这个工作流适合每周行业跟踪、产品调研和专题研究。第一版不追求全自动,先保证每条信息有来源、能去重、可以人工复核。
输入与输出
输入可以是网页链接、论文、产品更新、聊天记录或个人笔记。最终输出不是一堆摘要,而是一组结构统一的知识卡片。
每张卡片至少包含:
标题
一句话结论
事实或原文要点
来源 URL
发布日期
采集日期
主题标签
事实 / 推断 / 建议
待核查问题
执行步骤
1. 收集
把候选资料先放入收集箱,只记录标题、链接和发现日期。这个阶段不要急着逐篇总结,避免在低价值来源上花太多时间。
2. 筛选与去重
优先保留官方公告、原始论文和能够说明事实来源的页面。相同新闻被多家转载时,保留最接近原始信息的一条,并把其他页面作为补充。
3. 结构化摘要
让模型按固定字段提取内容,并明确区分事实、推断和建议。摘要应回答“这条信息为什么值得留下”,而不是重复网页开头。
4. 人工复核
打开原文检查数字、日期、产品名称和关键限定词。涉及购买、法律、财务、健康或公开引用时,不使用未经核查的自动摘要。
5. 写入知识库
使用稳定的主题标签和文件命名规则。一个卡片只解决一个主要问题,后续文章或报告通过链接组合多张卡片。
质量门禁
- 没有来源 URL 的条目不进入正式知识库。
- 时间敏感信息必须同时记录发布日期和采集日期。
- 事实与推断不能混在同一个字段。
- 来源冲突要保留,不让模型自行选择“正确答案”。
- 无法确认的信息进入待核查列表,而不是被静默删除。
最小自动化方式
第一版只自动完成抓取、字段提取和重复链接检查,把最终写入留给人工确认。连续运行几周后,再根据真实失败记录决定是否增加定时任务、相似内容去重或自动标签。
自动化的价值不是省掉所有判断,而是把重复整理工作交给机器,让人的时间留给来源选择和结论复核。