这个工作流适合每周行业跟踪、产品调研和专题研究。第一版不追求全自动,先保证每条信息有来源、能去重、可以人工复核。

输入与输出

输入可以是网页链接、论文、产品更新、聊天记录或个人笔记。最终输出不是一堆摘要,而是一组结构统一的知识卡片。

每张卡片至少包含:

标题
一句话结论
事实或原文要点
来源 URL
发布日期
采集日期
主题标签
事实 / 推断 / 建议
待核查问题

执行步骤

1. 收集

把候选资料先放入收集箱,只记录标题、链接和发现日期。这个阶段不要急着逐篇总结,避免在低价值来源上花太多时间。

2. 筛选与去重

优先保留官方公告、原始论文和能够说明事实来源的页面。相同新闻被多家转载时,保留最接近原始信息的一条,并把其他页面作为补充。

3. 结构化摘要

让模型按固定字段提取内容,并明确区分事实、推断和建议。摘要应回答“这条信息为什么值得留下”,而不是重复网页开头。

4. 人工复核

打开原文检查数字、日期、产品名称和关键限定词。涉及购买、法律、财务、健康或公开引用时,不使用未经核查的自动摘要。

5. 写入知识库

使用稳定的主题标签和文件命名规则。一个卡片只解决一个主要问题,后续文章或报告通过链接组合多张卡片。

质量门禁

  • 没有来源 URL 的条目不进入正式知识库。
  • 时间敏感信息必须同时记录发布日期和采集日期。
  • 事实与推断不能混在同一个字段。
  • 来源冲突要保留,不让模型自行选择“正确答案”。
  • 无法确认的信息进入待核查列表,而不是被静默删除。

最小自动化方式

第一版只自动完成抓取、字段提取和重复链接检查,把最终写入留给人工确认。连续运行几周后,再根据真实失败记录决定是否增加定时任务、相似内容去重或自动标签。

自动化的价值不是省掉所有判断,而是把重复整理工作交给机器,让人的时间留给来源选择和结论复核。