从一项能核实的说法开始
你请AI研究一个问题,收到一份排版整齐的报告:有链接、清楚的标题,也有肯定的结论。有人问:“这句话的依据在哪里?”你打开链接,却发现原文只支持其中一部分。
整段一起读时,这类问题容易被忽略。一句话可能同时涉及不同的人、日期和结果。事实问答基准SimpleQA把答案限制得很短,便于评估。[1] 核对报告时也可以借鉴这个思路:拆开重要说法,一项一项检查。
为每项说法保留来源,以及支持它的具体段落或观察记录。也记下与它不符的证据。这样,解释为什么相信某个结论时,就不必把整轮搜索重做一遍。
一句话再有说服力,也需要来源真正支持它。
写下你需要弄清什么
一文件夹论文能说明收集了什么,却不能说明已经知道什么。深入搜索前,先列出可能需要检验的说法。即使写成陈述句,也要把它们当作待调查的问题。
假设你研究一项由AI判断谁能获得援助的服务。你可能要确认:人们是否理解被拒绝的原因、是否知道如何申诉、能否在不承担过重负担的情况下纠正错误。通知说明服务告知了什么,访谈说明人们理解了什么,案件记录说明申诉是否改变了结果。这些来源回答的问题不同,因此都可能需要。
说法要具体到能够发现自己错了。“AI改善研究”留下的空白太多。“在这个项目中,AI在两小时内帮我们找到了比常用搜索方法更多的相关来源”,则有了比较对象。纳入资料前仍需核实来源。把涉及的人或任务、比较、结果和适用范围写清楚。
看来源究竟能说明什么
来源可靠,不等于它适合证明你的说法。政策文件说明规则怎么写,却不说明人们办事时的体验。产品公告记录公司声称发布了什么,却不是效果的独立证明。访谈记录一个人的叙述,不能据此判断这种经历有多普遍。
根据问题寻找证据。核对测量出的效果,要读原始研究;了解流程,可以查记录或直接观察。综述帮助你找到领域内的主要发现和分歧,评论提供值得追查的线索。例如,论坛帖子可能暴露一种值得调查的故障,却不能告诉你它发生得多频繁。
AI可以帮忙搜索。Anthropic介绍过一种研究系统,把问题分给多个智能体,并行搜索不同部分。[2] 这样可能找到更多候选来源,但每份资料仍需打开核对,才能用来支撑结论。
用一张小表记录证据
段末的引文可能支持第一句,却完全没有谈到下一句。给每项重要说法单独一行,就更容易看出这种缺口。这种表有时称为“主张台账”,用普通电子表格就够了。
先填写说法、来源链接,以及你依据的段落或观察。再记录发表日期、涉及的人群或情境、核查者、把握程度和相反证据。用“待核实”“有支持”“有争议”“已否定”或“未解决”等状态,让接手的人知道进展。
写作时继续使用这张表。两份来源看似一致,要核对它们是否支持同一项说法。AI生成新摘要后,把其中的说法与相关行对照。如果来源已不能支持草稿里的某句话,就修改或删除。表和报告保持对应,记录才有用。
这些是说明用的示例,不是研究结果。状态表示哪些已经核查,哪些还没有。
查明来源为什么不一致
一项研究说工具节省时间,访谈却说它增加工作,两者可能都没错。研究也许只测了受控条件下的一项短任务,访谈则算上了纠错时间。选择相信哪一方之前,先看它们是否涉及相同的人、日期、任务和衡量方式。
在笔记中保留双方说法和最有力的证据,写下差异的可能原因及下一步核查。最后也许发现,工具在一种环境节省时间,在另一种环境却没有。如果还解释不了,就保留未解决状态,不要把结果揉成一个让人安心的平均值。
AI智能体也需要停下来重新考虑方法。如果早期假设有误,继续搜索可能越走越偏。Anthropic的智能体指南建议对照外部环境检查结果,并设置停止条件。[3] 用于研究时,就是回到来源核对实际内容,并在下一步需要判断时交给人处理。
选择相信哪项发现之前,先看它们是否回答同一个问题。
把能检查的工作交给AI
可以请AI建议搜索词、寻找相关术语、归类相似发现、比较表格,或标出可能缺少支持的句子。也可以请它提出会挑战当前答案的证据。这些任务具体,结果可以检查,有助于减少整理资料的时间。
流畅的解释不是事情发生的记录。要检查来源,不能把模型的叙述当成证据。即使给了原始文档,也不能保证模型会用到相关段落。“Lost in the Middle”发现,长输入中相关信息的位置可能影响表现。[4]
保留输入和输出,方便检查或重做。研究者仍要决定问什么、接受哪些证据、如何处理歧义,以及结论有多大把握。如果AI提出这些判断,应先要求它说明依据,再审核是否采用。
判断再搜一次是否有价值
搜索一段时间后,新结果可能只是在重复已有材料。十份报告引用同一项研究,并不等于十次独立确认。要问的是:下一轮能否找到可能改变答案的证据,而不是让来源清单更长。
核查的程度应考虑判断错误的代价。有些事实性说法可能只需权威原始记录和一次独立确认;涉及安全的说法可能需要复现、专家审核,以及实际使用环境中的测试。早期探索发现可以暂时保留,但要说清楚。扩大搜索前,先决定这项说法需要哪些核查。
有时,继续阅读不是你需要的验证。PaperBench要求AI智能体复现论文研究,受评系统中表现最好的也只完成了部分工作。[5] 描述结果和复现结果是两回事。如果决策取决于某个发现能否在新环境成立,就应在那里做相关测试,或直接观察流程。
告诉读者,答案适用到哪里
结尾给出读者能用的答案:发现了什么、哪些证据最关键、有多大把握。带上最有力的相反发现,说明没有考察哪些人或情境。如果读者想采取行动,下一项重要核查是什么,也要写清楚。
例如,“这些访谈表明服务更容易使用,但我们还没有测试申诉流程”,就能帮助团队确定下一步。它支持有限的结论,没有暗示整项服务都通过了验证。说明未知之处,有助于避免把发现用在它不能支持的决策上。
当别人问为什么报告里有这个结论时,你应能展示说法、证据,以及两者之间的推理。这样的记录也方便更新研究:新来源可以改变某一项判断,而不必让整个项目从头开始。

