先看是否真的矛盾
一份报告说服务用户在增长,另一份说使用的人减少了。决定相信谁之前,先看各自数什么:前者可能统计所有曾经注册的人,后者统计本月活跃的人。两者可以都对。只总结成“来源有分歧”,就漏掉了有用发现:注册增加,当前使用却下降。
把每项说法与支持它的原文并列,注明研究对象、时间、指标和比较对象。例如远程工作的生产率,要问研究了哪些工作和员工,又怎样测生产率。先比实际结果,再比标题。
还要检查结论是否超出研究范围。Yarkoni讨论了研究者作出统计分析无法支持的宽泛主张,尤其是向受测任务或环境之外推广的问题。[4] 某个人群的发现可以有用,却未必回答了所有人群的问题。
先检查两份报告是否回答同一个问题。
摘要旁边保留原始发现
合并多份报告时,很容易想把措辞统一。这样便于阅读,却可能隐藏重要差别。在缩短的表述旁保留原文、数字、单位和语境,才能看出改变了什么。
三角互证规程是一种有条理地比较不同方法所得发现的办法,区分一致、部分一致、未涉及和不一致。[1] “未涉及”指一组发现没有回答另一组涉及的问题。没有问等待时间的问卷,不会反驳访谈中“等了很久”的讲述;访谈可能补上问卷没问到的经历。
下结论前,把发现并列成表。O’Cathain等人介绍了用表格查看这些关系,以及检查不符合初步解释的案例的方法。[2] 再加一个问题:什么条件下,两项发现可以同时为真?下一步调查就具体了。
核对可比性,追查证据从哪来
先查定义和计算。“用户”是账户、人还是会话?百分比的分母是所有受邀者,还是只包括回答者?再比较日期、地点、产品版本、研究纳入条件和结果观察期。适当时换算单位,但不能给不同指标相同名称,就假装它们等价。
考虑每种来源能说明什么。预测估计未来,最终报告记录已经发生的事。一个人的叙述可以记下故障,却不能说明多普遍。行政记录统计已上报案例,可能漏掉从未联系服务的人。这些资料可以服务于同一问题,却回答不同部分。
把重复说法追到依据。三份报告可能都引用同一项调查:出版物有三份,测量却只有一次。标明共享的调查、数据和样本,分清新分析与新收集的证据。重复本身不是独立确认。
三份报告引用同一项调查时
说明用示例:三份出版物,一次测量
三份报告引用同一项调查,仍只依赖一次测量。
用平实的语言说明差别
直接描述剩余问题:报告对成功定义不同,研究的人不同,时期不同,还是测量方法不同?也可能观察到相同结果,却对原因有不同解释;或对事实一致,却对结果是否可以接受有分歧。
描述应帮助选择下一项核查。定义不同,就比统计了什么;时期不同,就找相同日期;怀疑测量错,就查数据或换一种测量。解释作出不同预测时,找办法测试预测。如果争论的是能接受什么取舍,就明确判断标准,继续搜索未必能解决。
多个差别可能同时重要。后来的研究也许既换了人群,又用了更严格的成功定义。核查前保留两种可能。书面政策与实际经历不同,也要记录。随新发现更新解释,简要记下每项核查排除了什么。
比较旁保留原始段落。核查有新发现时,更新解释。
问平均值会隐藏什么
研究可比时,合并结果有帮助。但先看效果方向、大小、不确定性,以及研究的人和条件。如果服务对需要支持的人群变差,平均改善并不能让人放心。
Cochrane指南提醒,随机效应元分析不能解释掉研究间差别。它允许效果不同,再估计平均值,但研究结果方向不同时,平均可能误导。[3] 并列比较有时比一个合并数字更有用。如果看完结果才想到亚组解释,应把它当成待检验假设,而不是已经成立的规律。
问这项决策需要知道什么。总体完成率不错,团队仍可能需要理解为什么旧手机或某种语言的完成率下降。报告结果看似成立和发生变化的条件。观察太少、无法判断差异是否可靠时,也要说明。
找一项能区分解释的核查
假设一个团队认为人们放弃申请是因为说明难懂,另一个认为等待太久。两种解释都符合低完成率。保持等待不变、只简化说明,或保持措辞不变、只缩短等待,会发生什么?看新结果前,先写下各自预测。
支持竞争理论的研究者,有时会共同设计这样的测试,称为对抗式合作。2025年一项关于两种意识理论的研究,事先约定预测和测试,跨多个实验室和方法开展。结果支持部分预测,也挑战了双方的重要主张。[5] 没有简单决出胜者,共同测试仍让分歧更清楚。
日常研究中,可以请了解情况的批评者一起改进两种解释,选择有用核查:记录、现场走访、比较案例或小干预。约定什么结果会削弱各自解释。没有可行核查能区分时,就说明限制,考虑能随新证据调整的行动。
如果每种解释正确,分别应该观察到什么?
用AI找差别,再核实
AI能帮忙比较段落、发现用词变化、追踪重复引用,并提出可能原因。要求它返回确切说法、支持段落、疑似差别和待查事项。把输出当成要与来源对照的线索清单。
Chain-of-Verification先起草答案,提出核查问题,分别回答,再修订答复。它在受测任务中减少了幻觉。[6] 研究中可以借鉴,把整理分歧与检查分开。检查时回到原始日期、引语、样本和计算,不只问初稿是否听起来合理。
模型辩论在部分评估中改善了推理和事实回答。[7] 其他实验却发现,一个故意误导的智能体能把群体说服到错误答案,增加数量或轮次也无法可靠修复。[8] 模型一致还不够。重要结论要用来源材料或适当的现实核查验证,未解决异议也要保留。
给出证据支持得住的答案
“证据不一致”告诉读者的太少。解释哪些发现有支持、哪些仅适用于特定条件、哪些仍未解决。分清事实争议和可接受性争议。缺失的人群或结果限制了答案时,也要指出。
把答案接到决策上:现在合理能做什么?什么应容易撤回?还要查什么,谁在何时完成?不确定性未解决就建议行动时,解释等待和判断错误各自的代价。事情紧急,不会使证据更强。
有用答案可能比希望的窄:服务在一种环境有用,两份报告数的是不同东西,或当前证据不能区分两个原因。解释怎么得到答案,以及什么会改变它。分歧能指出下一步该调查什么时,就有价值。

