(01)

说清答案的哪部分不确定

“新服务可能让办理更方便。”这里的“可能”指什么?是人们说更好用,还是实际完成的人更多?又或者,你不确定其他地方是否也有效?加一个谨慎的词,并没有说明证据的弱点。

把已知和未知分开。例如:“受访者觉得新表格更容易理解。我们还不知道是否有更多申请人能填完。”读者能同时看到发现与限制,不必猜一个笼统信心标签的意思。

答案能核查时,还可以把信心与结果比较。SimpleQA用简短事实问题考察这种关系。[1] 如果许多可比答案都报70%的信心,其中约70%正确,这个水平就校准得较好。答对一次,不能证明有这样的长期表现。

告诉读者哪里不确定,什么证据会有帮助。
(02)

解释为什么没把握

不同缺口需要不同工作。记录缺失,要补证据;测量不可靠,要查收集方法;多个解释都合理,要设计能区分它们的研究;证据来自别国,要查本地条件是否相近。全写成“低信心”,会把下一步该做什么藏起来。

AI还带来一个问题:换提示词、来源或模型版本,答案会不会变?重复回答能暴露不一致,但模型也可能重复同一个错误。研究发现,模型能评估部分自身不确定性,却难以在新任务上保持这种评估的校准。[2] 模型自报的信心也需要测试。

把限制放在对应说法旁。官方通知可以确定政策开始日期,却未必说明执行有多一致。访谈可能提示使用更方便,但不能说明多少人受益。对日期的把握,不应让执行和效果听起来同样确定。

(03)

比较相似问题上的判断

擅长一类问题,不代表每类都可靠。查官方文件中的日期,与预测新产品需求不同。混在一起,容易核实的事实可能掩盖较差的预测。

一组可比判断有时称为参照类别。选择对工作重要的相似之处:问题、来源、方法、情境和预测期限。先积累足够案例,再检查有意义的差别。分组太小,估计不稳;分组太宽,又会隐藏信心失灵的地方。

预测要记录日期,并提前决定什么结果算正确、何时检查、由谁检查。如果宽泛结论无法这样评判,就用文字解释证据的强弱与限制。不必把每项解释都变成非是即否的预测。

(04)

能说明含义时,再用百分比

“73%”看起来可能比“很可能”更经过考虑,实际上两者也许都是未经检验的直觉。事件清楚、估计依据说得明白时,可以用百分比。要评估校准,还需要可比判断及其结果的记录。

校准只是有用预测的一部分。如果一半事件发生,每次都报50%可以符合总体频率,却难以帮助区分单个案例。预测研究也考察锐度,即预测分布有多集中,并与校准一起评估。[3] 对二元事件,有把握的估计只有能区分案例、经得起结果核对才有用。下方假设图展示了信心高于实际结果所支持程度的情况。

有多大把握,就有多常答对吗?

按报告的把握程度分组的假设示例

┄ 把握程度与答对比例一致的线● 实际答对比例
实际答对比例 ↑
0%0%50%50%100%100%
报告的把握程度 →
图 02虚线下方的点表示,把握程度高于实际答对比例。例如,声称有90%把握的回答中,实际答对的只有62%。

评分规则有助于比较多次预测。二元事件的Brier分数,是预测概率与结果(发生记1,未发生记0)之差的平方,再取平均。预测80%,发生时得0.04,未发生时得0.64,越低越好。它属于在期望上鼓励如实报告概率的恰当评分规则。[4] 对数评分对高度自信的错误惩罚尤其大。把分数与图表、重要人群的结果一起看,避免平均值藏住反复出现的问题。

看似精确的百分比,也需要依据和核查方法。
(05)

解释“很可能”这类词的含义

描述一组证据时,文字可能比百分比更有用。“两份独立记录支持,但尚未在实际中检查”,能说明依据和缺口。只写“高信心”,信息少得多。

在受研究任务中,模型可以学会用与观察概率较为一致的词语表达信心。[5] 读者仍可能有不同理解。一项关于IPCC概率表述的跨国研究发现,人们的理解常偏离预定含义。[6] 熟悉的词不一定有共同定义。

如果反复使用“有支持”“暂定”“未解决”等标签,就简要定义,说明它们指证据质量还是事件概率。如果方法中“很可能”代表数值范围,就在用词处写出范围。把依据放在附近,让读者自己判断。

(06)

把可能性与行动建议分开

60%可能造成小麻烦,与60%可能造成不可逆伤害,需要不同回应。信心本身不能决定行动。还要考虑判断错误和等待的代价、能否撤回,以及有哪些防护。

把估计和建议分开写。假设项目中,“我们估计这种模式再次出现的概率为65%—75%”描述判断;“先做有限试点,因为不利影响可控,两周内能看到结果”解释行动。别人就能分别质疑估计或试点的理由。

较弱信号可能足以支持再做一次访谈或小测试,却不足以全面上线。缺少支持可能成为暂停昂贵扩张的理由,却不能证明永远不会有效。问哪项可行观察最可能影响选择,就能说明下一步研究为什么值得做。

(07)

让“我不知道”有帮助

证据不足时,说明原因。缺记录,需要查找;问题含糊,需要澄清;发现冲突,需要比较;判断超出方法范围,需要其他方法或合适的审核者。虽然都暂时答不确定,下一步却不同。

一种研究方法比较多个AI答案的含义,以发现不一致、可能编造的说法。[7] 另一种用于机器人规划的方法,采用在样例上校准的共形预测来决定何时求助,并在明确假设下提供统计保证。[8] 它们解决特定问题。重复答案仍可能共有错误信念,保证也不能自动迁移到另一人群或任务。

既看系统回答多少,也看已回答的错多少。少答只有在减少错误的收益值得增加转交时才有用。检查哪些案例被转交,尤其按语言和用户群分别看。覆盖不足时,应改善证据或人工支持,而不是强迫系统给不确定答案。为转交案例设清楚的路径、负责人和预计响应时间。

有用的“我不知道”,会说明缺什么、下一步查什么。
(08)

说明什么会改变判断

估计反映某个时点已知的信息。写明哪些证据会加强、削弱或推翻它。新记录、另一人群的结果或失败的预测,可能比又一篇主题综述更重要。

保存带日期的重要估计、依据、所用可比案例,以及谁负责检查结果。结果到来后,先与原估计比较,再修改解释。保留旧版,才能看清原有信心是否合理、发生了什么变化。

结尾说明当前证据支持什么、什么仍不确定,以及在这种不确定性下怎样行动合理。写出下一项有用核查和复查时机。读者就能了解限制,并知道何时改变方向。