主题只是起点,还不是问题
试着搜索“对AI的信任”,你会找到论文、问卷、产品宣传和各种观点。读完后,你可能更了解这个主题,却仍不知道自己的研究要回答什么。搜索能找到与词语相关的材料,不能替你决定需要学到什么。
假设团队请你研究人们对一项自动化决策服务的信任。他们想知道的是:人们是否理解被拒绝的原因,是否认为决定公平,还是是否觉得自己有能力质疑错误?这些是不同的问题。选定一个,才能知道该了解谁的经历、寻找什么证据。
确定方法前,先花时间作出这个选择。Jason Wei在研究实践随笔中指出,无论实验做得多好,问题的选择都会影响项目能作出多大贡献。[1] 严谨执行的研究,如果回答了人们真正需要知道的事,就更有用。
继续找资料之前,先决定需要从中弄清什么。
谁需要答案,拿到后能做什么
“了解市场”或“探索用户态度”往往没有说明背后的选择。可以问提出需求的人:看完结果,你可能改变什么?也许是重写通知、推迟发布、调查故障,或保留现有服务。如果答案不能影响任何可选行动,先澄清目的,再继续收集信息。
研究不一定要服务于眼前的商业决策。它也可以改变一种解释、检验理论,或揭示领域忽略的问题。关键是说清楚希望学到什么、为什么重要。公开的研究议程,例如Anthropic Institute列出的重点方向,会让这些优先事项可供别人查看和讨论。[2]
试着补完这句话:“这项研究将帮助[人或团队]弄清[未知],从而在[选项]之间作出选择。”对服务团队来说,可能是决定重写拒绝通知,还是修改申诉流程。如果其中一个选项早已被排除,就需要换一个目的,或更如实地提出问题。
说清“信任”这样的词是什么意思
把“信任”写进研究问题,并不等于能测量它。你可以询问人们是否信任服务,观察他们是否使用,或检查他们是否了解服务的局限。这些方法揭示的事情不同。一个人继续使用服务,可能是没有替代选择,而不是信任它。
用可测量的迹象代表更宽泛的概念,通常称为使用“代理指标”。选什么指标,会影响研究能发现什么。Passi和Barocas的田野研究表明,数据科学团队会围绕现有数据、组织重点和协商来确定目标。[3] 公平问题可能在这个阶段就已出现,而不是等模型建好后才出现。
对每个重要词语,写下它的含义、准备观察什么,以及该观察不能告诉你什么。还要问:如果这个指标成为正式定义,谁可能受到不利影响?例如,只统计已提交的申诉,会漏掉想申诉却找不到说明的人。
使用一项服务,不一定意味着信任它。
对同一个问题,试几种不同问法
不要急着润色第一个问题,先看看其他可能。多少人放弃申诉?停在哪一步?修改通知能否帮助他们完成?他们怎样描述这段经历?延误是否发生在服务方收到申诉之后?这些都涉及同一流程,却可能导向不同解释和研究方法。
AI可以改变草稿中的人群、情境、比较或可能原因,帮你探索其他问法。把建议当作候选,而不是答案。例如,Co-Scientist把假设生成与审核、比较和改进分开。[4] 提出更多可能,只是选出有用问题的开始。
可以做个练习:请AI提出十二个候选问题,再按答案能让你学到什么来分组。十二只是鼓励跳出最初想法的提示,不是最优数量。删掉只换词语的版本。如果两个问题需要不同证据,就分开保留,不要硬塞进同一项研究。
选一个值得回答、也有条件调查的问题
用三个问题比较候选:答案重要吗?能否在现有时间、权限和方法下,负责任地取得证据?不同结果能否帮助你区分解释或选项?问题可以很重要,却暂时做不了;也可以很容易回答,却学不到多少。
这些是需要讨论的理由,不是算出客观赢家的公式。重要的问题也许值得先做小规模研究,看看能否收集到所需数据。一个不大的问题,也可能因为后续项目依赖它而值得做。记录选择的理由,不只留下分数。
对每个候选,写下它能帮助谁作什么决定、最难取得的证据、会让你意外的结果,以及接着能调查什么。团队就能比较实际可以开展的研究,而不是争论哪句话听起来更漂亮。
这是申诉流程的示例说明。选择方法前,先就这些事项达成一致。
先写下什么会让你改变看法
假设你预计,更清楚的说明会帮助人们完成申诉。什么结果会让你重新考虑?如果人们读懂了新通知,却仍然办不完,主要问题可能在别处。研究前写下这种可能,就不容易事后把不合预期的结果解释掉。
预注册更进一步:研究者在看到结果前记录问题和分析计划。它帮助读者区分研究检验的预测,与看到数据后形成的解释。[5][6] 即使不适合公开注册,保留带日期的计划和修改记录,也能让这一区别更清楚。
你仍然可以探索意外发现。说明它出乎预期,以及它如何引出新问题或新分析。不要把后来发现的模式说成早就预测到了。注册报告(Registered Reports)把相关原则用于发表:在结果出来前,评审者先审查问题和拟采用的方法。[7]
写明研究谁、在哪里研究
一个简短的问题装不下所有细节,可以另附一页说明。写清研究对象、地点和时间、比较内容,以及结果如何定义。这样既能控制工作范围,也能让读者知道答案适用于哪里。
“AI会改善研究吗?”本身太宽泛。可以改为比较:一支特定团队在固定搜索时段内,用和不用AI各找到多少来源,其中多少通过审核,两种方法各增加多少核查工作。这样就有了任务、比较,以及能观察的结果。
也要说明没有包括哪些人和证据。英语公开记录不能代表人们对某个问题知道的一切。访谈现有用户,不能说明某种经历在非用户中有多普遍。写清限制,有助于找出后续研究应该补上谁或什么材料。
决定何时重新考虑问题
起初合理的问题,也可能不再有用。你可能失去记录的访问权限,发现指标漏掉真正的问题,或得知别人已经作出回答。研究要支持的决策也可能改变。已经花了时间,并不意味着继续就是最好的选择。
在成本变高前,安排一次计划复查。如果拿不到所需证据、无法区分竞争解释,或预计所得不足以抵偿剩余投入,就重新考虑。公开的研究议程也会变化:Anthropic Institute表示,研究重点会随着AI及其影响的发展而调整。[2] 你的研究说明也应允许根据新发现修改。
暂停或停止时,留下简短记录:原问题、变化、已学到的内容,以及仍然有用的材料。说明什么条件会让项目值得重启。目的是用好剩余时间,不是让最初的每个问题都继续下去。

