(01)

怎样倾听,会改变听到的内容

参与者简短回答后停了一下,说:“其实,我不是这个意思。”访谈者是等待、追问还是进入下一题,会影响接下来的讲述。文字记录保留了话语,却未必呈现让对方决定说什么的全部因素。

AI可以起草问题、转写语音、翻译段落,也能建议怎样归类叙述。Schroeder等人访问的研究者谈到了这些可能用途,同时担心隐私、偏差、访问条件和参与者数据的处理。[1] 实际要问的是:哪项任务对你的研究有帮助,结果又怎样检查?

为每项用途写明工具接收什么、输出什么、谁审核,以及参与者需要知道什么。如果节省的时间能让你更专注倾听和细读材料,就有价值。但保护信息、公平呈现参与者的责任仍然存在。

留出空间,让参与者停顿、不同意,或纠正你的理解。
(02)

邀请参与前,说明怎样使用AI

“本研究使用AI”留下太多空白。用工具起草邀请,与把录音发送给转写服务或分析个人经历,是不同用途。告诉参与者记录什么、送到哪里、谁能访问、保留多久,以及供应商是否可能用于改进模型。在研究能支持的范围内提供分别选择,并解释拒绝某项用途对参与有何影响。

招募前核查这些安排。用虚构材料测试录音从存储、转写、分析、导出到删除的全过程。确认工具能支持你准备提供的退出流程,并说明限制。研究条件允许时,尽早把身份信息与研究材料分开。

把约定用途和限制写进研究计划,需要批准的事项指定审核者。Schroeder等人的研究中,一些研究者因保密顾虑而避免向专有语言模型提交参与者数据。[1] 适合准备邀请的工具,未必适合处理访谈内容。

(03)

用虚构角色检查假设,不能把它当证词

让AI扮演参与者,马上就能得到貌似合理的回答。一项涉及19位质性研究者的研究中,生成叙述起初包含熟悉的主题,但对话深入后,研究者发现具体细节和深度不足。模拟参与者也不能表示同意、自主选择或质疑自己如何被呈现。[3]

生成角色反映的是对某种经历的假设,不能说明那个人实际经历了什么。假设研究认为人们因表格难懂而不使用服务,真实参与者却可能讲到一次过去的遭遇,让自己害怕联系机构。招募真人,才让这种意外叙述有机会改变研究。

AI可以检查招募措辞、准备待审核译文,或发现筛选问题中的假设。简单的招募表能显示还缺谁的经历。不要从措辞推断敏感特征或判断谁可信。缺少某个人群,就继续招募或报告缺口,不要填入生成的引语。

貌似真实的生成回答,不是一个人经历过什么的证据。
(04)

对话时,把注意力留给参与者

自动访谈可以触达比小团队逐个访谈更多的人。Geiecke和Jaravel研究了包括语音访谈在内的AI主导访谈,并在多种应用中报告了有希望的质量评估。[2] 这支持在合适条件下尝试,却不能说明每个主题、参与者或敏感披露都同样适合。

不只测能否完成,还要看访谈者如何回应。追问是否承接上一条回答,是否允许不同意见?检查参与者纠正、说不知道、痛苦、沉默或退出时会怎样。除了回答内容,也按人群查看误解和提前离开的情况。

人主导访谈时,连续的AI建议可能分散注意。如果使用实时辅助,要告知参与者,并限定用途,例如计时或一节结束后提醒遗漏主题。何时暂停、等待或离开提纲,由你决定。撤回同意、需要关注痛苦、系统出错需纠正,或工具妨碍倾听时,应停止自动化。

(05)

核对文字记录是否忠实于录音

自动转写是初稿。它可能漏掉姓名、改错术语、合并交叠发言,或丢失停顿和自我修正。交替使用多种语言时,仅凭文字尤其难核查。错误一旦进入记录,也可能进入分析和最终引语。

有些说话者可能遇到更多错误。2020年一项研究用73位黑人与42位白人说话者的对话测试五套商业语音识别系统,平均词错率分别为0.35和0.19,即35%和19%。[4] 这是该研究的结果,不是所有当前工具的评分。它说明,应检查与自己研究相关的说话者和录音条件,对容易出错的情况增加审核。

不同说话人群体的平均词错误率

2020年研究 · 五种商用语音识别系统

黑人说话人 · 73人35%
白人说话人 · 42人19%
图 02平均词错误率分别为35%和19%。总体平均值无法体现谁的发言需要更多修正。来源:Koenecke等(2020),正文[4]。 Koenecke et al., 2020 ↗

在获准的存储环境中,把录音与带时间戳的文字记录连接起来。标明听不清的片段、交叠发言、分析所需的停顿和修正。发布前逐段核对引用的录音。重要解释还应重听前后对话,单独一句话未必能说明当事人的意思。

在转写错误变成发现之前,先核对录音。
(06)

翻译时保留原语言

流畅译文仍可能丢失含义。礼貌的拒绝、亲属称谓或日常比喻,在报告语言中可能没有直接对应。van Nes等人说明,一种语言开展的研究用另一种语言发表时,翻译会增加一层解释。[5] 文句既要自然,也要保留参与者的意思。

原始文字记录与译文并排保留,用相同的段落标识对应。注明可能有多种含义的词,并记录为何选这个版本。支撑核心发现的段落,请双语研究者审核。条件允许时,先用原语言分析,避免早期翻译缩小解释空间。

AI可以为审核提供不同译法。模型意见一致,不是决定含义的投票。有时保留原词并解释更合适。报告中说明访谈和分析使用了哪些语言、谁翻译,以及重要段落如何检查。

(07)

说明为什么采用这个解释

研究者常给段落加标签,帮助开展分析,这些标签称为编码。编码清单不会自动成为研究发现。在反思式主题分析中,研究者通过细读材料,并反思问题、知识和自身位置如何影响解释,来发展主题。[7] AI生成的整齐清单可能让这些选择尚未检查时,工作就像完成了一样。

请AI建议前,先自己阅读一组多样材料,只使用获准用于该目的的内容。可以让它找与暂定编码相关的段落、比较两种解释,或寻找挑战主题的叙述。要求返回段落标识,采用建议前回到完整讲述。这些步骤要适合所选分析方法,不能当成通用编码流程。

另一项比较六个开放模型与人工编码者的研究中,人工编码者处理复杂句子的表现稳定;对模型而言,简单句的表现优于复杂句。有些模型标签虽与参考标签一致,专家评价却较低。[6] 因此要检查解释,不只统计标签匹配。保留有用分歧,说明主题为何进入报告,尤其是含糊或情绪复杂的段落。

建议的主题需要证据,也需要研究者解释。
(08)

让读者和参与者看清最终报告

考虑是否应请参与者修正文字记录、反馈解释,或通过其他方式回应。适当做法取决于方法和关系。反馈可以发现误引或缺失语境,却不能自动确定真相:人们可能意见不同、改变叙述,或不愿继续参与。

访谈与焦点小组报告清单COREQ要求说明团队、方法、情境和分析。[8] 重要的AI用途也应同样清楚:任务、工具和版本、提供材料、材料是否离开研究环境,以及做了哪些人工检查。说明工具造成的哪些改变影响了发现。

完成报告时,也完成数据处理。遵守约定的保留与删除安排,清除临时副本,明确日后再利用的负责人。只保存同意安排和研究计划允许的记录。读者应能追溯参与者的话如何变成发现,参与者也应得到你承诺的保护和选择。