(01)

先看用户能不能把事情办成

有人问AI助手如何申请一项当地服务。回答很流畅,却要求提交当地机构根本不出具的证明。另一个人拿到了正确说明,却无法用共用手机上传文件。两种情况下,系统都支持这门语言,用户却没能办成事。

语言菜单不能告诉你系统是否理解方言、口语、混用的语言或专业术语,也不能说明答案是否符合当地规则,或能否在用户的设备上执行。评估某个地方的使用情况时,要把这些条件和语言一起写清楚。

例如,“助手能准确回答税务问题”还需要说明国家或管辖区、纳税年度、纳税人类型、语言和具体任务,也要定义什么算错误。有了这些条件,才能检验这句话,读者也才能判断结果是否适用于自己。

回答流畅之后,还要看用户能否在当地按它办事。
(02)

了解实际使用需要哪些条件

选择模型或翻译测试题之前,先了解人们会怎样使用服务:说话还是打字,用什么称呼和术语,结果需要哪家机构或哪位专业人员接受。检查设备、网络、隐私、费用、无障碍条件,以及完成任务需要的帮助。还要问:答错了由谁承担后果,怎样纠正?

不同问题需要不同检查。双语审核能检查措辞,当地从业者能核对办事程序,目标用户能帮助发现操作卡在哪里。任何一项都不能代替全部检查:语言专家无法证明手机上传功能可用,小规模用户研究也不能说明某个问题在整个人群中有多普遍。

选择测试地点和人群时,除了受众规模,也要看能学到什么。考虑出错代价高、语言使用不同于开发环境,或设备与网络受限的情况,并说明还有谁未被纳入。称一种语言“资源不足”时,要指出缺的是哪些数据或研究资源,而不是把匮乏说成语言本身的局限。

(03)

翻译后的问题,在当地还说得通吗

一道译好的题目可能默认读者熟悉另一种学制、货币、公共机构或家庭关系。每个词都认识,不等于具备原题默认的背景知识。隐私、同意等概念,也可能需要直接翻译之外的解释。

Global MMLU在扩展到42种语言的基准中研究了这个问题。论文将28%的已标注题目归为需要文化、地理或方言知识的题目,地理指涉主要集中在北美和欧洲。单独评估文化敏感题目时,模型排名发生了变化。[1] 因此,把英语测试翻译好,并不能单独证明模型掌握了当地知识。

检查措辞是否准确、概念是否保持原意,以及正确答案能否支持预期行动。请双语审核者比较版本,也请目标用户解释自己怎样理解题目。加入能暴露外来假设的例子。把译文再翻回原语言可以发现措辞偏差,却不能证明原题本来就适合当地。

(04)

计算把任务做完需要多少代价

模型把文字分成称为词元的单位来处理。同样的信息,用不同语言表达可能需要不同数量的词元,影响费用和一次请求能容纳的内容。2023年一项覆盖22种不同语言的研究发现,许多受支持语言的使用者支付了更高的词元费用,得到的结果却更差。[2] 这描述的是当时受测服务,也说明只比较准确率不够。

用每种语言完整做一次任务,记录响应时间、失败、重试、费用,以及得到可用结果需要多少轮交流。检查语音识别、打字、字体、文档读取、姓名、地址和日期格式。如果前面的步骤已经误读了用户输入,模型能回答精心打好的问题也帮不上忙。

长文档和多轮对话要单独检查。一种语言需要更多词元时,系统可能更早截掉证据。还要记录用户纠正答案、寻求帮助或换用其他服务的时间和精力。比较完成任务的总成本,包括补救,而不只是一次请求的标价。

把纠正和重试算进去,再比较完成任务的成本。
(05)

从当地真实遇到的事情编写测试

在取得适当同意后,与目标用户和当地从业者一起收集有关表单、问题、术语和失败案例。询问一个有用的答案应该让人完成什么,以及系统不能默认什么。先了解这些实际情况,再决定哪些外部测试题值得翻译。

可以分成三组测试:一组检验在不同地方都成立的任务,一组由当地人员编写、涉及特定知识和程序,还有一组保持目标相同、每次只改变一个条件。标明哪些题目依赖文化知识,避免总分把这种依赖藏起来。

评分前,与当地审核者约定什么算好答案,包括可接受的不同说法、必需证据、不安全的建议,以及何时应该求助。检查答案是否帮助完成任务,而不只是符合某一种文风。审核者意见不同时,了解他们是否来自不同地区、岗位或生活经历。

(06)

测试人们平常怎么说、怎么写

加入口语、方言、敬语、混合文字、拼写错误、不完整句子,以及被误解后的纠正方式。2024年一项研究考察了十种英语方言,母语审核者发现,受测模型面对非标准变体时,回答中有更多刻板印象、贬损、误解和居高临下的表达。[3] 一个英语总分会掩盖这些差别。

安全表现也需要单独在当地检查。一项使用配对恶意提示的研究发现,受测系统在资源较少的语言中更常给出不安全或无关的回答。[4] 不能假定在一种语言中测试过的防护措施,在另一种语言中同样有效。用服务中实际出现的表达,检查合理拒答、不确定性说明和人工求助是否有效。

用成对案例检查某一个变化,例如正式与口语表达、本地与外来姓名、单一语言与多种语言混用。比较系统理解了什么、追问了什么、如何回答、拒绝和转交。行为改变时,再追查问题出在输入识别、知识缺失、安全规则、评分,还是应用中的其他环节。

(07)

让当地参与者一起决定怎么研究

让模型扮演当地居民,不能证明它的回答代表当地观点。比较中文和英文的实验发现,在社会取向和思维方式的测量中,生成回答出现了系统性差异。[5] 这说明语言可以改变模型行为,却不代表任一组回答能可靠描述使用那种语言的人。

同一个群体内部也有不同意见。一项将模型回答与美国民意数据比较的研究发现,模型与不同人口群体的观点存在明显差距,即使提示要求采用特定群体的视角也是如此。[6] 生成回答可以帮助预演问题或发现待检验的假设,不能补上缺失的参与者证据。

让当地贡献者参与选题、创建数据、制定评估、解释结果,以及判断是否可以投入使用。一项非洲语言翻译的参与式研究为30多种语言创建了新数据集和基准,并对其中约三分之一进行了人工评估。没有受过正规机器学习训练的人也参与了研究。[8] 应在任务确定前听取贡献者的意见,而不是等翻译完成后才请他们审核。

让当地参与者一起选择研究问题,而不只是审核译文。
(08)

说清楚服务在哪里经过测试

报告测试过的语言和变体、当地任务及使用条件。说明哪些问题经过翻译、哪些由当地人员编写,谁参与使用和审核。分别呈现完成情况、错误、费用和纠正所需的精力,并指出哪些重要场景还没有测试。

NLLB翻译项目结合数据创建、语言识别、建模和人工评估,覆盖了200种语言。[7] 这是一项重要成果。但服务能否在某个机构、专业领域或沟通方式下使用,仍需要调查。语言列表告诉我们可以从哪里开始检查。

将上线范围限制在通过当地约定标准的用途,并为不确定或后果重大的情况提供清楚的人工求助路径。除了投诉,还要观察完成、重试、纠正和退出。投诉少,也可能是人们没找到服务或没能用完。模型、规则、界面或当地做法变化后,应重新检查证据。