(01)

サービスを使おうとしている人から考える

地域のサービスへの申請方法をAIに尋ねたら、流暢な答えが返ってきました。しかし、必要だとされた書類を地元の窓口では発行していません。別の人は正しい案内を得たものの、共有の携帯電話からファイルを送れません。どちらも言語には対応していても、手続きは終わっていません。

言語メニューだけでは、方言、くだけた表現、複数言語の混在、専門用語への対応は分かりません。地域の規則や利用者の端末に答えが合うかも別の問題です。その場所で評価するときは、言語とともに利用条件を書きます。

たとえば「税務の質問に正確に答える」という主張には、国や管轄地域、課税年度、納税者の種類、言語、作業の指定が必要です。何を誤りとするかも決めます。具体的にすれば検証でき、読み手も自分の状況に当てはまるか判断できます。

流暢な答えでも、使う場所で役立つかを確かめる必要があります。
(02)

利用に必要な条件を調べる

モデルを選んだり試験を翻訳したりする前に、人がどう使うかを考えます。話すのか入力するのか、どんな言葉を使うのか。結果を受け取る窓口や専門職、手続きは何でしょうか。端末、通信、プライバシー、費用、アクセシビリティ、完了までの支援を確認します。誤答の負担を誰が引き受け、どう直せるかも調べます。

問いごとに確認方法を選びます。二言語を使う人のレビューは表現を、現地の実務者は手続きを、想定利用者は途中で困る箇所を確かめられます。一つの方法ですべては分かりません。言語の専門家だけでは携帯電話からの送信が動くか確認できず、小規模な利用者調査では問題が人口全体でどれほど起きるか推定できません。

利用者数だけでなく、何を知りたいかに合わせて調べる環境を選びます。誤りの影響が大きい場面、開発時と違う言葉の使い方、端末や通信の制約がある場面を含めます。対象に含めなかった人も示します。「低資源言語」と書くなら、どのデータや研究資源が不足しているかを説明します。言語そのものの限界ではありません。

(03)

翻訳した課題が、その場所でも意味を持つか

翻訳した質問には、なじみのない学校制度、通貨、役所、家族関係が前提になっていることがあります。すべての単語が分かっても、元の読者には当然だった背景知識が必要かもしれません。プライバシーや同意といった概念も、直訳以上の説明を要する場合があります。

Global MMLUは、42言語へ広げたベンチマークでこの問題を調べました。注釈を付けた問いの28%は文化・地理・方言の知識が必要と分類され、地理への言及は主に北米や欧州に偏っていました。文化に左右される問いを別に評価すると、モデルの順位が変わりました。[1] 英語の試験を翻訳しただけでは、現地の知識への対応は分かりません。

表現、概念の意味、正答から取れる行動を確認します。二言語の版を比べてもらい、想定利用者には質問をどう理解したか説明してもらいます。外から持ち込んだ前提が表れる例も入れます。元の言語に訳し戻すと表現のずれを見つけられますが、元の課題が現地に適している証明にはなりません。

(04)

完了までの手間を測る

モデルは文章をトークンという単位で処理します。同じ情報でも言語によって必要な数が違い、費用や一度に渡せる文章量に影響します。2023年に多様な22言語を調べた研究では、多くの対応言語で、話者がトークン単位の料金をより多く払う一方、結果は劣っていました。[2] 試したサービスでの結果ですが、正確さの点数だけでは足りない理由を示しています。

言語ごとに作業を最初から最後まで試します。応答時間、失敗、再試行、費用、使える結果までのやり取りの回数を記録します。音声認識、文字入力、フォント、文書の読取り、人名、住所、日付の形式も確認します。丁寧に入力した質問への答えが良くても、その前に実際の入力を読み違えていたら役立ちません。

長い文書や会話は別に見ます。トークンが多く必要な言語では、根拠が先に切り落とされるかもしれません。答えの修正、支援探し、別サービスへの切替えにかかる手間も記録します。一回の表示価格ではなく、修正も含めた完了までの費用を比べます。

修正も含め、作業を終えるまでの手間と費用を比べます。
(05)

現地で起きる状況から試験を作る

適切な同意のもとで、想定利用者や実務者と関連する書式、質問、用語、失敗の報告を集めます。良い答えで何ができるようになるか、システムが何を決めつけてはいけないかを尋ねます。既存の試験のどの問いを翻訳するか選ぶ前に、こうした状況から始めます。

試験は三つに分けられます。場所が変わっても意味の通る共通課題、現地の知識や手続きから作る課題、目的を保って一つの条件だけを変える比較課題です。文化知識に依存する問いには印を付け、合計点でその依存が隠れないようにします。

採点前に、現地の確認者と良い答えの基準を決めます。許容できる違い、必要な根拠、危険な助言、人の助けを求める場面を含めます。一つの好みの文体に合うかだけでなく、作業に役立つかを評価します。意見が分かれたら、地域、役割、経験の違いが関係していないか調べます。

(06)

普段の話し方や書き方で試す

くだけた表現、方言、敬語、文字の混在、誤字、不完全な文、誤解された後の言い直しを含めます。2024年の10の英語方言を扱う研究では、試したモデルの非標準変種への応答に、ステレオタイプ化、侮辱的な内容、誤解、見下した語り口が多いと母語話者が評価しました。[3] 英語全体の点数だけでは、こうした違いは隠れます。

安全性も現地の条件で確認が必要です。内容を揃えた悪意あるプロンプトを使った研究では、試したシステムは低資源言語で危険な回答や無関係な回答を多く返しました。[4] 一つの言語で試した対策が別の言語でも働くとは限りません。サービスで使われる言葉で、適切な回答拒否、不確実性の説明、人の支援への経路を試します。

特定の変化を比べる対の事例を作ります。改まった表現と会話調、現地の名前と外から持ち込んだ名前、一言語と複数言語の混在などです。何を理解し、尋ね、答え、拒み、引き継いだかを比べます。挙動が変わったら、入力認識、知識不足、安全規則、採点、ほかのアプリケーション処理のどこから問題が始まったか調べます。

(07)

現地の協力者と研究の進め方を決める

住民として答えるようモデルに頼んでも、その応答が現地の意見を代表するとは言えません。中国語と英語を比べた実験では、社会的な指向や思考様式の尺度で、生成された応答に系統的な違いがありました。[5] 言語がモデルの挙動を変えることは示しますが、どちらかが話者の考えを正しく表す証拠にはなりません。

同じ集団の人々も意見は異なります。米国の世論データとモデルの回答を比べた研究では、人口集団の見解と大きな差があり、特定の集団の視点を求めても差が残りました。[6] 生成回答は質問の予行や、確認すべき前提を見つけるために使えます。欠けている参加者の根拠を補うことはできません。

問いの選択、データ作成、評価基準、結果の解釈、利用開始の判断に、現地の協力者が関われるようにします。アフリカ言語の翻訳を扱った参加型研究では、30を超える言語で新しいデータセットとベンチマークを作り、その約3分の1で人による評価を行いました。機械学習の正式な訓練を受けていない参加者も研究に貢献しました。[8] 完成した翻訳の確認だけでなく、課題が決まる前から意見を反映できるようにします。

現地の協力者には、翻訳の確認だけでなく問いの選択にも関わってもらいます。
(08)

どこで試したサービスかを伝える

試した言語とその変種、現地の課題、利用条件を報告します。どの問いを翻訳し、どれを現地で作り、誰が参加して答えを確認したかも説明します。完了、誤り、費用、修正の手間の重要な違いを示し、まだ試していない環境を明記します。

NLLB翻訳プロジェクトは、データ作成、言語識別、モデル開発、人による評価を組み合わせて200言語を扱いました。[7] 大きな成果ですが、特定の窓口、分野、伝達方法でサービスが使えるかは、さらに調べる必要があります。対応言語の一覧は、その確認を始める手掛かりになります。

合意した現地の基準を満たす用途から提供し、不確実な事例や影響の大きい事例には人の支援へ進める経路を設けます。苦情だけでなく、完了、再試行、修正、離脱も見ます。苦情が少ないのは、サービスを見つけられない、最後まで使えないためかもしれません。モデル、規則、画面、現地の慣行が変わったら、根拠を見直します。