テーマから、答えたい問いへ進む
「AIへの信頼」で検索すると、論文、アンケート、製品の紹介、さまざまな意見が見つかります。読めば知識は増えても、自分の調査で何に答えるべきかは決まらないかもしれません。検索は言葉に関連する資料を探しますが、何を知る必要があるかまでは決めてくれません。
自動で判断するサービスへの信頼を調べてほしいと頼まれたとします。知りたいのは、利用者が却下の理由を理解できるか、公平だと感じるか、誤りに異議を申し立てられると思うかでしょうか。それぞれ別の問いです。一つを選ぶと、誰の経験を調べ、どんな根拠を探すかが見えてきます。
方法を決める前に、この選択に時間を使います。Jason Weiは研究実践について、実験をどれほど丁寧に行っても、問題の選び方が研究の貢献を左右すると述べています。[1] 実際に知る必要のあることに答えてこそ、丁寧な調査が役立ちます。
資料を増やす前に、その資料から何を知りたいかを決めます。
誰が答えを使い、何を変えられるか聞く
「市場を理解したい」「利用者の意識を知りたい」という依頼だけでは、その後の選択は分かりません。結果を読んだら何を変えられるか、依頼者に聞きます。通知文を直す、公開を延期する、問題をさらに調べる、今のサービスを続ける、といった選択があります。どの答えでも選択が変わらないなら、情報を集める前に目的を確かめます。
すべての研究に、すぐ使える事業上の判断が必要なわけではありません。説明を見直す、理論を試す、見落とされていた問いを見つけることも目的になります。何を知りたいのか、なぜ重要なのかを言葉にします。Anthropic Instituteの重点分野のように研究方針を公開すると、その優先順位をほかの人も検討できます。[2]
「この調査は、[人やチーム]が[選択肢]を選ぶために、[まだ分からないこと]を確かめます」と書いてみます。サービスの例なら、却下の通知文を直すか、異議申立ての手順を変えるかを決めるための調査です。どちらかが最初から選べないなら、目的や問いを実際の選択に合うものに直す必要があります。
「信頼」で何を意味するか説明する
問いに「信頼」と書くだけでは測れません。信頼しているかを尋ねる、利用するかを観察する、限界を理解しているかを確かめる方法がありますが、分かることは異なります。ほかに選択肢がなく、信頼していないサービスを使い続ける人もいるかもしれません。
広い概念の代わりに測る手がかりを、代理指標と呼びます。何を選ぶかで、調査から分かることが変わります。PassiとBarocasの現場研究は、データサイエンスのチームが利用可能なデータ、組織の優先事項、交渉を通じて目標を形作る様子を示しました。[3] モデルを作る前から、公平さに関わる選択が始まっています。
重要な言葉ごとに、その意味、観察すること、その観察だけでは分からないことを書きます。その指標が公式の定義になると誰が不利になるかも考えます。申立ての件数だけを数えると、申し立てたくても説明を見つけられなかった人が抜け落ちるかもしれません。
サービスを使うことと、信頼することは同じとは限りません。
同じ問題について、別の問いも考える
最初の問いを磨く前に、別の問いを試します。何人が申立てを途中でやめるのか。どの段階で止まるのか。通知を変えると完了しやすくなるのか。本人はどう感じたのか。受理後に処理が遅れているのか。同じ手順の話でも、説明や調査方法は変わります。
AIには、問いの中の人、場所、比較、原因の候補を変えてもらえます。提案は候補として扱います。たとえばCo-Scientistは、仮説を生成する作業と、検討、比較、改善する作業を分けています。[4] 可能性を増やすだけでは、有用な問いを選んだことにはなりません。
練習として十二個の問いを出し、答えから何が分かるかでまとめてみます。十二という数は最初の案から視野を広げるための目安です。言葉を入れ替えただけの案は除きます。必要な根拠が異なる問いは、無理に一つの調査にまとめず分けておきます。
手元の条件で、答える価値のある問いを選ぶ
候補を三つの質問で比べます。答えは重要か。使える時間、資料へのアクセス、方法の範囲で、責任を持って根拠を得られるか。異なる結果が出たとき、説明や選択肢を見分けられるか。重要でも今は実行できない問いもあれば、簡単でも分かることが少ない問いもあります。
これは客観的な一位を出す公式ではなく、話し合うための観点です。重要な問いなら、必要なデータを集められるか小さな予備調査で試す価値があります。小さな問いでも、大きな研究の前提を確かめるなら役立ちます。点数だけでなく、選んだ理由を残します。
各候補について、誰のどんな判断に役立つか、最も得にくい根拠は何か、どんな結果なら驚くか、次に何を調べられるかを書きます。そうすると、印象のよい文を選ぶ議論ではなく、実際に行う調査を比較できます。
申立ての手順を調べる架空の記入例です。方法を選ぶ前に、これらの選択を合意しておきます。
何が分かれば考えを変えるか書いておく
説明を分かりやすくすれば、申立てを最後まで進められる人が増えると予想しているとします。どんな結果なら考え直すでしょうか。新しい通知を理解しても完了できなければ、主な問題は別にあるかもしれません。調査前に書いておくと、都合の悪い結果を後から説明で片づけにくくなります。
事前登録は、この区別を明確にする方法です。結果を見る前に問いと分析計画を記録し、試した予測と、データを見てから考えた説明を読み手が見分けられるようにします。[5][6] 公開登録が適さない場合も、日付のある計画と変更記録を残せば区別しやすくなります。
予想外の結果を探索しても構いません。予想外だったと示し、どう新しい問いや分析につながったかを説明します。見つけた傾向を最初から予測していたようには書きません。Registered Reportsは出版にも関連する考え方を取り入れ、結果が分かる前に問いと提案された方法を査読します。[7]
誰を、どこで、いつ調べるか決める
短い問いにすべての条件は入りません。別に短い調査メモを用意し、誰や何を対象に、どこでいつ調べ、何と比べ、結果をどう定義するかを書きます。作業の範囲を保ち、読み手にも答えが当てはまる範囲を伝えられます。
「AIは調査を改善するか」だけでは広すぎます。特定のチームが一定時間に見つける資料数を、AIを使う場合と使わない場合で比べることはできます。確認後に採用できた資料数と、それぞれに必要だった追加確認の量も調べます。これで課題、比較、観察する結果が具体的になります。
含めない人や資料も明示します。英語の公的記録だけでは、人々が問題について知っていることのすべては分かりません。現在の利用者へのインタビューから、非利用者に同じ経験がどれほど多いかは分かりません。限界が分かれば、次の調査に含める対象も見えてきます。
問いを見直す時点を決める
開始時には適切だった問いが、途中で役立たなくなることがあります。記録にアクセスできなくなる、指標が本当の問題を捉えていないと分かる、別の研究がすでに答えを出す、といった変化です。調査で支えるはずの判断が変わることもあります。費やした時間だけを理由に続ける必要はありません。
費用が膨らむ前に、計画を見直す時点を決めます。必要な根拠を得られない、複数の説明を見分けられない、残る労力に見合うことを学べないなら再検討します。公開された研究方針も変わり得ます。Anthropic Instituteは、AIとその影響の変化に応じて重点分野を発展させると説明しています。[2] 自分の調査メモも、分かったことに応じて更新できるようにします。
一時停止や中止をしたら、元の問い、変わったこと、分かったこと、まだ使える資料を短く残します。どんな条件なら再開する価値があるかも書きます。残った時間を有効に使うための記録です。

