(01)

確かめられる主張に分ける

AIに調査を頼むと、リンクと見出しが整い、結論もはっきりした報告書が返ってきます。ところが「この文は、どの資料で確かめたのですか」と聞かれてリンクを開くと、書かれている内容の一部しか裏付けられていません。

段落をまとめて読むと、この問題を見落としがちです。一文の中にも、異なる人、日付、結果についての主張が含まれます。事実を問うベンチマークのSimpleQAは、答えを短くして評価しやすくしています。[1] 報告書の確認にも同じ考え方が使えます。重要な主張を分け、一つずつ確かめます。

各主張について、出典と、その根拠になる正確な箇所や観察記録を残します。反対の結果を示す資料も書き添えます。そうすれば、検索を最初からやり直さなくても、なぜその結論を信頼するのか説明できます。

説得力のある文にも、それを裏付ける出典が必要です。
(02)

何を確かめる必要があるか書き出す

論文が詰まったフォルダから分かるのは、集めた資料です。何が分かったかまでは分かりません。本格的に検索する前に、確かめる必要がありそうな主張を書き出します。断定文で書いても、まだ結論ではなく調査する問いとして扱います。

たとえば、AIで支援の対象者を決めるサービスを調べるとします。本人が却下の理由を理解し、異議を申し立てる方法を知り、過度な負担なく誤りを直せるかが問いになります。通知文は何を伝えたか、インタビューは何を理解したか、案件記録は申立てで結果が変わったかを示します。問いの異なる部分に答えるため、複数の資料が必要です。

間違っていたと分かる程度まで具体的にします。「AIは調査を改善する」では比較する対象が曖昧です。「この調査では、通常の検索方法よりAIを使ったほうが、2時間以内に関連資料を多く見つけられた」なら比較できます。ただし、採用する資料は確認が必要です。対象となる人や課題、比較条件、結果、主張の範囲を示します。

(03)

その資料から何が分かるかを考える

信頼できる資料でも、その主張の根拠に適しているとは限りません。制度の文書から分かるのは規則であり、利用者の経験ではありません。製品発表は企業が公開したと述べる内容を示しますが、性能を独立に確かめた資料ではありません。インタビューは一人の経験を伝えますが、その経験がどれほど多いかまでは分かりません。

問いに合う根拠を探します。測定された効果は元の研究で、手順や過程は記録や観察で確かめます。レビュー論文は分野の主な結果や意見の違いを知るために、論評は調べる手がかりを得るために使えます。フォーラムの投稿も、問題の頻度は分からなくても、調査すべき不具合を教えてくれることがあります。

AIはこの探索を手伝えます。Anthropicは、問いを複数のエージェントに分けて並行して調べるリサーチシステムを紹介しています。[2] 資料の候補を広げる方法ですが、主張の根拠に使う前には、それぞれを開いて確認する必要があります。

(04)

主張と根拠を小さな表にまとめる

段落末尾の引用が、最初の文だけを裏付け、次の文には関係しないことがあります。重要な主張を一行ずつ表にすると、その抜けが見えやすくなります。「主張台帳」と呼ばれることもありますが、スプレッドシートで十分です。

まず主張、出典のリンク、根拠にする箇所や観察を書きます。資料の公開日と対象の人や環境も記録します。確認者、確信の度合い、食い違う根拠を加えます。「候補」「裏付けあり」「見解不一致」「棄却」「未解決」などの状態を付けると、次に読む人にも作業の進み具合が分かります。

執筆中も表を使います。二つの出典が一致して見えたら、同じ主張を支えているか確認します。AIが新しい要約を出したら、該当する行と照合します。下書きの文を出典が裏付けていなければ、その文を直すか削除します。表と報告書を対応させておくことが大切です。

(05)

結果が食い違う理由を調べる

研究では時間が減ったのに、インタビューでは仕事が増えたという声があったとします。両方とも正しいかもしれません。研究は条件を揃えた短い課題を扱い、インタビューには誤りを直す時間も含まれている可能性があります。どちらを採用するか決める前に、人、時期、課題、測定項目が同じか確かめます。

両方の主張と、それぞれを最もよく裏付ける根拠を残します。違いが生じた理由の候補と、次に確かめることを書きます。ある環境では時間が減り、別の環境では減らないと分かるかもしれません。説明できなければ、安心できる平均にまとめず未解決のまま残します。

AIエージェントにも、立ち止まって方法を見直す仕組みが必要です。最初の前提が違えば、検索を増やすほど誤った方向へ進むことがあります。Anthropicの指針は、実際の環境と結果を照合し、停止条件を設けることを勧めています。[3] 調査では資料の内容を確かめ、次の段階に判断が必要なら人に戻す形で応用できます。

どちらの結果を採用するか決める前に、同じ問いに答えているか確認します。
(06)

結果を点検できる作業をAIに任せる

検索語の提案、関連用語の探索、似た結果の分類、表の比較、根拠が足りない文の指摘をAIに頼めます。自分の答えを覆す根拠の候補を挙げてもらうこともできます。どれも結果を点検しやすい具体的な作業で、資料整理の時間を減らせます。

流暢な説明は、何が起きたかの記録ではありません。モデルの説明を根拠にせず、出典を確認します。原文を渡しても必要な箇所を使うとは限りません。「Lost in the Middle」は、長い入力の中で関連情報を置く位置によって性能が変わり得ることを示しました。[4]

確認や再実行ができるよう、入力と出力を残します。どの問いを立て、どの根拠を採用し、曖昧な点をどう扱い、どこまで確信するかは研究者が判断します。AIがこうした判断を提案した場合も、理由を確認してから採用します。

(07)

追加検索で何が変わりそうか考える

検索を続けても、すでに見た内容ばかりになることがあります。同じ研究を引用する報告書が十本あっても、独立した確認が十回行われたわけではありません。資料の一覧を長くするだけでなく、答えを変える根拠が増えそうかを考えます。

確認の程度は、間違ったときの影響に合わせます。事実に関する主張なら、信頼できる一次記録と独立した確認で足りる場合もあります。安全に関わる主張には、再現、専門家の検討、実際に使う場での試験が必要かもしれません。初期の探索結果は、暫定と明示して残せます。検索が膨らむ前に、必要な確認を決めます。

資料をさらに読むだけでは足りない場合もあります。PaperBenchはAIエージェントに論文の研究を再現させる評価で、試験した中で最も高性能なシステムでも達成したのは作業の一部でした。[5] 結果を説明することと再現することは違います。新しい環境でも成り立つかが判断を左右するなら、その場で関連する試験や直接観察を行います。

(08)

答えがどこまで使えるか伝える

最後に、分かったこと、特に重要な根拠、確信の度合いを示します。最も有力な反対の結果と、調べていない人や環境も含めます。その答えを行動に使う前に何を確認すべきか、次の手順を伝えます。

たとえば「今回のインタビューでは使いやすくなったと分かりましたが、異議申立ての手順はまだ試していません」なら、チームは次に調べることが分かります。サービス全体の検証が済んだように見せず、限られた結論を示せます。不明な点を伝えることも、根拠の範囲を超えた判断を防ぐ助けになります。

なぜ報告書にその結論があるのか聞かれたら、主張と根拠、それらを結ぶ理由を示せるようにします。この記録があれば、新しい資料が出たときにも、調査を最初からやり直さずに必要な判断を更新できます。