同じ問いへの答えかを確かめる
ある報告は「利用者が増えている」、別の報告は「利用が減っている」と述べています。どちらを信じるか決める前に、数えているものを見ます。一方は累計登録者数、もう一方は今月使った人の数かもしれません。両方とも正しいなら、分かるのは「登録は増えているが、今の利用は減っている」ということです。
それぞれの主張と、それを支える原文を並べます。誰をいつ調べ、何を測り、何と比べたかも添えます。在宅勤務の生産性なら、対象の仕事や働き手、生産性の測り方を確認します。見出しを比べる前に、実際の結果を比べます。
結論が研究の範囲を越えていないかも見ます。Yarkoniは、調べた課題や環境の外まで一般化しようとするときなどに、統計分析では支えられない広い主張が生まれる問題を論じています。[4] ある集団での結果は有用でも、すべての集団について答えているとは限りません。
まず、二つの報告が同じ問いに答えているかを確かめます。
要約のそばに元の結果を残す
複数の報告をまとめると、同じ言葉で書きたくなります。読みやすくなる一方、大事な違いが消えることもあります。短くした説明のそばに原文、数値、単位、調べた状況を残し、何を変えたか分かるようにします。
異なる方法で得た知見を整理して比べるのが、トライアンギュレーションの手順です。一致、部分的な一致、言及がない状態、食い違いを区別します。[1] 待ち時間を尋ねなかったアンケートは、「長く待った」というインタビューの話と矛盾しません。インタビューが、アンケートで扱わなかった経験を補っている可能性があります。
結論を書く前に、知見を表に並べます。O’Cathainらは、こうした関係や、考えている説明に合わない事例を調べるための表を紹介しています。[2] 「どんな条件なら、両方とも正しいと言えるか」という問いも加えます。次に確かめることが具体的になります。
数え方と、根拠の出どころを調べる
まず定義と計算を見ます。「利用者」はアカウント、人、利用回数のどれでしょうか。割合の分母は、依頼した全員か、回答した人だけでしょうか。日付、場所、製品の版、参加条件、結果を観察した期間も比べます。必要なら単位を換算しますが、違う指標に同じ名前を付けて同じものに見せてはいけません。
資料ごとに何が分かるかも考えます。予測は今後の見込み、最終報告は実際に起きたことを示します。一人の体験から失敗の存在は分かっても、頻度までは分かりません。行政記録には届け出た件数が残りますが、サービスへ連絡しなかった人は含まれないかもしれません。同じ問いに関係する資料でも、答えられる部分が違います。
繰り返される主張は、元の根拠までたどります。三つの報告書が一つの調査を引用していれば、出版物は三つでも測定は一回です。共通の調査、データ、標本を示し、新しい分析と新しく集めた根拠を分けます。何度も書かれているだけでは、独立した裏づけにはなりません。
三つの報告書が一つの調査を引用している場合
説明のための例:出版物は三つ、測定は一回
三つの報告が一つの調査を引用しても、測定は一回です。
何が違うのかを言葉にする
残った違いを普段の言葉で書きます。成功の定義が違うのか、調べた人や時期が違うのか、測り方が違うのか。同じ結果を見て、原因の説明だけが違う場合もあります。事実には合意していても、その結果を許容できるかで意見が分かれることもあります。
違いが分かれば、次の確認を選べます。定義が違うなら数えた対象を比べ、時期が違うなら同じ期間の結果を探します。測定の誤りが疑われるならデータを確認するか別の方法で測ります。原因の説明が違うなら、それぞれの予測を試します。何を許容するかの争いなら判断基準を明示します。検索を増やしても決着しないかもしれません。
複数の違いが重なることもあります。後の研究が、別の集団と、より厳しい成功基準を使っているかもしれません。確認できるまで両方の可能性を残します。規定された方針と実際の経験が違う場合も記録します。調べるたびに説明を更新し、何を除外できたか短く残します。
比較のそばに原文を残します。確認で新しいことが分かれば、説明を更新します。
平均すると何が見えなくなるかを考える
比較できる研究なら、結果をまとめることが役立ちます。その前に、効果の向き、大きさ、不確かさ、対象者、条件を見ます。支援したい集団でサービスが使いにくくなっているなら、平均の改善だけでは十分な答えになりません。
Cochraneの指針は、ランダム効果メタ分析を使っても研究間の違いを説明できるわけではないと注意しています。これは効果のばらつきを認めて平均を推定する方法ですが、結果の向きが違う研究をまとめると誤解を招くことがあります。[3] 一つの数字より、並べた比較が役立つ場合もあります。結果を見てから気づいた集団別の説明は、確立した規則ではなく、確認すべき仮説として扱います。
今回の判断に何が必要かを考えます。全体の完了率が高くても、古い端末や特定の言語で下がる理由を知る必要があるかもしれません。結果が成り立つように見える条件と、変わる条件を示します。観察数が少なく、違いが確かなのか判断できない場合も伝えます。
二つの説明を見分ける確認を選ぶ
申請を途中でやめる理由について、あるチームは説明文が難しいから、別のチームは待ち時間が長いからだと考えています。どちらも低い完了率を説明できます。待ち時間を変えずに説明文を簡単にしたら、あるいは文面を変えずに待ち時間を短くしたら、どうなるでしょうか。新しい結果を見る前に、それぞれの予測を書きます。
異なる理論を支持する研究者が、共同で試験を設計することもあります。これは対立的協働と呼ばれます。意識に関する二つの理論を扱った2025年の研究では、予測と試験を事前に合意し、複数の研究室と方法で調べました。結果は一部の予測を支持し、両方の理論の重要な主張に疑問を投げかけました。[5] 単純な勝者を決める形にはならなくても、何が食い違うのかが明確になりました。
日々の調査でも、詳しい批判者に両方の説明を検討してもらい、役立つ確認を一緒に選べます。記録、現場訪問、比較事例、小さな介入などです。どの結果なら各説明が弱まるかも決めます。実行できる確認では区別できないなら、その限界を示し、根拠が増えたときに見直せる行動を考えます。
それぞれの説明が正しければ、何が起きるはずでしょうか。
AIが見つけた違いを原資料で確かめる
AIは文章を比べ、用語の変化や繰り返される引用を探し、考えられる理由を挙げる手助けができます。正確な主張、根拠となる原文、疑われる違い、未確認の点を返すよう頼みます。出力は、原資料と照らして確認する手掛かりとして使います。
Chain-of-Verificationという研究手法は、答えの下書き、確認用の問い、その問いへの個別の回答、答えの修正という順に進みます。試した課題では、事実に反する生成を減らしました。[6] 調査への応用として、食い違いの整理と確認を分けられます。確認の段階では、最初の要約がもっともらしいかだけを問わず、元の日付、引用、標本、計算へ戻ります。
モデル同士の議論で推論や事実への回答が改善した評価もあります。[7] 一方、意図的に誤誘導する一体のエージェントが集団を誤答へ説得し、数や議論の回数を増やしても安定して直らなかった実験もあります。[8] モデル間の合意だけでは不十分です。重要な結論を原資料や適切な現場の確認で検証し、解消していない異論も残します。
根拠から言える答えを伝える
「根拠は一様ではありません」だけでは、読み手は判断できません。どの知見が裏づけられ、どれが特定の条件でのみ成り立ち、何が未解決かを説明します。事実の食い違いと、許容できるかという判断の違いも分けます。調べていない集団や結果が答えを制限するなら、それも示します。
その答えを判断につなげます。今できること、後で戻せるようにしておくこと、追加確認が必要なことは何でしょうか。誰がいつまでに確かめるかも決めます。不確実なまま進める提案なら、待つ費用と間違えた場合の費用を説明します。急ぐ事情があっても、根拠が強くなるわけではありません。
得られる答えは、期待より狭いかもしれません。「この条件では役立つ」「二つの報告は違うものを数えていた」「今の根拠では二つの原因を区別できない」。そう判断した過程と、答えが変わりうる条件を示します。食い違いを調べる価値は、次に何を確かめるべきかが見えることにあります。

