答えのどこが不確かなのか示す
「新しいサービスは、おそらく利用しやすさを改善します」。使いやすいという声があったのでしょうか。手続きを終えた人が増えたのでしょうか。別の場所でも成り立つかが不明なのでしょうか。慎重な言葉を足しても、根拠の弱い部分は伝わりません。
分かったことと未確認のことを分けます。「インタビューでは、新しい申請書は分かりやすいと評価されました。最後まで記入できる人が増えるかは、まだ分かりません」なら、一般的な確信度のラベルを解釈しなくても、結果と限界が分かります。
答えを確認できる場合は、確信度と結果も比べられます。SimpleQAは短い事実問題でこの関係を調べます。[1] 比較可能な回答のうち70%の確信度を付けたものが約70%正しければ、その確信度はよく較正されています。一問の正解だけでは、その実績は示せません。
何が不確かで、どんな根拠が必要かを伝えます。
なぜ分からないのか説明する
不足の種類で次の作業は変わります。記録がなければ根拠を集め、測定が不確かなら集め方を点検します。複数の説明が成り立つなら見分ける調査が必要です。他国の結果なら現地条件を確認します。すべてを「確信度が低い」にまとめると、次に何をするかが見えなくなります。
AIでは、指示、資料の選び方、モデルの版を変えると答えが変わるかも問題です。繰り返すと不一致が分かりますが、同じ誤りを繰り返すこともあります。自分の不確実性をある程度評価できても、新しい課題ではその評価を適切に保てないことが研究で報告されています。[2] モデルの確信度も試す対象です。
限界は該当する主張のそばに置きます。公的通知で施行日は分かっても、一貫して実施されたかは不明かもしれません。インタビューで利用しやすくなったと示唆されても、何人が恩恵を受けたかは分かりません。日付への確信を、実施や効果にまで広げないようにします。
似た問いについての判断を比べる
ある種類の問いでよい実績があっても、すべてで信頼できるとは限りません。公文書の日付確認と新製品の需要予測は違います。まとめてしまうと、簡単な事実確認が予測の弱さを隠すことがあります。
比べられる判断の集まりを参照クラスと呼ぶことがあります。問い、出典、方法、環境、予測期間など、自分の作業に合う比較を選びます。学べるだけの事例を集め、意味のある違いを探します。小さすぎる集団は推定が不安定で、広すぎる集団は確信が外れる場面を隠します。
予測には日付を付け、何を正解とし、誰がいつ確認するか先に決めます。広い結論をその方法で判定できなければ、根拠の強さと限界を言葉で説明します。すべての解釈を二択の予測に変える必要はありません。
意味を確かめられる場合に確率を使う
73%という数字は「可能性が高い」より慎重に考えたように見えても、同じ未検証の直感かもしれません。出来事が明確で、推定の根拠を説明できるときに確率を使います。較正の評価には、比較できる判断と結果の記録も必要です。
較正はよい予測の一要素です。半分の出来事が起きるなら、すべてを50%としても全体の頻度とは合いますが、個別の判断には役立ちません。予測研究は、分布の集中度を表すシャープネスも較正と併せて見ます。[3] 二択なら、事例を見分け、結果でも裏付けられる確信に価値があります。下の架空の図は、実績以上に自信のある推定を示します。
自信の高さと、実際の正答率は合っていますか
示した確信度ごとに回答をまとめた仮想例
繰り返す予測は採点規則で比べられます。二択のブライアスコアは、確率と、起きた場合の1・起きない場合の0との差を二乗して平均します。80%の予測なら、起きれば0.04、起きなければ0.64で、小さいほどよい値です。期待値で正直な確率の表明を促す適正スコアリング規則の一つです。[4] 対数スコアは自信のある誤りに特に厳しくなります。平均だけでなく図や重要な集団の結果も見て、繰り返す問題を探します。
細かい確率にも、根拠と確かめる方法が必要です。
「可能性が高い」の意味を明確にする
根拠のまとまりを説明するなら、確率より言葉が役立つ場合があります。「独立した二件の記録が裏付けていますが、現場では未確認です」なら、信じる理由と不足が分かります。「確信度は高い」だけでは伝わりません。
研究では、モデルが実際の確率とおおむね対応する言葉で確信度を表すよう学習できました。[5] ただし読み手の解釈は異なる場合があります。IPCCの確率表現を複数国で調べた研究でも、意図した意味と受け取り方に違いがありました。[6] なじみのある言葉でも、定義を共有しているとは限りません。
「裏付けあり」「暫定」「未解決」などを使い続けるなら、短く定義します。根拠の質か、出来事の確率かも示します。方法の中で「可能性が高い」を数値の範囲に対応させるなら、その場に範囲も書きます。読み手が判断できるよう、理由を近くに置きます。
見込みと、何をするかを分ける
小さな不便の確率60%と、取り返しのつかない被害の確率60%では対応が違います。確信度だけで行動は決まりません。間違う費用、待つ費用、やり直せるか、使える安全策を考えます。
推定と提案は別に書きます。架空の例で「同じ傾向が再び現れる確率は65〜75%」は見込みです。「不利益を限定でき、二週間で結果が分かるため、小さく試す」は行動の理由です。分けると、推定にも試行の理由にも異論を述べられます。
弱い兆候は追加インタビューや小さな試験の理由になっても、全面導入を支えるとは限りません。根拠不足で高額な拡大を止めても、永久に機能しないと証明したわけではありません。実行できる観察のうち何が最も選択を変えそうかを問い、次の調査につなげます。
「分からない」を次の作業につなげる
根拠が足りなければ理由を示します。記録の欠落なら取得、曖昧な問いなら確認、結果の食い違いなら比較が必要です。方法の範囲外なら別の方法や適切な専門家を頼ります。自信を持って答えられない状態でも、次の手順は異なります。
複数のAI回答の意味を比べ、不一致から作り話の可能性を検出する研究があります。[7] ロボットの計画を対象とした別の研究は、事例で較正するコンフォーマル予測を使い、明示した仮定のもとで統計的保証を伴って助けを求める時点を決めます。[8] 特定の問題への方法です。同じ誤った見込みを繰り返す場合もあり、保証が別の集団や課題にそのまま移るわけではありません。
答える割合と、その答えが誤る割合を両方見ます。回答を減らすなら、引継ぎが増えるだけの価値があるほど誤りが減るか確認します。言語や利用者層ごとに何を保留するかも調べます。十分に対応できない集団には、無理に答えさせず、根拠や人の支援を補います。保留した案件には連絡経路、担当者、応答の目安を用意します。
役立つ「分からない」は、不足と次の確認を説明します。
明確な出来事には確率を、単純な二択にならない主張には根拠の説明を使います。どちらも理由と次の確認を示します。
何が分かれば判断を変えるか示す
推定はその時点の知識に基づきます。強める、弱める、覆す根拠を挙げます。一般的なレビューを増やすより、新しい記録、別の集団の結果、外れた予測が重要なこともあります。
重要な推定、根拠、比べた事例、結果の確認担当を日付付きで残します。結果が出たら、説明を直す前に元の推定と照合します。以前の版も保管し、確信が妥当だったか、何が変わったかを確認できるようにします。
今の根拠が支えること、残る不確実性、その中で適切な行動を示して締めくくります。次に役立つ確認と見直し時期も伝えます。読み手は限界を理解して行動し、方針を変える時点を見極められます。

