資料を入れても、必要な箇所が使われるとは限らない
長い報告書をAIに渡し、その結果が自分のプロジェクトにも当てはまるか尋ねます。答えは説得力があるのに、研究の対象者が違うという一文を見落としています。その文は渡した資料にありました。含めたことと、回答に使われたことは別です。
モデルが回答に使える情報をコンテキストと呼びます。一度に受け取れる上限がコンテキストウィンドウで、通常は文章などを分けた小さな単位のトークンで測ります。Lost in the Middleでは、必要な情報が長い入力の中ほどにあると、試験したモデルが使い損ねやすくなりました。[1] 情報を結びつけたり集約したりするRULERの課題でも、入力が長くなるにつれて性能が下がりました。[2]
実際に使うモデルと課題で確かめる必要があります。資料が全部入るかだけでなく、結論を変える細部に答えが触れているかを見ます。まず重要な箇所を見つけやすくし、正しく解釈するための前後の情報も添えます。
資料が入ったかだけでなく、重要な箇所が答えに使われたかを見ます。
プロジェクトの保管資料と、今使う資料を分ける
プロジェクトには発言録、報告書、下書き、検索結果、何週間もの会話がたまります。二つの結果を比較する作業に、そのすべてが同時に必要とは限りません。全部を持ち越すと、取りやめた計画や古い要約も入ります。
今のコンテキストを机の上の資料、残りを近くの資料棚と考えます。問い、有効な規則、今必要な根拠、進捗メモを机に置きます。MemGPTなども、作業中の情報と、必要なときに取り出す保存情報を分ける考え方を使っています。[6]
現在の入力から外しても、資料を消す必要はありません。固定したファイル名や識別子で保存し、取り出せるか確認します。権限の制限や安全規則は常に有効に保ちます。それ以外は、外すと答えが変わるか、次の工程を検証できなくなるかを考えて選びます。
指示、進捗、出典の内容を区別する
渡す情報の種類を示します。指示は何をするか、進捗メモは確認済みのことと未解決のこと、出典の箇所は根拠、例は答えの形式を伝えます。分けておくと、以前のAI要約を原資料のように扱っている場合にも気づきやすくなります。
用途に合わせて更新します。継続する規則を残し、新しい指示が以前の指示と矛盾しないか確かめます。進捗は作業に応じて直し、根拠は今の問いに合わせて取り出します。例は重要な違いを示す少数に絞り、使う可能性のあるツールの説明を読み込みます。
同じ情報を入力の各所にコピーしないようにします。締切が変わると、古い会話、要約、作業メモに別々の日付が残ることがあります。出典と更新日を付けた現在の記録を決め、古い日付は変更済みと示します。誰が更新するかも決めておくと、訂正が埋もれません。
今の問いに答える箇所を選ぶ
検索ツールが似た言葉の箇所を返しても、国、年、対象者、製品の版が違うことがあります。使う前に、次の作業が比較、引用、計算、主張の確認のどれなのかを示します。
比較なら両方で同じ指標を探し、期間が合うか確かめます。引用には前後の文と限定条件を添えます。制度の変更なら各版の施行日と例外を残します。インタビューを解釈するなら、考えている主題に合う発言だけでなく、反する発言も含めます。
進捗メモにはリンクやファイルの参照を置き、必要な段階で詳しい資料を開けます。Anthropicはこれを必要なときに取り出す「just in time」の方法として説明しています。[4] 毎回持ち越す量を減らせますが、正しい出典へ戻れることが前提です。短い参照で文書を代用する前に、その経路を試します。
今答える問いに合わせて、根拠を選びます。
無関係な資料を外し、反対の根拠は残す
情報が増えると、答えが悪くなる場合もあります。Shiらは算数の文章題で、無関係な細部が言語モデルの解答を妨げることを示しました。[3] 調査では、関連して見えても別の事例の資料が問題になります。昨年の製品を扱う報告書では、現行版を説明できないかもしれません。
それぞれを入れる理由を確かめます。問いに答えるか、その種類の主張を裏付けられるか、人、日付、定義が合うかを見ます。宣伝ページは技術報告を探す手がかりにはなっても、有効性の根拠とは限りません。古い報告書も、役割を明示すれば比較に使えます。
出てきた答えに反するというだけで資料を外してはいけません。その食い違いこそ必要かもしれません。無関係だと確認できたものを外し、重要な例外が残るか確かめます。無関係な情報を無視する指示はShiらの一部の試験で役立ちましたが、[3] 注意書きだけですべての紛らわしい入力に対応できるとは言えません。
要約で全体をつかみ、細部は原文に戻る
入力を短くすると費用が減り、結果もよくなる場合があります。LongLLMLinguaは、試験した長文入力の課題でプロンプト圧縮による改善を報告しています。[5] どんな短い要約でもよいわけではありません。要約は目的に合わせて細部を残し、ほかを省きます。
言葉や数値が重要なら正確な箇所を残します。決定事項と未完了の作業には日付入りの一覧が使えます。文章の要約は全体像を伝え、出典一覧は細部を探す助けになります。どの形式でも原資料へ戻る参照を付けます。
行動項目のための会議要約では、ためらい、意見の違い、決定までの議論が省かれるかもしれません。後で参加者の態度を解釈する唯一の根拠にすべきではありません。何のために作り、どの版を要約したかを示します。新しい問いに必要な細部が要約の対象外なら、原文を読み直します。
ある目的の要約には、次の問いに必要な情報がないかもしれません。
作業が変わったら、入力も更新する
関連する根拠をまとめ、限定条件を該当する主張のそばに置きます。現在の課題を見つけやすくし、出典と自分の解釈を分けます。Lost in the Middleでは順序が性能に影響したため、[1] 重要な試験例では並べ方も変えて確認します。一つの配置がすべてに最適とは限りません。
検索の終わりには有用な資料、未解決の手がかり、次の問いを残します。計算後は出力と確認方法を保存し、続行に必要なログだけを持ち越します。問いが変われば資料の選択も見直します。古い計画の下に新しい指示を足すだけでは、両方が答えに影響するかもしれません。
LongMemEvalは過去の文を思い出すだけでなく、更新された事実、時間に関する推論、情報がないときの回答保留を試します。[7] 実務では事実を訂正し、次の答えが訂正を使うか確かめられます。変更した記録に日付を付け、何を置き換えたかと更新担当を明確にします。
次の作業と確認に必要な情報を残し、入力から外した資料にも確実に戻れるようにします。
重要な情報が答えに使われたか試す
正しい答えが何に触れるべきか分かる実際の課題を、いくつか選びます。研究の重要な限界を残す、日付の異なる制度の版を区別する、保存メモから再開する、といった試験です。必要な記録がなく、何が分からないかを示すべき例も含めます。
入力を一度に一つ変えます。要約を外す、文書を並べ替える、もっともらしいが適用できない出典を加える方法があります。制御可能な作業記憶の研究も、与えた関連事実を使い、無関係な情報に引きずられないかを扱っています。[8] ここで提案する試験は、自分の工程で確認するためのものです。研究結果がそのまま当てはまるとは仮定しません。
答えを原資料と比べます。使った情報、依存した要約、原文の保存場所を短く記録します。確認の結果、不要だと分かったものは減らします。省略で答えが変わるなら、残すか再び取り出します。正しく、点検できる答えに必要な量を選びます。

