(01)

확인할 주장을 하나씩 나눕니다

AI에 조사를 맡겼더니 출처 링크와 깔끔한 소제목, 확신에 찬 결론을 갖춘 보고서가 나왔습니다. 그런데 누군가 “이 문장은 어떤 자료를 보고 썼나요?”라고 묻습니다. 링크를 열어 보니 보고서에 적힌 내용 중 일부만 확인할 수 있습니다.

문단을 통째로 읽으면 이런 빈틈을 놓치기 쉽습니다. 한 문장에도 서로 다른 사람과 시점, 결과에 관한 주장이 여러 개 들어갈 수 있기 때문입니다. 사실을 묻는 평가 시험인 SimpleQA는 답을 짧게 제한해 사실 여부를 판단하기 쉽게 만듭니다.[1] 보고서를 검토할 때도 이 방식을 참고할 수 있습니다. 중요한 주장을 나누고 하나씩 확인하는 겁니다.

주장마다 출처와 함께 근거가 되는 구절이나 관찰 내용을 남겨 둡니다. 그 주장과 어긋나는 자료도 적습니다. 그러면 처음부터 다시 검색하지 않고도 왜 그 결론을 신뢰하는지 설명할 수 있습니다.

설득력 있게 읽히는 문장에도 그 내용을 뒷받침하는 근거가 필요합니다.
(02)

자료를 찾기 전에 알아낼 내용을 적습니다

논문이 가득한 폴더를 보면 무엇을 모았는지는 알 수 있습니다. 무엇을 확인했는지는 별개입니다. 본격적으로 검색하기 전에 이번 조사에서 검증할 주장을 적어 봅니다. 사실처럼 써 놓았더라도 아직 확인된 내용은 아닙니다. 맞는지 알아보기 위해 적어 두는 겁니다.

예를 들어 AI로 지원 대상자를 심사하는 서비스를 연구한다고 해 보겠습니다. 탈락한 사람은 그 이유를 이해하는지, 이의를 제기하는 방법을 아는지, 무리한 수고 없이 오류를 바로잡을 수 있는지 확인해야 할 수 있습니다. 통지문을 보면 서비스가 무엇을 알렸는지 알 수 있습니다. 인터뷰에서는 사람들이 무엇을 이해했는지, 처리 기록에서는 이의 제기로 결과가 바뀌었는지 확인할 수 있습니다. 질문마다 필요한 자료가 다릅니다.

맞는지 틀린지 확인할 수 있도록 주장을 구체적으로 씁니다. “AI는 연구를 개선합니다”는 범위가 너무 넓습니다. “이번 과제에서 두 시간 동안 자료를 찾았을 때, AI를 쓴 쪽이 평소 검색 방식보다 관련 자료를 더 많이 찾았습니다”라고 하면 비교할 대상이 생깁니다. 찾은 자료를 실제로 쓸 수 있는지는 따로 검토해야 합니다. 대상과 비교 방법, 결과, 주장이 적용되는 범위를 밝혀 둡니다.

(03)

그 자료로 무엇을 알 수 있는지 묻습니다

믿을 만한 자료라도 지금 하려는 주장의 근거로는 부족할 수 있습니다. 정책 문서에는 규정이 적혀 있지만 사람들이 그 규정을 어떻게 경험하는지는 나오지 않습니다. 제품 발표문은 기업이 무엇을 출시했다고 밝혔는지 알려 줍니다. 제품의 성능을 독립적으로 입증하지는 않습니다. 인터뷰로 한 사람의 경험을 들을 수 있어도 그 경험이 얼마나 흔한지까지 알 수는 없습니다.

질문에 맞는 근거를 찾습니다. 측정된 효과를 확인하려면 원래 연구를 읽고, 절차를 이해하려면 기록을 살피거나 직접 관찰합니다. 여러 연구를 종합한 논문에서는 주요 결과와 의견이 갈리는 지점을 찾을 수 있습니다. 논평은 더 조사할 단서를 찾는 데 도움이 됩니다. 커뮤니티 게시물도 조사할 만한 문제를 알려 줄 수 있지만, 그 문제가 얼마나 자주 발생하는지까지 말해 주지는 않습니다.

AI는 이 자료 탐색을 도울 수 있습니다. Anthropic은 질문을 여러 에이전트에 나눠 맡겨 동시에 검색하는 연구 시스템을 소개했습니다.[2] 이런 방식으로 검토할 자료를 더 많이 찾을 수 있습니다. 다만 주장에 인용하기 전에는 각 자료를 직접 열어 내용을 확인해야 합니다.

(04)

간단한 표에 주장과 근거를 기록합니다

문단 끝의 출처가 첫 문장만 뒷받침하고 다음 문장과는 관련이 없을 수 있습니다. 중요한 주장마다 표의 한 행을 쓰면 이런 관계를 확인하기 쉽습니다. 이처럼 주장마다 근거를 기록한 표를 claim ledger라고도 합니다. 스프레드시트면 충분합니다.

먼저 주장과 출처 링크, 근거로 삼은 구절이나 관찰 내용을 적습니다. 자료의 발행일과 대상, 조사 환경도 기록합니다. 누가 검토했는지, 얼마나 확신하는지, 반대 근거가 있는지를 덧붙입니다. 검토 예정·근거 있음·이견 있음·기각·미해결처럼 상태를 표시하면 다른 사람도 어디까지 확인했는지 알 수 있습니다.

글을 쓰면서 이 표를 함께 봅니다. 두 출처가 같은 말을 하는 듯하면 정확히 같은 주장을 뒷받침하는지 확인합니다. AI가 새 요약을 만들면 표의 해당 항목과 대조합니다. 초안의 문장을 출처가 뒷받침하지 못한다면 고치거나 삭제합니다. 표는 보고서 내용과 함께 관리해야 쓸모가 있습니다.

(05)

자료마다 결론이 다른 이유를 확인합니다

한 연구에서는 도구를 쓰면 시간이 절약된다고 하는데 인터뷰에서는 일이 늘었다고 합니다. 둘 다 맞을 수 있습니다. 연구는 통제된 환경의 짧은 과제만 다뤘고, 인터뷰에는 오류를 수정하는 시간까지 포함됐을 수 있습니다. 어느 설명을 받아들일지 정하기 전에 대상과 시점, 과제, 측정 기준이 같은지 살펴봅니다.

두 주장과 각각을 가장 강하게 뒷받침하는 근거를 기록합니다. 차이가 생긴 이유를 추정하고 다음에 무엇을 확인할지 적습니다. 한 환경에서는 시간이 줄고 다른 환경에서는 늘어난다는 결론이 나올 수도 있습니다. 이유를 알 수 없다면 미해결로 남겨 둡니다. 서로 다른 결과를 평균 내서 안심할 만한 수치로 만들 필요는 없습니다.

AI 에이전트도 중간에 멈추고 접근 방법을 다시 살필 수 있어야 합니다. 처음 가정이 틀렸다면 검색을 거듭할수록 엉뚱한 방향으로 갈 수 있습니다. Anthropic의 에이전트 지침은 실제 환경에서 얻은 정보로 결과를 점검하고 중단 조건을 정하도록 권합니다.[3] 리서치에서는 출처에 실제로 무엇이 적혀 있는지 확인하고, 다음 단계에 판단이 필요하면 사람에게 검토를 요청하는 방식으로 적용할 수 있습니다.

두 결과 중 하나를 고르기 전에, 같은 질문에 답하는지 확인합니다.
(06)

결과를 검토할 수 있는 일을 AI에 맡깁니다

AI에 검색어와 관련 용어를 제안하거나 비슷한 조사 결과를 묶어 달라고 요청할 수 있습니다. 표를 비교하고, 근거가 부족해 보이는 문장을 표시하게 할 수도 있습니다. 내 답을 반박할 자료를 제안하도록 해도 좋습니다. 무엇을 했는지 확인할 수 있는 구체적인 작업이며, 자료를 정리하는 시간을 줄이는 데 도움이 될 수 있습니다.

AI가 그럴듯하게 설명해도 실제로 일어난 일을 정확히 옮겼는지는 알 수 없습니다. 그 설명을 근거로 쓰려면 출처와 대조해야 합니다. 원문을 입력해도 관련 구절을 제대로 활용한다는 보장은 없습니다. 「Lost in the Middle」 연구에서는 긴 입력 안에서 관련 정보가 놓인 위치에 따라 성능이 달라졌습니다.[4]

입력과 결과를 보관하면 작업을 검토하거나 다시 실행할 수 있습니다. 어떤 질문을 할지, 어떤 근거를 받아들일지, 모호한 내용을 어떻게 해석할지, 결론을 얼마나 확신할지는 연구자가 판단합니다. AI가 이런 판단을 제안하면 이유를 묻고 검토한 뒤 사용합니다.

(07)

더 검색하면 답이 달라질지 생각합니다

검색을 계속하다 보면 이미 찾은 내용이 되풀이됩니다. 보고서 열 편이 같은 연구 하나를 인용했다면 독립적인 확인이 열 번 이뤄진 것은 아닙니다. 출처 목록을 늘리는 데 그치지 않고, 답을 바꿀 만한 근거를 더 찾을 수 있을지 생각해 봅니다.

검토 수준은 판단이 틀렸을 때 생길 손해에 맞춰 정합니다. 어떤 사실은 권위 있는 원래 기록과 이를 독립적으로 확인한 자료로 충분할 수 있습니다. 안전에 직결되는 주장이라면 재현 시험과 전문가 검토, 실제 사용할 환경에서의 시험까지 필요할 수 있습니다. 초기 탐색 결과는 잠정적이라고 밝혀 둘 수 있습니다. 검색 범위가 커지기 전에 그 주장에 필요한 확인 수준을 정합니다.

자료를 더 읽는 것만으로 부족할 때도 있습니다. PaperBench는 AI 에이전트가 논문을 읽고 코드를 작성해 실험까지 재현하는 능력을 평가했습니다. 당시 시험한 시스템 중 가장 성능이 높은 경우에도 전체 작업의 일부만 완수했습니다.[5] 결과를 설명하는 일과 재현하는 일은 다릅니다. 새로운 환경에서도 결과가 성립하는지가 중요하다면 그 환경에서 직접 시험하거나 과정을 관찰해야 합니다.

(08)

확인한 내용과 남은 질문을 함께 전합니다

마지막에는 조사에서 얻은 답을 독자가 활용할 수 있게 설명합니다. 무엇을 알아냈는지, 핵심 근거는 무엇인지, 어느 정도 확신하는지 설명합니다. 가장 설득력 있는 반대 근거와 조사하지 않은 대상·환경도 밝힙니다. 독자가 결과를 바탕으로 행동하려면 무엇을 더 확인해야 하는지 적습니다.

예를 들어 “인터뷰에서는 서비스를 이용하기가 더 쉬워졌다는 답을 얻었지만, 이의 제기 절차는 아직 시험하지 않았습니다”라고 쓸 수 있습니다. 서비스 전체를 검증했다고 오해하게 하지 않으면서 다음 할 일을 알려 줍니다. 모르는 부분을 밝혀 두면 독자가 연구 결과를 적용 범위 밖의 결정에 사용하는 일을 줄일 수 있습니다.

보고서에 왜 그 결론을 썼느냐는 질문을 받으면 주장과 근거, 둘을 연결한 판단을 보여 줄 수 있어야 합니다. 이 기록이 있으면 연구를 갱신하기도 쉽습니다. 새 자료가 나왔을 때 처음부터 다시 시작하지 않고 그 자료와 관련된 판단을 고칠 수 있습니다.