먼저 같은 질문에 답하고 있는지 봅니다
한 보고서에서는 서비스 이용자가 늘었다고 하고, 다른 보고서에서는 줄었다고 합니다. 어느 쪽을 믿을지 정하기 전에 무엇을 셌는지 봅니다. 첫 보고서는 지금까지 가입한 사람을, 두 번째는 이번 달에 실제로 이용한 사람을 셌을 수 있습니다. 그렇다면 둘 다 맞을 수 있습니다. 단순히 ‘자료가 엇갈린다’고 정리하면 가입은 늘지만 실제 이용은 줄고 있다는 중요한 사실을 놓칩니다.
각 주장을 뒷받침하는 원문 옆에 조사 대상, 시기, 측정 항목, 비교 대상을 적습니다. 원격 근무가 생산성을 높인다는 주장이라면 어떤 업무와 근로자를 조사했고 생산성을 어떻게 측정했는지 확인합니다. 제목보다 실제 조사 결과를 먼저 비교합니다.
결론이 조사한 범위를 얼마나 넘어서는지도 살핍니다. 야르코니는 연구자가 실제로 조사한 과제나 환경을 넘어 결과를 일반화하면서, 통계 분석으로 뒷받침하지 못하는 주장을 할 수 있다고 설명합니다.[4] 한 집단에서 얻은 결과는 유용할 수 있지만 모든 집단에 대한 답은 아닐 수 있습니다.
두 보고서가 같은 질문에 답하고 있는지 먼저 확인합니다.
요약 옆에 원래 표현을 남겨 둡니다
보고서 여러 개를 요약하다 보면 비슷한 표현으로 통일하고 싶어집니다. 글은 읽기 쉬워지지만 중요한 차이가 사라질 수 있습니다. 줄여 쓴 문장 옆에 원문 구절, 수치, 단위, 조사 상황을 남겨 두면 요약하면서 무엇이 달라졌는지 확인할 수 있습니다.
서로 다른 방법으로 얻은 결과를 나란히 비교하는 절차를 triangulation protocol이라고 합니다. 결과가 일치하는지, 일부만 일치하는지, 한쪽에서만 다뤘는지, 서로 다른지를 구분합니다.[1] 예를 들어 설문에서 대기 시간을 묻지 않았고 인터뷰에서는 오래 기다렸다는 이야기가 나왔다면, 두 결과가 모순되는 것은 아닙니다. 인터뷰가 설문에서 놓친 경험을 보여 준 것일 수 있습니다.
결론을 쓰기 전에 결과를 표에 나란히 놓습니다. 오캐세인과 동료들은 이런 비교표로 자료 간 관계를 살피고, 정리 중인 설명에 맞지 않는 사례를 찾는 방법을 소개합니다.[2] 표에 ‘두 결과가 모두 맞을 수 있을까요? 그렇다면 어떤 조건에서일까요?’라는 질문을 덧붙입니다. 다음에 조사할 것이 구체적으로 드러납니다.
무엇을 셌는지, 근거가 어디서 왔는지 확인합니다
먼저 정의와 계산 방법을 봅니다. ‘이용자’가 계정 수인지 사람 수인지 이용 횟수인지 확인합니다. 보고된 비율의 분모가 설문에 초대받은 모든 사람인지, 실제로 답한 사람만인지도 봅니다. 이어 날짜, 지역, 제품 버전, 조사 참여 기준, 결과가 나타날 때까지 관찰한 기간을 비교합니다. 필요한 단위는 환산하되, 다른 것을 측정한 수치에 같은 이름을 붙여 같아 보이게 만들지는 않습니다.
각 자료로 무엇을 알 수 있는지도 구분합니다. 예측 자료는 앞으로 일어날 일을 추정하고, 최종 실적 보고서는 이미 일어난 일을 기록합니다. 한 사람의 경험으로 특정 문제가 발생했다는 것은 알 수 있어도 얼마나 흔한지는 알기 어렵습니다. 행정 기록에는 접수된 사례가 남지만, 서비스를 찾지 못한 사람은 빠질 수 있습니다. 같은 주제를 다루는 자료라도 답할 수 있는 부분은 다릅니다.
같은 주장이 반복되면 원자료까지 따라갑니다. 보고서 세 개가 모두 같은 설문조사를 인용했다면 출판물은 세 개지만 측정은 한 번입니다. 같은 조사, 데이터, 표본을 사용한 곳을 표시하고 기존 자료를 새로 분석한 것과 자료를 새로 수집한 것을 구분합니다. 반복해서 인용됐다는 이유만으로 여러 번 독립적으로 확인된 결과가 되지는 않습니다.
보고서 세 개가 같은 원자료를 인용한다면
가상 예시: 보고서 세 개, 설문조사 한 번
보고서 세 개가 같은 설문을 인용했다면 측정은 한 번입니다.
다음에 확인할 차이를 구체적으로 적습니다
남은 문제를 쉬운 말로 적습니다. 두 보고서가 성공을 다르게 정의했을 수 있습니다. 조사한 사람이나 시기, 측정 방법이 다를 수도 있습니다. 같은 결과를 보고도 원인을 다르게 설명할 수 있고, 사실에는 동의하면서 그 결과를 받아들일 만한지에 관해서만 의견이 다를 수도 있습니다.
이 설명을 보고 다음 확인 방법을 정할 수 있어야 합니다. 정의가 다르면 무엇을 셌는지, 기간이 다르면 날짜를 맞춰 비교합니다. 측정 오류가 의심되면 데이터를 확인하거나 다른 방법으로 측정합니다. 원인에 대한 두 설명이 다른 결과를 예측한다면 그 예측을 시험할 방법을 찾습니다. 무엇을 감수할 만한지에 관한 의견 차이는 판단 기준을 드러내야 합니다. 자료를 더 검색하는 것만으로 해결되지 않을 수 있습니다.
여러 차이가 함께 작용할 수도 있습니다. 후속 연구가 다른 집단을 조사하면서 성공 기준도 더 엄격하게 적용했을 수 있습니다. 확인하기 전에는 두 가능성을 모두 남겨 둡니다. 규정과 사람들이 실제로 경험한 일이 다를 때도 따로 기록합니다. 확인할 때마다 어떤 가능성을 제외했는지 짧게 적고 설명을 고칩니다.
비교표 옆에 원문을 남겨 둡니다. 새로 확인한 내용에 따라 차이가 생긴 이유에 대한 설명을 고칩니다.
평균을 내면 무엇이 가려질지 묻습니다
비교할 만한 연구끼리 결과를 합치면 도움이 됩니다. 다만 먼저 효과의 방향과 크기, 불확실성, 조사한 사람과 조건을 살펴야 합니다. 전체 평균은 좋아졌어도 정작 지원해야 할 집단에서 서비스가 나빠졌다면 평균만으로는 결정하기 어렵습니다.
연구마다 효과가 다를 수 있다고 보고 평균을 추정하는 방법을 random-effects meta-analysis라고 합니다. 코크란 지침은 이 방법으로도 연구 간 차이의 이유까지 설명할 수는 없으며, 효과의 방향이 서로 다르면 평균이 오해를 부를 수 있다고 경고합니다.[3] 하나의 숫자로 합치기보다 결과를 나란히 보여 주는 편이 나을 수 있습니다. 결과를 본 뒤 특정 집단에서만 차이가 난다는 설명을 떠올렸다면, 확정된 규칙이 아니라 추가로 확인할 가설로 다룹니다.
지금 내릴 결정에 무엇이 필요한지 묻습니다. 서비스 담당자는 전체 완료율이 괜찮더라도 오래된 휴대전화나 특정 언어에서 왜 완료율이 떨어지는지 알아야 할 수 있습니다. 결과가 어느 조건에서 유지되고 어디서 달라지는지 보고합니다. 관찰한 사례가 적어 우연한 차이인지 판단하기 어렵다면 그 한계도 밝힙니다.
두 설명을 구분할 수 있는 확인 방법을 찾습니다
한 팀은 신청 도중에 그만두는 이유가 어려운 안내문이라고 보고, 다른 팀은 긴 대기 시간 때문이라고 본다고 가정해 보겠습니다. 두 설명 모두 낮은 완료율과 맞아떨어집니다. 하지만 대기 시간은 그대로 두고 안내문만 쉽게 바꾸거나, 문구는 유지하면서 대기 시간만 줄이면 예상하는 결과가 달라집니다. 새 결과를 보기 전에 각 설명이 무엇을 예측하는지 적습니다.
서로 다른 이론을 지지하는 연구자들이 검증 방법을 합의하고 함께 시험하기도 합니다. 이를 adversarial collaboration이라고 합니다. 2025년 의식에 관한 두 이론을 시험한 연구는 예측과 검증 방법을 미리 합의하고 여러 실험실과 측정 방법을 사용했습니다. 결과는 일부 예측을 지지하면서 두 이론의 중요한 주장 모두에 의문을 제기했습니다.[5] 어느 한쪽이 이겼다고 단정하지 않으면서도 무엇이 쟁점인지 더 분명히 한 사례입니다.
실무에서는 문제를 잘 아는 비판자에게 두 설명을 모두 검토하고 유용한 확인 방법을 함께 골라 달라고 요청할 수 있습니다. 기록을 확인하거나 현장을 방문하고, 다른 사례와 비교하거나 일부 조건만 바꿔 시험할 수 있습니다. 어떤 결과가 나오면 각 설명의 설득력이 약해지는지 미리 합의합니다. 현실적으로 가능한 방법으로는 구분하기 어렵다면 그렇게 밝히고, 근거가 더 쌓였을 때 수정할 수 있는 행동을 고려합니다.
각 설명이 맞다면 어떤 결과가 나올까요?
AI가 찾은 차이는 원자료에서 확인합니다
AI는 문장을 비교하고, 용어가 달라진 곳을 찾고, 반복 인용을 추적하고, 가능한 설명을 제안하는 데 도움을 줄 수 있습니다. 정확한 주장, 뒷받침하는 원문, 차이로 의심되는 부분, 아직 확인할 내용을 함께 받습니다. 이 결과를 원자료와 대조할 검토 목록으로 사용합니다.
Chain-of-Verification은 모델이 답변 초안을 쓴 뒤 검증 질문을 만들고, 각 질문에 독립적으로 답한 다음 최종 답변을 작성하는 방법입니다. 연구에서 시험한 과제에서는 환각이 줄었습니다.[6] 리서치에 응용한다면 차이를 정리하는 단계와 사실을 확인하는 단계를 나눌 수 있습니다. 두 번째 단계에서는 첫 요약이 그럴듯한지 묻는 데 그치지 않고 원래 날짜, 인용문, 표본, 계산으로 돌아가 확인합니다.
모델 간 토론으로 추론과 사실 정확성이 좋아진 평가도 있습니다.[7] 반면 의도적으로 잘못된 방향으로 이끄는 에이전트 하나가 집단을 오답으로 설득하고, 모델 수나 토론 횟수를 늘려도 안정적으로 해결되지 않은 실험도 있습니다.[8] 따라서 모델끼리 의견이 같다는 것만으로는 부족합니다. 중요한 결론은 원자료나 적절한 현장 검증으로 확인하고, 해결하지 못한 반론도 남겨 둡니다.
현재 근거로 말할 수 있는 답을 줍니다
‘근거가 엇갈립니다’만으로는 독자가 판단하기 어렵습니다. 뒷받침되는 결과, 특정 조건에서만 성립하는 결과, 아직 해결되지 않은 부분을 설명합니다. 사실에 대한 이견과 무엇을 받아들일 만한지에 대한 이견을 구분합니다. 조사하지 못한 집단이나 결과 때문에 답이 제한된다면 그것도 밝힙니다.
그 답이 결정에 어떤 영향을 주는지 연결합니다. 지금 무엇을 할 수 있고, 어떤 조치는 되돌리기 쉽게 유지해야 할까요? 무엇을 누가 언제까지 더 확인해야 할까요? 불확실성이 해소되기 전에 행동하자고 권한다면 기다리는 비용과 틀렸을 때의 비용을 설명합니다. 급히 결정해야 한다고 근거가 더 강해지는 것은 아닙니다.
최종 답은 처음 기대보다 좁을 수 있습니다. 서비스가 특정 환경에서만 잘 작동하거나, 두 보고서가 다른 것을 세었거나, 현재 자료로는 두 원인을 구분할 수 없다는 결론일 수 있습니다. 그 답에 어떻게 도달했고 어떤 자료가 나오면 달라질지 설명합니다. 의견이 엇갈린다는 사실은 다음에 무엇을 조사할지 알려 줄 때 도움이 됩니다.

