(01)

답의 어느 부분이 불확실한지 밝힙니다

“새 서비스가 이용하기 더 편해졌을 가능성이 높습니다.” 독자는 여기서 무엇이 불확실한지 알기 어렵습니다. 사람들이 편해졌다고 말했나요? 절차를 끝까지 마친 사람이 늘었나요? 다른 곳에서도 같은 결과가 나올지 모르는 건가요? 조심스러운 단어를 붙이는 것만으로 근거의 빈틈이 설명되지는 않습니다.

아는 것과 아직 모르는 것을 나눠 씁니다. 예를 들어 “인터뷰한 사람들은 새 신청서가 이해하기 쉬워졌다고 답했습니다. 신청을 끝까지 마치는 사람이 늘었는지는 아직 모릅니다”라고 할 수 있습니다. 독자는 막연한 확신 등급을 해석하지 않고도 결과와 한계를 알 수 있습니다.

답이 맞는지 확인할 수 있다면 확신과 결과도 비교할 수 있습니다. SimpleQA는 짧은 사실 질문으로 이 관계를 살핍니다.[1] 예를 들어 70% 확신한다고 한 답을 많이 모았을 때 실제로 약 70%가 맞는다면, 제시한 확신과 정답률이 맞아떨어집니다. 이 관계를 살피는 것을 calibration이라고 합니다. 답 하나를 맞혔는지만으로는 판단할 수 없습니다.

무엇이 불확실하고 어떤 근거가 도움이 될지 설명합니다.
(02)

왜 확신하지 못하는지 설명합니다

무엇이 부족한지에 따라 할 일이 달라집니다. 기록이 없으면 근거를 더 찾아야 합니다. 측정값이 불안정하면 어떻게 수집했는지 확인합니다. 여러 설명이 그럴듯하면 어느 것이 맞는지 구분할 조사가 필요합니다. 다른 나라의 근거라면 현지 조건이 비슷한지 살펴봅니다. 모두 ‘낮은 확신’으로 묶으면 다음에 할 일이 가려집니다.

AI를 쓰면 프롬프트나 고른 출처, 모델 버전을 바꿨을 때도 같은 답이 나올지 따져야 합니다. 반복해서 물으면 답의 불일치를 찾을 수 있지만 모델이 같은 실수를 되풀이할 수도 있습니다. 모델이 자기 답의 불확실성을 어느 정도 평가할 수 있어도 새 과제에서는 그 평가가 실제 결과와 잘 맞지 않는다는 연구가 있습니다.[2] 모델의 확신도 검증할 대상으로 봅니다.

한계는 해당 주장에 붙입니다. 공식 통지문으로 정책 시행일은 확인해도 얼마나 일관되게 집행됐는지는 모를 수 있습니다. 인터뷰에서 서비스 이용이 쉬워졌다는 답을 얻어도 혜택을 본 사람이 얼마나 되는지는 알 수 없습니다. 날짜에 대한 확신 때문에 집행이나 효과까지 같은 수준으로 확인한 것처럼 들리지 않게 합니다.

(03)

비슷한 질문에 대한 판단끼리 비교합니다

한 종류의 질문을 잘 맞혔다고 모든 질문에서 믿을 만한 것은 아닙니다. 공식 문서의 날짜를 확인하는 일과 신제품의 수요를 예측하는 일은 다릅니다. 둘을 합치면 쉬운 사실 확인의 좋은 성적이 부정확한 수요 예측을 가릴 수 있습니다.

이처럼 서로 비교할 만한 판단을 모아 둔 집합을 reference class라고 부릅니다. 내 작업에 맞춰 질문과 출처, 방법, 환경, 예측 기간이 비슷한 판단을 고릅니다. 배울 수 있을 만큼 사례를 모은 뒤 의미 있는 차이가 있는지 봅니다. 집단이 너무 작으면 추정이 불안정하고, 너무 넓으면 어떤 경우에 확신이 빗나가는지 가려집니다.

예측 날짜를 기록하고 어떤 결과가 나와야 맞은 것으로 볼지, 언제 누가 확인할지 미리 정합니다. 넓은 해석이나 결론을 이런 방식으로 판정하기 어렵다면 근거의 강도와 한계를 말로 설명합니다. 모든 해석을 맞거나 틀리는 예측으로 바꿀 필요는 없습니다.

(04)

백분율의 의미를 확인할 수 있을 때 씁니다

‘73%’는 ‘가능성이 높습니다’보다 신중히 계산한 값처럼 보일 수 있습니다. 둘 다 검증하지 않은 직감일 수도 있습니다. 어떤 사건인지 분명하고 추정의 근거를 설명할 수 있을 때 백분율을 씁니다. 확신과 실제 결과가 잘 맞는지 평가하려면 서로 비교할 만한 판단과 결과의 기록도 필요합니다.

확신과 실제 발생 빈도가 맞더라도, 그 예측이 개별 사례를 판단하는 데는 도움이 적을 수 있습니다. 사건이 절반씩 일어나는 자료에서 모든 사건에 50%를 주면 전체 빈도에는 맞아도 개별 사례를 판단하는 데는 도움이 적습니다. 예측 연구는 확률 분포가 얼마나 집중돼 있는지를 뜻하는 sharpness도 calibration과 함께 살핍니다.[3] 일어나거나 일어나지 않는 사건이라면, 사례를 구분하는 자신 있는 예측이 실제 결과와도 맞을 때 유용합니다. 아래 가상 도표는 결과에 비해 확신이 지나치게 높은 경우를 보여 줍니다.

확신한 만큼 실제로 맞았을까요?

확신 수준별로 답을 묶은 가상 예시

┄ 확신과 결과가 일치하는 기준● 실제로 맞은 비율
실제로 맞은 비율 ↑
0%0%50%50%100%100%
제시한 확신 →
그림 02점선 아래의 점은 결과보다 확신이 높았음을 나타냅니다. 예를 들어 90% 확신한다고 한 답 중 실제로 맞은 비율은 62%입니다.

반복한 예측은 점수로 비교할 수 있습니다. 일어나거나 일어나지 않는 사건을 평가할 때는 Brier score를 쓸 수 있습니다. 사건이 일어나면 1, 일어나지 않으면 0으로 두고, 예측 확률과의 차이를 제곱해 평균을 냅니다. 80%로 예측한 사건이 일어나면 0.04, 일어나지 않으면 0.64이며 낮을수록 좋습니다. 이 방식은 실제로 믿는 확률을 부풀리거나 낮추지 않고 그대로 제시할 때 평균적으로 유리하도록 설계돼 있습니다. 이런 채점 방식을 proper scoring rule이라고 합니다.[4] 로그 점수는 확신에 찬 오답에 특히 큰 불이익을 줍니다. 점수뿐 아니라 도표와 중요한 집단별 결과를 함께 봐야 반복되는 문제가 평균에 가려지지 않습니다.

정밀해 보이는 백분율에도 근거와 검증 방법이 필요합니다.
(05)

‘가능성이 높다’는 말의 뜻도 설명합니다

여러 근거를 설명할 때는 백분율보다 말이 더 유용할 수 있습니다. “독립적인 기록 두 개가 뒷받침하지만 실제 현장에서는 아직 확인하지 못했습니다”라고 하면 왜 믿는지와 무엇이 빠졌는지가 드러납니다. ‘높은 확신’만으로는 알기 어렵습니다.

모델이 확신을 말로 표현하도록 학습시켰을 때 시험한 과제에서 그 표현이 관찰된 확률과 어느 정도 맞았다는 연구가 있습니다.[5] 그래도 독자마다 같은 말을 다르게 이해할 수 있습니다. IPCC의 확률 표현을 여러 나라에서 조사했을 때도 사람들이 해석한 의미가 의도와 다른 경우가 많았습니다.[6] 익숙한 단어라고 모두 같은 뜻으로 받아들이지는 않습니다.

‘근거 있음’, ‘잠정적’, ‘미해결’ 같은 표시를 반복해서 쓴다면 뜻을 간단히 정의합니다. 근거의 질을 나타내는지 사건이 일어날 가능성을 나타내는지 밝힙니다. 방법상 ‘가능성이 높음’을 수치 범위로 정했다면 그 말을 쓰는 곳에 범위도 보여 줍니다. 근거 설명도 가까이 둬야 독자가 판단할 수 있습니다.

(06)

일어날 가능성과 대응 방법을 나눕니다

작은 불편이 생길 가능성 60%와 되돌릴 수 없는 피해가 생길 가능성 60%에는 다른 대응이 필요합니다. 확신만으로 행동을 정할 수는 없습니다. 판단이 틀렸을 때와 기다렸을 때의 비용, 행동을 되돌릴 수 있는지, 어떤 보호 조치가 있는지를 함께 봅니다.

추정과 권고를 따로 씁니다. 가상의 프로젝트에서 “이 패턴이 반복될 가능성을 65~75%로 추정합니다”는 예상입니다. “피해를 제한할 수 있고 두 주 안에 결과를 확인할 수 있으니 작은 규모로 시범 운영해 봅니다”는 행동의 이유입니다. 둘을 나누면 다른 사람이 추정치와 시범 운영의 판단 근거를 각각 검토할 수 있습니다.

약한 신호가 인터뷰 한 번이나 작은 시험의 이유는 될 수 있어도 전면 도입을 뒷받침하지는 못할 수 있습니다. 근거가 부족하면 비용이 큰 확대를 멈출 수 있지만 앞으로도 절대 작동하지 않는다고 입증된 것은 아닙니다. 현실적으로 확인할 수 있는 것 중 무엇이 선택에 가장 큰 영향을 줄지 묻습니다. 다음 조사를 왜 해야 하는지 분명해집니다.

(07)

‘모르겠습니다’ 다음에 할 일을 알립니다

근거가 부족하다면 이유를 말합니다. 기록이 빠졌으면 찾아야 하고, 질문이 모호하면 뜻을 확인해야 합니다. 결과가 어긋나면 비교하고, 현재 방법으로 판단할 수 없는 질문이면 다른 접근이나 자격을 갖춘 검토자가 필요합니다. 아직 확실한 답을 못 한다는 점은 같아도 다음 할 일은 다릅니다.

여러 AI 답변의 의미를 비교해 일관되지 않고 지어냈을 가능성이 있는 주장을 찾는 연구가 있습니다.[7] 로봇의 행동 계획을 다룬 다른 연구는 기존 사례를 바탕으로 예측의 불확실성을 평가하는 conformal prediction을 이용해 언제 사람에게 도움을 요청할지 정합니다. 이 방법의 통계적 보장은 연구에서 명시한 가정이 성립할 때 적용됩니다.[8] 각각 특정 문제를 다루는 방법입니다. 여러 답이 같은 잘못된 믿음을 공유할 수도 있고, 통계적 보장이 다른 집단이나 과제에 자동으로 적용되지도 않습니다.

시스템이 얼마나 자주 답하는지와 그 답이 얼마나 자주 틀리는지를 함께 봅니다. 답을 보류해 오류가 줄어드는 이점이, 사람이 검토할 일이 늘어나는 부담보다 큰지 확인합니다. 특히 언어와 사용자 집단별로 어떤 사례를 보류하는지 살핍니다. 답하지 못하는 사례가 많다면 불확실한 답을 강요하기보다 근거나 사람의 지원을 보완합니다. 보류한 사례에는 처리 경로와 담당자, 예상 응답 시간을 정해 줍니다.

쓸모 있는 ‘모르겠습니다’는 부족한 것과 다음 확인할 일을 알려 줍니다.
(08)

무엇이 나오면 판단을 바꿀지 밝힙니다

추정은 특정 시점에 아는 내용을 반영합니다. 어떤 근거가 나오면 판단을 강화하거나 약화하거나 뒤집을지 적습니다. 주제를 전반적으로 다시 읽기보다 새 기록 하나, 다른 집단의 결과, 빗나간 예측이 더 중요할 수 있습니다.

중요한 추정치와 근거, 비교에 쓴 사례, 결과 확인 담당자를 날짜와 함께 기록합니다. 결과가 나오면 설명을 고치기 전에 원래 추정과 비교합니다. 이전 버전도 남겨야 확신이 타당했는지 무엇이 달라졌는지 볼 수 있습니다.

마지막에는 지금 근거로 뒷받침할 수 있는 내용과 남은 불확실성, 그 상태에서 취할 만한 행동을 설명합니다. 다음에 확인할 일과 재검토 시점도 밝힙니다. 독자가 한계를 알고 행동하며 언제 방향을 바꿔야 할지 알아볼 수 있게 합니다.