(01)

점수와 함께 무엇을 알아보려 했는지 남깁니다

AI 도우미가 시험에서 72%를 기록했다고 가정해 보겠습니다. 몇 달 뒤 새 버전은 다른 답을 내놓습니다. 옛 점수는 당시 시험을 설명하지만 지금의 선택에는 도움이 되지 않을 수 있습니다. 결과와 함께 모델, 시험 자료, 설정, 날짜를 남겨 무엇에 관한 수치인지 알 수 있게 합니다.

이 문제는 오늘날의 언어 모델 이전에도 있었습니다. HAPI는 2020~2022년 상용 기계학습 서비스의 예측 170만 건 이상을 수집했습니다. 연구진은 시간에 따른 큰 변화를 발견했습니다. 일부 시험에서는 정확도가 떨어졌고, 전체 점수가 비슷해도 오류가 나타나는 데이터 유형은 달라졌습니다.[1] 같은 제품 이름이 같은 동작을 보장하지 않았습니다.

점수 옆에 연구로 무엇을 알게 됐는지 적습니다. 어떤 과제가 쉬워졌을까요? 누가 도움을 받았고, 어떤 오류는 여전히 검토가 필요했을까요? 어떤 근거가 나오면 그 설명이 달라질까요? 이런 질문이 있으면 원래 모델을 더 이상 쓸 수 없어도 후속 연구에서 확인할 것이 남습니다.

결과가 달라진 이유를 이해할 수 있도록 질문과 비교 기준을 남깁니다.
(02)

근거가 실제로 보여 주는 만큼 말합니다

좋은 답 하나는 그 시도에서 무슨 일이 있었는지 보여 줍니다. 여러 사례를 시험하면 그 조건에서 모델이 어떻게 작동하는지 더 알 수 있습니다. 업무가 나아졌는지 알려면 사람이 검토와 수정까지 포함해 일을 마치는 과정을 조사해야 합니다. 조직의 결정이 좋아졌다고 말하려면 그 결정에 관한 근거가 필요합니다.

이 주장들을 구분합니다. 정보를 정확히 추출하는 모델이 검색 시간은 줄여도 최종 결정까지 개선하지는 못할 수 있습니다. 초안을 빨리 만드는 대신 나중에 확인할 일이 늘어날 수도 있습니다. 주장하려는 결과를 직접 측정하고, 좁은 시험으로 더 넓은 효과를 입증하려 하지 않습니다.

예를 들어 정해진 문서 검토 과정에서 초벌 정보 추출로 수작업 검색은 줄었지만 예외 판단에는 전문가가 필요했다는 결과는 유용합니다. 후속 모델에서도 같은 관계를 시험할 수 있기 때문입니다. 왜 개선됐다고 보는지와 그 근거를 설명합니다. 어떤 결과가 나와도 맞는 넓은 주장보다 다음에 확인할 대상을 분명히 해 줍니다.

(03)

같은 일을 얼마나 잘 마쳤는지 비교합니다

모델이 바뀌어도 의미가 통하는 지표를 씁니다. 완료한 사례, 해결한 요청, 승인된 결정, 정해진 업무에 든 시간을 비교할 수 있습니다. 토큰과 메시지 수는 시스템의 동작을 설명하는 데 도움이 되지만, 메시지가 줄었다고 일을 더 잘 마친 것은 아닐 수 있습니다.

METR의 time horizon 연구가 한 가지 예입니다. 이 연구는 AI가 정해진 성공 확률로 완료할 수 있는 과제의 길이를 숙련된 사람의 수행 시간으로 나타냅니다.[4] AI가 실제로 실행된 시간을 뜻하지 않습니다. 같은 과제 기준과 성공 확률로 여러 시스템에 같은 질문을 던질 수 있습니다.

교체 모델을 시험하기 전에 완료 조건, 필요한 품질, 비용, 허용할 실패를 정합니다. 절반의 확률로 성공하는 시스템은 사람이 면밀히 감독하면 유용할 수 있지만 무인 업무에는 맞지 않을 수 있습니다. 과제 정의가 바뀌면 옛 기준과 새 기준으로 모두 채점할 사례를 남깁니다. 그래야 정의가 달라진 것과 성능이 나아진 것을 구분할 수 있습니다.

같은 과제와 필요한 성공 확률을 기준으로 모델을 비교합니다.
(04)

기존 시험을 남기고 현재 사례를 더합니다

같은 시험을 유지하면 비교할 기준이 생기지만 문항이 낡거나 모델에 너무 익숙해질 수 있습니다. 시험 전체를 바꾸면 점수 변화가 모델 때문인지 새 질문 때문인지 알기 어렵습니다. 비교용 고정 사례와 현재 업무에서 얻은 새 사례를 함께 둡니다.

Dynabench에서는 사람이 이해하고 풀 수 있지만 현재 모델은 틀리는 사례를 만듭니다. LiveBench는 최근 출처에서 새 질문을 뽑고 객관적으로 확인할 수 있는 답으로 평가합니다.[2][3] 모델이 바뀌어도 시험에서 배울 것이 남게 하는 두 가지 방법입니다. 어느 쪽을 쓰든 그 시험이 무엇을 측정하는지 이해해야 합니다.

각 묶음의 목적을 분명히 합니다. 바꾸지 않은 사례는 과거와 비교하고, 새 사례는 현재 조건을 확인하며, 어려운 사례는 알려진 실패 유형을 시험합니다. 정답이나 과제가 더 이상 유효하지 않아 뺀 문항도 기록합니다. 묶음별 결과를 따로 보고해야 새 문항이 쉬워져 전체 점수가 오른 일을 성능 향상으로 오해하지 않습니다.

(05)

실제로 일하는 사람에게 생긴 변화를 봅니다

Preregistration을 거친 전문직 글쓰기 실험에서는 ChatGPT를 사용할 수 있을 때 평균 작업 시간이 40% 줄고 평가된 품질이 18% 높아졌습니다.[5] 시험한 사람, 과제, 도구에 관한 결과입니다. 후속 연구에서는 같은 종류의 도움이 여전히 유용한지 물을 수 있지만, 모든 새 모델에서 같은 비율의 개선을 기대할 수는 없습니다.

고객지원 담당자 5,000명 이상을 다룬 현장 연구에서는 시간당 해결 건수가 평균적으로 늘었고 경험이 적은 직원의 이득이 더 컸습니다. 가장 숙련된 직원은 속도가 조금 빨라진 반면 품질은 조금 낮아졌습니다.[6] 교체 시스템에서도 누가 도움을 받고 업무가 어떻게 달라지는지 함께 봐야 합니다. 빨리 처리하는 것만으로 더 좋은 지원이 되지는 않습니다.

컨설턴트 대상 실험에서는 AI가 일부 과제에 도움을 줬지만 시스템의 능력을 벗어난 과제에서는 성과를 떨어뜨렸습니다.[7] 어떤 과제였고 사람들이 도구를 믿고 사용할지 어떻게 판단했는지 남깁니다. 새 모델에서 잘하는 범위가 넓어질 수 있어도 어디서 도움이 불확실해지는지는 다시 찾아야 합니다.

누가 도움을 받고 어떤 일이 나아지며 어디서 문제가 생기는지 확인합니다.
(06)

교체할 때의 비교 방법을 미리 정합니다

현재 시스템을 쓸 수 있을 때 고정 사례, 새 사례, 중요한 과거 실패를 고릅니다. 기존 시스템과 후보 시스템의 도구, 접근 권한, 시간, 사람의 지원을 비교할 수 있게 맞춥니다. 완료한 업무, 신뢰성, 비용, 대기, 수정 수고, 심각한 오류를 비교합니다. 일반적인 출력 변동을 알 수 있을 만큼 반복하고, 가능하면 검토자가 어느 버전의 결과인지 모르게 평가합니다.

시간에 따른 모델 선택 연구는 조건이 바뀔 때 최근 자료와 과거 자료를 어떻게 함께 쓸지 다룹니다. adaptive rolling window는 평가에 사용할 과거 데이터의 기간을 상황에 맞게 조절하는 방법입니다.[9] 실무에서도 과거와 현재의 자료를 함께 봅니다. 과거 사례는 잃어버린 능력을, 현재 사례는 지금 처리해야 할 일을 보여 줍니다. 적절한 비중은 과제에 따라 정합니다.

어떤 결과가 나오면 교체할지 미리 결정합니다. 후보가 새 사례에서는 좋아지고 옛 사례에서는 나빠졌다면 옛 사례가 지금도 중요한지 봅니다. 두 시스템이 같은 심각한 오류를 내면 모델과 함께 공유한 데이터와 도구도 조사합니다. 같은 오류가 같은 원인을 입증하지는 않습니다. 새 시스템이 다른 방식으로 문제를 풀면 도움이 되는 이유에 대한 설명도 고칩니다.

(07)

모델 외에 무엇이 달라졌는지 찾습니다

모델, 애플리케이션, 이용자가 바뀌어서 결과가 달라질 수 있습니다. 과제의 정답이 바뀌었을 수도 있습니다. 새 정책이 생기면 모델이 전과 똑같이 답해도 틀린 답이 됩니다. 모델 버전과 함께 출처 자료, 화면, 절차, 사람의 업무 방식이 바뀐 내용도 기록합니다.

WILDS 벤치마크는 병원, 지역, 시기 등 환경이 달라질 때 기계학습 시스템에 생기는 성능 격차를 보여 줍니다.[8] 비교할 때 일부 입력은 그대로 남기고 현재 환경의 사례도 모읍니다. 성능이 왜 달라졌는지 설명하려면 무엇을 일정하게 유지했는지부터 알아야 합니다.

이용자에게 중요한 사례 유형, 결과, 수정, 도움 요청, 비용, 불만을 추적합니다. 전체 점수가 유지돼도 중요한 집단은 따로 봅니다. HAPI에서도 평균이 비슷한 사이 데이터 유형별 오류가 달라질 수 있었습니다.[1] 이런 확인으로 이전 결론이 더 이상 적용되지 않는 시점을 알아챌 수 있습니다.

(08)

언제 다시 확인해야 하는지 독자에게 알립니다

보고서 끝에 과제, 사람, 기간, 시스템 버전, 비교 대상, 결과를 적습니다. 결과가 적용되는 범위와 불확실한 부분을 설명합니다. 새 모델, 정책, 화면, 가격, 이용자 집단, 심각한 실패 등 어떤 변화가 생기면 재검토할지도 밝힙니다.

결론의 현재 상태를 분명히 합니다. 새 시험에서도 뒷받침됐는지, 수정이 필요한지, 더 나은 설명으로 대체됐는지, 이제는 다루지 않는 과제에 관한 것인지 구분합니다. 재검토할 때가 됐는데 아직 하지 못했다면 현재도 유효한지는 모른다고 적습니다. 옛 보고서가 계속 공개돼 있다는 사실은 주장이 유지된다는 근거가 아닙니다.

이전 버전을 보관하고 근거, 해석, 권고한 행동이 어떻게 달라졌는지 설명합니다. 독자가 어떤 부분은 여전히 유용하고 다른 부분은 왜 고쳤는지 알 수 있어야 합니다. 다음 검토자에게 답을 다시 확인할 방법을 남기면 모델이 바뀌어도 연구를 이어 쓸 수 있습니다.