(01)

서비스를 쓰려는 사람의 상황에서 시작합니다

한 사람이 지역 서비스를 신청하는 방법을 AI에게 물었습니다. 답은 자연스럽지만 그 지역 기관에서는 발급하지 않는 서류를 요구합니다. 다른 사람은 올바른 안내를 받았지만 공용 휴대전화에서 필요한 파일을 올릴 수 없습니다. 두 경우 모두 언어는 지원하지만 하려던 일은 끝내지 못합니다.

언어 선택 메뉴만으로는 방언, 일상적인 말투, 여러 언어를 섞은 표현, 전문 용어를 얼마나 잘 이해하는지 알 수 없습니다. 현지 규칙이나 이용자의 기기에 맞는 답을 주는지도 알 수 없습니다. 특정 지역에서 서비스를 평가할 때는 언어와 함께 이런 조건을 설명합니다.

예를 들어 세금 질문에 정확히 답한다는 주장을 검증하려면 국가나 관할, 과세 연도, 납세자 유형, 언어, 과제를 정해야 합니다. 무엇을 오류로 볼지도 분명해야 합니다. 그래야 주장을 시험하고, 독자도 자신의 상황에 그 결과를 적용할 수 있는지 판단할 수 있습니다.

자연스러운 답도 실제로 쓰이는 곳에서 도움이 되어야 합니다.
(02)

일을 끝내는 데 무엇이 필요한지 알아봅니다

모델을 고르거나 시험 문항을 번역하기 전에 이용 과정을 적습니다. 말로 입력할지 글로 쓸지, 어떤 용어를 쓸지 확인합니다. 결과를 받아 주어야 하는 기관이나 담당자는 누구일까요? 기기, 인터넷 연결, 사생활 보호, 비용, 접근성, 필요한 도움도 살핍니다. 답이 틀리면 누가 손해를 보고 어떻게 바로잡을 수 있는지도 묻습니다.

질문마다 맞는 확인 방법을 고릅니다. 두 언어를 아는 검토자는 표현을, 현지 실무자는 절차를 확인할 수 있습니다. 실제 이용자는 어디서 막히는지 보여 줄 수 있습니다. 어느 방법도 모든 질문에 답하지는 못합니다. 언어 전문가의 검토로 휴대전화 파일 업로드가 되는지 알 수 없고, 소규모 사용자 조사로 전체 인구에서 문제가 얼마나 흔한지 알 수도 없습니다.

시험할 환경은 이용자 수뿐 아니라 무엇을 배워야 하는지도 고려해 고릅니다. 오류의 비용이 크거나, 개발할 때와 다른 언어 표현을 쓰거나, 기기와 통신에 제약이 있는 상황을 포함합니다. 누구를 포함하지 못했는지도 밝힙니다. ‘low-resource language’라고 부를 때는 어떤 데이터나 연구 자원이 부족한지 설명합니다. 자원이 부족한 것은 언어 자체의 한계가 아닙니다.

(03)

번역한 과제가 현지에서도 말이 되는지 봅니다

번역한 질문이 낯선 학제, 화폐, 행정 기관, 가족 관계를 전제할 수 있습니다. 단어를 모두 알아도 원래 독자에게는 익숙했던 배경지식이 필요할 수 있습니다. 사생활이나 동의 같은 개념도 직역만으로 충분히 설명되지 않을 수 있습니다.

Global MMLU는 42개 언어로 확장한 평가에서 이 문제를 살폈습니다. 논문에서 분류한 문항의 28%는 문화·지역·방언 지식을 요구했고, 지리적 언급은 주로 북미나 유럽에 집중됐습니다. 문화적 지식이 필요한 문항을 따로 평가하자 모델 순위도 달라졌습니다.[1] 영어 시험을 번역한 점수만으로는 모델이 현지 지식을 얼마나 잘 다루는지 알기 어렵습니다.

표현이 자연스러운지, 개념의 뜻이 유지되는지, 정답을 받은 사람이 필요한 일을 할 수 있는지 함께 확인합니다. 두 언어를 아는 검토자에게 버전을 비교해 달라고 하고, 실제 이용자에게 질문을 어떻게 이해했는지 물어봅니다. 다른 지역의 가정을 드러낼 사례도 포함합니다. 원래 언어로 다시 번역하면 표현이 달라진 곳을 찾을 수 있지만, 원래 과제가 현지에 적합한지까지 확인되지는 않습니다.

(04)

완료까지 드는 수고를 측정합니다

모델은 텍스트를 토큰이라는 단위로 처리합니다. 같은 정보라도 언어에 따라 토큰 수가 달라져 비용과 한 번에 넣을 수 있는 분량에 영향을 줍니다. 언어 구조가 다양한 22개 언어를 다룬 2023년 연구에서는 지원 언어 중 상당수에서 더 많은 토큰 요금을 내고도 더 낮은 품질의 결과를 받았습니다.[2] 당시 시험한 서비스에 관한 결과지만, 정확도만으로 비교해서는 부족한 이유를 보여 줍니다.

각 언어로 처음부터 끝까지 과제를 수행해 봅니다. 응답 시간, 실패, 재시도, 비용, 쓸 만한 결과까지 오간 대화 횟수를 기록합니다. 음성 인식, 타이핑, 글꼴, 문서 읽기, 이름, 주소, 날짜 형식도 확인합니다. 정돈된 질문에 잘 답하더라도 앞 단계에서 이용자의 실제 입력을 잘못 읽으면 도움이 되기 어렵습니다.

긴 문서와 긴 대화는 따로 살핍니다. 한 언어에서 토큰이 더 많이 필요하면 근거 자료가 더 일찍 잘릴 수 있습니다. 답을 고치거나 도움을 찾거나 다른 서비스로 옮기는 데 든 수고도 기록합니다. 요청 한 번의 표시 가격보다 수정까지 포함해 일을 마치는 데 든 비용을 비교합니다.

답을 고치는 수고까지 포함해 일을 마치는 데 드는 시간과 비용을 비교합니다.
(05)

현지에서 겪는 상황으로 시험을 만듭니다

실제 이용자와 실무자가 쓰는 양식, 질문, 용어, 실패 사례를 적절한 동의 아래 모읍니다. 도움이 되는 답을 받으면 무엇을 할 수 있어야 하는지, 시스템이 함부로 가정해서는 안 되는 것은 무엇인지 묻습니다. 다른 곳의 시험 문항 중 무엇을 번역할지는 이런 상황을 살핀 뒤 정합니다.

시험은 세 묶음으로 구성할 수 있습니다. 여러 환경에서 의미가 통하는 공통 과제, 현지 지식과 절차를 다루는 과제, 같은 목표에서 조건 하나를 바꾸는 비교 과제입니다. 문화적 지식이 필요한 질문은 따로 표시합니다. 그래야 종합 점수가 특정 문화에 대한 지식의 영향을 가리지 않습니다.

채점하기 전에 현지 검토자와 좋은 답의 기준을 합의합니다. 허용할 표현 차이, 필요한 근거, 위험한 조언, 도움을 요청해야 할 시점을 포함합니다. 선호하는 말투와 일치하는지보다 실제 과제에 도움이 되는지 판단합니다. 검토자끼리 의견이 다르면 서로 다른 지역, 역할, 경험 때문인지 살핍니다.

(06)

사람들이 실제로 쓰는 말과 글을 시험합니다

일상적인 말투, 방언, 높임말, 여러 문자의 혼용, 오타, 불완전한 문장, 오해를 고치는 표현을 포함합니다. 영어 방언 열 가지를 다룬 2024년 연구에서 각 방언을 모어로 쓰는 검토자들은 모델의 답변을 평가했습니다. 시험한 모델은 표준어가 아닌 방언에 답할 때 고정관념, 비하, 오해, 깔보는 태도를 더 많이 보였습니다.[3] 영어 전체에 점수 하나만 붙였다면 이런 차이가 가려졌을 것입니다.

안전성도 현지에서 별도로 확인해야 합니다. 같은 악의적 요청을 여러 언어로 옮겨 시험한 연구에서는 평가한 시스템이 low-resource language에서 위험하거나 질문과 무관한 답을 더 자주 했습니다.[4] 한 언어에서 시험한 보호 장치가 다른 언어에서도 작동한다고 가정할 수는 없습니다. 서비스에 쓰이는 언어 표현으로 적절한 거절, 불확실성 안내, 사람의 도움을 받는 경로를 시험합니다.

조건 하나를 살펴볼 수 있도록 사례를 짝지어 만듭니다. 격식체와 대화체, 현지 이름과 외국 이름, 한 언어와 여러 언어를 섞은 표현을 비교할 수 있습니다. 시스템이 무엇을 이해하고 질문하고 답하고 거절했는지, 누구에게 넘겼는지 봅니다. 동작이 달라지면 입력 인식, 지식 부족, 안전 규칙, 채점, 애플리케이션의 다른 부분 중 어디서 문제가 시작됐는지 조사합니다.

(07)

현지 참여자와 연구 방향을 함께 정합니다

모델에게 현지 주민 역할을 시킨다고 그 답이 현지의 견해를 대표하지는 않습니다. 중국어와 영어를 비교한 실험에서는 사회적 성향과 사고방식을 측정하는 응답에 체계적인 차이가 나타났습니다.[5] 언어가 모델의 행동을 바꿀 수 있다는 결과입니다. 어느 쪽 답도 그 언어를 쓰는 사람들의 견해라고 믿을 근거는 되지 않습니다.

같은 집단 안에서도 의견은 다릅니다. 모델 응답을 미국 여론 자료와 비교한 연구에서는 인구 집단별 견해와 상당한 차이가 나타났고, 특정 집단의 관점에서 답하라는 지시를 줘도 차이가 남았습니다.[6] 생성된 답은 질문을 미리 시험하거나 확인할 가정을 찾는 데 쓸 수 있습니다. 모집하지 못한 참여자의 실제 응답을 채울 수는 없습니다.

현지 참여자와 질문을 고르고 데이터를 만들며, 평가 기준과 결과 해석을 함께 정합니다. 실제 서비스에 써도 되는지 판단하는 과정에도 참여하게 합니다. 아프리카 언어의 참여형 번역 연구는 새 데이터셋과 30개 이상 언어의 벤치마크를 만들고, 그중 약 3분의 1에서 사람 평가를 진행했습니다. 정규 기계학습 교육을 받지 않은 참여자도 연구에 기여했습니다.[8] 완성된 번역을 검토해 달라고만 하지 말고 과제를 정하기 전부터 의견을 반영합니다.

현지 참여자와 번역뿐 아니라 연구할 질문부터 함께 정합니다.
(08)

어디까지 시험했는지 밝힙니다

시험한 언어와 표현 방식, 현지 과제, 이용 조건을 보고합니다. 번역한 질문과 현지에서 만든 질문을 구분하고, 누가 참여하고 답을 검토했는지 설명합니다. 완료율, 오류, 비용, 수정 수고에서 중요한 차이를 보여 줍니다. 아직 시험하지 못한 주요 환경도 적습니다.

NLLB 번역 프로젝트는 데이터 구축, 언어 식별, 모델 개발, 사람 평가를 결합해 200개 언어를 다뤘습니다.[7] 큰 성과이지만 특정 기관, 분야, 소통 방식에서 서비스가 작동하는지는 여전히 확인해야 합니다. 지원 언어 목록은 그런 질문을 시작할 곳을 알려 줍니다.

합의한 현지 기준을 충족한 용도로 사용 범위를 정하고, 불확실하거나 영향이 큰 사례는 사람의 도움을 받을 수 있게 합니다. 불만과 함께 완료, 재시도, 수정, 중도 이탈을 살핍니다. 불만이 적은 이유가 사람들이 서비스를 찾지 못했거나 끝내지 못했기 때문일 수도 있습니다. 모델, 규칙, 화면, 현지 관행이 바뀌면 근거를 다시 검토합니다.