(01)

듣는 방식에 따라 알게 되는 내용이 달라집니다

참여자가 짧게 답한 뒤 잠시 멈추고 “사실 제가 하려던 말은 조금 달라요”라고 합니다. 인터뷰어가 기다릴지, 더 물을지, 다음 질문으로 넘어갈지에 따라 이어지는 이야기가 달라질 수 있습니다. 녹취록에는 말이 남지만 그 사람이 무엇을 털어놓을지 결정한 과정이 모두 담기지는 않습니다.

AI는 질문 초안을 쓰고 음성을 글로 옮기고 구절을 번역하며 발언을 묶는 방법을 제안할 수 있습니다. Schroeder 등이 인터뷰한 연구자들은 유용한 가능성과 함께 개인정보, 편향, 도구 접근성, 참여자 자료 처리에 대한 우려를 말했습니다.[1] 실무에서는 내 연구에 도움이 될 작업과 결과를 확인할 방법을 구체적으로 정합니다.

AI를 쓰려는 작업마다 어떤 자료를 주고 어떤 결과를 받으며 누가 검토할지 적습니다. 참여자에게 무엇을 알려야 하는지도 묻습니다. 아낀 시간으로 더 잘 듣고 자료를 깊이 살필 수 있다면 가치가 있습니다. 그래도 개인정보를 보호하고 참여자의 이야기를 공정하게 전할 책임은 남습니다.

참여자가 잠시 멈추거나 다른 의견을 말할 수 있어야 합니다. 그 이야기를 듣고 연구자의 해석도 달라질 수 있습니다.
(02)

참여를 요청하기 전에 AI 사용을 설명합니다

“이 연구는 AI를 사용합니다”만으로는 설명이 부족합니다. 모집 안내문 초안에 쓰는 것과 녹음을 글로 옮기는 전사 서비스에 보내거나 개인의 경험을 분석하는 것은 다릅니다. 무엇을 녹음하고 어디로 보내며 누가 열람하는지, 얼마나 보관하고 서비스 제공자가 모델 개선에 쓸 수 있는지 알립니다. 연구에서 제공할 수 있는 범위 안에서 각 AI 활용에 동의할지 선택할 수 있게 하고, 거절하면 참여에 어떤 영향이 있는지도 설명합니다.

모집 전에 이 계획을 확인합니다. 가상의 녹음 자료로 저장, 전사, 분석, 내보내기, 삭제까지 경로를 따라가 봅니다. 약속하려는 참여 철회 절차를 도구가 지원하는지 확인하고 한계도 설명합니다. 연구가 허용하는 한 식별 정보와 연구 자료를 일찍 분리합니다.

합의한 활용과 제한을 연구 계획에 적고 승인이 필요한 일에는 검토자를 정합니다. Schroeder 등의 연구에서 일부 연구자는 기밀성 우려로 참여자 자료를 상용 언어 모델에 공유하지 않았습니다.[1] 안내문 준비에 괜찮은 도구라도 인터뷰 자료 자체에는 맞지 않을 수 있습니다.

(03)

가상 참여자의 답을 증언으로 쓰지 않습니다

AI에 참여자 역할을 시키면 그럴듯한 답이 곧바로 나옵니다. 질적 연구자 19명이 참여한 연구에서도 처음에는 익숙한 주제가 나타났습니다. 하지만 대화를 이어가며 구체적인 내용과 깊이가 부족하다는 문제가 드러났습니다. 가상 참여자는 동의하거나 스스로 선택하고 자신을 묘사한 방식에 이의를 제기할 수도 없었습니다.[3]

생성된 인물에는 누군가의 경험에 대한 가정이 담깁니다. 그 사람이 실제로 겪은 일을 알려 주지는 못합니다. 연구자가 사람들이 서비스를 피하는 이유를 복잡한 신청서 때문이라고 생각한다고 해 보겠습니다. 실제 참여자는 예전에 겪은 일 때문에 그 기관에 연락하는 것 자체가 두려웠다고 말할 수 있습니다. 실제 참여자의 말을 들어야 이런 예상 밖의 경험을 알고 연구 방향도 다시 살필 수 있습니다.

AI는 모집 문구를 검토하고 확인할 번역 초안을 만들거나 선별 질문에 깔린 가정을 찾는 데 도움을 줄 수 있습니다. 간단한 모집 현황표로 빠진 경험도 확인할 수 있습니다. 말투로 민감한 특성을 추측하거나 누구를 믿을지 정하지 않습니다. 빠진 집단은 추가로 모집하거나 한계로 밝힙니다. 생성한 인용문으로 채우지 않습니다.

그럴듯한 생성 답변은 누군가의 경험을 입증하는 자료가 아닙니다.
(04)

대화 중에는 참여자에게 집중합니다

자동 인터뷰는 작은 팀이 한 사람씩 만날 때보다 많은 사람과 대화할 수 있습니다. Geiecke와 Jaravel은 음성 인터뷰를 포함한 AI 주도 인터뷰를 연구하고 여러 활용 사례에서 유망한 품질 평가를 보고했습니다.[2] 적절한 조건에서 시도해 볼 근거입니다. 모든 주제와 사람, 민감한 이야기에 똑같이 잘 맞는다는 증거는 아닙니다.

참여자가 끝까지 마쳤는지만 보지 말고 인터뷰어의 대응을 시험합니다. 후속 질문이 직전 답을 반영하나요? 동의하지 않을 여지를 주나요? 말을 정정하거나 모른다고 답할 때, 괴로워하거나 침묵하거나 참여를 철회할 때 어떻게 되는지 봅니다. 답변의 내용과 함께 오해와 중도 이탈을 집단별로 검토합니다.

사람이 진행하는 인터뷰에서도 AI 제안이 계속 뜨면 참여자에게서 주의가 멀어질 수 있습니다. 실시간 보조를 쓴다면 설명하고 역할을 좁힙니다. 시간 확인이나 한 주제가 끝난 뒤 빠진 항목을 알려 주는 정도로 정할 수 있습니다. 멈추거나 기다리거나 질문지에서 벗어날 때는 연구자가 판단합니다. 동의가 철회되거나, 괴로움에 대응해야 하거나, 시스템 오류를 고쳐야 하거나, 도구 때문에 집중해서 듣기 어려워지면 자동화를 멈춥니다.

(05)

녹취록을 실제 발언과 대조합니다

자동 녹취록은 초안입니다. 이름을 놓치고 전문 용어를 바꾸거나 겹친 말을 합칠 수 있습니다. 멈춤이나 고쳐 말한 부분이 사라지기도 합니다. 여러 언어를 오가는 발언은 글만 보고 확인하기 특히 어렵습니다. 녹취록에 들어간 오류가 분석과 최종 인용에도 들어갈 수 있습니다.

오류가 어떤 화자에게 더 많이 생길 수도 있습니다. 2020년 연구는 상용 음성 인식 시스템 다섯 개를 흑인 화자 73명과 백인 화자 42명의 대화로 시험했습니다. 평균 단어 오류율은 각각 0.35와 0.19, 즉 35%와 19%였습니다.[4] 그 연구의 결과이며 현재 모든 전사 도구의 성적은 아닙니다. 내 연구의 화자와 녹음 조건에서도 확인하고 오류가 더 예상되는 곳을 더 검토해야 하는 이유를 보여 줍니다.

화자 집단별 평균 단어 오류율

2020년 연구 · 상용 음성 인식 시스템 5개

흑인 화자 · 73명35%
백인 화자 · 42명19%
그림 02평균 단어 오류율은 각각 35%와 19%였습니다. 전체 평균만으로는 누구의 발언을 더 많이 고쳐야 하는지 알 수 없습니다. 출처: Koenecke 외(2020), 본문 [4]. Koenecke et al., 2020 ↗

승인된 보관 환경에서 녹음과 시간 표시가 있는 녹취록을 연결합니다. 불분명한 구절, 겹친 말, 분석에 중요한 멈춤, 수정한 곳을 표시합니다. 공개하기 전에 모든 인용문을 녹음과 대조합니다. 중요한 해석이라면 앞뒤 대화도 다시 듣습니다. 한 문장만으로는 그 사람이 뜻한 바를 알기 어려울 수 있습니다.

녹취록의 오류가 연구 결과가 되기 전에 녹음을 확인합니다.
(06)

번역할 때도 원어 자료를 함께 둡니다

번역이 유창해도 뜻을 놓칠 수 있습니다. 정중한 거절, 친족 호칭, 일상적인 비유가 보고서의 언어와 정확히 대응하지 않을 수 있습니다. Van Nes 등은 한 언어로 수행한 연구를 다른 언어로 출판할 때 번역이라는 해석 과정이 더해진다고 설명합니다.[5] 자연스럽게 읽히면서 참여자의 뜻도 보존해야 합니다.

원어 녹취록 옆에 번역문을 두고 서로 대응하는 구절에 같은 번호나 식별자를 붙입니다. 여러 뜻으로 읽히는 말과 해당 번역을 고른 이유를 적습니다. 핵심 결과를 뒷받침하는 구절은 두 언어를 아는 연구자가 검토합니다. 가능하면 원어로 분석을 시작해 초기 번역 때문에 해석이 좁아지지 않게 합니다.

AI에 다른 번역안을 제안하게 해 비교할 수 있습니다. 여러 모델의 의견이 같다고 다수결로 의미가 정해지지는 않습니다. 원어를 남기고 설명하는 편이 나을 때도 있습니다. 보고서에는 인터뷰와 분석에 쓴 언어, 번역한 사람, 중요한 구절을 확인한 방법을 밝힙니다.

(07)

왜 그 해석을 골랐는지 설명합니다

연구자는 구절에 담긴 의미를 짧은 이름표로 표시하곤 합니다. 이 이름표를 code, 이름표를 붙이는 작업을 coding이라고 합니다. 이름표 목록만으로 연구 결과가 완성되지는 않습니다. Reflexive thematic analysis에서는 자료를 읽으며 연구자의 질문과 지식, 배경이 해석에 어떤 영향을 주는지 살피고 분석할 주제를 구성합니다.[7] AI가 만든 목록은 이런 선택을 검토하기도 전에 작업이 끝난 것처럼 보이게 할 수 있습니다.

AI에 제안을 요청하기 전에 다양한 자료 일부를 직접 읽고, 그 용도로 승인된 자료만 사용합니다. 임시로 붙인 이름표와 관련된 구절 찾기, 두 해석 비교하기, 주제에 반하는 이야기 찾기 등을 맡길 수 있습니다. 구절의 식별자를 요구하고 제안을 쓰기 전에 전체 이야기를 다시 읽습니다. 이 과정을 모든 연구에 그대로 적용하기보다, 내 분석 방법에 맞는 단계만 골라 활용합니다.

공개 모델 여섯 개와 사람의 코딩을 비교한 연구에서 사람은 복잡한 문장에서도 일관된 성과를 보였고, 모델은 복잡한 문장보다 단순한 문장에서 더 나은 성과를 보였습니다. 모델이 붙인 이름표가 기준 답과 같아도 전문가의 품질 평가는 낮은 경우가 있었습니다.[6] 일치한 이름표 수만 세지 말고 해석을 검토해야 할 이유입니다. 유용한 의견 차이를 기록하고 왜 그 주제를 보고서에 넣는지 설명합니다. 모호하거나 감정이 복잡한 대목은 특히 살펴봅니다.

제안된 주제에는 근거와 연구자의 설명이 필요합니다.
(08)

독자와 참여자가 이해할 수 있게 결과를 전합니다

참여자에게 녹취록 수정이나 해석 검토, 다른 방식의 의견 제시 기회를 줄지 생각합니다. 적절한 방식은 연구 방법과 관계에 따라 달라집니다. 검토로 잘못된 인용이나 빠진 맥락을 찾을 수 있지만 진실이 자동으로 확정되지는 않습니다. 참여자끼리 의견이 다르거나 설명을 바꾸거나 추가 참여를 거절할 수도 있습니다.

인터뷰와 포커스 그룹의 보고 점검표인 COREQ는 연구팀과 방법, 맥락, 분석을 설명하도록 합니다.[8] 중요한 AI 활용도 같은 수준으로 밝힙니다. 맡긴 일과 도구·버전, 입력한 자료, 연구 환경 밖으로 자료가 나갔는지, 사람이 무엇을 확인했는지를 적습니다. 도구를 쓰면서 분석이나 결과가 달라진 부분도 설명합니다.

보고서와 함께 자료 처리도 마칩니다. 합의한 보관·삭제 방식을 따르고 임시 사본을 지우며 나중에 재사용할 때의 담당자를 정합니다. 동의와 연구 계획이 허용하는 기록만 남깁니다. 독자가 참여자의 말에서 결과에 이른 과정을 따라갈 수 있어야 하고, 참여자에게 약속한 보호 조치를 지키고 안내한 선택권을 보장해야 합니다.