# AI 음성 텍스트 변환 원리: 음향 모델부터 화자 분리까지

URL: https://aginsi.com/ko/journal/ai-eumseong-tekseuta-byeonhwan-wonri
Type: blog
Locale: ko
Published: 2026-09-03
Updated: 2026-09-04

---

> AI 음성 텍스트 변환은 음향 모델과 언어 모델로 이루어진 파이프라인입니다. 깨끗한 음성에서 WER 5% 미만이 가능하지만 실제 회의 환경에서는 15-25%로 떨어집니다.

AI 음성 텍스트 변환 원리는 두 개의 분리된 시스템이 직렬로 연결된 파이프라인으로 설명할 수 있다. 음향 모델이 음파를 음소(phoneme)로 변환하고, 언어 모델이 그 음소 시퀀스를 실제 단어로 해석한다. 변환 품질은 거의 전적으로 오디오 선명도와 모델 학습 코퍼스 규모에 달려 있다. 깨끗한 단일 화자 녹음에서는 단어 오류율(WER) 5% 이하가 가능하지만, 소음이 있는 6인 회의 환경에서는 같은 도구로도 15-25%까지 떨어진다.

이 기술은 새로운 것이 아니다. 자동 음성 인식 시스템은 1970년대부터 존재했다. 변화의 분기점은 2022년 전후로, 트랜스포머 기반 모델이 표준이 되면서부터다. 이전 시스템은 오디오를 한 프레임씩 순차 처리했기 때문에 문장 맥락을 활용하지 못했다. 동음이의어와 전문 용어 오류가 속출했던 이유다. 지금의 개선은 실질적이지만, 벤더 마케팅이 암시하는 것보다는 제한적이다.

## 말을 파싱하는 일이 생각보다 어려운 이유

인쇄된 텍스트는 이미 분절되어 있다. 단어 사이의 공백, 구 경계의 구두점, 문장 시작의 대문자. 음성 언어에는 이런 신호가 없다. 연속적인 음향 정보의 흐름을 의미 단위로 잘라내는 작업 자체가 모든 하위 처리의 전제 조건이다.

예를 들어 화자가 "recognize speech"를 일반적인 대화 속도로 발음할 때, 두 단어 사이의 음향 신호에는 침묵도, 간격도, 구분자도 없다. 모델은 확률적 단서를 통해 경계를 추론해야 한다. 마지막 자음의 지속 시간, 음고의 변화, 문맥상 자주 등장하는 단어 시퀀스에 대한 지식이 그 단서다. 일상적 표현에서는 이 방식이 잘 작동한다. 그러나 학습 단계에서 만나지 못한 신조어, 고유명사, 도메인 특수 어휘에서는 경계 오류가 전사 오류로 증폭된다.

말을 파싱하는 근본적인 어려움은 소프트웨어 버그가 아니다. 음성 언어의 속성이다. 이 제약을 이해하는 것이 어떤 전사 도구에 대해서도 합리적인 기대치를 설정하는 출발점이 된다.

![음향 모델 처리를 나타내는 컬러풀한 스펙트로그램 주파수 시각화](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/aginsi/2026-09/e702f0-img1.webp)

## 음향 모델: 파형에서 음소로

음향 모델은 첫 번째 변환을 담당한다. 원시 오디오 신호를 음소 시퀀스로 변환하는 것이다. 이 시스템은 단어를 '듣는' 것이 아니라 스펙트로그램을 '읽는다'. 스펙트로그램은 한 축이 시간, 다른 축이 주파수인 2차원 오디오 표현이다. 훈련된 신경망이 이 스펙트로그램을 스캔하며 음소 시퀀스에 확률을 할당한다.

실제 운용에서 음향 모델 성능을 결정하는 세 가지 요소가 있다.

- 
**샘플 레이트와 비트 심도**: 품질이 낮은 오디오는 모델이 훈련받은 주파수 정보를 잘라낸다. 스펙트럼 표현에 공백이 생긴다.

- 
**신호 대 잡음 비율(SNR)**: 배경 소음은 경쟁하는 음소 후보를 만들어낸다. 개방형 사무공간이 특히 불리한 환경이다.

- 
**화자 편차**: 억양, 속도, 발음 방식이 스펙트로그램을 학습 분포에서 벗어나게 한다. 음소 할당의 신뢰도가 떨어진다.

음향 모델의 출력은 단어가 아니다. 확률 음소 래티스(lattice), 즉 가능한 음소 시퀀스의 가중 그래프다. 이 래티스를 다음 레이어가 해석한다. 음향 단계에서 발생한 오류는 하위에서 복합된다. 잘못 읽힌 음소가 항상 그럴듯한 오류 단어를 만드는 것은 아니다. 때로는 이후 수정이 재구성조차 어려운 비일관적 출력을 만든다.

## 언어 모델: 추측이 아닌 맥락으로 해결

언어 모델은 음소 시퀀스를 받아 이렇게 묻는다. 지금까지 이 문장에서 나온 모든 것을 고려할 때, 여기서 가장 확률 높은 단어는 무엇인가? 이 레이어에서 2022년 이후 통계적 방법에서 트랜스포머로의 전환이 실질적 차이를 만들었다.

이전 시스템은 앞선 두세 개 토큰에서 단어 확률을 계산했다. 트랜스포머 기반 언어 모델은 전체 가용 컨텍스트 창에 주목한다. 현재 구현에서는 단락 전체 이상이다. 실질적 결과는 동음이의어의 정확한 구분, 더 신뢰할 수 있는 구두점 삽입, 짧은 음향 실패를 맥락이 보완하는 복구 능력 향상이다.

이것이 해결하지 못하는 것은 도메인 어휘다. 일반 영어 오디오로 훈련된 모델은 "probit regression"이나 "grey literature synthesis"에 낮은 확률을 부여한다. 사회과학 연구자가 일상적으로 쓰는 용어들이다. 맞춤 어휘 업로드를 허용하거나 학술 및 법률 코퍼스로 파인튜닝된 도구가 이 격차를 줄인다. 전문 용어가 포함된 작업을 한다면 그 기능을 구체적으로 평가해야 한다. 일반 영어에서 WER 97%를 달성하고 실제 코퍼스에서 82%를 기록하는 도구는, 목적에 따라 82% 도구다.

![화자 레이블이 표시된 AI 전사 인터페이스를 보여주는 노트북이 있는 회의 테이블](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/aginsi/2026-09/536be8-img2.webp)

## 화자 분리: 실제로 중요한 단계

전사는 무엇을 말했는지를 알려준다. 화자 분리(diarization)는 누가 말했는지를 알려준다. 두 프로세스는 대부분의 현대 도구에서 병렬로 실행되지만, 기술적으로 별개의 시스템이며 실패 모드도 다르다. 그리고 화자 분리는 가장 중요한 상황에서 정확히 실패하는 경향이 있다.

화자 분리는 화자가 누구인지 알지 못한 채로 오디오 세그먼트를 화자 정체성으로 묶는다. 출력은 레이블이 붙은 텍스트다. "화자 1:", "화자 2:". 도구는 이들이 이나와 마르코스라는 것을 알지 못한다. 그 매핑은 음성 프로필 데이터베이스나 수동 편집이 필요하다. 괜찮은 마이크와 명확한 화자 분리로 진행된 양자 인터뷰라면 대부분의 수정을 건너뛸 수 있다. 12명이 참여하는 편집 회의에서 발화가 겹치는 경우, 전사본은 상당한 재구성이 필요하다.

일반적인 화자 분리 실패 상황:

- 
비슷한 기본 주파수를 가진 두 목소리, 특히 유사한 음역대에서 말하는 동성 쌍

- 
겹치는 발화: 시스템은 각 세그먼트를 단일 화자에 할당하므로, 겹치는 부분의 다른 목소리는 단순히 사라진다

- 
세그먼트 사이의 화자 임베딩을 변질시키는 가변 배경 소음으로 한 사람이 두 명의 별도 화자로 분할됨

문제는 회의 규모가 아니다. 분리의 문제다. 개별 마이크 세트를 잘 배치하는 것이 프리미엄 전사 서비스로 업그레이드하는 것보다 화자 분리 품질에 더 많이 기여한다.

## 발표된 정확도와 실제 소음 환경에서의 차이

도구 문서에서 가장 자주 접하는 기준값은 영어에서 WER 5% 미만이다. WER은 참조 전사 대비 대체, 삽입, 삭제를 계산한다. 5% 점수는 100개 단어 중 5개가 틀리다는 의미다. 그 수치가 어떤 녹음 조건에서 측정되었는지는 거의 명시되지 않는다.

실험실 기준값은 16kHz 단일 화자, 배경 소음 없음, 모델의 주요 학습 언어 조건에서 깨끗한 오디오를 사용한다. 개방형 사무공간, 대역폭이 일정하지 않은 화상 통화, 주변 소음 속에서 스마트폰으로 녹음한 현장 인터뷰에서는 같은 모델로 WER 15-30% 범위가 일반적이다. 발표된 수치와 관찰된 수치 사이의 격차는 제품 결함이 아니다. 학습 분포 외부에서 시스템을 운용하는 결과다.

![나무 책상에서 태블릿으로 전사본을 검토하는 헤드폰을 낀 연구자](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/aginsi/2026-09/a33eb4-img3.webp)

여기서 두 가지 관찰을 남겨둔다.

첫째, 녹음 환경의 품질이 도구 선택보다 분산의 더 많은 부분을 설명한다. 조용한 방과 기본 USB 콘덴서 마이크는 상위 도구 간 전환보다 수정 작업량을 더 안정적으로 줄인다. 환경 설정에 대한 투자가 구독 업그레이드보다 더 나은 효과를 낸다.

둘째, 비영어권 언어는 크게 뒤처진다. 스페인어, 프랑스어, 독일어, 중국어는 주요 모델에서 합리적으로 처리된다. 학습 코퍼스가 작은 언어, 많은 아프리카 언어, 지역 아랍어 변종, 소규모 유럽 언어는 기껏해야 대략적인 초안 수준의 출력을 낸다. 코퍼스가 그런 언어라면, 어떤 작업 흐름도 도구에 맡기기 전에 대표 샘플로 정확도를 검증해야 한다.

## AI 전사가 제 역할을 하는 곳, 격차가 남는 곳

양쪽을 직접적으로 말하겠다.

AI 전사가 작업 흐름에 통합할 만큼 충분히 잘 작동하는 상황:

- 
강의 및 컨퍼런스 녹음: 지배적인 단일 화자, 통제된 음향 환경, 사후 수정 허용

- 
정성 연구를 위한 양자 인터뷰: 일관된 화자 분리, 복구 가능한 전사, 용어집 업로드로 관리 가능한 전문 어휘

- 
회의 요약 및 액션 아이템 추출: 출력 속도가 이 활용 수준에서의 정확도 트레이드오프를 정당화

- 
접근성 자막: 맥락이 이해를 돕는 실시간 자막에서 근사치 정확도로 충분

격차가 측정 가능하고 인간 검토가 선택이 아닌 상황:

- 
법률 및 의료 문서: 전문 용어의 오류율이 전문적 기준을 상회하며, 잘못 읽힌 용어는 수정이 놓칠 수 있는 방식으로 의미를 바꾼다

- 
학습 분포 외부의 강한 억양 발화: 모델이 도메인 지식 없이는 식별하기 어려운 그럴듯한 오류 단어를 생성한다

- 
겹치는 발화가 있는 다자 원탁 회의: 전사본이 수정이 아닌 재구성을 필요로 하는 경우가 많다

## 전사 도구를 선택하기 전에 평가해야 할 것

WER은 시작점이지 결정 변수가 아니다. 연구 및 지식 작업에서 기준값이 포착하지 못하는 것들이 있다.

**맞춤 어휘 지원**: 학술 및 전문 분야는 지속적으로 새로운 용어를 생성한다. 도메인 용어와 고유명사 용어집을 받아들이는 도구는 명목상 더 높은 정확도의 일반 모델을 특정 코퍼스에서 능가할 것이다. 이 기능이 어떤 플랜 등급에서 제공되는지 확인하라.

**내보내기 형식 유연성**: 벤더 플랫폼 내부에만 저장된 전사본은 시간이 지남에 따라 복합되는 의존성을 만든다. 기존 주석 또는 분석 작업 흐름과 통합되는 일반 텍스트, SRT 또는 구조화된 JSON으로의 깔끔한 내보내기를 갖춘 도구를 선호하라.

**데이터 처리 및 보존 정책**: 민감한 인터뷰 출처, 미발표 연구 결과 또는 보호된 참가자 데이터를 다루는 경우, 벤더가 오디오 및 전사본 파일을 얼마나 오래, 어느 관할권에서, 어떤 법적 체계 하에 보유하는지 확인해야 한다. 이것은 부차적인 질문이 아니다.

**배치 처리 능력**: 녹음 파일 백로그가 있는 사람에게 여러 파일을 대기열에 넣고 야간에 처리하는 능력은 편의 기능이 아닌 작업 흐름의 전제 조건이다.

결국 선택하는 것은 추상적인 정확도가 아니라, 자신의 자료, 자신의 언어, 자신의 작업 흐름 제약에 맞는 정확도다. 그것을 확인하는 유일한 신뢰할 수 있는 방법은, 도구를 채택하기 전에 자신의 코퍼스에서 대표 샘플로 구조화된 테스트를 진행하는 것이다.

## FAQ

### AI 음성 텍스트 변환은 어떻게 작동하나요?

AI 음성 텍스트 변환은 두 단계 파이프라인으로 작동합니다. 음향 모델이 오디오 파형을 분석해 스펙트로그램으로 변환하고 음소 시퀀스에 확률을 할당합니다. 이후 언어 모델이 그 음소 시퀀스를 문맥을 고려해 가장 확률 높은 단어로 해석합니다.

### AI 전사의 단어 오류율(WER)은 얼마나 되나요?

깨끗한 단일 화자 영어 녹음에서는 WER 5% 미만이 가능합니다. 그러나 개방형 사무공간, 화상 통화, 현장 스마트폰 녹음 등 실제 환경에서는 같은 모델로도 WER 15-30% 범위가 일반적입니다. 벤더 발표 수치는 실험실 조건 기준임을 감안해야 합니다.

### 화자 분리(diarization)란 무엇이고 언제 실패하나요?

화자 분리는 누가 말했는지를 파악하는 기술로, 전사와 병렬로 실행되는 별도 시스템입니다. 비슷한 기본 주파수의 동성 목소리, 겹치는 발화, 가변 배경 소음 환경에서 자주 실패합니다. 겹치는 발화에서는 한쪽 목소리가 완전히 누락될 수 있습니다.

### AI 전사에서 도메인 전문 용어는 어떻게 처리되나요?

일반 코퍼스로 훈련된 모델은 학술 및 전문 용어에 낮은 확률을 부여해 오류를 냅니다. 맞춤 어휘 업로드 기능이나 해당 도메인 코퍼스로 파인튜닝된 도구가 이 격차를 줄입니다. 도구 선택 전에 맞춤 어휘 지원 여부와 제공 플랜 등급을 확인하는 것이 중요합니다.

### AI 전사 도구를 선택할 때 WER 외에 무엇을 봐야 하나요?

맞춤 어휘 지원, 내보내기 형식 유연성(일반 텍스트, SRT, JSON), 데이터 보존 정책(보관 기간, 관할권, 법적 체계), 배치 처리 능력을 평가해야 합니다. 가장 중요한 것은 자신의 실제 코퍼스 샘플로 직접 정확도를 검증하는 것입니다.

### 비영어권 언어에서 AI 전사 정확도는 어떤가요?

스페인어, 프랑스어, 독일어, 중국어는 주요 모델에서 합리적으로 처리됩니다. 그러나 학습 코퍼스가 작은 언어, 많은 아프리카 언어, 지역 아랍어 변종, 소규모 유럽 언어에서는 대략적인 초안 수준의 출력이 일반적입니다. 워크플로에 적용하기 전에 반드시 샘플 검증이 필요합니다.

### AI 전사를 반드시 인간이 검토해야 하는 경우는 어떤 상황인가요?

법률 및 의료 문서화에서는 전문 용어 오류율이 전문적 기준을 상회하므로 인간 검토가 필수입니다. 학습 분포 외부의 강한 억양 발화, 겹치는 발화가 많은 다자 원탁 회의 녹음에서도 전사본이 수정이 아닌 재구성 수준의 작업이 필요할 수 있습니다.