WhisperX 소개 — 정확한 타임스탬프 음성 인식
WhisperX 소개 — 정확한 타임스탬프 음성 인식
WhisperX 는 OpenAI Whisper 기반 ASR 에 단어 단위 타임스탬프와 화자 분리를 더한 라이브러리예요. large-v2 모델 기준 실시간의 70배 속도로 전사하면서, 각 단어가 언제 발화됐는지 정확히 알려줘요.
핵심 기능
- 배치 추론: large-v2 로 70x 실시간의 고속 전사.
- faster-whisper 백엔드: beam_size=5 로 large-v2 에 <8GB GPU 메모리만 필요.
- 정확한 단어 타임스탬프: wav2vec2 forced alignment 로 단어 단위 정확도 확보.
- 다중 화자 ASR: pyannote-audio 기반 화자 분리로 누가 말했는지 라벨.
- VAD 전처리: 환각(hallucination) 감소, WER 저하 없이 배칭.
Whisper 의 한계 극복
Whisper 는 자체적으로 높은 정확도의 전사를 제공하지만 타임스탬프가 발화 단위(utterance) 수준이라 몇 초 오차가 있을 수 있어요. WhisperX 는 강제 음소 정렬(forced phoneme alignment) 로 이것을 단어 단위로 정확하게 개선해요.
사용 예 (CLI)
whisperx audio.wav --model large-v2 --diarize --highlight_words True
더 알아보기 (Learn more)
출처: WhisperX GitHub