WhisperX 소개 — 정확한 타임스탬프 음성 인식

WhisperX 소개 — 정확한 타임스탬프 음성 인식

WhisperX 는 OpenAI Whisper 기반 ASR 에 단어 단위 타임스탬프와 화자 분리를 더한 라이브러리예요. large-v2 모델 기준 실시간의 70배 속도로 전사하면서, 각 단어가 언제 발화됐는지 정확히 알려줘요.

핵심 기능

  • 배치 추론: large-v2 로 70x 실시간의 고속 전사.
  • faster-whisper 백엔드: beam_size=5 로 large-v2 에 <8GB GPU 메모리만 필요.
  • 정확한 단어 타임스탬프: wav2vec2 forced alignment 로 단어 단위 정확도 확보.
  • 다중 화자 ASR: pyannote-audio 기반 화자 분리로 누가 말했는지 라벨.
  • VAD 전처리: 환각(hallucination) 감소, WER 저하 없이 배칭.

Whisper 의 한계 극복

Whisper 는 자체적으로 높은 정확도의 전사를 제공하지만 타임스탬프가 발화 단위(utterance) 수준이라 몇 초 오차가 있을 수 있어요. WhisperX 는 강제 음소 정렬(forced phoneme alignment) 로 이것을 단어 단위로 정확하게 개선해요.

사용 예 (CLI)

whisperx audio.wav --model large-v2 --diarize --highlight_words True

더 알아보기 (Learn more)

출처: WhisperX GitHub