WhisperX README — 설치와 CLI 사용
WhisperX README — 설치와 CLI 사용
WhisperX 는 단어 타임스탬프와 화자 분리를 제공하는 고속 음성 인식 도구예요. 설치하고 CLI 로 바로 쓸 수 있어요.
설치
pip install whisperx
또는 개발 설치:
git clone https://github.com/m-bain/whisperX.git
cd whisperX && uv sync --all-extras --dev
CLI 사용 (영어, 화자 분리 포함)
whisperx audio.wav --model large-v2 --diarize --highlight_words True
--model large-v2: Whisper 모델 선택.--diarize: 화자 분리 → 화자 ID 라벨.--highlight_words True: 단어 강조(타임스탬프).
CPU/Mac 실행:
whisperx audio.wav --compute_type int8 --device cpu
지원 언어
음소 정렬 모델은 언어별이며, 기본으로 en, fr, de, es, it 은 torchaudio 파이프라인, 그 외 다수 언어는 Hugging Face 모델을 자동 선택해요.
주요 옵션
--condition_on_prev_text False(기본): 환각 감소.- GPU 메모리 부족 시
--compute_type int8등으로 완화.
연구·활용
INTERSPEECH 2023 에 채택됐고, 배칭·정렬·VAD 효과는 논문에서 확인할 수 있어요.
더 알아보기 (Learn more)
출처: WhisperX README