Whisper 개요
Whisper 개요
Whisper는 OpenAI가 공개한 범용 음성 인식 모델이에요. 다양한 종류의 오디오로 대규모 학습을 했고, 여러 작업을 한 번에 수행하는 멀티태스킹 모델이라는 게 핵심이에요.
출처: openai/whisper
Whisper는 대규모의 다양한 오디오 데이터로 학습된 범용 음성 인식 모델이에요. 여러 언어의 음성 인식, 음성 번역, 언어 식별을 한 모델이 동시에 처리할 수 있는 멀티태스킹 모델이죠.
아키텍처는 트랜스포머 시퀀스-투-시퀀스 모델이에요. 다국어 음성 인식, 음성 번역, 구어 언어 식별, 음성 활동 감지(VAD) 같은 여러 작업을 하나의 토큰 시퀀스로 표현해서 디코더가 예측하도록 학습했어요. 그래서 여러 단계로 나뉘던 전통적인 음성 처리 파이프라인을 하나의 모델로 대체할 수 있어요.
이런 멀티태스킹 학습 방식은 여러 특수 토큰(task specifier나 classification target)을 사용하는데, 여기서 등장하는 게 Whisper가 한 번에 하나의 모델로 여러 일을 처리할 수 있게 만든 비결이에요. 실제 사용할 때는 이 세부 구조까지 알 필요 없이, 준비된 CLI나 파이썬 API로 결과를 바로 받아볼 수 있어요.