OpenAI Whisper — 음성을 텍스트로 만드는 음성 인식

OpenAI Whisper (음성 인식)

Whisper는 OpenAI가 만든 오픈소스 음성 인식(STT) 모델이에요. 음성을 많은 언어로 텍스트로 바꿔주고, OpenAI API에서는 Audio API의 transcriptions·translations 엔드포인트로 제공돼요. 역사적으로 whisper-1이 쓰였고, 지금은 gpt-4o-transcribe 같은 고품질 스냅샷 모델도 지원해요.

이 카테고리의 문서

  • 개요: Speech to Text — 음성을 텍스트로 변환
  • 핵심 기능: Transcription — 파일·실시간 전사 워크플로
  • 실전·API: Realtime Transcription — 실시간 음성 인식

출처: https://developers.openai.com/api/docs/guides/speech-to-text