음성-텍스트 API
음성-텍스트 API (Speech to Text APIs)
vLLM은 음성을 텍스트로 바꾸는 자동 음성 인식(ASR) 모델을 HTTP API로도 서빙할 수 있어요. OpenAI의 Transcriptions/Translation API 형식을 따르고, 실시간(realtime) 스트리밍도 지원해요. 이 페이지에서 음성-텍스트 API의 종류를 살펴볼게요.
vLLM은 음성 입력을 처리하는 여러 API를 제공해요. 음성 파일 업로드부터 실시간 스트리밍까지 다양하게 지원해요.
Transcriptions API
텍스트 변환(transcriptions) API는 오디오 파일을 받아 텍스트로 변환해줘요. 자세한 내용은 OpenAI의 Transcriptions API(/v1/audio/transcriptions) 사양을 따르며, ASR 모델에만 적용돼요.
오디오 파일 업로드 (Uploading Audio Files)
샘플링 파라미터와 vLLM 확장을 포함한 지원 파라미터의 전체 목록은 프로토콜 정의를 참고하세요.
응답 형식 (Response Format): (원문의 응답 형식 예시는 프로토콜 정의를 참고하세요. — 확인 필요)
Translation API
번역(translation) API는 오디오를 받아 다른 언어의 텍스트로 변환해줘요. (/v1/audio/translations) ASR 모델에만 적용돼요.
Realtime API
Realtime API(/v1/realtime)는 실시간으로 음성을 처리하는 스트리밍 인터페이스예요. ASR 모델에만 적용돼요.
서버 → 클라이언트 이벤트 (Server → Client Events)
Realtime API는 서버에서 클라이언트로 이벤트를 스트리밍해요.
예제 클라이언트 (Example Clients)
- openai_realtime_client.py - 오디오 파일을 업로드하고 전사(transcribe)합니다.