음성-텍스트 API

음성-텍스트 API (Speech to Text APIs)

vLLM은 음성을 텍스트로 바꾸는 자동 음성 인식(ASR) 모델을 HTTP API로도 서빙할 수 있어요. OpenAI의 Transcriptions/Translation API 형식을 따르고, 실시간(realtime) 스트리밍도 지원해요. 이 페이지에서 음성-텍스트 API의 종류를 살펴볼게요.

출처: vLLM 공식 문서 — serving/online_serving/speech_to_text

vLLM은 음성 입력을 처리하는 여러 API를 제공해요. 음성 파일 업로드부터 실시간 스트리밍까지 다양하게 지원해요.

Transcriptions API

텍스트 변환(transcriptions) API는 오디오 파일을 받아 텍스트로 변환해줘요. 자세한 내용은 OpenAI의 Transcriptions API(/v1/audio/transcriptions) 사양을 따르며, ASR 모델에만 적용돼요.

오디오 파일 업로드 (Uploading Audio Files)

샘플링 파라미터와 vLLM 확장을 포함한 지원 파라미터의 전체 목록은 프로토콜 정의를 참고하세요.

응답 형식 (Response Format): (원문의 응답 형식 예시는 프로토콜 정의를 참고하세요. — 확인 필요)

Translation API

번역(translation) API는 오디오를 받아 다른 언어의 텍스트로 변환해줘요. (/v1/audio/translations) ASR 모델에만 적용돼요.

Realtime API

Realtime API(/v1/realtime)는 실시간으로 음성을 처리하는 스트리밍 인터페이스예요. ASR 모델에만 적용돼요.

서버 → 클라이언트 이벤트 (Server → Client Events)

Realtime API는 서버에서 클라이언트로 이벤트를 스트리밍해요.

예제 클라이언트 (Example Clients)

더 알아보기 (Learn more)