오디오와 음성

오디오와 음성

새로운 대화형 음성 애플리케이션을 만들 때 어디서부터 시작할지 막막할 때가 많죠. OpenAI가 지금 권하는 출발점은 GPT-Live입니다. 듣는 동안에도 말을 할 수 있고, 백엔드 에이전트가 추론하거나 도구를 쓰거나 작업을 마무리하는 동안에도 대화를 이어갈 수 있어요. 첫 대화는 WebRTC 퀵스타트로 연결해 보고, 그다음에 짧은 Live 프롬프트를 작성해 보면 전체 흐름이 잡혀요. 이미 Realtime 애플리케이션이나 텍스트 에이전트를 운영 중이라면 GPT-Live 가이드의 마이그레이션 문서를 따라가면 됩니다.

출처: 공식문서

다른 오디오 워크플로 고르기

음성 작업도 "어떤 상황에서 어떤 API를 쓸지"가 핵심이에요. Realtime 세션과 도구 모델이 필요하면 Realtime API를 쓰고, 대화형 에이전트 없이 전사·번역·음성 생성만 필요하다면 아래 전용 API 중에서 고르면 됩니다. 이 기준이 맞는지 한눈에 정리한 표가 아래 있어요.

만들고 싶은 것 시작 지점 직접 제어하는 것
Realtime 세션·도구 모델을 쓰는 음성-음성 에이전트 Realtime API 오디오 턴, 세션 상태, 도구, 인터럽션
기존 텍스트 에이전트를 위한 음성 인터페이스 Voice agents 음성→텍스트, 텍스트 에이전트 워크플로, 텍스트→음성
오디오 파일의 전사본 File transcription 파일 업로드, 제한된 요청, 지원 전사 형식
조수 말 없이 실시간 자막만 Live transcription 스트리밍 오디오와 증분 전사 이벤트
지속적인 음성 통역 Live translation 전용 번역 세션(음성 에이전트 턴 루프가 아님)
나레이션이나 생성 음성 Text to speech 텍스트, 목소리, 출력 형식
기존 채팅 앱의 오디오 입·출력 Audio in Chat Completions 제한된 멀티모달 채팅 요청

음성으로 만들기

Voice agents 문서에서 여러 아키텍처를 비교할 수 있어요. 먼저 GPT-Live 프롬프팅이나 Realtime 음성 프롬프팅 가이드부터 시작하고, 이후 공통 가이드인 커스텀 목소리, 평가, 비용 최적화 문서를 이어서 보면 됩니다. 각 가이드는 모델별·API별로 달라지는 동작을 따로 구분해 설명하고 있어요.

연결 방식 고르기

브라우저 오디오는 WebRTC로, 서버 오디오 파이프라인은 WebSockets로 시작하는 게 자연스러워요. 전화 통화가 필요하면 Telephony and SIP 문서를 보세요. 신뢰할 수 있는 백엔드가 미디어 세션을 관찰하고 제어하고 싶다면 서버 측 제어 연결 가이드가 도움이 됩니다. 각 연결 페이지에서 사용할 API를 선택해야 하고, 같은 전송 방식을 쓴다고 해서 GPT-Live와 Realtime의 핸드셰이크나 자격 증명, 이벤트 형식이 서로 호환되는 건 아니라는 점을 꼭 확인해 두세요.

기존 애플리케이션에 오디오 더하기

Chat Completions 예제는 이제 Audio in Chat Completions 문서로 옮겨졌어요. 브라우저용 음성 에이전트 스타터가 필요하면 GPT-Live WebRTC 퀵스타트를 쓰면 됩니다.

더 알아보기 (Learn more)