오디오와 음성
오디오와 음성 (Audio and voice)
새로운 대화형 음성 애플리케이션을 만든다면 **GPT-Live**부터 시작하세요. 말하면서 들을 수 있고, 백엔드 에이전트가 추론하거나, 도구를 쓰거나, 과제를 끝내는 동안 대화를 이어 갈 수 있어요.
출처: 문서
본문
WebRTC 퀵스타트로 첫 대화를 연결한 뒤 짧은 Live 프롬프트를 작성해 보세요. 이미 Realtime 애플리케이션이나 텍스트 에이전트가 있다면 GPT-Live로 마이그레이션을 따라가세요.
다른 오디오 워크플로 선택하기 (Choose another audio workflow)
Realtime 세션과 도구 모델이 필요하면 Realtime API를 사용하세요. 대화형 에이전트 없이 전사, 번역, 또는 음성 생성만 필요하다면 아래의 전용 API를 선택하세요.
| 빌드 | 여기서 시작 | 제어할 수 있는 것 |
|---|---|---|
| Realtime 세션과 도구 모델을 쓰는 음성-음성 에이전트 | Realtime API | 오디오 턴, 세션 상태, 도구, 인터럽션. |
| 기존 텍스트 에이전트용 음성 인터페이스 | Voice agents | 음성-텍스트, 텍스트 에이전트 워크플로, 그다음 텍스트-음성. |
| 오디오 파일의 전사 | 파일 전사 | 파일 업로드, 제한된 요청, 지원되는 전사 형식. |
| 어시스턴트 음성 없는 실시간 자막 | 실시간 전사 | 스트리밍 오디오와 증분 전사 이벤트. |
| 연속 음성 번역 | 실시간 번역 | 보이스 에이전트 턴 루프가 아닌 전용 번역 세션. |
| 내레이션이나 생성 음성 | Text to speech | 텍스트, 음성, 출력 형식. |
| 기존 채팅 앱에서의 오디오 입력 또는 출력 | Chat Completions에서의 오디오 | 제한된 멀티모달 채팅 요청. |
음성으로 빌드하기 (Build with voice)
Voice agents로 아키텍처를 비교하세요. GPT-Live 또는 Realtime용 프롬프팅 가이드부터 시작하세요. 그다음 공유 가이드인 커스텀 음성, 평가, 비용 최적화를 사용하세요. 각 가이드는 모델 또는 API 특유 동작을 구분해요.
연결 선택하기 (Choose a connection)
브라우저 오디오에는 WebRTC부터 시작하세요. 서버 오디오 파이프라인에는 WebSockets을 사용하세요. 전화 통화는 Telephony and SIP을 참고하세요. 서버 측 제어 연결로 신뢰할 수 있는 백엔드가 미디어 세션을 관찰하고 제어할 수 있어요.
각 연결 페이지에서 API를 선택하세요. 트랜스포트를 공유한다고 해서 GPT-Live와 Realtime의 핸드셰이크, 자격 증명, 이벤트 형식이 호환되지는 않아요. 필수 조건과 설정 지침은 연결 가이드를 확인하세요.
기존 애플리케이션에 오디오 추가하기 (Add audio to your existing application)
Chat Completions 예시는 이제 Chat Completions에서의 오디오에 있어요. 브라우저 보이스 에이전트 스타터는 GPT-Live WebRTC 퀵스타트를 사용하세요.
더 알아보기 (Learn more)
- GPT-Live 가이드에서 새 대화형 음성 애플리케이션을 시작하세요.
- Voice agents 가이드에서 보이스 아키텍처를 비교하세요.