Realtime Transcription — 실시간 음성 인식
Realtime Transcription — 실시간 음성 인식
실시간 전사는 오디오가 도착하는 대로 전사 델타를 스트리밍하는 기능이에요. 발화가 끝나기 전에 사용자가 텍스트를 먼저 볼 수 있어서, 라이브 자막·에이전트 어시스트 같은 낮은 지연 시간 용도에 적합해요.
모델 선택
| 모델 | 특징 |
|---|---|
gpt-realtime-whisper |
라이브 오디오·전사 델타, 튜닝 가능한 지연 시간. 네이티브 스트리밍 |
gpt-4o-transcribe |
스트리밍 불필요한 고정밀 전사(파일·요청-응답) |
gpt-4o-mini-transcribe |
비용 우선 저비용 전사 |
whisper-1 |
기존 Whisper 통합 |
이벤트 처리
실시간 세션에서는 전사 델타와 완료 이벤트를 받아요.
ws.on("message", (data) => {
const event = JSON.parse(data);
if (event.type === "conversation.item.input_audio_transcription.delta") {
process.stdout.write(event.delta);
}
if (event.type === "conversation.item.input_audio_transcription.completed") {
console.log("Final transcript:", event.transcript);
}
});
item_id로 이벤트를 발화에 매칭할 수 있으니, 서로 다른 화자가 섞이는 경우에도 텍스트를 올바르게 붙일 수 있어요.