Realtime Transcription — 실시간 음성 인식

Realtime Transcription — 실시간 음성 인식

실시간 전사는 오디오가 도착하는 대로 전사 델타를 스트리밍하는 기능이에요. 발화가 끝나기 전에 사용자가 텍스트를 먼저 볼 수 있어서, 라이브 자막·에이전트 어시스트 같은 낮은 지연 시간 용도에 적합해요.

모델 선택

모델 특징
gpt-realtime-whisper 라이브 오디오·전사 델타, 튜닝 가능한 지연 시간. 네이티브 스트리밍
gpt-4o-transcribe 스트리밍 불필요한 고정밀 전사(파일·요청-응답)
gpt-4o-mini-transcribe 비용 우선 저비용 전사
whisper-1 기존 Whisper 통합

이벤트 처리

실시간 세션에서는 전사 델타와 완료 이벤트를 받아요.

ws.on("message", (data) => {
  const event = JSON.parse(data);
  if (event.type === "conversation.item.input_audio_transcription.delta") {
    process.stdout.write(event.delta);
  }
  if (event.type === "conversation.item.input_audio_transcription.completed") {
    console.log("Final transcript:", event.transcript);
  }
});

item_id로 이벤트를 발화에 매칭할 수 있으니, 서로 다른 화자가 섞이는 경우에도 텍스트를 올바르게 붙일 수 있어요.

더 알아보기