`transcribe()`

transcribe()

오디오 파일에서 트랜스크립트(텍스트)를 생성하는 함수예요. 음성 인식이 필요할 때 사용해요.

출처: 문서

본문

오디오 파일에서 트랜스크립트(텍스트)를 생성해요.

import { transcribe } from 'ai';
import { openai } from '@ai-sdk/openai';
import { readFile } from 'fs/promises';

const { text: transcript } = await transcribe({
  model: openai.transcription('gpt-4o-transcribe'),
  audio: await readFile('audio.mp3'),
});

console.log(transcript);

Import

import { transcribe } from "ai"

API Signature

Parameters

  • model: TranscriptionModelV4 — 사용할 트랜스크립션 모델.
  • audio: DataContent (string | Uint8Array | ArrayBuffer | Buffer) | URL — 트랜스크립트를 생성할 오디오 파일.
  • providerOptions: Record<string, JSONObject> (선택) — 프로바이더별 추가 옵션.
  • maxRetries: number (선택) — 최대 재시도 횟수. 기본값: 2.
  • abortSignal: AbortSignal (선택) — 호출을 취소할 수 있는 abort 신호.
  • headers: Record<string, string> (선택) — 요청에 대한 추가 HTTP 헤더.
  • download: (options: { url: URL; abortSignal?: AbortSignal }) => Promise<{ data: Uint8Array; mediaType: string | undefined }> (선택) — URL에서 오디오를 가져오는 커스텀 다운로드 함수. ai에서 createDownload()를 사용해 크기 제한이 있는 다운로드 함수를 만들 수 있어요. 예: createDownload({ maxBytes: 50 * 1024 * 1024 }). 기본값: 2 GiB 제한이 있는 내장 다운로드.

Returns

  • text: string — 오디오 입력에서 변환된 전체 트랜스크립트 텍스트.
  • segments: Array<{ text: string; startSecond: number; endSecond: number }> — 트랜스크립트 세그먼트 배열. 각 세그먼트는 변환된 텍스트 일부와 시작·종료 시간(초)을 담고 있어요.
  • language: string | undefined — 트랜스크립트의 언어(ISO-639-1 형식). 예: 영어는 "en".
  • durationInSeconds: number | undefined — 트랜스크립트의 길이(초).
  • warnings: Warning[] — 모델 프로바이더의 경고 (예: 지원되지 않는 설정).
  • providerMetadata: Record<string, JSONObject> (선택) — 프로바이더의 선택적 메타데이터. 바깥 키는 프로바이더 이름이고, 안쪽 값이 메타데이터예요. 세부 내용은 프로바이더에 따라 달라져요.
  • responses: Array<TranscriptionModelResponseMetadata> — 프로바이더의 응답 메타데이터. 모델을 여러 번 호출했다면 응답이 여러 개일 수 있어요.
    • timestamp: Date — 생성된 응답 시작 시각.
    • modelId: string — 응답 생성에 사용된 응답 모델의 ID.
    • headers: Record<string, string> (선택) — 응답 헤더.

더 알아보기 (Learn more)

전체 사이트맵