`transcribe()`
transcribe()
오디오 파일에서 트랜스크립트(텍스트)를 생성하는 함수예요. 음성 인식이 필요할 때 사용해요.
출처: 문서
본문
오디오 파일에서 트랜스크립트(텍스트)를 생성해요.
import { transcribe } from 'ai';
import { openai } from '@ai-sdk/openai';
import { readFile } from 'fs/promises';
const { text: transcript } = await transcribe({
model: openai.transcription('gpt-4o-transcribe'),
audio: await readFile('audio.mp3'),
});
console.log(transcript);
Import
import { transcribe } from "ai"
API Signature
Parameters
- model:
TranscriptionModelV4— 사용할 트랜스크립션 모델. - audio:
DataContent (string | Uint8Array | ArrayBuffer | Buffer) | URL— 트랜스크립트를 생성할 오디오 파일. - providerOptions:
Record<string, JSONObject>(선택) — 프로바이더별 추가 옵션. - maxRetries:
number(선택) — 최대 재시도 횟수. 기본값: 2. - abortSignal:
AbortSignal(선택) — 호출을 취소할 수 있는 abort 신호. - headers:
Record<string, string>(선택) — 요청에 대한 추가 HTTP 헤더. - download:
(options: { url: URL; abortSignal?: AbortSignal }) => Promise<{ data: Uint8Array; mediaType: string | undefined }>(선택) — URL에서 오디오를 가져오는 커스텀 다운로드 함수.ai에서createDownload()를 사용해 크기 제한이 있는 다운로드 함수를 만들 수 있어요. 예:createDownload({ maxBytes: 50 * 1024 * 1024 }). 기본값: 2 GiB 제한이 있는 내장 다운로드.
Returns
- text:
string— 오디오 입력에서 변환된 전체 트랜스크립트 텍스트. - segments:
Array<{ text: string; startSecond: number; endSecond: number }>— 트랜스크립트 세그먼트 배열. 각 세그먼트는 변환된 텍스트 일부와 시작·종료 시간(초)을 담고 있어요. - language:
string | undefined— 트랜스크립트의 언어(ISO-639-1 형식). 예: 영어는"en". - durationInSeconds:
number | undefined— 트랜스크립트의 길이(초). - warnings:
Warning[]— 모델 프로바이더의 경고 (예: 지원되지 않는 설정). - providerMetadata:
Record<string, JSONObject>(선택) — 프로바이더의 선택적 메타데이터. 바깥 키는 프로바이더 이름이고, 안쪽 값이 메타데이터예요. 세부 내용은 프로바이더에 따라 달라져요. - responses:
Array<TranscriptionModelResponseMetadata>— 프로바이더의 응답 메타데이터. 모델을 여러 번 호출했다면 응답이 여러 개일 수 있어요.- timestamp:
Date— 생성된 응답 시작 시각. - modelId:
string— 응답 생성에 사용된 응답 모델의 ID. - headers:
Record<string, string>(선택) — 응답 헤더.
- timestamp:
더 알아보기 (Learn more)
- generateText
- streamText
- embed
- embedMany
- rerank
- generateImage
- experimental_streamTranscribe
- experimental_streamTranslate
- transcribe
- generateSpeech
- experimental_generateVideo
- experimental_evaluate
- uploadFile
- uploadSkill
- Agent (Interface)
- ToolLoopAgent
- createAgentUIStream
- createAgentUIStreamResponse
- pipeAgentUIStreamToResponse
- experimental_startBatch
- tool
- experimental_getBatchStatus
- dynamicTool
- experimental_getBatchResults
- experimental_cancelBatch
- createMCPClient
- experimental_getRealtimeToolDefinitions
- toolSearch
- experimental_listBatches
- MCP Apps
- Experimental_StdioMCPTransport
- jsonSchema
- zodSchema
- valibotSchema
- Output
- filterActiveTools
- ModelMessage
- UIMessage
- validateUIMessages
- safeValidateUIMessages
- Experimental_SandboxSession
- createProviderRegistry
- customProvider
- cosineSimilarity
- wrapLanguageModel
- wrapImageModel
- LanguageModelV4Middleware
- extractReasoningMiddleware
- simulateStreamingMiddleware
- defaultInstructionsMiddleware
- defaultSettingsMiddleware
- addToolInputExamplesMiddleware
- extractJsonMiddleware
- isStepCount
- hasToolCall
- isLoopFinished
- simulateReadableStream
- smoothStream
- generateId
- createIdGenerator
- DefaultGeneratedFile