Gladia 프로바이더
Gladia 프로바이더 (Gladia Provider)
Gladia 프로바이더는 Gladia 전사(transcription) API에 대한 언어 모델 지원을 제공하는 문서예요.
출처: 문서
본문
Gladia 프로바이더는 Gladia 전사 API에 대한 언어 모델 지원을 포함하고 있어요.
설정 (Setup)
Gladia 프로바이더는 @ai-sdk/gladia 모듈에서 사용할 수 있어요. 다음과 같이 설치할 수 있어요:
npm install @ai-sdk/gladia
프로바이더 인스턴스 (Provider Instance)
@ai-sdk/gladia에서 기본 프로바이더 인스턴스인 gladia를 임포트할 수 있어요:
import { gladia } from '@ai-sdk/gladia';
커스터마이즈된 설정이 필요하다면 @ai-sdk/gladia에서 createGladia를 임포트하고 자기 설정으로 프로바이더 인스턴스를 생성할 수 있어요:
import { createGladia } from '@ai-sdk/gladia';
const gladia = createGladia({
// custom settings, e.g.
fetch: customFetch,
});
Gladia 프로바이더 인스턴스를 커스터마이즈하기 위해 다음 선택적 설정을 사용할 수 있어요:
-
apiKey string
Authorization헤더로 전송되는 API 키예요. 기본값은GLADIA_API_KEY환경 변수예요. -
headers Record<string,string>
요청에 포함할 커스텀 헤더예요.
-
fetch (input: RequestInfo, init?: RequestInit) => Promise<Response>
커스텀 fetch 구현이에요. 기본값은 전역
fetch함수예요. 요청을 가로채는 미들웨어로 사용하거나, 예를 들어 테스트용 커스텀 fetch 구현을 제공할 수 있어요.
전사 모델 (Transcription Models)
.transcription() 팩토리 메서드를 사용해 Gladia 전사 API를 호출하는 모델을 만들 수 있어요.
const model = gladia.transcription();
providerOptions 인자를 사용해 추가적인 프로바이더별 옵션을 전달할 수도 있어요. 예를 들어 summarize 옵션을 제공하면 콘텐츠 섹션에 대한 요약을 활성화해요.
import { transcribe } from 'ai';
import { gladia } from '@ai-sdk/gladia';
import { type GladiaTranscriptionModelOptions } from '@ai-sdk/gladia';
import { readFile } from 'fs/promises';
const result = await transcribe({
model: gladia.transcription(),
audio: await readFile('audio.mp3'),
providerOptions: {
gladia: {
summarization: true,
} satisfies GladiaTranscriptionModelOptions,
},
});
참고: Gladia에는 다양한 모델이 없으므로 표준
modelid 매개변수를 생략할 수 있어요.
다음 프로바이더 옵션을 사용할 수 있어요:
-
contextPrompt string
더 나은 정확도를 위해 전사 모델에 제공할 컨텍스트예요. 선택 사항이에요.
-
customVocabulary boolean | any[]
전사 정확도를 높이기 위한 커스텀 어휘예요. 선택 사항이에요.
-
customVocabularyConfig object
커스텀 어휘의 설정이에요. 선택 사항이에요.
- vocabulary Array<string | { value: string, intensity?: number, pronunciations?: string[], language?: string }>
- defaultIntensity number
-
detectLanguage boolean
언어를 자동으로 감지할지 여부예요. 선택 사항이에요.
-
enableCodeSwitching boolean
다국어 오디오에 대한 코드 스위칭을 활성화해요. 선택 사항이에요.
-
codeSwitchingConfig object
코드 스위칭의 설정이에요. 선택 사항이에요.
- languages string[]
-
language string
오디오의 언어를 지정해요. 선택 사항이에요.
-
callback boolean
전사 완료 시 콜백을 활성화해요. 선택 사항이에요.
-
callbackConfig object
콜백의 설정이에요. 선택 사항이에요.
- url string
- method 'POST' | 'PUT'
-
subtitles boolean
전사에서 자막을 생성해요. 선택 사항이에요.
-
subtitlesConfig object
자막의 설정이에요. 선택 사항이에요.
- formats Array<'srt' | 'vtt'>
- minimumDuration number
- maximumDuration number
- maximumCharactersPerRow number
- maximumRowsPerCaption number
- style 'default' | 'compliance'
-
diarization boolean
화자 분리(diarization)를 활성화해요. 선택 사항이에요.
-
diarizationConfig object
화자 분리의 설정이에요. 선택 사항이에요.
- numberOfSpeakers number
- minSpeakers number
- maxSpeakers number
- enhanced boolean
-
translation boolean
전사 번역을 활성화해요. 선택 사항이에요.
-
translationConfig object
번역의 설정이에요. 선택 사항이에요.
- targetLanguages string[]
- model 'base' | 'enhanced'
- matchOriginalUtterances boolean
-
summarization boolean
전사 요약을 활성화해요. 선택 사항이에요.
-
summarizationConfig object
요약의 설정이에요. 선택 사항이에요.
- type 'general' | 'bullet_points' | 'concise'
-
moderation boolean
콘텐츠 검열(moderation)을 활성화해요. 선택 사항이에요.
-
namedEntityRecognition boolean
개체명 인식을 활성화해요. 선택 사항이에요.
-
chapterization boolean
전사의 챕터화를 활성화해요. 선택 사항이에요.
-
nameConsistency boolean
전사에서 이름 일관성을 활성화해요. 선택 사항이에요.
-
customSpelling boolean
커스텀 철자를 활성화해요. 선택 사항이에요.
-
customSpellingConfig object
커스텀 철자의 설정이에요. 선택 사항이에요.
- spellingDictionary Record<string, string[]>
-
structuredDataExtraction boolean
구조화된 데이터 추출을 활성화해요. 선택 사항이에요.
-
structuredDataExtractionConfig object
구조화된 데이터 추출의 설정이에요. 선택 사항이에요.
- classes string[]
-
sentimentAnalysis boolean
감정 분석을 활성화해요. 선택 사항이에요.
-
audioToLlm boolean
오디오를 LLM으로 처리하는 것을 활성화해요. 선택 사항이에요.
-
audioToLlmConfig object
오디오를 LLM으로 처리하는 설정이에요. 선택 사항이에요.
- prompts string[]
-
customMetadata Record<string, any>
요청에 포함할 커스텀 메타데이터예요. 선택 사항이에요.
-
sentences boolean
문장 감지를 활성화해요. 선택 사항이에요.
-
displayMode boolean
표시 모드를 활성화해요. 선택 사항이에요.
-
punctuationEnhanced boolean
향상된 구두점을 활성화해요. 선택 사항이에요.
모델 기능 (Model Capabilities)
| 모델 | 전사 (Transcription) | 지속시간 (Duration) | 세그먼트 (Segments) | 언어 (Language) |
|---|---|---|---|---|
Default |
지원 | 지원 | 지원 | 지원 |