Gladia 프로바이더

Gladia 프로바이더 (Gladia Provider)

Gladia 프로바이더는 Gladia 전사(transcription) API에 대한 언어 모델 지원을 제공하는 문서예요.

출처: 문서

본문

Gladia 프로바이더는 Gladia 전사 API에 대한 언어 모델 지원을 포함하고 있어요.

설정 (Setup)

Gladia 프로바이더는 @ai-sdk/gladia 모듈에서 사용할 수 있어요. 다음과 같이 설치할 수 있어요:

npm install @ai-sdk/gladia

프로바이더 인스턴스 (Provider Instance)

@ai-sdk/gladia에서 기본 프로바이더 인스턴스인 gladia를 임포트할 수 있어요:

import { gladia } from '@ai-sdk/gladia';

커스터마이즈된 설정이 필요하다면 @ai-sdk/gladia에서 createGladia를 임포트하고 자기 설정으로 프로바이더 인스턴스를 생성할 수 있어요:

import { createGladia } from '@ai-sdk/gladia';

const gladia = createGladia({
  // custom settings, e.g.
  fetch: customFetch,
});

Gladia 프로바이더 인스턴스를 커스터마이즈하기 위해 다음 선택적 설정을 사용할 수 있어요:

  • apiKey string

    Authorization 헤더로 전송되는 API 키예요. 기본값은 GLADIA_API_KEY 환경 변수예요.

  • headers Record<string,string>

    요청에 포함할 커스텀 헤더예요.

  • fetch (input: RequestInfo, init?: RequestInit) => Promise<Response>

    커스텀 fetch 구현이에요. 기본값은 전역 fetch 함수예요. 요청을 가로채는 미들웨어로 사용하거나, 예를 들어 테스트용 커스텀 fetch 구현을 제공할 수 있어요.

전사 모델 (Transcription Models)

.transcription() 팩토리 메서드를 사용해 Gladia 전사 API를 호출하는 모델을 만들 수 있어요.

const model = gladia.transcription();

providerOptions 인자를 사용해 추가적인 프로바이더별 옵션을 전달할 수도 있어요. 예를 들어 summarize 옵션을 제공하면 콘텐츠 섹션에 대한 요약을 활성화해요.

import { transcribe } from 'ai';
import { gladia } from '@ai-sdk/gladia';
import { type GladiaTranscriptionModelOptions } from '@ai-sdk/gladia';
import { readFile } from 'fs/promises';

const result = await transcribe({
  model: gladia.transcription(),
  audio: await readFile('audio.mp3'),
  providerOptions: {
    gladia: {
      summarization: true,
    } satisfies GladiaTranscriptionModelOptions,
  },
});

참고: Gladia에는 다양한 모델이 없으므로 표준 model id 매개변수를 생략할 수 있어요.

다음 프로바이더 옵션을 사용할 수 있어요:

  • contextPrompt string

    더 나은 정확도를 위해 전사 모델에 제공할 컨텍스트예요. 선택 사항이에요.

  • customVocabulary boolean | any[]

    전사 정확도를 높이기 위한 커스텀 어휘예요. 선택 사항이에요.

  • customVocabularyConfig object

    커스텀 어휘의 설정이에요. 선택 사항이에요.

    • vocabulary Array<string | { value: string, intensity?: number, pronunciations?: string[], language?: string }>
    • defaultIntensity number
  • detectLanguage boolean

    언어를 자동으로 감지할지 여부예요. 선택 사항이에요.

  • enableCodeSwitching boolean

    다국어 오디오에 대한 코드 스위칭을 활성화해요. 선택 사항이에요.

  • codeSwitchingConfig object

    코드 스위칭의 설정이에요. 선택 사항이에요.

    • languages string[]
  • language string

    오디오의 언어를 지정해요. 선택 사항이에요.

  • callback boolean

    전사 완료 시 콜백을 활성화해요. 선택 사항이에요.

  • callbackConfig object

    콜백의 설정이에요. 선택 사항이에요.

    • url string
    • method 'POST' | 'PUT'
  • subtitles boolean

    전사에서 자막을 생성해요. 선택 사항이에요.

  • subtitlesConfig object

    자막의 설정이에요. 선택 사항이에요.

    • formats Array<'srt' | 'vtt'>
    • minimumDuration number
    • maximumDuration number
    • maximumCharactersPerRow number
    • maximumRowsPerCaption number
    • style 'default' | 'compliance'
  • diarization boolean

    화자 분리(diarization)를 활성화해요. 선택 사항이에요.

  • diarizationConfig object

    화자 분리의 설정이에요. 선택 사항이에요.

    • numberOfSpeakers number
    • minSpeakers number
    • maxSpeakers number
    • enhanced boolean
  • translation boolean

    전사 번역을 활성화해요. 선택 사항이에요.

  • translationConfig object

    번역의 설정이에요. 선택 사항이에요.

    • targetLanguages string[]
    • model 'base' | 'enhanced'
    • matchOriginalUtterances boolean
  • summarization boolean

    전사 요약을 활성화해요. 선택 사항이에요.

  • summarizationConfig object

    요약의 설정이에요. 선택 사항이에요.

    • type 'general' | 'bullet_points' | 'concise'
  • moderation boolean

    콘텐츠 검열(moderation)을 활성화해요. 선택 사항이에요.

  • namedEntityRecognition boolean

    개체명 인식을 활성화해요. 선택 사항이에요.

  • chapterization boolean

    전사의 챕터화를 활성화해요. 선택 사항이에요.

  • nameConsistency boolean

    전사에서 이름 일관성을 활성화해요. 선택 사항이에요.

  • customSpelling boolean

    커스텀 철자를 활성화해요. 선택 사항이에요.

  • customSpellingConfig object

    커스텀 철자의 설정이에요. 선택 사항이에요.

    • spellingDictionary Record<string, string[]>
  • structuredDataExtraction boolean

    구조화된 데이터 추출을 활성화해요. 선택 사항이에요.

  • structuredDataExtractionConfig object

    구조화된 데이터 추출의 설정이에요. 선택 사항이에요.

    • classes string[]
  • sentimentAnalysis boolean

    감정 분석을 활성화해요. 선택 사항이에요.

  • audioToLlm boolean

    오디오를 LLM으로 처리하는 것을 활성화해요. 선택 사항이에요.

  • audioToLlmConfig object

    오디오를 LLM으로 처리하는 설정이에요. 선택 사항이에요.

    • prompts string[]
  • customMetadata Record<string, any>

    요청에 포함할 커스텀 메타데이터예요. 선택 사항이에요.

  • sentences boolean

    문장 감지를 활성화해요. 선택 사항이에요.

  • displayMode boolean

    표시 모드를 활성화해요. 선택 사항이에요.

  • punctuationEnhanced boolean

    향상된 구두점을 활성화해요. 선택 사항이에요.

모델 기능 (Model Capabilities)

모델 전사 (Transcription) 지속시간 (Duration) 세그먼트 (Segments) 언어 (Language)
Default 지원 지원 지원 지원

더 알아보기 (Learn more)