Sarvam Provider
Sarvam Provider
Sarvam AI Provider는 AI SDK와 통합하도록 개발된 라이브러리예요. 이 라이브러리는 애플리케이션에 Speech to Text(STT) 기능을 제공해 오디오와 텍스트 데이터와의 원활한 상호작용을 가능하게 해요.
출처: 문서
본문
설정
Sarvam 프로바이더는 sarvam-ai-provider 모듈에서 사용할 수 있어요. 다음과 같이 설치할 수 있어요:
npm install sarvam-ai-provider
프로바이더 인스턴스
먼저 Sarvam Dashboard에서 Sarvam API Key를 받아요.
그런 다음 애플리케이션에서 Sarvam을 초기화해요:
import { createSarvam } from 'sarvam-ai-provider';
const sarvam = createSarvam({
headers: {
'api-subscription-key': 'YOUR_API_KEY',
},
});
api-subscription-key는 헤더로 전달해야 해요. 보안을 위해YOUR_API_KEY를 환경 변수로 사용하는 것을 고려하세요.
- 음성을 텍스트로 전사하기
import { transcribe } from 'ai';
import { readFile } from 'fs/promises';
await transcribe({
model: sarvam.transcription('saarika:v2'),
audio: await readFile('./src/transcript-test.mp3'),
providerOptions: {
sarvam: {
language_code: 'en-IN',
},
},
});
기능
파라미터 변경
- language_code 변경
providerOptions: {
sarvam: {
language_code: 'en-IN',
},
},
language_code는 입력 오디오의 언어를 지정하며 정확한 전사를 위해 필요해요. •saarika:v1모델에는 필수예요 (이 모델은unknown을 지원하지 않아요). •saarika:v2모델에는 선택사항이에요. • 언어를 모를 때는unknown을 사용하세요. 그 경우 API가 자동으로 감지해요. 사용 가능한 옵션:unknown,hi-IN,bn-IN,kn-IN,ml-IN,mr-IN,od-IN,pa-IN,ta-IN,te-IN,en-IN,gu-IN.
- with_timestamps?
providerOptions: {
sarvam: {
with_timestamps: true,
},
},
with_timestamps는 각 단어/토큰의 시작/종료 타임스탬프를 포함할지 지정해요. • 타입: boolean • true일 때 각 단어/토큰에 시작/종료 타임스탬프가 포함돼요. • 기본값: false
- with_diarization?
providerOptions: {
sarvam: {
with_diarization: true,
},
},
with_diarization은 화자 분리(speaker diarization, Beta)를 활성화해요. • 타입: boolean • true일 때 화자 분리를 활성화해요. • 기본값: false
- num_speakers?
providerOptions: {
sarvam: {
with_diarization: true,
num_speakers: 2,
},
},
num_speakers는 감지할 화자 수를 설정해요 (with_diarization이 true일 때만). • 타입: number | null • 감지할 화자 수. • 기본값: null
참고 자료
더 알아보기 (Learn more)
- 출처 문서: Sarvam Provider