Gemini 3.8 Flash-Lite TTS 모델
Gemini 3.8 Flash-Lite TTS 모델
Gemini 3.8 Flash-Lite TTS(gemini-3.8-flash-lite-tts)는 Google의 빠르고 비용 효율적인 '일꾼' 텍스트 음성 변환(TTS) 모델이에요. 고처리량(high-throughput) 프로덕션 워크로드에서 gemini-3.1-flash-tts-preview를 대체하도록 만들어졌습니다.
출처: 문서
본문
개요와 기능
Gemini 3.8 Flash-Lite TTS는 낮은 지연 시간과 표현력 있고 자연스러운 음성을 결합했어요.
- 고처리량 효율 (High-throughput efficiency): 대량 프로덕션, 대화형 음성 에이전트 파이프라인, 읽어주기(read-aloud) 기능, 주요 언어에서의 일상적인 단일 화자 음성 생성을 위해 최적화됐어요.
- 드롭인 스키마 호환 (Drop-in schema compatibility):
gemini-3.8-flash-tts와 정확히 동일한 API 스키마와 구조화 프롬프트 형식을 공유해서, 파라미터 하나만 바꾸면 모델을 전환할 수 있어요. - 완전한 음성 생태계 지원 (Full voice ecosystem support): 사전 제작(prebuilt) 음성, 확장 음성 라이브러리(
GET /v1beta/voices), 커스텀 Voice design 페르소나, Voice replication(기본적으로 영구 저장 음성 + 선택적 stateless 키)을 지원해요. Google AI Studio에서 음성을 대화형으로 설계·복제할 수도 있어요.
기능의 전체 범위, 프롬프팅 모범 사례, 코드 예시는 Text-to-speech 가이드를 참고하세요.
어떤 TTS 모델을 써야 할까
두 Gemini 3.8 TTS 모델은 같은 API 스키마와 프롬프팅 구조를 공유해요. 워크로드에 맞는 모델을 고르면 됩니다.
| 기능 / 워크로드 | Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts) |
Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) |
|---|---|---|
| 주 강점 (Primary strength) | 높은 처리량, 낮은 지연 시간, 비용 효율 | 최대 음성 충실도, 연기 뉘앙스, 방언 커버리지 |
| 최적 사용 사례 (Best use cases) | 대량 프로덕션, 실시간 음성 에이전트 파이프라인, 읽어주기 기능, 음성 복제, 일상적인 단일 화자 생성 | 오디오북, 스튜디오 내레이션, 복잡한 다중 화자 대화, 강한 발성 연기, 어려운 발음, 지역 방언 |
| 지원 언어 (Supported languages) | 101개 언어 | 130개 언어 |
| 대체 권장 대상 (Recommended replacement for) | gemini-3.1-flash-tts-preview |
새로운 플래그십 창작 전용 계층 |
마이그레이션 가이드
gemini-3.1-flash-tts-preview에서 gemini-3.8-flash-lite-tts로 업그레이드한다면, 요청을 Gemini 3.8 TTS 스키마에 맞게 수정하세요.
- 턴 단위 지시를
speech_metadata로 옮기기: Gemini 3.8 TTS는 입력 텍스트를 말 그대로의 전사(verbatim transcript)로 취급해요."Say cheerfully: Hello!"나"Speaker 1: Hello!"같은 인라인 텍스트 지시는 그대로 발화될 수 있어요. 지속적인 전달 지시(style)와 화자 라벨(speaker)은 구조화된 메타데이터로 옮기세요.- Interactions API: 각 텍스트 콘텐츠 블록에
"type": "speech_metadata","speaker","style"을 담은 어노테이션을 붙이세요. - GenerateContent API: 각
part에"speech_metadata": {"speaker": "...", "style": "..."}을 붙이세요.
- Interactions API: 각 텍스트 콘텐츠 블록에
- 점시각(일시적) 발성 이벤트에만 앵글 브래킷 인라인 태그 쓰기: 순간적인 비발화 음성과 일시정지(예:
<laugh>,<sigh>,<cough>,<breath>,<short pause>)는 앵글 브래킷을 이용해 전사 안에 인라인으로 남기세요. 속삭임 같은 전달 스타일은speech_metadata.style에 넣으세요. - 다중 화자 요청의 모든 턴에
speaker지정하기: 다중 화자 요청의 모든 턴은speech_metadata안에 설정된 화자 중 하나와 일치하는speaker를 명시적으로 포함해야 해요. - Voice design으로 페르소나를 미리 설계하기: 길었던 레거시 Audio Profile / Director's Notes 블록 대신 Voice design으로 만든 커스텀 음성을 사용하고, 그
voice_...ID를 최소 또는 빈style문자열과 함께 TTS 요청에 전달하세요. - 유너리(unary) 요청의 기본 WAV(
audio/wav) 출력 감안하기:gemini-3.1-flash-tts-preview와 이전 TTS 모델(기본적으로 헤더 없는 raw PCMaudio/l16반환)과 달리, Gemini 3.8 TTS는 유너리 요청에서 기본적으로 표준 RIFF 헤더가 있는 WAV 오디오(audio/wav/AUDIO_WAV)를 반환해요.- 코드가 예전에 raw PCM 바이트를 WAV 헤더로 감쌌다면(예: Python의
wave모듈이나ffmpeg), 수동 헤더 래퍼를 제거하고 반환된 바이트를.wav파일에 바로 쓰세요. - 파이프라인에 헤더 없는 raw PCM, mu-law, A-law 오디오가 필요하다면
response_format을"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW"),"audio/alaw"("AUDIO_ALAW")로 명시적으로 설정하세요. 오디오 출력 형식을 참고하세요.
- 코드가 예전에 raw PCM 바이트를 WAV 헤더로 감쌌다면(예: Python의
gemini-3.8-flash-lite-tts
| 속성 | 설명 |
|---|---|
| 모델 코드 | gemini-3.8-flash-lite-tts |
| 지원 데이터 유형 | 입력 텍스트 출력 오디오 |
| 토큰 제한[*] | 입력 토큰 한도 8,192 출력 토큰 한도 16,384 (Gemini API 서빙 한도) |
| 기능 | 오디오 생성 지원 캐싱 지원 코드 실행 미지원 파일 검색 미지원 함수 호출 미지원 Google Maps 기반 접지 미지원 이미지 생성 미지원 Live API 미지원 검색 접지 미지원 구조화 출력 미지원 Thinking 미지원 URL 컨텍스트 미지원 |
| 옵션 | Batch API 지원 Flex inference 지원 Priority inference 지원 |
| 버전 | 모델 버전 패턴을 참고하세요. - gemini-3.8-flash-lite-tts |
| 최신 업데이트 | 2026년 9월 |
지원 언어
gemini-3.8-flash-lite-tts는 입력 언어를 자동 감지하며 100개 이상의 언어를 지원해요.
| 언어 | 언어 | 언어 |
|---|---|---|
| Acehnese (Arab script) | German | Manipuri |
| Afrikaans | Greek | Marathi |
| Akan | Gujarati | Minangkabau (Arab script) |
| Amharic | Haitian Creole | Mizo |
| Armenian | Halh Mongolian | Nepali (individual language) |
| Assamese | Hausa | Nigerian Fulfulde |
| Awadhi | Hebrew | North Azerbaijani |
| Balinese | Hindi | Northern Sotho |
| Bangla | Hungarian | Northern Uzbek |
| Banjar (Latn script) | Icelandic | Norwegian Bokmål |
| Basque | Iloko | Norwegian Nynorsk |
| Belarusian | Indonesian | Nyanja |
| Bhojpuri | Iranian Persian | Odia (individual language) |
| Bosnian | Italian | Persian (Afghanistan) |
| Buginese | Japanese | Polish |
| Bulgarian | Javanese | Portuguese |
| Cantonese | Kamba | Punjabi |
| Catalan | Kannada | Romanian |
| Cebuano | Kashmiri (Arab script) | Russian |
| Central Kurdish | Kashmiri (Deva script) | Santali |
| Chhattisgarhi | Kazakh | Serbian |
| Chinese (Hans script) | Khmer | Sinhala |
| Chinese (Hant script) | Kikuyu | Slovak |
| Croatian | Kinyarwanda | South Azerbaijani |
| Czech | Kongo | Southern Pashto |
| Danish | Korean | Spanish |
| Dutch | Kyrgyz | Standard Arabic (Arab script) |
| Egyptian Arabic | Lao | Standard Arabic (Latn script) |
| English | Lingala | Standard Latvian |
| Estonian | Macedonian | Standard Malay |
| Filipino | Magahi | Tamil |
| French | Maithili | Telugu |
| Galician | Malayalam | Turkish |
| Ganda | Maltese | Vietnamese |
| Georgian | — | — |
더 알아보기 (Learn more)
gemini-3.8-flash-lite-tts는 처리량이 중요한 워크로드용이에요. 음성 충실도와 연기 표현이 더 중요한 작업이라면 gemini-3.8-flash-tts를 고려해 보세요. TTS 전반의 기능과 프롬프팅 방법은 speech-generation 문서를, 커스텀 음성 설계·복제는 Voice design / Voice replication 문서를 이어서 보면 좋아요.