Gemini 3.8 Flash TTS
Gemini 3.8 Flash TTS
스튜디오급 음성 충실도, 표현력 있는 연기, 정통 지역 악센트, 견고한 장문 다중 턴 안정성으로 설계된 Google의 플래그십 크리에이티브 텍스트-음성 변환 모델이에요.
출처: 원문
본문
Gemini 3.8 Flash TTS(gemini-3.8-flash-tts)는 Google의 플래그십 크리에이티브 텍스트-음성 변환 모델로, 스튜디오급 음성 충실도, 표현력 있는 연기, 정통 지역 악센트, 견고한 장문 다중 턴 안정성을 위해 설계됐어요.
Google AI Studio에서 직접 사용해 볼 수 있어요.
개요와 기능
Gemini 3.8 Flash TTS는 표현력 있는 오디오 생성의 새로운 기준을 세워요:
- 높은 음향 충실도와 연기 뉘앙스: 풍부한 감정 범위, 자연스러운 운율, 턴 수준
style지시와 인라인 발성 이벤트(<laugh>,<sigh>,<short pause>)에 대한 정확한 준수를 제공해요. - 장문 다중 턴 안정성: 긴 대화와 수 분짜리 내레이션 전반에 걸쳐 음성 붕괴 없이 일관된 음성 아이덴티티, 음색, 볼륨, 음향 룸톤을 유지해요.
- 정통 지역 악센트와 발음: 지역 악센트와 소수 언어 방언을 지원해요.
- 완전한 음성 생태계 지원: 프리빌트 음성, Extended Voice Library(
GET /v1beta/voices), 커스텀 Voice design 페르소나, Voice replication(기본적으로 영구 저장 음성 + 선택적 stateless 키)과 원활하게 작동해요. Google AI Studio에서 대화형으로 음성을 설계하고 복제할 수도 있어요.
기능, 프롬프팅 모범 사례, 코드 예시는 Text-to-speech 가이드를 참고하세요.
어떤 TTS 모델을 언제 쓸까
두 Gemini 3.8 TTS 모델은 동일한 API 스키마와 프롬프팅 구조를 공유해요. 워크로드에 맞는 모델을 선택하세요:
| 기능 / 워크로드 | Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) | Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts ) |
|---|---|---|
| 주요 강점 | 최대 음성 충실도, 연기 뉘앙스, 방언 커버리지 | 높은 처리량, 낮은 지연 시간, 비용 효율 |
| 최적의 사용 사례 | 오디오북, 스튜디오 내레이션, 복잡한 다중 화자 대화, 격한 발성 연기, 어려운 발음, 지역 방언 | 대량 제작, 실시간 음성 에이전트 캐스케이드, 읽어주기 기능, 음성 복제, 일상 단일 화자 생성 |
| 지원 언어 | 130개 언어 | 101개 언어 |
| 추천 대체 대상 | 신규 플래그십 크리에이티브 티어 | gemini-3.1-flash-tts-preview |
마이그레이션 가이드
gemini-3.1-flash-tts-preview나 그 이전 Gemini TTS 모델에서 마이그레이션한다면, Gemini 3.8 TTS 스키마에 맞게 요청을 업데이트하세요:
- 턴 수준 지시를
speech_metadata로 옮기기: Gemini 3.8 TTS는 입력 텍스트를 엄격히 문자 그대로의 전사본으로 취급해요."Say cheerfully: Hello!"나"Speaker 1: Hello!"같은 인라인 텍스트 지시는 소리 내어 말해질 수 있어요. 지속 전달 지시(style)와 스피커 라벨(speaker)은 구조화 메타데이터로 옮기세요:- Interactions API: 각 텍스트 콘텐츠 블록에
"type": "speech_metadata","speaker","style"이 있는 annotation을 첨부하세요. - GenerateContent API: 각
part에"speech_metadata": {"speaker": "...", "style": "..."}를 첨부하세요.
- Interactions API: 각 텍스트 콘텐츠 블록에
- 시점 발성 이벤트에만 각괄호 인라인 태그 사용: 순간적인 비음성 발성과 일시정지는 전사본 인라인에서 각괄호(
<laugh>,<sigh>,<cough>,<breath>,<short pause>)로 유지하세요. 속삭임 같은 전달 스타일은speech_metadata.style에 넣으세요. - 다중 화자 요청의 모든 턴에
speaker지정: 다중 화자 요청의 모든 턴은speech_metadata안에 구성된 화자 중 하나와 일치하는speaker를 명시적으로 포함해야 해요. - Voice design으로 페르소나를 미리 설계: 긴 레거시 Audio Profile/Director's Notes 블록을 Voice design에서 만든 커스텀 음성으로 대체하고, 그
voice_...ID를 최소 혹은 빈style문자열과 함께 TTS 요청 전반에 사용하세요. - 단항 요청의 기본 WAV(
audio/wav) 출력 고려:gemini-3.1-flash-tts-preview와 그 이전 TTS 모델(기본적으로 헤더 없는 원시 PCMaudio/l16반환)과 달리, Gemini 3.8 TTS는 단항 요청에서 표준 RIFF 헤더가 있는 WAV 오디오(audio/wav/AUDIO_WAV)를 기본으로 반환해요.- 이전에 원시 PCM 바이트를 WAV 헤더로 감쌌다면(Python의
wave모듈이나ffmpeg사용 등), 수동 헤더 래퍼를 제거하고 반환된 바이트를 직접.wav파일에 쓰세요. - 파이프라인에 헤더 없는 원시 PCM, mu-law, A-law 오디오가 필요하면
response_format을 명시적으로"audio/l16"("AUDIO_L16"),"audio/mulaw"("AUDIO_MULAW"),"audio/alaw"("AUDIO_ALAW")로 설정하세요. 오디오 출력 형식을 참고하세요.
- 이전에 원시 PCM 바이트를 WAV 헤더로 감쌌다면(Python의
gemini-3.8-flash-tts
| 속성 | 설명 |
|---|---|
| 모델 코드 | gemini-3.8-flash-tts |
| 지원 데이터 타입 | 입력: 텍스트 / 출력: 오디오 |
| 토큰 한도 [*] | 입력 토큰 한도 8,192 / 출력 토큰 한도 16,384 (Gemini API 서빙 한도) |
| 기능 | 오디오 생성 지원 / 캐싱 지원 / 코드 실행 미지원 / 파일 검색 미지원 / 함수 호출 미지원 / Google Maps 접지 미지원 / 이미지 생성 미지원 / Live API 미지원 / 검색 접지 미지원 / 구조화 출력 미지원 / Thinking 미지원 / URL 컨텍스트 미지원 |
| 소비 옵션 | Batch API 지원 / Flex 추론 지원 / Priority 추론 지원 |
| 버전 | 모델 버전 패턴 참고. gemini-3.8-flash-tts |
| 최근 업데이트 | 2026년 9월 |
지원 언어
gemini-3.8-flash-tts는 입력 언어를 자동으로 감지하며 130개 이상의 언어를 지원해요:
| 언어 | 언어 | 언어 |
|---|---|---|
| Acehnese (Arab script) | Greek | Nepali (individual language) |
| Afrikaans | Guarani | Nigerian Fulfulde |
| Akan | Gujarati | North Azerbaijani |
| Amharic | Haitian Creole | Northern Sotho |
| Armenian | Halh Mongolian | Northern Uzbek |
| Assamese | Hausa | Norwegian Bokmål |
| Awadhi | Hebrew | Norwegian Nynorsk |
| Balinese | Hindi | Nyanja |
| Bangla | Hungarian | Occitan |
| Banjar (Arab script) | Icelandic | Odia (individual language) |
| Banjar (Latn script) | Igbo | Pangasinan |
| Bashkir | Iloko | Persian (Afghanistan) |
| Basque | Indonesian | Polish |
| Belarusian | Iranian Persian | Portuguese |
| Bemba | Italian | Punjabi |
| Bhojpuri | Japanese | Romanian |
| Bosnian | Javanese | Russian |
| Buginese | Kabyle | Santali |
| Bulgarian | Kamba | Serbian |
| Burmese | Kannada | Sindhi |
| Cantonese | Kashmiri (Arab script) | Sinhala |
| Catalan | Kashmiri (Deva script) | Slovak |
| Cebuano | Kazakh | Slovenian |
| Central Kurdish | Khmer | Somali |
| Chhattisgarhi | Kikuyu | South Azerbaijani |
| Chinese (Hans script) | Kinyarwanda | Southern Pashto |
| Chinese (Hant script) | Kongo | Southern Sotho |
| Crimean Tatar | Korean | Spanish |
| Croatian | Kyrgyz | Standard Arabic (Arab script) |
| Czech | Lao | Standard Arabic (Latn script) |
| Danish | Latgalian | Standard Latvian |
| Dutch | Lingala | Standard Malay |
| Dyula | Lithuanian | Swahili (individual language) |
| Dzongkha | Luxembourgish | Swati |
| Egyptian Arabic | Macedonian | Swedish |
| English | Magahi | Tajik |
| Estonian | Maithili | Tamil |
| Filipino | Malayalam | Telugu |
| Finnish | Maltese | Thai |
| French | Manipuri | Tigrinya |
| Galician | Marathi | Tosk Albanian |
| Ganda | Minangkabau (Arab script) | Turkish |
| Georgian | Minangkabau (Latn script) | Uyghur |
| German | Mizo | Vietnamese |