Gemini 3.8 Flash TTS

Gemini 3.8 Flash TTS

스튜디오급 음성 충실도, 표현력 있는 연기, 정통 지역 악센트, 견고한 장문 다중 턴 안정성으로 설계된 Google의 플래그십 크리에이티브 텍스트-음성 변환 모델이에요.

출처: 원문

본문

Gemini 3.8 Flash TTS(gemini-3.8-flash-tts)는 Google의 플래그십 크리에이티브 텍스트-음성 변환 모델로, 스튜디오급 음성 충실도, 표현력 있는 연기, 정통 지역 악센트, 견고한 장문 다중 턴 안정성을 위해 설계됐어요.

Google AI Studio에서 직접 사용해 볼 수 있어요.

개요와 기능

Gemini 3.8 Flash TTS는 표현력 있는 오디오 생성의 새로운 기준을 세워요:

  • 높은 음향 충실도와 연기 뉘앙스: 풍부한 감정 범위, 자연스러운 운율, 턴 수준 style 지시와 인라인 발성 이벤트(<laugh>, <sigh>, <short pause>)에 대한 정확한 준수를 제공해요.
  • 장문 다중 턴 안정성: 긴 대화와 수 분짜리 내레이션 전반에 걸쳐 음성 붕괴 없이 일관된 음성 아이덴티티, 음색, 볼륨, 음향 룸톤을 유지해요.
  • 정통 지역 악센트와 발음: 지역 악센트와 소수 언어 방언을 지원해요.
  • 완전한 음성 생태계 지원: 프리빌트 음성, Extended Voice Library(GET /v1beta/voices), 커스텀 Voice design 페르소나, Voice replication(기본적으로 영구 저장 음성 + 선택적 stateless 키)과 원활하게 작동해요. Google AI Studio에서 대화형으로 음성을 설계하고 복제할 수도 있어요.

기능, 프롬프팅 모범 사례, 코드 예시는 Text-to-speech 가이드를 참고하세요.

어떤 TTS 모델을 언제 쓸까

두 Gemini 3.8 TTS 모델은 동일한 API 스키마와 프롬프팅 구조를 공유해요. 워크로드에 맞는 모델을 선택하세요:

기능 / 워크로드 Gemini 3.8 Flash TTS ( gemini-3.8-flash-tts ) Gemini 3.8 Flash-Lite TTS ( gemini-3.8-flash-lite-tts )
주요 강점 최대 음성 충실도, 연기 뉘앙스, 방언 커버리지 높은 처리량, 낮은 지연 시간, 비용 효율
최적의 사용 사례 오디오북, 스튜디오 내레이션, 복잡한 다중 화자 대화, 격한 발성 연기, 어려운 발음, 지역 방언 대량 제작, 실시간 음성 에이전트 캐스케이드, 읽어주기 기능, 음성 복제, 일상 단일 화자 생성
지원 언어 130개 언어 101개 언어
추천 대체 대상 신규 플래그십 크리에이티브 티어 gemini-3.1-flash-tts-preview

마이그레이션 가이드

gemini-3.1-flash-tts-preview나 그 이전 Gemini TTS 모델에서 마이그레이션한다면, Gemini 3.8 TTS 스키마에 맞게 요청을 업데이트하세요:

  1. 턴 수준 지시를 speech_metadata로 옮기기: Gemini 3.8 TTS는 입력 텍스트를 엄격히 문자 그대로의 전사본으로 취급해요. "Say cheerfully: Hello!"나 "Speaker 1: Hello!" 같은 인라인 텍스트 지시는 소리 내어 말해질 수 있어요. 지속 전달 지시(style)와 스피커 라벨(speaker)은 구조화 메타데이터로 옮기세요:
    1. Interactions API: 각 텍스트 콘텐츠 블록에 "type": "speech_metadata", "speaker", "style"이 있는 annotation을 첨부하세요.
    2. GenerateContent API: 각 part에 "speech_metadata": {"speaker": "...", "style": "..."}를 첨부하세요.
  2. 시점 발성 이벤트에만 각괄호 인라인 태그 사용: 순간적인 비음성 발성과 일시정지는 전사본 인라인에서 각괄호(<laugh>, <sigh>, <cough>, <breath>, <short pause>)로 유지하세요. 속삭임 같은 전달 스타일은 speech_metadata.style에 넣으세요.
  3. 다중 화자 요청의 모든 턴에 speaker 지정: 다중 화자 요청의 모든 턴은 speech_metadata 안에 구성된 화자 중 하나와 일치하는 speaker를 명시적으로 포함해야 해요.
  4. Voice design으로 페르소나를 미리 설계: 긴 레거시 Audio Profile/Director's Notes 블록을 Voice design에서 만든 커스텀 음성으로 대체하고, 그 voice_... ID를 최소 혹은 빈 style 문자열과 함께 TTS 요청 전반에 사용하세요.
  5. 단항 요청의 기본 WAV(audio/wav) 출력 고려: gemini-3.1-flash-tts-preview와 그 이전 TTS 모델(기본적으로 헤더 없는 원시 PCM audio/l16 반환)과 달리, Gemini 3.8 TTS는 단항 요청에서 표준 RIFF 헤더가 있는 WAV 오디오(audio/wav / AUDIO_WAV)를 기본으로 반환해요.
    1. 이전에 원시 PCM 바이트를 WAV 헤더로 감쌌다면(Python의 wave 모듈이나 ffmpeg 사용 등), 수동 헤더 래퍼를 제거하고 반환된 바이트를 직접 .wav 파일에 쓰세요.
    2. 파이프라인에 헤더 없는 원시 PCM, mu-law, A-law 오디오가 필요하면 response_format을 명시적으로 "audio/l16"("AUDIO_L16"), "audio/mulaw"("AUDIO_MULAW"), "audio/alaw"("AUDIO_ALAW")로 설정하세요. 오디오 출력 형식을 참고하세요.

gemini-3.8-flash-tts

속성 설명
모델 코드 gemini-3.8-flash-tts
지원 데이터 타입 입력: 텍스트 / 출력: 오디오
토큰 한도 [*] 입력 토큰 한도 8,192 / 출력 토큰 한도 16,384 (Gemini API 서빙 한도)
기능 오디오 생성 지원 / 캐싱 지원 / 코드 실행 미지원 / 파일 검색 미지원 / 함수 호출 미지원 / Google Maps 접지 미지원 / 이미지 생성 미지원 / Live API 미지원 / 검색 접지 미지원 / 구조화 출력 미지원 / Thinking 미지원 / URL 컨텍스트 미지원
소비 옵션 Batch API 지원 / Flex 추론 지원 / Priority 추론 지원
버전 모델 버전 패턴 참고. gemini-3.8-flash-tts
최근 업데이트 2026년 9월

지원 언어

gemini-3.8-flash-tts는 입력 언어를 자동으로 감지하며 130개 이상의 언어를 지원해요:

언어 언어 언어
Acehnese (Arab script) Greek Nepali (individual language)
Afrikaans Guarani Nigerian Fulfulde
Akan Gujarati North Azerbaijani
Amharic Haitian Creole Northern Sotho
Armenian Halh Mongolian Northern Uzbek
Assamese Hausa Norwegian Bokmål
Awadhi Hebrew Norwegian Nynorsk
Balinese Hindi Nyanja
Bangla Hungarian Occitan
Banjar (Arab script) Icelandic Odia (individual language)
Banjar (Latn script) Igbo Pangasinan
Bashkir Iloko Persian (Afghanistan)
Basque Indonesian Polish
Belarusian Iranian Persian Portuguese
Bemba Italian Punjabi
Bhojpuri Japanese Romanian
Bosnian Javanese Russian
Buginese Kabyle Santali
Bulgarian Kamba Serbian
Burmese Kannada Sindhi
Cantonese Kashmiri (Arab script) Sinhala
Catalan Kashmiri (Deva script) Slovak
Cebuano Kazakh Slovenian
Central Kurdish Khmer Somali
Chhattisgarhi Kikuyu South Azerbaijani
Chinese (Hans script) Kinyarwanda Southern Pashto
Chinese (Hant script) Kongo Southern Sotho
Crimean Tatar Korean Spanish
Croatian Kyrgyz Standard Arabic (Arab script)
Czech Lao Standard Arabic (Latn script)
Danish Latgalian Standard Latvian
Dutch Lingala Standard Malay
Dyula Lithuanian Swahili (individual language)
Dzongkha Luxembourgish Swati
Egyptian Arabic Macedonian Swedish
English Magahi Tajik
Estonian Maithili Tamil
Filipino Malayalam Telugu
Finnish Maltese Thai
French Manipuri Tigrinya
Galician Marathi Tosk Albanian
Ganda Minangkabau (Arab script) Turkish
Georgian Minangkabau (Latn script) Uyghur
German Mizo Vietnamese

더 알아보기 (Learn more)