Coqui TTS 소개 — 고급 텍스트 음성 합성 라이브러리
Coqui TTS 소개
TTS(Text-to-Speech)를 처음 시작할 때는 모델 종류가 많아서 어디서부터 손댈지 막막해요. Coqui TTS(🐸TTS)는 연구와 프로덕션에서 검증된( battle-tested) 딥러닝 TTS 툴킷으로, 1100개 이상 언어의 사전학습 모델과 새 모델 학습·파인튜닝 도구, 데이터셋 분석·큐레이션 유틸을 한데 모았어요.
주요 특징
- Text2Speech 작업을 위한 고성능 딥러닝 모델
- Text2Spec 모델: Tacotron, Tacotron2, Glow-TTS, SpeedySpeech
- Speaker Encoder로 화자 임베딩을 효율적으로 계산
- Vocoder 모델: MelGAN, Multiband-MelGAN, GAN-TTS, ParallelWaveGAN, WaveGrad, WaveRNN
- 빠르고 효율적인 모델 학습, 터미널·Tensorboard 상세 로그
- 다중 화자 TTS 지원
- 가볍고 유연한
Trainer API - 출시·즉시 사용 가능한 모델
dataset_analysis아래 TTS 데이터셋 큐레이션 도구
설치
합성만 하려면 PyPI에서 설치하는 게 가장 간단해요. 테스트 기준은 Ubuntu 18.04 + python >= 3.9, < 3.12예요.
pip install TTS
직접 모델을 코딩·학습할 계획이면 저장소를 클론하고 로컬 설치는:
git clone https://github.com/coqui-ai/TTS
pip install -e .[all,dev,notebooks]
Python API 시작
import torch
from TTS.api import TTS
device = "cuda" if torch.cuda.is_available() else "cpu"
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2").to(device)
wav = tts.tts(text="Hello world!", speaker_wav="my/cloning/audio.wav", language="en")
tts.tts_to_file(text="Hello world!", speaker_wav="my/cloning/audio.wav", language="en", file_path="output.wav")