TorToiSe 음성 커스터마이징 — 레퍼런스 클립

TorToiSe 음성 커스터마이징 — 레퍼런스 클립

Tortoise는 멀티 스피커 모델로 학습됐고, 이를 위해 **레퍼런스 클립(reference clips)**을 참고해요. 레퍼런스 클립은 화자의 녹음을 넣어주는 것으로, 출력 음성의 음높이·말투·말 속도, 심지어 발음 결점(리습·말더듬)까지 결정해요. 볼륨·배경소음·녹음 품질·리버브 같은 비(非)목소리 요소에도 영향을 줘요.

출처: https://raw.githubusercontent.com/neonbjb/tortoise-tts/master/voice_customization_guide.md

제공되는 목소리

저장소에는 여러 개의 사전 패키징 목소리가 있어요. 앞에 train_ 이 붙은 목소리는 학습 데이터에서 온 것이라 다른 것보다 훨씬 잘 나와요. 고품질 음성이 목표라면 그중 하나를 고르는 걸 권장해요. zero-shot 흉내가 궁금하다면 나머지를 살펴보면 돼요.

새 목소리 추가

  1. 화자의 오디오 클립을 모아요. 좋은 소스는 YouTube 인터뷰(youtube-dl로 받기), 오디오북, 팟캐스트예요.
  2. 클립을 약 10초 단위로 잘라요. 최소 3개가 필요하고, 많을수록 좋아요(테스트 기준 최대 5개).
  3. 클립을 부동소수점(float) 형식, 22,050 샘플레이트 WAV로 저장해요.
  4. voices/ 안에 하위 디렉터리를 만들고 그 안에 클립을 넣어요.
  5. Tortoise 유틸리티를 --voice=<your_subdirectory_name>로 실행해요.

좋은 레퍼런스 클립 고르는 팁

  • 배경음악·소음·리버브가 있는 클립은 피해요 — 이런 건 학습 데이터에서 제외됐고 Tortoise가 잘 처리하지 못해요.
  • 연설(스피치)은 증폭 시스템의 왜곡이 있어 피해요.
  • 전화 통화 녹음은 피해요.
  • 과한 말더듬·더듬거림·"uh", "like" 같은 단어가 많은 클립은 피해요.
  • 출력과 비슷한 방식으로 말하는 클립을 찾아요. 오디오북으로 듣고 싶다면 책을 읽는 클립을 찾는 식이에요.
  • 클립의 내용(텍스트)은 상관없지만, 다양한 텍스트가 더 잘 작동하는 것 같아요.

더 알아보기