Piper 음성 품질 — 4단계 품질 레벨

Piper 음성 품질 — 4단계 품질 레벨

Piper의 음성은 학습된 품질 수준에 따라 x_low / low / medium / high 4단계로 나뉘어요. 같은 텍스트를 각 품질 음성으로 들으면 메모리·품질 트레이드오프를 직접 체감할 수 있어요.

출처: https://rhasspy.github.io/piper-samples/

품질 레벨

레벨 오디오 파라미터
x_low 16kHz 5-7M
low 16kHz 15-20M
medium 22.05kHz 15-20M
high 22.05kHz 28-32M

x_low는 16kHz 오디오에 57M 파라미터로 가장 가볍고, high는 22.05kHz 오디오에 2832M 파라미터로 가장 좋은 품질이에요. 저사양 기기면 낮은 레벨, 품질이 중요하면 높은 레벨을 고르면 돼요.

멀티 스피커

일부 음성은 **여러 화자(multi-speaker)**를 담고 있어서, 한 모델 안에서 여러 사람의 스타일을 잡아냈어요. 멀티 스피커 모델은 화자 전환을 빠르게 할 수 있지만, 개별 화자의 품질은 단일 화자 모델보다 조금 떨어질 수 있어요.

더 알아보기