NeMo Speech 저장소 — ASR·TTS·음성 LLM
NeMo Speech 저장소
NVIDIA NeMo 저장소는 최근 음성·오디오·멀티모달 LLM에 집중하면서, 음성 AI를 위한 연구·프로덕션 툴킷으로 재편됐어요. 개발 방향을 알면 스피치 파이프라인을 어떻게 쓸지 잡힐 거예요.
NeMo Speech가 만드는 것
NVIDIA NeMo Speech는 자동 음성 인식(ASR), 텍스트 음성 합성(TTS), Speech LLM을 연구하는 연구자와 PyTorch 개발자를 위해 만들어졌어요. 기존 코드와 사전학습 모델 체크포인트를 활용해 새 AI 모델을 효율적으로 만들고 커스터마이즈하고 배포하게 도와줘요.
기술 문서는 NeMo Framework User Guide에서 볼 수 있어요.
대표 모델·업데이트
- Parakeet-unified-en-0.6b — 영어 오프라인·스트리밍(최소 지연 160ms) 추론, 문장 부호·대문자 지원
- Nemotron-Speech-Streaming — 하나의 체크포인트로 지연-정확도 파레토 곡선에서 원하는 지점 선택
- Parakeet V3 / Canary V2 — 25개 유럽 언어 음성 인식·번역
- Nemotron 3 VoiceChat — 네모트론 나노 v2 LLM 백본 + 스피치·TTS 디코더로 full-duplex 대화
요구사항
- Python 3.12 이상
- PyTorch 2.6 이상
- NVIDIA GPU (모델 훈련 시)
PyTorch 2.6부터 torch.load는 기본 weights_only=True예요. 일부 체크포인트는 weights_only=False가 필요할 수 있고, 이 경우 코드 실행 전에 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1 환경 변수를 설정할 수 있어요. 신뢰할 수 없는 소스에서 weights only 이상을 로드하면 임의 코드 실행 위험이 있으니 주의해요.
설치
pip install 'nemo-toolkit[all]'
CUDA 12.x/13.x 추가 의존성은 pip install 'nemo-toolkit[all,cu12]' 또는 pip install 'nemo-toolkit[all,cu13]'로 설치해요.