SeamlessM4T v2 — UnitY2 아키텍처와 Transformers 사용
SeamlessM4T v2
SeamlessM4T는 음성과 텍스트를 거의 100개 언어로 고품질 번역하는 올인원 다국어·멀티모달 기계 번역 모델이에요. v2는 새로운 UnitY2 아키텍처를 적용해 음성 생성 작업에서 품질과 추론 속도를 모두 개선했어요.
지원 작업
- 음성→음성 번역 (S2ST)
- 음성→텍스트 번역 (S2TT)
- 텍스트→음성 번역 (T2ST)
- 텍스트→텍스트 번역 (T2TT)
- 자동 음성 인식 (ASR)
지원 범위
- 🎤 음성 입력 101개 언어
- 💬 텍스트 입력/출력 96개 언어
- 🔊 음성 출력 35개 언어
모델 계열
| 모델 이름 | #params |
|---|---|
| SeamlessM4T-Large v2 | 2.3B |
| SeamlessM4T-Large (v1) | 2.3B |
Transformers로 시작하기
- Transformers 라이브러리와 sentencepiece 설치:
pip install git+https://github.com/huggingface/transformers.git sentencepiece
- 파이프라인으로 간단히:
from transformers import pipeline
pipe = pipeline("automatic-speech-recognition", model="facebook/seamless-m4t-v2-large")
- 모델과 프로세서로 직접:
tokenizer = AutoTokenizer.from_pretrained("facebook/seamless-m4t-v2-large")
model = AutoModel.from_pretrained("facebook/seamless-m4t-v2-large", device_map="auto")
- 음성 샘플 생성 (타깃 언어 러시아어 예):
from transformers import AutoProcessor, SeamlessM4Tv2Model
import torchaudio
processor = AutoProcessor.from_pretrained("facebook/seamless-m4t-v2-large")
model = SeamlessM4Tv2Model.from_pretrained("facebook/seamless-m4t-v2-large")