SeamlessM4T 실전 — 설치와 추론 명령어
SeamlessM4T 실전 — 설치와 추론
SeamlessM4T는 fairseq2 기반으로 동작해. 추론은 m4t_predict 명령줄 도구로 아주 쉽게 시작할 수 있어요. 먼저 전제 조건인 fairseq2가 필요해요. fairseq2는 Linux x86-64와 Apple 실리콘 Mac 전용 프리빌드 패키지를 제공하고, libsndfile 의존성이 필요할 수 있어요.
출처: https://github.com/facebookresearch/seamless_communication
S2ST (음성→음성 번역)
m4t_predict <path_to_input_audio> --task s2st --tgt_lang <tgt_lang> --output_path <path_to_save_audio>
T2TT (텍스트→텍스트 번역)
m4t_predict <input_text> --task t2tt --tgt_lang <tgt_lang> --src_lang <src_lang>
Seamless 확장 패밀리
- SeamlessExpressive — 운율(prosody)·목소리 스타일을 언어 간에 보존하는 모델
- SeamlessStreaming — 약 100개 언어의 동시통역·스트리밍 ASR
- 이 둘을 결합한 Seamless가 실시간·표현적 번역 통합 모델이에요.
Unity.cpp로 GGML에서 실행
SeamlessM4T 모델을 GGML(C 텐서 라이브러리)로 실행하려면 unity.cpp를 써요.
./ggml/bin/unity --model seamlessM4T_medium.ggml input.wav
평가·파인튜닝
- 평가: m4t/evaluate README
- 파인튜닝: m4t/finetune README
SeamlessM4T v1에는 온디바이스용 작은 모델(281M)도 함께 공개돼 있어요.
라이선스
SeamlessM4T(v1/v2)와 SeamlessStreaming 모델은 CC-BY-NC 4.0 라이선스로 배포돼요.