SeamlessM4T 실전 — 설치와 추론 명령어

SeamlessM4T 실전 — 설치와 추론

SeamlessM4T는 fairseq2 기반으로 동작해. 추론은 m4t_predict 명령줄 도구로 아주 쉽게 시작할 수 있어요. 먼저 전제 조건인 fairseq2가 필요해요. fairseq2는 Linux x86-64와 Apple 실리콘 Mac 전용 프리빌드 패키지를 제공하고, libsndfile 의존성이 필요할 수 있어요.

출처: https://github.com/facebookresearch/seamless_communication

S2ST (음성→음성 번역)

m4t_predict <path_to_input_audio> --task s2st --tgt_lang <tgt_lang> --output_path <path_to_save_audio>

T2TT (텍스트→텍스트 번역)

m4t_predict <input_text> --task t2tt --tgt_lang <tgt_lang> --src_lang <src_lang>

Seamless 확장 패밀리

  • SeamlessExpressive — 운율(prosody)·목소리 스타일을 언어 간에 보존하는 모델
  • SeamlessStreaming — 약 100개 언어의 동시통역·스트리밍 ASR
  • 이 둘을 결합한 Seamless가 실시간·표현적 번역 통합 모델이에요.

Unity.cpp로 GGML에서 실행

SeamlessM4T 모델을 GGML(C 텐서 라이브러리)로 실행하려면 unity.cpp를 써요.

./ggml/bin/unity --model seamlessM4T_medium.ggml input.wav

평가·파인튜닝

SeamlessM4T v1에는 온디바이스용 작은 모델(281M)도 함께 공개돼 있어요.

라이선스

SeamlessM4T(v1/v2)와 SeamlessStreaming 모델은 CC-BY-NC 4.0 라이선스로 배포돼요.

더 알아보기