SeamlessM4T 소개 — 다국어·멀티모달 음성 번역의 기초 모델
SeamlessM4T 소개
기존 음성 번역은 음성→음성 작업을 여러 하위 시스템으로 나눠 단계별로 처리했는데, 각 시스템은 보통 한 가지 모달리티에만 강하고 언어 커버리지도 제한적이었어요. SeamlessM4T는 이런 분절을 해소하기 위해 만든 다국어·멀티태스크 번역 모델로, 음성과 텍스트를 넘나드는 번역·전사를 하나의 모델에서 처리해요.
지원 작업
- 자동 음성 인식(ASR): 약 100개 언어
- 음성→텍스트 번역(S2TT): 약 100개 입력·출력 언어
- 음성→음성 번역(S2ST): 약 100개 입력, 35개(+영어) 출력 언어
- 텍스트→텍스트 번역(T2TT): 약 100개 언어
- 텍스트→음성 번역(T2ST): 약 100개 입력, 35개(+영어) 출력 언어
오픈 사이언스 철학에 따라 CC BY-NC 4.0 라이선스로 공개돼요. 모든 연구는 차세대 시퀀스 모델링 라이브러리인 fairseq2로 뒷받침돼요.
접근 방식
단일 모델을 만들기 위해 fairseq를 재설계한 fairseq2가 동력을 제공해요. 데이터 스케일링 측면에서는 200개 언어용 다국어·멀티모달 텍스트 임베딩 공간인 SONAR(Sentence-level mOdality- aNd language-agnostic RepresentatiOns)를 구축했어요. 교사-학생(teacher-student) 접근으로 이 임베딩 공간을 음성 모달리티로 확장해 현재 36개 언어를 커버해요.
웹 데이터(수백억 문장)와 음성(400만 시간)에서 마이닝해 총 443,000시간 이상의 음성-텍스트 정렬과 약 29,000시간의 음성-음성 정렬을 자동 생성했어요.
성능
거의 100개 언어에 걸쳐 ASR·S2TT·S2ST·T2ST·T2TT를 모두 포함한 벤치마크에서 최신(state-of-the-art) 결과를 달성했고, 영어·스페인어·독일어 같은 고자원 언어에서도 강한 성능을 유지해요. 원어(source language)는 별도 언어 식별 모델 없이 암묵적으로 인식해요.