SeamlessM4T — 음성과 텍스트를 아우르는 올인원 번역 모델

SeamlessM4T

서로 다른 언어를 쓰는 사람이 실시간으로 대화하려면, 번역이 음성→음성·음성→텍스트·텍스트→음성·텍스트→텍스트를 한꺼번에 처리할 수 있어야 자연스러워요. SeamlessM4T는 Meta가 공개한 기초(foundational) 다국어·멀티태스크 번역 모델로, 음성 인식(약 100개 언어), 음성→텍스트 번역, 음성→음성 번역(입력 약 100개, 출력 35개(+영어) 언어), 텍스트→텍스트 번역, 텍스트→음성 번역까지 단일 모델로 지원해요. 별도의 언어 식별 모델 없이 원어를 암묵적으로 인식한다는 점도 특징이에요.

이 카테고리의 문서

  • 소개: SeamlessM4T가 어떤 작업을 하나로 묶는지
  • v2 모델: UnitY2 아키텍처와 Transformers 사용
  • 실전: 설치·추론·모델 계열

출처: https://ai.meta.com/blog/seamless-m4t/