Cohere Transcribe Arabic
Cohere Transcribe Arabic
Cohere Transcribe Arabic은 아랍어 오디오 입력에 최적화된 Cohere Transcribe의 파인튜닝 버전이에요. 아랍어 화자의 다양한 방언과 억양, 음향 조건을 정확히 포착하도록 설계된 모델입니다.
출처: 문서
본문
모델 소개
Cohere Transcribe Arabic은 아랍어 오디오 입력에 최적화된 Cohere Transcribe의 파인튜닝 버전이에요. Cohere Transcribe와 마찬가지로 2B 파라미터 규모의 오디오 입력, 텍스트 출력 전용 자동 음성 인식(ASR) 모델이며 오픈소스로 제공됩니다. 이 모델은 전사 과정에서 아랍어 화자들의 다양한 방언, 억양, 음향 조건을 정확하게 포착하도록 설계되었어요.
모델 세부 정보
- 입력(Input): 오디오 파형(Audio waveform)
- 출력(Output): 텍스트(Text)
- 모델 이름:
cohere-transcribe-arabic-07-2026 - 지원 언어: 아랍어(Arabic), 영어(English)
- 다중 방언 지원(Multidialectal support): 예(Yes)
- 코드 스위칭 지원(Code-switching support): 예(Yes)
- 최대 파일 크기: 25MB
- 라이선스: Apache 2.0
사용 가능 여부(Availability)
API를 통해 Cohere Transcribe Arabic을 무료로, 간단한 설정만으로 속도 제한(rate limits)에 따라 실험해볼 수 있어요.
속도 제한 없이 프로덕션에 배포하려면 전용 Model Vault를 프로비저닝하면 됩니다. 이렇게 하면 인프라를 관리하지 않고도 저지연(low-latency), 프라이빗 클라우드 추론이 가능해져요. 가격은 시간당 인스턴스(hour-instance) 기준으로 계산되며, 장기 약정 시 할인 플랜이 적용됩니다. 요구 사항을 논의하려면 저희 팀에 문의해 주세요.
강점(Strengths)
Cohere Transcribe Arabic은 아랍어 음성에 대해 최첨단(state-of-the-art) 수준의 전사 정확도를 달성해요. 이런 결과는 다양하거나 변동이 있는 오디오 입력에도 견고한데, 여기에는 이중 언어 대화(아랍어-영어), 지역 방언과 어투, 기업 특화 어휘 등이 포함됩니다.
부모 모델과 마찬가지로 Cohere Transcribe Arabic은 높은 처리량(high-throughput)의 프로덕션 추론에 최적화되어 있으며, 원거리 필드(far-field, 화자가 수신부에서 멀리 떨어진 경우) 전사 작업에서 최전선에 있어요.
주요 한계(Key Limitations)
- 타임스탬프: 이 모델은 전사본과 함께 타임스탬프를 출력하지 않아요.
- 화자 분리(speaker diarization): 여러 화자가 있는 오디오 파일에서 개별 화자를 자동으로 식별하지 않습니다.
모델 구조(Model architecture)
Cohere Transcribe는 음성에 최적화된 Transformer 변형인 Conformer를 기반으로 구축되어 있어요. 입력 오디오 파형은 Mel 스펙트로그램으로 변환된 다음, 모델 파라미터의 대부분을 담고 있는 Conformer 인코더가 처리합니다. 인코더의 표현은 가벼운 Transformer 디코더로 전달되어 텍스트 토큰을 생성해요. Cohere Transcribe는 표준 지도 학습 기반 교차 엔트로피(supervised cross-entropy)로 학습됩니다.