Cohere의 Command A+ 모델
Cohere의 Command A+ 모델
Command A+는 25B 활성·218B 전체 파라미터를 가진 Mixture of Experts(MoE) 모델로, 에이전트형·추론·비전·다국어 작업에서 뛰어난 성능을 보여줘요.
출처: 문서
본문
설명(Description)
Command A+는 Cohere의 첫 번째 Mixture of Experts(MoE) 모델로, 강력한 에이전트형 모델의 힘을 모으고 입력에서 비전과 텍스트를 지원하며, 언어 지원을 유럽 연합 공식 언어 전체를 포함한 48개 언어로 확장했어요. MoE 아키텍처 덕분에 이 모델은 높은 정확도의 사용자 경험을 제공하면서도, 엔터프라이즈가 인스턴스당 필요한 GPU 수를 최소화하는 높은 처리량, 저지연 솔루션의 필요성을 균형 잡아 1xB200 / 2xH100 지원을 제공합니다.
Command A+는 무엇에 사용할 수 있나요?
Command A+는 다음에 특히 뛰어나요:
- 복잡한 멀티모달 에이전트형 작업: 혼합 모달리티(비전/텍스트) 입력으로, 모델이 자율적으로 행동하고 환경과 상호작용하며 복잡한 작업을 해결할 수 있어요.
- 다국어 작업: 48개 언어 지원과 이 모델의 추론, 에이전트형 문제 해결, 비전 처리 능력이 결합해, Command A+는 지원 언어 수를 늘릴 뿐만 아니라 전 세계 엔터프라이즈가 Cohere 모델로 할 수 있는 일을 확장합니다.
- 정확도와 효율성의 균형: 단일 B200 또는 두 개의 H100 칩만으로 모델 배포를 지원하고, 추론·이미지 처리·에이전트형 작업에서 Command A 패밀리의 나머지 모델들보다 크게 개선된 Command A+는 Command A 패밀리에서 단연 가장 빠르고 성능이 뛰어난 모델이에요.
토큰 예산, thinking 연산 활성화/비활성화 등에 대해 더 이야기할 내용이 있는데, 이는 전용 Reasoning 가이드에서 확인할 수 있어요.
일반 사항(General)
- 모델 제공자 이름: Cohere Inc.
- 출시일(Release Date): 2026년 5월 20일(May 20, 2026)
- 모델 의존성(Model dependencies): 해당 없음(N/A)
- 연락처(Contact): [email protected]
모델 속성(Model Properties)
- 모델 아키텍처: Command A+는 희소 혼합 전문가(sparse mixture-of-experts) 모델이에요.
- 입력 모달리티(Input modalities): 텍스트, 이미지
- 출력 모달리티(Output modalities): 텍스트
- 모델 크기(Model Size): 전체 218B, 활성 25B
배포 및 기술 통합(Distribution and Technical Integration)
- Cohere 배포(Cohere Deployment): 배포 옵션(Deployment options)은 배포 유형 또는 플랫폼에 적용되는 사용 약관의 적용을 받아요. 사용은 고객과의 상업 계약에 명시된 제한(Cohere의 사용 정책(Usage Policy) 포함)을 따릅니다.
- 오픈소스 배포(Open Source Deployment): Command A+는 Hugging Face에서 Apache 2.0 라이선스로 제공됩니다.
- 기술 통합 및 필요 소프트웨어(있는 경우): Cohere 배포의 경우 Command A+ 시작하기에 관한 설치 가이드(Installation Guide)를 참고하세요. 오픈소스 배포의 경우 HuggingFace 페이지에서 안내를 확인할 수 있어요.
- 필요 하드웨어(Required Hardware): W4A4 기준 1× B200 또는 W4A4 기준 2× H100
모델 데이터 및 학습(Model Data and Training)
-
사전학습(Pre-training): 이 모델은 자기지도 학습(self-supervised learning)을 통해 대규모의 라벨 없는 데이터 컬렉션에서 여러 언어에 걸친 일반적인 패턴, 구문, 의미론을 학습했어요.
-
후속학습(Post-training): 후속 학습 과정에서는 라벨이 지정된 데이터셋을 사용해 지도 파인튜닝(SFT, supervised fine-tuning)과 강화학습(RL, reinforcement learning) 기법으로 광범위한 도메인과 능력에 걸친 모델 성능을 최대화했어요.
-
데이터(Data): 사전학습과 후속학습 모두에서 다양한 데이터 소스와 모달리티가 사용되는데, 여기에는 공개적으로 이용 가능한 정보에서 비롯된 텍스트·이미지 콘텐츠, Cohere가 인간 주석 또는 합성 데이터를 포함한 자동화 수단으로 개발·생성한 독점 데이터셋, 전문 데이터 공급업체에서 비롯된 데이터셋이 포함됩니다. 대부분의 경우 Cohere 고객은 자체 환경에서 Cohere 모델을 사용하므로, Cohere는 모델에 제출된 입력에 접근할 수 없으며 이를 모델 학습에 사용하지 않아요. Cohere가 호스팅하는 환경에서 Cohere 모델을 사용하면서 얻은 비식별 데이터(예: 사용자 입력)는 사용자 제어권과 Cohere의 관련 서비스 약관이 허용하는 제한적인 상황에서 사용될 수 있습니다.
-
학습 데이터 처리(Training Data Processing): Cohere는 중복 제거(deduplication), 유해 또는 유해한 콘텐츠 필터링, 품질 필터링 등 데이터 품질과 학습 적합성을 보장하기 위한 다양한 기법을 사용해요.
-
EU AI Act 제53(1)(d)조:
학습 콘텐츠 공개 요약(Public Summary of Training Content)