DeepSeek-Coder-V2 — MoE 코드 모델
DeepSeek-Coder-V2 — MoE 코드 모델
DeepSeek-Coder-V2는 오픈소스 MoE 코드 언어 모델이에요. 코드 전용 태스크에서 GPT4-Turbo에 필적하는 성능을 달성했다는 게 핵심이죠. DeepSeek-V2의 중간 체크포인트에서 추가 6T 토큰으로 계속 사전훈련해서 만들었어요.
전작 대비 개선
- 코드·추론·일반 능력에서 DeepSeek-Coder-33B보다 큰 발전
- 지원 프로그래밍 언어를 86개에서 338개로 확장
- 컨텍스트 길이를 16K에서 128K로 확장
두 가지 크기
| 모델 | 총 파라미터 | 활성 파라미터 | 컨텍스트 |
|---|---|---|---|
| DeepSeek-Coder-V2-Lite-Base/Instruct | 16B | 2.4B | 128K |
| DeepSeek-Coder-V2-Base/Instruct | 236B | 21B | 128K |
DeepSeekMoE 프레임워크 기반으로, 활성 파라미터가 총 파라미터의 아주 일부에 불과해요. 추론 비용을 크게 아낄 수 있죠.
벤치마크
코딩·수학 벤치마크에서 GPT4-Turbo, Claude 3 Opus, Gemini 1.5 Pro 같은 폐쇄형 모델보다 우수한 성능을 보여줬어요.