DeepSeek-Coder-V2 — MoE 코드 모델

DeepSeek-Coder-V2 — MoE 코드 모델

DeepSeek-Coder-V2는 오픈소스 MoE 코드 언어 모델이에요. 코드 전용 태스크에서 GPT4-Turbo에 필적하는 성능을 달성했다는 게 핵심이죠. DeepSeek-V2의 중간 체크포인트에서 추가 6T 토큰으로 계속 사전훈련해서 만들었어요.

출처: deepseek-ai/DeepSeek-Coder-V2

전작 대비 개선

  • 코드·추론·일반 능력에서 DeepSeek-Coder-33B보다 큰 발전
  • 지원 프로그래밍 언어를 86개에서 338개로 확장
  • 컨텍스트 길이를 16K에서 128K로 확장

두 가지 크기

모델 총 파라미터 활성 파라미터 컨텍스트
DeepSeek-Coder-V2-Lite-Base/Instruct 16B 2.4B 128K
DeepSeek-Coder-V2-Base/Instruct 236B 21B 128K

DeepSeekMoE 프레임워크 기반으로, 활성 파라미터가 총 파라미터의 아주 일부에 불과해요. 추론 비용을 크게 아낄 수 있죠.

벤치마크

코딩·수학 벤치마크에서 GPT4-Turbo, Claude 3 Opus, Gemini 1.5 Pro 같은 폐쇄형 모델보다 우수한 성능을 보여줬어요.

더 알아보기