DeepSeek Coder 개요 — 시리즈와 훈련

DeepSeek Coder 개요 — 시리즈와 훈련

DeepSeek Coder는 1B~33B 크기의 코드 모델 시리즈예요. 1B, 5.7B, 6.7B, 33B 크기로 제공되고, 여러 언어와 다양한 벤치마크에서 오픈소스 코드 모델 중 최첨단 성능을 달성했어요.

출처: deepseek-ai/DeepSeek-Coder

핵심 특징

  • 대규모 훈련 데이터: 2T 토큰, 87% 코드 + 13% 영어·중국어 언어 데이터
  • 유연한 크기: 1B / 5.7B / 6.7B / 33B
  • 높은 성능: HumanEval, MultiPL-E, MBPP, DS-1000, APPS에서 최상위
  • 프로젝트 수준 완성: 16K 윈도우 + fill-in-the-blank 태스크로 프로젝트 코드 완성·채우기 지원

성능 결과

DeepSeek-Coder-Base-33B는 CodeLlama-34B보다 HumanEval Python 7.9%, HumanEval Multilingual 9.3%, MBPP 10.8%, DS-1000 5.9% 앞섰어요. 특히 7B가 CodeLlama-34B 성능에 도달했고, 지시 튜닝된 Instruct-33B는 HumanEval에서 GPT-3.5-turbo를 능가했어요.

데이터 생성·훈련 절차

  1. GitHub에서 코드 수집 후 StarCoder Data와 같은 필터 규칙 적용
  2. 저장소 내 파일 의존성을 파싱해 파일 위치 재배치
  3. 의존 파일을 연결해 단일 예시로 만들고 repo-level minhash로 중복 제거
  4. 문법 오류·가독성 낮은 저품질 코드 추가 필터링

훈련은 1) 87% 코드·10% 코드 관련 언어·3% 비코드 중국어로 1.8T 토큰·4K 윈도우 사전훈련 → 2) 16K 윈도우로 200B 토큰 추가 사전훈련 → 3) 2B 토큰 지시 데이터로 파인튜닝 순서로 진행돼요.

더 알아보기