DeepSeek-V3 모델 요약과 다운로드
DeepSeek-V3 모델
DeepSeek-V3는 671B 총 파라미터, 토큰당 37B 활성의 MoE 언어 모델이에요. 사전 훈련은 14.8T 토큰의 다양하고 고품질 데이터로 진행됐고, 이후 SFT(지도 파인튜닝)와 RL(강화학습) 단계로 능력을 끌어올렸어요.
성능
- 오픈소스 모델 중에서 우수한 성능을 보이고, 주요 클로즈드소스 모델과 견줄 만한 성과
- 사후 훈련(post-training)에는 **DeepSeek-R1의 지식 증류(knowledge distillation)**를 도입
다운로드
체크포인트는 저장소의 모델 다운로드 섹션과 Hugging Face에서 받을 수 있어요. 671B 규모라 배포에는 상당한 GPU 메모리가 필요해요.
라이선스
저장소의 License 섹션에서 확인할 수 있어요. 오픈웨이트로 공개되어 있어 연구·상업적으로 사용하는 흐름이 많아요.