DeepSeek-R1 모델 둘러보기
DeepSeek-R1 모델 둘러보기
일반 LLM은 답을 바로 내놓지만, R1 은 "생각부터 하고 답한다"는 점이 달라요. DeepSeek 는 이 추론 능력을 **대규모 강화학습(RL)**으로 만들어냈어요. 그래서 수학·논리·코딩처럼 단계적 추론이 필요한 문제에서 특히 강해요.
R1 시리즈 구성
R1-Zero 는 지도 미세조정(SFT) 없이 순수 RL 만으로 훈련한 모델이에요. 여기서 다양한 추론 행동이 자연스럽게 나타났고, 그 경험을 바탕으로 만들어진 게 R1 이에요. R1 은 여러 벤치마크에서 OpenAI o1-mini 를 능가하는 결과를 보여줬어요.
| 모델 | 총 파라미터 | 활성 파라미터 | 컨텍스트 |
|---|---|---|---|
| DeepSeek-R1-Zero | 671B | 37B | 128K |
| DeepSeek-R1 | 671B | 37B | 128K |
두 모델 모두 DeepSeek-V3-Base 를 기반으로 해요.
지식 증류(distill) 모델
커뮤니티에서 쓰기 쉽도록 작은 밀집 모델로도 증류본을 공개했어요. Qwen2.5 와 Llama 3 시리즈를 베이스로 한 6종이에요.
- DeepSeek-R1-Distill-Qwen : 1.5B / 7B / 14B / 32B
- DeepSeek-R1-Distill-Llama : 8B(Llama-3.1-8B) / 70B(Llama-3.3-70B-Instruct)
작은 증류 모델치고 성능이 좋아서, 로컬에서 추론 모델을 돌려보기 좋아요.
사용 전 참고
로컬에서 R1 계열을 돌리기 전에 공식 README의 Usage Recommendation 섹션을 꼭 읽어보는 걸 권장해요. (확인 필요: 특정 사용 조건·하드웨어 권장 사항이 README에 정리돼 있어요.)
더 알아보기
- thinking mode API: api-docs.deepseek.com/guides/thinking_mode
- R1 릴리스·가격: api-docs.deepseek.com/news/news250120