Qwen3 Thinking 모드 — 추론과 모드 전환

Qwen3 Thinking 모드 — 추론과 모드 전환

Qwen3의 가장 흥미로운 점은 한 모델에서 생각하기와 빠른 응답을 모두 제공한다는 거예요. 발표 블로그 제목처럼 'Think Deeper, Act Faster' — 복잡한 문제에선 깊이 생각하고, 간단한 일에선 빠르게 행동할 수 있게 설계했어요.

출처: Qwen3: Think Deeper, Act Faster

플래그십 모델

  • Qwen3-235B-A22B: 총 235B 파라미터, 활성 22B 파라미터의 대형 MoE. DeepSeek-R1, o1, o3-mini, Grok-3, Gemini-2.5-Pro 같은 최상위 모델들과 견줄 만한 성능을 보여줘요.
  • Qwen3-30B-A3B: 총 30B, 활성 3B 파라미터의 작은 MoE. 활성 파라미터가 10배인 QwQ-32B를 능가했어요.
  • Qwen3-4B: 아주 작은 밀집 모델이지만 Qwen2.5-72B-Instruct에 필적하는 성능을 냈어요.

모드 전환하기

transformers에서 apply_chat_templateenable_thinking 파라미터로 모드를 조절해요.

text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True,
    enable_thinking=True   # True가 기본값. False면 non-thinking
)

생각 내용과 실제 답변은 thinking 태그를 기준으로 분리돼요. 토큰 id 151668 response 태그라서, 출력에서 이 위치를 기준으로 나눠 파싱할 수 있어요.

컨텍스트 길이

  • 밀집 모델: 0.6B4B는 32K, 8B32B는 128K
  • MoE 모델(30B-A3B, 235B-A22B): 128K

2507 업데이트에서는 이 컨텍스트를 256K~최대 1M 토큰까지 확장하는 기능도 추가됐어요.

더 알아보기