Qwen3-2507 — Qwen3-30B-A3B-Instruct-2507 모델 카드

Qwen3-2507 — Qwen3-30B-A3B-Instruct-2507 모델 카드

Qwen3-30B-A3B-Instruct-2507은 전작 Qwen3의 비-씽킹 모드(non-thinking mode)를 업데이트한 버전이에요. 일반 능력(명령 따르기·논리 추론·텍스트 이해·수학·과학·코딩·도구 사용), 다언어 장기 지식, 사용자 취향 정렬에서 큰 개선이 있었고, 256K 토큰 장문 이해를 기본 지원해요.

출처: Qwen/Qwen3-30B-A3B-Instruct-2507

모델 구조

  • 파라미터: 총 30.5B, 활성 3.3B
  • 레이어: 48 / 어텐션 헤드(GQA): Q 32, KV 4
  • 전문가 수: 128개 중 활성 8개
  • 컨텍스트 길이: 기본 262,144 (엄밀히 native)
  • 이 모델은 비-씽킹 모드만 지원해서 thinking 블록을 출력하지 않아요. enable_thinking=False를 지정할 필요도 없어요.

배포 예시

# SGLang
python -m sglang.launch_server --model-path Qwen/Qwen3-30B-A3B-Instruct-2507 --context-length 262144

# vLLM
vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --max-model-len 262144

OOM이 나면 컨텍스트를 32,768처럼 짧게 줄이라고 문서가 안내해요.

초장문(1M 토큰) 처리

256K를 넘는 초장문을 처리할 때는 Dual Chunk Attention(DCA)MInference라는 희소 어텐션 기법을 써요. 1M 토큰에 가까운 시퀀스에서 표준 어텐션 대비 최대 3× 속도 향상을 냈어요. config.json을 config_1m.json으로 교체하고 vLLM/SGLang으로 서빙하면 되고, 이때 약 240GB GPU 메모리가 필요해요.

권장 샘플링 파라미터

Temperature=0.7, TopP=0.8, TopK=20, MinP=0을 권장해요. 대부분의 질의엔 출력 길이 16,384 토큰이면 충분하다고 해요.

더 알아보기