Qwen3-2507 — Qwen3-30B-A3B-Instruct-2507 모델 카드
Qwen3-2507 — Qwen3-30B-A3B-Instruct-2507 모델 카드
Qwen3-30B-A3B-Instruct-2507은 전작 Qwen3의 비-씽킹 모드(non-thinking mode)를 업데이트한 버전이에요. 일반 능력(명령 따르기·논리 추론·텍스트 이해·수학·과학·코딩·도구 사용), 다언어 장기 지식, 사용자 취향 정렬에서 큰 개선이 있었고, 256K 토큰 장문 이해를 기본 지원해요.
모델 구조
- 파라미터: 총 30.5B, 활성 3.3B
- 레이어: 48 / 어텐션 헤드(GQA): Q 32, KV 4
- 전문가 수: 128개 중 활성 8개
- 컨텍스트 길이: 기본 262,144 (엄밀히 native)
- 이 모델은 비-씽킹 모드만 지원해서
thinking블록을 출력하지 않아요.enable_thinking=False를 지정할 필요도 없어요.
배포 예시
# SGLang
python -m sglang.launch_server --model-path Qwen/Qwen3-30B-A3B-Instruct-2507 --context-length 262144
# vLLM
vllm serve Qwen/Qwen3-30B-A3B-Instruct-2507 --max-model-len 262144
OOM이 나면 컨텍스트를 32,768처럼 짧게 줄이라고 문서가 안내해요.
초장문(1M 토큰) 처리
256K를 넘는 초장문을 처리할 때는 Dual Chunk Attention(DCA) 와 MInference라는 희소 어텐션 기법을 써요. 1M 토큰에 가까운 시퀀스에서 표준 어텐션 대비 최대 3× 속도 향상을 냈어요. config.json을 config_1m.json으로 교체하고 vLLM/SGLang으로 서빙하면 되고, 이때 약 240GB GPU 메모리가 필요해요.
권장 샘플링 파라미터
Temperature=0.7, TopP=0.8, TopK=20, MinP=0을 권장해요. 대부분의 질의엔 출력 길이 16,384 토큰이면 충분하다고 해요.