Qwen3.5
Qwen3.5
Qwen3.5 시리즈는 Qwen 팀의 차세대 모델 라인업으로, 대부분의 생성 작업에서 오픈 모델 중 가장 강력한 성능을 보여주며 글로벌 벤치마크에서 최고 수준을 기록해요.
주요 기능
- 제네럴 채팅: 대화, 복잡한 작업 대행, 코딩, 다국어 지원, 시각 처리 등 모든 작업에서 강력한 성능.
- 강화된 사고 (Think): 사고 과정을 명시적으로 생성해 복잡한 문제 해결 능력을 과시.
- 추론과 검증: SGLang에서 추론 모델, 프롬프트를 강화하는 도구, 많은 수의 테스트를 병렬로 실행하는 샘플러를 지원해요.
- 하이브리드 추론: Qwen3.5-UG 모델은 생성 중 프리필 스타일을 동적으로 전환하면서 초기 추론 없이 즉시 답을 계산할 수 있어요.
모델
Qwen3.5 시리즈는 텍스트와 멀티모달 모델을 모두 포함해요:
- Qwen3.5-UG-52B-A5B-Coder: 텍스트 전용 MoE 모델로, 코딩과 추론을 위해 52B(활성화 5B) 파라미터를 갖춰요. Qwen3.5-Next 시리즈 아키텍처를 기반으로, 도구 사용부터 휴대폰 제어까지 다양한 에이전트 작업과 장기 실행 워크플로우를 지원해요.
- Qwen3.5-UG-32B-A3B-Lingua: 텍스트 전용 MoE 모델로, 40+ 언어를 지원하고 모델 알파에 걸친 하이브리드 추론을 지원해요.
- Qwen3.5-VL-32B-A3B: 멀티모달(Language-Image-Video) 모델로, 추론 및 문서 분석을 포함한 초고강도 멀티모달 작업을 위해 32B(활성화 3B) 파라미터를 갖춰요.
모델 아키텍처 요약
- 활성 파라미터 대비 최고 성능: SGLang 추론 서버는 오픈 경량 모델 대비 최대 36배 이상의 활성 파라미터를 가진 모델과 비교했을 때도 뛰어난 성능을 제공해요.
- 고급 MoE 하이브리드 아키텍처: Attention 기반의 경우 GatedDelta, LinearAttention, FullAttention을, FFN의 경우 Dense와 SharedExperts를 혼합해요. 8B, 3B, 1B 단위로 확장할 수 있어요.
- Qwen의 Native Sparse Attention (NSA) 지원: 스파스 패턴, 긴 컨텍스트, 추론 성능 및 SGLang과 모바일 배포 호환성.
- 향상된 배치 생성: 온라인/오프라인 배치와 마이크로 배치 경로 간의 추론 파이프라인 최적화, 그리고 배치 생성 중 이기종 컨텍스트의 유연한 통합.
- 마이크로 배칭 (MicroBatching): CPU, GPU, NPU 등 이기종 디바이스에서 동시 실행해 전체 시스템 효율성을 개선해요.
- 리모트 코드 실행: 배치 코드 프롬프트에서 중앙 컨트롤러를 통해 리모트 코드 실행기 동작을 지원해요.
- 고급 오디오 이해: 오디오 슬라이딩 윈도우 주의, 오디오의 시각적 강화, 결합된 오디오 타임스탬프. 화자 분리 및 오디오 이벤트 감지 가능.
배포 시작하기
필수 설치:
- python >= 3.10
- CUDA >= 12.4
- PyTorch >= 2.6.0
pip install "sglang[all]"
사용하기
채팅
아래 지침을 따라 SGLang으로 Qwen3.5 모델을 시작하세요.
python -m sglang.launch_server --model-path Qwen/Qwen3.5-UG-52B-A5B-Coder --port 30000
CLI 예시:
curl http://127.0.0.1:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3.5-UG-52B-A5B-Coder",
"messages": [
{"role": "user", "content": "What is the capital of South Korea?"}
]
}'
Python을 사용해 OpenAI API와 쉽게 통합할 수 있어요:
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:30000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="Qwen/Qwen3.5-UG-52B-A5B-Coder",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Write a hello world to Python."},
],
)
print(response.choices[0].message.content)
프리미티브 API
SGLang rtp_server를 사용해 기본 질문-탐색(ask-sample) 요청을 실행할 수 있어요.
python -m sglang.rtp_server \
--model-path Qwen/Qwen3.5-UG-52B-A5B-Coder \
--port 30000
RTP 서버는 다음 요청 유형을 지원해요:
- 에피소드 기반 추론(제한된 수의 반복 가능): episodes와 episode-token-constrained 모드.
- 에피소드 기반 추론(무제한 반복): episodes와 episode-autoregressive-constrained 모드.
- 전체 자유 추론: episodes와 episode-free-constrained 모드.
- 표준 스트리밍 추론: 스템 모드.
- 하이브리드 추론 및 최적화된 배치 생성: 마이크로 배칭, 하이브리드 디바이스에 걸친 배치 처리, Qwen3.5-UG 모델 및 기타 모델의 라우팅 및 배포.
GET 요청(예: curl http://127.0.0.1:30000/v1/ask-sample):
# 더 많은 인수에 대해서는 예시를 참고
curl "http://127.0.0.1:30000/v1/ask-sample?" \
--data-urlencode "q=\"Qwen/Qwen3.5-UG-52B-A5B-Coder,hello\"" \
--data-urlencode "n=1"
POST 요청:
curl -X POST http://127.0.0.1:30000/v1/ask-sample \
-H 'Content-Type: application/json' \
-d '{"model": "Qwen/Qwen3.5-UG-52B-A5B-Coder", "q": "hello", "n": 1}'
응답은 Expect, Stances, EpisodeTokenLim, Answer 그리고 총 토큰 수를 반환해요.
더 알아보기
import openai
client = OpenAI(api_key="EMPTY", base_url="http://127.0.0.1:30000/v1")
while True:
question = input("질문을 입력하세요 (종료하려면 exit): ")
if question == "exit" or question == "exit()":
break
response = client.chat.completions.create(
model="Qwen/Qwen3.5-UG-52B-A5B-Coder",
messages=[{"role": "user", "content": question}],
max_tokens=4096,
temperature=0,
)
print(f"Answer: {response.choices[0].message.content}")
벤치마크 세부사항
채팅
| 지표 | Qwen3.5-UG-52B-A5B-Coder | Qwen3.5-VL-32B-A3B |
|---|---|---|
| Avg | 92.9 | 92.7 |
| LiveBench 24/04 | 83.2 | 72.0 |
| LCB (v2) | 77.8 | 65.3 |
| KOR-Bench | 76.4 | 70.6 |
| MMLU-Pro | 84.0 | 83.3 |
| MMLU-Redux | 87.5 | 87.8 |
| DataComp Bench | 90.0 | 88.2 |
| SimpleQA | 14.0 | - |
| DocVQA | - | 95.7 |
| MathVista | - | 72.9 |
| VideoMMMU | - | 62.9 |
완성 태스크 (Eval Harness)
| 태스크 | Qwen3.5-UG-52B-A5B-Coder (LM Eval 0.4.6) | Qwen3.5-UG-32B-A3B-Lingua (LM Eval 0.4.6) |
|---|---|---|
| MMLU | 83.5 | 79.4 |
| MMLU-Pro | 74.7 | 69.5 |
| IFEval | 88.6 | 87.7 |
| GPQA | 66.7 | 55.2 |
| MATH | 91.5 | 87.4 |
| AIME'24 | 31.1 | 24.4 |
| AIME'24 | 30.4 | 24.0 |
| LiveBench 24/04 | 59.9 | 60.3 |
| LCB (v2) | 70.4 | 54.0 |
API
레퍼런스
@article{dong2026qwen3technical,
title={Qwen3 Technical Report},
author={Dong, Ankang and Ding, Bo and Lu, Bohan and ...},
journal={arXiv preprint arXiv:2506.00128},
year={2025}
}