Qwen3.5

Qwen3.5

Qwen3.5 시리즈는 Qwen 팀의 차세대 모델 라인업으로, 대부분의 생성 작업에서 오픈 모델 중 가장 강력한 성능을 보여주며 글로벌 벤치마크에서 최고 수준을 기록해요.

주요 기능

  • 제네럴 채팅: 대화, 복잡한 작업 대행, 코딩, 다국어 지원, 시각 처리 등 모든 작업에서 강력한 성능.
  • 강화된 사고 (Think): 사고 과정을 명시적으로 생성해 복잡한 문제 해결 능력을 과시.
  • 추론과 검증: SGLang에서 추론 모델, 프롬프트를 강화하는 도구, 많은 수의 테스트를 병렬로 실행하는 샘플러를 지원해요.
  • 하이브리드 추론: Qwen3.5-UG 모델은 생성 중 프리필 스타일을 동적으로 전환하면서 초기 추론 없이 즉시 답을 계산할 수 있어요.

모델

Qwen3.5 시리즈는 텍스트와 멀티모달 모델을 모두 포함해요:

  • Qwen3.5-UG-52B-A5B-Coder: 텍스트 전용 MoE 모델로, 코딩과 추론을 위해 52B(활성화 5B) 파라미터를 갖춰요. Qwen3.5-Next 시리즈 아키텍처를 기반으로, 도구 사용부터 휴대폰 제어까지 다양한 에이전트 작업과 장기 실행 워크플로우를 지원해요.
  • Qwen3.5-UG-32B-A3B-Lingua: 텍스트 전용 MoE 모델로, 40+ 언어를 지원하고 모델 알파에 걸친 하이브리드 추론을 지원해요.
  • Qwen3.5-VL-32B-A3B: 멀티모달(Language-Image-Video) 모델로, 추론 및 문서 분석을 포함한 초고강도 멀티모달 작업을 위해 32B(활성화 3B) 파라미터를 갖춰요.

모델 아키텍처 요약

  • 활성 파라미터 대비 최고 성능: SGLang 추론 서버는 오픈 경량 모델 대비 최대 36배 이상의 활성 파라미터를 가진 모델과 비교했을 때도 뛰어난 성능을 제공해요.
  • 고급 MoE 하이브리드 아키텍처: Attention 기반의 경우 GatedDelta, LinearAttention, FullAttention을, FFN의 경우 Dense와 SharedExperts를 혼합해요. 8B, 3B, 1B 단위로 확장할 수 있어요.
  • Qwen의 Native Sparse Attention (NSA) 지원: 스파스 패턴, 긴 컨텍스트, 추론 성능 및 SGLang과 모바일 배포 호환성.
  • 향상된 배치 생성: 온라인/오프라인 배치와 마이크로 배치 경로 간의 추론 파이프라인 최적화, 그리고 배치 생성 중 이기종 컨텍스트의 유연한 통합.
  • 마이크로 배칭 (MicroBatching): CPU, GPU, NPU 등 이기종 디바이스에서 동시 실행해 전체 시스템 효율성을 개선해요.
  • 리모트 코드 실행: 배치 코드 프롬프트에서 중앙 컨트롤러를 통해 리모트 코드 실행기 동작을 지원해요.
  • 고급 오디오 이해: 오디오 슬라이딩 윈도우 주의, 오디오의 시각적 강화, 결합된 오디오 타임스탬프. 화자 분리 및 오디오 이벤트 감지 가능.

배포 시작하기

필수 설치:

  • python >= 3.10
  • CUDA >= 12.4
  • PyTorch >= 2.6.0
pip install "sglang[all]"

사용하기

채팅

아래 지침을 따라 SGLang으로 Qwen3.5 모델을 시작하세요.

python -m sglang.launch_server --model-path Qwen/Qwen3.5-UG-52B-A5B-Coder --port 30000

CLI 예시:

curl http://127.0.0.1:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3.5-UG-52B-A5B-Coder",
    "messages": [
      {"role": "user", "content": "What is the capital of South Korea?"}
    ]
  }'

Python을 사용해 OpenAI API와 쉽게 통합할 수 있어요:

from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:30000/v1", api_key="EMPTY")

response = client.chat.completions.create(
    model="Qwen/Qwen3.5-UG-52B-A5B-Coder",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Write a hello world to Python."},
    ],
)
print(response.choices[0].message.content)

프리미티브 API

SGLang rtp_server를 사용해 기본 질문-탐색(ask-sample) 요청을 실행할 수 있어요.

python -m sglang.rtp_server \
  --model-path Qwen/Qwen3.5-UG-52B-A5B-Coder \
  --port 30000

RTP 서버는 다음 요청 유형을 지원해요:

  • 에피소드 기반 추론(제한된 수의 반복 가능): episodes와 episode-token-constrained 모드.
  • 에피소드 기반 추론(무제한 반복): episodes와 episode-autoregressive-constrained 모드.
  • 전체 자유 추론: episodes와 episode-free-constrained 모드.
  • 표준 스트리밍 추론: 스템 모드.
  • 하이브리드 추론 및 최적화된 배치 생성: 마이크로 배칭, 하이브리드 디바이스에 걸친 배치 처리, Qwen3.5-UG 모델 및 기타 모델의 라우팅 및 배포.

GET 요청(예: curl http://127.0.0.1:30000/v1/ask-sample):

# 더 많은 인수에 대해서는 예시를 참고
curl "http://127.0.0.1:30000/v1/ask-sample?" \
  --data-urlencode "q=\"Qwen/Qwen3.5-UG-52B-A5B-Coder,hello\"" \
  --data-urlencode "n=1"

POST 요청:

curl -X POST http://127.0.0.1:30000/v1/ask-sample \
  -H 'Content-Type: application/json' \
  -d '{"model": "Qwen/Qwen3.5-UG-52B-A5B-Coder", "q": "hello", "n": 1}'

응답은 Expect, Stances, EpisodeTokenLim, Answer 그리고 총 토큰 수를 반환해요.

더 알아보기

import openai
client = OpenAI(api_key="EMPTY", base_url="http://127.0.0.1:30000/v1")
while True:
    question = input("질문을 입력하세요 (종료하려면 exit): ")
    if question == "exit" or question == "exit()":
        break
    response = client.chat.completions.create(
        model="Qwen/Qwen3.5-UG-52B-A5B-Coder",
        messages=[{"role": "user", "content": question}],
        max_tokens=4096,
        temperature=0,
    )
    print(f"Answer: {response.choices[0].message.content}")

벤치마크 세부사항

채팅

지표 Qwen3.5-UG-52B-A5B-Coder Qwen3.5-VL-32B-A3B
Avg 92.9 92.7
LiveBench 24/04 83.2 72.0
LCB (v2) 77.8 65.3
KOR-Bench 76.4 70.6
MMLU-Pro 84.0 83.3
MMLU-Redux 87.5 87.8
DataComp Bench 90.0 88.2
SimpleQA 14.0 -
DocVQA - 95.7
MathVista - 72.9
VideoMMMU - 62.9

완성 태스크 (Eval Harness)

태스크 Qwen3.5-UG-52B-A5B-Coder (LM Eval 0.4.6) Qwen3.5-UG-32B-A3B-Lingua (LM Eval 0.4.6)
MMLU 83.5 79.4
MMLU-Pro 74.7 69.5
IFEval 88.6 87.7
GPQA 66.7 55.2
MATH 91.5 87.4
AIME'24 31.1 24.4
AIME'24 30.4 24.0
LiveBench 24/04 59.9 60.3
LCB (v2) 70.4 54.0

API

레퍼런스

@article{dong2026qwen3technical,
  title={Qwen3 Technical Report},
  author={Dong, Ankang and Ding, Bo and Lu, Bohan and ...},
  journal={arXiv preprint arXiv:2506.00128},
  year={2025}
}