모델 시리즈 (Dense·MoE, Instruct·Thinking)
모델 시리즈 (Dense·MoE, Instruct·Thinking)
Qwen3-VL은 Qwen 시리즈 중 가장 강력한 비전·언어 모델이에요. 이번 세대는 텍스트 이해와 생성, 더 깊은 시각 인식과 추론, 긴 컨텍스트, 공간·영상 동역학 이해, 에이전트 상호작용까지 전반적으로 업그레이드됐어요.
Dense와 MoE 두 아키텍처가 엣지부터 클라우드까지 배치 폭을 담당하고, Instruct와 추론 강화 Thinking 버전으로 나눠서 배포 시나리오에 맞게 고르게 돼 있어요. 예를 들어 추론·수학이 중요한 작업은 Thinking, 빠른 일반 대화는 Instruct가 적합해요.
주요 강화 포인트
- Visual Agent — PC·모바일 GUI를 조작해서 요소를 인식하고 기능을 이해한 뒤 도구를 호출해 작업을 완료해요.
- Visual Coding — 이미지·영상에서 Draw.io/HTML/CSS/JS를 생성해요.
- 고급 공간 인식 — 객체 위치·시점·가림을 판단하고 2D 그라운딩에 더해 3D 그라운딩까지 지원해요.
- 긴 컨텍스트·영상 이해 — 기본 256K 컨텍스트, 1M까지 확장 가능하고 책·수 시간 분량 영상을 초 단위 인덱싱으로 처리해요.
- OCR 확장 — 10개 언어에서 32개 언어로 늘었고, 저조도·블러·기울어짐에도 잘 동작해요.
아키텍처 업데이트
- Interleaved-MRoPE — 시간·너비·높이에 걸쳐 전체 주파수를 배분하는 위치 임베딩으로 긴 호라이즌 영상 추론을 강화해요.
- DeepStack — ViT의 다층 피처를 융합해 미세한 디테일을 잡고 이미지-텍스트 해상도를 높여요.
더 알아보기
- 모델 카드와 커뮤니티: https://huggingface.co/Qwen/Qwen3-VL
- Qwen 공식 문서: https://qwen.readthedocs.io/en/latest/