Qwen3-VL (비전·언어 모델)
Qwen3-VL (비전·언어 모델)
Qwen3-VL은 Qwen 팀(Alibaba Cloud)이 만든 비전·언어 멀티모달 모델 시리즈예요. Dense 아키텍처와 MoE 아키텍처, Instruct 버전과 추론 강화 Thinking 버전까지 폭넓게 제공해서 엣지부터 클라우드까지 배치 폭이 넓죠.
이 세대는 텍스트 이해·생성은 물론 시각 인식과 추론, 긴 컨텍스트, 공간·영상 동역학 이해, 에이전트 상호작용까지 전반적으로 올라간 게 특징이에요. 특히 PC·모바일 GUI를 조작하는 Visual Agent, 32개 언어 OCR, 1M까지 확장 가능한 256K 컨텍스트 같은 기능이 두드러져요.
핵심 개념
- Visual Agent — 화면 요소 인식·도구 호출로 작업 완료
- Interleaved-MRoPE — 시공간 위치 임베딩으로 영상 추론 강화
- DeepStack — 다층 ViT 피처 융합으로 미세 디테일 포착
- Dense/MoE + Instruct/Thinking — 배포 시나리오별 선택
이 카테고리의 문서
- 모델 시리즈: Dense·MoE, Instruct·Thinking 변형 개요
- 아키텍처: MRoPE, DeepStack 등 주요 설계
- Transformers 사용법: from_pretrained·AutoProcessor 로딩