Command Palette
Search for a command to run...
Qwen3-VL 기술 보고서
Qwen3-VL 기술 보고서
초록
우리는 현재까지 Qwen 시리즈에서 가장 강력한 비전-언어 모델인 Qwen3-VL을 소개합니다. 이 모델은 다양한 다중모달 벤치마크에서 뛰어난 성능을 기록하며, 텍스트, 이미지, 영상이 혼합된 맥락을 최대 256K 토큰까지 자연스럽게 지원합니다. 모델 패밀리는 밀도형(Dense, 2B/4B/8B/32B)과 전문가 집합형(Mixture-of-Experts, 30B-A3B/235B-A22B) 두 가지 유형으로 구성되어, 다양한 지연 시간과 품질 간의 균형을 고려한 다양한 사용 사례에 대응할 수 있습니다. Qwen3-VL은 세 가지 핵심 기능을 제공합니다: (i) 텍스트 중심 이해 능력이 크게 향상되어, 여러 경우에서 동급의 텍스트 전용 기반 모델을 능가합니다; (ii) 긴 문맥 처리 능력이 강화되어, 텍스트 및 이미지/영상이 혼합된 다중모달 입력에 대해 원본 256K 토큰 창을 내장하고 있으며, 긴 문서나 영상 내에서 정보의 충실한 유지, 검색 및 교차 참조가 가능합니다; (iii) 단일 이미지, 다중 이미지, 영상 작업 전반에 걸쳐 고도화된 다중모달 추론 능력을 발휘하며, MMMU 및 시각 수학 벤치마크(MathVista, MathVision 등)에서 선도적인 성능을 입증했습니다. 아키텍처적으로는 세 가지 주요 개선 사항을 도입했습니다: (i) 이미지와 영상 간의 공간-시간 모델링을 강화한 개선된 혼합형 MRoPE(Interleaved-MRoPE); (ii) 다수의 레벨 ViT 특징을 효과적으로 활용하여 비전-언어 간의 정렬을 강화한 DeepStack 통합; (iii) 영상에 대한 텍스트 기반 시간 정렬 기능으로, 기존 T-RoPE에서 발전하여 명시적인 텍스트 기반 타임스탬프 정렬을 도입함으로써 더 정밀한 시계열 기반 인식을 가능하게 했습니다. 동일한 토큰 예산과 지연 시간 제약 조건 하에서도 Qwen3-VL은 밀도형 및 전문가 집합형(MoE) 아키텍처 모두에서 뛰어난 성능을 달성합니다. 우리는 Qwen3-VL이 실제 워크플로우에서 이미지 기반 추론, 에이전트 기반 의사결정, 다중모달 코드 지능의 기반 엔진으로 활용될 수 있기를 기대합니다.