Command Palette
Search for a command to run...
G2VLM: 통합 3D 재구성 및 공간 추론을 갖춘 기하학적 기반 비전 언어 모델
G2VLM: 통합 3D 재구성 및 공간 추론을 갖춘 기하학적 기반 비전 언어 모델
Wenbo Hu Jingli Lin Yilin Long Yunlong Ran Lihan Jiang Yifan Wang Chenming Zhu Runsen Xu Tai Wang Jiangmiao Pang
초록
시각-언어 모델(Vision-Language Models, VLMs)은 여전히 공간 지능 측면에서 강건성 부족을 보이며, 공간 이해 및 추론 과제에서 낮은 성능을 나타냅니다. 이 격차의 원인을 2차원 이미지로부터 3차원 공간을 재구성할 수 있는 시각 기하학 학습 과정의 부재로 판단하였습니다. 본 연구에서는 공간 지능의 두 핵심 요소인 공간적 3차원 재구성과 공간 이해를 연결하는 기하학 기반 시각-언어 모델인 G2VLM을 제안합니다. G2VLM은 학습된 3차원 시각 기하 특징을 자연스럽게 활용하여, 컨텍스트 내 학습(in-context learning)과 교차 추론(interleaved reasoning)을 통해 3차원 속성 직접 예측 및 공간 추론 과제의 성능 향상을 실현합니다. 본 연구의 통합 설계는 공간 이해 측면에서 매우 확장 가능하며, 다중 시점 이미지 및 영상 데이터의 풍부한 학습을 통해 3차원 시각 사전 지식(3D visual priors)의 이점을 동시에 활용할 수 있습니다. 이 사전 지식은 일반적으로 수집이 어려운 애노테이션에서만 도출될 수 있습니다. 실험 결과를 통해 G2VLM이 두 가지 과제 모두에서 뛰어난 성능을 발휘함을 확인하였으며, 최첨단 전방향 3차원 재구성 모델과 비교해 유사한 성능을 달성하고, 공간 이해 및 추론 과제에서는 더 우수하거나 경쟁 가능한 성능을 보였습니다. 의미적으로 강력한 VLM과 저수준의 3차원 시각 과제를 통합함으로써, G2VLM이 연구 공동체의 강력한 기준 모델이 되기를 기대하며, 향후 3차원 장면 편집 등 다양한 응용 가능성을 열어줄 것으로 기대합니다.