HyperAIHyperAI

Command Palette

Search for a command to run...

G2^22VLM: 통합 3D 재구성 및 공간 추론을 갖춘 기하학적 기반 비전 언어 모델

Wenbo Hu Jingli Lin Yilin Long Yunlong Ran Lihan Jiang Yifan Wang Chenming Zhu Runsen Xu Tai Wang Jiangmiao Pang

초록

시각-언어 모델(Vision-Language Models, VLMs)은 여전히 공간 지능 측면에서 강건성 부족을 보이며, 공간 이해 및 추론 과제에서 낮은 성능을 나타냅니다. 이 격차의 원인을 2차원 이미지로부터 3차원 공간을 재구성할 수 있는 시각 기하학 학습 과정의 부재로 판단하였습니다. 본 연구에서는 공간 지능의 두 핵심 요소인 공간적 3차원 재구성과 공간 이해를 연결하는 기하학 기반 시각-언어 모델인 G2^22VLM을 제안합니다. G2^22VLM은 학습된 3차원 시각 기하 특징을 자연스럽게 활용하여, 컨텍스트 내 학습(in-context learning)과 교차 추론(interleaved reasoning)을 통해 3차원 속성 직접 예측 및 공간 추론 과제의 성능 향상을 실현합니다. 본 연구의 통합 설계는 공간 이해 측면에서 매우 확장 가능하며, 다중 시점 이미지 및 영상 데이터의 풍부한 학습을 통해 3차원 시각 사전 지식(3D visual priors)의 이점을 동시에 활용할 수 있습니다. 이 사전 지식은 일반적으로 수집이 어려운 애노테이션에서만 도출될 수 있습니다. 실험 결과를 통해 G2^22VLM이 두 가지 과제 모두에서 뛰어난 성능을 발휘함을 확인하였으며, 최첨단 전방향 3차원 재구성 모델과 비교해 유사한 성능을 달성하고, 공간 이해 및 추론 과제에서는 더 우수하거나 경쟁 가능한 성능을 보였습니다. 의미적으로 강력한 VLM과 저수준의 3차원 시각 과제를 통합함으로써, G2^22VLM이 연구 공동체의 강력한 기준 모델이 되기를 기대하며, 향후 3차원 장면 편집 등 다양한 응용 가능성을 열어줄 것으로 기대합니다.


AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
G$^2$VLM: 통합 3D 재구성 및 공간 추론을 갖춘 기하학적 기반 비전 언어 모델 | 문서 | HyperAI초신경