Command Palette
Search for a command to run...
3EED: 3차원에서 모든 것을 기반으로 하기
3EED: 3차원에서 모든 것을 기반으로 하기
Rong Li Yuhao Dong Tianshuai Hu Ao Liang Youquan Liu Dongyue Lu Liang Pan Lingdong Kong Junwei Liang Ziwei Liu
초록
3차원 환경에서의 시각적 기반(visual grounding)은 실체화된 에이전트가 개방형 환경에서 언어로 지칭된 객체를 정확히 위치 파악하는 데 핵심적인 요소이다. 그러나 기존의 벤치마크는 실내 환경에 국한되어 있으며, 단일 플랫폼 제약과 소규모 데이터셋이라는 한계를 가지고 있다. 본 연구에서는 차량, 드론, 4족 보행 로봇 등 다양한 플랫폼에서 수집한 RGB 및 LiDAR 데이터를 포함하는 다중 플랫폼·다중 모달 3차원 기반 벤치마크인 3EED(3D Embodied Environment Dataset)을 제안한다. 본 데이터셋은 다양한 실외 환경을 대상으로 128,000개 이상의 객체와 22,000개 이상의 검증된 언어 지칭 표현을 제공하며, 기존 데이터셋 대비 10배 이상 규모가 크다. 고품질의 공간적 기반을 보장하기 위해 시각-언어 모델을 활용한 프롬프팅과 인간 검증을 결합한 확장 가능한 어노테이션 파이프라인을 개발하였다. 다중 플랫폼 간 학습을 지원하기 위해 플랫폼 인지(normalization) 기법과 다중 모달 정렬 기술을 제안하였으며, 내부 도메인 및 다중 플랫폼 평가를 위한 벤치마크 평가 프로토콜도 구축하였다. 연구 결과는 일반화 가능한 3차원 기반 학습에 있어 뚜렷한 성능 격차가 존재함을 밝히며, 이는 새로운 도전과 기회를 제시한다. 3EED 데이터셋과 벤치마크 툴킷은 언어 기반 3차원 실체화된 인지(embodied perception) 분야의 미래 연구를 촉진하기 위해 공개된다.