HyperAIHyperAI

Command Palette

Search for a command to run...

GST-Bench:视觉语言模型能否从视频中形成全局空间感知?

Qifeng Zhang Kaixiang Huang Heng Dong Huang Fang Junting Chen Junjie Zhu Yonghang Chen Zhiyu Zhang Wei Li

摘要

空间智能是具身智能体的基础,然而现有基准主要关注单一或少数视角下的局部空间感知,忽视了在连续、长时程视觉流上的全局空间意识。为弥补这一不足,我们提出了全局时空基准(GST-Bench),这是一个针对视频理解中全局空间智能的视觉问答基准,包含源自 6,790 分钟合成视频并经人工验证的问题。该基准要求模型从输入视频中未曾出现的新视角进行精确的空间推理,并将自我中心观察映射到全局俯视图像上。对 22 个当前最先进的视觉语言模型的全面评估揭示了模型与人类之间的显著差距:最强的零样本模型仅获得 42.68 分,远低于人类的 79.08 分。为探究这一差距的成因,我们构建了 GST-Bench-Local,发现尽管模型在相同任务形式下具备较强的局部空间理解能力,却仍无法将长时程观察整合为全局一致的场景表征。此外,我们还提供了用于全局空间推理的数据集 GST-Train,作为辅助资源以促进该挑战的未来研究。

一句话总结

来自字节跳动 Seed、浙江大学和新加坡国立大学的研究者推出了 GST-Bench,一个基于 6,7906,7906,790 分钟合成视频和人工验证问题构建的视频问答基准测试。该基准通过要求模型从新视角进行精确空间推理,并将长时间以自我为中心的观察映射到全局俯视图像上,评估全局空间意识。结果暴露出巨大差距:最强的零样本模型仅获得 42.6842.6842.68 分,而人类得分为 79.0879.0879.08。他们进一步使用 GST-Bench-Local 进行研究,发现在相同任务形式下模型虽有强大的局部空间理解能力,却无法将长时间观察整合为全局一致的场景表征,并进一步提供 GST-Train 作为训练资源以推动未来研究。

核心贡献

  • GST-Bench 是一个基于 6,790 分钟合成视频构建的视频 VQA 基准,通过要求模型从输入中未见的新视角回答空间问题,并将以自我为中心的观察映射到俯视图像,评估全局空间智能。
  • 对 22 个最先进 VLM 的评估揭示了巨大的性能差距:最强的零样本模型准确率仅为 42.68,远低于人类得分 79.08。
  • GST-Bench-Local 变体表明,尽管在相同任务形式下模型拥有强大的局部空间理解能力,却无法将长时间观察整合为全局一致的场景表征;配套的 GST-Train 数据集被提供以支持对此挑战的未来研究。

引言

视觉语言模型 (VLM) 必须为具身任务(如家用机器人取物品)构建全局一致的空间表征,其中 agent 必须将长时间以自我为中心的视频流整合成对整个场景的连贯理解。以往的基准测试有不足:单图像或少视角评估仅探究局部特性,而现有的基于视频的基准测试常包含可通过单帧回答的问题,依赖粗粒度的分类指标(如左/右),而非精确的数值角度,并且不测试以自我为中心的观察与显式全局布局(如俯视地图)之间的对齐。作者通过 GST-Bench 弥补了这些不足,这是一个视频问答基准,通过确保目标物体在查询视角下不可见、要求精确的数值答案(距离和角度)以及引入俯视图像评估全局-局部对应性,强制进行跨帧全局推理。他们还提供了 GST-Train,一个大规模训练数据集,通过微调使性能超越了最强的零样本专有模型,证明了空间推理差距可以被系统性地缩小。

数据集

作者引入了 GST-Bench,一个用于评估视觉语言模型 (VLM) 是否能从长时间以自我为中心的视频中形成全局一致空间表征的基准。它配有一个独立的训练集 GST-Train,该训练集通过相同流程构建,但使用分离的室内仿真场景以防止泄漏。以下是数据集组成、处理和使用方法的总结。

1. 数据来源和总体构成

  • 所有数据均由多种室内 3D 仿真资源生成:BEHAVIOR-1K、HyperSim、ArtVIP 以及其他自定义场景。这确保了房间布局、物体布置和可导航结构的广泛变化。
  • GST-Bench 包含 2,762 对经过人工验证的问答对,按照三项核心能力组织为 12 种任务类型:自身定位、物体定位和场景结构理解。
  • GST-Train 提供基于保留场景构建的训练样本(其规模与混合比例的细节在本文摘录中未说明)。

2. 输入模态与任务设计 该基准使用五种视觉输入类型探究空间推理:

  • 探索视频 – 对整个场景的长时间以自我为中心的遍历;空间记忆的主要来源。
  • 物体标注视频 – 在目标物体出现的每一帧上叠加红色边界框的探索视频;用于视觉物体定位任务。
  • 短轨迹视频 – 来自独立探索路径的片段;仅用于轨迹选择任务。
  • 俯视图像 – 以三种抽象层次渲染:
    • 简单:逼真的鸟瞰视图(移除天花板)。
    • 中等:占用地图风格(物体轮廓,无纹理)。
    • 困难:纯粹平面图(仅墙壁)。
  • 当前视图 – 来自 不在 探索轨迹上的视点的一张新颖的以自我为中心的图像;对于物体定位任务,该视图保证目标物体不存在,强制跨帧推理。

这些输入组合成以下任务组:

  • 自身定位:给定探索视频和一张新颖的当前视图,预测相机在中等俯视图像上的位置或朝向。
  • 物体定位:推断目标物体的位置,指定方式可以是类别名称(语义模态)或物体标注视频(视觉模态)。任务包括以自我为中心的方向、距离以及中等俯视地图上的全局位置。
  • 场景结构理解:将探索视频匹配到四个候选俯视图像中的正确图像(三个难度层次),或将短轨迹视频匹配到叠加在俯视地图上的四条候选轨迹之一。

3. 数据生成流水线 该流水线通过构建强制全局推理,并结合自动生成与人工验证。

  • 场景准备:为 GST-Bench 和 GST-Train 分别预留场景以避免泄漏。
  • 探索视频:在可导航区域内采样视点,连接成高效的遍历路线,并渲染为 RGB 视频。每个场景创建多条起点各异的轨迹。
  • 物体标注视频:通过实例/语义分割识别目标物体,在实例可见的每一帧上叠加边界框,从而提供实例级别的视觉目标指定。
  • 短轨迹视频:单独收集的轨迹被分割成短片段。
  • 俯视图像:每个场景渲染三个层次(简单、中等、困难)。
  • 当前视图:以独立朝向采样偏离轨迹的视点。仅当该视图与探索视频有足够的视觉重叠以使得定位成为可能时,才保留该视图;对于物体定位任务,目标物体必须不存在。
  • 问答生成与自动过滤:答案直接从仿真几何(位姿、投影、场景/轨迹标识)计算。过滤器移除具有无效投影、模糊可见性、视图重叠不足或退化选择的样本。
  • 人工验证:标注者人工确认可回答性:检查目标物体在提供的视频中是否可识别,以及给定探索视频后是否能定位偏离轨迹的当前视图。未通过检查的样本被丢弃,最终得到 2,762 个问题的基准测试。

4. 数据在模型中的使用方式

  • 该论文以零样本方式在 GST-Bench 上评估 VLM:为模型提供特定任务的输入(视频、俯视地图、文本提示),模型必须在不进行额外微调的情况下生成答案。
  • GST-Train 被用作训练集(其构建遵循相同流水线,场景与基准测试不重叠)。本文摘录未提供混合比例或训练划分细节,但保留场景的原则可防止污染评估。

方法

作者利用自动数据生成流水线构建一个强制全局空间推理的基准。如下图所示:

该流水线利用仿真环境的可扩展性和可控性,使用了多样化的室内资源,如 BEHAVIOR-1K、HyperSim 和 ArtVIP。评估场景与训练集分离,以防止场景级别的泄漏。该设计通过构建强制全局推理,要求目标物体在探索视频中可见,但在当前视图中不可见,而当前视图是在视频轨迹之外采样的。

数据收集阶段生成多种模态以支持多样任务类型。通过在可导航区域内采样空间分布的视点并沿高效遍历轨迹渲染以自我为中心的 RGB 视频,生成探索视频。为避免依赖单一规范路线,生成多条视点扰动且起点不同的轨迹。对于物体定位任务,通过在所有帧上对可见目标实例叠加红色边界框,根据外观而非类别名称指定目标,生成物体标注视频。短轨迹视频也作为连续片段生成,以评估以自我为中心的运动与全局地图的对齐情况。为提供明确的全局场景表征,俯视图像以三种抽象层次渲染:逼真的鸟瞰视图、保留物体和墙壁轮廓的占用地图风格图像,以及仅保留墙壁结构的平面图图像。当前视图从偏离轨迹的视点采样,具有独立的相机朝向。对于物体定位,目标物体严格在当前视图中不存在,迫使模型根据先前视频观察推断位置。真实值信息(包括相机位姿、物体位姿和可见性)直接从场景几何中提取。

数据收集之后,应用严格的质量控制流程。自动过滤移除具有无效投影、模糊物体可见性、查询视图重叠不足、退化选择或违反目标不可见约束的样本。视频过滤消除误标、外观不完整或严重遮挡的实例,而当前视图过滤丢弃信息量低的视图。

最后,问答生成阶段将过滤后的输入与特定任务模板结合,为十二种任务类型生成问答对。答案基于几何计算,例如从相机-物体位姿得出以自我为中心的方向和距离。生成的问答数据被划分,对于最终基准,进行人工验证。标注者确认目标物体在探索视频中可识别,并且偏离轨迹的当前视图包含足够的重叠用于定位,从而确保基准既具挑战性又可可靠回答。

实验

该评估在 GST-Bench 上对 22 个视觉语言模型(专有、开源和具身模型)使用零样本贪婪解码,在 12 个空间推理子任务上进行测试,揭示了巨大的性能差距:即便是最好的专有模型也落后人类表现超过 36 分,开源模型表现接近随机,具身模型无任何优势。将感知与跨帧整合分离的受控实验显示,专有模型能够进行局部感知,但无法整合全局空间信息,而开源模型在两个阶段都表现挣扎。使用针对性的 GST-Train 数据微调 Qwen3-VL-8B,分数从 25.89 显著提升至 53.52,超过了所有零样本模型,但仍远不及人类表现,这证实了显式监督可以改善但无法完全解决长时间空间推理。

当前的视觉语言模型发现 GST-Bench 极具挑战性,顶级专有模型比人类评估者低 36 分以上。开源模型在粗粒度的场景选择之外基本失败,在大多数子任务上表现接近随机猜测。通过针对性的空间监督微调,性能大幅超越所有零样本模型,但与人类空间理解之间仍存在巨大差距。最佳专有模型得分低于人类 36 分以上,在朝向和全局位置估计方面差距最为显著。开源模型的明显领先完全归功于简单和中等俯视选择子任务;在其余十个任务中,它们的分数与随机猜测相差无几。对空间推理数据进行微调,将模型的平均得分从 25.89 提升至 53.52,超越了所有零样本专有模型,但仍远低于人类表现。

当移除跨帧推理的需求时,专有模型显著提升,这揭示了全局空间整合而非局部感知的瓶颈。开源模型 Qwen3-VL-2B 并未从局部信息中获益,并且表现比全局设置下更差,这表明其在基本空间理解上存在根本性薄弱。GPT-5 在局部视频设置下比全局基线提高 +29.23 分,在局部图像设置下提高 +34.52 分,显示出强大的单视图感知能力但较弱的跨帧整合能力。Qwen3-VL-2B 在局部视频和局部图像设置下分别退化 -4.90 分和 -4.55 分,连更简单的局部空间感知任务也失败。

在 GST-Bench 空间推理基准上评估视觉语言模型的结果显示,所有模型的表现都远低于人类水平,最佳专有模型落后超过 36 分。移除跨帧推理使专有模型大幅提升,表明瓶颈在于全局整合而非局部感知,而某个开源模型甚至无法完成局部空间任务。通过空间监督微调,性能超越零样本模型,但距离人类空间理解仍有很大差距。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供