HyperAIHyperAI

Command Palette

Search for a command to run...

展示而非描述:在生成像素中评估空间认知而非大语言模型文本

Xu Wang Kaixiang Yao Miao Pan Xiaohe Zhou Xuanyu Liu Wenqi Zhang Xuhong Zhang

摘要

空间智能对于智能体从静态语义理解走向与物理世界交互至关重要。在现实世界中,许多空间任务植根于连续的视觉场景,其中位置、区域和路径更自然地通过指向、标记或绘制来表达,而非报告精确坐标或离散的文本符号。然而,现有的空间推理基准通常要求模型以坐标、选项或文本描述作答,这为图像生成模型造成了答案接口不匹配的问题。这一接口鸿沟使得难以在与文本输出视觉语言模型相同的任务语义下评估图像生成模型,尽管后者可以直接在像素空间中外化空间判断。为解决这一问题,我们提出了 ProVisE(协议化视觉评估),一个与基准无关的框架,它从图像生成模型中引出受协议约束的视觉答案,并将其解析为与原始评估指标兼容的结构化预测。ProVisE 还包含一个智能体构建器,可为新基准构建并验证任务特定的协议。基于此框架,我们引入了 SpatialGen-Bench,一个精心构建的诊断基准,包含 470 个样本,覆盖 14 个空间子任务、四个能力层级和多样的答案形式。我们在统一设定下评估了代表性的文本输出视觉语言模型和图像生成模型,并在六个外部空间基准上验证了智能体协议构建。实验结果表明,当空间答案可直接在像素空间中表达时,图像生成模型具有竞争力,而文本输出视觉语言模型在组合空间推理方面保持明显优势。这些发现揭示了像素空间表达与基于文本推理的互补优势与局限,同时 ProVisE 和 SpatialGen-Bench 为生成式空间评估及未来对图像生成模型空间认知的研究建立了一个指标兼容的测试平台。

一句话总结

为使空间认知能够统一评估,并揭示像素空间表达与基于文本的推理之间的互补优势,浙江大学的研究者提出了 ProVisE(一个与基准无关的框架,可引导图像生成模型给出受协议约束的视觉答案)以及 SpatialGen-Bench(一个包含 470 个样本、横跨 14 个空间子任务的诊断型基准)。

核心贡献

  • 本文提出 ProVisE,一个与基准无关的框架,可将图像生成模型给出的协议引导式视觉答案转换为与原始任务指标兼容的结构化预测,并构建了 SpatialGen-Bench,一个包含 470 个样本、横跨 14 个空间子任务与四个能力层级的诊断型基准。
  • 提出一种 agentic 构建器,可面向新基准自动构建并验证任务专用的生成-解析协议,使 ProVisE 能在无需逐模型适配的情况下,扩展至手动配置任务之外的场景。
  • 通过大量实验对比图像生成模型与文本输出视觉语言模型,结果表明:当答案可直接在像素空间中外化时,图像生成模型具备竞争力;而视觉语言模型在组合空间推理方面仍占优势,且 agentic 构建器能够成功将协议适配到六个外部基准。

引言

空间智能是人工智能 agent 与物理世界安全交互的基石,然而在视觉语言模型中对其进行评估长期以来都与坐标、标签或文本等符号化答案格式绑定。这种纯文本接口对空间任务而言并不自然,且完全排斥了可直接进行标注或合成视觉答案的图像生成模型。现有基准要么衡量文本到图像的提示保真度,要么对视觉语言模型的符号化预测评分,缺乏在共享空间任务语义下比较图像生成器与文本输出视觉语言模型的方法。作者引入 ProVisE 与 SpatialGen-Bench:前者是一种将生成输出约束为预定义视觉格式并将其解析为兼容原始指标的结构化预测的框架,后者则是一个包含 14 个空间子任务的诊断型基准。二者共同实现了系统化且指标对齐的比较,揭示出:当答案可直接外化时,像素空间生成表现优异;而基于文本的模型在组合空间推理上仍然更强。

数据集

SpatialGen-Bench 是一个诊断型评估基准,旨在跨异构答案接口测试空间认知。该基准从多个公开空间评估基准中重利用并筛选样本,覆盖感知、推理、指代表达、导航与路径规划等任务。数据集包含 470 个经人工整理的样本,组织为四个递进的能力层级和 14 个子任务,全部采用统一模式,同时保留任务特定的评分元数据。

  • 来源与规模

    • 源自多个公开空间评估数据集;虽未列出具体来源名称,但所选任务涵盖了物体级感知、视角推理、空间指代表达、状态建模、可供性、导航与轨迹规划。
    • 经过滤与去重后,所有层级共保留 470 个样本。
  • 能力层级与子集大小

    • 空间感知(145 个样本):计数、相对深度估计、朝向判断、物体大小比较。
    • 空间理解(140 个样本):关系验证、视角判断、空间心理建模、空间指代表达。
    • 空间推理(90 个样本):多跳空间推理、空间状态预测、几何可行性。
    • 空间交互(95 个样本):可供性指代表达、导航、轨迹规划。
  • 样本筛选与构建

    • 每个候选样本均经人工审查,仅当输入媒体、原始标注、任务指令和答案能够在源任务语义下被可靠恢复并评分时才予以保留。
    • 移除近似重复、视觉上不清晰、标注不一致以及答案含糊或存在多个有效答案的样本。
    • 筛选后,每个样本均根据其空间目标(而非其来源基准)被分配到一个子任务和能力层级;分配结果与源标注及任务表述进行交叉验证。
    • 最终数据集使用标准化的共享字段,同时存储评分所需的特定任务元数据(例如答案格式与评估函数)。
  • 数据完整性

    • 所有发布条目均通过确定性资源和模式检查及人工纳入审查;字段检查与审查覆盖率见附录。
  • 论文如何使用数据

    • SpatialGen-Bench 仅用于评估,不用于训练。它提供异构答案契约,以测试 ProVisE 在不同输出模式下服务空间任务的能力。
    • 评估指标因答案类型而异:对于离散答案子任务使用精确匹配准确率(经归一化后),对空间指代表达使用点在掩膜内准确率,对可供性使用平均掩膜精度,对预测使用部分得分端点分数,对轨迹规划使用 [email protected]

不涉及训练划分或混合比例;该基准是一个固定的评估集。唯一的处理包括对离散任务的答案归一化,以及根据保留的任务特定元数据将原始答案映射到适宜的度量函数。

实验

评估使用 ProVisE 流程,在一个异构空间推理基准 SpatialGen-Bench 上比较文本输出视觉语言模型与图像生成模型。当答案能保持为可直接外化的像素级状态时,视觉回答表现出色;当任务需要超越可见证据的转换时,文本回答更强;这两种界面提供了互补的成功案例。多数失败源于空间预测错误,而非视觉沟通失灵,表明“展示”可保留推理过程但无法替代所需推理。Agentic 协议构建可在不同基准间迁移,尽管将任务专用解析器替换为通用视觉语言模型会改变分数与排名,这证实了受控的、协议化的评估对可靠比较至关重要。

现有空间评估基准大多忽略层级化能力诊断、多答案格式以及跨文本输出模型与图像生成模型的共享评估。仅少数基准将任务充分组织为递进的推理层级,且几乎没有一个基准在公共指标下对两种模态同时评估。这种碎片化限制了分离模型在空间推理和输出模态这两类失效原因的能力。很少有基准完全支持从基础空间感知到动作导向推理的递进任务结构。也很少提供多种答案评估形式,多数基准依赖单一响应风格。几乎完全不存在在相同任务语义和指标下对文本输出视觉语言模型与图像生成模型进行共享评估的情况,仅有一个不完整的实现。在生成式设置中,图像有效但在空间上不正确是主要失败模式,说明正确的视觉输出并不等同于正确的空间推理。

当前模型仍远落后于人类空间智能,最佳文本回答模型的总体得分仅为 61.04,最佳视觉回答模型为 54.49,而人类得分为 87.79。最大的能力缺口在于“理解”层级,任务层级差距最大的分别是“视角”、“关系”和“心理建模”,凸显了在视角变换和关系推理方面的弱点。空间专用模型显示出孤立的优势,但在不同任务上表现不均,证实当前的专长化尚未带来通用的空间能力。人类总分(87.79)大幅高于文本回答最佳机器分数(61.04)和视觉回答最佳分数(54.49)。“理解”层级显示最大能力缺口,人类表现与最佳机器分数之间相差 38.57 分。任务层级缺口最大的是“视角”(51.43 分)、“关系”(31.43)和“心理建模”(28.57),表明跨视角转换空间表征是一个主要瓶颈。RoboBrain2.5-8B 在“大小”上取得 88.57 分,但在“朝向”、“视角”、“导航”和“轨迹”上急剧下降,反映出不平衡的空间专长。在非正确结果中,88.03% 是空间上不正确的有效预测,表明成功的图像生成并不能保证准确的空间推理。非答案类失败集中在“大小”和“可行性”(预渲染场景保留问题)以及“预测”和“指代表达”(答案恢复和解析困难),而“深度”子任务无解析器失效。

视觉与文本回答模式提供了互补优势,各自解决了对方未答对的题目。视觉界面挽回了显著比例的文本错题,GPT 对的视觉挽救率为 37.0%,SenseNova 为 30.6%,而纯文本成功案例仍频繁出现,证明两者均未在空间推理任务中占绝对优势。GPT Image 2 挽救了 GPT-5.4 错误回答条目的 37.0%,SenseNova 的视觉模式挽救了其文本模式失效的 30.6%。纯文本胜出最常出现在 SenseNova 上(占条目的 30.2%),表明存在某些像素输出无法替代符号化转换的任务。

文本型 GPT-5.4 在六个基准上达最高平均分(60.67%),但视觉型 GPT Image 2 在 SAT 和 RoboAfford 上占主导。Qwen3-VL-8B 在 EmbSpatial、OmniSpatial 和 Q-Spatial 上领先,但没有一个模型在所有方面都表现优异。失败分析表明,大多数错误是有效但在空间上不正确的预测;当空间状态可直接观察而无需隐藏变换或精确坐标恢复时,视觉输出最为可靠。GPT-5.4 获得最佳总体平均分(60.67%),但在 SAT(74% vs 66%)和 RoboAfford(64% vs 48%)上被视觉型 GPT Image 2 超越。在各任务中,88% 的非正确结果是有效的输出但在空间正确性上失败;当答案映射到可检查的图像状态时视觉输出表现优异,但当任务需要隐藏的几何变换、反事实摆放或精确坐标编码时则变得脆弱。

使用单个视觉语言模型通用解析器替代任务专用解析器,会同时改变图像生成模型的分数和排名。与原始解析器的排名相关系数介于 0.31 到 0.60 之间,平均绝对分数变化超过 5 分,而有效解析率保持较高。这表明通用解析器增加了一个依赖模型的解释层,而非统一的校准偏移。最优模型取决于解析器:在 ProVisE 下 GPT Image 2 领先,在 Qwen2.5-VL-72B 下 JoyAI-Image 领先,在 Llama 4 Scout 下 Seedream 4.5 领先。解析器替换导致显著且非均匀的分数变化,平均绝对差异为 5 到 6 分,因此该效应并非所有模型上的简单恒定偏移。

该评估框架引入了跨文本回答与图像生成模型的层级化空间推理任务,支持多种答案格式与共享指标,以分离推理失效与输出模态失效。结果表明,所有模型均远落后于人类空间智能,最大的缺口在视角变换与关系推理;视觉与文本模式提供互补优势:视觉输出可挽救许多文本失败,但大多数生成式错误是有效但在空间上不正确的图像,特别是当任务要求隐藏变换或精确坐标恢复时。将任务专用解析器替换为通用视觉语言模型解析器会显著改变分数和排名,揭示解析层引入了依赖模型的解释,而不是一致校正。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供