HyperAIHyperAI

Command Palette

Search for a command to run...

面向主动观察者的评测

Jiarui Zhang Muzi Tao Shangshang Wang Ollie Liu Xuezhe Ma Willie Neiswanger

摘要

人类视觉是一个闭环:视线会依据中间假设持续重定向,而非仅凭单次快照。数十年的心理物理学与认知科学研究表明,这种主动观察对广泛的任务至关重要。当前的多模态大语言模型(MLLMs)是否具备主动观察能力,是一个现有视觉语言基准无法回答的实证问题。我们提出了 ActiveVision,一个使 MLLMs 的主动观察能力可被量化的基准,包含 3 个类别下的 17 项任务。这些任务旨在迫使模型进行反复的视觉感知,而非给出单次静态描述。前沿 MLLMs 在 ActiveVision 上表现不佳:我们所评估的最高分模型 GPT-5.5,在最高推理努力层级下,仅解决了 10.6% 的题目,并在 17 项任务中的 11 项上得分为零;即便 Claude Fable 5 在多数推理和编程排行榜上位居榜首,也仅解决了 3.5% 的题目,远低于三位人类参与者平均 96.1% 的成绩。此外,即使模型自行编写并运行视觉代码,大部分差距依然存在。这类代码在真实图像上并不可靠,而捕捉其失败本身就需要模型所欠缺的主动感知能力。这些结果共同表明,当前的 MLLMs 缺乏稳健的主动视觉观察能力,这为构建能够闭合感知与推理循环的架构和训练目标提供了动力。

一句话总结

南加州大学的研究者推出了 ActiveVision,这是一个包含 3 个类别共 17 项任务的基准,强制进行反复的视觉感知,结果表明前沿多模态大语言模型如 GPT-5.5(10.6%10.6\%10.6%)和 Claude Fable 5(3.5%3.5\%3.5%)远不及人类(96.1%96.1\%96.1%),即使模型尝试自行编写和运行视觉代码,从而突显了主动观察能力的缺失,并推动能够闭合感知-推理循环的架构与训练目标。

核心贡献

  • 提出了 ActiveVision,一个通过 3 个类别 17 项任务隔离主动视觉观察的基准,每项任务都需要反复扫描、追踪和比较,使用保留精确几何信息且抵御单一语言描述捷径的逼真渲染图像。
  • 前沿多模态大语言模型在该基准上表现崩溃:GPT-5.5 仅解决了 10.6% 的样本,Claude Fable 5 解决了 3.5%,而三位人类参与者达到了 96.1%,即便增加推理努力也几乎未能提升表现。
  • 赋予模型编写和执行视觉代码的能力带来的收益不均:最强的 agent 仅解决了一半的样本,却耗费了远超无辅助人类的时间和计算资源,且代码在真实图像上经常失败,暴露了稳健主动感知的根本性缺失。

引言

多模态大语言模型(MLLMs)已经在静态图像基准上饱和,但机器人学、制造业和科学发现中的真实任务要求系统反复重新审视视觉证据,以形成、检验和完善假设——这一过程称为主动观察。现有的评估未能捕捉这一需求,因为它们依赖于单图像问答或描述,通常可以通过场景的固定文本描述来解决,导致感知假设检验循环的需求未被测量。作者引入了 ActiveVision,一个通过涵盖分散扫描、顺序遍历和细粒度视觉比较的 17 项任务隔离主动观察的基准。任务以精确的底层几何程序化生成,并经过逼真渲染,使得任何单一语言描述都无法承载答案,迫使模型在推理时反复检查像素。前沿多模态大语言模型最高准确率仅为 10.6%,而人类平均为 96.1%,即使是编写视觉工具的编程 agent 也仅达到 50.6%,揭示了一个巨大而持续的差距,将主动视觉定位为当前模型缺失的独特能力。

数据集

作者介绍了 ActiveVision,一个旨在探测视觉-语言模型是否能执行超越单次瞥视的主动连续视觉操作的诊断数据集。该数据集并非预存图像的固定集合;它是由一系列任务特定生成器实时程序化生成的。

数据集组成与来源

  • 17 项任务被组织为三个类别,分别针对一种核心感知例程:
    • 分散扫描:空间上分散的信号(点、笔画、区域、图面),必须被穷尽地定位和计数。
    • 顺序遍历:如箭头链、缠绕曲线或蜿蜒管道等需逐步跟随的连通结构。
    • 视觉属性迁移:在参考区域与多个候选者之间精细比较属性(长度、曲率、粗细、颜色模式等)。
  • 每项任务隔离了一个判别性视觉状态,其信息量超出了单一语言描述所能无损承载的范畴,迫使模型反复检查像素级证据。

任务实例化与处理

  • 每项任务生成器从一个确定性种子生成合成支架(使用 Matplotlib)、自然语言问题以及真实答案,使得实例完全可复现。
  • 为避免卡通般简洁的输入,采用了两阶段渲染管线:
    1. 一个程序化 Matplotlib 支架被创建,并附加真实标注。
    2. 该支架使用 GPT-image-2 通过任务特定提示进行重渲染,将抽象基元映射到逼真的现实世界场景。
  • 仅将最终逼真渲染图像展示给模型;支架和渲染提示保持隐藏。
  • 答案分布被刻意设计得宽泛且平坦,使得无论是最高频答案还是任务类型都无法作为捷径。

数据使用方式

  • ActiveVision 纯粹作为多模态模型的 评测基准 使用;未指定训练分割或混合比例(数据集设计用于零样本或少样本探测,而非微调)。
  • 模型仅接收渲染图像和问题,必须执行目标主动视觉操作。
  • 该数据集在程序上是无限的——生成器可以产生任意数量的样本——但论文并未固定静态数据集大小,将其视为一个可控的诊断环境,而非有限的测试集。

方法

作者围绕人类视觉的三种基本操作设计 ActiveVision:穷尽枚举、曲线追踪和细粒度比较。这些操作被实例化为三个不同的任务族,各自针对主动观察的特定维度。

第一个类别,分散扫描,要求模型找到并累积空间上分散的局部信号,如点或区域,难度随信号数量增加而提高。第二个类别,顺序遍历,涉及逐步跟随连通结构同时保持位置和方向,挑战模型避免格式塔插值。第三个类别,视觉属性迁移,要求在不同区域之间精细比较视觉属性,测试模型在不依赖语言先验的情况下提取和匹配属性的能力。

为确保这些任务真正需要迭代感知,作者强制执行一个核心设计原则:每个任务实例携带的判别性视觉状态,其信息量超过单一语言描述所能无损承载的范围。这是通过三个特性实现的。第一,项目被放置在任意的连续位置,而非网格上。第二,区域边界和形状针对每个实例全新合成,使用随机傅里叶谐波或样条曲线,创建一个连续且高方差的轮廓空间。第三,需遵循的路径是光滑的随机样条曲线,具有众多拐点。这些特性加在一起,使得迭代感知成为唯一自然的解决路径,因为一次性观察者无法可靠地保存必要的视觉状态。

作者通过 17 个任务生成器实例化该设计,从确定性种子产生合成支架、问题和真实答案。为了将这些操作置于真实场景中并避免卡通输入混淆,他们采用了一个两阶段生成管线。

在第一阶段,一个确定性的 Python 生成器输出带有完整真实标注的几何支架。在第二阶段,使用任务特定提示通过 GPT-image-2 将支架重渲染为逼真图像。此重渲染将程序化基元映射到现实世界场景,同时不改变位置、数量或拓扑结构。该管线确保感知难度主要由任务的判别结构决定,而非不熟悉的渲染风格,并且限制了工具使用脚本所能恢复的信息,使诊断对下游应用具有外部意义。

实验

该基准通过 85 幅逼真渲染图像探测主动视觉推理,人类精确匹配基线为 96.1%。前沿多模态语言模型最多解决 10.6%,增加思维链推理努力几乎不带来改善;模型的特点是低估拥挤场景的数量、在第一步就丢失空间追踪线索,并在比较中默认回答“相同”。调用经典视觉工具的编码 agent 达到 50.6%,但仅限于那些可算法化简约的任务,而遍历和计数任务大部分仍未解决,因为 agent 缺乏捕捉自身错误的感知能力。

ActiveVision 定义了跨认知轴的 17 个任务生成器,隔离了诸如计数图组件、跟随箭头链和识别缠结环等感知操作。每个生成器产生可复现的实例,具有广泛的答案分布以防止捷径学习,并且图像经过逼真重渲染以匹配医学扫描和卫星图像等现实世界场景。任务集涵盖了分散扫描(例如,计数有界面、连通组件、区域和孤立形状)和顺序遍历(例如,箭头链跟随)。agent 工具使用评估显示,属性迁移任务已基本解决,而遍历任务仍接近于零,并且所有 agent 在缠结环计数中均失败,凸显了感知难度。

前沿多模态模型在 ActiveVision 上精确匹配准确率最高为 10.6%,最佳模型在大多数任务上完全失败。人类参与者平均 96.1% 的准确率,揭示了机器与人类在复杂场景中视觉推理的巨大差距。六个前沿模型在缠结环计数上均得零分,而人类平均为满分。顶级模型 GPT-5.5 仅解决了 85 个样本中的 9 个,并在 17 项任务中的 11 项上得零分,而人类参与者平均 96.1% 准确率。

在视觉差异任务中评估的模型表现出强烈的保守偏差,经常默认回答“无”。这导致了真实差异的高漏检率,而虚警率保持较低,即使在几乎每个样本都回答“无”的运行中也是如此,表明这是一种安全响应策略,而非感知准确性。所有运行中漏检率都很高,一些配置漏掉了每一个真实差异,而虚警率保持低水平,在最保守的运行中常为零。在几乎每个项目都回答“无”的运行中,虚警率为零却错过了所有真实差异,暴露了当视觉比较变得过于困难时回避声明差异的响应偏差。

用代码执行替代视觉感知的 agent 系统产生了严重的资源成本:每个样本消耗 12-15 分钟的挂钟时间和 2.742.74-2.747.63 的计算费用,同时使用数十次工具调用和数万个输出 token。能力最强的 agent 只回答了略多于一半的基准,远低于无辅助人类的 96.1% 准确率,后者每个样本仅需约半分钟且零工具调用。这种效率和准确率差距凸显了用工具编排的推理替代主动视觉在处理噪声真实世界图像时的根本性局限。人类参与者以每个样本 0.56 分钟、零工具调用达到 96.1% 准确率,而最强的 agent 仅达到 50.6% 准确率,却耗时 13.9 分钟,每个样本花费 7.63。即使成本最低的agent每个样本也花费7.63。即使成本最低的 agent 每个样本也花费 7.63。即使成本最低的agent每个样本也花费2.74,仅提供 37.6% 准确率,远低于人类表现,表明工具使用未能弥合差距。agent 在每个样本上花费 12.5-14.7 分钟,大约是半分钟人工标注时间的 25 倍,每个样本产生数万个输出 token。

ActiveVision 基准使用 17 个感知任务生成器配以逼真图像,以隔离主动扫描和遍历操作。前沿多模态模型和 agent 系统在缠结环计数等核心任务上表现近乎为零,而人类则接近完美准确率;即使配备了代码的 agent 也仅回答了约一半基准,并带来极大的时间和成本开销。此外,模型在视觉差异任务中表现出强烈的保守偏差,频繁默认回答“无”,几乎漏掉了所有真实差异。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供