HyperAIHyperAI

Command Palette

Search for a command to run...

PerceptionBench:评估多模态大语言模型的原子视觉感知能力

摘要

我们提出了 PerceptionBench,一个专门设计用于评估多模态大语言模型(MLLM)原子视觉感知能力的基准。现有基准往往无法将感知能力隔离开来:整体性评估将感知错误与推理或领域知识方面的失败混为一谈,而应用驱动的基准仅覆盖由启发式设计所塑造的狭窄、碎片化的领域。为解决这些局限,PerceptionBench 采用自下而上的方法:通过诊断前沿 MLLM 在 42 个现有基准上的回答中最早的失败点,我们构建了一个错误分类体系,其感知分支定义了十项原子感知能力。在此分类体系的指导下,我们构建了 3,000 个经过验证的问题,这些问题答案简短且无歧义,每个问题隔离一项单一能力,其难度源于感知而非推理或知识。在十六个前沿 MLLM 上的基准测试结果表明,原子感知能力在很大程度上仍未得到解决——没有模型达到 60% 的准确率,与感知相关的幻觉平均而言是最薄弱的能力,而相似的总体得分掩盖了截然不同的能力轮廓。因此,PerceptionBench 为衡量和诊断 MLLM 的视觉感知边界提供了一个能力级别的标准。

一句话总结

Moonshot AI 的研究人员推出 PerceptionBench,一个通过源于 42 个现有基准的自下而上错误分类体系,诊断多模态大型语言模型中十种原子级视觉感知能力的基准,结果显示没有模型超过 60%60\%60% 准确率,且感知相关幻觉仍然是最薄弱的能力,从而为衡量 MLLM 视觉感知边界提供了能力层级标准。

核心贡献

  • PerceptionBench 分离出十种原子级视觉感知能力,这些能力是从 42 个现有 MLLM 基准的失败归因中自下而上推导得到的,其 3,000 个验证问题中的每一个都针对单一能力,并最小化推理或知识需求。
  • 对 16 个前沿 MLLM 的评估表明,原子级感知在很大程度上仍未解决:没有模型达到 60% 的整体准确率,并且感知相关幻觉平均而言是最薄弱的能力。
  • 整体得分几乎相同的模型表现出截然不同的能力画像,因此聚合准确率掩盖了模型实际获得了哪些感知能力。

引言

准确的视觉感知是多模态大型语言模型(MLLM)执行下游推理和交互的基础,但它由不同的原子能力构成,如属性识别、计数、定位和文本阅读。当前基准要么将感知与推理和外部知识混为一谈,使得错误归因不可能,要么针对由设计者先验定义的狭窄应用特定感知片段,而不是模型实际缺乏的能力。作者推出 PerceptionBench,一个包含 3,000 个验证问题的基准,围绕十种原子级感知能力组织,这些能力是通过自下而上的方式,从前沿 MLLM 在 42 个现有基准上的归因失败中得出的。这种设计直接衡量经验观察到的弱点,将感知与推理或知识分离,并提供先前以任务为导向或以感知为中心的基准无法提供的细粒度诊断粒度。

数据集

作者构建了 PerceptionBench,一个旨在评估多模态大型语言模型(MLLM)原子级视觉感知能力的数据集。它通过自下而上、失败驱动的工作流程构建,而非依赖设计者先验。

数据集组成与来源

  • 发布的基准包含 3,000 个验证的问答-图像样本。
  • 1,800 个问题(60%)是从 42 个现有基准上观察到的失败中分解出的原子子问题。
  • 1,200 个问题(40%)是针对从公开网络来源和内部整理数据中收集的补充图像新编写的问题。
  • 这 42 个源基准涵盖文档理解、OCR、图表理解、GUI 交互、视觉定位、科学图表、遥感和自然图像。

每个子集的关键细节

  • 分解子集(1,800 个样本):源自归因于感知错误的失败。对于每个失败,标注者接收原始问题、错误分析和分配的感知错误类型,然后将其分解为原子子问题,隔离导致失败的特定感知能力。
  • 新编子集(1,200 个样本):为提高视觉多样性并改善对代表性不足的能力的覆盖而创建。标注者在新图像上编写针对相同十种原子能力的感知问题。
  • 筛选规则:
    • 所有图像(重用和新收集的图像)都通过 ISC 描述符余弦相似度与大规模预训练语料库(如 LAION 和 Common Crawl)进行核对。相似度超过 0.95 阈值的图像被视为近似重复或泄露而被丢弃。
    • 每个构建的样本都由四个前沿 MLLM 组成的集成进行筛选。所有集成成员都正确解答的样本被移除。保留下来的样本根据回答正确的模型数量被分层为三个难度等级。
    • 多阶段验证(自动能力对齐、视觉定位检查和独立人工验证)移除或修订引入无关推理、模糊视觉证据或错误标注的样本。

论文如何使用数据

  • PerceptionBench 作为仅用于评估的基准,不用于训练。
  • 发布的 3,000 个样本是从包含超过 17,000 个验证样本的内部池的已构建部分中进行子采样得到,并进行了能力级平衡和难度分层。
  • 评估的十种原子级视觉感知能力是:视觉定位、视觉属性识别、视觉计数、视觉关系理解、深度与 3D 感知、OCR、视觉比较、细粒度识别、上下文整合和感知相关幻觉。
  • 归纳分类法中的其余错误类别(推理、知识、前提、其他)仅在失败归因期间使用,不包含在发布的基准中。

处理细节

  • 失败驱动能力发现:在 42 个基准上运行前沿 MLLM;错误样本形成候选失败池。一个更强的模型通过分析完整推理轨迹进行感知失败归因,定位最早的错误步骤,并分配一个开放词汇的错误标签。标签被聚类,并由 LLM 合并为统一的分类法。只有当视觉事实被误读时,失败才被归因于感知;否则归入推理或知识类别。
  • 难度感知选择:四个前沿 MLLM 的集成评估所有候选样本。所有集成模型都正确解答的样本被视为饱和而被丢弃。保留的样本按通过率分层,并在源基准和难度之间进行子采样。
  • 感知分解:标注者将归因的感知失败分解为原子子问题,每个子问题继承归因中的细粒度能力标签。
  • 元数据构建:每个样本都带有一个基于失败分类法的能力标签、基于集成共识的难度等级以及一个构建来源标签(分解或新编)。
  • 裁剪策略:未提及明确的裁剪策略;图像按源基准或新收集来源提供的方式使用,并进行针对预训练语料库的去重。

方法

作者设计 PerceptionBench 是为了识别和评估多模态大型语言模型所需的原子级感知能力。该框架不依赖设计者先验或特定任务切片,而是遵循一个基于经验观察到的模型失败的三阶段自下而上流程。

第一阶段是失败驱动能力发现。作者从 42 个涵盖不同视觉领域的现有基准上收集前沿模型的错误预测。为了将真正的感知限制与推理或知识错误隔离开来,他们引入了一种感知失败归因过程。一个更强的前沿模型分析完整的预测上下文(包括问题、图像、参考答案和推理轨迹),以定位最早的错误步骤,并分配一个开放词汇的错误标签。然后,这些标签被聚类为统一的分类法。作者观察到,现有基准仅探测失败空间中狭窄且互补的部分,因为每个基准中的失败都集中在仅一个或少数几个错误类型上。

如下图所示:

为了解决这种碎片化,作者仅保留分类法中的感知错误类别,这产生了十种原子级视觉感知能力。这些能力包括视觉定位、视觉属性识别、视觉计数、视觉关系理解、深度与 3D 感知、OCR、视觉比较、细粒度识别、上下文整合和感知相关幻觉。

第二阶段是基准选择与构建。为确保基准保持挑战性和诊断性,作者采用了一种难度感知选择过程。他们使用四个前沿模型的集成评估所有候选样本。集成中所有模型都正确解答的样本被视为饱和而被丢弃。保留的样本根据正确解答的模型数量被分层为三个难度等级,然后进行子采样以抵消倾斜的来源分布。为了进一步平滑难度分布,他们执行感知分解。标注者将复杂的感知问题分解为更细粒度的原子子问题,每个子问题隔离导致失败的特定感知能力。为了增加视觉多样性,他们用来自公开网络来源和内部整理数据的额外图像补充基准。为了减轻数据污染,他们计算每个图像的 Image Similarity Challenge 描述符与大规模预训练语料库的余弦相似度,丢弃任何相似度超过 0.95 的图像。最后,一个筛选步骤镜像了发现阶段。前沿模型集成评估新构建的样本,移除所有模型都正确解答的样本,以维持具有挑战性的难度画像。

第三阶段涉及多阶段验证,结合自动能力对齐和视觉定位检查以及独立的人工验证。这种严格的工作流程最终产生了一个包含 3,000 个验证问题的发布基准,从包含超过 17,000 个样本的内部池中子采样得到,确保了在平衡的难度等级上全面覆盖十种原子级视觉感知能力。

实验

评估设置使用 PerceptionBench,一个包含 3,000 个仅涉及原子感知的问题的基准,这些问题是通过失败驱动能力发现和难度感知选择构建的,并使用统一的评判器评估 16 个前沿多模态模型。主要结果证实,原子级视觉感知仍然是一个重大瓶颈,整体准确率在 32.5% 到 59.7% 之间,而感知相关幻觉在所有模型中都是最弱的能力。定性分析确认失败主要是感知性的而非认知性的,而可靠性实验显示聚合得分稳定,但样本级行为不一致,表明模型尚未稳健地获得底层的感知技能。

原子级视觉感知对多模态大型语言模型来说仍是一个重大瓶颈,PerceptionBench 上的整体准确率在 32.5% 到 59.7% 之间,没有模型接近性能上限。各模型的感知能力发展不均衡,感知相关幻觉始终落后于其他技能,如视觉关系、OCR 和定位。引人注目的是,整体性能与幻觉鲁棒性似乎是脱钩的,因为整体领先者显示出最低的幻觉得分之一,而一个中等排名的模型却取得了最佳的幻觉结果。整体准确率从 32.5% 到 59.7%,确认原子感知仍未被解决,且基准保持了强大的区分能力。感知相关幻觉平均是最弱的能力(36.7%),显著落后于视觉关系(53.2%)、OCR(52.4%)和定位(52.0%)。整体领先者 GPT-5.6-Sol 在定位上达到 76.7%,但在幻觉上仅为 26.9%,这是排行榜上最低的幻觉得分之一。GPT-5.5 和 Gemini-3.1-Pro 整体相差不到一个点,但在具体能力上差异显著,GPT-5.5 在定位上领先 13 分,而 Gemini-3.1-Pro 在 OCR 和细粒度识别上各领先 8 分。最好的幻觉得分(50.6%)属于 Gemini-3.5-Flash,这是一个整体排名靠中的模型(52.0%),而整体领先者 GPT-5.6-Sol 在幻觉上仅得 26.9%。开源模型 Kimi K3(58.5%)超越了所有其他专有系统,包括 Gemini-3.1-Pro(56.2%)和 GPT-5.5(55.8%)。

对前沿 MLLM 的多次独立运行产生的平均准确率标准差很小,确认了基准聚合得分的稳定性。然而,pass@4 与 pass^4 之间的巨大差距揭示了显著的样本级不一致性,表明模型常常间歇性地成功,而不是通过稳健的视觉感知。所有评估模型的四次运行标准差都很低,GPT-5.6-Sol 展现出最小的变化(std 0.17)和最高的平均准确率。尽管平均得分稳定,但每个模型的 pass@4 与 pass^4 之间的差距都很大,超过 25 个百分点,这表示不可靠的样本级感知行为。

在 PerceptionBench 上的评估揭示,原子级视觉感知对多模态大型语言模型来说仍是一个未解决的挑战,整体准确率在 32.5% 到 59.7% 之间,没有模型接近性能上限。感知相关幻觉始终落后于视觉关系、OCR 和定位等能力,且整体性能与幻觉鲁棒性脱钩,因为顶级模型显示出最差的幻觉得分之一,而一个中等排名的模型却取得了最佳结果。多次运行确认了稳定的聚合得分,但 pass@4 与 pass^4 之间的巨大差距暴露了显著的样本级不一致性,表明模型是间歇性地成功,而不是通过可靠的视觉感知。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供