HyperAIHyperAI

Command Palette

Search for a command to run...

PerceptionBench 视觉感知能力基准数据集

日期

7 小时前

数据集组织

Moonshot AI(月之暗面)

论文 URL

2607.24957

许可证

Non-Commercial

标签

PerceptionBench 是由 Moonshot AI 于 2026 年发布的大模型视觉感知能力基准数据集,专门用于评估多模态大语言模型(MLLMs)基本视觉感知能力,相关论文成果为 PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models 。 该数据集共包含 3,000 道已验证测试题,涵盖 10 种基本感知能力,包含视觉关系理解、计数、属性认知、深度与 3D 感知、空间定位、比较推理、细粒度识别、上下文整合、 OCR 文本理解及感知相关幻觉等类别。其中 1,800 题为从现有基准测试的失败样本中分解得到的原子级子问题,1,200 题为基于补充图像全新创作的题目。评测采用标准化提示词模板与最高可用推理预算,对 GPT-5.6-Sol 、 Kimi K3 、 Claude-Fable-5 等 16 款前沿多模态大语言模型进行开放问答测试。

数据字段:

  • index:样本唯一索引编号
  • answer:参考答案
  • problem:题目描述
  • hint:提示信息
  • image:题目中的图片信息
  • error_category:样本对应的原子感知能力类别
  • source_bmk:上游基准的来源标识
  • source_idx:样本在上游基准中的原始索引

Citation

@article{perceptionbench2026,
title   = {PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models},
author  = {Moonshot AI},
year    = {2026}
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供