Command Palette
Search for a command to run...
PerceptionBench 视觉感知能力基准数据集
PerceptionBench 是由 Moonshot AI 于 2026 年发布的大模型视觉感知能力基准数据集,专门用于评估多模态大语言模型(MLLMs)基本视觉感知能力,相关论文成果为 PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models 。 该数据集共包含 3,000 道已验证测试题,涵盖 10 种基本感知能力,包含视觉关系理解、计数、属性认知、深度与 3D 感知、空间定位、比较推理、细粒度识别、上下文整合、 OCR 文本理解及感知相关幻觉等类别。其中 1,800 题为从现有基准测试的失败样本中分解得到的原子级子问题,1,200 题为基于补充图像全新创作的题目。评测采用标准化提示词模板与最高可用推理预算,对 GPT-5.6-Sol 、 Kimi K3 、 Claude-Fable-5 等 16 款前沿多模态大语言模型进行开放问答测试。
数据字段:
- index:样本唯一索引编号
- answer:参考答案
- problem:题目描述
- hint:提示信息
- image:题目中的图片信息
- error_category:样本对应的原子感知能力类别
- source_bmk:上游基准的来源标识
- source_idx:样本在上游基准中的原始索引
Citation
@article{perceptionbench2026,
title = {PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models},
author = {Moonshot AI},
year = {2026}
}