HyperAI
Command Palette
Search for a command to run...
Image Understanding Benchmark 图像理解基准数据集
Image Understanding Benchmark 是由 Microsoft 于 2024 年发布的一个用于图像理解评估的合成数据集,旨在评估多模态模型在图像理解、空间推理、视觉提示、物体识别和检测等方面的能力。
该数据集包含物体检测、物体识别、空间推理和视觉提示四个子任务,共生成约 10,240 张图像。数据通过程序化方式生成,结合 COCO 物体和 Places365 背景,并加入随机旋转、位置和缩放变化,可用于多模态模型的视觉理解能力评估。
数据集组成
数据集包含 8 个配置(config),分为单物体(single)和双物体(pairs)两种条件,涵盖以下四个子任务:
- 物体检测(Object Detection)
- 物体识别(Object Recognition)
- 空间推理(Spatial Reasoning)
- 视觉提示(Visual Prompting)
每个子任务在两种条件下分别生成 1,280 张图像,总计约 10,240 张图像。每个配置主要包含以下字段:
- id:数据样本的唯一编号。
- image:输入图像。
- prompt:用于模型评估的提示文本。
- ground_truth:部分任务中的标准答案。
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。