HyperAIHyperAI

Command Palette

Search for a command to run...

Image Understanding Benchmark 图像理解基准数据集

日期

数据集组织

微软

许可证

cdla-permissive-2.0

Image Understanding Benchmark 是由 Microsoft 于 2024 年发布的一个用于图像理解评估的合成数据集,旨在评估多模态模型在图像理解、空间推理、视觉提示、物体识别和检测等方面的能力。

该数据集包含物体检测、物体识别、空间推理和视觉提示四个子任务,共生成约 10,240 张图像。数据通过程序化方式生成,结合 COCO 物体和 Places365 背景,并加入随机旋转、位置和缩放变化,可用于多模态模型的视觉理解能力评估。

数据集组成

数据集包含 8 个配置(config),分为单物体(single)和双物体(pairs)两种条件,涵盖以下四个子任务:

  • 物体检测(Object Detection)
  • 物体识别(Object Recognition)
  • 空间推理(Spatial Reasoning)
  • 视觉提示(Visual Prompting)

每个子任务在两种条件下分别生成 1,280 张图像,总计约 10,240 张图像。每个配置主要包含以下字段:

  • id:数据样本的唯一编号。
  • image:输入图像。
  • prompt:用于模型评估的提示文本。
  • ground_truth:部分任务中的标准答案。
数据集示例
数据集示例

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供