HyperAIHyperAI

Command Palette

Search for a command to run...

Image Understanding Benchmark 画像理解ベンチマークデータセット

日付

データセット構成

Microsoft Corporation

ライセンス

cdla-permissive-2.0

Image Understanding Benchmark は、Microsoft が2024年に公開した画像理解評価用の合成データセットであり、マルチモーダルモデルの画像理解、空間推論、視覚的プロンプト、物体認識、検出などの能力を評価することを目的としています。

このデータセットは、物体検出、物体認識、空間推論、視覚的プロンプトの4つのサブタスクで構成され、合計約10,240枚の画像が生成されています。データはプログラムによって生成され、COCO物体とPlaces365背景を組み合わせ、ランダムな回転、位置、スケール変化を加えており、マルチモーダルモデルの視覚理解能力の評価に使用できます。

データセット構成

データセットは8つの構成(config)を含み、単一物体(single)と二重物体(pairs)の2つの条件に分かれており、以下の4つのサブタスクをカバーしています:

  • 物体検出(Object Detection)
  • 物体認識(Object Recognition)
  • 空間推論(Spatial Reasoning)
  • 視覚的プロンプト(Visual Prompting)

各サブタスクは、2つの条件それぞれで1,280枚の画像を生成し、合計約10,240枚の画像になります。各構成には主に以下のフィールドが含まれています:

  • id:データサンプルの一意の番号。
  • image:入力画像。
  • prompt:モデル評価用のプロンプトテキスト。
  • ground_truth:一部のタスクにおける標準回答。
数据集示例
数据集示例

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています