HyperAI
Command Palette
Search for a command to run...
Image Understanding Benchmark 画像理解ベンチマークデータセット
Image Understanding Benchmark は、Microsoft が2024年に公開した画像理解評価用の合成データセットであり、マルチモーダルモデルの画像理解、空間推論、視覚的プロンプト、物体認識、検出などの能力を評価することを目的としています。
このデータセットは、物体検出、物体認識、空間推論、視覚的プロンプトの4つのサブタスクで構成され、合計約10,240枚の画像が生成されています。データはプログラムによって生成され、COCO物体とPlaces365背景を組み合わせ、ランダムな回転、位置、スケール変化を加えており、マルチモーダルモデルの視覚理解能力の評価に使用できます。
データセット構成
データセットは8つの構成(config)を含み、単一物体(single)と二重物体(pairs)の2つの条件に分かれており、以下の4つのサブタスクをカバーしています:
- 物体検出(Object Detection)
- 物体認識(Object Recognition)
- 空間推論(Spatial Reasoning)
- 視覚的プロンプト(Visual Prompting)
各サブタスクは、2つの条件それぞれで1,280枚の画像を生成し、合計約10,240枚の画像になります。各構成には主に以下のフィールドが含まれています:
- id:データサンプルの一意の番号。
- image:入力画像。
- prompt:モデル評価用のプロンプトテキスト。
- ground_truth:一部のタスクにおける標準回答。
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。