Command Palette
Search for a command to run...
PerceptionBench 視覚認知能力ベンチマークデータセット
PerceptionBenchは、大規模モデルの視覚認識能力を評価するためのベンチマークデータセットであり、Moonshot AIによって2026年に公開されました。これは、マルチモーダル大規模言語モデル(MLLM)の基本的な視覚認識能力を評価するために特別に設計されています。関連する研究論文には、以下のようなものがあります。 PerceptionBench:マルチモーダル大規模言語モデルにおける原子レベルの視覚知覚の評価 。 このデータセットには、視覚的関係の理解、計数、属性認識、奥行きと3D知覚、空間位置特定、比較推論、きめ細かい認識、文脈統合、OCRテキスト理解、知覚関連の幻覚など、10の基本的な知覚能力を網羅する3,000の検証済みテスト問題が含まれています。これらのうち、1,800問は既存のベンチマークの失敗サンプルから派生した原子レベルのサブ問題であり、1,200問は補足画像に基づいて新たに作成された問題です。評価では、標準化されたプロンプトワードテンプレートと利用可能な最高の推論予算を使用して、GPT-5.6-Sol、Kimi K3、Claude-Fable-5など、16の最先端マルチモーダル大規模言語モデルに対して自由回答形式の質問応答テストを実施します。
データフィールド:
- インデックス: サンプルの固有インデックス番号
- 回答: 参考回答
- 問題:問題の説明
- ヒント: プロンプトメッセージ
- 画像:質問内の画像情報
- error_category: サンプルに対応する原子センシング能力のカテゴリ。
- source_bmk: アップストリームベンチマークのソース識別子
- source_idx: アップストリームベンチマークにおけるサンプルの元のインデックス。
引用
@article{perceptionbench2026,
title = {PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models},
author = {Moonshot AI},
year = {2026}
}