HyperAIHyperAI

Command Palette

Search for a command to run...

PerceptionBench 視覚認知能力ベンチマークデータセット

日付

7時間前

データセット構成

Moonshot AI(月之暗面)

Paper URL

2607.24957

ライセンス

Non-Commercial

PerceptionBenchは、大規模モデルの視覚認識能力を評価するためのベンチマークデータセットであり、Moonshot AIによって2026年に公開されました。これは、マルチモーダル大規模言語モデル(MLLM)の基本的な視覚認識能力を評価するために特別に設計されています。関連する研究論文には、以下のようなものがあります。 PerceptionBench:マルチモーダル大規模言語モデルにおける原子レベルの視覚知覚の評価 。 このデータセットには、視覚的関係の理解、計数、属性認識、奥行きと3D知覚、空間位置特定、比較推論、きめ細かい認識、文脈統合、OCRテキスト理解、知覚関連の幻覚など、10の基本的な知覚能力を網羅する3,000の検証済みテスト問題が含まれています。これらのうち、1,800問は既存のベンチマークの失敗サンプルから派生した原子レベルのサブ問題であり、1,200問は補足画像に基づいて新たに作成された問題です。評価では、標準化されたプロンプトワードテンプレートと利用可能な最高の推論予算を使用して、GPT-5.6-Sol、Kimi K3、Claude-Fable-5など、16の最先端マルチモーダル大規模言語モデルに対して自由回答形式の質問応答テストを実施します。

データフィールド:

  • インデックス: サンプルの固有インデックス番号
  • 回答: 参考回答
  • 問題:問題の説明
  • ヒント: プロンプトメッセージ
  • 画像:質問内の画像情報
  • error_category: サンプルに対応する原子センシング能力のカテゴリ。
  • source_bmk: アップストリームベンチマークのソース識別子
  • source_idx: アップストリームベンチマークにおけるサンプルの元のインデックス。

引用

@article{perceptionbench2026,
title   = {PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models},
author  = {Moonshot AI},
year    = {2026}
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています