Command Palette
Search for a command to run...
VisualOverload シーン画像理解データセット
VisualOverload は、外部の知識に依存せずに複雑なシーンの詳細に対するモデルの視覚的理解と推論能力を調べることを目的としたシーン画像理解評価データセットです。 このデータセットには、パブリックドメインの高解像度絵画から構成される2,720組の質問と回答のペアが含まれており、複数の登場人物、行動、サブプロット、複雑な背景が描かれていることが多いです。質問は手動で設計されており、モデルのシーン理解能力を包括的にテストします。このデータセットは、視覚的な質問応答の研究、詳細な画像の理解と推論、そして複数の登場人物や要素を含む複雑なシーンの評価に適しています。

引用
@InProceedings{ガブリコフ_2026_visualoverload, 著者={ポール・ガブリコフ、ウェイ・リン、M・ジェハンゼブ・ミルザ、ソウミャ・ジャハギルダル、ムハンマド・フザイファ、シヴァン・ドヴェ、セレナ・ヤン=レヴィ、ジェームズ・グラス、ヒルデ・キューネ} title={{VisualOverload}: 非常に密度の高いシーンにおける VLM の視覚的理解の調査}, 書籍タイトル = {IEEE/CVFコンピュータビジョンおよびパターン認識会議(CVPR)議事録}、 月 = {6月}、 年 = {2026} }