HyperAIHyperAI

Command Palette

Search for a command to run...

Ensemble De Données De Référence Pour Les Capacités De Perception Visuelle PerceptionBench

Date

il y a 7 heures

Organisation

Moonshot AI(月之暗面)

URL du document

2607.24957

Licence

Non-Commercial

PerceptionBench est un jeu de données de référence pour évaluer les capacités de perception visuelle des grands modèles. Publié par Moonshot AI en 2026, il est spécifiquement conçu pour évaluer les capacités de perception visuelle de base des grands modèles de langage multimodaux (MLLM). Parmi les articles de recherche associés, on peut citer… PerceptionBench : Évaluation de la perception visuelle atomique dans les grands modèles de langage multimodaux . Cet ensemble de données contient 3 000 questions de test validées couvrant 10 capacités perceptives fondamentales, notamment la compréhension des relations visuelles, le comptage, la reconnaissance d'attributs, la perception de la profondeur et de la 3D, la localisation spatiale, le raisonnement comparatif, la reconnaissance fine, l'intégration contextuelle, la compréhension de texte par reconnaissance optique de caractères (OCR) et les hallucinations perceptives. Parmi ces questions, 1 800 sont des sous-problèmes élémentaires dérivés d'exemples d'échecs de jeux de données de référence existants, et 1 200 sont des questions nouvellement créées à partir d'images supplémentaires. L'évaluation utilise des modèles de mots-clés standardisés et le budget d'inférence maximal disponible pour réaliser des tests de réponse à des questions ouvertes sur 16 modèles de langage multimodaux de pointe, dont GPT-5.6-Sol, Kimi K3 et Claude-Fable-5.

Champs de données :

  • index : Numéro d'index unique de l'échantillon
  • Réponse : Réponse de référence
  • Problème : Description du problème
  • Indice : Message d'invite
  • Image : Informations sur l'image dans la question
  • error_category : La catégorie de capacité de détection atomique correspondant à l’échantillon.
  • source_bmk : Identifiant de la source du benchmark en amont
  • source_idx : L’index d’origine de l’échantillon dans le benchmark en amont.

Citation

@article{perceptionbench2026,
title   = {PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models},
author  = {Moonshot AI},
year    = {2026}
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp