Command Palette
Search for a command to run...
基准数据集用于图像理解基准测试
Image Understanding Benchmark est un ensemble de données synthétiques publié par Microsoft en 2024 pour l'évaluation de la compréhension d'images, conçu pour évaluer les capacités des modèles multimodaux en matière de compréhension d'images, de raisonnement spatial, de sollicitation visuelle, de reconnaissance et de détection d'objets.
Cet ensemble de données comprend quatre sous-tâches : détection d'objets, reconnaissance d'objets, raisonnement spatial et sollicitation visuelle, générant au total environ 10 240 images. Les données sont générées de manière procédurale, combinant des objets COCO et des arrière-plans Places365, avec des variations aléatoires de rotation, de position et d'échelle, et peuvent être utilisées pour évaluer les capacités de compréhension visuelle des modèles multimodaux.
Composition de l'ensemble de données
L'ensemble de données comprend 8 configurations (config), divisées en deux conditions : objet unique (single) et paires d'objets (pairs), couvrant les quatre sous-tâches suivantes :
- Détection d'objets (Object Detection)
- Reconnaissance d'objets (Object Recognition)
- Raisonnement spatial (Spatial Reasoning)
- Sollicitation visuelle (Visual Prompting)
Chaque sous-tâche génère 1 280 images dans chacune des deux conditions, soit un total d'environ 10 240 images. Chaque configuration comprend principalement les champs suivants :
- id : numéro unique de l'échantillon de données.
- image : image d'entrée.
- prompt : texte de sollicitation utilisé pour l'évaluation du modèle.
- ground_truth : réponse standard dans certaines tâches.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.