Command Palette
Search for a command to run...
Image Understanding Benchmark Bildverständnis-Benchmark-Datensatz
Image Understanding Benchmark ist ein synthetischer Datensatz zur Bewertung des Bildverständnisses, der 2024 von Microsoft veröffentlicht wurde. Er zielt darauf ab, die Fähigkeiten multimodaler Modelle in Bereichen wie Bildverständnis, räumlichem Denken, visuellen Hinweisen, Objekterkennung und Detektion zu bewerten.
Der Datensatz umfasst vier Unteraufgaben: Objektdetektion, Objekterkennung, räumliches Denken und visuelle Hinweise, mit insgesamt etwa 10.240 generierten Bildern. Die Daten werden programmatisch erzeugt, indem COCO-Objekte mit Places365-Hintergründen kombiniert und zufällige Rotationen, Positionen und Skalierungsvarianten hinzugefügt werden. Sie eignen sich zur Bewertung der visuellen Verständnisfähigkeiten multimodaler Modelle.
Zusammensetzung des Datensatzes
Der Datensatz enthält 8 Konfigurationen (configs), unterteilt in Bedingungen mit einem Objekt (single) und zwei Objekten (pairs), und umfasst die folgenden vier Unteraufgaben:
- Objektdetektion (Object Detection)
- Objekterkennung (Object Recognition)
- Räumliches Denken (Spatial Reasoning)
- Visuelle Hinweise (Visual Prompting)
Für jede Unteraufgabe werden unter beiden Bedingungen jeweils 1.280 Bilder generiert, insgesamt etwa 10.240 Bilder. Jede Konfiguration enthält hauptsächlich die folgenden Felder:
- id: Eindeutige Nummer der Datenprobe.
- image: Eingabebild.
- prompt: Hinweistext zur Bewertung des Modells.
- ground_truth: Standardantwort in einigen Aufgaben.
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.