Command Palette
Search for a command to run...
VisualOverload-Datensatz Zum Verständnis Von Szenenbildern
VisualOverload ist ein Datensatz zur Auswertung des Szenenbildverständnisses, der darauf abzielt, das visuelle Verständnis und die Denkfähigkeit des Modells in Bezug auf Details in komplexen Szenen zu untersuchen, ohne auf externes Wissen zurückzugreifen. Dieser Datensatz enthält 2.720 Frage-Antwort-Paare, bestehend aus gemeinfreien, hochauflösenden Gemälden, die oft mehrere Charaktere, Aktionen, Nebenhandlungen und komplexe Hintergründe aufweisen. Die Fragen werden manuell erstellt, um das Szenenverständnis des Modells umfassend zu testen. Dieser Datensatz eignet sich für die visuelle Frage-Antwort-Forschung, das detaillierte Bildverständnis und die Schlussfolgerung sowie die Bewertung komplexer Szenen mit mehreren Charakteren und Elementen.

Zitat
@InProceedings{Gavrikov_2026_visualoverload, author={Paul Gavrikov and Wei Lin and M. Jehanzeb Mirza and Soumya Jahagirdar and Muhammad Huzaifa and Sivan Doveh and Serena Yeung-Levy and James Glass and Hilde Kuehne}, title={{VisualOverload}: Probing Visual Understanding of VLMs in Really Dense Scenes}, Buchtitel = {Proceedings der IEEE/CVF-Konferenz über Computer Vision und Mustererkennung (CVPR)}, Monat = {Juni}, Jahr = {2026} }
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.