Command Palette
Search for a command to run...
مجموعة بيانات فهم صور المشهد VisualOverload
VisualOverload عبارة عن مجموعة بيانات لتقييم فهم صور المشهد تهدف إلى فحص قدرة النموذج على الفهم البصري والتفكير في التفاصيل في المشاهد المعقدة دون الاعتماد على المعرفة الخارجية. تحتوي هذه المجموعة من البيانات على 2720 زوجًا من الأسئلة والأجوبة، تتألف من لوحات فنية عالية الدقة، متاحة للعامة، غالبًا ما تتضمن شخصيات وأحداثًا وحبكات فرعية وخلفيات معقدة. صُممت الأسئلة يدويًا لاختبار فهم النموذج للمشهد بشكل شامل. تُعد هذه المجموعة مناسبة لأبحاث الإجابات البصرية، وفهم الصور وتفسيرها بشكل مفصل، وتقييم المشاهد المعقدة ذات الشخصيات والعناصر المتعددة.

الاستشهاد
@InProceedings{Gavrikov_2026_visualoverload، المؤلفون: {بول غافريكوف، ووي لين، وم. جهانزيب ميرزا، وسوميا جاهجيردار، ومحمد حذيفة، وسيفان دوفه، وسيرينا يونغ ليفي، وجيمس غلاس، وهيلد كوهن}، العنوان={{VisualOverload}: استكشاف الفهم البصري لـ VLMs في مشاهد كثيفة للغاية}, عنوان الكتاب = {وقائع مؤتمر IEEE/CVF حول رؤية الحاسوب والتعرف على الأنماط (CVPR)}, الشهر = {يونيو}، السنة = {2026} }
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.