التاريخ

منذ 4 أعوام

المؤسسة

عنوان URL للنشر

github.com

رابط الورقة البحثية

arxiv.org

الترخيص

Other

الوسوم

متعدد الوسائط

فهم الفيديو

الإجابة على الأسئلة البصرية

الكمان هو اختصار لـ VIdeO-and-Language INference، والذي يمكن استخدامه لمهام الفهم المتعدد الوسائط لمقاطع الفيديو والنصوص. تحتوي مجموعة البيانات على 95,322 زوجًا من الفيديو والفرضيات من 15,887 مقطع فيديو، تغطي أكثر من 582 ساعة من الفيديو. تحتوي مقاطع الفيديو هذه على محتوى غني بديناميكيات زمنية مختلفة، وتغيرات الأحداث، والتفاعلات الشخصية. تم جمع البيانات من مصدرين: (أ) البرامج التلفزيونية الشهيرة، و(ب) مقاطع الأفلام من قنوات اليوتيوب.

تم المساهمة بهذه المجموعة من البيانات من قبل مستخدمي المجتمع وهي مخصصة للأغراض التعليمية والإعلامية فقط. إذا كان أي محتوى ينطوي على انتهاك لحقوق النشر، يرجى الاتصال بنا على [email protected] للمراجعة والإزالة الفورية.

مجموعات البيانات ذات الصلة

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي

وحدات GPU جاهزة للعمل

أفضل الأسعار

ابدأ عرض الأسعار