Command Palette
Search for a command to run...
مجموعة بيانات الإجابة على الأسئلة المرئية Visual7W
التاريخ
الحجم
رابط النشر
رابط الورقة البحثية
الترخيص
أخرى

Visual7W عبارة عن مجموعة بيانات لفهم محتوى الصورة. إنه يقوم بأداء مهام الإجابة على الأسئلة البصرية من خلال وصف مناطق الصورة في النص وارتباطاتها. لا تحتوي مجموعة البيانات على الصورة نفسها فحسب، بل تحتوي أيضًا على أسئلة وأجوبة تتعلق بمحتوى منطقة الصورة.
Visual7W عبارة عن مجموعة فرعية من مجموعة بيانات Visual Genome، تحتوي على 47,300 صورة لمجموعة بيانات COCO، و327,929 زوجًا من الأسئلة والأجوبة، و1,311,756 سؤالًا متعدد الاختيارات من صنع الإنسان، و561,459 أساسًا للأشياء تغطي 36,579 فئة.
تتكون أسئلة Visual7W بشكل أساسي من ماذا، وأين، وكيف، ومتى، ومن، ولماذا، وأي. الأسئلة هي اختيارات متعددة وكل سؤال لديه أربعة إجابات محتملة.
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — عجّل تطوير الذكاء الاصطناعي الخاص بك من خلال البرمجة المشتركة المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.