مجموعة بيانات الإجابة على الأسئلة المرئية Visual7W
التاريخ
منذ 3 أعوام
الحجم
1.76 GB
رابط النشر
الترخيص
其他
الفئات

Visual7W عبارة عن مجموعة بيانات لفهم محتوى الصورة. إنه يقوم بأداء مهام الإجابة على الأسئلة البصرية من خلال وصف مناطق الصورة في النص وارتباطاتها. لا تحتوي مجموعة البيانات على الصورة نفسها فحسب، بل تحتوي أيضًا على أسئلة وأجوبة تتعلق بمحتوى منطقة الصورة.
Visual7W عبارة عن مجموعة فرعية من مجموعة بيانات Visual Genome، تحتوي على 47,300 صورة لمجموعة بيانات COCO، و327,929 زوجًا من الأسئلة والأجوبة، و1,311,756 سؤالًا متعدد الاختيارات من صنع الإنسان، و561,459 أساسًا للأشياء تغطي 36,579 فئة.
تتكون أسئلة Visual7W بشكل أساسي من ماذا، وأين، وكيف، ومتى، ومن، ولماذا، وأي. الأسئلة هي اختيارات متعددة وكل سؤال لديه أربعة إجابات محتملة.
Visual7W.torrent
البذر 1التنزيل 1مكتمل 397إجمالي التنزيلات 510