HyperAI

مجموعة بيانات الإجابة على الأسئلة المرئية Visual7W

التاريخ

منذ 3 أعوام

الحجم

1.76 GB

المؤسسة

جامعة ستانفورد

رابط النشر

ai.stanford.edu

الترخيص

其他

特色图像

Visual7W عبارة عن مجموعة بيانات لفهم محتوى الصورة. إنه يقوم بأداء مهام الإجابة على الأسئلة البصرية من خلال وصف مناطق الصورة في النص وارتباطاتها. لا تحتوي مجموعة البيانات على الصورة نفسها فحسب، بل تحتوي أيضًا على أسئلة وأجوبة تتعلق بمحتوى منطقة الصورة.

Visual7W عبارة عن مجموعة فرعية من مجموعة بيانات Visual Genome، تحتوي على 47,300 صورة لمجموعة بيانات COCO، و327,929 زوجًا من الأسئلة والأجوبة، و1,311,756 سؤالًا متعدد الاختيارات من صنع الإنسان، و561,459 أساسًا للأشياء تغطي 36,579 فئة.

تتكون أسئلة Visual7W بشكل أساسي من ماذا، وأين، وكيف، ومتى، ومن، ولماذا، وأي. الأسئلة هي اختيارات متعددة وكل سؤال لديه أربعة إجابات محتملة.

Visual7W.torrent
البذر 1التنزيل 1مكتمل 397إجمالي التنزيلات 510
  • Visual7W/
    • README.md
      1.34 KB
    • README.txt
      2.68 KB
      • data/
        • dataset_v7w_grounding_annotations.zip
          7.07 MB
        • dataset_v7w_pointing.zip
          18.56 MB
        • dataset_v7w_telling.zip
          24.2 MB
        • visual7w-toolkit
          24.39 MB
        • visual7w_images.zip
          1.76 GB