HyperAIHyperAI

Command Palette

Search for a command to run...

DataCompDR-12M: نص-صورة مع تسميات توضيحية اصطناعية

التاريخ

المؤسسة

رابط الورقة البحثية

2311.17049

الترخيص

apple-amlr

تم إصدار مجموعة البيانات DataCompDR-12M بواسطة شركة آبل في عام 2024، وهي عبارة عن مجموعة بيانات للصور والنصوص تحتوي على نصوص مُصنَّعة وتضمينات صور وبيانات وصفية. النتيجة البحثية ذات الصلة متاحة عبر «MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training»، ويهدف المشروع إلى تحسين كفاءة تدريب نماذج الصور والنصوص وأدائها من خلال استراتيجيات تعزيز البيانات متعددة الوسائط.

تحتوي هذه المجموعة على معلومات وصفية لـ 12.8 مليون صورة، وقد تم إنشاؤها بناءً على جزء فرعي من مجموعة البيانات DataComp-1B، باستخدام نموذج coca_ViT-L-14 الموجود ضمن مكتبة OpenCLIP لتوليد خمسة نصوص مصطنعة لكل صورة، مع دمج تقنيات تعزيز الصور العشوائية القوية. تتضمن المجموعة تضمين الصور، وتضمين النصوص، ومعلومات التعزيز المعتمدة على المعلمة، بالإضافة إلى المعرفات الفريدة والقيم التجزئية (Hashes) الخاصة بالصور، مما يجعلها مناسبة لتدريب نماذج فعالة لمواءمة الصور مع النصوص.

تكوين مجموعة البيانات

  • url.txt: روابط الصور (من نوع السلسلة النصية)
  • syn.json: يحتوي على قائمة بالنصوص المُنْتَجَة (syn_text)، والتي تمثل أوصافاً بديلة مولدة بواسطة النموذج
  • paug.json: يحتوي على قائمة بمعززات المعلمة (param_aug)، مسجلة تفاصيل معاملات تعزيز الصورة المحددة
  • npz: يحتوي على تضمين الصور (image_emb) وتضمين النصوص (text_emb)، وكلاهما عبارة عن قوائم من الأعداد العشرية
  • json: يحتوي على المعرّف الفريد للصورة (uid) وقيمة تجزئة SHA256 للصورة (sha256)

يتألف كل عينة بيانات من ثلاثي يتكون من صورة معززة عشوائياً، ونص حقيقي، ونص مُنتَخَب عشوائياً من بين النصوص المُصْنَعَة. يبلغ بعد المتجهات التمثيلية 1,536 بُعداً، ناتجاً عن ربط متجهين بأبعاد 768 من نموذجي معلم قويين.

数据集示例
数据集示例

عينة من مجموعة البيانات

الاستشهاد المرجعي

@InProceedings{mobileclip2024,
  author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
  title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month = {June},
  year = {2024},
}

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp