HyperAIHyperAI

Command Palette

Search for a command to run...

DataComp-12M: أزواج الصور والنصوص

التاريخ

المؤسسة

رابط الورقة البحثية

2311.17049

الترخيص

apple-amlr

تم إصدار مجموعة بيانات DataComp-12M بواسطة شركة أبل في عام 2024، وهي مجموعة بيانات محسّنة للصور والنصوص. تم نشر نتائج البحث المتعلقة بها في الورقة العلمية «MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training»، والتي تهدف إلى رفع كفاءة التدريب وأداء نماذج الصور والنصوص من خلال استراتيجيات تعزيز متعددة الوسائط.

تحتوي هذه المجموعة على معرفات فريدة (UIDs) لـ 12 مليون عينة من الفرع الفرعي DataComp-1B-BestPool، وتُعد جزءاً من سلسلة بيانات DataCompDR. تستفيد DataCompDR من استراتيجيات التعزيز لمجموعات البيانات متعددة الوسائط لتحسين بيانات DataComp الأصلية، وذلك عبر توليد عناوين اصطناعية وتعزيز الصور لتحسين عملية التدريب. أظهرت التجارب أن النماذج المدربة على DataCompDR-12M تتفوق بشكل ملحوظ على مجموعات البيانات المرجعية مثل CC-12M و YFCC-15M بالإضافة إلى DataComp-Small/Medium في مهام التصنيف الصفرية العيّنات (Zero-shot classification)، مما يحقق تحسناً بنسبة تصل إلى 10 أضعاف حتى 1000 ضعف في كفاءة التعلم. نُشرت العينات الأصلية من الصور والنصوص الخاصة بهذه المجموعة بموجب ترخيص CC-BY-4.0 من قبل مشروع DataComp، بينما صدرت البيانات الوصفية (Metadata) عن شركة أبل وفقاً لترخيص Apple AMLR.

تكوين مجموعة البيانات

تركز هذه المجموعة أساساً على ملف قائمة بمعرفات الفهرسة العالمية الموحدة (UIDs) المستخدمة لتحديد عينات مجموعة بيانات DataComp-12M. الهيكل التفصيلي هو كما يلي:

  • uids.txt: يحتوي على قائمة نصية تضم 12,779,520 معرّف فريد (UID)، حيث يمثل كل سطر معريفاً واحداً.
  • uids.npy: عبارة عن ملف مصفوفة NumPy يضم 12,779,520 معرّف فريد، ونوع البيانات المحدد فيه هو numpy.dtype("u8,u8").

تطابق هذه المعرفات بدقة واحدة تلو الأخرى مع معرفات الشرائح (Shard IDs) الموجودة في مجموعة البيانات الأصلية DataComp-12م وفي مجموعة البيانات DR-12M، بما يضمن اتساق البيانات وإمكان تتبعها.

الاقتباس العلمي

@InProceedings{mobileclip2024,
  author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
  title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month = {June},
  year = {2024},
}

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp