HyperAIHyperAI

Command Palette

Search for a command to run...

DataComp-12M : Paires Image-Texte

Date

Organisation

URL du document

2311.17049

Licence

apple-amlr

Le jeu de données DataComp-12M est un ensemble de données image-texte amélioré publié par Apple en 2024, dont les résultats de recherche sont présentés dans l'article « MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training ». Il vise à améliorer l’efficacité et la performance des modèles image-texte grâce à une stratégie d’entraînement renforcée multimodale.

Ce jeu de données contient les identifiants uniques (UIDs) correspondant aux échantillons du sous-ensemble DataComp-1B-BestPool, faisant partie intégrante de la série de jeux de données DataCompDR. DataCompDR améliore les données originales de DataComp en appliquant des stratégies de renforcement sur des ensembles de données multimodales, optimisant ainsi le processus d’apprentissage via la génération de titres synthétiques et l’amélioration des images. Les expériences montrent que les modèles image-texte entraînés sur DataCompDR-12M surpassent significativement plusieurs références telles que CC-12M, YFCC-15M et DataComp-Small/Medium pour des tâches comme la classification zéro-shot, tout en offrant une augmentation de l’efficacité d’apprentissage comprise entre 10 fois et 1 000 fois. Les échantillons originaux d’images et de textes proviennent de DataComp avec licence CC-BY-4.0, tandis que les métadonnées ont été publiées par Apple selon la licence Apple AMLR.

Composition du jeu de données

L’essentiel de ce jeu de données réside dans un fichier listant les IDs uniques servant à identifier chaque éample contenu dans DataComp-12M. Sa structure détaillée se présente comme suit :

  • uids.txt : Un fichier texte contenant 12 779 520 UID, disposés ligne par ligne ;
  • uids.npy : Une matrice NumPy incluant également ces mêmes 12 779 520 UID, codée au format numpy.dtype("u8,u8").

Chaque UID correspond exactement à celui associé aux fragments présents tant dans le jeu de données original DataComp-12M qu’à ceux inclus dans DataCompDR-12M, garantissant cohérence et traçabilité des informations exploitées durant toute analyse ou exploitation ultérieure.

Citation

@InProceedings{mobileclip2024,
  author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
  title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month = {June},
  year = {2024},
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp