Command Palette
Search for a command to run...
DataCompDR-12M : Texte-image Avec Légendes Synthétiques
DataCompDR-12M est un jeu de données d’images et de textes publié par Apple en 2024, contenant des textes synthétiques, des embeddings d’images ainsi que des métadonnées. Le résultat scientifique associé se trouve dans « MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training », avec pour objectif d’améliorer l’efficacité et les performances de l’entraînement des modèles image-texte grâce à des stratégies d’augmentation multilingue.
Ce jeu de données comprend les métadonnées de 12,8 millions d’images, générées sur la base d’un sous-ensemble de DataComp-1B. Il utilise le modèle coca_ViT-L-14 issu d’OpenCLIP afin de produire cinq descriptions textuelles synthétiques par image, combiné à une technique puissante d’augmentation aléatoire des images.
Le jeu de données intègre des embeddings d’images, des embeddings de texte, des informations relatives aux paramètres d’augmentation, ainsi qu’une identifiant unique et une valeur hachée SHA256 pour chaque image. Il convient particulièrement bien à l’entraînement efficace de modèles alignant images et textes.
Composition du jeu de données
- url.txt : URL des images (type chaîne de caractères)
- syn.json : contient la liste des textes synthétiques (syn_text), qui sont des descriptions alternatives générées par le modèle
- paug.json : contient la liste des augmentations paramétriques (param_aug), enregistrant les paramètres spécifiques utilisés lors de l’augmentation des images
- npz : contient les embeddings d’images (image_emb) et les embeddings de texte (text_emb), tous deux représentés comme des listes de nombres flottants
- json : contient l’identifiant unique de l’image (uid) ainsi que sa somme de contrôle SHA256 (sha256)
Chaque échantillon du jeu de données forme un triplet composé d’une image augmentée aléatoirement, d’un texte réel et d’un texte synthétique sélectionné au hasard. Les vecteurs embedding ont une dimensionnalité de 1 536 dimensions, obtenus en concaténant deux vecteurs de 768 dimensions issus de deux enseignants forts distincts.
Aperçu du jeu de données
Référence bibliographique
@InProceedings{mobileclip2024,
author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2024},
}
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.