Command Palette
Search for a command to run...
DataComp-12M: Bild-Text-Paare
Der Datensatz DataComp-12M ist ein erweiterter Bild-Text-Datensatz, der von Apple im Jahr 2024 veröffentlicht wurde; die zugehörige wissenschaftliche Publikation findet sich unter «MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training». Ziel ist es, durch multimodale Verstärkungstrainingstrategien die Effizienz und Leistung des Trainings von Bild-Text-Modellen zu verbessern.
Dieser Datensatz enthält die UIDs von 12 Millionen Stichproben aus dem Subset „DataComp-1B-BestPool“ und ist Teil der DataCompDR-Reihe. DataCompDR erweitert die ursprünglichen DataComp-Daten mittels multimodaler Verstärkungsansätze, indem synthetische Titel generiert und Bildverstärkungen eingesetzt werden, um den Trainingsprozess zu optimieren. Experimentelle Ergebnisse zeigen, dass auf DataCompDR-12M trainierte Bild-Text-Modelle bei Aufgaben wie Zero-Shot-Klassifizierung signifikant besser abschneiden als Modelle, die mit Benchmark-Datensätzen wie CC-12M, YFCC-15M sowie DataComp-Small oder DataComp-Medium trainiert wurden, wodurch eine Steigerung der Lerneffizienz um das Zehnfache bis Tausendfache erreicht wird. Die Originalbilder und Textstichproben stammen vom DataComp-Projekt und stehen unter der Lizenz CC-BY-4.0 zur Verfügung, während die Metadaten von Apple unter Einhaltung der Apple-AMLR-Lizenz veröffentlicht wurden.
Zusammensetzung des Datensatzes
Der Datensatz besteht hauptsächlich aus einer Datei mit UID-Listen, die zur Identifikation der Stichproben innerhalb von DataComp-12M dient. Der genaue Aufbau sieht wie folgt aus:
- uids.txt: Eine Textdatei mit 12.779.520 UIDs, wobei jede UID in einer eigenen Zeile steht.
- uids.npy: Eine NumPy-Archievdatei, die ebenfalls 12.779.520 UIDs enthält; der Datentyp lautet numpy.dtype(„u8,u8“).
Diese UIDs entsprechen exakt denen der Shards im ursprünglichen DataComp-12M-Datensatz sowie im DataCompDR-12M-Datensatz, was Konsistenz und Nachverfolgbarkeit der Daten sicherstellt.
Zitierweise
@InProceedings{mobileclip2024,
author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2024},
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.