HyperAIHyperAI

Command Palette

Search for a command to run...

DataComp-12M: Bild-Text-Paare

Datum

Organisation

Paper-URL

2311.17049

Lizenz

apple-amlr

Der Datensatz DataComp-12M ist ein erweiterter Bild-Text-Datensatz, der von Apple im Jahr 2024 veröffentlicht wurde; die zugehörige wissenschaftliche Publikation findet sich unter «MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training». Ziel ist es, durch multimodale Verstärkungstrainingstrategien die Effizienz und Leistung des Trainings von Bild-Text-Modellen zu verbessern.

Dieser Datensatz enthält die UIDs von 12 Millionen Stichproben aus dem Subset „DataComp-1B-BestPool“ und ist Teil der DataCompDR-Reihe. DataCompDR erweitert die ursprünglichen DataComp-Daten mittels multimodaler Verstärkungsansätze, indem synthetische Titel generiert und Bildverstärkungen eingesetzt werden, um den Trainingsprozess zu optimieren. Experimentelle Ergebnisse zeigen, dass auf DataCompDR-12M trainierte Bild-Text-Modelle bei Aufgaben wie Zero-Shot-Klassifizierung signifikant besser abschneiden als Modelle, die mit Benchmark-Datensätzen wie CC-12M, YFCC-15M sowie DataComp-Small oder DataComp-Medium trainiert wurden, wodurch eine Steigerung der Lerneffizienz um das Zehnfache bis Tausendfache erreicht wird. Die Originalbilder und Textstichproben stammen vom DataComp-Projekt und stehen unter der Lizenz CC-BY-4.0 zur Verfügung, während die Metadaten von Apple unter Einhaltung der Apple-AMLR-Lizenz veröffentlicht wurden.

Zusammensetzung des Datensatzes

Der Datensatz besteht hauptsächlich aus einer Datei mit UID-Listen, die zur Identifikation der Stichproben innerhalb von DataComp-12M dient. Der genaue Aufbau sieht wie folgt aus:

  • uids.txt: Eine Textdatei mit 12.779.520 UIDs, wobei jede UID in einer eigenen Zeile steht.
  • uids.npy: Eine NumPy-Archievdatei, die ebenfalls 12.779.520 UIDs enthält; der Datentyp lautet numpy.dtype(„u8,u8“).

Diese UIDs entsprechen exakt denen der Shards im ursprünglichen DataComp-12M-Datensatz sowie im DataCompDR-12M-Datensatz, was Konsistenz und Nachverfolgbarkeit der Daten sicherstellt.

Zitierweise

@InProceedings{mobileclip2024,
  author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
  title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month = {June},
  year = {2024},
}

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp