HyperAIHyperAI

Command Palette

Search for a command to run...

DataCompDR-12M: Bild-Text Mit Synthetischen Beschriftungen

Datum

Organisation

Paper-URL

2311.17049

Lizenz

apple-amlr

DataCompDR-12M ist ein von Apple im Jahr 2024 veröffentlichtes Bild-Text-Dataset, das synthetische Texte, Bild-Einbettungen und Metadaten enthält. Die zugehörige wissenschaftliche Arbeit finden Sie unter „MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training“. Das Dataset zielt darauf ab, die Trainings-effizienz und Leistung von Bild-Text-Modellen durch multimodale Datenaugmentierungsstrategien zu verbessern.

Das Dataset umfasst Metadaten für 12,8 Millionen Bilder, basierend auf einer Teilmenge von DataComp-1B. Für jedes Bild wurden fünf synthetische Textbeschreibungen mit dem Modell coca_ViT-L-14 aus OpenCLIP generiert und mit starken zufälligen Bildaugmentierungstechniken kombiniert. Es enthält Bild-Einbettungen, Text-Einbettungen, Parameter-Augmentationsinformationen sowie eindeutige Bezeichner und SHA256-Hashwerte der Bilder, was es geeignet macht zum Training effizienter Modelle zur Ausrichtung zwischen Bildern und Texten.

Zusammensetzung des Datasets

  • url.txt: Bild-URLs (Typ String)
  • syn.json: Enthält eine Liste synthetischer Texte (syn_text), d.h. alternative Beschreibungen, die vom Modell generiert wurden
  • paug.json: Enthält eine Liste von Parametern für Augmentationen (param_aug), welche die spezifischen Parameter der Bildaugmentation dokumentieren
  • npz: Enthält Bild-Einbettungen (image_emb) und Text-Einbettungen (text_emb), beide als Float-Listen gespeichert
  • json: Enthält den eindeutigen Identifikator des Bildes (uid) und dessen SHA256-Hashwert (sha256)

Jede Datenseite besteht aus einem Triplet bestehend aus einem zufällig augmentierten Bild, einem echten Text und einem zufällig ausgewählten synthetischen Text. Die Einbettungsvektoren haben eine Dimensionalität von 1.536 und entstehen durch die Verkettung zweier 768-dimensionaler Vektoren starker Lehrermodelle.

数据集示例
数据集示例

Datensatzbeispiel

Zitierweise

@InProceedings{mobileclip2024,
  author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
  title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month = {June},
  year = {2024},
}

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp