Command Palette
Search for a command to run...
DataCompDR-12M: Bild-Text Mit Synthetischen Beschriftungen
DataCompDR-12M ist ein von Apple im Jahr 2024 veröffentlichtes Bild-Text-Dataset, das synthetische Texte, Bild-Einbettungen und Metadaten enthält. Die zugehörige wissenschaftliche Arbeit finden Sie unter „MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training“. Das Dataset zielt darauf ab, die Trainings-effizienz und Leistung von Bild-Text-Modellen durch multimodale Datenaugmentierungsstrategien zu verbessern.
Das Dataset umfasst Metadaten für 12,8 Millionen Bilder, basierend auf einer Teilmenge von DataComp-1B. Für jedes Bild wurden fünf synthetische Textbeschreibungen mit dem Modell coca_ViT-L-14 aus OpenCLIP generiert und mit starken zufälligen Bildaugmentierungstechniken kombiniert. Es enthält Bild-Einbettungen, Text-Einbettungen, Parameter-Augmentationsinformationen sowie eindeutige Bezeichner und SHA256-Hashwerte der Bilder, was es geeignet macht zum Training effizienter Modelle zur Ausrichtung zwischen Bildern und Texten.
Zusammensetzung des Datasets
- url.txt: Bild-URLs (Typ String)
- syn.json: Enthält eine Liste synthetischer Texte (
syn_text), d.h. alternative Beschreibungen, die vom Modell generiert wurden - paug.json: Enthält eine Liste von Parametern für Augmentationen (
param_aug), welche die spezifischen Parameter der Bildaugmentation dokumentieren - npz: Enthält Bild-Einbettungen (
image_emb) und Text-Einbettungen (text_emb), beide als Float-Listen gespeichert - json: Enthält den eindeutigen Identifikator des Bildes (
uid) und dessen SHA256-Hashwert (sha256)
Jede Datenseite besteht aus einem Triplet bestehend aus einem zufällig augmentierten Bild, einem echten Text und einem zufällig ausgewählten synthetischen Text. Die Einbettungsvektoren haben eine Dimensionalität von 1.536 und entstehen durch die Verkettung zweier 768-dimensionaler Vektoren starker Lehrermodelle.
Datensatzbeispiel
Zitierweise
@InProceedings{mobileclip2024,
author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2024},
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.