HyperAI
Command Palette
Search for a command to run...
DataComp-12M 图像-文本对
DataComp-12M 数据集是由 Apple 于 2024 年发布的一个增强型图像-文本数据集,相关论文成果为「MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training」,旨在通过多模态强化训练策略提升图像-文本模型的训练效率与性能。
该数据集包含 DataComp-1B-BestPool 子集中的 12 M 个样本的 UIDs,是 DataCompDR 系列数据的一部分。 DataCompDR 利用多模态数据集强化策略对原始 DataComp 数据进行增强,通过生成合成标题和图像增强来优化训练过程。 实验表明,在 DataCompDR-12M 上训练的图像-文本模型在零样本分类等任务上显著优于 CC-12M、YFCC-15M 及 DataComp-Small/Medium 等基准数据集,实现了 10 倍至 1,000 倍的学习效率提升。 该数据集的原始图像和文本样本由 DataComp 以 CC-BY-4.0 许可发布,而元数据由 Apple 发布,遵循 Apple AMLR 许可。
数据集组成
该数据集主要包含 UID 列表文件,用于标识 DataComp-12M 数据集中的样本。具体结构如下:
- uids.txt:包含 12,779,520 个 UID 的文本列表,每行一个 UID。
- uids.npy:包含 12,779,520 个 UID 的 NumPy 数组文件,数据类型为numpy.dtype("u8,u8")。
这些 UID 与 DataComp-12M 原始数据集及 DataCompDR-12M 数据集中的分片 UID 一一对应,确保数据的一致性和可追溯性。
Citation
@InProceedings{mobileclip2024,
author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2024},
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。