HyperAI
Command Palette
Search for a command to run...
DataCompDR-12M 合成文本与图像嵌入
DataCompDR-12M 是由 Apple 于 2024 年发布的一个包含合成文本、图像嵌入和元数据的图像-文本数据集,相关论文成果为「MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training」,旨在通过多模态数据增强策略提升图像-文本模型的训练效率与性能。
该数据集包含 1,280 万张图像的元数据,基于 DataComp-1B 的子集生成,利用 OpenCLIP 中的 coca_ViT-L-14 模型为每张图像生成 5 条合成文本,并结合强随机图像增强技术。 数据集中包含了图像嵌入、文本嵌入、参数增强信息以及图像的唯一标识符和哈希值,适用于训练高效的图像-文本对齐模型。
数据集组成
- url.txt:图像 URL(字符串类型)
- syn.json:包含合成文本列表(syn_text),由模型生成的替代描述
- paug.json:包含参数增强列表(param_aug),记录图像增强的具体参数
- npz:包含图像嵌入(image_emb)和文本嵌入(text_emb),均为浮点数列表
- json:包含图像唯一标识符(uid)和图像 SHA256 哈希值(sha256)
每个数据样本由随机增强的图像、真实文本和随机选取的合成文本组成三元组,嵌入向量为 1,536 维,由两个强教师模型的 768 维向量拼接而成。
数据集示例
Citation
@InProceedings{mobileclip2024,
author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2024},
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。