HyperAIHyperAI

Command Palette

Search for a command to run...

DataCompDR-12M 合成文本与图像嵌入

日期

数据集组织

论文 URL

2311.17049

许可证

apple-amlr

DataCompDR-12M 是由 Apple 于 2024 年发布的一个包含合成文本、图像嵌入和元数据的图像-文本数据集,相关论文成果为「MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training」,旨在通过多模态数据增强策略提升图像-文本模型的训练效率与性能。

该数据集包含 1,280 万张图像的元数据,基于 DataComp-1B 的子集生成,利用 OpenCLIP 中的 coca_ViT-L-14 模型为每张图像生成 5 条合成文本,并结合强随机图像增强技术。 数据集中包含了图像嵌入、文本嵌入、参数增强信息以及图像的唯一标识符和哈希值,适用于训练高效的图像-文本对齐模型。

数据集组成

  • url.txt:图像 URL(字符串类型)
  • syn.json:包含合成文本列表(syn_text),由模型生成的替代描述
  • paug.json:包含参数增强列表(param_aug),记录图像增强的具体参数
  • npz:包含图像嵌入(image_emb)和文本嵌入(text_emb),均为浮点数列表
  • json:包含图像唯一标识符(uid)和图像 SHA256 哈希值(sha256)

每个数据样本由随机增强的图像、真实文本和随机选取的合成文本组成三元组,嵌入向量为 1,536 维,由两个强教师模型的 768 维向量拼接而成。

数据集示例
数据集示例

数据集示例

Citation

@InProceedings{mobileclip2024,
  author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
  title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month = {June},
  year = {2024},
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供