HyperAI
Command Palette
Search for a command to run...
DataCompDR-12M:合成キャプション付き画像テキストデータセット
DataCompDR-12M は、Apple が 2024年に公開した合成テキスト、画像埋め込み、およびメタデータを含む画像-テキストデータセットです。関連論文は「MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training」で発表されており、マルチモーダルなデータ拡張戦略を通じて画像-テキストアライメントモデルの学習効率とパフォーマンスを向上させることを目的としています。
このデータセットには 1,280 万件の画像のメタデータが含まれており、DataComp-1B のサブセットに基づいて生成されています。各画像に対して OpenCLIP に搭載された coca_ViT-L-14 モデルを用いて 5 つの合成テキストが作成され、強力なランダム画像拡張技術も組み合わされています。
データセットには画像埋め込み、テキスト埋め込み、パラメータ拡張情報、そして各画像のユニーク ID とハッシュ値が含まれ、効率的な画像-テキストアライメントモデルの訓練に適しています。
データセット構成
- url.txt:画像の URL(文字列型)
- syn.json:モデルによって生成された代替説明である合成テキストリスト(syn_text)を含む
- paug.json:画像拡張の詳細パラメータを記録するパラメータ拡張リスト(param_aug)を含む
- npz:浮動小数点配列として格納された画像埋め込み(image_emb)およびテキスト埋め込み(text_emb)を含む
- json:画像のユニーク ID(uid)と画像の SHA256 ハッシュ値(sha256)を含む
各サンプルは、ランダムに拡張された画像、実際のテキスト、およびランダムに選択された合成テキストからなるトリプルで構成されます。埋め込みベクトルは 1,536 次元であり、2つの強教師モデルからの 768 次元ベクトルをつなぎ合わせたものです。
データセット例
引用文献
@InProceedings{mobileclip2024,
author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2024},
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。