HyperAIHyperAI

Command Palette

Search for a command to run...

DataCompDR-12M:合成キャプション付き画像テキストデータセット

日付

データセット構成

Paper URL

2311.17049

ライセンス

apple-amlr

DataCompDR-12M は、Apple が 2024年に公開した合成テキスト、画像埋め込み、およびメタデータを含む画像-テキストデータセットです。関連論文は「MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training」で発表されており、マルチモーダルなデータ拡張戦略を通じて画像-テキストアライメントモデルの学習効率とパフォーマンスを向上させることを目的としています。

このデータセットには 1,280 万件の画像のメタデータが含まれており、DataComp-1B のサブセットに基づいて生成されています。各画像に対して OpenCLIP に搭載された coca_ViT-L-14 モデルを用いて 5 つの合成テキストが作成され、強力なランダム画像拡張技術も組み合わされています。

データセットには画像埋め込み、テキスト埋め込み、パラメータ拡張情報、そして各画像のユニーク ID とハッシュ値が含まれ、効率的な画像-テキストアライメントモデルの訓練に適しています。

データセット構成

  • url.txt:画像の URL(文字列型)
  • syn.json:モデルによって生成された代替説明である合成テキストリスト(syn_text)を含む
  • paug.json:画像拡張の詳細パラメータを記録するパラメータ拡張リスト(param_aug)を含む
  • npz:浮動小数点配列として格納された画像埋め込み(image_emb)およびテキスト埋め込み(text_emb)を含む
  • json:画像のユニーク ID(uid)と画像の SHA256 ハッシュ値(sha256)を含む

各サンプルは、ランダムに拡張された画像、実際のテキスト、およびランダムに選択された合成テキストからなるトリプルで構成されます。埋め込みベクトルは 1,536 次元であり、2つの強教師モデルからの 768 次元ベクトルをつなぎ合わせたものです。

数据集示例
数据集示例

データセット例

引用文献

@InProceedings{mobileclip2024,
  author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
  title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month = {June},
  year = {2024},
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています