HyperAIHyperAI

Command Palette

Search for a command to run...

DataComp-12M: 画像・テキストペア

日付

データセット構成

Paper URL

2311.17049

ライセンス

apple-amlr

DataComp-12M データセットは、Apple が 2024年に公開した強化された画像・テキストデータセットであり、関連論文の成果は「MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training」です。このデータセットは、マルチモーダルな強化学習戦略を通じて、画像・テキストモデルの学習効率とパフォーマンスを向上させることを目的としています。

本データセットには、DataComp-1B-BestPool サブセットから抽出された 12M 個のサンプルの UID(一意識別子)が含まれており、DataCompDR シリーズの一部となっています。DataCompDR は、マルチモーダルデータセットに対する強化戦略を用いて元の DataComp データを増幅し、合成キャプションや画像拡張を適用することでトレーニングプロセスを最適化します。実験結果によると、DataCompDR-12M で訓練された画像・テキストモデルは、ゼロショット分類などのタスクにおいて、CC-12M、YFCC-15M、および DataComp-Small/Medium といったベンチマークデータセットよりも著しく優れており、学習効率が最大で約 1,000 倍まで改善されました。

データセットに含まれる画像とテキストの生データは DataComp によって CC-BY-4.0 ライセンスの下に提供されており、メタデータについては Apple により Apple AMLR ライセンスに基づき公開されています。

データセット構成

本データセットは主に、DataComp-12M の各サンプルを特定するための UID リストファイルを含みます。具体的な構造は以下の通りです。

  • uids.txt:12,779,520 件の UID を含むテキストリスト形式ファイルで、各行に 1 つずつ UID が記載されます。
  • uids.npy:12,779,520 件分の UID からなる NumPy アレイ形式ファイルで、データタイプは numpy.dtype("u8,u8") です。

これらの UID は、DataComp-12M および DataCompDR-12M に含まれるシャードごとの UID と 1 対 1 で対応しており、データの整合性と追跡可能性を保証しています。

引用文献

@InProceedings{mobileclip2024,
  author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
  title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
  booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  month = {June},
  year = {2024},
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています