Command Palette
Search for a command to run...
DataComp-12M: 画像・テキストペア
DataComp-12M データセットは、Apple が 2024年に公開した強化された画像・テキストデータセットであり、関連論文の成果は「MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training」です。このデータセットは、マルチモーダルな強化学習戦略を通じて、画像・テキストモデルの学習効率とパフォーマンスを向上させることを目的としています。
本データセットには、DataComp-1B-BestPool サブセットから抽出された 12M 個のサンプルの UID(一意識別子)が含まれており、DataCompDR シリーズの一部となっています。DataCompDR は、マルチモーダルデータセットに対する強化戦略を用いて元の DataComp データを増幅し、合成キャプションや画像拡張を適用することでトレーニングプロセスを最適化します。実験結果によると、DataCompDR-12M で訓練された画像・テキストモデルは、ゼロショット分類などのタスクにおいて、CC-12M、YFCC-15M、および DataComp-Small/Medium といったベンチマークデータセットよりも著しく優れており、学習効率が最大で約 1,000 倍まで改善されました。
データセットに含まれる画像とテキストの生データは DataComp によって CC-BY-4.0 ライセンスの下に提供されており、メタデータについては Apple により Apple AMLR ライセンスに基づき公開されています。
データセット構成
本データセットは主に、DataComp-12M の各サンプルを特定するための UID リストファイルを含みます。具体的な構造は以下の通りです。
- uids.txt:12,779,520 件の UID を含むテキストリスト形式ファイルで、各行に 1 つずつ UID が記載されます。
- uids.npy:12,779,520 件分の UID からなる NumPy アレイ形式ファイルで、データタイプは numpy.dtype("u8,u8") です。
これらの UID は、DataComp-12M および DataCompDR-12M に含まれるシャードごとの UID と 1 対 1 で対応しており、データの整合性と追跡可能性を保証しています。
引用文献
@InProceedings{mobileclip2024,
author = {Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Raviteja Vemulapalli, Oncel Tuzel},
title = {MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2024},
}