HyperAI
Command Palette
Search for a command to run...
COYO-700M 画像とテキストのペア データセット

COYO-700M は、7 億 4,700 万の画像とテキストのペアと、さまざまなモデルのトレーニングにおける使いやすさを向上させる他の多くのメタ属性を含む大規模なデータセットです。このデータセットは、以前の視覚的および言語的データセットと同様の戦略に従い、HTML ドキュメント内の多くの有益な代替テキストとそれに関連する画像のペアを収集します。
データ収集プロセス
2020 年 10 月から 2021 年 8 月にかけて、研究チームは CommonCrawl の HTML ドキュメント内の代替テキストと画像ソースのペアを約 100 億件収集し、最小限のコストで画像およびテキスト レベルのフィルタリング プロセスを通じて有益でないペアを排除しました。この図は、研究チームのデータ収集プロセスの概要を示しています。
引用
@misc{kakaobrain2022coyo-700m,
title = {COYO-700M: Image-Text Pair Dataset},
author = {Byeon, Minwoo and Park, Beomhee and Kim, Haecheon and Lee, Sungjun and Baek, Woonhyuk and Kim, Saehoon},
year = {2022},
howpublished = {\url{https://github.com/kakaobrain/coyo-dataset}},
}
coyo-700m.torrent
シード中 1ダウンロード中 0完了 219総ダウンロード数 408
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。