Command Palette
Search for a command to run...
WIT 画像テキスト データセット

WIT (Wikipedia ベースの Image Text の正式名) は、大規模なマルチモーダルおよび多言語データ セットです。このデータセットは、3,760 万個のエンティティが豊富な画像とテキストのサンプルの厳選されたコレクションで構成されており、ウィキペディアの 108 言語での 1,150 万個の一意の画像が含まれています。このデータセットの規模により、マルチモーダル機械学習モデルの事前トレーニング データセットとして使用できます。 WIT には 4 つの独自の利点があります。
- WIT は、画像テキストのサンプル数に基づく最大のマルチモーダル データセットです。
- 100 を超える言語がカバーされており (言語ごとに少なくとも 12,000 の例が含まれます)、多くの画像にはクロスランゲージ テキストが提供されています。
- 以前のデータセットと比較して、WIT はより多様な概念と現実世界のエンティティのセットを表します。
- WIT は、非常に困難な現実世界のテスト セットを提供します。
引用
@inproceedings{10.1145/3404835.3463257, 著者 = {Srinivasan, Krishna、Raman, Karthik、Chen, Jiecao、Bendersky, Michael、Najork, Marc}、 タイトル = {WIT: マルチモーダル多言語機械学習のためのWikipediaベースの画像テキストデータセット}、 年 = {2021}、 ISBN = {9781450380379}、 発行者 = {Association for Computing Machinery}、 住所 = {ニューヨーク州ニューヨーク州米国}、 url = {https://doi.org/10.1145/3404835.3463257}, doi = {10.1145/3404835.3463257}、 書籍タイトル = {第44回国際ACM SIGIR情報検索研究開発会議議事録} ページ = {2443–2449}、 ページ数 = {7}、 キーワード = {データセット、マルチモーダル、機械学習、ウィキペディア、多言語、画像テキスト検索、ニューラルネットワーク} 場所 = {バーチャルイベント、カナダ}、 シリーズ = {SIGIR '21} }