HyperAI
Command Palette
Search for a command to run...
InternVid - 完全な高品質の大規模ビデオテキストデータセット

このデータセットは、上海人工知能実験室(上海AI実験室)、南京大学、中国科学院などが共同で2024年に公開する高品質かつ大規模な動画・テキストデータセットであり、人工知能の大規模化に対応することを目的としています。ビデオ言語モデリングでは、大規模なモデルのビデオを理解して生成する能力をさらに向上させることが求められています。 世界最大のビデオテキスト公開データセットの 1 つとして、InternVid には、詳細なテキスト説明を含む 700 万以上のビデオが含まれており、16 のシーンと約 6,000 のアクションの説明が含まれており、総再生時間はほぼ 760,000 時間になります。データセット内でビデオとテキストの高度な対応性を備えていますビデオとテキストの説明が厳密に一致している、ビデオ テキストの意味一致、ビデオ テキストの検索、ビデオ テキストの生成などのマルチモーダル学習タスク トレーニングのための「ビデオ辞書」を提供します。 InternVid は学術コミュニティから広く注目されており、マルチモーダル ワールド モデル LWM に適用されており、Google および Stable AI によるビデオ生成作業で使用または参照されており、2024 年の国際表現会議で関連論文が注目を集めています。学習 (ICLR 2024)。
引用
@article{wang2023internvid,
title={InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation},
author={Wang, Yi and He, Yinan and Li, Yizhuo and Li, Kunchang and Yu, Jiashuo and Ma, Xin and Chen, Xinyuan and Wang, Yaohui and Luo, Ping and Liu, Ziwei and Wang, Yali and Wang, Limin and Qiao, Yu},
journal={arXiv preprint arXiv:2307.06942},
year={2023}
}
@article{wang2022internvideo,
title={InternVideo: General Video Foundation Models via Generative and Discriminative Learning},
author={Wang, Yi and Li, Kunchang and Li, Yizhuo and He, Yinan and Huang, Bingkun and Zhao, Zhiyu and Zhang, Hongjie and Xu, Jilan and Liu, Yi and Wang, Zun and Xing, Sen and Chen, Guo and Pan, Junting and Yu, Jiashuo and Wang, Yali and Wang, Limin and Qiao, Yu},
journal={arXiv preprint arXiv:2212.03191},
year={2022}
}
InternVid-Full.torrent
シード中 1ダウンロード中 0完了 227総ダウンロード数 444
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。