HyperAI
Command Palette
Search for a command to run...
Hebrew-CLIP 希伯来语数据集
Hebrew-CLIP 是由 NVIDIA 于 2024 年发布的一个面向希伯来语视觉语言模型训练的数据集,旨在促进 CLIP 等视觉语言模型在希伯来语场景下的应用。
该数据集包含约 778 万条希伯来语图像描述,主要由 DataComp-1B 机器翻译数据和 LAION-5B 多语言数据组成。数据以 Parquet 格式存储,不包含实际图像,仅提供文本描述及对应的图像嵌入引用,适用于多模态模型的训练和评估。
数据集组成
数据集由两个 Parquet 文件组成,每个文件主要包含以下字段:
- key:描述的唯一标识符。
- heb_caption:希伯来语描述文本。
- file_name:对应的图像嵌入文件名。
- file_index:嵌入在文件中的索引位置。
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。