HyperAIHyperAI

Command Palette

Search for a command to run...

Hebrew-CLIP 希伯来语数据集

日期

数据集组织

英伟达

许可证

nvidia-license

Hebrew-CLIP 是由 NVIDIA 于 2024 年发布的一个面向希伯来语视觉语言模型训练的数据集,旨在促进 CLIP 等视觉语言模型在希伯来语场景下的应用。

该数据集包含约 778 万条希伯来语图像描述,主要由 DataComp-1B 机器翻译数据和 LAION-5B 多语言数据组成。数据以 Parquet 格式存储,不包含实际图像,仅提供文本描述及对应的图像嵌入引用,适用于多模态模型的训练和评估。

数据集组成

数据集由两个 Parquet 文件组成,每个文件主要包含以下字段:

  • key:描述的唯一标识符。
  • heb_caption:希伯来语描述文本。
  • file_name:对应的图像嵌入文件名。
  • file_index:嵌入在文件中的索引位置。

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供