HyperAIHyperAI

Command Palette

Search for a command to run...

Hebrew-CLIP ヘブライ語データセット

日付

データセット構成

NVIDIA

ライセンス

nvidia-license

Hebrew-CLIP は、NVIDIA が2024年に公開した、ヘブライ語の視覚言語モデルトレーニング用データセットであり、CLIP などの視覚言語モデルのヘブライ語環境での応用を促進することを目的としています。

このデータセットには約778万件のヘブライ語画像キャプションが含まれており、主に DataComp-1B の機械翻訳データと LAION-5B の多言語データで構成されています。データは Parquet 形式で保存され、実際の画像は含まれず、テキストキャプションと対応する画像埋め込みの参照のみを提供し、マルチモーダルモデルのトレーニングと評価に適しています。

データセット構成

データセットは2つの Parquet ファイルで構成され、各ファイルには主に以下のフィールドが含まれます:

  • key:キャプションの一意の識別子。
  • heb_caption:ヘブライ語のキャプションテキスト。
  • file_name:対応する画像埋め込みファイル名。
  • file_index:ファイル内の埋め込みのインデックス位置。

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています