HyperAI
Command Palette
Search for a command to run...
Hebrew-CLIP ヘブライ語データセット
Hebrew-CLIP は、NVIDIA が2024年に公開した、ヘブライ語の視覚言語モデルトレーニング用データセットであり、CLIP などの視覚言語モデルのヘブライ語環境での応用を促進することを目的としています。
このデータセットには約778万件のヘブライ語画像キャプションが含まれており、主に DataComp-1B の機械翻訳データと LAION-5B の多言語データで構成されています。データは Parquet 形式で保存され、実際の画像は含まれず、テキストキャプションと対応する画像埋め込みの参照のみを提供し、マルチモーダルモデルのトレーニングと評価に適しています。
データセット構成
データセットは2つの Parquet ファイルで構成され、各ファイルには主に以下のフィールドが含まれます:
- key:キャプションの一意の識別子。
- heb_caption:ヘブライ語のキャプションテキスト。
- file_name:対応する画像埋め込みファイル名。
- file_index:ファイル内の埋め込みのインデックス位置。
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。