HyperAIHyperAI

Command Palette

Search for a command to run...

Hebrew-CLIP 数据集希伯来语

Date

Organisation

NVIDIA

Licence

nvidia-license

Hebrew-CLIP est un ensemble de données publié par NVIDIA en 2024, conçu pour l'entraînement de modèles vision-langage en hébreu, visant à promouvoir l'application de modèles vision-langage tels que CLIP dans des contextes en hébreu.

Cet ensemble de données contient environ 7,78 millions de descriptions d'images en hébreu, principalement composé de données de traduction automatique de DataComp-1B et de données multilingues de LAION-5B. Les données sont stockées au format Parquet, sans inclure d'images réelles, mais fournissant uniquement des descriptions textuelles et des références aux embeddings d'images correspondants, adaptées à l'entraînement et à l'évaluation de modèles multimodaux.

Composition de l'ensemble de données

L'ensemble de données se compose de deux fichiers Parquet, chacun contenant principalement les champs suivants :

  • key : identifiant unique de la description.
  • heb_caption : texte de description en hébreu.
  • file_name : nom du fichier d'embedding d'image correspondant.
  • file_index : index de position de l'embedding dans le fichier.

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp