Command Palette
Search for a command to run...
Hebrew-CLIP 数据集希伯来语
Hebrew-CLIP est un ensemble de données publié par NVIDIA en 2024, conçu pour l'entraînement de modèles vision-langage en hébreu, visant à promouvoir l'application de modèles vision-langage tels que CLIP dans des contextes en hébreu.
Cet ensemble de données contient environ 7,78 millions de descriptions d'images en hébreu, principalement composé de données de traduction automatique de DataComp-1B et de données multilingues de LAION-5B. Les données sont stockées au format Parquet, sans inclure d'images réelles, mais fournissant uniquement des descriptions textuelles et des références aux embeddings d'images correspondants, adaptées à l'entraînement et à l'évaluation de modèles multimodaux.
Composition de l'ensemble de données
L'ensemble de données se compose de deux fichiers Parquet, chacun contenant principalement les champs suivants :
- key : identifiant unique de la description.
- heb_caption : texte de description en hébreu.
- file_name : nom du fichier d'embedding d'image correspondant.
- file_index : index de position de l'embedding dans le fichier.
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.