Command Palette
Search for a command to run...
Hebräisch-CLIP Hebräisch-Datensatz
Hebrew-CLIP ist ein von NVIDIA im Jahr 2024 veröffentlichtes Datenset für das Training hebräischer visuell-sprachlicher Modelle, das darauf abzielt, die Anwendung von visuell-sprachlichen Modellen wie CLIP im hebräischen Kontext zu fördern.
Das Datenset enthält etwa 7,78 Millionen hebräische Bildbeschreibungen, die hauptsächlich aus maschinell übersetzten Daten von DataComp-1B und mehrsprachigen Daten von LAION-5B bestehen. Die Daten sind im Parquet-Format gespeichert, enthalten keine tatsächlichen Bilder, sondern bieten nur Textbeschreibungen und entsprechende Verweise auf Bildeinbettungen, geeignet für das Training und die Bewertung multimodaler Modelle.
Zusammensetzung des Datensets
Das Datenset besteht aus zwei Parquet-Dateien, die jeweils hauptsächlich die folgenden Felder enthalten:
- key: Eindeutige Kennung der Beschreibung.
- heb_caption: Hebräischer Beschreibungstext.
- file_name: Name der entsprechenden Bildeinbettungsdatei.
- file_index: Indexposition der Einbettung in der Datei.
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.