HyperAIHyperAI

Command Palette

Search for a command to run...

Hebräisch-CLIP Hebräisch-Datensatz

Datum

Organisation

NVIDIA

Lizenz

nvidia-license

Hebrew-CLIP ist ein von NVIDIA im Jahr 2024 veröffentlichtes Datenset für das Training hebräischer visuell-sprachlicher Modelle, das darauf abzielt, die Anwendung von visuell-sprachlichen Modellen wie CLIP im hebräischen Kontext zu fördern.

Das Datenset enthält etwa 7,78 Millionen hebräische Bildbeschreibungen, die hauptsächlich aus maschinell übersetzten Daten von DataComp-1B und mehrsprachigen Daten von LAION-5B bestehen. Die Daten sind im Parquet-Format gespeichert, enthalten keine tatsächlichen Bilder, sondern bieten nur Textbeschreibungen und entsprechende Verweise auf Bildeinbettungen, geeignet für das Training und die Bewertung multimodaler Modelle.

Zusammensetzung des Datensets

Das Datenset besteht aus zwei Parquet-Dateien, die jeweils hauptsächlich die folgenden Felder enthalten:

  • key: Eindeutige Kennung der Beschreibung.
  • heb_caption: Hebräischer Beschreibungstext.
  • file_name: Name der entsprechenden Bildeinbettungsdatei.
  • file_index: Indexposition der Einbettung in der Datei.

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp