HyperAIHyperAI

Command Palette

Search for a command to run...

Clustering-Pretraining-Datensatz Von ClimbLab

Datum

Organisation

NVIDIA

Paper-URL

2504.13161

Lizenz

CC BY NC 4.0

ClimbLab ist ein hochwertiger Datensatz für vortrainierte Sprachmodelle, der von NVIDIA im Jahr 2025 veröffentlicht wurde; die zugehörige Forschungsarbeit findet sich unter „CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training“. Ziel ist es, großen Sprachmodellen einen streng gefilterten und durch Clustering optimierten Trainingsdatensatz bereitzustellen.

Der Datensatz umfasst ein gefiltertes Korpus mit insgesamt 1,2 Billionen Token und gliedert sich in 20 semantische Cluster. Er richtet sich primär an Forschungszwecke und Entwicklungsaufgaben, liegt im Parquet-Format vor und enthält etwa 400 Milliarden Token (in der vom Anbieter bereitgestellten vorsentenen Version); Erfassung und Annotation erfolgen automatisiert. Basierend auf den Quellen Nemotron-CC und SmolLM-Corpus werden Daten mittels der CLIMB-Clustering-Methode semantisch neu strukturiert und gefiltert. Der Prozess beinhaltet die Aufteilung der Daten nach Themen in 1.000 Gruppen sowie eine Bewertung über zwei Klassifikatoren – zur Erkennung von Werbung und zur Einschätzung des Bildungswerts –, um minderwertige Inhalte zu entfernen.

Zusammensetzung des Datensatzes

Struktur und Aufbau des ClimbLab-Datensatzes sind wie folgt beschrieben:

  • Datenformat: Parquet-Dateien enthalten Tokensequenzen, die mit dem GPT-2-Tokenizer erstellt wurden. Um den Originaltext wiederherzustellen, kann das offiziell bereitgestellte Skript detokenize_climblab.py zum Detokenisieren verwendet werden.
  • Datencusterung: Die Daten sind in 20 unabhängige Cluster unterteilt, die aufgrund ihrer semantischen Ähnlichkeit organisiert sind, was die Effizienz beim Pretraining verbessert.
  • Umfang: Das ursprüngliche Korpus beträgt 1,2 Billionen Token; die öffentlich verfügbare, vorsente Version umfasst ca. 400 Milliarden Token.
  • Inhaltliche Merkmale: Durch Werbefiltration und Bewertungen zum Bildungswert wird hohe Qualität und Relevanz für Bildungsanwendungen gewährleistet.
数据集示例
数据集示例

Zitierweise

@article{diao2025climb,
  author    = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
  title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training}, 
  journal   = {arXiv preprint},
  year      = {2025},
  archivePrefix = {arXiv},
  primaryClass = {cs.CL},
  url={https://arxiv.org/abs/2504.13161}, 
}

KI mit KI entwickeln

Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.

KI-gestütztes kollaboratives Programmieren
Sofort einsatzbereite GPUs
Die besten Preise

HyperAI Newsletters

Abonnieren Sie unsere neuesten Updates
Wir werden die neuesten Updates der Woche in Ihren Posteingang liefern um neun Uhr jeden Montagmorgen
Unterstützt von MailChimp