Command Palette
Search for a command to run...
Clustering-Pretraining-Datensatz Von ClimbLab
Datum
Paper-URL
Lizenz
CC BY NC 4.0
ClimbLab ist ein hochwertiger Datensatz für vortrainierte Sprachmodelle, der von NVIDIA im Jahr 2025 veröffentlicht wurde; die zugehörige Forschungsarbeit findet sich unter „CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training“. Ziel ist es, großen Sprachmodellen einen streng gefilterten und durch Clustering optimierten Trainingsdatensatz bereitzustellen.
Der Datensatz umfasst ein gefiltertes Korpus mit insgesamt 1,2 Billionen Token und gliedert sich in 20 semantische Cluster. Er richtet sich primär an Forschungszwecke und Entwicklungsaufgaben, liegt im Parquet-Format vor und enthält etwa 400 Milliarden Token (in der vom Anbieter bereitgestellten vorsentenen Version); Erfassung und Annotation erfolgen automatisiert. Basierend auf den Quellen Nemotron-CC und SmolLM-Corpus werden Daten mittels der CLIMB-Clustering-Methode semantisch neu strukturiert und gefiltert. Der Prozess beinhaltet die Aufteilung der Daten nach Themen in 1.000 Gruppen sowie eine Bewertung über zwei Klassifikatoren – zur Erkennung von Werbung und zur Einschätzung des Bildungswerts –, um minderwertige Inhalte zu entfernen.
Zusammensetzung des Datensatzes
Struktur und Aufbau des ClimbLab-Datensatzes sind wie folgt beschrieben:
- Datenformat: Parquet-Dateien enthalten Tokensequenzen, die mit dem GPT-2-Tokenizer erstellt wurden. Um den Originaltext wiederherzustellen, kann das offiziell bereitgestellte Skript
detokenize_climblab.pyzum Detokenisieren verwendet werden. - Datencusterung: Die Daten sind in 20 unabhängige Cluster unterteilt, die aufgrund ihrer semantischen Ähnlichkeit organisiert sind, was die Effizienz beim Pretraining verbessert.
- Umfang: Das ursprüngliche Korpus beträgt 1,2 Billionen Token; die öffentlich verfügbare, vorsente Version umfasst ca. 400 Milliarden Token.
- Inhaltliche Merkmale: Durch Werbefiltration und Bewertungen zum Bildungswert wird hohe Qualität und Relevanz für Bildungsanwendungen gewährleistet.
Zitierweise
@article{diao2025climb,
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
journal = {arXiv preprint},
year = {2025},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url={https://arxiv.org/abs/2504.13161},
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.