Command Palette
Search for a command to run...
Clustering-Mix-Vorbereitungstraining-Datensatz Für ClimbMix
Das ClimbMix-Datenset wurde von NVIDIA im Jahr 2025 veröffentlicht und ist ein hochwertiges Datenset, das speziell für die effiziente Vorabtrainierung großer Sprachmodelle konzipiert wurde. Die zugehörige Forschungsarbeit findet sich unter „CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training“ und zielt darauf ab, durch innovative Clusterungs- und iterative Mischalgorithmen bei gleichem Token-Budget eine bessere Vorabtrainierungsleistung als bestehende öffentliche Datensätze zu erzielen.
Dieses Datenset enthält 400 Milliarden Tokens; das Datenformat ist Text (Parquet), wobei der GPT-2-Tokenizer zur Vorverarbeitung und Tokenisierung verwendet wird. Der Aufbau des Datensets beginnt damit, dass Rohdaten nach Themeninformationen in 1.000 Gruppen eingeteilt werden. Anschließend werden zwei Klassifikatoren – einer zum Erkennen von Werbung und einer zur Bewertung des Bildungswerts – auf jede Gruppe angewendet, um diese zu bewerten. Schlecht bewertete Daten werden entfernt, und schließlich werden die verbleibenden hochwertigen Datengruppen gemäß bestimmten Gewichten gemischt. Das Datenset dient ausschließlich Forschungszwecken und soll Forschern dabei helfen, effizientere Skalierungstrends für Modelle zu erkunden.
Zusammensetzung des Datensets
Der Datensatz umfasst hauptsächlich folgende Schlüsselinformationen:
- Datenmenge: 400 Milliarden Tokens
- Datenformat: Als Parquet gespeicherte Textsequenzen
- Tokenisiermethode: Verwendung eines GPT-2-Tokenizers
- Datenherkunft: Automatisierte Sammlung und Verarbeitung
- Labeling-Methode: Automatische Kennzeichnung und Filterung
<div style="text-align:center">
<img src="https://hyperai.cn-bj.ufileos.com/40d47e27-c8c9-4dc7-92c3-901dfbd21afe" alt="数据集示例">
</div>
Zitation
@article{diao2025climb,
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
journal = {arXiv preprint},
year = {2025},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url={https://arxiv.org/abs/2504.13161},
}
KI mit KI entwickeln
Von der Idee bis zum Launch – beschleunigen Sie Ihre KI-Entwicklung mit kostenlosem KI-Co-Coding, sofort einsatzbereiter Umgebung und bestem GPU-Preis.