Command Palette
Search for a command to run...
Ensemble De Données Pré-entraîné Par Clustering ClimbLab
Date
URL du document
Licence
CC BY NC 4.0
ClimbLab est un jeu de données de modèles linguistiques pré-entraînés de haute qualité publié par NVIDIA en 2025 ; les résultats des recherches connexes sont disponibles dans « CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training », et il vise à fournir aux grands modèles linguistiques des jeux d’entraînement rigoureusement filtrés et optimisés par clustering sémantique.
Ce jeu de données constitue une corpus filtré contenant 1,2 billion de tokens, répartis en 20 clusters sémantiques.
Il est principalement destiné à la recherche et au développement, utilise le format Parquet, couvre environ 40 milliards de tokens pour la version pré-tokenisée fournie officiellement, et repose sur une collecte et un étiquetage automatisés.
Basé sur Nemotron-CC et SmolLM-Corpus, il applique la méthode de clustering CLIMB pour restructurer et filtrer les données selon leur signification sémantique.
Le processus spécifique comprend : regroupement initial des données en 1 000 thématiques, puis évaluation via deux classificateurs — l’un détectant les publicités, l’autre évaluant la valeur éducative — afin d’éliminer les contenus de faible qualité.
Composition du jeu de données
La structure et la composition du jeu ClimbLab se présentent comme suit :
- Format des données : Au format Parquet, contenant des séquences de tokens générées avec le tokenizeur GPT-2. Pour récupérer le texte brut, utilisez le script
detokenize_climblab.pyfourni officielement pour effectuer le détokenizing. - Clustering des données : Les données sont divisées en 20 clusters indépendants, organisés selon leur similarité sémantique, ce qui améliore l’efficacité de l’apprentissage préalable.
- Volume des données : Le corpus original compte 1,2 billion de tokens ; la version publiée officiellement, déjà pré-tokenisée, représente environ 40 milliards de tokens.
- Caractéristiques du contenu : Après filtration despublicitaires et évaluation de la pertinence pédagogique, seule la donnée de haute qualité et éducativement pertinente est conservée.
Référence bibliographique
@article{diao2025climb,
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
journal = {arXiv preprint},
year = {2025},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url={https://arxiv.org/abs/2504.13161},
}
Créer de l'IA avec l'IA
De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.