HyperAIHyperAI

Command Palette

Search for a command to run...

Ensemble De Données Pré-entraîné Par Clustering ClimbLab

Date

Organisation

NVIDIA

URL du document

2504.13161

Licence

CC BY NC 4.0

ClimbLab est un jeu de données de modèles linguistiques pré-entraînés de haute qualité publié par NVIDIA en 2025 ; les résultats des recherches connexes sont disponibles dans « CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training », et il vise à fournir aux grands modèles linguistiques des jeux d’entraînement rigoureusement filtrés et optimisés par clustering sémantique.

Ce jeu de données constitue une corpus filtré contenant 1,2 billion de tokens, répartis en 20 clusters sémantiques.
Il est principalement destiné à la recherche et au développement, utilise le format Parquet, couvre environ 40 milliards de tokens pour la version pré-tokenisée fournie officiellement, et repose sur une collecte et un étiquetage automatisés.
Basé sur Nemotron-CC et SmolLM-Corpus, il applique la méthode de clustering CLIMB pour restructurer et filtrer les données selon leur signification sémantique.
Le processus spécifique comprend : regroupement initial des données en 1 000 thématiques, puis évaluation via deux classificateurs — l’un détectant les publicités, l’autre évaluant la valeur éducative — afin d’éliminer les contenus de faible qualité.

Composition du jeu de données

La structure et la composition du jeu ClimbLab se présentent comme suit :

  • Format des données : Au format Parquet, contenant des séquences de tokens générées avec le tokenizeur GPT-2. Pour récupérer le texte brut, utilisez le script detokenize_climblab.py fourni officielement pour effectuer le détokenizing.
  • Clustering des données : Les données sont divisées en 20 clusters indépendants, organisés selon leur similarité sémantique, ce qui améliore l’efficacité de l’apprentissage préalable.
  • Volume des données : Le corpus original compte 1,2 billion de tokens ; la version publiée officiellement, déjà pré-tokenisée, représente environ 40 milliards de tokens.
  • Caractéristiques du contenu : Après filtration despublicitaires et évaluation de la pertinence pédagogique, seule la donnée de haute qualité et éducativement pertinente est conservée.
数据集示例
数据集示例

Référence bibliographique

@article{diao2025climb,
  author    = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
  title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training}, 
  journal   = {arXiv preprint},
  year      = {2025},
  archivePrefix = {arXiv},
  primaryClass = {cs.CL},
  url={https://arxiv.org/abs/2504.13161}, 
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp