HyperAIHyperAI

Command Palette

Search for a command to run...

Ensemble De Données D'entraînement Prédictif Par Mélange Et Regroupement ClimMix

Date

Organisation

NVIDIA

URL du document

2504.13161

Licence

CC BY NC 4.0

Le jeu de données ClimbMix est un ensemble de haute qualité publié par NVIDIA en 2025, conçu spécifiquement pour le préentraînement efficace des grands modèles de langage (LLM). Les résultats associés à cette publication sont disponibles dans l'article « CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training », et visent à offrir des performances supérieures aux jeux de données publics existants lors du préentraînement, avec un budget identique en tokens, grâce à une approche innovante combinant clustering et mélange itératif.

Ce jeu de données contient 400 milliards de tokens. Il est au format texte (Parquet) et utilise le tokenisateur GPT-2 pour la préparation et le découpage des textes.
La construction du jeu de données commence par la division des données brutes en 1 000 groupes selon leurs informations thématiques. Ensuite, deux classificateurs — l’un dédié à la détection publicitaire et l’autre à l’évaluation de la valeur éducative — sont appliqués afin d’attribuer une note à chaque groupe. Les données jugées de faible qualité sont ensuite éliminées, tandis que les groupes restants contenant des données de bonne qualité sont mélangés selon certains poids prédéfinis.

Ce jeu de données est uniquement destiné à des fins de recherche et développement, visant à aider les chercheurs à explorer des tendances plus efficaces concernant l'évolution des modèles.

Composition du jeu de données

Le jeu de données comprend principalement les éléments suivants :

  • Taille des données : 400 milliards de tokens
  • Format des données : séquences stockées sous forme de texte au format Parquet
  • Méthode de tokenisation : utilisation du tokenizeur GPT-2
  • Source des données : collecte automatisée et traitement automatique
  • Méthode d'étiquetage : étiquetage et filtrage automatiques
数据集示例
数据集示例

Référence bibliographique

@article{diao2025climb,
  author    = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
  title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training}, 
  journal   = {arXiv preprint},
  year      = {2025},
  archivePrefix = {arXiv},
  primaryClass = {cs.CL},
  url={https://arxiv.org/abs/2504.13161}, 
}

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp