HyperAI
Command Palette
Search for a command to run...
ClimbLab 聚类预训练数据集
ClimbLab 是由 NVIDIA 于 2025 年发布的一个高质量预训练语言模型数据集,相关论文成果为「CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training」,旨在为大型语言模型提供经过严格筛选和聚类优化的训练数据集。
该数据集是一个包含 1.2 万亿 token 的过滤语料库,共分为 20 个语义聚类。 该数据集主要面向研究和开发用途,格式为 Parquet,数据规模约为 4,000 亿 token(官方提供的预分词版本),采用自动化方式采集和标注。 基于 Nemotron-CC 和 SmolLM-Corpus,通过 CLIMB 聚类方法对数据进行语义重组和过滤。 具体流程包括将数据按主题分为 1,000 组,并使用广告检测和教育价值评估两个分类器进行打分,剔除低质量数据。
数据集组成
ClimbLab 数据集的结构和组成如下:
- 数据格式:Parquet 格式,包含使用 GPT-2 tokenizer 进行分词的 token 序列。若需获取原始文本,可使用官方提供的 detokenize_climblab.py 脚本进行去分词处理。
- 数据聚类:数据被划分为 20 个 distinct clusters(独立聚类),基于语义相关性组织,有助于提升预训练效率。
- 数据规模:原始语料库为 1.2 万亿 token,官方发布的预分词数据集版本约为 4,000 亿 token。
- 内容特点:经过广告过滤和教育价值评估,确保数据的高质量和教育相关性。
Citation
@article{diao2025climb,
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
journal = {arXiv preprint},
year = {2025},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url={https://arxiv.org/abs/2504.13161},
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。