HyperAI
Command Palette
Search for a command to run...
ClimbMix 聚类混合预训练数据集
ClimbMix 数据集是由 NVIDIA 于 2025 年发布的一个专为大语言模型高效预训练设计的高质量数据集,相关论文成果为「CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training」,旨在通过创新的聚类与迭代混合算法,在同等 Token 预算下提供优于现有公开数据集的预训练性能。
该数据集包含 4,000 亿个 Token,数据格式为文本格式(Parquet),采用 GPT-2 分词器进行预处理和分词。 数据集的构建过程首先将原始数据按主题信息分为 1,000 个组,随后应用广告检测和教育价值评估两类分类器对每组数据进行评分,剔除低质量数据,最后根据特定权重混合剩余的高质量数据组。 该数据集仅用于研发目的,旨在帮助研究人员探索更高效的模型缩放趋势。
数据集组成
数据集主要包含以下关键信息:
- 数据规模:4,000 亿 Token
- 数据格式:Parquet 格式存储的文本序列
- 分词方式:使用 GPT-2 tokenizer 进行分词
- 数据来源:自动化收集与处理
- 标签方法:自动化标签与过滤
Citation
@article{diao2025climb,
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
journal = {arXiv preprint},
year = {2025},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url={https://arxiv.org/abs/2504.13161},
}
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。