HyperAIHyperAI

Command Palette

Search for a command to run...

ClimbMix 聚类混合预训练数据集

日期

数据集组织

英伟达

论文 URL

2504.13161

许可证

CC BY NC 4.0

ClimbMix 数据集是由 NVIDIA 于 2025 年发布的一个专为大语言模型高效预训练设计的高质量数据集,相关论文成果为「CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training」,旨在通过创新的聚类与迭代混合算法,在同等 Token 预算下提供优于现有公开数据集的预训练性能。

该数据集包含 4,000 亿个 Token,数据格式为文本格式(Parquet),采用 GPT-2 分词器进行预处理和分词。 数据集的构建过程首先将原始数据按主题信息分为 1,000 个组,随后应用广告检测和教育价值评估两类分类器对每组数据进行评分,剔除低质量数据,最后根据特定权重混合剩余的高质量数据组。 该数据集仅用于研发目的,旨在帮助研究人员探索更高效的模型缩放趋势。

数据集组成

数据集主要包含以下关键信息:

  • 数据规模:4,000 亿 Token
  • 数据格式:Parquet 格式存储的文本序列
  • 分词方式:使用 GPT-2 tokenizer 进行分词
  • 数据来源:自动化收集与处理
  • 标签方法:自动化标签与过滤
数据集示例
数据集示例

Citation

@article{diao2025climb,
  author    = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
  title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training}, 
  journal   = {arXiv preprint},
  year      = {2025},
  archivePrefix = {arXiv},
  primaryClass = {cs.CL},
  url={https://arxiv.org/abs/2504.13161}, 
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供