HyperAIHyperAI

Command Palette

Search for a command to run...

ClimbLab 聚类预训练数据集

日期

数据集组织

英伟达

论文 URL

2504.13161

许可证

CC BY NC 4.0

ClimbLab 是由 NVIDIA 于 2025 年发布的一个高质量预训练语言模型数据集,相关论文成果为「CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training」,旨在为大型语言模型提供经过严格筛选和聚类优化的训练数据集。

该数据集是一个包含 1.2 万亿 token 的过滤语料库,共分为 20 个语义聚类。 该数据集主要面向研究和开发用途,格式为 Parquet,数据规模约为 4,000 亿 token(官方提供的预分词版本),采用自动化方式采集和标注。 基于 Nemotron-CC 和 SmolLM-Corpus,通过 CLIMB 聚类方法对数据进行语义重组和过滤。 具体流程包括将数据按主题分为 1,000 组,并使用广告检测和教育价值评估两个分类器进行打分,剔除低质量数据。

数据集组成

ClimbLab 数据集的结构和组成如下:

  • 数据格式:Parquet 格式,包含使用 GPT-2 tokenizer 进行分词的 token 序列。若需获取原始文本,可使用官方提供的 detokenize_climblab.py 脚本进行去分词处理。
  • 数据聚类:数据被划分为 20 个 distinct clusters(独立聚类),基于语义相关性组织,有助于提升预训练效率。
  • 数据规模:原始语料库为 1.2 万亿 token,官方发布的预分词数据集版本约为 4,000 亿 token。
  • 内容特点:经过广告过滤和教育价值评估,确保数据的高质量和教育相关性。
数据集示例
数据集示例

Citation

@article{diao2025climb,
  author    = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
  title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training}, 
  journal   = {arXiv preprint},
  year      = {2025},
  archivePrefix = {arXiv},
  primaryClass = {cs.CL},
  url={https://arxiv.org/abs/2504.13161}, 
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供