HyperAIHyperAI

Command Palette

Search for a command to run...

Clustering Pre-training Dataset for ClimbLab

日付

データセット構成

NVIDIA

Paper URL

2504.13161

ライセンス

CC BY NC 4.0

ClimbLab は、NVIDIA が 2025年に公開した高品質な事前学習言語モデル用データセットです。関連論文は「CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training」で、大規模言語モデルに対して厳密にフィルタリングされクラスター最適化されたトレーニングデータを供給することを目的としています。

このデータセットは 1.2 トリリオンのトークンを含むフィルタ済みコーパスであり、計 20 の意味的なクラスタに分かれています。 主に研究および開発向けに設計されており、形式は Parquet です。データ量は約 4,000 エルティオン トークン(公式が提供するプレトークナイズ版)、収集と注釈付けは自動化されています。 Nemotron-CC と SmolLM-Corpus を基盤とし、CLIMB クラスタリング手法を用いてデータの意味再構成とフィルタリングを行っています。 具体的なプロセスでは、まずテーマごとに 1,000 グループに分割し、広告検出分類器と教育的価値評価分類器の両方によってスコアリングを行い、低品質なデータを除外します。

データセットの構成

ClimbLab データセットの構造と内訳は以下の通りです:

  • データフォーマット:GPT-2 トークナイザーを使用してトークン化したシーケンスを含む Parquet フォーマット。元のテキストを取得する場合は、公式が提供する detokenize_climblab.py スクリプトを使ってデトークナイズ処理を行ってください。
  • データクラスタリング:データは 20 の個別クラスタ(distinct clusters)に区分けされており、意味的近接性に基づいて整理されており、事前学習効率の向上に寄与します。
  • データサイズ:元々のコーパスは 1.2 トリリオン トークンですが、公式リリース済みのプレトークナイズ版データセットは約 4,000 エルティオン トークンです。
  • コンテンツ特性:広告フィルターや教育的価値評価を経ており、高品質かつ教育的に関連性の高いことを保証しています。
数据集示例
数据集示例

引用文献

@article{diao2025climb,
  author    = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
  title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training}, 
  journal   = {arXiv preprint},
  year      = {2025},
  archivePrefix = {arXiv},
  primaryClass = {cs.CL},
  url={https://arxiv.org/abs/2504.13161}, 
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています