HyperAI
Command Palette
Search for a command to run...
Clustering Pre-training Dataset for ClimbLab
ClimbLab は、NVIDIA が 2025年に公開した高品質な事前学習言語モデル用データセットです。関連論文は「CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training」で、大規模言語モデルに対して厳密にフィルタリングされクラスター最適化されたトレーニングデータを供給することを目的としています。
このデータセットは 1.2 トリリオンのトークンを含むフィルタ済みコーパスであり、計 20 の意味的なクラスタに分かれています。 主に研究および開発向けに設計されており、形式は Parquet です。データ量は約 4,000 エルティオン トークン(公式が提供するプレトークナイズ版)、収集と注釈付けは自動化されています。 Nemotron-CC と SmolLM-Corpus を基盤とし、CLIMB クラスタリング手法を用いてデータの意味再構成とフィルタリングを行っています。 具体的なプロセスでは、まずテーマごとに 1,000 グループに分割し、広告検出分類器と教育的価値評価分類器の両方によってスコアリングを行い、低品質なデータを除外します。
データセットの構成
ClimbLab データセットの構造と内訳は以下の通りです:
- データフォーマット:GPT-2 トークナイザーを使用してトークン化したシーケンスを含む Parquet フォーマット。元のテキストを取得する場合は、公式が提供する
detokenize_climblab.pyスクリプトを使ってデトークナイズ処理を行ってください。 - データクラスタリング:データは 20 の個別クラスタ(distinct clusters)に区分けされており、意味的近接性に基づいて整理されており、事前学習効率の向上に寄与します。
- データサイズ:元々のコーパスは 1.2 トリリオン トークンですが、公式リリース済みのプレトークナイズ版データセットは約 4,000 エルティオン トークンです。
- コンテンツ特性:広告フィルターや教育的価値評価を経ており、高品質かつ教育的に関連性の高いことを保証しています。
引用文献
@article{diao2025climb,
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
journal = {arXiv preprint},
year = {2025},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url={https://arxiv.org/abs/2504.13161},
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。