HyperAI
Command Palette
Search for a command to run...
ClimbMix クラスタリング混合理論前訓練データセット
ClimbMix データセットは、NVIDIA が 2025年に公開した、大規模言語モデルの効率的な事前学習のために設計された高品質データセットです。関連論文は「CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training」で示されており、革新的なクラスタリングおよび反復混合法を用いることで、同じトークン予算において既存の公開データセットを上回る事前学習パフォーマンスを実現することを目指しています。
このデータセットには 4,000億個のトークが含まれており、データ形式はテキスト形式(Parquet)です。GPT-2 トークナイザを使用して前処理とトークナイズが行われます。 データセットの構築プロセスでは、まず元のデータをトピック情報に基づいて 1,000 グループに分類し、その後広告検出エビリティ評価という 2 つの分類器を各グループに対して適用してスコア付けを行い、低品質なデータを除外します。最後に特定の重み付けに基づいて残りの高品質なデータグループを混合します。 本データセットは研究開発目的のみで使用され、研究者がより効率的なモデルのスケーリング傾向を探求することを支援するために作成されています。
データセット構成
データセットは主に以下の重要な情報を含みます:
- データサイズ:4,000億トークン
- データフォーマット:Parquet フォーマットで保存されるテキストシーケンス
- トークナイズ手法:GPT-2 トークナイザを使用
- データソース:自動収集・処理
- ラベリング手法:自動化によるラベル付与とフィルタリング
引用文献
@article{diao2025climb,
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
journal = {arXiv preprint},
year = {2025},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url={https://arxiv.org/abs/2504.13161},
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。