HyperAIHyperAI

Command Palette

Search for a command to run...

ClimbMix クラスタリング混合理論前訓練データセット

日付

データセット構成

NVIDIA

Paper URL

2504.13161

ライセンス

CC BY NC 4.0

ClimbMix データセットは、NVIDIA が 2025年に公開した、大規模言語モデルの効率的な事前学習のために設計された高品質データセットです。関連論文は「CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training」で示されており、革新的なクラスタリングおよび反復混合法を用いることで、同じトークン予算において既存の公開データセットを上回る事前学習パフォーマンスを実現することを目指しています。

このデータセットには 4,000億個のトークが含まれており、データ形式はテキスト形式(Parquet)です。GPT-2 トークナイザを使用して前処理とトークナイズが行われます。 データセットの構築プロセスでは、まず元のデータをトピック情報に基づいて 1,000 グループに分類し、その後広告検出エビリティ評価という 2 つの分類器を各グループに対して適用してスコア付けを行い、低品質なデータを除外します。最後に特定の重み付けに基づいて残りの高品質なデータグループを混合します。 本データセットは研究開発目的のみで使用され、研究者がより効率的なモデルのスケーリング傾向を探求することを支援するために作成されています。

データセット構成

データセットは主に以下の重要な情報を含みます:

  • データサイズ:4,000億トークン
  • データフォーマット:Parquet フォーマットで保存されるテキストシーケンス
  • トークナイズ手法:GPT-2 トークナイザを使用
  • データソース:自動収集・処理
  • ラベリング手法:自動化によるラベル付与とフィルタリング
数据集示例
数据集示例

引用文献

@article{diao2025climb,
  author    = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
  title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training}, 
  journal   = {arXiv preprint},
  year      = {2025},
  archivePrefix = {arXiv},
  primaryClass = {cs.CL},
  url={https://arxiv.org/abs/2504.13161}, 
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています