HyperAIHyperAI

Command Palette

Search for a command to run...

推論コーパス大規模モデルマインドチェーンデータセット

日付

7時間前

ライセンス

Apache 2.0

Reasoning Corpusは、SupraLabsが公開した大規模なモデル思考データセットであり、主に教師ありファインチューニング(SFT)、モデル蒸留、および指導訓練に使用されます。 このデータセットには約500万個のサンプルが含まれており、各シーケンスの長さは5,000トークンに制限されています。各サンプルには、元のユーザープロンプト、推論軌跡、アシスタントの最終応答、ソース情報、推定トークン長、および事前フォーマットされたChatML表現が含まれています。データは、科学、数学、コーディング、論理的推論、金融と経済、医学、多言語STEMなど、複数の分野を網羅する60以上の公開推論データウェアハウスから取得されています。DeepSeek-v4、DeepSeek-r1、Qwen3、Gemma4などの主流の大規模モデルによって生成された思考連鎖データが統合されています。

データフィールド:

  • repo_id: アップストリームデータソースリポジトリの識別子
  • tok_len: サンプルトークン長の事前計算推定値
  • ユーザー: 元のユーザープロンプトまたはタスクコマンド
  • thought_trace: モデルによって生成された中間推論の思考連鎖
  • アシスタント:推論プロセスから導き出された最終回答。
  • ChatML: 標準のChatML形式のテキスト(フォーマット済み)

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています