Command Palette
Search for a command to run...
OpenCodeReasoningは、NVIDIAが2025年にリリースした大規模なプログラミング推論合成データセットです。大規模言語モデル(LLM)向けの高品質なプログラミング推論トレーニングデータを提供し、コード生成と論理的推論能力の向上を促進することを目的としています。関連する論文の結果は次のとおりです。OpenCodeReasoning: 競争力のあるコーディングのためのデータ蒸留の進化”。 このデータセットには 735,255 個のサンプルが含まれており、28,319 個の固有のプログラミング問題をカバーしており、現在利用可能な推論プログラミング データセットとしては最大規模のものの 1 つです。
データソース:
- CodeForces、CodeChef、LeetCode、および TACO、APPS、CodeContests などの公開データセットを含む 11 の主要なプログラミング プラットフォームからの質問を統合します。
- コード応答は、データの一貫性と推論ロジックの標準化を確保するために、NVIDIA が独自に開発したモデル R1 によって生成されます。
引用
@article{ahmad2025opencodereasoning,
title={OpenCodeReasoning: Advancing Data Distillation for Competitive Coding},
author={Wasi Uddin Ahmad, Sean Narenthiran, Somshubra Majumdar, Aleksander Ficek, Siddhartha Jain, Jocelyn Huang, Vahid Noroozi, Boris Ginsburg},
year={2025},
eprint={2504.01943},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2504.01943},
}