HyperAI
Command Palette
Search for a command to run...
EpiCoder-func-380k コード生成
EpiCoder-func-380k は、Microsoft が 2025 年に公開した、大規模言語モデルのコード生成能力の微調整に特化したデータセットであり、関連する論文成果は「EpiCoder: Encompassing Diversity and Complexity in Code Generation」で、コード生成タスクにおける指示の多様性と複雑性の課題を解決することを目的としています。
このデータセットには、38万件の関数レベルの指示-出力ペアのインスタンスが含まれており、詳細なテキスト指示に基づいて Python コードを生成するように大規模言語モデルをトレーニングするために特別に使用されます。 データセットは合成手法によって構築され、指示とコードは両方とも大規模言語モデルによって生成され、Docker 環境で正確性が検証され、指示レベルの並列最適化を含むさまざまなプログラミングシナリオをカバーし、特定のコードタスクにおけるモデルのパフォーマンスを向上させるのに適しています。
データセットの構成
データセットは主に以下の2つのフィールドで構成されており、各データは完全なプログラミングタスクのインスタンスを表します:
- instruction:文字列型で、詳細なプログラミングタスクの説明を含み、コードの機能、制約条件、および最適化要件を規定します。
- output:文字列型で、上記の指示を満たす Python コードの実装を含みます。
すべてのデータは、専門家が生成した指示とモデルが合成したコードのペアであり、追加のメタデータやコメントフィールドは含まれません。
Citation
@misc{wang2025epicoderencompassingdiversitycomplexity,
title={EpiCoder: Encompassing Diversity and Complexity in Code Generation},
author={Yaoxiang Wang and Haoling Li and Xin Zhang and Jie Wu and Xiao Liu and Wenxiang Hu and Zhongxin Guo and Yangyu Huang and Ying Xin and Yujiu Yang and Jinsong Su and Qi Chen and Scarlett Li},
year={2025},
eprint={2501.04694},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2501.04694},
}
このデータセットはコミュニティユーザーによって提供されており、教育および情報提供のみを目的としています。著作権侵害に関わるコンテンツがある場合は、[email protected]までご連絡ください。速やかに確認し、削除いたします。