HyperAIHyperAI

Command Palette

Search for a command to run...

EpiCoder-func-380k コード生成

日付

データセット構成

Microsoft Corporation

Paper URL

2501.04694

ライセンス

MIT

EpiCoder-func-380k は、Microsoft が 2025 年に公開した、大規模言語モデルのコード生成能力の微調整に特化したデータセットであり、関連する論文成果は「EpiCoder: Encompassing Diversity and Complexity in Code Generation」で、コード生成タスクにおける指示の多様性と複雑性の課題を解決することを目的としています。

このデータセットには、38万件の関数レベルの指示-出力ペアのインスタンスが含まれており、詳細なテキスト指示に基づいて Python コードを生成するように大規模言語モデルをトレーニングするために特別に使用されます。 データセットは合成手法によって構築され、指示とコードは両方とも大規模言語モデルによって生成され、Docker 環境で正確性が検証され、指示レベルの並列最適化を含むさまざまなプログラミングシナリオをカバーし、特定のコードタスクにおけるモデルのパフォーマンスを向上させるのに適しています。

データセットの構成

データセットは主に以下の2つのフィールドで構成されており、各データは完全なプログラミングタスクのインスタンスを表します:

  • instruction:文字列型で、詳細なプログラミングタスクの説明を含み、コードの機能、制約条件、および最適化要件を規定します。
  • output:文字列型で、上記の指示を満たす Python コードの実装を含みます。

すべてのデータは、専門家が生成した指示とモデルが合成したコードのペアであり、追加のメタデータやコメントフィールドは含まれません。

Citation

@misc{wang2025epicoderencompassingdiversitycomplexity,
      title={EpiCoder: Encompassing Diversity and Complexity in Code Generation}, 
      author={Yaoxiang Wang and Haoling Li and Xin Zhang and Jie Wu and Xiao Liu and Wenxiang Hu and Zhongxin Guo and Yangyu Huang and Ying Xin and Yujiu Yang and Jinsong Su and Qi Chen and Scarlett Li},
      year={2025},
      eprint={2501.04694},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2501.04694}, 
}

AIでAIを構築

アイデアからローンチまで — 無料のAIコーディング支援、すぐに使える環境、最高のGPU価格でAI開発を加速。

AI コーディング補助
すぐに使える GPU
最適な料金体系

HyperAI Newsletters

最新情報を購読する
北京時間 毎週月曜日の午前9時 に、その週の最新情報をメールでお届けします
メール配信サービスは MailChimp によって提供されています