Command Palette
Search for a command to run...
مجموعة بيانات EpiCoder-func-380k لتوليد الأكواد البرمجية
EpiCoder-func-380k هو مجموعة بيانات أصدرتها Microsoft في عام 2025، تركز على ضبط دقيق لقدرات توليد الأكواد في نماذج اللغة الكبيرة، وتتمثل النتائج البحثية ذات الصلة في "EpiCoder: Encompassing Diversity and Complexity in Code Generation"، بهدف معالجة تحديات تنوع التعليمات وتعقيدها في مهام توليد الأكواد.
تحتوي مجموعة البيانات هذه على 380,000 زوج من الأمثلة على مستوى الدوال من تعليمات ومخرجات، وهي مخصصة خصيصًا لتدريب نماذج اللغة الكبيرة على توليد كود Python استنادًا إلى تعليمات نصية مفصلة. تم بناء مجموعة البيانات من خلال طرق تركيبية، حيث تم توليد التعليمات والأكواد بواسطة نماذج اللغة الكبيرة والتحقق من صحتها في بيئة Docker، وتغطي مجموعة متنوعة من سيناريوهات البرمجة بما في ذلك التحسين المتوازي على مستوى التعليمات، وهي مناسبة لتحسين أداء النموذج في مهام الأكواد المحددة.
تكوين مجموعة البيانات
تتكون مجموعة البيانات بشكل أساسي من الحقلين التاليين، حيث يمثل كل سجل مثيلًا كاملاً لمهمة برمجة:
- instruction: نوع سلسلة، يحتوي على وصف مفصل لمهمة البرمجة، ويحدد وظيفة الكود والقيود ومتطلبات التحسين.
- output: نوع سلسلة، يحتوي على تنفيذ كود Python الذي يلبي التعليمات المذكورة أعلاه.
جميع البيانات عبارة عن أزواج من التعليمات التي أنشأها خبراء والأكواد التي تم توليدها بواسطة النماذج، ولا تتضمن حقولًا إضافية للبيانات الوصفية أو التعليقات.
Citation
@misc{wang2025epicoderencompassingdiversitycomplexity,
title={EpiCoder: Encompassing Diversity and Complexity in Code Generation},
author={Yaoxiang Wang and Haoling Li and Xin Zhang and Jie Wu and Xiao Liu and Wenxiang Hu and Zhongxin Guo and Yangyu Huang and Ying Xin and Yujiu Yang and Jinsong Su and Qi Chen and Scarlett Li},
year={2025},
eprint={2501.04694},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2501.04694},
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.