HyperAIHyperAI

Command Palette

Search for a command to run...

مجموعة بيانات LCC Java لقاعدة بيانات كبيرة

التاريخ

المؤسسة

Microsoft Corporation

الترخيص

Other

LCC Java هي مجموعة بيانات كود جافا أصدرتها Microsoft في عام 2023، مشتقة من مشروع The Large Code Corpus (LCC)، وتهدف إلى توفير كوربوس كود عالي الجودة لمهام مثل فهم الكود وتوليد الكود وإكمال الكود.

تبلغ مساحة مجموعة البيانات هذه حوالي 1.87 جيجابايت، وتحتوي على 120,000 عينة من أكواد جافا، وتستمد البيانات من أكواد جافا المصدرية الحقيقية في المشاريع مفتوحة المصدر، وتنقسم إلى مجموعة تدريب ومجموعة تحقق ومجموعة اختبار. تحتوي كل عينة بشكل أساسي على الكود السياقي والجزء المستهدف المقابل من الكود، ويتم تخزينها بتنسيق JSON، ويمكن استخدامها للتعلم الخاضع للإشراف والتدريب على التسلسل إلى تسلسل (Seq2Seq) لنماذج الكود.

مكونات مجموعة البيانات

تحتوي مجموعة البيانات على الأجزاء الثلاثة التالية:

  • مجموعة التدريب (train): 100,000 عينة، حوالي 1.61 جيجابايت.
  • مجموعة التحقق (validation): 10,000 عينة، حوالي 131 ميجابايت.
  • مجموعة الاختبار (test): 10,000 عينة، حوالي 129 ميجابايت.

يحتوي كل عينة بشكل أساسي على الحقول التالية:

  • context: الكود السياقي، الذي يوفر معلومات خلفية الكود للنموذج.
  • gt: الجزء المستهدف من الكود، أي الكود الذي يحتاج النموذج إلى توقعه أو توليده.

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp