HyperAIHyperAI

Command Palette

Search for a command to run...

مجموعة بيانات التدريب المسبق للتجميع ClimbLab

التاريخ

المؤسسة

NVIDIA

رابط الورقة البحثية

2504.13161

الترخيص

CC BY NC 4.0

تم إصدار ClimbLab بواسطة شركة إنفيديا في عام 2025، وهو مجموعة بيانات عالية الجودة للنماذج اللغوية المدربة مسبقاً، وتشير الورقة البحثية ذات الصلة إلى «CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training»، ويهدف هذا المشروع إلى توفير مجموعات تدريب تم فحصها بدقة وتحسين تجميعها لتناسب النماذج اللغوية الكبيرة.

تُعد هذه المجموعة مستودع لغوي مُفلتر يحتوي على تريليونَي رمز لغوي (token)، ومقسمة إلى عشرين عنقودة دلالية.
تركز هذه المجموعة بشكل رئيسي على أغراض البحث والتطوير، وتكون بصيغة باركيه (Parquet)، بحجم بيانات يقارب 40 مليار رمز لغوي (النسخة المُجزأة مسبقًا التي توفرها الشركة الرسمية)، وتم جمع البيانات ووضع العلامات عليها تلقائيًا.

استنادًا إلى مجموعتي Nemotron-CC وSmolLM-Corpus، أعيد تنظيم البيانات وفلترتها باستخدام طريقة التجميع المعروفة باسم CLIMB.
تشمل العملية التفصيلية تقسيم المحتوى حسب الموضوع إلى ألف فئة، ثم استخدام مصنفين أحدهما للكشف عن الإعلانات والآخر لتقييم القيمة التعليمية لإسقاط البيانات منخفضة الجودة.

مكونات مجموعة البيانات

يتضمن هيكل ومكونات مجموعة بيانات ClimbLab ما يلي:

  • صيغة البيانات: تُقدم بـ صيغة باركيه (Parquet)، وتتضمّن تسلسلات الرموز اللغوية المجزأة باستخدام أداة تجزئة NLP الخاصة بنموذج GPT-2. للحصول على النص الأصلي، يمكن للمستخدم تنفيذ السكربت الرسمي detokenize_climblab.py لإعادة بناء الجمل من الرموز المفصولة.
  • التجمع الدلالي: قُسّمت البيانات إلى عشرون تجمع مستقل (distinct clusters)، مرتبة وفق الارتباط الدلالي مما يعزز كفاءة التدريب المسبق.
  • حجم البيانات: يبلغ حجم المستودع الأصلي للبيانات نحو تريليوني رمز لغوي، بينما تبلغ النسخة المنشورة رسميًا والمفصلة مسبقًا حوالي 40 مليار رمز لغوي.
  • خصائص المحتوى: خضعت البيانات لعمليات فلترة إعلانية وتقويم قيمتها التعليمية لضمان جودتها العالية وارتباطها بالمجال التعليمي.
数据集示例
数据集示例

الاستشهاد المرجعي

@article{diao2025climb,
  author    = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
  title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training}, 
  journal   = {arXiv preprint},
  year      = {2025},
  archivePrefix = {arXiv},
  primaryClass = {cs.CL},
  url={https://arxiv.org/abs/2504.13161}, 
}

بناء الذكاء الاصطناعي بالذكاء الاصطناعي

من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.

البرمجة التعاونية باستخدام الذكاء الاصطناعي
وحدات GPU جاهزة للعمل
أفضل الأسعار

HyperAI Newsletters

اشترك في آخر تحديثاتنا
سنرسل لك أحدث التحديثات الأسبوعية إلى بريدك الإلكتروني في الساعة التاسعة من صباح كل يوم اثنين
مدعوم بواسطة MailChimp