Command Palette
Search for a command to run...
مجموعة بيانات التدريب المسبق للتجميع ClimbLab
التاريخ
رابط الورقة البحثية
الترخيص
CC BY NC 4.0
تم إصدار ClimbLab بواسطة شركة إنفيديا في عام 2025، وهو مجموعة بيانات عالية الجودة للنماذج اللغوية المدربة مسبقاً، وتشير الورقة البحثية ذات الصلة إلى «CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training»، ويهدف هذا المشروع إلى توفير مجموعات تدريب تم فحصها بدقة وتحسين تجميعها لتناسب النماذج اللغوية الكبيرة.
تُعد هذه المجموعة مستودع لغوي مُفلتر يحتوي على تريليونَي رمز لغوي (token)، ومقسمة إلى عشرين عنقودة دلالية.
تركز هذه المجموعة بشكل رئيسي على أغراض البحث والتطوير، وتكون بصيغة باركيه (Parquet)، بحجم بيانات يقارب 40 مليار رمز لغوي (النسخة المُجزأة مسبقًا التي توفرها الشركة الرسمية)، وتم جمع البيانات ووضع العلامات عليها تلقائيًا.
استنادًا إلى مجموعتي Nemotron-CC وSmolLM-Corpus، أعيد تنظيم البيانات وفلترتها باستخدام طريقة التجميع المعروفة باسم CLIMB.
تشمل العملية التفصيلية تقسيم المحتوى حسب الموضوع إلى ألف فئة، ثم استخدام مصنفين أحدهما للكشف عن الإعلانات والآخر لتقييم القيمة التعليمية لإسقاط البيانات منخفضة الجودة.
مكونات مجموعة البيانات
يتضمن هيكل ومكونات مجموعة بيانات ClimbLab ما يلي:
- صيغة البيانات: تُقدم بـ صيغة باركيه (Parquet)، وتتضمّن تسلسلات الرموز اللغوية المجزأة باستخدام أداة تجزئة NLP الخاصة بنموذج GPT-2. للحصول على النص الأصلي، يمكن للمستخدم تنفيذ السكربت الرسمي
detokenize_climblab.pyلإعادة بناء الجمل من الرموز المفصولة. - التجمع الدلالي: قُسّمت البيانات إلى عشرون تجمع مستقل (distinct clusters)، مرتبة وفق الارتباط الدلالي مما يعزز كفاءة التدريب المسبق.
- حجم البيانات: يبلغ حجم المستودع الأصلي للبيانات نحو تريليوني رمز لغوي، بينما تبلغ النسخة المنشورة رسميًا والمفصلة مسبقًا حوالي 40 مليار رمز لغوي.
- خصائص المحتوى: خضعت البيانات لعمليات فلترة إعلانية وتقويم قيمتها التعليمية لضمان جودتها العالية وارتباطها بالمجال التعليمي.
الاستشهاد المرجعي
@article{diao2025climb,
author = {Shizhe Diao and Yu Yang and Yonggan Fu and Xin Dong and Dan Su and Markus Kliegl and Zijia Chen and Peter Belcak and Yoshi Suhara and Hongxu Yin and Mostofa Patwary and Celine Lin and Jan Kautz and Pavlo Molchanov},
title={CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training},
journal = {arXiv preprint},
year = {2025},
archivePrefix = {arXiv},
primaryClass = {cs.CL},
url={https://arxiv.org/abs/2504.13161},
}
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.