HyperAIHyperAI

Command Palette

Search for a command to run...

تجميع مجموعة البيانات | من الرياضيات التنافسية إلى تطبيقات الأدوات: 9 مجموعات بيانات رياضية مفتوحة المصدر من معهد ماساتشوستس للتكنولوجيا، وشركة NVIDIA، وجامعة هوازهونغ للعلوم والتكنولوجيا، وما إلى ذلك، تغطي CoT، والاستدلال متعدد الوسائط، وتدريب التفكير طويل السلسلة.

Featured Image

أصبح الاستدلال الرياضي مؤشراً أساسياً لقياس مستوى ذكاء نماذج اللغة الكبيرة (LLMs). فمن العمليات الحسابية إلى مسائل مستوى الأولمبياد، ثم إلى التخطيط متعدد الخطوات واستخدام الأدوات، ينتقل النموذج من "تقديم الإجابات" إلى "فهم المشكلات وإكمال الاستدلال".

بالمقارنة مع مجموعات بيانات الإجابة على الأسئلة التقليدية،تركز بيانات الاستدلال الرياضي بشكل أكبر على عملية التفكير وسلسلة الاستدلال.لا تحتاج البيانات عالية الجودة إلى تقديم إجابات دقيقة فحسب، بل تحتاج أيضًا إلى توفير مسارات استدلال موحدة، وحلول متعددة المسارات، ونتائج قابلة للتحقق لمساعدة النموذج على تحليل المشكلة، وبناء حلقات منطقية، وتحسين الاستقرار في ظل المهام المعقدة.

في السنوات الأخيرة، قامت فرق مثل OpenAI و NVIDIA و Alibaba Cloud بتسريع عملية تطوير نماذج الاستدلال، وتطورت مجموعات البيانات الرياضية من مجموعات بسيطة من المشكلات إلى موارد شاملة تغطي الاستدلال طويل السلسلة (CoT)، والاستدلال المعزز بالأدوات، والفهم متعدد الوسائط، وتدريب التعلم المعزز، ونمذجة بنية المعرفة.

تتضمن هذه المقالة تسع مجموعات بيانات تمثيلية للاستدلال الرياضي.يغطي هذا المجال مجالات مثل مشاكل مستوى المنافسة، والاستدلال متعدد اللغات ومتعدد الوسائط، وتوليد نماذج مسارات الاستدلال، والحل بمساعدة الأدوات، ونمذجة الاعتماد على المعرفة.تشير هذه الاتجاهات إلى أن بيانات الاستدلال الرياضي أصبحت البنية التحتية لتطور نماذج الاستدلال - فالمنافسة بين النماذج الكبيرة في المستقبل لن تعتمد فقط على حجم المعلمات، ولكن أيضًا على القدرة على تعلم قدرات استدلال موثوقة وقابلة للتحقق وقابلة للنقل من خلال بيانات عالية الجودة.

تتوفر مجموعات البيانات التالية على HyperAI، مما يساعد الباحثين والمطورين على استكشاف التدريب والتقييم والتطبيقات بسرعة.

انقر هنا لمشاهدة المزيد من الدروس التعليمية عالية الجودة:

https://hyper.ai/datasets

1.مجموعة بيانات الرسم البياني للاعتمادية باستخدام نظرية الرياضيات

تشغيل عبر الإنترنت:https://go.hyper.ai/oSSEs

Math-Graph هي مجموعة بيانات لرسوم بيانية لتبعية النظريات الرياضية، صدرت عام 2026 من مختبر الذكاء الاصطناعي الرياضي بجامعة واشنطن. وتقوم بإنشاء رسم بياني لتبعية النظريات الرياضية على مستوى العبارة. الورقة البحثية ذات الصلة بعنوان: TheoremGraph: Bridging Formal and Informal Mathematics.

تحتوي هذه المجموعة من البيانات على 47,952 زوجًا من العبارات الرياضية الرسمية وغير الرسمية، حيث تدمج هذين النوعين من المعرفة الرياضية في رسم بياني متماسك للتبعية يغطي الرياضيات الرسمية وغير الرسمية. وتشمل هذه المجموعة بيانات وصفية للأوراق البحثية، وعبارات رياضية (رسمية/غير رسمية)، وحواف التبعية، ووصفًا باللغة الطبيعية مُولّدًا بواسطة نموذج اللغة الطبيعية.

2.مجموعة بيانات الاستدلال الرياضي SFT Nemotron-SFT-Math-v4

تشغيل عبر الإنترنت:https://go.hyper.ai/MU9v3

Nemotron-SFT-Math-v4 هي مجموعة بيانات للاستدلال الرياضي، أصدرتها شركة NVIDIA في مايو 2026. تحمل الورقة البحثية ذات الصلة عنوان "Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision". تهدف هذه المجموعة إلى حل مشكلات عدم اتساق الجودة، ومسارات الاستدلال غير القياسية، وانخفاض الدقة، ومحدودية السيناريوهات في مجموعات البيانات الرياضية التقليدية. كما أنها تُحسّن بشكل فعّال قدرات النموذج في الاستدلال الهيكلي، والاستدلال متعدد المسارات، والتحقق من الإجابات. تُستخدم هذه المجموعة على نطاق واسع في ضبط نماذج الاستدلال الرياضي واسعة النطاق، وتحليل مسارات الاستدلال، وتطوير خوارزميات التحقق من الإجابات، وبناء أنظمة الاستدلال طويلة السياق، وتقييم متانة الاستدلال في النموذج. 

تحتوي هذه المجموعة من البيانات على 545,431 عينة تدريبية، تشمل 285,516 عينة استدلالية من أداة COT و259,915 عينة استدلالية من أداة TIR. وتغطي سيناريوهات رياضية في المسابقات والبحوث الجامعية في مجالات الجبر والهندسة ونظرية الأعداد والتوافقية، وغيرها. وقد تم ترميز البيانات باستخدام أسلوب هجين يجمع بين العمل اليدوي والآلي، ويتضمن حقولًا موحدة مثل الرقم الفريد، ونص السؤال، والحوار متعدد الأدوار، والإجابة القياسية، والمصدر، والبروتوكول.

3.مجموعة بيانات MathNet متعددة الوسائط للاستدلال الرياضي المعياري

تشغيل عبر الإنترنت:https://go.hyper.ai/XA6AN

MathNet عبارة عن مجموعة بيانات واسعة النطاق ومتعددة اللغات والوسائط للاستدلال الرياضي، أُصدرت عام 2026 من قِبل فريق من معهد ماساتشوستس للتكنولوجيا بالتعاون مع جامعة الملك عبد الله للعلوم والتقنية ومؤسسات أخرى. والورقة البحثية ذات الصلة تحمل عنوان "MathNet: معيار عالمي متعدد الوسائط للاستدلال الرياضي والاسترجاع".يهدف إلى تقييم وتحسين قدرات النماذج الكبيرة في الاستدلال الرياضي على مستوى الألعاب الأولمبية ومهام الاسترجاع المنظمة، ويستخدم على نطاق واسع في تقييم الاستدلال الرياضي، وبحوث RAG، والتدريب متعدد الوسائط للذكاء الاصطناعي.

تحتوي هذه المجموعة من البيانات، الإصدار v0، على 27,817 مسألة رياضية متخصصة وحلولها القياسية. وهي تغطي مسائل مسابقات الرياضيات الرسمية من 58 دولة ومنطقة بـ 17 لغة، بما في ذلك 5,148 مسألة مصورة بإجمالي 7,541 رسمًا هندسيًا وبيانيًا. تشمل المجموعة الجبر، والهندسة، ونظرية الأعداد، والتوافقية، والتفاضل والتكامل، والاحتمالات والإحصاء، وأنظمة المعرفة الرياضية الأخرى المستخدمة في الأولمبياد. وتدعم المجموعة ثلاث مهام معيارية: حل المسائل الرياضية، واسترجاع الدلالات الرياضية (تحديد المسائل المتكافئة والمتشابهة بنيويًا)، وتحسين عملية الاسترجاع.

4مجموعة بيانات الاستدلال الرياضي Nemotron-Math-v2

تشغيل عبر الإنترنت:https://go.hyper.ai/rYdfW

Nemotron-Math-v2 هي مجموعة بيانات للاستدلال الرياضي أصدرتها شركة NVIDIA في عام 2025. يحمل البحث ذو الصلة عنوان "Nemotron-Math: تقطير فعال للاستدلال الرياضي من خلال الإشراف متعدد الأنماط". تُستخدم هذه المجموعة بشكل أساسي لتدريب نماذج اللغة الطويلة (LLMs) على أداء الاستدلال الرياضي المنظم، ودراسة الاختلافات بين الاستدلال المُعزز بالأدوات والاستدلال اللغوي البحت، وبناء أنظمة استدلال طويلة السياق أو متعددة المسارات.

تحتوي هذه المجموعة من البيانات على ما يقارب 347,000 مسألة رياضية عالية الجودة و7 ملايين مسار استدلال مُولّد بواسطة النموذج. تُحل كل مسألة في ستة تكوينات: عمق استدلال عالٍ/متوسط/منخفض، مع أو بدون استخدام تقنية TIR في بايثون، ويتم التحقق من صحة الإجابات عبر مسار معالجة باستخدام نموذج خطي للتعلم (LLM) كمعيار للحكم.

5. مجموعة بيانات CHIMERA العامة للاستدلال الاصطناعي

تشغيل عبر الإنترنت:https://go.hyper.ai/JskxG

CHIMERA هي مجموعة بيانات اصطناعية مصممة خصيصًا لتدريب الاستدلال. الورقة البحثية ذات الصلة بعنوان: CHIMERA: بيانات اصطناعية مضغوطة لاستدلال LLM قابل للتعميم.

تغطي هذه المجموعة من البيانات نطاقًا واسعًا من مواضيع العلوم والتكنولوجيا والهندسة والرياضيات، وتوفر مسارات التفكير المتسلسل الطويل، وتحتوي على 9225 سؤالًا موزعة على 8 مواضيع (الرياضيات، وعلوم الحاسوب، والكيمياء، والفيزياء، والأدب، والتاريخ، وعلم الأحياء، وعلم الصوتيات). جميع الأمثلة مُولَّدة بواسطة نموذج لغوي ضخم، ويتم التحقق من صحتها تلقائيًا دون الحاجة إلى أي تعليق يدوي.

6. مجموعة بيانات مشكلة الاستدلال في Open-RL

تشغيل عبر الإنترنت:https://go.hyper.ai/WYDck

Open-RL هي مجموعة بيانات لمسائل الاستدلال متعددة المجالات، أصدرتها شركة تورينج عام 2026، وتحتوي على مسائل استدلالية مستقلة وقابلة للتحقق وصريحة في مجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) في الفيزياء والرياضيات والأحياء والكيمياء. تتطلب كل مسألة استدلالًا متعدد الخطوات، وتتضمن عمليات رمزية و/أو حسابات عددية، ولها إجابة نهائية قابلة للتحقق بموضوعية.

تُعد مجموعة البيانات هذه مناسبة لضبط التعلم المعزز، ونمذجة المكافآت، والتدريب الخاضع للإشراف على النتائج، وقياس الاستدلال القابل للتحقق.تتطلب كل مشكلة خطوات متعددة من الاستدلال وتتضمن عمليات رمزية وحسابات عددية، مع إجابة نهائية قابلة للتحقق.

7. مجموعة بيانات الاستدلال التدريجي GPT-5.4

تشغيل عبر الإنترنت:https://go.hyper.ai/CeBEp

مجموعة بيانات الاستدلال التدريجي GPT-5.4 هي مجموعة بيانات استدلال اصطناعية عالية الكثافة مصممة لنمذجة الاستدلال طويل السلسلة (CoT) ومهام حل المشكلات المعقدة. تعتمد هذه المجموعة على منهجية "المهندس الرئيسي"، حيث تستخدم Gemini 3 Flash لتوليد تلميحات صعبة، وتجمعها مع نواة الاستدلال GPT-5.4 لإتمام الاستدلال متعدد الخطوات وتوليد النتائج.

تحتوي هذه المجموعة من البيانات على ما يقارب 1500 عينة من المستوى النخبوي، تغطي مجالات بالغة التعقيد كالرياضيات والبرمجة والطب. وقد حُددت صعوبة المهمة بشكل موحد عند مستويي "الماجستير" و"ما بعد الدكتوراه". تتضمن عينات البيانات عمليات استدلال كاملة متعددة الخطوات وحلولاً نهائية موثقة، مما يجعلها مناسبة للسيناريوهات التي تتضمن استنباطاً منطقياً متسلسلاً وتقييماً لقدرات الاستدلال المتقدمة.

8.مجموعة بيانات التدريب والتعليم المسبق Sutra 10B

تشغيل عبر الإنترنت:https://go.hyper.ai/skT3q

مجموعة بيانات Sutra 10B Pretraining هي مجموعة بيانات تعليمية عالية الجودة لتدريب نماذج اللغة الكبيرة مسبقًا. يتم إنشاؤها بواسطة إطار عمل Sutra، حيث توفر محتوى تعليميًا منظمًا وتُحسّن عملية تدريب نماذج اللغة. تُعد هذه المجموعة الأكبر في سلسلة Sutra، وهي مصممة لتوضيح كيف يمكن لمجموعات البيانات الكثيفة والمُنسقة جيدًا أن تُوفر أداءً مثاليًا لتدريب نماذج اللغة الصغيرة مسبقًا.

تحتوي هذه المجموعة من البيانات على 10,193,029 سجلاً تعليمياً، بإجمالي يزيد عن 10 مليارات كلمة، تغطي تسعة مجالات رئيسية: التخصصات المتداخلة، والتكنولوجيا، والعلوم، والدراسات الاجتماعية، والرياضيات، ومهارات الحياة، والفنون والإبداع، وفنون اللغة، والفلسفة والأخلاق. وتتبع البيانات نموذجاً تعليمياً راسخاً، مع 10 مستويات صعوبة من الأساسي إلى المتقدم، مما يدل على تسلسل هرمي جيد وتنظيم منهجي.

9. مجموعة بيانات الاستدلال البصري VisCoR-55K

تشغيل عبر الإنترنت:https://go.hyper.ai/kIlWk

VisCoR-55K هي مجموعة بيانات عالية الجودة للاستدلال البصري، صدرت عام 2026 من جامعة هوا تشونغ للعلوم والتكنولوجيا بالتعاون مع علي بابا كلاود. تحتوي هذه المجموعة على ما يقارب 55,000 عينة للاستدلال البصري، تُنتج كل منها عملية استدلال مقابلة باستخدام عينات متباينة.مجموعة بيانات عالية الجودة للاستدلال البصري تغطي خمس فئات: عامة، واستدلال، ورياضية، ورسم بياني، والتعرف الضوئي على الأحرف.الهدف هو تعزيز البحث في نماذج اللغة البصرية في الاستدلال البصري الموثوق والقوي.