Command Palette
Search for a command to run...
مجموعة بيانات كبيرة لسلسلة العقل من نماذج التفكير المنطقي
مجموعة بيانات التفكير المنطقي هي مجموعة بيانات كبيرة للتفكير النموذجي أصدرتها شركة SupraLabs، وتستخدم بشكل أساسي للضبط الدقيق الخاضع للإشراف (SFT) وتقطير النموذج وتدريب التعليمات. تحتوي هذه المجموعة من البيانات على ما يقارب 5 ملايين عينة، حيث يقتصر طول كل تسلسل على 5000 رمز. تتضمن كل عينة طلب المستخدم الأصلي، ومسار الاستدلال، واستجابة المساعد النهائية، ومعلومات المصدر، والطول التقديري للرمز، وتمثيل ChatML مُنسق مسبقًا. تأتي البيانات من أكثر من 60 مستودع بيانات استدلال عام، تغطي مجالات متعددة مثل العلوم، والرياضيات، والبرمجة، والتفكير المنطقي، والمالية والاقتصاد، والطب، والعلوم والتكنولوجيا والهندسة والرياضيات متعددة اللغات. وهي تدمج بيانات سلاسل الأفكار المُولدة بواسطة نماذج كبيرة شائعة الاستخدام مثل DeepSeek-v4 وDeepSeek-r1 وQwen3 وGemma4.
حقول البيانات:
- repo_id: مُعرِّف مستودع مصدر البيانات الأصلي
- tok_len: تقدير محسوب مسبقًا لطول رمز العينة
- المستخدم: موجه المستخدم الأصلي أو أمر المهمة
- تتبع الفكر: سلسلة التفكير الاستدلالي الوسيطة التي يولدها النموذج
- المساعد: الإجابة النهائية مستمدة من عملية الاستدلال.
- ChatML: نص منسق قياسياً بتنسيق ChatML
بناء الذكاء الاصطناعي بالذكاء الاصطناعي
من الفكرة إلى الإطلاق — سرّع تطوير الذكاء الاصطناعي الخاص بك مع المساعدة البرمجية المجانية بالذكاء الاصطناعي، وبيئة جاهزة للاستخدام، وأفضل أسعار لوحدات معالجة الرسومات.