Command Palette
Search for a command to run...
تم إصدار برنامج MiniCPM-RobotManip، الذي يحتوي على 1.5 مليار معلمة، كمصدر مفتوح رسميًا؛ كما أصدرت NVIDIA نموذج Cosmos3-Edge متعدد الأنماط، والذي يغطي النصوص والصور ومقاطع الفيديو وتسلسلات الحركة.

في مجال الذكاء المجسد، يُعدّ تمكين الروبوتات من الإدراك والفهم والتصرف أمراً أساسياً لدفع الأنظمة الذكية إلى العالم الحقيقي. تستكشف سلسلة MiniCPM-Robot من MiniCPM مهمتين أساسيتين: التلاعب بالروبوت وتتبع الأهداف.MiniCPM-RobotManip هو نموذج حركة بصري-لغوي يحتوي على 1.5 مليار مُعامل فقط. يعتمد على بنية MiniCPM-V 4.6 البصرية-اللغوية، وبالتكامل مع رأس حركة مُنتشر، يُحقق ربطًا شاملاً من الملاحظة البصرية والأوامر اللغوية إلى حركات الروبوت.يركز برنامج MiniCPM-RobotTrack على تتبع الأهداف، محققًا إمكانيات تتبع بصري فوري على الحافة مع 0.9 مليار مُعامل. وبفضل بنيته الخفيفة، وذاكرة السياق المتدفقة، وتقنية ضغط الصور الفعّالة، تُظهر سلسلة MiniCPM-Robot إمكانية الاستدلال الفعال في سيناريوهات الروبوتات الواقعية باستخدام نماذج صغيرة الحجم.
يعرض موقع HyperAI الإلكتروني الآن "MiniCPM-Robot: نماذج الذكاء المجسد للعالم الحقيقي"، لذا تعال وجربه!
الاستخدام عبر الإنترنت:https://go.hyper.ai/0VsYI
نظرة سريعة على تحديثات الموقع الرسمي لشركة hyper.ai من 25 يوليو إلى 30 يوليو:
* مجموعات بيانات عامة عالية الجودة: 9
* مجموعة مختارة من الدروس التعليمية عالية الجودة: 8
* تحليل مقالات المجتمع: مقالتان
* إدخالات الموسوعة الشعبية: 5
قم بزيارة الموقع الرسمي:هايبر.اي
مجموعات البيانات العامة المختارة
1.مجموعة بيانات الرسم البياني للاعتمادية باستخدام نظرية الرياضيات
Math-Graph هي مجموعة بيانات لرسوم بيانية لتبعية النظريات الرياضية، صدرت عام 2026 من مختبر الذكاء الاصطناعي الرياضي بجامعة واشنطن. وتقوم بإنشاء رسم بياني لتبعية النظريات الرياضية على مستوى العبارة. الورقة البحثية ذات الصلة بعنوان: TheoremGraph: Bridging Formal and Informal Mathematics.
تحتوي هذه المجموعة من البيانات على 47,952 زوجًا من العبارات الرياضية الرسمية وغير الرسمية، حيث تدمج هذين النوعين من المعرفة الرياضية في رسم بياني متماسك للتبعية يغطي الرياضيات الرسمية وغير الرسمية. وتشمل هذه المجموعة بيانات وصفية للأوراق البحثية، وعبارات رياضية (رسمية/غير رسمية)، وحواف التبعية، ووصفًا باللغة الطبيعية مُولّدًا بواسطة نموذج اللغة الطبيعية.
تشغيل عبر الإنترنت:https://go.hyper.ai/bwVQf
2.مجموعة بيانات الاستدلال الرياضي SFT Nemotron-SFT-Math-v4
Nemotron-SFT-Math-v4 هي مجموعة بيانات للاستدلال الرياضي، أصدرتها شركة NVIDIA في مايو 2026. تحمل الورقة البحثية ذات الصلة عنوان "Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision". تهدف هذه المجموعة إلى حل مشكلات عدم اتساق الجودة، ومسارات الاستدلال غير القياسية، وانخفاض الدقة، ومحدودية السيناريوهات في مجموعات البيانات الرياضية التقليدية. كما أنها تُحسّن بشكل فعّال قدرات النموذج في الاستدلال الهيكلي، والاستدلال متعدد المسارات، والتحقق من الإجابات. تُستخدم هذه المجموعة على نطاق واسع في ضبط نماذج الاستدلال الرياضي واسعة النطاق، وتحليل مسارات الاستدلال، وتطوير خوارزميات التحقق من الإجابات، وبناء أنظمة الاستدلال طويلة السياق، وتقييم متانة الاستدلال في النموذج.
تحتوي هذه المجموعة من البيانات على 545,431 عينة تدريبية، تشمل 285,516 عينة استدلالية من أداة COT و259,915 عينة استدلالية من أداة TIR. وتغطي سيناريوهات رياضية في المسابقات والبحوث الجامعية في مجالات الجبر والهندسة ونظرية الأعداد والتوافقية، وغيرها. وقد تم ترميز البيانات باستخدام أسلوب هجين يجمع بين العمل اليدوي والآلي، ويتضمن حقولًا موحدة مثل الرقم الفريد، ونص السؤال، والحوار متعدد الأدوار، والإجابة القياسية، والمصدر، والبروتوكول.
تشغيل عبر الإنترنت:https://go.hyper.ai/Kv9E4
3.مجموعة بيانات MathNet متعددة الوسائط للاستدلال الرياضي المعياري
MathNet عبارة عن مجموعة بيانات واسعة النطاق ومتعددة اللغات والوسائط للاستدلال الرياضي، أُصدرت عام 2026 من قِبل فريق من معهد ماساتشوستس للتكنولوجيا بالتعاون مع جامعة الملك عبد الله للعلوم والتقنية ومؤسسات أخرى. والورقة البحثية ذات الصلة تحمل عنوان "MathNet: معيار عالمي متعدد الوسائط للاستدلال الرياضي والاسترجاع".يهدف إلى تقييم وتحسين قدرات النماذج الكبيرة في الاستدلال الرياضي على مستوى الألعاب الأولمبية ومهام الاسترجاع المنظمة، ويستخدم على نطاق واسع في تقييم الاستدلال الرياضي، وبحوث RAG، والتدريب متعدد الوسائط للذكاء الاصطناعي.
تحتوي هذه المجموعة من البيانات، الإصدار v0، على 27,817 مسألة رياضية متخصصة وحلولها القياسية. وهي تغطي مسائل مسابقات الرياضيات الرسمية من 58 دولة ومنطقة بـ 17 لغة، بما في ذلك 5,148 مسألة مصورة بإجمالي 7,541 رسمًا هندسيًا وبيانيًا. تشمل المجموعة الجبر، والهندسة، ونظرية الأعداد، والتوافقية، والتفاضل والتكامل، والاحتمالات والإحصاء، وأنظمة المعرفة الرياضية الأخرى المستخدمة في الأولمبياد. وتدعم المجموعة ثلاث مهام معيارية: حل المسائل الرياضية، واسترجاع الدلالات الرياضية (تحديد المسائل المتكافئة والمتشابهة بنيويًا)، وتحسين عملية الاسترجاع.
تشغيل عبر الإنترنت:https://go.hyper.ai/AWKaV

4مجموعة بيانات الاستدلال الرياضي Nemotron-Math-v2
Nemotron-Math-v2 هي مجموعة بيانات للاستدلال الرياضي أصدرتها شركة NVIDIA في عام 2025. يحمل البحث ذو الصلة عنوان "Nemotron-Math: تقطير فعال للاستدلال الرياضي من خلال الإشراف متعدد الأنماط". تُستخدم هذه المجموعة بشكل أساسي لتدريب نماذج اللغة الطويلة (LLMs) على أداء الاستدلال الرياضي المنظم، ودراسة الاختلافات بين الاستدلال المُعزز بالأدوات والاستدلال اللغوي البحت، وبناء أنظمة استدلال طويلة السياق أو متعددة المسارات.
تحتوي هذه المجموعة من البيانات على ما يقارب 347,000 مسألة رياضية عالية الجودة و7 ملايين مسار استدلال مُولّد بواسطة النموذج. تُحل كل مسألة في ستة تكوينات: عمق استدلال عالٍ/متوسط/منخفض، مع أو بدون استخدام تقنية TIR في بايثون، ويتم التحقق من صحة الإجابات عبر مسار معالجة باستخدام نموذج خطي للتعلم (LLM) كمعيار للحكم.
تشغيل عبر الإنترنت:https://go.hyper.ai/rYdfW
5. مجموعة بيانات CHIMERA العامة للاستدلال الاصطناعي
CHIMERA هي مجموعة بيانات اصطناعية مصممة خصيصًا لتدريب الاستدلال. الورقة البحثية ذات الصلة بعنوان: CHIMERA: بيانات اصطناعية مضغوطة لاستدلال LLM قابل للتعميم.
تغطي هذه المجموعة من البيانات نطاقًا واسعًا من مواضيع العلوم والتكنولوجيا والهندسة والرياضيات، وتوفر مسارات التفكير المتسلسل الطويل، وتحتوي على 9225 سؤالًا موزعة على 8 مواضيع (الرياضيات، وعلوم الحاسوب، والكيمياء، والفيزياء، والأدب، والتاريخ، وعلم الأحياء، وعلم الصوتيات). جميع الأمثلة مُولَّدة بواسطة نموذج لغوي ضخم، ويتم التحقق من صحتها تلقائيًا دون الحاجة إلى أي تعليق يدوي.
تشغيل عبر الإنترنت:https://go.hyper.ai/JskxG
6. مجموعة بيانات مشكلة الاستدلال في Open-RL
Open-RL هي مجموعة بيانات لمسائل الاستدلال متعددة المجالات، أصدرتها شركة تورينج عام 2026، وتحتوي على مسائل استدلالية مستقلة وقابلة للتحقق وصريحة في مجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) في الفيزياء والرياضيات والأحياء والكيمياء. تتطلب كل مسألة استدلالًا متعدد الخطوات، وتتضمن عمليات رمزية و/أو حسابات عددية، ولها إجابة نهائية قابلة للتحقق بموضوعية.
تُعد مجموعة البيانات هذه مناسبة لضبط التعلم المعزز، ونمذجة المكافآت، والتدريب الخاضع للإشراف على النتائج، وقياس الاستدلال القابل للتحقق.تتطلب كل مشكلة خطوات متعددة من الاستدلال وتتضمن عمليات رمزية وحسابات عددية، مع إجابة نهائية قابلة للتحقق.
تشغيل عبر الإنترنت:https://go.hyper.ai/WYDck
7. مجموعة بيانات الاستدلال التدريجي GPT-5.4
مجموعة بيانات الاستدلال التدريجي GPT-5.4 هي مجموعة بيانات استدلال اصطناعية عالية الكثافة مصممة لنمذجة الاستدلال طويل السلسلة (CoT) ومهام حل المشكلات المعقدة. تعتمد هذه المجموعة على منهجية "المهندس الرئيسي"، حيث تستخدم Gemini 3 Flash لتوليد تلميحات صعبة، وتجمعها مع نواة الاستدلال GPT-5.4 لإتمام الاستدلال متعدد الخطوات وتوليد النتائج.
تحتوي هذه المجموعة من البيانات على ما يقارب 1500 عينة من المستوى النخبوي، تغطي مجالات بالغة التعقيد كالرياضيات والبرمجة والطب. وقد حُددت صعوبة المهمة بشكل موحد عند مستويي "الماجستير" و"ما بعد الدكتوراه". تتضمن عينات البيانات عمليات استدلال كاملة متعددة الخطوات وحلولاً نهائية موثقة، مما يجعلها مناسبة للسيناريوهات التي تتضمن استنباطاً منطقياً متسلسلاً وتقييماً لقدرات الاستدلال المتقدمة.
تشغيل عبر الإنترنت:https://go.hyper.ai/CeBEp
8.مجموعة بيانات التدريب والتعليم المسبق Sutra 10B
مجموعة بيانات Sutra 10B Pretraining هي مجموعة بيانات تعليمية عالية الجودة لتدريب نماذج اللغة الكبيرة مسبقًا. يتم إنشاؤها بواسطة إطار عمل Sutra، حيث توفر محتوى تعليميًا منظمًا وتُحسّن عملية تدريب نماذج اللغة. تُعد هذه المجموعة الأكبر في سلسلة Sutra، وهي مصممة لتوضيح كيف يمكن لمجموعات البيانات الكثيفة والمُنسقة جيدًا أن تُوفر أداءً مثاليًا لتدريب نماذج اللغة الصغيرة مسبقًا.
تحتوي هذه المجموعة من البيانات على 10,193,029 سجلاً تعليمياً، بإجمالي يزيد عن 10 مليارات كلمة، تغطي تسعة مجالات رئيسية: التخصصات المتداخلة، والتكنولوجيا، والعلوم، والدراسات الاجتماعية، والرياضيات، ومهارات الحياة، والفنون والإبداع، وفنون اللغة، والفلسفة والأخلاق. وتتبع البيانات نموذجاً تعليمياً راسخاً، مع 10 مستويات صعوبة من الأساسي إلى المتقدم، مما يدل على تسلسل هرمي جيد وتنظيم منهجي.
تشغيل عبر الإنترنت:https://go.hyper.ai/skT3q
9. مجموعة بيانات الاستدلال البصري VisCoR-55K
VisCoR-55K هي مجموعة بيانات عالية الجودة للاستدلال البصري، صدرت عام 2026 من جامعة هوا تشونغ للعلوم والتكنولوجيا بالتعاون مع علي بابا كلاود. تحتوي هذه المجموعة على ما يقارب 55,000 عينة للاستدلال البصري، تُنتج كل منها عملية استدلال مقابلة باستخدام عينات متباينة.مجموعة بيانات عالية الجودة للاستدلال البصري تغطي خمس فئات: عامة، واستدلال، ورياضية، ورسم بياني، والتعرف الضوئي على الأحرف.الهدف هو تعزيز البحث في نماذج اللغة البصرية في الاستدلال البصري الموثوق والقوي.
تشغيل عبر الإنترنت:https://go.hyper.ai/kIlWk
دروس تعليمية عامة مختارة
1. روبوت MiniCPM: نموذج ذكاء مجسد للعالم الحقيقي
MiniCPM-Robot هي عائلة من نماذج الذكاء المجسد من OpenBMB للإدراك واتخاذ القرارات والتحرك في العالم الحقيقي. يتضمن الإصدار الأولي نموذجين: MiniCPM-RobotManip، وهو نموذج VLA عام لمعالجة الروبوتات، وMiniCPM-RobotTrack، وهو نموذج حافة لتتبع الأهداف المجسدة.
تشغيل عبر الإنترنت:https://go.hyper.ai/0VsYI

2. دايموند-1.0: نموذج استعادة الكلام التراجعي الذاتي
Diamond هو نموذج لاستعادة الكلام تم تطويره بواسطة nineninesix.ai في يوليو 2026. وهو يستخدم بنية seq2seq ذاتية التراجع لاستعادة الصوت المتدهور (ترميز معدل البت المنخفض، والضوضاء الخلفية، والقص، والنطاق الضيق) إلى 44.1 كيلو هرتز بجودة قريبة من جودة الاستوديو.
تشغيل عبر الإنترنت:https://go.hyper.ai/OHZ6o

3. Nanbeige4.2-3B: نموذج الوكيل الذكي المضغوط
Nanbeige4.2-3B هو نموذج وكيل مضغوط طورته شركة Nanbeige في يوليو 2026، وهو مبني على Nanbeige4.2-3B-Base. يستخدم هذا النموذج بنية المحول الحلقي، حيث يعيد استخدام طبقات المحول لزيادة سعة النموذج دون زيادة عدد المعلمات - باستخدام 3 مليارات فقط من المعلمات غير المضمنة (من إجمالي 4 مليارات)، يتفوق على نماذج أكبر مثل Qwen3.5-9B و Gemma4-12B في اختبارات قياس أداء الوكلاء.
تشغيل عبر الإنترنت:https://go.hyper.ai/KI1QR

4. فارا 1.5-27ب: الحواسيب متعددة الوسائط باستخدام الوكلاء الأذكياء
Fara1.5-27B هو وكيل حاسوبي متعدد الوسائط أطلقته مايكروسوفت ريسيرش إيه آي فرونتيرز في مايو 2026. يتميز هذا الوكيل بابتكاره الأساسي المتمثل في بنية إدراك تعتمد على الرؤية فقط، حيث يراقب المتصفح من خلال لقطات الشاشة وينجز المهام من البداية إلى النهاية باستخدام استدعاءات أدوات منظمة (النقر، الكتابة، التمرير، البحث في صفحات الويب، إلخ) دون الوصول إلى نموذج كائن المستند (DOM). يستند هذا النموذج إلى Qwen3.5-27B وتم ضبطه بدقة تحت إشراف، باستخدام بيانات تدريب مُولّدة من عملية FaraGen1.5 متعددة الوكلاء.
تشغيل عبر الإنترنت:https://go.hyper.ai/9AwuJ

5. NVIDIA Cosmos3-Edge: نموذج الاستدلال متعدد الوسائط
Cosmos3-Edge هو نموذج أساسي متعدد الوسائط للعالم مكون من 4B معلمات، تم إصداره بواسطة فريق NVIDIA في يوليو 2026. يتمثل ابتكاره وميزته الأساسية في اعتماد بنية Transformer الهجينة (MoT)، والتي تدمج Transformer التراجعي التلقائي و Transformer الانتشار ضمن إطار عمل موحد للتعامل مع توليد النصوص وتوليد الوسائط المتعددة مثل الصور/مقاطع الفيديو/الإجراءات، على التوالي.
تشغيل عبر الإنترنت:https://go.hyper.ai/yB4bz

6. ماج-فلو: نموذج أساسي لتوليد الصور وتحريرها بكفاءة عالية وبدقة أصلية
Mage-Flow هو نموذج أساسي مضغوط لتوليد الصور وتحريرها بحجم 4B أصدرته مايكروسوفت في يوليو 2026. من خلال تحسين مشترك مصمم بعناية لنظام العمود الفقري للتجزئة، فإنه يحقق جودة مماثلة للنماذج الأكبر حجمًا (Qwen-Image 20B، FLUX.2 32B) على نطاق معلمات 4B، مع الحفاظ على سرعة استدلال أسرع وبصمة ذاكرة أقل.
تشغيل عبر الإنترنت:https://go.hyper.ai/3cw36

7. LingBot-World-V2: توليد مقاطع فيديو من الصور مع عوالم لا نهائية وتفاعلات متنوعة
LingBot-World-V2 هو نموذج لتوليد الفيديو من الصور، أطلقه فريق Robbyant في يوليو 2026. يحقق هذا النموذج تفاعلات طويلة الأمد من خلال التدريب المسبق السببي مع الحفاظ على جودة إخراج ثابتة؛ كما يدعم توليد فيديو بدقة 720p بمعدل 60 إطارًا في الثانية في الوقت الفعلي، ويتمتع بقدرات تفاعلية متنوعة مثل الهجوم والرماية وإلقاء التعاويذ. علاوة على ذلك، يُعد LingBot-World-V2 أول نموذج يُدخل إطار عمل للوكلاء الأذكياء في نموذج العالم، مما يحقق فهمًا أكثر ذكاءً للمشهد وتوليدًا أفضل للتفاعلات من خلال وكلاء تخطيط السلوك ووكلاء توليف البيئة.
تشغيل عبر الإنترنت:https://go.hyper.ai/wecWC

8. MOSS-Transcribe-Diarize: نسخ صوتي شامل متعدد المتحدثين وفصل المتحدثين
MOSS-Transcribe-Diarize هو نموذج فهم صوتي متعدد المتحدثين من البداية إلى النهاية تم إصداره بواسطة فريق MOSI.AI (OpenMOSS) في يوليو 2026. من خلال استدلال واحد فقط، يمكن للنموذج إكمال نسخ الكلام وفصل المتحدثين في وقت واحد، وإخراج نص منظم مع طوابع زمنية وعلامات متحدث مجهولة (مثل [S01]، [S02]).
تشغيل عبر الإنترنت:https://go.hyper.ai/TElI9

💡لقد قمنا أيضًا بتأسيس مجموعة تبادل تعليمية حول الانتشار المستقر. مرحبًا بالأصدقاء لمسح رمز الاستجابة السريعة والتعليق على [برنامج تعليمي SD] للانضمام إلى المجموعة لمناقشة المشكلات الفنية المختلفة ومشاركة نتائج التطبيق ~

تفسير مقالة المجتمع
1. اقترح مختبر أرغون الوطني في الولايات المتحدة برنامج ChemGraph، الذي يستخدم 13 اختبارًا معياريًا لتقييم قيمة العوامل في مجال الكيمياء الحاسوبية.
أطلق مختبر أرغون الوطني برنامج ChemGraph، وهو نظام ذكاء اصطناعي مدعوم بتقنية LLM، مصمم خصيصًا لأتمتة عمليات محاكاة الجزيئات في الكيمياء الحاسوبية. تُظهر الاختبارات المعيارية أن النماذج الكبيرة، مثل GPT-4o، تعمل بثبات على المهام المعقدة؛ ومع ذلك، من خلال تقسيم المهام بشكل استراتيجي، يمكن للنماذج الأصغر (مثل GPT-4o-mini) تحسين الأداء بشكل ملحوظ، لتصل إلى مستوى أداء النماذج الأكبر أو حتى تتجاوزه. يوفر هذا البحث نهجًا جديدًا لأتمتة الذكاء الاصطناعي في البحث العلمي بتكلفة منخفضة.
شاهد التقرير الكامل:https://go.hyper.ai/Cgo56
2. استنادًا إلى استنتاج النموذج الكبير واستخدام أداة MCP، أكمل علماء الأشعة السينية في جامعة ستانفورد بشكل مستقل عملية محاذاة حيود البلورة المفردة في مصدر إشعاع السنكروترون.
قام فريق بحثي من جامعة ستانفورد ومختبر SLAC الوطني للمسرعات بتطوير نظام "عالم الأشعة السينية المدعوم بالذكاء الاصطناعي" ونشره على خط شعاع حقيقي في مصدر إشعاع السنكروترون بجامعة ستانفورد. وقد قام الفريق أولاً باختبار النظام في خط شعاع افتراضي قبل نقله إلى المعدات الحقيقية، مستخدماً مهمة حل مصفوفة توجيه البلورة الأحادية لاختبار قدرة الذكاء الاصطناعي على إكمال خطوات تجريبية متعددة بشكل مستقل والتعامل مع الانحرافات غير المتوقعة في بيئة حقيقية.
شاهد التقرير الكامل:https://go.hyper.ai/jF9qk
مقالات موسوعية شعبية
1. حلقة التفاعل بين الإنسان والآلة (HITL)
2. التعرف التلقائي على الكلام (ASR)
3. التعرف الضوئي على الأحرف (OCR)
4. نموذج العمل العالمي (WAM)
5. إطار التعلم المعزز القائم على التفكير (GTR)
فيما يلي مئات المصطلحات المتعلقة بالذكاء الاصطناعي التي تم تجميعها لمساعدتك على فهم "الذكاء الاصطناعي" هنا:
الموعد النهائي للقمة في أغسطس
إن ما ورد أعلاه هو كل محتوى اختيار المحرر لهذا الأسبوع. إذا كان لديك موارد تريد تضمينها على الموقع الرسمي لـ hyper.ai، فنحن نرحب بك أيضًا لترك رسالة أو إرسال مقال لإخبارنا بذلك!
نراكم في الاسبوع القادم!








