مودل إكسبريس يُسرّع توزيع أوزان الذكاء الاصطناعي
أعلنت شركة إنفيديا عن إطلاق نظام ModelExpress لتحسين توزيع أوزان النماذج الذكية وتقليل زمن بدء التشغيل البارد في مجموعات الحوسبة. يهدف النظام إلى معالجة التحدي المتزايد الناتج عن حجم ملفات النماذج الذي يتراوح بين مئات الجيجابايت والتيرابايت، حيث كان نقل الأوزان بين الوحدات التقليدية يستهلك وقتاً ويثقل كاهل النطاق الترددي. يعتمد النظام على فكرة أساسية تتمثل في البحث أولاً عن نسخة متوافقة من الأوزان على خادم مجاور قبل تحميلها، مما يلغي تكرار عمليات الجلب من التخزين السحابي أو المحلي. يعمل النظام من خلال مكتبة NVIDIA Inference Xfer Library (NIXL) لإجراء نقل مباشر بين بطاقات الرسوميات عبر بروتوكول RDMA. عند بدء التشغيل الأول، يجلب النظام ملفات الأوزان من التخزين الخارجي أو المحلي مباشرة إلى ذاكرة GPU متجاوزاً القرص الصلب والذاكرة المضيفة عبر تقنية Model Streamer. بمجرد جاهزية الخادم الأول، تتحول العملية إلى نقل نظير لنظير حيث يجلب الخوادم اللاحقة الأوزان من خوادم نشطة بالفعل، مما يحول التوسع الأفقي إلى شبكة توزيع فعالة. كما يدمج النظام خدمة Model Cache Service لتجميع طلبات التنزيل المتزامنة وتحميل الملف مرة واحدة فقط على مستوى العناقيد، مع تحسينات لتسجيل ذاكرة GPU وتقليل زمن الانتظار. يغطي النظام أيضاً مرحلة التمهيد الحراري عبر واجهة Artifact Transfer API التي تتيح مشاركة مخازن kernels المُشفّرة والمُحسّنة تلقائياً بين النماذج المتطابقة، مما يلغي الحاجة إلى عمليات التجميع المؤقت المتكررة. بالإضافة إلى ذلك، يدعم النظام تدريب النماذج المعزز من خلال آلية استلام محركة للتحديث المستمر للأوزان بين مدربي النموذج وعاملِي الاستدلال، مع ضمان التوافق الهيكلي وتجنب التوقف عند تحديثات الخطوات الفردية. أظهرت الاختبارات العملية على بيئة مكونة من ثمانية أجهزة B200 تشغيل نموذج DeepSeek-V4 Pro انخفاض زمن بدء التشغيل الكلي من ثماني دقائق إلى دقيقة و44 ثانية، مع نقل الأوزان في أقل من 10 ثوانٍ. يدعم النظام بشكل افتراضي شبكات متعددة مثل InfiniBand وRoCE وNVLink وEFA، ويتكامل مع إطارات عمل بارزة مثل vLLM وSGLang وDynamo وllm-d. يمثل هذا الإصدار خطوة عملية نحو تخفيض التكاليف التشغيلية وتسريع دورات نشر النماذج الذكية على نطاق واسع.
