يدعم ترانسفورمرز الآن نماذج لاما سي بي بي المكمّمة
أعلنت مكتبة Transformers التابعة لمنصة Hugging Face عن إضافة دعم رسمي وتشغيل مدمج لنماذج GGUF المُكبَّسة المطوَّرة بواسطة محرك llama.cpp، مما يُمكّن المطورين من استيراد وتشغيل نماذج الذكاء الاصطناعي محلياً على أجهزة الكمبيوتر الشخصية والمحمولة بكفاءة عالية. يهدف هذا التحديث إلى سد الفجوة بين المكتبتين الرائدتين في مجال الحوسبة المحلية، حيث تدمج Transformers الآن النواة الحسابية ggml المحسَّنة لمنصة Apple Silicon مباشرة ضمن حلقة عمل PyTorch، مما يلغي الحاجة إلى بيئات تشغيل منفصلة مع الحفاظ على واجهة برمجة التطبيقات القياسية. يعتمد التحديث على مكتبة kernels الجديدة لاستيراد نواة ggml المتخصصة في التكميم، والطبيعيات، والانتباه السريع، وتوجيه النماذج ذات الخبراء المختلطين، مما يقلل استهلاك الذاكرة ويحسن سرعة توليد الرموز. أظهرت الاختبارات المعتمدة على معالجات Apple Silicon أن أداء التوليد يقترب من كفاءة llama.cpp الأصلي، خاصة عند استخدام مستويات تكميم متوازنة مثل Q4_K_M وQ5_K_M التي توازن بين دقة النموذج وحجم ملفه. إلى جانب تحسين النواة، عولجت حلقة التوليد لتقليل نقاط المزامنة بين وحدات المعالجة، مما يضمن تدفقاً مستمراً للرموز دون تأخيرات ناتجة عن عمليات إعادة التجميع أو المزامنة المتكررة. يدعم الإصدار الأول بنية Qwen3.5 على أنظمة macOS، مع خطط مستقبلية لتوسيع نطاق الدعم ليشمل معماريات أخرى وأشكالاً متعددة الوسائط. يوفر التحديث مسارين رئيسيين للتنفيذ: التحميل المباشر عبر الواجهة القياسية باستخدام معرّف النموذج واسم ملف GGUF، أو تشغيل خدمة محلية عبر واجهة متوافقة مع OpenAI. تؤكد المنصة أن محرك llama.cpp يظل الخيار الأمثل للأداء المحلي النقي، بينما يقدم هذا الدمج بديلاً مرناً للمطورين الذين يفضلون بيئة Python الموحدة، مع إمكانية تمديد استخدام نواة ggml لتشغيل معالجات وبنى غير مدعومة في llama.cpp مباشرة، مما يوسع آفاق البحث والتطوير في الحوسبة المحلية.
