HyperAIHyperAI

Command Palette

Search for a command to run...

نظام توجيه نماذج لغة كبيرة متكيف ضمن قيود ميزانية

تُمثل نماذج اللغة الكبيرة (LLMs) تطورًا جوهريًا في معالجة اللغة الطبيعية، لكن تباين قدراتها التكلفة في التطبيقات العملية يشكل تحديًا كبيرًا. لمعالجة هذه المشكلة، ظهر مفهوم "توجيه نماذج اللغة الكبيرة"، الذي يُعدّل اختيار النموذج الأنسب لكل استعلام تلقائيًا. في الدراسات السابقة، تم معالجة هذه المهمة كمشكلة تعلم مراقب، بافتراض توفر معرفة كاملة بتوافق كل استعلام مع أفضل نموذج. لكن الواقع العملي يفتقر إلى هذه البيانات المسبقة، ويواجه تغيرات مستمرة في طبيعة الاستعلامات. لذلك، يقترح الباحثون نهجًا جديدًا يُعامل فيه توجيه النماذج كمشكلة "البنديت السياقي" (contextual bandit)، مما يسمح باتخاذ قرارات تكيفية بناءً على تغذية راجعة مباشرة من الأداء (bandit feedback)، دون الحاجة إلى تقييم كل النماذج الممكنة لكل استعلام – على عكس الطرق التقليدية التي تعتمد على التعلم المراقب. لتحقيق ذلك، تم تطوير فضاء مشترك للتمثيل (embedding space) يُمثل الاستعلامات والنماذج بشكل متناسق، بحيث تُقاس درجة التوافق بينهما من خلال المسافة بين تمثيلاتهما. يُتعلم هذا الفضاء أولًا من بيانات تفضيلات بشرية مُجمّعة مسبقًا، ثم يُحسّن تدريجيًا باستخدام ملاحظات أداء حقيقية من الاستخدامات الحية. استنادًا إلى هذا المفهوم، تم تطوير نموذج جديد يُسمى PILOT (Preference-prior Informed LinUCB for adaptive routing)، وهو تطوير مبتكر لنظام LinUCB المعروف في تعلم البنديت، يُدمج فيه التوجيه البشري المسبق لتحسين دقة التوصيات. يُمكن لـ PILOT التعلم من تجربة المستخدم الفعلية، مثل جودة الإجابة أو سرعة الاستجابة، لتعديل استراتيجيات التوجيه بمرور الوقت. إضافة إلى ذلك، يأخذ النموذج بعين الاعتبار تباين الميزانيات التي يضعها المستخدمون في استخدام النماذج، حيث لا يُسمح دائمًا باستخدام النماذج الأكثر تكلفة حتى لو كانت الأفضل. لذا، تم تصميم سياسة تكلفة مباشرة في الزمن الحقيقي، تُعامل كمشكلة "الحقيبة المتعددة الخيارات" (multi-choice knapsack)، لتضمن استخدام الموارد بكفاءة، مع الحفاظ على جودة الإجابة ضمن الحدود المالية المحددة. النتائج الأولية تُظهر أن النموذج الجديد يتفوق في دقة التوجيه وفعالية الاستخدام المالي مقارنة بالطرق التقليدية، خاصة في بيئات ديناميكية تتغير فيها طبيعة الاستعلامات باستمرار. كما يُظهر قدرة عالية على التكيف مع تفضيلات المستخدمين المتغيرة دون الحاجة إلى إعادة تدريب كامل أو تجميع بيانات جديدة. هذا البحث مقبول في مؤتمر EMNLP 2025 ضمن قسم "النتائج" (Findings)، ويُعدّ خطوة مهمة نحو تطوير أنظمة توجيه نماذج لغة ذكية، قادرة على التعلم والتكيف في الوقت الحقيقي، مع الحفاظ على الكفاءة التشغيلية والتكاليف المنخفضة.

الروابط ذات الصلة

نظام توجيه نماذج لغة كبيرة متكيف ضمن قيود ميزانية | القصص الشائعة | HyperAI