HyperAIHyperAI

Command Palette

Search for a command to run...

PILOT : Un système intelligent de routage adaptatif des modèles linguistiques sous contraintes budgétaires

Les grands modèles linguistiques (LLM) ont révolutionné le traitement du langage naturel, mais leur diversité en termes de capacités et de coûts pose des défis importants dans les applications pratiques. La routage des LLM vise à résoudre ce problème en sélectionnant dynamiquement le modèle le plus adapté à chaque requête ou tâche. Les approches antérieures abordent cette question comme un problème d’apprentissage supervisé, supposant une connaissance complète des paires optimales entre requêtes et modèles. Toutefois, dans les scénarios réels, de telles correspondances exhaustives sont inaccessibles, et les besoins des utilisateurs évoluent constamment. Dans ce contexte, nous proposons de modéliser le routage des LLM comme un problème de bandit contextuel, permettant une prise de décision adaptative fondée sur des retours en temps réel (feedback bandit), sans avoir à évaluer tous les modèles pour chaque requête — une approche qui diffère fondamentalement du routage supervisé. Pour cela, nous concevons un espace d’embeddings partagé où les requêtes et les modèles sont représentés de manière à refléter leur affinité. Cet espace est initialement appris à partir de données humaines de préférences collectées hors ligne, puis affiné en continu grâce à des retours obtenus en ligne via le cadre du bandit contextuel. Nous mettons en œuvre cette idée dans un nouvel algorithme, appelé PILOT (Preference-prior Informed LinUCB for adaptive routing), une extension innovante de l’algorithme LinUCB. PILOT exploite les connaissances préalables issues des préférences humaines pour guider les décisions initiales, tout en s’adaptant efficacement aux nouvelles données. Cette approche permet de réduire le temps d’exploration et d’améliorer la rapidité de convergence vers des choix optimaux. Un autre défi majeur est la gestion des contraintes budgétaires variées des utilisateurs. Pour répondre à cette problématique, nous introduisons une politique de coût en ligne, modélisée comme un problème de sac à dos à choix multiples. Cette politique garantit que le routage reste efficace du point de vue des ressources, tout en respectant les limites budgétaires imposées par l’utilisateur. L’approche proposée a été validée dans des expérimentations sur des jeux de données réels, démontrant une performance supérieure en termes de qualité des réponses et d’efficacité économique par rapport aux méthodes existantes. En intégrant des données humaines, une adaptation en ligne et une gestion intelligente des coûts, PILOT représente une avancée significative vers un routage des LLM plus intelligent, flexible et adapté aux besoins réels des utilisateurs. Cette étude a été acceptée pour publication dans les actes de EMNLP 2025 (findings).

Liens associés

PILOT : Un système intelligent de routage adaptatif des modèles linguistiques sous contraintes budgétaires | Articles tendance | HyperAI