OpenAI dévoile GPT-5.6, alliant intelligence et efficacité
OpenAI présente la famille de modèles GPT-5.6, conçue pour équilibrer performance et coût sur l'ensemble des tâches courantes. La gamme comprend trois variantes : GPT-5.6 Sol, la version la plus puissante dotée de capacités de raisonnement étendu, qui dépasse le modèle Fable 5 de Claude sur les benchmarks de codage à moins de la moitié du prix ; Terra, offrant une intelligence équivalente à GPT-5.5 pour la moitié du coût ; et Luna, la plus rapide et la plus abordable, coûtant 80 % de moins que Sol. Pour atteindre ces résultats, OpenAI a optimisé l'ensemble de sa pile technique, depuis l'entraînement des modèles jusqu'à leur exécution. L'entreprise mise sur l'efficacité pour servir plus de requêtes avec le même matériel tout en maintenant la rapidité et la fiabilité attendues par ses plus d'un milliard d'utilisateurs actifs. Cette démarche repose sur plusieurs leviers techniques majeurs. Au niveau de l'inférence, l'entreprise a amélioré l'équilibrage de charge, le décodage spéculatif et la gestion de la mémoire cache. GPT-5.6 Sol, utilisé via l'assistant de développement Codex, a analysé automatiquement le trafic en production, identifié les goulots d'étranglement et réécrit les noyaux informatiques exécutés sur les processeurs graphiques. Cette automatisation a réduit les coûts de service de 20 %. Le décodage spéculatif, qui utilise un modèle auxiliaire pour prédire plusieurs jetons simultanément, a quant à lui amélioré l'efficacité de génération de 15 %. Les configurations d'exécution sont désormais optimisées en fonction de la charge de travail réelle, permettant une utilisation plus fine du matériel. Les gains d'efficacité s'étendent également à la couche d'orchestration pour agents. Dans les environnements autonomes, les fenêtres de contexte gonflent rapidement à mesure que les modèles interagissent avec de nombreux plugins et historiques de conversation. OpenAI a mis en place une découverte différée des outils et limité leur sortie à 10 000 jetons pour éviter de surcharger le modèle. De plus, le système conserve un historique immuable et commande les outils de manière déterministe, ce qui maximise l'utilisation du cache des invites. Ces ajustements réduisent considérablement les calculs redondants lors des tâches complexes en plusieurs étapes. Selon l'éditeur, ces avancées ne sont pas ponctuelles mais s'inscrivent dans une boucle d'optimisation continue. L'intelligence artificielle elle-même accélère la recherche de gains techniques, créant un effet d'entraînement sur la réduction de la latence et des coûts. OpenAI confirme qu'elle continuera à peaufiner ces architectures pour rendre l'intelligence artificielle générale plus accessible, plus performante et économiquement viable à grande échelle.
