GPT-5.6 Luna vs GPT-6 Astra : revue de code moins chère
Une évaluation récente met en perspective GPT-5.6 Luna et GPT-6 Astra pour l'examen automatisé de code. Testés sur cinquante demandes de modification publiques issues de projets majeurs comme Sentry, Discourse, Cal.com et Keycloak, les deux modèles illustrent le compromis inhérent entre coût et précision. GPT-5.6 Luna, facturée 0,20 dollar par million de tokens d'entrée et 1,20 dollar pour les tokens de sortie, se distingue par son économie. Chaque examen coûte environ 0,004 dollar, contre 0,113 dollar pour Astra, soit un écart de vingt-huit fois. Sur l'ensemble des tests, Luna a généré des résultats en vingt-trois secondes par examen et a coûté 0,20 dollar au total, tandis qu'Astra nécessitait 36 secondes et 5,66 dollars. En matière de détection, Luna a identifié 69 bogues vérifiés contre 92 pour Astra. Sa précision s'établit à 74 %, signifiant qu'une découverte sur quatre ne résiste pas à la vérification, contre un sur vingt-quatre pour Astra. Malgré ce fossé, le coût par bogue vérifié de Luna (0,003 dollar) reste vingt fois inférieur à celui d'Astra (0,061 dollar). Les résultats révèlent toutefois une limite structurelle : Luna performe bien sur les erreurs logiques et les problèmes de données, mais peine considérablement sur les modules de sécurité et de gestion des accès. Sur les vingt-quatre vulnérabilités de sécurité testées, Luna n'en a détecté que neuf, contre dix-neuf pour Astra. Ce déficit est particulièrement visible sur les modifications liées à l'authentification, où la précision de Luna chute à 50 %. L'analyse montre aussi que les deux modèles ne détectent pas les mêmes défauts. Luna a identifié vingt-cinq bogues manqués par Astra, principalement des problèmes de logique et de concurrence. L'exécution simultanée des deux modèles aurait permis de retrouver cent dix-sept vérifiés sur cent quarante-trois pour un coût total de 5,86 dollars. Cette complémentarité suggère une approche hybride : utiliser le modèle économique pour la vérification quotidienne du code standard, tout en réservant l'analyse approfondie aux parties sensibles du système. Les équipes devraient également ajuster leur stratégie en fonction du contexte, car un simple extrait de code ne permet pas à l'intelligence artificielle de distinguer automatiquement une fonction critique d'une routine. Cette évaluation repose sur une méthodologie rigoureuse avec des invites de commande identiques et une double vérification par des juges algorithmiques indépendants. Les chercheurs soulignent les limites inhérentes à l'analyse uniquement par différences de code, qui ignore la logique globale du projet et l'historique des incidents de production. Bien que les dépôts testés soient publics et datés, la conception artificielle des bogues garantit la validité des tests. Les données brutes, les invites et les scripts de notation sont publics pour permettre la reproductibilité. En définitive, GPT-5.6 Luna s'impose comme un outil économique efficace pour la maintenance courante, mais ne peut remplacer une validation rigoureuse sur les zones critiques. Une architecture de revue assistée par IA doit intégrer ces disparités pour optimiser à la fois la sécurité et les ressources informatiques.
