HyperAIHyperAI

Command Palette

Search for a command to run...

Les outils IA de codage font des erreurs une fois sur quatre

Une nouvelle étude de l'Université de Waterloo révèle que les outils de codage basés sur l'intelligence artificielle commettent des erreurs dans un cas sur quatre, mettant en lumière les limites actuelles de leur fiabilité dans le développement logiciel. Cette recherche, intitulée StructEval, a été publiée dans les Transactions on Machine Learning Research et sera présentée au congrès ICLR 2026. Alors que les modèles de langage (LLM) s'intègrent de plus en plus aux flux de travail des développeurs, la capacité de ces systèmes à fournir des réponses précises et facilement intégrables reste un défi majeur. Pour pallier les difficultés d'interprétation des réponses naturelles, plusieurs géants technologiques comme OpenAI, Google et Anthropic ont introduit des sorties structurées. Ces formats imposent aux modèles de générer du code dans des structures prédéfinies telles que JSON, XML ou Markdown, facilitant ainsi leur lecture tant pour les humains que pour les autres logiciels. Cependant, l'étude de l'Université de Waterloo démontre que cette technologie n'est pas encore aussi fiable que beaucoup l'espéraient. Lors des tests, les modèles les plus avancés n'ont atteint qu'une précision d'environ 75 %, tandis que les modèles open source oscillaient autour de 65 %. Le projet StructEval a évalué onze modèles de langage à travers dix-huit formats de sortie structurés et quarante-quatre tâches conçues pour mesurer la rigueur du respect des règles. Dongfu Jiang, doctorant en informatique et co-auteur principal de l'étude, explique que l'objectif était de mesurer non seulement la syntaxe du code, mais aussi l'exactitude des résultats produits pour différentes tâches. Les chercheurs ont constaté que si les modèles gèrent correctement les tâches textuelles, ils peinent considérablement face à la génération d'images, de vidéos ou de sites web. Cette recherche est le fruit d'un effort collaboratif impliquant Jialin Yang, étudiant de premier cycle, et le professeur assistant Wenhu Chen. Elle intègre également des annotations de dix-sept autres chercheurs à travers le monde. Wenhu Chen souligne que l'Université de Waterloo encourage ses étudiants à passer du simple rôle d'annotateur à celui d'organisateur de projets et de créateur d'études de benchmarking, permettant ainsi de ne pas seulement utiliser l'IA, mais aussi de la construire et de l'évaluer. Malgré les progrès réalisés, les auteurs de l'étude insistent sur le fait que ces systèmes ne sont pas encore suffisamment fiables pour fonctionner sans supervision humaine. Les agents de codage générés par l'IA peuvent assister les développeurs, mais ils nécessitent un contrôle et une validation humains significatifs pour garantir l'exactitude et la sécurité des résultats. À mesure que l'industrie continue d'adopter ces outils, il devient crucial de maintenir une approche prudente, reconnaissant que l'intelligence artificielle reste une aide et non un remplaçant autonome pour le moment.

Liens associés