ARC-AGI-3 : benchmark IA mesure performance et efficacité
Le classement du ARC Prize vient de recevoir une mise à jour majeure, reflétant l'évolution des normes d'évaluation de l'intelligence artificielle. Initialement conçu pour mesurer l'intelligence fluide passive, le benchmark ARC-AGI a progressé vers la version 3, qui place désormais les agents IA au cœur d'environnements interactifs inédits, exigeant une adaptation en temps réel. Cette évolution marque un tournant : la performance ne se mesure plus uniquement à la capacité de résoudre des problèmes, mais à l'efficacité avec laquelle les ressources sont mobilisées. Les données publiées sur le tableau de bord mettent en lumière la relation entre le coût par tâche et les résultats obtenus. Ce graphique en nuage de points révèle que l'intelligence véritable réside dans un équilibre économique et technique. Les systèmes classés se divisent en plusieurs catégories. D'une part, les modèles de langage de base, tels que GPT-4.5 et Claude 3.7, proposent des inférences en un seul passage sans mécanismes de raisonnement étendu, offrant ainsi une mesure brute de leurs capacités initiales. D'autre part, les systèmes optimisés via des processus de raisonnement itératif montrent une amélioration des performances à mesure que le temps de calcul est prolongé, avant d'atteindre une limite de rentabilité. Enfin, les solutions issues du défi Kaggle démontrent comment des méthodes sur mesure, limitées à un budget informatique strict de cinquante dollars pour cent vingt tâches, peuvent rivaliser efficacement. La politique de vérification impose des critères rigoureux pour garantir l'intégrité des résultats. Seuls les systèmes dont le coût de fonctionnement reste inférieur à dix mille dollars figurent officiellement dans le classement. Les modèles incapables de générer des sorties complètes voient les tâches restantes automatiquement marquées comme échouées. Certaines propositions portant la mention aperçu restent non officielles et fondées sur des tests incomplets, notamment pour les évaluations provisoires des coûts associées à des modèles comme Gemini 3 Pro ou o1-pro. Cette refonte du classement souligne une tendance claire du secteur : l'ère des simples générateurs de texte cède progressivement la place à des agents capables de raisonner, de s'adapter et d'optimiser leurs ressources dans des contextes dynamiques. Pour les chercheurs et les développeurs, le tableau de bord du ARC Prize offre désormais une référence précise pour mesurer non seulement la puissance computationnelle, mais aussi la viabilité économique et la robustesse opérationnelle des architectures IA de nouvelle génération.
