HyperAIHyperAI

Command Palette

Search for a command to run...

Benchmarks
LLM

AISI et EvalEval rendent les benchmarks IA reproductibles

Le Royaume-Uni renforce la transparence de l'évaluation des modèles d'intelligence artificielle grâce à une collaboration entre le UK AI Security Institute (AISI) et l'EvalEval Coalition. L'AISI utilise désormais l'infrastructure d'EvalEval pour publier ouvertement ses résultats d'évaluation, favorisant ainsi une science de l'évaluation plus reproductible et vérifiable. Cette initiative fait suite à un atelier conjoint organisé lors de la conférence NeurIPS 2025 et à des retours qui ont directement influencé le développement du schéma de rapport commun Every Eval Ever. La publication d'évaluations standardisées répond à un problème croissant dans le secteur : les résultats sur les performances des systèmes d'IA sont souvent rapportés selon des formats hétérogènes, sans suffisamment d'informations pour permettre leur reproduction. Réexécuter ces tests est par ailleurs très coûteux. Pour y remédier, EvalEval développe un schéma de rapport partagé et une plateforme appelée Evaluation Cards, qui structure les données des benchmarks, les métadonnées des modèles et le contexte nécessaire à leur interprétation. L'AISI, qui travaille également à optimiser ses méthodes via des outils comme OptStop et HiBayES, apporte à cet écosystème une rigueur statistique et une analyse standardisée des transcriptions. Dans cette nouvelle phase, l'AISI rend accessibles publiquement ses méthodes et résultats via des Evaluation Cards. Cette publication comprend des données vérifiées, le contexte expérimental et les configurations techniques relatives à cinq benchmarks principaux. Elle couvre l'évaluation de six modèles de pointe : Claude Opus 4, 4.5 et 4.6, ainsi que GPT-5, 5.2 et 5.4. Les ensembles de données incluent également les résultats de deux évaluations cybernétiques, Cyber CTFs et The Last Ones, qui mobilisent un groupe de modèles partiellement différent. Ces informations accompagnent la publication récente de l'AISI, qui examine comment le pouvoir de calcul utilisé lors de l'inférence influence les performances des grands modèles de langage. Les résultats montrent que la performance aux benchmarks varie significativement selon le protocole d'évaluation et la quantité de tokens alloués. Lorsque les modèles reçoivent un retour correctif après chaque tentative, ils parviennent à résoudre davantage de tâches à mesure que l'utilisation des tokens augmente. La mise à disposition ouverte de ces données, accompagnée de leurs paramètres de configuration, permet aux chercheurs et aux praticiens d'analyser chaque étude en détail et de comparer les performances à travers le domaine. Ces références vérifiées aident également à contextualiser les rapports qui omettent ces détails, en montrant comment les choix méthodologiques peuvent influencer les scores affichés. À mesure que davantage d'organisations d'évaluation adopteront le standard EEE, ces publications ouvertes soutiendront une méta-recherche plus large et plus fiable. L'EvalEval Coalition, une communauté de recherche dédiée au développement d'infrastructures scientifiquement solides pour l'évaluation, voit cette adoption comme une étape clé vers une meilleure documentation de la pertinence et de l'utilité des benchmarks. De son côté, l'AISI, organe de recherche du ministère britannique de la Science et de l'Innovation, poursuit sa mission de doter les gouvernements d'une compréhension scientifique des risques liés à l'IA avancée. Cette synergie entre standardisation ouverte et sécurité réglementaire pourrait transformer la façon dont les performances des modèles sont mesurées, partagées et évaluées à l'échelle mondiale.

Liens associés