HyperAIHyperAI

Command Palette

Search for a command to run...

La Capacité De l'IA 27B À Reproduire Les Articles Des Scientifiques Surpasse GPT-5.5/Claude Opus 4.8 ; Faraday Explore l'innovation Scientifique À Long terme.

Featured Image

La reproductibilité d'un article de recherche est la pierre angulaire d'un système de connaissances scientifiques. Elle garantit non seulement la fiabilité des résultats de recherche existants, mais fournit également une base pour de futures expériences.

Cependant, plusieurs domaines scientifiques, notamment l'apprentissage automatique, sont actuellement confrontés à une « crise de reproductibilité ». Théoriquement, les agents d'IA basés sur de grands modèles de langage (LLM) pourraient apporter une solution évolutive à cette crise ; toutefois, en pratique, la reproductibilité pose des défis aux agents d'IA existants dans trois domaines principaux :d'abord,Par définition, le problème de la reproduction d'un article réside dans l'incomplétude de l'information. En effet, l'article ne propose qu'une version compressée, et donc nécessairement abrégée, du processus de recherche complet ayant mené à une découverte, omettant inévitablement certains détails.Deuxièmement,Les agents d'IA existants sont principalement entraînés de manière approfondie sur des problèmes bien définis et fermés, tandis que la reproduction de documents papier exige des agents qu'ils mènent une exploration ouverte ; enfin, pour les tâches de reproduction générales, il n'existe pas de fonction de récompense claire qui puisse être utilisée pour une optimisation continue « par ascension ».

En réponse à ce défi,Une équipe de recherche d'Inherent Labs a entraîné un agent scientifique IA appelé Faraday, capable de reproduire des articles de recherche scientifique.Cet agent basé sur la modélisation linéaire en nombres entiers (LLM) utilise Codex GPT-5.5 comme outil, à l'instar des chercheurs en IA qui utilisent des agents programmés. Lors d'une évaluation basée sur des critères, Faraday a surpassé Claude Opus 4.8 et GPT-5.5 sur une tâche d'apprentissage automatique distribuée de 731 TPI et sur une tâche d'IA pour la science de 601 TPI.

Il est important de noter que Faraday, bien que ne possédant que 27 milliards de paramètres, peut piloter un modèle de 5 000 milliards de paramètres, ce qui représente une amélioration significative des performances par rapport à l'utilisation de ce modèle plus volumineux seul. L'analyse qualitative d'une exécution unique montre que Faraday adopte une approche plus rigoureuse sur le plan scientifique.

Les résultats de recherche connexes, intitulés « Former les scientifiques en IA à reproduire la recherche », ont été publiés en prépublication sur arXiv.

Points saillants de la recherche :

* Cette étude a construit un espace de tâches généré automatiquement contenant 310 tâches de reproduction de graphes à partir de 100 articles de Machine Learning and AI for Science, couvrant la période de 1990 à 2026.

Cette étude propose une méthode de post-formation GRPO stable, adaptée aux tâches non vérifiables de longue durée. Cette méthode comprend un évaluateur de critères d'évaluation pour chaque tâche, l'agrégation des résultats d'évaluation de plusieurs échantillons et un mécanisme d'attribution de crédits à chaque tour.

Cette étude a entraîné un agent doté de 27 milliards de paramètres capable d'utiliser des agents de codage comme outils (CAT). Des expériences, tant quantitatives que qualitatives, démontrent que Faraday fait preuve d'une plus grande rigueur scientifique.

image

Adresse du document :
https://hyper.ai/papers/2608.13331

Créer une réplique d'espace de tâches générée automatiquement

Pour entraîner Faraday, les chercheurs ont construit un espace de tâches évolutif appelé Replica. L'espace de tâches Replica se compose de 242 tâches d'entraînement et de 68 tâches de test, tirées de 100 articles bien connus sur l'apprentissage automatique (ML) et l'IA pour la science.Chaque tâche exige de l'agent qu'il reproduise une figure résultante de l'article. L'agent peut obtenir l'article original après masquage de la figure et dispose d'un temps limité à 60 minutes, tout en n'utilisant qu'une tranche de 1/7 MIG d'un GPU H200.

image

Le système fournit à l'agent un environnement conteneurisé, préchargé de bibliothèques de recherche utiles, et lui offre un accès internet, des invites système et des instructions pour les tâches à accomplir. Si une expérience décrite dans l'article ne peut être menée à terme dans le temps imparti, les invites indiqueront à l'agent comment la reproduire aussi fidèlement que possible avant de la finaliser.

* Les tâches d'entraînement sont tirées d'articles sur l'apprentissage automatique publiés entre 1990 et 2026.

* Les tâches de test sont tirées d'articles d'IA pour la science publiés entre 2012 et 2026.

Il est important de noter que ces tâches sont toutes générées automatiquement, ce qui confère à l'ensemble de l'espace de tâches une excellente évolutivité. Pour un article donné, le système le transforme en une tâche grâce à trois étapes de traitement visuel du langage, toutes pilotées par Gemini 2.5 Pro : premièrement, l'étape de numérisation identifie toutes les figures et leurs légendes dans le texte ; deuxièmement, l'étape de localisation détermine les cadres de délimitation des figures dans la boucle de réparation du validateur LLM ; enfin, la figure est masquée de manière irréversible dans le PDF. Une tâche complète se compose de trois parties : la légende, la figure originale extraite (« figure de référence ») et l'article dont la figure a été masquée.

L'équipe de recherche vérifie manuellement chaque tâche et élimine celles de moindre qualité, comme celles dont la couverture graphique est insuffisante, celles qui ne correspondent pas aux graphiques de résultats ou celles dont les légendes sont incorrectes.Chaque article contribue à 1 à 13 tâches, avec une médiane de 2 tâches.

Une méthode GRPO stable post-formation adaptée aux tâches non vérifiables à long terme

Cadre d'agent simple

Agent Harness fournit une interface entre les grands modèles de langage (LLM, où l'entrée et la sortie sont des jetons) et l'environnement (actions d'entrée/états de sortie) :

* Capacités et contexte disponibles

L'agent exécute des opérations via cinq appels de fonction : `apply_patch`, `read_file`, `list_dir`, `grep_files` et `shell`. Faraday peut utiliser l'outil shell pour détacher les processus d'arrière-plan de la session courante, ce qui lui permet d'exécuter plusieurs séries d'opérations tout en lançant plusieurs commandes en parallèle. Les appels d'outils au sein d'une même série sont exécutés simultanément et leurs résultats sont ajoutés à l'historique dans l'ordre de leur appel. L'exécution s'interrompt en cas de dépassement de capacité du contexte, de dépassement de la limite de 16 000 jetons par série ou d'erreur d'inférence ; même les exécutions incomplètes sont évaluées comme les autres. Sinon, l'exécution s'interrompt lorsque Faraday répond directement sans appeler d'outils, ou lorsque la limite de temps d'exécution spécifiée est atteinte.

* Utilisation d'agents programmables comme outils (CAT)

Faraday est équipé d'un agent de programmation de pointe qu'il utilise comme outil. Un script d'interface exécute l'interface de ligne de commande Codex (CLI) de manière non interactive. Faraday peut invoquer ce script via un outil shell et obtenir un journal des commandes, des sorties et des messages de l'agent de programmation, incluant le temps d'exécution de chaque étape. Par défaut, les appels suivants reprennent l'état de la session précédente de l'agent de programmation ; toutefois, Faraday peut également réinitialiser le contexte ou exécuter plusieurs agents de programmation en parallèle. Le script d'interface impose une limite de temps, configurable individuellement par Faraday pour chaque requête. En cas de dépassement de cette limite, un journal partiel des interactions est renvoyé. Le modèle utilisé par l'agent de programmation est un paramètre d'exécution : GPT-5.4 mini est utilisé pour la majeure partie de l'entraînement ; GPT-5.5 est utilisé lors de la phase finale et de l'évaluation.

Programme post-formation

Pour obtenir l'agent Faraday, les chercheurs ont post-entraîné Qwen3.6-27B dans le cadre de l'agent Faraday, en utilisant une GRPO modifiée basée sur l'espace de tâches Replica. Ils ont employé un ajustement fin LoRA avec un rang de 128 (k = 128) ; l'adaptateur a été entraîné sur toutes les couches de projection linéaire à l'aide d'une fenêtre de contexte de 128 000 jetons et d'un taux d'apprentissage fixe de 6 × 10⁻⁶. Chaque étape de l'optimiseur Adam consistait à tirer un lot de 10 tâches d'une partition de l'ensemble d'entraînement Replica contenant 242 tâches, chaque tâche correspondant à 8 exécutions.

La méthode d'échantillonnage des tâches garantit que chaque lot couvre uniformément toute la période d'années du corpus ; en même temps, chaque époque d'entraînement accède à chaque tâche exactement une fois, évitant ainsi la domination des données d'une période scientifique particulière dans une certaine mise à jour des paramètres.

stabilité de l'entraînement à long terme

Le post-entraînement exige un apprentissage par renforcement à long terme dans un domaine non vérifiable, un contexte connu pour être sujet à l'instabilité de l'entraînement et même à l'effondrement du modèle. Deux facteurs contribuent à cette instabilité : la forte variance du signal de récompense et l'attribution uniforme du crédit. Pour remédier à ce problème, les chercheurs ont apporté deux modifications à l'évaluateur durant la phase d'entraînement.

Premièrement, le système utilise la moyenne de trois évaluations indépendantes pour calculer la récompense lors du déploiement. Deuxièmement, il exige du juge qu'il attribue des pondérations tour par tour afin de créditer chaque cycle d'opérations durant le déploiement. Ainsi, le crédit peut être réalloué au sein d'un même déploiement sans modifier l'ampleur globale des mises à jour des paramètres.

Faraday est plus rigoureux tant sur le plan qualitatif que quantitatif de la recherche scientifique.

Avant d'évaluer les capacités de Faraday, les résultats expérimentaux ont d'abord vérifié que la tâche Replica elle-même était suffisamment complexe.Claude Opus 4.8 est l'un des modèles de base les plus performants de l'étude, mais aucun des principaux agents de codage, y compris Claude et GPT-5.5, n'a atteint la saturation sur les tâches de réplication.L'étude a également révélé que plus la date de publication d'un article est récente, plus sa reproduction est difficile ; les articles d'IA pour la science sont généralement plus difficiles à reproduire que les articles d'apprentissage automatique traditionnels. L'équipe de recherche suppose que cela pourrait être lié à la plus faible densité d'informations des articles récents dans les données de pré-entraînement du modèle, et aussi au fait que les recherches récentes nécessitent généralement des ressources de calcul plus importantes, ce qui rend plus difficile une réduction d'échelle raisonnable.

La capacité de Faraday à reproduire le papier est supérieure à celle de Claude et du Codex.

Les chercheurs ont comparé Faraday avec divers modèles de référence sur l'ensemble de la distribution des tâches Replica (voir figure ci-dessous).Les performances de Faraday sont globalement améliorées par rapport au modèle Qwen de base, tant pour les tâches d'entraînement que pour les tests.Dans les tâches distribuées, Faraday surpasse Claude et Codex dans 731 tâches TP3T ; dans les tâches hors distribution, Faraday surpasse Claude et Codex dans 601 tâches TP3T.

L'article de Faraday démontre une reproductibilité supérieure par rapport aux agents intelligents de programmation de pointe.

Une décomposition plus poussée du score total du juge en différentes sous-dimensions révèle que…Faraday a surpassé le modèle de référence en termes de profondeur expérimentale, de reproductibilité des assertions et de fidélité visuelle, tout en obtenant des résultats comparables à ceux de Claude en matière d'intégrité scientifique et de fidélité de réalisation.(Voir l'image ci-dessous).

Les points forts de Faraday résident principalement dans la profondeur de ses expériences et la reproductibilité de ses conclusions scientifiques.

Pour déterminer si les avantages de Faraday peuvent être obtenus uniquement par l'optimisation des mots-clés, les chercheurs ont effectué 24 itérations d'optimisation automatique des mots-clés sur le modèle de base Codex, en comparant les mots-clés finaux avec ceux des modèles Codex et Faraday originaux. Les résultats sont présentés dans la figure ci-dessous :

Pour toutes les tâches, que ce soit en utilisant les invites de base par défaut ou les invites obtenues grâce à un cycle d'optimisation contextuelle sur l'ensemble d'entraînement, le score moyen de Faraday était supérieur à celui de Codex.

Les suggestions de mots optimisées n'ont pas permis d'améliorer significativement les performances, l'écart avec Faraday persiste donc.Les invites optimisées ont permis d'identifier les schémas de défaillance spécifiques dans les résultats, mais elles n'ont pas résolu ces problèmes : l'amélioration des performances apportée par la post-formation ne semble pas être obtenue uniquement par l'ingénierie des invites.

Faraday a démontré des capacités de recherche plus rigoureuses au niveau qualitatif.

Pour comprendre les améliorations spécifiques apportées par Faraday par rapport aux modèles de référence Claude et Codex, les chercheurs ont analysé manuellement certains résultats, en se concentrant sur les cas où les scores de Faraday dépassaient significativement les meilleurs scores de Claude et Codex. Le tableau ci-dessous présente quelques exemples représentatifs :

Le comportement de Faraday ressemble davantage à celui d'un chercheur scientifique rigoureux.

Deux tendances se sont dégagées de l'analyse : premièrement, le modèle de Faraday parvient à reproduire fidèlement le mécanisme que l'expérience cherche à tester, tandis que le modèle de référence intègre souvent directement et en dur le résultat attendu ou recourt à une approche trop simplifiée, ne parvenant ainsi pas à reproduire les principales conclusions correspondant aux graphiques ; deuxièmement, le modèle de Faraday est plus complet en termes de portée expérimentale, capable de reproduire une plus grande partie du contenu de l'expérience originale, tout en évitant les suppressions inutiles.

Capacité de généralisation des « réplications imaginées »

Les chercheurs ont ensuite évalué la capacité de généralisation de Faraday pour la reproduction « imaginaire » (comme illustré dans la figure ci-dessous). Ils ont demandé à Claude Opus 4.8 de sélectionner aléatoirement cinq articles dans les ensembles d'entraînement et de test de Replica, en générant deux variantes pour chaque article, puis ont évalué les performances de Faraday et de Codex GPT-5.5 sur ces tâches.

image
Pour 20 variations de tâches contrefactuelles réparties sur 10 articles, Faraday a surpassé les autres modèles en termes de scores moyens sur presque toutes les tâches en 8 essais.

Sur 19 des 20 tâches, les juges ont préféré les résultats de Faraday à ceux de Codex. Dans une certaine mesure, Faraday a non seulement démontré une meilleure reproductibilité que les modèles les plus performants, mais a également fait preuve de capacités d'innovation supérieures.Toutefois, les chercheurs ont également souligné avec prudence que leur échelle d'évaluation n'avait jamais été validée pour les tâches « imaginatives », de sorte que cette conclusion nécessite encore une vérification plus approfondie dans de futures recherches.

Conclusion

Si les chercheurs en IA du passé s'apparentaient davantage à des ingénieurs capables de mener des expériences, le paradigme CAT de Faraday vise à doter l'IA du jugement scientifique nécessaire pour savoir quelle action entreprendre. Les capacités à déterminer une orientation de recherche, à définir de manière pertinente la portée des expériences et à évaluer la fiabilité des résultats reproductibles – une fois intégrées à la couche externe de l'agent intelligent – peuvent être continuellement amplifiées grâce aux mises à jour des modèles sous-jacents de pointe.

Plus important encore, ce paradigme offre de nouvelles perspectives sur le développement et la sécurité des capacités d'IA : il permet à un modèle relativement simple de gérer les jugements scientifiques, tandis qu'un modèle plus puissant se charge de l'exécution technique. À l'avenir, la compétition entre les chercheurs en IA ne portera peut-être plus uniquement sur la taille des paramètres du modèle, mais s'orientera vers l'amélioration des jugements scientifiques, l'utilisation des outils et les capacités de collaboration homme-machine.

Références :

https://arxiv.org/abs/2608.13331