RLE-Bench évalue les agents IA ingénieurs de robots
Une équipe de chercheurs d’Harvard et de Georgia Tech a mis au point RLE-Bench, une plateforme d’évaluation ouverte destinée à mesurer les capacités des agents de codage autonomes à concevoir et faire fonctionner des robots physiques. Dirigée par Na Li d’Harvard et Bo Dai de Georgia Tech, l’équipe inclut également les chercheurs Haitong Ma, Chenxiao Gao et Rushi Qiang. L’initiative répond à un besoin croissant dans le domaine de l’intelligence artificielle, où les systèmes de génération de code progressent rapidement, mais peinent souvent à intégrer les contraintes du monde réel. RLE-Bench se présente comme un examen standardisé pour ce que les chercheurs appellent les ingénieurs d’apprentissage robotique. Le benchmark propose quarante-huit tâches répartis en quatre catégories : le contrôle interactif, le développement de politiques de décision, la perception et l’estimation, ainsi que la conception mécanique. L’objectif dépasse la simple production de code. Il s’agit d’évaluer si un système d’IA peut raisonner sur la stabilité, la dynamique, les contraintes matérielles et l’interaction entre les logiciels et l’environnement physique. Les exercices s’exécutent dans des environnements simulés, mais intègrent des lois physiques réelles. Un agent peut ainsi réussir à générer un algorithme de navigation qui semble optimal numériquement, mais échouer dès qu’une charge réelle est ajoutée au système. Dans une tâche illustrative, un agent doit concevoir une base mobile universelle pour plusieurs bras robotiques. Le design initial permet de toucher toutes les cibles, mais provoque le renversement du robot lors des tests de stabilité, révélant un manque de raisonnement physique. Selon les chercheurs, les benchmarks existants en robotique se concentrent généralement sur l’évaluation de politiques de contrôle ou d’apprentissage. RLE-Bench élargit cette perspective en couvrant l’ensemble du processus d’ingénierie. La standardisation des tests permet aux équipes de comparer différents systèmes dans des conditions identiques et d’identifier précisément les lacunes technologiques actuelles. La plateforme est entièrement open-source et accessible publiquement, invitant la communauté scientifique et les praticiens du secteur à y ajouter de nouvelles tâches. Les chercheurs considèrent cette première version comme un socle évolutif. Les prochaines versions viseront à intégrer des défis plus complexes tels que l’intégration système, le débogage, la sécurité et le déploiement sur le terrain. Cette démarche s’inscrit dans une volonté de bâtir un référentiel commun pour mesurer objectivement la capacité des intelligences artificielles à assister les ingénieurs dans la conception de robots autonomes.