Command Palette
Search for a command to run...
Le Laboratoire National d'Argonne Aux États-Unis a Proposé ChemGraph, Qui Utilise 13 Tests De Référence Pour Évaluer La Valeur Des Agents Dans Le Domaine De La Chimie computationnelle.

Ces dernières années, le développement rapide de l'intelligence artificielle, et notamment les progrès des grands modèles de langage (LLM), a ouvert de nouvelles possibilités pour la recherche scientifique automatisée.**Plusieurs agents basés sur la technologie LLM ont déjà été développés pour aider les utilisateurs à accomplir diverses tâches liées à la chimie.**Par exemple, Bran et al. ont développé ChemCrow, un agent chimique piloté par un modèle de langage étendu, capable d'effectuer des tâches de synthèse chimique pour une variété de molécules ; McNaughton et al. ont développé CACTUS, un agent basé sur un modèle de langage étendu qui intègre des outils de chimioinformatique, pouvant aider les chercheurs à réaliser des tâches telles que la prédiction des propriétés moléculaires, la recherche de similarités et l'évaluation de la similarité des médicaments ; White et ses collègues ont proposé MDCrow, un assistant d'agent LLM capable d'effectuer des flux de travail de dynamique moléculaire (DM).
Dans ce contexte,**Une équipe de recherche du Laboratoire national d'Argonne aux États-Unis a proposé ChemGraph, un système d'agents intelligents piloté par un modèle de langage de grande taille.**Il est conçu pour réaliser des flux de travail de simulation moléculaire dans le domaine de la chimie computationnelle.
Des chercheurs ont évalué ChemGraph sur 13 tâches de référence. Les résultats ont montré que pour les tâches simples ne nécessitant que quelques outils, les modèles de langage de grande taille et de petite taille (tels que GPT-4o-mini et Claude-3.5-haiku) atteignaient une précision et une stabilité élevées. Cependant, à mesure que la complexité de la tâche augmentait, les performances de ces modèles diminuaient significativement, tandis que le modèle de grande taille (GPT-4o) conservait d'excellentes performances. En décomposant stratégiquement les tâches complexes en sous-tâches plus petites et plus faciles à gérer, même avec des modèles plus petits, les performances de ChemGraph pouvaient être améliorées pour égaler, voire surpasser dans certains cas, celles de GPT-4o.
Les résultats de cette recherche, intitulée « ChemGraph comme cadre agentique pour les flux de travail de chimie computationnelle », ont été publiés dans la revue Communications Chemistry, une sous-revue de Nature.
Points saillants de la recherche :
ChemGraph exploite des modèles basés sur des réseaux neuronaux graphiques pour obtenir des calculs précis et efficaces, tout en combinant les capacités de compréhension du langage naturel, de planification des tâches et de raisonnement scientifique de LLM, offrant ainsi une interface utilisateur intuitive et interactive.
ChemGraph peut effectuer diverses tâches, allant de la génération de chaînes SMILES et de structures moléculaires à l'optimisation géométrique, l'analyse vibrationnelle et les calculs thermochimiques.
ChemGraph aide les utilisateurs à utiliser diverses méthodes de simulation moléculaire, notamment des méthodes semi-empiriques, des fonctions potentielles d'apprentissage automatique et la théorie de la fonctionnelle de la densité (DFT).
Adresse du document :
https://www.nature.com/articles/s42004-025-01776-9
Treize expériences de référence établissent un système d'évaluation pour les agents intelligents de chimie computationnelle.
**Bien que certains cadres de référence pour les agents existent déjà, il n'existe toujours pas de référence unifiée pour l'évaluation des agents dans le domaine de la chimie computationnelle. C'est pourquoi les chercheurs ont conçu 13 expériences de référence afin d'évaluer les capacités de ChemGraph.**Ces expériences visent à tester la capacité de ChemGraph à accomplir des tâches à l'aide de six outils intégrés, y compris des appels d'outils individuels et des appels de chaînes d'outils.
En fonction des différents types de données saisies par l'utilisateur, ces tâches ont été réparties en trois catégories : (1) nom moléculaire ; (2) chaîne SMILES ; (3) réaction chimique. Le tableau ci-dessous récapitule 360 évaluations indépendantes réalisées dans le cadre de 13 expériences.

ChemGraph, un cadre d'agents intelligents piloté par un modèle de langage de grande taille
ChemGraph est un framework d'agents intelligents piloté par un modèle de langage étendu, conçu pour automatiser les flux de travail de simulation moléculaire grâce à des appels d'outils structurés et des capacités de raisonnement. Il est basé sur LangGraph et utilise le framework ReAct.
LangGraph introduit un modèle d'exécution basé sur les graphes, conçu pour une collaboration multi-agents plus robuste. Un flux de travail LangGraph typique se compose de trois parties :
- ÉtatL'état est une structure de données partagée qui représente l'état actuel d'un système.
- NœudsUn nœud est une fonction Python qui définit la logique d'un agent. Il prend l'état actuel en entrée et renvoie l'état mis à jour. Un nœud peut être un modèle de langage complexe ou une fonction qui effectue une opération spécifique.
- BordsUne arête est une fonction qui contrôle le flux des messages, déterminant quel nœud exécuter ensuite. On distingue deux types d'arêtes : les arêtes dirigées et les arêtes conditionnelles. Les arêtes dirigées représentent une transmission unidirectionnelle et fixe des messages d'un nœud à un autre ; les arêtes conditionnelles, quant à elles, offrent une plus grande flexibilité, permettant aux messages d'être acheminés vers différents nœuds en fonction de conditions spécifiques.
Le schéma ci-dessous illustre la structure générale de ChemGraph : tout d’abord, l’agent, basé sur un modèle de langage complexe, reçoit un ensemble d’outils prédéfinis. En fonction des instructions de l’utilisateur, l’agent choisit l’outil à utiliser. Après chaque utilisation, le modèle de langage reçoit le résultat et détermine si une autre utilisation est nécessaire. Une fois toutes les utilisations terminées, le message peut être acheminé par l’un des deux chemins possibles.

Le diagramme suivant illustre plus en détail comment ChemGraph invoque des outils et coordonne leurs résultats pour accomplir des tâches de chimie computationnelle :

L'architecture multi-agents peut améliorer considérablement les performances du modèle.
L'équipe de recherche a évalué systématiquement les performances de ChemGraph sur des tâches de chimie computationnelle de complexité variable à travers 13 tests de référence :
Évaluation d'un agent unique
Dans un premier temps, les chercheurs ont évalué les performances de l'agent unique ChemGraph sur 13 tâches expérimentales à l'aide de trois grands modèles de langage : GPT-4o-mini, Claude-3.5-haiku et Qwen-2.5-14B. Concernant GPT-4o, seules ses performances sur les deux derniers problèmes (react2enthalpy et react2gibbs) ont été évaluées. La figure suivante illustre la précision des différents modèles sur les différentes tâches :

existerLes tâches name2xyz, name2opt et name2vibmilieu—Il est nécessaire que les grands modèles de langage invoquent les outils avec précision et génèrent des résultats corrects et structurés. GPT-4o-mini et Claude-3.5-haiku ont tous deux obtenu de bons résultats à cet égard, avec une précision supérieure à 83%.
existertâche smi2xyz vers smi2filemilieu—Claude-3.5-haiku et GPT-4o-mini ont maintenu des performances solides et stables, atteignant tous deux une précision supérieure à 83% ; Qwen-2.5-14B a également montré des performances améliorées dans cet ensemble de tâches, avec une précision minimale de 77%.
existerreact2enthalpy et react2gibbsTâche****milieu—Qwen-2.5-14B a obtenu les résultats les plus faibles, avec une précision inférieure à 20% ; GPT-4o-mini a obtenu des résultats modérés, avec des précisions respectives de 40% et 49% ; Claude-3.5-haiku a surpassé les autres modèles de langage à grande échelle de petite taille, atteignant des précisions respectives de 67% et 69% ; GPT-4o a obtenu les meilleures performances, avec une précision moyenne supérieure à 83% dans les deux tâches.
Évaluation multi-agents
Les chercheurs ont ensuite évalué les performances du ChemGraph multi-agent en utilisant GPT-4o-mini, Claude-3.5-haiku, Qwen-2.5-14B et GPT-4o (voir figure ci-dessous) et ont comparé les résultats avec les performances de l'agent unique.

Finalement, en mode multi-agents, GPT-4o a atteint une précision parfaite, accomplissant deux tâches (react2enthalpy et react2gibbs) avec un taux de réussite de 100%.
Derniers mots
ChemGraph, un système d'agents intelligents basé sur un modèle de langage étendu et dédié à la chimie computationnelle et à la science des matériaux, illustre le potentiel de l'IA pour automatiser les flux de travail de la recherche scientifique. L'équipe de recherche a annoncé son intention d'étendre les capacités d'application de ChemGraph aux simulations à grande échelle en intégrant davantage d'outils, en optimisant l'architecture de l'agent et en renforçant le support du calcul haute performance. Parallèlement, le système utilise des conteneurs Docker pour garantir la sécurité opérationnelle et améliorer en continu la fiabilité de l'agent.
Il est important de noter que ChemGraph ne remplace pas les logiciels de chimie computationnelle traditionnels, mais constitue plutôt une plateforme de collaboration intelligente reliant les chercheurs et les outils de simulation grâce à une interaction en langage naturel. Avec le développement de vastes modèles open source, ChemGraph devrait également réduire le coût des applications de recherche en IA et permettre aux agents scientifiques intelligents de jouer un rôle plus important dans des domaines tels que la découverte de matériaux et la conception moléculaire.
Références :
https://phys.org/news/2026\-07\-ai\-framework\-battery\-combustion\-materials.html











