HyperAIHyperAI

Command Palette

Search for a command to run...

米国のアルゴンヌ国立研究所は、計算化学分野における薬剤の価値を評価するために13のベンチマークテストを用いるChemGraphを提案した。

Featured Image

近年、人工知能の急速な発展、特に大規模言語モデル(LLM)の進歩は、自動化された科学研究に新たな可能性を切り開いた。すでに、ユーザーが様々な化学関連のタスクを完了するのを支援するために、LLM(法線言語モデル)に基づくエージェントがいくつか開発されている。例えば、Branらは、さまざまな分子の化学合成タスクを実行できる大規模言語モデル駆動型の化学エージェントであるChemCrowを開発しました。McNaughtonらは、分子特性予測、類似性検索、薬剤類似性評価などのタスクを研究者が完了するのに役立つ、ケモインフォマティクスツールを統合した大規模言語モデルエージェントであるCACTUSを開発しました。Whiteらは、分子動力学(MD)ワークフローを実行できるLLMエージェントアシスタントであるMDCrowを提案しました。
この文脈では、アメリカのアルゴンヌ国立研究所の研究チームは、大規模な言語モデルによって駆動されるインテリジェントエージェントシステムであるChemGraphを提案した。これは、計算化学分野における分子シミュレーションのワークフローを実行するために設計されています。
研究者らは、13のベンチマークタスクでChemGraphを評価した。その結果、少数のツールしか必要としない単純なタスクでは、小型の大規模言語モデル(GPT-4o-miniやClaude-3.5-haikuなど)が高い精度と安定性を達成できることがわかった。しかし、タスクの複雑さが増すにつれて、これらのモデルのパフォーマンスは著しく低下したが、大規模モデル(GPT-4o)は高いパフォーマンスを維持した。複雑なタスクをより小さく管理しやすいサブタスクに戦略的に分割することで、より小型のモデルであっても、ChemGraphのパフォーマンスはGPT-4oと同等、場合によってはそれを上回るまで向上させることができた。
関連する研究成果は、「計算化学ワークフローのためのエージェント型フレームワークとしてのChemGraph」と題され、Nature誌のサブジャーナルであるCommunications Chemistryに掲載された。

研究のハイライト:

ChemGraphは、グラフニューラルネットワークベースのモデルを活用して正確かつ効率的な計算を実現すると同時に、LLMの自然言語理解、タスク計画、科学的推論機能を組み合わせることで、直感的でインタラクティブなユーザーインターフェースを提供します。

ChemGraphは、SMILES文字列や分子構造の生成から、幾何構造の最適化、振動解析、熱化学計算まで、幅広いタスクを実行できます。

ChemGraphは、半経験的手法、機械学習ポテンシャル関数、密度汎関数理論(DFT)など、さまざまな分子シミュレーション手法の利用をユーザーにサポートします。

用紙のアドレス:

https://www.nature.com/articles/s42004-025-01776-9

13のベンチマーク実験により、計算化学におけるインテリジェントエージェントの評価システムが確立される。

エージェントの評価に関するベンチマークフレームワークは既にいくつか存在するものの、計算化学の分野におけるエージェント評価のための統一されたベンチマークはまだ存在しない。そこで、研究者らはChemGraphの性能を評価するために13種類のベンチマーク実験を設計した。これらの実験は、単一ツール呼び出しとツールチェーン呼び出しを含む、6つの統合ツールを使用してChemGraphがタスクを実行する能力をテストすることを目的としています。
ユーザー入力の種類に基づいて、これらのタスクは(1)分子名、(2)SMILES文字列、(3)化学反応の3つのカテゴリに分類されました。以下の表は、13の実験で実施された360の独立した評価をまとめたものです。

*ChemGraphの評価に使用したベンチマーク実験の概要表*

最初の11回の実験では、タスクは主に分子名またはSMILES文字列に関するもので、各タスクに必要なツール呼び出しは最大4回、またはサブタスクは最大4回でした。一方、最後の2回の実験では、化学反応の熱化学的特性の計算に焦点を当て、複雑さが大幅に増し、反応物と生成物の数に応じて9回から12回のツール呼び出しが必要となりました。これらのタスクでは、各物質について個別に熱化学計算を実行し、さらに以前に得られた結果に基づいて反応レベルの特性を構築する必要がありました。

ChemGraphは、大規模言語モデルによって駆動されるインテリジェントエージェントフレームワークです。

ChemGraphは、大規模な言語モデルを基盤とするインテリジェントエージェントフレームワークであり、構造化されたツール呼び出しと推論機能を通じて分子シミュレーションワークフローを自動化するように設計されています。LangGraphをベースとし、ReActフレームワークに準拠しています。

LangGraphは、より堅牢なマルチエージェント連携を実現するために設計されたグラフベースの実行モデルを導入しています。典型的なLangGraphワークフローは、次の3つの部分から構成されます。

  • 状態とは、システムの現在の状態を表す共有データ構造のことです。
  • ノードノードとは、エージェントのロジックを定義するPython関数です。現在の状態を入力として受け取り、更新された状態を返します。ノードは、大規模な言語モデルでも、特定の操作を実行する関数でも構いません。
  • エッジエッジとは、メッセージの流れを制御し、次にどのノードを実行するかを決定する機能です。エッジは、有向エッジと条件付きエッジに分類できます。有向エッジは、あるノードから別のノードへのメッセージの固定された一方向伝送を表します。一方、条件付きエッジは、特定の条件に基づいてメッセージを異なるノードに流すことができるため、より柔軟性があります。

以下の図は、ChemGraphの一般的な構造を示しています。まず、大規模言語モデルエージェントは、定義済みのツールセットを受け取ります。エージェントは、ユーザーのプロンプトに基づいて、どのツールを呼び出すかを決定します。各ツールの呼び出し後、大規模言語モデルは結果を受け取り、別のツールの呼び出しが必要かどうかを判断します。すべてのツールの呼び出しが完了すると、メッセージは2つの経路のいずれかに沿って配信され続けます。

*ChemGraphの概要*

最初のパスでは、ChemGraphは従来の大規模言語モデルと同様に、ツール呼び出しの結果を含む人間が理解しやすい応答を返します。2番目のモードでは、メッセージは別の大規模言語モデルエージェントに転送され、ユーザーのリクエストに応じて構造化された出力(事前定義されたJSON形式)を直接生成します。このデュアルモード設計により、自然言語による対話と体系的な評価の両方がサポートされ、ChemGraphは一般的なユースケースと評価ワークフローの両方に対応できます。

以下の図は、ChemGraphがどのようにツールを呼び出し、それらの出力を調整して計算化学タスクを実行するかをさらに詳しく説明しています。

*GPT-4o-miniを使用してreact2enthalpyタスクを実行する際の、人間とChemGraph(単一エージェント)の相互作用の例* 

この例では、ユーザーはChemGraphに対し、GFN2-xTB法を用いて400Kにおけるメタン燃焼反応のエンタルピーを計算するよう要求します。ChemGraph(GPT-4o-miniを搭載)はまず、反応に関与する各分子の化学名をSMILES文字列に変換します(ツール呼び出し1~4)。次に、これらのSMILES文字列に基づいて、AtomsDataデータ構造に原子座標を生成します(ツール呼び出し5~8)。最後に、ChemGraphは生成された原子座標とユーザーが指定したパラメータ(計算機の種類、温度など)を用いて熱力学的計算を実行します。

マルチエージェントアーキテクチャは、モデルのパフォーマンスを大幅に向上させることができる。

研究チームは、13種類のベンチマークテストを通して、複雑さの異なる計算化学タスクにおけるChemGraphの性能を体系的に評価した。

単剤評価

まず、研究者らは、GPT-4o-mini、Claude-3.5-haiku、Qwen-2.5-14Bという3つの大規模言語モデルを用いて、13の実験タスクにおけるシングルエージェントChemGraphの性能を評価した。GPT-4oについては、最後の2つの問題(react2enthalpyとreact2gibbs)における性能のみを評価した。次の図は、異なるタスクにおける各モデルの精度を示している。

*単剤ChemGraphの精度ヒートマップ* 

存在する name2smiタスク真ん中—Claude-3.5-haikuは、molecule_name_to_smilesツールを一貫して呼び出しませんでした。代わりに、内部の化学知識を使用してSMILES文字列を手動で構築しようとしたり、ツールをまったく使用しなかったりすることがありました。その結果、Claude-3.5-haikuは、このタスクの3つのモデルの中で、分子あたりの平均ツール呼び出し回数が最も少なくなりました。GPT-4o-miniは、実験を正確に完了し、正しい答えを生成することができました。Qwen-2.5-14Bは、正しいツール名とパラメータを含む正確なツール呼び出しを概ね生成できましたが、エラーは主にツール出力からの結果の抽出中に発生しました。

存在する name2xyz、name2opt、およびname2vibタスク真ん中大規模な言語モデルには、ツールを正確に呼び出すだけでなく、正しく構造化された出力結果を生成することが求められます。GPT-4o-miniとClaude-3.5-haikuはどちらもこの点で優れた性能を発揮し、83%を超える精度を達成しました。

存在する smi2xyz から smi2file への変換タスク真ん中—Claude-3.5-haikuとGPT-4o-miniは、どちらも83%を超える精度を達成し、強力かつ安定したパフォーマンスを維持しました。Qwen-2.5-14Bもこのタスクセットでパフォーマンスが向上し、最低精度は77%でした。

存在する 反応エンタルピーと反応ギブズ タスク真ん中—Qwen-2.5-14Bは最も性能が悪く、精度は20%を下回りました。GPT-4o-miniは中程度の結果で、精度はそれぞれ40%と49%でした。Claude-3.5-haikuは他の小規模大規模言語モデルを上回り、精度はそれぞれ67%と69%でした。GPT-4oは最高の性能を達成し、両方のタスクで平均精度が83%を超えました。

マルチエージェント評価

研究者らはさらに、GPT-4o-mini、Claude-3.5-haiku、Qwen-2.5-14B、およびGPT-4oを使用してマルチエージェントChemGraphの性能を評価し(下図参照)、その結果をシングルエージェントの性能と比較した。

*異なる大規模言語モデルを使用した場合の、react2enthalpyおよびreact2gibbsタスクにおけるChemGraphの平均精度*

結果は次のようになります。マルチエージェントシステムは、さまざまなモデルの精度を大幅に向上させる。react2enthalpyタスクでは、GPT-4o-miniの精度が401 TP3Tから871 TP3Tに向上し、Claude-3.5-haikuの精度も671 TP3Tから871 TP3Tに向上しました。どちらの結果も、3回の独立した実行の平均です。注目すべきは、どちらのモデルも、シングルエージェントGPT-4oのベースライン性能である831 TP3Tを上回ったことです。最後のタスクであるreact2gibbsでも同様の傾向が見られました。GPT-4o-miniの精度は491 TP3Tから871 TP3Tに向上し、Claude-3.5-haikuの精度は691 TP3Tから931 TP3Tに向上しました。対照的に、Qwen-2.5-14Bは、ツール呼び出しエラーが頻繁に発生したため、集約エージェントが正確な回答を生成する能力が制限され、改善は限定的でした。

最終的に、マルチエージェントモードでは、GPT-4oは完璧な精度を達成し、2つのタスク(react2enthalpyとreact2gibbs)を100%の成功率で完了しました。

最後に書きます

ChemGraphは、計算化学および材料科学向けの大規模言語モデルインテリジェントエージェントシステムであり、科学研究ワークフローの自動化におけるAIの可能性を示しています。研究チームは、より多くのツールを統合し、エージェントアーキテクチャを最適化し、高性能コンピューティングサポートを強化することで、大規模シミュレーションタスクにおけるChemGraphの応用機能をさらに拡張していくと述べています。同時に、このシステムはDockerコンテナを利用して運用上のセキュリティを確保し、エージェントの信頼性を継続的に向上させています。

ChemGraphは従来の計算化学ソフトウェアに取って代わるものではなく、自然言語による対話を通じて研究者とシミュレーションツールを結びつけるインテリジェントなコラボレーションレイヤーとして機能することに留意することが重要です。大規模なオープンソースモデルの開発に伴い、ChemGraphはAI研究アプリケーションのコスト削減にも貢献し、材料発見や分子設計といった分野でインテリジェントな科学エージェントがより大きな役割を果たすことを可能にすると期待されています。

参考文献:

https://phys.org/news/2026-07-ai-framework-battery-combustion-materials.html

https://www.nature.com/articles/s42004-025-01776-9