HyperAIHyperAI

Command Palette

Search for a command to run...

미국 아르곤 국립 연구소는 전산 화학 분야에서 시약의 가치를 평가하기 위해 13가지 벤치마크 테스트를 사용하는 ChemGraph를 제안했습니다.

Featured Image

최근 인공지능의 급속한 발전, 특히 대규모 언어 모델(LLM)의 발전은 자동화된 과학 연구에 새로운 가능성을 열어주었습니다.이미 여러 LLM 기반 에이전트가 개발되어 사용자들이 다양한 화학 관련 작업을 완료하는 데 도움을 주고 있습니다.예를 들어, Bran et al.은 다양한 분자에 대한 화학 합성 작업을 수행할 수 있는 대규모 언어 모델 기반의 화학 에이전트인 ChemCrow를 개발했습니다. McNaughton et al.은 분자 속성 예측, 유사성 검색, 약물 유사성 평가와 같은 작업을 완료하는 데 도움이 되는 화학정보학 도구를 통합한 대규모 언어 모델 에이전트인 CACTUS를 개발했습니다. White와 동료들은 분자 동역학(MD) 워크플로우를 수행할 수 있는 LLM 에이전트 보조 도구인 MDCrow를 제안했습니다.
이러한 맥락에서,미국 아르곤 국립 연구소의 연구팀이 대규모 언어 모델을 기반으로 하는 지능형 에이전트 시스템인 ChemGraph를 제안했습니다.이 소프트웨어는 계산화학 분야에서 분자 시뮬레이션 워크플로우를 수행하도록 설계되었습니다.
연구진은 13개의 벤치마크 작업에서 ChemGraph를 평가했습니다. 그 결과, 몇 가지 도구만 필요한 간단한 작업에서는 GPT-4o-mini 및 Claude-3.5-haiku와 같은 소형 대형 언어 모델이 높은 정확도와 안정성을 보였습니다. 그러나 작업 복잡성이 증가함에 따라 이러한 모델의 성능은 크게 저하된 반면, 대형 모델(GPT-4o)은 우수한 성능을 유지했습니다. 복잡한 작업을 더 작고 관리하기 쉬운 하위 작업으로 전략적으로 분할하면, 소형 모델을 사용하더라도 ChemGraph의 성능을 GPT-4o와 동등하거나 경우에 따라 능가할 수 있었습니다.
"계산화학 워크플로우를 위한 에이전트 프레임워크로서의 ChemGraph"라는 제목의 관련 연구 결과는 Nature 하위 저널인 Communications Chemistry에 게재되었습니다.

연구 하이라이트:

ChemGraph는 그래프 신경망 기반 모델을 활용하여 정확하고 효율적인 계산을 수행하는 동시에 LLM의 자연어 이해, 작업 계획 및 과학적 추론 기능을 결합하여 직관적이고 상호작용적인 사용자 인터페이스를 제공합니다.

ChemGraph는 SMILES 문자열 및 분자 구조 생성부터 기하 최적화, 진동 분석 및 열화학 계산에 이르기까지 다양한 작업을 수행할 수 있습니다.

ChemGraph는 준경험적 방법, 머신러닝 기반 잠재 함수, 밀도 함수 이론(DFT)을 포함한 다양한 분자 시뮬레이션 방법을 사용자가 활용할 수 있도록 지원합니다.

서류 주소:

https://www.nature.com/articles/s42004-025-01776-9

13개의 벤치마크 실험을 통해 계산화학 지능형 에이전트의 평가 시스템을 구축했습니다.

에이전트 평가를 위한 몇 가지 벤치마크 프레임워크는 이미 존재하지만, 계산화학 분야에서 에이전트 평가를 위한 통합된 벤치마크는 아직 없습니다. 따라서 연구진은 ChemGraph의 기능을 평가하기 위해 13개의 벤치마크 실험을 설계했습니다.이 실험들은 단일 도구 호출 및 도구 체인 호출을 포함하여 6개의 통합 도구를 사용하여 ChemGraph가 작업을 수행할 수 있는 능력을 테스트하는 것을 목표로 합니다.
사용자 입력의 유형에 따라 이러한 작업은 (1) 분자 이름, (2) SMILES 문자열, (3) 화학 반응의 세 가지 범주로 나뉘었습니다. 아래 표는 13개의 실험에서 수행된 360개의 독립적인 평가를 요약한 것입니다.

*ChemGraph 평가에 사용된 벤치마크 실험 요약표*

처음 11개의 실험에서는 주로 분자 이름이나 SMILES 문자열과 관련된 작업이었으며, 각 작업은 최대 4개의 도구 호출 또는 4개의 하위 작업으로 구성되었습니다. 반면, 마지막 두 실험은 화학 반응의 열화학적 특성 계산에 초점을 맞추어 복잡성이 크게 증가했으며, 반응물과 생성물의 수에 따라 9~12개의 도구 호출이 필요했습니다. 이러한 작업에서는 각 물질에 대해 열화학적 계산을 개별적으로 수행하고, 이전에 얻은 결과를 바탕으로 반응 수준의 특성을 구축해야 했습니다.

ChemGraph는 대규모 언어 모델을 기반으로 하는 지능형 에이전트 프레임워크입니다.

ChemGraph는 대규모 언어 모델을 기반으로 하는 지능형 에이전트 프레임워크로, 구조화된 도구 호출 및 추론 기능을 통해 분자 시뮬레이션 워크플로우를 자동화하도록 설계되었습니다. LangGraph를 기반으로 하며 ReAct 프레임워크를 따릅니다.

LangGraph는 더욱 견고한 다중 에이전트 협업을 위해 설계된 그래프 기반 실행 모델을 도입했습니다. 일반적인 LangGraph 워크플로는 세 부분으로 구성됩니다.

  • 상태상태는 시스템의 현재 상태를 나타내는 공유 데이터 구조입니다.
  • 노드노드는 에이전트의 로직을 정의하는 파이썬 함수입니다. 현재 상태를 입력으로 받아 업데이트된 상태를 반환합니다. 노드는 대규모 언어 모델일 수도 있고 특정 작업을 수행하는 함수일 수도 있습니다.
  • 가장자리엣지는 메시지 흐름을 제어하는 함수로, 다음에 실행할 노드를 결정합니다. 엣지는 방향성 엣지와 조건부 엣지로 나눌 수 있는데, 방향성 엣지는 한 노드에서 다른 노드로 메시지가 고정된 단방향으로만 전송됨을 나타냅니다. 반면, 조건부 엣지는 특정 조건에 따라 메시지가 다른 노드로 흐를 수 있도록 더 큰 유연성을 제공합니다.

아래 다이어그램은 ChemGraph의 일반적인 구조를 보여줍니다. 먼저, 대규모 언어 모델 에이전트는 미리 정의된 도구 세트를 수신합니다. 에이전트는 사용자의 프롬프트에 따라 어떤 도구를 실행할지 결정합니다. 각 도구 실행 후, 대규모 언어 모델은 결과를 수신하고 추가 도구 실행이 필요한지 판단합니다. 모든 도구 실행이 완료되면 메시지는 두 가지 경로 중 하나를 통해 계속 전달될 수 있습니다.

*ChemGraph 개요*

첫 번째 방식에서 ChemGraph는 기존의 대규모 언어 모델과 유사하게 도구 호출 결과를 담은 사람이 이해하기 쉬운 응답을 반환합니다. 두 번째 방식에서는 메시지가 두 번째 대규모 언어 모델 에이전트로 전달되어 사용자의 요청에 따라 구조화된 출력(미리 정의된 JSON 형식)을 직접 생성합니다. 이러한 이중 모드 설계는 자연어 상호 작용과 체계적인 평가를 모두 지원하므로 ChemGraph는 일반적인 사용 사례와 평가 워크플로우를 모두 충족할 수 있습니다.

다음 다이어그램은 ChemGraph가 계산 화학 작업을 수행하기 위해 도구를 호출하고 그 출력을 조정하는 방식을 더욱 자세히 보여줍니다.

*GPT-4o-mini를 사용하여 react2enthalpy 작업을 수행할 때 사람과 ChemGraph(단일 에이전트) 간의 상호 작용 예시* 

이 예시에서 사용자는 ChemGraph에 GFN2-xTB 방법을 사용하여 400K에서 메탄 연소 반응의 엔탈피를 계산하도록 요청합니다. ChemGraph(GPT-4o-mini 탑재)는 먼저 반응에 참여하는 각 분자의 화학명을 SMILES 문자열로 변환합니다(도구 호출 1~4). 그런 다음, 이러한 SMILES 문자열을 기반으로 AtomsData 데이터 구조에 원자 좌표를 생성합니다(도구 호출 5~8). 마지막으로, ChemGraph는 생성된 원자 좌표와 사용자가 지정한 매개변수(계산기 유형, 온도 등)를 사용하여 열역학 계산을 수행합니다.

다중 에이전트 아키텍처는 모델 성능을 크게 향상시킬 수 있습니다.

연구팀은 13개의 벤치마크 과제를 통해 ChemGraph의 성능을 다양한 복잡성의 계산 화학 과제에서 체계적으로 평가했습니다.

단일 약제 평가

먼저 연구진은 GPT-4o-mini, Claude-3.5-haiku, Qwen-2.5-14B 등 세 가지 대형 언어 모델을 사용하여 13개의 실험 과제에서 단일 에이전트 ChemGraph의 성능을 평가했습니다. GPT-4o의 경우, 마지막 두 문제(react2enthalpy 및 react2gibbs)에 대한 성능만 평가했습니다. 다음 그림은 각 모델이 다양한 과제에서 보여준 정확도를 나타냅니다.

*단일 약제 ChemGraph의 정확도 히트맵* 

존재하다 name2smi 작업가운데—Claude-3.5-haiku는 molecule_name_to_smiles 도구를 일관되게 호출하지 않았습니다. 때로는 자체적인 화학 지식을 활용하여 SMILES 문자열을 수동으로 구성하려고 시도하거나, 아예 도구를 사용하지 않는 경우도 있었습니다. 그 결과, Claude-3.5-haiku는 이 과제에서 세 모델 중 분자당 평균 도구 호출 횟수가 가장 낮았습니다. GPT-4o-mini는 실험을 정확하게 완료하고 정답을 도출했습니다. Qwen-2.5-14B는 일반적으로 정확한 도구 호출(올바른 도구 이름과 매개변수 포함)을 수행했지만, 오류는 주로 도구 출력에서 결과를 추출하는 과정에서 발생했습니다.

존재하다 name2xyz, name2opt 및 name2vib 작업가운데대규모 언어 모델은 도구를 정확하게 호출할 뿐만 아니라 올바르고 구조화된 출력 결과를 생성해야 한다는 요구 사항이 있습니다. GPT-4o-mini와 Claude-3.5-haiku는 모두 이 점에서 뛰어난 성능을 보였으며, 83%를 초과하는 정확도를 달성했습니다.

존재하다 smi2xyz를 smi2file 작업으로 변환가운데—Claude-3.5-haiku와 GPT-4o-mini는 강력하고 안정적인 성능을 유지하며 둘 다 83% 이상의 정확도를 달성했습니다. Qwen-2.5-14B 또한 이 작업 세트에서 향상된 성능을 보여주며 최소 77%의 정확도를 기록했습니다.

존재하다 react2enthalpy 및 react2gibbs 가운데Qwen-2.5-14B는 20% 미만의 정확도로 가장 저조한 성능을 보였고, GPT-4o-mini는 각각 40%와 49%의 정확도를 기록하며 중간 정도의 성능을 보였습니다. Claude-3.5-haiku는 다른 소규모 대규모 언어 모델보다 우수한 성능을 보였으며, 각각 67%와 69%의 정확도를 달성했습니다. GPT-4o는 두 작업 모두에서 평균 83%를 넘는 정확도를 기록하며 가장 높은 성능을 보였습니다.

다중 에이전트 평가

연구진은 GPT-4o-mini, Claude-3.5-haiku, Qwen-2.5-14B 및 GPT-4o를 사용한 다중 에이전트 ChemGraph의 성능을 추가로 평가하고(아래 그림 참조) 단일 에이전트의 성능과 결과를 비교했습니다.

*다양한 대규모 언어 모델을 사용할 때 react2enthalpy 및 react2gibbs 작업에 대한 ChemGraph의 평균 정확도*

결과는 다음과 같습니다다중 에이전트 시스템은 다양한 모델의 정확도를 크게 향상시킵니다.react2enthalpy 작업에서 GPT-4o-mini는 정확도가 401 TP3T에서 871 TP3T로 향상되었고, Claude-3.5-haiku는 671 TP3T에서 871 TP3T로 향상되었습니다. 두 결과 모두 세 번의 독립적인 실행 평균값입니다. 특히 두 모델 모두 단일 에이전트 GPT-4o의 기준 성능인 831 TP3T를 능가했습니다. 마지막 작업인 react2gibbs에서도 유사한 경향이 관찰되었습니다. GPT-4o-mini는 정확도가 491 TP3T에서 871 TP3T로 향상되었고, Claude-3.5-haiku는 691 TP3T에서 931 TP3T로 향상되었습니다. 반면 Qwen-2.5-14B는 도구 호출 오류가 빈번하게 발생하여 정확한 답변을 생성하는 데 한계가 있었기 때문에 성능 향상이 제한적이었습니다.

궁극적으로, 다중 에이전트 모드에서 GPT-4o는 완벽한 정확도를 달성하여 두 가지 작업(react2enthalpy 및 react2gibbs)을 100%의 성공률로 완료했습니다.

마지막 말

ChemGraph는 계산화학 및 재료과학을 위한 대규모 언어 모델 기반 지능형 에이전트 시스템으로, 인공지능(AI)을 활용하여 과학 연구 워크플로우를 자동화할 수 있는 잠재력을 보여줍니다. 연구팀은 향후 더 많은 도구를 통합하고, 에이전트 아키텍처를 최적화하며, 고성능 컴퓨팅 지원을 강화하여 대규모 시뮬레이션 작업에서 ChemGraph의 활용 범위를 더욱 확장할 계획이라고 밝혔습니다. 또한, 이 시스템은 Docker 컨테이너를 활용하여 운영 보안을 확보하고 에이전트의 신뢰성을 지속적으로 향상시키고 있습니다.

ChemGraph는 기존의 계산화학 소프트웨어를 대체하는 것이 아니라, 자연어 상호작용을 통해 연구자와 시뮬레이션 도구를 연결하는 지능형 협업 계층 역할을 한다는 점을 유념해야 합니다. 대규모 오픈소스 모델 개발을 통해 ChemGraph는 AI 연구 애플리케이션의 비용을 절감하고, 재료 발견 및 분자 설계와 같은 분야에서 지능형 과학 에이전트가 더욱 중요한 역할을 수행할 수 있도록 지원할 것으로 기대됩니다.

참고문헌:

https://phys.org/news/2026-07-ai-framework-battery-combustion-materials.html

https://www.nature.com/articles/s42004-025-01776-9