HyperAIHyperAI

Command Palette

Search for a command to run...

재료 AI가 '설명 가능한 시대'로 나아가고 있습니다. 일본 연구팀이 고차원 분광학의 블랙박스를 해독하여 새로운 재료를 발견하는 데 핵심적인 특징들을 밝혀냈습니다.

Featured Image

최근 몇 년 동안 재료 과학 분야에서 머신 러닝의 응용이 많은 주목을 받고 있습니다. 초기에는 밴드 갭 에너지, 점 결함 형성 에너지, 융점 등과 같은 구조-물성 스칼라 예측에 국한되었던 머신 러닝의 적용 범위가 점차 확대되어 현재는 더욱 복잡한 고차원 물리량 모델링에까지 이르렀습니다. 그중에서도 가장 도전적인 분야 중 하나는 재료 스펙트럼의 예측 및 분석입니다.

유전 함수, 스펙트럼(흡수, 반사 및 방출), 전자 및 포논 상태 밀도와 같은 스펙트럼 데이터는 재료를 이해하고 설계하는 데 매우 중요합니다. 그러나 스칼라 속성과 비교했을 때, 고차원 스펙트럼 데이터는 큰 출력 차원, 복잡한 구조, 그리고 강한 물리적 제약 조건이라는 특징을 가지고 있어 기존의 머신러닝 방법으로는 정확성과 해석 가능성을 동시에 달성하기 어렵습니다. 딥러닝 모델은 스펙트럼을 어느 정도 예측할 수 있었지만, 해석 가능성의 부족은 재료 설계 분야에서의 추가적인 적용을 제한하는 주요 병목 현상으로 남아 있습니다.

이러한 맥락에서,일본 도쿄 과학 대학의 연구팀이 재료 과학 분야에서 고차원 스펙트럼 데이터를 처리할 수 있는 딥러닝 모델을 해석하는 방법을 제안했습니다.연구진은 2,681개의 산화물, 칼코게나이드 및 관련 화합물의 광 흡수 스펙트럼에 대한 제일원리 계산 데이터 세트를 구축했습니다. 표준 밀도 함수 계산과 비교했을 때, 스펙트럼 시작 에너지와 형태를 보정한 후 계산 결과는 보고된 실험 스펙트럼과 훨씬 더 잘 일치하는 것으로 나타났습니다.

연구진은 또한 해당 데이터 세트와 ALIGNN 알고리즘을 사용하여 고정밀 광 흡수 스펙트럼 예측 모델을 개발했습니다.특징 추출과 클러스터 분석을 결합하여 빛 흡수 개시 에너지와 강도를 주로 결정하는 핵심 요소 유형과 그 배위 환경을 성공적으로 추출했습니다.

"고차원 데이터에서 유망한 물질 그룹 및 공통 특징의 딥러닝 기반 추출: 무기 결정의 광학 스펙트럼 사례"라는 제목의 관련 연구 결과는 Advanced Intelligent Discovery에 게재되었습니다.

연구 하이라이트:

* 본 연구는 고차원 스펙트럼 데이터의 특징 추출 및 군집 분석을 통해 재료를 분류하는 방법을 제안하고, 이를 통해 잠재적인 재료 그룹과 그 공통 특징을 추출한다.

* 본 연구에서 개발된 제1원리 계산 데이터셋과 머신러닝 모델은 향후 신소재 발굴 및 재료 정보학 연구에 중요한 역할을 할 것으로 기대된다.

* 본 연구에서 제안한 방법은 적용 범위가 넓어 다양한 분광 데이터의 분류 및 해석에 활용될 수 있다. 이 방법은 무기 결정의 광 흡수 스펙트럼에만 국한되지 않고 다양한 분야에 적용될 수 있다.

서류 주소:https://advanced.onlinelibrary.wiley.com/doi/10.1002/aidi.202600007

고처리량 제일원리 계산을 사용하여 구축된 데이터 세트

연구자들은 먼저 재료 프로젝트 데이터베이스에서 다음 조건을 충족하는 산화물, 칼코게나이드 및 관련 재료를 선별했습니다. (1) 재료는 O, S, Se 중 적어도 하나의 원소를 포함하고 산화수는 반드시 -2일 필요는 없습니다. (2) 재료는 다음 원소를 포함하지 않습니다. H, 할로겐, 희귀 가스, Mn–Ni, Tc–Rh, Os–Ir, Po, 란탄족(La 및 Ce 제외) 및 악티늄족. (3) 재료는 스핀 편극을 나타내지 않습니다. (4) 공간군 P1 및/또는 원래 단위 셀에 40개 이상의 원자가 있는 시스템은 높은 계산 비용 또는 결정 구조의 불확실성으로 인해 제외되었습니다.

제1원리 계산에 사용된 재료의 총 수는 9,808개이며, 계산 데이터베이스는 아래 그림에 나타낸 과정에 따라 구축되었습니다.

금속 산화물, 칼코게나이드 및 관련 화합물의 유전 함수에 대한 제일원리 계산 데이터베이스 구축 워크플로

그림에서 볼 수 있듯이, 이 계산 과정은 매우 복잡합니다. 일관성을 유지하고 컴퓨팅 자원을 효율적으로 사용하면서 높은 처리량의 컴퓨팅을 달성하기 위해서는,연구원들은 자체 개발한 프로그램을 사용했으며, pymatgen, FireWorks, Custodian, atomate, vise와 같은 도구를 활용하여 프로세스를 자동화했습니다.모든 제일원리 계산은 VASP 소프트웨어 패키지를 사용하여 수행되었습니다. 이 워크플로는 PBEsol(+U) 계산을 사용하여 광 흡수 스펙트럼과 화합물 생성 에너지를 생성하고, nsc-dd 혼합 함수와 PBEsol(+U) 계산을 사용하여 밴드 구조를 얻습니다.

머신러닝 데이터셋과 관련하여 연구원들은 (1) 로컬 데이터베이스의 경쟁 위상에 비해 불안정한 물질, (2) PBEsol(+U) 밴드갭이 0.3 eV 미만인 물질을 제거했습니다. 최종적으로 유지된 물질의 수는 2681개였습니다.

광 흡수 스펙트럼을 기반으로 ALIGNN 모델 구축

머신러닝 모델 구축 및 예측 정확도

모델 수준에서,본 연구에서는 고차원 광 흡수 스펙트럼을 모델링하기 위한 핵심 예측 프레임워크로 ALIGNN(Atomistic Line Graph Neural Network)을 사용합니다.기존의 결정 그래프 컨볼루션 네트워크(CGCNN)와 비교했을 때, ALIGNN의 핵심 장점은 "원자 그래프 + 결합선 그래프"라는 두 가지 표현 방식을 동시에 도입하여 3체 각도 정보를 명시적으로 인코딩하고, 국소 구조 환경을 더욱 정교하게 표현할 수 있다는 점에 있다. 아래 그림의 윗부분은 ALIGNN 아키텍처의 개략도를 보여준다.

광 흡수 스펙트럼 예측에 사용된 ALIGNN 모델의 개략도 및 제안된 해석 방법.

이 프레임워크에서 원자는 노드이고, 원자 간 결합은 에지이며, 에지 간의 관계는 선 그래프로 표현되어 결합 각도 정보를 학습 가능한 구조적 특징으로 변환합니다.이러한 설계 덕분에 모델은 두 물체 사이의 거리 정보뿐만 아니라 세 물체 사이의 상호 작용 특성까지 파악할 수 있으므로 결정의 물리적 거동을 더욱 정확하게 모방할 수 있습니다.

특징 추출 및 클러스터링

연구진은 최적화된 모델의 ALIGNN 첫 번째 레이어에서 특징을 추출하고, 각 물질의 모든 원자 위치에 대한 특징 벡터를 평균화한 후, 위 그림 하단에서 볼 수 있듯이 계층적 클러스터링 분석을 수행했습니다. 이 방법의 목표는 입력 특징(원소 구성 및 인접 원자 수, 원자 간 거리, 결합 각도를 포함한 원자 배위 특징 등)과 출력 특성(광 흡수 스펙트럼) 모두에서 유사성을 보이는 물질들을 그룹으로 분류하는 것입니다.

아래 그림은 계층적 클러스터링을 통해 얻은 96개 그룹의 광 흡수 스펙트럼을 보여줍니다. 각 클러스터 내의 스펙트럼 형태는 실제로 유사하며, 이는 본 연구에서 사용된 클러스터링 방법의 효과성을 입증합니다.

계층적 클러스터링을 통해 얻은 흡수 스펙트럼 분류 결과

결과: 해석 가능한 물질 집단 구조 및 물리적 메커니즘 추출이 이루어졌습니다.

연구진은 재료 과학 분야에서 고차원 스펙트럼 데이터를 처리하는 새로운 딥러닝 모델의 능력을 검증하기 위해 일련의 실험을 수행했습니다.

예측 성능 기능

예측 성능 측면에서 ALIGNN 모델은 아래 그림에서 볼 수 있듯이 테스트 세트에서 전반적으로 높은 정확도를 보였습니다.약 75%의 물질 흡수 스펙트럼 예측에 대한 평균 절대 오차(MAE)는 0.14 미만으로, 이는 모델이 복잡한 스펙트럼 형태를 잘 재현할 수 있음을 나타냅니다.

최적화된 ALIGNN 모델을 사용하여 테스트 세트에서 광 흡수 스펙트럼을 예측한 결과

위 이미지의 오른쪽 패널은 각 사분위수에서 오차가 가장 큰 네 가지 물질에 대한 예측 결과를 보여줍니다. 첫 번째에서 세 번째 사분위수에 속하는 물질의 경우, ALIGNN 예측 결과(색깔 있는 곡선)는 제일원리 참조 계산 결과(검은색 곡선)와 잘 일치합니다. 그러나 네 번째 사분위수에 속하는 일부 화합물은 광 흡수 스펙트럼의 시작 위치에서 상당한 편차를 보입니다. 이러한 이상치 샘플은 독특한 전자 구조와 훈련 데이터 세트에 유사한 구조의 물질이 부족하기 때문에 예측 성능이 저조합니다.

광 흡수 스펙트럼의 시작 위치를 포착하는 능력

MAE는 전체 스펙트럼 범위를 포괄하는 전역적인 지표이지만, 연구진은 모델이 국소적인 스펙트럼 개시 에너지를 정확하게 재현할 수 있는지 추가적으로 조사했습니다. 아래 그림은 제1원리 계산과 ALIGNN 예측에서 log₁₀ α(ω)가 처음으로 2.5를 초과하는 시점에 해당하는 가장 낮은 광자 에너지를 비교한 패리티 플롯입니다. 여기서 α는 흡수 계수를 나타냅니다.

테스트 세트 스펙트럼의 초기 에너지에 대한 패리티 플롯.

결과에 따르면 초기 에너지에 대한 예측 R² 값은 0.950이고 MAE는 0.353 eV로 나타났으며, 이는 ALIGNN 모델이 광 흡수 스펙트럼의 시작 위치를 정확하게 포착할 수 있음을 보여줍니다.

해석 가능성 분석

해석 가능성 분석 측면에서 연구진은 ALIGNN의 첫 번째 레이어에서 특징 표현을 추출하고 재료에 대한 계층적 클러스터링을 수행하여 96개의 재료 그룹을 도출했습니다. 결과는 다음과 같습니다...같은 클러스터 내의 물질들은 스펙트럼 형태, 특히 흡수 시작 위치와 흡수 가장자리의 기울기에서 높은 일관성을 보이며 상당한 공통성을 나타냅니다. 이는 모델이 초기 단계에서 스펙트럼 관련 구조적 특징을 학습했음을 시사합니다.

추가 사례 연구를 통해 서로 다른 물질 그룹 간의 명확한 물리적 차이가 드러납니다. 예를 들어, 74족 물질은 일반적으로 넓은 밴드 갭과 스펙트럼 변곡점 근처에서 높은 흡수 계수를 나타냅니다. 그림 a는 이 그룹의 모든 물질이 V 또는 Cr을 포함하고 있으며, 다른 양이온은 주로 알칼리 금속임을 보여줍니다. 이러한 물질은 대부분 VO₄³⁻, CrO₄²⁻ 또는 Cr₂O₇²⁻ 형태로 존재하며, 양이온은 사면체 배위 환경에 위치합니다.


클러스터 74에 속하는 물질들의 광 흡수 스펙트럼 (여기서 α는 흡수 계수를 나타낸다).

연구진은 Matminer에 구현된 CrystalFingerprintNN을 사용하여 클러스터 내 각 물질의 양이온 자리의 사면체 배위 지수를 계산하고 모든 양이온 자리의 최대값 분포를 분석했습니다. 아래 그림 b에서 볼 수 있듯이 대부분의 물질은 실제로 사면체 배위 자리를 가지고 있습니다.


74번째 물질 클러스터(빨간색)와 전체 데이터 세트(파란색) 간의 사면체 배위 유사성 분포.

전자 상태 밀도 관점에서 볼 때, 전도대 바닥(CBM) 근처에서 Vd 또는 Cr-d 상태에 의한 날카로운 피크가 관찰됩니다. V⁵⁺ 및 Cr⁶⁺의 높은 원자가 상태는 광학 전이에 사용될 수 있는 다수의 비점유 전자 상태를 제공합니다. 따라서 고체 화학 및 물리적 관점에서 이러한 바나듐산염, 크롬산염 및 이크롬산염이 높은 광 흡수 계수를 갖는 것은 타당합니다.

모델 클러스터링 결과로부터 화학적 메커니즘을 추론하는 이 과정은 블랙박스 예측에 불과했던 머신러닝 결과를 재료 설계에 유용한 지식의 원천으로 전환시켜 줍니다. 더 나아가, 본 연구는 원시 스펙트럼 데이터를 기반으로 한 직접 클러스터링 결과와 비교했는데, 직접 클러스터링 방식은 유사한 스펙트럼은 식별할 수 있었지만 명확한 화학 구조 그룹을 형성하는 데 어려움을 겪어 재료 유형이 상당히 혼합되는 결과를 초래했습니다. 이는 ALIGNN 특징 공간이 일관된 구조-물성 표현을 달성하는 데 있어 얼마나 우수한지를 다시 한번 보여줍니다.

결론

본 연구의 의의는 고정밀 광흡수 분광 예측 모델을 구축하는 데 그치지 않고, 더욱 중요한 것은 "딥러닝 표현 학습"과 "재료 물리학적 해석"을 결합한 방법론적 틀을 제시한다는 데 있다. ALIGNN 모델과 계층적 클러스터링 분석을 결합함으로써, 본 연구는 고차원 스펙트럼 데이터에서 재료의 공통 법칙을 추출하는 능력을 확보했으며, 이를 통해 기계 학습 모델이 결과를 예측할 뿐만 아니라 그 결과의 기저에 있는 구조와 전자적 기원을 밝힐 수 있게 되었다.

이상적으로는 엑시톤 효과, 포논 보조 전자 전이 및 결함의 스펙트럼 특성을 재현하기 위해 전자-정공 상호작용, 전자-포논 결합 및 점 결함의 영향을 모두 고려해야 합니다. 그러나 이러한 효과를 포함하는 고처리량 제일원리 스펙트럼 계산은 계산 비용이 너무 많이 들기 때문에 본 연구에서는 이를 달성하지 못했습니다. 그럼에도 불구하고, 더욱 정밀한 다체 계산 방법과 머신러닝 모델의 통합이 이루어짐에 따라 이러한 유형의 연구는 재료 발견에서 더욱 중요한 역할을 할 것으로 기대되며, 재료 설계를 경험 중심적 접근 방식에서 데이터 중심적 접근 방식과 메커니즘 중심적 접근 방식을 통합하는 새로운 단계로 이끌 것입니다.