Command Palette
Search for a command to run...
RNA 구조 예측 기술이 알파폴드 3에 필적한다! 버지니아 공대 연구팀은 진화 정보에 완전히 독립적인 RNAbpFlow를 제안했다.

2020년 11월, 알파폴드 2(AlphaFold 2)는 CASP14 국제 단백질 구조 예측 대회에서 큰 주목을 받았습니다. 단백질의 3차원 구조를 실험적 정확도에 근접하게 예측한 알파폴드 2는 반세기 동안 생물학계를 괴롭혀 온 단백질 접힘 문제를 해결했을 뿐만 아니라, 그 놀라운 성과로 4년 후 두 개발자에게 노벨 화학상을 안겨주었습니다. 하지만 알파폴드 2의 성공은 시작에 불과했습니다. 마치 핵폭탄처럼, 그것은 구조 생물학 분야 전체에 불을 지폈고, 인공지능을 활용하여 생체 고분자의 공간적 구조를 분석하는 연구의 물결을 일으켰습니다.
알파폴드 2가 단백질 분야에서 이룬 획기적인 성과에 영감을 받아, 인공지능을 활용하여 리보핵산(RNA)의 3차원 구조를 예측하는 문제에도 큰 기대가 걸려 있습니다.하지만 현재 주류 알고리즘들은 구현 과정에서 여전히 피할 수 없는 몇 가지 현실적인 병목 현상에 직면하고 있습니다.첫째, 대부분의 트랜스포머 기반 RNA 예측 모델은 다중 서열 정렬(MSA)에서 제공하는 주요 진화 서열 정보 또는 생물학적 언어 모델에서 간접적으로 얻은 상동 서열 정보에 크게 의존합니다. 그러나 RNA 염기쌍의 구조적 유사성 때문에 고품질의 신뢰할 수 있는 MSA 결과를 생성하기 어렵습니다. 둘째, 대부분의 주류 방법은 RNA 2차 구조의 염기쌍 형성에 대한 핵심 정보를 충분히 활용하지 못하는데, 이는 RNA의 3차원 접힘 형태를 결정하는 핵심 요소입니다. 셋째, RNA 분자는 자연적인 형태적 유연성을 가지고 있으며 여러 안정적인 공간적 형태로 존재합니다. 기존 알고리즘은 대부분 단일 정적 결과만 출력하며 RNA의 실제 동적 형태 집합을 재구성할 수 없습니다.
앞서 언급한 문제를 해결하기 위해 버지니아 공과대학의 Debswapna Bhattacharya 교수와 그의 학생 Sumit Tarafder는 시퀀스 및 염기쌍 조건을 기반으로 하는 SE(3)-등변 흐름 일치 모델인 RNAbpFlow를 개발하기 위해 협력했습니다.이 모델은 다중 서열 정렬이나 상동성 템플릿과 같은 진화 정보 없이 RNA 뉴클레오티드 서열 및 염기쌍 정보만을 기반으로 모든 원자 RNA 구조의 완전한 세트를 생성할 수 있습니다.본 연구에서는 기존 AI 기반 RNA 구조 예측 방법의 여러 단점을 해결합니다. 다양한 벤치마크 실험을 통해 염기쌍 결합을 제약 조건으로 도입하면 모델의 예측 정확도가 크게 향상됨을 입증했습니다. RNA 토폴로지 샘플링 및 3D 구조 모델링이라는 두 가지 핵심 작업에서 RNAbpFlow는 기존의 주요 방법들을 능가하는 성능을 보여줍니다.
RNAbpFlow와 AlphaFold 3의 비교 테스트에서 나온 인상적인 데이터는 최종 결과를 명확히 보여주었다는 점을 언급할 가치가 있습니다.CASP16 블라인드 테스트 실험에서 RNAbpFlow는 14개 RNA 표적(≤200 nt) 중 대다수의 전체 접힘 구조를 정확하게 재구성할 수 있었으며, 그중 12개는 예측 기준을 충족했습니다.반면, 동일한 실험 조건에서 알파폴드 3의 예측 구조 중 자연적인 형태와 일치하는 기준을 충족한 구조는 단 8개뿐이었습니다.
"RNAbpFlow: 조건부 RNA 3D 구조 생성을 위한 염기쌍 증강 SE(3) 흐름 매칭"이라는 제목의 관련 연구 결과가 Nature Methods에 게시되었습니다.
연구 하이라이트:
- 제안된 RNAbpFlow는 시퀀스 및 염기쌍 조건을 기반으로 하는 SE(3) 등유체 매칭 모델로, 기존 RNA 3차원 구조 예측 방법의 여러 단점을 해결합니다.
- 세 가지 주요 혁신이 제안되었습니다. 3채널 염기쌍 조건부 입력, 뉴클레오사이드 염기 중심 특성화, 그리고 염기쌍 특이적 보조 손실(bp2D 및 bp3D)은 염기쌍 및 3차원 구조의 정확도를 크게 향상시켰습니다.
- 본 논문에서는 독립적이고 중복되지 않는 학습 및 테스트 세트 전략을 제안하고, 여러 권위 있는 벤치마크와 CASP 블라인드 테스트를 통해 제안된 방법의 타당성을 검증합니다. 제안된 방법의 전반적인 성능은 기존의 주류 알고리즘들을 능가합니다.

서류 주소:
https://www.nature.com/articles/s41592-026-03128-4
훈련 데이터셋과 테스트 데이터셋의 독립적인 중복 제거는 진실되고 공정한 평가를 보장합니다.
본 연구에서는 자체 개발한 RNAbpFlow 모델을 구축하고 평가 결과의 타당성과 신뢰성을 확보하기 위해, 내용 중복이 없는 독립적인 훈련 및 테스트 데이터셋을 사용하고, 단일 기본 모델을 전 과정에 걸쳐 사용하는 대신 각 테스트 벤치마크에 특정 모델 가중치를 할당했습니다. 이는 훈련 데이터가 평가 과정에 혼합되어 결과 왜곡을 초래하는 것을 방지하기 위함입니다.
모델 개발 및 내부 검증과 관련하여,본 연구에서는 RNA3DB 데이터셋을 사용합니다. 이 데이터셋은 서열 및 구조 수준 모두에서 중복이 없어 딥러닝 모델 학습 및 내부 벤치마킹에 매우 적합합니다. 본 연구에서는 2024년 4월 26일 단백질 데이터베이스(PDB)에서 추출한 RNA3DB 데이터셋 버전을 사용했으며, 원 논문에 제시된 학습-테스트 분할 방식을 따라 대표적인 RNA 서열을 선별하여 실험에 사용했습니다.
데이터 세트에 고품질의 천연 RNA 구조와 정확한 염기쌍 정보만 포함되도록 하기 위해, 본 실험에서는 다단계 품질 관리 필터링을 수행했습니다. 여기에는 단일 뉴클레오티드에 단일 원자만 있는 구조와 단백질 잔류물이 혼합된 구조를 제거하는 것, FASTA 서열과 3차원 구조 간의 불일치를 수정하여 염기쌍의 무결성을 보호하기 위해 연속적인 실험 서열을 잘라내는 것, 그리고 천연 구조에서 염기쌍이 없는 서열을 삭제하는 것이 포함되었습니다. RNAView를 사용하여 염기쌍 정보를 추출하고, 길이가 20개 뉴클레오티드 이상인 연속적인 비쌍 RNA 사슬을 필터링하고, 서열 길이를 30~200개 뉴클레오티드로 제한한 후, 최종적으로 560개의 RNA 서열로 구성된 순수 훈련 세트(Rfam 패밀리와 일치하지 않는 서열은 데이터 유출 위험을 더욱 줄이기 위해 제거됨)와 48개의 서열로 구성된 순수 테스트 세트를 얻었습니다.
데이터 분할의 이 부분은 RNA3DB의 비중복 분할 방식을 완벽하게 따르며, 루트로부터의 데이터 유출을 방지하기 위해 훈련 세트와 테스트 세트 간에 서열이나 구조가 겹치지 않는다는 점을 언급할 가치가 있습니다.
RNAbpFlow와 RNAJP의 비교 실험에서,본 연구에서는 RNAJP 연구에서 사용된 것과 유사한 3방향 연결기를 포함하는 22개의 RNA 서열 데이터셋을 활용하여 선별 과정을 수행했습니다. 연구진은 먼저 이 데이터셋에서 다중체 구조를 제거한 후, 남은 서열들을 앞서 언급한 정제된 훈련 데이터셋과 비교하여 중복 및 서열 복제를 제거했습니다. 최종적으로 처리된 데이터셋은 12개의 서열로 축소되었습니다.
CASP15 및 CASP16 국제 대회와의 호환성과 관련하여,본 연구는 대회 블라인드 테스트 규칙을 엄격히 준수하고 다른 알고리즘과의 공정한 비교를 보장하기 위해 RNA3DB에서 제공하는 기본 훈련 및 테스트 세트 분할 방식을 그대로 사용하지 않았습니다. 대신, RNA3DB에서 완전히 분리되고 겹치지 않는 두 개의 새로운 훈련 세트를 재구성하고 설계했습니다.
CASP15의 경우, CASP15 대회에서 테스트할 첫 번째 RNA 샘플이 2022년 5월에야 공개되었기 때문에, 연구진은 새로운 학습 데이터 세트를 설계할 때 2022년 4월 이전에 PDB 데이터베이스에 업로드된 RNA 서열(모두 RNA3DB에서 가져옴)만을 포함시켰습니다. 이는 모델 학습 과정에서 CASP15에서 테스트할 RNA를 완전히 배제하여 블라인드 테스트 규칙을 엄격하게 준수하기 위한 것이었습니다. 최종적으로, 학습 데이터 세트는 30~784 뉴클레오티드 길이의 731개 RNA 서열로 구성되었습니다. 모델 평가에 사용된 테스트 데이터 세트는 CASP15 벤치마크 세트에서 가져온 6개의 천연 RNA와 4개의 합성 RNA로 구성되었습니다.
CASP16의 경우,실험에 사용된 훈련 데이터 세트는 실험적으로 구조가 규명된 994개의 PDB 구조와 교차 증류 데이터 증강에 사용된 신뢰도 높은 예측 구조 2,170개로 구성되어 총 3,164개의 샘플을 포함합니다.각 학습 배치에서 PDB 구조의 수와 교차 증류된 데이터의 수의 비율은 대략 1:2.2입니다.
구체적으로, 같은 이유로 CASP16에서 테스트할 첫 번째 RNA 배치는 2024년 5월에 공개되었습니다. 따라서 연구진은 RNA3DB에서 적합한 모든 데이터를 단일 학습 데이터 세트로 통합했는데, 여기에는 2024년 4월 6일 이전에 업로드된 PDB 구조만 포함되었습니다. 엄격한 선별 과정을 거쳐 994개의 RNA 서열과 그에 해당하는 측정된 3차원 구조를 얻었습니다. 테스트 데이터는 현재 CASP16에서 이용 가능한 실제 실험적 3차원 구조를 가진 28개의 RNA에서 가져왔습니다.
교차 증류 데이터 세트를 구성하는 데 사용된 데이터는 주로 데이터 증강의 효과를 탐색하기 위해 bpRNA-1m(90) 데이터 세트에서 가져왔습니다. bpRNA-1m(90) 데이터 세트에는 28,370개의 RNA 서열(및 해당 2차 구조)이 포함되어 있습니다. 중복 제거 및 서열 길이를 30~200으로 제한한 후, MMseqs2 클러스터링 도구를 사용하여 여러 번 추출한 후,최종 결과는 신뢰도가 높은 2,170개의 RNA 구조로 구성된 교차 증류 데이터 세트였습니다.
스트림 매칭 기반 조건부 생성 프레임워크
RNAbpFlow는 서열 및 염기쌍 조건을 기반으로 하는 SE(3) 등유체 매칭 모델입니다(아래 그림 참조). 단백질 구조 생성 모델인 FrameFlow를 수정하여 NuFold에서 제안한 뉴클레오티드 표현 방식을 채택하고, RNA 서열의 각 뉴클레오티드를 강체 프레임으로 표현합니다. 뉴클레오티드 서열 및 염기쌍 정보를 제약 조건으로 사용하여 반복적인 샘플링을 통해 이면각을 예측하고, 모든 원자를 점진적으로 최종적으로 완전한 3차원 RNA 구조(진정한 리보스 접힘 구조)로 축소합니다. 요컨대,RNAbpFlow의 핵심 장점은 "입력 조건"과 "모델 패러다임"이라는 두 가지로 요약할 수 있습니다.

"입력 조건"과 관련하여,RNAbpFlow는 서열 및 염기쌍 정보만을 이용하여 MSA 또는 상동성 템플릿 정보 없이 조건부로 3차원 RNA 구조를 생성할 수 있습니다.
첫째, 입력으로는 L 길이의 RNA 서열이 사용되며, 뉴클레오티드는 원핫 인코딩을 이용하여 표현됩니다. 즉, 네 가지 뉴클레오티드(A, U, C, G)에 해당하는 네 개의 요소를 가진 이진 벡터가 사용됩니다. 둘째, 학습 단계에서 염기쌍 정보 처리를 위해(이것이 핵심 혁신입니다), RNAView, MC-Annotate, DSSR 세 가지 도구를 사용하여 실험적으로 분석된 자연적인 3차원 구조에서 2차원 염기쌍 주석을 추출하고, 이를 세 개의 독립적인 L × L 이진 행렬로 표현합니다. 다양한 고전적 및 비고전적 염기쌍 특징을 최대한 포착하기 위해, 본 연구에서는 세 가지 도구에서 얻은 모순되는 주석을 일률적으로 수정하지 않습니다. 대신, 세 개의 이진 행렬을 직접 연결하여 L × L × 3 텐서를 생성하고, 이를 잡음 제거 네트워크 구조의 바이어스 항에 입력으로 사용하여 세 개의 독립적인 채널에서 염기쌍 특징 정보를 제공합니다.
또한, CASP15 및 CASP16 경쟁 테스트 목표의 샘플링 및 추론 시나리오에서는 자연 염기쌍에 대한 실제 값이 없기 때문에, IPKnot, SPOT-RNA, RibonanzaNet의 세 가지 RNA 2D 구조 예측 도구에서 출력된 서열 의존적 염기쌍 예측 행렬을 실험에 사용했습니다. 이 세 가지 도구는 모두 슈도매듭 식별 기반 염기쌍 예측을 지원하며, CASP15의 자연 RNA 목표에 대한 샘플링 성능을 기준으로 선정되었습니다. 더욱이, RNAbpFlow는 매우 다재다능하여 사용자가 세 가지 염기쌍 행렬 세트를 입력으로 정의할 수 있도록 지원합니다. 사용자 지정 염기쌍 행렬 세트가 하나만 있는 경우, 이를 세 번 복사하여 네트워크에서 요구하는 3채널 2D 입력 형식에 맞출 수 있습니다.

"모델 패러다임"의 관점에서 보면,핵심은 "플로우 매칭"에 있습니다. 플로우 매칭은 데이터 분포의 확률 흐름에 맞는 속도장(또는 플로우 필드)을 학습하는 것을 핵심 목표로 하는 심층 생성 모델의 한 유형입니다. 이를 통해 가우시안 분포와 같은 단순 분포를 고차원 공간에서 목표에 필요한 복잡한 데이터 분포로 변환할 수 있습니다. 플로우 매칭은 원래 데이터 분포를 완전히 변형하지 않고 단순 분포에서 목표 분포로 이동하는 샘플 포인트의 움직임을 설명하는 속도장을 직접 학습합니다. 학습된 벡터장에 상미분 방정식을 적용함으로써, 플로우 매칭은 목표를 근사하는 더 간단한 이동 궤적을 생성할 수 있습니다. 확산 모델과 비교했을 때, 플로우 매칭은 대규모 샘플 생성의 계산 속도를 크게 향상시킬 수 있습니다.
본 연구에서 흐름 매칭 방법의 목표는 매개변수화된 벡터장 Ut를 학습하는 것입니다. 이 벡터장은 시간에 따라 부드럽게 변화하는 매핑을 나타내며, 이를 통해 두 분포, 즉 잡음이 포함된 프레임의 분포 p₀(T₀)와 참 기준 프레임의 분포 p₁(T₁) 사이의 변환 관계를 설명하는 상미분 방정식이 생성됩니다. 이 매핑을 학습하기 위해 연구진은 잡음이 포함된 참 기준 프레임 Tₜ를 기반으로 시간 t에서의 벡터장을 예측하는 매개변수화된 신경망 Vθ(Tₜ, t)를 훈련시켰습니다. 이 신경망 부분은 FrameFlow를 참고하여 설계되었으며, AlphaFold 2의 구조 모듈을 백본 네트워크 아키텍처로 사용했습니다.
구체적인 학습 설정에 관해서는, PyTorch-Lightning 프레임워크를 사용하여 모델을 학습시켰으며, Adam 옵티마이저를 학습률 0.0001로 설정했습니다. 분산 학습은 8개의 NVIDIA H100 GPU에서 1500회 반복 실행되었습니다.
핵심 임무 수행 성능이 알파폴드 3를 능가합니다.
RNAbpFlow의 샘플링 성능을 평가하기 위해, 본 연구에서는 먼저 비고전적 염기쌍 결합, 염기 스태킹 상호작용, 장거리 루프-루프 상호작용을 포함하여 염기쌍 결합 정보를 명시적으로 고려하는 거친 입자 분자 동역학 시뮬레이션 기반의 3차원 RNA 구조 샘플링 방법인 RNAJP와 비교하였다.
실험 결과는 아래 그림에 나타나 있습니다.RNAbpFlow는 두 가지 평가 지표 모두에서 RNAJP보다 우수한 성능을 보였습니다.구체적으로, RNAbpFlow는 평균 국소 거리 차이 테스트 점수(lDDT 점수)에서 0.66이라는 높은 점수를 달성한 반면, RNAJP는 0.59에 그쳤습니다. 마찬가지로, 전역 토폴로지 샘플링 측면에서 RNAbpFlow는 평균 템플릿 모델링 점수(TM 점수)에서 0.38을 달성한 반면, RNAJP는 0.32를 달성했습니다.

표본 유효성 평가와 관련하여, 올바른 접는 구조는 TM 점수를 기준으로 결정됩니다.RNAbpFlow는 높은 비율의 RNA 표적을 검출했으며, 그중 66,671개가 TP3T로 검출되었습니다.lDDT 점수를 기반으로 올바르게 접힌 구조의 검출률은 TP3T 단백질의 경우 251이었지만, RNAJP의 경우 각각 41,671과 0에 불과했습니다. 또한 RNAbpFlow로 생성된 12,000개의 시뮬레이션된 구조 중 13.41개의 TP3T 구조는 템플릿 모델링 점수가 0.45보다 높았고, 9.61개의 TP3T 구조는 lDDT 점수가 0.7보다 높았습니다. 반면 RNAJP의 시뮬레이션된 구조 중에서는 템플릿 모델링 점수가 0.45보다 높은 구조가 1,731개에 불과했고, lDDT 점수가 0.75보다 높은 구조는 하나도 없었습니다.
위 결과는 RNAbpFlow가 최적 구조 점수 산출에서 RNAJP보다 뛰어날 뿐만 아니라, 고품질 시뮬레이션 구조의 비율 또한 더 높다는 것을 보여줍니다.이는 전역 토폴로지와 지역 구성이라는 두 가지 샘플링 작업에서 해당 방법의 효율성을 보여줍니다.
다음으로, 연구팀은 CASP15 블라인드 테스트 데이터 세트에서 RNA bpFlow를 여러 기존 방법과 비교했습니다(아래 표 참조). 결과는 다음과 같습니다...실제적이고 정확한 자연 염기쌍 정보를 입력하면 RNAbpFlow의 모델링 및 예측 성능이 크게 향상됩니다.평균 TM-점수는 0.48에 도달했고, 모든 원자의 제곱평균편차(RMSD)는 7.77, 비왓슨-크릭 염기쌍 상호작용 네트워크 충실도(INF-NWC)는 0.62였습니다. 알고리즘이 예측한 염기쌍만 사용했을 때, 세 가지 지표는 각각 0.40, 10.70, 0.48이었습니다.
이에 비해, 정확한 염기쌍 정보를 제공했을 때 TM-score는 201 TP3T 증가하고, RMSD는 27.41 TP3T 감소했으며, INF-NWC는 29.21 TP3T 증가하여 고품질 염기쌍 정보의 중요성을 강조했습니다.

반면, 다른 방법들은 실제 자연 염기쌍을 입력하더라도 성능 향상이 매우 제한적입니다. 예를 들어, 가장 우수한 성능을 보인 Vfold는 TM 점수가 0.34에 불과한 반면, RNAComposer는 최소 RMSD가 14.15입니다. 이는 RNAbpFlow가 더 뛰어난 적응성을 지니고 있으며, 심층 생성 모델링에서 정확한 염기쌍 제약 조건을 효율적으로 활용하여 AI 방법의 예측 성능 상한선을 크게 높인다는 것을 보여줍니다.
연구진은 CASP16 블라인드 테스트 대상에 대한 RNAbpFlow의 샘플링 정확도를 검증하기 위해 CASP16 대회에서 가장 우수한 성능을 보인 두 가지 예측 모델과 비교했습니다. 결과(아래 그림 참조)는 RNAbpFlow가 14개의 예측 대상(≤200 nt)에 대해 평균 최대 TM-score 및 lDDT 지표 측면에서 AlphaFold 3를 포함한 모든 알고리즘보다 우수한 성능을 보임을 보여줍니다. RNAbpFlow가 생성한 구조적 형태 중 12개(85,711 TP3T)에서 적어도 하나의 올바르게 접힌 형태를 찾을 수 있었지만, AlphaFold 3는 8개(57,131 TP3T)에서만 이를 달성하여 RNAbpFlow의 더욱 안정적인 성능을 입증했습니다.
하지만 200nt보다 긴 RNA 표적의 경우, RNAbpFlow는 여전히 NuFold, trRosettaRNA2, DRfold2보다 우수한 성능을 보이지만 AlphaFold3보다는 성능이 떨어집니다. 이는 긴 서열에 대한 예측 염기쌍의 정확도가 크게 감소하기 때문입니다.

또한, 실험 결과 예측 불가능한 표적(TM-score < 0.45; MSA 유효 상동성 서열 깊이 ≤ 130; 약한 진화 신호)의 경우, 진화 정보가 부족할 때 염기쌍 제약 조건 기반 구조 예측 모델이 RNAbpFlow보다 훨씬 우수한 성능을 보였으며, 이는 염기쌍 정보만으로 RNA의 3차원 구조를 예측할 수 있는 RNAbpFlow의 우수성을 입증합니다. 그러나 R1263 및 R1264와 같이 예측이 용이한 표적의 경우, 충분한 심층 다중 서열 정렬 데이터가 있으면 AF3-server와 Yang-Server 두 정렬 모델이 RNAbpFlow와 동등하거나 더 나은 성능을 보였으며, 이는 두 모델 모두 서열 정렬 정보에 크게 의존함을 보여줍니다.
마지막 말
요약하자면, RNAbpFlow는 MSA 및 구조적 상동성에 제한받지 않습니다. 서열과 염기쌍 정보만을 이용하여 RNA의 전체 원자 3차원 구조 모델을 처음부터 끝까지 직접 생성할 수 있습니다. 고정밀 원자 수준의 대규모 구조 세트 생성 기술을 통해 RNA 구조 동역학 연구에 매우 유망한 새로운 방향을 제시할 수 있을 것입니다.








