Command Palette
Search for a command to run...
LLM에서 단백질 변이 순위를 매기는 최초의 표준화된 벤치마크! 하버드 대학교 연구팀은 13개의 주류 모델과 95개의 특수 모델을 한 번에 평가하는 PG-LLM을 제안했습니다.

ChatGPT나 Doubao와 처음 대화를 나눴을 때 느꼈던 경외감을 기억하시나요? 보편적인 언어 모델을 기반으로 만들어진 이들은 마치 전지전능한 존재처럼 보였고, 시를 짓고 시사 문제를 이해하는 것은 물론 그림을 그리고 편지를 쓰고 코딩까지 할 수 있는 것처럼 보여 사람들을 놀라게 했습니다. 하지만 문화, 예술, 과학 등 다양한 분야에서 "전지전능해 보이는" 이 지능형 도우미에 대해 과학자들은 점점 더 다음과 같은 질문을 던지고 있습니다. 보편적인 언어 모델이 지식 격차가 큰 전문 분야에서 얼마나 잘 작동할 수 있을까요?
단백질 공학 분야에서 범용 언어 모델은 생물학적 지식 및 추론 벤치마크에서 향상된 성능을 보여주기 때문에 단백질 설계 과정에 점점 더 많이 활용되고 있습니다. 그러나 과학자들은 단백질 변이의 영향을 평가하는 데 있어 이러한 모델의 능력에 대한 명확한 이해가 여전히 부족합니다. 인류 시스템 기술 보고서에 언급된 Claude 계열 모델을 평가한 ProteinGym-Hard 평가와 같은 일부 범용 언어 모델의 평가 결과를 제시한 기술 보고서들이 있지만, 이러한 연구들은 모델 집단의 제한과 횡단면적 비교 검증의 부족 등 여러 가지 문제점을 안고 있습니다.
이를 고려하여,하버드 대학교와 Capable의 연구팀은 ProteinGym 데이터셋을 기반으로 하는 PG-LLM 벤치마크를 제안했습니다.본 연구에서는 최초로 13개의 범용 언어 모델과 95개의 전문 단백질 예측 도구를 통합된 평가 기준 내에서 동시에 평가했습니다. PG-LLM 벤치마크 테스트를 통해 범용 언어 모델이 단백질 돌연변이 스크리닝을 수행할 수 있으며, 높은 실용적 가치를 지니고 있을 뿐만 아니라 기존의 전문 예측 도구 절반 이상보다 우수한 성능을 보인다는 사실을 최초로 확인했습니다. 본 벤치마크는 단백질 공학 분야의 새로운 도구 개발을 강력하게 지원할 뿐만 아니라 단백질 설계에 대한 완전히 새로운 아이디어를 제시할 수 있을 것입니다.
"PG-LLM: 단백질 변이체 순위 지정을 위한 범용 언어 모델 벤치마킹"이라는 제목의 관련 연구 결과는 bioRxiv에 사전 공개 논문으로 게재되었습니다.
연구 하이라이트:
* 범용 언어 모델(PG-LLM)에서 단백질 돌연변이 순위 지정을 위한 최초의 표준화된 벤치마크 구축
* 대규모 교차 모델 제어 실험을 수행하여 일반 언어 모델과 특수 단백질 예측 모델 간의 성능 차이를 명확하게 정의합니다.
* 다차원적인 실험적 관점을 제공하여 두 가지 모델 유형의 기본 메커니즘 차이를 밝히고 잠재적인 융합 해결책을 위한 토대를 마련합니다.
논문 링크: https://www.proteingymllm.com/paper
ProteinGym 데이터셋을 기반으로, 이 데이터셋은 217개의 실험 데이터 세트를 포함합니다.
PG-LLM은 단백질 돌연변이 예측 분야에서 보편적으로 표준화된 벤치마크 데이터셋인 ProteinGym 데이터셋을 기반으로 구축되었습니다. 본 연구에서는 ProteinGym v1.3 딥 돌연변이 스캐닝 데이터셋 전체를 사용합니다.이 연구는 186가지 단백질과 총 217세트의 실험 데이터를 다룹니다.이 중 148개 그룹은 단일 점 돌연변이 실험만으로 결정되었고, 나머지 69개 그룹은 다중 부위 복합 돌연변이 실험으로 결정되었습니다.
공정한 테스트를 위해 계층화 샘플링 전략을 사용하여 후보 돌연변이 세트를 구성했습니다. 모든 돌연변이는 측정된 기능적 값에 따라 가장 작은 값부터 가장 큰 값 순으로 정렬한 후 10개의 구간으로 균등하게 나누었습니다. 그런 다음 각 구간에서 거의 동일한 수의 돌연변이 샘플을 추출했습니다. 이를 통해 후보 세트가 낮은, 중간, 높은 기능 수준의 샘플을 균형 있게 포함하도록 하여 특정 구간에 샘플이 집중되는 것을 방지하고 테스트 편향을 막았습니다. 동시에 무작위 샘플링으로 인한 결과의 무작위성을 제거하기 위해 각 실험 그룹에 대해 "추출"이라고 하는 세 개의 독립적인 후보 돌연변이 부분 집합을 구성했습니다. 최종 모델 성능 점수는 세 번의 평가 결과의 평균값입니다.
본 연구에서는 각각 10개, 50개, 100개의 돌연변이를 포함하는 세 가지 크기의 후보군을 설정했습니다.순위 결정은 주로 50개의 후보 돌연변이 세트를 기반으로 합니다.실험의 균일성과 공정성을 보장하기 위해 모든 실험 점수는 ProteinGym의 중첩 매크로 집계 규칙을 따랐으며, 이는 측정된 점수가 높을수록 변이 단백질의 기능적 성능이 우수함을 의미합니다.
일반 언어 모델을 위한 단백질 변이 순위 평가를 위한 최초의 표준화된 평가 기준
PG-LLM 벤치마크는 일반 언어 모델의 단백질 돌연변이 시퀀싱 기능을 평가하기 위해 특별히 설계된 표준화된 벤치마크 도구 세트입니다.이 프레임워크는 샘플이 필요 없는 돌연변이 시퀀싱 작업에 대해 공정하고 균일한 워크플로우를 제공하도록 설계되었습니다.구체적으로, 각 작업은 모델에 입력 단백질 서열과 실험 검출 계획 설명만 제공합니다. 다중 서열 비교(MSA) 또는 단백질 3차원 구조 정보를 제공하지 않고, 모델은 50개의 뒤섞인 돌연변이 단백질을 기능적 특성에 따라 자율적으로 분류해야 합니다.
단백질 돌연변이 시퀀싱 작업에서 일반 언어 모델들의 집단적 성능을 체계적으로 평가하고, 단일 모델에 의한 편향된 결론을 방지하며, 일반 언어 모델의 성능 수준을 정량화하고 그 역량 한계를 명확히 하는 것이 본 연구의 목적이다.본 연구에서는 수평적 및 수직적 차원 모두에서 포괄적인 검증을 위해 두 가지 주요 평가 대상 범주를 포함했습니다. 하나는 일반 언어 모델이고, 다른 하나는 특수 단백질 예측 모델입니다.입력 조건 및 평가 규칙과 관련하여, 두 모델의 작동 원리가 다르다는 점을 고려하여 본 연구에서는 일반 언어 모델과 비교하여 특수 예측 모델에 의도적으로 불균등한 입력 조건을 적용했습니다. 일반 언어 모델의 입력 조건이 더 엄격한 것과 달리, 특수 예측 모델은 MSA 또는 단백질 3D 구조 정보와 같은 기본 제공 입력을 사용할 수 있습니다. 평가 규칙은 일반 언어 모델과 동일한 종합 평가 지표를 사용하며, 점수 지표는 스피어만 순위 상관 계수로 나타냅니다. ρ=1은 순위의 완벽한 일치를 나타내고, ρ=0은 단조로운 순위 상관 관계가 없음을 나타냅니다.
구체적으로, 일반 언어 모델에는 Claude Opus 5, GPT 시리즈, Gemini 시리즈, GLM-5.2, Kimi K3 등 현재 널리 사용되는 13개 모델이 포함됩니다. 95개의 전문 단백질 예측 모델 중에서,여기에는 단백질 돌연변이 분야의 최첨단 예측 도구인 VenusREM이 포함됩니다.톈우 테크놀로지 AI 연구소의 기술 과학자인 탄 양(Tan Yang)의 주도하에 개발된 이 검색 기능이 강화된 오픈 소스 단백질 언어 모델은 특히 샘플이 0개인 단위 점 돌연변이 효과 예측에 특화되어 있습니다. 본 연구에서 이 모델은 전문 분야 모델 중 최고의 성능을 보여주며, 클로드 오푸스 5(Claude Opus 5)를 능가하는 결과를 나타냈습니다.
앞서 VenusREM은 하버드 의대 연구팀이 개발한 단백질 돌연변이 효과 평가 벤치마크인 ProteinGym에서 제로샷 예측 성능 부문에서 최고 수준을 달성하며 Meta, BioMap, Microsoft 등에서 개발한 대표적인 모델들을 능가했습니다. VenusREM 모델과 관련 코드는 완전 오픈소스로 공개되었으며, 지난 30일 동안 Hugging Face 플랫폼에서 4,000회 이상, 출시 이후 누적 다운로드 수는 25만 회를 넘어섰습니다.
개발자들이 고급 VenusREM 모델을 신속하게 도입할 수 있도록 지원합니다.HyperAI 공식 웹사이트(hyper.ai)의 튜토리얼 섹션에 "VenusREM: 검색 기반 단백질 돌연변이 효과 예측"이 추가되었습니다.환경 설정이 완료되었으며, 최소한의 노력으로 쉽게 배포할 수 있습니다.
온라인으로 실행:
https://hyper.ai/cn/notebooks/venusrem\-retrieval\-enhanced\-protein\-mutation\-effect\-prediction VenusREM 오픈 소스 주소:
https://github.com/ai4protein/VenusREM
다양한 모델을 아우르는 다차원 비교 실험을 통해 두 가지 유형의 모델 간 기본 메커니즘의 차이점을 밝혀냈습니다.
본 연구의 핵심 결론은 50개의 후보군을 기반으로 하며, 결과는 아래 그림에 나타나 있습니다.

더욱 주목할 만한 점은 수직 모델과 비교했을 때 Claude Opus 5가 중간 수준에도 도달한다는 것입니다. 구체적으로, 95개 방법 중 49개를 능가하며, 여기에는 순수 시퀀스 방법 46개 중 41개, MSA 또는 구조적 방법을 사용하는 복합 방법 49개 중 8개가 포함됩니다. 이는 순수 시퀀스 방법의 중간값인 ρ = 0.374보다 높은 점수에서 확인할 수 있습니다.전용 대형 단백질 모델인 ESM2-650M의 경우 0.411에 가깝지만, VenusREM의 0.523에는 여전히 크게 못 미칩니다.
연구진은 추론 단계에서 컴퓨팅 자원을 늘리는 것이 범용 언어 모델의 성능 향상에 도움이 되는지 추가 검증을 진행했습니다. 그 결과, 모델에 더 많은 사고 시간과 추론 텍스트 출력 시간을 제공했을 때 GPT, Claude, Gemini 모델 모두의 순위 정확도가 향상되는 것을 확인했습니다. 그러나 일정 수준에 도달한 후에는 성능 향상 폭이 점차 줄어들어, 결국 단백질 예측 전문 모델의 성능에는 미치지 못했습니다. (아래 그림 참조)

또한, 순수 서열 예측 도구는 진화적 대조 정보가 충분한 단백질에서 더 나은 성능을 보이는 반면, 범용 대형 모델의 정확도는 대조 정보의 깊이에 거의 영향을 받지 않습니다. 예를 들어, 13개의 범용 언어 모델과 46개의 순수 서열 예측 방법을 180회 테스트에 걸쳐 비교한 결과, 13개 범용 언어 모델의 종합 결과는 대조 정보의 깊이가 낮은 단백질과 높은 단백질 간에 거의 변화가 없었습니다. 낮은, 중간, 높은 대조 정보 그룹에 대한 조정된 성능은 각각 0.313, 0.301, 0.311이었으며, 높은 대조 정보와 낮은 대조 정보 그룹 간의 차이는 -0.002에 불과했습니다. (아래 그림 참조)

마지막으로, 본 연구는 훈련 데이터 오염이 모델의 예측 정확도에 영향을 미치는지 추가적으로 검증했습니다. 그 결과, 원본 문서를 인식할 수 있는 모델의 순위 정확도가 인식하지 못하는 모델에 비해 꾸준히 향상되지 않았으며, 어떤 경우에는 원본 문서를 인식할 수 있는 모델의 점수가 오히려 더 낮았습니다.
잠재적인 융합 방식은 단백질 설계 분야에서 도구를 적용하는 데 새로운 아이디어를 제공합니다.
요약하자면, 본 연구 결과는 범용 언어 모델이 단백질 돌연변이 서열을 예측하는 데 유용하며, 기존의 많은 서열 예측 도구보다 우수한 성능을 보여 실용적인 가치가 있음을 입증했습니다. 그러나 동시에, 범용 언어 모델과 주요 전문 예측 방법 간에는 여전히 상당한 격차가 존재하며, 전문 단백질 예측 방법을 완전히 대체할 수는 없다는 점도 확인했습니다. 그럼에도 불구하고 "전문화"는 핵심이며, 범용 언어 모델과 전문 예측 모델 모두 특정 도메인 작업에만 국한될 수 없으므로, 이 둘의 활용을 어떻게 조율할 것인지가 중요한 과제입니다.
주목할 점은 다음과 같습니다.본 연구의 주요 순위표에서 스피어만 상관계수가 VenusREM을 훨씬 능가하는 VenusREM은 2000년대에 태어난 박사 과정 학생의 주도하에 개발되었습니다.톈우 테크놀로지 AI 연구소의 기술 과학자인 탄 양은 현재 상하이 자오퉁 대학교와 상하이 혁신 아카데미에서 공동 박사 과정을 밟고 있으며, 2025년 졸업 예정입니다. 단백질 돌연변이 효과 예측 및 단백질 엔지니어링을 위한 다중 모달 사전 학습 모델인 VenusREM의 핵심 목표는 단백질의 아미노산 서열, 3차원 구조 및 상동성 정보를 종합적으로 활용하여 후보 돌연변이가 단백질 활성, 안정성 및 결합 능력과 같은 기능적 특성에 미치는 잠재적 영향을 보다 정확하게 평가하는 것입니다.
기존의 단백질 언어 모델은 단일 서열 정보에만 의존하는 반면, VenusREM은 아미노산 서열을 서열 용어로 인코딩하고 각 잔기를 둘러싼 국소적인 3차원 공간 환경을 구조 용어로 이산화합니다. 그런 다음, 분리된 멀티 헤드 크로스 어텐션을 통해 서열 맥락, 국소 구조적 특징, 그리고 잔기 간의 상대적 위치 관계를 동시에 모델링합니다. 이러한 방식으로,이 모델은 아미노산 서열 내 아미노산의 순차적 의존성을 이해할 수 있을 뿐만 아니라, 서열상으로는 멀리 떨어져 있지만 3차원 공간에서는 서로 가까운 아미노산 잔기들 간의 상호작용도 식별할 수 있습니다.
이러한 기반 위에 VenusREM은 단백질 데이터베이스에서 목표 단백질과 관련된 상동 서열을 검색하고 다중 서열 정렬을 통해 각 위치에서 진화적 보존 및 아미노산 치환 선호도를 추출하는 검색 강화 모듈을 추가로 도입했습니다. 이 모델은 서열-구조 공동 특성화와 상동 진화 정보를 가중치로 융합합니다. 목표 단백질에 대한 실험적 라벨링이나 추가 학습이 필요 없는 샘플이 전혀 없는 경우에도 단일점 및 다중점 돌연변이에 대한 적합도 점수를 계산하고 해당 위치에서 돌연변이 및 야생형 아미노산의 예측 점수를 비교하여 후보 돌연변이의 순위를 매깁니다.

탄 양이 인터뷰에서 언급했듯이, 일반 언어 모델과 수직적 모델은 각각 장단점이 있습니다. 전자는 "박식해 보이지만" 전문 분야에 대한 깊이 있는 지식이 부족하고, 후자는 기초 과학 연구 데이터에 대한 깊은 이해는 있지만 사고력과 추론 능력이 부족합니다. 복잡한 실험 요구 사항을 이해하기 위해 일반 언어 모델을 사용하여 인간의 개입을 최소화하고, 이를 수직적 모델과 결합하여 진화적 또는 구조적 정보를 활용해 정확한 점수 계산을 수행하면 더 나은 결과를 얻을 수 있을 것입니다.











