Command Palette
Search for a command to run...
LLMにおけるタンパク質変異ランキングのための初の標準化されたベンチマーク!ハーバード大学の研究チームが、13の主流モデルと95の特殊モデルを一度に評価するPG-LLMを提案しました。

ChatGPTやDoubaoと初めてチャットした時の驚きを覚えていますか?普遍的な言語モデルに基づいて構築されたこれらのツールは、詩作や時事問題の理解だけでなく、絵画、手紙の執筆、プログラミングなど、あらゆる分野で人々を驚嘆させる能力を備え、まるで全知全能のように見えました。しかし、文化、芸術、科学といった分野において「全能」に見えるこのようなインテリジェントなアシスタントに対して、科学者の間では、高度な知識が必要とされる専門分野で、普遍的な言語モデルはどれほど優れた性能を発揮できるのか、という疑問がますます高まっています。
タンパク質工学においては、汎用言語モデルは生物学的知識と推論のベンチマークにおける性能向上により、タンパク質設計プロセスにおいてますます活用されるようになっている。しかしながら、タンパク質変異の影響を評価する能力については、科学者の間で明確な理解が得られていない。いくつかの技術報告書では、汎用言語モデルの評価結果が示されているが(例えば、Anthropicシステム技術報告書で言及されているProteinGym-Hard評価ではClaudeシリーズモデルが評価されている)、これらの研究には、モデル集団の限定や横断的な比較検証の欠如など、多くの問題点が残っている。
これを考慮して、ハーバード大学とCapable社の研究チームは、ProteinGymデータセットに基づいて構築されたPG-LLMベンチマークを提案した。今回初めて、13種類の汎用言語モデルと95種類のタンパク質予測ツールを、統一された評価基準に基づいて同時に評価しました。PG-LLMベンチマークテストを通して、汎用言語モデルが実際にタンパク質変異スクリーニングを実行できることが初めて確認され、高い実用性を持ち、成熟した専門予測ツールの少なくとも半数を上回る性能を発揮することが実証されました。このベンチマークの導入は、タンパク質工学分野における新興ツールの開発を強力に支援するとともに、タンパク質設計に全く新しい発想をもたらす可能性を秘めています。
関連する研究成果は、「PG-LLM:タンパク質変異ランキングのための汎用言語モデルのベンチマーク」と題され、プレプリントとしてbioRxivに掲載されている。
研究のハイライト:
*汎用言語モデルPG-LLMにおけるタンパク質変異ランキングのための初の標準化ベンチマークの確立
* 大規模なモデル間比較実験を実施し、汎用言語モデルと特化型タンパク質予測モデル間の性能境界を明確に定義する。
* 多次元的な実験的視点を提供し、2種類のモデルの根本的なメカニズムの違いを明らかにし、潜在的な融合ソリューションの基礎を提供する。

論文リンク:https://www.proteingymllm.com/paper
ProteinGymデータセットを基にしたこのデータセットは、217セットの実験データを網羅しています。
PG-LLMは、タンパク質変異予測分野における普遍的に標準化されたベンチマークデータセットであるProteinGymデータセットに基づいて構築されています。本研究では、ProteinGym v1.3の完全なディープ変異スキャンデータセットを使用します。対象としたのは186種類のタンパク質と、合計217セットの実験データである。これらのうち、148グループは単一点突然変異実験のみによって決定され、残りの69グループは多部位複合突然変異実験によって決定された。
テストの公平性を確保するため、候補変異セットの構築には層別サンプリング戦略が採用されました。すべての変異は、測定された機能値の小さい順から大きい順に並べられ、10の区間に均等に分割されました。各区間からほぼ同数の変異サンプルが抽出されました。これにより、候補セットが低、中、高機能レベルのサンプルをバランスよく網羅し、単一の区間へのサンプルの集中を防ぎ、テストの偏りを回避することができました。同時に、ランダムサンプリングによって生じる結果のランダム性を排除するため、各実験グループごとに「抽出」と呼ばれる3つの独立した候補変異のサブセットが構築されました。最終的なモデル性能スコアは、3つの評価結果の平均値でした。
本研究では、それぞれ10個、50個、100個の変異を含む3つの候補セットサイズを設定した。ランキングの結論は、主に50個の候補変異に基づいている。実験の均一性と公平性を確保するため、すべての実験スコアはProteinGymのネスト型マクロ集計ルールに従いました。つまり、測定されたスコアが高いほど、変異タンパク質の機能的性能が優れていることを意味します。
汎用言語モデルにおけるタンパク質変異ランキングのための初の標準化された評価ベンチマーク
PG-LLMベンチマークは、汎用言語モデルのタンパク質変異配列決定能力を評価するために特別に設計された、標準化されたベンチマークツール群です。このフレームワークは、サンプル数ゼロの変異シーケンス解析タスクにおいて、公平かつ統一されたワークフローを提供するように設計されています。具体的には、各タスクでは、入力タンパク質配列と実験検出計画の説明のみがモデルに提供されます。多重配列比較(MSA)やタンパク質の三次元構造情報が提供されないため、モデルは50個のランダムに並べ替えられた変異タンパク質を、その機能的品質に基づいて自律的に分類する必要があります。
タンパク質変異配列決定タスクにおける汎用言語モデルの総合的なパフォーマンスを体系的に評価し、単一モデルからの偏った結論を回避し、汎用言語モデルのパフォーマンスレベルを定量化し、その能力の限界を明確にするために、本研究では、水平方向と垂直方向の両方から包括的な検証を行うための評価対象として、大きく分けて2つのカテゴリーを設定した。1つは汎用言語モデル、もう1つは特化したタンパク質予測モデルである。入力条件と評価ルールに関して、2種類のモデルの動作原理の違いに基づき、本研究では、汎用言語モデルと比較して、特化型予測モデルに対して意図的に異なる入力条件を採用しています。後者のより厳格な入力条件とは異なり、前者はMSAやタンパク質の3D構造情報など、ネイティブに提供される入力を使用できます。評価ルールは、汎用言語モデルと同じ集計評価指標を使用し、スコア指標はスピアマン順位相関係数で表されます。ρ=1はランキングの完全な一貫性を示し、ρ=0は単調な順位相関がないことを示します。
具体的には、一般言語モデルには、Claude Opus 5、GPTシリーズ、Geminiシリーズ、GLM-5.2、Kimi K3など、現在主流の13モデルが含まれています。95の専門的なタンパク質予測モデルの中で、これには、タンパク質変異の分野における最先端の予測ツールであるVenusREMが含まれています。Tianwu Technology AI Labの技術科学者であるTan Yang氏の主導で開発された、検索機能を強化したオープンソースのタンパク質言語モデルは、特にゼロサンプル単位点突然変異効果予測のために設計されています。本研究では、専門分野のモデルの中でもトップクラスの性能を発揮し、Claude Opus 5を凌駕しました。
以前、VenusREMは、ハーバード大学医学部の研究チームが構築したタンパク質変異の影響を評価するベンチマークであるProteinGymにおいて、Meta、BioMap、Microsoftなどのチームが開発した代表的なモデルを凌駕する、優れたゼロショット予測性能を達成しました。VenusREMモデルおよび関連コードは完全にオープンソース化されており、過去30日間でHugging Faceプラットフォーム上で4,000回以上、リリース以来25万回以上ダウンロードされています。
開発者が高度なVenusREMモデルを迅速に導入できるようにするためにHyperAIの公式ウェブサイト(hyper.ai)のチュートリアルセクションに、「VenusREM:検索機能を強化したタンパク質変異効果予測」が掲載されました。環境設定は完了しており、最小限の労力で簡単にデプロイできます。
オンラインで実行:
https://hyper.ai/cn/notebooks/venusrem-retrieval-enhanced-protein-mutation-effect-prediction
VenusREMのオープンソースアドレス:
https://github.com/ai4protein/VenusREM
複数のモデルにわたる多次元比較試験により、2種類のモデル間の根本的なメカニズムの違いが明らかになった。
本研究の主要な結論は、50個の候補セットに基づいており、その結果を以下の図に示す。

結果によると、Claude Opus 5 はスピアマン相関係数 ρ=0.406 で汎用言語モデルのリーダーボードのトップに立ち、それに僅差で GPT-5.6 Sol が ρ=0.402 で続いています。ただし、この結果は絶対的なものではありません。両方のモデルがテストを完了できた実験を比較すると、例えば 180 の共通評価指標において、GPT-5.6 Sol の方が実際には優れたパフォーマンスを示しました。GPT-5.6 Solのスコアは、GPT-5.6のスコアを0.409対0.400上回った。
さらに注目すべきは、垂直モデルと比較しても、Claude Opus 5は中央値レベルに達している点です。具体的には、95の手法のうち49の手法を上回っており、その中には46の純粋なシーケンス手法のうち41の手法、およびMSAまたは構造的手法を用いた49の複合手法のうち8の手法が含まれています。これは、純粋なシーケンス手法の中央値ρ = 0.374よりも高いスコアにも反映されています。専用の大型タンパク質モデルESM2-650Mでは0.411に近い値だが、VenusREMの0.523には依然として大きく劣る。
推論フェーズにおける計算リソースの増加が汎用言語モデルの能力向上につながるかどうかをさらに検証するため、研究者らは追加検証を実施した。その結果、モデルに思考時間と推論テキストの出力を増やすことで、GPT、Claude、Geminiのいずれのモデルにおいてもランキング精度が向上することが示された。しかし、ある一定のレベルに達すると、性能向上は徐々に収束し、最終的には特化型タンパク質予測モデルに追いつくことはできなかった。(下図参照)

しかし、リソースを増やすことが常に有益とは限りません。候補セットのサイズを大きくすると、汎用言語モデルに逆効果をもたらす場合があります。例えば、候補サイズが10から100に増加すると、GPT-5.6 Solの178の共通指標におけるスコアは、実際には0.423から0.375に低下します。他の汎用言語モデルのパフォーマンス低下も避けられません。それとは対照的に、ESM2-150M、ESM2-650M、VenusREMなどの垂直モデルはほとんど影響を受けていない。
さらに、純粋な配列予測ツールは、十分な進化的な対比情報を持つタンパク質に対してより優れた性能を発揮する一方、汎用的な大規模モデルの精度は対比の深さにほとんど影響されない。例えば、13種類の汎用言語モデルと46種類の純粋な配列手法を比較した実験では、180回のテストにおいて、13種類の汎用言語モデルの集約結果は、低深度タンパク質と高深度タンパク質の間で実質的に変化しなかった。低深度、中深度、高深度グループの調整済み性能はそれぞれ0.313、0.301、0.311であり、高深度と低深度の差はわずか-0.002であった。(下図参照)

対照的に、純粋シーケンス法の平均値は、低深度での0.309から中深度での0.380、高深度での0.411へと徐々に増加し、その差は+0.102であった。さらに、46の方法のうち45の方法の点推定では、高深度での性能が低深度での性能よりも優れていることが示された。
最後に、本研究では、訓練データの汚染がモデルの予測精度に影響を与えるかどうかをさらに検証した。その結果、元の文書を認識できるモデルのランキング精度は、認識できないモデルと比較して着実に向上するわけではなく、場合によっては、元の文書を認識できるモデルのスコアがさらに低くなることが示された。
潜在的な融合スキームは、タンパク質設計分野におけるツールの応用に関して新たなアイデアを提供する。
要約すると、本研究の結果は、汎用言語モデルがタンパク質変異配列を予測する能力を確実に示しており、その性能は多くの古典的な配列予測ツールを凌駕し、実用的な価値を示している。しかしながら、汎用言語モデルと最先端の専門予測手法との間には依然として大きな隔たりがあり、専門的なタンパク質予測手法を完全に置き換えることはできないことも確認された。とはいえ、「専門化が鍵」であり、汎用言語モデルも専門予測モデルも特定のドメインのタスクにのみ使用できるわけではない。両者の連携方法も重要な課題である。
注目すべきは本研究の主要なリーダーボードにおいて、スピアマン相関係数がVenusREMをはるかに上回るVenusREMは、2000年代生まれの博士課程学生の主導で開発された。天武科技AI研究所の技術科学者である譚陽氏は、現在、上海交通大学と上海イノベーションアカデミーの共同博士課程に在籍しており、2025年度卒業予定です。VenusREMは、タンパク質変異の影響予測とタンパク質工学のためのマルチモーダル事前学習モデルであり、タンパク質のアミノ酸配列、三次元構造、相同性情報を共同で利用して、候補となる変異がタンパク質の活性、安定性、結合能力などの機能特性に及ぼす潜在的な影響をより正確に評価することを主な目的としています。
従来のタンパク質言語モデルは単一の配列情報のみに依存していますが、VenusREMはアミノ酸配列を配列用語として符号化し、各残基を取り巻く局所的な3次元空間環境を構造用語として離散化します。そして、配列コンテキスト、局所的な構造的特徴、および残基間の相対的な位置関係を、分離されたマルチヘッドクロスアテンションによって共同でモデル化します。このようにして、このモデルは、アミノ酸配列におけるアミノ酸の順序依存性を理解できるだけでなく、配列上では離れているものの、三次元空間では互いに近い位置にある残基間の相互作用も特定できる。
この基盤の上に、VenusREMはさらに検索強化モジュールを導入し、タンパク質データベースから標的タンパク質に関連する相同配列を検索し、多重配列アライメントを通じて各部位における進化的な保存性とアミノ酸置換の傾向を抽出します。このモデルは、配列と構造の統合的な特徴付けと相同な進化情報を重み付けして融合します。サンプルがゼロであっても、標的タンパク質の実験的な標識や追加のトレーニングは不要で、単一点変異と多点変異の適合度スコアを計算し、対応する部位における変異型アミノ酸と野生型アミノ酸の予測スコアを比較することで、候補となる変異をランク付けします。

続いて、タン・ヤン博士は、VenusREMをベースとした、社内における対話型タンパク質研究開発インテリジェントエージェントであるMatwingsVenus™の開発と実装を主導した。 MatwingsVenus™の最大の特長は、まさに「対話型研究開発」を実現している点です。高度なコーディングや複雑なモデル構築を必要とせず、まるで日常会話のようにコマンドを発行するだけで、AIがタンパク質の設計、予測、そして全工程の検証を自律的に完了させることができます。先月開催された2026年世界人工知能会議では、この「AI科学者」の成果が輝きを放ち、アリババや百度といった業界大手と並んで「会議の至宝」の称号を獲得。同会議に選ばれた唯一の科学系インテリジェント製品となりました。
Tan Yang氏がインタビューで述べたように、汎用言語モデルと垂直モデルにはそれぞれ長所と短所がある。前者は「博識」ではあるが専門分野における深い知識に欠け、後者は基礎となる科学研究データに対する深い理解はあるものの、思考力や推論能力に欠ける。汎用言語モデルを用いて複雑な実験要件を理解し、人間が関与する仕組みを構築し、それを垂直モデルと組み合わせて進化情報や構造情報を活用した正確なスコアリングを行うことで、より良い結果が得られる可能性がある。








