Command Palette
Search for a command to run...
PG-LLM:面向蛋白质变体排序的通用语言模型基准评测
PG-LLM:面向蛋白质变体排序的通用语言模型基准评测
Rohit Arora Leo Tianlai Chen Melissa Du Debora S. Marks George M. Church
摘要
通用语言模型正越来越多地被用于蛋白质设计流程,但其评估变体效应的能力尚不明确。为回答这一问题,我们构建了 PG-LLM,一个基于 ProteinGym 的基准,用于在 217 项蛋白质变体优先级排序任务上评估通用语言模型。每项任务遵循相同格式:语言模型接收一条野生型蛋白质序列和一项实验描述,需在不依赖多序列比对或蛋白质结构的情况下,按适应性对 50 条突变序列进行排序。我们在相同的候选集上,使用相同的评估指标,对 13 个语言模型进行了评估,并对 95 个已发表的蛋白质预测器进行了重新评分。Claude Opus 5 以 Spearman 相关系数 ρ = 0.406 领跑主要排行榜,略微领先于 GPT-5.6 Sol 的 0.402。然而,当仅在两者都评分的实验上比较时,GPT-5.6 Sol 的得分高于 Opus 5。Opus 5 的表现优于 95 个已发表蛋白质预测器中的 49 个,包括 46 个纯序列方法中的 41 个,并接近 ESM2-650M 的 ρ = 0.411,但仍低于领先预测器 VenusREM 的 ρ = 0.523。在 GPT、Claude 和 Gemini 系列模型中,变体排序性能随测试时计算量的增加而提升,但增益逐渐减弱,未能弥合与专用蛋白质预测器的差距。与在具有更深进化比对的蛋白质上表现更好的纯序列预测器不同,大语言模型的准确性随比对深度的变化很小。PG-LLM 表明,无需工具辅助的语言模型能捕获大量蛋白质变体信号,并已超越许多成熟的基于序列的预测器。这些结果确立了语言模型作为生物分子推理器的新兴能力,同时明确了其在变体优先级排序流程中可靠应用尚存的提升空间。
一句话总结
哈佛大学与Capable的研究人员提出PG-LLM,这是一个基于ProteinGym的基准,在217个蛋白质变体排序任务上评估13个通用语言模型,结果显示Claude Opus 5以ρ=0.406领先,优于许多无需多序列比对的纯序列预测器,但仍落后于专用模型VenusREM(ρ=0.523),而测试时计算的增益逐渐减弱。
核心贡献
- 基准PG-LLM仅使用野生型序列、实验描述和50个突变体,无需序列比对或结构信息,在ProteinGym的217个蛋白质变体优先级排序任务上评估通用语言模型。
- 比较十三个语言模型和95个已发表预测器后发现,Claude Opus 5的Spearman相关系数达到0.406,超越95个预测器中的49个,包括大多数纯序列方法,但仍低于专用模型VenusREM的0.523。
- 在GPT、Claude和Gemini系列模型中,增加测试时计算能改善变体排序,但增益在达到专用预测器水平前减弱,且与纯序列方法不同,大语言模型的准确性对序列比对的深度不敏感。
引言
蛋白质变体的功能测试优先级排序是蛋白质工程中的核心挑战,而深度突变扫描(DMS)提供了序列-功能关系的密集图谱。目前最先进的专用预测器整合了进化、结构和蛋白质家族信息,但通用语言模型可能通过解读实验目标并对候选序列进行推理,从而简化这一流程,无需专用的蛋白质建模流程。此前对该能力的评估仅限于单一模型家族在ProteinGym实验子集上的测试,缺乏与更广泛预测器格局的对比或关键性能因素的分析。作者引入PG-LLM,这一基准在所有217个ProteinGym替换实验上,将十三个通用语言模型与95个已发表的蛋白质预测器进行比较。评估每个模型在排序任务上的表现,仅提供野生型序列、实验描述和打乱顺序的突变体序列,无需序列比对或结构信息。该工作揭示前沿模型能捕获大量蛋白质变体信号,但尚未达到最强的专用系统,表明变体排序是通用语言模型的一项新兴能力。
数据集
作者从ProteinGym v1.3的替换部分构建PG-LLM基准,使用186个蛋白质上的全部217个实验。每个实验包含具有实验适应度值(数值越大表示性能越好)的变体。基准包含148个单替换实验和69个多突变变体实验。
-
候选集构建 对于每个实验,变体按测量的适应度排序,分为十个等频次的区间,然后从每个区间大致采样相同数量的变体。这种分层采样确保候选集覆盖整个性能范围,而非集中在均值附近。采样后的变体随机打乱并分配唯一标识符。
-
抽取次数 每个实验生成三个独立采样的候选集(抽取1-3),使用固定种子1-3。每个评估的模型和预测器在同一抽取内对相同变体进行测试。抽取分数单独报告,实验层面的分析则平均可用的抽取分数。
-
候选集大小 主要排行榜使用固定的候选集长度。此外,基准通过测试N=10、50和100的三个固定抽取来评估候选集大小的影响(如文中所述)。
-
提示格式 每个提示包含蛋白质和生物体名称、测量的表型简短描述、对应更好性能的方向、完整野生型序列以及打乱顺序的全长突变体序列。模型必须推断序列变化与所述实验之间的关系,联合比较所有候选,并返回一个从最高预测性能到最低的JSON排序。提示刻意不提供来源出版物、突变表示法、实验测量值、多序列比对和结构信息。
-
用途 PG-LLM基准是一个零样本评估套件,不提供训练数据。大语言模型和已发表的预测器通过其在相同候选集上排序变体的能力进行比较。所有聚合结果、实验水平预测和provider可见的轨迹均可在ProteinGymLLM.com获取,评估代码通过PG-LLM GitHub仓库发布。
方法
作者设计PG-LLM基准,用于评估大语言模型在特定蛋白质工程任务上的表现:给定实验目标,将一组变体氨基酸序列按预期实验性能排序。
任务形式与候选集构建 每个提示遵循标准化模板,提供蛋白质和生物体名称、测量的表型简短描述、对应更好性能的方向、完整野生型序列以及打乱顺序的全长突变体序列。提示刻意不提供来源出版物、突变表示法、实验测量值、多序列比对和结构数据。模型必须推断序列变化与所述实验的关系,并返回一个从最高预测性能到最低的单一JSON排序。
为构建候选集,作者利用ProteinGym v1.3替换部分中186个蛋白质上的217个实验。每个实验中的变体按测量的适应度排序,分为十个等频次区间。从每个区间大致采样相同数量的变体,确保候选集覆盖该实验的测量适应度范围,而非集中在中心附近。变体顺序随后随机打乱,并为每个变体分配唯一标识符。每个实验使用固定种子生成三个独立采样的候选集,称为抽取。
模型推理与输出解析 作者在纯文本条件下评估十三个通用语言模型,无需外部工具、检索或程序执行。不同模型配置不同级别的推理努力,例如某些模型使用max推理,其他则使用high或xhigh。模型被指示返回一个包含“ranking”数组的JSON对象,该数组包含候选标识符。解析流程首先搜索精确的双引号“ranking”数组。如果失败,则根据候选标识符在响应中首次出现的顺序提取。若响应包含至少80%的预期标识符,则视为合格,任何遗漏的标识符按提示顺序附加在显式排名之后。
评分、聚合与基线对比 对于每个基准单元,将返回的候选排名与实验值比较,使用Spearman秩相关系数ρ。为聚合这些分数,主要排行榜采用嵌套宏平均方法。每个抽取分别计算完整的嵌套宏平均分数,然后取平均。在单个抽取内,每个蛋白质-功能类别单元内的重复实验取平均,每个功能类别内蛋白质取平均,然后对五个类别均值赋予相等权重。这种层次结构防止有许多实验的蛋白质或有许多蛋白质的类别主导整体分数。
作者还将大语言模型与95个已发表的预测器进行比较,包括46个纯序列方法和49个利用序列比对、结构或两者兼有的方法。对于每组突变体序列,将每个预测器发布的分数表限制在所选变体上,进行排序,并使用相同的指标和聚合流程进行评估。
实验
PG-LLM基准评估通用大语言模型根据实验描述和序列,按预期适应度对蛋白质变体进行排序的能力,使用Spearman相关系数与实验测量值比较。最佳大语言模型Claude Opus 5和GPT-5.6 Sol超越了许多纯序列专用预测器,但低于基于序列比对/结构的方法,且当候选集变大时,其准确性下降,而专用模型不受影响。测试时扩展带来递减的回报,大语言模型的性能并未从更深的进化比对中受益,表明其依赖不同的知识来源。这些结果展示了大语言模型中涌现的蛋白质推理能力,但并不能替代专用模型。