HyperAIHyperAI

Command Palette

Search for a command to run...

从高通量评估到湿实验研究:以检索增强模型推进突变效应预测

Yang Tan Ruilin Wang Banghao Wu Liang Hong Bingxin Zhou

VenusREM:基于检索增强的蛋白质突变效应预测

跳转至 Notebook

摘要

动机:酶工程通过改造野生型蛋白来提升催化活性、热稳定性等性质,是获得满足工业与研究需求酶制剂的关键途径。除传统的定向进化和理性设计外,深度学习的最新进展提供了低成本、高性能的替代方案。这些预训练模型通过编码隐含的共进化模式,已成为强大的工具,其核心挑战在于揭示蛋白质序列、结构与功能之间的复杂关系。结果:我们提出 VENUSREM,一个检索增强的蛋白质语言模型,旨在捕获空间和时间尺度上的局部氨基酸相互作用。VENUSREM 在 ProteinGym 基准的 217 项检测上取得了最先进的性能。除高通量开放基准验证外,我们还对 30 余个突变体进行了低通量事后分析,以验证该模型提升 VHH 抗体稳定性和结合亲和力的能力。我们进一步设计了 DNA 聚合酶的 10 个新型突变体,并通过湿实验评估其在高温下增强的活性,从而验证了 VENUSREM 的有效性。计算机模拟和实验评估不仅证实了 VENUSREM 作为酶工程计算工具的可靠性,也为未来突变效应预测的计算研究展示了一个全面的评估框架。

一句话总结

上海交通大学、华东理工大学和上海人工智能实验室的研究人员提出 VENUSREM,一种检索增强的蛋白质语言模型,能够捕捉空间和时间尺度上的局部氨基酸相互作用,在 ProteinGym 基准的 217 个测定中达到最先进性能,并通过湿实验验证,展示了 VHH 抗体在超过 30 个突变体的后验分析中稳定性和结合亲和力的改善,以及 10 个设计的 DNA 聚合酶突变体在高温下活性的增强,从而建立了突变效应预测的综合评估框架。

核心贡献

  • 本文提出 VENUSREM,一种检索增强的蛋白质语言模型,整合来自同源序列的进化信息以捕捉跨空间和时间尺度的局部氨基酸相互作用,在 217 个 ProteinGym 测定中达到最先进性能。
  • 本工作建立了一个使用低通量实验数据的多维度后验分析方案,以补充高通量基准,无需新的湿实验即可实现独立模型验证;验证了超过 30 个 VHH 抗体突变体的稳定性和结合亲和力改善。
  • 该方法通过设计 10 个新型 DNA 聚合酶单点突变体得到验证,湿实验显示它们在高温下具有增强的活性,证明了其在酶工程中的实际应用价值。

引言

酶是合成生物学的核心,但野生型变体通常活性低、稳定性差或结合弱,这促使酶工程来定制这些特性。在大规模蛋白质序列语料库上预训练的深度学习模型已成为预测突变效应的强大工具,然而现有方法通常只捕获一种或两种模态:序列、结构或来自多序列比对的进化信息。此前没有方法整合全部三种模态,而那些纳入同源数据的方法要么需要额外训练,要么缺乏即插即用的灵活性,导致学习到的表征可能不完整。作者通过 VENUSREM 弥补了这一差距,这是一种预训练的蛋白质语言模型,具有检索增强模块,通过解耦交叉注意力层融合序列和结构 token,并通过比对 tokenizer 无缝注入进化信号,无需额外训练。这种统一的表征在 ProteinGym 基准的 217 个测定中始终优于所有模型,并在计算机模拟和湿实验中可靠地识别有益的单点和多点突变,展示了其在酶工程实际应用中的强大潜力。

数据集

以下是基于提供的论文段落的数据集简要描述。

序列 token

  • 词汇表包含 20 种标准氨基酸和 5 个特殊 token(<pad><cls><eos><unk><mask>)。
  • 预训练语言模型在 Foldseek 聚类后的数据上训练,该数据聚类 AlphaFold2 数据库并保留原始 PDB 结构和氨基酸序列。
  • 推理时仅使用野生型蛋白质序列和结构;不进行突变掩码或逐位突变。

结构 token

  • 从 CATH43-S40 中提取的 4,735,677 个局部结构图构建局部结构码本。
  • 对于每个残基,通过选择空间半径 10 Å 内最多 40 个相邻残基定义局部邻域。距离 ≤10 Å 的残基连接成无向图。
  • 这些图由一个六层几何向量感知器(GVP)自编码器处理,使用去噪目标(Cα 坐标上的高斯噪声和布朗运动)进行训练。
  • 平均池化操作产生一个 256 维向量,然后通过 K-means 聚类映射到 2048 维离散潜在空间(隐式结构词汇表)。

同源序列 三种检索策略为每个蛋白质提供进化信息。对于 217 个 ProteinGym 测定,第一种策略使用预下载的 MSA;另外两种即时计算。

  • EVcouplings 比对: Jackhmmer 在 UniRef100 上搜索,进行五次迭代,比特得分从 0.1 到 0.9(九个搜索组)。选择具有最显著进化耦合的 .a2m 文件。预处理将小写字母转换为大写,并将特殊字符替换为 <pad> token。
  • ColabFold 比对: ColabFold 查询本地 PDB 数据库并输出 .a3m 比对,然后使用 reformat.pl 脚本重新比对以确保兼容性。
  • Foldseek 比对: 通过 Foldseek API 对数据库(afdb50afdb-proteomecath50pdb100)进行结构比对。从查询序列中去除空位,并将目标比对填充至查询序列长度。

评估数据集

  • ProteinGym(替换子集): 217 个高通量测定,超过 250 万个突变。
  • VHH 抗体: 来自 Kang 等人(2025)的 31 个突变体(1–4 个位点突变),评估结合亲和力和耐碱性。结构由 AlphaFold3 预测,同源序列从 UniRef100 检索。

数据使用方式

  • 序列 tokenizer 在 Foldseek 聚类数据上预训练。
  • 结构 tokenizer 在 CATH 的 4.7M 局部结构图上训练。
  • 模型接受野生型序列 token、结构 token 以及来自三个检索流程的处理后的同源比对。然后在 ProteinGym 和 VHH 抗体基准上进行评估。

方法

VENUSREM 框架是一个零样本突变效应预测器,接受野生型蛋白质的序列、结构和同源序列信息作为输入。对于长度为 L 的给定蛋白质,序列直接 token 化为 20 种标准氨基酸加上五个特殊 token(、、、、)的独热向量。局部结构通过离散 token 化流程编码:对于每个残基,根据 10 Å 半径内最多 40 个空间邻居构建图,预训练的几何向量感知器(GVP)自编码器通过平均池化将每个图映射为 256 维连续向量。这些连续向量随后通过 K‑means 聚类量化为 2048 维码本,为每个残基生成一个离散结构 token。GVP 自编码器使用去噪目标训练,用 3D 高斯噪声和布朗运动扰动 Cα 坐标。

序列和结构 token 被送入 BERT 风格的蛋白质语言模型(PLM),该模型使用解耦多头交叉注意力计算原生表征。对于位置 i 和 j,注意力分数由序列 token 嵌入 R_i、R_j、结构 token 嵌入 S_i、S_j 和相对位置编码 P_{ij} 构建。初始注意力表示为:

Attn(i,j)={Ri,Si,Pij}×{Rj,Sj,Pji},\mathrm{Attn}(i, j) = \{\boldsymbol{R}_i, \boldsymbol{S}_i, \boldsymbol{P}_{ij}\} \times \{\boldsymbol{R}_j, \boldsymbol{S}_j, \boldsymbol{P}_{ji}\}^\top,Attn(i,j)={Ri,Si,Pij}×{Rj,Sj,Pji},

在丢弃不含残基信息的项后,简化为五个与氨基酸相关的分量:

Attn(i,j)=RiRj+RiSj+RiPji+SiRj+PijRj=QiR(KjR)+QiR(KjS)+QiR(KjiP)+QiS(KjR)+QijP(KjR).\begin{aligned} \mathrm{Attn}(i, j) &= \boldsymbol{R}_i \boldsymbol{R}_j^\top + \boldsymbol{R}_i \boldsymbol{S}_j^\top + \boldsymbol{R}_i \boldsymbol{P}_{ji}^\top + \boldsymbol{S}_i \boldsymbol{R}_j^\top + \boldsymbol{P}_{ij} \boldsymbol{R}_j^\top \\ &= \boldsymbol{Q}_i^R (\boldsymbol{K}_j^R)^\top + \boldsymbol{Q}_i^R (\boldsymbol{K}_j^S)^\top + \boldsymbol{Q}_i^R (\boldsymbol{K}_{ji}^P)^\top \\ &\quad + \boldsymbol{Q}_i^S (\boldsymbol{K}_j^R)^\top + \boldsymbol{Q}_{ij}^P (\boldsymbol{K}_j^R)^\top. \end{aligned}Attn(i,j)=RiRj+RiSj+RiPji+SiRj+PijRj=QiR(KjR)+QiR(KjS)+QiR(KjiP)+QiS(KjR)+QijP(KjR).

注意力分数按 1/5d1/\sqrt{5d}1/5d 缩放(dddQR\boldsymbol{Q}^RQR 的维度),用 softmax 归一化,并用于更新隐藏表征:

Ro=σ ⁣(Hattn5d)VR.\boldsymbol{R}_o = \sigma\!\left(\frac{\boldsymbol{H}_{\mathrm{attn}}}{\sqrt{5d}}\right) \boldsymbol{V}^R.Ro=σ(5dHattn)VR.

PLM 在大型蛋白质结构语料库上预训练,因此为每个位置 i 和词汇索引 v 生成原生 logits 张量 Oivnative\boldsymbol{O}_{iv}^{\mathrm{native}}Oivnative

同时,使用三种策略之一检索查询蛋白质的同源序列:基于 EVcouplings 的 MSA、ColabFold 自动 MSA 重新比对或 Foldseek 结构比对。比对后的序列被组装成包含 N 条同源序列的多序列比对(MSA)。对于每个残基位置 i,通过统计 N 条序列中每种氨基酸类型的出现次数计算频率向量,归一化后形成计数矩阵 C\mathbf{C}C

Civ=n=1NI(Ani=v)v=1Vn=1NI(Ani=v),\mathbf{C}_{iv} = \frac{\sum_{n=1}^{N} \mathcal{I}(\mathbf{A}_{ni} = v)}{\sum_{v=1}^{V} \sum_{n=1}^{N} \mathcal{I}(\mathbf{A}_{ni} = v)},Civ=v=1Vn=1NI(Ani=v)n=1NI(Ani=v),

其中 V=25V=25V=25I\mathcal{I}I 为指示函数。然后通过 softmax 和对数变换获得进化 logits:

Oivevo=log ⁣(exp(Civ)v=1Vexp(Civ)).\mathbf{O}_{iv}^{\mathrm{evo}} = \log\!\left(\frac{\exp(\mathbf{C}_{iv})}{\sum_{v=1}^{V} \exp(\mathbf{C}_{iv})}\right).Oivevo=log(v=1Vexp(Civ)exp(Civ)).

最终输出 logits 是原生和进化贡献的加权组合,由参数 α[0,1]\alpha \in [0,1]α[0,1] 控制:

Oivout=(1α)Oivnative+αOivevo.\boldsymbol{O}_{iv}^{\mathrm{out}} = (1 - \alpha) \cdot \boldsymbol{O}_{iv}^{\mathrm{native}} + \alpha \cdot \boldsymbol{O}_{iv}^{\mathrm{evo}}.Oivout=(1α)Oivnative+αOivevo.

对于给定突变体,其突变位置集合为 T\mathcal{T}T,每个位置 ttt 将野生型残基 vvv 变为 vv'v,零样本适应度分数为所有突变位点 logit 差之和:

Fx=tT(OtvoutOtvout).F_x = \sum_{t \in \mathcal{T}} (\boldsymbol{O}_{t v'}^{\mathrm{out}} - \boldsymbol{O}_{t v}^{\mathrm{out}}).Fx=tT(OtvoutOtvout).

这种评分方案捕捉了相对于野生型的适应度变化预测,无需任何突变特异性训练,仅依赖集成的序列、结构和进化信号。

实验

VENUSREM 的评估涵盖 ProteinGym 上的高通量基准测试、VHH 抗体突变体的后验分析以及 phi29 DNA 聚合酶的前瞻性湿实验工程。通过整合序列、结构和进化信息,VENUSREM 在排行榜上取得顶尖表现,并在不同属性类型上实现稳健的适应度预测。它可靠地捕捉了多点突变对抗体结合和耐碱性的影响,在湿实验环境中,它设计的酶变体同时提高了活性和热稳定性,证实了其在蛋白质工程中的实际应用价值。

VenusREM 在 ProteinGym 基准上取得了最高的总体平均 Spearman 相关性,优于所有其他模型。它在活性、结合和表达预测中排名第一,在稳定性中排名第二,在生物体适应度中排名第三。通过整合序列、结构和进化信息,它超越了仅依赖这些模态子集的模型。VenusREM 获得了最佳的总体平均 Spearman 相关性,明显领先于第二名 ProSST。它在活性、结合和表达预测中领先,在稳定性上紧随 ProSST 之后排名第二。序列、结构和进化特征的整合使 VenusREM 优于仅使用其中一种或两种输入的模型。在生物体适应度方面,进化感知模型 PoET 和 TranceptEVE 占据前两名,VenusREM 位列第三。

在 ProteinGym 基准上,VenusREM 取得了最高的总体平均 Spearman 相关性,在活性、结合和表达预测中领先,同时在稳定性中排名第二,在生物体适应度中排名第三。其序列、结构和进化特征的整合使其优于仅依赖其中一种或两种模态的模型。结果突显了结合多种数据类型在多样化的蛋白质功能预测任务中能带来更优的性能。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供