HyperAIHyperAI

Command Palette

Search for a command to run...

基于 Claude 的自主从头蛋白质结合剂设计

Amir Shanehsazzadeh

摘要

用于蛋白质结构生成、序列设计和结构预测的深度学习方法,如今使得仅需数十个设计即可针对众多靶标进行从头结合剂设计。然而,一次设计活动仍需要涵盖靶标生物学、结构建模以及快速迭代的计算工具集的专业知识,并需数天时间来协调软件与计算资源。我们探究了 AI 智能体能够在多大程度上提供此类专业知识和劳动。我们将一次结合剂设计活动的工作知识写入一个统一的协议提示中,该提示不针对任何靶标指定表位、支架或序列。基于该提示,在没有任何人类参与设计决策的情况下,Claude Opus 4.8 和 Mythos Preview 针对 16 个靶标开展了 24 至 48 小时的设计活动。它们研究每个靶标、选择表位、安装并运行开源蛋白质设计和结构预测模型、在计算机上优化候选分子,并为每个靶标交付 30 个排序设计。两家独立的合同研究组织完全按照交付内容合成了每一个设计并测量了其结合情况,其中 16 个靶标中有 15 个获得了可解释的测量结果。Claude 针对其中 14 个靶标设计了结合剂,1,320 个设计中有 354 个发生结合,命中率为 27%;在每次活动中针对每个靶标排名第一的设计中,49% 发生结合。在单次 48 小时会话中同时针对所有靶标进行设计时,Mythos Preview 和 Opus 4.8 的命中率分别为 26.7% 和 22.6%;在 24 小时会话中一次针对一个靶标进行设计时,Mythos Preview 的命中率为 35.1%。在 E3 连接酶亚基 RBX1 上——该靶标最近是一项公开设计竞赛的主题,竞赛中 245 个从头设计中有 9 个发生结合——Claude 的 90 个设计中有 28 个发生结合。最紧密结合的解离常数 KDK _ { \mathrm { D } }KD 为 3.9 nM,而在同一平板上重新合成并测量的竞赛获胜设计的解离常数为 45 nM。尽管跨物种反应性仅是提示中的次要目标,但在针对其靶标的小鼠直系同源物进行测试的 233 个结合剂中,有 130 个也与之结合。Claude 使用的每个模型都是开源的,这使得此类设计活动在任何实验室都触手可及。我们公开了提示、全部 1,440 个设计的计算模型,以及具有可靠测量结果的 1,320 个设计的结合数据,作为自主结合剂设计的可复现协议和该领域的基准数据集。

一句话总结

Anthropic 研究人员证明,Claude Opus 4.8 和 Mythos Preview 在单一协议提示的引导下、且任何设计决策均无人工输入,自主针对 16 个靶点开展了从头结合剂设计活动,使用开源蛋白质设计和结构预测模型,实现了 27% 的命中率(1320 个设计中有 354 个)和排名靠前设计中 49% 的结合率,包括 RBX1 上 KDK _ { \mathrm { D } }KD 为 3.9 nM,并发布了提示、全部 1440 个设计的计算模型,以及 1320 个具有可靠测量数据的设计的结合数据。

核心贡献

  • 本文提出一种基于单一冻结提示的自主蛋白质结合剂设计协议,该提示不指定任何表位、支架或序列;在该协议下,Claude Opus 4.8 和 Mythos Preview 研究靶点、选择表位、运行开源设计和结构预测工具,并在没有任何人工设计决策输入的情况下提供排序的从头结合剂。
  • 两家独立合同研究组织在 15 个可解释靶点上进行的实验验证发现 14 个靶点存在结合剂,1320 个合成设计中有 354 个结合(27% 命中率),排名第一的设计中 49% 结合;在 RBX1 上,90 个设计中有 28 个结合,最紧密 KD 为 3.9 nM,而竞赛获胜条目为 45 nM。
  • 本研究发布了提示、全部 1440 个设计的计算模型、每个设计的来源记录以及 1320 个设计的结合测量数据,建立了可复现的协议和用于自主结合剂设计的基准数据集。

引言

从头蛋白质结合剂的设计对治疗和诊断很重要,但典型项目依赖专家科学家选择靶点、挑选表位、运行设计工具并对候选物排序。以往的 AI 辅助流程和 agent 系统支持了该工作流的部分环节,但仍依赖大量人工干预,且很少在大规模、完整实验报告的情况下接受测试。作者通过展示 Claude 仅凭一份书面协议和开源工具即可自主开展针对 16 个靶点的结合剂设计活动来填补这一空白,从靶点构建到最终排序的每个设计决策均由 Claude 做出,并在大多数靶点上产生了经过实验验证的结合剂。

方法

作者利用一份全面的协议提示来引导 AI agent 完成自主蛋白质结合剂设计活动。该提示约 16,000 词,作为每个 agent 实例的系统提示加载。它封装了专家设计者的知识,定义了活动阶段、可用工具和选择标准,同时将具体决策留给 agent。agent 自主研究靶点生物学,选择建模区域和表位,并从预先审查的骨架生成和序列设计开源工具菜单中选择工具。在投入计算资源评分前,agent 会根据新颖性和序列组成过滤候选物。

有关该协议的详细结构,请参见框架图。

该提示分为三个主要主题块。“科学与工具”块(34.2%)提供设计所需的工作知识,包括靶点档案、表位选择、设计工具菜单、评分前过滤器和具体排序分数。“编排与验证”块(34.7%)通过定义子 agent 委派、时间线纪律和验证规则,实现 24 至 48 小时的持续自主运行。“运维”块(31.1%)管理计算预算、节奏调控和最终报告交付物。

为了评估并选择每个靶点排名前 30 的设计,agent 使用基于结构预测器集成的特定排序分数。

如下图所示,作者确定将 Protenix v2、ESMFold2 和 ESMFold2-Fast 的分数进行集成,在区分结合剂与非结合剂方面获得了最高的宏平均精度。

该排序分数将来自这三个预测器的 z 分数化 ipSAEmin\mathrm{ipSAE}_{\min}ipSAEmin(interaction predicted Structural Alignment Error,相互作用预测结构对齐误差)与自洽 DockQ(sc-DockQ)项结合,后者的权重为四分之一。sc-DockQ 项用于检查预测构象是否与设计复合物一致,尽管它们不会显著改变区分能力。

在自主设计活动之后,作者应用了独立于湿实验室工作的标准化重评分协议。每个订购设计都使用十个公开可用的共折叠预测器在统一设置下进行评估。记录每个预测器五个种子的最大 ipSAEmin\mathrm{ipSAE}_{\min}ipSAEmin

这些重评分置信值与实验结合命中率的校准关系如下图所示。

三个活动预测器的平均 ipSAEmin\mathrm{ipSAE}_{\min}ipSAEmin 与各靶点命中率之间存在强相关性。为了对设计进行实验验证,作者使用了两家独立合同研究组织(CRO):Adaptyv Bio 和 Twist Bioscience。Adaptyv Bio 通过无细胞合成表达设计,并使用表面等离子体共振(SPR)或生物层干涉测量(BLI)测量结合。Twist Bioscience 在 HEK293 细胞中以 Fc 融合形式表达设计,并使用高通量 SPR 阵列。作者开发了一种自动标记规则,以整合两家 CRO 的不同读数。如果设计满足 Adaptyv Bio 轨迹中的特定标准,或两个盲测轨迹评级均为阳性,或 Twist Bioscience 标签为阳性且 Adaptyv Bio 数据无信息,则该设计被分类为结合剂。这种严格的双验证流程确保了对测试设计进行稳健分类。

实验

该研究测试了自主 AI agent 能否完成从靶点研究到排序设计集的完整蛋白质结合剂设计活动;实验通过两家独立 CRO 在 15 个可解释靶点上合成并测量了 1320 个设计,并为每个设计分配综合结合剂判定。实验表明,该 agent 在大多数靶点上产生了结合剂,其排名靠前的设计结合率更高;共折叠分数在靶点内能区分结合剂与非结合剂,但对最不成功的靶点几乎没有预警。进一步验证发现,该 agent 的设计在共享靶点上可与开放蛋白质设计竞赛参赛作品竞争,包括物种交叉反应和含 β 折叠的结合剂;同时也发现明显失败,例如针对 MBP 没有结合剂,针对 BBF-14 和 15-PGDH 仅出现罕见的弱结合剂,而整体证据仍仅限于结合和排序,而非结构或功能。

设计排名与结合情况经过校准:考虑每个靶点更多排名最高的设计会增加至少有一种结合剂的靶点数量。单靶点设计活动较早达到所示最大覆盖率,而多靶点设计活动随着纳入更多设计而更渐进地改善。每个靶点排名第一的设计已在每次活动中为约一半靶点产生结合剂。覆盖率随着纳入更多靠前设计而提高,到前 15 个设计时,多靶点活动覆盖 13 个靶点中的 10 个,单靶点活动覆盖 15 个靶点中的 11 个。MBP 在任何所示活动中均未产生结合剂,TNFα 在两次 Mythos Preview 活动中均未产生结合剂。

该实验通过随着纳入更多靠前设计来追踪靶点覆盖率,研究设计排名与结合的关系。每个靶点排名最高的设计为约一半靶点产生结合剂,覆盖率随着更多靠前设计的纳入而提高,到前 15 个设计时,多靶点活动覆盖 13 个靶点中的 10 个,单靶点活动覆盖 15 个靶点中的 11 个。单靶点活动较早达到最大覆盖率,而多靶点活动更渐进地改善。MBP 在任何所示活动中均未产生结合剂,TNFα 在两次 Mythos Preview 活动中均未产生结合剂。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供