Command Palette
Search for a command to run...
通用分子基础模型可迁移至多种嗅觉任务
通用分子基础模型可迁移至多种嗅觉任务
Yikun Han Yi Wang Neil Mankodi Stephen Yang Ambuj Tewari
摘要
基础模型已深刻改变了分子性质预测,但一个仅在单一典型嗅觉预测任务上微调的分子基础模型,能否学到可迁移至多种机器嗅觉问题的表征,仍不明确。我们通过以下方式探究这一问题:在用于多标签气味描述符预测的 GS-LF 基准上微调 Uni-Mol2,并将所得模型(不进行额外深度学习训练)应用于四个互补的下游场景:跨数据集气味描述符预测、有气味与无气味分类、对映体评估以及气味混合物可辨别性。微调后的模型在主要 GS-LF 基准上的性能与最先进的嗅觉专用基线相当或更优,并在这些下游评估中表现出一致的迁移能力。对映体分析进一步表明,三维分子表征能够区分镜像分子,而二维图模型从根本上无法做到这一点,尽管准确预测立体化学的感知后果仍是一个开放挑战。这些结果共同支持了机器嗅觉中“一次训练、跨任务迁移”的范式,并表明基于化学预训练的分子表征为可迁移的嗅觉预测提供了坚实基础。
一句话总结
密歇根大学的研究人员在 GS-LF 多标签气味描述符基准上微调了 Uni-Mol2,发现该模型在无需额外深度学习训练的情况下,匹配或超越了最先进的嗅觉专用基线,并迁移到跨数据集气味描述符预测、有气味与无气味分类、对映体评估和气味混合物可区分性等任务,同时还揭示三维分子表示能够以二维图模型无法做到的方式区分镜像分子,支持机器嗅觉中一次训练、跨任务迁移的范式。
核心贡献
- 在 GS-LF 多标签气味描述符预测任务上微调 Uni-Mol2 分子基础模型,所得模型在该基准上匹配或超越了最先进的嗅觉专用基线性能。
- 在没有额外深度学习训练的情况下,同一个微调模型迁移到四个不同的机器嗅觉问题,包括跨数据集气味描述符预测、有气味与无气味分类、对映体评估和气味混合物可区分性,通常匹配或优于专门基线。
- 对映体分析表明,模型的三维分子表示能够区分镜像分子,这是二维图模型所不具备的能力,而准确预测立体化学的感知后果仍然是一个开放挑战。
引言
深度学习已经在视觉和语言领域带来突破,但机器嗅觉由于严重的数据稀缺而落后。定量结构-气味关系(QSOR)建模旨在从分子结构预测气味品质,已经从早期统计方法发展到图神经网络和专家标注的 GS-LF 数据集,然而单分子气味描述符预测的进展已经停滞。作者通过在该 GS-LF 基准上微调分子基础模型来解决这一瓶颈,并表明所得表示能够稳健迁移到多个下游嗅觉任务,包括跨数据集描述符预测、有气味与无气味分类、混合物可区分性和立体化学评估,而无需大量针对特定任务的重新训练。
方法
作者提出一种用于机器嗅觉的迁移学习框架,利用分子基础模型应对高质量气味数据集的稀缺问题。整体流程包括在规范数据集上微调基础模型,随后评估其在多种嗅觉任务中的可迁移性。
框架使用 Uni-Mol2 作为基础模型。由于嗅觉本质上与分子形状、几何结构和立体化学相关,标准二维分子图或 SMILES 字符串并不足够。选择 Uni-Mol2 是因为它能够显式整合原子级、图级和三维几何信息,使其表示对分子空间结构高度敏感。通过在 GS-LF 数据集上微调该模型,作者旨在获得稳健的分子表示,能够泛化到从多标签分类到回归的下游任务。
针对气味描述符预测中固有的严重类别不平衡,作者在微调期间采用 focal loss 损失函数。例如,“fruit”等常见描述符出现数千次,而“chamomile”等罕见描述符仅出现几十次。focal loss 降低频繁类别的权重并强调少数类别,定义为:
Lfocal(pt)=−αt(1−pt)γlog(pt)其中 pt 是真实类别的预测概率,αt 是类别平衡因子,γ 是聚焦参数,用于降低已良好分类样例的损失贡献。为进一步增强稳健性,作者通过平均五个交叉验证折中排名前 10 的超参数配置的预测,构建了一个包含 50 个模型的集成。对于单分子和跨数据集任务,直接评估该集成。对于混合物感知距离预测任务,学习到的分子嵌入作为轻量级经典机器学习模型的输入,避免额外的深度学习微调。
除了即时性能之外,作者还分析常见错误模式,以推动未来架构改进。他们将混淆标签对 (ℓtrue,ℓpred) 定义为一种错误,即标注有描述符 ℓtrue 的分子被错误地赋予描述符 ℓpred。这对应于真实标签的一个假阴性和预测标签的一个假阳性。
分析表明,最常混淆的标签对在训练集中表现出明显较高的共现频率。例如,“green”和“sweet”这一标签对共现数百次,远高于数据集平均水平。这表明预测错误并非随机,而是反映了气味描述符之间内在的统计重叠。
为了确定这种统计结构是否与语义相似性一致,作者为所有描述符生成 BERT 嵌入,并评估最易混淆标签对的余弦相似度。
结果表明,尽管最频繁混淆对的平均相似度百分位数略高于随机水平,但偏差并不具有统计显著性。这意味着仅凭语义相似性难以解释观察到的混淆结构。因此,作者提出,未来的基础模型不应再将气味描述符视为独立类别标签。相反,他们建议学习分子与气味描述符的联合表示空间,通过学习到的兼容性函数进行预测。这种方法将自然捕捉描述符之间的关系,在相关标签之间共享统计强度,并可能支持对未见过的气味描述符进行零样本泛化。
实验
评估将 Uni-Mol2 与 POM/OpenPOM 基线在单分子气味描述符预测、对映体对分析、跨数据集迁移、气味检测和混合物判别任务上进行比较。Uni-Mol2 一致优于基线,表明其三维分子表示捕捉了立体化学敏感性,尽管它仍然难以正确分配对映体特定的气味描述符。该模型还能有效泛化到外部数据集,并迁移到预测气味混合物的感知可区分性,凸显了学习表示的广泛实用性。
Uni-Mol2 (FT) 在 GS-LF 多标签分类任务上,在所比较的模型中取得了最佳的宏平均 AUROC、AUPRC、F1、精确率和召回率。它同时优于最初发表的 POM 结果和完全可复现的 OpenPOM 基线。在相同超参数调优预算下,将 Uni-Mol2 模型规模增大到 164M 并未提升性能。Uni-Mol2 (FT) 在所有报告的分类指标上领先,具有最高的宏平均 AUROC、AUPRC、F1、精确率和召回率。POM 未报告宏平均 AUPRC 或召回率,而 OpenPOM 提供了带有 bootstrap 置信区间的完整指标估计。更大的 164M Uni-Mol2 配置相比 84M 配置并未带来额外收益。
在对映体测试集上,Uni-Mol2 在所有宏平均指标上均优于 OpenPOM,其中宏平均 AUPRC 的相对提升最大。评估使用从训练数据迁移来的标签阈值,未进行进一步调优,表明微调后的表示更好地捕捉了与气味感知相关的立体化学差异。Uni-Mol2 的宏平均 AUPRC 明显高于 OpenPOM,反映出预测对映体对气味描述符时更强的精确率-召回率权衡。所有依赖阈值的指标(F1、精确率、召回率)在 Uni-Mol2 上均一致更高,证实了学习表示对立体化学区分的稳健迁移。
在 Zhang 气味描述符测试集上,无论是否包含所有分子还是移除训练集中出现的分子,Uni-Mol2 在所有报告指标上均一致优于 OpenPOM。该模型在非重叠子集上达到 0.8975 的宏平均 AUROC,表明其具有很强的跨数据集迁移能力。这些结果表明,Uni-Mol2 捕捉了可迁移的结构特征,能够泛化到原始训练分布之外。Uni-Mol2 在完整和非重叠设置下的宏平均 AUROC、AUPRC、F1、精确率和召回率均高于 OpenPOM。在非重叠子集上,Uni-Mol2 达到 0.8975 的宏平均 AUROC,证实其能够泛化到训练期间未见过的分子。
在气味检测任务上,Uni-Mol2 一致优于 OpenPOM,在完整和非重叠测试集上均取得更高的 AUROC,并且在无气味类别上取得显著更高的召回率和 F1 分数。这些提升伴随精确率和 AUPRC 的适度下降,表明模型识别更多真正的无气味分子,但代价是额外的假阳性。在两种评估设置下,Uni-Mol2 将无气味分子的召回率相对于 OpenPOM 提高了约 19 个百分点,捕获了更大比例的正类。Uni-Mol2 的 F1 分数比 OpenPOM 高出约 12 个百分点,尽管精确率下降,但反映了精确率与召回率之间更好的平衡。
Uni-Mol2 微调嵌入与基于树的回归器相结合,在预测气味混合物可区分性方面取得最佳整体性能,衡量标准为四个数据集上的组合 RMSE 和 Pearson 相关性。在单个数据集上,Uni-Mol2 在 Snitz 1、Snitz 2 和 Ravia 上优于 OpenPOM 基线,而 OpenPOM 在 Bushdid 数据集上有微弱优势。结果表明,从单分子任务学到的分子表示能够有效迁移到混合物感知。使用随机森林或梯度提升回归器的 Uni-Mol2 表示取得最高组合 Pearson 相关性和最低组合 RMSE,优于所有 OpenPOM 变体。在单个数据集上,Uni-Mol2 在 Snitz 1、Snitz 2 和 Ravia 上领先,而 OpenPOM 使用随机森林在 Bushdid 数据集上具有小幅优势。
跨多个嗅觉基准,包括多标签分类、对映体判别、跨数据集迁移、气味检测和混合物可区分性,Uni-Mol2 微调嵌入一致优于 OpenPOM 基线,表现出很强的泛化能力和立体化学敏感性。该模型在无气味检测的召回率和 F1 上带来显著提升,并在混合物预测任务上取得最佳组合性能,同时增大模型规模并未改善结果。这些发现证实,Uni-Mol2 学到了可迁移的分子表示,对单分子和混合物感知均有效。