跳转至

Multimodal out-of-distribution individual uncertainty quantification enhances binding affinity prediction for polypharmacology

作者: Amitesh Badkul, Li Xie, Shuo Zhang, Lei Xie
来源: Nature Machine Intelligence
主题: 其他
相关性: 5/10
机构绿灯: Cornell University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01151-2


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于计算药物发现应用机器学习的交叉领域。核心科学问题是:如何利用机器学习模型,快速、准确地预测一个候选药物分子(配体)与多个不同蛋白质靶点之间的结合强度(结合亲和力)。这一任务被称为“多靶点结合亲和力预测”,是多药理学(polypharmacology)的关键技术——即一个药物同时作用于多个蛋白质,以治疗复杂疾病(如癌症、神经退行性疾病)。该领域目前成熟度中等:深度学习模型已能处理大量数据,但在实际应用中面临严重的分布外(Out-of-Distribution, OOD)泛化问题——训练数据中的化合物结构与实际筛选的化合物结构差异巨大,模型预测不可靠。

  • 本文的位置:它针对的是多靶点结合亲和力预测中的三个具体挑战:(1) 对结构新颖的化合物(OOD)进行可靠预测;(2) 在OOD场景下量化每个预测的不确定性(现有不确定性量化方法在OOD下假设失效);(3) 方法必须能扩展到数十亿化合物的虚拟筛选。本文提出一个名为 eMOSAIC 的模型无关的异常检测方法,来解决这些挑战。

二、关键术语扫盲

  1. 配体 (Ligand):能与蛋白质结合的小分子,通常是候选药物。
  2. 蛋白质靶点 (Protein Target):药物作用的生物大分子(通常是酶、受体等),结合后改变其功能。
  3. 结合亲和力 (Binding Affinity):衡量配体与蛋白质结合强度的指标,通常用解离常数 Kd 或 IC50 表示。值越小,结合越强。
  4. 多药理学 (Polypharmacology):一个药物同时作用于多个蛋白质靶点的策略,用于治疗多因素疾病。
  5. 分布外 (Out-of-Distribution, OOD):测试数据的分布与训练数据显著不同。在药物发现中,训练集是已知化合物,测试集是全新结构,属于典型的OOD场景。
  6. 多模态表示 (Multimodal Representation):将不同来源的信息(如蛋白质序列、化合物结构、3D构象)融合成一个统一的特征向量,供模型使用。
  7. 蛋白质语言模型 (Protein Language Model, pLM):一种基于Transformer的深度学习模型,在大规模蛋白质序列上预训练,能学习蛋白质的“语法”和功能特征。本文使用结构感知的pLM。
  8. 马氏距离 (Mahalanobis Distance):一种考虑数据协方差结构的距离度量,用于衡量一个点与一个分布中心的偏离程度。在本文中用于计算化合物嵌入的离群程度。
  9. 异常检测 (Anomaly Detection):识别与大多数数据显著不同的样本。本文用聚类方法识别“异常”化合物,这些化合物的预测不确定性高。
  10. 虚拟筛选 (Virtual Screening):通过计算模型从大型化合物库中筛选出有潜力的候选药物,替代昂贵的实验筛选。
  11. 嵌入 (Embedding):将高维离散数据(如分子结构、蛋白质序列)映射到低维连续向量空间,便于机器学习模型处理。

三、这个领域的人在关心什么

计算药物发现领域的研究者核心追问是:如何用计算模型替代或加速昂贵的实验筛选,从而更快、更便宜地发现新药? 这涉及两个子问题:(1) 预测准确性:模型能否准确预测一个化合物与靶点的结合强度?(2) 泛化能力:模型能否对结构全新的化合物做出可靠预测?后者是实际应用中的瓶颈——训练数据来自已知化合物库,但筛选目标是全新结构,模型往往“过拟合”于训练分布。

当前主流方法分为两类: - 基于序列的方法:仅使用蛋白质序列和化合物SMILES(一种分子结构表示法)作为输入,速度快但忽略3D结构信息。代表性工作如 Öztürk et al. (2018) 的 DeepDTA,使用卷积神经网络。 - 基于结构的方法:使用蛋白质-配体复合物的3D结构(如通过分子对接获得),理论上更准确,但计算成本极高,无法扩展到大规模筛选。代表性工作如 Jumper et al. (2021) 的 AlphaFold 用于蛋白质结构预测,但其直接用于结合亲和力预测仍有局限。

本文的 eMOSAIC 方法绕开了这些局限:它不依赖昂贵的3D结构计算,而是利用多模态嵌入(来自pLM和深度神经网络)进行异常检测,从而在OOD场景下量化不确定性。它不试图改进预测模型本身,而是为任何预测模型提供一个“可靠性评分”——告诉用户哪些预测可信,哪些不可信。

四、数据问题

  • 数据来源:公开数据库,如 BindingDBPDBbindChEMBL 等,包含实验测定的蛋白质-配体结合亲和力数据。蛋白质序列来自 UniProt,化合物结构来自 PubChem 等。
  • 数据形态表格数据(化合物ID、蛋白质ID、亲和力值)+ 序列数据(蛋白质氨基酸序列、化合物SMILES字符串)+ 图结构数据(化合物分子图)。维度:蛋白质序列长度约数百到数千氨基酸;化合物分子图节点数约数十到数百原子。
  • 结构特征:数据具有层次结构——一个化合物对应多个蛋白质靶点(多药理学),一个蛋白质对应多个化合物。存在多任务学习结构:每个蛋白质靶点是一个预测任务。
  • Noise & 测量误差:实验测定的亲和力值存在异方差——不同实验方法、不同实验室的测量误差不同。噪声通常假设为高斯,但实际可能更复杂(如对数正态分布)。数据中存在测量误差(实验重复性差)和标签噪声(错误标注)。
  • Selection / Bias / 缺失:存在严重的选择偏差——实验数据偏向于已知活性化合物和热门靶点,大量“无活性”或“弱活性”数据缺失。缺失数据:许多化合物-蛋白质对没有实验数据。截断 (Truncation):亲和力测量有上限(如IC50 > 10μM 通常记为“无活性”),导致数据被截断。
  • 哪些是“漂亮的统计学问题”:OOD泛化下的不确定性量化、异方差噪声建模、选择偏差校正、缺失数据下的多任务学习——这些都是统计学家会感兴趣的挑战。哪些是“纯工程或领域难题”:蛋白质语言模型的设计与训练、分子图神经网络的架构选择、大规模虚拟筛选的计算优化——这些是深度学习工程问题。

五、方法与模型问题

  • 文章用的分析方法:提出一个两阶段方法:
    1. 训练阶段:训练一个多模态深度神经网络(MMDNN),输入蛋白质序列(经pLM编码)和化合物SMILES(经图神经网络编码),输出对所有靶点的结合亲和力预测。同时,从MMDNN的中间层提取每个训练样本的多模态嵌入
    2. 预测与不确定性量化阶段:对于新化合物,计算其嵌入与训练集嵌入的马氏距离(离群评分),并通过聚类识别异常区域。最终为每个预测给出一个个体不确定性分数——分数越高,预测越不可靠。
  • 关键假设:(1) 训练集和测试集的嵌入空间分布不同,且OOD样本的嵌入会偏离训练集中心;(2) 马氏距离能有效捕捉这种偏离;(3) 聚类能识别出嵌入空间中的“异常”区域。
  • 推断/计算手段:深度学习(MMDNN、pLM)+ 异常检测(马氏距离、K-means聚类)。没有使用贝叶斯方法或MCMC。不确定性量化是频率学派的,基于距离度量。
  • 核心结论 + 不确定性量化:在多个OOD验证集上,eMOSAIC 显著优于基线方法(包括直接使用预测置信度、蒙特卡洛Dropout等)。不确定性量化是通过阈值实现的:设定一个不确定性分数阈值,高于阈值的预测被标记为“不可靠”,低于阈值的预测被接受。没有提供预测区间或置信区间,只有二分类的“可靠/不可靠”标签。

六、对统计学家的判断(最关键的一节,不要含糊)

  1. 这篇文章作为科普读物质量如何?
  2. 评分:4/5 星
  3. 理由:对OOD不确定性量化的设定和挑战解释清晰,不依赖深度领域知识。作为一篇Nature Machine Intelligence上的应用方法论文,它很好地展示了药物发现中的实际统计问题。但部分术语(如pLM、SMILES)对完全外行仍需额外解释,且方法细节(如马氏距离的具体计算)可读性一般。总体而言,是一篇不错的入门级科普。

  4. 这里面有没有统计学家会觉得有意思的东西?

  5. 科学趣味性:高。多药理学和OOD泛化是药物发现的核心挑战,问题本身足够有趣。一个统计学家会好奇:如何在一个预测模型不可靠时,仍然做出有意义的决策?这直接关联到统计决策理论风险控制
  6. 方法学空间:中等。本文的方法本质上是基于距离的异常检测,在统计上并不新颖。但它的设定——为每个预测提供个体化的不确定性分数,而非全局的置信度——是值得注意的。这提出了一个统计挑战:如何为高维、多模态、非欧几里得的嵌入空间设计有效的距离度量?马氏距离假设数据服从高斯分布,这在实践中往往不成立。更鲁棒的非参数距离度量(如基于核的MMD)或密度估计方法可能更合适。此外,不确定性阈值的校准(如何选择阈值以控制错误发现率或假阳性率)是一个典型的统计问题,本文未深入讨论。
  7. 现实相关性:高。OOD泛化和不确定性量化是所有应用机器学习的通用问题,统计学家在生物信息学、材料科学、社会科学等领域都会遇到类似挑战。本文的数据模式(多任务、层次结构、选择偏差)在统计实践中很常见。
  8. 明确结论:很有意思值得留意。虽然方法本身不深,但它清晰地展示了一个重要的应用场景,并提出了一个统计学家可以介入的问题:如何为高维、多模态数据的OOD预测提供有校准保证的不确定性量化?这比简单的距离阈值更有统计深度。

  9. 武器库匹配度(轻量,点到即可)

  10. 无明显接口。您的武器库(非参数统计、高维渐近、因果推断、高阶U统计量)与本文的核心方法(深度学习+异常检测)无直接交集。本文是纯科普阅读,不提供可迁移的方法学工具。

  11. 如果想进一步了解这个话题,下一步读什么?

  12. 入门综述“Uncertainty Quantification in Deep Learning: A Survey” by Moloud Abdar et al. (2021) — 一篇全面的综述,涵盖贝叶斯深度学习、蒙特卡洛Dropout、集成方法等,适合了解UQ的通用方法。
  13. 奠基论文“Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning” by Yarin Gal & Zoubin Ghahramani (ICML 2016) — 将Dropout解释为贝叶斯近似,是深度学习UQ的奠基工作。
  14. 动手数据集BindingDB (https://www.bindingdb.org/) — 公开的蛋白质-配体结合亲和力数据库,可用于复现和扩展本文的实验。

七、术语小抄

英文术语 中文 一句话解释
Ligand 配体 能与蛋白质结合的小分子,通常是候选药物。
Protein Target 蛋白质靶点 药物作用的生物大分子,结合后改变其功能。
Binding Affinity 结合亲和力 衡量配体与蛋白质结合强度的指标,值越小结合越强。
Polypharmacology 多药理学 一个药物同时作用于多个蛋白质靶点的策略。
Out-of-Distribution (OOD) 分布外 测试数据分布与训练数据显著不同,模型泛化困难。
Multimodal Representation 多模态表示 融合不同来源信息(如序列、结构)的特征向量。
Protein Language Model (pLM) 蛋白质语言模型 在大规模蛋白质序列上预训练的Transformer模型。
Mahalanobis Distance 马氏距离 考虑数据协方差结构的距离度量,用于离群检测。
Anomaly Detection 异常检测 识别与大多数数据显著不同的样本。
Virtual Screening 虚拟筛选 通过计算模型从大型化合物库中筛选候选药物。
Embedding 嵌入 将高维离散数据映射到低维连续向量空间。
SMILES 简化分子线性输入规范 一种用ASCII字符串表示分子结构的方法。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论