Multimodal out-of-distribution individual uncertainty quantification enhances binding affinity prediction for polypharmacology¶
作者: Amitesh Badkul, Li Xie, Shuo Zhang, Lei Xie
来源: Nature Machine Intelligence
主题: 其他
相关性: 5/10
机构绿灯: Cornell University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01151-2
一、这篇论文属于什么学科、要解决什么¶
-
学科定位:本文属于计算药物发现与应用机器学习的交叉领域。核心科学问题是:如何利用机器学习模型,快速、准确地预测一个候选药物分子(配体)与多个不同蛋白质靶点之间的结合强度(结合亲和力)。这一任务被称为“多靶点结合亲和力预测”,是多药理学(polypharmacology)的关键技术——即一个药物同时作用于多个蛋白质,以治疗复杂疾病(如癌症、神经退行性疾病)。该领域目前成熟度中等:深度学习模型已能处理大量数据,但在实际应用中面临严重的分布外(Out-of-Distribution, OOD)泛化问题——训练数据中的化合物结构与实际筛选的化合物结构差异巨大,模型预测不可靠。
-
本文的位置:它针对的是多靶点结合亲和力预测中的三个具体挑战:(1) 对结构新颖的化合物(OOD)进行可靠预测;(2) 在OOD场景下量化每个预测的不确定性(现有不确定性量化方法在OOD下假设失效);(3) 方法必须能扩展到数十亿化合物的虚拟筛选。本文提出一个名为 eMOSAIC 的模型无关的异常检测方法,来解决这些挑战。
二、关键术语扫盲¶
- 配体 (Ligand):能与蛋白质结合的小分子,通常是候选药物。
- 蛋白质靶点 (Protein Target):药物作用的生物大分子(通常是酶、受体等),结合后改变其功能。
- 结合亲和力 (Binding Affinity):衡量配体与蛋白质结合强度的指标,通常用解离常数 Kd 或 IC50 表示。值越小,结合越强。
- 多药理学 (Polypharmacology):一个药物同时作用于多个蛋白质靶点的策略,用于治疗多因素疾病。
- 分布外 (Out-of-Distribution, OOD):测试数据的分布与训练数据显著不同。在药物发现中,训练集是已知化合物,测试集是全新结构,属于典型的OOD场景。
- 多模态表示 (Multimodal Representation):将不同来源的信息(如蛋白质序列、化合物结构、3D构象)融合成一个统一的特征向量,供模型使用。
- 蛋白质语言模型 (Protein Language Model, pLM):一种基于Transformer的深度学习模型,在大规模蛋白质序列上预训练,能学习蛋白质的“语法”和功能特征。本文使用结构感知的pLM。
- 马氏距离 (Mahalanobis Distance):一种考虑数据协方差结构的距离度量,用于衡量一个点与一个分布中心的偏离程度。在本文中用于计算化合物嵌入的离群程度。
- 异常检测 (Anomaly Detection):识别与大多数数据显著不同的样本。本文用聚类方法识别“异常”化合物,这些化合物的预测不确定性高。
- 虚拟筛选 (Virtual Screening):通过计算模型从大型化合物库中筛选出有潜力的候选药物,替代昂贵的实验筛选。
- 嵌入 (Embedding):将高维离散数据(如分子结构、蛋白质序列)映射到低维连续向量空间,便于机器学习模型处理。
三、这个领域的人在关心什么¶
计算药物发现领域的研究者核心追问是:如何用计算模型替代或加速昂贵的实验筛选,从而更快、更便宜地发现新药? 这涉及两个子问题:(1) 预测准确性:模型能否准确预测一个化合物与靶点的结合强度?(2) 泛化能力:模型能否对结构全新的化合物做出可靠预测?后者是实际应用中的瓶颈——训练数据来自已知化合物库,但筛选目标是全新结构,模型往往“过拟合”于训练分布。
当前主流方法分为两类: - 基于序列的方法:仅使用蛋白质序列和化合物SMILES(一种分子结构表示法)作为输入,速度快但忽略3D结构信息。代表性工作如 Öztürk et al. (2018) 的 DeepDTA,使用卷积神经网络。 - 基于结构的方法:使用蛋白质-配体复合物的3D结构(如通过分子对接获得),理论上更准确,但计算成本极高,无法扩展到大规模筛选。代表性工作如 Jumper et al. (2021) 的 AlphaFold 用于蛋白质结构预测,但其直接用于结合亲和力预测仍有局限。
本文的 eMOSAIC 方法绕开了这些局限:它不依赖昂贵的3D结构计算,而是利用多模态嵌入(来自pLM和深度神经网络)进行异常检测,从而在OOD场景下量化不确定性。它不试图改进预测模型本身,而是为任何预测模型提供一个“可靠性评分”——告诉用户哪些预测可信,哪些不可信。
四、数据问题¶
- 数据来源:公开数据库,如 BindingDB、PDBbind、ChEMBL 等,包含实验测定的蛋白质-配体结合亲和力数据。蛋白质序列来自 UniProt,化合物结构来自 PubChem 等。
- 数据形态:表格数据(化合物ID、蛋白质ID、亲和力值)+ 序列数据(蛋白质氨基酸序列、化合物SMILES字符串)+ 图结构数据(化合物分子图)。维度:蛋白质序列长度约数百到数千氨基酸;化合物分子图节点数约数十到数百原子。
- 结构特征:数据具有层次结构——一个化合物对应多个蛋白质靶点(多药理学),一个蛋白质对应多个化合物。存在多任务学习结构:每个蛋白质靶点是一个预测任务。
- Noise & 测量误差:实验测定的亲和力值存在异方差——不同实验方法、不同实验室的测量误差不同。噪声通常假设为高斯,但实际可能更复杂(如对数正态分布)。数据中存在测量误差(实验重复性差)和标签噪声(错误标注)。
- Selection / Bias / 缺失:存在严重的选择偏差——实验数据偏向于已知活性化合物和热门靶点,大量“无活性”或“弱活性”数据缺失。缺失数据:许多化合物-蛋白质对没有实验数据。截断 (Truncation):亲和力测量有上限(如IC50 > 10μM 通常记为“无活性”),导致数据被截断。
- 哪些是“漂亮的统计学问题”:OOD泛化下的不确定性量化、异方差噪声建模、选择偏差校正、缺失数据下的多任务学习——这些都是统计学家会感兴趣的挑战。哪些是“纯工程或领域难题”:蛋白质语言模型的设计与训练、分子图神经网络的架构选择、大规模虚拟筛选的计算优化——这些是深度学习工程问题。
五、方法与模型问题¶
- 文章用的分析方法:提出一个两阶段方法:
- 训练阶段:训练一个多模态深度神经网络(MMDNN),输入蛋白质序列(经pLM编码)和化合物SMILES(经图神经网络编码),输出对所有靶点的结合亲和力预测。同时,从MMDNN的中间层提取每个训练样本的多模态嵌入。
- 预测与不确定性量化阶段:对于新化合物,计算其嵌入与训练集嵌入的马氏距离(离群评分),并通过聚类识别异常区域。最终为每个预测给出一个个体不确定性分数——分数越高,预测越不可靠。
- 关键假设:(1) 训练集和测试集的嵌入空间分布不同,且OOD样本的嵌入会偏离训练集中心;(2) 马氏距离能有效捕捉这种偏离;(3) 聚类能识别出嵌入空间中的“异常”区域。
- 推断/计算手段:深度学习(MMDNN、pLM)+ 异常检测(马氏距离、K-means聚类)。没有使用贝叶斯方法或MCMC。不确定性量化是频率学派的,基于距离度量。
- 核心结论 + 不确定性量化:在多个OOD验证集上,eMOSAIC 显著优于基线方法(包括直接使用预测置信度、蒙特卡洛Dropout等)。不确定性量化是通过阈值实现的:设定一个不确定性分数阈值,高于阈值的预测被标记为“不可靠”,低于阈值的预测被接受。没有提供预测区间或置信区间,只有二分类的“可靠/不可靠”标签。
六、对统计学家的判断(最关键的一节,不要含糊)¶
- 这篇文章作为科普读物质量如何?
- 评分:4/5 星
-
理由:对OOD不确定性量化的设定和挑战解释清晰,不依赖深度领域知识。作为一篇Nature Machine Intelligence上的应用方法论文,它很好地展示了药物发现中的实际统计问题。但部分术语(如pLM、SMILES)对完全外行仍需额外解释,且方法细节(如马氏距离的具体计算)可读性一般。总体而言,是一篇不错的入门级科普。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:高。多药理学和OOD泛化是药物发现的核心挑战,问题本身足够有趣。一个统计学家会好奇:如何在一个预测模型不可靠时,仍然做出有意义的决策?这直接关联到统计决策理论和风险控制。
- 方法学空间:中等。本文的方法本质上是基于距离的异常检测,在统计上并不新颖。但它的设定——为每个预测提供个体化的不确定性分数,而非全局的置信度——是值得注意的。这提出了一个统计挑战:如何为高维、多模态、非欧几里得的嵌入空间设计有效的距离度量?马氏距离假设数据服从高斯分布,这在实践中往往不成立。更鲁棒的非参数距离度量(如基于核的MMD)或密度估计方法可能更合适。此外,不确定性阈值的校准(如何选择阈值以控制错误发现率或假阳性率)是一个典型的统计问题,本文未深入讨论。
- 现实相关性:高。OOD泛化和不确定性量化是所有应用机器学习的通用问题,统计学家在生物信息学、材料科学、社会科学等领域都会遇到类似挑战。本文的数据模式(多任务、层次结构、选择偏差)在统计实践中很常见。
-
明确结论:很有意思值得留意。虽然方法本身不深,但它清晰地展示了一个重要的应用场景,并提出了一个统计学家可以介入的问题:如何为高维、多模态数据的OOD预测提供有校准保证的不确定性量化?这比简单的距离阈值更有统计深度。
-
武器库匹配度(轻量,点到即可):
-
无明显接口。您的武器库(非参数统计、高维渐近、因果推断、高阶U统计量)与本文的核心方法(深度学习+异常检测)无直接交集。本文是纯科普阅读,不提供可迁移的方法学工具。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述:“Uncertainty Quantification in Deep Learning: A Survey” by Moloud Abdar et al. (2021) — 一篇全面的综述,涵盖贝叶斯深度学习、蒙特卡洛Dropout、集成方法等,适合了解UQ的通用方法。
- 奠基论文:“Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning” by Yarin Gal & Zoubin Ghahramani (ICML 2016) — 将Dropout解释为贝叶斯近似,是深度学习UQ的奠基工作。
- 动手数据集:BindingDB (https://www.bindingdb.org/) — 公开的蛋白质-配体结合亲和力数据库,可用于复现和扩展本文的实验。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Ligand | 配体 | 能与蛋白质结合的小分子,通常是候选药物。 |
| Protein Target | 蛋白质靶点 | 药物作用的生物大分子,结合后改变其功能。 |
| Binding Affinity | 结合亲和力 | 衡量配体与蛋白质结合强度的指标,值越小结合越强。 |
| Polypharmacology | 多药理学 | 一个药物同时作用于多个蛋白质靶点的策略。 |
| Out-of-Distribution (OOD) | 分布外 | 测试数据分布与训练数据显著不同,模型泛化困难。 |
| Multimodal Representation | 多模态表示 | 融合不同来源信息(如序列、结构)的特征向量。 |
| Protein Language Model (pLM) | 蛋白质语言模型 | 在大规模蛋白质序列上预训练的Transformer模型。 |
| Mahalanobis Distance | 马氏距离 | 考虑数据协方差结构的距离度量,用于离群检测。 |
| Anomaly Detection | 异常检测 | 识别与大多数数据显著不同的样本。 |
| Virtual Screening | 虚拟筛选 | 通过计算模型从大型化合物库中筛选候选药物。 |
| Embedding | 嵌入 | 将高维离散数据映射到低维连续向量空间。 |
| SMILES | 简化分子线性输入规范 | 一种用ASCII字符串表示分子结构的方法。 |
Maintained by 陈星宇 · Homepage · Source on GitHub