A flaw in using pretrained protein language models in protein–protein interaction inference models¶
作者: Joseph Szymborski, Amin Emad
来源: Nature Machine Intelligence
主题: 其他
相关性: 0/10
机构绿灯: McGill University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01176-7
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于计算生物学的一个活跃分支——蛋白质-蛋白质相互作用(PPI)的机器学习预测。核心科学问题是:给定两个蛋白质的序列(氨基酸字母串),能否预测它们是否会物理结合(相互作用)?这是一个经典的配对生物信息学任务,已有大量基于序列特征、结构特征或共进化信息的计算方法。该领域目前处于“深度学习模型泛滥但评估标准不统一”的成熟阶段,预训练蛋白质语言模型(pLM)的引入带来了性能提升的宣称,但也引发了对其评估可靠性的质疑。
- 本文的位置:本文是一篇方法学批评文章,针对的是当前一个具体且紧迫的问题:使用预训练pLM进行PPI推断时,是否存在数据泄露(data leakage)导致性能虚高? 作者系统性地构建了控制泄露与不控制泄露的数据集,训练小型pLM并比较性能,证实了泄露的存在,并揭示了pLM在泛化任务上的根本弱点。这篇文章之所以现在出现,是因为pLM(如ESM、ProtBERT等)已被广泛采用,但社区尚未严格审视其在下游配对任务中的评估协议。
二、关键术语扫盲¶
- 蛋白质语言模型 (pLM):一种深度学习模型,在大规模蛋白质序列(数百万条)上通过自监督学习(如预测被遮盖的氨基酸)训练而成。它学习的是蛋白质序列的“语法”和“语义”,类似于BERT学习英语。输出是每个氨基酸的向量表示(embedding)。
- 蛋白质-蛋白质相互作用 (PPI):两个或多个蛋白质分子在生物体内物理结合,共同执行功能。预测PPI是理解细胞通路、疾病机制和药物设计的基础。
- 数据泄露 (Data Leakage):在模型训练过程中,测试集的信息(直接或间接)被泄露给训练过程,导致模型在测试集上的性能被高估。在PPI任务中,一个典型的泄露是:训练集和测试集中包含了共享同一蛋白质的相互作用对(例如,训练集有A-B,测试集有A-C),模型学会了识别蛋白质A本身,而不是学习A与B、A与C的相互作用模式。
- 配对生物数据集 (Paired Biological Dataset):数据点由两个实体(这里是两个蛋白质)的配对组成,标签(是否相互作用)依赖于这对组合。这与单实体任务(如预测单个蛋白质的功能)有本质区别,因为泄露风险更高。
- 上下文长度 (Context Length):pLM能“看到”的氨基酸序列的最大长度。如果蛋白质序列超过这个长度,模型会截断或分块处理,可能丢失长程相互作用信息。
- 严格 (Strict) vs. 非严格 (Non-strict) 数据集:作者构建的两个数据集。严格数据集确保训练集和测试集中没有共享任何蛋白质(即,一个蛋白质只出现在一个集合中),从而控制数据泄露。非严格数据集则允许蛋白质共享,模拟了当前许多论文中不严谨的评估协议。
- 泛化 (Generalization):模型在训练数据之外的新数据上的表现。本文测试了两种泛化:跨物种泛化(人类→人类-SARS-CoV-2)和突变效应泛化(预测点突变对结合亲和力的影响)。
- 结合亲和力 (Binding Affinity):衡量两个蛋白质结合强度的物理化学量。预测点突变如何改变亲和力是更精细、更具挑战性的任务。
- 人类-SARS-CoV-2 PPI:新冠病毒(SARS-CoV-2)的蛋白质与人类宿主蛋白质之间的相互作用。预测这些相互作用对理解病毒感染机制和开发抗病毒药物至关重要。
- 嵌入 (Embedding):pLM为每个氨基酸或整个蛋白质输出的一个高维向量(例如,1280维)。这个向量被用作下游PPI分类器的输入特征。
- 点突变 (Point Mutation):蛋白质序列中单个氨基酸被替换成另一个。一个著名的例子是镰状细胞贫血症中的突变。
三、这个领域的人在关心什么¶
计算生物学家和生物信息学家正在追问一个根本问题:我们能否仅从蛋白质的氨基酸序列,就准确预测它们之间复杂的相互作用网络? 这个问题的答案对基础生物学(理解生命分子机器)和转化医学(药物靶点发现、个性化医疗)都至关重要。由于实验测定PPI(如酵母双杂交、质谱)成本高、通量低,计算方法成为不可或缺的替代方案。
当前的主流方法经历了从“特征工程+机器学习”到“深度学习端到端学习”的转变。早期方法依赖手工设计的特征(如氨基酸组成、理化性质、进化谱),然后训练SVM或随机森林。近年来,预训练蛋白质语言模型(pLM) 成为主流,其思路是:先用海量无标注序列训练一个强大的“蛋白质理解”模型(如ESM-1b, Rives et al., 2021; ProtBERT, Elnaggar et al., 2021),然后将其输出的蛋白质嵌入作为特征,输入一个简单的分类器(如逻辑回归、MLP)来预测PPI。这些pLM-based方法宣称取得了显著优于传统方法的性能。
然而,本文作者指出,这些性能提升可能源于一个被忽视的陷阱:数据泄露。许多早期工作(如Yao et al., 2019; Hashemifar et al., 2018)在划分训练/测试集时,没有确保蛋白质不重叠,导致模型实际上是在“记忆”蛋白质本身,而不是学习相互作用模式。本文通过构建严格(无泄露)和非严格(有泄露)数据集,训练了小型pLM,并系统性地证明了泄露会导致测试分数虚高。更重要的是,作者发现,即使控制了泄露,pLM-based模型在更具挑战性的泛化任务(如预测跨物种PPI或突变效应)上表现不佳,与非pLM模型(如基于进化谱的模型)相比并无优势。这揭示了当前pLM在PPI任务上的根本局限性:它们可能擅长“记忆”训练数据中的模式,但缺乏真正的“推理”能力。
四、数据问题¶
- 数据来源:主要来自公开的PPI数据库,如STRING、BioGRID、HPRD等。这些数据库整合了来自高通量实验、文献挖掘和计算预测的PPI数据。作者还使用了SKEMPI数据库(用于突变效应预测)和Gordon et al. (2020) 的人类-SARS-CoV-2 PPI数据集。
- 数据形态:配对序列数据。每个数据点由两个蛋白质的氨基酸序列(字符串)组成,标签是二元(是否相互作用)或连续(结合亲和力变化)。序列长度从几十到几千个氨基酸不等。
- 结构特征:序列数据本身是一维的,但蛋白质的三维结构决定了其功能。pLM通过自注意力机制隐式地学习序列中的长程依赖关系,但无法直接建模三维结构。数据具有层次结构:氨基酸→结构域→蛋白质→相互作用对。
- Noise & 测量误差:PPI标签本身有很高的假阳性和假阴性率。实验方法(如酵母双杂交)有很高的噪声,且数据库整合了不同来源、不同质量的数据。这是一个噪声标签问题。
- Selection / Bias / 缺失:存在严重的实验偏差:研究得多的蛋白质(如与癌症相关的)有更多的PPI记录,而许多“暗物质”蛋白质几乎没有数据。这导致训练数据高度不平衡且有偏。此外,缺失的相互作用(未观测到的真实相互作用)是主要的标签噪声来源。
- 哪些是“漂亮的统计学问题”:
- 噪声标签下的分类:PPI标签的高噪声率是一个经典的统计挑战,需要鲁棒的损失函数或标签噪声模型。
- 数据泄露的量化与校正:本文的核心问题——如何严格定义、检测和校正配对数据中的泄露——是一个具有普遍意义的统计评估问题。
- 迁移学习与领域适应:pLM的预训练-微调范式本质上是迁移学习。本文揭示了在特定下游任务(PPI)上,预训练模型可能引入“捷径学习”(shortcut learning),即利用泄露的蛋白质身份信息,而非真正的相互作用模式。这是一个有趣的统计学习理论问题。
- 哪些是“纯工程或纯领域难题”:
- 蛋白质序列的长程依赖建模(超过pLM上下文长度)是一个工程问题,需要更高效的Transformer架构或分块策略。
- 整合多模态数据(序列、结构、进化谱、基因共表达)以提高PPI预测的鲁棒性,是一个领域知识驱动的工程问题。
五、方法与模型问题¶
- 分析方法:本文的核心方法是对比实验。作者构建了两个版本的PPI数据集:
- 非严格 (Non-strict):随机划分训练/测试集,不控制蛋白质重叠(模拟当前主流做法)。
- 严格 (Strict):确保训练集和测试集中没有共享任何蛋白质(控制泄露)。 作者在这两个数据集上训练了相同架构的小型pLM(一个轻量级的Transformer),并比较其性能。此外,他们还训练了非pLM的基线模型(如基于进化谱的模型)。
- 关键假设:
- 假设“严格”划分能有效消除由蛋白质身份泄露导致的性能虚高。这是一个合理的领域知识约束。
- 假设小型pLM的性能趋势可以推广到大型pLM(如ESM-1b)。作者在补充材料中验证了这一点。
- 推断 / 计算手段:
- 模型:小型Transformer(pLM) + 下游分类器(逻辑回归或MLP)。
- 训练:标准的监督学习,交叉熵损失。
- 评估:使用AUC-ROC、AUC-PR、F1-score等标准分类指标。对于泛化任务,使用Spearman相关系数(突变效应预测)和AUC(跨物种PPI预测)。
- 不确定性量化:完全没有。本文没有提供任何置信区间、p值或贝叶斯后验。结论完全基于点估计的比较。这是一个明显的统计方法学缺口。
- 核心结论:
- 数据泄露导致性能虚高:在非严格数据集上,pLM的AUC-ROC显著高于严格数据集(例如,从0.98降到0.85),证实了泄露的存在。
- 泄露不影响单实体任务:在蛋白质关键词注释(非配对任务)上,严格与非严格划分的性能差异很小,说明泄露是配对任务特有的问题。
- 上下文长度无关:pLM的上下文长度与长序列蛋白质的PPI预测性能无关,暗示模型可能没有有效利用长程信息。
- 泛化失败:pLM-based模型在预测人类-SARS-CoV-2 PPI和点突变效应上表现不佳,与非pLM模型相当甚至更差,揭示了其泛化能力的根本局限。
六、对统计学家的判断¶
-
这篇文章作为科普读物质量如何?
- 打分:4/5 星。
- 理由:文章清晰、自包含,对计算生物学的门外汉(包括统计学家)非常友好。它用一个简单但关键的实验设计(严格 vs. 非严格数据集)讲清楚了一个普遍问题(数据泄露),并给出了明确的警示。缺点是术语较多(pLM、PPI、embedding),但作者解释得足够好。读完能长见识,理解为什么“性能数字高”不等于“模型好”。
-
这里面有没有统计学家会觉得有意思的东西?
- 结论:很有意思,值得留意。
- 论证:
- (i) 科学趣味性:这个问题本身非常有趣。它触及了现代机器学习中一个核心的、但常被忽视的陷阱:评估协议的设计如何影响我们对模型能力的认知。对于统计学家来说,这就像发现一个看似无偏的估计量,实际上因为样本选择偏差而严重高估了参数。故事本身有很强的警示和启发意义。
- (ii) 方法学空间:有,而且很大。本文虽然指出了问题,但没有提供任何统计方法来量化或校正这种泄露。这为统计学家留下了明确的口子:
- 泄露的统计检验:能否设计一个假设检验,来判断一个给定的PPI数据集划分是否存在显著的蛋白质身份泄露?这可以基于排列检验或图结构上的随机化。
- 泄露鲁棒的估计量:能否开发一个PPI预测模型,其性能评估对泄露是鲁棒的?例如,使用交叉验证时确保蛋白质不重叠,或者使用去偏的机器学习(DML) 框架来估计模型在“无泄露”条件下的真实性能。
- 不确定性量化:本文完全没有UQ。一个贝叶斯方法可以给出PPI预测的后验概率,并量化由数据噪声和泄露不确定性带来的预测不确定性。
- 高维与依赖结构:pLM输出的嵌入是高维的(~1000维),且具有复杂的依赖结构。如何在这种高维、强相关的特征上进行有效的统计推断(例如,识别哪些氨基酸位置对PPI最重要)是一个挑战。
- (iii) 现实相关性:非常高。数据泄露是任何使用预训练模型进行下游配对任务(如推荐系统中的用户-物品匹配、化学中的药物-靶点亲和力预测、社交网络中的链接预测)时都会遇到的普遍问题。本文揭示的模式——预训练模型可能引入“捷径”——具有跨领域的普适性。统计学家在与其他领域合作时,几乎必然会遇到类似问题。
-
武器库匹配度
- 无明显接口,纯科普阅读。本文的核心问题是评估协议和实验设计,不涉及您武器库中的具体工具(非参数统计、minimax界、U-statistics、因果推断、高维渐近)。虽然数据泄露可以看作一种“选择偏差”,但本文并未使用因果推断框架来建模。这是一个纯科普阅读,用于开阔眼界,了解生物信息学中的典型陷阱。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述/科普:
- 《Evaluating Machine Learning Models》 by Alice Zheng:一本关于机器学习评估实践的实用书籍,其中有一章专门讨论数据泄露。虽然不是生物信息学特定,但概念通用。
- 《A survey of data leakage in machine learning》:一篇综述性文章(需搜索确认),系统性地总结了不同领域的数据泄露类型。
- 关键奠基或代表论文:
- Rives et al. (2021). "Biological structure and function emerge from scaling unsupervised learning to 250 million protein sequences." PNAS. 这是ESM-1b的原始论文,是pLM领域的奠基之作。阅读它可以理解pLM是如何训练的,以及其声称的能力。
- Elnaggar et al. (2021). "ProtTrans: Towards Cracking the Language of Life’s Code Through Self-Supervised Learning." Bioinformatics. 这是ProtBERT的原始论文,是另一个主流的pLM。
- 本文引用的、存在泄露问题的早期工作:例如 Yao et al. (2019) 或 Hashemifar et al. (2018)。阅读这些论文可以直观地看到“非严格”评估协议是如何导致性能虚高的。
- 可动手玩的数据集/挑战赛:
- STRING database:一个大型PPI数据库,可以下载其子集,并尝试复现本文的“严格” vs. “非严格”实验。
- BioGRID:另一个高质量的PPI数据库。
- Kaggle上的PPI预测竞赛:搜索“Protein-Protein Interaction Prediction”可以找到一些公开数据集和竞赛,可以用于实践。
- 入门综述/科普:
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Protein Language Model (pLM) | 蛋白质语言模型 | 在大量蛋白质序列上预训练的深度学习模型,学习序列的“语法”和“语义”。 |
| Protein-Protein Interaction (PPI) | 蛋白质-蛋白质相互作用 | 两个或多个蛋白质物理结合,共同执行生物功能。 |
| Data Leakage | 数据泄露 | 测试集信息(如蛋白质身份)被模型在训练时“看到”,导致性能被高估。 |
| Paired Dataset | 配对数据集 | 数据点由两个实体配对组成,标签依赖于这对组合(如PPI)。 |
| Context Length | 上下文长度 | pLM能“看到”的氨基酸序列的最大长度。 |
| Strict / Non-strict Dataset | 严格/非严格数据集 | 严格:训练/测试集无蛋白质重叠;非严格:允许重叠(有泄露风险)。 |
| Embedding | 嵌入 | pLM为蛋白质或氨基酸输出的高维向量,作为下游任务的输入特征。 |
| Generalization | 泛化 | 模型在训练数据之外的新数据上的表现能力。 |
| Binding Affinity | 结合亲和力 | 衡量两个蛋白质结合强度的物理化学量。 |
| Point Mutation | 点突变 | 蛋白质序列中单个氨基酸被替换成另一个。 |
| AUC-ROC / AUC-PR | ROC曲线下面积/PR曲线下面积 | 常用的二分类模型性能评估指标。 |
| Transfer Learning | 迁移学习 | 在一个任务上训练好的模型(如pLM),被用于另一个相关任务(如PPI预测)。 |
Maintained by 陈星宇 · Homepage · Source on GitHub