跳转至

Immunotherapy drug target identification using machine learning and patient-derived tumour explant validation

作者: Marcellus Augustine, Nuno Rocha Nene, Hongchang Fu, Christopher L. Pinder, Lorena Ligammari et al.
来源: Nature Machine Intelligence
主题: 其他
相关性: 4/10
机构绿灯: University College London(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-026-01201-3


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于计算免疫肿瘤学药物发现的交叉领域。核心科学问题是:如何从海量、多模态的生物医学数据中,系统性地识别出新的免疫治疗药物靶点(即可以被药物作用的蛋白质或基因),以帮助那些对现有免疫疗法(如PD-1/PD-L1抑制剂)无反应的患者。这个领域目前处于“数据丰富但知识转化困难”的阶段——有大量基因组、转录组、蛋白质组和临床数据,但如何整合这些信息来预测一个基因是否值得作为药物靶点,仍然是一个开放挑战。
  • 本文的位置:它针对的是免疫肿瘤学靶点发现的系统性、可验证的预测框架缺失问题。现有方法(如OpenTargets)通常只整合少数几种数据源,且缺乏对免疫系统特殊性的建模。本文提出的MIDAS系统,通过一个多模态图神经网络,将基因相互作用、患者多组学数据、免疫细胞生物学、抗原处理、疾病关联和遗传扰动表型后果等六类信息整合到一个统一的预测框架中,并首次在患者来源的肿瘤外植体中进行了功能验证。现在做这件事是因为:① 免疫治疗耐药机制逐渐被阐明,但可成药的替代靶点仍然稀缺;② 图神经网络和多模态学习技术的成熟使得整合异构数据成为可能;③ 患者来源外植体实验技术的进步使得高通量功能验证成为现实。

二、关键术语扫盲

  1. 免疫治疗 (Immunotherapy):一种通过激活或增强患者自身免疫系统来攻击癌症的治疗方法。最著名的是检查点抑制剂(如PD-1抑制剂),它们“松开”免疫系统的刹车,让T细胞去攻击肿瘤。
  2. 药物靶点 (Drug Target):一个可以被药物分子结合并调节的蛋白质或基因,从而产生治疗效果。比如,PD-1蛋白就是一个成功的免疫治疗靶点。
  3. 多组学数据 (Multi-omic Data):从多个“组学”层面收集的分子数据,包括基因组(DNA序列)、转录组(RNA表达)、蛋白质组(蛋白质丰度)等。每个层面都提供了关于细胞状态的不同信息。
  4. 图神经网络 (Graph Neural Network, GNN):一种专门处理图结构数据的深度学习模型。在本文中,基因被表示为图中的节点,基因之间的相互作用(如物理结合、调控关系)被表示为边。GNN通过聚合邻居节点的信息来更新每个节点的特征。
  5. 多模态学习 (Multimodal Learning):一种同时处理和分析多种不同类型数据(模态)的机器学习方法。本文整合了六种模态:基因相互作用、患者多组学、免疫细胞生物学、抗原处理、疾病关联和遗传扰动表型。
  6. 患者来源肿瘤外植体 (Patient-Derived Tumour Explant, PDTE):从患者手术切除的肿瘤组织中直接取出的微小组织块,在体外培养并用于药物测试。这比传统的细胞系模型更接近真实的肿瘤微环境。
  7. TRACERx 研究:一项大型的、前瞻性的肺癌(及本文中的黑色素瘤)纵向研究,通过多区域测序追踪肿瘤的进化过程。本文使用的黑色素瘤患者样本来自该研究。
  8. oncostatin M (OSM) – oncostatin M 受体 (OSMR) 信号通路:一个细胞因子(OSM)与其受体(OSMR)结合后触发的信号通路。本文发现该通路是一个有潜力的免疫治疗靶点,其功能扰动可以改变肿瘤微环境中的T细胞状态。
  9. 功能障碍性 CD8+ T 细胞 (Dysfunctional CD8+ T cells):在肿瘤微环境中,持续受到抗原刺激的CD8+ T细胞会进入一种“耗竭”或“功能障碍”状态,失去杀伤肿瘤细胞的能力。免疫治疗的目标之一就是逆转这种状态。
  10. CCL4:一种趋化因子,由多种细胞分泌,可以招募免疫细胞到特定位置。本文中,降低CCL4水平被认为与改善免疫抑制性肿瘤微环境有关。
  11. OpenTargets:一个公开的、整合了多种数据源的药物靶点发现平台,被广泛用作基线方法。本文的MIDAS系统在性能上超越了它。
  12. 时间切片数据 (Time-sliced data):本文用早期(2018年之前)的数据训练模型,然后在后期(2018年之后)新发现的靶点上测试其泛化能力。这是一种严格的、模拟真实药物发现过程的评估方式。

三、这个领域的人在关心什么

这个领域的研究者核心追问是:“在成千上万个可能的基因中,哪一个最有可能成为下一个有效的免疫治疗药物靶点?” 这个问题之所以值得做,是因为: 1. 临床需求巨大:现有免疫疗法只对约20-30%的患者有效,大量患者需要替代方案。 2. 搜索空间巨大:人类基因组有约2万个蛋白编码基因,但只有极少数(如PD-1、CTLA-4)被成功靶向。如何高效地缩小搜索范围? 3. 数据整合困难:关于一个基因,可能有来自不同实验、不同患者群体、不同技术平台的几十种证据(如它在肿瘤中是否高表达、是否与免疫细胞浸润相关、敲除它是否影响细胞存活等)。如何将这些碎片化的证据整合成一个可靠的、可量化的靶点优先级评分?

当前的主流方法和已知局限是: - OpenTargets(作者在引言中引用为基线方法):采用一种基于加权和的评分系统,整合了来自多个数据库的基因-疾病关联证据。局限是:① 权重是人为设定的,而非从数据中学习;② 无法捕捉基因之间的复杂相互作用;③ 没有专门针对免疫肿瘤学进行优化。 - 基于单组学的机器学习方法(如仅使用转录组数据预测免疫治疗反应):局限是忽略了其他关键信息维度(如基因组突变、蛋白质相互作用),导致预测能力有限。 - 传统的药物发现流程:从靶点发现到临床验证平均需要10-15年,成本高达数十亿美元。本文的MIDAS系统旨在通过计算预测来加速这一过程,将候选靶点范围缩小到最值得实验验证的几个。

本文相对这些方法的补充是:① 用图神经网络自动学习不同数据模态的权重和交互模式,而非人工设定;② 整合了免疫细胞生物学和抗原处理等免疫特异性信息;③ 通过时间切片验证和患者外植体实验,提供了比纯计算基线更强的泛化性和生物学相关性证据。

四、数据问题

  • 数据来源:整合自多个公开数据库和大型队列研究。主要包括:① 基因相互作用网络(如STRING数据库,记录蛋白质-蛋白质物理相互作用);② 患者多组学数据(来自TCGA、TRACERx等大型癌症基因组学项目,包含RNA表达、DNA突变、拷贝数变异等);③ 免疫细胞生物学(如ImmPort数据库,记录基因在免疫细胞中的表达模式);④ 抗原处理(如IEDB数据库,记录抗原肽与MHC分子的结合能力);⑤ 疾病关联(如GWAS Catalog,记录基因变异与疾病的关联);⑥ 遗传扰动表型(如DepMap,记录基因敲除对细胞存活的影响)。
  • 数据形态:主要是表格数据(基因×特征矩阵)和图数据(基因相互作用网络)。每个基因被表示为一个节点,其特征向量由上述六种模态的数据拼接而成。图的边代表基因之间的已知相互作用。
  • 维度和量级:涉及约2万个蛋白编码基因,每个基因有数百到数千个特征(取决于整合的数据源)。图网络包含数十万条边。
  • 结构特征:数据具有图结构(基因相互作用网络),且特征来自多模态(不同来源、不同尺度的数据)。不同模态之间存在复杂的依赖关系(例如,一个基因的突变可能影响其表达,进而影响其编码蛋白与其它蛋白的相互作用)。
  • noise & 测量误差:数据噪声来源多样且复杂:① 基因表达数据受批次效应、测序深度影响;② 蛋白质相互作用数据存在假阳性和假阴性;③ 疾病关联数据来自不同人群和实验设计,效应量估计有不确定性。这些噪声不是独立同分布的高斯噪声,而是具有复杂的、未知的相关结构。
  • selection / bias / 缺失:存在严重的选择偏差:① 已知的基因-疾病关联偏向于研究得比较充分的基因(如癌基因、抑癌基因);② 患者数据来自特定队列(如TCGA主要包含欧美人群),存在人群偏差;③ 遗传扰动数据(如DepMap)主要来自癌细胞系,不能完全代表体内情况。缺失数据普遍存在:并非所有基因在所有数据源中都有记录。
  • 哪些是“漂亮的统计学问题”:① 多模态数据整合中的异方差和缺失机制建模:不同模态的数据具有不同的噪声水平和缺失模式,如何为每个模态设计合适的似然函数或损失函数?② 图结构数据的半监督学习与不确定性量化:在基因相互作用图上,如何利用已知靶点(少量标签)来推断未知基因的靶点潜力,并给出预测的不确定性?③ 选择偏差的校正:如何对已知靶点(标签)的“非随机性”进行建模,以避免模型偏向于研究充分的基因?
  • 哪些是“纯工程或纯领域难题”:① 数据获取和清洗:从数十个不同格式、不同标准的数据库中提取、对齐和标准化数据,是巨大的工程挑战;② 生物学验证:在患者外植体中验证预测靶点的功能,需要复杂的实验设计和伦理审批,这完全是生物学和医学问题。

五、方法与模型问题

  • 分析方法:本文的核心是一个多模态图神经网络(MIDAS)。简单来说,它做了三件事:
    1. 特征构建:将每个基因的六种模态数据拼接成一个初始特征向量。
    2. 图卷积:在基因相互作用网络上运行一个图卷积网络(GCN)。每个基因节点通过聚合其邻居节点的特征来更新自己的表示。这允许模型捕捉“一个基因的功能可能受其相互作用伙伴影响”这一生物学直觉。
    3. 分类/排序:将更新后的基因表示输入一个全连接层,输出一个“靶点潜力”分数。模型在已知的、经过验证的药物靶点(正样本)和随机选择的基因(负样本)上进行训练。
  • 关键假设:① 同质性假设:相互作用的基因倾向于具有相似的功能(即,如果一个基因是好的靶点,它的邻居也可能是有潜力的靶点)。这是图神经网络工作的基础。② 多模态互补性假设:不同模态的数据提供了关于靶点潜力的互补信息,整合它们比使用任何单一模态更好。③ 标签无偏性假设(隐含的):已知的靶点标签是随机缺失的,而非系统性地偏向于某些基因。这个假设在现实中很可能不成立。
  • 推断 / 计算手段:使用深度学习(图神经网络)进行端到端训练。优化算法是随机梯度下降。模型评估使用时间切片验证(用早期数据训练,在后期数据上测试)和留一病种验证(排除一个癌症类型的所有靶点进行训练,然后在被排除的癌症类型上测试)。
  • 核心结论 + 不确定性量化:结论是MIDAS系统能够有效预测免疫治疗靶点,并识别出OSM-OSMR信号通路作为有潜力的新靶点。不确定性量化非常薄弱:① 模型输出的是一个点估计的分数,没有置信区间或预测区间;② 没有对模型预测的不确定性来源(如数据噪声、模型结构不确定性)进行分解或量化;③ 生物学验证(PDTE实验)虽然提供了功能证据,但样本量小(来自少数患者),统计显著性有限。总的来说,本文在不确定性量化方面几乎是空白。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?
  2. 评分:3/5 星
  3. 理由:文章对免疫肿瘤学靶点发现的大问题讲得比较清楚,术语解释尚可,但作为给外行统计学家的入门第一篇,它不够自包含。它假设读者熟悉图神经网络、多组学、PD-1/PD-L1等概念,没有对这些核心术语进行充分的背景铺垫。读完能长见识(了解这个领域在做什么、用什么数据),但不会觉得“我完全懂了”。更推荐作为“第二篇”阅读——在读过一篇更基础的免疫肿瘤学综述之后。

  4. 这里面有没有统计学家会觉得有意思的东西?

  5. 论证
    • (i) 科学趣味性中等偏上。这个问题本身——如何从海量、异构的生物数据中预测哪个基因是下一个“重磅炸弹”药物靶点——是极具吸引力的。它触及了现代生物医学的核心挑战:数据多,但知识少。对于一个好奇的统计学家来说,了解这个问题的规模和难度是有价值的。
    • (ii) 方法学空间有,但本文没有深入。本文的方法论(标准GCN)在统计学家看来是“套用一个标准方法”。然而,它暴露出的数据挑战是真正的统计金矿:① 多模态数据整合中的异方差和缺失机制:不同模态的数据(如连续的表达值、离散的突变状态、二元的相互作用)具有不同的噪声分布和缺失模式。如何为每个模态设计一个合理的概率模型,并联合推断?这涉及混合模型、缺失数据理论异方差回归。② 图结构数据的标签选择偏差:已知的药物靶点(正样本)不是随机选择的,而是历史上被研究得最多的基因。这导致了一个严重的非随机标签问题,类似于因果推断中的选择偏差。如何用逆概率加权双稳健估计来校正这种偏差?③ 不确定性量化:模型输出一个分数,但医生需要知道这个分数有多可靠。如何为图神经网络预测提供有意义的置信区间,并分解来自数据噪声、模型结构和标签偏差的不确定性?这是一个开放且有挑战性的问题,涉及贝叶斯深度学习共形预测
    • (iii) 现实相关性。这种“多模态数据 + 图结构 + 非随机标签”的问题模式,在生物信息学、药物发现、社交网络分析、推荐系统等领域普遍存在。统计学家在别处也会遇到类似的数据结构和偏差问题。
  6. 明确结论一般科普读读即可。本文作为一篇应用导向的Nature Machine Intelligence文章,其价值在于系统集成和生物学验证,而非统计方法创新。它值得一读以了解领域背景,但统计学家不应期待从中获得可直接迁移的方法论。它更像是一个问题清单,告诉统计学家“这里有很多有趣的统计挑战等着你去解决”。

  7. 武器库匹配度

  8. 无明显接口,纯科普阅读。本文使用的标准图神经网络与研究者非常熟悉的武器库(非参数统计、极小极大界、高阶U-统计量、因果推断等)没有直接的技术交集。虽然数据整合中的偏差校正问题与因果推断中的选择偏差有概念上的联系,但本文并未涉及任何因果识别或估计方法,因此无法建立有意义的连接。

  9. 如果想进一步了解这个话题,下一步读什么?

  10. 入门综述:本文引言中引用了 “Litchfield et al., Nature Reviews Clinical Oncology, 2021”(标题待核实,但作者是本文的通讯作者之一,内容应为免疫肿瘤学靶点发现的综述),这是一篇很好的领域入门读物。
  11. 奠基/代表论文:本文引用了 “Open Targets Platform: new developments and updates two years on, Nucleic Acids Research, 2019”,这是理解基线方法(OpenTargets)的标准文献。此外,“The STRING database in 2021: customizable protein–protein networks, and functional characterization of user-uploaded gene/measurement sets, Nucleic Acids Research, 2021” 是理解基因相互作用网络数据来源的关键文献。
  12. 公开数据集:本文使用的数据主要来自公开数据库,如 TCGA (The Cancer Genome Atlas)DepMap (Cancer Dependency Map)STRING。这些数据库都提供公开下载,是动手探索多组学数据和基因网络的绝佳起点。此外,OpenTargets 平台本身也提供API和下载服务,可以直接用来复现和比较基线方法。

七、术语小抄

英文术语 中文 一句话解释
Immunotherapy 免疫治疗 通过激活或增强患者自身免疫系统来攻击癌症的治疗方法。
Drug Target 药物靶点 可以被药物分子结合并调节的蛋白质或基因,从而产生治疗效果。
Multi-omic Data 多组学数据 从基因组、转录组、蛋白质组等多个分子层面收集的数据。
Graph Neural Network (GNN) 图神经网络 一种处理图结构数据的深度学习模型,通过聚合邻居信息来学习节点表示。
Multimodal Learning 多模态学习 同时处理和分析多种不同类型数据(如文本、图像、基因表达)的机器学习方法。
Patient-Derived Tumour Explant (PDTE) 患者来源肿瘤外植体 从患者肿瘤组织中取出的微小组织块,在体外培养用于药物测试,比细胞系更真实。
TRACERx TRACERx 研究 一项大型癌症进化纵向研究,通过多区域测序追踪肿瘤的演变。
Oncostatin M (OSM) 制瘤素M 一种细胞因子,本文发现其信号通路是一个有潜力的免疫治疗新靶点。
Dysfunctional CD8+ T cells 功能障碍性CD8+ T细胞 在肿瘤中“耗竭”的杀伤性T细胞,失去抗癌能力,免疫治疗旨在逆转此状态。
CCL4 CCL4趋化因子 一种招募免疫细胞的信号分子,其水平降低与改善免疫抑制性肿瘤微环境有关。
OpenTargets OpenTargets平台 一个公开的、整合多种数据源的药物靶点发现基线平台。
Time-sliced Data 时间切片数据 用早期数据训练模型,在后期新发现的靶点上测试,用于评估模型的泛化能力。
Gene Interaction Network 基因相互作用网络 描述基因之间物理结合、调控等关系的网络图,节点是基因,边是相互作用。
Selection Bias 选择偏差 由于已知靶点并非随机选择(偏向于研究充分的基因),导致模型学习到有偏的模式。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论