Integrating multimodal cancer data using deep latent variable path modelling¶
作者: Alex Ing, Alvaro Andrades, Marco Raffaele Cosenza, Jan O. Korbel
来源: Nature Machine Intelligence
主题: 其他
相关性: 5/10
机构绿灯: Heidelberg University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01052-4
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于癌症基因组学与计算病理学的交叉领域,具体是多模态数据整合。核心科学问题是:癌症是一种复杂的系统性疾病,其表型由基因组(DNA突变、甲基化)、转录组(RNA表达)、表观组(miRNA调控)以及组织形态(病理切片图像)共同决定。传统研究往往只分析单一数据模态(如只做RNA-seq),无法捕捉这些不同层面之间的相互依赖关系。该子领域目前处于“方法百花齐放但缺乏统一框架”的阶段——有简单的拼接法、基于核的方法、以及各类深度学习融合模型,但如何同时做到可解释(知道哪个模态影响哪个)和高容量(捕捉非线性关系)仍是挑战。
- 本文的位置:它针对的是“如何在一个统一的概率模型中,同时学习多模态数据的低维表示(深度学习擅长)和模态之间的结构化依赖关系(路径建模擅长)”。作者认为,现有的深度整合方法(如变分自编码器VAE的变体)通常把所有模态压缩到一个共享潜变量里,丢失了模态间的定向关系信息;而经典的路径建模(如偏最小二乘路径模型PLS-PM)又太线性、容量不够。本文试图把两者结合。
二、关键术语扫盲¶
- 多模态数据 (Multimodal data):同一批样本(比如同一个病人的肿瘤组织)测出的不同类型数据。本文涉及:DNA突变(SNV)、DNA甲基化、miRNA表达、mRNA表达(RNA-seq)、组织病理学图像(H&E染色切片)。
- 潜变量 (Latent variable):无法直接观测、但能解释观测数据背后结构的变量。比如“肿瘤的侵袭性”不能直接测,但会同时影响基因表达和病理图像形态。
- 路径建模 (Path modelling):一种结构方程模型(SEM)的变体,用有向图(路径图)表示变量之间的因果或依赖关系。比如“DNA甲基化 → 基因表达 → 病理表型”。
- 变分自编码器 (VAE, Variational Autoencoder):一种深度学习生成模型,学习将高维数据(如图像、基因表达)压缩到一个低维潜空间,并能从潜变量生成新数据。本文用它作为每个模态的“编码器-解码器”。
- 合成致死 (Synthetic lethality):两个基因各自单独突变时细胞还能活,但两个同时突变细胞就死——这是癌症靶向治疗的重要概念。本文用方法识别这种相互作用。
- 空间转录组学 (Spatial transcriptomics):一种新技术,能在组织切片上测量每个空间位置的基因表达,同时获得“哪里在表达什么”的信息,把组织形态和分子特征对齐。
- CRISPR-Cas9 筛选:用基因编辑工具逐个敲除基因,看哪个基因的缺失会影响细胞存活,用于发现功能重要的基因。
- TCGA (The Cancer Genome Atlas):美国的大型癌症基因组项目,收集了上万例肿瘤样本的多组学数据(基因组、转录组、表观组、临床信息),是本文的主要训练数据来源。
- 单细胞数据分层 (Single-cell data stratification):把单细胞RNA测序得到的成千上万个细胞,根据基因表达模式分成不同的细胞类型或状态。
- H&E染色 (Hematoxylin and Eosin stain):病理学最常用的染色方法,把细胞核染成蓝紫色、细胞质染成粉红色,病理医生据此判断组织形态是否异常。本文用其数字化图像作为组织学模态。
三、这个领域的人在关心什么¶
癌症研究者在追问一个根本问题:肿瘤的分子改变(基因突变、表观遗传变化)如何最终塑造出病理医生在显微镜下看到的组织形态,以及这些形态又如何反过来影响病人的预后和治疗响应? 这个问题之所以难,是因为中间隔着多层生物学过程:DNA突变影响基因表达,基因表达改变细胞行为,细胞行为改变组织结构。每一层都有复杂的非线性关系和反馈回路。传统做法是“单模态分析”——比如只做RNA-seq找差异表达基因,或者只让病理医生看切片分级——但这两者之间的关联往往是丢失的。
当前主流的多模态整合方法大致分三类:(1) 早期融合:把各模态特征直接拼成一个长向量,然后做聚类或分类——简单但忽略了模态间的结构关系;(2) 中间融合:每个模态先单独学一个低维表示,再融合这些表示——这是深度学习的主流做法(如多模态VAE),但通常假设所有模态共享同一个潜变量,无法表达“甲基化影响表达、表达影响病理”这样的定向路径;(3) 路径建模/结构方程模型:显式指定变量间的有向图,但传统方法(如偏最小二乘路径模型PLS-PM)是线性的,无法捕捉复杂的非线性依赖。本文的方法正是要填补后两类之间的空白:保留路径建模的结构化关系图,但用深度神经网络替换线性映射,从而获得非线性容量。
四、数据问题¶
- 数据来源:主要来自TCGA乳腺癌数据集(约1000例病人),以及额外的单细胞RNA-seq数据、CRISPR-Cas9筛选数据(来自细胞系)、空间转录组数据(来自组织切片)。
- 数据形态:混合形态——(1) 表格型:SNV(二进制矩阵,基因×样本)、甲基化(连续值,CpG位点×样本)、miRNA-seq(计数,miRNA×样本)、RNA-seq(计数,基因×样本);(2) 图像型:H&E染色全切片图像(高分辨率RGB图像,每个样本一张大图)。
- 维度和量级:基因/位点维度极高(数万),样本量中等(~1000)。图像维度极高(百万像素级),但通过预训练的病理图像特征提取器(如ResNet)压缩到数百维的特征向量。
- 结构特征:存在层次结构——基因表达受甲基化和miRNA调控,病理形态是下游表型。存在空间结构——空间转录组数据有明确的(x,y)坐标依赖。
- Noise & 测量误差:RNA-seq和miRNA-seq是计数数据,通常假设负二项分布(overdispersion);甲基化是beta值(0-1连续);SNV是离散的(0/1/2,但通常二值化为突变/未突变)。图像有染色批次效应和扫描仪差异。噪声非独立——基因之间有共表达网络,空间转录组有空间自相关。
- Selection / Bias / 缺失:TCGA数据存在缺失模态(不是所有样本都有所有模态的数据),本文用VAE的变分下界自然处理了缺失(只对观测到的模态计算重构损失)。存在样本选择偏倚——TCGA主要收录可手术切除的肿瘤,晚期/转移性肿瘤代表性不足。
- 哪些是“漂亮的统计学问题”:多模态缺失数据的联合建模、高维计数数据的非线性降维、空间依赖结构的整合——这些都是有统计挑战性的。哪些是“纯工程或领域难题”:病理图像的预处理(组织分割、特征提取)、基因注释的生物学先验知识编码、计算资源(训练大模型)——这些是领域专家或工程师的工作,统计学家不必深究。
五、方法与模型问题¶
- 方法重述:本文的核心想法是给每个数据模态配一个VAE(编码器把原始数据压缩到潜变量,解码器从潜变量重构数据),然后在这些潜变量之间加上一个有向路径图(比如“甲基化潜变量 → 表达潜变量 → 病理潜变量”)。整个模型通过最大化所有模态的联合变分下界(ELBO)来训练。路径图的结构(谁指向谁)由领域知识预先指定,不是从数据中学的。
- 关键假设:(1) 每个模态的潜变量是低维的(~10-50维);(2) 模态间的依赖关系可以用有向无环图(DAG)表示;(3) 给定父节点的潜变量,子节点的潜变量条件独立于其他变量(局部马尔可夫性质);(4) 潜变量服从各向同性高斯先验(VAE的标准假设)。
- 推断/计算手段:变分推断(VAE的标准训练方式)+ 随机梯度下降(Adam优化器)。没有MCMC,没有贝叶斯全后验。路径图的结构固定后,整个模型是一个大的端到端神经网络,用反向传播训练。
- 核心结论 + 不确定性量化:作者展示了模型在几个任务上的表现:(1) 在TCGA数据上,比经典路径模型(PLS-PM)更好地拟合了模态间的关联(用重构误差和相关性度量);(2) 在单细胞数据上,学到的潜变量能更好地区分细胞类型;(3) 在CRISPR筛选数据上,识别出了已知的合成致死对。不确定性几乎没有量化——没有置信区间,没有后验方差,没有敏感性分析。模型输出是点估计(潜变量值、路径系数),评估靠下游任务性能(分类准确率、相关性)。
六、对统计学家的判断¶
- 这篇文章作为科普读物质量如何?
- 3/5 星。作为Nature Machine Intelligence上的文章,它对多模态整合的大问题讲得比较清楚,术语解释也基本自包含(虽然需要读者对VAE和路径建模有基本概念)。但作为“给外行统计学家的第一篇入门”,它不够理想——对VAE和变分推断的数学细节几乎没讲,路径建模的统计性质(识别性、一致性)完全没有讨论。读完能长见识(知道癌症研究者在整合什么数据),但不会让你理解方法的统计基础。
-
一句话理由:科普价值中等——大问题讲明白了,但方法细节和统计性质被深度学习的“黑盒”包装掩盖了。
-
这里面有没有统计学家会觉得有意思的东西?
- (i) 科学趣味性:值得了解。 癌症的多模态整合是一个真实且重要的问题——同一个肿瘤的DNA、RNA、组织形态之间存在复杂的因果链条,统计学家如果能参与构建可解释的概率模型,是有意义的。这个问题本身足够有趣。
- (ii) 方法学空间:有,但本文没深入。 本文的方法本质上是带结构化潜变量的VAE,这在深度学习文献里不算新(已有“因果VAE”、“结构化VAE”等工作)。但从统计角度看,有几个有趣的口子:(a) 识别性问题:路径图是预先指定的,但数据能否识别这些路径的方向?如果图不是DAG(有反馈),怎么办?(b) 不确定性量化:VAE的变分后验是近似后验,其质量(校准性、覆盖概率)在本文中完全没有评估——这是一个典型的UQ问题;(c) 缺失数据机制:多模态缺失在本文中被“自然处理”了(只计算观测模态的ELBO),但这隐含了缺失随机(MAR)假设,且没有讨论缺失机制对推断的影响;(d) 高维计数数据的非线性降维:RNA-seq的负二项噪声模型与VAE的高斯潜变量假设是否匹配?有没有更好的噪声模型(如ZINB-VAE)?——这些在本文中都被简化了。
- (iii) 现实相关性:中等。 多模态缺失数据、结构化潜变量、非线性路径建模——这些模式在流行病学、社会科学、地球科学中也会出现。但本文的特定数据形态(基因表达+病理图像)对大多数统计学家来说比较陌生。
-
明确结论:一般科普读读即可。 方法学上不够深入,统计学家能学到的新东西有限。作为了解癌症多模态整合的窗口值得一读,但不必精读。
-
武器库匹配度:
-
无明显接口,纯科普阅读。 你的武器库(非参数统计、高维渐近、因果推断、U统计量)与本文的深度VAE+路径建模框架没有直接对接。本文没有涉及你熟悉的minimax界、U统计量计算、或因果识别理论。唯一可能的弱连接是:如果路径图是因果图,那么因果推断中的结构方程模型(SEM) 和工具变量理论可以用于讨论识别性——但本文完全没有触及因果识别,只是把路径图当作依赖关系的描述而非因果模型。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述/科普:
- 本文引用了 R. Argelaguet et al., “Multi-Omics Factor Analysis—a framework for unsupervised integration of multi-omics data sets,” Molecular Systems Biology, 2018——这是MOFA方法的论文,是多模态整合的经典工作,比本文更统计(因子模型),适合作为入门。
- 本文引用了 K. Van Deun et al., “A structured overview of simultaneous component based data integration,” BMC Bioinformatics, 2011——一篇关于多模态数据整合方法的综述,适合了解全局图景。
- 关键奠基/代表论文:
- 本文引用了 D. P. Kingma & M. Welling, “Auto-Encoding Variational Bayes,” ICLR, 2014——VAE的原始论文,理解本文方法的基础。
- 本文引用了 Y. Li et al., “Deep learning for multi-modal data integration in cancer,” Nature Reviews Methods Primers, 2022——一篇关于深度学习多模态整合的综述,比本文更全面。
- 可动手玩的数据集:
- TCGA数据(通过GDC Data Portal下载)——本文的主要数据源,公开可用,但体量大、预处理复杂。
- 10x Genomics 空间转录组数据(公开数据集,如人类乳腺癌样本)——适合尝试空间转录组+病理图像的整合。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Multimodal data | 多模态数据 | 同一批样本测出的不同类型数据(如基因、图像、临床指标) |
| Latent variable | 潜变量 | 无法直接观测、但能解释观测数据背后结构的变量(如“肿瘤侵袭性”) |
| Path modelling | 路径建模 | 用有向图表示变量间依赖关系的统计框架(结构方程模型的一种) |
| Variational Autoencoder (VAE) | 变分自编码器 | 一种深度学习生成模型,学习将数据压缩到潜空间并从中生成新数据 |
| Synthetic lethality | 合成致死 | 两个基因各自突变没事,同时突变细胞死亡——癌症靶向治疗概念 |
| Spatial transcriptomics | 空间转录组学 | 在组织切片上测量每个空间位置的基因表达,获得“哪里表达什么” |
| CRISPR-Cas9 screen | CRISPR-Cas9 筛选 | 逐个敲除基因看哪个影响细胞存活,用于发现功能重要基因 |
| TCGA (The Cancer Genome Atlas) | 癌症基因组图谱 | 美国大型癌症基因组项目,收集上万例肿瘤的多组学数据 |
| H&E stain | H&E染色 | 病理学标准染色(核蓝紫、质粉红),用于判断组织形态 |
| Single-cell RNA-seq | 单细胞RNA测序 | 测量单个细胞中所有基因的表达水平,分辨率极高 |
| ELBO (Evidence Lower BOund) | 证据下界 | VAE训练时最大化的目标函数,平衡重构质量和先验匹配 |
| Missing at Random (MAR) | 随机缺失 | 缺失概率仅依赖于观测到的数据,不依赖于缺失值本身 |
Maintained by 陈星宇 · Homepage · Source on GitHub