跳转至

SpaMTP: integrative statistical analysis and visualization of spatial metabolomics and transcriptomics data

作者: Andrew Causer, Tianyao Lu, Jurgen Kriel, Joel J. D. Moffet, Christopher C. J. Fitzgerald et al.
来源: Nature Methods
主题: 其他
相关性: 3/10
机构绿灯: University of Melbourne(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41592-026-03140-8


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于空间组学(Spatial Omics),具体是空间多模态数据整合。这个子领域的核心科学问题是:如何在组织切片上同时测量并理解不同分子层次(如基因表达、蛋白质丰度、代谢物浓度)的空间分布,从而揭示细胞在组织微环境中的功能状态和相互作用。目前该领域处于快速发展但工具碎片化的阶段:空间转录组学已有成熟的分析工具(如Seurat、Scanpy),但空间代谢组学(测量小分子代谢物在组织上的分布)的分析工具严重不足,更缺乏将两者整合的端到端软件。
  • 本文的位置:它针对的是空间代谢组学与空间转录组学数据整合缺乏统一、易用的计算框架这一具体问题。现在做这件事是因为:1) 空间代谢组学技术(如MALDI-MSI、DESI-MSI)已成熟到能产生高质量数据;2) 同时从同一组织切片获取转录组和代谢组数据的技术(如SpaceM、MALDI-RNA-seq)刚刚出现;3) 现有工具要么只处理转录组,要么是代谢组专用的孤立软件,跨平台整合需要大量手动操作和编程。

二、关键术语扫盲

  1. 空间组学(Spatial Omics):在组织切片上测量分子信息,同时保留其空间位置(x, y坐标)。想象一张地图,每个坐标点不仅告诉你“这里有什么细胞”,还告诉你“这些细胞在表达什么基因、制造什么蛋白质、积累什么代谢物”。
  2. 空间代谢组学(Spatial Metabolomics):用质谱成像(MSI)技术测量组织切片上每个像素点的代谢物(小分子,如糖、脂质、氨基酸)种类和丰度。结果是每个像素点有一个质谱图(一堆峰,每个峰对应一个分子量)。
  3. 空间转录组学(Spatial Transcriptomics):测量组织切片上每个空间点(spot或cell)的基因表达水平(mRNA丰度)。常见技术有10x Visium(每个点包含多个细胞)、MERFISH(单细胞分辨率)。
  4. MALDI-MSI / DESI-MSI:两种主流的质谱成像技术。MALDI用激光轰击组织表面使分子电离,DESI用带电溶剂喷雾。两者都产生一个像素网格,每个像素有一个质谱。
  5. 代谢物注释(Metabolite Annotation):从质谱峰(一个m/z值)推断它对应什么代谢物。这是代谢组学最大的瓶颈——质谱只能告诉你分子量,但一个分子量可能对应多个同分异构体,需要串联质谱(MS/MS)或精确质量匹配数据库来确认。
  6. Seurat架构:R语言中最流行的单细胞/空间转录组学分析框架。它定义了一套标准数据结构(Seurat对象)和操作流程(标准化、降维、聚类、差异表达)。SpaMTP把代谢组数据也塞进这个框架,让用户能用熟悉的工具处理新类型数据。
  7. 空间对齐(Spatial Alignment):将同一组织切片上不同模态的数据(如H&E染色图像、转录组点阵、代谢组像素网格)配准到同一个坐标系。因为不同技术的分辨率不同(转录组点直径55μm,代谢组像素10μm),需要找到对应关系。
  8. 联合聚类(Joint Clustering):同时利用转录组和代谢组数据对空间点进行聚类,识别出在两种模态下都一致的“空间区域”或“细胞类型”。不是分别聚类再比较,而是用一个联合模型同时考虑两种数据。
  9. 多模态整合(Multimodal Integration):将不同分子层次的数据(基因、代谢物)融合成一个统一的表示,用于下游分析。常见方法有加权最近邻(WNN)、因子分析(MOFA+)、CCA等。
  10. 富集检验(Enrichment Test):在某个空间区域或细胞群中,看哪些代谢通路(如糖酵解、脂肪酸氧化)被显著激活。通过比较该区域中代谢物的丰度与背景分布,用超几何检验或GSEA类方法判断。
  11. 空间代谢物-基因相关性(Spatial Metabolite-Gene Correlation):计算每个代谢物丰度与每个基因表达量在空间上的相关性(如Spearman相关),用于发现代谢物与基因表达的共定位关系。这是探索性分析的核心输出。
  12. 端到端框架(End-to-End Framework):从原始数据输入(质谱文件、测序数据)到最终可视化(热图、空间散点图、UMAP)的完整软件包,用户不需要自己写中间步骤的代码。

三、这个领域的人在关心什么

空间组学的研究者正在追问一个根本的生物学问题:组织微环境中的细胞是如何通过分子通讯来协调功能的? 传统方法把组织匀浆后测平均分子丰度,丢失了空间信息。空间转录组学让我们看到“哪些基因在哪里表达”,空间代谢组学让我们看到“哪些代谢物在哪里积累”。但基因表达和代谢物丰度不是一一对应的——一个基因的mRNA水平高,不代表其编码的酶活性高,更不代表下游代谢物浓度高。因此,同时测量并整合这两种信息,才能理解从基因到代谢表型的完整调控链条。

当前的主流方法存在明显局限: - 空间转录组学分析:以Seurat(Hao et al., 2021, Cell)和Scanpy(Wolf et al., 2018, Genome Biology)为代表,提供了成熟的降维、聚类、差异表达流程,但完全不处理代谢组数据。 - 空间代谢组学分析:以SCiLS Lab(商业软件)和Cardinal(Bemis et al., 2015, Bioinformatics)为代表,专注于质谱成像数据的预处理、峰检测、注释和可视化,但缺乏与转录组数据的整合接口,且不提供下游生物学解释(如通路富集)功能。 - 多模态整合方法:如MOFA+(Argelaguet et al., 2020, Molecular Systems Biology)和CiteFuse(Kim et al., 2020, Nature Communications)能整合不同模态数据,但设计时未考虑空间结构,且不处理代谢组特有的注释和质谱数据格式。

SpaMTP的贡献在于:把代谢组数据“翻译”成Seurat能理解的格式,让用户能复用Seurat生态中已有的整合、聚类、可视化工具,同时补充了代谢组特有的功能(注释、富集检验、空间对齐)。它没有发明新的统计方法,而是解决了软件工程层面的互操作性问题

四、数据问题

  • 数据来源:两种来源——(1) 空间代谢组学:MALDI-MSI或DESI-MSI质谱成像仪,产生每个像素点的质谱图;(2) 空间转录组学:10x Visium(基于探针捕获mRNA,空间分辨率55μm)或MERFISH(基于成像,单细胞分辨率)。两种数据可以从同一组织切片的连续切片或同一张切片的不同区域获取。
  • 数据形态
  • 代谢组:光谱数据(每个像素点一个质谱向量,维度可达数万m/z bins),稀疏(大多数bins无信号),非负整数(离子计数)。
  • 转录组:计数矩阵(基因×空间点),稀疏(大多数基因在大多数点不表达),非负整数(UMI计数)。
  • 两者都有空间坐标(x, y),构成一个不规则或规则网格。
  • 结构特征空间依赖结构——相邻像素/点的分子丰度高度相关(组织是连续的)。多模态层次结构——同一个空间位置有来自不同分子层次的数据,但分辨率不同(代谢组像素通常比转录组点小得多,需要聚合或插值)。
  • Noise & 测量误差
  • 代谢组:质谱噪声(基线漂移、离子抑制效应)、注释不确定性(一个m/z峰可能对应多个代谢物)、批次效应(不同实验批次间信号强度不可比)。
  • 转录组:测序深度差异(每个点捕获的mRNA总数不同)、dropout(低表达基因在稀疏采样下被漏检)、空间扩散(mRNA可能从原始位置扩散)。
  • 两者都是非高斯、过离散的计数数据,常用负二项或泊松模型。
  • Selection / Bias / 缺失分辨率不匹配是核心问题——转录组点(55μm)覆盖多个细胞,代谢组像素(10μm)接近单细胞,如何对齐?组织切片选择——只分析一个或几个切片,能否代表整个肿瘤/器官?代谢物检测偏差——质谱只检测到电离效率高的代谢物,许多重要代谢物(如糖酵解中间体)难以检测。
  • 哪些是“漂亮的统计学问题”
  • 空间多模态对齐与融合:不同分辨率、不同噪声结构、不同稀疏度的数据如何整合?这是统计匹配/数据融合的经典问题。
  • 空间相关性建模:如何利用空间结构提高代谢物注释的准确性(相邻像素的质谱应该相似)?这是空间统计/图模型问题。
  • 多模态联合聚类:如何同时利用转录组和代谢组信息识别空间区域,且允许两种模态对聚类贡献不同?这是多视图聚类问题。
  • 哪些是“纯工程或纯领域难题”:代谢物注释(需要化学数据库和MS/MS验证)、质谱预处理(基线校正、峰对齐)、组织切片制备(保持分子完整性)。这些需要化学和实验专业知识,统计学家帮不上忙。

五、方法与模型问题

  • 文章用的分析方法(用直白语言重述):
  • 数据导入与预处理:把代谢组质谱数据(imzML格式)读入,做基线校正、峰检测、归一化,然后转换成Seurat对象。转录组数据直接用Seurat的标准流程读入。
  • 空间对齐:用组织切片的H&E染色图像作为桥梁,通过图像配准(基于特征点匹配或仿射变换)把代谢组像素网格和转录组点阵对齐到同一个坐标系。
  • 代谢物注释:将质谱峰与数据库(HMDB、LipidMaps)匹配,用精确质量(<5ppm误差)和MS/MS谱图确认。
  • 联合聚类:对每个空间点,提取其转录组特征(基因表达向量)和代谢组特征(代谢物丰度向量),用Seurat的加权最近邻(WNN)方法——先分别对两种模态做PCA降维,然后计算每个模态的权重(基于模态内最近邻一致性),最后用加权后的联合嵌入做UMAP和聚类。
  • 富集检验:对每个聚类/区域,用超几何检验判断哪些代谢通路(KEGG、Reactome)中的代谢物丰度显著高于背景。
  • 空间相关性分析:计算每个代谢物与每个基因在空间上的Spearman相关系数,找出共定位的代谢物-基因对。
  • 关键假设
  • 空间对齐假设:H&E图像上的组织形态在连续切片间保持一致(实际有切片厚度导致的微小变形)。
  • 联合聚类假设:两种模态的潜在结构是共享的(即存在“空间区域”这个概念,且两种模态都反映它)。
  • 注释假设:质谱峰的精确质量匹配足以唯一确定代谢物(实际有同分异构体问题)。
  • 推断/计算手段非统计的确定性方法为主——图像配准用OpenCV的特征匹配,代谢物注释用质量匹配,聚类用Seurat的WNN(基于PCA和最近邻图)。没有贝叶斯推断、没有不确定性量化、没有假设检验的校正(富集检验用了超几何检验,但未做多重比较校正)。
  • 核心结论 + 不确定性量化:论文展示了SpaMTP在三个生物系统(小鼠脑、人类黑色素瘤、人类结直肠癌)上的应用,发现了代谢物-基因共定位模式(如脂质代谢与免疫浸润区域的空间关联)。不确定性完全没有量化——没有置信区间、没有p值校正、没有对注释不确定性的传播。结论是描述性的(“我们发现X与Y在空间上共定位”),而非推断性的(“X与Y的共定位在统计上显著,且效应大小为Z”)。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?
  2. 3/5 星。理由:对完全不懂空间组学的统计学家来说,它不是好的入门第一篇——文章默认读者熟悉Seurat、质谱成像、代谢组学,术语密集且不解释。但如果你已经读过一篇空间转录组学的科普(如10x Visium的介绍),这篇文章能让你快速了解“代谢组学数据长什么样、整合时遇到什么工程问题”。它把大问题(多模态整合)讲清楚了,但没有讲深——读完你知道“他们做了什么”,但不知道“为什么这么做是合理的”或“有什么更好的方法”。

  3. 这里面有没有统计学家会觉得有意思的东西?

  4. (i) 科学趣味性:中等。问题本身(基因表达与代谢物丰度的空间关系)是生物学的前沿,但本文的呈现方式(工具论文,以展示功能为主)缺乏科学悬念。一个好奇的统计学家可能会想:“代谢物-基因空间相关性到底意味着什么?是因果关系还是共定位的混杂?”但本文不回答这个问题。
  5. (ii) 方法学空间有,但本文没有触及。数据特性(空间依赖、多模态、分辨率不匹配、注释不确定性)提出了真正的统计挑战,但SpaMTP用的是现成的、非统计的工程方法(图像配准、PCA、WNN)。统计学家可以问:如何为空间对齐的不确定性建模?如何用空间高斯过程融合不同分辨率的数据?如何量化代谢物注释的置信度并传播到下游分析?如何做空间因果推断(代谢物变化是否导致基因表达变化,还是反之)?这些口子都是开的,但本文没有填
  6. (iii) 现实相关性:高。空间多模态数据正在成为生物医学的标配(肿瘤微环境、神经科学、发育生物学)。统计学家在别处也会遇到类似问题:不同分辨率传感器的数据融合、空间依赖的多视图聚类、带注释不确定性的下游分析。模式是通用的
  7. 明确结论一般科普读读即可。作为工具论文,它展示了“当前实践是什么”,但统计学家读完后应该感到“这里有很多可以改进的统计方法”,而不是“学到了一个可以直接用的统计工具”。如果你对空间组学完全没兴趣,可以跳过;如果你好奇“生物学家现在怎么处理空间多模态数据”,花30分钟浏览一下图和方法部分就够了。

  8. 武器库匹配度

  9. 无明显接口,纯科普阅读。你的very_familiar武器(非参数统计、高维渐近、U-统计量、因果推断)在这里没有直接应用场景。SpaMTP的核心问题是软件工程和领域知识(质谱、代谢物化学),不是统计推断。唯一可能的弱连接是:如果你对空间点过程空间统计感兴趣,这里的数据结构(空间坐标+多模态特征)是经典的空间统计问题,但本文没有用任何空间统计方法(没有变差函数、没有克里金、没有空间回归)。不要牵强

  10. 如果想进一步了解这个话题,下一步读什么?

  11. 入门综述:Ståhl et al. (2016, Science) “Visualization and analysis of gene expression in tissue sections by spatial transcriptomics”——空间转录组学的奠基论文,讲清楚数据是怎么产生的。然后读Marx (2021, Nature Methods) “Method of the Year 2020: spatially resolved transcriptomics”——一篇很好的科普综述。
  12. 关键奠基论文:Hao et al. (2021, Cell) “Integrated analysis of multimodal single-cell data”——Seurat的WNN方法论文,是SpaMTP联合聚类的核心算法来源。Bemis et al. (2015, Bioinformatics) “Cardinal: an R package for statistical analysis of mass spectrometry-based imaging experiments”——空间代谢组学的主流R包,理解代谢组数据的标准处理流程。
  13. 可动手玩的数据集:10x Genomics官网提供Visium空间转录组学公开数据集(人类乳腺癌、小鼠脑等)。SpaMTP的GitHub仓库(https://github.com/)应该包含示例数据。但注意:同时包含空间代谢组和转录组的公开数据集非常少,这是该领域的一个瓶颈。

七、术语小抄

英文术语 中文 一句话解释
Spatial Metabolomics 空间代谢组学 在组织切片上测量小分子代谢物的空间分布,用质谱成像技术
Spatial Transcriptomics 空间转录组学 在组织切片上测量基因表达(mRNA)的空间分布
MALDI-MSI 基质辅助激光解吸电离质谱成像 一种空间代谢组学技术,用激光轰击组织使分子电离
Metabolite Annotation 代谢物注释 从质谱峰推断它对应什么代谢物的过程
Seurat Seurat R语言中最流行的单细胞/空间转录组学分析框架
Spatial Alignment 空间对齐 将不同技术获取的同一组织的空间数据配准到同一坐标系
Joint Clustering 联合聚类 同时利用多种模态数据对空间点进行聚类
Multimodal Integration 多模态整合 将不同分子层次的数据融合成统一表示
WNN (Weighted Nearest Neighbor) 加权最近邻 Seurat中整合多模态数据的方法,给每种模态一个权重
Enrichment Test 富集检验 判断某个代谢通路在特定区域是否被显著激活的统计检验
m/z 质荷比 质谱中离子的质量与电荷之比,用于识别分子
UMI (Unique Molecular Identifier) 唯一分子标识符 转录组测序中用于去除PCR重复的分子条形码
imzML imzML格式 质谱成像数据的标准交换格式
SpaceM SpaceM技术 一种同时从同一细胞获取代谢组和转录组数据的技术

Maintained by 陈星宇 · Homepage · Source on GitHub

评论