Integration of imaging-based and sequencing-based spatial omics mapping on the same tissue section via DBiTplus¶
作者: Archibald Enninful, Zhaojun Zhang, Dmytro Klymyshyn, Matthew Ingalls, Mingyu Yang et al.
来源: Nature Methods
主题: 其他
相关性: 4/10
机构绿灯: Yale University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41592-025-02948-0
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于空间组学(Spatial Omics),具体是空间多模态整合这一子领域。空间组学的核心科学问题是:如何在保留组织原始空间结构(即细胞在组织切片上的物理位置)的前提下,同时测量大量基因的表达(转录组)和蛋白质的表达(蛋白质组)?传统方法要么只能测转录组(如空间转录组测序),要么只能测蛋白质(如多重免疫荧光成像),且通常在不同组织切片上进行,导致无法直接对齐。该领域目前处于快速发展期,技术层出不穷,但整合不同模态数据到同一张切片上仍是重大挑战。
- 本文的位置:本文针对的是在同一张组织切片上,同时获得高通量、全转录组范围的基因表达数据和单细胞分辨率的蛋白质成像数据这一具体问题。之所以现在做,是因为之前的技术(如DBiT-seq)只能做测序,而纯成像方法通量有限。DBiTplus 通过巧妙的实验流程设计,将两种技术路线合二为一,解决了“一张切片、两种数据”的难题。
二、关键术语扫盲¶
- 空间转录组学 (Spatial Transcriptomics):一种技术,能在显微镜下看到组织切片的同时,知道每个微小区域(比如一个细胞或一小群细胞)里有哪些基因被激活了。就像给组织地图上的每个地点都贴上一张“基因购物清单”。
- 多重蛋白质成像 (Multiplexed Protein Imaging):一种成像技术,可以在一张组织切片上同时标记和观察几十种不同的蛋白质。每种蛋白质用不同颜色的荧光“染料”标记,就像给细胞里的不同“零件”涂上不同颜色,从而识别细胞类型和状态。
- 空间条形码 (Spatial Barcoding):一种给组织切片上每个微小区域(像素)分配一个独特“条形码”序列的技术。测序时,通过读取这个条形码,就能知道这段RNA分子原本来自组织上的哪个位置。就像给每个快递包裹贴上地址标签。
- RNase H 介导的 cDNA 回收 (RNase H-mediated cDNA retrieval):本文的核心实验技巧。在完成空间条形码标记后,用一种特殊的酶(RNase H)把已经标记好的cDNA(基因的DNA拷贝)从组织切片上“剪”下来并回收,从而释放组织表面,为后续的蛋白质成像做准备。这是实现“先测序后成像”的关键。
- 福尔马林固定石蜡包埋 (FFPE):一种处理临床组织样本的标准方法,将组织用福尔马林固定、石蜡包埋,可以长期保存。但FFPE样本的RNA通常降解严重,对空间转录组技术是巨大挑战。本文展示了DBiTplus对FFPE样本的兼容性。
- 解卷积 (Deconvolution):一种计算分析方法。当测序数据的分辨率(比如50微米)低于单个细胞时,一个测序点可能包含多种细胞类型。解卷积就是根据已知的细胞类型基因表达特征,估算出这个混合点里每种细胞各占多少比例。
- 成像引导的解卷积 (Imaging-guided deconvolution):本文的亮点。利用高分辨率的蛋白质成像数据(能看清单个细胞),来“指导”低分辨率的测序数据的解卷积过程。因为成像数据已经告诉了我们每个测序点里有哪些细胞,所以解卷积更准确。
- 单细胞分辨率空间转录组图谱 (Single-cell-resolved spatial transcriptome atlas):最终目标。通过整合,生成一张组织地图,地图上的每个点(代表一个细胞)都有其完整的基因表达谱和空间位置信息。
- 淋巴瘤发生 (Lymphomagenesis):淋巴瘤(一种血癌)的形成和发展过程。本文用DBiTplus分析了人类淋巴瘤组织,试图揭示其背后的分子机制。
- 多模态数据整合 (Multimodal data integration):将来自不同技术平台(如测序和成像)的数据,在数学和计算上进行对齐、融合,以获得比单一模态更全面的信息。
三、这个领域的人在关心什么¶
空间组学的研究者最核心的追问是:细胞在组织中的“邻里关系”如何影响其功能和命运? 传统单细胞测序(scRNA-seq)把细胞从组织中分离出来,虽然能获得每个细胞的基因表达,但丢失了空间位置信息。空间组学则试图回答:肿瘤边缘的免疫细胞和肿瘤内部的免疫细胞,它们的基因活动有何不同?大脑皮层不同层的神经元,其分子特征如何?一个器官的发育过程中,不同区域的细胞如何协同工作?
当前的主流方法分为两大阵营: 1. 基于测序的方法:如 10x Visium(商业平台,分辨率约55微米,一个点包含多个细胞)和 Slide-seq(更高分辨率)。它们的优势是能检测全转录组(所有基因),但分辨率通常低于单细胞,且无法直接看到蛋白质。 2. 基于成像的方法:如 MERFISH 和 seqFISH(基于荧光原位杂交),以及 CyCIF 和 CODEX(基于抗体标记的蛋白质成像)。它们的优势是单细胞甚至亚细胞分辨率,但通量有限(一次只能看几十到几百个基因或蛋白质),且无法做到全转录组覆盖。
已知局限:这两类方法通常在不同切片上操作,导致数据无法完美对齐。即使在同一张切片上,也很难同时兼顾“全转录组广度”和“单细胞分辨率”。DBiTplus 的贡献在于,它通过一个巧妙的实验流程(先测序后成像),在同一张切片上同时获得了全转录组的测序数据和单细胞分辨率的蛋白质成像数据,然后用成像数据来“指导”测序数据的解卷积,从而生成单细胞分辨率的全转录组图谱。它绕开了“要么选广度,要么选分辨率”的困境。
四、数据问题¶
- 数据来源:通过DBiTplus实验流程获得。首先对组织切片进行空间条形码标记和测序(获得空间转录组数据),然后用RNase H回收cDNA,再对同一张切片进行多重蛋白质成像(获得蛋白质空间分布数据)。
- 数据形态:
- 测序数据:本质上是空间点阵上的基因表达计数矩阵。每个“像素点”(spot)对应一个空间条形码,每个点有一个基因表达向量(计数数据)。维度:点数 × 基因数(通常数千个点,数万个基因)。
- 成像数据:高分辨率的多通道荧光图像。每个像素有多个通道的荧光强度值,代表不同蛋白质的表达量。维度:图像像素数 × 蛋白质通道数(通常几十个通道)。
- 结构特征:数据具有强空间结构。测序点和成像像素之间有明确的物理对应关系(通过图像配准对齐)。数据是层次化的:成像数据是单细胞分辨率,测序数据是亚细胞群分辨率。
- noise & 测量误差:
- 测序数据:典型的计数噪声(泊松或负二项分布),存在dropout(基因表达被检测为0)和批次效应。
- 成像数据:荧光噪声(泊松噪声、背景荧光、光漂白),存在抗体非特异性结合。
- 对齐误差:将成像数据与测序点阵对齐时,存在配准误差。
- selection / bias / 缺失:
- 组织选择偏差:实验选择的组织区域可能不代表整个器官。
- 基因/蛋白质选择偏差:成像只能检测预设的几十种蛋白质,而测序能检测所有基因,存在信息不对称。
- 空间分辨率不匹配:测序点(~50微米)远大于单个细胞(~10微米),导致测序数据是混合信号,这是核心的缺失数据问题(每个测序点内细胞的精细空间分布未知)。
- 哪些是“漂亮的统计学问题”:
- 空间解卷积:从混合信号中推断亚细胞群比例,这是一个高维、有结构约束的逆问题。成像数据提供了强先验信息(细胞类型和位置),使得这个问题从“病态”变得“可解”。
- 多模态数据对齐与融合:如何将不同分辨率、不同噪声模型、不同测量量的数据(计数 vs. 荧光强度)进行统计上合理的整合,是一个函数型数据对齐和潜在变量模型问题。
- 空间依赖建模:基因表达在空间上不是独立的,如何建模这种空间相关性(如马尔可夫随机场)来提升解卷积或差异表达分析的精度。
- 哪些是“纯工程或领域难题”:实验流程的化学优化(RNase H效率、抗体兼容性)、图像配准的算法实现、计算流程的工程化。这些是生物技术和计算机视觉问题,而非统计核心。
五、方法与模型问题¶
- 分析方法:
- 图像配准:将高分辨率蛋白质成像图像与低分辨率测序点阵对齐,建立空间对应关系。
- 细胞分割:从成像图像中识别单个细胞,并提取每个细胞的蛋白质表达谱。
- 成像引导的解卷积:这是核心。对于每个测序点,利用成像数据中该点内所有细胞的蛋白质表达谱,推断出每个细胞的类型。然后,将这些细胞类型信息作为先验,对测序点的基因表达数据进行解卷积,估算每种细胞类型在该点内的基因表达谱。这本质上是一个带约束的线性回归或非负矩阵分解问题。
- 数据整合与可视化:将解卷积后的单细胞分辨率基因表达数据与成像数据对齐,生成最终的空间图谱。
- 关键假设:
- 领域知识约束:假设成像中使用的蛋白质标记能可靠地识别主要细胞类型(这是生物学假设)。
- 计算可行性假设:假设解卷积问题在给定成像先验下是良态的(即解是唯一的、稳定的)。
- 推断 / 计算手段:主要使用优化(非负最小二乘、NMF)和图像处理(配准、分割)。没有使用贝叶斯方法或MCMC。不确定性量化非常有限(主要依赖交叉验证或重复实验)。
- 核心结论 + 不确定性量化:结论是DBiTplus能成功生成单细胞分辨率的空间转录组图谱,并揭示了淋巴瘤的分子机制。不确定性基本没有被量化。解卷积的结果没有给出置信区间或后验分布。差异表达分析(如比较肿瘤区域和正常区域)可能使用了标准的统计检验(如t检验或Wilcoxon秩和检验),但未对空间相关性进行校正。这是该领域论文的普遍现状,统计严谨性远不如方法学创新。
六、对统计学家的判断¶
-
这篇文章作为科普读物质量如何?
- 评分:★★★★☆ (4/5)
- 理由:对于完全不懂空间组学的统计学家,这是一篇极好的入门级科普。它用清晰的实验流程图和直观的结果图,把“先测序后成像”这个核心思想讲得非常明白。术语解释(如空间条形码、解卷积)在上下文中足够自洽。读完能让你迅速理解这个领域在做什么、面临什么核心数据挑战(分辨率不匹配、多模态整合)。缺点是方法部分(计算流程)描述得比较简略,更像一个“食谱”而非“原理说明”,但作为科普这可以接受。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:非常高。这个问题本身——如何在同一张组织切片上同时获得“全景基因地图”和“高分辨率细胞快照”——是一个极其优雅且重要的科学问题。它直接关系到我们对癌症、发育、神经科学等领域的理解。作为一个好奇的统计学家,了解这种技术会极大地拓宽你对“数据”和“测量”的认知边界。
- 方法学空间:有,但不在本文中。本文的方法学贡献主要在实验流程,其计算流程(解卷积)是相对常规的。然而,它揭示了一个非常肥沃的统计问题:如何利用高分辨率、低通量的辅助数据(成像),来提升低分辨率、高通量的主数据(测序)的空间分辨率? 这本质上是一个多分辨率、多模态的统计整合问题。具体挑战包括:
- 空间解卷积的UQ:如何为每个测序点内每种细胞类型的基因表达估计提供不确定性度量(置信区间或后验分布)?这需要将成像数据的噪声、细胞分割的不确定性、以及测序数据的计数噪声都纳入一个统一的概率模型。
- 空间相关性的处理:标准解卷积假设测序点内细胞是独立的,但空间上相邻的细胞基因表达是相关的。如何建模这种空间依赖来改进估计?
- 缺失数据视角:可以将测序点内的精细空间分布视为缺失数据,成像数据提供了关于这个缺失数据的部分信息。这可以形式化为一个缺失数据模型,并应用EM算法或贝叶斯数据增广。
- 因果推断的潜在接口:虽然本文未涉及,但有了单细胞分辨率的空间图谱后,可以问一些因果问题,例如“肿瘤微环境中,A细胞分泌的因子B是否导致了C细胞的基因表达变化?”这需要结合空间邻近性和潜在结果框架。
- 现实相关性:非常高。这种“多分辨率、多模态数据整合”的模式在科学中无处不在:卫星遥感(高分辨率光谱 vs. 低分辨率热成像)、医学影像(高分辨率MRI vs. 低分辨率PET)、材料科学(高分辨率电子显微镜 vs. 低分辨率X射线衍射)。统计学家在别处也会遇到这类问题。
- 明确结论:很有意思值得留意。虽然本文本身不是一篇统计方法论文,但它清晰地定义了一个对统计学家极具吸引力的核心问题。它是一扇绝佳的窗户,让你看到空间组学这个领域里“统计需求”和“统计供给”之间的巨大鸿沟。
-
武器库匹配度:
- 无明显接口,纯科普阅读。你的核心武器(非参统计、U-统计量、因果推断、高维渐近)与本文的常规解卷积方法没有直接关联。本文的问题模式(多模态整合、空间解卷积)更接近图像处理和空间统计,而非你熟悉的领域。不过,如果你对逆问题(inverse problems with random noise)有深入理解,可以将空间解卷积视为一个带结构先验的线性逆问题,这或许是一个微弱的连接点。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述:“Spatial transcriptomics and in situ sequencing to study Alzheimer’s disease” (Chen et al., 2022, Cell) 或 “The emerging landscape of spatial profiling technologies” (Marx, 2021, Nature Methods)。这些综述能帮你快速建立领域全景图。
- 奠基/代表论文:
- DBiT-seq (Liu et al., 2020, Cell): 本文的前身,只做测序,是理解DBiTplus的基础。
- 10x Visium 的商业化白皮书或相关论文:了解当前最主流的空间转录组技术及其局限性。
- “Spatial deconvolution of cell types from spatial transcriptomics data” (Kleshchevnikov et al., 2022, Nature Biotechnology): 一篇专门讨论空间解卷积方法(如Cell2location)的论文,能让你看到统计学家在这个问题上的努力。
- 可动手玩的数据集:10x Genomics 官网提供公开的Visium数据集(如人类乳腺癌、小鼠大脑)。你可以下载原始测序数据和H&E染色图像,尝试用开源工具(如Seurat、Scanpy)进行基本的空间分析和解卷积。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Spatial Transcriptomics | 空间转录组学 | 在组织切片上测量基因表达,并保留其空间位置信息的技术。 |
| Multiplexed Protein Imaging | 多重蛋白质成像 | 同时用多种荧光标记观察组织切片上不同蛋白质的技术。 |
| Spatial Barcoding | 空间条形码 | 给组织切片上每个微小区域分配一个独特的DNA序列标签,用于定位。 |
| RNase H-mediated cDNA Retrieval | RNase H介导的cDNA回收 | 一种酶学方法,用于从组织切片上温和地回收已标记的cDNA,为后续成像做准备。 |
| Deconvolution | 解卷积 | 从混合信号中估算其组成成分的比例或特征的计算方法。 |
| Imaging-guided Deconvolution | 成像引导的解卷积 | 利用高分辨率成像数据作为先验信息,来指导低分辨率测序数据的解卷积过程。 |
| FFPE (Formalin-Fixed Paraffin-Embedded) | 福尔马林固定石蜡包埋 | 一种标准的临床组织保存方法,对RNA质量有挑战。 |
| Single-cell Resolution | 单细胞分辨率 | 数据的分辨率足以区分和测量单个细胞。 |
| Multimodal Data Integration | 多模态数据整合 | 将来自不同技术平台(如测序和成像)的数据进行对齐和融合分析。 |
| Spot | 测序点 | 空间转录组测序中,一个空间条形码对应的组织区域(通常包含多个细胞)。 |
| Dropout | 丢失事件 | 单细胞测序中,一个实际表达的基因未被检测到的现象。 |
| Batch Effect | 批次效应 | 不同实验批次引入的系统性技术偏差。 |
Maintained by 陈星宇 · Homepage · Source on GitHub