跳转至

Resolving sensitivity, specificity and signal contamination in Xenium spatial transcriptomics

作者: Mariia Bilous, Daria Buszta, Jonathan Bac, Senbai Kang, Yixing Dong et al.
来源: Nature Methods
主题: 其他
相关性: 7/10
机构绿灯: École Polytechnique Fédérale de Lausanne(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41592-026-03089-8


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于空间转录组学,这是分子生物学和基因组学的一个前沿分支。传统转录组学(如RNA测序)测量的是组织块中所有细胞的平均基因表达,丢失了细胞在组织中的物理位置信息。空间转录组学则试图在保留组织切片原始结构的前提下,测量每个细胞(或每个微小区域)中哪些基因被激活、激活到什么程度。这相当于从一张“模糊的购物清单”升级为一张“带地图的购物清单”——不仅知道买了什么,还知道每样东西放在商店的哪个货架上。该领域目前正处于快速成熟期,商业平台(如10x Genomics的Xenium、Vizgen的MERSCOPE、Nanostring的CosMx)竞相推出,但每个平台都有自己独特的技术噪声,用户对这些噪声的系统性理解还很欠缺。

  • 本文的位置:本文聚焦于Xenium平台的数据质量问题。Xenium是目前最广泛采用的空间转录组学平台之一,但它的数据到底有多可靠?所谓的“基因表达信号”里有多少是真正的生物学信号,多少是技术噪声(比如一个细胞里的RNA分子“溅”到了相邻细胞上)?作者利用一个超过40个肿瘤切片的大型实测数据集,系统评估了Xenium的检测特异性、基因面板性能、细胞分割策略,并特别量化了转录本溢出(transcript spillover)这一关键噪声源。在此基础上,他们提出了一个名为SPLIT的信号纯化方法,试图从混合的转录信号中分离出每个细胞的真实表达谱。

二、关键术语扫盲

  1. 空间转录组学 (Spatial Transcriptomics):一种在组织切片的原始空间位置上测量基因表达的技术。想象一下,你有一张城市地图(组织切片),你想知道每个街区(细胞)里有哪些商店(基因)在营业、生意多好(表达量)。空间转录组学就是干这个的。

  2. Xenium平台:由10x Genomics公司推出的一个商业空间转录组学平台。它使用一种叫做“原位测序”的技术,直接在组织切片上对RNA分子进行测序和定位,从而获得单细胞级别的基因表达空间图谱。

  3. 转录本溢出 (Transcript Spillover):这是本文的核心噪声问题。在Xenium的成像和信号处理过程中,一个细胞内的RNA分子发出的荧光信号可能会“扩散”或“串扰”到相邻的细胞上,导致一个细胞被错误地记录为表达了它邻居的基因。这就像邻居家做饭的味道飘到了你家,让你误以为自己家也在做同样的菜。

  4. 基因面板 (Gene Panel):在空间转录组学实验中,你无法测量所有两万多个基因,只能预先选择一组感兴趣的基因(通常是几百个)进行检测。这个预先选定的基因集合就是“基因面板”。面板的设计(选哪些基因、选多少)直接影响实验的生物学发现能力。

  5. 细胞分割 (Cell Segmentation):从高分辨率的组织图像中,识别出每个细胞的边界,从而将测得的转录本信号分配给特定的细胞。这是一个关键的图像分析步骤,分割不准会直接导致信号分配错误。常用的方法有基于细胞核(DAPI染色)的扩张、基于细胞膜标记物的分割等。

  6. 单核RNA测序 (snRNA-seq):一种从单个细胞核中提取RNA并进行测序的技术。与传统的单细胞RNA测序(scRNA-seq)不同,snRNA-seq只分析细胞核内的RNA,这通常能更好地代表细胞的“真实”转录状态,且对冷冻组织样本更友好。本文用它作为“金标准”来量化Xenium数据中的转录本污染。

  7. 信号去卷积 (Signal Deconvolution):当一个测量值(如一个像素点的荧光强度)是多个来源(如多个细胞)的混合信号时,通过数学模型将这些混合信号分离成各个来源的贡献。在空间转录组学中,这常用于处理细胞边界模糊或信号溢出的情况。

  8. T细胞耗竭 (T-cell Exhaustion):在肿瘤微环境中,持续受到抗原刺激的T细胞会逐渐失去其杀伤功能,进入一种“耗竭”状态。这是一种重要的免疫抑制机制,与肿瘤的免疫逃逸和不良预后相关。检测耗竭T细胞的空间分布(例如,它们是否与肿瘤细胞紧密相邻)对于理解免疫治疗反应至关重要。

  9. 恶性细胞共定位 (Malignant Cell Colocalization):指不同类型的细胞(如免疫细胞和肿瘤细胞)在空间上紧密相邻。这种空间关系是研究细胞间相互作用(如免疫抑制、信号传递)的关键线索。

  10. 背景校正 (Background Correction):从原始测量信号中减去非特异性结合、自发荧光、系统噪声等背景信号,以得到更真实的特异性信号。在空间转录组学中,背景可能来自组织本身的荧光、试剂残留等。

  11. 原位测序 (In Situ Sequencing):直接在组织切片上对RNA分子进行测序的技术,无需像传统测序那样先提取和扩增RNA。这使得RNA分子的空间位置得以保留。Xenium平台就基于此技术。

三、这个领域的人在关心什么

空间转录组学的研究者核心追问是:“在完整的组织环境中,不同细胞是如何通过基因表达来执行功能、相互交流、并最终决定组织(如肿瘤)的宏观行为的?” 他们不再满足于知道肿瘤里有“很多免疫细胞”,而是想知道:这些免疫细胞具体分布在肿瘤的哪个区域?是浸润在肿瘤内部,还是被挡在边缘?它们与肿瘤细胞的距离有多近?这些空间关系如何影响免疫细胞的激活或耗竭状态?

当前的主流方法主要依赖商业平台的“开箱即用”流程。例如,Xenium平台自带的软件会进行细胞分割和基因计数。然而,这些流程的局限正被逐渐揭示: - 细胞分割不准确:这是最根本的问题。基于细胞核的简单分割方法(如He et al., 2022 提出的方法)在细胞密度高、形态复杂的肿瘤组织中表现不佳,导致一个细胞被错误地分割成多个,或多个细胞被合并成一个。 - 转录本溢出未被充分校正:这是本文重点攻击的局限。大多数现有方法(如Bai et al., 2024 提出的背景校正策略)要么完全忽略溢出,要么使用过于简单的全局背景模型,无法处理局部、细胞类型依赖的溢出模式。 - 缺乏系统性的基准测试:尽管Xenium等平台被广泛使用,但像本文这样,基于大规模、多组织、多基因面板的实测数据,对平台性能进行系统性、定量化评估的工作非常稀缺。用户往往只能依赖厂商提供的、可能经过优化的演示数据。

本文相对于这些局限,做了三件事:第一,它提供了一个公开的、大规模的基准数据集,让整个领域可以客观地评估Xenium的性能。第二,它精确量化了转录本溢出,并揭示了其与细胞类型和局部密度的关系。第三,它提出了SPLIT方法,这是一种比现有方法更精细、更自适应的信号纯化策略,绕开了简单全局校正的局限。

四、数据问题

  • 数据来源:数据来自超过40个人类乳腺和肺肿瘤组织切片,使用10x Genomics的Xenium平台进行空间转录组学实验。同时,对同一组织样本的相邻切片或解离细胞进行了单核RNA测序(snRNA-seq),作为参考。
  • 数据形态:核心数据是空间坐标 + 基因计数矩阵。每个被检测到的RNA分子都有一个精确的(x, y)坐标,并被分配一个基因身份。经过细胞分割后,这些分子被汇总到每个细胞中,形成一个标准的“细胞×基因”计数矩阵,但每个细胞还额外关联了一个空间位置。此外,还有高分辨率的组织荧光图像(用于细胞分割)。
  • 维度和量级:每个组织切片通常包含数万到数十万个细胞,每个细胞检测几百个基因(取决于基因面板大小)。总数据量是TB级别的原始图像和数十GB的计数矩阵。
  • 结构特征:数据具有强空间依赖结构。相邻细胞的基因表达谱高度相关,因为它们在同一个组织微环境中。这种空间自相关是生物学信息的关键,也是统计建模的挑战。数据还具有层次结构:细胞 → 组织区域(如肿瘤核心、边缘、基质)→ 整个切片。
  • noise & 测量误差:噪声来源复杂且非高斯。
    • 主要噪声转录本溢出,这是一种空间相关的、非独立的噪声。一个高表达基因的细胞会“污染”其邻近细胞,导致噪声在空间上聚集。
    • 其他噪声:包括检测效率的随机性(每个RNA分子被检测到的概率远小于1,类似一个低概率的伯努利试验)、背景荧光基因面板的交叉反应等。计数数据本身是过离散的(方差远大于均值),不符合简单的泊松分布。
  • selection / bias / 缺失 / censoring / truncation / 计算约束
    • 基因面板选择偏差:实验只能测量预先选定的几百个基因,这本身就是一种巨大的选择偏差。所有未选基因的表达信息完全缺失。
    • 细胞分割偏差:分割算法会系统性地漏掉某些细胞(如形状不规则的细胞)或错误地合并细胞,导致细胞类型比例估计有偏。
    • 组织处理偏差:组织切片、固定、透化等步骤会引入RNA降解和空间移位,造成信号丢失和位置偏差。
    • 计算约束:处理TB级的图像数据和数百万个细胞的空间坐标,对内存和计算速度有极高要求。SPLIT方法的设计必须考虑可扩展性。

五、方法与模型问题

  • 文章用的分析方法
    1. 噪声量化:通过将Xenium数据与同一组织的snRNA-seq数据进行比对,作者可以识别出那些在snRNA-seq中不表达、但在Xenium中被检测到的基因-细胞对,从而量化转录本溢出的程度和模式。这是一种利用外部金标准进行校准的思路。
    2. SPLIT方法:其核心是一个两步信号纯化流程。
      • 第一步:背景建模与校正。对于每个细胞,SPLIT首先估计其局部背景信号。这个背景不是全局常数,而是基于该细胞周围一个“环形区域”(排除细胞本身)内的信号强度来动态计算的。这相当于一个空间自适应的高通滤波器
      • 第二步:混合信号解析。对于背景校正后仍然存在的、可能来自多个细胞重叠区域的信号,SPLIT使用一个基于概率的模型来解析。它假设一个像素点的信号是周围几个细胞的贡献的线性混合,然后通过一个迭代优化算法(类似于期望最大化算法)来估计每个细胞在每个像素点的贡献比例,从而将信号“归还”给正确的细胞。
  • 关键假设
    • 领域知识约束:假设snRNA-seq数据能提供“真实”的细胞类型特异性表达谱,作为去卷积的参考。这是一个合理的近似,但snRNA-seq本身也有自己的技术偏差(如只捕获核内RNA)。
    • 计算可行性:假设溢出信号在空间上是局部的(只影响邻近细胞),从而可以将问题分解为局部计算,避免全局优化。这是SPLIT方法可扩展的关键。
  • 推断 / 计算手段:主要使用图像处理(形态学操作、滤波)、概率建模(混合模型)、迭代优化(EM算法)。没有使用深度学习或复杂的贝叶斯推断。计算上,SPLIT被设计为可并行化,能在标准服务器上处理大规模数据集。
  • 核心结论 + 不确定性量化
    • 结论:Xenium数据存在显著的、细胞类型依赖的转录本溢出;SPLIT能有效校正这种溢出,提高信号纯度,并揭示被噪声掩盖的生物学信号(如T细胞耗竭与恶性细胞共定位)。
    • 不确定性量化几乎没有。文章通过可视化(如UMAP降维图、空间分布图)和定量指标(如信号纯度提升百分比)来展示SPLIT的效果,但没有为SPLIT校正后的每个基因表达值提供置信区间或标准误差。结论的稳健性主要通过在不同数据集(乳腺、肺肿瘤)上重复验证来体现,而非严格的统计推断。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 打分:4/5 星
    • 理由:作为Nature Methods上的方法学论文,它非常清晰地阐述了空间转录组学中的一个核心数据问题(信号溢出),并用直观的示意图和实测数据说明了问题的严重性。对于外行统计学家,读完能理解这个领域在关心什么、数据长什么样、主要噪声是什么。扣掉的一星是因为它假设读者对分子生物学实验流程(如原位测序、snRNA-seq)有基本了解,部分术语(如“基因面板”、“细胞分割”)的解释不够深入,需要读者自己额外查一下。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 科学趣味性:高。 这个问题本身非常迷人:我们如何从一张充满噪声、信号相互干扰的“空间基因地图”中,还原出每个细胞的真实“身份”和“状态”?这本质上是一个空间反卷积问题,与天文学中从模糊图像中还原星体、或信号处理中从混叠信号中分离源信号的问题有异曲同工之妙。对于任何对“从复杂、有噪声的观测中提取干净信号”感兴趣的统计学家来说,这都是一个值得了解的精彩案例。
    • 方法学空间:中等。 本文的方法学贡献(SPLIT)在生物学上很有效,但从统计建模角度看,它相对“朴素”。它主要依赖图像处理和启发式算法,而不是一个严格的概率生成模型。这留下了巨大的方法学空间:
      • 概率生成模型:可以构建一个完整的概率模型,将每个细胞的“真实”表达、转录本溢出过程(作为空间点过程)、检测效率(作为随机缺失)都纳入其中。然后通过贝叶斯推断或最大似然估计来同时学习所有参数。这比SPLIT的两步法更优雅,也能提供不确定性量化。
      • 不确定性量化:这是最明显的口子。SPLIT没有为校正后的表达量提供任何置信度。一个统计学家可以问:SPLIT校正后的信号,其方差有多大?我们有多大的把握说一个细胞确实表达了某个基因?这可以引入测量误差模型贝叶斯分层模型
      • 空间依赖结构:溢出噪声是空间相关的,但SPLIT的局部背景校正可能无法完全消除这种相关性。一个更精细的模型可以显式地建模这种空间协方差结构(例如,使用高斯过程或马尔可夫随机场)。
    • 现实相关性:高。 这种“信号混合-分离”的问题模式在科学中无处不在。除了空间转录组学,它还出现在:多重免疫荧光(不同荧光染料信号重叠)、遥感成像(一个像素混合了多种地物光谱)、质谱流式细胞术(信号通道间的溢出)。因此,理解这个问题的统计本质,对于处理许多其他领域的类似数据都有启发意义。
    • 明确结论:很有意思,值得留意。 虽然本文的方法本身不是统计前沿,但它清晰地定义了一个具有挑战性的、真实存在的统计反问题,并且这个问题在生物学领域极其重要。对于一位对“空间点过程”、“测量误差模型”或“贝叶斯反卷积”感兴趣的统计学家,这是一个绝佳的、有真实数据支撑的研究问题来源。
  3. 武器库匹配度:

    • 无明显接口,纯科普阅读。 本文的问题(空间信号反卷积)与研究者武器库中的核心工具(因果推断、高维U统计量、半参理论)没有直接、自然的连接。虽然“逆问题”的概念是相通的,但这里的噪声结构(空间相关的溢出)和模型(基于图像的混合模型)与研究者熟悉的“带随机噪声的逆问题”(如反卷积、断层扫描)在数学形式上差异很大。研究者现有的非参数统计和软件工程经验或许有助于理解数据探索和流程构建,但无法直接迁移来解决SPLIT的核心挑战。
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述/科普
      • 《Spatial transcriptomics: a new frontier in biology》 (或类似标题的综述,可在Nature Reviews Genetics或Nature Methods上查找)。这类综述会系统介绍各种空间转录组学技术(包括Xenium)的原理、优缺点和数据分析流程。
    • 关键的奠基或代表论文
      • 本文引用的 Bai et al., 2024 的论文(标题待核实,但摘要中提及了背景校正策略)。阅读这篇论文可以了解SPLIT之前的主流背景校正方法及其局限。
      • 本文引用的 He et al., 2022 的论文(标题待核实,但摘要中提及了细胞分割方法)。阅读这篇论文可以理解细胞分割这个基础步骤的挑战和现有解决方案。
      • 10x Genomics官方发布的Xenium数据分析白皮书或技术说明。这是了解平台官方数据处理流程和参数建议的第一手资料。
    • 可以动手玩的公开数据集
      • 本文作者已公开的数据集。论文中明确提到他们提供了超过40个肿瘤切片的数据。这是最直接、最相关的资源。可以关注论文的“数据可用性”声明部分,查找GEO或Figshare等数据库的链接。
      • 10x Genomics官网的Xenium数据集页面。10x Genomics提供了多个公开的Xenium演示数据集(如人类乳腺癌、小鼠大脑等),可以直接下载原始图像和计数矩阵,用于测试SPLIT或其他方法。

七、术语小抄

英文术语 中文 一句话解释
Spatial Transcriptomics 空间转录组学 在组织切片上测量基因表达并保留其空间位置的技术。
Xenium Xenium平台 10x Genomics公司的一款商业空间转录组学平台,基于原位测序。
Transcript Spillover 转录本溢出 一个细胞的RNA信号错误地“溅”到相邻细胞上,造成信号污染。
Gene Panel 基因面板 实验中预先选定的一组待检测基因。
Cell Segmentation 细胞分割 从图像中识别并勾画出每个细胞边界的过程。
snRNA-seq 单核RNA测序 只分析细胞核内RNA的测序技术,常作为空间数据的参考。
Signal Deconvolution 信号去卷积 将混合的测量信号分离成各个来源的贡献。
T-cell Exhaustion T细胞耗竭 肿瘤中T细胞因持续刺激而失去功能的状态。
Malignant Cell Colocalization 恶性细胞共定位 肿瘤细胞与其他类型细胞在空间上紧密相邻。
Background Correction 背景校正 从原始信号中减去非特异性噪声,得到真实信号。
In Situ Sequencing 原位测序 直接在组织切片上对RNA进行测序,保留其空间位置。
UMAP 统一流形逼近与投影 一种常用的降维和可视化方法,用于展示细胞间的相似性。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论