跳转至

NicheTrans: spatial-aware cross-omics translation

作者: Zhikang Wang, Qi Zou, Senlin Lin, Sijie Li, Yan Cui et al.
来源: Nature Methods
主题: 其他
相关性: 5/10
机构绿灯: Fudan University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41592-026-03153-3


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于空间组学(Spatial Omics)计算生物学的交叉领域。空间组学是近年来生物学最热门的子领域之一,核心科学问题是:在保留细胞在组织中原位位置信息的前提下,测量细胞内的分子(如RNA、蛋白质),从而理解细胞如何根据其“邻居”和环境来执行功能。 目前该领域成熟度中等——测量技术(如空间转录组学)发展极快,但数据分析方法(尤其是整合不同组学数据的方法)仍处于早期、快速迭代阶段。
  • 本文的位置:它针对的是跨组学翻译(Cross-omics Translation) 这个具体问题。现实中,同时测量一个组织切片上所有细胞的RNA和蛋白质(即“空间多组学”)在技术上极其困难、昂贵且需要特殊设备。而只测量RNA(空间转录组学)则相对容易。本文提出的NicheTrans,目标是从容易获取的“单组学”空间数据(如RNA)出发,通过计算模型“翻译”或“推断”出难以获取的“多组学”数据(如蛋白质)。之所以现在能做,是因为Transformer等深度学习模型在捕捉复杂空间依赖关系上取得了突破。

二、关键术语扫盲

  1. 空间转录组学 (Spatial Transcriptomics):一种技术,可以测量组织切片上每个“点”(spot,通常包含几个到几十个细胞)的基因表达水平(即哪些基因被激活了),并记录这些点在切片上的二维坐标。它回答了“哪个基因在哪里表达”。
  2. 空间蛋白质组学 (Spatial Proteomics):类似地,测量组织切片上每个点的蛋白质丰度。蛋白质是执行功能的分子,比RNA更直接地反映细胞状态,但测量难度更大。
  3. 组学 (Omics):指对一个生物系统内所有分子进行大规模研究的学科后缀,如基因组学(DNA)、转录组学(RNA)、蛋白质组学(蛋白质)。
  4. 跨组学翻译 (Cross-omics Translation):一种计算任务,利用一种组学数据(如RNA)来预测另一种组学数据(如蛋白质)。其生物学基础是,RNA和蛋白质的表达水平通常(但不总是)相关。
  5. 细胞微环境 (Cellular Microenvironment):一个细胞周围的其他细胞、细胞外基质、信号分子等。在空间组学中,这通常指一个细胞(或点)的“空间邻域”——即其物理位置附近的细胞。这是理解细胞功能的关键。
  6. Transformer:一种深度学习架构,最初用于自然语言处理。其核心是自注意力机制,可以学习输入数据中任意两个元素之间的关系。在本文中,它被用来学习一个细胞(点)与其所有邻居细胞之间的空间关系。
  7. 自注意力机制 (Self-Attention):Transformer的核心组件。它允许模型在处理一个数据点(如一个细胞)时,动态地“关注”数据中所有其他点,并计算它们之间的相关性权重。在空间组学中,这相当于让模型自己学习哪些邻居细胞对当前细胞的状态最重要。
  8. 空间邻域编码 (Spatial Neighborhood Encoding):将每个细胞的物理位置信息(坐标)和其邻居的基因表达信息,编码成一个模型可以处理的数学向量。NicheTrans的创新之一就是显式地编码了这个“微环境”信息。
  9. 多模态数据整合 (Multimodal Data Integration):将来自不同技术、不同测量类型的数据(如RNA和蛋白质)放在一个统一的框架下进行分析,以获取更全面的生物学图景。
  10. 空间多组学域 (Spatial Multiomics Domains):通过整合RNA和蛋白质数据,在组织切片上识别出的具有独特分子特征和空间位置的功能区域。这些区域可能对应着不同的组织结构或疾病状态。
  11. 阿尔茨海默病 (Alzheimer‘s Disease, AD):一种神经退行性疾病。本文用它作为案例,展示了NicheTrans如何帮助发现与疾病相关的、单靠RNA数据无法发现的细胞状态和分子通路。
  12. 胶质细胞 (Glial Cells):大脑中的非神经元细胞,起支持、营养、保护神经元的作用。近年来发现它们在阿尔茨海默病等疾病中扮演关键角色。本文通过翻译出的蛋白质标记物,量化了不同胶质细胞亚型在脑组织中的空间分布。

三、这个领域的人在关心什么

这个领域的研究者,本质上在追问一个生物学最根本的问题:细胞是如何在三维空间中组织起来,形成一个功能性的器官或组织的? 他们不再满足于把细胞打碎、在试管里研究单个分子,而是希望看到分子在原生环境中的“社会关系”——谁和谁挨着,谁在给谁发信号,谁在生病时改变了行为。

具体来说,他们关心: 1. 细胞“身份”的空间决定因素:一个细胞之所以是神经元而不是胶质细胞,除了其内在的基因程序,还因为它周围有什么细胞?空间组学数据提供了回答这个问题的“社交网络”。 2. 疾病的空间病理学:比如在肿瘤中,癌细胞如何与周围的免疫细胞、基质细胞相互作用来促进生长和转移?在阿尔茨海默病中,异常的蛋白质(如淀粉样β)是如何在大脑中扩散并影响不同脑区的细胞? 3. 从“是什么”到“为什么”的跨越:单组学(如RNA)能告诉我们“哪里有什么基因在表达”,但多组学(RNA+蛋白质)能告诉我们“这个基因表达是否真的导致了蛋白质功能的变化”。翻译方法试图在数据层面弥合这个鸿沟。

当前主流方法与局限: - 主流方法:早期的跨组学翻译方法,如 Bian & Fan (2022) 提出的方法,主要基于单细胞数据。它们假设一个细胞的RNA和蛋白质表达之间存在一个全局的、共享的映射关系,然后利用配对或非配对的单细胞数据来学习这个映射。 - 已知局限:这些方法忽略了空间位置信息。它们把每个细胞当作独立的个体,没有考虑细胞微环境对蛋白质表达的影响。例如,一个肿瘤细胞如果被免疫细胞包围,其蛋白质表达谱(如免疫检查点蛋白)会与孤立的肿瘤细胞完全不同。NicheTrans的贡献正是显式地将空间邻域信息作为输入,从而捕捉到这种由微环境驱动的蛋白质表达变化。它绕开了“全局映射”的强假设,转而学习一个“空间上下文依赖”的映射。

四、数据问题

  • 数据来源:来自公开的空间组学数据集,包括空间转录组学(如10x Visium技术,测量RNA)和空间蛋白质组学(如CODEX或IMC技术,测量蛋白质)。这些数据通常来自对小鼠或人类组织(如脑、肿瘤)的冷冻切片进行的多重染色和成像。
  • 数据形态:本质上是空间点过程高维向量的结合。每个“点”(spot)是一个空间坐标(x, y),并关联一个高维向量(如数千个基因的表达量,或数十个蛋白质的丰度)。数据可以看作是一张“图像”,但像素是稀疏的、不规则排列的点,而不是规则的网格。
  • 结构特征:具有强烈的空间依赖结构。相邻点的基因/蛋白质表达高度相关,因为它们在同一个组织微环境中。这种依赖是非平稳的,且在不同组织区域(如肿瘤核心 vs. 边缘)变化很大。
  • Noise & 测量误差
    • 空间转录组学:噪声主要来自技术性dropout(许多基因在单个点检测不到,导致大量零值)和测序深度差异。数据通常被建模为负二项分布泊松分布
    • 空间蛋白质组学:噪声来自抗体非特异性结合、成像噪声等。数据通常是连续值,但经过复杂的预处理(如背景校正、归一化)。
    • 跨模态噪声:RNA和蛋白质的测量噪声是相关的(因为来自同一组织),但相关结构未知且复杂。
  • Selection / Bias / 缺失
    • 配对数据稀缺:同时测量RNA和蛋白质的“黄金标准”数据非常少,且通常只覆盖少量蛋白质(如几十种),而RNA数据覆盖数千个基因。这是典型的缺失数据问题——我们想预测的“目标”蛋白质数据在大部分空间点上都是缺失的。
    • 空间分辨率不匹配:不同技术的空间分辨率不同(如Visium的spot直径55μm,而CODEX是单细胞级)。这导致数据对齐时存在聚合偏差
  • 哪些是“漂亮的统计学问题”
    • 空间依赖的缺失数据插补:如何利用空间结构(而非独立同分布假设)来插补高维、稀疏的蛋白质数据?这是一个有挑战性的空间统计 + 矩阵补全问题。
    • 跨模态的分布对齐:如何将两个具有不同噪声模型、不同分辨率和不同覆盖度的高维分布(RNA和蛋白质)进行对齐?这类似于因果推断中的代理学习(Proximal Learning)迁移学习中的协变量偏移问题。
    • 不确定性量化:模型翻译出的蛋白质表达有多可靠?能否给出每个预测值的置信区间?这在生物学应用中至关重要,但本文未做。
  • 哪些是“纯工程或领域难题”:数据预处理(如批次效应校正、空间对齐)、计算资源(Transformer模型训练需要大量GPU)、生物学验证(翻译出的蛋白质是否真的有功能意义)。

五、方法与模型问题

  • 分析方法:NicheTrans的核心是一个基于Transformer的编码器-解码器架构
    1. 输入:对于每个空间点,输入其自身基因表达向量空间邻域编码。邻域编码是通过一个图神经网络(GNN)或简单的K近邻聚合,将周围点的基因表达和相对位置信息整合成一个向量。
    2. 编码器:一个Transformer模型,其自注意力机制在所有空间点之间运行。这允许模型学习一个点与其所有邻居(甚至更远点)之间的长程依赖关系,从而捕捉全局的空间组织结构。
    3. 解码器:将编码后的空间上下文表示,映射到目标蛋白质的表达向量。这是一个多任务学习问题,每个蛋白质是一个输出任务。
    4. 训练:在少量配对数据(同时有RNA和蛋白质的点)上进行监督学习,优化目标是预测蛋白质表达与真实值之间的均方误差(MSE)或负对数似然。
  • 关键假设
    1. 空间平滑性:相邻点的蛋白质表达是相似的,或者至少其差异可以由空间上下文解释。这是所有空间方法的基础。
    2. 跨模态可翻译性:RNA表达和空间上下文信息,足以预测蛋白质表达。这个假设在生物学上部分成立(中心法则),但忽略了翻译后修饰、蛋白质降解等复杂过程。
    3. Transformer的容量足够:假设自注意力机制能够捕捉到决定蛋白质表达的所有关键空间关系。
  • 推断 / 计算手段深度学习(Transformer + 反向传播 + Adam优化器)。没有使用贝叶斯方法或MCMC。不确定性量化基本缺失——模型只给出点预测,没有置信区间。
  • 核心结论与不确定性:结论是NicheTrans能有效从空间转录组数据翻译出空间蛋白质组数据,并发现新的生物学结构(如AD中的空间多组学域)。不确定性完全没有被量化。模型预测的可靠性仅通过下游生物学验证(如免疫组化染色)来间接确认,缺乏统计上的严谨性。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 评分4/5 星
    • 理由:作为Nature Methods上的方法学论文,它写得相当清晰。对统计学家来说,它很好地展示了“空间组学”这个领域在关心什么(细胞微环境)、面对什么数据(空间点过程+高维向量)、以及用什么工具(Transformer)。术语解释得不错,大问题(跨组学翻译)也讲明白了。扣一星是因为它没有深入讨论统计挑战(如不确定性、噪声模型),且方法部分对非深度学习专家可能稍显晦涩。但作为一篇入门级科普,它完全合格,能让你快速理解这个领域的核心范式。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 科学趣味性非常高。这个问题本身极其迷人:我们能否从“容易测量的”分子(RNA)和“细胞的社会关系”(空间位置)中,推断出“难以测量的”分子(蛋白质)?这本质上是一个反问题,而且是一个有生物学意义的反问题。它直接关系到我们能否以更低的成本、更广的覆盖度来理解疾病机制。作为一个好奇的统计学家,了解这个领域绝对值得。
    • 方法学空间巨大,但本文未触及。本文的方法学贡献是工程性的(设计了一个能工作的Transformer架构),而不是统计性的。它留下的统计挑战非常“漂亮”:
      • 不确定性量化(UQ):这是最明显的口子。如何为每个翻译出的蛋白质表达值提供一个可靠的置信区间?这需要将空间依赖、跨模态噪声和模型不确定性都考虑进去。可以想象一个贝叶斯空间模型共形预测(Conformal Prediction) 框架。
      • 识别问题:RNA和蛋白质之间的映射关系是否唯一?是否存在多个不同的蛋白质表达模式对应同一个RNA表达模式?这类似于因果推断中的工具变量代理变量问题。空间上下文信息本身可能就是一个强大的“工具”,帮助识别出真正的因果映射。
      • 高维与依赖结构:数千个基因和数十个蛋白质,加上复杂的空间依赖,构成了一个典型的高维、非独立数据问题。如何设计一个既能捕捉空间结构又能处理高维度的统计模型?图模型空间高斯过程张量回归都是潜在的候选。
      • 计算-统计权衡:Transformer模型的计算成本极高。是否存在一个更简单、统计上更高效(但可能计算上更慢)的替代模型?或者,能否证明在某些条件下,Transformer是达到最优统计效率所必需的?
    • 现实相关性非常高。这种“从易测推断难测”的模式在科学中无处不在:从遥感(从可见光推断土壤成分)到材料科学(从XRD推断晶体结构)。统计学家在别处也会遇到类似的数据结构(空间依赖、多模态、缺失数据)。
    • 明确结论很有意思,值得留意。但注意,是问题本身留下的统计挑战值得留意,而不是本文的方法。本文是通往这些有趣统计问题的绝佳入口
  3. 武器库匹配度

    • 无明显接口,纯科普阅读。你的武器库(非参、高维、U-统计量、因果推断)与本文使用的深度Transformer模型没有直接的技术重叠。虽然空间依赖结构可以用图模型空间统计来建模,但本文并未采用这些方法,且你的武器库中也没有专门处理大规模图神经网络或Transformer的工具。因此,不建议基于本文做任何follow-up工作。把它当作一次愉快的科普阅读,了解一个有趣的新领域即可。
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述
      • “Spatial transcriptomics and its applications in cancer research” (或类似标题的综述,可在Nature Reviews Cancer等期刊找到)。这类综述会从生物学角度讲清楚空间组学能做什么,是很好的背景阅读。
      • “Computational methods for spatial transcriptomics” (如Nature Methods或Genome Biology上的综述)。这类综述会系统介绍数据分析方法,包括空间聚类、细胞类型反卷积、配体-受体分析等,能帮你建立方法学地图。
    • 关键奠基或代表论文
      • Bian & Fan (2022):本文引用的单细胞翻译方法。阅读它可以理解“没有空间信息”的方法是什么样,从而更深刻地理解NicheTrans的贡献。
      • Ståhl et al. (2016) “Visualization and analysis of gene expression in tissue sections by spatial transcriptomics” (Science):空间转录组学的奠基性论文之一,介绍了10x Visium技术的前身。读它可以理解数据是如何产生的。
    • 可以动手玩的公开数据集
      • 10x Genomics 官网提供多个空间转录组学(Visium)公开数据集,包括人类乳腺癌、小鼠脑等。这些是标准基准数据。
      • 斯坦福大学的SPOTlightSquidpy等Python包,提供了处理和分析空间转录组数据的教程和示例数据,可以让你快速上手体验。

七、术语小抄

英文术语 中文 一句话解释
Spatial Transcriptomics 空间转录组学 在组织切片上测量每个位置的基因表达,保留空间信息。
Spatial Proteomics 空间蛋白质组学 在组织切片上测量每个位置的蛋白质丰度,比RNA更接近功能。
Cross-omics Translation 跨组学翻译 用易测的组学数据(如RNA)预测难测的组学数据(如蛋白质)。
Cellular Microenvironment 细胞微环境 一个细胞周围的其他细胞和分子,决定其行为和命运。
Transformer Transformer 一种深度学习模型,通过自注意力机制捕捉数据中所有元素间的关系。
Self-Attention 自注意力机制 让模型在处理一个点时,能“关注”所有其他点并学习它们的重要性。
Spatial Neighborhood Encoding 空间邻域编码 将细胞的位置和邻居信息转化为模型可读的数学向量。
Multimodal Data Integration 多模态数据整合 将不同类型(如RNA和蛋白质)的数据放在一起分析。
Spatial Multiomics Domains 空间多组学域 通过整合多组学数据在组织上识别出的功能区域。
Dropout (in scRNA-seq) 技术性缺失 由于技术限制,许多基因在单个细胞/点中未被检测到,导致大量零值。
Batch Effect 批次效应 不同实验批次引入的系统性技术差异,需要校正。
Visium Visium 10x Genomics公司的一种主流空间转录组学技术。
CODEX / IMC CODEX / IMC 两种主流的空间蛋白质组学成像技术。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论