跳转至

Nicheformer: a foundation model for single-cell and spatial omics

作者: Alejandro Tejada-Lapuerta, Anna C. Schaar, Robert Gutgesell, Giovanni Palla, Lennard Halle et al.
来源: Nature Methods
主题: 其他
相关性: 6/10
机构绿灯: Technical University of Munich(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41592-025-02814-z


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于计算生物学中的单细胞基因组学空间组学交叉领域。核心科学问题是:细胞的功能和身份不仅由其内在的基因表达决定,还强烈依赖于它在组织中的空间微环境(即它周围有哪些其他类型的细胞)。传统单细胞测序(scRNA-seq)将组织解离成单个细胞,丢失了所有空间信息;而空间转录组学(Spatial Transcriptomics)能测量细胞在组织切片上的位置和基因表达,但技术通量低、覆盖基因数少。本文试图用基础模型(Foundation Model) 弥合这两类数据之间的鸿沟,让大规模、低成本的无空间信息数据也能获得空间上下文信息。该领域目前处于“方法爆炸期”,大量基于深度学习的模型被提出,但缺乏统一、大规模预训练的通用模型。

  • 本文的位置:它针对的是如何联合利用解离单细胞数据(海量但无空间信息)和空间转录组数据(有空间信息但规模小) 这一具体问题。现在做这件事的时机成熟,因为:(1) 空间转录组数据(尤其是靶向技术如 MERFISH、Xenium)正在快速积累;(2) Transformer 架构在生物序列(如 DNA、蛋白质)和单细胞数据(如 scGPT、Geneformer)上已证明有效;(3) 需要一个能同时处理两种数据模态的模型,以将空间信息“迁移”到无空间的数据集上。

二、关键术语扫盲

  1. 单细胞 RNA 测序 (scRNA-seq):一种技术,测量单个细胞中数千个基因的表达水平。缺点是细胞必须从组织中解离出来,失去了它们在组织中的原始位置信息。
  2. 空间转录组学 (Spatial Transcriptomics):一类技术,在保留细胞空间位置的同时测量其基因表达。分为两类:(a) 靶向(如 MERFISH、Xenium):预先选定一组基因(几百个),高精度定位;(b) 非靶向(如 10x Visium):捕获所有基因,但分辨率较低(一个点可能包含多个细胞)。
  3. 基础模型 (Foundation Model):在超大规模、多样化的数据上预训练的深度学习模型(通常是 Transformer),其学到的通用表征可以通过微调(fine-tuning)或线性探测(linear probing)适配到多种下游任务。例如 GPT、BERT。
  4. Transformer:一种神经网络架构,核心是自注意力机制,能捕捉输入序列中任意两个元素之间的依赖关系。在本文中,每个“细胞”被视为一个“词”,其基因表达谱和空间坐标构成输入。
  5. 自监督学习 (Self-Supervised Learning):一种无需人工标注标签的训练方法。模型通过预测输入数据中被遮盖的部分(如遮盖某些基因的表达值)来学习有意义的表征。本文使用的就是这种范式。
  6. 线性探测 (Linear Probing):一种评估预训练表征质量的方法。固定预训练模型的参数,只在其输出的表征之上训练一个简单的线性分类器或回归器。如果线性模型就能表现良好,说明表征本身已经很好地分离了不同类别。
  7. 微调 (Fine-Tuning):将预训练模型作为初始化,然后在特定下游任务的数据上继续训练整个模型(或部分层)以适配该任务。
  8. 空间微环境 (Spatial Microenvironment):一个细胞周围局部区域内的细胞类型组成和空间排列。例如,肿瘤细胞周围的免疫细胞浸润情况。这是本文要建模的核心生物学概念。
  9. 解离细胞 (Dissociated Cells):通过酶解或机械方法从组织中分离出来的单个细胞,失去了空间位置信息。scRNA-seq 数据就是解离细胞数据。
  10. 空间组成预测 (Spatial Composition Prediction):给定一个细胞的基因表达谱,预测其所在局部微环境中有哪些其他类型的细胞及其比例。这是本文设计的一个关键下游任务。
  11. 空间标签预测 (Spatial Label Prediction):预测一个细胞在组织切片上的具体空间坐标或区域(如“肿瘤核心”、“肿瘤边缘”)。
  12. MERFISH / Xenium:两种主流的靶向空间转录组学技术。它们通过荧光原位杂交或原位测序,在组织切片上直接成像并识别单个细胞中数百个基因的 mRNA 分子,从而获得单细胞分辨率的空间基因表达数据。

三、这个领域的人在关心什么

这个领域的研究者核心追问是:组织是如何“组装”起来的? 即,不同类型的细胞如何通过空间上的相互作用和通讯,共同执行生理功能或导致疾病(如癌症、神经退行性疾病)。他们不再满足于知道“肿瘤里有哪些免疫细胞”,而是想知道“这些免疫细胞具体分布在肿瘤的什么位置?它们和肿瘤细胞靠得多近?这种空间排列是否与病人预后相关?”

当前的主流方法分为两派: - 纯空间分析方法:如 Giotto (Dries et al., 2021) 和 Squidpy (Palla et al., 2021),它们直接对空间转录组数据进行邻域分析、细胞-细胞互作打分。局限是只能处理有空间信息的数据,无法利用海量的 scRNA-seq 数据。 - 单细胞基础模型:如 scGPT (Cui et al., 2024) 和 Geneformer (Theodoris et al., 2023),它们只在 scRNA-seq 数据上预训练,能很好地表征细胞状态,但完全忽略了空间上下文。本文的 Nicheformer 正是针对这一局限,通过联合预训练,将空间信息编码进模型,从而弥补了这两派之间的鸿沟。

四、数据问题

  • 数据来源:数据来自公开数据库(如 GEO、Single Cell Portal)和内部生成的数据集。空间转录组数据主要来自 MERFISH 和 Xenium 两种靶向技术。
  • 数据形态:每个样本是一个细胞,其特征是:
    • 基因表达谱:一个高维稀疏向量(~20,000 个基因,但大部分表达值为0)。
    • 空间坐标:二维坐标 (x, y),表示细胞在组织切片上的位置。
    • 细胞类型标签:由领域专家通过聚类和标记基因鉴定。
    • 组织来源:如“人类肺”、“小鼠脑”。
  • 维度和量级:预训练语料 SpatialCorpus-110M 包含 1.1 亿个细胞(5700 万解离 + 5300 万空间细胞),覆盖 73 种组织。这是目前该领域最大的公开预训练数据集之一。
  • 结构特征:数据具有层次结构(细胞 → 组织切片 → 组织类型 → 物种)和空间依赖结构(相邻细胞的基因表达高度相关,形成空间微环境)。模型需要同时处理这两种结构。
  • Noise & 测量误差
    • scRNA-seq:存在dropout(基因表达被随机检测不到,导致大量零值)、批次效应(不同实验批次间的系统性差异)。
    • 空间转录组:靶向技术(MERFISH/Xenium)的基因检测效率高,但基因选择偏差(只测几百个基因);此外,细胞分割(从图像中识别单个细胞边界)会引入误差。
  • Selection / Bias:数据存在组织类型偏差(脑、肿瘤数据远多于其他组织)和技术偏差(不同空间技术的数据分布不同)。模型需要处理这些偏差以实现泛化。
  • 哪些是“漂亮的统计学问题”
    • 高维稀疏数据的表征学习:如何从 2 万个基因中提取低维、有生物学意义的表征,同时处理 dropout 和批次效应。
    • 空间依赖建模:如何将空间坐标(连续、非欧几里得)有效地融入 Transformer 的注意力机制中。
    • 迁移学习与领域适应:如何将模型从有空间信息的数据迁移到无空间信息的数据,并保证迁移的有效性。
  • 哪些是“纯工程或纯领域难题”
    • 数据整合与标准化:将来自不同平台、不同实验室、不同物种的数据统一成标准格式(如基因符号对齐、批次校正),这是巨大的工程挑战。
    • 细胞类型注释:不同数据集使用的细胞类型命名和层级不一致,需要手动或半自动对齐。

五、方法与模型问题

  • 分析方法:文章使用一个Transformer 编码器作为基础模型。输入是每个细胞的基因表达谱(经过对数归一化和特征选择)和空间坐标。模型通过自监督学习进行预训练:随机遮盖输入中一部分基因的表达值,然后让模型预测这些被遮盖的值。空间坐标通过一个空间位置编码器(类似 Transformer 中的位置编码)被注入模型,使模型能感知细胞间的空间关系。
  • 关键假设
    1. 空间上下文可以通过基因表达模式推断:即,一个细胞的基因表达谱包含了其所在微环境的信息(例如,靠近肿瘤的免疫细胞会表达特定的应激基因)。这是整个方法成立的生物学前提。
    2. Transformer 的自注意力机制能有效捕捉细胞间的空间依赖:模型假设通过注意力权重,可以学习到哪些细胞对彼此的空间上下文最重要。
  • 推断 / 计算手段深度学习(Transformer 预训练 + 微调)。模型训练使用标准的 Adam 优化器,在 8 个 A100 GPU 上进行。下游任务评估使用线性探测微调
  • 核心结论 + 不确定性量化
    • 核心结论:Nicheformer 学到的细胞表征能有效预测空间微环境组成和空间标签,且显著优于仅在解离数据上训练的模型。它还能将空间信息“预测”到 scRNA-seq 数据上,实现空间信息的迁移。
    • 不确定性量化几乎没有。文章报告了分类/回归任务的性能指标(如准确率、F1 分数、均方误差),但未对模型预测的不确定性进行任何量化(例如,没有置信区间、没有贝叶斯推断、没有对预测不确定性的分析)。这是该领域深度学习方法的一个普遍弱点。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?
  2. 4/5 星。文章写得相当清晰,对空间转录组学的基本概念(解离 vs 空间、靶向 vs 非靶向)解释得不错。对于一位对单细胞生物学完全外行的统计学家,读完引言和结果部分,能理解“为什么空间信息重要”以及“模型在做什么”。但部分细节(如具体的预训练目标函数、注意力机制变体)对非 AI 背景的读者可能稍显晦涩。总体而言,是一篇很好的领域入门文章。

  3. 这里面有没有统计学家会觉得有意思的东西?

  4. 很有意思,值得留意。理由如下:

    • (i) 科学趣味性:这个问题本身非常迷人。它触及了生物学的一个核心问题:结构如何决定功能?统计学家会欣赏这种将“位置”和“属性”联合建模的尝试,这类似于空间统计学,但数据规模和复杂性(高维、稀疏、非平稳)远超经典空间统计的范畴。
    • (ii) 方法学空间:这里存在真正的统计挑战,而非简单的“套用标准方法”:
      • 表征的统计性质:模型学到的 512 维细胞表征,其几何结构(如流形假设、各向同性)是什么?不同细胞类型在表征空间中是如何分布的?这直接关联到高维统计流形学习
      • 迁移学习的理论:将空间信息从有空间数据迁移到无空间数据,其可识别性泛化误差界是什么?这本质上是一个因果迁移学习领域适应问题。什么条件下这种迁移是有效的?是否存在无法迁移的“反事实”空间上下文?
      • 不确定性量化:模型预测“这个细胞周围有 30% 的 T 细胞”,但这个预测有多可靠?对于罕见细胞类型或从未见过的组织,预测不确定性应该很高。如何为这种深度学习的输出提供有意义的置信区间?这是一个开放且重要的问题。
      • 计算-统计权衡:预训练 1.1 亿细胞的计算成本极高。是否存在更高效的统计方法(如基于核的方法、图神经网络)能在更小的数据上达到类似效果?Transformer 的注意力机制是否是最优的空间依赖建模方式?这里存在统计效率 vs 计算成本的经典权衡。
    • (iii) 现实相关性:这种“多模态、大规模、有空间结构”的数据模式在神经科学(脑连接组)、生态学(物种分布)、流行病学(疾病空间传播)中普遍存在。统计学家在别处也会遇到类似问题:如何整合高分辨率但稀疏的“空间”数据与低分辨率但密集的“非空间”数据。
  5. 武器库匹配度

  6. 无明显接口,纯科普阅读。虽然 high-dimensional asymptoticssoftware development 在概念上相关(理解表征空间的维度和构建分析流程),但本文的核心方法(Transformer 预训练、自监督学习)不在 very_familiar 武器库中。nonparametric statisticsminimax bounds 难以直接应用于这种非参数、非凸的深度学习模型。inverse problems 也不直接对应。因此,不建议作为 follow-up 工作的起点,但作为拓宽视野的阅读非常有价值。

  7. 如果想进一步了解这个话题,下一步读什么?

  8. 入门综述
    • 《Spatial transcriptomics at the single-cell level》 (Moffitt et al., 2022, Nature Reviews Methods Primers)。这是一篇非常全面的综述,详细介绍了各种空间转录组技术的原理、数据特性和分析挑战,是入门该领域的绝佳读物。
  9. 奠基/代表论文
    • 《Geneformer: a foundation model for single-cell transcriptomics》 (Theodoris et al., 2023, Nature)。这是单细胞基础模型的奠基之作,仅在 scRNA-seq 上预训练。阅读它可以理解 Nicheformer 的基线模型和单细胞基础模型的通用范式。
    • 《Spatial reconstruction of single-cell gene expression data》 (Satija et al., 2015, Nature Biotechnology)。这是将 scRNA-seq 数据映射到空间位置的早期经典工作(Seurat 包的核心算法),可以了解该问题的历史脉络。
  10. 可动手玩的数据集
    • MERFISH 小鼠脑数据:这是空间转录组学领域最常用的基准数据集之一,通常可在 BRAIN Initiative Cell Census Network (BICCN)Allen Institute 的网站上公开获取。数据包含数万个细胞、数百个基因和精确的 3D 空间坐标,非常适合用来测试空间分析算法。

七、术语小抄

英文术语 中文 一句话解释
scRNA-seq 单细胞 RNA 测序 测量单个细胞中数千个基因的表达,但丢失了细胞在组织中的位置。
Spatial Transcriptomics 空间转录组学 在保留细胞空间位置的同时测量其基因表达的技术。
Foundation Model 基础模型 在超大规模数据上预训练的通用 AI 模型,可通过微调适配多种任务。
Transformer 变换器 一种基于自注意力机制的神经网络,擅长处理序列数据,捕捉长距离依赖。
Self-Supervised Learning 自监督学习 模型通过预测输入数据中被遮盖的部分来学习,无需人工标签。
Linear Probing 线性探测 固定预训练模型,只在其输出上训练一个线性分类器来评估表征质量。
Fine-Tuning 微调 在预训练模型基础上,用特定任务的数据继续训练整个模型。
Spatial Microenvironment 空间微环境 一个细胞周围局部区域内的细胞类型组成和空间排列。
Dissociated Cells 解离细胞 从组织中分离出来的单个细胞,失去了空间位置信息。
MERFISH / Xenium 多重抗误差荧光原位杂交 / 原位测序 两种高分辨率靶向空间转录组技术,可单细胞精度定位数百个基因。
Dropout 随机缺失 scRNA-seq 中基因表达被随机检测不到的现象,导致数据中大量零值。
Batch Effect 批次效应 不同实验批次间由非生物学因素(如试剂、操作者)导致的系统性数据差异。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论