Nicheformer: a foundation model for single-cell and spatial omics¶
作者: Alejandro Tejada-Lapuerta, Anna C. Schaar, Robert Gutgesell, Giovanni Palla, Lennard Halle et al.
来源: Nature Methods
主题: 其他
相关性: 6/10
机构绿灯: Technical University of Munich(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41592-025-02814-z
一、这篇论文属于什么学科、要解决什么¶
-
学科定位:本文属于计算生物学中的单细胞基因组学与空间组学交叉领域。核心科学问题是:细胞的功能和身份不仅由其内在的基因表达决定,还强烈依赖于它在组织中的空间微环境(即它周围有哪些其他类型的细胞)。传统单细胞测序(scRNA-seq)将组织解离成单个细胞,丢失了所有空间信息;而空间转录组学(Spatial Transcriptomics)能测量细胞在组织切片上的位置和基因表达,但技术通量低、覆盖基因数少。本文试图用基础模型(Foundation Model) 弥合这两类数据之间的鸿沟,让大规模、低成本的无空间信息数据也能获得空间上下文信息。该领域目前处于“方法爆炸期”,大量基于深度学习的模型被提出,但缺乏统一、大规模预训练的通用模型。
-
本文的位置:它针对的是如何联合利用解离单细胞数据(海量但无空间信息)和空间转录组数据(有空间信息但规模小) 这一具体问题。现在做这件事的时机成熟,因为:(1) 空间转录组数据(尤其是靶向技术如 MERFISH、Xenium)正在快速积累;(2) Transformer 架构在生物序列(如 DNA、蛋白质)和单细胞数据(如 scGPT、Geneformer)上已证明有效;(3) 需要一个能同时处理两种数据模态的模型,以将空间信息“迁移”到无空间的数据集上。
二、关键术语扫盲¶
- 单细胞 RNA 测序 (scRNA-seq):一种技术,测量单个细胞中数千个基因的表达水平。缺点是细胞必须从组织中解离出来,失去了它们在组织中的原始位置信息。
- 空间转录组学 (Spatial Transcriptomics):一类技术,在保留细胞空间位置的同时测量其基因表达。分为两类:(a) 靶向(如 MERFISH、Xenium):预先选定一组基因(几百个),高精度定位;(b) 非靶向(如 10x Visium):捕获所有基因,但分辨率较低(一个点可能包含多个细胞)。
- 基础模型 (Foundation Model):在超大规模、多样化的数据上预训练的深度学习模型(通常是 Transformer),其学到的通用表征可以通过微调(fine-tuning)或线性探测(linear probing)适配到多种下游任务。例如 GPT、BERT。
- Transformer:一种神经网络架构,核心是自注意力机制,能捕捉输入序列中任意两个元素之间的依赖关系。在本文中,每个“细胞”被视为一个“词”,其基因表达谱和空间坐标构成输入。
- 自监督学习 (Self-Supervised Learning):一种无需人工标注标签的训练方法。模型通过预测输入数据中被遮盖的部分(如遮盖某些基因的表达值)来学习有意义的表征。本文使用的就是这种范式。
- 线性探测 (Linear Probing):一种评估预训练表征质量的方法。固定预训练模型的参数,只在其输出的表征之上训练一个简单的线性分类器或回归器。如果线性模型就能表现良好,说明表征本身已经很好地分离了不同类别。
- 微调 (Fine-Tuning):将预训练模型作为初始化,然后在特定下游任务的数据上继续训练整个模型(或部分层)以适配该任务。
- 空间微环境 (Spatial Microenvironment):一个细胞周围局部区域内的细胞类型组成和空间排列。例如,肿瘤细胞周围的免疫细胞浸润情况。这是本文要建模的核心生物学概念。
- 解离细胞 (Dissociated Cells):通过酶解或机械方法从组织中分离出来的单个细胞,失去了空间位置信息。scRNA-seq 数据就是解离细胞数据。
- 空间组成预测 (Spatial Composition Prediction):给定一个细胞的基因表达谱,预测其所在局部微环境中有哪些其他类型的细胞及其比例。这是本文设计的一个关键下游任务。
- 空间标签预测 (Spatial Label Prediction):预测一个细胞在组织切片上的具体空间坐标或区域(如“肿瘤核心”、“肿瘤边缘”)。
- MERFISH / Xenium:两种主流的靶向空间转录组学技术。它们通过荧光原位杂交或原位测序,在组织切片上直接成像并识别单个细胞中数百个基因的 mRNA 分子,从而获得单细胞分辨率的空间基因表达数据。
三、这个领域的人在关心什么¶
这个领域的研究者核心追问是:组织是如何“组装”起来的? 即,不同类型的细胞如何通过空间上的相互作用和通讯,共同执行生理功能或导致疾病(如癌症、神经退行性疾病)。他们不再满足于知道“肿瘤里有哪些免疫细胞”,而是想知道“这些免疫细胞具体分布在肿瘤的什么位置?它们和肿瘤细胞靠得多近?这种空间排列是否与病人预后相关?”
当前的主流方法分为两派: - 纯空间分析方法:如 Giotto (Dries et al., 2021) 和 Squidpy (Palla et al., 2021),它们直接对空间转录组数据进行邻域分析、细胞-细胞互作打分。局限是只能处理有空间信息的数据,无法利用海量的 scRNA-seq 数据。 - 单细胞基础模型:如 scGPT (Cui et al., 2024) 和 Geneformer (Theodoris et al., 2023),它们只在 scRNA-seq 数据上预训练,能很好地表征细胞状态,但完全忽略了空间上下文。本文的 Nicheformer 正是针对这一局限,通过联合预训练,将空间信息编码进模型,从而弥补了这两派之间的鸿沟。
四、数据问题¶
- 数据来源:数据来自公开数据库(如 GEO、Single Cell Portal)和内部生成的数据集。空间转录组数据主要来自 MERFISH 和 Xenium 两种靶向技术。
- 数据形态:每个样本是一个细胞,其特征是:
- 基因表达谱:一个高维稀疏向量(~20,000 个基因,但大部分表达值为0)。
- 空间坐标:二维坐标 (x, y),表示细胞在组织切片上的位置。
- 细胞类型标签:由领域专家通过聚类和标记基因鉴定。
- 组织来源:如“人类肺”、“小鼠脑”。
- 维度和量级:预训练语料 SpatialCorpus-110M 包含 1.1 亿个细胞(5700 万解离 + 5300 万空间细胞),覆盖 73 种组织。这是目前该领域最大的公开预训练数据集之一。
- 结构特征:数据具有层次结构(细胞 → 组织切片 → 组织类型 → 物种)和空间依赖结构(相邻细胞的基因表达高度相关,形成空间微环境)。模型需要同时处理这两种结构。
- Noise & 测量误差:
- scRNA-seq:存在dropout(基因表达被随机检测不到,导致大量零值)、批次效应(不同实验批次间的系统性差异)。
- 空间转录组:靶向技术(MERFISH/Xenium)的基因检测效率高,但基因选择偏差(只测几百个基因);此外,细胞分割(从图像中识别单个细胞边界)会引入误差。
- Selection / Bias:数据存在组织类型偏差(脑、肿瘤数据远多于其他组织)和技术偏差(不同空间技术的数据分布不同)。模型需要处理这些偏差以实现泛化。
- 哪些是“漂亮的统计学问题”:
- 高维稀疏数据的表征学习:如何从 2 万个基因中提取低维、有生物学意义的表征,同时处理 dropout 和批次效应。
- 空间依赖建模:如何将空间坐标(连续、非欧几里得)有效地融入 Transformer 的注意力机制中。
- 迁移学习与领域适应:如何将模型从有空间信息的数据迁移到无空间信息的数据,并保证迁移的有效性。
- 哪些是“纯工程或纯领域难题”:
- 数据整合与标准化:将来自不同平台、不同实验室、不同物种的数据统一成标准格式(如基因符号对齐、批次校正),这是巨大的工程挑战。
- 细胞类型注释:不同数据集使用的细胞类型命名和层级不一致,需要手动或半自动对齐。
五、方法与模型问题¶
- 分析方法:文章使用一个Transformer 编码器作为基础模型。输入是每个细胞的基因表达谱(经过对数归一化和特征选择)和空间坐标。模型通过自监督学习进行预训练:随机遮盖输入中一部分基因的表达值,然后让模型预测这些被遮盖的值。空间坐标通过一个空间位置编码器(类似 Transformer 中的位置编码)被注入模型,使模型能感知细胞间的空间关系。
- 关键假设:
- 空间上下文可以通过基因表达模式推断:即,一个细胞的基因表达谱包含了其所在微环境的信息(例如,靠近肿瘤的免疫细胞会表达特定的应激基因)。这是整个方法成立的生物学前提。
- Transformer 的自注意力机制能有效捕捉细胞间的空间依赖:模型假设通过注意力权重,可以学习到哪些细胞对彼此的空间上下文最重要。
- 推断 / 计算手段:深度学习(Transformer 预训练 + 微调)。模型训练使用标准的 Adam 优化器,在 8 个 A100 GPU 上进行。下游任务评估使用线性探测和微调。
- 核心结论 + 不确定性量化:
- 核心结论:Nicheformer 学到的细胞表征能有效预测空间微环境组成和空间标签,且显著优于仅在解离数据上训练的模型。它还能将空间信息“预测”到 scRNA-seq 数据上,实现空间信息的迁移。
- 不确定性量化:几乎没有。文章报告了分类/回归任务的性能指标(如准确率、F1 分数、均方误差),但未对模型预测的不确定性进行任何量化(例如,没有置信区间、没有贝叶斯推断、没有对预测不确定性的分析)。这是该领域深度学习方法的一个普遍弱点。
六、对统计学家的判断¶
- 这篇文章作为科普读物质量如何?
-
4/5 星。文章写得相当清晰,对空间转录组学的基本概念(解离 vs 空间、靶向 vs 非靶向)解释得不错。对于一位对单细胞生物学完全外行的统计学家,读完引言和结果部分,能理解“为什么空间信息重要”以及“模型在做什么”。但部分细节(如具体的预训练目标函数、注意力机制变体)对非 AI 背景的读者可能稍显晦涩。总体而言,是一篇很好的领域入门文章。
-
这里面有没有统计学家会觉得有意思的东西?
-
很有意思,值得留意。理由如下:
- (i) 科学趣味性:这个问题本身非常迷人。它触及了生物学的一个核心问题:结构如何决定功能?统计学家会欣赏这种将“位置”和“属性”联合建模的尝试,这类似于空间统计学,但数据规模和复杂性(高维、稀疏、非平稳)远超经典空间统计的范畴。
- (ii) 方法学空间:这里存在真正的统计挑战,而非简单的“套用标准方法”:
- 表征的统计性质:模型学到的 512 维细胞表征,其几何结构(如流形假设、各向同性)是什么?不同细胞类型在表征空间中是如何分布的?这直接关联到高维统计和流形学习。
- 迁移学习的理论:将空间信息从有空间数据迁移到无空间数据,其可识别性和泛化误差界是什么?这本质上是一个因果迁移学习或领域适应问题。什么条件下这种迁移是有效的?是否存在无法迁移的“反事实”空间上下文?
- 不确定性量化:模型预测“这个细胞周围有 30% 的 T 细胞”,但这个预测有多可靠?对于罕见细胞类型或从未见过的组织,预测不确定性应该很高。如何为这种深度学习的输出提供有意义的置信区间?这是一个开放且重要的问题。
- 计算-统计权衡:预训练 1.1 亿细胞的计算成本极高。是否存在更高效的统计方法(如基于核的方法、图神经网络)能在更小的数据上达到类似效果?Transformer 的注意力机制是否是最优的空间依赖建模方式?这里存在统计效率 vs 计算成本的经典权衡。
- (iii) 现实相关性:这种“多模态、大规模、有空间结构”的数据模式在神经科学(脑连接组)、生态学(物种分布)、流行病学(疾病空间传播)中普遍存在。统计学家在别处也会遇到类似问题:如何整合高分辨率但稀疏的“空间”数据与低分辨率但密集的“非空间”数据。
-
武器库匹配度:
-
无明显接口,纯科普阅读。虽然
high-dimensional asymptotics和software development在概念上相关(理解表征空间的维度和构建分析流程),但本文的核心方法(Transformer 预训练、自监督学习)不在very_familiar武器库中。nonparametric statistics和minimax bounds难以直接应用于这种非参数、非凸的深度学习模型。inverse problems也不直接对应。因此,不建议作为 follow-up 工作的起点,但作为拓宽视野的阅读非常有价值。 -
如果想进一步了解这个话题,下一步读什么?
- 入门综述:
- 《Spatial transcriptomics at the single-cell level》 (Moffitt et al., 2022, Nature Reviews Methods Primers)。这是一篇非常全面的综述,详细介绍了各种空间转录组技术的原理、数据特性和分析挑战,是入门该领域的绝佳读物。
- 奠基/代表论文:
- 《Geneformer: a foundation model for single-cell transcriptomics》 (Theodoris et al., 2023, Nature)。这是单细胞基础模型的奠基之作,仅在 scRNA-seq 上预训练。阅读它可以理解 Nicheformer 的基线模型和单细胞基础模型的通用范式。
- 《Spatial reconstruction of single-cell gene expression data》 (Satija et al., 2015, Nature Biotechnology)。这是将 scRNA-seq 数据映射到空间位置的早期经典工作(Seurat 包的核心算法),可以了解该问题的历史脉络。
- 可动手玩的数据集:
- MERFISH 小鼠脑数据:这是空间转录组学领域最常用的基准数据集之一,通常可在 BRAIN Initiative Cell Census Network (BICCN) 或 Allen Institute 的网站上公开获取。数据包含数万个细胞、数百个基因和精确的 3D 空间坐标,非常适合用来测试空间分析算法。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| scRNA-seq | 单细胞 RNA 测序 | 测量单个细胞中数千个基因的表达,但丢失了细胞在组织中的位置。 |
| Spatial Transcriptomics | 空间转录组学 | 在保留细胞空间位置的同时测量其基因表达的技术。 |
| Foundation Model | 基础模型 | 在超大规模数据上预训练的通用 AI 模型,可通过微调适配多种任务。 |
| Transformer | 变换器 | 一种基于自注意力机制的神经网络,擅长处理序列数据,捕捉长距离依赖。 |
| Self-Supervised Learning | 自监督学习 | 模型通过预测输入数据中被遮盖的部分来学习,无需人工标签。 |
| Linear Probing | 线性探测 | 固定预训练模型,只在其输出上训练一个线性分类器来评估表征质量。 |
| Fine-Tuning | 微调 | 在预训练模型基础上,用特定任务的数据继续训练整个模型。 |
| Spatial Microenvironment | 空间微环境 | 一个细胞周围局部区域内的细胞类型组成和空间排列。 |
| Dissociated Cells | 解离细胞 | 从组织中分离出来的单个细胞,失去了空间位置信息。 |
| MERFISH / Xenium | 多重抗误差荧光原位杂交 / 原位测序 | 两种高分辨率靶向空间转录组技术,可单细胞精度定位数百个基因。 |
| Dropout | 随机缺失 | scRNA-seq 中基因表达被随机检测不到的现象,导致数据中大量零值。 |
| Batch Effect | 批次效应 | 不同实验批次间由非生物学因素(如试剂、操作者)导致的系统性数据差异。 |
Maintained by 陈星宇 · Homepage · Source on GitHub