跳转至

TranscriptFormer: A generative cell atlas across 1.5 billion years of evolution

作者: James D. Pearce, Sara E. Simmonds, Gita Mahmoudabadi, Lakshmi Krishnan, Giovanni Palla et al.
来源: Science
主题: 其他
相关性: 7/10
机构绿灯: Stanford University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1126/science.aec8514


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于单细胞转录组学计算生物学的交叉领域,具体是单细胞基础模型这一新兴方向。单细胞转录组学通过测量单个细胞中所有基因的表达水平(即“转录组”),来揭示细胞的身份、状态和功能。传统上,这类分析依赖于将细胞与已知的参考图谱(如人类细胞图谱)进行比对。本文试图回答一个更宏大的问题:是否存在跨越物种、跨越进化时间的通用细胞“语言”或“语法”? 如果能学习到这种通用表示,那么一个物种的细胞类型知识就可以直接迁移到另一个物种上,无需为每个物种从头构建参考图谱。这个领域目前正处于从“为每个物种建图谱”到“跨物种通用模型”的范式转变初期,本文是这一转变的标志性工作。

  • 本文的位置:它针对的是跨物种细胞类型识别和比较这一具体问题。过去,比较不同物种的细胞类型(例如,比较小鼠和人类的神经元)需要复杂的、依赖于专家知识的同源性分析。本文的核心贡献是证明:一个在大量多物种单细胞数据上预训练的Transformer模型,可以零样本(zero-shot)地识别出从未见过的物种的细胞类型,甚至能识别疾病状态。这相当于为细胞生物学建立了一个“通用翻译器”。

二、关键术语扫盲

  1. 单细胞转录组学 (Single-cell transcriptomics):一种技术,可以测量单个细胞内成千上万个基因的活性(即有多少mRNA分子)。这就像给每个细胞拍一张“快照”,显示它正在做什么。数据通常是一个巨大的矩阵,行是细胞,列是基因,每个格子里的数字代表该基因在该细胞中的表达水平。

  2. 转录组 (Transcriptome):一个细胞或一群细胞中所有信使RNA(mRNA)分子的总和。它反映了哪些基因正在被“读取”和“表达”,是细胞身份和状态的直接体现。

  3. 细胞类型 (Cell type):具有相似基因表达模式和功能的细胞群体,如神经元、心肌细胞、T细胞等。识别和分类细胞类型是单细胞分析的核心目标。

  4. 基础模型 (Foundation model):一个在极其庞大和多样化的数据上预训练的深度学习模型(通常是Transformer)。它学习到的通用表示(representations)可以“微调”或直接“零样本”迁移到各种下游任务,如分类、聚类、生成等。GPT和BERT是文本领域的例子,TranscriptFormer是细胞生物学领域的例子。

  5. 零样本学习 (Zero-shot learning):模型在训练时从未见过某个类别的样本,但能在测试时正确识别它。在本文中,模型在人类、小鼠等物种上训练后,可以直接识别一个从未见过的物种(如海鞘)的细胞类型,无需任何该物种的标注数据。

  6. Transformer:一种深度学习架构,最初用于自然语言处理。其核心是“注意力机制”(attention mechanism),可以捕捉输入序列中任意两个元素之间的长程依赖关系。在本文中,它被用来处理“基因表达谱”这个序列,学习基因之间的复杂关系。

  7. 表示学习 (Representation learning):让模型自动学习如何将原始数据(如基因表达向量)转换为一个更有用、更紧凑的数学表示(通常是一个低维向量)。一个好的表示应该能捕捉到数据的关键特征,例如,相同细胞类型的细胞在表示空间中会彼此靠近。

  8. 基因本体 (Gene Ontology, GO):一个标准化的、结构化的词汇表,用于描述基因和基因产物的功能、参与的生物学过程以及在细胞中的位置。它提供了一个“字典”,让生物学家可以用统一的语言讨论基因功能。

  9. 系统发育 (Phylogeny):物种之间的进化关系,通常用树状图表示。本文发现,模型学习到的细胞表示空间,其结构竟然与物种的进化树惊人地一致,表明模型“无师自通”地学到了进化信息。

  10. 发育轨迹 (Developmental trajectory):细胞从一种状态(如干细胞)分化成另一种状态(如神经元)所经历的连续变化过程。模型能自动重建出这些轨迹,例如从受精卵到各种体细胞的路径。

  11. 掩码语言建模 (Masked language modeling):一种自监督学习任务。模型会随机“遮盖”输入序列中的一部分(例如,遮盖一个基因的表达值),然后让模型去预测被遮盖的部分。通过这种方式,模型被迫学习序列内部的上下文关系和结构。这是TranscriptFormer预训练的核心方法。

三、这个领域的人在关心什么

这个领域的研究者,本质上在追问一个生物学最根本的问题:生命的基本单元——细胞——是如何组织起来的? 一个多细胞生物体有数百种不同的细胞类型,它们如何从同一个受精卵分化而来?不同物种的细胞类型之间有何异同?是否存在一套通用的“细胞组织原则”?

过去十年,单细胞转录组学技术爆炸式发展,让我们能以前所未有的分辨率观察细胞。研究者们为人类、小鼠、斑马鱼等模式生物构建了详尽的“细胞图谱”。然而,这些工作大多是物种特异性的。当你想比较人类和章鱼的视觉系统时,你无法直接套用人类的细胞类型标签。你需要进行复杂的、基于基因同源性的比对,这既耗时又充满主观性。

当前主流方法和局限: - 主流方法:基于参考图谱的细胞类型注释。例如,使用scmapSingleR等工具,将新测序的细胞与一个已标注的参考图谱(如人类细胞图谱)进行比对,通过计算基因表达谱的相似性来分配细胞类型。 - 已知局限:这种方法高度依赖参考图谱的质量和物种匹配度。对于非模式生物或进化距离很远的物种,缺乏高质量的参考图谱,导致注释效果极差。此外,这些方法通常只做“最近邻”匹配,无法学习到更深层的、跨物种的细胞组织规律。 - 本文的突破:TranscriptFormer通过在一个包含12个物种、跨越15亿年进化史的巨量数据上进行预训练,学习到了一个通用的、物种无关的细胞表示空间。在这个空间里,相同功能的细胞类型(如“神经元”)即使来自不同物种,也会彼此靠近。这使得零样本跨物种迁移成为可能,绕开了传统方法对物种特异性参考图谱的依赖。它不再是比较“这个细胞像不像人类神经元”,而是直接判断“这个细胞是否具有神经元的通用特征”。

四、数据问题

  • 数据来源:公开的单细胞RNA测序(scRNA-seq)数据集,整合自多个大型项目,如人类细胞图谱(HCA)、小鼠细胞图谱(MCA)、Tabula Sapiens等。数据由测序仪器产生。
  • 数据形态稀疏矩阵。行是细胞(1.12亿),列是基因(约2万个蛋白编码基因)。每个元素是一个非负整数,代表该基因在该细胞中检测到的mRNA分子数(UMI计数)。数据极其稀疏,通常超过90%的条目为零。
  • 结构特征层次结构。细胞属于不同的物种、组织、个体、细胞类型、细胞状态。数据具有天然的层次性和嵌套性。此外,基因表达本身具有复杂的相关性网络(基因调控网络)。
  • Noise & 测量误差
    • 技术噪声:测序过程引入的随机性,导致基因捕获效率低、dropout事件(一个基因实际有表达但未被检测到)。UMI计数通常服从负二项分布零膨胀负二项分布,而非高斯分布。
    • 生物学变异:细胞周期、代谢状态等导致的细胞间固有差异。
    • 批次效应:不同实验批次、不同实验室、不同测序平台引入的系统性偏差,是单细胞数据分析中最棘手的噪声之一。
  • Selection / Bias / 缺失
    • 选择偏差:数据集中物种、组织、细胞类型的覆盖极不均匀。人类和小鼠的数据占绝大多数,而其他物种的数据量少得多。模型可能对常见物种有偏向。
    • 缺失:基因表达矩阵本身就是高度缺失的(dropout)。此外,许多细胞类型的标注信息(细胞类型标签)是缺失或不准确的。
  • 哪些是“漂亮的统计学问题”
    • 高维、稀疏、非高斯数据的降维和表示学习:如何从2万维的稀疏计数数据中学习到一个低维、信息丰富的表示,同时处理dropout和批次效应,这是一个经典的统计挑战。
    • 层次化建模:如何利用数据的物种-组织-细胞类型层次结构来改进模型?这是一个结构化的多任务学习问题。
    • 迁移学习中的协变量偏移:训练集(12个物种)和测试集(新物种)的分布存在巨大差异(协变量偏移)。零样本学习的成功依赖于模型学到了真正“不变”的特征,这本质上是一个因果推断或领域泛化问题。
  • 哪些是“纯工程或领域难题”
    • 数据整合与质量控制:整合来自数百个不同研究的数据集,处理批次效应、标准化、基因名统一等,是巨大的工程挑战。
    • 计算资源:在1.12亿细胞上训练一个大型Transformer模型,需要大量的GPU资源和分布式训练技术,这主要是工程问题。

五、方法与模型问题

  • 分析方法:本文的核心是一个生成式基础模型,名为TranscriptFormer。它本质上是一个掩码自编码器
    1. 输入:每个细胞的基因表达谱(一个稀疏向量)。模型将其投影到一个连续的嵌入空间。
    2. 预训练任务掩码基因预测。随机遮盖输入中15%的基因表达值,然后让模型基于未被遮盖的基因来预测被遮盖基因的表达水平。这个任务迫使模型学习基因之间的共表达模式和调控关系。
    3. 模型架构:一个Transformer。它将基因视为一个序列,通过自注意力机制捕捉基因之间的长程依赖关系。模型输出一个“细胞嵌入”(cell embedding),即整个细胞表达谱的压缩表示。
    4. 下游任务:预训练完成后,细胞嵌入被用于各种任务。对于细胞类型分类,只需在嵌入之上训练一个简单的线性分类器(或直接使用零样本的最近邻方法)。对于疾病状态识别,也是类似。
  • 关键假设
    • 通用性假设:存在一套跨越物种的、通用的细胞组织原则,可以被数据驱动的方式学习到。这是整个工作的前提。
    • 自监督有效性假设:掩码基因预测任务能够学习到有生物学意义的细胞表示,而不仅仅是统计上的相关性。
  • 推断 / 计算手段深度学习。使用PyTorch等框架,在大规模GPU集群上进行分布式训练。优化算法是AdamW。模型评估使用标准的分类指标(如F1分数、准确率)。
  • 核心结论 + 不确定性量化
    • 核心结论:模型在跨物种细胞类型分类上达到SOTA,能零样本识别疾病状态,且发育轨迹和系统发育关系在表示中自然涌现。
    • 不确定性量化几乎没有。这是一篇典型的深度学习应用论文。作者报告了分类任务的性能指标(如F1分数),但没有提供任何关于模型预测的置信区间、贝叶斯后验或不确定性估计。对于“零样本”预测,没有量化模型何时会“不确定”或“犯错”。这是一个显著的统计缺口。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 评分4/5 星
    • 理由:作为一篇Science论文,它很好地讲述了一个宏大的科学故事,并展示了令人印象深刻的结果。对于外行统计学家,它清晰地阐明了单细胞生物学的大问题(跨物种细胞比较)和基础模型如何提供解决方案。术语解释基本到位,图表直观。扣一星是因为方法部分对非深度学习专家不够友好(Transformer的细节被一笔带过),且对数据挑战(如批次效应)的讨论不够深入。读完能让你对“AI for Biology”的前沿有很好的感性认识。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 结论很有意思,值得留意
    • 论证
      • (i) 科学趣味性极高。这个问题本身——是否存在通用的细胞“语言”——是生物学的一个根本性问题。模型能够“无师自通”地学习到进化关系和发育轨迹,这本身就极具哲学和科学趣味。对于一个好奇的统计学家,这是一个绝佳的案例,展示了强大的表示学习如何从海量、嘈杂的数据中提取出深刻的科学洞见。
      • (ii) 方法学空间巨大。虽然本文的方法本身是工程驱动的,但它暴露了大量统计学家可以介入的开放问题:
        • 不确定性量化(UQ):这是最明显的缺口。模型何时会“自信地犯错”?如何为一个零样本预测给出一个可信区间?这对于将模型应用于临床诊断或药物发现至关重要。贝叶斯深度学习、共形预测等方法在这里有巨大的应用空间。
        • 因果推断:模型学习到的表示是“相关”还是“因果”?它是否捕捉到了驱动细胞分化的因果机制,还是仅仅学到了统计上的共现模式?将因果表示学习(如CausalVAE)的思想引入,可以尝试区分“因果”基因和“反应”基因。
        • 迁移学习与领域适应:零样本迁移的成功,本质上是一个极端的领域适应问题。统计学家可以研究:模型学到了什么“不变”特征?这些特征对协变量偏移(如不同物种、不同疾病状态)的鲁棒性如何?能否从理论上刻画迁移学习的误差界?
        • 高维统计与假设检验:如何从模型学到的表示中,进行有统计学意义的假设检验?例如,如何判断一个基因在两种细胞类型之间的差异表达是“真实”的,而不仅仅是模型表示空间的伪影?
      • (iii) 现实相关性。单细胞数据(高维、稀疏、非高斯、层次化、有批次效应)是许多现代数据集的典型代表。统计学家在基因组学、神经科学、甚至市场营销中都会遇到类似结构的数据。本文展示的“预训练+零样本迁移”范式,正在成为处理这类数据的标准流程。理解其潜力和局限,对任何处理复杂、异构数据的统计学家都有价值。
  3. 武器库匹配度

    • 无明显接口,纯科普阅读。你的very_familiar武器库(非参数统计、极小极大界、高阶U统计量、逆问题、高维渐近、因果推断估计理论)与本文的核心方法(大规模Transformer预训练、自监督学习、零样本迁移)没有直接的技术重叠。本文不涉及任何你熟悉的统计推断理论或计算复杂度分析。它是一篇优秀的科普读物,能拓宽你的视野,但不会直接启发你当前的研究问题。
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述 / 科普
      • 《单细胞转录组学数据分析方法综述》(待核实,可搜索“Review of single-cell RNA-seq data analysis methods”)。这类综述会系统介绍scRNA-seq数据的处理流程、降维、聚类、差异表达分析等基础方法,是很好的起点。
      • 《基础模型在生物学中的应用》(待核实,可搜索“Foundation models in biology”)。这类综述会介绍GPT、BERT等模型如何被改造用于处理DNA、RNA、蛋白质序列。
    • 关键的奠基或代表论文
      • 《Geneformer》(Theodoris et al., Nature 2023):这是本文的直接前身工作之一,也是第一个在单细胞数据上预训练的Transformer基础模型。它证明了掩码基因预测任务的有效性。阅读它可以理解本文的技术脉络。
      • 《scGPT》(Cui et al., Nature Methods 2024):另一个重要的单细胞基础模型,使用了生成式预训练Transformer。与TranscriptFormer相比,它更侧重于人类数据,并展示了在细胞扰动预测等任务上的能力。
    • 可以动手玩的公开数据集 / 挑战赛
      • 人类细胞图谱(Human Cell Atlas, HCA)数据门户:可以下载大量公开的scRNA-seq数据集,用于复现或探索。
      • CITE-seq数据:一种同时测量基因表达和表面蛋白的技术,提供了更丰富的细胞表型信息,是测试新方法的绝佳平台。

七、术语小抄

英文术语 中文 一句话解释
Single-cell transcriptomics 单细胞转录组学 测量单个细胞内所有基因活性(mRNA)的技术。
Foundation model 基础模型 在超大规模数据上预训练的通用AI模型,可迁移到多种任务。
Zero-shot learning 零样本学习 模型在训练时没见过某类样本,但能直接识别它。
Transformer 变换器 一种深度学习架构,通过“注意力机制”捕捉序列中的长程依赖关系。
Cell embedding 细胞嵌入 模型为每个细胞生成的一个低维数学向量,代表其“身份”。
Masked language modeling 掩码语言建模 一种自监督学习任务:遮盖输入的一部分,让模型预测被遮盖的内容。
Dropout 丢失事件 单细胞测序中,一个基因实际有表达但未被检测到的现象。
Batch effect 批次效应 不同实验批次引入的系统性技术偏差,是数据分析的主要障碍。
Phylogeny 系统发育 物种之间的进化关系,通常用树状图表示。
Developmental trajectory 发育轨迹 细胞从一种状态(如干细胞)分化成另一种状态(如神经元)的路径。
Gene Ontology (GO) 基因本体 一个标准化的基因功能分类词汇表。
UMI (Unique Molecular Identifier) 唯一分子标识符 一种分子条形码,用于精确计数mRNA分子,减少PCR扩增偏差。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论