跳转至

Computational strategies for cross-species knowledge transfer

作者: Hao Yuan, Christopher A. Mancuso, Kayla Johnson, Ingo Braasch, Arjun Krishnan
来源: Nature Methods
主题: 其他
相关性: 7/10
链接: 期刊页 · arXiv


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于计算生物学(computational biology)的一个分支——跨物种知识转移(cross-species knowledge transfer)。核心科学问题是:人类生物学和疾病研究大量依赖模式生物(小鼠、斑马鱼、果蝇、酵母等),但进化差异使得这些生物的实验结果不能直接套用到人类身上。如何利用计算手段,把模式生物中积累的基因功能、疾病关联、细胞类型等知识,系统地“翻译”到人类(或其他物种)身上?这个领域目前处于方法爆炸但缺乏统一框架的阶段——有大量针对特定任务(如基因功能预测、细胞类型比对)的工具,但缺乏一个通用的统计/计算范式。

  • 本文的位置:这是一篇发表在 Nature Methods 上的 Perspective(观点综述),不是原创方法论文。它系统梳理了跨物种知识转移的四类核心任务,并提出了一个关键概念——“agnology”(功能等效性,不依赖进化起源)。本文的价值在于为这个碎片化的领域画了一张地图,让读者看清哪些问题已经被解决、哪些方法在竞争、哪些挑战仍然开放。对于外行统计学家,这是进入这个领域的绝佳入口。

二、关键术语扫盲

  1. 模式生物 (model organism):被科学家广泛用于实验研究的物种,如小鼠、果蝇、斑马鱼、酵母。它们繁殖快、基因操作方便,但进化上离人类有远有近。
  2. 直系同源基因 (ortholog):不同物种中从共同祖先直接继承下来的基因,通常功能相似。例如,人类和小鼠的“胰岛素基因”是直系同源。这是跨物种知识转移最经典的“桥梁”。
  3. 旁系同源基因 (paralog):同一物种内通过基因复制产生的基因,功能可能分化。跨物种比较时,旁系同源会带来混淆——一个人类基因可能对应多个小鼠基因,功能不完全相同。
  4. 转录组 (transcriptome):一个细胞或组织中所有基因的表达水平(即哪些基因被“打开”了、开了多少)。单细胞转录组(scRNA-seq)可以测量单个细胞的表达谱,是当前最主流的数据类型。
  5. 分子网络 (molecular network):把基因/蛋白质看作节点,它们之间的相互作用(如物理结合、共表达、调控关系)看作边。最常用的是蛋白质-蛋白质相互作用网络(PPI network)。
  6. 功能等效性 (functional equivalence):两个来自不同物种的分子/细胞/基因集,虽然进化起源可能不同,但在生物功能上扮演相同角色。例如,人类和小鼠中负责“免疫应答”的基因集可能不完全由直系同源基因组成,但功能等效。
  7. Agnology:本文提出的核心概念——不依赖进化起源的功能等效性。Agnologous genes(agnologs)是指在不同物种中功能等效的基因,不管它们是不是直系同源。这是对传统“orthology”概念的扩展。
  8. 细胞类型比对 (cell-type mapping):不同物种的细胞类型不完全一一对应。例如,人类大脑中的某种神经元,在小鼠中可能没有完全相同的类型,但有一个“最接近”的类型。计算方法试图自动找出这种对应关系。
  9. 基因集富集分析 (GSEA):一种统计方法,判断一组基因(如某个通路中的基因)是否在某种条件下(如疾病 vs 健康)整体表达上调或下调。跨物种版本(XGSEA)试图用模式生物的数据预测人类的通路激活情况。
  10. 嵌入 (embedding):把高维数据(如一个细胞的数千个基因表达值)映射到一个低维向量空间,使得功能相似的实体在空间中靠近。跨物种嵌入的目标是把不同物种的基因/细胞放到同一个向量空间里,让功能等效的实体彼此靠近。
  11. 蛋白质语言模型 (protein language model):用大量蛋白质序列训练的大型深度学习模型(如ESM、AlphaFold),能学习蛋白质的结构和功能特征。这些模型生成的“蛋白质嵌入”可以替代传统的序列比对,用于跨物种功能推断。
  12. 互作同源 (interolog):如果物种A中蛋白质X和Y相互作用,且X和Y在物种B中分别有直系同源X'和Y',那么X'和Y'很可能也相互作用。这是跨物种网络知识转移的基本假设。

三、这个领域的人在关心什么

这个领域的根本驱动力是:人类生物学和疾病研究不能只在人类身上做实验。伦理和实际限制意味着大量机制研究、药物筛选、基因功能验证必须在模式生物上进行。但进化已经让不同物种的基因组、细胞类型、生理过程产生了巨大差异——小鼠的“炎症反应”和人类的“炎症反应”不完全是一回事。因此,计算生物学家需要回答一个核心问题:如何把模式生物中积累的海量知识,可靠地“翻译”到人类身上?

这个翻译问题可以分解为四个层次,也正是本文梳理的四个关键领域:

  1. 基因和疾病注释的转移:如果在小鼠中敲除某个基因导致心脏病,那么人类的同源基因是否也跟心脏病有关?传统方法依赖直系同源关系,但直系同源并不保证功能相同。更先进的方法(如MUNK、GenePlexusZoo)利用分子网络和机器学习,学习跨物种的“功能表示”,从而预测基因的功能。
  2. 功能等效分子组分的识别:不同物种中,哪些基因/蛋白质在功能上扮演相同角色?这比找直系同源更难——因为功能等效可能由非直系同源的基因完成。例如,人类和小鼠中负责“DNA修复”的基因集可能只有部分重叠。方法如ETNA和MUNK通过联合嵌入分子网络来识别这种功能对齐。
  3. 等效扰动基因或基因集的推断:如果在斑马鱼中施加某种药物导致一组基因表达变化,那么人类中对应的基因集是什么?这需要跨物种的“差异表达”比较。FIT(Found In Translation)是一个经典方法,它用机器学习模型学习小鼠和人类之间表达变化的对应关系,从而把小鼠实验结果“翻译”到人类。
  4. 等效细胞类型的识别:单细胞转录组技术让我们能比较不同物种的细胞类型。但人类大脑的“星形胶质细胞”和小鼠的“星形胶质细胞”是同一种细胞吗?方法如SAMap和SATURN通过比对单细胞转录组图谱,自动找出跨物种的等效细胞类型。

当前主流方法和局限:传统方法高度依赖直系同源基因作为桥梁——这是最直观但也最受限的策略,因为直系同源关系不能捕捉功能趋同或基因替换。Shafer (2019) 的综述系统总结了早期跨物种scRNA-seq整合方法,指出了批次效应和基因进化关系的复杂性。Butler et al. (2018) 的Seurat工具开创了基于“共同变异来源”的数据整合范式,但主要针对同物种不同条件,跨物种时受限于同源基因。Tarashansky et al. (2020) 的SAMap通过构建跨物种的“基因同源图”来比对细胞图谱,但作者指出它对种内流形施加了额外限制,未与其他方法系统比较。本文的贡献在于:它没有提出新方法,而是用“agnology”这个统一概念把碎片化的方法串联起来,并指出了当前方法的共同短板——缺乏对功能等效性的严格统计定义和不确定性量化。

四、数据问题

  • 数据来源:主要来自两大渠道:(1) 公共数据库——如STRING(蛋白质相互作用网络)、OMIM(疾病-基因关联)、Gene Expression Omnibus(转录组数据);(2) 大规模测序项目——如Vertebrate Genomes Project(基因组)、人类细胞图谱(Human Cell Atlas)、以及各种模式生物的单细胞图谱项目。
  • 数据形态:核心是两种数据类型:
    • 转录组数据(bulk RNA-seq 或 scRNA-seq):每个样本/细胞是一个高维向量(~20,000个基因的表达值),scRNA-seq还带有稀疏性和dropout噪声。
    • 分子网络:通常是稀疏的图结构(节点=基因/蛋白质,边=相互作用),边权重可以是二值(有无相互作用)或连续(置信度分数)。
  • 维度和量级:scRNA-seq数据集可达数百万细胞 × 数万基因;分子网络如STRING包含超过1亿条蛋白质-蛋白质关联(覆盖数千个物种)。
  • 结构特征
    • 层次结构:物种之间有系统发育树(进化关系),细胞类型有分化层级,基因有功能层级(通路、复合体)。
    • 图结构:分子网络具有无标度(scale-free)和小世界(small-world)特性。
    • 多模态:同一问题可能涉及序列、表达、网络、表型等多种数据。
  • Noise & 测量误差
    • scRNA-seq:dropout(大量基因检测不到表达)、技术批次效应、扩增偏差。噪声非高斯,更接近负二项或零膨胀负二项分布。
    • 分子网络:假阳性/假阴性率高——实验方法(如酵母双杂交)有高错误率,计算预测的相互作用更不可靠。
    • 跨物种比较额外引入进化噪声:基因复制/丢失、调控元件变化、同源关系的不确定性。
  • Selection / Bias / 缺失
    • 物种偏差:绝大多数数据来自少数模式生物(人类、小鼠、果蝇、酵母),非模式生物数据极度稀疏。
    • 组织偏差:血液、脑、肿瘤等组织数据丰富,其他组织(如肾脏、皮肤)数据少。
    • 功能偏差:与疾病相关的基因研究更充分,基础功能基因(如管家基因)反而被忽视。
    • 缺失数据:非模式物种的分子网络几乎完全缺失,只能通过同源关系从模式生物“投射”过来,引入巨大不确定性。
  • 哪些是“漂亮的统计学问题”
    • 跨物种的测量误差建模:如何把不同物种、不同技术、不同实验室的数据放在同一个概率框架下?这涉及多源数据融合和异质性建模。
    • 图对齐中的不确定性量化:当用网络嵌入对齐两个物种的基因时,对齐的置信度是多少?目前方法几乎不提供。
    • 功能等效性的统计定义:什么算“功能等效”?需要一个可检验的统计假设,而不是一个启发式阈值。
  • 哪些是“纯工程或纯领域难题”
    • 基因命名混乱:不同数据库对同一基因的命名不同,需要繁重的映射工作。
    • 基因组组装质量差异:非模式物种的基因组往往碎片化、不完整,导致基因注释错误。
    • 计算资源:大规模跨物种单细胞整合需要大量GPU/内存,不是统计问题。

五、方法与模型问题

本文是综述,不提出新方法,但梳理了四类任务中的代表性方法。以下用直白语言重述其核心思路:

  1. 基于直系同源的知识转移(最经典):

    • 做法:找到人类基因G在小鼠中的直系同源基因G',如果G'与疾病D'相关,则推断G与人类中对应的疾病D相关。
    • 假设:直系同源 = 功能保守。这个假设经常被违反(基因复制后功能分化)。
    • 不确定性量化:几乎没有——要么是/不是直系同源,没有置信度。
  2. 基于分子网络的功能表示学习(如MUNK, GenePlexusZoo, ETNA):

    • 做法:把不同物种的分子网络通过同源关系“缝合”成一个联合网络,然后用图嵌入方法(如node2vec、图神经网络)把每个基因映射到一个低维向量。功能相似的基因(不管来自哪个物种)在向量空间中靠近。
    • 关键假设:网络拓扑结构反映功能——这是领域知识约束。计算上,图嵌入是高效的(可扩展到百万节点)。
    • 不确定性量化:嵌入本身是确定性的,没有置信区间。GenePlexusZoo通过交叉验证评估预测性能,但不对单个预测给出不确定性。
  3. 基于深度学习的跨物种单细胞整合(如SATURN, GeneCompass, scGPT):

    • 做法:用蛋白质语言模型(如ESM)生成基因的“通用嵌入”,然后与scRNA-seq表达数据结合,学习跨物种的细胞嵌入。SATURN的核心创新是用蛋白质序列嵌入替代传统的同源基因匹配,使得即使没有直系同源关系的基因也能被比较。
    • 关键假设:蛋白质序列的进化保守性足以捕捉功能相似性——这在大语言模型时代被证明相当有效,但仍有反例(序列不同但功能相同的蛋白质)。
    • 不确定性量化:深度学习模型通常只输出点预测(如细胞类型标签),不提供预测置信度。GeneCompass和scGPT是生成式模型,可以输出概率分布,但跨物种场景下的校准性未经系统评估。
  4. 跨物种差异表达翻译(如FIT, XGSEA):

    • 做法:FIT用机器学习模型(随机森林)学习小鼠和人类之间差异表达基因的对应模式。XGSEA则用域适应(domain adaptation)方法,把斑马鱼的基因集富集结果“翻译”到人类。
    • 关键假设:存在一个可学习的跨物种“翻译函数”——这需要大量配对数据(同一条件在小鼠和人类中都有实验),而这样的数据非常稀缺。
    • 不确定性量化:FIT输出预测的差异表达基因列表,但没有p值或FDR控制。XGSEA输出p值,但跨物种的p值校准性存疑。

核心结论:本文的结论是“agnology”概念——功能等效性不应依赖进化起源,而应基于数据驱动的功能相似性。这个结论本身不是统计性的,但它为统计学家打开了一个问题空间:如何严格定义和量化“功能等效性”?

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 评分:⭐⭐⭐⭐(4/5)
    • 理由:作为一篇 Nature Methods 的Perspective,本文写得相当清晰——它用四个层次的问题把碎片化的领域组织起来,术语解释到位(虽然假设读者有基础生物学知识),大问题(“为什么跨物种知识转移重要”)讲得很明白。统计学家读完能理解这个领域在做什么、用什么数据、面临什么困难。扣一星是因为:它是一篇综述,没有深入任何方法的技术细节,统计学家读完后会好奇“具体怎么做”但得不到答案;另外,它假设读者熟悉scRNA-seq和分子网络的基本概念,完全外行的读者可能需要先补一点背景。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 科学趣味性非常高。这个问题本身极其迷人——进化在不同物种中“实验”了数亿年,产生了功能相似但序列不同的分子解决方案。统计学家会喜欢这种“自然实验”的视角:我们能否从观测数据中推断出“功能等效性”,而不依赖先验的进化关系?这本质上是一个因果推断问题(“这个基因在人类中扮演的角色,是否等同于那个基因在小鼠中的角色?”),但目前的计算方法几乎完全绕过了因果框架。
    • 方法学空间巨大。以下是几个具体的统计挑战:
      • 功能等效性的形式化定义:目前“agnology”是一个概念,不是统计量。能否定义一个可检验的假设——例如,两个基因是功能等效的,当且仅当它们在所有相关条件下的表达变化模式不可区分?这涉及高维假设检验多重比较
      • 跨物种预测的不确定性量化:几乎所有现有方法都只输出点预测(“这个基因与疾病相关”),没有置信区间或p值。但跨物种转移的决策(如“是否基于小鼠结果推进人类临床试验”)需要量化不确定性。这为预测区间、置信集、贝叶斯方法提供了丰富的应用场景。
      • 图对齐中的匹配不确定性:当用网络嵌入对齐两个物种的基因时,对齐是软性的(每个基因有一个向量,通过距离判断相似性),但如何量化“这个基因在物种A中的最佳匹配是物种B中的那个基因”的置信度?这类似于图匹配/网络对齐中的不确定性量化,是一个开放问题。
      • 多源数据融合中的异质性建模:不同物种的数据来自不同实验室、不同技术、不同条件。如何建模这种异质性,并从中提取跨物种的共享信号?这涉及混合效应模型、贝叶斯层次模型、或对抗性域适应
      • 进化相关性的统计建模:物种不是独立的——它们有系统发育树。跨物种数据存在进化相关性(亲缘近的物种数据更相似),这违反了独立同分布假设。如何在这种依赖结构下做推断?这类似于空间统计或网络相关数据中的问题。
    • 现实相关性。跨物种知识转移是生物医学研究的核心瓶颈——大量药物在动物模型中有效但在人类中失败,部分原因就是跨物种翻译不准确。统计学家在别处也会遇到类似的问题模式:从源域(模式生物)到目标域(人类)的迁移学习,其中源域和目标域共享部分结构(进化保守性)但也有系统差异(进化分化)。这种“部分共享、部分差异”的结构在推荐系统、自然语言处理、流行病学中都很常见。
    • 明确结论很有意思,值得留意。这不是一篇“纯领域文章统计上乏味”的综述——它揭示了一个统计方法学几乎空白的领域,充满了从定义到推断的开放问题。对于对迁移学习、图数据、高维假设检验、不确定性量化感兴趣的统计学家,这是一个值得关注的方向。
  3. 武器库匹配度

    • 无明显接口,纯科普阅读。本文涉及的核心问题(功能等效性推断、跨物种图对齐、单细胞数据整合)与研究者当前的 very_familiar 武器(nonparametric statistics, minimax bounds, higher-order U-statistics, inverse problems, high-dimensional asymptotics, causal inference estimation theory)没有直接的技术重叠。因果推断框架(如工具变量、代理变量)在概念上可以类比(“物种”作为工具变量?),但本文的数据和模型结构(图嵌入、深度学习、序列模型)与因果推断的标准设定差异太大,牵强连接没有意义。higher-order U-statistics 的 tensor contraction 视角在理论上可以用于分析某些跨物种共表达统计量,但本文没有涉及这类统计量。因此,纯科普阅读,开阔眼界
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述/科普
      • Shafer (2019): “Cross-Species Analysis of Single-Cell Transcriptomic Data” — 本文引用的综述,专门针对单细胞数据的跨物种分析,比本文更聚焦于方法细节,适合作为第二篇阅读。
      • Luecken et al. (2020): “Benchmarking atlas-level data integration in single-cell genomics” — 虽然主要针对同物种整合,但其对批次效应、评估指标、方法选择的讨论对理解跨物种整合的挑战有直接帮助。
    • 关键奠基/代表论文(均来自本文被引文献):
      • Tarashansky et al. (2020): “Mapping single-cell atlases throughout Metazoa unravels cell type evolution” — SAMap方法,是跨物种单细胞图谱比对的奠基工作之一,展示了从海绵到小鼠的细胞类型进化。
      • Rosen et al. (2024): “Toward universal cell embeddings: integrating single-cell RNA-seq datasets across species with SATURN” — 用蛋白质语言模型实现跨物种细胞嵌入的代表作,方法创新性强。
      • Normand et al. (2018): “Found in Translation: A machine learning model for improving mouse to human inference” — FIT方法,是跨物种差异表达翻译的经典工作,直接涉及统计学习。
      • Mancuso et al. (2023): “Joint representation of molecular networks from multiple species improves gene classification” — GenePlexusZoo方法,展示了多物种网络联合嵌入如何提升基因功能预测。
    • 公开数据集/挑战赛
      • Human Cell Atlas (https://data.humancellatlas.org/) 和 Tabula Muris (小鼠细胞图谱) 是跨物种单细胞整合的常用基准数据集。
      • STRING数据库 (https://string-db.org/) 提供多物种蛋白质相互作用网络,可直接下载用于网络对齐实验。
      • Open Problems in Single-Cell Analysis (https://openproblems.bio/) 有跨物种整合的挑战赛任务。

七、术语小抄

英文术语 中文 一句话解释
Model organism 模式生物 被广泛用于实验研究的物种(小鼠、果蝇、酵母等),用于理解人类生物学
Ortholog 直系同源基因 不同物种中从共同祖先直接继承的基因,通常功能相似
Paralog 旁系同源基因 同一物种内通过基因复制产生的基因,功能可能分化
Transcriptome 转录组 一个细胞或组织中所有基因的表达水平总和
scRNA-seq 单细胞RNA测序 测量单个细胞中所有基因表达水平的技术
Molecular network 分子网络 以基因/蛋白质为节点、相互作用为边的网络
Functional equivalence 功能等效性 不同物种的分子/细胞在功能上扮演相同角色,不管进化起源
Agnology 功能等效学 本文提出的概念:基于数据驱动的功能等效性,不依赖进化起源
Cell-type mapping 细胞类型比对 找出不同物种中功能对应的细胞类型
Embedding 嵌入 把高维数据映射到低维向量空间,使相似实体在空间中靠近
Protein language model 蛋白质语言模型 用大量蛋白质序列训练的大型深度学习模型,能学习蛋白质结构和功能特征
Interolog 互作同源 如果物种A中两蛋白相互作用,它们在物种B中的直系同源也可能相互作用
GSEA 基因集富集分析 判断一组基因是否在某种条件下整体表达上调或下调的统计方法
Batch effect 批次效应 不同实验批次引入的系统性技术偏差,会混淆生物学信号
Dropout 丢失事件 scRNA-seq中基因检测不到表达的现象,导致数据稀疏

Maintained by 陈星宇 · Homepage · Source on GitHub

评论