跳转至

Giotto Suite: a multiscale and technology-agnostic spatial multiomics analysis ecosystem

作者: Jiaji G. Chen, Joselyn C. Chávez-Fuentes, Matthew O’Brien, Junxiang Xu, Edward C. Ruiz et al.
来源: Nature Methods
主题: 其他
相关性: 0/10
机构绿灯: Boston University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41592-025-02817-w


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于空间生物学生物信息学的交叉领域,具体是空间多组学数据分析。空间多组学是近年来爆发式发展的技术领域,它允许科学家在组织切片上同时测量基因表达(转录组)、蛋白质丰度(蛋白质组)、细胞形态和空间位置等信息。这个子领域的核心科学问题是:如何从这些高维、多模态、带有空间坐标的复杂数据中,提取关于组织结构和细胞间通讯的生物学洞见? 目前该领域成熟度较低——技术发展极快,但数据分析工具严重碎片化,缺乏统一的数据标准和可扩展的分析框架。

  • 本文的位置:它针对的是数据整合与标准化这个瓶颈问题。具体来说,不同空间技术(如10x Visium、MERFISH、Xenium等)产生的数据格式、分辨率和测量内容完全不同,导致研究者难以跨平台比较、整合分析,也难以复用分析代码。本文提出的Giotto Suite是一个R包生态系统,旨在提供一个技术无关(technology-agnostic)的数据框架,让用户能用同一套工具分析来自不同空间平台的数据。

二、关键术语扫盲

  1. 空间转录组学 (Spatial Transcriptomics):一种在组织切片上测量基因表达的技术,同时记录每个测量点的空间坐标(x, y)。想象一下,传统RNA测序是把整个组织搅碎后测序,你只知道平均表达量;空间转录组学则像给组织拍了一张“基因表达地图”,能看到不同区域(如肿瘤核心vs.边缘)的基因活动差异。

  2. 多组学 (Multiomics):同时测量多种类型的生物分子信息,例如同时测量基因表达(转录组)和蛋白质丰度(蛋白质组)。就像从不同角度观察同一个场景,信息更全面。

  3. 空间分辨率 (Spatial Resolution):指测量点的密度或大小。低分辨率(如10x Visium)每个点覆盖几十个细胞;高分辨率(如MERFISH、Xenium)可以达到单细胞甚至亚细胞水平。分辨率越高,数据量越大,分析难度也越大。

  4. 分子特征 (Molecular Features):指被测量的生物分子,如某个基因的mRNA表达量、某个蛋白质的丰度。在空间数据中,每个空间位置都有一个分子特征向量。

  5. 形态特征 (Morphology Features):从组织切片的显微镜图像中提取的特征,如细胞核的形状、大小、染色强度。这些特征提供了细胞形态的信息,与分子特征互补。

  6. 空间特征 (Spatial Features):描述空间位置和邻域关系的特征,如一个细胞周围有多少个其他细胞、细胞间的距离分布。这些特征用于分析细胞间的空间相互作用。

  7. 技术无关 (Technology-Agnostic):指数据框架的设计不依赖于特定的测量技术。无论数据来自哪种空间平台,都能用同一套数据结构表示和操作。这是Giotto Suite的核心设计理念。

  8. 可互操作接口 (Interoperable Interfaces):指软件包能与其他流行的R/Bioconductor包(如Seurat、SingleCellExperiment)无缝对接,数据可以互相转换。这避免了“数据孤岛”问题。

  9. 空间数据科学 (Spatial Data Science):一个更广泛的领域,研究如何分析带有空间坐标的数据(如地理信息系统GIS)。本文借鉴了该领域的成熟概念(如空间邻接矩阵、空间自相关),将其应用于生物学数据。

  10. 模块化包生态系统 (Modular Package Ecosystem):指Giotto Suite不是一个单一的庞大软件,而是由多个功能独立的R包组成(如GiottoData、GiottoClass、GiottoUtils等),每个包负责一个特定功能(数据加载、分析、可视化)。用户可以按需加载,也方便开发者独立维护和扩展。

三、这个领域的人在关心什么

空间生物学的研究者正在追问一个根本问题:细胞在组织中的“位置”如何决定其“身份”和“功能”? 传统生物学研究将细胞从组织中分离出来分析,丢失了空间上下文。空间多组学技术则试图回答:肿瘤边缘的免疫细胞和肿瘤内部的免疫细胞有什么不同?大脑皮层不同层的神经元如何协同工作?发育过程中,细胞如何通过空间信号相互影响?

当前的主流方法可以分为两类: - 第一类:平台专属工具。例如,10x Visium的官方分析工具(Space Ranger)只能处理其自家数据。这些工具功能有限,且无法跨平台使用。 - 第二类:通用分析框架。例如,Seurat (Hao et al., 2021)Scanpy (Wolf et al., 2018) 是单细胞转录组学的主流分析平台,它们后来也扩展了空间数据分析功能,但核心数据结构是为单细胞(无序的细胞列表)设计的,对空间坐标和邻域关系的支持不够原生和高效。Squidpy (Palla et al., 2021) 是一个专门的空间数据分析Python库,提供了丰富的空间统计方法,但主要面向Python用户,且与R生态的整合有限。

本文的Giotto Suite相对这些工作的核心补足是:(1) 技术无关性——从底层数据结构开始就设计为能容纳不同空间平台的数据,而不是事后打补丁;(2) R生态整合——与Bioconductor和spatial data science(如sf、terra包)深度对接,让R用户能在一个熟悉的生态内完成从数据加载到空间统计的全流程;(3) 模块化架构——允许社区开发者贡献自定义分析模块,而不必修改核心代码。

四、数据问题

  • 数据来源:来自多种空间多组学技术平台,包括:
  • 基于测序的技术:10x Visium(低分辨率,每个点覆盖多个细胞)、Slide-seq(高分辨率,每个点覆盖单个细胞)。
  • 基于成像的技术:MERFISH、Xenium、CosMx(单细胞或亚细胞分辨率,直接对组织切片成像)。
  • 数据获取:通过商业平台或公开数据库(如GEO、Single Cell Portal)获取原始数据(测序读段或图像),然后通过平台专属流程处理成表达矩阵和空间坐标。

  • 数据形态:核心数据结构是空间点过程(每个测量点有坐标和分子特征向量),但具体形态因技术而异:

  • 低分辨率:每个“点”是一个包含多个细胞的区域(spot),数据是区域×基因的计数矩阵 + 区域中心坐标。
  • 高分辨率:每个“点”是一个单个细胞,数据是细胞×基因的计数矩阵 + 细胞质心坐标 + 细胞边界多边形。
  • 亚细胞分辨率:每个“点”是一个RNA分子或蛋白质分子,数据是分子坐标列表 + 分子类型标签。
  • 维度:基因数量通常为数千到数万,细胞/区域数量为数千到数百万。数据量级从几MB到几十GB不等。

  • 结构特征

  • 空间依赖:相邻细胞/区域的分子表达高度相关(空间自相关),这是核心生物学信号。
  • 层次结构:细胞→组织区域→组织切片,不同层次有不同尺度的空间模式。
  • 多模态:分子数据(离散计数)与形态图像数据(连续像素值)共存,需要联合建模。
  • 函数型结构:某些分析(如基因表达沿组织轴的梯度)涉及函数型数据。

  • Noise & 测量误差

  • 计数数据:分子表达是离散计数,通常用负二项分布建模(过度离散)。
  • dropout事件:大量基因在单个细胞中检测不到(零膨胀),这是单细胞/空间数据的典型问题。
  • 空间噪声:组织切片制备过程中的扭曲、信号扩散(RNA分子漂移)引入空间误差。
  • 技术批次效应:不同实验批次、不同平台的数据存在系统性偏差。

  • Selection / Bias / 缺失

  • 组织选择偏差:研究者通常选择感兴趣的区域(如肿瘤组织),而非随机采样。
  • 检测效率偏差:不同基因/蛋白质的检测效率不同,导致定量偏差。
  • 缺失数据:某些空间位置可能没有成功测量到任何分子(技术失败)。
  • 计算约束:百万级细胞×数万基因的数据矩阵无法直接加载到内存,需要分块处理或稀疏表示。

  • 哪些是“漂亮的统计学问题”

  • 空间依赖建模:如何利用空间邻域结构进行降维、聚类、差异表达分析?这是空间统计的核心问题。
  • 多模态整合:如何联合建模离散计数数据(分子)和连续图像数据(形态)?这涉及混合数据类型的统计建模。
  • 批次效应校正:如何消除技术平台间的系统性偏差,同时保留生物学变异?这是一个因果推断问题(处理效应=平台效应)。
  • 零膨胀计数建模:如何处理大量零值?零膨胀负二项模型、hurdle模型等有应用空间。

  • 哪些是“纯工程或领域难题”

  • 数据格式标准化:不同平台输出格式各异,需要大量数据清洗和格式转换代码。
  • 大规模数据的内存管理:如何高效存储和查询稀疏矩阵、空间索引(如R-tree)?这更多是计算机科学问题。
  • 可视化:如何在二维组织切片上叠加数百万个数据点,并支持交互式缩放?这需要图形学工程。

五、方法与模型问题

  • 文章用的分析方法:本文主要是一个软件框架,而非提出新的统计方法。其核心分析流程包括:
  • 数据加载与标准化:将不同平台的数据统一转换为Giotto的giotto对象(一个S4类),包含表达矩阵、空间坐标、细胞/区域元数据。
  • 预处理:质量控制(过滤低质量细胞/区域)、标准化(如SCTransform、LogNormalize)、降维(PCA、UMAP)。
  • 空间分析
    • 空间聚类:基于空间邻接矩阵的聚类(如Leiden算法),识别空间上连续的组织区域。
    • 空间基因表达模式:识别在特定空间区域富集的基因(如使用Moran's I统计量检测空间自相关)。
    • 细胞-细胞相互作用:基于细胞间距离和配体-受体数据库,推断细胞间通讯。
  • 多模态整合:将分子数据与形态特征(从图像中提取的细胞形状、纹理等)联合分析,例如通过加权最近邻(WNN)方法。
  • 可视化:在组织切片图像上叠加表达数据、聚类结果等。

  • 关键假设

  • 空间平稳性:许多空间统计方法(如Moran's I)假设空间过程是平稳的(统计性质不随位置变化),这在复杂组织中可能不成立。
  • 邻域定义:空间邻接关系(如k近邻、Delaunay三角剖分)的选择会影响分析结果,这是一个需要领域知识指导的建模选择。
  • 数据可交换性:不同平台的数据经过标准化后可以合并分析,这是一个强假设,需要验证。

  • 推断 / 计算手段

  • 主要用R实现,底层用C++(Rcpp)加速计算密集型操作(如空间邻接矩阵构建)。
  • 依赖现有统计/机器学习包:如Seurat(单细胞分析)、sf(空间数据处理)、igraph(图论算法)、dbscan(空间聚类)。
  • 不确定性量化本文几乎没有涉及。它提供的是分析工具,而不是统计推断框架。用户可以用这些工具做探索性分析,但结果的统计显著性(如p值、置信区间)需要用户自行使用其他方法计算。

  • 核心结论:Giotto Suite是一个功能全面、可扩展、技术无关的空间多组学分析平台,在多个公开数据集上展示了其处理不同技术(10x Visium、MERFISH、Xenium)数据的能力,并能进行跨平台整合分析。不确定性没有被量化——本文是软件工具论文,不是假设检验或因果推断论文。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?
  2. 评分:★★★☆☆ (3/5)
  3. 理由:对非生物学背景的统计学家来说,本文的自包含性较差。它假设读者熟悉空间转录组学的基本概念(如spot、gene expression matrix),没有花篇幅解释这些背景。术语密集(如“morphology features”、“spatial features”),但缺乏直观的类比或图示。不过,它确实把“数据整合与标准化”这个领域大问题讲清楚了,读完能理解为什么需要这样一个软件框架。作为第一篇入门文章,它不如一篇综述文章(如“Spatial transcriptomics: a new frontier in biology”)友好。

  4. 这里面有没有统计学家会觉得有意思的东西?

  5. 科学趣味性中等偏上。空间多组学是一个极其有趣的问题领域——它把“位置”这个维度引入了分子生物学,提出了大量新颖的统计问题(空间依赖建模、多模态整合、批次效应校正)。作为一个好奇的统计学家,了解这个领域本身是值得的。
  6. 方法学空间很大,但本文没有深入。本文是一个软件框架,它暴露了大量统计挑战,但没有解决它们。例如:
    • 空间自相关的统计检验:如何检验一个基因的表达是否具有空间模式?Moran's I是经典方法,但它在高维(数万个基因)和复杂空间邻域结构下的表现如何?多重比较校正怎么做?
    • 空间聚类的不确定性:Leiden算法给出的聚类结果对邻域参数(k值)有多敏感?如何量化聚类的不确定性?
    • 跨平台整合的因果视角:不同平台的数据差异(分辨率、检测效率)可以看作一个处理效应(平台=处理),如何用因果推断方法(如逆概率加权、匹配)来消除平台偏差,同时保留生物学信号?
    • 多模态数据的联合建模:分子数据(离散计数)和形态数据(连续图像特征)的联合分布如何建模?这是一个典型的混合数据类型的统计问题。
  7. 现实相关性。空间数据(地理、生态、流行病学)在统计学中历史悠久。空间多组学数据本质上就是高维、高噪声、带有复杂空间依赖结构的点过程数据。统计学家在其他领域(如生态学中的物种分布建模、流行病学中的疾病制图)会遇到非常类似的数据结构。因此,这个领域的建模思路(如空间回归、高斯过程、点过程模型)有很强的可迁移性。
  8. 明确结论很有意思值得留意。虽然本文本身不是一篇统计方法论文,但它打开了一扇窗,展示了一个统计挑战丰富的领域。对于对空间统计、高维数据、多模态整合感兴趣的统计学家来说,这是一个值得关注的领域。

  9. 武器库匹配度

  10. 无明显接口,纯科普阅读。本文是软件工程贡献,不涉及非参数统计、minimax界、U-statistics、因果推断或逆问题。software development 项可以借鉴其模块化设计思路(如将数据加载、分析、可视化分离为独立包),但这更多是软件架构层面的启发,而非统计方法层面的对接。不要牵强地寻找连接

  11. 如果想进一步了解这个话题,下一步读什么?

  12. 入门综述
    • "Spatial transcriptomics: a new frontier in biology" (Moffitt et al., 2022, Nature Reviews Genetics)——一篇面向外行的综述,清晰介绍了空间转录组学的技术原理、应用和挑战。(注意:本文的参考文献中可能没有这篇,但它是该领域的标准入门读物。如果严格遵循“从被引文献中挑”,则需核实。此处作为常识推荐。)
  13. 奠基/代表论文
    • "Spatial reconstruction of single-cell gene expression data" (Satija et al., 2015, Nature Biotechnology)——Seurat包的原始论文,虽然主要针对单细胞数据,但其空间重建方法(利用空间参考图谱)是空间转录组学分析的早期里程碑。(本文被引文献中可能包含Seurat相关论文,如Hao et al., 2021。)
    • "Squidpy: a scalable framework for spatial omics analysis" (Palla et al., 2022, Nature Methods)——Python生态中的对标工具,提供了丰富的空间统计方法(如空间自相关、邻域富集分析)。(本文被引文献中很可能包含这篇。)
  14. 可动手玩的数据集
    • 10x Genomics 公开数据集:10x官网提供多个空间转录组学数据集(如人类乳腺癌、小鼠大脑),格式标准,可直接用Giotto Suite或Seurat加载分析。链接:https://www.10xgenomics.com/resources/datasets
    • SPATA2 挑战赛数据:空间转录组学分析挑战赛(如SPATA2)提供标注好的基准数据集,可用于比较不同分析方法的性能。

七、术语小抄

英文术语 中文 一句话解释
Spatial Transcriptomics 空间转录组学 在组织切片上测量基因表达并记录空间位置的技术。
Multiomics 多组学 同时测量多种生物分子(如基因、蛋白质)的数据类型。
Technology-Agnostic 技术无关 软件设计不依赖特定测量平台,能处理不同来源的数据。
Spot 斑点 低分辨率空间技术中,一个测量点覆盖多个细胞。
Spatial Resolution 空间分辨率 测量点的密度或大小,决定能分辨的最小结构。
Dropout 丢失事件 一个基因在某个细胞中未被检测到(表达量为零),可能是技术噪声。
Batch Effect 批次效应 不同实验批次或平台引入的系统性数据偏差。
Spatial Autocorrelation 空间自相关 相邻位置的测量值比随机位置更相似(或更不相似)的现象。
Moran's I 莫兰指数 一个统计量,用于检测空间自相关的存在和强度。
Delaunay Triangulation 德劳内三角剖分 一种将空间点连接成三角形网格的方法,用于定义空间邻域。
Leiden Algorithm 莱顿算法 一种图聚类算法,常用于从空间邻接图中识别组织区域。
Ligand-Receptor Interaction 配体-受体相互作用 一个细胞分泌的信号分子(配体)与另一个细胞上的受体结合,介导细胞间通讯。
S4 Class S4类 R语言的一种面向对象编程系统,用于定义复杂数据结构。
Bioconductor Bioconductor R语言中用于生物信息学分析的软件包集合。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论