跳转至

HiC2Self: Self-supervised denoising for bulk and single-cell Hi-C contact maps

作者: Rui Yang, Alireza Karbalayghareh, Christina S. Leslie
来源: Science Advances
主题: 其他
相关性: 7/10
链接: https://doi.org/10.1126/sciadv.adu8060


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于三维基因组学(3D genomics)与生物信息学的交叉领域。核心科学问题是:细胞核内的 DNA 长链(约 2 米长)是如何折叠、打包在微米级的细胞核内的?这种三维折叠方式对基因调控(哪些基因被打开或关闭)至关重要。Hi-C 技术是测量全基因组三维接触的主要实验方法,但数据天生稀疏且噪声大,尤其是单细胞 Hi-C 数据,每个细胞只捕获极少量的接触事件。该领域目前成熟度中等——实验技术发展迅速,但数据分析方法(特别是去噪和结构重建)仍是瓶颈。
  • 本文的位置:它针对的是 Hi-C 接触图谱的去噪问题。现有监督学习方法需要配对的高质量参考数据(如高深度测序数据)来训练,但这类数据难以获取,且模型泛化能力差(在不同细胞类型、不同实验条件下表现不佳)。本文提出一种自监督去噪框架 HiC2Self,仅需低覆盖度的原始数据作为输入,利用接触图谱自身的结构冗余进行学习,无需外部参考。这解决了监督方法的核心痛点,为后续的生物学发现(如识别拓扑关联结构域 TAD、显著环状结构)提供了更可靠的数据基础。

二、关键术语扫盲

  1. Hi-C:一种染色体构象捕获实验技术。通过交联、酶切、连接、测序等步骤,测量基因组上任意两个位置在三维空间中物理上靠近的频率。输出是一个二维矩阵(接触图谱),矩阵元素值代表两个位点之间的接触次数。
  2. 接触图谱(Contact Map):Hi-C 实验的最终数据形式。是一个对称矩阵,行和列代表基因组上的位置(按坐标排列),矩阵中的数值表示这两个位置在细胞群体中被检测到相互接触的次数。数值越高,表示在三维空间中越靠近。
  3. 拓扑关联结构域(TAD, Topologically Associating Domain):基因组三维结构的基本单元。在接触图谱上表现为沿对角线的一系列“方块”,方块内部的 DNA 片段之间相互接触的频率远高于方块之间。TAD 被认为是一个相对独立的调控单元,内部的基因和调控元件相互作用更频繁。
  4. 显著环(Significant Loop):接触图谱上远离对角线的孤立高接触点,代表两个在基因组线性序列上相距较远的位点之间形成了稳定的三维接触。这些环通常由特定的蛋白质(如 CTCF、 cohesin)介导,对基因调控至关重要。
  5. Bulk Hi-C:从大量细胞(通常数百万个)中提取 DNA 进行 Hi-C 实验。结果是所有细胞的平均接触图谱,能反映群体水平的普遍结构,但掩盖了细胞间的异质性。
  6. 单细胞 Hi-C(scHi-C):对单个细胞进行 Hi-C 实验。数据极其稀疏(每个细胞只有几千到几万个接触事件,而全基因组有数十亿个可能的接触位点),但能揭示单个细胞独特的三维基因组结构。
  7. 覆盖度(Coverage):测序深度。在 Hi-C 中,指测序得到的有效接触对总数。覆盖度越高,接触图谱的“像素”越清晰,噪声越低。低覆盖度是单细胞 Hi-C 和低深度 bulk Hi-C 的主要挑战。
  8. 自监督学习(Self-supervised Learning):一种机器学习范式。模型从输入数据本身构造监督信号进行训练,无需人工标注或外部参考数据。本文的核心创新:利用接触图谱自身的结构冗余(如 TAD 内部的局部一致性)来学习去噪。
  9. 伪批量(Pseudobulk):将多个单细胞 Hi-C 数据合并成一个“虚拟”的批量数据。通过增加覆盖度来获得更清晰的群体平均结构,但牺牲了单细胞分辨率。
  10. Micro-C:Hi-C 的一种变体,使用微球菌核酸酶(MNase)代替限制性内切酶进行 DNA 片段化。能获得比 Hi-C 更高的分辨率(可达 1 kb),用于研究更精细的染色质结构,如核小体级别的相互作用。
  11. 甲基-3C(Methyl-3C):一种结合了 Hi-C 和 DNA 甲基化测序的技术,能同时测量三维基因组结构和 DNA 甲基化状态,通常用于单细胞分析。

三、这个领域的人在关心什么

三维基因组学的研究者追问的核心问题是:DNA 在细胞核里是怎么折叠的?这种折叠方式如何调控基因表达,从而影响细胞命运、疾病发生等生物学过程?

具体来说,他们关心: 1. 结构单元:TAD、环、区室(A/B compartments)等结构是如何形成的?它们在不同细胞类型、不同物种中是否保守? 2. 结构与功能的关系:TAD 边界破坏或环的缺失是否会导致基因错误表达,引发疾病(如癌症、发育缺陷)? 3. 动态变化:在细胞分化、发育、疾病进展过程中,三维基因组结构如何动态变化? 4. 单细胞异质性:同一个细胞类型中,不同细胞的三维结构是否相同?单细胞水平的结构变异有何生物学意义?

当前主流方法与局限: - 主流方法:基于深度学习的监督去噪方法(如 HiCPlus、DeepHiC)。这些方法需要配对数据:低覆盖度的“噪声”输入和高覆盖度的“干净”目标。局限在于:① 高覆盖度数据昂贵且难以获得;② 模型在训练数据之外的细胞类型或实验条件下泛化能力差;③ 无法处理单细胞数据(因为单细胞没有“干净”的参考)。 - 本文的贡献:HiC2Self 绕开了监督学习的限制。它基于一个简单的观察:接触图谱中,一个像素点的真实信号与其邻近像素(特别是同一 TAD 内的像素)高度相关,而噪声是独立的。因此,模型可以学习用周围像素来预测中心像素,从而在去噪的同时保留真实结构。这类似于图像处理中的 Noise2Noise 或 Noise2Void 思想,但针对 Hi-C 数据的特殊结构(如 TAD 的块状结构、环的稀疏性)进行了定制。

四、数据问题

  • 数据来源:Hi-C、Micro-C、单细胞甲基-3C 实验。实验流程包括:甲醛交联(固定三维结构)、限制性内切酶或 MNase 切割 DNA、生物素标记末端、连接(空间上靠近的末端被连接成嵌合 DNA 分子)、纯化、测序。
  • 数据形态二维矩阵(接触图谱)。矩阵大小由基因组分辨率和染色体长度决定。例如,1 Mb 分辨率下,人类 1 号染色体(~250 Mb)的矩阵大小为 250×250;1 kb 分辨率下,矩阵大小为 250,000×250,000,极其庞大。矩阵是对称的(i 和 j 的接触等于 j 和 i 的接触),且稀疏(绝大多数元素为 0)。
  • 结构特征
    • 对角线主导:沿对角线的值最大,因为线性距离近的位点更容易接触。
    • 块状结构:TAD 表现为沿对角线的方块,方块内值高,方块间值低。
    • 稀疏的离对角峰值:显著环表现为远离对角线的孤立高值点。
    • 层次结构:TAD 内部可嵌套更小的 sub-TAD。
  • Noise & 测量误差
    • 泊松噪声:接触计数本质上是计数数据,通常假设服从泊松分布(或过离散的负二项分布)。低覆盖度时,泊松噪声占主导。
    • 系统偏差:来自实验步骤(如酶切效率、连接效率、GC 含量、可映射性)的偏差,通常通过归一化方法(如 Knight-Ruiz 矩阵平衡)校正。
    • 相关噪声:由于测序读段的多重映射或 PCR 扩增偏好,噪声可能存在局部相关性。
  • Selection / Bias / 缺失
    • 稀疏性:单细胞 Hi-C 数据中,绝大多数可能的接触对都没有被观测到(缺失)。这不是随机缺失,而是由实验捕获效率极低导致的系统性缺失。
    • 覆盖度不均:不同基因组区域的测序深度不同,导致接触图谱的“信噪比”在基因组上不均匀。
  • 哪些是“漂亮的统计学问题”
    • 低计数矩阵的降噪与结构重建:这是一个典型的低信噪比下的逆问题,且数据具有特殊的块状+稀疏结构。统计学家可以思考:如何利用 TAD 的块状先验(类似于图像中的分段常数先验)或环的稀疏先验来设计更高效的去噪或矩阵补全方法?
    • 单细胞数据的聚合与异质性建模:如何从大量稀疏的单细胞接触矩阵中,既恢复群体平均结构(伪批量),又保留细胞间的异质性?这类似于混合模型张量分解问题。
    • 计数数据的非参数回归:接触计数与基因组距离之间存在强烈的递减关系(距离越远,接触越少)。如何非参数地建模这个背景距离效应,以识别出显著的、偏离背景的接触(即环)?这是一个函数型数据异常检测的混合问题。

五、方法与模型问题

  • 文章用的方法:HiC2Self 是一个自监督去噪框架,核心思想是 “用周围像素预测中心像素”
    • 具体操作:对于接触图谱中的每个非零像素(i, j),模型将其视为“目标”,并将其周围一个局部窗口(例如 5×5 或 7×7)内的其他像素作为“输入”。模型(一个简单的卷积神经网络 CNN)学习从输入到目标的映射。
    • 关键技巧:为了避免模型学到“恒等映射”(即直接复制输入中的目标像素本身),输入中必须排除目标像素。这通过一个“盲点”策略实现:在输入中挖掉中心像素,或者使用一个掩码(mask)让模型无法直接看到目标。
    • 损失函数:均方误差(MSE)或负对数似然(假设泊松分布)。模型在训练数据(即同一个接触图谱)上最小化预测值与真实值的差异。
    • 为什么能去噪:假设真实信号在局部是平滑的(TAD 内部)或具有特定模式(环),而噪声是独立的。模型只能从周围像素中学习到真实信号的结构,无法学习到独立的噪声,因此预测结果就是去噪后的信号。
  • 关键假设
    1. 局部结构冗余:接触图谱中,一个像素的真实值与其邻近像素高度相关。这是 TAD 结构存在的前提。
    2. 噪声独立性:不同像素的噪声是相互独立的(或至少相关性弱于信号的相关性)。
    3. 结构尺度:局部窗口的大小必须大于噪声的相关长度,但小于 TAD 的尺寸,才能有效捕捉结构。
  • 推断 / 计算手段
    • 模型:浅层 CNN(2-3 个卷积层),参数量小,计算效率高。
    • 训练:在单个接触图谱上训练,每个图谱训练一个独立的模型。这避免了跨样本泛化问题,但也意味着计算成本与样本量成正比。
    • 评估:通过比较去噪前后的接触图谱与“黄金标准”(高覆盖度数据)的皮尔逊相关系数、结构相似性指数(SSIM)等指标。对于单细胞数据,则通过检查重建的 TAD 和环是否与已知生物学知识一致。
  • 核心结论 + 不确定性量化
    • 结论:HiC2Self 能有效去噪,恢复 TAD 和环结构,在 bulk、伪批量、单细胞数据上均优于现有监督方法。
    • 不确定性量化几乎没有。文章没有提供去噪结果的不确定性区间或置信度。评估主要基于与“黄金标准”的相似性指标,但这些指标本身不提供不确定性信息。对于单细胞数据,由于没有“黄金标准”,评估更是定性为主。这是一个典型的“方法论文”弱点:展示了方法有效,但未量化其可靠性。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 评分:4/5 星
    • 理由:文章本身写得清晰,对 Hi-C 技术、TAD、环等核心概念有基本介绍,自包含性尚可。作为一个统计学家,读完能理解三维基因组学的基本问题、数据形态和主要挑战。但文章是方法论文,对生物学背景的科普深度有限,更侧重于展示方法效果。作为入门第一篇,它合格,但不算惊艳。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 科学趣味性。三维基因组学是一个极其迷人的领域:它揭示了生命最基础的分子——DNA——在细胞核内的物理组织方式,并直接关联到基因调控这一核心生物学问题。数据形态(稀疏、有结构的矩阵)和问题(从噪声中重建结构)本身就非常吸引人。一个好奇的统计学家会惊叹于“原来生物学家也在处理这种矩阵补全和降噪问题”。
    • 方法学空间中等偏上。本文的方法本身(自监督 CNN)在机器学习领域并不新颖,但其在 Hi-C 数据上的应用是巧妙的。从统计角度看,有多个值得深挖的口子:
      • 更结构化的先验:能否利用 TAD 的块状结构(类似于图像分割中的 Potts 模型)或环的稀疏性(类似于压缩感知),设计出比通用 CNN 更高效、更具可解释性的去噪或矩阵补全方法?例如,一个贝叶斯分层模型,将 TAD 边界和环位置作为潜在变量,同时进行推断和去噪。
      • 不确定性量化:这是最明显的缺口。如何为去噪后的接触图谱提供像素级别的置信区间?这对于后续的生物学发现(如判断一个环是否真实存在)至关重要。可以尝试变分推断MCMC来量化后验不确定性。
      • 单细胞数据的异质性建模:本文的伪批量方法只是简单求和,丢失了细胞间差异。能否用张量分解(细胞×位置×位置)或混合模型来同时学习群体平均结构和个体变异?这直接关联到高维统计和潜在变量模型。
      • 计数数据的非参数回归:背景距离效应的建模是识别显著环的关键。能否用非参数回归(如局部多项式、样条)更灵活地建模,并基于极值理论多重比较校正来识别显著偏离背景的接触?
    • 现实相关性。这种“低信噪比下的结构重建”问题在科学中无处不在(如天文图像、MRI、电子显微镜)。统计学家在别处也会遇到类似的数据模式:稀疏矩阵、块状结构、泊松噪声。Hi-C 数据提供了一个具体且有趣的案例。
    • 明确结论很有意思值得留意。虽然本文的方法本身不是统计创新,但它揭示了一个数据丰富、问题清晰、统计方法学空间巨大的领域。对于对“逆问题”、“矩阵补全”、“贝叶斯建模”感兴趣的统计学家,这是一个值得花时间了解的话题。
  3. 武器库匹配度

    • 无明显接口,纯科普阅读。您的武器库(非参数统计、极小极大界、高维渐近、因果推断)与 Hi-C 数据的核心挑战(低计数矩阵降噪、自监督学习、结构先验建模)没有直接的方法学重叠。虽然“逆问题”是一个宽泛的连接,但 Hi-C 的逆问题(从噪声观测中恢复真实接触)与您熟悉的“带随机噪声的逆问题”(如反卷积、断层扫描)在数学结构上差异较大。本文不涉及因果推断、U-统计量或高维协方差矩阵估计。因此,建议作为科普阅读,开阔眼界,但不作为方法学迁移的目标。
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述
      • “A 3D map of the human genome at kilobase resolution reveals principles of chromatin looping” (Rao et al., 2014, Cell)。这是 Hi-C 领域的奠基性论文之一,首次以高分辨率绘制了人类基因组的三维图谱,并系统定义了 TAD 和环。阅读它,能深刻理解生物学家在 Hi-C 数据中看到了什么。
      • “Single-cell Hi-C reveals cell-to-cell variability in chromosome structure” (Nagano et al., 2013, Nature)。单细胞 Hi-C 的开创性工作,展示了该技术的潜力和数据稀疏性的挑战。
    • 关键奠基/代表论文
      • “HiCPlus: a deep learning model for improving Hi-C contact maps” (Zhang et al., 2019, Nature Communications)。本文对比的监督学习方法之一。阅读它,能理解为什么监督学习在 Hi-C 去噪中面临泛化问题。
      • “Noise2Noise: Learning Image Restoration without Clean Data” (Lehtinen et al., 2018, ICML)。本文自监督思想的灵感来源。虽然不是 Hi-C 论文,但理解它有助于把握 HiC2Self 的核心原理。
    • 可动手玩的数据集
      • 4DN Data Portal (https://data.4dnucleome.org/)。4D 核体计划(4D Nucleome)提供了大量公开的 Hi-C、Micro-C 等数据集,包括 bulk 和单细胞数据。可以下载低覆盖度数据,尝试用 HiC2Self 或其他方法去噪,并与高覆盖度参考数据比较。

七、术语小抄

英文术语 中文 一句话解释
Hi-C 高通量染色体构象捕获 一种实验技术,测量全基因组任意两个位点在三维空间中的接触频率,输出一个二维接触矩阵。
Contact Map 接触图谱 Hi-C 实验的最终数据,一个对称矩阵,元素值表示两个基因组位点之间的接触次数。
TAD (Topologically Associating Domain) 拓扑关联结构域 基因组三维结构的基本单元,在接触图谱上表现为沿对角线的方块,内部接触频繁。
Significant Loop 显著环 接触图谱上远离对角线的孤立高接触点,代表两个远距离位点之间的稳定三维接触。
Bulk Hi-C 批量 Hi-C 从大量细胞中提取 DNA 进行实验,得到群体平均的接触图谱。
Single-cell Hi-C (scHi-C) 单细胞 Hi-C 对单个细胞进行实验,数据极其稀疏,但能揭示细胞间的结构异质性。
Coverage 覆盖度 测序深度,即有效接触对的总数。覆盖度越高,接触图谱越清晰。
Self-supervised Learning 自监督学习 一种机器学习方法,模型从输入数据本身构造监督信号进行训练,无需外部标签。
Pseudobulk 伪批量 将多个单细胞数据合并成一个虚拟的批量数据,以提高覆盖度。
Micro-C 微球菌核酸酶 Hi-C Hi-C 的变体,使用 MNase 酶切,能获得更高分辨率(~1 kb)的接触图谱。
Methyl-3C 甲基化-3C 一种结合 Hi-C 和 DNA 甲基化测序的技术,可同时测量三维结构和甲基化状态。
Chromatin 染色质 细胞核内 DNA 与蛋白质(如组蛋白)的复合物,是 DNA 的储存形式。
CTCF CCCTC-结合因子 一种重要的 DNA 结合蛋白,在形成 TAD 边界和介导染色质环中起关键作用。
Cohesin 黏连蛋白 一种环状蛋白复合物,通过环挤压(loop extrusion)机制形成染色质环。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论