跳转至

Cross-cohort analysis of expression and splicing quantitative trait loci in TOPMed

作者: Peter Orchard, Thomas W. Blackwell, Linda Kachuri, Peter J. Castaldi, Michael H. Cho et al.
来源: Science
主题: 其他
相关性: 7/10
机构绿灯: University of Michigan(US News 前 50,免分进入精读)
链接: https://doi.org/10.1126/science.adx2989


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于遗传流行病学功能基因组学的交叉领域。核心科学问题是:如何找到影响基因表达(或基因剪接)的DNA变异,并利用这些信息来解释为什么某些遗传变异与疾病风险相关。 这个领域已经相当成熟,拥有标准化的分析流程(eQTL mapping)和大型公开数据库(如GTEx),但仍在不断扩展样本量和组织类型,以发现更精细的调控信号。
  • 本文的位置:它针对的是次级(secondary)表达/剪接数量性状位点(e/sQTL)的发现与功能解读。具体来说,大多数eQTL研究只关注与某个基因表达关联最强的“主位点”(primary eQTL),但一个基因的表达可能受多个独立遗传变异调控。本文利用TOPMed项目的大规模RNA测序数据,系统性地寻找这些“次级位点”,并评估它们对解释复杂疾病GWAS信号的贡献。现在做这件事是因为样本量足够大(>14,000人),使得检测次级位点的统计功效大幅提升。

二、关键术语扫盲

  1. eQTL (expression Quantitative Trait Locus):表达数量性状位点。指基因组中某个特定位置的DNA变异(通常是单核苷酸多态性,SNP),其不同基因型与某个基因的表达水平高低相关。可以理解为“调控基因表达的DNA开关”。
  2. sQTL (splicing Quantitative Trait Locus):剪接数量性状位点。与eQTL类似,但关联的是基因的剪接方式(即同一个基因如何被“剪切”成不同的mRNA版本,产生不同的蛋白质变体)。
  3. cis-eQTL / cis-sQTL:顺式e/sQTL。指调控位点与被调控的基因位于同一条染色体上,且距离很近(通常<1Mb)。这是最常见的调控模式,相当于“本地开关”。
  4. trans-eQTL:反式eQTL。调控位点与被调控的基因不在同一条染色体上,或距离很远。相当于“远程遥控”,更难检测,需要更大样本量。
  5. GWAS (Genome-Wide Association Study):全基因组关联研究。通过扫描数百万个SNP,找出与某种疾病或性状(如身高、心脏病风险)显著相关的遗传变异。GWAS只能告诉你“哪里有关联”,但不能告诉你“为什么有关联”。
  6. Fine-mapping (精细映射):在GWAS或eQTL发现的关联区域中,利用统计方法(如贝叶斯模型)找出最可能具有因果作用的SNP,而不是仅仅报告一个关联信号区域。
  7. Colocalization (共定位分析):一种统计方法,用于判断两个不同性状(如基因表达水平和疾病风险)的关联信号是否由同一个因果遗传变异驱动。如果共定位成立,就为“该基因表达变化导致了疾病风险变化”提供了间接证据。
  8. RNA-seq (RNA sequencing):RNA测序。一种测量细胞或组织中所有基因表达水平的高通量技术。它不仅能测量表达量,还能检测不同的剪接形式。
  9. TOPMed (Trans-Omics for Precision Medicine):跨组学精准医学项目。美国国立卫生研究院(NIH)发起的大型项目,旨在通过整合基因组、转录组、蛋白质组等多层次数据,理解复杂疾病的遗传基础。本文的数据来源。
  10. UK Biobank:英国生物银行。一个包含约50万英国志愿者遗传和健康数据的大型生物医学数据库,是GWAS研究的主要数据来源之一。
  11. Secondary cis-e/sQTL (次级顺式e/sQTL):在同一个基因上,除了最强关联的“主位点”之外,第二个、第三个……独立关联的e/sQTL。它们可能通过不同的分子机制调控同一个基因。
  12. Conditional analysis (条件分析):一种统计方法,用于在已发现一个eQTL的基础上,通过将该位点的基因型作为协变量,来检测是否存在其他独立的eQTL信号。这是发现次级e/sQTL的核心方法。

三、这个领域的人在关心什么

这个领域的研究者核心追问是:“DNA序列上的微小差异,是如何通过影响基因的‘开关’(表达)或‘剪接’(加工),最终导致个体在疾病易感性、药物反应等方面的巨大差异?” 这是一个从“基因型”到“表型”的因果链条解释问题。

GWAS已经成功找到了成千上万与复杂疾病相关的遗传位点,但绝大多数位点位于非编码区,其功能机制不明。因此,一个主流假说是:这些GWAS位点通过调控附近基因的表达(即作为eQTL)来发挥作用。eQTL研究就是为这个假说提供证据。研究者们关心:哪些基因的表达受这些GWAS位点调控?这种调控是组织特异性的吗?是影响表达量还是影响剪接?一个基因是否受多个独立位点调控(即次级eQTL)?

当前主流的方法和已知局限: - 主流方法:以GTEx项目(Genotype-Tissue Expression)为代表,它系统性地收集了来自死后捐赠者的多种组织样本,并进行了标准的eQTL映射。GTEx是这一领域的奠基性工作,提供了最全面的组织特异性eQTL图谱。其局限在于样本量相对较小(每个组织通常几百人),导致检测次级eQTL和罕见变异的统计功效不足。 - 已知局限:大多数eQTL研究只关注“主位点”,忽略了次级位点。次级位点可能解释额外的遗传力,并且可能为GWAS信号提供新的解释。此外,许多研究只关注全血或少数几种容易获取的组织,而疾病相关的调控往往发生在特定组织(如肺、心脏)。 - 本文的贡献:本文利用TOPMed项目远超GTEx的样本量(特别是全血n=6454和肺n=1291),系统性地检测了次级e/sQTL。它绕开了GTEx样本量不足的局限,证明了次级位点发现远未饱和,并且这些次级位点能显著增加对GWAS信号的解读能力(发现了7096个与次级eQTL共定位的GWAS信号)。

四、数据问题

  • 数据来源:来自TOPMed项目的14,324个RNA测序样本。这些样本来自多个不同的队列研究(如Framingham Heart Study, COPDGene等),覆盖了多种人群。基因型数据通过全基因组测序(WGS)获得,提供了比基因芯片更全面的变异信息。
  • 数据形态表格数据。核心数据是基因表达量矩阵(基因 × 样本)和基因型矩阵(SNP × 样本)。此外还有剪接比率矩阵(外显子-外显子连接 × 样本)。维度:基因数约2-3万,SNP数数百万至上千万,样本数1.4万。
  • 结构特征层次结构:样本嵌套在队列中,队列嵌套在人群中。空间/基因组结构:SNP在染色体上有物理位置,基因也有位置,cis-eQTL分析利用了这种邻近性。时间结构:无,这是横截面数据。
  • noise & 测量误差:RNA-seq数据是计数数据,通常服从负二项分布(过离散的泊松分布)。测量误差来源于文库制备、测序深度、批次效应等。基因型数据(WGS)的测量误差极低,但存在基因分型错误和缺失。
  • selection / bias / 缺失 / censoring / truncation / 计算约束
    • 选择偏倚:样本来自多个不同的队列,每个队列有其特定的招募标准和人群构成(如COPDGene只招募吸烟者和慢阻肺患者),导致样本并非随机人群。分析中通过协变量(如队列、年龄、性别、遗传主成分)进行校正。
    • 缺失:基因表达数据有缺失(低表达基因被过滤掉),基因型数据有缺失(通过imputation填补)。
    • 计算约束:这是一个巨大的计算挑战。对每个基因(~2万)和其附近的每个SNP(~数千)进行关联检验,需要进行数亿次假设检验。标准做法是使用线性模型(如Matrix eQTL, FastQTL)进行快速近似计算,并采用严格的显著性阈值(如FDR < 0.05)。
  • 哪些数据特性是“漂亮的统计学问题”,哪些是“纯工程或纯领域难题”?
    • 漂亮的统计学问题
      1. 多重假设检验:数亿次检验下的FDR控制,以及如何利用基因组结构(如局部相关性)提高检验功效。
      2. 高维协变量调整:如何有效校正大量协变量(如PEER因子、遗传主成分、批次)以消除隐藏的混杂因素,同时避免过度拟合。
      3. 条件分析的统计功效:在已发现主位点后,如何设计检验来检测次级位点,其统计功效与样本量、效应大小、LD结构的关系。
    • 纯工程或纯领域难题
      1. 数据整合与质量控制:将来自不同测序中心、不同协议的数据进行归一化和批次校正(如使用ComBat),这是一个需要大量领域知识和工程经验的步骤。
      2. 剪接比率的量化:从RNA-seq reads中准确量化不同剪接形式的比例,涉及复杂的比对和计数算法(如LeafCutter, rMATS),是计算生物学问题。
      3. LD结构:连锁不平衡(LD)是基因组中相邻SNP之间的相关性,是遗传学的基本属性,不是统计问题,但它是所有精细映射和共定位分析的基础。

五、方法与模型问题

  • 文章用的分析方法
    1. e/sQTL映射:使用线性回归模型(或线性混合模型),将每个基因的表达量(或剪接比率)作为因变量,每个SNP的基因型(0/1/2)作为自变量,并加入协变量(年龄、性别、遗传主成分、PEER因子等)。对每个基因- SNP对进行检验,得到p值。这是标准的单变量关联分析。
    2. 次级e/sQTL发现:使用条件分析。首先找到主位点(p值最小的SNP),然后将该SNP的基因型作为协变量加入模型,重新对所有SNP进行检验。如果仍有显著SNP,则称为次级位点。重复此过程直到没有显著信号。
    3. 精细映射:使用SuSiE(Sum of Single Effects)等贝叶斯方法,对每个e/sQTL信号区域进行精细映射,计算每个SNP是因果变异的后验概率,并输出一组“可信集”(credible set)。
    4. 共定位分析:使用ENLOC(Enrichment of Local Colocalization)或coloc等贝叶斯方法,将e/sQTL的精细映射结果与UK Biobank的GWAS精细映射结果进行比较,判断两个信号是否由同一个因果变异驱动。
  • 关键假设
    • 线性加性模型:假设基因型对表达量的影响是线性的,且不同等位基因的效应是可加的。这是标准假设,在大多数情况下近似成立。
    • 独立性假设:条件分析假设在控制主位点后,次级位点的效应是独立的。如果存在上位性(基因-基因交互作用),此假设不成立。
    • 共定位的先验假设:贝叶斯共定位方法假设因果变异在基因组上是稀疏的,且两个性状共享一个因果变异的先验概率是固定的。
  • 推断 / 计算手段:主要是回归分析(线性模型)和贝叶斯推断(精细映射、共定位)。计算上依赖高效的软件工具(如FastQTL, SuSiE, ENLOC)来处理大规模数据。
  • 核心结论 + 不确定性是怎么量化的
    • 核心结论:发现了数万个次级e/sQTL,且发现数量随样本量增加而增加,表明远未饱和。这些次级位点能解释大量额外的GWAS信号(7096个共定位信号)。
    • 不确定性量化
      • eQTL映射:通过FDR(错误发现率) 控制假阳性。
      • 精细映射:通过后验概率可信集量化每个SNP是因果变异的可能性。
      • 共定位分析:通过后验概率(如PP.H4,即两个性状共享一个因果变异的概率)量化共定位的强度。文章没有对最终结论(如“次级位点对GWAS解读很重要”)进行正式的统计推断,而是基于描述性统计(如共定位信号的数量)来支持论点。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 打分3/5 星
    • 理由:作为一篇发表在《Science》上的应用型论文,它清晰地展示了大规模组学数据与GWAS整合的范式,但对统计学家来说,作为入门第一篇并不理想。文章假设读者已经熟悉eQTL、GWAS、精细映射、共定位等全套概念和流程,没有对核心方法进行科普性解释。术语密集,方法部分描述简略(“we performed conditional analysis”),更像是一份“发现报告”而非“方法教程”。读完能了解这个领域在做什么,但很难理解“为什么这么做”以及“统计挑战在哪里”。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 科学趣味性中等。这个问题本身(“遗传变异如何通过调控基因表达影响疾病”)是遗传学的一个核心问题,非常有意思。但本文的叙事重点在于“发现了多少”而非“如何发现”,对于好奇的统计学家来说,科学故事不够丰满。
    • 方法学空间有,但本文未深入。本文使用的都是标准方法,没有提出新的统计模型。然而,其数据特性(高维、多重检验、隐藏混杂、LD结构)为统计学家留下了明确的口子:
      • 隐藏混杂校正:PEER因子是一种主成分分析,但更复杂的因子模型或基于负控制的混杂校正方法(如causal inference中的方法)能否提升eQTL检测功效?
      • 条件分析的替代方案:标准的逐步条件分析在LD复杂区域可能失效。能否用多变量回归模型(如LASSO, Bayesian Variable Selection)一次性识别所有独立信号?这涉及到高维变量选择问题。
      • 共定位的因果解释:共定位不等于因果关系。能否将共定位分析与孟德尔随机化(MR)或中介分析结合,更严格地推断“基因表达→疾病”的因果路径?这直接连接了causal inference。
      • UQ的完整性:文章对发现进行了FDR控制,但对“次级位点对GWAS解读的贡献”这一结论,仅用计数来支持,缺乏正式的统计检验(如:观察到的共定位数量是否显著高于随机期望?)。
    • 现实相关性。这种“大规模关联分析 + 功能注释”的模式在生物医学中非常普遍。统计学家在其他领域(如微生物组、神经影像)也会遇到类似的数据结构(高维特征、强相关性、隐藏混杂)。理解这个问题的统计挑战,有助于迁移到其他领域。
    • 明确结论一般科普读读即可。本文是一篇高质量的应用报告,但统计方法学上乏善可陈。它展示了统计方法在遗传学中的应用场景,但本身不提供新的统计思想。对于想了解“这个领域在做什么”的统计学家,值得一读;对于寻找方法学灵感的人,价值有限。
  3. 武器库匹配度(轻量,点到即可)

    • 无明显接口,纯科普阅读。你的武器库(非参数统计、高维渐近、因果推断理论、U-statistics)与本文使用的标准线性回归和贝叶斯精细映射方法没有直接的技术重叠。虽然高维协变量调整和多重检验是统计问题,但本文的处理方式(PEER因子 + FDR)是领域内的标准工程实践,而非需要新理论的问题。因果推断(如孟德尔随机化)是相关方向,但本文并未涉及。
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述
      • GTEx Consortium. (2020). "The GTEx Consortium atlas of genetic regulatory effects across human tissues." Science. 这是该领域的奠基性工作,比本文更早、更系统地介绍了eQTL分析的概念、方法和挑战,是更好的入门读物。
      • Nica, A. C., & Dermitzakis, E. T. (2013). "Expression quantitative trait loci: present and future." Philosophical Transactions of the Royal Society B. 一篇经典的综述,清晰解释了eQTL的基本概念和统计方法。
    • 关键奠基或代表论文
      • 本文引用的精细映射方法Wang, G., et al. (2020). "A simple new approach to variable selection in regression, with application to genetic fine mapping." Journal of the Royal Statistical Society: Series B. 这是SuSiE方法的原始论文,由统计学家撰写,对理解精细映射的统计原理非常有帮助。
      • 本文引用的共定位方法Giambartolomei, C., et al. (2014). "Bayesian test for colocalisation between pairs of genetic association studies using summary statistics." PLoS Genetics. 这是coloc方法的原始论文,是理解共定位分析的必读文献。
    • 可以动手玩的公开数据集
      • GTEx Portal:提供所有组织的eQTL汇总统计数据和原始数据,是学习和复现分析的最佳资源。
      • TOPMed Data Portal:本文的数据来源,但访问可能需要申请。GTEx的数据更易获取。

七、术语小抄

英文术语 中文 一句话解释
eQTL 表达数量性状位点 与某个基因表达水平高低相关的DNA变异。
sQTL 剪接数量性状位点 与某个基因的剪接方式(产生不同蛋白质版本)相关的DNA变异。
cis-eQTL 顺式eQTL 调控位点与被调控基因位于同一条染色体上且距离很近的eQTL。
trans-eQTL 反式eQTL 调控位点与被调控基因不在同一条染色体上或距离很远的eQTL。
GWAS 全基因组关联研究 扫描全基因组,找出与疾病或性状相关的遗传变异。
Fine-mapping 精细映射 在关联区域中,用统计方法找出最可能具有因果作用的那个变异。
Colocalization 共定位分析 判断两个性状(如基因表达和疾病)的关联是否由同一个遗传变异驱动。
RNA-seq RNA测序 测量细胞中所有基因表达水平的高通量技术。
TOPMed 跨组学精准医学项目 一个大型项目,整合多组学数据研究复杂疾病。
UK Biobank 英国生物银行 包含50万人遗传和健康数据的大型数据库。
Secondary e/sQTL 次级e/sQTL 同一个基因上,除了最强关联的主位点外,其他独立的调控位点。
Conditional Analysis 条件分析 在控制已知位点效应后,寻找其他独立关联信号的统计方法。
LD (Linkage Disequilibrium) 连锁不平衡 基因组中相邻SNP之间的非随机相关性。
PEER factor PEER因子 一种用于校正RNA-seq数据中隐藏技术或生物变异的主成分。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论