Estimation of genetic correlation with summary association statistics¶
作者: Jianqiao Wang, Hongzhe Li
来源: Biometrika
主题: 高维统计 / 随机矩阵
相关性: 5/10
机构绿灯: University of North Carolina at Chapel Hill(US News 前 50,免分进入精读)
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:如何仅用GWAS汇总统计量(summary association statistics,即每个SNP的效应估计值及其标准误),而非个体水平的基因型-表型数据,来估计两个复杂性状之间的遗传相关性(genetic correlation)。遗传相关性衡量的是两个性状共享的遗传基础的程度,其估计对于理解疾病共病机制、揭示多效性(pleiotropy)以及指导后续的因果推断(如孟德尔随机化)至关重要。当前该领域的成熟度较高,已有多种实用方法(如LD Score回归),但对其统计性质(相合性、渐近正态性、对模型假设的稳健性)的严格理论分析仍不充分。
发展脉络(history)¶
-
奠基工作:从个体水平数据到SNP遗传力估计
- Yang et al. (2010):提出用全基因组SNP同时拟合线性模型,通过REML(限制性最大似然)估计SNP遗传力(即所有常见SNP共同解释的表型方差比例)。这是“利用全基因组SNP而非少数显著位点”这一思想的奠基之作。
- Bulik-Sullivan et al. (2015a, LD Score回归):开创性地提出仅用GWAS汇总统计量估计SNP遗传力的方法。其核心洞察是:一个SNP的检验统计量(卡方统计量)的期望值,与其LD Score(该SNP与周围所有SNP的连锁不平衡r²之和)呈线性关系,斜率正比于SNP遗传力,截距反映群体分层等混杂。这极大地降低了数据获取门槛。
-
主要进展:从单性状到跨性状遗传相关性
- Bulik-Sullivan et al. (2015b, 跨性状LD Score回归):将LD Score回归扩展到两个性状,提出用两个性状GWAS的z统计量的乘积对LD Score回归,其斜率估计遗传协方差,进而得到遗传相关性。该方法成为目前应用最广的“黄金标准”方法。
- Guo et al. (2017b, 功能去偏估计FDE):在高维线性模型框架下,为遗传协方差和遗传相关性提出了功能去偏估计量(FDE),并证明了其minimax最优性。这是对遗传相关性估计进行严格统计理论分析的重要一步。本文(Wang & Li)的introduction明确指出,FDE需要个体水平数据,而本文的目标是仅用汇总统计量。
- Shi et al. (2017, ρ-HESS):提出了局部遗传相关性的估计方法,将分析从全基因组尺度细化到局部基因组区域,并同样仅需汇总统计量。
-
当前Frontier与本文的位置
- 当前Frontier:尽管LD Score回归应用广泛,但其统计性质(如估计量的相合性、方差估计的准确性)在理论上并未被充分刻画。特别是,LD Score回归的方差估计依赖于block jackknife,当模型假设(如所有SNP效应方差相等)被违反时,该方差估计可能有偏。此外,LD Score回归对LD信息的利用是“平均化”的(通过LD Score),可能损失了精细的LD结构信息。
- 本文的位置:本文正是在这个理论缺口上切入。它在高维线性模型框架下,为遗传相关性提出了一个基于矩估计(method of moments)的新估计量。该估计量仅需汇总统计量,并首次在理论上证明了其相合性和渐近正态性。更重要的是,本文通过理论分析揭示了LD Score回归方法的两个缺陷:①未充分利用LD信息;②其jackknife方差估计在模型假设偏离时可能不稳健。本文的估计量被证明是对LD Score回归的一种改进和理论补充。
子线索聚类¶
- 基于个体水平数据的方法:以Yang et al. (2010)的REML方法和Guo et al. (2017b)的FDE为代表。这类方法统计性质清晰,但需要访问原始基因型数据,这在大型GWAS中常因隐私和伦理限制而不可行。
- 基于汇总统计量的方法:这是本文的核心战场。包括:
- LD Score回归及其衍生(Bulik-Sullivan et al., 2015a, 2015b; Zheng et al., 2017):应用最广,但理论性质分析不足。
- 本文提出的矩估计方法:旨在提供更扎实的理论基础和更稳健的估计。
- 多基因风险评分(PRS)方法:以Purcell et al. (2009)的跨性状PRS为代表。PRS通过计算一个性状的遗传风险评分对另一个性状的预测能力(R²)来间接衡量遗传重叠。本文introduction指出,PRS的R²通常很小(<2%),且其统计性质(如与遗传相关性的关系)未被严格研究。本文的矩估计方法为理解PRS的局限性提供了理论视角。
这个方向在追问的核心问题¶
- 如何仅用汇总统计量,对遗传相关性进行统计上严格(相合、渐近正态)的估计?
- 现有方法(如LD Score回归)的统计性质是什么?在什么条件下它们会失效?
- 如何更充分地利用LD矩阵的精细结构信息,而不是仅用其汇总统计量(LD Score)?
- 如何区分真正的多效性(pleiotropy,一个SNP直接影响两个性状)和由LD导致的虚假遗传相关性?
⚠️ 作者的Framing¶
- 作者把缺口frame成什么:作者将缺口frame为“对遗传相关性估计的严格统计理论分析的缺乏”。他们指出,尽管LD Score回归应用广泛,但其“statistical properties, including their robustness to model assumptions, is still lacking”。本文通过提出一个具有明确理论性质的矩估计量,将自己定位为填补这一理论空白的“显然的下一步”。
- 哪些竞争路线被他淡化或回避了:
- Guo et al. (2017b)的FDE:作者承认FDE是“optimal”,但强调其需要个体水平数据,从而将本文的方法定位为在“仅用汇总统计量”这一更实际场景下的替代方案。作者没有深入讨论FDE是否可以通过某种方式(如近似)仅用汇总统计量实现。
- 其他基于汇总统计量的方法:如Shi et al. (2017)的ρ-HESS,作者在introduction中提及,但未将其作为主要比较对象。作者将比较重点完全放在LD Score回归上,这可能是为了突出本文方法的改进。
- 什么明显该被引/该存在、却没出现在intro里?:未见明显缺失的关键引用。作者引用了该领域几乎所有里程碑式的工作。
张力¶
未见明显对立引用。该领域的工作基本是互补和递进的,共同构建了从个体水平数据到汇总统计量、从遗传力到遗传相关性的分析框架。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(p\): SNP(单核苷酸多态性)的数量,通常很大(如数百万)。
- \(n_1, n_2\): 两个GWAS研究的样本量。
- \(y_1 \in \mathbb{R}^{n_1}\), \(y_2 \in \mathbb{R}^{n_2}\): 两个性状的表型向量(可观测)。
- \(X_1 \in \mathbb{R}^{n_1 \times p}\), \(X_2 \in \mathbb{R}^{n_2 \times p}\): 两个GWAS的基因型矩阵(不可直接观测,仅知其汇总统计量)。
- \(\beta_1 \in \mathbb{R}^p\), \(\beta_2 \in \mathbb{R}^p\): 两个性状的SNP效应向量(待估参数,高维)。
- \(\epsilon_1 \in \mathbb{R}^{n_1}\), \(\epsilon_2 \in \mathbb{R}^{n_2}\): 独立同分布的随机误差项,均值为0,方差为\(\sigma^2_{\epsilon_1}, \sigma^2_{\epsilon_2}\)。
- \(\Sigma \in \mathbb{R}^{p \times p}\): LD矩阵(Linkage Disequilibrium matrix),即所有SNP之间的相关系数矩阵。本文假设LD矩阵是已知的,可以从一个参考群体(如1000 Genomes Project)中估计得到。
- \(\hat{\beta}_{1,j}, \hat{\beta}_{2,j}\): 第\(j\)个SNP对两个性状的边际效应估计(可观测的汇总统计量),通常来自单变量线性回归。
- \(s_{1,j}^2, s_{2,j}^2\): 上述边际效应估计的方差(可观测的汇总统计量)。
- \(\rho_g\): 遗传相关性(目标参数)。
- 模型:
- 两个性状分别服从高维线性模型:
\[y_1 = X_1\beta_1 + \epsilon_1, \quad y_2 = X_2\beta_2 + \epsilon_2\]
- 关键假设:SNP效应\(\beta_1, \beta_2\)被视为随机效应,服从一个均值为0、协方差结构待定的分布。这是遗传学中常用的“随机效应模型”视角。
- 遗传相关性的定义:本文定义遗传相关性为两个性状的标准化SNP效应向量的相关系数:
\[\rho_g = \frac{\beta_1^T \Sigma \beta_2}{\sqrt{\beta_1^T \Sigma \beta_1} \sqrt{\beta_2^T \Sigma \beta_2}}\]注意,这里用LD矩阵\(\Sigma\)对效应向量进行了“加权”。这个定义与Guo et al. (2017b)一致,但与LD Score回归的定义(基于所有SNP效应方差的协方差)略有不同。
- 两个性状分别服从高维线性模型:
- 可观测数据:
- 研究者能观测到的是:每个SNP的边际效应估计\(\hat{\beta}_{1,j}, \hat{\beta}_{2,j}\)及其标准误\(s_{1,j}, s_{2,j}\)。这些是GWAS的“汇总统计量”。
- 研究者观测不到的是:原始基因型矩阵\(X_1, X_2\),以及真实的SNP效应向量\(\beta_1, \beta_2\)。
- 研究者假设已知的是:LD矩阵\(\Sigma\)(从参考面板估计)。
第二步:讲最小内核¶
最简特例:假设所有SNP都是独立的(即LD矩阵\(\Sigma = I_p\),单位阵),且两个性状的GWAS样本量相同(\(n_1 = n_2 = n\)),且所有SNP的边际效应估计的方差相同(\(s_{1,j}^2 = s_{2,j}^2 = s^2\))。
在这个特例下,遗传相关性的定义简化为:
即两个效应向量的余弦相似度。
核心思路:我们如何仅用\(\hat{\beta}_{1,j}, \hat{\beta}_{2,j}\)来估计\(\rho_g\)?
-
矩条件:在随机效应模型下,可以证明边际效应估计的期望和方差满足某些矩条件。例如,对于任意一个SNP \(j\),有:
\[E[\hat{\beta}_{1,j} \hat{\beta}_{2,j}] = \rho_g \sqrt{h_1^2 h_2^2} + \text{噪声项}\]其中\(h_1^2, h_2^2\)是两个性状的SNP遗传力。这个矩条件将我们关心的参数\(\rho_g\)与可观测的\(\hat{\beta}_{1,j} \hat{\beta}_{2,j}\)的期望联系起来。 -
矩估计:矩估计的基本思想是“用样本矩代替总体矩”。因此,我们可以用所有SNP的\(\hat{\beta}_{1,j} \hat{\beta}_{2,j}\)的样本均值作为\(E[\hat{\beta}_{1,j} \hat{\beta}_{2,j}]\)的估计,然后解出\(\rho_g\)。
-
解决高维问题:然而,这里有一个关键困难:遗传力\(h_1^2, h_2^2\)也是未知的,且同样需要估计。此外,边际效应估计\(\hat{\beta}_{1,j}\)本身是有偏的(因为它是单变量回归,忽略了其他SNP的贡献),这在高维背景下尤为严重。
-
本文的关键想法:作者巧妙地构造了一个不需要估计遗传力的矩条件。他们发现,对于任意两个SNP \(j\)和\(k\),其边际效应估计的乘积的期望满足一个关系,该关系可以消去遗传力项,从而直接得到关于\(\rho_g\)的方程。具体来说,他们利用了一个事实:在独立SNP的特例下,\(E[\hat{\beta}_{1,j} \hat{\beta}_{2,k}]\)(\(j \neq k\))与\(\rho_g\)成正比,且比例系数与遗传力无关。通过巧妙地组合不同SNP对的矩条件,他们构造了一个关于\(\rho_g\)的简单矩估计量。
一句话总结:本文的核心数学贡献是,在高维线性模型下,构造了一个仅依赖于边际效应估计和已知LD矩阵的矩条件,该矩条件直接识别出遗传相关性\(\rho_g\),无需估计高维的SNP效应向量或遗传力。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高维线性模型框架下,研究如何仅用GWAS汇总统计量(边际效应估计及其标准误)和已知的LD矩阵,来相合且渐近正态地估计两个复杂性状之间的遗传相关性\(\rho_g\)。
- 核心工具/方法:提出了一个矩估计量(method of moments estimator),该估计量通过构造一个关于边际效应估计的二次型,巧妙地消去了高维的SNP效应向量,从而直接识别出\(\rho_g\)。
- 主要结论:证明了该矩估计量的相合性和渐近正态性。理论分析表明,该估计量与LD Score回归估计量有密切联系,但更充分地利用了LD信息,且其方差估计对模型假设的偏离更稳健。模拟和真实数据分析验证了其优于LD Score回归的性能。
关键设定与假设¶
- 模型:两个性状分别服从高维线性模型 \(y_1 = X_1\beta_1 + \epsilon_1\), \(y_2 = X_2\beta_2 + \epsilon_2\)。
- 随机效应假设:SNP效应向量\(\beta_1, \beta_2\)被视为随机向量,服从一个均值为0的分布。具体地,假设\(E[\beta_1] = 0\), \(E[\beta_2] = 0\), \(Var(\beta_1) = \frac{h_1^2}{p} I_p\), \(Var(\beta_2) = \frac{h_2^2}{p} I_p\), \(Cov(\beta_1, \beta_2) = \frac{\rho_g \sqrt{h_1^2 h_2^2}}{p} I_p\)。这是一个同方差的随机效应模型,即所有SNP的效应方差相同。这是本文与LD Score回归共享的核心假设。
- 已知LD矩阵:假设LD矩阵\(\Sigma\)是已知的。在实际应用中,它由一个外部参考面板(如1000 Genomes Project)估计得到。
- 边际效应估计:假设可观测的汇总统计量\(\hat{\beta}_{1,j}, \hat{\beta}_{2,j}\)是通过单变量线性回归(即每个SNP单独对表型回归)得到的。这是GWAS的标准做法。
- 样本独立性:假设两个GWAS的样本是独立的(\(X_1\)和\(X_2\)独立,\(\epsilon_1\)和\(\epsilon_2\)独立)。这是为了简化理论分析,作者在附录中讨论了样本重叠的情况。
- 与已有文献的对比:相比LD Score回归,本文的设定更明确地写明了高维线性模型和随机效应假设。相比Guo et al. (2017b)的FDE,本文的设定允许仅使用汇总统计量,但代价是施加了更强的同方差随机效应假设。
主要结果¶
- 定理1(矩估计量的相合性):在正则条件下,本文提出的矩估计量\(\hat{\rho}_g\)是遗传相关性\(\rho_g\)的相合估计,即\(\hat{\rho}_g \xrightarrow{p} \rho_g\)。直觉:矩估计量本质上是一个关于边际效应估计的二次型的函数,该二次型的期望在\(p \to \infty\)时收敛到\(\rho_g\)的某个函数,且其方差趋于0。必要条件:SNP数量\(p\)和样本量\(n\)都趋于无穷大,且\(p/n\)趋于一个常数(高维场景)。
- 定理2(矩估计量的渐近正态性):在更强的正则条件下,\(\sqrt{p}(\hat{\rho}_g - \rho_g)\)依分布收敛到一个均值为0的正态分布。直觉:矩估计量可以表示为一系列弱相关随机变量的和,从而可以用中心极限定理。解决的技术难点:证明渐近正态性需要处理高维二次型的渐近分布,作者使用了U-统计量和鞅差序列的理论工具。
- 与LD Score回归的关系:作者证明,在特定的参数化下,本文的矩估计量与LD Score回归的估计量在形式上非常相似。然而,关键区别在于:
- LD信息利用:LD Score回归使用每个SNP的LD Score(一个标量)作为回归变量,而本文的矩估计量直接使用了整个LD矩阵\(\Sigma\)。作者通过理论推导和模拟表明,当LD结构复杂时,本文的方法能更准确地捕捉LD对遗传相关性的贡献。
- 方差估计:LD Score回归使用block jackknife估计方差,而本文给出了方差的分析表达式。模拟表明,当同方差随机效应假设被违反时(例如,存在少数效应很大的SNP),LD Score回归的jackknife方差估计会严重有偏,而本文的分析方差估计则相对稳健。
证明路线与技术技巧¶
- 整体路线:
- 构造矩条件:首先,基于随机效应模型,推导出边际效应估计\(\hat{\beta}_1, \hat{\beta}_2\)的期望和协方差结构。关键的一步是证明\(E[\hat{\beta}_1 \hat{\beta}_2^T]\)与\(\rho_g\)和LD矩阵\(\Sigma\)之间存在一个简洁的关系。
- 提出矩估计量:基于上述矩条件,构造一个关于\(\hat{\beta}_1, \hat{\beta}_2\)和\(\Sigma\)的二次型,使其期望恰好是\(\rho_g\)的某个函数。通过求解这个函数,得到\(\hat{\rho}_g\)的显式表达式。
- 证明相合性:将\(\hat{\rho}_g\)分解为“期望项”和“随机波动项”。证明“期望项”收敛到真值\(\rho_g\),而“随机波动项”在\(p \to \infty\)时依概率收敛到0。这一步的关键是控制高维二次型的方差,使用了矩阵的谱范数和随机矩阵理论中的工具。
- 证明渐近正态性:将\(\hat{\rho}_g\)进一步表示为一系列鞅差的和,然后应用鞅中心极限定理。这一步需要精细地处理估计量的高阶项,并证明其可忽略性。
- 关键跳跃点:
- 从矩条件到显式估计量:如何从一个关于矩阵的矩条件,巧妙地构造出一个标量估计量,是本文的第一个关键跳跃。作者通过引入一个“权重矩阵”并求解一个优化问题来实现。
- 处理高维二次型的渐近分布:证明\(\hat{\rho}_g\)的渐近正态性需要处理一个形式复杂的二次型。作者没有直接使用经典的二次型极限定理(如Bai-Silverstein定理),而是通过U-统计量分解和鞅差表示,将问题转化为一个更易处理的形式。
- 技术技巧点名:
- U-统计量:用于分解和简化高维二次型的期望和方差计算。
- 鞅差序列:用于证明渐近正态性,通过构造一个鞅差序列,将复杂的依赖结构转化为鞅框架下的问题。
- 矩阵谱范数:用于控制高维随机矩阵(如\(\hat{\beta}_1 \hat{\beta}_2^T\))的算子范数,这是证明相合性的关键。
- 随机矩阵理论:用于处理LD矩阵\(\Sigma\)的谱性质,以及基因型矩阵\(X\)的随机性。
真实例子与应用¶
- 数据/场景:使用UK Biobank数据,分析脑白质(WM)纤维束的弥散张量成像(DTI)参数与几种神经精神疾病(如ADHD、双相情感障碍、精神分裂症)之间的遗传相关性。
- 方法应用:作者首先使用ENIGMA管道从UK Biobank的dMRI数据中提取了7个DTI参数(FA, MD等)的汇总统计量。然后,他们使用本文提出的矩估计量和LD Score回归,分别估计了每个DTI参数与三种精神疾病的遗传相关性。
- 结果:
- 两种方法都检测到了一些显著的遗传相关性,例如,FA(各向异性分数)与精神分裂症呈负相关。
- 然而,在部分结果中,两种方法的估计值存在差异。作者通过一个“正对照分析”(positive control analysis)来评估哪种方法更可靠。他们分析了总脑体积(TBV) 的遗传相关性,因为同一性状在两个独立研究中的遗传相关性理论上应为1。结果显示,本文的矩估计量给出的估计值更接近1,而LD Score回归的估计值则偏低,表明本文方法更准确。
- 这个例子想说明什么:这个真实数据例子旨在验证本文方法在实际应用中的有效性,并展示其相对于LD Score回归的优势。正对照分析的结果有力地支持了本文方法更准确、更稳健的结论。
🔎 结论是否比证明窄¶
- 窄化之处:本文的主要理论结果(相合性和渐近正态性)是在同方差随机效应模型下严格证明的。然而,在真实数据中,SNP效应几乎肯定不是同方差的(例如,一些SNP是“因果”的,效应较大;大多数SNP效应很小或为零)。作者在模拟中测试了违反该假设的情况(如存在少数大效应SNP),并发现本文方法仍优于LD Score回归,但并未给出在异方差模型下的严格理论证明。作者在结论部分提到,将方法扩展到异方差模型是未来工作。
- 泛化claim:作者在摘要和引言中声称本文方法“more robust and has better interpretability than the LD score regression method under different genetic architectures”。这个“different genetic architectures”的表述比其严格证明的“同方差”模型要宽泛。虽然模拟支持了这一claim,但严格的理论保证目前仅限于同方差模型。
四、开放问题¶
-
异方差随机效应模型下的理论性质:本文的核心理论(相合性、渐近正态性)是在所有SNP效应方差相等的同方差假设下建立的。要证:在更现实的异方差模型(如Bayesian alphabet模型,或存在稀疏大效应SNP)下,本文的矩估计量是否仍然相合?其渐近分布是什么?方差估计公式是否需要调整?扎根点:本文结论部分明确提到“extending our method to accommodate heterogeneous SNP effect variances is an important future direction”。
-
样本重叠时的调整:本文的理论假设两个GWAS的样本是独立的。然而,在实际中,样本重叠(如UK Biobank中同时测量了多个性状)非常普遍。要估:当存在样本重叠时,本文的矩估计量会产生什么偏差?如何修正矩条件以消除该偏差?扎根点:本文在附录中简要讨论了样本重叠的情况,但未给出完整的理论结果或修正方法。
-
LD矩阵估计误差的影响:本文假设LD矩阵\(\Sigma\)是已知的,但实际中它是从一个有限样本的参考面板估计得到的。要估:LD矩阵的估计误差如何传播到遗传相关性的估计中?是否会导致额外的偏差或方差?能否给出一个考虑LD矩阵不确定性的校正方差估计?扎根点:本文在模拟中使用了估计的LD矩阵,但未对其估计误差进行理论分析。
-
与多基因风险评分(PRS)的理论联系:本文的introduction指出,跨性状PRS的R²通常很小,但其与遗传相关性的精确关系未被研究。要证:能否在本文的模型框架下,推导出PRS的R²与遗传相关性\(\rho_g\)之间的解析关系?这或许能解释为何PRS的R²通常很小,并为PRS的校正提供理论依据。扎根点:本文在introduction中明确提出了对PRS理论分析的缺失,并将其作为本文动机的一部分。
Maintained by 陈星宇 · Homepage · Source on GitHub