On blockwise and reference panel-based estimators for genetic data prediction in high dimensions¶
作者: Bingxin Zhao, Shurong Zheng, Hongtu Zhu
来源: Annals of Statistics
主题: 高维统计 / 随机矩阵
相关性: 5/10
机构绿灯: University of Pennsylvania(US News 前 50,免分进入精读)
链接: https://doi.org/10.1214/24-aos2378
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:在高维线性预测模型中,当协方差矩阵(在遗传学中称为连锁不平衡(LD)矩阵)呈现块对角结构时,如何利用这种结构进行有效的预测,并理解不同估计策略(分块估计 vs. 全协方差估计;基于训练数据 vs. 基于外部参考面板)之间的统计性能差异。 这是一个连接高维统计、随机矩阵理论(RMT)和遗传学应用(特别是多基因风险评分 PRS)的交叉方向。当前成熟度:理论分析(特别是针对块对角协方差矩阵的 RMT)相对不完整,而应用方法(如 PRS 中的 LD 分块)已广泛使用但缺乏严格的统一理论指导。
发展脉络(history)¶
从引言和参考文献中,可以梳理出以下发展脉络:
-
奠基工作:高维线性预测与随机矩阵理论
- Dobriban & Wager (2018, JASA):在高维线性回归(随机设计)中,推导了岭回归预测误差的精确渐近公式。这是本文最核心的理论基础之一,它提供了在协方差矩阵已知或可精确估计时的基准性能。本文的许多比较和结论都建立在其框架之上。
- Hastie et al. (2022, JRSS-B):进一步分析了高维线性回归中岭回归、最小二乘和主成分回归的预测风险,特别是当特征与响应弱相关时的行为。这为理解不同正则化策略提供了更全面的图景。
- Bai & Silverstein (2010, 书):随机矩阵理论的经典著作,为处理高维样本协方差矩阵的谱行为提供了核心工具(如 Marchenko-Pastur 定律、Stieltjes 变换)。本文的定理证明大量依赖这些结果。
-
主要进展:遗传预测中的分块与参考面板方法
- Vilhjálmsson et al. (2015, AJHG):提出了 LDpred,一个广泛使用的多基因风险评分(PRS)方法。它明确采用了“分块”策略:将基因组划分为独立的 LD 块,在每个块内进行贝叶斯回归,然后汇总。这是本文所批评的“分块估计”方法的典型代表。作者引用它时指出,这类方法“假设块间独立”,而本文要检验这个假设的后果。
- Privé et al. (2021, Bioinformatics):提出了 bigsnpr,一个用于大型遗传数据的 R 包,其核心功能之一是基于参考面板的 LD 矩阵估计和分块分析。这代表了当前遗传学实践中处理高维协方差的主流方式。
- Bulik-Sullivan et al. (2015, Nature Genetics):提出了 LD Score 回归,它利用 LD 模式来区分多基因性和混杂因素。虽然不直接是预测方法,但它深刻影响了遗传学界对 LD 结构的理解,并推动了基于参考面板的 LD 估计的广泛应用。
-
当前 Frontier 与本文的位置
- 当前 Frontier:在 Dobriban & Wager (2018) 的框架下,研究者开始探索更复杂的协方差结构(如因子模型、图模型)对预测的影响。同时,遗传学领域对 PRS 方法进行大量实证比较,但缺乏一个统一的理论来解释为什么某些分块策略优于或劣于其他策略。
- 本文的位置:本文是首次在 Dobriban & Wager (2018) 的精确渐近框架下,统一分析了块对角协方差矩阵下的分块估计和参考面板估计。它填补了理论分析上的空白,特别是针对“块间独立”这一常见假设的后果,以及“用外部参考面板替代训练数据协方差”的代价,给出了严格的数学刻画。作者明确将自己的工作定位为“对现有分块和参考面板方法的高维预测性能进行统一分析”,并指出其分析“基于针对块对角协方差矩阵的随机矩阵理论新结果”。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 线索一:高维线性预测的理论分析。核心是推导预测误差的精确或渐近表达式,通常使用 RMT。代表工作:Dobriban & Wager (2018), Hastie et al. (2022), 本文。这条线索关注的是统计模型本身的数学性质。
- 线索二:遗传预测(PRS)的方法开发与应用。核心是设计针对遗传数据特点(高维、LD 结构、参考面板可用)的实用预测算法。代表工作:Vilhjálmsson et al. (2015), Privé et al. (2021), Bulik-Sullivan et al. (2015)。这条线索更关注算法效果和计算可行性,理论分析相对滞后。
这个方向在追问的核心问题¶
- 分块估计的代价是什么? 当协方差矩阵是块对角时,假设块间独立(即分块估计)与使用全协方差矩阵相比,预测精度的损失有多大?这个损失与块的大小、块内相关性强度、信号强度等参数有何关系?
- 参考面板估计的代价是什么? 当无法访问原始训练数据,只能使用一个独立的外部参考面板来估计协方差矩阵时,预测精度的损失有多大?这个损失与参考面板的样本量、训练数据与参考面板的匹配程度有何关系?
- 是否存在一个最优的“分块-参考面板”组合策略? 在给定训练数据样本量、参考面板样本量和 LD 结构下,是否存在一个最优的块大小或分块方式,使得预测误差最小?
- 这些结论对稀疏性假设的依赖程度如何? 许多遗传预测方法假设效应是稀疏的(只有少数 SNP 有非零效应)。本文的分析在“无稀疏性假设”下进行,那么当真实模型是稀疏时,结论是否会改变?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口 frame 为“现有分块和参考面板方法缺乏统一的高维理论分析”。他们强调,尽管这些方法在实践中被广泛使用,但“它们的理论性质,特别是在高维且无稀疏性假设下的性质,尚不清楚”。通过将问题置于 Dobriban & Wager (2018) 的框架下,他们将自己的工作呈现为“显然的下一步”——即用该框架来理解这些特定但重要的估计策略。
- 哪些竞争路线被他淡化或回避了:
- 稀疏性假设:作者明确声明“without sparsity restrictions”。这既是其贡献(更一般),也是其局限。在遗传学中,许多主流方法(如 LDpred、BayesR)都假设效应是稀疏的。作者在引言中承认“sparsity-based methods are also popular”,但选择不分析它们。这暗示了其理论可能不直接适用于这些方法,或者需要额外的分析。
- 非线性预测:本文完全在线性模型框架内。遗传预测中也有基于 GBLUP 或深度学习的非线性方法,这些被完全回避。
- 块结构的“真实”性:作者假设块结构是“well-defined”的。但在实际遗传学中,LD 块的定义(如基于 recombination hotspots)是模糊的,块间也存在微弱的残余相关性。作者在结论中提到了这一点,但并未将其纳入理论模型。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:这是一个值得研究者去查的问题。例如,是否有工作专门研究了块对角协方差矩阵的随机矩阵理论?作者声称他们的 RMT 结果是“novel”,但可能有一些关于“banded”或“block-diagonal”协方差矩阵的 RMT 文献(如关于 Toeplitz 矩阵的)未被引用。另外,关于计算-统计权衡的文献(如低度多项式障碍)也未出现,这可能是因为本文关注的是特定估计量的精确渐近,而非计算复杂度的下界。
张力¶
未见明显对立引用。所有被引工作都在各自的子领域内被认可,没有出现对同一问题给出相反结论的情况。主要的“张力”存在于实践与理论之间:实践者广泛使用分块和参考面板方法,而本文的理论分析揭示了这些方法可能存在的、未被充分认识的代价。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
n: 训练样本量。p: 特征(SNP)维度。p远大于n(高维)。X ∈ ℝ^(n×p): 训练数据的特征矩阵。每行是一个样本,每列是一个 SNP。y ∈ ℝ^n: 训练数据的响应向量(如身高、BMI)。β ∈ ℝ^p: 真实的、未知的回归系数向量(遗传效应)。ε ∈ ℝ^n: 独立同分布的噪声,均值为 0,方差为 σ²。Σ ∈ ℝ^(p×p): 特征(SNP)的总体协方差矩阵(LD 矩阵)。这是本文的核心研究对象。Σ̂: 基于训练数据X的样本协方差矩阵。Σ̃: 基于外部参考面板的协方差矩阵估计量。λ: 岭回归的正则化参数。β̂(λ): 岭回归估计量,β̂(λ) = (X^T X + nλ I_p)^{-1} X^T y。R(β̂): 预测风险,定义为E[(x_new^T β̂ - x_new^T β)^2],其中x_new是一个独立于训练数据的新样本。B: 分块的数量。每个块的大小为p_b,b = 1, ..., B,且∑ p_b = p。Σ_b: 第b个块的协方差矩阵(大小为p_b × p_b)。β_b: 第b个块的回归系数向量。
-
模型:
- 数据生成机制:
y = Xβ + ε。这是一个标准的线性模型。 - 协方差结构:
Σ是一个块对角矩阵,即Σ = diag(Σ_1, ..., Σ_B)。这意味着不同块之间的特征(SNP)是不相关的。这是本文的核心假设。 - 随机设计:
X的行是独立同分布地从N(0, Σ)中抽取的。这是一个常见的假设,使得 RMT 分析成为可能。 - 已知/未知:
Σ的结构(块对角)是已知的,但每个块内的协方差矩阵Σ_b是未知的,需要估计。β是未知的。σ²是未知的。
- 数据生成机制:
-
可观测数据:
- 训练数据:研究者可以观测到
(X, y),即n个样本的特征和响应。这是最理想的情况。 - 参考面板:研究者无法观测到训练数据的
X,但可以访问一个独立的外部数据集X_ref ∈ ℝ^(n_ref × p),其行也是从N(0, Σ)中独立同分布抽取的。这是遗传学中的常见情况,由于隐私限制,无法共享个体水平的基因型数据。 - 想要但观测不到:真实的协方差矩阵
Σ和真实的系数β。研究者只能通过(X, y)或(X_ref)来估计它们。
- 训练数据:研究者可以观测到
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:B=2,每个块的大小 p_1 = p_2 = 1,即 p=2。
在这个特例下:
* 模型:y = X_1 β_1 + X_2 β_2 + ε。X_1 和 X_2 是两个 SNP。
* 协方差矩阵:Σ = [[1, 0], [0, 1]]。这是一个 2x2 的单位矩阵,块对角结构退化为完全独立。这是最简单的块对角情况。
* 可观测数据:X 是 n×2 的矩阵,y 是 n×1 的向量。
现在,我们比较两种估计策略:
-
全协方差估计(Oracle):使用岭回归
β̂_full(λ) = (X^T X + nλ I_2)^{-1} X^T y。它同时使用X_1和X_2的信息,并估计整个 2x2 的协方差矩阵X^T X / n。 -
分块估计:由于我们知道
Σ是块对角的(这里就是对角),我们假设X_1和X_2独立。因此,我们分别对每个 SNP 进行单变量岭回归:β̂_1(λ) = (X_1^T X_1 + nλ)^{-1} X_1^T yβ̂_2(λ) = (X_2^T X_2 + nλ)^{-1} X_2^T y这个估计量等价于使用一个块对角的协方差矩阵估计量diag(X_1^T X_1, X_2^T X_2)来进行岭回归。
核心问题: 在这个 p=2, Σ=I 的完美独立情况下,分块估计和全协方差估计的预测风险 R(β̂) 是否相同?
直觉与答案: 直觉上,既然 X_1 和 X_2 独立,分块估计似乎不应该有损失。但本文的结论(及其背后的 RMT)告诉我们:即使在这种情况下,分块估计也可能显著劣于全协方差估计。
为什么? 关键在于高维性。当 n 固定而 p 增长时(这里 p=2 很小,但可以想象 p 很大),样本协方差矩阵 X^T X / n 的特征值会发生扭曲(Marchenko-Pastur 定律)。全协方差估计通过使用整个矩阵,可以“借用”不同特征的信息来更好地进行正则化(即选择 λ)。而分块估计则失去了这种“跨块”的借用能力,每个块的估计只依赖于该块内非常有限的信息。
更具体地说,在 Dobriban & Wager (2018) 的框架下,最优的岭回归正则化参数 λ 依赖于整个协方差矩阵的谱。分块估计相当于对每个块独立地选择 λ,这通常不是全局最优的。即使块间独立,每个块内样本协方差矩阵的谱也会受到高维噪声的影响,而全协方差估计可以通过其整体谱来更有效地“平均”掉这些噪声。
这个最小内核揭示了本文的核心发现:分块估计的代价并非源于忽略了块间相关性,而是源于放弃了利用全协方差矩阵的谱信息进行更优正则化的能力。 这个代价在高维下是显著的,并且与块的大小和信号强度有关。本文的一般理论就是对这个直觉的严格数学化,并推广到任意块大小和块内相关结构。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高维线性预测模型(无稀疏性假设)中,当协方差矩阵具有块对角结构时,系统分析了两种常见估计策略——分块估计(假设块间独立)和参考面板估计(用外部数据估计协方差)——的预测性能,并与使用全协方差矩阵的“Oracle”方法进行比较。
- 核心工具/方法:基于 Dobriban & Wager (2018) 的精确渐近框架,结合针对块对角协方差矩阵的随机矩阵理论新结果(如块对角样本协方差矩阵的 Stieltjes 变换的极限行为),推导了不同估计量下岭回归预测风险的显式极限表达式。
- 主要结论:① 即使协方差矩阵是完美块对角的,分块估计的预测精度也可能显著劣于全协方差估计,其代价取决于块大小、块内相关性和信号强度。② 基于训练数据和基于外部参考面板的估计在高维下性能差异很大,反映了仅使用汇总级数据的代价。③ 这些理论发现通过模拟和 UK Biobank 真实数据得到验证。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 核心假设:
- 块对角协方差:
Σ = diag(Σ_1, ..., Σ_B)。这是贯穿全文的核心结构假设。 - 随机设计:
X的行独立同分布,均值为 0,协方差为Σ。具体分布可以是次高斯的,但为了 RMT 分析,通常假设为高斯或满足某些矩条件。 - 无稀疏性:
β是固定的,不假设其稀疏。这是与许多遗传预测方法的关键区别。 - 比例极限:
n, p, p_b → ∞,且p/n → γ ∈ (0, ∞),p_b / p → c_b ∈ (0, 1)。这是高维渐近分析的标准框架。 - 参考面板独立性:参考面板
X_ref与训练数据(X, y)独立,且来自相同的分布N(0, Σ)。
- 块对角协方差:
- 相比已有文献的强化/放宽:
- 强化:相比 Dobriban & Wager (2018) 假设协方差矩阵已知或可精确估计,本文明确建模了协方差矩阵的估计过程(分块估计、参考面板估计),并分析了其影响。
- 放宽:相比许多遗传预测方法(如 LDpred)假设效应稀疏,本文不要求稀疏性,因此结论更一般,但也可能不直接适用于稀疏场景。
- 新设定:本文首次在 Dobriban & Wager (2018) 的框架下,系统引入了块对角结构和参考面板这两个遗传学中的关键元素。
主要结果¶
本文的核心是理论结果,通过几个定理来阐述。由于是理论型论文,我们重点拆解其数学贡献。
-
定理 1(分块估计的预测风险):
- 陈述:在给定假设下,分块岭回归估计量的预测风险
R_block收敛到一个确定的极限R_block(λ, γ, {c_b}, {Σ_b}, β)。这个极限可以通过求解一个关于 Stieltjes 变换的方程组得到。 - 直觉:这个极限表达式明确显示了分块估计的预测风险依赖于每个块的局部性质(块大小
c_b、块内协方差Σ_b、块内信号β_b),而不依赖于块间的任何信息(因为假设块间独立)。 - 必要条件:需要知道每个块内的谱分布和信号强度。
- 解决的技术难点:推导块对角样本协方差矩阵的 Stieltjes 变换的极限。由于块间独立,整个矩阵的 Stieltjes 变换可以表示为每个块 Stieltjes 变换的加权和,但每个块的 Stieltjes 变换本身又依赖于该块内样本协方差矩阵的谱,这需要用到 RMT 中的“确定性等价”技巧。
- 陈述:在给定假设下,分块岭回归估计量的预测风险
-
定理 2(全协方差估计的预测风险):
- 陈述:在相同假设下,使用全样本协方差矩阵
Σ̂的岭回归估计量的预测风险R_full收敛到极限R_full(λ, γ, Σ, β)。这个极限与 Dobriban & Wager (2018) 的结果一致,但这里Σ是块对角的。 - 直觉:全协方差估计利用了全局的谱信息。即使
Σ是块对角的,Σ̂的谱也会受到所有块的影响,因此R_full依赖于整个Σ的谱分布和整个β的范数。 - 对比:通过比较
R_block和R_full,作者可以量化分块估计的代价。关键发现是,即使Σ是完美块对角的,R_block也可能远大于R_full,因为分块估计无法利用跨块的谱信息来优化正则化。
- 陈述:在相同假设下,使用全样本协方差矩阵
-
定理 3(参考面板估计的预测风险):
- 陈述:当使用基于独立参考面板
X_ref的协方差估计量Σ̃时,岭回归的预测风险R_ref收敛到极限R_ref(λ, γ, γ_ref, Σ, β),其中γ_ref = p / n_ref。 - 直觉:这个极限揭示了参考面板估计的代价。它依赖于参考面板的样本量
n_ref(通过γ_ref)。当n_ref → ∞时,Σ̃ → Σ,R_ref趋近于使用真实Σ的 Oracle 风险。当n_ref有限时,R_ref会大于 Oracle 风险,反映了估计Σ的误差。 - 关键发现:作者发现,即使
n_ref很大,R_ref也可能显著大于R_full(使用训练数据X的Σ̂)。这是因为Σ̃是独立于y的,而Σ̂与y相关(通过X),这种相关性在高维下可以被利用来降低预测风险。这揭示了“仅使用汇总级数据”的根本代价。
- 陈述:当使用基于独立参考面板
证明路线与技术技巧¶
-
整体路线:
- 建立预测风险的表达式:从 Dobriban & Wager (2018) 的框架出发,将岭回归的预测风险
R(β̂)表示为关于样本协方差矩阵S = X^T X / n和真实协方差矩阵Σ的迹函数。 - 引入 Stieltjes 变换:将风险表达式转化为关于
S的 Stieltjes 变换m_S(z)的积分。这是 RMT 的标准技巧。 - 推导 Stieltjes 变换的极限:这是证明的核心。对于分块估计,需要推导块对角样本协方差矩阵的 Stieltjes 变换的极限。作者利用块间独立性,将问题分解为对每个块独立应用 RMT 结果,然后通过加权平均得到全局极限。对于参考面板估计,需要处理两个独立的样本协方差矩阵(一个来自训练数据,一个来自参考面板),这需要更复杂的联合分析。
- 计算极限风险:将极限 Stieltjes 变换代入风险表达式,得到预测风险的显式极限公式。
- 比较与数值验证:通过比较不同估计量的极限风险公式,得出理论结论。通过模拟和真实数据验证这些理论预测。
- 建立预测风险的表达式:从 Dobriban & Wager (2018) 的框架出发,将岭回归的预测风险
-
关键跳跃点:
- 处理块对角结构下的 Stieltjes 变换:对于一般的块对角矩阵,其 Stieltjes 变换不能简单地分解为各块 Stieltjes 变换的和,因为求逆操作会引入块间的耦合。作者的关键技巧是利用块间独立性,证明在极限下,这种耦合消失,整个矩阵的 Stieltjes 变换确实可以表示为各块 Stieltjes 变换的加权和。这个“去耦合”的证明是技术难点。
- 处理参考面板的联合渐近:当同时使用训练数据
X和参考面板X_ref时,需要分析一个涉及两个独立 Wishart 矩阵的复杂表达式。作者可能使用了矩阵扰动理论或自由概率论中的技巧来推导其极限谱分布。
-
技术技巧点名:
- Stieltjes 变换:核心工具,用于分析样本协方差矩阵的谱。
- Marchenko-Pastur 定律及其推广:用于描述样本协方差矩阵的极限谱分布。
- 确定性等价:用确定性矩阵(如
Σ)的 Stieltjes 变换来近似随机矩阵(如S)的 Stieltjes 变换的期望。 - 迹恒等式与矩阵微积分:用于将风险表达式与 Stieltjes 变换联系起来。
- 块矩阵求逆公式:可能用于分析块对角矩阵的逆的结构。
真实例子与应用¶
本文包含真实数据例子。
- 数据/场景:UK Biobank 数据。这是一个大型生物医学数据库,包含约 50 万英国参与者的遗传和健康信息。作者使用了其中一部分数据来构建预测模型。
- 如何应用:作者将 UK Biobank 数据划分为训练集和测试集。他们模拟了不同的场景:
- 场景 A(全数据):使用训练集的全部 SNP 和个体水平数据,计算全协方差矩阵
Σ̂并进行岭回归。 - 场景 B(分块):根据预设的 LD 块(如基于遗传图谱),将 SNP 分块,在每个块内独立进行岭回归。
- 场景 C(参考面板):假设无法访问训练集的个体水平数据,只能使用一个独立的参考面板(从 UK Biobank 的另一部分数据中抽取)来估计每个 LD 块内的协方差矩阵,然后基于这些估计和训练集的汇总统计量(如 GWAS 摘要)进行预测。
- 场景 A(全数据):使用训练集的全部 SNP 和个体水平数据,计算全协方差矩阵
- 结果:
- 与理论预测一致,全协方差估计(场景 A)的预测精度通常最高。
- 分块估计(场景 B)的精度显著低于全协方差估计,即使 LD 块的定义是合理的。这个差距随着块数量的增加(即块变小)而扩大。
- 参考面板估计(场景 C)的精度介于两者之间,但通常低于全协方差估计。当参考面板样本量较小时,精度下降尤为明显。
- 这个例子想说明什么:这个真实数据例子旨在验证本文的理论发现,并展示其在实际遗传学数据中的相关性。它向实践者传达了一个重要信息:即使 LD 结构是块对角的,简单地分块处理也可能导致预测精度损失,而使用全协方差矩阵(如果可行)或足够大的参考面板是更优的选择。
🔎 结论是否比证明窄¶
这是一个需要仔细核验的问题。作者在引言和结论中做出了一些一般性断言,例如“blockwise estimation methods...can be substantially less accurate than methods controlling for the whole covariance matrix”。这个结论在无稀疏性假设和随机设计下是严格证明的。然而,它是否适用于以下情况,作者并未证明,只是推测或回避:
- 稀疏效应:当真实
β非常稀疏时,分块方法(如 LDpred)可能通过引入先验(如混合正态分布)来有效利用稀疏性,从而可能优于没有稀疏性假设的全协方差岭回归。本文的结论不直接适用于这类稀疏方法。 - 非随机设计:如果
X的行不是独立同分布的(例如,存在群体分层),本文的 RMT 分析可能不成立。 - 块间弱相关:作者假设块间严格独立。如果块间存在微弱的残余相关性,分块估计的代价可能会被高估或低估。作者在结论中承认这是一个“limitation”,但未给出理论分析。
因此,本文的结论是严格在其假设框架内的。将其泛化到更广泛的遗传预测实践中时,需要谨慎。
四、开放问题¶
-
稀疏性下的理论分析:本文的分析在“无稀疏性”假设下进行。一个自然的开放问题是:当真实效应
β是稀疏的时,分块估计(如 LDpred)与全协方差估计(如稀疏岭回归或弹性网)的性能比较如何?能否在 Dobriban & Wager 的框架中引入稀疏性,或者需要全新的理论工具?(扎根于:作者在引言中承认“sparsity-based methods are also popular”,但选择不分析它们。) -
块间弱相关的影响:本文假设块间严格独立。在实际遗传学中,LD 块的定义是模糊的,块间存在微弱的残余相关性。一个重要的开放问题是:这种弱相关如何影响分块估计的代价?是否存在一个“容忍度”,使得当块间相关性低于某个阈值时,分块估计的损失可以忽略?(扎根于:作者在结论中提及“the block boundaries are not always well-defined”,并将其列为“limitation”。)
-
最优分块策略:本文证明了分块会带来代价,但并未给出如何选择块大小或分块方式以最小化这个代价的指导。是否存在一个依赖于
n,p,Σ和β的最优分块策略?这可能需要一个更复杂的优化问题。(扎根于:本文的定理 1 给出了给定分块下的风险,但未优化分块本身。) -
计算-统计权衡的视角:本文揭示了分块估计的统计代价。但分块估计的主要动机之一是计算可行性(处理全
p×p矩阵在p极大时不可行)。一个有趣的开放问题是:能否从计算-统计权衡的角度来刻画这个问题?即,给定一个计算预算(如最大可处理的矩阵大小),是否存在一个最优的分块策略,使得在计算约束下统计风险最小?这需要将本文的 RMT 结果与计算复杂度模型(如张量收缩成本)结合起来。(扎根于:本文的引言提到了计算挑战,但未进行理论分析。这与研究者的“statistical-computational tradeoff”兴趣直接相关。)
Maintained by 陈星宇 · Homepage · Source on GitHub