跳转至

Limiting eigen-structure of spiked sample covariance matrices under missing observations

作者: Haotian Cheng, Huiqin Li, Yanqing Yin, Zhixiang Zhang
主题: 高维统计 / 随机矩阵
相关性: 8/10
链接: https://arxiv.org/abs/2608.09135


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是高维 spiked 协方差矩阵的特征结构(特征值与特征向量)的渐近行为。核心问题是:当数据维度 \(p\) 与样本量 \(n\) 可比(\(p/n \to c \in (0,\infty)\))时,样本协方差矩阵的特征值和特征向量如何依赖于总体协方差矩阵中那些“突出”的(spiked)特征值?这个方向已经发展出成熟的相变理论(BBP 相变)、特征值中心极限定理(CLT)和特征向量渐近理论,但绝大多数工作假设数据是完全观测的。本文的贡献在于将这一理论框架推广到数据随机缺失(MCAR) 的场景下。

发展脉络(history)

  1. 奠基工作:Johnstone (2001) 与 BBP 相变

    • Johnstone (2001) 提出了 spiked 总体模型:\(\boldsymbol{\Sigma} = \operatorname{diag}\{\alpha_1, \ldots, \alpha_N, 1, \ldots, 1\}\),其中 \(N\) 个“spike”特征值远大于 1。他研究了最大样本特征值的分布,并发现了与 Tracy-Widom 分布的联系。
    • Baik, Benarous & Péché (2005) 发现了著名的 BBP 相变:当 spike 强度 \(\alpha > 1 + \sqrt{c}\) 时,对应的样本特征值会“跳出”谱的支撑集,其极限分布由 Tracy-Widom 变为 Gaussian;否则它会“淹没”在谱的 bulk 中。这个相变阈值是后续所有工作的基石。
  2. 特征值渐近理论的完善:Bai-Yao 与 Baik-Silverstein

    • Baik & Silverstein (2006) 严格证明了样本 spiked 特征值的几乎必然极限,建立了 spike 到样本特征值的映射 \(\psi(\alpha) = \alpha (1 + c/(\alpha-1))\)(在 identity bulk 情形下)。
    • Bai & Yao (2008, 2012) 做了两个关键推广:① 将总体协方差矩阵推广到块对角结构\(\boldsymbol{\Sigma} = \operatorname{diag}(\boldsymbol{\Sigma}_N, \boldsymbol{\Sigma}_S)\)),其中 \(\boldsymbol{\Sigma}_S\) 的谱分布收敛到某个一般分布 \(H\);② 建立了远距离 spike(distant spikes) 的样本特征值的中心极限定理(CLT),并引入了关键的判别函数 \(\psi'(\tilde{\alpha}_k) > 0\) 来区分“远距离”和“闭合”spike。本文的记号和方法大量继承自 Bai & Yao。
  3. 特征向量渐近理论:Paul 与后续发展

    • Paul (2007) 首次在 Gaussian 数据下研究了 spiked 样本特征向量的渐近行为。
    • Johnstone & Yang (2018) 以非 Gaussian 模型(Bai-Yao 框架)整理了特征向量内积和投影的渐近正态性,为后续工作提供了标准参考。
    • Bao, Ding, Wang & Wang (2022) 在更一般的条件下(允许多重 spike、无上界)推导了特征值和特征向量广义分量的联合分布,并应用于多种假设检验问题。
  4. 当前 Frontier 与本文位置

    • Zhang, Zheng, Pan & Zhong (2022) 去掉了块对角假设,证明了 spiked 特征值与线性谱统计量的渐近独立性,并提出了更一般的协方差矩阵检验。
    • Li, Pan, Yin & Zhou (2024) 是本文最关键的“跳板”。他们研究了缺失数据下 Gram 矩阵的谱分析,建立了 Marchenko-Pastur 定律的推广、线性谱统计量的 CLT 以及特征值的精确分离结果。本文直接引用了他们的结果(Theorem 2.1, 2.2, 2.3 in [13])作为技术基础。
    • 本文的位置:在 Li et al. (2024) 建立的缺失数据谱分析框架之上,首次将 Bai-Yao 的 spiked 模型特征值/特征向量渐近理论推广到缺失数据场景。它不是提出全新的数学工具,而是将现有工具(扰动分析、二次型 CLT)与缺失数据下的新谱结构相结合,推导出修正后的极限参数。

子线索聚类

  1. 完整数据下的特征值渐近:Johnstone (2001), Baik & Silverstein (2006), Bai & Yao (2008, 2012), Jiang & Bai (2021), Zhang et al. (2022)。这一簇关注 spike 到样本特征值的映射、相变、CLT 和渐近独立性。
  2. 完整数据下的特征向量渐近:Paul (2007), Johnstone & Yang (2018), Bao et al. (2022), Morales-Jimenez et al. (2021)。这一簇关注特征向量内积、投影的极限和联合分布。
  3. 缺失数据下的谱分析:Li et al. (2024)。这一簇目前只有这一篇核心工作,它为缺失数据下的 Gram 矩阵提供了谱分布、CLT 和分离结果,是本文的“基础设施”。
  4. 应用:独立性检验:Bodnar, Dette & Parolya (2019)。本文在应用部分与他们的统计量 \(T_W\)\(T_{LH}\) 进行了比较。

这个方向在追问的核心问题

  1. 相变阈值如何被缺失数据改变? 经典 BBP 相变阈值 \(\alpha = 1 \pm \sqrt{c}\) 在缺失数据下会变成什么?本文的 \(\psi'(\tilde{\alpha}_k) > 0\) 条件给出了一个隐式定义,但未给出显式表达式。
  2. 缺失数据如何影响特征值和特征向量的极限参数(偏移量、方差)? 本文的核心贡献就是回答这个问题:极限方差和协方差结构都依赖于缺失概率 \(\theta_i\) 和缺失指示变量的四阶矩。
  3. 如何基于这些理论进行有效的统计推断? 本文提出了一个独立性检验作为应用,但更一般的推断问题(如 spike 数量的估计、置信区间构造)仍是开放的。

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 为“尽管高维 PCA 在缺失数据下应用广泛,但其理论行为(尤其是 spiked 模型下的特征结构)尚未被研究”。他们声称这是“novel approach”,并强调“limiting parameters differ substantially from those in the complete data case”。
  • 被淡化/回避的竞争路线
    • 插补方法:作者在引言中明确提到“imputation methods often fail to fully preserve the underlying structure”,从而一笔带过。他们没有与任何具体的插补方法(如矩阵补全、EM 算法)进行理论或数值比较。
    • 更一般的缺失机制:本文假设 MCAR(完全随机缺失),且缺失概率 \(\theta_i\) 仅依赖于维度 \(i\),不依赖于数据值。这是最强的缺失假设。作者没有讨论如何推广到 MAR(随机缺失)或 MNAR(非随机缺失)。
    • 非独立成分结构:本文假设数据有独立成分结构(\(\mathbf{x} = \boldsymbol{\Sigma}^{1/2} \tilde{\mathbf{x}}\)\(\tilde{\mathbf{x}}\) 的 entries i.i.d.)。这是 RMT 的标准假设,但在实际数据中可能不成立。
  • 什么明显该被引/该存在、却没出现在 intro 里?
    • 关于缺失数据下 PCA 的实证或算法文献:例如,Probabilistic PCA (PPCA) 及其缺失数据变体、基于 SVD 的矩阵补全方法。这些是更“实用”的路线,作者完全回避了。
    • 关于非随机缺失(MNAR)下协方差估计的识别性文献:如果缺失机制依赖于未观测到的数据,协方差矩阵本身可能不可识别。这是一个更根本的挑战,但本文未触及。

张力

未见明显对立引用。所有被引工作都在逐步放宽假设、完善理论,彼此之间是互补而非矛盾的关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(p\): 总体维度。
    • \(n\): 样本量。
    • \(N\): spiked 部分的维度(固定常数)。
    • \(S = p - N\): 非 spiked(bulk)部分的维度。
    • \(c_n = p/n\), \(c = \lim_{n\to\infty} c_n\): 维度-样本量比。
    • \(\mathbf{x} \in \mathbb{R}^p\): 潜在(complete)数据,均值为 0,协方差为 \(\boldsymbol{\Sigma}\)
    • \(\boldsymbol{\Sigma}\): 总体协方差矩阵,块对角结构 \(\operatorname{diag}(\boldsymbol{\Sigma}_N, \boldsymbol{\Sigma}_S)\)
    • \(\mathbf{b} \in \{0,1\}^p\): 缺失指示向量,\(b_i \sim \operatorname{Ber}(\theta_i)\),独立于 \(\mathbf{x}\)
    • \(\mathbf{y} = \mathbf{b} \circ \mathbf{x}\): 实际观测到的数据(Hadamard 乘积)。
    • \(\tilde{\boldsymbol{\Sigma}} = \operatorname{Cov}(\mathbf{y})\): 观测数据的协方差矩阵。它与 \(\boldsymbol{\Sigma}\) 的关系是 \(\tilde{\boldsymbol{\Sigma}} = \mathbf{P}\boldsymbol{\Sigma}\mathbf{P} + (\mathbf{P} - \mathbf{P}^2) \circ \boldsymbol{\Sigma}\),其中 \(\mathbf{P} = \operatorname{diag}(\theta_1, \ldots, \theta_p)\)
    • \(\tilde{\alpha}_1 > \ldots > \tilde{\alpha}_K\): \(\tilde{\boldsymbol{\Sigma}}_N\) 的“远距离 spike”特征值(多重性 \(n_k\))。
    • \(\lambda_{n,1} \ge \ldots \ge \lambda_{n,p}\): 样本协方差矩阵 \(\mathbf{S}_n = \frac{1}{n} \mathbf{Y}\mathbf{Y}^T\) 的特征值。
    • \(\boldsymbol{\beta}_j\): 对应 \(\lambda_{n,j}\) 的样本特征向量。
    • \(\mathbf{u}_k\): 对应 \(\tilde{\alpha}_k\) 的总体特征向量(\(\tilde{\boldsymbol{\Sigma}}\) 的)。
    • \(\psi(\tilde{\alpha})\): spike 到样本特征值的极限映射函数(见公式 2.1)。
    • \(F_{c,H}\): \(\mathbf{S}_{22} = \frac{1}{n} \mathbf{Y}_S \mathbf{Y}_S^T\) 的极限谱分布(LSD),其中 \(H\)\(\tilde{\boldsymbol{\Sigma}}_S\) 的 LSD。
  • 模型

    • Spiked Population Model\(\boldsymbol{\Sigma} = \operatorname{diag}(\boldsymbol{\Sigma}_N, \boldsymbol{\Sigma}_S)\)\(\boldsymbol{\Sigma}_N\)\(N\) 个“大”特征值(spikes),\(\boldsymbol{\Sigma}_S\) 的谱分布收敛到某个分布 \(H\)(bulk)。
    • 缺失机制MCAR(完全随机缺失)。每个维度 \(i\) 的观测与否由一个独立的 Bernoulli 变量 \(b_i \sim \operatorname{Ber}(\theta_i)\) 决定,且与数据值 \(\mathbf{x}\) 独立。
    • 数据生成\(\mathbf{Y} = \mathbf{D} \circ (\boldsymbol{\Sigma}^{1/2} \tilde{\mathbf{X}})\),其中 \(\mathbf{D}\)\(p \times n\) 的独立 Bernoulli 矩阵,\(\tilde{\mathbf{X}}\)\(p \times n\) 的 i.i.d. 标准化随机变量矩阵(独立成分结构)。
  • 可观测数据

    • 可观测\(\mathbf{Y}\)\(p \times n\) 矩阵,包含大量零元素,代表缺失)。我们能计算 \(\mathbf{S}_n = \frac{1}{n} \mathbf{Y}\mathbf{Y}^T\) 及其特征值和特征向量。
    • 不可观测(潜在)\(\mathbf{X}\)(完整数据)、\(\boldsymbol{\Sigma}\)(总体协方差)、\(\mathbf{D}\)(缺失指示矩阵)、\(\tilde{\mathbf{X}}\)(标准化随机变量)。我们只能通过假设和模型来推断它们。

第二步:讲最小内核

本文不是“特例推广”型,而是“在更复杂设定下重新推导已知结果”型。其核心数学困难在于:缺失机制破坏了样本协方差矩阵 \(\mathbf{S}_n\) 的简单结构,使得经典的扰动分析(如 Baik-Silverstein 的方法)不能直接应用

最小问题:考虑最简单的 spiked 模型:\(\boldsymbol{\Sigma}_N = \operatorname{diag}(\alpha_1, \ldots, \alpha_N)\)\(\boldsymbol{\Sigma}_S = \mathbf{I}_S\)(identity bulk),且缺失概率对所有维度相同:\(\theta_i = \theta\)。那么,观测数据的协方差矩阵为 \(\tilde{\boldsymbol{\Sigma}} = \operatorname{diag}(\theta \alpha_1, \ldots, \theta \alpha_N, \theta, \ldots, \theta)\)问题:在这个特例下,样本特征值 \(\lambda_{n,1}\) 的极限分布是什么?它与完整数据(\(\theta=1\))下的 Bai-Yao CLT 有何不同?

核心思路: 1. 利用已有结果简化 bulk:Li et al. (2024) 已经给出了缺失数据下 \(\mathbf{S}_{22}\) 的谱分布 \(F_{c,H}\)。在 identity bulk 且均匀缺失下,\(H\) 是一个在 \(\theta\) 处的点质量,\(F_{c,H}\) 就是经典的 Marchenko-Pastur 定律,但参数被缩放。 2. 将问题转化为对 \(\mathbf{A}_n(\lambda)\) 的分析:通过行列式恒等式,spiked 特征值问题等价于求解 \(|\lambda \mathbf{I}_N - \mathbf{A}_n(\lambda)| = 0\),其中 \(\mathbf{A}_n(\lambda) = \frac{1}{n} \mathbf{Y}_N [\mathbf{I}_n + \mathbf{B}_n(\lambda)] \mathbf{Y}_N^T\)。这里 \(\mathbf{B}_n(\lambda)\) 只依赖于 bulk 部分 \(\mathbf{Y}_S\)。 3. 分解 \(\mathbf{A}_n(\lambda)\):将 \(\mathbf{A}_n(\lambda)\) 分解为确定性部分和随机部分:

\[\mathbf{A}_n(\lambda) = \underbrace{\frac{1}{\sqrt{n}} \mathbf{C}_n(\lambda)}_{\text{随机波动}} + \underbrace{[1 + c f_1(\lambda)] \tilde{\boldsymbol{\Sigma}}_N}_{\text{确定性主项}} + o_{a.s.}(1)\]
其中 \(f_1(\lambda) = \int \frac{x}{\lambda - x} dF_{c,H}(x)\)。这个分解是 Bai-Yao 框架的核心,本文的关键在于证明它在缺失数据下仍然成立,但 \(\tilde{\boldsymbol{\Sigma}}_N\)\(F_{c,H}\) 都已被缺失机制改变。 4. 证明 \(\mathbf{C}_n(\lambda)\) 的 CLT\(\mathbf{C}_n(\lambda)\) 是一个 \(N \times N\) 的随机矩阵,其元素是二次型。本文的 Lemma 6.1 是一个关键的 CLT,它给出了这种二次型在缺失数据下的联合渐近正态性,其协方差结构依赖于缺失概率 \(\theta_i\) 和数据四阶矩。 5. 扰动分析:一旦 \(\mathbf{A}_n(\lambda)\) 的渐近行为已知,就可以用标准的矩阵扰动理论(如 Lemma 6.4)来推导样本特征值 \(\lambda_{n,j}\) 和特征向量 \(\boldsymbol{\beta}_j\) 的极限分布。特征值的极限偏移由 \(\psi(\tilde{\alpha}_k)\) 给出,方差则由 \(\mathbf{C}_n(\lambda)\) 的协方差结构决定。

一句话总结:本文的核心数学操作是将 Bai-Yao 的“完整数据”扰动分析框架,嫁接到 Li et al. (2024) 的“缺失数据”谱分析结果上,从而得到修正后的极限参数。所有的新颖性都体现在这些参数如何被 \(\theta_i\)\(\mathbf{D}\) 的矩所改变。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在数据完全随机缺失(MCAR)的高维 spiked 总体模型下,样本协方差矩阵的远距离 spiked 特征值和特征向量的渐近行为(几乎必然极限、中心极限定理)。
  2. 核心工具/方法:利用 Li et al. (2024) 关于缺失数据下 Gram 矩阵谱分析的结果,将 Bai & Yao (2008, 2012) 的扰动分析框架(特别是 \(\mathbf{A}_n(\lambda)\) 分解和二次型 CLT)推广到缺失数据场景。
  3. 主要结论:远距离 spiked 特征值和特征向量仍具有渐近正态性,但其极限参数(如 \(\psi(\tilde{\alpha}_k)\)、方差 \(\sigma^2\)、协方差矩阵 \(\boldsymbol{\Gamma}_k\))与完整数据情形有显著差异,这些差异由缺失概率 \(\theta_i\) 和缺失指示变量的四阶矩刻画。基于此,提出了一个检验两组变量独立性的方法。

关键设定与假设

  • Assumption (a)\(p/n \to c \in (0, \infty)\)。标准的高维渐近设定。
  • Assumption (b):数据有有限四阶矩\(\mathbb{E}(x_{ij}^4) < \infty\))。比 Bai & Yao (2008) 的假设强,但比 Jiang & Bai (2021) 的“tail probability decay”弱。
  • Assumption (c):非 spiked 部分的谱分布 \(H_n\) 弱收敛到 \(H\),且 \(\|\boldsymbol{\Sigma}\|\) 有界。这是 RMT 的标准假设。
  • Assumption (d)远距离 spike 条件\(\tilde{\alpha}_k\)\(H\) 的支撑集之外,且 \(\psi'(\tilde{\alpha}_k) > 0\)。这是 Bai-Yao 框架的核心,它保证了对应的样本特征值会“跳出” bulk,从而可被可靠地检测和分析。相比完整数据,这里的 \(\psi(\cdot)\)\(H\) 都已被缺失机制改变
  • Assumption (e)(仅用于特征向量结果):\(\tilde{\boldsymbol{\Sigma}}_N\) 的特征值都是单根(simple)。这是为了简化特征向量扰动分析,避免处理多重特征值带来的复杂性。

主要结果

  1. Proposition 2.1(几乎必然收敛):远距离 spiked 样本特征值 \(\lambda_{n,j}\) 几乎必然收敛到 \(\psi(\tilde{\alpha}_k)\)。这个映射 \(\psi(\cdot)\) 的形式与完整数据相同,但其中的 \(H\) 是缺失数据下 bulk 的 LSD。当 \(\psi'(\tilde{\alpha}_k) \le 0\) 时,样本特征值会收敛到 bulk 支撑集的边界。
  2. Theorem 2.5(特征值 CLT)\(\sqrt{n}(\lambda_{n,j} - \psi(\tilde{\alpha}_k))\) 的联合分布收敛到一个由 Gaussian 随机矩阵 \(\mathbf{C}(\psi(\tilde{\alpha}_k))\) 的特征值决定的分布。关键差异:协方差函数中出现了 \(\mathbb{E}(d_{j1} d_{s1} d_{\ell 1} d_{t1} x_{j1} x_{s1} x_{\ell 1} x_{t1})\) 项,这混合了缺失指示变量 \(\mathbf{D}\) 和数据 \(\mathbf{X}\) 的矩。在完整数据下,\(d_{ij} \equiv 1\),此项退化为 \(\mathbb{E}(x_{j1} x_{s1} x_{\ell 1} x_{t1})\)
  3. Theorem 2.8(特征向量内积极限):样本特征向量 \(\boldsymbol{\beta}_k\) 与总体特征向量 \(\mathbf{u}_k\)平方内积 \(\langle \boldsymbol{\beta}_k, \mathbf{u}_k \rangle^2\) 几乎必然收敛到 \(1 / (1 + c f_2(\psi(\tilde{\alpha}_k)) \tilde{\alpha}_k)\)。这个形式与完整数据相同,但 \(f_2(\cdot)\)\(\tilde{\alpha}_k\) 已被缺失机制改变。
  4. Theorem 2.9(特征向量 CLT)\(\sqrt{n}(\boldsymbol{a}_k - \mathbf{e}\mathbf{v}_k)\) 渐近正态,均值为 0,协方差矩阵为 \(\boldsymbol{\Gamma}_k\)关键差异\(\boldsymbol{\Gamma}_k\) 中出现了 \(\mathbf{C}_k\) 矩阵,其元素 \(C_{ij}^k = \sum_{s,t} \tilde{v}_{ks} \tilde{v}_{kt} \mathbb{E}(y_{i1} y_{s1} y_{j1} y_{t1})\),再次混合了缺失和数据矩。

证明路线与技术技巧

  • 整体路线

    1. 谱分离:利用 Li et al. (2024) 的精确分离结果,将 spiked 特征值问题与 bulk 部分解耦。
    2. 矩阵分解:将 \(\mathbf{S}_n\) 的特征值问题转化为 \(\mathbf{A}_n(\lambda)\) 的特征值问题,并将 \(\mathbf{A}_n(\lambda)\) 分解为确定性主项和随机波动项。
    3. 二次型 CLT:证明随机波动项 \(\mathbf{C}_n(\lambda)\) 的联合渐近正态性(Lemma 6.1),这是整个证明的技术核心。
    4. 扰动分析:利用矩阵扰动引理(Lemma 6.4),从 \(\mathbf{A}_n(\lambda)\) 的渐近行为推导出特征值和特征向量的极限分布。
    5. Delta 方法:将特征向量的结果从 \(\boldsymbol{a}_k\) 变换到 \(\mathbf{e}\mathbf{V}^T \boldsymbol{a}_k\)
  • 关键跳跃点

    • \(\mathbf{S}_n\)\(\mathbf{A}_n(\lambda)\):通过行列式恒等式 \(|\lambda \mathbf{I}_p - \mathbf{S}_n| = |\lambda \mathbf{I}_S - \mathbf{S}_{22}| \cdot |\lambda \mathbf{I}_N - \mathbf{S}_{11} - \mathbf{S}_{12}(\lambda \mathbf{I}_S - \mathbf{S}_{22})^{-1} \mathbf{S}_{21}|\),将问题从 \(p\) 维降到 \(N\) 维(\(N\) 是固定常数)。这是 Bai-Yao 框架的标准技巧。
    • 证明 \(\mathbf{C}_n(\lambda)\) 的 CLT:Lemma 6.1 的证明是本文最吃功夫的地方。它需要处理缺失数据带来的复杂矩结构。证明思路是:将二次型 \(\boldsymbol{\xi}_l^T \mathbf{M} \boldsymbol{\eta}_l\) 的 CLT 转化为对特征函数的分析,利用截断、中心化、鞅差序列的 CLT 等标准 RMT 技巧。难点在于协方差矩阵 \(G\) 的推导,它包含了 \(\tau\)(对角元素平方的极限)和 \(\nu\)(迹平方的极限)的复杂组合,并且依赖于缺失指示变量的四阶矩。
    • 处理 \(\mathbf{T}_{k2}\)\(\mathbf{A}_n(\lambda_{n,k}) - \mathbf{A}_n(\psi_n(\tilde{\alpha}_k))\):这个差项涉及 \(\lambda_{n,k} - \psi_n(\tilde{\alpha}_k)\),而后者正是我们要找的极限分布。证明的关键是证明 \(\mathbf{T}_{k2} = o_{a.s.}(1)\),从而在扰动分析中可以忽略它。这需要用到 Proposition 2.1(\(\lambda_{n,k}\) 的 a.s. 收敛)和 resolvent 恒等式(公式 5.14)。
  • 技术技巧点名

    • Skorokhod strong representation:在证明 Theorem 2.5 时,作者用 Skorokhod 表示将 \(\mathbf{C}_n(\psi(\tilde{\alpha}_k))\) 的依分布收敛转化为几乎必然收敛,从而可以在同一个概率空间上进行代数运算。
    • Borel-Cantelli 引理:用于证明 \(\mathbf{T}_{k1}\) 的几乎必然收敛(公式 5.12 附近),需要用到 Lemma 6.3 给出的矩不等式来证明级数可和。
    • 矩阵扰动引理(Lemma 6.4):这是 Johnstone & Yang (2018) 的引理,用于从 \(\mathbf{A}_n(\lambda)\) 的扰动推导特征向量的扰动。它给出了特征向量差的一阶近似(\(-\mathbf{D}_k \mathbf{B} \mathbf{v}_k\))和余项界。
    • Resolvent 恒等式:用于处理 \(\mathbf{G}_n(\lambda) - \mathbf{G}_n(\psi)\)\(\lambda \mathbf{G}_n(\lambda) - \psi \mathbf{G}_n(\psi)\) 的差(公式 5.14),这是证明 \(\mathbf{T}_{k2} \to 0\) 的关键。

真实例子与应用

  • 模拟研究(Section 3)

    • 数据\(p=500\)\(\boldsymbol{\Sigma} = \mathbf{D} \operatorname{diag}\{15, 10, 2, \ldots, 2, 1, \ldots, 1\} \mathbf{D}^T\)。有两个 spike(15 和 10),248 个 2,其余为 1。缺失概率 \(1-\theta_i \sim \text{Uniform}(0, 0.5)\)
    • 方法:计算三个统计量 \(T_1\)(标准化后的最大特征值)、\(T_2\)(特征向量内积)、\(T_3\)(标准化后的特征向量分量),并与理论分布(标准正态或常数)比较。
    • 结果:Q-Q 图和表格显示,在不同分布(正态、Gamma、t)和不同样本量(\(n=500, 1000\))下,模拟值与理论值吻合良好,验证了 Theorem 2.5, 2.8, 2.9 的准确性。
    • 目的:验证理论结果在有限样本下的近似精度,并展示其对非 Gaussian 分布的稳健性。
  • 应用:独立性检验(Section 4)

    • 问题:检验两组高维变量(\(\mathbf{x}_N\)\(\mathbf{x}_S\))在缺失数据下是否独立。
    • 方法:基于 Theorem 2.7(特征值 CLT),构造了一个 Wald 型统计量 \(\hat{T}_N\),在原假设下渐近服从 \(\chi^2(N)\) 分布。参数(如 \(\tilde{\alpha}_i\)\(\mathbf{e}\mathbf{v}_i\))用样本估计量替代(如 \(\lambda_i(\mathbf{S}_{11})\)\(\boldsymbol{\beta}_{1i}/\|\boldsymbol{\beta}_{1i}\|\)),并采用数据分裂(一半估计参数,一半计算统计量)来控制估计误差。
    • 结果:模拟显示,\(\hat{T}_N\) 的 empirical size 接近名义水平 0.05,且 empirical power 远高于两个对比方法(\(T_W\)\(T_{LH}\) from Bodnar et al., 2019),尤其是在样本量较大时。
    • 目的:展示理论结果的实际应用价值,并证明其相对于现有方法的优势。

🔎 结论是否比证明窄

  • 。Theorem 2.5 和 2.9 的证明严格依赖于 Assumption (d)\(\psi'(\tilde{\alpha}_k) > 0\),即“远距离 spike”)。对于“闭合 spike”(\(\psi'(\tilde{\alpha}_k) \le 0\)),作者只给出了 Proposition 2.1 和 Theorem 2.8 中的 a.s. 极限(收敛到 bulk 边界或 0),没有给出 CLT。论文的标题和摘要中“limiting eigen-structure”的表述,实际上只覆盖了远距离 spike 的完整渐近理论,闭合 spike 的 CLT 是一个明确的开放问题。
  • 此外,Theorem 2.9 的证明依赖于 Assumption (e)(单根特征值)。对于多重 spike 的情形,特征向量的 CLT 会更复杂,本文未涉及。

四、开放问题

  1. 闭合 spike 的 CLT:当 \(\psi'(\tilde{\alpha}_k) \le 0\) 时,样本特征值收敛到 bulk 支撑集的边界。其极限分布是什么?是 Tracy-Widom 分布还是其他?这扎根于 Proposition 2.1 和 Theorem 2.8 中未给出 CLT 的部分。
  2. 多重 spike 的特征向量 CLT:当 \(\tilde{\boldsymbol{\Sigma}}_N\) 有重特征值时,Theorem 2.9 不适用。此时特征向量的渐近行为如何?这扎根于 Assumption (e) 的限制。
  3. 更一般的缺失机制:本文假设 MCAR。能否将结果推广到 MAR(随机缺失)或更一般的缺失模式?这需要新的识别理论和谱分析工具,扎根于本文对 MCAR 的依赖。
  4. 非独立成分结构:本文假设数据有独立成分结构。如果数据是更一般的次高斯或 heavy-tailed 分布,结果是否仍然成立?这扎根于 Assumption (b) 和独立成分结构假设。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论