跳转至

A BHEP test for multivariate normality on incomplete data

作者: Daniel Gaigall, Philipp Wübbolding
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2607.03335


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:在数据存在缺失值(不完全数据)的情况下,如何检验一个多元随机向量是否服从多元正态分布。多元正态性是许多多元统计方法(如因子分析、结构方程模型、线性判别分析)的基础假设,因此检验其有效性至关重要。经典方法(如BHEP检验)针对的是完整数据,而实际数据集中缺失值普遍存在。该子方向当前处于从“完整数据方法”向“不完全数据专用方法”过渡的早期阶段,成熟度较低,大多数现有工作要么直接丢弃缺失数据(完整案例分析),要么使用插补法,但这些做法都有严重缺陷。

发展脉络(history)

  1. 奠基工作:完整数据下的BHEP检验
  2. Baringhaus & Henze (1988):提出了经典的BHEP检验,基于经验特征函数与正态分布特征函数之间的 \(L^2\) 距离。该检验是仿射不变的(从而分布自由),且对任何偏离正态的备择假设都是一致(consistent)的。这是本工作的直接理论源头。
  3. Ebner & Henze (2020):对基于加权 \(L^2\) 统计量的多元正态性检验进行了全面的综述,总结了该领域在完整数据下的主要进展。

  4. 主要进展:处理缺失数据的朴素尝试及其问题

  5. Aleksi´c & Miloˇsevi´c (2024)这是本文最直接的竞争路线。该工作“revisits the usual BHEP test”并比较了完整案例分析和多种插补方法(如均值/中位数插补)在缺失数据下的表现,并建议了一个bootstrap程序来校准检验水平。作者明确指出:“In general, there is no guarantee that the procedure works.”——即插补后的数据分布与真实分布不同,直接应用完整数据方法需要非常小心。
  6. Tsatsi et al. (2024):通过模拟比较了不同插补方法下多种多元正态性检验的表现,进一步证实了插补法带来的问题。

  7. 当前Frontier:针对特殊缺失模式的专用方法

  8. Tan et al. (2005), Yamada et al. (2015), Kurita & Seo (2022):这三篇工作处理的是特殊的不完全数据情形(如单调缺失、两步缺失),并且检验统计量只基于特定的分布形状参数(偏度或峰度)。这意味着它们只能检测到对正态性的特定偏离,而非一致检验。作者指出:“treat testing for multivariate normality in special incomplete data cases by focusing on specific shape parameters”。

  9. 本文的位置

  10. 本文是第一个针对一般性不完全数据(允许任意缺失模式)提出的一致BHEP检验。它直接处理缺失数据,而不是通过插补或丢弃数据。它通过引入投影方法(projection approach)来增强灵活性和功效,并巧妙地绕过了协方差矩阵估计可能奇异的问题。

子线索聚类

这些被引文献大致落在三条子线索上:

  • 线索一:完整数据下的BHEP检验及其变体(Baringhaus & Henze, 1988; Ebner & Henze, 2020; Henze & Jim´enez-Gamero, 2020; ˇCoupek et al., 2024; Gaigall & W¨ubbolding, 2025)。这一簇的核心是发展基于特征函数的 \(L^2\) 检验,并将其推广到更复杂的设定(如Hilbert空间值数据、函数型数据)。本文的统计量构造直接继承自这一线索。
  • 线索二:缺失数据的处理策略(Aleksi´c & Miloˇsevi´c, 2024; Tsatsi et al., 2024)。这一簇关注的是如何将已有的完整数据检验方法(如BHEP)应用于缺失数据,主要手段是插补或完整案例分析。本文的动机正是源于这些方法的不足。
  • 线索三:针对特殊缺失模式的专用检验(Tan et al., 2005; Yamada et al., 2015; Kurita & Seo, 2022)。这一簇为特定的缺失模式(如单调缺失)和特定的偏离方向(如基于偏度/峰度)设计了检验。本文的目标是提供一个更通用的、对任何偏离都一致的检验。

这个方向在追问的核心问题

  1. 如何构造一个在缺失数据下仍然一致(consistent)的多元正态性检验? 即检验统计量能否检测到任何偏离正态的备择假设,而不仅仅是基于偏度或峰度的特定偏离。
  2. 如何避免因缺失数据导致的协方差矩阵估计奇异问题? 当样本量小于维度或缺失率很高时,完整案例分析或某些估计方法会导致协方差矩阵不可逆,从而使得基于Mahalanobis距离的检验(如经典BHEP)失效。
  3. 如何获得一个可行的临界值? 由于缺失数据破坏了仿射不变性,检验统计量不再是分布自由的,其零分布依赖于未知的缺失机制和参数。因此,需要开发有效的bootstrap程序来逼近临界值。

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将缺口frame为“缺乏一个针对一般不完全数据、且一致(consistent)的多元正态性检验”。他们强调,现有的方法要么是“adaptation of standard procedures”(如插补法,有缺陷),要么是“special incomplete data cases”(如只针对特定缺失模式或特定偏离方向)。因此,本文提出的“BHEP test for multivariate normality especially for the incomplete data case”是“显然的下一步”。
  • 哪些竞争路线被他淡化或回避了:作者明确指出了Aleksi´c & Miloˇsevi´c (2024)的不足(插补法的问题),并在模拟中与之对比。但他们回避了高维情形\(d > n\))的深入讨论。虽然他们声称方法在“dimension is large”时也适用,但定理的证明依赖于协方差矩阵的正定性(Assumption 1),且估计量 \(\hat{\Sigma}_n\)\(d > n\) 时必然是奇异的。他们通过使用矩阵根(matrix root)来“circumvent the problem of singular covariance matrix estimates”,但并未从理论上证明在高维下检验统计量的渐近性质(如收敛速度、功效)是否仍然成立。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 本文没有引用任何关于高维BHEP检验的工作。在 \(d > n\) 的设定下,经典BHEP检验本身就需要修正(例如,使用正则化协方差矩阵或随机矩阵理论)。既然本文声称适用于“dimension is large”,却未引用或讨论高维BHEP检验的相关文献(如基于随机矩阵理论的检验),这是一个明显的空白。此外,本文也未引用关于缺失数据下非参数或半参数检验的通用理论(如基于经验似然的方法),这些方法可能提供另一种思路。

张力

未见明显对立引用。所有被引工作都承认缺失数据处理是一个难题,且现有方法有缺陷。本文与Aleksi´c & Miloˇsevi´c (2024)在方法上是对立的(直接建模 vs. 插补),但结论上并不矛盾——后者也承认其方法需要谨慎使用。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \(X \in \mathbb{R}^d\):感兴趣的随机向量,其分布 \(L(X)\) 未知。\(d \ge 2\) 是维度。
  • \(\mu = E(X) \in \mathbb{R}^d\)\(X\) 的期望向量(参数)。
  • \(\Sigma = \text{Cov}(X) \in \mathbb{R}^{d \times d}\)\(X\) 的协方差矩阵(参数),假设正定。
  • \(I \in \{0,1\}^d\):缺失指示随机向量。\(I^{(j)} = 1\) 当且仅当 \(X^{(j)}\) 被观测到。
  • \(p(a) = P(I = a), a \in \{0,1\}^d\):缺失模式的概率质量函数(参数)。
  • \(I \odot X\):Hadamard积,即 \((I^{(1)}X^{(1)}, \ldots, I^{(d)}X^{(d)})^\top\)。这是实际观测到的“带缺失的数据向量”。
  • \(n\):样本量。
  • \((I_i, I_i \odot X_i), i=1,\ldots,n\):可观测的独立同分布样本。
  • \(\hat{\mu}_n, \hat{\Sigma}_n, \hat{p}_n\):基于可观测样本的估计量。
  • \(\Pi\):所有投影映射的集合。\(\pi \in \Pi\)\(\mathbb{R}^d\) 投影到其一个子空间 \(\mathbb{R}^{d_\pi}\)(即选择 \(d_\pi\) 个坐标)。
  • \(T_n\):本文提出的检验统计量。
  • \(\Phi_{d_\pi}\)\(d_\pi\) 维标准正态分布。

  • 模型

  • 数据生成机制:首先,从分布 \(L(X)\) 生成完整的 \(X\)。然后,独立于 \(X\),从分布 \(L(I)\) 生成缺失指示 \(I\)Assumption 2: 可忽略缺失机制)。最后,我们只能观测到 \((I, I \odot X)\)
  • 要检验的假设:\(H_0: L(X) \in \{N_d(\mu, \Sigma): \mu \in \mathbb{R}^d, \Sigma \succ 0\}\) vs. \(H_1: L(X) \notin\) 该族。
  • 已知量:\(L(I)\) 属于一个已知的分布族 \(\mathcal{L}_I\)(例如,所有可能的分布,或独立同分布伯努利分布)。注意:\(L(I)\) 的具体形式未知,但其所属的族是已知的

  • 可观测数据

  • 实际能观测到的是\(n\) 个独立同分布的样本对 \((I_i, I_i \odot X_i)\)。对于每个样本 \(i\),我们看到了哪些变量被观测到了(\(I_i\)),以及被观测到的变量的具体数值(\(I_i \odot X_i\))。缺失的变量值(即 \(I_i^{(j)} = 0\) 对应的 \(X_i^{(j)}\))是完全不可观测的
  • 想要但观测不到的是:完整的 \(X_i\) 向量。我们只能通过假设(如可忽略缺失机制)和可观测数据来推断其分布。

第二步:讲最小内核

最简特例:考虑最简单的情形:\(d=2\)(二元),且缺失模式只有两种:要么两个变量都观测到(\(I = (1,1)\)),要么第一个变量缺失、第二个变量观测到(\(I = (0,1)\))。假设 \(L(I)\) 是已知的,即 \(p(1,1) = p_{11}\)\(p(0,1) = p_{01}\) 是已知常数。我们想检验 \(H_0: X \sim N_2(\mu, \Sigma)\)

在这个特例下,本文的核心思路是什么?

  1. 参数估计:我们需要估计 \(\mu\)\(\Sigma\)。由于缺失机制已知且简单,我们可以用加权矩估计。例如,对于 \(\mu^{(2)}\)(第二个变量的均值),所有样本(无论 \(I^{(1)}\) 是否缺失)都观测到了 \(X^{(2)}\),所以 \(\hat{\mu}_n^{(2)} = \frac{1}{n} \sum_{i=1}^n X_i^{(2)}\)。对于 \(\mu^{(1)}\),只有 \(I_i = (1,1)\) 的样本才观测到了 \(X^{(1)}\),所以 \(\hat{\mu}_n^{(1)} = \frac{1}{n_{11}} \sum_{i: I_i=(1,1)} X_i^{(1)}\),其中 \(n_{11}\) 是完全观测的样本数。协方差矩阵的估计类似,但需要更小心地处理交叉项 \(\text{Cov}(X^{(1)}, X^{(2)})\),因为只有完全观测的样本才能提供其信息。

  2. 构造检验统计量:经典BHEP检验统计量基于Mahalanobis距离,需要用到 \(\hat{\Sigma}_n^{-1}\)。但在缺失数据下,如果 \(n_{11}\) 很小(甚至为0),\(\hat{\Sigma}_n\) 可能是奇异的,无法求逆。本文的关键想法是:放弃Mahalanobis距离,直接使用原始数据(或中心化后的数据)的特征函数

  3. 核心思路:对于每个投影 \(\pi \in \Pi\)(在这个特例中,\(\Pi\) 包含恒等映射 \(\pi(x) = x\) 和投影到第二个坐标的映射 \(\pi(x) = x^{(2)}\)),我们计算:

  4. 经验特征函数\(\hat{\varphi}_{n,\pi}(t) = \frac{1}{n} \sum_{i=1}^n \exp\left(i \langle t, \pi(I_i \odot (X_i - \hat{\mu}_n)) \rangle \right)\)。注意,这里用的是中心化后的观测数据 \(\pi(I_i \odot (X_i - \hat{\mu}_n))\)。对于 \(\pi(x) = x^{(2)}\),这个量对所有样本都有定义。对于 \(\pi(x) = x\),它只在完全观测的样本上有定义(因为 \(I_i \odot (X_i - \hat{\mu}_n)\) 的第一个分量在 \(I_i^{(1)}=0\) 时为0)。
  5. 理论特征函数(在 \(H_0\) 下)\(\hat{\phi}_{n,\pi}(t) = \sum_{a \in \{0,1\}^{d_\pi}} \exp\left(-\frac{1}{2} \langle D_a \pi(\hat{\Sigma}_n) D_a t, t \rangle \right) \pi(\hat{p}_n)(a)\)。这个公式是正态分布特征函数在缺失数据下的加权平均。例如,对于 \(\pi(x) = x\)\(d_\pi=2\),求和项包括 \(a=(1,1)\)\(a=(0,1)\)。当 \(a=(1,1)\) 时,\(D_a = I_2\),项为 \(\exp(-\frac{1}{2} t^\top \hat{\Sigma}_n t) \hat{p}_n(1,1)\)。当 \(a=(0,1)\) 时,\(D_a = \text{diag}(0,1)\),项为 \(\exp(-\frac{1}{2} \hat{\Sigma}_n^{(2,2)} t_2^2) \hat{p}_n(0,1)\)

  6. 检验统计量\(T_{n,\pi} = n \int |\hat{\varphi}_{n,\pi}(t) - \hat{\phi}_{n,\pi}(t)|^2 d\Phi_{d_\pi}(t)\)。这个距离度量了经验特征函数与在 \(H_0\) 下期望的特征函数之间的差异。关键点:这个统计量不涉及 \(\hat{\Sigma}_n^{-1}\),因此即使 \(\hat{\Sigma}_n\) 是奇异的,它仍然有定义。最终统计量 \(T_n = \sum_{\pi \in \Pi} w_\pi T_{n,\pi}\) 是各投影下距离的加权和。

这个最小内核揭示了论文的核心数学困难:在缺失数据下,如何构造一个不依赖于协方差矩阵可逆性的、对正态性偏离敏感的 \(L^2\) 距离。作者的想法是:将问题从“比较观测数据的分布与正态分布”转化为“比较观测数据的特征函数与在缺失机制下正态分布特征函数的加权平均”。这个转化巧妙地绕过了矩阵求逆问题。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对一般性不完全数据(允许任意缺失模式),提出了一个基于特征函数的、一致(consistent)的多元正态性BHEP检验。
  2. 核心工具/方法:通过引入投影方法(projection approach)和直接使用原始数据的特征函数(而非Mahalanobis距离),构造了一个在协方差矩阵估计奇异时仍然有定义的检验统计量;并利用bootstrap程序获得临界值。
  3. 主要结论:证明了检验统计量在原假设和备择假设下的几乎必然极限(Theorem 2),以及原假设下的依分布收敛性(Theorem 3),从而为bootstrap程序提供了理论依据。模拟和真实数据示例验证了方法的有效性。

关键设定与假设

  • Assumption 1 (矩条件)\(E(|X|^2) < \infty\),且 \(\Sigma\) 正定。这是经典BHEP检验也需要的标准假设,保证了特征函数和协方差矩阵的存在性。
  • Assumption 2 (可忽略缺失机制)\(X\)\(I\) 独立,且 \(p(1_d) > 0\)(即存在完全观测的样本)。这是整个方法的核心假设,它保证了我们可以从可观测数据中识别出 \(L(X)\)(因为 \(P(X \le x) = P(I=1_d, I\odot X \le x) / p(1_d)\))。这个假设比“随机缺失(MAR)”更强,因为它要求缺失完全独立于数据值(MCAR)。相比已有文献:Aleksi´c & Miloˇsevi´c (2024) 的方法(插补法)通常也假设MCAR,但本文明确将其作为识别条件。
  • Assumption 3 (估计量强相合性)\(\hat{\mu}_n, \hat{\Sigma}_n, \hat{p}_n\) 几乎必然收敛到真值。这是证明Theorem 2(几乎必然极限)的基础。
  • Assumption 4 (估计量的渐近线性展开)\(\hat{\mu}_n, \hat{\Sigma}_n, \hat{p}_n\) 具有 \(\sqrt{n}\)-相合的、以影响函数(influence function)表示的线性展开。这是证明Theorem 3(依分布收敛)的关键,它允许我们将参数估计的误差纳入到检验统计量的渐近分布中。相比已有文献:经典BHEP检验不需要这个假设,因为其统计量是分布自由的,不依赖于参数估计。本文由于缺失数据破坏了分布自由性,必须显式处理参数估计的影响。

主要结果

  • Theorem 2 (几乎必然极限)
  • 陈述:在Assumption 1-3下,\(\frac{1}{n} T_n \xrightarrow{a.s.} \kappa = \sum_{\pi \in \Pi} w_\pi \int |\varphi_\pi - \phi_\pi|^2 d\Phi_{d_\pi}\)
  • 直觉\(\frac{1}{n} T_n\) 几乎必然收敛到一个非随机极限 \(\kappa\)。在 \(H_0\) 下,\(\varphi_\pi = \phi_\pi\),所以 \(\kappa = 0\)。在 \(H_1\) 下,由于恒等映射 \(id \in \Pi\) 的权重 \(w_{id} > 0\),且 \(L(I, I\odot X)\) 唯一确定 \(L(X)\),可以证明 \(\varphi_{id} \neq \phi_{id}\) 在某个 \(t\) 上成立,从而 \(\kappa > 0\)这保证了检验的一致性
  • 解决的技术难点:需要证明 \(\hat{\varphi}_{n,\pi}(t)\)\(\hat{\phi}_{n,\pi}(t)\)\(t\) 上一致地收敛到 \(\varphi_\pi(t)\)\(\phi_\pi(t)\)。证明使用了强数定律、稠密子集上的逐点收敛和Lipschitz性质来推广到整个空间。

  • Theorem 3 (依分布收敛)

  • 陈述:在 \(H_0\) 和 Assumption 1-4下,\(T_n \xrightarrow{d} T = \int \sum_{\pi \in \Pi} w_\pi V_\pi^2 d(\otimes_{\pi \in \Pi} \Phi_{d_\pi})\),其中 \((V_\pi; \pi \in \Pi)\) 是一个均值为零的向量值高斯过程,其协方差函数由影响函数 \(\Psi\) 给出。
  • 直觉\(T_n\) 的极限分布是一个高斯过程的 \(L^2\) 范数的加权和。这个分布依赖于未知参数(\(\mu, \Sigma, p\))和缺失机制,因此不是分布自由的。这解释了为什么需要bootstrap
  • 解决的技术难点:需要将参数估计的误差(\(\hat{\mu}_n - \mu, \hat{\Sigma}_n - \Sigma, \hat{p}_n - p\))对统计量的影响进行线性化,并证明剩余项在 \(L^2\) 范数下依概率收敛到0。证明使用了泰勒展开(二阶展开处理参数估计的非线性影响)和Hilbert空间中的中心极限定理。

证明路线与技术技巧

  • 整体路线(Theorem 3的证明)
  • 线性化:对 \(V_{n,\pi}(t) = \sqrt{n}(\hat{\varphi}_{n,\pi}(t) - \hat{\phi}_{n,\pi}(t))\) 进行泰勒展开,将其分解为“理想项”(基于真实参数 \(\mu, \Sigma, p\) 的i.i.d.和)和“剩余项”。
  • 处理参数估计:利用Assumption 4(影响函数展开),将泰勒展开中涉及 \(\hat{\mu}_n - \mu\)\(\hat{\Sigma}_n - \Sigma\) 的项,替换为它们的影响函数表示。最终,\(V_{n,\pi}(t)\) 可以表示为 \(\frac{1}{\sqrt{n}} \sum_{i=1}^n \Psi(I_i, I_i \odot X_i, t, \pi) + R_{n,\pi}(t)\),其中 \(\Psi\) 是显式给出的影响函数,\(R_{n,\pi}\) 是剩余项。
  • 证明剩余项可忽略:证明 \(|R_{n,\pi}|_{H_\pi} \xrightarrow{P} 0\),即剩余项在 \(L^2(\Phi_{d_\pi})\) 范数下依概率收敛到0。这需要仔细控制泰勒展开的高阶项和参数估计的收敛速度。
  • 应用Hilbert空间CLT:由于 \(\Psi\) 是均值为零、二阶矩有限的i.i.d.随机元,向量值过程 \((\frac{1}{\sqrt{n}} \sum_{i=1}^n \Psi(I_i, I_i \odot X_i, \cdot, \pi); \pi \in \Pi)\) 在Hilbert空间 \(H\) 中依分布收敛到一个高斯过程 \((V_\pi; \pi \in \Pi)\)
  • 连续映射定理:由于 \(T_n = \int \sum_{\pi} w_\pi V_{n,\pi}^2 d(\otimes \Phi_{d_\pi})\)\((V_{n,\pi})\) 的连续泛函,由连续映射定理可得 \(T_n \xrightarrow{d} T\)

  • 关键跳跃点:最吃功夫的引理是证明剩余项 \(R_{n,\pi}\)\(L^2\) 范数下可忽略。难点在于,泰勒展开的剩余项涉及 \(\hat{\mu}_n - \mu\)\(\hat{\Sigma}_n - \Sigma\) 的高阶项(如 \(|\hat{\mu}_n - \mu|^2\)),以及这些项与随机变量 \(\cos\)\(\sin\) 的交互。作者通过以下方式绕过:

  • \(\cos\)\(\sin\) 使用二阶泰勒展开,将 \(|\hat{\mu}_n - \mu|^2\) 项吸收进剩余项。
  • 利用 \(\hat{\mu}_n\)\(\hat{\Sigma}_n\)\(\sqrt{n}\)-相合性(Assumption 4),证明这些高阶项乘以 \(\sqrt{n}\) 后仍为 \(O_P(1)\),从而在除以 \(\sqrt{n}\) 后(因为 \(V_{n,\pi}\)\(\sqrt{n}\) 乘以一个差值)可以忽略。
  • 对于 \(\hat{\Sigma}_n\) 的展开,需要处理矩阵指数函数 \(\exp(-\frac{1}{2} \langle D_a \hat{\Sigma}_n D_a t, t \rangle)\) 的泰勒展开,这涉及到矩阵的二次型。作者利用了一个技巧:将 \(\exp(-\frac{1}{2} \langle D_a \hat{\Sigma}_n D_a t, t \rangle)\) 视为一个关于 \(\hat{\Sigma}_n\) 的泛函,并应用Delta方法(Lemma 1)来获得其影响函数。

  • 技术技巧点名

  • 泰勒展开(二阶):用于线性化 \(\cos\)\(\sin\) 和指数函数,以处理参数估计的影响。
  • Delta方法(Lemma 1):用于推导 \(\hat{\Sigma}_n\)\(\hat{p}_n\) 的复合函数(如矩阵根、指数函数)的渐近线性展开。
  • 稠密子集上的逐点收敛 + Lipschitz性质:用于证明经验特征函数在 \(t\) 上的一致收敛(Theorem 2的证明)。
  • Hilbert空间中心极限定理:用于推导检验统计量的极限分布(Theorem 3的证明)。
  • 影响函数(Influence Function):核心工具,用于将参数估计的误差线性化为i.i.d.随机变量的和。

真实例子与应用

  • 使用的数据/场景:纽约市空气质量数据集(airquality in R),包含153个观测,两个变量:臭氧(Ozone)和太阳辐射(Solar.R)。臭氧有37个缺失值,太阳辐射有7个缺失值,其中2个观测两个变量都缺失。
  • 如何应用:将本文提出的BHEP检验应用于该数据集。假设缺失机制属于“所有可能分布”的族(Example 1 (b)),并使用相应的估计量。在检验统计量中使用等权重。
  • 得到的结果:基于10000次bootstrap重抽样,估计的p值为0.0227。在显著性水平 \(\alpha = 0.05\) 下,拒绝多元正态性的原假设。
  • 这个例子想说明什么:展示本文方法在实际数据上的可应用性。它能够处理真实世界中常见的、非结构化的缺失模式,并给出一个合理的统计推断结果。

🔎 结论是否比证明窄

  • 关于高维情形:作者在引言中声称方法适用于“dimension is large”,但定理的证明依赖于Assumption 1(\(\Sigma\) 正定)和Assumption 3/4(估计量的相合性和渐近线性展开)。在高维(\(d > n\))下,即使 \(\Sigma\) 正定,样本协方差矩阵 \(\hat{\Sigma}_n\) 也必然是奇异的。虽然作者通过使用矩阵根绕过了统计量定义中的求逆问题,但估计量 \(\hat{\Sigma}_n\) 的相合性(Assumption 3)在高维下通常不成立(除非有额外的稀疏性假设)。因此,Theorem 2和Theorem 3的证明在高维下是无效的。作者在引言中的“always applicable, including in cases where ... the dimension of the data vectors is large”是一个未被严格证明的claim,其适用范围仅限于 \(d < n\)\(d\) 固定而 \(n \to \infty\) 的经典渐近框架。
  • 关于bootstrap的有效性:Theorem 3证明了 \(T_n\) 依分布收敛到 \(T\)。作者在Section 6中声称“using the same arguments as in (the proof of) Theorem 3 in Gaigall & W¨ubbolding (2025), we can combine Theorem 2 and Theorem 3 to obtain \(P(T_n > c_{n,1-\alpha}) \to 1\) under the alternative”。这暗示了bootstrap临界值 \(c^*_{n,1-\alpha}\) 是有效的(即检验水平正确且一致)。然而,本文并未给出bootstrap一致性的严格证明,只是引用了另一篇论文的论证。这是一个潜在的薄弱环节。

四、开放问题

  1. bootstrap一致性的严格证明:本文仅引用了其他工作来论证bootstrap的有效性,但未给出针对本检验统计量的完整证明。一个开放问题是:在本文的设定下,bootstrap临界值 \(c^*_{n,1-\alpha}\) 是否确实依概率收敛到真实零分布的分位数 \(c_{n,1-\alpha}\)?这需要验证bootstrap版本的统计量 \(T^*_n\) 的条件分布是否弱收敛到与 \(T_n\) 相同的极限分布。扎根于:Section 6中“using the same arguments as in (the proof of) Theorem 3 in Gaigall & W¨ubbolding (2025)”这一句。

  2. 高维情形的理论性质:本文的定理在 \(d\) 固定、\(n \to \infty\) 的经典框架下成立。当 \(d\)\(n\) 增长(如 \(d = o(n)\)\(d > n\))时,检验统计量的渐近性质(如收敛速度、功效、bootstrap有效性)完全未知。一个开放问题是:能否在高维稀疏模型下(如 \(\Sigma\) 是稀疏的)建立类似的理论?扎根于:引言中“the dimension of the data vectors is large”这一未被证明的claim。

  3. 权重 \(w_\pi\) 的最优选择:本文使用等权重,但理论上可以通过优化权重来最大化检验功效。一个开放问题是:如何根据缺失模式和数据特征,自适应地选择投影 \(\pi\) 及其权重 \(w_\pi\),以在特定备择假设下获得最大功效?这类似于自适应检验的问题。扎根于:Section 4中“we choose equal weights in the test statistic”这一具体选择。

  4. 放松可忽略缺失机制假设:本文的核心假设是 \(X\)\(I\) 独立(MCAR)。在实际中,更常见的是随机缺失(MAR)或非随机缺失(MNAR)。一个开放问题是:能否将本文的方法推广到MAR或MNAR设定下?这可能需要引入额外的模型(如倾向性得分模型)或工具变量。扎根于:Assumption 2中“the random vectors \(X\) and \(I\) are independent”这一强假设。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论