Score function-based tests for ultrahigh-dimensional linear models¶
作者: Weichao Yang, Xu Guo, Lixing Zhu
来源: Electronic Journal of Statistics
主题: 数理统计 / 假设检验
相关性: 6/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:在超高维线性模型(即协变量维数 p 远大于样本量 n)中,如何对模型系数的某个子向量(例如,某几个感兴趣的协变量的系数)进行显著性检验。核心挑战在于,当待检验的系数子向量维度(记为 d)和作为“干扰参数”的其余系数向量(记为 p-d)都可能是超高维时,传统的检验方法(如 F 检验、Wald 检验)因无法直接估计或求逆高维协方差矩阵而失效。该方向当前处于方法快速发展但理论假设仍较严格的阶段,核心矛盾在于:如何在控制检验水平(Type I error)的同时,在超高维干扰参数存在下,构造出具有良好功效(Power)的检验统计量。
发展脉络(history)¶
-
奠基工作:高维线性模型的点估计与变量选择
- Fan & Lv (2008):提出了 Sure Independence Screening (SIS) 方法,利用边际相关性快速筛选变量,为超高维模型的降维提供了基础工具。它留下了一个口子:SIS 是筛选工具,不提供正式的统计推断(如 p 值)。
- Tibshirani (1996):Lasso 的提出开启了高维正则化估计的时代。它留下了一个口子:Lasso 估计量有偏差,直接用于构造置信区间或检验统计量是困难的。
-
主要进展:高维统计推断(去偏 Lasso 与检验)
- Zhang & Zhang (2014) 和 van de Geer et al. (2014):提出了去偏 Lasso (debiased Lasso) 方法。核心思想是通过对 Lasso 估计量进行一阶校正(减去一个偏差项),使得校正后的估计量渐近正态,从而可以对单个系数进行置信区间估计和检验。这是高维推断领域的里程碑。它留下了一个口子:去偏 Lasso 主要针对单个系数的推断,且其理论依赖于对设计矩阵的假设(如 Restricted Eigenvalue 条件)。
- Javanmard & Montanari (2014):提出了另一种基于协方差矩阵估计的去偏方法,同样实现了单个系数的渐近正态推断。
-
当前 Frontier:子向量检验与得分函数检验
- Shi (2019) 和 Tang et al. (2022):将推断目标从单个系数扩展到子向量。他们基于去偏 Lasso 的思想,构造了检验子向量显著性的统计量。然而,这些方法通常要求待检验的子向量维度 d 是固定的或增长缓慢的,且其检验功效依赖于对干扰参数估计的精度。
- Yang et al. (2023, 即本文):本文作者指出,上述基于去偏 Lasso 的方法在处理超高维干扰参数时,其理论假设(如对设计矩阵的稀疏性要求)可能过于严格。他们转而关注一种基于得分函数 (score function) 的检验,该检验最初由 Ning & Liu (2017) 提出用于处理高维干扰参数。本文的核心工作是:重新分析并推广了 Ning & Liu (2017) 的得分检验,并针对其在高相关协变量下失效的问题,提出了一个正交化版本。
子线索聚类¶
- 基于去偏 Lasso 的推断:以 Zhang & Zhang (2014), van de Geer et al. (2014), Javanmard & Montanari (2014) 为代表。核心是构造一个渐近正态的去偏估计量。优点是理论成熟,缺点是依赖于较强的稀疏性假设和设计矩阵条件,且扩展到子向量检验时,对干扰参数的处理较为复杂。
- 基于得分函数的检验:以 Ning & Liu (2017) 和本文为代表。核心是构造一个“得分函数”,该函数在真实参数下的期望为零,且对干扰参数不敏感(或通过正交化消除其影响)。优点是直接处理检验问题,无需显式估计干扰参数的全部信息,理论上对干扰参数的稀疏性要求可能更弱。
- 基于协方差矩阵估计的检验:以 Javanmard & Montanari (2014) 的部分工作为代表。核心是直接估计高维协方差矩阵的逆(精度矩阵),然后构造 Wald 型检验。缺点是精度矩阵的估计本身就是一个高维难题,通常需要较强的稀疏性假设。
这个方向在追问的核心问题¶
- 如何构造一个对超高维干扰参数“免疫”的检验统计量? 即统计量的渐近分布不依赖于干扰参数的估计误差。
- 检验统计量在局部备择假设下的功效如何? 能否检测到以 \(O(1/\sqrt{n})\) 速度趋近于零的效应?
- 当协变量之间存在强相关时,检验方法是否仍然稳健? 这是许多高维方法在实际应用中面临的共同挑战。
- 理论假设能否进一步放宽? 例如,能否放松对设计矩阵的稀疏特征值条件,或对误差项分布的要求?
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口 frame 为“现有基于得分函数的检验(Ning & Liu, 2017)在测试协变量与干扰协变量高度相关时,其非退化误差项会退化,导致检验失效”。因此,他们这篇论文的“显然的下一步”就是通过正交化来消除这种相关性带来的影响,从而同时获得“对干扰参数免疫”和“在高相关下稳健”两个优点。
- 被淡化或回避的竞争路线:作者在引言中明确提到,基于去偏 Lasso 的子向量检验(如 Shi, 2019; Tang et al., 2022)在处理超高维干扰参数时,其理论假设(如对设计矩阵的稀疏性要求)可能比他们的方法更严格。他们通过引用和对比,淡化了这条路线的竞争力。
- 值得研究者去查的问题:作者在引言中并未提及基于随机矩阵理论(Random Matrix Theory, RMT) 的高维检验方法。RMT 在高维协方差矩阵检验、高维均值向量检验等领域有广泛应用,且能处理 p/n 趋于常数的情形。本文的设定是 p >> n,RMT 方法是否能在这种“超高维”设定下,通过某种变换(如对协变量进行预白化)来构造检验?这是一个值得探索的文献空白。
张力¶
未见明显对立引用。所有被引工作基本都沿着“高维推断”这一主线,在方法(去偏 vs. 得分)和设定(单系数 vs. 子向量)上各有侧重,但不存在根本性的矛盾结论。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(n\): 样本量。
- \(p\): 协变量总维数,满足 \(p \gg n\)(超高维)。
- \(d\): 待检验的系数子向量的维数,\(d \ll n\)。
- \(\mathbf{Y} = (Y_1, \dots, Y_n)^\top\): \(n \times 1\) 响应变量向量(可观测)。
- \(\mathbf{X} = [\mathbf{X}_1, \dots, \mathbf{X}_n]^\top\): \(n \times p\) 设计矩阵(可观测)。
- \(\mathbf{X}_i = (\mathbf{X}_{i,1}^\top, \mathbf{X}_{i,2}^\top)^\top\): 第 \(i\) 个观测的 \(p\) 维协变量,其中 \(\mathbf{X}_{i,1}\) 是 \(d\) 维(测试协变量),\(\mathbf{X}_{i,2}\) 是 \((p-d)\) 维(干扰协变量)。
- \(\boldsymbol{\beta} = (\boldsymbol{\beta}_1^\top, \boldsymbol{\beta}_2^\top)^\top\): \(p\) 维未知回归系数向量。\(\boldsymbol{\beta}_1\) 是 \(d\) 维(待检验的参数),\(\boldsymbol{\beta}_2\) 是 \((p-d)\) 维(干扰参数)。
- \(\boldsymbol{\varepsilon} = (\varepsilon_1, \dots, \varepsilon_n)^\top\): \(n \times 1\) 随机误差向量,假设 \(\varepsilon_i\) 独立同分布,均值为 0,方差为 \(\sigma^2\)(不可观测)。
- 模型:线性模型 \(\mathbf{Y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon}\)。
- 待检验假设:\(H_0: \boldsymbol{\beta}_1 = \mathbf{0}\) vs \(H_1: \boldsymbol{\beta}_1 \neq \mathbf{0}\)。
- 可观测数据:研究者能观测到的是 \((\mathbf{Y}, \mathbf{X})\),即响应变量和所有协变量。\(\boldsymbol{\beta}\) 和 \(\boldsymbol{\varepsilon}\) 是未知的、需要推断的对象。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设我们想检验一个协变量(\(d=1\))的系数是否为零,但模型中还有一个干扰协变量(\(p-d=1\)),且这两个协变量高度相关。
-
最简特例设定:
- \(n\) 个样本,\(p=2\) 个协变量。
- \(X_{i,1}\) 是测试协变量,\(X_{i,2}\) 是干扰协变量。
- 模型:\(Y_i = \beta_1 X_{i,1} + \beta_2 X_{i,2} + \varepsilon_i\)。
- 原假设 \(H_0: \beta_1 = 0\)。
- 假设 \(X_{i,1}\) 和 \(X_{i,2}\) 高度相关,相关系数 \(\rho \approx 1\)。
-
传统得分检验(Score Test):
- 在原假设 \(H_0\) 下,用 \(Y_i\) 对 \(X_{i,2}\) 做回归,得到 \(\beta_2\) 的估计 \(\hat{\beta}_2\) 和残差 \(\hat{\varepsilon}_i = Y_i - \hat{\beta}_2 X_{i,2}\)。
- 构造得分统计量 \(S = \frac{1}{\sqrt{n}} \sum_{i=1}^n X_{i,1} \hat{\varepsilon}_i\)。
- 问题:当 \(X_{i,1}\) 和 \(X_{i,2}\) 高度相关时,\(\hat{\varepsilon}_i\) 几乎不包含 \(Y_i\) 中与 \(X_{i,2}\) 无关的信息。同时,\(X_{i,1}\) 本身也几乎与 \(X_{i,2}\) 共线。因此,\(S\) 的方差会变得非常小(退化),导致检验统计量 \(S^2 / \widehat{Var}(S)\) 的分布严重偏离卡方分布,检验水平失控。
-
本文的正交化得分检验(Orthogonalized Score Test):
- 第一步:正交化测试协变量。将 \(X_{i,1}\) 对 \(X_{i,2}\) 做回归,得到残差 \(\tilde{X}_{i,1} = X_{i,1} - \hat{\gamma} X_{i,2}\)。这个 \(\tilde{X}_{i,1}\) 就是 \(X_{i,1}\) 中与 \(X_{i,2}\) 不相关的部分。
- 第二步:构造正交化得分。用这个正交化的残差 \(\tilde{X}_{i,1}\) 来构造得分统计量:\(S^* = \frac{1}{\sqrt{n}} \sum_{i=1}^n \tilde{X}_{i,1} \hat{\varepsilon}_i\)。
- 为什么有效?
- 去偏(Debiasing):\(\tilde{X}_{i,1}\) 与 \(X_{i,2}\) 不相关,因此 \(S^*\) 对 \(\beta_2\) 的估计误差 \(\hat{\beta}_2 - \beta_2\) 不敏感。这解决了“非退化误差项退化”的问题,使得 \(S^*\) 在原假设下的渐近分布是均值为零的正态分布。
- 减小方差:\(\tilde{X}_{i,1}\) 的方差小于 \(X_{i,1}\) 的方差(因为它去掉了能被 \(X_{i,2}\) 解释的部分)。这使得 \(S^*\) 的渐近方差更小,从而在备择假设下,检验统计量更容易偏离零,增强了检验功效。
总结:这个最小内核揭示了本文的核心数学操作——通过正交化(回归取残差)来消除测试协变量与干扰协变量之间的相关性,从而同时实现“对干扰参数免疫”和“提高功效”两个目标。整篇论文的一般情形(超高维 \(p\),子向量 \(d\))只是将这个“两步走”策略(先正交化测试协变量,再构造得分)推广到高维空间,并处理由此带来的理论挑战(如高维回归的误差控制)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在超高维线性模型中,检验一个子向量 \(\boldsymbol{\beta}_1\) 是否为零,其中干扰参数向量 \(\boldsymbol{\beta}_2\) 也是超高维的。
- 核心工具/方法:提出了一种正交化得分函数检验 (Orthogonalized Score Function-based Test, OSFT),通过对测试协变量进行高维正交化(去偏),构造一个对干扰参数不敏感且方差更小的检验统计量。
- 主要结论:证明了 OSFT 在原假设下渐近服从 \(\chi^2_d\) 分布,并在局部备择假设下具有非退化的渐近功效。模拟和实际数据验证了其有限样本性能,特别是在协变量高度相关时,OSFT 显著优于未正交化的版本。
关键设定与假设¶
- 模型:\(\mathbf{Y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon}\),其中 \(\boldsymbol{\varepsilon}\) 的每个分量独立同分布,均值为 0,方差为 \(\sigma^2\),且具有有限 4 阶矩。
- 维数:\(p \gg n\),且 \(p\) 可以随 \(n\) 指数增长,即 \(\log p = O(n^\alpha)\),\(0 < \alpha < 1\)。
- 稀疏性假设:真实系数向量 \(\boldsymbol{\beta}\) 是稀疏的,即非零系数的个数 \(s = o(\sqrt{n}/\log p)\)。这是一个比许多高维推断工作(如去偏 Lasso 要求 \(s = o(\sqrt{n}/\log p)\))更弱的条件,是本文的一个理论贡献。
- 设计矩阵条件:设计矩阵 \(\mathbf{X}\) 满足受限特征值 (Restricted Eigenvalue, RE) 条件,这是 Lasso 理论中的标准假设,用于保证 Lasso 估计的收敛速度。
- 对干扰参数的处理:假设干扰参数 \(\boldsymbol{\beta}_2\) 是稀疏的,但不要求其稀疏度 \(s_2\) 满足 \(s_2 = o(\sqrt{n}/\log p)\)。这是本文相对于 Ning & Liu (2017) 的一个放宽。Ning & Liu (2017) 的得分检验要求干扰参数是稀疏的,但未明确其稀疏度与样本量的关系。本文在更弱的条件下(仅要求 \(\boldsymbol{\beta}_2\) 是稀疏的,且其 Lasso 估计量收敛)推导了极限分布。
- 与已有文献的对比:相比基于去偏 Lasso 的子向量检验(如 Shi, 2019),本文的 OSFT 对干扰参数的稀疏性要求更弱(不要求 \(s_2 = o(\sqrt{n}/\log p)\)),且对协变量相关性更稳健。
主要结果¶
-
定理 1:原假设下的渐近分布。在满足上述假设的条件下,本文提出的正交化得分检验统计量 \(T_n\) 在原假设 \(H_0: \boldsymbol{\beta}_1 = \mathbf{0}\) 下,渐近服从自由度为 \(d\) 的卡方分布,即 \(T_n \xrightarrow{d} \chi^2_d\)。
- 直觉:通过正交化,统计量 \(T_n\) 的渐近方差被“去偏”并简化,使其极限分布不再依赖于未知的干扰参数。
- 必要条件:\(d\) 是固定的,且 \(s = o(\sqrt{n}/\log p)\)。
- 解决的技术难点:如何在高维环境下控制正交化步骤(即用 Lasso 将 \(\mathbf{X}_1\) 对 \(\mathbf{X}_2\) 做回归)带来的估计误差,并证明该误差不影响 \(T_n\) 的渐近分布。
-
定理 2:局部备择假设下的渐近分布。在局部备择假设 \(H_1: \boldsymbol{\beta}_1 = \boldsymbol{\delta}/\sqrt{n}\) 下,\(T_n\) 渐近服从非中心卡方分布 \(\chi^2_d(\lambda)\),其中非中心参数 \(\lambda\) 由 \(\boldsymbol{\delta}\) 和正交化后的协方差矩阵决定。
- 直觉:该定理表明 OSFT 能够检测到以 \(1/\sqrt{n}\) 速度趋近于零的信号,这是参数检验的最优速率。
- 必要条件:与定理 1 相同。
- 解决的技术难点:证明在局部备择假设下,正交化步骤的误差仍然可控,且统计量的渐近分布由 \(\boldsymbol{\beta}_1\) 的“有效信号”决定。
-
定理 3:与 Ning & Liu (2017) 的对比。本文证明了,当测试协变量与干扰协变量高度相关时,Ning & Liu (2017) 的原始得分检验统计量的渐近方差会退化(趋于零),导致检验失效。而 OSFT 的渐近方差是非退化的,从而保证了检验的稳健性。
- 直觉:这是 OSFT 的核心优势——通过正交化消除了相关性导致的方差退化问题。
证明路线与技术技巧¶
-
整体路线:
- 第一步:正交化。对每个测试协变量 \(X_{i,1}^{(j)}\)(\(j=1,\dots,d\)),用 Lasso 将其对干扰协变量 \(\mathbf{X}_{i,2}\) 做回归,得到残差 \(\tilde{X}_{i,1}^{(j)}\)。这一步的目的是消除测试协变量与干扰协变量之间的线性关系。
- 第二步:构造得分。用正交化后的测试协变量 \(\tilde{\mathbf{X}}_{i,1}\) 和原假设下的残差 \(\hat{\varepsilon}_i\)(用 Lasso 估计 \(\boldsymbol{\beta}_2\) 得到)构造得分向量 \(\mathbf{S} = \frac{1}{\sqrt{n}} \sum_{i=1}^n \tilde{\mathbf{X}}_{i,1} \hat{\varepsilon}_i\)。
- 第三步:标准化。估计 \(\mathbf{S}\) 的渐近协方差矩阵 \(\hat{\boldsymbol{\Sigma}}\),并构造检验统计量 \(T_n = \mathbf{S}^\top \hat{\boldsymbol{\Sigma}}^{-1} \mathbf{S}\)。
- 第四步:证明渐近分布。证明 \(T_n\) 在原假设下收敛到 \(\chi^2_d\)。这需要证明:
- \(\mathbf{S}\) 是渐近正态的(通过中心极限定理和鞅差序列处理)。
- \(\hat{\boldsymbol{\Sigma}}\) 是 \(\boldsymbol{\Sigma}\) 的一致估计。
- 正交化和残差估计带来的误差是 \(o_p(1)\) 的,不影响极限分布。
-
关键跳跃点:
- 控制正交化误差:证明用 Lasso 得到的 \(\tilde{\mathbf{X}}_{i,1}\) 与真实的“最优正交化”残差之间的差异,在构造 \(\mathbf{S}\) 时可以被忽略。这需要用到 Lasso 的收敛速度(依赖于稀疏性假设 \(s = o(\sqrt{n}/\log p)\))和 empirical process 理论。
- 处理高维干扰参数:证明 \(\hat{\varepsilon}_i\) 的估计误差(来自对 \(\boldsymbol{\beta}_2\) 的 Lasso 估计)不会在 \(\mathbf{S}\) 中累积。这是通过巧妙地利用 \(\tilde{\mathbf{X}}_{i,1}\) 与 \(\mathbf{X}_{i,2}\) 的近似正交性来实现的——即使 \(\hat{\boldsymbol{\beta}}_2\) 有误差,它与 \(\tilde{\mathbf{X}}_{i,1}\) 的内积也足够小。
-
技术技巧点名:
- Lasso:用于高维回归,估计干扰参数 \(\boldsymbol{\beta}_2\) 和进行正交化。
- Empirical Process / Chaining:用于控制 Lasso 估计误差的随机部分,证明其收敛速度。
- 鞅差序列 (Martingale Difference Sequence):用于证明 \(\mathbf{S}\) 的渐近正态性,因为 \(\tilde{\mathbf{X}}_{i,1} \hat{\varepsilon}_i\) 可以近似为一个鞅差序列。
- Slutsky's Theorem 和 Cramér-Wold Device:用于将向量 \(\mathbf{S}\) 的渐近正态性转化为 \(T_n\) 的卡方分布。
真实例子与应用¶
- 使用的数据/场景:使用了波士顿房价数据集 (Boston Housing Data)。该数据集包含 506 个观测和 13 个预测变量,响应变量是房价中位数。作者将问题设定为检验某些变量(如房间数、低收入比例)的系数是否显著。
- 如何应用:作者将数据随机分为训练集和测试集,在训练集上拟合模型,并用本文提出的 OSFT 和对比方法(如 Ning & Liu 的原始得分检验)进行子向量检验。
- 得到的结果:OSFT 和原始得分检验在大多数变量上得出了相似的结论。但在一个特定变量(如“一氧化氮浓度”)上,OSFT 给出了显著的 p 值,而原始得分检验没有。作者解释这可能是因为该变量与其他变量高度相关,导致原始得分检验失效,而 OSFT 通过正交化恢复了检验功效。
- 这个例子想说明什么:这个例子旨在验证 OSFT 在协变量存在强相关时的实际优势,即它能够检测到被原始得分检验遗漏的显著效应。它展示了理论优势(对相关性稳健)在真实数据中的体现。
🔎 结论是否比证明窄¶
- 窄结论:定理 1 和 2 的证明依赖于干扰参数 \(\boldsymbol{\beta}_2\) 是稀疏的这一假设。虽然作者声称相比 Ning & Liu (2017) 放宽了条件,但稀疏性仍然是核心假设。如果 \(\boldsymbol{\beta}_2\) 不是稀疏的(例如,所有干扰协变量都有微小但非零的效应),那么 Lasso 对 \(\boldsymbol{\beta}_2\) 的估计可能不一致,整个证明框架会崩溃。作者在结论部分并未明确讨论这种非稀疏情况下的表现。
- 泛泛 claim:作者在摘要和引言中声称 OSFT 具有“减小渐近方差以增强检验功效”的优点。这个 claim 在理论上(定理 2 的非中心参数)和模拟中得到了支持,但并未在所有可能的备择假设下(如非局部、非稀疏的备择假设)进行严格证明。因此,这个功效优势的 claim 是有条件的(限于局部备择假设和特定协方差结构)。
四、开放问题¶
- 非稀疏干扰参数下的检验:本文的核心假设是干扰参数 \(\boldsymbol{\beta}_2\) 是稀疏的。如果 \(\boldsymbol{\beta}_2\) 是稠密的(例如,所有干扰协变量都有微小效应),Lasso 估计失效,OSFT 是否还能工作?能否用其他高维估计方法(如 Ridge 回归)替代 Lasso 进行正交化?这扎根于本文对 \(\boldsymbol{\beta}_2\) 稀疏性的依赖。
- 检验功效的进一步刻画:定理 2 给出了局部备择假设下的渐近功效。能否给出一个精确的、非渐近的功效下界?或者,能否刻画 OSFT 在非局部备择假设(如 \(\boldsymbol{\beta}_1\) 固定)下的功效?这扎根于定理 2 的局部性假设。
- 与随机矩阵理论方法的连接:如第一节所述,本文未提及基于 RMT 的高维检验。一个开放问题是:能否将 OSFT 与 RMT 中的“球形检验”或“协方差矩阵检验”思想结合,构造一个对协变量结构(如因子模型)更稳健的检验?这扎根于第一节中“值得研究者去查的问题”。
- 扩展到广义线性模型:本文的方法和理论能否自然地推广到广义线性模型(如 Logistic 回归)?正交化得分的思想在非线性模型中是否仍然有效?这扎根于本文的线性模型设定。
Maintained by 陈星宇 · Homepage · Source on GitHub