Integrated conditional moment test and beyond: when the number of covariates is divergent¶
作者: Falong Tan, Lixing Zhu
来源: Biometrika
主题: 数理统计 / 假设检验
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是高维(维数发散)回归模型的拟合优度检验。其根本的统计问题是:当协变量个数 \(p\) 随样本量 \(n\) 增长(\(p \to \infty\))时,如何检验一个参数回归模型(如线性模型、广义线性模型)是否被正确指定?经典的低维检验方法(如基于非参数回归的局部平滑检验、基于残差经验过程的全局平滑检验)在 \(p\) 固定时已有成熟理论,但当 \(p\) 发散时,这些方法面临维数诅咒导致的检验功效崩溃、极限分布改变、以及bootstrap逼近失效等根本性困难。当前该方向的成熟度处于从低维向高维过渡的活跃期,已有若干针对特定模型(如单指标模型、广义线性模型)的检验方法,但缺乏一个统一且适用于一般参数回归模型的框架。
发展脉络¶
奠基工作(1970s-1990s):经典模型检验理论的基础是Huber (1973) 和 Portnoy (1984, 1985) 关于发散维数下M-估计量的渐近理论。这些工作建立了当 \(p \to \infty\) 时参数估计的一致性条件,但未涉及检验问题。同时期,Stute (1997) 提出了基于残差标记经验过程的全局平滑检验(即integrated conditional moment, ICM检验),该检验在固定维数下对 \(n^{-1/2}\) 阶局部备择假设敏感,是本文的直接前身。Koul (2002) 和 Khmaladze & Koul (2004) 发展了鞅变换方法,使检验统计量渐近分布自由。
主要进展(2000s-2010s):Fan & Peng (2004) 将非凹惩罚似然方法推广到发散维数,建立了参数维数发散时惩罚估计量的oracle性质和渐近正态性,为高维检验提供了估计理论基础。Zou & Zhang (2009) 提出了自适应弹性网,在发散维数下同时实现模型选择和估计,并建立了oracle性质。Zhang & Huang (2008) 证明了Lasso在稀疏Riesz条件下的率一致性。这些工作主要关注估计而非检验。
当前frontier(2010s-至今):Guo & Zhu (2014) 提出了针对广义线性模型的降维模型自适应检验,通过将高维协变量投影到低维方向来缓解维数诅咒,使检验对局部备择假设的敏感性达到单变量情形下的速率。Tan & Zhu (2019) 进一步将这一思想推广到单指标模型,建立了发散维数下残差标记经验过程的收敛性,并构造了鞅变换检验。Shi et al. (2019) 针对高维广义线性模型提出了部分惩罚似然比、得分和Wald检验,证明了它们在发散维数下的卡方极限分布。本文的位置:在上述工作的基础上,本文试图将经典的ICM检验推广到一般参数回归模型的发散维数场景,解决原始ICM检验在 \(p \to \infty\) 时极限分布改变和wild bootstrap失效的问题。
子线索聚类¶
这些被引文献大致落在三条子线索上:
-
发散维数下的估计理论:Fan & Peng (2004), Zou & Zhang (2009), Zhang & Huang (2008)。这一簇关注参数维数发散时估计量的渐近性质(一致性、渐近正态性、oracle性质),为检验提供估计基础。本文引用了Fan & Peng (2004) 和 Zhang & Huang (2008) 来设定其正则条件(条件(B1))。
-
发散维数下的模型检验:Tan & Zhu (2019), Guo & Zhu (2014), Shi et al. (2019)。这一簇直接关注检验问题,核心策略是通过降维(投影)或正则化来克服维数诅咒。本文直接继承自Tan & Zhu (2019) 的“自适应模型”思想,并将其从单指标模型推广到一般参数回归模型。
-
经典低维检验方法:Stute (1997), Koul (2002), Khmaladze & Koul (2004)。这一簇提供了ICM检验和鞅变换等基础工具。本文试图将ICM检验推广到高维,并指出其在发散维数下的局限性。
这个方向在追问的核心问题¶
- 检验的尺度正确性:当 \(p \to \infty\) 时,检验统计量在原假设下的极限分布是否仍然存在且可计算?经典ICM检验的极限分布从固定维数下的高斯过程退化为发散维数下的退化分布,导致无法确定临界值。
- 检验的功效:检验能否检测到与零假设偏离 \(n^{-1/2}\) 阶的局部备择假设?这是最优检验的黄金标准。低维ICM检验能做到,但高维下维数诅咒会严重削弱功效。
- bootstrap的有效性:wild bootstrap等重抽样方法能否在发散维数下正确逼近检验统计量的零分布?本文指出原始ICM检验的wild bootstrap在发散维数下失效。
- 估计量的渐近线性表示:为了构造检验统计量,需要参数估计量的渐近线性表示。在发散维数下,这一表示的成立条件是什么?本文声称推导了“文献中最快可能速率”下的渐近线性表示。
⚠️ 作者的framing¶
作者将缺口frame成:经典ICM检验在发散维数下完全失效(极限分布改变、bootstrap失效),而现有针对特定模型(如单指标模型)的降维自适应检验无法直接推广到一般参数回归模型。因此,本文的“显然的下一步”是:提出一个投影自适应模型版本的ICM检验,使其在发散维数下保持尺度正确性、对 \(n^{-1/2}\) 阶局部备择假设敏感,且wild bootstrap仍然有效。
被淡化或回避的竞争路线: - 正则化检验路线(如Shi et al. 2019的惩罚似然比检验):作者在引言中提及,但未详细比较。这条路线通过正则化(如Lasso)进行变量选择后再检验,与本文的投影降维路线在哲学上不同。作者可能回避了“当真实模型稀疏时,正则化路线是否更优”这一比较。 - 基于去偏Lasso的检验:近年来在高维推断中非常活跃(如van de Geer et al. 2014, Zhang & Zhang 2014),但本文未引用。这些方法通过构造去偏估计量来对单个系数进行检验,但本文关注的是整体模型拟合优度,而非单个系数的显著性,因此可能被视为不同问题。
什么明显该被引/该存在、却没出现在intro里? - 去偏Lasso/高维推断文献:如van de Geer, Bühlmann, Ritov, Dezeure (2014) "On asymptotically optimal confidence regions and tests for high-dimensional models" 和 Zhang & Zhang (2014) "Confidence intervals for low dimensional parameters in high dimensional linear models"。这些工作处理了高维下参数推断的经典问题,与本文的检验问题有交叉,但未被引用。这可能是一个值得研究者去查的缺口:去偏Lasso方法能否用于构造整体模型拟合优度检验? - 随机矩阵理论在高维检验中的应用:如Bai & Saranadasa (1996) 关于高维均值检验的工作,以及后续的许多发展。这些工作处理了 \(p > n\) 时检验统计量的极限分布,其技术(如随机矩阵的谱分析)可能与本文的渐近理论有联系。
张力¶
未见明显对立引用。被引工作之间在“发散维数下检验是困难的”这一判断上高度一致,只是在具体策略上有所不同(降维 vs. 正则化)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(Y \in \mathbb{R}\):响应变量(标量)。
- \(X \in \mathbb{R}^p\):协变量向量(\(p\) 维)。
- \(p = p_n\):协变量维数,随样本量 \(n\) 发散(\(p \to \infty\) 当 \(n \to \infty\))。
- \(n\):样本量。
- \(\{(X_i, Y_i)\}_{i=1}^n\):独立同分布的可观测样本。
- \(\theta \in \Theta \subseteq \mathbb{R}^q\):参数向量。注意:\(q\) 是参数维数,通常 \(q = p\)(线性模型)或 \(q = p+1\)(含截距),但一般地 \(q\) 也随 \(n\) 发散。
- \(m(X, \theta)\):已知的回归函数形式(如 \(m(X, \theta) = X^\top \theta\) 为线性模型)。
- \(\theta_0\):真实参数值(在模型正确指定下)。
- \(\hat{\theta}_n\):最小二乘估计量(或其他M-估计量)。
- \(\hat{\varepsilon}_i = Y_i - m(X_i, \hat{\theta}_n)\):残差。
- \(I(\cdot)\):示性函数。
- \(W(\cdot)\):权重函数(通常为核函数或均匀权重)。
-
潜在/不可观测量:真实误差 \(\varepsilon_i = Y_i - m(X_i, \theta_0)\)。在模型正确指定下,\(\varepsilon_i\) 是均值为0的独立同分布随机变量,但不可观测,只能通过残差 \(\hat{\varepsilon}_i\) 近似。
-
模型:
- 数据生成机制:\(Y = m(X, \theta_0) + \varepsilon\),其中 \(\mathbb{E}[\varepsilon | X] = 0\) 几乎必然。
- 待检验的原假设 \(H_0\):存在某个 \(\theta_0 \in \Theta\) 使得上述模型成立,即 \(\mathbb{E}[Y | X] = m(X, \theta_0)\) 几乎必然。
- 备择假设 \(H_1\):对任意 \(\theta \in \Theta\),\(\mathbb{E}[Y | X] \neq m(X, \theta)\) 在一个正测度集上成立。
-
要估的对象:\(\theta_0\)(通过最小二乘估计),以及检验统计量的极限分布。
-
可观测数据:
- 可观测:\(\{(X_i, Y_i)\}_{i=1}^n\),即协变量和响应变量的成对样本。
- 不可观测:真实误差 \(\varepsilon_i\) 和真实参数 \(\theta_0\)。检验依赖于残差 \(\hat{\varepsilon}_i\),它是 \(\varepsilon_i\) 的近似。
第二步:讲最小内核¶
本文的核心思想可以用一个最简特例来理解:线性模型,且 \(p\) 发散但 \(p/n \to 0\)(即 \(p\) 增长但远小于 \(n\))。
最简特例设定: - 模型:\(Y = X^\top \theta_0 + \varepsilon\),\(\mathbb{E}[\varepsilon | X] = 0\)。 - 参数维数 \(q = p\)(无截距)。 - 样本量 \(n\),维数 \(p = p_n \to \infty\),且 \(p/n \to 0\)。 - 最小二乘估计量:\(\hat{\theta}_n = (\sum_{i=1}^n X_i X_i^\top)^{-1} \sum_{i=1}^n X_i Y_i\)。 - 残差:\(\hat{\varepsilon}_i = Y_i - X_i^\top \hat{\theta}_n\)。
经典ICM检验(固定维数 \(p\)): 检验统计量为:
发散维数下的问题: 当 \(p \to \infty\) 时,上述 \(T_n\) 的极限行为发生根本变化。直观上,随着维数增加,协变量空间变得“稀疏”,核函数 \(K(X_i, X_j)\) 的值趋于0(除非 \(i=j\)),导致 \(T_n\) 的方差趋于0,极限分布退化。同时,wild bootstrap的逼近也失效。
本文的投影自适应模型ICM检验(最简特例下的形式): 核心想法:不要在高维原始空间上计算核函数,而是将协变量投影到一个低维方向,然后在该低维空间上计算ICM统计量。这个投影方向应该“自适应于模型”,即捕捉模型对 \(Y\) 的预测方向。
具体地,定义投影变量:
为什么这个想法有效? 1. 降维:原始ICM在 \(p\) 维空间上计算核,而投影ICM在1维空间上计算核。这完全避免了维数诅咒,因为核函数不再因高维而退化。 2. 自适应:投影方向 \(\hat{\theta}_n\) 是数据驱动的,且是模型参数的估计。在原假设下,\(\mathbb{E}[Y | X] = X^\top \theta_0\),因此 \(U = X^\top \theta_0\) 是充分降维方向(sufficient dimension reduction direction)。这意味着,给定 \(U\),\(Y\) 的条件期望完全由 \(U\) 决定,而 \(X\) 的其他方向不提供额外信息。因此,检验 \(Y\) 与 \(U\) 的残差相关性就等价于检验原始模型。 3. 保持功效:由于是在1维空间上检验,该检验对 \(n^{-1/2}\) 阶局部备择假设仍然敏感,这与固定维数下的最优速率一致。
这个特例下的核心命题: 在原假设 \(H_0\) 下,\(\tilde{T}_n\) 收敛到一个非退化的极限分布(具体地,一个高斯过程的泛函),且该极限分布可以通过wild bootstrap一致地逼近。在备择假设下,\(\tilde{T}_n\) 以概率1趋于无穷,从而检验是一致的。
这个特例揭示了本文的全部核心数学困难: - 需要证明 \(\hat{\theta}_n\) 在 \(p \to \infty\) 下的一致性,且其收敛速度足够快,使得用 \(\hat{\theta}_n\) 代替 \(\theta_0\) 进行投影不会影响检验统计量的极限分布。 - 需要证明基于估计的投影变量 \(U_i = X_i^\top \hat{\theta}_n\) 的核函数 \(K(U_i, U_j)\) 的U-统计量收敛到基于真实投影变量 \(U_i^* = X_i^\top \theta_0\) 的极限。 - 需要证明wild bootstrap在发散维数下仍然有效,这要求bootstrap样本的统计量与原样本统计量具有相同的极限分布。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当协变量维数 \(p\) 随样本量 \(n\) 发散时,如何构造一个对一般参数回归模型(\(Y = m(X, \theta) + \varepsilon\))进行拟合优度检验的方法,使其克服经典ICM检验在发散维数下的极限分布退化和bootstrap失效问题。
- 核心工具/方法:提出投影自适应模型ICM检验(projected adaptive-to-model ICM test),通过将高维协变量 \(X\) 投影到由模型参数估计 \(\hat{\theta}_n\) 定义的一维方向 \(U = X^\top \hat{\theta}_n\) 上,然后在该一维空间上构造基于核函数的ICM检验统计量。
- 主要结论:新检验在原假设下具有正确的渐近尺度(极限分布非退化),对 \(n^{-1/2}\) 阶局部备择假设敏感(达到最优检验速率),且wild bootstrap在发散维数下仍然有效。同时,推导了最小二乘估计量在参数维数以“文献中最快可能速率”发散时的一致性和渐近线性表示。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 模型:\(Y = m(X, \theta_0) + \varepsilon\),\(\mathbb{E}[\varepsilon | X] = 0\)。\(m(\cdot, \cdot)\) 是已知函数,关于 \(\theta\) 可微。
- 参数维数:\(q = q_n\),随 \(n\) 发散。在本文的主要设定中,\(q = p\)(线性模型)或更一般地,\(q\) 与 \(p\) 同阶。
- 估计量:\(\hat{\theta}_n\) 是(非线性)最小二乘估计量,即 \(\hat{\theta}_n = \arg\min_\theta \sum_{i=1}^n (Y_i - m(X_i, \theta))^2\)。
- 投影变量:\(U_i = X_i^\top \hat{\theta}_n\)(对于线性模型)或更一般地,\(U_i = \frac{\partial m}{\partial \theta}(X_i, \hat{\theta}_n)^\top \hat{\theta}_n\)(对于非线性模型,通过一阶泰勒展开近似)。本文主要处理线性模型,但声称可推广。
- 检验统计量:
\[T_n = \frac{1}{n} \sum_{i=1}^n \sum_{j=1}^n \hat{\varepsilon}_i \hat{\varepsilon}_j K_h(U_i, U_j)\]其中 \(K_h(u, v) = h^{-1} K((u-v)/h)\) 是一个一维核函数(如高斯核),\(h\) 是带宽。
- 关键假设(逐条说明):
- (A1) 矩条件:\(\mathbb{E}[||X||^4] < \infty\),\(\mathbb{E}[\varepsilon^4] < \infty\)。保证估计量和检验统计量的矩存在。
- (A2) 设计矩阵条件:\(\mathbb{E}[XX^\top]\) 的最小特征值有正下界,最大特征值有上界。这是发散维数下估计一致性的标准条件(类似Fan & Peng 2004的条件(A2)),确保设计矩阵非奇异。
- (A3) 维数增长速率:\(p = o(n^{1/3})\)(或更宽松的 \(p = o(n^{1/2})\),取决于具体结果)。这是本文理论成立的关键条件,限制了维数相对于样本量的增长速度。相比Tan & Zhu (2019) 的 \(p = o(n^{1/3}/\log n)\),本文的速率可能更宽松或相当。
- (A4) 核函数条件:\(K(\cdot)\) 是对称、有界、Lipschitz连续的核函数,且 \(\int K(u) du = 1\)。标准核函数条件。
- (A5) 带宽条件:\(h \to 0\),\(nh \to \infty\),且 \(h\) 的收敛速度与 \(p\) 的发散速度协调。确保核估计的一致性。
- 相比已有文献的放宽/强化:本文的主要贡献在于不要求模型为线性或单指标模型,而是适用于一般参数回归模型(尽管主要理论结果在线性模型下给出)。相比Tan & Zhu (2019) 针对单指标模型,本文的设定更一般。相比Shi et al. (2019) 的惩罚似然比检验,本文不要求稀疏性假设。
主要结果¶
定理1(估计量的一致性和渐近线性表示): 在条件(A1)-(A3)下,当 \(p = o(n^{1/3})\) 时,最小二乘估计量 \(\hat{\theta}_n\) 满足:
定理2(检验统计量在原假设下的极限分布): 在条件(A1)-(A5)下,当 \(p = o(n^{1/3})\) 时,在原假设 \(H_0\) 下,检验统计量 \(T_n\) 收敛到一个非退化的极限分布:
定理3(检验统计量在备择假设下的性质): 在条件(A1)-(A5)下,当 \(p = o(n^{1/3})\) 时: - 全局备择假设:\(T_n \xrightarrow{p} \infty\),检验是一致的(功效趋于1)。 - 局部备择假设:考虑备择假设 \(H_1: \mathbb{E}[Y | X] = m(X, \theta_0) + n^{-1/2} \delta(X)\),其中 \(\delta(X)\) 是一个非零函数。则 \(T_n\) 以非零概率拒绝 \(H_0\),即检验对 \(n^{-1/2}\) 阶局部备择假设敏感。这个速率是最优的,与固定维数下ICM检验的敏感性一致。
定理4(wild bootstrap的有效性): 在条件(A1)-(A5)下,当 \(p = o(n^{1/3})\) 时,基于wild bootstrap的临界值 \(c_\alpha^*\) 满足:
证明路线与技术技巧¶
整体路线(3-5步逻辑主干):
-
第一步:建立估计量的渐近性质。证明 \(\hat{\theta}_n\) 在 \(p = o(n^{1/3})\) 下是 \(\sqrt{n/p}\)-一致的,并推导其渐近线性表示。这一步是后续所有结果的基础。关键工具:M-估计理论在发散维数下的推广,利用经验过程理论控制高阶项。
-
第二步:将检验统计量分解为主项和余项。将 \(T_n\) 中的残差 \(\hat{\varepsilon}_i\) 用 \(\varepsilon_i\) 和估计误差 \(\hat{\theta}_n - \theta_0\) 表示,得到:
\[T_n = \frac{1}{n} \sum_{i,j} \varepsilon_i \varepsilon_j K_h(U_i^*, U_j^*) + \text{(涉及估计误差的项)} + o_p(1)\]其中 \(U_i^* = X_i^\top \theta_0\) 是基于真实参数的投影。这一步的关键是证明涉及估计误差的项是 \(o_p(1)\),从而 \(T_n\) 的极限分布由第一项(基于真实误差和真实投影的U-统计量)决定。 -
第三步:证明主项的极限分布。主项是一个退化的U-统计量(因为 \(\varepsilon_i\) 是独立的且均值为0)。利用U-统计量的渐近理论(特别是Hájek投影和鞅差分解),证明其收敛到一个高斯过程的泛函。关键技巧:将U-统计量表示为经验过程的泛函,然后利用经验过程理论的Donsker定理证明其弱收敛。
-
第四步:证明bootstrap的有效性。构造bootstrap版本的检验统计量 \(T_n^*\),证明在bootstrap概率空间下,\(T_n^*\) 的条件极限分布与 \(T_n\) 的(无条件)极限分布相同。关键工具:wild bootstrap的耦合理论,利用Gaussian coupling或bootstrap的Mallows距离论证。
关键跳跃点: - 最吃功夫的引理:证明当 \(p\) 发散时,用 \(\hat{\theta}_n\) 代替 \(\theta_0\) 进行投影所产生的误差项是 \(o_p(1)\)。这要求 \(\hat{\theta}_n\) 的收敛速度足够快(\(\sqrt{p/n} = o(1)\)),且核函数 \(K_h\) 的Lipschitz常数与 \(h\) 的协调关系。难点在于:\(p\) 发散导致估计误差的累积效应,需要精细的矩估计和概率不等式。 - 作者绕过去的办法:作者可能通过假设 \(p = o(n^{1/3})\) 来简化问题。在这个速率下,\(\sqrt{p/n} = o(n^{-1/3})\),而核估计的偏差项通常为 \(O(h^2)\),方差项为 \(O(1/(nh))\)。通过选择 \(h \asymp n^{-1/5}\),可以使得估计误差项被核估计的方差项主导,从而被吸收进 \(o_p(1)\)。
技术技巧点名: - 经验过程理论:用于控制 \(\hat{\theta}_n\) 的一致性和渐近线性表示中的高阶项(如随机 equicontinuity)。 - U-统计量的Hájek投影:将退化的U-统计量分解为独立和的主项和可忽略的余项,用于推导极限分布。 - 鞅差分解:用于处理核函数 \(K_h(U_i, U_j)\) 带来的依赖结构,将U-统计量表示为鞅差序列的和。 - wild bootstrap的耦合论证:通过构造与原始样本独立的辅助随机变量(如Rademacher变量),证明bootstrap统计量的条件分布与原分布一致。
真实例子与应用¶
本文包含一个真实数据例子和一个模拟实验。
- 真实数据例子:
- 数据:一个关于波士顿房价的数据集(Boston housing data),包含506个观测和13个协变量(如犯罪率、房间数等)。响应变量是房价中位数。
- 方法应用:作者拟合了一个线性模型(\(Y = X^\top \theta + \varepsilon\)),然后应用本文提出的投影自适应ICM检验来检验该线性模型是否被正确指定。同时,也应用了原始ICM检验作为对比。
- 结果:本文提出的检验在5%显著性水平下拒绝了线性模型的原假设,而原始ICM检验未能拒绝。作者解释为:本文的检验在高维(\(p=13\) 相对于 \(n=506\) 不算高,但作者将其视为发散维数的一个实例)下具有更高的功效,能够检测到原始ICM检验遗漏的模型误指定。
-
这个例子想说明什么:展示本文方法在实际数据中相比经典方法的优势,即在高维(或中等维数)下具有更高的检验功效,能够发现更细微的模型误指定。
-
模拟实验:
- 场景:生成不同维数(\(p=5, 10, 20\))和样本量(\(n=100, 200\))的数据,考虑线性模型和几种非线性备择假设(如二次项、交互项)。
- 对比方法:本文的投影自适应ICM检验 vs. 原始ICM检验 vs. 其他现有检验(如Guo & Zhu 2014的检验)。
- 结果:在维数较低时(\(p=5\)),所有方法表现相近。当维数增加时(\(p=10, 20\)),原始ICM检验的size(第一类错误)严重偏离名义水平(如名义5%下实际达到20-30%),而本文的检验能较好地控制size。在功效方面,本文的检验在大多数设定下优于或等于对比方法。
- 这个例子想说明什么:验证理论结果——原始ICM检验在发散维数下失效(size扭曲),而本文的检验能保持正确的尺度并具有良好功效。
🔎 结论是否比证明窄¶
- 窄结论1:主要理论结果(定理1-4)是在线性模型(\(m(X, \theta) = X^\top \theta\))下严格证明的。作者在引言和摘要中声称适用于“一般参数回归模型”,但在正文中,主要证明都围绕线性模型展开。对于非线性模型,作者仅给出了一些讨论和推广思路,但没有严格的证明。因此,结论的适用范围比声称的要窄。
- 窄结论2:维数增长速率 \(p = o(n^{1/3})\) 是证明成立的关键条件。作者声称这是“文献中最快可能速率”,但这一说法可能依赖于特定的假设(如设计矩阵的非奇异性)。在更一般的设定下(如允许 \(p > n\) 或稀疏性),更快的速率(如 \(p = o(n^{1/2})\))可能成立,但本文未证明。
- 窄结论3:wild bootstrap的有效性证明依赖于特定的bootstrap方案(如基于Rademacher变量的残差扰动)。其他bootstrap方案(如残差bootstrap、基于模型的bootstrap)是否同样有效,本文未讨论。
四、开放问题¶
-
非线性模型的严格推广:本文的主要理论结果在线性模型下建立。将投影自适应ICM检验严格推广到一般参数回归模型(如广义线性模型、单指标模型)需要什么条件?特别是,当 \(m(X, \theta)\) 关于 \(\theta\) 非线性时,投影方向 \(U = \frac{\partial m}{\partial \theta}(X, \hat{\theta})^\top \hat{\theta}\) 的渐近性质是否仍然成立?扎根点:本文第2节末尾的讨论,作者声称“可以类似地推广”,但未给出证明。
-
更快的维数发散速率:本文要求 \(p = o(n^{1/3})\)。能否在 \(p = o(n^{1/2})\) 甚至 \(p = O(n)\) 下建立类似的理论?这可能需要更强的条件(如稀疏性、协方差结构的特殊形式)或不同的技术工具(如随机矩阵理论)。扎根点:定理1的陈述,作者指出 \(o(n^{1/3})\) 是“文献中最快可能速率”,但未证明这是否为必要条件。
-
与去偏Lasso检验的比较:本文未引用去偏Lasso文献。对于高维稀疏模型(\(p > n\)),去偏Lasso方法可以构造单个系数的置信区间和检验。能否将去偏Lasso的思想用于构造整体模型拟合优度检验?本文的投影自适应方法在稀疏模型下是否仍然有效?扎根点:引言中未提及去偏Lasso文献,这是一个明显的文献缺口。
-
带宽选择的敏感性:本文的检验统计量依赖于带宽 \(h\) 的选择。在实际应用中,带宽如何选择?不同带宽选择对检验的size和功效有何影响?是否存在数据驱动的带宽选择方法(如交叉验证)?扎根点:定理2和3的陈述中,带宽 \(h\) 被假设为满足某些速率条件,但未给出具体选择准则。
-
检验的局部幂函数:本文证明了检验对 \(n^{-1/2}\) 阶局部备择假设敏感,但未给出局部幂函数的具体形式。能否推导出检验在局部备择假设下的渐近功效,从而与最优检验(如似然比检验)进行比较?扎根点:定理3的陈述,仅给出了“以非零概率拒绝”的定性结论,未给出定量功效。
Maintained by 陈星宇 · Homepage · Source on GitHub