Specification Testing of Regression Models with Mixed Discrete and Continuous Predictors¶
作者: Xuehu Zhu, Qiming Zhang, Lixing Zhu, Jun Zhang, Luoyao Yu
来源: Journal of Business & Economic Statistics
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://doi.org/10.1080/07350015.2022.2110879
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是回归模型的设定检验(specification testing),核心问题是:给定一个参数化的回归模型(如线性模型、部分线性模型),如何检验该模型是否正确地刻画了响应变量与预测变量之间的关系?根本的统计挑战在于,当预测变量包含离散和连续变量时,如何构造一个既能对任意偏离原假设的备择假设都有检测能力(omnibus),又能有效缓解“维数灾难”的检验统计量。当前该领域的成熟度较高,已有大量基于非参数平滑(如核方法)和基于经验过程的检验方法,但针对混合型预测变量的自适应检验仍是一个活跃的研究前沿。
发展脉络(history)¶
根据论文引言和参考文献,该方向的发展脉络可梳理如下:
-
奠基工作:非参数平滑检验的提出
- Hardle & Mammen (1993):提出了基于核平滑的检验,通过比较参数拟合与非参数拟合的差异来检验模型设定。这是该领域的经典奠基工作,但其检验统计量的渐近分布依赖于非参数估计的偏差,且对维数敏感。
- Zheng (1996):提出了一个基于U-统计量的非参数检验,通过核函数构造条件矩检验,避免了直接估计非参数回归函数,简化了渐近理论。但同样面临维数诅咒——随着连续预测变量维数增加,检验的局部检测速率急剧下降。
-
主要进展:自适应模型检验(adaptive-to-model tests)
- Guo, Wang & Zhu (2016):提出了“自适应模型检验”的概念。核心思想是:如果原假设下的参数模型是正确设定的,那么该模型本身已经蕴含了关于条件均值函数的结构信息。利用这个结构,可以将有效连续预测变量的维数“降”到模型实际需要的维数,从而缓解维数灾难。该工作主要针对连续预测变量。
- Zhu, Guo, Zhu, Zhang & Yu (2021):将自适应模型检验推广到部分线性模型,其中部分预测变量是离散的。他们通过将离散变量视为“分组变量”,在每个离散组合下分别进行降维,但这种方法在离散变量水平数较多时效率下降。
-
当前Frontier:混合型预测变量的统一处理
- 当前的前沿是如何统一地处理离散和连续预测变量,使得检验的检测速率只依赖于连续变量的“有效维数”,而不受离散变量水平数的直接影响。本文正是针对这一缺口提出的。
-
本文的位置
- 本文是自适应模型检验在混合型预测变量场景下的一个推广和深化。它通过引入“部分中心子空间”(partial central subspace)的概念,并发展了一种新的“离散化-期望OLS”估计方法,将离散变量和连续变量纳入一个统一的降维框架,从而实现了“检验表现如同只有一个连续预测变量”的目标。
子线索聚类¶
这些被引文献大致落在以下三条子线索上:
-
线索一:基于非参数平滑的全局检验(Global Smoothing Tests)
- 代表工作:Hardle & Mammen (1993), Fan & Li (1996), Lavergne & Patilea (2012)。
- 核心思想:直接比较参数拟合值与非参数拟合值(如核回归)的差异。这类检验通常对备择假设有omnibus性质,但维数灾难严重,且需要选择平滑参数(带宽)。
- 当前瓶颈:在高维连续预测变量下,非参数估计的收敛速度极慢,导致检验功效低下。
-
线索二:基于经验过程的检验(Empirical Process-based Tests)
- 代表工作:Stute (1997), Stute, Thies & Zhu (1998), Escanciano (2006)。
- 核心思想:基于残差与某个指标函数(如指示函数)的协方差过程构造检验。这类检验通常不需要选择带宽,但维数灾难同样存在,且其检测速率通常低于局部平滑检验。
- 当前瓶颈:对高维预测变量的适应性较差,且其渐近分布通常是非标准的(如高斯过程),需要bootstrap逼近。
-
线索三:自适应模型检验(Adaptive-to-Model Tests)
- 代表工作:Guo, Wang & Zhu (2016), Zhu, Guo, Zhu, Zhang & Yu (2021), 本文。
- 核心思想:利用原假设下参数模型的结构信息进行降维,使得检验的检测速率只依赖于模型中的“有效维数”,而非原始预测变量的总维数。
- 当前瓶颈:如何有效处理离散变量,以及如何将降维方法(如充分降维)与检验构造无缝结合。
这个方向在追问的核心问题¶
- 如何构造一个对任意备择假设都有检测能力(omnibus)的检验? 这是所有非参数检验的根本要求。
- 如何缓解维数灾难,使得检验在连续预测变量维数较高时仍能保持合理的功效? 这是该领域最核心的挑战。
- 如何处理混合型预测变量(离散+连续)? 离散变量的存在使得传统的连续降维方法(如基于梯度的)失效,需要新的处理策略。
- 如何构造一个渐近分布简单(如标准正态)且bootstrap逼近效果好的检验统计量? 这关系到检验的实际可用性。
⚠️ 作者的 framing¶
- 作者的缺口frame:作者将缺口frame为“现有自适应模型检验(如Guo et al., 2016)主要针对连续预测变量,而针对混合型预测变量的检验要么效率低下(如Zhu et al., 2021),要么需要复杂的离散变量处理”。因此,本文的贡献被定位为“提出一个统一的、能同时处理离散和连续变量的自适应模型检验,使得检验的检测速率达到仅有一个连续预测变量时的水平”。
- 被淡化/回避的竞争路线:作者淡化了基于经验过程的检验(如Stute, 1997)在混合变量下的潜力。这些检验理论上可以通过将离散变量视为指标函数的一部分来处理,但作者认为其检测速率不如局部平滑检验。作者也回避了直接使用非参数核回归进行检验的路线(如Hardle & Mammen, 1993),因为其维数灾难问题在混合变量下更为严重。
- 值得研究者去查的问题:什么明显该被引/该存在、却没出现在intro里? 论文没有引用任何关于“充分降维”(Sufficient Dimension Reduction, SDR)在假设检验中应用的近期工作,特别是那些将SDR与模型设定检验结合的工作。例如,Li (2018) 或 Cook & Forzani (2019) 的相关工作。这可能是作者有意为之(因为本文的SDR方法是作为副产品发展的),也可能是一个值得研究者去核实的潜在缺口。
张力¶
未见明显对立引用。该领域的发展脉络较为清晰,不同方法(平滑 vs. 经验过程 vs. 自适应)各有优劣,但并未出现根本性的矛盾结论。主要的张力在于“检测速率”与“对备择假设的敏感性”之间的权衡,但这是所有非参数检验的固有特性,而非文献间的矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( Y \in \mathbb{R} \):响应变量(连续)。
- \( X \in \mathbb{R}^p \):连续预测变量(\( p \) 维)。
- \( Z \in \mathbb{R}^q \):离散预测变量(\( q \) 维,每个分量取有限个值,如分类变量)。
- \( (Y_i, X_i, Z_i), i=1,\dots,n \):独立同分布的样本。
- \( m(x, z) = \mathbb{E}[Y | X=x, Z=z] \):未知的条件均值函数(回归函数)。
- \( g(x, z; \beta) \):一个已知形式的参数模型,用于近似 \( m(x, z) \)。\( \beta \) 是未知的有限维参数。
- \( \hat{\beta} \):基于样本对 \( \beta \) 的某个估计量(如最小二乘估计)。
- \( \varepsilon = Y - m(X, Z) \):不可观测的误差项,满足 \( \mathbb{E}[\varepsilon | X, Z] = 0 \)。
- \( \hat{\varepsilon}_i = Y_i - g(X_i, Z_i; \hat{\beta}) \):残差。
- \( \mathcal{S}_{Y|X}^{(Z)} \):给定 \( Z \) 下,\( Y \) 对 \( X \) 的部分中心子空间(partial central subspace)。这是一个 \( d \) 维子空间(\( d \le p \)),其基向量 \( B \) 满足:\( Y \perp X | B^\top X, Z \)。即,给定 \( B^\top X \) 和 \( Z \) 后,\( Y \) 与 \( X \) 条件独立。这是充分降维的核心概念。
- \( \hat{B} \):对 \( B \) 的估计。
- \( \hat{U}_i = \hat{B}^\top X_i \):降维后的连续预测变量(\( d \) 维)。
-
模型:
- 原假设 \( H_0 \):存在某个 \( \beta_0 \),使得 \( m(x, z) = g(x, z; \beta_0) \) 几乎处处成立。即,参数模型是正确设定的。
- 备择假设 \( H_1 \):对于所有 \( \beta \),\( \mathbb{P}(m(X, Z) \neq g(X, Z; \beta)) > 0 \)。即,参数模型是错误的。
- 数据生成机制:\( Y = m(X, Z) + \varepsilon \),其中 \( \varepsilon \) 是均值为0、方差为 \( \sigma^2(X, Z) \) 的随机误差,且 \( \mathbb{E}[\varepsilon | X, Z] = 0 \)。
-
可观测数据:
- 研究者能观测到的是 \( (Y_i, X_i, Z_i) \) 的独立同分布样本。
- 想要但观测不到的是:真实的回归函数 \( m(x, z) \)、误差项 \( \varepsilon_i \)、以及部分中心子空间 \( \mathcal{S}_{Y|X}^{(Z)} \) 及其基 \( B \)。这些都需要通过假设和估计来推断。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设只有一个连续预测变量 \( X \)(\( p=1 \))和一个二值离散预测变量 \( Z \in \{0, 1\} \)(\( q=1 \))。原假设模型是线性模型:\( H_0: Y = \beta_0 + \beta_1 X + \beta_2 Z + \varepsilon \)。
-
传统非参数检验的困境:如果直接用核方法检验,需要在一个二维空间(\( X, Z \))上进行非参数平滑。由于 \( Z \) 是离散的,通常的做法是分别在 \( Z=0 \) 和 \( Z=1 \) 的子样本上对 \( X \) 进行一维核平滑。这相当于做了两个一维检验,然后合并。当 \( Z \) 的水平数很多时,每个子样本的样本量会变得很小,导致检验功效极低。
-
本文的自适应思想:
- 利用模型结构降维:在原假设 \( H_0 \) 下,模型是线性的。这意味着,给定 \( Z \),条件均值函数 \( \mathbb{E}[Y | X, Z] \) 是 \( X \) 的线性函数。因此,部分中心子空间 \( \mathcal{S}_{Y|X}^{(Z)} \) 的维数 \( d=1 \),其基向量就是 \( X \) 的系数 \( \beta_1 \)。换句话说,\( Y \) 对 \( X \) 的依赖完全通过一个一维线性组合 \( \beta_1 X \) 来体现。
-
构造投影检验统计量:作者构造的检验统计量 \( T_n \) 的核心是:
\[T_n = \frac{1}{n(n-1)} \sum_{i \neq j} \hat{\varepsilon}_i \hat{\varepsilon}_j K_h(\hat{U}_i - \hat{U}_j) \mathbb{I}(Z_i = Z_j)\]其中:- \( \hat{\varepsilon}_i \) 是残差。
- \( K_h(\cdot) = K(\cdot / h) / h \) 是一个一维核函数,带宽为 \( h \)。
- \( \hat{U}_i = \hat{B}^\top X_i \) 是估计出的降维后的连续预测变量。在这个特例中,\( \hat{U}_i = \hat{\beta}_1 X_i \)(即线性预测值的一部分)。
- \( \mathbb{I}(Z_i = Z_j) \) 是指示函数,表示只比较具有相同离散变量值的观测对。
-
为什么这个检验有效?
- 在原假设下:\( \hat{\varepsilon}_i \) 是真实误差 \( \varepsilon_i \) 的近似。由于 \( \mathbb{E}[\varepsilon_i | X_i, Z_i] = 0 \),且 \( \varepsilon_i \) 与 \( \varepsilon_j \) 独立(\( i \neq j \)),所以 \( T_n \) 的期望近似为0。其渐近正态性可以通过U-统计量的中心极限定理得到。
- 在备择假设下:如果模型错误,那么 \( \hat{\varepsilon}_i \) 会包含模型偏差 \( m(X_i, Z_i) - g(X_i, Z_i; \hat{\beta}) \)。这个偏差与 \( \hat{U}_i \) 相关,因此当 \( \hat{U}_i \) 和 \( \hat{U}_j \) 接近时,\( \hat{\varepsilon}_i \) 和 \( \hat{\varepsilon}_j \) 也会相关,导致 \( T_n \) 的期望偏离0,从而检测出模型错误。
- 关键优势:由于我们只对降维后的一维变量 \( \hat{U} \) 进行核平滑,并且只比较相同 \( Z \) 的观测对,检验的“有效维数”是1,而不是原始的 \( p+q \)。因此,其检测速率可以达到一维局部平滑检验的水平(即 \( n^{-1/2} h^{-1/4} \) 量级的局部备择假设),而不会受到 \( p \) 或 \( q \) 的直接影响。这就是“自适应”的含义:检验自动适应了原假设模型的结构,将高维问题转化为一维问题。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对混合型(离散+连续)预测变量的回归模型,提出了一种非参数投影自适应模型设定检验,以解决现有检验在混合变量下维数灾难严重或效率低下的问题。
- 核心工具/方法:利用部分中心子空间(partial central subspace)进行降维,将有效连续预测变量的维数降至模型结构所决定的维数 \( d \);并发展了一种“离散化-期望OLS”(Discretization-Expectation OLS, DE-OLS)方法作为副产品来估计该子空间。
- 主要结论:检验统计量在原假设下渐近正态,对备择假设具有omnibus性质,且其检测局部备择假设的速率与仅有一个连续预测变量时的局部平滑检验相同,显著缓解了维数灾难。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 模型设定:考虑一般回归模型 \( Y = m(X, Z) + \varepsilon \),其中 \( X \in \mathbb{R}^p \) 连续,\( Z \in \mathbb{R}^q \) 离散(每个分量取有限个值)。原假设 \( H_0: m(x, z) = g(x, z; \beta) \) 对某个 \( \beta \) 成立。
- 假设A1(模型光滑性):参数模型 \( g(x, z; \beta) \) 对 \( \beta \) 和 \( x \) 足够光滑(如二阶连续可导),且 \( \hat{\beta} \) 是 \( \sqrt{n} \)-相合的估计量。这是标准假设,保证参数估计的误差不影响检验的一阶渐近性质。
- 假设A2(部分中心子空间的存在性与唯一性):存在一个 \( d \) 维子空间 \( \mathcal{S}_{Y|X}^{(Z)} \),其基为 \( B \in \mathbb{R}^{p \times d} \),使得 \( Y \perp X | B^\top X, Z \)。且 \( d \) 是已知的或可被一致估计的。这是本文方法的核心假设,它保证了降维的可行性。相比已有文献(如Guo et al., 2016),本文明确处理了 \( Z \) 的存在,使得降维是在给定 \( Z \) 的条件下进行的。
- 假设A3(DE-OLS估计的一致性):所提出的DE-OLS方法能一致地估计部分中心子空间 \( \mathcal{S}_{Y|X}^{(Z)} \),即 \( \hat{B} \) 是 \( B \) 的相合估计。这是检验统计量能够实现自适应降维的技术保证。
- 假设A4(核函数与带宽条件):核函数 \( K(\cdot) \) 是二阶核,带宽 \( h \) 满足 \( h \to 0 \) 且 \( n h^{d} \to \infty \)。这是核平滑估计的标准条件。注意,这里的 \( d \) 是部分中心子空间的维数,通常远小于 \( p \),因此带宽条件比直接对 \( X \) 进行核平滑要宽松得多。
- 相比已有文献的放宽/强化:
- 放宽:相比Zhu et al. (2021) 需要为每个离散组合分别估计子空间,本文通过DE-OLS方法统一处理,放宽了对离散变量水平数的限制。
- 强化:相比Guo et al. (2016) 只考虑连续变量,本文明确处理了离散变量,但代价是需要假设部分中心子空间的存在性,并发展新的估计方法。
主要结果¶
-
定理1(检验统计量的渐近正态性):
- 陈述:在原假设 \( H_0 \) 下,经过适当标准化的检验统计量 \( T_n \) 依分布收敛于标准正态分布 \( N(0, 1) \)。
- 直觉:\( T_n \) 本质上是一个退化的U-统计量(因为 \( \mathbb{E}[\varepsilon_i | X_i, Z_i] = 0 \) 导致其核的期望为0)。通过U-统计量的投影方法(Hájek projection),可以证明其渐近等价于一个独立同分布随机变量的和,从而由中心极限定理得到正态性。
- 必要条件:需要假设A1-A4,以及误差项 \( \varepsilon \) 的有限四阶矩。
- 解决的技术难点:难点在于处理估计的 \( \hat{B} \) 和 \( \hat{\beta} \) 带来的额外变异性。作者证明,由于 \( \hat{B} \) 和 \( \hat{\beta} \) 都是 \( \sqrt{n} \)-相合的,它们对 \( T_n \) 的影响是渐近可忽略的(即 \( o_p(1) \)),从而保证了极限分布与已知参数情形相同。
-
定理2(检验的局部检测能力):
- 陈述:考虑局部备择假设 \( H_{1n}: m(x, z) = g(x, z; \beta_0) + C_n \delta(x, z) \),其中 \( \delta(x, z) \) 是一个非零函数,\( C_n \) 是趋于0的序列。本文证明,当 \( C_n = n^{-1/2} h^{-d/4} \) 时,检验的势(power)趋于一个非零常数(介于0和1之间)。这个速率与仅有一个连续预测变量(\( d=1 \))时的局部平滑检验的检测速率相同。
- 直觉:这个结果直接体现了“自适应”的优势。无论原始连续预测变量的维数 \( p \) 有多大,只要原假设模型结构决定了有效维数 \( d \),检验就能达到 \( d \) 维局部平滑检验的检测速率。这比直接对 \( p \) 维变量进行核平滑的检验(其检测速率为 \( n^{-1/2} h^{-p/4} \))要快得多。
- 必要条件:需要 \( \delta(x, z) \) 与部分中心子空间 \( \mathcal{S}_{Y|X}^{(Z)} \) 的基 \( B \) 相关,即模型偏差必须出现在降维后的方向上。这是合理的,因为如果偏差出现在与 \( B \) 正交的方向上,那么它无法被降维后的检验检测到,但这种情况在原假设模型结构下是罕见的。
- 解决的技术难点:证明的关键在于将 \( T_n \) 在局部备择假设下的期望分解为两部分:一部分来自模型偏差,另一部分来自随机误差。通过精确计算模型偏差项的二阶矩,可以得到检测速率。
证明路线与技术技巧¶
-
整体路线:
- 第一步:构造检验统计量。基于降维后的变量 \( \hat{U} \) 和残差 \( \hat{\varepsilon} \),构造U-统计量形式的检验统计量 \( T_n \)。
- 第二步:处理估计误差。将 \( T_n \) 分解为“理想统计量”(使用真实参数 \( \beta_0 \) 和真实子空间基 \( B \))加上若干余项。证明这些余项都是 \( o_p(1) \),从而 \( T_n \) 与理想统计量渐近等价。这一步需要用到 \( \hat{\beta} \) 和 \( \hat{B} \) 的 \( \sqrt{n} \)-相合性以及泰勒展开。
- 第三步:证明理想统计量的渐近正态性。理想统计量是一个退化的U-统计量。使用U-统计量的投影定理,将其投影到单个观测上,得到其Hájek投影。证明该投影满足Lindeberg条件,从而由中心极限定理得到渐近正态性。
- 第四步:计算局部备择假设下的势。在局部备择假设下,计算 \( T_n \) 的期望和方差,并证明其渐近分布是一个非中心正态分布。通过分析非中心参数,得到检测速率。
-
关键跳跃点:
- 跳跃点1:证明 \( \hat{B} \) 的估计误差对 \( T_n \) 的影响是渐近可忽略的。这是最吃功夫的地方。因为 \( T_n \) 的核函数 \( K_h(\hat{U}_i - \hat{U}_j) \) 对 \( \hat{B} \) 非常敏感。作者通过将 \( K_h(\hat{U}_i - \hat{U}_j) \) 在真实 \( B \) 处进行泰勒展开,并利用 \( \hat{B} - B = O_p(n^{-1/2}) \) 以及核函数的Lipschitz性质,证明了展开后的高阶项是可忽略的。这个技巧在非参数检验中很常见,但需要精细的阶数计算。
- 跳跃点2:证明检验的检测速率与 \( d \) 有关,而与 \( p \) 无关。这依赖于部分中心子空间的性质。作者巧妙地利用了 \( \mathbb{E}[Y | X, Z] = \mathbb{E}[Y | B^\top X, Z] \) 这一事实,将模型偏差 \( \delta(x, z) \) 投影到 \( B^\top X \) 的方向上,从而将高维问题转化为低维问题。
-
技术技巧点名:
- U-统计量理论:用于构造检验统计量并推导其渐近性质。
- Hájek投影:用于将退化的U-统计量投影为独立和,从而应用中心极限定理。
- 泰勒展开与\( \sqrt{n} \)-相合性:用于处理参数估计和子空间估计带来的误差。
- 核平滑:用于构造局部权重,使得检验能检测到局部偏离。
- Wild Bootstrap:用于逼近检验统计量的有限样本分布,避免直接使用渐近正态近似可能带来的尺寸扭曲。
真实例子与应用¶
本文包含两个真实数据例子:
-
例子1:波士顿房价数据(Boston Housing Data)
- 数据/场景:预测变量包括连续变量(如房间数、犯罪率等)和离散变量(如查尔斯河虚拟变量)。响应变量是房价中位数。作者考虑了一个线性模型作为原假设。
- 方法应用:使用本文提出的检验来测试线性模型是否充分。同时,也使用了几个现有的检验(如Zheng (1996) 的检验、Guo et al. (2016) 的检验)作为对比。
- 结果:本文的检验在5%显著性水平下拒绝了线性模型,而一些现有检验未能拒绝。作者进一步拟合了一个包含交互项的非线性模型,本文的检验未能拒绝该模型,表明其能正确识别正确的模型。
- 说明的问题:该例子旨在展示本文检验相对于现有方法具有更高的检测功效,能够发现更细微的模型错误设定。
-
例子2:摩托车撞击数据(Motorcycle Impact Data)
- 数据/场景:这是一个经典的非参数回归例子,响应变量是头部加速度,预测变量是时间(连续)。作者考虑了一个三次多项式模型作为原假设。
- 方法应用:由于只有一个连续预测变量,该例子主要用于展示本文检验在简单场景下的表现,并与传统的非参数检验(如Hardle & Mammen (1993))进行比较。
- 结果:本文的检验和传统检验都拒绝了三次多项式模型,结论一致。
- 说明的问题:该例子验证了本文检验在低维场景下与现有方法表现一致,没有损失功效。
🔎 结论是否比证明窄¶
- 窄结论1:定理2的局部检测速率 \( n^{-1/2} h^{-d/4} \) 是在假设 \( d \) 已知且被一致估计的前提下证明的。论文中提到了 \( d \) 可以通过信息准则(如BIC)进行选择,但没有严格证明在选择 \( d \) 后,检验的渐近性质(特别是检测速率)仍然成立。这是一个典型的“证明比结论窄”的情况:证明是在 \( d \) 已知的“理想”条件下完成的,但实际应用中 \( d \) 是未知的。
- 窄结论2:DE-OLS方法被证明能一致估计部分中心子空间,但论文没有证明该估计量的收敛速度是最优的,也没有与现有的充分降维方法(如SIR, SAVE)在混合变量下的表现进行理论比较。作者将其称为“副产品”,暗示其理论性质可能不是最优的,但足以用于检验构造。
四、开放问题¶
-
未知 \( d \) 下的自适应检验:当部分中心子空间的维数 \( d \) 未知时,如何构造一个检验,使其渐近性质(特别是检测速率)不受 \( d \) 的选择影响?这需要发展一种数据驱动的 \( d \) 选择方法,并证明其与检验的联合渐近性质。扎根点:论文第4节提到“在实践中,\( d \) 可以通过BIC等准则选择”,但未给出理论证明。
-
DE-OLS方法的理论最优性:本文提出的DE-OLS方法是否达到了充分降维中估计部分中心子空间的半参数效率界?如果不是,是否存在更高效的估计方法,能进一步提升检验的有限样本表现?扎根点:论文第3.2节将DE-OLS描述为“一个副产品”,暗示其理论性质可能不是重点,但这是一个明确的开放问题。
-
检验对高维离散变量的适应性:当离散变量 \( Z \) 的维数 \( q \) 很高(例如,每个观测都有一个唯一的ID)时,本文的检验是否仍然有效?因为 \( \mathbb{I}(Z_i = Z_j) \) 会使得几乎所有观测对都不被比较,导致检验统计量退化。扎根点:论文的模拟和例子中 \( q \) 都很小(1或2),未讨论高维离散变量的情况。
-
与基于经验过程检验的深入比较:本文声称其检验在检测速率上优于基于经验过程的检验(如Stute, 1997),但未给出严格的minimax下界来证明这一点。一个开放问题是:在混合型预测变量下,是否存在一个minimax最优的检验,其检测速率能同时达到局部平滑检验和经验过程检验的优势?扎根点:论文引言中提到了与经验过程检验的比较,但仅限于定性讨论。
Maintained by 陈星宇 · Homepage · Source on GitHub