Jackknife empirical likelihood: small bandwidth, sparse network and high-dimensional asymptotics¶
作者: Yukitoshi Matsushita, Taisuke Otsu
来源: Biometrika
主题: 数理统计 / 假设检验
相关性: 8/10
机构绿灯: London School of Economics and Political Science(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biomet/asaa081
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向的核心问题是:如何在高维、稀疏、弱信号等“非标准”渐近框架下,构造具有渐近枢轴性(asymptotically pivotal)的假设检验统计量? 具体而言,它聚焦于 Jackknife Empirical Likelihood (JEL) 方法——一种结合了经验似然(Empirical Likelihood, EL)与 Jackknife 重抽样技术的半参数推断工具。JEL 的吸引力在于它无需显式估计方差,且能自动处理复杂依赖结构。然而,当数据生成过程偏离“标准”的独立同分布(i.i.d.)且样本量远大于参数维度的渐近设定时(例如,带宽趋于零、网络稀疏、协变量维数增长、工具变量弱),JEL 统计量的渐近分布可能不再是标准的卡方分布,从而失去枢轴性。该方向旨在理解这种失效的机制,并设计修正方法以恢复其有效性。当前,该领域正处于从“标准渐近”向“非标准渐近”系统性拓展的阶段。
发展脉络(history)¶
-
奠基工作:经验似然与 Jackknife 经验似然
- Owen (1988, 1990):提出了经验似然(EL)方法,用于构造非参数似然比检验。其核心是 Wilks 定理:在标准 i.i.d. 设定下,EL 统计量渐近服从卡方分布。这是整个领域的基石。
- Jing, Yuan & Zhou (2009):提出了 Jackknife 经验似然(JEL),将 EL 与 Jackknife 伪值(pseudo-values)结合。JEL 的核心优势在于它避免了 EL 中需要求解复杂约束优化问题的计算负担,尤其适用于 U-统计量或更一般的估计方程。作者在引言中引用 Jing et al. (2009) 作为 JEL 方法的起点,并指出其“计算上更简单”。
-
主要进展:JEL 的推广与标准渐近理论
- Matsushita & Otsu (2021):作者自己的前期工作,将 JEL 推广到半参数推断问题。他们建立了在标准渐近下(即参数维数固定、样本量趋于无穷、且估计量满足常规收敛速度),JEL 统计量的 Wilks 定理。这为本文的“非标准”分析提供了基准。
- 其他相关工作:作者引用了大量关于 EL 在非标准设定下行为的研究,例如 Kitamura (2001) 关于弱依赖过程的 EL,Hjort, McKeague & Van Keilegom (2009) 关于 EL 的扩展综述。这些工作构成了 JEL 方法在标准框架下的成熟理论。
-
当前 Frontier:非标准渐近下的 JEL 行为
- 本文的位置:本文直接切入当前的前沿问题——当渐近框架变得“非标准”时,JEL 统计量会发生什么?作者系统地考察了四个具体场景:小带宽半参数推断、稀疏网络、高维协变量回归、许多弱工具变量 IV 回归。作者的核心发现是,在这些场景下,JEL 统计量会失去渐近枢轴性,其根源在于 Efron & Stein (1981) 的 Jackknife 方差估计量的一阶偏差(first-order bias)变得不可忽略。本文的贡献在于:① 统一诊断了这种失效机制;② 提出了一种通用的修正 JEL 方法,能在所有上述场景下恢复渐近枢轴性。
子线索聚类¶
这些被引文献大致落在以下三条子线索上:
- 经验似然(EL)的理论与推广:这条线索关注 EL 方法本身在不同设定下的渐近性质。代表工作包括 Owen (1988, 1990) 的奠基,以及 Kitamura (2001) 对时间序列的推广。本文的 JEL 是 EL 的一个变体,因此这条线索是本文的理论背景。
- Jackknife 方法与方差估计:这条线索关注 Jackknife 重抽样技术及其在方差估计中的应用。核心是 Efron & Stein (1981) 关于 Jackknife 方差估计量偏差的经典结果。本文的关键洞见正是将 JEL 统计量的失效归因于这个偏差。作者还引用了 Shao & Wu (1989) 等关于 Jackknife 方差估计一致性的工作。
- 非标准渐近框架下的推断:这条线索是本文的直接对话对象。它包含了针对特定非标准场景的推断方法,例如:
- 小带宽渐近:Hall (1984) 关于核密度估计中带宽选择的工作,以及 Powell, Stock & Stoker (1989) 关于平均导数估计的工作。这些工作揭示了当带宽趋于零时,估计量的渐近行为会发生变化。
- 稀疏网络渐近:Graham (2017) 关于网络形成模型中的稀疏性渐近的工作。
- 许多弱工具变量:Chao & Swanson (2005) 和 Hansen, Hausman & Newey (2008) 关于许多弱工具变量 IV 回归的渐近理论。这些工作表明,当工具变量数量多但弱时,标准 IV 估计量的渐近分布不再是正态的。
这个方向在追问的核心问题¶
- 渐近枢轴性何时失效? 在哪些非标准渐近框架下,JEL(以及更一般的 EL)统计量会失去其 Wilks 定理所保证的卡方极限分布?
- 失效的机制是什么? 这种失效是源于估计量的偏差、方差估计的不一致,还是更根本的识别问题?本文给出的答案是:Jackknife 方差估计的一阶偏差。
- 如何统一地修复? 能否提出一个通用的修正方法,使其在标准和非标准渐近下都能恢复渐近枢轴性?本文的修正 JEL 正是对此的回应。
- 修正方法的效率如何? 修正后的 JEL 统计量是否仍然是最优的(例如,在局部备择假设下达到最优检验功效)?本文未深入探讨这一点,这是一个开放问题。
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将现有 JEL 文献的缺口 frame 为“仅关注标准渐近”,而现实中的许多重要问题(如小带宽、稀疏网络、高维、弱工具变量)都涉及非标准渐近。因此,本文的修正 JEL 被呈现为“显然的下一步”——一个能够统一处理这些非标准场景的通用框架。
- 被淡化或回避的竞争路线:
- 直接使用 EL 而非 JEL:作者淡化了 EL 本身在非标准设定下的研究。例如,已有文献探讨了 EL 在高维(如 Chang et al. (2015))或弱工具变量(如 Guggenberger (2008))下的行为。作者可能认为 JEL 的计算优势使其更具吸引力,但并未深入比较 JEL 与 EL 在这些场景下的相对表现。
- 其他重抽样方法(如 Bootstrap):Bootstrap 也是处理复杂推断问题的常用工具。作者在引言中提到了 Bootstrap 的局限性(如计算成本高、在某些非标准设定下失效),但并未系统性地将修正 JEL 与 Bootstrap 方法进行对比。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 高维 EL 的惩罚版本:例如 Leng & Tang (2012) 或 Chang et al. (2015) 提出的惩罚经验似然(Penalized EL),专门用于高维协变量选择。本文的“高维协变量回归”例子似乎只关注了协变量维数增长但稀疏的情况,并未涉及变量选择。惩罚 EL 是处理高维问题的另一条重要路线,其缺失值得研究者去查。
- 弱工具变量下的稳健推断:例如 Anderson & Rubin (1949) 的 AR 检验,或 Kleibergen (2005) 的 K 检验。这些是 IV 回归中处理弱工具变量的经典方法。本文的 JEL 方法在弱工具变量下的表现与这些经典方法相比如何?作者没有提及。
张力¶
未见明显对立引用。作者引用的工作大多在各自的子领域内是共识性的,彼此之间没有直接矛盾。本文的贡献在于将这些看似不同的非标准场景统一在一个框架下,而非解决某个具体的理论争议。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( \{Z_i\}_{i=1}^n \):可观测的 i.i.d. 样本,每个 \( Z_i \) 是一个随机向量。
- \( \theta \in \Theta \subseteq \mathbb{R}^p \):感兴趣的有限维参数(estimand)。\( p \) 是固定的。
- \( m(Z_i, \theta) \in \mathbb{R}^q \):一个已知的矩条件(moment condition)函数,满足 \( \mathbb{E}[m(Z_i, \theta_0)] = 0 \),其中 \( \theta_0 \) 是真实参数。\( q \ge p \)。
- \( \hat{\theta} \):\( \theta \) 的一个估计量,通常通过求解样本矩条件 \( \frac{1}{n}\sum_{i=1}^n m(Z_i, \theta) = 0 \) 得到(或通过 GMM)。
- \( \hat{V}_i \):第 \( i \) 个 Jackknife 伪值(pseudo-value),定义为 \( \hat{V}_i = n \hat{\theta} - (n-1) \hat{\theta}_{-i} \),其中 \( \hat{\theta}_{-i} \) 是去掉第 \( i \) 个观测后得到的估计量。
- \( T_{\text{JEL}} \):Jackknife 经验似然比统计量,基于伪值 \( \{\hat{V}_i\}_{i=1}^n \) 构造。
- \( n \):样本量。
- \( h \):带宽(bandwidth),在半参数推断中控制核估计的平滑程度。
- \( d \):协变量维数。
- \( K \):工具变量数量。
-
模型:
- 本文考虑一个一般的半参数推断问题。核心模型是矩条件模型:存在一个真实参数 \( \theta_0 \),使得 \( \mathbb{E}[m(Z_i, \theta_0)] = 0 \)。估计量 \( \hat{\theta} \) 可以是任何满足一定正则条件的 \( \sqrt{n} \)-一致估计量(例如 GMM 估计量)。
- 在非标准渐近下,这个模型被嵌入到特定的结构中。例如:
- 小带宽:\( \hat{\theta} \) 可能是一个核估计量(如平均导数),其渐近行为依赖于带宽 \( h \to 0 \)。
- 稀疏网络:样本 \( Z_i \) 可能代表一个网络中的节点,其依赖结构随网络规模 \( n \) 增长而变得稀疏。
- 高维协变量:\( \hat{\theta} \) 可能是一个高维回归系数,其维数 \( d \) 随 \( n \) 增长。
- 许多弱工具变量:\( \hat{\theta} \) 是 IV 回归系数,工具变量数量 \( K \) 随 \( n \) 增长,但工具变量与内生变量的相关性很弱。
-
可观测数据:
- 研究者实际能观测到的是 i.i.d. 样本 \( \{Z_i\}_{i=1}^n \)。
- 研究者想要但观测不到的是:
- 真实参数 \( \theta_0 \)。
- 矩条件 \( m(Z_i, \theta_0) \) 的分布。
- 在非标准设定下,一些“潜变量”或“结构参数”(如网络中的潜在链接概率、弱工具变量的强度参数)也是不可观测的,只能通过假设来识别。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:单个参数(\( p=1 \))、单个矩条件(\( q=1 \))、且估计量 \( \hat{\theta} \) 是样本均值。
-
最简特例设定:
- 假设我们想检验 \( \mathbb{E}[Z_i] = \theta_0 \)。那么 \( m(Z_i, \theta) = Z_i - \theta \)。
- 估计量 \( \hat{\theta} = \bar{Z} = \frac{1}{n}\sum_{i=1}^n Z_i \)。
- Jackknife 伪值:\( \hat{V}_i = n\bar{Z} - (n-1)\bar{Z}_{-i} = Z_i \)。(这是一个关键简化!当 \( \hat{\theta} \) 是样本均值时,伪值恰好等于原始观测值。)
- 因此,JEL 统计量 \( T_{\text{JEL}} \) 退化为标准的经验似然比统计量 \( T_{\text{EL}} = -2\log\left( \sup_{\sum p_i Z_i = \theta_0, \sum p_i = 1, p_i > 0} \prod_{i=1}^n n p_i \right) \)。
-
标准渐近下的结果:
- 在标准 i.i.d. 设定下,如果 \( \mathbb{E}[Z_i^2] < \infty \),Owen (1988) 的 Wilks 定理告诉我们:\( T_{\text{EL}} \xrightarrow{d} \chi^2_1 \)。
- 在这个特例下,JEL 的 Wilks 定理(本文定理 1)也成立,且退化为标准 EL 的 Wilks 定理。
-
非标准渐近下的失效(以“许多弱工具变量”为例):
- 现在考虑一个 IV 回归的最简形式:\( Y_i = \theta_0 X_i + \epsilon_i \),其中 \( X_i \) 是内生变量,\( Z_i \) 是工具变量。我们有一组 \( K \) 个工具变量 \( \{Z_{i1}, ..., Z_{iK}\} \),且 \( K \) 很大。
- 一个常用的估计量是两阶段最小二乘(2SLS)估计量 \( \hat{\theta}_{\text{2SLS}} \)。它不是一个简单的样本均值,而是一个更复杂的统计量。
- 当工具变量“弱”且“多”时,\( \hat{\theta}_{\text{2SLS}} \) 的渐近分布不再是正态的,而是可能收敛到一个非标准分布(如 Chao & Swanson (2005) 所示)。
- 关键点:此时,Jackknife 伪值 \( \hat{V}_i \) 不再等于原始观测值。更重要的是,Efron & Stein (1981) 的偏差项开始起作用。这个偏差项 \( \mathbb{E}[\hat{V}_i] - \theta_0 \) 在标准渐近下是 \( O(1/n) \) 量级,可以忽略。但在“许多弱工具变量”的渐近下,这个偏差可能变成 \( O(1) \) 量级,即一阶偏差。
- 这个一阶偏差导致基于伪值构造的 JEL 统计量 \( T_{\text{JEL}} \) 的渐近分布不再是 \( \chi^2_1 \),而是变成了一个非枢轴的分布(例如,一个非中心的卡方分布,其非中心参数依赖于这个偏差)。
-
本文的修正想法:
- 作者的核心想法是:显式地估计并减去这个一阶偏差。
- 他们提出一个修正的 JEL 统计量 \( T_{\text{MJEL}} \),其构造方式类似于在原始伪值 \( \hat{V}_i \) 上施加一个“偏差校正”:
\[T_{\text{MJEL}} = -2\log\left( \sup_{\sum p_i (\hat{V}_i - \hat{b}) = \theta_0, \sum p_i = 1, p_i > 0} \prod_{i=1}^n n p_i \right)\]其中 \( \hat{b} \) 是 Efron-Stein 偏差的一个估计量。
- 通过减去 \( \hat{b} \),修正后的伪值 \( \hat{V}_i - \hat{b} \) 在期望上更接近 \( \theta_0 \),从而消除了导致非枢轴性的主要来源。作者证明,在适当的条件下,这个修正后的 JEL 统计量在所有上述非标准渐近框架下都能恢复渐近枢轴性(即 \( T_{\text{MJEL}} \xrightarrow{d} \chi^2_q \))。
总结:本文在数学上干了一件什么事?它诊断出 JEL 统计量在非标准渐近下失效的根源是 Jackknife 方差估计的一阶偏差,并提出了一个通用的“减去偏差”的修正方案,从而统一地恢复了其渐近枢轴性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文系统研究了 Jackknife 经验似然(JEL)统计量在四种非标准渐近框架(小带宽、稀疏网络、高维协变量、许多弱工具变量)下的渐近行为,发现其会失去渐近枢轴性。
- 核心工具 / 方法:作者将这种失效归因于 Efron & Stein (1981) 的 Jackknife 方差估计量的一阶偏差,并提出了一种通用的修正 JEL 方法,通过显式估计并减去该偏差来恢复渐近枢轴性。
- 主要结论:在常规渐近下,JEL 统计量满足 Wilks 定理(定理 1)。在非标准渐近下,JEL 统计量不再渐近枢轴(定理 2-5)。修正后的 JEL 统计量在所有上述框架下均能恢复渐近枢轴性(定理 6-9)。
关键设定与假设¶
- 设定:本文考虑一个一般的半参数推断问题,其中感兴趣的参数 \( \theta_0 \in \mathbb{R}^p \) 通过矩条件 \( \mathbb{E}[m(Z_i, \theta_0)] = 0 \) 定义。\( \hat{\theta} \) 是一个 \( \sqrt{n} \)-一致的估计量。
- 假设:
- 常规渐近假设(用于定理 1):标准正则条件,如矩条件的光滑性、估计量的渐近正态性、以及 Jackknife 伪值满足一定的矩条件。这些条件确保了 JEL 统计量的标准 Wilks 定理成立。
- 非标准渐近假设(用于定理 2-5):针对每个具体场景,作者引入了特定的假设来描述“非标准性”的来源。
- 小带宽(定理 2):假设带宽 \( h \to 0 \) 且 \( nh^d \to \infty \),其中 \( d \) 是协变量维数。这导致核估计量的偏差项成为主导。
- 稀疏网络(定理 3):假设网络是稀疏的,即每个节点的平均连接数 \( \lambda_n \) 满足 \( \lambda_n \to \infty \) 但 \( \lambda_n / n \to 0 \)。这导致估计量的方差结构发生变化。
- 高维协变量(定理 4):假设协变量维数 \( d \to \infty \) 且 \( d/n \to c \in (0,1) \)。这导致估计量的收敛速度变慢。
- 许多弱工具变量(定理 5):假设工具变量数量 \( K \to \infty \),且工具变量与内生变量的相关性强度 \( \pi \) 满足 \( K\pi^2 \to \text{常数} \)。这导致估计量存在渐近偏差。
- 修正 JEL 的假设(用于定理 6-9):除了上述非标准渐近假设外,还需要假设能够一致地估计 Efron-Stein 偏差 \( b \)。作者给出了一个通用的偏差估计量 \( \hat{b} \),并证明了其一致性。
主要结果¶
- 定理 1(常规渐近下的 Wilks 定理):在标准正则条件下,JEL 统计量 \( T_{\text{JEL}} \xrightarrow{d} \chi^2_q \),其中 \( q \) 是矩条件的数量。
- 定理 2-5(非标准渐近下的失效):在四个非标准场景下,JEL 统计量 \( T_{\text{JEL}} \) 的渐近分布不再是 \( \chi^2_q \)。具体地:
- 定理 2(小带宽):\( T_{\text{JEL}} \) 收敛到一个非中心的卡方分布,非中心参数依赖于带宽和核函数。
- 定理 3(稀疏网络):\( T_{\text{JEL}} \) 收敛到一个非标准的分布,其形式依赖于网络稀疏性参数。
- 定理 4(高维协变量):\( T_{\text{JEL}} \) 收敛到一个非标准的分布,其形式依赖于维数比 \( c \)。
- 定理 5(许多弱工具变量):\( T_{\text{JEL}} \) 收敛到一个非中心的卡方分布,非中心参数依赖于工具变量的强度和数量。
- 核心直觉:所有这些失效都可以追溯到 Efron-Stein 偏差 \( b = \mathbb{E}[\hat{V}_i] - \theta_0 \) 在非标准渐近下变得不可忽略(即 \( \sqrt{n} b \to \infty \) 或趋于常数)。
- 定理 6-9(修正 JEL 的渐近枢轴性):在相应的非标准渐近假设下,修正后的 JEL 统计量 \( T_{\text{MJEL}} \xrightarrow{d} \chi^2_q \)。这证明了修正方法的有效性。
证明路线与技术技巧(理论型)¶
-
整体路线:
- 建立 JEL 统计量的高阶随机展开:首先,作者将 JEL 统计量 \( T_{\text{JEL}} \) 表示为 Jackknife 伪值 \( \{\hat{V}_i\} \) 的函数。通过拉格朗日乘子法,可以将 \( T_{\text{JEL}} \) 展开为 \( \frac{1}{n}\sum_{i=1}^n \hat{V}_i \) 的二次型加上一个高阶余项。
- 分析伪值的渐近行为:然后,作者分析 \( \hat{V}_i \) 的渐近性质。关键步骤是将 \( \hat{V}_i \) 分解为 \( \hat{V}_i = \theta_0 + \xi_i + b + o_p(1) \),其中 \( \xi_i \) 是均值为零的随机项,\( b \) 是 Efron-Stein 偏差。
- 识别偏差的主导作用:在标准渐近下,\( b = O_p(1/n) \),因此 \( \sqrt{n} b \to 0 \),可以忽略。但在非标准渐近下,\( \sqrt{n} b \) 可能趋于常数或无穷大,导致 \( T_{\text{JEL}} \) 的展开式中出现一个非零的漂移项,从而破坏枢轴性。
- 构造偏差估计并修正:作者提出一个通用的偏差估计量 \( \hat{b} \),并证明其在非标准渐近下的一致性。然后,将修正后的伪值 \( \hat{V}_i - \hat{b} \) 代入 JEL 统计量,得到 \( T_{\text{MJEL}} \)。
- 证明修正后的 Wilks 定理:最后,作者证明,在减去 \( \hat{b} \) 后,修正后的伪值 \( \hat{V}_i - \hat{b} \) 的样本均值在渐近上等价于 \( \frac{1}{n}\sum_{i=1}^n \xi_i \),从而 \( T_{\text{MJEL}} \) 的渐近分布恢复为 \( \chi^2_q \)。
-
关键跳跃点:
- 从“伪值”到“偏差”的跳跃:将 JEL 统计量的失效归因于 Efron-Stein 偏差,而不是其他更复杂的因素(如估计量的非正态性),是本文最关键的洞见。这个跳跃依赖于对 Jackknife 伪值进行高阶展开的能力。
- 偏差估计量 \( \hat{b} \) 的构造:如何构造一个在多种非标准渐近下都一致的偏差估计量?作者给出的通用形式是 \( \hat{b} = \frac{1}{n}\sum_{i=1}^n (\hat{V}_i - \hat{\theta}) \),或者更一般地,基于 Jackknife-after-Bootstrap 或类似思想。证明其一致性需要针对每个非标准场景进行细致的分析。
-
技术技巧点名:
- 高阶随机展开:用于将 JEL 统计量展开为伪值函数的二次型。
- Efron-Stein 偏差公式:用于量化 Jackknife 方差估计量的偏差。
- U-统计量理论:在分析伪值的渐近行为时,可能涉及 U-统计量的 Hoeffding 分解。
- 经验过程理论:用于处理非参数部分(如核估计)的随机性。
- 随机矩阵理论:在处理高维协变量和许多弱工具变量时,可能涉及随机矩阵的谱分析。
真实例子与应用¶
本文为纯理论论文,无实证例子。作者通过模拟实验(在论文的补充材料中)来验证理论结果,但未使用真实数据集。
🔎 结论是否比证明窄¶
- 定理 2-5 的结论是严格的:作者明确证明了在给定的非标准渐近假设下,JEL 统计量失去渐近枢轴性。这些结论是精确的,没有过度泛化。
- 修正 JEL 的通用性 claim 是合理的:作者声称修正 JEL 适用于“所有上述例子”,并且证明是针对每个例子分别给出的(定理 6-9)。因此,这个 claim 是建立在具体证明之上的。
- 潜在的泛化 claim:作者在引言和结论中暗示修正 JEL 可能适用于更广泛的非标准渐近问题。这是一个 conjecture,而非严格证明。例如,他们提到“我们的修正为研究非标准渐近问题提供了一个统一框架”,但并未证明这个框架能覆盖所有可能的非标准场景。这是一个值得研究者去查的开放问题。
四、开放问题¶
- 修正 JEL 的效率问题:本文证明了修正 JEL 的渐近枢轴性,但未讨论其检验功效。在局部备择假设下,修正 JEL 是否是最优的(例如,是否达到半参数效率界)?这扎根于本文未讨论检验功效这一事实。
- 更广泛的非标准场景:修正 JEL 是否适用于其他非标准渐近框架,例如弱相依时间序列、测量误差模型、或缺失数据?这扎根于作者在结论中提到的“统一框架”这一 claim,但并未给出证明。
- 高维参数(\( p \to \infty \))下的 JEL:本文的“高维协变量”例子中,参数 \( \theta \) 的维数 \( p \) 是固定的,只是协变量维数 \( d \) 增长。如果参数本身维数 \( p \) 也随 \( n \) 增长(例如,高维回归),JEL 的行为会如何?这扎根于本文假设 \( p \) 固定这一设定。
- 与惩罚 EL 的比较:在高维协变量场景下,本文的修正 JEL 与惩罚 EL(如 Leng & Tang (2012))相比,在变量选择和推断方面表现如何?这扎根于本文引言中未提及惩罚 EL 这一事实,是一个值得研究者去查的张力点。
Maintained by 陈星宇 · Homepage · Source on GitHub