The V-fold jackknife for semiparametric inference: variance estimation, confidence intervals, and simultaneous confidence bands¶
作者: Yi Li, Ashkan Ertefaie, Mark van der Laan
主题: 效率理论 / Debiased ML
相关性: 8/10
链接: https://arxiv.org/abs/2607.22493
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向的核心问题是:如何为现代半参数估计量(尤其是那些依赖机器学习算法的估计量)提供计算高效且理论上可靠的推断(方差估计、置信区间、联合置信带)? 传统上,bootstrap 是默认工具,但其理论性质在数据自适应估计的背景下常常不明确,且计算成本高昂。该方向旨在寻找替代方案,这些方案应直接利用估计量自身的渐近线性展开,而不是依赖于对重抽样分布的重建。
发展脉络(history)¶
-
奠基工作:经典 Jackknife 与 Bootstrap
- Quenouille (1949) 和 Tukey (1958):提出了 jackknife 方法,用于偏差估计和方差估计。Tukey 引入了“伪值”(pseudo-values)的概念,这是本文方法的核心构件。
- Efron (1979):提出了 bootstrap,并指出对于非光滑泛函(如样本中位数),普通的 delete-1 jackknife 会失效,而删除更大组别的观测可以缓解这个问题。这为分组 jackknife 提供了直觉基础。
- Brillinger (1964):在经典参数设定下(最大似然估计),证明了固定分组数 V 时,Studentized 分组 jackknife 统计量收敛到自由度为 V-1 的 t 分布。这是本文定理 1 的直接先驱。
-
主要进展:Jackknife 方差估计的一致性理论
- Shao & Wu (1989):发展了 delete-d jackknife 方差估计量一致性的通用理论,强调了底层泛函的平滑性或可微性。本文的定理 2(发散 V 下的方差一致性)建立在这一工作之上,但针对的是不同的设定:使用单个平衡分区,且假设直接基于 RAL 展开和折层余项稳定性。
-
当前 Frontier:半参数与机器学习估计量的推断
- Chernozhukov et al. (2018):提出了去偏机器学习(DML)框架,使用交叉拟合(cross-fitting)来估计半参数参数。本文在讨论部分(9.3节)指出,V-fold jackknife 可以自然地集成到交叉拟合的工作流中,因为昂贵的 nuisance 估计步骤已经完成。
- van der Laan (2023):发展了高阶样条高度自适应 lasso(HAL)估计量的点态渐近正态性理论,其收敛速度慢于 √n,且影响函数方差发散。本文的第 7 节专门将 V-fold jackknife 理论推广到这类“广义渐近线性估计量”,并以 HAL 剂量反应曲线作为主要应用例子。
- Ohlendorff et al. (2025):提出了“廉价子抽样”(cheap subsampling)方法,与本文共享计算动机。但本文指出,该方法引入了额外的调优参数(子样本比例 m/n),且其 t_B 校正是蒙特卡洛复制误差,而非数据成分的有限数量。
-
本文的位置:本文系统地将固定 V 的 t_{V-1} 结果从经典 MLE 推广到整个正则渐近线性估计量类(定理 1),建立了发散 V 下方差估计量的 √V 一致性(定理 2),并首次基于分组 jackknife 构建了联合置信带(定理 4)。它还通过尺度不变性,将框架扩展到非 √n 收敛率的估计量(定理 7, 8)。本文的定位是提供一个计算上比 bootstrap 更轻、理论上比 bootstrap 更直接(与估计量自身的一阶线性化挂钩)的推断框架。
子线索聚类¶
- 经典 Jackknife 理论:包括 Quenouille (1949), Tukey (1958), Brillinger (1964), Miller (1974), Shao & Wu (1989)。这一簇关注 jackknife 在参数或平滑设定下的理论性质(偏差、方差、一致性)。
- Bootstrap 及其变体:包括 Efron (1979), Efron & Tibshirani (1993), van der Vaart (1998), Gill et al. (1989), Praestgaard & Wellner (1993), Lam (2022), Ohlendorff et al. (2025)。这一簇关注 bootstrap 及其计算高效的变体,但其理论验证通常需要更强的条件(如 Hadamard 可微性)。
- 基于影响函数的半参数推断:包括 Chernozhukov et al. (2018), Zheng & van der Laan (2011), van der Laan (2019), D´ıaz & van der Laan (2013)。这一簇依赖于显式推导和评估影响函数(EIC)来进行推断,计算上通常只需一次拟合,但推导复杂,且可能数值不稳定。
- 复杂抽样中的 Jackknife:包括 Kott (1998, 2001), Kott & Garren (2011), Yang et al. (2020)。这一簇在调查抽样中被称为“delete-a-group jackknife (DAGJK)”,本文为其在半参数设定下的应用提供了通用理论。
这个方向在追问的核心问题¶
- 计算效率:如何在不进行成百上千次重拟合(如 bootstrap)的情况下,获得有效的推断?
- 理论可靠性:对于数据自适应估计量,如何确保推断方法(如 bootstrap)的理论有效性?其所需的正则性条件(如 Hadamard 可微性)是否成立?
- 易用性:如何避免推导和评估复杂的影响函数(EIC)?能否提供一个“即插即用”的推断工具?
- 非标准收敛率:当估计量收敛速度慢于 √n 时(如非参数函数估计),如何构建有效的置信区间?已知的瓶颈是,delta 方法需要知道并估计发散的方差率,而这可能非常困难。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口 frame 为:bootstrap 在现代半参数和机器学习设定下,其理论性质“largely unstudied”(未充分研究),且其计算成本“substantial”(巨大)。因此,需要一个“computationally efficient and theoretically justified alternative”(计算高效且理论上合理的替代方案)。作者将 V-fold jackknife 定位为这样一个方案,其有效性直接与估计量自身的“asymptotic linearity and fold-level remainder stability”(渐近线性和折层余项稳定性)挂钩,而不是与 bootstrap 对完整自适应估计过程的近似挂钩。
- 哪些竞争路线被他淡化或回避了:作者淡化了 bootstrap 的实用性,强调其理论验证的困难。对于基于影响函数(EIC)的方法,作者承认其计算成本低(1次拟合),但指出其需要显式推导影响函数,且可能在数值上失败(如在 HAL 剂量反应曲线中,失败率高达 6.2%)。作者也淡化了廉价 bootstrap 变体(如 Ohlendorff et al. 2025),指出它们引入了额外的调优参数(子样本比例),且其 t 校正是蒙特卡洛误差而非数据成分的有限数量。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:作者在附录 B 中提到了 Chen & Kato (2020) 的“jackknife multiplier bootstrap”,但并未在引言中引用。这可能是因为 Chen & Kato 的方法与本文方法有本质不同(它使用 leave-one-out jackknife 来估计 Hajek 投影,然后将其输入到外部的高斯乘子 bootstrap 方案中,而不是直接对伪值进行 Studentization)。这是一个值得研究者去查的张力点:为什么作者选择不将 Chen & Kato (2020) 作为主要的相关工作来讨论?
张力¶
未见明显对立引用。被引工作之间没有在略不同条件下得出相反结论的明显例子。它们更多地是在不同的设定(参数 vs. 半参数,平滑 vs. 非平滑)下发展不同的工具。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
O_i:第 i 个观测数据,i.i.d. 来自未知分布P_0。P_0:真实的数据生成分布。Ψ(P_0):目标参数,一个从统计模型M到实数的映射(标量)。Ψ̂(P_n):基于全样本P_n的估计量。φ = φ_{P_0}:影响函数,一个均值为 0、方差有限的函数。R(P_n, P_0):渐近线性展开中的余项,满足R(P_n, P_0) = o_p(n^{-1/2})。V:折数(fold number),一个固定的整数(如 5, 10, 20)。I_v:第 v 折的观测索引集合,大小|I_v| = n/V。P_{n, -v}:去掉第 v 折后的经验分布(leave-fold-out 样本)。Ψ̂(P_{n, -v}):基于 leave-fold-out 样本的估计量。IC_Jack(v):第 v 个 jackknife 伪值,定义为V Ψ̂(P_n) - (V-1) Ψ̂(P_{n, -v})。Ψ̂_Jack(P_n):jackknife 估计量,即所有伪值的均值(1/V) Σ_v IC_Jack(v)。Ŝ_Jack²:V-fold jackknife 方差估计量,定义为(V-1)^{-1} Σ_v (IC_Jack(v) - Ψ̂_Jack(P_n))²。cSE:jackknife 标准误,定义为Ŝ_Jack / √V。t_{V-1, 1-α/2}:自由度为V-1的 t 分布的(1-α/2)分位数。
-
模型:
- 假设估计量
Ψ̂(P_n)是正则渐近线性 (RAL) 的,即它满足:Ψ̂(P_n) - Ψ(P_0) = P_n φ + R(P_n, P_0)其中P_n φ = (1/n) Σ_i φ(O_i)是影响函数的样本均值,R(P_n, P_0) = o_p(n^{-1/2})是渐近可忽略的余项。 - 目标参数
Ψ(P_0)是路径可微 (pathwise differentiable) 的,这意味着其影响函数φ存在且方差有限。
- 假设估计量
-
可观测数据:
- 可观测:
n个 i.i.d. 样本O_1, ..., O_n。研究者可以计算全样本估计量Ψ̂(P_n)和V个 leave-fold-out 估计量Ψ̂(P_{n, -v})。 - 想要但观测不到:影响函数
φ本身是未知的,因为它依赖于真实分布P_0。因此,基于影响函数的方差Var(φ(O))也是未知的,需要估计。V-fold jackknife 的核心思想就是不直接估计φ,而是通过伪值的离散度来近似φ的方差。
- 可观测:
第二步:讲最小内核¶
最简特例:线性估计量 (Linear Estimator)
假设 Ψ̂(P_n) 是一个精确的线性估计量,即余项 R(P_n, P_0) = 0。那么:
Ψ̂(P_n) - Ψ(P_0) = P_n φ = (1/n) Σ_i φ(O_i)
现在,考虑第 v 折的伪值:
IC_Jack(v) = V Ψ̂(P_n) - (V-1) Ψ̂(P_{n, -v})
代入线性展开:
IC_Jack(v) = V [Ψ(P_0) + P_n φ] - (V-1) [Ψ(P_0) + P_{n, -v} φ]
= Ψ(P_0) + V P_n φ - (V-1) P_{n, -v} φ
注意,P_n φ 是全样本均值,P_{n, -v} φ 是去掉第 v 折后的样本均值。它们之间有一个精确的关系:
P_n φ = (1/V) P_{n, v} φ + ((V-1)/V) P_{n, -v} φ
其中 P_{n, v} φ 是第 v 折内的样本均值。
代入上式:
IC_Jack(v) = Ψ(P_0) + V [(1/V) P_{n, v} φ + ((V-1)/V) P_{n, -v} φ] - (V-1) P_{n, -v} φ
= Ψ(P_0) + P_{n, v} φ + (V-1) P_{n, -v} φ - (V-1) P_{n, -v} φ
= Ψ(P_0) + P_{n, v} φ
核心发现:对于精确的线性估计量,第 v 个伪值 IC_Jack(v) 恰好等于目标参数 Ψ(P_0) 加上第 v 折内影响函数的样本均值 P_{n, v} φ。
因此,伪值的均值(jackknife 估计量)是:
Ψ̂_Jack(P_n) = (1/V) Σ_v IC_Jack(v) = Ψ(P_0) + (1/V) Σ_v P_{n, v} φ = Ψ(P_0) + P_n φ = Ψ̂(P_n)
(对于线性估计量,jackknife 估计量等于全样本估计量,偏差为 0。)
伪值的样本方差 Ŝ_Jack² 是:
Ŝ_Jack² = (1/(V-1)) Σ_v (IC_Jack(v) - Ψ̂_Jack(P_n))²
= (1/(V-1)) Σ_v (P_{n, v} φ - P_n φ)²
这正是 V 个独立折层均值 P_{n, v} φ 的样本方差。由于每个折层有 n/V 个 i.i.d. 观测,根据中心极限定理,当 n/V 足够大时,P_{n, v} φ 近似服从均值为 0、方差为 (V/n) Var(φ) 的正态分布。
现在,考虑 Studentized 统计量:
T = √V (Ψ̂_Jack(P_n) - Ψ(P_0)) / Ŝ_Jack
= √V (P_n φ) / Ŝ_Jack
由于 Ŝ_Jack² 是 V 个独立近似正态随机变量的样本方差,根据经典统计理论,T 近似服从自由度为 V-1 的 t 分布。这就是 Brillinger (1964) 的结果,也是本文定理 1 的核心。
总结:这篇论文在数学上干了一件什么事?它证明了,即使对于更一般的渐近线性估计量(有余项),只要余项足够小,上述 t 分布近似仍然成立。其核心思路是:伪值 IC_Jack(v) 近似等于 Ψ(P_0) + P_{n, v} φ,因此伪值的离散度近似等于折层均值 P_{n, v} φ 的离散度,从而 Studentized 统计量近似服从 t 分布。 这个近似不依赖于方差估计量 Ŝ_Jack² 是否依概率收敛到真实方差,因为 t 分布的分位数已经为这种不确定性提供了校正。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:为现代半参数估计量(特别是基于机器学习的估计量)开发一个计算高效且理论上严谨的推断框架,用于方差估计、置信区间和联合置信带的构建。
- 核心工具 / 方法:V-fold jackknife。该方法仅需 V 次留出重拟合,利用 jackknife 伪值的经验离散度来量化不确定性,无需推导或评估影响函数。
- 主要结论:对于正则渐近线性估计量,固定 V 时 Studentized 统计量收敛到 t_{V-1} 分布(定理 1);当 V 发散时,方差估计量以 V^{-1/2} 速率一致(定理 2);该方法可扩展到联合置信带(定理 4)和非 √n 收敛率的广义渐近线性估计量(定理 7, 8)。
关键设定与假设¶
- 核心设定:估计量
Ψ̂(P_n)是正则渐近线性 (RAL) 的,即Ψ̂(P_n) - Ψ(P_0) = P_n φ + R(P_n, P_0),其中R(P_n, P_0) = o_p(n^{-1/2})。这是整个理论的基础。 - 关键假设(定理 1,固定 V):
E_{P_0}[φ] = 0,0 < σ² = E_{P_0}[φ²] < ∞。R(P_n, P_0) = o_p(n^{-1/2})。max_{1≤v≤V} |R(P_{n, -v}, P_0)| = o_p(n^{-1/2})。这个假设要求 leave-fold-out 估计量的余项也足够小,是保证伪值近似成立的关键。
- 关键假设(定理 2,发散 V):
- 与定理 1 相同的 RAL 假设。
V → ∞,V = o(n)。- 折层余项差异条件:
∥d_n∥_{V,2} = o_p(1/(√n V)),其中d_{n,v} = R(P_n, P_0) - R(P_{n, -v}, P_0)。这个条件要求全样本和 leave-fold-out 样本的余项差异足够小,是方差估计量一致性的关键。
- 相比已有文献的放宽/强化:
- 相比 Brillinger (1964):将固定 V 的 t_{V-1} 结果从 MLE 推广到整个 RAL 类。
- 相比 Shao & Wu (1989):使用单个平衡分区(而非平均多个删除子集),假设直接基于 RAL 展开(而非一般的平滑性条件)。
- 相比 bootstrap:不依赖于 Hadamard 可微性,而是依赖于更直接的渐近线性和折层余项稳定性。
主要结果¶
- 定理 1 (固定 V 的 t 分布收敛):对于固定 V ≥ 2,在满足上述假设的条件下,Studentized V-fold jackknife 统计量收敛到自由度为 V-1 的 t 分布。这意味着即使方差估计量不依概率收敛,也能通过使用 t 分布的分位数来获得有效的置信区间。
- 定理 2 (发散 V 的方差一致性):当 V → ∞ 且满足折层余项差异条件时,V-fold jackknife 方差估计量
σ̂² = (n/V) Ŝ_Jack²是真实方差σ²的一致估计,且收敛速率为V^{-1/2}。这为 Wald 型置信区间提供了理论基础。 - 定理 4 (联合置信带):对于 m 维参数向量,固定 V 时,分量 Studentized 向量收敛到一个由真实相关矩阵
R_0决定的极限分布T_∞。该分布不同于标准的多变量 t 分布,其分位数需通过蒙特卡洛模拟计算。这为构建联合置信带提供了理论基础。 - 定理 7 & 8 (非 √n 收敛率):将上述结果推广到影响函数方差发散(
σ_n → ∞)的广义渐近线性估计量。由于 Studentization 的尺度不变性,未知的收敛率σ_n在 Studentized 统计量中被抵消,因此相同的 V-fold jackknife 程序无需知道有效维度即可提供有效的推断。
证明路线与技术技巧(理论型)¶
整体路线(以定理 1 为例):
1. 伪值分解:将伪值 IC_Jack(v) 分解为 Ψ(P_0) + P_{n, v} φ + 余项。证明的关键是,通过代数恒等式,全样本余项 R(P_n, P_0) 被精确抵消,只留下 leave-fold-out 余项的组合。
2. 方差估计量等价:证明 Ŝ_Jack² 与折层均值 W_v = P_{n, v} φ 的样本方差 S_W² 在渐近意义下等价(引理 1)。这依赖于余项假设 max_v |R(P_{n, -v}, P_0)| = o_p(n^{-1/2})。
3. 中心化等价:证明 jackknife 估计量 Ψ̂_Jack(P_n) 与全样本估计量 Ψ̂(P_n) 的差异是 o_p(cSE)(引理 2),因此可以将 Studentized 统计量中心化在 Ψ̂(P_n) 上。
4. 极限分布:将 Studentized 统计量表示为 (√V * 折层均值均值) / (折层均值标准差) + o_p(1)。由于折层均值是独立同分布随机变量的均值,根据中心极限定理和连续映射定理,该统计量收敛到 t_{V-1} 分布。
关键跳跃点:
* 引理 1 的证明:证明 Ŝ_Jack² 和 S_W² 的差异是 o_p(n^{-1})。这需要仔细处理余项 ∆_v 的阶数,并利用 W_v - W̄ = O_p(n^{-1/2}) 和 max_v |∆_v| = o_p(n^{-1/2}) 来证明交叉项和平方项都是可忽略的。
* 定理 2 的证明:证明方差估计量的一致性。关键跳跃点在于将 (n/V) Ŝ_W² 精确分解为 (1/n) Σ φ_i² + T_n + ...,其中 T_n 是折内交叉项。然后证明 T_n = O_p(V^{-1/2}),从而得到 σ̂² = (1/n) Σ φ_i² + O_p(V^{-1/2})。这需要计算 T_n 的方差,并利用 V → ∞ 的条件。
技术技巧点名:
* 代数恒等式:在伪值分解和方差分解中,大量使用代数恒等式来精确抵消或分离出余项。
* 连续映射定理:用于从折层均值的联合正态分布推导出 Studentized 统计量的 t 分布。
* Slutsky 定理:用于处理中心化等价和余项可忽略性。
* Cauchy-Schwarz 不等式:用于在定理 2 中界定量交叉项。
* U-统计量方差计算:用于计算 T_n 的方差,得到 O(V^{-1}) 的阶数。
真实例子与应用¶
本文包含三个详细的模拟实验,是验证理论的重要部分: 1. 平均处理效应 (ATE) 的标量推断: * 数据/场景:模拟数据,包含 8 个协变量、一个二元处理和一个连续结果。通过 TMLE 和 Super Learner 估计 ATE。考虑了四种场景(倾向性得分模型正确/错误指定,正性假设中等/严重)。 * 方法应用:将 V-fold jackknife (V=5,10,20) 与 EIC 方法、bootstrap 和稳健方差估计进行比较。 * 结果:在 n=200 时,EIC 方法严重欠覆盖(70-87%),而 V-fold jackknife 达到 93-98% 的覆盖。在 n=1000 时,差距缩小,但 V-fold jackknife 仍保持良好覆盖。 * 说明的问题:验证了定理 1 在有限样本下的有效性,特别是在 EIC 方法失效(由于 nuisance 估计不精确)的情况下。同时展示了 V 的选择对区间宽度的影响(V 越小,t 分位数越重尾,区间越宽,但覆盖更保守)。
-
Kaplan-Meier 生存曲线的点态和联合推断:
- 数据/场景:模拟右删失生存数据,n=200,在 91 个时间点上评估生存函数。
- 方法应用:比较 V-fold jackknife 与 Greenwood 公式(点态)以及经典的 Hall-Wellner 和 Equal Precision 带(联合)。
- 结果:点态覆盖接近 95%。联合覆盖(V=20)达到 94.6%,与经典方法(96.6%)相当。
- 说明的问题:验证了定理 4 在功能参数上的有效性。通过分析有效秩(effective rank),解释了即使 V < m(91个点),秩亏的相关矩阵估计也能很好地工作,因为相邻时间点高度相关,有效维度很低。
-
HAL 剂量反应曲线的推断:
- 数据/场景:模拟四种不同复杂度的剂量反应曲线(光滑、振荡、分段光滑、不连续),n=500,在 20 个剂量点上评估。
- 方法应用:比较 V-fold jackknife (V=20) 与 delta 方法和 bootstrap。这是对定理 7 和 8 的验证。
- 结果:对于光滑和振荡曲线,V-fold jackknife 达到近 95% 的点态覆盖,而 delta 方法严重欠覆盖(低至 72%)且数值失败率高达 6.2%。对于不连续曲线,所有方法覆盖都下降,但 V-fold jackknife 仍是最高的。偏差校正的联合置信带(定理 6)在偏差适中时恢复了近名义覆盖。
- 说明的问题:展示了 V-fold jackknife 在非 √n 收敛率设定下的实际价值。其尺度不变性使其无需知道有效维度
J_n即可自动适应发散的方差,而 delta 方法需要显式计算发散的方差,这既困难又数值不稳定。
🔎 结论是否比证明窄¶
- 定理 4 的联合置信带:作者明确指出,对于固定 V,极限分布
T_∞依赖于真实相关矩阵R_0,而R_0在固定 V 下是不可一致估计的。因此,正式的 plug-in 联合覆盖有效性需要 V → ∞(定理 5)。然而,模拟中使用了固定 V(如 V=20)并取得了良好效果。作者将此归因于低有效秩,并承认这是“empirical support”(经验支持),而非“formal fixed-V coverage theorem”(正式的固定 V 覆盖定理)。这是一个重要的窄结论。 - 定理 6 的偏差校正:定理 6 的证明依赖于一个均匀相对误差条件
ε_n = max_j |b̂_j - b_j| / cSE_j → 0。作者在模拟中展示了当偏差适中时(DGPs 1-2),该条件似乎成立,但当偏差很大时(DGPs 3-4),校正不充分。这表明定理 6 的结论可能比其证明所依赖的条件更窄,即它不能保证在偏差很大的情况下恢复名义覆盖。
四、开放问题¶
-
依赖数据的 V 选择:作者在 9.1 节给出了选择 V 的实用指导(如 V=10 到 20 是合理的默认值),并提出了一个基于有效秩的启发式规则(
V ≥ 2 r̂_V)。一个开放问题是:能否开发一个完全数据自适应的程序来选择 V,以平衡偏差-方差和计算成本?这扎根于论文的 9.1 节和 9.3 节。 -
增长维度的联合推断:论文的联合置信带理论假设 m 是固定的。一个自然的扩展是允许
m = m_n → ∞,例如在密集网格上评估函数。这需要均匀控制余项,并可能涉及高斯过程近似。这扎根于论文的 9.2 节(“The simultaneous confidence band theory assumes fixed m; extending to a growing number of evaluation points ... is beyond the scope of this paper.”)。 -
依赖数据的推广:论文假设 i.i.d. 数据。将框架扩展到时间序列或聚类数据,需要将折层结构替换为块或基于聚类的分区,类似于块 bootstrap 方法。这扎根于论文的 9.3 节(“adapting the framework to dependent data ... would require replacing the i.i.d. fold structure with block or cluster-based partitions”)。
-
与高阶影响函数 (HOIF) 的连接:论文的方法基于一阶渐近线性展开。一个开放问题是,对于需要高阶展开才能获得有效推断的估计量(例如,当一阶余项不可忽略时),V-fold jackknife 是否仍然有效,或者是否需要类似“高阶 jackknife”的构造?这扎根于研究者自身的兴趣(HOIF)和论文的 9.2 节(“Parameters fall outside the present theory when the required asymptotic linearity or fold-stable remainder conditions fail”)。
Maintained by 陈星宇 · Homepage · Source on GitHub