Wild Bootstrap and Efron's Bootstrap for Debiased Cox Regression¶
作者: Lena Schemet, Sarah Friedrich-Welz
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.24230
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在高维生存数据中,经过 Lasso 变量选择后,如何对选出的 Cox 回归系数进行有效的统计推断(构造置信区间)。核心挑战在于,Lasso 的收缩偏倚和选择步骤会扭曲估计量的抽样分布,使得基于一阶渐近正态近似的 Wald 区间在有限样本下覆盖精度严重不足。当前成熟度:debiased Lasso 框架已为高维线性模型和广义线性模型提供了渐近有效的推断,并已推广到 Cox 模型;但有限样本下的一阶近似仍不精确,而 bootstrap 方法在 Lasso 选择后的理论有效性长期被质疑,因此将 bootstrap 应用于 debiased Cox 估计量以改进有限样本覆盖是一个自然但尚未被系统研究的缺口。
发展脉络(history)¶
-
奠基工作:Lasso 与 debiased 推断框架
- Tibshirani (1996, 1997):提出 Lasso 和 Cox Lasso,将 ℓ1 惩罚引入回归与生存分析,实现变量选择与正则化估计。
- Zhang & Zhang (2014) 与 van de Geer et al. (2014):提出 debiased / desparsified Lasso 框架,通过一阶校正消除 Lasso 的收缩偏倚,使估计量渐近正态,从而在高维线性模型和广义线性模型中实现有效推断。这是本文的核心理论基石。
- Yu, Bradic & Samworth (2021) 与 Kong, Yu, Zhang & Cheng (2021):将 debiased Lasso 框架推广到 Cox 比例风险模型,处理了时依协变量、删失和模型误设等挑战,建立了 debiased Cox 估计量的渐近正态性。本文直接引用这些工作作为 Cox 模型 debiasing 的“黑箱”结果。
-
主要进展:后选择推断的困境与 bootstrap 的局限性
- Leeb & Pötscher (2005, 2006) 与 Berk et al. (2013):严格证明了直接对 Lasso 估计量进行 bootstrap 是无效的,因为其极限分布非光滑且不连续。这奠定了“bootstrap 在正则化选择后不可靠”的普遍认知。
- Lee et al. (2016) 与 Taylor & Tibshirani (2018):提出精确后选择推断(exact post-selection inference),通过条件在所选模型上来获得有效推断。本文明确将其定位为替代路线,而非本文追求的目标。
-
当前 Frontier:bootstrap 在 debiased 估计量上的应用
- Pauly (2011) 与 Chernozhukov, Chetverikov & Kato (2013):为加权重抽样(包括 multiplier bootstrap 和 exchangeably weighted bootstrap)在鞅差数组和高维随机向量最大值上的应用提供了理论工具。本文的 wild bootstrap 和 Efron bootstrap 证明直接依赖这些结果。
- Dobler & Pauly (2014) 与 Bluhmki et al. (2019):将 wild bootstrap 应用于 Aalen-Johansen 估计量和 Nelson-Aalen 估计量,展示了其在生存分析计数过程框架下的有效性。本文的 score-based bootstrap 构造与这些工作一脉相承。
- 本文位置:本文是首次系统研究将 wild bootstrap 和 Efron's bootstrap 应用于 debiased Cox 估计量,以改进有限样本下后选择推断的覆盖精度。它填补了“debiased 推断”与“bootstrap 重抽样”之间的空白,并回应了“bootstrap 在 Lasso 后无效”的普遍质疑。
子线索聚类¶
- Debiased Lasso 推断框架:van de Geer et al. (2014), Zhang & Zhang (2014), Yu et al. (2021), Kong et al. (2021), Xia, Nan & Li (2023)。这一簇的核心是构造渐近线性表示,通过估计逆信息矩阵来校正 Lasso 偏倚,从而获得渐近正态的估计量。本文的 debiased Cox 估计量直接来自这一簇。
- 后选择推断:Leeb & Pötscher (2005, 2006), Berk et al. (2013), Lee et al. (2016), Taylor & Tibshirani (2018)。这一簇关注选择步骤对推断的影响,要么证明传统方法失效,要么提出条件在所选模型上的精确推断。本文将其作为对比和背景,而非采用其方法。
- 生存分析中的重抽样方法:Pauly (2011), Dobler & Pauly (2014), Bluhmki et al. (2019), Chernozhukov et al. (2013), Dietrich, Dobler & de Gunst (2025)。这一簇为计数过程和鞅框架下的加权重抽样提供了理论基础。本文的 score-based bootstrap 构造和渐近证明直接建立在这一簇之上。
这个方向在追问的核心问题¶
- 如何在高维 Cox 模型中进行变量选择后的有效推断? 当前主流方法是 debiased Lasso 的 Wald 区间,但已知其在有限样本下覆盖不足。
- bootstrap 能否用于改进 debiased 估计量的有限样本覆盖? 尽管 bootstrap 在 Lasso 估计量上失效,但 debiased 估计量是光滑且正则的,这为 bootstrap 的应用打开了大门。
- 哪种 bootstrap 方案(wild vs. Efron)在生存数据设定下更有效? 两者在理论有效性、计算成本和有限样本表现上存在权衡。
- bootstrap 的改进是否依赖于调参规则? 理论证明不依赖特定调参规则,但模拟显示改进幅度受调参规则影响。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口 frame 为“debiased Cox 估计量的 bootstrap 校准”。他们指出,尽管 debiased 估计量是渐近正态的,但一阶 Wald 区间在有限样本下仍不精确,而 bootstrap 是改进有限样本近似的标准工具。由于 debiased 估计量是光滑的,它避开了“bootstrap 在 Lasso 后无效”的经典负面结论。因此,本文成为“显然的下一步”:将 bootstrap 应用于 debiased Cox 估计量。
- 哪些竞争路线被他淡化或回避了:作者明确淡化了精确后选择推断(Lee et al. 2016, Taylor & Tibshirani 2018)。他们指出本文的目标不是提出精确的后选择推断,而是评估 bootstrap 是否提供了一种实用且可靠的方法。这暗示精确后选择推断可能计算复杂或对模型假设敏感,而 bootstrap 更易于实现。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用关于 bootstrap 在 debiased Lasso 上应用的早期工作。例如,对于线性模型,是否有工作尝试过类似思路?这可能是作者有意为之,因为本文可能是该方向的首篇系统研究。值得研究者去查的问题:在本文之前,是否有任何工作(即使是会议论文或预印本)将 bootstrap 应用于 debiased Lasso 估计量(不限于 Cox 模型)?如果有,它们的结论与本文有何异同?
张力¶
未见明显对立引用。所有被引工作基本构成一个连贯的叙事:debiased 推断提供了渐近有效性,但有限样本不足;bootstrap 在 Lasso 上失效,但在 debiased 估计量上可能有效。本文是这一叙事的自然延伸。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
T_i: 个体i的真实事件时间(潜在量,不可完全观测)。C_i: 个体i的删失时间(潜在量,不可完全观测)。\tilde{T}_i = min(T_i, C_i): 观测到的随访时间(可观测)。\delta_i = I(T_i \le C_i): 事件指示符(1=事件,0=删失)(可观测)。X_i \in \mathbb{R}^p: p 维协变量向量(可观测)。O_i = (\tilde{T}_i, \delta_i, X_i): 个体i的可观测数据。n: 样本量。p: 协变量维数(可能大于 n)。\beta_0 \in \mathbb{R}^p: 真实的回归系数向量(待估参数)。\hat{\beta}: Cox Lasso 估计量(有偏的)。\tilde{\beta}: Debiased Cox 估计量(目标估计量)。\Theta_0 = \Sigma_0^{-1}: 逆信息矩阵(未知的总体量)。\hat{\Theta}: 通过 nodewise Lasso 估计的逆信息矩阵。\psi_i(\beta): 个体i在参数\beta处的 Cox 得分贡献(可基于可观测数据计算)。\dot{\ell}_n(\beta) = n^{-1} \sum_i \psi_i(\beta): 归一化的 Cox 得分。\xi_i^{(b)}: 第b次 wild bootstrap 重抽样的乘子(独立于数据,均值为0,方差为1)。W_i^{(b)}: 第b次 Efron bootstrap 重抽样的多项计数。\omega_i^{(b)} = W_i^{(b)} - 1: 中心化的 Efron bootstrap 权重。\tilde{\beta}_j^{*(b)}: 第b次 bootstrap 重抽样的 debiased 估计量在第j个分量上的值。\hat{\sigma}_{j,*}: bootstrap 标准差。
- 模型:Cox 比例风险模型。给定协变量
X_i,个体i在时间t的风险函数为\lambda(t|X_i) = \lambda_0(t) \exp(X_i^\top \beta_0),其中\lambda_0(t)是未知的基线风险函数。模型假设风险比例性,即不同个体的风险函数之比不随时间变化。 - 可观测数据:研究者能观测到
(\tilde{T}_i, \delta_i, X_i)。由此可以构造计数过程N_i(t) = I(\tilde{T}_i \le t, \delta_i = 1)和风险集指示Y_i(t) = I(\tilde{T}_i \ge t)。想要但观测不到的是真实事件时间T_i和基线风险函数\lambda_0(t)。Cox 模型通过部分似然巧妙地绕过了\lambda_0(t),使得\beta_0的推断仅依赖于可观测数据。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设我们只有一个协变量(p=1),并且我们只关心这一个系数的推断。此时,Cox Lasso 退化为一个带 ℓ1 惩罚的 Cox 回归。Debiased 估计量简化为 \tilde{\beta} = \hat{\beta} + \hat{\Theta} \dot{\ell}_n(\hat{\beta}),其中 \hat{\Theta} 是一个标量,是 \hat{\Sigma}^{-1} 的估计。
核心命题:\tilde{\beta} 是渐近正态的,其渐近方差为 \sigma^2 / n,其中 \sigma^2 = \text{Var}(\Theta_0 \psi_i(\beta_0))。
最小内核的证明思路:
1. 渐近线性表示:通过泰勒展开,可以证明 \sqrt{n}(\tilde{\beta} - \beta_0) = \Theta_0 \frac{1}{\sqrt{n}} \sum_{i=1}^n \psi_i(\beta_0) + o_p(1)。这意味着 debiased 估计量在渐近意义上等价于一个样本均值(的线性变换)。
2. Bootstrap 近似:既然 \tilde{\beta} 的分布由 \sum_i \psi_i(\beta_0) 驱动,那么我们可以通过重加权这个和来近似其分布,而无需重新估计 \hat{\beta} 和 \hat{\Theta}。
- Wild Bootstrap:用独立乘子 \xi_i 重加权:\tilde{\beta}_{WB}^* = \tilde{\beta} + \hat{\Theta} \frac{1}{n} \sum_i \xi_i \psi_i(\hat{\beta})。由于 \xi_i 是独立同分布的,条件于数据,\frac{1}{\sqrt{n}} \sum_i \xi_i \psi_i(\hat{\beta}) 的分布可以通过条件中心极限定理逼近 N(0, \hat{\sigma}^2)。
- Efron Bootstrap:用中心化的多项权重 \omega_i 重加权:\tilde{\beta}_{Efr}^* = \tilde{\beta} + \hat{\Theta} \frac{1}{n} \sum_i \omega_i \psi_i(\hat{\beta})。条件于数据,\frac{1}{\sqrt{n}} \sum_i \omega_i \psi_i(\hat{\beta}) 的分布可以通过 Pauly (2011) 的交换性加权重抽样理论逼近 N(0, \hat{\sigma}^2)。
为什么这个内核成立:关键在于 debiased 估计量的渐近线性表示。它把复杂的、非光滑的 Lasso 估计问题转化为了一个光滑的、关于得分函数的线性问题。Bootstrap 只需要重加权这个线性部分,而无需处理 Lasso 的非光滑性。这完美地避开了“bootstrap 在 Lasso 上失效”的经典问题。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了在 Cox 比例风险模型中,经过 Lasso 变量选择后,如何利用 wild bootstrap 和 Efron's bootstrap 对 debiased Cox 估计量进行推断,以构造比一阶 Wald 区间更精确的置信区间。
- 核心工具 / 方法:提出了两种 score-based bootstrap 方案:wild bootstrap(使用独立乘子重加权个体得分贡献)和 Efron's bootstrap(使用中心化的多项重抽样权重重加权得分贡献)。两种方案均固定原始的 Cox Lasso 拟合和 debiasing 矩阵,仅对得分贡献施加 bootstrap 权重。
- 主要结论:理论证明了两种 bootstrap 的渐近有效性,即 bootstrap 分布能一致逼近 debiased 估计量的渐近分布。模拟实验表明,在多种小到中等样本量设定下,bootstrap 区间(尤其是 basic 区间)的覆盖精度优于一阶 debiased Wald 区间,但改进幅度依赖于调参规则和设定。Efron's bootstrap 更保守,覆盖更高但区间更宽;wild bootstrap 更温和,计算成本更低。
关键设定与假设¶
- 设定:高维 Cox 比例风险模型,数据存在独立右删失。协变量维数
p可以大于或接近样本量n。真实回归系数\beta_0是稀疏的(s_0 = \|\beta_0\|_0较小)。 - 关键假设(在附录 S1.2 中列出):
- (A1) 独立删失:
C_i \perp T_i | X_i。这是 Cox 模型的标准假设。 - (A2) 有界协变量与有限时间:协变量几乎处处有界,研究时间
\tau有限。这是技术性假设,用于控制经验过程。 - (A3) 非退化风险集:基线风险有界,且风险集在
\tau内非退化。确保 Cox 部分似然的 Hessian 矩阵是良定义的。 - (A4) 信息矩阵正定:总体信息矩阵
\Sigma_0的特征值有界且远离 0。这是进行 debiasing 和渐近推断的基础。 - (A5) 稀疏性:
s_0 \log p / \sqrt{n} \to 0。这是高维 Lasso 理论的标准条件,要求真实模型足够稀疏,以保证 Lasso 估计量的收敛速度。 - (A6) 精度矩阵估计一致性:Nodewise Lasso 估计的
\hat{\Theta}在无穷范数下是\Theta_0的一致估计。这是 debiasing 步骤成功的关键。 - (A7) 影响函数矩条件:影响函数
\phi_{ij}的四阶矩有限。用于 bootstrap 的条件中心极限定理。 - (A8) Wild Bootstrap 乘子条件:乘子
\xi_i独立同分布,均值为 0,方差为 1,四阶矩有限。标准条件。 - (A9) Efron Bootstrap 权重条件:权重来自多项分布。标准条件。
- (A1) 独立删失:
- 相比已有文献的强化/放宽:本文的假设与 Yu et al. (2021) 和 Kong et al. (2021) 等 debiased Cox 文献的假设基本一致。关键创新在于,本文的证明不依赖于特定的调参规则(如
\lambda_{\min}或\lambda_{1se}),而是依赖于 Lasso 估计量最终满足的稀疏性和余项控制性质(Remark 1)。这比要求调参规则满足特定理论速率更宽松,也更贴近实践。
主要结果¶
- 定理 1 (渐近线性性):
\sqrt{n}(\tilde{\beta}_j - \beta_j^0) = n^{-1/2} \sum_i \phi_{ij} + o_p(1),其中\phi_{ij} = e_j^\top \Theta_0 \psi_i(\beta_0)。这是整个推断的基础,将 debiased 估计量转化为一个样本均值的线性变换。 - 定理 2 (Wild Bootstrap 一致性):
\sup_t |P^*(\sqrt{n}(\tilde{\beta}_{WB,j}^* - \tilde{\beta}_j) \le t) - P(\sqrt{n}(\tilde{\beta}_j - \beta_j^0) \le t)| \xrightarrow{p} 0。即 wild bootstrap 分布能一致逼近真实抽样分布。 - 定理 3 (Wild Bootstrap 方差一致性):
\hat{\sigma}_{j,WB}^2 \xrightarrow{p} \sigma_j^2 / n。即 bootstrap 方差是渐近方差的一致估计。 - 定理 4 (标准化 Wild Bootstrap 统计量的有效性):
\sup_t |P^*(T_j^{WB} \le t) - P(T_j \le t)| \xrightarrow{p} 0,其中T_j^{WB} = (\tilde{\beta}_{WB,j}^* - \tilde{\beta}_j) / \hat{\sigma}_{j,WB}。这保证了 basic bootstrap 区间的渐近覆盖。 - Efron Bootstrap 的对应结果:定理 S5-S7 给出了 Efron bootstrap 的类似一致性结果,证明依赖于 Pauly (2011) 的交换性加权重抽样理论。
证明路线与技术技巧(理论型)¶
- 整体路线:
- 线性化:利用泰勒展开和 Lasso 的收敛速度,证明 debiased 估计量
\tilde{\beta}与一个线性统计量n^{-1/2} \sum_i \phi_{ij}渐近等价(定理 1)。 - Bootstrap 线性化:类似地,证明 bootstrap 统计量
\tilde{\beta}_j^*与一个加权线性统计量n^{-1/2} \sum_i \xi_i \phi_{ij}(wild) 或n^{-1/2} \sum_i \omega_i \phi_{ij}(Efron) 渐近等价,且余项在条件概率下可忽略(o_p^*(1))。 - 条件中心极限定理:
- Wild:对
n^{-1/2} \sum_i \xi_i \phi_{ij}应用条件于数据的 multiplier CLT(如 van der Vaart & Wellner 1996),证明其条件分布弱收敛于N(0, \sigma_j^2)。 - Efron:对
n^{-1/2} \sum_i \omega_i \phi_{ij}应用 Pauly (2011) 关于交换性加权重抽样的定理 4.1,证明其条件分布弱收敛于N(0, \sigma_j^2)。
- Wild:对
- Slutsky 论证:结合步骤 1-3,利用条件 Slutsky 引理(Lemma S1),证明 bootstrap 统计量的条件分布与原始统计量的无条件分布之间的 Kolmogorov 距离收敛到 0。
- 线性化:利用泰勒展开和 Lasso 的收敛速度,证明 debiased 估计量
- 关键跳跃点:
- 处理 bootstrap 余项:证明
\hat{\Theta} \dot{\ell}_n(\hat{\beta})与\Theta_0 \dot{\ell}_n(\beta_0)之差在 bootstrap 下是o_p^*(1)。这需要利用 Lasso 和 nodewise Lasso 的收敛速度,以及\hat{\beta}和\hat{\Theta}在 bootstrap 中固定这一事实。难点在于,\psi_i(\hat{\beta})与\psi_i(\beta_0)的差异需要被控制。作者通过假设 (A1)-(A7) 和 Lasso 的稀疏性来保证这一点。 - Efron Bootstrap 的条件 CLT:与 wild bootstrap 的独立乘子不同,Efron 的权重
\omega_i是相依的(和为 0)。直接应用标准 CLT 不成立。作者巧妙地将其与 Pauly (2011) 的框架联系起来,该框架专门处理交换性、中心化的权重,并证明了其条件分布的正态性。
- 处理 bootstrap 余项:证明
- 技术技巧点名:
- 条件 Slutsky 引理 (Lemma S1):用于将 bootstrap 余项
o_p^*(1)与主项分离,是证明 bootstrap 一致性的标准技巧。 - Multiplier CLT:用于 wild bootstrap 的条件分布逼近。
- Pauly (2011) 的交换性加权重抽样定理:用于 Efron bootstrap 的条件分布逼近。这是本文证明 Efron bootstrap 有效性的核心理论工具。
- Nodewise Lasso:用于估计逆信息矩阵
\Theta_0,是 debiasing 步骤的标准技术。 - ADEMP 框架:用于设计模拟实验,确保模拟的系统性和可重复性。
- 条件 Slutsky 引理 (Lemma S1):用于将 bootstrap 余项
真实例子与应用¶
- 数据:SUPPORT2 数据集(Study to Understand Prognoses and Preferences for Outcomes and Risks of Treatments),一个多中心队列研究,包含 9,105 名重病住院患者和 44 个基线协变量。
- 应用方法:使用 Cox Lasso 进行变量选择(选出 20 个协变量),然后对选出的系数计算 debiased Wald 区间、wild bootstrap basic 区间和 Efron bootstrap basic 区间。
- 结果:图 4 展示了三个方法对 20 个选出的协变量的风险比估计和 90% 置信区间。对于强信号(如
avtisst,age,scoma),三种区间非常相似。对于中等强度的信号,bootstrap 区间(尤其是 Efron)比 Wald 区间更宽或更不对称,反映了有限样本下 bootstrap 分布与一阶正态近似的差异。 - 这个例子想说明什么:这个例子旨在展示所提方法在实际大规模数据中的应用,并说明推断方法的选择会影响中等强度效应的不确定性量化。它不是一个验证理论或展示压倒性优势的模拟,而是一个实用性演示。作者明确指出,该数据集的样本量远大于模拟中的样本量,因此它“补充而非镜像”了模拟研究。
🔎 结论是否比证明窄¶
- 窄的结论:定理 2-4 的证明明确依赖于坐标 ℓ1 惩罚(Cox Lasso)和 nodewise ℓ1 回归。作者在 Remark S1 中明确声明,证明不自动扩展到 elastic net, group Lasso, fused Lasso, SCAD, MCP 等其他惩罚。这是一个重要的窄化。论文的结论严格限于 Cox Lasso。
- 泛化的 claim:作者在讨论部分提到“同样的 score-based bootstrap 构造可以与常见的调参选择或密切相关的加权/自适应 ℓ1 变体结合”,但这只是一个推测,并未在理论中证明。作者谨慎地指出,这要求这些变体满足证明所需的稀疏性和余项条件。
- 关于调参规则:理论证明(Remark 1)声称不依赖于特定调参规则,而是依赖于 Lasso 估计量的性质。然而,模拟结果(表 S6, S7)显示,不同的调参规则(
\lambda_{\min},\lambda_{1se}, AIC, BIC)确实会影响 bootstrap 区间的覆盖和宽度。这表明,虽然理论是“调参规则无关”的,但有限样本表现对调参规则是敏感的。这是一个值得注意的张力。
四、开放问题¶
- 数据驱动调参的显式理论:本文的理论(Remark 1)依赖于 Lasso 估计量满足特定的稀疏性和余项条件,但并未给出一个保证这些条件成立的、关于数据驱动调参规则(如交叉验证)的显式理论。扎根于:Remark 1 和 Section 7 的讨论“develop a more explicit theory for data-driven tuning rules in debiased Cox inference”。
- Bootstrap-t 区间:本文只研究了 basic bootstrap 区间,并指出 bootstrap-t 区间(使用复制内标准差)可能提供进一步的有限样本改进,但代价是计算成本更高。扎根于:Section 7 的讨论“investigate the classical bootstrap-t construction with replicate-specific standard-error estimates”。
- 同时置信带:本文只处理了分量推断。将 bootstrap 方法扩展到时间索引的生存量(如累积基线风险)的同时置信带,需要函数型弱收敛论证。扎根于:Section 7 的讨论“move beyond the present componentwise theory toward simultaneous confidence bands for time-indexed survival quantities”。
- 更广泛的惩罚类:本文的证明严格限于 Cox Lasso。将类似方法推广到 elastic net, group Lasso, SCAD 等惩罚,需要处理不同的 KKT 结构和偏倚项。扎根于:Remark S1 和 Section 7 的讨论“investigate whether the finite-sample advantages of bootstrap refinement persist for broader penalty classes”。
Maintained by 陈星宇 · Homepage · Source on GitHub