跳转至

Wild Bootstrap and Efron's Bootstrap for Debiased Cox Regression

作者: Lena Schemet, Sarah Friedrich-Welz
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.24230


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在高维生存数据中,经过 Lasso 变量选择后,如何对选出的 Cox 回归系数进行有效的统计推断(构造置信区间)。核心挑战在于,Lasso 的收缩偏倚和选择步骤会扭曲估计量的抽样分布,使得基于一阶渐近正态近似的 Wald 区间在有限样本下覆盖精度严重不足。当前成熟度:debiased Lasso 框架已为高维线性模型和广义线性模型提供了渐近有效的推断,并已推广到 Cox 模型;但有限样本下的一阶近似仍不精确,而 bootstrap 方法在 Lasso 选择后的理论有效性长期被质疑,因此将 bootstrap 应用于 debiased Cox 估计量以改进有限样本覆盖是一个自然但尚未被系统研究的缺口。

发展脉络(history)

  1. 奠基工作:Lasso 与 debiased 推断框架

    • Tibshirani (1996, 1997):提出 Lasso 和 Cox Lasso,将 ℓ1 惩罚引入回归与生存分析,实现变量选择与正则化估计。
    • Zhang & Zhang (2014) 与 van de Geer et al. (2014):提出 debiased / desparsified Lasso 框架,通过一阶校正消除 Lasso 的收缩偏倚,使估计量渐近正态,从而在高维线性模型和广义线性模型中实现有效推断。这是本文的核心理论基石。
    • Yu, Bradic & Samworth (2021) 与 Kong, Yu, Zhang & Cheng (2021):将 debiased Lasso 框架推广到 Cox 比例风险模型,处理了时依协变量、删失和模型误设等挑战,建立了 debiased Cox 估计量的渐近正态性。本文直接引用这些工作作为 Cox 模型 debiasing 的“黑箱”结果。
  2. 主要进展:后选择推断的困境与 bootstrap 的局限性

    • Leeb & Pötscher (2005, 2006) 与 Berk et al. (2013):严格证明了直接对 Lasso 估计量进行 bootstrap 是无效的,因为其极限分布非光滑且不连续。这奠定了“bootstrap 在正则化选择后不可靠”的普遍认知。
    • Lee et al. (2016) 与 Taylor & Tibshirani (2018):提出精确后选择推断(exact post-selection inference),通过条件在所选模型上来获得有效推断。本文明确将其定位为替代路线,而非本文追求的目标。
  3. 当前 Frontier:bootstrap 在 debiased 估计量上的应用

    • Pauly (2011) 与 Chernozhukov, Chetverikov & Kato (2013):为加权重抽样(包括 multiplier bootstrap 和 exchangeably weighted bootstrap)在鞅差数组和高维随机向量最大值上的应用提供了理论工具。本文的 wild bootstrap 和 Efron bootstrap 证明直接依赖这些结果。
    • Dobler & Pauly (2014) 与 Bluhmki et al. (2019):将 wild bootstrap 应用于 Aalen-Johansen 估计量和 Nelson-Aalen 估计量,展示了其在生存分析计数过程框架下的有效性。本文的 score-based bootstrap 构造与这些工作一脉相承。
    • 本文位置:本文是首次系统研究将 wild bootstrap 和 Efron's bootstrap 应用于 debiased Cox 估计量,以改进有限样本下后选择推断的覆盖精度。它填补了“debiased 推断”与“bootstrap 重抽样”之间的空白,并回应了“bootstrap 在 Lasso 后无效”的普遍质疑。

子线索聚类

  1. Debiased Lasso 推断框架:van de Geer et al. (2014), Zhang & Zhang (2014), Yu et al. (2021), Kong et al. (2021), Xia, Nan & Li (2023)。这一簇的核心是构造渐近线性表示,通过估计逆信息矩阵来校正 Lasso 偏倚,从而获得渐近正态的估计量。本文的 debiased Cox 估计量直接来自这一簇。
  2. 后选择推断:Leeb & Pötscher (2005, 2006), Berk et al. (2013), Lee et al. (2016), Taylor & Tibshirani (2018)。这一簇关注选择步骤对推断的影响,要么证明传统方法失效,要么提出条件在所选模型上的精确推断。本文将其作为对比和背景,而非采用其方法。
  3. 生存分析中的重抽样方法:Pauly (2011), Dobler & Pauly (2014), Bluhmki et al. (2019), Chernozhukov et al. (2013), Dietrich, Dobler & de Gunst (2025)。这一簇为计数过程和鞅框架下的加权重抽样提供了理论基础。本文的 score-based bootstrap 构造和渐近证明直接建立在这一簇之上。

这个方向在追问的核心问题

  1. 如何在高维 Cox 模型中进行变量选择后的有效推断? 当前主流方法是 debiased Lasso 的 Wald 区间,但已知其在有限样本下覆盖不足。
  2. bootstrap 能否用于改进 debiased 估计量的有限样本覆盖? 尽管 bootstrap 在 Lasso 估计量上失效,但 debiased 估计量是光滑且正则的,这为 bootstrap 的应用打开了大门。
  3. 哪种 bootstrap 方案(wild vs. Efron)在生存数据设定下更有效? 两者在理论有效性、计算成本和有限样本表现上存在权衡。
  4. bootstrap 的改进是否依赖于调参规则? 理论证明不依赖特定调参规则,但模拟显示改进幅度受调参规则影响。

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将缺口 frame 为“debiased Cox 估计量的 bootstrap 校准”。他们指出,尽管 debiased 估计量是渐近正态的,但一阶 Wald 区间在有限样本下仍不精确,而 bootstrap 是改进有限样本近似的标准工具。由于 debiased 估计量是光滑的,它避开了“bootstrap 在 Lasso 后无效”的经典负面结论。因此,本文成为“显然的下一步”:将 bootstrap 应用于 debiased Cox 估计量。
  • 哪些竞争路线被他淡化或回避了:作者明确淡化了精确后选择推断(Lee et al. 2016, Taylor & Tibshirani 2018)。他们指出本文的目标不是提出精确的后选择推断,而是评估 bootstrap 是否提供了一种实用且可靠的方法。这暗示精确后选择推断可能计算复杂或对模型假设敏感,而 bootstrap 更易于实现。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用关于 bootstrap 在 debiased Lasso 上应用的早期工作。例如,对于线性模型,是否有工作尝试过类似思路?这可能是作者有意为之,因为本文可能是该方向的首篇系统研究。值得研究者去查的问题:在本文之前,是否有任何工作(即使是会议论文或预印本)将 bootstrap 应用于 debiased Lasso 估计量(不限于 Cox 模型)?如果有,它们的结论与本文有何异同?

张力

未见明显对立引用。所有被引工作基本构成一个连贯的叙事:debiased 推断提供了渐近有效性,但有限样本不足;bootstrap 在 Lasso 上失效,但在 debiased 估计量上可能有效。本文是这一叙事的自然延伸。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:
    • T_i: 个体 i 的真实事件时间(潜在量,不可完全观测)。
    • C_i: 个体 i 的删失时间(潜在量,不可完全观测)。
    • \tilde{T}_i = min(T_i, C_i): 观测到的随访时间(可观测)。
    • \delta_i = I(T_i \le C_i): 事件指示符(1=事件,0=删失)(可观测)。
    • X_i \in \mathbb{R}^p: p 维协变量向量(可观测)。
    • O_i = (\tilde{T}_i, \delta_i, X_i): 个体 i 的可观测数据。
    • n: 样本量。
    • p: 协变量维数(可能大于 n)。
    • \beta_0 \in \mathbb{R}^p: 真实的回归系数向量(待估参数)。
    • \hat{\beta}: Cox Lasso 估计量(有偏的)。
    • \tilde{\beta}: Debiased Cox 估计量(目标估计量)。
    • \Theta_0 = \Sigma_0^{-1}: 逆信息矩阵(未知的总体量)。
    • \hat{\Theta}: 通过 nodewise Lasso 估计的逆信息矩阵。
    • \psi_i(\beta): 个体 i 在参数 \beta 处的 Cox 得分贡献(可基于可观测数据计算)。
    • \dot{\ell}_n(\beta) = n^{-1} \sum_i \psi_i(\beta): 归一化的 Cox 得分。
    • \xi_i^{(b)}: 第 b 次 wild bootstrap 重抽样的乘子(独立于数据,均值为0,方差为1)。
    • W_i^{(b)}: 第 b 次 Efron bootstrap 重抽样的多项计数。
    • \omega_i^{(b)} = W_i^{(b)} - 1: 中心化的 Efron bootstrap 权重。
    • \tilde{\beta}_j^{*(b)}: 第 b 次 bootstrap 重抽样的 debiased 估计量在第 j 个分量上的值。
    • \hat{\sigma}_{j,*}: bootstrap 标准差。
  • 模型:Cox 比例风险模型。给定协变量 X_i,个体 i 在时间 t 的风险函数为 \lambda(t|X_i) = \lambda_0(t) \exp(X_i^\top \beta_0),其中 \lambda_0(t) 是未知的基线风险函数。模型假设风险比例性,即不同个体的风险函数之比不随时间变化。
  • 可观测数据:研究者能观测到 (\tilde{T}_i, \delta_i, X_i)。由此可以构造计数过程 N_i(t) = I(\tilde{T}_i \le t, \delta_i = 1) 和风险集指示 Y_i(t) = I(\tilde{T}_i \ge t)。想要但观测不到的是真实事件时间 T_i 和基线风险函数 \lambda_0(t)。Cox 模型通过部分似然巧妙地绕过了 \lambda_0(t),使得 \beta_0 的推断仅依赖于可观测数据。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:假设我们只有一个协变量(p=1),并且我们只关心这一个系数的推断。此时,Cox Lasso 退化为一个带 ℓ1 惩罚的 Cox 回归。Debiased 估计量简化为 \tilde{\beta} = \hat{\beta} + \hat{\Theta} \dot{\ell}_n(\hat{\beta}),其中 \hat{\Theta} 是一个标量,是 \hat{\Sigma}^{-1} 的估计。

核心命题:\tilde{\beta} 是渐近正态的,其渐近方差为 \sigma^2 / n,其中 \sigma^2 = \text{Var}(\Theta_0 \psi_i(\beta_0))。

最小内核的证明思路: 1. 渐近线性表示:通过泰勒展开,可以证明 \sqrt{n}(\tilde{\beta} - \beta_0) = \Theta_0 \frac{1}{\sqrt{n}} \sum_{i=1}^n \psi_i(\beta_0) + o_p(1)。这意味着 debiased 估计量在渐近意义上等价于一个样本均值(的线性变换)。 2. Bootstrap 近似:既然 \tilde{\beta} 的分布由 \sum_i \psi_i(\beta_0) 驱动,那么我们可以通过重加权这个和来近似其分布,而无需重新估计 \hat{\beta} 和 \hat{\Theta}。 - Wild Bootstrap:用独立乘子 \xi_i 重加权:\tilde{\beta}_{WB}^* = \tilde{\beta} + \hat{\Theta} \frac{1}{n} \sum_i \xi_i \psi_i(\hat{\beta})。由于 \xi_i 是独立同分布的,条件于数据,\frac{1}{\sqrt{n}} \sum_i \xi_i \psi_i(\hat{\beta}) 的分布可以通过条件中心极限定理逼近 N(0, \hat{\sigma}^2)。 - Efron Bootstrap:用中心化的多项权重 \omega_i 重加权:\tilde{\beta}_{Efr}^* = \tilde{\beta} + \hat{\Theta} \frac{1}{n} \sum_i \omega_i \psi_i(\hat{\beta})。条件于数据,\frac{1}{\sqrt{n}} \sum_i \omega_i \psi_i(\hat{\beta}) 的分布可以通过 Pauly (2011) 的交换性加权重抽样理论逼近 N(0, \hat{\sigma}^2)。

为什么这个内核成立:关键在于 debiased 估计量的渐近线性表示。它把复杂的、非光滑的 Lasso 估计问题转化为了一个光滑的、关于得分函数的线性问题。Bootstrap 只需要重加权这个线性部分,而无需处理 Lasso 的非光滑性。这完美地避开了“bootstrap 在 Lasso 上失效”的经典问题。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了在 Cox 比例风险模型中,经过 Lasso 变量选择后,如何利用 wild bootstrap 和 Efron's bootstrap 对 debiased Cox 估计量进行推断,以构造比一阶 Wald 区间更精确的置信区间。
  2. 核心工具 / 方法:提出了两种 score-based bootstrap 方案:wild bootstrap(使用独立乘子重加权个体得分贡献)和 Efron's bootstrap(使用中心化的多项重抽样权重重加权得分贡献)。两种方案均固定原始的 Cox Lasso 拟合和 debiasing 矩阵,仅对得分贡献施加 bootstrap 权重。
  3. 主要结论:理论证明了两种 bootstrap 的渐近有效性,即 bootstrap 分布能一致逼近 debiased 估计量的渐近分布。模拟实验表明,在多种小到中等样本量设定下,bootstrap 区间(尤其是 basic 区间)的覆盖精度优于一阶 debiased Wald 区间,但改进幅度依赖于调参规则和设定。Efron's bootstrap 更保守,覆盖更高但区间更宽;wild bootstrap 更温和,计算成本更低。

关键设定与假设

  • 设定:高维 Cox 比例风险模型,数据存在独立右删失。协变量维数 p 可以大于或接近样本量 n。真实回归系数 \beta_0 是稀疏的(s_0 = \|\beta_0\|_0 较小)。
  • 关键假设(在附录 S1.2 中列出):
    • (A1) 独立删失:C_i \perp T_i | X_i。这是 Cox 模型的标准假设。
    • (A2) 有界协变量与有限时间:协变量几乎处处有界,研究时间 \tau 有限。这是技术性假设,用于控制经验过程。
    • (A3) 非退化风险集:基线风险有界,且风险集在 \tau 内非退化。确保 Cox 部分似然的 Hessian 矩阵是良定义的。
    • (A4) 信息矩阵正定:总体信息矩阵 \Sigma_0 的特征值有界且远离 0。这是进行 debiasing 和渐近推断的基础。
    • (A5) 稀疏性:s_0 \log p / \sqrt{n} \to 0。这是高维 Lasso 理论的标准条件,要求真实模型足够稀疏,以保证 Lasso 估计量的收敛速度。
    • (A6) 精度矩阵估计一致性:Nodewise Lasso 估计的 \hat{\Theta} 在无穷范数下是 \Theta_0 的一致估计。这是 debiasing 步骤成功的关键。
    • (A7) 影响函数矩条件:影响函数 \phi_{ij} 的四阶矩有限。用于 bootstrap 的条件中心极限定理。
    • (A8) Wild Bootstrap 乘子条件:乘子 \xi_i 独立同分布,均值为 0,方差为 1,四阶矩有限。标准条件。
    • (A9) Efron Bootstrap 权重条件:权重来自多项分布。标准条件。
  • 相比已有文献的强化/放宽:本文的假设与 Yu et al. (2021) 和 Kong et al. (2021) 等 debiased Cox 文献的假设基本一致。关键创新在于,本文的证明不依赖于特定的调参规则(如 \lambda_{\min} 或 \lambda_{1se}),而是依赖于 Lasso 估计量最终满足的稀疏性和余项控制性质(Remark 1)。这比要求调参规则满足特定理论速率更宽松,也更贴近实践。

主要结果

  • 定理 1 (渐近线性性):\sqrt{n}(\tilde{\beta}_j - \beta_j^0) = n^{-1/2} \sum_i \phi_{ij} + o_p(1),其中 \phi_{ij} = e_j^\top \Theta_0 \psi_i(\beta_0)。这是整个推断的基础,将 debiased 估计量转化为一个样本均值的线性变换。
  • 定理 2 (Wild Bootstrap 一致性):\sup_t |P^*(\sqrt{n}(\tilde{\beta}_{WB,j}^* - \tilde{\beta}_j) \le t) - P(\sqrt{n}(\tilde{\beta}_j - \beta_j^0) \le t)| \xrightarrow{p} 0。即 wild bootstrap 分布能一致逼近真实抽样分布。
  • 定理 3 (Wild Bootstrap 方差一致性):\hat{\sigma}_{j,WB}^2 \xrightarrow{p} \sigma_j^2 / n。即 bootstrap 方差是渐近方差的一致估计。
  • 定理 4 (标准化 Wild Bootstrap 统计量的有效性):\sup_t |P^*(T_j^{WB} \le t) - P(T_j \le t)| \xrightarrow{p} 0,其中 T_j^{WB} = (\tilde{\beta}_{WB,j}^* - \tilde{\beta}_j) / \hat{\sigma}_{j,WB}。这保证了 basic bootstrap 区间的渐近覆盖。
  • Efron Bootstrap 的对应结果:定理 S5-S7 给出了 Efron bootstrap 的类似一致性结果,证明依赖于 Pauly (2011) 的交换性加权重抽样理论。

证明路线与技术技巧(理论型)

  • 整体路线:
    1. 线性化:利用泰勒展开和 Lasso 的收敛速度,证明 debiased 估计量 \tilde{\beta} 与一个线性统计量 n^{-1/2} \sum_i \phi_{ij} 渐近等价(定理 1)。
    2. Bootstrap 线性化:类似地,证明 bootstrap 统计量 \tilde{\beta}_j^* 与一个加权线性统计量 n^{-1/2} \sum_i \xi_i \phi_{ij} (wild) 或 n^{-1/2} \sum_i \omega_i \phi_{ij} (Efron) 渐近等价,且余项在条件概率下可忽略(o_p^*(1))。
    3. 条件中心极限定理:
      • Wild:对 n^{-1/2} \sum_i \xi_i \phi_{ij} 应用条件于数据的 multiplier CLT(如 van der Vaart & Wellner 1996),证明其条件分布弱收敛于 N(0, \sigma_j^2)。
      • Efron:对 n^{-1/2} \sum_i \omega_i \phi_{ij} 应用 Pauly (2011) 关于交换性加权重抽样的定理 4.1,证明其条件分布弱收敛于 N(0, \sigma_j^2)。
    4. Slutsky 论证:结合步骤 1-3,利用条件 Slutsky 引理(Lemma S1),证明 bootstrap 统计量的条件分布与原始统计量的无条件分布之间的 Kolmogorov 距离收敛到 0。
  • 关键跳跃点:
    • 处理 bootstrap 余项:证明 \hat{\Theta} \dot{\ell}_n(\hat{\beta}) 与 \Theta_0 \dot{\ell}_n(\beta_0) 之差在 bootstrap 下是 o_p^*(1)。这需要利用 Lasso 和 nodewise Lasso 的收敛速度,以及 \hat{\beta} 和 \hat{\Theta} 在 bootstrap 中固定这一事实。难点在于,\psi_i(\hat{\beta}) 与 \psi_i(\beta_0) 的差异需要被控制。作者通过假设 (A1)-(A7) 和 Lasso 的稀疏性来保证这一点。
    • Efron Bootstrap 的条件 CLT:与 wild bootstrap 的独立乘子不同,Efron 的权重 \omega_i 是相依的(和为 0)。直接应用标准 CLT 不成立。作者巧妙地将其与 Pauly (2011) 的框架联系起来,该框架专门处理交换性、中心化的权重,并证明了其条件分布的正态性。
  • 技术技巧点名:
    • 条件 Slutsky 引理 (Lemma S1):用于将 bootstrap 余项 o_p^*(1) 与主项分离,是证明 bootstrap 一致性的标准技巧。
    • Multiplier CLT:用于 wild bootstrap 的条件分布逼近。
    • Pauly (2011) 的交换性加权重抽样定理:用于 Efron bootstrap 的条件分布逼近。这是本文证明 Efron bootstrap 有效性的核心理论工具。
    • Nodewise Lasso:用于估计逆信息矩阵 \Theta_0,是 debiasing 步骤的标准技术。
    • ADEMP 框架:用于设计模拟实验,确保模拟的系统性和可重复性。

真实例子与应用

  • 数据:SUPPORT2 数据集(Study to Understand Prognoses and Preferences for Outcomes and Risks of Treatments),一个多中心队列研究,包含 9,105 名重病住院患者和 44 个基线协变量。
  • 应用方法:使用 Cox Lasso 进行变量选择(选出 20 个协变量),然后对选出的系数计算 debiased Wald 区间、wild bootstrap basic 区间和 Efron bootstrap basic 区间。
  • 结果:图 4 展示了三个方法对 20 个选出的协变量的风险比估计和 90% 置信区间。对于强信号(如 avtisst, age, scoma),三种区间非常相似。对于中等强度的信号,bootstrap 区间(尤其是 Efron)比 Wald 区间更宽或更不对称,反映了有限样本下 bootstrap 分布与一阶正态近似的差异。
  • 这个例子想说明什么:这个例子旨在展示所提方法在实际大规模数据中的应用,并说明推断方法的选择会影响中等强度效应的不确定性量化。它不是一个验证理论或展示压倒性优势的模拟,而是一个实用性演示。作者明确指出,该数据集的样本量远大于模拟中的样本量,因此它“补充而非镜像”了模拟研究。

🔎 结论是否比证明窄

  • 窄的结论:定理 2-4 的证明明确依赖于坐标 ℓ1 惩罚(Cox Lasso)和 nodewise ℓ1 回归。作者在 Remark S1 中明确声明,证明不自动扩展到 elastic net, group Lasso, fused Lasso, SCAD, MCP 等其他惩罚。这是一个重要的窄化。论文的结论严格限于 Cox Lasso。
  • 泛化的 claim:作者在讨论部分提到“同样的 score-based bootstrap 构造可以与常见的调参选择或密切相关的加权/自适应 ℓ1 变体结合”,但这只是一个推测,并未在理论中证明。作者谨慎地指出,这要求这些变体满足证明所需的稀疏性和余项条件。
  • 关于调参规则:理论证明(Remark 1)声称不依赖于特定调参规则,而是依赖于 Lasso 估计量的性质。然而,模拟结果(表 S6, S7)显示,不同的调参规则(\lambda_{\min}, \lambda_{1se}, AIC, BIC)确实会影响 bootstrap 区间的覆盖和宽度。这表明,虽然理论是“调参规则无关”的,但有限样本表现对调参规则是敏感的。这是一个值得注意的张力。

四、开放问题

  1. 数据驱动调参的显式理论:本文的理论(Remark 1)依赖于 Lasso 估计量满足特定的稀疏性和余项条件,但并未给出一个保证这些条件成立的、关于数据驱动调参规则(如交叉验证)的显式理论。扎根于:Remark 1 和 Section 7 的讨论“develop a more explicit theory for data-driven tuning rules in debiased Cox inference”。
  2. Bootstrap-t 区间:本文只研究了 basic bootstrap 区间,并指出 bootstrap-t 区间(使用复制内标准差)可能提供进一步的有限样本改进,但代价是计算成本更高。扎根于:Section 7 的讨论“investigate the classical bootstrap-t construction with replicate-specific standard-error estimates”。
  3. 同时置信带:本文只处理了分量推断。将 bootstrap 方法扩展到时间索引的生存量(如累积基线风险)的同时置信带,需要函数型弱收敛论证。扎根于:Section 7 的讨论“move beyond the present componentwise theory toward simultaneous confidence bands for time-indexed survival quantities”。
  4. 更广泛的惩罚类:本文的证明严格限于 Cox Lasso。将类似方法推广到 elastic net, group Lasso, SCAD 等惩罚,需要处理不同的 KKT 结构和偏倚项。扎根于:Remark S1 和 Section 7 的讨论“investigate whether the finite-sample advantages of bootstrap refinement persist for broader penalty classes”。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论