跳转至

Wild Bootstrap and Efron's Bootstrap for Debiased Cox Regression

作者: Lena Schemet, Sarah Friedrich-Welz
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.24230


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是:在高维Cox比例风险模型中,对经过Lasso变量选择后的回归系数进行统计推断。根本的统计问题是:当协变量维数p与样本量n可比甚至更大时,如何对单个回归系数构造具有正确覆盖率的置信区间。核心困难在于,Lasso估计的收缩偏差和选择后的非正则渐近分布使得经典的Wald型推断失效。当前成熟度:debiased/desparsified Lasso框架已为线性模型和广义线性模型提供了渐近有效的推断,但将其扩展到Cox模型后,有限样本下的覆盖精度仍不理想,尤其是存在删失和强协变量相关时。

发展脉络

  1. 奠基工作:Lasso与Cox模型

    • Tibshirani (1996, 1997):提出Lasso和Cox Lasso,将ℓ1惩罚引入Cox比例风险模型,实现了变量选择和系数估计的同步。这是后续所有工作的起点。
    • Fan & Li (2002):系统研究了Cox模型中的变量选择问题,为惩罚似然方法在生存分析中的应用奠定了理论基础。
  2. 主要进展:高维Cox模型的理论与推断

    • Huang, Sun & Zhang (2013):建立了Cox Lasso估计量的理论性质(如估计误差界),为后续推断工作提供了稀疏性保证。
    • van de Geer, Bühlmann, Ritov & Dezeure (2014):提出了高维广义线性模型中debiased Lasso的一般框架,证明了其渐近正态性和半参数有效性。这是本文引用的“general blueprint”([15])。
    • Zhang & Zhang (2014):针对线性模型提出了类似的debiased估计量,并建立了置信区间。
    • Yu, Bradic & Samworth (2021):将debiased Lasso框架扩展到Cox模型,处理了时间依赖协变量和删失风险集带来的挑战,建立了渐近有效的置信区间。本文引用为“Cox-specific statements”([11])。
    • Kong, Yu, Zhang & Cheng (2021):进一步考虑了模型误设下的Cox回归,提出了基于desparsified Lasso的稳健推断方法。本文引用为“Cox-specific developments”([17])。
    • Xia, Nan & Li (2023):针对协变量维数发散(而非超高维)的Cox模型,提出了一种不依赖稀疏逆信息矩阵假设的修正debiased Lasso方法。本文引用为“Cox desparsification results can be invoked as black boxes”([10])。
  3. 当前Frontier:后选择推断与bootstrap校准

    • Leeb & Pötscher (2005, 2006):从理论上证明了,对于后模型选择估计量的无条件分布,无法进行一致估计。这构成了“后选择推断不可能性”的经典结论,是本文试图绕过的障碍。
    • Berk, Brown, Buja, Zhang & Zhao (2013):提出了“同时推断”框架,通过对所有可能子模型进行保护来获得有效的后选择推断,但该方法通常保守。
    • Lee, Sun, Sun & Taylor (2016):提出了Lasso的精确后选择推断方法,通过条件在选模型上来获得有效推断。本文明确将其定位为“rather than proposing an exact selective inference procedure”,即本文的目标不是这个。
    • Pauly (2011):建立了鞅差阵列的加权重抽样理论,为本文Efron bootstrap的渐近论证提供了核心工具(Theorem 4.1)。
    • Chernozhukov, Chetverikov & Kato (2013):建立了高维随机向量最大值的高斯近似和乘子bootstrap理论,为本文wild bootstrap的渐近论证提供了背景。
  4. 本文的位置:本文位于“debiased Lasso推断”和“bootstrap校准”的交汇处。它承认debiased Lasso提供了渐近有效的Wald区间,但指出其有限样本覆盖可能不准确。本文的贡献在于,将bootstrap(wild和Efron)应用于debiased Cox估计量,而不是原始的Lasso估计量,从而绕过了经典bootstrap在非光滑估计量上的失败,并试图通过bootstrap校准来改善有限样本性能。

子线索聚类

  1. Debiased/Desparsified Lasso推断:这是本文的直接技术基础。核心思想是通过对Lasso估计量进行一步修正(加上一个得分项),得到一个渐近无偏且正态的估计量。代表工作:van de Geer et al. (2014), Zhang & Zhang (2014), Yu et al. (2021), Kong et al. (2021), Xia et al. (2023)。这一簇的工作为高维推断提供了“一阶”解决方案,但有限样本表现依赖于渐近近似的质量。

  2. 后选择推断(Post-Selection Inference):这是一个更广泛的领域,旨在解决选择后推断的分布扭曲问题。代表工作:Leeb & Pötscher (2005, 2006)(不可能性结果),Berk et al. (2013)(同时推断),Lee et al. (2016)(精确条件推断)。本文明确将自己与“精确后选择推断”路线区分开,选择了一条更实用的“bootstrap校准”路线。

  3. 生存分析中的Bootstrap方法:这一簇工作为本文的bootstrap方案提供了方法论基础。代表工作:Lin, Wei & Ying (1993)(基于鞅残差的乘子重抽样),Spiekerman & Lin (1998)(删失数据的重抽样方法),Pauly (2011)(加权重抽样的鞅理论),Dobler & Pauly (2014)(竞争风险中的bootstrap),Bluhmki et al. (2019)(多状态Nelson-Aalen估计量的wild bootstrap),Dietrich, Dobler & de Gunst (2025)(计数过程统计量的wild bootstrap统一框架)。本文的wild bootstrap直接利用了Cox得分的鞅表示,而Efron bootstrap则基于Pauly (2011)的交换加权理论。

核心问题与已知瓶颈

  1. 核心问题:

    • 如何在高维Cox模型中对选中的回归系数进行有效推断?
    • Debiased Lasso的Wald区间在有限样本下是否足够准确?
    • Bootstrap能否改善debiased Lasso推断的有限样本表现?如果可以,哪种bootstrap方案(wild vs. Efron)更优?
    • Bootstrap推断的理论保证是什么?
  2. 已知瓶颈:

    • Lasso的收缩偏差:直接对Lasso估计量使用Wald区间会因偏差导致严重覆盖不足。
    • 选择后的分布扭曲:变量选择过程改变了估计量的采样分布,使得经典推断失效(Leeb & Pötscher)。
    • Cox模型的复杂性:删失、半参数结构、鞅表示使得理论分析比线性模型更复杂。
    • 有限样本精度:即使debiased Lasso是渐近正态的,其Wald区间在中等样本量下仍可能因高阶项或方差估计不准确而表现不佳。

⚠️ 作者的Framing

  • 作者如何frame缺口:作者将缺口定位为“debiased Cox Wald区间在有限样本下可能不准确,而bootstrap是改善其表现的潜在工具”。他们强调,经典bootstrap在Lasso上失败,但debiased估计量是光滑的,因此bootstrap可以适用。这使得他们的工作成为“显然的下一步”:既然debiased Lasso提供了渐近正态性,那么用bootstrap来校准其有限样本分布是自然的延伸。
  • 被淡化或回避的竞争路线:
    • 精确后选择推断(Lee et al., 2016; Taylor & Tibshirani, 2017):作者明确说“Rather than proposing an exact selective inference procedure”,表明他们选择了一条更实用但理论保证更弱的路线。他们回避了精确条件推断的复杂性和计算成本。
    • 同时推断(Berk et al., 2013):作者没有讨论这种保守但理论上更稳健的方法。
  • 什么明显该被引/该存在、却没出现在intro里?:
    • 更近期的debiased Lasso在Cox模型上的工作:除了Yu et al. (2021)和Kong et al. (2021),是否有2022-2025年的新进展?例如,是否有工作专门研究了Cox模型中debiased Lasso的方差估计问题?
    • 关于bootstrap在debiased估计量上应用的理论工作:是否有文献(即使在线性模型或GLM中)已经证明了bootstrap对debiased Lasso的有效性?如果有,本文的理论贡献(Theorem 2-4)的原创性需要被仔细审视。作者引用了van der Vaart & Wellner (1996)和Kosorok (2008)作为乘子bootstrap的一般理论,但没有引用任何将bootstrap应用于debiased Lasso的特定论文。这可能是一个值得研究者去查的gap。
    • 关于Cox模型bootstrap的负面结果:Hjort (1985)被引用,但作者没有深入讨论Cox模型bootstrap可能失败的具体条件或原因。

张力

  • 未见明显对立引用。被引工作之间没有直接矛盾,而是沿着不同的技术路线(debiased vs. exact selective inference)发展。本文的立场是调和性的:它接受debiased Lasso的渐近框架,并试图用bootstrap来改善其有限样本表现。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号:

    • T_i: 个体i的真实事件时间(潜在变量)。
    • C_i: 个体i的删失时间(潜在变量)。
    • \tilde{T}_i = min(T_i, C_i): 观测到的随访时间。
    • \delta_i = 1\{T_i \le C_i\}: 事件指示符(1=观察到事件,0=删失)。
    • X_i \in \mathbb{R}^p: p维协变量向量。
    • O_i = (\tilde{T}_i, \delta_i, X_i): 可观测数据,i.i.d.。
    • N_i(t) = 1\{\tilde{T}_i \le t, \delta_i = 1\}: 计数过程,记录个体i在时间t前是否发生事件。
    • Y_i(t) = 1\{\tilde{T}_i \ge t\}: 风险指示,个体i在时间t是否仍在风险集中。
    • \beta \in \mathbb{R}^p: 回归系数向量(参数)。
    • \beta_0: 真实的回归系数向量。
    • \lambda_0(t): 未知的基线风险函数。
    • \ell(\beta): Cox部分对数似然函数。
    • U(\beta) = \nabla \ell(\beta): 得分函数。
    • \psi_i(\beta): 个体i的得分贡献。
    • \hat{\beta}: Cox Lasso估计量。
    • \tilde{\beta}: Debiased Cox估计量。
    • \Theta_0 = \Sigma_0^{-1}: 逆信息矩阵(渐近方差的核心)。
    • \hat{\Theta}: 通过nodewise Lasso估计的逆信息矩阵。
    • \xi_i^{(b)}: Wild bootstrap的乘子变量(独立,均值为0,方差为1)。
    • W_i^{(b)}: Efron bootstrap的多项式权重(和为n)。
    • \omega_i^{(b)} = W_i^{(b)} - 1: 中心化的Efron bootstrap权重。
  • 模型:

    • Cox比例风险模型:\lambda(t|X_i) = \lambda_0(t) \exp(X_i^\top \beta)。这是一个半参数模型,基线风险\lambda_0(t)是无穷维 nuisance 参数,\beta是有限维目标参数。
    • 非信息删失:给定X_i,C_i与T_i独立,且不依赖于\beta。
    • 数据生成机制:事件时间T_i由Cox模型生成,删失时间C_i由某个独立分布生成。
  • 可观测数据:

    • 研究者实际能观测到的是O_i = (\tilde{T}_i, \delta_i, X_i)。
    • 想要但观测不到的量:
      • 真实事件时间T_i(如果\delta_i=0,则被删失)。
      • 基线风险函数\lambda_0(t)。
      • 真实的回归系数\beta_0。
      • 逆信息矩阵\Theta_0。

第二步:讲最小内核

本文的核心思路可以浓缩为以下最小内核:

核心命题:对于一个“光滑”的估计量(如debiased Lasso),其采样分布可以通过对它的一阶渐近线性表示进行bootstrap来近似,而不是对原始的“非光滑”估计量(如Lasso)进行bootstrap。

最简特例:考虑一个单参数(p=1) 的Cox模型,没有变量选择问题。此时,Cox Lasso退化为标准的Cox部分似然估计\hat{\beta}。Debiased估计量\tilde{\beta}退化为\hat{\beta}本身(因为\hat{\Theta} = 1/\hat{\Sigma},且\dot{\ell}_n(\hat{\beta}) \approx 0)。但为了展示核心思想,我们考虑一个更一般的“光滑”M-估计量\hat{\theta},它满足渐近线性表示: \sqrt{n}(\hat{\theta} - \theta_0) = \frac{1}{\sqrt{n}} \sum_{i=1}^n \phi_i + o_p(1) 其中\phi_i是影响函数(i.i.d.,均值为0,方差为\sigma^2)。

Wild Bootstrap:生成bootstrap复制\hat{\theta}^*: \sqrt{n}(\hat{\theta}^* - \hat{\theta}) = \frac{1}{\sqrt{n}} \sum_{i=1}^n \xi_i \hat{\phi}_i 其中\xi_i是独立乘子(如N(0,1)),\hat{\phi}_i是\phi_i的估计(如基于\hat{\theta}的残差)。条件于数据,\frac{1}{\sqrt{n}} \sum_{i=1}^n \xi_i \hat{\phi}_i的分布近似于N(0, \hat{\sigma}^2),其中\hat{\sigma}^2 = \frac{1}{n} \sum \hat{\phi}_i^2。因此,bootstrap分布近似于\hat{\theta}的采样分布N(\theta_0, \sigma^2/n)。

本文的推广:本文将这个思想应用于debiased Cox Lasso估计量\tilde{\beta}。关键点在于: 1. \tilde{\beta}是“光滑”的,因为它有一个渐近线性表示(Theorem 1): \sqrt{n}(\tilde{\beta}_j - \beta_{0j}) = \frac{1}{\sqrt{n}} \sum_{i=1}^n \phi_{ij} + o_p(1) 其中\phi_{ij} = e_j^\top \Theta_0 \psi_i(\beta_0)。 2. 因此,bootstrap可以直接作用于这个线性表示的主导项\frac{1}{\sqrt{n}} \sum_{i=1}^n \phi_{ij},而不是作用于非光滑的\hat{\beta}。 3. 具体操作是:固定\hat{\beta}和\hat{\Theta},然后对得分贡献\psi_i(\hat{\beta})施加bootstrap权重(\xi_i或\omega_i),生成bootstrap复制\tilde{\beta}^*。这等价于对\phi_{ij}的估计进行bootstrap。

一句话总结:本文的核心数学操作是将bootstrap从“重抽样数据”或“重抽样估计量”简化为“重抽样得分贡献”,因为debiased估计量的分布完全由这些得分贡献的一阶行为决定。

三、这篇论文做了什么

三句话

  1. 研究问题:在高维Cox比例风险模型中,经过Cox Lasso变量选择后,如何对debiased估计量进行bootstrap推断,以改善有限样本下Wald区间的覆盖精度。
  2. 核心工具/方法:提出了两种基于得分的bootstrap方案——wild bootstrap(独立乘子)和Efron bootstrap(中心化多项重抽样权重),两者均固定原始Cox Lasso拟合和debiasing矩阵,仅对得分贡献施加bootstrap权重。
  3. 主要结论:从理论上证明了两种bootstrap方案的渐近有效性(分布一致性、方差一致性、标准化统计量有效性)。模拟研究表明,在小样本和中样本设置下,bootstrap区间(尤其是basic区间)比一阶debiased Wald区间具有更好的覆盖精度,但Efron bootstrap更保守且计算成本更高。

关键设定与假设

  • 完整设定:在第二节最小记号的基础上,本文考虑了高维设定,其中p可以与n相当甚至更大,但假设真实模型是稀疏的(s_0 = \|\beta_0\|_0较小)。
  • 关键假设(来自Supplementary Material S1.2):

    • (A1) 独立删失:C_i \perp T_i | X_i。这是Cox模型的标准假设。
    • (A2) 有界协变量与有限时间:\|X_i\|_\infty \le K a.s.,且\tau < \infty。技术性假设,简化了经验过程论证。
    • (A3) 非退化风险集:基线风险有界,且风险集在时间区间内非退化。确保信息矩阵非奇异。
    • (A4) 信息矩阵可逆且有界:\Sigma_0的特征值在[c_{min}, c_{max}]之间。标准假设。
    • (A5) 稀疏性:s_0 \log p / \sqrt{n} \to 0。这是高维稀疏推断的典型条件,比线性模型中的(s_0 \log p)/n \to 0更强,反映了Cox模型(部分似然)的复杂性。
    • (A6) Nodewise Lasso一致性:\|\hat{\Theta} - \Theta_0\|_\infty = o_p(1)。确保debiasing矩阵的估计是相合的。
    • (A7) 影响函数四阶矩有限:E(\phi_{1j}^4) < \infty。用于bootstrap的Lindeberg条件。
    • (A8) Wild Bootstrap乘子:\xi_i i.i.d.,均值为0,方差为1,四阶矩有限。
    • (A9) Efron Bootstrap权重:(W_1, ..., W_n) \sim Mult(n; 1/n, ..., 1/n),独立于数据。
  • 相比已有文献的强化/放宽:

    • 相比Yu et al. (2021)和Kong et al. (2021),本文的假设(A5)s_0 \log p / \sqrt{n} \to 0是标准的,没有明显强化或放宽。主要区别在于本文额外需要bootstrap权重的矩条件(A8, A9)。
    • 相比线性模型中的debiased Lasso,Cox模型需要处理计数过程和鞅,因此假设(A3)和(A4)是Cox特有的。

主要结果

  • Theorem 1 (Asymptotic Linearity):建立了debiased Cox估计量的渐近线性表示。这是所有后续理论的基础。它表明\sqrt{n}(\tilde{\beta}_j - \beta_{0j})渐近等价于一个i.i.d.影响函数之和,因此是渐近正态的。
  • Theorem 2 (Wild Bootstrap Consistency):证明了wild bootstrap的条件分布一致地逼近\sqrt{n}(\tilde{\beta}_j - \beta_{0j})的采样分布。这是核心理论贡献,表明wild bootstrap是有效的。
  • Theorem 3 (Wild Bootstrap Variance Consistency):证明了wild bootstrap的方差估计\hat{\sigma}^2_{j,WB}是\sigma^2_j / n的一致估计。
  • Theorem 4 (Validity of Standardized Wild Bootstrap Statistic):结合Theorem 2和3,证明了标准化后的bootstrap统计量T^{WB}_j的条件分布一致逼近T_j的分布。这直接保证了basic bootstrap区间的渐近覆盖正确性。
  • Efron Bootstrap的对应结果:在Supplementary Material S2中,作者使用Pauly (2011)的加权重抽样定理,证明了Efron bootstrap的分布一致性(Theorem S5)、方差一致性(Theorem S6)和标准化统计量有效性(Theorem S7)。

证明路线与技术技巧

  • 整体路线:

    1. 线性化:利用debiased Lasso的标准论证,将\sqrt{n}(\tilde{\beta}_j - \beta_{0j})和\sqrt{n}(\tilde{\beta}^*_j - \tilde{\beta}_j)都表示为“主导项(影响函数之和)+ 可忽略余项”。
    2. 条件Slutsky:使用Lemma S1(条件Slutsky引理),证明如果bootstrap的主导项条件分布收敛到正确极限,且余项条件概率收敛到0,那么bootstrap统计量的条件分布也收敛到正确极限。
    3. 主导项的条件CLT:
      • Wild Bootstrap:对主导项\frac{1}{\sqrt{n}} \sum \xi_i \phi_{ij}应用条件乘子中心极限定理。条件于数据,\phi_{ij}是固定的,\xi_i是独立随机变量。在Lindeberg条件下,该和的条件分布收敛到N(0, \sigma^2_j)。
      • Efron Bootstrap:对主导项\frac{1}{\sqrt{n}} \sum \omega_i \phi_{ij}应用Pauly (2011)的Theorem 4.1。该定理处理了交换权重(如中心化多项权重)下鞅差阵列的加权和的条件分布收敛问题。
    4. 方差一致性:证明bootstrap方差\hat{\sigma}^2_{j,*}是\sigma^2_j/n的一致估计。对于wild bootstrap,这是\frac{1}{n} \sum \phi_{ij}^2的相合性;对于Efron bootstrap,需要额外处理权重间的协方差。
    5. 标准化统计量:结合分布一致性和方差一致性,通过条件Slutsky论证,证明标准化bootstrap统计量的有效性。
  • 关键跳跃点:

    • 将Cox Lasso的余项控制与bootstrap的余项控制分离:证明路线巧妙地将Cox模型特有的复杂性(如鞅表示、风险集和)封装在Theorem S1(渐近线性性)的证明中。一旦这个定理成立,bootstrap论证就变成了一个更“通用”的关于影响函数之和的条件CLT问题。这使得证明结构清晰,但依赖于Cox Lasso的现有理论结果。
    • Efron Bootstrap的论证:对于Efron bootstrap,关键跳跃在于将\frac{1}{\sqrt{n}} \sum \omega_i \phi_{ij}识别为Pauly (2011)定理中的统计量。作者需要验证\phi_{ij}/\sqrt{n}满足该定理的条件(最大绝对值趋于0,平方和收敛)。这依赖于\phi_{ij}的四阶矩有限假设(A7)。
  • 技术技巧点名:

    • Martingale representation:Cox得分的鞅表示(U(\beta_0) = \sum \int \phi_i(t, \beta_0) dM_i(t))是wild bootstrap的动机来源,但在证明中并未直接使用,而是通过渐近线性表示来间接利用。
    • Conditional Slutsky lemma (Lemma S1):一个简洁而强大的工具,用于将bootstrap余项的可忽略性转化为分布收敛的结论。
    • Pauly's Theorem 4.1 (2011):处理交换权重下鞅差阵列的条件CLT,是Efron bootstrap理论的核心。
    • Nodewise Lasso:用于估计高维逆信息矩阵\Theta_0,是debiased Lasso框架的标准技术。

真实例子与应用

  • 数据:SUPPORT2数据集(Study to Understand Prognoses and Preferences for Outcomes and Risks of Treatments),一个大型多中心队列研究,包含n=9,105名重病住院患者,p=44个基线协变量。
  • 如何应用:
    1. 使用Cox Lasso从44个协变量中选出20个。
    2. 对这20个选中的变量,计算debiased Cox估计量(得到共同的风险比估计)。
    3. 分别计算debiased Wald区间、wild bootstrap basic区间和Efron bootstrap basic区间。
  • 结果:图4展示了20个选中变量的风险比估计和三种90%置信区间。对于强信号(如avtisst, age, scoma),三种区间非常相似。对于中等强度的信号,bootstrap区间(尤其是Efron)比Wald区间更宽或更不对称,反映了bootstrap对有限样本分布(如偏态)的校准。
  • 这个例子想说明什么:作者想说明,即使在样本量很大(n=9,105)的真实数据中,bootstrap校准仍然可能对中等效应的推断产生影响,而不仅仅是小样本问题。同时,它也展示了方法的实际可用性。

🔎 结论是否比证明窄

  • 是。论文的结论(Theorem 2-4)是在假设(A1)-(A9)下严格证明的,但这些假设本身是相当强的。
    • 窄点1:调参规则。Remark 1明确指出,理论适用于满足稀疏性和余项条件的Cox Lasso估计量,但不自动覆盖任何特定的数据驱动调参规则(如\lambda_{min}, \lambda_{1se}, AIC, BIC)。模拟中比较了这些规则,但理论保证只适用于“如果”这些规则产生的估计量满足条件。这是一个重要的gap。
    • 窄点2:Componentwise推断。理论只处理了单个系数\beta_j的推断。作者在Discussion中承认,扩展到同时置信带需要函数弱收敛论证,这是未来工作。
    • 窄点3:惩罚类型。Remark S1明确指出,证明不自动扩展到elastic net, group Lasso, SCAD, MCP等其他惩罚。这些惩罚改变了KKT条件或偏差结构。
    • 窄点4:Bootstrap区间类型。理论只严格证明了basic bootstrap区间的渐近有效性。作者在模拟中主要报告了basic区间,但也在Section 3.3中定义了percentile和normal区间,并说它们“are not part of the primary numerical comparison”。这意味着这些区间的理论性质可能未被证明或表现不佳。

四、开放问题

  1. 数据驱动调参的理论:本文的理论(Remark 1)不覆盖任何特定的数据驱动调参规则(如\lambda_{min}, AIC)。扎根于:Remark 1: “the present theory covers these choices only insofar as the resulting random tuning parameter satisfies the regularity conditions...”。一个开放问题是:能否为Cox Lasso的特定调参规则(如交叉验证的\lambda_{min})建立理论,证明其产生的估计量满足debiasing所需的稀疏性和余项条件?这需要更精细的调参过程分析。

  2. Bootstrap-t区间:本文只严格证明了basic bootstrap区间。扎根于:Discussion: “Another is to investigate the classical bootstrap-t construction with replicate-specific standard-error estimates...”。一个开放问题是:对于debiased Cox估计量,bootstrap-t区间(在每个bootstrap复制内重新估计标准误)是否能提供比basic区间更好的有限样本表现?这需要处理在每个bootstrap复制内重新估计\hat{\Theta}的计算和理论挑战。

  3. 同时置信带:本文只处理了componentwise推断。扎根于:Discussion: “A further extension is to move beyond the present componentwise theory toward simultaneous confidence bands for time-indexed survival quantities...”。一个开放问题是:能否将本文的bootstrap论证扩展到函数空间D[0, \tau],为累积基线风险或时变系数过程构造同时置信带?这需要建立debiased Cox估计量的函数弱收敛理论及其bootstrap版本。

  4. 扩展到其他惩罚:本文的理论只覆盖了Lasso。扎根于:Remark S1: “the proof does not automatically extend to penalties such as the elastic net, group Lasso, fused Lasso, SCAD, or MCP”。一个开放问题是:对于其他惩罚(如adaptive Lasso, SCAD),本文的bootstrap方案是否仍然有效?这需要分析这些惩罚下debiased估计量的渐近线性表示是否仍然成立,以及余项是否仍可控制。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论