Model-based bootstrap inference for Cox models after Lasso selection¶
作者: Lena Schemet, Andreas Groll, Sarah Friedrich-Welz
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.18893
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是高维变量选择后的频率推断,核心问题是在使用 Lasso 等正则化方法进行变量选择后,如何对选出的系数构造有效的置信区间或假设检验。标准 Wald 型区间在选后条件覆盖上表现差,因为选择步骤改变了估计量的抽样分布,且 Lasso 本身有收缩偏倚。该方向当前成熟度较高,已有多种竞争框架(条件选后推断、去偏/去稀疏化、样本分裂、bootstrap),但每种框架都有其特定的假设、目标参数定义和有限样本局限性。
发展脉络¶
奠基工作:Berk et al. (2013) 提出 PoSI(Post-Selection Inference),通过为所有可能的子模型购买“同时性保险”来保证选后推断的普遍有效性,但代价是极端保守。Lee et al. (2016) 和 Taylor & Tibshirani (2015, 2018) 发展了精确条件选后推断,通过刻画给定选择事件后估计量的条件分布来构造有效推断,但该方法依赖于选择事件的精确几何描述(如 Lasso 的 polyhedral 选择区域),且计算复杂。
主要进展:van de Geer et al. (2014) 和 Zhang & Zhang (2014) 提出了去偏/去稀疏化 Lasso,通过向 Lasso 估计量添加一个基于 Karush-Kuhn-Tucker 条件的偏校正项,使得校正后的估计量渐近正态,从而可以对固定坐标(而非选后坐标)进行推断。该方法在高维线性模型和广义线性模型中建立了半参数效率最优性。Xia, Nan & Li (2023) 将去偏方法扩展到 Cox 模型,但需要处理 Cox 模型中 Fisher 信息矩阵的逆不稀疏的问题,他们通过求解一系列二次规划来近似逆信息矩阵。
当前 frontier:bootstrap 方法在选后推断中的应用。Chatterjee & Lahiri (2011) 研究了 Lasso 估计量的 bootstrap,但 Lasso 目标函数非光滑且选择数据依赖,使得标准 bootstrap 失效。本文的工作属于这一支线,但采用了一种模型基(model-based) 的 bootstrap 策略,而非重抽样原始数据。
本文的位置:本文定位在“Cox 模型 + Lasso 选择 + bootstrap 推断”这一交叉点。它不追求条件选后推断的精确性(如 Lee et al.),也不追求去偏方法对固定坐标的推断(如 van de Geer et al.),而是提出一个实用导向的 bootstrap 程序:先用 Cox-Lasso 选变量,再对选定变量拟合无惩罚 Cox 模型,然后从半参数 plug-in 模型生成 bootstrap 样本。其理论贡献在于证明了该 bootstrap 的一阶有效性,但依赖于 oracle 型稀疏假设(即真实模型被一致恢复)。
子线索聚类¶
-
条件选后推断(Lee et al., 2016; Taylor & Tibshirani, 2018):给定选择事件的条件分布,精确但计算复杂,且对选择规则敏感。本文引用语境指出这些方法“often target parameters defined independently of the selected Cox model reported in practice or rely on strong structural assumptions”。
-
去偏/去稀疏化方法(van de Geer et al., 2014; Zhang & Zhang, 2014; Xia, Nan & Li, 2023):对固定坐标进行推断,不依赖选择事件,但需要估计高维信息矩阵的逆,且在 Cox 模型中需要特殊处理。本文将其作为比较基准。
-
样本分裂(Berk et al., 2013; García Rasines & Young, 2023):将数据分为选择集和推断集,简单但牺牲效率。García Rasines & Young (2023) 提出基于响应随机化的替代方案以提高功效。
-
Bootstrap 方法(本文;Chatterjee & Lahiri, 2011):通过重抽样近似选后估计量的分布。本文的独特之处在于使用模型基 bootstrap(基于半参数 plug-in 模型),而非普通 case resampling,以保留 Cox 模型的风险集依赖和删失机制。
核心问题与已知瓶颈¶
- 核心问题 1:选后推断的目标参数是什么?是选后模型的系数(如本文),还是全模型的固定坐标(如去偏方法)?不同定义导致不同的推断框架和解释。
- 核心问题 2:如何平衡条件覆盖(给定选择事件)与边际覆盖?条件选后推断保证条件覆盖但可能保守,去偏方法保证边际覆盖但可能对选后报告不直接适用。
- 核心问题 3:有限样本下,bootstrap 能否有效近似选后估计量的分布?已知 Leeb & Pötscher (2006) 证明了无条件分布的一致估计是不可能的,但条件分布(给定选择事件)的估计是否可能?本文的 bootstrap 策略是条件于原始样本的选择,而非无条件。
- 已知瓶颈:Lasso 选择的不稳定性(特别是弱信号和强相关协变量下)使得选后推断困难;Cox 模型中的右删失增加了额外变异性;bootstrap 在非光滑目标函数(如 Lasso)上的有效性需要特殊处理。
⚠️ 作者的 framing¶
作者将缺口 frame 为:现有选后推断方法(条件选后、去偏)要么目标参数定义与实践中报告的选后模型不一致,要么依赖强结构假设,而 bootstrap 方法提供了一个概念上简单的替代方案。作者特别强调其程序不重复变量选择(选择步骤只做一次),因此 bootstrap 分布只反映无惩罚 Cox 重拟合的变异性,而非整个选择-估计流程的变异性。这既是简化也是局限。
被淡化或回避的竞争路线: - 条件选后推断(Lee et al., 2016)被提及但被描述为“often target parameters defined independently of the selected Cox model reported in practice”——这个判断是否公平?条件选后推断的目标参数正是选后模型的系数,只是推断是条件于选择事件的。 - 去偏方法(van de Geer et al., 2014)被用作比较基准,但作者指出其“addresses a different inferential problem”(固定坐标 vs. 选后坐标),这回避了两种方法在 oracle 假设下渐近等价的事实(当选择一致时,选后模型系数与真值一致)。
什么明显该被引/该存在、却没出现在 intro 里? - Leeb & Pötscher (2006) 的不可估计性结果(Can one estimate the unconditional distribution of post-model-selection estimators?)被引用,但该结果主要针对无条件分布,而本文的 bootstrap 是条件于原始样本选择的。作者没有讨论这个区别是否规避了 Leeb & Pötscher 的负结果。 - Knight & Fu (2000) 关于 Lasso 渐近分布的工作被引用,但仅用于说明 bootstrap 与非光滑目标函数结合的困难,没有深入讨论 Lasso 估计量的非正态极限分布(当真值非零时)对 bootstrap 有效性的影响。 - Bühlmann & van de Geer (2011) 关于高维统计的教科书被引用,但未讨论其中关于 Lasso 选后推断的章节。
张力¶
未见明显对立引用。各子线索(条件选后、去偏、bootstrap)通常被视为互补而非竞争,各自有不同的假设和适用范围。一个潜在的张力是:Leeb & Pötscher (2006) 的不可估计性结果暗示无条件选后分布的一致估计是不可能的,而本文的 bootstrap 试图近似条件分布(给定原始样本的选择)。作者没有明确讨论这个区别是否足以规避 Leeb & Pötscher 的负结果,这值得研究者去查。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \( X \in \mathbb{R}^p \):p 维协变量向量。 - \( T \):事件时间(随机变量)。 - \( C \):删失时间(随机变量)。 - \( W = T \wedge C \):观测时间。 - \( \delta = \mathbf{1}(T \le C) \):事件指示符。 - \( N_i(t) = \mathbf{1}(W_i \le t, \delta_i = 1) \):个体 i 的计数过程。 - \( Y_i(t) = \mathbf{1}(W_i \ge t) \):个体 i 的风险指示符。 - \( \beta^\circ \in \mathbb{R}^p \):真实回归系数向量(参数,要估的对象)。 - \( \lambda_0(t) \):未知基线风险函数(非参数,要估的对象)。 - \( \Lambda_0(t) = \int_0^t \lambda_0(u) du \):累积基线风险。 - \( \ell(\beta) \):对数偏似然函数。 - \( \gamma_n \):Lasso 惩罚参数(标量)。 - \( \hat{\beta}^L \):Cox-Lasso 估计量。 - \( \hat{M} = \{j: \hat{\beta}^L_j \ne 0\} \):选出的变量集。 - \( \tilde{\beta}_{\hat{M}} \):在选出的变量集上拟合无惩罚 Cox 模型得到的系数(要推断的对象)。 - \( \hat{\Lambda}_0(t; \tilde{\beta}_{\hat{M}}) \):Breslow 基线累积风险估计量。 - \( \hat{F}_C \):删失分布的 Kaplan-Meier 估计量。 - \( n \):样本量。 - \( p = p_n \):协变量维度(可随 n 增长)。 - \( s^\circ = |M^\circ| \):真实活跃集大小。 - \( \tau \):固定研究终点(用于理论论证)。
模型:Cox 比例风险模型:
可观测数据:\( \{(W_i, \delta_i, X_i)\}_{i=1}^n \),其中 \( W_i = T_i \wedge C_i \),\( \delta_i = \mathbf{1}(T_i \le C_i) \)。研究者能观测到的是:每个个体的观测时间(事件或删失中较早者)、事件是否发生的指示符、以及协变量向量。观测不到的是:事件时间 \( T_i \) 和删失时间 \( C_i \) 本身(当它们被对方截断时),以及基线风险函数 \( \lambda_0(t) \)。
第二步:最小内核¶
本文的核心思路可以用一个固定维度(p 固定)且无变量选择的 Cox 模型来理解。在这个特例下,整个 bootstrap 程序退化为 Hjort (1985) 的经典模型基 bootstrap,而本文的理论贡献(定理 3.1)正是建立在这个基础上的。
最简特例:假设 \( p \) 固定,且我们不进行变量选择(即直接拟合全模型)。那么: - 原始数据:\( \{(W_i, \delta_i, X_i)\}_{i=1}^n \)。 - 拟合全模型 Cox 回归,得到 \( \hat{\beta} \) 和 Breslow 估计 \( \hat{\Lambda}_0(t) \)。 - 从拟合的 Cox 模型生成 bootstrap 数据: - 对每个 i,从 \( \text{Unif}(0,1) \) 抽取 \( U_i \)。 - 计算 bootstrap 事件时间:\( T_i^* = \hat{\Lambda}_0^{-1}\left( -\log U_i / \exp(X_i^\top \hat{\beta}) \right) \)。 - 从删失分布估计 \( \hat{F}_C \) 抽取 bootstrap 删失时间 \( C_i^* \)。 - 得到 bootstrap 观测:\( W_i^* = T_i^* \wedge C_i^* \),\( \delta_i^* = \mathbf{1}(T_i^* \le C_i^*) \)。 - 在 bootstrap 样本上重新拟合 Cox 模型,得到 \( \hat{\beta}^* \)。
要证的命题:\( \mathcal{L}(\sqrt{n}(\hat{\beta}^* - \hat{\beta}) | \text{原始数据}) \Rightarrow_P \mathcal{L}(\sqrt{n}(\hat{\beta} - \beta^\circ)) \),即 bootstrap 分布一致逼近真实抽样分布。
证明思路(定理 3.1 的证明路线): 1. Plug-in 正确性:由于 \( \hat{\beta} \) 和 \( \hat{\Lambda}_0 \) 一致估计真值,bootstrap 数据生成机制以概率趋于真实 Cox 模型。 2. 鞅表示:Cox 模型的得分函数可以写成鞅随机积分。 3. 线性展开:对得分方程做 Taylor 展开,得到 \( \sqrt{n}(\hat{\beta} - \beta^\circ) \approx I(\beta^\circ)^{-1} n^{-1/2} U_n(\beta^\circ) \),bootstrap 版本类似。 4. 条件鞅 CLT:bootstrap 得分的可预测二次变差收敛到与原始样本相同的极限,因此条件鞅中心极限定理给出 \( n^{-1/2} U_n^*(\hat{\beta}) \Rightarrow_P N(0, I(\beta^\circ)) \)。
为什么这个特例是内核:本文的完整程序(定理 3.2)只是在这个特例上叠加了一个oracle 归约:当 Lasso 以概率趋于 1 恢复真实活跃集时,在事件 \( \hat{M} = M^\circ \) 上,无惩罚 Cox 重拟合就是真实活跃模型上的普通 Cox 估计,因此固定维度的 bootstrap 有效性直接适用。整个证明的“吃劲”部分就是定理 3.1 的固定维度结果,而定理 3.2 只是通过选择稳定性假设将其“嫁接”到选后场景。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:Cox 比例风险模型经 Lasso 变量选择后,如何对选出的系数构造有效的置信区间。
- 核心工具/方法:提出一种模型基 bootstrap 程序:先用 Cox-Lasso 选变量,再对选定变量拟合无惩罚 Cox 模型,然后从半参数 plug-in Cox 模型(含 Breslow 基线风险估计和 plug-in 删失分布)生成 bootstrap 样本,每次只重拟合无惩罚模型(不重复变量选择)。
- 主要结论:在 oracle 型稀疏假设和标准 Cox 正则性条件下,证明了该 bootstrap 的一阶有效性(条件弱收敛);模拟显示百分位数和学生化 bootstrap 区间在中小样本下条件覆盖优于 bootstrap-Wald 区间,与去偏区间竞争力相当但依赖信号强度和选择稳定性。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - Cox 模型假设:\( \lambda(t|X) = \lambda_0(t) \exp(X^\top \beta^\circ) \),非信息删失,固定研究终点 \( \tau \)。 - 正则性条件 (C1)-(C6):确保计数过程鞅框架、得分函数的渐近线性性、信息矩阵的正定性等。具体包括:\( \int_0^\tau \lambda_0(t) dt < \infty \),协变量有界,信息矩阵 \( I(\beta^\circ) \) 正定,以及一些关于风险集和鞅的 Lindeberg 型条件。 - 删失分布假设:要么 (C7) 协变量独立删失(C ⊥ X),此时用 Kaplan-Meier 估计 \( \hat{F}_C \);要么 (C8) 协变量依赖删失,此时需要一致的条件删失分布估计量。 - 稀疏 Cox-Lasso 假设: - 惩罚水平:\( \gamma_n \asymp \sqrt{(\log p)/n} \)。 - 得分条件:\( \max_j |n^{-1} U_{n,j}(\beta^\circ)| \le \gamma_n/2 \) 以概率趋于 1。 - 兼容性条件(compatibility condition):确保在稀疏锥上有足够信息。 - Beta-min 条件:\( \min_{j \in M^\circ} |\beta^\circ_j| \ge c_{\min} \gamma_n \)。 - 选择稳定性:\( P(\hat{M} = M^\circ) \to 1 \)。
相比已有文献的强化/放宽: - 相比条件选后推断(Lee et al., 2016):本文不要求选择事件的精确几何描述,但需要更强的选择稳定性假设(oracle 选择)。 - 相比去偏方法(van de Geer et al., 2014):本文的目标参数是选后模型系数(而非固定坐标),但需要选择稳定性假设来保证选后模型与真实模型一致。 - 相比普通 bootstrap(Chatterjee & Lahiri, 2011):本文使用模型基 bootstrap 而非重抽样,避免了 Lasso 目标函数非光滑的问题,但依赖于模型正确设定。
主要结果¶
定理 3.1(固定维度 bootstrap 有效性): - 陈述:在固定 p 和正则性条件下,\( \mathcal{L}(\sqrt{n}(\hat{\beta}^* - \hat{\beta}) | D_n) \Rightarrow_P \mathcal{L}(\sqrt{n}(\hat{\beta} - \beta^\circ)) \)。 - 直觉:bootstrap 分布一致逼近真实抽样分布。 - 必要条件:Cox 模型正则性条件 + 删失分布的一致估计。 - 解决的技术难点:bootstrap 样本的鞅结构、条件鞅 CLT 在 bootstrap 世界中的适用性。
定理 3.2(稀疏 Cox-Lasso 设置下的 bootstrap 有效性): - 陈述:在 oracle 型稀疏假设下,\( \mathcal{L}(\sqrt{n}(\tilde{\beta}^*_{\hat{M}} - \tilde{\beta}_{\hat{M}}) | D_n) \Rightarrow_P \mathcal{L}(\sqrt{n}(\tilde{\beta}_{\hat{M}} - \beta^\circ)) \)。 - 直觉:在 oracle 事件 \( \hat{M} = M^\circ \) 上,退化为固定维度情形。 - 必要条件:选择稳定性 \( P(\hat{M} = M^\circ) \to 1 \) + 定理 3.1 的条件。 - 解决的技术难点:将随机选择集 \( \hat{M} \) 替换为 oracle 集 \( M^\circ \) 时,误差是 \( o_P(1) \) 的。
学生化区间的有效性:需要额外的一致性条件——Cox 信息基标准误在原始重拟合和 bootstrap 重拟合中一致估计真实标准误。在 oracle 事件上,这是普通 Cox 模型观测信息矩阵的一致性(Andersen et al., 1993, Ch. VII)。
证明路线与技术技巧¶
整体路线(定理 3.2): 1. 定义 oracle 事件:\( A_n = \{\hat{M} = M^\circ\} \)。由选择稳定性假设,\( P(A_n) \to 1 \)。 2. 在 oracle 事件上:\( \tilde{\beta}_{\hat{M}} \) 就是真实活跃模型上的普通 Cox 估计量,bootstrap 重拟合也在同一模型上进行。 3. 应用定理 3.1:在 \( A_n \) 上,固定维度的 bootstrap 有效性成立。 4. 处理非 oracle 事件:由于 \( P(A_n) \to 1 \),非 oracle 事件上的贡献是 \( o_P(1) \)。 5. 条件 Slutsky 定理:将 oracle 事件上的收敛性推广到无条件收敛。
关键跳跃点: - 定理 3.1 的证明中,从“bootstrap 数据生成机制以概率趋于真实模型”到“bootstrap 得分函数的条件鞅 CLT”之间的跳跃:需要验证 bootstrap 世界中的可预测二次变差收敛到与原始样本相同的极限。这依赖于 \( \hat{\beta} \) 和 \( \hat{\Lambda}_0 \) 的一致性和删失分布估计的一致性。 - 定理 3.2 中,将随机选择集 \( \hat{M} \) 替换为 oracle 集 \( M^\circ \) 时,需要证明 \( \sqrt{n}(\tilde{\beta}^*_{\hat{M}} - \tilde{\beta}_{\hat{M}}) \) 与 \( \sqrt{n}(\tilde{\beta}^*_{M^\circ} - \tilde{\beta}_{M^\circ}) \) 的差异是 \( o_P(1) \) 的。这依赖于选择稳定性假设,但作者没有给出详细的误差分析(证明在 Supporting Information A.4 中)。
技术技巧点名: - 鞅表示与鞅 CLT:Cox 模型的得分函数可以写成鞅随机积分,这是 Andersen & Gill (1982) 的经典框架。bootstrap 世界中的类似表示是证明的核心。 - 条件弱收敛:使用 \( \Rightarrow_P \) 表示 bootstrap 分布的弱收敛(条件于数据),这是 bootstrap 理论的标准工具。 - Oracle 归约:将选后问题归约为固定维度问题,这是高维统计中处理变量选择的常见技巧(如 Bühlmann & van de Geer, 2011)。 - Breslow 估计量:用于估计累积基线风险,是 Cox 模型半参数推断的标准工具。 - Kaplan-Meier 估计量:用于估计删失分布,在协变量独立删失假设下使用。
真实例子与应用¶
数据:SEER(Surveillance, Epidemiology, and End Results)乳腺癌数据。n = 8000 名女性患者(2010-2015 年诊断的 II-III 期原发性浸润性乳腺癌),其中 2489 人发生事件(死亡),中位随访 102 个月,删失率 68.9%。预处理后 p = 74 个协变量(人口学特征、肿瘤分期和分级、受体状态、肿瘤大小、淋巴结受累、治疗指标、城乡状态、收入类别)。
如何应用: 1. 用交叉验证的 Cox-Lasso 选出 20 个变量。 2. 对选出的变量拟合无惩罚 Cox 模型(重拟合)。 3. 用模型基 bootstrap(B = 900)生成百分位数、学生化、Wald 型 bootstrap 区间。 4. 比较这些区间与 naive 选后 Wald 区间和去偏 Cox-Lasso 参考区间。
结果: - 强效应变量(化疗、阳性淋巴结、PR 阴性、无手术、AJCC T4)在所有区间构造下都显著非零。 - 弱效应变量(种族指标、肿瘤大小、部分 AJCC 淋巴结类别)在不同区间构造下差异较大。 - 模型基 bootstrap 区间与 naive Wald 区间在弱效应变量上差异明显,说明区间构造的选择会影响实际报告的不确定性。
这个例子想说明什么: - 方法可行性:在真实生存分析中可以实现。 - 区间构造的敏感性:不同 bootstrap 区间(百分位数 vs. Wald vs. 学生化)在弱效应变量上给出不同的不确定性量化,说明选择区间构造很重要。 - 与去偏方法的对比:两者目标参数不同(选后模型系数 vs. 固定坐标),因此差异主要反映目标差异而非方法优劣。
🔎 结论是否比证明窄¶
是。几个关键点: 1. 选择稳定性假设:定理 3.2 要求 \( P(\hat{M} = M^\circ) \to 1 \),但模拟中使用的 AIC 和 \( \lambda_{\min} \) 调参规则不保证这个性质。作者在讨论中承认:“the oracle-type theory assumes consistent recovery of the true active set but does not establish this property for either of the two tuning strategies in full generality”。因此,模拟中观察到的有限样本覆盖不足(特别是小样本和弱信号下)不被理论覆盖。 2. 学生化区间的有效性:定理 3.2 只给出了 bootstrap 分布的一阶有效性,学生化区间需要额外的一致性条件(Cox 信息基标准误的一致性)。作者在 Section 2.3 中承认:“This consistency does not follow from variable selection alone”,并依赖于 oracle 事件上的标准结果。因此,学生化区间的理论保证不比百分位数区间更强。 3. 目标参数的定义:本文的推断目标是选后无惩罚 Cox 重拟合的系数,而非原始 Cox-Lasso 系数或全模型系数。作者在引言中明确:“Our goal is not to provide exact selective inference or to replace penalized Cox estimation, but to quantify uncertainty for coefficients reported after Cox–Lasso variable selection.” 这意味着如果 Lasso 选错了变量(漏选或误选),本文的区间覆盖的是“错误模型”的系数,而非真值。这在模拟中通过条件于选择来评估,但在实际应用中无法知道选择是否正确。 4. 一阶有效性 vs. 有限样本表现:定理 3.2 只保证一阶渐近有效性,不保证二阶精度或有限样本覆盖。模拟中观察到的覆盖不足(特别是 n=30 时)与理论不矛盾,但说明理论保证在有限样本中可能不够。
四、开放问题¶
-
非 oracle 设定下的 bootstrap 有效性:当选择稳定性假设不成立时(即 \( P(\hat{M} = M^\circ) \not\to 1 \)),本文的 bootstrap 是否仍然有效?扎根于定理 3.2 对 \( P(\hat{M} = M^\circ) \to 1 \) 的依赖。作者在讨论中承认“Extensions to other penalties, selection mechanisms, model misspecification, and broader high-dimensional regimes require additional theory”。
-
程序感知(procedure-aware)的目标参数:本文的 bootstrap 条件于原始样本的选择,不反映选择步骤本身的变异性。一个更完整的目标是“整个选择-估计流程”的推断,即考虑选择不确定性。扎根于讨论中“A particularly relevant extension is a procedure-aware target that incorporates the complete selection-and-estimation workflow rather than conditioning on the model selected in the original sample”。
-
二阶精度与 BCa 区间:本文只建立了一阶有效性,未考虑二阶修正(如 BCa 区间)。扎根于讨论中“The results establish first-order validity only and do not imply higher-order refinements or second-order accuracy. BCa intervals and related corrections are therefore not considered.”
-
扩展到竞争风险和多状态模型:本文的 bootstrap 原理基于半参数 plug-in 模型,原则上可推广到其他生存模型。扎根于讨论中“The same principle may be adaptable to related semiparametric survival models, including competing risks and multistate models.”
提醒:要确认第 1 条是否是真 gap,建议去读 Leeb & Pötscher (2006) 的不可估计性结果,以及最近关于“bootstrap after model selection”的文献(如 Chatterjee & Lahiri, 2011 的后续工作),看是否有在非 oracle 设定下仍然有效的 bootstrap 方法。
Maintained by 陈星宇 · Homepage · Source on GitHub