跳转至

Estimating heterogeneous treatment effects with right-censored data via causal survival forests

作者: Yifan Cui, Michael R Kosorok, Erik Sverdrup, Stefan Wager, Ruoqing Zhu
来源: Journal of the Royal Statistical Society Series B
主题: 因果推断
相关性: 9/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是:在右删失生存数据下,非参数地估计条件平均处理效应(CATE)。核心统计问题是:在观测研究中,当结局变量是生存时间(可能被右删失)时,如何利用随机森林等非参数工具,在无混淆性假设下,估计异质性处理效应 τ(x) = E[Ti(1) - Ti(0) | Xi = x],并给出有效的推断(置信区间)。该方向当前处于“从无删失到有删失”的扩展阶段——无删失情形下的因果森林已有较成熟的渐近理论(Wager & Athey 2018),但生存数据下的删失机制带来了额外的识别与估计挑战。

发展脉络(history)

  1. 奠基工作:随机森林与因果森林。Breiman (2001) 提出随机森林;Wager & Athey (2018) 首次证明因果森林在无混淆性下对 CATE 的点态一致性与渐近正态性,并给出基于无穷小 Jackknife 的方差估计。这是本文的直接理论起点。
  2. 主要进展:广义随机森林与正交学习。Athey et al. (2019) 将随机森林推广至局部矩估计框架(广义随机森林),可处理 IV、分位数回归等;Foster et al. (2019) 提出正交统计学习,证明若目标风险满足 Neyman 正交性,则两阶段样本分裂的 meta-algorithm 可将 nuisance 估计误差的影响降至二阶。Nie & Wager (2021) 提出拟 Oracle 的 CATE 估计,通过构造正交目标函数隔离因果信号。Kennedy (2020) 给出双稳健 CATE 估计的通用误差界与 Oracle 效率条件。
  3. 当前 frontier:生存数据下的异质性处理效应。已有工作主要分两类:(a) 将无删失方法直接适配——如 Foster et al. (2011) 的 Virtual Twins 方法扩展到生存数据(用随机生存森林估计 μ0, μ1);(b) 开发专门的生存树/森林——如 Ishwaran et al. (2008) 的随机生存森林(基于 log-rank 分裂准则),Steingrimsson et al. (2016) 的双稳健生存树(构造双稳健损失函数)。但这些方法要么缺乏对 CATE 的渐近推断理论,要么未同时处理删失与选择偏差。
  4. 本文的位置:本文首次将因果森林框架扩展到右删失数据,核心创新是将 Neyman 正交得分与随机生存森林结合,通过正交估计方程同时调整删失偏差和选择偏差,并给出渐近正态性与半参数效率界。这是对 Wager & Athey (2018) 在生存数据下的直接推广,也是对 Athey et al. (2019) 广义随机森林在删失设定下的具体化。

子线索聚类

  • 线索 A:基于树的 CATE 估计(无删失)。Wager & Athey (2018)、Athey et al. (2019)、Athey & Imbens (2016)、Nie & Wager (2021)。核心:用随机森林做 CATE 估计,有渐近理论。
  • 线索 B:生存数据的树/森林方法。Ishwaran et al. (2008)(随机生存森林,基于 log-rank 分裂)、Steingrimsson et al. (2016)(双稳健生存树)、Zhu & Kosorok (2012)(递归插补生存森林)。核心:处理删失,但缺乏 CATE 推断理论。
  • 线索 C:正交/双稳健 CATE 估计(无删失)。Kennedy (2020)、Foster et al. (2019)、Nie & Wager (2021)。核心:用 Neyman 正交性实现二阶 nuisance 误差控制。
  • 线索 D:最优治疗规则与子组识别。Foster et al. (2011)(Virtual Twins)、Zhao et al. (2012)(Outcome Weighted Learning)、Qian & Murphy (2011)。核心:从 CATE 估计到决策规则,但多为无删失设定。

这个方向在追问的核心问题

  1. 如何同时处理删失偏差和选择偏差? 删失导致生存时间不可完全观测,选择偏差(无混淆性)需要调整协变量。两者叠加使 CATE 估计更复杂。
  2. 能否在生存数据下实现与无删失情形相当的渐近效率? 即估计量能否达到半参数效率界,且收敛速度不受删失机制影响(在合理假设下)。
  3. 如何构造有效的方差估计? 生存数据下,无穷小 Jackknife 是否仍适用?删失带来的额外不确定性如何量化?
  4. 非参数 CATE 估计在生存数据下的 minimax 最优率是多少? 目前仅有 Cui et al. (2022) 对生存森林的收敛速度有初步结果(n^{-1/(p+2)}),但 CATE 的 minimax 界尚不清楚。

⚠️ 作者的 framing

作者将缺口 frame 为:“现有因果森林方法无法处理右删失数据,而现有生存森林方法缺乏对 CATE 的推断理论”。因此本文的“显然下一步”是:将因果森林的正交化策略与生存森林的删失处理机制结合。作者淡化了以下竞争路线: - 直接使用 IPCW(逆概率删失加权)将无删失方法适配——作者在实验中将此作为 baseline,但指出其方差大、对删失模型敏感。 - 基于 Cox 模型的方法——作者在实验中也将其作为 baseline,但指出其线性假设过强。 - Kennedy (2020) 的双稳健 CATE 估计——作者将其列为相关文献,但未讨论其在生存数据下的直接推广(可能因为 Kennedy 的框架需要完整的 outcome 观测)。

值得研究者去查的问题:本文未引用 Cui et al. (2022) 关于生存森林收敛速度的工作(虽然作者在别处引了),也未引用任何关于生存数据下 CATE 的 minimax 下界的工作——这类下界是否存在?若不存在,这是一个明显的 gap。

张力

未见明显对立引用。所有被引工作基本在“正交化 + 树方法”这一共识框架下,差异在于具体实现与设定(删失 vs. 无删失)。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(X_i \in \mathcal{X} = [0,1]^p\):协变量向量(p 维,连续,密度有界远离 0 和 ∞)。 - \(W_i \in \{0,1\}\):二值处理变量(0 = 对照,1 = 处理)。 - \(T_i(0), T_i(1)\):潜在生存时间(counterfactual),即个体 i 在两种处理下的潜在结局。不可观测——每个个体只能观测到一种处理下的结局。 - \(T_i = T_i(W_i)\):实际观测到的生存时间(若未删失)。 - \(C_i\):删失时间(假设独立于潜在结局给定协变量和处理)。 - \(U_i = \min(T_i, C_i)\):观测到的随访时间。 - \(\Delta_i = I(T_i \le C_i)\):事件指示符(1 = 观察到事件,0 = 删失)。 - \(Y_i(t) = I(T_i \ge t)\):生存过程指示符(在时间 t 仍存活)。 - \(h\):固定的时间界(horizon),研究者关心的最大随访时间。 - \(\tau(x) = E[T_i(1) - T_i(0) | X_i = x]\):条件平均处理效应(CATE),本文目标 estimand。注意:由于删失,实际估计的是受限平均生存时间差(RMST difference)\(\tau_h(x) = E[\min(T_i(1), h) - \min(T_i(0), h) | X_i = x]\),其中 h 是固定时间界。 - \(e(x) = P(W_i = 1 | X_i = x)\):倾向得分(propensity score)。 - \(m(w, x) = E[\min(T_i, h) | X_i = x, W_i = w]\):条件均值函数(nuisance)。 - \(S_{C|W}(t|x) = P(C_i > t | X_i = x, W_i = w)\):删失生存函数(nuisance)。 - \(\lambda_{C|W}(t|x)\):删失风险函数(nuisance)。

模型: - 无混淆性(Unconfoundedness)\(\{T_i(0), T_i(1)\} \perp W_i | X_i\)。即给定协变量,处理分配与潜在结局独立。 - 删失独立于潜在结局给定协变量和处理\(C_i \perp \{T_i(0), T_i(1)\} | X_i, W_i\)。即给定协变量和处理,删失时间与潜在生存时间独立(条件独立删失)。 - 重叠假设(Overlap):存在 \(\eta > 0\) 使得 \(\eta < e(x) < 1 - \eta\) 对所有 x 成立。 - 数据生成\((X_i, W_i, T_i(0), T_i(1), C_i)\) 独立同分布,但研究者只能观测到 \((X_i, W_i, U_i, \Delta_i)\)

可观测数据: 研究者实际能观测到的是:\(\{(X_i, W_i, U_i, \Delta_i)\}_{i=1}^n\),其中 \(U_i = \min(T_i, C_i)\)\(\Delta_i = I(T_i \le C_i)\)不可观测的是:潜在生存时间 \(T_i(0), T_i(1)\),以及删失时间 \(C_i\)(若未删失则 \(C_i > T_i\) 不可知)。所有推断必须依赖无混淆性和条件独立删失假设来识别。

第二步:讲最小内核

最简特例:假设 \(p=1\)(只有一个协变量),且 \(h = \infty\)(无时间界,即估计完整生存时间的 CATE)。进一步假设删失完全随机(MCAR)\(C_i \perp (T_i, X_i, W_i)\),即删失时间与所有变量独立。此时删失机制最简单:删失生存函数 \(S_C(t)\) 不依赖于 x 或 w。

在这个特例下,本文的核心思路是什么?

  1. 目标:估计 \(\tau(x) = E[T_i(1) - T_i(0) | X_i = x]\)
  2. 挑战:由于删失,我们无法直接观测到 \(T_i\),只能观测到 \(U_i = \min(T_i, C_i)\)\(\Delta_i\)。即使知道 \(e(x)\),也无法直接使用无删失情形的正交得分(如 Nie & Wager 2021 的 R-learner 得分)。
  3. 关键想法:构造一个正交得分函数 \(\psi(\cdot)\),使得:
  4. 它是无偏的\(E[\psi(O_i; \tau(x), \eta) | X_i = x] = 0\)\(\tau(x)\) 为真值时,其中 \(\eta\) 是 nuisance 参数(包括 \(e, m, S_C, \lambda_C\))。
  5. 它是Neyman 正交的\(\partial E[\psi(O_i; \tau(x), \eta)] / \partial \eta = 0\) 在真值处成立,即 nuisance 估计误差对目标估计的影响是二阶的。
  6. 本文构造的得分(简化版,在 MCAR 下):
    \[\psi(O_i; \tau(x), \eta) = \frac{W_i - e(X_i)}{e(X_i)(1 - e(X_i))} \left[ \frac{\Delta_i U_i}{S_C(U_i)} - m(W_i, X_i) \right] - \tau(X_i)\]
    其中 \(S_C(t)\) 是删失生存函数(在 MCAR 下不依赖于 x, w)。注意:\(\Delta_i U_i / S_C(U_i)\)\(T_i\) 的 IPCW 估计(因为 \(E[\Delta_i U_i / S_C(U_i) | X_i, W_i] = E[T_i | X_i, W_i]\) 在 MCAR 下成立)。
  7. 为什么正交? 直觉上,得分对 nuisance 的导数涉及 \(E[W_i - e(X_i) | X_i] = 0\) 或类似项,因此在真值处为零。这保证了即使 \(e(x)\)\(m(w,x)\) 以较慢速率估计(如 \(n^{-1/4}\)),\(\tau(x)\) 的估计仍可达到 \(n^{-1/2}\) 收敛(在参数化设定下)。
  8. 森林如何用? 本文不是直接最小化上述得分的平方和,而是用随机森林来局部化:在每个测试点 x,森林赋予训练样本权重 \(\alpha_i(x)\)(基于树中 x 落入的叶节点),然后求解加权矩条件:
    \[\sum_{i=1}^n \alpha_i(x) \psi(O_i; \tau(x), \hat{\eta}) = 0\]
    其中 \(\hat{\eta}\) 是 nuisance 参数的交叉拟合估计。这等价于在 x 的邻域内求解正交得分方程。

这个特例揭示了本文的核心数学操作:将无删失情形下的正交 CATE 得分(如 R-learner 得分)中的 outcome \(T_i\) 替换为 IPCW 调整后的伪 outcome \(\Delta_i U_i / \hat{S}_C(U_i)\),并证明这种替换不破坏 Neyman 正交性。一般情形(条件独立删失)只是将 \(S_C(t)\) 替换为 \(S_{C|W}(t|X_i)\),并在得分中引入删失风险函数的积分项来调整。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在右删失生存数据下,基于无混淆性假设,非参数估计条件平均处理效应(CATE)\(\tau_h(x) = E[\min(T_i(1), h) - \min(T_i(0), h) | X_i = x]\),并给出渐近推断。
  2. 核心工具/方法:将随机生存森林与 Neyman 正交得分结合,构造因果生存森林(causal survival forests)。方法包括:正交估计方程(同时调整删失和选择偏差)、交叉拟合(cross-fitting)估计 nuisance 参数、无穷小 Jackknife(IJ)方差估计。
  3. 主要结论:在正则条件下,因果生存森林估计量是渐近正态的,且达到半参数效率界;基于 IJ 的方差估计是一致的,可构造有效置信区间。模拟和真实数据实验表明,该方法在多种删失比例和混杂强度下优于现有基线。

关键设定与假设

在第二节最小记号基础上,补全完整设定: - 时间界 h:固定且有限,使得 \(P(U_i \ge h | X_i) > 0\) 对所有 x 成立(避免尾部不稳定)。 - 删失机制:条件独立删失 \(C_i \perp T_i | X_i, W_i\),且删失生存函数 \(S_{C|W}(t|x)\) 和风险函数 \(\lambda_{C|W}(t|x)\) 是 nuisance 参数,需估计。 - 森林结构:假设协变量空间 \(\mathcal{X} = [0,1]^p\),密度有界。树的分裂基于正交得分(而非 log-rank 或 MSE),使用 Athey et al. (2019) 的 \(\tilde{\Delta}\)-criterion。 - 交叉拟合:将数据随机分成 K 折,每折的 nuisance 参数用其余 K-1 折估计,然后在该折上计算得分。这避免了 overfitting 偏差。 - 相比已有文献的放宽/强化: - 相比 Wager & Athey (2018):放宽了无删失假设,但增加了条件独立删失假设。 - 相比 Ishwaran et al. (2008):强化了推断理论(渐近正态性、方差估计),但增加了无混淆性假设(随机生存森林不假设无混淆性,仅做预测)。 - 相比 Kennedy (2020):将双稳健 CATE 估计从无删失扩展到删失数据,但森林的局部化机制不同(Kennedy 使用核平滑或任意回归方法)。

主要结果

定理 1(渐近正态性):在正则条件下(包括森林的“诚实性”、分裂的随机性、nuisance 估计的收敛速率等),因果生存森林估计量 \(\hat{\tau}_h(x)\) 满足:

\[\frac{\hat{\tau}_h(x) - \tau_h(x)}{\sqrt{\hat{V}_n(x)}} \xrightarrow{d} N(0, 1)\]
其中 \(\hat{V}_n(x)\) 是 IJ 方差估计。关键条件:nuisance 估计的收敛速率需快于 \(n^{-1/4}\)(这是 Neyman 正交性的标准要求)。

定理 2(半参数效率):在更强的假设下(包括 nuisance 估计达到 \(n^{-1/2}\) 速率),\(\hat{\tau}_h(x)\) 达到半参数效率界,即其渐近方差等于 efficient influence function 的方差。

定理 3(IJ 方差一致性):基于无穷小 Jackknife 的方差估计 \(\hat{V}_n(x)\)\(\text{Var}(\hat{\tau}_h(x))\) 的一致估计。

直觉:这些结果依赖于两个关键机制:(a) Neyman 正交性使得 nuisance 估计误差的影响是二阶的,因此只要 nuisance 估计足够快(\(n^{-1/4}\)),\(\tau_h(x)\) 的收敛速率不受影响;(b) 森林的局部化机制(自适应最近邻)使得在 x 点附近的有效样本量足够大,从而中心极限定理成立。

证明路线与技术技巧

整体路线(3-5 步逻辑主干): 1. 线性化:将 \(\hat{\tau}_h(x)\) 表示为“oracle 估计量”(假设 nuisance 已知)加上一个 nuisance 估计误差项。利用 Neyman 正交性,证明该误差项是二阶小量(\(o_p(n^{-1/2})\))。 2. Oracle 估计量的渐近性:证明若 nuisance 已知,则因果生存森林估计量等价于一个局部线性矩估计,其渐近正态性可由森林的“自适应最近邻”性质推导(类似 Wager & Athey 2018 的论证)。 3. 二阶误差控制:证明 nuisance 估计误差(交叉拟合后)对 \(\hat{\tau}_h(x)\) 的影响是 \(o_p(n^{-1/2})\)。这需要:(a) nuisance 估计的收敛速率(如 \(n^{-1/4}\));(b) 交叉拟合的独立性保证;(c) 得分函数的 Neyman 正交性。 4. 方差估计:证明 IJ 方差估计量 \(\hat{V}_n(x)\) 收敛到 oracle 方差。这依赖于森林的“无穷小”性质——每个训练样本对预测的影响可近似为线性项。 5. 结合:由 Slutsky 定理,得到 \(\hat{\tau}_h(x)\) 的渐近正态性。

关键跳跃点: - 跳跃点 1:构造正交得分 \(\psi(\cdot)\) 并证明其 Neyman 正交性。这是整个方法的基础。难点在于:删失数据下,得分必须同时调整删失和选择偏差,且对 nuisance 的导数需为零。作者通过引入 IPCW 项和删失风险积分项来实现。 - 跳跃点 2:证明在交叉拟合下,nuisance 估计误差对 \(\hat{\tau}_h(x)\) 的影响是 \(o_p(n^{-1/2})\)。这需要细致的 U-统计量展开和 empirical process 论证。关键引理是:由于交叉拟合,得分函数在 nuisance 估计值和真值处的差可分解为独立项的和,其方差可被控制。 - 跳跃点 3:将 IJ 方差估计从无删失情形推广到删失情形。这需要证明 IJ 的线性近似在删失得分下仍成立,且删失带来的额外变异性可被 IJ 捕获。

技术技巧点名: - Neyman 正交得分:核心工具,用于二阶 nuisance 误差控制。具体形式见公式 (8)-(10)。 - 交叉拟合(Cross-fitting):用于打破 nuisance 估计与目标估计之间的相关性,避免 overfitting 偏差。 - 无穷小 Jackknife(IJ):用于方差估计。IJ 通过计算每个训练样本对预测的“影响函数”来估计方差,无需 bootstrap。 - 自适应最近邻(Adaptive nearest neighbors):森林的局部化机制,使得在 x 点的有效样本量随 n 增长,且邻域形状自适应于数据。 - U-统计量展开:在证明二阶误差控制时,将 nuisance 估计误差项展开为 U-统计量,利用 Hoeffding 分解控制高阶项。

真实例子与应用

模拟实验: - 数据生成:基于修改的 Cox 模型或加速失效时间模型,生成异质性处理效应。协变量 p=5 或 10,删失比例 25% 或 50%,混杂强度中等。 - Baseline 方法:(a) Virtual Twins 适配(用随机生存森林估计 μ0, μ1);(b) Cox 模型交互项;(c) 因果森林直接适配(忽略删失,用观测到的 U_i 作为 outcome);(d) 随机生存森林的 CATE 估计(基于 log-rank 分裂)。 - 结果:因果生存森林在 RMSE 和置信区间覆盖上均优于所有 baseline,尤其在删失比例高、混杂强时优势明显。例如,在 50% 删失下,因果生存森林的 RMSE 比 Virtual Twins 适配低 30-50%。 - 这个例子想说明:正交化策略在删失数据下有效,且森林的局部化机制比全局模型(Cox)更灵活。

真实数据应用: - 数据:ACTG 175 艾滋病临床试验数据(约 2000 名患者,4 种治疗,右删失结局)。本文关注两种治疗(zdovudine vs. didanosine)的异质性效果。 - 方法应用:用因果生存森林估计 CATE \(\tau_h(x)\)(h=2 年),并给出点估计和 95% 置信区间。发现某些患者亚组(如基线 CD4 计数低、年龄大)从 didanosine 获益更大。 - 结果:与 Cox 模型交互项相比,因果生存森林发现了更丰富的异质性模式(如非线性交互)。置信区间宽度合理。 - 这个例子想说明:方法在实际数据中可行,且能发现临床上有意义的异质性。

🔎 结论是否比证明窄

  • 窄化 1:定理 1 的渐近正态性要求 nuisance 估计收敛速率快于 \(n^{-1/4}\),但作者未给出具体哪些方法能达到该速率(如随机生存森林的收敛速率是否满足?)。作者在模拟中使用了随机生存森林估计 nuisance,但未证明其速率。
  • 窄化 2:定理 2 的半参数效率要求 nuisance 估计达到 \(n^{-1/2}\) 速率,这在非参数设定下通常不成立(除非使用参数模型或高维稀疏模型)。作者在文中承认“this condition is strong”,但未讨论在非参数设定下效率是否仍可达。
  • 窄化 3:所有理论结果针对的是固定时间界 h,而非整个生存曲线。CATE 随时间变化的情形(即 \(\tau(x, t)\) 为 t 的函数)未被覆盖。
  • 泛化 claim:作者在摘要和引言中声称方法可处理“right-censored data”,但理论只覆盖了条件独立删失(\(C \perp T | X, W\))。若删失依赖于未观测变量(如信息性删失),方法可能失效。作者未讨论这一限制。

四、开放问题

  1. 非参数 nuisance 估计的收敛速率:本文的渐近正态性要求 nuisance 估计快于 \(n^{-1/4}\),但随机生存森林在非参数设定下的收敛速率尚不完全清楚(Cui et al. 2022 给出 n^{-1/(p+2)},这在高维下可能慢于 n^{-1/4})。扎根于:定理 1 的条件 (A5) 要求 nuisance 估计的 \(L_2\) 误差为 \(o_p(n^{-1/4})\),但作者未证明随机生存森林满足该条件。

  2. CATE 随时间变化:本文只估计固定时间界 h 下的 RMST 差。若研究者关心整个生存曲线上的异质性(如“处理在早期有效但后期无效”),需要将方法扩展到 \(\tau(x, t) = E[I(T_i(1) > t) - I(T_i(0) > t) | X_i = x]\)扎根于:本文第 6 节“Discussion”提到“extending our method to estimate the whole survival curve is an important direction”。

  3. 信息性删失:本文假设删失独立于潜在结局给定协变量和处理。若删失依赖于未观测的预后因素(如 sicker 患者更易失访),则方法有偏。扎根于:本文第 2 节假设 (A2) 明确要求条件独立删失,但未讨论该假设的敏感性。

  4. 高维协变量:本文假设协变量维数 p 固定且密度有界。当 p 随 n 增长(高维)时,森林的收敛速率和渐近正态性是否仍成立?扎根于:本文第 3 节的渐近理论假设 \(\mathcal{X} = [0,1]^p\) 且 p 固定,未讨论高维情形。

提醒:要确认第 1 条是否为真 gap,建议去读 Cui et al. (2022) 关于生存森林收敛速度的论文,以及随机生存森林在非参数回归下的 minimax 下界文献。若随机生存森林的收敛速率确实慢于 n^{-1/4},则本文的理论条件在实际中可能不满足——但这不意味着方法无效,只是理论需要更精细的分析(如放宽 n^{-1/4} 条件,或证明森林的“内在维度”低于 p)。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论