Causal Survival Forests with Negative Controls¶
作者: Zijun Gao, Kyoungeui Hong, Leyi Ma, Qianli Wu, Zachary Izzo et al.
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.19749
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:在观察性生存分析中,当存在未观测混杂(unmeasured confounding)且结局是右删失(right-censored)时,如何灵活地、非参数地估计异质性处理效应(Heterogeneous Treatment Effect, HTE)。该方向当前处于“方法整合期”——已有成熟的生存HTE估计器(如因果生存森林)和成熟的未观测混杂处理框架(如近端因果推断),但二者尚未被系统地结合起来。
发展脉络(history)¶
- 奠基工作:Rubin (1974) 的潜在结果框架为因果推断提供了语言基础。Athey & Imbens (2015) 和 Wager & Athey (2018) 将随机森林引入HTE估计,提出了因果树和因果森林,在无未观测混杂假设下实现了非参数HTE估计与推断。
- 主要进展:Cui, Kosorok, Sverdrup, Wager & Zhu (2023) 将因果森林扩展到右删失生存数据,提出了因果生存森林(CSF),通过Neyman正交化损失同时处理删失和选择偏差。同期,Miao, Geng & Tchetgen Tchetgen (2018) 提出了近端因果推断(Proximal Causal Inference, PCI)框架,利用负对照变量(negative controls)在存在未观测混杂时识别因果效应。Cui, Pu, Shi, Miao & Tchetgen Tchetgen (2024) 进一步建立了半参数近端因果推断的效率理论。
- 当前frontier:近端因果推断正从平均处理效应(ATE)向更复杂的目标扩展。Li, Linderman, Shi & Tchetgen Tchetgen (2025) 将其推广到右删失生存数据,但局限于参数化的加性风险模型和平均处理效应。Kallus, Mao & Uehara (2021) 提出了基于minimax学习的非参数桥函数估计,但同样聚焦于ATE。
- 本文的位置:本文是第一个将近端因果推断的负对照框架与非参数HTE估计器(因果生存森林)结合的工作。它填补了“存在未观测混杂时灵活估计生存HTE”这一空白。
子线索聚类¶
- 生存分析中的HTE估计:包括Cui et al. (2023) 的CSF、Tabib & Larocque (2020) 的随机森林方法、Hu et al. (2021, 2022) 的BART方法、Henderson et al. (2020) 的贝叶斯加速失效时间模型。这一簇的核心是在无未观测混杂假设下,用机器学习灵活建模生存HTE。
- 近端因果推断:包括Miao et al. (2018) 的识别理论、Cui et al. (2024) 的半参数效率理论、Tchetgen Tchetgen et al. (2024) 的综述、Ying et al. (2021) 的纵向扩展、Liu et al. (2025) 的回归方法。这一簇的核心是利用负对照变量在存在未观测混杂时识别因果效应。
- 随机森林与正交化:包括Athey et al. (2019) 的广义随机森林、Nie & Wager (2021) 的R-learner、Wager & Athey (2018) 的因果森林。这一簇的核心是通过Neyman正交化损失实现鲁棒的HTE估计。
核心问题与瓶颈¶
- 核心问题1:如何放松“无未观测混杂”这一强假设?——近端因果推断提供了答案,但需要负对照变量满足特定的排除限制和完备性条件。
- 核心问题2:如何将负对照框架从ATE扩展到HTE?——桥函数(bridge function)的估计和正交化损失的设计是关键。
- 核心问题3:如何在存在删失时实现非参数HTE估计?——CSF提供了模板,但需要与负对照框架整合。
- 已知瓶颈:桥函数的估计涉及求解条件矩方程(conditional moment problem),通常是ill-posed的;完备性条件(completeness)在有限样本下难以验证;负对照变量的有效性是应用特定的,无法从数据中验证。
⚠️ 作者的framing¶
作者将缺口frame成:“现有生存HTE方法依赖无未观测混杂假设,而近端因果推断在生存数据中仅用于ATE且依赖参数模型,因此将二者结合是显然的下一步。” 被淡化的竞争路线包括: - 敏感性分析(如Huang et al., 2020):作者在引言中提及但未深入比较。敏感性分析不要求负对照变量,但只能提供效应范围而非点估计。 - 工具变量法:作者未提及。工具变量与负对照不同,它要求排除限制(exclusion restriction)和相关性,通常更严格。 - 直接对(X, W, Z)使用CSF:这是作者在模拟中作为“Uncensored Baseline”和“Censored Baseline”的消融对照,但未在引言中作为竞争路线讨论。
值得研究者去查的问题:本文未引用任何关于高维负对照或高维桥函数估计的工作(如高维工具变量或高维条件矩估计)。这可能是由于生存HTE设定本身已足够复杂,但高维扩展是自然方向。
张力¶
未见明显对立引用。所有被引工作基本在“无未观测混杂假设不现实,需要负对照”这一共识上一致。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(A_i \in \{0, 1\}\):二元处理变量。 - \(X_i \in \mathbb{R}^p\):可观测的基线协变量。 - \(U_i\):未观测混杂变量(标量或向量)。 - \(T_i(a), C_i(a)\):潜在事件时间和潜在删失时间,\(a \in \{0, 1\}\)。 - \(T_i = T_i(A_i), C_i = C_i(A_i)\):实际事件和删失时间。 - \(Y_i = \min(T_i, C_i)\):观测到的生存时间。 - \(\Delta_i = I\{T_i \le C_i\}\):事件指示符。 - \(h > 0\):固定时间窗(horizon)。 - \(G_i(a; h)\):潜在结局,可以是 \(\min\{T_i(a), h\}\)(RMST)或 \(I\{T_i(a) > h\}\)(生存概率)。 - \(\tau(x) = \mathbb{E}[G_i(1; h) - G_i(0; h) \mid X_i = x]\):条件平均处理效应(CATE)。 - \(Z_i\):负对照处理(negative control treatment)。 - \(W_i\):负对照结局(negative control outcome)。 - \(q(z, x)\):处理桥函数,满足 \(\mathbb{E}[q(Z_i, X_i) \mid X_i, U_i] = \mathbb{P}(A_i = 1 \mid X_i, U_i)\)。 - \(f_a(w, x)\):结局桥函数,满足 \(\mathbb{E}[f_a(W_i, X_i) \mid X_i, U_i] = \mathbb{E}[G_i(a; h) \mid X_i, U_i]\)。 - \(m(x, w, z) = \mathbb{E}[G_i(h) \mid X_i = x, W_i = w, Z_i = z]\):边际均值函数。 - \(S_C(t \mid \cdot)\):条件删失生存函数。 - \(\Lambda_C(t \mid \cdot)\):条件删失累积风险。 - \(\rho_a(t, \cdot; h)\):条件期望结局,给定存活到时间 \(t\)。
模型: - 潜在结果框架,SUTVA成立。 - 重叠假设:\(0 < \mathbb{P}(A_i = 1 \mid X_i, U_i) < 1\) a.s. - 不假设无未观测混杂:允许 \(A_i\) 依赖于 \(U_i\)。 - 负对照结构(图1):\((A_i, Z_i) \perp (T_i(a), C_i(a), W_i) \mid U_i, X_i\)。 - 桥函数存在性:存在 \(q\) 和 \(f_a\) 满足 (2) 式。 - 条件独立删失:\(C_i(a) \perp T_i(a) \mid X_i, W_i, Z_i, A_i = a\)。
可观测数据:研究者实际能观测到的是 \(\{(X_i, W_i, Z_i, A_i, Y_i, \Delta_i)\}_{i=1}^n\)。 - 可观测:\(X_i, W_i, Z_i, A_i, Y_i, \Delta_i\)。 - 潜在/不可观测:\(U_i\),以及潜在结果 \(T_i(a), C_i(a), G_i(a; h)\)(除非在特定条件下通过删失校正识别)。
第二步:最小内核——无删失、线性桥函数、一维X的特例¶
特例设定: - 无删失:\(C_i = \infty\) a.s.,因此 \(\Delta_i = 1\),\(Y_i = T_i\),\(G_i(h) = \min(T_i, h)\)。 - 一维 \(X_i\),一维 \(U_i\),一维 \(W_i\),一维 \(Z_i\)。 - 桥函数是线性的:\(q(z, x) = \alpha_0 + \alpha_1 z + \alpha_2 x\),\(f_a(w, x) = \beta_{a0} + \beta_{a1} w + \beta_{a2} x\)。 - 目标:估计 \(\tau(x) = \mathbb{E}[G_i(1; h) - G_i(0; h) \mid X_i = x]\)。
核心思路: 1. 用桥函数构造残差:定义处理残差 \(A_i^{\text{res}} = A_i - q(Z_i, X_i)\) 和结局残差 \(Y_i^{\text{res}} = G_i(h) - m(X_i, W_i, Z_i)\),其中 \(m = q f_1 + (1-q) f_0\)。 2. 正交化损失:使用损失函数 \(\ell = \sum_i (Y_i^{\text{res}} - \tau(X_i) A_i^{\text{res}})^2\) 来训练随机森林。 3. 为什么有效:在桥函数正确时,\(\mathbb{E}[A_i^{\text{res}} \mid X_i, U_i] = 0\) 且 \(\mathbb{E}[Y_i^{\text{res}} \mid X_i, U_i] = \tau(X_i, U_i) \mathbb{E}[A_i^{\text{res}} \mid X_i, U_i]\),因此损失函数的得分在 \(\tau^w(x)\) 处有条件期望为零。当 \(U\) 不修改效应时,\(\tau^w(x) = \tau(x)\)。
在这个特例下,要证的命题退化成什么? - 命题3.3(有效性)退化为:在无删失、线性桥函数下,损失函数的得分在 \(\tau(x)\) 处有条件期望为零,当且仅当 \(\tau(x, u) = \tau(x)\)。 - 证明:直接计算 \(\mathbb{E}[(A_i - q_i)(G_i - m_i - \tau(X_i)(A_i - q_i)) \mid X_i = x]\),利用桥函数性质将其分解为 \(\mathbb{E}[(A_i - q_i)^2 (\tau(X_i, U_i) - \tau(X_i)) \mid X_i = x]\),在 \(\tau(x, u) = \tau(x)\) 时为零。
为什么这个特例抓住了核心? - 无删失去掉了删失校正的复杂性,线性桥函数去掉了非参数估计的困难,一维变量去掉了高维诅咒。剩下的核心是:如何用桥函数构造正交化损失,使得HTE估计对未观测混杂鲁棒。论文的一般情形只是在这个核心上添加了删失校正、非参数桥函数估计和高维特征。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在存在未观测混杂和右删失的观察性生存数据中,如何灵活地、非参数地估计异质性处理效应(HTE)。
- 核心工具/方法:将近端因果推断的负对照桥函数与因果生存森林(CSF)的Neyman正交化损失相结合,提出NC-CSF——一种使用桥函数构造残差、再用正交化损失训练随机森林的HTE学习器。
- 主要结论:NC-CSF在模拟中显著优于现有基线(包括CSF、随机生存森林、BART等),在真实数据上复现了已知发现并揭示了新的异质性模式。
关键设定与假设¶
- 负对照假设(式1):\((A_i, Z_i) \perp (T_i(a), C_i(a), W_i) \mid U_i, X_i\)。这意味着给定完整混杂状态 \((X_i, U_i)\),处理 \(A_i\) 和负对照处理 \(Z_i\) 与潜在结果、潜在删失时间、负对照结局 \(W_i\) 独立。这是近端因果推断的核心假设。
- 桥函数存在性(式2):存在函数 \(q\) 和 \(f_a\) 使得 \(\mathbb{E}[q(Z_i, X_i) \mid X_i, U_i] = \mathbb{P}(A_i = 1 \mid X_i, U_i)\) 和 \(\mathbb{E}[f_a(W_i, X_i) \mid X_i, U_i] = \mathbb{E}[G_i(a; h) \mid X_i, U_i]\)。这要求负对照变量能“代表”未观测混杂。
- 条件独立删失(式3):\(C_i(a) \perp T_i(a) \mid X_i, W_i, Z_i, A_i = a\)。这是生存分析的标准假设,但这里条件集包含了负对照变量。
- 相比已有文献的放宽/强化:相比CSF(Cui et al., 2023),本文放宽了无未观测混杂假设;相比生存近端因果推断(Li et al., 2025),本文强化了目标(从ATE到HTE)和灵活性(从参数模型到非参数森林)。
主要结果¶
- 命题3.3(有效性):NC-CSF的得分在 \(\tau^w(x)\) 处有条件期望为零,其中 \(\tau^w(x)\) 是 \(\tau(x, U)\) 的加权平均,权重为 \((A_i - q(Z_i, X_i))^2\)。当 \(U\) 不修改效应时,\(\tau^w(x) = \tau(x)\)。
- 直觉:桥函数构造的残差消除了未观测混杂的直接影响,但留下了处理效应与处理残差方差的协方差。
- 必要条件:桥函数正确。
- 解决的技术难点:如何将桥函数整合到CSF的损失中,使得得分在存在未观测混杂时仍具有条件期望为零的性质。
- 命题3.5(Neyman正交性):NC-CSF的得分关于所有nuisance函数(\(q, m, S_C, \rho_a, \Lambda_C\))的路径导数在真实值处条件期望为零。
- 直觉:得分对nuisance估计误差是“二阶敏感”的,即一阶误差被消除,只有二阶乘积项残留。
- 必要条件:nuisance函数在真实值处可微。
- 解决的技术难点:证明删失校正部分(涉及 \(S_C, \rho_a, \Lambda_C\))的正交性,这需要利用计数过程鞅的性质。
- 命题3.6(渐近正态性):在固定或诚实子组 \(S\) 上,若交叉拟合的nuisance估计量满足 \(L_2\) 误差 \(o_p(n_S^{-1/4})\),则NC-CSF估计量 \(\hat{\tau}_S\) 是 \(\sqrt{n_S}\)-相合的、渐近正态的,方差为 \(\sigma_S^2\)。
- 直觉:Neyman正交性 + 交叉拟合 + 足够快的nuisance收敛率 → 可行估计量与oracle估计量渐近等价。
- 必要条件:有界性、残差重叠、\(o_p(n^{-1/4})\) 的nuisance收敛率。
- 解决的技术难点:将CSF的渐近理论扩展到存在负对照和桥函数的情形。
证明路线与技术技巧¶
整体路线(以命题3.3和3.5为例): 1. 桥函数识别(命题3.2):证明桥函数满足的可观测条件矩方程(式6)与潜在桥函数方程(式2)在完备性条件下等价。这为桥函数的估计提供了可操作的基础。 2. 构造正交化损失(式5):定义 \(A_i^{\text{res}} = A_i - q_i\) 和 \(Y_i^{\text{res}}\)(删失校正后的残差),损失为 \(\sum_i (Y_i^{\text{res}} - \tau(X_i) A_i^{\text{res}})^2\)。 3. 证明得分有效性(命题3.3):计算 \(\mathbb{E}[(A_i - q_i)(Y_i - m_i - \tau(X_i)(A_i - q_i)) \mid X_i = x]\),利用桥函数性质将其分解为 \(\mathbb{E}[(A_i - q_i)^2 (\tau(X_i, U_i) - \tau(X_i)) \mid X_i = x]\),从而得到 \(\tau^w(x)\)。 4. 证明Neyman正交性(命题3.5):对每个nuisance分量(\(q, m, S_C, \rho_a, \Lambda_C\))计算得分的一阶变分,证明其在真实值处条件期望为零。对于删失相关分量,利用计数过程鞅的性质。 5. 渐近分析(命题3.6):利用交叉拟合使观测与nuisance估计独立,结合Neyman正交性将可行估计量与oracle估计量的差控制为 \(o_p(n^{-1/2})\),再对oracle估计量应用中心极限定理。
关键跳跃点: - 桥函数与删失校正的整合:删失校正后的 \(Y_i^{\text{res}}\) 需要同时包含桥函数(\(m_i\))和CSF的删失校正项(涉及 \(S_C, \rho_a, \Lambda_C\))。证明这两部分在得分中不产生一阶偏差是技术难点。 - Neyman正交性的证明:对于删失相关nuisance,需要利用计数过程鞅的Doob-Meyer分解,证明得分的一阶变分是鞅积分,其条件期望为零。
技术技巧点名: - 桥函数:用于从未观测混杂中“提取”处理机制和结局机制。 - Neyman正交化:使损失对nuisance估计误差鲁棒。 - 交叉拟合:打破nuisance估计与得分计算之间的依赖,简化渐近分析。 - 计数过程鞅:用于处理删失校正部分的正交性证明。 - 经验过程/Delta方法:用于渐近正态性的证明(文中未详细展开,但隐含在命题3.6的证明思路中)。
真实例子与应用¶
- ACTG175 HIV试验:比较ddI单药与ZDV+ddI联合疗法。NC-CSF估计出年龄相关的异质性:年轻患者(20-30岁)的RMST效应为负(联合疗法不利),中年患者(40-62岁)为正。这与已知的年龄-治疗交互作用一致,而基线R-CSF给出全年龄正效应。
- 数据:1,083名患者,RMST horizon \(h=1000\)天。
- 方法应用:将CD4/CD8计数设为 \(W\),种族/抗逆转录病毒史设为 \(Z\),12个基线变量设为 \(X\)。
- 结果:NC-CSF揭示了更保守、更年龄依赖的效应模式。
- 右心导管插入术(RHC)数据:评估RHC对30天生存率的影响。NC-CSF估计的ATE为-0.0433,介于Kallus et al. (2021) 的灵活估计和线性/无混杂估计之间。
- 数据:5,735名患者,二元30天生存结局。
- 方法应用:将pafi1/paco21设为 \(Z\),ph1/hema1设为 \(W\),其余68个变量设为 \(X\)。
- 结果:作为一致性检查,NC-CSF的估计落在已有文献估计的范围内。
- MIMIC-IV药物相互作用:评估他克莫司与CYP3A抑制剂联用是否增加7天内急性肾损伤(AKI)风险。
- 数据:2,257名阳性对照组(联用CYP3A抑制剂),1,398名惰性对照组(联用无CYP3A活性的药物)。
- 方法应用:预处理实验室值作为 \(W\),行政变量作为 \(Z\)。
- 结果:在阳性对照组,NC-CSF估计出最强的危害信号(AKI-free survival降低0.2410),而惰性对照组无显著效应。在有肝病史的亚组中,危害更大(-0.3532 vs -0.2131),与生物学机制一致。
🔎 结论是否比证明窄¶
- 命题3.6 只证明了在固定或诚实子组上的渐近正态性,并未证明递归学习的森林能恢复唯一的oracle分区。作者在Remark 3.7中明确承认了这一点,并指出分区恢复需要额外的分离和结构条件(如Madrid Padilla et al., 2021)。因此,论文的理论结论比其方法声称的“灵活非参数HTE学习器”要窄——理论只覆盖了子组推断,而非整个森林的全局性质。
- 命题3.3 的结论是 \(\tau^w(x)\) 而非 \(\tau(x)\)。作者在Remark 3.4中讨论了二者的差异,但并未提供 \(\tau^w(x) = \tau(x)\) 的充分必要条件(除了“U不修改效应”这一强假设)。因此,在一般情形下,NC-CSF估计的是加权目标,而非标准CATE。
四、开放问题(点到为止,扎根具体语句)¶
-
加权目标 \(\tau^w(x)\) 与标准CATE \(\tau(x)\) 的差距:当 \(U\) 修改效应时,\(\tau^w(x) \neq \tau(x)\)。作者在Remark 3.4中给出了差距的表达式(式7),但未提供如何检验或缩小这一差距的方法。扎根于:Remark 3.4 和 Section 6 “τ^w(x) is the general estimand and need not equal the conventional CATE”。
-
递归分裂行为的理论分析:命题3.6只覆盖了固定子组,未分析森林递归分裂的全局性质。作者在Remark 3.7中承认了这一点。扎根于:Remark 3.7 “It does not prove that a recursively learned forest recovers a unique oracle partition”。
-
桥函数估计的ill-posedness:作者在Section 6和Appendix B中讨论了桥函数估计的ill-posedness,但未提供有限样本下的理论保证(如正则化桥函数的收敛率)。扎根于:Section 6 “completeness does not resolve finite-sample ill-posedness” 和 Appendix B “A small κ corresponds to a poorly conditioned inverse”。
-
负对照有效性的验证:负对照假设(式1)无法从数据中验证。作者在Section 6中承认了这一点。扎根于:Section 6 “negative-control validity is application-specific and cannot be verified from the observed law alone”。
Maintained by 陈星宇 · Homepage · Source on GitHub