Causal inference with staggered entries and effects that change over calendar time¶
作者: Lorenzo Gasparollo, Mats J. Stensrud
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.30099
一、领域脉络与小综述¶
这个方向是什么¶
本子方向研究的是在个体入组时间(staggered entry)不同的纵向研究中,由于固定的行政截止日期(administrative end-of-follow-up)导致的右删失问题。核心统计/科学问题是:当研究者认为必须条件于入组时间 \(E\) 来假设删失机制(censoring assumptions)是合理的(因为 \(E\) 与结局相关,即存在日历时间变化 calendar-time changes, CTC),但条件于 \(E\) 又必然导致 positivity 违背(因为晚期入组的个体在长随访时间上必然被删失),那么因果效应(如生存函数)是否还能从观测数据中识别? 如果不能,偏差有多大?如何通过敏感性分析来量化这种偏差?该方向当前成熟度较高,但本文指出一个被广泛忽视的、由 positivity 违背导致的根本性识别问题。
发展脉络(history)¶
- 奠基工作:Robins (1986, 1993); Robins and Rotnitzky (1992); Robins and Greenland (1994)。这些工作建立了因果推断中处理删失的序贯可交换性(sequential exchangeability)框架,并指出条件于 \(E\) 是处理日历时间趋势的常见做法。Robins (1993) 和 Robins and Greenland (1994) 提出的 g-estimation of structural nested failure time models 被认为可以“adequately adjust for \(E\)”,但本文作者指出,这些方法并非主流实践。
- 主要进展:Hernán et al. (2000, 2008)。这两篇 seminal 论文将 Marginal Structural Models (MSM) 和 IPTW 应用于生存分析,并明确调整了 \(E\)。它们被广泛引用,并启发了大量目标试验模拟(target trial emulation)研究。本文作者指出,这些工作“implicitly relied on the extrapolation assumption” 来保证识别。
- 当前 Frontier:Hansen et al. (2017)。该文明确指出了条件于 \(E\) 时,行政删失部分的条件独立假设等价于无日历时间趋势,并认为该假设是可检验的。本文作者对此提出批评:Hansen et al. (2017) 的可检验性仅适用于研究期内(study period),而post-study period 的依赖关系(即本文定义的 CTC)是不可检验的。本文作者将 CTC 定义为“dependencies between the outcome of interest and the time of study entry arising during the post-study period”,并指出这是更一般、更适用于决策的定义。
- 本文的位置:本文系统性地揭示了在 WSC(加权生存曲线)和 MSM-hazard 两类主流程序中,条件于 \(E\) 的删失假设因 positivity 违背而 ill-posed 的后果。它给出了在 positivity 违背下 valid identification 的条件(即 extrapolation assumptions),并首次提出了 c-values 和 extrapolation curves 作为敏感性分析工具,量化了 nullify 一个推断效应所需的最小 post-study 风险变化。
子线索聚类¶
- WSC 程序(加权生存曲线):包括 Kaplan-Meier 及其加权/分层版本(Kaplan and Meier, 1958; Cole and Hernán, 2004; Xie and Liu, 2005)。本文证明,在 CTC 下,这些程序目标参数是受限的生存函数 \(S^{*,\text{km},a_k}_k = \prod_{m=0}^k (1-h^{a_m}_{,m})\),而非目标 estimand \(S^{a_k}_k\),除非满足一个难以验证的假设(8)。
- MSM-hazard 程序:包括 MSM 和作为其特例的 Cox 比例风险模型(Hernán et al., 2000, 2001, 2008; Cox, 1972)。本文给出了在 positivity 违背下,MSM-hazard 程序能正确识别 \(S^{a_k}_k\) 的充要条件(Proposition 1):必须将 \(E\) 包含在基线协变量 \(V\) 中,且模型对 \(h^{a_k}_k(v)\) 的设定必须正确(即 \(M(B)^{cs}_{|V}\) with \(E \in V\))。
- 敏感性分析:包括 e-values(Ding and VanderWeele, 2016)和本文提出的 c-values。c-values 量化了 nullify 一个效应所需的 post-study 风险变化,其角色类似于 e-values 量化未测量混杂。
这个方向在追问的核心问题¶
- 识别问题:在 positivity 违背下,目标因果 estimand(如 \(S^{a_k}_k\))是否还能从观测数据中识别?需要什么额外假设?
- 偏差刻画:当识别假设不成立时,WSC 和 MSM-hazard 程序实际估计的是什么参数?偏差的表达式是什么?
- 敏感性分析:如何量化对 extrapolation assumptions 的依赖程度?能否给出一个直观的度量,帮助研究者判断其结论的稳健性?
- 实践指导:在目标试验模拟等广泛应用中,研究者应如何正确调整 \(E\),并评估其结论对不可检验假设的敏感性?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将问题定位为“条件于 \(E\) 的删失假设是 ill-posed 的”,并指出这是一个被广泛忽视的根本性问题。他们将自己的贡献 frame 成“阐明这一问题的后果”并“提供解决方案(extrapolation assumptions 和 c-values)”,从而使其论文成为“显然的下一步”。
- 哪些竞争路线被他淡化或回避了:作者明确提到 Robins 的 g-estimation 和 parametric g-computation 可以“adequately adjust for \(E\)”,但随即表示本文研究的是“two widely used classes of procedures”,从而将 g-estimation 等更复杂的方法排除在主要讨论之外。作者也淡化了修改 estimand(如将目标人群限制在 \(E \le T-k\))这一路线,认为它改变了研究问题。
- 什么明显该被引/该存在、却没出现在 intro 里?:作者在附录 B.5.2 中讨论了 Hansen et al. (2017) 的局限性,但 intro 中未提及。此外,关于 positivity 违背的通用处理方法(如 Petersen et al., 2012; Moore et al., 2012)仅在附录中简要提及。值得研究者去查的问题:是否存在其他处理 positivity 违背的通用框架(如基于 truncated 或 modified treatment)可以应用于此问题?这些框架与本文的 extrapolation assumptions 相比有何优劣?
张力¶
未见明显对立引用。所有被引工作基本都承认条件于 \(E\) 是处理日历时间趋势的必要步骤,但本文首次系统性地揭示了其导致的 positivity 违背问题,并给出了解决方案。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(E\): 个体入组的日历时间(calendar time of study entry),\(E \in \{0, \dots, T\}\)。
- \(k\): 从入组开始测量的随访时间(follow-up time),\(k \in \{0, \dots, K\}\)。
- \(T\): 行政截止的日历时间(calendar time of administrative end of study)。
- \(C_{k-1}\): 右删失指示符(1=删失,0=未删失),在 \(k\) 时刻结局测量之前。
- \(A_k\): 处理指示符(1=处理,0=对照)。
- \(Y_k\): 事件指示符(1=死亡/失败,0=存活)。
- \(L_k\): 基线(\(k=0\))和时变(\(k>0\))协变量。
- \(S^{a_k}_k := P(Y^{a_k, c_{k-1}=0}_k = 0)\): 目标 estimand,即所有个体在干预下接受处理策略 \(a_k\) 且无删失时的生存概率。
- 模型:数据生成机制由潜在结果框架描述。关键假设是序贯可交换性(ex)、一致性(con)和 positivity(pos),这些假设通常被认为在条件于 \(E\) 和协变量历史时成立。
- 可观测数据:研究者能观测到每个个体的 \((E, L_0, A_0, Y_0, C_0, L_1, A_1, Y_1, C_1, \dots)\),直到个体发生事件或被删失。关键不可观测量是 post-study period 的潜在结局 \(Y^{a_k, c_{k-1}=0}_k\) 对于 \(e+k > T\) 的个体。例如,一个在 \(E=1\) 入组的个体,在 \(k=2\) 时(\(e+k=3 > T=2\))的潜在结局永远无法被观测到,因为他在 \(k=2\) 之前必然被行政删失。
第二步:讲最小内核¶
最简特例:设 \(K=T=2\)。考虑一个点处理 \(A\)(仅在 \(k=0\) 时分配),且无时变混杂(\(L_k = \emptyset\) for \(k>0\))。目标 estimand 是 \(S^{a=1}_2\),即所有个体在 \(k=2\) 时接受处理且无删失的生存概率。
- 问题:研究者认为 \(E\) 与结局相关,因此假设删失机制在条件于 \(E\) 时是独立的(ex)。但根据 (3),对于 \(E=1\) 的个体,在 \(k=2\) 时必然被删失(\(C_1=1\))。因此,positivity 条件 \(P(C_1=0 | Y_1=0, A=a, E=1) > 0\) 被违反。这意味着 ex 条件 \(Y^{a, c_{1}=0}_2 \perp \!\!\! \perp C_1 | Y_1=0, A=a, E=1\) 是 ill-posed 的,因为其条件集在观测数据中概率为零。
- 核心思路:由于无法在 post-study period 观测到任何数据,要识别 \(S^{a=1}_2\),必须对 post-study period 的潜在结局做出外推假设(extrapolation assumption)。本文的核心贡献是:
- 指出问题:WSC 程序(如 Kaplan-Meier)在 \(E=1\) 的个体中,只能估计到 \(k=1\) 的生存,然后将其“拖平”到 \(k=2\),这隐含地假设了 \(h^{a=1}_{,2} = h^{a=1}_2\),即 post-study 的风险与 study period 相同。这在 CTC 下通常不成立。
- 给出条件:MSM-hazard 程序要正确识别,必须将 \(E\) 包含在模型中,并且模型形式必须正确,这本质上是对 post-study 风险函数形式的一个外推假设。
- 量化敏感性:c-values 回答的问题是:如果 post-study 的风险在治疗组增加 \(c^1_2\) 倍,在对照组减少 \(c^0_2\) 倍,那么原本的效应(如风险比)就会被 nullify。研究者可以判断,这样的变化在科学上是否合理。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在 staggered entry 研究中,条件于入组时间 \(E\) 的删失假设因 positivity 违背而 ill-posed,本文研究了这一问题的后果,并给出了在 WSC 和 MSM-hazard 两类程序中实现 valid identification 的条件。
- 核心工具/方法:通过离散时间潜在结果框架和计数过程框架,严格推导了 WSC 和 MSM-hazard 程序在 positivity 违背下实际估计的参数(偏差表达式),并提出了 c-values 和 extrapolation curves 作为敏感性分析工具。
- 主要结论:WSC 程序在 CTC 下通常估计的是受限的生存函数;MSM-hazard 程序要正确识别目标 estimand,必须将 \(E\) 包含在基线协变量中且模型设定正确,这本质上是一个外推假设;c-values 提供了一种量化该假设敏感性的实用方法。
关键设定与假设¶
- 关键设定:离散时间,\(K=T\)。个体 i.i.d.。数据按时间顺序 \((L_k, C_{k-1}, A_k, Y_k)\) 生成。\(Y_k\) 和 \(C_{k-1}\) 是吸收状态。
- 关键假设:
- ex(e, k), con(e, k), pos(e, k):标准的序贯可交换性、一致性和 positivity 假设,条件于 \(E=e\) 和协变量历史。
- \((\neg ecp)\):上述三个假设在整个 follow-up(包括 post-study period)都成立。本文证明这是 ill-posed 的。
- \((\neg ecp)\):上述三个假设仅在研究期内(\(e+k \le T\))成立。这是本文工作的基础假设。
- HI:Hazard Independence,即 \(h^{a_k}_k(v)\) 不依赖于过去的处理历史 \(a_{k-1}\)。
- \(M(B)^{cs}_{|V}\):模型 \(M(B)\) 对 \(h^{a_k}_k(v)\) 的设定是正确的。
- \(M(B)^{*\text{-}cs}_{|V}\):模型 \(M(B)\) 对伪总体 \(P^*\) 中的 hazard \(h^{*,a_k}_k(v)\) 的设定是正确的。
- 相比已有文献的放宽或强化:本文放宽了 \((\neg ecp)\) 到 \((\neg ecp)\),承认了 post-study period 的 positivity 违背。但强化了 MSM-hazard 程序的识别条件,明确指出需要 \(E \in V\) 且模型正确,这比以往文献中隐含的假设更清晰、更严格。
主要结果¶
- 定理 1 (WSC 偏差):在 \((\neg ecp)\) 下,WSC 程序(如 IPTW Kaplan-Meier)估计的 \(S^{*,\text{km},a_k}_k\) 收敛到 \(\prod_{m=0}^k (1-h^{a_m}_{,m})\),而非目标 \(S^{a_k}_k\)。偏差为 \(\prod_{m=0}^k (1-h^{a_m}_{,m}) - \prod_{m=0}^k (1-h^{a_m}_m)\),除非假设 (8) 成立(即 study 和 post-study 的 hazard 相等)。技术难点:证明的关键在于 Lemma S3 和 Corollary S3,它们揭示了在 \((\neg ecp)\) 下,IPTW 权重只能将 hazard 识别到受限的 \(h^{a_m}_{,m}\),而非完整的 \(h^{a_m}_m\)。
- 定理 2 (MSM-hazard 识别, Proposition 1):在 \((\neg ecp)\) 下,如果 \(M(B)^{*\text{-}cs}_{|V}\) 成立且模型可识别,那么 \(S^{a_k}_k = S^{*,\text{msm},a_k}_k\) 当且仅当 \(M(B)^{cs}_{|V}\) 成立且 \(E \in V\)。直觉:MSM-hazard 程序通过模型外推来填补 post-study 的信息。只有当模型形式正确,并且 \(E\) 被包含在模型中(从而允许模型捕捉到 post-study 的 CTC 效应)时,外推才是正确的。必要条件:\(E \in V\) 是必要的,否则 Lemma S12 证明 \(M(B)^{cs}_{|V}\) 和 \(M(B)^{*\text{-}cs}_{|V}\) 不可能同时成立。
- 定理 3 (c-values 定义与性质):c-values \((c^0_k, c^1_k)\) 是 nullify 一个推断效应所需的最小 post-study 风险变化倍数。它们有闭式解(当对称解存在时),并且可以转化为 additive hazard shift \(\delta^a_k\)。技术难点:证明 c-values 的存在性和唯一性(Proposition S6),以及将其与 additive hazard shift 联系起来(Proposition S7)。
证明路线与技术技巧¶
- 整体路线:
- 建立基础:在离散时间框架下,定义 \((\neg ecp)\) 和 \((\neg ecp)\),并证明 \((\neg ecp)\) 因 positivity 违背而 ill-posed。
- 分析 WSC:利用 IPTW 理论(Lemma S3, Corollary S3),证明在 \((\neg ecp)\) 下,加权后的伪总体 \(P^*\) 中的 hazard 等于受限的 counterfactual hazard \(h^{a_m}_{,m}\),从而推导出 WSC 的偏差。
- 分析 MSM-hazard:引入 person-time law \(P^{pt}\)(Definition S1, Proposition S4),将 MSM-hazard 的估计问题转化为一个标准的回归问题。然后证明,要使该回归的参数 \(\beta^*\) 等于目标参数 \(\beta\),必须满足 \(E \in V\) 且模型正确(Lemma S12, Proposition 1)。
- 提出敏感性分析:基于风险分解,定义 c-values 为 nullify 效应所需的最小 post-study 风险变化倍数,并给出其闭式解和与 additive hazard shift 的等价性。
- 关键跳跃点:最吃功夫的引理是 Lemma S12,它证明了当 \(E \notin V\) 时,\(M(B)^{cs}_{|V}\) 和 \(M(B)^{*\text{-}cs}_{|V}\) 不可能同时成立。这意味着,如果研究者没有将 \(E\) 纳入模型,那么无论模型多么灵活,其估计的 \(\beta^*\) 都不可能等于目标参数 \(\beta\)。这个结论直接挑战了“只要模型足够灵活就能解决问题”的直觉。
- 技术技巧点名:
- IPTW 理论:用于将观测数据分布转换为伪总体分布,从而识别 counterfactual hazard。
- Person-time law:一种将纵向数据转化为独立观测的巧妙技巧,使得 MSM-hazard 的估计问题可以简化为一个标准的 pooled logistic regression 问题,从而可以应用经典的 M-estimation 理论。
- 风险分解:将总风险分解为 study period 和 post-study period 两部分,这是定义 c-values 的基础。
- 凸优化:c-values 被定义为最小化一个凸惩罚函数(平方对数乘积)的解,保证了其存在性和唯一性。
真实例子与应用¶
- 案例 1:Zidovudine 对 HIV 阳性男性生存的影响(基于 Hernán et al., 2000)。
- 数据/场景:模拟数据,设定 \(K=T=15\)。设计了六个场景,区分了有无 CTC、\(E\) 的分布是否均匀、以及是否观测到 post-study 数据。
- 方法应用:比较了三种程序:1) 包含 \(E\) 的 MSM-hazard(\(\hat{S}^{*,\text{msm}}_k\)),2) 不包含 \(E\) 的 MSM-hazard(\(\hat{S}^{*,\text{msm-we}}_k\)),3) WSC Kaplan-Meier(\(\hat{S}^{*,\text{km}}_k\))。
- 结果:当 CTC 存在且 \(E\) 被正确包含在模型中时(Scenario A),\(\hat{S}^{*,\text{msm}}_k\) 能正确估计 \(S_k\)。当 \(E\) 被排除时(Scenario A),\(\hat{S}^{*,\text{msm-we}}_k\) 和 \(\hat{S}^{*,\text{km}}_k\) 都低估了 \(S_k\)。当模型设定错误时(Scenario B),所有程序都失败。当 \(E\) 的分布严重左偏时(Scenario C),由于大部分个体在 study period 内已完成随访,偏差很小。
- 说明的问题:验证了理论结果,展示了 \(E\) 在模型中的重要性,以及模型设定错误和 \(E\) 分布对偏差的影响。
- 案例 2:mRNA 疫苗对接受免疫检查点抑制剂患者的效果(基于 Grippin et al., 2025)。
- 数据/场景:真实数据,目标试验模拟。\(K=44\),\(T=44\),\(E\) 的范围是 0 到 21。
- 方法应用:估计了加权 Kaplan-Meier 曲线 \(\hat{S}^{*,\text{km},a}_k\),并计算了 c-values 和 extrapolation curves。
- 结果:对于 \(k>23\),\(\hat{S}^{*,\text{km},a}_k\) 的估计需要外推假设。c-values 显示,要 nullify 疫苗的保护效应,需要 post-study 风险在疫苗组增加约 0.95(\(k=27\))到 0.02(\(k=44\))倍(additive scale),在对照组减少约 0.04 倍。作者讨论了两种临床情景,认为这些变化在科学上可能是不合理的,从而支持了疫苗的保护效应。
- 说明的问题:展示了 c-values 在实际数据分析中的应用,如何帮助研究者评估其结论对不可检验假设的敏感性。
🔎 结论是否比证明窄¶
- 窄结论:Proposition 1 的证明依赖于“无完美抵消”条件(pci 和 pcii)。作者在正文中承认了这一点,但未深入讨论这些条件在实践中的普遍性。值得研究者去查的问题:这些“完美抵消”条件在什么情况下可能成立?它们是否可以被视为一种“病理学”情况,还是在实际数据中可能发生?
- 泛泛 claim:作者在讨论中声称“We believe these results will help applied researchers understand and structure their causal analyses.” 这是一个泛泛的 claim,但论文本身提供了具体的理论指导和实用工具,因此这个 claim 是合理的。
四、开放问题¶
- 刻画偏差的 sharp bound:本文在 Corollary S5 中给出了 MSM-hazard 程序在模型设定错误时的偏差 bounds,但这些 bounds 依赖于对 post-study hazard 的上下界假设。扎根于 Corollary S5 和 Proposition 1 的证明。一个开放问题是:能否在更弱的假设下(如单调性、形状约束)得到更紧的、甚至 sharp 的 bounds?这直接关联到研究者熟悉的 nonparametric statistics 和 minimax bounds 工具。
- c-values 的推广:本文的 c-values 是针对 MSM-hazard 程序定义的,并假设了 HI。扎根于 Section 4。一个开放问题是:如何将 c-values 推广到更一般的设定,如时变处理、非比例风险模型、或使用 g-computation 的程序?这需要重新定义“nullify the effect”的标准。
- 连续时间框架下的严格理论:本文的连续时间结果(Proposition S3)依赖于一些正则性条件。扎根于 Appendix B.4 和 C.1.3。一个开放问题是:能否在更一般的连续时间计数过程框架下,建立与离散时间类似的、关于 WSC 和 MSM-hazard 程序偏差的严格理论?这可能需要更精细的 empirical process 工具。
- 与 g-estimation 的对比:作者指出 Robins 的 g-estimation 可以“adequately adjust for \(E\)”,但未深入讨论。扎根于 Introduction 第一段。一个开放问题是:g-estimation 是否真的能避免本文提出的 positivity 问题?如果可以,其代价是什么(如更强的模型假设、计算复杂性)?如果不能,它是否也隐含了类似的外推假设?这是一个值得研究者去查的、可能揭示不同方法间深层联系的问题。
Maintained by 陈星宇 · Homepage · Source on GitHub