Estimating Pathway Treatment Effects in the Presence of Intermediate Events with Multi-State Data¶
作者: Yuhao Deng, Haoyu Wei, Donglin Zeng, Rui Song, Xiao-Hua Zhou
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.22608
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:在存在中间事件(如疾病进展)的生存数据(多状态数据)中,如何估计治疗沿着不同路径对主要终点(如死亡)的因果效应。这是一个将因果推断中的路径效应(path-specific effects)识别与多状态生存模型(multi-state models) 相结合的子方向。其根本挑战在于,中间事件既是治疗后的变量,又会影响后续事件的发生,从而成为“治疗诱导的混杂因素”(treatment-induced confounding),这使得传统的中介分析框架(如自然效应、可分离效应)的识别假设失效。当前该方向正处于从“处理单一中间事件”向“处理多个相互作用的中间事件”过渡的阶段,且对统计效率和稳健性的理论需求日益增长。
发展脉络(history)¶
根据作者的引言和参考文献,该方向的发展脉络可梳理如下:
-
奠基工作:多状态模型与竞争风险模型
- Prentice et al. (1978), Fine & Gray (1999), Andersen & Keiding (2002), Putter et al. (2007):建立了多状态模型和竞争风险模型的基本框架,定义了状态、转移、累积发生率函数(CIF)等核心概念,并提供了基于转移风险的估计方法。这些工作为后续的因果推断提供了数据建模基础。
-
主要进展:将中介分析框架引入生存数据
- 自然效应(Natural Effects):Huang (2021), Weir et al. (2022), Martinussen & Stensrud (2023), Deng et al. (2024), Breum et al. (2024) 尝试将传统中介分析中的“自然直接/间接效应”扩展到半竞争风险数据。作者指出,这些框架“only considered at most one type of intermediate event”,并且当存在多个相互竞争的中间事件时,由于“sequential ignorability”假设被违反,自然效应不可识别。
- 可分离效应(Separable Effects):Stensrud et al. (2021, 2022), Robins et al. (2022) 提出了一个替代框架,假设原始治疗可以被分解为多个成分,每个成分只直接影响一个事件。作者认为,可分离效应“are not informative about the effect through each transition pathway”,且在实际试验中很难找到生物学上有意义的、具有孤立效应的治疗成分。
-
当前 Frontier:随机干预效应(Randomized Interventional Effects)
- VanderWeele & Tchetgen Tchetgen (2017), Vansteelandt & Daniel (2017), Lin & VanderWeele (2017), Díaz & Hejazi (2020), Hejazi et al. (2022), Valeri et al. (2023):提出了“随机干预效应”框架,用于纵向研究中的中介分析。该框架的核心思想是,通过设想一个“随机干预”来设定中间变量的分布,从而避免“交叉世界”(cross-world)假设。作者将此框架视为解决多状态数据路径效应问题的关键工具。
- 本文的位置:作者将上述随机干预效应框架首次系统性地推广到多状态生存数据。他们定义了在转移风险层面进行顺序随机干预的机制,并推导了反事实累积发生率(CIF)的有效影响函数(EIF),从而构建了半参数有效且多重稳健的估计量。这填补了“统计上高效且稳健的估计方法”的空白。
子线索聚类¶
被引文献大致落在以下三条子线索上:
- 线索一:多状态生存数据建模:关注如何用数学模型(如转移风险、Kolmogorov 前向方程)描述和估计事件随时间演化的过程。代表工作:Prentice et al. (1978), Fine & Gray (1999), Andersen & Keiding (2002), Putter et al. (2007), Zeng & Lin (2007)。
- 线索二:因果中介分析的识别与估计:关注在何种假设下,可以识别和估计治疗通过中间变量对结局的间接效应。代表工作:自然效应(Huang 2021, Martinussen & Stensrud 2023)、可分离效应(Stensrud et al. 2021, Robins et al. 2022)、随机干预效应(VanderWeele & Tchetgen Tchetgen 2017, Díaz & Hejazi 2020)。
- 线索三:半参数效率理论与稳健估计:关注如何利用有效影响函数(EIF)构建渐近有效且对模型误设稳健的估计量。代表工作:Bickel et al. (1993), Hines et al. (2022), Kennedy (2024)。
这个方向在追问的核心问题¶
- 识别问题:在存在治疗诱导的、未观测的混杂因素时,如何定义和识别沿着特定转移路径的因果效应?传统假设(如序贯可忽略性)在多状态数据中几乎必然被违反。
- 估计问题:如何从观测数据中高效且稳健地估计这些路径效应?简单的“plug-in”估计量(先估计转移风险,再代入公式)效率低且对模型误设敏感。
- 推断问题:如何对路径效应进行假设检验,以确定治疗是否通过特定路径发挥作用?
- 解释问题:定义的因果效应(如随机干预效应)是否具有实际意义?能否指导临床决策?
⚠️ 作者的 framing¶
- 作者如何 frame 缺口:作者将缺口 frame 为“现有中介框架(自然效应、可分离效应)在处理多状态数据时,要么识别假设不成立,要么定义不清晰或难以解释”。因此,他们的工作——将随机干预效应推广到多状态数据——成为了“显然的下一步”。他们强调,随机干预效应“does not require cross-world assumptions”且“remains valid in a hypothetical sense by marginalizing over [unmeasured confounders]”,从而绕开了其他框架的核心难题。
- 被淡化或回避的竞争路线:作者明确指出了可分离效应的局限性(难以找到有意义的治疗成分,且不提供路径信息)。对于自然效应,他们仅指出其在多状态数据下不可识别,但未深入讨论在某些特定结构(如无治疗诱导混杂)下,自然效应是否仍可作为有意义的基准。
- 值得研究者去查的问题:作者在引言中引用了 Deng et al. (2026) 和 Vo et al. (2026) 来支持随机干预效应在处理未观测混杂时的有效性。但这两篇文献本身可能也处于发展初期。一个值得查证的问题是:是否存在其他处理治疗诱导混杂的因果框架(如基于“阴性对照”的 Proximal Causal Inference)被本文完全忽略? 如果有,它们与本文的随机干预框架在假设和解释上有什么根本差异?
张力¶
未见明显对立引用。文献脉络呈现清晰的递进关系:从建模到因果识别,再到高效估计。不同框架(自然效应 vs. 可分离效应 vs. 随机干预效应)之间的差异被作者清晰地表述为“适用场景和假设强度”的不同,而非根本性矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
A:治疗分配变量(A=1治疗组,A=0对照组)。W:基线协变量向量(如年龄、性别)。G:状态集合,包括初始状态(O)、中间状态(如E,M)和终末状态(如D)。E:转移集合,即(k, g)表示从状态k到状态g的一步转移。X(t):在时间t时的观测状态。X^a(t):在干预水平a下的反事实状态过程。a是一个向量,其分量a_kg指定了对转移(k,g)的干预水平(1表示采用治疗下的风险,0表示采用对照下的风险)。T^a_j:在干预a下,首次到达状态j的反事实时间。F^a_j(t):反事实累积发生率函数(CIF),即P(T^a_j ≤ t)。这是核心的因果 estimand。dΛ^a_kg(t|W, X^a(t)):在干预a下,给定历史和协变量,从状态k到g的反事实转移风险。q:一条从初始状态到目标状态的路径,如q = (O, E, D)。Q_j:所有从初始状态到状态j的路径集合。N_k(t):观测到的、指示状态k是否在时间t前被访问的计数过程。Y_k(t):观测到的、指示个体在时间t是否处于状态k的风险过程。M_kg(t):与转移(k,g)相关的鞅过程。
-
模型:
- 数据生成机制由多状态模型描述。个体从初始状态
O开始,根据转移风险dΛ_kg(t|W, X(t))在不同状态间转移,最终可能进入终末状态D或被删失c。转移风险可以依赖于基线协变量W和当前的状态历史X(t)。 - 因果模型假设存在一个反事实世界,其中我们可以对每个转移风险施加一个“随机干预”,将其设定为治疗组或对照组下的风险水平。这个干预是“随机”的,因为它通过从特定分布中随机抽取计数过程来实现,从而边缘化掉任何未观测的治疗诱导混杂。
- 估计模型采用半参数方法,例如用 Cox 比例风险模型来建模转移风险
dΛ_kg(t|W, X(t)),用逻辑回归建模倾向得分P(A=1|W)。
- 数据生成机制由多状态模型描述。个体从初始状态
-
可观测数据:
- 研究者观测到
n个独立同分布的个体O_i = (A_i, W_i, X_i(t*)),其中t*是研究结束时间。 - 轨迹
X_i(t*)可以等价地表示为(T_k, Δ_k : k ∈ G),其中T_k是首次访问状态k的时间(如果被访问),Δ_k是指示是否访问的示性变量。 - 关键区分:研究者可以观测到状态转移的时间和转移到的状态,但无法观测到驱动这些转移的潜在机制(如未观测的混杂因素
L(t))。因果推断的目标就是仅从这些可观测数据中,识别出在特定随机干预a下的反事实 CIFF^a_j(t)。
- 研究者观测到
第二步:讲最小内核——以“疾病-死亡(Illness-Death)模型”为例¶
本文的一般设定可以退化到经典的疾病-死亡(I-D)模型,这是理解其核心思想的最简特例。
-
特例设定:
- 状态:
O(初始健康),I(疾病),D(死亡)。 - 转移:
(O, I),(O, D),(I, D)。 - 干预向量:
a = (a_OI, a_OD, a_ID)。 - 目标:估计治疗对死亡
D的路径效应。
- 状态:
-
核心思路:
- 定义干预:我们设想一个反事实世界,其中我们可以独立地“设定”每个转移的风险。例如,我们可以让
(O, I)转移的风险与治疗组相同(a_OI = 1),但同时让(O, D)和(I, D)转移的风险与对照组相同(a_OD = 0, a_ID = 0)。这个干预向量记为a = (1, 0, 0)。 - 定义效应:
- 总效应:
τ_D(t) = F^1_D(t) - F^0_D(t),其中1 = (1,1,1),0 = (0,0,0)。 - 直接效应(通过
O→D):比较a = (0, 1, 0)和a = (0, 0, 0)下的 CIF 差异。这衡量了治疗对“不经过疾病直接死亡”这条路径的影响。 - 间接效应(通过
O→I→D):比较a = (1, 0, 1)和a = (0, 0, 0)下的 CIF 差异。这衡量了治疗通过影响疾病发生,进而影响死亡这条路径的总效应。 - 路径分解:总效应可以分解为
τ_D(t) = [F^(0,1,1)_D(t) - F^0_D(t)] + [F^1_D(t) - F^(0,1,1)_D(t)]。第一项是“直接死亡效应”,第二项是“通过疾病的间接效应”。进一步地,直接死亡效应还可以分解为“初始状态直接死亡”和“患病后死亡”两个子路径。
- 总效应:
- 定义干预:我们设想一个反事实世界,其中我们可以独立地“设定”每个转移的风险。例如,我们可以让
-
为什么这个特例能体现核心数学困难?
- 识别:在 I-D 模型中,
F^a_D(t)的识别公式(Theorem 1)退化为一个三重积分,涉及三个转移风险。核心困难在于,即使我们正确地估计了每个转移风险,简单的“plug-in”估计量也是低效的,因为它在估计过程中没有利用个体层面的信息来纠正偏差。 - EIF 的作用:本文的核心贡献是推导了
F^a_D(t)的 EIF。在 I-D 模型中,这个 EIF 会包含一个“debiasing term”,该 term 通过加权后的鞅过程,将每个观测个体的实际转移时间与模型预测的风险进行比较,从而修正 plug-in 估计量的偏差。这个修正项正是实现“多重稳健性”和“半参数有效性”的关键。 - 结论:本文的一般理论,本质上就是将 I-D 模型中的 EIF 推导和估计方法,推广到具有任意多个状态和复杂路径的通用多状态图上。其核心数学思想是:通过 EIF 对路径积分进行一阶泰勒展开,得到一个可以分解为各转移风险 EIF 线性组合的表达式,从而将复杂的多状态估计问题,转化为一系列相对简单的、针对单个转移的估计问题。
- 识别:在 I-D 模型中,
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在存在多个相互作用的中间事件(如 EMACE 和 MVE)的多状态生存数据中,如何定义、识别和估计治疗沿着每条特定转移路径对终末事件(如死亡)的因果效应。
- 核心工具 / 方法:将“随机干预效应”框架系统性地推广到多状态数据,通过设想对每个转移风险进行顺序随机干预来定义路径效应;并基于半参数理论,推导了反事实累积发生率(CIF)的有效影响函数(EIF),以此构建了一个多重稳健且半参数有效的一步估计量(one-step estimator)。
- 主要结论:在标准因果假设(可忽略性、随机删失、一致性、正性)和扩展马尔可夫性下,反事实 CIF 是可识别的。所提出的 EIF 估计量具有多重稳健性(只要每个路径上的转移风险模型或倾向得分/删失模型之一正确指定,即一致)和半参数有效性(渐近方差达到效率界)。在 LEADER 试验数据中,该方法发现利拉鲁肽对死亡的降低效应主要通过“初始状态→EMACE→死亡”和“初始状态→EMACE→MVE→死亡”这两条路径介导。
关键设定与假设¶
- 核心记号:已在第二节交代。
- 关键假设:
- 可忽略性(Ignorability, Assumption 1):
A ⊥⊥ X^a(t*) | W。即治疗分配在给定基线协变量W下与潜在结果独立。这排除了基线混杂,但不排除治疗诱导的混杂。 - 随机删失(Random Censoring, Assumption 2):删失时间独立于潜在结果,给定历史和当前治疗分配。
- 正性(Positivity, Assumption 3):治疗概率和未删失概率在给定条件下都为正。
- 一致性(Consistency, Assumption 4):观测到的结果等于在观测到的治疗分配下的潜在结果。
- 扩展马尔可夫性(Extended Markovness, Assumption 5):转移风险只依赖于当前状态和无序的状态历史(即哪些事件发生过),而不依赖于事件发生的精确时间顺序。这是一个关键的工作假设,它简化了模型,使得估计可行。作者指出该假设是可检验的,并可以通过建模逗留时间(sojourn times)来放松。
- 可忽略性(Ignorability, Assumption 1):
- 相比已有文献的强化/放宽:
- 相比自然效应:放宽了“序贯可忽略性”(sequential ignorability)这一交叉世界假设。随机干预效应不需要这个假设。
- 相比可分离效应:放宽了“治疗成分可分离”这一在实际中难以满足的假设。随机干预效应直接作用于转移,而不是寻找有生物学意义的治疗成分。
- 相比标准多状态模型:强化了因果推断的假设(可忽略性、一致性),但放宽了对模型形式的要求(通过 EIF 实现多重稳健性)。
主要结果¶
- Theorem 1 (Identifiability):在假设 1-4 下,反事实 CIF
F^a_j(t)可以通过观测数据的转移风险和基线协变量分布来识别。识别公式是一个路径积分,将每个转移的风险密度和生存概率相乘并积分。 - Lemma 1 (Efficient Influence Function):在假设 1-5 下,推导了
F^a_j(t)的 EIF。这个 EIF 由三部分组成:F^a_j(t|W) - F^a_j(t)(协变量分布的影响)和一个复杂的 debiasing termφ^a_j(t; O)。这个 debiasing term 是关键,它通过加权后的鞅过程η来修正模型误设带来的偏差。 - Theorem 2 (Multiple Robustness):EIF 估计量
˜F^a_j(t)是多重稳健的。对于每条路径q,只要满足以下条件之一,估计量就是一致的:- 路径
q上所有转移的风险模型都正确指定。 - 倾向得分和删失模型正确指定,且路径
q上除一个转移外的所有转移风险模型都正确指定。 - 直觉:这比标准的双重稳健(doubly robust)更强。它意味着即使多个模型都错了,只要错误模式满足特定条件,估计量仍然一致。
- 路径
- Theorem 3 (Semiparametric Efficiency):在正则性条件下(模型是 Donsker 类,收敛速度足够快),EIF 估计量
˜F^a_j(t)是渐近正态的,且其渐近方差达到了半参数效率界。这意味着在所有正则渐近线性估计量中,它的渐近方差最小。 - Corollary 1 & 2 (Inference):基于 EIF 的线性性,可以直接构造治疗效应
τ_j(t; a, a*)的置信区间和假设检验(基于限制平均生存时间损失 RMSTL)。
证明路线与技术技巧¶
-
整体路线:
- 识别:首先在假设 1-4 下,证明反事实转移风险等于观测到的条件风险,从而将反事实 CIF 表达为观测转移风险的函数(Theorem 1)。
- EIF 推导:在扩展马尔可夫性(Assumption 5)下,将观测数据的似然分解为正交的切线空间(协变量空间和每个转移的鞅空间)。然后,通过“链式法则”对识别公式进行路径wise 的变分,将
F^a_j(t)的 EIF 表达为各转移风险 EIF 的线性组合(Lemma 1)。这个推导过程是技术核心,它利用了鞅的正交性和多状态模型中“同一时间只有一个转移发生”的特性。 - 估计量构建:用半参数模型(如 Cox 模型)拟合转移风险和倾向得分,然后将其代入 EIF 公式,得到“plug-in”估计量
ˆF^a_j(t)和“debiasing”项ˆφ^a_j(t; O)。最终的一步估计量为˜F^a_j(t) = P_n[ˆF^a_j(t|W) + ˆφ^a_j(t; O)]。 - 渐近理论:将
√n(˜F^a_j(t) - F^a_j(t))分解为三部分:经验过程项、Donsker 条件导致的剩余项、以及偏差项。通过证明偏差项是o_p(n^{-1/2})(利用 Cauchy-Schwarz 不等式和 Lipschitz 性质,将偏差项 bound 为模型估计误差的乘积),最终得到渐近正态性和有效性(Theorem 3)。多重稳健性(Theorem 2)的证明则通过分析不同模型误设组合下,偏差项是否为零来论证。
-
关键跳跃点:
- EIF 的显式表达式:推导出
η函数(公式 8)是第一个关键跳跃。这个函数将复杂的路径积分与单个观测的鞅过程联系起来,是构建可行估计量的基础。 - 偏差项的控制:证明
√n P{ψ(ˆP) - ψ(P)} = o_p(1)是第二个关键跳跃。这需要巧妙地利用 EIF 的结构,将偏差项分解为一系列乘积项,并证明在正则性条件下,这些乘积项以o_p(n^{-1/2})的速度收敛。
- EIF 的显式表达式:推导出
-
技术技巧点名:
- Efficient Influence Function (EIF):核心工具,用于构建半参数有效和多重稳健的估计量。
- Martingale Theory:用于刻画计数过程的随机波动,是 EIF 推导和偏差分析的基础。
- Kolmogorov Forward Equation:用于将转移风险积分得到 CIF。
- Chain Rule (Pathwise Differentiability):用于对复杂的路径积分 estimand 求导,以得到其 EIF。
- Donsker Class & Empirical Process Theory:用于证明一步估计量的渐近性质,确保模型估计的误差不会主导渐近分布。
- Cauchy-Schwarz Inequality & Lipschitz Property:用于 bound 偏差项,证明其可忽略性。
真实例子与应用¶
- 数据:LEADER 试验数据,包含 9340 名 2 型糖尿病患者,随机接受利拉鲁肽或安慰剂。主要终点是死亡,中间事件是 EMACE(扩展主要不良心血管事件)和 MVE(微血管事件)。
- 方法应用:
- 建模:为每个治疗组拟合了四个 Cox 模型,分别对应非致命性 EMACE、MVE、直接心血管死亡和其他原因死亡。模型以基线协变量和事件发生状态作为时变协变量。
- 效应估计:
- 事件特异性效应:通过干预进入某个事件的所有转移,估计治疗对该事件的直接效应。发现利拉鲁肽对 EMACE 和 MVE 有显著直接效应,对非心血管死亡无显著直接效应。
- 转移特异性效应:通过干预单个转移,估计治疗对该转移的效应。发现利拉鲁肽对
O→E转移有显著效应。 - 路径特异性效应:通过干预路径上的所有转移,估计治疗沿该路径的效应。发现
O→E→D和O→E→M→D两条路径的效应显著,表明利拉鲁肽主要通过降低 EMACE 风险来降低死亡率。
- 敏感性分析:通过引入共享脆弱性(frailty)模型来检验未观测混杂的影响。结果与主分析一致,且脆弱性方差很小,表明未观测混杂的影响很弱。
- 结果:该方法提供了比传统 Kaplan-Meier 和 Cox 回归更细致的因果机制见解,揭示了利拉鲁肽降低死亡率的主要路径。
- 例子想说明什么:验证了所提出方法在真实复杂数据中的可行性和实用性,并展示了其相较于传统生存分析方法的优势——能够回答“治疗如何起作用”这一更深层次的问题。
🔎 结论是否比证明窄¶
- 是。Theorem 3 的证明依赖于 Assumption 5(扩展马尔可夫性)和一系列正则性条件(Supplementary Material A),这些条件要求模型是 Donsker 类且收敛速度足够快。然而,在论文的讨论和结论部分,作者有时会以更泛化的语气谈论该方法的“高效性”和“稳健性”。例如,在摘要中声称“construct multiply robust and semiparametrically efficient estimators”,这个结论严格来说是在 Assumption 5 下成立的。如果 Assumption 5 不成立,EIF 的形式会改变(见 Supplementary E.5),且需要估计点风险(pointwise hazard),这会大大降低效率。因此,“半参数有效”这个结论的适用范围被 Assumption 5 所限制。作者在正文中承认了这一点,但读者需要留意这个 gap。
四、开放问题¶
-
放松扩展马尔可夫性:本文的 EIF 推导和高效估计依赖于 Assumption 5(扩展马尔可夫性)。作者在 Supplementary E.5 中给出了没有该假设下的 EIF,但指出其需要估计点风险,效率更低。一个开放问题是:能否在放松或完全不依赖扩展马尔可夫性的情况下,构建一个仍然半参数有效且计算可行的估计量?(扎根于 Lemma 1 和 Supplementary E.5 的对比)。
-
处理时变混杂:作者在讨论中提到,当存在时变协变量时,可以考虑“条件于时变协变量”的随机干预。但这需要建模时变协变量的强度。一个开放问题是:如何将本文的框架与处理时变混杂的方法(如 g-computation、IPW、DML)结合,以定义和估计在时变混杂下的路径效应?(扎根于 Section 5 第一段)。
-
非参数工作模型:本文使用了半参数 Cox 模型。作者在讨论中提到,可以使用非参数工作模型(如核平滑)来估计风险,从而避免 Assumption 5。一个开放问题是:当使用非参数模型时,EIF 估计量的收敛速度会如何变化?能否达到 minimax 最优?(扎根于 Section 5 最后一段)。
-
与 Proximal Causal Inference 的联系:本文的随机干预框架通过边缘化未观测混杂来保持定义的有效性。这与 Proximal Causal Inference 中利用“阴性对照”变量来识别因果效应的思路有异曲同工之处。一个值得探索的问题是:能否将本文的路径效应框架与 Proximal Causal Inference 结合,在存在未观测混杂的情况下,利用辅助变量(如阴性对照暴露/结局)来识别更细粒度的路径效应?(这是一个基于研究者兴趣和领域张力的开放问题,并非直接来自本文)。
Maintained by 陈星宇 · Homepage · Source on GitHub