跳转至

Estimating Pathway Treatment Effects in the Presence of Intermediate Events with Multi-State Data

作者: Yuhao Deng, Haoyu Wei, Donglin Zeng, Rui Song, Xiao-Hua Zhou
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.22608


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是:在存在中间事件(如疾病进展)的生存数据(多状态数据)中,如何定义、识别和估计路径特异性处理效应(pathway treatment effects)。其根本的统计/科学问题是:当处理(药物)可以通过多条路径(例如,直接导致死亡,或先引发中间事件再导致死亡)影响最终终点时,如何将总效应分解为沿每条路径的贡献,并给出可靠的推断。当前该方向的成熟度处于方法快速发展但核心假设争议较大的阶段:已有框架(自然效应、可分离效应)在简单设定下可行,但在存在多个中间事件和治疗诱导混杂时,其识别假设要么不成立,要么难以解释。

发展脉络(history)

根据论文引言和参考文献,该方向的发展脉络可梳理如下:

  1. 奠基工作:多状态模型与竞争/半竞争风险

    • Putter et al. (2007) 等提供了多状态模型的教程性框架,将中间事件和终点视为不同状态,用转移风险(transition hazards)刻画疾病进程。这是本文的建模基础。
    • Fine & Gray (1999) 提出了竞争风险下的子分布风险模型,为处理存在竞争事件时的累积发生率估计提供了标准工具。这是早期处理单一中间事件的基石。
  2. 主要进展:因果中介分析框架引入生存数据

    • 自然效应(Natural Effects)框架:Huang (2021)、Deng et al. (2024) 等尝试将传统中介分析中的“自然直接/间接效应”推广到半竞争风险数据。作者指出,这些框架“only considered at most one type of intermediate event”,且当存在多个中间事件时,序贯可忽略性(sequential ignorability) 假设因治疗诱导混杂而失效(Shpitser & Tchetgen Tchetgen 2016, Miles et al. 2020)。
    • 可分离效应(Separable Effects)框架:Stensrud et al. (2021, 2022)、Robins et al. (2022) 提出将原始处理分解为多个“成分”,每个成分只直接影响一个事件。作者认为,该框架“are not informative about the effect through each transition pathway”,且在实际试验中难以识别有生物学意义的、效应孤立的处理成分。
  3. 当前 Frontier:随机干预效应(Randomized Interventional Effects)

    • VanderWeele & Tchetgen Tchetgen (2017)、Vansteelandt & Daniel (2017)、Díaz & Hejazi (2020) 等提出了针对纵向数据中介分析的“随机干预效应”框架。该框架通过设想对中介变量进行随机干预(而非设定为自然值)来定义效应,从而避免了对“交叉世界”独立性的依赖。
    • 本文的位置:作者将随机干预效应框架系统性地扩展到多状态数据。这是该框架在生存分析中的一个自然但非平凡的推广。本文的核心贡献在于:① 严格定义了多状态数据下的序贯随机干预;② 推导了反事实累积发生率的有效影响函数(EIF);③ 构造了多重稳健且半参数有效的估计量;④ 在LEADER试验中展示了其应用价值。

子线索聚类

这些被引文献大致落在以下三条子线索上:

  • 线索一:多状态模型与生存分析(Putter et al. 2007, Fine & Gray 1999, Andersen & Keiding 2002)。这一簇关注如何用转移风险建模疾病进程,并估计累积发生率。本文继承了其建模语言,但目标是因果推断。
  • 线索二:因果中介分析(自然效应与可分离效应)(Huang 2021, Deng et al. 2024, Stensrud et al. 2021, 2022)。这一簇试图在生存数据中定义直接和间接效应,但受限于强假设。本文的定位是替代这些框架,以规避其假设问题。
  • 线索三:随机干预效应(VanderWeele & Tchetgen Tchetgen 2017, Díaz & Hejazi 2020, Lin & VanderWeele 2017)。这一簇提供了一种更稳健的效应定义方式,不依赖交叉世界假设。本文是这一簇在多状态数据上的首次系统应用和理论深化。

这个方向在追问的核心问题

  1. 如何定义“路径效应”? 在多状态数据中,路径是复杂的(如 O→E→D 和 O→E→M→D),如何给出一个既在因果上可解释、又在数学上可识别的定义?
  2. 如何应对治疗诱导混杂? 中间事件既是处理的结果,又是后续终点的混杂,这违反了标准中介分析的核心假设。如何在不依赖不可检验的假设下进行推断?
  3. 如何实现高效且稳健的估计? 简单的plug-in估计量(如基于Kolmogorov forward equation)是模型依赖且低效的。如何构造一个对模型误设不敏感、且能达到半参数效率界的估计量?
  4. 如何检验路径效应? 除了点估计,如何对“某条路径是否存在处理效应”进行假设检验?

⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)

  • 作者把缺口 frame 成什么? 作者将现有框架(自然效应、可分离效应)的缺口 frame 为:在处理多个中间事件和治疗诱导混杂时,其识别假设“cannot be satisfied”或“hard to identify”。因此,本文提出的随机干预效应框架是“显然的下一步”,因为它“remains valid in a hypothetical sense by marginalizing over them [unmeasured confounders]”,且“does not require cross-world assumptions”。
  • 哪些竞争路线被他淡化或回避了? 作者在讨论中承认“separable effects place the targets of treatment components on events rather than transitions”,并指出“Identifying clinically meaningful treatment components with isolated effects is not always feasible”。这实际上淡化了可分离效应框架在解释性上的潜在优势。作者也回避了动态处理策略(dynamic treatment regimes) 这一竞争路线,仅在补充材料中作为“under sequential ignorability”的延伸讨论。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 作者引用了大量随机干预效应的工作,但没有引用关于工具变量(IV) 或近端因果推断(Proximal Causal Inference) 在类似设定下的工作。这些方法也可能处理未观测混杂,但作者完全未提及。这是一个值得研究者去查的问题:IV/近端方法能否作为替代方案?作者回避它们是因为假设不同(如需要排他性约束),还是因为技术不成熟?

张力

未见明显对立引用。所有被引工作基本是在不同假设下解决同一问题,作者通过指出其假设的局限性来为自己的方法开辟空间,而非直接矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • A:处理变量(0=对照,1=处理)。这是随机变量。
    • W:基线协变量向量。这是随机变量。
    • G:状态集合,包括初始状态(O)、中间状态(如E, M)、终末状态(如D)。这是集合。
    • E:转移集合,即所有可能的一步转移 (k,g)。这是集合。
    • a = (a_kg : (k,g) ∈ E):干预水平向量。a_kg = 1 表示对转移 (k,g) 施加处理水平的风险,a_kg = 0 表示施加对照水平的风险。这是参数/干预设定。
    • X^a(t):在干预 a 下,个体在时间 t 所处的潜在状态。这是潜在随机变量。
    • T^a_j:在干预 a 下,首次到达状态 j 的潜在时间。这是潜在随机变量。
    • F^a_j(t) = P(T^a_j ≤ t):反事实累积发生率,即干预 a 下,在时间 t 前到达状态 j 的概率。这是目标 estimand。
    • Λ^a_kg(t|W, X^a(t-)):潜在转移风险,即在干预 a 下,给定历史和当前状态 k,在 t 时刻转移到 g 的瞬时风险。这是模型参数。
    • N_k(t):观测到的状态 k 的计数过程(是否在 t 前发生过)。这是可观测随机变量。
    • Y_k(t):观测到的状态 k 的风险过程(是否在 t 时刻处于风险中)。这是可观测随机变量。
    • T_c:删失时间。这是可观测随机变量。
    • n:样本量。这是标量。
  • 模型:

    • 数据生成机制:每个个体从初始状态 O 开始,根据其处理 A 和基线协变量 W,以及当前状态历史,从一个多状态模型中随机生成一条事件轨迹。该模型由一组转移风险函数 Λ^A_kg(t|W, X(t-)) 完全刻画。这些风险函数可以是半参数模型(如Cox比例风险模型)。
    • 因果模型:存在一个潜在结果框架。对于每个可能的干预向量 a,存在一个潜在轨迹 X^a(t)。观测到的轨迹是 X^A(t)(一致性假设)。
    • 关键假设:可忽略性(A ⊥⊥ X^a(t*) | W)和随机删失(N^a_c(t) ⊥⊥ X^a(t+dt) | W, X^a(t-), A=a)。
  • 可观测数据:

    • 研究者实际能观测到的是 n 个独立同分布的样本 O_i = (A_i, W_i, X_i(t*))。
    • 轨迹 X_i(t*) 等价于观测到的事件时间 T_{i,k} 和事件指示符 Δ_{i,k}(对于每个状态 k)。
    • 想要但观测不到的是:在不同干预 a 下的潜在轨迹 X^a_i(t*),以及治疗诱导混杂(如随时间变化的潜在风险因素 L^a(t))。这些只能通过假设(如可忽略性)和模型来识别。

第二步:讲最小内核——疾病-死亡(Illness-Death)模型

为了理解本文的核心思路,我们考虑最简单的多状态模型:疾病-死亡(I-D)模型。该模型只有三个状态:初始健康(O)、生病(I)、死亡(D)。转移只有三条:O→I, O→D, I→D。这是一个经典的半竞争风险模型。

  • 干预向量:a = (a_OI, a_OD, a_ID)。
  • 目标:估计处理对死亡(D)的总效应,并将其分解为直接效应(通过 O→D)和间接效应(通过 O→I→D)。

核心思路:作者不试图“阻止”中间事件(生病)发生,而是设想一个假设世界,在这个世界里,我们人为地控制每个转移的风险水平。

  1. 定义总效应:τ_D(t) = F^1_D(t) - F^0_D(t),其中 1 = (1,1,1) 表示所有转移都施加处理水平,0 = (0,0,0) 表示所有转移都施加对照水平。

  2. 定义直接效应:我们想看看,如果只改变“直接死亡”的风险(O→D),而让“生病”的风险(O→I)和“生病后死亡”的风险(I→D)都保持在对照水平,会发生什么。这对应干预向量 a_direct = (0, 1, 0)。那么,直接效应就是: τ_direct(t) = F^(0,1,0)_D(t) - F^0_D(t)。 这个效应衡量的是,仅仅因为处理改变了“从健康直接到死亡”的风险,所导致的死亡概率变化。

  3. 定义间接效应:总效应减去直接效应,就是间接效应: τ_indirect(t) = τ_D(t) - τ_direct(t) = F^1_D(t) - F^(0,1,0)_D(t)。 这个效应衡量的是,因为处理改变了“生病”的风险(O→I),进而通过“生病后死亡”的路径(I→D)所导致的死亡概率变化。

为什么这个思路有效? * 无需序贯可忽略性:在定义 F^(0,1,0)_D(t) 时,我们设想对 O→I 施加了对照水平的风险。这个设想是假设性的,我们并不需要观测数据中“生病”的发生是独立于未来结局的。我们只是说:“如果生病风险像对照组一样,但死亡风险像处理组一样,结果会怎样?” 这个“如果”是定义的一部分,不需要数据来验证。 * 边际化掉治疗诱导混杂:在真实世界中,处理可能通过影响某个未观测的混杂 L(t) 来影响“生病”和“死亡”。但在我们的假设世界里,我们直接设定了转移风险的水平(例如,O→I 的风险被设定为对照组的水平)。这个设定本身就边际化掉了 L(t) 的影响,因为我们不再关心 L(t) 是如何被处理影响的。我们只关心在给定风险水平下,轨迹会如何演化。

数学上:F^(0,1,0)_D(t) 可以通过以下方式计算: 1. 用对照组数据估计 O→I 的风险 Λ^0_OI。 2. 用处理组数据估计 O→D 的风险 Λ^1_OD。 3. 用对照组数据估计 I→D 的风险 Λ^0_ID。 4. 然后,用这些估计的风险,通过 Kolmogorov forward equation 模拟一个“混合”世界:个体从 O 出发,面临 O→I 的风险(对照水平)和 O→D 的风险(处理水平)。如果生病了,则面临 I→D 的风险(对照水平)。由此模拟出的死亡累积发生率就是 F^(0,1,0)_D(t) 的估计。

最小内核总结:本文的核心数学问题就是如何估计像 F^(0,1,0)_D(t) 这样的“混合”反事实累积发生率,并给出其高效、稳健的估计量。这个“混合”是通过对每个转移指定不同的处理水平(a_kg)来实现的,从而将总效应分解为路径效应。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在存在多个中间事件(如EMACE和MVE)的多状态生存数据中,如何定义、识别和估计沿每条转移路径的处理效应,以回答“处理通过哪条路径起作用”的问题。
  2. 核心工具/方法:将随机干预效应(Randomized Interventional Effects) 框架扩展到多状态数据,通过设想对每个转移风险进行假设干预来定义路径效应;并基于有效影响函数(EIF) 构造了多重稳健(Multiply Robust) 且半参数有效的一步估计量(one-step estimator)。
  3. 主要结论:① 在标准因果假设下,反事实累积发生率是可识别的;② 推导了其EIF,并证明了基于EIF的估计量具有多重稳健性和半参数有效性;③ 在LEADER试验中,发现利拉鲁肽主要通过降低EMACE风险(尤其是通过 O→E 和 O→E→M→D 路径)来降低全因死亡率。

关键设定与假设

  • 设定:在第二节最小记号的基础上,本文处理的是一般多状态图(如Figure 1),允许任意多个中间状态和复杂的路径。干预向量 a 的维度等于转移边的数量 |E|。
  • 假设:
    • Assumption 1 (Ignorability):A ⊥⊥ X^a(t*) | W。这是标准无混杂假设,不排除治疗诱导混杂。
    • Assumption 2 (Random censoring):删失独立于潜在结局,给定历史和实际处理。
    • Assumption 3 (Positivity):处理分配概率和非删失概率有正下界。
    • Assumption 4 (Consistency):观测轨迹等于实际处理下的潜在轨迹。
    • Assumption 5 (Extended Markovness):转移风险只依赖于当前状态和无序的历史状态集合(如是否发生过EMACE),而不依赖于事件发生的精确时间顺序。这是一个关键的工作假设,它简化了估计,因为不同路径上的个体如果处于相同的“无序历史状态集合”,就可以合并估计风险。作者声称该假设是可检验的(Grambsch & Therneau 1994)。
  • 相比已有文献的放宽/强化:
    • 放宽:相比自然效应,不要求序贯可忽略性或交叉世界独立性。相比可分离效应,不要求处理成分的“部分隔离”(partial isolation)。
    • 强化:引入了Extended Markovness假设,这在标准竞争风险模型中自动成立,但在一般多状态模型中是一个额外的结构性假设。作者在补充材料E.5中给出了不依赖此假设的EIF,但指出其估计需要点态风险,效率更低。

主要结果

  • Theorem 1 (Identifiability):在Assumptions 1-4下,反事实累积发生率 F^a_j(t) 可由观测数据识别。识别公式(5)是一个多重积分,将路径上的转移风险密度相乘并积分。这是后续估计的基础。
  • Lemma 1 (Efficient Influence Function):在Assumptions 1-5下,推导了 F^a_j(t) 的EIF,如公式(7)所示。EIF由三部分组成:① 一个基于条件累积发生率的项 F^a_j(t|W);② 一个去偏项 φ^a_j(t;O),其期望为零,用于修正plug-in估计的偏差;③ 减去目标量 F^a_j(t)。EIF的推导是本文的核心理论贡献。
  • Theorem 2 (Multiple Robustness):基于EIF的一步估计量 \tilde{F}^a_j(t) 是多重稳健的。具体来说,对于每条路径 q,只要满足以下条件之一,估计量就是一致的:① 路径 q 上所有转移的风险模型都正确设定;② 倾向得分和删失模型正确设定,且路径 q 上至多一个转移风险模型误设。这比传统的双重稳健(doubly robust)更强,因为它允许多个模型误设,只要它们不是全部集中在同一条路径上。
  • Theorem 3 (Semiparametric Efficiency):在正则性条件下(包括模型正确设定、Donsker条件、收敛速率足够快),\sqrt{n}\{\tilde{F}^a_j(t) - F^a_j(t)\} 渐近正态,且其渐近方差达到半参数效率界。这意味着该估计量是所有正则渐近线性(RAL)估计量中渐近方差最小的。
  • Corollary 1 & 2 (Inference):处理效应 τ_j(t;a,a*) 的估计量也具有渐近正态性,且其方差可由EIF的差直接得到。基于受限平均生存时间损失(RMSTL) 的检验统计量 T_j(a,a*) 可用于假设检验。

证明路线与技术技巧(理论型)

  • 整体路线:

    1. 识别:首先证明在标准假设下,潜在转移风险可识别为观测条件风险。然后,通过Kolmogorov forward equation,将反事实累积发生率表示为转移风险的多重积分(Theorem 1)。
    2. EIF推导:这是最核心的一步。作者采用路径导数(pathwise derivative) 方法。他们考虑一个参数化子模型,计算目标泛函 F^a_j(t) 在该子模型下的导数,然后将其投影到观测数据的切空间上。这个投影就是EIF。推导的关键在于处理多状态数据中复杂的计数过程和风险集。作者利用链式法则将 F^a_j(t) 的EIF分解为每个转移风险 Λ_kg 的EIF的线性组合。而每个 Λ_kg 的EIF可以通过标准方法(如处理竞争风险数据)得到,如公式(8)所示。
    3. 估计量构造:基于EIF,构造一步估计量 \tilde{F}^a_j(t) = P_n[\hat{F}^a_j(t|W) + \hat{\phi}^a_j(t;O)]。其中 \hat{F}^a_j(t|W) 是plug-in估计,\hat{\phi}^a_j(t;O) 是拟合的去偏项。这个估计量通过求解EIF的估计方程 P_n[\widehat{EIF}] = 0 来校正plug-in估计的偏差。
    4. 渐近理论:证明多重稳健性(Theorem 2)需要仔细分析当不同模型误设时,估计量的偏差如何抵消。证明的关键在于将 P[\psi(\hat{P}) - \psi(P)] 分解为一系列项的和,每项对应一个转移风险,并利用Cauchy-Schwarz不等式和Lipschitz性质证明每项都是 o_p(n^{-1/2})。证明半参数有效性(Theorem 3)则依赖于标准的一步估计量理论:将 \sqrt{n}(\tilde{F} - F) 分解为 \sqrt{n}(P_n - P)\psi(P) + \sqrt{n}P\{\psi(\hat{P}) - \psi(P)\} + o_p(1)。第一项收敛到均值为0的正态分布,方差为 Var(\psi(P)),即EIF的方差。第二项在Donsker条件和收敛速率条件下是 o_p(1)。
  • 关键跳跃点:

    • EIF的显式形式:推导出如公式(7)所示的、可计算的EIF形式是最大的难点。这需要巧妙地处理多状态数据中的风险集和计数过程,并利用Extended Markovness假设来简化。
    • 多重稳健性的证明:证明“至多一个转移风险误设”时估计量仍一致,需要精细的代数操作,如补充材料E.3所示,通过将偏差项重写为指数形式差分的积分,并证明其抵消。
  • 技术技巧点名:

    • Efficient Influence Function (EIF):核心工具,用于构造高效、稳健的估计量。
    • One-step estimation:基于EIF的偏差校正方法。
    • Multiple robustness:比双重稳健更强的稳健性概念。
    • Kolmogorov forward equation:用于从转移风险计算累积发生率。
    • Donsker class:用于控制经验过程项,保证 \sqrt{n}P\{\psi(\hat{P}) - \psi(P)\} = o_p(1)。
    • Cauchy-Schwarz inequality & Lipschitz property:用于证明余项为 o_p(n^{-1/2})。

真实例子与应用

  • 数据:LEADER试验,一项关于利拉鲁肽(liraglutide)对2型糖尿病患者心血管结局影响的大型随机对照试验。共9340名参与者。
  • 场景:将EMACE(E)和MVE(M)作为中间事件,死亡(D)作为终末事件。分析利拉鲁肽如何通过不同路径影响死亡风险。
  • 方法应用:
    1. 模型拟合:分别对每个转移(如 O→E, O→M, E→D 等)拟合Cox比例风险模型,以基线协变量和事件发生状态作为协变量。
    2. 效应估计:通过设定不同的干预向量 a,估计并比较反事实累积发生率。
      • 事件特异性效应:例如,将进入E的所有转移(O→E, M→E)设为处理水平,其他为对照,估计对EMACE的“直接效应”。
      • 转移特异性效应:例如,仅将 O→E 设为处理水平,估计该转移对死亡的贡献。
      • 路径特异性效应:例如,将 O→E 和 E→D 设为处理水平,估计沿 O→E→D 路径的效应。
    3. 推断:基于EIF计算标准误和置信区间,并进行假设检验。
  • 结果:
    • 利拉鲁肽显著降低了EMACE和MVE的风险(直接效应显著),但对非心血管死亡无显著直接效应。
    • 对死亡的总效应不显著(P=0.1253),但路径分析发现,通过 O→E→D 和 O→E→M→D 路径的效应是显著的。这表明利拉鲁肽降低死亡率的主要机制是通过降低EMACE风险。
    • 敏感性分析(frailty模型)支持了主要结论,表明未观测混杂的影响很弱。
  • 例子想说明什么:这个例子展示了本文方法在回答“处理如何起作用”这一科学问题上的价值。传统的Cox回归或log-rank检验只能给出总效应,而本文的方法能揭示出效应的具体路径,为精准医疗和机制研究提供洞见。

🔎 结论是否比证明窄

  • 多重稳健性:Theorem 2声称“至少一个条件成立”时估计量一致。但仔细看,条件(2)要求“倾向得分和删失风险正确设定,且所有但一个转移风险正确设定”。这意味着如果倾向得分和删失模型都误设,即使所有转移风险都正确,估计量也可能不一致。这个结论比“多重稳健”这个泛泛的说法要窄。作者在模拟中只测试了“一个转移风险误设”和“倾向得分误设”的情况,没有测试“倾向得分和删失模型同时误设”的情况。
  • 半参数有效性:Theorem 3的成立依赖于“所有模型都正确设定”这一条件。如果模型误设,估计量可能仍然一致(多重稳健性),但不再有效。论文没有给出模型误设下的效率损失分析。
  • Extended Markovness:Lemma 1和Theorem 2, 3的证明都依赖于Assumption 5。作者在补充材料E.5中给出了不依赖此假设的EIF,但指出其估计更困难。因此,本文的主要理论结果是在Extended Markovness这个额外假设下成立的。这个假设在一般多状态数据中是否合理,需要研究者根据具体应用判断。

四、开放问题(点到为止,扎根具体语句)

  1. 时变混杂下的干预:作者在讨论中指出,“Alternative interventions may be considered when time-varying confounders are present.” 当存在随时间变化的混杂 L(t) 时,对转移风险的随机干预可能需要条件于 L(t),这会改变 L(t) 的分布,从而需要建模 L(t) 的强度。这是一个重要的开放问题,扎根于论文第27页“First, alternative interventions may be considered when time-varying confounders are present.”

  2. 可分离效应的实际解释:作者承认“Identifying clinically meaningful treatment components with isolated effects is not always feasible, limiting the practical interpretation of separable effects.” 这暗示了可分离效应框架在解释性上的潜在优势。一个开放问题是:在什么条件下,随机干预效应和可分离效应能给出相似的结论?或者,能否将随机干预效应的结果“翻译”成更易解释的“处理成分”效应?这扎根于论文第27页对可分离效应的讨论。

  3. 非参数工作模型:作者提到“Nonparametric working models, such as kernel smoothing, can estimate the hazards conditional on prior event times without Assumption 5.” 这意味着可以放松Extended Markovness假设,但代价是估计更复杂。一个开放问题是:如何在高维状态历史下,有效地使用非参数方法估计转移风险,并保持EIF估计量的良好性质?这扎根于论文第28页“Alternative working models are possible.”

  4. 效应不“尖锐”(Not Sharp):作者指出“interventional effects are not sharp (Miles 2023). Even if a null effect is obtained, it does not necessarily imply that there is no effect, because time-varying confounding may offset the genuine effect.” 这是一个重要的局限性。开放问题是:能否构造一个更“尖锐”的检验或效应定义,在存在治疗诱导混杂时,仍能检测到真实的因果效应?或者,如何量化这种“不尖锐”带来的偏差?这扎根于论文第28页对“interventional effects are not sharp”的讨论。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论