Causal Mediation Analysis with a Time-Dependent Mediator, Time-Dependent Confounders and a Time-to-Event Outcome: Revisiting the Difference Method¶
作者: Robin Denz, Nina Timmesfeld
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.13094
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在纵向数据中,如何将处理变量对生存结局的总效应,分解为通过一个随时间变化的中介变量传导的间接效应,以及不通过该中介变量的直接效应。核心挑战在于,中介变量和结局之间可能存在随时间变化的混杂变量,而这些混杂变量本身又可能受到处理变量的影响,形成复杂的反馈回路。该方向当前处于方法快速发展但应用门槛高的阶段:已有多种理论严谨的方法(如参数化中介g-formula、动态路径分析、半竞争风险模型),但大多统计复杂、计算密集、缺乏用户友好的软件实现,导致应用研究者倾向于使用更简单的替代方法。
发展脉络(history)¶
-
奠基工作:传统中介分析与生存结局的初步结合
- Baron & Kenny (1986) 和 VanderWeele (2015) 建立了传统中介分析的基本框架(线性模型、连续结局),并系统总结了因果中介分析的理论基础。
- VanderWeele (2011) 首次系统讨论了生存结局下的因果中介分析,指出在比例风险模型下,乘积系数法仅在结局罕见时有效,而可加风险模型和加速失效时间(AFT)模型则更稳健。这篇工作为后续研究划定了关键边界。
-
主要进展:应对时间依赖性中介变量和混杂变量
- Daniel et al. (2011) 和 Lin et al. (2017a) 提出了参数化中介g-formula,这是对Robins (1986) 的g-formula在纵向中介分析中的直接扩展。它通过模拟反事实数据来估计直接和间接效应,理论上可以处理任意复杂的时间依赖性反馈。Lin et al. (2017a) 提供了可行的算法和SAS宏,是本文的基准方法。
- Aalen et al. (2020) 和 Vansteelandt et al. (2019) 分别提出了基于可加风险模型和路径特定效应的动态路径分析方法。Aalen et al. (2020) 将g-formula与可加风险模型结合,得到了简洁、可解释的直接和间接效应表达式。Vansteelandt et al. (2019) 则明确定义了路径特定效应作为目标估计量,并处理了重复测量中介变量和死亡导致的截断问题。
- Fulcher et al. (2017) 揭示了在AFT模型下,由于删失导致的模型误设定,差异法和乘积系数法可能产生不同的估计,并指出差异法在存在删失时通常有偏。
-
当前Frontier:更复杂的数据结构和计算挑战
- 当前研究正朝着更复杂的设定发展,包括:半竞争风险(Huang 2021; Gao et al. 2023)、连续时间过程(Kateline et al. 2025)、贝叶斯非参数联合模型(Bhandari et al. 2025a,b)、目标最大似然估计(Wang et al. 2025)等。这些方法虽然更灵活,但计算成本极高,且大多没有现成的、易于使用的软件包。
-
本文的位置:本文不是提出新方法,而是对一种简单、流行但备受争议的旧方法——差异法——在复杂纵向设定下的表现进行系统性的实证评估。它填补了文献中的一个明确空白:尽管差异法被广泛使用且被许多方法论文献所不鼓励,但其在时间依赖性中介变量和生存结局下的实际偏差大小和适用条件从未被系统地量化过。本文通过模拟研究和真实数据分析,为应用研究者提供了关于差异法风险和局限性的具体指导。
子线索聚类¶
这些被引文献大致落在以下三条子线索上:
-
基于g-methods的方法:这是最理论严谨的一类。核心思想是通过模拟或加权来调整时间依赖性混杂。代表工作包括:Lin et al. (2017a)(参数化中介g-formula)、Vansteelandt et al. (2019)(路径特定效应 + g-formula)、Aalen et al. (2020)(g-formula + 可加风险模型)、Keil et al. (2014)(参数化g-formula的教程)。这类方法的优点是理论上可以处理任意复杂的反馈,缺点是计算复杂、需要为所有变量建模、对模型误设定敏感。
-
基于半竞争风险/多状态模型的方法:这类方法将中介变量和结局视为两个相互依赖的事件时间,利用多状态模型框架进行分解。代表工作包括:Huang (2021)(非参数半竞争风险中介分析)、Gao et al. (2023)(主分层效应)、Breum et al. (2024)(连续时间疾病-死亡模型)。这类方法能自然地处理死亡对中介变量的截断,但通常需要更严格的识别假设。
-
基于简单回归的差异法:这是本文的研究焦点。它通过拟合两个模型(总效应模型和直接效应模型)并取其系数差来估计间接效应。代表工作包括:Susser (1973) 和 VanderWeele (2015) 的教科书式介绍,以及 Jiang & VanderWeele (2015) 对其保守性的讨论。这类方法的优点是极其简单、计算快速,但缺点是需要很强的结构假设(如处理对时间依赖性混杂变量无直接影响),且对模型的可压缩性敏感。
这个方向在追问的核心问题¶
- 目标估计量的定义:在存在时间依赖性中介变量和生存结局时,如何定义有意义的、可识别的直接和间接效应?是使用自然效应、路径特定效应,还是主分层效应?不同定义对应不同的识别假设和解释。
- 识别条件:在复杂的纵向反馈下,需要哪些假设才能从观测数据中识别出这些效应?特别是,如何处理处理变量对时间依赖性混杂变量的直接影响(即“处理-混杂反馈”)?
- 估计方法的选择:在给定识别假设下,哪种估计方法(g-formula、IP加权、半参数估计、贝叶斯方法)在偏差、方差和计算成本之间取得最佳平衡?对于应用研究者,哪种方法最可行?
- 模型误设定的影响:当参数模型(如Cox模型、AFT模型)被误设定时,不同方法的稳健性如何?特别是,差异法对模型可压缩性和删失机制的敏感性有多大?
⚠️ 作者的framing¶
- 作者的缺口frame:作者将缺口frame成“差异法在时间依赖性中介变量和生存结局下的表现从未被系统评估过”。他们承认差异法在理论上被不鼓励,但指出其“简单性”对应用研究者有巨大吸引力,因此需要量化其实际偏差,以提供“更清晰的指导”。这使得本文成为“显然的下一步”:在提出更复杂的方法之前,先搞清楚简单方法在什么条件下能用、什么条件下不能用。
- 被淡化或回避的竞争路线:作者明确将参数化中介g-formula作为“基准”,并承认其“在所有场景下保持无偏”。但他们淡化了g-formula的实践困难(“需要为所有变量建模”、“计算昂贵”、“需要软件开发知识”),从而为差异法保留了“简单高效替代方案”的空间。作者没有深入讨论其他竞争方法(如半参数估计、TMLE)在类似设定下的表现,也没有比较差异法与这些方法在计算时间上的具体差异。
- 明显该被引/该存在、却没出现在intro里的工作:本文的intro和参考文献列表非常全面,涵盖了该领域的主要工作。一个值得注意的缺失是,作者没有引用任何关于半参数效率理论(如高效影响函数、双稳健估计)在纵向中介分析中的应用。例如,Tchetgen Tchetgen & Shpitser (2012) 关于双稳健估计的工作,或Zheng & van der Laan (2012) 关于TMLE在纵向设定下的工作,都没有被提及。这可能是因为本文的焦点是“简单方法”vs“参数化g-formula”,而非更前沿的半参数方法。这是一个值得研究者去查的问题:半参数方法(如TMLE)在本文的模拟设定下表现如何?它们是否能在保持无偏的同时,比参数化g-formula更高效?
张力¶
未见明显对立引用。所有被引工作基本一致认为:在存在处理-混杂反馈时,差异法有偏;而g-formula等更严格的方法在正确设定下是无偏的。本文的贡献在于量化了这种偏差的大小,并揭示了AFT模型差异法在无反馈时也存在因可压缩性导致的偏差,这与之前关于AFT模型可压缩性的结论(Crowther et al. 2023)存在张力。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
A:二元基线处理变量,A ∈ {0, 1}。0=对照,1=处理。这是参数/ estimand中的关键变量。T:时间至事件(time-to-event)结局,即首次发生感兴趣事件(如死亡)的时间。这是随机变量。C:删失时间。我们只能观测到T_obs = min(T, C)和事件指示符D_obs = I(T ≤ C)。这是随机变量。M_t:时间依赖性中介变量,在时间t测量。本文中为二元变量(如是否发生组织学进展)。这是随机变量。L_t:时间依赖性混杂变量向量,在时间t测量。本文中为二元变量。这是随机变量。X:基线协变量(如年龄、性别)。这是随机变量。t:离散时间点,t ∈ {0, 1, 2, ..., k}。这是维数/样本量指标。Y_t:二元时间依赖性结局指示符,Y_t = I(T ≤ t)。在离散时间设定下,Y_t在事件发生前为0,发生后为1。Y^{a, a'}_t:反事实结局,即在处理设为a,但中介过程设为a'时,在时间t观测到的结局。这是潜在/反事实量。λ^{a, a'}(t):反事实结局Y^{a, a'}_t对应的风险函数。这是参数/ estimand。Ψ_TE(t),Ψ_DE(t),Ψ_IE(t):总效应、直接效应、间接效应。这是目标估计量。
-
模型:
- 数据生成机制由一个非参数结构方程模型描述,其因果结构由图1的DAG给出。核心是马尔可夫性:给定所有变量在
t-1时刻的值,t时刻的变量与过去独立。 - 对于差异法,需要指定两个条件回归模型:
- 直接效应模型:
λ(t | A, M_t, L_t, X),即风险函数依赖于处理、中介、时间依赖性混杂和基线协变量。 - 总效应模型:
λ(t | A, X),即风险函数仅依赖于处理和基线协变量。
- 直接效应模型:
- 本文考察了三种具体的模型形式:Cox比例风险模型(log hazard ratio scale)、Aalen可加风险模型(hazard difference scale)、AFT模型(log survival time scale)。
- 数据生成机制由一个非参数结构方程模型描述,其因果结构由图1的DAG给出。核心是马尔可夫性:给定所有变量在
-
可观测数据:
- 研究者实际能观测到的是:每个个体的
(A, X),以及一系列随时间更新的(L_t, M_t, Y_t)记录,直到T_obs或研究结束。数据通常以计数过程格式(counting process format)存储,每个时间区间一行。 - 想要但观测不到的是:反事实结局
Y^{a, a'}_t及其对应的风险函数λ^{a, a'}(t)。这些只能通过假设(如一致性、序贯可忽略性)从观测数据中识别。
- 研究者实际能观测到的是:每个个体的
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:没有时间依赖性混杂变量(L_t 只是纯预测变量,不受 A 或 M_t 影响),处理随机分配,结局罕见。
在这个特例下,图1的DAG简化为:A → M_t → Y_{t+1},且 L_t 仅指向 Y_{t+1},不与 A 或 M_t 相连。此时,时间依赖性混杂问题消失。
- 要证的命题:在这个特例下,基于Cox模型或Aalen模型的差异法,能否无偏估计间接效应
Ψ_IE? -
证明怎么走(直觉):
- 总效应模型:
λ(t | A, X)正确估计了A对T的边际总效应(在log hazard ratio或hazard difference scale上)。由于没有混杂,这个模型是正确设定的。 - 直接效应模型:
λ(t | A, M_t, L_t, X)正确估计了在给定M_t和L_t下A对T的条件直接效应。由于L_t不是混杂变量(它不影响M_t),将其纳入模型不会引入偏差,只是提高了效率。 - 关键跳跃点:差异法成立的核心是可压缩性(collapsibility)。即,边际总效应(来自总效应模型)等于条件直接效应(来自直接效应模型)加上通过中介变量的间接效应。对于Cox模型,这个性质仅在结局罕见时近似成立(因为此时log hazard ratio近似于log risk ratio,而risk ratio是可压缩的)。对于Aalen模型,hazard difference本身就是可压缩的,因此这个性质在理论上成立。
- 为什么成立:在这个特例下,
A对T的总效应可以分解为A → T的直接路径和A → M_t → T的间接路径。直接效应模型通过条件在M_t上“阻断”了间接路径,因此其系数β_A估计了直接效应。总效应模型的系数θ_A估计了总效应。因此,θ_A - β_A就是间接效应。
- 总效应模型:
-
论文的一般情形:本文的模拟研究就是在这个最简特例(场景1)的基础上,逐步增加复杂性(
L_t成为混杂变量、L_t与M_t存在反馈、A直接影响L_t、存在基线混杂Z),来考察差异法在哪些条件下会失效。AFT模型差异法即使在最简特例下也有偏,这是本文的一个核心发现,其原因是AFT模型的系数在边际化后不可压缩,这与之前关于AFT模型可压缩性的结论相悖。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:系统评估了差异法(difference method)在存在时间依赖性中介变量、时间依赖性混杂变量和生存结局的因果中介分析中的表现,特别是其估计间接效应的偏差。
- 核心工具/方法:通过大规模的模拟研究,比较了基于Cox比例风险模型、Aalen可加风险模型和加速失效时间(AFT)模型的差异法,并以参数化中介g-formula作为无偏基准。
- 主要结论:Aalen模型差异法在无处理直接导致的时间依赖性混杂变量时无偏;Cox模型差异法仅在结局罕见时无偏;AFT模型差异法因可压缩性问题几乎在所有场景下均有偏;只有参数化中介g-formula在所有场景下保持无偏。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 目标估计量:定义为路径特定效应(path-specific effects),而非自然效应。这是为了避免自然效应在存在时间依赖性混杂和生存结局时的识别问题。具体地,间接效应
Ψ_IE(t)定义为log(λ^{1,1}(t) / λ^{1,0}(t)),其中λ^{1,1}(t)是处理设为1、中介过程也设为1时的风险,λ^{1,0}(t)是处理设为1、但中介过程设为0时的风险。这个定义捕捉了通过整个中介过程传导的效应。 - 识别假设:需要满足一致性、积极性、序贯可忽略性和跨世界独立性。序贯可忽略性要求,在给定过去观测到的混杂变量后,处理分配、中介变量和结局之间不存在未观测的混杂。这是所有因果推断方法的共同基础。
- 模型假设:对于差异法,需要假设直接效应模型和总效应模型都是正确设定的。例如,Cox模型需要满足比例风险假设,AFT模型需要选择正确的基线分布(本文使用Weibull分布)。对于g-formula,需要为所有时间依赖性变量(
L_t,M_t,Y_t)建立正确的条件概率模型(本文使用log-binomial或log-Poisson模型)。 - 相比已有文献的强化/放宽:本文强化了对差异法适用条件的理解,明确指出其需要“处理对时间依赖性混杂变量无直接影响”这一强结构假设。本文放宽了对AFT模型可压缩性的认知,通过模拟发现其在纵向设定下不可压缩,这与之前关于时间固定中介变量的结论不同。
主要结果¶
- 核心量化结论:
- Aalen模型差异法:在场景1-3(无处理-混杂反馈)和场景5-6(有基线混杂)中,当模型正确设定时,间接效应估计无偏。在场景4(有处理-混杂反馈)中,严重有偏。
- Cox模型差异法:在场景1-3和5-6中,当结局罕见(
β^Y_0 = log(0.0001))时,间接效应估计近似无偏;当结局常见(β^Y_0 = log(0.001))时,有偏。在场景4中,严重有偏。 - AFT模型差异法:在所有场景下,间接效应估计均有偏,即使是在最简单的场景1且结局罕见时。偏差虽小但持续存在。表1揭示了原因:直接效应模型估计的是条件效应(
β^Y_A),而目标估计量是边际效应,两者不相等(非可压缩性)。 - 参数化中介g-formula:在所有场景下,间接效应估计无偏。
- 与baseline对比:g-formula在所有场景下无偏,但方差通常大于正确设定下的差异法(见图3-5的箱线图宽度)。作者指出,这可能是由于其模拟实现仅使用了一个模拟数据集,实际应用中可通过多次模拟平均来降低方差。
- 稳健性:作者通过改变基线事件概率、引入删失、改变混杂结构等方式,检验了结果的稳健性。核心结论(Aalen无偏、Cox在罕见结局下无偏、AFT有偏、g-formula无偏)在大多数设定下保持一致。
证明路线与技术技巧¶
本文为应用/方法型论文,其“证明”主要通过模拟研究完成。
-
整体路线:
- 定义数据生成过程(DGP):使用离散事件模拟(Gillespie算法)生成6种不同复杂度的纵向数据,每种数据都对应一个已知的因果结构(DAG)。
- 计算真实目标估计量:由于DGP已知,可以通过蒙特卡洛积分(模拟1,000,000个个体)精确计算出每个场景下的真实总效应、直接效应和间接效应。
- 应用估计方法:对每个模拟数据集,分别应用基于Cox、Aalen、AFT模型的差异法(包括正确设定和错误设定的版本)以及参数化中介g-formula。
- 评估性能:重复1000次模拟,计算每种方法估计的间接效应与真实值之间的偏差和均方误差。
- 分析偏差来源:对于AFT模型差异法的意外偏差,通过表1深入分析,发现其根源在于条件效应与边际效应之间的非可压缩性。
-
关键跳跃点:本文没有数学证明,其“跳跃点”在于模拟设计。作者巧妙地设计了6个场景,逐步引入时间依赖性混杂、反馈回路和处理-混杂反馈,从而能够隔离出导致差异法失效的特定结构。特别是场景4(处理直接影响
L_t)的设计,清晰地展示了差异法失效的根本原因。 -
技术技巧点名:
- 离散事件模拟(Gillespie算法):用于生成具有复杂时间依赖性的纵向数据,模拟了连续时间过程。
- 蒙特卡洛积分:用于计算真实目标估计量,通过模拟大量反事实数据来逼近真实值。
- 参数化中介g-formula:作为基准方法,其实现涉及为所有时间依赖性变量拟合参数模型,然后通过蒙特卡洛模拟生成反事实数据。
- 非参数Bootstrap:用于为真实数据分析中的估计量计算标准误和置信区间。
真实例子与应用¶
- 用的什么数据/场景:使用了来自Mayo Clinic的原发性胆汁性胆管炎(PBC) 随机对照试验数据(Lindor et al., 1994),包含170名患者。目标是分析熊去氧胆酸(UDCA)治疗对无肝移植生存期(LTFS)的影响,其中组织学进展(由两阶段) 作为时间依赖性中介变量。
- 怎么把本文方法用上去:将差异法(Cox、Aalen、AFT模型)和参数化中介g-formula应用于该数据。直接效应模型包含了处理(UDCA)、中介(组织学进展)、时间依赖性混杂(静脉曲张出现)和基线混杂(疾病分期、Mayo风险评分、胆红素)。总效应模型仅包含处理和基线混杂。
- 得到什么结果:所有方法的结果基本一致:UDCA对LTFS有保护作用(总效应HR≈0.63),直接效应与总效应相似,间接效应接近1(即通过组织学进展的中介效应很小)。但由于样本量小,所有置信区间都包含1,结果不显著。
- 这个例子想说明什么:这个例子主要是一个教学演示,展示了如何在实际中应用这些方法。作者明确指出,该分析并非为了产生新的临床证据,而是为了说明方法的用法和潜在陷阱。例子也揭示了实际应用中的困难:样本量不足、识别假设可能不成立(如UDCA可能直接影响时间依赖性混杂变量),导致差异法和g-formula的结果几乎相同,无法区分。
🔎 结论是否比证明窄¶
是的。作者在讨论部分(Section 7)明确承认了这一点:
- “Our results suggest that, under the stated identifiability and model assumptions, the Cox or Aalen based difference method, but not the AFT model based difference method, may be used when there are no time-dependent confounders that are directly caused by the treatment. It is, however, important to note that the presented simulations do not constitute a mathematical proof of this result.”
- 作者还列举了多个未考虑的现实复杂性:处理-中介交互作用、多个中介变量、依赖性删失、竞争风险、截断、测量误差等。这些都是在更窄的模拟条件下得出的结论,不能直接推广到所有现实场景。
四、开放问题¶
-
差异法的数学证明:本文的结论基于模拟。能否在更一般的半参数模型下,严格证明Aalen模型差异法在无处理-混杂反馈时的无偏性,以及AFT模型差异法因非可压缩性导致的偏差形式?这扎根于论文Section 7的声明:“the presented simulations do not constitute a mathematical proof of this result”。
-
“罕见结局”的量化阈值:Cox模型差异法在结局罕见时表现良好,但“罕见”的具体阈值是多少?是事件率低于1%、5%还是10%?这个阈值是否依赖于其他参数(如效应大小、样本量)?这扎根于论文Section 7的疑问:“exactly how rare the outcome needs to be remains unclear”。
-
与半参数方法的系统比较:本文仅比较了差异法和参数化g-formula。一个自然的扩展是,将差异法与更前沿的半参数方法(如TMLE、双稳健估计)在相同的模拟设定下进行比较。这些方法是否能在保持无偏的同时,比参数化g-formula更高效、对模型误设定更稳健?这扎根于论文intro中未引用的半参数效率理论工作。
-
用户友好软件的实现:作者指出,复杂方法缺乏用户友好软件是应用研究者转向差异法的原因之一。一个直接的问题是:能否开发一个R包,将参数化中介g-formula(或更先进的TMLE方法)封装成易于使用的函数,从而降低应用门槛?这扎根于论文Section 7的呼吁:“user-friendly software implementations are needed to facilitate their usage by applied researchers”。
Maintained by 陈星宇 · Homepage · Source on GitHub