Joint Model for Mediation Analysis with Causally Related Longitudinal and Recurrent Event Mediators for Survival Outcome¶
作者: Fang Niu, Cheng Zheng, Lei Liu
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.23894
一、领域脉络与小综述¶
这个方向是什么¶
本子方向解决的根本问题是:在纵向研究中,当存在两种不同类型的中介变量(如重复测量的生物标志物和复发事件计数过程)且它们之间存在因果依赖关系时,如何从观测数据中识别和估计暴露对生存结局的自然直接效应(NDE) 和自然间接效应(NIE)。当前成熟度较低:多数方法只处理单一类型中介,或假设中介间独立,且对未观测混杂的控制依赖较强的序贯可忽略性(SI)假设。
发展脉络(history)¶
- 奠基工作:Liu et al. (2004) 提出共享 frailty 模型联合分析复发事件与终末事件,为后续因果扩展提供了基础建模框架。Liu and Huang (2008, 2009) 进一步将重复测量与复发事件联合建模,但未涉及因果解释。
- 主要进展:Imai and Yamamoto (2013) 系统讨论了多个因果相关中介的识别与敏感性分析,但未处理生存结局和过程型中介。Didelez (2019) 定义了纵向中介与生存结局的因果中介效应,但限于单一中介。Zheng and Liu (2022) 利用共享随机效应放松 SI 假设,处理纵向中介与生存结局,但只考虑单一重复测量中介。Niu et al. (2023) 将共享 frailty 模型用于复发事件中介的因果分析,但未纳入重复测量中介。
- 当前 frontier:同时处理多类型中介(重复测量 + 复发事件)且允许中介间因果依赖,同时通过共享随机效应放松 SI 假设。本文直接定位在此缺口。
- 本文位置:作者声称“现有方法无法处理多类型中介且中介间有因果依赖”,因此提出一个联合建模框架,将重复测量、复发事件和生存结局通过共享随机效应联系起来,并用似然方法估计 NDE 和 NIE。
子线索聚类¶
- 联合建模(joint modeling):Liu et al. (2004), Liu and Huang (2008, 2009), Paulon et al. (2020), Proust-Lima and Taylor (2009)。这一簇主要关注统计建模(参数/半参数/贝叶斯),强调相关性而非因果性。
- 因果中介分析(causal mediation):Imai and Yamamoto (2013), Didelez (2019), Huang (2021), Stensrud et al. (2022), Zheng and Liu (2022), Zheng and Zhou (2017)。这一簇关注识别假设(SI 及其放松)、效应定义(NDE/NIE)和估计方法。
- 复发事件与终末事件的因果机制:Niu et al. (2023), Vansteelandt et al. (2019)。这一簇专门处理复发事件作为中介,但未同时纳入重复测量。
核心问题与瓶颈¶
- 核心问题:① 如何定义和识别多中介(过程型)的 NDE/NIE?② 如何放松 SI 假设以允许未观测混杂?③ 如何高效计算高维积分(过程型中介的路径积分)?
- 主流方法:共享随机效应(frailty)模型 + 蒙特卡洛积分。瓶颈:① 随机效应分布假设强(正态),误设时估计偏差大(模拟显示);② 无闭式解,计算成本高;③ 缺乏半参数效率理论,无法判断估计量的最优性。
⚠️ 作者的 framing(必须明确标注为作者说法)¶
作者将缺口 frame 为:“现有方法只能单独分析复发事件中介或重复测量中介,无法同时处理两者且允许中介间因果依赖”(Introduction 第2段)。他们声称通过“扩展联合建模框架,纳入共享随机效应,放松 SI 假设”来填补这一缺口。竞争路线被淡化或回避:① 工具变量方法(IV)未被讨论,尽管它也能处理未观测混杂;② 结构方程模型(SEM)被提及但仅作为未来方向(Discussion),未与本文方法对比;③ 更灵活的贝叶斯非参数方法(如 Paulon et al. 2020)未被纳入比较。明显该被引但未出现:关于多中介因果推断的经典文献(如 VanderWeele & Vansteelandt 2014 的综述)未被引用,可能因为该文更侧重横截面或单一时间点中介。
张力¶
未见明显对立引用。各被引工作基本在互补设定下发展,未出现同一问题下不同结论的冲突。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(Z_i\):处理/暴露变量(二值,0/1)。 - \(X_i \in \mathbb{R}^p\):基线协变量。 - \(W_i(z, s)\):在暴露 \(z\) 下,个体 \(i\) 在时间 \(s\) 的潜在重复测量中介(如 CD4 计数)。实际观测到的是 \(W_i(s) = W_i(Z_i, s)\) 在离散时间点 \(s_{i1}, \dots, s_{i l_i}\)。 - \(M_i(z, w, t)\):在暴露 \(z\) 和重复测量中介过程 \(w\) 下,个体 \(i\) 在时间 \(t\) 之前的潜在复发事件计数(如机会性感染次数)。实际观测到的是 \(M_i(t) = M_i(Z_i, W_i, t)\)。 - \(T_i(z, m, w)\):在暴露 \(z\)、复发事件过程 \(m\) 和重复测量过程 \(w\) 下的潜在生存时间。实际观测到的是 \(T_i^* = T_i \wedge C_i\) 和事件指示 \(\Delta_i = I(T_i \le C_i)\),其中 \(C_i\) 是删失时间。 - \(\nu_i\):共享随机效应(frailty),连接复发事件中介 \(M\) 与生存结局 \(T\),独立于 \(Z, X\),服从 \(N(0, \sigma_\nu^2)\)。 - \(u_i\):共享随机效应,连接重复测量中介 \(W\)、复发事件中介 \(M\) 与生存结局 \(T\),独立于 \(Z, X\),服从 \(N(0, \sigma_u^2)\)。 - \(\varepsilon_i(t)\):测量误差/个体波动,独立于 \(Z, X\),服从 \(N(0, \sigma_\varepsilon^2)\)。
模型(方程 1-3): - 复发事件强度:\(r_i(z, w, t) = r_0(t) \exp\{\beta_z z + \beta_x^\top X_i + \beta_w w(t) + \nu_i + \gamma u_i\}\)。 - 重复测量均值:\(W_i(z, t) = \alpha_0 + \alpha_z z + \alpha_x^\top X_i + \alpha_t t + u_i + \varepsilon_i(t)\)。 - 生存 hazard:\(\lambda_i(z, m, w, t) = \lambda_0(t) \exp\{\eta_z z + \eta_m m(t) + \eta_w w(t) + \eta_x^\top X_i + \delta_1 \nu_i + \delta_2 u_i\}\)。
可观测数据:对每个个体 \(i\),观测到 \((Z_i, X_i, \{W_i(s_{ij})\}_{j=1}^{l_i}, \{M_i(t)\}_{t \le T_i^*}, T_i^*, \Delta_i)\)。不可观测:潜在中介过程 \(W_i(z, s)\) 和 \(M_i(z, w, t)\) 在反事实水平下的值,以及随机效应 \(\nu_i, u_i\)。
第二步:最小内核¶
为了看清核心思路,考虑一个极度简化的特例:假设时间固定为单个时间点 \(\tau\),且: - 重复测量中介 \(W\) 只在基线测量一次(即 \(W\) 是标量,非过程)。 - 复发事件中介 \(M\) 简化为一个二值指示变量(是否在 \([0, \tau]\) 内至少发生一次事件),而非计数过程。 - 生存结局 \(T\) 简化为在 \(\tau\) 时刻是否存活(二值)。
此时模型退化为: - \(W = \alpha_0 + \alpha_z Z + \alpha_x^\top X + u + \varepsilon\),\(\varepsilon \sim N(0, \sigma_\varepsilon^2)\)。 - \(P(M=1 \mid Z, X, W, \nu, u) = 1 - \exp\{-r_0 \exp(\beta_z Z + \beta_x^\top X + \beta_w W + \nu + \gamma u)\}\)(指数分布强度,\(r_0\) 常数)。 - \(P(T > \tau \mid Z, M, W, X, \nu, u) = \exp\{-\lambda_0 \exp(\eta_z Z + \eta_m M + \eta_w W + \eta_x^\top X + \delta_1 \nu + \delta_2 u)\}\)(指数分布 hazard,\(\lambda_0\) 常数)。
核心命题:估计 \(NDE(\tau) = P(T(z', M(z, W(z)), W(z'')) > \tau) - P(T(z, M(z, W(z)), W(z'')) > \tau)\),其中 \(z, z', z'' \in \{0,1\}\)。由于 \(W\) 和 \(M\) 是随机变量,需要积分掉它们和随机效应。
关键想法:通过共享随机效应 \(\nu, u\) 将未观测混杂纳入模型,使得在给定 \((Z, X, \nu, u)\) 后,\(W\) 和 \(M\) 与 \(T\) 条件独立(放松的 SI)。于是潜在生存概率可写为:
最小内核的数学困难:即使在这个简化特例中,积分维度已经达到 4(\(\nu, u, W(z), W(z')\),\(M\) 由它们决定),且没有解析形式。论文的一般情形(过程型中介)只是将这个积分扩展到无限维路径空间,核心思路相同:用共享随机效应控制未观测混杂,用蒙特卡洛近似路径积分。
三、这篇论文做了什么¶
三句话¶
- 研究问题:当存在重复测量中介(如 CD4 计数)和复发事件中介(如机会性感染)且中介间有因果依赖时,如何估计暴露对生存结局的自然直接效应(NDE)和自然间接效应(NIE)。
- 核心工具:扩展的联合建模框架,通过共享随机效应(frailties)连接重复测量、复发事件和生存结局,在放松的序贯可忽略性(SI)假设下识别因果效应,并用蒙特卡洛数值积分计算效应估计。
- 主要结论:模拟显示在正确模型设定下估计偏差小、覆盖率高,但对随机效应分布误设敏感;应用于 CPCRA 艾滋病研究,发现既往 AIDS 定义条件(PADC)通过复发机会性感染和重复 CD4 计数中介影响生存,且 CD4 与生存间的共享随机效应显著(提示未观测混杂),而治疗(ddI vs ddC)无显著直接或间接效应。
关键设定与假设¶
- 模型设定:方程 (1)-(3) 为参数模型,基线强度/ hazard 用分段常数函数(4 段)。随机效应 \(\nu_i, u_i\) 独立正态,测量误差 \(\varepsilon_i(t)\) 独立正态。
- 假设:
- 扩展 SUTVA:无干扰,一致性(潜在结果与观测结果一致)。
- 放松的序贯可忽略性(SI):方程 (4)-(6)。具体地:
- (4) \(Z \perp (M(z', W^{z'}), W^{z''}, T(z, m, w)) \mid X\)(暴露随机化或条件可忽略)。
- (5) \(W^{z''} \perp (M(z', W^{z'}), T(z, m, w)) \mid Z, X, u\)(重复测量中介可忽略给定 \(Z, X, u\))。
- (6) \(M^{z'} \perp T(z, m, w) \mid Z, X, u, \nu\)(复发事件中介可忽略给定 \(Z, X, u, \nu\))。
- Markov 假设:强度/hazard 只依赖当前 \(w(t)\) 和 \(m(t)\),不依赖历史。
- 相比已有文献的放宽/强化:相比标准 SI(要求无未观测混杂),本文通过共享随机效应 \(u, \nu\) 允许未观测时不变混杂存在于中介与结局之间,这是放宽;但假设随机效应分布已知(正态),且未观测混杂是时不变的,这是限制。
主要结果¶
- 模拟结果(Table 1):
- Setting I(正确设定):NDE, NIE_M, NIE_W 在时间点 2,4,6,8 的偏差均 ≤0.005,经验标准差与中位标准误接近,95% 覆盖率在 93%-98% 之间。
- Setting II(随机效应误设:\(\nu, u\) 用 log-gamma 分布):偏差大幅增加(如时间 8 时 NDE 偏差 0.041,覆盖率降至 9.6%),表明估计量对随机效应分布敏感。
- 真实数据结果(CPCRA):
- 暴露:治疗(ddI vs ddC):NDE, NIE_OI, NIE_CD4 的 95% 置信区间均包含 0,无显著效应。与之前仅考虑复发事件中介的研究(Niu et al. 2023)不同,后者曾报告显著直接效应——作者解释为之前研究将 CD4 的间接效应混入了 NDE。
- 暴露:PADC(既往 AIDS 定义条件):NDE 显著(负向,PADC 降低生存概率),NIE_OI 显著(负向),NIE_CD4 显著(正向但幅度较小)。总效应与 Cox 回归估计一致。
- 参数估计(Table 2):共享随机效应 \(u\) 在生存模型中显著(\(\hat{\delta}_2 = -2.35, p<0.001\)),提示 CD4 与生存间存在未观测混杂;\(\nu\) 不显著(\(p=0.80\))。
证明路线与技术技巧(理论型必写,但本文为方法型,侧重模型与计算)¶
- 整体路线:① 定义潜在结果框架下的 NDE/NIE(Section 2);② 提出参数联合模型(方程 1-3);③ 在放松 SI 下将效应表达为积分形式(Section 2.2);④ 用最大似然估计模型参数(高斯求积);⑤ 用蒙特卡洛积分近似效应估计(采样随机效应、中介路径、计算条件生存概率);⑥ Bootstrap 计算置信区间。
- 关键跳跃点:从潜在结果到可观测数据的转换依赖于放松 SI 假设(方程 4-6),使得积分中的条件分布均可由观测数据估计。这是识别上的核心步骤。
- 技术技巧点名:
- 共享随机效应(frailty):用于控制未观测时不变混杂,放松 SI。
- 分段常数基线:简化非参数部分,便于似然计算。
- 高斯求积(Gaussian quadrature):用于最大化联合似然(SAS Proc NLMIXED)。
- 蒙特卡洛积分:用于近似高维路径积分(无限维中介过程)。
- Bootstrap:用于推断,未推导渐近方差。
真实例子与应用¶
- 数据:CPCRA 研究,467 名 HIV 患者,随机接受 ddI 或 ddC,随访 1-21 个月。记录基线协变量(PADC、性别、AZT 反应层、血红蛋白),每 2 个月测量 CD4 计数(重复测量中介 \(W\)),记录机会性感染(OI)发生时间(复发事件中介 \(M\)),结局为总生存时间。
- 方法应用:分别以治疗(ddI vs ddC)和 PADC 为暴露,拟合联合模型(方程 1-3),估计 NDE、NIE_OI、NIE_CD4 随时间变化的生存概率差。
- 结果:见上文“主要结果”。关键发现:PADC 的 NIE_OI 幅度大于 NIE_CD4,提示控制 OI 比提升 CD4 对生存更重要;治疗无显著效应,与之前研究对比凸显了区分中介路径的重要性。
- 例子想说明:① 方法能处理实际中两类中介共存且因果相关的情形;② 能揭示不同中介的相对重要性;③ 能检测未观测混杂(通过共享随机效应显著性);④ 与 Cox 回归的总效应一致,验证了模型合理性。
🔎 结论是否比证明窄¶
- 论文没有渐近理论证明(如一致性、渐近正态性、效率界),所有结论基于模拟和 Bootstrap。作者在 Discussion 中未声称理论性质,但模拟仅覆盖有限设定(200 次重复,正态随机效应)。结论比证明窄:实际应用中,随机效应分布未知,误设时估计可能严重偏倚(模拟 Setting II 显示),但论文未提供稳健性方法或诊断工具。
- 作者在 Section 2.2 声称“under this relaxed assumption, we can write the survival function … and all terms are estimable from the data”,但未证明估计量的 \(\sqrt{n}\)-一致性或给出收敛速度。这是纯参数模型,理论上 MLE 在正则条件下一致,但论文未验证正则条件(如基线函数的光滑性、随机效应可识别性)。
四、开放问题(点到为止,扎根具体语句)¶
-
双向因果中介:论文假设中介 \(M\) 可被 \(W\) 因果影响,但未考虑 \(M\) 反向影响 \(W\)。作者在 Discussion 中承认“mediators may influence each other bidirectionally”,并建议未来整合互惠因果模型或结构方程模型(引用 Grace 2021, Gunzler et al. 2013)。这是一个明确的开放问题。
-
随机效应分布误设的稳健性:模拟显示当 \(\nu, u\) 从 log-gamma 分布生成时,估计偏差和覆盖率严重恶化(Table 1 Setting II)。论文未提供诊断或稳健估计方法。未来可探索半参数或非参数随机效应分布(如 Dirichlet 过程混合),或发展对分布误设不敏感的估计量。
-
半参数效率界与双稳健估计:本文使用完全参数模型,未推导半参数效率界。对于此类多中介、过程型中介的因果效应,是否存在双稳健估计量(如基于高效影响函数)?这直接关联研究者的“semiparametric theory”和“debiased ML”兴趣。扎根于论文未讨论效率理论这一事实。
-
高维协变量与中介选择:论文假设协变量 \(X\) 维数固定且已给定。当协变量或中介数量高维时(如基因表达数据),如何选择中介或进行变量选择?这关联研究者的“high-dimensional statistics”兴趣。论文未提及高维场景。
-
计算可扩展性:蒙特卡洛积分需要大量采样,且随随访时间点增加计算成本剧增。论文未讨论计算复杂度或优化策略。对于大型纵向数据集,需要更高效的近似方法(如变分推断或拉普拉斯近似)。
Maintained by 陈星宇 · Homepage · Source on GitHub