跳转至

Doubly robust estimation of while-alive estimands in individually-randomized and cluster-randomized trials

作者: Xi Fang, Da Zhao, Fan Li
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.15969


一、领域脉络与小综述

这个方向是什么

本论文聚焦于慢性病随机试验中,由死亡(terminal event)截断的复发非致命事件(recurrent nonfatal events)的因果推断。核心问题是:如何定义一个既能反映复发事件负担、又不受生存时间差异混淆的治疗效应估计量?传统方法要么忽略复发事件(仅分析首次事件时间),要么将死亡视为删失(丧失因果解释),要么将累积事件数与生存时间混为一谈(延长生存的组反而因有更多时间发生事件而显得“更差”)。本文所研究的“存活期间”(while-alive) estimand,通过将事件负担标准化为每单位存活时间内的期望事件数,直接回应了这一挑战。该方向当前处于方法快速发展期,已有非参数估计、回归方法和高效估计,但双重稳健估计在暴露加权(exposure-weighted)版本和整群随机试验(CRT)设定下尚属空白。

发展脉络(history)

作者在引言中勾勒了一条清晰的脉络,从经典生存分析到现代因果推断,逐步收窄到本文的定位。

  1. 奠基工作:复发事件分析的经典框架。

    • Prentice, Williams, and Peterson (1981):提出了条件回归模型,是早期处理多元失效时间数据的里程碑。
    • Lawless and Nadeau (1995):发展了稳健的边际率和均值函数方法,为不依赖特定强度模型的推断奠定了基础。
    • D. Y. Lin et al. (2000):提出了半参数回归模型(LWYY模型),用于估计复发事件的边际均值和率函数,成为后续工作的标准工具之一。作者引用时指出,这些方法“acknowledging that no recurrent events can occur after death”,但并未直接解决“event burden per unit time alive”的估计问题。
  2. 主要进展:处理终端事件的两条路径。

    • 路径一:边际率/均值函数法。 以 Cook and Lawless (1997)、Ghosh and Lin (2000) 为代表,直接建模复发事件的边际率,承认死亡后事件停止。作者评价其“characterize how often events occur... inevitably influenced by the distribution of the terminal event”。
    • 路径二:联合建模法。 以 C.-Y. Huang and Wang (2004)、Liu et al. (2004) 为代表,通过共享脆弱性(shared frailty)引入复发与死亡过程间的依赖。作者认为这些方法同样“characterize how often events occur”,而非直接估计单位存活时间内的负担。
    • 因果推断视角的引入。 Genetti et al. (2025) 和 Y. Huang et al. (2026) 分别提出了高效估计量和模型辅助因果推断方法。Mork et al. (2025) 引入了结构嵌套率模型。Lyu et al. (2023) 和 Ohnishi et al. (2025) 则采用主分层(principal stratification)框架,将推断限制在“无论接受何种治疗都会存活”的亚群上。作者指出,主分层方法“redefines the target population free of the terminal event, and hence the resulting inference no longer applies to the original, full trial population”。
  3. 当前 Frontier:While-Alive Estimand 的正式化与估计。

    • ICH E9(R1) Addendum (2019) 和 Committee for Medicinal Products for Human Use (2020) 提供了监管层面的框架,将死亡视为“intercurrent event”,并定义了“while-alive strategy”。
    • Mao (2023) 首次在非参数框架下系统研究了一类广义的 while-alive estimand,包括暴露加权版本。
    • Wei et al. (2023) 考察了两种特定 while-alive estimand 及其估计量的性质。
    • Fang et al. (2025) 为复合生存终点的 while-alive 摘要发展了回归方法。
    • Ragni et al. (2026) 推导了患者加权(patient-weighted)while-alive estimand 的高效影响函数,并提出了高效非参数估计量。
    • Baer et al. (2025) 是与本文最相关的工作。作者指出,Baer et al. 将复发事件和死亡嵌入一个多重稳健因果框架,但其估计量“constructed directly on the survival function scale, and the resulting survival estimates are not guaranteed to be monotone across time”。本文则通过局部 Nelson-Aalen 构造,天然保证了单调性。
  4. 本文的位置。 作者将自身定位为填补两个空白:一是为暴露加权 while-alive estimand 提供双重稳健估计(Baer et al. 是多重稳健,但基于生存函数尺度);二是将这一框架扩展到整群随机试验(CRT),并区分个体平均和群平均 estimand,处理信息性群大小(informative cluster size)。

子线索聚类

  1. 复发事件分析的经典统计方法:Prentice et al. (1981), Lawless and Nadeau (1995), D. Y. Lin et al. (2000), Cook and Lawless (1997, 2002, 2007), Ghosh and Lin (2000, 2002), Cook et al. (2009)。这一簇主要关注在无终端事件或将其视为删失时的边际率/均值建模。
  2. 处理终端事件的联合模型与因果推断:C.-Y. Huang and Wang (2004), L.-A. Lin et al. (2017), Liu et al. (2004), M.-C. Wang et al. (2001), Genetti et al. (2025), Y. Huang et al. (2026), Mork et al. (2025)。这一簇通过共享脆弱性或因果框架(如结构嵌套模型)处理复发与死亡间的依赖。
  3. While-Alive Estimand 的正式化与估计:Mao (2023), Wei et al. (2023), Fang et al. (2025), Ragni et al. (2026), Baer et al. (2025)。这一簇直接针对“每单位存活时间的事件负担”这一 estimand,发展识别、估计和推断方法。
  4. 整群随机试验(CRT)的因果推断:Balzer et al. (2019, 2023), Li et al. (2025), B. Wang et al. (2024), Fang et al. (2026a, 2026b), Grant et al. (2025), Kahan et al. (2023, 2024, 2026)。这一簇关注 CRT 中由于信息性群大小导致的个体平均与群平均 estimand 的区分,以及相应的稳健估计方法。

核心问题与瓶颈

  • 核心问题 1:如何定义一个有因果解释的、不受生存时间混淆的复发事件治疗效应? 瓶颈在于死亡不是普通删失,它既终止了事件发生,又与事件风险相关。While-alive estimand 通过标准化解决了这一问题,但不同加权版本(患者加权 vs. 暴露加权)回答不同问题。
  • 核心问题 2:如何在存在协变量依赖删失时,对 while-alive estimand 进行稳健估计? 瓶颈在于需要同时处理删失、终端事件和复发事件三个过程。现有方法要么不稳健(如 IPCW),要么计算复杂(如 Baer et al. 的未来均值法),要么不适用于 CRT。
  • 核心问题 3:在 CRT 中,如何定义和估计 while-alive estimand,并处理信息性群大小? 瓶颈在于群是随机化单位,但事件发生在个体层面。群大小可能与预后和治疗效果相关,导致个体平均和群平均 estimand 不同。现有 CRT 方法未针对 while-alive 摘要。

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 成“暴露加权 while-alive estimand 的双重稳健估计尚未发展,尤其在 CRT 中”。他们通过对比 Baer et al. (2025) 的“未来均值法”(不保证单调性、计算复杂)来凸显自己“局部 Nelson-Aalen 构造”(天然单调、计算简单)的优势。同时,通过对比 Fang et al. (2025) 的回归方法(未区分个体/群平均 estimand、未处理信息性群大小)来凸显自己在 CRT 设定下的贡献。
  • 被淡化或回避的竞争路线:作者淡化了主分层方法(Lyu et al., 2023; Ohnishi et al., 2025),仅指出其目标人群不同。他们也回避了与 Ragni et al. (2026) 的深入比较,后者针对的是患者加权 estimand,而本文是暴露加权,两者回答不同问题。作者在讨论中承认了这一点。
  • 值得研究者去查的问题:作者在引言中引用了大量关于复发事件和 CRT 的文献,但没有引用任何关于“统计-计算权衡”(statistical-computational tradeoff)或“低度多项式障碍”(low-degree polynomial barrier)的文献。对于一个关注计算复杂度的研究者,这是一个明显的缺失。本文提出的估计量是封闭形式的(closed-form),计算上非常高效,但这是否意味着在某些高维或复杂设定下,存在一个“统计-计算”的权衡?例如,当协变量维度很高时,LWYY 模型和 Cox 模型的估计是否仍然可行?是否存在一个信号强度阈值,低于该阈值时,任何多项式时间算法都无法一致估计 while-alive estimand?这个问题在本文中完全没有被触及。

张力

未见明显对立引用。文献脉络是累积性的,而非矛盾性的。不同方法(边际模型、联合模型、主分层、while-alive)服务于不同的科学问题,作者清晰地指出了各自的适用场景和局限性。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:
    • i: 个体索引(IRT)或群索引(CRT)。
    • A_i ∈ {0, 1}: 处理分配(0=对照,1=干预)。
    • Z_i: 基线协变量向量。
    • D_i^a: 在治疗 a 下的潜在终端事件(死亡)时间。
    • T_{ikj}^a: 在治疗 a 下,个体 i 的第 k 类事件的第 j 次发生时间。
    • N_{ik}^a(t): 在治疗 a 下,个体 i 到时间 t 为止的第 k 类复发事件的计数过程。关键:该过程在死亡时停止,即 N_{ik}^a(t) = N_{ik}^a(t ∧ D_i^a)。
    • w = (w_1, ..., w_K)^T: 预设的、非负的事件类型权重向量,反映临床重要性。
    • N_i^{a,w}(t) = Σ_k w_k N_{ik}^a(t): 加权复发事件过程。
    • τ: 固定的时间视界(如 4 年)。
    • Estimand:
      • µ^a(τ; w) = E[N_i^{a,w}(τ)]: 边际加权复发事件负担。
      • ν^a(τ) = E[D_i^a ∧ τ]: 受限平均生存时间(RMST)。
      • ψ^a(τ; w) = µ^a(τ; w) / ν^a(τ): 暴露加权 while-alive 复发事件率。这是本文的核心 estimand。
      • ∆(τ; w) = ψ^1(τ; w) - ψ^0(τ; w): 治疗对比。
    • 可观测数据:
      • X_i = min(D_i, C_i, τ): 观测到的随访时间(D_i 是实际死亡时间,C_i 是删失时间)。
      • δ_i = I(D_i ≤ C_i ∧ τ): 死亡事件指示符。
      • δ_i^C = I(C_i < D_i ∧ τ): 删失指示符。
      • N_i^D(t) = I(X_i ≤ t, δ_i = 1): 观测到的死亡计数过程。
      • Y_i(t) = I(X_i ≥ t): 观测到的风险指示符。
      • N_{ik}(t): 观测到的第 k 类复发事件计数过程(在 X_i 处截断)。
      • N_i^w(t) = Σ_k w_k N_{ik}(t): 观测到的加权复发事件过程。
    • 潜在但不可观测的量:D_i^a, N_i^{a,w}(t), C_i^a。识别依赖于假设(一致性、随机化、条件独立删失)。

第二步:讲最小内核

本文的核心数学思想可以浓缩为一个最简特例:假设没有删失(C_i = ∞),且只有一种复发事件类型(K=1, w=1)。

在这个特例下,所有潜在结果都是完全可观测的(对于 A_i = a 的个体)。那么,ψ^a(τ) 的估计就简化为一个简单的比率问题:

ψ^a(τ) = E[N_i^a(τ)] / E[D_i^a ∧ τ]

其中,N_i^a(τ) 是到死亡或 τ 为止的复发事件总数,D_i^a ∧ τ 是存活时间。

为什么这还不够? 因为即使没有删失,ψ^a(τ) 也不是一个简单的样本均值之比。N_i^a(τ) 和 D_i^a ∧ τ 是相关的,且 N_i^a(τ) 的分布依赖于 D_i^a。直接计算 (1/n) Σ N_i^a(τ) / (1/n) Σ (D_i^a ∧ τ) 是相合的,但效率可能不高,且无法处理删失。

本文的关键想法:作者没有直接估计这个比率,而是将其分解为两个更基础的“局部”量,即死亡风险增量和存活者中的复发事件率增量。这通过 Proposition 1 实现:

µ^a(τ) = ∫_0^τ S^a(t-) dΛ^{R,a}(t) ν^a(τ) = ∫_0^τ S^a(t) dt

其中: * S^a(t) = P(D^a > t) 是生存函数。 * dΛ^{D,a}(t) = E[dN^{D,a}(t)] / E[Y^a(t)] 是边际死亡风险增量(在时间 t 存活的个体中,瞬时死亡的概率)。 * dΛ^{R,a}(t) = E[dN^{a}(t)] / E[Y^a(t)] 是存活者中的边际复发事件率增量(在时间 t 存活的个体中,瞬时发生复发事件的期望次数)。

这个分解的威力在于:它将一个复杂的比率估计问题,转化为了两个标准的生存分析问题——估计累积风险函数 Λ^{D,a}(t) 和 Λ^{R,a}(t)。一旦估计出这两个累积风险,就可以通过 Nelson-Aalen 型估计量(乘积限估计生存函数,Stieltjes 积分累积事件负担)来构造 µ^a(τ) 和 ν^a(τ),进而得到 ψ^a(τ)。

在有删失的现实世界中,直接估计 dΛ^{D,a}(t) 和 dΛ^{R,a}(t) 会遇到删失偏差。本文的核心技术贡献就是为这两个局部量分别构造了增广估计方程,使得估计量具有双重稳健性:只要删失模型或结局模型(死亡和复发事件)之一正确,估计就是相合的。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:为个体随机试验(IRT)和整群随机试验(CRT)中的暴露加权 while-alive 复发事件率,发展双重稳健估计量和推断方法。
  2. 核心工具/方法:基于局部 Nelson-Aalen 表示,通过增广估计方程同时估计终端事件的边际风险和存活者中的加权复发事件率;在 CRT 中,进一步区分个体平均和群平均 estimand,并使用群级影响函数进行推断。
  3. 主要结论:建立了分量级双重稳健性(分母需删失或死亡模型正确,分子需删失或死亡与复发模型同时正确)和渐近正态性;模拟验证了理论性质;通过 HF-ACTION 和 STRIDE 两个真实数据例子展示了方法的应用。

关键设定与假设

  • Assumption 1 (Consistency):无干扰、无隐藏治疗版本。标准假设。
  • Assumption 2 (Randomization):处理分配概率已知且有界。对于 IRT,A_i ⊥⊥ 所有潜在结果 | Z_i。对于 CRT (Assumption 5),类似条件成立,但允许随机化概率依赖于基线信息(如分层、配对)。
  • Assumption 3 (Covariate-dependent censoring):C_i^a ⊥⊥ {D_i^a, N_i^a(·)} | Z_i,且条件删失生存函数 K_i^a(t) 在 [0, τ] 上一致有界。这是关键假设,它允许删失依赖于基线协变量,但要求给定协变量后删失与事件过程独立。这比完全随机删失更宽松,但比允许删失依赖于时变协变量的假设更强。
  • Assumption 4 (Consistency for CRT):与 Assumption 1 类似,但针对群级处理。
  • Assumption 6 (Covariate-dependent censoring for CRT):与 Assumption 3 类似,但条件集是群的全部基线信息 F_i,允许群内个体间的任意依赖。

相比已有文献的放宽/强化: * 相比 Mao (2023) 和 Wei et al. (2023):本文处理了协变量依赖删失,而 Mao 和 Wei 的工作主要是在非参数或更简单的删失设定下。 * 相比 Baer et al. (2025):本文的估计量基于局部 Nelson-Aalen 构造,天然保证生存函数的单调性,而 Baer et al. 的一步估计量需要后续的保序投影。本文的计算也更简单,只需一次 Cox 和 LWYY 拟合。 * 相比 Fang et al. (2025):本文明确区分了 CRT 中的个体平均和群平均 estimand,并处理了信息性群大小,而 Fang et al. 的回归方法未做此区分。

主要结果

  • Theorem 1 (Componentwise double robustness for IRT):这是核心理论结果。它表明:
    • 如果删失模型 (C_a) 或死亡结局模型 (O_a^D) 正确,则 ν̂_a^{DR}(τ) 是 ν_a(τ) 的相合估计。
    • 如果删失模型 (C_a) 或死亡与复发结局模型同时正确 (O_a^D ∩ O_a^R),则 µ̂_a^{DR}(τ; w) 是 µ_a(τ; w) 的相合估计。
    • 因此,ψ̂_a^{DR}(τ; w) 的相合性要求分母和分子都相合。
  • Theorem 2 (Asymptotic normality for IRT):在正则条件下,n^{1/2}(ψ̂_a^{DR}(τ; w) - ψ_a(τ; w)) 渐近正态,且其影响函数 ϕ_{ψ,a,i} 可以显式写出。这为 Wald 型置信区间和假设检验提供了基础。
  • Theorem 3 (Componentwise double robustness for CRT):与 Theorem 1 类似,但针对 CRT 设定下的个体平均和群平均 estimand。Remark 1 强调,双重稳健性陈述对两个 estimand 都成立,但它们是不同的因果量。
  • Theorem 4 (Asymptotic normality for CRT):与 Theorem 2 类似,但以群为独立单元,影响函数是群级的 Φ_{ψ,a,ℓ,i}。

证明路线与技术技巧

  • 整体路线:
    1. 局部表示:通过 Proposition 1,将 µ^a 和 ν^a 表示为 Λ^{D,a} 和 Λ^{R,a} 的函数。
    2. 增广估计方程:为 dΛ^{D,a}(t) 和 dΛ^{R,a}(t) 分别构造增广估计方程(公式 5 和 8)。这些方程是逆概率删失加权(IPCW)Nelson-Aalen 估计方程加上一个“增广项”,该增广项包含条件全数据增量。
    3. 双重稳健性证明:证明的核心是引理 2 (Calibration of U*)。这个引理表明,增广项中的 U 过程像一个“开关”:当删失模型正确时,U 的期望为 1,增广项消失,估计量退化为 IPCW 估计量;当结局模型正确时,U 的期望校准了 IPCW 项的偏差,使得即使删失模型错误,估计量仍然相合。证明通过计算增广估计方程在两种情形下的期望来完成(见 Appendix A2)。
    4. 渐近正态性:通过计数过程理论和半参数估计方程理论建立。关键在于推导出 Λ̂^{D,DR}_a(t) 和 Λ̂^{R,DR,w}_a(t) 的渐近线性表示,其影响函数包括来自增广估计方程的“经验项”和来自估计 nuisance 函数的“一阶效应”。然后通过 delta 方法(乘积限、Stieltjes 积分、比率)得到 ψ̂_a^{DR} 的影响函数。
  • 关键跳跃点:最吃功夫的部分是推导 nuisance 函数估计对影响函数的影响(Appendix A3.2 和 A3.3)。这需要将 Cox 模型和 LWYY 模型的估计(包括回归系数和基线风险/率函数)的渐近线性表示,通过链式法则传播到 U 过程和局部估计方程中。这涉及复杂的函数型 delta 方法和乘积法则。
  • 技术技巧点名:
    • Nelson-Aalen 估计量 / 乘积限:用于从局部风险增量构造生存函数。
    • 增广估计方程 (Augmented Estimating Equations):核心技巧,用于实现双重稳健性。
    • 计数过程鞅理论 (Counting Process Martingale Theory):用于推导 U 过程的校准性质(引理 2)和渐近线性表示。
    • 半参数效率理论 (Semiparametric Efficiency Theory):用于推导高效影响函数(Appendix A4),并与本文估计量的影响函数进行比较,阐明效率损失的条件。
    • LWYY 模型 (Lin-Wei-Yang-Ying Model):用于建模复发事件的边际率,是结局模型的核心组成部分。
    • 群级影响函数 (Cluster-level Influence Functions):用于处理 CRT 中的群内相关性,将推断建立在独立群的基础上。

真实例子与应用

  • HF-ACTION (IRT):
    • 数据:2331 名慢性心衰患者,随机分配到常规护理或常规护理+运动训练。复发事件为全因住院,终端事件为全因死亡。
    • 方法应用:使用本文提出的双重稳健估计量,估计运动训练 vs. 常规护理的 while-alive 全因住院率差异。nuisance 函数通过 Cox 模型(死亡和删失)和 LWYY 模型(住院)拟合,调整了基线协变量。
    • 结果:在 4 年视界上,估计的 while-alive 住院率差异为 -0.025 次/年(95% CI: -0.070, 0.020),无统计学显著性。点估计表明运动训练组每 100 人年减少约 2.5 次住院。
    • 说明的问题:展示了 while-alive estimand 如何提供与原始首次事件分析互补的信息。原始分析发现风险比有临界显著性,而 while-alive 分析表明,在考虑了所有复发住院和生存时间后,证据并不强。这凸显了 while-alive estimand 在解释治疗对总负担影响方面的价值。
  • STRIDE (CRT):
    • 数据:86 个初级保健诊所(群)被随机分配到护士主导的干预或增强型常规护理,共 5451 名老年人。复发事件为跌倒损伤,终端事件为死亡。
    • 方法应用:同时估计了个体平均和群平均 while-alive 跌倒损伤率差异。nuisance 函数拟合与 HF-ACTION 类似,但调整了健康系统指标和实践规模。
    • 结果:个体平均分析显示,干预在 1-2 年时显著降低了 while-alive 跌倒损伤率(如 1 年时差异为 -0.044 次/年,p=0.014),但到 3 年时效应消失。群平均分析的所有置信区间均包含零。
    • 说明的问题:完美展示了在 CRT 中区分个体平均和群平均 estimand 的重要性。由于实践规模与预后相关(信息性群大小),两种 estimand 给出了不同的结论。个体平均分析(给大实践更多权重)发现了早期获益,而群平均分析(每个实践权重相等)未发现显著效应。这为理解干预效果的异质性提供了关键信息。

🔎 结论是否比证明窄

  • 窄结论 1:双重稳健性依赖于“分量级”条件。 作者在 Theorem 1 中明确指出了这一点:分母的稳健性只需要删失或死亡模型正确,而分子的稳健性需要删失或(死亡与复发模型同时)正确。这是一个非常精确的陈述,没有过度泛化。例如,如果死亡模型正确但复发模型错误,分子可能不稳健。
  • 窄结论 2:效率不是最优的。 作者在 Section 2.3 末尾和 Appendix A4 中明确承认,本文估计量的影响函数不是一般意义上的半参数高效影响函数。它只在“历史充分性”(history sufficiency)条件下才达到效率界。作者将此描述为一种“deliberate tradeoff”,以换取计算简单性和稳定性。这是一个诚实的、不夸大结论的表述。
  • 窄结论 3:CRT 中的效率。 类似地,在 CRT 设定下(Section 3.2 末尾),作者明确指出,群级影响函数不是高效影响函数,因为未利用群内其他成员在删失后可能提供的信息。这又是一个精确的、不夸大的陈述。

四、开放问题

  1. 放松条件独立删失假设:本文的 Assumption 3 要求删失独立于事件过程(给定基线协变量)。如果删失依赖于未测量的时变健康状态,估计量可能有偏。作者在讨论中承认了这一点(“If dropout or loss to follow-up depends on unmeasured health status... the proposed estimators may remain biased”)。这是一个明确的开放问题:如何将本文框架扩展到允许信息性删失(informative censoring)的情形?这可能需要对删失机制进行联合建模或使用工具变量方法。
  2. 事件类型权重的敏感性分析:作者指出,权重 w 是预设的临床常数,但不同权重定义不同因果问题。当没有公认的权重集时,如何进行敏感性分析?作者在讨论中提到了这一点(“sensitivity analyses across clinically plausible weighting schemes may therefore be informative”)。这是一个方法论上的开放问题:如何系统地评估 while-alive estimand 对权重选择的敏感性?
  3. 扩展到更灵活的 nuisance 估计:作者目前依赖 Cox 和 LWYY 等半参数工作模型。他们提到可以扩展到交叉拟合的、去偏的机器学习估计量(“cross-fitted, debiased machine-learning estimators”),以允许更灵活的协变量调整。这直接扎根于讨论中的最后一段。这是一个明确的未来工作方向,需要验证在复发事件和删失过程的正则条件下,此类方法是否仍能保持有效推断。
  4. 统计-计算权衡的缺失:如前所述,本文未探讨任何统计-计算权衡。对于一个关注计算复杂度的研究者,一个自然的开放问题是:在高维协变量(p >> n)或复杂依赖结构下,是否存在一个信号阈值,低于该阈值时,任何多项式时间算法都无法一致估计 while-alive estimand? 本文的估计量是封闭形式的,计算上非常高效,但这可能意味着它在某些“硬”问题上会失效。这个问题扎根于本文未触及的文献领域,但值得研究者去探索。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论