tteICE: An R Package for Estimating Treatment Effects on Time-to-Event Outcomes with Intercurrent Events in Two-Arm Trials¶
作者: Yuhao Deng, Yi Zhou, Yi Wang, Shasha Han
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2609.23473
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的方向是因果推断与生存分析的交叉领域,核心问题为:在存在"intercurrent events(ICEs,间发事件)"的两臂临床试验中,如何定义、识别并估计具有因果解释的时间-事件结局治疗效应。ICEs 是随机化后发生、影响主要结局的解释或测量的事件,如治疗中断、使用补救药物、发生竞争事件(如死亡)等。该问题的根本困难在于:ICEs 的存在使得"在治疗策略下的事件发生时间"这一潜在结局可能不再良定义(如竞争事件使主要结局不可观测),或使简单的风险比估计失去因果含义。该子方向当前处于方法框架已建立、但软件工具严重滞后的成熟度阶段——ICH E9 (R1) 附录(Committee et al. 2019)已给出五策略的概念框架,但缺乏统一、易用的实现工具。
发展脉络(history)¶
- 奠基工作:ICH E9 (R1) 附录(Committee et al. 2019)首次以监管文件形式提出五策略框架(treatment policy、composite、while on treatment、hypothetical、principal stratum),为处理 ICEs 提供了标准化语言。这是整个领域的"宪法性"文件,后续方法学工作均围绕如何将五策略操作化展开。
- 主要进展:Deng, Han, and Zhou (2025)(即本文引用的核心方法学论文,发表于 Statistics in Medicine)在随机化试验框架下,为五策略分别定义了具有因果解释的 estimand(潜在累积发生函数 CIF),推导了非参数估计量的渐近方差(基于 functional delta method 与 empirical process theory),并进一步提出了半参数有效估计量(基于 efficient influence function, EIF)。该工作填补了"五策略 → 可估计 estimand → 有效推断"的完整链条,是本文包的方法学基础。同期,Deng, Wang, and Zhou (2024) 将半参数有效估计推广至半竞争风险设定,并讨论了将 estimand 解释为自然/控制效应所需的序贯可忽略性假设。
- 当前 frontier:方法学上,前沿问题包括:(i) 时变 ICEs 与纵向数据的扩展;(ii) 在部分模型误设定下的稳健性(本文提到的 multiple robustness 性质);(iii) 与 target trial emulation 框架的结合(本文在 observational data 部分引用了 Hernán and Robins 2016)。软件实现上,现有 R 包(如
cmprsk、timereg、fastcmprsk、tidycmprsk、mets、SemiCompRisks、survival、flexsurv、mstate)均只覆盖单一策略或单一数据结构的估计,缺乏统一实现五策略的因果推断工具。 - 本文的位置:本文是软件实现层的工作,将 Deng et al. (2025) 的方法学成果封装为 R 包
tteICE,同时支持竞争风险和半竞争风险两种数据结构、非参数与半参数有效两种估计方法、五种策略,并集成绘图与 Shiny 交互界面。其定位是"方法学成果的工程化落地",而非新方法学贡献。
子线索聚类¶
- 五策略 estimand 的形式化与识别(Deng, Han, Zhou 2025; Deng, Wang, Zhou 2024):核心是给出五策略下 CIF 的数学定义、识别条件(随机化、随机删失、竞争风险可识别性)与因果解释(自然效应 vs. 控制效应)。
- 半参数有效估计与推断(Deng et al. 2025 及其引用的 semiparametric efficiency 文献):基于 EIF 构造渐近有效估计量,实现 multiple robustness;本文附录 A.2 给出了各策略 EIF 的具体形式。
- 竞争风险/半竞争风险的生存分析工具(Gray 1988; Fine and Gray 1999; Lee, Rondeau, Haneuse 2017; 以及
cmprsk、timereg、fastcmprsk、SemiCompRisks、mstate、flexsurv、stpm2cr等):这些是本文的"底层工具",提供 CIF 估计、风险集处理等基础功能,但均不涉及因果 estimand 的定义。 - 因果推断的软件生态(
MatchIt、mediation、causalCmprsk、PStrat):这些包分别处理匹配、中介分析、竞争风险下的平均处理效应、主分层分析,但均未覆盖 ICH E9 (R1) 五策略的完整框架。
这个方向在追问的核心问题¶
- 如何为五策略下的 estimand 给出严格的因果定义? 即:当 ICEs 存在时,"治疗效应"到底指什么?不同策略回答的是不同的科学问题(如 treatment policy 问"开处方 vs 不开处方的效果",hypothetical 问"若 ICE 被控制/移除时的效果")。
- 如何在观测数据中识别这些 estimand? 需要哪些假设(随机化、无未测量混杂、序贯可忽略性、主分层可忽略性等)?哪些 estimand 在何种数据结构(竞争 vs 半竞争)下可识别?
- 如何构造渐近有效且稳健的估计量? EIF 的推导、multiple robustness 的实现、方差估计的可靠性。
- 如何让非方法学专家(临床研究者)能够正确使用这些方法? 这是本文试图回答的问题——通过软件封装降低使用门槛。
⚠️ 作者的 framing(必须明确标注成"这是作者的说法")¶
作者在引言中将领域缺口 frame 为:"尽管 ICH E9 (R1) 提出了五策略框架,且理论上已有对应的方法学论文(Deng et al. 2025),但现有软件生态中缺乏一个统一实现这些策略的 R 包,导致临床研究者难以将这些方法应用于实际数据。" 作者将本文定位为"填补软件空白"的显然下一步。作者淡化的竞争路线包括:(i) 将五策略分别映射到现有包(如用 cmprsk 做 while on treatment、用 PStrat 做 principal stratum)的"拼凑方案"——作者认为这需要大量数据预处理且无法保证估计量的有效性;(ii) 基于参数模型的贝叶斯方法——作者未在引言中讨论。值得研究者去查的问题:作者声称"没有统一工具",但未系统比较 riskRegression、adjustedCurves 等近期包是否已部分覆盖五策略;此外,作者对 observational data 的处理仅提及 target trial emulation,未深入讨论在非随机化数据中五策略 estimand 的识别条件是否与 RCT 不同。
张力¶
未见明显对立引用。但存在一个潜在张力:Deng et al. (2025) 的方法学建立在随机化试验的框架上,而本文声称适用于 observational studies(通过 target trial emulation),这两者所需的识别假设强度不同(RCT 只需随机化+随机删失,观测研究需无未测量混杂+正性+正确模型设定)。作者在文中承认了这一点("the analytical framework is also applicable to observational data under specific conditions in which a target trial can be explicitly emulated"),但未深入讨论在观测数据中五策略 estimand 的识别条件是否与 RCT 相同,以及半参数有效估计量的 multiple robustness 性质在观测数据下是否仍然成立。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据¶
符号(逐个点名):
- \(W \in \{0, 1\}\):治疗分配指示(1 = 治疗组,0 = 对照组)。随机化试验中 \(W\) 独立于所有潜在结果。
- \(T(w)\):潜在主要结局事件时间(在治疗分配 \(w\) 下)。这是潜在(counterfactual)量,每个个体只有一个版本的 \(T(w)\) 可被观测。
- \(R(w)\):潜在 ICE 发生时间(在治疗分配 \(w\) 下)。同样是潜在量。
- \(C(w)\):潜在删失时间(在治疗分配 \(w\) 下)。潜在量。
- \(t^*\):研究结束时间(固定常数,设计参数)。
- \(\mu^w_k(t)\):策略 \(k\) 下、治疗组 \(w\) 的潜在累积发生函数(CIF),即 \(P(\text{策略 } k \text{ 下的事件时间} < t)\)。这是目标 estimand。
- \(\tau^k(t) = \mu^k_1(t) - \mu^k_0(t)\):策略 \(k\) 下的治疗效应(CIF 之差)。这是因果 estimand。
- \(\Lambda_j(t; w)\):第 \(j\) 类事件的累积风险函数(\(j=1\) 为主要结局,\(j=2\) 为 ICE),在治疗组 \(w\) 下。这是中间量,用于构造 CIF。
- \(\Lambda_0(t; w)\):删失的累积风险函数。中间量。
- \(M_j(t; w, x)\):第 \(j\) 类事件的鞅过程。技术工具,用于推导 EIF 与渐近方差。
- \(X\):基线协变量向量(观测研究中用于调整混杂)。可观测量。
- \(P(W = w \mid X)\):倾向评分(观测研究)。可观测量(需估计)。
模型(用直白语言写出数据生成机制):
- 潜在结果框架:每个个体 \(i\) 有潜在事件时间 \(\{T_i(1), T_i(0)\}\) 和潜在 ICE 时间 \(\{R_i(1), R_i(0)\}\)。随机化保证 \(\{T_i(1), T_i(0), R_i(1), R_i(0)\} \perp W_i\)。
- 竞争风险结构:在竞争风险设定下,\(T(w)\) 和 \(R(w)\) 是竞争事件——先发生者决定观测到的结局。在半竞争风险设定下,\(R(w)\) 可以发生在 \(T(w)\) 之前或之后,但 \(T(w)\) 在 \(R(w)\) 之后仍可被观测(即 ICE 不阻止主要结局的观测,但可能改变其风险)。
- 可观测数据:对每个个体,研究者观测到:
- 治疗分配 \(W_i\);
- 主要结局时间 \(\tilde{T}_i = \min\{T_i(W_i), R_i(W_i), C_i(W_i)\}\) 及指示 \(\Delta^T_i = I\{T_i(W_i) \le \min(R_i(W_i), C_i(W_i))\}\);
- ICE 时间 \(\tilde{R}_i = \min\{R_i(W_i), C_i(W_i)\}\) 及指示 \(\Delta^R_i = I\{R_i(W_i) \le C_i(W_i)\}\);
- 删失时间 \(C_i\)(假设独立于 \((T, R)\) 给定 \(W\));
- 基线协变量 \(X_i\)(观测研究)。
- 关键点:\(T_i(1)\) 和 \(T_i(0)\) 中只有一个可被观测(取决于 \(W_i\)),且 \(T_i(w)\) 可能因 \(R_i(w)\) 先发生而不可观测(竞争风险)或仍可观测但风险改变(半竞争风险)。这就是"想要但观测不到"的部分——因果推断需要靠随机化(RCT)或可忽略性(观测研究)来识别。
第二步:最小内核¶
最小内核:考虑最简单的竞争风险设定,无协变量,完全随机化试验,目标 estimand 是 treatment policy 策略下的 CIF 之差 \(\tau^{tp}(t) = P(T(1) < t) - P(T(0) < t)\)。
核心命题:在随机化、随机删失、正性假设下,\(\tau^{tp}(t)\) 可由观测数据识别,且非参数估计量为
为什么成立:在 treatment policy 策略下,ICE 被视为自然发生的事件,不改变 estimand 的定义——我们问的是"如果随机分配到治疗组 vs 对照组,主要结局的累积发生率差异"。由于随机化,\(P(T(w) < t) = P(T < t \mid W = w)\)(一致性 + 随机化),而右侧恰是观测数据中治疗组 \(w\) 的 CIF。Nelson–Aalen 估计量一致估计累积风险,经指数变换得到 CIF 的一致估计。渐近正态性由 empirical process theory 保证,方差由 functional delta method 给出(即本文附录 A.1 中的公式)。
这个最小内核揭示了整篇论文的本质:五策略的区别仅在于如何定义"事件时间"——treatment policy 直接用观测到的主要结局时间;composite 将 ICE 和主要结局合并为复合事件;while on treatment 将 ICE 视为删失;hypothetical 设想 ICE 风险被控制(需额外假设);principal stratum 将分析限制在"永不发生 ICE"的亚组(需主分层可忽略性)。一旦 estimand 定义清楚,估计与推断的框架(非参数 + 半参数有效)是统一的。本文的贡献在于:将这些策略的 estimand 统一在一个软件框架中,并实现半参数有效估计(EIF 的具体形式见附录 A.2)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:如何在一个统一的 R 包中实现 ICH E9 (R1) 五策略下、竞争风险和半竞争风险两种数据结构中的时间-事件结局治疗效应估计与推断。
- 核心工具/方法:将 Deng et al. (2025) 的非参数估计(functional delta method 推导渐近方差)与半参数有效估计(基于 EIF,实现 multiple robustness)方法封装为
tteICE包,提供surv.tteICE()(竞争风险)和scr.tteICE()(半竞争风险)两个主函数,并集成绘图与 Shiny 交互界面。 - 主要结论:通过模拟研究验证了包的正确性——非参数与半参数有效估计量的偏差可忽略,渐近标准误与经验标准误接近,置信区间覆盖率接近名义水平;通过 BMT 真实数据示例展示了包的实际使用流程。
关键设定与假设¶
在第二节最小记号的基础上,本文的完整设定包括:
- 数据结构:竞争风险(competing risks)和半竞争风险(semi-competing risks)两种。竞争风险下,ICE 和主要结局是互斥的竞争事件;半竞争风险下,ICE 不阻止主要结局的观测,但可能改变其风险。
- 五策略的 estimand 定义(表 1):
- Treatment policy (tp):\(P(T(w) < t)\),ICE 自然发生,不干预。
- Composite (cv):\(P(\min\{T(w), R(w)\} < t)\),将 ICE 和主要结局合并为复合事件。
- While on treatment (wo):\(P(T(w) < t, R(w) \ge t)\),仅计数未发生 ICE 时的主要结局事件。
- Hypothetical (hp):设想 ICE 风险被控制(如设为对照组水平或移除),需额外假设(如序贯可忽略性)。
- Principal stratum (ps):\(P(T(w) < t \mid R(1) = R(0) = \infty)\),仅关注"永不发生 ICE"的亚组,需主分层可忽略性假设。
- 识别假设:
- SUTVA(无干扰、单一版本处理):隐含假设。
- 随机化:治疗分配独立于所有潜在结果(RCT 设定)。
- 随机删失:删失时间独立于潜在事件时间(给定治疗和协变量)。
- 正性:每个治疗组在每个风险集内有正的概率处于风险中。
- 观测研究:需额外假设无未测量混杂(通过 target trial emulation 框架),以及倾向评分模型和结局模型的正确设定(对半参数有效估计的 multiple robustness 性质)。
- 半参数有效估计的工作模型:Cox 比例风险模型作为结局和 ICE 的工作模型;倾向评分用 logistic 回归。Multiple robustness 性质:只要(倾向评分、结局风险、删失风险)三组模型中有两组正确设定,估计量即一致。
主要结果¶
理论结果(来自 Deng et al. 2025,本文引用并实现):
- 五策略下 CIF 的非参数估计量及其渐近方差(functional delta method 推导,附录 A.1)。
- 五策略下 CIF 的半参数有效估计量(EIF 形式,附录 A.2),具有 multiple robustness 性质。
- 渐近正态性由 empirical process theory 保证。
模拟验证(附录 B):
- 设定:完全随机化试验,结局风险 \(\lambda_1(t; w) = a_w t\)(Weibull),ICE 风险 \(\lambda_2(t; w) = c_w\)(常数),样本量 \(n=500\),\(B=1000\) 次重复。
- 结果:所有策略下估计量的偏差均小于 0.001(表 S2、S4),渐近标准误与经验标准误的比值在 0.95–1.05 之间,95% 置信区间覆盖率在 0.94–0.96 之间。半参数有效估计在观测研究设定下(有协变量、有混杂)表现良好,且对工作模型的部分误设具有稳健性。
真实数据示例(BMT 数据):
- 数据:137 名骨髓移植患者,主要结局为死亡,ICE 为复发。
- 结果:展示了五策略下 CIF 估计和 treatment effect 估计的图形输出。例如,treatment policy 策略下 AML vs ALL 的死亡 CIF 差异在随访早期为负(AML 组死亡风险更低),后期趋于零;principal stratum 策略的置信区间最宽(因亚组样本量小)。
真实例子与应用¶
本文使用 Klein and Moeschberger (1997) 的 BMT 数据作为示例,完整展示了从数据准备、模型拟合到结果可视化的流程。该示例的核心目的是验证包的可用性,而非发现新的科学结论。示例中特别强调了半参数有效估计在观测研究中的应用(通过 target trial emulation 框架),以及如何处理协变量以实现混杂调整。
🔎 结论是否比证明窄¶
- 明确窄于证明的声明:作者在讨论部分承认,对于 observational data,半参数有效估计量的 multiple robustness 性质依赖于工作模型的正确设定,但未给出在部分模型误设下的理论保证(仅通过模拟验证)。作者写道:"Under partial model misspecification, the standard error is no longer accurate; bootstrapping standard error should be used instead."——这是一个条件性声明,但未给出 bootstrap 在何种条件下有效。
- 被泛化的声明:作者声称包适用于"randomized controlled trials and observational studies",但 observational studies 的适用性依赖于 target trial emulation 的假设(如无未测量混杂),这些假设在文中未形式化。作者在引言中写道:"the analytical framework is also applicable to observational data under specific conditions in which a target trial can be explicitly emulated"——"specific conditions"未明确列出。
- 未证明但被 claim 的性质:作者在摘要中声称包提供"valid causal inference",但 causal validity 依赖于识别假设(随机化或可忽略性),这些假设在包中无法检验。作者在讨论中承认了这一点,但未提供敏感性分析工具。
四、开放问题¶
-
时变 ICEs 与纵向数据:本文假设每个个体至多发生一次 ICE,且 ICE 状态为二元。实际临床试验中 ICEs 可能多次发生(如反复治疗中断),或 ICE 状态随时间变化。将五策略 estimand 扩展至时变 ICE 设定需要新的识别条件与估计方法。扎根于:作者在讨论中写道"extending the package to accommodate additional data types and estimands is of interest",但未具体展开。
-
ICE 发生时间未知(区间删失):本文假设 ICE 发生时间精确观测。若 ICE 仅在随访检查时被发现(区间删失),估计方法需要调整。扎根于:作者在讨论中提及"the exact timing of ICEs may be unobservable",但未给出解决方案。
-
敏感性分析工具:本文的 causal 解释依赖于不可检验的假设(随机化、无未测量混杂、序贯可忽略性)。包中未提供敏感性分析功能。扎根于:作者在讨论中承认"the validity of causal interpretations relies on untestable assumptions",但未提供工具。
-
半参数有效估计在部分模型误设下的理论保证:作者通过模拟验证了 multiple robustness,但未给出在部分模型误设下的渐近理论(如收敛速度、置信区间覆盖率的理论保证)。扎根于:作者在附录 A.2 中仅给出 EIF 形式,未讨论误设下的性质。
-
与 target trial emulation 的深度整合:本文仅提及 target trial emulation 框架,但未提供工具来帮助用户明确指定目标试验(如 eligibility criteria、treatment strategies、causal contrasts)。扎根于:作者在引言中引用 Hernán and Robins (2016),但未在包中实现相关功能。
-
多重 ICE 类型与复合 estimand:本文的五策略假设 ICE 为单一类型。当存在多种 ICE(如治疗中断、使用补救药物、发生非致命事件)时,如何定义和估计复合 estimand 尚不明确。扎根于:作者在讨论中提及"multiple types of ICEs"但未展开。
提示:若想确认上述开放问题是否为真 gap,建议去读近 5 年 Statistics in Medicine、Biometrics、JRSS-A 上关于 intercurrent events 的 5 篇左右论文的引言——若多篇都指向同一问题(如时变 ICEs),则可能是共识性 gap;若各篇提出的框架互相冲突(如 hypothetical vs. principal stratum 的识别条件不同),则可能是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub