跳转至

Interim Analysis in Sequential Multiple Assignment Randomized Trials for Survival Outcomes

讲者: Zi Wang
会场: Advances in Statistical Methods for Biomedical and Clinical Studies
报告题目: Interim Analysis in Sequential Multiple Assignment Randomized Trials for Survival Outcomes
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:如何在序贯多组随机试验(SMART)中,对生存时间(time-to-event)结局进行有效的中期分析(interim analysis),从而在不膨胀I类错误的前提下,允许因疗效显著而提前终止试验,以节省时间与资源。 当前成熟度:SMART设计本身(用于构建和比较动态治疗方案DTR)已有较成熟的框架,但其中期分析方法主要针对连续结局(如均值),针对生存结局的方法尚在早期发展阶段。

发展脉络(history)

  • 奠基工作:SMART设计与DTR框架
  • Murphy (2005):提出了SMART作为开发自适应治疗策略的实验设计,奠定了多阶段随机化的理论基础。
  • Chakraborty & Murphy (2014):系统综述了DTR的估计方法(Q-learning、边际结构模型)和推断技术,成为该领域的标准参考。
  • Nahum-Shani et al. (2017):展示了如何用Q-learning从SMART数据中构建更个性化的ATS,推动了方法的实际应用。

  • 主要进展:SMART中的中期分析(针对连续结局)

  • Wu, Wang & Wahed (2021):首次提出SMART中的中期监测(IM-SMART),基于逆概率加权的全局Wald检验,使用多元卡方分布建立边界。这是本文的直接前驱。
  • Manschot, Laber & Davidian (2023):改进了Wu等人的方法,通过利用部分信息(即尚未完成所有阶段的患者数据)来提高效率。本文引用称其“improving upon it to accommodate partial information”。

  • 当前frontier:生存结局的中期分析

  • Tsiatis & Davidian (2024):提出了一个广义log-rank型检验,用于比较SMART中嵌入的DTR的生存分布,可纳入协变量信息。本文将其作为替代统计量(TD统计量)并与之比较。
  • 本文 (Wang, Cheng & Wahed, 2025):在SMART框架下,针对生存结局,提出了基于加权log-rank统计量的中期分析方法,并建立了相应的边界计算程序。

子线索聚类

  1. SMART设计与DTR估计:聚焦于如何设计试验、估计DTR效果(如Q-learning、边际结构模型)。代表:Murphy (2005), Chakraborty & Murphy (2014), Nahum-Shani et al. (2017)。
  2. SMART中的中期分析(连续结局):关注如何在SMART中引入中期停止规则,以连续结局(如均值)为目标。代表:Wu et al. (2021), Manschot et al. (2023)。
  3. 生存结局的检验与中期分析:关注生存时间作为结局时的假设检验与中期监测。代表:Tsiatis & Davidian (2024), 本文。

这个方向在追问的核心问题

  1. 如何构造有效的检验统计量? 在SMART中,由于患者路径重叠和后续随机化导致的缺失,需要加权。对于生存结局,log-rank统计量如何加权?其渐近分布是什么?
  2. 如何计算中期分析之间的相关性? 生存结局的检验统计量在不同分析时间点的协方差结构复杂,不满足独立增量性质。如何估计这个协方差矩阵以建立正确的边界?
  3. 如何选择边界类型? Pocock、OBF、Lan-Demets等边界在SMART生存结局设定下如何调整?哪种在控制I类错误和保持功效方面表现更好?
  4. 如何处理部分信息? 在中期分析时,许多患者尚未完成所有阶段,如何利用他们的部分数据来提高效率?

⚠️ 作者的framing

  • 作者把缺口frame成什么? 作者明确指出:“the interim monitoring method for time-to-event outcomes in SMART remains unclear.” 他们将自身工作定位为填补这一空白,即把已有的连续结局中期分析方法(Wu et al., 2021; Manschot et al., 2023)扩展到生存结局。
  • 哪些竞争路线被淡化或回避? 作者淡化了Tsiatis & Davidian (2024)的统计量,将其作为“alternative test statistic”而非核心方法。他们强调自己的加权log-rank统计量与TD统计量“belong to the same class”,但并未深入比较两者在效率或稳健性上的差异。此外,作者回避了非比例风险这一常见挑战——他们的方法基于log-rank检验,当比例风险假设不成立时,检验功效可能受损。Tsiatis & Davidian (2025) 的独立增量工作(被引文献[12])正是针对此问题,但本文未讨论其适用性。
  • 什么明显该被引/该存在、却没出现在intro里? 作者未引用关于SMART中响应自适应随机化(RAR) 的工作(如Wang et al., 2021; Norwood et al., 2024)。这些工作与中期分析有潜在联系(都涉及在试验过程中根据累积数据调整设计),但本文完全未提及。此外,关于SMART中参与者福利的讨论(如Wang et al., 2022)也未出现,这可能是一个值得研究者去查的缺口。

张力

未见明显对立引用。所有被引工作基本沿着“SMART设计 → 连续结局中期分析 → 生存结局中期分析”的线性发展路径,彼此之间没有矛盾结论。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • n:总样本量。
  • Aj:初始治疗(j=1,2)。
  • Bk:对初始治疗有反应(responder)后的维持治疗(k=1,2)。
  • Cl:对初始治疗无反应(non-responder)后的补救治疗(l=1,2)。
  • AjBkCl:一个动态治疗方案(DTR),即先用Aj,若有反应则用Bk,若无反应则用Cl。
  • Ti:患者i的真实生存时间(从初始随机化到死亡)。
  • Vi:患者i的删失时间。
  • Ui = min(Ti, Vi):观测时间。
  • δi = I(Ti ≤ Vi):事件指示符(1=观察到死亡,0=删失)。
  • ηi:是否进入第二阶段的指示符(1=进入,0=在第一阶段死亡/退出)。
  • Ri:对初始治疗的反应指示符(1=有反应,0=无反应)。仅在ηi=1时观测。
  • Ii(Aj):是否被分配到初始治疗Aj的指示符。
  • Ii(Bk):是否被分配到维持治疗Bk的指示符。仅在ηi=1且Ri=1时观测。
  • Ii(Cl):是否被分配到补救治疗Cl的指示符。仅在ηi=1且Ri=0时观测。
  • Wjkl,i(s):在时间s时,患者i对DTR AjBkCl的时变逆概率权重。
  • Ni(s) = I(Ui ≤ s, δi = 1):患者i在时间s前的计数过程(事件发生)。
  • Yi(s) = I(Ui ≥ s):患者i在时间s的风险过程(仍在风险集中)。
  • ¯Njkl(s) = Σ_i Wjkl,i(s) Ni(s):加权事件计数。
  • ¯Yjkl(s) = Σ_i Wjkl,i(s) Yi(s):加权风险集大小。
  • Zjkl:比较DTR AjBkCl与参考DTR A1B1C1的加权log-rank统计量。
  • Z(t) = (Zjkl(t))^T:在时间t时所有比较的log-rank统计量向量。
  • T(t) = n^{-1} Z(t)^T Σ̂(t)^{-1} Z(t):在时间t时的Wald型检验统计量。
  • Λ_jkl(t):DTR AjBkCl的累积风险函数。

  • 模型

  • 数据生成机制:一个两阶段SMART设计(SMART1,图1)。患者先被随机分配到A1或A2(概率ℓ_j)。若进入第二阶段(η_i=1),则根据反应状态(R_i)被随机分配到B1/B2(概率p_k)或C1/C2(概率q_l)。生存时间T_i由第一阶段时间T1_i和第二阶段时间T2_i组成(若η_i=1)。各阶段生存时间服从指数分布,参数取决于治疗分配。删失时间V_i独立于生存时间。
  • 统计模型:非参数或半参数。核心假设是无未测量的混杂(通过随机化保证)和删失独立于生存时间(给定协变量)。逆概率加权用于处理因后续随机化导致的“系统缺失”。

  • 可观测数据

  • 可观测{Ii(Aj), ηi, ηiT1i, ηiRi, ηiRiIi(Bk), ηi(1-Ri)Ii(Cl), Ui, δi}。注意,第二阶段治疗分配和反应状态仅在患者进入第二阶段后才被观测到。
  • 想要但观测不到:如果患者被分配到某个DTR,其潜在生存时间。我们只能观测到患者实际遵循的路径下的生存时间。逆概率加权通过创建一个伪总体来估计每个DTR下的生存分布,其中每个患者都被“复制”到所有他们可能遵循的DTR上。

第二步:讲最小内核

最简特例:两阶段SMART,只有两个DTR(SMART2的简化版)

考虑一个极度简化的SMART2设计:只有初始治疗A1和A2,且只有对A1有反应的患者才进入第二阶段并随机分配到B1或B2。非反应者不再接受治疗。这样,我们只有两个DTR:A1B1和A1B2。目标是检验这两个DTR的生存分布是否相同。

  • 可观测数据{Ii(A1), ηi, ηiRi, ηiRiIi(B1), Ui, δi}。注意,只有被分配到A1的患者才可能进入第二阶段。
  • 逆概率权重:对于DTR A1B1,权重为:
  • 若患者被分配到A1且尚未进入第二阶段(s < T1_i):W_{11,i}(s) = 1/ℓ_1(ℓ_1是A1的随机化概率,通常为0.5)。
  • 若患者被分配到A1、有反应且被分配到B1(s ≥ T1_i):W_{11,i}(s) = (1/ℓ_1) * (1/p_1)(p_1是B1的随机化概率)。
  • 若患者被分配到A1、无反应:W_{11,i}(s) = (1/ℓ_1) * 1(非反应者权重不再调整,因为他们不进入第二阶段)。
  • 加权log-rank统计量:比较A1B1与A1B2。由于只有一个参考DTR(A1B1),log-rank统计量退化为一个标量: Z = ∫_0^∞ [¯Y_{11}(s) ¯Y_{12}(s) / (¯Y_{11}(s) + ¯Y_{12}(s))] * [d¯N_{11}(s)/¯Y_{11}(s) - d¯N_{12}(s)/¯Y_{12}(s)] 其中,¯N_{11}(s)¯Y_{11}(s)是加权后的事件和风险过程。
  • 检验:在零假设(两个DTR生存分布相同)下,Z渐近服从均值为0的正态分布。方差可通过渐近线性化估计。中期分析时,在时间t1计算Z(t1),若|Z(t1)| > b1(某个边界),则停止并拒绝H0;否则继续到最终分析t2,若|Z(t2)| > b2则拒绝。
  • 核心困难Z(t1)Z(t2)的协方差Cov(Z(t1), Z(t2))不满足独立增量性质(即不等于Var(Z(t1))),因为生存数据是累积的。本文的核心贡献就是解决了这个协方差估计问题,从而可以正确计算边界b1和b2。

这个最小内核揭示了整篇论文的核心:如何估计不同分析时间点上的加权log-rank统计量之间的协方差,以建立正确的序贯检验边界。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对生存结局的SMART,开发了具有统计有效性的中期监测方法,允许在疗效显著时提前终止试验。
  2. 核心工具/方法:提出了一个加权log-rank卡方统计量,用于比较多个嵌入DTR的生存分布;通过渐近线性化估计统计量在不同分析时间点的协方差矩阵;并基于此建立了Pocock、OBF和Lan-Demets边界。
  3. 主要结论:在模拟中,所提出的方法(特别是使用渐近线性化估计协方差)能很好地控制I类错误(接近名义水平0.05),并能在保持功效的同时显著降低期望样本量(例如,OBF边界下期望样本量减少7%-19%)。Tsiatis-Davidian统计量在SMART1(8个DTR)下I类错误略有膨胀,但在SMART2(4个DTR)下表现良好。

关键设定与假设

  • 设定:两阶段SMART设计,两种变体:
  • SMART1:初始治疗A1/A2,反应者随机到B1/B2,非反应者随机到C1/C2。共8个嵌入DTR。
  • SMART2:初始治疗A1/A2,反应者随机到B1/B2,非反应者不再接受治疗。共4个嵌入DTR。
  • 假设
  • 随机化:各阶段的治疗分配概率已知且为正(ℓ_j, p_k, q_l > 0)。
  • 删失独立:删失时间V_i独立于生存时间T_i和所有治疗分配。
  • 一致性:观测到的生存时间等于患者实际遵循的DTR下的潜在生存时间。
  • 正则性条件:确保加权计数过程和风险过程收敛到确定性的极限(如¯Y_{jkl}(s)/n → y_{jkl}(s)),这是渐近理论的标准条件。
  • 相比已有文献的强化/放宽
  • 相比Wu et al. (2021)(连续结局),本文将其扩展到生存结局,处理了更复杂的协方差结构。
  • 相比Manschot et al. (2023)(利用部分信息),本文未采用部分信息方法,而是使用时变权重来纳入尚未完成所有阶段的患者。这是一个简化,但可能损失效率。

主要结果

  • 定理1:定义了向量Q(t_m)使得T(t_m) = Q(t_m)^T Q(t_m),并指出在零假设下,堆叠向量Q = (Q(t_1), ..., Q(t_M))^T服从均值为0、协方差矩阵为Ψ的多元正态分布。这为建立中期边界提供了理论基础,因为T(t_m)的联合分布是多元卡方分布(Wishart类型)。
  • 协方差估计:通过渐近线性化,将Z_{jkl}表示为独立同分布项Z_{jkl,i}的和,从而可以用Σ̂(t) = n^{-1} Σ_i Ẑ_i(t) Ẑ_i(t)^T估计Cov(n^{-1/2} Z(t))。对于跨时间点的协方差Cov(Z(t_m), Z(t_m')),作者提出了两种实用方法:
  • 近似法:假设独立增量性质(即Cov(Z(t_1), Z(t_2)) ≈ Var(Z(t_1))),这在信息时间比例合适时近似成立。
  • 误差花费函数法:使用Lan-Demets方法,无需预先指定分析次数和时间,通过序贯确定边界来避免直接估计跨时间协方差。
  • 模拟结果
  • I类错误控制:使用渐近线性化估计协方差时,LR和TD统计量的I类错误在名义水平0.05附近(如SMART1下LR为3.7%-4.4%,SMART2下为5.4%-6.2%)。使用Bootstrap估计时,I类错误普遍膨胀(如SMART2下高达11.6%)。
  • 功效与期望样本量:OBF边界在保持功效(与单次分析相近)的同时,显著降低了期望样本量(如Alt1下从500降至466)。Pocock边界降低样本量更多,但功效损失也更大。
  • LR vs TD:在SMART1(8个DTR)下,TD统计量的I类错误略高于LR(如6.4% vs 4.0%),但功效也更高(如82% vs 78%)。在SMART2(4个DTR)下,两者表现相似。

证明路线与技术技巧

  • 整体路线
  • 构造加权log-rank统计量:定义Z_{jkl},通过逆概率加权W_{jkl,i}(s)来调整因后续随机化导致的缺失。
  • 渐近线性化:将Z_{jkl}表示为独立同分布项的和Σ_i Z_{jkl,i} + o_p(1)。关键步骤是将dN_i(s)替换为dM_i(s) + Y_i(s) dΛ_0(s),并利用¯Y_{jkl}(s)/ (¯Y_{jkl}(s) + ¯Y_{111}(s))收敛到π_{jkl}(s)这一事实,消去dΛ_0(s)项。
  • 估计协方差:基于渐近线性表示,用Ẑ_i(t) Ẑ_i(t)^T的样本均值估计Cov(n^{-1/2} Z(t))。对于跨时间协方差,要么近似,要么用误差花费函数回避。
  • 建立边界:利用定理1,将T(t_m)的联合分布转化为多元卡方分布。通过模拟或数值积分,找到满足整体I类错误为α的边界b_1, ..., b_M
  • 关键跳跃点
  • Z_{jkl}Σ_i Z_{jkl,i}的渐近等价:这是整个推断的基础。作者通过将dN_i(s)替换为dM_i(s) + Y_i(s) dΛ_0(s),并证明¯Y_{jkl}(s)/ (¯Y_{jkl}(s) + ¯Y_{111}(s))收敛到π_{jkl}(s),从而消去了dΛ_0(s)项,使得Z_{jkl}的渐近分布只依赖于dM_i(s),而dM_i(s)是均值为0的鞅差。
  • 跨时间协方差的处理:这是生存结局中期分析的核心难点。作者没有给出一个封闭形式的解析解,而是提供了两种实用方案(近似和误差花费函数),这在应用中是合理的。
  • 技术技巧点名
  • 逆概率加权(IPW):用于处理因后续随机化导致的“系统缺失”,创建伪总体。
  • 渐近线性化(Asymptotic linearization):将复杂的统计量表示为独立同分布项的和,从而简化方差估计。
  • 鞅理论(Martingale theory):通过dM_i(s) = dN_i(s) - Y_i(s) dΛ_0(s),利用鞅差的性质进行渐近分析。
  • 多元卡方分布(Multivariate chi-square distribution):用于描述T(t_m)的联合分布,并建立边界。
  • 误差花费函数(Error spending function):Lan-Demets方法,用于灵活地序贯确定边界,避免直接估计跨时间协方差。

真实例子与应用

  • 数据:Children's Cancer Group高危险神经母细胞瘤研究(Matthay et al., 1999, 2009)。539名患者,其中379名无进展者进入第一阶段随机化(ABMT vs 继续化疗),203名无进展者进入第二阶段随机化(cis-RA vs 无治疗)。这是一个SMART2设计。
  • 方法应用:作者假设患者按研究ID顺序均匀入组,在50%事件发生时(1254天,n=289)进行一次中期分析。使用加权log-rank和TD统计量,计算Pocock和OBF边界。
  • 结果
  • 中期分析:LR统计量=3.34,TD统计量=3.14,均低于Pocock边界(约9.1)和OBF边界(约11.5),因此不拒绝H0,试验继续。
  • 最终分析:LR统计量=5.80,TD统计量=6.56,仍低于最终边界(OBF下约8),因此最终结论也是不拒绝H0。
  • 生存曲线图(图3)显示四个DTR的生存曲线有差异(如中位生存时间从440天到526天),但差异不显著。
  • 这个例子想说明什么:展示了所提出的中期分析方法在实际数据中的应用,并说明其与最终分析结论一致。同时,也揭示了在样本量有限的情况下,即使生存曲线有差异,也可能无法达到统计显著性。

🔎 结论是否比证明窄

  • 窄结论:作者在模拟中假设了指数分布生存时间,且删失独立于生存时间。这些假设在证明中用于保证正则性条件,但实际应用中可能不成立。作者在讨论中未明确说明方法对模型误设的稳健性。
  • 泛泛claim:作者声称“The proposed interim analysis framework can easily incorporate other boundaries”(如Haybittle边界),但并未在文中展示或证明。这是一个泛泛的声称,缺乏具体验证。
  • 值得注意的点:作者在计算边界时,对于“近似法”假设了独立增量性质,但并未严格证明该性质在SMART生存结局下成立。他们通过模拟验证了其近似效果,但理论上这是一个未解决的问题。

四、开放问题

  1. 部分信息的利用:本文的权重W_{jkl,i}(s)在患者进入第二阶段前只使用初始随机化权重,未利用其部分随访数据。Manschot et al. (2023) 针对连续结局提出了更高效的部分信息方法。如何将部分信息方法扩展到生存结局,以进一步提高中期分析的效率?(扎根于:本文第2.3节对权重的定义,以及Manschot et al. (2023) 的引用。)

  2. 非比例风险下的稳健性:本文的方法基于log-rank检验,当比例风险假设不成立时(如延迟效应、交叉生存曲线),检验功效可能严重受损。Tsiatis & Davidian (2025) 的工作(被引文献[12])提供了处理非比例风险的一般框架。如何将本文的加权log-rank框架与Tsiatis & Davidian (2025) 的独立增量方法结合,以处理SMART中生存结局的非比例风险?(扎根于:本文第1节对log-rank检验的依赖,以及Tsiatis & Davidian (2025) 的独立增量工作。)

  3. 响应自适应随机化(RAR)与中期分析的结合:本文的中期分析假设随机化概率是固定的。但Wang et al. (2021) 和 Norwood et al. (2024) 提出了SMART中的RAR方法,其中随机化概率会根据累积数据动态调整。如何在RAR-SMART中进行中期分析?此时,逆概率权重需要根据更新的随机化概率进行调整,且检验统计量的渐近分布可能更复杂。(扎根于:本文未引用的RAR工作,以及第3.1节中权重W_{jkl,i}(s)依赖于固定随机化概率的设定。)

  4. 更一般的设计与多阶段扩展:本文只考虑了两阶段SMART。如何将方法扩展到三阶段或更多阶段的SMART? 此时,权重结构更复杂,协方差矩阵的维度更高,边界计算的计算负担可能显著增加。(扎根于:本文第6节讨论中“The method can also be extended to accommodate additional stages”这一泛泛声称,但未提供具体方案。)


Maintained by 陈星宇 · Homepage · Source on GitHub

评论