Detecting Early and Late Divergences in Survival Curves Using Nonparametric Effect Measures¶
作者: Patrick B. Langthaler, Jun Ma, Jonas Beck
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2609.02596
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:在生存分析中,当两组生存曲线不满足比例风险假设(如早期发散、后期收敛,或曲线交叉)时,如何有效地进行假设检验并提供可解释的效应度量。当前该领域的成熟度较高,已有大量针对非比例风险的检验方法和效应度量,但大多数方法要么只关注检验(如加权log-rank、MaxCombo),要么只提供单一的全局效应量(如RMST差、win ratio),缺乏一个能同时提供全局效应和时间对比(早期 vs. 晚期)信息的可解释框架。
发展脉络¶
-
奠基工作:log-rank检验(未在本文中明确引用,但作为默认基准被反复提及)是比例风险假设下的最优检验,但在非比例风险下可能失效。Cox比例风险模型(未明确引用)提供了风险比(HR)作为效应度量,但HR在非比例风险下难以解释。
-
主要进展(检验方法):
- 加权log-rank检验:如Gehan-Wilcoxon、Peto-Peto、Fleming-Harrington型检验(Wu and Gilbert 2002; Karrison 2016),通过给不同时间点的事件赋予不同权重来应对非比例风险。Yang and Prentice (2009) 提出了自适应加权log-rank检验,利用Yang-Prentice模型估计的时变风险比来构造权重,在比例和非比例替代下均有良好表现。
- 针对交叉曲线的检验:Qiu and Sheng (2008) 提出了两阶段检验,先做log-rank检验,若不拒绝则再检验交叉效应。Liu, Ditzhaus, and Xu (2020) 提出了基于生存曲线间面积的bootstrap检验。Zhang, Datta, and Qiu (2024) 提出了针对交叉风险率曲线的非参数检验。You et al. (2023) 提出了基于ball divergence的检验。
- MaxCombo型检验:Mukhopadhyay et al. (2022) 和 Lin, Mukhopadhyay, et al. (2023) 评估了MaxCombo检验(取多个加权log-rank统计量的最大值)在免疫肿瘤学试验中的表现,发现其在非比例风险下比log-rank检验更敏感。
-
主要进展(可解释的效应度量):
- 限制平均生存时间(RMST):Royston and Parmar (2013) 提出了RMST作为HR的替代,它不需要比例风险假设,但需要预设一个时间地平线。Pak et al. (2017) 讨论了RMST在癌症临床试验中的可解释性。
- 生命期望差/比(LED/LER):Dehbi, Royston, and Hackshaw (2017) 提出了LED和LER,可在多个时间区间内计算,以捕捉时变效应。
- Win Ratio:Gasparyan et al. (2020) 提出了分层win ratio。Mao (2024) 讨论了win ratio的estimand定义,指出其依赖于比较的时间框架。Wu, Wang, and Li (2026) 比较了win ratio和RMST差在非比例风险下的表现,发现win ratio对早期效应更敏感,而RMST对晚期效应更敏感。
- Mann-Whitney效应:Dobler and Pauly (2018) 研究了右删失和结数据下Mann-Whitney效应的bootstrap和置换推断。
-
当前frontier:现有方法存在一个缺口:omnibus检验(如MaxCombo、面积检验)能提高检测能力,但不提供效应如何随时间变化的描述;而一维的效应度量(如RMST差、win ratio)可能平均掉早期和晚期的相反效应。本文的位置:本文试图填补这个缺口,提出一个二维非参数效应向量,同时提供全局的Mann-Whitney效应(θ)和一个中位数分割的时间对比度(O),以区分早期和晚期的差异。
子线索聚类¶
- 检验方法:关注于提高在非比例风险下的检测能力。包括加权log-rank(Yang and Prentice 2009)、两阶段检验(Qiu and Sheng 2008)、面积检验(Liu, Ditzhaus, and Xu 2020)、MaxCombo(Mukhopadhyay et al. 2022)、ball divergence(You et al. 2023)等。这些方法通常不提供直接的效应量解释。
- 可解释的效应度量:关注于提供临床可解释的、不依赖于比例风险假设的效应量。包括RMST(Royston and Parmar 2013)、LED/LER(Dehbi, Royston, and Hackshaw 2017)、win ratio(Gasparyan et al. 2020; Mao 2024; Wu, Wang, and Li 2026)、Mann-Whitney效应(Dobler and Pauly 2018)。这些方法通常提供一个单一的全局摘要。
- 重叠指数与Mann-Whitney泛函:这是一个更基础的统计理论线索,关注于分布间重叠或排序的概率度量。Parkinson et al. (2018) 提出了生态位重叠的非参数估计和推断。Beck, Langthaler, and Bathke (2025) 结合了随机倾向和分布重叠,提出了改进的非参数效应度量。Dey, Bathke, and Kumar (2025) 研究了尺度族分布下重叠指数的推断。本文的O(F,G)被证明等价于Beck et al. (2025)中的重叠指数。
这个方向在追问的核心问题¶
- 如何同时提供检验和可解释的效应度量? 大多数方法要么是检验(给出p值),要么是效应量(给出估计值),但很少能同时做到。
- 如何用一个简洁的框架捕捉早期和晚期效应的相反方向? 当早期有益、晚期有害时,全局效应量(如RMST差)可能接近零,从而掩盖重要的时变模式。
- 如何在右删失下对非参数效应向量进行联合推断? 需要处理Kaplan-Meier估计量的渐近性质、中位数分割点的随机性以及两个效应分量之间的相关性。
- 如何选择或设计一个对多种非比例风险模式都稳健的检验? 现有研究表明,没有一种检验在所有模式下都是最优的(Li et al. 2015; Dormuth et al. 2022)。
⚠️ 作者的framing¶
- 作者把缺口frame成什么:作者将现有方法分为“testing-focused”和“estimand-focused”两类,并指出“a gap remains: omnibus tests usually do not describe how effects change over time, while one-dimensional estimands may obscure opposing early and late effects.” 因此,本文被定位为“显然的下一步”:一个二维的、同时提供全局效应和时间对比的、可解释的、支持联合推断的框架。
- 哪些竞争路线被他淡化或回避了:
- RMST差:作者承认RMST是“clinically attractive”,但认为“a single global RMST difference ... may still average over opposing early and late effects”。然而,RMST可以通过选择不同的时间地平线(如早期和晚期)来部分解决这个问题,作者没有深入讨论这种可能性。
- Win ratio:作者将其归为“probability-scale treatment effects”,但未详细讨论其与本文θ(F,G)的关系。实际上,win ratio与Mann-Whitney效应有密切联系,但作者没有进行比较。
- 时变协变量或Cox模型的扩展:作者完全回避了通过包含时变协变量或使用平滑时变系数模型来建模时变效应的方法,这些方法也能提供效应随时间变化的描述。
- 什么明显该被引/该存在、却没出现在intro里?:作者没有引用任何关于时变系数Cox模型(如Schoenfeld残差检验、平滑时变系数模型)的文献。这些方法直接建模风险比随时间的变化,是处理非比例风险的另一种主流思路。作者也没有引用关于因果推断中处理时变治疗的文献,尽管本文的框架可以自然地扩展到因果推断设定。
张力¶
未见明显对立引用。所有被引工作都承认log-rank检验在非比例风险下可能失效,并提出了各种改进方案。主要的张力在于“哪种方法最好”,但这是一个依赖于具体替代模式的问题,而非根本性的理论矛盾。Li et al. (2015) 和 Dormuth et al. (2022) 的综述性工作明确指出了这一点。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
T_i:第1组(如对照组)的事件时间,随机变量。C_i:第1组的删失时间,随机变量。U_j:第2组(如治疗组)的事件时间,随机变量。D_j:第2组的删失时间,随机变量。F(t) = P(T ≤ t):第1组事件时间的累积分布函数(CDF),主要待估对象。G(t) = P(U ≤ t):第2组事件时间的CDF,主要待估对象。K(t) = P(C ≤ t):第1组删失时间的CDF,nuisance参数。J(t) = P(D ≤ t):第2组删失时间的CDF,nuisance参数。n_1:第1组的样本量。n_2:第2组的样本量。N = n_1 + n_2:总样本量。X_i = min(T_i, C_i):第1组的可观测时间。Δ_i = 1{T_i ≤ C_i}:第1组的可观测事件指示符(1=事件,0=删失)。Y_j = min(U_j, D_j):第2组的可观测时间。Γ_j = 1{U_j ≤ D_j}:第2组的可观测事件指示符。θ(F, G):Mann-Whitney效应,目标参数(estimand),衡量全局排序。O(F, G):中位数分割时间对比度,目标参数(estimand),衡量早期与晚期排序的差异。ψ(F, G) = (θ(F, G), O(F, G))^T:二维目标参数向量。m:G的中位数,即G(m) = 1/2。θ_≤(F, G):给定U ≤ m的条件Mann-Whitney效应(早期)。θ_>(F, G):给定U > m的条件Mann-Whitney效应(晚期)。
-
模型:
- 两组独立,组内独立同分布。
- 组内删失独立:
T_i ⊥ C_i,U_j ⊥ D_j。 - 这是一个完全非参数模型:对
F和G的形式没有任何参数假设(如比例风险、加速失效时间等)。唯一的结构性假设是独立删失。
-
可观测数据:
- 实际能观测到的是:
(X_i, Δ_i)和(Y_j, Γ_j)。即,对于每个个体,我们只能看到其被删失的时间(X_i或Y_j),以及一个指示该时间是否为真实事件时间的标志(Δ_i或Γ_j)。 - 想要但观测不到的是:真实的事件时间
T_i和U_j。当Δ_i = 0时,我们只知道T_i > X_i,但不知道其确切值。这是右删失数据的核心困难。 - 识别:在独立删失假设下,
F和G可以通过Kaplan-Meier估计量从可观测数据中非参数地识别出来。
- 实际能观测到的是:
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设没有删失(所有事件时间都被观测到),且所有分布都是连续的(没有结)。
在这个特例下:
- 可观测数据简化为T_1, ..., T_{n1}和U_1, ..., U_{n2}。
- Kaplan-Meier估计量退化为经验分布函数F̂(t) = (1/n_1) Σ 1{T_i ≤ t}和Ĝ(t) = (1/n_2) Σ 1{U_j ≤ t}。
- 目标参数:
- θ(F, G) = P(T < U)。这是一个经典的Mann-Whitney参数,衡量从F中随机抽取的一个值小于从G中随机抽取的一个值的概率。如果θ > 1/2,说明T倾向于更小(即第1组事件发生更早)。
- O(F, G) = θ_>(F, G) - θ_≤(F, G),其中θ_≤(F, G) = P(T < U | U ≤ m),θ_>(F, G) = P(T < U | U > m),m是G的中位数。
这个特例下的核心命题:我们想检验H_0: F = G,并估计(θ, O)。
证明怎么走(直觉):
1. 估计:用经验分布函数F̂和Ĝ替换F和G,得到θ̂和Ô。θ̂就是经典的Mann-Whitney U统计量除以n_1 n_2。Ô的计算需要先找到Ĝ的样本中位数m̂,然后分别计算U ≤ m̂和U > m̂两组内的条件Mann-Whitney效应。
2. 渐近性质:由于θ̂和Ô都是F̂和Ĝ的平滑泛函,且F̂和Ĝ是经验过程,通过函数Delta方法,可以证明√N ( (θ̂, Ô)^T - (θ, O)^T )联合收敛到一个均值为零的二维正态分布。
3. 关键难点:Ô的定义依赖于G的中位数m,而估计量Ô依赖于Ĝ的样本中位数m̂。m̂本身是一个随机变量,其渐近分布是正态的。因此,证明Ô的渐近正态性需要处理移动边界问题——即积分区域[0, m̂]和(m̂, ∞)本身是随机的。这需要Hadamard可微性论证,将m̂的随机性线性化。
4. 本文的关键想法:通过Hadamard可微性,将Ô视为(F, G)的泛函,其导数包含一个来自m̂的边界项(见Lemma S4中的-F^±(m)h_G(m))。这使得整个证明可以统一在函数Delta方法的框架下,无需为m̂单独推导分布。
一句话总结:本文在数学上干的事是:定义了一个依赖于中位数分割点的二维非参数泛函ψ(F,G),证明了该泛函在Kaplan-Meier估计量下是Hadamard可微的,从而通过函数Delta方法建立了其估计量的联合渐近正态性,并利用bootstrap进行推断。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对右删失生存数据中非比例风险(特别是早期发散、后期收敛)的模式,提出了一个联合推断框架,包含一个全局Mann-Whitney效应(θ)和一个中位数分割时间对比度(O),以同时提供全局和时变的效应度量。
- 核心工具/方法:基于Kaplan-Meier估计量的非参数泛函估计,利用函数Delta方法证明联合渐近正态性,并开发了基于bootstrap的Wald型检验、max-t型检验和联合置信区间。
- 主要结论:模拟研究表明,在非比例风险(如交叉生存曲线)下,该方法优于log-rank检验,同时维持名义第一类错误率。在黑色素瘤脑转移的真实数据例子中,该方法揭示了标准分析中隐藏的早期治疗优势。
关键设定与假设¶
- 设定:两组独立右删失生存数据,组内独立同分布,组间独立。
-
假设:
- 独立删失:
T_i ⊥ C_i,U_j ⊥ D_j。这是Kaplan-Meier估计量一致性的标准假设。 - 正则性条件(Assumption S1):包括(i)独立同分布和独立删失;(ii)样本量比例收敛;(iii)中位数
m唯一且G在m处连续可微且密度为正,F在m处连续;(iv) Kaplan-Meier过程在[0, τ]上弱收敛到高斯过程;(v)尾部截断的渐近可忽略性;(vi)截断协方差矩阵收敛。 - bootstrap正则性条件(Assumption S2):包括bootstrap Kaplan-Meier过程的条件弱收敛和尾部截断条件。
- 对于pooled bootstrap检验:额外假设
H_0: F=G且删失分布相等K=J,以保证两组观测可交换。
- 独立删失:
-
相比已有文献的放宽或强化:
- 放宽:完全非参数,不假设比例风险或任何参数模型。
- 强化:对中位数
m的正则性要求(唯一性、连续可微、正密度)比一些仅基于秩的方法更强。这是为了处理移动边界问题所付出的代价。
主要结果¶
- Theorem 1 (联合渐近正态性):在Assumption S1下,
√N (ψ̂_N - ψ(F, G))依分布收敛到均值为零的二维正态分布N_2(0, Σ(F, G))。这是所有推断的基础。 - Theorem 2 (Bootstrap一致性):在Assumption S1和S2下,分层bootstrap和pooled bootstrap(在
H_0下)都能一致地估计渐近分布。这为Wald检验和max-t检验提供了理论依据。 - 模拟结果:
- 第一类错误:基于pooled bootstrap的max-t检验在大多数设定下能很好地控制名义水平(0.05),表现与log-rank检验相当,甚至在小样本下更好(Figure 2b)。
- 比例风险:log-rank检验和Yang-Prentice自适应检验表现最好,本文方法稍逊但差距不大(Figure 3a)。
- 中间交叉:log-rank和Gehan-Wilcoxon检验失效。两阶段检验和Yang-Prentice检验表现最好。本文方法在小样本下居中,在大样本下(n=100)变得有竞争力(Figure 3b)。
- 末端交叉:log-rank检验表现最差。本文方法与其他方法表现相似,在小样本下略逊于Gehan-Wilcoxon和Yang-Prentice,但大样本下追平(Figure 4a)。
- 扩散过渡替代:两阶段检验和log-rank检验表现较差。本文方法在小样本下居中,在大样本下成为最好的方法之一(Figure 4b)。
- 真实数据例子(黑色素瘤脑转移):
- 数据:Hong et al. (2019) 的III期试验,比较全脑放疗(WBRT)与观察。
- 方法应用:计算
(θ̂, Ô) = (0.522, 0.401)。 - 结果:
θ̂接近0.5,其置信区间包含0.5,与原始分析(log-rank p=0.89)一致,表明无显著全局生存差异。Ô小于0.5,其置信区间上界接近0.5,提示早期WBRT有优势,后期优势减弱或逆转。分解为早期和晚期条件效应:θ̂_≤ = 0.322(早期WBRT优势),θ̂_> = 0.723(晚期WBRT优势减弱)。 - 说明的问题:该例子展示了
O如何揭示标准log-rank检验和单一全局效应量(如HR)所隐藏的时变模式。尽管结果不是确认性的(置信区间包含零),但它提供了有价值的描述性信息。
证明路线与技术技巧¶
-
整体路线:
- 局部化:先固定一个有限的
τ < τ_0(τ_0是两组观测时间支撑集的上确界),定义截断后的效应向量ψ_τ。这样做是为了避免处理Kaplan-Meier估计量在尾部的不稳定性。 - Hadamard可微性:证明截断后的泛函
ψ_τ在(F, G)处是Hadamard可微的。这需要分别证明:Θ_τ(截断的Mann-Whitney效应)的可微性(Lemma S2)。A(截断的早期条件效应)的可微性(Lemma S4),这是最核心的一步,因为它需要处理中位数m作为G的泛函的随机性。O_τ作为Θ_τ和A的线性组合,其可微性直接得到(Lemma S5)。
- 函数Delta方法:利用Kaplan-Meier过程
√N (F̂ - F, Ĝ - G)的弱收敛性(Assumption S1(iv))和ψ_τ的Hadamard可微性,得到√N (ψ̂_τ - ψ_τ)的弱收敛性。 - 尾部截断:利用Assumption S1(v)和(vi),证明当
τ → τ_0时,截断误差可以忽略,从而得到√N (ψ̂ - ψ)的弱收敛性(Theorem 1)。 - Bootstrap:类似地,利用bootstrap Kaplan-Meier过程的条件弱收敛性(Assumption S2)和bootstrap函数Delta方法,证明bootstrap估计量的一致性(Theorem 2)。
- 局部化:先固定一个有限的
-
关键跳跃点:
- Lemma S4的证明:这是整个证明中最吃功夫的引理。难点在于
A(F, G) = ∫_{[0, m]} F^± dG的积分上限m = G^{-1}(1/2)本身是G的函数。当G被扰动为G_n = G + t_n h_{G,n}时,积分上限变为m_n = G_n^{-1}(1/2)。证明需要将A(F_n, G_n) - A(F, G)分解为两部分:一部分是固定区间[0, m]上的积分差(由Lemma S1处理),另一部分是移动边界(m, m_n]上的积分。作者通过将G_n(m_n) = 1/2和G(m) = 1/2代入,将移动边界项线性化为-t_n F^±(m) h_{G,n}(m) + o(t_n),从而得到了导数中的边界项-F^±(m) h_G(m)。这个技巧是处理此类问题的标准方法。
- Lemma S4的证明:这是整个证明中最吃功夫的引理。难点在于
-
技术技巧点名:
- 函数Delta方法:整个渐近理论的核心工具,用于将估计量的渐近分布转化为泛函导数的分布。
- Hadamard可微性:比Frechet可微性更弱,足以用于函数Delta方法,且更容易在非参数设定下验证。
- 移动边界问题:通过将积分上限的随机性线性化来处理,是半参数和非参数统计中的标准技巧。
- Kaplan-Meier过程弱收敛:利用
D[0, τ]空间上的经验过程理论。 - Bootstrap函数Delta方法:用于证明bootstrap的一致性。
- Wald型检验和max-t型检验:两种常见的多参数假设检验方法。max-t检验能提供分量级别的控制,且通常比Wald检验更稳健。
🔎 结论是否比证明窄¶
- 结论:作者声称该方法“outperforms the log-rank test under non-proportional hazards”。这个结论在模拟的特定场景(中间交叉、末端交叉、扩散过渡)下是成立的,但并非在所有非比例风险模式下都成立。例如,在比例风险下,log-rank检验表现更好。
- 证明:Theorem 1和2的证明依赖于一系列正则性条件(Assumption S1和S2),特别是关于中位数
m的唯一性和G在m处的正则性。如果G在m附近很平坦(密度接近0),或者中位数不唯一,那么渐近理论可能失效。作者在Remark S1中提到了对更一般分位数分割的扩展,但未给出证明。 - 具体语句:在模拟结果部分,作者写道“our method is either in the middle, for smaller sample sizes, or one of the best two, at larger sample sizes.” 这是一个诚实的描述,没有过度泛化。但在摘要中“outperforms the log-rank test”的表述,在未限定替代模式的情况下,可能略显宽泛。
四、开放问题¶
-
协变量调整:作者在Discussion中提到“Future work could develop covariate-adjusted versions of the proposed effects”。这是一个自然的扩展。如何将
θ和O调整为条件效应(给定协变量),并开发相应的推断方法?这需要处理协变量带来的维度灾难,可能涉及半参数模型或倾向得分加权。扎根于:Discussion部分“Future work could develop covariate-adjusted versions of the proposed effects”。 -
竞争风险:作者也提到了“extend the framework to competing risks”。在竞争风险下,事件的定义更复杂(如癌症特异性死亡 vs. 其他原因死亡)。如何定义和估计
θ和O?这需要处理累积发生率函数而非生存函数。扎根于:Discussion部分“extend the framework to competing risks”。 -
更一般的分位数分割:作者在Remark S1中提到了更一般的分位数分割
O_p,但只给出了中位数p=1/2的详细理论。对于其他p值,特别是接近0或1的极端分位数,渐近理论是否仍然成立?方差是否会急剧膨胀?如何在实际应用中选择p?扎根于:Remark S1“More generally, for a fixed p∈(0,1), let q_p := G^{-1}(p) ... The same asymptotic arguments apply for any fixed p∈(0,1), provided that q_p is unique...”。 -
与因果推断的联系:本文的框架可以自然地应用于因果推断中的处理效应估计。例如,在观察性研究中,
θ可以解释为处理组相对于对照组的概率排序效应。如何将O用于敏感性分析,以评估未观测混杂对早期和晚期效应的影响?扎根于:本文的设定是随机化试验,但方法本身不依赖于随机化。这是一个潜在的、但未被作者提及的扩展方向。
Maintained by 陈星宇 · Homepage · Source on GitHub