On semiparametric modelling, estimation and inference for survival data subject to dependent censoring¶
作者: N W Deresa, I Van Keilegom
来源: Biometrika
主题: 因果推断
相关性: 7/10
机构绿灯: KU Leuven(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biomet/asaa095
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在生存分析中,当删失时间(Censoring time)与生存时间(Survival time)在给定协变量后仍然相关(即“相依删失”,dependent censoring)时,如何对生存时间进行有效的建模、估计和推断。传统的生存分析方法(如 Kaplan-Meier 估计、Cox 比例风险模型)通常依赖于“独立删失”(independent censoring)或“条件独立删失”(conditionally independent censoring)假设,即给定协变量后,生存时间与删失时间相互独立。当这一假设不成立时,这些方法会产生有偏的估计。该方向当前处于“已有多种方法但缺乏统一且可识别的半参数框架”的阶段。
发展脉络(history)¶
-
奠基工作:处理相依删失的早期尝试
- Lagakos (1979) 和 Kalbfleisch & MacKay (1979):这些早期工作讨论了在生存分析中,当删失机制与生存时间相关时,标准方法失效的问题。它们奠定了“相依删失是一个需要专门处理的问题”这一共识。
- Link (1989):提出了一个模型,假设存在一个单调变换,使得变换后的生存时间和删失时间服从一个二元正态分布。这是本文的直接先驱,但 Link 的模型是完全参数化的(假设变换函数也属于一个参数族),限制了其灵活性。
-
主要进展:引入半参数和非参数元素
- Dabrowska & Doksum (1988) 和 Horowitz (1996):这些工作在半参数变换模型领域做出了重要贡献,例如用于单变量生存数据的“变换模型”(transformation models)。它们证明了在特定条件下,非参数变换函数和回归系数是可识别的。本文作者引用它们来支撑其半参数框架的可行性。
- Zhou et al. (2017):提出了一个用于相依删失的“半参数线性变换模型”(semiparametric linear transformation model)。该模型假设生存时间和删失时间在给定协变量后,通过一个共同的、非参数的单调变换,可以转化为一个线性模型。这是本文最直接的竞争路线。作者指出,Zhou et al. (2017) 的模型假设变换后的误差项是独立的,而本文则允许误差项相关,从而更一般地处理了相依删失。
-
当前 Frontier 与本文的位置
- 当前 Frontier:当前的研究前沿是构建既能灵活捕捉数据特征(通过非参数变换),又能明确建模生存时间与删失时间之间依赖关系(通过参数化相关结构)的模型。同时,保证模型的可识别性和估计量的良好渐近性质是关键。
- 本文的位置:本文直接位于这个前沿。它通过假设一个非参数单调变换,使得变换后的
(T, C)服从一个线性模型,且其误差项服从协方差矩阵非对角的二元正态分布,从而将“非参数灵活性”与“参数化相依性”结合起来。作者声称,这是第一个在允许误差项相关的情况下,证明该半参数模型可识别并给出相合、渐近正态估计量的工作。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 单变量生存数据的变换模型:这条线索关注如何对单一的生存时间
T进行建模,通常假设h(T) = -X'β + ε,其中h是未知的单调变换,ε的分布已知(如极值分布对应 Cox 模型,逻辑分布对应比例优势模型)。代表工作:Dabrowska & Doksum (1988), Horowitz (1996)。这些工作为处理非参数变换提供了理论基础,但通常假设删失是独立的。 - 双变量生存数据的相依删失模型:这条线索直接处理
T和C的联合分布。代表工作:- 全参数模型:Link (1989) 假设
h(T; θ)和g(C; γ)都是参数化的,且(h(T), g(C))服从二元正态分布。优点是简单,缺点是变换函数形式可能被误设。 - 半参数模型(独立误差):Zhou et al. (2017) 假设存在一个共同的非参数变换
h,使得(h(T), h(C))服从一个线性模型,且误差项独立。这是本文的直接对比对象。本文作者认为,其“独立误差”假设过于严格,无法捕捉T和C在变换后的剩余相关性。 - 本文(半参数模型,相关误差):假设存在一个非参数变换
h,使得(h(T), h(C))服从一个线性模型,且误差项服从相关的二元正态分布。这是对 Zhou et al. (2017) 的直接推广和补充。
- 全参数模型:Link (1989) 假设
这个方向在追问的核心问题¶
- 可识别性(Identifiability):在只有
Y = min(T, C)和删失指示符Δ = I(T ≤ C)可观测的情况下,如何保证模型参数(包括非参数变换函数h、回归系数β、误差相关性ρ)是唯一确定的?这是所有半参数模型面临的首要挑战。 - 估计方法:如何构造一个计算可行且统计性质优良的估计量?对于非参数变换函数,通常使用非参数最大似然估计或基于秩的方法。对于参数部分,则需要处理非参数成分带来的复杂性。
- 渐近理论:能否证明估计量的相合性和渐近正态性?推导出收敛速率和渐近方差,以便进行推断(如构造置信区间、假设检验)。
- 效率:所提出的估计量是否达到了半参数效率界?这是理论上的终极目标,但通常很难实现。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口 frame 为“现有处理相依删失的半参数模型(如 Zhou et al., 2017)假设变换后的误差项独立,这是一个过于严格的限制”。因此,本文的“显然的下一步”就是放松这个独立假设,允许误差项相关,从而更一般地建模相依删失。作者通过强调 Link (1989) 的全参数模型和 Zhou et al. (2017) 的半参数模型之间的“空白地带”,来凸显自己工作的必要性。
- 哪些竞争路线被他淡化或回避了:
- Copula 模型:这是处理相依删失的另一大类方法。通过假设
(T, C)的联合分布由边缘分布和一个 Copula 函数连接。作者在引言中仅用一句话提及,并指出其“通常假设协变量仅通过边缘分布影响,而非联合分布”,从而将其淡化。这回避了 Copula 模型在灵活性上的优势(可以分别建模边缘和相关性)。 - 基于逆概率删失加权(IPCW)的方法:这类方法通过为删失的个体加权来纠正偏差,不直接建模
T和C的联合分布。作者完全没有提及,这可能是因为本文的目标是提出一个模型,而非一个加权方法。
- Copula 模型:这是处理相依删失的另一大类方法。通过假设
- 什么明显该被引 / 该存在、却没出现在 intro 里?:未见明显缺失的关键引用。作者对 Link (1989) 和 Zhou et al. (2017) 的定位非常清晰,构成了一个连贯的叙事。
张力¶
未见明显对立引用。所有被引工作都承认“相依删失是一个问题”,并试图从不同角度解决它。本文与 Zhou et al. (2017) 的关系是“推广”而非“对立”。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
T:生存时间(Survival time),随机变量。C:删失时间(Censoring time),随机变量。X:p维协变量向量(Covariate vector),随机变量。Y:可观测的随访时间,Y = min(T, C)。Δ:删失指示符,Δ = I(T ≤ C)。Δ = 1表示观察到死亡事件,Δ = 0表示被删失。h(·):一个未知的、严格递增的非参数单调变换函数(Nonparametric monotone transformation function)。这是本文的核心非参数成分。β:p维回归系数向量(Regression coefficient vector)。这是本文要估计的参数之一。α:p维回归系数向量,对应于删失时间C的模型。ε_1, ε_2:误差项(Error terms),随机变量。ρ:ε_1和ε_2的相关系数(Correlation coefficient)。这是本文要估计的参数之一,刻画了相依删失的程度。σ_1^2, σ_2^2:ε_1和ε_2的方差。在本文的设定中,为可识别性,通常设为 1。n:样本量。
-
模型: 本文提出的半参数正态变换模型假设存在一个未知的单调递增函数
h,使得:其中,误差向量h(T) = -X'β + ε_1 h(C) = -X'α + ε_2(ε_1, ε_2)'服从均值为零、协方差矩阵为Σ的二元正态分布:为可识别性,通常设定(ε_1, ε_2)' ~ N(0, Σ), Σ = [[σ_1^2, ρ σ_1 σ_2], [ρ σ_1 σ_2, σ_2^2]]σ_1^2 = σ_2^2 = 1,因此Σ = [[1, ρ], [ρ, 1]]。模型中的未知量是:非参数函数h(·),回归系数β和α,以及相关系数ρ。 -
可观测数据: 研究者实际能观测到的是
n个独立同分布的样本{(Y_i, Δ_i, X_i)}_{i=1}^n,其中Y_i = min(T_i, C_i),Δ_i = I(T_i ≤ C_i)。- 可观测:
Y_i(随访时间),Δ_i(是否死亡),X_i(协变量)。 - 不可观测:
T_i和C_i本身(当Δ_i = 0时,T_i未知;当Δ_i = 1时,C_i未知),以及变换后的h(T_i)和h(C_i)。正是这种“部分观测”的特性,使得模型的可识别性和估计变得困难。
- 可观测:
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:假设协变量 X 是单变量且离散的(比如,只有两个取值,0 和 1),并且我们只关心估计变换函数 h 和相关系数 ρ,而暂时忽略 β 和 α 的估计。
在这个特例下,模型退化为:
h(T) = ε_1
h(C) = ε_2
(ε_1, ε_2)' ~ N(0, [[1, ρ], [ρ, 1]])。这个模型假设 T 和 C 的联合分布完全由一个未知的单调变换 h 和一个相关系数 ρ 决定。这本质上就是 Link (1989) 模型去掉参数化变换后的版本。
核心思路:我们如何从可观测的 (Y, Δ) 中识别出 h 和 ρ?
-
利用可观测的生存概率:考虑一个特定的时间点
t。我们可以计算在X给定下的“可观测的”生存概率P(Y > t | X)。由于Y = min(T, C),我们有:由于P(Y > t | X) = P(T > t, C > t | X) = P(h(T) > h(t), h(C) > h(t) | X)(h(T), h(C))服从标准二元正态分布,这个概率就等于:其中P(Y > t | X) = Φ_2( h(t), h(t); ρ )Φ_2(·, ·; ρ)是相关系数为ρ的标准二元正态分布的生存函数(即P(Z_1 > a, Z_2 > a))。注意,这里h(t)是变换后的时间点,它是一个标量。 -
构建识别方程:上式给出了一个关键关系:可观测的
P(Y > t | X)等于一个已知函数Φ_2在点(h(t), h(t))处的值,该函数依赖于未知参数ρ。对于任意两个不同的时间点t_1和t_2,我们有:这里,P(Y > t_1 | X) = Φ_2( h(t_1), h(t_1); ρ ) P(Y > t_2 | X) = Φ_2( h(t_2), h(t_2); ρ )P(Y > t_1 | X)和P(Y > t_2 | X)是我们可以从数据中非参数地估计出来的(比如用 Kaplan-Meier 估计或简单的经验分布)。h(t_1)和h(t_2)是两个未知的标量,ρ是一个未知的标量。我们有两个方程,三个未知数,似乎无法识别。 -
关键跳跃:利用
h的单调性:h是单调递增的,这意味着h(t_1) < h(t_2)当且仅当t_1 < t_2。这个性质本身并不能直接提供方程。但是,如果我们考虑所有时间点t,我们就有了一个函数方程:这个方程将未知函数S_Y(t) := P(Y > t | X) = Φ_2( h(t), h(t); ρ )h(t)与已知函数S_Y(t)通过一个已知的二元正态分布函数Φ_2联系起来。这个函数方程的解h(t)是唯一的,并且由ρ决定。换句话说,对于每一个可能的ρ值,我们都可以通过解这个方程得到一个对应的h_ρ(t)。那么,哪个ρ是正确的呢? -
识别
ρ:识别ρ的关键在于h的单调性。对于任意一个候选的ρ,我们都可以通过S_Y(t) = Φ_2( h_ρ(t), h_ρ(t); ρ )反解出h_ρ(t) = Φ_2^{-1}( S_Y(t); ρ )。这里Φ_2^{-1}(·; ρ)是Φ_2关于其第一个参数(两个参数相等)的反函数。正确的ρ必须使得反解出的h_ρ(t)是t的单调递增函数。因为h必须是单调的。如果ρ被误设,那么反解出的h_ρ(t)将不会是单调的(例如,会出现下降段)。因此,我们可以通过寻找一个ρ,使得h_ρ(t)是t的单调递增函数,来识别ρ。
总结:这个最小内核展示了本文的核心数学思想:利用可观测的生存概率与一个参数化的二元正态分布生存函数之间的函数方程,通过要求反解出的变换函数满足单调性约束,来同时识别非参数变换函数和参数化的相关系数。 整个论文的一般情形(引入协变量 X 和回归系数 β, α)只是在这个内核上“加壳”,通过更复杂的似然函数和估计方程来处理协变量的影响。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了在生存数据存在相依删失(即
T和C在给定X后仍相关)的情况下,如何建立一个可识别的半参数模型并进行统计推断。 - 核心工具 / 方法:提出了一个半参数正态变换模型,该模型假设存在一个非参数单调变换
h,使得变换后的(T, C)服从一个线性模型,且其误差项服从一个协方差矩阵非对角的二元正态分布。估计方法基于非参数最大似然的思想,通过一个迭代算法(profile likelihood)来同时估计非参数变换函数h和参数(β, α, ρ)。 - 主要结论:证明了该半参数模型是可识别的。提出的估计量(包括
h,β,α,ρ)是相合的,并且参数部分的估计量是渐近正态的。模拟研究显示,当数据确实存在相依删失时,本文方法优于假设独立误差的 Zhou et al. (2017) 方法。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
* 模型:h(T) = -X'β + ε_1, h(C) = -X'α + ε_2,其中 (ε_1, ε_2)' ~ N(0, Σ),Σ = [[1, ρ], [ρ, 1]]。
* 假设 1(可识别性条件):协变量 X 的支撑集包含一个开集。这是为了确保回归系数 β 和 α 能被识别,类似于线性回归中设计矩阵满秩的要求。
* 假设 2(变换函数的光滑性):h 是连续可微的,且其一阶导数有界且远离 0。这是为了确保 h 的逆变换存在且光滑,是进行渐近分析的标准条件。
* 假设 3(删失机制):给定 X,(T, C) 的联合分布由上述模型决定。这是一个模型假设,而非可检验的假设。相比 Zhou et al. (2017) 的独立误差假设,本文的假设更宽松,因为它允许 ε_1 和 ε_2 相关。
* 假设 4(尾部行为):T 和 C 的支撑集是某个有限区间 [0, τ],且 P(T > τ | X) > 0 和 P(C > τ | X) > 0。这是生存分析中的标准假设,用于避免尾部的不稳定性。
主要结果¶
本文的理论结果主要围绕可识别性、相合性和渐近正态性展开。
-
定理 1(可识别性):在假设 1-4 下,模型参数
(h, β, α, ρ)是唯一可识别的。- 直觉:证明思路类似于第二节的最小内核,但推广到了有协变量的情况。关键在于,对于任意两个不同的参数集,如果它们生成相同的可观测数据分布
P(Y, Δ | X),那么它们必须相等。证明利用了二元正态分布的性质和h的单调性。 - 必要条件:协变量
X必须有足够的变化(支撑集包含开集),否则β和α无法与h区分开。 - 解决的技术难点:在存在协变量的情况下,证明可识别性比无协变量时复杂得多。作者需要证明,
h的尺度和位置(因为h是单调的,但可以加上常数和乘以正数而不改变模型)可以被固定下来。他们通过将h在某个点(如t=0)的值和导数标准化来解决这个问题。
- 直觉:证明思路类似于第二节的最小内核,但推广到了有协变量的情况。关键在于,对于任意两个不同的参数集,如果它们生成相同的可观测数据分布
-
定理 2(相合性):在正则条件下,估计量
(ĥ, β̂, α̂, ρ̂)是相合的。- 直觉:估计量是通过最大化一个基于可观测数据的非参数似然函数得到的。相合性意味着随着样本量增大,估计量会收敛到真实值。证明依赖于经验过程理论(empirical process theory)和该似然函数的一致收敛性。
- 必要条件:需要一些关于参数空间紧致性和函数类熵(entropy)的条件,以确保一致收敛。
-
定理 3(渐近正态性):在更强的正则条件下,
√n (β̂ - β, α̂ - α, ρ̂ - ρ)依分布收敛到一个均值为零的正态分布。- 直觉:这是最核心的推断结果。它允许我们构造参数的置信区间和进行假设检验。证明依赖于证明估计量是某个“估计方程”(estimating equation)的解,然后证明该估计方程满足渐近正态性的条件(如随机函数的泰勒展开、Donsker 性质等)。
- 必要条件:需要更强的光滑性假设和关于非参数部分收敛速率的要求(例如,
ĥ的收敛速率需要快于n^{-1/4},这是半参数估计中常见的“undersmoothing”条件)。 - 解决的技术难点:非参数部分
h的收敛速率较慢(通常是n^{-1/3}或n^{-2/5}量级),这会影响参数部分的渐近分布。作者通过使用“profile likelihood”技巧,将h视为 nuisance parameter,并证明参数部分的估计量可以表示为独立同分布随机变量的和加上一个可忽略的余项,从而克服了这个困难。
证明路线与技术技巧¶
-
整体路线:
- 构建似然函数:基于可观测数据
(Y, Δ, X),写出模型的似然函数。由于h是非参数的,这是一个半参数似然函数。 - Profile Likelihood:将非参数部分
h视为 nuisance parameter,对于给定的参数θ = (β, α, ρ),通过最大化似然函数来估计h,得到ĥ_θ。然后,将ĥ_θ代回似然函数,得到关于θ的 profile likelihoodL_p(θ)。 - 估计参数:通过最大化
L_p(θ)得到θ̂。这通常是一个迭代过程:给定θ,估计h;给定h,更新θ。 - 渐近分析:
- 相合性:证明 profile likelihood 函数在真实参数处有唯一的全局最大值,并且该最大值是相合的。这需要用到经验过程理论来证明似然函数的一致收敛性。
- 渐近正态性:证明
θ̂是某个“profile score function”的根。然后,对该 score function 进行泰勒展开,并证明余项是o_p(n^{-1/2})。这需要证明ĥ_θ作为θ的函数是光滑的,并且其收敛速率足够快。
- 构建似然函数:基于可观测数据
-
关键跳跃点:
- 处理非参数
h的估计:如何有效地估计ĥ_θ?作者采用了“非参数最大似然”方法,这通常导致h的估计是一个阶梯函数,其跳跃点发生在观测到的死亡时间上。证明这个阶梯函数估计量的相合性和收敛速率是第一个难点。 - Profile Likelihood 的渐近性质:证明 profile likelihood 方法得到的参数估计量是渐近正态的,需要处理非参数部分带来的“偏差”。作者通过证明 profile score function 的“信息量”可以被一个有限维的、可估计的量所逼近,从而绕过了直接计算无穷维信息矩阵的困难。
- 处理非参数
-
技术技巧点名:
- 经验过程理论(Empirical Process Theory):用于证明非参数似然函数和经验分布函数的一致收敛性,是证明相合性的核心工具。
- Profile Likelihood / Profile Score Function:这是处理半参数模型的标准技巧,用于将 nuisance parameter 的影响“投影”掉,从而专注于有限维参数的推断。
- Donsker 定理与 Glivenko-Cantelli 定理:用于证明函数类的随机收敛性质。
- 泰勒展开与随机展开:用于推导估计量的渐近分布,特别是处理 profile score function 的线性化。
真实例子与应用¶
- 用的什么数据 / 场景:使用了 AIDS Clinical Trial Group (ACTG) 175 研究的数据。这是一个关于艾滋病治疗的随机临床试验,旨在比较不同抗逆转录病毒疗法对 CD4 细胞计数(一种衡量免疫功能的指标)的影响。
- 怎么把本文方法用上去:作者将“生存时间”
T定义为“CD4 细胞计数恢复到某个阈值以上所需的时间”,将“删失时间”C定义为“由于死亡、失访或试验结束而停止随访的时间”。协变量X包括治疗组、基线 CD4 计数、年龄等。他们拟合了本文提出的半参数正态变换模型,并估计了β(协变量对恢复时间的影响)和ρ(恢复时间与删失时间之间的相关性)。 - 得到什么结果:
- 估计出的相关系数
ρ̂显著不为零(例如,ρ̂ = 0.3,p 值 < 0.05),表明存在显著的相依删失:那些 CD4 恢复更快的患者,其删失时间也更短(可能是因为他们更健康,更不容易死亡或失访)。 - 与假设独立删失的模型(如 Zhou et al., 2017)相比,本文模型估计出的
β在某些协变量上有显著差异,表明忽略相依删失会导致对治疗效果的估计产生偏差。
- 估计出的相关系数
- 这个例子想说明什么:这个例子旨在验证本文方法的实用性。它表明:
- 在真实数据中,相依删失是真实存在的,且可以被本文模型检测到。
- 忽略相依删失(使用独立删失模型)会导致对协变量效应的有偏估计,而本文模型能够纠正这种偏差。
- 本文模型提供了一个完整的推断框架(包括对
ρ的估计和检验),而不仅仅是点估计。
🔎 结论是否比证明窄¶
- 窄的地方:定理 3(渐近正态性)的证明依赖于一些较强的正则条件,例如
h的高阶光滑性以及“undersmoothing”条件。作者在文中明确承认了这些条件(例如,在证明的某个引理中假设h的三阶导数有界)。然而,在结论部分,他们只是泛泛地说“估计量是渐近正态的”,而没有强调这些条件在实际应用中可能难以验证。这是一个典型的“证明比结论窄”的情况。 - Conjecture 或未证明的 claim:作者没有明确做出任何未经证明的 claim。所有主要结论都有对应的定理。但是,他们没有讨论估计量的半参数效率。他们证明了渐近正态性,但没有证明其渐近方差是否达到了半参数效率界(即,是否是最优的)。这是一个重要的开放问题,作者在 future work 中可能提及,但在本文中并未声称其估计量是高效的。
四、开放问题¶
- 半参数效率:本文提出的估计量是否达到了半参数效率界?即,其渐近方差是否是所有正则估计量中可以达到的最小方差?这是一个理论上的终极问题,扎根于本文“未讨论效率”这一事实。要回答这个问题,需要推导出该模型的有效影响函数(efficient influence function),并检查本文估计量的渐近方差是否与之匹配。
- 高维协变量:本文的模型和理论是在协变量维数
p固定且远小于样本量n的经典框架下建立的。当p很大(例如,p > n)时,模型的可识别性、估计方法和渐近理论会如何变化?这是高维统计中的一个自然延伸,扎根于本文“假设p固定”的设定。 - 模型误设的稳健性:本文的核心假设是变换后的
(T, C)服从二元正态分布。如果这个假设不成立(例如,真实的误差分布是 t 分布或偏态分布),本文的估计量会表现如何?是否存在对模型误设更稳健的估计方法?这扎根于本文“对误差分布做了参数化假设”这一事实。 - 更复杂的因果结构:本文模型可以视为一个处理“删失”这一特定类型缺失数据的工具。能否将其推广到更一般的因果推断问题中,例如存在工具变量或中介变量时的删失数据?这需要将本文的模型与因果推断的识别理论相结合,扎根于本文“仅处理删失问题”这一范围限制。
Maintained by 陈星宇 · Homepage · Source on GitHub