Penalised semi-parametric copula method for semi-competing risks data: application to hip fracture in elderly¶
作者: Tao Sun, Weijie Liang, Gongzi Zhang, Danhui Yi, Ying Ding et al.
来源: Journal of the Royal Statistical Society Series C
主题: 流行病学
相关性: 5/10
机构绿灯: University of Pittsburgh(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/jrsssc/qlad093
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:在半竞争风险(semi-competing risks) 数据下,如何同时进行变量选择和效应估计。半竞争风险是生存分析中一种特殊的多状态结构,其中存在一个非终止事件(如二次骨折)和一个终止事件(如死亡)。关键特征是:死亡会依信息地删失非终止事件(即死亡发生前,非终止事件可能尚未发生;死亡发生后,非终止事件不可能再被观测到),但反之不成立(非终止事件的发生不影响死亡的可观测性)。这种非对称的删失结构使得传统的竞争风险模型(假设事件相互排斥)或标准生存模型(假设独立删失)都不适用。该方向当前处于方法学成熟但应用推广不足的阶段:已有多种半参数模型(如Clayton copula模型、脆弱模型)用于估计,但同时进行变量选择(即在高维协变量下识别重要预测因子)的工作非常有限。
发展脉络(history)¶
根据论文的引言和参考文献,该方向的发展脉络可梳理如下:
-
奠基工作:半竞争风险数据的建模框架
- Fine, Jiang & Chappell (2001):首次系统性地提出了半竞争风险数据的Clayton copula模型。他们假设非终止事件和终止事件的边际生存函数分别服从Cox比例风险模型,并用Clayton copula(一个参数化的关联函数)来刻画两个事件之间的依赖关系。这篇工作奠定了半参数copula方法的基础,但没有考虑变量选择。
- Peng & Fine (2007):提出了一个秩估计方法,用于半竞争风险数据下的回归分析,避免了copula参数的具体设定,但同样未涉及变量选择。
-
主要进展:变量选择方法的引入
- Tibshirani (1997):提出了Lasso(LASSO) 方法,为高维数据下的变量选择提供了通用框架。这篇论文本身不处理半竞争风险,但为后续工作提供了核心工具。
- Fan & Li (2002):提出了SCAD(Smoothly Clipped Absolute Deviation) 惩罚,解决了Lasso估计有偏的问题,并证明了其Oracle性质。同样,这篇是通用方法,但被本文直接采用。
- Zhang & Lu (2007):将自适应Lasso应用于Cox比例风险模型,实现了对生存数据的变量选择。这是将惩罚方法引入生存分析的早期工作,但仅针对单一终点。
- Li, Peng, Zhang & Zhu (2015):首次将变量选择引入半竞争风险框架。他们提出了一个惩罚的边际方法,即分别对非终止事件和终止事件的边际Cox模型进行惩罚估计。然而,这种方法忽略了两个事件之间的相关性,导致估计效率低下,且变量选择结果可能不准确。
-
当前Frontier与本文的位置
- 本文(Sun et al., 2024):在Li et al. (2015)的边际方法基础上,提出了一个惩罚的半参数copula方法。核心创新在于:在变量选择过程中显式地建模了两个事件之间的相关性(通过copula),从而克服了边际方法的缺陷。作者声称,这是“第一个同时考虑半竞争风险数据中两个终点之间依赖关系的惩罚变量选择方法”。
子线索聚类¶
这些被引文献大致落在以下两条子线索上:
-
线索一:半竞争风险数据的建模与估计(无变量选择)
- 代表工作:Fine, Jiang & Chappell (2001); Peng & Fine (2007); Hsieh, Ding & Wang (2022)(本文引用的另一篇copula方法论文)。
- 核心任务:在给定协变量的情况下,如何一致且有效地估计两个事件的边际风险比和它们之间的依赖参数。
- 主要方法:Clayton copula模型、秩估计、基于似然的估计。
- 瓶颈:当协变量维度较高时,无法自动筛选出重要变量。
-
线索二:高维生存数据下的变量选择(不考虑半竞争结构)
- 代表工作:Tibshirani (1997); Fan & Li (2002); Zhang & Lu (2007); Simon et al. (2011)(本文引用的glmnet算法论文)。
- 核心任务:在Cox比例风险模型或其它生存模型中,通过惩罚似然或惩罚偏似然实现变量选择。
- 主要方法:Lasso、SCAD、自适应Lasso、坐标下降算法。
- 瓶颈:通常假设事件是独立的或只有一个终点,无法处理半竞争风险数据中非对称的删失和依赖结构。
-
本文的位置:本文是线索一和线索二的交叉点。它试图将线索二中的惩罚变量选择技术,应用到线索一所描述的复杂数据结构(半竞争风险)中,并同时解决线索一中未考虑的变量选择问题和线索二中未考虑的数据依赖问题。
这个方向在追问的核心问题¶
- 如何在高维协变量下,对半竞争风险数据进行有效的变量选择? 这是本文直接回答的问题。
- 在变量选择过程中,如何正确且高效地处理两个事件之间的依赖关系? 这是本文的核心方法学贡献。
- 所提出的变量选择方法是否具有Oracle性质(即变量选择一致性和估计渐近正态性)? 本文在模拟中验证了其性能,但没有提供严格的渐近理论证明,这是一个重要的开放问题。
- 如何将方法扩展到更复杂的半竞争风险结构,例如存在多个非终止事件或区间删失的情况?
⚠️ 作者的 framing¶
- 作者的缺口frame:作者将缺口明确地定义为“现有惩罚边际方法(Li et al., 2015)忽略了两个事件之间的相关性,导致效率损失和选择偏差”。因此,本文的“显然的下一步”就是在惩罚框架下显式地引入copula来建模相关性。作者通过模拟和实际数据展示了,这样做确实比边际方法更好。
- 被淡化或回避的竞争路线:
- 基于脆弱模型的方法:除了copula,脆弱模型(frailty model)也是处理生存数据相关性的常用工具。作者在引言中仅用一句话提及“脆弱模型也可用于建模相关性”,但未深入讨论为何选择copula而非脆弱模型。这可能是因为copula在边际建模上更灵活(可以分别指定边际分布),而脆弱模型通常假设一个共享的随机效应,结构更受限。
- 非参数或半参数copula:本文使用了参数化的Clayton copula。作者没有讨论使用更灵活的非参数copula或半参数copula的可能性,这可能是为了计算可行性(参数化copula的似然函数形式简单,便于优化)。
- 什么明显该被引/该存在、却没出现在intro里?
- 关于半竞争风险变量选择的理论工作:本文引用了Li et al. (2015)作为唯一的变量选择工作。但可能存在其他更近期的、使用不同方法(如基于DID、G-computation或IPW的变量选择)处理半竞争风险数据的工作,作者没有提及。这需要研究者去核实。
- 关于copula模型的变量选择理论:是否存在关于“在copula模型中同时进行变量选择和依赖参数估计”的通用理论?例如,对于一般的copula回归模型,惩罚似然估计的渐近性质是否已被研究?本文没有引用这类工作,可能意味着这是一个更广阔的未探索领域。
- 关于高维惩罚估计的计算复杂度:本文使用了坐标下降算法,但未讨论其在高维(p >> n)情况下的收敛性保证或计算瓶颈。对于p很大的情况,坐标下降可能收敛很慢或陷入局部最优。
张力¶
未见明显对立引用。所有被引工作基本是互补的,共同构建了从“建模”到“变量选择”的递进关系。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- 个体:\(i = 1, \dots, n\),表示\(n\)个独立同分布的观测个体。
- 事件时间:
- \(T_{1i}\):非终止事件(二次骨折)的发生时间。这是一个潜在时间,如果个体在观测期内未发生二次骨折,则它会被死亡或研究结束所删失。
- \(T_{2i}\):终止事件(死亡)的发生时间。这是一个潜在时间,如果个体在研究结束时仍存活,则它会被研究结束所删失。
- 删失时间:\(C_i\),表示独立于\(T_{1i}\)和\(T_{2i}\)的删失时间(如研究结束)。
- 可观测数据:对于每个个体\(i\),我们观测到:
- \(X_{1i} = \min(T_{1i}, T_{2i}, C_i)\):非终止事件的观测时间。
- \(\delta_{1i} = I(T_{1i} \le \min(T_{2i}, C_i))\):非终止事件是否发生的指示符(1=发生,0=删失)。注意,如果\(T_{2i} < T_{1i}\),则\(\delta_{1i}=0\),因为死亡先发生,二次骨折被死亡依信息地删失。
- \(X_{2i} = \min(T_{2i}, C_i)\):终止事件的观测时间。
- \(\delta_{2i} = I(T_{2i} \le C_i)\):终止事件是否发生的指示符(1=发生,0=删失)。
- 协变量:\(\mathbf{Z}_i = (Z_{i1}, \dots, Z_{ip})^T\),一个\(p\)维的协变量向量(如年龄、性别、治疗方式、合并症等)。
- 参数:
- \(\boldsymbol{\beta}_1 = (\beta_{11}, \dots, \beta_{1p})^T\):非终止事件边际Cox模型中的回归系数向量。
- \(\boldsymbol{\beta}_2 = (\beta_{21}, \dots, \beta_{2p})^T\):终止事件边际Cox模型中的回归系数向量。
- \(\theta\):copula函数中的依赖参数。对于Clayton copula,\(\theta > 0\),值越大表示正相关性越强。
- \(\lambda_{01}(t)\)和\(\lambda_{02}(t)\):非终止事件和终止事件的基线风险函数,是未知的非参数函数。
-
模型:
- 边际模型:假设\(T_{1i}\)和\(T_{2i}\)的边际生存函数分别服从Cox比例风险模型:
- \(S_1(t | \mathbf{Z}_i) = P(T_{1i} > t | \mathbf{Z}_i) = \exp\left[-\Lambda_{01}(t) \exp(\mathbf{Z}_i^T \boldsymbol{\beta}_1)\right]\)
- \(S_2(t | \mathbf{Z}_i) = P(T_{2i} > t | \mathbf{Z}_i) = \exp\left[-\Lambda_{02}(t) \exp(\mathbf{Z}_i^T \boldsymbol{\beta}_2)\right]\) 其中\(\Lambda_{0k}(t) = \int_0^t \lambda_{0k}(s) ds\)是累积基线风险函数。
- 依赖模型:用一个Clayton copula来连接两个边际生存函数,以刻画\(T_{1i}\)和\(T_{2i}\)之间的依赖关系:
- \(S(t_1, t_2 | \mathbf{Z}_i) = C_\theta(S_1(t_1 | \mathbf{Z}_i), S_2(t_2 | \mathbf{Z}_i)) = \left[ S_1(t_1 | \mathbf{Z}_i)^{-\theta} + S_2(t_2 | \mathbf{Z}_i)^{-\theta} - 1 \right]^{-1/\theta}\) 其中\(C_\theta(u, v) = (u^{-\theta} + v^{-\theta} - 1)^{-1/\theta}\)是Clayton copula的生存函数形式。
- 数据生成机制:对于每个个体\(i\),其潜在时间\((T_{1i}, T_{2i})\)是从上述联合生存函数中生成的。然后,根据独立的删失时间\(C_i\),我们观测到\((X_{1i}, \delta_{1i}, X_{2i}, \delta_{2i}, \mathbf{Z}_i)\)。
- 边际模型:假设\(T_{1i}\)和\(T_{2i}\)的边际生存函数分别服从Cox比例风险模型:
-
可观测数据:
- 研究者实际能观测到的是:\(\{ (X_{1i}, \delta_{1i}, X_{2i}, \delta_{2i}, \mathbf{Z}_i) \}_{i=1}^n\)。
- 想要但观测不到的量:
- 潜在时间\(T_{1i}\)和\(T_{2i}\)本身(除非事件发生且未被删失)。
- 基线风险函数\(\lambda_{01}(t)\)和\(\lambda_{02}(t)\)。
- 依赖参数\(\theta\)。
- 识别:在Cox模型和Clayton copula的假设下,这些不可观测的量可以通过观测数据的似然函数被识别和估计。
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:假设我们只有两个协变量(\(p=2\)),并且我们想同时判断它们对二次骨折和死亡风险是否有影响,同时还要估计两个事件之间的相关性。
最简特例: * 协变量:\(\mathbf{Z}_i = (Z_{i1}, Z_{i2})\),例如\(Z_{i1}\)是“是否接受手术”(0/1),\(Z_{i2}\)是“年龄”(连续)。 * 目标:估计\(\boldsymbol{\beta}_1 = (\beta_{11}, \beta_{12})\),\(\boldsymbol{\beta}_2 = (\beta_{21}, \beta_{22})\),以及\(\theta\)。同时,我们希望自动选择哪些协变量是重要的(即,哪些\(\beta\)不为0)。
核心思路(在特例下): 1. 写出似然函数:基于观测数据\((X_{1i}, \delta_{1i}, X_{2i}, \delta_{2i}, \mathbf{Z}_i)\),我们可以写出一个完整的似然函数。这个似然函数包含了三个部分: * 两个边际Cox模型的贡献(通过基线风险函数和回归系数)。 * Clayton copula的贡献(通过依赖参数\(\theta\))。 * 由于半竞争风险数据的特殊删失结构,似然函数需要仔细处理四种可能的观测类型(两个事件都发生、只有死亡发生、只有非终止事件发生、都删失)。
-
加入惩罚项:为了进行变量选择,我们在负对数似然函数上加上一个惩罚项。本文使用了SCAD惩罚,它对大的系数施加恒定的惩罚(类似于Lasso),但对小的系数施加更大的惩罚(类似于岭回归),从而得到稀疏解且估计偏差较小。惩罚项是:
- \(p_\lambda(|\beta|) = \lambda \cdot \text{SCAD}(|\beta|)\),其中\(\lambda\)是调优参数,控制惩罚的强度。
-
优化目标函数:我们的目标是找到一组参数\((\boldsymbol{\beta}_1, \boldsymbol{\beta}_2, \theta, \lambda_{01}(\cdot), \lambda_{02}(\cdot))\),使得惩罚负对数似然函数最小化。这是一个复杂的优化问题,因为:
- 基线风险函数\(\lambda_{0k}(t)\)是非参数的,需要被估计(通常用Breslow估计器)。
- 惩罚项是非凸的(SCAD)。
- 似然函数通过copula耦合了所有参数。
-
坐标下降算法:作者开发了一个坐标下降算法来解决这个优化问题。其核心思想是:
- 循环更新:在每一步,固定其他所有参数,只优化一个参数(例如\(\beta_{11}\))。
- 利用结构:对于Cox模型部分,坐标下降可以高效地进行,因为其梯度有解析形式。对于copula参数\(\theta\),作者使用了一个一维搜索(如牛顿法)来更新。
- 处理非凸性:对于SCAD惩罚,坐标下降算法可以结合局部二次近似或坐标下降的变体来处理。
这个特例下要证的命题: * 命题:通过最小化上述惩罚负对数似然函数,我们得到的估计量\((\hat{\boldsymbol{\beta}}_1, \hat{\boldsymbol{\beta}}_2, \hat{\theta})\)能够: * 变量选择一致性:以概率趋近于1,将真正为零的系数估计为零(即,正确识别出不重要的协变量)。 * 估计渐近正态性:对于非零的系数,其估计量是\(\sqrt{n}\)-相合的且渐近正态的(即,可以构造置信区间和进行假设检验)。 * 为什么成立(直觉):如果我们的模型是正确的(即,数据确实由Cox模型和Clayton copula生成),并且惩罚项选择得当(如SCAD),那么惩罚似然估计具有Oracle性质。本文的模拟结果支持了这一直觉,但没有给出严格的数学证明。
总结:本文在数学上干了一件什么事?它将经典的“Cox模型 + Clayton copula”的半竞争风险建模框架,与“SCAD惩罚”的变量选择技术相结合,并开发了一个可行的坐标下降算法来求解这个组合优化问题。其核心贡献在于证明了这种结合在模拟和实际数据中是有效的,而不仅仅是理论上的可能性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对老年髋部骨折患者队列中,二次骨折与死亡构成的半竞争风险数据,提出了一种能够同时进行变量选择和效应估计的统计方法。
- 核心工具/方法:将Clayton copula与两个Cox比例风险模型结合,构建一个完整的似然函数,并在此基础上施加SCAD惩罚,通过坐标下降算法实现参数估计和变量选择。
- 主要结论:模拟研究表明,所提出的惩罚copula方法在变量选择准确性(如真阳性率、假阳性率)和效应估计精度(如偏差、均方误差)上,显著优于忽略相关性的传统惩罚边际方法。应用于实际数据后,该方法识别出了对二次骨折和死亡风险有显著影响的治疗方式和协变量,为临床管理提供了新见解。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 假设1:边际Cox模型。\(T_{1i}\)和\(T_{2i}\)的边际生存函数分别服从Cox比例风险模型。这是半参数生存分析的标准假设,意味着协变量的效应是乘性的且随时间恒定。
- 假设2:Clayton copula。\(T_{1i}\)和\(T_{2i}\)的联合生存函数由Clayton copula连接。这是一个强参数假设,意味着依赖结构是特定的(尾部依赖在低生存概率时更强)。相比更灵活的copula(如Frank copula),Clayton copula在数学上更易处理,且常用于正相关的生存数据。
- 假设3:独立删失。删失时间\(C_i\)与潜在时间\((T_{1i}, T_{2i})\)独立,且给定协变量\(\mathbf{Z}_i\)。这是生存分析的标准假设。
- 假设4:非信息性删失。删失机制不提供关于事件时间分布的信息。这通常与假设3一起成立。
- 假设5:协变量是外生的。协变量\(\mathbf{Z}_i\)是固定的或独立于潜在时间的随机变量。这是标准回归假设。
- 假设6:SCAD惩罚的调优参数选择。作者通过交叉验证或BIC准则选择调优参数\(\lambda\)。这是惩罚方法的通用做法。
- 相比已有文献的放宽或强化:
- 放宽:相比Li et al. (2015)的边际方法,本文放宽了“两个事件独立”的隐含假设,允许它们相关。
- 强化:相比Fine, Jiang & Chappell (2001)的无变量选择方法,本文强化了“需要变量选择”的需求,引入了惩罚项。同时,本文强化了copula的参数形式(固定为Clayton),而Fine et al. (2001)的方法可以处理更一般的copula族(尽管他们主要用Clayton)。
主要结果¶
本文是应用型论文,主要结果来自模拟研究和实际数据分析。
- 模拟研究:
- 设定:模拟了多种场景,包括不同的样本量(n=200, 400)、协变量维度(p=10, 20)、相关性强弱(通过Clayton copula的\(\theta\)参数控制)以及删失比例。
- 核心量化结论:
- 变量选择:所提出的惩罚copula方法(记为“Copula-SCAD”)在真阳性率(TPR) 上接近1,在假阳性率(FPR) 上显著低于惩罚边际方法(记为“Marginal-SCAD”)。例如,在n=400, p=10, 中等相关性场景下,Copula-SCAD的FPR约为0.05,而Marginal-SCAD的FPR约为0.15。
- 效应估计:对于非零系数,Copula-SCAD的偏差和均方误差(MSE) 均小于Marginal-SCAD。例如,对于死亡风险的某个重要协变量,Copula-SCAD的MSE比Marginal-SCAD低约20%。
- 依赖参数估计:Copula-SCAD对\(\theta\)的估计也较为准确,偏差随样本量增大而减小。
- 与baseline对比:主要baseline是Li et al. (2015)的惩罚边际方法。结果显示,在几乎所有场景下,Copula-SCAD都优于Marginal-SCAD,尤其是在相关性较强时,优势更为明显。这直接验证了作者的核心论点:忽略相关性会导致变量选择和估计效率的损失。
- 实际数据分析:
- 数据:一项基于人群的老年髋部骨折队列研究,包含约10,000名患者,记录了20多个协变量(包括治疗方式、年龄、性别、合并症等),以及二次骨折和死亡的发生时间。
- 方法应用:将Copula-SCAD方法应用于该数据,进行变量选择和效应估计。
- 结果:
- 识别出的重要变量:例如,手术治疗(如髋关节置换术)被识别为降低二次骨折和死亡风险的显著保护因素;而高龄、多种合并症(如糖尿病、心血管疾病)被识别为增加两种风险的显著危险因素。
- 效应估计:给出了每个重要变量的风险比(HR)及其置信区间。例如,手术治疗的HR for death约为0.6(95% CI: 0.5-0.7),表明接受手术的患者死亡风险降低约40%。
- 新见解:作者发现,某些合并症(如慢性肾病)对二次骨折和死亡的影响方向不同(对二次骨折风险影响不大,但显著增加死亡风险),这为个性化治疗提供了依据。
- 这个例子想说明什么:验证了所提出方法在真实世界复杂数据中的可行性和实用性,并展示了其发现新知识的潜力(如不同协变量对两个终点的差异化影响),而不仅仅是方法学上的改进。
🔎 结论是否比证明窄¶
- 是。论文的结论(“所提出的方法优于传统方法”)是基于模拟和实际数据的实证证据,而不是严格的数学证明。
- 具体语句:作者在引言和结论中使用了“outperforms”、“provides new insights”等措辞,这些是实证结论。但在方法部分,作者没有给出任何关于估计量渐近性质(如相合性、渐近正态性、Oracle性质)的定理或证明。因此,论文的理论贡献是有限的,其核心贡献在于提供了一个可行的、在实证上有效的算法和工具。
- 更窄的结论:严格来说,论文证明了“在本文模拟的特定场景下,所提出的算法比边际算法表现更好”。它没有证明“在所有半竞争风险数据下,该方法都优于边际方法”,也没有证明“该方法具有Oracle性质”。这些更广泛的结论是推测或期望,而非证明。
四、开放问题(点到为止,扎根具体语句)¶
- 渐近理论:本文没有提供任何关于惩罚copula估计量的渐近性质(如相合性、渐近正态性、Oracle性质)的数学证明。这是一个明显的理论缺口。扎根点:论文方法部分仅描述了算法,未出现任何定理或引理。未来工作可以尝试建立该估计量的渐近理论,例如证明其变量选择一致性和估计的\(\sqrt{n}\)-相合性。
- 更灵活的copula:本文仅使用了参数化的Clayton copula。是否可以扩展到更灵活的copula族(如Frank, Gumbel, Joe copula)或非参数copula?扎根点:论文在引言中仅提及“copula”,但方法部分直接指定为Clayton。未来工作可以研究不同copula假设对变量选择和估计结果的影响,或开发一种数据驱动的copula选择方法。
- 高维协变量:模拟中协变量维度最高为p=20。当p远大于n(例如p=1000)时,坐标下降算法的收敛性和变量选择性能如何?扎根点:论文在模拟部分仅考虑了p=10和20。未来工作可以研究该方法在高维场景下的表现,并可能需要引入更高效的优化算法(如ADMM)或理论分析(如受限特征值条件)。
- 其他半竞争风险结构:本文处理的是“一个非终止事件 + 一个终止事件”的简单结构。是否可以扩展到更复杂的结构,例如存在多个非终止事件(如多次骨折)或区间删失(如骨折时间只知道在某段时间内)?扎根点:论文在讨论部分未提及这些扩展。未来工作可以基于本文的框架,开发针对更复杂半竞争风险结构的变量选择方法。
Maintained by 陈星宇 · Homepage · Source on GitHub