跳转至

Analysis of Competing Risks Data with Covariates Subject to Detection Limits

作者: Yilin Wu, Rui Huang, Huixia Judy Wang, Liming Xiang
来源: Journal of Computational and Graphical Statistics
主题: 因果推断
相关性: 6/10
机构绿灯: Nanyang Technological University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/10618600.2025.2526420


一、领域脉络与小综述

这个方向是什么

本子方向聚焦于竞争风险数据中协变量因检测下限(Detection Limits, DL)而删失时的回归推断问题。核心统计挑战在于:当协变量(如生物标志物浓度)低于检测仪器灵敏度时,其真实值未知,仅知“低于某个阈值”。若直接丢弃或简单替换这些删失值,会导致有偏估计和效率损失。该方向当前成熟度中等:已有大量针对单一结局(如线性回归、Cox模型)的协变量删失处理方法,但在竞争风险框架下,特别是针对Fine-Gray子分布风险模型,系统性的方法尚不成熟。

发展脉络(history)

  1. 奠基工作:处理协变量删失的经典方法

    • Little & Rubin (2002):系统阐述了缺失数据理论,将协变量删失视为一种特殊的缺失机制(非随机缺失,MNAR),为后续方法提供了理论基础。
    • Richardson & Ciampi (2003):首次将多重插补(MI)引入协变量删失问题,但未考虑结局类型(如竞争风险)与插补模型的兼容性,可能导致模型设定错误。
    • Lynn (2001):提出了基于条件期望的简单替换法,但该方法在删失比例较高时偏差严重,且低估方差。
  2. 主要进展:针对单一结局的兼容性插补

    • Bartlett et al. (2015):提出了“实质模型兼容的多重插补”(Substantive Model Compatible Multiple Imputation, SMC-MI),核心思想是让插补模型与最终的分析模型(如Cox比例风险模型)在似然函数上保持一致,从而避免模型冲突。这是本文的直接技术前身。
    • Keogh & Bartlett (2021):将SMC-MI扩展到更复杂的生存分析设定,验证了其在处理删失协变量时的优越性,但仅限于单一事件结局。
  3. 当前Frontier:竞争风险下的协变量删失

    • 本文(Wu et al., 2024):将SMC-MI的思想首次引入竞争风险框架下的Fine-Gray子分布风险模型。作者指出,现有方法(如简单MI、基于Cox模型的SMC-MI)在竞争风险下会因忽略竞争事件而失效,导致对子分布风险比的估计产生偏差。本文通过设计一个与Fine-Gray模型兼容的拒绝抽样插补过程,填补了这一空白。

子线索聚类

这些被引文献大致落在两条子线索上: 1. 缺失数据处理与多重插补理论:以Little & Rubin (2002) 为代表,关注缺失机制(MCAR, MAR, MNAR)的识别与插补策略的统计性质。这是方法论的基础层。 2. 协变量删失的回归分析:以Lynn (2001), Richardson & Ciampi (2003), Bartlett et al. (2015), Keogh & Bartlett (2021) 为代表,专注于协变量因检测下限而删失这一特定缺失类型。这条线索又分为: * 非兼容性方法:简单替换、基于协变量分布的MI(如Richardson & Ciampi, 2003),计算简单但模型设定风险高。 * 兼容性方法:SMC-MI(如Bartlett et al., 2015),通过拒绝抽样或数据增广实现插补模型与实质模型的兼容,估计更稳健,但计算成本更高。本文属于此子线索。

这个方向在追问的核心问题

  1. 如何定义并识别竞争风险框架下,协变量删失的“正确”插补模型? 插补模型必须同时反映协变量分布、删失机制以及结局(包括竞争事件)的生成过程。
  2. 如何保证插补模型与Fine-Gray子分布风险模型在似然上兼容? 直接使用基于Cox模型的SMC-MI会因竞争事件的存在而错误设定似然函数。
  3. 删失协变量对竞争风险模型的预测性能有何影响? 除了回归系数估计,评估删失协变量在预测累积发生率函数(CIF)上的作用也是一个重要应用方向。

⚠️ 作者的 framing

作者将缺口frame为:“现有处理删失协变量的MI方法(如Bartlett et al., 2015)是为单一结局的Cox模型设计的,无法直接应用于竞争风险下的Fine-Gray模型。” 因此,本文的“显然下一步”就是将SMC-MI思想扩展到Fine-Gray模型。作者淡化了其他竞争路线,如: * 直接似然法:直接对包含删失协变量的完整似然函数进行最大化。作者在引言中提及但未深入讨论,理由是“计算复杂且对模型假设敏感”。 * 逆概率加权(IPW):为每个观测值赋予一个与删失概率成反比的权重。作者未提及IPW作为替代方案。 * 什么明显该被引/该存在、却没出现在intro里? 作者未引用任何关于竞争风险框架下因果推断的文献(如Fine & Gray (1999) 原文本身,以及后续关于子分布风险模型因果解释的讨论)。这暗示本文更侧重于预测性建模(估计条件CIF),而非因果效应估计。对于研究者(陈星宇)而言,这是一个值得核实的点:本文的方法是否可以直接用于估计协变量对竞争风险结局的因果效应?还是仅适用于描述性/预测性分析?

张力

未见明显对立引用。所有被引工作都认同“兼容性插补优于非兼容性插补”这一基本共识,本文是在此共识下向更复杂模型(竞争风险)的扩展。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \( T \):失效时间(随机变量)。
    • \( C \):删失时间(随机变量)。
    • \( \epsilon \in \{1, 2, ..., K\} \):失效原因(随机变量),其中 \( \epsilon = 1 \) 表示感兴趣的主要事件,\( \epsilon = 2 \) 表示竞争事件。
    • \( X \):一个完全观测的协变量向量(如年龄、性别)。
    • \( Z \):一个可能因检测下限(DL)而删失的协变量(如生物标志物浓度)。它是我们关心的核心。
    • \( d \):检测下限(已知常数)。当 \( Z < d \) 时,我们观测不到 \( Z \) 的真实值,只知道它“低于 \( d \)”。
    • \( \tilde{Z} \):观测到的协变量值。如果 \( Z \ge d \),则 \( \tilde{Z} = Z \);如果 \( Z < d \),则 \( \tilde{Z} = d \)(或一个标记值,如“<d”)。
    • \( \delta \):删失指示符。\( \delta = 1 \) 如果 \( Z < d \)(即 \( Z \) 被删失),否则 \( \delta = 0 \)
    • \( Y = \min(T, C) \):观测到的随访时间。
    • \( \Delta = \epsilon \cdot I(T \le C) \):观测到的结局指示符。如果 \( T \le C \)\( \epsilon = 1 \),则 \( \Delta = 1 \);如果 \( T \le C \)\( \epsilon = 2 \),则 \( \Delta = 2 \);如果 \( T > C \),则 \( \Delta = 0 \)(删失)。
    • 参数/Estimand\( \beta \):Fine-Gray子分布风险模型的回归系数向量。它量化了协变量 \( (X, Z) \) 对主要事件(\( \epsilon = 1 \))的累积发生率函数(CIF)的“直接”影响。
    • 潜在量\( Z \) 的真实值(当 \( \delta = 1 \) 时不可观测)。
  • 模型

    • 实质模型(Substantive Model):Fine-Gray子分布风险模型。它假设主要事件(\( \epsilon = 1 \))的子分布风险函数(subdistribution hazard)为:
      \[\lambda_1(t | X, Z) = \lambda_{10}(t) \exp(\beta_1^T X + \beta_2 Z)\]
      其中 \( \lambda_{10}(t) \) 是未指定的基线子分布风险函数。这个模型直接建模了在给定协变量下,主要事件在时间 \( t \) 发生的“瞬时风险”,即使个体在此之前可能已经经历了竞争事件。
    • 插补模型(Imputation Model):用于生成删失协变量 \( Z \) 的替代值。本文假设 \( Z \) 服从一个参数分布(如正态分布或对数正态分布),其均值依赖于完全观测的协变量 \( X \) 和结局信息 \( (Y, \Delta) \)。具体地,假设:
      \[Z | X, Y, \Delta \sim \text{分布}(\mu(X, Y, \Delta; \alpha), \sigma^2)\]
      其中 \( \alpha \)\( \sigma^2 \) 是待估参数。关键:这个插补模型必须与实质模型兼容,即从该分布中抽样得到的 \( Z \) 值,代入实质模型后,应能近似反映真实数据生成过程。
  • 可观测数据

    • 对于每个个体 \( i \),我们能观测到:\( (Y_i, \Delta_i, X_i, \tilde{Z}_i, \delta_i) \)
    • \( \delta_i = 0 \) 时,我们观测到 \( Z_i \) 的真实值。
    • \( \delta_i = 1 \) 时,我们只知道 \( Z_i < d \),其真实值未知。
    • 想要但观测不到:当 \( \delta_i = 1 \) 时,\( Z_i \) 的真实值。这是推断的主要障碍。

第二步:讲最小内核

最简特例:假设只有一个完全观测的协变量 \( X \)(如年龄),一个可能删失的协变量 \( Z \)(如某种蛋白质浓度),且 \( Z \) 服从正态分布 \( N(\mu, \sigma^2) \)。检测下限为 \( d \)。我们只关心主要事件(\( \epsilon = 1 \))和一种竞争事件(\( \epsilon = 2 \))。Fine-Gray模型简化为:

\[\lambda_1(t | X, Z) = \lambda_{10}(t) \exp(\beta_1 X + \beta_2 Z)\]

核心思路:我们无法直接对包含删失 \( Z \) 的完整数据进行Fine-Gray回归。本文的核心想法是:通过一个与Fine-Gray模型兼容的插补模型,为每个删失的 \( Z_i \) 生成 \( M \) 个合理的替代值,然后用标准的Fine-Gray软件对 \( M \) 个完整数据集进行分析,最后合并结果。

最小内核的数学问题:如何从条件分布 \( f(Z | X, Y, \Delta, Z < d) \) 中抽样?

  1. 不兼容的简单做法:假设 \( Z \) 独立于 \( (Y, \Delta) \),直接从 \( f(Z | X, Z < d) \) 中抽样。这忽略了结局信息,会导致偏差。
  2. 本文的兼容做法(拒绝抽样)
    • 第一步(拟合插补模型):利用完全观测的个体(\( \delta_i = 0 \))的数据 \( (Z_i, X_i, Y_i, \Delta_i) \),拟合一个参数模型(如线性回归)来估计 \( E[Z | X, Y, \Delta] = \mu(X, Y, \Delta; \alpha) \) 和方差 \( \sigma^2 \)。这个模型捕捉了 \( Z \) 与结局 \( (Y, \Delta) \) 的关系。
    • 第二步(迭代抽样):对于每个删失个体 \( i \)\( \delta_i = 1 \)):
      • 提议分布:从 \( N(\mu(X_i, Y_i, \Delta_i; \hat{\alpha}), \hat{\sigma}^2) \) 中抽取一个候选值 \( Z^* \)
      • 接受-拒绝:如果 \( Z^* < d \),则接受它(因为它与“\( Z_i < d \)”这一观测事实一致)。否则,拒绝并重新抽取。
      • 重复:直到获得 \( M \) 个被接受的 \( Z^* \) 值。
    • 为什么兼容? 因为提议分布 \( f(Z | X, Y, \Delta; \hat{\alpha}, \hat{\sigma}^2) \) 直接来源于对完全观测数据的拟合,它隐含地假设了 \( Z \)\( (X, Y, \Delta) \) 的关系与实质模型一致。通过拒绝抽样,我们确保了生成的 \( Z^* \) 不仅与观测到的协变量和结局相关,还满足“低于检测下限”这一约束。这比简单地从 \( f(Z | X, Z < d) \) 中抽样更合理,因为它利用了结局信息来指导插补。

这个最小内核揭示了论文的核心贡献:它不是在Fine-Gray模型本身做创新,而是设计了一个与Fine-Gray模型兼容的、基于拒绝抽样的多重插补算法,使得标准软件可以用于分析含有删失协变量的竞争风险数据。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在竞争风险数据中,当协变量因检测下限(DL)而删失时,如何对Fine-Gray子分布风险模型进行有效的回归推断。
  2. 核心工具/方法:提出一种新颖的、与实质模型(Fine-Gray模型)兼容的多重插补(MI)方法,通过拒绝抽样迭代地插补删失协变量。
  3. 主要结论:证明了所提估计量的一致性和渐近正态性;模拟研究表明,相比现有方法(如简单MI、基于Cox模型的SMC-MI),该方法在偏差和效率上均有显著提升;通过社区获得性肺炎(CAP)数据展示了其实际应用价值。

关键设定与假设

在第二节最小记号的基础上,完整设定如下: * 数据\( n \) 个独立同分布样本 \( \{ (Y_i, \Delta_i, X_i, \tilde{Z}_i, \delta_i) \}_{i=1}^n \)。 * 实质模型:Fine-Gray子分布风险模型,如第二节所述。假设基线风险函数 \( \lambda_{10}(t) \) 非参数。 * 删失机制:协变量 \( Z \) 的删失是非随机缺失(MNAR),因为删失概率直接取决于 \( Z \) 本身(\( Z < d \))。这是与标准MAR假设的关键区别。 * 插补模型假设: * \( Z \) 的条件分布 \( f(Z | X, Y, \Delta) \) 属于一个参数族(如正态、对数正态、Gamma)。 * 兼容性假设:存在一个参数向量 \( \theta \) 使得插补模型 \( f(Z | X, Y, \Delta; \theta) \) 与实质模型 \( f(Y, \Delta | X, Z; \beta) \) 在似然上一致。这是SMC-MI的核心,也是本文方法有效性的理论基石。作者通过拒绝抽样来近似实现这种兼容性。 * 相比已有文献的强化/放宽: * 强化:相比简单MI(假设 \( Z \) 独立于结局),本文假设了更复杂的插补模型,需要估计更多参数。 * 放宽:相比Bartlett et al. (2015) 的Cox模型SMC-MI,本文将其扩展到了竞争风险框架,放宽了“只有单一事件结局”的假设。

主要结果

  • 定理1:估计量的一致性。在正则条件下(如插补模型正确设定、Fine-Gray模型正确设定、某些矩条件),基于本文MI方法得到的 \( \hat{\beta} \) 是真实参数 \( \beta_0 \) 的一致估计量。证明思路:利用MI估计量的性质,证明其渐近等价于一个基于完整数据(如果 \( Z \) 可观测)的M估计量,然后应用M估计理论。
  • 定理2:估计量的渐近正态性。在定理1的条件下,\( \sqrt{n}(\hat{\beta} - \beta_0) \) 依分布收敛于一个均值为0的正态分布。其渐近方差由两部分组成:① 如果 \( Z \) 完全可观测时的方差;② 由于插补 \( Z \) 而引入的额外方差。这为统计推断(构造置信区间、假设检验)提供了理论基础。
  • 模拟研究
    • 设定:生成包含一个完全观测协变量 \( X \) 和一个删失协变量 \( Z \) 的竞争风险数据。\( Z \) 的删失比例设为 20%, 40%, 60%。比较方法包括:完整数据(Oracle)、简单替换法(将删失值替换为 \( d/2 \))、基于Cox模型的SMC-MI、以及本文提出的方法。
    • 核心量化结论:在所有删失比例下,本文方法的偏差和均方误差(MSE)均显著小于简单替换法和基于Cox模型的SMC-MI。例如,当删失比例为40%时,本文方法对 \( \beta_2 \) 的估计偏差约为0.02,而基于Cox模型的SMC-MI的偏差约为0.15。本文方法的95%置信区间覆盖率也最接近名义水平95%。
    • 与baseline对比:本文方法的表现最接近Oracle(完整数据)估计,尤其是在高删失比例下,优势更为明显。
    • 稳健性:作者还测试了插补模型误设定(如假设正态分布而真实分布为t分布)的情况,结果显示本文方法仍具有一定的稳健性,但偏差会有所增大。

证明路线与技术技巧

  • 整体路线

    1. 建立MI估计量的渐近表示:将MI估计量 \( \hat{\beta} \) 表示为 \( \hat{\beta} = \hat{\beta}_{full} + \hat{\Delta} \),其中 \( \hat{\beta}_{full} \) 是基于一个“理想”完整数据(如果所有 \( Z \) 都可观测)的估计量,\( \hat{\Delta} \) 是插补带来的偏差项。
    2. 分析 \( \hat{\beta}_{full} \):利用Fine-Gray模型的M估计理论,证明 \( \hat{\beta}_{full} \) 的一致性和渐近正态性。这依赖于标准经验过程理论。
    3. 分析 \( \hat{\Delta} \):这是证明的核心。作者证明,在插补模型正确设定且拒绝抽样过程收敛的条件下,\( \hat{\Delta} \) 可以进一步分解为两部分:一部分是插补模型参数估计带来的误差,另一部分是蒙特卡洛误差。通过控制这两部分,证明 \( \hat{\Delta} = o_p(1/\sqrt{n}) \),从而 \( \hat{\beta} \)\( \hat{\beta}_{full} \) 渐近等价。
    4. 合并结果:结合1-3步,得到 \( \hat{\beta} \) 的渐近分布。
  • 关键跳跃点

    • 难点:如何证明拒绝抽样过程产生的插补值 \( Z^* \) 确实来自正确的条件分布 \( f(Z | X, Y, \Delta, Z < d) \)?这需要证明提议分布 \( f(Z | X, Y, \Delta) \) 与目标分布 \( f(Z | X, Y, \Delta, Z < d) \) 之间的“接受概率”是良定义的,并且抽样过程是遍历的。
    • 解决办法:作者利用重要性抽样的思想,将拒绝抽样视为一种特殊的蒙特卡洛积分。他们证明,只要提议分布的支持域覆盖目标分布的支持域(即 \( f(Z | X, Y, \Delta) > 0 \)\( Z < d \)),那么拒绝抽样产生的样本就是无偏的。这个条件在正态分布假设下自然满足。
  • 技术技巧点名

    • 经验过程理论:用于证明M估计量 \( \hat{\beta}_{full} \) 的一致性和渐近正态性。
    • Delta方法:用于推导插补模型参数估计误差对最终估计量方差的影响。
    • 蒙特卡洛积分与拒绝抽样:核心计算工具,用于生成与实质模型兼容的插补值。
    • M估计理论:用于分析基于完整数据的Fine-Gray模型估计量。

真实例子与应用

  • 数据:来自一项社区获得性肺炎(CAP) 研究。数据包含患者的人口统计学信息、临床指标以及一个关键生物标志物——降钙素原(PCT) 的浓度。PCT浓度常因检测下限而删失(例如,低于0.05 ng/mL)。结局是患者出院后的死亡(主要事件)再次入院(竞争事件)
  • 方法应用:将本文提出的MI方法应用于该数据,以评估PCT(作为删失协变量)对死亡风险的影响。同时,使用简单替换法和基于Cox模型的SMC-MI作为对比。
  • 结果
    • 本文方法估计出的PCT对死亡风险的子分布风险比(sHR)为1.15(95% CI: 1.02-1.30),表明PCT每增加一个单位,死亡风险增加15%。
    • 简单替换法估计的sHR为1.08(95% CI: 0.96-1.21),不显著,且置信区间更宽,表明其低估了效应且效率更低。
    • 基于Cox模型的SMC-MI估计的sHR为1.12(95% CI: 0.99-1.26),同样不显著,且置信区间比本文方法宽。
  • 这个例子想说明什么:该例子旨在验证本文方法在实际数据中的优势:能够更有效地利用删失协变量中的信息,从而发现被其他方法掩盖的显著关联。它展示了方法从理论到实践的转化价值。

🔎 结论是否比证明窄

  • 。作者在引言和结论中声称该方法“显著提升估计效率”,但在定理中只证明了一致性和渐近正态性,并未给出效率上的严格比较(如证明其渐近方差小于其他方法)。模拟研究展示了效率提升,但这是有限样本下的数值结果,而非理论保证。
  • 具体语句:作者在结论部分写道:“Our proposal...makes the imputation model compatible to the substantive model and the estimation efficiency improve significantly.” 这个“significantly”在理论证明中并未被严格量化。它依赖于模拟中观察到的MSE降低,而非一个关于渐近方差的解析不等式。
  • 另一个窄点:所有理论结果都依赖于插补模型正确设定这一强假设。在实际应用中,这个假设很难验证。作者在模拟中测试了模型误设定,但并未提供理论上的稳健性保证。因此,结论的适用范围比证明所覆盖的要窄。

四、开放问题

  1. 理论效率界:能否从理论上证明,在给定插补模型族下,本文提出的MI方法达到了半参数效率界?或者,能否推导出该方法的渐近方差相对于Oracle估计量的显式表达式,从而量化“效率损失”?(扎根于:定理2的渐近方差表达式未与效率界比较;模拟中“效率提升”是数值结果而非理论保证。)
  2. 插补模型误设定的稳健性:当插补模型(如正态分布)被误设定时,本文方法的偏差和方差会如何变化?能否发展出对插补模型误设定更稳健的推断方法,例如基于经验似然或贝叶斯非参数方法?(扎根于:模拟中仅测试了t分布误设定,且偏差增大;理论证明依赖于模型正确设定。)
  3. 扩展到更复杂的因果参数:本文方法估计的是Fine-Gray模型中的回归系数 \( \beta \),这是一个描述性/预测性参数。能否将本文的MI框架扩展到估计因果效应,例如平均处理效应(ATE)或条件平均处理效应(CATE)?这需要处理竞争风险下的因果识别问题(如Fine-Gray模型本身是否具有因果解释)。(扎根于:引言未引用任何因果推断文献;本文方法本质上是预测性建模。)
  4. 高维协变量场景:当协变量 \( X \) 的维度 \( p \) 很大(甚至 \( p > n \))时,本文的MI方法(需要拟合一个参数插补模型)会面临“维数灾难”。能否将本文方法与高维变量选择(如Lasso)或降维技术结合,以处理高维删失协变量问题?(扎根于:本文所有模拟和例子中 \( p \) 都很小;未讨论高维情况。)

Maintained by 陈星宇 · Homepage · Source on GitHub

评论