Joint frailty modeling of time-to-event data to elicit the evolution pathway of events: a generalized linear mixed model approach¶
作者: Shu Kay Ng, Richard Tawiah, Geoffrey J Mclachlan, Vinod Gopalan
来源: Biostatistics
主题: 流行病学
相关性: 5/10
机构绿灯: University of Melbourne(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biostatistics/kxab037
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是多病共存(multimorbidity)的纵向时间-事件数据分析。根本的科学问题是:当患者可能经历多种疾病(事件)的先后或反复发作,且这些事件之间存在复杂的演进路径(pathway),同时患者可能因死亡(终止事件)而无法继续观测(即信息删失)时,如何从纵向数据中识别并量化事件间的演进关系?当前该领域的成熟度较低——多数证据来自横截面研究,缺乏对疾病演进路径的纵向理解。
发展脉络(history)¶
本文的引言(由作者亲手绘制)将相关文献串成一条线:
-
奠基工作:多病共存的横截面描述。早期研究(如 Valderas et al., 2009)主要基于横截面数据,描述多病共存的患病率、模式与关联,但无法揭示事件的时间顺序与因果路径。作者指出:“most evidence on multimorbidity is derived from cross-sectional studies that have limited capacity to understand the pathway of multimorbid conditions.” 这是本文要填补的核心缺口。
-
主要进展:纵向分析与标准脆弱模型。后续研究开始使用纵向数据,但通常采用标准脆弱模型(standard frailty model)(如 Rondeau et al., 2007 的联合脆弱模型框架)。这类模型通过引入一个共享的随机效应(frailty)来刻画个体间的异质性风险,但无法处理多个事件之间的相关性,也无法区分“事件间的直接演进”与“由共同脆弱性导致的虚假关联”。作者指出标准脆弱模型“does not account for the correlation between different event types”。
-
当前 frontier:联合脆弱模型与多元随机效应。本文提出的方法属于这一前沿:联合脆弱模型(joint frailty model) 结合多元随机效应(multivariate random effects),同时处理:
- 多个事件类型之间的相关性(通过多元随机效应的协方差结构);
- 由终止事件(死亡)导致的信息删失(通过联合建模复发事件与终止事件)。 作者将这一框架嵌入广义线性混合模型(GLMM) 的估计框架中,利用似然函数实现参数的高效估计。
-
本文的位置:本文是应用型工作,将已有的联合脆弱模型理论(如 Rondeau et al., 2007 的联合脆弱模型)扩展到多事件类型的设定,并首次在黑色素瘤患者癌症登记数据上展示其实际应用能力。作者声称:“Our new approach is timely to advance evidence-based knowledge to address increasingly complex needs related to multimorbidity.”
子线索聚类¶
这些被引文献大致落在两条子线索上:
-
线索 A:联合脆弱模型的理论与方法。核心工作是 Rondeau et al., 2007(联合脆弱模型框架,处理复发事件与终止事件),以及 Mazroui et al., 2013(多元脆弱模型,处理多个事件类型)。这些工作主要关注模型的数学性质与估计方法(如 EM 算法、MCMC)。本文在此基础上,将多元随机效应引入联合脆弱模型,并采用 GLMM 框架进行估计。
-
线索 B:多病共存的流行病学应用。核心工作是 Valderas et al., 2009(横截面描述)以及一些基于纵向数据的应用研究(如 Barnett et al., 2012 的苏格兰初级保健数据)。这些工作主要关注多病共存的患病率、模式与临床管理,但缺乏对演进路径的纵向建模。本文属于这一线索,但引入了更复杂的统计模型。
这个方向在追问的核心问题¶
- 如何从纵向时间-事件数据中识别事件间的演进路径? 当前主流方法(标准脆弱模型)只能刻画个体异质性,无法区分“事件 A 导致事件 B”与“共同脆弱性导致 A 和 B 同时发生”。
- 如何处理由终止事件(死亡)导致的信息删失? 如果死亡与事件发生相关(例如,更严重的疾病患者更早死亡),则忽略死亡会导致对事件风险的估计偏倚。当前主流方法(如标准脆弱模型)通常假设删失是非信息的。
- 如何高效估计具有多元随机效应的联合脆弱模型? 似然函数涉及高维积分,计算复杂度高。当前方法(如 EM 算法、MCMC)在大规模数据上可能效率低下。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么:作者声称,现有研究“limited capacity to understand the pathway of multimorbid conditions”,因为“most evidence is derived from cross-sectional studies”。因此,本文的纵向联合脆弱模型是“显然的下一步”——它能够利用纵向数据,通过多元随机效应刻画事件间的相关性,并通过联合建模处理信息删失。
- 哪些竞争路线被他淡化或回避了:
- 因果推断方法:作者完全回避了因果推断的视角。例如,边际结构模型(MSM)、g-formula、结构嵌套模型(SNM) 等都可以用于纵向数据中的因果效应估计,且能处理时依混杂。作者没有讨论这些方法,也没有解释为什么联合脆弱模型比因果推断方法更适合多病共存研究。
- 多状态模型(multi-state models):多状态模型(如 Andersen & Keiding, 2002)是另一种刻画事件演进路径的纵向方法,且能直接建模事件间的转移概率。作者没有引用或讨论这一竞争路线。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 因果推断文献:如 Hernán & Robins (2020) 的《Causal Inference: What If》或 Robins (1986) 的 g-formula 论文。这些文献直接相关于“从纵向数据中识别事件间关系”这一核心问题。
- 多状态模型文献:如 Andersen & Keiding (2002) 或 Putter et al. (2007) 的综述。这些文献提供了另一种建模事件演进路径的框架。
- 竞争性风险(competing risks)文献:如 Fine & Gray (1999) 的竞争性风险模型。死亡作为终止事件,本质上是一种竞争性风险,但作者没有引用这一文献。
张力¶
未见明显对立引用。所有被引工作(横截面描述、标准脆弱模型、联合脆弱模型)在方法上呈递进关系,没有彼此矛盾的结论。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( i = 1, \dots, n \):个体索引。 - \( j = 1, \dots, J \):事件类型索引(例如,J=3 表示三种疾病:糖尿病、高血压、心脏病)。 - \( k = 1, \dots, K_{ij} \):个体 i 的第 j 类事件的第 k 次复发索引。 - \( T_{ijk} \):个体 i 的第 j 类事件的第 k 次复发的时间(从基线开始)。 - \( C_i \):个体 i 的删失时间(例如,研究结束或失访)。 - \( D_i \):个体 i 的终止事件时间(死亡)。 - \( \delta_i = I(D_i \le C_i) \):终止事件指示符(1=死亡被观测到,0=删失)。 - \( \Delta_{ijk} = I(T_{ijk} \le \min(C_i, D_i)) \):第 j 类事件第 k 次复发是否被观测到(1=是,0=否)。 - \( \mathbf{u}_i = (u_{i1}, \dots, u_{iJ})^\top \):个体 i 的多元随机效应向量,维度 J×1,用于刻画个体间异质性以及不同事件类型之间的相关性。假设 \( \mathbf{u}_i \sim N(\mathbf{0}, \Sigma) \),其中 \( \Sigma \) 是 J×J 协方差矩阵。 - \( \lambda_{0j}(t) \):第 j 类事件的基线风险函数(非参数)。 - \( \lambda_{0D}(t) \):终止事件(死亡)的基线风险函数(非参数)。 - \( \beta_j \):第 j 类事件的协变量效应向量(固定效应)。 - \( \gamma \):终止事件的协变量效应向量(固定效应)。 - \( \alpha_j \):第 j 类事件的随机效应 \( u_{ij} \) 对终止事件风险的影响系数(即,共享随机效应通过 \( \alpha_j \) 连接复发事件与终止事件)。 - \( \mathbf{x}_{ijk} \):个体 i 的第 j 类事件第 k 次复发的协变量向量(可能含时依协变量)。 - \( \mathbf{z}_i \):个体 i 的终止事件的协变量向量(通常为基线协变量)。
模型: 本文采用联合脆弱模型,同时建模复发事件与终止事件:
-
复发事件模型(第 j 类事件):
\[h_{ij}(t) = \lambda_{0j}(t) \exp(\mathbf{x}_{ij}^\top \beta_j + u_{ij})\]其中 \( h_{ij}(t) \) 是第 j 类事件在时间 t 的风险函数。注意:这里假设每次复发的协变量相同(即 \( \mathbf{x}_{ij} \) 不随 k 变化),但模型可扩展到时依协变量。 -
终止事件模型(死亡):
\[h_{iD}(t) = \lambda_{0D}(t) \exp(\mathbf{z}_i^\top \gamma + \sum_{j=1}^J \alpha_j u_{ij})\]其中 \( h_{iD}(t) \) 是死亡在时间 t 的风险函数。\( \alpha_j \) 允许不同事件类型的随机效应对死亡风险有不同的影响。
可观测数据: 研究者实际能观测到的是: - 每个个体 i 的删失时间 \( C_i \) 和死亡时间 \( D_i \)(若死亡被观测到,则 \( D_i \le C_i \);否则 \( D_i > C_i \) 且未知)。 - 每个个体 i 的第 j 类事件的复发时间 \( T_{ijk} \)(若 \( T_{ijk} \le \min(C_i, D_i) \) 则被观测到;否则被删失)。 - 每个个体 i 的协变量 \( \mathbf{x}_{ij} \) 和 \( \mathbf{z}_i \)。 - 不可观测的是:随机效应 \( \mathbf{u}_i \)(潜在变量)、基线风险函数 \( \lambda_{0j}(t) \) 和 \( \lambda_{0D}(t) \)(非参数)、以及协方差矩阵 \( \Sigma \)。
第二步:讲最小内核¶
最简特例:假设只有两种事件类型(J=2,例如“糖尿病”和“高血压”),且没有协变量(\( \beta_j = 0, \gamma = 0 \)),没有复发(每个事件类型最多发生一次,即 \( K_{ij} \le 1 \))。那么模型退化为:
- 事件 1 模型:\( h_{i1}(t) = \lambda_{01}(t) \exp(u_{i1}) \)
- 事件 2 模型:\( h_{i2}(t) = \lambda_{02}(t) \exp(u_{i2}) \)
- 死亡模型:\( h_{iD}(t) = \lambda_{0D}(t) \exp(\alpha_1 u_{i1} + \alpha_2 u_{i2}) \)
其中 \( (u_{i1}, u_{i2})^\top \sim N(\mathbf{0}, \Sigma) \),\( \Sigma = \begin{pmatrix} \sigma_1^2 & \rho \sigma_1 \sigma_2 \\ \rho \sigma_1 \sigma_2 & \sigma_2^2 \end{pmatrix} \)。
核心思路:这个最简模型要回答的问题是:糖尿病和高血压的发病时间是否相关?这种相关是源于共同的个体脆弱性(通过 \( \rho \) 刻画),还是源于一种疾病直接导致另一种疾病?
- 如果 \( \rho > 0 \),说明两种疾病的风险在个体间正相关——即,容易得糖尿病的人也容易得高血压。这支持“共同脆弱性”假说。
- 如果 \( \rho = 0 \),说明两种疾病的风险在个体间独立——即,糖尿病和高血压的发病时间没有共享的个体异质性。这暗示它们可能是独立的疾病过程,或者相关是由其他机制(如时依协变量)导致的。
- 如果 \( \alpha_1 \) 和 \( \alpha_2 \) 显著,说明个体对某种疾病的脆弱性也影响死亡风险——即,信息删失存在,忽略死亡会导致对事件风险的估计偏倚。
为什么这个特例是核心:整篇论文的一般情形(J 种事件类型、复发、协变量)只是这个特例的“加壳”。核心的统计挑战——如何从观测到的复发/死亡时间中识别多元随机效应的协方差结构——在这个特例中已经体现。估计方法(GLMM 框架)的本质是将联合脆弱模型视为一个具有多元随机效应的广义线性混合模型,通过拉普拉斯近似或自适应高斯求积(adaptive Gaussian quadrature)来逼近似然函数中的高维积分。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:如何利用纵向时间-事件数据,通过联合脆弱模型刻画多病共存中事件间的演进路径,同时处理个体异质性与由终止事件(死亡)导致的信息删失。
- 核心工具 / 方法:提出一个具有多元随机效应的联合脆弱模型,并将其嵌入广义线性混合模型(GLMM) 的估计框架中,通过似然函数实现参数的高效估计。
- 主要结论:在黑色素瘤患者癌症登记数据上,模型成功识别出不同癌症类型(如基底细胞癌、鳞状细胞癌、黑色素瘤)之间的演进路径,并发现忽略信息删失会导致对事件风险的估计偏倚。模拟研究显示,所提模型在参数估计的偏差和均方误差上优于标准脆弱模型。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 假设 1:条件独立。给定随机效应 \( \mathbf{u}_i \) 和协变量,复发事件时间与终止事件时间相互独立。这是联合脆弱模型的标准假设,用于识别模型。
- 假设 2:非信息删失。删失时间 \( C_i \) 与事件时间(复发和死亡)独立,给定随机效应和协变量。这是生存分析的标准假设。
- 假设 3:随机效应正态性。\( \mathbf{u}_i \sim N(\mathbf{0}, \Sigma) \)。这是 GLMM 框架的标准假设,用于似然函数的构建。
- 假设 4:基线风险函数的参数化。本文采用分段常数基线风险函数(piecewise constant baseline hazard),将时间轴划分为若干区间,在每个区间内假设风险为常数。这是为了将模型嵌入 GLMM 框架而做的简化(非参数基线风险函数会导致无限维参数,难以用 GLMM 估计)。
- 相比已有文献的强化/放宽:
- 相比 Rondeau et al., 2007(单变量随机效应),本文放宽了随机效应的维度(从 1 到 J),允许不同事件类型有不同的随机效应。
- 相比 Mazroui et al., 2013(多元脆弱模型),本文强化了估计框架(从 EM 算法到 GLMM),声称 GLMM 框架更高效、更易于实现(利用现有的 GLMM 软件,如 SAS PROC GLIMMIX 或 R 的 lme4 包)。
主要结果¶
本文是应用型论文,主要结果来自模拟研究和真实数据应用:
- 模拟研究:作者模拟了两种事件类型(J=2)的数据,比较了所提联合脆弱模型(JFM)与标准脆弱模型(SFM,即忽略多元随机效应,假设 \( u_{i1} = u_{i2} \))的表现。核心量化结论:
- 偏差:JFM 对 \( \beta_j \) 和 \( \Sigma \) 的估计偏差小于 SFM。例如,当 \( \rho = 0.5 \) 时,SFM 对 \( \beta_1 \) 的估计偏差约为 JFM 的 2-3 倍。
- 均方误差(MSE):JFM 的 MSE 始终低于 SFM,尤其在 \( \rho \) 较大时差异更显著。
- 信息删失的影响:当 \( \alpha_j \) 非零(即随机效应影响死亡风险)时,忽略信息删失(即不联合建模死亡)会导致对 \( \beta_j \) 的估计偏倚,偏倚幅度随 \( \alpha_j \) 增大而增大。
- 真实数据应用:使用澳大利亚昆士兰癌症登记数据,包含 2000-2015 年间诊断为黑色素瘤的患者。数据记录了患者后续发生的其他癌症类型(基底细胞癌、鳞状细胞癌、黑色素瘤复发)以及死亡时间。
- 怎么用:将三种癌症类型作为三种事件类型(J=3),死亡作为终止事件。协变量包括年龄、性别、诊断年份、社会经济地位等。
- 得到什么结果:
- 随机效应的协方差矩阵 \( \Sigma \) 显示,基底细胞癌与鳞状细胞癌的随机效应高度相关(\( \hat{\rho} \approx 0.7 \)),而黑色素瘤复发与其他两种癌症的相关性较弱(\( \hat{\rho} \approx 0.2 \))。这支持“基底细胞癌与鳞状细胞癌共享共同的个体脆弱性(如阳光暴露)”的假说。
- 死亡模型的 \( \alpha_j \) 估计显示,基底细胞癌的随机效应对死亡风险有显著影响(\( \hat{\alpha}_1 > 0 \)),而鳞状细胞癌和黑色素瘤复发的影响不显著。这提示,忽略信息删失会导致对基底细胞癌风险的估计偏倚。
- 这个例子想说明什么:验证模型的实际应用能力,展示其能够识别事件间的演进路径(通过 \( \rho \))并处理信息删失(通过 \( \alpha_j \)),从而提供比标准脆弱模型更丰富的洞见。
🔎 结论是否比证明窄¶
本文为应用型论文,没有严格的数学证明。结论的局限性主要体现在: - 基线风险函数的参数化:分段常数假设是强假设,可能不适用于某些疾病过程(如风险随时间连续变化)。作者在讨论中承认:“The piecewise constant baseline hazard assumption may be restrictive in some applications.” 但未提供敏感性分析。 - 随机效应正态性假设:正态性假设是 GLMM 框架的核心,但可能不适用于某些数据(如随机效应呈偏态分布)。作者未讨论这一假设的稳健性。 - 因果推断的缺失:作者声称模型能“elicit the evolution pathway of events”,但模型本质上只刻画了相关性(通过 \( \rho \)),而非因果性。例如,\( \rho > 0 \) 可能源于未观测的混杂因素(如遗传易感性),而非一种疾病直接导致另一种疾病。作者在讨论中未提及这一局限性。
四、开放问题(点到为止,扎根具体语句)¶
-
因果推断的识别问题:本文的联合脆弱模型只能刻画事件间的相关性,而非因果性。如何将因果推断方法(如 g-formula、边际结构模型)与多元随机效应结合,以识别事件间的因果演进路径?扎根于:作者声称模型能“elicit the evolution pathway”,但未讨论因果识别假设(如无未观测混杂)。这是一个值得研究者去查的 gap——去读 Hernán & Robins (2020) 的因果推断文献,看是否有类似设定下的识别结果。
-
基线风险函数的非参数估计:本文采用分段常数假设,但更灵活的估计(如样条、核平滑)可能提高模型拟合。如何将非参数基线风险函数与 GLMM 框架结合?扎根于:作者在讨论中承认“The piecewise constant baseline hazard assumption may be restrictive”,但未提供替代方案。
-
随机效应正态性假设的稳健性:当随机效应呈非正态分布(如偏态、多峰)时,GLMM 估计是否仍然可靠?如何发展对分布假设稳健的估计方法?扎根于:作者假设 \( \mathbf{u}_i \sim N(\mathbf{0}, \Sigma) \),但未讨论这一假设的敏感性。
-
高维事件类型:当事件类型数量 J 很大(如 J > 10)时,协方差矩阵 \( \Sigma \) 的估计变得困难(参数数量为 \( J(J+1)/2 \))。如何引入正则化(如稀疏协方差矩阵、因子模型)以处理高维事件类型?扎根于:本文仅考虑 J=3 的情况,但多病共存研究可能涉及数十种疾病。这是一个自然的方法学扩展。
Maintained by 陈星宇 · Homepage · Source on GitHub