跳转至

Landmarking with Latent Class Mixed Models for Dynamic Prediction of Time-to-event Data with Heterogeneous Biomarker Trajectories

作者: Víctor Velasco-Pardo, Nathan Constantine-Cooke, Charlie W. Lees, Catalina A. Vallejos
主题: 因果推断
相关性: 5/10
链接: https://arxiv.org/abs/2606.24678


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是动态风险预测(dynamic risk prediction),具体指利用纵向重复测量的时变协变量(如生物标志物)来更新个体在未来时间窗口内的生存概率。核心统计问题是:给定个体在 landmark 时间 \(s\) 仍处于风险集,如何利用截至 \(s\) 的纵向历史 \(Y_i(s)\) 和静态协变量,估计 \(\pi_i(s+w|s) = \Pr(T_i > s+w \mid T_i \ge s, Y_i(s), w_i)\)。该方向在电子健康记录(EHR)大规模异质性队列中需求迫切,但现有方法在处理未观测异质性计算可扩展性之间存在张力。

发展脉络(history)

  • 奠基工作:Wulfsohn & Tsiatis (1997) 提出联合纵向与生存模型(JMLS),通过共享随机效应刻画纵向轨迹与事件时间的关联,但要求共同基线 \(t=0\),计算代价高。Van Houwelingen (2007) 提出 landmarking 两步法:在每个 landmark 时间点,仅用风险集个体拟合生存模型,纵向历史用“最后一次观测向前填充”(LOCF)总结,计算简单但忽略测量误差。
  • 主要进展:Rizopoulos et al. (2017) 系统比较了 JMLS 与 landmarking,指出 JMLS 在模型正确时预测更优,但 landmarking 更灵活、可扩展。Paige et al. (2018) 将线性混合效应模型(LME)嵌入 landmarking,用最佳线性无偏预测(BLUP)总结纵向轨迹,部分克服测量误差,但仍假设随机效应同质(正态分布)。Ferrer et al. (2019) 验证了 landmarking 与 JMLS 的估计量性质,确认 JMLS 在正确设定下优势。De Swart et al. (2025) 提出 superlandmarking,通过堆叠数据借用跨 landmark 信息,但大样本推断仍有挑战。
  • 当前 frontier 与本文位置:当存在未观测亚组结构(如疾病亚型、未观测混杂导致的异质性轨迹)时,上述方法均假设纵向过程同质。Lin et al. (2000, 2002) 提出联合潜在类别模型(JLCM),将个体分配到离散潜在类别,每个类别有独立的纵向与生存子模型,但计算强度与 JMLS 类似,且同样要求共同基线,难以用于 EHR 大规模数据。本文将潜在类别混合模型(LCMM, McCulloch et al., 2002; Proust-Lima et al., 2017)嵌入 landmarking 框架,在保留 landmarking 灵活性的同时,通过 LCMM 捕捉未观测异质性,并开发模块化 R 包 landmaRk 实现。

子线索聚类

  1. 联合建模路线(JMLS / JLCM):共享随机效应或潜在类别,统一似然,理论性质好但计算昂贵,要求共同基线。代表:Wulfsohn & Tsiatis (1997), Lin et al. (2000, 2002), Rizopoulos (2012)。
  2. Landmarking 路线:两步法,灵活选择纵向总结方式与生存模型,计算高效,可处理不同随访长度。代表:Van Houwelingen (2007), Paige et al. (2018), Barrett et al. (2017), De Swart et al. (2025)。
  3. 异质性建模路线:用潜在类别或混合模型刻画未观测亚组。代表:Lin et al. (2000, 2002) 的 JLCM,McCulloch et al. (2002) 的 LCMM(仅纵向),以及本文的 LCMM+landmarking。

核心问题与瓶颈

  • 核心问题:如何在 EHR 大规模异质性队列中,利用纵向生物标志物进行动态风险预测,同时处理未观测亚组结构?
  • 已知瓶颈:JMLS/JLCM 计算不可扩展(Rizopoulos et al., 2017 指出“failing to scale well”);传统 landmarking 假设同质轨迹(LOCF 忽略测量误差,LME 假设正态随机效应);现有 landmarking 软件(如 Landmarking 包)仅支持 LOCF 和 LME,无法灵活扩展。

⚠️ 作者的 framing

作者将缺口 frame 为:“现有 landmarking 假设同质,JLCM 计算昂贵,因此需要一种可扩展的异质性感知 landmarking 方法”。他们淡化/回避了: - JLCM 在模型正确设定下可能更优的理论性质(Ferrer et al., 2019 的结论被引用但未深入讨论); - LCMM 本身要求误差正态、类别数预先指定等强假设; - 未讨论其他异质性建模方法(如广义加性模型 Zhang et al., 2013、潜在高斯过程 Hall et al., 2008),仅在结论中提及作为替代。

值得研究者去查的问题:作者未引用任何关于半参数/非参数潜在类别模型的工作(如基于 Dirichlet process 的混合模型),也未讨论因果推断中处理未观测混杂的 proximal 方法(如 negative control),尽管两者在概念上相关。此外,landmaRk 包的 CRAN 搜索(Supplementary Table S1)显示,除 Landmarking 外,其他包均不涉及纵向数据——这暗示该领域软件生态确实薄弱,但作者未讨论为何不直接扩展 Landmarking 包而是另起炉灶。

张力

未见明显对立引用。所有被引工作一致认为 JMLS/JLCM 计算昂贵、landmarking 灵活但同质假设强,本文的定位是自然的折中。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(N\):个体数。 - \(T_i\):事件或删失时间(随机变量)。 - \(D_i\):删失指示(1=事件,0=删失)。 - \(Y_i = (y_{i1}, \dots, y_{in_i})^\top\):个体 \(i\)\(n_i\) 次纵向测量(可观测)。 - \(t_{ij}\):第 \(j\) 次测量的时间点。 - \(m_i(t)\):潜在的真实纵向过程(不可观测,有测量误差)。 - \(x_i, w_i\):静态协变量向量(可观测),分别影响纵向和生存过程。 - \(s\):landmark 时间(预指定)。 - \(w\):预测窗口长度。 - \(R_s = \{i: T_i \ge s\}\):landmark 时间 \(s\) 的风险集。 - \(Y_i(s) = \{y_{ij}: t_{ij} \le s\}\):截至 \(s\) 的纵向历史(可观测)。 - \(\hat{y}_i(s)\):对 \(Y_i(s)\) 的总结(标量或向量),作为生存模型的输入。 - \(\pi_i(s+w|s) = \Pr(T_i > s+w \mid T_i \ge s, \hat{y}_i(s), w_i)\):动态预测概率(目标 estimand)。 - \(G\):潜在类别数(需预先指定)。 - \(c_i \in \{1,\dots,G\}\):个体 \(i\) 的潜在类别标签(不可观测)。 - \(\pi_{ig} = \Pr(c_i = g \mid x_i, Y_i(s))\):后验类别概率(由 LCMM 估计)。 - \(\hat{c}_i = \arg\max_g \hat{\pi}_{ig}\):预测的类别标签(硬分配)。 - \(\hat{y}_i(s|x_i, c_i=g)\):给定类别 \(g\) 的纵向轨迹预测(由 LCMM 的 empirical Bayes 给出)。

模型: - Landmarking 框架:在每个 \(s\),对风险集 \(R_s\) 拟合一个生存模型(本文用 Cox PH),输入为 \(\hat{y}_i(s)\)\(w_i\),有时还包括 \(\hat{c}_i\)。生存模型形式:

\[h_i(t|w_i, \hat{y}_i(s), s) = h_0(t|s) \exp(\gamma_s^\top w_i + \alpha_s \hat{y}_i(s)), \quad t > s.\]
- LCMM 纵向子模型(用于生成 \(\hat{y}_i(s)\)\(\hat{\pi}_{ig}\)): - 类别分配:\(\Pr(c_i = g \mid x_i) = \frac{\exp(\xi_{0g} + x_{1i}^\top \xi_{1g})}{\sum_{\ell} \exp(\xi_{0\ell} + x_{1i}^\top \xi_{1\ell})}\)(多项 logit)。 - 给定类别 \(g\),纵向测量:
\[y_{ij} \mid c_i=g = m_i(t_{ij} \mid x_i, c_i=g) + \epsilon_{ij}, \quad \epsilon_{ij} \sim N(0, \sigma^2),\]
其中 \(m_i(t \mid x_i, c_i=g) = \beta_g^\top x_{2i}(t) + b_{ig}^\top z_i(t)\)\(b_{ig} \sim N(0, \Sigma_g)\)。 - 后验概率:\(\pi_{ig} = \frac{\phi_{ig}(Y_i(s) \mid x_i, c_i=g) \Pr(c_i=g \mid x_i)}{\Pr(Y_i(s) \mid x_i)}\),由 Bayes 公式计算。

可观测数据\(\{T_i, D_i, Y_i, x_i, w_i\}_{i=1}^N\)。不可观测:潜在类别 \(c_i\)、随机效应 \(b_{ig}\)、真实轨迹 \(m_i(t)\)

第二步:最小内核

最简特例:假设只有 \(G=2\) 个潜在类别,纵向轨迹为线性(仅随机截距和斜率),且只有一个 landmark 时间 \(s\)。此时 LCMM 退化为一个两类别混合线性模型,每个类别有各自的固定效应 \((\beta_{0g}, \beta_{1g})\) 和随机效应方差 \(\Sigma_g\)。生存模型为 Cox PH,输入为 \(\hat{y}_i(s)\) 和可选的 \(\hat{c}_i\)

核心思路:传统 LME 假设所有个体共享相同的随机效应分布(正态),当存在两个不同轨迹模式的亚组时,LME 的 BLUP 会“平均”两个模式,导致预测偏差。LCMM 先通过 EM 算法估计两个类别的参数和后验概率 \(\hat{\pi}_{i1}, \hat{\pi}_{i2}\),然后对每个个体计算加权平均轨迹预测:

\[\hat{y}_i(s) = \hat{\pi}_{i1} \hat{y}_i(s|x_i, c_i=1) + \hat{\pi}_{i2} \hat{y}_i(s|x_i, c_i=2).\]
此外,还可将硬分配 \(\hat{c}_i = \arg\max_g \hat{\pi}_{ig}\) 作为额外协变量加入 Cox 模型,以捕捉轨迹形状信息(例如,类别 1 是上升趋势,类别 2 是下降趋势,即使它们在 \(s\) 时刻的预测值相同,未来风险也不同)。

为什么有效:在模拟中,\(\hat{y}_i(s)\) 本身与 LME 的 BLUP 差异不大(因为加权平均仍接近整体均值),但加入 \(\hat{c}_i\) 后,生存模型能利用类别标签反映的轨迹形状信息,从而显著提升预测区分度(tdAUC)和校准度(Brier score)。这是本文的核心发现:异质性的价值主要体现在类别标签,而非轨迹点预测的改进


三、这篇论文做了什么

三句话

  1. 研究问题:在 EHR 大规模异质性队列中,如何利用纵向生物标志物进行动态风险预测,同时处理未观测亚组结构且保持计算可扩展性。
  2. 核心工具:将潜在类别混合模型(LCMM)嵌入 landmarking 框架,用 LCMM 估计后验类别概率和类别特异性轨迹预测,再以加权平均轨迹和/或预测类别标签作为 Cox 生存模型的输入;开发模块化 R 包 landmaRk 实现。
  3. 主要结论:模拟和真实数据(aids 数据集)表明,在存在潜在异质性时,所提方法(尤其是包含预测类别标签的 LCMMGcl 规格)在区分度和校准度上优于传统 landmarking(LOCF、LME),且计算效率远高于联合潜在类别模型(JLCM);但性能依赖于类别数 \(G\) 的选择和是否包含类别标签,且无单一规格在所有场景下最优。

关键设定与假设

  • Landmarking 设定:landmark 时间 \(s\) 预先指定;每个 landmark 独立拟合纵向和生存模型(也可用单一全局纵向模型作为敏感性分析);生存时间在预测窗口 \([s, s+w)\) 外截尾以缓解“老化协变量”问题。
  • LCMM 假设
  • 类别数 \(G\) 预先指定(可通过网格搜索或探索性分析选择)。
  • 误差项 \(\epsilon_{ij}\) 正态分布(模拟中考察了 \(t_5\) 重尾误差的稳健性)。
  • 随机效应 \(b_{ig}\) 正态分布,类别特异性方差 \(\Sigma_g\)
  • 类别分配由多项 logit 模型决定,协变量 \(x_{1i}\) 可影响分配概率。
  • 相比已有文献的放宽/强化
  • 放宽了传统 landmarking 的同质轨迹假设(LME 的正态随机效应)。
  • 相比 JLCM,放宽了共同基线要求(landmarking 天然允许不同随访起点),且计算更高效(模块化、可并行)。
  • 但强化了 LCMM 的分布假设(正态误差、正态随机效应),而 JLCM 也可用其他分布。

主要结果

  • 模拟研究(8 个场景,\(N=1000,2000\)\(G=3\) 真实类别):
  • 所有 landmarking 方法均优于无纵向信息的静态模型。
  • LCMM 不含类别标签(LCMMG)与 LME 性能相当,有时更差——说明仅靠加权平均轨迹无法充分捕捉异质性。
  • LCMM 含类别标签(LCMMGcl)在大多数场景下是 top performer,区分度(tdAUC 增量)和校准度(Brier score 负增量)均优于 LME 和 JLCM。
  • JLCM 的校准度显著差于 landmarking(Brier score 高出数倍),且计算时间更长(Supplementary Table S18:JLCM4 中位数 6.5 小时 vs LCMM4cl 中位数 3.8 小时)。
  • 过指定类别数(如真实 \(G=3\) 但用 \(G=4\))在 landmark 特异性纵向模型中影响较小,但在单一全局纵向模型中灾难性(校准度崩溃)。
  • 真实数据案例(aids 数据集,\(N=467\),CD4 轨迹预测死亡):
  • 无单一模型在所有 landmark 和预测窗口下最优。LCMM2cl 在早期 landmark(\(s=7,8,9\))tdAUC 最高,但后期(\(s=12\))LME 反超。
  • 所有 landmarking 方法校准度(Brier score)差异不大,但 JLCM 校准度极差(Brier score 约 0.2-0.3 vs landmarking 约 0.08-0.16)。
  • 包含类别标签的 LCMM2cl 在部分场景优于不含标签的 LCMM2,但优势不如模拟中显著。

证明路线与技术技巧(本文为应用型,无理论证明,但可拆解方法设计)

  • 整体路线(方法设计逻辑):
  • 在每个 landmark \(s\),用风险集 \(R_s\) 的纵向数据拟合 LCMM,估计参数和后验概率。
  • 对每个个体,计算加权平均轨迹预测 \(\hat{y}_i(s) = \sum_g \hat{\pi}_{ig} \hat{y}_i(s|x_i, c_i=g)\),并可选硬分配 \(\hat{c}_i\)
  • \(\hat{y}_i(s)\) 和/或 \(\hat{c}_i\) 作为协变量,拟合 landmark 特异性 Cox PH 模型。
  • 用 IPCW 调整的 tdAUC 和 Brier score 评估预测性能(5 折交叉验证,相同折)。
  • 关键跳跃点:为何加权平均轨迹不提升性能,而加入类别标签提升?作者解释为:\(\hat{y}_i(s)\) 是条件期望的加权平均,与 LME 的 BLUP 数值相近;但类别标签编码了轨迹形状(上升/下降/波动),提供了超越当前值的预后信息。这一解释是经验性的,无理论证明。
  • 技术技巧
  • LCMM 的 EM 算法(Proust-Lima et al., 2017 实现)。
  • IPCW 调整的 tdAUC 和 Brier score(Blanche et al., 2019; Graf et al., 1999),用 riskRegression 包计算。
  • 交叉验证中分层抽样(按事件指示)确保折间事件数平衡。
  • 模块化 R 包设计:landmaRk 将 landmarking 拆分为“初始化→风险集→纵向模型→生存模型→评估”五个步骤,用户可自定义任意组件。

真实例子与应用

  • 数据aids 数据集(JMbayes2 包),467 名 HIV 患者,随机接受 ddI 或 ddC 治疗,基线及四次随访测量 CD4 计数(平方根变换),主要终点为死亡(188 事件,279 删失)。
  • 方法应用:landmark 时间 \(s=7,8,9,10,11,12\) 个月,预测窗口 \(w=3,6\) 个月。纵向模型用 LME 和 LCMM(\(G=2,3,4\)),生存模型用 Cox PH,包含药物指示、预测 CD4 值和/或预测类别标签。JLCM 作为对比。
  • 结果:LCMM2cl 在 \(s=8, w=3\) 时 tdAUC 最高(0.678),但 LME 在 \(s=12\) 时反超。所有 landmarking 方法 Brier score 相近(0.08-0.16),JLCM 的 Brier score 高达 0.17-0.32。作者强调“no single model is uniformly best”。
  • 例子想说明:验证方法在真实数据中的可行性,并展示性能依赖于 landmark 时间、预测窗口和模型选择,提示实践者需根据具体场景选择。

🔎 结论是否比证明窄

  • 。本文所有结论基于模拟和单一真实数据案例,无理论保证(如一致性、渐近分布、效率界)。例如,结论“LCMMGcl 优于 LME”仅在模拟场景(数据由 JLCM 生成,\(G=3\),线性轨迹误设)下成立,真实数据中优势不统一。作者在结论中承认“limitation: number of clusters must be specified in advance”、“ignores uncertainty in cluster labels”。此外,模拟中纵向模型是误设的(真实非线性,模型用线性),但作者未讨论误设程度对结论的影响。

四、开放问题(扎根具体语句)

  1. 类别数 \(G\) 的选择:作者指出“the number of clusters \(G\) has to be specified in advance, or chosen via a grid-search”(结论第 2 段)。如何为 landmark 特异性模型选择 \(G\)?是否可开发数据驱动的选择准则(如基于交叉验证的预测性能、或信息准则的整合)?扎根于结论第 2 段。

  2. 预测不确定性的传播:landmarking 两步法忽略纵向模型和类别分配的不确定性。作者提到“uncertainty in cluster allocations is taken into account when averaging cluster-specific predictions… however, such uncertainty is ignored when including predicted cluster labels in the survival model”(结论第 3 段)。能否将后验概率 \(\hat{\pi}_{ig}\) 直接作为权重或协变量纳入生存模型,而非硬分配?这需要开发新的推断方法。

  3. 误差分布稳健性:LCMM 假设误差正态,但模拟中 \(t_5\) 误差下性能仍可接受,作者未给出理论条件。能否放松为半参数或非参数误差分布?作者在结论中提及“generalised additive models and latent Gaussian processes may offer a viable option”(结论第 4 段),但未展开。

  4. 计算收敛问题:早期 landmark(数据稀疏)或风险集过小时,LCMM 优化器可能不收敛(模拟中 LCMM4 在 \(N=1000\) 时失败)。如何保证小样本下的稳定性?是否可引入正则化或贝叶斯先验?扎根于模拟结果(Supplementary Figures 中多处标注“optimiser failed to converge”)。

提醒:要确认这些是否为真 gap,建议阅读近期 5 篇关于动态预测中异质性建模的论文(如 Ferrer et al. 2019 的后续、或 EHR 预测的综述),看它们是否指向相同问题。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论