Landmarking with Latent Class Mixed Models for Dynamic Prediction of Time-to-event Data with Heterogeneous Biomarker Trajectories¶
作者: Víctor Velasco-Pardo, Nathan Constantine-Cooke, Charlie W. Lees, Catalina A. Vallejos
主题: 因果推断
相关性: 5/10
链接: https://arxiv.org/abs/2606.24678
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的子方向是动态风险预测(dynamic risk prediction),具体指利用纵向重复测量的时变协变量(如生物标志物)来更新个体在未来时间窗口内的生存概率。核心统计问题是:给定个体在 landmark 时间 \(s\) 仍处于风险集,如何利用截至 \(s\) 的纵向历史 \(Y_i(s)\) 和静态协变量,估计 \(\pi_i(s+w|s) = \Pr(T_i > s+w \mid T_i \ge s, Y_i(s), w_i)\)。该方向在电子健康记录(EHR)大规模异质性队列中需求迫切,但现有方法在处理未观测异质性与计算可扩展性之间存在张力。
发展脉络(history)¶
- 奠基工作:Wulfsohn & Tsiatis (1997) 提出联合纵向与生存模型(JMLS),通过共享随机效应刻画纵向轨迹与事件时间的关联,但要求共同基线 \(t=0\),计算代价高。Van Houwelingen (2007) 提出 landmarking 两步法:在每个 landmark 时间点,仅用风险集个体拟合生存模型,纵向历史用“最后一次观测向前填充”(LOCF)总结,计算简单但忽略测量误差。
- 主要进展:Rizopoulos et al. (2017) 系统比较了 JMLS 与 landmarking,指出 JMLS 在模型正确时预测更优,但 landmarking 更灵活、可扩展。Paige et al. (2018) 将线性混合效应模型(LME)嵌入 landmarking,用最佳线性无偏预测(BLUP)总结纵向轨迹,部分克服测量误差,但仍假设随机效应同质(正态分布)。Ferrer et al. (2019) 验证了 landmarking 与 JMLS 的估计量性质,确认 JMLS 在正确设定下优势。De Swart et al. (2025) 提出 superlandmarking,通过堆叠数据借用跨 landmark 信息,但大样本推断仍有挑战。
- 当前 frontier 与本文位置:当存在未观测亚组结构(如疾病亚型、未观测混杂导致的异质性轨迹)时,上述方法均假设纵向过程同质。Lin et al. (2000, 2002) 提出联合潜在类别模型(JLCM),将个体分配到离散潜在类别,每个类别有独立的纵向与生存子模型,但计算强度与 JMLS 类似,且同样要求共同基线,难以用于 EHR 大规模数据。本文将潜在类别混合模型(LCMM, McCulloch et al., 2002; Proust-Lima et al., 2017)嵌入 landmarking 框架,在保留 landmarking 灵活性的同时,通过 LCMM 捕捉未观测异质性,并开发模块化 R 包
landmaRk实现。
子线索聚类¶
- 联合建模路线(JMLS / JLCM):共享随机效应或潜在类别,统一似然,理论性质好但计算昂贵,要求共同基线。代表:Wulfsohn & Tsiatis (1997), Lin et al. (2000, 2002), Rizopoulos (2012)。
- Landmarking 路线:两步法,灵活选择纵向总结方式与生存模型,计算高效,可处理不同随访长度。代表:Van Houwelingen (2007), Paige et al. (2018), Barrett et al. (2017), De Swart et al. (2025)。
- 异质性建模路线:用潜在类别或混合模型刻画未观测亚组。代表:Lin et al. (2000, 2002) 的 JLCM,McCulloch et al. (2002) 的 LCMM(仅纵向),以及本文的 LCMM+landmarking。
核心问题与瓶颈¶
- 核心问题:如何在 EHR 大规模异质性队列中,利用纵向生物标志物进行动态风险预测,同时处理未观测亚组结构?
- 已知瓶颈:JMLS/JLCM 计算不可扩展(Rizopoulos et al., 2017 指出“failing to scale well”);传统 landmarking 假设同质轨迹(LOCF 忽略测量误差,LME 假设正态随机效应);现有 landmarking 软件(如
Landmarking包)仅支持 LOCF 和 LME,无法灵活扩展。
⚠️ 作者的 framing¶
作者将缺口 frame 为:“现有 landmarking 假设同质,JLCM 计算昂贵,因此需要一种可扩展的异质性感知 landmarking 方法”。他们淡化/回避了: - JLCM 在模型正确设定下可能更优的理论性质(Ferrer et al., 2019 的结论被引用但未深入讨论); - LCMM 本身要求误差正态、类别数预先指定等强假设; - 未讨论其他异质性建模方法(如广义加性模型 Zhang et al., 2013、潜在高斯过程 Hall et al., 2008),仅在结论中提及作为替代。
值得研究者去查的问题:作者未引用任何关于半参数/非参数潜在类别模型的工作(如基于 Dirichlet process 的混合模型),也未讨论因果推断中处理未观测混杂的 proximal 方法(如 negative control),尽管两者在概念上相关。此外,landmaRk 包的 CRAN 搜索(Supplementary Table S1)显示,除 Landmarking 外,其他包均不涉及纵向数据——这暗示该领域软件生态确实薄弱,但作者未讨论为何不直接扩展 Landmarking 包而是另起炉灶。
张力¶
未见明显对立引用。所有被引工作一致认为 JMLS/JLCM 计算昂贵、landmarking 灵活但同质假设强,本文的定位是自然的折中。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(N\):个体数。 - \(T_i\):事件或删失时间(随机变量)。 - \(D_i\):删失指示(1=事件,0=删失)。 - \(Y_i = (y_{i1}, \dots, y_{in_i})^\top\):个体 \(i\) 的 \(n_i\) 次纵向测量(可观测)。 - \(t_{ij}\):第 \(j\) 次测量的时间点。 - \(m_i(t)\):潜在的真实纵向过程(不可观测,有测量误差)。 - \(x_i, w_i\):静态协变量向量(可观测),分别影响纵向和生存过程。 - \(s\):landmark 时间(预指定)。 - \(w\):预测窗口长度。 - \(R_s = \{i: T_i \ge s\}\):landmark 时间 \(s\) 的风险集。 - \(Y_i(s) = \{y_{ij}: t_{ij} \le s\}\):截至 \(s\) 的纵向历史(可观测)。 - \(\hat{y}_i(s)\):对 \(Y_i(s)\) 的总结(标量或向量),作为生存模型的输入。 - \(\pi_i(s+w|s) = \Pr(T_i > s+w \mid T_i \ge s, \hat{y}_i(s), w_i)\):动态预测概率(目标 estimand)。 - \(G\):潜在类别数(需预先指定)。 - \(c_i \in \{1,\dots,G\}\):个体 \(i\) 的潜在类别标签(不可观测)。 - \(\pi_{ig} = \Pr(c_i = g \mid x_i, Y_i(s))\):后验类别概率(由 LCMM 估计)。 - \(\hat{c}_i = \arg\max_g \hat{\pi}_{ig}\):预测的类别标签(硬分配)。 - \(\hat{y}_i(s|x_i, c_i=g)\):给定类别 \(g\) 的纵向轨迹预测(由 LCMM 的 empirical Bayes 给出)。
模型: - Landmarking 框架:在每个 \(s\),对风险集 \(R_s\) 拟合一个生存模型(本文用 Cox PH),输入为 \(\hat{y}_i(s)\) 和 \(w_i\),有时还包括 \(\hat{c}_i\)。生存模型形式:
可观测数据:\(\{T_i, D_i, Y_i, x_i, w_i\}_{i=1}^N\)。不可观测:潜在类别 \(c_i\)、随机效应 \(b_{ig}\)、真实轨迹 \(m_i(t)\)。
第二步:最小内核¶
最简特例:假设只有 \(G=2\) 个潜在类别,纵向轨迹为线性(仅随机截距和斜率),且只有一个 landmark 时间 \(s\)。此时 LCMM 退化为一个两类别混合线性模型,每个类别有各自的固定效应 \((\beta_{0g}, \beta_{1g})\) 和随机效应方差 \(\Sigma_g\)。生存模型为 Cox PH,输入为 \(\hat{y}_i(s)\) 和可选的 \(\hat{c}_i\)。
核心思路:传统 LME 假设所有个体共享相同的随机效应分布(正态),当存在两个不同轨迹模式的亚组时,LME 的 BLUP 会“平均”两个模式,导致预测偏差。LCMM 先通过 EM 算法估计两个类别的参数和后验概率 \(\hat{\pi}_{i1}, \hat{\pi}_{i2}\),然后对每个个体计算加权平均轨迹预测:
为什么有效:在模拟中,\(\hat{y}_i(s)\) 本身与 LME 的 BLUP 差异不大(因为加权平均仍接近整体均值),但加入 \(\hat{c}_i\) 后,生存模型能利用类别标签反映的轨迹形状信息,从而显著提升预测区分度(tdAUC)和校准度(Brier score)。这是本文的核心发现:异质性的价值主要体现在类别标签,而非轨迹点预测的改进。
三、这篇论文做了什么¶
三句话¶
- 研究问题:在 EHR 大规模异质性队列中,如何利用纵向生物标志物进行动态风险预测,同时处理未观测亚组结构且保持计算可扩展性。
- 核心工具:将潜在类别混合模型(LCMM)嵌入 landmarking 框架,用 LCMM 估计后验类别概率和类别特异性轨迹预测,再以加权平均轨迹和/或预测类别标签作为 Cox 生存模型的输入;开发模块化 R 包
landmaRk实现。 - 主要结论:模拟和真实数据(aids 数据集)表明,在存在潜在异质性时,所提方法(尤其是包含预测类别标签的 LCMMGcl 规格)在区分度和校准度上优于传统 landmarking(LOCF、LME),且计算效率远高于联合潜在类别模型(JLCM);但性能依赖于类别数 \(G\) 的选择和是否包含类别标签,且无单一规格在所有场景下最优。
关键设定与假设¶
- Landmarking 设定:landmark 时间 \(s\) 预先指定;每个 landmark 独立拟合纵向和生存模型(也可用单一全局纵向模型作为敏感性分析);生存时间在预测窗口 \([s, s+w)\) 外截尾以缓解“老化协变量”问题。
- LCMM 假设:
- 类别数 \(G\) 预先指定(可通过网格搜索或探索性分析选择)。
- 误差项 \(\epsilon_{ij}\) 正态分布(模拟中考察了 \(t_5\) 重尾误差的稳健性)。
- 随机效应 \(b_{ig}\) 正态分布,类别特异性方差 \(\Sigma_g\)。
- 类别分配由多项 logit 模型决定,协变量 \(x_{1i}\) 可影响分配概率。
- 相比已有文献的放宽/强化:
- 放宽了传统 landmarking 的同质轨迹假设(LME 的正态随机效应)。
- 相比 JLCM,放宽了共同基线要求(landmarking 天然允许不同随访起点),且计算更高效(模块化、可并行)。
- 但强化了 LCMM 的分布假设(正态误差、正态随机效应),而 JLCM 也可用其他分布。
主要结果¶
- 模拟研究(8 个场景,\(N=1000,2000\),\(G=3\) 真实类别):
- 所有 landmarking 方法均优于无纵向信息的静态模型。
- LCMM 不含类别标签(LCMMG)与 LME 性能相当,有时更差——说明仅靠加权平均轨迹无法充分捕捉异质性。
- LCMM 含类别标签(LCMMGcl)在大多数场景下是 top performer,区分度(tdAUC 增量)和校准度(Brier score 负增量)均优于 LME 和 JLCM。
- JLCM 的校准度显著差于 landmarking(Brier score 高出数倍),且计算时间更长(Supplementary Table S18:JLCM4 中位数 6.5 小时 vs LCMM4cl 中位数 3.8 小时)。
- 过指定类别数(如真实 \(G=3\) 但用 \(G=4\))在 landmark 特异性纵向模型中影响较小,但在单一全局纵向模型中灾难性(校准度崩溃)。
- 真实数据案例(aids 数据集,\(N=467\),CD4 轨迹预测死亡):
- 无单一模型在所有 landmark 和预测窗口下最优。LCMM2cl 在早期 landmark(\(s=7,8,9\))tdAUC 最高,但后期(\(s=12\))LME 反超。
- 所有 landmarking 方法校准度(Brier score)差异不大,但 JLCM 校准度极差(Brier score 约 0.2-0.3 vs landmarking 约 0.08-0.16)。
- 包含类别标签的 LCMM2cl 在部分场景优于不含标签的 LCMM2,但优势不如模拟中显著。
证明路线与技术技巧(本文为应用型,无理论证明,但可拆解方法设计)¶
- 整体路线(方法设计逻辑):
- 在每个 landmark \(s\),用风险集 \(R_s\) 的纵向数据拟合 LCMM,估计参数和后验概率。
- 对每个个体,计算加权平均轨迹预测 \(\hat{y}_i(s) = \sum_g \hat{\pi}_{ig} \hat{y}_i(s|x_i, c_i=g)\),并可选硬分配 \(\hat{c}_i\)。
- 用 \(\hat{y}_i(s)\) 和/或 \(\hat{c}_i\) 作为协变量,拟合 landmark 特异性 Cox PH 模型。
- 用 IPCW 调整的 tdAUC 和 Brier score 评估预测性能(5 折交叉验证,相同折)。
- 关键跳跃点:为何加权平均轨迹不提升性能,而加入类别标签提升?作者解释为:\(\hat{y}_i(s)\) 是条件期望的加权平均,与 LME 的 BLUP 数值相近;但类别标签编码了轨迹形状(上升/下降/波动),提供了超越当前值的预后信息。这一解释是经验性的,无理论证明。
- 技术技巧:
- LCMM 的 EM 算法(Proust-Lima et al., 2017 实现)。
- IPCW 调整的 tdAUC 和 Brier score(Blanche et al., 2019; Graf et al., 1999),用
riskRegression包计算。 - 交叉验证中分层抽样(按事件指示)确保折间事件数平衡。
- 模块化 R 包设计:
landmaRk将 landmarking 拆分为“初始化→风险集→纵向模型→生存模型→评估”五个步骤,用户可自定义任意组件。
真实例子与应用¶
- 数据:
aids数据集(JMbayes2 包),467 名 HIV 患者,随机接受 ddI 或 ddC 治疗,基线及四次随访测量 CD4 计数(平方根变换),主要终点为死亡(188 事件,279 删失)。 - 方法应用:landmark 时间 \(s=7,8,9,10,11,12\) 个月,预测窗口 \(w=3,6\) 个月。纵向模型用 LME 和 LCMM(\(G=2,3,4\)),生存模型用 Cox PH,包含药物指示、预测 CD4 值和/或预测类别标签。JLCM 作为对比。
- 结果:LCMM2cl 在 \(s=8, w=3\) 时 tdAUC 最高(0.678),但 LME 在 \(s=12\) 时反超。所有 landmarking 方法 Brier score 相近(0.08-0.16),JLCM 的 Brier score 高达 0.17-0.32。作者强调“no single model is uniformly best”。
- 例子想说明:验证方法在真实数据中的可行性,并展示性能依赖于 landmark 时间、预测窗口和模型选择,提示实践者需根据具体场景选择。
🔎 结论是否比证明窄¶
- 是。本文所有结论基于模拟和单一真实数据案例,无理论保证(如一致性、渐近分布、效率界)。例如,结论“LCMMGcl 优于 LME”仅在模拟场景(数据由 JLCM 生成,\(G=3\),线性轨迹误设)下成立,真实数据中优势不统一。作者在结论中承认“limitation: number of clusters must be specified in advance”、“ignores uncertainty in cluster labels”。此外,模拟中纵向模型是误设的(真实非线性,模型用线性),但作者未讨论误设程度对结论的影响。
四、开放问题(扎根具体语句)¶
-
类别数 \(G\) 的选择:作者指出“the number of clusters \(G\) has to be specified in advance, or chosen via a grid-search”(结论第 2 段)。如何为 landmark 特异性模型选择 \(G\)?是否可开发数据驱动的选择准则(如基于交叉验证的预测性能、或信息准则的整合)?扎根于结论第 2 段。
-
预测不确定性的传播:landmarking 两步法忽略纵向模型和类别分配的不确定性。作者提到“uncertainty in cluster allocations is taken into account when averaging cluster-specific predictions… however, such uncertainty is ignored when including predicted cluster labels in the survival model”(结论第 3 段)。能否将后验概率 \(\hat{\pi}_{ig}\) 直接作为权重或协变量纳入生存模型,而非硬分配?这需要开发新的推断方法。
-
误差分布稳健性:LCMM 假设误差正态,但模拟中 \(t_5\) 误差下性能仍可接受,作者未给出理论条件。能否放松为半参数或非参数误差分布?作者在结论中提及“generalised additive models and latent Gaussian processes may offer a viable option”(结论第 4 段),但未展开。
-
计算收敛问题:早期 landmark(数据稀疏)或风险集过小时,LCMM 优化器可能不收敛(模拟中 LCMM4 在 \(N=1000\) 时失败)。如何保证小样本下的稳定性?是否可引入正则化或贝叶斯先验?扎根于模拟结果(Supplementary Figures 中多处标注“optimiser failed to converge”)。
提醒:要确认这些是否为真 gap,建议阅读近期 5 篇关于动态预测中异质性建模的论文(如 Ferrer et al. 2019 的后续、或 EHR 预测的综述),看它们是否指向相同问题。
Maintained by 陈星宇 · Homepage · Source on GitHub