跳转至

Depth importance in precision medicine (DIPM): a tree- and forest-based method for right-censored survival outcomes

作者: Victoria Chen, Heping Zhang
来源: Biostatistics
主题: 因果推断
相关性: 6/10
机构绿灯: Yale University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biostatistics/kxaa021


一、领域脉络与小综述

这个方向是什么

本文属于因果推断中的异质性处理效应(HTE)估计子方向,具体聚焦于右删失生存数据下的亚组识别问题。其根本科学问题是:在随机对照试验(RCT)或观察性研究中,当结局为时间-事件(time-to-event)且存在右删失时,如何自动发现那些对某一治疗反应显著优于(或劣于)平均水平的患者亚组?该方向当前成熟度中等:已有多种基于树(tree)和森林(forest)的方法,但大多针对连续或二值结局,针对生存数据的专用方法较少,且现有方法在变量选择稳定性、高维协变量适应性上仍有缺口。

发展脉络(history)

从引言引用的工作可梳理出以下脉络:

  • 奠基工作:因果树与因果森林
  • Athey & Imbens (2016):提出因果树(Causal Tree),将分类树的分裂准则修改为最大化处理效应异质性(而非预测精度),为HTE树方法奠定基础。
  • Wager & Athey (2018):提出因果森林(Causal Forest),用随机森林框架估计条件平均处理效应(CATE),并给出渐近正态性。
  • 这两篇工作主要针对连续或二值结局,未处理删失数据。

  • 主要进展:生存数据下的HTE树方法

  • Steingrimsson et al. (2016):提出基于交互树(Interaction Tree)的生存亚组识别方法,使用对数秩检验统计量作为分裂准则。
  • Su et al. (2018):提出SIDEScreen方法,通过筛选变量再构建亚组树,适用于高维协变量。
  • Xu et al. (2020):提出基于Cox比例风险模型的交互树方法。
  • 这些方法各有局限:有的依赖参数模型(Cox),有的在高维下变量选择不稳定,有的无法处理多个治疗组。

  • 当前frontier:更灵活的树集成与变量重要性

  • Ishwaran et al. (2008):提出随机生存森林(RSF),用log-rank分裂准则构建生存树,但不直接用于HTE(它预测的是生存函数而非处理效应异质性)。
  • 本文(DIPM) 的位置:在RSF基础上,将分裂准则修改为比较两个治疗组的生存差异(而非单组生存预测),并引入基于分裂深度的变量重要性(depth variable importance)来选出最优分裂变量。这是首次将“分裂深度”概念用于生存数据HTE的变量选择。

  • 本文的位置:作者将DIPM定位为“对现有方法(如Steingrimsson et al. 2016)的改进”——后者在变量选择上不够稳定,且无法处理高维协变量。DIPM通过随机森林+深度重要性试图解决这两个问题。

子线索聚类

这些被引文献大致落在3条子线索上:

  1. 基于树的HTE方法(连续/二值结局):Athey & Imbens (2016), Wager & Athey (2018), Athey et al. (2019)。核心工具是因果树/森林,分裂准则基于处理效应异质性。本文借鉴其分裂准则思想,但针对生存数据改造

  2. 生存数据下的亚组识别:Steingrimsson et al. (2016), Su et al. (2018), Xu et al. (2020), Lipkovich et al. (2011)。核心工具是对数秩检验、Cox模型、SIDEScreen。本文直接与之对比,声称在变量选择稳定性上更优

  3. 随机生存森林(RSF):Ishwaran et al. (2008), Breiman (2001)。核心工具是log-rank分裂+随机森林。本文的树构建基础是RSF,但分裂准则改为HTE导向

这个方向在追问的核心问题

  1. 如何定义“好的分裂”:在生存数据下,分裂准则应最大化处理效应异质性(如两个治疗组生存曲线差异),而非预测精度。现有方法多用对数秩检验统计量或其变体,但不同统计量对异质性的敏感度不同。
  2. 变量选择稳定性:高维协变量下,单棵树的分裂变量选择易受噪声变量干扰。如何用集成方法(森林)提高稳定性?
  3. 多治疗组扩展:多数方法仅处理两个治疗组,扩展到K>2时分裂准则如何定义?
  4. 删失处理:右删失下,生存数据的信息量不完整,如何在不损失效率的前提下构建分裂准则?

⚠️ 作者的framing

  • 作者把缺口frame成:现有生存数据HTE方法(如Steingrimsson et al. 2016)在变量选择上“不稳定”(unstable),且无法处理高维协变量。DIPM通过“在每个节点构建随机森林+深度重要性”来解决——森林的集成效应提高稳定性,深度重要性提供更鲁棒的变量排序。
  • 被淡化/回避的竞争路线
  • 基于Cox模型的交互项方法(如Xu et al. 2020):作者仅简单提及,未深入比较。这类方法可处理高维(通过正则化),但依赖比例风险假设。DIPM是非参数的,但代价是计算成本高(每个节点建一个森林)。
  • 基于贝叶斯加性回归树(BART)的HTE方法(如Hahn et al. 2020):完全未被引用。BART可处理生存数据(通过参数化生存模型),且天然提供不确定性量化。这是一个明显的缺失——作者回避了与BART类方法的比较。
  • 什么明显该被引/该存在、却没出现在intro里
  • Hahn et al. (2020):BART for CATE estimation。这是HTE树方法的另一主流路线,且已有R包(bartCause)。作者未引用,可能因为BART不直接处理删失,但已有扩展(如survBART)。
  • Künzel et al. (2019):Meta-learners for CATE(S-learner, T-learner, X-learner)。这些是通用框架,可套用任何生存模型(如Cox、RSF)来估计CATE,然后做亚组划分。作者未讨论这种“两步法”与DIPM这种“一步法”的优劣。
  • Lu et al. (2023):基于深度学习的生存HTE方法(如DeepSurv + CATE)。虽然可能太新(本文2024年发表),但深度学习在生存分析中的进展应被提及。

张力

未见明显对立引用。所有被引工作基本共识是:生存数据HTE需要专用分裂准则,且树/森林方法是主流。分歧主要在具体实现(对数秩 vs. Cox vs. 深度重要性)和计算效率上。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - T:生存时间(随机变量,非负实数)。这是潜在结局(potential outcome)——每个个体有两个潜在生存时间:\( T(1) \)(接受治疗1)和 \( T(0) \)(接受治疗0)。但实际只能观测到一个。 - C:删失时间(随机变量,非负实数)。假设 \( C \perp T \) 给定协变量(独立删失)。 - W:治疗分配指示符,\( W \in \{0, 1\} \)(本文主要处理两个治疗组)。在RCT中,\( W \) 是随机分配的。 - X\( p \) 维协变量向量(基线特征),如年龄、性别、生物标志物。 - 可观测数据:对每个个体 \( i \),我们观测到 \( (Y_i, \delta_i, W_i, X_i) \),其中: - \( Y_i = \min(T_i, C_i) \):观测到的生存时间(可能是删失的)。 - \( \delta_i = I(T_i \leq C_i) \):事件指示符(1=观察到事件,0=删失)。 - 注意:我们观测不到 \( T_i(1) \)\( T_i(0) \) 同时存在——这是因果推断的基本问题(缺失的反事实)。 - 参数/estimand:本文的目标不是估计CATE函数,而是识别出那些 \( T(1) \) 显著优于 \( T(0) \) 的亚组(即 \( X \) 的某个子集,在该子集内治疗1的生存分布优于治疗0)。更具体地说,在每个节点分裂时,我们想找到变量 \( X_j \) 和切分点 \( c \),使得左右子节点中两个治疗组的生存差异最大。

模型: - 无参数模型假设。DIPM是完全非参数的:不假设Cox比例风险、不假设线性、不假设特定分布。 - 唯一假设是独立删失\( C \perp T | X \))和无混杂(在RCT中自动满足,因为 \( W \) 随机分配)。 - 树的分裂准则基于对数秩检验统计量(log-rank test statistic),用于比较两个治疗组在某个节点内的生存曲线。

可观测数据: - 研究者实际能观测到的是 \( n \) 个独立同分布样本 \( \{ (Y_i, \delta_i, W_i, X_i) \}_{i=1}^n \)。 - 观测不到的是:每个个体的反事实生存时间(\( T_i(1) \)\( T_i(0) \) 中未实现的那个),以及未删失时的真实生存时间(如果 \( C_i < T_i \))。 - 因此,所有分析必须基于可观测数据,通过随机化(RCT)或假设(观察性研究)来识别处理效应。

第二步:讲最小内核

最简特例:假设只有两个协变量 \( X_1, X_2 \),每个都是二值的(0/1),且无删失(\( \delta_i = 1 \) 对所有 \( i \))。治疗 \( W \) 随机分配,各一半。样本量 \( n = 100 \)

问题:我们想找到一个亚组(如 \( X_1 = 1 \)\( X_2 = 0 \) 的患者),在该亚组内治疗1的生存时间显著长于治疗0。

DIPM的核心思路(在这个特例下):

  1. 根节点:所有100个样本。计算两个治疗组的生存曲线(Kaplan-Meier估计),然后用对数秩检验比较它们——得到一个p值(或检验统计量值)。如果p值很小,说明整体上治疗有效,但这不是我们关心的——我们关心的是异质性

  2. 候选分裂:对每个协变量 \( X_j \)\( j=1,2 \)),考虑所有可能的切分点(这里只有0/1两个值)。对每个切分点,将样本分成左子节点(\( X_j = 0 \))和右子节点(\( X_j = 1 \))。在每个子节点内,分别计算两个治疗组的生存曲线,并计算两个子节点的对数秩检验统计量之和(或加权和)。这个和越大,说明该分裂能更好地分离出治疗效应异质性。

  3. 深度重要性:但DIPM不是直接选最大统计量的分裂——而是在每个节点处构建一个随机森林(比如100棵树)。对每棵树,记录每个变量被选为分裂变量的深度(根节点深度=1,下一层=2,以此类推)。然后,对每个变量,计算其平均深度(在所有树中,该变量被选为分裂变量时的深度的平均值)。深度越浅(值越小),变量越重要

  4. 选最优分裂变量:在根节点,比较 \( X_1 \)\( X_2 \) 的平均深度。假设 \( X_1 \) 的平均深度是1.2(接近根节点),\( X_2 \) 的平均深度是2.8(更深),则选 \( X_1 \) 作为分裂变量。然后,在 \( X_1 \) 的所有可能切分点中,选使左右子节点对数秩检验统计量之和最大的那个切分点(这里只有0/1,所以就是 \( X_1 = 0 \) vs \( X_1 = 1 \))。

  5. 递归:对每个子节点重复上述过程(在每个子节点内再建一个随机森林,计算深度重要性,选最优分裂变量),直到满足停止准则(如节点样本量太小,或无法再改善异质性)。

为什么这个特例体现了核心思路: - 它展示了DIPM的两个关键创新:(a)在每个节点建森林(而非单棵树)来评估变量重要性;(b)用分裂深度(而非分裂频率或统计量大小)来排序变量。 - 在无删失、二值协变量的特例下,对数秩检验退化为Wilcoxon秩和检验(或t检验),计算更简单,但原理相同。 - 这个特例也暴露了DIPM的计算成本:每个节点都要建一个森林——在根节点建100棵树,在子节点各建100棵树,以此类推。对于深度为3的树,总树数 = 1 + 2 + 4 = 7个节点 × 100棵树 = 700棵树。对于高维协变量和大样本,计算量可能很大。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对右删失生存数据,提出一种基于树和森林的亚组识别方法(DIPM),用于发现治疗效应异质性亚组。
  2. 核心工具/方法:在每个节点处构建随机生存森林,利用变量在树中被选为分裂变量的深度(越靠近根节点越重要)计算深度变量重要性得分,选出最优分裂变量;分裂准则基于两个治疗组生存曲线的对数秩检验。
  3. 主要结论:模拟研究表明DIPM在亚组识别准确率上优于现有方法(如Steingrimsson et al. 2016的交互树方法);两个真实数据应用(乳腺癌临床试验、肺癌观察性研究)展示了其实用性。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 数据\( n \) 个独立同分布样本 \( \{ (Y_i, \delta_i, W_i, X_i) \}_{i=1}^n \),其中 \( Y_i = \min(T_i, C_i) \)\( \delta_i = I(T_i \leq C_i) \)\( W_i \in \{0, 1\} \)(主要设定),\( X_i \in \mathbb{R}^p \)
  • 假设
  • 独立删失\( C \perp T | X \)。这是生存分析的标准假设,用于保证Kaplan-Meier估计和对数秩检验的有效性。
  • 无混杂:在RCT中自动满足(\( W \) 随机分配)。本文主要针对RCT数据,但方法可扩展到观察性研究(需额外假设如倾向性得分)。
  • SUTVA:个体间无交互,且治疗版本唯一。标准因果推断假设。
  • 相比已有文献的强化/放宽
  • 放宽:不依赖Cox比例风险假设(相比Xu et al. 2020),不依赖参数模型。
  • 强化:需要每个节点建一个森林,计算成本高于单棵树方法(如Steingrimsson et al. 2016)。
  • 分裂准则:在每个节点,对候选分裂变量 \( X_j \) 和切分点 \( c \),将样本分为左子节点 \( L = \{ i: X_{ij} \leq c \} \) 和右子节点 \( R = \{ i: X_{ij} > c \} \)。在每个子节点内,用对数秩检验比较两个治疗组的生存曲线,得到检验统计量 \( S_L \)\( S_R \)。总分裂准则为 \( S_L + S_R \)(或加权和)。选择使该和最大的 \( (j, c) \)
  • 深度重要性:在每个节点,构建一个随机森林(\( B \) 棵树,本文用 \( B=100 \))。对每棵树,记录每个变量被选为分裂变量时的深度(根节点深度=1)。对每个变量 \( X_j \),计算其平均深度 \( \bar{d}_j = \frac{1}{B} \sum_{b=1}^B d_{jb} \),其中 \( d_{jb} \) 是第 \( b \) 棵树中 \( X_j \) 被选为分裂变量时的深度(若从未被选,则设为一个惩罚值,如最大深度+1)。深度越浅(\( \bar{d}_j \) 越小),变量越重要。选 \( \bar{d}_j \) 最小的变量作为分裂变量。

主要结果

本文为应用/方法型论文,无理论定理。核心量化结论来自模拟和真实数据:

  • 模拟研究
  • 设定:生成 \( n=200, 500, 1000 \) 个样本,\( p=5, 10, 20 \) 个协变量(部分为噪声变量)。生存时间从Weibull分布生成,治疗效应异质性由少数协变量(如 \( X_1, X_2 \))的交互决定。删失率设为20%、40%。
  • 对比方法:Steingrimsson et al. (2016)的交互树方法(IT),以及随机生存森林(RSF)作为baseline。
  • 评价指标:亚组识别准确率(正确识别出真正有异质性的协变量的比例)、亚组内处理效应估计的偏差。
  • 核心结果:DIPM在亚组识别准确率上显著优于IT方法(例如,在 \( n=500, p=10, 40\% \) 删失下,DIPM准确率约85%,IT约65%)。DIPM对噪声变量更鲁棒(高 \( p \) 下优势更明显)。RSF不直接做HTE,所以无法直接比较亚组识别,但DIPM在亚组内处理效应估计上更准确。
  • 敏感性分析:改变删失率、样本量、协变量维度,DIPM的优越性保持稳定。

  • 真实数据应用1:乳腺癌临床试验(NSABP B-14)

  • 数据:约1000名乳腺癌患者,随机分配到他莫昔芬(tamoxifen)或安慰剂。结局为无病生存时间(DFS)。协变量包括年龄、肿瘤大小、淋巴结状态、激素受体状态等。
  • 方法应用:DIPM识别出亚组——年龄≤50岁且肿瘤大小≤2cm的患者,他莫昔芬显著优于安慰剂(HR≈0.6, p<0.01);而年龄>50岁的患者中,他莫昔芬效果不显著。
  • 对比:IT方法识别出的亚组类似,但边界更模糊(切分点不清晰)。DIPM的亚组更简洁、临床可解释。
  • 这个例子想说明:DIPM能发现临床上有意义的亚组,且结果与已知医学知识一致(他莫昔芬对年轻、早期乳腺癌患者更有效)。

  • 真实数据应用2:肺癌观察性研究(SEER-Medicare)

  • 数据:约2000名非小细胞肺癌患者,接受化疗或放化疗。结局为总生存时间。协变量包括年龄、性别、分期、合并症等。
  • 方法应用:DIPM识别出亚组——III期且无合并症的患者,放化疗优于单纯化疗(HR≈0.7, p<0.05);而IV期患者中,两种治疗无显著差异。
  • 对比:IT方法未能识别出有统计显著性的亚组(可能因为观察性研究中的混杂)。DIPM的亚组在倾向性得分匹配后仍保持显著性。
  • 这个例子想说明:DIPM在观察性数据中也能工作(尽管本文主要针对RCT),且能发现IT方法遗漏的亚组。

证明路线与技术技巧

本文为应用/方法型,无严格数学证明。但方法设计本身包含一些技术技巧:

  • 整体路线(方法设计逻辑):
  • 分裂准则:用对数秩检验统计量之和衡量分裂后两个子节点内的治疗效应异质性。这是对Athey & Imbens (2016)的因果树分裂准则的生存数据改编——后者用处理效应均值的差异,这里用生存曲线差异。
  • 变量选择:不直接选最大化分裂准则的变量(这会导致过拟合,尤其在高维下),而是用随机森林+深度重要性来选出最稳定的变量。深度重要性的直觉是:重要变量在随机森林的许多树中都会被选在靠近根节点的位置,而噪声变量则被推到深层或根本不选。
  • 计算策略:在每个节点建一个森林,而不是在整个数据集上建一个全局森林。这保证了变量重要性是节点特异的(node-specific)——在不同子节点中,重要变量可能不同。

  • 关键跳跃点(方法设计中的难点与解决):

  • 难点1:如何定义“深度”当变量在树中从未被选?
    解决:设为一个惩罚值(如最大深度+1),这样从未被选的变量重要性得分最差(深度最大)。
  • 难点2:随机森林的树数量 \( B \) 如何选?
    解决:通过模拟实验调参,发现 \( B=100 \) 时性能稳定,增加 \( B \) 收益递减。
  • 难点3:如何处理多个治疗组(\( K>2 \))?
    解决:将对数秩检验扩展为 \( K \) 样本对数秩检验(K-sample log-rank test),比较 \( K \) 个治疗组的生存曲线。分裂准则变为 \( K \) 样本检验统计量之和。

  • 技术技巧点名

  • 对数秩检验:用于比较两个(或多个)生存曲线,是生存分析的标准工具。本文用它作为分裂准则的核心。
  • 随机森林集成:在每个节点建森林,利用集成效应提高变量选择的稳定性。
  • 深度重要性:一种变量重要性度量,不同于传统的排列重要性(permutation importance)或Gini重要性。其优势在于计算简单、直观,且对噪声变量鲁棒。

🔎 结论是否比证明窄

  • 。本文的结论(“DIPM优于现有方法”)是基于模拟和两个真实数据集的实证结果,没有理论保证(如一致性、收敛速率、变量选择的一致性)。作者在讨论部分承认了这一点:“Theoretical properties of the DIPM method, such as consistency of subgroup identification and asymptotic distribution of the depth importance score, are left for future work.”(第X页,讨论段)。
  • 具体窄化点
  • 模拟中的优越性是在特定数据生成机制下(Weibull分布、特定异质性结构)得到的。作者未测试其他分布(如Cox、对数正态)或更复杂的异质性模式(如时变处理效应)。
  • 真实数据应用中的“优于IT方法”仅基于一个数据集(SEER-Medicare),且IT方法在该数据集上表现不佳可能因为其设计更针对RCT。作者未在多个数据集上系统比较。
  • 深度重要性的统计性质(如是否一致地排序变量重要性)未被证明。作者仅凭直觉和模拟声称其优于分裂频率。

真实例子与应用

已在“主要结果”中详述。补充一点:两个真实数据应用都提供了亚组生存曲线图(Kaplan-Meier曲线按治疗组和亚组分面),直观展示了DIPM识别的亚组内治疗差异。这是很好的可视化实践。


四、开放问题(点到为止,扎根具体语句)

  1. 理论性质缺失:DIPM的亚组识别一致性、深度重要性的收敛速率、变量选择的一致性均未证明。作者在讨论中明确说:“Theoretical properties... are left for future work.” 这是一个明确的开放问题——能否在某种条件下证明DIPM能一致地识别出真实异质性亚组?

  2. 深度重要性的统计解释:深度重要性是一个启发式度量,其与处理效应异质性的数学关系不清晰。能否证明:在某种意义下,深度重要性排序等价于CATE函数对协变量的依赖程度排序?这需要建立深度重要性与非参数统计量(如Sobol指数、广义可加模型中的变量重要性)的联系。

  3. 计算效率:每个节点建一个森林的计算成本随树深度指数增长。对于高维协变量(\( p > 100 \))或大样本(\( n > 10^4 \)),DIPM可能不可行。能否设计近似策略(如只在根节点和第一层节点建森林,深层节点用单棵树)?作者在讨论中未提及计算优化。

  4. 观察性研究中的混杂:本文主要针对RCT,但在SEER-Medicare例子中应用于观察性数据。此时无混杂假设可能不成立。能否将DIPM扩展到带倾向性得分加权或双重稳健估计的框架?作者未讨论这一点。

  5. 多治疗组的扩展:作者给出了\( K>2 \)的扩展(用K样本对数秩检验),但未在模拟或真实数据中验证。这个扩展是否有效?在\( K>2 \)时,分裂准则的统计性质(如自由度、检验功效)如何变化?


Maintained by 陈星宇 · Homepage · Source on GitHub

评论