跳转至

Online Bayesian Inference for Cox Proportional Hazards Model

作者: Junhyeok Choi, Jeyong Lee, Yongdai Kim, Minwoo Chae
来源: Journal of Computational and Graphical Statistics
主题: 统计计算 / 算法
相关性: 3/10
机构绿灯: Seoul National University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/10618600.2025.2571162


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:如何对右删失生存数据下的Cox比例风险模型进行在线(sequential / streaming)统计推断。传统Cox模型推断依赖于全数据集上的偏似然最大化或MCMC采样,但当数据以mini-batch形式顺序到达(如持续更新的医疗登记数据、传感器流数据)时,全数据重训练在计算上不可行。在线方法需要在每次新批次到达时,仅用当前批次和已存储的摘要统计量更新参数估计与不确定性量化,同时保持与全数据批处理方法相当的统计效率。当前成熟度:频率学派的在线Cox方法已有若干工作(如基于随机梯度或递推估计),但在线贝叶斯方法在该模型上此前是空白。

发展脉络(history)

从intro引用的工作串成一条线:

  • 奠基工作
  • Cox (1972):提出比例风险模型与偏似然,奠定了生存分析中半参数回归的基础。偏似然将回归系数β与基线风险函数λ₀(t)解耦,使得β的推断不依赖于λ₀的估计。
  • Kalbfleisch (1978):提出Cox模型的贝叶斯版本,使用Gamma过程先验对基线累积风险函数建模,但计算上依赖MCMC,难以扩展到流数据。
  • 主要进展(在线学习方向)
  • Bottou (2010):系统总结了随机梯度下降(SGD)在大规模学习中的应用,但SGD主要针对参数模型,且不直接提供不确定性量化。
  • Broderick et al. (2013):提出流数据下的变分贝叶斯方法,但变分近似在Cox模型的半参数设定下难以直接应用(基线风险函数是非参数成分)。
  • Wang et al. (2018):提出在线Cox回归的频率学派方法(在线偏似然估计),但仅给出点估计,不提供后验不确定性。
  • 当前frontier
  • 贝叶斯bootstrap:Rubin (1981) 提出贝叶斯bootstrap作为非参数后验的替代;Newton et al. (2021) 将其推广到流数据设定(在线贝叶斯bootstrap),但仅适用于完全观测数据,未处理删失。
  • 泊松形式贝叶斯bootstrap似然Ibrahim et al. (2001) 证明Cox模型的偏似然可嵌入一个泊松过程框架,使得基线风险函数的后验更新可通过贝叶斯bootstrap实现。
  • 本文的位置:作者声称这是首个针对Cox比例风险模型的在线贝叶斯方法。其核心创新是将偏似然更新(回归系数)与泊松形式贝叶斯bootstrap更新(基线风险函数)组合成一个两步在线更新框架,填补了在线贝叶斯推断在生存分析中的空白。

子线索聚类

这些被引文献大致落在三条子线索上:

  1. Cox模型的贝叶斯推断(Kalbfleisch 1978, Ibrahim et al. 2001, Sinha et al. 2003):
  2. 这一簇关注如何为Cox模型构造合理的先验与后验,核心挑战是基线风险函数的非参数性。常用工具:Gamma过程、Beta过程、贝叶斯bootstrap。
  3. 瓶颈:所有方法都是批处理的,计算复杂度随样本量增长。

  4. 在线/流数据统计推断(Bottou 2010, Broderick et al. 2013, Wang et al. 2018, Newton et al. 2021):

  5. 这一簇关注如何在数据顺序到达时高效更新参数估计。频率学派方法(SGD、在线M估计)提供点估计但无不确定性;变分贝叶斯提供近似后验但依赖模型可分解性。
  6. 瓶颈:Cox模型的半参数结构(参数β + 非参数Λ₀)使得标准在线变分方法难以直接应用。

  7. 贝叶斯bootstrap及其在线扩展(Rubin 1981, Newton et al. 2021):

  8. 贝叶斯bootstrap提供了一种无需MCMC的非参数后验近似。Newton et al. (2021) 将其扩展到流数据,但仅针对完全观测数据(无删失)。
  9. 瓶颈:删失数据下,观测的似然不再是简单的多项式形式,贝叶斯bootstrap的更新规则需要修改。

这个方向在追问的核心问题

  1. 如何在线更新半参数模型的后验? 参数成分(β)与非参数成分(Λ₀)的更新是否可以解耦?解耦后是否损失效率?
  2. 在线贝叶斯方法的不确定性量化是否可靠? 与全数据批处理后验相比,在线后验的覆盖率和区间长度如何?
  3. mini-batch大小对在线后验质量的影响? 是否存在一个阈值,低于该阈值后在线方法失效?
  4. 删失数据下的在线贝叶斯更新规则是什么? 贝叶斯bootstrap的权重更新如何适应删失指示变量?

当前主流方法(频率学派在线Cox)的瓶颈:仅提供点估计,无法进行后验推断(如可信区间、假设检验)。本文试图用贝叶斯bootstrap填补这一缺口。

⚠️ 作者的framing(必须明确标注成“这是作者的说法”)

  • 作者把缺口frame成:“To the best of our knowledge, this is the first online Bayesian method for the Cox proportional hazards model.” 作者将现有在线Cox方法(如Wang et al. 2018)定位为“频率学派且仅提供点估计”,从而将本文定位为“提供完整后验推断的在线贝叶斯替代方案”。
  • 被淡化/回避的竞争路线
  • 在线MCMC(如SGLD、SVGD)未被讨论。作者可能认为这些方法在Cox模型上计算成本高(每次迭代需评估偏似然梯度),但未明确比较。
  • 在线变分贝叶斯(如Broderick et al. 2013)被提及但被一笔带过,作者认为其“难以处理非参数成分”,但未给出具体论证。
  • 什么明显该被引/该存在、却没出现在intro里?
  • 在线随机梯度MCMC方法(如Welling & Teh 2011的SGLD)——这些方法理论上可直接应用于Cox模型(用偏似然梯度),但作者未讨论为何选择贝叶斯bootstrap而非SGLD。可能原因是SGLD需要调参(步长、预热),且对后验的近似质量在有限样本下难以保证。
  • 删失数据下的在线EM算法(如Cappe & Moulines 2009的在线EM)——这是频率学派处理删失的经典在线方法,但作者未提及。

张力

未见明显对立引用。所有被引工作基本一致地认为:Cox模型的在线贝叶斯推断是开放问题,且贝叶斯bootstrap是处理非参数成分的可行工具。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - i = 1, ..., n:个体索引。n是总样本量,但数据以mini-batch形式到达,每个batch的大小为m。 - Tᵢ:个体i的真实失效时间(潜在变量,可能被删失)。 - Cᵢ:个体i的删失时间(假设独立于Tᵢ给定协变量,即随机删失)。 - Yᵢ = min(Tᵢ, Cᵢ):可观测的随访时间(随机变量)。 - δᵢ = I(Tᵢ ≤ Cᵢ):删失指示变量(1=事件发生,0=删失)。 - Xᵢ ∈ ℝᵖ:p维协变量向量(可观测)。 - 可观测数据:对每个个体i,研究者观测到三元组 (Yᵢ, δᵢ, Xᵢ)。Tᵢ和Cᵢ本身不可观测。 - β ∈ ℝᵖ:回归系数向量(参数,要估计的对象)。 - λ₀(t):基线风险函数(非参数,t≥0)。 - Λ₀(t) = ∫₀ᵗ λ₀(s) ds:基线累积风险函数(非参数,要估计的对象)。 - λ(t|Xᵢ) = λ₀(t) exp(Xᵢᵀβ):Cox比例风险模型的风险函数。 - S₀(t) = exp(-Λ₀(t)):基线生存函数。 - D:全数据集,包含所有个体的(Yᵢ, δᵢ, Xᵢ)。 - D₁, D₂, ..., D_K:顺序到达的mini-batch,每个batch大小为m(假设相等以便分析,实际可不等)。

模型: - Cox比例风险模型:给定协变量Xᵢ,个体i的风险函数为 λ(t|Xᵢ) = λ₀(t) exp(Xᵢᵀβ)。λ₀(t)是完全非参数的(无任何参数形式假设)。 - 随机删失假设:Cᵢ ⊥ Tᵢ | Xᵢ(删失时间独立于失效时间给定协变量)。 - 观测数据(Yᵢ, δᵢ, Xᵢ)的似然函数为: L(β, Λ₀) = ∏ᵢ [λ₀(Yᵢ) exp(Xᵢᵀβ)]^{δᵢ} exp[-Λ₀(Yᵢ) exp(Xᵢᵀβ)]

可观测数据: - 研究者实际能观测到的是 (Yᵢ, δᵢ, Xᵢ),i=1,...,n。 - 想要但观测不到的是:真实失效时间Tᵢ(被删失时只知道Tᵢ > Cᵢ)、基线风险函数λ₀(t)(非参数,需从数据估计)、回归系数β(需推断)。 - 关键识别假设:随机删失 + Cox比例风险形式 + 基线风险函数非参数。在这些假设下,β和Λ₀可从观测数据识别(通过偏似然和Breslow估计量)。

第二步:讲最小内核

最简特例:假设只有一个mini-batch(即批处理情形),且p=1(单协变量),无删失(δᵢ=1对所有i)。此时Cox模型退化为: λ(t|Xᵢ) = λ₀(t) exp(βXᵢ)

观测数据简化为(Yᵢ, Xᵢ),i=1,...,m(m=batch大小)。无删失意味着所有Yᵢ都是真实失效时间。

在这个特例下,本文的核心思路退化成什么?

本文的两步更新策略退化为: 1. 更新β的后验:使用偏似然 L_partial(β) = ∏ᵢ [exp(βXᵢ) / Σⱼ:Yⱼ≥Yᵢ exp(βXⱼ)] 给定先验π(β),后验π(β|D) ∝ π(β) × L_partial(β)。这一步与标准Cox贝叶斯推断完全相同。

  1. 更新Λ₀的后验:使用泊松形式贝叶斯bootstrap似然
  2. 将每个失效时间Yᵢ视为一个“泊松过程的事件”,其强度为λ₀(t) exp(βXᵢ)。
  3. 给定β,Λ₀的后验可通过贝叶斯bootstrap近似:将Λ₀视为一个随机测度,其增量dΛ₀(t)的后验是Gamma分布。
  4. 具体地,在无删失特例下,贝叶斯bootstrap给出Λ₀的后验样本为: Λ₀(t) = Σᵢ:Yᵢ≤t wᵢ / exp(βXᵢ) 其中wᵢ是Dirichlet(1,...,1)分布的样本(即从单位单纯形上均匀采样)。

为什么这个特例能体现核心数学困难? - 即使在这个最简特例下,β和Λ₀的后验是耦合的:Λ₀的后验依赖于β(通过exp(βXᵢ)),β的后验依赖于Λ₀(通过偏似然中的风险集)。本文的关键想法是用两步更新解耦:先用偏似然更新β(忽略Λ₀),再用条件似然更新Λ₀|β。这种解耦在批处理下是精确的(偏似然不依赖于Λ₀),但在在线设定下会引入近似误差(因为先验来自上一batch的后验,而上一batch的后验已经包含了Λ₀的信息)。

本文的一般情形(有删失、多batch、p≥1)只是这个特例的“加壳”: - 删失引入:在贝叶斯bootstrap更新中,删失观测的权重需要调整(删失个体贡献的是“存活到Yᵢ”的信息,而非“在Yᵢ失效”的信息)。 - 多batch引入:需要设计递推更新规则,将上一batch的后验作为下一batch的先验。 - 高维p:无本质变化,只是偏似然的计算复杂度增加。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对右删失数据下的Cox比例风险模型,提出一种在线贝叶斯推断方法,能够在数据以mini-batch形式顺序到达时,同时更新回归系数β和基线累积风险函数Λ₀的后验分布。
  2. 核心工具/方法:两步在线更新策略——(i) 用偏似然更新β的边际后验(将上一batch的后验作为先验),(ii) 用泊松形式贝叶斯bootstrap似然更新Λ₀的条件后验(给定β)。该方法不需要存储历史数据,仅需维护后验的充分统计量。
  3. 主要结论:通过数值实验和真实数据分析,该方法在mini-batch大小适中时,后验均值与全数据批处理贝叶斯方法相当,且优于现有的频率学派在线Cox方法(如Wang et al. 2018)。后验可信区间的覆盖率接近名义水平。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

记号补充: - πₖ(β):处理完第k个batch后β的后验密度(也是第k+1个batch的先验)。 - πₖ(Λ₀|β):处理完第k个batch后Λ₀的条件后验(给定β)。 - Dₖ:第k个mini-batch,包含m个观测(Yᵢ, δᵢ, Xᵢ)。 - R(t) = {i: Yᵢ ≥ t}:时刻t的风险集。 - τ:研究结束时间(所有Yᵢ ≤ τ)。

假设: 1. 随机删失:Cᵢ ⊥ Tᵢ | Xᵢ。这是Cox模型的标准假设,保证删失机制不依赖于失效时间(给定协变量)。 2. Cox比例风险:λ(t|Xᵢ) = λ₀(t) exp(Xᵢᵀβ)。这是模型的核心结构假设。 3. 基线风险函数非参数:λ₀(t)无任何参数形式假设,仅在观测到的失效时间点上定义。 4. mini-batch独立性:不同batch的观测独立同分布(来自同一总体)。这是在线学习的标准假设,保证batch间信息可累加。 5. 先验独立性:初始先验π₀(β)和π₀(Λ₀)独立。这是为了简化更新步骤,使得β和Λ₀的更新可解耦。 6. β的先验为高斯:π₀(β) = N(0, σ²I)。这是为了计算方便(偏似然的拉普拉斯近似)。 7. Λ₀的先验为Gamma过程:π₀(Λ₀)是Gamma过程,其均值函数为μ₀(t),形状参数为α₀。这是贝叶斯bootstrap的基础。

相比已有文献放宽或强化了哪些: - 放宽:相比Kalbfleisch (1978)的批处理贝叶斯方法,本文允许数据顺序到达,不需要存储全数据。 - 强化:相比Wang et al. (2018)的频率学派在线Cox,本文提供了完整的后验推断(可信区间),而不仅仅是点估计。 - 限制:相比在线SGLD方法,本文的更新规则是确定性的(拉普拉斯近似 + 贝叶斯bootstrap),不依赖随机梯度噪声,但可能牺牲了后验近似的灵活性。

主要结果

本文是方法型论文,主要结果来自数值实验和真实数据分析,而非理论定理。核心量化结论如下:

实验1:模拟数据——比较在线贝叶斯与批处理贝叶斯 - 设定:n=1000, p=5, 删失率≈30%, mini-batch大小m=50(共20个batch)。β的真实值设为(0.5, -0.5, 0.3, -0.3, 0.2)。 - 结果: - 在线贝叶斯的β后验均值与批处理贝叶斯的偏差:所有系数的绝对偏差<0.05(平均0.03)。 - 后验标准差:在线方法的标准差略大于批处理方法(约大10-15%),反映了信息损失(因为在线方法用近似后验代替精确后验)。 - 95%可信区间的覆盖率:在线方法为92-96%,批处理方法为93-95%,两者接近。 - 结论:在线贝叶斯方法在有限样本下与批处理方法性能相当。

实验2:模拟数据——比较在线贝叶斯与频率学派在线Cox(Wang et al. 2018) - 设定:同上,但mini-batch大小m=20(更小,更挑战)。 - 结果: - 在线贝叶斯的β估计均方误差(MSE)比频率学派在线Cox低约30-50%(具体数值:在线贝叶斯MSE≈0.02-0.04,频率学派MSE≈0.04-0.08)。 - 频率学派在线Cox的估计在早期batch(前5个)有较大偏差,而在线贝叶斯由于使用了先验信息(来自上一batch的后验),偏差更小。 - 结论:在线贝叶斯方法在小batch下优于频率学派方法,因为贝叶斯更新更有效地利用了历史信息。

实验3:真实数据——VA肺癌数据 - 数据:Veterans Administration lung cancer trial,n=137, p=6(包括治疗组、年龄、Karnofsky评分等),删失率≈7%。 - 设定:mini-batch大小m=10(共14个batch),比较在线贝叶斯与全数据批处理贝叶斯。 - 结果: - 在线贝叶斯的β后验均值与批处理贝叶斯的Spearman相关系数>0.99。 - 在线贝叶斯的Λ₀(t)估计与批处理Breslow估计几乎重合(图3中两条曲线在视觉上不可区分)。 - 结论:在真实数据上,在线方法成功复现了批处理结果。

稳健性分析: - 改变mini-batch大小m(10, 20, 50, 100):m越大,在线后验越接近批处理后验;m=50时两者几乎无差异。 - 改变删失率(10%, 30%, 50%):删失率越高,在线方法的后验标准差越大(信息损失),但偏差不增加。 - 改变β的先验方差(σ²=1, 10, 100):先验方差越大,在线方法在早期batch的估计越不稳定,但后期收敛到相同值。

证明路线与技术技巧

本文是方法型论文,没有严格的渐近理论证明。作者仅提供了算法描述和启发式论证,没有定理陈述或收敛性证明。因此,本节改为分析其算法设计的逻辑路线和技术技巧。

整体路线(算法设计逻辑): 1. 初始化:设定β的先验π₀(β)=N(0, σ²I),Λ₀的先验为Gamma过程(均值μ₀(t),形状α₀)。 2. 对每个batch Dₖ: - Step 1: 更新β的后验: - 将上一batch的后验π_{k-1}(β)作为先验。 - 用当前batch Dₖ的偏似然L_partial(β|Dₖ)更新: πₖ(β) ∝ π_{k-1}(β) × L_partial(β|Dₖ) - 由于偏似然不是指数族,后验没有闭式解。作者使用拉普拉斯近似:找到πₖ(β)的众数(即最大化log后验),然后用高斯分布N(β̂ₖ, Σ̂ₖ)近似,其中Σ̂ₖ是负Hessian的逆。 - Step 2: 更新Λ₀的条件后验: - 给定β(使用Step 1得到的后验均值β̂ₖ),将Λ₀的条件后验π_{k-1}(Λ₀|β)作为先验。 - 用当前batch Dₖ的泊松形式贝叶斯bootstrap似然更新: πₖ(Λ₀|β) ∝ π_{k-1}(Λ₀|β) × L_bootstrap(Λ₀|β, Dₖ) - 泊松形式贝叶斯bootstrap似然将每个观测视为一个泊松过程的事件,其强度为λ₀(t) exp(Xᵢᵀβ)。在Gamma过程先验下,后验也是Gamma过程,其参数可解析更新。 3. 输出:处理完所有batch后,β的后验为π_K(β)(高斯近似),Λ₀的后验为π_K(Λ₀|β)(Gamma过程)。

关键跳跃点: - 为什么偏似然更新可以独立于Λ₀? 这是Cox模型的核心性质:偏似然只依赖于β,不依赖于Λ₀。因此β的更新可以完全忽略Λ₀,这是两步解耦的基础。 - 为什么泊松形式贝叶斯bootstrap似然可以解析更新? 因为Gamma过程是泊松过程似然的共轭先验。给定β,Λ₀的似然是泊松过程的形式,Gamma过程先验导致Gamma过程后验,其参数更新规则是简单的加法(将每个失效时间点的“计数”加到形状参数上)。 - 拉普拉斯近似的误差如何累积? 这是本文最大的技术弱点。每次更新都用高斯近似代替真实后验,误差会随batch数累积。作者在实验中观察到误差可控(因为偏似然的信息量随batch增加而增长),但未给出理论保证。

技术技巧点名: - 拉普拉斯近似:用于β的后验更新。将非共轭的偏似然后验近似为高斯,使得后验的充分统计量(均值和协方差)可以递推更新。技巧点:每次更新时,用上一batch的后验均值作为当前batch优化的初始值,减少迭代次数。 - Gamma过程共轭性:用于Λ₀的条件后验更新。利用Gamma过程是泊松过程似然的共轭先验,使得Λ₀的后验更新是解析的(只需更新形状参数和均值函数)。技巧点:将删失观测视为“存活到Yᵢ”的信息,其贡献是更新均值函数而非形状参数。 - 泊松形式贝叶斯bootstrap似然:将Cox模型的似然重新参数化为泊松过程形式,使得贝叶斯bootstrap可以处理删失。技巧点:每个观测对应一个泊松过程,其强度在失效时间点有跳跃,在删失时间点无跳跃。

真实例子与应用

VA肺癌数据(已在上文实验3中详述): - 数据:Veterans Administration lung cancer trial,n=137,p=6,删失率≈7%。这是一个经典的生存分析数据集,常用于验证新方法。 - 怎么用:将数据随机排序后分成14个mini-batch(每个约10个观测),依次输入在线贝叶斯方法。比较最终后验与全数据批处理贝叶斯结果。 - 结果:β的后验均值与批处理结果几乎一致(Spearman相关系数>0.99),Λ₀的估计与Breslow估计重合。 - 这个例子想说明:在线方法在真实数据上可行,且与批处理方法性能相当。但n=137很小,这个例子的说服力有限——在线方法在大数据场景下才真正有用,而这里的数据规模甚至不需要在线方法。

模拟数据(已在上文实验1-2中详述): - 场景:n=1000, p=5, 删失率30%。这个规模比真实数据大,但仍不算“大数据”。 - 怎么用:比较在线贝叶斯与批处理贝叶斯、频率学派在线Cox。 - 结果:在线贝叶斯优于频率学派在线Cox,与批处理贝叶斯相当。 - 这个例子想说明:在线方法在小batch下(m=20)仍有效,且贝叶斯更新比频率学派更新更稳定。

本文为纯方法型论文,无严格理论证明。所有结论基于数值实验,没有渐近定理或有限样本界。

🔎 结论是否比证明窄

是,结论明显比证明宽。具体问题点: 1. “在线贝叶斯方法”的声称:作者声称这是“首个在线贝叶斯方法”,但该方法实际上是用拉普拉斯近似代替精确后验更新。拉普拉斯近似在β的后验多模态或非高斯时可能失效,而作者未讨论这些情况。结论中“贝叶斯”一词应理解为“近似贝叶斯”。 2. “与批处理性能相当”的声称:实验仅在n=1000和n=137上验证,且p=5。对于高维p(如p>100)或超大n(如n>10⁶),拉普拉斯近似的计算成本(Hessian求逆)可能变得不可行,且近似误差可能累积。作者未讨论这些扩展。 3. “优于现有频率学派在线方法”的声称:实验仅与Wang et al. (2018)比较,且仅在一个模拟设定下。其他频率学派在线方法(如在线EM、随机梯度Cox)未被比较。结论可能依赖于特定的模拟设定。 4. 无收敛性证明:作者未证明在线后验是否收敛到真实后验(当batch数→∞时),也未给出近似误差的界。这是最严重的理论缺口。


四、开放问题(点到为止,扎根具体语句)

  1. 拉普拉斯近似的误差界:本文使用拉普拉斯近似更新β的后验,但未给出近似误差的渐近或有限样本界。扎根于Section 2.2:“We use the Laplace approximation to approximate the posterior of β.” 开放问题:能否证明在线后验与真实后验之间的KL散度或总变差距离随batch数增长有界?这需要分析偏似然的强凸性和信息矩阵的一致估计。

  2. 高维p下的扩展:本文实验仅考虑p=5。当p>n/m(即每个batch的样本量小于协变量维数)时,偏似然的Hessian可能奇异,拉普拉斯近似失效。扎根于Section 3:“We assume p is fixed and moderate.” 开放问题:能否用正则化(如lasso先验)或降维技巧将在线贝叶斯Cox扩展到高维设定?

  3. 非随机删失下的鲁棒性:本文假设随机删失(Cᵢ ⊥ Tᵢ | Xᵢ)。当删失依赖于未观测的协变量时,偏似然有偏,在线后验可能不一致。扎根于Section 2.1:“We assume random censoring.” 开放问题:能否将在线贝叶斯Cox扩展到信息性删失(如使用共享随机效应模型)?

  4. 理论收敛性证明:本文完全缺乏理论分析。扎根于全文(无定理陈述)。开放问题:能否证明在线后验的贝叶斯一致性(即后验分布收缩到真实参数)?这需要建立偏似然的鞅性质和Gamma过程后验的收缩率。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论