Bayesian hierarchical bootstrap framework for causal subgroup estimation with a time-to-event outcome¶
作者: Mengyao Shi, Amanda Ricciuto, Mark Deneau, Kuan Liu
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2608.00789
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:在时间-事件结局(time-to-event outcome)下,如何对预设的亚组(prespecified subgroups,如年龄组、疾病风险分层)进行因果效应估计。核心挑战在于:亚组样本量可能很小(稀疏性),右删失(right censoring)进一步减少了有效信息,而亚组间的协变量分布可能存在异质性。当前方法的成熟度处于“方法正在从连续/二元结局向生存结局扩展,但分布层面的正则化尚未被充分探索”的阶段。
发展脉络(history)¶
-
奠基工作:g-formula 与因果推断的形式化框架
- Robins (1986, 1987):提出了 g-formula,将反事实生存概率表达为对亚组特异性基线协变量分布的期望。这为亚组因果推断提供了形式化基础,但也明确指出了估计需要两个组件:条件生存函数和协变量分布。本文引用语境:“The g-formula [2, 3, 4] provides a formal framework for identifying subgroup causal estimands in time-to-event settings...”
- Hill (2011):将 BART 引入因果推断,用于估计边际处理效应,开启了贝叶斯非参数方法在因果推断中的应用。本文引用语境:“Specifically, Bayesian additive regression trees (BART) were used in early work to estimate marginal treatment effects [5]...”
- Zeldow et al. (2019), Hahn et al. (2020):将 BART 扩展至异质性处理效应(HTE)估计,包括个体和条件平均处理效应。本文引用语境:“...and were subsequently extended to estimate individual and conditional average treatment effects [6, 7].”
-
主要进展:贝叶斯非参数因果推断的扩展
- 贝叶斯非参数模型(BNP)的广泛应用:一系列工作将 Dirichlet 过程混合模型(DPM)等 BNP 方法应用于复杂数据结构的因果推断,包括零膨胀结局 [10]、缺失数据 [11]、中介分析 [12]、竞争风险下的生存结局 [13]、分位数效应 [14]。这些工作展示了 BNP 在灵活建模和不确定性传播上的潜力,但主要正则化对象是条件结局分布,而非亚组协变量分布。
- 生存结局的贝叶斯因果方法:Henderson et al. (2020) 提出了基于 BART 的非参数 AFT 模型,用于估计个体化处理效应。Hu et al. (2021) 系统比较了多种生存机器学习方法,发现 AFT-BART-NP 在偏差、精度和期望遗憾方面表现最佳。这些工作表明灵活贝叶斯生存模型可以处理复杂的协变量效应和交互,但其 g-computation 步骤通常依赖于固定的经验亚组协变量分布。本文引用语境:“Flexible Bayesian survival models, including accelerated failure time (AFT) formulations based on causal BART, have been developed to estimate heterogeneous treatment effects on survival outcomes... [15, 16, 17].”
- 信息借力(Borrowing of Strength)方法:Oganisian et al. (2024) 提出了层次贝叶斯自助法(HBB),将亚组协变量分布视为可借力的推断量,而非固定的经验分布。这是本文的直接前身,但HBB 此前仅针对非生存结局。本文引用语境:“Specifically, the hierarchical Bayesian bootstrap (HBB) treats subgroup covariate distributions as inferential quantities that can share information across subgroups... [18].”
- 分布差异与稳健动态借力:Zheng & Wason (2022) 和 Jiang et al. (2023) 提出了基于分布差异(distributional discrepancy)和弹性先验(elastic priors)的动态借力方法,用于在篮子试验或历史数据中,根据源与目标之间的相似性来调整借力强度。本文将其列为未来扩展方向。本文引用语境:“Distributional-discrepancy and robust dynamic-borrowing methods provide possible extensions for favoring commensurate sources and discounting conflicting information [25, 26].”
-
当前 Frontier 与本文位置
- 当前 Frontier:将灵活的贝叶斯生存模型(如 AFT-BART)与分布层面的正则化(如 HBB)结合起来,同时处理条件结局模型和亚组协变量分布的不确定性,并传播至最终的因果估计量。
- 本文位置:本文是第一个将 HBB 框架扩展到时间-事件结局的工作。它填补了“HBB 用于生存结局”和“现有生存因果方法忽略协变量分布不确定性”之间的空白。本文的贡献是提出一个统一框架,该框架结合了贝叶斯 AFT 模型(处理删失和条件结局)和 HBB(正则化亚组协变量分布),并通过后验 g-formula 传播两者的不确定性。
子线索聚类¶
- 贝叶斯非参数因果推断(BNP for Causal Inference):以 Dirichlet 过程及其扩展为核心,对观测数据联合分布进行灵活建模,进而识别和估计各种因果量。代表工作:[10, 11, 12, 13, 14]。这一簇的共同特点是:模型灵活,但通常不专门针对亚组稀疏性进行分布层面的正则化。
- 生存结局的异质性处理效应估计(HTE with Survival Outcomes):将 BART、贝叶斯因果森林等灵活模型扩展到生存结局,处理删失、非线性、交互等复杂情况。代表工作:[15, 16, 17]。这一簇的共同特点是:侧重于条件结局模型的灵活性,但 g-computation 步骤通常使用固定的经验分布。
- 信息借力方法(Borrowing of Strength):通过层次模型或先验,在相关亚组或数据源之间共享信息,以稳定稀疏亚组的估计。代表工作:[18, 25, 26]。这一簇的共同特点是:直接针对分布层面的不确定性,但此前主要应用于非生存结局或临床试验中的参数模型。
这个方向在追问的核心问题¶
- 如何稳定估计稀疏亚组的因果效应? 当亚组样本量很小或协变量支持有限时,经验分布不稳定,如何通过借力来降低方差,同时控制偏差?
- 如何正确传播来自多个组件的不确定性? 在 g-formula 框架下,不确定性来自条件结局模型和协变量分布。如何将两者都纳入后验推断,而不是只传播其中一个?
- 如何避免对协变量分布施加过强的参数假设? 非参数或半参数方法(如 HBB)可以在不假设特定分布形式的情况下实现借力,但其效率和偏差特性如何?
- 借力机制如何适应亚组间的异质性? 当亚组协变量分布差异很大时,简单的全局借力(如 HBB 的共享基分布)可能引入偏差。如何设计更自适应的借力结构(如基于分布差异的加权)?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将现有方法的缺口定位为“现有贝叶斯生存因果方法主要正则化条件结局模型,而忽略了亚组协变量分布的不确定性”。他们声称,HBB 通过将亚组协变量分布视为可借力的推断量,直接解决了 g-formula 中的分布组件问题,从而在稀疏亚组中提供更稳定的估计。这使得本文成为“显然的下一步”:既然 HBB 在非生存结局中有效,将其扩展到生存结局是自然的。
- 哪些竞争路线被他淡化或回避了:
- 双重稳健(Doubly Robust)方法:作者在讨论部分提到“Doubly robust estimators of treatment-specific survival distributions provide a foundation for such an extension [27, 28]”,但并未将其作为主要比较对象。在模拟中,他们只比较了 EMP、BB、HBB 和 AFT-BART-NP,没有比较任何双重稳健估计量。这淡化了“通过结合倾向得分和结局模型来获得稳健性”这一竞争路线。
- 基于倾向得分加权的亚组方法:作者在引言开头引用了 Yang et al. (2023) 的倾向得分加权方法,但并未在模拟或应用中与之比较。这回避了“通过加权实现亚组协变量平衡”这一直接竞争路线。
- 更灵活的借力机制:作者承认当前 HBB 的借力结构(共享基分布 F0)不区分源亚组与目标亚组的相似性,并将其列为未来工作。这回避了“当前方法在亚组分布差异大时可能表现不佳”这一核心局限。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 更系统的贝叶斯层次模型用于生存数据借力:例如,在临床试验中用于篮子试验或平台试验的贝叶斯层次模型(如 Berry et al. 的工作),这些工作也处理生存结局和借力,但通常假设参数模型。作者没有引用这类工作,可能因为其参数假设与本文的非参数目标不同,但作为借力方法的先驱,值得提及。
- 关于后验 g-formula 识别条件的更深入讨论:作者引用了 Chen et al. (2024) 的灵活贝叶斯 g-formula,但该工作主要关注时依混杂。对于本文的设定(点处理、基线协变量),后验 g-formula 的识别条件与标准 g-formula 一致,但作者没有引用更早的、专门讨论后验 g-formula 识别性的文献(如 Robins 的早期工作或关于贝叶斯因果推断的综述)。
张力¶
未见明显对立引用。所有被引工作基本沿着“从参数到非参数”、“从条件模型到分布模型”、“从连续结局到生存结局”的路径发展,彼此之间是互补而非矛盾的关系。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
i = 1, ..., n:个体索引。A_i ∈ {0, 1}:可观测的二元处理变量(如是否使用熊去氧胆酸)。X_i:可观测的基线协变量向量(如年龄、GGT、IBD 状态)。G_i ∈ {1, ..., K}:可观测的亚组成员身份(如年龄组 0-10, 11-15, 15+)。T_i^*:潜在事件时间(如 GGT 正常化时间)。T_i^*(a)是处理为a时的潜在事件时间。C_i:潜在删失时间。Y_i = min(T_i^*, C_i):可观测的随访时间。Δ_i = I(T_i^* ≤ C_i):可观测的事件指示符(1=事件发生,0=删失)。S_g^a(t) = Pr{T_i^*(a) > t | G_i = g}:目标 estimand,亚组g在处理a下的潜在生存概率。F_g(x) = Pr(X_i ≤ x | G_i = g):目标但不可直接观测的亚组g的基线协变量分布。这是需要估计的。S_{T^*}(t | A=a, X=x, G=g):可识别的条件生存函数,由观测数据估计。θ:AFT 模型的参数。ε_i:AFT 模型的误差项。α_g:HBB 的浓度参数,控制亚组g从共享分布借力的强度。F_0:HBB 的共享基分布。π_i:共享基分布中观测值i的权重。ω_{gi}:亚组g的 HBB 分布中观测值i的权重。
-
模型:
- 因果模型:基于潜在结果框架,假设一致性、条件可交换性、正性、条件独立删失(Assumptions 1-4)。目标 estimand 通过 g-formula 识别:
S_g^a(t) = ∫ S_{T^*}(t | A=a, X=x, G=g) dF_g(x) - 数据生成机制:未显式指定,但模拟中使用了 Weibull AFT 模型生成事件时间,逻辑模型生成处理分配。
- 估计模型:
- 条件结局模型:贝叶斯 AFT 模型,
log T_i^* = m_θ(A_i, X_i, G_i) + ε_i。m_θ是参数化的(如线性),ε_i的分布(如 Weibull)是参数化的。 - 协变量分布模型:HBB 模型。
F_g | α_g, F_0 ~ DP(α_g F_0),F_0 | γ, F^* ~ DP(γ F^*)。在γ=0的贝叶斯自助法设定下,F_0由观测到的所有X_i支持,F_g是F_0和亚组g内观测值的加权平均。
- 条件结局模型:贝叶斯 AFT 模型,
- 因果模型:基于潜在结果框架,假设一致性、条件可交换性、正性、条件独立删失(Assumptions 1-4)。目标 estimand 通过 g-formula 识别:
-
可观测数据:研究者能观测到的是
(Y_i, Δ_i, A_i, X_i, G_i)的独立同分布样本。观测不到的是T_i^*(若删失)、C_i(若事件发生)、以及反事实T_i^*(1-a)。目标但观测不到的是亚组协变量分布F_g,只能通过假设(如 HBB 的层次结构)和观测数据来推断。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设只有一个亚组(K=1),没有删失(所有事件时间都被观测到),且 AFT 模型是线性的。在这个特例下,论文的一般性设定退化成什么?
-
退化的设定:
G_i是常数,所以没有“亚组”概念。目标 estimand 退化为边际生存概率S^a(t)。- 没有删失,所以
Y_i = T_i^*,Δ_i = 1。AFT 模型退化为标准线性回归模型:log T_i^* = θ_0 + θ_1 A_i + θ_2^T X_i + ε_i。 - g-formula 退化为:
S^a(t) = ∫ S_{T^*}(t | A=a, X=x) dF(x),其中F(x)是整个样本的协变量分布。
-
最小内核问题:如何估计
S^a(t)?传统方法(EMP)是:① 拟合 AFT 模型得到θ的后验;② 对于每个后验θ样本,计算每个个体的条件生存概率S_{T^*}(t | A=a, X_i);③ 取这些概率的经验平均:(1/n) Σ_i S_{T^*}(t | A=a, X_i)。这等价于用经验分布F_n(x) = (1/n) Σ_i δ_{X_i}(x)作为F(x)的估计。 -
本文的关键想法:用 HBB 替代经验分布
F_n(x)。在单亚组、无删失的特例下,HBB 退化为标准的贝叶斯自助法(Bayesian Bootstrap, BB)。BB 不把F(x)固定为F_n(x),而是赋予它一个随机分布:F(x) = Σ_i π_i δ_{X_i}(x),其中(π_1, ..., π_n) ~ Dirichlet(1, ..., 1)。然后,对于每个π的样本,计算加权平均Σ_i π_i S_{T^*}(t | A=a, X_i)。 -
为什么这能工作? BB 通过引入
π的随机性,显式地传播了协变量分布F(x)的不确定性。当样本量n很大时,π的后验集中在1/n附近,BB 的结果接近 EMP。当n很小时,π的后验方差很大,BB 的区间会更宽,反映了对F(x)估计的不确定性。HBB 是多亚组版本的 BB,它通过层次结构,让每个亚组的F_g不仅由其自身数据决定,还受到共享基分布F_0的“拉动”,从而在稀疏亚组中实现借力。 -
回到一般情形:论文的一般情形只是这个特例的“加壳”:
- 加壳1(多亚组):从 BB 变成 HBB,引入层次结构
F_g | F_0,实现跨亚组借力。 - 加壳2(右删失):从标准线性回归变成 AFT 模型,似然函数包含删失观测的生存概率贡献。
- 加壳3(后验 g-formula):将 AFT 的后验
θ和 HBB 的后验ω_g配对,计算S_g^{a,(m)}(t) = Σ_i ω_{gi}^{(m)} S_{T^*}(t | A=a, X_i, G=g; θ^{(m)})。
- 加壳1(多亚组):从 BB 变成 HBB,引入层次结构
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对右删失时间-事件结局下的预设亚组因果效应估计问题,提出一个贝叶斯层次自助法(HBB)框架,以稳定稀疏亚组中因协变量分布估计不稳定而导致的因果估计量波动。
- 核心工具 / 方法:将 HBB 先验置于亚组特异性基线协变量分布上,实现跨相关亚组的信息借力;结合贝叶斯加速失效时间(AFT)模型处理右删失;通过后验 g-formula 同时传播生存模型和协变量分布的不确定性。
- 主要结论:模拟表明,当目标亚组的协变量分布稀疏或形状不规则(如偏态)时,HBB 相比经验分布(EMP)和亚组内贝叶斯自助法(BB)能降低均方误差(MSE)并缩窄可信区间,同时保持接近名义水平的覆盖率。在协变量分布相似或亚组样本量充足时,HBB 的改进有限,甚至可能引入微小偏差。在真实数据(PSC 研究)中,HBB 估计显示熊去氧胆酸在所有亚组中均与 GGT 正常化概率增加相关,但亚组间差异不显著。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 因果识别假设:
- 一致性(Assumption 1):
A_i = a ⇒ T_i^* = T_i^*(a)。标准假设。 - 条件可交换性(Assumption 2):
T_i^*(a) ⊥⊥ A_i | X_i, G_i。即给定基线协变量和亚组,处理分配与潜在结果独立。这比无混杂假设更强,因为它要求在亚组内,给定X_i后处理分配是随机的。 - 正性(Assumption 3):
Pr(A_i = a | X_i = x, G_i = g) > 0。要求在亚组g内,每个协变量组合下都有概率接受两种处理。 - 条件独立删失(Assumption 4):
T_i^* ⊥⊥ C_i | A_i, X_i, G_i。要求删失时间与事件时间在给定处理、协变量和亚组后独立。这是一个很强的假设,作者在敏感性分析中检验了其违反的情况。
- 一致性(Assumption 1):
- 模型假设:
- AFT 模型:
log T_i^* = m_θ(A_i, X_i, G_i) + ε_i。m_θ是参数化的(模拟中为线性,包含亚组截距和亚组-处理交互),ε_i的分布是参数化的(模拟中为 Weibull)。这比非参数 AFT-BART 模型假设更强。 - HBB 模型:
F_g | α_g, F_0 ~ DP(α_g F_0),F_0 | γ, F^* ~ DP(γ F^*)。这是一个非参数先验,不假设协变量分布的具体形式。关键参数是α_g,控制借力强度。作者采用固定校准α_g = nM/n_g,其中M是用户指定的参考亚组大小(模拟中M=15)。
- AFT 模型:
- 相比已有文献的强化或放宽:
- 强化:相比仅使用经验分布的 BART 方法,本文显式建模了协变量分布的不确定性,这是对现有方法的一个强化。
- 放宽:相比参数化的借力模型(如正态随机效应模型),HBB 不对协变量分布做参数假设,这是对模型假设的放宽。
- 未改变:因果识别假设(一致性、可交换性、正性、条件独立删失)与大多数观察性生存因果推断研究一致,没有放宽。
主要结果¶
- 理论结果:本文是方法论文,没有新的渐近理论结果。主要“理论”贡献是后验 g-formula 的计算框架,即如何将 HBB 的权重采样与 AFT 的后验采样结合,得到亚组生存概率的后验分布。作者在附录中给出了 g-formula 的识别证明,但这是标准结果。
- 模拟结果(核心量化结论):
- HBB vs. EMP/BB:在Gamma 协变量分布(亚组间分布差异大)且小亚组(如
n_g=36)中,HBB 的 MSE 显著低于 EMP 和 BB(相对 MSE 约为 0.5-0.9,即 HBB 的 MSE 是 EMP/BB 的 50%-90%)。HBB 的偏差也更小,区间更窄,覆盖率接近 95%。在Gaussian 协变量分布(亚组间分布相同)中,HBB 与 EMP/BB 表现相似,没有明显优势。 - HBB vs. AFT-BART-NP:在所有模拟场景中,AFT-BART-NP 的 RMSE 是 HBB 的 5-25 倍,区间宽度是 2-3 倍,覆盖率也更差。这表明在样本量较小(n=300)且数据生成机制接近参数 AFT 假设时,参数模型比灵活的非参数模型更有效。
- 敏感性分析(信息性删失):当条件独立删失假设被违反时,HBB 在 Gamma 小亚组中的优势仍然存在(相对 MSE 约 0.4-0.6),但所有方法的绝对 RMSE 和区间宽度都增加了。这表明 HBB 的分布借力优势对删失机制具有一定的稳健性,但无法纠正由信息性删失本身带来的偏差。
- HBB vs. EMP/BB:在Gamma 协变量分布(亚组间分布差异大)且小亚组(如
- 真实数据例子(PSC 研究):
- 数据:来自 Pediatric PSC Consortium 的 260 名患者,其中 182 人接受熊去氧胆酸(URSO)治疗,78 人未接受。结局是 GGT 正常化时间。
- 方法应用:将 HBB 框架应用于此数据,估计 URSO 在不同年龄组(0-10, 11-15, 15+)和 SCOPE 风险分层(低、中、高)中的因果效应。调整了基线 IBD、PSC-AIH 重叠、log-GGT 和万古霉素使用。
- 结果:URSO 在所有亚组中都与 GGT 正常化概率增加相关(后验概率约 0.88-0.93)。效应在 6 个月时变得明显,之后趋于稳定。高风险患者的估计效应略大,但亚组间差异不显著(可信区间高度重叠)。
- 这个例子想说明什么:① 展示了 HBB 框架在真实世界观察性研究中的可用性。② 说明了即使亚组样本量很小(如 0-10 岁高风险组),HBB 也能给出稳定的估计。③ 强调了在亚组效应不显著时,应避免过度解读亚组特异性结论。
证明路线与技术技巧¶
- 整体路线:本文的“证明”实际上是后验计算算法的推导和模拟验证。路线如下:
- 定义后验 g-formula:将目标 estimand
S_g^a(t)的后验分布分解为对条件生存函数S_{T^*}和协变量分布F_g的后验积分。 - 指定先验:为
S_{T^*}指定贝叶斯 AFT 模型先验,为F_g指定 HBB 先验。 - 后验采样:设计一个两步采样算法:
- 步骤 A:从 AFT 模型的后验中采样
θ^{(m)}。 - 步骤 B:从 HBB 模型的后验中采样
ω_g^{(m)}(亚组g的权重向量)。
- 步骤 A:从 AFT 模型的后验中采样
- 配对与计算:将
θ^{(m)}和ω_g^{(m)}配对,代入后验 g-formula 公式S_g^{a,(m)}(t) = Σ_i ω_{gi}^{(m)} S_{T^*}(t | A=a, X_i, G=g; θ^{(m)}),得到S_g^a(t)的一个后验样本。 - 重复:重复步骤 3-4 共 M 次,得到后验样本集,进而计算后验均值、可信区间等。
- 定义后验 g-formula:将目标 estimand
- 关键跳跃点:
- 跳跃点1:从“固定经验分布”到“随机 HBB 分布”。这是本文的核心概念跳跃。传统方法将
F_g视为已知(固定为经验分布),而本文将其视为一个需要推断的随机量。这个跳跃使得协变量分布的不确定性可以被量化并传播。 - 跳跃点2:将 AFT 和 HBB 的后验采样解耦。作者指出“the AFT and Dirichlet draws can be generated independently and paired within each Monte Carlo iteration”。这是一个重要的计算技巧,避免了复杂的联合采样。其合理性在于:在给定
(A, X, G)后,AFT 模型只依赖于(Y, Δ),而 HBB 模型只依赖于X和G。在贝叶斯框架下,如果先验是独立的,那么后验也是条件独立的,因此可以分别采样。
- 跳跃点1:从“固定经验分布”到“随机 HBB 分布”。这是本文的核心概念跳跃。传统方法将
- 技术技巧点名:
- Dirichlet 过程(DP):用于构建 HBB 的层次先验。
F_g | F_0 ~ DP(α_g F_0)是 DP 作为非参数先验的典型应用。 - 贝叶斯自助法(Bayesian Bootstrap):通过设置 DP 的基测度参数
γ=0,将 DP 后验简化为一个 Dirichlet 分布,使得权重π_i和ω_{gi}可以直接从 Dirichlet 分布中采样,无需 MCMC。 - 后验 g-formula(Posterior g-formula):将 g-formula 的识别公式与贝叶斯后验推断结合,通过后验采样来传播不确定性。这是贝叶斯因果推断的标准技术。
- 加速失效时间模型(AFT):用于处理右删失时间-事件结局,提供了一个参数化的条件生存函数
S_{T^*}(t | ...),便于与 HBB 的加权平均结合。
- Dirichlet 过程(DP):用于构建 HBB 的层次先验。
🔎 结论是否比证明窄¶
- 是。作者在讨论部分明确承认了多个局限性,这些局限性使得论文的结论比其声称的“统一框架”要窄:
- “Distributional borrowing cannot correct misspecification of Sa(t | x, g).” 这意味着 HBB 的优势依赖于 AFT 模型的正确设定。如果 AFT 模型是错的,借力可能无济于事甚至有害。这比“HBB 框架能稳定估计”的泛化 claim 要窄。
- “The current borrowing structure does not distinguish among potential source subgroups according to their similarity to the target subgroup.” 这意味着当源亚组与目标亚组的协变量分布差异很大时,借力可能引入偏差。这比“HBB 能有效借力”的 claim 要窄。
- “The present likelihood also relies on conditionally independent censoring.” 这意味着当删失是信息性时,方法可能失效。敏感性分析也证实了这一点(所有方法表现都变差)。这比“HBB 框架适用于右删失数据”的 claim 要窄。
- 模拟中 AFT-BART-NP 表现不佳:作者谨慎地指出“This result does not establish a general advantage of parametric AFT models”,并承认当数据生成机制偏离参数假设时,灵活模型可能更优。这比“HBB 优于 BART”的潜在 claim 要窄。
四、开放问题¶
- 自适应借力结构:当前 HBB 的共享基分布
F_0对所有亚组一视同仁。如何设计一个目标特异性基分布F_{0g} = Σ_{h≠g} ω_{gh} F_h,其中权重ω_{gh}取决于目标亚组g和源亚组h之间协变量分布的相似性?这直接扎根于论文讨论部分:“A more adaptive extension could replace the single pooled base distribution with a target-specific mixture... where the weights depend on jointly estimated similarities between the target and source covariate distributions.” - 浓度参数
α_g的完全贝叶斯推断:当前使用固定校准α_g = nM/n_g。如何为参考亚组大小M或借力分数λ_g = α_g/(α_g + n_g)指定一个超先验,并传播其不确定性?这扎根于论文讨论部分:“A full Bayesian specification is possible by assigning a hyperprior to the reference size M, or directly to the pooling fraction λ_g... and propagating uncertainty in the pooling strength through the posterior g-formula.” - 双重稳健扩展:如何将 HBB 标准化与一个同时包含处理机制和删失机制的增强估计量结合,以获得双重稳健性?这扎根于论文讨论部分:“Doubly robust estimators of treatment-specific survival distributions provide a foundation for such an extension [27, 28].”
- 扩展至更复杂的生存数据设定:如何将 HBB 框架扩展到竞争风险(competing risks)和时依处理(time-varying treatments)?这扎根于论文讨论部分:“In the presence of competing events, an extension could standardize treatment-specific cumulative incidence functions [29, 30].” 以及 “Extensions to informative censoring, competing risks, and time-varying treatments would require additional models for those processes...”
Maintained by 陈星宇 · Homepage · Source on GitHub