跳转至

RECaST-Surv: A Calibrated Borrowing Method for Survival Endpoints in Unequal Randomized Trials

作者: Dehua Bi, Arlina Shen, Ruben P. A. van Eijk, Lu Tian, Jiapeng Xu et al.
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2609.19109


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是临床试验中的外部数据借用(external data borrowing),其根本的统计问题是:当随机对照试验(RCT)的并发对照组样本量有限(如不等随机化 r:1、儿科或罕见病)时,如何利用外部真实世界数据(历史试验、注册登记数据)来提升疗效估计的精度和检验功效,同时严格控制因外部数据与当前试验人群不可比而引入的偏倚。这个方向的成熟度处于"方法众多但缺乏统一理论框架"的阶段——已有方法(power prior、commensurate prior、MAP prior 等)在贝叶斯框架下处理借用强度,但多数方法对"外部数据与目标人群的系统性差异"的建模要么过于刚性(如假设完全可交换),要么过于宽松(如完全忽略差异导致 I 类错误膨胀)。本文试图在生存终点这一具体但重要的设定下,通过"结构模型 + 校准"的组合拳来同时解决效率提升和错误控制两个问题。

发展脉络

  • 奠基工作:贝叶斯借用方法的源头是 Ibrahim and Chen (2000) 提出的 power prior(PP),其核心思想是将外部数据的似然函数取 α 次幂(0 ≤ α ≤ 1)来控制借用强度。这一工作奠定了"通过先验/似然加权实现信息借用"的基本范式。Duan et al. (2006) 的 modified power prior 进一步将 α 视为随机变量以增加灵活性。这些方法的共同局限是:α 的选择缺乏数据驱动的准则,且隐含假设外部数据与当前试验在模型参数上具有某种程度的可交换性。
  • 主要进展——从"全局加权"到"局部校准":Hobbs et al. (2012) 的 commensurate prior(CP) 引入了一个"一致性参数"来衡量外部数据与当前试验的差异,当两者不一致时自动减少借用。Neuenschwander et al. (2010) 的 MAP prior 和 Schmidli et al. (2014) 的 robust MAP(R-MAP) 通过混合先验(一部分质量放在信息性先验上,一部分放在扩散先验上)来实现稳健借用。这些方法在概念上更精细,但仍然依赖先验设定,且对生存终点(存在删失、时间尺度)的处理不自然。Liu et al. (2021) 的 PS-MAP 和 Lu et al. (2022) 的 PS-PP 引入倾向得分来调整外部数据与试验人群的可观测协变量差异,但无法处理未观测混杂。
  • 当前 frontier——"结构模型 + 显式校准":Hickey et al. (2024) 提出的 RECaST(Random Effect Calibration of Source to Target) 是本文的直接前身。RECaST 的核心创新是:不再假设外部与目标人群可交换,而是引入一个患者特异性的乘性校准因子 βᵢ(Cauchy 分布),该因子直接作用于源模型的线性预测子,从而允许源模型在目标人群上发生系统性的、患者特异的偏移。RECaST 只需要源模型的汇总级参数(拟合的系数向量),不需要患者级外部数据,这解决了数据共享的隐私障碍。本文(RECaST-Surv) 将 RECaST 从连续/二元结局扩展到生存终点,通过 Weibull 比例风险模型实现,并额外开发了基于 bootstrap 的检验校准程序——这是 RECaST 原框架没有的,也是本文区别于前作的核心增量。

子线索聚类

被引文献大致落在三条子线索上:

  1. 先验加权类(prior weighting):PP、modified PP、MAP、R-MAP。核心机制是"对似然或先验进行加权",优点是实现简单,缺点是借用强度难以数据自适应地确定,且对模型误设敏感。
  2. 协变量调整类(covariate adjustment):PS-PP、PS-MAP、PAM-HC(Bi et al. 2023b)、LEAP(Alt et al. 2024)。核心机制是"通过倾向得分匹配/加权或潜在子结构识别可交换亚群",优点是能处理可观测混杂,缺点是依赖"无未观测混杂"这一不可检验假设,且需要患者级数据。
  3. 结构校准类(structural calibration):RECaST(Hickey et al. 2024)、RECaST-Surv(本文)。核心机制是"用源模型做基线,用随机效应校准源-目标差异",优点是只需汇总级源信息、对系统性偏移有显式建模,缺点是依赖参数模型假设(如 Cauchy 校准因子的分布形式、Weibull 生存模型)。

这个方向在追问的核心问题

  1. 借用多少:如何数据自适应地决定外部信息的借用强度,使得在外部数据与目标人群高度一致时接近完全借用,在高度不一致时接近不借用?
  2. 借用什么:应该借用患者级数据、汇总统计量、还是模型参数?这直接关系到数据隐私和跨机构合作的可行性。
  3. 如何控制错误:借用外部信息后,如何在有限样本下保证 I 类错误率接近名义水平?这是频率学派对贝叶斯借用方法的核心质疑。
  4. 如何建模不可比性:外部数据与目标人群的差异可能来自可观测协变量分布、未观测混杂、研究实施差异(如随访方案、终点定义)等多个层面,哪些差异可以被建模、哪些只能靠敏感性分析?

⚠️ 作者的 framing(这是作者的说法)

作者将缺口 frame 成:"现有的贝叶斯借用方法(PP、CP、MAP 等)在生存终点设定下缺乏一个既能借用外部信息、又能在试验层面控制 I 类错误的框架。RECaST 虽然提供了结构校准的思路,但只适用于连续/二元结局,且没有解决检验校准问题。" 因此本文的定位是"显然的下一步":把 RECaST 的结构校准思想推广到生存终点 + 增加试验层面的错误控制。

被作者淡化或回避的竞争路线: - 频率学方法(如 inverse probability weighting、calibration weighting)在文中几乎未被讨论——这些方法不依赖贝叶斯先验,但通常需要患者级外部数据。 - 因果推断框架下的传输学习(transfer learning in causal inference)——如用外部数据估计 nuisance 参数、再用目标数据做推断的两阶段方法,本文未涉及。 - 对 Cauchy 校准因子分布的敏感性——作者假设 βᵢ ~ Cauchy(µ, τ),但未讨论如果真实校准机制不是 Cauchy(如正态或偏态)时方法的稳健性。这是一个明显的"该被讨论却未讨论"的点。

什么明显该被引 / 该存在、却没出现在 intro 里? - Borrowing 方法的系统比较综述(如 FDA 关于外部数据使用的指南性文件或相关综述)——本文的 intro 没有引用任何监管视角的文献,而这是该领域实际应用中绕不开的。 - 生存分析中传输学习的近期工作——特别是利用外部数据估计 baseline hazard 或 nuisance 参数的半参数方法(如 Li, Luedtke, et al. 在 transfer learning for survival 方面的工作),这些与本文的 Weibull 参数化形成对比,但未被提及。

张力

未见明显对立引用。被引文献之间没有在相同条件下得出相反结论的情况。不过存在一个隐含的张力:先验加权类方法(PP、MAP)假设外部数据与目标人群在模型参数层面可交换(或通过先验混合实现部分稳健),而 RECaST 类方法明确建模这种不可交换性(通过 βᵢ)。这两条路线对"外部数据是否可信"的哲学立场不同,但作者没有在 intro 中正面讨论这一张力。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

符号清单(逐个点名):

记号 含义 类型
j ∈ {0, 1, ..., J} 数据集索引:j=0 为当前试验,j=1,...,J 为外部数据源 索引
n₀ 当前试验总样本量 样本量
n₀,₁ / n₀,₀ 当前试验治疗组 / 对照组样本量(n₀,₁/n₀,₀ ≈ r) 样本量
nⱼ (j≥1) 外部数据源 j 的样本量 样本量
tⱼ,ᵢ 第 j 个数据集中第 i 个患者的随访时间(删失或事件时间的最小值) 可观测随机变量
δⱼ,ᵢ 事件指示符(1=事件,0=删失) 可观测随机变量
xⱼ,ᵢ ∈ ℝᵈ 基线协变量向量(已中心化/标准化) 可观测随机变量
θⱼ 第 j 个数据集的模型参数向量(如 Cox/Weibull 回归系数) 参数(估计目标)
βᵢ 患者特异性的校准因子,βᵢ ~ Cauchy(µ, τ) 潜在(latent)随机变量
µ, τ Cauchy 分布的位置和尺度参数 超参数(估计目标)
ν Weibull 形状参数 参数(估计目标)
α Weibull 模型的截距项 参数(估计目标)
ψ = (µ, τ, ν, α) 全部待估参数 参数向量
S(t x₀) 目标人群中协变量为 x₀ 的对照患者的生存函数
HR 治疗组 vs 对照组的风险比 目标量(estimand)

模型(以 J=1 为例,这是全文最核心的设定):

  1. 外部数据(源):假设外部数据服从 Weibull 比例风险模型,其参数 θ₁ 已由外部数据估计得到(记为 \(\hat{\theta}_1\))。外部数据的 hazard 为:

    \[\lambda_1(t|x) = \nu t^{\nu-1} \exp\{\alpha_1 + x^T \theta_1\}\]

  2. 当前试验对照组(目标):hazard 为:

    \[\lambda_0^{(0)}(t|x) = \nu t^{\nu-1} \exp\{\alpha + \beta_i \cdot f(\hat{\theta}_1, x)\}\]
    其中 \(f(\hat{\theta}_1, x) = x^T \hat{\theta}_1\) 是源模型的线性预测子,βᵢ 是患者特异性的校准因子。

  3. 校准因子的分布:βᵢ ~ Cauchy(µ, τ)。当 βᵢ = 1 时,目标人群的 hazard 与源模型完全一致(即外部数据与当前试验完全可交换);当 βᵢ ≠ 1 时,源模型的预测子在目标人群上发生了乘性偏移。

  4. 当前试验治疗组:hazard 为:

    \[\lambda_0^{(1)}(t|x) = \nu t^{\nu-1} \exp\{\alpha + \beta_i \cdot f(\hat{\theta}_1, x) + \Delta\}\]
    其中 Δ 是对数风险比(log hazard ratio),是主要的推断目标。

可观测数据: - 当前试验:\(\{ (t_{0,i}, \delta_{0,i}, x_{0,i}, z_i); i=1,...,n_0 \}\),其中 z_i ∈ {0,1} 是治疗分配指示符。 - 外部数据:仅需汇总级信息 \(\hat{\theta}_1\)(以及估计 \(\hat{\theta}_1\) 时的协变量分布信息,用于 harmonization)。

关键点——可观测与不可观测的区分: - 可观测:当前试验的完整数据(治疗组 + 对照组)、外部数据的 \(\hat{\theta}_1\)。 - 不可观测(潜在):每个患者的校准因子 βᵢ、外部数据中未观测的混杂因素、目标人群的真实 hazard 结构。

第二步:最小内核

剥掉所有一般性设定后,支撑整篇论文的最小内核是:

"当外部数据与当前试验人群存在系统性差异时,如何用一个单参数的随机效应(Cauchy 校准因子)来吸收这种差异,并保证基于校准后模型的检验不失控?"

最简例子(把问题压缩到极致):

假设我们有一个外部数据集(n₁ = 1000),估计得到源模型的线性预测子系数 \(\hat{\theta}_1 = (0.2, 0.3, 0.4)\)。当前试验只有 n₀ = 100 个对照组患者和 200 个治疗组患者(r=2:1)。

朴素做法:直接把外部数据当作对照组的一部分合并分析。问题:如果外部人群与试验人群存在系统性差异(比如外部人群病情更轻),合并后对照组的风险被低估,治疗效应被高估,I 类错误膨胀。

RECaST-Surv 的做法: 1. 用外部数据估计 \(\hat{\theta}_1\)(源模型)。 2. 用当前试验的 100 个对照组患者,估计校准因子 βᵢ 的分布参数 (µ, τ)。这里的直觉是:如果外部模型在试验人群中表现良好,βᵢ 应该集中在 1 附近(µ ≈ 1, τ 小);如果外部模型系统性偏移,µ 会偏离 1,τ 会变大。 3. 对 200 个治疗组患者,用校准后的模型预测他们在"假如接受对照治疗"时的生存曲线(反事实预测)。 4. 用观测的治疗组事件数和预测的对照组事件数构造检验统计量(类似 one-sample log-rank test)。 5. 关键步骤:用 bootstrap 校准检验的拒绝域。具体来说,在零假设 Δ=0 下,把对照组数据随机分成"训练"和"测试"两部分,重复估计和检验过程,得到零分布下的 p 值分布,然后用这个分布来校准最终检验的阈值。

为什么这个内核是"最小"的:因为整个方法的核心逻辑链只有三步——(a) 用外部数据学一个源模型;(b) 用试验对照组校准源模型到目标人群;(c) 用校准后的模型做反事实预测并检验。所有技术细节(Weibull 假设、Cauchy 先验、MCMC 采样、bootstrap 校准)都只是这三步的"加壳"。

这个内核的数学本质:它本质上是一个带随机效应的参数传输学习(parametric transfer learning with random effects)问题。源模型提供了先验知识(通过 \(\hat{\theta}_1\)),目标数据(对照组)用来估计校准分布,然后这个校准分布被用来生成治疗组的反事实预测。检验的校准则是为了修正"用估计的模型做检验"所带来的不确定性——这是参数引导(parametric bootstrap)思想在检验问题上的应用。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在生存终点的不等随机化试验(或其他并发对照组有限的情形)中,如何借用外部真实世界数据来提升检验功效,同时控制 I 类错误率。
  2. 核心工具 / 方法:将 RECaST 的 Cauchy 随机效应校准框架扩展到 Weibull 比例风险模型,并开发了基于 bootstrap 的检验校准程序,用于在试验层面控制 I 类错误。
  3. 主要结论:在模拟研究中,RECaST-Surv 在多种挑战性设定下维持接近名义水平的 I 类错误(约 3.8%–7.0%),同时比无借用的 RCT 分析提高约 10%–12% 的功效;在 ALS 试验模拟中,功效从 82.8% 提升至 95.7%。

关键设定与假设

模型设定(在第二节最小记号基础上补全):

  1. Weibull 比例风险模型:hazard 函数为 \(\lambda(t|x) = \nu t^{\nu-1} \exp\{\alpha + x^T \theta\}\)。这是一个参数模型,假设 hazard 的时变形状由 ν 控制,协变量效应通过指数线性预测子进入。

  2. 校准因子的 Cauchy 分布:βᵢ ~ Cauchy(µ, τ)。Cauchy 分布的选择是关键——它比正态分布有更重的尾部,允许更大的校准偏移。作者在文中(第 2 节)引用 Hickey et al. (2024) 的 Lemma 1 说明,在一阶近似下,βᵢ 的分布确实近似 Cauchy。

  3. 边际似然:对对照组数据,通过积分掉 βᵢ 得到边际似然:

    \[\bar{L}(\psi | \hat{\theta}_1, t, \delta, x) = \int L(\beta, \psi | \hat{\theta}_1, t, \delta, x) \pi(\beta | \mu, \tau) d\beta\]
    这个积分用 Gauss-Legendre 求积(64 点)数值计算。

  4. 先验设定:µ ~ N(0, σ²_µ),α ~ N(0, σ²_α),τ ~ log-Normal(µ_τ, σ²_τ),ν ~ log-Normal(µ_ν, σ²_ν)。这些是弱信息先验。

  5. 检验统计量:基于 one-sample log-rank 类型的统计量,比较观测的治疗组事件数与预测的对照组事件数。

相比已有文献放宽/强化了哪些假设: - 放宽:不要求外部数据与当前试验完全可交换(相比 PP、MAP 的隐含假设);不要求患者级外部数据(相比 PS-based 方法)。 - 强化:假设 Weibull 参数模型正确(相比半参数方法);假设校准因子服从 Cauchy 分布(这是一个具体的参数假设,可能过强)。

关键假设的统计含义: - Cauchy 校准因子的可识别性:仅用对照组数据估计 (µ, τ) 需要足够的对照组样本量。当 n₀,₀ 很小时(如 < 50),(µ, τ) 的估计会很不稳定,这可能是方法的一个实际瓶颈。 - Weibull 假设:如果真实 hazard 不是 Weibull 形式(如非单调 hazard),校准后的模型可能产生偏的预测。作者在模拟中只考虑了 Weibull 生成的数据,这是一个明显的局限。

主要结果

模拟研究(表 1 和表 2):

  • I 类错误控制:在"同质"(Same)场景下,RECaST-Surv 的 I 类错误率在 3.5%–5.2% 之间(名义水平 5%),与 RCT-only 相当。在"异质"(Diff)场景下,RECaST-Surv 的 I 类错误率在 3.9%–6.3% 之间,而 R-MAP 在多个设定下 I 类错误率高达 7.0%–8.7%。这说明 bootstrap 校准确实起到了控制错误的作用。
  • 功效提升:在 HR=0.607 的设定下,RECaST-Surv 的功效比 RCT-only 提高约 10%–12%(例如 N=200, r=1 时,RCT-only 功效 66.5%,RECaST-Surv 功效 83.7%)。在 N=300, r=1 时,RCT-only 功效 84.7%,RECaST-Surv 功效 93.7%。
  • 与 R-MAP 的比较:R-MAP 在功效上往往更高(例如 N=200, r=1, HR=0.607 时功效 89.9%),但这是以 I 类错误膨胀为代价的。C-RMAP(校准后的 R-MAP)功效大幅下降(56.0%),低于 RECaST-Surv(83.7%)。这说明 RECaST-Surv 在"功效-I 类错误"的权衡上优于 R-MAP。

ALS 真实数据模拟(表 3):

  • 随机抽样场景:RECaST-Surv 功效 95.7% vs RCT-only 82.8%,I 类错误 6.3% vs 5.5%。
  • 偏倚抽样场景:RECaST-Surv 功效 93.9% vs RCT-only 81.2%,I 类错误 2.5% vs 4.5%。注意这里 RECaST-Surv 的 I 类错误反而低于名义水平,说明偏倚抽样下方法偏保守。

估计精度:RECaST-Surv 的 SD 和 MSE 普遍低于 RCT-only(例如 N=200, r=1, HR=1 时,RCT-only SD=0.178,RECaST-Surv SD=0.166),说明借用确实提升了估计精度。

证明路线与技术技巧

整体路线(3-5 步逻辑主干):

  1. 源模型估计:从外部数据估计 \(\hat{\theta}_1\)。这一步是"预训练",只需要汇总级参数。
  2. 校准参数估计:用当前试验对照组数据,通过边际似然(积分掉 βᵢ)估计 (µ, τ, ν, α)。这一步是"微调",将源模型适配到目标人群。
  3. 反事实预测:对治疗组患者,用校准后的模型预测他们在对照治疗下的生存曲线。
  4. 检验统计量构造:用 one-sample log-rank 类型的统计量比较观测 vs 预测。
  5. Bootstrap 校准:在零假设下,通过反复分割对照组数据(一部分用于估计校准参数,一部分用于构造检验统计量),得到检验统计量的零分布,从而校准拒绝阈值。

关键技巧:

  • Cauchy 校准因子的积分:边际似然中的积分通过变量替换 β = µ + τ·tan(u) 转化为有限区间积分,用 Gauss-Legendre 求积。这个技巧避免了 MCMC 对 βᵢ 的采样,大大降低了计算负担。
  • Bootstrap 校准:这是本文最核心的技术贡献。它本质上是一种"数据分割 + 重抽样"的校准方法,目的是在估计和检验使用同一数据的情况下修正检验水平。具体来说,在零假设下,把对照组随机分成两部分,一部分用于估计校准参数,另一部分用于计算检验统计量,重复 B 次得到零分布下的 p 值,然后用这个分布的分位数作为最终检验的阈值。这个方法的优点是完全数据驱动,不需要假设检验统计量的渐近分布。
  • 多源加权:对于 J>1 的情形,用 1/τ̂ⱼ 作为权重组合多个外部源的预测,τ̂ⱼ 越小(源与目标越一致)权重越大。这是一个简单但有效的自适应加权方案。

技术难点:

  • Cauchy 分布的重尾性:βᵢ 的 Cauchy 分布意味着边际似然中的被积函数可能有重尾行为,Gauss-Legendre 求积的精度需要验证。作者在附录中提供了求积点数的敏感性分析(64 点 vs 128 点),但正文没有详细讨论。
  • Bootstrap 校准的计算成本:每次 bootstrap 迭代都需要重新估计校准参数,当 B=100 且对照组样本量较大时,计算量可能不小。作者没有报告计算时间。
  • 小样本下的校准稳定性:当对照组样本量很小时(如 n₀,₀ = 50),bootstrap 校准的稳定性存疑。模拟中最小对照组样本量是 50(N=200, r=3),但作者没有报告这个设定下的校准表现。

🔎 结论是否比证明窄

是的,存在几处"证明窄于结论"的地方:

  1. "维持接近名义水平的 I 类错误"的声明:模拟中 I 类错误率在 3.5%–7.0% 之间波动,并非严格控制在 5% 附近。在 Diff 场景的某些设定下(如 N=200, r=3),RECaST-Surv 的 I 类错误率可能达到 6.3%–7.0%,虽然低于 R-MAP 的 8.7%,但仍偏离名义水平。作者在摘要中声称"维持接近名义水平",但模拟结果中 7.0% 的 I 类错误率是否算"接近"值得商榷。

  2. "仅需汇总级信息"的声明:虽然方法在形式上只需要 \(\hat{\theta}_1\),但协变量分布的 harmonization(中心化、标准化)需要知道外部数据的协变量分布信息。如果外部数据与试验数据的协变量定义不一致(比如年龄分段不同),仅靠汇总级参数可能不够。作者在文中提到"需要 harmonization",但没有详细讨论这一步骤的可行性和稳健性。

  3. "适用于多种挑战性设定"的声明:模拟中考虑的挑战包括协变量偏移、未测量混杂、参数传输错误等,但没有考虑:非 Weibull 的真实 hazard、时变治疗效应、信息性删失等更复杂的生存分析场景。作者在讨论部分承认了 Weibull 假设的限制,但结论部分的表述仍偏乐观。

  4. "功效提升 10%–12%"的声明:这个数字来自特定模拟设定(HR=0.607, N=200/300)。在 HR=0.779 的设定下,功效提升幅度较小(例如 N=200, r=1 时从 23.2% 到 36.5%,提升 13.3%,但绝对功效仍低)。在真实数据模拟中,功效提升更显著(82.8% 到 95.7%),但这是基于 null 场景的模拟,实际效果可能因数据质量而异。


四、开放问题

以下开放问题均扎根于本文的具体语句:

  1. 非参数化扩展(扎根于第 6 节 "the current implementation relies on a parametric Weibull survival model, which may be restrictive"):如何将校准框架扩展到 Cox 比例风险模型或完全非参数的生存模型?在非参数设定下,Cauchy 校准因子的分布假设是否仍然合理?这需要新的理论工具来分析校准因子的渐近行为。

  2. 校准因子的可识别性(扎根于第 3.2 节 "we assume βᵢ ~ Cauchy(µ, τ)"):仅用对照组数据能否可靠地识别 (µ, τ)?当对照组样本量很小时,校准分布的估计误差如何传播到最终的检验统计量?是否存在最小对照组样本量的要求?这可以用 minimax 或半参数效率理论来刻画。

  3. bootstrap 校准的理论保证(扎根于第 3.3 节 "we propose to calibrate this rejection threshold"):bootstrap 校准在什么条件下能保证 I 类错误的渐近控制?校准的收敛速度是多少?当估计器和检验统计量都是非光滑函数时,bootstrap 的一致性需要什么条件?这涉及高阶渐近理论。

  4. 多源权重的自适应选择(扎根于第 3.4 节 "we define the source weights as wⱼ = 1/τ̂ⱼ / Σ..."):1/τ̂ 权重是否是最优的?能否基于数据自适应地选择权重以最小化均方误差或最大化功效?这可以形式化为一个带约束的优化问题。

  5. 时间零点的对齐(扎根于第 5 节 "an important consideration ... is the definition of baseline or time zero"):当外部数据的 time zero 与试验不一致时(如外部数据从诊断开始随访,试验从随机化开始随访),校准框架如何处理?这是生存分析中特有的问题,需要仔细的建模。

  6. 与因果推断框架的连接(扎根于第 1 节 "differences in patient populations, study conduct, or unmeasured confounding may therefore persist"):本文的校准因子 βᵢ 本质上是在调整未测量的"研究效应"(study effect)。能否将这一框架与因果推断中的传输学习(transportability)理论建立严格联系?例如,βᵢ 是否可以解释为某种敏感性分析参数?


给研究者的提示:若要确认上述开放问题是否为真 gap,建议去读以下近期文献的 intro(约 5 篇):(1) 关于 external data borrowing 在生存分析中的最新综述;(2) Li et al. 关于 transfer learning for survival data 的工作;(3) FDA 关于 real-world evidence 的指南性文件。如果这些文献的 intro 都指向"缺乏统一的错误控制框架"或"缺乏非参数化方法",那么上述问题就是共识性的真 gap;如果它们已经解决了部分问题,则需要重新定位。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论