Covariate-Adaptive Sample Size Re-estimation for Population-Standardized Historical Control Designs in Single-Arm Trials¶
作者: Keisuke Hanada, Masahiro Kojima
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2607.25159
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:在外部对照单臂试验(externally controlled single-arm trial)中,如何设计样本量。这类试验没有随机化的同期对照组,而是使用历史数据、注册库或真实世界数据作为对照。其根本困难在于:活跃治疗组(当前试验)与外部对照组(历史数据)的基线协变量分布可能不同,导致简单的均值比较不能反映真实的治疗效果。因此,样本量规划必须考虑这种分布差异,并定义清楚“对谁有效”的目标人群。
发展脉络(history)¶
-
奠基工作:历史对照试验的统计基础
- Pocock (1976) 和 Viele et al. (2014) 奠定了历史对照试验的基本框架,讨论了如何结合随机化与历史对照,以及动态借用的方法。Viele et al. (2014) 特别强调了“动态借用”的概念,即根据历史数据与当前数据的相似性来决定借用的信息量。
- Makuch & Simon (1980) 和 Zhang et al. (2010) 则专注于样本量计算,提出了在历史对照试验中如何考虑历史对照均值的不确定性。Zhang et al. (2010) 指出,Makuch-Simon 方法忽略了历史对照均值的随机性,会导致实际功效和I类错误偏离名义水平,并提出了控制其百分位数的方法。
-
主要进展:倾向性评分与人群标准化
- Rosenbaum & Rubin (1983) 提出了倾向性评分(propensity score),成为处理观察性研究中选择偏差的核心工具。这为外部对照试验中的协变量调整提供了理论基础。
- Stuart et al. (2011) 和 Dahabreh et al. (2020) 将倾向性评分的思想扩展到可推广性(generalizability)和可迁移性(transportability)问题。他们提出使用“试验参与评分”(trial participation score)来将随机试验的结果标准化到一个目标人群。本文直接借鉴了这一思路,将历史对照的结局标准化到实际入组的活跃治疗组人群。
- Austin & Stuart (2015) 和 Cole & Hernan (2008) 提供了使用逆概率加权(IPTW)进行标准化的实践指南,强调了正性(positivity)、模型设定和加权后协变量平衡的重要性。
-
当前前沿:外部对照试验的样本量重估
- Schoenfeld et al. (2019) 提出了一个贝叶斯分层模型,用于在将先前试验作为历史对照时进行假设检验和样本量计算,考虑了试验间的变异。
- Kojima et al. (2026) 是本文作者团队的前期工作,针对混合对照设计(hybrid-control design,即结合当前小规模对照组与历史对照),提出了使用IPTW评估协变量不平衡,并在盲态下进行样本量重估(SSR)的方法。本文是其直接延伸,但将场景从“混合对照”推广到了“纯外部对照”的单臂试验。
- Xu & Friede (2026) 和 Maeda et al. (2026) 研究了盲态下对连续型结局的方差进行连续监测和SSR,考虑了中期估计的不确定性。本文的SSR程序在思路上与之一致,但更新的是目标人群分布而非方差。
-
本文的位置:本文位于上述脉络的交汇点。它继承了“人群标准化”的思想(Stuart et al., 2011; Dahabreh et al., 2020),并将其应用于外部对照单臂试验的样本量设计。它扩展了“样本量重估”的方法(Kojima et al., 2026),但将更新对象从“协变量不平衡程度”明确为“目标人群的协变量分布”,并开发了相应的理论性质。
子线索聚类¶
- 线索一:历史对照试验的统计方法(Pocock, 1976; Viele et al., 2014; Schoenfeld et al., 2019; Qi et al., 2022)。这一簇关注如何借用历史信息,包括贝叶斯动态借用、分层模型等,主要处理的是历史数据与当前数据之间的异质性。
- 线索二:人群标准化与可推广性方法(Stuart et al., 2011; Dahabreh et al., 2020; Austin & Stuart, 2015; Loiseau et al., 2022)。这一簇关注如何将从一个群体(如随机试验)得到的因果效应估计值,通过倾向性评分或G-computation等方法,迁移到另一个目标群体。本文的核心估计量就属于这一簇。
- 线索三:样本量重估(SSR)方法(Kojima et al., 2026; Xu & Friede, 2026; Maeda et al., 2026; Gould & Shih, 1992)。这一簇关注如何在试验进行中,利用累积的数据(通常是盲态的)来更新样本量,以应对设计阶段假设的不确定性。本文的SSR程序属于这一簇,但创新性地将更新对象从“方差”或“协变量不平衡”扩展到了“目标人群分布”。
核心问题与瓶颈¶
- 目标人群的定义:在外部对照试验中,“对谁有效”是首要问题。是历史对照人群、当前试验人群,还是某个超级人群?不同的定义会导致不同的估计量和样本量需求。
- 协变量不平衡的处理:如何有效且稳健地调整活跃治疗组与历史对照组之间的基线差异?IPTW、G-computation、DML等方法各有优劣,且对模型设定和正性假设敏感。
- 样本量规划的不确定性:设计阶段对目标人群的假设(如协变量分布)可能严重偏离实际入组人群,导致试验功效不足或过度。如何量化并应对这种不确定性?
- 盲态下的信息利用:在保持结局盲态的前提下,能否利用累积的基线协变量信息来优化试验设计?这是SSR的核心挑战。
⚠️ 作者的 framing¶
- 作者如何frame缺口:作者将缺口定位为“目标人群不确定性”(target population uncertainty)。他们指出,现有样本量计算方法(如Makuch & Simon, 1980; Zhang et al., 2010)通常假设目标人群在设计阶段是固定的,但实际入组的活跃治疗组人群的协变量分布可能与计划不同。因此,他们提出,既然目标人群是“实际入组的活跃治疗组人群”,那么样本量设计就应该反映这个人群的实际分布,而不仅仅是计划分布。这使他们提出的“协变量自适应SSR”成为“显然的下一步”。
- 被淡化或回避的竞争路线:
- 贝叶斯动态借用方法(如Viele et al., 2014; Qi et al., 2022)被提及但未被深入比较。作者将本文定位为频率学派框架下的设计方法,回避了与贝叶斯方法在“信息借用程度”上的直接比较。贝叶斯方法通过先验分布来量化不确定性,而本文通过SSR来应对不确定性。
- 更复杂的因果推断方法,如G-computation和Doubly Debiased Machine Learning (DDML)(Loiseau et al., 2022),被提及作为分析阶段的工具,但本文的SSR程序是基于一个更简单的、基于平衡评分的标准化方法。作者没有讨论如果最终分析使用DDML,SSR程序应如何调整。
- 什么明显该被引/该存在、却没出现在intro里?
- 关于“条件功效”(conditional power)的文献:本文的SSR程序本质上是基于条件功效的,但intro中只引用了Proschan & Hunsberger (1995) 这一篇奠基工作。关于条件功效在适应性设计中的广泛应用和理论(如Promising Zone设计),本文没有深入讨论。这是一个值得研究者去查的缺口:本文的SSR与更一般的条件功效框架有何异同?
- 关于“信息锚定”(information anchoring)的文献:在适应性设计中,如何保证不同阶段的信息量可比是一个重要问题。本文的SSR更新了目标分布,这实际上改变了检验的“信息锚”,其影响值得进一步探讨。
张力¶
未见明显对立引用。所有被引工作基本都指向一个共识:外部对照试验需要处理协变量不平衡,而样本量规划需要应对不确定性。本文是在这个共识下提出一个具体的、可操作的解决方案。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
G:二元数据源指示符。G=1表示来自当前活跃治疗组单臂试验;G=0表示来自历史对照组数据源。注意:这不是处理分配指示符。Y:观测到的结局变量。X:基线协变量向量(在治疗前测量)。Y^1,Y^0:潜在结局。活跃治疗组个体观测到Y = Y^1;历史对照组个体观测到Y = Y^0。Z = s(X):平衡评分(balancing score),是预先指定的协变量函数。本文主要使用s(X) = P(G=1|X),即试验参与评分(trial participation score)。F_{Z,A}:活跃治疗组(G=1)中平衡评分Z的分布。这是本文定义的目标人群。η^a(F_{Z,A}):在目标人群F_{Z,A}下,处理状态a的结局泛函(如均值、事件概率)。η^1是活跃治疗组的结局,η^0是对照组的结局。Δ(F_{Z,A}) = η^1(F_{Z,A}) - η^0(F_{Z,A}):目标人群中的处理效应估计量。θ^0(z):条件对照参数,即给定Z=z时,历史对照组(G=0)的结局特征(如条件均值E[Y^0 | Z=z])。n_A,n_H:活跃治疗组和历史对照组的样本量。N:活跃治疗组的目标样本量。τ^2_0(F):标准化对照参数估计量\hat{η}^0(F)的方差。σ^2_1:活跃治疗组结局的方差。
-
模型:
- 数据生成机制:活跃治疗组数据
(Y_i, X_i, Z_i)来自分布F_{X,A};历史对照组数据(Y_j, X_j, Z_j)来自分布F_{X,H}。两个分布可能不同。 - 关键假设:
- 条件可交换性(Conditional Exchangeability):在给定基线协变量
X或平衡评分Z的条件下,数据源G与潜在结局Y^0独立。即Y^0 ⟂ G | X或Y^0 ⟂ G | Z。这保证了历史对照组的结局可以代表活跃治疗组人群的对照结局。 - 正性(Positivity):对于活跃治疗组中所有可能的
Z值,历史对照组中都有非零的概率出现,即P(G=0 | Z=z) > 0。
- 条件可交换性(Conditional Exchangeability):在给定基线协变量
- 要估的对象:
Δ(F_{Z,A}),即活跃治疗组人群的平均处理效应(ATT的变体)。
- 数据生成机制:活跃治疗组数据
-
可观测数据:
- 活跃治疗组:可以观测到
(Y_i, X_i, Z_i),其中Y_i = Y_i^1。 - 历史对照组:可以观测到
(Y_j, X_j, Z_j),其中Y_j = Y_j^0。 - 想要但观测不到的:活跃治疗组中每个个体的
Y_i^0(如果他们接受对照治疗的潜在结局)。这是因果推断的核心缺失数据问题。
- 活跃治疗组:可以观测到
第二步:讲最小内核¶
本文的核心思路可以用一个最简单的二元协变量例子来理解。
-
最简特例:
- 协变量
X是二元的(例如,性别:男/女)。 - 历史对照组中,
P(X=1 | G=0) = p_H。 - 活跃治疗组中,
P(X=1 | G=1) = p_A。设计阶段假设p_A = p_H,但实际入组后p_A可能不同。 - 结局模型:
Y^0 = β_0 + β_1 X + ε,其中ε ~ N(0,1)。 - 平衡评分
Z = s(X) = P(G=1|X)。在这个简单例子中,Z是X的确定性函数,所以标准化到Z的分布等价于标准化到X的分布。
- 协变量
-
核心思路:
- 目标人群:实际入组的活跃治疗组人群,其协变量分布为
P(X=1) = p_A。 - 标准化对照参数:
η^0(p_A) = E[Y^0 | p_A] = β_0 + β_1 * p_A。这个值依赖于p_A。 - 设计对比:
Δ(p_A) = η^1 - η^0(p_A)。如果设计阶段假设p_A = p_H,则Δ(p_H) = η^1 - (β_0 + β_1 p_H)。如果实际p_A ≠ p_H,那么实际的设计对比Δ(p_A)就会偏离计划值。 - 样本量公式:基于正态近似的样本量公式为
N(p_A) = (z_{1-α/2} + z_{1-β})^2 / Δ(p_A)^2。因此,N也依赖于p_A。 - 问题:如果实际
p_A > p_H,且β_1 > 0(例如,男性结局更好),那么η^0(p_A) > η^0(p_H),导致Δ(p_A) < Δ(p_H),从而所需的样本量N(p_A) > N(p_H)。如果按计划样本量N(p_H)入组,试验就会功效不足。 - 本文的解决方案:在试验进行中,利用已入组活跃治疗组个体的
X来实时估计p_A(即\hat{p}_A),然后用\hat{p}_A代入样本量公式,更新目标样本量N(\hat{p}_A)。由于X在入组时就能观测到,这个过程是结局盲态的。
- 目标人群:实际入组的活跃治疗组人群,其协变量分布为
-
结论:本文在数学上干了一件非常直观的事:当目标人群的协变量分布与计划不符时,通过实时观测到的协变量分布来动态调整样本量,以维持目标功效。论文的一般情形(高维
X、任意平衡评分Z、更复杂的结局模型)只是这个二元例子在更复杂设定下的推广。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在外部对照单臂试验中,当实际入组的活跃治疗组人群的基线协变量分布与设计阶段的计划分布不同时,如何通过样本量重估(SSR)来维持目标检验功效。
- 核心工具/方法:提出了一个人群标准化估计量(population-standardized estimand),将历史对照结局通过平衡评分标准化到实际入组的活跃治疗组人群;并基于此开发了一个协变量自适应、结局盲态的SSR程序,该程序仅利用累积的基线协变量来更新目标人群分布和所需样本量。
- 主要结论:在模拟研究中,当计划人群与真实入组人群存在分布偏移时,固定设计会损失功效,而所提SSR能维持接近目标水平的功效,表现与理想设计(oracle design)相当。理论分析表明,在适当条件下,该SSR程序能近似控制I类错误,并保证条件功效。
关键设定与假设¶
- 目标人群:定义为“实际入组的活跃治疗组人群”(
F_{Z,A})。这是一个关键选择,它使得估计量类似于ATT,并且样本量规划必须依赖于这个实际分布。 - 平衡评分:使用预先指定的
Z = s(X),通常是试验参与评分P(G=1|X)。这借鉴了可推广性文献(Stuart et al., 2011; Dahabreh et al., 2020)的思路,将高维的X降维到一个低维的评分,使得标准化在设计和中期分析中更稳定。 - 标准化方法:使用逆概率加权(IPTW),权重为
w_j(F) = \hat{Z}_j^H(F) / (1 - \hat{Z}_j^H(F))。这等价于将历史对照的分布通过“赔率”权重调整到活跃治疗组的评分分布。 - 关键假设:
- 条件可交换性:
Y^0 ⟂ G | Z。这是标准化有效性的核心。 - 正性:活跃治疗组评分分布的支持集是历史对照组评分分布支持集的子集。
- 模型设定正确:试验参与评分模型
s(X)和条件对照参数模型θ^0(z)被正确设定。 - SSR独立性:SSR规则和停止规则仅依赖于评分过程
{Z_i},而不依赖于活跃治疗组结局{Y_i}(假设A1)。 - 单次最终检验:仅在入组完成后进行一次最终检验,无中期疗效分析(假设A2)。
- 条件可交换性:
- 相比已有文献的强化/放宽:
- 强化:相比Kojima et al. (2026) 的混合对照设计,本文专注于纯外部对照设计,并明确将目标人群定义为实际入组人群,使得SSR的逻辑更清晰。
- 放宽:相比Makuch & Simon (1980) 等固定样本量方法,本文允许样本量根据实际入组人群动态调整,放宽了“计划分布等于真实分布”的强假设。
主要结果¶
-
定理1(近似I类错误控制):
- 陈述:在假设A1-A3下,基于所提出SSR的最终检验,其I类错误率不超过
α + E[ρ_{N_final}],其中ρ_n是条件拒绝概率与α的偏差。如果E[ρ_{N_final}] → 0,则渐近控制I类错误。 - 直觉:由于SSR和停止规则不依赖于结局,最终样本量
N_final是一个关于协变量过程的停时。最终检验的I类错误可以分解为每个可能停时点上条件I类错误的期望。只要每个停时点上的条件I类错误被控制住,整体I类错误就被控制住。ρ_n项来自于使用经验评分分布\hat{F}_{Z,A,n}代替真实分布F_{Z,A}^{true}所带来的近似误差。 - 必要条件:SSR必须与结局无关(A1),且最终检验是单次的(A2)。
- 解决的技术难点:证明了在适应性设计中,只要适应性规则不依赖于结局,I类错误就不会被系统性膨胀。这是盲态SSR的经典结论,本文将其应用到了“目标人群更新”这一新场景。
- 陈述:在假设A1-A3下,基于所提出SSR的最终检验,其I类错误率不超过
-
定理2(条件功效保证):
- 陈述:在假设A1-A2和A4-A5下,给定最终观测到的评分分布
\hat{F}_{Z,A,N_final},条件功效至少为1 - β - ε_{N_final},其中ε_N是正态近似的误差。 - 直觉:假设A5是一个“oracle条件”,它要求SSR程序最终使用的目标样本量
N_target(N_final)至少等于针对最终观测到的评分分布\hat{F}_{Z,A,N_final}的oracle所需样本量。如果这个条件满足,那么基于正态近似的功效就能达到目标水平。 - 必要条件:SSR程序必须足够保守(例如,使用保守SSR版本),以确保假设A5以高概率成立。
- 解决的技术难点:将功效保证从“无条件”转化为了“条件于最终目标分布”。这使得功效分析可以基于试验中实际观测到的信息,而不是设计阶段的假设。
- 陈述:在假设A1-A2和A4-A5下,给定最终观测到的评分分布
证明路线与技术技巧¶
-
整体路线:
- 分离SSR与功效检验:首先证明,由于SSR规则仅依赖于协变量过程(A1),最终样本量
N_final是一个关于协变量信息流的停时。这使得I类错误和功效的分析可以条件于这个停时。 - I类错误控制(定理1):将整体I类错误分解为
E[P(拒绝 | G_{N_final})]。由于N_final是停时,且条件于G_n时,检验的I类错误被假设A3控制,因此整体I类错误被α + E[ρ_{N_final}]控制。 - 条件功效保证(定理2):条件于最终评分分布
\hat{F}_{Z,A,N_final},检验统计量T_N的分布由假设A4近似为正态。功效的下界由1 - Φ(z_{1-α/2} - μ_N)给出。假设A5保证了μ_N足够大,使得这个下界至少为1-β。
- 分离SSR与功效检验:首先证明,由于SSR规则仅依赖于协变量过程(A1),最终样本量
-
关键跳跃点:
- 跳跃点1:将“目标人群不确定性”转化为“样本量不确定性”。作者的关键想法是,既然目标人群是实际入组人群,那么其分布的不确定性就应该通过SSR来吸收。这个跳跃将问题从“如何估计一个固定目标”转变为“如何为一个动态变化的目标设计试验”。
- 跳跃点2:证明SSR的“结局盲态”性质足以近似控制I类错误。这是通过定理1完成的,其核心是假设A1和A2。这个跳跃点依赖于一个经典结论:只要适应性规则不依赖于结局,就不会系统性膨胀I类错误。
-
技术技巧点名:
- 条件概率分解:在定理1的证明中,使用
P(R_{N_final}) = Σ_n P(R_n, N_final = n) = Σ_n E[I(N_final = n) P(R_n | G_n)]。这是处理停时问题时的标准技巧。 - Delta方法:在保守SSR中,使用Delta方法估计
log N_{re}(n)的标准误,以构建不确定性区间。这是处理正偏态样本量分布时的实用技巧。 - 正态近似:整个样本量公式和功效分析都基于正态近似(假设A4)。这是临床试验样本量计算的常规做法。
- 条件概率分解:在定理1的证明中,使用
真实例子与应用¶
- 数据/场景:使用了阿尔茨海默病合作研究(ADCS)的数据。将ADC-016试验(B族维生素)的安慰剂组作为历史对照组,将ADC-027试验(DHA)的治疗组作为假设的活跃治疗组单臂试验。
- 如何应用:
- 定义平衡评分:使用逻辑回归估计试验参与评分
P(G=1|X)。Case 1使用性别和教育程度;Case 2使用年龄、性别、教育程度和基线MMSE评分。 - 实施SSR:在预设的审查时间点(Case 1: 20, 30, 40人;Case 2: 20, 40, 60, 80人),仅使用已入组活跃治疗组个体的基线协变量,重新估计评分模型,计算标准化对照均值
\hat{η}^0,并更新目标样本量N_{target}。 - 结果:展示了不同调整集(Case 1 vs Case 2)和不同SSR版本(点估计 vs 保守)下,最终样本量的差异。例如,Case 2中,由于调整了更多协变量,早期样本量估计更不稳定,但最终样本量反映了入组人群的协变量特征。
- 定义平衡评分:使用逻辑回归估计试验参与评分
- 这个例子想说明什么:主要目的是展示方法的可实施性,而非验证理论。它说明了调整集的选择和入组过程中协变量分布的演变会如何影响标准化对照参数和最终样本量。这是一个“概念验证”性质的例子。
- 模拟研究:通过模拟,系统地比较了六种设计在计划分布与真实分布不同时的表现。核心结论是:当
μ_A(活跃治疗组与历史对照组的均值差异)增大时,固定设计的功效显著下降,而所提SSR能通过增加样本量来维持功效,表现接近oracle设计。
🔎 结论是否比证明窄¶
- 是。定理2的证明依赖于假设A5,这是一个oracle条件,即SSR程序最终使用的样本量必须至少等于针对最终观测分布的oracle所需样本量。在实际中,这个条件只能被近似满足(例如,通过保守SSR)。作者在证明后的讨论中也承认了这一点:“A power guarantee therefore requires the estimated required sample size not to fall below the oracle required sample size with sufficient probability.”
- 因此,论文的严格证明只给出了一个条件于oracle条件成立的功效保证。而论文的泛泛claim(如“maintained power near the target level”)是基于模拟研究,而非严格证明。模拟中,点估计SSR在
μ_A=1.0时,功效为0.791,略低于目标0.80,这正好反映了oracle条件未能完美满足的情况。
四、开放问题¶
-
放松正态近似假设:本文的样本量公式和理论(定理2)依赖于正态近似。对于二元、有序、时间-事件结局或小样本情况,如何开发基于精确检验、置换检验或模拟的条件功效SSR程序?【扎根于论文Section 5讨论:“For binary, ordinal, time-to-event, or small-sample settings, the required sample size conditional on the observed score distribution could be updated numerically using exact tests, permutation tests, bootstrap methods…”】
-
扩展到混合对照设计:本文专注于纯外部对照设计。当存在一个小型的同期随机对照组时(混合对照设计),如何将本文的“目标人群标准化”框架与“信息借用”结合起来,并开发相应的SSR程序?【扎根于论文Section 5讨论:“One is application to hybrid-control designs… designs that combine a small concurrent control group with external controls must jointly address target-population standardization, borrowing of external information, and sample size re-estimation (Kojima et al., 2026).”】
-
处理未测量混杂:本文的核心假设是条件可交换性,即
Y^0 ⟂ G | Z。如果存在未测量的混杂因素,这个假设会被违反。如何对SSR程序进行敏感性分析,以评估未测量混杂对所需样本量和I类错误的影响?【扎根于论文Section 5讨论:“If unmeasured confounding, calendar-time differences, measurement differences, or endpoint-definition differences remain, η^0(F) may not represent the control potential outcome in the target population.”】 -
考虑治疗效应异质性:本文假设活跃治疗组的设计值
η^1不依赖于目标评分分布F。如果治疗效应在协变量间是异质的,那么η^1也会随F变化。如何将这种异质性纳入SSR框架?【扎根于论文Section 5讨论:“We also treated the active-arm design value η^1 as independent of the target score distribution… Designs that relax these assumptions may be needed when treatment effects are heterogeneous by covariates…”】
Maintained by 陈星宇 · Homepage · Source on GitHub