Power and Sample Size Calculations for Hybrid Controlled Trials¶
作者: Ke Zhu, Shu Yang, Xiaofei Wang
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.26475
一、领域脉络与小综述¶
这个方向是什么¶
混合对照试验(Hybrid Controlled Trial, HCT)通过引入外部对照(External Control, EC)来增强随机对照试验(RCT)的统计功效,尤其适用于罕见病、肿瘤、儿科等场景。其根本的统计问题是:在计划阶段,EC 与 RCT 对照的可比性(协变量分布重叠、结果漂移)未知,导致传统 RCT 样本量公式失效。当前该子方向的成熟度:分析方法(贝叶斯动态借用、频率学派 IPW/AIPW/TMLE)已较丰富,但前瞻性样本量计算方法仍相对有限,是本文试图填补的缺口。
发展脉络(history)¶
- 奠基工作:Pocock (1976) 最早提出结合随机对照与历史对照;Ventz et al. (2022) 系统定义了 HCT 设计框架,通过模拟和真实数据展示了 HCT 相比纯 RCT 或纯外部对照的优势。
- 主要进展(分析方法):贝叶斯方法通过先验或借用模型刻画借用强度(Zhang et al., 2022; Bi et al., 2023; Chen et al., 2024; Tian et al., 2025),频率学派则发展出基于倾向得分的估计量,如 augmented IPW (Li et al., 2023)、TMLE (Valancius et al., 2024)、augmented calibration weighting (Gao et al., 2025a)。这些工作聚焦于分析阶段的推断。
- 当前 frontier(样本量设计):Gao et al. (2025c) 提出了基于高效影响函数的 HCT 和单臂试验样本量方法,但需要指定完整的 nuisance 函数(如结果模型),在计划阶段难以 elicite。Liu et al. (2026a) 为观察性研究开发了基于 IPW 的样本量公式,使用三个标量参数(重叠系数、混杂系数等),但该框架针对的是观察性研究中的 ATE,而非 HCT 中结合随机化与外部数据的设定。自适应方法(Guo et al., 2024; Kojima et al., 2026)依赖期中数据,不完全是前瞻性。
- 本文的位置:作者提出“5+3”参数化框架,在 Liu et al. (2026a) 的基础上扩展至 HCT 设定,并改进了数值校准方法(直接正态校准而非 Beta 近似),同时为连续和二元结局分别推导了方差公式。作者在 Table 1 中明确对比了现有方法,指出本文是唯一仅需标量参数的前瞻性 HCT 样本量方法。
子线索聚类¶
- 贝叶斯动态借用(Zhang et al., 2022; Bi et al., 2023; Chen et al., 2024; Tian et al., 2025):通过先验或交换性模型刻画借用,样本量计算通常基于有效样本量(ESS)或模拟,缺乏解析公式。
- 频率学派基于倾向得分的估计与推断(Li et al., 2023; Valancius et al., 2024; Gao et al., 2025a; Zhu et al., 2025):发展出 IPW、AIPW、TMLE、ACW 等估计量,但样本量计算要么需要完整 nuisance 函数,要么未专门处理。
- 自适应设计(Guo et al., 2024; Kojima et al., 2026):在期中分析时根据 RCT 数据调整借用量或样本量,但需要 interim 数据,不是纯前瞻性。
- 样本量公式的解析推导(Liu et al., 2026a; 本文):将方差表达为少量可解释标量参数的函数,适用于计划阶段。Liu et al. (2026a) 针对观察性研究,本文针对 HCT。
这个方向在追问的核心问题¶
- 如何在前瞻性设计中量化 EC 的可比性? 需要可解释、可 elicite 的标量参数,而非完整协变量分布。
- 如何将 EC 可比性映射到 IPW 估计量的方差,从而得到样本量公式? 需要建立从设计参数到渐近方差的解析关系。
- 对于不同结局类型(连续、二元、生存),公式如何调整? 本文处理了连续和二元,生存留作未来工作。
- 如何保证公式在有限样本下的准确性? 特别是当 RCT 样本量较小时(罕见病场景),正态近似可能失效。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
作者将缺口 frame 为:“there remains a need for a prospective sample-size method for HCTs that requires only a small number of interpretable design inputs, does not rely on access to interim data, and explicitly accounts for EC comparability.”(Introduction 第 3 段)。他们通过“5+3”参数化(5 个常规 RCT 参数 + 3 个 HCT 特定标量参数)来满足这一需求。
- 被淡化或回避的竞争路线:作者在 Remark 2 中承认,更高效的估计量(AIPW、TMLE)可能提供更大功效,但“characterizing their asymptotic power requires additional information about the outcome model”,因此本文聚焦 IPW 以保持简单。这实际上回避了高效估计量在计划阶段可能带来的优势。此外,贝叶斯方法(如 Zhang et al., 2022)被归为“需要先验或借用模型”,但未深入讨论其样本量公式是否也能用标量参数近似。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者在 Discussion 中提到了 Gordon and Schuler (2025) 的敏感性分析框架,但 intro 中未提及。此外,关于“结果漂移”的检测方法(如 Gao et al., 2025a 的 data-adaptive borrowing)在 intro 中仅一笔带过,未详细对比。未见明显对立引用。
张力¶
未见明显对立引用。各工作在不同设定下(贝叶斯 vs 频率、前瞻 vs 自适应、IPW vs 高效估计)各有侧重,但结论不矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(S\):指示变量,\(S=1\) 表示 RCT 样本,\(S=0\) 表示 EC 样本。
- \(A\):处理指示,\(A=1\) 实验组,\(A=0\) 对照组。EC 中 \(A=0\)。
- \(Y\):观测结局。
- \(Y(1), Y(0)\):潜在结局。
- \(X\):协变量向量。
- \(\pi_S(x) = \Pr(S=1 \mid X=x)\):抽样倾向得分(sampling propensity score)。
- \(\bar\pi_S = \Pr(S=1) = n_{\text{RCT}} / n\),其中 \(n = n_{\text{RCT}} + n_{\text{EC}}\)。
- \(\bar\pi_A = n_1 / n_{\text{RCT}}\):RCT 内处理分配比例(已知)。
- \(\tau = \theta_1 - \theta_0\),其中 \(\theta_a = \mathbb{E}[Y(a) \mid S=1]\):RCT 人群中的平均处理效应(ATE)。
- \(W = \tilde{X}^\top \gamma\):线性抽样倾向得分,其中 \(\tilde{X} = (1, X^\top)\),\(\logit(\pi_S(X)) = W\)。
- \(\phi\):Bhattacharyya 重叠系数,衡量 RCT 与 EC 中 \(\pi_S(X)\) 分布的相似度。
- \(\rho = \text{cor}(W, Y(0))\):相关系数,刻画区分 RCT 与 EC 的协变量方向与对照潜在结局的关联。
- \(n_{\text{EC}}\):无结果漂移的 EC 样本量(可能小于可用 EC 总数)。
- 模型:
- 数据生成:RCT 中 \(A\) 随机分配(已知 \(\bar\pi_A\));EC 中所有个体接受对照。协变量分布:RCT 人群为 \(f_{\text{RCT}}(x)\),EC 人群通过指数倾斜生成(模拟中),但计划阶段假设 \(W \sim N(\mu_W, \sigma_W^2)\)(logit-normal 模型)。
- 识别假设:Assumption 1-4(SUTVA、条件均值可交换性、正性)。
- 结局模型:连续结局假设同方差线性模型 \(Y(0) = a + bW + \varepsilon\);二元结局假设 logistic 模型 \(\logit \mathbb{E}[Y(0) \mid W] = a + bW\)。
- 可观测数据:研究者能观测到 \((S_i, A_i, X_i, Y_i)\) 的独立同分布样本,其中 RCT 样本有 \(S=1\) 且 \(A\) 随机,EC 样本有 \(S=0\) 且 \(A=0\)。不可观测的是潜在结局 \(Y(0)\) 和 \(Y(1)\) 的完整分布,以及抽样倾向得分 \(\pi_S(x)\)(需估计)。计划阶段连 RCT 的 \(X\) 也未知,只能依赖先验信息。
第二步:讲最小内核¶
本文的核心数学困难是:在计划阶段,如何仅用少量标量参数(\(\phi, \rho, n_{\text{EC}}\))确定 IPW 估计量的渐近方差 \(V = V_1 + V_0\),从而解出所需 \(n_{\text{RCT}}\)。
最简特例:完美重叠(\(\phi=1\))
当 \(\phi=1\) 时,\(\pi_S(X) \equiv \bar\pi_S\) 为常数,即 RCT 与 EC 的协变量分布完全相同。此时 \(W\) 退化,\(\sigma_W=0\),\(\rho=0\) 按惯例。IPW 估计量的方差简化为:
若进一步假设两臂方差相等 \(\sigma_Y^2\),则 \(V = \frac{\sigma_Y^2}{\bar\pi_S} \left( \frac{1}{\bar\pi_A} + \frac{1}{1-\bar\pi_A} \right)\)。注意到 \(\bar\pi_S = n_{\text{RCT}}/(n_{\text{RCT}}+n_{\text{EC}})\),因此总样本量 \(n = n_{\text{RCT}}+n_{\text{EC}}\) 越大,方差越小。此时样本量公式退化为常规 RCT 公式,但用 \(n\) 代替 \(n_{\text{RCT}}\)。例如,若 \(\bar\pi_A=0.5\),则 \(V = 4\sigma_Y^2 / \bar\pi_S\),所需 \(n_{\text{RCT}}\) 由 \(n_{\text{RCT}} = (z_{1-\alpha}+z_{1-\beta})^2 \cdot 4\sigma_Y^2 / \tau^2 - n_{\text{EC}}\) 给出。这个特例直观展示了 EC 如何通过增加有效样本量来降低所需 RCT 样本量。
一般情况(\(\phi<1\))
当重叠不完全时,\(W\) 有变异,方差 \(V_0\) 中包含额外项(Theorem 2 和 3 中的积分表达式),需要数值计算。但核心思想不变:\(V\) 完全由 \((\bar\pi_A, \bar\pi_S, \phi, \rho, \theta_0 \text{或} \sigma_Y^2)\) 决定,其中 \(\bar\pi_S\) 由候选 \(n_{\text{RCT}}\) 和 \(n_{\text{EC}}\) 确定。因此,给定目标功效,可数值求解 \(n_{\text{RCT}}\)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:为混合对照试验(HCT)提出前瞻性样本量计算方法,解决计划阶段 EC 可比性未知导致传统公式失效的问题。
- 核心工具/方法:基于 IPW 估计量的渐近正态性,引入“5+3”参数化——5 个常规 RCT 参数(效应量、分配比例、显著性水平、功效、结局参数)加上 3 个 HCT 特定标量参数(无结果漂移的 EC 样本量 \(n_{\text{EC}}\)、重叠系数 \(\phi\)、相关系数 \(\rho\)),在 logistic 抽样模型和正态线性/ logistic 结局工作模型下,将渐近方差表达为这些参数的函数。
- 主要结论:建立了 IPW 估计量的渐近正态性(Theorem 1),并分别给出连续结局(Theorem 3)和二元结局(Theorem 2)的方差公式;模拟显示理论功效与经验功效高度吻合(最大绝对偏差 0.031);在真实临床试验(INJeCT-LUNG)中展示了如何使用该框架确定 RCT 样本量(推荐 176 人)。
关键设定与假设¶
- 识别假设:Assumption 1-4(SUTVA、RCT 内无混淆、条件均值可交换性、抽样正性)。其中 Assumption 3 要求 EC 无结果漂移(\(\mathbb{E}[Y(0) \mid S=1, X] = \mathbb{E}[Y(0) \mid S=0, X]\)),这是借用 EC 的核心假设。
- 工作模型:
- 抽样模型:\(\logit(\pi_S(X)) = \tilde{X}^\top \gamma\),且 \(W = \tilde{X}^\top \gamma \sim N(\mu_W, \sigma_W^2)\)(线性倾向得分正态性假设)。
- 结局模型:连续结局为同方差线性模型 \(Y(0) = a + bW + \varepsilon\)(Theorem 3);二元结局为 logistic 模型 \(\logit \mathbb{E}[Y(0) \mid W] = a + bW\)(Theorem 2)。
- 额外条件:Theorem 1 要求条件二阶矩可运输性 \(\mathbb{E}[(Y(0)-\theta_0)^2 \mid X, S=1] = \mathbb{E}[(Y(0)-\theta_0)^2 \mid X, S=0]\),这是为了得到简洁的方差表达式。
- 相比已有文献的放宽/强化:相比 Liu et al. (2026a) 的观察性研究框架,本文扩展至 HCT 设定,需要处理 RCT 内随机化带来的不同权重结构;相比 Gao et al. (2025c),本文不需要指定完整 nuisance 函数,但牺牲了效率(使用 IPW 而非 AIPW)。
主要结果¶
- Theorem 1(渐近正态性):在 Assumptions 1-4 及矩条件下,\(\sqrt{n}(\hat\tau - \tau) \xrightarrow{d} N(0, V)\),其中 \(V = V_1 + V_0\),表达式见 (1)。证明的关键是写出影响函数并验证协方差为零(因为 \(w_1 w_0 = 0\) a.s.)。
- Theorem 2(二元结局方差):在 logistic 结局模型下,\(V_0\) 由 (4) 给出,其中参数 \((a,b)\) 通过 (5)(6) 由 \((\theta_0, \rho)\) 确定。需要数值积分。
- Theorem 3(连续结局方差):在同方差线性模型下,\(V_0\) 由 (8) 给出,其中 \(\kappa\) 是导出量,表达式依赖于 \(\rho, \sigma_W^2, \sigma_{W,1}^2\)。
- 样本量公式:基于 Wald 检验,功率公式 (2) 可数值求解 \(n_{\text{RCT}}\)。模拟显示理论功率与经验功率高度一致(最大偏差 0.031),且使用估计的倾向得分时功率略高(因方差减小)。
证明路线与技术技巧¶
- 整体路线(以 Theorem 1 为例):
- 一致性:证明 \(\mathbb{E}[w_a] = \bar\pi_S\) 且 \(\mathbb{E}[w_a Y] = \bar\pi_S \theta_a\),由大数定律得 \(\hat\theta_a \xrightarrow{p} \theta_a\)。
- 渐近线性表示:将 \(\sqrt{n}(\hat\theta_a - \theta_a)\) 写为 \(\frac{1}{\bar\pi_S} \frac{1}{\sqrt{n}} \sum w_{a,i}(Y_i - \theta_a) + o_p(1)\),得到影响函数 \(\phi_a(O)\)。
- 方差计算:分别计算 \(\mathbb{V}[\phi_1]\) 和 \(\mathbb{V}[\phi_0]\)。对于 \(\phi_0\),利用条件二阶矩可运输性将条件方差简化为 \(M_0(X)\),再通过迭代期望得到 \(V_0\) 的积分形式。
- 协方差为零:因为 \(w_1 w_0 = 0\) a.s.,故 \(\text{Cov}(\phi_1, \phi_0)=0\)。
- CLT:由中心极限定理和 Slutsky 定理得渐近正态性。
- 关键跳跃点:将 \(V_0\) 表达为仅依赖于 \(\pi_S(X)\) 和 \(Y(0)\) 的条件二阶矩的期望,而非依赖于完整协变量分布。这依赖于条件二阶矩可运输性假设(Condition (ii)),使得 \(M_0(X)\) 在 RCT 和 EC 中相同。
- 技术技巧:
- Hájek 型 IPW 估计:使用归一化权重(分母为权重和),避免 Horvitz-Thompson 型的不稳定性。
- Bhattacharyya 系数:作为重叠度量,与 \(\bar\pi_S\) 一起确定 \(W\) 的分布参数 \((\mu_W, \sigma_W^2)\)。
- 数值校准:先用 Beta 分布近似获得初值,再直接数值优化使 \((\bar\pi_S, \phi)\) 匹配目标,改进 Liu et al. (2026a) 的近似方法。
- logit-normal 积分:方差公式中的期望通过数值积分(如高斯-埃尔米特求积)计算。
真实例子与应用¶
- 数据/场景:INJeCT-LUNG 随机 II 期试验,针对可切除的非小细胞肺癌,主要终点为 48 个月无事件生存(EFS)。计划使用 CheckMate 816 和 CheckMate 77T 的 EC。
- 方法应用:将 EFS 在 48 个月时二值化,设定常规参数(\(\theta_0=0.485, \tau=0.118, \bar\pi_A=0.75, \alpha=0.10, 1-\beta=0.80\))和 HCT 参数(\(n_{\text{EC}}=300, \phi=0.90, \rho=0.20\))。使用 R 包
hctdesign计算得最小 RCT 样本量 173,考虑 4 人随机化区组后推荐 176 人(132 实验组,44 对照组),理论功效 80.4%。 - 结果:敏感性分析(Table 6-7)显示,\(n_{\text{EC}}\) 从 0 增至 300 时所需 RCT 样本量从 428 降至 176;\(\phi\) 从 1 降至 0.80 时样本量从 140 增至 220;\(\rho\) 的影响较小(0-0.30 范围内最多差 1 人)。
- 这个例子想说明:验证了框架在实际试验设计中的可用性,并展示了各参数对样本量的影响,特别是重叠系数 \(\phi\) 的敏感性。
🔎 结论是否比证明窄¶
- Theorem 1 的条件 (ii) 要求条件二阶矩可运输性,但作者在 Remark 3 中承认,若放松此条件,\(V_0\) 将依赖数据源特定的条件二阶矩,需额外参数。因此,论文的简洁方差公式仅在条件 (ii) 下严格成立,但作者声称“the same general variance calculation remains applicable”略显宽泛。
- 功率公式基于 oracle 倾向得分,但模拟显示用估计的倾向得分时方差更小、功效略高。作者在 Remark 1 中承认可考虑估计的方差修正,但未在公式中体现。因此,公式给出的功率是保守的(低估实际功率),这在设计阶段是可接受的,但需注意。
- 小样本警告:Remark 5 指出当 \(n_{\text{RCT}}\) 较小时正态近似可能不准确,建议模拟验证。因此,公式的适用性在极小样本下未严格证明,仅给出启发式建议(t 分布临界值或方差膨胀因子)。
四、开放问题¶
- 考虑倾向得分估计的方差修正:本文使用 oracle 倾向得分推导方差,但 Remark 1 指出估计倾向得分可降低渐近方差。如何将估计的影响函数修正纳入设计阶段的样本量公式,同时保持参数化简洁性?扎根于 Remark 1 和模拟结果(估计 PS 时方差更小)。
- 扩展到更高效估计量(AIPW、TMLE):Remark 2 指出这些估计量可能提供更大功效,但需要额外结果模型信息。能否为 AIPW 设计类似的“5+3”参数化,使得在计划阶段仅需少量额外输入(如结果模型的 \(R^2\))?扎根于 Remark 2 和 Discussion 第四点。
- 删失时间-事件结局:当前框架不直接处理删失,而真实应用(INJeCT-LUNG)使用生存伪值。Discussion 第五点明确将此列为未来工作。如何将方差公式扩展到 Cox 模型或 RMST 差异,并引入类似的重叠/相关系数?扎根于 Discussion 第五点及引用 Yang et al. (2026)。
- 结合期中数据自适应调整:Discussion 第三点建议将前瞻性计算与期中盲态样本量重估计结合。如何将本文的 5+3 参数化嵌入自适应设计,使得在期中根据观测数据更新 \(\phi\) 和 \(\rho\) 的估计?扎根于 Discussion 第三点及引用 Guo et al. (2024); Kojima et al. (2026)。
Maintained by 陈星宇 · Homepage · Source on GitHub