Power and sample size calculations for causal mediation analysis with a binary mediator in randomized trials¶
作者: Bosen Cui, Yuhong Yang, Fan Yang
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.30412
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在随机试验的设计阶段,如何为因果中介效应(自然间接效应 NIE 和自然直接效应 NDE)计算所需的样本量,使得试验有足够的统计功效来检测这些中介路径上的效应。 核心困难在于:即使治疗分配是随机的,中介变量并非随机分配,因此中介效应的精度不仅取决于总效应计算中的那些参数(如结局方差),还额外依赖于中介变量的条件分布、中介-结局关联强度以及协变量对两者的预测能力。当前该方向的成熟度较低——对于线性结构方程模型(LSEM)之外的中介设定(尤其是二值中介),几乎没有解析的样本量公式可用,主要依赖蒙特卡洛模拟。
发展脉络¶
-
奠基工作:线性结构方程模型(LSEM)框架下的间接效应检验
- Baron & Kenny [1986]:提出了经典的逐步回归法,将间接效应定义为系数乘积(
a*b)。这是中介分析的基石,但其 NIE 解释仅在无治疗-中介交互且结局为连续的线性模型下成立。 - MacKinnon et al. [2002], Fritz & MacKinnon [2007], Vittinghoff et al. [2009]:在 Baron & Kenny 框架下,提供了基于系数乘积的样本量推荐和表格。这些工作为线性模型下的设计提供了可操作的指导,但无法处理二值中介或非线性结局。
- Baron & Kenny [1986]:提出了经典的逐步回归法,将间接效应定义为系数乘积(
-
主要进展:因果中介分析框架的建立与识别
- Imai et al. [2010a,b]:提出了基于潜在结果的因果中介分析统一框架,明确了 NIE 和 NDE 的非参数定义,并给出了关键的序贯可忽略性(sequential ignorability) 识别假设。这为超越 LSEM 的估计方法(如加权法、回归法)奠定了理论基础。作者引用它们来设定识别假设。
- Tchetgen & Shpitser [2012]:发展了半参数理论,给出了 NIE 和 NDE 的有效影响函数(efficient influence function),并提出了倍差稳健(doubly robust)估计量。作者指出,这类基于结果模型的估计量在设计阶段需要难以获取的先验信息,因此本文选择基于 RMPW 估计量。
-
当前 Frontier:超越 LSEM 的样本量方法
- Thoemmes et al. [2010], Schoemann et al. [2017], Qin [2024]:提出了基于蒙特卡洛模拟的通用功效分析方法。这些方法非常灵活,可以处理复杂的中介模型(如多重中介、纵向中介),但需要指定完整的数据生成机制,这在设计阶段往往信息不足。作者指出,模拟本身对“哪些设计阶段的汇总统计量是充分的”几乎没有指导。
- Kelcey et al. [2017]:在群组随机试验中,为间接效应提供了允许治疗-中介交互的闭式功效计算公式。但该方法局限于连续中介和结局的线性混合效应模型,不覆盖二值中介。
- Shook-Sa & Hudgens [2022], Liu et al. [2026]:为 ATE 的逆概率加权(IPW)估计量开发了解析的样本量公式,通过设计效应(design effect)或方差分解来量化加权对精度的影响。本文的工作直接借鉴了这种思路,但将其从 ATE 扩展到了中介分析中的 RMPW 估计量。
-
本文的位置:本文填补了二值中介在随机试验中 NIE 和 NDE 的解析样本量公式这一空白。它不依赖于完整的联合分布模拟,而是通过将 RMPW 估计量的方差分解为少量可解释的设计参数(如中介概率、中介异质性、路径强度等)的函数,为设计阶段提供了可操作的工具。
子线索聚类¶
- 线性模型与系数乘积法:Baron & Kenny [1986], MacKinnon et al. [2002], Fritz & MacKinnon [2007], Vittinghoff et al. [2009], Kelcey et al. [2017]。这些工作假设连续中介和/或结局,使用线性回归,间接效应为系数乘积。优点是公式简单,缺点是假设强,无法处理二值变量和非线性。
- 因果中介分析框架与半参数方法:Imai et al. [2010a,b], Tchetgen & Shpitser [2012], Hong et al. [2015], Bein et al. [2018]。这些工作建立了基于潜在结果的识别框架,并提出了加权(RMPW)或倍差稳健估计量。优点是模型假设更弱,适用于各种变量类型。缺点是设计阶段的方差计算复杂。
- 基于模拟的通用功效分析:Thoemmes et al. [2010], Schoemann et al. [2017], Qin [2024]。优点是极其灵活,适用于任何模型。缺点是设计阶段需要指定完整的联合分布,且对哪些参数是关键的缺乏指导。
- ATE 的解析样本量公式(加权估计量):Shook-Sa & Hudgens [2022], Liu et al. [2026]。这些工作为 IPW 估计量提供了解析公式,是本文最直接的方法论前身。本文将其核心思想(方差分解为可解释分量)从 ATE 迁移到了中介分析。
这个方向在追问的核心问题¶
- 识别问题:在何种假设下,NIE 和 NDE 可以从观测数据中非参数地识别?序贯可忽略性是否合理?如何放松它?
- 估计问题:如何高效、稳健地估计 NIE 和 NDE?RMPW、回归、倍差稳健估计量各有什么优缺点?
- 设计问题(本文核心):在设计一个随机试验时,如何为中介效应(而非总效应)计算样本量?需要哪些设计阶段的输入参数?这些参数如何从预试验数据或专家知识中获取?
- 功效与敏感性:中介效应的功效对哪些参数(如中介-结局关联强度、中介概率重叠度)最敏感?当这些参数被误设时,样本量计算有多稳健?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将现有方法的缺口 frame 为“要么局限于线性模型,要么需要完整的联合分布模拟”。他们声称,本文的解析公式通过“将方差分解为少量可解释的设计参数”解决了这个问题,使得设计阶段只需指定“中介概率、中介异质性、结局方差、路径强度”等几个直观的输入。
- 哪些竞争路线被他淡化或回避了:
- Tchetgen & Shpitser [2012] 的倍差稳健估计量:作者明确说它需要“难以获取的结局模型参数先验信息”,因此回避了。但倍差稳健估计量在效率上可能优于 RMPW,且对结果模型误设更稳健。作者没有讨论如果设计阶段能获取这些先验信息,倍差稳健估计量是否会提供更小的样本量。
- 基于回归的估计量:作者在补充材料(Section S6)中为连续中介的回归估计量提供了公式,但在正文中完全聚焦于 RMPW。对于二值中介,基于回归的估计量(如 Imai et al. 的算法)也是可行的,作者没有讨论其设计阶段方差的计算难度。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:作者没有引用关于敏感性分析的文献(如 Imai et al. [2010b] 中的敏感性分析部分,或 VanderWeele 的工作)。对于一个设计阶段的工具,了解功效对未测量混杂的敏感性是至关重要的。本文的公式完全依赖于序贯可忽略性假设,但没有讨论如果该假设被违反,所需的样本量会如何变化。
张力¶
未见明显对立引用。所有被引工作基本沿着“从线性到非线性、从模拟到解析”的路径演进,彼此之间没有根本性的矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
N: 样本量。i: 个体索引。X: 基线协变量向量(p维)。A ∈ {0, 1}: 随机分配的治疗。M ∈ {0, 1}: 二值中介变量。Y ∈ R: 结局(连续或二值)。M(a): 当治疗被设为a时的潜在中介值。Y(a, m): 当治疗被设为a且中介被设为m时的潜在结局。θ(a, a') = E[Y(a, M(a'))]: 中介功能函数,表示将治疗设为a、中介分布设为a'时的平均结局。δ(a) = θ(a, 1) - θ(a, 0): 自然间接效应(NIE),固定治疗为a,改变中介分布。ζ(a) = θ(1, a) - θ(0, a): 自然直接效应(NDE),固定中介分布为a,改变治疗。π_a = P(A = a): 治疗分配概率。p_a(X) = P(M = 1 | A = a, X): 在给定治疗和协变量下,中介为 1 的条件概率。R_{a,a'}(M, X) = p_{a'}(X)^M * (1-p_{a'}(X))^{1-M} / (p_a(X)^M * (1-p_a(X))^{1-M}): 中介概率比(RMPW 权重)。
- 模型:
- 数据生成机制:
(X, A, M, Y)是独立同分布的。A是随机分配的,M和Y的分布由A和X决定。 - 识别假设(Assumption 1):
{Y(a', m), M(a)} ⊥ A(由随机化保证)。Y(a, m) ⊥ M(a') | A = a', X(序贯可忽略性:给定X,中介-结局无未测量混杂)。0 < p_a(X) < 1(积极性:在每个协变量水平下,中介的两个水平都可能出现)。
- 目标:估计
δ(a)和ζ(a)。
- 数据生成机制:
- 可观测数据:研究者能观测到
(X_i, A_i, M_i, Y_i)。- 可观测:
X(基线协变量),A(治疗分配),M(实际中介值),Y(实际结局)。 - 想要但观测不到:
M(1-a)(如果个体接受的治疗是a,则观测不到其在另一种治疗下的中介值),Y(a, 1-m)(如果个体接受的治疗是a且中介是m,则观测不到其在另一种中介值下的结局)。这些潜在变量是定义因果效应的基础,需要通过假设和估计方法从可观测数据中识别。
- 可观测:
第二步:讲最小内核¶
本文的核心思路是:将 RMPW 估计量的渐近方差分解为几个可解释的分量,然后在一个简化的“工作模型”(working model)下,将这些分量表达为少量设计参数的函数。
最简特例:考虑一个连续结局,且无治疗-中介交互(即 γ_0 = γ_1 = γ)的随机试验。在这个特例下,NIE 简化为 δ(a) = γ * (q_1 - q_0),其中 q_a = E[M(a)] 是治疗组 a 的中介概率均值。
核心数学问题:如何计算 RMPW 估计量 \hat{δ}(a) = \hat{θ}(a, 1) - \hat{θ}(a, 0) 的方差 V_δ(a)?
关键想法:
1. 方差分解:V_δ(a) 可以分解为(公式 5):
V_δ(a) = (1/π_a) * [d_{a,1}B_{a,1} + C_{a,1} + d_{a,0}B_{a,0} + C_{a,0} - 2K_a]
其中:
* d_{a,a'}:中介概率比的二阶矩,衡量了中介分布在不同治疗组之间的重叠度。如果两组中介概率差异很大,d 就大。
* B_{a,a'}:结局围绕 θ(a, a') 的二阶矩,主要取决于结局方差。
* C_{a,a'}:中介概率比与结局方差的协方差,捕捉了加权过程如何改变结局的变异性。
* K_a:两个加权均值估计量之间的协方差(因为它们共享同一组 A=a 的样本)。
-
工作模型下的简化:为了在设计阶段计算这些分量,作者引入了一个工作模型:
- 中介模型:
M(a) = I{ f_M(X) + aΔ_M + ε_M > 0 },其中ε_M ~ N(0,1)。这定义了一个潜变量W = f_M(X)。 - 结局模型:
Y(a, m) = f_a(X) + γ_a * m + ε_a,其中E[ε_a | X, M(a)] = 0。 - 关键近似:假设潜变量
W近似服从正态分布N(μ_W, σ²_W)。这个近似使得复杂的多维积分简化为关于W的一维高斯积分。
- 中介模型:
-
设计参数:在这个工作模型下,所有方差分量都可以由以下少量、可解释的设计参数决定:
q_0, q_1: 两组的边际中介概率。R²_M: 潜变量W的方差占总潜变量(W + ε_M)方差的比例,衡量了协变量对中介的预测能力(中介异质性)。S²_a: 治疗组a的边际结局方差。κ_a: 结局Y与潜变量W的相关性,衡量了协变量对结局的预测能力。δ(a): 目标 NIE 效应量,用于校准路径系数γ_a。
结论:在这个最简特例下,本文的核心贡献是证明了:只要指定了 (q_0, q_1, R²_M, S²_a, κ_a, δ(a)) 这六个参数,就可以通过一维数值积分计算出 V_δ(a),进而通过 Wald 公式(公式 6)得到所需的样本量 N。 这完全绕开了指定完整的联合分布 (X, M, Y) 的复杂模拟过程。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在随机试验中,针对二值中介变量和连续或二值结局,为自然间接效应(NIE)和自然直接效应(NDE)开发了解析的功效与样本量计算公式。
- 核心工具/方法:基于比率-中介-概率加权(RMPW)估计量的oracle 方差分解,并结合一个probit 潜指数中介模型和一个工作结局模型,将方差分量表达为少量可解释的设计参数的函数。
- 主要结论:模拟研究表明,该解析公式计算出的样本量与基于完整模拟的基准样本量高度吻合,能够达到目标功效,且 I 类错误接近名义水平。ACTG175 实例展示了如何利用预试验数据校准输入参数。
关键设定与假设¶
- 设定:随机试验,
N个独立同分布的样本,观测数据为O = (X, A, M, Y)。治疗A随机分配,中介M为二值,结局Y为连续或二值。 - 核心假设(Assumption 1):
- 序贯可忽略性(Sequential Ignorability):
Y(a', m) ⊥ M(a') | A = a', X。这是因果中介分析中最关键的假设,意味着给定基线协变量X,中介-结局之间没有未测量的混杂。相比 Imai et al. [2010a,b] 的原始假设,本文没有额外要求Y(a, m) ⊥ M(a') | X(即跨治疗组的无混杂),而是使用了更弱的条件版本。 - 积极性(Positivity):
0 < p_a(X) < 1,确保每个协变量水平下,中介的两个水平都有可能发生。
- 序贯可忽略性(Sequential Ignorability):
- 工作模型假设(用于设计阶段计算,非识别所需):
- 中介模型:
M(a) = I{ f_M(X) + aΔ_M + ε_M > 0 },ε_M ~ N(0,1)。这是一个 probit 模型。 - 潜变量正态近似:
W = f_M(X)近似服从正态分布。作者通过一个 Lyapunov 条件(Lemma S1)来证明当f_M(X)是许多独立协变量的线性组合且没有主导项时,该近似是合理的。 - 结局模型(连续):
Y(a, m) = f_a(X) + γ_a * m + ε_a,E[ε_a | X, M(a)] = 0,且同方差。进一步假设f_a(X)与W联合正态。 - 结局模型(二值):
Y(a, m) = I{ f*_a(X) + γ*_a(m - q_a) + ε*_a > 0 },ε*_a ~ N(0,1)。这是一个 probit 模型。
- 中介模型:
- 相比已有文献的放宽/强化:
- 放宽:相比 Baron & Kenny 的线性模型,本文允许二值中介和非线性结局(通过 probit 模型)。
- 强化:相比基于模拟的方法,本文引入了工作模型和正态近似,这本质上是一种参数化近似。如果工作模型严重误设,解析公式的精度会下降。作者通过混合协变量设计(非高斯)的模拟来检验这种近似,结果显示依然良好。
主要结果¶
- 定理/公式:
- RMPW 估计量的 Oracle 方差(Proposition 1):给出了
\hat{θ}(a, a')的渐近方差公式V_θ(a, a')。 - 方差分解(公式 2, 3, 5):将
V_θ、V_ζ和V_δ分解为d_{a,a'}(比率二阶矩)、B_{a,a'}(结局二阶矩)、C_{a,a'}(比率-结局协方差)和K_a(共享臂协方差)等分量。 - 设计阶段方差公式(Table 1 & 2):在 probit 工作模型下,将所有方差分量表达为设计参数
(q_0, q_1, R²_M, S²_a, κ_a, δ(a))的函数。这是本文的核心技术贡献。 - 样本量公式(公式 6):
N ≈ (z_{1-α} + z_{1-β})² * V_{τ*} / τ*²,其中τ*是目标效应量,V_{τ*}是相应的设计阶段方差。
- RMPW 估计量的 Oracle 方差(Proposition 1):给出了
- 模拟验证:
- 校准度:在连续和二值结局下,解析样本量
N与模拟基准N_sim的比值平均接近 1(连续:0.997;二值:1.019),经验功效接近 80%。 - 稳健性:在非高斯协变量(混合设计)下,结果同样良好。当使用估计的中介概率比(而非 oracle 值)时,功效和 I 类错误控制依然稳健。
- 与 ATE 规划的对比(Table S11):展示了以 ATE 为目标规划的试验,其中介效应的功效可能严重不足(低至 0.199)或过度(高达 1.000),强调了为中介效应专门规划样本量的必要性。
- 校准度:在连续和二值结局下,解析样本量
- 真实例子(ACTG175):
- 数据:ACTG175 试验,比较齐多夫定单药与其他抗逆转录病毒疗法。
- 场景:中介是早期免疫应答(CD4 细胞计数增加 ≥ 50),结局是 96 周内无事件生存。
- 方法:使用预试验数据(1941 名参与者)校准设计参数
(q_0, q_1, R²_M, κ_a, δ(a)),然后计算所需样本量。 - 结果:对于 NIE
δ(1)和δ(0),尽管效应量相似(0.029 vs 0.033),但所需样本量差异巨大(174 vs 705),这主要是因为它们的方差不同。这直观地展示了本文公式的价值:它能揭示不同效应在精度上的差异。 - 敏感性分析(Figure 1):展示了样本量对中介-结局路径强度
γ最为敏感,对治疗分配比例π_1的敏感性因效应而异。
证明路线与技术技巧¶
- 整体路线:
- 建立 Oracle 方差:从 RMPW 估计量的定义出发,通过一阶泰勒展开得到其影响函数,进而得到渐近方差
V_θ(a, a')(Proposition 1)。 - 方差分解:将
V_θ分解为d,B,C三个分量(公式 2)。然后,利用 NIE 和 NDE 估计量的线性组合性质,得到V_ζ和V_δ的分解(公式 3, 5)。对于V_δ,关键一步是识别出共享臂协方差项K_a并证明其非负性(Section S1.1)。 - 引入工作模型:为了在设计阶段计算
d,B,C,K,引入 probit 中介模型和线性/probit 结局模型。 - 参数化与近似:
- 通过潜变量
W的正态近似,将复杂的多维期望转化为关于W的一维高斯积分。 - 将设计参数
(q_0, q_1, R²_M)与潜变量参数(μ_W, σ²_W, Δ_M)建立联系(公式 7)。 - 通过引入
κ_a(结局-W相关性),将结局模型中的f_a(X)与W的关联参数化,从而确定C_{a,a'}和K_a。
- 通过潜变量
- 得到闭式/数值解:最终,所有方差分量都可以通过一维数值积分(高斯求积)计算,从而得到
V_{τ*}和N。
- 建立 Oracle 方差:从 RMPW 估计量的定义出发,通过一阶泰勒展开得到其影响函数,进而得到渐近方差
- 关键跳跃点:
- 从
V_θ到V_δ的分解:V_δ不能简单相加,因为\hat{θ}(a, 1)和\hat{θ}(a, 0)来自同一组样本。作者识别并处理了它们之间的协方差K_a,这是推导V_δ的关键。 C_{a,a'}和K_a的参数化:这两个分量涉及权重和结局的联合行为,直接指定非常困难。作者通过引入κ_a(结局-W相关性)和γ_a(路径系数),在工作模型下成功地将它们表达为可计算的一维积分。这是本文最核心的技术技巧。
- 从
- 技术技巧点名:
- 影响函数(Influence Function):用于推导 RMPW 估计量的渐近方差(Proposition 1)。
- 方差分解:将复杂的方差拆解为具有统计意义的子分量(
d,B,C,K)。 - 潜变量模型(Latent Variable Model):使用 probit 模型处理二值中介,并引入潜变量
W来简化协变量结构。 - Lyapunov 中心极限定理(Lemma S1):为潜变量
W的正态近似提供了理论依据。 - Stein 引理(Stein's Identity):用于计算
ξ_a = Cov(M(a), W)(Section S1.3)。 - 一维数值积分(Gaussian Quadrature):用于计算
d_{a,a'}、C_{a,a'}等期望值,避免了高维积分。
🔎 结论是否比证明窄¶
- 窄的方面:
- 本文的解析公式严格依赖于工作模型(probit 中介 + 线性/probit 结局 + 潜变量正态近似)。作者在模拟中检验了非高斯协变量下的表现,但并未证明公式对所有偏离工作模型的情况都稳健。结论中“the analytic calculations are well calibrated”应理解为“在模拟所覆盖的设定下”,而非一个普遍成立的定理。
- 公式基于 oracle 方差,即假设中介概率比
R_{a,a'}是已知的。作者通过模拟检验了估计R_{a,a'}后的表现,但并未给出理论证明(如“估计R_{a,a'}对V_δ的影响是二阶小量”)。结论中“similar empirical power under oracle and estimated mediator probability ratios”是一个模拟观察,而非理论保证。 - 对于二值结局,NDE 的目标值
ζ(a)不是自由输入,而是由θ(1,1), θ(0,0), δ(0), δ(1)隐含决定的(Section 4.2)。这意味着设计者不能独立地指定 NDE 的效应量,这在某些应用场景下可能是一个限制。
四、开放问题¶
-
扩展到其他因果中介估计量:本文聚焦于 RMPW 估计量。作者在结论中提到“Future work could extend the design calculations to alternative causal mediation estimands, such as interventional effects”。一个具体的问题是:如何为倍差稳健(doubly robust)估计量或基于回归的估计量(如 Imai et al. 的算法)开发类似的解析样本量公式? 这需要处理更复杂的方差结构,但可能提供更高效或更稳健的设计。扎根于:Conclusion 段落。
-
处理未测量混杂的敏感性分析:本文的公式完全依赖于序贯可忽略性假设。一个重要的开放问题是:如何将敏感性分析整合到样本量计算中? 例如,给定一个假设的未测量混杂强度,所需的样本量会增加多少?这可以为设计者提供关于假设稳健性的重要信息。扎根于:本文没有讨论敏感性分析,这是一个明显的空白。
-
扩展到多重或纵向中介:本文只处理了单个二值中介。作者在结论中提到“settings with multivalued or longitudinal mediators”。一个具体的问题是:对于多重中介(如多个生物标志物)或纵向中介(如随时间变化的治疗依从性),如何分解 RMPW 估计量的方差并找到可解释的设计参数? 这需要处理更复杂的权重结构和协方差矩阵。扎根于:Conclusion 段落。
-
工作模型误设下的理论保证:本文的公式依赖于工作模型和正态近似。一个理论性的开放问题是:能否给出解析公式在一般数据生成机制下的误差界? 例如,当潜变量
W严重偏离正态分布时,样本量计算的误差有多大?这需要更深入的高维或半参数理论分析。扎根于:作者在 Section 4 中承认了正态近似是一个“design-stage device”,并仅通过模拟验证了其稳健性,缺乏理论保证。
Maintained by 陈星宇 · Homepage · Source on GitHub