Causal mediation analysis for stochastic interventions¶
作者: Iván Díaz, Nima Hejazi
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/1901.02776
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是因果中介分析,其根本的科学问题是:将一个总因果效应(如处理对结局的平均效应)分解为“通过某个中介变量传递的间接效应”和“不通过该中介变量的直接效应”,从而揭示处理发挥作用的机制。该方向当前已从早期的线性结构方程模型发展到非参数因果框架,但主流工作(如自然直接/间接效应)仍聚焦于二元处理变量和确定性干预(将处理设定为固定值)。本文试图将这一框架推广到随机干预(处理变量是随机变量)和连续/分类处理变量的设定下。
发展脉络(history)¶
-
奠基工作:因果推断的现代框架始于 Rubin (1974) 的潜在结果框架和 Pearl (1995, 2000) 的非参数结构方程模型与 do-calculus。Robins and Greenland (1992) 和 Pearl (2001) 首次在潜在结果框架下定义了自然直接效应和间接效应,将总效应分解为通过中介的路径和不通过中介的路径。这是中介分析的因果里程碑,但其识别依赖于“跨世界反事实独立性”假设(cross-world counterfactual independencies),即假设处理取不同值时的潜在结果与中介的潜在值独立。作者指出,这一假设“在随机化试验中不可识别”,因此“科学主张无法通过实验证伪”(Popper, 1934; Dawid, 2000; Robins and Richardson, 2010)。
-
主要进展——解决跨世界独立性问题的两条路线:为克服自然效应的识别困境,文献发展出两条路线:
- 路线一:部分识别(bounds)。Robins and Richardson (2010)、Tchetgen and Phiri (2014)、Miles et al. (2015) 等在不做跨世界独立性假设的情况下,推导直接效应的界(bounds)。这提供了保守但稳健的推断。
- 路线二:重新定义效应(interventional effects)。Petersen et al. (2006)、van der Laan and Petersen (2008)、Vansteelandt and VanderWeele (2012)、VanderWeele et al. (2014) 等提出了替代的直接/间接效应定义,统称为干预效应(interventional effects)。这些效应不依赖跨世界独立性,因此可以在随机化处理和中介的实验中识别。本文属于这条路线。
-
当前 Frontier——随机干预与连续处理:大多数中介分析工作仍假设处理是二元的且干预是确定性的。然而,许多实际应用(如连续的手术时间、体力活动量)需要处理连续变量,且“将所有人设定为同一值”的干预可能不现实或违反正性假设。为此,随机干预(stochastic interventions)的概念被引入,用于定义总效应。关键工作包括:
- Díaz and van der Laan (2012, 2018) 和 Haneuse and Rotnitzky (2013) 定义了修正处理策略(modified treatment policies) 的总效应,允许处理变量连续,干预是“将每个人的处理值减少δ”这类依赖于自然值的操作。
- Kennedy (2018a) 针对二元处理,提出了增量倾向性评分干预(incremental propensity score interventions),通过改变暴露的几率比来定义总效应,并给出了高效估计量。
- 这些工作没有处理效应的分解(直接/间接效应),这正是本文的切入点。
-
本文的位置:本文是上述两条线索的交叉点。它采用“干预效应”路线(避免跨世界独立性),但将其从确定性干预推广到随机干预(修正处理策略和指数倾斜),从而为连续/分类处理变量的中介分析提供了完整的识别、高效估计和推断框架。作者明确将本文定位为“随机干预总效应分解”的首次系统处理。
子线索聚类¶
- 子线索1:自然直接/间接效应的识别与估计。核心工作包括 Robins and Greenland (1992), Pearl (2001), Imai et al. (2010), Tchetgen Tchetgen (2013)。这些工作处理二元处理,依赖跨世界独立性假设,并发展了基于回归、加权或双重稳健的估计量。瓶颈在于跨世界假设的不可检验性和在连续处理下的不适用性。
- 子线索2:干预效应(interventional effects)。核心工作包括 Vansteelandt and VanderWeele (2012), VanderWeele et al. (2014), Lok (2016, 2019), Vansteelandt and Daniel (2017), Zheng and van der Laan (2017), Rudolph et al. (2017)。这些工作通过重新定义效应来避免跨世界独立性,但通常仍假设处理是二元的且干预是确定性的。瓶颈在于对连续处理缺乏统一的处理框架。
- 子线索3:随机干预的总效应。核心工作包括 Díaz and van der Laan (2012, 2018), Haneuse and Rotnitzky (2013), Kennedy (2018a)。这些工作定义了随机干预下的总效应,并发展了高效估计量,但没有进行效应分解。本文填补了子线索2和3之间的空白。
这个方向在追问的核心问题¶
- 如何定义和识别不依赖跨世界独立性的直接/间接效应? 这是“干预效应”路线的核心。
- 如何将中介分析从二元处理推广到连续/分类处理? 这是随机干预框架的核心优势。
- 如何在非参数或高维设定下高效估计这些效应,并构造有效的置信区间? 这需要半参数效率理论和数据自适应方法。
- 当存在受处理影响的中介-结局混杂时,效应是否仍可识别? 这是一个公认的难点,本文明确将其排除在范围之外。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口定位为“随机干预总效应的分解”。他们声称,现有工作要么处理了随机干预的总效应(Díaz and van der Laan, 2012; Kennedy, 2018a),要么处理了确定性干预的效应分解(interventional effects),但“没有一篇论文处理随机干预的效应分解”。因此,本文是“显然的下一步”。
- 哪些竞争路线被他淡化或回避了:
- 自然效应:作者明确指出了其跨世界独立性假设的不可检验性,并将其作为本文方法更优的主要论据。这并非淡化,而是正面攻击。
- 参数方法:作者批评了基于参数结构方程模型的方法(如 Baron and Kenny, 1986),认为其“施加了不可信的假设”。对于连续处理,他们指出参数中介方法(如 Vansteelandt et al., 2012)“通过施加不可检验且不可信的参数假设引入了不可量化的偏差”。这是对竞争路线的有力批评。
- 受处理影响的中介-结局混杂:作者明确声明“本文方法不能用于”这种情况,并将其列为未来工作。这是一个诚实的回避,但也是本文的主要局限性。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 从用户的研究兴趣看,本文与统计-计算权衡(statistical-computational tradeoff)没有直接关联。本文的估计量是多项式时间的(基于回归和交叉拟合),其计算复杂度主要取决于回归函数的估计,而非一个需要低度多项式屏障来刻画计算可行性的问题。因此,没有引用该领域的文献是合理的。不过,如果考虑多元中介情形,估计回归函数的计算成本(如树宽)可能成为一个有趣的问题,但这并非本文的重点。
张力¶
未见明显对立引用。文献中关于“自然效应”和“干预效应”的争论是清晰的,但并非矛盾,而是不同假设下的不同选择。本文明确选择了后者。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
A:暴露/处理变量(连续或分类)。Y:结局变量(连续或二元)。Z:中介变量(可以是多元的)。W:基线协变量(向量)。O = (W, A, Z, Y):一个观测单元的数据。P:O的分布。Pn:经验分布。g(a|w):倾向性得分,即给定W=w时A=a的条件密度/概率。m(a, z, w) = E[Y | A=a, Z=z, W=w]:结局回归函数。e(a|z, w):给定(Z, W)时A的条件密度。q(z|a, w):给定(A, W)时Z的条件密度。r(z|w):给定W时Z的边缘密度。g_δ(a|w):用户指定的随机干预后的暴露分布,由参数δ索引。g_{δ=0} = g。A_δ:从g_δ中抽取的潜在暴露变量。Y(a, z):将(A, Z)设定为(a, z)时的潜在结局。Z(a):将A设定为a时的潜在中介。θ(δ) = E[Y(A_δ, Z)]:核心目标参数,即干预暴露但不干预中介时的平均潜在结局。ψ(δ) = E[Y(A_δ)]:干预暴露后的总平均潜在结局。β(δ) = θ(δ) - E[Y]:直接效应(PIDE)。ψ(δ) - θ(δ):间接效应(PIIE)。
-
模型:
- 数据生成机制由非参数结构方程模型(NPSEM)描述:
W = f_W(U_W),A = f_A(W, U_A),Z = f_Z(W, A, U_Z),Y = f_Y(W, A, Z, U_Y)。这假定了变量间的时序关系,且U是外生误差。 - 统计模型
M是非参数模型,即所有在O上的连续分布。
- 数据生成机制由非参数结构方程模型(NPSEM)描述:
-
可观测数据:
- 可观测:
W, A, Z, Y。我们有n个i.i.d.样本(W_i, A_i, Z_i, Y_i)。 - 想要但观测不到:潜在结局
Y(a, z)和潜在中介Z(a)。所有因果效应都是这些反事实量的函数。识别需要假设(如A3)将这些反事实量与可观测数据的条件分布联系起来。
- 可观测:
第二步:讲最小内核¶
最简特例:二元暴露、单个二元中介、无协变量
假设A ∈ {0, 1},Z ∈ {0, 1},没有协变量W。我们想评估一个随机干预A_δ的效果,该干预将暴露的几率比乘以δ(即Kennedy的增量倾向性评分干预)。此时,g_δ(1) = δ * g(1) / (δ * g(1) + 1 - g(1))。
核心问题:将总效应ψ(δ) = E[Y(A_δ)] - E[Y]分解为直接效应和间接效应。
本文的核心思路:定义直接效应为β(δ) = E[Y(A_δ, Z)] - E[Y],即只改变暴露分布、不改变中介分布时的效应。间接效应为ψ(δ) - β(δ)。
在这个特例下,识别和估计退化成什么?
-
识别:根据定理1,
θ(δ) = E[Y(A_δ, Z)]被识别为:θ(δ) = Σ_{a∈{0,1}} Σ_{z∈{0,1}} m(a, z) * g_δ(a) * P(Z=z)其中m(a, z) = E[Y | A=a, Z=z]。注意,这里不需要W,且识别公式不涉及跨世界反事实。它只依赖于可观测数据的条件均值m、干预分布g_δ和中介的边缘分布P(Z)。 -
估计:一个简单的替代估计量是:
θ_sub(δ) = Σ_{a∈{0,1}} Σ_{z∈{0,1}} m_hat(a, z) * g_δ(a) * (1/n) Σ_i I(Z_i = z)其中m_hat是m的估计(例如,通过逻辑回归)。 -
为什么这个例子是“最小内核”:
- 它剥离了所有协变量
W,使识别和估计公式变得极其透明。 - 它展示了本文的核心贡献:通过随机干预
g_δ来定义效应,使得直接效应β(δ)的识别只需要E[Y|A, Z]和P(Z),而不需要任何跨世界独立性假设。这与自然直接效应形成鲜明对比,后者需要Y(a, Z(a*))这类跨世界量。 - 在这个特例下,
θ(δ)的EIF(定理2和推论1)会大大简化,其核心结构——一个关于Y的“伪残差”项和一个关于A的“协变量平衡”项——仍然保留,但计算变得非常直观。
- 它剥离了所有协变量
因此,即使不读全文,读者也能抓住本文的核心数学思想:用随机干预替换确定性干预,从而在更弱的假设下定义和识别直接/间接效应。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了在随机干预(stochastic interventions)框架下,如何将总因果效应分解为直接效应和间接效应,从而为连续/分类处理变量的中介分析提供了一套完整的识别、估计和推断理论。
- 核心工具/方法:核心工具是半参数效率理论,特别是高效影响函数(EIF)。基于EIF,作者构建了一个一步估计量(one-step estimator),并采用交叉拟合(cross-fitting) 来放松对初始估计量的熵条件要求,允许使用数据自适应的机器学习方法。
- 主要结论:在无受处理影响的中介-结局混杂假设下,随机干预下的直接/间接效应可以在比自然效应更弱的假设下被识别(无需跨世界独立性)。作者提出的高效估计量在回归函数达到
n^{1/4}-一致率时是n^{1/2}-一致且渐近线性的,并给出了基于乘子自助法(multiplier bootstrap)的均匀置信带和假设检验方法。
关键设定与假设¶
- 设定:非参数统计模型
M,数据由NPSEM (1) 生成。处理变量A可以是连续或分类的。中介Z可以是多元的。明确排除了受处理影响的中介-结局混杂(如图2所示)。 - 关键假设:
- A1 (分段光滑可逆性):仅对修正处理策略(如例1)需要,确保可以通过变量变换公式计算
g_δ。 - A2 (共同支撑):
supp{g_δ(·|w)} ⊆ supp{g(·|w)}。这是随机干预的标准假设,确保干预在数据支持的范围内。对于例1和例2的干预,该假设自动满足。 - A3 (条件可交换性):
E[Y(a, z) | A, W, Z] = E[Y(a, z) | W, Z]。这是本文的核心识别假设。它比自然效应所需的Y(a, z) ⟂⟂ (A, Z) | W更弱,因为它只要求给定(W, Z)后,A与Y(a, z)条件独立,而不要求Z与Y(a, z)独立。作者指出,这一假设在随机化暴露和中介的实验中自动满足。 - 相比已有文献:相比自然效应(Pearl, 2001),本文的A3放宽了跨世界独立性假设。相比干预效应(Vansteelandt and VanderWeele, 2012),本文的A3与之类似,但本文的效应定义基于随机干预,因此适用于连续处理。
- A1 (分段光滑可逆性):仅对修正处理策略(如例1)需要,确保可以通过变量变换公式计算
主要结果¶
- 定理1 (识别):在A2和A3下,
θ(δ) = E[Y(A_δ, Z)]被识别为∫ m(a, z, w) g_δ(a|w) p(z, w) dν(a, z, w)。这个公式是后续所有估计量的基础。 - 定理2 (EIF):给出了
θ(δ)在非参数模型中的高效影响函数D_{η,δ},它由三部分组成:D^Y(与Y相关)、D^A(与A相关)、D^{Z,W}(与Z,W相关)。D^A的具体形式依赖于随机干预的类型(修正处理策略或指数倾斜),分别在引理1和引理2中给出。 - 引理1 & 2 (EIF的具体形式):关键技巧是引入了一个辅助参数
φ(a, w),它通过一个顺序回归(sequential regression)来定义,从而避免了直接估计可能高维的中介密度r(z|w)。例如,对于指数倾斜,φ(a, w) = E[ g(A|W)/e(A|Z,W) * m(A, Z, W) | A=a, W=w]。 - 定理3 (点态弱收敛):对于修正处理策略,在
n^{1/4}-一致率条件(条件(i))下,一步估计量θ_hat(δ)是n^{1/2}-一致且渐近正态的,方差达到半参数效率界。 - 定理4 (均匀弱收敛):对于指数倾斜干预,在额外假设下,
θ_hat(δ)作为δ的函数弱收敛到一个高斯过程。这为构造均匀置信带和检验“无直接效应”的零假设提供了理论基础。
证明路线与技术技巧¶
-
整体路线:
- 推导EIF:通过计算非参数最大似然估计量(NPMLE)的影响函数来获得EIF。这是一个标准但繁琐的代数过程。
- 构建一步估计量:基于EIF,构造
θ_hat(δ) = P_n D_{η_hat, δ}。由于D_{η, δ}是θ(δ)的EIF,P_n D_{η, δ}是θ(δ)的一阶渐近等价表示。 - 交叉拟合:将数据分成
J折,用第j折外的数据训练η_hat_j,然后用第j折内的数据计算D_{η_hat_j, δ}。这避免了Donsker条件,允许使用复杂的机器学习方法。 - 分析渐近偏差:将
θ_hat(δ) - θ(δ)分解为经验过程项G_n D_{η, δ}和二阶偏差项R_n。核心工作是证明R_n = o_P(n^{-1/2})。 - 控制二阶偏差:通过定理5和6(在附录中)给出的二阶表示,证明
R_n可以被||m_hat - m|| * (||g_hat - g|| + ||e_hat - e||) + ||g_hat - g|| * ||φ_hat - φ||等乘积项控制。因此,只要每个回归函数以n^{1/4}速率收敛,其乘积就是o_P(n^{-1/2})。 - 建立弱收敛:经验过程项
G_n D_{η, δ}依分布收敛到高斯过程。结合R_n = o_P(1),得到θ_hat(δ)的渐近分布。
-
关键跳跃点:
- 参数化
e = gq/r:这是本文的一个关键技巧。它允许将EIF中涉及q和r的项(如D^{Z,W})重写为只依赖于e和g的项,从而避免了直接估计高维中介密度r(z|w)。这个技巧在Zheng and van der Laan (2012) 中也有使用。 - 引入辅助参数
φ:通过将D^A中的积分重写为一个条件期望φ,将估计问题从密度估计转化为回归问题。这是另一个避免维度诅咒的关键。 - 交叉拟合的使用:这是现代半参数估计的标准技巧,但本文明确将其用于随机干预的中介分析,并给出了完整的理论证明。
- 参数化
-
技术技巧点名:
- 高效影响函数 (EIF):核心工具,用于构造高效估计量和分析渐近性质。
- 交叉拟合 (Cross-fitting):用于放松熵条件,允许使用数据自适应方法。
- 乘子自助法 (Multiplier Bootstrap):用于构造均匀置信带和进行假设检验,避免了重新估计
η的计算负担。 - 顺序回归 (Sequential Regression):通过
φ的定义,将高维积分问题转化为回归问题。 - 二阶偏差分析 (Second-order Bias Analysis):通过定理5和6,将偏差表示为回归误差的乘积,从而导出
n^{1/4}-一致率条件。
真实例子与应用¶
- 数据:来自
mmaR包的观察性研究数据,包含691名儿童,研究参与运动队对BMI的影响。 - 变量:
A:是否参与运动队(二元)。Y:BMI。Z:三个中介变量:运动习惯、零食摄入、超重状态。W:其他所有收集到的协变量(作为潜在混杂)。
- 方法应用:
- 采用增量倾向性评分干预,
δ=2,即干预使参与运动队的几率翻倍。 - 使用
medshiftR包估计θ(δ)(直接效应部分),使用npcausalR包估计ψ(δ)(总效应部分)。 - 使用Super Learner集成多种机器学习算法(xgboost, random forest, lasso, HAL等)来估计所有回归函数。
- 采用增量倾向性评分干预,
- 结果:
- 直接效应估计为0.011(95% CI: -0.458, 0.479)。
- 间接效应估计为-0.157(95% CI: -0.672, 0.357)。
- 结论:基于该数据,无法得出“将参与运动队的几率翻倍”对儿童BMI有显著直接或间接影响的结论。但效应的方向与预期一致(间接效应为负,即通过改变行为降低BMI)。
- 这个例子想说明什么:展示了本文方法在真实数据上的完整应用流程,包括效应分解、使用数据自适应方法估计回归函数、以及基于EIF的推断。它验证了方法的实用性,尽管结果不显著。
🔎 结论是否比证明窄¶
- 窄的结论:定理3和4的渐近线性性依赖于
n^{1/4}-一致率条件。作者在模拟中使用了高度自适应LASSO(HAL),该估计器被证明可以达到这个速率。但作者并未证明所有在Super Learner库中的算法(如xgboost)都能达到n^{1/4}速率。因此,在实际应用中,该条件可能不成立,导致推断不准确。作者在讨论中提到了这一点,并建议使用TMLE作为替代。 - 泛化的claim:作者声称方法“允许多元中介”。然而,在多元中介下,间接效应的解释变得复杂。作者在讨论中承认“解释需要更加小心”,但并未提供任何理论或方法来分解多元中介的路径。因此,方法在“允许”多元中介上是成立的,但在“解释”多元中介上,结论比证明窄。
- 未证明的conjecture:作者在引理3和4中讨论了多重稳健性。对于修正处理策略,他们证明了在特定配置下的多重稳健性。但对于指数倾斜,他们只证明了
g必须被一致估计。这是一个明确的结论,而非conjecture。
四、开放问题¶
- 受处理影响的中介-结局混杂:本文明确排除了这种情况。作者指出,点识别在此情况下“通常不可能”,部分识别是活跃研究领域(Robins and Richardson, 2010; Tchetgen and Phiri, 2014; Miles et al., 2015)。扎根于:Remark 2 和 Section 7。
- 暴露-中介交互:本文的效应定义和EIF推导是否允许暴露-中介交互?在
m(a, z, w)中,交互项是自然包含的。但EIF的推导和二阶偏差分析是否在交互存在时仍然成立?作者没有明确讨论。扎根于:m(a, z, w)的定义本身是灵活的,但理论分析未专门处理交互。 - 多元中介的路径分解:本文只给出了“联合”间接效应。如何将间接效应进一步分解为通过每个中介的路径特定效应?这在存在多个相关中介时是一个开放问题。扎根于:Section 7 的讨论。
- 与统计-计算权衡的联系:本文的
n^{1/4}-一致率条件是半参数估计的标准要求。一个有趣的问题是:是否存在某些数据生成机制,使得达到n^{1/4}速率在计算上是困难的(例如,需要指数级时间),从而在统计和计算之间产生一个权衡?这可以联系到用户对低度多项式屏障的兴趣。扎根于:定理3的条件(i)。
Maintained by 陈星宇 · Homepage · Source on GitHub