Quadruply robust methods for causal mediation analysis¶
讲者: Zhen Qi (Renmin University of China)
会场: Advances in Causal Inference and Machine Learning for Complex Data
报告题目: Quadruply Robust Methods for Causal Mediation Analysis
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
因果中介分析(causal mediation analysis)旨在将总效应分解为自然直接效应(NDE)和自然间接效应(NIE),后者通过中介变量M传递。核心统计挑战在于:目标参数θ = E[Y(1, M(0))]涉及一个跨世界反事实(cross-world counterfactual),它从未被观测到,只能通过可观测数据与一系列 nuisance 函数(倾向得分、条件密度比、条件均值等)来识别。该子方向当前成熟度较高,已有多种稳健估计框架(triply robust, odds-modeling triply robust),但在高维设定下,现有方法要么要求所有 nuisance 模型正确指定才能获得√N-推断,要么在误设时只能保证一致性。本文旨在扩大模型正确性场景,使得在更宽松的条件下仍能实现√N-一致性和渐近正态性。
发展脉络(history)¶
- 奠基工作:Tchetgen Tchetgen & Shpitser (2012) 推导了θ的有效影响函数(EIF),并提出了三重稳健(TR) 框架:若三个模型场景(Ma, Mb, Mc)中至少一个成立,则估计量一致。该工作奠定了半参数理论的基础。
- 主要进展:Zheng & Van Der Laan (2012)、Miles et al. (2019)、Farbmacher et al. (2022) 提出了odds-modeling三重稳健(O-TR) 方法,通过贝叶斯法则将条件密度比替换为逆因果概率的比值,避免了直接估计条件密度,从而将模型类从MTR扩大到MOTR。但O-TR需要建模逆因果概率p(S)=P(A=1|X,M),这通常比正向DGP更复杂。
- 高维扩展:Farbmacher et al. (2022)、Xu et al. (2022) 在双机器学习(DML)框架下将TR和O-TR扩展到高维,但仅在所有nuisance模型正确指定时才能获得√N-推断;否则只能保证一致性。完全基于模型的方法(如Huang & Pan 2016, Song et al. 2020)要求所有模型正确,误设会导致不一致。
- 本文位置:本文提出四重稳健(QR) 框架,在非参数建模下允许四种模型正确性场景(MQR = Ma ∪ M′_b ∪ M′′_c ∪ Md),严格包含MTR和MOTR;在参数建模下提出模型四重稳健(MQR),通过特殊损失函数实现Neyman正交性,即使在误设下也能达到√N-推断,且模型类MMQR = Ma ∪ M′_b ∪ M′′_c ∪ M′_d 仍比MTR和MOTR更广。
子线索聚类¶
- 三重稳健(TR)方法:依赖直接估计条件密度f1, f0,并通过积分(2.2)估计τ(X)。代表:Tchetgen Tchetgen & Shpitser (2012), Farbmacher et al. (2022), Xu et al. (2022)。难点:高维下密度估计困难,积分计算不稳定。
- Odds-modeling三重稳健(O-TR)方法:通过贝叶斯法则(2.3)避免密度估计,转而建模逆因果概率p(S)。代表:Zheng & Van Der Laan (2012), Miles et al. (2019), Farbmacher et al. (2022)。优点:避免积分;缺点:p(S)是诱导量,其复杂度由(π, q)决定,且当µ误设时τ的估计仍可能不一致。
- 高维中介分析:使用正则化参数模型估计nuisance,但现有方法在误设时只能一致性。代表:Farbmacher et al. (2022), Xu et al. (2022), 以及完全模型方法(Huang & Pan 2016, Song et al. 2020, Guo et al. 2022, Jiang & Colditz 2023)。本文的MQR属于此线索,但实现了更强的稳健性。
这个方向在追问的核心问题¶
- 核心问题1:如何在不观测跨世界反事实的情况下识别θ?——通过EIF(2.1)和多种nuisance函数。
- 核心问题2:如何扩大模型正确性场景,使得在更多误设情况下仍能获得√N-推断?——现有TR和O-TR只允许三种场景,本文试图增加到四种。
- 核心问题3:在高维设定下,当nuisance估计只能达到慢速时,如何实现√N-推断?——现有方法要求所有模型正确或只能一致性,本文通过Neyman正交性实现误设下的二阶偏差。
- 核心问题4:如何避免直接估计条件密度或逆因果概率?——O-TR通过贝叶斯法则,本文的QR通过DR表示(3.1)和QR表示(3.2)进一步减少对初始µ估计的依赖。
⚠️ 作者的framing¶
作者将缺口frame为:现有TR和O-TR方法在高维下要么要求所有nuisance模型正确(才能√N-推断),要么只能一致性;而本文通过引入新的QR表示和特殊损失函数,实现了在更广模型类下的√N-推断。作者淡化了O-TR方法在低维下的有效性,强调其在高维下的局限性。作者回避了Xia & Chan (2023)的QR框架——该框架依赖于treatment-induced confounders,而本文的QR不依赖。值得研究者去查的问题:Xia & Chan (2023)的QR是否真的与本文正交?是否还有其他未引用的“四重稳健”工作?另外,本文的MQR要求线性或广义线性模型,是否可以通过基扩展覆盖更广的DGP?这些在intro中未讨论。
张力¶
未见明显对立引用。所有被引工作基本一致认为:稳健性提升是值得追求的目标,且高维下需要更精细的偏差控制。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(Y \in \mathbb{R}\):结果变量。
- \(A \in \{0,1\}\):二元处理变量。
- \(X \in \mathbb{R}^{d_1}\):预处理协变量。
- \(M \in \mathbb{R}^{d_2}\):中介变量(位于A到Y的路径上)。
- \(S = (X^\top, M^\top)^\top \in \mathbb{R}^d\),\(d = d_1 + d_2\)。
- 潜在变量:\(M(a)\) 为处理A=a时的潜在中介;\(Y(a,m)\) 为处理A=a且中介设为m时的潜在结果。
- 目标参数:\(\theta = E[Y(1, M(0))]\)(即θ_{1,0})。
- 可观测数据:i.i.d.样本 \((Y_i, A_i, X_i, M_i)_{i=1}^N\)。
- 不可观测量:跨世界反事实 \(Y(1, M(0))\) 从未被观测到。
- 关键nuisance函数:
- \(\mu(S) = E[Y \mid A=1, S]\)(条件均值,在A=1组)。
- \(\tau(X) = E[Y(1, M(0)) \mid X]\)(跨世界条件均值)。
- \(\pi(X) = P(A=1 \mid X)\)(倾向得分)。
- \(f_a(S) = f(M \mid A=a, X)\)(条件密度)。
- \(q(S) = f_0(S) / f_1(S)\)(条件密度比)。
- \(\tau_n(X) = E[\mu(S) \mid A=0, X]\)(嵌套条件均值,基于µ)。
-
工作模型:用上标*表示,如\(\mu^*\)是µ的工作模型;正确指定指\(\mu^* = \mu\)。
-
模型:标准因果中介假设(Assumption 1):一致性、可忽略性(给定X,处理与潜在结果独立,且Y(1,m)与M(0),M(1)独立)、正性(π(X)和q(S)有界远离0和1)。数据生成机制如图1:X→A, X→M, A→M, X→Y, M→Y, A→Y。
-
可观测数据:研究者观测到(Y, A, X, M)。潜在变量M(0), M(1), Y(1,m)等不可观测。跨世界量Y(1, M(0))从未出现。识别θ需要借助可观测量的函数以及nuisance函数。
第二步:最小内核¶
最简特例:假设所有变量均为标量(d1=1, d2=1),且所有函数为线性。具体地: - \(X \sim N(0,1)\)。 - \(A \mid X \sim \text{Bernoulli}(\pi(X))\),其中\(\pi(X) = \text{logit}^{-1}(\alpha_0 + \alpha_1 X)\)(正确指定)。 - \(M \mid A, X \sim N(\beta_0 + \beta_1 A + \beta_2 X, 1)\),因此\(f_1(M|X) = \phi(M - (\beta_0+\beta_1+\beta_2 X))\),\(f_0(M|X) = \phi(M - (\beta_0+\beta_2 X))\),密度比\(q(S) = \exp(-\beta_1 M + \beta_1(\beta_0+\beta_2 X) + \beta_1^2/2)\)(指数形式)。 - \(Y \mid A=1, M, X \sim N(\gamma_0 + \gamma_1 M + \gamma_2 X, 1)\),因此\(\mu(S) = \gamma_0 + \gamma_1 M + \gamma_2 X\)(线性)。 - 目标:\(\theta = E[Y(1, M(0))]\)。在此线性高斯设定下,可解析计算:\(\theta = \gamma_0 + \gamma_1(\beta_0 + \beta_2 X) + \gamma_2 X\),但我们需要从观测数据估计。
核心困难:即使所有函数线性,直接回归Y on A, M, X只能得到E[Y|A=1, M, X] = µ(S),但无法得到E[Y(1, M(0))|X] = τ(X),因为M(0)的分布不同于给定A=1时的M分布。需要调整分布偏移。
本文的关键想法:使用两种策略的组合: 1. 嵌套回归:τ(X) = E[µ(S) | A=0, X](因为给定A=0时,M的分布就是M(0)的分布)。但若µ误设,此估计有偏。 2. 重要性加权:τ(X) = E[q(S) Y | A=1, X](因为q(S)将A=1组的分布调整到A=0组)。但若q误设,也有偏。
DR表示(Theorem 3.1):结合两者,得到τ(X) = τ_n(X) + E[q^(S) (Y - µ^(S)) | A=1, X]。只要µ^或q^之一正确,此表示就正确。这减少了对单一初始估计的依赖。
QR表示(Theorem 3.2):进一步,对于θ本身,作者构造了新的得分函数ϕ^(W)(式3.2),使得E[ϕ^(W)] = θ在四种场景下成立。这四种场景对称地涉及µ, π, q, (τ_n, τ)四个组件,每个组件恰好出现在两个场景中。这比TR(三种场景)和O-TR(三种场景)更广。
最小内核的数学本质:在给定X下,我们需要估计一个“跨世界”条件期望,它涉及两个不同处理水平下的分布。通过构造一个对多个nuisance函数具有“双稳健”甚至“四重稳健”的矩条件,使得只要至少一个子集正确,估计就无偏。这类似于处理效应估计中的双稳健,但扩展到更复杂的结构。
三、这篇论文做了什么¶
三句话¶
- 研究问题:在因果中介分析中,估计自然直接效应和间接效应所依赖的跨世界参数θ = E[Y(1, M(0))],并实现比现有三重稳健方法更广的模型正确性场景下的√N-推断。
- 核心工具/方法:提出了两种估计量——(a) QR估计量(Algorithm 1),基于新的DR表示(3.1)和QR得分(3.2),支持非参数nuisance估计;(b) MQR估计量(Algorithm 2),针对高维参数模型,通过六个特殊设计的损失函数(4.3)-(4.8)实现Neyman正交性,使得即使在模型误设下,偏差也是二阶的。
- 主要结论:QR估计量在四种模型正确性场景下一致,且当所有模型正确时达到半参数有效;MQR估计量在更严格的线性/广义线性模型假设下,即使部分模型误设,也能实现√N-一致性和渐近正态性,且模型类MMQR严格大于MTR和MOTR。
关键设定与假设¶
- 基本假设:Assumption 1(一致性、可忽略性、正性),标准因果中介假设。
- QR的额外假设:Assumption 2(正则性条件),包括nuisance估计的L2收敛率(¯r_π, ¯r_q, ¯r_µ, ¯r_τn, ¯r_τ = o(1)),以及矩条件(ε, ϱ, ζ, ξ的条件矩有界)。这些假设允许非参数估计,但要求乘积率条件(如¯r_µ¯r_q = o(N^{-1/2}))以实现√N-推断。
- MQR的额外假设:Assumption 3(模型类MMQR),要求至少一个场景成立,其中线性/逻辑斯蒂/指数形式被正确指定。Assumption 4(正则性),包括子高斯性、特征值下界等。Assumption 5(稀疏性),要求各nuisance参数的ℓ0范数满足s = o(N/log d),以及(r_π^2 + r_q^2) log d = O(1)。这些假设比QR更具体,但允许高维。
- 相比已有文献的放宽/强化:放宽了模型正确性场景(从3种到4种);强化了线性/广义线性假设(MQR),但允许误设;在高维下,现有方法要求所有模型正确才能√N-推断,而MQR在误设下也能实现。
主要结果¶
- Theorem 3.3(QR一致性):在MQR类下,ˆθ_QR - θ = O_p(N^{-1/2} + 乘积项 + 误设指示项)。当所有模型正确时,√N-一致性要求乘积率o(N^{-1/2})。
- Theorem 3.4(QR渐近正态性):当所有模型正确且乘积率条件满足时,√N(ˆθ_QR - θ) ⇒ N(0, σ^2),且σ^2可一致估计。此时ˆθ_QR是半参数有效的。
- Theorem 4.1(MQR改进收敛速度):在MMQR类下,ˆθ_MQR - θ = O_p(σ_m N^{-1/2} + 二阶项),其中σ_m ≍ ||β^*_µ||_2 + 1。误设时,偏差是二阶的(如r_π^2, r_q^2等),而非QR中的一阶项。
- Theorem 4.2(MQR稳健推断):在MMQR类下,若乘积率条件满足(如r_π(r_τ + r_τn) + r_q r_µ + r_π r_µ = o(N^{-1/2})),则√N(ˆθ_MQR - θ) ⇒ N(0, σ_m^2),且σ_m^2可一致估计。这是首个在高维误设下实现√N-推断的中介分析结果。
证明路线与技术技巧¶
整体路线(QR): 1. 分解:将ˆθ_QR - θ分解为三部分:∆{k,0}(基于真得分的中心极限项)、∆{k,1}(估计误差的随机波动)、∆{k,2}(估计误差的期望偏差)。 2. 控制∆_{k,0}:利用Lyapunov CLT,需要ϕ^的2+t阶矩有界(Lemma C.7)。 3. 控制∆_{k,1}:通过交叉拟合和泰勒展开,证明其阶为O_p(N^{-1/2}(¯r_µ + ¯r_τ + ¯r_τn + ¯r_π + ¯r_q))。 4. 控制∆_{k,2}:将偏差分解为多个乘积项(如∆{k,3}到∆{k,10}),利用Cauchy-Schwarz和Hölder不等式,得到阶为O_p(¯r_µ¯r_q + ¯r_τ¯r_π + ... + 误设指示项×线性项)。关键:当模型正确时,误设指示项消失,只剩乘积项。 5. 组合*:在乘积率条件下,∆{k,1}和∆{k,2}为o_p(N^{-1/2}),因此主导项是∆{k,0},从而渐近正态。
整体路线(MQR): 1. 构造特殊损失函数:ℓ1-ℓ6(式4.3-4.8)使得在总体水平上,ϕ(W; ν)对每个nuisance参数的梯度等于对应损失函数的梯度(式4.9)。因此,即使模型误设,只要ν^是这些损失函数的总体最小化子,就有E[∇_ν ϕ(W; ν^)] = 0(Neyman正交性)。 2. 高维估计:使用ℓ1正则化分别估计每个nuisance参数,得到ˆν。证明每个估计量的收敛速度(Theorem D.1, D.2),依赖于稀疏性和正则化参数选择。 3. 偏差分析:将ˆθ_MQR - θ分解,类似QR。关键:由于Neyman正交性,∆_{k,2}(期望偏差)中原本可能出现的线性项(如¯r_π)被消除,只剩二阶项(如r_π^2, r_q^2等)。这通过泰勒展开和损失函数的一阶条件证明。 4. 渐近正态性:在乘积率条件(如r_π(r_τ + r_τn) = o(N^{-1/2}))下,二阶项可忽略,主导项是中心极限项。
技术技巧点名: - 交叉拟合(cross-fitting):用于避免过拟合偏差,在QR和MQR中均使用(Algorithm 1, 2)。 - Neyman正交性:MQR的核心,通过特殊损失函数实现,使得估计方程对nuisance估计误差一阶不敏感。 - 高维正则化:使用ℓ1惩罚估计线性/逻辑斯蒂/指数模型,并利用RSC条件(Lemma D.13)和梯度浓度(Lemma D.14)推导收敛速度。 - 协变量平衡损失:ℓ1和ℓ2用于估计倾向得分,使得加权后的协变量均值平衡,这是实现Neyman正交性的关键。 - 乘积率条件:在QR和MQR中均出现,是半参数推断的标准技巧(如DML)。 - 泰勒展开与偏差分解:将偏差分解为多个乘积项,利用Cauchy-Schwarz和Hölder不等式控制。
真实例子与应用¶
- 模拟实验(Section 5.1):设计了两个高维设定(d1=101, d2=50, N=600-1800)。Setting (i) 非逻辑斯蒂π和非线性µ;Setting (ii) 非逻辑斯蒂π和非指数q。比较了8种方法(Oracle, TR, O-TR, QR1, QR2, O-TR’, MQR1, MQR2)。结果:QR2和MQR2在RMSE和覆盖率上优于现有方法,MQR2的覆盖率接近95%。额外模拟(Setting iii)显示当所有参数模型误设时,非参数QR2表现最好。
- 真实数据应用(Section 5.2):使用ACTG175数据集(HIV临床试验,N=780)。目标:量化组合疗法通过早期免疫恢复(CD4/CD8计数在20周)对96周CD4计数的中介效应。将X和M扩展为高维(d1=188, d2=101)。结果:所有方法均发现显著的正向NDE和NIE,但QR2和MQR2估计的NIE更大(37.71%和34.89% vs 26.50%-33.51%),表明更大比例的总效应通过早期免疫恢复中介。该例子展示了方法在高维实际数据中的可行性。
🔎 结论是否比证明窄¶
- Theorem 3.3和3.4:证明中假设所有nuisance估计收敛到其概率极限(可能不同于真值),且乘积率条件成立。但结论声称“在MQR类下”成立,而MQR类包含误设场景。实际上,Theorem 3.3的收敛速度中包含误设指示项(如1_{π≠π^}¯r_τ),这意味着当误设时,收敛速度可能慢于N^{-1/2}。Theorem 3.4则明确要求“所有nuisance模型正确指定”。因此,结论比证明窄*:论文声称QR在MQR类下“实现√N-推断”,但Theorem 3.4只覆盖了所有模型正确的情况;Theorem 3.3只保证一致性,不保证√N-推断。在误设下,QR只能一致性,不能推断。这与MQR形成对比,MQR在误设下也能推断(Theorem 4.2)。论文在摘要和引言中强调“quadruply robust methods that enlarge the model classes under which both unbiased identification and √N-inference are achieved”,但QR部分实际上只在所有模型正确时才能√N-推断。这一点需要仔细区分:QR的“四重稳健”指的是识别(unbiased identification)在四种场景下成立,但推断(√N-inference)需要所有模型正确。MQR的“模型四重稳健”则实现了在误设下的推断。论文在Section 3.2末尾明确写了“When all working models are correctly specified, ... ˆθ_QR is semiparametrically efficient”,但未强调误设时只能一致性。因此,读者需注意QR和MQR在推断上的差异。
四、开放问题(点到为止,扎根具体语句)¶
-
扩展到treatment-induced confounders:论文在Discussion中提到,Xia & Chan (2023)的QR依赖于treatment-induced confounders,而本文的QR不依赖。自然的问题是:能否将本文的QR框架扩展到存在treatment-induced confounders的情形,从而进一步扩大模型类?这扎根于论文第6段:“It is therefore natural to extend our QR framework to settings with treatment-induced confounding and to further expand the model class that supports valid inference”。
-
更广泛的cross-world functionals:论文提到“beyond natural effects, it is also of interest to extend our methods to a broader class of cross-world functionals, including conditional and marginal interventional effects”。这扎根于Discussion最后一句。具体地,如何将QR表示推广到其他跨世界参数(如路径特定效应)?可能需要新的DR表示和正交得分。
-
MQR中线性/广义线性假设的放松:MQR要求所有nuisance函数为线性/逻辑斯蒂/指数形式。能否在非参数或半参数框架下实现类似的误设下推断?例如,使用核方法或神经网络,同时保持Neyman正交性?这扎根于MQR的设定(Section 4.1),且论文承认“MQR relies on (generalized) linear working models”。一个具体问题是:能否构造类似的正交损失函数用于非参数估计,使得误设下的偏差仍为二阶?
-
乘积率条件的可验证性:Theorem 4.2要求r_π(r_τ + r_τn) + r_q r_µ + r_π r_µ = o(N^{-1/2})。这些r依赖于未知稀疏性。在实际中,如何验证这些条件?或者能否给出更易检验的充分条件(如所有s = o(√N / log d))?这扎根于Theorem 4.2后的讨论:“One sufficient, but not necessary, condition is that all nuisance estimates converge at rate o(N^{-1/4})”。
提醒:要确认这些是否为真gap,建议阅读近期约5篇相关论文的intro(如Xia & Chan 2023, Farbmacher et al. 2022, Xu et al. 2022, 以及高维中介分析综述),看是否都指向这些方向。
Maintained by 陈星宇 · Homepage · Source on GitHub