Proximal Identification and Estimation in Front-Door Causal Structures with Unobserved Confounding of the Mediator¶
作者: Helen Guo, Beatrix Yaxin Wen, Ilya Shpitser
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2607.10515
一、领域脉络与小综述¶
这个方向是什么¶
本子方向的核心问题是:在因果推断中,当存在未观测混杂时,如何利用代理变量(proxy variables) 来非参数地识别因果效应。其根本挑战在于,标准识别策略(如后门准则、前门准则)依赖于“无未观测混杂”的强假设,而现实观测数据中这一假设往往不成立。近端因果推断(Proximal Causal Inference)提供了一套框架,通过观测到的、与未观测混杂相关的代理变量(如负对照变量),在保留非参数灵活性的前提下恢复因果效应的可识别性。该方向目前处于快速发展期,已从简单的单混杂情形扩展到更复杂的图结构(如中介分析、前门结构)。
发展脉络(history)¶
- 奠基工作:Pearl [1995] 提出了前门准则,允许处理变量A与结果Y之间存在未观测混杂,但要求中介变量M无混杂。这是本工作的直接起点。Pearl [2009] 的《Causality》一书系统化了do-算子与潜在结果框架。
- 主要进展——近端因果推断的兴起:Miao, Geng, and Tchetgen Tchetgen [2018] 开创性地证明了,当存在两个独立的代理变量(W, Z)时,即使测量误差机制不可识别,因果效应仍可非参数识别。Kuroki and Pearl [2014] 和 Allman et al. [2015] 则从张量分解(eigendecomposition)角度提供了另一种识别策略。这两条路线(桥方程 vs. 张量分解)构成了近端推断的两大技术支柱。
- 当前frontier——复杂图结构与半参数估计:Cui et al. [2024] 系统发展了近端因果推断的半参数理论,包括效率界与双稳健估计。Dukes, Shpitser, and Tchetgen Tchetgen [2023] 将近端框架推广到中介分析,识别自然直接与间接效应。Shpitser, Wood-Doughty, and Tchetgen Tchetgen [2023] 提出了近端ID算法,将图模型识别理论与近端方法统一,是目前最一般的识别算法。Ghassami et al. [2025] 进一步处理了隐藏中介的情形。
- 本文的位置:本文针对前门准则中“中介变量无混杂”这一最受批评的假设,将其放松为“中介变量存在未观测混杂,但可观测到其代理变量”。它填补了前门准则与近端推断之间的一个自然缺口——即图1所示的复合弓图(composite bow graph)。本文提供了三种不同的识别策略(两种桥方程型、一种张量分解型),并首次为第三种策略(张量分解型)推导了基于影响函数的半参数估计量,具有多重稳健性。
子线索聚类¶
- 桥方程方法(Bridge equation methods):以Miao et al. [2018] 为代表,通过求解Fredholm积分方程来构造桥函数,将不可观测的混杂分布替换为可观测数据的函数。本文的Assumption Set 1和2属于此类。其优势在于可处理连续型混杂,但依赖于完备性(completeness)假设。
- 张量分解方法(Array decomposition / eigendecomposition methods):以Kuroki and Pearl [2014]、Allman et al. [2015] 为代表,通过矩阵/张量的特征分解来恢复潜在变量的分布。本文的Assumption Set 3属于此类。其优势在于可恢复完整联合分布(从而识别任意功能),但通常要求潜在变量具有有限支持。
- 半参数估计理论:以Cui et al. [2024]、Kennedy [2022] 为代表,为近端识别得到的泛函开发高效、双稳健的估计量。本文为第三种识别策略构造了影响函数估计量,属于此线索。
这个方向在追问的核心问题¶
- 识别:在给定图结构下,需要什么样的代理变量假设(条件独立性、完备性、秩条件)才能非参数识别因果效应?
- 估计:如何构造出收敛速度快(√n)、对 nuisance 函数估计误差稳健(双/多重稳健)的估计量?
- 效率:在给定半参数模型下,因果效应的半参数效率界是什么?能否达到?
- 可检验性:识别所需的假设(如完备性)是否可检验?若不可检验,其违反的后果有多严重?
⚠️ 作者的 framing(必须明确标注成"这是作者的说法")¶
- 作者把缺口 frame 成什么:作者指出,前门准则在实践中“rarely met”因为中介变量常与处理、结果共享未观测原因(第2.4节)。因此,本文的“显然的下一步”就是允许中介变量存在混杂,并利用代理变量来恢复识别。作者将三种策略定位为“proximal generalizations of the front-door criterion”。
- 哪些竞争路线被他淡化或回避了:作者在引言中提到了ID算法及其扩展(Shpitser and Pearl [2006], Huang and Valtorta [2006]),但并未深入讨论ID算法是否能在复合弓图中直接应用(即不借助代理变量)。实际上,ID算法在此图中会失败(因为存在不可压缩的隐藏变量),作者默认了这一点。此外,作者回避了与工具变量(IV)方法的比较——在复合弓图中,若存在一个有效的工具变量,也可能识别因果效应,但本文未讨论这种替代方案。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:作者引用了Bai et al. [2025](已发表?arxiv)作为Assumption Set 1的先行工作,但未引用可能更早的类似结果。此外,关于高维或非参数完备性检验的文献(如Canay et al. [2013])仅在讨论完备性假设时被提及,但未作为独立子方向展开。值得研究者去查的问题:是否存在其他图结构(如带有多个中介或处理-中介交互)下,近端前门准则的识别公式?这些是否已被覆盖?
张力¶
未见明显对立引用。各被引工作之间在技术路线上有差异(桥方程 vs. 张量分解),但作者明确指出它们是非嵌套的(non-nested models),即各有适用场景,而非相互矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - A:处理变量(treatment),本文假设为二值(0或1)。 - Y:结果变量(outcome)。 - M:中介变量(mediator),可以是向量。 - U:未观测混杂变量(unobserved confounder),影响A、M、Y。 - W, Z:U的两个代理变量(proxy variables),可观测。 - Y(a):潜在结果(potential outcome),即当A被设为a时Y的值。 - p(Y(a)):干预分布(interventional distribution),即因果效应的目标。 - ψ_a = E[Y(a)]:因果效应的均值(counterfactual mean),本文的估计目标。 - h₁, h₀, b₁, b₀:桥函数(bridge functions),是未知的、需从数据中求解的函数。 - η:nuisance参数集合(如条件均值、条件密度等)。
模型: 数据生成机制由图1的复合弓图(composite bow graph) 描述: - A → M → Y(直接路径) - A ← U → Y(处理-结果混杂) - A ← U → M → Y(中介混杂) - 此外,U还影响W和Z(代理变量)。 关键点是:U同时混杂了A、M、Y,因此标准前门准则(要求M无混杂)失效。
可观测数据: 研究者实际能观测到的是:(A, M, Y, W, Z) 的独立同分布样本。 - 可观测:A, M, Y, W, Z。 - 不可观测:U(潜在混杂)。 - 想要但观测不到:潜在结果Y(a)(只能观测到Y(A)),以及U的分布。 - 识别目标:将p(Y(a))表达为可观测数据分布p(A, M, Y, W, Z)的函数。
第二步:讲最小内核¶
最简特例:假设U是二值(取0或1),且所有变量(A, M, Y, W, Z)都是有限支持的离散变量。这是本文Assumption Set 3(张量分解型)的自然特例。
在这个特例下,核心思路是什么?
-
问题:我们想估计E[Y(a)],但U不可观测。如果U可观测,则可通过式(3)的广义前门公式识别: E[Y(a)] = Σ_{m, a', u} E[Y | a', m, u] p(m | a, u) p(a', u) 现在U不可观测,我们需要用代理变量W, Z来“替代”U。
-
关键想法:利用张量分解(本质上是矩阵特征分解)来恢复U的分布。具体地,在Assumption 3.9下(W, Z, Y在给定U, M, A下条件独立),我们可以构造两个矩阵:
- P_{W|Z}:W对Z的条件概率矩阵(维度 |W| × |Z|)。
-
P_{y, W|Z, a, m}:给定Z, a, m时,Y=y且W的联合概率矩阵。 由条件独立性,这两个矩阵可分解为: P_{W|Z} = P_{W|U} P_{U|Z} P_{y, W|Z, a, m} = P_{W|U} diag(P_{y|U, a, m}) P_{U|Z} 其中P_{W|U}和P_{U|Z}是未知的“因子矩阵”。
-
识别步骤:
- 计算P_{y, W|Z, a, m} P_{W|Z}^{-1} = P_{W|U} diag(P_{y|U, a, m}) P_{W|U}^{-1}。
- 这是一个相似变换,因此对P_{y, W|Z, a, m} P_{W|Z}^{-1}进行特征分解,即可恢复P_{W|U}的列向量(即p(W | U=u_i))和特征值(即p(Y=y | U=u_i, a, m)),仅相差一个标签置换。
- 通过在不同(a, m)组合下匹配标签(利用W的分布不依赖于a, m),可以恢复完整的联合分布p(A, M, Y, U, W, Z)(up to labeling)。
-
一旦恢复,代入式(3)即可计算E[Y(a)]。
-
为什么这个特例是“最小内核”:它去掉了所有为一般性服务的技术假设(如连续状态空间、无穷维函数空间),只保留了核心的代数结构——矩阵分解与特征分解。本文的一般情形(连续U、连续W/Z)只是这个特例的“加壳”,需要更复杂的泛函分析工具(如Fredholm积分方程、完备性假设)来替代矩阵求逆。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在前门准则的图结构中,当中介变量M存在未观测混杂U时,如何利用U的代理变量(W, Z)来非参数识别和估计处理变量A对结果Y的因果效应E[Y(a)]。
- 核心工具/方法:近端因果推断框架,包括三种识别策略(两种基于桥方程、一种基于张量分解),以及相应的plug-in估计量和基于影响函数的半参数估计量。
- 主要结论:在三种不同的假设集下,因果效应均可被非参数识别;基于影响函数的估计量(针对第三种策略)具有多重稳健性(在5组nuisance函数中任一组正确指定时一致)和√n-渐近正态性。
关键设定与假设¶
图结构:复合弓图(Fig. 1),其中U同时混杂A、M、Y。代理变量W和Z与U相连,但连接方式在不同假设集中不同(Fig. 3b, 4a, 4b)。
三种假设集:
| 假设集 | 条件独立性 | 完备性 | 桥方程解 | 适用场景 |
|---|---|---|---|---|
| Set 1 (Sec 3.1) | Assumption 3.1 (Fig. 4a) | Assumption 3.2 (Z对U的完备性) | Assumption 3.3 (两个Fredholm方程) | 允许W与Y、Z与A相关 |
| Set 2 (Sec 3.2) | Assumption 3.5 (Fig. 4b) | Assumption 3.6 (Z和W分别对U的完备性) | Assumption 3.7 (两个Fredholm方程) | 允许W与A、Z与M相关 |
| Set 3 (Sec 3.3) | Assumption 3.9 (Fig. 3b) | Assumption 3.11 (Z和W对U的完备性) + Assumption 3.12 (Y分布区分性) | 无需显式桥方程 | 可恢复完整联合分布 |
关键假设的统计含义: - 完备性(Completeness):例如Assumption 3.2要求,对于每个(a, m),条件期望算子T: g(U) → E[g(U) | Z, a, m]是单射。这等价于说Z对U有足够的“变异性”,使得U的任何非平凡函数都无法被Z条件独立于。这是非参数识别的核心条件,类似于工具变量中的“相关性”条件,但更强。 - Fredholm方程解:Assumption 3.3要求存在函数h₁, h₀使得某些积分方程成立。在有限支持下,这等价于某些概率矩阵的左可逆性(见Appendix B, D)。 - 相比已有文献:本文的Assumption Set 1与Dukes et al. [2023] 的中介分析假设类似,但应用于前门结构;Assumption Set 3与Kuroki and Pearl [2014] 的假设类似,但放宽了W, Z, Y的独立性要求(本文允许Y与W, Z通过U相关)。
主要结果¶
定理3.4(Assumption Set 1的识别): - 陈述:在Assumptions 3.1-3.3下,p(Y(a))由式(7)识别:p(Y(a)=y) = Σ_{a', w} h₀(y, w, a', a) p(w, a')。 - 直觉:桥函数h₀将不可观测的U“积分掉”,最终表达式只涉及可观测的W和A。 - 必要条件:两个Fredholm方程有解(即某些条件概率矩阵左可逆)。
定理3.8(Assumption Set 2的识别): - 陈述:在Assumptions 3.5-3.7下,p(Y(a))由式(8)识别:p(Y(a)=y) = Σ_{m, a', w, z} b₁(y, a', m, w) b₀(m, a, z) p(w, z, a')。 - 直觉:两个桥函数b₁, b₀分别替代了p(y|u, a', m)和p(m|a, u),最终表达式与式(3)结构相似。
定理3.13(Assumption Set 3的识别): - 陈述:在Assumptions 3.9-3.12下,完整联合分布{p(A, M, Y, u_i, W, Z)}被识别(up to labeling),因此p(Y(a))可通过式(3)识别。 - 直觉:通过矩阵特征分解恢复潜在变量U的分布,从而“打开”黑箱。 - 必要条件:U具有有限支持(或连续情形下满足Hu and Schennach [2008]的条件)。
定理4.1(影响函数): - 陈述:在Assumption Set 3下,ψ_a的非参数影响函数由式(14)给出,它是全数据影响函数(式11)的加权组合,权重为Lagrange插值多项式(式52-55)。 - 技术难点:权重需满足式(12)-(13)的条件期望性质,这要求U具有有限支持。
定理4.2(多重稳健性): - 陈述:基于式(14)的估计量在5组nuisance函数中任一组正确指定时一致(见定理4.2的(1)-(5))。 - 直觉:这是双稳健性(doubly robustness)的推广——多个“机会”来正确指定模型。
定理4.3(渐近正态性): - 陈述:在样本分割和nuisance函数一致估计下,√n(ψ̂_a - ψ_a) → N(0, E[φ²]),前提是nuisance函数估计误差的乘积为o_p(n^{-1/2})(见定理4.3的(1)-(5))。 - 条件:这是典型的“双机器学习”条件——nuisance函数可以慢于√n收敛,只要它们的乘积足够快。
证明路线与技术技巧¶
整体路线(以Assumption Set 3为例): 1. 识别:利用矩阵分解(Appendix F)恢复U的分布。 - 步骤1:构造P_{W|Z}和P_{y, W|Z, a, m}。 - 步骤2:计算P_{y, W|Z, a, m} P_{W|Z}^{-1} = P_{W|U} diag(P_{y|U, a, m}) P_{W|U}^{-1}。 - 步骤3:特征分解得到P_{W|U}和P_{y|U, a, m}(up to labeling)。 - 步骤4:跨(a, m)匹配标签,恢复完整联合分布。 2. 估计:构造影响函数。 - 步骤1:写出全数据影响函数φ_full(式11),假设U可观测。 - 步骤2:利用权重(Lagrange插值多项式)将φ_full投影到可观测数据空间,得到φ_obs(式14)。 - 步骤3:证明φ_obs满足影响函数的定义(Appendix J),即其与得分的协方差等于参数对子模型的导数。 3. 渐近性质:证明√n-一致性和多重稳健性(Appendix L)。 - 步骤1:将估计误差分解为R₁ + R₂ + (P_n - P)φ。 - 步骤2:利用样本分割和一致估计证明R₁ = o_p(n^{-1/2})。 - 步骤3:利用乘积条件(定理4.3的(1)-(5))证明R₂ = o_p(n^{-1/2})。
关键跳跃点: - 从全数据影响到观测数据影响:这是最吃功夫的部分。作者没有直接推导φ_obs,而是通过构造权重(Lagrange插值多项式)将φ_full“翻译”到观测数据空间。权重的构造依赖于U的有限支持,且需满足式(12)-(13)的条件期望性质。这本质上是一种非参数投影——将依赖于U的函数替换为仅依赖于可观测变量的函数。 - 多重稳健性的证明:定理4.2的证明(Appendix K)需要仔细追踪每个nuisance函数被正确指定时,哪些项收敛到0。这依赖于权重的条件期望性质(式12-13)和Fulcher et al. [2020] 的已有结果。
技术技巧点名: - Fredholm积分方程:用于Assumption Set 1和2的识别,将不可观测的积分转化为可观测的桥函数。 - 矩阵特征分解:用于Assumption Set 3的识别,恢复潜在变量分布。 - Lagrange插值多项式:用于构造权重(式52-55),实现从全数据影响到观测数据影响的投影。 - 影响函数(Influence Function):用于构造半参数估计量,实现√n-一致性和多重稳健性。 - 样本分割(Sample Splitting):用于证明渐近正态性,避免overfitting bias。 - 乘积条件(Product Rate Condition):用于放松nuisance函数的收敛速度要求(定理4.3)。
真实例子与应用¶
本文为纯理论+模拟,无真实数据例子。模拟实验(Section 5)使用两种数据生成过程: 1. 有限支持DGP(Appendix M):所有变量(A, M, Y, U, W, Z)均为二值。U ~ Ber(0.1),A, M, Y, W, Z由U和/或H(另一个混杂)生成。地面真值ACE = 0.258。 2. 混合DGP(Appendix N):U₁为二值,U₂为连续正态,A和M为二值(logistic),Y为连续正态。地面真值ACE = 0.169。
模拟结果(Table 1, 2): - Oracle(全数据)估计量几乎无偏。 - 错误的前门估计量(假设M无混杂)有显著偏倚(~0.1)。 - 三种近端plug-in估计量(ψ̂^(S1,PI), ψ̂^(S2,PI), ψ̂^(S3,PI))在n≥3000时偏倚大幅减小,接近无偏。 - 影响函数估计量(ψ̂^(S3,IF))在n=1000时不稳定(方差极大),但n≥3000时表现良好。 - 多重稳健性验证:当p(M|a, u)被错误指定时,plug-in估计量ψ̂^(S3,PI,MIS)有显著偏倚,而影响函数估计量ψ̂^(S3,IF,MIS)仍保持无偏(Table 1, n=3000)。
这个例子想说明什么: - 验证了三种识别策略的有效性——在中等样本量下,近端方法可以纠正前门准则因中介混杂导致的偏倚。 - 展示了影响函数估计量的多重稳健性——即使部分nuisance函数被错误指定,仍可得到一致估计。 - 也暴露了影响函数估计量在小样本下的不稳定性——这是逆概率加权类估计量的常见问题,可通过clipping缓解。
🔎 结论是否比证明窄¶
- 影响函数估计量仅适用于U具有有限支持的情形。作者在4.4.2节明确写道:“Developing the analogous construction of these weights beyond the setting where U has finite support remains an open problem”。因此,定理4.1-4.3的结论严格限于有限支持U。然而,作者在讨论中(Section 6)并未明确强调这一限制,而是泛泛地说“develop an influence function based estimator for the functional obtained via the third strategy”。值得研究者去查的问题:作者是否在conjecture中暗示了连续U的推广?还是明确将其列为未来工作?
- Assumption Set 1和2的估计量(plug-in)没有推导影响函数,因此其收敛速度未知(可能慢于√n)。作者仅声称“consistent under standard regularity conditions”,未给出具体速率。
- 模拟实验仅验证了三种假设集的交集(即同时满足所有假设的DGP)。作者未测试当某个假设违反时(如完备性不成立)的敏感性。值得研究者去查的问题:在模拟中,作者是否尝试了违反某个假设的DGP?如果没有,这是否是一个重要的稳健性缺口?
四、开放问题¶
-
连续U的影响函数构造:本文的影响函数估计量(定理4.1)依赖于U的有限支持(权重为Lagrange插值多项式)。扎根于:4.4.2节“Developing the analogous construction of these weights beyond the setting where U has finite support remains an open problem”。能否将权重推广到连续U(例如通过核方法或样条逼近)?这需要新的泛函分析工具。
-
Assumption Set 1和2的半参数效率理论:本文为Assumption Set 1和2仅提供了plug-in估计量,未推导影响函数或效率界。扎根于:Section 4.1仅给出“consistent under standard regularity conditions”。能否为这两个识别公式推导出双稳健、√n-一致的估计量?其半参数效率界是什么?
-
高维或非参数中介M:本文假设M是低维的(模拟中为二值)。扎根于:作者在讨论中未提及高维M。当M的维度随样本量增长时,识别公式中的求和/积分变得不可行。能否利用稀疏性、低秩结构或深度表示来应对?这与您在高维统计和U-统计量方面的兴趣可能相关。
-
完备性假设的可检验性:本文的识别依赖于完备性假设(Assumptions 3.2, 3.6, 3.11),这些假设在非参数模型中通常不可检验。扎根于:作者在3.1节引用Canay et al. [2013] 和Cui et al. [2024] 讨论了“distributions that fail to satisfy Assumption 3.2 can be made arbitrarily close in total variation distance to distributions that do satisfy it”。能否开发出针对特定子类(如指数族)的检验?或者,能否给出完备性违反时的偏倚界(sensitivity analysis)?
Maintained by 陈星宇 · Homepage · Source on GitHub