Causal Mediation Analysis for Network Data with Graph Neural Network¶
作者: Peikai Wu, Zhiguo Xiao
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.13274
一、领域脉络与小综述¶
这个方向是什么¶
本子方向旨在解决网络数据中的因果中介分析问题。根本的科学问题是:当个体通过社会网络相互连接时,如何将处理对结果的总效应分解为通过中介变量传递的间接效应和不通过该中介的直接效应,同时允许处理、中介和结果在个体间存在溢出(spillover)效应,并控制由网络结构本身带来的高维混淆。当前成熟度较低:绝大多数因果中介分析理论建立在无干扰(no-interference)假设上,而网络因果推断文献又几乎不涉及中介机制。本文是首个在单个大网络、非参数模型下系统研究中介效应识别、估计与推断的工作。
发展脉络(history)¶
-
奠基工作:Robins and Greenland (1992) 和 Pearl (2001) 在潜在结果框架下正式定义了受控直接效应、自然直接和间接效应,奠定了无干扰假设下的中介分析基础。Imai et al. (2010)、Tchetgen Tchetgen and Shpitser (2012)、VanderWeele (2015) 进一步丰富了识别条件、半参数估计和敏感性分析。留下的口子:所有工作都依赖 SUTVA(无干扰),不适用于网络数据。
-
网络因果推断(无中介):Hudgens and Halloran (2008) 引入部分干扰(partial interference)假设,将网络划分为独立组。Aronow and Samii (2017) 提出暴露映射(exposure mapping)作为定义因果 estimand 和限制干扰结构的工具。Forastiere et al. (2021)、Li and Wager (2022)、Leung (2022)、Ogburn et al. (2024) 将理论推广到一般网络。关键转折:Sävje (2024) 指出暴露映射同时承担了“定义 estimand”和“限制干扰结构”两个职责,二者应分离——研究者可以用映射定义效应,但不应要求真实干扰机制恰好以该映射形式运作。Leung and Loupos (2022) 遵循这一思路,用图神经网络处理高维网络混淆,但未考虑中介机制。
-
网络中介分析的有限工作:VanderWeele et al. (2013) 在群随机试验中分解自然间接效应为自身中介效应和溢出中介效应,但限于部分干扰。Kundu and Song (2024) 将暴露映射范式扩展到中介和结果同时存在网络依赖的情形,但估计和推断建立在线性随机效应结构方程模型上,仍通过暴露映射施加结构限制。Liu et al. (2021)、Che et al. (2021) 的“网络中介分析”将网络结构本身或潜在空间表示作为中介,回答的是不同的问题。留下的口子:没有工作系统研究单个大网络、一般干扰结构、非参数模型下的因果中介分析。
-
本文的位置:本文声称填补上述空白——在单个大网络中,允许处理和中介同时溢出,结果函数可任意依赖于所有个体的处理、中介、协变量和邻接矩阵,暴露映射和中介映射仅用于定义 estimand 而不限制真实干扰机制。
子线索聚类¶
- 线索A:部分干扰与群随机试验(VanderWeele et al., 2013; Hudgens and Halloran, 2008)。假设网络可划分为独立组,适用于组随机化设计,不适用于单个大网络。
- 线索B:暴露映射+结构方程模型(Kundu and Song, 2024; Forastiere et al., 2021)。通过暴露映射限制干扰结构,通常配合线性或参数模型,存在映射误设风险。
- 线索C:暴露映射仅定义estimand+非参数估计(Sävje, 2024; Leung and Loupos, 2022; 本文)。分离映射的两个职责,用灵活的非参数方法(如GNN)估计 nuisance 函数。本文是这条线索上首次引入中介分析的工作。
这个方向在追问的核心问题¶
- 识别:在存在处理和中介溢出、高维网络混淆时,需要什么样的条件独立性假设才能将因果量表示为可观测数据的函数?这些假设是否有结构误差层面的原始充分条件?
- 估计:如何构造对 nuisance 函数误设具有鲁棒性的估计量(双稳健/多稳健)?如何用图神经网络从节点特征和邻接矩阵直接学习高维 nuisance 函数,避免手工构造邻域特征的误设风险?
- 推断:在单个大网络中,个体间存在复杂依赖,如何建立效应估计量的渐近正态性并构造一致的方差估计量?需要什么样的弱依赖条件(近似邻域干扰、ψ-依赖)?
⚠️ 作者的 framing¶
作者将缺口 frame 为:“no existing work systematically studies identification, estimation and inference for causal mediation analysis in a single large network under a general interference structure and a nonparametric model.” 本文的“显然的下一步”是:将 Sävje (2024) 对暴露映射两职责的区分扩展到中介分析,并引入 GNN 处理高维混淆。被淡化的竞争路线:Kundu and Song (2024) 的线性结构方程模型被批评为“still imposes structural restrictions through exposure mappings”,但作者未讨论在什么条件下线性模型可能足够(例如,当真实干扰机制确实接近线性时)。明显该被引/该存在、却没出现在intro里:本文引用了 Leung and Loupos (2022) 用 GNN 处理网络混淆,但未引用任何关于 GNN 理论性质(如泛化界、逼近能力)的文献,也未引用关于高维 nuisance 函数估计率(如 Farrell et al., 2021 的深度神经网络理论)的文献——这些对验证 Assumption 8 的合理性至关重要。
张力¶
未见明显对立引用。各工作主要在设定(部分干扰 vs 一般网络、参数 vs 非参数、有中介 vs 无中介)上不同,而非在同一设定下得出矛盾结论。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(n\):个体总数。 - \(N_n = \{1, \dots, n\}\):个体集合。 - \(A \in \{0,1\}^{n \times n}\):对称邻接矩阵,\(A_{ij}=1\) 表示 \(i\) 和 \(j\) 直接相连,\(A_{ii}=0\)。 - \(\ell_A(i,j)\):\(i\) 和 \(j\) 之间的最短路径长度(不连通时为 \(\infty\))。 - \(N(i,K) = \{j: \ell_A(i,j) \le K\}\):\(i\) 的 \(K\)-邻域。 - \(X_i \in \mathbb{R}^{d_X}\):个体 \(i\) 的协变量(可观测)。 - \(D_i \in \{0,1\}\):个体 \(i\) 的处理(可观测)。 - \(M_i \in \{0,1\}\):个体 \(i\) 的中介(可观测)。 - \(Y_i \in \mathbb{R}\):个体 \(i\) 的结果(可观测)。 - \(\varepsilon_i, \omega_i, \nu_i\):不可观测的误差项。 - \(D = (D_1, \dots, D_n)\),\(M = (M_1, \dots, M_n)\),\(X = (X_1, \dots, X_n)\),\(Y = (Y_1, \dots, Y_n)\)。 - \(D_{-i} = (D_j)_{j \neq i}\),\(M_{-i} = (M_j)_{j \neq i}\)。 - \(Y_i(d, m)\):当所有个体的处理设为 \(d\)、中介设为 \(m\) 时,个体 \(i\) 的潜在结果。 - \(M_i(d_i)\):当个体 \(i\) 的处理设为 \(d_i\) 时,其潜在中介。 - \(T_i = t_n(i, D_{-i}, A)\):暴露映射,是 \(D_{-i}\) 和 \(A\) 的已知向量值函数,用于定义 estimand。 - \(S_i = s_n(i, M_{-i}, A)\):中介映射,是 \(M_{-i}\) 和 \(A\) 的已知向量值函数,用于定义 estimand。 - \(J_n \subseteq N_n\):感兴趣的子总体,大小为 \(j_n = |J_n|\)。
模型: - 结果模型:\(Y_i(d, m) = f_n(i, d, m, X, A, \varepsilon)\),其中 \(f_n\) 是未知函数,允许任意形式的溢出和网络混淆。 - 中介模型:\(M_i(d_i) = g_n(i, d_i, X, A, \omega_i)\),其中 \(g_n\) 是未知函数,仅依赖自身处理。 - 处理模型:\(D_i = h_n(i, X, A, \nu_i)\),其中 \(h_n\) 是未知函数,仅依赖自身误差。 - 一致性假设:\(Y_i = Y_i(D, M)\),\(M_i = M_i(D_i)\)。
可观测数据:研究者观测到 \((X, A, D, M, Y)\)。潜在结果 \(Y_i(d, m)\) 和潜在中介 \(M_i(d_i)\) 不可观测,只能通过假设识别。
第二步:最小内核¶
最简特例:考虑 \(n=2\) 个个体,\(A_{12}=A_{21}=1\),\(A_{11}=A_{22}=0\)。协变量 \(X_1, X_2\) 独立。处理 \(D_1, D_2 \in \{0,1\}\),中介 \(M_1, M_2 \in \{0,1\}\),结果 \(Y_1, Y_2\) 连续。暴露映射和中介映射取最简单的形式:\(T_i = D_{-i}\)(即另一个个体的处理),\(S_i = M_{-i}\)(即另一个个体的中介)。感兴趣的子总体 \(J_n = \{1,2\}\)。
核心思路:在这个特例下,本文要解决的根本问题是:如何定义和识别“个体 \(i\) 的自身处理对自身结果”的受控直接效应(OCDE),同时允许另一个个体的处理和中介对 \(i\) 的结果产生溢出?关键想法是:用暴露映射 \(T_i = D_{-i}\) 和中介映射 \(S_i = M_{-i}\) 来“固定”溢出部分,从而分离自身效应。
具体展开: - OCDE 定义:对于个体 \(i\),固定另一个个体的处理 \(D_{-i}=t\)、自身中介 \(M_i=m\)、另一个个体的中介 \(M_{-i}=s\),则自身受控直接效应为 \(Y_i(1, t, m, s) - Y_i(0, t, m, s)\)。总体 OCDE 为这两个个体效应的平均。 - 识别:在条件独立性假设(Assumption 3)下,\(Y_i(d, m) \perp\!\!\!\perp D \mid X, A\) 且 \(Y_i(d, m) \perp\!\!\!\perp M \mid D, X, A\),则 OCDE 等于可观测量的函数:
为什么这是最小内核:这个 \(n=2\) 的特例包含了本文所有核心要素——暴露映射仅定义 estimand、分离自身与溢出效应、条件独立性假设、AIPW 估计、GNN 学习 nuisance。一般情形只是将这个特例推广到任意 \(n\)、任意网络结构、更复杂的暴露/中介映射。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在单个大观测网络中,当处理和中介同时存在溢出效应、且存在高维网络混淆时,如何定义、识别、估计和推断自身受控直接效应(OCDE)、自身自然直接效应(ONDE)和自身自然间接效应(ONIE)。
- 核心工具/方法:引入暴露映射和中介映射(仅用于定义 estimand,不限制干扰结构),在加强的条件独立性假设下识别因果量;构造 AIPW 估计量(对受控效应双稳健,对自然效应多稳健);用图神经网络(PNA 架构)从节点特征和邻接矩阵直接学习高维 nuisance 函数。
- 主要结论:在近似邻域干扰、弱网络依赖和合适的 GNN 一阶段收敛率(\(n^{-1/4}\))下,建立了效应估计量的渐近正态性,并构造了网络 HAC 方差估计量并证明其一致性。模拟中 GNN 优于基于手工构造邻域特征的 MLP 和随机森林。实证分析发现保险知识是农业保险推广的重要中介渠道。
关键设定与假设¶
- 设定:条件于 \((X, A)\) 进行分析,避免对协变量和网络的联合分布建模。模型(1)-(3)允许任意形式的非线性溢出和网络混淆,但中介和处理模型假设仅依赖自身误差(用于识别,估计理论不依赖此限制)。
- 关键假设:
- Assumption 1(一致性):标准假设。
- Assumption 2(误差独立性):给定 \(X, A\),\(\{(\varepsilon_i, \omega_i, \nu_i)\}_{i=1}^n\) 相互独立。这排除了未观测网络混淆,是后续条件独立性假设的结构基础。
- Assumption 3(OCDE 识别):\(Y_i(d, m) \perp\!\!\!\perp D \mid X, A\) 且 \(Y_i(d, m) \perp\!\!\!\perp M \mid D, X, A\)。这是无干扰下序贯可忽略性的网络类比,要求所有处理-结果和中介-结果的共同原因都被 \(X, A\) 或 \(D\) 捕捉。
- Assumption 4(ONDE/ONIE 识别):在 Assumption 3 基础上,增加 \(M_i(d_i) \perp\!\!\!\perp D_i \mid X, A\)(无处理-中介混淆)和跨世界独立性条件(14)。后者是识别自然效应的关键,也是最强的假设。
- Assumption 5(暴露映射局部性):\(T_i\) 和 \(S_i\) 仅由固定阶邻域内的处理和中介决定。这是合理的,因为实际使用的映射都满足。
- Assumption 6(有界性与重叠):标准条件,包括潜在结果 \(p>4\) 阶矩存在、倾向得分有界远离 0 和 1、渐近方差非退化。
- Assumption 7(近似邻域干扰):真实结果模型 \(f_n\) 可以被局部 \(r\)-邻域模型 \(f_{n,r}\) 近似,近似误差 \(\gamma_n(r)\) 随 \(r\) 衰减。这是建立弱依赖的关键。
- Assumption 8(GNN 收敛率):nuisance 估计的均方误差为 \(o_p(n^{-1/2})\)(即 \(n^{-1/4}\) 率),加上随机等度连续性条件。这是双机器学习文献的标准要求。
- Assumption 9(ψ-依赖):要求协方差随距离衰减的速度快于邻域稠密化的速度,是网络中心极限定理的关键条件。
- 相比已有文献的放宽/强化:相比 Kundu and Song (2024),本文不要求线性结构方程模型,也不要求暴露映射限制干扰结构,因此更灵活但识别假设更强(需要跨世界独立性)。相比 Leung and Loupos (2022),本文引入了中介机制,因此 nuisance 函数系统更复杂(需要估计中介倾向得分等)。
主要结果¶
- Theorem 1(OCDE 识别):在 Assumptions 1-3 下,OCDE 等于可观测条件均值之差。直觉:条件独立性允许将潜在结果期望替换为可观测条件期望。必要条件:Assumption 3 必须成立。
- Theorem 2(ONDE/ONIE 识别):在 Assumptions 1, 2, 4 下,ONDE 和 ONIE 等于可观测量的函数。技术难点:需要跨世界独立性条件(14)来将自然中介水平 \(M_i(d_i^*)\) 的期望转化为可观测中介分布的加权和。
- Theorem 3(OCDE 渐近正态性):在 Assumptions 1-3, 5-9 下,\(\sqrt{j_n}(\widehat{\text{OCDE}} - \text{OCDE}) / \sigma_{n,C} \xrightarrow{d} N(0,1)\)。必要条件:GNN 估计率达到 \(n^{-1/4}\),网络依赖衰减足够快(Assumption 9)。
- Theorem 4(方差估计量一致性):在 Assumption 10 和 Theorem 3 的条件下,网络 HAC 方差估计量 \(\hat{\sigma}_C^2\) 是 \(\sigma_{n,C}^2\) 的一致估计。技术难点:需要控制 GNN 估计误差被邻域大小放大(Assumption 10(iii) 限制 \(b_n\)-邻域大小的增长)。
- Theorem 5-6(ONDE 渐近正态性与方差一致性):类似 Theorem 3-4,但需要更强的 Assumptions 11-15(更多 nuisance 函数、更严格的矩条件)。
证明路线与技术技巧¶
整体路线(以 Theorem 3 为例): 1. AIPW 分解:将 \(\widehat{\text{OCDE}} - \text{OCDE}\) 分解为“oracle 分数和”+“一阶段余项”(\(R_{1n}, R_{2n}\))。 2. 建立 ψ-依赖:证明中心化个体分数 \(\{\phi_i^C\}\) 在给定 \((X, A)\) 下是条件 ψ-依赖的(Lemma 1)。关键:利用近似邻域干扰(Assumption 7)构造局部近似,证明远距离个体分数近似独立。 3. 应用网络 CLT:验证 Kojevnikov et al. (2021) 网络中心极限定理的条件(ψ-依赖、矩有界、方差非退化、依赖衰减条件 Assumption 9),得到 oracle 分数和的渐近正态性。 4. 控制余项:用 Assumption 8(GNN 收敛率和随机等度连续性)证明 \(R_{1n}, R_{2n} = o_p(1)\)。关键:\(R_{1n}\) 通过随机等度连续性控制,\(R_{2n}\) 通过 Cauchy-Schwarz 和 MSE 率控制。 5. Slutsky 定理:合并得到渐近正态性。
关键跳跃点: - Lemma 1 的证明:需要将 \(\phi_i^C\) 分解为局部近似 \(\phi_i^{C,(r/4)}\) 和余项,利用 Assumption 7 的近似误差界 \(\gamma_n(r/4)\) 控制协方差。难点在于处理暴露映射和中介映射带来的局部性(Assumption 5)。 - Theorem 4 的证明:需要建立可行 HAC 估计量与 oracle HAC 估计量的等价性(Step 2),这要求控制 GNN 估计误差被邻域大小放大(式 (49) 中的 \(n(i, b_n)^2\) 项)。Assumption 10(iii) 限制 \(n(i, b_n)^2\) 的均值为 \(O_p(\sqrt{n})\),从而保证 \(o_p(1)\)。
技术技巧点名: - ψ-依赖 (Kojevnikov et al., 2021):用于刻画网络依赖结构,是建立 CLT 的基础。 - 近似邻域干扰 (Leung, 2022):将因果结构层面的弱依赖转化为统计依赖的衰减。 - 双机器学习 (Chernozhukov et al., 2018):AIPW 估计量和 \(n^{-1/4}\) 率条件。 - 网络 HAC 方差估计 (Kojevnikov et al., 2021):用核矩阵截断远距离协方差,带宽自适应于网络密度和路径长度。 - PNA 架构 (Corso et al., 2020):GNN 的具体实现,用多种聚合函数(mean, sd, sum, min, max)和度缩放捕捉复杂邻域信息。
真实例子与应用¶
- 数据:Cai et al. (2015) 的中国农村农业保险实验,4848 个农民,随机分配到简单/密集信息宣讲会,以及默认购买/不购买选项。
- 方法应用:将密集宣讲会作为处理 \(D\),保险知识测试得分(是否≥40%)、感知参保率(是否>50%)、主观灾害概率(是否>40%)分别作为中介 \(M\),保险购买决策作为结果 \(Y\)。暴露映射和中介映射均设为常数 1(即不限制他人处理和中介)。估计 OCDE(1,0,1), OCDE(1,1,1), ONDE(1), ONIE(1)。
- 结果:
- 密集宣讲会显著提高参保率。当中介为保险知识时,ONDE=0.0383,ONIE=0.0351,两者均显著,说明保险知识是重要中介渠道(占总效应约一半)。
- 当中介为感知参保率或主观灾害概率时,ONIE 接近 0 且不显著,说明密集宣讲会不通过改变这些感知起作用。
- 默认购买选项也显著提高参保率,但 ONIE 均不显著,说明其作用不通过感知渠道。
- 这个例子想说明:本文方法能将原始研究中关于机制的“非正式讨论”转化为可估计、可检验的因果分解,且 GNN 估计结果与 MLP/RF 在方向上一致但数值上有差异(GNN 因利用了网络邻域信息而被视为主要依据)。
🔎 结论是否比证明窄¶
- 窄的地方:Theorem 3 和 5 的渐近正态性是在“固定 \((t, m, s)\)”或“固定 \(t\)”下建立的,未提供关于这些参数(如暴露映射水平)的均匀推断。作者在结论中承认“developing uniform inference”是未来工作。
- 泛化的 claim:作者声称框架可扩展到连续/多值处理和中介(脚注 1),但未给出具体识别条件或估计量,也未讨论核光滑化带来的额外渐近复杂性。这更像是一个“conjecture”而非已证明的结论。
- 被淡化的假设强度:Assumption 4 中的跨世界独立性条件(14)在实证中极难验证,作者仅提供了结构误差层面的充分条件(\(\varepsilon \perp\!\!\!\perp \nu \mid X, A\) 等),但未讨论这些条件在观测研究中的可信度或敏感性分析方法。
四、开放问题¶
-
纵向扩展:将框架扩展到时变处理、中介和结果,以及演化的网络,以追踪直接、间接和溢出效应如何随时间累积。扎根于:Section 7 “First, a longitudinal version of the framework could accommodate time-varying treatments, mediators and outcomes, as well as an evolving network”。
-
连续/多值处理与中介:将框架扩展到连续或多值处理和中介,以及固定维度的中介向量,并进一步分解为中介特异性路径效应。扎根于:Section 7 “Second, the framework could be extended to continuous or multi-valued treatments and mediators and to a fixed-dimensional vector of mediators”。
-
均匀推断与异质性效应:发展均匀推断、同时检验以及跨网络位置或子总体的异质性中介效应方法。扎根于:Section 7 “Third, developing uniform inference, simultaneous testing and methods for heterogeneous mediation effects across network positions or subpopulations”。
-
跨世界独立性条件的敏感性分析:Assumption 4 中的跨世界独立性条件(14)是识别自然效应的关键但极强的假设。发展对该假设的敏感性分析方法,或寻找更弱的替代假设(如干预效应),是重要的开放问题。扎根于:Theorem 2 的证明依赖于条件(14),且作者在 Appendix B 中讨论了干预效应(不需要跨世界独立性)作为替代,但未给出敏感性分析。
Maintained by 陈星宇 · Homepage · Source on GitHub