跳转至

Graph-based causal variance decompositions: When "variance explained" means causation

作者: Olli Saarela, Juha Karvanen
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2608.27140


一、领域脉络与小综述

这个方向是什么

本方向要解决的根本问题是:如何将“方差解释”(variance explained)从纯描述性的、依赖于条件顺序的分解,提升为具有因果解释的分解,使得每个方差分量对应一个明确的因果贡献(如总效应、受控效应或路径特定贡献)。当前成熟度:已有应用特定的分解(如医院质量比较)和一般因果归因框架(如内在因果贡献),但缺乏一个统一的图论框架来逐分量评估识别性,且允许非拓扑序、不要求因果充分性。本文正是填补这一空白。

发展脉络(history)

  • 奠基工作:Bowsher & Swain (2012) 在生化网络背景下指出多路方差分解的非唯一性,并强调条件顺序承载科学问题。这为后续将顺序视为估计的一部分而非噪声奠定了基础。
  • 应用驱动的因果方差分解:Chen et al. (2020) 在医疗质量比较中提出三路因果方差分解,直接用潜在结果定义医院相关方差分量,使其成为因果估计量。随后扩展到中介分析(Chen et al., 2022)和层次结构(Chen et al., 2023)。Yu et al. (2025) 进一步扩展到八路分解用于健康不平等,引入“允许协变量”(allowable covariates)概念,并考虑修改顺序(先条件于X再考虑Z)以获得受控效应解释。这些工作为特定DAG和科学问题建立了因果解释,但“没有提供一般图条件,使得任意有序观测方差分量具有因果解释”(本文第4页原文)。
  • 一般因果归因与变量重要性:Janzing et al. (2024) 提出内在因果贡献(ICC),通过结构保持干预将每个节点分解为外生噪声贡献,并用Shapley平均消除顺序依赖。Saha et al. (2025) 发展拓扑序ICC用于深度网络,在无潜在混杂假设下用观测变量表示ICC。Khan et al. (2025) 提出条件变量重要性度量(CVIM),与条件平均处理效应(CATE)建立二次关系,但“不能同时为所有变量的重要性度量获得因果解释”(本文第2页原文)。Hines et al. (2025) 和 Paillard et al. (2025) 发展针对处理效应异质性的变量重要性度量及推断程序。这些工作提供了一般构造,但要么聚焦内在贡献(不产生多分量分解),要么只处理单变量重要性。
  • 反事实ANOVA与可解释性:Gao & Zhao (2024) 提出“反事实可解释性”,用DAG和反事实比较将ANOVA型归因扩展到依赖解释变量。Zhang & Gao (2026) 发展半参数估计和推断,包括基于影响函数的估计。这些目标(函数方差分解)与本文的条件方差分量不同,但同样将解释方差视为因果估计量。
  • 本文的位置:本文声称填补了“应用特定分解和一般归因之间的空白”(第4页)。它提供一般图条件,逐分量评估识别性,允许非拓扑序,不要求因果充分性,并将顺序视为科学估计的一部分而非平均掉。

子线索聚类

  1. 应用驱动的因果方差分解(Chen et al., 2020, 2022, 2023; Yu et al., 2025):针对特定DAG(医院比较、健康不平等)定义因果方差分量,使用潜在结果和混合效应模型估计。特点:科学问题导向,但缺乏一般图条件。
  2. 一般因果归因/变量重要性(Janzing et al., 2024; Saha et al., 2025; Khan et al., 2025; Hines et al., 2025; Paillard et al., 2025):提供一般构造(ICC、Shapley、条件重要性),但要么聚焦内在贡献(不产生多分量分解),要么只处理单变量重要性,且通常假设因果充分性或拓扑序。
  3. 反事实ANOVA/可解释性(Gao & Zhao, 2024; Zhang & Gao, 2026):将函数方差分解(Sobol指数)扩展到依赖变量,使用DAG和反事实比较。目标不同(函数方差 vs 条件方差),但同样将解释方差视为因果估计量。

核心问题与已知瓶颈

  • 核心问题:如何定义和识别具有因果解释的有序方差分量?具体包括:(a) 在什么图条件下,观测方差分量等于其因果对应?(b) 当顺序不是拓扑序时,如何定义因果解释?(c) 当系统包含未观测变量时,哪些分量仍可识别?
  • 已知瓶颈:现有方法要么缺乏一般图条件(Chen等),要么不产生多分量分解(Khan等),要么要求因果充分性(Janzing等拓扑序ICC),要么通过平均消除顺序而非将其视为估计的一部分。

⚠️ 作者的framing

作者将缺口frame为:“应用特定分解和一般归因之间缺少一个框架,其中因果解释和识别是逐分量针对全图评估的,并且替代的科学选择顺序本身可以定义实质不同的估计量”(第4页)。他们淡化/回避了以下竞争路线: - Shapley平均(Janzing等):作者明确不采用,认为顺序应作为科学估计的一部分,而非平均掉。他们用聚类(vector-valued node)处理平行结构,而非平均。 - 效率理论/双稳健估计:作者在讨论中承认这是未来方向,但本文仅使用plug-in估计和近似贝叶斯,未发展EIF或双稳健方法。他们引用Jung et al. (2022) 的do-Shapley双稳健估计作为相关但不同的工作。 - 高维/非参数设定:本文模拟中p=15,但未讨论高维渐近或非参数识别。作者未提及高维或非参数下的挑战。

明显缺失:本文没有引用任何关于半参数效率界或双稳健估计的文献(如Kennedy, 2016; Chernozhukov et al., 2018),尽管在讨论中提到了EIF。此外,没有讨论当调整集不唯一时如何选择,也没有讨论对图结构不确定性的敏感性分析(仅在讨论中提及)。

张力

未见明显对立引用。不同方法对顺序的处理有分歧(固定 vs 平均),但作者明确选择固定顺序,并给出理由(科学估计的一部分)。这属于方法选择而非矛盾。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(Y\):结果变量(可观测)。 - \(X_1, \ldots, X_k\):解释变量(可观测),顺序记为 \(X_1 \prec X_2 \prec \cdots \prec X_k \prec Y\)。 - \(X_{\prec j} := (X_1, \ldots, X_{j-1})\):在顺序中排在 \(X_j\) 之前的变量。 - \(X_{1:j} := (X_1, \ldots, X_j)\)。 - \(\Delta_j := E_{X_{\prec j}}[ V_{X_j | X_{\prec j}} \{ E(Y | X_{1:j}) \} ]\):第 \(j\) 个方差分量(观测数据定义)。 - \(\Delta_{\text{res}} := E_{X_{1:k}}[ V(Y | X_{1:k}) ]\):残差分量。 - \(V(Y) = \sum_{j=1}^k \Delta_j + \Delta_{\text{res}}\):全方差分解恒等式。 - \(\text{do}(X_j)\):Pearl的do算子,表示对 \(X_j\) 进行干预。 - \(G\):因果DAG,可能包含未观测变量。 - \(\text{de}_G(X_j)\):\(X_j\) 在 \(G\) 中的后代集。 - 对于非拓扑序 \(\sigma\):\(X_{\prec j}^{\sigma}\) 为顺序中排在 \(X_j\) 之前的变量;\(C_j^{\sigma} := X_{\prec j}^{\sigma} \cap \text{de}_G(X_j)\)(受控的后代);\(B_j^{\sigma} := X_{\prec j}^{\sigma} \setminus C_j^{\sigma}\)(候选调整集);\(E_j^{\sigma} := \{X_j\} \cup C_j^{\sigma}\)(联合暴露集)。

模型: - 数据生成机制由因果DAG \(G\) 描述,可能包含未观测变量。观测变量为 \(X_1, \ldots, X_k, Y\)。未观测变量记为 \(U\)。假设无选择偏差,一致性成立。 - 对于每个分量,识别依赖于do-calculus规则2(行动/观察交换):若 \(X_{\prec j}\) 是 \(X_j\) 对 \(Y\) 总效应的有效调整集,则 \(p(y | \text{do}(X_j), X_{\prec j}) = p(y | X_j, X_{\prec j})\)。 - 有效调整集的定义:在 \(G\) 中,调整集 \(S\) 满足后门准则(无后代,阻断所有后门路径)。

可观测数据: - 研究者观测到来自联合分布 \(p(X_1, \ldots, X_k, Y)\) 的 i.i.d. 样本。 - 潜在量:反事实均值 \(E(Y | \text{do}(X_j), X_{\prec j})\) 不可直接观测,需通过调整集识别。 - 未观测变量 \(U\) 不出现在数据中,但影响识别条件。

第二步:最小内核

最简特例:考虑因果充分DAG(无未观测混杂),变量为 \(X_1, X_2, Y\),结构为 \(X_1 \rightarrow Y \leftarrow X_2\),且 \(X_1\) 与 \(X_2\) 独立。拓扑序可以是 \(X_1 \prec X_2 \prec Y\) 或 \(X_2 \prec X_1 \prec Y\)。取 \(X_1 \prec X_2 \prec Y\)。

  • 可观测数据:\((X_1, X_2, Y)\) 的 i.i.d. 样本。
  • 方差分解:
    \[V(Y) = \underbrace{V_{X_1}[E(Y|X_1)]}_{\Delta_1} + \underbrace{E_{X_1}[V_{X_2|X_1}[E(Y|X_1,X_2)]]}_{\Delta_2} + \underbrace{E_{X_1,X_2}[V(Y|X_1,X_2)]}_{\Delta_{\text{res}}}.\]
  • 因果解释:由于 \(X_1\) 无父节点,空集是 \(X_1\) 对 \(Y\) 总效应的有效调整集,故 \(E(Y|X_1) = E(Y|\text{do}(X_1))\),因此 \(\Delta_1 = V_{X_1}[E(Y|\text{do}(X_1))]\),即 \(X_1\) 的总效应方差。对于 \(X_2\),\(X_1\) 是 \(X_2\) 的父节点且非后代,是有效调整集,故 \(E(Y|X_1,X_2) = E(Y|\text{do}(X_2), X_1)\),因此 \(\Delta_2 = E_{X_1}[V_{X_2|X_1}[E(Y|\text{do}(X_2), X_1)]]\),即给定 \(X_1\) 下 \(X_2\) 的条件效应方差。
  • 这个特例说明:在因果充分且拓扑序下,每个观测方差分量自动对应一个因果效应(总效应或条件效应)。证明只需do-calculus规则2。

若存在未观测混杂:假设 \(U\) 是 \(X_1\) 和 \(Y\) 的共同原因(\(U \rightarrow X_1, U \rightarrow Y\)),且 \(X_1\) 与 \(X_2\) 独立。拓扑序仍为 \(X_1 \prec X_2 \prec Y\)。此时,\(X_1\) 分量:空集不是有效调整集(因为 \(X_1 \leftarrow U \rightarrow Y\) 是后门路径),故 \(E(Y|X_1) \neq E(Y|\text{do}(X_1))\),\(\Delta_1\) 无因果解释。\(X_2\) 分量:\(X_1\) 是有效调整集(阻断所有后门路径,因为 \(X_2\) 与 \(U\) 独立),故 \(\Delta_2\) 仍有因果解释。这展示了逐分量检查的必要性,正是本文的核心思想。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在因果图框架下,定义有序方差分解的因果对应,并给出逐分量识别条件,允许拓扑序和非拓扑序,不要求因果充分性。
  2. 核心工具/方法:利用do-calculus规则2和图形调整准则,逐分量检查识别性;提出基于模型plug-in估计(利用顺序特异性因子分解)和近似贝叶斯不确定性量化(渐近正态参数后验+贝叶斯bootstrap)。
  3. 主要结论:给出拓扑序下分量识别的充分条件(Proposition 3.1, Corollary 3.2),非拓扑序下受控效应分量的识别条件(Proposition 3.6),以及通过聚类获得唯一拓扑序的方法(Proposition 3.4)。模拟显示在正确模型下表现合理,但对模型误设敏感。

关键设定与假设

  • 设定:给定因果DAG \(G\)(可能含未观测变量),观测变量 \(X_1,\ldots,X_k,Y\)。用户指定顺序 \(\sigma\)(可以是拓扑序或非拓扑序)。分解中可只包含部分观测变量,未包含的变量和未观测变量留在残差中。
  • 假设:
  • 一致性:观测结果等于潜在结果在观测暴露下的值。
  • 无选择偏差:样本独立同分布。
  • 对于每个分量 \(j\),需要检查 \(X_{\prec j}\)(拓扑序)或 \(B_j^{\sigma}\)(非拓扑序)是否为有效调整集。有效调整集的定义基于后门准则(无后代,阻断所有后门路径)。这等价于条件交换性:\(Y \perp X_j \mid X_{\prec j}\) 在干预图 \(G_{\underline{X_j}}\) 中成立。
  • 相比已有文献:放宽了因果充分性假设(Chen等假设无未观测混杂?实际上Chen等使用随机效应模型但未一般化);允许非拓扑序(Janzing等只考虑拓扑序);不要求所有变量都包含在分解中。

主要结果

  • Proposition 3.1(拓扑序识别):若 \(X_{\prec j}\) 是 \(X_j\) 对 \(Y\) 总效应的有效调整集,则 \(E(Y|X_j, X_{\prec j}) = E(Y|\text{do}(X_j), X_{\prec j})\),从而 \(\Delta_j\) 的因果对应由观测数据识别。证明直接:do-calculus规则2。
  • Corollary 3.2(因果充分特例):若 \(G\) 因果充分且顺序拓扑,则每个 \(X_{\prec j}\) 自动是有效调整集,所有分量识别。
  • Proposition 3.4(聚类获得唯一拓扑序):若变量可划分为反链(antichains)\(C_1,\ldots,C_K\),使得每个 \(C_\ell\) 中变量互不为祖先,且 \(C_\ell\) 中所有变量是 \(C_m\)(\(\ell<m\))中所有变量的祖先,则聚类后顺序唯一。这避免了Shapley平均,将平行变量归为向量值节点。
  • Proposition 3.6(非拓扑序识别):对于非拓扑序 \(\sigma\),若 \(B_j^{\sigma}\) 是联合暴露集 \(E_j^{\sigma} = \{X_j\} \cup C_j^{\sigma}\) 对 \(Y\) 的有效调整集,则 \(E(Y|X_j, X_{\prec j}^{\sigma}) = E(Y|\text{do}(E_j^{\sigma}), B_j^{\sigma})\),从而 \(\Delta_j^{\sigma}\) 的受控效应因果对应被识别。这里 \(C_j^{\sigma}\) 是排在 \(X_j\) 之前的后代,被解释为受控变量。

技术难点:非拓扑序下,后代变量出现在前面,不能作为普通调整变量。作者通过将它们纳入联合暴露集,并检查剩余变量 \(B_j^{\sigma}\) 是否为该联合暴露的有效调整集,从而获得受控效应解释。这要求 \(B_j^{\sigma}\) 阻断所有后门路径,包括那些涉及未观测变量的路径。

证明路线与技术技巧

  • 整体路线:所有识别命题的证明都是直接应用do-calculus规则2。步骤:(1) 根据顺序定义,将条件期望写为 \(E(Y|X_j, X_{\prec j})\) 或 \(E(Y|E_j^{\sigma}, B_j^{\sigma})\);(2) 若调整集有效,则规则2给出 \(p(y|\text{do}(\cdot), \text{adj}) = p(y|\cdot, \text{adj})\);(3) 代入方差分量定义即得。没有复杂的渐近理论。
  • 关键跳跃点:非拓扑序下,将后代变量纳入联合暴露集是核心想法。这需要用户明确哪些后代是“受控”的,并检查剩余变量是否调整了联合暴露。作者用dagitty包的isAdjustmentSet函数进行图形检查,示例代码给出。
  • 技术技巧:
  • do-calculus规则2:核心工具,用于将条件分布转化为干预分布。
  • 图形调整准则:通过后门准则或isAdjustmentSet函数检查调整集有效性。
  • 聚类(vector-valued node):处理平行结构,避免Shapley平均,获得唯一拓扑序。
  • 贝叶斯bootstrap:用于传播经验分布的不确定性(边际分布和条件分布中的经验部分)。
  • 渐近正态参数后验:对回归模型参数,用MLE和估计协方差矩阵生成后验样本。
  • 顺序特异性因子分解:将联合分布按顺序分解为条件分布,使plug-in估计自然对应分解中的期望和方差。

真实例子与应用

本文为纯模拟研究,无真实数据应用。模拟基于图1的DAG(Z→X→A→Y, Z→A, Z→Y, X→Y, 以及可能的U)。生成数据比较拓扑序(Z≺X≺A≺Y)和修改序(X≺Z≺A≺Y)的估计。模拟场景包括不同样本量(n=500,1500)、协变量维度(p=5,15)和Z-A交互强度(γ_ZA=0,0.6,1.0)。估计方法包括参数模型(主效应、交互、Firth校正)和XGBoost。结果展示: - 正确指定模型下,参数估计偏差小;XGBoost有系统性偏差(低估Δ_Z和Δ_X,高估残差)。 - 修改序的Δ_Z在拓扑序下接近零,但在修改序下占7-8%总方差,说明修改序能捕捉路径特定信号。 - 近似贝叶斯区间覆盖在正确模型下接近名义水平,但在分量接近零时欠覆盖;模型误设导致严重欠覆盖。

🔎 结论是否比证明窄

  • Proposition 3.6 要求 \(B_j^{\sigma}\) 是联合暴露集 \(E_j^{\sigma}\) 的有效调整集。这比单独调整 \(X_j\) 更强。论文未讨论当 \(B_j^{\sigma}\) 不是有效调整集但存在其他调整集(如 \(B_j^{\sigma}\) 的子集或超集)时的识别条件。实际中,用户可能希望选择更小的调整集,但命题未覆盖。
  • Proposition 3.4 的聚类方法假设变量可划分为反链,且祖先关系完全由偏序决定。当变量间存在更复杂的结构(如部分祖先关系)时,聚类可能不唯一或无法形成反链。论文未讨论这种情况。
  • 模拟部分:XGBoost的偏差被归因于“预测导向的拟合不能保证准确估计非线性方差分解泛函”(第22页),但未给出理论解释(如plug-in偏差的一阶展开)。这暗示结论(估计对模型误设敏感)比证明(识别结果)更宽泛,因为识别本身不涉及估计。
  • 讨论中:作者承认“估计是进一步发展的重点”(第28页),并指出EIF和双稳健估计是自然下一步。这表明本文的估计方法(plug-in)是初步的,结论(估计表现)可能随更先进方法而改变。

四、开放问题

  1. 发展高效影响函数(EIF)和偏差校正估计量:本文的plug-in估计对模型误设敏感(模拟中XGBoost和主效应模型均显示偏差)。作者明确提到“推导单个分量的高效影响函数,并用其构造偏差校正的一步或目标估计量”(第28页)。扎根于论文第28页“A natural next step is therefore to derive efficient influence functions for the individual components and use them to construct bias-corrected one-step or targeted estimators.”

  2. 完整的贝叶斯推断(MCMC):近似贝叶斯程序在分量接近零时覆盖不足(模拟中Δ_Z拓扑序)。作者建议“基于MCMC后验采样的适当贝叶斯实现可以避免对高斯近似的依赖,并通过拟合的条件模型联合传播不确定性”(第29页)。扎根于论文第29页“A proper Bayesian implementation based on posterior sampling by MCMC could avoid reliance on Gaussian approximations and propagate uncertainty jointly through the fitted conditional models.”

  3. 对图结构、顺序或聚类定义的敏感性分析:论文假设因果图和顺序已知,但实际中这些选择可能不确定。作者指出“敏感性分析 over plausible graphs, orderings, or cluster definitions may be important”(第29页)。扎根于论文第29页“In applications, these choices may themselves be uncertain, and sensitivity analysis over plausible graphs, orderings, or cluster definitions may be important.”

  4. 扩展到干预性因果方差分解:当前框架分解的是观测结果方差。作者提到“可以扩展到干预性因果方差分解,其中分解的是干预后潜在结果的方差”(第29页)。扎根于论文第29页“To quantify disparities that remain after hypothetical interventions on downstream variables that are well-defined intervention targets, the present framework can be extended to interventional causal variance decompositions, in which the variance of an interventional potential outcome is decomposed.”

提醒:要确认这些是否为真gap,建议阅读近期约5篇相关论文的引言(如Janzing et al. 2024, Zhang & Gao 2026, Hines et al. 2025),看它们是否都指向相同的开放问题。若一致,则为共识性真gap;若互相打架,则可能是机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论