Graph-based causal variance decompositions: When "variance explained" means causation¶
作者: Olli Saarela, Juha Karvanen
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2608.27140
一、领域脉络与小综述¶
这个方向是什么¶
本文所处理的子方向是因果方差分解(causal variance decomposition):将观测到的结果变量Y的边际方差,按照一组解释变量(X₁,…,X_k)的某种顺序,分解为若干分量,并赋予每个分量因果解释。传统方差分解(如ANOVA型递归全方差公式)是纯概率恒等式,其分量依赖于条件顺序且无因果含义。该方向的核心问题是:在什么图形条件下,一个有序方差分量可以被解释为“由某个变量(或变量集)的因果效应所解释的方差”?以及如何估计和推断这些因果分量?当前该方向处于从应用特定构造向一般图形理论过渡的阶段。
发展脉络(history)¶
- 奠基工作:Bowsher & Swain (2012) 在随机生化网络背景下明确指出了多路方差分解的非唯一性,并强调条件顺序承载科学问题。Pearl (2009) 的do-calculus为因果识别提供了通用语言。这两篇奠定了“顺序重要”和“因果识别可图形化”的基础。
- 应用驱动的因果方差分解:Chen et al. (2020) 在医疗质量比较中首次提出三路因果方差分解,将医院效应分量定义为潜在结果下的因果 estimand。随后扩展至中介分析(Chen et al., 2022)和分层提供者结构(Chen et al., 2023)。Yu et al. (2025) 进一步分解出八路分量,处理群体差异和效应修饰。这些工作为特定DAG和科学问题建立了因果方差分量,但未提供一般图形条件来判断任意有序方差分量何时有因果解释(本文引言原话)。
- 变量重要性:Khan et al. (2025) 提出条件变量重要性度量(MVIM/CVIM),当X_j视为处理、其余变量为有效混杂调整集时,该度量与CATE有二次关系。但该度量不产生顺序多分量分解。Hines et al. (2025) 和 Paillard et al. (2025) 发展了对异质性处理效应的变量重要性度量及推断。这些工作连接了方差分解与机器学习中的变量重要性,但不处理顺序分解。
- 一般因果归因:Janzing et al. (2024) 提出内在因果贡献(ICC),通过结构方程将每个节点解析为外生噪声,用结构保持干预定义归因,并通过Shapley平均消除顺序依赖。Saha et al. (2025) 将拓扑ICC推广到深度神经网络,在无潜在混杂假设下建立可识别性。Gao & Zhao (2024) 提出“反事实可解释性”,用DAG和反事实比较将ANOVA型归因扩展到依赖解释变量。Zhang & Gao (2026) 发展半参数估计与推断。Jung et al. (2022) 提出do-Shapley值,分解干预期望。这些工作提供了通用归因框架,但通常假设因果充分性,且通过平均处理顺序非唯一性,而非将顺序视为科学定义的一部分(本文引言原话)。
- 本文位置:作者声称填补了“应用特定分解”与“一般归因框架”之间的缺口。本文提供逐分量图形识别条件,不要求因果充分性,允许非拓扑顺序(受控效应解释),并通过聚类处理并行结构,将顺序视为科学 estimand 的一部分而非需要平均的歧义。
子线索聚类¶
- 应用驱动的因果方差分解(Chen et al., 2020, 2022, 2023; Yu et al., 2025):针对医疗质量比较的具体DAG,定义并估计因果方差分量,但缺乏一般图形理论。
- 变量重要性(Khan et al., 2025; Hines et al., 2025; Paillard et al., 2025):关注单个变量对结果或异质性处理效应的贡献,不产生顺序多分量分解。
- 一般因果归因(Janzing et al., 2024; Saha et al., 2025; Gao & Zhao, 2024; Zhang & Gao, 2026; Jung et al., 2022):在结构因果模型或DAG下定义节点级归因,通常通过Shapley平均处理顺序,且常假设因果充分性。
本文属于第三条线索,但通过“逐分量识别”和“顺序作为科学定义”与第一条线索连接。
这个方向在追问的核心问题¶
- 因果方差分量的定义:如何将“方差解释”转化为因果 estimand?不同顺序对应不同因果问题。
- 可识别性:在存在未观测变量、非拓扑顺序时,哪些分量仍可由观测数据识别?需要什么图形条件?
- 顺序非唯一性:当DAG允许多个拓扑顺序时,如何得到唯一分解?平均(Shapley)还是聚类?
- 估计与推断:如何从有限样本中估计这些非线性泛函?如何量化不确定性?对模型误设的敏感性如何?
当前主流方法:应用特定分解(Chen等)使用参数模型plug-in估计;一般归因(Janzing等)使用Shapley平均和结构方程;变量重要性(Hines等)使用影响函数。已知瓶颈:缺乏统一图形识别理论;plug-in估计对模型误设敏感;效率理论尚未发展。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
作者把缺口 frame 成:“The decompositions of Chen et al. (2020, 2022, 2023) and Yu et al. (2025) establish causally interpretable variance components for particular DAGs and scientific questions, but do not provide general graphical conditions under which an arbitrary component of an ordered observed-data variance decomposition has a causal interpretation. … Conversely, Janzing et al. (2024); Saha et al. (2025) provide general graph-based attribution constructions, but focus on intrinsic node-wise contributions and resolve non-unique orderings through averaging. Existing results also typically formulate the topological case under unconfounded or causally sufficient models.” 因此本文的贡献是:逐分量识别、不要求因果充分性、顺序作为科学定义、允许非拓扑顺序和聚类。
被淡化或回避的竞争路线:作者明确选择不采用Shapley平均(Remark 3.5),理由是“当并行变量有共同科学角色时,我们更倾向于将它们合并为向量值节点”。这回避了Shapley平均在归因中的流行性。作者也没有发展效率理论(如影响函数),仅在讨论中提及“自然下一步是推导有效影响函数”。此外,作者没有与基于影响函数的变量重要性方法(Hines et al., 2025)进行直接比较,尽管后者也处理因果归因。
什么明显该被引/该存在、却没出现在intro里? 值得研究者去查的问题:关于方差分解的因果解释,是否有更早的统计文献(如Cox & Reid, 1987关于ANOVA的因果解释)?关于因果变量重要性的效率理论,Williamson et al. (2021, JASA) 的R-squared-based variable importance是否应被引用?关于半参数效率界在方差分解中的应用,目前似乎空白。这些缺失可能意味着作者有意聚焦于识别而非效率。
张力¶
未见明显对立引用。不同方法对顺序处理不同(平均 vs 固定),但作者将其视为科学选择而非矛盾。在因果充分性假设上,Janzing等和Saha等通常假设无潜在混杂,而本文明确允许未观测变量,这是更一般的设定,但代价是某些分量可能不可识别。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(Y\):结果变量(可观测,标量,本文模拟中为二值)。
- \(X_1, \dots, X_k\):解释变量(可观测,可以是向量值)。在运行例子中:\(Z\)(社会人口学组别,三分类),\(X\)(临床病例组合协变量,p维向量),\(A\)(医院分配,五分类)。
- \(U\):未观测的混杂变量(可能存在于完整因果图中,但不在分解中)。
- \(\prec\):用户指定的顺序,如 \(X_1 \prec X_2 \prec \cdots \prec X_k \prec Y\)。\(X_{\prec j} := X_{1:j-1}\) 表示在顺序中位于 \(X_j\) 之前的变量。
- \(\Delta_j\):第 \(j\) 个方差分量,定义为 \(\Delta_j = \mathbb{E}_{X_{\prec j}} \left[ \mathbb{V}_{X_j \mid X_{\prec j}} \left\{ \mathbb{E}(Y \mid X_{1:j}) \right\} \right]\)。
- \(\Delta_{\text{res}}\):残差分量,\(\Delta_{\text{res}} = \mathbb{E}_{X_{1:k}} \left[ \mathbb{V}(Y \mid X_{1:k}) \right]\)。
- \(do(X_j)\):Pearl的do-算子,表示对 \(X_j\) 进行干预。
- \(G\):完整因果DAG,可能包含未观测变量。
- \(\text{de}_G(X_j)\):在 \(G\) 中 \(X_j\) 的后代集合。
-
在修改顺序下:\(C_j^\sigma\) 为在顺序中位于 \(X_j\) 之前且是 \(X_j\) 后代的变量(受控变量),\(B_j^\sigma\) 为其余前置变量(候选调整集),\(E_j^\sigma = \{X_j\} \cup C_j^\sigma\) 为联合暴露集。
-
模型:
- 数据生成机制由非参数结构方程模型(NPSEM)表示,对应一个因果DAG \(G\)。变量间关系由结构方程决定,但本文不假设具体函数形式。关键假设是DAG正确且满足马尔可夫性。
- 可观测数据来自联合分布 \(P(X_1,\dots,X_k,Y)\),但完整因果图可能包含未观测变量 \(U\)。
-
本文不假设因果充分性(即允许存在未观测共同原因)。
-
可观测数据:
- 研究者观测到 \(n\) 个独立同分布样本 \(\{ (X_{1i},\dots,X_{ki}, Y_i) \}_{i=1}^n\)。
- 未观测变量 \(U\) 不出现在数据中,但影响识别条件。
- 想要但观测不到的量:干预分布 \(P(Y \mid do(X_j), X_{\prec j})\),以及因果方差分量 \(\Delta_j\) 的因果版本(即用do-期望替换条件期望后的分量)。识别条件保证在某些图形条件下,因果分量等于可观测的 \(\Delta_j\)。
第二步:最小内核¶
最简特例:考虑只有两个解释变量 \(X_1, X_2\) 和一个结果 \(Y\),DAG为 \(X_1 \rightarrow X_2 \rightarrow Y\),且无未观测混杂(因果充分)。拓扑顺序为 \(X_1 \prec X_2 \prec Y\)。则方差分解为:
核心思路:每个分量的因果解释等价于其内部的条件期望等于对应的do-期望。而do-期望的识别条件就是:前置变量 \(X_{\prec j}\) 构成 \(X_j\) 对 \(Y\) 总效应的有效调整集。在拓扑顺序下,由于 \(X_{\prec j}\) 包含所有 \(X_j\) 的非后代且阻断所有后门路径,该条件自动成立。当存在未观测混杂时,某些分量可能失效,但其他分量可能仍成立——这就是逐分量识别。
推广到一般情形:论文的一般设定只是这个特例的“加壳”:更多变量、非拓扑顺序、未观测变量、向量值节点。核心数学困难在于:当顺序不是拓扑时,前置变量可能包含后代,此时不能直接使用后门准则,需要将后代视为受控变量,并检验剩余前置变量是否构成联合暴露集的有效调整集(Proposition 3.6)。这个条件比拓扑情形更严格,但提供了更丰富的科学解释(如受控效应)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在因果DAG框架下,为有序方差分解的每个分量建立因果解释和可识别性条件,允许分解变量仅为完整因果系统的子集(含未观测变量),并允许用户指定非拓扑顺序以获得受控效应解释。
- 核心工具/方法:利用do-calculus和图形调整准则,逐分量检验前置变量是否为有效调整集;对于非拓扑顺序,将前置后代视为受控变量,检验剩余前置变量是否为联合暴露集的有效调整集;通过聚类(向量值节点)处理并行结构以获得唯一拓扑顺序;提出基于顺序因子分解的模型基plug-in点估计和近似贝叶斯不确定性量化。
- 主要结论:在拓扑顺序下,若因果图因果充分,则所有分量自动识别(Corollary 3.2);否则,每个分量需单独检验前置变量是否为有效调整集(Proposition 3.1)。在非拓扑顺序下,若前置后代被控制、剩余前置变量构成联合暴露集的有效调整集,则该分量有受控效应因果解释(Proposition 3.6)。模拟表明,在正确模型设定下plug-in估计表现合理,但对模型误设和灵活ML估计敏感。
关键设定与假设¶
- 设定:给定一个因果DAG \(G\),其中节点包括观测变量(部分用于分解)和可能的未观测变量。用户指定一个顺序 \(\sigma\)(可以是拓扑或非拓扑)和一组要分解的观测变量 \(X_1,\dots,X_k\)(可能只是 \(G\) 中观测变量的子集)。结果 \(Y\) 总是最后。
- 关键假设:
- DAG正确性:\(G\) 正确编码了变量间的因果结构(包括未观测变量)。
- 马尔可夫性:每个变量条件独立于其非后代(给定其父节点)。
- 一致性:\(Y\) 的观测值等于在给定实际处理下的潜在结果(SUTVA的组成部分)。
- 无选择偏差:样本独立同分布来自观测联合分布。
- 调整集有效性:对于每个分量,需要检验前置变量(或调整集)是否满足后门准则或更一般的调整准则(可通过dagitty函数验证)。这是可检验的图形条件,而非统计假设。
- 相比已有文献的放宽/强化:
- 放宽了因果充分性假设(允许未观测变量),而Janzing et al. (2024) 和 Saha et al. (2025) 通常假设无潜在混杂。
- 强化了顺序的角色:顺序是科学定义的一部分,而非需要平均的歧义(与Shapley平均方法相反)。
- 允许非拓扑顺序,这在Chen et al. (2020) 和 Yu et al. (2025) 中已有应用,但本文首次给出一般图形识别条件。
主要结果¶
理论结果:
- Proposition 3.1(拓扑顺序下逐分量识别):若 \(X_{\prec j}\) 是 \(X_j\) 对 \(Y\) 总效应的有效调整集(在完整图 \(G\) 中),则 \(\mathbb{E}(Y \mid X_j, X_{\prec j}) = \mathbb{E}(Y \mid do(X_j), X_{\prec j})\),从而 \(\Delta_j\) 的因果版本由观测数据识别。证明直接来自do-calculus规则2。
- Corollary 3.2(因果充分特例):若 \(G\) 因果充分且顺序拓扑,则每个 \(X_{\prec j}\) 自动是有效调整集,所有分量识别。证明:拓扑顺序保证 \(X_{\prec j}\) 包含所有父节点且阻断所有后门路径。
- Proposition 3.4(通过聚类获得唯一拓扑顺序):若变量可划分为反链(antichains),使得每个反链中变量互不为祖先,且反链间有全序,则聚类后的节点有唯一拓扑顺序。这给出了不通过平均而获得唯一分解的方法。
- Proposition 3.6(修改顺序下逐分量识别):对于非拓扑顺序,令 \(C_j^\sigma\) 为前置后代(受控变量),\(B_j^\sigma\) 为其余前置变量。若 \(B_j^\sigma\) 是联合暴露集 \(E_j^\sigma = \{X_j\} \cup C_j^\sigma\) 对 \(Y\) 总效应的有效调整集,则 \(\mathbb{E}(Y \mid X_j, X_{\prec j}^\sigma) = \mathbb{E}(Y \mid do(E_j^\sigma), B_j^\sigma)\),从而 \(\Delta_j^\sigma\) 有受控效应因果解释。证明类似,将条件分布重写为给定联合暴露和调整集。
技术难点:这些命题本身不涉及复杂证明,核心难点在于识别条件的图形检验——需要判断给定调整集是否满足后门准则或更一般的调整准则。本文依赖dagitty包实现,但理论上需要处理可能包含未观测变量的图。另一个难点是非拓扑顺序下联合暴露集的定义:需要区分前置后代和非后代,这依赖于用户顺序和DAG。
估计与推断: - 点估计:基于顺序因子分解的plug-in估计。将联合分布按顺序分解为条件分布乘积,对每个因子拟合参数模型(如逻辑回归、多项逻辑回归),然后通过嵌套期望和方差公式计算分量。对于第一个变量,可用经验分布。对于修改顺序,需拟合 \(Z \mid X\) 等模型。 - 近似贝叶斯不确定性量化:对每个条件模型的参数,从渐近正态后验(MLE + 协方差矩阵)独立抽样;对经验分布部分,使用贝叶斯自助(Dirichlet权重)。然后对每个后验样本重新计算分量,得到后验样本,用分位数构造区间。 - 模拟结果:在运行例子(图1 DAG)下,当结果模型正确指定时,参数plug-in估计偏差小;当存在 \(Z\)-\(A\) 交互但模型遗漏时,\(\Delta_A\) 被低估、\(\Delta_{\text{res}}\) 被高估;XGBoost(调参优化预测损失)产生持续偏差,尤其在修改顺序的 \(\Delta_Z\) 和拓扑顺序的 \(\Delta_X\) 上。覆盖概率在正确模型下接近名义水平,但在分量真值接近零时(拓扑 \(\Delta_Z\))欠覆盖。
证明路线与技术技巧¶
整体路线(以Proposition 3.1为例): 1. 固定 \(j\),假设 \(X_{\prec j}\) 是 \(X_j\) 对 \(Y\) 的有效调整集。 2. 由调整集定义,在删去 \(X_j\) 出射边的图 \(G_{X_j}\) 中,\(Y \perp X_j \mid X_{\prec j}\)。 3. 由do-calculus规则2(行动/观察交换),\(p(y \mid do(x_j), x_{\prec j}) = p(y \mid x_j, x_{\prec j})\)。 4. 因此 \(\mathbb{E}(Y \mid do(X_j), X_{\prec j}) = \mathbb{E}(Y \mid X_j, X_{\prec j})\)。 5. 代入 \(\Delta_j\) 的定义即得识别。
关键跳跃点:没有跳跃——这是do-calculus的直接应用。真正的技术贡献在于将方差分解的每个分量与一个do-期望联系起来,并给出可操作的图形检验条件。这需要将方差分解的嵌套结构拆解为条件期望的序列,然后对每个条件期望应用识别条件。
技术技巧点名:
- do-calculus规则2:用于将条件期望转化为干预期望。
- 后门准则/调整准则:用于检验前置变量是否为有效调整集。本文使用dagitty包的isAdjustmentSet函数,该函数实现了一般调整准则(Shpitser & Pearl, 2006)。
- 顺序因子分解:将联合分布按用户顺序分解,使plug-in估计与识别条件对齐。
- 贝叶斯自助:用于传播经验分布的不确定性,与参数模型的渐近正态后验结合。
- 嵌套期望与方差的重写:公式(8)将方差分解写为嵌套条件期望和方差的形式,便于plug-in估计。
真实例子与应用¶
本文为纯方法+模拟,无真实数据例子。模拟基于运行例子(图1 DAG),数据生成机制包括三分类组别 \(Z\)、p维协变量 \(X\)(p=5或15)、五分类医院 \(A\)、二值结果 \(Y\)。模拟评估了不同样本量(n=500,1500)、维度、交互强度(\(\gamma_{ZA}=0,0.6,1.0\))下的点估计偏差、标准差、RMSE,以及近似贝叶斯区间的覆盖概率。模拟旨在说明: - 正确指定的参数模型表现良好。 - 遗漏交互导致 \(\Delta_A\) 和 \(\Delta_{\text{res}}\) 的系统偏差。 - XGBoost(调参优化预测损失)产生持续偏差,说明预测性能不保证方差分解泛函的准确估计。 - 覆盖概率在分量真值远离零时较好,接近零时欠覆盖。
🔎 结论是否比证明窄¶
- Proposition 3.1和3.6的结论与证明一致:它们只给出了充分条件(“如果调整集有效,则识别”),没有讨论必要性。作者没有声称这些条件是必要的,但模拟中未检验必要性。
- Corollary 3.2 声称在因果充分且拓扑顺序下“每个非残差分量的因果方差分量被识别”。这是正确的,但注意它假设了因果充分性(无未观测混杂)。在引言中,作者强调“不要求因果充分性”,但Corollary 3.2本身是因果充分特例。这并不矛盾,因为一般情形下需要逐分量检验。
- 关于聚类与唯一拓扑顺序(Proposition 3.4):结论是“ordered variance decomposition is uniquely defined at the cluster level”。但注意,聚类改变了 estimand(将多个变量归为一个分量),并非原始分解的唯一化。作者在Remark 3.5中明确说“我们不追求平均”,所以这是设计选择而非证明的推广。
- 估计部分:作者提出了plug-in估计和近似贝叶斯,但没有给出渐近性质(如相合性、渐近正态性)。模拟提供了有限样本证据,但理论性质未证明。作者在讨论中承认“自然下一步是推导有效影响函数”,暗示当前估计方法可能不是最优的。
- 结论是否比证明窄:总体而言,论文的识别理论部分(命题)是严谨的,但估计部分缺乏理论保证。作者在摘要和结论中声称“propose model-based plug-in estimators together with an approximate Bayesian procedure”,但未证明这些估计量的渐近性质。因此,估计部分的结论(“这些估计量有效”)比证明(无渐近理论)宽。模拟仅覆盖特定数据生成机制,不能一般化。
四、开放问题(点到为止,扎根具体语句)¶
-
效率影响函数与偏差校正估计:论文第28页讨论中写道:“A natural next step is therefore to derive efficient influence functions for the individual components and use them to construct bias-corrected one-step or targeted estimators.” 这是一个明确的开放问题:为每个因果方差分量推导半参数效率界和有效影响函数,并构造双稳健或去偏ML估计量。扎根于Discussion段落。
-
贝叶斯不确定性量化的改进:论文第29页写道:“A proper Bayesian implementation based on posterior sampling by MCMC could avoid reliance on Gaussian approximations and propagate uncertainty jointly through the fitted conditional models.” 当前近似贝叶斯方法使用独立渐近正态抽样和贝叶斯自助,可能低估不确定性(模拟中覆盖不足)。开发全贝叶斯MCMC方法是一个方向。
-
敏感性分析:论文第29页写道:“sensitivity analysis over plausible graphs, orderings, or cluster definitions may be important.” 当前框架假设因果图和顺序已知,但实际中这些选择可能不确定。发展对图形误设、顺序选择、聚类粒度的敏感性分析方法是一个开放问题。
-
干预因果方差分解:论文第29页写道:“To quantify disparities that remain after hypothetical interventions on downstream variables that are well-defined intervention targets, the present framework can be extended to interventional causal variance decompositions, in which the variance of an interventional potential outcome is decomposed.” 当前分解的是观测结果 \(Y\) 的方差,而非干预后潜在结果的方差。将框架扩展到干预方差分解(如Chen et al., 2020中的思路)是一个自然延伸。
-
高维设定下的估计:模拟中 \(p=15\) 已显示较大变异性,但未涉及 \(p \gg n\) 的高维情形。当协变量维度高时,如何估计条件分布并保持方差分解的稳定性?这可能需要正则化或降维技术。论文未讨论此点,但可视为隐含开放问题。
Maintained by 陈星宇 · Homepage · Source on GitHub