On inferential equivalence classes of causal models¶
作者: Charlotte Edgar, Heather Battey
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.08327
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是因果模型在有限样本下的可区分性与不确定性量化。核心问题是:当样本量有限时,哪些因果模型(有向无环图)与观测数据在统计上不可区分?传统因果发现输出一个 Markov 等价类(在无额外假设下,同一等价类内的模型在任何样本量下都不可区分),但有限样本下,多个不同的 Markov 等价类也可能与数据兼容。因此,需要构建一个因果模型的置信集(confidence set of causal models),即所有在给定显著性水平下未被数据拒绝的因果模型的集合。该方向试图从真实因果机制的结构性质出发,探明因果推断中可达到的极限。
发展脉络(history)¶
- 奠基工作:Cox (1968, 1977) 和 Cox & Snell (1974, 1989) 很早就强调模型不确定性,指出在稀疏回归中应报告多个兼容模型而非单一选择。但这一观点长期未获重视。Cox & Wermuth (1993) 提出了高斯因果模型的无约束参数化((A, Δ) 参数化),避免了锥约束,为后续置信集构建提供了关键工具。
- 主要进展:Evans (2020) 提出了 c-等价类(c-equivalence)的概念,刻画了两个模型在参数空间交点附近的局部几何接近程度,并证明:区分两个模型所需的样本量增长率取决于它们的 c-等价类(c 越大,模型越接近,需要更慢的信号衰减才能区分)。该工作为理解有限样本下模型的可区分性提供了几何框架。Cox & Battey (2017) 和 Battey & Cox (2018) 在高维回归背景下重新强调了置信集的重要性,并提出了基于不完全区组设计的变量约简方法。Lewis & Battey (2025) 和 Battey et al. (2026) 进一步从理论上阐明了置信集的几何性质和约简策略。
- 当前 frontier:Wang et al. (2026) 首次将置信集思想引入因果模型,提出了基于 bootstrap 的因果排序置信集构建方法,并证明了渐近有效性。但该方法较为复杂,且未深入分析不同模型被包含的概率差异。
- 本文的位置:本文在 Wang et al. (2026) 的基础上,利用 Cox & Wermuth (1993) 的无约束参数化,提出了一种更简单的基于似然比检验的置信集构建方法。更重要的是,本文通过嵌入 Evans (2020) 的几何框架,系统分析了当真实参数处于可检测性边界时,不同因果模型被包含在置信集中的概率如何随样本量和信号强度变化,并首次研究了多个因果模型同时作用(混合)的情形。
子线索聚类¶
- 模型选择与局部几何:以 Evans (2020) 为核心,研究模型对在交点附近的几何性质如何决定其可区分性。该线索给出了 c-等价类的定义,并证明区分不同 c-等价类的模型需要不同的样本量增长率。本文直接继承并应用了这一框架。
- 置信集构建与理论:以 Cox & Battey (2017)、Lewis & Battey (2025)、Battey et al. (2026) 为代表,关注如何在高维或低维回归中构建模型的置信集,并分析其性质。本文将其扩展到因果模型,并利用无约束参数化简化了构建。
- 因果发现的不确定性量化:以 Wang et al. (2026) 为代表,专门针对因果模型(DAG)构建置信集。本文与之直接竞争,但采用了不同的构建方法(似然比 vs. bootstrap),并提供了更细致的理论分析(包含概率的衰减率)。
- 混合因果模型:本文独有地引入了混合因果模型(不同个体可能由不同因果机制生成),并分析了置信集在混合情形下的行为。该线索与 Goldthorpe (2025) 关于社会学中“三角验证”的讨论相呼应。
这个方向在追问的核心问题¶
- 有限样本下,哪些因果模型与数据兼容? 即如何构建一个有效的置信集,使得真实模型以给定概率被包含。
- 不同错误模型被包含的概率如何随样本量和信号强度变化? 是否存在一个清晰的“阈值”,使得某些模型在信号足够强时被排除,而另一些则始终难以排除?
- 当多个因果机制同时作用(混合)时,置信集能否恢复所有成分? 混合权重和模型几何如何影响包含概率?
- 如何将置信集思想推广到非高斯、非参数或更复杂的因果模型? 当前工作主要限于高斯线性 DAG。
⚠️ 作者的 framing¶
作者将缺口 frame 为:现有因果发现文献(除 Wang et al. 2026 外)几乎不关注模型不确定性,而 Wang et al. (2026) 的 bootstrap 方法复杂且未深入分析几何性质。因此,本文的“显然的下一步”是:利用 Evans (2020) 的几何框架和 Cox-Wermuth 无约束参数化,提供一个更简单、更具理论洞察的置信集构建方法,并首次研究混合因果模型。
被淡化或回避的竞争路线: - 作者明确提到“With the exception of Wang et al. (2026), none of this literature concerns causal models.” 这暗示其他置信集工作(如 Lewis & Battey 2025)主要针对回归模型,而非因果模型。但作者未讨论这些回归置信集方法是否可直接迁移到因果设定(例如通过将因果模型视为结构方程模型)。 - 作者未提及贝叶斯方法(如贝叶斯网络结构学习中的后验概率或模型平均),这些方法也处理模型不确定性,但通常依赖于先验和 MCMC。作者可能认为频率学派置信集更符合“证据呈现”的哲学。
什么明显该被引 / 该存在、却没出现在 intro 里? - 因果发现中关于“等价类”的经典文献(如 Chickering 2002, Spirtes et al. 2000)未被引用,尽管 Markov 等价类是本文的起点。作者可能认为这些是常识,但作为综述,提及它们有助于定位。 - 关于“部分可识别性”或“部分祖先图”(PAG)的文献(如 Zhang 2008)也未出现,这些工作处理的是存在潜在混淆时的因果结构不确定性,与本文的“有限样本不可区分性”有交叉但不同。值得研究者去查:是否存在将置信集思想扩展到部分可识别设定的工作?
张力¶
未见明显对立引用。所有被引工作基本一致地认为模型不确定性需要被量化,且 Evans (2020) 的几何框架是分析可区分性的有力工具。本文与 Wang et al. (2026) 是直接竞争关系,但作者将其定位为互补(更简单、更深入的理论分析),而非对立。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \( Y = (Y_1, \dots, Y_d)^T \):d 维可观测随机向量,假设均值为零。 - \( \Sigma = \text{Cov}(Y) \):协方差矩阵。 - \( \Sigma^{-1} \):精度矩阵。 - \( \gamma = \text{vech}(\Sigma) \in \mathbb{R}^{d(d+1)/2} \):将对称矩阵 Σ 的下三角部分拉直为向量,用于参数化。 - \( A \):下三角矩阵(在给定因果排序下),对角线为 1,非对角线元素 \( a_{ij} = -\beta_{ij \mid \text{par}(i) \setminus j} \),即负的回归系数。 - \( \Delta \):对角矩阵,\( D = e^\Delta \) 是误差协方差矩阵。 - 模型 \( m_j \):一个因果模型,由 A 中零元素的位置(缺失边)和因果排序共同定义。 - \( \hat{\Sigma}^{-1}_j \):在模型 \( m_j \) 下约束的最大似然估计的精度矩阵。 - \( \gamma^* \):两个模型在参数空间中的交点(即两个模型都兼容的分布)。 - \( a^{(n)}_0 \):真实模型参数 \( \gamma^{(n)}_0 \) 与交点 \( \gamma^* \) 的偏差,即 \( \gamma^{(n)}_0 = \gamma^* + a^{(n)}_0 \)。 - \( c \)-等价类:描述两个模型在交点附近几何接近程度的指标(定义见后)。 - \( \theta \):混合权重,用于混合模型。
模型: - 数据生成机制:假设 \( Y \) 服从均值为零的高斯分布,且其依赖结构由一个未知的有向无环图(DAG)描述。给定一个因果排序(变量的拓扑序),存在下三角矩阵 A 和对角矩阵 Δ 使得 \( \Sigma^{-1} = A^T e^{-\Delta} A \)。缺失边对应 A 中的零元素。 - 可观测数据:独立同分布样本 \( Y_1, \dots, Y_n \),每个是 d 维向量。充分统计量是样本协方差矩阵 \( S_n = n^{-1} \sum_{i=1}^n Y_i Y_i^T \)。 - 想要但观测不到:真实的因果排序、真实的 DAG 结构、真实的参数 A 和 Δ。这些只能通过假设和统计推断来估计。
第二步:最小内核——三变量情形¶
本文的核心思想可以通过 三个变量 X, Y, Z 的最简情形完全展现。假设三个变量中恰好有一条缺失边(即只有两条有向边),那么共有 12 种可能的 V 形结构(见表 1)。这些结构分为 6 个 Markov 等价类(例如,模型 1: X→Y←Z 是单元素等价类;模型 2-4 是同一个等价类,对应链或分叉结构)。
最小内核问题:给定真实模型是其中之一(例如模型 1: X→Y←Z,即 Y 是碰撞节点),当样本量 n 有限且信号强度(即非零的因果效应大小)处于可检测性边界时,哪些其他模型会被错误地保留在 95% 置信集中?保留概率如何随 n 和信号强度变化?
核心数学困难:不同模型在参数空间中的几何接近程度不同。例如,模型 1 和模型 2(X←Y→Z)共享相同的骨架(无向图 X—Y—Z),但方向不同。它们在参数空间中相交于一个点(例如所有因果效应为零的点)。Evans (2020) 证明,共享相同骨架的模型是 2-近等价(2-near-equivalent)的,而骨架不同的模型是 1-近等价(1-near-equivalent)的。这意味着,要区分 2-近等价的模型,需要信号强度衰减慢于 \( n^{-1/4} \);而要区分 1-近等价的模型,只需要信号衰减慢于 \( n^{-1/2} \)(即标准参数速率)。
本文的关键想法:利用 Cox-Wermuth 无约束参数化,对每个候选模型进行似然比检验(与饱和模型比较),将所有未被拒绝的模型纳入置信集。然后,通过 Evans 的几何框架和 van der Vaart 的局部似然比理论,分析当真实参数以不同速率趋近交点时,每个错误模型的包含概率如何变化。具体地,Proposition 5.1 指出:如果错误模型与真实模型是 c-等价的,且真实参数偏离交点的速率 \( a^{(n)}_0 \lesssim n^{-1/(2c)} \),则该错误模型会以渐近名义概率被保留;否则以概率趋于 0 被保留。
例子:在图 3 中,真实模型为模型 1,信号强度 \( a^{(n)}_0 = n^{-1/4} \) 时,2-近等价模型(模型 2)的保留概率稳定在约 0.9(接近名义水平 0.95),而 1-近等价模型(模型 5)的保留概率随 n 增大而衰减到 0。当信号强度 \( a^{(n)}_0 = n^{-1/6} \) 时,2-近等价模型也开始衰减。这直观验证了理论阈值。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高斯线性 DAG 设定下,如何构建因果模型的置信集,并分析不同错误模型被包含的概率如何随样本量和信号强度变化,以及当多个因果机制混合时置信集的行为。
- 核心工具/方法:利用 Cox & Wermuth (1993) 的无约束参数化 (A, Δ) 避免锥约束,基于似然比检验构建置信集;嵌入 Evans (2020) 的 c-等价类几何框架,结合 van der Vaart (2000) 的局部似然比理论(contiguous alternatives)分析包含概率的渐近行为。
- 主要结论:错误模型被保留的概率取决于其与真实模型的 c-等价类:c 越大(模型越接近),需要越慢的信号衰减(即更大的样本量或更强的效应)才能将其排除。对于混合模型,包含概率由混合权重和成分模型的几何共同决定,只有权重足够大的成分才能以名义概率被保留。
关键设定与假设¶
- 高斯性:所有变量联合高斯,均值为零。这是似然比检验和几何分析的基础。
- 线性 DAG:因果结构由有向无环图描述,且效应是线性的。
- 无潜在混淆:假设所有相关变量都被观测到,且没有隐藏的公共原因(即因果充分性假设)。这使得 Markov 等价类成为不可区分性的唯一来源。
- 正则性:真实参数在模型参数空间内部(非边界),确保标准似然渐近理论适用。
- 无约束参数化:使用 (A, Δ) 参数化,其中 A 是下三角矩阵(给定排序),非零元素可任意取值而不破坏正定性。这避免了锥约束,使得似然比统计量渐近服从 χ² 分布。
- c-等价类定义:基于 Hausdorff 距离在交点附近球内的衰减速率(定义 5.1)。本文主要使用 c-近等价(c-near-equivalence)以获得更锐利的阈值。
相比已有文献:本文的假设与 Wang et al. (2026) 类似(高斯、线性、无混淆),但构建方法更简单(无需 bootstrap)。相比 Evans (2020),本文将其几何结果从“模型对的可区分性”转化为“置信集中模型的包含概率”,并推广到混合模型。
主要结果¶
- Proposition 5.1(核心定理):设真实模型 \( m_0^{(n)} \) 的参数以速率 \( a_0^{(n)} \) 趋近交点 \( \gamma^* \),错误模型 \( m_1^{(n)} \) 与 \( m_0^{(n)} \) 在 \( \gamma^* \) 处 c-等价。则当 \( a_0^{(n)} \lesssim n^{-1/(2c)} \) 时,\( m_1^{(n)} \) 以概率 \( 1-\alpha+o(1) \) 被保留在置信集中;否则以概率 \( o(1) \) 被保留。此外,同一 Markov 等价类中的所有模型总是以名义概率被保留。
- 直觉:c 越大,模型越“接近”,需要更慢的信号衰减(即更大的 n 或更强的效应)才能区分。阈值 \( n^{-1/(2c)} \) 来自局部似然比检验的非中心参数计算。
- Proposition 5.2:在真实参数趋近交点时,错误模型下的 KL 投影参数也以相同速率趋近交点,且 MLE 的波动为 \( O_p(n^{-1/2}) \)。这保证了 Proposition 5.1 的 contiguity 框架适用。
- Proposition 6.1 & Corollaries 6.1-6.2(混合模型):对于两成分混合模型 \( (1-\theta)F_{0,1} + \theta F_{0,2} \),若两成分模型是 c-等价的,则混合模型与任一成分的 c-等价类由 min{c, c_1, c_2} 等决定。当 \( \theta = O(n^{-1/2}) \) 时,权重较大的成分(如 \( m_{0,1} \))总是以名义概率被保留,而权重较小的成分(\( m_{0,2} \))仅在信号足够强时被保留。对于不在混合中的错误模型,其保留概率由最接近的成分的 c-等价类决定。
证明路线与技术技巧¶
整体路线(以 Proposition 5.1 为例): 1. 局部参数化:将模型参数在交点 \( \gamma^* \) 附近局部缩放,定义 \( h = \sqrt{n}(\gamma - \gamma^*) \)。真实模型对应 \( h_0 = \sqrt{n} a_0^{(n)} \),错误模型对应 \( h_1 = \sqrt{n} a_1^{(n)} \)。 2. 似然比统计量的渐近分布:利用 van der Vaart (2000, Theorem 16.7),在 contiguity 下,似然比统计量 \( \Lambda_n \) 收敛到非中心 χ² 分布,非中心参数为 \( \delta = \inf_{h_1 \in H_1} \| I^{1/2} h_0 - I^{1/2} h_1 \| \),其中 \( H_1 \) 是错误模型的局部参数空间。 3. c-等价与 δ 的衰减:若 \( m_1 \) 与 \( m_0 \) 是 c-等价的,则 \( a_1^{(n)} = a_0^{(n)} + o(\|a_0^{(n)}\|^c) \)。当 \( a_0^{(n)} \lesssim n^{-1/(2c)} \) 时,\( h_1 = o(1) \),从而 δ → 0,Λ_n 收敛到中心 χ²,模型不被拒绝。否则 δ 发散,Λ_n 趋于无穷,模型被拒绝。 4. Markov 等价类:若 \( m_1 \sim m_0 \),则 \( \hat{\Sigma}^{-1}_1 = \hat{\Sigma}^{-1}_0 \),似然比统计量相同,因此总是被保留。
关键跳跃点: - 将 Evans 的几何定义(Hausdorff 距离的衰减速率)转化为局部参数空间中 \( h_1 \) 的衰减速率。这需要证明 c-等价意味着 \( a_1^{(n)} = a_0^{(n)} + o(\|a_0^{(n)}\|^c) \)(Evans 2020, p.3538)。 - 在混合模型证明中,需要处理混合分布的非高斯性。作者通过将混合模型视为凸组合,并利用 Hausdorff 距离的线性性质(Lemma B.1),将混合模型的几何与成分模型的几何联系起来。
技术技巧点名: - van der Vaart (2000) 的局部渐近正态性:用于推导似然比统计量在 contiguity 下的极限分布。 - Hausdorff 距离:用于量化模型集合在交点附近的接近程度。 - Cox-Wermuth 无约束参数化:避免锥约束,使得似然比统计量渐近 χ²,且参数空间是欧几里得空间,便于几何分析。 - Markov 不等式与经验过程:在 Proposition 5.2 的证明中,用于控制 MLE 的收敛速率(见附录 A.2)。
真实例子与应用¶
本文为纯理论论文,但包含大量模拟实验来验证理论结果: - 三变量 12 个模型(图 1、图 3、附录 C 图 7-10):固定信号强度(如 \( a_{ij} = n^{-1}, n^{-1/2}, n^{-1/4}, n^{-1/6} \)),模拟 500 次,计算每个模型被保留的比例。结果清晰展示了:同一 Markov 等价类保留概率接近名义水平;2-近等价模型在信号衰减慢于 \( n^{-1/4} \) 时保留概率高,否则衰减;1-近等价模型在信号衰减慢于 \( n^{-1/2} \) 时保留概率高,否则衰减。这些模拟直接验证了 Proposition 5.1 的阈值。 - 混合模型(图 5、图 6):两成分混合(模型 1 和模型 2)和三成分混合(模型 1、2、5),在单纯形上展示保留概率。结果支持 Corollary 6.1 和 6.2:权重大的成分总是保留,权重小的成分仅在信号足够强时保留;错误模型(如模型 12)几乎从不保留。
这些模拟的目的是验证理论预测的阈值行为,而非展示方法在实际数据上的优越性。作者明确说“The formulations of this paper belong to formal theory and are intended to provide understanding rather than direct utility.”
🔎 结论是否比证明窄¶
- 作者在 Proposition 5.1 中假设真实参数在参数空间内部(interior),这保证了标准 χ² 渐近。但实际中,真实参数可能接近边界(例如因果效应接近零),此时渐近可能不准确。作者未讨论边界情况。
- 混合模型的结果(Corollary 6.1)假设 \( \theta = O(n^{-1/2}) \),即混合权重以参数速率衰减。作者在正文中未解释这一假设的合理性,仅在证明中用于构造 contiguity。实际中,θ 可能是固定的,此时结论是否成立?作者未讨论。
- 作者在 §7 提到“One obvious extension... is to confidence sets for the mixture models themselves”,但本文只研究了成分模型的保留概率,未构建混合模型本身的置信集。因此,结论比“混合模型置信集”这个更一般的问题窄。
四、开放问题¶
-
非高斯与非线性模型的扩展:本文的构建和理论严重依赖高斯性和线性。作者在 §7 提到“In principle, the construction of §4 can be extended by using the factorisation property of directed acyclic graphs”,但未给出具体方案。一个开放问题是:对于非参数或半参数因果模型(如加性噪声模型),如何构建置信集并分析其几何性质?这需要将 c-等价类推广到非参数设定,并处理似然比检验的渐近分布(可能涉及经验过程)。扎根点:§7 最后一段。
-
混合模型本身的置信集:本文只分析了混合模型中成分模型的保留概率,但未构建混合模型(即混合分布本身)的置信集。这需要估计混合权重 θ 并处理其作为 nuisance 参数的影响。作者指出“This is more complicated due to estimation of the nuisance parameter θ and the many combinations of c-equivalences”。扎根点:§7 第二段。
-
三角验证的形式化:作者提到 Goldthorpe (2025) 的“三角验证”问题,即如何结合多个研究的置信集来推断因果机制。本文仅提供了非正式建议(记录不同样本量下各模型被保留的比例)。一个开放问题是:如何设计一个正式的统计程序,将来自不同样本量、不同设计的置信集合并,以得到更可靠的因果结论?这可能需要考虑不同研究的异质性和选择偏差。扎根点:§7 第三段。
-
高维因果模型的置信集:本文假设变量数 d 固定。当 d 随 n 增长时,似然比检验的自由度 \( d(d+1)/2 \) 也会增长,导致检验功效下降。如何在高维稀疏因果图中构建置信集?可能需要结合变量约简(如 Battey et al. 2026 的 co-sufficiency 分离)和正则化技术。扎根点:本文未涉及高维,但作者所在团队有高维回归置信集的工作(Lewis & Battey 2025),可视为自然延伸。
Maintained by 陈星宇 · Homepage · Source on GitHub