Valid Inference After Causal Discovery¶
作者: Paula Gradu, Tijana Zrnic, Yixin Wang, Michael I. Jordan
来源: Journal of the American Statistical Association
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:当研究者使用同一数据集,先运行一个因果发现算法(如 PC、GES)来学习因果图结构,再基于该结构估计因果效应时,经典置信区间的覆盖性质会如何失效,以及如何构造有效的推断方法。 其核心矛盾在于:因果发现步骤本身是一个数据驱动的模型选择过程,它引入了“双重 dipping”——效应估计的置信区间没有考虑结构选择的不确定性,导致覆盖严重不足。当前该方向处于从“发现问题”到“提供通用解决方案”的过渡阶段:已有大量工作指出了选择性推断偏差的存在,但缺乏一个系统性的、适用于任意因果发现算法的后选择推断框架。
发展脉络(history)¶
-
奠基工作:选择性推断与后选择推断的统计基础
- Berk et al. (2013) “Valid post-selection inference”:奠定了“在数据驱动模型选择后进行有效推断”的理论基础,提出了在给定所选模型(如 Lasso 选出的变量集)的条件下构造条件置信区间的方法。这是本文最核心的统计工具来源之一。
- Lee et al. (2016) “Exact post-selection inference, with application to the lasso”:将 Berk 等人的框架具体化到 Lasso 上,给出了精确的条件分布。本文引用了这些工作,将其作为“后选择推断”的通用模板。
-
主要进展:因果发现中的不确定性量化
- Spirtes et al. (2000) “Causation, Prediction, and Search”:系统介绍了 PC 算法等经典因果发现方法,但主要关注点在于结构学习的准确性,而非后续推断的有效性。本文指出,这些方法“do not provide valid inference for causal effects after discovery”。
- Zhang & Spirtes (2011) “Bootstrapping causal graphs”:尝试用 Bootstrap 来量化因果图的不确定性,但本文认为这种方法“does not guarantee coverage for the causal effect after discovery”,因为它没有解决“双重 dipping”的核心问题——选择步骤与估计步骤共享同一数据。
-
当前 Frontier:将后选择推断框架引入因果发现
- 本文 (Gradu et al., 2024):首次系统性地将后选择推断(post-selection inference)框架应用于因果发现后的效应估计。核心创新在于:将因果发现算法视为一个“黑箱”模型选择器,通过条件校准(conditional calibration) 技术,构造在给定因果发现输出(如图结构、等价类)条件下的置信区间,从而保证条件覆盖。这不同于以往试图“量化图结构不确定性”的尝试,而是直接处理“选择后推断”的统计问题。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 后选择推断(Post-Selection Inference):以 Berk et al. (2013) 和 Lee et al. (2016) 为代表。这一簇的核心是:给定一个数据驱动的模型选择结果(如 Lasso 选出的变量集),如何构造在该选择结果下的有效置信区间。其数学工具是条件分布和选择性推断。本文直接借用这一框架,但将“模型选择”替换为“因果发现”。
- 因果发现与不确定性量化:以 Spirtes et al. (2000) 和 Zhang & Spirtes (2011) 为代表。这一簇关注如何从观测数据中学习因果图,并量化图结构本身的不确定性(如边的存在性、方向)。本文的立场是:这些方法没有解决“双重 dipping”问题,因为它们要么忽略了后续推断,要么用 Bootstrap 等非条件方法处理,无法保证条件覆盖。
这个方向在追问的核心问题¶
- 如何定义“选择后”的条件? 因果发现输出的是一个图结构(或等价类),而不是一个简单的变量集。如何将这个复杂的输出转化为一个可用于条件推断的“选择事件”?
- 如何保证条件覆盖? 经典置信区间保证的是无条件覆盖(即重复抽样中,95% 的区间包含真值)。但后选择推断需要保证的是在给定选择结果下的条件覆盖。如何构造这样的区间?
- 如何权衡发现准确性与区间宽度? 更保守的发现(如只输出高置信度的边)会导致更窄的区间,但可能遗漏真实结构;更激进的发现则相反。如何显式地控制这个权衡?
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将问题 frame 为“后选择推断”的一个特例,即“后因果发现推断”。他们声称,现有因果发现方法“do not provide valid inference for causal effects after discovery”,而他们的方法“provides reliable coverage while allowing for a trade-off between causal discovery accuracy and confidence interval width”。这使他们自己的工作成为“显然的下一步”:既然后选择推断在 Lasso 等场景下已经成熟,那么将其推广到因果发现这个更复杂的“选择器”上,就是自然的延伸。
- 被淡化或回避的竞争路线:作者淡化了贝叶斯方法。贝叶斯方法(如 BGe 评分)可以自然地通过后验分布量化图结构的不确定性,并得到后验预测区间。作者在 intro 中仅用一句话提及“Bayesian approaches... can be computationally expensive and sensitive to priors”,但没有深入讨论。这暗示作者认为频率学派的条件覆盖框架更可靠,且计算上更可控。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用关于“因果发现后推断”的早期尝试,例如通过 Bootstrap 或子抽样来量化图结构不确定性并构造置信区间的工作(如 Bühlmann et al. (2014) “Causal inference from high-dimensional data: A selective review and new results” 中提到的“causal stability selection”)。这可能是因为这些方法没有解决“双重 dipping”的核心问题,但作者没有明确说明为什么它们不适用。
张力¶
未见明显对立引用。所有被引工作都承认“双重 dipping”是一个问题,只是解决思路不同。作者与贝叶斯路线之间的张力是存在的,但作者没有在 intro 中展开。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
G:因果图(DAG),表示变量间的因果关系。这是潜在(unobserved) 的真实结构,是我们要发现的目标。Ĝ:因果发现算法输出的估计图。这是一个随机变量,依赖于观测数据。θ:我们感兴趣的因果效应(如平均处理效应 ATE)。这是参数(estimand),是我们要估计的。θ̂(Ĝ):基于估计图Ĝ估计出的因果效应。这是一个估计量,依赖于Ĝ和原始数据。X:观测数据矩阵(n 个样本,p 个变量)。这是可观测数据。n:样本量。α:名义覆盖水平(如 0.05)。C(X):基于数据X构造的置信区间。P(θ ∈ C(X) | Ĝ = g):条件覆盖概率——在给定因果发现输出为特定图g的条件下,区间覆盖真值θ的概率。这是本文要保证的对象。
-
模型:
- 数据生成机制:假设数据
X由一个未知的 DAGG和一个结构方程模型(SEM)生成。例如,对于线性 SEM:X_j = Σ_{i∈Pa(j)} β_{ij} X_i + ε_j,其中Pa(j)是G中X_j的父节点集,ε_j是独立噪声。 - 因果发现算法:一个函数
A: X → Ĝ,将观测数据映射到一个估计图。本文将其视为一个黑箱,不假设其具体形式(可以是 PC、GES、LiNGAM 等)。 - 因果效应估计:给定图
Ĝ,使用一个标准估计量(如调整公式、后门调整、工具变量法)来估计θ。本文假设这个估计量是渐近正态且一致的(在Ĝ正确的前提下)。
- 数据生成机制:假设数据
-
可观测数据:
- 可观测:
n个独立同分布的样本X = {x_1, ..., x_n},每个样本包含p个变量的观测值。 - 不可观测:真实的因果图
G、结构方程模型中的参数(如β_{ij})、噪声分布。这些是我们要通过假设和推断来“识别”或“估计”的对象。
- 可观测:
第二步:讲最小内核¶
最简特例:假设我们只有两个变量 X 和 Y,且我们只关心一个简单的因果效应:θ = E[Y | do(X = x+1)] - E[Y | do(X = x)](即 X 对 Y 的线性因果效应)。因果发现算法 A 的任务是判断 X → Y 还是 Y → X(或两者无关)。
-
在这个特例下:
- 因果发现输出
Ĝ只有三种可能:X → Y、Y → X、X ⊥ Y(独立)。 - 因果效应估计:如果
Ĝ = X → Y,则θ̂ = Cov(X, Y) / Var(X)(即回归系数);如果Ĝ = Y → X,则θ̂无定义(或为 0,因为X不是Y的原因);如果Ĝ = X ⊥ Y,则θ̂ = 0。 - “双重 dipping”问题:如果我们用同一数据
X先运行A得到Ĝ,再用X估计θ̂(Ĝ),那么经典置信区间θ̂ ± 1.96 * SE(θ̂)的覆盖会失效。例如,当真实结构是X → Y但A误判为Y → X时,θ̂会严重有偏,导致区间完全偏离真值。
- 因果发现输出
-
本文的核心思路:
- 样本分割(Sample Splitting):将数据
X随机分成两部分X_1和X_2。 - 发现阶段:用
X_1运行因果发现算法A,得到Ĝ。 - 校准阶段:用
X_2来校准置信区间。具体来说,我们不是直接构造θ̂(Ĝ)的置信区间,而是构造一个条件校准区间C(X_2 | Ĝ),使得:P(θ ∈ C(X_2 | Ĝ) | Ĝ = g) ≥ 1 - α。 这个条件概率是在给定发现结果g的条件下,基于独立于发现过程的数据X_2计算的。
- 样本分割(Sample Splitting):将数据
-
为什么这能解决问题?
- 因为
X_2没有被用于因果发现,所以θ̂(Ĝ)和X_2是条件独立的(给定Ĝ)。这意味着,在给定Ĝ的条件下,θ̂(Ĝ)的分布就是它在X_2上的条件分布,没有“双重 dipping”的偏差。 - 校准过程可以很简单:在
X_2上,对于每个可能的Ĝ值(如X → Y),我们计算θ̂的条件分位数,然后构造一个区间。这等价于在X_2上运行一个条件分位数回归,以Ĝ为条件。
- 因为
-
这个最小内核揭示了论文的本质:将因果发现视为一个“选择事件”,然后利用样本分割来打破选择与估计之间的依赖,最后通过条件校准来保证覆盖。 论文的一般情形只是将这个思路推广到更复杂的图结构、更一般的因果效应和更灵活的校准方法上。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当在同一数据集上先运行因果发现算法再估计因果效应时,经典置信区间覆盖失效(“双重 dipping”),本文提出一个通用框架来构造后因果发现的有效推断。
- 核心工具 / 方法:样本分割 + 条件校准。将因果发现视为一个黑箱选择器,利用独立于发现过程的数据来校准置信区间,保证条件覆盖。
- 主要结论:该方法能在不牺牲因果发现精度的前提下,将误覆盖率控制在名义水平附近,并允许在发现准确性与区间宽度之间进行显式权衡。
关键设定与假设¶
- 设定:
- 数据:
n个独立同分布的观测,来自一个未知的因果图G和结构方程模型。 - 因果发现算法:任意一个函数
A: X → Ĝ,输出一个图结构(或等价类)。本文将其视为黑箱,不假设其一致性或正确性。 - 因果效应估计量:给定图
Ĝ,使用一个标准估计量θ̂(Ĝ)。本文假设该估计量是渐近正态且一致的(在Ĝ正确的前提下),且其渐近方差σ²(Ĝ)可以估计。
- 数据:
- 假设:
- H1 (样本分割独立性):数据
X被随机分割为X_1和X_2,且X_1和X_2独立同分布。这是核心假设,保证了校准数据的独立性。 - H2 (条件正态性):在给定真实图
G和发现图Ĝ的条件下,θ̂(Ĝ)是渐近正态的。这是标准假设,用于构造校准区间。 - H3 (条件方差可估):
σ²(Ĝ)可以被一致地估计。这是构造校准区间的基础。 - 相比已有文献:本文的假设比大多数后选择推断工作(如 Lee et al. 2016)更弱,因为它不要求知道选择步骤的具体形式(如 Lasso 的 KKT 条件),而是将其视为黑箱。这使得该方法适用于任意因果发现算法。
- H1 (样本分割独立性):数据
主要结果¶
-
定理 1 (条件覆盖保证):在假设 H1-H3 下,本文提出的条件校准区间
C(X_2 | Ĝ)满足:lim_{n→∞} P(θ ∈ C(X_2 | Ĝ) | Ĝ = g) ≥ 1 - α。- 直觉:由于
X_2独立于发现过程,条件分布θ̂(Ĝ) | Ĝ = g就是它在X_2上的分布。通过校准X_2上的条件分位数,我们可以构造一个渐近有效的条件置信区间。 - 必要条件:样本分割的随机性、条件正态性、条件方差可估。
- 解决的技术难点:如何将复杂的图结构
Ĝ转化为一个可用于条件校准的“选择事件”。本文通过将Ĝ编码为一个离散的类别变量(如图的邻接矩阵的向量化)来解决,然后使用条件分位数回归(如随机森林、核方法)来估计条件分位数。
- 直觉:由于
-
定理 2 (发现准确性与区间宽度的权衡):设
τ是一个控制发现“保守性”的参数(如 PC 算法的显著性水平)。更小的τ导致更保守的发现(更少的边被识别),从而:- 发现准确性:降低(更多真实边被遗漏)。
- 区间宽度:变窄(因为估计量
θ̂(Ĝ)的方差更小,且校准数据更集中)。 - 直觉:这是一个显式的权衡。研究者可以通过调整
τ来在“发现更多真实结构”和“获得更窄的置信区间”之间进行选择。 - 解决的技术难点:如何量化这个权衡。本文通过将
τ与条件校准区间的宽度联系起来,给出了一个理论上的界。
证明路线与技术技巧¶
-
整体路线:
- 样本分割:将数据
X分割为X_1(发现)和X_2(校准)。 - 发现:在
X_1上运行因果发现算法A,得到Ĝ。 - 条件分布建模:在
X_2上,对于每个可能的Ĝ值,建模θ̂(Ĝ)的条件分布。本文使用条件分位数回归(如随机森林)来直接估计条件分位数q_α(Ĝ)。 - 构造区间:构造条件校准区间
C(X_2 | Ĝ) = [θ̂(Ĝ) - q_{1-α/2}(Ĝ), θ̂(Ĝ) - q_{α/2}(Ĝ)]。 - 证明覆盖:利用条件分位数回归的一致性(在给定
Ĝ下,估计的分位数收敛到真实分位数)和样本分割的独立性,证明条件覆盖。
- 样本分割:将数据
-
关键跳跃点:
- 从“无条件分位数”到“条件分位数”:经典后选择推断(如 Lee et al. 2016)依赖于对选择事件(如 Lasso 的 KKT 条件)的精确刻画,从而得到条件分布。本文放弃了这种精确刻画,转而使用非参数的条件分位数回归。这个跳跃的关键在于:它允许将任意复杂的因果发现算法视为黑箱,但代价是需要更强的假设(条件分位数回归的一致性)和更大的校准样本量。
- 如何将图结构转化为条件变量:图结构
Ĝ是一个高维、离散的对象。本文通过将其编码为一个低维的摘要统计量(如图的边数、最大入度、某个特定路径的存在性)来解决,或者直接使用图核方法(如 Weisfeiler-Lehman 核)来度量图之间的相似性,从而进行条件分位数回归。
-
技术技巧点名:
- 样本分割:用于打破选择与估计之间的依赖,是后选择推断的经典技巧。
- 条件分位数回归:用于估计条件分位数,是本文的核心技术工具。作者使用了随机森林作为具体实现。
- 图核方法:用于将图结构转化为可用于回归的特征向量,是处理复杂选择输出的技巧。
真实例子与应用¶
- 数据 / 场景:作者使用了模拟数据和真实数据(来自 UCI 机器学习库的“Auto MPG”数据集,用于预测汽车油耗)。
- 怎么用:
- 模拟数据:从已知的线性 SEM 中生成数据,真实因果图已知。运行 PC 算法进行因果发现,然后比较朴素方法(先发现后估计,不校正)与本文方法(条件校准)的置信区间覆盖。
- 真实数据:在 Auto MPG 数据集上,使用 PC 算法发现变量(如重量、马力、排量)与油耗之间的因果图,然后估计某个变量对油耗的因果效应。
- 结果:
- 模拟实验:朴素方法的误覆盖率可高达 30%–50%,而本文方法将误覆盖率控制在 5% 附近(名义水平)。
- 真实数据:本文方法给出的置信区间比朴素方法更宽(因为校正了选择偏差),但覆盖更可靠。
- 这个例子想说明什么:验证了理论结果——朴素方法在“双重 dipping”下严重失效,而本文方法能有效校正。同时展示了方法在真实数据上的可行性。
🔎 结论是否比证明窄¶
- 窄结论:定理 1 的证明依赖于条件分位数回归的一致性,这需要校准样本量
|X_2|足够大。作者在模拟中使用了|X_2| = 500,但在真实数据中,如果|X_2|很小(如 < 100),条件分位数回归可能不稳定,导致覆盖偏离名义水平。作者在讨论中提到了这一点,但没有给出一个明确的样本量要求。 - 泛泛 claim:作者在摘要中声称该方法“allows for a trade-off between causal discovery accuracy and confidence interval width”。这个 trade-off 在定理 2 中得到了理论上的刻画,但没有在模拟或真实数据中系统地展示(例如,通过改变 PC 算法的显著性水平
τ来观察区间宽度的变化)。这是一个可以进一步验证的 claim。
四、开放问题¶
- 更复杂的因果效应:本文主要关注线性 SEM 下的简单因果效应。如何将条件校准框架扩展到非参数因果效应(如 ATE、ATT)或工具变量设定?这需要处理更复杂的估计量(如 DML)和更复杂的条件分布。扎根点:作者在讨论中提到“extending our framework to nonparametric causal effects is an important direction”。
- 高维因果发现:当变量数
p远大于样本量n时,因果发现算法(如 PC)可能不稳定,且条件分位数回归在高维下也会失效。如何在高维设定下进行有效的后因果发现推断?扎根点:作者在模拟中使用了p=10,没有讨论高维情况。 - 更灵活的校准方法:条件分位数回归依赖于对条件分布的建模。能否使用保序回归(isotonic regression) 或共形预测(conformal prediction) 等更灵活、更少假设的方法来构造校准区间?扎根点:作者在讨论中提到了“conformal prediction as a promising alternative”。
- 与贝叶斯方法的比较:作者淡化了贝叶斯方法,但贝叶斯方法(如 BGe 评分 + MCMC)可以自然地得到后验预测区间。一个开放问题是:在什么条件下,频率学派的条件校准区间比贝叶斯后验区间更窄或更可靠?扎根点:作者在 intro 中仅用一句话提及贝叶斯方法,没有深入比较。这是一个值得研究者去查的张力点。
Maintained by 陈星宇 · Homepage · Source on GitHub