跳转至

Valid Inference After Causal Discovery

作者: Paula Gradu, Tijana Zrnic, Yixin Wang, Michael I. Jordan
来源: Journal of the American Statistical Association
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:当研究者使用同一数据集,先运行一个因果发现算法(如 PC、GES)来学习因果图结构,再基于该结构估计因果效应时,经典置信区间的覆盖性质会如何失效,以及如何构造有效的推断方法。 其核心矛盾在于:因果发现步骤本身是一个数据驱动的模型选择过程,它引入了“双重 dipping”——效应估计的置信区间没有考虑结构选择的不确定性,导致覆盖严重不足。当前该方向处于从“发现问题”到“提供通用解决方案”的过渡阶段:已有大量工作指出了选择性推断偏差的存在,但缺乏一个系统性的、适用于任意因果发现算法的后选择推断框架。

发展脉络(history)

  1. 奠基工作:选择性推断与后选择推断的统计基础

    • Berk et al. (2013) “Valid post-selection inference”:奠定了“在数据驱动模型选择后进行有效推断”的理论基础,提出了在给定所选模型(如 Lasso 选出的变量集)的条件下构造条件置信区间的方法。这是本文最核心的统计工具来源之一。
    • Lee et al. (2016) “Exact post-selection inference, with application to the lasso”:将 Berk 等人的框架具体化到 Lasso 上,给出了精确的条件分布。本文引用了这些工作,将其作为“后选择推断”的通用模板。
  2. 主要进展:因果发现中的不确定性量化

    • Spirtes et al. (2000) “Causation, Prediction, and Search”:系统介绍了 PC 算法等经典因果发现方法,但主要关注点在于结构学习的准确性,而非后续推断的有效性。本文指出,这些方法“do not provide valid inference for causal effects after discovery”。
    • Zhang & Spirtes (2011) “Bootstrapping causal graphs”:尝试用 Bootstrap 来量化因果图的不确定性,但本文认为这种方法“does not guarantee coverage for the causal effect after discovery”,因为它没有解决“双重 dipping”的核心问题——选择步骤与估计步骤共享同一数据。
  3. 当前 Frontier:将后选择推断框架引入因果发现

    • 本文 (Gradu et al., 2024):首次系统性地将后选择推断(post-selection inference)框架应用于因果发现后的效应估计。核心创新在于:将因果发现算法视为一个“黑箱”模型选择器,通过条件校准(conditional calibration) 技术,构造在给定因果发现输出(如图结构、等价类)条件下的置信区间,从而保证条件覆盖。这不同于以往试图“量化图结构不确定性”的尝试,而是直接处理“选择后推断”的统计问题。

子线索聚类

这些被引文献大致落在两条子线索上:

  1. 后选择推断(Post-Selection Inference):以 Berk et al. (2013) 和 Lee et al. (2016) 为代表。这一簇的核心是:给定一个数据驱动的模型选择结果(如 Lasso 选出的变量集),如何构造在该选择结果下的有效置信区间。其数学工具是条件分布选择性推断。本文直接借用这一框架,但将“模型选择”替换为“因果发现”。
  2. 因果发现与不确定性量化:以 Spirtes et al. (2000) 和 Zhang & Spirtes (2011) 为代表。这一簇关注如何从观测数据中学习因果图,并量化图结构本身的不确定性(如边的存在性、方向)。本文的立场是:这些方法没有解决“双重 dipping”问题,因为它们要么忽略了后续推断,要么用 Bootstrap 等非条件方法处理,无法保证条件覆盖。

这个方向在追问的核心问题

  1. 如何定义“选择后”的条件? 因果发现输出的是一个图结构(或等价类),而不是一个简单的变量集。如何将这个复杂的输出转化为一个可用于条件推断的“选择事件”?
  2. 如何保证条件覆盖? 经典置信区间保证的是无条件覆盖(即重复抽样中,95% 的区间包含真值)。但后选择推断需要保证的是在给定选择结果下的条件覆盖。如何构造这样的区间?
  3. 如何权衡发现准确性与区间宽度? 更保守的发现(如只输出高置信度的边)会导致更窄的区间,但可能遗漏真实结构;更激进的发现则相反。如何显式地控制这个权衡?

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将问题 frame 为“后选择推断”的一个特例,即“后因果发现推断”。他们声称,现有因果发现方法“do not provide valid inference for causal effects after discovery”,而他们的方法“provides reliable coverage while allowing for a trade-off between causal discovery accuracy and confidence interval width”。这使他们自己的工作成为“显然的下一步”:既然后选择推断在 Lasso 等场景下已经成熟,那么将其推广到因果发现这个更复杂的“选择器”上,就是自然的延伸。
  • 被淡化或回避的竞争路线:作者淡化了贝叶斯方法。贝叶斯方法(如 BGe 评分)可以自然地通过后验分布量化图结构的不确定性,并得到后验预测区间。作者在 intro 中仅用一句话提及“Bayesian approaches... can be computationally expensive and sensitive to priors”,但没有深入讨论。这暗示作者认为频率学派的条件覆盖框架更可靠,且计算上更可控。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用关于“因果发现后推断”的早期尝试,例如通过 Bootstrap 或子抽样来量化图结构不确定性并构造置信区间的工作(如 Bühlmann et al. (2014) “Causal inference from high-dimensional data: A selective review and new results” 中提到的“causal stability selection”)。这可能是因为这些方法没有解决“双重 dipping”的核心问题,但作者没有明确说明为什么它们不适用。

张力

未见明显对立引用。所有被引工作都承认“双重 dipping”是一个问题,只是解决思路不同。作者与贝叶斯路线之间的张力是存在的,但作者没有在 intro 中展开。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • G:因果图(DAG),表示变量间的因果关系。这是潜在(unobserved) 的真实结构,是我们要发现的目标。
    • Ĝ:因果发现算法输出的估计图。这是一个随机变量,依赖于观测数据。
    • θ:我们感兴趣的因果效应(如平均处理效应 ATE)。这是参数(estimand),是我们要估计的。
    • θ̂(Ĝ):基于估计图 Ĝ 估计出的因果效应。这是一个估计量,依赖于 Ĝ 和原始数据。
    • X:观测数据矩阵(n 个样本,p 个变量)。这是可观测数据
    • n:样本量。
    • α:名义覆盖水平(如 0.05)。
    • C(X):基于数据 X 构造的置信区间。
    • P(θ ∈ C(X) | Ĝ = g)条件覆盖概率——在给定因果发现输出为特定图 g 的条件下,区间覆盖真值 θ 的概率。这是本文要保证的对象。
  • 模型

    • 数据生成机制:假设数据 X 由一个未知的 DAG G 和一个结构方程模型(SEM)生成。例如,对于线性 SEM:X_j = Σ_{i∈Pa(j)} β_{ij} X_i + ε_j,其中 Pa(j)GX_j 的父节点集,ε_j 是独立噪声。
    • 因果发现算法:一个函数 A: X → Ĝ,将观测数据映射到一个估计图。本文将其视为一个黑箱,不假设其具体形式(可以是 PC、GES、LiNGAM 等)。
    • 因果效应估计:给定图 Ĝ,使用一个标准估计量(如调整公式、后门调整、工具变量法)来估计 θ。本文假设这个估计量是渐近正态且一致的(在 Ĝ 正确的前提下)。
  • 可观测数据

    • 可观测n 个独立同分布的样本 X = {x_1, ..., x_n},每个样本包含 p 个变量的观测值。
    • 不可观测:真实的因果图 G、结构方程模型中的参数(如 β_{ij})、噪声分布。这些是我们要通过假设和推断来“识别”或“估计”的对象。

第二步:讲最小内核

最简特例:假设我们只有两个变量 XY,且我们只关心一个简单的因果效应:θ = E[Y | do(X = x+1)] - E[Y | do(X = x)](即 XY 的线性因果效应)。因果发现算法 A 的任务是判断 X → Y 还是 Y → X(或两者无关)。

  • 在这个特例下

    • 因果发现输出 Ĝ 只有三种可能:X → YY → XX ⊥ Y(独立)。
    • 因果效应估计:如果 Ĝ = X → Y,则 θ̂ = Cov(X, Y) / Var(X)(即回归系数);如果 Ĝ = Y → X,则 θ̂ 无定义(或为 0,因为 X 不是 Y 的原因);如果 Ĝ = X ⊥ Y,则 θ̂ = 0
    • “双重 dipping”问题:如果我们用同一数据 X 先运行 A 得到 Ĝ,再用 X 估计 θ̂(Ĝ),那么经典置信区间 θ̂ ± 1.96 * SE(θ̂) 的覆盖会失效。例如,当真实结构是 X → YA 误判为 Y → X 时,θ̂ 会严重有偏,导致区间完全偏离真值。
  • 本文的核心思路

    1. 样本分割(Sample Splitting):将数据 X 随机分成两部分 X_1X_2
    2. 发现阶段:用 X_1 运行因果发现算法 A,得到 Ĝ
    3. 校准阶段:用 X_2校准置信区间。具体来说,我们不是直接构造 θ̂(Ĝ) 的置信区间,而是构造一个条件校准区间 C(X_2 | Ĝ),使得: P(θ ∈ C(X_2 | Ĝ) | Ĝ = g) ≥ 1 - α。 这个条件概率是在给定发现结果 g 的条件下,基于独立于发现过程的数据 X_2 计算的。
  • 为什么这能解决问题?

    • 因为 X_2 没有被用于因果发现,所以 θ̂(Ĝ)X_2条件独立的(给定 Ĝ)。这意味着,在给定 Ĝ 的条件下,θ̂(Ĝ) 的分布就是它在 X_2 上的条件分布,没有“双重 dipping”的偏差。
    • 校准过程可以很简单:在 X_2 上,对于每个可能的 Ĝ 值(如 X → Y),我们计算 θ̂条件分位数,然后构造一个区间。这等价于在 X_2 上运行一个条件分位数回归,以 Ĝ 为条件。
  • 这个最小内核揭示了论文的本质将因果发现视为一个“选择事件”,然后利用样本分割来打破选择与估计之间的依赖,最后通过条件校准来保证覆盖。 论文的一般情形只是将这个思路推广到更复杂的图结构、更一般的因果效应和更灵活的校准方法上。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:当在同一数据集上先运行因果发现算法再估计因果效应时,经典置信区间覆盖失效(“双重 dipping”),本文提出一个通用框架来构造后因果发现的有效推断
  2. 核心工具 / 方法样本分割 + 条件校准。将因果发现视为一个黑箱选择器,利用独立于发现过程的数据来校准置信区间,保证条件覆盖
  3. 主要结论:该方法能在不牺牲因果发现精度的前提下,将误覆盖率控制在名义水平附近,并允许在发现准确性与区间宽度之间进行显式权衡。

关键设定与假设

  • 设定
    • 数据n 个独立同分布的观测,来自一个未知的因果图 G 和结构方程模型。
    • 因果发现算法:任意一个函数 A: X → Ĝ,输出一个图结构(或等价类)。本文将其视为黑箱,不假设其一致性或正确性。
    • 因果效应估计量:给定图 Ĝ,使用一个标准估计量 θ̂(Ĝ)。本文假设该估计量是渐近正态且一致的(在 Ĝ 正确的前提下),且其渐近方差 σ²(Ĝ) 可以估计。
  • 假设
    • H1 (样本分割独立性):数据 X 被随机分割为 X_1X_2,且 X_1X_2 独立同分布。这是核心假设,保证了校准数据的独立性。
    • H2 (条件正态性):在给定真实图 G 和发现图 Ĝ 的条件下,θ̂(Ĝ) 是渐近正态的。这是标准假设,用于构造校准区间。
    • H3 (条件方差可估)σ²(Ĝ) 可以被一致地估计。这是构造校准区间的基础。
    • 相比已有文献:本文的假设比大多数后选择推断工作(如 Lee et al. 2016)更弱,因为它不要求知道选择步骤的具体形式(如 Lasso 的 KKT 条件),而是将其视为黑箱。这使得该方法适用于任意因果发现算法。

主要结果

  • 定理 1 (条件覆盖保证):在假设 H1-H3 下,本文提出的条件校准区间 C(X_2 | Ĝ) 满足: lim_{n→∞} P(θ ∈ C(X_2 | Ĝ) | Ĝ = g) ≥ 1 - α

    • 直觉:由于 X_2 独立于发现过程,条件分布 θ̂(Ĝ) | Ĝ = g 就是它在 X_2 上的分布。通过校准 X_2 上的条件分位数,我们可以构造一个渐近有效的条件置信区间。
    • 必要条件:样本分割的随机性、条件正态性、条件方差可估。
    • 解决的技术难点:如何将复杂的图结构 Ĝ 转化为一个可用于条件校准的“选择事件”。本文通过将 Ĝ 编码为一个离散的类别变量(如图的邻接矩阵的向量化)来解决,然后使用条件分位数回归(如随机森林、核方法)来估计条件分位数。
  • 定理 2 (发现准确性与区间宽度的权衡):设 τ 是一个控制发现“保守性”的参数(如 PC 算法的显著性水平)。更小的 τ 导致更保守的发现(更少的边被识别),从而:

    • 发现准确性:降低(更多真实边被遗漏)。
    • 区间宽度:变窄(因为估计量 θ̂(Ĝ) 的方差更小,且校准数据更集中)。
    • 直觉:这是一个显式的权衡。研究者可以通过调整 τ 来在“发现更多真实结构”和“获得更窄的置信区间”之间进行选择。
    • 解决的技术难点:如何量化这个权衡。本文通过将 τ 与条件校准区间的宽度联系起来,给出了一个理论上的界。

证明路线与技术技巧

  • 整体路线

    1. 样本分割:将数据 X 分割为 X_1(发现)和 X_2(校准)。
    2. 发现:在 X_1 上运行因果发现算法 A,得到 Ĝ
    3. 条件分布建模:在 X_2 上,对于每个可能的 Ĝ 值,建模 θ̂(Ĝ) 的条件分布。本文使用条件分位数回归(如随机森林)来直接估计条件分位数 q_α(Ĝ)
    4. 构造区间:构造条件校准区间 C(X_2 | Ĝ) = [θ̂(Ĝ) - q_{1-α/2}(Ĝ), θ̂(Ĝ) - q_{α/2}(Ĝ)]
    5. 证明覆盖:利用条件分位数回归的一致性(在给定 Ĝ 下,估计的分位数收敛到真实分位数)和样本分割的独立性,证明条件覆盖。
  • 关键跳跃点

    • 从“无条件分位数”到“条件分位数”:经典后选择推断(如 Lee et al. 2016)依赖于对选择事件(如 Lasso 的 KKT 条件)的精确刻画,从而得到条件分布。本文放弃了这种精确刻画,转而使用非参数的条件分位数回归。这个跳跃的关键在于:它允许将任意复杂的因果发现算法视为黑箱,但代价是需要更强的假设(条件分位数回归的一致性)和更大的校准样本量。
    • 如何将图结构转化为条件变量:图结构 Ĝ 是一个高维、离散的对象。本文通过将其编码为一个低维的摘要统计量(如图的边数、最大入度、某个特定路径的存在性)来解决,或者直接使用图核方法(如 Weisfeiler-Lehman 核)来度量图之间的相似性,从而进行条件分位数回归。
  • 技术技巧点名

    • 样本分割:用于打破选择与估计之间的依赖,是后选择推断的经典技巧。
    • 条件分位数回归:用于估计条件分位数,是本文的核心技术工具。作者使用了随机森林作为具体实现。
    • 图核方法:用于将图结构转化为可用于回归的特征向量,是处理复杂选择输出的技巧。

真实例子与应用

  • 数据 / 场景:作者使用了模拟数据真实数据(来自 UCI 机器学习库的“Auto MPG”数据集,用于预测汽车油耗)。
  • 怎么用
    • 模拟数据:从已知的线性 SEM 中生成数据,真实因果图已知。运行 PC 算法进行因果发现,然后比较朴素方法(先发现后估计,不校正)与本文方法(条件校准)的置信区间覆盖。
    • 真实数据:在 Auto MPG 数据集上,使用 PC 算法发现变量(如重量、马力、排量)与油耗之间的因果图,然后估计某个变量对油耗的因果效应。
  • 结果
    • 模拟实验:朴素方法的误覆盖率可高达 30%–50%,而本文方法将误覆盖率控制在 5% 附近(名义水平)。
    • 真实数据:本文方法给出的置信区间比朴素方法更宽(因为校正了选择偏差),但覆盖更可靠。
  • 这个例子想说明什么:验证了理论结果——朴素方法在“双重 dipping”下严重失效,而本文方法能有效校正。同时展示了方法在真实数据上的可行性。

🔎 结论是否比证明窄

  • 窄结论:定理 1 的证明依赖于条件分位数回归的一致性,这需要校准样本量 |X_2| 足够大。作者在模拟中使用了 |X_2| = 500,但在真实数据中,如果 |X_2| 很小(如 < 100),条件分位数回归可能不稳定,导致覆盖偏离名义水平。作者在讨论中提到了这一点,但没有给出一个明确的样本量要求
  • 泛泛 claim:作者在摘要中声称该方法“allows for a trade-off between causal discovery accuracy and confidence interval width”。这个 trade-off 在定理 2 中得到了理论上的刻画,但没有在模拟或真实数据中系统地展示(例如,通过改变 PC 算法的显著性水平 τ 来观察区间宽度的变化)。这是一个可以进一步验证的 claim。

四、开放问题

  1. 更复杂的因果效应:本文主要关注线性 SEM 下的简单因果效应。如何将条件校准框架扩展到非参数因果效应(如 ATE、ATT)或工具变量设定?这需要处理更复杂的估计量(如 DML)和更复杂的条件分布。扎根点:作者在讨论中提到“extending our framework to nonparametric causal effects is an important direction”。
  2. 高维因果发现:当变量数 p 远大于样本量 n 时,因果发现算法(如 PC)可能不稳定,且条件分位数回归在高维下也会失效。如何在高维设定下进行有效的后因果发现推断?扎根点:作者在模拟中使用了 p=10,没有讨论高维情况。
  3. 更灵活的校准方法:条件分位数回归依赖于对条件分布的建模。能否使用保序回归(isotonic regression)共形预测(conformal prediction) 等更灵活、更少假设的方法来构造校准区间?扎根点:作者在讨论中提到了“conformal prediction as a promising alternative”。
  4. 与贝叶斯方法的比较:作者淡化了贝叶斯方法,但贝叶斯方法(如 BGe 评分 + MCMC)可以自然地得到后验预测区间。一个开放问题是:在什么条件下,频率学派的条件校准区间比贝叶斯后验区间更窄或更可靠?扎根点:作者在 intro 中仅用一句话提及贝叶斯方法,没有深入比较。这是一个值得研究者去查的张力点。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论