跳转至

Proxy-Adjusted Causal Discovery from Targeted Interventions

作者: Li Chen, Wei Pan, Xiaotong Shen
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2609.23897


一、领域脉络与小综述

  • 这个方向是什么:本文属于"因果发现(causal discovery)"中一个非常具体且困难的子问题:在存在未测量混杂(unmeasured confounding)的情况下,从靶向干预(targeted interventions)数据中恢复有向无环图(DAG)的直接因果边。其根本困难在于,随机化干预虽然能识别"谁影响谁"(祖先关系),但无法直接区分"直接影响"与"经由中间变量的间接影响"。更棘手的是,当存在未测量的共同原因(如细胞状态)时,即使干预是随机的,条件化中间变量也可能打开"对撞子路径"(collider path),产生虚假关联。该方向当前的状态是:模型驱动的 IV 方法(如 GrIVET)需要强参数假设;非参数代理方法(如 proximal causal inference)多聚焦于单个因果效应的估计而非整个图结构的恢复;而大规模干预数据的图学习方法(如 DCDI、ENCO)通常假设因果充分性(causal sufficiency)。本文试图填补的缺口是:在非参数框架下,利用代理变量(proxy)和靶向干预的联合信息,恢复直接因果边。

  • 发展脉络(history):

    • 奠基工作:Pearl (2009) 和 Sprites et al. (2001) 建立了因果图和干预的形式语言,但主要针对观测数据或完全随机化实验。PC 算法 (Kalisch and Bühlmann, 2007) 是约束基方法的代表,但依赖因果充分性假设。
    • 干预数据的利用:Peters et al. (2016) 的 invariant prediction 和 Brouillard et al. (2020) 的 DCDI 开始系统利用干预数据提供方向信息,但通常假设无未测量混杂。Lippe et al. (2021) 的 ENCO 进一步提升了可扩展性,但同样受限于此。
    • 代理变量的引入:Miao et al. (2018) 和 Cui et al. (2024) 的 proximal causal inference 框架为利用代理变量处理未测量混杂提供了识别理论,但主要关注单个效应的估计。Xie et al. (2024) 的线性代理选择方法也聚焦于效应估计。
    • 图恢复与混杂并存:Chen et al. (2024) 的 GrIVET 和 Wang et al. (2024) 的 GAMPI 开始在存在未测量混杂时进行图恢复,但依赖高斯或广义线性模型。Kaltenpoth and Vreeken (2023) 的 NOCALIDAC 和 Li et al. (2024) 的 DeFuSE 处理非线性,但分别依赖特定的潜在变量模型或相关高斯误差结构。Park and Li (2026) 的 ARGEN 针对 Perturb-seq 数据,但需要模型化的表达预测器。
    • 本文位置:PABM 试图将 proximal 思想(代理变量)与干预数据结合,并明确将"识别假设"与"估计方法"分离,允许使用灵活的机器学习模型(如梯度提升)来估计条件分布,从而在非参数框架下处理非线性、非加性关系。
  • 子线索聚类:

    1. 基于分数的连续优化方法:Zheng et al. (2018) NOTEARS, Ng et al. (2019) Masked Gradient, Brouillard et al. (2020) DCDI, Lippe et al. (2021) ENCO。这些方法将离散图搜索转化为连续优化,但大多在因果充分性下工作。
    2. 基于 IV / 代理的因果效应估计:Miao et al. (2018), Cui et al. (2024), Xie et al. (2024)。这些方法提供识别条件,但通常不输出完整图结构。
    3. 含隐藏变量的图恢复:Chen et al. (2024) GrIVET, Wang et al. (2024) GAMPI, Kaltenpoth and Vreeken (2023) NOCALIDAC, Li et al. (2024) DeFuSE。这些方法直接处理未测量混杂下的图恢复,但通常依赖特定的参数模型或分布假设。
    4. 大规模干预数据应用:Replogle et al. (2021) 提供了数据基础;Brown et al. (2025) inspre, Park and Li (2026) ARGEN, Han et al. (2025) IBCD 等针对 Perturb-seq 数据开发了专门方法。
  • 这个方向在追问的核心问题:

    1. 可识别性:在何种条件下,未测量混杂存在时,直接因果边是可由观测数据(干预+代理)识别的?本文的答案是"局部、成对的条件分布比较"(Assumption 2)。
    2. 估计与推断:如何从有限样本中估计这些条件分布比较,并控制多重检验的误差?本文给出了有限样本恢复条件和 FWER 控制(Theorem 11, 12)。
    3. 可扩展性:如何将方法扩展到高维(如基因组规模的数千个基因)?本文的复杂度为 O(p²) 次比较,但每次比较的拟合成本可能很高。
    4. 鲁棒性:当代理变量不完美或干预存在脱靶效应时,方法的表现如何?本文通过代理消融实验部分回答了这个问题。
  • ⚠️ 作者的 framing(这是作者的说法):作者将缺口 frame 成"现有方法要么需要因果充分性,要么需要强参数模型,要么只估计效应不恢复图结构"。因此,PABM 是"显然的下一步":它结合了干预(提供方向)和代理(处理混杂),并在非参数框架下工作。作者淡化了以下竞争路线:(a) 完全参数化的 IV 方法(如 GrIVET)在模型正确时可能更高效;(b) 纯观测数据的代理方法(如 proximal causal inference)不需要干预设计;(c) 大规模贝叶斯方法(如 IBCD)虽然计算量大但提供了不确定性量化。值得研究者去查的问题:作者在引言中未提及近期关于"干预目标未知"或"软干预"的图发现工作,也未讨论与"因果表示学习"(causal representation learning)的关系——这些可能是被刻意回避的竞争路线。

  • 张力:未见明显对立引用。但存在一个微妙的张力:一方面,作者强调"非参数"框架(不指定函数形式);另一方面,其理论结果(Theorem 11)依赖于"工作族"(working family)的逼近误差和估计误差的界,这在实践中很难验证。这与纯模型无关的识别结果(如 Theorem 6)之间存在差距——识别是精确的,但估计需要近似。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

  • 符号:
  • 图与节点:p 个感兴趣的变量 X = (X_1, ..., X_p),构成 DAG 的节点。pa(r) ⊆ [p] \ {r} 是 X_r 的父节点集合(直接原因)。E 是边集,(j, r) ∈ E 当且仅当 j ∈ pa(r)。
  • 干预:U = (U_1, ..., U_p) 是干预分配向量。U_j 是作用于 X_j 的干预变量(如 CRISPR 指南 RNA 的指示变量)。U_j 是可观测的。
  • 代理变量:W 是记录的协变量和代理变量块(如线粒体基因表达、细胞周期标记)。W_r 是进入 X_r 机制的代理子向量。W 是可观测的。
  • 未测量混杂:H = (H_1, ..., H_q) 是未观测的共同原因(如潜在的细胞状态),影响多个 X 变量。H 是不可观测的。
  • 结构方程:X_r = f_r(X_{pa(r)}, H, U_r, W_r, ε_r),其中 ε_r 是独立于 (H, U, W) 的噪声。
  • 目标(Estimand):边集 E,即所有直接因果关系的集合。
  • 核心统计量:
    • Δ^anc_{jr}:祖先增益(Ancestor Gain),衡量干预 U_j 对 X_r 的条件分布的影响(式 2)。
    • Δ^X_{jr}:表达增益(Expression Gain),衡量在控制其他祖先和代理后,X_j 对 X_r 的条件分布的增量影响(式 3)。
    • Δ^U_{jr}:干预增益(Intervention Gain),衡量在控制其他祖先和代理后,U_j 对 X_r 的条件分布的增量影响(式 3)。
    • Ω_{jr}:综合结构证据(式 5),max{Δ^X_{jr}, a^U_{jr}Δ^U_{jr}},其中 a^U_{jr} 是干预可用性指示。
  • 可观测数据:D_n = {(X_i, U_i, W_i) : i = 1, ..., n},即 n 个独立同分布的样本,每个样本包含所有感兴趣的变量、干预分配和代理变量。

第二步:最小内核

考虑最简单的非平凡情形:三个变量 X_j → X_r,且存在一个未测量的混杂 H 同时影响 X_j 和 X_r。我们想知道 X_j 是否是 X_r 的直接原因(即 j ∈ pa(r))。

  1. 祖先筛选(Stage A):我们有一个随机化的干预 U_j,它只影响 X_j(排除性)。如果 U_j 与 X_r 相关(在控制 W 后),那么 X_j 一定是 X_r 的祖先(j ∈ Anc(r))。这通过 Δ^anc_{jr} > 0 来判断。这一步是可靠的,因为随机化保证了 U_j ⊥ H | (U_{-j}, W)。

  2. 直接原因识别(Stage B):现在我们知道 X_j 是 X_r 的祖先,但它可能是直接原因,也可能通过中间变量 M 间接作用(X_j → M → X_r)。为了区分,我们比较两个条件分布:

    • 表达比较:p(X_r | X_{pa(r)\setminus\{j\}}, X_j, W, U_r) vs p(X_r | X_{pa(r)\setminus\{j\}}, W, U_r)。如果 X_j 对 X_r 有直接作用,那么加入 X_j 应该改变 X_r 的条件分布,即 Δ^X_{jr} > 0。
    • 干预比较:类似地,比较 p(X_r | X_{pa(r)\setminus\{j\}}, U_j, W, U_{-j}) vs p(X_r | X_{pa(r)\setminus\{j\}}, W, U_{-j}),即 Δ^U_{jr} > 0。
  3. 核心困难(对撞子偏差):为什么不能简单地条件化所有其他变量?考虑路径 X_j → M → X_r 和 H → M。如果我们想检验 X_j 是否直接影响 X_r,我们可能会条件化 M(因为它是一个中间变量)。但是,M 是 X_j 和 H 的对撞子(X_j → M ← H)。条件化 M 会打开 X_j 和 H 之间的虚假关联路径,从而使得 X_j 和 X_r 在给定 M 后产生虚假相关。这就是为什么需要"代理变量" W 来"屏蔽" H 的影响:如果 W 足够好地捕捉了 H 的信息,那么条件化 W 可以阻断 H 的路径,从而使得条件独立性的检验有效。

  4. 最小命题:在满足 Assumption 2(即 W 能充分代理 H,且条件独立性成立)的前提下,j ∈ pa(r) 当且仅当 Ω_{jr} > 0。也就是说,一个候选变量是直接原因,当且仅当它在某个条件分布比较中产生了正的增益。这个命题的证明依赖于"联合零假设/备择假设"的结构:非父节点的增益必须为零(由条件独立性保证),而父节点的增益必须为正(由"可检测性"保证)。

这个最小内核展示了本文的核心思想:用干预来建立祖先关系(方向),用代理变量来阻断混杂,用条件分布比较来区分直接与间接效应。整个论文的定理和算法都是这个简单想法的严格化和一般化。

三、这篇论文做了什么

三句话: 1. 研究了什么问题:在存在未测量混杂的情况下,如何从靶向干预数据中非参数地恢复 DAG 的直接因果边。 2. 核心工具 / 方法:提出了一个两阶段框架 PABM:第一阶段用干预变量做祖先筛选(识别候选父节点),第二阶段用"平衡掩蔽"的条件分布比较(表达比较和干预比较)来区分直接父节点和间接祖先,并通过样本分割和多重检验校正控制错误发现。 3. 主要结论:在明确的识别条件下(Assumption 1 和 2),PABM 能够从总体层面正确识别直接因果边;在有限样本下,若满足一定的估计精度和信号强度条件,PABM 能以高概率恢复真实图结构,并控制图级 FWER。模拟和真实数据(K562 Perturb-seq)分析展示了其在实践中的有效性。

关键设定与假设: - 数据生成:X_r = f_r(X_{pa(r)}, H, U_r, W_r, ε_r),ε_r 独立于 (H, U, W)。这允许高度非线性和非加性的机制。 - Assumption 1 (干预有效性):(a) 条件外生性:U_j ⊥ H | (U_{-j}, W);(b) 排除性:U_j 只通过 X_j 影响其他变量;(c) 可检测性:每个祖先都能产生可检测的干预信号(Δ^anc_{jr} > 0)。 - Assumption 2 (代理调整后的非边分离):对于每个非父节点 j ∉ pa(r),在控制了其他祖先和代理变量后,X_j(或 U_j)与 X_r 条件独立(即 Δ^X_{jr} = 0 和 Δ^U_{jr} = 0)。这是本文的核心识别假设,它比"无未测量混杂"弱,但比"代理变量完全捕捉混杂"要强——它要求代理变量能在条件分布意义上阻断所有混杂路径。 - 相比已有文献:相比 GrIVET/GAMPI(需要线性或广义线性结构),PAM 不指定函数形式;相比 DCDI/ENCO(假设因果充分性),PABM 允许未测量混杂;相比 proximal causal inference(通常估计单个效应),PABM 输出整个图结构。

主要结果: - Theorem 6 (总体识别):在 Assumption 1 和 2 下,Ω_{jr} > 0 当且仅当 j ∈ pa(r)。这是整个方法的理论基础,它将图恢复问题转化为一系列条件分布比较问题。 - Theorem 11 (有限样本恢复):在"精确选择"(exact selection)的假设下,若每个父节点的增益都大于某个阈值(κ^tr_S),且估计误差(B_S)小于该阈值的一半,则 PABM 能以至少 1 - δ_tr - δ_X - δ_U 的概率恢复真实图。这个定理将图恢复的误差分解为三个部分:训练阶段的选择误差(δ_tr)、表达比较的估计误差(δ_X)和干预比较的估计误差(δ_U)。 - Theorem 12 (FWER 控制):在"有效 p 值"的假设下,对结构族、响应族和一致族分别应用 Holm 校正,能控制图级 FWER。这是对多重比较问题的严格处理。

证明路线与技术技巧: 1. 整体路线: - Step 1:证明祖先筛选的可靠性(Assumption 1 保证 Δ^anc_{jr} = 0 当且仅当 j ∉ Anc(r))。 - Step 2:在祖先筛选的基础上,证明条件分布比较的"零-正"分离性(Assumption 2 保证非父节点的增益为零,可检测性保证父节点的增益为正)。 - Step 3:将总体层面的分离性转化为有限样本的估计问题,通过控制估计误差(B_S)和信号强度(κ^tr_S)来保证恢复。 - Step 4:通过样本分割和多重检验校正(Holm/BH)来控制错误发现。 2. 关键跳跃点: - 从"祖先"到"父节点"的跳跃:这是最困难的部分。祖先筛选只能告诉我们 j 在 r 的上游,但不能区分直接和间接。作者通过"平衡掩蔽"——即同时调整其他祖先和代理变量——来阻断间接路径,从而将问题转化为条件独立性检验。这个跳跃的难点在于,调整变量本身可能引入对撞子偏差,而 Assumption 2 正是为了确保调整后的条件独立性成立。 - 从"总体"到"有限样本"的跳跃:Theorem 11 需要同时控制估计误差和信号强度。作者通过引入"训练-验证"分割,将模型拟合和假设检验分开,从而避免了过拟合导致的 p 值膨胀。 3. 技术技巧点名: - 条件似然比 / KL 散度:用条件 KL 散度(Δ^X_{jr}, Δ^U_{jr})作为衡量条件分布差异的度量,这比简单的均值差异更一般,能捕捉方差、形状等分布变化。 - 样本分割(Sample Splitting):训练集用于选择候选变量和拟合模型,验证集用于计算 p 值,这是保证 p 值有效性的关键。 - 多重检验校正(Holm/Bonferroni):对多个假设进行校正,控制图级 FWER。 - 平衡掩蔽(Balanced Masking):在比较中,确保除候选变量外,其他变量的处理方式(包括是否包含在模型中)完全一致,以保证比较的公平性。 - 经验过程 / 集中不等式:用于推导估计误差的界(B_S),这是 Theorem 11 的基础。

真实例子与应用: - 模拟研究:设计了三种机制——线性、非线性加性(cosine)、非加性交互(interaction)——来验证方法在不同数据生成过程中的表现。结果显示 PABM 在 SHD 和 F1 上优于或接近现有方法,且对代理变量质量(噪声水平)的敏感性分析表明,代理信息越准确,性能越好。 - K562 Perturb-seq 数据分析:使用公开的染色体 6 数据(19,251 个细胞,45 个基因),构建了一个候选网络。结果显示 PABM 构建的网络更小、更稀疏,且与 STRING 数据库的已知蛋白互作有相当的吻合度。这个例子想说明:PABM 在真实数据上能产生更保守、更可解释的候选网络,且对代理变量的消融(移除 GEM 指标)会显著改变结果,说明代理信息对控制混杂至关重要。

🔎 结论是否比证明窄: - 是的,存在明显差距。Theorem 6 和 11 的证明依赖于"精确选择"(exact selection)和"有效 p 值"(valid p-values)这两个强假设。但在实际实现中,作者使用的是经验的残差相关筛选和正态近似的 p 值,这些并未在定理中被严格证明。作者在文中也承认:"The numerical implementation uses working normal p-values... Establishing the one-sided risk condition and the conditional limit remains specific to the fitting procedure, including the boosting implementation studied here."(第 4.3 节后)。这意味着,理论保证是针对理想化的 oracle 过程,而实际算法是这种过程的启发式近似。此外,Theorem 11 的有限样本界依赖于对估计误差的均匀控制,这在非参数设定下通常需要较强的熵条件或光滑性假设,文中并未给出这些条件的显式验证。

四、开放问题

  1. 估计误差的显式控制:Theorem 11 中的 B_S(估计误差界)依赖于具体估计器的收敛速率。对于梯度提升这类自适应方法,如何给出非渐近的、可验证的误差界?这需要更细致的估计理论分析。
  2. 代理变量充分性的检验:Assumption 2 要求代理变量能完全阻断混杂,但实践中如何检验这一假设?能否发展出类似于"代理外生性检验"或"敏感性分析"的工具,来量化代理不充分时的偏差?
  3. 多重检验的效能优化:Holm 校正虽然控制了 FWER,但可能过于保守,导致检验效能降低。能否利用图结构信息(如层次关系)设计更高效的校正方法?
  4. 扩展到干预目标未知或软干预:本文假设干预目标是已知且精确的。在 Perturb-seq 中,指南 RNA 可能存在脱靶效应,或干预是部分有效的(软干预)。如何将 PABM 扩展到这些更现实的场景?
  5. 与因果表示学习的结合:当观测变量不是基本因果变量(如基因表达是潜在调控网络的投影)时,如何将 PABM 与因果表示学习结合,以恢复潜在层面的因果图?

提示:要确认这些是否是真 gap,建议去读近 2-3 年(2023-2026)关于"干预数据因果发现"、"代理变量因果推断"、"Perturb-seq 网络推断"的顶会/顶刊论文(如 NeurIPS, ICML, JASA, Biometrika)的引言和未来工作部分。如果多个独立团队都在朝同一方向努力,那大概率是共识性的真问题;如果只有零星提及,则可能是尚未被充分开发的空白。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论