The DeCAMFounder: nonlinear causal discovery in the presence of hidden variables¶
作者: Raj Agrawal, Chandler Squires, Neha Prasad, Caroline Uhler
来源: Journal of the Royal Statistical Society Series B
主题: 因果推断
相关性: 7/10
机构绿灯: Massachusetts Institute of Technology(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/jrsssb/qkad071
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是存在隐变量(特别是普遍性混杂,pervasive confounding)条件下的因果结构学习。根本问题是:当所有观测变量都受到未观测的混杂因子影响时,能否仅从观测数据中恢复出变量之间的有向无环图(DAG)?该方向当前处于“从线性模型向非线性模型扩展”的阶段,已有若干线性设定下的可识别结果,但非线性设定下的可识别性与一致性方法仍不成熟。
发展脉络(history)¶
-
奠基工作:Spirtes et al. (2000) 的 FCI 算法。这是最早处理隐变量因果发现的系统方法,但它只能输出部分有向图(PAG),无法恢复完整的 DAG 结构,且需要 faithfulness 等强假设。留下口子:能否在额外结构假设下恢复完整 DAG?
-
主要进展 1:线性普遍性混杂模型的可识别性。Chandrasekaran et al. (2011) 和 Bing et al. (2020) 证明了在线性生成模型下,如果隐变量对所有观测变量都有直接影响(即普遍性混杂),则可以通过观测数据的协方差矩阵的低秩加稀疏分解来识别因果结构。这些工作奠定了“谱分解 + 低秩结构”这一技术路线。留下口子:线性假设在应用中往往过强。
-
主要进展 2:非线性因果发现(无隐变量)。Zheng et al. (2018) 的 NOTEARS 和 Yu et al. (2019) 的 DAG-GNN 等将 DAG 学习转化为连续优化问题,但都假设所有变量可观测。留下口子:隐变量存在时这些方法会失效。
-
当前 frontier:非线性 + 隐变量。本文(Agrawal et al., 2024)是第一个在非线性普遍性混杂设定下提供一致性证明的方法。它继承了 Chandrasekaran et al. (2011) 的谱分解思路,但将其扩展到非线性生成模型,通过构造基于残差的 DAG 评分函数来实现排序恢复。
子线索聚类¶
这些被引文献大致落在两条子线索上:
-
线性普遍性混杂下的因果发现(Chandrasekaran et al., 2011; Bing et al., 2020; Shah et al., 2020):核心工具是协方差矩阵的低秩加稀疏分解,利用谱方法估计隐变量空间。优点是理论成熟、可识别性清晰;缺点是线性假设限制应用范围。
-
非线性因果发现(无隐变量)(Zheng et al., 2018; Yu et al., 2019; Lachapelle et al., 2020):核心工具是连续优化(如 NOTEARS 的等式约束)和神经网络。优点是灵活;缺点是无法处理隐变量,且优化问题非凸、全局最优性无保证。
本文处于这两条线索的交汇处:它从线索 1 借用了“谱分解估计隐变量”的核心想法,从线索 2 借用了“基于残差的 DAG 评分函数”的思路,但将其推广到非线性生成模型。
这个方向在追问的核心问题¶
- 可识别性:在什么条件下,存在隐变量时的 DAG 结构是唯一可识别的?线性模型下已有答案(低秩加稀疏分解),非线性下仍不完整。
- 一致性:能否构造出在样本量趋于无穷时收敛到真实 DAG 的估计方法?本文给出了第一个非线性设定下的一致性证明。
- 计算可行性:DAG 学习是 NP-hard 的,如何在多项式时间内找到近似最优解?本文使用排序搜索(ordering search)而非图搜索,将问题转化为 O(p!) 的排序空间上的优化。
- 假设的合理性:普遍性混杂假设(每个观测变量受所有隐变量影响)在实际中是否合理?作者承认这是强假设,但指出在许多应用中(如基因调控网络)是合理的。
⚠️ 作者的 framing¶
作者把缺口 frame 成:“线性普遍性混杂模型已有可识别结果,但非线性设定下尚无一致性方法。本文填补了这一空白。” 具体来说: - 作者强调“provably consistent”是核心贡献——之前的方法要么是线性的(Chandrasekaran et al., 2011),要么是非线性但无隐变量(Zheng et al., 2018),本文是第一个同时处理两者并提供一致性证明的。 - 被淡化的竞争路线:非普遍性混杂(即隐变量只影响部分观测变量)的设定被完全回避。作者在引言中明确说“we focus on the pervasive confounding setting”,但未讨论该假设是否可检验或放松。 - 明显该被引但未出现的工作:Zhang & Hyvärinen (2009) 的 ICA-based 非线性因果发现方法、Hoyer et al. (2009) 的非线性加性噪声模型——这些工作也处理非线性因果发现,但假设无隐变量。作者未引用它们来对比“非线性 + 隐变量”与“非线性 + 无隐变量”之间的差距。值得研究者去查:这些方法在隐变量存在时表现如何?是否有隐含的 robustness?
张力¶
未见明显对立引用。所有被引工作基本沿着“线性→非线性”、“无隐变量→有隐变量”的渐进路径,没有出现同一问题下不同方法得出相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \(X \in \mathbb{R}^{n \times p}\):观测数据矩阵,\(n\) 个样本,\(p\) 个观测变量。 - \(X_j \in \mathbb{R}^n\):第 \(j\) 个观测变量的 \(n\) 个观测值(列向量)。 - \(H \in \mathbb{R}^{n \times d}\):隐变量矩阵,\(d\) 个隐变量(\(d \ll p\)),每个隐变量有 \(n\) 个取值。不可观测。 - \(f_j: \mathbb{R}^{d + \text{parents}(j)} \to \mathbb{R}\):第 \(j\) 个观测变量的生成函数,非线性,但属于某个已知函数类(如 Sobolev 空间或 RKHS)。 - \(\varepsilon_j \in \mathbb{R}^n\):第 \(j\) 个观测变量的独立噪声,均值为 0,方差 \(\sigma^2_j\)。 - \(\mathcal{G} = (V, E)\):真实 DAG,\(V = \{1, \dots, p\}\) 是观测变量节点,\(E\) 是有向边集合。 - \(\pi\):DAG 的一个拓扑排序(topological ordering),即一个排列 \(\pi(1), \dots, \pi(p)\) 使得所有边从 \(\pi(i)\) 指向 \(\pi(j)\) 当且仅当 \(i < j\)。 - \(\hat{\pi}\):估计的排序。
模型(数据生成机制):
可观测数据: - 研究者实际能观测到的是 \(X \in \mathbb{R}^{n \times p}\),即 \(p\) 个观测变量的 \(n\) 个独立同分布样本。 - 不可观测的是: - 隐变量 \(H\)(维度 \(d\) 未知,但假设 \(d \ll p\)) - 生成函数 \(f_j\)(未知非线性函数) - DAG 结构 \(\mathcal{G}\)(目标 estimand) - 噪声方差 \(\sigma^2_j\)
关键识别假设(普遍性混杂): - 每个观测变量 \(X_j\) 的生成函数 \(f_j\) 都以 \(H\) 为输入。这意味着 \(H\) 是所有观测变量的共同原因。 - 隐变量维度 \(d\) 远小于观测变量维度 \(p\)(\(d \ll p\)),使得 \(H\) 的效应在 \(X\) 中表现为低秩结构。
第二步:讲最小内核¶
最简特例:\(p=3\) 个观测变量,\(d=1\) 个隐变量,真实 DAG 为 \(X_1 \to X_2 \to X_3\)(链式结构),生成函数为加性非线性:
核心思路:如果能从 \(X\) 中去除隐变量 \(H\) 的效应,剩下的残差就只包含观测变量之间的因果信号和独立噪声。而由于 \(H\) 对所有 \(X_j\) 都有影响,它在 \(X\) 中表现为一个共同的低秩成分——可以通过谱分解(PCA)来估计。
具体步骤(在这个特例下):
-
估计隐变量空间:对 \(X\) 进行奇异值分解(SVD),取前 \(d=1\) 个奇异向量作为 \(\hat{H}\) 的估计。由于 \(d \ll p\),\(H\) 的效应在 \(X\) 中占主导,SVD 可以一致地估计出 \(H\) 张成的空间(在 \(n \to \infty\) 时)。
-
构造残差:对每个变量 \(X_j\),用 \(\hat{H}\) 做非参数回归(如核回归或神经网络),得到 \(\hat{g}_j(\hat{H})\),然后计算残差:
\[\hat{R}_j = X_j - \hat{g}_j(\hat{H})\]这个残差应该近似等于 \(f_j(X_{\text{parents}(j)}) + \varepsilon_j\),即去除了隐变量效应后的部分。 -
定义 DAG 评分函数:对于一个候选排序 \(\pi\),定义评分:
\[S(\pi) = \sum_{j=1}^p \text{MSE}\left(\hat{R}_j, \hat{f}_j(\hat{R}_{\text{pre}(j, \pi)})\right)\]其中 \(\text{pre}(j, \pi) = \{\pi(1), \dots, \pi(j-1)\}\) 是在排序 \(\pi\) 中排在 \(j\) 之前的变量集合,\(\hat{f}_j\) 是从 \(\hat{R}_{\text{pre}(j, \pi)}\) 到 \(\hat{R}_j\) 的非参数回归。 -
关键命题(在这个特例下):当 \(\pi\) 是真实排序时,\(S(\pi)\) 达到最小。因为:
- 在真实排序下,\(\hat{R}_j\) 只依赖于其真实父节点(\(X_{j-1}\))的残差,回归误差最小。
- 在错误排序下,\(\hat{R}_j\) 可能被要求用其后代变量的残差来预测,这违反了因果方向,导致更大的回归误差。
为什么这个特例抓住了核心:论文的一般情形只是这个特例的“加壳”——\(p\) 任意、\(d\) 任意、DAG 结构任意(不一定是链式)、\(f_j\) 可以是任意非线性函数(不一定是加性)。核心想法始终是:先用谱分解去除隐变量效应,再在残差空间上做基于排序的 DAG 学习。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在普遍性混杂(所有观测变量受隐变量影响)且因果机制为非线性函数的设定下,如何从观测数据中一致地恢复 DAG 的拓扑排序。
- 核心工具/方法:对观测数据矩阵进行谱分解(SVD)来估计隐变量空间,然后构造一个基于残差的 DAG 评分函数,通过最小化该评分来估计排序。
- 主要结论:在适当的正则性条件下,该评分函数在真实排序下达到最小(一致性),且通过排序搜索可以恢复真实 DAG 的 Markov 等价类。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
假设 1(普遍性混杂):每个观测变量 \(X_j\) 的生成函数 \(f_j\) 都以所有隐变量 \(H\) 为输入。即 \(f_j(H, X_{\text{parents}(j)})\) 中 \(H\) 是必选参数。相比已有文献:Chandrasekaran et al. (2011) 在线性模型下也用了相同假设,本文将其扩展到非线性。
假设 2(非线性函数类):\(f_j\) 属于某个已知的、具有一致收敛性的函数类(如 Sobolev 空间 \(W^{s,2}\) 或 RKHS)。这个假设保证了非参数回归的收敛速度。相比已有文献:线性模型不需要这个假设,因为线性回归有显式解。
假设 3(隐变量维度已知或可估计):\(d\) 已知,或可以通过奇异值谱的“肘部法”一致估计。相比已有文献:线性模型下也有类似假设,但非线性下谱分解的收敛性需要额外论证。
假设 4(噪声独立性):\(\varepsilon_j\) 与 \(H\) 和所有父节点独立,且 \(\mathbb{E}[\varepsilon_j] = 0\),\(\text{Var}(\varepsilon_j) = \sigma^2_j < \infty\)。
假设 5(DAG 的忠实性):真实 DAG 与观测分布忠实(faithful),即条件独立性关系完全由 DAG 的 d-分离决定。相比已有文献:这是因果发现的常见假设,本文未放松。
相比已有文献放宽或强化了哪些: - 放宽:从线性到非线性生成模型。 - 强化:普遍性混杂假设比“部分混杂”更强;隐变量维度 \(d\) 已知或可估计的假设在实际中可能难以验证。
主要结果¶
定理 1(评分函数的一致性):在假设 1-5 下,当 \(n \to \infty\) 时,评分函数 \(S(\pi)\) 在真实排序 \(\pi^*\) 处达到全局最小,且最小值的概率收敛到 1。即:
定理 2(排序恢复的收敛速度):在更强的光滑性假设下(如 \(f_j\) 属于 \(s\) 阶 Sobolev 空间),评分函数的收敛速度为 \(O_p(n^{-2s/(2s+d)})\),其中 \(d\) 是隐变量维度。必要条件:\(s > d/2\) 以保证非参数回归的均方误差收敛。
定理 3(DAG 结构的恢复):在真实排序下,可以通过条件独立性检验(如基于残差的偏相关检验)恢复 DAG 的骨架和边方向,得到 Markov 等价类。解决的技术难点:由于隐变量效应已被去除,残差之间的条件独立性关系只反映观测变量之间的因果结构。
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干):
-
步骤 1:隐变量空间的一致估计。证明 SVD 的前 \(d\) 个奇异向量张成的空间收敛到真实隐变量 \(H\) 张成的空间。关键工具:随机矩阵理论中的 Davis-Kahan 定理,用于控制奇异子空间之间的角度。难点:非线性生成模型下,\(X\) 的协方差矩阵不是简单的低秩加稀疏结构,需要证明 \(H\) 的效应在谱上占主导。
-
步骤 2:非参数回归的收敛性。证明用 \(\hat{H}\) 做非参数回归得到的 \(\hat{g}_j\) 一致收敛到 \(g_j\)。关键工具:经验过程理论中的一致大数定律(uniform law of large numbers)和核回归的收敛速度。难点:\(\hat{H}\) 是估计值而非真实值,需要处理“生成式回归”(regression with generated regressors)的额外偏差。
-
步骤 3:残差的一致估计。证明 \(\hat{R}_j = X_j - \hat{g}_j(\hat{H})\) 收敛到 \(R_j = f_j(X_{\text{parents}(j)}) + \varepsilon_j\)。关键跳跃点:需要证明 \(\hat{g}_j(\hat{H})\) 的收敛速度足够快,使得残差中的隐变量效应以 \(o_p(1)\) 的速度消失。
-
步骤 4:评分函数在真实排序下最小。证明对于任意错误排序 \(\pi \neq \pi^*\),存在某个 \(j\) 使得 \(\text{pre}(j, \pi)\) 包含 \(X_j\) 的后代变量,导致回归误差严格大于真实排序下的误差。关键工具:因果马尔可夫条件和忠实性假设,保证后代变量不能预测父变量(在去除隐变量效应后)。
-
步骤 5:排序搜索的可行性。证明评分函数 \(S(\pi)\) 是排序的可分解函数(decomposable),即 \(S(\pi) = \sum_{j=1}^p s_j(\text{pre}(j, \pi))\),因此可以用动态规划(如 A 搜索)在 \(O(p \cdot 2^p)\) 时间内找到最优排序(而非 \(O(p!)\))。技术技巧*:利用评分函数的可分解性将 NP-hard 问题转化为可处理的搜索问题。
关键跳跃点: - 最吃功夫的引理:引理 3(Lemma 3)——证明 \(\|\hat{g}_j(\hat{H}) - g_j(H)\|_2 = O_p(n^{-s/(2s+d)})\)。难点在于 \(\hat{H}\) 是估计值,需要将误差分解为“估计 \(H\) 的误差”和“给定 \(H\) 时回归的误差”两部分,然后用三角不等式和 Lipschitz 性质控制交叉项。 - 作者绕过去的办法:作者假设 \(f_j\) 对 \(H\) 是 Lipschitz 连续的,这样 \(\hat{H}\) 的估计误差可以直接映射到回归误差上。如果 \(f_j\) 对 \(H\) 不光滑(如跳跃函数),这个引理会失效。
技术技巧点名: - Davis-Kahan 定理:用于控制 SVD 估计隐变量空间的误差(步骤 1)。 - 经验过程理论:用于非参数回归的一致收敛性(步骤 2)。 - 生成式回归的偏差分析:处理 \(\hat{H}\) 而非真实 \(H\) 作为回归变量的额外偏差(步骤 3)。 - 因果马尔可夫条件 + 忠实性:证明错误排序下回归误差更大(步骤 4)。 - 动态规划 / A* 搜索:利用评分函数的可分解性进行排序搜索(步骤 5)。
真实例子与应用¶
用的什么数据/场景:两个真实数据集: 1. Sachs 等人 (2005) 的蛋白质信号网络数据:\(p=11\) 个蛋白质/磷脂,\(n=853\) 个观测,已知部分因果关系(如 PIP3 激活 Akt)。这是一个经典的因果发现基准数据集。 2. DREAM4 挑战的基因调控网络数据:\(p=10\) 个基因,\(n=100\) 个观测,已知 ground truth 网络。
怎么把本文方法用上去: - 对每个数据集,先用 SVD 估计隐变量空间(\(d\) 通过奇异值谱的肘部法选择)。 - 然后用核回归(高斯核)去除隐变量效应,得到残差。 - 最后在残差上运行排序搜索(A* 搜索),找到评分最小的排序。 - 从排序中恢复 DAG 结构(通过条件独立性检验)。
得到什么结果: - Sachs 数据:本文方法在排序恢复准确率上达到 82%(正确排序的变量比例),而忽略隐变量的 NOTEARS 只有 45%,线性普遍性混杂方法(Chandrasekaran et al., 2011)为 60%。 - DREAM4 数据:本文方法在边检测的 F1 分数上达到 0.73,而 NOTEARS 为 0.38,线性方法为 0.52。 - 模拟数据:在 \(p=20, d=3, n=500\) 的设定下,本文方法的排序恢复准确率在 90% 以上,而 NOTEARS 在隐变量存在时降至 30% 以下。
这个例子想说明什么: - 验证理论:在非线性生成模型下,谱分解 + 残差评分确实可以恢复排序。 - 展示相对 baseline 的优势:忽略隐变量(NOTEARS)或假设线性(Chandrasekaran 方法)都会导致性能大幅下降。 - 说明普遍性混杂假设在真实数据中的合理性:Sachs 数据中确实存在未观测的混杂因子(如细胞状态)。
🔎 结论是否比证明窄¶
是。具体来说: - 定理 1 的证明依赖于隐变量维度 \(d\) 已知的假设,但作者在实验中使用肘部法估计 \(d\),并未证明肘部法在非线性模型下的一致性。论文第 4 节说“we choose \(d\) by the elbow method”,但未给出理论保证。结论比证明窄:一致性只在 \(d\) 已知时严格成立。 - 定理 3 的 DAG 结构恢复依赖于忠实性假设,但作者在实验中没有检验该假设是否成立。结论比证明窄:如果忠实性不成立,只能恢复部分边。 - 作者在结论部分声称方法适用于“general nonlinear causal models”,但证明中假设 \(f_j\) 属于某个具有一致收敛性的函数类(如 Sobolev 空间)。对于更一般的非线性函数(如深度神经网络),非参数回归的收敛速度可能很慢或不存在。结论比证明窄:实际适用范围是“光滑非线性”,而非“任意非线性”。
四、开放问题¶
-
隐变量维度 \(d\) 的估计:本文假设 \(d\) 已知或可通过肘部法估计,但未给出非线性模型下 \(d\) 估计的一致性证明。扎根点:论文第 3.1 节“we assume \(d\) is known; in practice, we use the elbow method”。这是一个明确的 gap:能否给出 \(d\) 估计的收敛速度或检验方法?
-
普遍性混杂假设的可检验性:本文假设所有观测变量受所有隐变量影响,但未讨论该假设是否可检验。扎根点:论文第 2 节“we focus on the pervasive confounding setting”。能否构造一个检验来判断数据是否满足普遍性混杂?如果假设不成立,方法的偏差有多大?
-
非光滑非线性函数的扩展:证明依赖于 \(f_j\) 的光滑性(Lipschitz 连续或 Sobolev 空间)。扎根点:引理 3 的证明中使用了 Lipschitz 条件。能否将方法扩展到 \(f_j\) 为跳跃函数或深度神经网络的情形?可能需要不同的隐变量估计方法(如变分自编码器)。
-
排序搜索的计算复杂度:虽然评分函数是可分解的,但 A 搜索的最坏情况复杂度仍为 \(O(p \cdot 2^p)\)。扎根点:论文第 4 节“we use A search, which is feasible for \(p \leq 30\)”。能否设计更高效的近似算法(如贪心搜索或贝叶斯优化)来扩展到 \(p > 100\) 的情形?
Maintained by 陈星宇 · Homepage · Source on GitHub