跳转至

Spectrally Deconfounded Random Forests

作者: Markus Ulmer, Cyrill Scheidegger, Peter Bühlmann
来源: Journal of Computational and Graphical Statistics
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在存在未观测混杂变量(unobserved confounders)时,如何一致地估计一个回归函数(或因果效应)。 经典回归假设所有相关变量都已观测到,但现实中往往存在同时影响处理变量(或协变量)和结果变量的未观测因素,导致遗漏变量偏差(omitted variable bias)。 当前该方向的成熟度较高,已有大量针对线性模型、部分线性模型、以及非参数模型的识别与估计方法,但将去混杂技术扩展到灵活的非参数集成学习方法(如随机森林)仍是一个相对较新的尝试。

发展脉络(history)

根据论文的引言和参考文献,该方向的发展脉络可梳理如下:

  1. 奠基工作:线性模型中的工具变量(IV)与代理变量

    • Angrist, Imbens, and Krueger (1999) 等:工具变量(IV)方法是处理未观测混杂的经典框架,通过寻找一个与未观测混杂无关、但与处理变量相关的工具变量来识别因果效应。 但 IV 方法依赖于找到有效的工具变量,这在许多应用中非常困难。
    • Pearl (2009) 等:因果图与后门准则、前门准则为识别因果效应提供了图形化工具,但同样依赖于对因果结构的先验知识。
  2. 主要进展:利用高维观测协变量进行“代理”去混杂

    • Wang, Athey, and Imbens (2020):提出了“代理变量”(proxy variable)的概念,利用高维观测协变量作为未观测混杂的“代理”,通过正则化方法(如 Lasso)来估计因果效应。 这是从线性模型出发,利用高维信息进行去混杂的关键一步。
    • Chernozhukov et al. (2018) 的 Double/Debiased Machine Learning (DML) 框架:将机器学习方法(如随机森林、神经网络)用于因果推断,通过 Neyman 正交化(Neyman orthogonality)和交叉拟合(cross-fitting)来消除正则化偏差,从而在存在高维协变量时得到渐近正态的估计量。 这为将灵活的非参数方法用于因果推断提供了理论基础。
  3. 当前 Frontier:谱去混杂(Spectral Deconfounding)

    • Chernozhukov, Hansen, Liao, and Zhu (2022):提出了“谱去混杂”(Spectral Deconfounding)方法,专门针对高维观测协变量线性模型设定。 核心思想是:如果未观测混杂变量对观测协变量的影响是“密集”的(即影响很多观测协变量),那么这些混杂变量的信息会体现在观测协变量矩阵的主成分中。 因此,通过移除协变量矩阵的某些主成分(即“谱”分解),可以消除未观测混杂带来的偏差。 该方法不需要工具变量,也不需要知道混杂变量的具体形式,只需假设其影响是“密集”的。
    • 本文(Ulmer, Scheidegger, Bühlmann, 2024):将谱去混杂的思想从线性模型扩展到非线性随机森林框架,提出了 Spectrally Deconfounded Random Forests (SDForests)。 这是首次将谱去混杂与集成学习方法结合,旨在处理非线性回归中的未观测混杂问题。

子线索聚类

这些被引文献大致落在以下两条子线索上:

  • 线索一:基于工具变量/代理变量的方法:这类方法依赖于找到有效的工具变量或代理变量。 代表工作包括 Angrist et al. (1999) 的 IV 方法,以及 Wang et al. (2020) 的代理变量方法。 其瓶颈在于寻找有效工具变量/代理变量的难度。
  • 线索二:基于高维协变量结构的方法:这类方法不依赖工具变量,而是利用高维观测协变量自身的结构信息(如稀疏性、低秩结构)来识别混杂。 代表工作包括 Chernozhukov et al. (2022) 的谱去混杂方法,以及本文的 SDForests。 其瓶颈在于对混杂结构(如“密集”假设)的依赖。

这个方向在追问的核心问题

  1. 识别问题:在什么条件下,仅凭观测数据就能识别出未观测混杂下的因果效应或回归函数? 这通常需要一些结构假设(如线性、稀疏性、密集性)。
  2. 估计问题:在识别条件成立的前提下,如何构造出具有良好统计性质(如一致性、渐近正态性、最优收敛速度)的估计量?
  3. 计算问题:对于高维数据,如何设计出计算上可行且统计上有效的算法?
  4. 鲁棒性问题:当识别假设(如“密集”混杂)被轻微违反时,估计量的表现如何?

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将缺口 frame 为“将谱去混杂从线性模型扩展到非线性、灵活的集成学习方法(随机森林)”。 他们指出,现有的谱去混杂方法(Chernozhukov et al., 2022)仅适用于线性模型,而随机森林等非线性方法在应用中更灵活、更强大。 因此,本文是“显然的下一步”——将谱去混杂的“去偏”能力与随机森林的“拟合”能力相结合。
  • 哪些竞争路线被他淡化或回避了:作者淡化了 DML 框架。 DML 也可以处理高维协变量下的非线性模型(如使用随机森林作为 nuisance 函数的估计器),但 DML 通常需要 Neyman 正交化,而本文的方法是通过直接修改目标函数(最小二乘)来实现去混杂。 作者在引言中简要提及 DML,但并未深入比较两者的优劣。 此外,作者回避了与贝叶斯方法(如 Bayesian Additive Regression Trees, BART)的比较,BART 也是一种处理高维非线性回归的流行方法。
  • 什么明显该被引/该存在、却没出现在 intro 里?:作者没有引用 Künzel, Sekhon, Bickel, and Yu (2019) 的 Causal Forest 方法。 Causal Forest 是随机森林在因果推断中的一个重要变体,专门用于估计异质性处理效应(CATE)。 虽然 Causal Forest 通常假设无未观测混杂(unconfoundedness),但它是随机森林在因果推断领域最直接的相关工作之一。 作者没有讨论 SDForests 与 Causal Forest 在目标(估计回归函数 vs. 估计 CATE)和假设上的区别,这是一个值得研究者去查的缺口。

张力

未见明显对立引用。 所有被引工作都沿着“利用高维协变量结构处理未观测混杂”这一主线,彼此之间是互补而非矛盾的关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \( Y \in \mathbb{R} \):结果变量(response variable)。
    • \( X \in \mathbb{R}^p \)高维观测协变量(observed covariates),\( p \) 很大(可能远大于样本量 \( n \))。
    • \( H \in \mathbb{R}^d \)未观测混杂变量(unobserved confounders),\( d \) 相对较小(\( d \ll p \))。 这是研究者无法观测到的。
    • \( f(X) \):我们想要估计的直接回归函数(direct regression function),即 \( \mathbb{E}[Y | X] \) 中由 \( X \) 直接贡献的部分。 在存在 \( H \) 时,\( \mathbb{E}[Y | X] \) 会受到 \( H \) 的间接影响。
    • \( g(X, H) \):真实的回归函数,即 \( \mathbb{E}[Y | X, H] \)。 由于 \( H \) 不可观测,我们无法直接估计它。
    • \( \epsilon \):独立于 \( X \)\( H \) 的随机噪声,\( \mathbb{E}[\epsilon | X, H] = 0 \)
    • \( n \):样本量。
    • \( \mathbf{X} \in \mathbb{R}^{n \times p} \):观测到的协变量矩阵。
    • \( \mathbf{Y} \in \mathbb{R}^n \):观测到的结果向量。
    • \( \mathbf{H} \in \mathbb{R}^{n \times d} \):未观测的混杂矩阵。
    • \( \mathbf{\Sigma} = \frac{1}{n} \mathbf{X}^\top \mathbf{X} \):观测协变量的样本协方差矩阵。
    • \( \mathbf{\Gamma} \)\( \mathbf{X} \) 的谱分解中的特征向量矩阵。
    • \( \mathbf{\Gamma}_{(k)} \):前 \( k \) 个主成分对应的特征向量(即 \( \mathbf{X} \) 的谱分解中最大的 \( k \) 个特征值对应的特征向量)。
  • 模型

    • 数据生成机制(DGP)假设为:
      \[Y = g(X, H) + \epsilon\]
      其中 \( g \) 是一个未知的、可能是非线性的函数。 本文的核心假设是,未观测混杂 \( H \) 对观测协变量 \( X \) 的影响是线性且密集的(linear and dense confounding)。 具体来说,假设存在一个线性关系:
      \[X = \mathbf{B} H + \tilde{X}\]
      其中 \( \mathbf{B} \in \mathbb{R}^{p \times d} \) 是一个系数矩阵,\( \tilde{X} \) 是独立于 \( H \) 的噪声。 “密集”意味着 \( \mathbf{B} \) 的许多(甚至所有)元素都是非零的,即 \( H \) 影响 \( X \) 的很多维度。 这个假设是谱去混杂方法的核心:它意味着 \( H \) 的信息会“泄露”到 \( X \)主成分中。
  • 可观测数据

    • 研究者实际能观测到的是:\( \{(X_i, Y_i)\}_{i=1}^n \),即 \( n \) 个独立同分布的样本,每个样本包含一个 \( p \) 维的观测协变量向量和一个标量结果。
    • 研究者想要但观测不到的是:\( H_i \)(未观测混杂变量)和 \( g(X, H) \) 的真实形式。 因此,直接对 \( Y \)\( X \) 进行回归会得到 \( \mathbb{E}[Y | X] \),它包含了 \( H \) 通过 \( X \) 的间接影响,从而产生遗漏变量偏差。

第二步:讲最小内核

本文的最小内核可以理解为:在线性模型设定下,谱去混杂如何工作,以及它如何被推广到随机森林

最简特例:线性模型 + 一个未观测混杂

假设: 1. 线性模型\( Y = X^\top \beta + H \gamma + \epsilon \),其中 \( \beta \in \mathbb{R}^p \)\( \gamma \in \mathbb{R} \) 是系数。 2. 一个未观测混杂\( d = 1 \),即 \( H \) 是一个标量。 3. 线性且密集的混杂\( X = \mathbf{B} H + \tilde{X} \),其中 \( \mathbf{B} \in \mathbb{R}^p \) 是一个密集的向量(即几乎所有元素非零),\( \tilde{X} \) 是独立于 \( H \) 的噪声。

问题:我们想估计 \( \beta \)(即 \( X \)\( Y \) 的直接效应),但直接对 \( Y \)\( X \) 进行 OLS 回归会得到有偏的估计,因为 \( X \)\( H \) 相关(通过 \( \mathbf{B} \))。

谱去混杂的核心思路: 1. 识别混杂方向:由于 \( H \)\( X \) 的影响是“密集”的,\( H \) 的信息会体现在 \( X \)第一个主成分(即协方差矩阵 \( \mathbf{\Sigma} \) 的最大特征值对应的特征向量)中。 直观上,如果 \( H \) 影响 \( X \) 的很多维度,那么 \( X \) 的样本点会在 \( H \) 的方向上产生最大的变异。 2. 移除混杂方向:将 \( X \) 投影到与第一个主成分正交的子空间上,即:

\[X^{\perp} = X - \mathbf{\Gamma}_{(1)} \mathbf{\Gamma}_{(1)}^\top X\]
其中 \( \mathbf{\Gamma}_{(1)} \) 是第一个主成分对应的特征向量。 这一步移除了 \( X \) 中与 \( H \) 最相关的部分。 3. 用去混杂后的协变量进行回归:用 \( X^{\perp} \) 代替 \( X \)\( Y \) 进行 OLS 回归,得到 \( \beta \) 的估计。 由于 \( X^{\perp} \)\( H \) 的相关性被大大削弱,因此估计的偏差会减小。

推广到随机森林: 随机森林的核心是递归地对协变量空间进行划分(基于 CART 准则),并在每个叶子节点内用该叶子节点内样本的 \( Y \) 的均值作为预测值。 谱去混杂的思想可以自然地嵌入到随机森林的构建过程中: 1. 在每个分裂节点,我们不是直接用原始的 \( X \) 来寻找最佳分裂点,而是先用谱去混杂方法移除当前节点内样本的 \( X \) 中与未观测混杂相关的方向。 2. 使用去混杂后的 \( X^{\perp} \) 来寻找最佳分裂点(即最小化分裂后的均方误差)。 3. 在叶子节点,用该节点内样本的 \( Y \) 的均值作为预测值,但由于分裂过程已经基于去混杂后的协变量,因此预测值对未观测混杂的敏感性降低。

为什么这个最小内核能支撑全文:这个特例清晰地展示了谱去混杂的“去偏”机制——通过移除协变量矩阵的主成分来消除未观测混杂的影响。 本文的一般情形(非线性回归函数、多个未观测混杂、随机森林的复杂分裂准则)只是在这个核心思想上进行“加壳”:用随机森林来拟合非线性函数,用多个主成分来应对多个混杂变量,用更复杂的理论分析来证明偏差的可控性。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在存在未观测混杂变量时,如何利用高维观测协变量来估计一个非线性的回归函数。
  2. 核心工具/方法:提出了 Spectrally Deconfounded Random Forests (SDForests),该方法在随机森林的每个分裂节点,通过对观测协变量矩阵进行谱分解并移除其前 \( k \) 个主成分,来消除未观测混杂带来的偏差。
  3. 主要结论:在一定的线性且密集混杂假设下,SDForests 的偏差可以被控制;模拟和半合成实验表明,即使假设不完全满足,SDForests 在估计直接回归函数时也优于经典随机森林,且在无混杂时性能相当。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 设定
    • 数据生成过程:\( Y_i = g(X_i, H_i) + \epsilon_i \)\( i = 1, \dots, n \)
    • \( g \) 是未知的、可能是非线性的函数。
    • \( X_i \in \mathbb{R}^p \)\( H_i \in \mathbb{R}^d \)\( \epsilon_i \) 是独立噪声。
    • 核心假设(线性且密集混杂)
      • 线性混杂\( X_i = \mathbf{B} H_i + \tilde{X}_i \),其中 \( \mathbf{B} \in \mathbb{R}^{p \times d} \) 是未知的系数矩阵,\( \tilde{X}_i \) 是独立于 \( H_i \) 的噪声。
      • 密集混杂\( \mathbf{B} \) 的列向量是“密集”的,即它们与 \( \mathbb{R}^p \) 中的标准基向量有非零内积。 更技术性的表述是,\( \mathbf{B} \) 的列向量张成的子空间与 \( \mathbb{R}^p \) 中的“稀疏”方向正交。 这个假设保证了 \( H \) 的信息会“泄露”到 \( X \) 的许多维度中,从而体现在 \( X \) 的主成分里。
    • 去混杂参数 \( k \):需要指定要移除的主成分个数 \( k \)。 理论上,\( k \) 应等于未观测混杂的维度 \( d \)。 在实际应用中,\( k \) 可以通过交叉验证或启发式方法(如“肘部法则”)来选择。
  • 相比已有文献的放宽或强化
    • 放宽:相比 Chernozhukov et al. (2022) 的线性模型,本文允许回归函数 \( g \) 是非线性的。
    • 强化:本文的“密集混杂”假设比一些代理变量方法(如 Wang et al., 2020)的“稀疏”假设更强。 后者假设只有少数观测协变量是混杂的代理,而本文假设几乎所有观测协变量都受到混杂的影响。

主要结果

本文的主要结果是理论分析和实证验证。

  • 理论结果(偏差控制)

    • 定理 1(偏差界):在一定的正则性条件下(包括线性且密集混杂假设、随机森林的树结构假设等),SDForests 的估计偏差可以被一个与 \( k \)\( p \) 相关的量所控制。 具体来说,偏差的上界随着 \( k \) 的增加而减小(因为移除了更多混杂信息),但也会随着 \( p \) 的增加而增加(因为高维带来了更大的估计方差)。 这个定理给出了一个偏差-方差权衡的定量描述。
    • 直觉:该定理表明,通过选择合适的 \( k \),SDForests 可以有效地减小由未观测混杂引起的偏差,同时不会引入过大的方差。 它解决了“去混杂”与“估计精度”之间的核心矛盾。
    • 必要条件:该定理依赖于“线性且密集混杂”假设。 如果该假设不成立(例如,混杂是稀疏的),则偏差控制可能失效。
    • 解决的技术难点:证明的关键在于分析随机森林的分裂过程如何受到谱去混杂的影响。 作者需要证明,在去混杂后的协变量空间中进行分裂,可以近似地找到与原始回归函数 \( g \) 相关的结构,同时避免被混杂变量 \( H \) 所误导。
  • 实证结果(模拟与半合成数据)

    • 模拟研究:作者设计了多种模拟场景,包括线性、非线性的回归函数,以及不同强度的混杂。 结果表明,SDForests 在存在混杂时,其均方误差(MSE)显著低于经典随机森林。 在无混杂时,两者的性能几乎相同。
    • 半合成数据(单细胞基因表达数据):作者使用一个真实的单细胞基因表达数据集(\( p \approx 1000 \)),并人为地引入一个未观测混杂变量(模拟一个已知的生物学过程)。 结果再次验证了 SDForests 的优势。
    • 这个例子想说明什么:这个半合成实验旨在说明,即使在真实数据中,线性且密集混杂的假设可能不完全满足,SDForests 仍然能够提供比经典随机森林更好的性能。 这展示了方法的鲁棒性。

证明路线与技术技巧

  • 整体路线

    1. 建立谱去混杂的线性代数基础:首先,在给定的节点内,对协变量矩阵 \( \mathbf{X} \) 进行奇异值分解(SVD),得到其左奇异向量 \( \mathbf{U} \)、奇异值 \( \mathbf{D} \) 和右奇异向量 \( \mathbf{V} \)。 谱去混杂相当于将 \( \mathbf{X} \) 投影到与最大的 \( k \) 个左奇异向量正交的子空间上。
    2. 分析去混杂对分裂准则的影响:随机森林的分裂准则(如均方误差)可以表示为协变量和响应变量的函数。 作者证明,在去混杂后的协变量空间中进行分裂,等价于在原始协变量空间中进行分裂,但目标函数被一个“去混杂”的版本所替代。 这个去混杂的目标函数可以分解为“信号”部分(与 \( g \) 相关)和“噪声”部分(与 \( H \) 相关)。
    3. 控制噪声部分的偏差:利用“线性且密集混杂”假设,作者证明“噪声”部分的期望可以被一个与 \( k \)\( p \) 相关的量所控制。 这个控制依赖于随机矩阵理论中的一些结果,例如,\( \mathbf{X} \) 的奇异值谱的分布。
    4. 整合到随机森林的渐近理论:最后,作者将上述结果整合到随机森林的渐近理论框架中(如 Scornet et al., 2015 的“加性随机森林”模型),从而得到 SDForests 的偏差界。
  • 关键跳跃点

    • 从线性模型到非线性随机森林的跳跃:这是本文最核心的贡献。 作者需要证明,谱去混杂不仅在线性模型中有效,而且在随机森林这种复杂的、基于递归划分的非线性模型中也能发挥作用。 关键跳跃点在于证明,去混杂后的协变量空间仍然保留了足够的信息来构建一个有效的回归树。
    • 偏差界的推导:推导偏差界需要处理随机森林的随机性(树的随机性、分裂点的随机性)和谱去混杂的随机性(基于样本的 SVD)。 作者需要巧妙地利用概率不等式和随机矩阵理论来统一处理这些随机性。
  • 技术技巧点名

    • 奇异值分解(SVD):用于实现谱去混杂,即移除协变量矩阵的主成分。
    • 随机矩阵理论:用于分析 \( \mathbf{X} \) 的奇异值谱,并证明“密集混杂”假设下,\( H \) 的信息会集中在最大的几个奇异值对应的奇异向量中。
    • 概率不等式(如 Hoeffding 不等式、Bernstein 不等式):用于控制随机森林分裂过程中的随机误差。
    • 加性随机森林模型(Scornet et al., 2015):作为分析随机森林渐近性质的理论框架。

真实例子与应用

  • 使用的数据/场景:一个公开的单细胞基因表达数据集(来自人类外周血单核细胞,PBMC)。 作者人为地引入一个未观测混杂变量,模拟一个已知的生物学过程(例如,细胞周期)。
  • 怎么把本文方法用上去:作者将 SDForests 应用于这个半合成数据集,其中 \( Y \) 是某个基因的表达水平,\( X \) 是其他所有基因的表达水平,\( H \) 是人为引入的细胞周期阶段。 他们比较了 SDForests 和经典随机森林在预测 \( Y \) 时的 MSE。
  • 得到什么结果:SDForests 的 MSE 显著低于经典随机森林,表明它能够更好地处理由未观测混杂(细胞周期)引起的偏差。
  • 这个例子想说明什么:这个例子旨在展示 SDForests 在真实数据场景下的实用性,并说明其假设(线性且密集混杂)在现实世界中可能近似成立。

🔎 结论是否比证明窄

  • 。 论文的结论(“SDForests 优于经典随机森林”)在模拟和半合成实验中得到了验证,但理论证明(定理 1)是在“线性且密集混杂”假设下严格成立的。 作者在结论中承认,这个假设在实际中可能不完全满足,但实证结果表明方法具有一定的鲁棒性。 因此,结论的适用范围(“优于”)比证明的适用范围(“在假设下偏差可控”)要宽。 这是一个典型的“证明窄、结论宽”的情况,值得研究者注意。

四、开放问题

  1. 放松“线性且密集混杂”假设:本文的理论证明强烈依赖于“线性且密集混杂”假设。 一个开放问题是:能否在更弱的假设下(例如,混杂是稀疏的、非线性的)证明 SDForests 的偏差可控性? 这扎根于本文的假设 1(线性混杂)和假设 2(密集混杂)。
  2. 自适应选择去混杂参数 \( k \):本文使用交叉验证或启发式方法选择 \( k \)。 一个开放问题是:能否设计一个数据驱动的、理论保证的方法来自适应地选择最优的 \( k \),例如,基于某种信息准则或稳定性选择? 这扎根于本文的第 3 节(关于 \( k \) 的选择的讨论)。
  3. 与 DML 框架的深入比较:本文淡化了与 DML 的比较。 一个开放问题是:在什么条件下,SDForests 优于基于 DML 的随机森林方法? 例如,当混杂是“密集”时,SDForests 可能更有效;当混杂是“稀疏”时,DML 可能更稳健。 这扎根于本文的引言(对 DML 的简要提及)。
  4. 扩展到其他因果参数:本文估计的是直接回归函数 \( \mathbb{E}[Y | X] \)。 一个开放问题是:能否将谱去混杂的思想扩展到估计其他因果参数,如平均处理效应(ATE)或条件平均处理效应(CATE)? 这扎根于本文的结论(关于未来工作的讨论)。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论