跳转至

Shrinkage Bayesian Causal Forest with Instrumental Variable

作者: Lennard Maßmann, Jens Klenke
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.18903


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是异质性因果效应的子组发现与估计,具体聚焦于不完全依从(imperfect compliance)的 IV 设定。其根本科学问题是:在存在未观测混杂、且工具变量仅能识别"依从者"(compliers)平均因果效应(CACE)的框架下,如何从高维协变量中发现可解释的、效应异质的子组,并对其 CACE 进行可靠的估计与推断。该方向的成熟度处于"方法快速发展但理论根基尚浅"的阶段——已有大量基于树/森林的异质性效应估计方法(如 causal forest、BART-based 方法),但针对 IV 设定下"稀疏高维 + 子组发现 + 有效推断"三者结合的问题,仍缺乏系统性解决方案。

发展脉络(history)

  • 奠基工作:Imbens & Angrist (1994) 与 Angrist et al. (1996) 建立了局部平均处理效应(LATE/CACE)的识别框架,确立了在单调性与排除性约束下,工具变量可识别依从者子总体的平均效应。这是整个 IV 异质性分析的理论基石。
  • 异质性效应估计的兴起:Athey & Imbens (2016) 提出 causal tree,将递归划分引入因果效应异质性发现;Athey et al. (2019) 的 generalized random forests (GRF) 进一步提供了基于森林的、具有渐近性质的异质性效应估计框架。Wang et al. (2022) 将这一思路扩展到 IV 设定,提出 instrumental forest,但不提供显式的子组划分。
  • 贝叶斯非参数路径:Chipman et al. (2010) 的 BART 提供了灵活的贝叶斯非参数回归工具;Hahn et al. (2020) 的 BCF 将其改造为因果推断工具,通过分离预后函数与效应函数并引入倾向得分来缓解正则化诱导混杂。Caron et al. (2022) 的 SBCF 进一步引入 Dirichlet 先验实现变量选择稀疏性。
  • IV 与树方法的结合:Bargagli-Stoffi et al. (2022) 提出 BCF-IV,将 BCF 框架扩展到 IV 设定,通过两阶段策略(先估计 cITT 与依从者比例,再构造子组并做组内 2SLS)实现可解释的子组发现。本文的直接定位:作者明确指出 BCF-IV 在高维稀疏设定下失效——其均匀分裂先验导致大量无关变量被选入分裂,从而稀释了真实效应信号。本文的贡献是在 BCF-IV 的骨架上引入 SBCF 的稀疏化机制。

子线索聚类

  1. 基于划分的异质性效应发现(Athey & Imbens 2016; Athey et al. 2019; Wang et al. 2022):以树/森林为工具,目标是找到效应异质的分区,强调渐近性质与推断有效性,但可解释性有限。
  2. 贝叶斯加性树模型(Chipman et al. 2010; Hahn et al. 2020; Caron et al. 2022):以 BART 为骨干,强调灵活性与不确定性量化,近年逐步引入稀疏化先验以应对高维问题。
  3. IV 设定下的异质性效应(Bargagli-Stoffi & Gnecco 2020; Bargagli-Stoffi et al. 2022; Johnson et al. 2022):专门处理不完全依从,目标函数是 cCACE 而非 CATE,识别依赖 IV 假设,推断依赖子组内 2SLS。

这个方向在追问的核心问题

  1. 如何在高维协变量中识别真正的效应修饰变量? 当 P 远大于有效信号维度时,均匀分裂先验导致"信号稀释",如何通过先验设计实现稀疏性?
  2. 如何平衡子组的可解释性与统计效率? 树越深越精细,但每个子组的样本量越小,2SLS 推断越不稳定;浅树可解释但可能遗漏真实异质性。
  3. 如何保证发现后的推断有效性? 子组是数据驱动发现的,直接使用同一数据进行组内推断会引入选择偏差;honest splitting 是标准应对,但其在 IV 设定下的理论性质尚不清晰。

⚠️ 作者的 framing(这是作者的说法)

作者将缺口 frame 为:"BCF-IV 在高维稀疏设定下退化,因为 BART 的均匀分裂先验无法将分裂集中在少数真正的效应修饰变量上。" 因此,本文的贡献被定位为"显然的下一步"——将 SBCF 的 Dirichlet 稀疏先验移植到 IV 设定,并额外引入基于后验分裂频率的 CART 代价加权。作者淡化的竞争路线包括:(1) 基于 GRF 的 instrumental forest 虽然在高维下表现稳健,但不提供显式子组划分,因此不满足"可解释子组发现"的需求;(2) 直接对 cCACE 做稀疏正则化(如 lasso-type 方法)虽然能处理高维,但无法生成树状的可解释分区。作者未讨论的潜在竞争路线包括:将 causal forest 的 honesty 性质与 IV 结合的理论分析,以及基于贝叶斯模型平均的子组不确定性量化。

张力

未见明显对立引用。但存在一个值得注意的隐含张力:Caron et al. (2022) 的 SBCF 是在无工具变量的常规因果推断设定下提出的,其稀疏先验的有效性依赖于"预后函数与效应函数的稀疏性结构相似"这一隐含假设。本文将其移植到 IV 设定时,cITT 与依从者比例的稀疏性结构可能完全不同——作者在正文中未讨论这一潜在的不匹配。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

符号清单(逐个点名):

记号 含义 类型
\(Y_i \in \mathbb{R}\) 观测结果 随机变量(观测)
\(Z_i \in \{0,1\}\) 二元工具变量(随机化分配) 随机变量(观测)
\(W_i \in \{0,1\}\) 实际接受的处理 随机变量(观测)
\(X_i \in \mathbb{R}^P\) P 维预处理协变量 随机变量(观测)
\(W_i(z)\) 在工具 \(Z_i = z\) 下的潜在处理 潜在变量(不可观测)
\(Y_i(z, w)\) 在工具 \(Z_i = z\)、处理 \(W_i = w\) 下的潜在结果 潜在变量(不可观测)
\(G_i \in \{C, D, AT, NT\}\) 依从类型(complier/defier/always-taker/never-taker) 潜在类别(不可观测)
\(\pi_G(x) = \Pr(G_i = G \mid X_i = x)\) 条件依从类型概率 参数/函数(待估计)
\(\tau_{CACE}(x)\) 条件依从者平均因果效应 目标估计量(estimand)
\(ITTY(x)\) 条件意图治疗效应 中间量(由观测可识别)
\(\pi_C(x)\) 条件依从者比例 中间量(由观测可识别)
\(N\) 样本量 常数
\(P\) 协变量维度 常数
\(I_{disc}, I_{inf}\) 发现/推断子样本 数据划分

模型与数据生成机制:

  1. 潜在结果框架:每个个体 \(i\) 有潜在处理 \(W_i(0), W_i(1)\) 和潜在结果 \(Y_i(z, w)\)。观测到的处理 \(W_i = W_i(Z_i)\),观测到的结果 \(Y_i = Y_i(Z_i, W_i)\)。
  2. 依从类型:由 \((W_i(0), W_i(1))\) 的联合取值决定。单调性假设 \(W_i(1) \geq W_i(0)\) 排除了 defiers,使得 \(G_i \in \{C, AT, NT\}\)。
  3. 识别假设(Assumption 2.1):
  4. (a) SUTVA/一致性:无干扰、无隐藏处理变体;
  5. (b) 相关性:\(\pi_C(x) > 0\) a.s.;
  6. (c) 工具无混杂:\(Z_i \perp\!\!\!\perp \{Y_i(z,w)\}_{z,w}, W_i(0), W_i(1) \mid X_i\);
  7. (d) 排除性:\(Y_i(z,w) = Y_i(w)\),即工具只通过处理影响结果;
  8. (e) 单调性:\(W_i(1) \geq W_i(0)\)。

  9. 可观测数据:\(\{(Y_i, W_i, Z_i, X_i)\}_{i=1}^N\),i.i.d. 抽样。

核心识别公式(Proposition 2.1):

\[\tau_{CACE}(x) = \frac{ITTY(x)}{\pi_C(x)} = \frac{\mathbb{E}[Y_i \mid Z_i = 1, X_i = x] - \mathbb{E}[Y_i \mid Z_i = 0, X_i = x]}{\mathbb{E}[W_i \mid Z_i = 1, X_i = x] - \mathbb{E}[W_i \mid Z_i = 0, X_i = x]}\]

估计策略:两阶段。第一阶段在发现子样本 \(I_{disc}\) 上估计 cITT 与依从者比例(通过 BART/SBCF),形成点态估计 \(\hat{\tau}_{SBCF}(x)\);第二阶段将点态估计输入浅层 CART 以发现子组划分 \(\{X_j\}\);第三阶段在推断子样本 \(I_{inf}\) 上对每个子组做 2SLS 估计 \(\hat{\tau}^{2SLS}_{X_j}\)。

第二步:最小内核

剥离所有一般性设定后,本文的核心数学问题是:

如何在高维协变量 \(X \in \mathbb{R}^P\)(其中仅少数维度真正影响效应)下,构造一个估计量 \(\hat{\tau}(x)\),使得:(1) 作为异质性信号,它能将样本划分成可解释的子组;(2) 子组内的 2SLS 估计保持近似的名义覆盖?

最小例子(\(P=2\),仅一个真实效应修饰变量):

  • 设 \(X = (X_1, X_2)\),其中 \(X_1 \in \{0,1\}\) 是唯一的效应修饰变量,\(X_2\) 为纯噪声。
  • 真实模型:\(Y_i(0) = \mu(X_i) + \epsilon_i\),\(Y_i(1) = Y_i(0) + W_i(1) \tau_{CACE}(X_i)\),其中 \(\tau_{CACE}(X_i) = k \cdot \mathbb{1}\{X_{i,1} = 1\}\)(\(k>0\)),\(\mu(X_i)\) 依赖于 \(X_2\)(制造预后混杂)。
  • 工具 \(Z_i \sim \text{Bernoulli}(0.5)\),处理 \(W_i(1) \sim \text{Bernoulli}(0.75)\),\(W_i(0) = 0\)。

BCF-IV 的失败模式:均匀分裂先验下,每棵树的每次分裂以等概率 \(1/P\) 选择候选变量。当 \(P\) 增大时,\(X_1\) 被选中的概率降至 \(1/P\),而 \(X_2\) 等噪声变量被选中的总概率升至 \((P-1)/P\)。结果:树结构被噪声变量主导,子组划分无法分离 \(X_1 = 0\) 与 \(X_1 = 1\) 的个体,导致组内 2SLS 估计混合了正负效应,估计值向零收缩,且置信区间因混合分布而过度覆盖或欠覆盖。

SBCF-IV 的修复机制:将分裂先验改为 \(s \sim \text{Dirichlet}(\alpha/P, \ldots, \alpha/P)\),其中 \(\alpha\) 由超先验 \(\alpha/(\alpha+\rho) \sim \text{Beta}(a,b)\) 控制。当数据支持稀疏性时,后验将 \(\alpha\) 推向小值,使得分裂概率集中在少数变量上。在最小例子中,后验会将分裂概率集中在 \(X_1\) 上,从而恢复正确的子组划分。核心机制:先验的稀疏性诱导 + 数据自适应地确定稀疏程度。

为什么这个内核是"最小"的:它剥离了所有关于树深度、分裂准则、MCMC 采样、honest splitting 的细节,只保留了"先验如何影响变量选择,进而影响子组发现质量"这一条主线。理解了这一点,就能理解本文的全部贡献——其余都是工程实现。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在不完全依从的 IV 设定下,当协变量维度 \(P\) 增大且大部分变量与效应异质性无关时,如何可靠地发现并估计异质性 CACE 的子组。
  2. 核心工具/方法:将 SBCF 的 Dirichlet 稀疏先验引入 BCF-IV 框架,分别对 cITT 与依从者比例建模,并将后验分裂频率作为代价输入下游 CART 以引导子组划分。
  3. 主要结论:在高维稀疏设定下,SBCF-IV 在子组发现(DR/FDR)、个体分类(Precision/Recall/F-score)和估计精度(MSE/覆盖率)上均显著优于 BCF-IV,且增益随 \(P\) 增大而扩大。

关键设定与假设

  • 数据生成:\(N=1000\),\(P \in \{10, 50, 100\}\),一半二元一半连续协变量。真实效应修饰变量仅 \(X_1, X_2\)(均为二元),其余为噪声。效应大小 \(k \in \{0, 0.2, \ldots, 2\}\)。
  • 识别假设:完全采用 Assumption 2.1(SUTVA、相关性、无混杂工具、排除性、单调性)。相比 BCF-IV 的强化:无——识别假设完全相同,本文的贡献在估计策略而非识别。
  • 模型设定:cITT 与依从者比例各用一个 SBCF,\(\mu(e(x), x)\) 包含倾向得分作为协变量以缓解正则化诱导混杂。相比 BCF-IV 的强化:分裂先验从均匀改为 Dirichlet,且 \(\rho_{ITTY} = P/2 < P+1\) 对效应函数施加更强的稀疏性偏好。
  • 推断:honest splitting(发现/推断样本分离),子组内 2SLS,Holm 校正 p 值。

主要结果

  • 树级子组发现:在 \(P=100, k=2\) 时,BCF-IV 的 DR 约 0.3,而 SBCF-IV 接近 1.0;FDR 方面,BCF-IV 在 \(P=10, k=2\) 时高达 0.75,SBCF-IV 始终低于 0.06。
  • 个体分类:SBCF-IV 的 F-score 在 \(P=100, k=2\) 时约 0.95,BCF-IV 约 0.2;Precision 差距更悬殊(0.98 vs 0.1)。
  • 估计精度:SBCF-IV 的 MSE 在 \(P=100, k=2\) 时约为 BCF-IV 的 1/10;覆盖率方面,BCF-IV 在 \(P=50, k=2\) 时降至 0.2,而 SBCF-IV 始终在 0.94–0.96 之间。
  • 消融实验(附录 E.5):CART 代价加权对非稀疏方法(BCF-IV、GRF-IV)有部分帮助,但对 SBCF-IV 几乎无额外增益——说明稀疏先验本身是主要贡献来源。

证明路线与技术技巧

本文是方法-应用型论文,无核心定理证明。其"证明"体现在模拟实验的系统性设计上:

  • 整体路线:构造一个"稀疏异质性"的 DGP → 对比 BCF-IV 与 SBCF-IV 在树级、个体级、估计精度三个层面的表现 → 通过消融实验分离"稀疏先验"与"代价加权"各自的贡献。
  • 关键设计选择:
  • 真实效应仅由两个二元变量驱动,且与预后函数 \(\mu(X)\) 的支撑集不重叠——这放大了均匀先验的劣势,因为 BCF-IV 必须从 \(P-2\) 个噪声变量中"偶然"选中正确的分裂变量。
  • 效应大小 \(k\) 从 0 到 2 扫描,覆盖从无效应到强效应的完整谱系,使得"何时稀疏性重要"的边界清晰可见。
  • 覆盖率指标区分了"点估计精度"与"推断有效性"——BCF-IV 在 \(P\) 增大时覆盖率急剧下降,说明其置信区间不仅不准确,而且系统性误导。

🔎 结论是否比证明窄

是,且明显。作者在摘要和引言中声称"在稀疏高维设定下可靠地发现并估计异质性 CACE 子组",但:

  1. 模拟 DGP 的稀疏性结构是已知且极端的——真实效应仅由 2 个变量驱动,且与预后函数支撑集不重叠。作者未测试"效应由 5 个或 10 个变量驱动"的中等稀疏场景,也未测试"效应变量与预后变量重叠"的场景。
  2. 无理论保证。作者在结论中明确承认"我们未建立选择或划分一致性(selection or partition consistency)的保证"——这意味着 SBCF-IV 的子组发现可能在小样本或复杂 DGP 下失效,但作者未给出失效边界。
  3. 实证部分仅报告了"显著子组",未报告未显著子组的假阴性率。在 OHIE 中,作者只报告了 1 个显著子组(英语偏好、38-59 岁),但未说明其他 6 个子组是否因样本量不足而无法检测,还是确实无效应。

四、开放问题

  1. 理论保证缺失:SBCF-IV 的子组发现是否具有一致性?在什么条件下(稀疏度、信噪比、样本量),后验分裂频率能一致地识别真实效应修饰变量?这需要建立 Dirichlet 先验下 BART 后验收缩速率(posterior contraction rate)的理论,目前文献中仅有 Caron et al. (2022) 在常规因果设定下的部分结果,IV 设定下尚无对应结论。(扎根于结论段:"We establish no selection- or partition-consistency guarantee for the discovery step.")

  2. 稀疏度与效应大小的交互:模拟中 \(k\) 从 0 到 2 扫描,但未报告"当真实效应变量数 \(m\) 变化时,SBCF-IV 的性能如何退化"。当 \(m\) 从 2 增至 10 或 20 时,Dirichlet 先验的稀疏性诱导是否仍然有效?这直接关系到方法在真实数据(通常有多个效应修饰变量)中的适用性。(扎根于模拟设计:"only \(X_1, X_2\) drive heterogeneity")

  3. 依从者比例异质性的处理:作者将 cITT 与依从者比例分开建模,但未讨论二者异质性结构不同时的行为。若依从者比例由一组变量驱动,而 cITT 由另一组变量驱动,SBCF-IV 的稀疏先验是否会对两组变量施加错误的稀疏性偏好?(扎根于第 3 节:"We separately model the numerator and denominator of the identification ratio")

  4. 代价加权的最优性:作者将后验分裂频率作为 CART 代价,但未讨论这一选择的统计最优性。是否存在比线性代价更优的加权方式?代价加权是否会影响 CART 划分的渐近性质?(扎根于第 3 节公式 (6))


提醒:要确认上述问题是否为真 gap,建议去读以下方向的近期文献(各约 5 篇)的引言:(i) Bayesian nonparametric 方法在 IV 设定下的理论分析;(ii) 高维异质性效应估计的 minimax 界;(iii) 子组发现后的选择性推断(selective inference)。如果多个独立团队都在引言中指向同一缺口,那大概率是真 gap;如果各说各话,则可能是"伪 gap",需要更谨慎的判断。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论