跳转至

Median-based Splitting Rules for Causal Trees and Forests

作者: Lennard Maßmann, Karolina Gliszczyńska-Schroeder
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.07888


一、领域脉络与小综述

  • 这个方向是什么:本文聚焦于异质性处理效应(HTE)估计中,当结果变量呈现重尾或偏态分布时,因果树/森林分裂准则的稳健性问题。其根本统计问题是:在基于递归划分(recursive partitioning)的非参数 HTE 估计器中,如何设计一个对极端值不敏感、同时仍能有效捕捉真实效应异质性的分裂准则。该方向当前处于方法发展阶段:核心框架(诚实因果树/森林)已成熟并有理论保证,但针对非标准结果分布(重尾、偏态)的稳健化改造仍缺乏系统研究,且新准则的理论性质(如渐近正态性)尚未建立。

  • 发展脉络(history):

    • 奠基工作:Athey & Imbens (2016) 提出诚实因果树(honest causal tree),通过样本分割(sample splitting)消除自适应划分带来的偏差,并给出基于均方误差(MSE)分解的诚实分裂准则。Wager & Athey (2018) 进一步建立因果森林的渐近正态性理论,证明在诚实性、α-正则性和子采样条件下,森林估计量收敛到高斯过程。这两篇奠定了"诚实分裂 + 渐近推断"的范式。
    • 主要进展:Athey, Bickel, Chen, Imbens & Pollmann (2023) 将半参数效率理论引入随机化实验的 HTE 估计,提出基于影响函数(influence function)的估计器,在重尾结果下仍保持根号 n 收敛。Ghosh, Deb, Karmakar & Sen (2026) 建立 Rosenbaum (1993) 秩基估计量的渐近理论,证明其在随机化实验中对重尾结果具有稳健性,但仅针对常数处理效应。Leqi & Kennedy (2022) 提出中位数最优治疗规则(median optimal treatment regime)的估计方法,将目标从条件均值转向条件分位数,以应对偏态结果。
    • 当前 frontier:将稳健位置估计量(如 Hodges-Lehmann 估计量)嵌入树/森林的分裂准则中,同时保持诚实推断框架。本文声称这是首次将 Hodges-Lehmann 估计量作为分裂锚点(anchor)引入因果树/森林。
    • 本文的位置:作者将稳健分裂准则(MSD)插入到 Athey-Imbens-Wager 的诚实框架中,不改变诚实估计和森林推断部分,仅替换分裂目标函数。其定位是"即插即用"的稳健性改进,而非全新推断框架。
  • 子线索聚类:

    1. 诚实树/森林的推断理论:Athey & Imbens (2016)、Wager & Athey (2018)、Bladt & Lemvig (2026)、Cattaneo, Klusowski & Tian (2025)。这一簇关注划分算法的统计性质(偏差、方差、渐近分布),是本文的框架基础。
    2. 稳健/秩基处理效应估计:Rosenbaum (1993)、Ghosh et al. (2026)、Hodges & Lehmann (1963)。这一簇关注在重尾或偏态结果下,如何用秩或中位数替代均值来估计处理效应,是本文分裂准则的灵感来源。
    3. 半参数效率与去偏机器学习:Chernozhukov et al. (2018)、Athey et al. (2023)、Kennedy (2023)。这一簇关注如何通过影响函数和交叉拟合实现半参数效率,本文用 AIPW 做 ATE 聚合,属于该线索的应用。
    4. 稳健分裂准则的启发式方法:Roy & Larocque (2012)、Li & Martin (2017)、Moradian et al. (2017)。这一簇在预测森林中提出中位数或绝对偏差分裂,但未在因果推断框架下给出理论保证,本文将其思想移植到因果树中。
  • 这个方向在追问的核心问题:

    1. 如何定义并度量"稳健"的分裂收益? 当结果重尾时,MSE 准则的方差项被极端值主导,导致分裂被噪声驱动。MSD 用 Hodges-Lehmann 估计量替代均值差,但其与 HTE 的偏差-方差权衡尚无理论刻画。
    2. 稳健分裂是否会损害推断有效性? 改变分裂准则可能影响树的 α-正则性和诚实性条件,进而影响森林的渐近正态性。本文仅通过"保持诚实估计不变"来规避,但未证明 MSD 分裂下森林估计量的渐近性质。
    3. 如何平衡稳健性与效率? 在正态结果下,MSD 相对 MSE 有效率损失(Hodges-Lehmann 的相对效率约 0.95);在重尾下则相反。是否存在自适应准则能根据数据自动选择锚点?
    4. 估计目标与分裂目标的一致性:分裂准则应针对 CATE 的异质性,但 MSD 实际度量的是位置偏移(location shift),当处理效应非加法(如方差效应)时,MSD 可能失效。
  • ⚠️ 作者的 framing(必须明确标注成"这是作者的说法"):作者将缺口 frame 成"MSE 分裂准则在重尾/偏态结果下不稳定,而现有稳健估计量(如 Ghosh et al. 2026)仅针对常数效应,无法处理异质性"。因此,本文的贡献是"将 Hodges-Lehmann 估计量嵌入诚实分裂准则,在保持推断框架不变的前提下提升稳健性"。作者淡化了以下竞争路线:(1) 直接对结果做变换(如 log 或 rank)后再用 MSE 分裂,这更简单但可能改变效应解释;(2) 使用分位数回归森林(quantile regression forest)直接估计条件分位数处理效应,这更直接但偏离了均值 CATE 目标;(3) 对极端值做 winsorization 或截断,这更工程化但缺乏理论。值得研究者去查的问题:作者在引言中未引用 Leqi & Kennedy (2022) 关于中位数最优治疗规则的工作,也未讨论其与 MSD 在目标函数上的本质区别——这是否意味着 MSD 在偏态结果下可能系统性地偏离 CATE?

  • 张力:未见明显对立引用。但存在一个隐含张力:Athey et al. (2023) 的半参数效率理论表明,在随机化实验中,基于影响函数的估计器在重尾下仍可达到根号 n 效率,而本文的 MSD 仅改进分裂稳定性,不涉及估计效率。这两条路线(稳健分裂 vs. 稳健估计)可能在不同样本量下各有优势,但作者未讨论其相对表现。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:
  • 参数 / 估计目标:
    • τ(x) := E[Y_i(1) - Y_i(0) | X_i = x]:条件平均处理效应(CATE),本文的核心估计目标。
    • τ := E[τ(X_i)]:平均处理效应(ATE),用于整体评估。
    • ∆(x; Π):在固定划分 Π 下,叶节点 l(x;Π) 内的位置偏移参数(location shift),即 Hodges-Lehmann 估计量所估计的目标。
  • 随机变量 / 样本:
    • (X_i, Y_i, D_i):第 i 个观测的三元组,其中 X_i ∈ R^K 为协变量向量,Y_i 为观测结果,D_i ∈ {0,1} 为处理指示。
    • (Y_i(0), Y_i(1)):潜在结果对(potential outcomes),满足 SUTVA(假设 1)。
    • S_1, S_0:处理组和对照组样本。
    • N_{d,l}:叶节点 l 中处理组(d=1)或对照组(d=0)的样本数。
  • 维数 / 样本量指标:

    • N:总样本量。
    • K:协变量维度。
    • B:森林中树的数量。
    • M_C:蒙特卡洛模拟次数。
  • 模型:

  • 数据生成机制:观测数据 (X_i, Y_i, D_i) 独立同分布采样自某个未知联合分布。处理分配 D_i 在随机化实验中满足 D_i ⊥ (Y_i(0), Y_i(1)) | X_i(即无混杂,假设 2),且倾向得分 p(X_i) = P(D_i=1|X_i) 已知或可估计。
  • 潜在结果模型:Y_i(d) = µ_d(X_i) + ε_i(d),其中 µ_d(x) = E[Y_i(d)|X_i=x] 是条件均值函数,ε_i(d) 是均值为零的噪声项。在叶节点 l 内,假设处理效应为常数,即 Y_i(1) - Y_i(0) = τ(l;Π) 对所有 X_i ∈ l 成立(这是分裂准则设计的前提,也是叶节点估计的基础)。
  • 可观测数据:研究者实际能观测到的是 (X_i, Y_i, D_i) 三元组。观测不到的是:
    1. 潜在结果 Y_i(0) 和 Y_i(1) 的联合分布(只能观测到其中一个);
    2. 个体处理效应 τ_i = Y_i(1) - Y_i(0);
    3. 叶节点内的真实位置偏移 ∆(x;Π)(只能通过样本估计)。
  • 关键识别假设:SUTVA(假设 1)、无混杂(假设 2)、重叠(假设 3)。这些假设保证了 CATE 可由观测数据识别,即 τ(x) = E[Y_i|D_i=1,X_i=x] - E[Y_i|D_i=0,X_i=x]。

第二步:讲最小内核

本文的最小内核可以归结为一个决策问题:在诚实因果树的每个节点分裂时,如何评估一个候选划分(split)的好坏?

  • 传统做法(MSE 准则):Athey & Imbens (2016) 提出的诚实分裂准则,其核心是估计划分后叶节点内 CATE 估计的期望均方误差(EMSE)。对于候选划分 Π,其准则为: Q_MSE(Π) = Σ_l (N_l/N) [τ̂(l;S_tr)² - V_hat(l)], 其中 τ̂(l;S_tr) 是训练样本上的叶内均值差,V_hat(l) 是方差惩罚项(与叶内样本量成反比)。这个准则的缺陷在于:当结果变量重尾时,τ̂(l;S_tr) 和 V_hat(l) 都被极端值主导,导致分裂被噪声驱动,而非真实的效应异质性。

  • 本文的核心改动(MSD 准则):将准则中的均值差 τ̂(l;S_tr) 替换为 Hodges-Lehmann 估计量 τ̂_HL(l;S_tr),即所有处理组-对照组配对差异的中位数: τ̂_HL(l;S_tr) = median{ Y_j - Y_m : j ∈ S_tr₁, m ∈ S_tr₀, X_j, X_m ∈ l }。 相应地,方差惩罚项也替换为 Hodges-Lehmann 估计量的渐近方差估计。这样,分裂准则对极端值不敏感,因为中位数具有 50% 的崩溃点(breakdown point)。

  • 为什么这个改动是"最小"的? 因为其他所有部分都保持不变:

  • 诚实性:训练样本(S_tr)用于分裂,估计样本(S_est)用于叶节点估计,两者分离。
  • 叶节点估计:最终 CATE 估计仍用估计样本上的均值差 τ̂(l;S_est),而非 Hodges-Lehmann 估计量。
  • 森林推断:仍用 Athey et al. (2019) 的 Bootstrap of Little Bags (BLB) 构造置信区间。
  • ATE 聚合:仍用 AIPW 估计量。

  • 这个最小内核的数学本质:它回答了一个问题——在重尾分布下,如何用一个稳健的"位置差"估计量来指导划分,同时不改变最终估计量的定义。其代价是:分裂准则不再精确对应最终估计量的 EMSE(因为最终估计量是均值差,而分裂锚点是 Hodges-Lehmann),而是对应一个"稳健代理"的 EMSE。作者在附录 A.4 中证明,这个代理准则与真实 EMSE 的差异是 O(1/N_est) 阶的,因此不影响一阶渐近性质。

  • 为什么这个改动有效? 考虑一个极端场景:叶节点内有 10 个处理组和 10 个对照组观测,其中 1 个处理组观测是异常值(如 Y_j = 1000,而其余观测在 0-10 之间)。均值差会被这个异常值拉高,导致该叶节点被误判为"高效应"区域。而 Hodges-Lehmann 估计量(配对差异的中位数)只受 50% 以上的异常值影响,因此能正确识别该叶节点的真实效应。

三、这篇论文做了什么

三句话: 1. 研究了什么问题:在重尾或偏态结果变量下,如何设计稳健的因果树/森林分裂准则,以降低 HTE 估计的误差并改善置信区间覆盖。 2. 核心工具 / 方法:将 Hodges-Lehmann 位置估计量嵌入诚实因果树的分裂准则,提出 MSD(Median Squared Deviation)准则,并辅以 MAD 和 LMS 作为稳健基线;保持诚实估计、森林推断和 AIPW 聚合不变。 3. 主要结论:在模拟研究中,MSD 在重尾(t₃)和偏态(对数正态)结果下降低了 CATE 估计的 RMSE 和绝对偏差,改善了置信区间覆盖;在正态结果下与 MSE 表现相当。在两个实证应用中,MSD 与 MSE 的 ATE 估计一致,但 CATE 分布的形状不同。

关键设定与假设: - 诚实性:训练样本 S_tr 和估计样本 S_est 严格分离,分裂准则在 S_tr 上计算,叶节点效应在 S_est 上估计。这是 Athey & Imbens (2016) 的核心假设,本文完全继承。 - α-正则性:每个叶节点至少包含训练样本的 α 比例,且每个子节点至少包含 α·N 个观测。这是 Wager & Athey (2018) 定理 4.1 成立的条件,本文在实现中通过最小叶节点大小参数强制。 - 随机分裂:每个节点从随机子集中选择分裂变量,保证树之间的去相关性。本文继承。 - 位置偏移假设(Assumption 4):叶节点内处理组和对照组分布仅差一个位置偏移 ∆(x;Π),且该偏移是常数。这是 Hodges-Lehmann 估计量一致性的关键条件。相比 Athey & Imbens (2016) 的 MSE 准则,MSD 额外要求这一假设,因为 Hodges-Lehmann 估计量在非位置偏移模型下可能不一致。 - 有限矩条件:Wager & Athey (2018) 要求结果变量有有限二阶矩;MSD 仅要求有限一阶矩(因为中位数估计量的渐近方差只依赖密度函数),这是放宽。

主要结果: - 模拟研究(表 6-9,图 1-2): - 在 S1(正态)中,MSD 的 RMSE 比 MSE 高约 2-3%,但覆盖更接近名义水平(0.95 vs 0.88)。 - 在 S2(t₃)中,MSD 的 RMSE 比 MSE 低约 13-15%,覆盖从 0.96 改善到 0.98。 - 在 S3(稀疏极端响应者)中,MSD 的 RMSE 比 MSE 低约 20%,覆盖从 0.84 改善到 0.93。 - 在 S4(偏态个体效应)中,MSD 的 RMSE 比 MSE 低约 10%,覆盖从 0.99 改善到 0.99(两者都过覆盖)。 - ATE 估计:MSD 和 MSE 的 ATE 估计几乎相同(差异 < 0.01),因为 AIPW 聚合消除了分裂准则的影响。 - 实证应用: - Progresa:MSD 和 MSE 的 ATE 估计分别为 1.48 和 1.47,但 MSD 的 CATE 分布更平滑,尾部更薄。 - ACTG 175:MSD 和 MSE 的 ATE 估计分别为 66.62 和 66.60,CATE 分布几乎重合。 - 计算成本(表 10):MSD 的中位运行时间是 MSE 的 4.13 倍,MAD 是 6.03 倍,主要开销在配对差异的排序。

证明路线与技术技巧: - 整体路线: 1. 建立 Hodges-Lehmann 估计量的叶内渐近理论(附录 D):证明在位置偏移假设下,τ̂_HL(l;S_tr) 是 ∆(x;Π) 的一致估计量,且渐近正态,方差由叶内密度函数决定。 2. 推导 MSD 准则的 EMSE 分解(附录 A.4):将 MSD 准则写成 Σ_l (N_l/N) [τ̂_HL(l;S_tr)² - V̂_HL(l)],其中 V̂_HL(l) 是 Hodges-Lehmann 估计量的渐近方差估计。证明该准则与真实 EMSE 的差异是 O(1/N_est) 阶。 3. 证明森林推断的传递性(附录 B.1):由于诚实估计和森林聚合不变,Wager & Athey (2018) 的定理 4.1 仍然适用,只需验证 MSD 分裂满足 α-正则性和随机分裂条件。 4. 模拟验证:通过 4 个场景、2 种样本量、2 种协变量维度,比较 MSD、MSE、MAD、LMS 的 RMSE、偏差、覆盖和运行时间。

  • 关键跳跃点:
  • Hodges-Lehmann 估计量的叶内方差估计(附录 A.4.1):作者没有直接估计叶内密度函数,而是用配对差异的排序统计量来估计方差。具体地,V̂_HL(l) 用 (N_{1,l}N_{0,l})^{-1} Σ_{j,m} (Y_j - Y_m - τ̂_HL)² 的某种稳健版本。这个估计量在重尾下可能不收敛,但作者通过模拟验证了其有限样本表现。
  • MSD 准则与真实 EMSE 的等价性(附录 A.4.2):作者证明,当叶内样本量足够大时,τ̂_HL(l;S_tr)² 的期望等于 ∆(x;Π)² + V̂_HL(l),因此 MSD 准则的期望与真实 EMSE 只差一个常数项。这个证明依赖于 Hodges-Lehmann 估计量的中位数无偏性。
  • BLB 方差估计的缩放因子(附录 A.7):作者引入 κ(x)^{-2} 缩放因子,其中 κ(x) = E[(D_i - p(X_i))² | X_i = x]。这个因子在随机化实验中等于 p(1-p),用于校正 BLB 方差估计的偏差。作者承认这个缩放是"deliberately conservative",会加宽置信区间。

  • 技术技巧点名:

  • Hodges-Lehmann 估计量:所有配对差异的中位数,具有 50% 崩溃点,是重尾分布下位置参数的自然估计。
  • Quickselect 算法(Hoare, 1961):用于高效计算中位数,避免全排序。
  • Bootstrap of Little Bags (BLB)(Sexton & Laake, 2009; Athey et al., 2019):通过子样本聚合估计方差,避免重复拟合森林。
  • AIPW 估计量(Robins et al., 1994; Chernozhukov et al., 2018):用于 ATE 聚合,对 CATE 估计误差具有双重稳健性。
  • 交叉拟合(cross-fitting):在 AIPW 中使用,避免过拟合偏差。

🔎 结论是否比证明窄: - 明确窄于证明的声明:作者在结论中声称"MSD 在重尾和偏态结果下降低了 CATE 估计的误差",但模拟只覆盖了 t₃ 和对数正态两种分布。对于更一般的重尾分布(如帕累托分布),Hodges-Lehmann 估计量的渐近方差可能发散,MSD 的优越性不成立。作者在附录 D 中承认,证明依赖于密度函数在配对差异中位数处为正且有限,这排除了某些极端重尾情形。 - 未证明但被暗示的声明:作者在引言中暗示"MSD 是 MSE 的稳健替代品",但未证明 MSD 准则在所有重尾分布下都优于 MSE。模拟只展示了有限场景下的相对表现。 - 被泛化的声明:作者在结论中声称"MSD 保留了森林推断的渐近有效性",但这一结论依赖于 Wager & Athey (2018) 的定理 4.1,而该定理要求分裂准则满足特定的正则条件。作者在附录 B.1 中仅通过实现细节(最小叶节点大小、随机分裂)来"确保"这些条件,但未给出 MSD 准则满足 α-正则性的正式证明。

四、开放问题

  1. MSD 准则的渐近理论:作者在附录 D 中证明了 Hodges-Lehmann 估计量的叶内渐近正态性,但未证明 MSD 分裂准则下森林估计量的渐近正态性。Wager & Athey (2018) 的定理 4.1 要求分裂准则满足特定的正则条件,而 MSD 准则是否满足这些条件尚未验证。扎根点:附录 B.1 中"we treat honesty, regularity, symmetry, randomization, and the leaf estimator unchanged"这一句,暗示作者将 MSD 视为"黑箱"分裂准则,未验证其正则性。

  2. 位置偏移假设的检验:Assumption 4(i) 要求叶节点内处理组和对照组分布仅差一个位置偏移。当处理效应是异方差的(如方差效应)或非加性的(如交互效应)时,MSD 准则可能失效。作者在模拟中只考虑了加法效应,未检验 MSD 在非位置偏移模型下的表现。扎根点:结论中"the target degrades to a robust proxy for the leaf effect"这一句,承认了 MSD 在假设失败时的局限性。

  3. 计算效率的改进:MSD 的运行时间是 MSE 的 4 倍,主要开销在配对差异的排序。作者在附录 B.1.1 中承认"the estimate is formed by enumerating all N₁,lN₀,l within-leaf pairwise differences",但未提出任何加速算法。扎根点:表 10 中 MSD 和 MAD 的运行时间数据。

  4. 自适应准则选择:MSD 在正态分布下略逊于 MSE(RMSE 高 2-3%),在重尾下显著优于 MSE。是否存在数据驱动的准则选择方法(如根据叶内分布的峰度或偏度自动选择 MSE 或 MSD)?扎根点:结论中"an exact calibration against alternative variance estimators remains for future work"这一句。

  5. 与半参数效率理论的衔接:Athey et al. (2023) 的影响函数方法在重尾下仍保持根号 n 效率,而 MSD 仅改进分裂稳定性。将 MSD 与影响函数结合(如用 MSD 选择划分,用影响函数估计叶内效应)是否能同时获得稳健性和效率?扎根点:引言中引用了 Athey et al. (2023) 但未讨论其与 MSD 的互补性。


给研究者的一句话提醒:要确认上述开放问题是否是真 gap,建议去读以下近期工作的引言部分:(1) Athey et al. (2023) 关于半参数 HTE 估计;(2) Ghosh et al. (2026) 关于秩基估计量;(3) Cattaneo et al. (2025) 关于诚实树的精度极限。如果这三篇的引言都指向"稳健分裂准则缺乏理论保证",那这就是共识性 gap;如果它们各自提出了不同的稳健化路线,那可能意味着 MSD 只是众多竞争方案之一。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论