跳转至

Representation Multiplicity in Causal Forests

作者: Yi Niu
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2609.12406


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是基于随机森林(random forests)的自适应非参数估计理论,具体聚焦于因果森林(causal forest)在估计异质性处理效应(heterogeneous treatment effects, HTE)时的统计性质。该方向的核心问题是:当数据生成过程满足无混杂(unconfoundedness)等识别条件时,如何利用森林的自适应邻域(adaptive neighborhood)结构,对条件平均处理效应(CATE)τ(x) = E[Y(1) − Y(0) | X = x] 进行一致估计并构造有效推断。该方向的成熟度较高——Wager & Athey (2018) 已建立了诚实森林(honest forest)的渐近高斯性与点态置信区间,Athey et al. (2019) 将其推广到广义矩条件框架。本文的切入点是这一框架中一个被忽视的规范性问题:当协变量以冗余的单调编码形式出现时,森林的随机特征选择机制会产生系统性偏差。

发展脉络

  • 奠基工作:Wager & Athey (2018) 首次为因果森林建立了渐近理论,证明在诚实分裂(honest splitting)和充分随机化(sufficient randomness)条件下,CATE 估计量点态渐近正态且方差可估计。其核心洞见是将森林估计量视为"自适应邻域加权平均",从而借用局部多项式回归的分析工具。Athey et al. (2019) 进一步提出广义随机森林(generalized random forests),将估计目标从 CATE 推广到任意由局部矩条件定义的参数,并给出了统一的渐近理论。这两篇构成了本文的"母框架"。

  • 主要进展:在森林的偏差分析方面,Louppe (2014) 的博士论文最早系统研究了冗余预测变量对随机森林分裂选择概率的影响,指出保留冗余列会改变其进入分裂搜索的概率并影响预测——这是本文引用的直接理论依据。在更一般的层面,Chi et al. (2022) 和 Klusowski & Tian (2024) 提供了高维随机森林的恢复界(recovery bounds),刻画了特征选择与预测误差之间的权衡。Mei et al. (2026) 则从外生随机性的角度刻画了森林的偏差来源。这些工作共同构成了"森林偏差来源"这一子线索。

  • 当前 frontier:本文所处的位置是——上述理论工作大多假设协变量集合是"干净的"(即每个协变量对应一个独立的信息源),但实际应用中研究者常会构造冗余编码(如同时保留收入及其对数、平方根等)。本文证明,这种表示多重性(representation multiplicity)在因果森林中会导致 CATE 估计的极限发生偏移,且该偏移不会随样本量消失。

子线索聚类

  1. 森林的渐近理论(Wager & Athey 2018; Athey et al. 2019):建立一致性、渐近正态性与推断方法。这一簇关注的是"给定分裂规则,估计量的极限是什么"。
  2. 森林的偏差来源(Louppe 2014; Chi et al. 2022; Klusowski & Tian 2024; Mei et al. 2026):刻画特征选择、冗余变量、外生随机性如何影响森林的预测偏差。这一簇关注的是"分裂规则本身如何受数据表示影响"。
  3. 因果推断中的去偏与稳健性(Chernozhukov et al. 2022):自动去偏机器学习(automatic debiased ML),关注如何在高维/机器学习估计器中修正正则化偏差。本文的实证部分直接复现了该文的 NSW 数据分析。

这个方向在追问的核心问题

  1. 森林估计量的极限行为如何依赖于特征表示? 主流方法(如 grf 包)默认特征集合是给定的、无冗余的,但本文证明冗余编码会改变分裂候选的权重分布。
  2. 偏差是否随样本量消失? 本文的核心结论是:在特定条件下(访问深度指数 Iₙ → 0),偏差持续存在,不随 n 增大而消失。
  3. 如何修复表示敏感性? 本文提出"分裂类采样"(class sampling)作为修复方案,即在分裂候选采样时以"等价类"为单位而非原始列。

⚠️ 作者的 framing

这是作者的说法:作者将问题 frame 为"表示多重性导致因果森林的 CATE 估计不一致,且该不一致源于随机特征选择对冗余列的偏好"。作者声称这一偏差是"系统性"的,并提出了类采样作为"修复"。作者淡化的竞争路线包括:(a) 在分裂准则中直接惩罚冗余(如基于相关性的特征加权);(b) 在估计阶段使用去偏技术(如 Chernozhukov et al. 2022 的正交化),而非修改分裂机制本身。值得研究者去查的问题:为什么作者没有讨论在分裂准则(如 Gini 不纯度)中直接对特征相关性进行惩罚的方案?为什么没有讨论在估计阶段使用交叉拟合去偏来消除表示影响?这些路线在文献中是否存在?

张力

未见明显对立引用。但值得注意的是,Chi et al. (2022) 和 Klusowski & Tian (2024) 的恢复界暗示高维森林在稀疏条件下可以自适应地忽略无关特征,这与本文"冗余编码导致持续偏差"的结论存在潜在张力——前者关注的是无关特征(irrelevant features),后者关注的是冗余但信息等价的特征。这一区别值得研究者注意。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

符号清单(按类别分组):

  • 参数 / estimand:
  • τₐ(X) = a₁s₁(X) + a₂s₂(X):真实的 CATE,其中 a = (a₁, a₂) 是系数向量,sⱼ(X) = 2·1{Xⱼ ≥ 1/2} − 1 是二值状态指示器。
  • a₁, a₂:两个协变量的处理效应系数,满足 0 < a ≤ a₁ < a₂ ≤ ā,且 a₂ − a₁ ≥ Δₐ > 0。
  • π*(x) = 1{τₐ(x) > 0}:最优治疗分配规则。
  • Regₐ(π) = E[|τₐ(X)|·1{π(X) ≠ π*(X)}]:策略遗憾(policy regret)。

  • 随机变量 / 样本:

  • X = (X₁, X₂) ~ Unif([0,1]²):协变量向量,两个分量独立均匀分布。
  • W ∈ {0,1}:二元处理指示器,P(W=1|X) = 1/2(完全随机化)。
  • Y(w):潜在结果,Y(w) = m₀(X) + w·τₐ(X) + U,其中 E(U|X,W) = 0。
  • Y = Y(W):观测结果。
  • (Yᵢ, Wᵢ, Xᵢ)ᵢ₌₁ⁿ:i.i.d. 训练样本。
  • Γᵢ = 4(Wᵢ − 1/2){Yᵢ − mₐ(Xᵢ)}:oracle 变换得分,满足 E(Γᵢ | Xᵢ = x) = τₐ(x)。
  • Γ̂ᵢ:用交叉拟合估计 m̂ 替换 mₐ 后的拟合得分。

  • 森林结构参数:

  • sₙ:每棵树的子采样大小(subsample size)。
  • kₙ:叶节点最小样本量。
  • Bₙ:树的数量。
  • Hₙ = log(sₙ/kₙ):有效路径深度(effective path depth)。
  • Mₙ:协变量列数(本文中 Mₙ = cₙ + 1,cₙ 为冗余编码数)。
  • Q_{Mₙ}:每个节点采样的候选列数(grf 中由 mtry 控制)。
  • ωₙ = E[Q_{Mₙ}]/Mₙ:单次分裂中某列被选中的概率。
  • Iₙ = Hₙ·ωₙ:访问深度指数(access-depth index),本文的核心量。

  • 表示与类:

  • R₁,ₙ(X) = {X₁⁽¹⁾, …, X₁⁽ᶜⁿ⁾, X₂}:重复编码 X₁ 的表示。
  • R₂,ₙ(X) = {X₁, X₂⁽¹⁾, …, X₂⁽ᶜⁿ⁾}:重复编码 X₂ 的表示。
  • 每个 Xⱼ⁽ℓ⁾ = φⱼℓₙ(Xⱼ) 是严格递增的编码映射(如对数、平方根、秩变换等)。
  • 分裂类(split class):在有限数组 X_cert 上生成相同无序划分的列集合。

模型:

数据生成机制为: - X ~ Unif([0,1]²),W ~ Bernoulli(1/2),W ⊥ {Y(0), Y(1)} | X。 - Y = m₀(X) + W·τₐ(X) + U,E(U|X,W) = 0。 - 研究者使用诚实因果森林(honest causal forest),分裂准则基于拟合得分 Γ̂ 的方差减少。

可观测数据:研究者观测到 (Yᵢ, Wᵢ, Xᵢ)ᵢ₌₁ⁿ,以及一个协变量表示 Rₕ,ₙ(h = 1 或 2)。关键点是:两种表示生成相同的 σ-域 σ(X₁, X₂),即信息等价,但列数不同。

第二步:最小内核

核心命题(非正式陈述):考虑两个信息等价的表示 R₁,ₙ 和 R₂,ₙ。R₁,ₙ 将 X₁ 重复 cₙ 次(共 cₙ+1 列),R₂,ₙ 将 X₂ 重复 cₙ 次。由于随机特征选择在每个节点从 Mₙ 列中均匀采样 Q_{Mₙ} 列,X₁ 在 R₁,ₙ 中被选中的概率是 X₂ 的 cₙ 倍。这导致:

  • 当 Iₙ → 0(即 Hₙ·ωₙ → 0)时,重复的协变量主导分裂路径,另一个协变量(单例)几乎不会被选中。此时,森林的极限预测为:
  • 表示 R₁,ₙ 下:T̂₁,ₙ → a₁s₁(X₂ 的效应完全丢失)
  • 表示 R₂,ₙ 下:T̂₂,ₙ → a₂s₂(X₁ 的效应完全丢失)

因此,两个信息等价的表示产生符号相反的 CATE 估计(在 s₁ 与 s₂ 异号的区域),且策略遗憾趋于 (a₂ − a₁)/2 > 0。

为什么成立(直觉):关键在于"访问深度"与"候选概率"的权衡。路径深度 Hₙ 决定了分裂次数;每次分裂时,单例协变量被选中的概率仅为 ωₙ。若 Hₙ·ωₙ → 0,则整条路径上单例被选中的期望次数趋于 0,由 Markov 不等式可知其从未被选中的概率趋于 1。此时,森林只能基于重复协变量分裂,另一个协变量的效应完全无法被捕获。

数学难点:证明的关键在于处理"分裂路径的依赖结构"——一旦某个协变量被选中并分裂,后续分裂的条件分布会改变。作者通过"失败树"(failure tree)构造——在每步都条件于不选单例——将问题转化为对条件概率乘积的控制。这需要精细的浓度不等式(相对 VC Bernstein 界)来处理随机分裂准则下的偏差。

最小例子:设 a₁ = 1, a₂ = 2,X₁, X₂ 独立均匀。真实 CATE 为 τ(X) = s₁ + 2s₂。在区域 {s₁ = −1, s₂ = +1} 上,τ = +1 > 0(应治疗);但若表示 R₁,ₙ 导致 X₂ 从未被分裂,则估计 T̂₁,ₙ ≈ s₁ = −1 < 0(不治疗),产生错误决策。策略遗憾为 E[|τ|·1{π̂ ≠ π*}] = (a₂ − a₁)/2 = 0.5。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:当协变量包含严格单调的冗余编码时,因果森林的随机特征选择机制会对被重复表示的协变量产生选择偏好,导致 CATE 估计的极限发生偏移,且该偏移在访问深度指数 Iₙ → 0 时持续存在。
  2. 核心方法:建立了一个两协变量模型(X₁, X₂),其中一方被 cₙ 重编码;通过"失败树"构造和相对 VC 浓度不等式,刻画了森林极限预测对表示选择的依赖,并提出了"分裂类采样"作为修复方案。
  3. 主要结论:在 Iₙ → 0 时,单例协变量的效应完全丢失,两个信息等价的表示产生符号相反的 CATE 极限和正的政策遗憾;在 Iₙ → ∞ 时,两种表示均恢复真实 CATE;在中间区域,效应被部分恢复,权重由 e^{−κdₕ(a)} 刻画。

关键设定与假设

  • 模型设定:X = (X₁, X₂) ~ Unif([0,1]²),二元处理 W ~ Bernoulli(1/2),CATE 为 τₐ(X) = a₁s₁ + a₂s₂,其中 sⱼ = 2·1{Xⱼ ≥ 1/2} − 1。系数满足 0 < a ≤ a₁ < a₂ ≤ ā,且 a₂ − a₁ ≥ Δₐ。
  • 表示设定:R₁,ₙ 将 X₁ 重复 cₙ 次(共 cₙ+1 列),R₂,ₙ 将 X₂ 重复 cₙ 次。所有编码映射 φⱼℓₙ 严格递增,因此两种表示生成相同的 σ-域。
  • 森林设定:诚实因果森林,分裂准则基于拟合得分 Γ̂ 的方差减少。候选列数 Q_{Mₙ} 由 mtry 控制,Q_{Mₙ} ∈ {1, …, Mₙ}。
  • 假设 1(核心):
  • (a) 结果有界,条件误差分布有连续密度;
  • (b) 交叉拟合的均方误差 o(1);
  • (c) 每个节点存在正增益的 admissible split(延续性条件);
  • (d) 分裂准则的归一化得分与 oracle 得分一致(得分传递条件);
  • (e) 树结构满足正则性(子采样比例、叶节点大小、树数等)。
  • 相比已有文献:Wager & Athey (2018) 假设特征集合固定且无冗余;本文放松了这一隐含假设,允许特征集合包含信息等价的冗余列。但本文的模型更简单(仅两协变量、二元状态),未处理高维或连续协变量的情形。

主要结果

定理 1(表示依赖的森林极限):在假设 1 下,若 Iₙ → 0,则对 h = 1, 2: ‖T̂ₕ,ₙ − aₕsₕ‖{L₁(P_X)} →ᵖ 0。 即,森林只保留被重复表示的协变量的效应,单例协变量的效应完全丢失。若 Iₙ → ∞,则 ‖T̂ₕ,ₙ − τₐ‖{L₁(P_X)} →ᵖ 0,两种表示均恢复真实 CATE。若 Iₙ → κ ∈ (0, ∞),则 T̂₁,ₙ →ᵖ a₁s₁ + (1 − e^{−κd₁(a)})a₂s₂, T̂₂,ₙ →ᵖ (1 − e^{−κd₂(a)})a₁s₁ + a₂s₂, 其中 dₕ(a) 是失败树路径深度的极限归一化值。

推论 1(符号反转与政策遗憾):在 Iₙ → 0 时,对任意 a ∈ Cₐ: P_X(sgn(T̂₁,ₙ) ≠ s₂) →ᵖ 1/2(在 s₁ 与 s₂ 异号的区域), Regₐ(π̂₁,ₙ) →ᵖ (a₂ − a₁)/2 > 0。 即,重复较小系数的协变量会导致非零的政策遗憾。

推论 2(临界表示规模):在 grf 的默认 mtry 规则下(ξ_{Mₙ} ~ √Mₙ),临界表示规模为 Mₙ ≍ Hₙ²;在固定 mtry 下为 Mₙ ≍ Hₙ。

命题 1(类采样的不变性):若在有限数组 X_cert 上先对列进行等价类划分(相同弱序和并列关系),再在类级别进行采样,则森林的划分、预测、标准误和变量重要性在列的置换、冗余编码的增删下保持不变。

证明路线与技术技巧

整体路线(5 步):

  1. 得分一致性:利用假设 1(d) 的得分传递条件,将分裂准则从拟合得分 Γ̂ 替换为 oracle 得分 Γ,误差为 o(1)。
  2. 失败树构造:定义"失败树"为在每一步都条件于不选单例协变量的树。其转移核与普通树仅在"单例被选中"这一事件上不同。
  3. 耦合与概率控制:将普通树与失败树耦合,控制两者路径不同的概率。关键估计是单例在整条路径上从未被选中的概率 ≥ 1 − O(Hₙωₙ)(当 ωₙ → 0 时)。
  4. 极限刻画:在失败树上,单例从未被分裂,因此其效应完全丢失。利用叶节点内样本均值的一致性,得到极限 T̂ₕ,ₙ → aₕsₕ。
  5. 中间区域的精细分析:当 Iₙ → κ 时,利用泊松近似刻画单例首次被选中的位置,得到权重 e^{−κdₕ(a)}。

关键技术技巧:

  • 相对 VC Bernstein 界:用于控制分裂准则在随机子样本上的均匀偏差。这是处理"分裂准则依赖数据"这一非标准问题的核心工具。
  • 失败树条件构造:将"避免单例"这一事件从路径概率中分解出来,转化为对条件概率乘积的控制。这避免了直接分析高维依赖结构。
  • 泊松极限:在中间区域,单例被选中的次数近似为 Poisson(Hₙωₙ),利用 Poisson 分布的截断性质得到部分恢复的权重。
  • 类采样的确定性论证:命题 1 的证明不依赖概率估计,而是通过构造类级别的采样方案,使得等价类内的列在采样中不可区分。

真实例子与应用

蒙特卡洛模拟:设 p = 40, 100, 250, 500 个基线协变量,其中 X₁ 被 8 重编码。使用 grf 2.4.0 默认参数。结果显示: - 在 p = 500 时,两种表示的 CATE 符号不一致率达 45.7%(阈值 0.10 时 32.9%),而仅改变森林种子时仅为 0.09%。 - 类采样将符号不一致率降至 0.00%,且政策遗憾从 0.026 降至 0.005。

实证复现(NSW 数据):复现 Chernozhukov et al. (2022) 的 NSW 职业培训研究。原始分析保留年龄、教育、1974 和 1975 年收入及其平方项。复现发现:当保留平方项时,个体对比(individual contrast)的符号在 2.3–11.5% 的观测中发生反转(取决于样本/规格),而仅改变种子时为 1.3–4.6%。类采样后符号反转率降至 2.5–8.3%,但仍高于种子变化基准。ATET 估计变化范围为 4–177 美元,均不改变统计显著性。

例子想说明什么:模拟展示了表示多重性在可控环境下的严重性(符号不一致率随维度增长);实证复现则说明即使在标准应用中,冗余编码(平方项)也会导致个体层面的决策不稳定,且这种不稳定不能由种子变化解释。

🔎 结论是否比证明窄

  • 明确证明:定理 1 的 Iₙ → 0 和 Iₙ → ∞ 两个端点情形在假设 1 下严格成立。推论 1 的符号反转和遗憾下界直接由定理 1 推出。
  • 中间区域(Iₙ → κ):定理 1 的中间情形需要额外的路径深度条件(假设 1 后的补充条件),且 dₕ(a) 的存在性依赖失败树路径深度的收敛,这一收敛性在文中仅以"假设"形式给出(假设 1 后的补充段落),未给出充分条件。这是证明比结论窄的地方——作者在定理陈述中使用了 e^{−κdₕ(a)} 的精确形式,但 dₕ(a) 的识别和可估计性并未完全建立。
  • 命题 1 的适用范围:类采样的不变性仅在有限数组 X_cert 上成立,对训练分布之外的预测点(未来数据)没有保证。作者在结论部分也承认这一点。
  • 实证部分:NSW 复现中,类采样后的符号反转率仍高于种子变化基准,作者未给出理论解释。这可能意味着类采样并未完全消除表示敏感性,或存在其他偏差来源。

四、开放问题

  1. dₕ(a) 的识别与估计:定理 1 中间区域的权重 e^{−κdₕ(a)} 依赖失败树路径深度的极限 dₕ(a),但文中未给出 dₕ(a) 的显式表达式或可估计的充分条件。要确认这是否为真 gap,可去读 Wager & Athey (2018) 和 Athey et al. (2019) 中关于路径深度收敛的讨论——若他们给出了更一般的条件,则本文的 dₕ(a) 可能只是其特例;若没有,则这是一个值得追的问题。

  2. 类采样的分布外保证:命题 1 的类采样不变性仅在有限数组 X_cert 上成立。对训练分布之外的预测点,类采样是否仍能保证预测不变?这需要扩展命题 1 的证明到无限总体,或给出反例。扎根于命题 1 的陈述"on the declared array"。

  3. 高维情形的推广:本文的模型仅有两个协变量(X₁, X₂),其中一个被重复编码。当协变量维度 p 随 n 增长时,访问深度指数 Iₙ 的定义和定理 1 的结论是否仍然成立?扎根于定理 1 的证明中对"两协变量矩形类"的依赖。

  4. 类采样与变量重要性的交互:类采样消除了预测的不变性,但变量重要性(variable importance)在类采样下如何变化?文中未报告类采样后的变量重要性结果。扎根于第 5.2 节实证部分仅报告了 ATET 和符号反转率。

  5. 与去偏方法的比较:Chernozhukov et al. (2022) 的正交化方法能否消除表示多重性的影响?本文未与 DML 框架进行理论比较。扎根于第 1 节引言中对 Chernozhukov et al. (2022) 的引用及其在实证中的复现。


提醒:若想确认上述某条是否是真 gap,建议去读以下近期文献的引言部分——(i) 关于随机森林特征选择偏差的文献(如 Scornet 等关于 VIMP 的工作);(ii) 关于因果森林在高维下性质的文献(如 Wager & Athey 的后续工作);(iii) DML 框架下关于 nuisance 估计器规范敏感性的文献。若这些文献的引言都指向同一问题,则说明是共识性 gap;若互相矛盾,则可能是机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论