跳转至

Significance-First Splitting: Aligning Treatment Heterogeneity Detection with Honest Estimation

作者: Pantelis Z. Hadjipantelis, Josephine Chiang, Karthik Nagesh
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.03999


一、领域脉络与小综述

这个方向是什么

本子方向聚焦于异质性处理效应(CATE)的树方法估计与推断。核心统计问题是:在随机化实验或观察性研究中,如何同时实现两个目标——(i) 检测哪些协变量驱动了处理效应的异质性(即找到“谁受益、谁受损”的子群),(ii) 对每个子群的平均处理效应给出有名义覆盖率的置信区间。当前成熟度:树方法因其可解释性成为主流,但现有方法在“检测异质性”与“有效推断”之间存在一个已知的权衡,尚无方法能同时满足三个条件(见下文)。

发展脉络(history)

作者在引言中把现有工作串成两条主线,并指出一个明确的缺口:

  1. 奠基工作:显著性分裂树
  2. Radcliffe & Surry (2011):提出用平方 t 统计量(t²)作为分裂准则,直接检验“分裂两侧的处理效应是否相等”。这是第一个将假设检验嵌入树分裂的方法,对处理分配不平衡也稳健(Radcliffe & Simpson 2008; Devriendt et al. 2021 引用其优点)。留下的口子:用同一数据做树构造和叶估计,导致 CATE 估计有偏、置信区间无效。

  3. 主要进展:诚实因果树与森林

  4. Athey & Imbens (2016):引入“诚实性”(honesty)——将数据分裂为训练集(用于建树)和估计集(用于叶 CATE 估计),消除自适应偏差,使叶级置信区间达到名义覆盖率,且不依赖稀疏性假设。留下的口子:其分裂准则(EMSEτ,即诚实均方误差)不直接检验处理效应异质性,可能分裂在预测结果均值而非处理效应的协变量上。
  5. Wager & Athey (2018):将诚实树扩展为随机森林(因果森林),使用无放回子抽样,通过无穷小刀切(IJ)实现森林预测的渐近正态性和逐点置信区间。留下的口子:分裂准则仍是 EMSE 梯度,且 IJ 区间估计的是预测误差而非蒙特卡洛收敛。

  6. 当前 frontier 与本文位置

  7. 作者声称:“目前没有方法能同时满足:(i) 使用统计上合理的效应修饰检验作为分裂准则,(ii) 给出诚实、无偏的叶估计与名义 CI 覆盖,(iii) 扩展到森林并借助 IJ 进行方差估计。”
  8. 本文(rattus) 提出混合算法:用 t² 分裂准则(来自 Radcliffe & Surry)进行树生长,用诚实 EMSEτ 准则(来自 Athey & Imbens)进行交叉验证剪枝,从而结合两者优势。森林版本保留 bootstrap 计数向量,用 IJ 估计蒙特卡洛方差(作为收敛诊断,而非逐点推断)。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索 A:显著性分裂树(significance-based uplift trees)
    核心方法:用 t² 或类似统计量直接检验分裂是否产生异质性。代表:Radcliffe & Surry (2011)、Radcliffe & Simpson (2008)、Devriendt et al. (2021)。共同特征:分裂准则与异质性检测对齐,但缺乏诚实推断。

  • 线索 B:诚实因果树/森林(honest causal trees/forests)
    核心方法:通过样本分裂保证推断有效性。代表:Athey & Imbens (2016)、Wager & Athey (2018)。共同特征:提供名义 CI 覆盖,但分裂准则(EMSEτ 或 MSE 梯度)不直接检测异质性,可能被结果均值预测的协变量误导。

这个方向在追问的核心问题

  1. 分裂准则的选择:如何设计一个准则,既能有效检测处理效应异质性,又能与诚实推断兼容?
  2. 推断的有效性:在树/森林框架下,如何保证叶级 CATE 估计的无偏性和置信区间的名义覆盖率?
  3. 森林的方差估计:对于 bootstrap 森林,如何高效估计预测的方差(蒙特卡洛方差 vs. 预测误差)?
  4. 计算效率:在大规模数据(如 Criteo 的 1400 万样本)上,如何使树生长、剪枝和 IJ 方差估计在计算上可行?

已知瓶颈:显著性分裂树缺乏推断有效性;诚实树的分裂准则可能忽略真正的异质性信号;森林的 IJ 方差估计在 bootstrap 设置下计算成本高(O(B·n·n_test))。

⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)

作者把缺口 frame 成:“目前没有方法能同时满足 (i) 使用统计上合理的效应修饰检验作为分裂准则,(ii) 给出诚实、无偏的叶估计与名义 CI 覆盖,(iii) 扩展到森林并借助 IJ 进行方差估计。” 他们声称自己的混合算法“关闭了这个缺口”。

  • 被淡化或回避的竞争路线
  • 作者在 §3.8 提到观察性研究可通过倾向得分加权(IPW)扩展,但明确警告“所有理论保证在随机化下完全成立;在观察性设置下,它们仅当倾向得分模型正确指定时才成立”。他们承认双重稳健扩展是未来工作(§6)。
  • 作者在 §5.2 与 GRF Causal Forest(Wager & Athey 2018)比较,但 GRF 使用 MSE 梯度分裂准则,而 rattus 使用 t² 准则。作者声称 t² 准则在存在“预测结果均值但不影响处理效应”的协变量时更优,但未与 GRF 的“EMSE 梯度”准则做直接理论比较。
  • 作者在 §6 承认“与显著性分裂树和诚实因果树的直接比较留作未来工作”——这意味着本文并未与 Radcliffe & Surry 的原始显著性树做实证对比。

  • 什么明显该被引/该存在、却没出现在 intro 里?

  • Loh, He & Man (2015) 的 GUIDE 方法:作者在 §3.2 的 'gi' 模式中引用了它(用于减少变量选择偏差),但在 intro 中未提及。GUIDE 是另一个将假设检验嵌入树分裂的框架,与本文的 t² 准则有直接竞争关系。
  • Künzel et al. (2019) 的元学习器(S-/T-/X-learner):作者在 §2.1 和 §5.2 中作为基线使用,但在 intro 中未将其定位为竞争方法。元学习器是 CATE 估计的主流方法,其与树方法的比较是领域内常见话题。
  • Chipman, George & McCulloch (2010) 的 BART:在 §2.1 被提及,但未在 intro 中讨论。BART 是另一种提供不确定性量化的贝叶斯树方法。

张力

未见明显对立引用。作者将 Radcliffe & Surry 和 Athey & Imbens 视为互补而非对立:t² 准则擅长检测异质性,EMSEτ 准则擅长控制复杂度。本文的核心主张是两者可以“各司其职”——t² 用于生长,EMSEτ 用于剪枝。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - τ(x) = E[Y(1) - Y(0) | X = x]:条件平均处理效应(CATE),目标 estimand。 - Y(1), Y(0):潜在结果(potential outcomes),分别对应处理组和对照组。 - D ∈ {0, 1}:二元处理变量。 - X ∈ ℝ^p:协变量向量。 - Y:观测到的结果变量。 - Π:协变量空间的一个划分(partition),由叶节点 ℓ 组成。 - ˆτℓ:叶 ℓ 的 CATE 估计,ˆτℓ = ¯Y₁(ℓ) - ¯Y₀(ℓ),其中 ¯Y_w(ℓ) 是叶 ℓ 中处理臂 w 的结果均值。 - S_tr:训练样本(用于建树和交叉验证),大小 N_tr。 - S_est:估计样本(用于叶 CATE 估计和标准误),大小 N_est。 - p = Pr(D = 1):边际处理概率。 - :平方 t 统计量,用于检验“分裂两侧的处理效应是否相等”。 - EMSEτ:诚实均方误差准则(Athey & Imbens 2016 定义)。 - B:森林中树的数量。 - N_bi:第 b 棵 bootstrap 树中第 i 个观测的计数。 - C:中心化计数矩阵,C_bi = N_bi - 1。 - G = CC^T:Gram 矩阵,用于高效计算 IJ 方差。

模型: - 潜在结果框架(Rubin 1974):每个个体 i 有 (Y_i(0), Y_i(1)),但只能观测到 Y_i = D_i Y_i(1) + (1 - D_i) Y_i(0)。 - 假设:SUTVA(个体处理效应稳定假设)和无混淆性(D ⊥ (Y(0), Y(1)) | X)。在本文的合成实验中,处理是随机化的(p = 0.5),因此无混淆性自动满足。 - 数据生成机制(合成实验):Y_i(w) = η(X_i) + ½(2w - 1)κ(X_i) + ε_i,其中 ε_i ~ N(0, 0.01)η(X) 是结果均值函数,κ(X) 是 CATE 函数(即 τ(X) = κ(X))。

可观测数据: - 研究者观测到 (X_i, Y_i, D_i) 的 i.i.d. 样本,i = 1, ..., n。 - 不可观测:每个个体的两个潜在结果 (Y_i(0), Y_i(1)) 不能同时观测到。CATE τ(x) 是条件期望,需要识别假设(无混淆性)才能从可观测数据中估计。

第二步:讲最小内核

最简特例:假设只有一个二元协变量 X ∈ {0, 1}(例如性别:男/女),处理 D ∈ {0, 1} 随机化(p = 0.5),结果 Y 连续。我们想估计 CATE τ(x) = E[Y(1) - Y(0) | X = x],并判断 τ(0)τ(1) 是否不同。

在这个特例下,论文的核心思路退化成什么?

  1. 分裂准则(t²):我们要决定是否根据 X 分裂数据。分裂后,有四个单元格:(D=0, X=0), (D=1, X=0), (D=0, X=1), (D=1, X=1)。拟合线性模型:

    Y = µ + α·D + β·X + γ·D·X + ε
    
    系数 γ 就是 τ(1) - τ(0)(即处理效应在两组间的差异)。t² 统计量检验 H₀: γ = 0。如果 t² 大,说明分裂有意义——处理效应在 X=0X=1 上确实不同。

  2. 诚实估计:将数据随机分成两半。用一半(S_tr)决定是否分裂(即选择树结构)。用另一半(S_est)估计每个子组的 CATE:

  3. ˆτ(0) = ¯Y₁(X=0) - ¯Y₀(X=0)(在 S_est 上计算)
  4. ˆτ(1) = ¯Y₁(X=1) - ¯Y₀(X=1)(在 S_est 上计算) 由于 S_est 独立于树结构,ˆτ(0)ˆτ(1) 是无偏的,且它们的置信区间(基于两样本 t 检验)达到名义覆盖率。

  5. t² 与 EMSEτ 的对齐:在这个特例下,EMSEτ 准则(Athey & Imbens 2016 的公式 (1))会奖励任何减少结果方差的 split,即使 γ = 0(即处理效应无差异)。例如,如果 X 只影响结果均值(η(X)X 变化)但不影响处理效应(κ(X) 常数),EMSEτ 仍会鼓励分裂,而 t² 会正确拒绝。这就是作者在 §3.2 中分解的核心:当异质性驱动分裂时,t² 与 EMSEτ 对齐;当结果均值驱动分裂时,两者分歧。

这个最小内核说明了什么? 论文的核心数学贡献不是发明新统计量,而是证明 t² 准则与诚实 EMSEτ 准则在“处理效应异质性驱动分裂”的条件下是等价的(通过 §3.2 的分解),从而允许将 t² 用于生长(检测异质性)、EMSEτ 用于剪枝(控制复杂度)。在只有一个二元协变量的特例下,整个方法退化为:用 t² 检验决定是否分裂,用独立样本做两样本均值差估计和推断。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在因果树框架下,如何同时实现处理效应异质性的有效检测(通过显著性分裂)和叶级 CATE 的诚实推断(通过样本分裂与交叉验证剪枝)。
  2. 核心工具/方法:提出混合算法 rattus——用平方 t 统计量(t²)作为分裂准则进行树生长,用诚实 EMSEτ 准则进行交叉验证剪枝,并扩展到森林(bootstrap 集成)以提供更低方差的点估计和 IJ 蒙特卡洛方差诊断。
  3. 主要结论:在 Athey & Imbens (2016) 的三个合成设计上,单棵树在 90% 名义水平下达到约 90% 的叶平均 CI 覆盖;在 Criteo、Starbucks 和 Hillstrom 三个真实 uplift 数据集上,Qini 系数与 S-/T-learner 和 GRF Causal Forest 基线相当或更优(所有 12 个 Wilcoxon 检验 p < 0.05)。

关键设定与假设

完整设定(在第二节最小记号基础上补充): - 数据:i.i.d. 样本 (X_i, Y_i, D_i)i = 1, ..., n,来自随机化实验(核心算法假设)或观察性研究(需倾向得分加权)。 - 诚实性:数据集被随机分为训练集 S_tr(默认 50%)和估计集 S_est(默认 50%)。树结构(划分 Π)仅基于 S_tr 构建;叶 CATE 估计和标准误仅基于 S_est 计算。这是所有推断保证的基础。 - 分裂准则:t² 统计量,来自四单元格饱和回归模型(§3.2 公式)。候选分裂最大化 t²。 - 剪枝准则:诚实 EMSEτ(Athey & Imbens 2016 公式 (1)),通过 k 折交叉验证在 S_tr 上选择代价复杂度惩罚 λ。 - 森林:B 棵 bootstrap 树(默认 B=50),每棵树内部进行 50/50 诚实样本分裂。特征子抽样(每节点 ⌊√p⌋ 个特征)去相关。 - IJ 方差:基于 Wager, Hastie & Efron (2014) 的 IJ 估计器,但仅作为蒙特卡洛收敛诊断(非逐点推断)。通过 Gram 矩阵 G = CC^T 实现 O(B²(n + n_test)) 计算。

相比已有文献的假设变化: - 放宽:相比 Athey & Imbens (2016),分裂准则从 EMSEτ 改为 t²,后者对“结果均值预测”协变量更鲁棒(§3.2 分解)。 - 强化:相比 Radcliffe & Surry (2011),增加了诚实样本分裂和交叉验证剪枝,消除了自适应偏差。 - 未变:仍假设随机化(或通过 IPW 调整后的无混淆性)、SUTVA、有限方差。

主要结果

理论结果(Proposition 1-4):

  1. Proposition 1(诚实无偏性):对于任何在 S_tr 上构建的划分 Π(独立于 S_est),叶 CATE 估计 ˆτℓ 是条件无偏的:E[ˆτℓ | Π] = τℓ证明路线ˆτℓS_est 上的两样本均值差,S_est 与 Π 独立,因此无偏性直接来自随机化。必要条件:诚实样本分裂(Π 与 S_est 独立)。

  2. Corollary 2(叶级 CI 覆盖):标准置信区间 ˆτℓ ± c_{1-α/2} · ˆσℓ 达到名义覆盖率,无需对 Π 做稀疏性假设。证明路线:因为 Π 固定且 S_est 独立,叶内观测是条件 i.i.d. 样本,ˆτℓ 是固定层上的两样本均值差,CLT 适用。小样本时用 Welch t 分布近似。

  3. Proposition 3(t² 的渐近分布):在 H₀: γ = 0(节点内无处理效应异质性)下,t² → χ²₁(当节点样本量 nℓ → ∞)。证明路线:四单元格饱和回归的 OLS 估计量 ˆγ 满足 ˆγ / √(ˆσ² C₄₄) ~ t(nℓ - 4),平方后得 t² ~ F(1, nℓ - 4),当 nℓ → ∞F → χ²₁重要警告:由于多重测试(选择最大 t²),用未调整的 F 临界值作为硬性显著性门控是反保守的,作者建议用户禁用此功能(设 α = 1.0),依赖交叉验证剪枝。

  4. Proposition 4(IJ 在诚实森林中的有效性):在诚实森林中,IJ 方差估计的误差为 O_p(B^{-1/2} n^{-1/2}),比自适应森林的 O_p(B^{-1/2}) 更快。证明路线:诚实性使一阶自适应偏差项 ∂ˆτ_b / ∂N_bi 为零(因为树结构仅依赖 S_tr,估计仅依赖 S_est,两者独立),剩余误差来自 Hájek 投影近似,为 O(n^{-1/2})

实证结果(§5):

  • 合成实验(Athey & Imbens 2016 的三个设计):单棵树在 90% 名义水平下,叶平均 CI 覆盖率为 0.894-0.903(200 次重复,标准差约 0.11-0.13)。EMSEτ 随设计复杂度增加(Design 1: 0.0037 → Design 3: 0.0573)。
  • 真实数据(Criteo、Starbucks、Hillstrom):rattus 诚实森林的 Qini AUC 在所有三个数据集上均优于 GRF Causal Forest 基线(Criteo: 0.0887 vs. 0.0859; Starbucks: 0.2141 vs. 0.2112; Hillstrom: 0.0346 vs. 0.0214)。所有 12 个 Wilcoxon 检验 p < 0.05。森林相对于单棵树的增益在 Starbucks 上最大(0.2141 vs. 0.1954),在 Criteo 上最小(0.0887 vs. 0.0814),与 IJ 收敛诊断一致(低信噪比时 bagging 增益有限)。

证明路线与技术技巧

整体路线(以 Proposition 1 和 3 为例):

  1. 诚实无偏性(Proposition 1):这是最直接的证明——定义 ˆτℓ = ¯Y₁(ℓ) - ¯Y₀(ℓ),取条件期望 E[ˆτℓ | Π] = E[¯Y₁(ℓ) | Π] - E[¯Y₀(ℓ) | Π]。由于 Π 与 S_est 独立,E[¯Y_w(ℓ) | Π] = µ(w, ℓ)(处理臂 w 在叶 ℓ 中的条件均值),因此 E[ˆτℓ | Π] = τℓ关键跳跃点:无——这是诚实性的直接推论。

  2. t² 的渐近分布(Proposition 3):从四单元格回归模型出发,OLS 估计 ˆγ 的方差为 Var(ˆγ) = σ² · C₄₄,其中 C₄₄ = N_{TL}^{-1} + N_{TR}^{-1} + N_{CL}^{-1} + N_{CR}^{-1}。在 H₀ 下,ˆγ / √(ˆσ² C₄₄) ~ t(nℓ - 4)。平方后得 t² ~ F(1, nℓ - 4)。当 nℓ → ∞F(1, nℓ - 4) → χ²₁关键跳跃点:无——这是经典回归理论的标准结果。

  3. IJ 在诚实森林中的有效性(Proposition 4):标准 IJ 理论(Wager et al. 2014)要求两个条件:(C1) 树预测平方可积,(C2) Hájek 投影近似准确。在诚实森林中,(C2) 被强化:因为 ˆτ_b(x) 仅依赖 S_est(独立于树结构),∂ˆτ_b / ∂N_bi 的一阶项为零。关键跳跃点:证明一阶自适应偏差项为零——这是诚实性的直接结果,但作者将其形式化为“Bias₁ = 0”,从而将 IJ 误差从 O_p(B^{-1/2}) 降至 O_p(B^{-1/2} n^{-1/2})

技术技巧点名: - Gram 矩阵加速 IJ 计算(§4.4):将 IJ 方差从 O(B·n·n_test) 降至 O(B²(n + n_test))。核心技巧:将 dVar_IJ(x_j) 重写为 (1/B²) · ˜t_j^T G ˜t_j,其中 G = CC^T ∈ ℝ^{B×B} 独立于测试点。这利用了二次型的矩阵代数恒等式,避免了逐训练点循环。对于 B=50, n=n_test=10⁶,加速约 4 个数量级。 - 有效 alpha 网格(§3.3):剪枝时,代价复杂度惩罚 λ 的候选值不是固定几何序列,而是树中实际存在的“有效增益”(每个内部节点的 ˆτ²_train(split) - ˆV_train(split))。这确保交叉验证只评估不同的树结构,避免冗余计算。 - GUIDE 两步法(§3.2 的 'gi' 模式):通过先做变量选择(F 检验)再做阈值搜索,减少高基数特征的变量选择偏差。这是 Loh, He & Man (2015) 的技术,作者将其作为可选项实现。

真实例子与应用

合成数据(§5.1): - 数据:Athey & Imbens (2016) 的三个设计,Y_i(w) = η(X_i) + ½(2w-1)κ(X_i) + ε_iε_i ~ N(0, 0.01)p = 0.5X_i ~ Uniform([0,1]^K)。 - Design 1: K=2, η = ½(x₁ + x₂), κ = ½ x₁。无噪声协变量。 - Design 2: K=10, η = ½ Σ_{k=1}^6 x_k, κ = Σ_{k=1}^2 1[x_k > 0.5] · x_k。4 个噪声协变量。 - Design 3: K=20, η = ½ Σ_{k=1}^{12} x_k, κ = Σ_{k=1}^2 1[x_k > 0.5] · x_k。8 个噪声协变量。 - 方法应用:N_train = 1000(内部 50/50 诚实分裂),N_te = 8000,n_reps = 200。报告叶平均 CI 覆盖率(90% 名义水平)。 - 结果:覆盖率 0.894-0.903,标准差 0.11-0.13。EMSEτ 随噪声协变量增加而上升(0.0037 → 0.0573)。 - 想说明什么:验证 Proposition 1 的 CI 覆盖保证——在三个不同复杂度下,叶级 CI 覆盖率接近名义水平。

真实数据(§5.2): - 数据: - Criteo Uplift Dataset(Diemert et al. 2018):约 1400 万观测,12 个特征,二元处理,两个二元结果(visit 和 conversion)。 - Starbucks(Rößler et al. 2021):约 12.6 万观测,7 个特征,来自促销活动。 - Hillstrom(Hillstrom 2008):约 6.4 万观测,8 个特征(recency, history, mens, womens, zip_code, newbie, channel, history_segment),来自电子邮件营销活动。 - 方法应用:50% 训练(按处理分层),50% 测试。rattus 单棵树和诚实森林(B=50, max_depth=6, 默认超参数)。基线:S-Learner 和 T-Learner(HistGradientBoostingRegressor)、GRF Causal Forest(B=52, max_depth=6)。比较 Qini AUC(36 次独立运行)。 - 结果(表 3): - Criteo:Honest Forest 0.0887 > GRF 0.0859 > S-Learner 0.0877 > T-Learner 0.0806 > Single Tree 0.0814。 - Starbucks:Honest Forest 0.2141 > GRF 0.2112 > S-Learner 0.2070 > Single Tree 0.1954 > T-Learner 0.1940。 - Hillstrom:Honest Forest 0.0346 > Single Tree 0.0298 > S-Learner 0.0267 > GRF 0.0214 > T-Learner 0.0192。 - 想说明什么:① rattus 诚实森林在所有三个数据集上 Qini 优于 GRF Causal Forest(p < 0.05),尤其在 Hillstrom 上差距最大(0.0346 vs. 0.0214),作者归因于 t² 准则避免了对“结果均值预测”协变量的分裂。② 森林相对于单棵树的增益在信噪比低的数据集(Criteo)上较小,在信噪比高的数据集(Starbucks)上较大,与 IJ 收敛诊断一致。

🔎 结论是否比证明窄

  • Proposition 1 和 Corollary 2 的结论与证明完全匹配:证明的是“叶级 CATE 估计无偏”和“叶级 CI 达到名义覆盖率”,结论也仅限于此。没有声称森林预测的 CI 有效。
  • Proposition 3 的结论与证明匹配:证明的是 t² 在 H₀ 下渐近 χ²₁,但作者立即警告多重测试问题,建议用户禁用硬性显著性门控。结论没有过度泛化。
  • Proposition 4 的结论与证明匹配:证明的是 IJ 方差估计的误差率,但作者明确声明“IJ 区间是收敛诊断,不是逐点推断”。结论没有声称 IJ 区间对 τ(x) 有效。
  • 森林的渐近正态性:作者在 §6 承认“诚实显著性森林的完整渐近正态性结果……需要额外的正则条件,形式证明留作未来工作”。这意味着本文没有证明森林预测的渐近正态性(类似 Wager & Athey 2018 的 Theorem 4.1),而这是森林级 CI 的前提。因此,森林的推断能力被明确限制为“点估计 + IJ 收敛诊断”,而非“逐点 CI”。
  • 观察性研究:§3.8 的 IPW 扩展仅给出启发式建议,没有理论保证。作者明确声明“所有理论保证在随机化下完全成立;在观察性设置下,它们仅当倾向得分模型正确指定时才成立”。结论没有声称在观察性研究中的有效性。

四、开放问题

  1. 双重稳健扩展(扎根于 §6 “A doubly-robust version combining IPTW with direct estimation would strengthen applicability to heavily confounded settings”):如何将 rattus 的 t² 分裂准则与双重稳健估计(如 AIPW)结合,使其在倾向得分模型错误指定时仍保持一致性?这需要重新推导 t² 统计量在加权设置下的分布,并证明诚实性在双重稳健框架下仍成立。

  2. 变量选择偏差的形式化刻画(扎根于 §6 “A formal characterisation of the residual bias under the ‘greedy’ mode and a power comparison between the two modes across feature-cardinality settings is left for future work”):在默认的 'greedy' 模式下,t² 准则对高基数特征的选择偏差有多大?能否用极值理论(如最大值分布)刻画 max_j t²_j 的分布,并设计校正方法?

  3. 诚实显著性森林的渐近正态性(扎根于 §6 “A full asymptotic normality result for the honest significance forest, analogous to Theorem 4.1 of Wager and Athey (2018), requires additional regularity conditions on the t² criterion and the CV pruning step”):在什么条件下,rattus 森林的预测 ˆτ_forest(x) 是渐近正态的?这需要证明 t² 分裂准则满足 Wager & Athey (2018) 的“正则性条件”(如分裂的“诚实性”和“随机性”),并处理交叉验证剪枝引入的额外随机性。

  4. 计算扩展(扎根于 §6 “For extremely large datasets, a globally pre-computed bin structure (as in LightGBM) rather than per-node quantile estimation could yield further speedups”):如何将 rattus 的每节点分位数估计替换为全局预计算分箱(如 LightGBM 的直方图算法),同时保持诚实性?这需要证明全局分箱不会引入自适应偏差,并分析其对分裂准则 t² 的影响。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论