跳转至

Optimal Variance Reduction in Randomized Experiments

作者: Amir Najmi, Michael D. Keselman
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.23615


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是在完全随机化实验中,如何利用协变量(不受处理影响的响应侧信息)来降低处理效应估计量的方差。核心统计问题是:给定一个处理效应 estimand(如平均处理效应、对数比率效应等),以及一个可以任意复杂的预测模型族,能否构造一个估计量,使其方差达到理论下界,同时不引入因过拟合或正则化导致的偏差?该方向当前已从简单的线性协变量调整(如 CUPED)发展到利用任意机器学习模型的非参数/半参数方法,其成熟度较高,但针对复杂效应指标(如乘法效应、比率效应)的最优性理论仍有缺口。

发展脉络(history)

  • 奠基工作:线性调整与 Freedman 的批评。Deng et al. (2013) 提出 CUPED,利用实验前数据(作为协变量)通过线性回归调整来降低方差,其核心是假设响应与协变量呈线性关系。Freedman (2008) 则批评 OLS 调整可能恶化渐近精度、导致无效的方差估计和小样本偏差。Lin (2013) 回应了这些批评,证明当包含完整的处理-协变量交互项时,OLS 调整不会损害渐近精度,且 Huber-White 标准误可构造有效置信区间。这些工作奠定了线性调整的理论基础,但模型形式受限。

  • 主要进展:非参数/机器学习调整与偏差控制。Hosseini and Najmi (2019) 提出了一个通用框架,允许使用任意预测模型(如神经网络)进行方差缩减,同时保持渐近无偏性,但其方法仅建模单一臂(如仅控制组),在非平衡实验中是次优的。Chernozhukov et al. (2018) 的 Double/Debiased ML (DML) 框架虽然主要针对观察性研究中的因果推断,但其交叉拟合(cross-fitting)和 Neyman 正交化思想被后续工作直接借用。Jin and Ba (2023) 最接近本文,他们利用 AIPW 估计量的半参数最优性,对加性处理效应和比率指标(加性效应)实现了最优方差缩减,但需要分别为 Y 和 Z(对处理组和控制组)训练四个模型,且不适用于乘法效应。

  • 当前 frontier 与本文位置:当前 frontier 是处理非加性(乘法、比率)处理效应,并允许使用任意复杂模型。Soriano (2017) 是唯一处理乘法效应的先验工作,但使用贝叶斯方法,未证明最优性。本文声称填补了这一空白:对加性效应达到非渐近最优,对更复杂的效应(乘法、比率、方差比、回归系数)通过 Delta 方法达到渐近最优,且只需训练一个单一的标量函数 g(x),比 Jin and Ba (2023) 的四个模型更简洁。

子线索聚类

  1. 线性调整方法:CUPED (Deng et al., 2013)、Lin (2013)。假设线性关系,计算简单,但模型容量有限,无法利用复杂协变量结构。
  2. 非参数/机器学习调整(单臂或双臂分离):Hosseini and Najmi (2019)(单臂建模)、Jin and Ba (2023)(双臂分离建模,需四个模型)。允许任意复杂模型,但要么次优(单臂),要么在非平衡实验中因小臂数据稀疏而难以训练(双臂分离)。
  3. 针对复杂指标的方法:Soriano (2017)(乘法效应,贝叶斯,无最优性保证)。本文属于此线索,但提供了最优性证明。

核心问题与已知瓶颈

  • 核心问题 1:对于给定的处理效应 estimand,最优的协变量调整函数 g(x) 是什么?——已知瓶颈:对于加性效应,最优 g 是条件期望的凸组合(式 4);对于复杂效应,此前无一般解。
  • 核心问题 2:如何在使用任意复杂模型(如神经网络)时避免过拟合偏差?——已知瓶颈:交叉拟合(cross-fitting)是标准解法,但需确保模型估计的收敛性(DML 要求一定收敛速率,而本文声称不需要)。
  • 核心问题 3:在非平衡实验(γ 远离 1/2)中,如何有效借用大臂信息来帮助小臂建模?——已知瓶颈:双臂分离建模(Jin and Ba, 2023)在小臂数据稀疏时失效;单臂建模(Hosseini and Najmi, 2019)则完全忽略另一臂信息。

⚠️ 作者的 framing

作者将缺口 frame 成:"现有工作要么只处理加性效应(Jin and Ba, 2023),要么需要分别训练多个模型(Jin and Ba, 2023 需四个模型),要么不处理乘法效应(除 Soriano 2017 外均未涉及)。本文通过构造一个单一的最优调整函数 g(x),统一处理加性和复杂效应,且证明更简单。" 作者淡化了 DML 的通用性——DML 本身也可用于随机实验的方差缩减(如第 7 节所述),但作者指出 DML 等价于一个 pooled 模型,在 γ≠1/2 时是次优的。值得研究者去查的问题:作者未引用任何关于半参数效率界(efficient influence function)的文献(如 Robins et al. 1994, Lunceford and Davidian 2004 虽被引,但仅用于 AIPW 的引用,而非作为效率理论的一般框架)。本文的最优性证明本质上是方差最小化,而非半参数效率意义上的最优——后者通常涉及影响函数和正交化。作者是否刻意回避了效率理论的语言?此外,本文未讨论非随机实验(观察性研究)的情况,而 DML 正是为此设计。

张力

未见明显对立引用。所有被引工作均承认协变量调整的有效性,分歧仅在于模型形式、偏差控制和最优性条件。Lin (2013) 与 Freedman (2008) 的争论已被 Lin 的工作解决。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号:
  • \(X \in \mathbb{R}^p\):协变量向量(不受处理影响)。
  • \(Y(0), Y(1) \in \mathbb{R}\):潜在结果(potential outcomes),分别对应控制和处理下的响应。
  • \(W \in \{0,1\}\):处理分配指示变量(0=控制,1=处理)。
  • 可观测数据:\((X_i, Y_i, W_i)\),其中 \(Y_i = Y_i(W_i)\)(即只观测到对应分配的那个潜在结果)。
  • \(\delta = \mathbb{E}[Y(1)] - \mathbb{E}[Y(0)]\):平均处理效应(ATE),是目标 estimand。
  • \(M = \bar{Y}_T - \bar{Y}_C\):简单差分估计量,其中 \(\bar{Y}_T = \frac{1}{|T|}\sum_{i\in T} Y_i(1)\),\(\bar{Y}_C = \frac{1}{|C|}\sum_{j\in C} Y_j(0)\)。
  • \(g(x) \in \mathbb{R}\):一个固定的(从训练数据中学习,但独立于实验数据)协变量函数。
  • \(M_{\text{adj}} = M - (\bar{g}_T - \bar{g}_C)\):调整后的估计量,其中 \(\bar{g}_T = \frac{1}{|T|}\sum_{i\in T} g(X_i)\),\(\bar{g}_C = \frac{1}{|C|}\sum_{j\in C} g(X_j)\)。
  • \(\gamma = |T|/(|T|+|C|)\):处理组占比。
  • \(w_1, w_0\):引理 1 中的通用权重,在应用中对应 \(1/\lambda_1, 1/\lambda_0\) 或 \(1/|T|, 1/|C|\)。
  • 模型:完全随机化实验。个体 \((X_i, Y_i(0), Y_i(1))\) 独立同分布于某个联合分布。处理分配 \(W_i\) 独立于潜在结果和协变量(即 \(W_i \perp\!\!\!\perp (X_i, Y_i(0), Y_i(1))\)),且 \(\mathbb{P}(W_i=1) = \gamma\) 固定。
  • 可观测数据:研究者观测到 \((X_i, Y_i, W_i)\)。潜在结果 \(Y_i(0)\) 和 \(Y_i(1)\) 不可同时观测——这是因果推断的核心缺失数据问题。协变量 \(X\) 完全可观测。

第二步:最小内核——加性处理效应

本文的核心思路在加性处理效应这个特例中完全展现。去掉所有为复杂效应服务的 Delta 方法,剩下的最小内核是:如何选择 \(g(x)\) 使得 \(M_{\text{adj}}\) 的方差最小?

问题:给定 iid 样本 \((X_i, Y_i(0), Y_i(1))\),但只能观测到 \((X_i, Y_i, W_i)\)。定义 \(M_{\text{adj}} = M - (\bar{g}_T - \bar{g}_C)\)。求 \(g\) 使得 \(\text{Var}(M_{\text{adj}})\) 最小。

推导: 1. 由于随机化,\(M\) 无偏,且 \(M_{\text{adj}}\) 也无偏(因为 \(\mathbb{E}[\bar{g}_T - \bar{g}_C] = 0\))。 2. 方差计算:

\[\text{Var}(M) = \frac{1}{|T|}\text{Var}(Y(1)) + \frac{1}{|C|}\text{Var}(Y(0))\]
\[\text{Var}(M_{\text{adj}}) = \frac{1}{|T|}\text{Var}(Y(1) - g(X)) + \frac{1}{|C|}\text{Var}(Y(0) - g(X))\]
3. 应用引理 1(方差分解 + 条件方差公式):令 \(w_1 = |T|, w_0 = |C|\),则 \(\eta = w_1/(w_1+w_0) = \gamma\)。引理 1 证明,最小化 \(J(g) = \frac{1}{w_1}\text{Var}(Y_1 - g(X)) + \frac{1}{w_0}\text{Var}(Y_0 - g(X))\) 的 \(g\) 为:
\[g^*(x) = (1-\eta)\mathbb{E}[Y_1|X=x] + \eta\mathbb{E}[Y_0|X=x]\]
代入 \(Y_1 = Y(1), Y_0 = Y(0), \eta = \gamma\),得:
\[g^*(x) = (1-\gamma)\mathbb{E}[Y(1)|X=x] + \gamma\mathbb{E}[Y(0)|X=x]\]
4. 直觉:最优 \(g\) 是条件期望的凸组合,权重“反向”——小臂(\(\gamma\) 小)的权重更大,因为小臂的方差贡献更大,需要更精确的调整。当 \(\gamma=0.5\) 时,\(g^*\) 是简单平均。

这个特例揭示了整篇论文的核心数学操作:将方差最小化问题转化为一个关于 \(g\) 的二次型优化,通过条件方差分解(Law of Total Variance)分离出不可减少的噪声项(\(K_2\)),然后证明剩余项是 \(g\) 与某个目标函数之差的方差。一般情形(定理 3)只是将这个操作通过 Delta 方法迁移到非线性 estimand 上。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在完全随机化实验中,对于任意可微的处理效应 estimand(加性、乘法、比率、方差比、回归系数),如何利用协变量 \(X\) 构造一个调整估计量 \(M_{\text{adj}}\),使其渐近方差最小,同时允许使用任意复杂模型(如神经网络)而不引入偏差。
  2. 核心工具/方法:对于加性效应,直接最小化有限样本方差(引理 1);对于复杂效应,通过 Delta 方法将渐近方差近似为线性组合的方差,然后应用相同的引理得到最优调整函数 \(g^*(x)\) 的显式形式(定理 3)。使用交叉拟合(cross-fitting)来估计 \(g^*\) 以避免过拟合偏差。
  3. 主要结论:最优调整函数 \(g^*(x)\) 是条件期望的加权组合,权重由处理组占比 \(\gamma\) 和 estimand 的导数决定(式 20)。该最优性是渐近一阶的(定理 3),且对 estimand 的单调变换保持不变(定理 4)。对于加性效应,该解也是非渐近最优的(式 4 与定理 3 一致)。

关键设定与假设

  • 设定:完全随机化实验,个体 iid。\(Y\) 可以是向量(如比率指标中的 \((Y, Z)\))。处理效应 estimand \(\delta = f(\mu_1, \mu_0)\),其中 \(\mu_1 = \mathbb{E}[Y(1)], \mu_0 = \mathbb{E}[Y(0)]\),\(f\) 可微且导数在真值处非零。
  • 假设:
  • 随机化:\(W \perp\!\!\!\perp (X, Y(0), Y(1))\)。这是核心识别假设,使得简单差分无偏。
  • 可微性:\(f\) 和调整函数 \(h\) 在真值处可微且导数非零(定理 3 的条件)。这是 Delta 方法成立的前提。
  • 交叉拟合:模型 \(\hat{y}(W, x)\) 在训练集上拟合,在测试集上评估,保证估计的无偏性。论文声称不需要模型收敛速率(与 DML 不同),但未给出严格证明。
  • 与已有文献的对比:相比 Jin and Ba (2023) 需要为 Y 和 Z 分别建模(四个模型),本文只需一个标量函数 \(g(x)\);相比 Hosseini and Najmi (2019) 的单臂建模,本文是双臂联合最优。

主要结果

  • 定理 3(一般情况下的最优 \(g\)):对于可微的 \(f\) 和满足抵消性质(式 11)的 \(h\),最优调整函数 \(g^*(x)\) 满足:
    \[v_g^T g^*(x) = (1-\gamma) v_a^T \mathbb{E}[Y(1)|X=x] - \gamma v_b^T \mathbb{E}[Y(0)|X=x]\]
    其中 \(v_a = f'_a(\mu_1, \mu_0), v_b = f'_b(\mu_1, \mu_0), v_g = h'_4(\mu_1, \mu_0, \mu_g, \mu_g)\)。该结果的关键在于:方差仅通过 \(v_g^T g(x)\) 依赖于 \(g\),因此可简化为标量问题。技术难点:将多维 \(Y\) 和 \(g\) 的方差最小化问题通过 Delta 方法转化为标量引理 1 的形式。
  • 定理 4(单调变换下的不变性):若 \(g^*\) 最小化 \(\text{Var}_{\text{DM}}\{M_{\text{adj}}\}\),则对任意可微的 \(t\)(\(t'(\delta) \neq 0\)),\(g^*\) 也最小化 \(\text{Var}_{\text{DM}}\{t(M_{\text{adj}})\}\)。这保证了最优性对效应尺度(如对数 vs. 比率)的选择是稳健的。
  • 加性效应特例:\(v_a=1, v_b=-1, v_g=1\),得 \(g^*(x) = (1-\gamma)\mathbb{E}[Y(1)|X] + \gamma\mathbb{E}[Y(0)|X]\),与有限样本最优解一致。

证明路线与技术技巧

  • 整体路线(以定理 3 为例):
  • Delta 方法近似:将 \(M_{\text{adj}} = h(\bar{Y}_1, \bar{Y}_0, \bar{G}_1, \bar{G}_0)\) 在真值处一阶泰勒展开,得到 \(\text{Var}_{\text{DM}}\{M_{\text{adj}}\} = \text{Var}_{\text{DM}}\{v_a^T \bar{Y}_1 + v_b^T \bar{Y}_0 - v_g^T \bar{G}_1 + v_g^T \bar{G}_0\}\)。
  • 独立性分解:由于处理组和控制组独立,将方差分解为两部分:\(\text{Var}_{\text{DM}}\{v_a^T \bar{Y}_1 - v_g^T \bar{G}_1\} + \text{Var}_{\text{DM}}\{v_b^T \bar{Y}_0 + v_g^T \bar{G}_0\}\)。
  • CLT 缩放:利用定理 2,将样本均值序列的 \(\text{Var}_{\text{DM}}\) 转化为单样本方差除以样本量比例:\(\frac{1}{\lambda_1}\text{Var}(v_a^T Y(1) - v_g^T g(X)) + \frac{1}{\lambda_0}\text{Var}(-v_b^T Y(0) - v_g^T g(X))\)。
  • 应用引理 1:将问题映射到引理 1 的框架(\(Y_1 = v_a^T Y(1), Y_0 = -v_b^T Y(0), f(X) = v_g^T g(X)\)),直接得到最优条件。
  • 关键跳跃点:从多维 \(Y\) 和 \(g\) 到标量 \(v_g^T g(x)\) 的约化。这依赖于 Delta 方法的一阶近似,使得方差仅通过 \(v_g^T g\) 依赖于 \(g\),从而将问题降维。难点:证明 \(v_g\) 不依赖于 \(g\) 本身(仅依赖于 \(h\) 在真值处的导数),且抵消性质(式 11)保证了 \(h'_3 = -h'_4\)。
  • 技术技巧点名:
  • Delta 方法:用于将非线性 estimand 的渐近方差近似为线性组合的方差(定理 1)。
  • 条件方差分解(Law of Total Variance):引理 1 的核心,将 \(J(f)\) 分解为不可减少的噪声项 \(K_2\) 和与 \(f\) 相关的项。
  • 交叉拟合(Cross-fitting):用于无偏估计 \(g^*\),避免过拟合偏差(算法 2.1 和 5.5)。
  • “均值移除”技巧:引理 1 证明中,通过定义 \(\tilde{f}(X) = f(X) - \mathbb{E}f(X)\) 等,将方差转化为平方期望,便于应用条件期望的投影性质。

真实例子与应用

本文包含多个数值/应用例子,但没有真实数据实验。所有例子均为理论推导,展示如何将一般公式(定理 3)应用于特定 estimand:

  • 加性效应(5.1 节):验证一般公式退化为已知最优解。
  • 乘法效应:对数尺度(5.2 节):给出两种调整方式(式 25 和式 26),证明它们渐近等价。
  • 乘法效应:比率(5.3 节):通过定理 4 说明与对数尺度等价。
  • 比率指标(5.4 节):\(Y\) 为二维向量 \((Y, Z)\),最优 \(g\) 为式 29。关键洞察:即使响应是多维的,最优调整只需一个标量函数 \(g(x)\)。同时展示了一个失败案例(式 22 不满足),说明某些 \(h\) 的选择不可行。
  • 稳定分母(5.7 节):展示如何将不受处理影响的变量(如曝光天数)作为协变量而非响应的一部分。
  • 方差比(5.8 节):将方差估计转化为均值估计问题(通过 \(Y\) 和 \(Y^2\) 的均值),应用框架。
  • 回归趋势(5.9 节):将每日处理效应的线性组合(如趋势系数)作为 estimand,证明最优 \(g\) 是每日最优 \(g\) 的加权和(式 31),允许跨天借用强度。

这些例子的目的是验证框架的通用性,而非展示实证优势。论文未与任何 baseline 方法(如 CUPED, DML, Jin and Ba 2023)进行模拟或真实数据对比。

🔎 结论是否比证明窄

  • 窄结论 1:定理 3 的“最优性”是渐近一阶的(通过 Delta 方法),仅对 \(\sqrt{n}\)-consistent 估计量成立。论文在 3.1 节明确承认“对于小样本实验,它可能仅作为启发式方法”。但后续讨论(如 6.2 节)将 MSE 与方差直接挂钩,隐含了小样本下的适用性,这未被证明。
  • 窄结论 2:定理 3 假设 \(h\) 的导数在真值处非零,且 \(f\) 可微。对于非光滑 estimand(如分位数处理效应),框架不直接适用。论文未讨论此限制。
  • 窄结论 3:论文声称“不需要模型收敛速率”(第 1 节),但引理 1 和定理 3 的证明假设 \(g\) 是固定的(已知的)。在实际算法中,\(g\) 是从数据中估计的(通过交叉拟合),其估计误差对方差的影响仅通过 6.2 节的 MSE 公式近似处理,未给出严格的收敛条件(如 DML 中的 Neyman 正交性条件)。这可能是最值得质疑的 claim:DML 需要模型收敛速率 \(o(n^{-1/4})\) 来保证 \(\sqrt{n}\)-consistency,而本文声称不需要任何速率——但未提供证明,仅依赖交叉拟合的无偏性。无偏性保证点估计无偏,但不保证方差估计的准确性或 \(\sqrt{n}\)-consistency。

四、开放问题

  1. 非随机实验的扩展:本文完全依赖随机化假设(\(W \perp\!\!\!\perp (X, Y(0), Y(1))\))。将该框架扩展到观察性研究(需要 unconfoundedness 和 overlap)是一个自然方向。扎根于:论文第 1 节“Framing”明确假设随机化,且第 7 节与 DML 的比较暗示了此 gap。
  2. 小样本下的最优性:定理 3 的渐近最优性在小样本下可能不成立。能否推导出有限样本的方差下界(如通过 Cramér-Rao 或 minimax 界)?扎根于:3.1 节“For small sample experiments, it may serve as a heuristic”。
  3. 模型估计误差的严格理论:论文声称不需要模型收敛速率,但未证明。能否给出一个类似于 DML 的定理,明确交叉拟合估计 \(g\) 所需的收敛速率条件(如 \(o(n^{-1/4})\) 或更弱)?扎根于:第 1 节“models of arbitrary complexity may be employed without concern for bias”,以及 6.2 节仅给出 MSE 启发式。
  4. 最优强度借用(borrowing strength):论文在 6.1 节讨论了“wrong direction of weights”问题,但未给出如何最优地跨臂借用信息(如通过正则化或分层模型)的理论指导。能否推导出在给定模型族下,最小化 \(\text{Var}(v_g(\hat{g}(X) - g^*(X)))\) 的估计策略?扎根于:6.1 节“how best to borrow strength across models for \(\hat{y}(W=1, x)\) and \(\hat{y}(W=0, x)\)”被列为未回答问题。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论