跳转至

Regression adjustment in completely randomized experiments with a diverging number of covariates

作者: Lihua Lei, Peng Ding
来源: Biometrika
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是完全随机化实验中,如何利用高维协变量(协变量个数 p 随样本量 n 发散)来改进平均处理效应(ATE)的估计效率。核心统计问题是:在仅依赖随机化设计(不假设结果模型正确)的“设计-based”推断框架下,当 p 很大时,传统的回归调整(如 ANCOVA)会因高维偏差而失效,如何构造一个既相合又渐近正态的 ATE 估计量,并给出其渐近方差表达式。当前成熟度:固定 p 下的理论已很成熟(Lin, 2012),但 p 发散下的理论仍处于发展期,本文是这一方向的重要推进。

发展脉络

  1. 奠基工作:Neyman 的随机化推断框架与 Freedman 的批评
  2. Neyman (1923/1990):提出有限总体(finite-population)视角下的随机化推断,将 ATE 估计的随机性完全归因于处理分配,而非从超总体抽样。这是本文及整个设计-based 推断的基石。
  3. Freedman (2008):批评 OLS 回归调整在随机化实验中会恶化渐近精度、产生无效的精度度量和小样本偏差。这一批评引发了后续大量关于“回归调整是否安全”的讨论。

  4. 主要进展:固定 p 下的回归调整理论

  5. Lin (2013):在 Freedman 批评的回应中,证明当包含完整的处理-协变量交互项时,OLS 调整不会损害渐近精度,且 Huber-White 标准误是相合的。这是固定 p 下回归调整的“黄金标准”结果。本文引用语境指出,Lin (2013) 对结果变量的四阶矩有更严格的要求(见被引论文 [1])。
  6. Middleton (2018):将回归调整推广到任意实验设计(如分层随机化),提出一类广义回归估计量,并给出比现有文献更紧的方差界。本文引用语境将其列为有限总体视角的“黄金标准”之一。

  7. 当前 Frontier:高维协变量调整

  8. Bloniarz et al. (2016):首次在有限总体随机化模型下讨论 p 可能大于 n 的高维情形,但假设潜在结果可被协变量的稀疏线性组合良好近似(超稀疏 regime,非零系数个数远小于 n^{1/2}/log p)。本文指出这一假设过于严格。
  9. Wager et al. (2016):证明任何风险相合的回归调整(包括机器学习方法)都能得到 ATE 的有效估计,但本文指出其结论不适用于许多其他估计量(如 Bloniarz et al. 和 Wager et al. 自身的估计量)。
  10. 本文 (Lei & Ding, 2021):在 p 发散(但 p/n → 0)的设定下,不假设结果模型线性或稀疏,仅依赖随机化设计,提出一个偏差校正估计量,证明其相合性和渐近正态性。这是对 Bloniarz et al. (2016) 和 Wager et al. (2016) 的重要放松。

子线索聚类

  1. 设计-based 推断(有限总体视角):Neyman (1923), Lin (2013), Middleton (2018), Fogarty (2018), Li & Ding (2016)。这一簇强调随机化是推断的唯一来源,不假设超总体模型,结果模型可以任意复杂。
  2. 高维协变量调整(稀疏性假设):Bloniarz et al. (2016), Wager et al. (2016)。这一簇利用 Lasso 或机器学习方法处理高维协变量,但依赖稀疏性或风险相合性等假设。
  3. 无放回抽样的集中不等式:Bardenet & Maillard (2013), Tropp (2015), Bobkov (2004)。这一簇提供本文所需的技术工具——用于处理有限总体下无放回抽样的向量和矩阵集中不等式。

这个方向在追问的核心问题

  1. 偏差-方差权衡:当 p 发散时,回归调整引入的偏差(因高维估计不准确)与方差缩减(因协变量解释结果变异)如何平衡?传统 ANCOVA 在 p 固定时无偏差,但 p 发散时偏差不可忽略。
  2. 模型假设的必要性:能否在不假设结果模型线性或稀疏的条件下,仍实现高维协变量的有效调整?Bloniarz et al. (2016) 需要稀疏性,Wager et al. (2016) 需要风险相合性,本文试图完全摆脱这些假设。
  3. 渐近方差的识别:在 p 发散下,ATE 估计量的渐近方差表达式是什么?如何构造相合的标准误估计?
  4. 随机化设计的“免费午餐”:随机化是否提供了某种“保护”,使得即使协变量调整方法不完美,也能得到有效的推断?Lin (2013) 在固定 p 下回答了“是”,本文在 p 发散下继续追问。

⚠️ 作者的 framing

作者将缺口 frame 成:现有高维协变量调整方法(Bloniarz et al., 2016; Wager et al., 2016)要么依赖稀疏性假设,要么依赖风险相合性假设,而本文在仅依赖随机化设计的条件下,不假设结果模型正确,提出了一个更通用的偏差校正估计量。作者淡化了以下竞争路线: - 超总体视角下的高维推断(如 Cai & Guo, 2017 的置信区间自适应问题):本文完全采用有限总体视角,回避了超总体模型下的偏差-方差权衡讨论。 - 交叉拟合(cross-fitting)技术:Wager et al. (2016) 使用交叉拟合实现有限样本无偏性,本文未采用这一技术,而是通过偏差校正项直接修正。

值得研究者去查的问题:本文的 introduction 未引用任何关于“高维协变量调整在分层随机化或配对实验”中的工作(如 Fogarty, 2018 虽被引,但仅作为有限总体视角的例证,未讨论其高维扩展)。此外,本文未讨论协变量选择后的推断问题(如 post-selection inference),而这是高维统计中一个活跃且相关的子领域。

张力

未见明显对立引用。各被引工作之间在“是否需要模型假设”上存在梯度(Lin 2013 不需要,Bloniarz et al. 2016 需要稀疏性,Wager et al. 2016 需要风险相合性),但并非矛盾,而是不同设定下的不同结论。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \( N \):总样本量(有限总体中的个体数)。
  • \( p \):协变量个数(维度),随 \( N \) 发散,但 \( p/N \to 0 \)
  • \( i = 1, \dots, N \):个体索引。
  • \( Y_i(1), Y_i(0) \):个体 \( i \) 的潜在结果(potential outcomes),分别对应接受处理(\( Z_i = 1 \))和对照(\( Z_i = 0 \))。不可观测——每个个体只能观测到其中一个。
  • \( Z_i \in \{0, 1\} \):处理分配指示变量。在完全随机化实验中,\( \sum_{i=1}^N Z_i = N_1 \)(处理组样本量),\( N_0 = N - N_1 \)(对照组样本量),且 \( (Z_1, \dots, Z_N) \) 均匀分布在所有满足该约束的分配上。
  • \( X_i \in \mathbb{R}^p \):个体 \( i \) 的协变量向量(预处理,不受处理影响)。可观测
  • \( Y_i = Z_i Y_i(1) + (1 - Z_i) Y_i(0) \):观测到的结果。可观测
  • \( \tau = \frac{1}{N} \sum_{i=1}^N [Y_i(1) - Y_i(0)] \):有限总体平均处理效应(FATE)。这是要估计的目标参数
  • \( \hat{\tau} \):某个 ATE 估计量。
  • \( \bar{Y}(1) = \frac{1}{N_1} \sum_{i: Z_i=1} Y_i(1) \)\( \bar{Y}(0) = \frac{1}{N_0} \sum_{i: Z_i=0} Y_i(0) \):处理组和对照组的样本均值(基于潜在结果,但实际观测到的是 \( Y_i \) 而非 \( Y_i(z) \))。
  • \( \hat{\tau}_{\text{diff}} = \bar{Y}(1) - \bar{Y}(0) \):简单差分估计量。
  • \( \hat{\beta}_1, \hat{\beta}_0 \):基于处理组和对照组数据分别拟合的回归系数(用于协变量调整)。
  • \( \hat{\mu}_1(x) = x^\top \hat{\beta}_1 \)\( \hat{\mu}_0(x) = x^\top \hat{\beta}_0 \):拟合的回归函数。

  • 模型

  • 无模型。这是关键:本文不假设潜在结果 \( Y_i(1), Y_i(0) \) 与协变量 \( X_i \) 之间存在任何参数或非参数关系(如线性、稀疏性等)。唯一的结构来自随机化:处理分配 \( Z_i \) 是随机的,且与潜在结果独立(在有限总体中,这意味着 \( (Y_i(1), Y_i(0), X_i) \) 是固定的,随机性仅来自 \( Z_i \))。
  • 因此,这是一个设计-based(或随机化-based)推断框架,而非模型-based框架。

  • 可观测数据

  • 可观测\( \{(Z_i, X_i, Y_i)\}_{i=1}^N \),其中 \( Y_i = Z_i Y_i(1) + (1-Z_i) Y_i(0) \)
  • 不可观测:每个个体的反事实结果(\( Y_i(1) \) 对对照组个体,\( Y_i(0) \) 对处理组个体)。因此,\( \tau \) 本身是不可观测的,需要估计。
  • 关键识别假设:随机化本身保证了 \( \hat{\tau}_{\text{diff}} \)\( \tau \) 的无偏估计(在有限总体下,无偏性是对所有可能的随机化分配取期望)。协变量调整的目标是降低方差,同时保持(渐近)无偏性。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:p = 1(单个协变量),且协变量是二值的(如性别:男/女)

  • 设定\( N \) 个个体,每个个体有协变量 \( X_i \in \{0, 1\} \)(如 0=女,1=男)。完全随机化:\( N_1 \) 个处理,\( N_0 \) 个对照。
  • 目标:估计 \( \tau = \frac{1}{N} \sum_i [Y_i(1) - Y_i(0)] \)
  • 简单差分估计量\( \hat{\tau}_{\text{diff}} = \bar{Y}(1) - \bar{Y}(0) \)。其方差为 \( \text{Var}(\hat{\tau}_{\text{diff}}) = \frac{S_1^2}{N_1} + \frac{S_0^2}{N_0} - \frac{S_{10}^2}{N} \),其中 \( S_1^2, S_0^2 \) 是处理组和对照组潜在结果的有限总体方差,\( S_{10}^2 \) 是协方差(Neyman 1923)。这个方差可能很大,因为未控制性别差异。
  • 协变量调整的直觉:如果男性和女性的平均结果不同,那么处理组和对照组中性别比例的不平衡会引入额外的方差。通过回归调整,可以“扣除”这部分由性别不平衡引起的变异。
  • 本文的偏差校正估计量(在 p=1 特例下)
  • 分别拟合:在处理组中,用 \( X_i \)\( Y_i \) 做线性回归(无截距?有截距?),得到 \( \hat{\beta}_1 \);在对照组中类似得到 \( \hat{\beta}_0 \)
  • 构造调整估计量\( \hat{\tau}_{\text{adj}} = \hat{\tau}_{\text{diff}} - (\bar{X}(1) - \bar{X}(0))^\top (\hat{\beta}_1 + \hat{\beta}_0)/2 \)? 不,本文的估计量形式更复杂,但核心思想是:用回归系数来校正处理组和对照组协变量均值差异带来的偏差。
  • 偏差校正:当 p=1 时,\( \hat{\beta}_1 \)\( \hat{\beta}_0 \) 是相合的(因为 p 固定),所以 \( \hat{\tau}_{\text{adj}} \) 的偏差很小。但当 p 发散时,\( \hat{\beta}_1 \)\( \hat{\beta}_0 \) 本身有高维偏差,导致 \( \hat{\tau}_{\text{adj}} \) 有不可忽略的偏差。本文的贡献就是构造了一个校正项,来消除这个高维偏差
  • 这个特例揭示了什么:即使 p=1,协变量调整的收益也来自“扣除”协变量不平衡的影响。当 p 很大时,每个协变量都可能有不平衡,但高维回归估计本身会引入偏差,使得简单的“扣除”失效。本文的偏差校正项就是用来修复这个失效的。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在完全随机化实验中,当协变量个数 p 随样本量 N 发散(但 p/N → 0)时,如何构造一个仅依赖随机化设计(不假设结果模型正确)的 ATE 估计量,并证明其相合性和渐近正态性。
  2. 核心工具/方法:提出一个偏差校正估计量,其核心是构造一个基于无放回抽样集中不等式的校正项,用于消除高维线性回归调整带来的偏差。
  3. 主要结论:在仅假设潜在结果有界四阶矩的条件下,所提估计量是 \( \tau \) 的相合估计,且渐近正态,其渐近方差与“神谕”(oracle)估计量(即已知最优线性调整系数)的方差相同。同时给出了一个相合的标准误估计量。

关键设定与假设

  • 设定:有限总体(finite population),完全随机化实验(completely randomized experiment)。处理组样本量 \( N_1 \),对照组 \( N_0 \),总样本量 \( N = N_1 + N_0 \)。协变量 \( X_i \in \mathbb{R}^p \),p 随 N 发散,但 \( p/N \to 0 \)
  • 假设 1(随机化)\( (Z_1, \dots, Z_N) \) 均匀分布在所有满足 \( \sum_i Z_i = N_1 \) 的分配上。这是设计-based 推断的核心假设。
  • 假设 2(矩条件):存在常数 \( C > 0 \),使得对每个 \( i \)\( \mathbb{E}[Y_i^4(1)] \leq C \)\( \mathbb{E}[Y_i^4(0)] \leq C \),且 \( \|X_i\|_2 \leq C \)(协变量有界)。这比 Lin (2013) 要求的四阶矩条件更弱(Lin 要求结果变量的四阶矩,本文只要求潜在结果的四阶矩,且不要求协变量有界?实际上本文要求协变量有界,但这是为了技术证明的方便,可以放松)。
  • 假设 3(回归估计的相合性):存在一个基于 Lasso 或其他正则化方法的回归估计量 \( \hat{\beta}_1, \hat{\beta}_0 \),使得 \( \|\hat{\beta}_1 - \beta_1^*\|_2 = o_p(1) \)\( \|\hat{\beta}_0 - \beta_0^*\|_2 = o_p(1) \),其中 \( \beta_1^*, \beta_0^* \) 是某种“最优”线性预测系数(在有限总体中定义)。这是本文最关键的假设:它不要求 \( \beta_1^*, \beta_0^* \) 是“真实”的(即不要求结果模型是线性的),只要求存在某个线性预测器能很好地近似条件均值,且正则化方法能相合地估计它。相比 Bloniarz et al. (2016) 的稀疏性假设,这是一个显著放松
  • 相比已有文献的强化/放松
  • 放松:不假设结果模型线性或稀疏(vs. Bloniarz et al. 2016);不假设风险相合性(vs. Wager et al. 2016);对四阶矩的要求比 Lin (2013) 更弱。
  • 强化:要求协变量有界(vs. 许多高维文献允许次高斯或重尾);要求 p/N → 0(vs. Bloniarz et al. 允许 p > n,但需要超稀疏)。

主要结果

  • 定理 1(偏差校正估计量的相合性与渐近正态性)
  • 陈述:在假设 1-3 下,所提偏差校正估计量 \( \hat{\tau}_{\text{bc}} \) 满足 \( \sqrt{N}(\hat{\tau}_{\text{bc}} - \tau) \xrightarrow{d} N(0, V) \),其中 \( V \) 是渐近方差,其表达式由潜在结果和协变量的有限总体协方差结构决定。
  • 直觉:偏差校正项成功消除了高维回归调整带来的偏差,使得估计量在渐近意义上等价于“神谕”估计量(即已知最优线性调整系数时的估计量)。因此,其渐近方差与神谕方差相同,且不大于简单差分估计量的方差。
  • 必要条件:p/N → 0,且存在相合的回归估计量(假设 3)。
  • 解决的技术难点:高维回归调整的偏差通常以 \( p/N \) 的量级增长,当 p 发散时不可忽略。本文通过构造一个校正项,将偏差降低到 \( o_p(1/\sqrt{N}) \) 的量级,从而恢复渐近正态性。

  • 定理 2(相合的标准误估计)

  • 陈述:给出了一个基于“三明治”形式的标准误估计量 \( \hat{\text{se}}(\hat{\tau}_{\text{bc}}) \),并证明 \( \hat{\text{se}}(\hat{\tau}_{\text{bc}}) / \sqrt{V} \xrightarrow{p} 1 \)
  • 直觉:该标准误估计量是相合的,因此可以构造渐近有效的置信区间。
  • 技术难点:标准误的估计需要处理高维协方差矩阵的估计,本文利用随机化结构简化了这一问题。

证明路线与技术技巧

  • 整体路线(3-5 步逻辑主干):
  • 定义偏差校正估计量\( \hat{\tau}_{\text{bc}} = \hat{\tau}_{\text{diff}} - \text{校正项} \)。校正项的具体形式是 \( (\bar{X}(1) - \bar{X}(0))^\top (\hat{\beta}_1 + \hat{\beta}_0)/2 \) 加上一个额外的偏差校正项 \( \hat{B} \)
  • 分解偏差:将 \( \hat{\tau}_{\text{bc}} - \tau \) 分解为三部分:(a) 简单差分估计量的偏差(在有限总体下为 0),(b) 回归调整引入的偏差(来自 \( \hat{\beta}_1, \hat{\beta}_0 \) 的估计误差),(c) 偏差校正项 \( \hat{B} \)
  • 控制回归调整偏差:证明 (b) 部分可以写成 \( (\bar{X}(1) - \bar{X}(0))^\top (\hat{\beta}_1 - \beta_1^* + \hat{\beta}_0 - \beta_0^*)/2 \) 加上一个高阶项。由于 \( \bar{X}(1) - \bar{X}(0) = O_p(\sqrt{p/N}) \)(由随机化保证),而 \( \|\hat{\beta}_1 - \beta_1^*\|_2 = o_p(1) \),所以 (b) 的量级是 \( o_p(\sqrt{p/N}) \)。当 p/N → 0 时,这比 \( 1/\sqrt{N} \) 小,但还不够小(因为 p 发散,\( \sqrt{p/N} \) 可能比 \( 1/\sqrt{N} \) 大)。
  • 构造偏差校正项:关键步骤。校正项 \( \hat{B} \) 被设计为 \( (\bar{X}(1) - \bar{X}(0))^\top (\hat{\beta}_1 - \beta_1^* + \hat{\beta}_0 - \beta_0^*)/2 \) 的一个相合估计,使得 (b) + (c) 的量级降低到 \( o_p(1/\sqrt{N}) \)这是本文的核心技术贡献。校正项的构造依赖于对 \( \hat{\beta}_1 - \beta_1^* \) 的某种“去偏”估计,利用了无放回抽样的集中不等式。
  • 渐近正态性:在偏差被控制后,\( \hat{\tau}_{\text{bc}} - \tau \) 的主项是简单差分估计量减去一个可估计的协变量不平衡项,其渐近正态性可由有限总体中心极限定理(Li & Ding, 2016)得到。

  • 关键跳跃点

  • 最难的部分是构造偏差校正项 \( \hat{B} \)。难点在于:\( \beta_1^* \)\( \beta_0^* \) 是未知的,且 \( \hat{\beta}_1 - \beta_1^* \) 本身不可观测。作者巧妙地利用“样本分割”或“交叉拟合”的思想(但本文用的是另一种技巧),通过将样本随机分成两部分,用一部分估计 \( \hat{\beta} \),用另一部分估计 \( \hat{B} \),从而打破了 \( \hat{\beta} \)\( \bar{X}(1) - \bar{X}(0) \) 之间的相关性,使得校正项有效。
  • 另一个关键跳跃:证明校正项 \( \hat{B} \) 的方差足够小。这需要精细的集中不等式,特别是针对无放回抽样的向量和矩阵集中不等式(本文新发展的工具)。

  • 技术技巧点名

  • 无放回抽样的向量和矩阵集中不等式:本文新发展的核心技术工具。用于控制 \( \bar{X}(1) - \bar{X}(0) \) 的范数,以及校正项 \( \hat{B} \) 的方差。这是对 Tropp (2015) 和 Bardenet & Maillard (2013) 的推广和深化。
  • 样本分割(sample splitting):用于构造偏差校正项,打破估计量与数据之间的相关性。
  • 有限总体中心极限定理:Li & Ding (2016) 的结果,用于证明主项的渐近正态性。
  • Lasso 型正则化:用于在高维下获得相合的回归估计 \( \hat{\beta}_1, \hat{\beta}_0 \)。但本文的理论不依赖于 Lasso 的具体形式,只要求存在某种相合估计量。

真实例子与应用

本文为纯理论论文,无实证例子。 作者在引言中提到了模拟实验(simulation),但未在摘要或引言中给出具体结果。模拟实验的目的是验证理论结果(如有限样本下的覆盖概率),并比较所提方法与简单差分估计量、Bloniarz et al. (2016) 的 Lasso 调整估计量的表现。

🔎 结论是否比证明窄

  • 结论的陈述:作者声称所提估计量“在更弱的条件下”是相合和渐近正态的。这个“更弱”是相对于 Bloniarz et al. (2016) 的稀疏性假设而言的。
  • 证明的实际范围:证明依赖于假设 3(存在相合的回归估计量)。这个假设本身并不弱——它要求高维回归问题本身是可解的(即存在一个相合的估计量)。对于某些设计矩阵(如高度共线性的协变量),这个假设可能不成立。作者在文中讨论了 Lasso 在什么条件下满足假设 3(如限制特征值条件),但并未声称对所有情况都成立。
  • 值得注意的窄化:作者假设 p/N → 0,而 Bloniarz et al. (2016) 允许 p > n(在超稀疏下)。因此,本文的结论在“p 可以多大”这个问题上实际上更窄了。作者在引言中明确提到了这一点,将其定位为与 Bloniarz et al. (2016) 的不同设定。

四、开放问题

  1. p 与 N 同阶或 p > N 的情形:本文要求 p/N → 0。能否将结果推广到 p 与 N 成比例(p/N → c ∈ (0,1))甚至 p > N 的情形?这需要新的技术工具,因为无放回抽样的集中不等式在 p 很大时可能失效。扎根点:本文定理 1 的证明依赖于 p/N → 0 来控制偏差校正项的方差。

  2. 非线性调整:本文使用线性回归调整。能否推广到非线性调整(如使用神经网络、随机森林等)?这需要发展新的偏差校正技术,因为非线性模型的估计误差更难刻画。扎根点:本文的假设 3 要求存在相合的线性预测器,这限制了调整函数的形式。

  3. 更复杂的实验设计:本文只考虑完全随机化实验。能否将偏差校正思想推广到分层随机化、配对实验或整群随机化实验?扎根点:作者在引言中提到了 Middleton (2018) 和 Fogarty (2018) 对更复杂设计的回归调整理论,但未讨论高维扩展。

  4. 协变量选择后的推断:本文的估计量使用了所有 p 个协变量。如果研究者想先进行变量选择(如只选择与结果相关的协变量),再进行调整,那么选择后的推断问题如何解决?扎根点:本文未讨论 post-selection inference,而这是高维统计中一个活跃且相关的子领域。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论