跳转至

Efficient Covariate Balancing for the Local Average Treatment Effect

作者: Phillip Heiler
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在工具变量(IV)框架下,当存在双侧不依从(two-sided noncompliance)时,如何高效且稳健地估计局部平均处理效应(LATE)。核心挑战在于,传统的逆概率加权(IPW)估计量在有限样本中往往因权重不稳定或协变量不平衡而产生较大偏差和方差。当前成熟度:这是一个在计量经济学和因果推断中非常活跃的领域,已有大量关于IV估计的理论和方法,但针对有限样本下权重平衡的系统性方法仍是一个开放问题。

发展脉络(history)

  • 奠基工作:Imbens & Angrist (1994) 提出了LATE的概念,明确了在IV框架下,对于“依从者”(compliers)子群体,处理效应是可识别的。Angrist, Imbens & Rubin (1996) 进一步将潜在结果框架与IV结合,奠定了该领域的理论基础。
  • 主要进展:Abadie (2003) 提出了半参数LATE估计量,通过逆概率加权(IPW)来估计依从者的平均处理效应。Frolich (2007) 发展了非参数IV估计方法。这些工作主要关注识别和渐近性质,但有限样本下的权重不稳定问题并未得到充分解决。
  • 当前frontier:近年来,经验平衡(empirical balancing)方法在因果推断中兴起,如Imai & Ratkovic (2014) 的协变量平衡倾向得分(CBPS),以及Zubizarreta (2015) 的稳定平衡权重。这些方法通过直接优化协变量平衡来改进IPW估计。然而,它们主要针对无条件平均处理效应(ATE),而非IV设定下的LATE。
  • 本文的位置:本文是首次将经验平衡方法系统性地应用于IV框架下的LATE估计。作者指出,现有IV估计方法(如Abadie, 2003)在有限样本中可能因权重不稳定而产生较大偏差,而本文通过定制损失函数,在工具变量各水平组间实现精确有限样本平衡,从而降低偏差和方差。

子线索聚类

  1. IV估计与LATE识别:Imbens & Angrist (1994), Angrist, Imbens & Rubin (1996), Abadie (2003), Frolich (2007)。这一簇主要关注LATE的识别条件和半参数估计方法。
  2. 经验平衡方法:Imai & Ratkovic (2014), Zubizarreta (2015), Hainmueller (2012)。这一簇发展了一系列通过直接优化协变量平衡来改进IPW估计的方法,但主要针对ATE。
  3. 双重稳健估计:Robins, Rotnitzky & Zhao (1994), Bang & Robins (2005)。这一簇提出了结合倾向得分和结果回归的估计量,当其中一个模型正确时,估计量仍保持一致。本文也提出了双重稳健扩展版本。

这个方向在追问的核心问题

  1. 如何在IV设定下实现有限样本的协变量平衡? 现有经验平衡方法主要针对ATE,而IV设定下需要同时平衡工具变量各水平组间的协变量分布。
  2. 如何利用处理选择步骤的额外信息来进一步降低偏差? 在双侧不依从场景中,处理选择(即是否依从)本身提供了关于协变量分布的信息,如何有效利用这些信息是一个开放问题。
  3. 如何保证估计量的半参数效率? 在IV设定下,LATE的半参数效率界是什么?如何构造达到该效率界的估计量?
  4. 如何实现双重稳健性? 当倾向得分模型或结果回归模型之一被错误指定时,估计量是否仍保持一致?

⚠️ 作者的framing

作者将缺口frame成:现有IV估计方法(如Abadie, 2003)在有限样本中因权重不稳定而产生较大偏差,而本文通过经验平衡方法可以同时降低偏差和方差。作者淡化了以下竞争路线: - 非参数IV方法(如Frolich, 2007):作者认为这些方法在有限样本中可能因维数灾难而表现不佳,但并未在文中进行详细比较。 - 基于机器学习的IV估计(如Athey, Imbens & Wager, 2018):作者未提及这些方法,可能是因为它们主要关注异质性处理效应,而非LATE的估计效率。

值得研究者去查的问题:本文未引用任何关于“局部工具变量”(local IV)或“工具变量与协变量交互”的工作,这些工作可能对理解本文方法的适用性有重要意义。此外,本文未讨论多工具变量或多处理水平的情况,这些是实际应用中常见的场景。

张力

未见明显对立引用。所有被引工作基本在同一个框架下(潜在结果、IV、LATE),彼此之间是互补而非矛盾的关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( Z \in \{0,1\} \):二元工具变量(instrumental variable)。 - \( D \in \{0,1\} \):二元处理变量(treatment)。 - \( Y \in \mathbb{R} \):结果变量(outcome)。 - \( X \in \mathbb{R}^p \):协变量向量(covariates),\( p \) 为维数。 - \( D(z) \):当 \( Z = z \) 时的潜在处理状态(potential treatment)。 - \( Y(d) \):当 \( D = d \) 时的潜在结果(potential outcome)。 - \( C \):依从类型(compliance type),\( C = a \)(always-taker,总是接受处理),\( C = n \)(never-taker,从不接受处理),\( C = c \)(complier,依从者),\( C = d \)(defier,违抗者)。 - \( \pi_z(x) = \mathbb{P}(Z = 1 \mid X = x) \):工具变量倾向得分(instrument propensity score)。 - \( \tau = \mathbb{E}[Y(1) - Y(0) \mid C = c] \):局部平均处理效应(LATE),即依从者的平均处理效应。 - \( w_i \):个体 \( i \) 的权重。 - \( n \):样本量。

模型: - 数据生成机制:假设存在一个潜在结果框架,其中 \( (Y, D, Z, X) \) 是从某个联合分布中独立同分布抽取的。 - 关键假设: 1. 独立性\( Z \perp (Y(0), Y(1), D(0), D(1)) \mid X \)。 2. 排他性\( Z \) 仅通过 \( D \) 影响 \( Y \)。 3. 单调性\( D(1) \geq D(0) \)(即不存在defier)。 4. 第一阶段的非零效应\( \mathbb{E}[D \mid Z = 1, X] \neq \mathbb{E}[D \mid Z = 0, X] \)。 - 这些假设共同保证了LATE的可识别性。

可观测数据: - 研究者实际能观测到的是 \( (Y_i, D_i, Z_i, X_i) \)\( n \) 个独立同分布样本。 - 不可观测的是潜在结果 \( Y_i(0), Y_i(1) \) 和依从类型 \( C_i \)。这些只能通过假设和IV结构来识别。

第二步:讲最小内核

最简特例:假设 \( p = 1 \)(只有一个协变量 \( X \)),且 \( X \) 是二值的(例如,\( X \in \{0, 1\} \))。同时,假设工具变量 \( Z \) 是随机分配的(即 \( \pi_z(x) = 0.5 \) 对所有 \( x \) 成立)。在这个特例下,LATE的估计问题退化为一个简单的加权平均问题。

核心思路:本文的核心思想是,通过选择权重 \( w_i \),使得在工具变量各水平组(\( Z = 0 \)\( Z = 1 \))之间,协变量 \( X \) 的分布被精确平衡。具体来说,我们希望找到一组权重,使得:

\[\sum_{i: Z_i = 1} w_i X_i = \sum_{i: Z_i = 0} w_i X_i\]
同时,权重 \( w_i \) 应满足归一化条件(即 \( \sum_{i: Z_i = 1} w_i = \sum_{i: Z_i = 0} w_i = 1 \))。

为什么这能估计LATE? 在IV设定下,LATE的识别依赖于工具变量 \( Z \) 对处理 \( D \) 的“外生”影响。通过平衡协变量 \( X \),我们确保了 \( Z \) 在给定 \( X \) 的条件下是“条件随机”的,从而可以识别依从者的平均处理效应。具体地,LATE的估计量可以写成:

\[\hat{\tau} = \frac{\sum_{i: Z_i = 1} w_i Y_i - \sum_{i: Z_i = 0} w_i Y_i}{\sum_{i: Z_i = 1} w_i D_i - \sum_{i: Z_i = 0} w_i D_i}\]
这个公式是Wald估计量的加权版本。当权重 \( w_i \) 平衡了协变量 \( X \) 时,分子和分母分别估计了 \( Z \)\( Y \)\( D \) 的“条件平均”效应,从而得到LATE的一致估计。

本文的关键想法:作者不是直接求解上述平衡方程(这通常会导致权重不稳定),而是通过一个定制化的损失函数来估计工具变量倾向得分 \( \pi_z(x) \),使得权重 \( w_i = 1 / \pi_z(X_i) \) 自动满足平衡条件。具体地,作者使用一个指数族损失函数,其梯度恰好是协变量平衡条件。这样,权重估计和平衡优化被统一在一个框架中。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在二元工具变量下双侧不依从场景中,如何通过经验平衡方法高效估计局部平均处理效应(LATE)。
  2. 核心工具/方法:提出了一种定制化的损失函数来估计工具变量倾向得分,使得逆概率权重自动实现协变量平衡,并给出了渐近正态性和半参数效率的条件。
  3. 主要结论:该方法在有限样本中比传统IPW方法具有更低的偏差和方差,且可以扩展到双重稳健版本。

关键设定与假设

  • 设定:二元工具变量 \( Z \),二元处理 \( D \),连续结果 \( Y \),协变量 \( X \in \mathbb{R}^p \)
  • 假设
  • 独立性\( Z \perp (Y(0), Y(1), D(0), D(1)) \mid X \)。这是IV识别的基础。
  • 排他性\( Z \) 仅通过 \( D \) 影响 \( Y \)。这是IV有效性的核心。
  • 单调性\( D(1) \geq D(0) \)。这排除了defier,简化了LATE的识别。
  • 第一阶段的非零效应\( \mathbb{E}[D \mid Z = 1, X] \neq \mathbb{E}[D \mid Z = 0, X] \)。这保证了工具变量对处理有影响。
  • 重叠性\( 0 < \mathbb{P}(Z = 1 \mid X) < 1 \) 对所有 \( X \) 成立。这保证了权重的稳定性。
  • 相比已有文献:本文的假设与Abadie (2003) 基本一致,但本文通过经验平衡方法放松了对倾向得分模型正确指定的依赖。

主要结果

  • 定理1(渐近正态性):在正则条件下,本文提出的经验平衡LATE估计量 \( \hat{\tau} \)\( \sqrt{n} \)-一致且渐近正态的。具体地,\( \sqrt{n}(\hat{\tau} - \tau) \xrightarrow{d} N(0, V) \),其中 \( V \) 是半参数效率界。
  • 定理2(半参数效率):当工具变量倾向得分模型被正确指定时,本文的估计量达到半参数效率界。这意味着在渐近意义上,没有其他正则估计量可以具有更小的方差。
  • 定理3(双重稳健性):本文提出的双重稳健扩展版本,当倾向得分模型或结果回归模型之一被正确指定时,估计量仍保持一致。这增强了方法的稳健性。

证明路线与技术技巧

整体路线: 1. 第一步:定义损失函数。作者定义了一个指数族损失函数 \( \ell(\beta; Z, X) \),其梯度 \( \nabla \ell(\beta; Z, X) \) 恰好是协变量平衡条件。通过最小化这个损失函数,得到工具变量倾向得分的估计 \( \hat{\pi}_z(x) \)。 2. 第二步:构造权重。权重 \( w_i = 1 / \hat{\pi}_z(X_i) \) 被用于构造LATE的加权Wald估计量。 3. 第三步:建立渐近理论。作者利用M-估计理论,证明了 \( \hat{\beta} \)\( \sqrt{n} \)-一致性和渐近正态性,进而推导出 \( \hat{\tau} \) 的渐近分布。 4. 第四步:证明半参数效率。作者计算了LATE的influence function,并证明了本文的估计量是渐近线性的,其influence function与半参数效率界一致。 5. 第五步:双重稳健扩展。作者将结果回归模型纳入估计框架,构造了双重稳健估计量,并证明了其一致性。

关键跳跃点: - 损失函数的设计:如何确保损失函数的梯度恰好是协变量平衡条件?作者使用了指数族分布(如逻辑回归)的似然函数,其得分函数(score function)自然包含了协变量与工具变量的交互项。通过调整损失函数的形式,作者使得最小化损失函数等价于求解协变量平衡方程。 - 半参数效率的证明:作者需要证明,在IV设定下,LATE的半参数效率界可以通过本文的估计量达到。这需要计算LATE的efficient influence function,并证明本文的估计量是渐近线性的,其influence function与效率界一致。作者通过将估计量表示为U-统计量的形式,并利用经验过程理论完成了证明。

技术技巧点名: - M-估计理论:用于证明 \( \hat{\beta} \) 的渐近性质。 - 经验过程理论:用于处理估计量中涉及的非参数成分。 - Influence function:用于计算半参数效率界和证明渐近线性性。 - U-统计量:用于处理估计量中的双重求和形式。

真实例子与应用

本文包含一个真实数据例子,使用国家支持工作(NSW)项目的数据来评估培训项目对收入的影响。在这个例子中,工具变量是随机分配(是否被邀请参加培训),处理是实际参加培训,结果是收入。由于存在不依从(有些人被邀请但未参加,有些人未被邀请但参加了),这是一个典型的双侧不依从场景。作者将本文的方法应用于该数据,并与传统IPW方法和Abadie (2003) 的估计量进行比较。结果表明,本文的方法在有限样本中具有更低的偏差和更小的方差,且估计结果更稳定。

🔎 结论是否比证明窄

  • 结论:作者声称方法“自动实现精确有限样本平衡”。但严格来说,这种平衡是在估计的倾向得分下实现的,而非真正的倾向得分。当倾向得分模型被错误指定时,平衡可能不精确。作者在定理3中通过双重稳健性部分解决了这个问题,但并未完全消除模型错误指定的风险。
  • 窄结论:作者在定理1和2中假设倾向得分模型被正确指定。在实际应用中,这一假设可能不成立。作者在文中提到“通过使用灵活的函数形式(如多项式或样条)可以缓解模型错误指定”,但这并非严格证明。

四、开放问题

  1. 多工具变量或多处理水平:本文仅考虑二元工具变量和二元处理。当存在多个工具变量或多个处理水平时,如何扩展经验平衡方法?这需要重新定义平衡条件和损失函数。扎根点:本文的设定明确限定为“二元工具变量”和“二元处理”,作者在结论部分提到“扩展到多值处理是未来工作”。
  2. 高维协变量:当协变量维数 \( p \) 较大时,经验平衡方法可能面临维数灾难。如何在高维设定下实现有效的平衡?扎根点:本文的模拟中 \( p \) 较小(\( p = 5 \)),作者未讨论高维情况。
  3. 弱工具变量:当工具变量较弱时,LATE的估计可能不稳定。本文的方法在弱工具变量下表现如何?扎根点:本文的假设4要求第一阶段的非零效应,但未讨论弱工具变量的情况。
  4. 与机器学习方法的结合:本文使用参数模型估计倾向得分。如何将机器学习方法(如随机森林、神经网络)与经验平衡结合,以处理更复杂的协变量结构?扎根点:作者在结论部分提到“可以使用更灵活的模型”,但未给出具体方法。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论