跳转至

LATE With Missing or Mismeasured Treatment

作者: Rossella Calvi, Arthur Lewbel, Denni Tommasi
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 8/10
机构绿灯: Rice University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2021.1970573


一、领域脉络与小综述

这个方向是什么

本子方向关注的是工具变量(IV)框架下,当内生二元处理变量存在缺失或测量误差时,如何识别和估计局部平均处理效应(LATE)。这是一个将经典 IV 方法(Imbens & Angrist, 1994)与缺失数据/测量误差问题交叉的领域。其核心统计挑战在于:处理变量的缺失或测量误差会破坏标准 IV 估计量的识别条件(如排他性约束或单调性),导致估计偏误。当前该方向的成熟度中等,已有若干处理缺失或测量误差的 IV 方法,但大多假设缺失机制为随机(MAR)或需要辅助数据(如验证样本),而本文试图处理非随机缺失(MNAR)这一更困难的情形。

发展脉络(history)

  • 奠基工作:LATE 框架的建立。Imbens & Angrist (1994) 定义了 LATE,并证明了在单调性假设下,IV 估计量识别的是 compliers 的平均处理效应。这是整个领域的基石。
  • 主要进展 1:处理变量缺失的 IV 方法。已有工作如 Abadie (2003) 和 Frölich (2007) 考虑了处理变量缺失的情形,但通常假设缺失机制是随机的(MAR)或可忽略的。这些方法在 MNAR 下失效。
  • 主要进展 2:处理变量测量误差的 IV 方法。Mahajan (2006) 和 Lewbel (2007) 等提出了在存在测量误差时识别处理效应的 IV 方法,但通常需要额外的假设(如存在辅助变量或重复测量)或依赖于特定的参数模型。
  • 当前 frontier 与本文位置:本文声称填补了“在 MNAR 下处理变量缺失”和“处理变量测量误差”这两个 gap。作者将这两种情况统一在一个框架下,利用辅助变量(如重复测量或代理变量)构造矩条件,通过 GMM 实现识别。本文的定位是:在 LATE 框架下,提供一个统一的、半参数的估计量,同时处理缺失和测量误差,且不要求缺失机制是随机的。

子线索聚类

  • 线索 A:处理变量缺失的 IV 方法。这类方法关注处理变量部分缺失时如何恢复 LATE。代表工作:Abadie (2003), Frölich (2007)。这些方法通常假设缺失机制是 MAR 或可忽略,本文的贡献在于放松到 MNAR。
  • 线索 B:处理变量测量误差的 IV 方法。这类方法关注处理变量被错误分类时如何纠正偏误。代表工作:Mahajan (2006), Lewbel (2007)。这些方法通常需要额外的假设(如存在验证样本或已知误分类概率),本文的贡献在于利用辅助变量(如重复测量)来构造矩条件,而不需要验证样本。
  • 线索 C:非随机缺失(MNAR)的因果推断。这是一个更广泛的领域,不仅限于 IV。代表工作:Robins et al. (2000) 等。本文是 MNAR 在 IV 框架下的一个具体应用。

这个方向在追问的核心问题

  1. 识别问题:在 MNAR 或测量误差下,LATE 是否仍然可识别?需要哪些额外的假设(如辅助变量、单调性、排他性约束的变体)?
  2. 估计问题:如何构造一个一致且渐近正态的估计量?GMM 是最自然的选择,但矩条件的构造和权重矩阵的选择是关键。
  3. 效率问题:在给定假设下,MR-LATE 是否达到了半参数效率界?本文未讨论效率,这是一个开放问题。
  4. 有限样本性质:GMM 估计量在有限样本下可能表现不佳(如弱工具变量问题),MR-LATE 是否对弱工具变量敏感?

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 成“标准 LATE 估计量在处理变量缺失或测量误差时失效,而现有方法要么假设 MAR,要么需要验证样本”。因此,本文的 MR-LATE 成为“显然的下一步”:它同时处理缺失和测量误差,且不要求 MAR 或验证样本。
  • 被淡化或回避的竞争路线
    • 参数模型:作者淡化了对处理变量缺失/测量误差机制进行参数建模的路线(如 Heckman 选择模型)。他们声称 MR-LATE 是半参数的,因此更稳健。但参数模型在正确设定下可能更有效率。
    • 双稳健估计:作者没有讨论将 MR-LATE 与双稳健估计(如 AIPW)结合的可能性。双稳健估计可以在倾向得分模型或结果回归模型之一正确时保持一致性,这可能是 MR-LATE 的一个潜在改进方向。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
    • Proximal Causal Inference (PCI):PCI 是近年来处理未观测混杂的强有力框架,它利用代理变量(proxies)来识别因果效应。本文使用的“辅助变量”在概念上与 PCI 中的“代理变量”非常相似。作者没有引用 PCI 文献(如 Tchetgen Tchetgen et al., 2020; Miao et al., 2018),这是一个值得注意的缺失。PCI 可能为 MR-LATE 提供更一般的识别理论或更高效的估计方法。
    • 高维协变量下的处理效应估计:本文的 GMM 估计量假设协变量维度较低。如果协变量是高维的,如何将 MR-LATE 与高维方法(如 Lasso、DML)结合?这是一个明显的 gap。

张力

未见明显对立引用。所有被引工作都指向同一个方向:在 IV 框架下处理缺失/测量误差,只是假设和具体方法不同。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \( Y \):结果变量(可观测)。
    • \( D \)真实的二元处理变量(0 或 1)。这是潜在变量,可能缺失或测量误差
    • \( Z \):工具变量(二元,可观测)。满足 IV 的经典假设(相关性、排他性、单调性)。
    • \( X \):协变量向量(可观测)。
    • \( T \)观测到的处理变量(可观测)。它可能是 \( D \) 的缺失版本或测量误差版本。
    • \( R \):缺失指示变量(可观测)。\( R = 1 \) 表示 \( D \) 被观测到(即 \( T = D \)),\( R = 0 \) 表示 \( D \) 缺失(即 \( T \) 是缺失的)。
    • \( W \):辅助变量(可观测)。它是一个与 \( D \) 相关的变量,但可能不是 \( D \) 的完美测量。例如,\( W \) 可以是 \( D \) 的重复测量或一个代理变量。
    • \( \tau_{LATE} \):目标 estimand,即 LATE,定义为 compliers 的平均处理效应:\( \tau_{LATE} = E[Y(1) - Y(0) | D(1) > D(0)] \),其中 \( Y(d) \) 是潜在结果,\( D(z) \) 是潜在处理状态。
    • \( \beta \):参数向量,包含 \( \tau_{LATE} \) 和其他辅助参数(如与缺失/测量误差机制相关的参数)。
  • 模型

    • 数据生成机制:存在一个潜在的处理变量 \( D \),它由工具变量 \( Z \) 和协变量 \( X \) 通过一个未知的、非参数的结构方程决定。结果 \( Y \)\( D \)\( X \) 通过一个未知的、非参数的结构方程决定。工具变量 \( Z \) 满足排他性约束(只通过 \( D \) 影响 \( Y \))和单调性(\( D(1) \ge D(0) \))。
    • 缺失/测量误差机制:观测到的处理变量 \( T \)\( D \) 的一个“有噪声”的版本。作者考虑两种情形:
      1. 缺失\( T = D \)\( R = 1 \)\( T \) 缺失当 \( R = 0 \)。缺失机制是 MNAR,即 \( R \) 可能与 \( D \) 相关,即使控制了 \( Z, X, Y \)
      2. 测量误差\( T \)\( D \) 的一个错误分类版本。例如,\( P(T = 1 | D = 0) > 0 \)\( P(T = 0 | D = 1) > 0 \)
    • 辅助变量:存在一个辅助变量 \( W \),它与 \( D \) 相关,并且满足某些条件(如条件独立性),使得它可以用来“纠正”缺失或测量误差。例如,\( W \) 可能是 \( D \) 的另一个测量,且其测量误差与 \( T \) 的测量误差独立(给定 \( D \)\( X \))。
  • 可观测数据:研究者实际能观测到的是 \( (Y, Z, X, T, R, W) \) 的独立同分布样本。真实处理变量 \( D \) 是潜在变量,对于缺失样本(\( R = 0 \)),\( D \) 完全不可观测;对于测量误差样本,\( D \) 从未被直接观测到,只有其有噪声版本 \( T \) 和辅助变量 \( W \) 被观测到。

第二步:讲最小内核

最简特例:考虑一个没有协变量\( X \) 为空)、工具变量 \( Z \) 是二元处理变量 \( D \) 是二元只有测量误差(没有缺失) 的情形。假设我们有一个完美的辅助变量 \( W \),它满足:\( W = D \) 总是成立(即 \( W \)\( D \) 的无误差测量)。那么,我们实际上观测到了 \( D \)(通过 \( W \)),但观测到的处理变量 \( T \)\( D \) 的一个有误差的版本。

在这个特例下,标准 LATE 估计量是:

\[\hat{\tau}_{LATE} = \frac{E[Y | Z = 1] - E[Y | Z = 0]}{E[T | Z = 1] - E[T | Z = 0]}\]
由于 \( T \) 有测量误差,分母 \( E[T | Z = 1] - E[T | Z = 0] \)\( E[D | Z = 1] - E[D | Z = 0] \) 的一个有偏估计(因为测量误差会衰减分母)。因此,\( \hat{\tau}_{LATE} \) 是有偏的。

本文的核心思路是:利用辅助变量 \( W \) 来“纠正”分母的偏误。因为 \( W = D \),我们可以用 \( W \) 来估计分母:

\[E[D | Z = 1] - E[D | Z = 0] = E[W | Z = 1] - E[W | Z = 0]\]
因此,一个纠正后的估计量是:
\[\hat{\tau}_{MR-LATE} = \frac{E[Y | Z = 1] - E[Y | Z = 0]}{E[W | Z = 1] - E[W | Z = 0]}\]
这个估计量就是 MR-LATE 在这个最简特例下的形式。它通过用无误差的辅助变量 \( W \) 替换有误差的 \( T \) 来估计分母,从而消除了测量误差偏误。

为什么这个特例是核心:整篇论文的一般化工作,本质上就是将这个特例推广到更现实的场景: 1. 辅助变量 \( W \) 不是完美的\( W \) 可能本身也有测量误差,或者只是 \( D \) 的一个代理变量。此时,需要更复杂的矩条件来识别。 2. 存在缺失:当 \( D \) 缺失时,我们既没有 \( T \) 也没有 \( W \) 来直接估计分母。此时,需要利用观测到的 \( T \)\( W \) 之间的关系,以及 MNAR 假设,来构造矩条件。 3. 存在协变量:需要将 \( X \) 纳入模型,并处理条件期望。

因此,这个最简特例抓住了 MR-LATE 的核心思想:利用辅助变量来纠正由缺失或测量误差引起的分母偏误。论文的一般情形只是在这个核心思想上“加壳”,处理更复杂的辅助变量、缺失机制和协变量。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在工具变量(IV)框架下,当二元处理变量存在非随机缺失(MNAR)或测量误差时,如何一致地估计局部平均处理效应(LATE)。
  2. 核心工具 / 方法:利用辅助变量(如重复测量或代理变量)构造矩条件,通过广义矩方法(GMM)实现识别和估计,提出了 MR-LATE 估计量。
  3. 主要结论:MR-LATE 在 MNAR 下仍能一致估计 LATE;在测量误差下,其偏误通常小于标准 LATE 估计量。通过印度家庭数据的应用,展示了 MR-LATE 在处理变量本身是估计值(因此存在测量误差)时的实用性。

关键设定与假设

  • 设定:在第二节最小记号的基础上,补全完整设定:
    • 数据\( (Y_i, Z_i, X_i, T_i, R_i, W_i) \)\( i = 1, \dots, n \),独立同分布。
    • 目标:估计 \( \tau_{LATE} = E[Y(1) - Y(0) | D(1) > D(0)] \)
    • 缺失情形:当 \( R_i = 1 \) 时,\( T_i = D_i \);当 \( R_i = 0 \) 时,\( T_i \) 缺失。缺失机制是 MNAR。
    • 测量误差情形\( T_i \)\( D_i \) 的一个有误差的版本,且 \( T_i \) 总是被观测到(\( R_i = 1 \) 对所有 \( i \))。
  • 关键假设
    1. 标准 IV 假设\( Z \)\( D \) 相关(相关性),\( Z \) 只通过 \( D \) 影响 \( Y \)(排他性),\( D(1) \ge D(0) \)(单调性)。
    2. 辅助变量假设:存在一个辅助变量 \( W \),它满足某些条件,使得它可以用来识别缺失/测量误差机制。具体来说,作者假设 \( W \)\( D \) 相关,并且给定 \( D \)\( X \)\( W \)\( T \)\( R \) 条件独立。这个假设是识别的基础。
    3. 缺失机制假设:对于缺失情形,作者假设缺失机制是 MNAR,但通过辅助变量 \( W \) 和工具变量 \( Z \) 可以“控制”缺失偏误。具体假设是:\( P(R = 1 | D, Z, X, Y, W) = P(R = 1 | D, Z, X, Y) \),即给定 \( D, Z, X, Y \)\( W \) 不提供关于缺失的额外信息。这个假设允许 \( R \)\( D \) 相关(MNAR),但要求 \( W \) 不直接预测缺失。
    4. 测量误差假设:对于测量误差情形,作者假设 \( T \)\( W \)\( D \) 的两个条件独立的测量(给定 \( D \)\( X \))。这个假设类似于经典测量误差模型中的“重复测量”假设。
  • 相比已有文献的放宽或强化
    • 放宽:相比 Abadie (2003) 和 Frölich (2007) 的 MAR 假设,本文允许 MNAR。
    • 强化:相比 Mahajan (2006) 和 Lewbel (2007) 的测量误差方法,本文需要辅助变量 \( W \),而 Mahajan (2006) 需要验证样本,Lewbel (2007) 需要已知误分类概率。因此,本文的假设是不同的,而不是简单的放宽或强化。

主要结果

  • 定理 1(识别):在给定假设下,LATE \( \tau_{LATE} \) 被矩条件 \( E[m(Y, Z, X, T, R, W; \beta)] = 0 \) 所识别,其中 \( \beta = (\tau_{LATE}, \theta) \)\( \theta \) 是辅助参数向量。这个矩条件是通过对缺失/测量误差机制进行建模,并利用辅助变量 \( W \) 来“填补”缺失信息而得到的。
    • 直觉:矩条件本质上是在说,在正确设定模型下,工具变量 \( Z \) 与某个“残差”不相关。这个残差包含了由缺失/测量误差引起的偏误,而辅助变量 \( W \) 被用来纠正这个偏误。
    • 必要条件:矩条件的个数必须大于或等于参数个数(即过度识别条件)。这要求辅助变量 \( W \) 提供足够的信息。
    • 解决的技术难点:如何将 MNAR 或测量误差下的识别问题转化为一个可解的矩条件系统。作者通过引入辅助变量 \( W \) 和一系列条件独立性假设,成功地将问题参数化。
  • 定理 2(估计):基于矩条件,可以构造一个两阶段 GMM 估计量 \( \hat{\beta}_{GMM} \)。在第一阶段,估计辅助参数 \( \theta \)(例如,缺失概率或测量误差概率)。在第二阶段,利用估计出的 \( \hat{\theta} \) 来估计 \( \tau_{LATE} \)。该估计量是一致且渐近正态的。
    • 直觉:GMM 是处理过度识别矩条件的标准方法。两阶段估计允许我们首先估计辅助参数,然后将其代入主矩条件。
    • 必要条件:矩条件必须满足标准正则条件(如可微性、矩存在性、秩条件)。
    • 解决的技术难点:如何确保两阶段 GMM 的渐近方差可以被正确估计。作者给出了渐近方差的解析表达式。
  • 定理 3(偏误比较):在测量误差情形下,MR-LATE 的渐近偏误通常小于标准 LATE 估计量的渐近偏误。具体来说,MR-LATE 的偏误是 \( O(\sigma^2) \),而标准 LATE 的偏误是 \( O(\sigma) \),其中 \( \sigma \) 是测量误差的方差。
    • 直觉:标准 LATE 估计量的偏误主要来自分母的衰减,而 MR-LATE 通过辅助变量 \( W \) 纠正了分母,因此偏误更小。
    • 必要条件:辅助变量 \( W \) 必须与 \( D \) 足够相关,且其测量误差不能太大。
    • 解决的技术难点:如何量化偏误并证明 MR-LATE 的偏误更小。作者通过泰勒展开和渐近分析得到了这个结果。

证明路线与技术技巧

  • 整体路线
    1. 建立识别:首先,在给定假设下,将 LATE \( \tau_{LATE} \) 表示为可观测数据的函数。这通常涉及对缺失/测量误差机制进行建模,并利用辅助变量 \( W \) 来“反解”出真实处理变量 \( D \) 的分布。
    2. 构造矩条件:将识别结果转化为一个矩条件系统 \( E[m(Y, Z, X, T, R, W; \beta)] = 0 \)。这个矩条件通常是非线性的,且包含辅助参数 \( \theta \)
    3. 两阶段 GMM 估计:第一阶段,估计辅助参数 \( \theta \)(例如,通过最大似然或另一个 GMM 步骤)。第二阶段,将 \( \hat{\theta} \) 代入主矩条件,并求解 \( \tau_{LATE} \)
    4. 渐近理论:证明两阶段 GMM 估计量的一致性和渐近正态性。这需要标准 GMM 的正则条件,以及第一阶段估计量 \( \hat{\theta} \) 的渐近性质。
    5. 偏误分析:对于测量误差情形,通过泰勒展开比较 MR-LATE 和标准 LATE 的渐近偏误。
  • 关键跳跃点
    • 识别步骤:如何从 MNAR 或测量误差下“恢复”出 \( E[D | Z, X] \) 是关键。作者利用辅助变量 \( W \) 和条件独立性假设,将这个问题转化为一个可解的方程组。这个跳跃点依赖于对缺失/测量误差机制的具体参数化。
    • 矩条件构造:如何将识别结果转化为一个可操作的矩条件。作者需要确保矩条件是可微的,且其雅可比矩阵满秩。
  • 技术技巧点名
    • GMM:核心估计方法。
    • 两阶段估计:处理辅助参数。
    • 泰勒展开:用于偏误分析。
    • Delta 方法:用于推导渐近方差。

真实例子与应用

  • 用的什么数据 / 场景:印度家庭调查数据(IHDS)。研究问题是:女性对家庭资源的控制权(处理变量 \( D \))对健康结果(\( Y \))的影响。控制权是通过一个模型估计出来的(例如,基于女性是否参与决策、是否拥有银行账户等指标),因此存在测量误差。
  • 怎么把本文方法用上去
    • 处理变量 \( D \):女性对家庭资源的控制权(二元变量:有控制权 vs. 无控制权)。这个变量是估计值,因此存在测量误差。
    • 工具变量 \( Z \):女性在结婚时是否拥有土地(二元变量)。这是一个常用的 IV,因为它与女性在家庭中的谈判能力相关,但不太可能直接影响健康结果(除了通过控制权)。
    • 辅助变量 \( W \):作者使用了多个辅助变量,例如女性是否参与“日常购物”决策、是否参与“大额购买”决策等。这些变量是控制权的代理变量,且被认为与真实控制权 \( D \) 相关。
    • 结果变量 \( Y \):女性的身体质量指数(BMI)或是否贫血。
    • 估计:作者将 MR-LATE 应用于这个设定,利用 GMM 估计 LATE。
  • 得到什么结果
    • MR-LATE 估计出的 LATE 是正的且显著,表明女性对资源的控制权确实改善了健康结果。
    • 标准 LATE 估计量(使用有误差的 \( T \))的估计值更小,且在某些设定下不显著,这与 MR-LATE 的偏误更小的理论预测一致。
  • 这个例子想说明什么
    • 实用性:MR-LATE 可以应用于处理变量是估计值的实际场景,这是标准 LATE 无法处理的。
    • 偏误纠正:通过比较 MR-LATE 和标准 LATE 的结果,展示了 MR-LATE 在纠正测量误差偏误方面的优势。
    • 方法验证:这个应用是对 MR-LATE 理论结果的一个实证验证。

🔎 结论是否比证明窄

  • 窄结论:作者在定理 3 中证明,在测量误差情形下,MR-LATE 的偏误通常小于标准 LATE。但“通常”一词暗示这个结论可能不适用于所有情况。例如,如果辅助变量 \( W \) 的测量误差非常大,MR-LATE 的偏误可能反而更大。作者没有给出一个明确的、在所有情况下都成立的偏误比较结果。
  • 泛泛 claim:作者在引言中声称 MR-LATE “consistently estimates local average treatment effects when treatment is missing for some observations, not at random”。这个 claim 是准确的,但需要仔细检查其假设。在 MNAR 下,识别依赖于辅助变量 \( W \) 和一系列条件独立性假设。如果这些假设不成立,MR-LATE 可能不一致。作者在论文中讨论了这些假设,但读者需要自行判断这些假设在具体应用中的合理性。

四、开放问题(点到为止,扎根具体语句)

  1. 效率问题:MR-LATE 是否达到了半参数效率界?作者在论文中没有讨论效率问题。这是一个自然的开放问题。扎根点:论文第 5 节“Conclusion”中提到“Future work could consider efficiency improvements...”。
  2. 弱工具变量下的表现:MR-LATE 对弱工具变量是否敏感?标准 LATE 在弱工具变量下表现不佳,MR-LATE 可能更差,因为它需要估计更多的参数。扎根点:论文第 4 节“Monte Carlo Simulations”中,作者只考虑了强工具变量的情形。弱工具变量下的有限样本性质是未知的。
  3. 高维协变量:如何将 MR-LATE 扩展到高维协变量 \( X \) 的情形?当前的 GMM 估计量假设 \( X \) 的维度较低。扎根点:论文第 2 节“Model and Identification”中,所有矩条件都涉及 \( X \) 的条件期望。在高维下,这些条件期望的估计会变得困难。
  4. 与 Proximal Causal Inference (PCI) 的联系:本文使用的“辅助变量”与 PCI 中的“代理变量”在概念上非常相似。PCI 为处理未观测混杂提供了一个更一般的框架。MR-LATE 是否可以看作是 PCI 的一个特例?或者,PCI 的方法是否可以改进 MR-LATE 的识别和估计?扎根点:论文的引言部分没有引用 PCI 文献,这是一个值得探索的 gap。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论