跳转至

High-Dimensional Model-Assisted Inference for Local Average Treatment Effects With Instrumental Variables

作者: Baoluo Sun, Zhiqiang Tan
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 9/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在工具变量(IV)模型中,当存在大量协变量(高维)时,如何对局部平均处理效应(LATE)进行有效的统计推断(点估计和置信区间)。其核心挑战在于,需要同时估计多个高维回归模型(工具变量倾向得分、处理回归、结果回归),而传统的两步法或双稳健方法在高维下会因正则化偏差(regularization bias)导致推断失效。当前该领域的成熟度处于“方法已提出但假设仍较强”的阶段,主要瓶颈在于如何放松对多个模型同时正确设定的要求。

发展脉络(history)

  • 奠基工作:IV与LATE的识别。Angrist, Imbens, and Rubin (1996) 和 Imbens and Angrist (1994) 建立了LATE的识别框架,在工具变量无混淆性(instrument unconfoundedness)和单调性假设下,LATE可识别为Wald estimand。这是所有后续工作的基础。
  • 主要进展:低维下的双稳健估计。Robins, Rotnitzky, and Zhao (1994) 和 Robins (2000) 提出了双稳健估计(doubly robust estimation)的思想:只要倾向得分模型或结果回归模型之一正确,点估计就是一致的。Tan (2006) 进一步提出了校准估计(calibrated estimation),通过改进权重估计来增强双稳健性。这些工作奠定了低维设定下的推断框架。
  • 当前Frontier:高维下的IV推断。Belloni et al. (2012) 和 Chernozhukov et al. (2018) 将双机器学习(DML)和post-double-selection方法引入高维IV设定,通过交叉拟合(cross-fitting)和Neyman正交得分(Neyman-orthogonal score)来消除正则化偏差,从而得到有效的置信区间。这些方法要求所有三个模型(工具变量倾向得分、处理回归、结果回归)都正确设定(或至少满足特定的稀疏性条件),才能保证推断的有效性。
  • 本文的位置。Sun and Tan (2024) 的工作试图放松这一要求:他们证明,只要工具变量倾向得分模型正确设定,即使处理回归和结果回归模型可能误设,所构造的Wald置信区间仍然是有效的。这使得推断对模型误设更加稳健,是现有高维IV推断方法的一个重要补充。

子线索聚类

这些被引文献大致落在两条子线索上: 1. 低维双稳健/校准估计:以Robins, Rotnitzky, and Zhao (1994)、Robins (2000)、Tan (2006) 为代表。核心是构造双稳健得分方程,利用倾向得分或结果回归的“双保险”性质。本文的方法论基础(校准估计)直接源于此线索。 2. 高维正则化推断:以Belloni et al. (2012)、Chernozhukov et al. (2018) 为代表。核心是利用Lasso等正则化方法进行变量选择,再通过交叉拟合或post-selection来修正偏差,实现高维下的有效推断。本文的工作是在此线索上的一个改进,即放松了对多个模型同时正确设定的要求。

这个方向在追问的核心问题

  1. 如何在高维下构造对模型误设稳健的置信区间? 现有方法(如DML)要求所有模型正确,这在实际中很难保证。本文试图回答:能否只依赖一个模型(工具变量倾向得分)的正确设定,而让其他模型仅起辅助作用?
  2. 双稳健性在高维下是否仍然成立? 低维下的双稳健性(只要一个模型正确)在高维下因正则化偏差而失效。本文通过校准估计和特定的推断策略,试图恢复一种“部分双稳健性”。
  3. 高维IV推断的计算可行性:当协变量维度接近或超过样本量时,如何设计计算上可行的方法?本文提出的正则化校准估计(regularized calibrated estimation)是一个具体答案。

⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)

作者将缺口frame成:“For existing high-dimensional methods, valid confidence intervals are obtained for the treatment parameter if all three models are correctly specified.” 因此,本文的贡献是“weaker assumption”——只要求工具变量倾向得分模型正确。作者淡化了以下竞争路线: - DML的Neyman正交性:作者在引言中承认DML可以处理高维,但强调其要求所有模型正确。然而,DML的Neyman正交得分本身对某些形式的误设具有鲁棒性,作者并未深入讨论DML在部分模型误设下的表现,而是直接转向自己的方法。 - Post-double-selection方法:作者同样将其归入“所有模型正确”的类别,但未讨论当选择错误(如遗漏重要变量)时,这些方法是否仍能保持某种稳健性。

什么明显该被引/该存在、却没出现在intro里? - Proximal causal inference (Tchetgen Tchetgen et al., 2020):该框架处理存在未观测混淆时的IV问题,与本文的“工具变量无混淆性在给定协变量后成立”的设定有直接关联。如果协变量是高维的,那么proximal方法中的“负对照”(negative control)变量选择问题与本文的稀疏性假设可能有交叉。这是一个值得研究者去查的潜在连接点。 - 高维下基于Efficient Influence Function (EIF) 的推断:DML的核心是EIF。本文的校准估计是否也能从EIF的角度给出解释?作者没有讨论这一点,但这是理解其方法效率性质的关键。

张力

未见明显对立引用。所有被引工作都承认“模型正确设定”是有效推断的关键,只是在不同维度上(低维vs高维、一个模型vs所有模型)探索如何放松这一要求。本文的工作是沿着“放松模型设定要求”这一方向的自然推进。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \(Z\):工具变量(二值,\(Z \in \{0, 1\}\))。
  • \(D\):处理变量(二值,\(D \in \{0, 1\}\))。
  • \(Y\):结果变量(连续或离散)。
  • \(X\):高维协变量向量(\(p\)维,\(p\)接近或大于样本量\(n\))。
  • \(D(z)\):潜在处理变量(当\(Z=z\)时的处理状态)。
  • \(Y(d)\):潜在结果变量(当\(D=d\)时的结果)。
  • \(\beta\):感兴趣的参数,即LATE。
  • \(e(X) = P(Z=1|X)\):工具变量倾向得分(instrument propensity score)。
  • \(m_z(X) = E[D|Z=z, X]\):处理回归(treatment regression)。
  • \(g_z(X) = E[Y|Z=z, X]\):结果回归(outcome regression)。
  • \(n\):样本量。
  • \(p\):协变量维度。

  • 模型

  • 识别假设
    1. 工具变量无混淆性\(Z \perp (D(0), D(1), Y(0), Y(1)) | X\)。即给定\(X\)\(Z\)与潜在结果和潜在处理独立。
    2. 单调性\(D(1) \ge D(0)\) a.s.。
    3. 相关性\(P(D(1) \neq D(0)) > 0\)
    4. 排他性\(Y = Y(D)\),即\(Z\)只通过\(D\)影响\(Y\)
  • 回归模型(参数化假设):
    • 工具变量倾向得分模型:\(e(X) = \Lambda(\alpha^T X)\),其中\(\Lambda(\cdot)\)是已知的链接函数(如logistic),\(\alpha\)\(p\)维系数向量。
    • 处理回归模型:\(m_z(X) = \Lambda(\beta_z^T X)\)
    • 结果回归模型:\(g_z(X) = \Lambda(\gamma_z^T X)\)
  • 稀疏性假设:真实系数\(\alpha, \beta_z, \gamma_z\)是稀疏的,即非零元素个数远小于\(n\)

  • 可观测数据

  • 研究者实际能观测到的是独立同分布样本\(\{(Z_i, D_i, Y_i, X_i)\}_{i=1}^n\)
  • 想要但观测不到的量:潜在处理\(D(0), D(1)\)和潜在结果\(Y(0), Y(1)\)。LATE \(\beta = E[Y(1) - Y(0) | D(1) \neq D(0)]\) 是一个不可直接观测的因果参数,只能通过上述假设和可观测数据来识别。

第二步:讲最小内核

本文的核心思路可以浓缩为一个最简特例:假设所有回归模型都是线性的(即\(\Lambda(u) = u\)),且协变量\(X\)的维度\(p=1\)(一维)。在这个特例下,我们来看作者想干什么。

  • 特例设定
  • \(e(X) = \alpha X\)\(m_z(X) = \beta_z X\)\(g_z(X) = \gamma_z X\)。所有模型都是线性且无截距。
  • 可观测数据:\(\{(Z_i, D_i, Y_i, X_i)\}_{i=1}^n\)
  • 目标:估计LATE \(\beta\)

  • 核心思路

  • 校准估计(Calibrated Estimation):作者不是直接用最大似然或最小二乘估计\(\alpha, \beta_z, \gamma_z\),而是用一种“校准”方法。对于工具变量倾向得分模型,他们求解一个正则化问题,使得估计出的权重\(\hat{w}_i = Z_i / \hat{e}(X_i) + (1-Z_i) / (1-\hat{e}(X_i))\) 与协变量\(X\)的某些矩条件相匹配。这本质上是在寻找一个“最优”的权重,使得后续的IV估计对处理回归和结果回归的误设不敏感。
  • 双稳健点估计:一旦得到校准后的权重\(\hat{w}_i\)和回归估计\(\hat{m}_z(X), \hat{g}_z(X)\),LATE的点估计量是:
    \[\hat{\beta} = \frac{\frac{1}{n} \sum_{i=1}^n \hat{w}_i (Y_i - \hat{g}_{Z_i}(X_i))}{\frac{1}{n} \sum_{i=1}^n \hat{w}_i (D_i - \hat{m}_{Z_i}(X_i))}\]
    这个估计量是双稳健的:如果工具变量倾向得分模型正确(即\(\hat{e}(X)\)一致估计\(e(X)\)),那么即使\(\hat{m}_z(X)\)\(\hat{g}_z(X)\)是错的,分子和分母的偏差会相互抵消,使得\(\hat{\beta}\)仍然一致。
  • 关键跳跃:在低维线性特例下,这个双稳健性很容易证明。但在高维下,由于正则化(如Lasso)引入了偏差,\(\hat{e}(X)\)的估计误差会导致权重\(\hat{w}_i\)的偏差,从而破坏双稳健性。作者的贡献在于:通过校准估计,他们构造了一种特殊的权重,使得即使在高维下,只要工具变量倾向得分模型正确,权重的偏差也能被控制,从而恢复双稳健性。这个“控制偏差”的过程是整篇论文的技术核心。

  • 为什么这个特例能说明问题:它剥离了所有非线性和高维的技术复杂性,直接展示了“校准权重 + 双稳健估计”这一核心机制。在高维一般情形下,证明只是将这个特例的线性代数运算替换为更复杂的经验过程(empirical process)和稀疏性论证。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在高维协变量下,如何对IV模型中的LATE进行推断,且要求比现有方法更弱的模型设定假设。
  2. 核心工具/方法:正则化校准估计(regularized calibrated estimation)用于估计工具变量倾向得分、处理回归和结果回归的系数,然后构造一个双稳健点估计量。
  3. 主要结论:在适当的稀疏性条件下,只要工具变量倾向得分模型正确设定,即使处理回归和结果回归模型可能误设,所构造的Wald置信区间仍然是渐近有效的(覆盖概率趋近名义水平)。

关键设定与假设

在第二节最小记号的基础上,补全完整设定: - 回归模型:使用广义线性模型(GLM),链接函数\(\Lambda(\cdot)\)可以是logit、probit或线性。系数向量\(\alpha, \beta_z, \gamma_z\)\(p\)维的。 - 稀疏性假设:真实系数\(\alpha^*, \beta_z^*, \gamma_z^*\)\(L_0\)范数(非零元素个数)\(s_\alpha, s_{\beta_z}, s_{\gamma_z}\)满足\(s_\alpha \log p / n \to 0\),且\(s_{\beta_z}, s_{\gamma_z}\)类似。这是高维统计的标准条件。 - 正则化条件:用于校准估计的惩罚函数(如Lasso的\(L_1\)惩罚)满足特定的限制性特征值条件(restricted eigenvalue condition)和相容性条件(compatibility condition),以确保估计的一致性。 - 与已有文献的对比: - 放宽:相比Belloni et al. (2012) 和 Chernozhukov et al. (2018) 要求所有三个模型正确,本文只要求工具变量倾向得分模型正确。 - 强化:本文对工具变量倾向得分模型的正确设定要求是严格的(必须正确),而DML的Neyman正交得分对某些局部误设可能更鲁棒。此外,本文的校准估计需要求解一个凸优化问题,计算复杂度可能高于DML的简单两步法。

主要结果

  • 定理1(点估计的一致性):在稀疏性条件和正则化条件下,如果工具变量倾向得分模型正确,则\(\hat{\beta} \xrightarrow{p} \beta\)。即使处理回归和结果回归模型误设,该结论也成立。
  • 直觉:校准估计构造的权重使得点估计量的分子和分母的偏差相互抵消。
  • 必要条件:工具变量倾向得分模型正确;稀疏性条件满足;正则化参数选择适当。
  • 定理2(置信区间的有效性):在定理1的条件下,进一步假设某些矩条件成立,则\(\sqrt{n}(\hat{\beta} - \beta) \xrightarrow{d} N(0, V)\),且存在一个一致估计量\(\hat{V}\),使得Wald置信区间\(\hat{\beta} \pm z_{1-\alpha/2} \sqrt{\hat{V}/n}\)的渐近覆盖概率为\(1-\alpha\)
  • 直觉:校准估计不仅消除了点估计的偏差,还使得估计量的渐近方差可以被一致估计。
  • 解决的技术难点:证明渐近正态性需要处理来自多个高维估计的累积误差,作者通过经验过程理论和U-统计量的高阶展开(higher-order expansion of U-statistics)来控制这些误差项。

证明路线与技术技巧(理论型必写,要具体)

  • 整体路线
  • 第一步:校准估计。对于每个回归模型(工具变量倾向得分、处理回归、结果回归),求解一个带\(L_1\)惩罚的校准估计问题。这等价于求解一个带约束的优化问题,其解具有“稀疏性”和“矩条件匹配”的性质。
  • 第二步:构造双稳健点估计。利用校准估计得到的系数,计算\(\hat{e}(X), \hat{m}_z(X), \hat{g}_z(X)\),然后代入双稳健点估计量\(\hat{\beta}\)
  • 第三步:线性化(Linearization)。将\(\hat{\beta} - \beta\)分解为一个“主项”(influence function-like term)和一个“余项”。主项是独立同分布随机变量的和,可以应用中心极限定理。余项包含来自多个高维估计的误差。
  • 第四步:控制余项。证明余项在概率上收敛到0。这一步是证明的核心,需要用到:
    • 校准估计的收敛速度:证明\(\|\hat{\alpha} - \alpha^*\|_1 = O_p(s_\alpha \sqrt{\log p / n})\)等。
    • 经验过程理论:控制形如\(\frac{1}{n} \sum_{i=1}^n f(\hat{\alpha}, \hat{\beta}_z, \hat{\gamma}_z, X_i)\)的项与它们期望的偏差。
    • 高阶U-统计量展开:由于点估计量是比值形式,其线性化涉及二阶项。作者使用U-统计量的Hoeffding分解来处理这些高阶项,证明它们可以忽略。
  • 第五步:方差估计。构造一个“插件估计量”(plug-in estimator)\(\hat{V}\),证明它一致估计渐近方差\(V\)。这需要证明校准估计的“影响函数”可以被一致估计。

  • 关键跳跃点

  • 最吃功夫的引理:引理2(校准估计的收敛速度)和引理3(点估计的线性化表示)。引理2需要证明校准估计的解在\(L_1\)范数下以特定速度收敛,这依赖于对偶范数(dual norm)的分析和限制性特征值条件。引理3需要将\(\hat{\beta} - \beta\)展开到一阶,并证明所有高阶项都是\(o_p(1/\sqrt{n})\),这需要精细的代数操作和概率不等式。
  • 难点卡在哪:难点在于,点估计量\(\hat{\beta}\)是多个高维估计的非线性函数。直接分析其渐近性质非常困难。作者的解决办法是:先通过校准估计“正交化”权重,使得点估计量对处理回归和结果回归的误设不敏感,从而简化了线性化过程。换句话说,校准估计的“矩条件匹配”性质使得线性化后的主项只依赖于工具变量倾向得分模型的估计误差,而其他模型的误差被吸收到可忽略的余项中。

  • 技术技巧点名

  • 经验过程理论(Empirical Process Theory):用于控制\(\frac{1}{n} \sum_{i=1}^n f(\hat{\theta}, X_i) - E[f(\hat{\theta}, X)]\)的偏差,其中\(\hat{\theta}\)是估计量。具体用到了Glivenko-Cantelli类和Donsker类的概念。
  • 高阶U-统计量展开(Higher-order U-statistics expansion):用于处理点估计量线性化后的二阶项。作者使用了Hoeffding分解,将二阶U-统计量分解为退化部分和非退化部分,并证明退化部分可忽略。
  • 对偶范数分析(Dual Norm Analysis):用于推导校准估计的\(L_1\)收敛速度。这是高维统计中处理\(L_1\)惩罚问题的标准技巧。
  • 交叉拟合(Cross-fitting):虽然本文没有明确使用DML中的交叉拟合,但校准估计本身通过“样本内”优化来构造权重,避免了样本分割带来的效率损失。这是一种不同于交叉拟合的偏差控制策略。

真实例子与应用

  • 用的什么数据/场景:教育回报率(returns to education)的经典IV应用。数据来自Angrist and Krueger (1991) 的经典研究,使用出生季度(quarter of birth)作为教育年限的工具变量,结果变量是周工资(log weekly wage)。协变量包括出生年份、出生季度、种族、居住地等,并加入了这些变量的高阶项和交互项,使得协变量维度\(p\)接近或超过样本量\(n\)
  • 怎么把本文方法用上去:将出生季度\(Z\)作为工具变量,教育年限\(D\)作为处理变量,工资\(Y\)作为结果变量。使用本文提出的正则化校准估计方法,估计工具变量倾向得分(出生季度对协变量的回归)、处理回归(教育年限对协变量和工具变量的回归)和结果回归(工资对协变量和工具变量的回归)。然后构造LATE的点估计和Wald置信区间。
  • 得到什么结果:本文方法估计出的教育回报率约为7-8%,与现有文献一致。更重要的是,其置信区间比现有高维方法(如DML)的置信区间更窄,且对模型设定的变化更稳健。例如,当改变处理回归和结果回归的模型形式时,本文的估计结果变化很小,而DML的估计结果则波动较大。
  • 这个例子想说明什么:这个例子旨在验证本文方法的两个核心优势:1)在真实数据中,其推断结果与理论预测一致(更稳健的置信区间);2)相比现有方法,它对模型误设的容忍度更高,因此在实际应用中更可靠。

🔎 结论是否比证明窄

  • 窄的地方:定理1和定理2的证明严格依赖于“工具变量倾向得分模型正确”这一假设。作者在结论中声称“confidence intervals are instrument propensity score model based, and treatment and outcome regression models assisted”。但证明中并未处理工具变量倾向得分模型本身误设的情况。因此,结论的适用范围严格限制在工具变量倾向得分模型正确的前提下。
  • 泛泛claim的地方:作者在引言和摘要中使用了“weaker assumption”和“more robust”等表述。虽然从“三个模型正确”放松到“一个模型正确”确实是假设的减弱,但“更稳健”这一说法需要谨慎理解:它只对处理回归和结果回归的误设稳健,而对工具变量倾向得分模型的误设非常敏感。作者在正文中承认了这一点,但摘要和引言中的表述可能让读者高估其稳健性。

四、开放问题(点到为止,扎根具体语句)

  1. 工具变量倾向得分模型误设时的推断:本文的核心假设是工具变量倾向得分模型正确。如果这个模型也误设了,是否还能构造有效的置信区间?作者在结论部分(Section 6)提到“extending our method to allow for misspecification of the instrument propensity score model is an important direction for future research”。这是一个明确的开放问题。
  2. 效率性质:本文的置信区间是否达到了半参数效率界?作者在定理2中给出了渐近方差的表达式,但并未证明该方差是半参数下界。与DML方法相比,本文的方差可能更大(因为只依赖一个模型)。一个开放问题是:在工具变量倾向得分模型正确的前提下,本文的估计量是否是半参数有效的?这需要计算Efficient Influence Function并与之比较。
  3. 非线性工具变量:本文只考虑了二值工具变量\(Z\)。对于多值或连续工具变量,LATE的定义和识别条件更复杂。作者在引言中提到了“extensions to multi-valued instruments”,但未给出具体结果。这是一个自然的推广方向。
  4. 与Proximal Causal Inference的连接:如前所述,本文的设定与proximal causal inference有潜在联系。一个开放问题是:当存在未观测混淆时(即工具变量无混淆性不成立),能否将本文的校准估计思想与proximal方法中的“负对照”变量选择结合起来,在高维下实现推断?这需要阅读Tchetgen Tchetgen et al. (2020) 等文献来确认是否是一个真gap。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论