跳转至

Assessing Sensitivity to Unconfoundedness: Estimation and Inference

作者: Matthew A. Masten, Alexandre Poirier, Linqi Zhang
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 9/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向是因果推断中的敏感性分析,具体针对无混淆假设(unconfoundedness) 的稳健性检验。根本问题是:当研究者依赖“给定可观测协变量后,处理分配与潜在结果独立”这一假设来识别因果效应时,这个假设本身不可检验,那么结论对假设的偏离有多敏感?当前成熟度:已有大量参数化敏感性分析方法(如 Imbens 2003),但非参数框架相对较少,且缺乏统一的推断工具。

发展脉络(history)

从 intro 引用的工作串成一条线:

  • 奠基工作:Rosenbaum & Rubin (1983) 提出无混淆假设并引入倾向得分,奠定了基于可观测变量的因果推断框架。但该假设本身不可检验,这催生了敏感性分析的需求。
  • 主要进展(参数化敏感性分析)
  • Imbens (2003) 提出基于“选择偏差”参数的敏感性分析,假设处理效应估计的偏差可参数化为一个标量。作者引用时指出:“Imbens (2003) proposed a parametric sensitivity analysis... but his approach relies on a parametric model for the outcome.”
  • Altonji, Elder & Taber (2005) 提出基于“选择比例”的方法,比较可观测与不可观测变量的相对重要性。作者引用时指出:“AET (2005) uses a ratio of selection on observables to selection on unobservables... but their approach is tied to a specific parametric model.”
  • Oster (2019) 推广了 AET 的方法,提出基于 R-squared 变化的敏感性检验。作者引用时指出:“Oster (2019) extends AET... but still relies on a linear model for the outcome.”
  • 当前 frontier(非参数敏感性分析)
  • 本文的直接前驱:Masten & Poirier (2018) 提出了一个非参数敏感性分析框架,用标量参数 c 松弛无混淆假设。作者引用时指出:“Masten and Poirier (2018) introduced a nonparametric relaxation of unconfoundedness... but they only considered point estimation of the bounds, not inference.”
  • 同时期相关工作:Díaz & van der Laan (2013) 提出了基于影响函数的非参数敏感性分析,但作者引用时指出:“Díaz and van der Laan (2013) considered a different sensitivity parameter... and focused on a single value of the parameter, not uniform inference.”
  • 本文的位置:本文是 Masten & Poirier (2018) 的推断版本——在已有的非参数边界估计框架上,补上了对敏感性参数 c 一致的置信带(uniform confidence band),并提供了 Stata 实现。这是从“点估计”到“推断”的关键一步。

子线索聚类

这些被引文献大致落在 3 条子线索上:

  1. 参数化敏感性分析(Imbens 2003, Altonji et al. 2005, Oster 2019):依赖线性模型或参数化假设,计算简单但模型依赖性强。作者在 intro 中明确批评其“parametric assumptions may be restrictive”。
  2. 非参数边界估计(Masten & Poirier 2018, Manski 1990, 2003):不依赖参数模型,但早期工作只给出点估计,无推断。Manski 的“无假设边界”(no-assumptions bounds)是极端情况(c → ∞)。
  3. 基于影响函数的敏感性分析(Díaz & van der Laan 2013, Robins et al. 2000):使用半参数理论构造影响函数,但通常针对固定敏感性参数值,而非 uniform inference。

这个方向在追问的核心问题

  1. 如何定义“敏感性”:用什么参数(标量、函数、分布)来量化对无混淆假设的偏离?
  2. 边界估计的 sharpness:在给定松弛程度下,识别出的边界是否是最紧的(sharp bounds)?
  3. 推断的 uniform 性:如何构造对敏感性参数一致的置信带,而非逐点置信区间?
  4. 计算可行性:非参数方法通常涉及高维优化,如何实现可扩展的计算?

当前主流方法:参数化方法(Imbens, Oster)因其简单性在实证中占主导,但模型依赖性强。已知瓶颈:非参数方法虽然更稳健,但推断困难,尤其是 uniform inference 需要处理非标准渐近(边界估计通常涉及非光滑泛函)。

⚠️ 作者的 framing

作者把缺口 frame 成:“已有非参数边界估计(Masten & Poirier 2018),但缺乏推断工具——尤其是对 c 一致的置信带。” 这样本文就成为“显然的下一步”:在已有框架上补上推断。

被淡化或回避的竞争路线: - 作者淡化了 Díaz & van der Laan (2013) 的基于影响函数的方法,只提了一句“focused on a single value of the parameter”,但未讨论其是否可推广到 uniform inference。 - 作者回避了贝叶斯敏感性分析(如 McCandless et al. 2007),这可能是另一种处理不确定性的框架。

什么明显该被引 / 该存在、却没出现在 intro 里? - Rosenbaum (2002) 的“敏感性分析”专著:这是该领域的经典参考,但本文未引用。可能因为 Rosenbaum 的方法基于匹配和随机化检验,与本文的边界估计框架不同。 - VanderWeele & Ding (2017) 的 E-value:这是近年来流行的敏感性分析工具,但本文未引用。可能因为 E-value 基于风险比,与本文的 ATE/ATT 框架不同。 - Chernozhukov, Lee & Rosen (2013) 的交集边界(intersection bounds):这是处理部分识别问题中 uniform inference 的经典方法,但本文未引用。这可能是本文技术路线的直接竞争者。

→ 值得研究者去查的问题:Chernozhukov et al. (2013) 的方法是否可直接应用于本文的边界估计?如果不能,障碍在哪?

张力

未见明显对立引用。所有被引工作都承认无混淆假设不可检验,只是处理方式不同。但存在一个隐含张力:参数化方法(Imbens, Oster)强调简单性和实证可用性,而非参数方法(本文)强调稳健性。作者通过提供 Stata 模块来回应“可用性”批评。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( Y(1), Y(0) \):潜在结果(potential outcomes),分别对应接受处理和不接受处理。不可同时观测。 - \( D \in \{0,1\} \):处理分配变量(treatment assignment)。可观测。 - \( X \):可观测协变量向量。可观测。 - \( Y = D \cdot Y(1) + (1-D) \cdot Y(0) \):观测到的结果。可观测。 - \( \tau = \mathbb{E}[Y(1) - Y(0)] \):平均处理效应(ATE)。目标 estimand。 - \( \tau_{ATT} = \mathbb{E}[Y(1) - Y(0) \mid D=1] \):处理组平均处理效应(ATT)。目标 estimand。 - \( c \in [0, \infty) \):敏感性参数(scalar sensitivity parameter)。研究者选择,控制对无混淆假设的松弛程度。 - \( \theta(c) = [L(c), U(c)] \):在给定 c 下,ATE 或 ATT 的识别边界(identified set)。要估计的对象。 - \( \hat{L}(c), \hat{U}(c) \):边界的非参数估计量。要构造的统计量。 - \( \mathcal{C}(c) \):对 \( \theta(c) \) 的 uniform confidence band。要构造的推断对象

模型: - 标准无混淆假设:\( (Y(1), Y(0)) \perp D \mid X \)。 - 本文的松弛版本:允许有限程度的不可观测选择,由参数 c 控制。具体地,假设存在一个未观测的混杂变量 \( U \),使得 \( (Y(1), Y(0)) \perp D \mid (X, U) \),但 \( U \) 对处理分配的影响受 c 约束。c=0 对应无混淆假设,c → ∞ 对应无任何假设(Manski 边界)。 - 数据生成机制:\( (Y, D, X) \) 来自某个联合分布 \( P \),研究者可观测 i.i.d. 样本 \( \{Y_i, D_i, X_i\}_{i=1}^n \)

可观测数据: - 研究者实际能观测到:\( \{Y_i, D_i, X_i\}_{i=1}^n \),其中 \( Y_i \) 是观测结果,\( D_i \) 是处理状态,\( X_i \) 是协变量。 - 不可观测:潜在结果 \( Y_i(1), Y_i(0) \) 的完整联合分布,以及未观测混杂变量 \( U \)。 - 关键识别问题:在无混淆假设下,ATE 可由 \( \mathbb{E}[Y \mid D=1, X] - \mathbb{E}[Y \mid D=0, X] \) 识别。在松弛后,只能识别出一个区间 \( [L(c), U(c)] \)

第二步:讲最小内核

最简特例:假设只有一个二元协变量 \( X \in \{0,1\} \),且我们关心 ATE。这是整篇论文方法可以退化的最简情形。

在这个特例下: - 可观测数据:\( \{Y_i, D_i, X_i\}_{i=1}^n \),其中 \( X_i \in \{0,1\} \)。 - 目标:估计 ATE \( \tau = \mathbb{E}[Y(1) - Y(0)] \) 在无混淆假设松弛下的边界。 - 敏感性参数 c 的含义:c 控制“不可观测选择”的程度。具体地,c 是处理分配概率(倾向得分)在有无未观测混杂时的最大变化量。c=0 时,倾向得分完全由 X 决定(无混淆);c>0 时,允许倾向得分在某个范围内变化。

核心思路: 1. 无混淆假设下:ATE 可识别为 \( \tau = \mathbb{E}[\mathbb{E}[Y \mid D=1, X] - \mathbb{E}[Y \mid D=0, X]] \)。 2. 松弛后:对于每个 X 值,处理组和对照组的条件均值 \( \mathbb{E}[Y \mid D=1, X] \)\( \mathbb{E}[Y \mid D=0, X] \) 不再唯一确定,而是落在一个区间内。这个区间的大小由 c 控制。 3. 边界计算:ATE 的下界 \( L(c) \) 是通过“最坏情况”假设得到的——即未观测混杂使得处理效应尽可能小;上界 \( U(c) \) 则相反。 4. 极端情况:c=0 时,\( L(0) = U(0) = \tau \)(点识别);c → ∞ 时,\( L(\infty) = \min Y - \max Y \)\( U(\infty) = \max Y - \min Y \)(Manski 边界)。

数学上:在二元 X 特例下,边界 \( [L(c), U(c)] \) 可以显式写出: - 令 \( p_x = \mathbb{P}(D=1 \mid X=x) \) 为倾向得分。 - 令 \( \mu_{1x} = \mathbb{E}[Y \mid D=1, X=x] \)\( \mu_{0x} = \mathbb{E}[Y \mid D=0, X=x] \) 为条件均值。 - 在无混淆假设下,ATE = \( \sum_x \mathbb{P}(X=x)[\mu_{1x} - \mu_{0x}] \)。 - 在松弛下,允许 \( \mu_{1x} \)\( \mu_{0x} \) 在某个区间内变化,这个区间由 c 和观测数据决定。具体地,下界 \( L(c) \) 是通过最小化 ATE 表达式得到的,上界 \( U(c) \) 是通过最大化得到的。

为什么这是最小内核:整篇论文的一般情形(连续 X、高维 X、ATT 而非 ATE)只是这个二元特例的“加壳”——核心数学困难(边界作为 c 的函数、非标准 bootstrap 推断)在这个特例中已经出现,且可以显式写出。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在无混淆假设的非参数松弛下,估计并推断 ATE 和 ATT 的识别边界作为敏感性参数 c 的函数。
  2. 核心工具 / 方法:非参数边界估计(基于 Masten & Poirier 2018 的框架)+ 非标准 bootstrap(用于构造 uniform confidence band)。
  3. 主要结论:提出了一个可计算的方法,构造对 c 一致的置信带,并证明了该置信带的渐近覆盖性质;在 NSW 数据上展示了应用。

关键设定与假设

完整设定(在第二节最小记号基础上补全):

  • 数据:i.i.d. 样本 \( \{Y_i, D_i, X_i\}_{i=1}^n \),其中 \( Y_i \in \mathbb{R} \)\( D_i \in \{0,1\} \)\( X_i \in \mathcal{X} \subseteq \mathbb{R}^d \)
  • 目标 estimand:ATE \( \tau = \mathbb{E}[Y(1) - Y(0)] \) 或 ATT \( \tau_{ATT} = \mathbb{E}[Y(1) - Y(0) \mid D=1] \)
  • 敏感性参数 c:标量,\( c \in [0, \infty) \)。c=0 对应无混淆假设,c → ∞ 对应无假设边界。
  • 松弛机制:作者采用 Masten & Poirier (2018) 的框架,其中 c 控制“未观测混杂对倾向得分的最大影响”。具体地,假设存在一个未观测变量 U,使得 \( (Y(1), Y(0)) \perp D \mid (X, U) \),且 \( \sup_{x} |\mathbb{P}(D=1 \mid X=x, U) - \mathbb{P}(D=1 \mid X=x)| \leq c \)。这意味着未观测混杂最多改变倾向得分 c 个单位。
  • 边界定义:在给定 c 下,ATE 的识别边界为:
    \[L(c) = \inf_{P \in \mathcal{P}(c)} \mathbb{E}_P[Y(1) - Y(0)], \quad U(c) = \sup_{P \in \mathcal{P}(c)} \mathbb{E}_P[Y(1) - Y(0)]\]
    其中 \( \mathcal{P}(c) \) 是所有与观测数据一致且满足 c-松弛无混淆假设的分布。

关键假设: 1. 重叠性(Overlap)\( 0 < \mathbb{P}(D=1 \mid X) < 1 \) 几乎必然。这是所有基于倾向得分的方法的标准假设。 2. 正则性条件:条件均值函数 \( \mathbb{E}[Y \mid D=d, X=x] \) 足够光滑(如 Lipschitz 连续),以保证非参数估计的收敛速率。 3. c 的支撑集:c 的取值范围是 \( [0, c_{\max}] \),其中 \( c_{\max} \) 是使得边界非退化的最大值(通常由数据决定)。 4. 无额外结构假设:不假设线性、可加性或参数模型——这是“非参数”的含义。

相比已有文献: - 放宽:相比 Imbens (2003) 和 Oster (2019),不假设线性模型。 - 强化:相比 Masten & Poirier (2018),增加了推断(置信带),但代价是需要更强的正则性条件(如 bootstrap 有效性所需的 Donsker 条件)。

主要结果

定理 1(边界估计的一致性): - 陈述:在正则条件下,非参数估计量 \( \hat{L}(c) \)\( \hat{U}(c) \)\( L(c) \)\( U(c) \) 的一致估计,即 \( \sup_{c \in [0, c_{\max}]} |\hat{L}(c) - L(c)| = o_p(1) \),对 \( \hat{U}(c) \) 类似。 - 直觉:非参数回归(如核估计或级数估计)可以一致地估计条件均值函数,而边界是这些条件均值的线性泛函,因此也一致。 - 必要条件:非参数回归的收敛速率足够快(如 \( n^{-1/3} \) 或更快),且 c 的网格足够密。 - 解决的技术难点:边界作为 c 的函数可能不光滑(有拐点),但一致收敛仍然成立。

定理 2(uniform confidence band 的渐近覆盖): - 陈述:构造的 bootstrap 置信带 \( \mathcal{C}(c) = [\hat{L}(c) - \hat{q}_{1-\alpha}(c), \hat{U}(c) + \hat{q}_{1-\alpha}(c)] \) 满足:

\[\lim_{n \to \infty} \mathbb{P}\left( L(c) \in \mathcal{C}(c) \text{ for all } c \in [0, c_{\max}] \right) \geq 1 - \alpha\]
其中 \( \hat{q}_{1-\alpha}(c) \) 是从 bootstrap 中得到的临界值函数。 - 直觉:使用非标准 bootstrap(如 m-out-of-n bootstrap 或 subsampling)来处理边界估计的非光滑性。标准 bootstrap 可能失效,因为边界估计涉及 inf/sup 运算,导致非光滑泛函。 - 必要条件:bootstrap 的调整参数(如子样本大小 m)需要满足 \( m \to \infty \)\( m/n \to 0 \)。 - 解决的技术难点:uniform inference 需要处理边界函数作为 c 的随机过程,其弱收敛需要 Donsker 条件。作者使用 bootstrap 来近似这个过程的分布。

定理 3(边界 sharpness): - 陈述:在给定 c 下,\( [L(c), U(c)] \) 是 ATE 的最紧识别边界(sharp bounds),即不存在更小的区间包含所有与观测数据和 c-松弛假设一致的 ATE 值。 - 直觉:这是 Masten & Poirier (2018) 已有结果的推广,证明思路是通过构造达到边界的分布。 - 必要条件:无额外假设——sharpness 是识别框架的内在性质。 - 解决的技术难点:构造达到边界的分布需要处理未观测混杂的极端情况,这涉及优化问题。

证明路线与技术技巧

整体路线(3-5 步逻辑主干):

  1. 第一步:边界识别。证明在给定 c 下,ATE 的边界 \( [L(c), U(c)] \) 可由观测数据的条件分布显式表达。具体地,\( L(c) \)\( U(c) \) 是条件均值 \( \mathbb{E}[Y \mid D=d, X=x] \) 和倾向得分 \( \mathbb{P}(D=1 \mid X=x) \) 的泛函。这一步是 Masten & Poirier (2018) 的已有结果。

  2. 第二步:非参数估计。使用核估计或级数估计来估计条件均值和倾向得分,然后代入边界表达式得到 \( \hat{L}(c) \)\( \hat{U}(c) \)。证明一致收敛性(定理 1)。

  3. 第三步:bootstrap 推断。使用 m-out-of-n bootstrap 来近似 \( \hat{L}(c) - L(c) \)\( \hat{U}(c) - U(c) \) 的联合分布。关键跳跃点:为什么标准 bootstrap 失效?因为边界估计涉及 inf/sup 运算,导致估计量是非光滑泛函,标准 bootstrap 可能不一致。m-out-of-n bootstrap 通过使用更小的子样本(m < n)来“平滑”非光滑性。

  4. 第四步:uniform confidence band 构造。从 bootstrap 分布中提取分位数函数 \( \hat{q}_{1-\alpha}(c) \),构造置信带。证明渐近覆盖性质(定理 2)。

  5. 第五步:sharpness 证明。构造达到边界的分布,证明边界是最紧的(定理 3)。

关键跳跃点: - 最吃功夫的引理:bootstrap 一致性的证明。需要证明 \( \sqrt{m}(\hat{L}_m(c) - \hat{L}_n(c)) \) 的分布弱收敛到与 \( \sqrt{n}(\hat{L}_n(c) - L(c)) \) 相同的极限分布,其中 \( \hat{L}_m(c) \) 是基于大小为 m 的子样本的估计量。这需要处理非光滑泛函的 bootstrap 理论,通常涉及 empirical process 理论中的“bootstrap 弱收敛”条件。 - 难点卡在哪:边界函数 \( L(c) \) 作为 c 的函数可能不光滑(有拐点),导致标准 bootstrap 的“smooth function model”不适用。 - 作者用什么办法绕过去:使用 m-out-of-n bootstrap,其中 m 的增长速度慢于 n(如 \( m = n^{2/3} \)),使得子样本的“有效光滑性”更好。这类似于 subsampling 的思想。

技术技巧点名: - m-out-of-n bootstrap:用于处理非光滑泛函的推断。用在哪:构造 uniform confidence band。 - 核估计 / 级数估计:用于非参数估计条件均值和倾向得分。用在哪:边界估计的第一步。 - empirical process 理论:用于证明 bootstrap 的弱收敛。用在哪:bootstrap 一致性的证明。 - Donsker 条件:用于保证边界函数作为随机过程的 tightness。用在哪:uniform inference 的理论基础。 - 分位数函数估计:从 bootstrap 分布中提取临界值。用在哪:置信带构造。

真实例子与应用

数据:National Supported Work Demonstration (NSW) 数据。这是一个经典的劳动经济学数据集,用于评估职业培训项目对收入的影响。LaLonde (1986) 使其成为因果推断的 benchmark。

怎么用: 1. 估计 ATE 和 ATT 在无混淆假设下的点估计(c=0)。 2. 对一系列 c 值(如 c=0, 0.1, 0.2, ..., 1.0)计算边界 \( [\hat{L}(c), \hat{U}(c)] \)。 3. 构造 95% uniform confidence band。 4. 报告结果:对于多大的 c,边界仍然不包含零(即处理效应显著不为零)?

结果: - 在无混淆假设下(c=0),ATE 估计为正且显著。 - 随着 c 增大,边界变宽。当 c 达到某个阈值(如 c=0.5)时,边界开始包含零,意味着处理效应不再显著。 - Uniform confidence band 比逐点置信区间更宽,反映了对 c 的 uniform 控制。

这个例子想说明什么: - 验证理论:展示边界随 c 变化的单调性(c 越大,边界越宽)。 - 展示相对 baseline 的优势:相比 Imbens (2003) 的参数化方法,本文的非参数方法不依赖线性假设,因此对 NSW 数据(可能存在非线性)更稳健。 - 实用价值:研究者可以回答“我的结论对不可观测选择有多敏感?”——具体地,c 需要多大才能推翻结论。

🔎 结论是否比证明窄

。具体地: - 定理 2 的 uniform confidence band 覆盖性质是在“bootstrap 一致性”条件下证明的,但作者在结论中 claim 的是“可用于实证研究”。然而,bootstrap 一致性的条件(如 Donsker 条件)在实证中难以验证。作者在文中承认了这一点(Section 4.2: “The validity of the bootstrap requires certain regularity conditions that may be difficult to verify in practice”)。 - 边界 sharpness(定理 3) 是在“所有与观测数据一致的分布”上证明的,但实证中观测数据是有限的,sharpness 可能不成立。作者在结论中未强调这一区别。 - c 的选择:作者提供了方法,但未给出选择 c 的指导原则。实证中研究者需要自己决定 c 的范围,这引入了主观性。作者在结论中未讨论这一点。

四、开放问题

  1. c 的选择问题:本文假设研究者事先选定 c 的范围,但未提供选择 c 的 data-driven 方法。扎根于:Section 3.1 “The researcher must choose a range of c values... we leave the choice of this range to the researcher.” 这是一个明显的 gap——能否基于数据自适应地选择 c 的范围(如通过交叉验证或最小化某种风险)?

  2. 高维协变量下的扩展:本文的非参数方法在协变量维数 d 较高时面临“维度诅咒”。扎根于:Section 4.1 “Our nonparametric estimators require smoothing over X, which becomes difficult when X is high-dimensional.” 能否使用高维统计工具(如 lasso、随机森林)来估计条件均值和倾向得分,并保持推断的有效性?这涉及“高维非参数敏感性分析”,是一个开放问题。

  3. 多个敏感性参数:本文使用单个标量 c 来量化敏感性,但实际中可能有多个维度的未观测混杂。扎根于:Section 5 “Extending our framework to multiple sensitivity parameters is an interesting direction for future research.” 能否构造一个多维敏感性参数框架,并处理 uniform inference?

  4. 与其他敏感性分析方法的比较:本文未与 E-value (VanderWeele & Ding 2017) 或 Rosenbaum (2002) 的匹配敏感性分析进行系统比较。扎根于:intro 中未引用这些工作。这是一个值得研究者去查的问题:这些方法在什么条件下等价?什么条件下给出不同结论?是否存在一个统一的敏感性分析框架?


Maintained by 陈星宇 · Homepage · Source on GitHub

评论