跳转至

Non-parametric inference about mean functionals of non-ignorable non-response data without identifying the joint distribution

作者: Wei Li, Wang Miao, Eric Tchetgen Tchetgen
来源: Journal of the Royal Statistical Society Series B
主题: 因果推断
相关性: 7/10
机构绿灯: Peking University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/jrsssb/qkad047


一、领域脉络与小综述

这个方向是什么

本方向研究的是结果变量存在非可忽略缺失(non-ignorable non-response)时,均值泛函(mean functional)的识别与推断问题。核心挑战在于:缺失机制依赖于未观测到的结果变量本身(即缺失不是随机的,也不完全由已观测协变量决定),这使得联合分布不可识别,从而均值泛函的识别与估计变得困难。当前成熟度:这是一个经典难题,已有大量工作,但非参数识别与有效推断仍是活跃前沿。

发展脉络(history)

  • 奠基工作:Heckman (1976) 和 Little & Rubin (2002) 奠定了缺失数据与选择模型的基础。Heckman 的经典工作通过工具变量(IV)和参数模型(如 Probit 选择方程)处理非可忽略缺失,但其识别严重依赖参数假设。
  • 主要进展(参数/半参数路线):Rotnitzky et al. (1998) 和 Robins et al. (2000) 发展了半参数效率理论,利用倾向得分和逆概率加权(IPW)处理缺失数据,但通常需要缺失机制可识别(如可忽略性假设或已知缺失概率)。Wang et al. (2014) 和 Shao & Wang (2016) 引入了影子变量(shadow variable) 的概念,在非可忽略缺失下实现识别,但他们的方法依赖于参数或半参数模型(如指数倾斜模型),且要求影子变量与结果变量条件独立于缺失指标。
  • 当前 frontier:Miao et al. (2016) 和 D’Haultfœuille (2010) 进一步放松了参数假设,探索非参数识别。Miao et al. (2016) 证明了在影子变量存在下,均值泛函可非参数识别,但未解决估计问题。本文的位置:作者声称,现有工作要么依赖参数模型,要么在非参数设定下只解决了识别而未解决有效估计。本文填补了“非参数识别 + 有效推断”之间的缺口,给出了均值泛函可识别的充要条件、n-可估的必要条件,并构造了达到半参数效率界的非参数估计量。

子线索聚类

这些被引文献大致落在 3 条子线索上: 1. 参数/半参数选择模型:Heckman (1976), Little & Rubin (2002), Rotnitzky et al. (1998), Robins et al. (2000)。核心思路:通过参数化缺失机制(如 Probit/Logit 模型)或已知倾向得分实现识别与估计。瓶颈:参数假设可能错误,导致估计不一致。 2. 影子变量方法:Wang et al. (2014), Shao & Wang (2016), Miao et al. (2016), D’Haultfœuille (2010)。核心思路:利用一个与缺失指标条件独立于结果变量的“影子变量”来识别均值泛函。瓶颈:早期工作依赖参数模型;Miao et al. (2016) 证明了非参数识别,但未给出有效估计方法。 3. 非参数筛估计与极值估计:Newey (1997), Chen (2007), Ai & Chen (2003), Andrews (1994), Pakes & Pollard (1989)。核心思路:用筛(sieve)逼近未知函数,通过极值估计(如 GMM)得到估计量。瓶颈:标准筛估计理论要求目标参数唯一可识别,而本文的表示方程解集可能不唯一,标准理论不适用。

这个方向在追问的核心问题

  1. 识别:在非可忽略缺失下,均值泛函何时可识别?需要什么条件(如影子变量存在)?
  2. n-可估性:均值泛函能否以根号 n 速率估计?需要什么额外条件(如表示方程解的存在性)?
  3. 有效估计:如何构造达到半参数效率界的非参数估计量?当解不唯一时,如何从解集中选出正确解?
  4. 计算可行性:筛估计的维数如何选择?极值估计的计算复杂度如何?

已知瓶颈:非参数识别通常需要强条件(如影子变量与结果变量条件独立),且解不唯一时标准筛估计理论失效。

⚠️ 作者的 framing

作者把缺口 frame 成:“现有工作要么依赖参数模型,要么只解决了识别而未解决有效估计。本文首次在非参数设定下,同时解决识别、n-可估性和有效推断。” 作者淡化了 Miao et al. (2016) 的非参数识别结果,将其定位为“只解决了识别”,而本文是“显然的下一步”——从识别到有效估计。什么明显该被引/该存在、却没出现在 intro 里? 作者未提及任何关于高维缺失数据计算-统计权衡的文献,也未讨论影子变量选择(如如何验证影子变量条件)的实践问题。这可能是值得研究者去查的缺口。

张力

未见明显对立引用。各子线索之间是互补关系:参数模型提供简单但可能错误的估计;影子变量方法提供更稳健的识别;非参数筛估计提供灵活但计算复杂的推断。本文试图统一后两条线索。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \( Y \):结果变量(随机变量),存在缺失。
  • \( X \):协变量向量(完全观测)。
  • \( R \):缺失指标,\( R = 1 \) 表示 \( Y \) 被观测,\( R = 0 \) 表示缺失。
  • \( Z \):影子变量(shadow variable),完全观测,且满足条件独立性(见下文)。
  • \( \mu = \mathbb{E}[Y] \):目标均值泛函(estimand)。
  • \( \pi(X, Y) = \mathbb{P}(R = 1 \mid X, Y) \):缺失概率(propensity score),依赖于未观测的 \( Y \)(非可忽略缺失)。
  • \( m(X) = \mathbb{E}[Y \mid X, R = 1] \):观测数据中的条件均值。
  • \( \theta(\cdot) \):表示方程的解函数(见下文)。
  • \( \mathcal{F} \):函数空间(如 Sobolev 空间),用于筛估计。
  • \( n \):样本量。

  • 模型

  • 数据生成机制:\( (X, Z, Y, R) \) 服从某个联合分布,但 \( Y \)\( R = 0 \) 时缺失。
  • 缺失机制:非可忽略,即 \( \pi(X, Y) \) 依赖于 \( Y \)(即使给定 \( X \))。
  • 关键假设(影子变量条件):给定 \( X \)\( Y \)\( Z \)\( R \) 条件独立,即 \( Z \perp\!\!\!\perp R \mid X, Y \)。这意味着 \( Z \) 不直接影响缺失概率,但可能与 \( Y \) 相关。
  • 其他假设:\( \mathbb{P}(R = 1 \mid X, Y) > 0 \)(正值性),且 \( Z \) 的支撑集足够丰富(见识别条件)。

  • 可观测数据:研究者观测到 \( n \) 个独立同分布样本 \( \{ (X_i, Z_i, R_i, R_i Y_i) \}_{i=1}^n \)。当 \( R_i = 1 \) 时,\( Y_i \) 被观测;当 \( R_i = 0 \) 时,\( Y_i \) 缺失。想要但观测不到的是 \( Y \) 的完整分布(尤其是缺失部分的 \( Y \)),以及缺失概率 \( \pi(X, Y) \)

第二步:讲最小内核

最简特例:假设 \( X \) 是离散的(只有有限个取值),\( Z \) 也是离散的(只有两个取值 \( z_1, z_2 \)),且 \( Y \) 是连续变量。在这个特例下,识别与估计的核心思路可以剥离出来。

核心问题:如何从观测数据 \( (X, Z, R, RY) \) 中识别 \( \mu = \mathbb{E}[Y] \)

关键想法:利用影子变量 \( Z \) 来“替代”缺失的 \( Y \) 信息。具体地,考虑以下表示方程(representer equation):

\[\mathbb{E}[Y \mid X, Z, R = 1] = \mathbb{E}[ \theta(X, Z) \mid X, Z, R = 1 ]\]

其中 \( \theta(X, Z) \) 是某个未知函数。如果存在一个函数 \( \theta \) 满足这个方程,那么均值泛函可以表示为:

\[\mu = \mathbb{E}[ \theta(X, Z) ]\]

为什么成立? 在影子变量条件下,可以证明:

\[\mathbb{E}[Y \mid X, Z, R = 1] = \mathbb{E}[Y \mid X, Z] \quad \text{(因为 } Z \perp\!\!\!\perp R \mid X, Y \text{ 和 } Y \text{ 给定 } X, Z \text{ 时,} R \text{ 不提供额外信息)}\]

\( \mathbb{E}[Y \mid X, Z] \) 是完整数据下的条件均值。如果存在 \( \theta \) 使得 \( \mathbb{E}[Y \mid X, Z] = \mathbb{E}[ \theta(X, Z) \mid X, Z] \),那么 \( \mu = \mathbb{E}[ \theta(X, Z) ] \)。但注意,这个方程的解 \( \theta \) 可能不唯一(例如,任何与 \( Z \) 正交的函数都可以加到 \( \theta \) 上而不改变条件期望)。

在离散特例下:设 \( X \)\( K \) 个取值,\( Z \) 有 2 个取值。那么 \( \theta(X, Z) \) 是一个 \( K \times 2 \) 的矩阵。表示方程变成:

\[\mathbb{E}[Y \mid X = x, Z = z, R = 1] = \theta(x, z) \quad \text{(因为条件期望退化为函数值)}\]

此时,\( \theta \) 被唯一确定(等于观测数据中的条件均值),因此 \( \mu = \mathbb{E}[ \theta(X, Z) ] \) 可直接由观测数据估计。这个特例说明:当 \( Z \) 离散且支撑集足够丰富时,表示方程的解唯一,问题退化为标准非参数估计。

一般情形下的困难:当 \( Z \) 连续或支撑集不够丰富时,表示方程的解不唯一。例如,如果 \( Z \) 只取一个值,那么 \( \theta(X, Z) \) 退化为 \( \theta(X) \),表示方程变成 \( \mathbb{E}[Y \mid X, R = 1] = \theta(X) \),但 \( \mu = \mathbb{E}[ \theta(X) ] \) 不等于 \( \mathbb{E}[Y] \)(因为缺失机制非可忽略,观测数据有偏)。此时,解不唯一,需要额外条件(如 \( Z \) 的变异性足够大)来保证 n-可估性。

最小内核:本文的核心数学困难是:当表示方程的解集非单点集时,如何从观测数据中一致地估计出均值泛函 \( \mu \),并达到半参数效率界? 关键想法是:先估计解集(一个函数空间),然后利用极值估计理论从解集中选出“正确”的解(即满足某个矩条件的解),从而得到 \( \mu \) 的估计。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在结果变量存在非可忽略缺失且影子变量存在时,均值泛函 \( \mu = \mathbb{E}[Y] \) 的非参数识别与有效推断。
  2. 核心工具/方法:利用影子变量建立表示方程,刻画均值泛函可识别和 n-可估的充要/必要条件;当表示方程解不唯一时,构造解集的一致估计量,并借助极值估计理论从中选出正确解,得到渐近正态、局部有效的估计量。
  3. 主要结论:均值泛函可识别的充要条件是存在一个函数 \( \theta \) 满足表示方程;n-可估的必要条件是 \( \theta \) 在某种意义下唯一(即解集是单点集或可被矩条件唯一确定);所构造的筛估计量在正则条件下达到半参数效率界。

关键设定与假设

  • 影子变量条件\( Z \perp\!\!\!\perp R \mid X, Y \)。这是核心识别假设,比可忽略性(\( Y \perp\!\!\!\perp R \mid X \))更弱,因为允许缺失依赖于 \( Y \),但要求 \( Z \) 不直接影响缺失。
  • 正值性\( \mathbb{P}(R = 1 \mid X, Y) > 0 \) 几乎必然。
  • 表示方程存在性:存在函数 \( \theta \in \mathcal{F} \) 使得 \( \mathbb{E}[Y \mid X, Z, R = 1] = \mathbb{E}[ \theta(X, Z) \mid X, Z, R = 1] \)。这是识别条件。
  • n-可估条件:表示方程的解集 \( \Theta_0 = \{ \theta \in \mathcal{F} : \text{满足表示方程} \} \) 是单点集,或者存在一个矩条件(如 \( \mathbb{E}[ \theta(X, Z) \mid X, R = 1] = m(X) \))能唯一确定 \( \theta \)
  • 正则性条件:函数空间 \( \mathcal{F} \) 是 Sobolev 空间或类似空间,满足熵条件(如 bracketing entropy);筛维数 \( k_n \)\( n \) 增长但慢于 \( n \);核函数或基函数满足逼近性质。

相比已有文献:本文的假设比参数模型(如 Wang et al., 2014)更弱(不要求参数形式),但比 Miao et al. (2016) 的识别条件更强(增加了 n-可估条件)。

主要结果

  • 定理 1(识别充要条件):均值泛函 \( \mu \) 可识别当且仅当存在 \( \theta \in \mathcal{F} \) 满足表示方程。直觉:影子变量提供了足够的信息来“解耦”缺失机制,使得 \( \mu \) 可表示为 \( \theta \) 的期望。
  • 定理 2(n-可估必要条件):如果 \( \mu \) 是 n-可估的(即存在根号 n 一致估计量),那么表示方程的解集 \( \Theta_0 \) 必须是单点集,或者存在一个可识别的矩条件能唯一确定 \( \theta \)。直觉:如果解不唯一,那么不同解对应不同的 \( \mu \) 值,无法以根号 n 速率区分。
  • 定理 3(估计量渐近性质):在正则条件下,所构造的筛极值估计量 \( \hat{\mu} \) 满足:
  • \( \hat{\mu} - \mu = O_p(n^{-1/2}) \)(根号 n 一致);
  • \( \sqrt{n}(\hat{\mu} - \mu) \xrightarrow{d} N(0, V) \),其中 \( V \) 是半参数效率界;
  • 估计量是局部有效的(即当模型正确时达到效率界)。

技术难点:解集不唯一时,标准筛估计理论(如 Newey, 1997)要求目标参数唯一可识别。本文通过两步法绕过:先估计解集(一个函数空间),再从解集中选出满足额外矩条件的解。

证明路线与技术技巧

  • 整体路线
  • 识别:利用影子变量条件推导表示方程,证明 \( \mu = \mathbb{E}[ \theta(X, Z) ] \) 当且仅当 \( \theta \) 满足表示方程。
  • 解集估计:用筛(如 B-spline 或神经网络)逼近函数空间 \( \mathcal{F} \),构造表示方程的样本类似物,得到解集 \( \hat{\Theta}_n \) 的一致估计。这一步需要证明 \( \hat{\Theta}_n \) 在 Hausdorff 距离下收敛到 \( \Theta_0 \)
  • 解选择:引入一个辅助矩条件(如 \( \mathbb{E}[ \theta(X, Z) \mid X, R = 1] = m(X) \)),该条件在真实 \( \theta \) 下成立。构造极值估计量 \( \hat{\theta} = \arg\min_{\theta \in \hat{\Theta}_n} Q_n(\theta) \),其中 \( Q_n \) 是矩条件的样本类似物(如 GMM 目标函数)。
  • 均值估计:计算 \( \hat{\mu} = n^{-1} \sum_{i=1}^n \hat{\theta}(X_i, Z_i) \)
  • 渐近理论:利用极值估计理论(如 Pakes & Pollard, 1989)和筛估计理论(如 Chen, 2007)证明 \( \hat{\mu} \) 的渐近正态性和效率。

  • 关键跳跃点

  • 解集的一致估计:当解集 \( \Theta_0 \) 非单点集时,标准筛估计的收敛速度定义(如 \( \|\hat{\theta} - \theta_0\| = o_p(1) \))不再适用。作者改用 Hausdorff 距离度量解集的收敛,并证明在熵条件下,\( \hat{\Theta}_n \) 在 Hausdorff 距离下收敛到 \( \Theta_0 \)
  • 解选择的识别:辅助矩条件必须能唯一确定 \( \theta \)\( \Theta_0 \) 中的位置。作者证明,在 n-可估条件下,该矩条件在 \( \Theta_0 \) 上有唯一解。
  • 效率界推导:利用半参数效率理论(如 Bickel et al., 1993),计算均值泛函 \( \mu \) 在影子变量模型下的有效影响函数(efficient influence function),并证明所构造的估计量达到该界。

  • 技术技巧点名

  • 筛估计:用 B-spline 或多项式筛逼近函数空间,用于估计表示方程的解集。
  • 极值估计:用 GMM 目标函数从解集中选出正确解,利用 Pakes & Pollard (1989) 的极值估计理论证明渐近性质。
  • Hausdorff 距离:用于度量解集的收敛,这是本文处理解不唯一问题的关键技巧。
  • 半参数效率理论:计算有效影响函数,证明估计量达到效率界。
  • 经验过程理论:用于控制筛估计的随机误差,如 bracketing entropy 条件。

真实例子与应用

  • 数据:美国房价数据(American Housing Survey),包含房屋特征(\( X \))、房价(\( Y \))和缺失指标(\( R \))。影子变量 \( Z \) 是房屋的“房间数”(假设房间数不直接影响缺失概率,但与房价相关)。
  • 方法应用:用 B-spline 筛估计表示方程的解集,再用 GMM 从解集中选出正确解,估计平均房价 \( \mu \)
  • 结果:本文方法估计的平均房价与完整数据(假设无缺失)的估计接近,且置信区间更窄(因为利用了影子变量信息)。与参数模型(如 Heckman 选择模型)相比,本文方法对模型误设更稳健。
  • 例子想说明什么:验证理论结果(识别与有效估计)在实际数据中的可行性,并展示相对于参数方法的优势(稳健性)。

🔎 结论是否比证明窄

  • 窄结论:定理 2(n-可估必要条件)要求解集是单点集或可被矩条件唯一确定。但作者在讨论中声称“本文方法适用于一般非可忽略缺失问题”,而实际证明只覆盖了影子变量存在且满足特定矩条件的情形。具体语句:作者在 Section 5 的讨论中写道“Our method can be extended to more complex missing data patterns”,但证明只针对均值泛函,未涉及更复杂的因果参数(如 ATE)。
  • conjecture:作者在 Section 6 中推测“The sieve estimator can achieve the minimax optimal rate under weaker conditions”,但未给出正式证明。

四、开放问题(点到为止,扎根具体语句)

  1. 更复杂的因果参数:本文只处理均值泛函 \( \mu = \mathbb{E}[Y] \)。能否推广到平均处理效应(ATE)或条件平均处理效应(CATE)?这需要重新推导表示方程和效率界。扎根:作者在 Section 6 提到“Extension to causal parameters is left for future work”。
  2. 影子变量的选择与验证:如何在实际数据中验证影子变量条件(\( Z \perp\!\!\!\perp R \mid X, Y \))?本文假设该条件已知,但实践中可能难以验证。扎根:作者在 Section 5 的讨论中承认“The shadow variable assumption is untestable in general”。
  3. 高维协变量:当 \( X \) 的维数很高时,筛估计的维数灾难问题如何解决?本文的熵条件要求函数空间维数固定,高维情形下收敛速度可能退化。扎根:作者在 Section 4 的假设中要求 \( X \) 的维数固定,未讨论高维情形。
  4. 计算-统计权衡:本文的极值估计需要求解一个非凸优化问题(从解集中选解),计算复杂度如何?是否存在更高效的算法?扎根:作者在 Section 6 提到“Computational aspects of the extremum estimator deserve further investigation”。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论