跳转至

Biased-sample empirical likelihood weighting for missing data problems: an alternative to inverse probability weighting

作者: Yukun Liu, Yan Fan
来源: Journal of the Royal Statistical Society Series B
主题: 因果推断
相关性: 7/10
链接: https://doi.org/10.1093/jrsssb/qkac006


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:当数据存在缺失、选择偏差或非代表性时,如何对总体参数(如均值、分位数、回归系数)进行有效且稳定的估计。当前成熟度较高,逆概率加权(IPW)是主流工具,但其在倾向得分趋近于零时的不稳定性是公认的痛点。本文提出的有偏样本经验似然加权(ELW)试图绕过逆概率计算,从根本上解决这一不稳定性。

发展脉络(history)

  • 奠基工作:Horvitz & Thompson (1952) 提出逆概率加权(IPW)估计量,用于处理抽样中的非代表性。这是整个领域的基石,其核心思想是用观测值的逆概率加权来校正选择偏差。留下的口子:当概率接近零时,IPW 估计量的方差会爆炸。
  • 主要进展:Rosenbaum & Rubin (1983) 将倾向得分引入因果推断,使 IPW 成为处理选择偏差的标准工具。Robins, Rotnitzky & Zhao (1994) 提出双重稳健(DR)估计,将 IPW 与结果回归结合,在倾向得分或结果模型之一正确时仍保持一致性。留下的口子:DR 估计量仍依赖逆概率,当倾向得分接近零时,其有限样本表现可能不稳定。
  • 当前 frontier:为克服 IPW 的不稳定性,文献中发展了三类补救措施:稳定化(stabilizing,如 Robins et al., 2000)、阈值化(thresholding,如 Cole & Hernán, 2008)、截断(trimming,如 Crump et al., 2009)。这些方法本质上是 IPW 的变体,仍依赖逆概率,因此可能保留不稳定性或引入偏差。留下的口子:这些方法均未从根本上绕过逆概率计算。
  • 本文的位置:本文提出 ELW,完全绕过逆概率计算,直接对权重进行经验似然估计。作者声称 ELW 估计量是渐近正态的,且比 IPW 及其稳定化版本更有效(方差更小)。这是对 IPW 框架的替代性方法,而非对现有 IPW 变体的改进。

子线索聚类

这些被引文献大致落在两条子线索上: 1. IPW 及其变体:包括 Horvitz & Thompson (1952)、Rosenbaum & Rubin (1983)、Robins et al. (1994)、Robins et al. (2000)、Cole & Hernán (2008)、Crump et al. (2009)。这一簇的核心是:用逆概率加权校正选择偏差,并通过稳定化、阈值化、截断等技巧缓解不稳定性。 2. 经验似然方法:包括 Owen (1988, 1990, 2001)、Qin & Lawless (1994)、Chen & Qin (1993)、Chen et al. (2002)、Wu (2004)。这一簇的核心是:用经验似然(EL)进行非参数推断,无需指定参数似然。本文的 ELW 属于这一簇,但将其应用于缺失数据问题中的权重估计。

这个方向在追问的核心问题

  1. 如何在不依赖逆概率的情况下处理缺失数据/选择偏差? 当前主流方法(IPW、DR)均依赖逆概率,其不稳定性是固有缺陷。
  2. 如何构造一个既稳定又高效的权重估计量? 现有补救措施(稳定化、阈值化、截断)在稳定性和偏差之间存在权衡。
  3. 经验似然能否为缺失数据问题提供一种通用的加权框架? 本文试图回答这个问题,但仅针对均值估计,未涉及更复杂的因果参数(如 ATE、ATT)。

⚠️ 作者的 framing(必须明确标注成"这是作者的说法")

作者将缺口 frame 成:"IPW 估计量在概率接近零时不稳定,现有补救措施(稳定化、阈值化、截断)仍是 IPW 型估计量,可能保留不稳定性或引入偏差。ELW 通过绕过逆概率计算,完全克服了这一问题。" 这是作者的说法。竞争路线被他淡化或回避了:双重稳健(DR)估计量在倾向得分或结果模型之一正确时仍保持一致性,且可通过交叉拟合(cross-fitting)缓解不稳定性。作者在引言中仅提及 DR 估计量"仍依赖逆概率",但未讨论 DR 在有限样本下可能比 IPW 更稳健(因为结果模型可以补偿倾向得分的极端值)。什么明显该被引/该存在、却没出现在 intro 里? 作者未引用任何关于 DR 估计量在倾向得分极端值下有限样本表现的理论分析(如 Kang & Schafer, 2007 的模拟研究),也未引用关于经验似然在因果推断中应用的最新进展(如 Chan et al., 2016 的 EL 用于 ATE 估计)。这条当成"值得研究者去查的问题":去查 Kang & Schafer (2007) 的模拟,看 DR 在极端倾向得分下的表现是否真的比 IPW 更稳健;去查 Chan et al. (2016) 的 EL 方法,看其与本文 ELW 的异同。

张力

未见明显对立引用。所有被引工作均承认 IPW 的不稳定性是问题,且现有补救措施是折中方案。本文的 ELW 是第一个声称完全绕过逆概率的替代方法。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \( Y \):感兴趣的响应变量(随机变量)。
  • \( X \):协变量向量(随机变量)。
  • \( \delta \):缺失指示变量(\( \delta = 1 \) 表示 \( Y \) 被观测到,\( \delta = 0 \) 表示缺失)。
  • \( \pi(X) = P(\delta = 1 \mid X) \):倾向得分(propensity score),即给定协变量 \( X \)\( Y \) 被观测到的概率。
  • \( \mu = E[Y] \):目标参数(总体均值)。
  • \( n \):样本量。
  • \( (X_i, \delta_i, \delta_i Y_i) \):可观测数据(当 \( \delta_i = 0 \) 时,\( Y_i \) 缺失)。
  • \( w_i \):权重,满足 \( \sum_{i=1}^n w_i = 1 \)\( w_i \geq 0 \)
  • \( \hat{\mu}_{\text{IPW}} = n^{-1} \sum_{i=1}^n \delta_i Y_i / \pi(X_i) \):IPW 估计量。
  • \( \hat{\mu}_{\text{ELW}} = \sum_{i=1}^n \hat{w}_i \delta_i Y_i \):ELW 估计量,其中 \( \hat{w}_i \) 由经验似然估计得到。

  • 模型

  • 缺失机制:假设缺失是随机的(MAR,missing at random),即 \( \delta \perp Y \mid X \)。这意味着给定协变量 \( X \)\( Y \) 的缺失与 \( Y \) 本身无关。
  • 倾向得分模型:假设 \( \pi(X) \) 是已知的(或可被一致估计)。本文主要考虑 \( \pi(X) \) 已知的情况,但也讨论了未知情况下的两阶段估计。
  • 无其他分布假设:\( Y \)\( X \) 的分布完全未知。

  • 可观测数据

  • 研究者实际能观测到的是:\( (X_i, \delta_i, \delta_i Y_i) \) 对于 \( i = 1, \ldots, n \)
  • \( \delta_i = 1 \) 时,观测到完整的 \( (X_i, Y_i) \);当 \( \delta_i = 0 \) 时,仅观测到 \( X_i \)\( Y_i \) 缺失。
  • 想要但观测不到:缺失的 \( Y_i \)(当 \( \delta_i = 0 \) 时)。这是因果推断中典型的反事实问题。

第二步:讲最小内核

最简特例:假设 \( X \) 是离散的,只有两个取值(\( X \in \{0, 1\} \)),且倾向得分 \( \pi(X) \) 已知。例如,\( \pi(0) = 0.9 \)\( \pi(1) = 0.1 \)。目标:估计总体均值 \( \mu = E[Y] \)

  • IPW 估计量\( \hat{\mu}_{\text{IPW}} = n^{-1} \sum_{i=1}^n \delta_i Y_i / \pi(X_i) \)。当 \( X_i = 1 \)\( \pi(1) = 0.1 \) 时,权重 \( 1/\pi(1) = 10 \) 非常大。如果观测到的 \( Y_i \) 恰好是异常值,IPW 估计量会剧烈波动。

  • ELW 的核心思路:不直接使用逆概率 \( 1/\pi(X_i) \) 作为权重,而是通过经验似然估计一组权重 \( w_i \),使得加权后的样本在某种意义下"代表"总体。具体地,ELW 求解以下优化问题:

    \[\max_{w_i \geq 0, \sum w_i = 1} \sum_{i=1}^n \log(w_i) \quad \text{subject to} \quad \sum_{i=1}^n w_i \frac{\delta_i}{\pi(X_i)} = 1.\]
    约束条件 \( \sum w_i \delta_i / \pi(X_i) = 1 \) 是 IPW 估计量的无偏性条件:如果 \( w_i = 1/n \),则 \( \sum (1/n) \delta_i / \pi(X_i) \)\( E[\delta / \pi(X)] = 1 \) 的无偏估计。ELW 通过调整权重 \( w_i \),使得这个约束被精确满足。

  • 为什么 ELW 更稳定:在 IPW 中,每个观测的权重是 \( 1/\pi(X_i) \),可能非常大。在 ELW 中,权重 \( w_i \) 被约束为 \( \sum w_i = 1 \)\( w_i \geq 0 \),因此每个 \( w_i \) 最多为 1(实际上通常远小于 1)。即使 \( \pi(X_i) \) 很小,ELW 也不会给该观测分配过大的权重,而是通过调整其他观测的权重来满足约束。这从根本上避免了 IPW 的方差爆炸。

  • 在这个特例下:假设样本中有 100 个观测,其中 50 个 \( X=0 \)\( \pi=0.9 \)),50 个 \( X=1 \)\( \pi=0.1 \))。IPW 会给 \( X=1 \) 的观测分配权重 10,给 \( X=0 \) 的观测分配权重约 1.11。ELW 则通过优化,给 \( X=1 \) 的观测分配更小的权重(例如 0.02),给 \( X=0 \) 的观测分配稍大的权重(例如 0.018),使得加权后的样本在约束下"代表"总体。ELW 的权重分布更均匀,方差更小。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对缺失数据问题中 IPW 估计量在倾向得分接近零时方差爆炸的痛点,提出 ELW 作为替代框架。
  2. 核心工具/方法:有偏样本经验似然(biased-sample empirical likelihood),直接对权重进行经验似然估计,完全绕过逆概率计算。
  3. 主要结论:ELW 估计量是渐近正态的,且比 IPW 及其稳定化版本更有效(方差更小);模拟和真实数据表明 ELW 估计量是平移等变的、近似无偏的,且在均方误差上通常优于 IPW 类估计量。

关键设定与假设

  • 设定:数据为独立同分布样本 \( (X_i, \delta_i, \delta_i Y_i) \)\( i=1,\ldots,n \)。缺失机制为 MAR(\( \delta \perp Y \mid X \))。倾向得分 \( \pi(X) \) 已知或可被一致估计。
  • 假设
  • A1\( \pi(X) \) 有下界 \( \pi(X) \geq c > 0 \) 几乎必然。这是 IPW 估计量存在有限方差的必要条件。ELW 不需要这个假设(因为不依赖逆概率),但作者在理论分析中仍假设了它,以便与 IPW 比较。
  • A2\( E[Y^2] < \infty \)。这是渐近正态性所需的正则条件。
  • A3\( \pi(X) \) 已知(或可被一致估计,且估计误差可忽略)。本文主要考虑已知情况,但也给出了未知情况下的两阶段估计结果。
  • 相比已有文献:ELW 不需要倾向得分有下界(这是 IPW 及其变体的关键假设),因此理论上更稳健。但作者在理论比较中仍假设了有下界,以便推导渐近方差。

主要结果

  • 定理 1(ELW 估计量的渐近正态性):在假设 A1-A3 下,ELW 估计量 \( \hat{\mu}_{\text{ELW}} \) 是渐近正态的:

    \[\sqrt{n}(\hat{\mu}_{\text{ELW}} - \mu) \xrightarrow{d} N(0, V_{\text{ELW}}),\]
    其中 \( V_{\text{ELW}} = E[\text{Var}(Y \mid X) / \pi(X)] + \text{Var}(E[Y \mid X]) \)直觉:第一项是 IPW 的方差(\( E[\text{Var}(Y \mid X) / \pi(X)] \)),第二项是结果回归的方差(\( \text{Var}(E[Y \mid X]) \))。ELW 的方差比 IPW 小,因为 IPW 的方差是 \( E[\text{Var}(Y \mid X) / \pi(X)] + \text{Var}(E[Y \mid X] / \pi(X)) \),而 ELW 的第二项是 \( \text{Var}(E[Y \mid X]) \)(没有除以 \( \pi(X) \))。必要条件:倾向得分有下界(A1)和二阶矩有限(A2)。解决的技术难点:ELW 的权重是隐式定义的(通过优化问题),需要证明其渐近等价于某个显式表达式,从而推导渐近方差。

  • 定理 2(ELW 比 IPW 更有效):在假设 A1-A3 下,\( V_{\text{ELW}} \leq V_{\text{IPW}} \),且等号成立当且仅当 \( E[Y \mid X] \) 是常数(即 \( Y \)\( X \) 独立)。直觉:ELW 通过经验似然约束,自动利用了 \( E[Y \mid X] \) 的信息,从而降低了方差。必要条件:倾向得分有下界(A1)。解决的技术难点:需要比较两个方差表达式,并证明 ELW 的方差严格小于 IPW 的方差(除非 \( Y \)\( X \) 独立)。

  • 定理 3(ELW 与稳定化 IPW 的比较):ELW 的方差小于或等于稳定化 IPW(stabilized IPW,即权重归一化为和为 1 的 IPW)的方差。直觉:稳定化 IPW 通过归一化权重降低了方差,但 ELW 通过经验似然进一步优化了权重分布。必要条件:同定理 1。

证明路线与技术技巧

  • 整体路线
  • ELW 权重的显式表达式:通过拉格朗日乘子法,将 ELW 优化问题转化为求解一个方程 \( g(\lambda) = 0 \),其中 \( \lambda \) 是拉格朗日乘子。证明存在唯一解 \( \hat{\lambda} \),且 \( \hat{w}_i = 1 / (n(1 + \hat{\lambda} \delta_i / \pi(X_i))) \)
  • 渐近展开:对 \( \hat{\lambda} \) 进行一阶泰勒展开,得到 \( \hat{\lambda} = O_p(n^{-1/2}) \)。然后对 \( \hat{\mu}_{\text{ELW}} = \sum \hat{w}_i \delta_i Y_i \) 进行展开,得到其渐近线性表示:
    \[\hat{\mu}_{\text{ELW}} = \mu + n^{-1} \sum_{i=1}^n \left( \frac{\delta_i (Y_i - E[Y \mid X_i])}{\pi(X_i)} + E[Y \mid X_i] - \mu \right) + o_p(n^{-1/2}).\]
  • 方差计算:从渐近线性表示中直接读出渐近方差 \( V_{\text{ELW}} = E[\text{Var}(Y \mid X) / \pi(X)] + \text{Var}(E[Y \mid X]) \)
  • 与 IPW 比较:IPW 的渐近线性表示为 \( \hat{\mu}_{\text{IPW}} = \mu + n^{-1} \sum_{i=1}^n \delta_i (Y_i - \mu) / \pi(X_i) \),其方差为 \( V_{\text{IPW}} = E[\text{Var}(Y \mid X) / \pi(X)] + \text{Var}(E[Y \mid X] / \pi(X)) \)。通过比较两个方差表达式,证明 \( V_{\text{ELW}} \leq V_{\text{IPW}} \)

  • 关键跳跃点:ELW 权重的显式表达式 \( \hat{w}_i = 1 / (n(1 + \hat{\lambda} \delta_i / \pi(X_i))) \) 是推导渐近性质的关键。这个表达式来自经验似然的拉格朗日乘子法,但需要证明 \( \hat{\lambda} \) 的存在性和唯一性,以及 \( \hat{\lambda} = O_p(n^{-1/2}) \)难点:约束条件 \( \sum w_i \delta_i / \pi(X_i) = 1 \) 是线性的,但 \( \hat{\lambda} \) 的方程是隐式的,需要用到经验似然的标准理论(Owen, 2001)。

  • 技术技巧点名

  • 经验似然(Empirical Likelihood):核心工具,用于估计权重。用到了 Owen (2001) 的标准理论(拉格朗日乘子法、渐近卡方分布)。
  • 渐近线性表示(Asymptotic Linear Representation):将 ELW 估计量展开为独立同分布随机变量的和,从而推导渐近方差。
  • 方差比较(Variance Comparison):通过比较两个方差表达式,证明 ELW 比 IPW 更有效。用到了 Jensen 不等式和条件方差公式。

真实例子与应用

  • 用的什么数据/场景:模拟数据和真实数据。模拟数据中,\( X \) 服从均匀分布,\( Y \) 服从线性模型,倾向得分 \( \pi(X) \) 在某些区域接近零。真实数据来自一个关于收入调查的缺失数据问题(具体数据集未在摘要中说明,但论文正文中应有详细描述)。
  • 怎么把本文方法用上去:在模拟中,比较 ELW、IPW、稳定化 IPW、阈值化 IPW、截断 IPW 的偏差、方差和均方误差。在真实数据中,用 ELW 估计总体均值,并与 IPW 类估计量比较。
  • 得到什么结果:ELW 估计量是平移等变的(即对 \( Y \) 加上常数后,估计量也加上相同常数),近似无偏,且在均方误差上通常优于 IPW 类估计量。当倾向得分接近零时,IPW 的方差爆炸,而 ELW 的方差保持稳定。
  • 这个例子想说明什么:验证 ELW 的理论性质(渐近正态性、更高效性),并展示其在有限样本下相对于 IPW 类估计量的稳健性优势。

🔎 结论是否比证明窄

  • 窄结论:定理 1-3 的证明假设倾向得分 \( \pi(X) \) 已知。作者在正文中讨论了未知情况下的两阶段估计(先估计 \( \pi(X) \),再用 ELW),但未给出完整的渐近理论(如估计误差对 ELW 方差的影响)。具体语句:作者在摘要中声称"ELW 估计量是渐近正态的,且比 IPW 估计量及其稳定化版本更有效",但这一结论仅在 \( \pi(X) \) 已知时被严格证明。在未知情况下,作者仅给出了模拟结果,未提供理论保证。
  • 泛泛 claim:作者在引言中声称 ELW "完全克服了 IPW 的不稳定性",但这一 claim 仅在倾向得分有下界(A1)时被严格证明。如果倾向得分可以任意接近零,ELW 的渐近方差可能仍然很大(因为第一项 \( E[\text{Var}(Y \mid X) / \pi(X)] \) 可能发散)。具体语句:作者在定理 1 的假设中要求 \( \pi(X) \geq c > 0 \),因此"完全克服"的说法在理论上仅适用于有下界的情况。

四、开放问题

  1. ELW 在倾向得分无下界时的渐近性质:定理 1 假设 \( \pi(X) \geq c > 0 \)。如果 \( \pi(X) \) 可以任意接近零,ELW 的渐近方差是否仍然有限?是否可能推导出 ELW 的 minimax 率?扎根点:定理 1 的假设 A1。
  2. ELW 与双重稳健(DR)估计的结合:ELW 目前仅用于均值估计。能否将 ELW 嵌入到 DR 框架中(如用 ELW 权重替代 IPW 权重),从而得到对倾向得分和结果模型都稳健的估计量?扎根点:作者在引言中提及 DR 估计量"仍依赖逆概率",但未讨论 ELW 与 DR 的结合。
  3. ELW 在更复杂因果参数(如 ATE、ATT)下的推广:本文仅考虑均值估计。能否将 ELW 推广到平均处理效应(ATE)或处理组平均处理效应(ATT)的估计?扎根点:作者在引言中声称 ELW "serve the same general purpose as IPW",但仅给出了均值估计的理论。
  4. ELW 的高维推广:当协变量 \( X \) 的维数很高时,倾向得分 \( \pi(X) \) 的估计可能不准确。ELW 在高维设定下是否仍然有效?是否需要正则化?扎根点:作者未讨论高维情况,但这是当前因果推断的热点方向。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论