Robust propensity score weighting estimation under missing at random¶
作者: Hengfang Wang, Jae Kwang Kim, Jeongseop Han, Youngjo Lee
来源: Electronic Journal of Statistics
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本方向处理的是缺失数据下的因果推断与参数估计问题。根本的科学问题是:当目标变量(如结果变量 Y)存在缺失,且缺失机制为随机缺失(Missing At Random, MAR)时,如何利用观测数据对总体参数(如均值、回归系数)进行相合且高效的估计。当前成熟度较高,但核心挑战在于:倾向得分模型(response propensity model)和结果回归模型(outcome regression model)都容易误设,而双重稳健(doubly robust, DR)估计量虽能容忍其中一个模型误设,但在两个模型都轻微误设时表现不稳定,且对离群值敏感。
发展脉络(history)¶
- 奠基工作:Rosenbaum & Rubin (1983) 提出倾向得分(propensity score)的概念,奠定了基于倾向得分加权处理缺失数据与选择偏差的方法基础。其核心思想是:给定协变量 X,响应概率 P(R=1|X) 可以平衡处理组与对照组的协变量分布。
- 主要进展:Robins, Rotnitzky & Zhao (1994) 提出双重稳健估计(doubly robust estimation),开创性地证明:只要倾向得分模型或结果回归模型之一正确指定,估计量就是相合的。这极大地放宽了单一模型正确指定的要求。Scharfstein, Rotnitzky & Robins (1999) 进一步系统化了双重稳健框架在缺失数据中的应用。
- 当前 frontier: 双重稳健估计的后续发展集中在几个方向:(1) 提高对两个模型都误设时的稳健性(如 Kang & Schafer (2007) 的著名反例揭示了双重稳健估计在模型轻微误设时可能表现极差);(2) 处理高维协变量下的模型选择问题(如 Belloni, Chernozhukov & Hansen (2014) 的 double/debiased machine learning);(3) 处理离群值或重尾数据对加权估计的影响。
- 本文的位置: 本文在双重稳健框架内,引入信息投影(information projection) 这一工具,提出一种新的稳健加权估计方法。其创新点在于:(1) 通过间接模型校准约束构造 DR 估计量;(2) 将信息投影推广到离群值稳健估计,这是对现有 DR 方法在稳健性维度上的一个补充。
子线索聚类¶
这些被引文献大致落在以下子线索上: 1. 倾向得分加权与校准(Calibration Weighting):如 Deville & Särndal (1992) 的校准估计(calibration estimator),通过调整权重使加权样本的协变量均值与总体均值匹配。本文的信息投影方法可视为一种特殊的校准方法。 2. 双重稳健估计(Doubly Robust Estimation):如 Robins, Rotnitzky & Zhao (1994)、Scharfstein, Rotnitzky & Robins (1999)、Bang & Robins (2005)。这是本文的直接竞争与基础框架。 3. 稳健估计与离群值处理(Robust Estimation & Outlier Handling):如 Huber (1964) 的 M-估计,以及 Lee & Nelder (1996) 的稳健广义线性模型。本文将其与信息投影结合。 4. 缺失数据下的模型诊断与敏感性分析:如 Kang & Schafer (2007) 对双重稳健估计脆弱性的诊断,以及 Robins, Rotnitzky & Scharfstein (2000) 的敏感性分析框架。
这个方向在追问的核心问题¶
- 如何构造对两个模型都误设时仍保持良好表现的估计量? 当前主流方法是使用更灵活的非参数或机器学习模型(如 DML),但代价是理论分析复杂化。
- 如何提高加权估计对离群值的稳健性? 传统的倾向得分加权(如 IPW)对极端权重非常敏感,一个离群值可能主导整个估计。现有方法包括截断权重(truncation)或使用稳健的损失函数。
- 如何在高维协变量下进行有效的模型选择与估计? 这是 DML 和正则化方法(如 LASSO)的领域,但如何与双重稳健框架结合仍是活跃研究。
- 如何将校准思想与双重稳健框架统一? 本文正是试图回答这个问题,通过信息投影提供一个统一的视角。
⚠️ 作者的 framing¶
作者将缺口 frame 成:现有双重稳健估计方法在处理离群值方面存在不足,且其构造方式(通常基于显式的倾向得分模型和结果回归模型)可以统一到信息投影的框架下。作者通过引入信息投影,声称其方法不仅对模型误设稳健,还能通过调整投影权重来应对离群值,从而“填补了双重稳健估计在离群值稳健性方面的空白”。
被淡化或回避的竞争路线: - DML(Double/Debiased Machine Learning):作者在引言中提到了 Chernozhukov et al. (2018) 的 DML 框架,但将其定位为“使用机器学习模型”的方法,而本文是“基于参数模型的信息投影”。作者没有深入讨论 DML 在处理高维或复杂模型时的优势,而是强调其参数模型的简洁性与可解释性。 - 截断权重(Weight Truncation):这是处理离群值最直接的方法,作者在引言中仅一笔带过,没有与本文方法进行详细比较。截断权重简单有效,但会引入偏差,本文方法是否在偏差-方差权衡上优于截断,是读者需要自行判断的。
什么明显该被引 / 该存在、却没出现在 intro 里? - Tan (2010) 的“正则化校准”(Regularized Calibration)方法,它通过惩罚项处理极端权重,与本文的信息投影在目标上高度重叠。作者没有引用 Tan (2010) 是一个值得注意的缺失。 - Vermeulen & Vansteelandt (2015) 的“偏差校正双重稳健估计”(Bias-corrected doubly robust estimation),它通过调整估计方程来减少有限样本偏差,与本文的“内部偏差校准”有概念上的联系。
张力¶
未见明显对立引用。所有被引工作基本都认同双重稳健估计的价值,分歧主要在于如何进一步提高其稳健性(对模型误设、对离群值、对高维数据)。本文与 DML 框架之间可能存在一种“参数 vs. 非参数”的张力,但作者没有将其呈现为对立。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( Y \):结果变量(outcome variable),可能存在缺失。
- \( X \):完全观测的协变量向量(fully observed covariates)。
- \( R \):响应指示变量(response indicator),\( R=1 \) 表示 \( Y \) 被观测到,\( R=0 \) 表示缺失。
- \( \pi(X) = P(R=1|X) \):倾向得分(propensity score),即给定 \( X \) 下 \( Y \) 被观测到的概率。
- \( m(X) = E[Y|X, R=1] \):结果回归模型(outcome regression model),即给定 \( X \) 和观测到 \( Y \) 的条件下 \( Y \) 的条件期望。
- \( \theta = E[Y] \):目标参数(target parameter),即总体的无条件均值。
- \( w_i \):样本权重(sample weight),用于加权估计。
- \( \beta \):倾向得分模型 \( \pi(X; \beta) \) 的参数。
-
\( \alpha \):结果回归模型 \( m(X; \alpha) \) 的参数。
-
模型:
- 缺失机制:假设为随机缺失(MAR),即 \( R \perp Y | X \)。这意味着给定 \( X \),\( Y \) 是否缺失与 \( Y \) 本身无关。
- 倾向得分模型:假设为参数模型,如 logistic 回归:\( \pi(X; \beta) = \exp(X^T\beta) / (1 + \exp(X^T\beta)) \)。
-
结果回归模型:假设为参数模型,如线性回归:\( m(X; \alpha) = X^T\alpha \)。
-
可观测数据:
- 研究者观测到 \( n \) 个独立同分布的样本 \( \{ (X_i, R_i, R_i Y_i) \}_{i=1}^n \)。
- 当 \( R_i=1 \) 时,\( Y_i \) 被观测到;当 \( R_i=0 \) 时,\( Y_i \) 缺失。
- 想要但观测不到的量:所有缺失的 \( Y_i \)(即 \( R_i=0 \) 时的 \( Y_i \))。目标参数 \( \theta = E[Y] \) 正是基于这些缺失值的总体均值。
第二步:讲最小内核¶
最简特例: 假设我们只有一个协变量 \( X \)(一维),且 \( X \) 是二值的(0 或 1)。我们想估计 \( \theta = E[Y] \)。倾向得分模型为 \( \pi(X; \beta) = \exp(\beta_0 + \beta_1 X) / (1 + \exp(\beta_0 + \beta_1 X)) \)。结果回归模型为 \( m(X; \alpha) = \alpha_0 + \alpha_1 X \)。
核心思路(信息投影): 传统的双重稳健估计量是:
本文的核心想法是:我们不直接使用估计的 \( \hat{\pi} \),而是通过“信息投影”来寻找一组新的权重 \( w_i \),使得加权后的样本在某种意义下“校准”到总体。具体来说,我们寻找一组权重 \( w_i \),使得: 1. \( w_i \) 尽可能接近 \( 1/\hat{\pi}(X_i) \)(即原始的 IPW 权重),但受限于某些校准约束。 2. 校准约束是:加权后的协变量均值等于总体协变量均值,即 \( \sum_{i=1}^n w_i X_i = \sum_{i=1}^n X_i \)(这里假设总体均值已知或可用样本均值近似)。
为什么这能实现双重稳健? 如果结果回归模型 \( m(X; \alpha) \) 正确指定,那么即使倾向得分模型误设,通过校准约束,加权后的样本也能在协变量分布上与总体匹配,从而得到相合的估计。如果倾向得分模型正确指定,那么 \( 1/\hat{\pi}(X_i) \) 本身就是好的权重,信息投影会倾向于保持这些权重不变。
离群值稳健性: 当存在离群值时,某些 \( Y_i \) 会异常大或小。传统的 IPW 权重 \( 1/\hat{\pi}(X_i) \) 会放大这些离群值的影响。本文通过信息投影,可以调整投影的“距离度量”,例如使用 \( L_1 \) 距离(而不是 \( L_2 \) 距离),从而产生对离群值更稳健的权重。这相当于在寻找权重时,不强制要求权重严格等于 \( 1/\hat{\pi}(X_i) \),而是允许权重有更大的偏差,从而“稀释”离群值的影响。
一句话总结: 本文的核心数学操作是在“接近原始 IPW 权重”和“满足协变量校准约束”之间寻找一个平衡点,这个平衡点通过最小化一个带约束的散度(如 Kullback-Leibler 散度)来实现,并且可以通过调整散度函数来获得对离群值的稳健性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在 MAR 缺失数据下,如何构造一个对模型误设和离群值都稳健的倾向得分加权估计量。
- 核心工具 / 方法:信息投影(information projection),通过最小化一个带约束的散度函数(如 KL 散度)来获得一组校准权重,并推广到使用稳健散度(如 \( L_1 \) 散度)来处理离群值。
- 主要结论:提出的估计量是双重稳健的(当倾向得分模型或结果回归模型之一正确指定时相合),且渐近正态。通过调整投影的散度函数,可以构造对离群值稳健的版本。
关键设定与假设¶
- 设定:独立同分布样本 \( \{ (X_i, R_i, R_i Y_i) \}_{i=1}^n \),\( Y \) 在 \( R=0 \) 时缺失。
- 假设 1 (MAR):\( R \perp Y | X \)。这是缺失数据推断的标准假设。
- 假设 2 (倾向得分模型):\( \pi(X; \beta) \) 是已知形式的参数模型(如 logistic),且参数 \( \beta \) 可通过最大似然估计(MLE)相合估计。
- 假设 3 (结果回归模型):\( m(X; \alpha) \) 是已知形式的参数模型(如线性),且参数 \( \alpha \) 可通过加权最小二乘(WLS)相合估计。
- 假设 4 (正则性条件):包括矩条件、模型可识别性、参数空间紧致性等标准正则性条件,用于保证 M-估计的渐近性质。
- 相比已有文献的强化/放宽:本文没有放宽 MAR 假设或模型形式,而是在估计方法上进行了创新。相比传统的 DR 估计,本文的方法在理论上提供了对离群值稳健的扩展,这是对现有 DR 框架的补充而非替代。
主要结果¶
- 定理 1 (双重稳健性):在假设 1-4 下,如果倾向得分模型 \( \pi(X; \beta) \) 或结果回归模型 \( m(X; \alpha) \) 之一正确指定,那么基于信息投影的估计量 \( \hat{\theta}_{IP} \) 是相合的,即 \( \hat{\theta}_{IP} \xrightarrow{p} \theta \)。
- 直觉:信息投影的校准约束确保了加权样本的协变量分布与总体匹配。如果结果回归模型正确,那么即使权重有偏,校准后的加权均值也能正确估计 \( \theta \)。如果倾向得分模型正确,那么信息投影会倾向于产生与 IPW 接近的权重,从而继承 IPW 的相合性。
- 必要条件:校准约束必须包含所有影响 \( Y \) 的协变量(即 \( X \) 本身)。如果校准约束遗漏了重要变量,双重稳健性可能失效。
-
解决的技术难点:如何证明信息投影产生的权重确实能实现双重稳健性,而不是仅仅满足校准约束。作者通过将信息投影估计量等价地表示为“内部偏差校准条件下的双重稳健回归插补估计”,从而将问题转化为标准 DR 估计的理论框架。
-
定理 2 (渐近正态性):在假设 1-4 下,\( \sqrt{n}(\hat{\theta}_{IP} - \theta) \xrightarrow{d} N(0, V) \),其中 \( V \) 是渐近方差,可以通过 sandwich 估计量相合估计。
- 直觉:这是 M-估计的标准结果,因为信息投影估计量可以看作是一个 M-估计量(通过最小化散度得到)。
-
必要条件:需要估计的倾向得分和结果回归模型参数是 \( \sqrt{n} \)-相合的。
-
定理 3 (离群值稳健性):通过将信息投影中的散度函数从 KL 散度替换为 \( L_1 \) 散度(或其他稳健散度),得到的估计量 \( \hat{\theta}_{RIP} \) 具有有界的影响函数(bounded influence function),从而对离群值稳健。
- 直觉:\( L_1 \) 散度对大的偏差(即离群值对应的极端权重)惩罚更轻,因此允许权重偏离原始 IPW 权重更远,从而“稀释”离群值的影响。
- 必要条件:需要选择合适的稳健散度函数,并证明其对应的估计量仍具有相合性和渐近正态性(可能是在更弱的矩条件下)。
证明路线与技术技巧¶
- 整体路线:
- 定义信息投影估计量:通过最小化一个带校准约束的散度函数来定义权重 \( w_i \)。
- 等价表示:证明信息投影估计量等价于一个“内部偏差校准条件下的双重稳健回归插补估计”。具体来说,\( \hat{\theta}_{IP} = \frac{1}{n} \sum_{i=1}^n [R_i Y_i / \hat{\pi}_i^* + (1 - R_i / \hat{\pi}_i^*) \hat{m}_i^*] \),其中 \( \hat{\pi}_i^* \) 和 \( \hat{m}_i^* \) 是通过信息投影校准后的倾向得分和结果回归模型。
- 转化为 M-估计:将上述等价形式视为一个 M-估计问题,其中参数包括倾向得分模型参数 \( \beta \)、结果回归模型参数 \( \alpha \),以及一个拉格朗日乘子(来自校准约束)。
- 应用 M-估计理论:利用标准 M-估计的渐近理论(如 van der Vaart (1998)),证明估计量的相合性和渐近正态性。关键在于验证目标函数满足一致收敛性和可微性条件。
-
稳健性推广:将 KL 散度替换为稳健散度(如 \( L_1 \) 散度),并证明其影响函数有界。这通常需要重新推导估计方程,并证明其解的存在性和唯一性。
-
关键跳跃点:
- 从信息投影到 DR 估计的等价性:这是本文最核心的洞察。作者需要证明,通过求解一个带约束的优化问题得到的权重,恰好可以写成 DR 估计量的形式。这个等价性将信息投影这个看似新颖的工具与成熟的 DR 理论连接起来,使得后续的渐近分析变得可行。
-
处理校准约束中的拉格朗日乘子:校准约束引入了额外的参数(拉格朗日乘子),这些参数也需要估计。作者需要证明,这些额外参数的估计不影响目标参数 \( \theta \) 的渐近性质(即它们是“讨厌参数”)。
-
技术技巧点名:
- M-估计理论:用于证明相合性和渐近正态性。作者将整个估计问题(包括权重计算和参数估计)视为一个联合 M-估计问题。
- 影响函数(Influence Function):用于分析离群值稳健性。通过计算估计量的影响函数,并证明其在稳健散度下是有界的,从而证明其对离群值的稳健性。
- 拉格朗日对偶(Lagrangian Duality):用于求解带约束的优化问题。信息投影问题可以转化为一个无约束的对偶问题,从而简化计算。
- Sandwich 方差估计:用于估计渐近方差,这是 M-估计的标准做法。
真实例子与应用¶
- 数据:来自 Conservation Effects Assessment Project (CEAP) 的数据,这是一个评估美国农业保护措施效果的调查项目。
- 场景:目标变量是“农民是否采用某种保护措施”(二值变量),存在缺失。协变量包括农场规模、作物类型、地理位置等。
- 方法应用:作者将本文提出的稳健信息投影估计量(RIP)应用于该数据,估计采用保护措施的比例。他们比较了 RIP 与标准 IPW、双重稳健估计(DR)以及截断权重的 DR 估计(DR-Trunc)的表现。
- 结果:RIP 估计量给出的估计值介于 IPW 和 DR 之间,且其标准误比 DR 更小。在存在离群值(如极端大的农场规模)的情况下,RIP 的估计值比 DR 更稳定,且对截断阈值不敏感。
- 这个例子想说明什么:验证本文方法在实际数据中的可行性,并展示其在处理离群值方面的优势。它表明 RIP 不仅是一个理论上的创新,而且在实际应用中也能提供更稳健的推断。
🔎 结论是否比证明窄¶
- 结论:作者声称其方法对“模型设定偏差”和“离群值”都稳健。
- 证明:定理 1 和 2 的证明严格依赖于参数模型假设(倾向得分和结果回归模型都是参数形式)。对于“模型设定偏差”的稳健性,证明只覆盖了“其中一个模型正确指定”的情况(即双重稳健性)。对于“两个模型都误设”的情况,作者没有给出理论保证,仅通过模拟研究进行了探索。
- 差距:作者在结论中使用的“稳健”一词,在理论证明中实际上被限定为“双重稳健”和“对离群值稳健”。对于更广泛的模型误设(如两个模型都轻微误设),本文的理论并未覆盖。这是一个值得注意的窄化。
四、开放问题¶
- 高维协变量下的扩展:本文的方法依赖于参数模型。当协变量维度 \( p \) 很大(甚至 \( p > n \))时,如何将信息投影与正则化方法(如 LASSO)结合,以进行有效的模型选择和估计?这扎根于本文的“参数模型”设定,以及引言中提到的 DML 框架。
- 非参数或半参数模型下的信息投影:能否将信息投影的思想推广到非参数或半参数模型?例如,使用核方法或样条来估计倾向得分和结果回归模型,然后通过信息投影进行校准?这扎根于本文的“参数模型”假设,以及作者在结论中提到的“未来工作”。
- 与其他稳健方法的比较:本文的稳健信息投影方法与截断权重、正则化校准(Tan 2010)等方法相比,在有限样本下的偏差-方差权衡如何?是否存在一个统一的框架来理解这些不同的稳健化策略?这扎根于作者在引言中回避的竞争路线(截断权重、Tan 2010)。
- 纵向数据或复杂抽样下的应用:本文的方法能否扩展到纵向数据(如重复测量)或复杂抽样设计(如分层抽样)?这扎根于研究者(陈星宇)的 primary interest 中的“longitudinal”因果推断,以及本文方法在 CEAP 数据上的应用(该数据可能具有复杂抽样结构)。
Maintained by 陈星宇 · Homepage · Source on GitHub