跳转至

Boosting Prediction with Data Missing Not at Random

作者: Yuan Bian, Grace Y. Yi, Wenqing He
来源: Journal of Computational and Graphical Statistics
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本方向的核心问题是:当响应变量(outcome)存在缺失,且缺失机制不可忽略(Missing Not At Random, MNAR)时,如何利用boosting这类非参数集成学习方法进行预测,并保证预测的相合性。 其根本挑战在于,MNAR意味着缺失概率依赖于未观测到的响应值本身,直接对完整观测数据拟合boosting模型会产生选择性偏差。当前该子方向的成熟度较低——boosting的理论分析本就薄弱,而将其与MNAR下的半参数校正结合的工作更是稀少。

发展脉络(history)

作者在引言中梳理了三条交织的线索,将其串成一条从“完全数据boosting”到“缺失数据boosting”的演进线:

  1. 奠基工作:Boosting的理论化。Friedman (2001) 将boosting重新解释为函数空间中的梯度下降(functional gradient descent),奠定了其统计学习基础。Bühlmann & Yu (2003) 证明了L2Boosting的相合性,但仅限于完全观测数据。这些工作为后续的缺失数据扩展提供了算法框架,但未涉及任何缺失机制

  2. 主要进展:缺失数据下的预测方法。作者引用了两条平行路线:

    • 基于完整观测的加权:Little & Rubin (2019) 的经典教材系统化了缺失数据框架,但主要关注参数模型。Robins, Rotnitzky & Zhao (1994) 提出了逆概率加权(IPW)双重稳健(DR) 估计,用于处理缺失协变量或响应,但这些方法最初是为参数/半参数模型设计的,未与boosting等非参数集成方法结合
    • Boosting的缺失数据扩展:作者指出,现有boosting变体(如XGBoost, LightGBM)在处理缺失值时,通常采用“默认方向”(将缺失值分到增益最大的子节点)或“代理分裂”(用其他特征近似)。这些方法本质上是启发式的,缺乏对MNAR机制的理论校正,且未证明估计量的相合性
  3. 当前Frontier:半参数校正与boosting的结合。本文是作者声称的“显然的下一步”:将半参数缺失数据处理框架(IPW/DR)嵌入boosting的函数梯度下降算法中,并给出收敛性与相合性证明。作者特别强调,现有文献中没有工作同时做到:(a) 处理MNAR响应缺失,(b) 使用boosting进行预测,(c) 提供严格的算法收敛性和估计量相合性证明。

  4. 本文的位置:本文填补了“半参数缺失校正”与“非参数boosting”之间的空白。它不是一个全新的理论突破,而是将两个成熟框架(半参数IPW/DR + 函数梯度下降)进行系统整合,并给出了整合后的理论性质。

子线索聚类

被引文献大致落在以下三条子线索上:

  • 线索A:Boosting的理论与算法(Friedman 2001; Bühlmann & Yu 2003; Bühlmann & Hothorn 2007)。这一簇关注boosting作为函数空间优化方法的统计性质,但完全忽略缺失数据
  • 线索B:缺失数据的半参数估计(Little & Rubin 2019; Robins, Rotnitzky & Zhao 1994; Tsiatis 2006)。这一簇发展了IPW、DR、多重插补等框架,但主要针对参数或低维模型,且通常关注均值或回归系数的估计,而非预测。
  • 线索C:缺失数据下的机器学习(作者引用了少量工作,如一些将缺失值作为特征或使用代理分裂的boosting变体)。这一簇是启发式的,缺乏理论保证,且未区分MAR与MNAR

这个方向在追问的核心问题

  1. 如何将半参数缺失校正(IPW/DR)嵌入boosting的迭代优化过程? 损失函数如何调整?梯度如何计算?
  2. 在MNAR下,boosting算法的收敛性是否仍然成立? 函数梯度下降的收敛性证明依赖于损失函数的凸性/光滑性,而IPW/DR损失是否保持这些性质?
  3. 估计量的相合性如何建立? 当boosting迭代次数随样本量增长时,预测函数能否收敛到最优预测函数?这需要处理boosting的“早停”与缺失机制估计误差之间的交互。
  4. 缺失机制模型(倾向性得分)的误设定对预测的影响有多大? DR方法声称对倾向性得分或结果回归之一正确设定时仍相合,但这一性质在boosting的非参数框架下是否保持?

⚠️ 作者的framing

作者将缺口frame成:“现有boosting方法要么假设完全数据,要么用启发式处理缺失值;现有半参数缺失方法要么是参数化的,要么不关注预测。因此,将半参数校正嵌入boosting是显然的下一步。” 作者淡化了以下竞争路线: - 多重插补(MI)+ Boosting:先对缺失响应进行多重插补(假设MAR),再用boosting拟合插补后的完整数据。作者仅在引言中简短提及,认为MI依赖于可忽略性假设(MAR),而本文方法可直接处理MNAR。但作者未讨论:如果缺失机制实际上是MAR,MI+Boosting是否比本文的IPW/DR-Boosting更有效?这是一个值得研究者去查的张力点。 - 直接使用完整观测的boosting + 事后校正:例如,先用boosting拟合完整观测,再用倾向性得分对预测进行加权。作者未讨论这种两步法是否可行。

什么明显该被引/该存在、却没出现在intro里? - 高维缺失数据下的boosting:如使用L1正则化的boosting变体(如Sparse Boosting)在缺失数据下的表现。本文的设定是低维(协变量维数固定),未涉及高维。 - 与“缺失协变量”而非“缺失响应”的对比:本文只处理响应缺失。如果协变量也有缺失,问题会更复杂,但作者未提及这一扩展方向。 - 因果推断中的缺失数据文献:如Hernán & Robins (2020) 的因果推断教材中关于缺失数据与censoring的章节。本文的IPW/DR框架与因果推断中的逆概率加权处理效应(IPTW)高度同构,但作者未明确建立这一联系。

张力

未见明显对立引用。所有被引工作基本是互补的:boosting文献不处理缺失,缺失数据文献不处理boosting。唯一的潜在张力是:MI+Boosting(假设MAR) vs. IPW/DR-Boosting(允许MNAR)——前者在MAR下可能更高效,后者在MNAR下更稳健。但作者未直接比较。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \( (X, Y) \):协变量向量 \( X \in \mathbb{R}^p \) 和响应变量 \( Y \in \mathbb{R} \)\( Y \)潜在的(可能缺失)。
  • \( R \):缺失指示符,\( R = 1 \) 表示 \( Y \) 被观测到,\( R = 0 \) 表示缺失。
  • \( \pi(X, Y) = P(R = 1 \mid X, Y) \)倾向性得分,即给定 \( (X, Y) \)\( Y \) 被观测到的概率。这是缺失机制的核心参数。
  • \( f(X) \):预测函数,目标是估计 \( f_0(X) = \mathbb{E}[Y \mid X] \)(条件期望)。
  • \( L(Y, f(X)) \):损失函数,如平方损失 \( (Y - f(X))^2 \)
  • \( \{(X_i, R_i, R_i Y_i) : i = 1, \dots, n\} \):可观测数据。注意:当 \( R_i = 0 \) 时,\( Y_i \)不可观测的。
  • \( \theta \):倾向性得分模型 \( \pi(X, Y; \theta) \) 的参数(如逻辑回归系数)。
  • \( \hat{\theta} \)\( \theta \) 的估计量(通常通过某种模型拟合得到)。

  • 模型

  • 数据生成机制\( (X, Y) \) 来自某个联合分布 \( P_{X,Y} \)。缺失机制由 \( \pi(X, Y) \) 控制:\( R \mid (X, Y) \sim \text{Bernoulli}(\pi(X, Y)) \)
  • MNAR设定\( \pi(X, Y) \) 显式依赖于 \( Y \),即 \( P(R = 1 \mid X, Y) \neq P(R = 1 \mid X) \)。这意味着缺失概率不仅取决于协变量,还取决于未观测到的响应值本身。
  • 已知/未知\( \pi(X, Y) \) 的函数形式未知,需要建模(如参数化逻辑回归)。\( f_0(X) \)目标,无参数形式假设。
  • 要估的对象:预测函数 \( f(X) \),使得 \( \mathbb{E}[L(Y, f(X))] \) 最小化。

  • 可观测数据

  • 实际能观测到\( X_i \)(总是观测到),\( R_i \)(总是观测到),以及当 \( R_i = 1 \) 时的 \( Y_i \)
  • 想要但观测不到:当 \( R_i = 0 \) 时的 \( Y_i \)。这是缺失数据问题的核心困难。
  • 关键识别条件:为了从可观测数据中识别 \( f_0(X) \),需要假设缺失机制模型 \( \pi(X, Y; \theta) \)正确设定的(或至少部分正确,如DR方法允许结果回归模型正确)。否则,估计量会有偏。

第二步:讲最小内核

最简特例:假设 \( Y \) 是二值的(\( Y \in \{0, 1\} \)),协变量 \( X \) 是单维的(\( p = 1 \)),且缺失机制是已知的逻辑回归模型:

\[\pi(X, Y) = \frac{\exp(\alpha + \beta X + \gamma Y)}{1 + \exp(\alpha + \beta X + \gamma Y)},\]
其中 \( \gamma \neq 0 \) 表示MNAR(缺失概率依赖于 \( Y \))。假设 \( \alpha, \beta, \gamma \)已知常数(这是最简情形,实际中需要估计)。

核心思路:在完全数据下,boosting通过函数梯度下降最小化经验损失 \( \frac{1}{n} \sum_{i=1}^n (Y_i - f(X_i))^2 \)。但在MNAR下,我们只能观测到 \( R_i = 1 \)\( Y_i \),直接对完整观测拟合boosting会最小化 \( \frac{1}{\sum R_i} \sum_{R_i=1} (Y_i - f(X_i))^2 \),这等价于对缺失概率加权后的条件分布进行拟合,导致有偏。

IPW校正:将每个完整观测的损失逆概率加权

\[L_{\text{IPW}}(Y_i, f(X_i); \pi_i) = \frac{R_i}{\pi(X_i, Y_i)} (Y_i - f(X_i))^2.\]
直觉:\( \pi(X_i, Y_i) \) 越小,该观测被观测到的概率越低,其“代表性”越强,因此权重越大。在已知 \( \pi \) 的最简情形下,\( \mathbb{E}[L_{\text{IPW}} \mid X] = \mathbb{E}[(Y - f(X))^2 \mid X] \),即IPW损失是无偏的

Boosting过程:在每一步迭代 \( m \): 1. 计算当前预测函数 \( f^{(m-1)}(X) \) 下的负梯度(对 \( f \) 的导数):

\[g_i^{(m)} = -\frac{\partial L_{\text{IPW}}(Y_i, f; \pi_i)}{\partial f} \bigg|_{f = f^{(m-1)}(X_i)} = \frac{2R_i}{\pi_i} (Y_i - f^{(m-1)}(X_i)).\]
2. 用基学习器(如决策树)拟合梯度 \( g_i^{(m)} \)\( X_i \) 的回归,得到更新方向 \( h^{(m)}(X) \)。 3. 更新:\( f^{(m)}(X) = f^{(m-1)}(X) + \nu h^{(m)}(X) \),其中 \( \nu \) 是学习率。

为什么成立:在已知 \( \pi \) 下,IPW损失是原始完全数据损失的无偏代理。函数梯度下降在凸损失下保证收敛到全局最优(平方损失是凸的)。因此,boosting迭代收敛到 \( f_0(X) = \mathbb{E}[Y \mid X] \)

推广到一般情形:当 \( \pi \) 未知时,需要用估计量 \( \hat{\pi}(X, Y) \) 代替。这引入了估计误差,需要证明其不影响相合性。DR方法则进一步引入结果回归模型 \( \hat{\mu}(X) = \hat{\mathbb{E}}[Y \mid X, R=1] \),使得只要 \( \pi \)\( \mu \) 之一正确设定,估计量仍相合。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:当响应变量 \( Y \) 存在MNAR缺失时,如何设计boosting预测方法,使得预测函数 \( f(X) \) 的估计是相合的。
  2. 核心工具/方法:将半参数缺失数据处理中的逆概率加权(IPW)双重稳健(DR) 损失函数嵌入boosting的函数梯度下降算法中,并给出算法收敛性和估计量相合性的理论证明。
  3. 主要结论:所提出的IPW-Boosting和DR-Boosting算法在正则条件下收敛到最优预测函数;估计量的相合性成立;数值实验表明,在MNAR下,所提方法显著优于忽略缺失的boosting和基于完整观测的boosting。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 缺失机制模型:假设 \( \pi(X, Y; \theta) \) 是参数化的(如逻辑回归),且 \( \theta \) 通过极大似然估计(基于可观测的 \( (X_i, R_i, R_i Y_i) \))得到。作者假设缺失机制模型是正确设定的(对于IPW方法),或至少倾向性得分模型或结果回归模型之一正确(对于DR方法)。
  • 正则条件
  • 倾向性得分有界远离0:存在 \( \delta > 0 \) 使得 \( \pi(X, Y) \geq \delta \) 几乎必然。这是IPW估计的经典条件,避免权重爆炸。
  • 损失函数的光滑性与凸性:平方损失满足这些性质,保证函数梯度下降的收敛性。
  • 基学习器的逼近能力:假设基学习器(如决策树)可以一致逼近任意平方可积函数(通用逼近性质)。
  • 独立同分布样本\( (X_i, Y_i, R_i) \) 是i.i.d.的。
  • 相比已有文献的强化/放宽
  • 强化:相比仅处理MAR的boosting变体,本文明确允许MNAR,这是更强的缺失假设(更一般,但需要更强的识别条件)。
  • 放宽:相比参数化的半参数缺失方法,本文对 \( f(X) \) 不做参数形式假设,允许非参数估计,这是更弱的模型假设

主要结果

本文是方法型+理论型混合:提出算法并证明其理论性质。核心结果如下:

  • 定理1(算法收敛性):在正则条件下,IPW-Boosting和DR-Boosting算法的函数梯度下降迭代收敛到损失函数的全局最小值(对于凸损失)。直觉:IPW/DR损失是原始完全数据损失的无偏代理,且保持凸性,因此函数梯度下降的收敛性证明(如Bühlmann & Yu 2003)可直接推广。必要条件:倾向性得分有界远离0;学习率足够小。
  • 定理2(估计量相合性):当boosting迭代次数 \( M \) 随样本量 \( n \) 以适当速率增长(如 \( M = o(n) \)\( M = O(\log n) \))时,所得到的预测函数 \( \hat{f}_n(X) \) 满足 \( \mathbb{E}[(\hat{f}_n(X) - f_0(X))^2] \to 0 \) 依概率。直觉:boosting的“早停”起到了正则化作用,防止过拟合;IPW/DR校正消除了缺失偏差。解决的技术难点:需要处理倾向性得分估计误差与boosting迭代误差的交互——作者通过假设倾向性得分估计的 \( \sqrt{n} \)-相合性,并控制boosting的逼近误差,最终得到相合性。
  • 推论(DR方法的双重稳健性):如果倾向性得分模型或结果回归模型之一正确设定,则DR-Boosting的估计量仍相合。这是半参数理论的标准结果在boosting框架下的推广

证明路线与技术技巧

整体路线(以IPW-Boosting为例): 1. 步骤1:将boosting视为函数空间中的梯度下降。定义损失泛函 \( \mathcal{L}(f) = \mathbb{E}[L_{\text{IPW}}(Y, f(X); \pi)] \)。boosting迭代 \( f^{(m)} = f^{(m-1)} - \nu \nabla \mathcal{L}(f^{(m-1)}) \)(在函数空间中)。 2. 步骤2:证明损失泛函的凸性与光滑性。平方损失是凸的,IPW加权不改变凸性。因此,梯度下降收敛到全局最小值。 3. 步骤3:处理倾向性得分估计误差。用 \( \hat{\pi} \) 代替 \( \pi \) 引入额外误差。作者证明,如果 \( \hat{\pi} \)\( \sqrt{n} \)-相合的(如MLE),则 \( \mathcal{L}_{\hat{\pi}}(f) \)\( \mathcal{L}_{\pi}(f) \) 的差异是 \( o_p(1) \) 的,不影响收敛性。 4. 步骤4:建立相合性。将boosting的“早停”视为一种正则化。通过控制偏差-方差权衡:迭代次数 \( M \) 太小则逼近误差大(欠拟合),太大则方差大(过拟合)。作者证明,当 \( M \) 以适当速率增长时,估计量的MSE趋于0。 5. 步骤5:推广到DR。DR损失 \( L_{\text{DR}} = \frac{R}{\pi}(Y - f)^2 + (1 - \frac{R}{\pi})(\mu - f)^2 \) 具有双重稳健性。证明路线类似,但需要额外处理结果回归模型 \( \mu \) 的估计误差。

关键跳跃点: - 跳跃点1:从“已知倾向性得分”到“估计倾向性得分”。这是最吃功夫的部分。作者需要证明,倾向性得分的估计误差不会破坏boosting的收敛性。关键引理是:\( \sup_{f \in \mathcal{F}} |\mathcal{L}_{\hat{\pi}}(f) - \mathcal{L}_{\pi}(f)| = o_p(1) \),其中 \( \mathcal{F} \) 是boosting迭代产生的函数类。这需要一致大数定律和倾向性得分估计的相合性。 - 跳跃点2:控制boosting迭代次数 \( M \)。与经典boosting理论不同,这里 \( M \) 的选择需要同时考虑缺失偏差校正和函数逼近。作者通过假设 \( M = o(n) \) 来保证方差可控,同时通过基学习器的逼近性质保证偏差衰减。

技术技巧点名: - 经验过程理论(Empirical Process):用于证明 \( \sup_{f} |\mathcal{L}_{\hat{\pi}}(f) - \mathcal{L}_{\pi}(f)| = o_p(1) \),需要控制函数类 \( \mathcal{F} \) 的熵或覆盖数。 - 函数梯度下降(Functional Gradient Descent):boosting的核心算法框架,将参数优化推广到函数空间。 - 半参数影响函数(Semiparametric Influence Function):DR损失的设计源于半参数理论中的高效影响函数,使得估计量对倾向性得分或结果回归模型的误设定具有鲁棒性。 - 交叉验证(用于选择 \( M \):作者建议使用交叉验证选择boosting迭代次数,这是实践中的标准做法,但理论分析中假设 \( M \) 是预先确定的。

真实例子与应用

本文包含模拟实验,但没有真实数据例子

  • 模拟设定:生成 \( X \sim \text{Uniform}[-2, 2] \)\( Y = \sin(X) + \epsilon \)\( \epsilon \sim N(0, 0.5^2) \))。缺失机制为逻辑回归:\( \logit(\pi(X, Y)) = \alpha + \beta X + \gamma Y \),其中 \( \gamma = 1 \) 表示MNAR。样本量 \( n = 200, 500 \)
  • 方法应用:比较四种方法:(a) 完整观测boosting(忽略缺失),(b) 完整数据boosting(作为Oracle基准),(c) IPW-Boosting,(d) DR-Boosting。使用平方损失,基学习器为决策树桩(stump),迭代次数由交叉验证选择。
  • 结果:在MNAR下,完整观测boosting的预测MSE显著高于Oracle(偏差明显)。IPW-Boosting和DR-Boosting的MSE接近Oracle,且DR-Boosting在倾向性得分模型误设定时仍表现良好(验证双重稳健性)。当样本量从200增加到500时,所提方法的MSE进一步下降,与相合性理论一致。
  • 这个例子想说明什么:验证理论预测——IPW/DR校正能有效消除MNAR下的选择性偏差;DR方法对模型误设定更稳健;有限样本下性能良好。

🔎 结论是否比证明窄

  • 窄结论1:定理2的相合性证明依赖于倾向性得分估计的 \( \sqrt{n} \)-相合性。但作者在模拟中使用了参数化逻辑回归,这满足 \( \sqrt{n} \)-相合性。然而,如果倾向性得分模型是非参数高维的(如使用神经网络估计),\( \sqrt{n} \)-相合性可能不成立,此时定理2的结论是否仍成立?作者未讨论。
  • 窄结论2:算法收敛性证明假设损失函数是凸的(平方损失)。对于非凸损失(如0-1损失或Hinge损失),收敛性不保证。作者在结论部分提到“可扩展到其他损失”,但未给出证明,这更像一个conjecture。
  • 窄结论3:所有理论结果假设协变量维数 \( p \) 固定。当 \( p \)\( n \) 增长时(高维设定),boosting的相合性需要额外条件(如稀疏性),本文未涉及。

四、开放问题

  1. 高维协变量下的MNAR-Boosting:当 \( p \gg n \) 时,倾向性得分估计和boosting的相合性如何建立?是否需要稀疏性假设?这扎根于本文“协变量维数固定”的设定。
  2. 非参数倾向性得分估计:如果 \( \pi(X, Y) \) 用非参数方法(如随机森林或神经网络)估计,\( \sqrt{n} \)-相合性可能不成立,此时IPW/DR-Boosting的相合性是否仍成立?需要更弱的条件(如 \( n^{1/4} \)-相合性)?这扎根于定理2对 \( \sqrt{n} \)-相合性的依赖。
  3. 缺失协变量+缺失响应的联合处理:本文只处理响应缺失。如果协变量也有缺失(且可能是MNAR),如何扩展?这扎根于作者在引言中未讨论的“缺失协变量”场景。
  4. 与因果推断的显式连接:本文的IPW/DR框架与因果推断中的处理效应估计(如IPTW、AIPW)高度同构。能否将本文的boosting方法直接用于估计条件平均处理效应(CATE) 在缺失结果下的情况?这扎根于作者未建立的因果推断联系。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论