Boosting Prediction with Data Missing Not at Random¶
作者: Yuan Bian, Grace Y. Yi, Wenqing He
来源: Journal of Computational and Graphical Statistics
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本方向的核心问题是:当响应变量(outcome)存在缺失,且缺失机制不可忽略(Missing Not At Random, MNAR)时,如何利用boosting这类非参数集成学习方法进行预测,并保证预测的相合性。 其根本挑战在于,MNAR意味着缺失概率依赖于未观测到的响应值本身,直接对完整观测数据拟合boosting模型会产生选择性偏差。当前该子方向的成熟度较低——boosting的理论分析本就薄弱,而将其与MNAR下的半参数校正结合的工作更是稀少。
发展脉络(history)¶
作者在引言中梳理了三条交织的线索,将其串成一条从“完全数据boosting”到“缺失数据boosting”的演进线:
-
奠基工作:Boosting的理论化。Friedman (2001) 将boosting重新解释为函数空间中的梯度下降(functional gradient descent),奠定了其统计学习基础。Bühlmann & Yu (2003) 证明了L2Boosting的相合性,但仅限于完全观测数据。这些工作为后续的缺失数据扩展提供了算法框架,但未涉及任何缺失机制。
-
主要进展:缺失数据下的预测方法。作者引用了两条平行路线:
- 基于完整观测的加权:Little & Rubin (2019) 的经典教材系统化了缺失数据框架,但主要关注参数模型。Robins, Rotnitzky & Zhao (1994) 提出了逆概率加权(IPW) 和双重稳健(DR) 估计,用于处理缺失协变量或响应,但这些方法最初是为参数/半参数模型设计的,未与boosting等非参数集成方法结合。
- Boosting的缺失数据扩展:作者指出,现有boosting变体(如XGBoost, LightGBM)在处理缺失值时,通常采用“默认方向”(将缺失值分到增益最大的子节点)或“代理分裂”(用其他特征近似)。这些方法本质上是启发式的,缺乏对MNAR机制的理论校正,且未证明估计量的相合性。
-
当前Frontier:半参数校正与boosting的结合。本文是作者声称的“显然的下一步”:将半参数缺失数据处理框架(IPW/DR)嵌入boosting的函数梯度下降算法中,并给出收敛性与相合性证明。作者特别强调,现有文献中没有工作同时做到:(a) 处理MNAR响应缺失,(b) 使用boosting进行预测,(c) 提供严格的算法收敛性和估计量相合性证明。
-
本文的位置:本文填补了“半参数缺失校正”与“非参数boosting”之间的空白。它不是一个全新的理论突破,而是将两个成熟框架(半参数IPW/DR + 函数梯度下降)进行系统整合,并给出了整合后的理论性质。
子线索聚类¶
被引文献大致落在以下三条子线索上:
- 线索A:Boosting的理论与算法(Friedman 2001; Bühlmann & Yu 2003; Bühlmann & Hothorn 2007)。这一簇关注boosting作为函数空间优化方法的统计性质,但完全忽略缺失数据。
- 线索B:缺失数据的半参数估计(Little & Rubin 2019; Robins, Rotnitzky & Zhao 1994; Tsiatis 2006)。这一簇发展了IPW、DR、多重插补等框架,但主要针对参数或低维模型,且通常关注均值或回归系数的估计,而非预测。
- 线索C:缺失数据下的机器学习(作者引用了少量工作,如一些将缺失值作为特征或使用代理分裂的boosting变体)。这一簇是启发式的,缺乏理论保证,且未区分MAR与MNAR。
这个方向在追问的核心问题¶
- 如何将半参数缺失校正(IPW/DR)嵌入boosting的迭代优化过程? 损失函数如何调整?梯度如何计算?
- 在MNAR下,boosting算法的收敛性是否仍然成立? 函数梯度下降的收敛性证明依赖于损失函数的凸性/光滑性,而IPW/DR损失是否保持这些性质?
- 估计量的相合性如何建立? 当boosting迭代次数随样本量增长时,预测函数能否收敛到最优预测函数?这需要处理boosting的“早停”与缺失机制估计误差之间的交互。
- 缺失机制模型(倾向性得分)的误设定对预测的影响有多大? DR方法声称对倾向性得分或结果回归之一正确设定时仍相合,但这一性质在boosting的非参数框架下是否保持?
⚠️ 作者的framing¶
作者将缺口frame成:“现有boosting方法要么假设完全数据,要么用启发式处理缺失值;现有半参数缺失方法要么是参数化的,要么不关注预测。因此,将半参数校正嵌入boosting是显然的下一步。” 作者淡化了以下竞争路线: - 多重插补(MI)+ Boosting:先对缺失响应进行多重插补(假设MAR),再用boosting拟合插补后的完整数据。作者仅在引言中简短提及,认为MI依赖于可忽略性假设(MAR),而本文方法可直接处理MNAR。但作者未讨论:如果缺失机制实际上是MAR,MI+Boosting是否比本文的IPW/DR-Boosting更有效?这是一个值得研究者去查的张力点。 - 直接使用完整观测的boosting + 事后校正:例如,先用boosting拟合完整观测,再用倾向性得分对预测进行加权。作者未讨论这种两步法是否可行。
什么明显该被引/该存在、却没出现在intro里? - 高维缺失数据下的boosting:如使用L1正则化的boosting变体(如Sparse Boosting)在缺失数据下的表现。本文的设定是低维(协变量维数固定),未涉及高维。 - 与“缺失协变量”而非“缺失响应”的对比:本文只处理响应缺失。如果协变量也有缺失,问题会更复杂,但作者未提及这一扩展方向。 - 因果推断中的缺失数据文献:如Hernán & Robins (2020) 的因果推断教材中关于缺失数据与censoring的章节。本文的IPW/DR框架与因果推断中的逆概率加权处理效应(IPTW)高度同构,但作者未明确建立这一联系。
张力¶
未见明显对立引用。所有被引工作基本是互补的:boosting文献不处理缺失,缺失数据文献不处理boosting。唯一的潜在张力是:MI+Boosting(假设MAR) vs. IPW/DR-Boosting(允许MNAR)——前者在MAR下可能更高效,后者在MNAR下更稳健。但作者未直接比较。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( (X, Y) \):协变量向量 \( X \in \mathbb{R}^p \) 和响应变量 \( Y \in \mathbb{R} \)。\( Y \) 是潜在的(可能缺失)。
- \( R \):缺失指示符,\( R = 1 \) 表示 \( Y \) 被观测到,\( R = 0 \) 表示缺失。
- \( \pi(X, Y) = P(R = 1 \mid X, Y) \):倾向性得分,即给定 \( (X, Y) \) 下 \( Y \) 被观测到的概率。这是缺失机制的核心参数。
- \( f(X) \):预测函数,目标是估计 \( f_0(X) = \mathbb{E}[Y \mid X] \)(条件期望)。
- \( L(Y, f(X)) \):损失函数,如平方损失 \( (Y - f(X))^2 \)。
- \( \{(X_i, R_i, R_i Y_i) : i = 1, \dots, n\} \):可观测数据。注意:当 \( R_i = 0 \) 时,\( Y_i \) 是不可观测的。
- \( \theta \):倾向性得分模型 \( \pi(X, Y; \theta) \) 的参数(如逻辑回归系数)。
-
\( \hat{\theta} \):\( \theta \) 的估计量(通常通过某种模型拟合得到)。
-
模型:
- 数据生成机制:\( (X, Y) \) 来自某个联合分布 \( P_{X,Y} \)。缺失机制由 \( \pi(X, Y) \) 控制:\( R \mid (X, Y) \sim \text{Bernoulli}(\pi(X, Y)) \)。
- MNAR设定:\( \pi(X, Y) \) 显式依赖于 \( Y \),即 \( P(R = 1 \mid X, Y) \neq P(R = 1 \mid X) \)。这意味着缺失概率不仅取决于协变量,还取决于未观测到的响应值本身。
- 已知/未知:\( \pi(X, Y) \) 的函数形式未知,需要建模(如参数化逻辑回归)。\( f_0(X) \) 是目标,无参数形式假设。
-
要估的对象:预测函数 \( f(X) \),使得 \( \mathbb{E}[L(Y, f(X))] \) 最小化。
-
可观测数据:
- 实际能观测到:\( X_i \)(总是观测到),\( R_i \)(总是观测到),以及当 \( R_i = 1 \) 时的 \( Y_i \)。
- 想要但观测不到:当 \( R_i = 0 \) 时的 \( Y_i \)。这是缺失数据问题的核心困难。
- 关键识别条件:为了从可观测数据中识别 \( f_0(X) \),需要假设缺失机制模型 \( \pi(X, Y; \theta) \) 是正确设定的(或至少部分正确,如DR方法允许结果回归模型正确)。否则,估计量会有偏。
第二步:讲最小内核¶
最简特例:假设 \( Y \) 是二值的(\( Y \in \{0, 1\} \)),协变量 \( X \) 是单维的(\( p = 1 \)),且缺失机制是已知的逻辑回归模型:
核心思路:在完全数据下,boosting通过函数梯度下降最小化经验损失 \( \frac{1}{n} \sum_{i=1}^n (Y_i - f(X_i))^2 \)。但在MNAR下,我们只能观测到 \( R_i = 1 \) 的 \( Y_i \),直接对完整观测拟合boosting会最小化 \( \frac{1}{\sum R_i} \sum_{R_i=1} (Y_i - f(X_i))^2 \),这等价于对缺失概率加权后的条件分布进行拟合,导致有偏。
IPW校正:将每个完整观测的损失逆概率加权:
Boosting过程:在每一步迭代 \( m \): 1. 计算当前预测函数 \( f^{(m-1)}(X) \) 下的负梯度(对 \( f \) 的导数):
为什么成立:在已知 \( \pi \) 下,IPW损失是原始完全数据损失的无偏代理。函数梯度下降在凸损失下保证收敛到全局最优(平方损失是凸的)。因此,boosting迭代收敛到 \( f_0(X) = \mathbb{E}[Y \mid X] \)。
推广到一般情形:当 \( \pi \) 未知时,需要用估计量 \( \hat{\pi}(X, Y) \) 代替。这引入了估计误差,需要证明其不影响相合性。DR方法则进一步引入结果回归模型 \( \hat{\mu}(X) = \hat{\mathbb{E}}[Y \mid X, R=1] \),使得只要 \( \pi \) 或 \( \mu \) 之一正确设定,估计量仍相合。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当响应变量 \( Y \) 存在MNAR缺失时,如何设计boosting预测方法,使得预测函数 \( f(X) \) 的估计是相合的。
- 核心工具/方法:将半参数缺失数据处理中的逆概率加权(IPW) 和双重稳健(DR) 损失函数嵌入boosting的函数梯度下降算法中,并给出算法收敛性和估计量相合性的理论证明。
- 主要结论:所提出的IPW-Boosting和DR-Boosting算法在正则条件下收敛到最优预测函数;估计量的相合性成立;数值实验表明,在MNAR下,所提方法显著优于忽略缺失的boosting和基于完整观测的boosting。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 缺失机制模型:假设 \( \pi(X, Y; \theta) \) 是参数化的(如逻辑回归),且 \( \theta \) 通过极大似然估计(基于可观测的 \( (X_i, R_i, R_i Y_i) \))得到。作者假设缺失机制模型是正确设定的(对于IPW方法),或至少倾向性得分模型或结果回归模型之一正确(对于DR方法)。
- 正则条件:
- 倾向性得分有界远离0:存在 \( \delta > 0 \) 使得 \( \pi(X, Y) \geq \delta \) 几乎必然。这是IPW估计的经典条件,避免权重爆炸。
- 损失函数的光滑性与凸性:平方损失满足这些性质,保证函数梯度下降的收敛性。
- 基学习器的逼近能力:假设基学习器(如决策树)可以一致逼近任意平方可积函数(通用逼近性质)。
- 独立同分布样本:\( (X_i, Y_i, R_i) \) 是i.i.d.的。
- 相比已有文献的强化/放宽:
- 强化:相比仅处理MAR的boosting变体,本文明确允许MNAR,这是更强的缺失假设(更一般,但需要更强的识别条件)。
- 放宽:相比参数化的半参数缺失方法,本文对 \( f(X) \) 不做参数形式假设,允许非参数估计,这是更弱的模型假设。
主要结果¶
本文是方法型+理论型混合:提出算法并证明其理论性质。核心结果如下:
- 定理1(算法收敛性):在正则条件下,IPW-Boosting和DR-Boosting算法的函数梯度下降迭代收敛到损失函数的全局最小值(对于凸损失)。直觉:IPW/DR损失是原始完全数据损失的无偏代理,且保持凸性,因此函数梯度下降的收敛性证明(如Bühlmann & Yu 2003)可直接推广。必要条件:倾向性得分有界远离0;学习率足够小。
- 定理2(估计量相合性):当boosting迭代次数 \( M \) 随样本量 \( n \) 以适当速率增长(如 \( M = o(n) \) 或 \( M = O(\log n) \))时,所得到的预测函数 \( \hat{f}_n(X) \) 满足 \( \mathbb{E}[(\hat{f}_n(X) - f_0(X))^2] \to 0 \) 依概率。直觉:boosting的“早停”起到了正则化作用,防止过拟合;IPW/DR校正消除了缺失偏差。解决的技术难点:需要处理倾向性得分估计误差与boosting迭代误差的交互——作者通过假设倾向性得分估计的 \( \sqrt{n} \)-相合性,并控制boosting的逼近误差,最终得到相合性。
- 推论(DR方法的双重稳健性):如果倾向性得分模型或结果回归模型之一正确设定,则DR-Boosting的估计量仍相合。这是半参数理论的标准结果在boosting框架下的推广。
证明路线与技术技巧¶
整体路线(以IPW-Boosting为例): 1. 步骤1:将boosting视为函数空间中的梯度下降。定义损失泛函 \( \mathcal{L}(f) = \mathbb{E}[L_{\text{IPW}}(Y, f(X); \pi)] \)。boosting迭代 \( f^{(m)} = f^{(m-1)} - \nu \nabla \mathcal{L}(f^{(m-1)}) \)(在函数空间中)。 2. 步骤2:证明损失泛函的凸性与光滑性。平方损失是凸的,IPW加权不改变凸性。因此,梯度下降收敛到全局最小值。 3. 步骤3:处理倾向性得分估计误差。用 \( \hat{\pi} \) 代替 \( \pi \) 引入额外误差。作者证明,如果 \( \hat{\pi} \) 是 \( \sqrt{n} \)-相合的(如MLE),则 \( \mathcal{L}_{\hat{\pi}}(f) \) 与 \( \mathcal{L}_{\pi}(f) \) 的差异是 \( o_p(1) \) 的,不影响收敛性。 4. 步骤4:建立相合性。将boosting的“早停”视为一种正则化。通过控制偏差-方差权衡:迭代次数 \( M \) 太小则逼近误差大(欠拟合),太大则方差大(过拟合)。作者证明,当 \( M \) 以适当速率增长时,估计量的MSE趋于0。 5. 步骤5:推广到DR。DR损失 \( L_{\text{DR}} = \frac{R}{\pi}(Y - f)^2 + (1 - \frac{R}{\pi})(\mu - f)^2 \) 具有双重稳健性。证明路线类似,但需要额外处理结果回归模型 \( \mu \) 的估计误差。
关键跳跃点: - 跳跃点1:从“已知倾向性得分”到“估计倾向性得分”。这是最吃功夫的部分。作者需要证明,倾向性得分的估计误差不会破坏boosting的收敛性。关键引理是:\( \sup_{f \in \mathcal{F}} |\mathcal{L}_{\hat{\pi}}(f) - \mathcal{L}_{\pi}(f)| = o_p(1) \),其中 \( \mathcal{F} \) 是boosting迭代产生的函数类。这需要一致大数定律和倾向性得分估计的相合性。 - 跳跃点2:控制boosting迭代次数 \( M \)。与经典boosting理论不同,这里 \( M \) 的选择需要同时考虑缺失偏差校正和函数逼近。作者通过假设 \( M = o(n) \) 来保证方差可控,同时通过基学习器的逼近性质保证偏差衰减。
技术技巧点名: - 经验过程理论(Empirical Process):用于证明 \( \sup_{f} |\mathcal{L}_{\hat{\pi}}(f) - \mathcal{L}_{\pi}(f)| = o_p(1) \),需要控制函数类 \( \mathcal{F} \) 的熵或覆盖数。 - 函数梯度下降(Functional Gradient Descent):boosting的核心算法框架,将参数优化推广到函数空间。 - 半参数影响函数(Semiparametric Influence Function):DR损失的设计源于半参数理论中的高效影响函数,使得估计量对倾向性得分或结果回归模型的误设定具有鲁棒性。 - 交叉验证(用于选择 \( M \)):作者建议使用交叉验证选择boosting迭代次数,这是实践中的标准做法,但理论分析中假设 \( M \) 是预先确定的。
真实例子与应用¶
本文包含模拟实验,但没有真实数据例子。
- 模拟设定:生成 \( X \sim \text{Uniform}[-2, 2] \),\( Y = \sin(X) + \epsilon \)(\( \epsilon \sim N(0, 0.5^2) \))。缺失机制为逻辑回归:\( \logit(\pi(X, Y)) = \alpha + \beta X + \gamma Y \),其中 \( \gamma = 1 \) 表示MNAR。样本量 \( n = 200, 500 \)。
- 方法应用:比较四种方法:(a) 完整观测boosting(忽略缺失),(b) 完整数据boosting(作为Oracle基准),(c) IPW-Boosting,(d) DR-Boosting。使用平方损失,基学习器为决策树桩(stump),迭代次数由交叉验证选择。
- 结果:在MNAR下,完整观测boosting的预测MSE显著高于Oracle(偏差明显)。IPW-Boosting和DR-Boosting的MSE接近Oracle,且DR-Boosting在倾向性得分模型误设定时仍表现良好(验证双重稳健性)。当样本量从200增加到500时,所提方法的MSE进一步下降,与相合性理论一致。
- 这个例子想说明什么:验证理论预测——IPW/DR校正能有效消除MNAR下的选择性偏差;DR方法对模型误设定更稳健;有限样本下性能良好。
🔎 结论是否比证明窄¶
- 窄结论1:定理2的相合性证明依赖于倾向性得分估计的 \( \sqrt{n} \)-相合性。但作者在模拟中使用了参数化逻辑回归,这满足 \( \sqrt{n} \)-相合性。然而,如果倾向性得分模型是非参数或高维的(如使用神经网络估计),\( \sqrt{n} \)-相合性可能不成立,此时定理2的结论是否仍成立?作者未讨论。
- 窄结论2:算法收敛性证明假设损失函数是凸的(平方损失)。对于非凸损失(如0-1损失或Hinge损失),收敛性不保证。作者在结论部分提到“可扩展到其他损失”,但未给出证明,这更像一个conjecture。
- 窄结论3:所有理论结果假设协变量维数 \( p \) 固定。当 \( p \) 随 \( n \) 增长时(高维设定),boosting的相合性需要额外条件(如稀疏性),本文未涉及。
四、开放问题¶
- 高维协变量下的MNAR-Boosting:当 \( p \gg n \) 时,倾向性得分估计和boosting的相合性如何建立?是否需要稀疏性假设?这扎根于本文“协变量维数固定”的设定。
- 非参数倾向性得分估计:如果 \( \pi(X, Y) \) 用非参数方法(如随机森林或神经网络)估计,\( \sqrt{n} \)-相合性可能不成立,此时IPW/DR-Boosting的相合性是否仍成立?需要更弱的条件(如 \( n^{1/4} \)-相合性)?这扎根于定理2对 \( \sqrt{n} \)-相合性的依赖。
- 缺失协变量+缺失响应的联合处理:本文只处理响应缺失。如果协变量也有缺失(且可能是MNAR),如何扩展?这扎根于作者在引言中未讨论的“缺失协变量”场景。
- 与因果推断的显式连接:本文的IPW/DR框架与因果推断中的处理效应估计(如IPTW、AIPW)高度同构。能否将本文的boosting方法直接用于估计条件平均处理效应(CATE) 在缺失结果下的情况?这扎根于作者未建立的因果推断联系。
Maintained by 陈星宇 · Homepage · Source on GitHub