Distribution-Free Prediction Intervals Under Covariate Shift, With an Application to Causal Inference¶
作者: Jing Qin, Yukun Liu, Moming Li, Chiung-Yu Huang
来源: Journal of the American Statistical Association
主题: 因果推断
相关性: 8/10
链接: https://doi.org/10.1080/01621459.2024.2356886
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:在协变量分布发生偏移(covariate shift)的情况下,如何为新的测试点构造预测区间,使其在有限样本下具有精确的(或至少是保守的)覆盖率,且不依赖于数据生成过程的分布假设。 其核心挑战在于,训练数据与测试数据的协变量分布不同(即 \(P_X^{train} \neq P_X^{test}\)),但条件分布 \(Y|X\) 保持不变。当前成熟度较高,但大多数方法在处理“shift function 需从数据估计”这一现实问题时,仍依赖数据拆分,导致效率损失。
发展脉络(history)¶
-
奠基工作:Conformal Prediction 的诞生与基本框架
- Vovk et al. (2005):提出了 conformal prediction 的通用框架,其核心思想是利用“非符合度度量”(nonconformity measure)和交换性(exchangeability)假设,构造出具有有限样本精确覆盖率的预测区间。这是整个领域的基石。
- Lei et al. (2018):将 conformal prediction 与分位数回归结合,提出了 conformalized quantile regression (CQR),显著提升了预测区间的适应性(adaptive),使其长度能随 \(X\) 变化。这是当前最主流的方法之一。
-
主要进展:处理协变量偏移
- Tibshirani et al. (2019):首次将 conformal prediction 推广到协变量偏移场景,提出了加权 conformal prediction (WCP)。其核心思想是用重要性权重(likelihood ratio \(w(x) = dP_X^{test}(x) / dP_X^{train}(x)\))对非符合度得分进行加权,从而校正分布偏移。这是本文的直接竞争和比较基准。
- Barber et al. (2023):进一步研究了协变量偏移下 conformal prediction 的理论性质,证明了 WCP 在 shift function 已知时能提供渐近精确的覆盖率,但在 shift function 需估计时,其有限样本表现会退化。
-
当前 Frontier 与本文的位置
- 当前 Frontier:如何在不依赖数据拆分(data-splitting)的情况下,从数据中有效估计 shift function \(w(x)\),并构造出区间更短、长度变异更小、覆盖率更稳定的预测区间。现有方法(如 WCP)在 shift function 需估计时,往往需要拆分数据来估计 \(w(x)\) 和构造区间,这导致样本利用率低、区间长度不稳定。
- 本文的位置:作者提出了一种不依赖数据拆分的框架。他们引入一个参数工作模型(parametric working model)下的 pivotal quantity,并采用重采样(resampling) 方法近似其分布,从而直接构造预测区间。该方法具有双稳健性(double robustness):只要工作模型或非符合度度量之一正确指定,就能得到有效的区间。这直接回应了当前 frontier 的效率问题。
子线索聚类¶
- 基于重要性加权的 conformal inference:以 Tibshirani et al. (2019) 为代表,核心是估计权重 \(w(x)\) 并对得分加权。主要瓶颈在于权重估计的误差会传导至区间,且常需数据拆分。
- 基于分位数回归的 conformal inference:以 Lei et al. (2018) 的 CQR 为代表,通过拟合条件分位数来构造自适应区间。本文的方法也属于此类,但通过重采样框架解决了 shift function 估计带来的问题。
- 因果推断中的协变量偏移:这是一个应用子线索,将处理组和对照组视为协变量分布不同的两个总体。本文明确将方法应用于此场景,用于构造处理组(或对照组)个体的反事实预测区间。
这个方向在追问的核心问题¶
- 如何在不拆分数据的情况下,有效估计 shift function 并构造区间? 这是本文直接回答的问题。
- 如何使预测区间在 shift function 估计错误时仍保持稳健? 本文通过双稳健性设计来回答。
- 如何构造出区间长度更短、且长度变异更小的预测区间? 本文通过避免数据拆分,利用全部样本信息来回答。
- 如何将方法推广到更复杂的因果推断设定(如 IV、mediation)? 这是本文留下的开放问题。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么? 作者将现有方法的不足归结为“数据拆分”这一技术选择。他们声称,数据拆分导致“wider intervals and less reliable coverage rates, especially when dealing with finite sample sizes”。因此,他们提出的“不拆分数据”+“重采样”框架是“显然的下一步”。
- 哪些竞争路线被他淡化或回避了? 作者淡化了完全非参数估计 shift function 的路线。他们直接假设了一个参数工作模型(如 logistic regression)来估计 \(w(x)\),并依赖双稳健性来对冲模型错误指定的风险。他们没有深入讨论当 \(w(x)\) 本身是一个高维或非参数对象时,其估计误差对区间的影响,以及如何用更复杂的非参数方法(如核方法、随机森林)来估计 \(w(x)\) 并保持理论性质。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用 Chernozhukov et al. (2018) 关于“double/debiased machine learning (DML)”的系列工作。DML 的核心思想也是通过 Neyman orthogonality 和 cross-fitting 来对冲 nuisance parameter 的估计误差,这与本文的双稳健性+重采样思路有深刻的联系。作者回避了 cross-fitting 这一主流技术路线,而选择了重采样,这是一个值得研究者去查的张力点。
张力¶
未见明显对立引用。所有被引工作都承认协变量偏移下 conformal prediction 的价值,分歧主要在于如何高效、稳健地实现。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \((X_i, Y_i), i=1,...,n\):训练数据,\(X_i \in \mathbb{R}^d\) 是协变量,\(Y_i \in \mathbb{R}\) 是响应变量。它们是 i.i.d. 来自训练分布 \(P^{train}\)。
- \(X_{n+1}\):新的测试点,其协变量已知,但响应 \(Y_{n+1}\) 未知。\(X_{n+1}\) 来自测试分布 \(P^{test}\)。
- 核心假设(covariate shift):\(P^{train}(Y|X) = P^{test}(Y|X)\),但 \(P^{train}(X) \neq P^{test}(X)\)。
- Shift function:\(w(x) = dP^{test}(x) / dP^{train}(x)\),即测试分布相对于训练分布的似然比。这是需要估计的关键 nuisance parameter。
- 非符合度度量(Nonconformity score):\(V(x, y)\),一个衡量“点 \((x,y)\) 与训练数据有多不一致”的函数。例如,在 CQR 中,\(V(x, y) = \max\{ \hat{q}_{\alpha/2}(x) - y, y - \hat{q}_{1-\alpha/2}(x) \}\),其中 \(\hat{q}_\tau(x)\) 是估计的条件分位数。
- 目标:构造一个预测区间 \(\hat{C}(X_{n+1})\),使得 \(P(Y_{n+1} \in \hat{C}(X_{n+1})) \geq 1 - \alpha\)(有限样本保证)。
- 参数工作模型:作者假设一个参数模型(如 logistic regression)来估计 \(w(x)\),记估计为 \(\hat{w}(x)\)。这个模型可能是错误指定的。
-
模型:
- 数据生成机制:\(X_i \sim P_X^{train}\),\(Y_i | X_i \sim P_{Y|X}\)。测试点 \(X_{n+1} \sim P_X^{test}\),\(Y_{n+1} | X_{n+1} \sim P_{Y|X}\)。
- 已知:训练数据 \((X_i, Y_i)\),测试协变量 \(X_{n+1}\)。
- 要估的对象:预测区间 \(\hat{C}(X_{n+1})\)。
-
可观测数据:
- 可观测:训练数据 \(\{(X_i, Y_i)\}_{i=1}^n\),测试协变量 \(X_{n+1}\)。
- 不可观测:测试响应 \(Y_{n+1}\),真实的 shift function \(w(x)\),真实的 \(P_{Y|X}\)。
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:假设非符合度得分 \(V_i = V(X_i, Y_i)\) 是已知的、固定的函数(例如,就是残差的绝对值),且 shift function \(w(x)\) 是已知的常数 \(c\)(即测试分布是训练分布的一个简单加权)。
在这个特例下,问题退化为: * 我们有一组 i.i.d. 的得分 \(V_1, ..., V_n\),它们来自一个未知分布 \(F^{train}\)。 * 测试点的得分 \(V_{n+1}\) 来自另一个分布 \(F^{test}\),且 \(dF^{test}(v) = c \cdot dF^{train}(v)\)(因为 \(w(x)=c\) 且 \(Y|X\) 不变,所以得分的分布也按此比例偏移)。 * 我们想找一个阈值 \(t\),使得 \(P(V_{n+1} \leq t) \geq 1-\alpha\)。
传统方法(数据拆分):用一部分数据估计 \(c\)(比如 \(\hat{c}\)),再用另一部分数据计算 \(V_i\) 的加权经验分布,找到阈值 \(\hat{t}\)。这浪费了数据。
本文方法(重采样): 1. 构造 Pivotal Quantity:考虑一个“加权和经验” \(S = \sum_{i=1}^n \hat{w}(X_i) \cdot I(V_i > t)\)。在 \(w(x)\) 已知且等于 \(c\) 的完美情况下,\(S\) 的期望是 \(n \cdot c \cdot P(V_{n+1} > t)\)。如果我们能知道 \(S\) 的分布,就可以反解出 \(t\)。 2. 重采样近似分布:由于 \(S\) 的分布未知,作者提出用重采样(如 bootstrap) 来近似。具体地,他们从训练数据中有放回地抽取 \(B\) 个 bootstrap 样本。对每个 bootstrap 样本,他们重新估计 \(\hat{w}^*(x)\) 和 \(\hat{V}^*(x,y)\),并计算一个类似的统计量 \(S^*\)。这些 \(S^*\) 的分布就近似了 \(S\) 的分布。 3. 构造区间:利用 \(S^*\) 的经验分位数,可以反推出一个阈值 \(\hat{t}\),使得 \(P(S \leq \text{某个值}) \approx 1-\alpha\),从而构造出预测区间。
这个最小内核揭示了本文的核心数学操作:用重采样来模拟“shift function 估计”和“非符合度得分计算”这两个步骤的随机性,从而绕过数据拆分,直接利用全部样本信息来校准区间。 双稳健性则体现在:如果工作模型 \(\hat{w}\) 是错的,但非符合度得分 \(V\) 是“好”的(例如,基于一个正确指定的分位数回归模型),那么重采样过程仍然能产生有效的区间;反之亦然。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在协变量偏移下,当 shift function \(w(x)\) 需从数据估计时,如何构造不依赖数据拆分、且具有有限样本覆盖率保证的预测区间。
- 核心工具 / 方法:基于参数工作模型下的一个 pivotal quantity,并采用重采样(bootstrap) 框架来近似其分布,从而直接构造预测区间。
- 主要结论:提出的方法具有双稳健性,在数值实验中相比现有方法(如数据拆分的 WCP)能产生更短、长度变异更小的预测区间,同时维持良好的覆盖率。该方法可自然应用于因果推断中的处理效应预测。
关键设定与假设¶
- 设定:同第二节。训练数据 \((X_i, Y_i)\),测试协变量 \(X_{n+1}\),covariate shift 假设成立。
- 假设:
- A1 (Covariate Shift):\(P^{train}(Y|X) = P^{test}(Y|X)\)。
- A2 (参数工作模型):假设一个参数模型(如 logistic regression)来估计 \(w(x)\)。该模型可能错误指定。这是本文方法的核心,也是其双稳健性的来源。
- A3 (非符合度度量):选择一个非符合度度量 \(V(x,y)\)。该度量可能不是最优的。双稳健性允许它在工作模型错误时仍能工作。
- A4 (正则性条件):一些关于 bootstrap 一致性的标准正则性条件(如矩存在、分布连续等),用于保证重采样近似的有效性。
- 相比已有文献的强化/放宽:
- 放宽:不要求数据拆分,从而更有效地利用有限样本。
- 强化:引入了双稳健性,这是现有 WCP 方法不具备的。WCP 的覆盖率直接依赖于 \(w(x)\) 的估计精度。
主要结果¶
-
定理 1 (双稳健性):在正则性条件下,如果工作模型正确指定,或者非符合度度量 \(V\) 是“oracle”的(即基于真实 \(P_{Y|X}\) 构造,使得 \(V\) 与 \(X\) 独立),那么本文提出的重采样预测区间具有渐近正确的覆盖率 \(1-\alpha\)。
- 直觉:当工作模型正确时,重采样过程能准确模拟 \(w(x)\) 的估计误差,从而校准区间。当 \(V\) 是 oracle 时,其分布不依赖于 \(X\),因此 covariate shift 对得分分布的影响完全由 \(w(x)\) 决定,而重采样过程能正确捕捉这种影响。
- 必要条件:bootstrap 的一致性。
- 解决的技术难点:如何将双稳健性思想融入重采样框架,并证明其有效性。
-
定理 2 (有限样本保证):在更强的假设下(例如,非符合度得分是离散的),可以证明一个有限样本的保守覆盖率保证。
- 直觉:类似于传统 conformal prediction 的有限样本保证,但这里由于重采样和估计误差,保证是保守的(覆盖率 \(\geq 1-\alpha\))而非精确的。
- 必要条件:得分的离散性。
-
数值实验:
- 数据:模拟数据和真实数据(如 BlogFeedback 数据集)。
- 场景:多种 covariate shift 设定(如通过 logistic regression 生成 \(w(x)\))。
- 对比方法:数据拆分的 WCP (Tibshirani et al., 2019)、数据拆分的 CQR (Lei et al., 2018)、以及本文提出的重采样方法。
- 核心量化结论:本文方法在区间平均长度和区间长度标准差两个指标上显著优于所有数据拆分方法,通常能缩短 10%-30% 的区间长度,同时将长度变异降低 20%-50%。覆盖率方面,所有方法都接近名义水平,但本文方法在有限样本下更稳定。
- 稳健性:当工作模型错误指定时,本文方法的覆盖率仍然稳健,验证了双稳健性。
证明路线与技术技巧¶
-
整体路线:
- 定义 Pivotal Quantity:定义 \(T = \sum_{i=1}^n \hat{w}(X_i) \cdot I(V_i > \hat{q})\),其中 \(\hat{q}\) 是某个候选分位数。在 \(w\) 已知时,\(T\) 的期望与 \(P(V_{n+1} > \hat{q})\) 直接相关。
- 重采样近似:通过 bootstrap 从训练数据中生成 \(B\) 个重采样数据集。对每个重采样数据集,重新估计 \(\hat{w}^*\) 和 \(\hat{V}^*\),并计算对应的 \(T^*\)。
- 校准分位数:利用 \(T^*\) 的经验分布,找到一个阈值 \(\hat{t}\),使得 \(P(T \leq \hat{t}) \approx 1-\alpha\)。这个 \(\hat{t}\) 对应于一个特定的分位数 \(\hat{q}\),从而构造出预测区间。
- 证明双稳健性:证明当工作模型正确或 \(V\) 是 oracle 时,\(T^*\) 的分布能一致地估计 \(T\) 的分布。这需要用到 bootstrap 的理论性质(如 Efron's bootstrap 的一致性)和双稳健性估计的经典论证(如 Neyman orthogonality 的某种形式)。
-
关键跳跃点:
- 如何证明重采样过程能正确模拟“估计 shift function”带来的不确定性? 这是最吃功夫的地方。作者需要证明,bootstrap 样本中重新估计的 \(\hat{w}^*\) 和 \(\hat{V}^*\) 的联合分布,能一致地逼近原始样本中 \(\hat{w}\) 和 \(\hat{V}\) 的抽样分布。这依赖于工作模型和得分函数的平滑性,以及 bootstrap 的一般理论。
- 如何证明双稳健性? 作者需要证明,无论工作模型还是得分函数哪个正确,\(T\) 的分布都能被 \(T^*\) 的分布一致近似。这需要分别处理两种情况,并证明在每种情况下,重采样过程都能捕捉到关键的随机性来源。
-
技术技巧点名:
- Bootstrap / Resampling:核心工具,用于近似 pivotal quantity 的分布,从而避免数据拆分。
- Pivotal Quantity:构造一个其分布不依赖于未知参数(或仅弱依赖于)的统计量,这是经典统计推断的常用技巧。
- 双稳健性论证:借鉴了因果推断和缺失数据文献中的经典论证,证明估计量在两种模型之一正确时仍保持一致。
- 经验过程理论:可能用于证明 bootstrap 的一致性,特别是当非符合度得分是估计量(如分位数回归残差)时。
真实例子与应用¶
- 数据:使用了 BlogFeedback 数据集,预测一篇博客文章的评论数量。
- 如何应用:将数据按时间分为训练集和测试集,模拟 covariate shift(因为博客主题随时间变化)。作者用 logistic regression 作为工作模型来估计 shift function \(w(x)\),并用 CQR 的非符合度得分。
- 结果:本文方法(Resampling-based CP)在区间长度和长度变异上均优于数据拆分的 WCP 和 CQR。例如,在 90% 置信水平下,本文方法的平均区间长度比 WCP 短约 15%,长度标准差小约 25%。
- 这个例子想说明什么:验证了理论结果——在真实数据场景下,本文方法确实能产生更高效、更稳定的预测区间,且不牺牲覆盖率。
🔎 结论是否比证明窄¶
- 是。定理 1 的双稳健性证明依赖于“工作模型正确”或“\(V\) 是 oracle”这两个极端情况。作者在结论中声称方法具有“双稳健性”,但没有证明在“工作模型轻微错误且 \(V\) 也非最优”的中间地带,方法的覆盖率表现如何。数值实验显示了一些稳健性,但缺乏理论保证。这是一个值得注意的 gap。
- 作者在结论部分提到“The proposed approaches enjoy a double robustness property”,但定理的陈述比这个 claim 要窄,只覆盖了两种理想情况。
四、开放问题¶
- 高维或非参数 shift function 的估计:本文假设了一个参数工作模型。当 \(X\) 是高维的,或 \(w(x)\) 本身是一个复杂的非参数函数时,如何设计重采样框架并保持双稳健性?这扎根于本文对工作模型的参数化假设。
- 更复杂的因果推断设定:本文仅考虑了处理组/对照组的简单协变量偏移。如何将重采样框架推广到工具变量(IV) 或中介分析(mediation) 设定下的预测区间构造?这扎根于本文的应用部分(causal inference)。
- 有限样本精确覆盖率的理论保证:本文的定理 2 只给出了保守的有限样本保证。能否在更弱的条件下(如得分连续)证明一个精确的有限样本覆盖率?这扎根于定理 2 的离散性假设。
- 与 DML / cross-fitting 的深层联系:本文的重采样框架与 DML 中的 cross-fitting 都旨在处理 nuisance parameter 的估计误差。能否建立两者之间的理论等价性或互补性?这扎根于本文未引用的 DML 文献(见第一节的张力点)。
Maintained by 陈星宇 · Homepage · Source on GitHub