Uncertainty quantification for expectation-calibrated predictions¶
作者: Georgios Gavrilopoulos, Johanna Ziegel
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.26703
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是期望校准(expectation calibration) 的不确定性量化。给定一个点预测模型 \(f(X)\)(用于预测条件均值 \(\mathbb{E}[Y|X]\)),称 \(f\) 是期望校准的,如果 \(\mathbb{E}[Y|f(X)] = f(X)\) 几乎必然。该性质最早由 Tarpey & Flury (1996) 称为“自洽性”,后来在分类校准文献中被称为“auto-calibration”或“perfect calibration”。核心统计问题是:在有限样本下,能否构造一个区间 \(C_{n+1,\alpha}(X_{n+1})\),使得它以高概率包含一个校准预测(而非直接包含 \(Y_{n+1}\))?该问题与经典预测区间的区别在于目标量是校准后的预测值,而非真实响应。当前该方向处于从二元分类向连续响应、从边际覆盖向条件覆盖、从启发式方法向分布自由有限样本保证的过渡阶段。
发展脉络(history)¶
-
奠基工作:校准概念起源于气象学概率预报(Murphy & Epstein, 1967; Dawid, 1986)。对于二元分类,Vovk et al. (2004) 提出 Venn 预测器,Vovk & Petej (2014) 提出 Venn-Abers 预测器,它们通过后处理给出集合值输出,保证包含一个校准预测。这些方法依赖分箱或等渗回归,但仅适用于二元响应。
-
主要进展(二元分类):Gupta et al. (2020) 系统研究了二元分类下的分布自由校准,证明了校准在完全无假设下是不可能的,但通过分箱(histogram binning)可以实现渐近校准,并构造了包含校准概率的置信区间。他们指出区间宽度与箱内样本量成反比,需要调参。
-
向连续响应扩展:Wüthrich & Ziegel (2024) 将等渗校准(isotonic calibration)推广到连续响应,证明了样本内校准(in-sample calibration)性质:对校准集拟合等渗回归后,拟合值在经验分布下满足 \(\mathbb{E}_{\hat{P}_n}[Y|\hat{T}(\hat{f}(X))] = \hat{T}(\hat{f}(X))\)。但该性质不直接适用于新样本(out-of-sample)。
-
同时期工作:Van der Laan & Alaa (2024) 提出了自校准共形预测,将 Venn-Abers 扩展到回归,构造了条件于校准预测的预测区间(即 \(P(Y_{n+1} \in \hat{C}_n(X_{n+1}) | \hat{f}(X_{n+1})) \geq 1-\alpha\)),但计算成本高且只能近似。Petej & Vovk (2026) 独立地扩展了 Venn-Abers 到连续标签,但仅提供边际覆盖保证,未研究渐近性质。
-
本文位置:本文在上述工作的基础上,针对连续响应,利用共形预测构造预测集 \(I_\alpha(X_{n+1})\),再结合任意样本内校准过程 \(G\),通过 Theorem 2.2 构造校准置信区间 \(C_{n+1,\alpha}\),使得 \(P(G(P_{n+1}, X_{n+1}) \in C_{n+1,\alpha} | \mathcal{A}) \geq 1-\alpha\)。该方法计算高效(仅需两次等渗回归),且具有渐近一致性(Theorem 4.4)和区间宽度趋于零(Theorem 5.1)。
子线索聚类¶
被引文献大致落在三条子线索上:
-
校准理论与 Venn 预测器:Vovk et al. (2004), Vovk & Petej (2014), Gupta et al. (2020), Dimitriadis et al. (2023)。这一簇关注校准的定义、不可能性结果、以及基于分箱/等渗回归的校准方法,主要针对二元分类。
-
共形预测及其变体:Lei et al. (2018), Romano et al. (2019), Barber et al. (2023), Gibbs et al. (2025), Duchi (2025), Chernozhukov et al. (2021)。这一簇提供分布自由的预测区间,具有有限样本覆盖保证,并研究条件覆盖、加权共形预测等扩展。
-
等渗回归与形状约束回归:Barlow et al. (1972), Zhang (2002), Mösching & Dümbgen (2020), Henzi et al. (2021, 2022, 2023), Wüthrich & Ziegel (2024)。这一簇研究等渗回归的统计性质(收敛速率、自由度、算法加速),以及其在分布回归、校准中的应用。
核心问题与已知瓶颈¶
- 核心问题:
- 如何为连续响应的点预测构造分布自由、有限样本有效的校准置信区间?
- 如何保证区间宽度渐近趋于零(即统计效力)?
- 如何避免调参(如分箱数)并保持计算高效?
-
如何将条件覆盖保证(如协变量条件)传递给校准置信区间?
-
已知瓶颈:
- Gupta et al. (2020) 的分箱方法需要调参,且区间宽度随箱内样本量减小而膨胀。
- Van der Laan & Alaa (2024) 的方法计算成本高,只能近似。
- Petej & Vovk (2026) 仅提供边际覆盖,未研究渐近性质。
- 现有等渗校准仅保证样本内校准,out-of-sample 性质需额外论证。
⚠️ 作者的 framing¶
作者将缺口 frame 为:“现有工作要么只针对二元分类(Gupta et al. 2020),要么只提供预测区间而非校准置信区间(Van der Laan & Alaa 2024),要么只有边际覆盖(Petej & Vovk 2026)”。作者声称他们的方法更通用(连续响应)、计算高效(仅需两次等渗回归)、具有渐近一致性和区间宽度趋于零。他们淡化了 Van der Laan & Alaa (2024) 的条件覆盖优势,强调其计算不可行性;也淡化了 Petej & Vovk (2026) 的并发工作,指出其缺乏渐近分析。
值得研究者去查的问题:作者在 intro 中未提及分位数校准(quantile calibration)或分布校准(distributional calibration)的文献,例如 Gneiting & Resin (2023) 的 T-calibration 框架,以及 Henzi et al. (2021) 的等渗分布回归(IDR)。这些工作可能提供另一种构造校准预测区间的方法。此外,共形预测的加权版本(如 Barber et al. 2023)在非可交换性下的扩展未被讨论,但本文假设可交换性。
张力¶
未见明显对立引用。各被引工作基本互补:Gupta et al. (2020) 处理二元分类,Van der Laan & Alaa (2024) 处理条件预测区间,本文处理校准置信区间。唯一可能的张力是:Gupta et al. (2020) 证明校准在完全无假设下不可能,而本文通过使用共形预测集 \(I_\alpha\) 绕过了这一不可能性(因为目标不是直接校准预测,而是包含校准预测的区间)。作者在 Remark A.1 中讨论了条件覆盖的传递性,但未与 Gupta et al. 的不可能性结果直接对比。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据¶
- 符号:
- \(X \in \mathcal{X}\):协变量(随机向量),\(\mathcal{X}\) 为标准 Borel 空间。
- \(Y \in \mathbb{R}\):响应变量(实值)。
- \((X_i, Y_i)\):第 \(i\) 个观测,\(i=1,\dots,n\) 为校准集,\(i=n+1\) 为测试点(\(Y_{n+1}\) 未观测)。
- \(S_1 = \{(X_{-i}, Y_{-i})\}_{i=0}^r\):训练集(独立于校准集)。
- \(S_2 = \{(X_i, Y_i)\}_{i=1}^n\):校准集。
- \(P_n\):校准集的经验分布。
- \(P_{n+1}\):扩充集 \(S_2 \cup \{(X_{n+1}, Y_{n+1})\}\) 的经验分布(未知)。
- \(P_y\):将 \(Y_{n+1}\) 替换为 \(y\) 后的经验分布。
- \(G(P, x)\):基于经验分布 \(P\) 的样本内校准过程,输出一个预测值。
- \(I_\alpha(X_{n+1})\):\(Y_{n+1}\) 的预测集,满足 \(P(Y_{n+1} \in I_\alpha(X_{n+1}) | \mathcal{A}) \geq 1-\alpha\)。
- \(C_{n+1,\alpha} = \{ G(P_y, X_{n+1}) : y \in I_\alpha(X_{n+1}) \}\):校准置信区间。
- \(\hat{f}(X)\):基模型(如 GAM、神经网络),在 \(S_1\) 上训练。
-
\(\mu(x) = \mathbb{E}[Y|X=x]\):真实条件均值(目标)。
-
模型:
- 数据生成:\((X_i, Y_i)\) 独立同分布(或至少可交换),且 \(S_2 \cup \{(X_{n+1}, Y_{n+1})\}\) 可交换,独立于 \(S_1\)。
- 假设 \(Y\) 具有有限一阶矩(Assumption A1)。
-
对于渐近结果,额外假设:\(Y_i = \mu(X_i) + \varepsilon_i\),\(\varepsilon_i\) 独立同分布、均值为零、方差有限(Assumption A2),且 \(\mu(X)\) 有界密度(Assumption A4),\(\varepsilon_i\) 条件次高斯(Assumption A6)。
-
可观测数据:
- 可观测:训练集 \(S_1\)、校准集 \(S_2\)、测试协变量 \(X_{n+1}\)。
- 不可观测:测试响应 \(Y_{n+1}\)、真实条件均值 \(\mu(X_{n+1})\)、扩充集经验分布 \(P_{n+1}\)。
- 关键识别假设:可交换性(等价于 i.i.d. 但更弱),使得条件于 \(P_{n+1}\) 时每个点同分布。
第二步:最小内核¶
最简特例:假设基模型 \(\hat{f}\) 是常数(即 \(\hat{f}(X) \equiv c\)),且我们使用最简单的分箱方案:只有一个 bin(即 \(K=1\))。此时,样本内校准过程 \(G(P_y, X_{n+1})\) 就是所有观测的平均值:
给定预测集 \(I_\alpha(X_{n+1}) = [\ell, h]\),校准置信区间为:
Theorem 2.2 断言:若 \(Y_{n+1} \in [\ell, h]\) 以概率 \(\geq 1-\alpha\),则 \(G(P_{n+1}, X_{n+1}) = \frac{Y_{n+1} + \sum Y_i}{n+1}\) 以相同概率落入该区间。证明的关键是:当 \(Y_{n+1} = y\) 时,\(G(P_{n+1}, X_{n+1}) = G(P_y, X_{n+1})\),因此覆盖事件等价于 \(Y_{n+1} \in I_\alpha\)。
这个特例揭示了核心思路:校准置信区间本质上是通过将预测集 \(I_\alpha\) 中的每个候选 \(y\) 代入样本内校准过程,得到一组可能的校准预测值,然后取这些值的区间。由于样本内校准过程 \(G\) 关于 \(y\) 是单调的(对于等渗回归情形,由 (16) 保证),区间端点只需计算 \(y\) 为 \(\ell\) 和 \(h\) 时的值。
更一般地,当使用等渗回归时,\(G(P_y, X_{n+1})\) 是等渗回归在测试点处的拟合值,且关于 \(y\) 单调递增(Lemma E.1 和 (16))。因此,\(C_{n+1,\alpha} = [T_\ell(\hat{f}(X_{n+1})), T_h(\hat{f}(X_{n+1}))]\),其中 \(T_\ell, T_h\) 分别是将 \(Y_{n+1}\) 替换为 \(\ell, h\) 后的等渗回归拟合。这避免了遍历 \(I_\alpha\) 中的所有 \(y\),计算量仅为两次等渗回归。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:为连续响应的点预测构造分布自由、有限样本有效的校准置信区间,即包含一个期望校准预测的区间,而非直接包含真实响应。
- 核心工具/方法:将样本内校准过程(如等渗回归)与共形预测集耦合,通过 Theorem 2.2 将后者的覆盖保证传递给前者;具体实现基于等渗回归的单调性,仅需两次等渗回归即可精确计算区间。
- 主要结论:校准置信区间具有至少名义覆盖(Theorem 2.2);基于等渗回归的区间宽度渐近趋于零(Theorem 5.1);等渗校准预测在结构假设下对真实条件均值一致(Theorem 4.4);模拟和保险数据实证展示了方法的有效性。
关键设定与假设¶
- 可交换性:\(S_2 \cup \{(X_{n+1}, Y_{n+1})\}\) 可交换,且独立于 \(S_1\)。这是共形预测的标准假设,比 i.i.d. 弱。
- Assumption A1:\(Y\) 具有有限一阶矩(保证期望存在)。
- Assumption A2(用于渐近分析):\(Y_i = \mu(X_i) + \varepsilon_i\),\(\varepsilon_i\) i.i.d. 均值为零、方差 \(\sigma_\varepsilon^2\)。
- Assumption A3-A6(用于 Theorem 4.4):
- A3:\((X_i, Y_i)\) i.i.d.
- A4:\(\mu(X)\) 有界支撑且密度有正下界。
- A5:基模型 \(\hat{f}_r\) 一致估计 \(\mu\) 的某个严格单调变换 \(T\),速率为 \((\log r / r)^{1/3}\)。
- A6:\(\varepsilon_i\) 条件次高斯。
- Assumption A7(用于 Theorem 5.1):等渗回归拟合的不同值个数 \(J_{n+1}\) 满足 \(\mathbb{E}[J_{n+1}] = O(n^{1/3} \log^q n)\)。
- Assumption A8:预测集 \(I_\alpha\) 的端点与 \(Y_{n+1}\) 的平方距离有界。
相比已有文献: - 相比 Gupta et al. (2020):本文从二元分类扩展到连续响应,且无需调参(等渗回归自动选择分箱)。 - 相比 Van der Laan & Alaa (2024):本文目标不同(校准预测的置信区间 vs. 响应预测区间),且计算更高效(精确而非近似)。 - 相比 Petej & Vovk (2026):本文提供条件覆盖(通过 \(\mathcal{A}\) 传递)和渐近性质。
主要结果¶
Theorem 2.2(核心定理):在可交换性和 A1 下,若 \(I_\alpha(X_{n+1})\) 满足 \(P(Y_{n+1} \in I_\alpha | \mathcal{A}) \geq 1-\alpha\),则 \(C_{n+1,\alpha} = \{ G(P_y, X_{n+1}) : y \in I_\alpha \}\) 满足 \(P(G(P_{n+1}, X_{n+1}) \in C_{n+1,\alpha} | \mathcal{A}) \geq 1-\alpha\),且 \(G(P_{n+1}, X_{n+1})\) 是校准的。直觉:覆盖事件等价于 \(Y_{n+1} \in I_\alpha\),因为当 \(Y_{n+1}=y\) 时 \(G(P_{n+1}, X_{n+1}) = G(P_y, X_{n+1})\)。必要条件:\(G\) 是样本内校准的(即 bin 内平均)。技术难点:证明 \(G(P_{n+1}, X_{n+1})\) 是校准的,需要利用可交换性将条件期望转化为经验分布下的期望。
Theorem 4.4(一致性):在 A3-A6 下,若 \(r \leq n\),则样本内校准预测 \(c_n(\hat{f}_r(x))\) 在 \(x\) 属于 \(\mu(x)\) 远离边界的区域上,以概率趋于 1 满足 \( |c_n(\hat{f}_r(x)) - \mu(x)| \leq C (\log r / r)^{1/3} \)。直觉:等渗校准将基模型的排序信息与响应平均结合,当基模型一致估计 \(\mu\) 的单调变换时,校准预测也一致。必要条件:基模型需满足 A5(一致估计单调变换),这比直接一致估计 \(\mu\) 更弱。
Theorem 5.1(宽度趋于零):在 A7-A8 下,\(\mathbb{E}[w(C_{n+1,\alpha})] \to 0\) 当 \(n \to \infty\)。直觉:等渗回归的块数增长速度为 \(n^{1/3}\),而预测集宽度有界,因此每个块内平均的贡献随 \(n\) 增大而减小。必要条件:A7 关于块数的增长,A8 关于预测集端点的有界二阶矩。
证明路线与技术技巧¶
Theorem 2.2 证明路线: 1. 证明 \(G(P_{n+1}, X_{n+1})\) 是校准的:利用可交换性,条件于 \(P_{n+1}\),\((X_i, Y_i)\) 同分布。对任意 Borel 集 \(B\),计算 \(\mathbb{E}[(Y_{n+1} - G_{n+1}) \mathbf{1}\{G_{n+1} \in B\}]\),通过塔式性质条件于 \(P_{n+1}\),再利用 \(G\) 的样本内校准性质(经验分布下条件期望等于自身)得到零。 2. 证明覆盖:\(G(P_{n+1}, X_{n+1}) \in C_{n+1,\alpha}\) 当且仅当存在 \(y \in I_\alpha\) 使得 \(G(P_{n+1}, X_{n+1}) = G(P_y, X_{n+1})\)。由于 \(G(P_y, X_{n+1})\) 关于 \(y\) 单调(对等渗回归),该条件等价于 \(Y_{n+1} \in I_\alpha\)。因此覆盖概率由 \(I_\alpha\) 保证。
关键跳跃点:证明 \(G(P_{n+1}, X_{n+1})\) 是校准的这一步,需要将条件期望转化为经验分布下的期望,并利用可交换性将测试点与校准点视为同分布。作者使用了分解定理(disintegration theorem)和 Fubini 定理,这是处理条件于随机测度的标准技巧。
Theorem 5.1 证明路线: 1. 将区间宽度表示为等渗投影之差:\(w(C_{n+1,\alpha}) = \text{iso}(Y^h)_{i_0} - \text{iso}(Y^\ell)_{i_0}\),其中 \(Y^h, Y^\ell\) 是将 \(Y_{n+1}\) 替换为 \(h, \ell\) 后的向量,\(i_0\) 是测试点对应的位置。 2. 利用 Lemma E.1(等渗投影的单调性)和 Lemma E.2(投影差的上界),将宽度与块大小联系起来。 3. 分情况(\(Y_{n+1} \geq h\) 等)处理,利用 A7(块数期望 \(O(n^{1/3}\log^q n)\))和 A8(端点有界二阶矩),通过 Cauchy-Schwarz 和条件概率论证期望宽度趋于零。
技术技巧点名: - 等渗投影的单调性(Lemma E.1):当仅改变一个坐标时,投影的块结构变化有界,用于控制宽度。 - 等渗投影的 Lipschitz 性质(Lemma E.2):投影差不超过 \(|y_1 - y_2| / (\text{块大小})\)。 - 浓度不等式:Lemma D.1 利用次高斯假设和 union bound 控制 \(M_n\)。 - 等渗回归的收敛速率:引用 Zhang (2002) 的 \(n^{-1/3}\) 速率(Proposition 4.3 证明中用到)。 - PAVA 算法:用于高效计算等渗回归,复杂度 \(O(n)\)。
真实例子与应用¶
模拟(Section 6): - 数据:三维协变量(正态、均匀、伯努利),响应 \(Y = X_1^2 - X_1 X_3 - 4/(1+X_1^2+X_2^2) + \varepsilon\),\(\varepsilon\) 为 Gamma 噪声(异方差)。样本量 \(N=3000\),训练:校准:测试 = 3:2:1。 - 方法应用:基模型为 GAM(故意误设定,不含交互项)和神经网络。预测集 \(I_\alpha\) 使用共形分位数回归(CQR)。校准置信区间通过 Algorithm 2 计算。 - 结果:区间宽度随 \(n\) 增大而减小(Figure 3),验证 Theorem 5.1。校准图(Figure 4)显示 GAM 在校准后(特别是裁剪后的样本内校准预测)校准性改善。神经网络本身校准性较好。 - 说明:验证方法在异方差、模型误设定下的表现,展示等渗校准对基模型校准性的提升。
保险数据案例(Section 7): - 数据:freMTPL2freq,678,013 条保单,响应为索赔次数(0-4),高度不平衡(>95% 为零)。协变量包括驾驶员年龄、车辆类型等。 - 方法应用:基模型为 Poisson GLM、CatBoost、神经网络。预测集 \(I_\alpha\) 使用基于 Poisson 偏差的非一致性得分的共形预测。校准置信区间通过 Algorithm 2 计算。 - 结果:\(\alpha=0.05\) 时预测集多为空或单点(因不平衡),\(\alpha=0.01\) 和 \(\alpha=0\) 时区间有差异。Figure 5 显示不同基模型在不同区域的区间宽度无统一优势。Table 2 显示所有基模型均未边际校准,Table 3 显示候选点预测(如中点、裁剪预测)也未能完全校准。 - 说明:展示方法在真实不平衡数据上的应用,强调预测集选择的重要性(Subsection 3.3),以及候选点预测的局限性(Subsection 3.4)。
🔎 结论是否比证明窄¶
- Theorem 2.2 的证明依赖于 \(G\) 是样本内校准的(即 bin 内平均),但作者在 Algorithm 2 中使用的等渗回归满足该性质。然而,作者在 Remark 2.1 中声称“任何样本内校准过程都是分箱过程”,这一定理本身是成立的,但证明中隐含了 \(G\) 仅依赖于经验分布 \(P_y\) 且可交换性成立。对于更一般的 \(G\)(如核平滑),该定理不一定成立。
- Theorem 4.4 的证明假设基模型满足 A5(一致估计 \(\mu\) 的单调变换),但作者在正文中未明确给出满足 A5 的具体模型例子,仅引用 Henzi et al. (2023) 的分布单指标模型。对于深度神经网络等黑箱模型,A5 是否合理存疑。
- Theorem 5.1 的证明依赖 A7(块数期望 \(O(n^{1/3}\log^q n)\)),作者引用 Meyer & Woodroofe (2000) 和 Durot et al. (2012) 支持该假设,但后者仅针对高斯噪声模型。作者在 Remark 5.1 中承认该假设在更一般设定下仅为猜想。因此,宽度趋于零的结论在非高斯、异方差情形下尚未严格证明。
四、开放问题¶
-
最优收敛速率:Theorem 5.1 仅证明期望宽度趋于零,未给出速率。作者在 Discussion 中提出“建立校准置信区间渐近期望宽度的最优(minimax)收敛速率”作为未来方向。扎根于 Section 5 末尾和 Section 8 第一段。
-
更弱的假设:Theorem 5.1 依赖 A7(块数期望 \(O(n^{1/3}\log^q n)\)),该假设在非高斯、异方差、非可交换情形下是否成立?作者在 Remark 5.1 中提及“conjecture the existence of a sharp upper bound”,但未证明。扎根于 Section 5 中关于 A7 的讨论。
-
条件覆盖的传递:Theorem 2.2 将 \(I_\alpha\) 的覆盖保证(通过 \(\sigma\)-代数 \(\mathcal{A}\))传递给 \(C_{n+1,\alpha}\)。但作者仅讨论了边际覆盖和有限类群覆盖(Remark A.1)。对于更精细的条件覆盖(如协变量条件),是否可能?扎根于 Remark A.1 和 Section 2.3 末尾。
-
候选点预测的严格保证:Section 3.4 提出的几种候选点预测(中点、裁剪预测、调整中点)均基于启发式,缺乏理论保证。Table 3 显示它们在保险数据上未能实现边际校准。能否构造一个同时具有校准性和一致性的点预测?扎根于 Section 3.4 和 Section 7.2 的 Table 3 讨论。
-
扩展到其他功能:本文针对期望校准。能否将类似框架扩展到分位数校准(quantile calibration)或分布校准(distributional calibration)?例如,结合等渗分布回归(Henzi et al., 2021)和共形预测。扎根于 Section 1 末尾关于概率校准的讨论,以及 Gneiting & Resin (2023) 的 T-calibration 框架。
Maintained by 陈星宇 · Homepage · Source on GitHub