跳转至

A Ranking Approach for Measuring Calibration

作者: Anirban Chatterjee, Rina Foygel Barber
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2609.13100


一、领域脉络与小综述

这个方向是什么

预测概率的校准(calibration)是机器学习可靠性的核心问题:一个模型输出的概率 \(f(X)\) 应当与真实结果的条件概率一致,即 \(E[Y \mid f(X)] = f(X)\)。偏离这一等式即为"失准"(miscalibration)。为了量化失准程度,最广泛使用的度量是 期望校准误差(Expected Calibration Error, ECE),定义为 \(\ell_2\text{-ECE}(f) = E\big[\,(E[Y \mid f(X)] - f(X))^2\,\big]\)。然而,ECE 的估计存在根本性困难:在无假设(assumption-free)条件下,不存在一致估计量(论文引言及 Remark 3.2 引述 Angelopoulos et al. [2024, Theorem 12.5] 的 hardness 结果)。实际中最常用的 binning 近似(将 \([0,1]\) 分成若干区间,在每个区间内用经验频率近似条件概率)虽然计算简单,但存在不可忽略的偏差,且对 bin 数 \(K\) 的选择高度敏感。本文提出的 rankECE 是一种基于排序的替代度量,它不依赖 bin 选择,在无假设条件下可被一致估计,并且是 ECE 的一个下界。该方向当前处于"度量设计 + 估计理论 + 假设检验"交叉的活跃期,但尚未形成统一框架。

发展脉络

校准度量的研究可追溯到天气预报中的概率预报评估(DeGroot and Fienberg, 1983; Murphy, 1973; Murphy and Winkler, 1977)。现代机器学习中,Guo et al. [2017] 系统展示了深度神经网络的失准现象,使 ECE 成为事实标准。但 ECE 的估计问题长期被忽视:binning 近似被广泛使用,其偏差与方差之间的权衡(bias-variance tradeoff)由 bin 数 \(K\) 控制。Kumar et al. [2019] 指出 binning 近似可能完全失效,并给出反例(论文 1.1.1 节引用)。为克服 binning 的缺陷,出现了多条替代路线:

  • 核方法:Widmann et al. [2019] 提出基于 RKHS 嵌入的 SKCE(Squared Kernel Calibration Error),避免了 bin 选择,但检验的渐近分布复杂,需要重抽样。
  • 平滑化:Blasiok and Nakkiran [2023] 提出 smooth ECE,用核平滑替代 binning,但需要选择带宽。
  • 距离度量:Blasiok et al. [2023] 提出 distance from calibration (dCE),用 Wasserstein 距离刻画失准。
  • 加权/对抗性度量:Gopalan et al. [2022] 的 weighted calibration error (wCE) 用一族检验函数来定义失准,Rossellini et al. [2025] 的 cutoff calibration 限制检验函数为区间指示函数。

本文的 rankECE 属于"排序/邻近"路线:将样本按预测概率排序后,比较相邻样本的残差乘积。其思想可追溯到 U-统计量与排序检验,但用于校准度量是新的。论文在引言中明确将自身定位为"提供一种可估计的 ECE 替代度量,同时保留 ECE 的直观解释"。

子线索聚类

被引文献大致可归为四簇:

  1. ECE 的估计与偏差问题:Kumar et al. [2019](binning 失效)、Roelofs et al. [2020](bin 数敏感性)、Nixon et al. [2019](自适应 binning)、Tao et al. [2023](binning 偏差分析)、Lee et al. [2023](T-cal,最优测试)。
  2. 核/嵌入方法:Widmann et al. [2019, 2021](SKCE)、Kumar et al. [2018](MMCE)。
  3. 理论 hardness 与可检验性:Angelopoulos et al. [2024](ECE 不可一致估计)、Foster and Vohra [1998](校准的渐近理论)、Kakade and Foster [2008](弱校准)。
  4. 下游决策与 actionability:Rossellini et al. [2025](cutoff calibration 与决策损失)、Okoroafor et al. [2025](omniprediction)、Blasiok et al. [2023](dCE 与决策)。

本文的 rankECE 同时触及第 1、3、4 簇:它是对 ECE 的近似(第 1 簇),具有可检验性(第 3 簇),并且满足 actionability(附录 B 证明小 rankECE 保证决策损失接近最优)。

这个方向在追问的核心问题

  1. 如何在不假设光滑性/单调性的前提下估计 ECE? 已知无假设一致估计不可能,那么哪些"合理"的替代度量可以做到?
  2. 如何设计一个既接近 ECE、又具有良好统计性质的度量? 包括:可估计性、可检验性、对下游决策的保证。
  3. 如何构造校准的假设检验? 原假设为完美校准 \(H_0: E[Y \mid f(X)] = f(X)\) a.s.,需要有限样本有效且功效高的检验。
  4. 度量之间的序关系:不同度量(ECE、SKCE、rankECE、dCE)在什么条件下相互控制?

当前主流方法(binning)的瓶颈在于:bin 数 \(K\) 的选择缺乏原则性指导,且 binning 近似存在 \(O(K/n)\) 的固有偏差(论文 Lemma 4.1 及 Remark 4.1)。核方法(SKCE)避免了 bin 选择,但检验需要重抽样,计算成本高。rankECE 的定位是:无 bin 选择、无假设可估计、计算 \(O(n \log n)\)、检验有显式临界值。

⚠️ 作者的 framing(这是作者的说法)

作者在引言和讨论中把缺口框定为:

  • "ECE 是标准度量,但无法在无假设条件下被可靠估计"(引言第 1 段)。
  • "binning 近似可能无法捕捉某些形式的失准"(1.1.1 节,引 Kumar et al. [2019] Example 3.2)。
  • "我们提出 rankECE,一种 tuning-free 的 ECE 替代度量,它可以被可靠估计,并且提供比 binning 更接近 ECE 的近似"(引言贡献段)。
  • 在讨论中,作者承认"总变差假设(bounded total variation)是获得有限样本保证所必需的",并认为 hardness 结果意味着"某种假设不可避免"(Discussion 第 1 段)。

作者淡化的竞争路线包括:SKME 类方法(仅作为检验对比出现,未深入讨论其理论)、以及基于光滑化的 ECE 估计(如 smooth ECE 仅在参考文献中出现,未在正文比较)。作者也回避了"rankECE 是否是最优度量"的问题,只声称它是"更好的代理"。

张力

被引文献之间存在一个明显张力:可估计性 vs. 语义保真度。ECE 本身不可估计,因此任何可估计的替代度量都必须牺牲某些方面。binning 牺牲的是"分辨率"(在 bin 内平均),rankECE 牺牲的是"严格上界"(它只是 ECE 的下界,可能低估失准)。SKCE 则改变了度量的语义(从条件期望的 \(L^2\) 距离变为 RKHS 距离)。论文中未见直接讨论这种张力的段落,但作者在 Remark 3.2 中明确承认"无假设一致估计不可能",从而为 rankECE 的近似性质提供了合理性。另一个张力是检验功效 vs. 计算成本:SKCE-U 功效高但需二次时间+重抽样;rankECE 线性时间但有保守的有限样本检验。论文实验显示 rankECE 渐近检验功效接近 SKCE-U,但未给出理论功效对比。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

  • 可观测数据:独立同分布样本 \((X_1, Y_1), \dots, (X_n, Y_n)\),其中 \(X_i \in \mathcal{X}\) 是特征,\(Y_i \in \{0,1\}\) 是二元标签。
  • 预测模型:预先给定的函数 \(f: \mathcal{X} \to [0,1]\),输出预测概率。注意:\(f\) 是固定的、不需要估计的;我们只评估 \(f\) 的校准程度。
  • 关键变量:\(Z_i = f(X_i)\),即预测概率。\(Z_i\) 是 \([0,1]\) 上的随机变量。
  • 目标量(estimand):\(\ell_2\text{-ECE}(f) = E\big[\,(E[Y \mid Z] - Z)^2\,\big]\),其中 \(Z = f(X)\)。注意 \(E[Y \mid Z]\) 是给定预测概率时真实标签的条件期望。
  • 残差:\(R_i = Y_i - Z_i\)。在校准假设下,\(E[R_i \mid Z_i] = 0\)。
  • 排序:令 \(\pi\) 为将 \(Z_1, \dots, Z_n\) 按升序排列的置换,即 \(Z_{\pi(1)} \le Z_{\pi(2)} \le \dots \le Z_{\pi(n)}\)。假设 \(Z\) 无并列(非原子分布),否则用随机化打破并列(附录 F 处理一般情形)。

第二步:最小内核

核心思想:ECE 度量的是"条件期望残差平方"的均值。直接估计 \(E[Y \mid Z]\) 需要非参数回归,会遭遇维数灾难和光滑性假设。但注意到一个恒等式:

\[\ell_2\text{-ECE}(f) = E\big[\,(Y - Z)(Y' - Z)\,\big],\]

其中 \(Y, Y'\) 是给定 \(Z\) 时的两个独立标签副本。这是因为 \(E[(Y-Z)(Y'-Z) \mid Z] = E[Y-Z \mid Z]^2 = (E[Y \mid Z] - Z)^2\)。

rankECE 的构造:将样本按 \(Z\) 排序后,相邻样本的 \(Z\) 值近似相等。因此,如果 \(Z_{\pi(i)}\) 和 \(Z_{\pi(i+1)}\) 很接近,那么 \(Y_{\pi(i)}\) 和 \(Y_{\pi(i+1)}\) 可以看作"给定 \(Z \approx Z_{\pi(i)}\) 时的两个近似独立标签副本"。于是乘积 \((Y_{\pi(i)} - Z_{\pi(i)})(Y_{\pi(i+1)} - Z_{\pi(i+1)})\) 的期望近似等于 \((E[Y \mid Z] - Z)^2\) 在 \(Z \approx Z_{\pi(i)}\) 处的值。对所有相邻对取平均,就得到 ECE 的近似。

定义(样本版本):

\[\widehat{\text{rankECE}}_n(f) = \frac{1}{n} \sum_{i=1}^{n-1} \big(Y_{\pi(i)} - Z_{\pi(i)}\big)\big(Y_{\pi(i+1)} - Z_{\pi(i+1)}\big).\]

定义(总体版本):对固定的 \(n\),取 \(n\) 个独立样本 \((X_i, Y_i)\),令 \(Z_i = f(X_i)\),排序后定义

\[\text{rankECE}_n(f) = E\Big[\frac{1}{n} \sum_{i=1}^{n-1} \big(Y_{\pi(i)} - Z_{\pi(i)}\big)\big(Y_{\pi(i+1)} - Z_{\pi(i+1)}\big)\Big].\]

为什么这个量有意义?

  1. 无假设可估计:\(\widehat{\text{rankECE}}_n\) 只依赖样本,不需要选择 bin 数或带宽。命题 2.1 给出 Hoeffding 型集中不等式:

    \[\big|\widehat{\text{rankECE}}_n(f) - \text{rankECE}_n(f)\big| \le \sqrt{\frac{81 \log(2/\delta)}{32 n}}\]
    以概率至少 \(1-\delta\)。注意这个界对 \(f\) 和分布完全无假设。

  2. 是 ECE 的下界:命题 3.1 证明 \(0 \le \text{rankECE}_n(f) \le \ell_2\text{-ECE}(f)\)。因此 rankECE 不会虚报失准(不会高估 ECE)。

  3. 渐近收敛到 ECE:命题 3.2 证明对任意固定的 \(f\),当 \(n \to \infty\) 时 \(\text{rankECE}_n(f) \to \ell_2\text{-ECE}(f)\)。所以 rankECE 是 ECE 的渐近一致近似。

  4. 完美校准的刻画:定理 3.1 证明(\(n \ge 4\))\(\text{rankECE}_n(f) = 0\) 当且仅当 \(f\) 完美校准。这一点比 binning 近似强得多——binning ECE 可能为零而实际未校准(Kumar et al. 2019 的反例)。

最小例子(直觉):假设 \(Z\) 只有两个取值 \(0.2\) 和 \(0.8\),各占一半。若 \(f\) 未校准,比如 \(E[Y \mid Z=0.2] = 0.5\),\(E[Y \mid Z=0.8] = 0.5\),则 \(\ell_2\text{-ECE} = 0.5 \times (0.3)^2 + 0.5 \times (0.3)^2 = 0.09\)。排序后,\(Z=0.2\) 的样本聚在一起,\(Z=0.8\) 的样本聚在一起。相邻对的残差乘积:在 \(Z=0.2\) 块内,\(Y-Z\) 的均值是 \(0.3\),乘积的期望约为 \(0.09\);在 \(Z=0.8\) 块内,\(Y-Z\) 的均值是 \(-0.3\),乘积的期望约为 \(0.09\)。平均后 rankECE 约为 \(0.09\),接近 ECE。若 \(f\) 完美校准,则每个块内残差均值为零,相邻乘积的期望为零,rankECE 为零。

为什么难? 直接估计 \(E[Y \mid Z]\) 需要条件期望回归,其 minimax 误差在无光滑性假设下可以任意大。rankECE 绕开了这一点:它不估计条件期望,而是利用排序后的邻近性构造"近似独立副本"。代价是它只给出 ECE 的下界,且下界与 ECE 的差距取决于残差函数的振荡程度(由总变差控制,命题 3.3)。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在 ECE 无法无假设一致估计的背景下,提出一种新的校准度量 rankECE,它基于排序后相邻样本的残差乘积,无需选择 bin 数或光滑参数。
  2. 核心方法:定义 rankECE 的样本估计量,证明其无假设集中性、是 ECE 的下界、渐近收敛到 ECE,并基于此构造有限样本有效和渐近正态的校准检验。
  3. 主要结论:rankECE 在逼近 ECE 的精度上优于 binning 近似(定理 4.1),在检验功效上可与 SKCE 竞争,且计算成本低两个数量级;同时满足可检验性和可行动性(附录 B)。

关键设定与假设

  • 数据:\((X_i, Y_i) \sim P\) i.i.d.,\(Y_i \in \{0,1\}\),\(Z_i = f(X_i) \in [0,1]\)。\(f\) 固定。
  • 非原子假设:\(Z\) 的分布无原子(即 \(P(Z=t)=0\) 对所有 \(t\)),以避免排序并列。附录 F 通过随机化打破并列,将结果推广到一般情形。
  • 总变差假设(命题 3.3):残差函数 \(r(z) = E[Y \mid Z=z] - z\) 有界变差(\(\|r\|_{TV} < \infty\))。这是保证 rankECE 与 ECE 差距为 \(O(1/n)\) 的充分条件。作者指出这是 hardness 结果下"最弱的自然假设"。
  • 检验的原假设:\(H_0: P(E[Y \mid Z] = Z) = 1\),即完美校准。
  • 无额外假设:集中性(命题 2.1)和检验的有效性(命题 3.4)不要求光滑性、矩条件或分布形状。

主要结果

(1)估计与集中性(命题 2.1)

样本估计量 \(\widehat{\text{rankECE}}_n(f)\) 以 \(O(1/\sqrt{n})\) 的速率围绕其期望 \(\text{rankECE}_n(f)\) 集中,常数绝对(81/32)。证明基于 McDiarmid 不等式,关键技巧是证明改变一个样本最多改变估计量 \(O(1/n)\)(因为每个样本只出现在至多两个相邻对中)。

(2)rankECE 是 ECE 的下界(命题 3.1)

\[0 \le \text{rankECE}_n(f) \le \ell_2\text{-ECE}(f).\]

证明思路:将相邻对乘积的期望写成条件期望形式,利用条件方差非负和 Jensen 不等式。这个性质保证了 rankECE 不会高估失准,因此"小 rankECE"是"近似校准"的必要条件。

(3)渐近收敛到 ECE(命题 3.2)

对固定 \(f\),\(\text{rankECE}_n(f) \to \ell_2\text{-ECE}(f)\)。证明分两步:先用 Lusin 定理和 Tietze 扩张定理将 \(r\) 替换为连续函数,再利用连续函数的均匀连续性证明相邻残差乘积收敛到 \(r(Z)^2\)。

(4)完美校准的刻画(定理 3.1)

\(n \ge 4\) 时,\(\text{rankECE}_n(f) = 0\) 当且仅当 \(f\) 完美校准。证明依赖于一个关键引理:如果 \(\text{rankECE}_n(f)=0\),则残差函数 \(r\) 在 \(Z\) 的支撑上恒为零。这比 binning ECE 的性质强得多——binning ECE 可能为零而实际未校准。

(5)有限样本有效检验(命题 3.4)

检验统计量 \(\widehat{\text{rankECE}}_n(f)\) 在 \(H_0\) 下的条件方差可被 \(\sigma^2(Z)\) 界定(\(\sigma^2(Z) = \frac{1}{n}\sum_{i=1}^{n-1} Z_{(i)}(1-Z_{(i)})Z_{(i+1)}(1-Z_{(i+1)})\))。拒绝域为

\[\widehat{\text{rankECE}}_n(f) > 2\sqrt{\frac{\sigma^2(Z) \log(2/\alpha)}{n}} + \frac{2\log(2/\alpha)}{3n}.\]
该检验在 \(H_0\) 下第 I 类错误 \(\le \alpha\),在 \(H_1\) 下功效 \(\to 1\)(因为 \(\widehat{\text{rankECE}}_n \to \ell_2\text{-ECE} > 0\) 而阈值 \(\to 0\))。证明基于 Bernstein 不等式,条件在 \(Z\) 上。

(6)与 binning 的比较(定理 4.1)

对任意 \(K\) 个 bin 的划分,\(\text{rankECE}_n(f) \ge \ell_2\text{-binECE}(f) - 4K/n\)。这意味着 rankECE 至少与 binning 一样接近 ECE(在 \(O(K/n)\) 的误差内),且不需要选择 \(K\)。证明通过将 bin 边界处的相邻对损失控制在 \(O(1/n)\) 来实现。

(7)可行动性(附录 B,定理 B.1)

对 \(M\)-分段单调变换类 \(\mathcal{H}\),有

\[R(f;\tau) - \inf_{h\in\mathcal{H}} R(h\circ f;\tau) \le \sqrt{\text{rankECE}(f) + \frac{8(M+1)}{n}},\]
其中 \(R\) 是加权 0-1 损失。这建立了"小 rankECE"对下游决策损失的保证。证明利用 binning 划分和 Cauchy-Schwarz 不等式。

证明路线与技术技巧

  • 整体路线:先建立样本估计量的集中性(McDiarmid),再建立 rankECE 与 ECE 的序关系(下界、渐近相等),然后构造检验,最后扩展到决策保证。
  • 关键技巧:
  • 相邻对分解:将排序后的样本视为"近似匹配对",把 ECE 的二次型转化为相邻残差乘积的和。这是整个方法的支点。
  • 条件独立 + 塔性质:在给定 \(Z\) 时,\(Y\) 的条件期望是 \(E[Y \mid Z]\),相邻对的乘积期望可分解为条件期望的乘积,从而与 ECE 建立联系。
  • 总变差控制:用 \(\|r\|_{TV}\) 来界定相邻 \(Z\) 值之间 \(r\) 的变化,得到 \(O(1/n)\) 的逼近误差。
  • Martingale CLT:证明渐近正态性时,将 \(\widehat{\text{rankECE}}_n\) 表示为鞅差序列的和,验证条件 Lindeberg 条件。
  • Bernstein 条件方差:在 \(H_0\) 下,残差乘积的条件方差可被 \(Z\) 的相邻乘积界定,从而得到显式有限样本阈值。

真实例子与应用

模拟实验(第 5.1.1 节):生成 \(Z \sim \text{Unif}[0,1]\),条件概率 \(g(z) = E[Y \mid Z=z]\) 取三种形式——二次型(光滑)、阶梯函数(不连续)、高频振荡(\(\sin(40\pi z^2)\))。比较 rankECE 与 binning ECE(\(K=10, \sqrt{n}, n^{1/3}, n/20\))对真实 ECE 的逼近。结果显示: - 对光滑 \(g\),rankECE 的比值(估计值/真实 ECE)快速趋近 1; - 对高频振荡 \(g\),binning 严重低估 ECE,而 rankECE 仍能保持较高的比值; - 固定 \(K\) 的 binning 在 \(n\) 增大时比值趋于一个小于 1 的常数(偏差不消失),而 rankECE 的比值趋于 1。

真实数据(第 5.1.2 节):使用 Amazon 和 Yelp 情感分类任务,评估四个预训练模型(DistilBERT SST2、BERT SST2、RoBERTa Twitter Sentiment、BERT Multilingual Stars)。对每个模型,从测试集中抽取不同大小的子样本,计算 rankECE 和 binning ECE 对"真实 ECE"(用大样本近似)的逼近。结果与模拟一致:rankECE 的比值更接近 1,且对 bin 数不敏感。

检验功效(第 5.2 节):在失准模型(\(g(z) = z - z^4\))下,比较 rankECE 检验(有限样本和渐近)与 SKCE 检验(高斯核、拉普拉斯核)的功效。结果显示: - rankECE 渐近检验的功效与 SKCE-U 相当,在 \(n=100\) 时略低,在 \(n\ge 200\) 时接近; - rankECE 有限样本检验更保守,功效较低但无需渐近近似; - 计算时间上,rankECE 比 SKCE-U 快 2–3 个数量级(SKCE-U 需 \(O(n^2)\) 且需 bootstrap)。

这些例子想说明什么:rankECE 在"逼近 ECE"和"检验失准"两个任务上都优于 binning,且计算成本远低于 SKCE。作者用这些实验支持"rankECE 是 ECE 的实用替代度量"这一主张。

🔎 结论是否比证明窄

  • 命题 3.2(渐近收敛到 ECE) 只对固定 \(f\) 成立,没有给出关于 \(f\) 的均匀收敛。这意味着如果 \(f\) 随 \(n\) 变化(如训练过程中),结论不适用。作者在 Remark 3.2 中承认这一点。
  • 定理 3.1(零刻画) 在 \(n \ge 4\) 时成立,但证明依赖 \(Z\) 的非原子性。附录 F 虽然推广到一般情形,但推广后的定义引入了额外的随机化,其解释性略弱。
  • 命题 3.3(总变差界) 给出的是 \(O(\|r\|_{TV}/n)\) 的界,但 \(\|r\|_{TV}\) 可能很大(对高频振荡 \(r\))。作者在例子中展示了 rankECE 仍能检测高频失准,但理论上没有给出不依赖 \(\|r\|_{TV}\) 的界。
  • 定理 4.1(与 binning 比较) 的常数 \(4K/n\) 是保守的;实验显示实际差距更小。作者没有给出更紧的界。
  • 检验的渐近正态性(定理 3.2) 要求 \(E[Z^2(1-Z)^2] > 0\),即 \(Z\) 不能退化到 \(\{0,1\}\)。这是合理的,但未讨论 \(Z\) 接近退化时的行为。
  • 可行动性(定理 B.1) 只对分段单调变换类成立,且界中含有 \(\sqrt{\text{rankECE}}\),对中等失准可能较松。

总体而言,论文的主要结论(下界、渐近收敛、检验有效性)都有严格证明,但"rankECE 是 ECE 的好近似"这一核心主张在理论上只对固定 \(f\) 和总变差有界的情形成立。实验补充了更广泛场景的证据,但缺乏对 \(f\) 自适应(data-dependent)情形的理论分析。


四、开放问题

以下问题均扎根于论文的具体语句或直接推论,供研究者自行判断价值。

  1. 总变差假设是否本质? 论文在讨论中写道:"it remains an open question as to whether the total variation assumption offers a sharp characterization of the types of miscalibration that can, or cannot, be detected with finite samples"(Discussion 第 1 段)。可以追问:是否存在比总变差更弱的假设(如 Hölder 类、有界 \(p\)-变差)仍能保证 rankECE 与 ECE 的差距为 \(o(1)\)?反过来,能否构造总变差无界但 rankECE 仍能检测的失准类型?

  2. 自适应 \(f\) 的均匀收敛。命题 3.2 只对固定 \(f\) 成立。若 \(f\) 是从数据中训练的(如神经网络),其复杂度随 \(n\) 增长,rankECE 是否仍收敛到 ECE?这需要关于 \(f\) 的复杂度度量(如 VC 维、覆盖数)的均匀版本。论文没有讨论这一点。

  3. rankECE 的 minimax 最优性。论文给出了 rankECE 作为 ECE 估计量的偏差界,但没有讨论其方差下界。是否存在比 rankECE 更优的"无 bin 选择"估计量?能否刻画在总变差类上估计 ECE 的 minimax 收敛速率?

  4. 检验功效的定量比较。论文实验显示 rankECE 渐近检验功效接近 SKCE-U,但没有理论功效分析。能否证明在局部备择(local alternatives)下 rankECE 检验的渐近相对效率(ARE)相对于 SKCE 或最优检验?

  5. 多维/结构化预测的扩展。论文的构造依赖 \(Z = f(X)\) 是一维的。对于多维预测(如多分类、向量值输出),如何定义"排序"?能否用深度/字典序推广 rankECE?附录 F 只处理了并列,未处理多维。

  6. 与决策损失的直接联系。定理 B.1 给出了 actionability 保证,但界中含有 \(M\)(分段单调变换的段数)。能否将 \(M\) 的选择自适应于数据?是否存在更紧的界,将 rankECE 直接与贝叶斯最优决策损失联系起来?

  7. 去随机化版本的效率。附录 F 的推广引入了随机化打破并列。去随机化版本(如平均所有可行排序)的计算复杂度如何?是否会影响集中性常数?

  8. 校准度量的公理化刻画。论文将 rankECE 定位为 ECE 的"代理",但没有讨论它是否满足某些公理(如单调性、可加性、对保序变换的不变性)。是否存在一个公理体系,使得 rankECE 是唯一满足这些公理的度量?

提醒:要确认上述问题是否为真 gap,建议检索近 2–3 年关于 calibration 度量(SKCE、dCE、smooth ECE)的后续工作,看是否已有解决。若多篇近期论文的引言都指向同一问题,则可能是共识性 gap;若各论文对同一问题的结论互相矛盾,则可能是更值得深挖的机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论