跳转至

Shape-Adaptive Conditional Calibration for Conformal Prediction via Minimax Optimization

讲者: Yajie Bao
会场: Large-Scale Inference and Selective Inference
报告题目: Shape-Adaptive Conditional Calibration for Conformal Prediction via Minimax Optimization
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

共形预测(Conformal Prediction, CP)是一种分布自由、模型无关的预测推断框架,能在有限样本下保证预测集对真实标签的覆盖概率不低于预设水平(如 90%)。经典的 split conformal prediction 仅保证边际覆盖\(P\{Y \in C(X)\} \ge 1-\alpha\)。但在异质性数据中,边际覆盖可能对某些子群严重欠覆盖。因此,更严格的目标是条件覆盖\(P\{Y \in C(X) \mid X = x\} \ge 1-\alpha\) 几乎处处成立。然而,Vovk (2012) 和 Lei et al. (2013) 已证明:在分布自由设定下,精确的条件覆盖不可能,除非允许平凡的无界预测集。因此,大量工作转向近似条件覆盖渐近条件覆盖,通过修改校准步骤或设计更好的非一致性得分来实现。

发展脉络

  1. 奠基工作:Vovk et al. (2005) 提出共形预测框架,Lei et al. (2018) 系统化 split conformal prediction,给出边际覆盖保证。Lei & Wasserman (2014) 提出通过划分协变量空间实现组条件覆盖(binning),但划分粗糙时覆盖不均匀。

  2. 局部化方法:Guan (2023) 提出 localized conformal prediction,用相似性权重对校准得分加权,实现有限样本边际覆盖和渐近条件覆盖。Hore & Barber (2025) 进一步引入随机化,在协变量偏移下提供松弛的局部覆盖保证。这些方法本质上仍依赖固定得分函数,仅调整阈值。

  3. 多验证方法:Jung et al. (2023) 借鉴算法公平中的多准确率思想,提出 multivalid conformal prediction,对用户指定的有限组集合(可重叠)渐近保证条件覆盖。其收敛速率为 \(n^{-1/4}\)

  4. 条件校准(Conditional Calibration, CC):Gibbs et al. (2025) 将条件覆盖转化为函数分位数回归问题:\(\min_{f \in \mathcal{F}} \mathbb{E}[\ell_\alpha(s(X,Y), f(Z))]\),其中 \(s\) 是固定得分,\(f\) 是阈值函数。该方法在有限维 \(\mathcal{F}\) 下给出有限样本组条件覆盖保证,在无限维下通过矩约束松弛控制条件覆盖偏差。但 CC 只能调整阈值,无法改变预测集的几何形状(如旋转、长宽比)。

  5. 多元标签的几何形状:Johnstone & Cox (2021) 和 Messoudi et al. (2022) 用马氏距离构造椭球预测集;Thurin et al. (2025) 用最优传输定义多元得分排序;Braun et al. (2025) 通过最小化体积优化任意范数球。这些方法主要关注得分设计,校准阶段仍只调阈值,且仅保证边际覆盖。

  6. 本文位置:Bao et al. (2026) 提出 MOPI,将条件预测推断重新表述为极小极大优化问题。与 CC 相比,MOPI 允许预测集的几何形状(通过参数化函数类 \(\mathcal{C}\))在校准阶段自适应调整,且允许条件变量 \(Z\) 与协变量 \(X\) 不同(例如敏感属性在测试时被屏蔽)。理论方面,MOPI 建立了与均方覆盖误差(MSCE)的直接联系,并给出非渐近 oracle 不等式,在组条件覆盖下达到 \(n^{-1/2}\) 速率(匹配 Areces et al. 2024 的最优速率,优于 Jung et al. 2023 的 \(n^{-1/4}\))。

子线索聚类

  • 线索 A:局部化与加权方法(Guan 2023, Hore & Barber 2025, Györfi & Walk 2019, Sesia & Romano 2021)。核心思想:用核权重或最近邻对校准得分加权,实现局部覆盖。优点:计算简单;缺点:得分固定,形状不可变,且通常要求 \(Z \subseteq X\)

  • 线索 B:多验证与组覆盖(Jung et al. 2023, Barber et al. 2021, Lei & Wasserman 2014)。核心思想:对有限组集合(可重叠)保证覆盖。Jung et al. 用多准确率迭代,Barber et al. 研究正则子集上的近似条件覆盖。速率较慢(\(n^{-1/4}\))。

  • 线索 C:函数分位数回归 / 条件校准(Gibbs et al. 2025, Kiyani et al. 2024b)。核心思想:将条件覆盖转化为矩约束或分位数回归,通过优化阈值函数实现。CC 是本文最直接的竞争方法。优点:理论清晰,有限维下有有限样本保证;缺点:形状固定,无法处理 \(Z\)\(X\) 不同的情况。

  • 线索 D:几何形状自适应(Johnstone & Cox 2021, Thurin et al. 2025, Braun et al. 2025, Feldman et al. 2023)。核心思想:设计更好的得分函数(如马氏距离、最优传输)以产生更紧的预测集。但校准阶段仍只调阈值,且通常只保证边际覆盖。本文 MOPI 属于此线索,但将形状调整纳入校准阶段。

核心问题与瓶颈

  1. 如何在校准阶段自适应调整预测集几何形状? 现有方法要么固定得分(CC),要么在训练阶段设计得分(Johnstone & Cox),但校准阶段无法改变形状。MOPI 通过极小极大优化直接优化参数化形状函数 \(h(x)\)

  2. 如何处理条件变量 \(Z\) 与协变量 \(X\) 不同的情况? 例如敏感属性在测试时被屏蔽。CC 要求 \(Z \subseteq X\),否则无法在测试时计算阈值。MOPI 通过解耦覆盖强制执行(内层最大化依赖 \(Z\))与预测映射(外层最小化依赖 \(X\)),允许 \(Z\) 仅在校准阶段使用。

  3. 如何量化条件覆盖误差并给出收敛速率? 多数方法只给出渐近或松弛保证。MOPI 直接以 MSCE 为目标,给出非渐近 oracle 不等式,并在组条件下达到最优 \(n^{-1/2}\) 速率。

⚠️ 作者的 framing

作者将缺口 frame 为:现有条件校准方法(CC)受限于固定得分函数的几何刚性,且无法处理 \(Z\)\(X\) 不同的情况。因此,MOPI 是“显然的下一步”——通过极小极大优化同时解决形状自适应和变量解耦。作者淡化了以下竞争路线: - 多验证方法(Jung et al. 2023)虽然速率较慢,但能处理任意重叠组,且理论框架不同。作者仅在相关工作中提及,未深入比较。 - 局部化方法(Guan 2023, Hore & Barber 2025)计算简单,在某些场景下可能更实用。作者在模拟中将其作为基线,但未讨论其计算优势。 - 直接优化得分函数的方法(Braun et al. 2025)也能实现形状自适应,但仅保证边际覆盖。作者在相关工作中指出这一点,但未讨论是否可将这些得分函数嵌入 MOPI 框架。

值得研究者去查的问题:本文未引用 Areces et al. (2024) 关于条件覆盖两个基本极限的工作(虽然 Theorem 4.3 的速率匹配该文),也未引用 Angelopoulos et al. (2024) 的理论基础综述。此外,关于极小极大公式用于条件矩约束的早期工作(Dikkala et al. 2020, Bennett & Kallus 2023)被引用,但未讨论这些工作与共形预测的深层联系(如是否可导出更紧的界)。

张力

未见明显对立引用。各方法在各自设定下成立,主要差异在于条件覆盖的严格程度、计算成本、形状灵活性。MOPI 在形状灵活性和变量解耦方面有明显优势,但代价是优化非凸(因指示函数),需用平滑代理。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \(X \in \mathcal{X} \subseteq \mathbb{R}^{d_X}\):协变量(特征),可观测。
  • \(Y \in \mathcal{Y} \subseteq \mathbb{R}^{d_Y}\):标签,可观测。
  • \(Z \in \mathcal{Z}\):条件变量,决定覆盖范围。可观测(至少在校准阶段)。可以是 \(X\) 本身、\(X\) 的子集、或敏感属性。
  • \(C(\cdot): \mathcal{X} \to 2^{\mathcal{Y}}\):集值函数,即预测集。目标是找到 \(C\) 使得 \(P\{Y \in C(X) \mid Z = z\} = 1-\alpha\) 对所有 \(z\) 成立。
  • \(\alpha \in (0,1)\):名义错误率(如 0.1)。
  • \(s(x,y)\):预训练的非一致性得分函数(固定)。
  • \(h(x)\):阈值函数或形状参数(如均值 \(\mu(x)\)、协方差 \(\Sigma(x)\)),属于函数类 \(\mathcal{H}\)
  • \(T(h(x), y)\):用于定义预测集的函数,如 \(T(h(x), y) = s(x,y) - h(x)\)(子水平集)或 \(T(h(x), y) = (y-\mu(x))^\top \Sigma^{-1}(x)(y-\mu(x)) - 1\)(椭球)。
  • \(\mathcal{C} = \{ C(x; h) = \{ y \in \mathcal{Y} : T(h(x), y) \le 0 \} : h \in \mathcal{H} \}\):结构化的集值函数类。
  • \(\mathcal{F}\):权重函数类,定义在 \(\mathcal{Z}\) 上,用于将条件约束松弛为边际矩约束。
  • \(\Psi(C, f) = \mathbb{E}[ f(Z)(1\{Y \notin C(X)\} - \alpha) - f^2(Z) ]\):带 \(L_2\) 惩罚的极小极大目标。
  • \(\text{MSCE}(C) = \mathbb{E}[ (\alpha(Z;C) - \alpha)^2 ]\),其中 \(\alpha(Z;C) = P\{Y \notin C(X) \mid Z\}\):均方覆盖误差。
  • \(C^{\text{ora}} = \arg\min_{C \in \mathcal{C}} \text{MSCE}(C)\):oracle 最优集。
  • \(n\):校准样本量。
  • \(D_n = \{(X_i, Y_i, Z_i)\}_{i=1}^n\):i.i.d. 校准数据。

  • 模型:数据 \((X,Y,Z)\) 来自某个未知联合分布。没有分布假设(分布自由)。唯一假设是校准数据与测试数据可交换(或 i.i.d.)。预测集 \(C(X)\) 的构造仅依赖校准数据,不依赖测试数据。

  • 可观测数据:研究者实际能观测到的是 \((X_i, Y_i, Z_i)\) 三元组(校准集)和测试协变量 \(X\)(可能还有 \(Z\),但若 \(Z\) 是敏感属性,测试时可能被屏蔽)。想要但观测不到的是条件覆盖概率 \(\alpha(Z;C) = P\{Y \notin C(X) \mid Z\}\),因为条件分布未知。因此只能通过样本矩约束来近似。

第二步:最小内核——组条件覆盖下的 MOPI

考虑最简单的设定:组条件覆盖(Example 2.2)。设 \(\mathcal{Z}\) 有限,\(|\mathcal{Z}| = K\),例如 \(Z = (1\{X \in G_1\}, \ldots, 1\{X \in G_K\})^\top\),组互不相交。目标:对每个组 \(k\)\(P\{Y \in C(X) \mid X \in G_k\} = 1-\alpha\)

进一步简化:取预测集类为子水平集(7):\(C(x; h) = \{ y : s(x,y) \le h(x) \}\),其中 \(s\) 是固定得分(如绝对残差),\(h: \mathcal{X} \to \mathbb{R}\) 是阈值函数。令 \(\mathcal{H} = \mathcal{F} = \{ \sum_{z \in \mathcal{Z}} \beta_z 1\{Z = z\} : \beta_z \in \mathbb{R} \}\),即阈值函数只依赖于组指示,每个组一个常数阈值。

此时,MOPI 的极小极大问题(5)退化为:

\[\min_{h \in \mathcal{H}} \max_{f \in \mathcal{F}} \mathbb{E}\left[ f(Z)(1\{Y \notin C(X;h)\} - \alpha) - f^2(Z) \right].\]

由于 \(\mathcal{F}\) 是有限维参数类,内层最大化有闭式解(Lemma 3.1):

\[\max_{f \in \mathcal{F}} \Psi(C, f) = \sum_{z \in \mathcal{Z}} \frac{ \left( \mathbb{E}[1\{Z=z\}(1\{Y \notin C(X;h)\} - \alpha)] \right)^2 }{4 P(Z=z) }.\]

注意 \(\mathbb{E}[1\{Z=z\}(1\{Y \notin C(X;h)\} - \alpha)] = P(Z=z)(\alpha(z;h) - \alpha)\),其中 \(\alpha(z;h) = P\{Y \notin C(X;h) \mid Z=z\}\)。因此,

\[\max_{f \in \mathcal{F}} \Psi(C, f) = \sum_{z \in \mathcal{Z}} \frac{ P(Z=z)^2 (\alpha(z;h) - \alpha)^2 }{4 P(Z=z) } = \frac{1}{4} \sum_{z \in \mathcal{Z}} P(Z=z) (\alpha(z;h) - \alpha)^2 = \frac{1}{4} \text{MSCE}(C).\]

于是,极小极大问题等价于最小化 MSCE。而 oracle 最优解 \(C^{\text{ora}}\) 就是使每个组的条件覆盖恰好为 \(1-\alpha\) 的阈值函数(若存在)。由于 \(\mathcal{H}\) 足够丰富(每个组一个自由参数),只要每个组内条件分位数存在,\(C^{\text{ora}}\) 就能实现零 MSCE。

核心思路:在有限组条件下,MOPI 的极小极大目标恰好是 MSCE 的 1/4 倍,因此求解 MOPI 等价于直接最小化条件覆盖误差。这与 CC 方法(最小化 pinball 损失)不同:CC 的 pinball 损失是 MSCE 的上界,但不一定等价;MOPI 在 \(\mathcal{F}\) 足够表达 \(\alpha(z;h)-\alpha\) 时严格等价。

为什么这个例子是内核:它去掉了所有一般性技术假设(RKHS、平滑代理、VC 维),只保留最核心的等价关系:极小极大 \(\leftrightarrow\) MSCE。论文的一般情形(无限维 \(\mathcal{Z}\)、形状自适应类 \(\mathcal{C}\))只是在这个内核上“加壳”:用 RKHS 近似 \(\alpha(\cdot;C)-\alpha\),用局部 Rademacher 复杂度控制估计误差,用平滑代理处理不可微性。


三、这篇论文做了什么

三句话

  1. 研究问题:在共形预测中,如何在校准阶段自适应调整预测集的几何形状(如椭球的方向、长宽比),以实现更好的条件覆盖(包括 \(Z\)\(X\) 不同的情况),并给出非渐近理论保证。
  2. 核心方法:提出 MOPI 框架,将条件预测推断转化为极小极大优化问题:\(\min_{C \in \mathcal{C}} \max_{f \in \mathcal{F}} \mathbb{E}[ f(Z)(1\{Y \notin C(X)\} - \alpha) - f^2(Z) ]\),其中 \(\mathcal{C}\) 是参数化的集值函数类(如椭球、盒子),\(\mathcal{F}\) 是权重函数类(有限维或 RKHS)。
  3. 主要结论:在 \(\mathcal{F}\) 足够表达 \(\alpha(\cdot;C)-\alpha\) 时,MOPI 等价于最小化 MSCE;建立了非渐近 oracle 不等式,收敛速率由 \(\mathcal{F}\)\(\mathcal{C}\) 的复杂度决定;在组条件覆盖下达到 \(n^{-1/2}\) 速率(最优);在 RKHS 权重类下达到 \(d_Z \log^{d_Z+1}(n/d_Z)/n\) 速率;平滑代理引入额外偏差 \(O(r^2)\)

关键设定与假设

  • 设定:数据 i.i.d. 或可交换。预测集类 \(\mathcal{C}\) 由 (3) 定义,其中 \(T\) 固定,\(h \in \mathcal{H}\) 是形状参数。权重函数类 \(\mathcal{F}\) 对称(\(f \in \mathcal{F} \Rightarrow -f \in \mathcal{F}\))。目标:\(Z\)-条件覆盖 (1)。
  • 假设
  • Assumption 1\(\mathcal{F}\) 的星形性与有界性):\(\mathcal{F}_U = \{ f \in \mathcal{F} : \|f\|_{\mathcal{F}}^2 \le U \}\) 是星形的,且 \(\sup_{f \in \mathcal{F}_U} \sup_{z \in \mathcal{Z}} |f(z)| \le 1\)。这用于控制函数类的复杂度和无穷范数。
  • Assumption 2(投影误差):对任意 \(C \in \mathcal{C}\),存在 \(f_C \in \mathcal{F}_U\) 使得 \(\mathbb{E}[(f_C(Z) - (\alpha(Z;C) - \alpha(Z;C^{\text{ora}})))^2] \le \eta^2\)\(\eta\) 衡量 \(\mathcal{F}\) 能否近似条件覆盖偏差。若 \(\alpha(\cdot;C)-\alpha \in \mathcal{F}\),则 \(\eta=0\)
  • Assumption 3(近似误差条件):(i) 存在 \(H_0(Z)\) 使得 \(P\{T(H_0(Z), Y) \le 0 \mid Z=z\} = 1-\alpha\);(ii) \(h_0(x) = \mathbb{E}[H_0(Z) \mid X=x] \in \mathcal{H}\);(iii) 条件覆盖概率关于形状参数 Lipschitz。这用于控制 oracle 近似误差 \(\text{MSCE}(C^{\text{ora}})\)
  • Assumption 4(VC 维):函数类 \(\{(x,y) \mapsto T(h(x), y) : h \in \mathcal{H}\}\) 有 VC 维 \(d_C\)。用于有限维 \(\mathcal{C}\) 的复杂度控制。

相比已有文献:与 CC (Gibbs et al. 2025) 相比,MOPI 不需要假设 \(Z \subseteq X\),且允许 \(\mathcal{C}\) 更灵活(不限于子水平集)。与多验证方法 (Jung et al. 2023) 相比,MOPI 的假设更少(不要求组集合有限),但需要 \(\mathcal{F}\) 足够丰富。

主要结果

  • Proposition 2.1(等价性):若 \((\alpha(\cdot;C)-\alpha)/2 \in \mathcal{F}\) 对所有 \(C \in \mathcal{C}\) 成立,则 \(\max_{f \in \mathcal{F}} \Psi(C,f) = \text{MSCE}(C)/4\),且 \(C^* = C^{\text{ora}}\)。这建立了极小极大目标与 MSCE 的直接联系,是全文理论基石。
  • Theorem 4.1(Oracle 不等式):在 Assumptions 1-2 下,以高概率,
    \[\mathbb{E}[(\alpha(Z;\hat{C})-\alpha)^2 \mid D_n] \lesssim \text{MSCE}(C^{\text{ora}}) + \eta^2 + \delta_{n,\mathcal{F}_U}^2 + \delta_{n,\mathcal{G}}^2 + \frac{\log(\log_2(1/\delta_{n,\mathcal{G}})/\zeta)}{n},\]
    其中 \(\delta_{n,\mathcal{F}_U}, \delta_{n,\mathcal{G}}\) 是局部 Rademacher 临界半径。该界将 MSCE 分解为近似误差(\(\text{MSCE}(C^{\text{ora}})\))、投影误差(\(\eta^2\))、估计误差(复杂度项)。
  • Theorem 4.2(近似误差界):在 Assumption 3 下,若 \(H_0(Z)\) 可被 \(X\) 预测(即 \(\sigma(X)\) 可测),则 \(\text{MSCE}(C^{\text{ora}})=0\);否则 \(\text{MSCE}(C^{\text{ora}}) \le \kappa^2 (1-\rho^2) \text{Tr}(\text{Cov}(H_0(Z)))\),其中 \(\rho^2 = \text{Tr}(\text{Cov}(h_0(X))) / \text{Tr}(\text{Cov}(H_0(Z)))\)。这量化了 \(Z\)\(X\) 的相关性对近似误差的影响。
  • Theorem 4.3(有限 \(\mathcal{Z}\) 下的速率):若 \(|\mathcal{Z}| < \infty\)\(\mathcal{F}\) 为参数类,\(\mathcal{C}\) 有 VC 维 \(d_C\),则
    \[\text{MSCE}(\hat{C}) \lesssim \text{MSCE}(C^{\text{ora}}) + \frac{d_C + |\mathcal{Z}|}{n} \log\left( \frac{n}{d_C + |\mathcal{Z}|} \right).\]
    在组条件覆盖下(\(\text{MSCE}(C^{\text{ora}})=0\)),速率 \(n^{-1/2}\)(对数因子内),匹配 Areces et al. (2024) 的最优速率,优于 Jung et al. (2023) 的 \(n^{-1/4}\)
  • Theorem 4.4(无限 \(\mathcal{Z}\) 下的速率):若 \(\mathcal{Z} = [0,1]^{d_Z}\)\(\mathcal{F}\) 为高斯核 RKHS,\(\mathcal{C}\) 有 VC 维 \(d_C\),则
    \[\text{MSCE}(\hat{C}) \lesssim \text{MSCE}(C^{\text{ora}}) + \eta^2 + \frac{d_C \log(n/d_C)}{n} + \frac{d_Z \log^{d_Z+1}(n/d_Z)}{n}.\]
    第一项是 VC 类速率,第二项是 RKHS 速率。
  • Theorem 4.5(平滑代理的 oracle 不等式):用高斯误差函数平滑后,额外误差为 \(O(r^2 / (\delta_{n,\mathcal{F}_U} + \sqrt{\log n/n})^2)\),其中 \(r\) 是平滑参数。建议取 \(r \lesssim \min\{\delta_{n,\mathcal{F}_U}^2, \log n/n\}\) 使平滑偏差可忽略。

证明路线与技术技巧

整体路线(以 Theorem 4.1 为例):

  1. 分解 MSCE\(\mathbb{E}[(\alpha(Z;\hat{C})-\alpha)^2] \le 2\text{MSCE}(C^{\text{ora}}) + 2\mathbb{E}[(\alpha(Z;\hat{C})-\alpha(Z;C^{\text{ora}}))^2]\)。核心是控制第二项。
  2. 利用最优性条件:由 \(\hat{C}\) 的定义,\(\max_f \hat{\Psi}_\gamma(\hat{C}, f) \le \max_f \hat{\Psi}_\gamma(C^{\text{ora}}, f) + \nu(\|C^{\text{ora}}\|_{\mathcal{H}}^2 - \|\hat{C}\|_{\mathcal{H}}^2)\)。通过上下界放缩,将经验目标与总体目标联系起来。
  3. 控制经验过程的偏差:对 \(\mathcal{F}_U\)\(\mathcal{G}\) 使用局部 Rademacher 复杂度(Bartlett et al. 2005),得到高概率下 \(\|f\|_{L^2,n}^2\)\(\|f\|_{L^2}^2\) 的偏差界,以及 \(|(P_n-P)\psi(C,f)|\) 的界。
  4. 投影引理:定义 \(f_C = \arg\min_{f \in \mathcal{F}_U} \mathbb{E}[(f(Z) - (\alpha(Z;C)-\alpha(Z;C^{\text{ora}})))^2]\),利用 Assumption 2 控制投影误差 \(\eta\)。通过 Cauchy-Schwarz 和 Lipschitz 性质,将 \(P\psi(C,f_C) - P\psi(C^{\text{ora}}, f_C)\)\(\|\alpha(C)-\alpha(C^{\text{ora}})\|_{L^2}\) 联系起来。
  5. 剥壳(peeling)与临界半径:对 \(\mathcal{G}\) 的临界半径 \(\delta_{n,\mathcal{G}}\) 使用剥壳参数 \(r\),结合 Bennett 不等式和 Rademacher 复杂度,得到 \(\|\alpha(\hat{C})-\alpha(C^{\text{ora}})\|_{L^2}\) 的上界。
  6. 合并:最终得到 \(\|\alpha(\hat{C})-\alpha(C^{\text{ora}})\|_{L^2} \lesssim \epsilon + \delta_{n,\mathcal{F}_U} + \delta_{n,\mathcal{G}} + \eta + \nu\|C^{\text{ora}}\|_{\mathcal{H}}^2/\tilde{\delta}_{n,\mathcal{F}} + \sqrt{\log(R_n/\zeta)/n}\)

关键跳跃点: - 从经验目标到总体目标的放缩:需要同时处理 \(\mathcal{F}\) 的无穷维和 \(\mathcal{C}\) 的复杂度。作者利用星形假设和局部 Rademacher 复杂度,将经验 \(L_2\) 范数与总体 \(L_2\) 范数联系起来(Lemma S6),这是非渐近分析的标准技巧。 - 处理指示函数的非 Lipschitz 性:在无限维 \(\mathcal{C}\) 下(附录 D),作者引入 margin 成本函数(φ, φ̄)来近似指示函数,通过优化 margin 参数 σℓ 得到收敛速率。这是分类理论中的标准技巧(Mason et al. 2000, Koltchinskii & Panchenko 2002)。 - 平滑代理的偏差分析:Theorem 4.5 需要额外控制平滑偏差,作者利用误差函数的积分性质(Lemma S4)得到 \(O(r)\) 的偏差,并通过 Lipschitz 常数 \(1/(\sqrt{2\pi}r)\) 与复杂度项结合。

技术技巧点名: - 局部 Rademacher 复杂度(Bartlett et al. 2005):用于控制函数类的临界半径,得到非渐近高概率界。 - 星形假设:简化剥壳参数选择。 - Bennett 不等式与功能版本(Bousquet 2003):用于经验过程的高概率界。 - 广义表示定理(Schölkopf et al. 2001):用于 RKHS 内层最大化的闭式解(Lemma 3.2)。 - Margin 成本函数(Mason et al. 2000):用于处理无限维 \(\mathcal{C}\) 下指示函数的非 Lipschitz 性。 - Dudley 积分:用于从覆盖数导出 Rademacher 复杂度上界。 - VC 维与覆盖数:用于有限维 \(\mathcal{C}\) 的复杂度控制。

真实例子与应用

论文包含两个真实数据实验:

  1. Households Dataset(Section 6.1):
  2. 数据:7,207 个家庭,标签为住房和健康支出(二维),协变量包括家庭特征、交通、娱乐、食品、公用事业支出和收入。
  3. 方法应用:构造椭球预测集。MOPI 使用预训练随机森林估计均值 \(\mu_0\),神经网络估计协方差 \(\Sigma_0\),然后在校准阶段通过极小极大优化调整协方差 \(\Sigma(x)\)\(\mathcal{F}\) 为高斯核 RKHS,\(\mathcal{H}\) 为神经网络类。
  4. 结果:MOPI 在组条件覆盖(低支出/收入子群)和局部覆盖(收入水平)上均接近名义水平 90%,且预测集体积更小。图 5 显示 MOPI 的覆盖更均匀。
  5. 说明:验证 MOPI 在真实多元标签数据上的形状自适应能力,以及相比 CC、RLCP、SCP 的优势。

  6. Communities and Crime Dataset(Section 6.2):

  7. 数据:预测社区暴力犯罪率,协变量包括人口、失业率、收入、种族构成等。将种族构成作为敏感属性 \(Z\)
  8. 方法应用:子水平集(绝对残差得分)。考虑两种场景:unmasked(\(Z\) 在测试时可用)和 masked(\(Z\) 被屏蔽)。MOPI 的 \(\mathcal{F}\)\(\mathcal{H}\) 均为高斯核 RKHS。
  9. 结果:在 unmasked 场景下,MOPI 和 CC 均达到目标覆盖;在 masked 场景下,CC 和 RLCP 失败,而 MOPI 仍能保持种族间的均衡覆盖(图 6)。
  10. 说明:验证 MOPI 处理 \(Z\)\(X\) 不同的能力,这是 CC 无法做到的。

🔎 结论是否比证明窄

  • Theorem 4.1 的 oracle 不等式依赖于 Assumption 2(投影误差 \(\eta\)),但作者在后续定理中(Theorem 4.3, 4.4)假设 \(\eta=0\) 或通过具体类保证。在一般设定下,\(\eta\) 可能非零,但作者未给出 \(\eta\) 的显式上界(如通过 \(\mathcal{F}\) 的逼近能力)。论文在 Section 4.3 中仅对有限 \(\mathcal{Z}\) 和 RKHS 给出了具体速率,但未讨论 \(\mathcal{F}\) 为其他类(如 Sobolev 空间)的情况。
  • Theorem 4.2 的近似误差界要求 Assumption 3(i) 存在 \(H_0(Z)\) 使得条件覆盖精确为 \(1-\alpha\)。这在连续 \(Z\) 下可能不成立(除非分布足够光滑),但作者在 Corollary C.1 中假设 \(\alpha(Z;C)-\alpha \in \mathcal{F}_U\) 来绕过。实际中,若 \(\mathcal{H}\) 不够丰富,\(\text{MSCE}(C^{\text{ora}})\) 可能非零,但论文未给出非参数逼近误差的显式速率(如通过 Sobolev 嵌入)。
  • 平滑代理的 Theorem 4.5 假设密度有上界,且 \(\sup_{f \in \mathcal{F}} \sup_z |f(z)|\) 有界。这些条件在 RKHS 下成立,但未讨论更一般的 \(\mathcal{F}\)
  • 模拟与真实数据中,MOPI 使用神经网络类 \(\mathcal{H}\),但理论部分(Theorem 4.3, 4.4)假设 \(\mathcal{C}\) 有 VC 维 \(d_C\)。神经网络的 VC 维有界(Bartlett et al. 2019),但实际中 \(d_C\) 可能很大,导致速率项 \(d_C/n\) 可能主导。论文未讨论这一矛盾。

四、开放问题

  1. 非凸优化与凸代理:MOPI 的目标因指示函数非凸,目前用平滑代理(Sigmoid/误差函数)近似。作者在 Section 7 指出,探索凸代理损失并分析相应理论性质是有意义的方向。扎根点:Section 7 第一句。

  2. 同时优化下游任务效率:当前 MOPI 只保证 \(Z\)-条件覆盖,但未考虑预测集体积或下游决策损失。作者提到同时优化体积(Braun et al. 2025)或决策损失(Bao et al. 2025)是开放问题。扎根点:Section 7 第二句。

  3. 无限维 \(\mathcal{C}\) 下的最优速率:Theorem S1(附录 D)对无限维 \(\mathcal{C}\)(RKHS)给出了速率,但依赖于 margin 参数优化。是否可达到 minimax 最优速率?扎根点:附录 D 的 Theorem S1 的证明依赖于 margin 成本函数,未与已知下界比较。

  4. 条件覆盖的检验问题:MOPI 以 MSCE 为目标,但未提供假设检验(如 \(H_0: \text{MSCE}=0\))的工具。结合研究者对假设检验的兴趣,可考虑构造基于 MOPI 的覆盖误差检验。扎根点:论文未涉及检验,但 MSCE 的 oracle 不等式可用于构造置信上界。

  5. 与高阶 U-统计量的潜在联系:MOPI 的极小极大目标涉及指示函数的期望,其经验版本是 U-统计量(当 \(\mathcal{C}\) 固定时)。若 \(\mathcal{C}\) 是参数化的,则目标成为经验过程。研究者熟悉的高阶 U-统计量张量网络复杂度(treewidth / einsum)可能用于分析更复杂的 \(\mathcal{C}\)(如张量积形状)。扎根点:论文未提及,但可视为跨领域机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论