Conformalized Large-Scale Selective Inference with Informative and Trustworthy Prediction Sets¶
讲者: Wenguang Sun
会场: Recent Advances in Model Free Inference
报告题目: Conformalized Large-Scale Selective Inference with Informative and Trustworthy Prediction Sets
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是大规模选择性预测中的信息性与可信性联合控制。根本问题:在成千上万个测试单元中,研究者只能对其中一部分进行后续验证(如药物筛选、基因组学),因此需要一种选择性报告策略——只报告那些既科学上有意义(满足用户指定的信息性约束,如预测区间不包含无趣值、分类集大小受限)又统计上可信(控制错误覆盖率 FCR 在预设水平)的预测集。该方向融合了共形预测(分布自由、有限样本保证)与多重假设检验中的 FCR 控制(Benjamini & Yekutieli 2005),当前成熟度:方法学上已有若干工作,但存在保守性、信息性损失或缺乏理论保证等问题,本文试图填补这些缺口。
发展脉络(history)¶
- 奠基工作:Benjamini & Yekutieli (2005) 引入 FCR 概念,提出 BY-FCR 过程,但保守且未考虑信息性约束。Vovk et al. (2005) 提出共形预测,提供分布自由的预测集。
- 主要进展:
- 共形选择:Jin & Candès (2023) 提出 cfBH,用共形 p 值进行选择,控制 FDR,但仅适用于单边假设,且缺乏信息性约束。
- 选择性共形推断:Bao et al. (2024) 提出 SCOP(后选择校准),Jin & Ren (2025) 提出 JOMI(交换调整),两者均控制 FCR,但调整后的预测集可能违反信息性约束(如区间变宽、包含无趣值)。
- 信息性共形预测:Gazin et al. (2025) 提出 InfoFCR 框架与 InfoSP 方法,首次同时保证信息性与 FCR 控制,但被作者指出本质保守(FCR 远低于名义水平,报告集数量少)。
- 当前 frontier:如何克服 InfoSP 的保守性,同时保持有限样本有效性和信息性?本文的 SCIP 框架正是针对此问题。
- 本文位置:作者将 SCIP 定位为 InfoSP 的增强版,通过引入信任分数和广义共形 p 值,实现渐近反保守性(FCR 接近 α),并证明有限样本 FCR 控制。同时,SCIP 统一了多个现有方法(cfBH、FASI、Zhao-Su 过程)作为特例。
子线索聚类¶
- FCR 控制方法:BY-FCR (Benjamini & Yekutieli 2005)、SCOP (Bao et al. 2024)、JOMI (Jin & Ren 2025)。这些方法关注后选择调整,但未显式处理信息性约束。
- 共形选择与共形 p 值:cfBH (Jin & Candès 2023, 2025)、加权共形 p 值 (Jin & Candès 2025)。这些方法利用共形 p 值进行选择,但通常限于单边或特定非一致性分数。
- 信息性预测集:InfoSP / InfoSCOP (Gazin et al. 2025)。直接处理信息性约束,但保守。
- 选择性分类:FASI (Rava et al. 2026)、Zhao & Su (2023)。针对分类任务,但未覆盖一般信息性约束。
核心问题与瓶颈¶
- 核心问题:如何设计一个选择性报告过程,使得每个报告的预测集都满足用户指定的信息性约束(如区间长度、类别数),同时控制 FCR 在 α 以下,且尽可能多地报告(高功率)?
- 已知瓶颈:现有方法要么牺牲信息性(JOMI 调整后区间变宽),要么保守(InfoSP 的 FCR 远低于 α,报告集少),要么缺乏理论保证(InfoSCOP 的筛选步骤无功率提升保证)。
⚠️ 作者的 framing¶
作者将缺口 frame 为:InfoSP 虽然同时满足信息性与 FCR 控制,但本质保守,导致功率低。本文通过引入信任分数和广义共形 p 值,将问题重新表述为“对每个候选信息集计算一个广义 p 值,再用 BH 过程选择”,从而直接利用 FCR 预算,实现反保守性。作者淡化或回避的竞争路线: - JOMI:作者指出其调整后可能违反信息性(图 1b 中 5 个集不再信息),但未讨论 JOMI 在信息性约束可放宽场景下的适用性。 - InfoSCOP:作者承认其可能提高功率,但强调“无理论保证”(Section 7 原文:“no theoretical guarantee exists that InfoSCOP always dominates InfoSP”),并指出其性能依赖筛选规则。 - 什么明显该被引/该存在、却没出现在 intro 里? 本文未引用任何关于计算效率或大规模实现的工作(如分布式共形推断、近似算法)。对于研究者关注的统计-计算权衡,本文完全未涉及。此外,未讨论非交换性(协变量偏移)下的扩展(虽然 Jin & Candès 2025 有相关工作,但本文未引用)。
张力¶
未见明显对立引用。各工作基本是互补或递进关系:BY-FCR 保守 → SCOP/JOMI 改进但牺牲信息性 → InfoSP 同时满足但保守 → SCIP 克服保守。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \( (X, Y) \in \mathbb{R}^d \times \mathcal{Y} \):特征向量与响应变量,服从未知分布 \( P_{XY} \)。 - \( \mathcal{Y} = \mathbb{R} \)(回归)或 \( \mathcal{Y} = [K] \)(分类,\( K \geq 2 \))。 - 训练集 \( D_{\text{tr}} \):用于训练预测模型(如 \( \hat{\mu} \) 或 \( \hat{\text{pr}} \))。 - 校准集 \( \{(X_i, Y_i)\}_{i=1}^n \):用于构造共形 p 值。 - 测试集 \( \{X_{n+j}\}_{j=1}^m \):特征已知,标签未知,需预测。 - 混合数据 \( D_{\text{mix}} = \{(X_i, Y_i)\}_{i=1}^{n+m} \):校准集 + 测试集(测试集标签未知,但用于理论分析时视为随机变量)。 - 信息集构造器 \( C^I : \mathcal{X} \to \mathcal{I} \):将每个特征映射到一个可报告的预测集,\( \mathcal{I} \) 是用户指定的可接受集族。 - 信任分数 \( T : \mathcal{X} \times \mathcal{I} \to \mathbb{R}^+ \):量化信息集的可靠性,越高越可信。 - 广义共形 p 值 \( p_j^{\text{GC}} \):用于选择信息集。 - 选择集 \( \mathcal{S} \subseteq [m] \):被报告的信息集索引。 - FCR:\( \text{FCR} = \mathbb{E}\left[ \frac{\sum_{j \in \mathcal{S}} I(Y_{n+j} \notin C_{n+j})}{\max(1, |\mathcal{S}|)} \right] \)。
模型: - 数据生成机制:未知分布 \( P_{XY} \),无参数假设。 - 关键假设:交换性(Assumption 1):\( D_{\text{mix}} \) 中的 \( n+m \) 个点条件于训练数据 \( D_{\text{tr}} \) 可交换。这是共形推断的标准条件。 - 信息集构造器和信任分数需满足排列不变性(Definition 1):对 \( D_{\text{mix}} \) 中点的排列不改变函数值(条件于辅助数据 \( D \))。
可观测数据: - 可观测:训练集 \( D_{\text{tr}} \)(有标签)、校准集 \( \{(X_i, Y_i)\}_{i=1}^n \)(有标签)、测试特征 \( \{X_{n+j}\}_{j=1}^m \)(无标签)。 - 不可观测:测试标签 \( Y_{n+j} \),以及潜在的反事实量(无)。 - 想要但观测不到:每个测试点的真实标签,以及“若选择不同集”的覆盖情况。
第二步:最小内核——单边回归选择特例¶
考虑最简单的设定:回归,单边备择(Example 2-a)。目标:识别响应大于阈值 \( c_0 \) 的测试单元。信息性约束:\( \mathcal{I} = \{(c_0, \infty)\} \),即每个报告集必须是区间 \( (c_0, \infty) \)。信任分数取预测均值 \( T(x, C^I) = \hat{\mu}(x) \),其中 \( \hat{\mu} \) 由独立训练集训练得到。
在这个特例下,SCIP 退化为 cfBH 过程(Jin & Candès 2023)。广义共形 p 值(式 9)简化为:
核心思路:这个 p 值衡量的是:在校准集中,有多少“空单元”(\( Y_i \leq c_0 \))的预测均值大于测试单元的预测均值。如果测试单元的 \( \hat{\mu} \) 很大,那么很少有空单元比它大,p 值就小,从而被优先选择。这直接对应“测试单元更可能属于备择(\( Y > c_0 \))”。
证明的最小内核:要证 FCR ≤ α,关键步骤是: 1. 在 \( H_{0,j}: Y_{n+j} \leq c_0 \) 下,\( p_j^{\text{GC}} \) 等于一个基于分数 \( \tilde{T}(x,y) = I(y \leq c_0) \cdot \hat{\mu}(x) \) 的共形 p 值(Proposition 1 的证明思路)。由于 \( \tilde{T} \) 是排列不变的,该共形 p 值服从均匀分布(Lemma S.2)。 2. 利用 PRDS 性质(Proposition 2):将 \( p_j^{\text{GC}} \) 替换为 oracle 共形 p 值 \( p_j^{\text{OC}} \) 后,序列是 PRDS 的。这允许使用标准的 BH 证明技巧(如 Wang 2022)得到 FCR ≤ α。
为什么这个特例是内核:论文的一般设定(任意信息性约束、任意信任分数)的证明完全依赖于上述两个性质:广义 p 值在零假设下具有“广义超均匀性”(式 11),以及 PRDS 性质。所有技术细节(如信任分数的构造、信息集构造器的排列不变性)都是为了确保这两个性质成立。因此,理解单边回归特例就抓住了整篇论文的数学本质。
三、这篇论文做了什么¶
三句话¶
- 研究问题:在大规模预测中,如何选择性报告满足用户指定信息性约束的预测集,同时控制假覆盖率(FCR)在预设水平,并尽可能提高功率(报告更多集)。
- 核心工具/方法:提出 SCIP 框架,包含三个组件:信息集构造器(将特征映射到可报告集)、信任分数(量化集的可信度)、广义共形 p 值(用于 BH 选择)。通过构造信任分数和广义 p 值,将问题转化为多重假设检验。
- 主要结论:SCIP 保证有限样本 FCR ≤ α(Theorem 3),且渐近反保守(FCR ≥ α - O(me^{-n}),Theorem 4),功率高于现有方法 InfoSP。在回归、分类、药物发现数据上验证。
关键设定与假设¶
- Assumption 1(交换性):\( D_{\text{mix}} \) 中的点条件于 \( D_{\text{tr}} \) 可交换。这是共形推断的标准,比 i.i.d. 弱。
- Assumption 2(用于反保守性):(a) 指示变量 \( I(Y_i \notin C^I(X_i)) \) 为 i.i.d. Bernoulli(\( \pi_0^* \));(b) \( \alpha < n\pi_0^*/(n+1) \)。(a) 比交换性强,但常见于共形文献;(b) 当 n 大时易满足。
- Assumption 3(信息性约束的正则性):(i) 单调性:若 \( C' \subseteq C \) 且 \( C \in \mathcal{I} \),则 \( C' \in \mathcal{I} \);(ii) 右连续且非增。确保 I-调整 p 值良定义。
- Assumption 4(用于功率分析):数据独立于训练集,且 i.i.d.。
- Assumption 5(用于功率分析):对 \( \tilde{\nu}(x) = \min\{\nu \geq 0: \{y: V(x,y) \leq \nu\} \in \mathcal{I}\} \) 的分布条件,确保 BH 阈值渐近行为。
- 相比已有文献:交换性假设与 Jin & Candès (2023) 相同;信息性约束的单调性假设与 Gazin et al. (2025) 相同。本文额外要求信任分数和信息集构造器的排列不变性,这是为了确保广义 p 值的均匀性。
主要结果¶
- Theorem 3(有限样本 FCR 控制):在 Assumption 1 和排列不变性下,SCIP 的 FCR ≤ α。证明基于广义 p 值的超均匀性和 PRDS 性质。
- Theorem 4(渐近反保守性):在 Assumption 1-2 下,FCR ≥ α - mα e^{-2n(n\pi_0^*/(n+1) - \alpha)^2} = α - O(me^{-n})。这意味着当 n 大时,FCR 接近 α,克服了 InfoSP 的保守性。证明利用 oracle 共形 p 值在备择下的概率上界(Lemma S.4)和 leave-one-out 技巧。
- Proposition 7(InfoSP+ 优于 InfoSP):在 Assumptions 3-5 下,InfoSP+ 的报告集渐近包含 InfoSP 的报告集(概率趋于 1)。证明通过分析 BH 阈值 \( \hat{\tau}_0^{\text{bh}} \) 的渐近行为(Lemma S.6)和 FDP 估计。
- Theorem 9(最优信任分数):在 mFCR 准则下,oracle 信任分数 \( T^{\text{ora}}(x, C^I) = \text{pr}(Y \in C^I(X) \mid X=x) \) 对应的阈值规则在计数功率上优于任何其他信任分数。证明基于 Neyman-Pearson 引理型论证。
证明路线与技术技巧(理论型)¶
Theorem 3 的证明路线: 1. 将 FCR 分解为 \( \sum_{j=1}^m \mathbb{E}[ I(p_j^{\text{GC}} \leq \alpha \hat{k}/m, H_{0,j}) / \hat{k} ] \),其中 \( \hat{k} = |\mathcal{S}| \)。 2. 对每个 j,利用 \( H_{0,j} \) 下 \( p_j^{\text{GC}} = p_j^{\text{OC}} \)(oracle 共形 p 值),将事件改写为 \( \kappa(p_{j\to \text{OC}}^{\text{GC}}) = \hat{k} \) 且 \( p_j^{\text{OC}} \leq \alpha \hat{k}/m \)。 3. 由 Proposition 2,\( p_{j\to \text{OC}}^{\text{GC}} \) 是 PRDS 在 {j} 上。利用标准 BH 证明(如 Wang 2022 的引理),有 \( \sum_{k=1}^m \text{pr}(\kappa(p_{j\to \text{OC}}^{\text{GC}}) = k \mid p_j^{\text{OC}} \leq \alpha k/m) \leq 1 \)。 4. 结合 \( p_j^{\text{OC}} \sim \text{Unif}(0,1) \)(Lemma S.2),得到每项 ≤ α/m,求和得 FCR ≤ α。
关键跳跃点:PRDS 性质的建立(Proposition 2)。证明需要构造 oracle 共形 p 值,并利用交换性下分数序列的对称性,通过 Proposition S.2(共形 p 值的条件均匀性和单调性)推导。
技术技巧: - 广义共形 p 值(式 9):将信任分数作为非一致性分数,但只考虑“空单元”(\( Y_i \notin C^I_i \))的分数。这不同于标准共形 p 值(考虑所有单元),但通过排列不变性仍保持均匀性。 - 自洽 BH 过程(式 10):等价于标准 BH,但便于理论分析(Blanchard & Roquain 2009)。 - Leave-one-out 技巧:在 Theorem 4 的证明中,将 \( p_j^{\text{GC}} \) 替换为 oracle 版本后,利用条件独立性将期望分解。 - Hoeffding 不等式:用于 Lemma S.4 中控制备择下 oracle p 值的概率。 - 均匀收敛:用于 Lemma S.6 中证明 BH 阈值的渐近行为。
真实例子与应用¶
- CIFAR-10 三分类示例(Section 1.2, Appendix E.1):目标:从三类(Vehicle, Aircraft, Bird)中识别图像,要求每个报告集大小 ≤ 2,FCR ≤ 0.1。比较标准共形、JOMI、InfoSP、InfoSP+(SCIP 实例)。结果:InfoSP+ 报告 21 个信息集(FCP=0.095),而 InfoSP 仅 12 个(FCP=0.083),标准共形排除非信息集后 FCP=0.143。说明 SCIP 在保持 FCR 控制的同时提高了功率。
- 药物发现(DTI)(Section 7.3):数据来自 Davis et al. (2011),10,000 个药物-靶点对,目标:为预测高结合亲和力(>中位数 6.13)的单元构建预测区间,FCR ≤ 0.2。比较 Naive、InfoSCOP(三个筛选水平)、InfoSP+。结果:Naive FCR=0.350,InfoSCOP 的 FCR 在 0.007-0.053 但功率极低(cPOW 5-31),InfoSP+ 的 FCR=0.206,cPOW=215,rPOW=69.9。说明 SCIP 在实际中有效且功率远高于现有方法。
- 模拟实验(Section 7.1-7.2):回归(信息性约束:区间只含正值)和分类(大小 ≤ 2)。比较 Naive、InfoSP、InfoSCOP、InfoSP+、InfoSP++。结果一致:SCIP 方法 FCR 接近 α,功率最高。
🔎 结论是否比证明窄¶
- Theorem 4 的证明依赖于 Assumption 2(i.i.d. 和 \( \alpha < n\pi_0^*/(n+1) \)),但作者在 Remark 3 中承认 i.i.d. 比交换性强。因此,反保守性结论在仅交换性下未严格证明,可能不成立。
- Proposition 7(InfoSP+ 优于 InfoSP)的证明依赖于 Assumption 5 和均匀收敛,且结论是“渐近包含概率趋于 1”,并非有限样本保证。作者在 Section 5.3 末尾明确说“lim pr(\( R_{\text{ISP}}^{\text{mod}} \subseteq R_{\text{ISP}^+}^{\text{mod}} \)) = 1”,但未给出有限样本界。
- Theorem 9(最优信任分数)基于 mFCR 准则(边际 FCR),而非原始 FCR。作者在 Remark 5 中承认,基于分辨率调整功率的最优性仍是开放问题。因此,该定理的实用价值受限于准则的选择。
四、开放问题(点到为止,扎根具体语句)¶
-
InfoSCOP 的理论保证:作者在 Section 7.1 指出“no theoretical guarantee exists that InfoSCOP always dominates InfoSP”(原文)。能否为 InfoSCOP 的筛选步骤设计一个原则性规则,并证明其功率提升?这扎根于论文的 limitation 讨论(Section 7.1 末句)。
-
分辨率调整功率(rPOW)的最优性:Theorem 9 仅针对计数功率(cPOW)。作者在 Remark 5 中明确说“A theoretical characterization of optimality based on resolution-adjusted power remains an open problem”。能否在 rPOW 准则下刻画最优信任分数?这扎根于 Section 6 的 Remark 5。
-
非交换性(协变量偏移)下的扩展:本文所有理论依赖交换性假设。Jin & Candès (2025) 已处理协变量偏移下的共形选择,但未结合信息性约束。能否将 SCIP 扩展到加权共形 p 值框架?这扎根于作者未引用的相关工作(Jin & Candès 2025),且是自然延伸。
-
计算效率与大规模实现:本文未讨论计算复杂度。对于 m 很大(如百万级)的测试集,计算所有广义 p 值需要 O(nm) 时间(若信任分数已预计算)。能否利用近似算法或分治策略加速?这扎根于论文未涉及的计算方面,且与研究者对统计-计算权衡的兴趣相关(但需注意本文不直接涉及计算复杂度理论)。
Maintained by 陈星宇 · Homepage · Source on GitHub