Multivariate Conformal Selection¶
讲者: Yi Yang
会场: Institute of Statistics and Big Data
报告题目: Multivariate Conformal Selection
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:如何从大量候选对象中,筛选出满足特定多变量标准的子集,同时严格控制在筛选过程中犯“假阳性”错误(即错误地将不合格对象选入)的比例。它结合了统计推断(通过 conformal inference 提供有限样本的误差控制保证)与多重假设检验(通过 False Discovery Rate (FDR) 控制来管理多重比较问题)。当前成熟度处于方法快速发展期,从单变量设定向多变量、复杂标准设定扩展是主要趋势。
发展脉络(history)¶
-
奠基工作:Conformal Prediction (CP) 与 FDR 控制
- Vovk et al. (2005):提出了 conformal prediction 框架,为单个预测提供有限样本的覆盖保证。这是所有后续工作的基石。
- Benjamini & Hochberg (1995):提出了 Benjamini-Hochberg (BH) 过程,为多重假设检验中的 FDR 控制提供了实用且强大的方法。这是筛选任务中控制错误率的标准工具。
-
主要进展:Conformal Selection (CS) 的提出
- Jin & Candès (2023):这是本文最直接的前身。他们提出了 Conformal Selection (CS) 框架,将 conformal p-values 与 BH 过程结合,用于单变量响应(d=1)的筛选问题(如
y > c)。该工作证明了在 exchangeability 条件下,CS 能实现有限样本的 FDR 控制。留下的口子:该方法局限于单变量响应和形如[c, +∞)的简单筛选标准,无法处理多变量、多标准并存的复杂场景。
- Jin & Candès (2023):这是本文最直接的前身。他们提出了 Conformal Selection (CS) 框架,将 conformal p-values 与 BH 过程结合,用于单变量响应(d=1)的筛选问题(如
-
当前 Frontier:多变量扩展与自适应分数
- Bates et al. (2021) 和 Feldman et al. (2023) 等:提出了多变量 conformal prediction 方法,用于构建多变量响应的预测集。本文的定位:作者指出,这些多变量 CP 方法不直接适用于筛选问题,因为其目标是构建置信集(形状可能复杂),而非与预定义的、形状固定的目标区域
R进行匹配,且 CP 控制的是 per-comparison error rate (PCER) 而非 FDR。 - 本文 (Yang, 2025):将 CS 从单变量推广到多变量响应(d ≥ 1),提出了 Multivariate Conformal Selection (mCS)。核心贡献是引入了 regional monotonicity 概念,并设计了两种满足该性质的非一致性分数(距离基和学习基),从而在更一般的多变量设定下保证了 FDR 控制。
- Bates et al. (2021) 和 Feldman et al. (2023) 等:提出了多变量 conformal prediction 方法,用于构建多变量响应的预测集。本文的定位:作者指出,这些多变量 CP 方法不直接适用于筛选问题,因为其目标是构建置信集(形状可能复杂),而非与预定义的、形状固定的目标区域
子线索聚类¶
-
Conformal Prediction 的多变量扩展:这类工作致力于为多变量响应
y构建预测集C(x)。代表工作包括 Bates et al. (2021)(风险控制预测集)、Feldman et al. (2023)(校准的多输出分位数回归)、Johnstone & Cox (2021)(用于鲁棒优化的 conformal 不确定集)等。共同点:目标是预测不确定性量化,而非筛选。与本文的关系:本文指出这些方法不能直接用于筛选任务,因为其输出(预测集)与筛选目标(预定义区域R)不直接兼容,且不控制 FDR。 -
Conformal Selection 及其变体:这类工作专注于使用 conformal inference 进行筛选,并控制 FDR。核心是 Jin & Candès (2023) 的 CS 框架。Gui et al. (2024) 的 Conformal Alignment 是 CS 在 LLM 对齐问题上的一个应用。本文的位置:本文是 CS 从单变量到多变量的直接推广,是该子线索上的一个关键进展。
-
可微排序与排序操作:这类工作来自机器学习领域,旨在为排序和排序操作提供可微的近似,以便进行端到端的梯度优化。代表工作有 Blondel et al. (2020) 和 Cuturi et al. (2019)。与本文的关系:本文的 mCS-learn 方法利用这些技术(特别是 Blondel et al. (2020))来构建一个可微的损失函数,从而能够通过反向传播学习最优的非一致性分数。
这个方向在追问的核心问题¶
- 如何定义多变量非一致性分数? 在单变量 CS 中,分数
V(x, y)的单调性(y越大,分数越大)是保证 FDR 控制的关键。在多变量设定下,如何定义类似的单调性?本文的答案是 regional monotonicity。 - 如何保证有限样本的 FDR 控制? 核心挑战在于,当用预测值
r替代未知的真实响应y来计算 p-value 时,如何确保 p-value 的保守性(即P(p_j ≤ α and j ∈ H_0) ≤ α)。本文通过 regional monotonicity 解决了这个问题。 - 如何最大化筛选能力(Power)? 在保证 FDR 控制的前提下,如何设计非一致性分数以最大化正确筛选出的对象数量?本文提出了两种策略:一种是基于距离的解析分数(mCS-dist),另一种是通过可微优化学习的分数(mCS-learn)。
- 如何处理复杂(非凸、不规则)的目标区域
R? 当R不是简单的矩形或球体时,基于距离的分数可能效果不佳。本文的 mCS-learn 方法旨在通过数据驱动的方式学习一个适用于任意形状R的分数。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么? 作者将缺口明确地定位为:“现有 conformal selection 方法局限于单变量响应和形如
y > c的筛选标准”(见 Introduction 第 3 段)。这使得本文的 mCS 成为“显然的下一步”——一个从单变量到多变量的直接、自然的推广。 - 哪些竞争路线被他淡化或回避了? 作者明确淡化了多变量 CP 方法(如 Bates et al. (2021))的适用性,指出它们的目标(构建预测集)与筛选任务不匹配,且控制的是 PCER 而非 FDR。作者也回避了将多变量问题转化为单变量问题(如通过定义
1{y ∈ R}的二元指示变量)的基线方法bi的深入讨论,仅在实验中将其作为基线,并指出其性能受限于二元分类模型的精度(在真实数据中 F1 分数仅为 0.31)。 - 什么明显该被引 / 该存在、却没出现在 intro 里? 未见明显缺失的关键引用。作者引用了 CS 的核心工作(Jin & Candès, 2023)、多变量 CP 的代表性工作、以及用于可微优化的技术工作,覆盖了主要相关领域。
张力¶
未见明显对立引用。被引工作之间在方法论上互补,而非矛盾。例如,多变量 CP 方法为预测集构建提供了思路,而 CS 为筛选和 FDR 控制提供了框架,本文则试图将两者在筛选任务上统一起来。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
x ∈ ℝᵖ:p 维特征向量。y ∈ ℝᵈ:d 维多变量响应变量。这是本文的核心,区别于单变量 CS。R ⊆ ℝᵈ:预定义的、封闭的目标区域。筛选目标是找出y ∈ R的样本。Rᶜ:R的补集,即y ∉ R的区域。H₀ⱼ:第j个测试样本的零假设,即y_{n+j} ∈ Rᶜ(不合格)。H₁ⱼ:第j个测试样本的备择假设,即y_{n+j} ∈ R(合格)。V(x, y):多变量非一致性分数(nonconformity score),是一个标量函数。分数越高,表示(x, y)这个组合越“不典型”。pⱼ:第j个测试样本的 conformal p-value。值越小,越有证据拒绝H₀ⱼ(即认为该样本合格)。q:用户指定的名义 FDR 水平。S:最终被选中的样本索引集合。n:校准数据集(calibration set)的大小。m:测试数据集(test set)的大小。ˆµ(x):一个预训练的、用于预测y的机器学习模型。
-
模型:
- 数据生成机制:假设训练数据
{(xᵢ, yᵢ)}ⁿᵢ₌₁和测试数据{(x_{n+j}, y_{n+j})}ᵐⱼ₌₁是从一个未知的、任意的联合分布D_{X×Y}中独立同分布 (i.i.d.) 或可交换 (exchangeable) 地抽取的。这是一个标准的 conformal inference 假设。 - 已知量:
x和y的维度p和d,目标区域R,名义 FDR 水平q。 - 待估对象:对于每个测试样本
j,我们想要判断y_{n+j} ∈ R是否成立,并据此决定是否将其选入S。
- 数据生成机制:假设训练数据
-
可观测数据:
- 可观测:训练数据
{(xᵢ, yᵢ)}ⁿᵢ₌₁(用于校准)和测试数据的特征{x_{n+j}}ᵐⱼ₌₁。 - 不可观测(潜在):测试数据的真实响应
{y_{n+j}}ᵐⱼ₌₁。这是筛选问题中不确定性的来源,也是我们需要进行统计推断的原因。 - 关键区分:我们想要知道
y_{n+j}是否在R内,但观测不到它。我们只能依赖x_{n+j}和从训练数据中学到的模型ˆµ来做出推断。
- 可观测:训练数据
第二步:讲最小内核¶
本文的核心思路可以浓缩为以下最简特例:
最简特例:假设响应维度 d=2,目标区域 R 是一个矩形 R = {y: y₁ ≥ c₁, y₂ ≥ c₂}(即第一象限的平移)。我们有一个预训练的模型 ˆµ(x),它能给出 y 的预测值。
核心问题:对于一个新的测试样本 (x_{n+1}, y_{n+1}),我们观测不到 y_{n+1},但想判断它是否在 R 内,并控制 FDR。
核心思路(以距离基分数 mCS-dist 为例):
-
定义一个“聪明”的非一致性分数
V(x, y):- 我们想要一个分数,当
y在R内时,它很大;当y在R外时,它很小。这样,一个大的分数就“不典型”地暗示了y ∈ R。 - 一个简单的选择是:
V(x, y) = M * 1{y ∉ R} - dist(ˆµ(x), Rᶜ)。- 第一项
M * 1{y ∉ R}:如果y在R外,这项是M(一个很大的常数);如果y在R内,这项是0。这保证了区域单调性:对于任何x,如果y' ∈ Rᶜ且y ∈ R,那么V(x, y') ≤ V(x, y)(因为M很大,但y'在R外时第一项是M,而y在R内时第一项是0,所以V(x, y')可能大于V(x, y)?等等,这里需要仔细。实际上,M是加在y ∉ R上的,所以当y ∈ R时,V(x, y) = -dist(ˆµ(x), Rᶜ);当y ∉ R时,V(x, y) = M - dist(ˆµ(x), Rᶜ)。由于M很大,V(x, y)在y ∈ R时很小,在y ∉ R时很大。这与“分数越大越不典型”的直觉一致。区域单调性要求:对于y' ∈ Rᶜ和y ∈ R,有V(x, y') ≥ V(x, y)。这显然成立,因为V(x, y') ≈ M而V(x, y) ≈ -dist。 - 第二项
-dist(ˆµ(x), Rᶜ):dist(ˆµ(x), Rᶜ)是预测值ˆµ(x)到R外部区域Rᶜ的距离。如果ˆµ(x)离Rᶜ很远(即预测值在R内部很深),那么dist很大,-dist很小,从而V(x, y)很小,p-value 也小,更容易被选中。这符合直觉:模型预测越有把握样本合格,我们就越应该选它。
- 第一项
- 我们想要一个分数,当
-
计算 conformal p-value
pⱼ:- 对于测试样本
j,我们无法计算V(x_{n+j}, y_{n+j}),因为y_{n+j}未知。 - 我们选择一个在
R边界上的点r(例如r = (c₁, c₂)),然后计算ˆV_{n+j} = V(x_{n+j}, r)。由于r ∈ R,根据区域单调性,V(x_{n+j}, y_{n+j}) ≥ ˆV_{n+j}当y_{n+j} ∈ Rᶜ时成立。 - 然后,我们将
ˆV_{n+j}与校准数据上的分数{V(xᵢ, yᵢ)}ⁿᵢ₌₁进行比较。p-valuepⱼ大致等于“校准分数中大于ˆV_{n+j}的比例”。如果ˆV_{n+j}很小(意味着模型预测很自信地认为样本合格),那么它比大多数校准分数都小,p-value 就会很小。
- 对于测试样本
-
应用 BH 过程进行筛选:
- 对所有
m个测试样本,我们得到m个 p-value{p₁, ..., pₘ}。 - 应用 Benjamini-Hochberg 过程,在名义 FDR 水平
q下,找到一个阈值k*,然后选出所有pⱼ ≤ q * k* / m的样本。 - 为什么 FDR 能被控制? 关键在于区域单调性保证了:当零假设
H₀ⱼ为真(即y_{n+j} ∈ Rᶜ)时,我们计算出的pⱼ是保守的,即它比“如果知道真实y_{n+j}时算出的 p-value”要大。一个更大的 p-value 更不容易被 BH 过程拒绝,从而减少了假阳性。定理 3.5 严格证明了这一点。
- 对所有
总结:这个最小内核展示了 mCS 如何通过一个满足区域单调性的分数,将未知的 y 替换为边界点 r 来计算保守的 p-value,并最终通过 BH 过程在控制 FDR 的同时进行筛选。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:将 Conformal Selection (CS) 框架从单变量响应(
d=1)推广到多变量响应(d ≥ 1),以解决需要同时满足多个标准的筛选问题(如药物发现、LLM 对齐)。 - 核心工具 / 方法:提出了 regional monotonicity 这一关键性质,并基于此设计了两种多变量非一致性分数:mCS-dist(基于距离的解析分数)和 mCS-learn(通过可微优化学习的分数),用于构建 conformal p-values 并应用 BH 过程。
- 主要结论:在 exchangeability 条件下,mCS 能保证有限样本的 FDR 控制。在模拟和真实数据实验中,mCS(特别是 mCS-dist 和 mCS-learn)在维持 FDR 控制的同时,显著优于多种基线方法,展现出更强的筛选能力(Power)。
关键设定与假设¶
- 设定:问题设定已在第二节“最小内核”中详细交代。核心是:给定训练/校准数据
D_cal和测试数据D_test(其响应y未知),目标是从D_test中选出子集S,使得S中尽可能多的样本满足y ∈ R,同时控制 FDR ≤q。 - 假设:
- Exchangeability:校准数据和测试数据是可交换的。这是所有 conformal inference 方法的标准假设。论文在定理 3.5 中进一步弱化为条件 exchangeability。
- Regional Monotonicity (定义 3.1):这是本文的核心假设,也是保证 FDR 控制的关键。它要求非一致性分数
V(x, y)满足:对于任意x,如果y' ∈ Rᶜ且y ∈ R,则V(x, y') ≤ V(x, y)。统计含义:这个性质确保了当真实响应y在目标区域R内时,其非一致性分数不小于用边界点r ∈ R替代y后计算出的分数。这是证明 p-value 保守性的基础。 - 相比已有文献的放宽/强化:相比 Jin & Candès (2023) 中针对单变量
y > c的单调性(要求V(x, y)在y上单调递增),本文的 regional monotonicity 是一个更一般的概念,它只要求在区域R和Rᶜ之间保持序关系,而不要求在整个ℝᵈ上单调。这是处理任意形状R的关键。
主要结果¶
- 定理 3.5 (有限样本 FDR 控制):这是本文的核心理论结果。它证明,只要非一致性分数
V满足 regional monotonicity,并且校准分数和测试分数在给定其他测试分数时是可交换的,那么 Algorithm 1 (mCS) 的输出S就能保证FDR ≤ q。直觉:证明通过构造一个“伪”p-value 集合,并利用 BH 过程的单调性,将 FDR 控制问题归结为单个 conformal p-value 的保守性,而 regional monotonicity 保证了这种保守性。 - 定理 4.1 (渐近分析):该定理给出了 mCS 在大样本下的 FDR 和 Power 的渐近表达式。核心结论:它揭示了选择不同非一致性分数对渐近 Power 的影响,并提供了一个理论依据来偏好“clipped score”(公式 8)。该定理表明,一个有效的分数应该使得
V(x, y)(当y ∈ R时)相对于V(x, r)(r ∈ ∂R)尽可能大,从而降低 BH 阈值t*的分母,允许更低的 p-value 被拒绝。解决的技术难点:为多变量设定下的分数选择提供了理论指导,这是单变量 CS 工作(Jin & Candès, 2023)中没有深入探讨的。 - 命题 4.2 (mCS-learn 的表达能力):该命题证明,在给定的数据分布和 FDR 水平下,存在一个形如公式 (11) 的分数(即
M * 1{y ∉ R} - f_θ(x, y; R)),能够最大化被选中的样本数量(即 Power)。意义:这为 mCS-learn 通过优化来学习最优分数提供了理论上的“存在性”保证,说明其分数族足够灵活。
证明路线与技术技巧(理论型)¶
-
整体路线(定理 3.5 证明):
- 定义与简化:定义确定性的 conformal p-values(假设无 ties),并引入“伪”p-value
pⱼ^ⱼ,其中将第j个测试样本的分数替换为真实的V(x_{n+j}, y_{n+j})。 - 关键引理:证明在
j被错误拒绝(即j ∈ S且y_{n+j} ∈ Rᶜ)的条件下,用pⱼ^ⱼ替换pⱼ不会改变 BH 过程的拒绝集S。这个引理依赖于 regional monotonicity 和 BH 过程的单调性。 - FDR 分解:将 FDR 分解为对每个
j的期望求和。利用上一步的引理,将事件{j ∈ S}替换为{j ∈ S*_j},其中S*_j是基于“伪”p-value 集合的拒绝集。 - 条件独立性:证明在给定某些条件(如校准分数集合和除
j外的测试分数)下,p*_j(基于真实y的 oracle p-value)与S*_j是条件独立的。 - 利用 p-value 的保守性:利用 conformal p-value 的已知性质(
P(p*_j ≤ α) ≤ α),结合条件独立性,得到E[1{p*_j ≤ q|S*_j|/m} / max(1, |S*_j|)] ≤ q/m。 - 求和:对所有
j求和,得到FDR ≤ q。
- 定义与简化:定义确定性的 conformal p-values(假设无 ties),并引入“伪”p-value
-
关键跳跃点:最吃功夫的步骤是第 2 步,即证明在错误拒绝事件下,替换 p-value 后拒绝集不变。这需要巧妙地处理 BH 过程的“step-up”性质,并利用 regional monotonicity 来比较不同 p-value 的大小关系。证明中细致地分情况讨论了
ˆV_{n+l}与ˆV_{n+j}的大小关系,以论证替换后所有 p-value 都不会变大,从而拒绝集不会缩小。 -
技术技巧点名:
- BH 过程的单调性:证明的核心工具,用于论证 p-value 替换后拒绝集的变化。
- 条件交换性:用于建立条件独立性,从而将复杂的联合分布问题分解为更简单的条件问题。
- Conformal p-value 的保守性:这是整个框架的基石,其证明依赖于 exchangeability 和排序的均匀性。
- 光滑排序 (Soft-sorting):在 mCS-learn 中,使用 Blondel et al. (2020) 的可微排序操作来近似非连续的排序和 BH 过程,使得损失函数可微,从而能够进行梯度下降优化。
真实例子与应用¶
- 数据:一个从多个公开来源整合的 ADMET 数据集,包含
n=22805个化合物和d=15个生物测定响应。缺失值通过 Chemprop 模型(Yang et al., 2019; Heid et al., 2023)进行插补。 - 场景:药物发现中的候选化合物筛选。目标是选出在多个生物属性(如清除率、CYP 抑制、渗透性等)上同时满足特定阈值的化合物。
- 方法应用:
- 使用 DeepPurpose 库(Huang et al., 2020)训练一个预测模型
ˆµ。 - 定义了三个筛选任务:Task 1(第一卦限,所有属性需高于阈值)、Task 2(球体,属性需接近一个理想点)、Task 3(球体补集,属性需远离一个危险点)。
- 将 mCS-dist 和 mCS-learn 与多个基线方法(CS_int, CS_ib, CS_is, bi)进行比较。
- 使用 DeepPurpose 库(Huang et al., 2020)训练一个预测模型
- 结果:
- FDR 控制:mCS-dist 和 mCS-learn 在所有任务和名义水平下均成功控制了 FDR(接近名义水平),而基线方法
CS_int严重违反 FDR 控制,CS_is和bi在某些情况下控制不佳或过于保守。 - Power:在保证 FDR 控制的方法中,mCS-dist 和 mCS-learn 通常取得最高或次高的 Power。特别是在非凸目标区域(Task 3)中,mCS-learn 表现优于 mCS-dist。
- 例子想说明什么:这个真实数据例子验证了 mCS 在实际、高维、复杂的筛选问题中的有效性。它展示了 mCS 能够处理真实数据中的噪声、缺失值和模型不完美性,并相比简单的基线方法(如将多变量问题二值化的
bi)具有显著优势。bi方法在此例中几乎无法选出任何化合物,凸显了直接处理多变量响应的重要性。
- FDR 控制:mCS-dist 和 mCS-learn 在所有任务和名义水平下均成功控制了 FDR(接近名义水平),而基线方法
🔎 结论是否比证明窄¶
- 定理 3.5 的证明依赖于条件 exchangeability 假设(
V1, ..., Vn, V_{n+j}在给定{ˆV_{n+ℓ}}ℓ≠j下可交换)。这是一个比简单 i.i.d. 或 exchangeability 更强的条件。作者在正文中将其作为定理的条件陈述,但在引言和算法描述中,通常只提“i.i.d.”或“exchangeability”。需要确认:这个更强的条件是否在实际应用中总能满足?例如,当ˆV_{n+ℓ}的计算依赖于所有测试数据时,条件独立性可能不成立。作者在附录 A.2 的证明中明确使用了这个条件,但正文的讨论相对较少。 - 命题 4.2 证明了存在一个最优分数,但并未给出如何高效地找到这个分数。mCS-learn 通过可微优化提供了一个实用的近似方法,但优化过程可能陷入局部最优,且其性能高度依赖于损失函数的设计(
L1vsL2)和超参数(如γ)。论文的实验(附录 C.2.5)显示L2损失远优于L1,说明损失函数的选择至关重要,而理论并未对此提供指导。 - 定理 4.1 的渐近分析假设了
r_{n+j} ≡ r是固定的。在实际应用中,选择不同的r(特别是边界上的点)会影响 Power。论文建议选择边界点,但未提供理论上的最优选择策略。
四、开放问题¶
- 更弱的 exchangeability 条件:定理 3.5 的证明依赖于一个较强的条件 exchangeability 假设。能否在更弱的、更易于验证的假设下(如仅需边际 exchangeability)证明 FDR 控制?这扎根于定理 3.5 的证明条件。
- 结构化 / 层次化响应的处理:论文在结论中提到“可以进一步扩展以处理层次化或结构化响应”。例如,当
y的某些维度之间存在已知的依赖关系(如一个属性是另一个属性的前提)时,如何设计更有效的非一致性分数?这扎根于论文结论部分的 future work 陈述。 - mCS-learn 的理论保证:mCS-learn 通过可微优化学习分数,但其理论性质(如收敛性、学习到的分数是否渐近最优)尚不明确。能否为这种数据驱动的分数学习方法提供理论上的 FDR 控制和 Power 保证?这扎根于命题 4.2 的存在性证明与 mCS-learn 实际算法之间的差距。
- 更紧的 FDR 控制:定理 3.5 保证
FDR ≤ q,但实验中的实际 FDR 往往低于名义水平,说明控制是保守的。能否设计方法(如通过更精确的 p-value 估计或自适应阈值选择)来收紧 FDR 控制,使其更接近名义水平,从而释放更多 Power?这扎根于定理 4.1 的渐近分析和对 clipped score 的讨论,其中提到“最大化 realized FDR”可以提升 Power。
Maintained by 陈星宇 · Homepage · Source on GitHub