跳转至

Active Hypothesis Testing under Computational Budgets with Applications to GWAS and LLM

讲者: Yin Xia
会场: Large-Scale Inference and Selective Inference
报告题目: Active Hypothesis Testing under Computational Budgets
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在大规模假设检验中,计算精确的 p 值或 e 值往往成本高昂(实验昂贵、计算密集),而研究者通常拥有廉价但可能不可靠的辅助信息(如预测模型输出、噪声测量、公共数据)。如何在严格满足全局计算预算的前提下,利用这些辅助信息来指导资源分配,使得每个假设都能得到一个统计上有效的检验统计量,同时最大化统计功效?当前该方向正处于从“启发式方法”向“有理论保证的框架”过渡的阶段。

发展脉络(history)

  1. 奠基工作:加权多重检验与两阶段筛选

    • Genovese et al. (2006) 等提出了加权 p 值方法,利用先验信息给不同假设分配权重,以提升功效。但这类方法假设每个假设的精确 p 值已经可用,不涉及计算成本问题。
    • Aoshima & Yata (2011) 等提出了两阶段程序:先用廉价筛选过滤掉无望的假设,再对幸存者进行精确检验。但这类方法采用硬性筛选,被筛掉的假设不再有正式的推断结论。
  2. 主要进展:主动学习与标签获取

    • Cohn et al. (1996)Settles (2009) 等开创了主动学习领域,核心是选择性查询最“有价值”的数据标签,以提升模型训练效率。
    • Zhang et al. (2021)Cook et al. (2023) 将主动学习思想引入统计推断,研究在自适应收集的数据上进行参数估计和推断。但本文作者指出,这些工作的目标是优化数据收集,而非优化检验统计量本身的计算
  3. 当前 Frontier:预测驱动推断与代理计算

    • Angelopoulos et al. (2023) 提出了预测驱动推断(PPI),利用预训练模型的预测来构建更紧的置信区间,但需要所有假设的预测值。
    • Zrnic & Candès (2024) 提出了主动统计推断,在标签获取上做文章,但同样聚焦于参数估计。
    • Xu et al. (2025b) 提出了代理计算框架,这是与本文最直接相关的工作。它通过独立的伯努利试验来决定是否计算精确统计量,从而降低期望计算成本。但本文指出其两个关键局限:① 总计算成本是随机的,无法严格满足固定预算;② 缺乏最优性理论
  4. 本文的位置

    • 本文在 Xu et al. (2025b) 的基础上,将其视为一个特例,并做了两个核心推广:① 将独立随机查询替换为全局预算约束下的依赖采样,使得总计算次数严格等于预设预算;② 建立了最优性和可容许性理论,证明了在给定控制函数下,其构造是点态最优的,且不存在普适最优的控制参数。

子线索聚类

  1. 加权多重检验:利用辅助信息(协变量)为 p 值加权或调整拒绝阈值,以提升功效。代表工作:Ignatiadis et al. (2016), Li & Barber (2019), Lei & Fithian (2018), Cai et al. (2020)。核心假设:精确 p 值已全部可得。
  2. 两阶段/筛选程序:先用廉价方法筛选,再对子集进行精确检验。代表工作:Aoshima & Yata (2011), Zehetmayer et al. (2005)。核心特征:被筛掉的假设无正式推断。
  3. 主动学习与标签获取:在数据收集阶段选择性获取标签,以优化模型或推断。代表工作:Cohn et al. (1996), Zhang et al. (2021), Zrnic & Candès (2024)。核心目标:参数估计或模型训练,而非检验统计量本身。
  4. 代理计算与主动统计:在计算检验统计量时,利用廉价代理信息决定是否进行昂贵计算。代表工作:Xu et al. (2025b) 和本文。核心挑战:预算约束、统计有效性、最优性。

这个方向在追问的核心问题

  1. 统计有效性:如何保证在选择性查询后,每个假设的最终统计量(p 值或 e 值)仍然是有效的(即满足超均匀性或期望≤1)?
  2. 预算约束:如何设计决策机制,使得昂贵计算的总次数严格等于一个预设的全局预算,而不是一个随机变量?
  3. 最优分配:给定辅助信息,如何设计查询概率(控制函数)以最大化统计功效?是否存在普适最优的选择?
  4. 与下游程序的兼容性:生成的“主动”统计量能否直接用于现有的多重检验程序(如 BH、BY、e-BH)以控制 FDR?

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将缺口 frame 为“在严格全局预算下进行有最优性保证的主动假设检验”。他们强调,现有工作(尤其是 Xu et al. 2025b)要么预算随机,要么缺乏理论最优性,而本文同时解决了这两个问题。
  • 哪些竞争路线被他淡化或回避了:作者淡化了加权多重检验路线,指出其“假设精确 p 值可用”的根本局限。他们也回避了与纯贝叶斯方法决策理论方法的深入比较,这些方法可能从不同角度处理资源分配问题。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:本文的 intro 和参考文献中,没有出现关于在线学习/多臂赌博机中“预算分配”或“探索-利用权衡”的经典文献(如 Auer et al. 2002, Bubeck & Cesa-Bianchi 2012)。这些文献处理的是在有限回合内最大化累积奖励,与本文的“在有限预算下最大化发现数”有概念上的联系,但被完全忽略了。这是一个值得研究者去查的潜在张力点。

张力

未见明显对立引用。所有被引工作基本是互补或递进关系,没有出现对同一问题给出相反结论的情况。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • N: 假设的总数。
    • H0,i: 第 i 个零假设。
    • Xi: 第 i 个假设的昂贵、精确的检验统计量。可以是 e 值 Ei 或 p 值 Pi
    • Xa_i: 第 i 个假设的廉价辅助统计量。可以是 Ea_iPa_i
    • nb: 全局计算预算,即允许计算昂贵统计量的总次数(nb << N)。
    • Ci: 决策指示变量,Ci = 1 表示计算了 Xi,否则为 0。预算约束为 Σ Ci ≤ nb
    • hi: 第 i 个假设的控制函数hi(Xa) 是一个映射到 [0, 1] 的概率值,决定了计算 Xi 的概率。
    • β: 超参数,β ∈ [0, 1],用于在“使用代理”和“使用精确值”两个分支之间分配“总证据预算”。
    • U: 一个独立的 Uniform(0, 1) 随机变量,用于实现概率决策。
    • a(·), b(·): 待设计的非负函数,用于构造最终的主动统计量。
  • 模型

    • 对于每个假设 i,存在一个联合分布 (Xi, Xa_i)。在零假设 H0,i 下,Xi 是有效的(对于 e 值:E[Ei] ≤ 1;对于 p 值:P(Pi ≤ s) ≤ s)。辅助统计量 Xa_i 的分布没有任何假设,它可以是任意复杂、与 Xi 任意相关的。
    • 决策过程:对于每个 i,我们观测到 Xa_i,然后根据 hi(Xa)U 来决定是否计算 Xi
  • 可观测数据

    • 可观测:所有 N 个假设的辅助统计量 {Xa_i}。这是廉价且容易获得的。
    • 想要但观测不到(或成本高昂):所有 N 个假设的精确统计量 {Xi}。我们只能计算其中的 nb 个。
    • 潜在量Ci 和最终的主动统计量 X_active_i 都是基于随机决策的潜在变量。

第二步:讲最小内核

本文的核心数学问题可以归结为单个假设下的最优构造问题。去掉所有多重检验和全局预算的复杂性,其最小内核是:

问题:假设你有一个精确的 e 值 E(满足 E[E] ≤ 1)和一个辅助统计量 Ea(非负,无分布假设)。你有一个控制函数 h(Ea),它告诉你以概率 h(Ea) 去计算 E,以概率 1 - h(Ea) 不去计算。你的目标是构造一个最终的主动 e 值 E_active,使得: 1. 有效性E[E_active] ≤ 1。 2. 最优性:在满足有效性的前提下,E_active 要尽可能大(因为 e 值越大,证据越强)。

核心思路E_active 有两种可能的形式: * 如果没算 E(概率 1 - h(Ea)),则 E_active = a(Ea)。 * 如果算了 E(概率 h(Ea)),则 E_active = b(Ea) * E

有效性条件 E[E_active] ≤ 1 可以写成: E[a(Ea) * (1 - h(Ea))] + E[b(Ea) * h(Ea) * E] ≤ 1

由于 E[E] ≤ 1,一个充分且必要的条件(定理 1)是存在一个 β ∈ [0, 1],使得: * a(x) * (1 - h(x)) ≤ β 对所有 x 成立。 * b(x) * h(x) ≤ 1 - β 对所有 x 成立。

为了最大化 E_active,我们希望 a(x)b(x) * E 尽可能大。因此,最优选择是取等号: * a(x) = β / (1 - h(x)) * b(x) = (1 - β) / h(x)

结论:这个最小内核告诉我们,对于任何给定的控制函数 h 和超参数 β,最优的主动 e 值构造是唯一的、点态最大的,其形式为: E_active = β / (1 - h(Ea)) (当没算 E 时) E_active = (1 - β) / h(Ea) * E (当算了 E 时)

这个构造是本文所有后续理论(包括 p 值、预算分配、可容许性)的基石。整个论文的一般情形(多重检验、全局预算)只是将这个单假设的最优构造,通过一个巧妙的依赖采样机制(命题 3)和归一化分配方案(公式 8),扩展到 N 个假设上。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在大规模假设检验中,如何在严格满足全局计算预算的前提下,利用廉价辅助统计量,为每个假设构造一个统计上有效的 p 值或 e 值。
  2. 核心工具 / 方法:提出了一个“主动假设检验”框架,核心是控制函数(决定是否计算昂贵统计量的概率)和归一化分配方案(将全局预算转化为每个假设的查询概率),并辅以一个精确和依赖采样算法来保证预算严格满足。
  3. 主要结论:建立了主动 e 值和 p 值的最优构造理论(定理 1-3),证明了其控制参数(hβ)的可容许性(命题 1-2),并通过模拟和两个真实数据案例(GWAS 和 LLM 临床预测)展示了其在固定预算下相比基线方法的效率优势

关键设定与假设

  • 设定N 个假设,每个假设 i 有一个昂贵的精确统计量 XiEiPi)和一个廉价的辅助统计量 Xa_i。全局预算为 nb
  • 假设
    • 对精确统计量Ei 是有效的 e 值(E[Ei] ≤ 1),Pi 是有效的 p 值(P(Pi ≤ s) ≤ s)。这是标准假设。
    • 对辅助统计量没有任何分布假设。这是本文的一个关键优势,使其能处理来自黑箱模型(如 LLM)的任意辅助信息。辅助统计量可以任意依赖于精确统计量。
    • 对控制函数hi 可以依赖于所有辅助统计量的向量 Xa,但不能依赖于未来的信息。在批处理设置中,这是自然满足的。
    • 对独立性:在构造主动 p 值时,论文区分了“独立”和“一般依赖”两种情况。在独立情况下(PiPa_i 独立),可以得到更紧(更小)的 p 值。在一般依赖下,构造更保守。
    • 与已有文献的对比:相比 Xu et al. (2025b) 的独立伯努利决策,本文的假设更弱(不要求决策独立),但通过依赖采样实现了更强的预算控制。

主要结果

  1. 定理 1(e 值有效性的充要条件):对于单个假设的主动 e 值构造,有效性 E[E_active] ≤ 1 对所有可能的 (Ea, E) 联合分布成立,当且仅当存在 β ∈ [0, 1] 使得 sup a(x)(1-h(x)) ≤ βsup b(x)h(x) ≤ 1-β。这个定理为最优构造提供了理论基础。
  2. 定理 2(p 值的最优 a(·):对于主动 p 值,在“代理分支”(没算精确值)中,点态最小的有效 a(x)(1-h(x))/β。这保证了在没算精确值时,得到的 p 值尽可能小。
  3. 定理 3(p 值的最优 b(·):对于主动 p 值,在“精确分支”(算了精确值)中:
    • 独立时:点态最小的有效 b(x)h(x)/(1-β)
    • 一般依赖时:一个可容许的有效选择是 b(x) = (sup_y h(y))/(1-β) * I(h(x) > 0)。这个选择更保守,但适用于任意依赖。
  4. 命题 1 & 2(可容许性):证明了没有一个普适最优的控制函数 h 或超参数 β。任何非平凡的选择都是“可容许的”,即不存在另一个选择在所有情况下都严格优于它。这意味着统计功效的提升必须来自数据自适应的预算分配策略,而非寻找一个万能参数。
  5. 命题 3(精确和依赖采样):给出了一个显式算法(公式 9),可以从一组和为 nb 的概率 {pi} 中,采样出恰好 nb 个指示变量 Ci,且每个 Ci 的边缘分布是 Bernoulli(pi)。这个命题是算法 1 的核心,保证了预算的严格满足。

证明路线与技术技巧

  • 整体路线

    1. 单假设最优构造:首先在单个假设的设定下,通过分析有效性条件,推导出主动 e 值和 p 值的最优(或可容许)形式(定理 1-3)。这是整个框架的基石。
    2. 可容许性分析:通过构造反例,证明没有普适最优的控制参数(命题 1-2)。这引导作者将重点转向数据自适应的预算分配。
    3. 全局预算分配:提出归一化分配方案(公式 8),将全局预算 nb 转化为每个假设的查询概率 hi,使得 Σ hi = nb
    4. 精确和依赖采样:设计一个算法(命题 3),从概率 {hi} 中采样出恰好 nb 个决策 Ci,从而严格满足预算。
    5. 算法整合:将上述所有部分整合成算法 1,并讨论其与下游多重检验程序的兼容性。
  • 关键跳跃点

    • 从“充分条件”到“充要条件”:在 e 值构造中,作者证明了将总期望 1 分解为 β1-β 两部分不仅是充分的,而且是必要的(定理 1)。这个证明通过反证法,构造了一个反例分布,使得任何不满足该分解的构造都会导致期望超过 1。这是理论上的一个关键跳跃。
    • 从“独立决策”到“依赖采样”:将独立伯努利试验替换为依赖采样(命题 3)是解决预算随机性的关键。这个跳跃依赖于一个巧妙的数学构造(公式 9),它利用了均匀随机变量和累积概率和的 floor 函数,在保持边缘分布不变的同时,强制了总和为 nb
  • 技术技巧点名

    • 反证法:用于证明定理 1 的充要性,通过构造一个使期望超过 1 的特定联合分布。
    • 点态最优性:在定理 2 和 3 中,通过考虑点质量分布来推导 a(x)b(x) 的下界,从而得到点态最优解。
    • 可容许性证明:通过构造两个不同的数据生成场景,在每个场景中,一个参数选择优于另一个,从而证明没有参数能被普遍支配。
    • Floor 函数技巧:命题 3 的证明中,利用 ⌊c - U⌋ 的期望性质来验证边缘分布,并利用其 telescoping sum 性质来验证总和约束。

真实例子与应用

  1. 心肌梗死 GWAS(全基因组关联研究)

    • 数据:来自 OpenGWAS 数据库的 MI(目标表型)和 HTN(高血压,辅助表型)的 GWAS 汇总统计量,共 9,567,070 个共同 SNP。
    • 方法应用:将 HTN 的 p 值作为辅助统计量 Pa_i,MI 的 p 值作为昂贵精确统计量 Pi。由于两个 GWAS 在不同队列中进行,假设 PiPa_i 独立,使用独立情况下的主动 p 值构造。预算 nb 从总 SNP 数的 2% 变化到 10%。
    • 结果:与随机查询和 Xu et al. (2025b) 的方法相比,本文的 Active-Default 方法在每个预算水平下都实现了最高的效率(每查询一个 MI p 值能恢复的“黄金标准”发现数)。例如,在 nb/N = 0.02 时,Active-Default 的效率远高于 Random 和 Xu。作者还验证了一个被优先发现的 SNP (rs1333047) 位于已知的心血管疾病风险位点 9p21.3。
    • 说明的问题:该例子展示了如何利用公共的、廉价的辅助数据(HTN GWAS)来指导昂贵的目标分析(MI GWAS),在严格预算下最大化发现效率。
  2. 心肌梗死并发症预测(LLM 应用)

    • 数据:来自 Golovenkin et al. (2020) 的 1700 名心梗患者的临床数据,目标是预测住院死亡率。一个昂贵的特征是“慢性心衰(ZSN A)”,其诊断需要超声心动图等昂贵检查。
    • 方法应用:使用Gemini 3.1 Pro 大语言模型,根据患者其他廉价临床数据来插补昂贵的 ZSN A 特征。基于插补后的数据计算一个代理共形 p 值 Pa_i 作为辅助统计量。精确 p 值 Pi 则基于包含真实 ZSN A 的完整数据计算。预算 nb = 100
    • 结果:所有方法都控制了 FDR。Active-Default 在严格满足 nb=100 预算的同时,实现了最高的效率(每查询一个精确 p 值能发现的真阳性数)。相比之下,Xu 的方法查询了远超 100 次,而 ALL 查询了 500 次。
    • 说明的问题:该例子展示了本文框架的“模型无关”特性,能够无缝集成像 LLM 这样的复杂黑箱模型作为辅助信息源,在资源受限的临床场景中高效地进行假设检验。

🔎 结论是否比证明窄

  • 。论文在引言和摘要中声称其框架是“模型无关”的,并且能处理“任意”辅助统计量。然而,其理论证明(特别是定理 1 和 3)依赖于辅助统计量 Xa_i 的分布没有任何假设这一事实。这虽然是一个优点,但也意味着其最优性结论是在最坏情况下成立的。在实际应用中,如果辅助统计量有特定的良好结构(例如,它是精确统计量的无偏估计),可能存在比本文构造更优的方法。论文没有探索这种可能性。
  • 另一个潜在窄化是,论文的 p 值构造在“一般依赖”下使用了 sup_y h(y) 这个保守因子。作者证明了这是可容许的,但并未证明它是最优的。可能存在其他更紧的、依赖于具体依赖结构的构造。论文在 Remark 3 中也承认,其分解策略是充分的但非必要的,暗示了存在更优构造的可能性。

四、开放问题

  1. 数据驱动的效用函数学习:论文建议使用 ui(x) = xui(x) = 1/(x+ε) 作为默认效用函数,但承认没有普适最优选择。一个明确的开放问题是:能否利用一个标定数据集,将效用函数的选择形式化为一个优化问题,以最大化下游目标(如发现数)?(扎根于 Section 6 Discussion 第一段)。

  2. 结构化推断问题的扩展:本文处理的是独立的、批处理的假设。一个自然的扩展是:如何将本框架推广到假设之间存在图结构(如网络、空间)或假设顺序到达的在线场景? 论文在 Supplement H 中初步讨论了在线设置,但提出的算法(公式 H.1)是启发式的,缺乏理论保证。这是一个具体的、可攻击的问题。(扎根于 Section 6 Discussion 第二段)。

  3. 与更复杂下游程序的整合:论文展示了其主动统计量可与 BH、BY、e-BH 等程序兼容。一个更深层的问题是:能否设计一个联合优化框架,将主动统计量的构造与下游 FDR 控制程序(如 AdaPT, SABHA)的权重学习结合起来,实现端到端的功效最大化?(扎根于 Section 3.3 最后一段,提及了与 AdaPT 等方法的兼容性)。

  4. 理论边界的收紧:对于一般依赖下的 p 值构造,论文使用了 sup_y h(y) 这个保守因子。一个理论上的开放问题是:能否刻画在给定依赖结构(如正依赖、混合依赖)下,主动 p 值的最优 b(·) 函数? 这需要比“可容许性”更强的“最优性”结果。(扎根于 Theorem 3 的第二部分和 Remark 3)。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论