The Randomized BH Procedure: A Generalized Framework Encompassing Conformal and Competition Tests¶
作者: Mingzhou Deng, Yan Fu
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2607.07245
一、领域脉络与小综述¶
-
这个方向是什么:多重假设检验中的错误发现率(FDR)控制。核心问题是:在同时进行大量假设检验时,如何设计一个程序,使得被拒绝的假设中,错误拒绝(假阳性)的比例在期望上被控制在预设水平α以下。经典方法是Benjamini-Hochberg (BH) 程序,它基于p值。然而,在许多现代数据场景中,获得有效的p值(即已知或可逼近的零分布)变得困难。因此,近年来涌现出“无零分布”的方法,包括竞争检验(competition tests)、共形检验(conformal tests)和e值方法。本文旨在为前两者提供一个统一的数学框架。
-
发展脉络(history):
- 奠基工作:Benjamini & Hochberg (1995) 提出了FDR准则和BH程序,其FDR控制依赖于p值在零假设下满足“子均匀性”(sub-uniformity)和特定的依赖结构(如PRDS)。这是整个领域的基石。
- 主要进展(无零分布方法):
- 竞争方法:Barber & Candès (2015) 提出了Knockoff滤波器,通过构造与原始变量保持依赖结构的“伪变量”,让原始统计量与伪变量竞争,从而在不依赖零分布的情况下控制FDR。Candes et al. (2018) 将其推广到Model-X框架。He et al. (2015, 2022) 的Target-Decoy Competition (TDC) 方法在蛋白质组学中广泛应用。这些方法的核心是构造伪变量,并利用标签(原始 vs. 伪)的随机性。
- 共形方法:Bates et al. (2023) 将共形预测框架(Vovk et al., 2005)引入多重检验,通过评估测试统计量在校准集中的秩次来生成“共形p值”。其有效性依赖于测试集和校准集之间的可交换性(exchangeability)假设。
- e值方法:Wang & Ramdas (2022) 提出了eBH程序,使用e值(零假设下期望≤1的非负随机变量)作为检验统计量。其优势在于能在任意依赖结构下控制FDR,但构造有效的e值本身可能和构造p值一样困难。
- 当前frontier与本文位置:竞争方法和共形方法各有优劣。竞争方法完全抛弃了p值,失去了p值统一尺度、直接量化证据的优势。共形方法则受限于严格的可交换性假设。本文作者观察到,这两种方法虽然形式迥异,但都让检验统计量在假设之间“互为参照”。作者的核心贡献是:通过引入随机化,将经典BH程序推广为“随机化BH程序”(Randomized BH),并证明经典BH、竞争检验和共形检验都是该框架的特例。这统一了这两个看似独立发展的子领域。
-
子线索聚类:
- p值方法与依赖结构:以Benjamini & Hochberg (1995)、Benjamini & Yekutieli (2001) 为代表,研究在PRDS、独立或任意依赖下,基于p值的BH程序如何控制FDR。这是最成熟的线索。
- 竞争方法:以Barber & Candès (2015)、Candes et al. (2018)、He et al. (2015) 为代表,通过构造伪变量和标签随机化来规避对零分布的需求。其FDR控制依赖于“竞争统计量”的结构性质(如标签条件概率)。
- 共形方法:以Bates et al. (2023) 为代表,利用可交换性生成有效的p值。其FDR控制依赖于共形p值满足BH-valid条件(子均匀性和PRDS)。
- e值方法:以Wang & Ramdas (2022) 为代表,利用期望的可加性在任意依赖下控制FDR。本文将其作为对比,未深入纳入统一框架。
-
这个方向在追问的核心问题:
- FDR控制的条件:对于给定的检验程序,需要什么样的统计性质(如p值的子均匀性、PRDS、竞争统计量的标签条件、可交换性)才能保证FDR ≤ α?这些条件之间是什么关系?
- 无零分布方法的统一性:竞争、共形、e值这三种看似不同的方法,是否存在一个更深层的、统一的数学结构?它们的优势和局限性能否在一个框架内被理解和弥补?
- 依赖结构的鲁棒性:如何放松经典BH程序对PRDS的依赖?如何放松共形方法对可交换性的依赖?如何在更一般的依赖结构下(如组间任意依赖)控制FDR?
- 异构检验的整合:当来自不同实验、不同分布族的检验结果需要合并时,如何维持全局FDR控制?p值提供了统一尺度,但竞争方法缺乏这一点。
-
⚠️ 作者的 framing:
- 作者把缺口 frame 成什么:作者将竞争方法和共形方法描述为“各有显著局限”(notable limitations),并指出它们“共享一个更深层的联系”(share a deeper connection)。因此,本文的贡献被定位为“发展一个统一框架,克服各自的局限,同时保留各自的优势”。作者特别强调,共形方法受限于“严格的可交换性假设”,而竞争方法“完全抛弃了p值,从而牺牲了p值的自然优势”。Randomized BH 框架被呈现为“显然的下一步”,因为它通过引入随机化,同时解决了这两个问题:它使共形检验摆脱了可交换性(允许通过预筛选构建校准集),并使竞争方法能够借助成熟的p值理论进行分析。
- 哪些竞争路线被他淡化或回避了:e值方法被明确地“仅用于比较,未深入探讨”(discussed only for comparison and are not explored in depth)。作者承认e值方法在任意依赖下的优势,但指出“构造有效的e值可能和获得有效p值一样困难”。这暗示e值方法并非一个更优的替代方案,而是与p值方法面临类似的挑战。作者没有深入讨论e值方法是否也能被纳入其随机化框架,而是在未来工作中将其列为开放问题。
- 什么明显该被引/该存在、却没出现在 intro 里?:作者在讨论共形方法时,提到了Barber et al. (2024) 的“加权可交换性”(weighted exchangeability)作为放松可交换性的一种尝试,并指出其“引入了相当大的理论复杂性,条件在实践中难以验证”。但作者没有引用或讨论其他放松可交换性的工作,例如基于分位数回归或条件分布匹配的共形推断方法。这些方法可能提供了与本文随机化方法不同的另一种路径。这是一个值得研究者去查的问题:是否存在其他已被提出的、用于放松共形检验可交换性假设的方法?它们与本文的随机化方法相比如何?
-
张力:未见明显对立引用。被引工作之间是互补或递进关系,而非矛盾。例如,竞争方法和共形方法被描述为各有优缺点,而非相互否定。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( H = [m] = \{1, \dots, m\} \):所有假设的索引集。
- \( H_0 \subseteq H \):真实零假设的集合(未知)。
- \( H_1 = H \setminus H_0 \):真实备择假设的集合。
- \( m_0 = |H_0| \), \( \pi_0 = m_0 / m \):零假设的数量和比例。
- \( R \subseteq H \):被拒绝的假设集(由检验程序决定)。
- \( V = |R \cap H_0| \):错误拒绝的数量(假阳性)。
- \( R = |R| \):总拒绝数量。
- \( \text{FDP} = V / (R \vee 1) \):错误发现比例。
- \( \text{FDR} = \mathbb{E}[\text{FDP}] \):错误发现率(目标控制量)。
- \( \alpha \in (0, 1) \):目标FDR水平。
- \( X = (X_1, \dots, X_m) \in \mathbb{R}^m_* \):检验统计量向量(\( \mathbb{R}_* = [0, \infty] \))。
- \( P = (P_1, \dots, P_m) \):p值向量。一个有效的p变量满足 \( \mathbb{P}(P_j \le t) \le t \) 对所有 \( t \in [0,1] \) 成立。
- \( q_{m,\alpha}^k = k\alpha / m \):BH程序的临界值。
- \( (W, L) \):竞争统计量。\( W_j \in \mathbb{R}_* \) 是得分,\( L_j \in \{0,1\} \) 是标签(1表示“原始”,0表示“伪”)。
- \( r \):竞争程序的参数,满足 \( \mathbb{P}(L_j = 1 \mid W, L_{-j}) = r/(1+r) \) 对所有 \( j \in H_0 \) 成立(竞争统计量定义)。
- \( \text{PRDS}_{H_0} \):在子集 \( H_0 \) 上的正回归依赖性。一个关键性质是,对于任何 \( j \in H_0 \) 和非递减集 \( C \),\( \mathbb{P}(X_{-j} \in C \mid X_j \le t) \) 是 \( t \) 的非递减函数。
-
模型:这是一个多重假设检验问题。我们有一个数据生成机制,它产生了 \( m \) 个检验统计量 \( X_1, \dots, X_m \)。对于每个假设 \( j \),我们想要检验 \( H_{0j}: \text{“第j个假设为真”} \) vs \( H_{1j}: \text{“第j个假设为假”} \)。我们不知道哪些 \( j \) 属于 \( H_0 \)。我们设计一个程序(如BH、竞争、共形),输入可观测的统计量,输出一个拒绝集 \( R \),并希望 \( \mathbb{E}[V/(R \vee 1)] \le \alpha \)。
-
可观测数据:
- 经典BH:可观测到的是 \( m \) 个p值 \( P_1, \dots, P_m \)。这些p值是通过某种方式从原始数据计算得到的,其零分布要么已知,要么可被逼近。我们想要但观测不到的是 \( H_0 \) 本身。
- 竞争方法:可观测到的是 \( m \) 对 \( (W_j, L_j) \)。\( W_j \) 是原始统计量与伪统计量(如Knockoff)的比较结果(如最大绝对值),\( L_j \) 指示哪个更大。我们想要但观测不到的是 \( H_0 \) 以及伪变量构造的完美性(即伪变量是否真的复制了原始变量的依赖结构)。
- 共形方法:可观测到的是测试集 \( X \)(\( m \) 个)和校准集 \( Y \)(\( n \) 个)。共形p值 \( P_j = (1 + \sum_{i=1}^n \mathbf{1}\{X_j \le Y_i\}) / (1+n) \) 是完全由可观测数据计算得到的。我们想要但观测不到的是 \( H_0 \) 以及可交换性假设是否成立(即 \( (X_{H_0}, Y) \) 是否可交换)。
第二步:讲最小内核¶
本文的核心思路是:通过引入随机化,将“每个零假设都必须满足的严格条件”放松为“平均意义上满足的条件”。
最简特例:考虑一个极端简化的场景,只有一个零假设(\( m=1 \), \( H_0 = \{1\} \))。经典BH程序要求 \( P_1 \) 是一个p变量(\( \mathbb{P}(P_1 \le t) \le t \))。现在,假设我们有 \( m \) 个零假设,但它们的p值 \( P_1, \dots, P_m \) 的边际分布可能不同,甚至有些 \( P_j \) 可能不是有效的p变量(例如,\( \mathbb{P}(P_j \le 0.05) = 0.1 > 0.05 \))。经典BH程序在这种情况下可能无法控制FDR。
Randomized BH 的核心想法:我们不再要求每个 \( j \in H_0 \) 都满足 \( \mathbb{P}(P_j \le t) \le t \),而是要求随机均匀地从 \( H_0 \) 中选出一个索引 \( J \),这个 \( P_J \) 满足p变量条件:
类似地,对于依赖结构,我们不再要求每个 \( j \in H_0 \) 都满足PRDS,而是要求随机化PRDS条件:对于随机选择的 \( J \),\( \mathbb{P}(P_J^{(\cdot)} \in C \mid P_J \le t) \) 是 \( t \) 的非递减函数,其中 \( P_J^{(\cdot)} \) 是去掉 \( P_J \) 后的顺序统计量。
为什么这能统一竞争和共形方法? - 共形方法:在可交换性下,所有 \( j \in H_0 \) 的共形p值 \( P_j \) 具有相同的边际分布,因此随机化p变量条件自动满足。本文的关键推广是:即使可交换性不成立,只要我们能通过某种方式(如预筛选)构造一个校准集,使得随机选出的零假设的p值在平均意义上满足条件,那么FDR仍然可控。这解释了为什么预筛选(可能引入备择假设到校准集)后,共形检验仍能工作。 - 竞争方法:竞争统计量 \( (W, L) \) 本身不产生p值。但本文通过一个巧妙的变换(公式(2)和(4)),从竞争统计量中构造出“类似p值”的统计量 \( P_j \) 和权重 \( E_j \)。然后证明,在竞争统计量的结构下,这些 \( P_j \) 满足随机化BH-valid条件。因此,竞争程序本质上是在执行一个加权后的随机化BH程序。
一句话总结:这篇论文在数学上干了一件什么事?它定义了一个比经典BH-valid更弱的条件——随机化BH-valid,并证明在这个更弱的条件下,BH程序仍然能控制FDR。然后,它证明经典BH、竞争检验和共形检验所产生的统计量,都满足(或被证明满足)这个随机化BH-valid条件,从而将它们统一在一个框架下。
三、这篇论文做了什么¶
-
三句话:
- 研究了什么问题:如何统一经典BH程序、竞争检验和共形检验这三个看似独立的FDR控制方法,并克服它们各自的局限性(共形方法对可交换性的依赖,竞争方法缺乏p值的统一尺度)。
- 核心工具/方法:提出了随机化BH程序(Randomized BH),通过引入随机化,将经典BH程序对p值的“逐假设”要求(子均匀性+PRDS)放松为“平均”要求(随机化p变量+随机化PRDS)。
- 主要结论:证明了经典BH、竞争检验和共形检验都是随机化BH程序的特例(嵌入定理)。基于此框架,提出了两个应用:① 从随机化视角深入分析复合p值(compound p-values)的FDR控制问题;② 为整合异构检验(如整合两个竞争检验,或整合一个p值检验与一个竞争检验)提供了全局FDR控制的一般方法。
-
关键设定与假设:
- 随机化BH-valid p变量(定义9):这是全文最核心的定义。它包含两个条件:
- 随机化p变量条件:对于均匀随机独立于 \( P \) 的索引 \( J \in H_0 \),有 \( \mathbb{P}(P_J \le t) \le t \) 对所有 \( t \in \mathbb{R}_* \) 成立。
- 随机化PRDS条件:对于任何非递减集 \( C \subseteq \mathbb{R}^{m-1}_* \),\( \mathbb{P}(P_J^{(\cdot)} \in C \mid P_J \le t) \) 在 \( t \in Q_{m,\alpha} \) 上是非递减的。这里 \( P_J^{(\cdot)} \) 是去掉 \( P_J \) 后的顺序统计量。
- 相比已有文献的放宽/强化:
- 相比经典BH:经典BH要求每个 \( j \in H_0 \) 的 \( P_j \) 都是p变量且满足PRDS。随机化BH-valid只要求这些性质在平均意义上对随机选出的 \( J \) 成立。这是显著的放宽。定理13证明,任何经典BH-valid的p变量集合都自动是随机化BH-valid的(通过随机占优),因此随机化BH-valid是严格更弱的条件。
- 相比共形方法:共形方法依赖于 \( (X_{H_0}, Y) \) 的可交换性,这保证了所有 \( j \in H_0 \) 的共形p值具有相同的边际分布,从而满足随机化BH-valid(定理12)。随机化BH-valid允许边际分布不同,只要平均后满足条件。这为通过预筛选构建校准集提供了理论基础(定理10)。
- 相比竞争方法:竞争方法不产生p值。本文通过公式(4)构造了“伪p值” \( P_j \) 和权重 \( E_j \),并证明在竞争统计量的结构下,这些 \( P_j \) 满足随机化BH-valid(定理14)。这赋予了竞争方法p值的分析工具。
- 随机化BH-valid p变量(定义9):这是全文最核心的定义。它包含两个条件:
-
主要结果:
- 定理11(FDR控制 for 随机化BH-valid p变量):如果 \( P \) 关于 \( H_0 \) 是随机化BH-valid的,那么BH程序 \( R_\alpha(P) \) 控制 \( \text{FDR} \le \alpha \pi_0 \)。这是整个框架的基石。
- 定理12(嵌入定理:共形检验):如果p变量 \( P \) 满足PRDS\( _{H_0} \) 且所有 \( j \in H_0 \) 的边际分布相同,则 \( P \) 是随机化BH-valid的。因此,在可交换性下,共形p值是随机化BH-valid的。
- 定理13(嵌入定理:经典BH):如果 \( P \) 是经典BH-valid的p变量,则存在 \( Q \) 使得 \( P \ge Q \) 几乎必然成立,且 \( Q \) 是随机化p变量,\( P \) 被 \( Q \) 随机占优地满足随机化PRDS。因此,经典BH-valid蕴含随机化BH-valid。
- 定理14(嵌入定理:竞争检验):如果 \( (W, L) \) 是参数为 \( r \) 的竞争统计量,则通过公式(4)构造的 \( P \) 和 \( E \) 使得加权BH程序能控制FDR。这证明了竞争程序是随机化BH框架的一个特例。
- 定理18(FDR控制 for 整合检验):给出了算法1(整合两个竞争检验)和算法2(整合p值检验与竞争检验)的FDR控制保证。关键在于,通过将竞争统计量转换为随机化BH-valid的“伪p值”,它们可以与标准p值在统一的BH阈值下进行比较,从而维持全局FDR控制。
- 定理19(任意组间依赖下的FDR控制):对于整合两个竞争检验,即使它们之间存在任意依赖关系,通过引入一个仅依赖于参数 \( r \) 的修正因子 \( c(r) \),仍能控制FDR。例如,当 \( r=1 \) 时,\( c(1) = 0.5201 \)。
-
证明路线与技术技巧:
- 整体路线:
- 建立等价形式:首先将竞争程序和共形程序改写为类似BH的形式(定理5和6),揭示它们共享的结构。
- 定义随机化BH-valid:提出定义9,这是整个框架的核心概念。
- 证明核心定理:证明定理11,即随机化BH-valid足以保证FDR控制。证明的关键在于利用随机化将求和与期望交换,并利用随机化PRDS条件处理依赖结构。
- 证明嵌入定理:分别证明经典BH、共形检验和竞争检验的统计量都满足(或被证明满足)随机化BH-valid条件(定理12-14)。
- 应用与推广:基于该框架,推导出复合p值的分析(定理16)和整合检验的算法与理论(定理18, 19)。
- 关键跳跃点:
- 从“逐假设”到“平均”:最大的概念跳跃是定义9。经典理论中,FDR控制依赖于每个零假设的p值性质。作者敏锐地观察到,由于FDR是对所有零假设取平均,因此只需要平均性质。这个跳跃使得统一框架成为可能。
- 竞争统计量的p值化:将竞争统计量 \( (W, L) \) 转化为“伪p值” \( P_j \) 和权重 \( E_j \)(公式(4))是一个关键技巧。这个转化不是平凡的,它利用了竞争统计量的结构性质(标签的随机性)来构造一个在平均意义上有效的p变量。
- 处理组间依赖:定理19中引入修正因子 \( c(r) \) 来处理整合检验时的组间任意依赖。证明思路是,通过一个上界将问题转化为一个与组间依赖无关的、关于二项分布随机变量的期望问题,从而找到通用的修正因子。
- 技术技巧点名:
- 随机化(Randomization):核心技巧。通过引入一个均匀随机的索引 \( J \),将逐假设的条件平均化。
- 随机占优(Stochastic Domination):在定理13中,用 \( Q \) 随机占优 \( P \),从而将经典BH-valid的性质“传递”到随机化框架下。
- 等价形式重写(Reformulation):将竞争和共形程序重写为BH-like形式,揭示了它们的共同结构。
- 负关联(Negative Association, NA):在定理16中,利用随机排列引入的负依赖来分析复合p值。
- FDR-Linking定理:在定理16的证明中引用,用于在负依赖下建立FDR界。
- 组合论证与二项分布上界:在定理19的证明中,将问题转化为一个关于二项分布随机变量的上界问题。
- 整体路线:
-
真实例子与应用:
- 预筛选共形测试(Section 5.1):
- 数据/场景:模拟数据,\( m=2000 \) 个假设,其中 \( m_0 = \pi_0 m \) 个零假设。每个假设的统计量 \( X_i \sim N(\mu_i, 1) \)。备择假设有信号 \( \mu_i = \beta \)。
- 方法应用:先用一个独立的预筛选数据集 \( X^{pre}_i \) 进行筛选,将 \( |X^{pre}_i| \ge 0.5 \) 的归入测试集 \( D_{test} \),其余的归入校准集 \( D_{cal} \)。然后,在 \( D_{test} \) 上应用共形BH程序,使用 \( D_{cal} \) 作为校准集。
- 结果:图1显示,在不同信号强度 \( \beta \) 和零假设比例 \( \pi_0 \) 下,FDR被控制在目标水平 \( \alpha \) 以下,且无需 \( \pi_0 \) 校正。这验证了定理10的结论:即使校准集可能包含备择假设(因为预筛选不完美),只要随机化条件满足,FDR仍可控。
- 说明的问题:验证了随机化BH框架允许共形检验通过预筛选构建校准集,从而摆脱了严格的可交换性假设。
- 整合测试(Section 5.2):
- 数据/场景:模拟两组独立的假设,每组内部有异方差的零分布(通过周期权重向量模拟)。分别构造竞争统计量或随机化p值。
- 方法应用:应用算法1(整合两个竞争检验)和算法2(整合p值检验与竞争检验)。
- 结果:图3和图4显示,按照算法(标记为“True”)进行的整合测试,FDR被控制在目标水平以下。而错误地使用 \( R_+(0) \) 作为分母(标记为“False”)则会导致FDR失控。这验证了定理18。
- 说明的问题:展示了随机化BH框架为整合异构检验提供了可行且有效的方案。
- 与e值方法的比较(Section 5.3):
- 数据/场景:与整合测试类似,但将竞争统计量通过两种方式(MHTE和CPE)转换为e值,然后进行整合。
- 结果:图5显示,e值转换方法(MHTE和CPE)经常无法控制FDR,而本文的随机化p值方法(CPCF)则表现良好。
- 说明的问题:强调了e值方法在异构整合问题中的局限性(e值过于“紧”),而随机化p值方法提供了一个更鲁棒的替代方案。
- 预筛选共形测试(Section 5.1):
-
🔎 结论是否比证明窄:
- 定理19的修正因子 \( c(r) \):论文证明了存在一个函数 \( c(r) \) 使得FDR可控,并给出了 \( c(1) = 0.5201 \) 的具体值。但论文没有给出 \( c(r) \) 对于一般 \( r \) 的显式表达式或计算方法,只给出了一个基于二项分布期望的上界定义。这比一个完整的、对所有 \( r \) 都适用的显式公式要窄。论文在补充材料中提供了更多分析,但并未声称对所有 \( r \) 都给出了闭式解。
- 整合检验的独立性假设:定理18要求被整合的检验(如两个竞争检验,或p值与竞争检验)之间是相互独立的。这是一个很强的假设。虽然定理19处理了竞争检验之间的任意组间依赖,但并未覆盖所有整合场景(如p值与竞争检验之间的任意依赖)。论文的结论在这一点上比其声称的“一般方法”要窄,因为它依赖于独立性或特定的依赖结构。
- e值方法的纳入:论文在讨论部分明确将e值方法的纳入列为开放问题,说明其框架目前并未真正统一e值方法。因此,论文标题中的“统一框架”实际上只统一了BH、竞争和共形三类方法,而非所有无零分布方法。
四、开放问题¶
-
随机化引入的负依赖的深入分析:论文在定理16中利用随机排列引入的负关联(NA)来分析复合p值,但FDR界是1.93α,且依赖于独立性。扎根于:定理16的证明和讨论部分(Section 6)提到“当原始统计量已经具有依赖结构时,理解它如何与随机化引入的负依赖相互作用,并推导出同时考虑两种来源的FDR界,是一个重要的开放问题。” 这是一个具体的理论问题:能否在原始p值具有某种已知依赖结构(如m-依赖、弱依赖)时,给出比1.93α更紧的FDR界?
-
e值方法的纳入:论文明确指出e值方法目前不在随机化BH框架内。扎根于:Section 6的讨论:“尽管e值目前处于随机化BH框架之外,但将它们纳入将把所有三种无零分布方法统一在一个单一的理论结构下。这是否可以通过适用于e值的随机化方案实现,还是需要根本不同的构造,仍然是一个悬而未决的问题。” 这是一个框架性的开放问题:能否定义一种“随机化e变量”或类似的平均化条件,使得eBH程序也能被纳入?
-
随机化BH-valid条件的更广泛应用:论文展示了两个应用(复合p值和整合检验)。扎根于:Section 6的讨论:“一个自然的下一步是研究经典p值和BH理论中的哪些更深层结果可以推广到随机化p值,例如最优加权和结构自适应BH程序。” 这是一个方法论问题:能否将随机化BH-valid的概念应用于更复杂的BH变体,如自适应BH(Storey's BH)、加权BH等,以在更一般的设定下获得最优性或适应性?
-
预筛选共形检验的有限样本保证:论文的定理10和模拟验证了预筛选共形检验的FDR控制,但其证明依赖于随机化条件和一些渐近或平均论证。扎根于:Section 5.1的模拟和补充材料S9.1的分析。一个开放问题是:能否为预筛选共形检验提供精确的有限样本FDR界,特别是当预筛选过程本身可能引入复杂的选择偏差时?这可能需要更精细的概率不等式。
Maintained by 陈星宇 · Homepage · Source on GitHub