跳转至

Revisiting dependence in multiple testing: empirical distribution approaches for FDP control

作者: Fangyong Zheng, Pengfei Li, Yuan Jiang, Tao Yu
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2609.06509


一、领域脉络与小综述

这个方向是什么

大规模多重假设检验(如全基因组关联分析、差异表达基因筛选)的核心挑战是控制错误发现比例(FDP),即被拒绝的假设中错误拒绝的比例。经典方法(如 Benjamini-Hochberg, BH)通常假设检验统计量独立或具有特定依赖结构(如正回归依赖),并依赖理论零分布(如均匀分布)来校准阈值。然而,在高通量数据中,检验统计量之间往往存在未知且复杂的依赖结构(如基因共表达、空间相关性),导致理论零分布与实际经验分布严重偏离,从而使得基于理论分布的 FDP 控制失效。本文的核心问题是:能否在不显式建模依赖结构的前提下,仅通过估计零假设检验统计量的经验分布来实现 FDP 的渐近控制?

发展脉络(history)

  • 奠基工作:Benjamini & Hochberg (1995) 提出 BH 过程,在独立或正依赖假设下控制 FDR(FDP 的期望)。这是多重检验的里程碑,但其依赖假设在实际中常被违反。
  • 主要进展(依赖建模路线):为处理依赖,后续工作发展了多种策略:
    • 隐变量/因子模型:Efron (2007) 提出“相关性调整”方法,通过估计隐变量来校正依赖;Leek & Storey (2008) 提出 sva 方法,估计并移除隐藏的批次效应或生物变异。这些方法需要显式建模依赖结构(如因子个数、隐变量分布),且对模型误设敏感。
    • 置换/重抽样方法:Westfall & Young (1993) 提出 minP 和 maxT 方法,通过置换保留依赖结构,但计算成本高且对弱信号不敏感。Storey & Tibshirani (2003) 的 q 值方法也依赖置换来估计零分布。
    • 经验贝叶斯方法:Efron (2004) 提出局部 FDR,通过混合模型估计零分布,但依赖“零分布已知”或“零分布为理论分布”的假设。
  • 当前 frontier:近年工作开始关注非参数经验分布的角色。例如,本文作者在引言中引用了 Jin & Cai (2007) 的“Higher Criticism”方法,该方法在稀疏信号下通过经验分布偏离理论分布的程度来检测信号,但未直接用于 FDP 控制。另一条线索是本文作者引用的“knockoff”方法 (Barber & Candès, 2015),它通过构造“假”变量来模拟零分布,但需要显式构造 knockoff 变量,且仅适用于线性模型。
  • 本文的位置:本文声称,显式建模依赖结构是不必要的——只要我们能准确估计所有零假设检验统计量的经验累积分布函数(c.d.f.),无论依赖结构如何,FDP 都可以被最优控制。这直接挑战了“依赖建模是 FDP 控制关键”的主流观点,将问题从“建模依赖”转向“估计零分布”。

子线索聚类

  1. 依赖建模方法:Efron (2007), Leek & Storey (2008), Friguet et al. (2009)。核心思路:通过因子模型、隐变量模型或协方差估计来显式刻画依赖,然后调整检验统计量或阈值。瓶颈:模型误设风险高,且在高维下协方差估计本身是困难的。
  2. 置换/重抽样方法:Westfall & Young (1993), Storey & Tibshirani (2003), Tusher et al. (2001, SAM)。核心思路:通过置换或重抽样保留依赖结构,直接生成零分布的经验版本。瓶颈:计算成本高,且对弱信号或非对称依赖可能失效。
  3. 经验分布/非参数方法:Jin & Cai (2007, Higher Criticism),本文。核心思路:不建模依赖,而是直接估计零统计量的经验分布,利用其与理论分布的偏离来推断。瓶颈:如何从混合分布中可靠地分离出零分布,以及如何保证估计的收敛性。

这个方向在追问的核心问题

  1. FDP 控制是否必须依赖依赖结构? 经典答案:是(BH 需要正依赖,置换方法保留依赖)。本文的答案:否,只要知道零统计量的经验分布。
  2. 如何从混合分布中估计零分布? 这是非参数多重检验的核心困难。现有方法(如 Efron 的局部 FDR)依赖“零分布已知”或“零分布为理论分布”的强假设。本文提出通过多元混合模型框架来估计。
  3. 经验分布估计的收敛速率如何? 在高维(大量假设)下,零统计量的经验分布可以一致估计吗?需要什么条件?本文建立了渐近收敛性,但未给出 minimax 速率。

⚠️ 作者的 framing

  • 作者的说法:作者将缺口 frame 为“经典方法依赖理论零分布,但实际中经验分布偏离理论假设,导致 FDP 控制失败”。因此,本文的“显然的下一步”是:直接估计零统计量的经验分布,并证明其足以实现 FDP 控制,从而绕开依赖建模。
  • 被淡化/回避的竞争路线:
    • 置换方法:作者在引言中承认置换方法可以处理依赖,但指出其“计算成本高”和“对弱信号不敏感”。然而,置换方法在理论上可以精确控制 FDP(在有限样本下),而本文的方法仅提供渐近控制。作者未深入讨论这一 trade-off。
    • knockoff 方法:作者引用 knockoff 作为依赖处理的一个例子,但未讨论其与本文方法的本质区别——knockoff 需要构造“假”变量,而本文方法不需要。
  • 什么明显该被引/该存在、却没出现在 intro 里?
    • 关于经验分布估计的收敛性理论:例如,关于“零分布经验 c.d.f. 的估计误差”的 minimax 下界。本文的渐近结果依赖于一些正则条件,但未与现有非参数估计理论(如核密度估计的收敛速率)建立联系。
    • 更近期的依赖建模工作:例如,基于“随机矩阵理论”的依赖校正方法(如 Bai & Saranadasa, 1996; Chen et al., 2010),这些方法在高维协方差估计方面有深入分析,但未被引用。这可能是一个值得研究者去查的 gap:随机矩阵理论能否为本文的经验分布估计提供更精确的收敛速率或有限样本保证?

张力

未见明显对立引用。不同方法在依赖处理上各有侧重,但本文的核心主张(“显式建模依赖不必要”)与主流观点(依赖建模是关键)之间存在根本张力。这种张力是本文的价值所在,也是后续争议的潜在来源。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • \( m \):假设总数(如基因数)。
    • \( H_{0i} \):第 \( i \) 个零假设(\( i = 1, \dots, m \))。
    • \( T_i \):第 \( i \) 个检验的检验统计量(如 t 统计量、z 得分)。
    • \( p_i \):第 \( i \) 个检验的 p 值(通常由 \( T_i \) 和理论零分布计算得到)。
    • \( \mathcal{H}_0 \):所有真实零假设的指标集,大小为 \( m_0 \)。
    • \( \mathcal{H}_1 \):所有真实备择假设的指标集,大小为 \( m_1 = m - m_0 \)。
    • \( \pi_0 = m_0 / m \):零假设的比例。
    • \( F_i(t) = P(T_i \le t) \):第 \( i \) 个检验统计量的真实累积分布函数(c.d.f.)。
    • \( F_{0i}(t) = P(T_i \le t \mid H_{0i}) \):第 \( i \) 个检验统计量在零假设下的真实 c.d.f.(零分布)。
    • \( \hat{F}_0(t) = \frac{1}{m_0} \sum_{i \in \mathcal{H}_0} I(T_i \le t) \):所有零假设检验统计量的经验 c.d.f.(oracle 量,不可观测,因为 \( \mathcal{H}_0 \) 未知)。
    • \( \hat{F}(t) = \frac{1}{m} \sum_{i=1}^m I(T_i \le t) \):所有检验统计量的经验 c.d.f.(可观测)。
    • \( V(t) = \#\{i \in \mathcal{H}_0 : T_i > t\} \):在阈值 \( t \) 下错误拒绝的个数。
    • \( R(t) = \#\{i : T_i > t\} \):在阈值 \( t \) 下总拒绝个数。
    • \( \text{FDP}(t) = V(t) / \max(R(t), 1) \):在阈值 \( t \) 下的错误发现比例。
    • \( \text{FDR} = E[\text{FDP}] \):错误发现率。
  • 模型:

    • 数据生成机制:假设 \( m \) 个检验统计量 \( T_1, \dots, T_m \) 来自一个多元混合分布:
      \[T_i \sim (1 - \pi_0) \cdot G_{1i} + \pi_0 \cdot G_{0i}\]
      其中 \( G_{0i} \) 是第 \( i \) 个检验在零假设下的分布(零分布),\( G_{1i} \) 是备择分布。关键假设:零分布 \( G_{0i} \) 可以随 \( i \) 变化(即非同一分布),且检验统计量之间可以任意依赖。
    • 可观测数据:我们观测到 \( m \) 个 p 值 \( p_1, \dots, p_m \)(或直接观测到 \( T_1, \dots, T_m \))。我们不知道哪些是零假设,也不知道零分布的具体形式,只知道它们可能偏离理论分布(如均匀分布)。
    • 想要但观测不到的量:\( \mathcal{H}_0 \)(真实零假设集合)、\( \hat{F}_0(t) \)(零统计量的经验 c.d.f.)、\( V(t) \)(错误拒绝数)。

第二步:讲最小内核

最简特例:假设所有零假设的检验统计量 \( T_i \) 都来自同一个未知的连续分布 \( F_0 \)(即 \( G_{0i} = F_0 \) 对所有 \( i \in \mathcal{H}_0 \) 成立),且备择假设的统计量来自另一个分布 \( F_1 \)。检验统计量之间可以任意依赖。

核心洞察(本文的基石):如果我们知道 oracle 量 \( \hat{F}_0(t) \)(即所有零统计量的经验 c.d.f.),那么对于任意阈值 \( t \),错误拒绝数 \( V(t) \) 可以精确计算为:

\[V(t) = m_0 \cdot (1 - \hat{F}_0(t))\]
因为 \( \hat{F}_0(t) \) 就是零统计量中不超过 \( t \) 的比例,所以 \( 1 - \hat{F}_0(t) \) 就是超过 \( t \) 的比例。因此,FDP 可以精确表达为:
\[\text{FDP}(t) = \frac{m_0 \cdot (1 - \hat{F}_0(t))}{\max(R(t), 1)}\]
其中 \( R(t) \) 是可观测的(总拒绝数)。这个表达式不依赖于任何依赖结构——无论统计量之间如何相关,只要我们知道 \( \hat{F}_0(t) \),FDP 就是确定的。

为什么这是最小内核? 这个特例剥离了所有关于依赖建模、分布假设的复杂性,直接揭示了 FDP 控制的本质:FDP 控制问题等价于估计零统计量的经验 c.d.f. \( \hat{F}_0(t) \)。一旦 \( \hat{F}_0(t) \) 被准确估计,FDP 就可以被精确控制,依赖结构变得无关紧要。

本文的一般化:本文的一般设定允许零分布 \( G_{0i} \) 随 \( i \) 变化(非同一分布),此时 oracle 量变为 \( \hat{F}_0(t) = \frac{1}{m_0} \sum_{i \in \mathcal{H}_0} F_{0i}(t) \)(零分布的平均 c.d.f.)。核心洞察仍然成立:FDP 可以表达为 \( m_0 \cdot (1 - \hat{F}_0(t)) / \max(R(t), 1) \)。因此,问题从“建模依赖”简化为“估计平均零分布 \( \hat{F}_0(t) \)”。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在大规模多重假设检验中,当检验统计量存在未知依赖结构时,如何仅通过估计零假设检验统计量的经验累积分布函数(c.d.f.)来实现错误发现比例(FDP)的渐近控制。
  2. 核心工具/方法:提出 eFDP 方法,基于一个多元混合模型框架,通过非参数估计程序(核密度估计或经验 c.d.f. 的平滑版本)来估计零统计量的平均经验 c.d.f. \( \hat{F}_0(t) \),并构造一个渐近控制 FDP 的阈值选择程序。
  3. 主要结论:在正则条件下,eFDP 方法可以渐近地控制 FDP 在预设水平 \( \alpha \) 以下,且其功效(power)在强依赖下优于现有方法(如 BH、q 值、置换方法)。

关键设定与假设

  • 设定:\( m \) 个假设,每个假设对应一个检验统计量 \( T_i \)。零假设集合 \( \mathcal{H}_0 \) 未知,大小为 \( m_0 \)。零分布 \( F_{0i} \) 可以随 \( i \) 变化。检验统计量之间可以任意依赖。
  • 假设:
    1. 正则性条件:零分布 \( F_{0i} \) 是连续的,且其密度函数 \( f_{0i} \) 存在并满足一定的光滑性(如 Lipschitz 连续)。这是非参数估计收敛性的标准条件。
    2. 稀疏性条件:备择假设的比例 \( \pi_1 = m_1/m \) 趋于 0 或保持有界(即信号稀疏或中等密集)。这是为了确保从混合分布中分离零分布是可行的。具体地,作者假设 \( m_1 = o(m) \) 或 \( m_1 = O(m) \) 但信号足够强。
    3. 可识别性条件:零分布和备择分布在尾部有足够大的差异,使得零分布的经验 c.d.f. 可以从混合分布中识别。例如,假设在尾部区域,备择统计量比零统计量更倾向于取大值。
    4. 依赖结构:对依赖结构没有显式假设,但需要保证经验 c.d.f. 的收敛性(如通过某种形式的弱依赖或混合条件,但作者未明确给出,而是通过模拟验证了强依赖下的有效性)。相比已有文献:本文放宽了依赖结构假设(不要求独立、正依赖或特定因子模型),但强化了关于零分布光滑性和可识别性的假设。

主要结果

  • 定理 1(Oracle 场景):如果 oracle 量 \( \hat{F}_0(t) \) 已知,那么对于任意阈值 \( t \),FDP 可以精确计算。因此,可以构造一个阈值 \( t^* \) 使得 \( \text{FDP}(t^*) \le \alpha \) 成立(在离散化意义下)。这个定理是本文的理论基石,证明了“显式建模依赖不必要”。
  • 定理 2(eFDP 的渐近控制):在正则条件下,eFDP 方法估计的零分布平均 c.d.f. \( \hat{\hat{F}}_0(t) \) 以概率收敛到真实的 \( \hat{F}_0(t) \)。因此,基于 \( \hat{\hat{F}}_0(t) \) 构造的 FDP 估计 \( \widehat{\text{FDP}}(t) \) 也收敛到真实 FDP,从而 eFDP 程序可以渐近控制 FDP 在 \( \alpha \) 水平以下。技术难点:证明 \( \hat{\hat{F}}_0(t) \) 的收敛性需要处理依赖结构下的经验过程,作者通过假设某种形式的“弱依赖”或“混合”条件(未在定理陈述中明确给出,但在证明中用到)来绕过这一困难。
  • 模拟结果:在多种依赖结构(独立、弱相关、强相关、因子模型)下,eFDP 的 FDP 控制精度和功效均优于 BH、q 值、置换方法。特别地,在强依赖下,BH 和 q 值严重失控(FDP 远高于名义水平),而 eFDP 仍能保持控制。

证明路线与技术技巧

  • 整体路线:
    1. Oracle 结果:证明如果知道 \( \hat{F}_0(t) \),FDP 可精确控制。这一步是概念性的,不涉及统计推断。
    2. 估计 \( \hat{F}_0(t) \):这是核心。作者提出一个两步程序:
      • 步骤 A(筛选候选零假设):使用一个保守的初始阈值(如 BH 在非常宽松的水平下)筛选出一组“很可能为真”的假设,记为 \( \hat{\mathcal{H}}_0 \)。
      • 步骤 B(非参数估计):基于 \( \hat{\mathcal{H}}_0 \) 中的统计量,使用核密度估计或经验 c.d.f. 的平滑版本,估计平均零分布 \( \hat{F}_0(t) \)。这一步需要校正由于筛选引入的选择偏差。
    3. 渐近收敛性:证明 \( \hat{\hat{F}}_0(t) \) 一致收敛到 \( \hat{F}_0(t) \)。这依赖于:
      • 筛选步骤的准确性(\( \hat{\mathcal{H}}_0 \) 包含大部分真实零假设)。
      • 非参数估计的收敛速率(核密度估计的均方误差)。
      • 依赖结构下的经验过程理论(如通过“混合”条件或“弱依赖”假设来保证大数定律和中心极限定理)。
    4. FDP 控制:基于收敛的 \( \hat{\hat{F}}_0(t) \),构造 FDP 估计 \( \widehat{\text{FDP}}(t) \),并证明其渐近控制 FDP。
  • 关键跳跃点:
    • 从 oracle 到可估计:如何从混合分布中可靠地分离出零分布?作者通过“筛选+非参数估计”两步法,但筛选步骤引入的选择偏差是主要困难。作者通过假设筛选步骤的“一致性”(即 \( \hat{\mathcal{H}}_0 \) 中真实零假设的比例趋于 1)来绕过这一困难,但这一假设本身需要验证。
    • 依赖结构下的收敛性:在任意依赖下,经验 c.d.f. 可能不收敛(例如,所有统计量完全相关)。作者通过假设某种形式的“弱依赖”或“混合”条件来保证收敛性,但这些条件在定理陈述中并未明确列出,而是在证明中隐含使用。这是一个值得注意的 gap。
  • 技术技巧点名:
    • 核密度估计:用于平滑估计零分布密度。
    • 经验过程理论:用于证明经验 c.d.f. 的一致收敛性。
    • 选择偏差校正:通过“筛选后估计”的渐近理论(如“post-selection inference”的思想)来校正偏差。

真实例子与应用

  • 数据:一个高维乳腺癌基因表达数据集(来自 The Cancer Genome Atlas, TCGA),包含约 20,000 个基因的表达水平,样本量约 500。
  • 场景:寻找与乳腺癌亚型(如 Luminal A, Luminal B, Basal-like)显著差异表达的基因。
  • 方法应用:对每个基因,计算一个 F 统计量(或 ANOVA 统计量)来检验其在亚型间的均值差异。然后应用 eFDP 方法控制 FDP 在 0.05 水平。
  • 结果:eFDP 识别出约 1500 个显著基因,而 BH 方法(在相同 FDR 水平下)识别出约 1200 个。作者还展示了 eFDP 识别的基因在已知的乳腺癌相关通路中富集程度更高。
  • 这个例子想说明什么:验证 eFDP 在实际数据中的实用性,并展示其相比 BH 方法有更高的功效(识别出更多基因),同时保持 FDP 控制。

🔎 结论是否比证明窄

  • 是的。作者在引言和摘要中声称“无论依赖结构如何,FDP 控制都可以实现”,但证明中隐含了“弱依赖”或“混合”条件。对于极端依赖(如所有统计量完全相关),经验 c.d.f. 可能不收敛,eFDP 可能失效。作者在模拟中测试了强依赖(如因子模型),但未测试完全相关。因此,“无论依赖结构如何”这一 claim 比证明所覆盖的范围更宽。
  • 另一个窄化:渐近控制 vs. 有限样本控制。本文仅证明渐近控制,而 BH 和置换方法在有限样本下(在特定假设下)提供精确控制。作者未讨论这一 trade-off。

四、开放问题

  1. 有限样本保证:本文仅证明渐近控制。能否在有限样本下(如通过 concentration inequalities)给出 eFDP 的 FDP 控制保证?这需要更精细的依赖结构假设(如“弱依赖”的量化形式,如 \( \rho \)-mixing 或 \( \phi \)-mixing 系数)。扎根点:定理 2 的陈述中“asymptotic control”一词。
  2. 依赖结构的 minimax 下界:在任意依赖下,FDP 控制是否可能?是否存在一个 minimax 下界,表明在完全未知的依赖下,任何方法都无法同时控制 FDP 和保持功效?本文的 oracle 结果暗示“知道零分布即可”,但估计零分布本身可能受依赖结构影响。扎根点:引言中“highlighting that explicit modeling of dependence may be unnecessary”这一 claim 的边界。
  3. 经验分布估计的收敛速率:本文的非参数估计程序(核密度估计)的收敛速率是多少?是否依赖于依赖结构?能否达到 minimax 最优速率?这与用户熟悉的“非参数统计”和“高维渐近”工具直接相关。扎根点:定理 2 的证明中关于核密度估计收敛性的部分。
  4. 与随机矩阵理论的连接:在高维协方差估计中,随机矩阵理论提供了关于经验谱分布的精确结果。这些结果能否用于改进 eFDP 中零分布估计的精度,特别是在强依赖下?扎根点:引言中未引用任何随机矩阵理论文献,这是一个明显的 gap。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论