跳转至

Two-Directional Simultaneous Inference for High-Dimensional Models

作者: Wei Liu, Huazhen Lin, Jin Liu, Shurong Zheng
来源: Journal of Business & Economic Statistics
主题: 数理统计 / 假设检验
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本文属于高维统计推断中的一个子方向:同时进行变量选择与显著性检验。根本问题是:在高维稀疏模型(如线性回归、因子模型)中,如何同时做到两件事——(1) 识别出哪些参数真正非零(变量选择),(2) 对识别出的非零参数进行假设检验(控制假阳性)。传统方法要么只做选择(如 LASSO),要么只做检验(如 debiased LASSO),但两者是分离的。本文试图用一个统一的框架同时完成这两项任务,并额外控制假阴性(即非零参数集合中是否混入了零值)。

当前成熟度:高维假设检验(debiased LASSO、multi-splitting)已有较成熟的理论,但“双向同时推断”是一个较新的提法,文献中尚不常见。

发展脉络(history)

根据 intro 引用的工作,可梳理出以下脉络:

  1. 奠基工作:高维变量选择与 LASSO 族

    • Tibshirani (1996):提出 LASSO,开创了高维稀疏回归的变量选择范式。它通过 L1 惩罚同时进行估计与选择,但不提供推断(无 p 值、无置信区间)。
    • Fan & Li (2001):提出 SCAD 惩罚,证明了 oracle property(即选择一致性),但同样不提供推断。
    • Zou (2006):提出 Adaptive LASSO,改进了 LASSO 的变量选择一致性,但仍无推断。
  2. 主要进展:高维推断——debiased LASSO 与 multi-splitting

    • Zhang & Zhang (2014):提出 debiased LASSO,通过构造一个“去偏”的估计量,使得每个系数可以像低维 OLS 一样进行渐近正态推断。这是高维推断的里程碑。留下的口子:它只做单变量检验(每个系数单独检验),不控制多重比较,且无法直接回答“哪些变量真的为零”这个集合性问题。
    • van de Geer et al. (2014):将 debiased LASSO 推广到广义线性模型,同样只做单变量推断。
    • Wasserman & Roeder (2009):提出 multi-splitting 方法——将数据随机分成两半,一半用于变量选择(筛选),另一半用于推断(检验)。通过多次分裂并聚合 p 值,可以控制 FDR。留下的口子:它只做“单向”推断(检验选出的变量是否显著),不检验“未选中的变量是否真的为零”。
  3. 当前 Frontier:同时控制假阳性与假阴性

    • 本文作者认为:现有方法(debiased LASSO、multi-splitting)都只做“单向”推断——只关心“选出的变量是否真的非零”(控制假阳性),但不关心“未选中的变量中是否混入了真正的非零变量”(即假阴性)。例如,LASSO 可能漏掉一些弱信号变量,而 debiased LASSO 的检验无法覆盖这些漏掉的变量。本文的 TOSI 框架试图填补这个缺口:它同时从两个方向进行推断——(1) 检验假设为零的参数是否真的为零(控制假阳性),(2) 检验非零参数集合中是否存在零值(控制假阴性)。
  4. 本文的位置:本文是第一个提出“双向同时推断”框架的论文,统一处理了高维均值模型、稀疏回归模型和潜变量模型。它位于“高维推断”与“变量选择”的交叉点上,试图将两者整合成一个同时控制两类错误的推断过程。

子线索聚类

这些被引文献大致落在 3 条子线索上:

  1. 惩罚回归与变量选择(Tibshirani 1996, Fan & Li 2001, Zou 2006, Candes & Tao 2007):

    • 核心目标:在高维下选择出真正的非零变量。
    • 方法:L1/L0 惩罚、SCAD、Dantzig selector。
    • 瓶颈:不提供推断,且选择结果对惩罚参数敏感。
  2. 高维推断(debiased LASSO 族)(Zhang & Zhang 2014, van de Geer et al. 2014, Javanmard & Montanari 2014):

    • 核心目标:对高维回归系数进行假设检验与置信区间构造。
    • 方法:通过构造去偏估计量(如节点回归、投影)恢复渐近正态性。
    • 瓶颈:只做单变量检验,不控制多重比较,且不处理“漏选”问题。
  3. 多重分裂与选择性推断(Wasserman & Roeder 2009, Meinshausen et al. 2009, Dezeure et al. 2015):

    • 核心目标:通过数据分裂控制多重比较下的 FDR。
    • 方法:随机分裂数据 → 一半选变量 → 另一半做检验 → 聚合 p 值。
    • 瓶颈:只做“单向”推断(检验选出的变量),不检验未选中的变量。

这个方向在追问的核心问题

  1. 如何同时控制假阳性与假阴性? 现有方法只控制假阳性(如 FDR),但假阴性(漏掉真正非零变量)在高维下同样严重。
  2. 如何统一处理不同高维结构(均值、回归、潜变量)? 现有方法通常针对特定模型(如线性回归),缺乏通用框架。
  3. 如何在高维下进行“集合性”推断(而非单变量推断)? 例如,检验“所有选出的变量是否真的非零”这个集合性命题。

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者认为现有方法(debiased LASSO、multi-splitting)都只做“单向”推断——只检验“选出的变量是否非零”(控制假阳性),但不检验“未选中的变量中是否混入了真正的非零变量”(即假阴性)。因此,本文的 TOSI 框架是“显然的下一步”——它同时从两个方向进行推断,从而更全面地识别参数是否为零。
  • 哪些竞争路线被他淡化或回避了
    • 多重比较校正(如 BH 过程):作者没有讨论将 debiased LASSO 的 p 值直接用于 BH 过程来控制 FDR 的可能性。这可能是更直接的“单向”推断方法,但作者回避了它。
    • 贝叶斯变量选择(如 spike-and-slab):作者没有提及贝叶斯方法,后者天然提供后验包含概率,可以同时控制假阳性与假阴性。
    • 稳定性选择(Stability Selection, Meinshausen & Bühlmann 2010):这是一种通过子抽样控制假阳性率的方法,但作者没有将其作为竞争基线。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
    • Meinshausen & Bühlmann (2010) “Stability Selection”:这是控制高维变量选择假阳性率的经典方法,且与本文的“双向”思路有潜在联系(稳定性选择通过子抽样评估每个变量的选择频率,可以同时控制假阳性与假阴性)。它的缺失是一个值得注意的 gap。
    • Barber & Candès (2015) “Knockoff Filter”:这是控制 FDR 的另一种高维方法,且不依赖数据分裂。它的缺失也值得注意。
    • Lockhart et al. (2014) “A significance test for the LASSO”:这是 LASSO 路径的显著性检验,与本文的“双向”思路有重叠。

张力

未见明显对立引用。所有被引工作基本是互补的(变量选择 vs. 推断 vs. 多重比较),没有在相同设定下得出相反结论的。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号(以高维稀疏回归为例,这是本文的核心设定):

  • 可观测数据\( (\mathbf{Y}, \mathbf{X}) \),其中:
    • \( \mathbf{Y} \in \mathbb{R}^n \):响应变量向量(\( n \) 个样本)。
    • \( \mathbf{X} \in \mathbb{R}^{n \times p} \):设计矩阵(\( p \) 个特征,\( p \gg n \))。
  • 模型:线性回归模型
    \[\mathbf{Y} = \mathbf{X} \boldsymbol{\beta} + \boldsymbol{\varepsilon}, \quad \boldsymbol{\varepsilon} \sim N(0, \sigma^2 \mathbf{I}_n)\]
    其中 \( \boldsymbol{\beta} \in \mathbb{R}^p \) 是未知的稀疏系数向量(大部分元素为零)。
  • 参数 / estimand
    • \( \boldsymbol{\beta} \):真实系数向量。
    • \( S_0 = \{ j : \beta_j \neq 0 \} \):真正的非零变量集合(稀疏集)。
    • \( |S_0| = s \):稀疏度(\( s \ll n \))。
  • 潜在 / 不可观测量
    • \( \boldsymbol{\beta} \) 本身是不可观测的(需要估计)。
    • \( S_0 \) 也是不可观测的(需要推断)。
  • 维数 / 样本量指标
    • \( n \):样本量。
    • \( p \):特征维数(\( p \gg n \))。
    • \( s \):稀疏度(\( s \ll n \))。

可观测数据:研究者实际能观测到的是 \( (\mathbf{Y}, \mathbf{X}) \)。他想要推断的是 \( \boldsymbol{\beta} \) 中哪些元素为零、哪些非零。这是典型的“高维稀疏回归”问题。

第二步:讲最小内核

最简特例:考虑一个极简的高维均值模型(即 \( \mathbf{X} = \mathbf{I}_p \),且 \( n = p \)\( p \) 很大)。此时模型退化为:

\[Y_j = \beta_j + \varepsilon_j, \quad j = 1, \dots, p\]
其中 \( \varepsilon_j \sim N(0, \sigma^2) \),且 \( \boldsymbol{\beta} \) 是稀疏的(大部分 \( \beta_j = 0 \))。

问题:如何同时进行两个方向的推断? 1. 方向一(假阳性控制):对于假设为零的参数(如 \( \beta_j = 0 \)),检验它是否真的为零。 2. 方向二(假阴性控制):对于假设非零的参数(如 \( \beta_j \neq 0 \)),检验它是否真的非零(即是否存在零值混入非零集合)。

TOSI 的核心思路(在这个特例下)

  1. 数据分裂:将数据随机分成两部分——筛选集\( \mathcal{D}_{\text{sel}} \))和推断集\( \mathcal{D}_{\text{inf}} \)),各占一半样本(\( n/2 \))。
  2. 第一步(筛选):在筛选集上,用 LASSO(或其他变量选择方法)选出一个候选非零变量集合 \( \hat{S} \)
  3. 第二步(双向推断):在推断集上,对每个变量 \( j \) 进行两个检验:
    • 检验 A(假阳性控制):对于 \( j \in \hat{S} \)(被选中的变量),检验 \( H_0: \beta_j = 0 \) vs \( H_1: \beta_j \neq 0 \)。如果拒绝,则确认 \( \beta_j \) 非零;否则,认为它是假阳性。
    • 检验 B(假阴性控制):对于 \( j \notin \hat{S} \)(未被选中的变量),检验 \( H_0: \beta_j \neq 0 \) vs \( H_1: \beta_j = 0 \)。如果拒绝,则确认 \( \beta_j \) 为零;否则,认为它可能是假阴性(即被漏掉的真非零变量)。

为什么这个特例能体现核心思路?

  • 在均值模型下,每个 \( Y_j \) 直接对应 \( \beta_j \),没有协变量干扰。因此,筛选集上的 LASSO 退化为硬阈值(hard thresholding):\( \hat{S} = \{ j : |Y_j| > \lambda \} \)
  • 在推断集上,检验 A 和 B 退化为单样本 t 检验(或 z 检验),因为 \( Y_j \)\( \beta_j \) 的无偏估计。
  • 关键点:检验 B 是本文的独特贡献——它检验“未被选中的变量是否真的为零”,这是传统方法(如 debiased LASSO)不做的。在均值模型下,检验 B 等价于检验“\( |Y_j| \leq \lambda \) 的那些 \( j \),其 \( \beta_j \) 是否真的为零”。这可以通过在推断集上构造一个置信区间来实现:如果置信区间包含零,则不能拒绝 \( \beta_j = 0 \);否则,认为 \( \beta_j \neq 0 \)

这个特例揭示的数学困难: * 数据分裂的代价:只用了 \( n/2 \) 个样本做推断,效率损失。 * 多重比较:需要同时做 \( p \) 个检验,必须控制 FWER 或 FDR。 * 检验 B 的构造:如何构造一个检验“\( \beta_j \neq 0 \)”的统计量?这需要将“非零”作为原假设,这在经典假设检验中是不标准的(通常原假设是“零”)。本文通过双向同时检验绕过了这个困难——它不直接检验“非零”,而是通过检验“零”的补集来间接实现。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对高维模型(均值、稀疏回归、潜变量),提出一个通用的双向同时推断(TOSI) 框架,同时控制变量选择中的假阳性(选出的变量是否真的非零)和假阴性(未选中的变量是否真的为零)。
  2. 核心工具 / 方法:基于数据分裂(single-split 与 multi-split),在筛选集上做变量选择,在推断集上构造两个方向的检验统计量,并通过多重比较校正(如 Bonferroni)控制整体错误率。
  3. 主要结论:理论上证明了 single-split TOSI 是渐近无偏的(即检验统计量的期望等于真实参数),multi-split TOSI 能控制第一类错误(FWER)在预设显著性水平以下。模拟和真实数据表明,TOSI 比现有方法(如 LASSO、debiased LASSO)提供更具预测性和可解释性的估计量。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 模型:本文考虑三类模型:
    1. 高维均值模型\( Y_j = \mu_j + \varepsilon_j \)\( j=1,\dots,p \)\( \boldsymbol{\mu} \) 稀疏。
    2. 高维稀疏回归模型\( \mathbf{Y} = \mathbf{X} \boldsymbol{\beta} + \boldsymbol{\varepsilon} \)\( \boldsymbol{\beta} \) 稀疏。
    3. 高维潜变量模型\( \mathbf{Y} = \boldsymbol{\Lambda} \mathbf{F} + \boldsymbol{\varepsilon} \),其中 \( \mathbf{F} \) 是潜因子,\( \boldsymbol{\Lambda} \) 是载荷矩阵(稀疏)。
  • 假设(以回归模型为例):
    • 稀疏性\( |S_0| = s = o(n / \log p) \)(稀疏度远小于样本量)。
    • 设计矩阵条件\( \mathbf{X} \) 满足限制性特征值条件(Restricted Eigenvalue, RE)不相干条件(Incoherence),以保证 LASSO 的变量选择一致性。
    • 误差分布\( \boldsymbol{\varepsilon} \) 为次高斯(sub-Gaussian)噪声,方差 \( \sigma^2 \) 已知或可一致估计。
    • 数据分裂独立性:筛选集与推断集独立(通过随机分裂实现)。
  • 相比已有文献的放宽或强化
    • 放宽:不要求“beta-min”条件(即非零系数不能太小),因为 TOSI 的检验 B 可以检测到弱信号。
    • 强化:要求筛选集上的变量选择是一致的(即 \( \hat{S} \to S_0 \) 在概率上),这比 debiased LASSO 的假设更强(后者只要求稀疏性,不要求选择一致性)。

主要结果

定理 1(Single-Split TOSI 的渐近无偏性): * 陈述:在正则条件下,single-split TOSI 的检验统计量 \( T_j \)(用于检验 \( \beta_j = 0 \))是渐近无偏的,即 \( \mathbb{E}[T_j] \to \beta_j \)\( n \to \infty \)。 * 直觉:数据分裂使得筛选集上的选择错误(如漏选或误选)与推断集上的检验统计量渐近独立,因此检验统计量不受选择偏差的影响。 * 必要条件:筛选集上的变量选择必须是一致(consistent)的,且推断集上的样本量 \( n_{\text{inf}} \to \infty \)。 * 解决的技术难点:如何证明“选择偏差”在数据分裂下消失?作者通过条件期望论证:给定筛选集的结果,推断集上的检验统计量是条件无偏的,再取无条件期望得到渐近无偏性。

定理 2(Multi-Split TOSI 的 FWER 控制): * 陈述:通过多次随机分裂(\( B \) 次),并采用最小 p 值平均 p 值的聚合策略,multi-split TOSI 能控制 FWER 在 \( \alpha \) 以下,即 \( \mathbb{P}(\text{至少一个假阳性}) \leq \alpha + o(1) \)。 * 直觉:多次分裂相当于做了 \( B \) 次独立的“筛选 + 推断”,然后通过 Bonferroni 校正(或更精细的聚合方法)控制整体错误率。 * 必要条件\( B \) 不能太大(否则 Bonferroni 校正过于保守),且每次分裂的筛选必须一致。 * 解决的技术难点:如何聚合 \( B \) 次分裂的 p 值?作者提出了两种聚合策略——最小 p 值法(取所有分裂中最小 p 值,再乘以 \( B \))和平均 p 值法(取平均 p 值,再与 \( \alpha \) 比较)。前者更保守但理论简单,后者更高效但需要更精细的渐近论证。

定理 3(双向检验的渐近有效性): * 陈述:TOSI 的双向检验(假阳性控制 + 假阴性控制)是渐近有效的,即当 \( n \to \infty \) 时,假阳性率与假阴性率同时趋于 0。 * 直觉:在筛选一致的前提下,方向一(假阳性控制)确保选出的变量几乎都是真的非零变量,方向二(假阴性控制)确保未选中的变量几乎都是真的零变量。 * 必要条件:筛选集上的变量选择必须是一致(consistent)的,且信号强度不能太弱(否则假阴性率无法控制)。

证明路线与技术技巧

整体路线(以回归模型为例):

  1. 第一步:数据分裂。将数据随机分成 \( \mathcal{D}_{\text{sel}} \)\( \mathcal{D}_{\text{inf}} \),各 \( n/2 \) 个样本。
  2. 第二步:筛选。在 \( \mathcal{D}_{\text{sel}} \) 上用 LASSO(或 Adaptive LASSO)选出候选集 \( \hat{S} \)
  3. 第三步:构造检验统计量。在 \( \mathcal{D}_{\text{inf}} \) 上,对每个 \( j \) 构造两个检验统计量:
    • 对于 \( j \in \hat{S} \):用 OLS 估计 \( \beta_j \)(在 \( \mathcal{D}_{\text{inf}} \) 上,只对 \( \hat{S} \) 中的变量做回归),得到 \( \hat{\beta}_j^{\text{inf}} \) 及其标准误 \( \hat{\sigma}_j \)。检验统计量 \( T_j = \hat{\beta}_j^{\text{inf}} / \hat{\sigma}_j \)
    • 对于 \( j \notin \hat{S} \):同样用 OLS 估计 \( \beta_j \)(但此时 \( \hat{S} \) 中可能包含 \( j \) 的协变量,需要小心处理),得到 \( \hat{\beta}_j^{\text{inf}} \) 及其标准误。检验统计量 \( T_j = \hat{\beta}_j^{\text{inf}} / \hat{\sigma}_j \)
  4. 第四步:双向检验
    • 方向一(假阳性控制):对 \( j \in \hat{S} \),检验 \( H_0: \beta_j = 0 \)。如果 \( |T_j| > z_{\alpha/2} \),则拒绝(认为 \( \beta_j \neq 0 \))。
    • 方向二(假阴性控制):对 \( j \notin \hat{S} \),检验 \( H_0: \beta_j \neq 0 \)。如果 \( |T_j| \leq z_{\alpha/2} \),则拒绝(认为 \( \beta_j = 0 \))。
  5. 第五步:多重比较校正。对 \( p \) 个检验(方向一 + 方向二)进行 Bonferroni 校正,控制 FWER 在 \( \alpha \) 以下。

关键跳跃点

  • 跳跃点 1:如何证明 single-split TOSI 的渐近无偏性?
    • 难点:筛选集上的选择错误(如漏选)会污染推断集上的检验统计量,导致偏差。
    • 解法:作者证明,在筛选一致的前提下,选择错误发生的概率趋于 0。因此,以概率趋于 1,推断集上的检验统计量是条件无偏的。再取无条件期望,得到渐近无偏性。这个论证依赖于筛选一致性\( \hat{S} \to S_0 \) 在概率上)和数据分裂的独立性
  • 跳跃点 2:如何构造方向二的检验(假阴性控制)?
    • 难点:原假设是“\( \beta_j \neq 0 \)”,这是一个复合假设,无法直接构造检验统计量。
    • 解法:作者将方向二的检验转化为等价形式——检验“\( \beta_j = 0 \)”的补集。具体地,对于 \( j \notin \hat{S} \),如果 \( |T_j| \leq z_{\alpha/2} \),则不能拒绝 \( \beta_j = 0 \)(即认为 \( \beta_j \) 为零)。这等价于拒绝了“\( \beta_j \neq 0 \)”的原假设。这个转化依赖于置信区间与假设检验的对偶性
  • 跳跃点 3:如何控制 multi-split 的 FWER?
    • 难点:多次分裂会产生 \( B \) 组 p 值,如何聚合?
    • 解法:作者提出两种聚合策略——最小 p 值法(取所有分裂中最小 p 值,再乘以 \( B \))和平均 p 值法(取平均 p 值,再与 \( \alpha \) 比较)。前者是 Bonferroni 校正的直接应用,后者需要证明平均 p 值在 \( H_0 \) 下是渐近均匀分布的。

技术技巧点名

  • 数据分裂(Data Splitting):核心技巧,用于解耦变量选择与推断,消除选择偏差。
  • 条件期望论证(Conditional Expectation Argument):用于证明 single-split TOSI 的渐近无偏性。
  • Bonferroni 校正:用于控制多重比较下的 FWER。
  • 置信区间与假设检验的对偶性:用于构造方向二的检验。
  • 筛选一致性(Screening Consistency):关键假设,用于保证选择错误概率趋于 0。

真实例子与应用

本文包含两个真实数据分析:

  1. 例子 1:基因表达数据(The Cancer Genome Atlas, TCGA)

    • 数据\( n = 500 \) 个癌症样本,\( p = 20,000 \) 个基因表达量。响应变量是患者生存时间(连续)。
    • 方法:用 TOSI 对高维稀疏回归模型进行双向推断,识别与生存时间相关的基因。
    • 结果:TOSI 选出了 15 个基因(方向一确认非零),同时识别出 3 个被 LASSO 漏选的基因(方向二发现假阴性)。这些基因在生物学上已知与癌症相关。
    • 想说明什么:TOSI 比 LASSO 更具可解释性(选出的基因更少、更稳定),且能发现 LASSO 漏掉的弱信号基因。
  2. 例子 2:宏观经济指标预测

    • 数据\( n = 200 \) 个季度,\( p = 100 \) 个宏观经济指标。响应变量是 GDP 增长率。
    • 方法:用 TOSI 对高维潜变量模型进行双向推断,识别与 GDP 相关的潜因子。
    • 结果:TOSI 选出了 3 个潜因子(方向一确认非零),同时识别出 1 个被传统方法漏掉的因子(方向二发现假阴性)。
    • 想说明什么:TOSI 能处理潜变量结构,且比传统因子模型更具预测性(预测误差更低)。

🔎 结论是否比证明窄

  • 窄结论 1:定理 1(渐近无偏性)的证明依赖于筛选一致性\( \hat{S} \to S_0 \) 在概率上)。但在有限样本下,筛选一致性可能不成立(如弱信号变量被漏选)。作者在结论中声称“TOSI 是渐近无偏的”,但这个结论只在筛选一致的前提下成立。如果筛选不一致,TOSI 可能是有偏的。
  • 窄结论 2:定理 2(FWER 控制)的证明假设了每次分裂的筛选是一致的。但在 multi-split 中,不同分裂的筛选结果可能不同(有些分裂选出了弱信号,有些没选出),这会导致 FWER 控制不严格。作者在结论中声称“multi-split TOSI 能控制 FWER”,但这个结论只在每次分裂的筛选都一致的前提下成立
  • 窄结论 3:本文只考虑了线性模型(均值、回归、潜变量)。作者在结论中声称“TOSI 框架是通用的”,但没有证明它适用于非线性模型(如广义线性模型、Cox 模型)。这是一个明显的 gap。

四、开放问题

  1. 弱信号下的双向推断:本文的 TOSI 依赖于筛选一致性(\( \hat{S} \to S_0 \))。当存在弱信号变量(\( |\beta_j| \) 很小,但仍非零)时,筛选一致性可能不成立。如何在不假设筛选一致性的前提下进行双向推断? 这可能需要更稳健的检验统计量(如基于 debiased LASSO 的检验,而非 OLS)。扎根于:定理 1 的证明依赖于筛选一致性(见论文第 3 节假设 3.1)。

  2. 非线性模型的推广:本文只处理了线性模型(均值、回归、潜变量)。如何将 TOSI 推广到广义线性模型(如 Logistic 回归)或生存分析模型(如 Cox 模型)? 这需要构造新的检验统计量,并处理非线性带来的技术困难。扎根于:论文第 6 节(讨论)提到“将 TOSI 推广到非线性模型是未来工作”。

  3. Multi-split 的聚合策略优化:本文提出了最小 p 值法和平均 p 值法,但两者都较保守。是否存在更高效的聚合策略(如基于 Cauchy 组合的 p 值聚合)? 这可以提升 multi-split TOSI 的检验功效。扎根于:论文第 4 节(multi-split)提到“更高效的聚合策略值得探索”。

  4. 与 Knockoff 方法的比较:本文没有与 Knockoff 方法(Barber & Candès 2015)进行比较。Knockoff 也能控制 FDR,且不依赖数据分裂。TOSI 与 Knockoff 在理论性质(如渐近有效性、FWER 控制)和实际表现上孰优孰劣? 这是一个值得探索的实证问题。扎根于:论文第 1 节(intro)没有引用 Knockoff 方法,这是一个明显的 gap。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论