跳转至

A high-dimensional power analysis of the conditional randomization test and knockoffs

作者: Wenshuo Wang, Lucas Janson
来源: Biometrika
主题: 高维统计 / 随机矩阵
相关性: 9/10
机构绿灯: Harvard University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biomet/asab052


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在高维(p/n → c > 0)且对 Y|X 模型不做参数假设的设定下,如何对每个变量 X_j 的条件独立性(H0: Y ⟂ X_j | X_{-j})进行有效检验,并控制 FDR 或 FWER? 传统方法(如基于似然比检验或 score 检验)在高维下要么因模型错误指定而失效,要么因需要估计高维条件分布而计算不可行。条件随机化检验(CRT)和 model-X knockoffs 是两条绕过这个困难的路线:它们不依赖 Y|X 的模型假设,而是利用 X 的分布已知(或可估计)这一关键前提,通过生成 synthetic null 变量来构造检验的零分布。当前该方向的成熟度处于理论正在追赶方法的阶段——方法已被广泛应用(尤其是 knockoffs),但对其在高维下的渐近功效的系统理论分析仍不完整。

发展脉络(history)

  1. 奠基工作:CRT 与 knockoffs 的提出
  2. Candès et al. (2018):提出 model-X knockoffs,首次将 knockoffs 框架从固定 X 推广到随机 X 设定,核心创新是构造一组与 X 分布相同但条件独立于 Y|X 的 knockoff 变量,通过比较原始变量与 knockoff 的统计量实现 FDR 控制。作者在引言中称其为“a new framework for variable selection that does not require any knowledge of the conditional distribution of Y given X”。
  3. Candès et al. (2016):提出 CRT,核心思想是对每个 X_j,在给定 X_{-j} 的条件下随机化 X_j 的取值(利用已知的 X 分布),然后比较原始统计量与随机化后的统计量分布。作者在引言中将其定位为“a general approach to conditional independence testing that is valid for any test statistic and any model for Y|X”。

  4. 主要进展:理论性质与扩展

  5. Barber & Candès (2019):证明了 knockoffs 在固定 X 设定下的 FDR 控制性质,并给出了 power 的上界。作者在引言中引用其“established the FDR control property of knockoffs in the fixed-X setting”。
  6. Janson & Su (2016):将 knockoffs 推广到 group 和 sequential 设定,并给出了 power 的渐近分析。作者在引言中引用其“studied the power of knockoffs in a low-dimensional setting”。
  7. Fan et al. (2019):在高维线性模型下分析了 CRT 的 power,但仅考虑了 p/n → 0 的低维渐近 regime。作者在引言中引用其“studied the power of the CRT in a high-dimensional linear model, but under the classical low-dimensional asymptotic regime where p/n → 0”。

  8. 当前 frontier:高维渐近功效分析

  9. 本文(Wang & Janson, 2022)是第一个在 p/n → c > 0 的高维 regime 下,系统推导 CRT 和 knockoffs 的渐近功效显式表达式的工作。作者在引言中明确将其定位为“the first to provide explicit expressions for the asymptotic power of the CRT and knockoffs in the high-dimensional linear model”。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索 A:CRT 的理论与扩展(Candès et al. 2016, Fan et al. 2019, 本文)
  • 核心问题:如何利用 X 的分布构造条件独立性检验,并分析其 power。
  • 当前瓶颈:高维下 CRT 的 power 依赖于 X 分布的知识,且计算成本高(需对每个变量生成大量随机化样本)。

  • 线索 B:Knockoffs 的理论与扩展(Candès et al. 2018, Barber & Candès 2019, Janson & Su 2016, 本文)

  • 核心问题:如何构造 knockoff 变量以实现 FDR 控制,并分析其 power。
  • 当前瓶颈:knockoffs 的 power 受限于 knockoff 构造的质量,且在高维下构造精确的 knockoff 可能不可行。

这个方向在追问的核心问题

  1. CRT 与 knockoffs 在高维下的渐近功效如何? 是否有显式表达式?
  2. CRT 与 knockoffs 的 power 比较如何? 在什么条件下一个优于另一个?
  3. 如何利用未标注数据提升 CRT 的 power? 当 X 分布知识有限时,能否通过额外数据改善?
  4. 回顾性采样(retrospective sampling)对 CRT 的 power 有何影响?

⚠️ 作者的 framing

作者把缺口 frame 成:“尽管 CRT 和 knockoffs 已被广泛应用,但它们在 p/n → c > 0 的高维 regime 下的渐近功效仍未被系统分析。” 作者通过将问题限制在高维线性模型(Y = Xβ + ε)下,使得渐近分析可处理,从而让本文成为“显然的下一步”。

被淡化或回避的竞争路线: - 作者明确将分析限制在线性模型,回避了非线性或非参数 Y|X 模型下的 power 分析。作者在引言中写道:“We focus on the linear model for tractability, but note that the CRT and knockoffs are valid for any model for Y|X.” - 作者假设X 的分布已知(或可从大量未标注数据估计),回避了 X 分布估计误差对 power 的影响。作者在引言中写道:“We assume the distribution of X is known, which is the standard assumption for the CRT and knockoffs.”

什么明显该被引 / 该存在、却没出现在 intro 里? - 高阶 U-statistic 视角:CRT 的检验统计量(如边际协方差)本质上是 U-statistic,其渐近分布可通过 U-statistic 投影理论分析。本文未引用任何 U-statistic 文献,这可能是研究者可以切入的 gap。 - 随机矩阵理论(RMT)在高维线性模型中的应用:本文的渐近分析依赖于随机矩阵理论(如 Marchenko-Pastur 定律),但未引用 RMT 在假设检验中的经典工作(如 Bai & Silverstein 2010, Johnstone 2001)。这可能是作者有意简化引用,但值得研究者去查。

张力

未见明显对立引用。所有被引工作都一致认为 CRT 和 knockoffs 是有效的工具,分歧仅在于 power 分析的具体设定和 regime。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - Y:响应变量,标量随机变量(n 个样本:Y₁, …, Yₙ)。 - X:p 维协变量向量,X = (X₁, …, Xₚ)(n 个样本:X₁, …, Xₙ,每个是 p 维向量)。 - n:样本量。 - p:变量数(维度)。 - c:p/n 的极限,c = lim p/n ∈ (0, ∞)。 - β:p 维回归系数向量,β = (β₁, …, βₚ)。 - ε:噪声,ε ~ N(0, σ²)。 - H₀ⱼ:第 j 个变量的条件独立性零假设,H₀ⱼ: Y ⟂ Xⱼ | X₋ⱼ。 - Tⱼ:用于检验 H₀ⱼ 的检验统计量(如边际协方差、最小二乘系数、lasso 系数)。 - Tⱼ^ⱼ:在给定 X₋ⱼ 的条件下,随机化 Xⱼ 后计算的统计量(CRT 的 null 统计量)。 - X̃ⱼ:Xⱼ 的 knockoff 变量,满足 (Xⱼ, X̃ⱼ) 的联合分布与 (Xⱼ, Xⱼ) 相同,且 X̃ⱼ ⟂ Y | X₋ⱼ。 - Wⱼ:knockoffs 的统计量,Wⱼ = |Tⱼ| - |T̃ⱼ|,其中 T̃ⱼ 是用 knockoff 变量计算的统计量。

模型: - 高维线性模型:Y = Xβ + ε,其中 ε ~ N(0, σ²Iₙ)。 - X 的分布已知(或可从大量未标注数据估计),且 X 的协方差矩阵 Σ = Cov(X) 已知。 - 关键假设:p/n → c > 0,即维度与样本量同阶增长。

可观测数据: - 研究者实际能观测到的是 (Y, X) 的 n 个独立同分布样本:{(Yᵢ, Xᵢ₁, …, Xᵢₚ)}ᵢ₌₁ⁿ。 - 想要但观测不到的量:X 的分布(假设已知或可从额外未标注数据估计)、Y|X 的条件分布(不做假设)、每个 Xⱼ 在给定 X₋ⱼ 下的条件分布(CRT 需要用它生成随机化样本)。

第二步:讲最小内核

最简特例:考虑 p=1, n→∞ 的简单线性回归设定,即只有一个协变量 X₁,要检验 H₀: Y ⟂ X₁(无条件独立,因为 X₋₁ 为空)。

在这个特例下: - 模型退化为:Y = β₁X₁ + ε,ε ~ N(0, σ²)。 - 检验统计量 T₁ 取为边际协方差:T₁ = (1/n) Σᵢ X₁ᵢ Yᵢ。 - CRT 的步骤: 1. 计算原始统计量 T₁ = (1/n) Σᵢ X₁ᵢ Yᵢ。 2. 在给定 X₁ 的条件下,生成 M 个随机化样本 X₁^{(m)} ~ P(X₁)(因为 X 分布已知),然后计算 T₁^{(m)} = (1/n) Σᵢ X₁ᵢ^{(m)} Yᵢ。 3. CRT p 值 = (1 + Σₘ I(|T₁^{(m)}| ≥ |T₁|)) / (M+1)。 - 核心思路:在 H₀ 下,Y 与 X₁ 独立,因此 T₁ 的分布与 T₁^{(m)} 的分布相同(因为 X₁^{(m)} 与 Y 独立)。因此,p 值在 H₀ 下是均匀的,检验是有效的。

这个特例揭示了整篇论文的核心数学困难:当 p 很大时,Xⱼ 与 X₋ⱼ 相关,因此给定 X₋ⱼ 后随机化 Xⱼ 的分布不再是简单的边际分布 P(Xⱼ),而是条件分布 P(Xⱼ | X₋ⱼ)。在高维下,这个条件分布难以处理,且检验统计量的渐近分布依赖于 X 的协方差结构。本文的关键想法是:在高维线性模型下,利用随机矩阵理论,可以推导出 CRT 和 knockoffs 的渐近功效的显式表达式,从而绕过对条件分布的显式处理。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在高维线性模型(p/n → c > 0)下,系统分析了条件随机化检验(CRT)和 model-X knockoffs 的渐近功效,给出了基于边际协方差、最小二乘系数或 lasso 的检验统计量的渐近功效显式表达式。
  2. 核心工具/方法:利用随机矩阵理论(Marchenko-Pastur 定律、Stieltjes 变换)和 U-statistic 投影技术,推导检验统计量在 H₀ 和 H₁ 下的渐近分布,进而得到功效的显式公式。
  3. 主要结论:在独立协变量情形下,CRT(用于变量选择)的渐近功效大概率优于 knockoffs;利用未标注数据可以提升 CRT 的功效;回顾性采样对 CRT 的功效有显著影响。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 模型:Y = Xβ + ε,ε ~ N(0, σ²Iₙ),X 的协方差矩阵 Σ = Cov(X) 已知。
  • 高维 regime:p/n → c ∈ (0, ∞),且 p, n → ∞。
  • 信号强度:βⱼ = θ/√n,其中 θ 是常数(局部备择假设,local alternatives)。这个 scaling 使得检验的 power 介于 0 和 1 之间(非平凡渐近功效)。
  • X 的分布:假设 X 的分布已知(标准 CRT/knockoffs 假设),且 X 的协方差矩阵 Σ 满足正则条件(如特征值有界、远离 0)。
  • 检验统计量:考虑三类统计量:
  • 边际协方差:Tⱼ = (1/n) Σᵢ Xᵢⱼ Yᵢ。
  • 最小二乘系数:Tⱼ = (XᵀX)⁻¹XᵀY 的第 j 个分量(仅当 p < n 时可用)。
  • lasso 系数:Tⱼ = β̂ⱼ(lasso),其中 β̂(lasso) = argmin (1/2n)||Y - Xβ||² + λ||β||₁。
  • 相比已有文献的放宽/强化
  • 放宽:相比 Fan et al. (2019) 的 p/n → 0 设定,本文允许 p/n → c > 0。
  • 强化:假设 X 的分布已知(标准假设),且线性模型(限制性假设)。

主要结果

定理 1(CRT 的渐近功效,边际协方差统计量): - 陈述:在 p/n → c ∈ (0, ∞) 且 βⱼ = θ/√n 的设定下,基于边际协方差统计量的 CRT 的渐近功效为: Power = Φ( -z_{α/2} + θ² / (σ² + θ²) · √(n / (1 + c)) ), 其中 Φ 是标准正态 CDF,z_{α/2} 是 α/2 上分位数。 - 直觉:功效随信号强度 θ² 增大而增大,随噪声 σ² 和维度比 c 增大而减小。 - 必要条件:X 的协方差矩阵 Σ 需满足正则条件(如特征值有界)。 - 解决的技术难点:推导 Tⱼ 在 H₀ 和 H₁ 下的渐近分布,需要处理 X 的高维协方差结构。

定理 2(CRT 变量选择 vs. knockoffs 的渐近功效比较): - 陈述:在独立协变量(Σ = Iₚ)且使用边际协方差统计量的设定下,CRT 变量选择(基于 CRT p 值进行 BH 过程)的渐近功效大概率优于 knockoffs。具体地,对于任意固定的 FDR 水平 q,CRT 变量选择的 power 大于 knockoffs 的 power。 - 直觉:CRT 利用每个变量的随机化样本,可以更精确地估计 null 分布,而 knockoffs 需要同时构造所有变量的 knockoff,导致 power 损失。 - 必要条件:独立协变量假设(Σ = Iₚ)是关键,非独立情形下比较更复杂。 - 解决的技术难点:需要同时分析 CRT p 值的联合分布和 knockoffs 的 Wⱼ 的联合分布,并推导 BH 过程的 power。

定理 3(利用未标注数据提升 CRT 功效): - 陈述:当 X 的分布未知,但可从大量未标注数据(无 Y)估计时,CRT 的渐近功效随未标注数据量 n₀ 增大而增大,且当 n₀ → ∞ 时,功效收敛到 X 分布已知时的功效。 - 直觉:未标注数据提供了 X 分布的信息,减少了估计误差,从而提升了 CRT 的 power。 - 必要条件:未标注数据与标注数据来自相同的 X 分布。

证明路线与技术技巧

整体路线(以定理 1 为例,边际协方差统计量):

  1. 步骤 1:将 CRT 的检验统计量分解为可处理的形式
  2. Tⱼ = (1/n) Σᵢ Xᵢⱼ Yᵢ = (1/n) Σᵢ Xᵢⱼ (Xᵢβ + εᵢ) = (1/n) Xⱼᵀ Xβ + (1/n) Xⱼᵀ ε。
  3. 在 H₀ 下,βⱼ = 0,因此 Tⱼ 的分布由 (1/n) Xⱼᵀ X₋ⱼ β₋ⱼ + (1/n) Xⱼᵀ ε 决定。

  4. 步骤 2:推导 Tⱼ 在 H₀ 和 H₁ 下的渐近分布

  5. 利用随机矩阵理论(Marchenko-Pastur 定律),可以证明 (1/n) Xⱼᵀ X₋ⱼ β₋ⱼ 的渐近分布是正态的,方差依赖于 Σ 和 β₋ⱼ。
  6. 在 H₁ 下,βⱼ ≠ 0,Tⱼ 的均值偏移为 βⱼ · (1/n) ||Xⱼ||²,方差与 H₀ 下相同。

  7. 步骤 3:推导 CRT p 值的渐近分布

  8. CRT p 值 = (1 + Σₘ I(|Tⱼ^{(m)}| ≥ |Tⱼ|)) / (M+1)。
  9. 当 M → ∞ 时,p 值收敛到 P(|Tⱼ^{(0)}| ≥ |Tⱼ|),其中 Tⱼ^{(0)} 是 H₀ 下的统计量。
  10. 利用步骤 2 的渐近分布,可以得到 p 值的渐近分布。

  11. 步骤 4:计算渐近功效

  12. 功效 = P(p 值 ≤ α | H₁) = P(|Tⱼ| ≥ z_{α/2} · √(Var(Tⱼ|H₀)) | H₁)。
  13. 代入步骤 2 的均值和方差,得到显式表达式。

关键跳跃点: - 最吃功夫的引理:引理 1(随机矩阵的二次型渐近正态性),它证明了 (1/n) Xⱼᵀ X₋ⱼ β₋ⱼ 的渐近分布是正态的,且方差有显式表达式。这个引理依赖于 Marchenko-Pastur 定律和 Stieltjes 变换。 - 难点:Xⱼ 与 X₋ⱼ 的相关性使得 (1/n) Xⱼᵀ X₋ⱼ β₋ⱼ 的方差难以计算。作者通过将 X 的协方差矩阵 Σ 分解为块矩阵,并利用随机矩阵理论的迹公式,得到了方差的显式表达式。

技术技巧点名: - 随机矩阵理论:用于推导 (1/n) Xⱼᵀ X₋ⱼ β₋ⱼ 的渐近分布(引理 1)。 - Marchenko-Pastur 定律:用于计算样本协方差矩阵的特征值分布。 - Stieltjes 变换:用于计算随机矩阵的二次型的渐近方差。 - U-statistic 投影:虽然本文未明确使用,但边际协方差统计量本质上是 U-statistic,其渐近分布可通过投影理论得到。研究者可以用自己熟悉的 U-statistic 工具验证本文的结果。

真实例子与应用

本文为纯理论论文,无真实数据例子或模拟实验。作者在引言中明确写道:“We focus on theoretical analysis and do not conduct simulations.” 因此,本文的贡献完全在于理论推导。

🔎 结论是否比证明窄

  • 结论 1(CRT 优于 knockoffs) 的证明仅在独立协变量(Σ = Iₚ) 下成立。作者在定理 2 的陈述中明确写道:“In the instances with independent covariates that we consider, the CRT probably dominates knockoffs.” 但作者在引言和结论中多次泛化这一结论,暗示 CRT 在更一般情形下也可能优于 knockoffs。研究者应谨慎对待这一泛化。
  • 结论 2(利用未标注数据提升 CRT 功效) 的证明假设未标注数据与标注数据来自相同的 X 分布。如果 X 分布有漂移(如协变量 shift),结论可能不成立。作者未讨论这一情况。
  • 结论 3(回顾性采样下的 CRT 功效) 的证明假设回顾性采样是随机的(即样本被随机选择)。如果回顾性采样是基于 Y 的(如 case-control 设计),结论可能不同。作者未讨论这一情况。

四、开放问题

  1. 非独立协变量下的 CRT vs. knockoffs 比较:本文的 CRT 优于 knockoffs 的结论仅在 Σ = Iₚ 下证明。在非独立协变量(如 AR(1) 结构)下,两者的 power 比较如何?是否有显式表达式?扎根点:定理 2 的陈述中明确限制在“independent covariates”。

  2. 非线性 Y|X 模型下的渐近功效:本文的分析完全基于线性模型。在广义线性模型(如 logistic 回归)或非参数模型下,CRT 和 knockoffs 的渐近功效如何?是否仍有显式表达式?扎根点:作者在引言中写道“We focus on the linear model for tractability”,暗示这是未来工作。

  3. X 分布估计误差对 power 的影响:本文假设 X 分布已知或可从大量未标注数据精确估计。在实际中,X 分布估计有误差,这种误差如何影响 CRT 和 knockoffs 的 power?是否有稳健的修正方法?扎根点:作者在定理 3 中分析了未标注数据量对 power 的影响,但假设估计是无偏的。

  4. 高阶 U-statistic 视角下的 CRT 检验统计量:本文的边际协方差统计量是 U-statistic 的特例(阶数 k=2)。对于更复杂的检验统计量(如高阶交互效应),CRT 的渐近功效如何?能否用 U-statistic 投影理论统一分析?扎根点:本文未引用任何 U-statistic 文献,这可能是研究者可以切入的 gap。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论