跳转至

Generating knockoffs via conditional independence

作者: Emanuela Dreassi, Fabrizio Leisen, Luca Pratelli, Pietro Rigo
来源: Electronic Journal of Statistics
主题: 因果推断
相关性: 6/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向是高维变量选择中的 FDR(False Discovery Rate)控制,具体聚焦于 knockoff 方法。Knockoff 方法由 Barber & Candès (2015) 开创,其核心思想是:为每个原始变量 \(X_j\) 构造一个“副本” \(\tilde{X}_j\)(knockoff copy),使得 \((X, \tilde{X})\) 的联合分布满足某种交换性(swap property),从而在不知道真实响应 \(Y\) 的情况下,通过比较 \(X_j\)\(\tilde{X}_j\)\(Y\) 的关联强度来筛选重要变量,并严格控制 FDR。该方向当前成熟度较高,已有多种构造方法(如 Model-X knockoffs、Group knockoffs、Deep knockoffs),但构造的普适性与计算可行性之间的张力仍是核心瓶颈。

发展脉络(history)

  • 奠基工作:Barber & Candès (2015) 提出 knockoff 方法,用于线性模型中的 FDR 控制,要求 \(X\) 的协方差矩阵已知。Candès et al. (2018) 将其推广到任意模型(Model-X knockoffs),核心假设是 \(X\) 的分布已知(或可精确估计),构造 \(\tilde{X}\) 使得 \((X, \tilde{X})\) 的联合分布满足交换性。这是本文的直接起点。
  • 主要进展:后续工作聚焦于如何构造 \(\tilde{X}\)。例如,二阶矩方法(如 Gaussian knockoffs)假设 \(X\) 服从高斯分布,通过匹配协方差矩阵构造;Deep knockoffs(Romano et al., 2020)使用生成模型(如 GAN)近似构造;Group knockoffs(Dai & Barber, 2016)处理分组变量。但这些方法各有局限:高斯假设过强,深度方法缺乏理论保证,且构造的 \(\tilde{X}\) 往往没有闭式分布。
  • 当前 frontier:本文作者在 JSPI (2023) 中提出了一种新构造方法(NA),基于条件独立性假设:若 \(X_1,\ldots,X_p\) 在给定某个随机元素 \(Z\) 后条件独立,则 \(\tilde{X}\) 可直接通过条件分布构造,且 \((X, \tilde{X})\) 的联合分布有闭式表达。本文(Dreassi et al., 2024)进一步给出了 NA 的理论基础:任意分布可在全变差距离下被条件独立分布逼近,且 NA 型 knockoff 的充要条件是 \((X, \tilde{X})\) 可延拓为满足某种不变性的无穷序列。
  • 本文的位置:本文是 NA 方法的理论深化,回答了“何时 NA 适用”以及“NA 型 knockoff 的本质是什么”两个基础问题。它不提供新的算法或实证,而是为 NA 方法提供概率论与测度论层面的严格支撑。

子线索聚类

  1. 构造方法:包括 Gaussian knockoffs(Candès et al., 2018)、Deep knockoffs(Romano et al., 2020)、Group knockoffs(Dai & Barber, 2016)等。这些方法关注如何从数据中生成 \(\tilde{X}\),但往往需要强假设或缺乏闭式解。
  2. 理论分析:包括 knockoff 的 FDR 控制理论(Barber & Candès, 2015;Candès et al., 2018)、交换性条件与 de Finetti 定理的联系(本文)。这些工作关注 knockoff 的统计性质与存在性条件。
  3. 应用与扩展:包括高维变量选择、因果推断中的协变量筛选(如 Mediation analysis with knockoffs)、时间序列 knockoffs 等。本文属于理论分析子线索,但为构造方法提供了新思路。

这个方向在追问的核心问题

  1. 如何构造 \(\tilde{X}\) 使得 \((X, \tilde{X})\) 的联合分布满足交换性? 当前主流方法(如二阶矩匹配、深度生成模型)各有局限,NA 方法通过条件独立性假设提供了一种新途径。
  2. NA 方法何时适用? 即条件独立性假设在什么情况下成立或可被近似满足?本文的第一个结果(全变差逼近)部分回答了这个问题。
  3. NA 型 knockoff 的本质是什么? 即什么样的 \((X, \tilde{X})\) 可以通过 NA 构造?本文的第二个结果(de Finetti 定理刻画)给出了充要条件。
  4. NA 方法在实际高维问题中的逼近误差如何控制? 本文只给出了全变差逼近的存在性,但未给出误差界或收敛速度。

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将 NA 方法的适用性(条件独立性假设)视为一个“可被近似满足”的条件,通过全变差逼近定理表明:任意分布 \(\mu\) 都可以被一个条件独立分布 \(\mu_0\) 逼近,且当 \(\mu\) 绝对连续时逼近误差可忽略。这样,NA 方法就从一个“需要强假设”的方法变成了一个“普适但需近似”的方法。作者还通过 de Finetti 定理将 NA 型 knockoff 刻画为某种无穷可交换序列的投影,从而将其与经典概率论联系起来。
  • 哪些竞争路线被他淡化或回避了:作者未与 Gaussian knockoffs 或 Deep knockoffs 进行实证比较,也未讨论 NA 方法在高维(\(p \gg n\))场景下的计算可行性(条件分布 \(P(X_i \mid Z)\) 的估计本身就是一个高维问题)。此外,作者回避了“如何选择 \(Z\)”这一关键问题——\(Z\) 是随机元素,其维度和结构未指定,实际中如何构造 \(Z\) 使得条件独立性近似成立?这可能是 NA 方法从理论到应用的最大障碍。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 作者未引用任何关于“条件独立性检验”或“高维条件分布估计”的文献(如 Zhang et al., 2011 的 nonparametric conditional independence test;或 Bühlmann et al., 2014 的 high-dimensional conditional independence testing)。这些文献直接关系到 NA 方法中“如何验证或近似条件独立性”这一核心问题。此外,作者也未引用 Barber & Candès (2015) 关于 knockoff 构造的原始论文(只引了 Candès et al., 2018),这可能是一个遗漏。

张力

未见明显对立引用。所有被引工作(Candès et al., 2018;JSPI 2023 等)均支持或扩展了 knockoff 方法,未出现彼此矛盾或相反结论的情况。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \(X = (X_1, \ldots, X_p)\)\(p\) 维随机向量,代表原始变量(如基因表达量、协变量)。
  • \(\tilde{X} = (\tilde{X}_1, \ldots, \tilde{X}_p)\)\(X\) 的 knockoff 副本,满足交换性(swap property)。
  • \(Z\):一个随机元素(可以是随机变量、随机向量、随机过程等),取值于某个可测空间 \((\mathcal{Z}, \mathcal{A})\)\(Z\) 是 NA 方法的核心:给定 \(Z\) 后,\(X_1,\ldots,X_p\) 条件独立。
  • \(\mu\)\(X\) 的真实概率测度,定义在 \(\mathbb{R}^p\) 上。
  • \(\mu_0\):一个形如 \(\mu_0(A_1 \times \ldots \times A_p) = E\left[\prod_{i=1}^p P(X_i \in A_i \mid Z)\right]\) 的概率测度,其中 \(A_i \subseteq \mathbb{R}\) 是 Borel 集。\(\mu_0\)\(\mu\) 的“条件独立近似”。
  • \(d_{TV}(\mu, \mu_0)\)\(\mu\)\(\mu_0\) 之间的全变差距离。
  • \(X_i \in \{0,1\}\):一个特例,所有变量为二元变量。

  • 模型

  • 数据生成机制:\(X\) 来自某个未知分布 \(\mu\)。NA 方法假设存在一个随机元素 \(Z\),使得 \(X_1,\ldots,X_p\) 在给定 \(Z\) 后条件独立。即:
    \[P(X_1 \in A_1, \ldots, X_p \in A_p \mid Z) = \prod_{i=1}^p P(X_i \in A_i \mid Z).\]
  • 当此假设成立时,knockoff \(\tilde{X}\) 可通过以下方式构造:\(\tilde{X}_i\) 的条件分布(给定 \(Z\))与 \(X_i\) 相同,且 \(\tilde{X}_1,\ldots,\tilde{X}_p\) 在给定 \(Z\) 后也条件独立,并与 \(X\) 独立。这样,\((X, \tilde{X})\) 的联合分布有闭式表达。

  • 可观测数据

  • 研究者实际能观测到的是 \(X\) 的样本(如 \(n\) 个独立同分布的观测 \(X^{(1)}, \ldots, X^{(n)}\)),以及响应变量 \(Y\)(用于后续变量选择)。
  • 想要但观测不到的量\(Z\) 是潜在变量,不可观测。NA 方法假设 \(Z\) 存在,但实际构造中需要估计或近似 \(P(X_i \mid Z)\)。此外,\(\tilde{X}\) 是构造出来的,不是观测到的。

第二步:讲最小内核

最简特例\(p=2\),且 \(X_1, X_2\) 为二元变量(\(X_i \in \{0,1\}\))。这是本文明确给出的一个特例(见 abstract 最后一句)。

  • 设定:假设存在一个随机变量 \(Z\)(取值于某个空间),使得 \(X_1\)\(X_2\) 在给定 \(Z\) 后条件独立。即:

    \[P(X_1 = a, X_2 = b \mid Z) = P(X_1 = a \mid Z) \cdot P(X_2 = b \mid Z), \quad a,b \in \{0,1\}.\]
    \(p_i(z) = P(X_i = 1 \mid Z = z)\),则 \(X_i \mid Z \sim \text{Bernoulli}(p_i(Z))\)

  • NA 构造:给定 \(Z\),构造 \(\tilde{X}_1, \tilde{X}_2\) 如下:

  • \(\tilde{X}_i \mid Z \sim \text{Bernoulli}(p_i(Z))\),且 \(\tilde{X}_1, \tilde{X}_2\) 在给定 \(Z\) 后条件独立,并与 \(X_1, X_2\) 独立。
  • \((X, \tilde{X})\) 的联合分布为:

    \[P(X_1=a, X_2=b, \tilde{X}_1=c, \tilde{X}_2=d) = E\left[ \prod_{i=1}^2 p_i(Z)^{a_i}(1-p_i(Z))^{1-a_i} \cdot \prod_{i=1}^2 p_i(Z)^{c_i}(1-p_i(Z))^{1-c_i} \right],\]
    其中 \(a_i, c_i \in \{0,1\}\)。这是一个闭式表达式。

  • 交换性验证:需要验证 \((X, \tilde{X})\) 满足交换性:对于任意子集 \(S \subseteq \{1,2\}\),交换 \(X_j\)\(\tilde{X}_j\)\(j \in S\))后,联合分布不变。由于 \(X_i\)\(\tilde{X}_i\) 在给定 \(Z\) 后独立同分布,且 \(Z\) 是唯一的公共随机性来源,交换性自然成立。具体地,对于任意 \(a,b,c,d\),有:

    \[P(X_1=a, X_2=b, \tilde{X}_1=c, \tilde{X}_2=d) = P(X_1=c, X_2=b, \tilde{X}_1=a, \tilde{X}_2=d)\]
    等,因为乘积中 \(p_i(Z)\) 的指数只依赖于 \(a_i + c_i\),交换 \(a_i\)\(c_i\) 不改变和。

  • 核心思路:这个特例揭示了 NA 方法的本质——通过引入一个潜在变量 \(Z\) 来“解耦”变量之间的依赖关系。一旦 \(X_i\) 在给定 \(Z\) 后条件独立,knockoff 构造就简化为独立同分布采样(给定 \(Z\)),且交换性自动满足。本文的一般化工作就是把这个特例推广到任意分布(通过全变差逼近)和任意 \(p\)(通过 de Finetti 定理)。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了基于条件独立性假设的 knockoff 构造方法(NA)的理论基础,包括任意分布被条件独立分布逼近的可能性,以及 NA 型 knockoff 的充要条件。
  2. 核心工具 / 方法:全变差逼近(Theorem 1)、de Finetti 的部分可交换序列定理(Theorem 2)、以及条件分布显式公式(Proposition 1-3)。
  3. 主要结论:任意概率测度 \(\mu\) 可在全变差距离下被形如 \(\mu_0\) 的条件独立测度逼近(当 \(\mu\) 绝对连续时逼近误差可忽略);NA 型 knockoff 的充要条件是 \((X, \tilde{X})\) 可延拓为满足某种不变性的无穷序列;在二元变量等特殊情形下给出了 \(\tilde{X} \mid X\) 的条件分布显式公式。

关键设定与假设

  • 设定\(X\)\(\mathbb{R}^p\) 上的随机向量,\(\tilde{X}\) 是其 knockoff 副本。NA 方法的核心假设是:存在一个随机元素 \(Z\)(取值于某个可测空间 \((\mathcal{Z}, \mathcal{A})\)),使得 \(X_1,\ldots,X_p\) 在给定 \(Z\) 后条件独立。
  • 假设 1(Theorem 1)\(\mu\)\(\mathbb{R}^p\) 上的任意概率测度。无额外假设,但逼近误差 \(d_{TV}(\mu, \mu_0)\)\(\mu\) 绝对连续时为零(即 \(\mu = \mu_0\)),否则可能非零。
  • 假设 2(Theorem 2)\((X, \tilde{X})\)\(\mathbb{R}^{2p}\) 上的随机向量,且 \(\tilde{X}\)\(X\) 的 knockoff(即满足交换性)。无额外假设,但结论依赖于 de Finetti 定理,要求序列可延拓为无穷序列。
  • 假设 3(Proposition 1-3)\(X_i \in \{0,1\}\)(二元变量),或 \(X\) 服从某种特定分布(如高斯)。这些假设用于推导 \(\tilde{X} \mid X\) 的显式公式。
  • 相比已有文献:相比 Candès et al. (2018) 的 Model-X knockoffs(要求 \(X\) 的分布已知),NA 方法不要求 \(X\) 的分布已知,但要求条件独立性假设成立。相比 Gaussian knockoffs(要求 \(X\) 服从高斯分布),NA 方法更灵活,但需要构造 \(Z\)

主要结果

Theorem 1(全变差逼近): - 陈述:设 \(\mu\)\(\mathbb{R}^p\) 上的任意概率测度。则存在一个概率测度 \(\mu_0\),形如 \(\mu_0(A_1 \times \ldots \times A_p) = E\left[\prod_{i=1}^p P(X_i \in A_i \mid Z)\right]\)(其中 \(Z\) 是某个随机元素),使得 \(d_{TV}(\mu, \mu_0) \leq 1 - \int \prod_{i=1}^p f_i(x_i) \, d\mu(x)\),其中 \(f_i\)\(\mu\) 的某种条件密度。当 \(\mu\) 绝对连续时,\(d_{TV}(\mu, \mu_0) = 0\),即 \(\mu = \mu_0\)。 - 直觉:这个定理说,任何分布都可以被一个“条件独立”的分布逼近,逼近误差由 \(\mu\) 的“非条件独立性”程度决定。如果 \(\mu\) 本身是绝对连续的(即存在密度),那么它实际上就是条件独立的(因为绝对连续性意味着 \(X_i\) 之间没有确定性依赖,但注意:绝对连续并不等价于条件独立,这里需要仔细理解——作者实际上构造了一个特定的 \(\mu_0\),使得当 \(\mu\) 绝对连续时 \(\mu = \mu_0\),这意味着绝对连续分布必然满足某种条件独立性?这似乎是一个很强的结论,需要检查证明)。 - 必要条件:无,但逼近误差非零时,NA 方法只能近似使用。 - 解决的技术难点:如何构造 \(\mu_0\)?作者通过引入一个“辅助随机元素” \(Z\)(具体构造见证明)来实现。这个 \(Z\) 实际上是一个“随机化”版本,使得 \(X_i\) 在给定 \(Z\) 后条件独立。

Theorem 2(NA 型 knockoff 的刻画): - 陈述:设 \((X, \tilde{X})\)\(\mathbb{R}^{2p}\) 上的随机向量,且 \(\tilde{X}\)\(X\) 的 knockoff。则 \(\tilde{X}\) 可通过 NA 构造(即存在 \(Z\) 使得 \(X_1,\ldots,X_p\) 在给定 \(Z\) 后条件独立,且 \(\tilde{X}\) 由条件分布生成)当且仅当 \((X, \tilde{X})\) 可延拓为无穷序列 \((X^{(1)}, X^{(2)}, \ldots)\),使得该序列满足某种部分可交换性(partial exchangeability)。 - 直觉:这个定理将 NA 型 knockoff 与 de Finetti 定理联系起来。部分可交换性意味着序列的分布关于“交换某些坐标”不变,这与 knockoff 的交换性一致。NA 型 knockoff 本质上是这种无穷可交换序列的“有限截断”。 - 必要条件\((X, \tilde{X})\) 必须可延拓为无穷序列,这要求其分布满足某种一致性条件(类似于 Kolmogorov 扩展定理)。 - 解决的技术难点:如何将 de Finetti 定理应用于 knockoff 设定?作者需要定义一种新的部分可交换性概念,使得 \((X, \tilde{X})\) 的交换性对应于无穷序列中“交换第 \(i\) 个原始变量与其 knockoff”的不变性。

Proposition 1-3(条件分布显式公式): - 陈述:在 \(X_i \in \{0,1\}\)(所有变量为二元变量)的情形下,给出了 \(\tilde{X} \mid X\) 的条件分布显式公式。类似地,在 \(X\) 服从某种特定分布(如高斯)时也有显式公式。 - 直觉:这些公式使得 NA 方法在实际中可直接计算 \(\tilde{X}\),无需采样 \(Z\)。 - 必要条件\(X_i\) 的分布必须属于某个参数族(如 Bernoulli、Gaussian),且条件独立性假设成立。

证明路线与技术技巧

整体路线(Theorem 1): 1. 构造 \(\mu_0\):给定 \(\mu\),定义 \(Z\) 为某个“随机化”版本(具体地,\(Z\)\(X\) 的一个“随机化副本”,使得 \(X_i\) 在给定 \(Z\) 后条件独立)。作者通过引入一个辅助随机变量 \(U\)(均匀分布)来构造 \(Z\),使得 \(X_i\) 的条件分布 \(P(X_i \in \cdot \mid Z)\) 有显式形式。 2. 计算全变差距离:利用全变差距离的定义 \(d_{TV}(\mu, \mu_0) = \sup_A |\mu(A) - \mu_0(A)|\),将其转化为积分形式。 3. 上界估计:通过 Jensen 不等式或 Cauchy-Schwarz 不等式,得到 \(d_{TV}(\mu, \mu_0) \leq 1 - \int \prod_{i=1}^p f_i(x_i) \, d\mu(x)\),其中 \(f_i\)\(\mu\) 的某种条件密度。 4. 绝对连续情形:当 \(\mu\) 绝对连续时,\(f_i\) 可被选为 \(\mu\) 的真实条件密度,从而 \(\int \prod_{i=1}^p f_i(x_i) \, d\mu(x) = 1\),故 \(d_{TV}(\mu, \mu_0) = 0\)

整体路线(Theorem 2): 1. 定义部分可交换性:设 \((X^{(1)}, X^{(2)}, \ldots)\)\(\mathbb{R}^{2p}\) 上的无穷序列。定义其满足“部分可交换性”如果对于任意有限子集,交换某些坐标(如 \(X^{(j)}_i\)\(X^{(k)}_i\))后分布不变。 2. 应用 de Finetti 定理:部分可交换序列的分布可表示为混合分布:存在一个随机元素 \(Z\),使得序列在给定 \(Z\) 后独立同分布。 3. 联系 NA:将 \((X, \tilde{X})\) 视为无穷序列的前两项,则部分可交换性意味着 \(X\)\(\tilde{X}\) 在给定 \(Z\) 后条件独立且同分布,这正是 NA 构造的条件。 4. 反向推导:反之,若 \((X, \tilde{X})\) 由 NA 构造,则可将其延拓为无穷序列(通过重复采样 \(\tilde{X}\) 的副本),且该序列满足部分可交换性。

关键跳跃点: - Theorem 1 中 \(\mu_0\) 的构造:如何保证 \(\mu_0\) 是条件独立的?作者通过引入一个“随机化” \(Z\) 来实现,但 \(Z\) 的构造依赖于 \(\mu\) 的某种分解,这需要测度论技巧(如 Radon-Nikodym 导数)。 - Theorem 2 中 de Finetti 定理的应用:经典 de Finetti 定理适用于可交换序列(所有坐标可交换),但这里需要部分可交换性(只交换某些坐标)。作者需要推广 de Finetti 定理到部分可交换情形,或引用已有结果(如 Aldous-Hoover 定理)。

技术技巧点名: - 全变差距离:用于衡量 \(\mu\)\(\mu_0\) 的逼近误差。 - de Finetti 定理:用于刻画 NA 型 knockoff 的充要条件。 - 条件分布显式公式:通过积分变换或特征函数推导。 - 测度论技巧:如 Radon-Nikodym 导数、条件期望的构造。

真实例子与应用

本文为纯理论,无任何真实数据例子或模拟实验。所有结果均为概率论与测度论层面的定理与命题。作者在引言中提到了 NA 方法在 JSPI (2023) 中的应用,但本文本身不包含实证。

🔎 结论是否比证明窄

  • Theorem 1:结论说“任意 \(\mu\) 可被 \(\mu_0\) 逼近”,但证明中 \(\mu_0\) 的构造依赖于一个特定的 \(Z\),这个 \(Z\) 可能非常复杂(如高维随机变量),实际中难以计算。因此,结论的存在性很强,但实用性可能有限——作者没有给出 \(Z\) 的显式构造或逼近误差的收敛速度。
  • Theorem 2:结论说“NA 型 knockoff 等价于无穷可交换序列的投影”,但证明中假设 \((X, \tilde{X})\) 可延拓为无穷序列,这要求其分布满足一致性条件。对于有限样本,这个条件是否自动满足?作者没有讨论。
  • Proposition 1-3:这些显式公式只在二元变量或高斯等特例下成立,且要求条件独立性假设精确成立。在实际中,条件独立性往往只能近似满足,此时公式的误差如何?作者未讨论。

四、开放问题

  1. 逼近误差的收敛速度:Theorem 1 只给出了全变差距离的上界,但未给出收敛速度。对于高维问题(\(p\) 很大),逼近误差是否随 \(p\) 增长?能否得到 \(d_{TV}(\mu, \mu_0) = O(p^{-\alpha})\) 或类似结果?这扎根于 Theorem 1 的陈述:“The approximation is in total variation distance when \(\mu\) is absolutely continuous, and an explicit formula for \(\mu_0\) is provided.”——但未给出误差界。

  2. \(Z\) 的构造与选择:NA 方法的核心是 \(Z\),但本文未讨论如何在实际中构造 \(Z\)。对于高维数据,\(Z\) 的维度可能很大,如何选择 \(Z\) 使得条件独立性近似成立?这扎根于 NA 方法的定义:“\(X_1,\ldots, X_p\) should be conditionally independent given some random element \(Z\).”——但 \(Z\) 是抽象的。

  3. 条件独立性假设的检验:在实际应用中,如何检验 \(X_1,\ldots,X_p\) 是否在给定 \(Z\) 后条件独立?这扎根于本文未引用的文献(如条件独立性检验),但直接关系到 NA 方法的适用性。

  4. NA 方法与现有 knockoff 构造的实证比较:本文未提供任何模拟或真实数据比较。NA 方法在 FDR 控制、统计功效、计算效率等方面是否优于 Gaussian knockoffs 或 Deep knockoffs?这扎根于本文的引言:“NA has essentially three advantages: (i) To build \(\widetilde{X}\) is straightforward; (ii) The joint distribution of \((X,\widetilde{X})\) can be written in closed form; (iii) \(\widetilde{X}\) is often optimal under various criteria.”——但这些优势未在本文中验证。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论