跳转至

Testing independence and conditional independence in high dimensions via coordinatewise Gaussianization

讲者: Jing He
会场: High-Dimensional Independence and Nonparametric Testing Methods
报告题目: Testing Independence and Conditional Independence in High Dimensions via Coordinatewise Gaussianization
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

本文研究的根本问题是:在高维场景下(p, q 甚至 m 随样本量 n 增长),如何检验两个随机向量 X ∈ ℝ^p 与 Y ∈ ℝ^q 的独立性,以及给定第三个随机向量 Z ∈ ℝ^m 时的条件独立性。这是一个基础且应用广泛的统计推断问题,直接关联特征选择、因果发现、图模型结构学习等。当前该子方向的成熟度较高,已有大量方法,但多数方法对矩条件、分布假设或维度增长速率有较强限制,且没有一种方法在所有设定下占优。本文试图填补的缺口是:在无需矩条件、允许任意分量相依结构、允许维度指数增长的前提下,构造出在模拟中一致优于 13 种常用方法的检验。

发展脉络(history)

  • 奠基工作:独立性检验的早期工作可追溯至 Spearman (1904)、Pearson (1920)、Kendall (1938) 等对单变量情形的秩相关检验。Wilks (1935)、Hotelling (1936) 等在高斯或椭圆对称分布下处理固定维度的向量独立性。这些工作奠定了检验的基本框架,但局限于低维或强分布假设。
  • 主要进展(低维→高维):进入高维时代后,Székely et al. (2007) 提出距离相关(dCor),Székely and Rizzo (2013) 给出高维 t 检验,Zhu et al. (2020) 和 Gao et al. (2021) 进一步研究了高维距离相关的渐近分布。Gretton et al. (2008) 提出基于 Hilbert-Schmidt 独立性准则(HSIC)的核方法,Pfister et al. (2018) 将其推广到多向量联合独立性。这些方法通常要求矩条件(如二阶矩存在)。为缓解矩限制,Zhu et al. (2017) 提出投影相关(Pcor),Heller et al. (2013)、Shi et al. (2022)、Deb and Sen (2023) 等发展了基于秩的方法。在条件独立性方面,Shah and Peters (2020) 提出广义协方差度量(GCM),基于残差协方差,但要求 Z 的维度固定且需要矩条件;Wang et al. (2015) 提出条件距离相关;Strobl et al. (2019) 提出随机化核条件独立性检验(RCIT/RCoT)。这些方法各有局限:矩条件、维度限制、或对重尾数据失效。
  • 当前 frontier 与本文位置:本文作者认为,现有方法“none of them is predominately better than the others”(引言原话)。本文的定位是:提出一种基于坐标高斯化的新检验,它不需要任何矩条件(因此可处理重尾分布),允许 X、Y 的分量间任意相依结构,且允许 p、q 以样本量的指数速率发散(对条件独立性,Z 的维度以多项式速率发散)。作者通过大规模模拟(13 种对比方法)宣称新方法一致优于所有对比方法。这一 claim 的强度很高,但需注意:检验的是必要条件(协方差为零),而非充分条件,因此当 U、V 非联合正态时,可能存在 U⫫V 但协方差非零的情形(此时检验有 power),也可能存在 U̸⫫V 但协方差为零的情形(此时检验无 power)。作者在 Remark 2 中承认了这一点,并提到可通过选择其他度量(如高阶矩)来应对,但本文未深入。

子线索聚类

被引文献大致落在以下 2-4 条子线索上:

  1. 坐标高斯化(非参数正态化)方法:Liu et al. (2009) 用于高维非参数图模型(nonparanormal),Xue and Zou (2012) 用于秩估计,Mai and Zou (2015) 用于充分降维,Mai et al. (2023) 给出理论保证。本文直接继承这一工具,将其用于检验问题。
  2. 高维独立性检验:包括基于距离相关(Székely et al. 2007; Székely and Rizzo 2013; Zhu et al. 2020; Gao et al. 2021)、HSIC(Gretton et al. 2008; Pfister et al. 2018)、投影相关(Zhu et al. 2017)、秩方法(Heller et al. 2013; Shi et al. 2022; Deb and Sen 2023)等。本文的独立性检验属于这一簇,但通过坐标高斯化绕过了矩条件。
  3. 高维条件独立性检验:包括 GCM(Shah and Peters 2020)、条件距离相关(Wang et al. 2015)、核方法(Fukumizu et al. 2008; Zhang et al. 2011; Strobl et al. 2019)、投影方法(Zhou et al. 2022)等。本文的条件独立性检验属于这一簇,但使用坐标高斯化后的残差,并允许 m 发散。
  4. 高维高斯逼近与乘子 bootstrap:Chernozhukov et al. (2017) 的高维 CLT 和 bootstrap 理论是本文统计量 null 分布逼近的基础。Chang et al. (2024a) 推广到相依数据。本文的乘子 bootstrap 直接应用了这些结果。

这个方向在追问的核心问题

  • 核心问题 1:如何在高维且重尾分布下,构造既能控制 size 又具有良好 power 的独立性/条件独立性检验?
  • 核心问题 2:检验统计量应基于哪种依赖度量(协方差、距离相关、核度量、互信息等)?不同度量对矩条件、维度增长速率、计算复杂度的 trade-off 如何?
  • 核心问题 3:对于条件独立性,如何有效消除 Z 的影响?非参数回归(如神经网络)与参数回归(如线性模型)的适用场景和理论保证如何?
  • 核心问题 4:如何在高维下逼近检验统计量的 null 分布?高斯逼近、bootstrap、置换检验各自的适用条件和精度如何?

当前主流方法与已知瓶颈:主流方法包括距离相关、HSIC、GCM、秩方法等。瓶颈在于:(i) 多数方法要求矩条件(如二阶矩存在),对重尾分布失效;(ii) 许多方法要求 p,q 固定或增长较慢(如多项式速率);(iii) 条件独立性检验中,Z 的维度通常要求固定或很小;(iv) 没有一种方法在所有设定下占优。

⚠️ 作者的 framing

作者将缺口 frame 为:现有方法“none of them is predominately better than the others”,而本文提出的方法“uniformly outperform the 13 frequently used tests in the extensive simulation studies”。作者通过坐标高斯化消除了矩条件,通过 L∞ 型统计量和乘子 bootstrap 实现了高维指数增长下的 size 控制。作者淡化了“检验的是必要条件”这一事实,但通过模拟显示在多种非线性依赖下仍有高 power。作者回避了与一致检验(如基于距离相关或 HSIC 的检验)的直接理论比较——那些检验在充分条件下是相合的,而本文的检验不是。作者也没有讨论当 U,V 非联合正态且协方差为零但存在高阶依赖时,本文检验的 power 会如何(模拟中未覆盖此类情形)。

什么明显该被引/该存在、却没出现在 intro 里? 作者没有引用关于“高维协方差矩阵检验”的经典工作(如 Cai, Liu, Xia 等关于稀疏协方差矩阵的检验),尽管本文的统计量本质上是检验协方差矩阵的无穷范数。此外,关于“条件独立性检验的 hardness”结果(如 Shah and Peters 2020 中关于无假设下不可能性的讨论)被引用了,但作者没有深入讨论本文方法在哪些条件下能绕过 hardness(因为本文检验的是必要条件,而非充分条件)。另外,关于“坐标高斯化”的早期理论工作(如 van der Waerden 检验)未被提及。

张力

被引工作之间未见明显对立结论,但存在不同假设下的互补关系。例如,距离相关方法要求矩条件,秩方法不要求矩但可能损失效率;GCM 要求 m 固定,本文允许 m 发散。这些差异构成了本文的动机。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • X ∈ ℝ^p, Y ∈ ℝ^q, Z ∈ ℝ^m:三个随机向量,其联合分布未知。
  • (X_i, Y_i, Z_i), i=1,…,n:i.i.d. 样本。
  • F_{X,j}(·), F_{Y,k}(·), F_{Z,l}(·):各分量的边缘分布函数(假设连续)。
  • U_j = Φ^{-1}(F_{X,j}(X_j)), V_k = Φ^{-1}(F_{Y,k}(Y_k)), W_l = Φ^{-1}(F_{Z,l}(Z_l)):坐标高斯化后的随机变量,服从标准正态分布 N(0,1)。U = (U_1,…,U_p)^T, V = (V_1,…,V_q)^T, W = (W_1,…,W_m)^T。
  • 可观测数据:{(X_i, Y_i, Z_i)}{i=1}^n。U_i, V_i, W_i 不可直接观测,需通过经验分布函数估计:\hat{U}{i,j} = Φ^{-1}( n \hat{F}{X,j}(X{i,j})/(n+1) ),其中 \hat{F}{X,j} 是经验分布函数。类似定义 \hat{V}{i,k}, \hat{W}_{i,l}。
  • 参数/estimand:独立性检验的 null 假设 H0: X⫫Y,等价于 U⫫V(因为变换是严格单调的)。条件独立性 H0: X⫫Y|Z,等价于 U⫫V|W。
  • 维数指标:p, q, m 可随 n 增长;d = pq 是独立性检验中协方差向量的维数。
  • 潜在量:U, V, W 是潜在的正态化变量,不可直接观测,只能通过估计得到。

  • 模型:无参数模型,仅假设所有边缘分布连续。对于条件独立性检验,额外假设回归函数 f_j(w) = E(U_j|W=w) 和 g_k(w) = E(V_k|W=w) 属于某种光滑函数类(如 (ϑ,C)-光滑广义层次交互模型,或线性模型)。

  • 可观测数据:研究者实际能观测到的是 (X_i, Y_i, Z_i)。通过它们可以计算 \hat{U}_i, \hat{V}_i, \hat{W}_i(基于经验分布函数)。想要但观测不到的是真实的 U_i, V_i, W_i,以及条件独立性检验中的残差 ε_i = U_i - f(W_i), δ_i = V_i - g(W_i)。这些只能通过估计得到。

第二步:最小内核

最简特例:p = q = 1, m = 0(即无条件独立性检验,且 X, Y 都是一维)。此时问题退化为检验两个一维连续随机变量 X 和 Y 是否独立。

  • 设定:X, Y 连续,边缘分布 F_X, F_Y 连续。变换后 U = Φ^{-1}(F_X(X)), V = Φ^{-1}(F_Y(Y)),则 U, V ~ N(0,1)。H0: X⫫Y 等价于 U⫫V,也等价于 E(UV) = 0(因为 U,V 独立当且仅当协方差为零,在联合正态下成立,但这里 U,V 边缘正态但不一定联合正态;然而在 H0 下,U,V 独立,所以协方差为零是成立的)。
  • 可观测数据:{(X_i, Y_i)}_{i=1}^n。计算 \hat{U}_i = Φ^{-1}( n \hat{F}_X(X_i)/(n+1) ), \hat{V}_i = Φ^{-1}( n \hat{F}_Y(Y_i)/(n+1) )。
  • 检验统计量:H_n = √n | (1/n) ∑_{i=1}^n \hat{U}_i \hat{V}_i |。这是 L∞ 型统计量在 d=1 时的特例。
  • 核心思路:在 H0 下,真实的 U_i, V_i 独立,因此 (1/√n)∑ U_i V_i 渐近 N(0,1)。但由于 U_i, V_i 未知,需用 \hat{U}_i, \hat{V}_i 代替。坐标高斯化的误差控制(Lemma 1-3)保证这种替代的误差是 o_p(1)。然后,通过高斯逼近(Chernozhukov et al. 2017)或乘子 bootstrap 得到临界值。
  • 为什么这是最小内核:整篇论文的独立性检验就是把这个特例推广到 p,q 任意大,统计量变为 √n max_{j,k} | (1/n)∑ \hat{U}{i,j} \hat{V}{i,k} |。所有理论证明的核心就是处理高维最大值的逼近以及坐标高斯化带来的估计误差。条件独立性检验则是在此基础上增加回归步骤。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在高维场景下(p,q 可指数增长,m 可多项式增长),检验两个随机向量的独立性以及给定第三个向量时的条件独立性,且要求方法不依赖矩条件、允许任意分量相依结构。
  2. 核心工具/方法:先对每个分量进行坐标高斯化(边缘分布变换到标准正态),然后基于变换后向量的样本协方差矩阵的 L∞ 范数构造检验统计量;对于条件独立性,先通过神经网络(非参数)或 Lasso(线性)回归消除 Z 的影响,再对残差做同样的 L∞ 检验;临界值通过乘子 bootstrap 计算。
  3. 主要结论:理论上证明了在适当条件下,独立性检验和两种条件独立性检验的 size 能被名义显著性水平控制(Theorem 1, 3, 5),且在局部备择下 power 趋于 1(Theorem 2, 4, 6);乘子 bootstrap 的渐近有效性(Theorem 7)。模拟中,新方法在 13 种对比方法中表现最优,尤其对重尾数据和高维情形。

关键设定与假设

  • 独立性检验(Section 3)
  • 假设所有边缘分布连续(保证坐标高斯化是严格单调的)。
  • 无矩条件要求。
  • 允许 p,q 以指数速率增长:log d ≪ n^{1/8} (log n)^{-1/4}(Proposition 1 的条件),但 Theorem 1 简化为 p ≲ n^{κ1}, q ≲ n^{κ2}。
  • 不需要对 U,V 的联合分布做任何假设(检验的是必要条件)。
  • 条件独立性检验——非参数回归(Section 4.1)
  • 回归函数 f_j, g_k 属于 (ϑ,C)-光滑广义层次交互模型(Condition 1),该模型覆盖加法模型、单指标模型、交互模型等。
  • 使用分层神经网络(Bauer and Kohler 2019)估计回归函数,网络参数有特定选择。
  • 样本分割:D1(估计边缘分布)、D2(估计回归函数)、D3(计算检验统计量),大小分别为 n1≍n, n2≍n, n3≍n^κ (κ∈(0,1))。
  • 允许 p,q 指数增长,m 多项式增长,但 m 的增长率受限于 (20) 式,例如 m ≪ n^{ϑ{4ϑ/(4ϑ+m*) - κ}/ϱ} 等。
  • 条件独立性检验——线性回归(Section 4.2)
  • 假设 (U,V,W) 的回归是线性的(模型 (9)),且误差项满足次高斯性(Condition 2(i))。
  • 使用 Lasso 估计回归系数,要求稀疏性 s ≪ n^{1/5} (log n)^{-1/2}(Theorem 6 的条件)。
  • 允许 p,q,m 均指数增长(log \tilde{d} ≪ n^{1/10} (s log n)^{-1/2} 等)。
  • 相比非参数版本,线性版本对 m 的增长限制更宽松(指数级 vs 多项式级),但要求线性假设。

主要结果

  • Theorem 1(独立性检验 size):在 H0 下,若 p≲n^{κ1}, q≲n^{κ2},则 P(H_n > \hat{cv}_{ind,α}) → α。证明依赖于 Proposition 1(高斯逼近)和坐标高斯化误差控制。
  • Theorem 2(独立性检验 power):在 H1 下,若 |E(U_i V_i^T)|_∞ ≥ C n^{-1/2} (log d)^{1/2} log n,则 power → 1。该条件表明备择信号需超过某个阈值。
  • Theorem 3(条件独立性非参数回归 size):在 Condition 1 和 m 的增长率限制下,P(\tilde{G}n > \hat{cv}{cind,α}) → α。
  • Theorem 4(条件独立性非参数回归 power):若 |E(ε_i δ_i^T)|_∞ ≥ C n^{-κ/2} (log d)^{1/2},则 power → 1。
  • Theorem 5(条件独立性线性回归 size):在 Condition 2 和稀疏性 s≪n^{1/5}(log n)^{-2} 下,P(\hat{G}n > \hat{cv}^*{cind,α}) → α。
  • Theorem 6(条件独立性线性回归 power):若 |E(ε_i δ_i^T)|_∞ ≥ C n^{-1/2} (log \tilde{d})^{1/2} log n,则 power → 1。
  • Theorem 7(乘子 bootstrap 有效性):使用 Mammen 或 Rademacher 乘子的 bootstrap 分布能一致逼近 null 分布。

证明路线与技术技巧

独立性检验的证明路线(以 Theorem 1 为例): 1. 坐标高斯化误差控制:将 \hat{U}{i,j} \hat{V}{i,k} 分解为 U_{i,j} V_{i,k} 加上若干误差项(Lemma 1-3)。误差项包括截断误差(|U|>M1)、线性化误差(泰勒展开)、高阶项等。通过选择截断阈值 M1 = √(κ1 log n) 和 M2 = √(κ2 log n),并利用 DKW 不等式、Bernstein 不等式、decoupling inequality 等,证明这些误差项在适当的 log d 条件下是 o_p(1)。 2. 高斯逼近:在 H0 下,真实 U,V 独立,因此 (1/√n)∑ U_i ⊗ V_i 的 L∞ 范数可以用高斯向量 ξ ~ N(0, Σ) 的 L∞ 范数逼近(Chernozhukov et al. 2017, Proposition 2.1),误差为 O_p(n^{-1/6} log^{7/6}(dn))。 3. 协方差矩阵估计误差:证明 \hat{Σ} 与 Σ 的无穷范数差是 o_p(1)(Lemma 4),从而条件高斯分布 N(0, \hat{Σ}) 与 N(0, Σ) 的 L∞ 分位数之差可忽略(通过 Nazarov 不等式和 Lemma 3.1 of Chernozhukov et al. 2013)。 4. 综合:结合以上三步,得到 sup_z |P(H_n > z) - P(|\hat{ξ}|_∞ > z | data)| = o_p(1),进而 size 控制。

关键跳跃点: - 坐标高斯化误差的精细控制:需要处理 \hat{U}{i,j} - U{i,j} 的 U 统计量结构,利用 decoupling 和 Bernstein 不等式得到最优速率。 - 截断参数 M1, M2 的选择:需要平衡截断偏差和方差,最终选择 κ1=48/35, κ2=4/7 等以最大化允许的 log d 增长速率。 - 条件独立性非参数回归的误差控制:需要神经网络估计的收敛速率(Bauer and Kohler 2019)以及样本分割技巧,证明回归误差对检验统计量的影响可忽略。

技术技巧点名: - empirical process / chaining:用于控制 \hat{U}{i,j} - U{i,j} 的 U 统计量(Lemma 1 的证明中使用了 decoupling inequality 和 Giné et al. 2000 的指数不等式)。 - 高阶 U-统计量展开:在 Lemma 5 中,将 \hat{U}{i,j} \hat{V}{i,k} - U_{i,j} V_{i,k} 展开为线性项加高阶项。 - Stein's method / 高斯逼近:Chernozhukov et al. 2017 的高维 CLT。 - 乘子 bootstrap:使用 Rademacher 或 Mammen 乘子生成 bootstrap 样本,避免直接模拟高维正态。 - 神经网络回归:Bauer and Kohler (2019) 的分层神经网络,用于估计非参数回归函数。 - Lasso 回归:用于线性模型下的条件独立性检验,需要稀疏性条件。 - 样本分割:将样本分为三部分,分别用于估计边缘分布、回归函数和计算检验统计量,以简化理论分析。

真实例子与应用

论文在 Section 7 进行了大量模拟,但没有提供真实数据例子。作者在摘要和引言中提到“a real data application”,但正文中仅说“relegated to the supplementary material”。因此,本文为纯理论+模拟,无实证例子。模拟部分设计了 10 个例子(5 个独立性,5 个条件独立性),覆盖了线性/非线性、重尾/轻尾、稀疏/非稀疏备择等场景,并与 13 种对比方法比较。结果(Table 1, 2)显示本文方法(尤其 Rademacher 乘子)在 size 控制和 power 上普遍优于对比方法,尤其在重尾数据下对比方法常返回无效结果(NA)。

🔎 结论是否比证明窄

  • 论文的独立性检验理论上只检验了协方差为零这一必要条件,但作者在 Remark 2 中承认“|E(UV^T)|_∞ may be equal to zero when U̸⫫V”,并提到可通过选择其他度量(如高阶矩)来应对,但本文未给出具体方法或理论。因此,结论(power 保证)实际上只针对协方差非零的备择,而模拟中覆盖的备择大多使协方差非零,但未覆盖协方差为零但存在高阶依赖的情形。
  • 条件独立性检验的非参数版本(Theorem 3-4)要求 m 的增长率受限于复杂的条件(20),且依赖于神经网络估计的收敛速率,这些条件在实际中难以验证。线性版本(Theorem 5-6)则要求线性假设和稀疏性,这些假设可能过于严格。
  • 论文的模拟中,对于条件独立性,当 n=100 时,非参数版本(CI-FNN)的 size 控制较差(如 Gaussian 乘子下 size 仅 0.3%),作者解释为神经网络需要大量样本。这暗示了理论条件(n3≍n^κ)在有限样本下可能不充分。

四、开放问题

  1. 检验充分性的缺失:本文检验的是协方差为零这一必要条件,而非充分条件。当 U,V 非联合正态时,可能存在 U̸⫫V 但协方差为零的情形(如 U 和 V 是独立的但具有非线性依赖?实际上独立则协方差必为零,但反过来不成立)。作者在 Remark 2 中提及可考虑其他度量(如高阶矩),但未给出具体方法。扎根点:Remark 2 最后一句“we may consider to choose a different measure such that U⫫V if and only if this measure between U and V equals to zero. See Section R.1 in the supplementary material for details.” 这是一个明确的开放问题:能否构造一个基于坐标高斯化的充分检验(如同时检验所有阶矩)?这需要处理高维多重检验问题。

  2. 条件独立性检验中回归方法的选择:本文提供了两种回归方法(神经网络和 Lasso),但未给出如何在实际中自动选择的方法。神经网络需要大量样本且调参复杂,Lasso 要求线性假设。扎根点:Section 4 开头提到“When the sample size n is small, we can further consider to fit the following linear models”,但未给出选择准则。一个开放问题是:能否设计一个数据驱动的准则,在非参数和线性回归之间自适应选择,或者使用更灵活的模型(如随机森林、梯度提升)并给出理论保证?

  3. 样本分割的敏感性:非参数条件独立性检验使用了样本分割(D1, D2, D3),且 n3 的选择通过 Algorithm 1 数据驱动,但该算法计算量极大(需训练 Bpq 个神经网络)。扎根点:Remark 4 提到“When n is small, sample-splitting may also lead to power loss. In this case, we can consider in practice using the full sample at each step of the testing procedure.” 但未给出理论分析。开放问题:能否避免样本分割,使用全样本的交叉拟合(cross-fitting)技巧,并建立相应的渐近理论?

  4. 与计算复杂度的联系:本文的统计量是 L∞ 型,计算简单(O(npq))。但研究者陈星宇对 U 统计量的计算复杂度(张量收缩、einsum)感兴趣。本文的独立性检验统计量本质上是二阶 U 统计量(样本协方差)的最大绝对值。一个可能的延伸是:考虑更高阶的依赖度量(如三阶交叉矩),其计算复杂度会急剧上升,此时张量收缩的树宽分析可能有用。扎根点:Remark 1 中提到了更一般的统计量形式 \tilde{H}n = max{1≤j1<...<jT≤d} ∑{t=1}^T √n |\hat{S}{n,j_t}|,这可以视为对多个协方差项的求和,但未涉及高阶矩。开放问题:能否将坐标高斯化与高阶 U 统计量结合,构造检验高阶依赖的统计量,并利用张量网络技术降低计算成本?


Maintained by 陈星宇 · Homepage · Source on GitHub

评论