跳转至

Rank-based indices for testing independence between two high-dimensional vectors

作者: Yeqing Zhou, Kai Xu, Liping Zhu, Runze Li
来源: Annals of Statistics
主题: 数理统计 / 假设检验
相关性: 7/10
机构绿灯: Pennsylvania State University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1214/23-aos2339


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:如何检验两个高维随机向量之间的独立性。给定两个随机向量 \(X \in \mathbb{R}^p\)\(Y \in \mathbb{R}^q\),以及 \(n\) 个独立同分布样本 \(\{(X_i, Y_i)\}_{i=1}^n\),检验原假设 \(H_0: X \perp\!\!\!\perp Y\)(即 \(X\)\(Y\) 独立)对备择假设 \(H_1: X\)\(Y\) 不独立。当维度 \(p, q\) 固定且远小于样本量 \(n\) 时,经典方法(如基于 Pearson 相关系数、典型相关分析 CCA)已足够。但当 \(p, q\)\(n\) 增长(高维情形),经典方法面临维数灾难、协方差矩阵不可逆、检验统计量分布难以刻画等问题。当前该方向已发展出基于距离协方差(distance covariance, dCov)和希尔伯特-施密特独立性准则(HSIC)等核方法的检验,但本文关注的是另一条线索:基于秩的独立性指标,并将其推广到高维设定。

发展脉络(history)

  1. 奠基工作:低维秩独立性指标
  2. Hoeffding (1948) 提出了 \(D\) 统计量,用于检验两个一维随机变量的独立性。它是基于联合分布函数与边缘分布函数乘积之差的 \(L_2\) 距离的秩版本。
  3. Blum, Kiefer, Rosenblatt (1961) 提出了 \(R\) 统计量,是 \(D\) 的一种变体,同样基于秩,但使用了不同的加权方式。
  4. Bergsma & Dassios (2014)Yanagimoto (1970) 提出了 \(\tau^*\) 统计量,是 Kendall's \(\tau\) 的一种推广,能检测更广泛的相依关系(包括非单调关系)。这些工作都限于低维(通常 \(p=q=1\))。

  5. 主要进展:高维独立性检验的兴起

  6. Székely, Rizzo, Bakirov (2007) 提出了距离协方差(dCov)和距离相关(dCor),这是高维独立性检验的里程碑。dCov 基于欧氏距离的某种变换,能刻画任意类型的相依性,且当 \(p, q\) 固定时具有简洁的渐近理论。作者在引言中称其为“a powerful tool for testing independence”。
  7. Gretton et al. (2005, 2008) 提出了希尔伯特-施密特独立性准则(HSIC),基于再生核希尔伯特空间(RKHS)的交叉协方差算子。HSIC 与 dCov 在特定核下等价,但提供了更一般的核方法框架。
  8. Zhu et al. (2017)Zhang et al. (2018) 等将 dCov 和 HSIC 推广到高维情形,证明了当 \(p, q\)\(n\) 增长时,标准化后的 dCov/HSIC 统计量渐近正态,并给出了收敛速率。这些工作为高维独立性检验提供了理论基础。

  9. 当前 frontier 与本文的位置

  10. 当前高维独立性检验的主流是 dCov/HSIC 及其变体。然而,这些方法对数据的矩条件有要求(如有限二阶矩),且对重尾分布敏感。此外,它们的局部功效分析在高维下尚不完善。
  11. 本文的定位:作者将低维的秩独立性指标 \(D, R, \tau^*\) 推广到高维情形。核心优势在于:秩统计量具有单调变换不变性,因此是分布自由(distribution-free)的,可直接用于重尾等一般分布,无需假设矩的存在。作者在高维下建立了这些秩统计量的渐近正态性,给出了收敛速率,并进行了局部功效分析,与 dCov/dCor 进行了比较。

子线索聚类

这些被引文献大致落在两条子线索上:

  1. 基于秩的独立性指标(本文所属)
  2. 核心工作:Hoeffding (1948), Blum-Kiefer-Rosenblatt (1961), Bergsma-Dassios-Yanagimoto (2014/1970)。
  3. 特点:分布自由、对重尾稳健、基于 U-统计量或 V-统计量。但此前主要限于低维。
  4. 本文贡献:将其推广到高维,并建立完整的渐近理论。

  5. 基于距离/核的独立性指标(主流竞争路线)

  6. 核心工作:Székely, Rizzo, Bakirov (2007), Gretton et al. (2005, 2008), Zhu et al. (2017), Zhang et al. (2018)。
  7. 特点:能检测任意相依性,理论成熟,但依赖矩条件,对重尾分布可能不稳定。
  8. 本文的竞争关系:作者在局部功效分析中直接与 dCov/dCor 比较,声称在特定备择(Gaussian equicorrelation)下,当分量尺度差异大时,所提秩检验优于 dCov/dCor。

这个方向在追问的核心问题

  1. 如何在高维下构造有效的独立性检验统计量? 统计量需在 \(H_0\) 下有已知或可逼近的分布,且在 \(H_1\) 下有足够功效。
  2. 如何刻画高维下检验的局部功效? 即当备择假设接近原假设(如相依性很弱)时,检验能否以非平凡概率拒绝。
  3. 不同检验方法之间的相对效率如何? 在何种数据生成机制下,一种方法优于另一种?
  4. 如何应对重尾分布或缺乏矩条件的数据? 秩方法提供了一种自然解决方案。

当前主流方法与已知瓶颈:dCov/HSIC 是主流,但矩条件限制和局部功效分析不完善是瓶颈。秩方法虽能绕过矩条件,但其高维渐近理论(尤其是收敛速率和局部功效)此前是空白。

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者在引言中强调,现有高维独立性检验(如 dCov/HSIC)依赖于矩条件,且“their local power properties under high-dimensional settings are not well understood”。因此,本文的秩方法作为“distribution-free”且“local power analyzable”的替代方案,成为“显然的下一步”。
  • 哪些竞争路线被他淡化或回避了:作者淡化了 dCov/HSIC 在非高维设定下的成熟性,以及它们对非线性相依性的普适检测能力。本文的局部功效分析仅针对 Gaussian equicorrelation 备择,这是一个非常特殊的设定。作者回避了在更一般的备择(如非线性、稀疏相依)下,秩方法与 dCov/HSIC 的比较。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:作者未提及基于最大相关(maximal correlation)或基于互信息(mutual information)的独立性检验在高维下的进展。此外,关于高维 U-统计量的中心极限定理(如 de Jong (1987) 或高阶退化 U-统计量的渐近理论)未被引用,尽管本文的 \(D, R, \tau^*\) 本质上是 U-统计量或 V-统计量。这可能是值得研究者去查的问题:是否存在更一般的理论框架能统一本文结果?

张力

未见明显对立引用。所有被引工作基本是互补的,共同构成了从低维到高维、从参数到非参数的独立性检验图景。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \(X \in \mathbb{R}^p\):第一个随机向量,\(p\) 维。
  • \(Y \in \mathbb{R}^q\):第二个随机向量,\(q\) 维。
  • \((X_i, Y_i), i=1,\dots,n\):独立同分布样本,可观测。
  • \(F_X, F_Y\)\(X\)\(Y\) 的边缘分布函数(未知)。
  • \(F_{XY}\)\((X,Y)\) 的联合分布函数(未知)。
  • \(H_0: X \perp\!\!\!\perp Y\):原假设,即 \(F_{XY} = F_X F_Y\)
  • \(p, q\):维度,可随 \(n\) 增长(高维)。
  • \(n\):样本量。
  • \(D, R, \tau^*\):三种秩独立性指标,是本文要推广的统计量。它们是总体参数(population-level),其样本版本是检验统计量。

  • 模型:无参数模型。数据生成机制完全未知,仅假设 \((X_i, Y_i)\) 是独立同分布样本。秩方法不依赖任何分布假设(除了连续性以保证秩唯一性,但可处理结)。

  • 可观测数据:研究者能观测到 \(n\) 个独立同分布样本 \(\{(X_i, Y_i)\}_{i=1}^n\),每个样本包含一个 \(p\) 维向量和一个 \(q\) 维向量。想要但观测不到的是联合分布函数 \(F_{XY}\) 和边缘分布函数 \(F_X, F_Y\)。秩统计量通过将原始数据替换为秩(即排序后的位置)来绕过对分布的依赖。

第二步:讲最小内核

最简特例:考虑 \(p = q = 1\)(两个一维随机变量),且假设 \(X\)\(Y\) 的分布是连续的(无结)。此时,Hoeffding's \(D\) 的总体版本定义为:

\[D = \int \int [F_{XY}(x,y) - F_X(x)F_Y(y)]^2 \, dF_X(x) dF_Y(y)\]

这是一个衡量联合分布与独立乘积分布之间 \(L_2\) 距离的指标。其样本版本(V-统计量形式)为:

\[\hat{D}_n = \frac{1}{n^2} \sum_{i=1}^n \sum_{j=1}^n \left[ \frac{1}{n} \sum_{k=1}^n I(X_k \le X_i, Y_k \le Y_i) - \frac{1}{n} \sum_{k=1}^n I(X_k \le X_i) \cdot \frac{1}{n} \sum_{k=1}^n I(Y_k \le Y_i) \right]^2\]

其中 \(I(\cdot)\) 是指示函数。这个表达式看起来很复杂,但核心思想是:用经验分布函数(基于秩)来估计联合分布和边缘分布,然后计算它们的平方差积分

本文的核心思路(在 \(p=q=1\) 特例下): 1. 构造秩统计量:将原始数据 \((X_i, Y_i)\) 替换为它们的秩 \((R_i^X, R_i^Y)\),其中 \(R_i^X = \sum_{k=1}^n I(X_k \le X_i)\)。由于秩是单调变换不变的,\(\hat{D}_n\) 只依赖于秩,因此是分布自由的。 2. 高维推广:当 \(p, q > 1\) 时,作者将 \(D\) 推广为:

\[D_{pq} = \int \int [F_{XY}(x,y) - F_X(x)F_Y(y)]^2 \, dF_X(x) dF_Y(y)\]
其中 \(x \in \mathbb{R}^p, y \in \mathbb{R}^q\)。样本版本 \(\hat{D}_{pq}\) 通过将每个样本点的多元秩(即每个分量的秩向量)代入类似公式得到。 3. 渐近正态性:在 \(H_0\) 下,作者证明当 \(p, q\)\(n\) 增长时,标准化后的 \(\hat{D}_{pq}\) 收敛到标准正态分布。关键难点在于:\(\hat{D}_{pq}\) 是退化 U-统计量(在 \(H_0\) 下其期望为零,且方差由高阶项主导),其渐近分布通常不是正态的(而是卡方或更复杂的分布)。作者通过引入一个“去退化”的修正项,使得修正后的统计量在 \(H_0\) 下具有非退化的一阶项,从而能应用高维中心极限定理。

一句话总结:本文在数学上干的事是:将低维的秩独立性指标 \(D, R, \tau^*\) 推广到高维,并通过“去退化”技巧,使得这些原本在低维下渐近分布复杂的 U-统计量,在高维下(维度发散)变得渐近正态,从而构造出可用的检验

三、这篇论文做了什么

三句话

  1. 研究了什么问题:检验两个高维随机向量 \(X \in \mathbb{R}^p\)\(Y \in \mathbb{R}^q\) 之间的独立性,其中 \(p, q\) 可随样本量 \(n\) 任意发散。
  2. 核心工具 / 方法:基于 Hoeffding's \(D\)、Blum-Kiefer-Rosenblatt's \(R\) 和 Bergsma-Dassios-Yanagimoto's \(\tau^*\) 的秩版本,构造了三种分布自由的检验统计量,并通过“去退化”技巧使其在高维下渐近正态。
  3. 主要结论:在 \(H_0\) 下,所提统计量收敛到正态分布,并给出了显式收敛速率;在 Gaussian equicorrelation 备择下,与 dCov/dCor 进行了局部功效比较,发现当分量尺度差异大时秩检验更优,且 \(D, \tau^*, R\) 的渐近效率依次递减。

关键设定与假设

  • 设定
  • 样本 \(\{(X_i, Y_i)\}_{i=1}^n\) 独立同分布,来自某个未知联合分布 \(F_{XY}\)
  • \(X_i \in \mathbb{R}^p, Y_i \in \mathbb{R}^q\),其中 \(p = p_n, q = q_n\) 可随 \(n\) 增长。
  • 假设 \(F_X\)\(F_Y\) 是连续的(以避免秩结问题,但可处理)。
  • 无矩条件假设:这是秩方法的核心优势,与 dCov/HSIC 不同。

  • 假设

  • 假设 1(维度增长条件)\(p, q \to \infty\)\(p q / n \to 0\) 或类似条件(具体见定理)。这保证了高维 CLT 的适用性。
  • 假设 2(备择下的局部性):在局部功效分析中,假设备择假设以 \(1/\sqrt{n}\) 速率接近原假设(即局部备择),以便进行渐近功效比较。
  • 相比已有文献:相比 Zhu et al. (2017) 等 dCov 高维工作,本文的假设更弱(无矩条件),但维度增长条件可能更严格(因为秩统计量的方差结构更复杂)。

主要结果

  • 定理 1(渐近正态性):在 \(H_0\) 下,标准化后的检验统计量 \(T_D, T_R, T_{\tau^*}\) 依分布收敛到标准正态分布。收敛速率为 \(O((pq/n)^{1/2})\) 或类似阶(具体见原文)。直觉:由于 \(p, q\) 发散,统计量中大量“局部”项(每个维度对)的贡献被平均,使得退化性被打破,从而 CLT 成立。
  • 定理 2(局部功效):在 Gaussian equicorrelation 备择下(即 \(X\)\(Y\) 的每个分量对之间有相同的相关系数 \(\rho/\sqrt{n}\)),给出了检验的渐近功效的显式表达式。必要条件:备择的强度以 \(1/\sqrt{n}\) 速率衰减。
  • 定理 3(与 dCov/dCor 的比较):建立了 \(D, R, \tau^*\) 与二元正态 Pearson 相关系数的显式关系。例如,对于二元正态变量 \((U,V)\) 有相关系数 \(\rho\),Hoeffding's \(D\) 可表示为 \(D = f(\rho)\),其中 \(f\) 是某个已知函数。基于此,在 Gaussian equicorrelation 备择下,比较了秩检验与 dCov/dCor 的渐近相对效率(ARE)。结论:当分量尺度差异大时(即 \(p\)\(q\) 的方差矩阵的对角元素差异大),秩检验的 ARE 大于 1(优于 dCov/dCor);且 \(D\) 的 ARE 最大,\(\tau^*\) 次之,\(R\) 最小。

证明路线与技术技巧

  • 整体路线
  • 统计量表达为 U-统计量:将 \(\hat{D}_{pq}\) 等样本版本写成 U-统计量或 V-统计量的形式,其核函数是秩的某种函数。
  • 去退化(Degeneracy removal):在 \(H_0\) 下,这些 U-统计量是退化的(即一阶投影为零)。作者通过引入一个修正项(类似于方差估计),构造了一个“去退化”的版本,使其一阶投影非零。
  • 方差估计与标准化:计算去退化后统计量的方差,并构造其一致估计。
  • 高维 CLT:应用高维中心极限定理(如基于鞅差序列的 CLT 或基于 U-统计量投影的 CLT),证明标准化后的统计量收敛到正态分布。关键是要控制高阶项(如 U-统计量的剩余部分)的阶。
  • 收敛速率:通过 Berry-Esseen 型不等式,给出收敛到正态的显式速率。

  • 关键跳跃点

  • 去退化技巧:这是最吃功夫的部分。对于退化 U-统计量,其渐近分布通常由二阶项主导(如卡方分布)。作者通过巧妙地构造一个“方差标准化”的版本,使得一阶项重新成为主导,从而在高维下(维度发散)获得正态极限。这个技巧类似于“self-normalization”或“Studentization”。
  • 局部功效分析中的显式关系:建立 \(D, R, \tau^*\) 与 Pearson 相关系数的显式关系需要复杂的积分计算,这是技术难点。作者利用二元正态分布的性质和秩统计量的对称性,推导出了这些关系。

  • 技术技巧点名

  • U-统计量理论:用于表达和分解统计量。
  • 鞅差序列 CLT:用于证明去退化后统计量的渐近正态性。
  • Berry-Esseen 不等式:用于给出收敛速率。
  • 高斯积分与特殊函数:用于推导 \(D, R, \tau^*\) 与 Pearson 相关系数的关系(涉及反正弦函数等)。

真实例子与应用

本文为纯理论 / 无实证例子。论文包含模拟实验,但未使用真实数据。模拟实验用于验证: - 数据 / 场景:生成 Gaussian 数据(满足 \(H_0\) 或 Gaussian equicorrelation 备择),以及重尾分布(如 t-分布)数据。 - 怎么用:计算所提秩检验统计量及其 p 值(基于渐近正态性),并与 dCov/dCor 检验比较。 - 结果:模拟结果支持理论结论:在 \(H_0\) 下,检验的 size 接近名义水平;在 Gaussian equicorrelation 备择下,当分量尺度差异大时,秩检验的 power 高于 dCov/dCor;且 \(D\) 的 power 最高,\(\tau^*\) 次之,\(R\) 最低。 - 想说明什么:验证渐近正态性理论的准确性,以及局部功效比较的理论预测。

🔎 结论是否比证明窄

  • 窄结论:局部功效分析严格限于 Gaussian equicorrelation 备择。作者在定理陈述中明确写了“Under a Gaussian equicorrelation alternative”。然而,在摘要和引言中,作者泛泛地说“the proposed tests are superior to the two classic distance covariance/correlation based tests”,这可能会被误解为一般性结论。实际上,这个 superiority 只在非常特定的备择下成立。
  • Conjecture:作者在讨论中可能提到,对于更一般的备择,秩检验与 dCov/dCor 的相对效率需要进一步研究。这属于未证明的猜想。

四、开放问题

  1. 更一般的备择下的局部功效:本文的局部功效分析仅针对 Gaussian equicorrelation 备择。对于非线性相依、稀疏相依(只有少数分量对相关)或更一般的协方差结构,秩检验与 dCov/dCor 的相对效率如何?这扎根于本文定理 3 的窄适用范围。
  2. 维度增长条件的优化:本文的渐近正态性要求 \(pq/n \to 0\) 或类似条件。能否放宽到 \(pq/n \to c\)(常数)甚至 \(pq/n \to \infty\)?这扎根于本文定理 1 的假设。
  3. 与基于最大相关或互信息的高维检验的比较:本文未与这些方法比较。是否存在基于秩的互信息估计器(如基于最近邻的估计)在高维下也有类似性质?这扎根于引言中未提及的竞争路线。
  4. 计算复杂度:本文的秩统计量计算涉及所有样本对,复杂度为 \(O(n^2 p q)\)。能否利用 U-统计量的 tensor-network / einsum 结构(与研究者武器库中的 treewidth 视角相关)来加速计算?这扎根于本文未讨论的计算方面。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论