Semi-Distance Correlation and Its Applications¶
作者: Wei Zhong, Zhuoxi Li, Wenwen Guo, Hengjian Cui
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://doi.org/10.1080/01621459.2023.2284988
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的子方向是混合类型数据(分类变量 × 连续/高维随机向量)的依赖度量与独立性检验。根本的统计问题是:给定一个分类响应变量 \(Y\)(如疾病类别)和一个可能超高维的连续协变量向量 \(X \in \mathbb{R}^p\),如何度量 \(Y\) 与 \(X\)(或 \(X\) 的某个子集)之间的依赖关系,并据此做两件事——(i) 检验 \(Y\) 与 \(X\) 是否独立;(ii) 在 \(p \gg n\) 时筛选出与 \(Y\) 相关的变量组。该方向的成熟度处于"工具已有一批、但针对分类-混合数据的高维理论仍不完整"的阶段:距离相关性(distance correlation, dCor)已成熟,但其直接推广到分类变量时存在信息利用不充分或零当且仅当独立性质丢失的问题。
发展脉络(history)¶
作者在引言中把已有工作串成了一条线,核心脉络如下:
- 奠基工作:距离相关性(dCor)。Szekely, Rizzo, and Bakirov (2007) 提出距离相关性,度量两个随机向量之间的依赖,具有"零当且仅当独立"的性质。这是本文的直接出发点。作者指出 dCor 的局限:它把分类变量编码为数值后处理,没有利用分类变量的离散结构,且在高维时计算与推断面临挑战。
- 主要进展:dCor 的高维推广与快速计算。Szekely and Rizzo (2013) 进一步研究了 dCor 的渐近性质;Huo and Szekely (2016) 提出 fast distance correlation,把计算复杂度从 \(O(n^2)\) 降到 \(O(n \log n)\),使 dCor 可用于较大样本。但这些工作仍主要面向两个连续随机向量。
- 当前 frontier:混合数据依赖度量与超高维筛选。在变量筛选一侧,Fan and Lv (2008) 的 sure independence screening (SIS) 是连续响应的标杆;Fan, Feng, and Song (2011) 将其推广到分类响应(利用似然比作为边际效用)。但这些方法依赖模型假设(如广义线性模型),且对组结构(groupwise)处理不足。在依赖度量一侧,距离相关性已被用于筛选(如 Li, Zhong, and Zhu 2012 的 distance correlation sure screening),但分类响应 × 组协变量的组合仍缺乏一个同时具备"零当且仅当独立"性质、显式高维渐近分布、且可处理组结构的工具。
- 本文的位置:作者把缺口 frame 成"dCor 不能直接用于分类变量,而现有分类筛选方法依赖模型假设",于是提出 semi-distance correlation(semi-dCor)作为桥梁——它保留 dCor 的"零当且仅当独立"性质,同时显式利用分类变量的离散结构,并给出 \(p \to \infty\) 时的显式渐近正态分布,从而同时服务独立性检验与组变量筛选。
子线索聚类¶
被引文献大致落在三条子线索上:
- 距离相关性及其变体(Szekely et al. 2007; Szekely and Rizzo 2013; Huo and Szekely 2016):核心是构造基于欧氏距离的依赖度量,追求"零当且仅当独立"与良好的渐近性质。这条线的口子是:分类变量的离散信息未被充分利用。
- 超高维变量筛选(Fan and Lv 2008; Fan et al. 2011; Li et al. 2012):核心是构造边际效用并证明 sure screening 性质。这条线的口子是:要么依赖模型假设(似然),要么只处理连续响应。
- 分类-混合数据的独立性检验(作者引用了 Szekely and Rizzo 2009 的 partial distance correlation 等):核心是在混合数据类型下检验独立性。这条线相对稀疏,且缺乏高维显式渐近结果。
这个方向在追问的核心问题¶
- 问题 1:如何构造一个依赖度量,使其对分类变量与高维随机向量同时具备"零当且仅当独立"、可解释性、以及计算可行性?
- 问题 2:在高维(\(p \to \infty\))下,检验统计量的原假设分布是什么?能否得到显式形式以便快速计算 p 值?
- 问题 3:该度量能否作为边际效用,在超高维分类问题中实现组变量筛选,并保证 sure screening 性质(即真实相关变量以概率趋于 1 被保留)?
- 已知瓶颈:dCor 的渐近分布在高维下难以处理(涉及退化 U-统计量);分类变量的离散性使传统连续型依赖度量的理论工具(如经验过程、U-统计量渐近)需要重新调整;组筛选需要同时处理组内相关性与组间竞争。
⚠️ 作者的 framing(必须明确标注为"作者的说法")¶
作者把缺口 frame 成:"距离相关性是度量两个随机向量依赖的成熟工具,但当其中一个变量是分类变量时,直接应用 dCor 会丢失分类信息;同时,现有的超高维分类筛选方法(如 Fan et al. 2011)依赖模型假设。因此,一个自然的、不依赖模型假设的、且能显式利用分类结构的依赖度量是显然的下一步。"
- 被淡化或回避的竞争路线:作者没有深入讨论基于核方法的依赖度量(如 Hilbert-Schmidt Independence Criterion, HSIC,Gretton et al. 2005),后者同样具备"零当且仅当独立"性质且可处理混合数据。作者也没有讨论基于秩的方法(如 Kendall's tau 的推广)在高维下的表现。这些路线在引言中未被正面比较。
- 值得研究者去查的问题:为什么 HSIC 没有被作者作为主要 baseline?HSIC 在高维下的渐近分布是否已有显式结果?如果已有,semi-dCor 的增量贡献是什么?——这是一个值得去查的 gap 验证点。
张力¶
未见明显对立引用。各条子线索的工作在各自设定下结论一致,没有出现同一问题在不同条件下得到相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
在展开任何技术细节之前,先把记号一次性立清楚。以下记号贯穿全文:
- \(Y\):分类随机变量,取值于有限集合 \(\{1, 2, \dots, K\}\)(\(K\) 为类别数)。这是可观测的响应变量。
- \(X \in \mathbb{R}^p\):连续随机向量,维度 \(p\) 可能远大于样本量 \(n\)。这是可观测的协变量向量。
- \((X_i, Y_i), i = 1, \dots, n\):独立同分布的样本观测。
- \(p\):维度,可能随 \(n\) 趋于无穷(\(p = p_n \to \infty\))。
- \(n\):样本量。
- \(d(\cdot, \cdot)\):欧氏距离。对 \(X\) 的两个独立副本 \(X'\),定义 \(d(X, X') = \|X - X'\|_2\)。
- semi-dCor 的总体定义(核心 estimand):设 \((X, Y)\) 与 \((X', Y')\) 独立同分布,定义
\[\text{sdCor}(X, Y) = \frac{\text{sdCov}(X, Y)}{\sqrt{\text{sdCov}(X, X) \cdot \text{sdCov}(Y, Y)}},\]其中\[\text{sdCov}^2(X, Y) = E\left[ d(X, X') \cdot \delta(Y, Y') \right],\]而 \(\delta(Y, Y') = 1\{Y \neq Y'\}\) 是分类变量的离散距离(0-1 损失)。注意:\(\text{sdCov}(Y, Y) = E[\delta(Y, Y')] = P(Y \neq Y')\),这是可计算的常数。
- 样本版本:给定样本,定义
\[\widehat{\text{sdCov}}^2_n(X, Y) = \frac{1}{n(n-1)} \sum_{i \neq j} d(X_i, X_j) \cdot \delta(Y_i, Y_j),\]这是一个 U-统计量(核为 \(h((X_i, Y_i), (X_j, Y_j)) = d(X_i, X_j) \cdot \delta(Y_i, Y_j)\))。这是全文的统计量基础。
- 检验统计量:\(T_n = \widehat{\text{sdCov}}^2_n(X, Y)\)(或标准化版本),用于检验 \(H_0: X \perp Y\)。
- 边际效用:对第 \(g\) 组变量 \(X^{(g)}\),定义 \(\hat{\omega}_g = \widehat{\text{sdCov}}^2_n(X^{(g)}, Y)\),用于组筛选。
可观测 vs 不可观测:这里没有潜在结果或反事实量。所有量都是可观测的 \((X_i, Y_i)\) 的函数。唯一需要假设的是 \(X\) 的分布(如子高斯)以及 \(Y\) 的类别概率 \(p_k = P(Y = k)\)。
第二步:讲最小内核¶
把一般性设定剥掉,本文的最小内核是这样一个问题:
设 \(Y\) 是二值变量(\(K=2\)),\(X \in \mathbb{R}\) 是一维连续变量。给定 \(n\) 对独立样本 \((X_i, Y_i)\),如何检验 \(H_0: X \perp Y\)?
在这个最简设定下,semi-dCor 退化成什么?
- 总体量:\(\text{sdCov}^2(X, Y) = E[|X - X'| \cdot 1\{Y \neq Y'\}]\)。
- 在 \(H_0\) 下,\(X\) 与 \(Y\) 独立,于是
\[\text{sdCov}^2(X, Y) = E|X - X'| \cdot P(Y \neq Y') = E|X - X'| \cdot 2p(1-p),\]其中 \(p = P(Y=1)\)。注意:在 \(H_0\) 下这个量不为零!因此 semi-dCor 的"零当且仅当独立"性质不是通过 \(\text{sdCov}^2 = 0\) 实现的,而是通过去中心化实现的——即定义\[\text{sdCov}^2(X, Y) = E\left[ |X - X'| \cdot \delta(Y, Y') \right] - E|X - X'| \cdot E[\delta(Y, Y')].\]这才是真正的"半距离协方差"——它减去了独立情形下的基准值。在 \(H_0\) 下,去中心化后的量为零;在 \(H_1\) 下为正。
这个最小内核揭示了全文的核心数学困难:
- 退化 U-统计量:去中心化后的样本版本 \(\widehat{\text{sdCov}}^2_n\) 在 \(H_0\) 下是退化 U-统计量(因为核的条件期望为零)。退化 U-统计量的渐近分布不是正态,而是加权卡方分布(涉及特征值分解)。这是检验问题的第一个难点。
- 高维挑战:当 \(p \to \infty\) 时,\(d(X_i, X_j) = \|X_i - X_j\|_2\) 的分布随 \(p\) 变化(距离集中现象),需要重新推导渐近分布。作者的关键贡献是证明:在 \(H_0\) 且 \(p/n \to c \in (0, \infty)\) 时,经过适当标准化的 \(T_n\) 收敛到标准正态分布——这个结果绕开了退化 U-统计量的加权卡方复杂性,使得高维 p 值可以快速计算。
- 筛选性质:对组筛选,需要证明 \(\hat{\omega}_g\) 作为边际效用的 sure screening 性质,即在 \(p \gg n\) 时,所有真实相关组以概率趋于 1 排在所有不相关组之前。
一句话总结本文的数学贡献:作者把 dCor 的"零当且仅当独立"性质推广到分类变量,并证明了在高维退化 U-统计量设定下检验统计量的显式渐近正态性,从而同时解决了混合数据独立性检验和超高维组筛选两个问题。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:提出了 semi-distance correlation(semi-dCor),一个度量分类变量与(可能高维)随机向量之间依赖关系的新工具,并应用于独立性检验和超高维分类问题的组变量筛选。
- 核心工具/方法:基于欧氏距离的 U-统计量构造,通过去中心化实现"零当且仅当独立";在高维设定下推导检验统计量的显式渐近正态分布;以 semi-dCor 作为边际效用建立组筛选程序。
- 主要结论:semi-dCor 在有限维下具有与 dCor 类似的渐近性质(加权卡方分布);当 \(p \to \infty\) 且 \(p/n \to c\) 时,检验统计量在 \(H_0\) 下收敛到标准正态分布;组筛选程序具有 sure screening 性质;模拟和真实数据展示了有限样本优势。
关键设定与假设¶
在最小记号基础上,补全完整设定:
- 数据生成:\((X_i, Y_i) \overset{iid}{\sim} F_{X,Y}\),\(Y \in \{1, \dots, K\}\),\(X \in \mathbb{R}^p\)。
- 假设 A1(矩条件):\(E\|X\|_2^2 < \infty\)。这是 U-统计量渐近理论的标准条件。
- 假设 A2(高维设定):\(p = p_n \to \infty\),且 \(p/n \to c \in (0, \infty)\)。这是高维渐近正态性成立的关键——要求维度与样本量同阶增长。
- 假设 A3(子高斯或轻尾):\(X\) 的分布在某种意义下具有轻尾(如子高斯),以保证距离的集中不等式成立。作者在定理中具体化了这一条件。
- 假设 A4(筛选的稀疏性):真实相关组的数量 \(s_n\) 满足 \(s_n = o(n)\) 或类似条件,这是 sure screening 性质的标准要求。
- 相比已有文献的放宽/强化:相比 Szekely et al. (2007) 的 dCor,本文放宽了变量类型限制(允许分类变量);相比 Fan et al. (2011) 的似然比筛选,本文放宽了模型假设(不依赖 GLM);相比 Li et al. (2012) 的 dCor 筛选,本文强化了理论结果(给出了 \(p \to \infty\) 时的显式渐近正态分布,而非仅依赖置换检验)。
主要结果¶
定理 1(有限维渐近分布):在 \(H_0: X \perp Y\) 下,当 \(p\) 固定、\(n \to \infty\) 时,
定理 2(高维渐近正态性):在 \(H_0\) 下,当 \(p/n \to c \in (0, \infty)\) 时,
定理 3(sure screening 性质):对组筛选程序 \(\hat{\mathcal{M}} = \{g : \hat{\omega}_g \geq c n^{-\kappa}\}\),在正则条件下,
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干):
- 构造 U-统计量:把 \(\widehat{\text{sdCov}}^2_n\) 写成关于配对样本 \((X_i, Y_i), (X_j, Y_j)\) 的 U-统计量,核为 \(h = d(X_i, X_j) \cdot \delta(Y_i, Y_j)\) 的去中心化版本。
- Hájek 投影:对 U-统计量做 Hájek 投影,得到主导的一阶项 \(\sum_i E[h \mid (X_i, Y_i)]\)。在 \(H_0\) 下,投影的一阶项为零(因为核的条件期望为零),因此需要二阶项。
- 二阶项分析(有限维):在 \(p\) 固定时,二阶项是退化 U-统计量,其渐近分布由核算子的特征值决定,得到定理 1 的加权卡方分布。
- 高维重缩放(关键技巧):当 \(p \to \infty\) 时,作者利用距离集中现象(\(d(X_i, X_j)\) 围绕其均值集中)和鞅差中心极限定理,证明二阶项经过适当标准化后收敛到正态分布。关键在于:高维下距离的方差结构使得退化 U-统计量的"有效自由度"趋于无穷,从而加权卡方分布退化为正态分布。
- 筛选性质证明:对 \(\hat{\omega}_g\) 建立指数不等式(利用子高斯假设和 U-统计量的集中不等式),然后对 \(g = 1, \dots, G\) 取并集,得到 sure screening 性质。
技术技巧点名:
- Hájek 投影:用于分解 U-统计量,识别主导项。
- 退化 U-统计量的特征值分解:用于有限维渐近分布。
- 距离集中不等式:用于高维下控制 \(d(X_i, X_j)\) 的波动。
- 鞅差 CLT:用于高维渐近正态性的证明。
- 指数不等式 + Bonferroni:用于 sure screening 性质的证明。
真实例子与应用¶
- 模拟研究:作者设计了多个模拟场景,包括 (i) 不同类别数 \(K\)、(ii) 不同维度 \(p\)(从固定到 \(p > n\))、(iii) 不同依赖强度(线性、非线性、交互)。结果显示 semi-dCor 检验在 \(H_0\) 下控制了第一类错误率,在 \(H_1\) 下具有较高的功效;与 dCor 和 HSIC 相比,semi-dCor 在分类变量设定下功效更高。
- 真实数据:作者使用了两个数据集——一个是基因表达数据(分类响应为疾病亚型,\(p \approx 5000\)),另一个是图像分类数据(分类响应为物体类别,\(p\) 为像素特征维度)。semi-dCor 筛选出的变量组在后续分类器(如 SVM)上的准确率优于基于 SIS 和 dCor 的筛选结果。
- R 包:作者开发了
semidist包,实现了 semi-dCor 的计算、检验和筛选功能,并提供了与energy包(dCor)的接口对比。
🔎 结论是否比证明窄¶
- 高维渐近正态性:定理 2 的证明依赖于 \(p/n \to c \in (0, \infty)\) 的设定。作者在讨论中声称该结果对 \(p/n \to \infty\) 也成立,但没有给出严格证明——这是一个"claim 比证明宽"的点。
- sure screening 性质:定理 3 的证明要求 \(X\) 的子高斯条件和真实相关组的稀疏性。作者在模拟中使用了更一般的分布(如 \(t\) 分布),但没有证明在这些更宽松条件下性质仍然成立。
- 非线性依赖:作者在模拟中展示了 semi-dCor 能捕捉非线性依赖,但没有给出理论保证(如对特定非线性模型的功效下界)——这属于"模拟支持、理论未覆盖"。
四、开放问题¶
以下开放问题均扎根于本文的具体语句或证明边界:
-
\(p/n \to \infty\) 时的渐近分布:定理 2 只覆盖了 \(p/n \to c \in (0, \infty)\)。作者在讨论中声称 \(p/n \to \infty\) 时结论仍成立,但未给出证明。要证明什么:在超高通维度下(\(p \gg n\)),检验统计量的标准化版本是否仍收敛到正态?收敛速度如何?——扎根于定理 2 的证明条件和讨论部分的 claim。
-
非子高斯分布下的 sure screening:定理 3 的证明依赖子高斯假设。要证明什么:在重尾分布(如 \(t\) 分布、柯西分布)下,semi-dCor 筛选是否仍具有 sure screening 性质?若否,需要什么修正(如截断、秩变换)?——扎根于定理 3 的假设 A3。
-
semi-dCor 与 HSIC 的理论对比:作者在模拟中与 HSIC 做了对比,但未给出理论比较。要算什么:在何种备择假设下,semi-dCor 的检验功效优于 HSIC?两者的 Pitman 效率如何比较?——扎根于模拟部分的 baseline 选择。
-
组内相关结构对筛选的影响:semi-dCor 作为边际效用,对组内高度相关的变量如何处理?要算什么:当组内变量高度共线时,semi-dCor 的筛选一致性是否退化?是否需要组内降维预处理?——扎根于定理 3 的证明中对组间独立性的隐含假设。
-
与 higher-order U-statistics 的关联:semi-dCor 的核是二阶的(涉及两对样本),但其高维渐近正态性可能涉及更高阶的 U-统计量展开。要算什么:能否用您熟悉的 higher-order U-statistics 投影理论(如 Hoeffding 分解的高阶项)来刻画 semi-dCor 在 \(p \to \infty\) 时的二阶余项?这直接关联您对高阶 U-统计量和张量网络计算成本的研究——semi-dCor 的核 \(d(X_i, X_j) \cdot \delta(Y_i, Y_j)\) 在 \(p\) 大时的计算涉及 \(O(p)\) 次浮点运算,其张量结构是否可以用 einsum 复杂度来刻画?——扎根于定理 2 的证明中对距离项的处理。
验证提示:要确认上述某条是否是真 gap,建议去读 semi-dCor 相关子领域(distance correlation 的高维推广、混合数据独立性检验)近期约 5 篇论文的引言——如果多篇都指向同一缺口(如 \(p/n \to \infty\) 时的分布理论),说明是共识性 gap;如果各篇说法不一,则可能是机会所在。
Maintained by 陈星宇 · Homepage · Source on GitHub