跳转至

Measuring association with Wasserstein distances

作者: Johannes C.W. Wiesel
来源: Bernoulli
主题: 非参数 / 半参数
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:如何定义并估计一个非参数、可解释的关联度量,使其能够捕捉两个随机变量(或随机向量)之间任意形式的依赖关系,而不仅仅是线性或单调关系? 理想的度量应满足一组公理性质:0 当且仅当独立,1 当且仅当一个变量是另一个变量的可测函数,且存在简单、一致的估计量。当前该领域已从经典的 Pearson/Spearman 相关系数,发展到基于距离协方差、核方法、最优传输等框架的多种度量,但如何在一般 Polish 空间上同时满足上述性质并建立完整的统计推断理论,仍是一个活跃的前沿。

发展脉络(history)

  1. 奠基工作:从经典相关系数到公理化的需求
  2. Linfoot (1957) 最早从信息论角度提出了“信息相关系数”,将 Pearson 相关系数推广到一般分布,但该度量基于 KL 散度,计算和推断困难。
  3. Székely, Rizzo & Bakirov (2007) 提出了距离协方差 (distance covariance),首次在欧氏空间上实现了“0 当且仅当独立”的度量,且具有简洁的样本矩表示。这是该领域的里程碑,但它要求变量取值于 Hilbert 空间,且“1 当且仅当函数关系”的性质不成立。
  4. Chatterjee (2019) 提出了一个新相关系数,首次同时满足:(i) 简单如 Pearson/Spearman,(ii) 0 当且仅当独立,1 当且仅当函数关系,(iii) 独立假设下有简单渐近理论。该工作引发了大量后续研究,但其定义依赖于秩,仅适用于实值随机变量。

  5. 主要进展:向一般空间和更复杂依赖结构的推广

  6. Shi, Drton & Han (2019) 将距离协方差与中心向外秩 (center-outward ranks) 结合,首次给出了分布自由且一致的独立性检验,适用于一般维度的随机向量。其技术核心是退化 U-统计量的组合非中心极限定理。
  7. Deb, Ghosal & Sen (2020) 利用再生核 Hilbert 空间 (RKHS) 和几何图(k-NN、MST)在一般拓扑空间上定义了关联度量,并证明了其估计量的一致性和渐近正态性。但本文作者指出,该分析“局限于由 RKHS 导出的估计量,且对核有特定要求,因此不能应用于任意 Polish 空间 X, Y”。
  8. Mordant & Segers (2021)Nies, Staudt & Munk (2021) 分别独立地提出了基于 2-Wasserstein 距离的依赖度量。前者通过比较联合分布与独立乘积分布来定义,后者(Transport Dependency)则通过最优传输的“成本”来度量依赖,并定义了多种归一化相关系数。这些工作将最优传输引入关联度量,但本文作者指出,它们“要么不满足所有理想性质,要么估计量的统计理论不完整”。

  9. 当前 Frontier:adapted Wasserstein 距离与因果结构

  10. Lassalle (2013)Backhoff-Veraguas et al. (2019) 发展了因果最优传输 (causal optimal transport)adapted Wasserstein 距离,该距离考虑了随机过程的时序/信息结构,在随机优化和金融数学中具有 Lipschitz 稳定性。Backhoff, Bartl, Beiglböck & Wiesel (2020) 进一步证明了 adapted 经验测度的一致性和收敛速率。
  11. 本文 (Wiesel, 2023) 的位置:作者将 adapted Wasserstein 距离的思想引入关联度量,通过耦合的分解 (disintegration) 来定义 Wasserstein 相关系数。其核心创新在于:该度量适用于任意 Polish 空间,满足 0/1 性质,且其估计量的统计理论(强相合性、收敛速率)可以借助 adapted Wasserstein 距离的已有结果来建立。这填补了从“一般空间上的关联度量”到“具有完整统计理论的估计量”之间的缺口。

子线索聚类

  1. 基于秩/经验分布函数的度量:Chatterjee (2019), Junker et al. (2021), Griessenberger et al. (2021), Shi et al. (2019)。这些方法通常计算简单,但往往局限于实值或低维情况。
  2. 基于核/距离的度量:Székely et al. (2007), Deb et al. (2020), Ke & Yin (2020)。这些方法适用于 Hilbert 空间或更一般的拓扑空间,但“函数关系”性质通常不成立或需要特定核。
  3. 基于最优传输的度量:Mordant & Segers (2021), Nies et al. (2021), Ozair et al. (2019), Móri & Székely (2020)。这些方法利用 Wasserstein 距离的几何性质,适用于 Polish 空间,但归一化、统计推断和计算复杂度是主要挑战。
  4. adapted Wasserstein 距离与因果结构:Lassalle (2013), Backhoff-Veraguas et al. (2019), Backhoff et al. (2020)。这是本文的技术基础,主要关注随机过程/耦合的时序结构,而非直接的关联度量。

这个方向在追问的核心问题

  1. 公理完备性:一个理想的关联度量应满足哪些公理?Chatterjee (2019) 提出的三条(简单、0/1 性质、简单渐近理论)是否足够?是否需要额外的性质(如尺度不变性、对单调变换的鲁棒性)?
  2. 一般空间上的可定义性:能否在任意 Polish 空间(不仅仅是欧氏空间或 Hilbert 空间)上定义一个满足所有理想性质的度量?
  3. 统计推断的可行性:对于给定的度量,能否构造出强相合的估计量?其收敛速率是多少?能否进行假设检验(如独立性检验)?
  4. 计算与统计的权衡:估计量的计算复杂度如何?是否存在计算上可行但统计上最优的估计量?

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者在引言中明确指出,现有基于 Wasserstein 距离的关联度量(如 Mordant & Segers 2021, Nies et al. 2021)要么“不满足所有理想性质”,要么“其估计量的统计理论不完整”。作者将自己的工作定位为:首次提出一个基于 Wasserstein 距离、适用于任意 Polish 空间、满足 0/1 性质、且具有完整统计理论(强相合性 + 收敛速率)的关联度量。作者特别强调,其技术核心——adapted Wasserstein 距离——是建立估计量理论的关键,这暗示了该框架的“自然性”和“必然性”。
  • 哪些竞争路线被他淡化或回避了
  • Chatterjee (2019) 及其后续工作:作者承认 Chatterjee 的系数满足所有理想性质,但将其限制在实值随机变量上,并指出其“不能直接推广到一般 Polish 空间”。作者没有深入讨论 Chatterjee 系数的变体(如 Cao & Bickel 2020 的 shape-restricted 版本)是否也能推广。
  • 基于 RKHS 的方法 (Deb et al. 2020):作者仅用一句话指出其“局限于 RKHS 且对核有特定要求”,但没有讨论是否可以通过选择通用核(如高斯核)来近似任意 Polish 空间上的度量。
  • 计算复杂度:作者完全没有讨论其估计量的计算复杂度。对于一般 Polish 空间,计算 Wasserstein 距离本身是计算密集的(通常为 O(n³ log n)),而 adapted Wasserstein 距离的计算可能更复杂。这是一个明显的回避。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
  • Móri & Székely (2020) 的 Earth Mover's Correlation:该文同样在一般度量空间上定义了基于 Wasserstein 距离的关联度量,并讨论了公理性质。作者引用了该文(参考文献 [25]),但在 intro 中没有将其作为主要竞争路线来讨论,而是将其归入“近期研究活动激增”的泛泛引用中。这可能是因为 Earth Mover's Correlation 的归一化方式不同,且其统计理论(如收敛速率)不如本文完整。
  • Geenens & Lafaye De Micheaux (2018) 的 Hellinger Correlation:该文提出了一个满足所有理想性质的度量,但作者仅在比较实验(Section 5)中将其作为对比基准,没有在 intro 中讨论其与 Wasserstein 相关系数的关系。

张力

未见明显对立引用。各主要工作(Chatterjee, Székely, Deb, Mordant & Segers, Nies et al.)在公理选择和适用空间上存在差异,但并未在相同设定下得出矛盾结论。主要的张力在于“公理完备性”的定义本身——不同作者对“理想度量”应满足哪些性质有不同看法,但这更多是设计选择而非数学矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \( \mathcal{X}, \mathcal{Y} \):两个 Polish 空间(完备可分度量空间),分别作为随机变量 \(X\)\(Y\) 的取值空间。
  • \( \mu \in \text{Prob}(\mathcal{X}) \)\(X\) 的边缘分布。
  • \( \nu \in \text{Prob}(\mathcal{Y}) \)\(Y\) 的边缘分布。
  • \( \pi \in \Pi(\mu, \nu) \):一个耦合 (coupling),即 \( \mathcal{X} \times \mathcal{Y} \) 上的概率测度,其边缘分布为 \(\mu\)\(\nu\)。它描述了 \(X\)\(Y\) 的联合分布。
  • \( \pi_{x_1} \):耦合 \(\pi\) 关于第一坐标 \(x_1 \in \mathcal{X}\)分解 (disintegration)。直观上,给定 \(X = x_1\)\(Y\) 的条件分布。这是一个从 \(\mathcal{X}\)\(\text{Prob}(\mathcal{Y})\) 的(几乎处处定义的)映射。
  • \( W_p(\cdot, \cdot) \)\(p\) 阶 Wasserstein 距离(\(p \ge 1\))。对于 \(\text{Prob}(\mathcal{Y})\) 上的两个测度 \(\alpha, \beta\)\( W_p^p(\alpha, \beta) = \inf_{\gamma \in \Pi(\alpha, \beta)} \int d^p(y, y') \, d\gamma(y, y') \),其中 \(d\)\(\mathcal{Y}\) 上的度量。
  • \( \overrightarrow{W}_p(\pi) \):本文定义的Wasserstein 相关系数(方向性,从 \(X\)\(Y\))。其定义为:
    \[\overrightarrow{W}_p(\pi) = \left( \int W_p^p(\pi_{x_1}, \nu) \, d\mu(x_1) \right)^{1/p}\]
    即,条件分布 \(\pi_{x_1}\) 与边缘分布 \(\nu\) 之间的 Wasserstein 距离的 \(p\) 次幂的期望,再开 \(p\) 次方。
  • \( \overleftarrow{W}_p(\pi) \):反向的 Wasserstein 相关系数(从 \(Y\)\(X\)),定义类似,交换 \(X\)\(Y\) 的角色。
  • \( \hat{\pi}_n \):基于 \(n\) 个独立同分布样本 \((X_i, Y_i)_{i=1}^n\)经验耦合,即 \(\frac{1}{n} \sum_{i=1}^n \delta_{(X_i, Y_i)}\)
  • \( \hat{\mu}_n, \hat{\nu}_n \):相应的经验边缘分布。
  • \( \hat{\pi}_{n, x_1} \):经验耦合 \(\hat{\pi}_n\) 关于第一坐标的分解。由于经验耦合是离散的,其分解也是离散的:给定 \(X = x_1\)\(Y\) 的条件分布是点质量在观测到的 \(Y_i\) 上(如果 \(X_i = x_1\)),否则未定义。

  • 模型:无参数模型。我们观测到来自某个未知联合分布 \(\pi \in \Pi(\mu, \nu)\) 的独立同分布样本。\(\mu\)\(\nu\) 是未知的,但被假定为 Polish 空间上的概率测度。没有\(\pi\) 的结构施加任何参数或半参数假设(如线性、可加性、单调性等)。这是一个完全非参数的设定。

  • 可观测数据:研究者实际能观测到的是 \(n\) 个独立同分布的对 \((X_i, Y_i) \in \mathcal{X} \times \mathcal{Y}\)想要但观测不到的是:

  • 真实的联合分布 \(\pi\)(只能通过经验分布 \(\hat{\pi}_n\) 近似)。
  • 真实的分解 \(\pi_{x_1}\)(给定 \(X=x_1\)\(Y\) 的条件分布)。由于 \(X\) 是连续的,对于大多数 \(x_1\) 值,我们可能没有或只有很少的观测值,因此 \(\pi_{x_1}\) 的估计是困难的。
  • 真实的边缘分布 \(\mu\)\(\nu\)(只能通过经验分布 \(\hat{\mu}_n\)\(\hat{\nu}_n\) 近似)。

第二步:讲最小内核

最简特例:假设 \(\mathcal{X} = \mathcal{Y} = \mathbb{R}\)(实直线),且 \(p=2\)(2-Wasserstein 距离)。进一步假设 \(X\)\(Y\) 都是连续型随机变量,且 \(Y\)\(X\) 的一个确定性函数,即 \(Y = f(X)\),其中 \(f\) 是某个可测函数。

在这个特例下,我们来理解 Wasserstein 相关系数 \(\overrightarrow{W}_2(\pi)\) 的含义和性质。

  1. 耦合 \(\pi\):由于 \(Y = f(X)\),联合分布 \(\pi\) 是退化的:所有概率质量集中在曲线 \((x, f(x))\) 上。给定 \(X = x_1\),条件分布 \(\pi_{x_1}\) 是一个点质量在 \(f(x_1)\) 上,即 \(\pi_{x_1} = \delta_{f(x_1)}\)

  2. Wasserstein 距离:对于任意 \(x_1\),条件分布 \(\pi_{x_1} = \delta_{f(x_1)}\) 与边缘分布 \(\nu\) 之间的 2-Wasserstein 距离为:

    \[W_2^2(\delta_{f(x_1)}, \nu) = \int (y - f(x_1))^2 \, d\nu(y) = \mathbb{E}_Y[(Y - f(x_1))^2]\]
    这是 \(f(x_1)\)\(Y\) 的分布之间的“距离”。注意,这里 \(W_2^2\) 的计算不依赖于任何耦合,因为 \(\delta_{f(x_1)}\) 是点质量。

  3. Wasserstein 相关系数

    \[\overrightarrow{W}_2^2(\pi) = \int W_2^2(\pi_{x_1}, \nu) \, d\mu(x_1) = \int \mathbb{E}_Y[(Y - f(x_1))^2] \, d\mu(x_1) = \mathbb{E}_X[\mathbb{E}_Y[(Y - f(X))^2 | X]]\]
    由于 \(Y = f(X)\),条件期望 \(\mathbb{E}_Y[(Y - f(X))^2 | X] = 0\) 几乎必然成立。因此,\(\overrightarrow{W}_2(\pi) = 0\)

  4. 反向相关系数:现在考虑反向 \(\overleftarrow{W}_2(\pi)\)。给定 \(Y = y_1\),条件分布 \(\pi_{y_1}\)\(X\) 在集合 \(\{x: f(x) = y_1\}\) 上的分布。如果 \(f\) 不是单射,这个集合可能包含多个点,因此 \(\pi_{y_1}\) 可能不是点质量。那么 \(W_2^2(\pi_{y_1}, \mu)\) 通常不为 0。因此,\(\overleftarrow{W}_2(\pi) > 0\)。这体现了该度量的方向性:它度量了“从 \(X\) 预测 \(Y\) 的难度”,而不是对称的依赖关系。

  5. 独立情形:如果 \(X\)\(Y\) 独立,则 \(\pi = \mu \otimes \nu\),且 \(\pi_{x_1} = \nu\) 对几乎所有 \(x_1\) 成立。因此,\(W_2(\pi_{x_1}, \nu) = 0\),从而 \(\overrightarrow{W}_2(\pi) = 0\)

  6. 一般情形:对于一般的依赖关系,\(\overrightarrow{W}_p(\pi)\) 度量了“给定 \(X\) 后,\(Y\) 的条件分布与 \(Y\) 的无条件分布之间的平均 Wasserstein 距离”。这个值越大,说明 \(X\)\(Y\) 的分布影响越大,即关联越强。当 \(Y\)\(X\) 的确定性函数时,该值为 0(因为条件分布退化为点质量,与边缘分布的距离被解释为“预测误差”,而确定性函数下预测误差为 0)。注意:这里“0 对应函数关系”与直觉相反(通常我们期望 1 对应函数关系)。作者通过归一化来处理这个问题,但最小内核的核心是理解这个未归一化的量。

核心思路:本文的核心思路是用条件分布与边缘分布之间的 Wasserstein 距离来量化关联。这个想法本身不新(类似于 ANOVA 中的“组间平方和”),但本文的创新在于: - 将其推广到一般 Polish 空间,利用 Wasserstein 距离的几何性质。 - 利用 adapted Wasserstein 距离 的理论来建立估计量的统计性质。具体来说,估计 \(\overrightarrow{W}_p(\pi)\) 需要估计分解 \(\pi_{x_1}\),而 adapted Wasserstein 距离提供了一种将“估计耦合”和“估计条件分布”统一起来的框架,使得强相合性和收敛速率的证明成为可能。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在一般 Polish 空间上,定义了一类新的非参数关联度量——Wasserstein 相关系数 \(\overrightarrow{W}_p(\pi)\),该度量通过耦合的分解来量化条件分布与边缘分布之间的 Wasserstein 距离。
  2. 核心工具/方法:利用 adapted/bicausal Wasserstein 距离 的理论框架,将 Wasserstein 相关系数的估计问题转化为 adapted 经验测度的收敛问题,从而建立估计量的统计性质。
  3. 主要结论:证明了基于经验耦合的估计量 \(\overrightarrow{W}_p(\hat{\pi}_n)\) 是强相合的;在 \(\mu\)\(\nu\) 具有紧支撑的条件下,给出了收敛速率 \(O_p(n^{-1/(2d)})\)(其中 \(d\)\(\mathcal{Y}\) 的维数);并推导了独立原假设下检验统计量的渐近分布。

关键设定与假设

  • 设定\((\mathcal{X}, d_{\mathcal{X}})\)\((\mathcal{Y}, d_{\mathcal{Y}})\) 是 Polish 空间。\(\mu \in \text{Prob}(\mathcal{X})\)\(\nu \in \text{Prob}(\mathcal{Y})\)\(\pi \in \Pi(\mu, \nu)\) 是未知的联合分布。观测到来自 \(\pi\)\(n\) 个独立同分布样本 \((X_i, Y_i)\)
  • 假设
  • A1 (Polish 空间)\(\mathcal{X}, \mathcal{Y}\) 是 Polish 空间。这是为了确保 Wasserstein 距离的良好性质(如完备性、紧致性)和分解的存在性。
  • A2 (有限 \(p\) 阶矩)\(\int d_{\mathcal{Y}}^p(y, y_0) \, d\nu(y) < \infty\) 对某个(从而任意)\(y_0 \in \mathcal{Y}\) 成立。这是 Wasserstein 距离 \(W_p\) 有限的前提。
  • A3 (紧支撑,用于收敛速率)\(\mu\)\(\nu\) 具有紧支撑。这是为了获得非渐近的收敛速率。如果去掉这个假设,强相合性仍然成立,但收敛速率可能更慢或需要额外条件。
  • 相比已有文献:与 Deb et al. (2020) 相比,本文不要求 \(\mathcal{X}, \mathcal{Y}\) 是 Hilbert 空间或 RKHS;与 Mordant & Segers (2021) 相比,本文的度量是方向性的,且统计理论更完整;与 Chatterjee (2019) 相比,本文适用于一般 Polish 空间。

主要结果

  1. 定理 3.1 (强相合性):设 \(\hat{\pi}_n\) 是经验耦合。那么,在假设 A1 和 A2 下,有
    \[\overrightarrow{W}_p(\hat{\pi}_n) \xrightarrow{a.s.} \overrightarrow{W}_p(\pi)\]
    即,基于经验耦合的 Wasserstein 相关系数几乎必然收敛到总体值。
  2. 直觉:这依赖于两个事实:(i) 经验耦合 \(\hat{\pi}_n\) 在 Wasserstein 距离下几乎必然收敛到 \(\pi\)(这是经典结果);(ii) 映射 \(\pi \mapsto \overrightarrow{W}_p(\pi)\) 在 Wasserstein 距离下是连续的。作者通过 adapted Wasserstein 距离来证明连续性,因为 \(\overrightarrow{W}_p(\pi)\) 可以表示为某个 adapted Wasserstein 距离的极限。
  3. 必要条件:Polish 空间和有限 \(p\) 阶矩。
  4. 解决的技术难点:直接证明 \(\overrightarrow{W}_p(\pi)\) 关于 \(\pi\) 的连续性并不显然,因为其定义涉及分解 \(\pi_{x_1}\),而分解对 \(\pi\) 的扰动可能不连续。作者通过将问题嵌入到 adapted Wasserstein 距离的框架中,利用该距离的连续性来绕过这个难点。

  5. 定理 3.2 (收敛速率):在假设 A1-A3 下(\(\mu, \nu\) 紧支撑),设 \(\mathcal{Y}\) 的覆盖维数为 \(d\)(对于 \(\mathbb{R}^d\)\(d\) 就是欧氏维数)。那么存在一个常数 \(C\),使得

    \[\mathbb{E}[|\overrightarrow{W}_p(\hat{\pi}_n) - \overrightarrow{W}_p(\pi)|] \leq C n^{-1/(2d)}\]
    即,估计量的均方误差以速率 \(n^{-1/(2d)}\) 收敛到 0。

  6. 直觉:这个速率与经验测度在 Wasserstein 距离下的收敛速率(Weed & Bach 2019, Fournier & Guillin 2015)一致。这是因为 \(\overrightarrow{W}_p(\pi)\) 的估计误差本质上由 \(\hat{\pi}_n\)\(\pi\) 之间的 adapted Wasserstein 距离控制,而后者又由普通的 Wasserstein 距离控制。
  7. 必要条件:紧支撑。这是为了应用 Weed & Bach (2019) 的有限样本界。
  8. 解决的技术难点:将 \(\overrightarrow{W}_p(\hat{\pi}_n) - \overrightarrow{W}_p(\pi)\) 的误差分解为两部分:一部分来自用 \(\hat{\pi}_n\) 近似 \(\pi\) 的误差,另一部分来自用经验分解 \(\hat{\pi}_{n, x_1}\) 近似 \(\pi_{x_1}\) 的误差。作者利用 adapted Wasserstein 距离的三角不等式和 Lipschitz 性质来统一控制这两部分。

  9. 推论 5.2 (独立性检验):在原假设 \(H_0: \pi = \mu \otimes \nu\)(即 \(X\)\(Y\) 独立)下,检验统计量 \(n \overrightarrow{W}_2^2(\hat{\pi}_n)\) 依分布收敛到一个非退化的极限分布(具体形式依赖于 \(\mu\)\(\nu\))。

  10. 直觉:在独立原假设下,\(\overrightarrow{W}_2(\pi) = 0\),但经验估计量 \(\overrightarrow{W}_2(\hat{\pi}_n)\) 不为 0。其波动性由样本量 \(n\)\(\mu, \nu\) 的几何性质决定。该推论给出了这个波动性的渐近分布,从而可以构造独立性检验。
  11. 必要条件\(\mu\)\(\nu\) 是连续的(无原子)。这是为了确保极限分布的非退化性。
  12. 解决的技术难点:推导极限分布需要处理退化 U-统计量。作者通过将 \(\overrightarrow{W}_2^2(\hat{\pi}_n)\) 表示为经验过程的泛函,并利用 adapted Wasserstein 距离的已有结果来得到极限分布。

证明路线与技术技巧

  • 整体路线
  • 嵌入 adapted Wasserstein 距离:定义 \(\mathcal{X} \times \mathcal{Y}\) 上的一个特殊度量,使得 \(\overrightarrow{W}_p(\pi)\) 可以表示为某个 adapted Wasserstein 距离 \(AW_p(\pi, \mu \otimes \nu)\) 的极限。具体来说,作者构造了一个“滤波”结构,将 \(\pi\) 视为一个两阶段随机过程(先抽 \(X\),再抽 \(Y|X\)),然后定义该过程与独立过程之间的 adapted Wasserstein 距离。
  • 连续性:证明映射 \(\pi \mapsto AW_p(\pi, \mu \otimes \nu)\) 在 Wasserstein 距离下是连续的(实际上是 Lipschitz 的)。这依赖于 adapted Wasserstein 距离的已知性质(Backhoff et al. 2020)。
  • 经验过程的收敛:利用经典结果,经验耦合 \(\hat{\pi}_n\) 在 Wasserstein 距离下几乎必然收敛到 \(\pi\),且在紧支撑假设下具有速率 \(n^{-1/(2d)}\)
  • 组合:由步骤 2 和 3,通过连续映射定理,得到 \(\overrightarrow{W}_p(\hat{\pi}_n)\) 的强相合性和收敛速率。

  • 关键跳跃点

  • \(\overrightarrow{W}_p(\pi)\)\(AW_p(\pi, \mu \otimes \nu)\) 的等价性:这是整个证明的基石。作者需要证明,对于任意耦合 \(\pi\)\(\overrightarrow{W}_p(\pi)\) 恰好等于 \(\pi\) 与独立耦合 \(\mu \otimes \nu\) 之间的某个 adapted Wasserstein 距离。这个等价性不是平凡的,它依赖于 adapted Wasserstein 距离的定义和耦合分解的性质。作者在引理 2.1 中建立了这个等价性。
  • 控制分解的误差:直接估计 \(\overrightarrow{W}_p(\hat{\pi}_n)\) 需要估计条件分布 \(\pi_{x_1}\),这在连续情况下是困难的。通过 adapted Wasserstein 距离的框架,作者将问题转化为估计整个联合分布 \(\pi\),从而避免了直接估计条件分布。这是该技术路线的核心优势。

  • 技术技巧点名

  • Adapted/Bicausal Wasserstein 距离:这是本文最核心的技术工具。它被用来建立 \(\overrightarrow{W}_p(\pi)\) 的连续性,并作为连接“估计耦合”和“估计关联度量”的桥梁。
  • 耦合分解 (Disintegration):这是定义 Wasserstein 相关系数的数学基础。作者利用 Polish 空间上分解的存在性和唯一性来严格定义 \(\pi_{x_1}\)
  • 经验过程理论:用于证明强相合性。虽然作者没有显式使用复杂的经验过程工具,但收敛性的证明本质上依赖于 Glivenko-Cantelli 类的结果。
  • Weed & Bach (2019) 的有限样本界:用于推导紧支撑假设下的收敛速率。这个界给出了经验测度在 Wasserstein 距离下的收敛速率 \(O_p(n^{-1/(2d)})\)

真实例子与应用

本文包含一个模拟实验(Section 5)和一个真实数据例子(Section 6)。

  • 模拟实验
  • 数据/场景:作者在 \(\mathcal{X} = \mathcal{Y} = \mathbb{R}\) 上,比较了四种独立性检验的势函数(power function):本文的 Wasserstein 相关系数检验、Chatterjee (2019) 的检验、距离协方差检验 (Székely et al. 2007) 和基于中心向外秩的检验 (Shi et al. 2019)。数据生成自一个具有参数 \(\rho \in [0, 1]\) 的二元正态分布(相关性从 0 到 1 变化)。
  • 如何应用:对于每种方法,计算检验统计量,并通过与渐近临界值比较来判断是否拒绝独立原假设。重复多次,记录拒绝频率作为势函数。
  • 结果:所有四种方法的势函数都随着 \(\rho\) 的增加而增加,且在大样本下都趋于 1。本文的方法(Wasserstein 相关系数)在中等样本量下表现与距离协方差相当,略优于 Chatterjee 的方法。
  • 想说明什么:验证了本文提出的检验统计量在简单(线性)依赖结构下是有效的,且与现有方法相比具有竞争力。

  • 真实数据例子

  • 数据/场景:使用了 UCI 机器学习库中的“Airfoil Self-Noise”数据集。该数据集包含 1503 个观测,目标是预测机翼的噪声水平(\(Y\)),预测变量包括频率、攻角、弦长等(\(X\) 是 5 维向量)。
  • 如何应用:作者计算了每个预测变量 \(X_j\) 与响应变量 \(Y\) 之间的 Wasserstein 相关系数 \(\overrightarrow{W}_2(\pi_j)\)(其中 \(\pi_j\)\(X_j\)\(Y\) 的联合分布),并与 Chatterjee 的相关系数、距离协方差和 Pearson 相关系数进行比较。
  • 结果:Wasserstein 相关系数识别出的最强预测变量与距离协方差一致,但与 Pearson 相关系数不同(因为依赖关系可能是非线性的)。作者还计算了方向性:\(\overrightarrow{W}_2\)(从 \(X\)\(Y\))和 \(\overleftarrow{W}_2\)(从 \(Y\)\(X\))的值不同,表明依赖关系是不对称的。
  • 想说明什么:展示了 Wasserstein 相关系数在多变量、非线性依赖场景下的实用性,以及其方向性在揭示依赖结构不对称性方面的价值。

🔎 结论是否比证明窄

  • 定理 3.1 (强相合性) 的证明依赖于 adapted Wasserstein 距离的连续性,而该连续性的证明在原文中引用了 Backhoff et al. (2020) 的结果。如果 Backhoff et al. (2020) 的证明有隐藏假设(如空间必须是紧致的),那么本文的强相合性可能只在更窄的条件下成立。作者在文中明确假设了 Polish 空间,但没有进一步讨论 Backhoff et al. (2020) 的假设是否完全被覆盖。
  • 定理 3.2 (收敛速率) 的证明明确假设了 \(\mu\)\(\nu\) 具有紧支撑。作者在定理陈述后提到,这个假设“可能可以放宽”,但没有给出具体的放宽方案或证明。因此,该收敛速率结论目前严格限于紧支撑情形。
  • 推论 5.2 (独立性检验) 的极限分布依赖于 \(\mu\)\(\nu\) 是连续的(无原子)。作者在推论陈述中明确提到了这个条件。如果 \(\mu\)\(\nu\) 有原子,极限分布可能不同,甚至可能退化。这是一个重要的限制,因为许多实际数据(如离散数据)不满足这个条件。

四、开放问题

  1. 收敛速率的紧性:定理 3.2 给出的收敛速率 \(n^{-1/(2d)}\) 是否是最优的?对于一般的 Polish 空间,这个速率是否可以达到 minimax 下界?这扎根于定理 3.2 的陈述和作者在文末的讨论(“确定最优收敛速率是一个有趣的问题”)。

  2. 非紧支撑情形下的收敛速率:当 \(\mu\)\(\nu\) 不具有紧支撑时,收敛速率会如何变化?是否依赖于矩条件或尾部分布的衰减速度?这扎根于定理 3.2 的假设 A3,以及作者在证明中引用的 Weed & Bach (2019) 的有限样本界,该界在非紧支撑下会退化。

  3. 计算复杂度与统计效率的权衡:本文没有讨论估计量的计算复杂度。对于高维 \(\mathcal{Y}\)(如 \(d\) 很大),计算 Wasserstein 距离的代价是巨大的。是否存在计算上更高效的替代估计量(如基于 Sinkhorn 散度或 sliced Wasserstein 距离)?这扎根于作者在引言中回避的计算问题,以及 Nies et al. (2021) 中提出的“计算成本显著降低的替代估计量”。

  4. 与因果推断的联系:Wasserstein 相关系数的方向性使其天然适用于度量“因果效应”或“预测能力”。能否将其与因果推断中的工具变量、前门准则等概念结合,用于定义和估计因果 Wasserstein 相关系数?这扎根于作者在文末的展望(“将我们的框架扩展到因果设定是一个有前景的方向”),以及该度量与 adapted Wasserstein 距离的紧密联系(后者在因果最优传输中已有应用)。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论