跳转至

Testing Equality of Distributions via Repeatedly Integrated Quantile Metrics Under Weak Moment Conditions

作者: Zhenfeng Zou, Meng Guan, Panxu Yuan
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2609.04935


一、领域脉络与小综述

这个方向是什么

两样本分布相等性检验(two-sample test)是非参数统计中最基础的问题之一:给定来自两个总体的独立样本,判断它们是否来自同一分布。该问题在临床试验、项目评估、金融尾部风险等领域有广泛应用。当前成熟度很高,已有大量经典方法(KS、CvM、AD、WMW、能量距离、MMD、Wasserstein距离等),但不同方法对矩条件、尾部行为、备择方向的敏感性差异很大。本文聚焦于基于分位数函数的Lp距离,试图在弱矩条件下(仅需一阶矩)构造一个既能检测整体分布差异、又对极端尾部不敏感的度量。

发展脉络(history)

  • 奠基工作:Kolmogorov (1933) 和 Smirnov (1939) 提出KS检验,基于经验分布函数的sup范数;Anderson (1962) 提出Cramér–von Mises检验,基于L2范数;Wilcoxon (1945) 和 Mann & Whitney (1947) 提出秩和检验。这些方法不依赖矩条件,但对某些备择(如尺度差异)功效有限。
  • 基于距离的进展:Baringhaus & Franz (2004) 和 Székely & Rizzo (2013) 提出能量距离(energy distance),Gretton et al. (2012) 提出最大均值差异(MMD),两者都嵌入再生核希尔伯特空间或特征函数,可检测任意分布差异,但能量距离需要有限一阶矩,MMD需要核的适当选择。
  • Wasserstein距离路线:Vallender (1974) 指出一维Wasserstein距离等价于分位数函数的Lp距离。del Barrio et al. (1999, 2005) 建立了经验Wasserstein距离的渐近理论,包括原假设和备择下的极限分布。Panaretos & Zemel (2019) 给出了综述。但p-Wasserstein距离要求有限p阶矩,且对尾部差异敏感(因为直接比较分位数点)。
  • 积分分位数函数与随机占优:Muliere & Scarsini (1989)、Wang & Young (1998)、Dentcheva & Ruszczyński (2006)、De La Cal & Cárcamo (2010) 等使用积分分位数函数来定义高阶随机占优或逆随机占优,但他们的目的是构造序关系,而非构造Lp度量。Rachev & Rüschendorf (1990) 使用积分分布函数定义stop-loss距离,但同样未用于两样本检验。
  • 本文位置:作者将积分分位数函数与Lp距离结合,构造Δ_{n,p}度量。当n=1时退化为Wasserstein;当n≥2时,重复积分平滑了分位数差异,使得度量仅需一阶矩即可有限。这填补了“弱矩条件下基于分位数的分布检验”这一缺口。

子线索聚类

  1. 经典非参数检验(KS、CvM、AD、WMW):基于经验分布函数或秩,矩条件弱,但对某些备择(如尾部差异)功效有限。
  2. 基于距离的检验(能量距离、MMD):嵌入特征空间,可检测任意差异,但能量距离需一阶矩,MMD需选择核,且对尾部敏感。
  3. Wasserstein距离检验:直接比较分位数函数,有完整渐近理论,但需有限p阶矩,且对极端尾部敏感。
  4. 随机占优与积分分位数:用于定义序关系,而非构造检验统计量。本文是第一条将积分分位数函数用于构造Lp度量的工作。

这个方向在追问的核心问题

  • 问题1:能否构造一个在弱矩条件下(仅一阶矩)仍有限、且能检测任意分布差异的度量?
  • 问题2:该度量的经验版本是否具有相合性和可处理的极限分布?
  • 问题3:该度量对极端尾部观测的敏感性如何?能否比Wasserstein更稳健?
  • 问题4:如何校准有限样本下的检验(置换检验是否有效)?

当前主流方法(Wasserstein、能量距离、MMD)要么需要高阶矩,要么对尾部敏感。已知瓶颈是:Wasserstein距离的矩条件不可放松(否则度量发散),而能量距离和MMD虽矩条件弱,但缺乏分位数层面的直观解释。

⚠️ 作者的framing(必须明确标注为“作者的说法”)

作者把缺口frame成:“现有基于分位数的度量(Wasserstein)需要有限p阶矩,且对极端上尾敏感;而重复积分可以平滑差异,使得度量在仅有一阶矩时有限,且累积地汇总分位数差异。” 作者淡化或回避了以下竞争路线: - 能量距离和MMD:作者在引言中承认它们“respond differently to different alternatives”,但在模拟和实证中将其作为基准,并强调Δ_{n,p}在“persistent same-direction quantile alternatives”下功效更高,且对尾部更不敏感。作者没有讨论能量距离和MMD在弱矩条件下的表现(例如Pareto(1.5)下能量距离是否有限?MMD是否仍有效?)。 - KS和CvM:作者仅在引言中列举,未在模拟中作为基准。这些方法矩条件弱,但可能对某些备择(如尺度差异)功效低。作者未比较Δ_{n,p}与KS/CvM在尾部稳健性上的差异。 - 什么明显该被引/该存在、却没出现在intro里?:作者未引用关于“分位数过程弱收敛”的经典教材(如van der Vaart & Wellner 1996/2023),虽然正文中使用了。此外,关于“置换检验在局部备择下的渐近等价性”的文献(如Chung & Romano 2013)被引用,但更早的经典结果(如Lehmann & Romano 2005)未提及。这些缺失不致命,但值得研究者去查是否遗漏了关键比较。

张力

未见明显对立引用。所有被引工作基本一致认为:Wasserstein距离需要矩条件,积分分位数函数用于随机占优。本文是第一个将两者结合用于检验的。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(F_X\):随机变量\(X\)的分布函数;\(F_X^{-1}(u) = \inf\{x: F_X(x) \ge u\}\),左连续分位数函数,\(u \in (0,1)\)。 - \(F_X^{[-n]}(u)\):\(n\)次积分分位数函数。\(n=1\)时就是\(F_X^{-1}\);\(n\ge 2\)时递归定义为\(F_X^{[-n]}(u) = \int_0^u F_X^{[-n+1]}(v) dv\)。等价于\(F_X^{[-n]} = A_n F_X^{-1}\),其中算子\(A_n\)定义为\((A_n \varphi)(u) = \frac{1}{(n-2)!} \int_0^u \varphi(v) (u-v)^{n-2} dv\)(对\(n\ge 2\))。 - \(\Delta_{n,p}(X,Y)\):\(L_p(0,1)\)距离 between \(F_X^{[-n]}\)和\(F_Y^{[-n]}\)。当\(n=1\)时就是p-Wasserstein距离\(W_p\)。 - \(N, M\):两样本大小;\(r_{N,M} = \sqrt{NM/(N+M)}\),标准化因子。 - \(\hat{F}_{X,N}^{-1}\):经验分位数函数;\(\hat{F}_{X,N}^{[-n]} = A_n \hat{F}_{X,N}^{-1}\)。 - \(B(u)\):标准布朗桥;\(B_F(u) = B(u)/f(F^{-1}(u))\),分位数过程的高斯极限。 - \(G_{n,F} = \sqrt{1-\lambda} A_n B_F^{(1)} - \sqrt{\lambda} A_n B_F^{(2)}\),其中\(B_F^{(1)}, B_F^{(2)}\)独立,\(\lambda = \lim N/(N+M)\)。

模型: - 数据生成:\(X_1,\dots,X_N \stackrel{i.i.d.}{\sim} F_X\),\(Y_1,\dots,Y_M \stackrel{i.i.d.}{\sim} F_Y\),两者独立。\(F_X, F_Y\)是\(\mathbb{R}\)上的分布。 - 参数/estimand:\(\Delta_{n,p}(X,Y)\)是总体度量。检验\(H_0: F_X = F_Y\)等价于\(\Delta_{n,p}=0\)(因为它是概率度量)。 - 已知/假设:当\(n\ge 2\)时,仅需\(X,Y \in L^1\)(一阶矩有限);当\(n=1\)时需\(X,Y \in L^p\)。渐近理论需要额外正则条件(C1-C2:密度光滑、尾部正则)。

可观测数据: - 可观测:两个独立样本\(\{X_i\}_{i=1}^N\)和\(\{Y_j\}_{j=1}^M\),每个是实数。 - 不可观测/潜在:总体分布\(F_X, F_Y\),分位数函数\(F_X^{-1}\),积分分位数函数\(F_X^{[-n]}\)。这些只能通过样本估计。

第二步:最小内核——特例\(n=2, p=2\)

去掉一般性假设,考虑最简情形:\(n=2, p=2\),即度量\(\Delta_{2,2}\)。此时:

\[F_X^{[-2]}(u) = \int_0^u F_X^{-1}(v) dv, \quad \Delta_{2,2}(X,Y) = \left( \int_0^1 \left[ \int_0^u (F_X^{-1}(v) - F_Y^{-1}(v)) dv \right]^2 du \right)^{1/2}.\]
为什么这个特例抓住了核心? 因为\(n=2\)是“重复积分”的最小非平凡情形(\(n=1\)是Wasserstein,已有理论)。\(p=2\)使得范数是Hilbert范数,便于分析(但论文也处理了一般\(p\))。

在这个特例下,论文的核心命题退化成什么? - 度量性质:\(\Delta_{2,2}\)是概率度量(非负、对称、三角不等式、\(\Delta_{2,2}=0 \iff F_X = F_Y\))。证明:若\(F_X \neq F_Y\),则\(F_X^{-1} - F_Y^{-1}\)在某个正测集上非零,其积分函数(即\(F_X^{[-2]} - F_Y^{[-2]}\))是连续函数,若恒为零则导数几乎处处为零,矛盾。 - 矩条件:仅需\(X,Y \in L^1\)。因为\(|F_X^{[-2]}(u)| \le \int_0^u |F_X^{-1}(v)| dv \le \mathbb{E}|X|\)(由分位数与期望的关系:\(\int_0^1 |F_X^{-1}(v)| dv = \mathbb{E}|X|\)),所以\(\Delta_{2,2} \le \mathbb{E}|X| + \mathbb{E}|Y| < \infty\)。而\(W_2\)需要二阶矩。 - 强相合性:\(\hat{\Delta}_{2,2}^{(N,M)} \xrightarrow{a.s.} \Delta_{2,2}\)。证明:经验分位数函数强相合于总体分位数函数(在\(L^1\)意义下),算子\(A_2\)是\(L^1 \to L^2\)的有界线性算子,所以连续映射给出相合性。 - 原假设下极限分布:若\(F_X = F_Y = F\),则\(r_{N,M} \hat{\Delta}_{2,2} \xrightarrow{d} \| G_{2,F} \|_2\),其中\(G_{2,F} = \sqrt{1-\lambda} A_2 B_F^{(1)} - \sqrt{\lambda} A_2 B_F^{(2)}\)。证明:经验分位数过程弱收敛到\(B_F\)(在\(L^2\)下),\(A_2\)是连续线性算子,所以\(A_2\)作用于过程后仍弱收敛,再取范数。 - 固定备择下极限分布:若\(\Delta_{2,2}>0\),则\(r_{N,M}(\hat{\Delta}_{2,2} - \Delta_{2,2}) \xrightarrow{d} N(0, \sigma^2)\)(因为\(p=2>1\),L2范数在非零点可微)。\(\sigma^2\)由\(h^*(u) = \mu(u)\)(因为\(p=2\)时\(| \cdot |^{p-1} \text{sgn}(\cdot) = \cdot\))给出。 - 局部备择:若\(F_{Y,K}^{-1} = F^{-1} + \frac{c}{r_K} h\),则\(r_K \hat{\Delta}_{2,2} \xrightarrow{d} \| A_2 h + G_{2,F} \|_2\)。

这个特例的证明思路:所有证明都依赖于算子\(A_2\)的线性性和有界性,以及经验分位数过程的已知弱收敛结果。论文的一般情形(任意\(n\ge 2, p\ge 1\))只是将\(A_2\)换成\(A_n\),将L2范数换成Lp范数,并处理\(p=1\)时的非可微性。因此,理解\(n=2, p=2\)就抓住了论文的数学核心。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:提出了基于重复积分分位数函数的一类新概率度量\(\Delta_{n,p}\),用于两样本分布相等性检验,在\(n\ge 2\)时仅需有限一阶矩即可定义。
  2. 核心工具/方法:利用线性算子\(A_n\)将分位数差映射到光滑函数,结合经验分位数过程的弱收敛理论和置换检验。
  3. 主要结论:证明了\(\Delta_{n,p}\)是概率度量且收敛蕴含弱收敛;建立了plug-in统计量的强相合性、原假设和固定备择下的极限分布、局部备择下的渐近功效;置换检验有限样本有效且相合;模拟和实证表明对尾部不敏感。

关键设定与假设

  • 完整设定:两独立样本,分布定义在\(\mathbb{R}\)上。\(n\ge 2, p\in[1,\infty]\)。当\(n=1\)时需\(L^p\),当\(n\ge 2\)时仅需\(L^1\)。
  • 假设C1(内部正则性与可积性):分布函数\(F\)二次可微,密度\(f\)在支撑内部为正,且\(\int_0^1 \frac{t(1-t)}{f^2(F^{-1}(t))} dt < \infty\),\(\sup_{0<t<1} \frac{t(1-t)|f'(F^{-1}(t))|}{f^2(F^{-1}(t))} < \infty\)。这保证了经验分位数过程在\(L^2(0,1)\)中弱收敛到\(B_F\)(del Barrio et al. 2005, Theorem 4.6(i))。
  • 假设C2(端点正则性):支撑端点处密度行为有下界(避免极端稀疏)。与C1一起确保弱收敛在\(L^2\)中成立。
  • 假设C3(局部分位数过程收敛):在三角阵列下,经验分位数过程(中心化后)弱收敛到独立布朗桥。这是高层次的,论文在附录中给出了充分条件(如Lipschitz扰动)。
  • 假设C4(局部备择方向):\(r_K (F_{X,K}^{-1} - F_{Y,K}^{-1}) \to \eta\) in \(L^2\),其中\(\eta\)是固定函数。
  • 相比已有文献:对于Wasserstein距离,del Barrio et al. (1999, 2005) 需要\(L^p\)矩和类似正则条件。本文的C1-C2与Wasserstein文献中的条件类似,但额外要求\(n\ge 2\)时仅需一阶矩,因此正则条件只用于渐近分布,而非度量定义。

主要结果

  • 定理3.1(强相合性):若\(X,Y \in L^1\),则对任意\(n\ge 2, p\in[1,\infty)\),\(\hat{\Delta}_{n,p}^{(N,M)} \xrightarrow{a.s.} \Delta_{n,p}\)。无需光滑性假设。
  • 定理3.2(原假设极限分布):在C1-C2下,\(r_{N,M} \hat{\Delta}_{n,p} \xrightarrow{d} \| G_{n,F} \|_p\),其中\(G_{n,F}\)是中心化高斯过程的\(A_n\)变换。极限一般非正态。
  • 定理3.3(固定备择极限分布):若\(\Delta_{n,p}>0\),则当\(p>1\)时,\(r_{N,M}(\hat{\Delta}_{n,p} - \Delta_{n,p}) \xrightarrow{d} N(0, \sigma^2_{n,p})\);当\(p=1\)时,极限是混合分布(取决于\(\mu\)的零测集)。
  • 定理3.5(置换检验相合性):在固定备择下,置换检验的功效趋于1。
  • 定理3.6(局部备择极限分布):在C1-C4下,\(r_K \hat{\Delta}_{n,p} \xrightarrow{d} \| A_n \eta + G_{n,F} \|_p\)。推论3.7给出渐近功效\(\beta_{n,p}(\eta) = P(\| A_n \eta + G_{n,F} \|_p > c_{n,p,F}(1-\alpha))\)。

证明路线与技术技巧

整体路线(以定理3.2为例): 1. 经验分位数过程弱收敛:在C1-C2下,\(\sqrt{N}(\hat{F}_{X,N}^{-1} - F^{-1}) \xrightarrow{d} B_F\) in \(L^2(0,1)\)(del Barrio et al. 2005)。 2. 算子传递:\(A_n\)是\(L^2(0,1) \to L^p(0,1)\)的有界线性算子(对任意\(p\in[1,\infty]\)),由连续映射定理,\(\sqrt{N} A_n(\hat{F}_{X,N}^{-1} - F^{-1}) \xrightarrow{d} A_n B_F\) in \(L^p\)。 3. 联合收敛:两样本独立,所以联合过程收敛到独立高斯过程的差,即\(\sqrt{N+M} A_n(\hat{F}_{X,N}^{[-n]} - \hat{F}_{Y,M}^{[-n]}) \xrightarrow{d} G_{n,F}\)(适当缩放)。 4. 范数映射:由于\(L^p\)范数是连续函数(但非可微),连续映射定理给出\(r_{N,M} \hat{\Delta}_{n,p} \xrightarrow{d} \| G_{n,F} \|_p\)。

关键跳跃点: - 跳跃1:经验分位数过程在\(L^2\)中的弱收敛需要C1-C2,这是已知结果,但论文需要验证这些条件对常见分布(如指数幂、Weibull)成立(附录S4)。 - 跳跃2:算子\(A_n\)的\(L^1 \to L^p\)有界性证明(引理S2.1)。由于\(A_n\)是积分算子,其范数有界于\(1/(n-2)!\),这保证了即使分位数差只有\(L^1\),\(A_n\)作用后也在\(L^\infty\)中,从而所有\(L^p\)范数有限。 - 跳跃3:固定备择下\(p=1\)时的非可微性处理。论文将\(L^1\)范数分解为\(\mu\)非零集和零集上的积分,零集上出现绝对值积分,导致极限非正态。这需要细致的测度论分析。

技术技巧点名: - 经验过程理论:用于分位数过程的弱收敛(del Barrio et al. 2005的结果)。 - 连续映射定理:用于算子\(A_n\)和范数映射。 - Delta方法:用于\(p>1\)时Lp范数在非零点的可微性,得到正态极限。 - 置换检验的有限样本有效性:基于交换性,加一规则控制水平。 - 局部备择的三角阵列弱收敛:需要条件C3-C4,论文在附录中给出充分条件(如Lipschitz扰动),并引用van der Vaart & Wellner (2023)的均匀连续性条件(3.7)来保证置换检验的渐近功效。

真实例子与应用

  • 数据:美国JTPA(Job Training Partnership Act)研究,成年女性样本(6102人,4088 offer组,2014 control组),30个月收入。有零收入点质量和长右尾。
  • 方法应用:使用8种检验(W1, W2, Δ_{2,1}, Δ_{2,2}, Δ_{3,1}, Δ_{3,2}, 能量距离, MMD),通过站点分层随机化推断(置换检验,9999次)。先检验基线(pre-program earnings)平衡,所有检验不拒绝;再检验30个月收入分布,所有检验拒绝(Holm调整后p值≤0.012)。
  • 结果:Δ_{n,p}的分离分数(标准化统计量)在4.37-4.88之间,低于能量距离(7.03)和MMD(6.06),但作者强调这是描述性的,不直接比较功效。关键发现:对99%分位数截断(winsorization),W1和W2分别下降3.39%和5.82%,而Δ_{2,1}仅下降0.04%,Δ_{3,1}下降0.0006%,表明Δ_{n,p}对极端上尾极不敏感。能量距离下降0.20%,MMD上升1.45%。
  • 这个例子想说明:Δ_{n,p}在保持检验能力的同时,对极端尾部观测的敏感性远低于Wasserstein距离,且累积分位数差距(A2g, A3g)提供了直观解释。

🔎 结论是否比证明窄

  • 定理3.1(强相合性) 只对\(p\in[1,\infty)\)证明,\(p=\infty\)未覆盖。论文在定义中包含了\(p=\infty\),但强相合性结果未给出(可能因为sup范数需要更精细的Glivenko-Cantelli型结果)。作者在定理陈述中明确写了\(p\in[1,\infty)\),所以没有过度claim。
  • 定理3.2和3.3 也只对\(p<\infty\)。\(p=\infty\)的极限分布需要单独分析(因为L∞范数非可微且不紧),论文明确说“not considered here”。
  • 局部备择(定理3.6) 要求条件C3-C4,其中C3是高层次的。论文在附录中给出了充分条件,但未证明这些条件对一般局部备择模型(如位置-尺度扰动)都成立。读者需要自行验证。
  • 置换检验的渐近功效(推论3.7) 需要条件(3.7)(置换分布均匀收敛到极限),论文引用标准结果,但未给出具体验证。对于重尾分布(如Pareto),该条件可能不成立,但模拟中仍使用置换检验并报告了功效。

四、开放问题(点到为止,扎根具体语句)

  1. 多元/高维扩展:论文结论明确说“the present study is restricted to univariate independent samples. Future work may extend the method to multivariate and high-dimensional two-sample testing”(Section 6)。对于高维情形,分位数函数定义困难(需要排序),但可通过投影或copula方法推广。扎根于论文最后一段。

  2. 时间序列与相依数据:同样在Section 6提到“develop theory and resampling procedures for time-series and other dependent data”。当前假设独立样本,对于序列数据,经验分位数过程的弱收敛需要不同的条件(如混合性),且置换检验不再直接适用。

  3. \(p=\infty\)的渐近理论:论文对\(p=\infty\)的极限分布未处理(Theorem 3.2, 3.3, 3.6都限于\(p<\infty\))。对于\(p=\infty\),\(\Delta_{n,\infty}\)是sup范数,其极限分布是高斯过程的sup,但需要处理算子\(A_n\)在L∞下的紧性。这是一个开放的技术问题,扎根于论文第3节开头“its supremum-norm counterpart requires a separate directional analysis and is not considered here”。

  4. 最优性(minimax)问题:论文未讨论该检验在何种意义下最优(如对某类备择的渐近功效上界)。研究者可以用非常熟悉的minimax界工具来评估\(\Delta_{n,p}\)在特定备择类(如Hölder光滑的密度差异)下的最优性。这并非论文直接留下的问题,但可以从“该度量是否达到某类备择的检测边界”角度追问。扎根于论文未提及任何minimax结果。

提醒:要确认第4条是否是真gap,建议去读近期关于分布检验minimax最优性的文献(如Ingster & Suslina 2003, Arias-Castro et al. 2018等),看是否有已知结果。如果已有结果,则本文的度量可能只是另一种实现;如果无,则是一个有价值的方向。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论