跳转至

Berry--Esseen bounds and bootstrap approximations for the Hilbert-space norm of \(U\)-statistics

作者: Nilanjan Chakraborty, Sayan Das
主题: 其他
相关性: 9/10
链接: https://arxiv.org/abs/2608.25463


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是:高维或函数型统计量的非渐近分布逼近,具体针对取值于可分Hilbert空间(可随样本量变化)的非退化U-统计量的Hilbert空间范数,建立其与高斯分布之间的Kolmogorov距离的显式上界,以及可行的bootstrap逼近的误差界。该方向的核心统计问题是:在什么条件下,一个非线性统计量的范数分布可以被高斯分布或bootstrap分布以可验证的有限样本精度逼近?当前成熟度:对于样本均值向量,已有大量非渐近结果(Chernozhukov et al. 2023综述),但对于U-统计量这类非线性统计量,尤其是其范数(而非坐标极大值)的逼近,理论尚不完整。

发展脉络(从intro + 参考文献构建)

  • 奠基工作:Hoeffding (1948) 提出U-统计量及其Hájek投影,奠定了渐近正态性的基础。Berry (1941)、Esseen (1942) 建立了经典Berry-Esseen定理。Callaert & Janssen (1978) 将Berry-Esseen定理推广到实值非退化U-统计量,得到n^{-1/2}率。
  • 主要进展(Hilbert值U-统计量):Korolyuk & Borovskikh (1990) 和 Borovskikh et al. (1997) 研究了Hilbert值U-统计量的正态逼近率,但依赖于全局谱约束:前者要求协方差算子有无穷多正特征值,后者将其减弱为至少九个正特征值。这些工作使用特征函数光滑化技术,得到的率是n^{-1/2},但假设较强。
  • 主要进展(高维U-统计量的bootstrap):Chen (2018)、Chen & Kato (2019) 在高维R^d中建立了U-统计量在超矩形上的bootstrap逼近界,但需要次指数或多项式尾假设,且结果针对ℓ∞范数而非ℓ2范数。
  • 主要进展(高维均值向量的Berry-Esseen界):Fang & Koike (2024) 在四阶矩条件下,对均值向量在凸集和球上建立了Berry-Esseen界,其技术(Stein方法在R^d中的推广)是本文的直接前驱。
  • 本文位置:作者将上述两条线(Hilbert值U-统计量的正态逼近 + 高维均值向量的四阶矩Berry-Esseen界)结合,在更弱的谱条件(仅需两个最大特征值正)和更弱的矩条件(四阶矩有限)下,对Hilbert值U-统计量的范数建立非渐近Berry-Esseen界(率n^{-1/8}),并首次给出三种bootstrap的非渐近逼近界。同时,将结果应用于Kendall's tau的检验,并证明分离率d^{1/4}/√n是minimax最优的。

子线索聚类

  1. 经典U-统计量渐近理论:Hoeffding (1948)、Serfling (2009)、Lee (2019)、Korolyuk & Borovskich (2013) —— 提供Hoeffding分解、Hájek投影等基础工具。
  2. Hilbert值U-统计量的正态逼近:Korolyuk & Borovskikh (1990)、Borovskikh et al. (1997) —— 需要强谱条件(无穷多或至少九个正特征值),得到n^{-1/2}率。
  3. 高维U-统计量的bootstrap逼近:Chen (2018)、Chen & Kato (2019) —— 针对超矩形上的ℓ∞范数,需要次指数尾假设。
  4. 高维均值向量的非渐近Berry-Esseen界:Fang & Koike (2024) —— 四阶矩条件,凸集和球上的结果,Stein方法在R^d中的推广。

核心问题与已知瓶颈

  • 核心问题1:在什么谱和矩条件下,U-统计量范数的分布可以被高斯分布以非渐近速率逼近?已知瓶颈:现有Hilbert值结果要求协方差算子有足够多的正特征值(至少九个),且矩条件较强(三阶矩有限)。
  • 核心问题2:当协方差算子奇异或近似低秩时,逼近速率如何依赖于谱几何?已知瓶颈:经典方法(特征函数光滑化)无法处理奇异协方差。
  • 核心问题3:如何构造可行的bootstrap程序并给出非渐近保证?已知瓶颈:对于U-统计量,Hájek投影的协方差算子难以直接估计,bootstrap的误差分析需要处理高阶剩余项。
  • 核心问题4:这些结果如何应用于高维假设检验,并达到minimax最优分离率?已知瓶颈:对于Kendall's tau这类U-统计量,检验的分离率与协方差谱的关系尚不明确。

⚠️ 作者的framing

作者将缺口frame为:“现有Hilbert值U-统计量的Berry-Esseen界依赖于全局谱条件(无穷多正特征值或至少九个),而本文在仅需两个最大特征值正且四阶矩有限的条件下,得到n^{-1/8}率,并推广到bootstrap”。竞争路线(如Chen 2018的次指数假设)被淡化,因为本文用更弱的四阶矩条件。明显该被引但没出现在intro里的:可能包括一些关于退化U-统计量的工作(如Gretton et al. 2012的MMD^2检验,但本文在3.3节讨论了MMD的非退化版本),以及关于U-统计量在ℓ∞范数下的高维结果(如Leung & Drton 2018的秩相关检验)。此外,关于协方差算子谱几何的近期工作(如Lopes 2025, Bunea & Xiao 2015)在本文中被引用,但未在intro中详细讨论其与本文假设的对比。

张力

未见明显对立引用。作者在讨论中(第12页)明确提到,Borovskikh et al. (1997) 的n^{-1/2}率在更弱假设下是否能达到是开放问题,这暗示了率与假设强度之间的张力。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号:
  • X = {X_1, ..., X_n}:独立(不一定同分布)随机元,取值于可测空间X。
  • H_n:可分Hilbert空间,可随样本量n变化。内积⟨·,·⟩,范数∥·∥。
  • \tilde{h}: X^r → H_n:对称核,阶数r固定。通常省略下标n。
  • θ = E[U_n]:U-统计量的期望。
  • U_n = (1/ C(n,r)) Σ_{1≤i1<...<ir≤n} \tilde{h}(X_{i1},...,X_{ir}):U-统计量。
  • T_n = √n (U_n - θ)/r:标准化统计量(目标)。
  • Z_n ~ N_{H_n}(0, Γ_n):高斯近似,Γ_n是Hájek投影的协方差算子。
  • L_n:Hájek投影的线性部分(见(4)),L_n = (1/√n) Σ_{i1=1}^n g^{(i1)}(X_{i1})。
  • R_n:高阶退化剩余部分(见(6)),满足T_n = L_n + R_n。
  • Γ_n = Cov(L_n) = (1/n) Σ_{i1=1}^n E[g^{(i1)}(X_{i1}) ⊗ g^{(i1)}(X_{i1})]:Hájek投影协方差算子。
  • ℓ_n = 1 - ∥Γ_n∥_op^2 / ∥Γ_n∥_HS^2:谱分散比例,ℓ_n > 0当且仅当至少两个特征值正。
  • m_n = max_{(i1,...,ir)∈C_n^r} E∥\tilde{h}(X_{i[1:r]})∥^4:核的四阶矩。
  • g^{(i1)}(x):第一阶投影函数(见(4)下方定义)。
  • f_i:剩余核(见(6)下方定义),满足一阶退化性。

  • 模型:

  • 数据生成机制:X_1,...,X_n独立,但未必同分布。核\tilde{h}对称,取值于H_n。U_n是\tilde{h}的U-统计量。目标是T_n = √n (U_n - θ)/r的范数分布。

  • 可观测数据:

  • 可观测:X_1,...,X_n。核\tilde{h}是已知函数(但可能依赖于未知分布参数)。因此U_n可计算。
  • 不可观测(潜在量):θ, Γ_n, g^{(i1)}, f_i等。这些需要通过数据估计或通过bootstrap逼近。

第二步:最小内核——最简特例

考虑最简特例:r=2(二阶U-统计量),H_n = R^d(d维欧氏空间),且观测i.i.d.。此时: - 核h: X^2 → R^d对称。 - U_n = (2/(n(n-1))) Σ_{1≤i<j≤n} h(X_i, X_j)。 - θ = E[h(X_1, X_2)]。 - T_n = √n (U_n - θ)/2。 - Hájek投影:L_n = (2/√n) Σ_{i=1}^n g(X_i),其中g(x) = E[h(x, X_2)] - θ。 - Γ_n = Cov(g(X_1))(d×d协方差矩阵)。 - 剩余R_n = T_n - L_n,是退化U-统计量(一阶退化)。

核心思路:通过Hoeffding分解T_n = L_n + R_n,其中L_n是独立和(g(X_i) i.i.d.),R_n是低阶项(E∥R_n∥^2 = O(1/n))。对L_n用Stein方法(Fang & Koike 2024在R^d中的版本)得到Berry-Esseen界,对R_n用矩控制。最终误差由L_n的谱几何(ℓ_n)和R_n的方差决定。

在这个特例下,定理2.1退化成什么? - 定理2.1的界Δ_n中的A_{1,n}, A_{2,n}, A_{3,n}简化为: - A_{1,n} ≲ (∥Γ_n∥_HS m_n / n + ∥Γ_n∥_op^{3/2} m_n^{3/4} / √n)^{1/4} / ∥Γ_n∥_HS^{3/4}。 - A_{2,n} ≲ (∥Γ_n∥_op^{1/2} m_n^{3/4} / √n + m_n / n)^{1/3} / ∥Γ_n∥_HS^{2/3}。 - A_{3,n} ≲ (E tr(Γ_{n,R}) + (E tr(Γ_{n,R}) E tr(Γ_n))^{1/2})^{1/2} / ∥Γ_n∥_HS^{1/2}。 - 在i.i.d.且r=2下,m_n = E∥h(X_1,X_2)∥^4,Γ_n = Cov(g(X_1)),Γ_{n,R} = Cov(R_n)。 - 若进一步假设∥Γ_n∥_HS ≍ 1,∥Γ_n∥_op ≍ 1,ℓ_n ≍ 1(即至少两个特征值正且非退化),且m_n < ∞,则Δ_n = O(n^{-1/8})(命题2.2的特例)。

为什么这个特例抓住了核心? 因为一般情形(任意r、非i.i.d.、无限维H_n)的证明只是这个特例的“加壳”:用更一般的Hilbert空间Stein方法(引理A.2)替代R^d版本,用更复杂的矩估计处理非i.i.d.和高阶项,但核心结构(Hoeffding分解 + Stein方法 + 反集中不等式)完全相同。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:取值于可分Hilbert空间H_n(可随样本量变化)的非退化U-统计量的Hilbert空间范数的非渐近高斯逼近和bootstrap逼近问题,并应用于高维Kendall's tau的检验。
  2. 核心工具/方法:Hilbert空间版本的Stein方法(引理A.2),结合对Hoeffding分解中高阶项的精细矩控制,以及谱几何量ℓ_n(衡量协方差算子在前导方向之外的平方谱质量占比)。
  3. 主要结论:建立了Berry-Esseen界(在固定Hilbert空间下为O(n^{-1/8}))和三种bootstrap(经验、高斯加权、jackknife乘子)的逼近界(EB: n^{-1/8}, GWB/JMB: n^{-1/6}),并证明Kendall's tau检验的分离率d^{1/4}/√n在稠密高斯相关备择下是minimax最优的。

关键设定与假设

  • 设定:X_1,...,X_n独立(未必同分布),核\tilde{h}: X^r → H_n对称,阶数r固定。H_n是可分Hilbert空间,可随n变化。目标:T_n = √n (U_n - θ)/r的范数分布。
  • 假设:
  • 四阶矩有限:m_n = max_{(i1,...,ir)∈C_n^r} E∥\tilde{h}(X_{i[1:r]})∥^4 < ∞(定理2.1)。在R^d中,弱化为坐标四阶矩有限(条件(B.1))。
  • 谱分散条件:ℓ_n = 1 - ∥Γ_n∥_op^2 / ∥Γ_n∥_HS^2 > 0,即至少两个特征值正(定理2.1)。在固定Hilbert空间下,强化为λ_{(2)}(Γ_n) > 1/C(条件(A.2))。
  • bootstrap额外假设:一阶平衡条件(A.3):\bar{θ}_{i1} = θ对所有i1成立,确保bootstrap协方差估计无偏。在R^d中,可选条件(B.3)(子高斯型投影)以改进算子范数估计。
  • 相比已有文献的放宽/强化:相比Borovskikh et al. (1997)(需要至少九个正特征值),本文仅需两个;相比Chen (2018)(需要次指数尾),本文仅需四阶矩有限。代价是率从n^{-1/2}降为n^{-1/8}。

主要结果

  • 定理2.1(一般Hilbert空间):d_Kol(∥T_n∥, ∥Z_n∥) ≲ Δ_n,其中Δ_n = ℓ_n^{-3/16} A_{1,n} + ℓ_n^{-1/6} A_{2,n} + ℓ_n^{-1/8} A_{3,n},A_{1,n}, A_{2,n}, A_{3,n}由m_n、∥Γ_n∥_HS、∥Γ_n∥_op和剩余协方差Γ_{n,R}定义。
  • 命题2.2(固定Hilbert空间,条件(A.1)(A.2)):d_Kol ≲ n^{-1/8},率与维数无关。
  • 命题2.3(高维R^d,条件(B.1)(B.2)):d_Kol ≲ Δ_{n,d},其中Δ_{n,d}显式依赖于d和谱指数q1,q2(见(7))。例如,当Γ_n = I_d时,Δ_{n,d} ≲ max{(d/n)^{1/6}, n^{-1/8}}。
  • 定理2.5(bootstrap逼近):对EB、GWB、JMB,给出E[d^⋆_Kol(∥T^⋆_n∥, ∥Z_n∥)]的上界,包含三项:线性部分的条件高斯逼近误差(仅EB有)、高阶bootstrap剩余项(EB和GWB有)、协方差估计误差(三者均有)。
  • 命题2.7(固定Hilbert空间,条件(A.1)-(A.3)):EB: n^{-1/8},GWB/JMB: n^{-1/6}。
  • 命题2.8(高维R^d,条件(B.1)(B.2)(A.3)):bootstrap界Δ^*_{n,d},比高斯逼近多一项协方差估计项(见(10))。若额外假设(B.3),则bootstrap界与高斯逼近界相同。
  • 命题3.1(检验一致性):在∥θ∥ ≥ C_{α,r} {tr(Γ_n^2)}^{1/4} a_n / √n且a_n → ∞时,bootstrap检验的势趋于1。
  • 命题3.3(Kendall's tau的minimax下界):对稠密高斯相关备择,任何渐近水平α检验在分离率o(d^{1/4}/√n)下不能一致有势。结合命题3.1,d^{1/4}/√n是minimax最优分离率。

证明路线与技术技巧

整体路线(以定理2.1为例): 1. Hoeffding分解:T_n = L_n + R_n,其中L_n是独立和(Hájek投影),R_n是退化剩余。 2. 光滑化:用光滑函数v_{η,τ}(引理A.1)逼近指示函数,将Kolmogorov距离转化为光滑函数期望差。 3. 三角不等式:|E v(T_n) - E v(Z_n)| ≤ |E v(T_n) - E v(L_n)| + |E v(L_n) - E v(Z_n)|。 4. 控制|E v(T_n) - E v(L_n)|:用引理A.1(iv)的Lipschitz性质,转化为E∥R_n∥^2和E∥L_n∥^2的界(引理B.1给出E∥R_n∥^2 = O(1/n),E∥L_n∥^2 = tr(Γ_n))。 5. 控制|E v(L_n) - E v(Z_n)|:用Hilbert空间Stein方法(引理A.2),得到依赖于Γ_n的谱量和g^{(i1)}的四阶矩的界。 6. 反集中不等式:用引理A.3(Götze et al. 2019)控制P(η < ∥Z_n∥^2 ≤ η+τ),其界为ℵ(Γ_n) τ,其中ℵ(Γ_n) = (Λ_1(Γ_n) Λ_2(Γ_n))^{-1/2} = ∥Γ_n∥_HS^{-1} ℓ_n^{-1/4}。 7. 优化τ:选择τ平衡三项误差,得到最终界Δ_n。

关键跳跃点: - 将Stein方法从R^d推广到无限维Hilbert空间:需要处理迹类算子、Fréchet导数、Ornstein-Uhlenbeck积分表示(引理A.2的证明)。关键技巧是使用v_{η,τ}的Hessian有界性(引理A.1(iii))和泰勒展开。 - 控制剩余项R_n的协方差:只有至少两个共同索引的核对才贡献非零期望,通过组合计数得到E∥R_n∥^2 = O(1/n)(引理B.1)。 - 处理非i.i.d.:在Hájek投影和bootstrap中,需要条件(A.3)确保bootstrap协方差估计无偏,否则会出现额外偏差项B_n(见第21页)。

技术技巧点名: - Stein方法在Hilbert空间:引理A.2,使用Ornstein-Uhlenbeck过程求解Stein方程。 - 高斯反集中不等式:引理A.3,来自Götze et al. (2019),给出球上概率的上界。 - 高斯比较引理:引理A.4,用于bootstrap中比较两个高斯分布(协方差不同)。 - Hoeffding分解的矩估计:引理B.1、B.2,通过组合计数控制剩余项的方差。 - bootstrap的协方差估计:引理B.3、B.4,证明E∥\hat{Γ}_n - Γ_n∥_HS = O(n^{-1/2})等。

真实例子与应用

  • Kendall's tau检验(第26-28页):d = p(p-1)/2维向量,核h(x,y) = vech(sign(x-y) sign(x-y)^T)。应用命题3.1和3.3,证明bootstrap检验在分离率d^{1/4}/√n下一致有势,且该率是minimax最优的。数据:X_i ~ N_p(0, R),备择为局部高斯相关结构。这个例子验证了理论:分离率由tr(Γ_n^2)^{1/4}/√n给出,而tr(Γ_n^2) ≍ d,故为d^{1/4}/√n。
  • Spearman's rank correlation(第28-29页):表示为三阶U-统计量\hat{ρ}_{uv}和二阶U-统计量\hat{τ}_{uv}的线性组合,应用命题2.3得到Berry-Esseen界。
  • MMD estimator(第30-31页):在RKHS中,MMD_n = ∥\hat{μ}_1 - \hat{μ}_2∥可表示为二阶U-统计量的范数,且非退化(除非特征映射几乎处处常数)。这展示了本文结果在双样本检验中的应用。
  • Mean and covariance operators in Hilbert space(第31页):样本均值和协方差算子可表示为U-统计量,用于检验两个函数样本的协方差相等。
  • Wilcoxon-Mann-Whitney type test for Hilbert valued observations(第31-32页):空间符号的U-统计量,用于位置偏移检验。

🔎 结论是否比证明窄

  • 定理2.1的界依赖于ℓ_n,当ℓ_n很小时(协方差近似秩1),界变差。作者指出这反映了反集中困难,但未证明该依赖是否必要。
  • 命题2.2的n^{-1/8}率可能不是最优的。作者在第12页明确说:“It remains open to see whether, under similar assumptions (A.1)–(A.2), the optimal rate of n^{-1/2} can be achieved”。因此,结论(n^{-1/8})比可能的最优率窄。
  • bootstrap的n^{-1/6}率(GWB/JMB)比EB的n^{-1/8}好,但需要条件高斯性。作者未证明该率是否紧。
  • 命题3.1的分离率条件∥θ∥ ≥ C {tr(Γ_n^2)}^{1/4} a_n / √n是充分的,但作者未证明必要性(除了Kendall's tau的minimax下界)。对于一般U-统计量,该条件是否必要是开放的。

四、开放问题(扎根具体语句)

  1. 最优率问题:在类似假设(A.1)-(A.2)下,能否达到n^{-1/2}的Berry-Esseen率?作者在第12页明确写道:“It remains open to see whether, under similar assumptions (A.1)–(A.2), the optimal rate of n^{-1/2} can be achieved”。这是最直接的开放问题,扎根于论文的讨论部分。

  2. 退化U-统计量的推广:本文专注于非退化U-统计量(ℓ_n > 0)。但许多实际应用(如MMD^2检验在H0下)涉及退化U-统计量。作者在3.3节讨论了MMD的非退化版本,但未处理退化情形。扎根于:本文所有定理均假设非退化(ℓ_n > 0),且Hoeffding分解中剩余项的控制依赖于非退化性。

  3. bootstrap条件(A.3)的放松:条件(A.3)要求\bar{θ}_{i1} = θ对所有i1成立,这在非i.i.d.情形下较强。作者在Remark 2.6中讨论了渐近平衡条件tr(B_n)/∥Γ_n∥_HS → 0,但未给出具体界。扎根于第21页Remark 2.6:“The exact equality in Condition (A.3) may be replaced by an asymptotic balance condition... We impose the exact balance condition to avoid these additional terms”。

  4. 高维情形下谱指数的自适应:命题2.3的界依赖于未知谱指数q1, q2(∥Γ_n∥_op ≍ d^{q1}, ∥Γ_n∥_F ≍ d^{q2})。在实际应用中,这些指数未知。能否构造数据自适应的检验或置信区间,而不需要估计这些指数?扎根于命题2.3的陈述及其后的Remark 2.4,其中界显式依赖于q1, q2。

提醒:要确认某条是否真gap,建议去读同子领域近期约5篇的intro(如Fang & Koike 2024, Chen 2018, Lopes 2025等),看它们是否都指向同一个问题。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论