跳转至

Berry--Esseen bounds and bootstrap approximations for the Hilbert-space norm of \(U\)-statistics

作者: Nilanjan Chakraborty, Sayan Das
主题: 其他
相关性: 9/10
链接: https://arxiv.org/abs/2608.25463


一、领域脉络与小综述

这个方向是什么

这个子方向的核心问题是:对于一个取值于高维或无穷维空间的非线性统计量(如U-统计量),其分布能否被一个高斯分布(或bootstrap分布)在非渐近意义下精确逼近? 具体而言,是要量化逼近误差(如Kolmogorov距离)如何依赖于样本量n、空间维数d(或更本质的谱几何量),以及统计量的非线性程度。当前成熟度:对于样本均值(线性统计量),高维Berry-Esseen界和bootstrap逼近的理论已相当成熟(见Chernozhukov et al. [2023]的综述);但对于非线性统计量,尤其是U-统计量,非渐近的分布逼近理论仍在快速发展中,且大多局限于特定的范数(如sup-norm)或特定的核结构。

发展脉络(history)

  1. 奠基工作:经典U-统计量渐近理论

    • Hoeffding [1948]:建立了U-统计量的Hoeffding分解和Hájek投影,奠定了其渐近正态性的基础。这是所有后续工作的基石。
    • Callaert and Janssen [1978]:对实值非退化U-统计量建立了经典的Berry-Esseen界,得到了n^{-1/2}的收敛速率。这是U-统计量分布逼近的定量化开端。
  2. 主要进展:Hilbert空间与高维扩展

    • Korolyuk and Borovskikh [1990], Borovskikh et al. [1997]:将Berry-Esseen界推广到取值于Hilbert空间的U-统计量,得到了n^{-1/2}的速率。但作者指出,这些经典技术(如特征函数光滑化)通常要求协方差算子具有无穷多个(或至少九个)严格正的特征值,且特征值不能趋近于零。这限制了其在近似低秩或奇异协方差结构上的应用。
    • Chen [2018], Chen and Kato [2019]:在高维欧氏空间R^d中,针对非退化U-统计量,建立了在超矩形(hyperrectangles)上的高斯和bootstrap逼近界。但作者指出,这些结果依赖于次指数或多项式尾部假设,且主要针对ℓ∞范数,而非ℓ2范数。
  3. 当前Frontier:非渐近、弱假设、ℓ2范数

    • Fang and Koike [2024]:对高维均值向量(线性统计量)在凸集和球上建立了仅依赖四阶矩的Berry-Esseen界。这是本文最直接的技术对标。作者指出,本文的目标是将Fang and Koike [2024]的成果从线性统计量推广到非线性U-统计量。
    • 本文 (Chakraborty and Das, 2026):在三角阵列框架下,针对取值于可分Hilbert空间H_n(可随n变化)的非退化U-统计量的ℓ2范数,建立了非渐近的Berry-Esseen界和bootstrap逼近。其核心创新在于:通过将Stein方法推广到Hilbert空间,放松了对协方差算子谱结构的要求(仅需前两个特征值非零),并显式刻画了逼近误差与谱几何量ℓ_n(稳定秩的倒数)的关系。

子线索聚类

  1. 经典渐近理论:Hoeffding [1948], Callaert and Janssen [1978], Korolyuk and Borovskikh [1990], Borovskikh et al. [1997]。这一簇工作主要关注固定维数或无穷维空间中的渐近分布和n^{-1/2}速率,但通常需要较强的谱条件(如无穷多个正特征值)或矩条件。
  2. 高维均值向量逼近:Chernozhukov et al. [2017, 2022, 2023], Fang and Koike [2024]。这一簇工作专注于线性统计量(样本均值)在高维R^d中的非渐近逼近,发展了基于Stein方法和bootstrap的通用工具,并得到了显式的维数依赖界。
  3. 高维U-统计量逼近:Chen [2018], Chen and Kato [2019], 以及本文。这一簇工作将高维逼近理论从线性统计量推广到非线性U-统计量。Chen [2018]主要处理ℓ∞范数和超矩形,而本文则聚焦于ℓ2范数和球,并采用了更弱的矩条件(四阶矩 vs. 次指数)。

这个方向在追问的核心问题

  1. 逼近误差如何依赖于维数d? 对于ℓ2范数,误差项中d的幂次是多少?能否达到与线性统计量相同的d依赖关系?
  2. 需要多强的矩条件? 能否从次指数或多项式尾部放松到仅需有限四阶矩?
  3. 协方差算子的谱结构如何影响逼近? 当协方差是近似低秩或奇异时,逼近是否仍然有效?误差如何依赖于谱的“分散程度”(如稳定秩)?
  4. bootstrap能否有效逼近未知的协方差结构? 对于U-统计量,其Hájek投影的协方差算子难以直接估计,bootstrap是否仍能提供有效的推断?

⚠️ 作者的framing

  • 作者把缺口frame成什么? 作者将缺口frame为:现有Hilbert空间U-统计量的Berry-Esseen界(如Borovskikh et al. [1997])依赖于过强的谱条件(需要无穷多个或至少九个正特征值),而现有高维U-统计量的结果(如Chen [2018])又局限于ℓ∞范数和更强的矩条件。因此,本文的“显然的下一步”是:在更弱的谱条件和矩条件下,为ℓ2范数建立非渐近的逼近界,并同时处理Hilbert空间和高维欧氏空间。
  • 哪些竞争路线被他淡化或回避了? 作者淡化了退化U-统计量的情形。本文所有结果都假设U-统计量是非退化的(即Hájek投影的协方差算子Γ_n非零)。对于退化U-统计量(如核的Hoeffding分解中一阶项为零),其极限分布是卡方型或更复杂的分布,本文的方法不直接适用。作者在引言中明确将研究范围限定在“nondegenerate U-statistics”。
  • 什么明显该被引/该存在、却没出现在intro里? 作者没有引用关于高阶影响函数(HOIF) 的文献。HOIF框架也处理U-统计量及其高阶退化项,并用于半参数推断。虽然HOIF更关注效率理论而非分布逼近,但两者在技术上有交叉(如对高阶U-统计量余项的控制)。这可能是研究者值得去查的一个方向,看看HOIF文献中是否有类似的非渐近逼近结果。

张力

未见明显对立引用。所有被引工作都在逐步放松假设、扩展适用范围,方向一致。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • X = {X_1, ..., X_n}: 独立(但不一定同分布)的随机元素,取值于某个可测空间X。
    • H_n: 一个可分Hilbert空间,可以随样本量n变化。其内积为⟨·,·⟩,范数为∥·∥。
    • r: U-统计量的阶数,固定常数(如r=2)。
    • ˜h: X^r → H_n: 对称的核函数,取值于H_n。这是U-统计量的核心。
    • θ = E[U_n]: U-统计量的期望(在H_n中)。
    • U_n: 阶数为r的U-统计量,U_n = (1/ C(n,r)) Σ_{1≤i1<...<ir≤n} ˜h(X_{i1}, ..., X_{ir})。
    • T_n = √n (U_n - θ) / r: 归一化的中心化U-统计量。这是我们要研究其分布的对象。
    • L_n: T_n的Hájek投影(线性部分),L_n = (1/√n) Σ_{i=1}^n g^{(i)}(X_i),其中g^{(i)}是条件期望。
    • R_n: T_n的余项(高阶退化部分),T_n = L_n + R_n。
    • Γ_n = Cov(L_n): Hájek投影L_n的协方差算子(在H_n上)。这是高斯近似的目标协方差。
    • Z_n ∼ N_{H_n}(0, Γ_n): 与L_n同协方差的高斯随机元。这是T_n的高斯近似目标。
    • ∥·∥: H_n上的范数。我们关心的是∥T_n∥的分布。
    • d_Kol(∥T_n∥, ∥Z_n∥): Kolmogorov距离,sup_{a≥0} |P(∥T_n∥ ≤ a) - P(∥Z_n∥ ≤ a)|。这是要上界的量。
    • ℓ_n = 1 - ∥Γ_n∥_op^2 / ∥Γ_n∥_HS^2: 谱分散度量。∥Γ_n∥_op是算子范数(最大特征值),∥Γ_n∥_HS是Hilbert-Schmidt范数(特征值平方和开根)。ℓ_n衡量了除最大特征方向外,其余谱质量的占比。ℓ_n > 0意味着至少有两个非零特征值。
  • 模型:

    • 数据生成机制:X_1, ..., X_n是独立随机元素,分布可以不同。
    • 核函数˜h是对称的,且E[∥˜h(X_{i1}, ..., X_{ir})∥^4] < ∞(有限四阶矩)。
    • 要估计的对象:θ = E[U_n]。
    • 已知/假设:r固定,核函数˜h已知(但分布未知)。
  • 可观测数据:

    • 可观测:样本X_1, ..., X_n,以及由此计算出的U-统计量U_n(从而T_n)。
    • 潜在/不可观测:
      • 核函数的期望θ。
      • Hájek投影L_n及其协方差算子Γ_n。Γ_n依赖于条件期望g^{(i)},无法直接从样本中解析计算。
      • 高斯近似目标Z_n。
      • 余项R_n。

第二步:讲最小内核

本文的核心思路是:将非线性统计量T_n的分布逼近问题,通过Hoeffding分解转化为其线性部分L_n的分布逼近问题,并证明余项R_n的贡献是渐近可忽略的。

最简特例:固定Hilbert空间,r=2,i.i.d.数据

  • 设定:假设H_n = H是一个固定的Hilbert空间(不随n变化),r=2,且X_1, ..., X_n是i.i.d.的。核函数为˜h(x,y),对称。
  • Hoeffding分解:
    • T_n = √n (U_n - θ) / 2。
    • Hájek投影:L_n = (1/√n) Σ_{i=1}^n g(X_i),其中g(x) = E[˜h(x, X_2)] - θ。
    • 余项:R_n = T_n - L_n。它是一个二阶U-统计量,其核是f(x,y) = ˜h(x,y) - g(x) - g(y) - θ,且满足E[f(x, X_2)] = 0(一阶退化)。
  • 核心命题(退化为定理2.1的推论):在E[∥˜h(X_1, X_2)∥^4] < ∞且Γ_n至少有两个非零特征值的条件下,有 d_Kol(∥T_n∥, ∥Z_n∥) ≲ n^{-1/8}。
  • 为什么成立(证明思路):
    1. 线性化:通过Hoeffding分解,T_n = L_n + R_n。L_n是独立同分布随机向量g(X_i)的和,R_n是“小”的余项。
    2. 控制余项:利用R_n的一阶退化性质,可以证明E[∥R_n∥^2] = O(1/n)。这意味着R_n在均方意义下是O_p(1/√n),比L_n(其范数为O_p(1))小一个阶。
    3. 逼近线性部分:L_n是独立同分布随机元之和。本文的核心技术贡献是将Stein方法推广到Hilbert空间,对L_n的范数∥L_n∥建立了Berry-Esseen界。这个界依赖于Γ_n的谱几何(通过ℓ_n)和g(X_i)的四阶矩。
    4. 组合误差:将余项误差和线性部分的逼近误差结合起来,通过优化一个平滑参数τ(在证明中用于平滑指示函数),最终得到n^{-1/8}的速率。

一句话总结最小内核:本文在数学上干的事就是:证明了一个非线性统计量T_n的范数分布,可以被一个具有相同协方差的高斯向量Z_n的范数分布所逼近,逼近误差主要来自对T_n的线性部分L_n的高斯逼近,而非线性部分R_n的贡献可以忽略不计。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在三角阵列框架下,研究了取值于可分Hilbert空间H_n(可随样本量变化)的非退化U-统计量的Hilbert空间范数∥T_n∥的分布,建立了其与高斯分布∥Z_n∥之间的非渐近Berry-Esseen界,以及三种bootstrap方法的逼近界。
  2. 核心工具/方法:将Stein方法推广到Hilbert空间,并结合Hoeffding分解、Hájek投影、高斯反集中不等式(Götze et al. [2019])以及高斯比较引理。
  3. 主要结论:得到了一个依赖于核函数四阶矩m_n和协方差算子谱几何量ℓ_n的通用Berry-Esseen界(定理2.1)。在固定Hilbert空间下,该界退化为O(n^{-1/8})(命题2.2)。在高维欧氏空间R^d中,给出了显式的维数依赖界(命题2.3)。对于三种bootstrap(经验、高斯加权、刀切乘子),也建立了类似的逼近界(定理2.5),并在固定Hilbert空间下分别得到O(n^{-1/8})和O(n^{-1/6})的速率(命题2.7)。最后,以配对Kendall's tau系数向量的检验为例,证明了该检验在稠密高斯相关备择下达到minimax最优分离率(命题3.3)。

关键设定与假设

  • 设定:X_1, ..., X_n独立但不必同分布。核˜h对称,阶数r固定。H_n是可分Hilbert空间,可随n变化。
  • 核心假设:
    • 有限四阶矩:m_n = max E[∥˜h(X_{i1}, ..., X_{ir})∥^4] < ∞。这是控制Hájek投影和余项矩的基本条件。
    • 非退化性:ℓ_n > 0,即Γ_n至少有两个非零特征值。这保证了高斯分布∥Z_n∥不是退化的(集中在一条线上),从而其反集中性质(anti-concentration)是可控的。ℓ_n越小(接近秩1),反集中界越差,逼近误差中的ℓ_n负幂次项就越大。
    • (可选)谱增长条件(命题2.3):∥Γ_n∥_op ≍ d^{q1}, ∥Γ_n∥_F ≍ d^{q2}。用于在高维R^d中得到显式的维数依赖界。
    • (可选)一阶平衡条件(条件A.3):¯θ_{i1} = θ对所有i1成立。在非i.i.d.数据下,这个条件保证了bootstrap协方差估计量的一致性,防止了不同观测索引间的确定性偏移污染协方差估计。
  • 相比已有文献的放宽/强化:
    • 放宽:相比Borovskikh et al. [1997](需要无穷多个或九个正特征值),本文仅需两个正特征值(ℓ_n > 0)。相比Chen [2018](需要次指数或多项式尾部),本文仅需四阶矩条件。
    • 强化:本文的结果是非渐近的,给出了显式的有限样本界,而不仅仅是渐近分布。本文同时处理了Hilbert空间和高维欧氏空间,提供了一个统一框架。

主要结果

  • 定理2.1(通用Berry-Esseen界):d_Kol(∥T_n∥, ∥Z_n∥) ≲ Δ_n,其中Δ_n是ℓ_n、m_n、∥Γ_n∥_HS、∥Γ_n∥_op以及余项R_n的迹的函数。这个界是通用的,但形式复杂。
  • 命题2.2(固定Hilbert空间):在m_n和λ_{(2)}(Γ_n)有界条件下,d_Kol(∥T_n∥, ∥Z_n∥) ≲ n^{-1/8}。这是一个维数无关的速率,是本文最简洁、最核心的结论。
  • 命题2.3(高维欧氏空间R^d):在坐标四阶矩条件和谱增长条件下,d_Kol(∥T_n∥, ∥Z_n∥) ≲ Δ_{n,d},其中Δ_{n,d}是d和n的显式函数。例如,当Γ_n = I_d时,Δ_{n,d} ≲ max{(d/n)^{1/6}, (1/n)^{1/8}}。这展示了维数d对逼近误差的影响。
  • 定理2.5 & 命题2.7(bootstrap逼近):对于三种bootstrap,在固定Hilbert空间下,经验bootstrap的逼近率为O(n^{-1/8}),而高斯加权和刀切乘子bootstrap的逼近率为O(n^{-1/6})。后者更快,因为其线性部分条件高斯,无需额外的条件高斯逼近步骤。
  • 命题3.3(Kendall's tau minimax下界):对于配对Kendall's tau系数向量的检验问题,证明了任何检验在分离半径o(d^{1/4}/√n)下都无法达到一致功效。结合命题3.1(检验一致性),表明本文提出的bootstrap检验在分离率d^{1/4}/√n(乘以一个发散因子)下是minimax最优的。

证明路线与技术技巧(理论型)

  • 整体路线:

    1. Hoeffding分解:将T_n分解为线性主部L_n和退化余部R_n。
    2. 平滑化:使用一个光滑函数v_{η,τ}(见引理A.1)来近似指示函数1{∥·∥ ≤ a},将Kolmogorov距离的上界问题转化为对E[v_{η,τ}(T_n) - v_{η,τ}(Z_n)]的控制。
    3. 三角不等式:将E[v_{η,τ}(T_n) - v_{η,τ}(Z_n)]分解为三部分:
      • (I) = E[v_{η,τ}(T_n) - v_{η,τ}(L_n)]:由余项R_n引起的误差。
      • (II) = E[v_{η,τ}(L_n) - v_{η,τ}(Z_n)]:线性部分的高斯逼近误差。
      • (III) = P(η-τ < ∥Z_n∥^2 ≤ η+τ):高斯分布的反集中误差。
    4. 分别控制:
      • 控制(I):利用v_{η,τ}的Lipschitz性质(引理A.1(iv))和R_n的矩界(E∥R_n∥^2 = O(1/n)),得到(I) ≲ τ^{-1} * O(1/√n)。
      • 控制(II):这是核心。作者将Stein方法推广到Hilbert空间(引理A.2),对L_n(独立随机元之和)的范数建立了光滑函数下的逼近误差界。该界依赖于Γ_n的谱范数和Hilbert-Schmidt范数,以及g^{(i)}(X_i)的三、四阶矩。
      • 控制(III):利用高斯反集中不等式(引理A.3),(III) ≲ ℵ(Γ_n) τ,其中ℵ(Γ_n) = (Λ_1 Λ_2)^{-1/2} = ∥Γ_n∥_HS^{-1} ℓ_n^{-1/4}。
    5. 优化τ:将上述三个界相加,得到一个关于τ的表达式。通过选择最优的τ(使三项平衡),得到最终的Berry-Esseen界。
  • 关键跳跃点:

    • Hilbert空间中的Stein方法:将经典的Stein方法从R^d推广到无穷维Hilbert空间,需要处理算子值函数的Fréchet导数、迹类算子等泛函分析工具。引理A.2的证明是技术难点,它建立了E[v_{η,τ}(S_n) - v_{η,τ}(Z_n)]的显式上界。
    • 余项R_n的矩控制:证明E∥R_n∥^2 = O(1/n)需要精细的计数论证(引理B.1)。由于R_n是退化U-统计量,其核f_i的条件期望为零,导致只有共享至少两个索引的元组对才有非零协方差,从而将求和项数从O(n^{2r})降低到O(n^{2r-2}),得到O(1/n)的速率。
  • 技术技巧点名:

    • Stein方法(Hilbert空间版):用于控制线性部分L_n的高斯逼近误差(引理A.2)。
    • 高斯反集中不等式:用于控制高斯分布∥Z_n∥在小区间上的概率质量(引理A.3,来自Götze et al. [2019])。
    • 高斯比较引理:用于控制bootstrap协方差估计量ˆΓ_n与目标Γ_n之间的差异对分布逼近的影响(引理A.4)。
    • Hoeffding分解:将非线性问题线性化。
    • 计数论证:用于控制退化U-统计量余项的矩。

真实例子与应用

  • 例子:配对Kendall's tau系数向量的检验(Section 3)。
  • 数据/场景:p维随机向量X_i,检验其所有d = p(p-1)/2个配对Kendall's tau系数是否全为零(即检验独立性)。
  • 方法应用:
    1. 构造向量值核h(x,y) = vech(sign(x-y) sign(x-y)^T),这是一个二阶U-统计量。
    2. 检验统计量为T_n = √n/2 * ˆτ_n,其中ˆτ_n是经验Kendall's tau向量。
    3. 使用本文提出的bootstrap方法(如JMB)计算临界值q_n^*(1-α)。
    4. 拒绝域为{∥T_n∥ > q_n^*(1-α)}。
  • 结果:
    • 命题3.1证明了该检验的渐近尺寸正确性(P_{H0}(∥T_n∥ > q_n^*(1-α)) → α)。
    • 命题3.1还证明了当备择假设的∥θ∥(即真实的Kendall's tau向量的范数)大于C * ∥Γ_n∥_HS^{1/2} / √n乘以一个发散因子时,检验功效趋于1。
    • 命题3.3给出了一个minimax下界,证明任何检验在分离半径o(d^{1/4}/√n)下都无法达到一致功效。
  • 例子想说明什么:这个例子展示了本文理论的两个核心应用:
    1. 验证理论:通过计算Kendall's tau核的矩和协方差结构,可以验证本文定理的条件(如四阶矩条件、谱条件)是否满足,从而证明bootstrap检验的有效性。
    2. 展示最优性:通过将本文检验的分离率(d^{1/4}/√n乘以发散因子)与minimax下界(d^{1/4}/√n)匹配,证明了该检验在稠密高斯相关备择下是rate-optimal的。这为本文的理论结果提供了强有力的实证支持。

🔎 结论是否比证明窄

  • 窄结论1:定理2.1的通用界Δ_n依赖于ℓ_n的负幂次。当ℓ_n非常小(即协方差算子接近秩1)时,这个界会变得很大,甚至无意义。作者在命题2.2中通过假设λ_{(2)}(Γ_n) > 1/C来保证ℓ_n有正下界,从而得到n^{-1/8}的干净速率。这意味着n^{-1/8}的速率只在“非退化”足够强(至少两个特征值远离零)时才成立。 对于“弱非退化”或“近似低秩”的情形,定理2.1的界虽然适用,但速率可能远慢于n^{-1/8}。
  • 窄结论2:bootstrap逼近的n^{-1/6}速率(对GWB和JMB)是在固定Hilbert空间下得到的。在高维R^d中,bootstrap的速率会变慢,并出现额外的维数依赖项(命题2.8中的第四项)。作者在Remark 2.9中举例说明,当Γ_n = I_d时,bootstrap速率可能降为(d^{4/3}/n)^{1/4},比高斯逼近的(d/n)^{1/6}更慢。这意味着bootstrap在高维下的表现可能不如高斯逼近,需要更强的条件(如条件B.3)才能匹配。
  • 窄结论3:所有结果都针对非退化U-统计量。对于退化U-统计量(如MMD^2检验统计量),本文的理论不适用。作者在3.3节中讨论MMD时,特意指出其构造的U-统计量在零假设下是非退化的,这与通常的MMD^2统计量不同。

四、开放问题

  1. 最优速率问题:在固定Hilbert空间下,本文得到了n^{-1/8}的逼近速率。作者在文中提到(Section 1.2, "It remains open to see whether, under similar assumptions (A.1)–(A.2), the optimal rate of n^{-1/2} can be achieved")。扎根点:命题2.2的n^{-1/8}速率与经典实值U-统计量的n^{-1/2}速率之间存在差距。能否通过更精细的Stein方法或不同的证明策略,在相同假设下将速率提升到n^{-1/2}或n^{-1/4}?这是一个开放的理论问题。

  2. 退化U-统计量的推广:本文所有结果都假设U-统计量是非退化的。对于退化U-统计量(如核的Hoeffding分解中一阶项为零),其极限分布是卡方型或更复杂的分布。能否将本文的Hilbert空间Stein方法推广到退化情形,建立其范数的Berry-Esseen界?扎根点:引言中明确将研究范围限定在“nondegenerate U-statistics”,且3.3节中特意构造了非退化的MMD统计量来规避退化问题。

  3. 计算与统计的权衡:本文的bootstrap方法(如JMB)需要计算所有n个刀切乘子系数ˆg^{(i)}(X_i),其计算复杂度为O(n^r)。对于高阶r或大n,计算成本可能很高。能否利用随机化不完全U-统计量(如Chen and Kato [2019]中的方法)或张量网络/einsum技术来降低计算成本,同时保持统计效率?扎根点:本文的bootstrap构造依赖于完整的U-统计量。研究者可以探索是否能用更高效的算法来近似ˆΓ_n,并分析其对逼近误差的影响。这与研究者熟悉的U-统计量treewidth/einsum计算视角高度相关。

  4. 协方差估计的bootstrap一致性:在高维R^d中,本文的bootstrap逼近率依赖于协方差估计量ˆΓ_n的精度(如E∥ˆΓ_n - Γ_n∥_HS)。对于更复杂的协方差结构(如稀疏、低秩加稀疏),能否设计出更高效的bootstrap方法(如阈值化或正则化的bootstrap),并建立相应的非渐近逼近界?扎根点:命题2.8中,bootstrap的额外误差项正是由协方差估计的累积误差d/√n引起的。这表明改进协方差估计是提升bootstrap性能的关键。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论