跳转至

Nonuniform Berry-Esseen bounds for Studentized U-statistics

讲者: Zhijun Cai
会场: Probability and Asymptotic Theory
报告题目: Berry–Esseen Bounds for Distributed Studentized Statistics
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向致力于刻画Studentized U-statistics(即用数据驱动的方差估计量进行Studentization后的U-statistics)的正态逼近精度。核心问题是:对于标准化U-statistics已经成熟的Berry-Esseen (B-E) 界(包括均匀界和非均匀界),能否推广到Studentized版本?如果能,其形式与标准化版本有何本质不同?该方向当前处于“从均匀界向非均匀界推进”的阶段,且刚刚解决了Studentization带来的根本性困难。

发展脉络(history)

  1. 奠基工作:标准化U-statistics的B-E界。Filippova (1962), Grams and Serfling (1973), Bickel (1974), Callaert and Janssen (1978) 等建立了标准化U-statistics的均匀B-E界。Chen and Shao (2007) 则进一步建立了非均匀B-E界(见本文(1.5)和(1.6)),其形式为 \(C(m) E[|h|^3] / ((1+|x|^3) \sqrt{n} \sigma^3)\),其中非均匀因子 \(1/(1+|x|^3)\)\(|x|\) 大时提供更紧的界。这是该方向的经典基准。

  2. 主要进展:Studentized U-statistics的均匀B-E界。由于方差 \(\sigma\) 通常未知,Studentization是更实际的设定。Helmers (1985), Callaert and Veraverbeke (1981), Zhao (1983), Wang et al. (2000) 逐步将Studentized U-statistics的均匀B-E界所需的矩条件从4.5阶降到3阶。Leung and Shao (2023) 在3阶矩条件下,对任意阶数 \(m\) 的Studentized U-statistics建立了统一的均匀B-E界(见本文Theorem 2.1),并倡导了“变量截断”(variable censoring)作为Stein方法下的关键技术。

  3. 当前Frontier与本文位置:在均匀界已基本解决后,非均匀界成为自然的前沿。然而,Novak (2005) 通过一个巧妙的二进制数据反例(见本文(2.4)),证明了对于自归一化和(self-normalized sum)\(S_n/V_n\),形如 (1.8) 的传统非均匀界不可能成立。本文(Leung and Shao, 2024)的核心贡献在于:首次为Studentized U-statistics建立了有效的非均匀B-E界。作者指出,Novak的反例同样适用于Studentized U-statistics,因此传统形式(1.9)必然失效。本文的解决方案是:在传统非均匀界的基础上,最小化地添加一个随 \(n\) 指数衰减的修正项 \(\exp(-c(m) n \sigma^6 / (E[|h|^3])^2)\),从而恢复了非均匀界的有效性。

子线索聚类

  1. 标准化U-statistics的B-E界:以Chen and Shao (2007) 为代表,建立了均匀和非均匀界,常数随 \(m\) 增长缓慢(\(\sqrt{m}\))。这是Studentized版本的理论基准。
  2. Studentized U-statistics的均匀B-E界:以Leung and Shao (2023) 为代表,在3阶矩条件下解决了均匀界问题,并发展了变量截断技术。
  3. 自归一化过程的B-E与Cramér型大偏差:以Wang and Jing (1999), Jing, Shao and Wang (2003), Shao and Zhou (2014) 为代表,为自归一化和 \(S_n/V_n\) 和t统计量建立了精细的Cramér型大偏差结果。这些结果是本文Theorem 3.2(t统计量的精细非均匀界)的直接工具。
  4. 非负核U-statistics的指数下尾界:本文Lemma 4.3是作者为证明修正项而发展的新工具,它扩展了de la Peña et al. (2009) 中关于独立非负随机变量和的指数下尾界。这个引理本身具有独立价值。

这个方向在追问的核心问题

  1. 非均匀界的“正确形式”是什么? 对于Studentized统计量,由于分母可能接近零,传统非均匀界(如(1.9))会因“极端事件”(如所有观测值相等)而失效。核心问题是:需要添加什么样的修正项才能恢复有效性?
  2. 常数对阶数 \(m\) 的依赖:标准化U-statistics的常数随 \(m\) 增长缓慢(\(\sqrt{m}\)),但本文的证明方法导致常数可能随 \(m\) 指数增长。这是Studentization的内在代价,还是证明技巧可以改进?
  3. 样本量 \(n\) 与阶数 \(m\) 的关系:本文要求 \(m^2 < n\),比均匀界要求的 \(2m < n\) 更强。能否在更弱的条件下建立非均匀界?
  4. 非均匀因子能否从多项式衰减提升为指数衰减? 对于t统计量(Theorem 3.2),非均匀因子可以是指数衰减的 \(e^{-c x^2}\)。但对于一般Studentized U-statistics,本文只得到了多项式衰减 \(1/(1+|x|^3)\)。能否推广指数衰减?

⚠️ 作者的framing

  • 作者把缺口frame成什么? 作者将缺口明确地定义为“非均匀B-E界缺失”,并指出Novak (2005)的反例表明传统形式必然失效。因此,本文的贡献被定位为“首次填补了这个空白”,其核心创新是“发现并证明了修正项的必要性和最优性”。
  • 哪些竞争路线被淡化或回避了? 作者没有深入讨论其他可能的Studentization方法(如bootstrap方差估计),而是专注于Jackknife方差估计器。作者也回避了常数随 \(m\) 增长的问题,仅在第4.1节将其作为开放问题讨论。
  • 什么明显该被引/该存在、却没出现在intro里? 作者没有引用关于高阶影响函数(HOIF)去偏机器学习(DML) 的文献。这些方法也处理非线性统计量的推断,但通常关注半参数效率而非B-E界。这可能是由于子领域不同,但值得研究者去查证是否存在交叉点。

张力

未见明显对立引用。所有被引工作都在逐步推进B-E界的精度和适用范围,没有出现相互矛盾的结论。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
    • \(X_1, \dots, X_n\):i.i.d. 随机变量,取值于可测空间 \(\mathcal{X}\)
    • \(h: \mathcal{X}^m \to \mathbb{R}\):对称核函数,阶数为 \(m\)
    • \(U_n = \binom{n}{m}^{-1} \sum_{1 \le i_1 < \dots < i_m \le n} h(X_{i_1}, \dots, X_{i_m})\):U-statistic。
    • \(g(x) = E[h(X_1, \dots, X_m) | X_1 = x]\):一阶规范函数。
    • \(\sigma^2 = \text{Var}[g(X_1)] > 0\):渐近方差。
    • \(\hat{\sigma}^2\):Jackknife方差估计量(见(2.1))。
    • \(T_n = \frac{\sqrt{n}}{m \hat{\sigma}} U_n\):Studentized U-statistic。
    • \(x \in \mathbb{R}\):我们想评估正态逼近精度的点。
    • \(\Phi(x)\):标准正态分布函数。
  • 模型
    • 数据生成机制:\(X_1, \dots, X_n \stackrel{i.i.d.}{\sim} P\),其中 \(P\)\(\mathcal{X}\) 上的某个分布。
    • 假设:\(E[h(X_1, \dots, X_m)] = 0\)(不失一般性,可通过中心化实现),\(\sigma^2 > 0\)(非退化条件),\(E[|h|^3] < \infty\)(三阶矩条件)。
    • 要估的对象:\(T_n\) 的分布函数 \(P(T_n \le x)\) 与标准正态分布函数 \(\Phi(x)\) 之间的差异。
  • 可观测数据
    • 可观测\(X_1, \dots, X_n\) 的样本。由此可以计算 \(U_n\)\(\hat{\sigma}^2\),进而得到 \(T_n\)
    • 想要但观测不到\(g(X_i)\)\(\sigma^2\) 是潜在量,因为它们依赖于未知的总体分布 \(P\)\(\sigma^2\) 必须通过 \(\hat{\sigma}^2\) 来估计。\(T_n\) 的分布也是未知的,我们试图用 \(\Phi(x)\) 来逼近它。

第二步:讲最小内核

本文的核心困难在于:Studentization使得分母 \(\hat{\sigma}\) 可能非常接近零,导致 \(T_n\) 以非零概率取极大值(甚至无穷大),从而破坏了传统非均匀界的形式。

最简特例:\(m=1\)\(h(x)=x\)(即t统计量)

在这个特例下,\(U_n = \bar{X}_n\)\(\hat{\sigma}^2 = s_n^2\)\(T_n = T_{\text{student}} = \sqrt{n} \bar{X}_n / s_n\)。此时,\(T_n\) 与自归一化和 \(S_n/V_n\) 通过关系式 (2.14) 相关联。

  • Novak (2005) 的反例:考虑二进制随机变量 \(X_i\),以概率 \(1-p\)\(p^{1/2}(1-p)^{-1/2}\),以概率 \(p\)\(-(1-p)^{1/2}p^{-1/2}\)。取 \(p = p_n = 1/n\)。考虑事件 \(\mathcal{E}_n = \{X_1 = \dots = X_n = p_n^{1/2}(1-p_n)^{-1/2}\}\)
    • 在这个事件上,\(S_n/V_n = \sqrt{n}\),因此 \(T_{\text{student}} = \infty\)
    • \(P(\mathcal{E}_n) = (1-1/n)^n \to e^{-1} > 0\)
    • 因此,对于任何 \(x < \infty\)\(P(T_{\text{student}} \le x) \le 1 - P(\mathcal{E}_n) \approx 1 - e^{-1}\),而 \(\Phi(x) \to 1\)\(x \to \infty\)。所以 \(|P(T_{\text{student}} \le x) - \Phi(x)|\) 的下极限至少是 \(e^{-1}\)
    • 然而,传统非均匀界(如(1.9))的右边会随着 \(x \to \infty\) 而趋于0。这就产生了矛盾,证明了传统非均匀界不可能成立。

核心思路:这个反例表明,Studentization带来的“极端事件”(即 \(\hat{\sigma}\) 非常小)使得 \(T_n\) 的尾部行为与正态分布有本质区别。为了恢复非均匀界,必须显式地处理这种极端事件。本文的解决方案是:在传统非均匀界的基础上,添加一个指数衰减的修正项 \(\exp(-c n \sigma^6 / (E[|h|^3])^2)\)。这个修正项正是为了覆盖像 \(\mathcal{E}_n\) 这样的极端事件而设计的。当 \(n\) 很大时,这个修正项非常小,但在 \(x\) 很大时,它比传统非均匀界衰减得更慢,从而能够“兜住”由极端事件引起的概率质量。

一句话总结:本文在数学上干的事是:证明了对于Studentized U-statistics,其非均匀B-E界必须包含一个指数衰减的修正项,并且这个修正项的形式(特别是 \(n\) 的阶数)是最优的。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:为Studentized U-statistics建立非均匀Berry-Esseen界,该界在 \(x\) 很大时仍能有效刻画正态逼近误差。
  2. 核心工具/方法:Stein方法 + 变量截断(variable censoring)+ 非负核U-statistics的指数下尾界(Lemma 4.3)。
  3. 主要结论:在 \(E[|h|^3]<\infty\)\(m^2 < n\) 条件下,非均匀B-E界由两部分组成:一个随 \(n\) 指数衰减的修正项,和一个与传统非均匀界形式相似的项(见Theorem 3.1)。对于t统计量,非均匀因子可以提升为指数衰减(Theorem 3.2)。

关键设定与假设

  • 设定\(X_1, \dots, X_n\) i.i.d.,核函数 \(h\) 对称,\(E[h]=0\)\(\sigma^2 = \text{Var}[g(X_1)] > 0\)\(E[|h|^3] < \infty\)
  • 假设
    • \(m^2 < n\):比均匀界要求的 \(2m < n\) 更强。作者在第4.2节讨论了放松到 \(2m < n\) 的可能性。
    • \(E[|h|^3] < \infty\):三阶矩条件,与均匀界的最优条件一致。
    • \(\sigma^2 = 1\):不失一般性,通过缩放核函数实现。
  • 相比已有文献:相比Chen and Shao (2007) 的标准化U-statistics非均匀界,本文处理了Studentization带来的额外复杂性。相比Leung and Shao (2023) 的均匀界,本文需要更精细的截断技术来提取非均匀因子,并需要新的指数下尾界来处理修正项。

主要结果

  • Theorem 3.1(一般Studentized U-statistics的非均匀B-E界)
    \[|P(T_n \le x) - \Phi(x)| \le \exp\left(-\frac{c_1(m) n \sigma^6}{(E[|h|^3])^2}\right) + \frac{C(m) E[|h|^3]}{(1+|x|^3)\sqrt{n} \sigma^3}.\]
    • 直觉:第一项是指数衰减的修正项,处理由Studentization引起的极端事件。第二项是传统形式的非均匀界,主导了“正常”区域的逼近误差。
    • 必要条件\(m^2 < n\)\(E[|h|^3] < \infty\)
    • 解决的技术难点:证明了传统非均匀界(如(1.9))不可能成立,并找到了“最小”的修正方案。
  • Theorem 3.2(t统计量的精细非均匀B-E界)
    \[|P(T_{\text{student}} \le x) - \Phi(x)| \le C_1 \exp\left(-\frac{c_1 n (E[X_1^2])^3}{(E[|X_1|^3])^2}\right) + \frac{C_2}{e^{c_2 x^2}} \frac{E[|X_1|^3]}{\sqrt{n} (E[X_1^2])^{3/2}}.\]
    • 直觉:非均匀因子从 \(1/(1+|x|^3)\) 提升为指数衰减的 \(e^{-c x^2}\),这是通过利用自归一化和的Cramér型大偏差定理(Jing et al., 2003)实现的。
    • 必要条件\(n \ge 2\)\(E[|X_1|^3] < \infty\)
  • 修正项的最优性:作者通过Novak (2005) 的反例证明,修正项中 \(n\) 的阶数(即 \(n\) 的一次方)是最优的。如果修正项是 \(\exp(-c n^a)\)\(a > 1\),则它衰减太快,无法覆盖极端事件(见第3节(iii))。

证明路线与技术技巧

整体路线(以Theorem 3.1为例)

  1. 重写 \(T_n\) 为自归一化形式:将 \(T_n\) 表示为 \(T_n = (W + D_1) / \sqrt{1 + D_2}\),其中 \(W = \sum_{i=1}^n g(X_i)/\sqrt{n}\) 是近似正态的线性部分,\(D_1\)\(D_2\) 是“余项”(见(4.3)-(4.15))。
  2. 变量截断:对 \(W, D_1, D_2\) 进行多层次的截断,得到它们的截断版本 \(W_b, \bar{D}_{1,x}, \bar{D}_2\)。截断的目的是为了控制余项,使得在“好”的事件上,\(T_n\) 的行为主要由 \(W_b\) 决定。截断阈值依赖于 \(x\)\(m\),这是提取非均匀因子的关键。
  3. 事件包含与概率分解:通过一系列事件包含关系(见(4.24)),将 \(P(T_n > x)\) 分解为:
    \[|P(T_n > x) - \bar{\Phi}(x)| \le R_x + P(D_2 < 9c_m^2/16 - 1) + |P(W_b + \bar{D}_{1,x} > x\sqrt{1+\bar{D}_2}) - \bar{\Phi}(x)|.\]
    • \(R_x\):由截断引起的“坏事件”的概率和,通过矩不等式和Chernoff界控制,得到非均匀界(Lemma 4.1)。
    • \(P(D_2 < 9c_m^2/16 - 1)\):分母 \(\hat{\sigma}^2\) 过小的概率。这是修正项的来源。
    • \(|P(W_b + \bar{D}_{1,x} > x\sqrt{1+\bar{D}_2}) - \bar{\Phi}(x)|\):在“好”事件上的逼近误差,通过Stein方法控制,得到非均匀界(Lemma 4.2)。
  4. 处理分母下尾概率:这是本文的核心技术难点。作者发现 \(\hat{\sigma}^2\) 本质上是一个非负核U-statistic(见(4.34)-(4.37))。为了控制其下尾概率,作者证明了Lemma 4.3:一个关于非负核U-statistics的指数下尾界。这个引理是本文的关键创新,它扩展了de la Peña et al. (2009) 中关于独立随机变量和的类似结果。
  5. Stein方法处理截断后的统计量:对 \(W_b + \bar{D}_{1,x}\)\(\bar{D}_2\) 应用Stein方法,利用Stein方程解的性质(Lemma A.2)和随机化集中不等式(Lemma A.6),得到非均匀界。

关键跳跃点

  • 从均匀界到非均匀界:在Leung and Shao (2023) 的均匀界证明中,截断阈值是常数。为了得到非均匀界,本文需要让截断阈值随 \(x\) 变化(如 \(c_m x/4\)),这使得对余项 \(R_x\) 的控制更加复杂,需要更精细的Chernoff界和矩估计。
  • 修正项的来源:将 \(\hat{\sigma}^2\) 识别为非负核U-statistic,并为其建立指数下尾界,这是整个证明中最具原创性的部分。这个引理(Lemma 4.3)的证明使用了Hoeffding (1963) 的经典技巧和不等式 \(e^{-s} \le 1 - s + s^p/p\)

技术技巧点名

  • Stein方法:用于控制截断后统计量的正态逼近误差。
  • 变量截断(Variable Censoring):对 \(W, D_1, D_2\) 进行多层次、依赖于 \(x\) 的截断,以提取非均匀因子。
  • 指数随机化集中不等式(Exponential Randomized Concentration Inequality, Lemma A.6):用于处理截断后统计量的集中性,是Stein方法证明中的关键工具。
  • 非负核U-statistics的指数下尾界(Lemma 4.3):核心创新,用于导出修正项。
  • Hoeffding分解:将U-statistic分解为不同阶数的规范函数之和,用于分析 \(D_1\)\(D_2\) 的矩。
  • Rosenthal不等式:用于控制 \(W\)\(\Lambda_n\) 的高阶矩。

真实例子与应用

本文为纯理论论文,无真实数据例子或模拟实验。作者通过Novak (2005) 的二进制数据反例来展示其理论结果的性质(见第3节(i)-(iii)),说明修正项的必要性和最优性。

🔎 结论是否比证明窄

  • Theorem 3.1 的结论是在 \(m^2 < n\) 下证明的,但作者在第4.2节明确表示相信在 \(2m < n\) 下也成立,并给出了一个“桥接”论证的草图。因此,\(m^2 < n\) 这个条件比作者相信的最终结论要窄
  • 常数随 \(m\) 的增长:作者在第4.1节指出,他们的证明方法导致常数 \(C(m)\) 可能随 \(m\) 指数增长,而标准化U-statistics的常数只随 \(m\) 增长 \(\sqrt{m}\)。作者明确表示“不清楚是否存在不同的证明可以降低这些常数的阶数”。因此,结论中关于常数依赖性的部分,其证明给出的上界可能远非最优,这是一个被作者承认的弱点。
  • 非均匀因子的形式:Theorem 3.1 的非均匀因子是 \(1/(1+|x|^3)\),但作者在Theorem 3.2中为t统计量证明了指数衰减的因子。作者在第3节末尾提出,能否将指数衰减推广到一般Studentized U-statistics是一个“开放问题”。因此,Theorem 3.1 中多项式衰减的结论可能不是最优的

四、开放问题

  1. 常数对阶数 \(m\) 的最优增长速率:本文的证明导致常数 \(C(m)\) 可能随 \(m\) 指数增长。能否找到一种新的证明方法,将常数增长速率降低到多项式(如 \(\sqrt{m}\))?这扎根于本文第4.1节的讨论。
  2. 放松样本量条件:本文要求 \(m^2 < n\),而均匀界只要求 \(2m < n\)。能否在 \(2m < n\) 的条件下证明Theorem 3.1?作者在第4.2节给出了一个“桥接”论证的草图,但承认存在一个技术瓶颈(缺乏Hoeffding型不等式)。解决这个瓶颈是一个具体的研究问题。
  3. 将指数衰减的非均匀因子推广到一般Studentized U-statistics:Theorem 3.2 为t统计量(\(m=1\))证明了指数衰减的非均匀因子 \(e^{-c x^2}\)。能否为 \(m \ge 2\) 的Studentized U-statistics建立类似的指数衰减界?这需要发展更强大的Cramér型大偏差结果,作者在文中指出当前结果(Shao and Zhou, 2016)只适用于一类受限的核函数。
  4. 与高阶U-statistics和计算复杂性的联系:研究者对高阶U-statistics的计算复杂性(如einsum复杂度)感兴趣。本文的证明中,\(\hat{\sigma}^2\) 被表示为 \(2m\) 阶U-statistic。一个开放问题是:能否利用U-statistic的图论/张量网络结构,来刻画本文中常数 \(C(m)\)\(c(m)\)\(m\) 增长的计算复杂性? 例如,证明中出现的 \(b_m\)\(c_m\) 是否与某个张量收缩的树宽有关?这扎根于本文第4.1节对常数 \(b_m\)\(c_m\) 的讨论,以及Lemma 4.3的证明中使用的Hoeffding技巧。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论