跳转至

Rates of convergence in the distances of Kolmogorov and Wasserstein for standardized martingales

讲者: Xiequan Fan
会场: Stein Method with Recent Advances
报告题目: Rates of Convergence in the Distances of Kolmogorov and Wasserstein for Standardized Martingales
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向是鞅中心极限定理(Martingale CLT)的收敛速度,具体研究标准化鞅 \( S_n/s_n \) 的分布向标准正态分布收敛时,在 Kolmogorov 距离和 Wasserstein-1 距离下的速率。其根本的统计/科学问题是:当数据是依赖的(鞅差序列)时,CLT 的误差项(Berry-Esseen 界)如何受鞅差的条件矩、条件方差的可预测性(即“条件方差 vs. 无条件方差”的差异)以及尾部行为的影响。当前成熟度:Kolmogorov 距离已有大量结果,Wasserstein 距离的结果相对较少,本文试图填补后者。

发展脉络(history)

  • 奠基工作:Heyde and Brown (1970) 和 Hall & Heyde (1980) 的专著建立了鞅 CLT 的基本框架,并给出了最早的 Berry-Esseen 界(形如 \( N_n^{1/(2p+1)} \) 的界,其中 \( N_n \) 包含条件矩和条件方差偏离项)。留下的口子:这些界在一般条件下不是最优的,且对 Wasserstein 距离几乎没有结果。
  • 主要进展(Kolmogorov 距离)
    • Bolthausen (1982):在“条件方差等于无条件方差”(\( \sigma_k^2 = \bar\sigma_k^2 \) a.s.)且鞅差有界或三阶矩有界的条件下,得到了精确的收敛速度 \( n^{-1/4} \)\( n\ln n / s_n^3 \),并证明了最优性(通过反例)。留下的口子:条件方差必须等于无条件方差,且矩条件较强。
    • Haeusler (1988):将 Heyde-Brown 的界推广到所有 \( p \in (1, \infty] \),并证明其最优性。留下的口子:该界在条件方差等于无条件方差时可能不是最优的(即 Bolthausen 的 \( n^{-1/4} \) 优于它)。
    • Fan (2019):在 \( V_n^2 = s_n^2 \) a.s. 且条件矩被条件方差控制(\( E[|X_k|^{2+\delta}|\mathcal{F}_{k-1}] \le \gamma^\delta E[X_k^2|\mathcal{F}_{k-1}] \))的条件下,得到了最优的 Berry-Esseen 界 \( s_n^{-\delta} \)\( \delta \in (0,1) \))或 \( s_n^{-1}\ln s_n \)\( \delta \ge 1 \))。留下的口子:仍然要求条件方差等于无条件方差。
    • Dedecker, Merlevède and Rio (2022):在非平稳设定下,给出了 Kolmogorov 距离的收敛速度,并处理了条件方差随机性的影响(见其 Corollary 3.1)。留下的口子:其界在某些情况下(如 \( \delta=1 \))比本文的 Corollary 2.1 稍弱(\( s_n^{-1/2}\sqrt{\ln s_n} \) vs. \( s_n^{-1/2} \))。
  • 当前 frontier(Wasserstein 距离)
    • Röllin (2014):使用 Stein 方法,在 \( V_n^2 = s_n^2 \) a.s. 且三阶矩有限的条件下,给出了 Wasserstein 距离的显式界(形如 \( \frac{3}{s_n}\sum_{k=1}^n E|X_k|^3/(\rho_{n,k}^2 + a^2) + 2a/s_n \))。留下的口子:要求条件方差等于无条件方差。
    • Dedecker, Merlevède and Rio (2022):在条件方差随机性趋于 0 的设定下,给出了 Wasserstein 距离的收敛速度。留下的口子:其界没有显式常数,且对条件方差偏离的依赖形式与本文不同。
  • 本文的位置:本文试图推广 Bolthausen (1982) 和 Röllin (2014) 的结果,在更一般的条件下(允许条件方差偏离无条件方差,且只要求二阶矩有限)给出 Kolmogorov 和 Wasserstein 距离的收敛速度,并声称这些速度在多种设定下是最优或接近最优的(与 i.i.d. 情形一致,至多差一个 \( \ln n \) 因子)。

子线索聚类

  1. Kolmogorov 距离的 Berry-Esseen 界:这是最成熟的线索。核心工作是 Bolthausen (1982)、Haeusler (1988)、Fan (2019)、Dedecker et al. (2022)。它们主要研究在条件方差等于/不等于无条件方差、不同矩条件下,Kolmogorov 距离的最优收敛速度。本文的 Theorem 2.1 和 2.2 属于此线索,试图统一和推广这些结果。
  2. Wasserstein 距离的收敛速度:这是较新的线索。核心工作是 Röllin (2014) 和 Dedecker et al. (2022)。它们使用 Stein 方法或 Lindeberg 方法,在条件方差等于/不等于无条件方差时给出 Wasserstein 距离的界。本文的 Theorem 2.3 和 2.4 属于此线索,试图推广 Röllin (2014) 的结果到更一般的条件,并给出与 Dedecker et al. (2022) 类似但带有显式常数的结果。

这个方向在追问的核心问题

  1. 在一般条件下(条件方差 ≠ 无条件方差),Kolmogorov 距离的最优收敛速度是什么? 当前主流方法是通过分解误差项为“条件矩项”和“条件方差偏离项”,并分别控制。已知瓶颈是:当条件方差偏离项衰减较慢时,它可能成为主导项(如 Corollary 2.2 中的 \( \ln n / n^\alpha \))。
  2. Wasserstein 距离的收敛速度能否达到与 i.i.d. 情形相同的阶(至多差一个对数因子)? 当前主流方法(Stein 方法)在条件方差等于无条件方差时能做到,但在一般条件下,需要处理条件方差偏离带来的额外项。已知瓶颈是:如何用 Stein 方法处理 \( E[(\sigma_k^2 - \bar\sigma_k^2) f'(\cdot)|\mathcal{F}_{k-1}] \) 这类项。
  3. 条件方差的随机性(即 \( \sigma_k^2 \)\( \bar\sigma_k^2 \) 的差异)如何影响收敛速度? 这是本文和 Dedecker et al. (2022) 都试图回答的问题。当前主流方法是将条件方差偏离项视为一个独立的误差源,并假设其以某种速率衰减(如 \( E|\sigma_k^2 - \bar\sigma_k^2| = O(k^{-\alpha}) \))。
  4. 这些收敛速度是否最优? 最优性通常通过构造反例来证明(如 Bolthausen (1982) 的 Example 2 和 4)。本文声称其许多结果是“最优”或“几乎最优”的,依据是这些速度与 i.i.d. 情形一致,或与已知反例匹配。

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 为“推广 Bolthausen (1982) 和 Röllin (2014) 的结果到更一般的条件”。具体来说,Bolthausen (1982) 的 Theorem 1(即 (1.6))要求 \( \sigma_k^2 = \bar\sigma_k^2 \) a.s. 且三阶矩有界;Röllin (2014) 的 Corollary 2.3 也要求 \( V_n^2 = s_n^2 \) a.s.。本文声称其 Theorem 2.1 和 2.3 去掉了这些限制,只要求二阶矩有限,并允许条件方差偏离无条件方差。这使得本文成为“显然的下一步”。
  • 被淡化或回避的竞争路线
    • Dedecker, Merlevède and Rio (2022) 的工作被引用,但作者在 Corollary 2.1 的 remark 中仅指出其界在 \( \delta=1 \) 时是 \( s_n^{-1/2}\sqrt{\ln s_n} \),而本文的 Corollary 2.1 给出 \( s_n^{-1/2} \),暗示本文更优。但作者没有详细比较两种方法在更一般条件下的优劣,也没有讨论 Dedecker et al. (2022) 的 projective criteria 方法与本文的 Bolthausen 引理方法之间的异同。
    • Haeusler (1988) 的界(1.4)在条件方差偏离时可能仍然有效,但作者没有明确说明本文的结果是否在 Haeusler 的设定下更优或更差。
  • 什么明显该被引/该存在、却没出现在 intro 里? 作者没有引用任何关于高维鞅函数型鞅的 CLT 收敛速度的工作。这暗示本文的设定是经典的低维、固定维数情形。对于一位研究高维统计的研究者来说,这是一个值得注意的缺失——本文的结果是否可以直接推广到高维?如果不能,高维鞅的 Berry-Esseen 界就是一个开放问题。

张力

未见明显对立引用。所有被引工作都在不同条件下给出界,彼此之间是互补关系而非矛盾关系。例如,Bolthausen (1982) 的 \( n^{-1/4} \) 界在条件方差等于无条件方差时最优,而 Haeusler (1988) 的界在条件方差偏离时可能更优。本文试图在更一般的框架下统一它们。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
    • \( \{X_k, \mathcal{F}_k\}_{k\ge 1} \):平方可积鞅差序列。\( X_k \) 是第 \( k \) 个鞅差,\( \mathcal{F}_k \) 是到时刻 \( k \) 为止的信息集(σ-代数)。
    • \( S_n = \sum_{k=1}^n X_k \):鞅本身。
    • \( \sigma_k^2 = E[X_k^2 | \mathcal{F}_{k-1}] \)条件方差(随机变量,依赖于过去信息)。
    • \( \bar\sigma_k^2 = E[X_k^2] \)无条件方差(常数)。
    • \( s_n^2 = \sum_{k=1}^n \bar\sigma_k^2 \):累积无条件方差(常数)。
    • \( V_n^2 = \sum_{k=1}^n \sigma_k^2 \):累积条件方差(随机变量)。
    • \( \rho_{n,k} = \sqrt{V_n^2 - V_{k-1}^2} \):从 \( k \)\( n \) 的累积条件方差的平方根(随机变量)。
    • \( \bar\rho_{n,k} = \sqrt{s_n^2 - s_{k-1}^2} \):从 \( k \)\( n \) 的累积无条件方差的平方根(常数)。
    • \( \tau_{n,k} = \sqrt{\bar\rho_{n,k}^2 + a^2} \):一个正则化后的量,\( a \) 是一个可调的常数(用于处理边界)。
    • \( K(S_n/s_n) \):Kolmogorov 距离,\( \sup_{x\in\mathbb{R}} |P(S_n/s_n \le x) - \Phi(x)| \)
    • \( W(S_n/s_n) \):1-Wasserstein 距离,\( \sup_{f \text{ is 1-Lipschitz}} |E[f(S_n/s_n)] - E[f(N)]| \),其中 \( N \sim N(0,1) \)
  • 模型
    • 数据生成机制:\( \{X_k\} \) 是一个平方可积鞅差序列,即 \( E[X_k | \mathcal{F}_{k-1}] = 0 \) a.s.,且 \( E[X_k^2] < \infty \)
    • 目标:估计标准化鞅 \( S_n/s_n \) 的分布与标准正态分布之间的 Kolmogorov 和 Wasserstein 距离。
    • 已知:\( s_n^2 \to \infty \)(保证 CLT 有意义)。
    • 要估的对象:\( K(S_n/s_n) \)\( W(S_n/s_n) \) 的上界(收敛速度)。
  • 可观测数据
    • 可观测\( X_1, \dots, X_n \) 的样本路径。由此可以计算 \( S_n \)\( s_n^2 \)(通过样本方差估计 \( \bar\sigma_k^2 \))、以及 \( \sigma_k^2 \) 的估计(如果模型允许)。
    • 潜在/不可观测:条件方差 \( \sigma_k^2 = E[X_k^2 | \mathcal{F}_{k-1}] \) 本身是不可直接观测的,因为它依赖于未知的条件分布。在证明中,它被当作一个随机变量来处理,但其值只能通过假设(如 \( \sigma_k^2 = \bar\sigma_k^2 \) a.s.)或通过其与 \( \bar\sigma_k^2 \) 的偏离来间接控制。这是整个问题的核心难点:我们只能观测到 \( X_k \),但收敛速度受制于我们无法直接观测的 \( \sigma_k^2 \)

第二步:讲最小内核

本文的核心思路可以浓缩为一个最简特例:假设所有条件方差等于无条件方差(\( \sigma_k^2 = \bar\sigma_k^2 \) a.s.),且鞅差是有界的(\( |X_k| \le M \) a.s.)。在这个特例下,本文要证明的核心命题退化为:

命题(Bolthausen (1982) 的 Theorem 2 的推广):在 \( \sigma_k^2 = \bar\sigma_k^2 \) a.s. 且 \( ||X||_\infty \le M \) 的条件下,Kolmogorov 距离满足 \( K(S_n/s_n) \le C(M) \frac{n \ln n}{s_n^3} \)。当 \( s_n^2 \asymp n \) 时,这给出 \( K(S_n/s_n) = O(\ln n / \sqrt{n}) \)

为什么这是最小内核? 因为: 1. 去掉了条件方差偏离的复杂性\( \sigma_k^2 = \bar\sigma_k^2 \) 意味着 \( V_n^2 = s_n^2 \) a.s.,这是本文许多定理(如 Theorem 2.2, 2.3)的一个关键子情形。在这个子情形下,所有涉及 \( E|\sigma_k^2 - \bar\sigma_k^2| \) 的项都消失了。 2. 去掉了高阶矩的复杂性:有界性(\( ||X||_\infty < \infty \))意味着所有矩都存在,且尾部行为被完全控制。这允许使用简单的泰勒展开来近似条件期望。 3. 核心数学困难仍然存在:即使在这个特例下,证明仍然需要处理鞅差序列的依赖结构。核心困难在于:如何将 \( E[h(S_n)] - E[h(N)] \) 分解为一系列可控制的项,其中 \( h \) 是 Lipschitz 函数(对于 Wasserstein 距离)或指示函数(对于 Kolmogorov 距离)。

在这个特例下,证明怎么走(以 Wasserstein 距离为例,对应 Theorem 2.3 的简化版): 1. 引入辅助正态变量:引入一个独立于 \( X \) 的标准正态变量 \( Z' \),并考虑 \( S_n + aZ' \)\( Z + aZ' \),其中 \( Z \sim N(0, s_n^2) \)。这一步(称为“平滑化”)是为了利用正态分布的良好性质。 2. Lindeberg 的 telescoping sum:将 \( E[h(S_n + aZ') - h(Z + aZ')] \) 写成从 \( k=1 \)\( n \) 的差分之和:\( \sum_{k=1}^n E[ h(S_k + T_{k+1} + aZ') - h(S_{k-1} + T_k + aZ') ] \),其中 \( T_k = \sum_{i=k}^n \sigma_i Z_i \) 是一个与 \( X \) 独立的正态变量,其条件方差为 \( \rho_{n,k}^2 \)。 3. Stein 方程:对每个 \( k \),利用 Stein 方程 \( g'(x) - xg(x) = f(x) - Ef(Y) \)(其中 \( Y \sim N(0,1) \))来替换 \( h \)。通过精心选择 \( f \)\( g \),可以将差分项转化为关于 \( X_k \)\( \sigma_k \) 的条件期望。 4. 泰勒展开与条件期望控制:对 \( f \)\( g \) 进行泰勒展开,利用 \( E[X_k | \mathcal{F}_{k-1}] = 0 \)\( E[X_k^2 | \mathcal{F}_{k-1}] = \sigma_k^2 \) 来消去低阶项。剩下的高阶项(如 \( E[|X_k|^3 | \mathcal{F}_{k-1}] \))被有界性控制,最终得到形如 \( \frac{1}{s_n} \sum_{k=1}^n \frac{E|X_k|^3}{\rho_{n,k}^2 + a^2} + \frac{2a}{s_n} \) 的界。当 \( s_n^2 \asymp n \) 时,这个界是 \( O(\ln n / \sqrt{n}) \)

核心想法:通过引入辅助正态变量和使用 Stein 方程,将难以直接处理的依赖序列的 CLT 误差,转化为一系列条件期望的累加,这些条件期望可以通过鞅差的条件矩和条件方差来显式控制。这个想法不依赖于 \( \sigma_k^2 = \bar\sigma_k^2 \) 的假设,因此可以推广到一般情形,只是需要额外处理 \( \sigma_k^2 - \bar\sigma_k^2 \) 带来的项。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在鞅差序列只要求二阶矩有限(\( ||X||_2 < \infty \))的一般条件下,给出了标准化鞅 \( S_n/s_n \) 在 Kolmogorov 距离和 Wasserstein-1 距离下的收敛速度(Berry-Esseen 界)。
  2. 核心工具/方法:对于 Kolmogorov 距离,使用 Bolthausen (1982) 的引理(Lemma 4.1 和 4.2)结合泰勒展开和 telescoping sum;对于 Wasserstein 距离,使用 Stein 方法(Chen, Goldstein and Shao, 2011)结合 Lindeberg 的 telescoping sum 论证。
  3. 主要结论:得到了 Kolmogorov 距离的显式上界(Theorem 2.1, 2.2)和 Wasserstein 距离的显式上界(Theorem 2.3, 2.4)。这些上界在多种具体设定下(如条件方差等于无条件方差、条件矩被条件方差控制、条件方差偏离以多项式速率衰减)退化为与 i.i.d. 情形相同的最优或接近最优的收敛速度(如 \( n^{-\delta/2} \), \( \ln n / \sqrt{n} \))。最后,将这些结果应用于分支过程在随机环境中的 Lotka-Nagaev 估计量的 CLT(Theorem 3.1)。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 核心假设\( \{X_k, \mathcal{F}_k\} \) 是平方可积鞅差序列(\( E[X_k | \mathcal{F}_{k-1}] = 0 \) a.s., \( E[X_k^2] < \infty \)),且 \( s_n^2 \to \infty \)
  • Theorem 2.1 (Kolmogorov 距离,一般界):只要求 \( ||X||_2 < \infty \)。这是最弱的假设。
  • Theorem 2.2 (Kolmogorov 距离,改进界):额外要求:
    • \( \sup_{k\ge 1} ||E[X_k^2 | \mathcal{F}_{k-1}]||_\infty < \infty \)(条件方差一致有界)。
    • \( \bar\rho_{n,k}^2 \le C \rho_{n,k}^2 \)(条件方差与无条件方差成比例,这是一个技术性假设,用于控制某些项)。
    • 条件 (2.2):一个关于截断条件矩的极限条件,用于确保某些项可以被吸收到 \( K(S_n/s_n) \) 中。这个条件在 \( ||E[|X_k|^{2+\delta}|\mathcal{F}_{k-1}]||_\infty \le C \bar\sigma_k^2 \) 时自动满足。
  • Theorem 2.3 (Wasserstein 距离,条件方差等于无条件方差):要求 \( V_n^2 = s_n^2 \) a.s. 且 \( ||X||_2 < \infty \)。这是 Röllin (2014) 结果的推广,去掉了三阶矩有限的要求。
  • Theorem 2.4 (Wasserstein 距离,一般界):只要求 \( ||X||_2 < \infty \)。这是对 Dedecker et al. (2022) 结果的补充,给出了显式常数。
  • 与已有文献的对比
    • 相比 Bolthausen (1982):放宽了 \( \sigma_k^2 = \bar\sigma_k^2 \) a.s. 和三阶矩有界的假设。
    • 相比 Röllin (2014):放宽了 \( V_n^2 = s_n^2 \) a.s. 和三阶矩有限的假设。
    • 相比 Dedecker et al. (2022):在 Kolmogorov 距离上,本文的 Corollary 2.1 在某些情形下给出了更优的界(\( s_n^{-1/2} \) vs. \( s_n^{-1/2}\sqrt{\ln s_n} \));在 Wasserstein 距离上,本文的 Theorem 2.4 给出了显式常数。

主要结果

  • Theorem 2.1 (Kolmogorov 距离,一般界):给出了一个包含截断三阶矩、截断二阶矩和条件方差偏离项的上界。这是最一般的结果,后续推论都是它的特例。
  • Corollary 2.1 (Kolmogorov 距离,\( 2+\delta \) 阶矩 + 条件方差偏离):在 \( E|X_k|^{2+\delta} \le C E X_k^2 \)\( E|\sigma_k^2 - \bar\sigma_k^2| \le C \bar\sigma_k^2 / s_n^\alpha \) 下,得到 \( K(S_n/s_n) \ll s_n^{-\delta/(1+\delta)} + \ln s_n / s_n^\alpha \)直觉:第一项来自矩条件,第二项来自条件方差偏离。当 \( \delta=1 \)\( \sigma_k^2 = \bar\sigma_k^2 \) 时,退化为 \( s_n^{-1/2} \),与 Bolthausen (1982) 的 \( n^{-1/4} \) 一致(当 \( s_n^2 \asymp n \))。
  • Corollary 2.2 (Kolmogorov 距离,推广 Bolthausen):在 \( ||X||_{2+\delta} < \infty \)\( \inf \bar\sigma_k^2 > 0 \)\( E|\sigma_k^2 - \bar\sigma_k^2| \ll k^{-\alpha} \) 下,得到 \( K(S_n/s_n) \ll n^{-\delta/(2+2\delta)} + \ln n / n^\alpha \)直觉:当 \( \delta=1 \)\( \sigma_k^2 = \bar\sigma_k^2 \) 时,退化为 \( n^{-1/4} \),即 Bolthausen (1982) 的 Theorem 1。作者声称第一项是最优的(通过反例)。
  • Theorem 2.3 (Wasserstein 距离,\( V_n^2 = s_n^2 \)):给出了一个包含截断二阶矩和截断三阶矩的显式上界。直觉:这是 Röllin (2014) 结果的推广,去掉了三阶矩有限的要求。
  • Corollary 2.6 (Wasserstein 距离,条件矩被条件方差控制):在 \( V_n^2 = s_n^2 \) a.s. 且 \( E[|X_k|^{2+\delta}|\mathcal{F}_{k-1}] \le \gamma E[X_k^2|\mathcal{F}_{k-1}] \) 下,得到 \( W(S_n/s_n) \le C s_n^{-\delta} \)\( \delta \in (0,1) \))或 \( C \ln s_n / s_n \)\( \delta \ge 1 \))。直觉:这是 Fan (2019) 的 Kolmogorov 距离结果在 Wasserstein 距离上的对应。
  • Corollary 2.7 (Wasserstein 距离,与 i.i.d. 一致):在 \( V_n^2 = s_n^2 \) a.s.、\( \sigma_k^2 \ge \alpha \) a.s. 且 \( ||X||_{2+\delta} < \infty \) 下,得到 \( W(S_n/s_n) \ll n^{-\delta/2} \)\( \delta \in (0,1) \))或 \( \ln n / \sqrt{n} \)\( \delta \ge 1 \))。直觉:与 i.i.d. 情形一致,至多差一个 \( \ln n \) 因子。作者特别指出,当 \( \delta=1 \) 时,Wasserstein 距离的收敛速度(\( \ln n / \sqrt{n} \))优于 Kolmogorov 距离的收敛速度(\( n^{-1/4} \))。
  • Theorem 3.1 (BPRE 应用):将上述结果应用于分支过程在随机环境中的 Lotka-Nagaev 估计量,得到了与 Corollary 2.4 和 2.8 形式相同的收敛速度。

证明路线与技术技巧

  • 整体路线(以 Theorem 2.1 为例)

    1. 平滑化:使用 Bolthausen 的 Lemma 4.1,将 \( K(S_n/s_n) \) 的控制转化为对 \( E[\Phi_u(S_n/s_n, a^2/s_n^2)] - \Phi(u) \) 的控制,其中 \( \Phi_u(x,y) = \Phi((u-x)/\sqrt{y}) \)。这一步引入了一个可调参数 \( a \)
    2. Telescoping sum:将 \( E[\Phi_u(S_n/s_n, \tau_{n+1}^2/s_n^2)] - E[\Phi_u(0, \tau_1^2/s_n^2)] \) 写成从 \( k=1 \)\( n \) 的差分之和。
    3. 泰勒展开与分解:对每个差分项进行二阶泰勒展开,利用 \( \partial^2 \Phi_u / \partial x^2 = 2 \partial \Phi_u / \partial y \) 的性质,将差分项分解为三个部分:\( I_1 \)(泰勒展开的余项)、\( I_2 \)(条件方差偏离项)、\( I_3 \)(关于 \( y \) 的泰勒展开余项)。
    4. 控制 \( I_1, I_2, I_3 \)
      • \( I_1 \):通过区分 \( |X_k| \le \tau_{k+1} \)\( |X_k| > \tau_{k+1} \) 两种情形,分别用三阶泰勒展开的余项和二次余项来控制,得到截断三阶矩和截断二阶矩的界。
      • \( I_2 \):直接利用 \( E[\xi_k^2 | \mathcal{F}_{k-1}] - \sigma_k^2/s_n^2 \) 的绝对值,得到条件方差偏离项的界。
      • \( I_3 \):通过二阶泰勒展开,得到一个可以求和并最终被 \( a/s_n \) 控制的项。
    5. 合并:将所有项的界合并,得到 Theorem 2.1 的最终不等式。
  • 关键跳跃点

    • Lemma 4.1 (Bolthausen, 1982):这个引理允许将 Kolmogorov 距离的控制转化为对平滑后分布函数的控制。它的证明依赖于正态分布的性质,是连接 Kolmogorov 距离和泰勒展开的桥梁。难点:如何选择平滑参数 \( a \) 以平衡不同项的贡献。
    • Theorem 2.2 的证明:这里的关键跳跃是使用 Lemma 4.2 和条件 (2.2) 来“吸收” \( I_1 \) 中的一部分到 \( K(S_n/s_n) \) 本身。具体来说,在控制 \( I_1 \) 时,作者没有直接取期望,而是先取条件期望,然后利用 Lemma 4.2 将 \( E[H(H_{k-1})] \)\( K(S_n/s_n) \) 联系起来。这使得 \( I_1 \) 的界中出现了 \( K(S_n/s_n) \) 乘以一个小系数的项。通过条件 (2.2) 确保这个系数小于 1,从而可以将 \( K(S_n/s_n) \) 移到不等式左边并解出。难点:条件 (2.2) 的验证和 Lemma 4.2 的巧妙应用。
    • Theorem 2.3 的证明:关键跳跃是使用 Stein 方程将 Wasserstein 距离的控制转化为对 \( E[\sigma_k^2 f'(\cdot) - X_k f(\cdot) | \mathcal{F}_{k-1}] \) 的控制。难点:如何选择 Stein 方程中的函数 \( f \)\( g \),使得后续的泰勒展开能够利用 \( E[X_k | \mathcal{F}_{k-1}] = 0 \)\( E[X_k^2 | \mathcal{F}_{k-1}] = \sigma_k^2 \) 来消去低阶项,同时保证余项可以被控制。
  • 技术技巧点名

    • Bolthausen 引理 (Lemma 4.1, 4.2):用于处理 Kolmogorov 距离,将分布函数的差转化为期望的差。
    • Stein 方法:用于处理 Wasserstein 距离,通过求解 Stein 方程将 Lipschitz 函数的期望差转化为关于鞅差的条件期望。
    • Lindeberg 的 telescoping sum:将整个序列的误差分解为单个时间步的误差之和,这是处理依赖序列的标准技巧。
    • 泰勒展开与截断:对 \( \Phi_u \) 和 Stein 方程的解进行泰勒展开,并通过截断(区分 \( |X_k| \) 是否大于某个阈值)来控制余项。
    • 条件期望的迭代:反复使用 \( E[\cdot] = E[E[\cdot | \mathcal{F}_{k-1}]] \) 来利用鞅差的条件矩性质。

真实例子与应用

本文包含一个真实应用:分支过程在随机环境(BPRE)中的 Lotka-Nagaev 估计量

  • 用的什么数据/场景:BPRE 是一个随机过程,其中每个个体的繁殖分布由随机环境决定。目标是估计平均后代数 \( m \)。Lotka-Nagaev 估计量 \( \hat m_{n_0,n} = \frac{1}{n} \sum_{k=n_0}^{n_0+n-1} Z_{k+1}/Z_k \) 是一个自然估计量。
  • 怎么把本文方法用上去:作者首先证明 \( \tilde\xi_{k+1} = Z_{k+1}/Z_k - m \) 是一个鞅差序列(在适当的滤子下)。然后,他们验证了这个鞅差序列满足本文 Corollary 2.4 和 2.8 的条件(如 \( E|\sigma_k^2 - \bar\sigma_k^2| = O(1/k) \)\( \sup_k ||E[|\tilde\xi_{k+1}|^{2+\delta}|\mathcal{F}_k]||_\infty < \infty \))。最后,直接应用这些推论,得到标准化估计量 \( S_{n_0,n} = \sqrt{n}(\hat m_{n_0,n} - m)/\sigma \) 的 Kolmogorov 和 Wasserstein 距离的收敛速度(Theorem 3.1)。
  • 得到什么结果:在 \( E|m_0 - m|^{2+\delta} + E|Z_1 - m_0|^{2+\delta} < \infty \) 的条件下,\( K(S_{n_0,n}) \ll n^{-\delta/2} \)\( \delta \in (0,1) \))或 \( \ln n / \sqrt{n} \)\( \delta \ge 1 \)),Wasserstein 距离也有相同阶的界。
  • 这个例子想说明什么:这个例子展示了本文理论结果的直接应用价值。它表明,对于一个非平凡的、具有实际背景的统计模型(BPRE),本文的 Berry-Esseen 界可以给出其估计量的最优或接近最优的收敛速度。这验证了本文理论的有效性和实用性。

🔎 结论是否比证明窄

  • Theorem 2.2 的条件 (2.2):这个条件在证明中至关重要,用于确保 \( K(S_n/s_n) \) 可以被“吸收”。然而,在 Corollary 2.3 和 2.4 中,作者通过更强的矩条件(\( ||E[|X_k|^{2+\delta}|\mathcal{F}_{k-1}]||_\infty \le C \bar\sigma_k^2 \))来验证 (2.2)。这意味着 Theorem 2.2 的结论在比其假设更窄的条件下被证明是成立的。作者没有给出一个不依赖 (2.2) 的、更直接的证明。
  • 最优性声明:作者多次声称其结果是“最优”或“几乎最优”(如 Corollary 2.2, 2.4, 2.7 后的讨论)。这些声明通常基于两点:(a) 与 i.i.d. 情形的最优速率一致;(b) 与 Bolthausen (1982) 的反例匹配。然而,这些反例都是在特定条件下(如 \( \sigma_k^2 = \bar\sigma_k^2 \) a.s.)构造的。在更一般的条件下(如条件方差偏离),作者没有提供反例来证明其界中的 \( \ln n / n^\alpha \) 项是最优的。他们只是说“up to a factor \( \ln n \)”,并引用 Bolthausen (1982) 的 Example 4 来暗示 \( n^{-\alpha} \) 项是最优的。这是一个值得注意的 gap:最优性的证明依赖于特定反例,而这些反例可能不覆盖所有被 claim 的设定

四、开放问题

  1. Wasserstein 距离的精确常数:Theorem 2.3 和 2.4 给出了显式常数(如 6, 3, 2),但作者没有声称这些常数是最优的。扎根于:Theorem 2.3 的陈述“the constants are explicit. This is an advantage of Stein’s method.” 这暗示了寻找 Wasserstein 距离的 Berry-Esseen 界的最优常数是一个开放问题。
  2. Kolmogorov 距离的 \( \ln n \) 因子能否去除? 在 Corollary 2.4 和 2.8 中,当 \( \delta \ge 1 \) 时,Kolmogorov 和 Wasserstein 距离的界中都包含一个 \( \ln n \) 因子。作者指出,对于均匀有界的鞅差,这个因子不能去掉(Bolthausen, 1982, Example 2)。但在更一般的条件下(如条件方差偏离),这个因子是否必要?扎根于:Corollary 2.4 后的讨论:“the factor \( \ln n \) cannot be replaced by 1. Indeed, by Example 2 of Bolthausen [2]...”
  3. 条件方差偏离的更快衰减:本文假设条件方差偏离以多项式速率衰减(\( E|\sigma_k^2 - \bar\sigma_k^2| = O(k^{-\alpha}) \))。如果衰减更快(如指数衰减),收敛速度是否会提升?或者,是否存在一个“信息论下界”,使得即使条件方差偏离衰减得再快,收敛速度也无法超过某个极限?扎根于:Corollary 2.2 和 2.4 中关于 \( \alpha \) 的假设。这是一个自然的推广方向。
  4. 高维或函数型鞅的推广:本文的所有结果都是在 \( \mathbb{R} \) 上的一维鞅。对于高维鞅(如 \( X_k \in \mathbb{R}^d \))或函数型鞅(如 \( X_k \) 是 Hilbert 空间中的随机元),类似的 Berry-Esseen 界是否存在?这需要处理高维或无穷维的 Kolmogorov 和 Wasserstein 距离,以及协方差矩阵的估计。扎根于:本文的整个设定都是一维的。对于一位研究高维统计的研究者来说,这是一个明显的、未被探索的领域。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论