跳转至

High-dimensional normal approximations for sums of Langevin Markov chains

讲者: Xiaolin Wang
会场: Stein Method with Recent Advances
报告题目: High-Dimensional Normal Approximations for Sums of Langevin Markov Chains
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

本文研究的根本问题是:如何量化一个高维马尔可夫链(具体为Langevin Monte Carlo算法生成的链)的部分和(partial sum)向多元正态分布的收敛速度,且该收敛速度必须显式依赖于状态空间的维数 \(d\) 和样本量(链长)\(n\)。这是一个典型的“高维概率”与“计算统计”交叉的问题:一方面,高维正态近似(CLT with dimension)是近十年来高维统计推断的理论基石;另一方面,Langevin Monte Carlo (LMC) 是当前高维贝叶斯采样和生成式建模的核心算法之一。本文试图将这两条独立发展的线索——高维CLT与LMC的收敛分析——首次结合起来。

发展脉络(history)

奠基工作:经典Berry-Esseen与多变量推广。 - Berry-Esseen定理(独立同分布情形,\(O(n^{-1/2})\))是起点。多变量推广由 Bentkus (2003, 2004)Raic (2019) 完成,给出对凸集的界 \(O(d^{7/4} / \sqrt{n})\)。但该界在 \(d \gg n\) 时失效。 - Chernozhukov, Chetverikov, Kato (2013) 实现了突破:对超矩形(hyperrectangles)类,在温和正则性条件下得到 \(O((\log d n)^{7/8} / n^{1/8})\),允许 \(p \gg n\)。这是高维CLT领域的里程碑,开启了“用Gauss近似或bootstrap近似高维统计量分布”的现代路线。

主要进展:向 \(n^{-1/2}\) 速率的推进。 - 随后一批工作通过利用随机向量的正则性(如次高斯性、log-concavity)将速率提升至 \(O(n^{-1/2})\) 量级(至多带 \(\log n\) 因子)。关键文献包括 Lopes (2022)(“隐式平滑”Lindeberg插值)、Kuchibhotla and Rinaldo (2020)(非奇异协方差下的 \(n^{-1/2}\) 率)、以及 Fang and Koike (2024a, 2024b)。特别是 Fang and Koike (2024b) 对log-concave随机向量得到 \(O((\log d)^{3/2} \log n / \sqrt{n})\) 的界,且证明该界在rate意义上最优(见其Proposition 1.2)。Fang and Koike (2024a) 进一步处理了退化协方差情形,并考虑了局部依赖结构。

当前Frontier:从独立到依赖。 - 上述所有高维CLT结果均假设随机向量独立(或至多局部依赖)。对于强依赖的马尔可夫链(如LMC链),高维正态近似理论几乎是空白。本文正是填补这一空白:将高维CLT从独立情形推广到Langevin马尔可夫链的全局依赖情形。

Langevin采样收敛性分析(平行线索)。 - 连续时间Langevin扩散的收敛率(如(1.3)式,\(W_2\) 距离下指数收敛,与 \(d\) 无关)由 Bakry et al. (2008, 2014)Cattiaux and Guillin (2009)Eberle (2015) 等建立,工具为Poincaré不等式或耦合。 - 离散化LMC的非渐近误差\(\pi_\eta\)\(\pi\) 的距离)由 Dalalyan (2017)(TV距离)、Durmus and Moulines (2017, 2019)(加权TV、\(W_2\))、Fang, Shao, Xu (2019)\(W_1\))等建立。这些工作给出 \(W_2(\pi_n, \pi)\) 的显式界,其中离散化误差项含 \(O(\eta d)\)\(O(\eta^2 d)\)。 - Altschuler and Talwar (2024) 进一步研究了 \(\pi_\eta\) 本身的浓度性质(次指数/次高斯性),这是本文引用的“第一步”。

本文的位置:本文是上述两条线索的首次交汇。它研究的是LMC链的部分和(而非单个迭代的分布)的高维正态近似,这是此前任何工作都未触及的问题。

子线索聚类

  1. 高维CLT(独立情形):Chernozhukov et al. (2013), Lopes (2022), Kuchibhotla and Rinaldo (2020), Fang and Koike (2024a, 2024b)。核心工具:Stein方法、Lindeberg交换、隐式平滑、log-concave性质。
  2. LMC收敛分析:Dalalyan (2017), Durmus and Moulines (2017, 2019), Fang et al. (2019), Altschuler and Talwar (2024)。核心工具:泛函不等式、耦合、Jacobi流。
  3. Stein方法在依赖数据上的应用:Fang and Koike (2022)(交换对方法,用于Wishart矩阵等)、Fang et al. (2019)(Bismut公式,用于Langevin扩散的CLT)。本文的Theorem 3.2属于此线索的延伸。

这个方向在追问的核心问题

  1. 高维CLT的依赖结构极限:当随机向量是强依赖的马尔可夫链时,Gauss近似的误差界是什么?维数 \(d\) 和链长 \(n\) 如何权衡?
  2. LMC链的统计推断:能否基于LMC链的部分和构造高维置信区域或假设检验?这需要部分和的CLT。
  3. 速率的最优性:本文得到的界(如 \(d^{5/2} (n\eta)^{-1/2}\))是否在 \(d\)\(n\) 上最优?与独立情形(\(d^{7/4}/\sqrt{n}\))的差距是本质的还是技术性的?

⚠️ 作者的framing

作者将缺口frame成:“高维CLT只处理了独立或局部依赖情形,而LMC链是全局依赖的,且此前没有任何维数显式的收敛速率。” 因此本文成为“显然的下一步”。作者淡化了以下竞争路线: - 直接对LMC链应用独立情形的CLT(如将链视为近似独立?)——作者未讨论。 - 使用批量均值(batch means)或谱方差估计的CLT——这些是MCMC推断的经典方法,但作者未提及。 - 什么明显该被引/该存在、却没出现在intro里?:本文未引用任何关于马尔可夫链中心极限定理(Markov chain CLT) 的经典文献(如Jones (2004), Haggstrom (2005), 或更早的Kipnis and Varadhan (1986))。这些文献处理的是固定维数下MCMC部分和的渐近正态性,但未给出维数显式界。作者可能认为这些工作与“高维”目标无关,但作为背景,它们的缺失值得研究者去查证。

张力

未见明显对立引用。各子线索内部结果一致(如独立高维CLT的速率逐步改进),且LMC收敛分析也有一致结论。唯一可能的张力在于:独立高维CLT的最优速率(\(d^{7/4}/\sqrt{n}\))与本文得到的速率(含 \(d^{5/2}\) 项)之间的差距——这是技术限制还是本质困难?作者未讨论。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \(d\):状态空间维数(高维)。
  • \(n\):LMC链的迭代次数(样本量)。
  • \(\eta\):LMC的步长(step size)。
  • \(X_k \in \mathbb{R}^d\):LMC算法第 \(k\) 步的迭代值(随机变量)。
  • \(\pi(x) \propto e^{-U(x)}\):目标分布(连续、强凸势能)。
  • \(\pi_\eta\):离散LMC链的平稳分布(与 \(\pi\) 不同)。
  • \(W_n = \eta^{1/2} n^{-1/2} \sum_{i=0}^{n-1} (X_i - \mathbb{E}_\pi[X])\)部分和(中心化、缩放后的),是本文研究的对象。
  • \(\Sigma\)\(W_n\) 的渐近协方差矩阵(\(d \times d\),正定,由(1.9)定义)。
  • \(\gamma\)\(d\) 维标准正态分布 \(N(0, I_d)\)
  • \(W_1(\cdot, \cdot)\):1-Wasserstein距离。
  • \(\xi_k \sim N(0, I_d)\):LMC算法中的独立高斯噪声。
  • \(\nabla U(x)\):势能梯度。
  • \(\nabla^2 U(x)\):Hessian矩阵。
  • \(\alpha, \beta\):强凸参数和光滑参数(\(0 < \alpha \le \beta\))。
  • \(M\):三阶及以上导数的上界。
  • \(\varphi_i(x)\):Stein方程 \(A\varphi_i = h_i - \pi(h_i)\) 的解,其中 \(h_i(x) = x_i\)(坐标映射),\(A\) 是Langevin扩散的生成元。

  • 模型

  • 连续时间:Langevin SDE \(dX_t = -\nabla U(X_t) dt + \sqrt{2} dB_t\),其不变分布为 \(\pi\)
  • 离散时间(LMC)\(X_{k+1} = X_k - \eta \nabla U(X_k) + \sqrt{2\eta} \xi_{k+1}\)。这是Euler-Maruyama离散化。
  • 假设\(U\)\(\alpha\)-强凸、\(\beta\)-光滑的,且五阶连续可微,三至五阶导数有界(Assumption 1.1)。步长 \(\eta \le \alpha/(2\beta^2)\)。初始分布 \(X_0 \sim \pi_\eta\)(链处于平稳)。

  • 可观测数据

  • 研究者实际能观测到的是LMC链的迭代值 \(\{X_0, X_1, \dots, X_{n-1}\}\),以及步长 \(\eta\)、势能梯度 \(\nabla U\)(通过Oracle查询)。
  • 想要但观测不到的是:
    1. 目标分布 \(\pi\) 的均值 \(\mathbb{E}_\pi[X]\)(需估计)。
    2. 渐近协方差 \(\Sigma\)(需估计)。
    3. 链的平稳分布 \(\pi_\eta\)(未知,与 \(\pi\) 不同)。
    4. 潜在的反事实量:若使用不同步长或不同初始值,链的轨迹会如何变化。

第二步:最小内核——线性情形(Theorem 2.1)

本文的一般设定(非线性 \(\nabla U\))非常复杂。但论文在Section 2中给出了一个最简特例\(\nabla U(x) = A x\),其中 \(A\) 是正定矩阵。此时LMC链退化为一个线性高斯自回归过程(VAR(1))。在这个特例下,几乎所有技术困难都消失了,核心思路一目了然。

在这个特例下: - LMC更新公式变为:\(X_{k+1} = (I_d - \eta A) X_k + \sqrt{2\eta} \xi_{k+1}\)。 - 这是一个线性系统,解可显式写出:\(X_k = \sqrt{2\eta} \sum_{i=0}^k (I_d - \eta A)^{k-i} \xi_i\)(假设 \(X_0=0\) 或类似)。 - 部分和 \(W_n\) 可以写成独立高斯随机向量的加权和(见(2.3)式):

\[W_n = \frac{1}{\sqrt{n}} \sum_{k=0}^{n-1} Z_k, \quad Z_k = \sqrt{2} A^{-1} [I_d - (I_d - \eta A)^{n-k}] \xi_k.\]
这里 \(\xi_k\) 是独立标准正态向量,因此 \(Z_k\) 是独立高斯向量(均值为0,协方差可算)。

  • 核心命题退化为\(W_n\) 本身是高斯向量(因为独立高斯之和仍是高斯),所以 \(W_n\) 与正态分布 \(\gamma\) 的Wasserstein距离完全由协方差匹配误差决定。即:

    \[W_2(\Sigma^{-1/2} W_n, \gamma) = W_2(\Sigma^{-1/2} W_n, \Sigma_n^{-1/2} W_n) \le \|\Sigma^{-1/2} - \Sigma_n^{-1/2}\|_{\text{op}} \sqrt{\mathbb{E}|W_n|^2},\]
    其中 \(\Sigma_n = \text{Cov}(W_n)\)\(\Sigma = \lim_{n\to\infty} \Sigma_n\)

  • 证明怎么走

  • 计算 \(\Sigma_n\)\(\Sigma\) 的显式表达式(Lemma 2.2)。
  • 证明 \(\|\Sigma_n - \Sigma\|_{\text{op}} \le C n^{-1} \eta^{-1} d\)(由矩阵范数不等式和 \(X_0\) 的二阶矩有界得到)。
  • 利用矩阵平方根的Lipschitz性质(Higham, Theorem 6.2)得到 \(\|\Sigma_n^{-1/2} - \Sigma^{-1/2}\|_{\text{op}} \le C \|\Sigma_n - \Sigma\|_{\text{op}}\)
  • 结合 \(\mathbb{E}|W_n|^2 = \text{tr}(\Sigma_n) \le C d\),得到 \(W_2(\Sigma^{-1/2} W_n, \gamma) \le C n^{-1} \eta^{-1} d^{3/2}\)
  • 代入 \(n = \lfloor \eta^{-p} \rfloor\) 得到 Theorem 2.1 中的第一项 \(C n^{1/p - 1} d^{3/2}\)

  • 为什么成立:因为线性+高斯性,\(W_n\) 本身就是高斯的,所以CLT是精确的(无需Stein方法),唯一误差来自有限样本协方差与极限协方差的偏差。这个偏差由链的几何遍历性\((I_d - \eta A)\) 的谱半径 < 1)控制,且与 \(d\) 的依赖来自迹的维数。

这个最小内核揭示了整篇论文的核心数学困难:当 \(\nabla U\) 非线性时,\(W_n\) 不再是高斯的,且不能写成独立随机向量的和。因此必须引入Stein方法处理依赖结构,并处理一个复杂的余项。线性情形是“无余项”的理想情况,其速率(\(d^{3/2} n^{1/p-1}\))远优于一般情形的速率(\(d^{5/2} (n\eta)^{-1/2}\)),这直观说明了非线性带来的代价。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:对于Langevin Monte Carlo算法生成的马尔可夫链,给出了其部分和 \(W_n\) 向高维标准正态分布 \(\gamma\) 的1-Wasserstein距离的显式上界,该上界显式依赖于维数 \(d\)、链长 \(n\) 和步长 \(\eta\)
  2. 核心工具/方法:发展了一个基于交换对(exchangeable pair) 的Stein方法新变体(Theorem 3.2),该变体通过构造一个辅助变量 \(D\) 来简化对依赖结构的处理;并将 \(W_n\) 分解为鞅部分 \(H_n\) 和余项 \(R_n\),分别用Stein方法和随机计算控制。
  3. 主要结论:在势能强凸、光滑且高阶导数有界的假设下(Assumption 1.1),当步长 \(\eta \le \alpha/(2\beta^2)\) 且链处于平稳时,有
    \[W_1(\Sigma^{-1/2} W_n, \gamma) \le C \left[ d^{5/2} (n\eta)^{-1/2} + n^{-1/2} d^{3} \log(nd) + \eta^{1/2} d^{3} + \eta^{3/2} n^{1/2} d^{5/2} \right].\]
    特别地,当 \(n = \lfloor \eta^{-p} \rfloor\)\(1 < p < 3\))时,该界可简化为 \(d^{5/2}\) 乘以 \(n\) 的幂次项(Corollary 1.5)。

关键设定与假设

  • Assumption 1.1(完整设定):
  • (i) \(U\) 五阶连续可微。
  • (ii) \(\nabla U(0) = 0\)(可放松为 \(\|\nabla U(0)\|_2 \le C d\),见Remark 1.3)。
  • (iii) \(U\)\(\alpha\)-强凸且 \(\beta\)-光滑:\(\alpha I_d \preceq \nabla^2 U \preceq \beta I_d\)
  • (iv) \(\|\nabla^3 U\|_{\text{op}}, \|\nabla^4 U\|_{\text{op}}, \|\nabla^5 U\|_{\text{op}} \le M\)(一致有界)。
  • 相比已有文献
  • 相比独立高维CLT(如Fang and Koike 2024b):本文需要更强的正则性(五阶导数有界 vs. log-concavity),因为需要控制Jacobi流的高阶矩(Lemma A.1)。
  • 相比LMC收敛分析(如Dalalyan 2017):本文额外需要三至五阶导数有界,这是为了确保Stein方程解 \(\varphi_i\) 的四阶导数有界(Proposition 3.4),从而控制余项中的高阶泰勒展开。
  • 统计含义
  • 强凸性保证链的几何遍历性(指数混合),这是控制依赖结构的关键。
  • 高阶导数有界保证Jacobi流的高阶矩指数衰减(Lemma A.1),这是Stein方法中泰勒余项可积的基础。
  • 步长 \(\eta \le \alpha/(2\beta^2)\) 确保离散化后的链仍保持几何遍历性(谱半径 < 1)。

主要结果

  • Theorem 1.2(主定理):给出了 \(W_1(\Sigma^{-1/2} W_n, \gamma)\) 的上界(见上文三句话)。
  • 直觉:四项分别对应:
    1. \(d^{5/2} (n\eta)^{-1/2}\):鞅部分 \(H_n\) 的CLT误差(来自Stein方法,与独立情形类似但维数指数更高)。
    2. \(n^{-1/2} d^{3} \log(nd)\):交换对构造中 \(D\)\(\delta\) 的矩控制(来自对数修正项)。
    3. \(\eta^{1/2} d^{3}\):离散化误差(来自余项 \(R_n\) 中的二阶项)。
    4. \(\eta^{3/2} n^{1/2} d^{5/2}\):离散化误差的高阶项(来自余项中的三阶项)。
  • 必要条件\(\Sigma\) 正定(Lemma 1.7),确保 \(\Sigma^{-1/2}\) 良定义。
  • 解决的技术难点:处理全局依赖(非独立)下的高维CLT,这是首次。

  • Theorem 2.1(线性情形):\(W_2\) 距离的界,速率更快(\(d^{3/2} n^{1/p-1}\)),且当初始分布为高斯时,误差仅来自协方差偏差(无Stein误差)。

  • Corollary 1.5:当 \(n = \lfloor \eta^{-p} \rfloor\) 时,主定理的界简化为 \(d^{5/2}\) 乘以 \(n\) 的幂次项,便于理解 \(n\)\(\eta\) 的权衡。

证明路线与技术技巧

整体路线(Section 3):

  1. Step 1: 分解。将 \(W_n\) 分解为鞅部分 \(H_n\) 和余项 \(R_n\)((3.11)式)。\(H_n\)\(\xi_k\) 的鞅差序列和,\(R_n\) 包含6项,来自对 \(W_n\) 的泰勒展开和Stein方程的应用。
  2. Step 2: 控制鞅部分。对 \(H_n\) 应用Stein方法(Theorem 3.2),得到 \(W_1(\Sigma^{-1/2} H_n, \gamma)\) 的界(Proposition 3.5)。
  3. 子步骤2a: 构造交换对。随机选取一个索引 \(I\),将 \(\xi_I\) 替换为独立副本 \(\xi'_I\),得到 \(H'_n\)。定义 \(D\)\(\delta = H'_n - H_n\)((3.12)-(3.13))。
  4. 子步骤2b: 验证Assumption 3.1。计算条件期望 \(\mathbb{E}[D | X]\)\(\mathbb{E}[D \delta^\top | X]\),得到 \(\Xi\)((3.14))。关键:通过构造,\(\mathbb{E}[D | X] = \lambda W\) 精确成立(无余项 \(R_1\)),这是本文Stein方法变体的优势(见Remark 3.3)。
  5. 子步骤2c: 估计 \(\sqrt{d} \mathbb{E}\|\Xi\|_{\text{HS}}\)。将 \(\Xi\) 分解为三项(\(R_1, R_2, R_3\)),分别用协方差估计(Lemma 3.7)、\(\chi^2\) 矩、和链的几何混合((3.19))控制。
  6. 子步骤2d: 估计 \(\mathbb{E}[|D| |\delta|^2 (|\log|\delta|| \vee 1)]\)。利用 \(D\)\(\delta\) 的显式表达式,通过链的几何遍历性和矩不等式得到 \(O(n^{-3/2} d^3 \log(nd))\)
  7. Step 3: 控制余项。对 \(R_n\) 的6项分别用随机计算和矩不等式估计(Proposition 3.8),得到 \(\mathbb{E}|\Sigma^{-1/2} R_n| \le C[(n\eta)^{-1/2} d + \eta^{1/2} d^2 + \eta^{3/2} n^{1/2} d^{5/2}]\)
  8. 关键引理:Lemma 3.9(\(\pi_\eta\) 的四阶矩有界 \(O(d^2)\))、Lemma 3.10(二阶和三阶项的方差有界)。
  9. Step 4: 合并。由Wasserstein距离的三角不等式((3.47)),将Step 2和Step 3的界相加即得Theorem 1.2。

关键跳跃点: - 构造 \(D\) 而非直接使用 \(\delta\)(Remark 3.3):传统交换对方法(如Fang and Koike 2022)要求 \(\mathbb{E}[\delta | X] = \lambda (W + R_1)\),其中 \(R_1\) 是余项。本文通过构造 \(D\) 使得 \(\mathbb{E}[D | X] = \lambda W\) 精确成立,从而简化了Stein方程的处理。代价是需要额外控制 \(\mathbb{E}[D \delta^\top | X]\) 中的 \(\Xi\)。 - 控制 \(\Xi\) 中的 \(R_3\)((3.18)-(3.21)):\(R_3\) 涉及 \(r_I\)(替换 \(\xi_I\) 后对后续迭代的影响)与 \(t_I\) 的乘积。利用链的几何混合((3.19))和Cauchy-Schwarz不等式,将其上界归结为 \(O(d^2 n^{1/p - 1})\),这是证明中最精细的部分之一。 - 余项 \(R_n\) 的分解((3.11)下方):将 \(W_n\) 通过Stein方程的解 \(\varphi_i\) 展开,得到6项余项。这需要 \(\varphi_i\) 的四阶导数有界(Proposition 3.4),而后者依赖于Jacobi流的高阶矩指数衰减(Lemma A.1)。

技术技巧点名: - Stein方法(交换对变体):Theorem 3.2,核心工具。 - Jacobi流的高阶矩估计:Lemma A.1,用于证明Stein方程解的正则性(Proposition 3.4)。使用Itô公式和Young不等式。 - 几何遍历性(谱半径):用于控制链的混合速率,如(3.19)式中的 \((1 - 2\eta\alpha + \eta^2\beta^2)^{(j-I)/2}\)。 - 矩阵范数不等式:Lemma 3.6,用于在Hilbert-Schmidt范数和算子范数之间转换。 - 比较定理(Comparison theorem):用于Jacobi流矩估计的证明(Lemma A.1证明中引用Platen 2003)。

真实例子与应用

本文为纯理论工作,无真实数据例子或模拟实验。 论文仅包含一个理论特例(线性情形,Section 2)作为“热身”(warm-up),该特例用于展示在无非线性困难时的最优速率。没有实证部分。

🔎 结论是否比证明窄

  • Theorem 1.2的界中,\(d^{5/2}\) 项是否最优? 作者未讨论。独立情形下最优维数依赖是 \(d^{7/4}\)(Bentkus 2003, Fang and Koike 2024a),本文的 \(d^{5/2}\) 明显更差。作者在Remark 1.6中仅提到“首次给出维数显式速率”,未声称最优性。这暗示 \(d^{5/2}\) 可能不是最优,但作者未给出下界。
  • Corollary 1.5要求 \(n = \lfloor \eta^{-p} \rfloor\)\(1 < p < 3\)。当 \(p \ge 3\) 时(即 \(\eta\) 衰减更快),界中的 \(\eta^{3/2} n^{1/2} d^{5/2}\) 项会发散。作者未讨论 \(p \ge 3\) 的情形,也未说明这是技术限制还是本质困难。
  • Assumption 1.1(iv)(五阶导数有界) 是否必要?作者在Remark 1.3中仅说“imposed to ensure the exponential convergence of the Jacobi flow”。可能可以放松,但作者未给出更弱的条件。
  • \(\Sigma\) 的定义((1.9)) 依赖于Stein方程的解 \(\varphi_i\),而 \(\varphi_i\) 本身是未知的。作者在Remark 1.4中承认“this derivation is not rigorous”,仅作为直观。实际应用中如何估计 \(\Sigma\) 未讨论。

四、开放问题(点到为止,扎根具体语句)

  1. 维数依赖的最优性:本文的界含 \(d^{5/2}\),而独立情形最优为 \(d^{7/4}\)。能否将 \(d^{5/2}\) 改进至 \(d^{7/4}\) 或更低?这需要新的技术(如利用log-concavity或更精细的Stein方法)。扎根:Theorem 1.2的界与Fang and Koike (2024b)的 \(O((\log d)^{3/2} / \sqrt{n})\) 对比,差距明显。

  2. 非强凸势能:本文假设 \(U\) 强凸(\(\alpha > 0\))。若 \(U\) 仅凸(\(\alpha = 0\))或非凸,链的混合速率会变慢(可能多项式而非指数),高维CLT是否仍成立?速率如何?扎根:Assumption 1.1(iii) 是强凸性,且步长条件 \(\eta \le \alpha/(2\beta^2)\) 依赖 \(\alpha\)

  3. \(p \ge 3\) 的情形:Corollary 1.5要求 \(1 < p < 3\)。当 \(p \ge 3\)(即 \(\eta\) 衰减更快)时,界中的 \(\eta^{3/2} n^{1/2} d^{5/2}\) 项发散。这是技术限制(如余项估计中的泰勒展开阶数不足)还是本质困难?扎根:Corollary 1.5的陈述和证明中对 \(p\) 的限制。

  4. \(W_1\) 到Kolmogorov距离:本文使用1-Wasserstein距离。对于统计推断(如构造置信区域),通常需要Kolmogorov距离(超矩形上的sup-norm)。能否将结果推广到Kolmogorov距离?扎根:论文引言中引用了大量Kolmogorov距离的结果(如Chernozhukov et al. 2013, Fang and Koike 2024b),但本文只处理了 \(W_1\)


Maintained by 陈星宇 · Homepage · Source on GitHub

评论