Edgeworth Expansions for Linear Rank Statistics -- Consolidated Version¶
作者: Walter Schneller
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2607.05284
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:如何为线性秩统计量(linear rank statistics)在零假设下的分布提供比正态逼近更精确的近似。线性秩统计量是秩检验的核心,其形式为 \(T_A = \sum_i a_{i\pi(i)}\),其中 \(\pi\) 是均匀随机排列,\(A=(a_{ij})\) 是 \(n\times n\) 的得分矩阵。经典的中心极限定理(CLT)给出了 \(T_A\) 的渐近正态性,但余项通常为 \(O(n^{-1/2})\) 量级。Edgeworth 展开的目标是将逼近精度提升到 \(O(n^{-1})\) 甚至更高,从而为秩检验提供更精确的 p 值近似。这个方向在 1980 年代达到高潮,本文是当时最完整的理论成果之一,但至今仍是该领域的标准参考。
发展脉络(history)¶
- 奠基工作:CLT 与 Berry-Esseen 界
- Hoeffding (1951):证明了线性秩统计量的渐近正态性(组合 CLT),奠定了该方向的基础。
- Motoo (1957):给出了 Hoeffding CLT 的简化证明。
-
Bolthausen (1984):首次为一般线性秩统计量建立了 Berry-Esseen 界,即 \(\sup_z |F_A(z) - \Phi(z)| \le K \beta_A / n\),其中 \(\beta_A = \sum_{i,j} |\hat{a}_{ij}|^3\)。这是本文的直接前驱——Bolthausen 的余项阶为 \(O(n^{-1/2})\) 量级(因为 \(\beta_A/n\) 通常为 \(O(n^{-1/2})\)),而本文的目标是将余项阶推进到 \(O(n^{-1})\)。
-
主要进展:Edgeworth 展开的尝试
- Does (1982):为简单线性秩统计量(\(a_{ij} = e_i d_j\))建立了 Berry-Esseen 界。
- Does (1983):为简单线性秩统计量建立了 Edgeworth 展开,但假设较强(如对得分函数 \(J\) 的光滑性要求高),且展开形式与本文不同(用积分而非 Riemann 和)。
- Bickel & van Zwet (1978) 和 Robinson (1978):在两样本情形下(即 \(a_{ij} = e_i d_j\) 且 \(e_i\) 为 0/1 指示变量)建立了 Edgeworth 展开,但余项阶含 \(n^\epsilon\) 因子,不够干净。
-
van Zwet (1982):给出了简单线性秩统计量特征函数估计的关键引理,为验证 Edgeworth 展开的条件提供了可操作的途径。
-
当前 frontier → 本文的位置
- Bickel & Robinson (1982):为 i.i.d. 情形下的 Edgeworth 展开找到了必要且充分的条件(即光滑性条件)。本文的核心贡献是:将 Bickel-Robinson 的条件推广到线性秩统计量,并证明 van Zwet 的条件(在微小因子内)蕴含了这些条件。
- 本文 (Schneller, 1989/2026):为一般线性秩统计量建立了第一阶 Edgeworth 展开(余项 \(O(\delta_A/n)\),通常为 \(O(n^{-1})\)),并给出了第二阶展开的公式化结果(未证明)。证明方法结合了 Stein 方法 和 Bolthausen 的组合方法的推广。
- Schneller (2025):是本文的完整技术报告(英文翻译版),包含了第二阶展开的完整证明。
子线索聚类¶
- Berry-Esseen 界:Hoeffding (1951), Motoo (1957), Bolthausen (1984), Does (1982), Ho & Chen (1978)。这一簇关注的是正态逼近的误差界,通常余项为 \(O(n^{-1/2})\)。
- Edgeworth 展开:Does (1983), Bickel & van Zwet (1978), Robinson (1978), van Zwet (1982), Schneller (本文)。这一簇追求更精确的逼近(余项 \(O(n^{-1})\) 或更好),但需要更强的条件。
- 条件验证:van Zwet (1982) 给出了简单线性秩统计量特征函数估计的引理,使得 Edgeworth 展开的条件可以被验证。本文在此基础上,将 van Zwet 的条件与 Bickel-Robinson 的光滑性条件联系起来。
这个方向在追问的核心问题¶
- 如何获得比 Berry-Esseen 更精确的分布逼近?
- 当前主流方法:Edgeworth 展开。瓶颈在于:展开的余项控制需要分布函数的光滑性条件(如二阶差分的界),而这些条件对秩统计量很难直接验证。
- 如何验证 Edgeworth 展开的条件?
- 对于一般线性秩统计量,条件(如本文的 (2.5))是自然且几乎必要的,但难以直接证明。对于简单线性秩统计量(\(a_{ij}=e_i d_j\)),van Zwet (1982) 的特征函数估计提供了验证途径。
- 如何推广到更高阶的展开?
- 第二阶展开的证明复杂度急剧上升(需要处理 16 个索引的组合构造),且余项阶通常为 \(O(n^{-3/2})\)。本文给出了公式但未证明,Schneller (2025) 包含了完整证明。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者在引言中明确指出,Bolthausen (1984) 的 Berry-Esseen 界(余项 \(O(\beta_A/n)\))是当前最好的结果,但“the purpose of this paper is to establish Edgeworth expansions of first order”。作者将本文定位为 Bolthausen 结果的自然推广——从 Berry-Esseen 到 Edgeworth,从 \(O(n^{-1/2})\) 到 \(O(n^{-1})\)。
- 哪些竞争路线被他淡化或回避了:
- Does (1983) 的结果被作者在 Remark 2.18(c) 中提及,但作者强调自己的展开形式不同(用 Riemann 和而非积分),且假设更弱、余项阶更好。
- Bickel & van Zwet (1978) 和 Robinson (1978) 的结果被作者在引言中提及,但作者指出自己的结果“comparable (up to a factor \(n^\epsilon)\)”,暗示自己的余项阶更优(不含 \(n^\epsilon\) 因子)。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 作者没有引用任何关于高维设定(如 \(n\) 远小于矩阵元素数)或非零假设下的 Edgeworth 展开的工作。这可能是由于本文专注于零假设下的精确分布逼近,而高维设定在当时尚未成为主流。
- 作者没有引用任何关于计算复杂度或算法实现的工作。本文是纯理论,没有讨论如何实际计算 Edgeworth 展开的系数或如何用于假设检验。
张力¶
- 未见明显对立引用。所有被引工作都在推进同一方向:从 CLT 到 Berry-Esseen 到 Edgeworth,条件逐渐加强,余项逐渐缩小。没有出现彼此矛盾或相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(A = (a_{ij})\):\(n \times n\) 的得分矩阵,实数。
- \(\pi\):均匀随机排列,定义在 \(\{1,\dots,n\}\) 上。
- \(T_A = \sum_i a_{i\pi(i)}\):线性秩统计量(中心化前)。
- \(\mu_A = \sum_{i,j} a_{ij} / n\),\(\sigma_A^2 = \sum_{i,j} \breve{a}_{ij}^2 / (n-1)\),其中 \(\breve{a}_{ij} = a_{ij} - \text{行均值} - \text{列均值} + \text{总均值}\)。
- \(\hat{a}_{ij} = \breve{a}_{ij} / \sigma_A\):标准化后的得分,满足 \(\sum_{i,j} \hat{a}_{ij}^2 = n-1\)。
- \(F_A(z) = P(T_A \le z)\):\(T_A\) 的分布函数。
- \(\Phi\):标准正态分布函数,\(\psi = \Phi'\)。
- \(\beta_A = \sum_{i,j} |\hat{a}_{ij}|^3\),\(\delta_A = \sum_{i,j} |\hat{a}_{ij}|^4\)。
- \(D_A = (\delta_A / n)^{1/2}\),\(E_A = (\sum_{i,j} |\hat{a}_{ij}|^5 / n)^{1/3}\)。
- \(\lambda_{1,A} = n^{-1} \sum_{i,j} \hat{a}_{ij}^3\),\(\lambda_{2,A}\):第二阶展开的累积量。
- \(e_{1,A}(x)\):第一阶 Edgeworth 展开,\(e_{1,A}(x) = \Phi(x) - \psi(x) \frac{1}{6} \lambda_{1,A} (x^2 - 1)\)。
-
\(N(l, A)\):从 \(A\) 中删除 \(l\) 行 \(l\) 列后得到的所有 \((n-l) \times (n-l)\) 子矩阵的集合。
-
模型:
- 数据生成机制:\(\pi\) 是 \(\{1,\dots,n\}\) 上的均匀随机排列。\(T_A\) 是 \(\pi\) 的确定性函数。
- 统计模型:无参数模型。所有概率来自排列的均匀分布。
- 已知:矩阵 \(A\) 是已知的(由研究者指定)。
-
要估的对象:\(F_A\) 的分布,特别是其与正态分布 \(\Phi\) 的偏差。
-
可观测数据:
- 可观测:矩阵 \(A\) 和排列 \(\pi\) 的实现。但通常我们只观测到 \(T_A\) 的值(即一次排列的结果)。
- 潜在 / 不可观测:排列 \(\pi\) 本身(在单次实验中不可重复观测)。所有概率计算都基于排列的均匀分布假设。
第二步:最小内核¶
最简特例:\(a_{ij} = e_i d_j\)(简单线性秩统计量),且 \(e_i\) 和 \(d_j\) 都是 0/1 变量(两样本情形)。
- 在这个特例下,\(T_A\) 退化为两样本秩和统计量(如 Wilcoxon 统计量)。
- 本文的 Edgeworth 展开退化为:
- 核心思路:通过 Stein 方法将 \(E(q(T_A))\) 的逼近转化为对 \(E(f'(T_A)) - E(T_A f(T_A))\) 的估计,其中 \(f\) 是 Stein 方程的解。然后利用 Bolthausen 的组合方法,通过构造 8 个随机索引 \(I_1,\dots,I_8\) 和 4 个随机排列 \(\pi_1,\dots,\pi_4\),将 \(T_A\) 分解为条件独立的部分,从而进行高阶泰勒展开。
- 为什么成立:组合构造保证了某些项的条件独立性(如 \(\pi_4\) 与 \(I_1\) 独立),使得期望可以分解为乘积形式,从而将高阶矩的估计转化为对低阶矩的估计。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在零假设下,为一般线性秩统计量 \(T_A\) 建立第一阶 Edgeworth 展开,余项阶通常为 \(O(n^{-1})\),并给出第二阶展开的公式化结果(未证明)。
- 核心工具 / 方法:Stein 方法 + Bolthausen 组合方法的推广。
- 主要结论:
- Theorem 2.1:对光滑函数 \(q\),\(|E(q(T_A)) - \int q e_{1,A}' dx| \le (K_1\|q\| + K_2\|q'\| + K_3\|q''\|) D_A^2\)。
- Theorem 2.4:对分布函数 \(F_A\),在条件 (2.5) 下,\(\|F_A - e_{1,A}\| \le (K_4 C_1 + K_5) D_A^2\)。
- Theorem 2.12(a):对简单线性秩统计量(\(a_{ij}=e_i d_j\)),在 van Zwet 条件下,\(\|F_A - e_{1,A}\| \le K_1 (\log n)^2 D_A^2\)。
关键设定与假设¶
- 标准化:假设 \(a_{ij} = \hat{a}_{ij}\)(即已中心化并标准化),且 \(|\hat{a}_{ij}| \le 1\)(通过截断实现)。
- 条件 (2.5):存在常数 \(C_1\) 使得对所有 \(z \in \mathbb{R}\)、\(0 \le y \le D_A\) 和 \(B \in N(8, \hat{A})\),有 \(|\Delta_y^2 F_B(z)| \le C_1 (D_A^2 + y^2)\)。这是 Bickel-Robinson 光滑性条件的推广,要求分布函数的二阶差分有界。
- van Zwet 条件 (2.13)-(2.15):对 \(e_i\) 和 \(d_j\) 的矩条件(如 \(\sum |e_i - \bar{e}|^r \ge en\) 等)和 Lebesgue 测度条件。这些条件比 (2.5) 更容易验证。
- 相比已有文献:
- 相比 Bolthausen (1984):从 Berry-Esseen 界(余项 \(O(\beta_A/n)\))推进到 Edgeworth 展开(余项 \(O(\delta_A/n)\))。
- 相比 Does (1983):假设更弱(对 \(J\) 的光滑性要求更低),余项阶更好(不含 \(n^\epsilon\) 因子)。
- 相比 Bickel & van Zwet (1978):从两样本情形推广到一般简单线性秩统计量。
主要结果¶
- Theorem 2.1(光滑函数):
- 陈述:对二次可导且导数有界的 \(q\),\(|E(q(T_A)) - \int q e_{1,A}' dx| \le (K_1\|q\| + K_2\|q'\| + K_3\|q''\|) D_A^2\)。
- 直觉:光滑函数的 Edgeworth 展开只需要函数本身的光滑性,不需要分布的光滑性。
- 必要条件:\(D_A = (\delta_A/n)^{1/2}\) 小(通常 \(O(n^{-1/2})\))。
-
解决的技术难点:通过 Stein 方法将问题转化为对 \(E(f'(T_A)) - E(T_A f(T_A))\) 的估计,其中 \(f\) 是 Stein 方程的解。
-
Theorem 2.4(分布函数):
- 陈述:在条件 (2.5) 下,\(\|F_A - e_{1,A}\| \le (K_4 C_1 + K_5) D_A^2\)。
- 直觉:分布函数的 Edgeworth 展开需要分布本身的光滑性(二阶差分的界)。
- 必要条件:条件 (2.5) 是几乎必要的(Remark 2.11(a))。
-
解决的技术难点:用光滑函数 \(q_z\) 逼近指示函数 \(1_{(-\infty, z]}\),并利用条件 (2.5) 控制逼近误差。
-
Theorem 2.12(a)(简单线性秩统计量):
- 陈述:在 van Zwet 条件下,\(\|F_A - e_{1,A}\| \le K_1 (\log n)^2 D_A^2 \le K_2 (\log n)^2 n^{-1 + ((4/k)-1)_+ + ((4/s)-1)_+}\)。
- 直觉:van Zwet 的特征函数估计(Lemma 6.5)可以用来验证条件 (2.5)。
- 必要条件:\(e_i\) 和 \(d_j\) 的矩条件(如存在 \(k>2\) 使得 \(\sum |e_i - \bar{e}|^k \le En\))。
- 解决的技术难点:将 van Zwet 的特征函数估计与 Bickel-Robinson 的光滑性条件联系起来(Lemma 6.3 和 Lemma 6.7)。
证明路线与技术技巧¶
整体路线(以 Theorem 2.4 为例):
- Step 1:用光滑函数逼近指示函数(Lemma 5.2)。
- 构造 \(q_z(x)\),它是 \(1_{(-\infty, z]}(x)\) 的二次样条逼近,满足 \(q_z\) 有界、一阶导数有界、二阶导数分段线性。
-
利用条件 (2.5) 控制逼近误差:\(\|F_A - e_{1,A}\| \le \sup_z |E(q_z(T_A)) - \int q_z e_{1,A}' dx| + (C_1+1) D_A^2\)。
-
Step 2:对光滑函数应用 Stein 方法(Lemma 3.19)。
- 定义 \(f = \Theta q_z\),满足 \(f'(x) - x f(x) = q_z(x) - \Phi(q_z)\)。
- 则 \(E(q_z(T_A)) - \Phi(q_z) = E(f'(T_A)) - E(T_A f(T_A))\)。
-
通过 Bolthausen 的组合构造,将 \(E(T_A f(T_A))\) 展开为 \(E(f'(T_A)) + \frac{1}{2} E(T_A^3) E(T_A f'(T_A)) + R(q_z)\),其中 \(R(q_z)\) 是余项。
-
Step 3:估计余项 \(R(q_z)\)(Lemma 5.3)。
- 利用条件 (2.5) 和 Proposition 5.7(\(E(|T_A| 1_{(-\infty, z]}(T_A))\) 的 Berry-Esseen 界)控制 \(R(q_z)\)。
-
关键:将 \(f''\) 的差分转化为 \(q_z'\) 的差分,然后利用 (2.5) 控制 \(q_z'\) 的期望。
-
Step 4:处理主项 \(\frac{1}{2} E(T_A^3) E(T_A f'(T_A))\)(Lemma 5.5)。
- 证明 \(|\frac{1}{2} E(T_A^3) E(T_A f'(T_A)) - \frac{1}{2} \lambda_{1,A} \Phi(x f'(x))| \le c D_A^2\)。
-
这需要 \(E(T_A f'(T_A))\) 的 Berry-Esseen 界(Proposition 5.7 的推广)。
-
Step 5:组合所有项。
- 得到 \(|E(q_z(T_A)) - \int q_z e_{1,A}' dx| \le (c_1 C_1 + c_2) D_A^2\),代入 Step 1 即得定理。
关键跳跃点:
- Bolthausen 组合构造:构造 8 个随机索引 \(I_1,\dots,I_8\) 和 4 个随机排列 \(\pi_1,\dots,\pi_4\),使得某些项条件独立。这是整个证明的基石,也是最难理解的部分。
- 条件 (2.5) 的验证:对于一般线性秩统计量,条件 (2.5) 难以直接验证。对于简单线性秩统计量,通过 van Zwet 的特征函数估计(Lemma 6.5)和 Lemma 6.3(将二阶差分与特征函数积分联系起来)来验证。
- Proposition 5.7:\(E(|T_A| 1_{(-\infty, z]}(T_A))\) 的 Berry-Esseen 界。这是证明 Lemma 5.3 和 Lemma 5.5 的关键工具。
技术技巧点名:
- Stein 方法:用于将分布逼近问题转化为微分方程的解的期望的估计。
- Bolthausen 组合方法:通过构造随机索引和排列,将依赖结构分解为条件独立的部分。
- 泰勒展开:对 \(f\) 和 \(f'\) 进行高阶泰勒展开,直到二阶项。
- 条件期望估计:利用条件独立性,将高阶矩的估计转化为低阶矩的估计。
- 特征函数估计:van Zwet (1982) 的引理用于估计简单线性秩统计量的特征函数。
- 光滑函数逼近:用二次样条函数 \(q_z\) 逼近指示函数 \(1_{(-\infty, z]}\)。
真实例子与应用¶
- 本文为纯理论,无实证例子。论文没有模拟实验或真实数据应用。所有结果都是定理和证明。
🔎 结论是否比证明窄¶
- Theorem 2.4 的条件 (2.5) 要求对所有 \(B \in N(8, \hat{A})\) 成立,而不仅仅是 \(\hat{A}\) 本身。作者在 Remark 2.11(b) 中承认:“It seems likely... that the Theorems 2.4 and 2.7 remain correct, if we assume (2.5), (2.8) and (2.9) only for \(\hat{A}\) instead of \(B \in N(8, \hat{A})\). However, a proof eludes me.” 这意味着定理的结论比证明所覆盖的范围窄——证明需要更强的条件(对所有子矩阵),但作者猜测结论在更弱的条件下也成立。
- Theorem 2.12(a) 的余项含 \((\log n)^2\) 因子,而 Theorem 2.4 的余项不含对数因子。作者在 Remark 2.18(a) 中说明,在某些条件下这个对数因子可以去掉,但证明没有给出。
- 第二阶展开(Theorem 2.7 和 Theorem 2.12(b))未证明,作者仅给出了公式和证明思路的简要说明(Section 7),完整证明在 Schneller (2025) 中。
四、开放问题¶
- 条件 (2.5) 能否只对 \(\hat{A}\) 本身成立?
- 扎根:Remark 2.11(b):“It seems likely... that the Theorems 2.4 and 2.7 remain correct, if we assume (2.5), (2.8) and (2.9) only for \(\hat{A}\) instead of \(B \in N(8, \hat{A})\). However, a proof eludes me.”
-
这是一个明确的开放问题:能否在更弱的条件下证明相同的结论?
-
第二阶展开的完整证明。
- 扎根:Theorem 2.7 和 Theorem 2.12(b) 的陈述已给出,但证明仅在 Schneller (2025) 中。
-
问题:能否给出一个更简洁的证明?或者能否将第二阶展开的条件进一步简化?
-
条件 (2.5) 的验证。
- 扎根:Theorem 2.12(a) 仅对简单线性秩统计量(\(a_{ij}=e_i d_j\))验证了条件 (2.5)。
-
问题:对于更一般的线性秩统计量(如 \(a_{ij} = c_i d_j + e_{ij}\)),能否找到类似 van Zwet 的条件来验证 (2.5)?
-
高维设定下的推广。
- 扎根:本文的所有结果都假设 \(n\) 固定,矩阵 \(A\) 的维数随 \(n\) 增长。
- 问题:在高维设定下(如 \(p \gg n\)),线性秩统计量的分布逼近是否仍然成立?Edgeworth 展开的余项阶是否会退化?
Maintained by 陈星宇 · Homepage · Source on GitHub