Random Invariance Testing on Quadratic Form Statistics with Application to Autocorrelation¶
作者: Amitakshar Biswas, Adam B Kashlak
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2608.25918
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是基于群不变性的非参数假设检验,特别是针对二次型统计量的检验问题。其核心思想是:如果检验统计量在某个紧群(如旋转群、置换群、反射群)的作用下具有不变性,那么可以通过在该群上积分(或利用其浓度性质)来得到精确或近似的 p 值,从而避免对数据分布做出强参数假设。该方向当前处于方法成熟但应用边界仍在拓展的阶段:经典置换检验已广泛使用,但计算成本高;而旋转检验虽在理论上优雅,但因生成随机旋转矩阵的计算成本高而应用受限。本文试图通过闭合形式的 p 值来弥合这一 gap。
发展脉络(history)¶
- 奠基工作:
- Durbin and Watson (1950, 1951, 1971):提出了经典的 Durbin-Watson 检验,用于检验线性模型残差的一阶自相关。其检验统计量是二次型,但 null 分布依赖于正态性假设,且通常只针对 lag=1。
- Lehmann and Romano (2006):系统阐述了置换检验和更一般的随机化检验的理论基础,确立了“随机化假设”(null-invariance)的核心地位。
-
Langsrud (2005):提出了旋转检验(rotation test),作为置换检验的替代,但计算上更昂贵。
-
主要进展:
- Dobriban (2022):建立了基于不变性的随机化检验的一致性理论框架,利用表示论将变换推广到一般紧拓扑群(如旋转群),并证明了在某些问题中随机化检验可以达到 minimax 最优检测率。这为本文提供了理论支撑。
- Koning and Hemerik (2023); Koning (2024):提出了“用更少置换获得更多功效”的方法,即使用精心设计的子群而非随机抽样,在保持检验精确性的同时提高功效。这直接挑战了“应使用所有置换”的传统观念。
-
Kashlak et al. (2022); Kashlak and Yuan (2022):提出了“无计算置换检验”(computation-free permutation test),利用浓度不等式导出闭合形式 p 值,并引入 Beta 校正来恢复统计功效。本文直接继承并推广了这一思路。
-
当前 frontier 与本文位置:
- 当前前沿在于:如何将群不变性检验推广到更一般的统计量(如二次型),并给出计算上可行(闭合形式)的 p 值,同时保持或提升统计功效。
- 本文的位置:将 Kashlak 等人的“无计算”框架从置换群推广到旋转群和反射群,并专门针对二次型统计量(特别是自相关检验)给出了统一的闭合形式 p 值公式。其核心创新在于:利用旋转群上的浓度不等式(Meckes, 2019)导出 p 值上界,再通过 Beta 校正恢复功效,从而避免了生成随机旋转矩阵的高昂计算成本。
子线索聚类¶
- 经典二次型检验:Durbin-Watson (1950, 1951, 1971), Breusch (1978), Godfrey (1978), Ljung and Box (1978)。这些方法依赖于正态性假设或大样本渐近理论(χ² 分布),且通常只针对特定滞后或作为 omnibus 检验。
- 随机化/置换检验:Lehmann and Romano (2006), Pesarin and Salmaso (2010), Good (2013)。这些方法通过重抽样(置换、旋转、反射)来逼近 null 分布,计算成本高,但假设弱。
- 群不变性检验的理论与效率:Dobriban (2022), Koning and Hemerik (2023), Koning (2024)。这些工作关注检验的一致性、功效优化(子群设计)和理论框架(表示论)。
- 闭合形式 p 值(无计算检验):Kashlak et al. (2022), Kashlak and Yuan (2022)。利用浓度不等式导出 p 值的解析表达式,避免 Monte Carlo 模拟。本文属于这一簇,并将其从置换群扩展到旋转群和反射群。
这个方向在追问的核心问题¶
- 如何在不依赖强分布假设(如正态性)的前提下,对二次型统计量进行精确或近似检验?
- 如何避免大规模 Monte Carlo 模拟(特别是对于旋转群这种计算昂贵的群),同时保持统计功效?
- 如何将检验从单一滞后(如 Durbin-Watson 的 lag=1)扩展到任意滞后,并控制多重比较?
- 群不变性检验在局部备择假设下的渐近功效如何?
当前主流方法与已知瓶颈: - Durbin-Watson:仅限 lag=1,依赖正态性假设,null 分布需数值计算(如 Imhof 算法)。 - Breusch-Godfrey / Ljung-Box:大样本渐近(χ²),是 omnibus 检验(同时检验所有 lag≤h),无法定位具体滞后,且在小样本或重尾分布下表现不佳。 - 置换/旋转检验:计算成本高,尤其对于旋转群(需 QR 分解),且 Monte Carlo 模拟的 p 值精度受限于模拟次数。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口定位为“缺乏一个统一的、计算上闭合形式的、针对二次型统计量的群不变性检验框架”。具体来说,他们声称:
- 现有旋转检验因计算成本高而应用受限(见 Remark 1.1 和 Figure 1)。
- 现有自相关检验(Durbin-Watson, Breusch-Godfrey, Ljung-Box)要么假设强(正态性),要么是 omnibus 检验无法定位具体滞后,要么依赖大样本渐近。
- 他们的方法通过浓度不等式 + Beta 校正,实现了“计算零负担”的闭合形式 p 值,且能针对任意滞后进行检验,功效优于 Breusch-Godfrey 和 Ljung-Box。
- 哪些竞争路线被他淡化或回避了:
- Dobriban (2022) 的理论框架被引用,但作者并未深入讨论其一致性结果与本文方法的联系或对比。Dobriban 的工作更关注“检验是否一致”,而本文更关注“如何计算 p 值”。作者淡化了“一致性”这一理论问题,而专注于“计算可行性”。
- Koning and Hemerik (2023); Koning (2024) 的“子群”方法被提及,但作者仅将其定位为“现代方法”,并未与自己的闭合形式方法进行直接比较(例如,子群方法是否也能导出闭合形式?)。作者似乎默认自己的方法在“计算零负担”上具有绝对优势。
- Imhof (1961) 和 Davies (1980) 的精确数值方法被提及(Section 3.1.2),但作者声称自己的方法“无需数值求逆”且“可扩展到谱未知的任意对称矩阵”。然而,对于已知谱的矩阵(如 Durbin-Watson 统计量),Imhof 算法是精确的,而本文的 Beta 校正 p 值只是近似。作者淡化了这一精度 trade-off。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 关于旋转检验的早期工作:除了 Langsrud (2005) 和 Solari et al. (2014),还有更早的旋转检验文献(如一些多元分析中的旋转检验),作者未提及。
- 关于二次型统计量在非正态下的渐近分布:例如,对于重尾分布,二次型统计量的极限分布可能不是 χ²,而是稳定分布。作者在模拟中考虑了 t(2) 和 Cauchy 分布,但未在 intro 中提及相关理论文献(如 Davis and Resnick, 1986,虽然后面引用了)。
- 关于多重比较校正:作者在太阳数据中使用了 Benjamini-Hochberg 方法,但在 intro 中未提及多重比较问题,也未与 Breusch-Godfrey 的 omnibus 检验在多重比较框架下进行对比。
张力¶
未见明显对立引用。所有被引工作基本是互补的:经典检验提供 baseline,随机化检验提供弱假设,Dobriban 提供理论,Koning 提供效率改进,Kashlak 提供闭合形式。本文试图将这些线索统一到二次型统计量上。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- X = (X₁, ..., Xₙ)ᵀ:可观测的时间序列数据向量,长度为 n。在检验中,我们通常将其中心化并标准化到单位球面上,即 X ∈ Sⁿ⁻¹。
- Aₕ:n×n 的移位矩阵(shift matrix),用于计算滞后 h 的样本自相关。其定义是:Aₕ 的 (i, i+h) 位置为 1,其余为 0。因此 XᵀAₕX = Σ_{t=1}^{n-h} X_t X_{t+h}。
- Bₕ = (Aₕ + Aₕᵀ)/2:Aₕ 的对称化版本。由于二次型只依赖于对称部分,XᵀAₕX = XᵀBₕX。
- ηₕ = K(h)/K(0):滞后 h 的自相关系数,其中 K(h) = Cov(X_t, X_{t+h}) 是自协方差。
- ĥₕ = XᵀAₕX / ||X||²:样本自相关系数。由于我们假设 X ∈ Sⁿ⁻¹,所以 ĥₕ = XᵀAₕX。
- G:一个紧群,可以是 SO(n)(特殊正交群,旋转)、S(n)(对称群,置换)或 B(n)(超立方体顶点群,反射)。
- M:G 中按 Haar 测度均匀分布的随机元素。对于 SO(n),M 是一个随机旋转矩阵。
- F(M) = (Mx)ᵀAₕ(Mx):将固定向量 x** 旋转后计算二次型,这是定义在群 G 上的函数。
-
pv∨:p 值的上界,由浓度不等式给出。
-
模型:
- 数据生成机制:我们观测到一个时间序列 {X_t},其均值为零(或已中心化)。我们关心其自相关结构。
- 零假设 H₀:滞后 h 的自相关为零,即 ηₕ = 0。这等价于 E[X_t X_{t+h}] = 0。
-
在 H₀ 下,数据 X 是“各向同性的”(isotropic)吗?不一定。H₀ 只要求特定的 h 对角线上为零,不要求整个协方差矩阵为 cI。但本文的检验利用了更强的“旋转不变性”假设:如果 X 是各向同性的(即 Cov(X) = σ²I),那么对于任何旋转 M,MX 与 X 同分布。作者巧妙地绕过了这个更强的假设:他们不检验 X 的旋转不变性,而是检验二次型统计量 ĥₕ 在旋转下的分布是否与原始观测值一致(见公式 3.2 及其等价性论证)。
-
可观测数据:
- 可观测:时间序列的 n 个观测值 X₁, ..., Xₙ。我们可以计算样本自相关 ĥₕ = XᵀAₕX(在标准化后)。
- 想要但观测不到:在 H₀ 下,ĥₕ 的精确 null 分布。我们不知道数据的分布,因此无法直接计算 P(|ĥₕ| > t)。经典方法要么假设正态性(Durbin-Watson),要么依赖大样本渐近(Breusch-Godfrey),要么通过 Monte Carlo 模拟(置换/旋转检验)。
- 本文的解决方案:利用群不变性,将“计算 null 分布”转化为“计算函数 F(M) = (Mx)ᵀAₕ(Mx) 在群 G 上的分布”,其中 x** 是观测到的标准化数据。由于 M 是均匀分布的,F(M) 的分布可以通过浓度不等式来 bound,从而得到闭合形式的 p 值上界。
第二步:讲最小内核¶
最简特例:n=3, h=1, 数据来自白噪声(H₀ 成立),且我们使用旋转群 G=SO(3)。
- 设定:我们有三个观测值 X₁, X₂, X₃,已中心化并标准化到单位球面上,即 x = (x₁, x₂, x₃)ᵀ ∈ S²。我们想检验滞后 1 的自相关是否为零。检验统计量是 ĥ₁ = xᵀA₁x = x₁x₂ + x₂x₃。
- 核心思路:如果 H₀ 成立(数据是白噪声),那么 x 在球面上是均匀分布的(各向同性)。因此,对于任何固定的旋转 M,Mx 与 x 同分布。这意味着,如果我们固定 x 并随机旋转它(即考虑 Mx),那么统计量 F(M) = (Mx)ᵀA₁(Mx) 的分布应该与原始统计量 ĥ₁ 的 null 分布相同。
- 关键跳跃:我们无法直接计算 F(M) 的分布,但我们可以利用浓度不等式来 bound 它偏离其均值(均值为 0,见 Lemma A.1)的概率。对于 SO(3),Corollary 2.1 给出: P(F(M) ≥ t) ≤ exp{-(n-2)t²/16L²} = exp{-t²/16L²},其中 L 是 F 的 Lipschitz 常数。
- 计算 Lipschitz 常数:由 Theorem 2.2,L = 2ρ(B₁),其中 B₁ 是 A₁ 的对称化。对于 n=3,B₁ 是一个 3×3 矩阵,其谱半径 ρ(B₁) 可以计算出来。但更一般地,对于任意 n 和 h,Lemma 3.2 证明 L=2(因为 ρ(Bₕ) ≤ 1)。因此,对于 n=3,我们有: P(F(M) ≥ t) ≤ exp{-t²/64}。
- 得到 p 值:观测到的统计量是 ĥ₁ = xᵀA₁x。p 值的上界是 P(F(M) ≥ ĥ₁) ≤ exp{-ĥ₁²/64}。这就是 Theorem 3.1 中 SO(n) 的情况(对于 n=3)。
- Beta 校正:这个上界太保守(因为常数 64 太大),导致检验功效极低。因此,作者引入 Beta 校正(Theorem 3.6):他们证明了 pv∨ = exp{-(n-2)ĥ₁²/64} 的分布近似于一个 Beta 分布,从而可以“校准”这个 p 值,使其在 null 下近似均匀。对于 n=3,这个 Beta 分布的形状参数是 32n(n+2)/[(n-h)(n-2)] = 3235/[(2)*(1)] = 240,第二个参数是 1/2。这给出了一个更精确的 p 值公式(公式 3.5)。
这个特例揭示了论文的核心数学操作: 1. 将检验问题转化为群上的函数分布问题。 2. 利用浓度不等式给出该函数 tail probability 的上界(保守但解析)。 3. 通过 Beta 校正(基于 Berry-Esseen 型定理和矩计算)将这个上界“校准”为近似精确的 p 值。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了二次型统计量(如样本自相关)的随机不变性检验问题,提出一个统一的框架,利用紧群(SO(n), S(n), B(n))上的浓度不等式导出闭合形式的 p 值,并将其应用于时间序列自相关检验。
- 核心工具/方法:核心工具是紧群上的 Lipschitz 函数浓度不等式(Meckes, 2019)和 Rademacher chaos 的 decoupling 不等式(Kwapien, 1987),以及一个基于 Berry-Esseen 定理和 Beta 分布的 p 值校正方法(Beta correction)。
- 主要结论:对于自相关检验,本文提出的 Beta 校正旋转检验在模拟中优于 Breusch-Godfrey 和 Ljung-Box 检验(在特定滞后上),且与计算密集的置换/旋转检验相比,功效损失很小。在太阳辐射数据中,该方法成功识别出约 11 年(135 个月)的周期。
关键设定与假设¶
- 群结构:G 是紧群(SO(n), S(n), B(n)),配备 Haar 测度。检验依赖于“随机化假设”:在 H₀ 下,数据 X 的分布对 G 中的变换不变(或更弱地,二次型统计量在 G 下的期望不变,见公式 3.2)。
- 二次型统计量:检验统计量是 XᵀAX,其中 A 是对称矩阵。对于自相关检验,A = Aₕ(移位矩阵的对称化)。
- 零假设:H₀: ηₕ = 0(滞后 h 的自相关为零)。作者证明这等价于 E[XᵀAₕX] = E_M[(MX)ᵀAₕ(MX)](公式 3.2)。
- 数据标准化:假设 X ∈ Sⁿ⁻¹(已中心化并标准化)。这通过将原始数据减去均值并除以范数实现,不影响自相关检验。
- 对于 Beta 校正的额外假设:Theorem 3.6 要求噪声过程 ε_t 是独立同分布的,均值为零,且具有有限三阶矩。此外,它利用了 ε_t ε_{t+h} 的“h-独立性”(h-independence)来应用 Berry-Esseen 定理(Tikhomirov, 1981)。
- 相比已有文献的放宽/强化:
- 放宽:相比 Durbin-Watson,不假设正态性;相比 Breusch-Godfrey/Ljung-Box,不依赖大样本渐近(虽然 Beta 校正本身依赖 Berry-Esseen,但模拟显示在 n=1000 时表现良好,甚至在重尾下也稳健)。
- 强化:相比一般的置换/旋转检验,本文的 p 值是闭合形式的,无需 Monte Carlo 模拟。但代价是 p 值是近似的(经过 Beta 校正),而置换检验在精确意义下是有效的。
主要结果¶
- Theorem 3.1 (Sub-Gaussian Bound):对于三种群,给出了 p 值的上界。这是后续 Beta 校正的基础。例如,对于 SO(n),P(ĥₕ(M) ≥ t | X) ≤ exp{-(n-2)t²/64}。这个界太保守,无法直接用于检验。
- Theorem 3.6 (Beta Correction):这是论文的核心理论结果。它给出了一个校准后的 p 值公式(公式 3.3 和 3.5),使得在 H₀ 下,该 p 值的分布近似于 Uniform[0,1]。具体地,它证明了 P(pv∨ ≤ u) ≤ C₀ I(u; α, 1/2) + O(n^{-1/2}),其中 α = 32n(n+2)/[(n-h)(n-2)],C₀ ≈ 1.004。这为检验提供了可操作的、近似精确的 p 值。
- 直觉:Theorem 3.1 给出的 pv∨ 在 H₀ 下是“过于保守”的(即其分布 stochastically larger than Uniform)。Theorem 3.6 通过计算 pv∨ 的分布(近似为 Beta),给出了一个“校准”后的临界值,使得检验的 size 更接近名义水平。
- 必要条件:有限三阶矩、h-独立性(用于 Berry-Esseen)。
- 解决的技术难点:如何将浓度不等式给出的保守上界转化为一个可用的、近似精确的 p 值。这需要计算统计量的均值和方差(Lemma 3.8),并利用 Berry-Esseen 定理将标准化后的统计量的分布近似为 χ²(1),然后通过变量变换得到 pv∨ 的分布。
- Proposition 3.9 (Uncorrelated Testing of Multiple Lags):证明了不同滞后 h 的检验统计量 ĥₕ 是不相关的。这使得我们可以对多个滞后进行独立检验,并使用 Fisher 方法或多重比较校正(如 Benjamini-Hochberg)来联合推断。
证明路线与技术技巧¶
整体路线(以 Theorem 3.6 为例): 1. 建立浓度不等式(Theorem 3.1):证明 F(M) = (Mx)ᵀAₕ(Mx) 是 Lipschitz 函数,然后应用群上的浓度不等式(Corollary 2.1, Theorem 2.3, 2.4)得到 tail bound。这一步给出了 pv∨ = exp{-(n-2)ĥₕ²/64}。 2. 计算均值和方差(Lemma 3.8):在 H₀ 下,计算 ĥₕ 的均值为 0,方差为 (n-h)/[n(n+2)]。这使用了球面上的矩公式(Lemma 3.7, Wiens, 1992)。 3. 应用 Berry-Esseen 定理:将标准化后的统计量 Z = ĥₕ² / Var(ĥₕ) 的分布近似为 χ²(1)。这一步依赖于 ε_t ε_{t+h} 的 h-独立性和有限三阶矩(Tikhomirov, 1981)。 4. 变量变换与 Beta 近似:将 pv∨ = exp{-c Z}(其中 c = 64/[(n-2)Var(ĥₕ)])的分布通过变量变换从 χ²(1) 导出。利用不等式 -log y ≥ 1-y 将积分 bound 为 Beta 分布的不完全 Beta 函数,从而得到 Theorem 3.6 中的上界。
关键跳跃点: - 从浓度不等式到 Beta 校正:这是最关键的跳跃。浓度不等式给出的是“最坏情况”的上界,而 Beta 校正试图恢复“平均情况”下的精确分布。这个跳跃依赖于 Berry-Esseen 定理,它要求数据具有有限三阶矩,并且是 h-独立的。对于重尾数据(如 Cauchy),这个跳跃可能不成立,模拟也证实了这一点(p 值变得保守)。 - Lemma 3.2 中 Lipschitz 常数的计算:证明对于任意 h,ρ(Bₕ) ≤ 1,从而 Lipschitz 常数 L=2。这个简洁的结果使得浓度不等式中的常数与 h 无关,简化了后续分析。
技术技巧点名: - Lipschitz 函数在紧群上的浓度不等式(Meckes, 2019, Theorem 5.17):用于 SO(n) 和 U(n) 等。这是整个方法的基础。 - Rademacher chaos 的 decoupling 不等式(Kwapien, 1987):用于处理反射群 B(n) 上的二次型。将二次型视为 Rademacher 变量的二阶混沌,利用矩 bound 导出 sub-Gaussian tail。 - Azuma-Hoeffding 不等式(Azuma, 1967; Rio, 2013):用于处理置换群 S(n)。通过 Fisher-Yates 构造将置换分解为一系列 transposition,构造鞅差序列,然后应用 Azuma-Hoeffding。 - 球面上的矩公式(Wiens, 1992, Lemma 3.7):用于计算二次型乘积的期望,从而得到方差。 - Berry-Esseen 定理(Tikhomirov, 1981):用于 h-独立序列,将标准化统计量的分布近似为正态/χ²。 - Beta 分布近似:利用不等式 -log y ≥ 1-y 将 χ² 分布的尾部积分 bound 为 Beta 分布的不完全 Beta 函数,从而得到解析的 p 值公式。
真实例子与应用¶
- 数据:美国国家海洋和大气管理局(NOAA)提供的 1900 年 1 月至 2025 年 2 月的月太阳辐射强度(log₂ 太阳黑子数),n=1502。
- 方法应用:
- 首先对原始时间序列进行 Nadaraya-Watson 核回归(带宽 6, 12, 18 个月),得到残差。
- 对残差应用本文的 Beta 校正旋转检验(Theorem 3.6),检验每个滞后 h=1,...,160 的自相关。
- 使用 Benjamini-Hochberg 方法进行多重比较校正。
- 结果:
- 在原始残差中,Breusch-Godfrey 检验对所有 lag≤24 都返回显著 p 值,无法定位具体滞后。而本文的检验识别出 lag=1,6,7,8,9 在 0.1% 水平显著。
- 在去除 AR(1) 成分后的残差中,本文检验识别出 lag=6 和 lag=9 显著,而 Breusch-Godfrey 对所有 lag≥6 都显著。
- 最重要的是,在多重比较校正后,lag=135 个月(11.25 年) 的 FDR 在 0.012 到 0.06 之间(取决于带宽),直接对应了天文学家已知的约 11 年太阳周期。
- 这个例子想说明什么:
- 定位能力:相比 Breusch-Godfrey 的 omnibus 检验,本文方法可以精确定位到具体的显著滞后,这对于识别周期性信号至关重要。
- 计算可行性:对于 n=1502 的大数据集,计算密集的旋转检验几乎不可行,而本文的闭合形式 p 值计算是瞬时的。
- 实际有效性:成功识别出已知的物理周期,验证了方法的实际价值。
🔎 结论是否比证明窄¶
- 是。论文的主要结论(公式 3.5 的闭合形式 p 值)的严格证明依赖于 Theorem 3.6,而 Theorem 3.6 的证明依赖于 Berry-Esseen 定理,该定理要求噪声 ε_t 是独立同分布且具有有限三阶矩。然而,在模拟和真实数据应用中,作者将其应用于:
- AR 过程:其中 ε_t 是 iid 的,满足条件。
- 重尾分布(t(2), Cauchy):这些分布没有有限三阶矩,甚至没有有限方差(Cauchy)。Theorem 3.6 的证明在此不成立。作者在模拟中观察到 p 值变得保守(Figure 2),并引用 Davis and Resnick (1986) 来讨论样本协方差在重尾下的行为,但并未给出理论保证。
- 真实太阳数据:其噪声过程是否满足 iid 和有限三阶矩是未知的。
- 因此,论文的结论(“我们的方法有效”)在严格意义上比其证明所覆盖的范围更宽。作者在 Section 4.2 中承认了这一点(“breaks the finite 4th moment assumption”),但并未提供重尾下的理论修正。这是一个值得研究者注意的 gap。
四、开放问题¶
-
重尾分布下的理论保证:Theorem 3.6 的证明依赖于有限三阶矩。对于 t(2) 或 Cauchy 等重尾分布,Berry-Esseen 定理不成立,Beta 校正的 p 值变得保守。能否为这类分布推导出类似的闭合形式 p 值?或者,能否证明在重尾下,Beta 校正仍然是一个有效的(虽然保守)上界?(扎根于 Section 4.2 和 Theorem 3.6 的证明条件)
-
更一般的二次型统计量:作者在 Section 6 中提到了 Moran's I、Cramer's V、Rayleigh 检验等。对于这些统计量,其对应的矩阵 A 的谱半径 ρ(B) 是否仍然有简洁的上界?Lipschitz 常数是否仍然容易计算? 如果不能,浓度不等式中的常数会变大,Beta 校正的参数也会改变,可能需要针对每个统计量重新推导。(扎根于 Section 6 的“future investigations”)
-
与“子群”方法的结合:Koning and Hemerik (2023) 的方法使用精心设计的子群来提高功效。能否将本文的闭合形式 p 值思想与子群方法结合? 例如,对于 SO(n) 的一个子群(如循环子群),是否也能导出类似的浓度不等式和 Beta 校正?这可能会在保持计算零负担的同时进一步提高功效。(扎根于 Remark 1.1 中对 Koning 工作的引用)
-
高维情况下的性能:本文的模拟和理论都假设 n 较大(n=1000),且 h ≪ n。当 n 固定而 h 接近 n 时,或者当数据维度很高(如 n 很大但有效样本量小)时,浓度不等式和 Beta 校正的表现如何? 特别是,Lemma 3.2 中 Lipschitz 常数 L=2 的证明是否依赖于 h ≪ n?对于 h 接近 n 的情况,ρ(Bₕ) 是否可能接近 2?(扎根于 Section 3.1 中“h ≪ n”的假设)
Maintained by 陈星宇 · Homepage · Source on GitHub