跳转至

A unified approach for testing in Hilbert spaces on incomplete data

作者: Daniel Gaigall, Philipp Wübbolding
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2607.13209


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是:在可分离 Hilbert 空间中,基于不完全观测数据(如缺失条目、部分观测函数、超高维截断等)进行统计假设检验。其根本问题在于:当数据维度可能很大甚至无限,且观测本身不完整(部分坐标或部分函数片段缺失)时,如何构造并证明检验统计量的渐近性质(极限分布、一致性、局部功效),以及如何通过重抽样(bootstrap)获得临界值。该方向当前处于从“完整数据”向“不完全数据”推广的活跃期,但统一的理论框架尚未完全建立。

发展脉络(history)

  1. 奠基工作:完整数据下的 Hilbert 空间检验
  2. Cuesta-Albertos et al. (2006, 2007):提出随机投影方法,将无限维分布检验转化为一维 Kolmogorov-Smirnov 检验。核心思想:若所有一维随机投影的分布匹配,则原始分布匹配。
  3. Bugni et al. (2009), Bugni & Horowitz (2021):提出基于 bootstrap 的拟合优度检验(单样本与多样本),用于函数型数据,但要求数据完整。
  4. Henze & Jiménez-Gamero (2020):将经典的 BHEP 检验(基于经验特征函数)从多元正态性检验推广到可分离 Hilbert 空间中的高斯性检验。这是特征函数路线在无限维的关键推广。

  5. 主要进展:投影积分方法与特征函数方法的结合

  6. Ditzhaus & Gaigall (2018, 2022), Gaigall et al. (2025):系统发展“对所有有限维投影积分”的检验框架,覆盖拟合优度、边际齐性、独立性等检验问题。技术核心:利用 U-统计量理论处理积分型检验统计量的渐近分布。
  7. Dette & Tang (2026):引入无矩条件的能量距离(基于特征泛函),用于 Hilbert 空间中的两样本比较与独立性检验。
  8. Gaigall & Wübbolding (2025):将 BHEP 检验推广到几何布朗运动的拟合优度检验(函数型数据,完整观测)。

  9. 当前 frontier:从不完整数据到统一框架

  10. Gaigall (2020):处理配对数据中边际齐性检验的缺失值问题(仅限 R×R)。
  11. Aleksić & Milošević (2024):研究缺失数据下 BHEP 检验的渐近行为,比较完整案例分析(CC)与插补(imputation)两种策略。
  12. Gaigall & Wübbolding (2026):提出针对缺失数据向量的 BHEP 检验(多元正态性),是本文的先行工作。
  13. 本文(Gaigall & Wübbolding, 2026):将上述所有线索统一——提出一个一般性框架,用 Hadamard 积建模不完全数据,用投影积分构造检验统计量,并指出可用 U-统计量或 Hilbert 空间极限定理进行分析。

子线索聚类

  • 线索 A:投影方法(Cuesta-Albertos et al. 2006/2007, Cuevas & Fraiman 2009, Ditzhaus & Gaigall 2018/2022, Gaigall et al. 2025)
    核心:用所有有限维投影的集合来刻画分布,检验统计量取投影上某个检验统计量的加权积分。优势:将无限维问题转化为有限维问题族。
  • 线索 B:特征函数 / 特征泛函方法(Baringhaus & Henze 1988, Henze & Jiménez-Gamero 2020, Dette & Tang 2026, Gaigall & Wübbolding 2025/2026)
    核心:利用经验特征函数与理论特征函数之间的 L2 距离构造检验统计量。优势:分布由特征泛函唯一确定,且 L2 距离通常有闭合形式。
  • 线索 C:不完全数据的处理(Gaigall 2020, Aleksić & Milošević 2024, Gaigall & Wübbolding 2026, 本文)
    核心:用缺失指示器与 Hadamard 积建模不完全观测,识别出“不完全数据中仍存在 i.i.d. 结构”这一关键性质,从而复用经典渐近工具。
  • 线索 D:Bootstrap 与重抽样(Romano 1989, Gaigall 2021, Baringhaus & Gaigall 2023, Gaigall 2023)
    核心:为各种非参数检验问题设计 bootstrap 程序,以获得临界值。本文指出这些程序需要针对不完全数据做适应性修改。

这个方向在追问的核心问题

  1. 如何将检验从完整数据推广到不完全数据? 不完全数据破坏了观测的 i.i.d. 结构(不同观测缺失不同坐标),但本文识别出“不完全数据本身仍构成 i.i.d. 样本”这一关键性质。
  2. 如何在高维或无限维下获得检验统计量的渐近分布? 经典多元检验(如 BHEP)在高维下失效(协方差矩阵奇异),投影积分方法通过降维回避了这一问题。
  3. 如何获得临界值? 检验统计量通常不是分布自由的,bootstrap 是标准解法,但在不完全数据下需要重新设计。
  4. 如何统一处理多种检验问题(拟合优度、对称性、齐性、独立性)? 本文的 Theorem 1 提供了一个统一的理论基础:所有检验问题都可以等价地表述为“对所有投影成立”的形式。

⚠️ 作者的 framing

作者将缺口 frame 为:“虽然已有针对完整数据或特定不完全数据情形的检验方法,但缺乏一个统一的、适用于一般 Hilbert 空间和不完全数据的检验框架。” 本文声称填补这一缺口的方式是:用 Hadamard 积建模不完全数据 + 用投影积分构造检验统计量 + 指出可用 U-统计量或 Hilbert 空间极限定理分析。

被淡化或回避的竞争路线: - 插补(imputation)方法(如 Aleksić & Milošević 2024)被提及但未深入讨论。作者选择“不插补、直接建模缺失机制”的路线,但未给出为何此路线优于插补的论证。 - 基于深度学习的函数型数据检验(如神经网络特征映射)完全未被提及。 - 高维随机矩阵方法(如基于样本协方差矩阵特征值的检验)未被讨论——尽管本文处理超高维情形(d ≫ n),但未与随机矩阵理论中的检验(如 Marchenko-Pastur 检验)做比较。

明显该被引 / 该存在、却没出现在 intro 里: - 高维因果推断中处理缺失协变量的检验方法(如基于双稳健估计的检验)未被引用。这可能是因为该文献与 Hilbert 空间检验的直接关联较弱,但值得研究者去查证是否存在可迁移的技术。 - 关于“缺失数据机制”的经典分类(MCAR / MAR / MNAR)未被引入。本文的模型(I 与 X 独立)实际上假设了 MCAR,但作者未明确讨论这一限制。

张力

未见明显对立引用。所有被引工作基本沿着“从完整到不完全、从有限维到无限维、从单一检验到统一框架”的单调演进路线,彼此之间没有矛盾结论。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • H:可分离 Hilbert 空间,维数可有限或无限。配备内积 ⟨·,·⟩ 与范数 ∥·∥。
  • (e_j)_{j∈J}:H 的可数标准正交基。J = {1,…,d}(有限维)或 J = ℕ(无限维)。
  • X:取值于 H 的随机变量,分布为 P_X。X(j) = ⟨X, e_j⟩ 是第 j 个坐标。
  • X_i, i=1,…,n:P_X 的 i.i.d. 样本。
  • I:取值于 H 的随机变量,表示缺失机制。I(j) ∈ {0,1} 是 Bernoulli 随机变量。关键假设:I 与 X 独立(即 MCAR)。
  • I⊙X:Hadamard 积,定义为 (I⊙X)(j) = I(j)X(j)。即:若 I(j)=1 则保留第 j 坐标,若 I(j)=0 则置零。
  • 可观测数据:(I_i, I_i⊙X_i), i=1,…,n。这是 i.i.d. 样本(因为 (I_i, X_i) 是 i.i.d. 的,且 I_i 与 X_i 独立)。注意:X_i 本身不可观测,只能观测到被 I_i 筛选后的版本。
  • P(H):所有从 H 到其有限维子空间的正交投影的集合。π(·) = ∑_{j∈J'} ⟨·, e_j⟩ e_j,其中 J' ⊂ J 有限。
  • π(I⊙X):投影后的不完全数据,取值于有限维空间(维数 = |J'|)。
  • Q:P(H) 上的(离散)概率测度,用于加权积分。q(π) = Q({π})。
  • T_n(π):基于投影后数据 (π(I_i), π(I_i⊙X_i)) 的检验统计量(非负,大值拒绝 H_0(π))。
  • T_n:整体检验统计量,T_n = ∫_{P(H)} T_n(π) dQ(π) = ∑_π q(π) T_n(π)。

想要但观测不到的量:完整的 X_i(未缺失的坐标)、P_X(目标分布)、P_{I⊙X}(不完全数据分布,但可估计)。

第二步:最小内核——最简特例

最简特例:d=2(二维随机向量),只有一个条目可能缺失。即 H = ℝ²,标准内积与标准基 e₁=(1,0), e₂=(0,1)。I = (I(1), I(2)),其中 I(1), I(2) ∈ {0,1},且 I 与 X 独立。

检验问题:拟合优度检验——H₀: P_X 是某个指定分布(如标准二元正态 N(0, I₂)) vs. H₁: 不是。

在这个特例下,Theorem 1 退化成什么?

Theorem 1 说:P_X = P_{X'} 当且仅当对所有 π ∈ P(H) 有 P_{π(I⊙X)} = P_{π(I⊙X')}。在拟合优度检验中,X' 是服从 H₀ 的随机变量(已知分布),X 是真实数据。所以检验 H₀ 等价于检验:对所有 π ∈ P(H),π(I⊙X) 的分布等于 π(I⊙X') 的分布。

P(H) 包含哪些投影?对于 d=2,P(H) 包含: - π₁:投影到 e₁(即取第一坐标),π₁(x) = x(1) - π₂:投影到 e₂(即取第二坐标),π₂(x) = x(2) - π₁₂:投影到 e₁ 和 e₂(即恒等映射),π₁₂(x) = (x(1), x(2))

核心思路:检验 H₀ 等价于检验三个子假设: - H₀(π₁): π₁(I⊙X) 的分布 = π₁(I⊙X') 的分布 - H₀(π₂): π₂(I⊙X) 的分布 = π₂(I⊙X') 的分布 - H₀(π₁₂): π₁₂(I⊙X) 的分布 = π₁₂(I⊙X') 的分布

每个子假设都是有限维(1维或2维)的检验问题,可以用经典方法(如 BHEP 检验)处理。整体检验统计量 T_n = q(π₁)T_n(π₁) + q(π₂)T_n(π₂) + q(π₁₂)T_n(π₁₂),其中 q 是权重(由统计学家选择)。

为什么这个特例抓住了论文的核心? - 它展示了“无限维 → 有限维投影族”的降维思想。 - 它展示了“不完全数据 → 投影后仍可检验”的关键:即使原始数据有缺失,投影后的数据 (π(I⊙X)) 仍然是可观测的(因为投影只保留部分坐标,而缺失的坐标已被置零)。 - 它展示了“整体检验 = 投影上子检验的加权和”这一统一框架。 - 一般情形(d 任意大或无限维)只是这个特例的“加壳”:投影集合更大、子检验更多、权重分布更复杂,但数学结构完全相同。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在可分离 Hilbert 空间中,基于不完全观测数据(缺失条目、部分观测函数、超高维截断等)进行统计假设检验的统一框架,覆盖拟合优度、对称性、齐性、独立性等检验问题。
  2. 核心工具 / 方法:用 Hadamard 积 (I⊙X) 建模不完全数据,用投影集合 P(H) 上的加权积分构造检验统计量 T_n = ∫ T_n(π) dQ(π),并指出该框架下检验问题等价于“对所有投影成立”的形式(Theorem 1)。
  3. 主要结论:Theorem 1 给出了分布等价性的投影刻画——P_X = P_{X'} 当且仅当对所有 π ∈ P(H) 有 P_{π(I⊙X)} = P_{π(I⊙X')}。这为将任意有限维检验方法(如 BHEP)推广到不完全数据与无限维情形提供了理论基础。论文还以正态性拟合优度检验为例(Gaigall & Wübbolding 2026)展示了具体实现。

关键设定与假设

  • Hilbert 空间 H:可分离,维数任意(有限或无限)。配备标准正交基 (e_j)。
  • 不完全数据模型:(I_i, I_i⊙X_i),其中 I_i(j) ∈ {0,1},I_i 与 X_i 独立(MCAR 假设)。关键:论文未明确讨论 MAR 或 MNAR 情形。
  • 投影集合 P(H):所有到有限维子空间的正交投影。关键性质:P(H) 是“分离点集”——即分布由其在所有投影上的像唯一决定(这是 Theorem 1 证明的基础)。
  • Theorem 1 的条件:对所有 π ∈ P(H),P(π(I) = 1 向量) > 0(即每个投影至少有一个观测完全保留的概率为正);X 与 I 独立;X' 与 I 独立。
  • 检验统计量 T_n(π):基于投影后数据 (π(I_i), π(I_i⊙X_i)) 的检验统计量,要求非负且大值指示拒绝 H₀(π)。未指定具体形式——这是框架的“可插拔”部分。
  • 权重 Q:P(H) 上的离散概率测度,由统计学家选择。未给出选择指导原则
  • Bootstrap 程序:参数 bootstrap,基于 H₀ 下的估计分布生成 bootstrap 样本。未给出具体算法,仅指出“可参考已有工作”。

相比已有文献的放宽或强化: - 相比 Ditzhaus & Gaigall (2018, 2022) 和 Gaigall et al. (2025):放宽了数据完整性要求(从不完整到完整);强化了统一性(覆盖更多检验问题)。 - 相比 Gaigall & Wübbolding (2026):放宽了 Hilbert 空间类型(从 ℝᵈ 到一般可分离 Hilbert 空间);强化了框架的一般性(不限于 BHEP 检验)。 - 相比 Henze & Jiménez-Gamero (2020):放宽了数据完整性要求;强化了检验问题范围(不限于高斯性检验)。

主要结果

本文只有一个核心定理(Theorem 1),其余内容为框架描述与示例。

Theorem 1(分布等价性的投影刻画): - 陈述:设 H 是可分离 Hilbert 空间。对所有 π ∈ P(H),假设 P(π(I) = 1 向量) > 0,且 X 与 I 独立、X' 与 I 独立。则 P_X = P_{X'} 当且仅当对所有 π ∈ P(H) 有 P_{π(I⊙X)} = P_{π(I⊙X')}。 - 直觉:分布由其在所有有限维投影上的像唯一决定(这是经典结论)。不完全数据 I⊙X 的分布又唯一决定 X 的分布(因为当 I=1 向量时,I⊙X = X;而 I=1 向量的概率为正,所以可以从条件分布恢复 X 的分布)。两者结合即得。 - 必要条件:P(π(I) = 1 向量) > 0 是关键的——它确保每个投影上至少有一些观测是“完全保留”的,从而可以从条件分布恢复原始分布。 - 解决的技术难点:如何将“分布由投影决定”这一经典结论推广到“不完全数据投影”情形。关键在于证明 P_{I⊙X} 唯一决定 P_X(证明中使用了条件概率公式)。

证明路线: 1. 第一步:引用 Ditzhaus & Gaigall (2018) 的结论——在完整数据下,分布由其在所有有限维投影上的像唯一决定:P_X = P_{X'} ⇔ ∀π∈P(H): P_{π(X)} = P_{π(X')}。 2. 第二步:证明 P_{I⊙X} 唯一决定 P_X。利用独立性假设(I 与 X 独立)和条件概率公式: P(X(1) ≤ x₁, …, X(d) ≤ x_d) = P(I(1)X(1) ≤ x₁, …, I(d)X(d) ≤ x_d, I(1)=1, …, I(d)=1) / P(I(1)=1, …, I(d)=1)。 这里 d 是投影 π 的维数(有限)。关键跳跃:这个公式要求 P(I(1)=1, …, I(d)=1) > 0,这正是 Theorem 1 的条件。 3. 第三步:结合两步得到:P_X = P_{X'} ⇔ P_{I⊙X} = P_{I⊙X'} ⇔ ∀π∈P(H): P_{π(I⊙X)} = P_{π(I⊙X')}。

技术技巧点名: - 条件概率 / 贝叶斯公式:用于从不完全数据分布恢复完全数据分布(第二步)。 - 投影分离性质:Hilbert 空间中分布由有限维投影唯一决定(第一步,引用已有结果)。 - Hadamard 积:用于建模不完全数据,将缺失问题转化为代数运算。

真实例子与应用

本文没有独立的实证例子。它主要是一个理论框架论文。但它以 Gaigall & Wübbolding (2026) 作为具体示例(Section 2.6),该示例本身包含模拟研究(但本文未报告结果)。

示例内容(Section 2.6): - 数据:ℝᵈ 中的随机向量,有缺失条目(Example 2a 的设定)。d 可以大于 n。 - 检验问题:H₀: P_X 是 d 维正态分布(均值 μ、协方差 Σ 未知)。 - 方法:对每个投影 π,构造 BHEP 型检验统计量 T_n(π) = n ∫ |φ̂{n,π}(t) - φ̂{0,n,π}(t)|² dΦ_k(t),其中 φ̂{n,π} 是基于投影后数据的经验特征函数,φ̂{0,n,π} 是在 H₀ 下估计的特征函数(用估计的 μ̂_n, Σ̂_n, p̂_n 代入)。整体统计量 T_n = ∑_π q(π) T_n(π)。 - 结果:论文未报告数值结果,仅指出“bootstrap 程序可用”(引用 Gaigall & Wübbolding 2026)。 - 这个例子想说明什么:展示如何将一般框架实例化——选择具体检验问题(正态性)、具体子检验(BHEP)、具体权重(未指定)、具体 bootstrap 程序。

🔎 结论是否比证明窄

。Theorem 1 的证明依赖于两个关键假设:(i) I 与 X 独立(MCAR),(ii) 对所有 π ∈ P(H),P(π(I)=1 向量) > 0。然而,论文在讨论中(Section 2.5, 2.6, 3)将框架描述为适用于“各种不完全数据情形”,包括: - 超高维随机向量(d ≫ n)——这没问题,因为 Theorem 1 不要求 d 固定。 - 部分观测函数(Example 2c)——这需要 I 的取值模式与函数的分段结构匹配,Theorem 1 的条件(对所有 π 有 P(π(I)=1) > 0)可能不成立(例如,如果某个区间从未被观测到,则投影到该区间的基函数时,P(π(I)=1) = 0)。 - 平滑函数(Example 2e)——这本质上是截断(只保留前 d 个基函数),Theorem 1 的条件成立(因为 I(j)=1 对 j≤d,I(j)=0 对 j>d,所以对投影到前 d 个基函数的 π,P(π(I)=1) = 1 > 0)。

具体语句:Section 2.2 说“This framework enables to address a broad range of incomplete data types”,但 Theorem 1 的条件并未对所有列举的类型(如部分观测函数)验证。这是一个泛化 claim 比证明宽的例子。


四、开放问题(扎根具体语句)

  1. 投影权重 Q 的选择:论文指出“Q or q can be chosen by the statistician”(Section 2.5),但未给出任何选择指导原则(如如何优化功效、如何适应数据缺失模式)。扎根:Section 2.5 最后一段。这是一个开放的设计问题——不同的 Q 可能导致不同的检验功效,是否存在最优 Q?

  2. Bootstrap 程序的渐近性质:论文建议使用参数 bootstrap 获得临界值(Section 2.5),但未证明 bootstrap 的一致性(即条件分布收敛到真实零分布)。扎根:Section 2.5 最后一段“Let us consider parametric bootstrap procedures…”,以及 Section 3 第一段“properties of the newly developed tests have to be investigated”。这是理论上的核心缺口——bootstrap 在不完全数据下的有效性需要严格证明。

  3. 高维情形下 d_n 的增长率:论文提到超高维情形(d ≫ n)可以嵌入框架(Example 2d),但未讨论 d_n 增长对检验统计量渐近分布的影响。扎根:Example 2d 和 Section 3 第二段“Asymptotic aspects as the sample size (and possibly simultaneously the dimension) of the observations tends to infinity have to be studied”。当 d_n 随 n 增长时,投影集合 P(H) 的大小也增长,加权和 T_n 的渐近行为需要重新分析(可能涉及 U-统计量在维数发散下的极限理论)。

  4. 与 MAR/MNAR 缺失机制的兼容性:论文假设 I 与 X 独立(MCAR),但许多实际应用(如纵向数据中的 dropout)涉及 MAR 或 MNAR。扎根:Section 2.2 的模型定义中未讨论缺失机制类型。这是一个明显的限制——将框架推广到 MAR/MNAR 需要引入额外的识别假设(如倾向性得分模型或工具变量)。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论