跳转至

Optimal nonparametric testing of Missing Completely At Random and its connections to compatibility

作者: Thomas B. Berrett, Richard J. Samworth
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://doi.org/10.1214/23-aos2326


一、领域脉络与小综述

这个方向是什么

本文研究的根本问题是:在非参数框架下,如何检验数据是否完全随机缺失(Missing Completely At Random, MCAR)。MCAR 是缺失数据领域中最强的假设——它要求缺失机制与数据值本身完全独立。如果 MCAR 成立,那么"完整案例分析"(complete-case analysis)就是无偏的,许多后续统计推断可以大幅简化。然而,检验 MCAR 本身是一个棘手的问题:由于缺失值的存在,我们永远无法直接观测到完整的数据联合分布,因此必须从可观测的边际分布中寻找线索。本文的核心洞察在于:MCAR 检验本质上等价于检验一组边际分布是否"兼容"(compatible),即是否存在一个联合分布同时以这些边际分布为其条件分布。这个看似简单的等价关系,将统计假设检验问题与 Fréchet 类理论、线性规划、以及量子上下文性(quantum contextuality)等看似遥远的数学领域联系了起来。该方向目前处于活跃发展阶段——非参数 MCAR 检验的极小极大理论在本文之前尚未被系统建立。

发展脉络

  • 奠基工作:缺失数据框架与 MCAR 的提出。缺失数据问题的现代框架由 Little 和 Rubin(2002)系统建立,他们将缺失机制分为 MCAR、MAR(随机缺失)和 MNAR(非随机缺失)三类。MCAR 是最强假设,也是最容易检验的——但传统检验方法(如 Little 1988 的多元正态检验)都依赖于参数模型假设。这些方法的共同弱点是:当参数模型错误时,检验可能失去有效性。

  • 主要进展:非参数检验的尝试。在非参数方向上,Fuchs(1982)提出了基于列联表的检验方法,但要求存在完整的观测案例(complete cases)。Li 和 Yu(2015)研究了非参数框架下边际分布一致性的检验问题,但他们的方法只检验"一致性"(consistency,即不同边际在重叠坐标上取值一致),而非"兼容性"(compatibility,即存在联合分布同时生成所有边际)。Spohn 等人(2021)用随机森林分类方法检验分布相等性,但同样只处理了一致性问题。关键缺口:一致性是兼容性的必要但不充分条件——一组边际分布可以两两一致,却仍然不存在任何联合分布同时以它们为边际(本文引言中的三维正态例子正是如此)。这一缺口意味着,此前所有基于一致性检验的方法都无法检测出所有可检测的 MCAR 违反。

  • 当前 frontier:极小极大检验与几何方法。近年来,假设检验的极小极大理论在非参数设定下取得了长足进展(如 Blanchard, Carpentier 和 Gutzeit 2018;Wei, Wainwright 和 Guntowoyina 2019),这些工作研究了凸锥上的检验问题,为本文提供了方法论基础。同时,Fréchet 类理论(Joe 1997)和边际多面体(marginal polytope)的几何结构(Wainwright 和 Jordan 2008;Deza 和 Laurent 2010)已被充分研究,但尚未被应用于统计检验问题。

  • 本文的位置:Berrett 和 Samworth 的贡献在于首次将 MCAR 检验问题精确刻画为兼容性检验问题,并建立了完整的极小极大理论。他们证明了:(i) 可检测的备择假设恰好是不兼容的边际分布族;(ii) 通过 Kellerer(1984)的对偶定理,不兼容性可以量化为一个线性规划问题,从而定义了"不兼容指数";(iii) 基于此指数的检验在离散情形下达到极小极大最优分离率(至多差对数因子)。这是该方向上第一个同时具备"对所有可检测备择一致有效"和"极小极大最优"双重性质的检验方法。

子线索聚类

  1. 缺失数据检验的统计方法:Little(1988)、Kim 和 Bentler(2002)、Jamshidian 和 Jalal(2010)——参数化方法;Fuchs(1982)——列联表方法;Li 和 Yu(2015)、Spohn 等(2021)——非参数一致性检验。这条线索的特点是:要么依赖参数假设,要么只检验一致性的必要条件。

  2. Fréchet 类与兼容性理论:Joe(1997)系统发展了 Fréchet 类理论;Kellerer(1984)给出了兼容性的对偶刻画;Vlach(1986)和 Eriksson 等(2006)研究了边际多面体的面结构。这条线索是纯数学的,本文首次将其系统引入统计检验。

  3. 凸几何与检验的极小极大理论:Blanchard 等(2018)、Wei 等(2019)研究了凸锥上的假设检验,建立了分离率的通用框架。本文的极小极大分析直接建立在这条线索之上。

  4. 量子上下文性:Abramsky 和 Brandenburger(2011)、Abramsky(2017)在量子物理中研究了"上下文性"(contextuality),其数学结构(不兼容的边际族)与本文的问题惊人地一致。本文的"不兼容指数"在量子物理中被称为"上下文分数"(contextual fraction)。这是一个跨学科的意外联系。

这个方向在追问的核心问题

  1. 可检测性边界:哪些 MCAR 违反在原理上是可以被检测的?本文的回答是:恰好是不兼容的边际族。这个刻画是精确的——Proposition 1 证明了兼容的备择假设与 MCAR 原假设在观测分布上不可区分。

  2. 最优检验的构造:给定可检测的备择,如何构造达到极小极大最优分离率的检验?本文给出了基于不兼容指数的通用构造,并在离散情形下证明了其最优性。

  3. 连续情形的处理:当变量包含连续分量时,如何在不假设参数模型的前提下进行检验?本文通过离散化(bandwidth 方法)处理,但引入了额外的光滑性假设(Hölder 条件),且分离率中包含离散化误差项。

  4. 计算可行性:不兼容指数的计算涉及线性规划,其复杂度随变量维度和字母表大小指数增长。本文给出了若干降低复杂度的策略(如 Proposition 10-12 的约化),但一般情形的计算仍是开放的。

⚠️ 作者的 framing

作者将本文的贡献框架为"首次精确刻画 MCAR 可检测备择集合,并给出极小极大最优检验"。这个框架的巧妙之处在于:它将一个看似不可能的问题(检验缺失机制)转化为一个纯几何问题(边际兼容性),从而使得线性规划和多面体理论等成熟工具可以直接应用。作者淡化的竞争路线包括:(i) 基于完整案例的检验方法(Fuchs 1982)——作者指出其需要完整案例,而本文方法不需要;(ii) 参数化检验方法——作者认为其依赖的模型假设在实践中难以验证。值得研究者去查的问题:作者在引言中提到了量子上下文性的联系,但并未深入探讨这一联系是否能为检验问题带来新的算法或理论工具;此外,作者对"一致性检验"(Li-Yu 2015, Spohn 2021)的批评是否完全公平——在某些应用场景下,一致性可能已经是实践中所能期望的最好结果。

张力

未见明显对立引用。不过有一个值得注意的微妙之处:Li 和 Yu(2015)以及 Spohn 等(2021)的方法检验一致性,而本文指出一致性不等于兼容性——但本文并未讨论一个自然的问题:在什么条件下,一致性检验的幂函数与兼容性检验的幂函数差距有多大? 如果差距很小,那么更简单的一致性检验可能在实践中已经足够。这一张力未被作者讨论。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

设定:我们有 \(d\) 个变量 \(X_1, \dots, X_d\),取值空间分别为 \(\mathcal{X}_1, \dots, \mathcal{X}_d\),记 \(\mathcal{X} = \prod_{j=1}^d \mathcal{X}_j\)。对每个子集 \(S \subseteq [d] := \{1, \dots, d\}\),记 \(X_S := (X_j : j \in S)\) 为 \(X\) 在坐标 \(S\) 上的投影,\(\mathcal{X}_S := \prod_{j \in S} \mathcal{X}_j\)。

缺失机制:每个样本点有一个"揭示向量"(revelation vector)\(\Omega \in \{0,1\}^d\),其中 \(\Omega_j = 1\) 表示第 \(j\) 个变量被观测到,\(\Omega_j = 0\) 表示缺失。我们观测到的是 \(X \circ \Omega\),即 \(X\) 与 \(\Omega\) 的逐坐标组合:第 \(j\) 个坐标若 \(\Omega_j = 1\) 则为 \(X_j\),若 \(\Omega_j = 0\) 则为缺失标记 \(\star\)。

MCAR 假设:\(H_0: X \perp\!\!\!\perp \Omega\),即数据与缺失机制独立。

关键观测:在 MCAR 下,给定 \(\Omega = 1_S\)(即观测到模式 \(S\)),\(X_S\) 的条件分布等于 \(X_S\) 的无条件边际分布。因此,对每个可观测模式 \(S\),我们得到 \(X_S\) 的一个边际分布 \(P_S\)。这些边际分布必须兼容——即存在 \(X\) 的某个联合分布 \(P\),使得 \(P\) 在 \(\mathcal{X}_S\) 上的边际恰好等于 \(P_S\),对所有 \(S \in \mathcal{S}\) 同时成立。这里 \(\mathcal{S} \subseteq 2^{[d]}\) 是所有可能观测模式的集合。

核心记号: - \(P_S\):模式 \(S\) 下观测到的 \(X_S\) 的分布(可观测) - \(P_S = (P_S : S \in \mathcal{S})\):所有可观测边际分布的集合 - \(\mathcal{P}_S\):所有可能的 \(P_S\) 的集合 - \(\mathcal{P}^0_S\):兼容的 \(P_S\) 的集合(即存在联合分布 \(P\) 以 \(P_S\) 为边际) - \(R(P_S)\):不兼容指数(定义见下) - \(n_S\):模式 \(S\) 下的样本量 - \(\hat{P}_S\):模式 \(S\) 下的经验分布

统计问题:给定观测数据 \(\{X_i \circ \Omega_i\}_{i=1}^n\),检验 \(H_0: P_S \in \mathcal{P}^0_S\)(即边际分布兼容,等价于 MCAR)。

第二步:最小内核

最小例子:\(d = 3\),\(\mathcal{S} = \{\{1,2\}, \{2,3\}, \{1,3\}\}\),即我们只观测到三个两两配对,没有完整的三元组观测。每个变量取值为 \(\{0,1\}\)(二元)。

问题:给定三个二元边际分布 \(P_{12}, P_{23}, P_{13}\),是否存在一个三元联合分布 \(P_{123}\),使得它的三个两两边际恰好等于给定的 \(P_{12}, P_{23}, P_{13}\)?

为什么这个问题是核心:这正是 Fréchet 类理论的基本问题——给定部分边际,判断 Fréchet 类 \(\mathcal{F}_{\mathcal{S}}(P_S)\) 是否非空。如果非空,则 \(P_S\) 兼容,MCAR 无法被检测;如果为空,则 \(P_S\) 不兼容,MCAR 被违反且在原理上可检测。

最小内核的数学表述:设 \(p_{ijk} := P(X_1 = i, X_2 = j, X_3 = k)\) 为联合概率质量函数。给定边际 \(p_{ij\cdot} := P(X_1 = i, X_2 = j)\) 等,兼容性要求存在非负 \(p_{ijk}\) 使得:

\[\sum_{k} p_{ijk} = p_{ij\cdot}, \quad \sum_{i} p_{ijk} = p_{\cdot jk}, \quad \sum_{j} p_{ijk} = p_{i \cdot k}, \quad \sum_{i,j,k} p_{ijk} = 1.\]

这是一个线性可行性问题——正是线性规划的标准形式。当 \(d=3\) 且 \(\mathcal{S} = \{\{1,2\},\{2,3\},\{1,3\}\}\) 时,这个问题的答案由Fréchet-Hoeffding 不等式族刻画:兼容性等价于对所有的 \(A \subseteq \{1,2\}, B \subseteq \{2,3\}, C \subseteq \{1,3\}\),有

\[P_{12}(A \times B) + P_{23}(B \times C) + P_{13}(C \times A) \leq 1 + P_{12}(A \times B \times \mathcal{X}_3) + \cdots\]
(具体形式见 Kellerer 1984 与 Vlach 1986。)

不兼容指数:当 \(P_S\) 不兼容时,我们定义

\[R(P_S) := \sup_{f_S \in \mathcal{G}^+_S} -\frac{1}{|\mathcal{S}|} \sum_{S \in \mathcal{S}} \int f_S \, dP_S,\]
其中 \(\mathcal{G}^+_S\) 是满足 \(\inf_{x \in \mathcal{X}} \sum_{S \in \mathcal{S}} f_S(x_S) \ge 0\) 的有界上半连续函数族。\(R(P_S) = 0\) 当且仅当 \(P_S\) 兼容;\(R(P_S) > 0\) 度量了不兼容的程度。Theorem 2 给出了关键的对偶刻画:
\[R(P_S) = \inf\{\epsilon \in [0,1] : P_S \in (1-\epsilon)\mathcal{P}^0_S + \epsilon \mathcal{P}_S\},\]
即 \(R(P_S)\) 是 \(P_S\) 到兼容集合 \(\mathcal{P}^0_S\) 的"距离"(在混合意义下)。

为什么这个例子能支撑整篇论文:本文的所有技术结果——离散情形的通用检验(Proposition 4)、改进检验(Theorem 7)、极小极大下界(Theorem 9)、连续情形的离散化处理(Theorem 15)——本质上都是在回答同一个问题:如何从数据中估计 \(R(P_S)\),并判断它是否显著大于 0? 最小例子中的线性规划结构在一般情形中保持不变,只是维度更高、约束更复杂。


三、这篇论文做了什么

三句话

① 研究了什么问题:在非参数框架下检验 MCAR 假设,精确刻画可检测的备择假设集合,并构造达到极小极大最优分离率的检验方法。② 核心工具/方法:将 MCAR 检验等价转化为边际分布的兼容性检验,利用 Kellerer(1984)的对偶定理定义不兼容指数 \(R(P_S)\),通过线性规划计算检验统计量,并建立其极小极大理论。③ 主要结论:离散情形下,基于不兼容指数的检验对所有可检测备择一致有效,且达到极小极大最优分离率(至多差对数因子);连续情形通过离散化处理,分离率中包含依赖于光滑性的误差项;该方法不需要任何完整案例即可有效。

关键设定与假设

离散情形(Section 3.1-3.3): - \(\mathcal{X}_j = [m_j]\) 为有限字母表,\(m_j \in \mathbb{N}\) - 每个模式 \(S \in \mathcal{S}\) 有确定样本量 \(n_S\),数据独立 - 无额外假设:不假设缺失机制的任何参数形式,不假设变量间的独立性

混合连续/离散情形(Section 4): - 前 \(d_0\) 个变量连续(取值于 \([0,1)\)),后 \(d - d_0\) 个变量离散 - 连续变量的密度满足 Hölder 条件:存在 \(L > 0\) 和 \(r = (r_1, \dots, r_{d_0}) \in (0,1]^{d_0}\) 使得 \(|p(x) - p(x')| \le L \sum_{j=1}^{d_0} |x_j - x'_j|^{r_j}\) - 带宽 \(h_j\) 趋于 0 的速度受光滑性参数控制

相比已有文献的放宽/强化: - 放宽:不要求存在完整案例(Fuchs 1982 需要);不要求参数模型(Little 1988 等需要) - 强化:要求对所有可检测备择一致有效(而不仅是局部备择);给出极小极大最优分离率(此前文献没有)

主要结果

结果 1:可检测性刻画(Proposition 1)。设 \(P_0\) 为 MCAR 假设下的分布集合,\(P'_0\) 为边际分布兼容的分布集合。则对任意检验 \(\psi\),\(\sup_{P \in P'_0} E_P \psi = \sup_{P \in P_0} E_P \psi\)。含义:兼容的边际分布族与 MCAR 假设在观测分布上不可区分——任何检验都无法在兼容备择上获得超过其尺寸的功效。这精确刻画了可检测备择的边界。

结果 2:不兼容指数的对偶刻画(Theorem 2)。\(R(P_S)\) 等于 \(P_S\) 到兼容集合的混合距离。证明路线:先通过 Alexandroff 单点紧化将问题化为紧空间上的线性规划,再应用 Isii(1964)的强对偶定理和 Riesz 表示定理。技术要点:对偶问题中的变量是 \(\mathcal{X}\) 上的符号测度,其全变差范数给出了距离的度量。

结果 3:通用检验的有限样本保证(Proposition 4)。检验统计量 \(\hat{R} := R(\hat{P}_S)\),拒绝域 \(\{\hat{R} \ge C_\alpha\}\),其中

\[C_\alpha := \frac{1}{2} \sum_{S \in \mathcal{S}} \left(\frac{|\mathcal{X}_S| - 1}{n_S}\right)^{1/2} + \left\{\frac{1}{2} \log(1/\alpha) \sum_{S \in \mathcal{S}} \frac{1}{n_S}\right\}^{1/2}.\]
保证:当 \(P_S \in \mathcal{P}^0_S\) 时,\(P(\hat{R} \ge C_\alpha) \le \alpha\)(有限样本 Type I 误差控制)。证明思路:利用 \(R\) 的 1-Lipschitz 性质(Proposition 3)和 McDiarmid 不等式对经验过程进行集中。

结果 4:极小极大最优性(Theorem 7-9)。在 \(d=3, \mathcal{S} = \{\{1,2\},\{2,3\},\{1,3\}\}\) 且 \(|\mathcal{X}_1| = r, |\mathcal{X}_2| = s, |\mathcal{X}_3| = 2\) 的情形下: - 上界:改进检验的分离率为 \(O((r+s)/n_{12} + r/n_{13} + s/n_{23})^{1/2}\)(至多对数因子); - 下界:任何检验的分离率至少为 \(\Omega((r+s)/(n_{12} \log r) + r/(n_{13} \log r) + s/(n_{23} \log s))^{1/2}\); - 结论:改进检验达到极小极大最优,至多差 \(\log\) 因子。

下界证明的技术要点:构造两个先验分布——一个在 \(H_0\) 下(兼容),一个在备择下(不兼容但 \(R(P_S)\) 很小)——使得它们的总变差距离有界。关键工具是 Lemma S1:配对 Poisson 混合分布之间的总变差距离上界,这是 Wu-Yang(2016)和 Jiao-Han-Weissman(2018)相关引理的推广。难点:需要同时控制 \(r, s\) 两个字母表大小和三个样本量 \(n_{12}, n_{13}, n_{23}\) 的权衡。

结果 5:连续情形的处理(Theorem 15)。通过带宽 \(h_j\) 离散化连续变量,检验统计量基于离散化后的经验分布。分离率为

\[\rho^* \asymp L \sum_{j=1}^{d_0} h_j^{r_j} + \left(\frac{\prod_{j=1}^{d_0} h_j^{-1} + \sum_{S \in \mathcal{S}} |\mathcal{X}_S|}{\min_S n_S}\right)^{1/2},\]
其中第一项是离散化偏差,第二项是估计方差。最优带宽选择 \(h_j \asymp (\min_S n_S)^{-1/(1+2r_j)}\) 给出分离率 \((\min_S n_S)^{-r_j/(1+2r_j)}\)。

真实例子与应用

例子 1(Section 3.2 之后):\(d=3, \mathcal{S} = \{\{1,2\},\{2,3\},\{1,3\}\}\),\(\mathcal{X} = [r] \times [s] \times [2]\)。这是本文最详细研究的情形。关键结论:不兼容指数有显式表达式 \(R(P_S) = 2\max_{A \subseteq [r], B \subseteq [s]}(-p_{AB\cdot} + p_{A\cdot 1} + p_{\cdot B 1} - p_{\cdot\cdot 1})_+\)。直觉:这个表达式衡量的是"三个边际分布之间的不一致程度"——如果存在 \(A, B\) 使得 \(P_{12}(A \times B)\) 与 \(P_{13}(A \times \{1\})\) 和 \(P_{23}(B \times \{1\})\) 严重不一致,则边际不兼容。

例子 2(Example 14):\(d=4\) 的几种不可约模式: - 链式 \(\mathcal{S} = \{\{1,2\},\{2,3\},\{3,4\},\{1,4\}\}\):\(R(P_S)\) 有显式表达式,且 \(F = 8\); - 星形 \(\mathcal{S} = \{\{1,2\},\{1,3\},\{1,4\},\{2,3\},\{3,4\}\}\):\(R(P_S)\) 可分解为三个子问题的最大值,\(F = 16\); - 完全图 \(\mathcal{S} = \{\{1,2\},\{1,3\},\{1,4\},\{2,3\},\{2,4\},\{3,4\}\}\):\(R(P_S)\) 的表达式包含 56 个本质面。

数值实验(Section 5):使用 \(d=3, r \in \{2,4,6\}\) 的设定,比较本文检验与 Fuchs(1982)检验。结果:本文检验在无完整案例时仍然有效,而 Fuchs 检验无法应用;在有完整案例时,本文检验的功效与 Fuchs 检验相当或更优。实验设计要点:通过改变 \(p_{\cdot 21}\) 来调节不兼容指数 \(R(P_S)\),展示检验功效随 \(R(P_S)\) 的单调性。

🔎 结论是否比证明窄

明确的窄结论: 1. Theorem 9 的下界只在 \(d=3, |\mathcal{X}_2| = |\mathcal{X}_3| = 2\) 的情形下证明,但上界(Theorem 8)对一般的 \(r, s\) 成立。作者在文中声称"我们的检验是极小极大最优的,至多差对数因子",但严格来说,下界只在 \(s = 2\) 时证明。对于一般的 \(s\),下界是否仍然成立是未证明的。 2. Proposition 10 的约化要求 \(J\) 中的变量只在单一模式中出现。如果 \(J\) 中的变量出现在多个模式中,约化不成立,\(R(P_S)\) 的计算可能更复杂。 3. 连续情形的 Theorem 15假设密度满足 Hölder 条件,且带宽选择依赖于光滑性参数 \(r\)。在实际应用中,\(r\) 未知,需要自适应选择——本文没有给出自适应方案。

被泛化的地方: 1. 作者在引言和摘要中声称"对所有可检测备择一致有效",但 Proposition 4 的证明依赖于 \(R\) 的 1-Lipschitz 性质,而这一性质在连续情形(Section 4)中需要额外的紧性假设。作者在 Section 4 中处理了这一点,但没有明确讨论当 \(\mathcal{X}\) 非紧时是否仍然成立。 2. 作者声称"不兼容指数是自然的不兼容度量",但并未讨论这一度量是否在某种意义上是唯一的或最优的。量子上下文性文献中还有其他度量(如 contextual fraction 的变体),本文未做比较。


四、开放问题

  1. 一般情形的极小极大下界(扎根于 Theorem 9 之后的讨论):Theorem 9 的下界只在 \(d=3, |\mathcal{X}_2| = |\mathcal{X}_3| = 2\) 时证明。对于一般的字母表大小和模式集合 \(\mathcal{S}\),极小极大分离率的下界是什么?特别是,当 \(\mathcal{S}\) 包含重叠较多的模式时,下界是否仍然由"最大不兼容对"决定?

  2. 自适应带宽选择(扎根于 Theorem 15 的假设):连续情形的检验需要知道密度的 Hölder 光滑性参数 \(r\) 才能选择最优带宽。能否构造自适应检验,在不已知 \(r\) 的情况下达到相同的分离率?这可能需要 Lepski 型自适应方法。

  3. 计算复杂度的降低(扎根于 Section 3.4 的讨论):不兼容指数的计算涉及线性规划,其复杂度随 \(|\mathcal{X}|\) 和 \(|\mathcal{S}|\) 指数增长。作者给出了若干约化策略(Proposition 10-12),但一般情形的计算仍是 NP-hard 的(这与边际多面体的复杂性有关)。是否存在多项式时间的近似算法,能在保证 Type I 误差控制的前提下近似计算 \(R(P_S)\)?

  4. 与量子上下文性的深层联系(扎根于引言中对 Abramsky 和 Brandenburger 2011 的引用):本文的不兼容指数与量子物理中的 contextual fraction 在数学上等价。这一联系是否能为两个领域带来新的工具?例如,量子信息中的 Bell 不等式检验方法是否可用于构造更高效的 MCAR 检验?

  5. 高维情形的推广(扎根于引言中提到的 Zhu, Wang 和 Samworth 2022 等高维缺失数据工作):当 \(d\) 很大时,模式集合 \(\mathcal{S}\) 的大小可能远大于样本量。此时不兼容指数的估计是否仍然可行?是否可以利用稀疏性假设(如大部分变量对独立)来降低复杂度?


提醒:若要确认上述某条是否是真 gap,建议去读该子领域近期约 5 篇论文的引言——如果多篇都指向同一个未解决问题,那很可能是共识性的 gap;如果各篇说法不一,则可能只是本文作者的个人 framing,需要更谨慎地判断。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论