跳转至

Evaluating Black-Box Classifiers via Stable Adaptive Two-Sample Inference

讲者: Jing Lei
会场: Recent Advances in Model Free Inference
报告题目: Evaluating Black-Box Classifiers via Stable Adaptive Two-Sample Inference
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是评估黑箱概率分类器的拟合优度(Goodness-of-Fit, GoF)。根本的统计问题是:给定一个由未知算法训练得到的概率分类器 \(\hat{\eta}\)(将特征 \(X\) 映射到标签 \(Y\) 的概率分布),以及一组独立的留出数据(holdout data),我们能否判断 \(\hat{\eta}\) 是否“足够好”?这里的“好”不是指分类准确率,而是指 \(\hat{\eta}\) 所隐含的联合分布 \(P_X \times \text{Multinom}(\hat{\eta}(X))\) 是否接近真实的数据生成分布 \(P_X \times \text{Multinom}(\eta(X))\)。该方向当前处于快速发展期,核心挑战在于:如何处理高维、复杂数据(如图像),如何对“黑箱”分类器(不假设其内部结构)进行推断,以及如何将评估问题形式化为一个具有严格统计保证的假设检验。

发展脉络(history)

  1. 奠基工作:从参数模型到高维广义线性模型

    • 经典的拟合优度检验(如Pearson卡方检验)主要针对参数模型。McCullagh (1985), Osius & Rojek (1992), Farrington (1996) 等发展了针对广义线性模型的检验。
    • Shah & Bühlmann (2018)Janková et al. (2020) 将GoF检验推广到高维线性模型和高维广义线性模型。他们的方法基于“残差预测”思想:在拟合模型后,用机器学习方法从残差中提取剩余信号,并证明在原假设下检验统计量具有高斯极限分布。留下的口子:这些方法依赖于特定的模型结构(线性、广义线性),无法直接处理完全非参数的黑箱分类器。
  2. 主要进展:用分类进行双样本检验与拟合优度检验

    • Kim, Ramdas, Singh & Wasserman (2021) 开创性地证明了:当数据维度和样本量都趋于无穷时,如果分类器的真实误差始终优于随机猜测,那么基于置换的检验和基于高斯近似的检验都是一致的。留下的口子:该工作主要关注“分类准确率是否显著优于随机”这一双样本检验问题,而非评估一个给定分类器与真实分布的接近程度。
    • Zhang, Ding & Yang (2023) 提出了BAGofT,一种用于二分类问题的自适应拟合优度检验。其核心思想是利用估计的分类器对特征空间进行自适应分箱,将问题转化为多个二项分布的检验。留下的口子:该方法将 \(\hat{\eta}\) 的训练过程视为检验的一部分(非黑箱),且其理论设定是检验 \(\hat{\eta}\) 是否渐近等于 \(\eta\),而非检验其是否在用户指定的容忍度内。其多类扩展缺乏严格证明且计算量大。
    • Javanmard & Mehrabi (2024) 提出了GRASP,一种用于二分类问题的随机化检验。它通过生成多个“伪造”样本并计算真实样本在其中的秩来构造检验统计量,并利用优化子程序确定决策规则。留下的口子:该方法需要预设容忍度 \(\delta\),且其优化子程序计算负担较重,不易扩展到多类问题或构造置信区间。
  3. 当前前沿:结果不可区分性、校准检验与条件分布检验

    • Dwork et al. (2021, 2022) 从算法公平性角度提出了“结果不可区分性”(Outcome Indistinguishability, OI)的概念:一个好的分类器生成的标签分布应与自然生成的标签分布无法被任何(属于某个函数类的)区分器有效区分。留下的口子:OI提供了一个理论框架,但本文将其转化为一个具体的、基于秩和统计量的统计检验。
    • Lee, Huang, Hassani & Dobriban (2023) 提出了T-Cal,一种用于检验分类器校准度的最优检验。留下的口子:校准度检验的是 \(E[\eta(X) | \hat{\eta}(X) = \eta]\) 是否等于 \(\eta\),而本文检验的是 \(\eta(X) = \hat{\eta}(X)\) 几乎必然成立,两者目标不同。T-Cal还依赖于光滑性等分布假设。
    • Hu & Lei (2024)Chen & Lei (2025) 研究了条件分布检验问题,即检验两个总体的 \(Y|X\) 条件分布是否相等。他们的秩和检验统计量是本文的直接灵感来源。留下的口子:这些工作处理的是精确零假设(两个分布完全相等),而本文将其推广到容忍性检验(tolerance testing),并处理了第二样本的构造问题。
  4. 本文的位置:本文位于上述脉络的交汇点。它借鉴了OI的思想,将评估问题形式化为一个容忍性双样本条件分布检验。它利用Hu & Lei (2024) 的秩和统计量,但通过构造第二样本(使用 \(\hat{\eta}\) 生成标签)将问题转化为一个标准的双样本检验。它采用交叉验证(cross-fitting)和稳定性分析(Lei, 2025)来避免样本分裂带来的效率损失,并首次为多类分类器的评估提供了严格的统计保证。

子线索聚类

  1. 基于分类的双样本检验:核心思想是用一个分类器的表现(如准确率、AUC)来检验两个分布是否相同。代表工作:Kim et al. (2021), Gerber et al. (2023), Cai, Lei & Roeder (2024)。本文的秩和统计量属于此类,但更侧重于评估而非检验相等。
  2. 结果不可区分性(OI):一个理论框架,要求分类器的输出与自然数据不可区分。代表工作:Dwork et al. (2021, 2022)。本文将其作为理论动机,并提供了一个具体的统计检验实现。
  3. 拟合优度检验(GoF):直接检验分类器与真实分布的匹配程度。代表工作:Zhang et al. (2023) (BAGofT), Javanmard & Mehrabi (2024) (GRASP)。本文与GRASP最为接近,但采用了不同的统计量(秩和 vs. 随机化秩),从而在计算效率和扩展性上有所区别。
  4. 校准检验:检验分类器的概率输出是否准确。代表工作:Lee et al. (2023) (T-Cal)。本文的目标与校准检验不同,但方法上(构造第二样本)有相似之处。

这个方向在追问的核心问题

  1. 如何定义“好”:除了分类准确率,用什么度量来量化分类器与真实分布的差异?本文采用基于AUC的Neyman-Pearson分离度量 \(\rho\)
  2. 如何应对黑箱:如何在不了解分类器内部结构(训练算法、模型架构)的情况下进行推断?本文假设只能通过采样访问 \(\hat{\eta}\)
  3. 如何处理高维与复杂数据:检验方法能否适应数据的高维性或非线性结构?本文通过允许用户选择灵活的区分器(如LASSO、XgBoost)来实现自适应性。
  4. 如何实现容忍性检验:实际中,完美拟合几乎不可能,如何检验“接近”而非“相等”?本文通过引入容忍参数 \(\delta\) 和构造置信下界来解决。

⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)

  • 作者把缺口 frame 成什么:作者声称,现有方法要么(a)只处理二分类问题(BAGofT, GRASP),要么(b)需要预设容忍度且计算复杂(GRASP),要么(c)依赖于特定的分布假设(T-Cal)。因此,本文提出的方法“是唯一一个在多类设定下具有严格保证的检验”("the only one with a rigorous guarantee in the multi-class setting")。作者将自己的方法定位为“显然的下一步”:结合OI的思想、秩和统计量的稳健性、以及交叉验证的效率。
  • 哪些竞争路线被他淡化或回避了
    • BAGofT:作者强调BAGofT不将 \(\hat{\eta}\) 视为黑箱(其训练是检验的一部分),且其多类扩展不严格。这淡化了BAGofT在二分类问题上的成熟度。
    • GRASP:作者强调GRASP的计算负担(优化子程序)和需要预设 \(\delta\) 的缺点,而本文的秩和统计量可以方便地构造置信下界,无需预设 \(\delta\)。这回避了GRASP在模型-X设定下可能更优的表现(作者在模拟中明确排除了这种比较)。
    • 校准检验:作者明确指出校准检验的目标不同,从而将其排除在直接竞争之外。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:作者没有引用任何关于“统计-计算权衡”或“低度多项式障碍”的文献。考虑到本文的区分器可以是一个复杂的机器学习模型,其计算可行性(例如,训练一个XgBoost区分器需要多少计算资源)是一个值得讨论的问题,但作者完全回避了。此外,对于“用分类进行双样本检验”这一子线索,作者引用了Kim et al. (2021) 和 Gerber et al. (2023),但未提及更早的、可能更基础的文献(如Friedman (2003) 的“用分类进行双样本问题”)。

张力

未见明显对立引用。不同工作主要在设定(二类 vs. 多类、精确 vs. 容忍、参数 vs. 非参数)和方法(分箱 vs. 随机化 vs. 秩和)上存在差异,而非结论上的矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
    • \(X \in \mathcal{X}\):特征向量,随机变量。
    • \(Y \in \{0, 1, \dots, M-1\}\):标签,随机变量。\(M\) 是类别数。
    • \(\eta(x) \in \Delta_{M-1}\)真实的条件概率分布,即 \(P(Y = y | X = x)\)。这是未知的、我们想要逼近的目标。
    • \(\hat{\eta}(x) \in \Delta_{M-1}\)待评估的黑箱概率分类器。它是一个已知的函数(或可以通过采样访问),由外部数据训练得到,与留出数据独立。
    • \(P_X\):特征 \(X\) 的边缘分布。
    • \(\rho(P_0, P_1)\):两个分布 \(P_0\)\(P_1\) 之间的Neyman-Pearson分离度量,定义为 \(\text{AUC}(L) - 0.5\),其中 \(L\) 是真实似然比。\(\rho\) 的值域为 \([0, 0.5]\)
    • \(\delta > 0\):用户预设的容忍度。零假设是 \(\rho(P_X \times \eta, P_X \times \hat{\eta}) < \delta\)
    • \(n\):留出样本量。观测数据为 \(\{(X_i, Y_i)\}_{i=1}^n\)
    • \((X_i', Y_i')\):构造的第二样本,其中 \(X_i' = X_i\)\(Y_i' \sim \text{Multinom}(\hat{\eta}(X_i))\)
    • \(\hat{g}\):区分器(distinguisher),一个从 \(\mathcal{X} \times \mathcal{L}\) 映射到 \([0,1]\) 的函数,用于估计一个样本点来自第二样本(即由 \(\hat{\eta}\) 生成)的概率。
    • \(T\):秩和检验统计量,用于衡量区分器 \(\hat{g}\) 区分两个样本的能力。
  • 模型
    • 数据生成机制:\((X, Y) \sim P_X \times \text{Multinom}(\eta(X))\)。即,先由 \(P_X\) 生成 \(X\),再由 \(\eta(X)\) 决定 \(Y\) 的多项分布。
    • 待评估的分类器 \(\hat{\eta}\) 是外生的,不依赖于留出数据。
    • 区分器 \(\hat{g}\) 是在留出数据上训练的一个辅助二分类器。
  • 可观测数据
    • 可观测:留出数据 \(\{(X_i, Y_i)\}_{i=1}^n\)。我们可以通过 \(\hat{\eta}\) 生成第二样本 \(\{(X_i, Y_i')\}_{i=1}^n\)。因此,我们最终可以观测到 \(\{(X_i, Y_i, Y_i')\}_{i=1}^n\)
    • 不可观测:真实的 \(\eta\) 函数。这是我们想要推断的对象。我们只能通过比较 \(\hat{\eta}\) 生成的 \(Y'\) 和真实的 \(Y\) 来间接了解 \(\eta\)

第二步:讲最小内核

本文的核心思路可以浓缩为一个最简特例二分类问题(\(M=2\)),线性逻辑回归模型,精确零假设(\(\delta=0\)

  • 设定

    • \(Y \in \{0, 1\}\)\(\eta(x) = P(Y=1|X=x) = \text{sigmoid}(x^T \theta^*)\),其中 \(\theta^*\) 是真实参数。
    • 待评估的分类器是 \(\hat{\eta}(x) = \text{sigmoid}(x^T \hat{\theta})\),其中 \(\hat{\theta}\) 是某个估计量。
    • 零假设 \(H_0: \eta(X) = \hat{\eta}(X)\) 几乎必然成立,即 \(\theta^* = \hat{\theta}\)
    • 备择假设 \(H_1: \eta(X) \neq \hat{\eta}(X)\),即 \(\theta^* \neq \hat{\theta}\)
  • 可观测数据:留出数据 \(\{(X_i, Y_i)\}_{i=1}^n\)。我们构造第二样本:\(X_i' = X_i\)\(Y_i' \sim \text{Bernoulli}(\hat{\eta}(X_i))\)

  • 核心思路

    1. 构造区分器:我们训练一个区分器 \(\hat{g}(x, y)\) 来区分两个样本:\(\{(X_i, Y_i)\}\)(来自真实分布)和 \(\{(X_i, Y_i')\}\)(来自 \(\hat{\eta}\))。由于 \(X\) 的边缘分布相同,区分器只能利用 \(Y\) 的信息。一个自然的区分器是逻辑回归:\(\hat{g}(x, y) = \text{sigmoid}(x^T \hat{\beta}_y)\),其中 \(\hat{\beta}_y\) 是在给定 \(Y=y\) 的子样本上训练的。如果 \(\hat{\eta} = \eta\),那么两个样本不可区分,\(\hat{g}\) 应该无法比随机猜测更好。
    2. 计算检验统计量:使用秩和统计量 \(T = \frac{1}{n^2} \sum_{i,j} \mathbf{1}\{\hat{g}(X_i, Y_i) < \hat{g}(X_j, Y_j')\}\)。这个统计量是区分器 \(\hat{g}\) 的AUC的估计。如果 \(\hat{g}\) 无法区分,\(T \approx 0.5\)。如果 \(\hat{g}\) 能区分(即 \(\hat{\eta} \neq \eta\)),那么 \(\hat{g}(X_j, Y_j')\) 倾向于更大,所以 \(T > 0.5\)
    3. 进行检验:在原假设下,\(T\) 应接近0.5。我们可以利用 \(T\) 的渐近正态性来构造拒绝域。如果 \(T\) 显著大于0.5,则拒绝原假设,认为 \(\hat{\eta}\)\(\eta\) 有显著差异。
  • 为什么这个特例抓住了核心

    • 问题退化:在这个特例下,检验 \(\eta = \hat{\eta}\) 等价于检验 \(\theta^* = \hat{\theta}\)。这是一个标准的参数假设检验问题。
    • 关键想法:本文的关键想法是将评估分类器的问题转化为一个双样本检验问题。通过构造第二样本,我们创造了一个“对照组”,使得我们可以用区分器的表现来度量两个分布的差异。这个想法在特例中非常清晰:如果 \(\hat{\theta} = \theta^*\),那么两个样本来自同一分布,任何区分器都无效;如果 \(\hat{\theta} \neq \theta^*\),那么两个样本分布不同,一个好的区分器就能发现差异。
    • 证明的骨架:在一般情形下,证明的核心是证明秩和统计量 \(T\) 的渐近正态性,并利用Neyman-Pearson引理将 \(T\) 的期望与真实的分离度量 \(\rho\) 联系起来。在特例中,这个联系是直接的:\(T\) 的期望就是区分器 \(\hat{g}\) 的AUC,而最优AUC由真实似然比给出,其与 \(\rho\) 的关系由Neyman-Pearson引理保证。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究如何评估一个黑箱概率多类分类器 \(\hat{\eta}\) 的拟合优度,将其形式化为一个容忍性假设检验问题:\(H_0: \rho(P_X \times \text{Multinom}(\hat{\eta}(X)), P_X \times \text{Multinom}(\eta(X))) < \delta\)
  2. 核心工具 / 方法:核心方法是通过构造第二样本(使用 \(\hat{\eta}\) 生成标签)将问题转化为双样本条件分布检验,然后训练一个辅助二分类器(区分器)并计算其秩和统计量(AUC的估计)。为了避免样本分裂的效率损失,采用了交叉验证(cross-fitting)技术,并利用交叉验证中心极限定理(Lei, 2025)来建立检验统计量的渐近分布。
  3. 主要结论:在区分器满足一定稳定性条件(Assumption 2)下,本文提出的样本分裂和交叉验证检验都能渐近控制第一类错误(Theorem 2)。检验的功效取决于区分器的质量,当区分器一致时,检验可以渐近达到最优功效(Corollary 9)。模拟和真实数据实验验证了方法的有效性,特别是在多类设定下,其表现优于GRASP。

关键设定与假设

  • 设定
    • 数据生成\((X, Y) \sim P_X \times \text{Multinom}(\eta(X))\)\(\eta\) 未知。
    • 黑箱假设\(\hat{\eta}\) 是外生的,与留出数据独立。我们只能通过采样访问 \(\hat{\eta}\)(即给定 \(X\),可以生成 \(Y' \sim \hat{\eta}(X)\))。
    • 容忍性假设:零假设是 \(\rho(P_0, P_1) < \delta\),其中 \(P_0 = P_X \times \text{Multinom}(\eta(X))\)\(P_1 = P_X \times \text{Multinom}(\hat{\eta}(X))\)\(\rho\) 是基于AUC的Neyman-Pearson分离度量。
    • 区分器:一个辅助二分类器 \(\hat{g}\),用于区分 \(P_0\)\(P_1\)。其训练数据是构造的 \(\{(X_i, Y_i, 0)\}\)\(\{(X_i, Y_i', 1)\}\)
  • 关键假设
    • Assumption 1 (样本分裂)\(\sigma_{n,\text{split}}^3 \sqrt{n_2} \to \infty\) 依概率成立。这是一个技术性假设,确保条件CLT可以转化为无条件CLT。\(\sigma_{n,\text{split}}\) 是条件方差,通常为常数阶,因此该假设很容易满足。
    • Assumption 2 (交叉验证):这是最关键的假设,包含三个部分:
      1. 非退化性\(\hat{g}_n(X, Y)\)\(\hat{g}_n(X', Y')\) 的密度有界。这避免了秩统计量的退化问题。
      2. 稳定性:区分器 \(\hat{g}\) 对单个数据点的扰动是“小”的,具体地,扰动后的变化量 \(\nabla_i \hat{g}_n(X, Y)\)\((\log(n)^{-\beta} n^{-1/2}, \beta)\) 次指数(sub-Weibull)的。这等价于要求 \(\hat{g}\) 的估计误差以 \(n^{-1/2}\) 速率(忽略对数因子)衰减。这是应用交叉验证CLT(Lei, 2025)的核心条件。
      3. 方差非零\(\sigma_{\text{tr,cross}}^2 > c > 0\)。这保证了检验统计量不会退化。
    • 相比已有文献:相比GRASP(需要优化子程序),本文的假设更侧重于区分器的稳定性,而非数据分布的具体形式。相比BAGofT(需要将 \(\hat{\eta}\) 的训练纳入检验),本文的假设更弱,因为 \(\hat{\eta}\) 是黑箱。相比T-Cal(需要光滑性假设),本文的假设更通用。

主要结果

  • Theorem 2 (有效性):在Assumption 1下,样本分裂检验渐近控制第一类错误。在Assumption 2下,交叉验证检验渐近控制第一类错误。这是本文的核心理论保证。

    • 直觉:该定理保证了无论区分器 \(\hat{g}\) 的质量如何,只要它满足稳定性条件,检验的拒绝域就是有效的(不会过度拒绝)。
    • 必要条件:对于样本分裂,需要 \(n_1, n_2 \to \infty\)。对于交叉验证,需要区分器稳定。
    • 解决的技术难点:交叉验证检验的难点在于,不同折的区分器 \(\hat{g}_{n,-k}\) 不同,导致U-统计量的核在不同折之间变化,无法直接应用标准CLT。本文通过Hoeffding分解将U-统计量近似为独立和,然后应用Lei (2025) 的交叉验证CLT来解决。稳定性假设(Assumption 2.2)保证了这种近似的误差可以忽略。
  • Corollary 9 (功效):如果区分器一致(即 \(\|\hat{L}_{n,-k} - L\|_{L_1} \to 0\)),那么对于任何 \(\delta_n < \delta^*\)\(\delta^* - \delta_n = \omega(1/\sqrt{n})\),检验的功效趋近于1。

    • 直觉:该定理说明,只要区分器足够好,检验就能以高概率检测到真实分离度 \(\delta^*\) 与容忍度 \(\delta_n\) 之间的微小差距。
    • 必要条件:区分器必须一致。如果区分器有偏(\(r_n \to r > 0\)),那么检验的功效会受限于这个偏差(最多 \(2r\))。
    • 解决的技术难点:证明需要将检验统计量的期望与真实分离度 \(\rho\) 联系起来。关键工具是Proposition 8,它给出了区分器AUC与最优AUC(即 \(\rho + 0.5\))之间的差距的上界,这个上界由区分器似然比估计的 \(L_1\) 误差控制。

证明路线与技术技巧

  • 整体路线(以交叉验证为例)

    1. Hoeffding分解:将每个折内的U-统计量 \(\frac{1}{n_k^2} \sum_{i,j \in I_k} R_{ij}(D_{n,-k})\) 近似为独立和 \(\frac{1}{n_k} \sum_{i \in I_k} [\phi(X_i, Y_i; D_{n,-k}) + \psi(X_i, Y_i'; D_{n,-k})]\),其中 \(\phi, \psi\) 是U-统计量的投影。Lemma 11证明了该近似的误差是 \(o_p(1/\sqrt{n})\)
    2. 应用交叉验证CLT:将近似后的统计量视为一个“交叉验证估计量”,其核函数为 \(\ell(Z, D) = \phi(X, Y; D) + \psi(X, Y'; D)\),其中 \(Z = (X, Y, Y')\)。然后应用Lei (2025) 的交叉验证CLT(Theorem 5)。
    3. 验证稳定性条件:为了应用Theorem 5,需要证明核函数 \(\ell\) 对单个数据点的扰动是 \(o(n^{-1/2})\) 的。Lemma 12利用Assumption 2.2(区分器的稳定性)和密度有界性(Assumption 2.1)证明了这一点。关键技巧是将 \(\phi\)\(\psi\) 的扰动转化为区分器 \(\hat{g}\) 的扰动,并利用 \(\hat{g}\) 的稳定性来控制。
    4. 方差估计:证明方差估计量 \(\hat{\sigma}_{\text{tr,cross}}^2\) 是一致的(Proposition 7)。证明分为两步:首先证明一个“理想”方差估计量(使用真实投影 \(\phi, \psi\))是一致的(利用Efron-Stein不等式和稳定性);然后证明用经验投影 \(\hat{\phi}, \hat{\psi}\) 替代真实投影的误差是 \(O_p(n^{-1/2})\)(利用DKW不等式)。
    5. 结合零假设:在零假设下,\(\frac{1}{K} \sum_{k=1}^K \mu(D_{n,-k}) \le \delta + 0.5\)。因此,用 \(\delta + 0.5\) 作为中心进行检验是保守的,从而控制了第一类错误。
  • 关键跳跃点

    • 从U-统计量到独立和:Lemma 11的证明。关键在于证明U-统计量的退化部分(即Hoeffding分解中的高阶项)在交叉验证框架下是可忽略的。这需要仔细计算条件期望和协方差,并利用稳定性假设来控制核函数变化带来的额外复杂性。
    • 验证稳定性:Lemma 12的证明。这是最吃功夫的部分。难点在于 \(\phi\)\(\psi\) 是期望算子,其稳定性不能直接从 \(\hat{g}\) 的稳定性推导出来。证明技巧是将 \(\phi\) 的扰动转化为一个关于 \(\hat{g}\) 的指示函数差的期望,然后利用密度有界性将期望转化为概率,最后利用 \(\hat{g}\) 的次指数稳定性来bound这个概率。
  • 技术技巧点名

    • Hoeffding分解:用于将U-统计量分解为独立和与退化部分。
    • 交叉验证中心极限定理 (CV-CLT):Lei (2025) 的核心定理,用于处理交叉验证估计量的渐近分布。
    • Efron-Stein不等式:用于证明方差估计量的一致性,通过控制由拟合数据扰动带来的方差。
    • DKW不等式:用于控制经验分布函数与真实分布函数之间的差距,从而证明经验投影 \(\hat{\phi}, \hat{\psi}\) 的一致性。
    • McDiarmid不等式:用于证明LASSO区分器在耦合样本下的收敛性(Lemma 14)。
    • 次指数/次Weibull随机变量:用于刻画区分器的稳定性,并推导出扰动项的尾部概率界。

真实例子与应用

  • 数据/场景:使用了两个多类图像分类基准数据集:MNIST(手写数字)和 Fashion MNIST(服装物品)。每个数据集有10个类别,特征 \(X\) 是784维的像素灰度值。
  • 方法应用
    1. 将每个数据集分为训练集(10000样本)和评估集(剩余60000样本)。
    2. 在训练集上训练三个不同的多类分类器:逻辑回归 (\(\hat{\eta}_{\text{lin}}\))、随机森林 (\(\hat{\eta}_{\text{rf}}\))、XgBoost (\(\hat{\eta}_{\text{xg}}\))。
    3. 在评估集上,对每个分类器 \(\hat{\eta}_a\),使用本文提出的交叉验证检验(5折,区分器为XgBoost)来计算“GoF拒绝半径”(即最小的 \(\delta\) 使得检验在0.05水平下不拒绝 \(H_0\))。
  • 结果
    • MNIST:逻辑回归准确率0.84,拒绝半径0.15;随机森林准确率0.95,拒绝半径0.12;XgBoost准确率0.95,拒绝半径0.014。
    • Fashion MNIST:逻辑回归准确率0.73,拒绝半径0.16;随机森林准确率0.86,拒绝半径0.070;XgBoost准确率0.87,拒绝半径0.021。
  • 这个例子想说明什么
    • 超越准确率:仅看准确率,随机森林和XgBoost在MNIST上表现相同(0.95)。但GoF检验揭示,XgBoost的拒绝半径(0.014)远小于随机森林(0.12),说明XgBoost的预测分布更接近真实数据分布。这表明GoF检验能提供比准确率更精细的评估信息。
    • 多类适用性:该例子成功展示了方法在多类(10类)和高维(784维)问题上的可行性。

🔎 结论是否比证明窄

  • Theorem 2 的陈述:定理陈述了“在Assumption 1/2下,检验渐近控制第一类错误”。这是一个严格的结论。
  • Corollary 9 的陈述:推论陈述了“如果区分器一致,且 \(\delta^* - \delta_n = \omega(1/\sqrt{n})\),则功效趋近于1”。这是一个严格的结论。
  • 潜在泛化:作者在模拟和真实数据中使用了XgBoost作为区分器,但理论证明只要求区分器满足稳定性条件(Assumption 2.2)。作者在Section 3.4中通过一个稀疏LASSO的例子论证了常见方法在耦合样本下仍然有效,但这只是一个特例分析,并未证明所有满足稳定性条件的区分器都能在耦合样本下工作。因此,“方法适用于任何稳定的区分器”这一结论的严格性,依赖于对“稳定性”的具体验证,这在实践中可能是一个挑战
  • 关于多类扩展:作者声称本文是“唯一一个在多类设定下具有严格保证的检验”。这个结论是严格的,因为其理论框架(从构造第二样本到秩和统计量)天然支持多类。相比之下,BAGofT的多类扩展缺乏理论证明,GRASP则只针对二分类。

四、开放问题(点到为止,扎根具体语句)

  1. 参数调优中的GoF:作者在Discussion中提到:“It would be valuable to understand how to implement cross-validation and the GoF approach together to tune parameters in general classification models.” 这是一个明确的开放问题:如何将本文的GoF检验与交叉验证结合,用于模型选择或超参数调优?扎根于:Section 6, 第一段。

  2. 交叉验证CLT的进一步应用:作者提到:“It would be interesting to see if cross-validated central limit theorems [Lei, 2025] can be used to allow cross-fitting to be used instead of sample splitting for better efficiency.” 虽然本文已经使用了交叉验证,但作者暗示这可能是一个更普遍的技术,可以应用于其他涉及退化U-统计量的推断问题。扎根于:Section 6, 第二段。

  3. 区分器稳定性的更弱条件:本文的交叉验证理论依赖于较强的稳定性假设(Assumption 2.2)。能否在更弱的条件下(如 \(L_2\) 稳定性)建立类似的CLT?这是一个技术性开放问题。扎根于:Assumption 2.2 的具体形式,以及Lei (2025) 中关于稳定性的讨论。

  4. 与模型-X设定的结合:作者在模拟中回避了与GRASP在模型-X设定下的比较。如果研究者有额外的无标签数据(即只有 \(X\),没有 \(Y\)),能否利用这些数据来改进区分器的训练,从而提升检验功效?扎根于:Section 4.1 的Remark,以及GRASP论文中关于模型-X设定下评分函数的讨论。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论