跳转至

Goodness-of-Fit Tests and Calibration Machine-Learning Algorithms for Logistic Regression with Sparse Data

作者: Ebrahim Khaled Ebrahim
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.11140


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在逻辑回归中,当数据是“稀疏的”(即连续型预测变量导致每个观测都有唯一的协变量模式,G ≈ n),如何可靠地检验模型的拟合优度(Goodness-of-Fit, GOF)? 经典的 Pearson 卡方检验和偏差检验(Deviance)依赖于分组数据(G << n)下的大样本渐近卡方分布,但在稀疏数据下,每个协变量模式只有一个观测,期望频数太小,卡方近似失效,导致检验的 I 类错误率失控或功效极低。该方向当前成熟度较高,已有大量替代方法,但缺乏一个在稀疏数据下对所有方法进行系统比较的共识性指南。

发展脉络(history)

  1. 奠基工作:经典检验及其失效

    • Pearson (1900) 和 Nelder & Wedderburn (1972) 提出了经典的 Pearson 卡方和偏差统计量,它们依赖于分组数据下的渐近卡方分布。
    • Farrington (1996) 和 Kuss (2002) 从理论上证明了当 n/G 趋于常数(即稀疏数据)时,这些统计量的渐近卡方分布不再成立。Farrington 指出,当 n/G 趋于有限常数时,渐近卡方分布不成立。Kuss 通过模拟证实,在连续协变量的实际设定中,标准检验(如 Pearson 和偏差检验)不能直接使用。
  2. 主要进展:替代方法的涌现(1980s-2010s)

    • 分组法(Grouping-Based):Hosmer Jr and Lemeshow (1980) 提出了经典的 Hosmer-Lemeshow (HL) 检验,通过按预测概率分位数分组(如十分位)来恢复卡方近似。这是最广泛使用的替代方法,但作者自己也指出其对分组数敏感,且可能遗漏某些类型的失拟。
    • 标准化法(Standardization-Based):Osius and Rojek (1992) 和 McCullagh (1985) 提出了对 Pearson 统计量进行标准化,使其渐近服从标准正态分布,从而避免了对分组的依赖。作者声称这些方法在稀疏数据下比 HL 检验更稳健。
    • 得分检验法(Score-Based):Tsiatis (1980) 和 Stukel (1988) 提出了基于得分(Score)的检验,通过检验在模型中添加特定项(如分组指示变量、非线性项)是否显著来检测失拟。这些方法不需要拟合完整的备择模型。
    • 平滑法(Smoothing-Based):Le Cessie and van Houwelingen (1991, 1995) 提出了基于核平滑残差的检验,避免了任意分组,能检测局部失拟。作者指出该方法对带宽参数敏感。
    • 校准法(Calibration-Based):Spiegelhalter (1986) 提出了基于 Brier 分数的 z 检验,直接评估预测概率与观测结果的一致性。Nattino, Finazzi, et al. (2014, 2016) 提出了 GiViTI 校准检验,使用数据驱动的多项式校准曲线,并提供了图形诊断工具(校准带)。
    • 重抽样法(Resampling-Based):Stute and Zhu (2002) 提出了基于累积残差过程的 Cramér-von Mises 型检验,其渐近分布复杂,依赖于模型引导(Model-Based Bootstrap)来计算 p 值。
  3. 当前 Frontier 与本文位置

    • 当前 frontier 是开发对特定类型失拟(如遗漏交互项、非线性项)更敏感、且在大样本下不会因“统计过强”(overpowering)而拒绝实际可接受模型的检验。例如,Nattino, Pennell, et al. (2020) 的 mHL large 检验和 Lai and L. Liu (2018) 的标准化 HL 检验都试图解决大样本下的过强问题。
    • 本文的位置:本文是一篇综述性模拟研究,系统比较了约 30 种 GOF 检验和机器学习校准算法在稀疏数据下的表现。它没有提出新方法,而是试图在 Hosmer et al. (1997) 的经典模拟框架下,为应用研究者提供一个关于“哪些检验在稀疏数据下表现最好”的全面、更新的指南。

子线索聚类

  1. 分组法:核心思想是通过分组恢复卡方近似。包括 Hosmer-Lemeshow 及其变体(等宽、大样本修正、Pigeon-Heyse 修正)、Pulkstenis-Robinson 检验(针对混合协变量)、Xie 检验(基于协变量空间聚类)。这些方法简单易用,但性能高度依赖于分组策略。
  2. 标准化法:核心思想是直接对 Pearson 统计量进行标准化,使其渐近服从正态分布,避免分组。包括 Osius-Rojek 检验、McCullagh 检验、Farrington 检验。这些方法理论上更适用于稀疏数据,但计算可能更复杂。
  3. 得分与似然法:核心思想是基于似然函数或其导数构造检验。包括 Tsiatis 得分检验、Stukel 得分检验(针对链接函数)、信息矩阵(IM)检验。这些方法通常针对特定形式的失拟,具有较高的针对性。
  4. 平滑法与校准法:核心思想是使用非参数或半参数技术来评估模型拟合。包括 Le Cessie-van Houwelingen 平滑残差检验、Copas 未加权平方和检验、GiViTi 校准检验、Spiegelhalter z 检验、Unreliability (U) 检验。这些方法通常更灵活,能检测更复杂的失拟模式,但计算成本可能更高。
  5. 重抽样法:核心思想是使用 Bootstrap 来近似检验统计量的零分布,避免对渐近分布的依赖。包括 Stute-Zhu 检验、投影检验、BAGofT 检验。这些方法通常计算量巨大,但能处理渐近分布复杂或未知的情况。

这个方向在追问的核心问题

  1. 在稀疏数据下,哪个(或哪些)检验能同时控制好 I 类错误率并具有高功效?
  2. 不同检验对不同类型的模型失拟(如遗漏非线性项 vs. 遗漏交互项)的敏感性如何?
  3. 样本量如何影响这些检验的性能?是否存在“统计过强”问题,即大样本下检验会拒绝实际可接受的模型?
  4. 如何将形式化的统计检验与图形化诊断工具(如校准图)结合起来,以获得更可靠的模型评估?

⚠️ 作者的 framing

  • 作者的缺口框架:作者将缺口 frame 成“尽管已有大量 GOF 检验,但在稀疏数据下,没有一个被广泛接受的‘最佳’检验,且应用研究者对哪些检验表现最好缺乏共识”。因此,本文的定位是“一个全面的、系统的模拟比较研究”,旨在为实践者提供选择指南。
  • 被淡化或回避的竞争路线:作者明确承认并排除了许多“不适用”的检验,如 Farrington 检验(在完全稀疏数据下功效为零)、PR 检验(需要分类变量)、投影检验(计算成本过高)。这实际上回避了这些方法在特定条件下的潜在价值。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:作者在引言中提到了 Hosmer et al. (1997) 的经典模拟框架,但并未提及该框架的局限性,例如它依赖于独立同分布(IID)数据、低维设定,且未考虑高维或聚类数据。此外,作者未引用任何关于“统计-计算权衡”或“高维逻辑回归 GOF 检验”的文献,这暗示本文的 scope 严格限制在经典的低维、IID 设定下。

张力

未见明显对立引用。所有被引工作都承认稀疏数据下经典检验失效,并致力于提出替代方案。主要差异在于不同方法对“最佳”的定义(如控制 I 类错误 vs. 最大化功效 vs. 计算可行性)以及它们对特定类型失拟的敏感性。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • Y_i ∈ {0, 1}:第 i 个观测的二元结果变量(可观测)。
    • x_i ∈ ℝ^p:第 i 个观测的 p 维协变量向量(可观测)。
    • β ∈ ℝ^p:逻辑回归模型的回归系数向量(待估参数)。
    • π_i = P(Y_i = 1 | x_i) = exp(x_i'β) / (1 + exp(x_i'β)):给定协变量下结果为 1 的概率(模型定义的潜在量)。
    • ˆπ_i:基于 MLE 估计 ˆβ 得到的预测概率。
    • n:样本量。
    • G:唯一协变量模式(covariate pattern)的数量。在稀疏数据下,G ≈ n。
    • m_g:第 g 个协变量模式中的观测数。在稀疏数据下,m_g = 1。
    • o_g:第 g 组中观测到的事件数。
    • e_g:第 g 组中期望的事件数。
  • 模型:

    • 数据生成机制:Y_i | x_i ~ Bernoulli(π_i),其中 π_i 与 x_i 的关系由逻辑函数 logit(π_i) = x_i'β 定义。
    • 统计模型:我们假设一个参数化的逻辑回归模型 M_0: logit(π_i) = x_i'β。目标是检验这个模型是否正确地描述了数据。
    • 已知/未知:x_i 和 Y_i 是可观测的。β 是待估的。π_i 是模型隐含的潜在量。
  • 可观测数据:

    • 研究者实际能观测到的是 {(Y_i, x_i)}_{i=1}^n,即 n 个独立的 (结果, 协变量) 对。
    • 想要但观测不到的量:真实的概率 π_i 是观测不到的。我们只能通过模型估计它。检验的零假设 H_0 就是模型正确,即 E[Y_i | x_i] = π(x_i, β) 对某个真实的 β 成立。

第二步:讲最小内核

本文的核心是比较不同检验在稀疏数据下的表现。其最小内核可以简化为一个最简单的特例:只有一个连续协变量 x 的逻辑回归模型。

  • 最简特例设定:

    • 数据:{(Y_i, x_i)}_{i=1}^n,其中 x_i 是连续变量(如从 U(-3, 3) 中抽取),Y_i 由真实的逻辑模型生成。
    • 真实模型(备择假设 H_1):logit(π_i) = β_0 + β_1 x_i + β_2 x_i^2(包含二次项)。
    • 拟合模型(零假设 H_0):logit(π_i) = β_0 + β_1 x_i(错误地省略了二次项)。
    • 问题:我们拟合了错误的线性模型,现在想用各种 GOF 检验来检测这个错误。
  • 在这个特例下,核心思路是什么?

    • 经典检验(Pearson/Deviance):计算 X^2 = Σ (Y_i - ˆπ_i)^2 / [ˆπ_i(1-ˆπ_i)]。由于每个 x_i 都不同,X^2 的渐近分布不是 χ²(n-p),导致检验失效(I 类错误率失控或功效极低)。
    • 分组法(HL 检验):将观测按 ˆπ_i 排序,分成 G=10 组。在每组内,计算 o_g 和 e_g,然后计算 Ĉ = Σ (o_g - e_g)² / [n_g ˆπ_g (1-ˆπ_g)]。这个统计量近似服从 χ²(G-2)。它通过分组“创造”了足够的期望频数,恢复了卡方近似的有效性。
    • 标准化法(Osius-Rojek 检验):计算 Z = (X² - (n-p)) / √(A + RSS),其中 A 和 RSS 是通过一个辅助加权回归计算出的方差校正项。这个 Z 统计量渐近服从 N(0,1)。它不依赖分组,而是直接校正了稀疏数据下 X² 的均值和方差。
    • 平滑法(Le Cessie-van Houwelingen 检验):计算平滑残差 T = (1/n) Σ r_s(x_i)² v(x_i),其中 r_s(x_i) 是核平滑后的 Pearson 残差。这个统计量检测的是残差中是否存在局部模式,而不是全局的偏差。
    • 校准法(GiViTi 检验):拟合一个多项式校准模型 logit(P(Y=1)) = γ_0 + γ_1 logit(ˆπ) + γ_2 [logit(ˆπ)]² + ...,然后检验 H_0: γ_0=0, γ_1=1, γ_2=...=0。它通过一个更灵活的模型来捕捉预测概率与真实概率之间的非线性关系。
  • 这个特例揭示了什么?

    • 在这个最简单的例子中,所有检验都在试图回答同一个问题:“拟合的线性模型是否遗漏了 x² 项?”
    • 不同检验的“答案”取决于它们如何定义“失拟”。HL 检验看的是分组后的平均偏差;Osius-Rojek 检验看的是整体 Pearson 统计量的异常;平滑法看的是残差的局部聚集;校准法看的是预测概率与真实概率之间的函数关系。
    • 本文的模拟研究就是系统地改变 β_2 的大小(从“轻微”到“显著”),并观察不同检验在多大样本量下能可靠地检测出这个遗漏项。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:系统比较了约 30 种统计检验和机器学习校准算法在稀疏数据(连续协变量导致 G ≈ n)下,对二元逻辑回归模型拟合优度进行检验时的性能。
  2. 核心工具 / 方法:采用 Hosmer et al. (1997) 的经典模拟框架,在多种协变量分布、样本量(200-5000)和模型失拟类型(遗漏二次项、遗漏交互项)下,评估各检验的经验 I 类错误率和经验功效。
  3. 主要结论:在固定显著性水平下,GiViTi 校准检验 (2016)、McCullagh (1989)、Osius-Rojek (1992)、Le Cessie (1995) 和 Stute-Zhu (2002) 检验在平衡高检验功效与正确 I 类错误率方面表现最佳。论文强调仅依赖形式检验不足,校准图等可视化诊断是检测模型缺陷的关键探索步骤。

关键设定与假设

  • 核心记号:已在第二节交代清楚。
  • 关键假设:
    • 独立性:观测 Y_i 在给定 x_i 下是独立的。
    • 模型正确性(零假设下):logit(P(Y_i=1|x_i)) = x_i'β 是真实的数据生成机制。
    • 稀疏数据:G ≈ n,即每个观测都有唯一的协变量模式。这是本文关注的核心设定。
    • 失拟类型:模拟中考虑的失拟类型包括遗漏二次项和遗漏交互项。作者没有考虑链接函数误设(如 Stukel 检验的目标)或高维设定。
  • 相比已有文献的强化/放宽:
    • 强化:相比 Hosmer et al. (1997) 只考虑 n=200, 500,本文将样本量扩展到 n=200, 500, 1000, 2000, 5000,更全面地展示了样本量对检验性能的影响。
    • 放宽:本文没有提出新的理论,而是对现有方法进行了更广泛的实证比较,包括了更多现代方法(如 GiViTi, eHL, BAGofT)。

主要结果

  • I 类错误率控制:

    • 表现良好:Osius-Rojek, McCullagh, Stute-Zhu, Copas 未加权检验在几乎所有场景下都能将 I 类错误率控制在名义水平(5%)附近。
    • 过于保守:Spiegelhalter z 检验和 eHL 检验的 I 类错误率几乎为零,表明它们过于保守,可能缺乏功效。
    • 过于宽松(Liberal):Pearson 和 Deviance 检验(未分组)的 I 类错误率严重膨胀,尤其是在稀疏数据下。HL F 检验的 I 类错误率接近 100%,完全不可用。
  • 功效分析:

    • 遗漏二次项(轻微):这是最困难的场景。McCullagh 检验、Le Cessie 检验和 Stute-Zhu 检验表现出最高的功效,但即使在 n=5000 时,功效也远未达到 100%。
    • 遗漏二次项(显著):大多数检验在 n≥1000 时功效接近 100%。McCullagh 检验和 Osius-Rojek 检验在较小样本量(n=200)下也表现出色。
    • 遗漏交互项(轻微):与遗漏二次项类似,McCullagh 检验、Le Cessie 检验和 Stute-Zhu 检验表现最佳。
    • 遗漏交互项(显著):几乎所有检验在 n≥1000 时功效都很高。McCullagh 检验在 n=200 时功效超过 70%,表现突出。
  • 真实数据例子(低出生体重数据集):

    • 数据:Hosmer et al. (1997) 使用的经典低出生体重数据集(n=188),包含母亲年龄、体重、种族、吸烟状况等变量。
    • 方法:拟合一个包含主效应的逻辑回归模型,然后应用所有 GOF 检验。之后,在模型中添加 年龄×体重 和 吸烟×体重 交互项,再次应用所有检验。
    • 结果:
      • 初始模型:大多数检验(包括 HL, Osius-Rojek, GiViTi)的 p 值 > 0.05,未能拒绝模型。但图形诊断(校准带、RMS 可靠性图)暗示可能存在非线性或遗漏交互项。
      • 修正模型:添加交互项后,图形诊断显示校准得到改善。大多数检验的 p 值上升,表明模型拟合更好。但分组 Deviance 检验和 Farrington 检验在修正后仍然拒绝模型,表明它们可能对某些残留失拟过于敏感。
    • 这个例子想说明什么:它生动地展示了形式检验与图形诊断之间的不一致性。仅仅依赖 p 值可能得出错误结论。一个全面的模型评估需要结合多种统计检验和可视化工具。

证明路线与技术技巧

本文是模拟研究,没有理论证明。其“证明路线”是模拟设计本身。

  • 整体路线:

    1. 数据生成:根据预设的“真实模型”(如包含二次项)生成数据。
    2. 模型拟合:拟合一个“错误模型”(如省略二次项)。
    3. 检验计算:对每个检验,计算其统计量和 p 值。
    4. 结果记录:记录该检验是否在 α=0.05 水平下拒绝零假设。
    5. 重复:对每个场景重复 10,000 次。
    6. 汇总:计算每个检验的拒绝率,作为 I 类错误率(当真实模型与拟合模型一致时)或功效(当不一致时)。
  • 关键跳跃点:没有理论跳跃点。模拟的关键在于精心设计的场景,这些场景能够区分不同检验对特定类型失拟的敏感性。

  • 技术技巧点名:

    • 经验 I 类错误率与功效:这是模拟研究的核心指标。
    • 热力图(Heatmap):用于可视化不同检验在不同样本量下的 I 类错误率和功效,使比较一目了然。
    • 模型引导 Bootstrap(Model-Based Bootstrap):用于 Stute-Zhu 检验和投影检验,以近似其复杂的零分布。
    • 数据分裂(Data Splitting):用于 BAGofT 检验,将数据分为训练集和测试集,以避免过拟合。
    • 自适应分区(Adaptive Partitioning):用于 BAGofT 检验,通过决策树等方法自动寻找能最大化观测与拟合值差异的分区。

🔎 结论是否比证明窄

  • 是。作者的结论“GiViTi, McCullagh, Osius-Rojek, Le Cessie, Stute-Zhu 检验表现最佳”是基于特定模拟设定(低维、IID、特定类型的失拟)得出的。作者在“方法论局限性”(Section 6.5)中明确承认了这一点,指出研究“依赖于独立同分布(IID)数据”、“关注低维经典逻辑回归”,且“可能无法直接解决高维、惩罚或聚类数据设定中出现的更现代问题”。因此,结论的适用范围比模拟本身要窄。例如,对于高维逻辑回归或存在复杂聚类结构的数据,这些结论可能不成立。

四、开放问题

  1. 高维设定下的 GOF 检验:本文所有模拟都在低维(p 很小)下进行。当 p 接近甚至大于 n 时,这些检验(尤其是基于 Pearson 统计量的)的渐近行为会如何变化?是否存在类似“统计-计算权衡”的问题?扎根点:Section 6.5 "Methodology Limitations" 提到“可能无法直接解决高维...数据设定”。

  2. 对更复杂失拟类型的敏感性:本文只考虑了遗漏二次项和交互项。对于更复杂的失拟,如链接函数误设(Stukel 检验的目标)、异方差性或聚类效应,这些检验的表现如何?扎根点:Section 5.3.3 "Link Function Misspecification" 提到“链接函数误设...超出了本研究的范围”。

  3. “统计过强”问题的统一解决方案:本文提到了 Nattino 的 mHL large 和 Lai & Liu 的标准化 HL 检验来解决大样本下的过强问题,但并未将它们与其他检验(如 GiViTi)进行系统比较。是否存在一个统一的框架来调整所有 GOF 检验,使其在大样本下仍能保持有意义的检验水平?扎根点:Section 3.7 "Nattino mHL large" 和 Section 4.3.8 "The Lai & Liu Standardized Power Procedure" 分别提出了解决方案,但未进行横向比较。

  4. 计算成本与可扩展性:投影检验和 BAGofT 检验虽然理论上强大,但计算成本极高。在“大数据”时代,如何设计既能保持高功效又能高效计算的 GOF 检验?扎根点:Section 5.7 "Liberal and Zero Power Tests" 提到“投影检验需要极高的计算资源,使其在大规模模拟研究中不可行”。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论