跳转至

Classification testing: A new framework for drawing qualitative conclusions from quantitative estimates

作者: Andrew C. Eggers, Zikai Li
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.23315


一、领域脉络与小综述

这个方向是什么

本文提出的“分类检验”(classification testing)是一个替代传统单一假设检验的统计推断框架。其根本问题是:当研究者希望从定量估计(如平均处理效应)中得出定性结论(如“效应为正”、“效应可忽略”)时,如何以可控的错误率(如I类错误)做出这种定性判断?传统假设检验只能对单一备择假设(如“效应不为零”)提供错误控制,而无法对多个竞争性定性结论(如“效应为正”或“效应为负”)同时提供错误控制。分类检验通过将参数空间划分为多个有实质意义的“类别”,并设计接受域,使得将估计量错误分配到任何类别的概率被控制在预设水平α以下。

发展脉络

本文的introduction和参考文献勾勒出一条清晰的线索:

  • 奠基工作:Neyman-Pearson假设检验框架(未直接引用,但作为隐含背景)奠定了频率学派错误控制的基础。Cox et al. (1977) 在讨论中提出,双尾检验的结果可以实用地分为上临界区、下临界区和中间区,其中中间区表示“数据本身不能提供关于符号的明确证据”(p. 51)。这已隐含了分类检验的思想雏形。

  • 主要进展:

  • 等价检验(Equivalence Testing):Schuirmann (1987) 提出TOST(Two One-Sided Tests)程序,用于检验效应是否可忽略(即|θ| < δ)。Rainey (2014)、Lakens (2017a)、Hartman and Hidalgo (2018) 将其引入社会科学,用于支持“效应可忽略”的结论。但TOST只能对“可忽略”提供错误控制,不能对“不可忽略”提供错误控制。
  • 方向性双尾检验(Directional Two-Sided Test):Kaiser (1960) 和 Jones & Tukey (2000) 提出,在双尾检验中,如果估计量落在上尾,可声明“效应为正”;落在下尾,可声明“效应为负”;落在中间,则无结论。这本质上是符号分类检验。Rice & Krakauer (2023) 在《Annual Review of Statistics and Its Application》上对此进行了综述。
  • 分区原则(Partitioning Principle):Finner & Strassburger (2002) 在《The Annals of Statistics》上提出,将参数空间划分为互斥的备择假设,对每个备择假设的补集进行检验,若拒绝则接受该备择假设,可控制族系错误率(FWER)而无需多重性校正。本文明确指出其框架是分区原则的一个实例。
  • 三面假设检验(Three-Sided Hypothesis Testing):Goeman et al. (2010) 提出同时检验“优效性”、“等价性”和“劣效性”的三面检验。Isager & Fitzgerald (2024) 和 Riffenburgh & Wang (2025) 也有类似工作。本文指出其符号-幅度分类检验与三面检验相关,但更优(更powerful)。

  • 当前前沿与本文位置:当前实践的主流仍是Wald-style的零假设显著性检验(NHST),其核心不对称性——只能拒绝零假设(从而支持备择假设),不能拒绝备择假设(从而支持零假设)——已被广泛批评(Gigerenzer et al. 2004; McShane et al. 2019)。本文声称,分类检验通过允许对任何类别进行错误控制,解决了这种不对称性,并且比现有方法(如TOST、三面检验)更优(更powerful或更灵活)。

子线索聚类

  1. 等价检验与效应量检验:Schuirmann (1987), Rainey (2014), Lakens (2017a), Hartman & Hidalgo (2018), Berger & Hsu (1996), Romano (2005), Wellek (2010)。这一簇关注如何以错误控制的方式声明效应“可忽略”或“非劣效”。本文的幅度分类检验属于这一簇,但声称比TOST更powerful(因为TOST是conservative的),且能同时声明“不可忽略”。

  2. 多结论检验与分区原则:Kaiser (1960), Jones & Tukey (2000), Finner & Strassburger (2002), Goeman et al. (2010), Rice & Krakauer (2023), Isager & Fitzgerald (2024), Riffenburgh & Wang (2025)。这一簇关注如何从单一估计中得出多个可能的错误控制结论。本文的符号分类检验和符号-幅度分类检验属于这一簇,并声称其符号-幅度检验比Goeman et al. (2010) 更powerful。

  3. 对NHST的批判与替代:Gigerenzer et al. (2004), Gill (1999), McShane et al. (2019), Nickerson (2000), Rosnow & Rosenthal (1992), Cumming (2014), Greenland et al. (2016), Edlin & Love (2022)。这一簇主要批判NHST的误用和局限性,倡导更连续的推理(如置信区间、估计文化)。本文认同这些批判,但认为定性结论不可避免,因此提出分类检验作为替代。

核心问题与瓶颈

  • 核心问题1:如何从定量估计中得出定性结论,同时控制错误率?
  • 核心问题2:如何解决传统假设检验中“只能拒绝零假设,不能拒绝备择假设”的不对称性?
  • 核心问题3:当有多个竞争性定性结论时,如何以错误控制的方式在其中做出选择?
  • 当前瓶颈:传统NHST的不对称性导致研究者只能为“研究假设”提供错误控制,而无法为“零假设”或“竞争假设”提供错误控制。等价检验(TOST)部分解决了“声明可忽略”的问题,但它是conservative的(实际错误率低于名义水平),且不能同时声明“不可忽略”。三面检验(Goeman et al. 2010)允许三种结论,但其阈值固定(不随σ/δ变化),导致在某些情况下不是最优的。

⚠️ 作者的framing

作者将缺口框架为:传统假设检验的不对称性(只能拒绝零假设,不能拒绝备择假设)是根本问题,而分类检验通过允许对任何类别进行错误控制来解决这个问题。作者声称,分类检验在以下方面优于现有实践: - 当目标是裁决竞争性假设时,分类检验允许研究者直接描述这些可能性,而不是人为指定一个为研究假设。 - 当目标是检验单一假设时,分类检验使该假设面临被证伪的风险(而不仅仅是未被确认)。 - 幅度分类检验比TOST更powerful(因为TOST是conservative的),且能同时声明“不可忽略”。 - 符号-幅度分类检验比Goeman et al. (2010) 的三面检验更powerful。

被淡化或回避的竞争路线: - 贝叶斯方法:作者完全回避了贝叶斯假设检验(如贝叶斯因子、后验概率)。贝叶斯方法天然允许对多个假设进行概率赋值,且没有频率学派的不对称性问题。作者可能认为频率学派错误控制在社会科学中仍是标准,因此选择在频率学派框架内改进。 - 置信区间与估计文化:作者承认Cumming (2014) 和 McShane et al. (2019) 倡导的“估计文化”,但认为定性结论不可避免,因此分类检验是对这种文化的补充而非替代。然而,作者没有深入讨论分类检验与置信区间在信息量上的权衡——分类检验只输出一个类别,而置信区间提供了连续的信息。

什么明显该被引/该存在、却没出现在intro里? - 决策理论框架:分类检验本质上是一个统计决策问题(将参数空间划分为行动空间,并定义损失函数)。Wald的统计决策理论(Wald, 1950)是更一般的框架,但未被引用。作者可能认为决策理论对应用研究者过于抽象。 - 多重假设检验中的“选择”与“断言”:Benjamini & Hochberg (1995) 的FDR控制被引用(在附录中),但未在intro中提及。分类检验与FDR控制的关系(如如何将分类p值用于FDR控制)是附录的内容,但intro未强调这一点。 - “无结论”区域的统计性质:分类检验允许“无结论”结果,这与“不拒绝零假设”在传统检验中的含义有微妙区别。作者在Section 2.3中讨论了这一点,但未引用关于“无结论”或“不可判定”结果的统计文献(如“三决策问题”的早期工作)。

张力

未见明显对立引用。所有被引工作基本都认同NHST存在缺陷,并试图改进。主要差异在于改进方向:等价检验关注“可忽略”结论,分区原则关注多结论控制,三面检验关注三种结论。本文试图统一这些方向。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型与可观测数据

  • 符号:
  • θ:标量估计量(estimand),如平均处理效应(ATE)。这是研究者想要推断的未知参数。
  • ̂θ:θ的估计量(estimator),如样本均值或回归系数。这是可观测的。
  • σ:̂θ的标准误(standard error),可能未知但可被一致估计。
  • ̂σ:σ的一致估计量。这是可观测的。
  • α:显著性水平(significance level),即允许的最大错误分类概率。通常取0.05。
  • δ:幅度分类中的阈值,用于定义“可忽略”效应的大小(如Cohen's d = 0.15)。这是研究者根据领域知识预设的。
  • C₁, C₂, ..., C_K:参数空间Θ的互斥划分,每个C_j对应一个定性类别(如“正”、“负”、“可忽略”)。
  • A₁, A₂, ..., A_K:接受域(acceptance regions),即̂θ的取值区间。如果̂θ ∈ A_j,则声明θ ∈ C_j。
  • z_{1-α}:标准正态分布的1-α分位数,即Φ⁻¹(1-α)。例如,α=0.05时,z_{0.95} ≈ 1.645。
  • Φ(·):标准正态分布的累积分布函数(CDF)。
  • φ(·):标准正态分布的概率密度函数(PDF)。

  • 模型:

  • 数据生成机制:̂θ ~ N(θ, σ²)(渐近正态)。这是社会科学应用中的标准假设,基于中心极限定理或M估计理论。
  • 已知:̂θ和̂σ是可观测的。σ未知但可被̂σ一致估计。
  • 要估的对象:θ的真实值属于哪个类别C_j。

  • 可观测数据:

  • 可观测:̂θ(点估计)和̂σ(标准误估计)。例如,在回归分析中,̂θ是回归系数,̂σ是其标准误。
  • 潜在/不可观测:θ的真实值。σ的真实值(但̂σ是其一致估计)。
  • 关键假设:̂θ的渐近正态性,以及̂σ的一致性。这是所有频率学派推断的基础。

第二步:最小内核——符号分类检验

最简特例:假设我们只关心θ的符号(正或负),且只有一个边界点0。这是分类检验中最简单的情况,也是Kaiser (1960) 和 Jones & Tukey (2000) 提出的“方向性双尾检验”。

设定: - 参数空间Θ = ℝ。 - 类别:C⁻ = (-∞, 0](“负或零”),C⁺ = (0, ∞)(“正”)。 - 可观测数据:̂θ ~ N(θ, σ²),σ已知(为简化,先假设已知;实际中可用̂σ代替)。 - 目标:以错误率≤ α 声明θ ∈ C⁻ 或 θ ∈ C⁺。

核心思路: 传统单尾检验只能拒绝H₀: θ ≤ 0(从而声明θ > 0),但不能拒绝H₀: θ > 0(从而声明θ ≤ 0)。分类检验通过同时运行两个单尾检验来解决这个问题: - 检验1:H₀: θ ≤ 0 vs H₁: θ > 0。如果̂θ ≥ z_{1-α}σ,则拒绝H₀,声明θ ∈ C⁺。 - 检验2:H₀: θ > 0 vs H₁: θ ≤ 0。如果̂θ ≤ -z_{1-α}σ,则拒绝H₀,声明θ ∈ C⁻。 - 如果|̂θ| < z_{1-α}σ,则两个检验都无法拒绝,结果为“无结论”。

为什么不需要多重性校正? 因为两个检验是互斥的:如果检验1拒绝(̂θ ≥ z_{1-α}σ),则检验2必然不拒绝(因为̂θ > 0,不满足̂θ ≤ -z_{1-α}σ)。反之亦然。因此,在θ = 0(最坏情况)下,错误分类的概率恰好是α(因为只有一侧的检验可能错误拒绝)。这符合分区原则(Finner & Strassburger 2002)。

等价于1-2α置信区间规则: 符号分类检验等价于:如果1-2α置信区间(̂θ ± z_{1-α}σ)完全落在C⁺内(即下界 > 0),则声明θ ∈ C⁺;如果完全落在C⁻内(即上界 < 0),则声明θ ∈ C⁻;否则无结论。这是因为: - ̂θ - z_{1-α}σ > 0 ⇔ ̂θ > z_{1-α}σ(声明正)。 - ̂θ + z_{1-α}σ < 0 ⇔ ̂θ < -z_{1-α}σ(声明负)。

这个例子说明了什么? 它展示了分类检验的核心思想:通过对称地对待所有类别,允许对任何类别进行错误控制,从而解决了传统检验的不对称性。它也是更复杂分类检验(幅度、符号-幅度)的构建基础。

三、这篇论文做了什么

三句话

  1. 研究问题:本文提出“分类检验”(classification testing)框架,作为传统单一假设检验的替代,允许研究者从定量估计中得出定性结论(如“效应为正”、“效应可忽略”),并控制错误分类率。
  2. 核心工具/方法:将参数空间划分为多个有实质意义的类别,设计接受域(acceptance regions),使得将估计量错误分配到任何类别的概率被控制在预设水平α以下。采用最大最小(maximin)准则选择最优接受域。
  3. 主要结论:分类检验在以下方面优于传统实践:(a) 符号分类检验等价于两个单尾检验,无需多重性校正;(b) 幅度分类检验比TOST更powerful(实际错误率更接近名义水平),且能同时声明“不可忽略”;(c) 符号-幅度分类检验比Goeman et al. (2010)的三面检验更powerful。通过一个实地实验数据(Broockman & Kalla 2025)展示了框架的应用。

关键设定与假设

  • 设定:标量估计量θ,估计量̂θ渐近正态:̂θ ~ N(θ, σ²),其中σ可被一致估计。
  • 假设:
  • 渐近正态性:̂θ的抽样分布是渐近正态的。这是社会科学应用中的标准假设,基于中心极限定理或M估计理论。
  • 一致标准误估计:̂σ是σ的一致估计。这保证了渐近有效性。
  • 参数空间划分:研究者根据领域知识将Θ划分为互斥的类别C₁, ..., C_K。划分必须是有实质意义的、逻辑完备的。
  • 错误控制目标:对于所有θ ∈ C_j,将θ错误分类到任何其他类别的概率不超过α。即sup_θ P_θ(错误分类) ≤ α。
  • 最大最小准则:在满足错误控制约束的所有分类规则中,选择最大化“最坏情况下的正确分类概率”(即所有类别中正确分类概率的最小值)的规则。

与已有文献的比较: - 相比传统NHST:分类检验允许对任何类别进行错误控制,而不仅仅是备择假设。 - 相比TOST:幅度分类检验的接受域是直接校准的(使边界处的错误率恰好为α),而TOST是conservative的(实际错误率低于α)。此外,分类检验允许声明“不可忽略”,而TOST不能。 - 相比Goeman et al. (2010)的三面检验:符号-幅度分类检验的阈值(z_dir, z_eq)依赖于σ/δ(即估计精度),而Goeman et al.使用固定阈值(z_{1-α/2}和z_{1-α})。本文声称其方法更powerful,因为固定阈值只在特定σ/δ值下最优。

主要结果

  1. 符号分类检验(Proposition 3):
  2. 接受域:A⁻ = (-∞, -z_{1-α}σ],A⁺ = [z_{1-α}σ, ∞)。
  3. 最优性:在满足错误控制约束的所有规则中,该规则最大化最坏情况下的正确分类概率(即maximin最优)。
  4. 等价于1-2α置信区间规则:如果1-2α CI完全落在C⁻或C⁺内,则分类。

  5. 幅度分类检验(Proposition 4):

  6. 类别:C₀ = (-δ, δ)(“可忽略”),C_± = (-∞, -δ] ∪ [δ, ∞)(“不可忽略”)。
  7. 接受域:A₀ = (-b, b),A_± = (-∞, -a] ∪ [a, ∞),其中(a, b)由以下方程唯一确定:
    • P_{θ=δ}(̂θ ∈ A_±) = α(控制将边界“可忽略”误分类为“不可忽略”的概率)。
    • P_{θ=δ}(̂θ ∈ A₀) = α(控制将边界“不可忽略”误分类为“可忽略”的概率)。
  8. 最优性:该规则是maximin最优的。
  9. 与TOST的比较:当σ/δ较小时,TOST的接受域与分类检验的A₀近似相同;但当σ/δ较大时,TOST的接受域消失(即无法声明“可忽略”),而分类检验的A₀始终存在。此外,分类检验的A_±允许声明“不可忽略”,而TOST不能。

  10. 符号-幅度分类检验(Proposition 5):

  11. 类别:C₀ = (-δ, δ)(“可忽略”),C⁻ = (-∞, -δ](“负且不可忽略”),C⁺ = [δ, ∞)(“正且不可忽略”)。
  12. 接受域:A⁺ = [δ + z_dir σ, ∞),A⁻ = (-∞, -δ - z_dir σ],A₀ = (-δ + z_eq σ, δ - z_eq σ),其中(z_dir, z_eq)由以下方程唯一确定:
    • P_{θ=δ}(̂θ ∈ A⁺ ∪ A⁻) = α(控制将边界“可忽略”误分类为“正/负且不可忽略”的概率)。
    • P_{θ=δ}(̂θ ∈ A₀ ∪ A⁻) = α(控制将边界“正且不可忽略”误分类为“可忽略”或“负且不可忽略”的概率)。
  13. 最优性:该规则是maximin最优的。
  14. 与Goeman et al. (2010)的比较:本文的阈值(z_dir, z_eq)依赖于σ/δ,而Goeman et al.使用固定阈值(z_{1-α/2}和z_{1-α})。附录E.1的模拟显示,本文方法在控制错误率的同时,正确分类概率(weakly)优于Goeman et al.的方法。

  15. 渐近有效性(Proposition 6):

  16. 当标准误估计量̂σ一致时,使用̂σ代替σ的plug-in程序渐近地控制错误率:sup_θ P_θ(错误分类) → α(依概率)。

  17. 多重检验的组合(Section 6):

  18. 当多个分类检验的结果可以组合时,只有当每个边界来自一个半有界声明(如符号检验的“正”或“负”,或符号-幅度检验的“正且不可忽略”)时,组合后的错误控制才成立。如果边界来自“可忽略”声明或幅度检验的声明,则组合后的错误控制不成立。

证明路线与技术技巧

整体路线(以符号-幅度检验为例,Proposition 5):

  1. 对称性约化:利用问题在θ → -θ下的反射不变性,将接受域限制为对称形式:A⁺ = [δ + z_dir σ, ∞),A⁻ = (-∞, -δ - z_dir σ],A₀ = (-δ + z_eq σ, δ - z_eq σ)。这减少了自由参数。
  2. 单调性分析:证明每个类别的正确分类概率在θ上是单调的,因此其下确界(infimum)在类别边界处达到。例如,对于C⁺,P_θ(̂θ ∈ A⁺)在θ上递增,下确界在θ = δ处。
  3. 错误控制约束:将全局错误控制约束转化为两个边界约束:
  4. 在θ = δ(从C₀侧逼近):P_θ(̂θ ∈ A⁺ ∪ A⁻) ≤ α。
  5. 在θ = δ(从C⁺侧逼近):P_θ(̂θ ∈ A₀ ∪ A⁻) ≤ α。
  6. 最大最小优化:目标函数W = min{inf_{θ∈C⁺} P_θ(̂θ ∈ A⁺), inf_{θ∈C₀} P_θ(̂θ ∈ A₀)}。由于对称性,inf_{θ∈C⁻} P_θ(̂θ ∈ A⁻) = inf_{θ∈C⁺} P_θ(̂θ ∈ A⁺)。在错误控制约束下,最大化W等价于使两个边界约束同时取等号(即达到α)。
  7. 唯一解的存在性:证明存在唯一的(z_dir, z_eq)使得两个边界约束同时取等号。这通过中间值定理和单调性完成。

关键跳跃点: - 从全局约束到边界约束:证明错误分类概率在θ上的最大值出现在类别边界处(Proposition 1)。这是整个证明的基础,它将无限维的约束(对所有θ)简化为有限个边界点约束。 - 最大最小准则的适用性:当存在多个类别时,不存在一致最优势(UMP)检验。作者采用最大最小准则,并证明最优规则使所有边界约束同时取等号。这需要证明在最优解处,所有类别的“最坏情况正确分类概率”相等。 - 符号-幅度检验中两个约束的耦合:与幅度检验不同,符号-幅度检验中,在θ = δ(从C⁺侧逼近)时,错误分类包括A₀和A⁻两部分。这导致z_dir和z_eq通过P⁻(z_dir)耦合。作者通过两步法求解:先由第一个约束解出z_dir,再代入第二个约束解出z_eq。

技术技巧点名: - 分区原则(Partitioning Principle):Finner & Strassburger (2002) 的思想,用于证明无需多重性校正。 - 最大最小准则(Maximin Criterion):Lehmann & Romano (2022, Ch. 8) 的标准方法,用于在无UMP检验时选择最优规则。 - 单调似然比(Monotone Likelihood Ratio):正态分布族在̂θ上具有单调似然比,这保证了接受域的最优形式是半直线或区间。 - 中间值定理(Intermediate Value Theorem):用于证明校准方程的解存在且唯一。 - 连续映射定理(Continuous Mapping Theorem):用于证明plug-in程序的渐近有效性(Proposition 6)。

真实例子与应用

数据:Broockman & Kalla (2025) 的实地实验,研究让Fox News观众接触CNN的效果。该实验有32个预注册的指标(indices),每个指标对应一个平均处理效应(ATE)的估计和标准误。

方法应用: 1. 设定δ = 0.15个标准差(Cohen's d的小效应阈值)。 2. 对每个指标,分别进行: - 传统双尾检验(H₀: θ = 0, α = 0.05)。 - 符号分类检验(α = 0.05)。 - 符号-幅度分类检验(α = 0.05, δ = 0.15)。 3. 根据Section 6的规则,组合符号检验和符号-幅度检验的结果,得到“组合声明”。

结果(Figure 6): - 传统双尾检验:16个显著,16个不显著。 - 符号分类检验:18个有方向性声明(17个正,1个负),14个无结论。 - 符号-幅度分类检验:2个“正且不可忽略”,12个“可忽略”,18个无结论。 - 组合声明:29个指标有错误控制声明(91%),而传统检验只有16个(50%)。

这个例子想说明什么: - 分类检验比传统检验产生更丰富的结论:不仅包括“显著/不显著”,还包括方向(正/负)和幅度(可忽略/不可忽略)。 - 分类检验可以识别出传统检验无法识别的模式:例如,一些传统上“不显著”的指标被分类为“可忽略”(有错误控制),一些被分类为“正”(有错误控制)。 - 组合多个分类检验可以产生更精确的声明(如“正且不可忽略”)。

🔎 结论是否比证明窄

  • Section 5.2(幅度分类检验):作者声称幅度分类检验“至少与任何现有等价检验一样好”(p. 19)。但附录E.2指出,在已知σ的情况下,幅度分类检验的“可忽略”接受域与Berger & Hsu (1996)的改进等价检验相同。在未知σ的情况下,本文使用plug-in方法(渐近有效),而Berger & Hsu使用t分布(精确有限样本有效)。因此,本文的声明在渐近意义下成立,但在有限样本下可能不如Berger & Hsu的方法(如果t分布与正态近似有显著差异)。作者在附录中承认了这一点,但未在正文中强调。
  • Section 5.3(符号-幅度分类检验):作者声称其方法比Goeman et al. (2010)更powerful。附录E.1的模拟支持这一说法,但模拟仅针对特定参数设置(n=500, 特定δ和σ值)。作者没有提供理论证明(如渐近相对效率),因此这一结论的普遍性有待进一步验证。
  • Section 9(讨论):作者提到“更精细的分区(超过3个类别)可能引发本文未解决的问题”(p. 29)。这暗示了框架的局限性:对于超过3个类别的情况,最优规则不再由边界错误率唯一确定,需要额外的准则(如贝叶斯先验)。这是一个开放问题。

四、开放问题

  1. 有限样本精确性:本文的框架依赖于̂θ的渐近正态性和̂σ的一致性。对于小样本或非正态数据,渐近近似可能不准确。如何为分类检验开发精确的有限样本方法(如基于t分布或置换检验)?扎根点:Proposition 6(渐近有效性)和附录E.2(与Berger-Hsu的比较)暗示了有限样本问题。

  2. 更精细分区的设计:对于超过3个类别(如“大正”、“中正”、“可忽略”、“中负”、“大负”)的情况,如何设计最优接受域?作者指出,此时边界错误率不再唯一确定规则,需要额外的准则(如最大化在某个先验下的期望功效)。扎根点:Section 9的讨论(p. 29)明确提到“更精细的分区可能引发本文未解决的问题”。

  3. 多重检验的联合错误控制:当对多个估计量同时进行分类检验时,如何控制全局错误率(如FDR或FWER)?本文附录C提供了初步方案(使用分类p值和BH/Holm程序),但模拟仅针对特定依赖结构(等相关、符号块、t-copula、对抗混合)。对于更一般的依赖结构(如时间序列、空间数据),这些程序的表现如何?扎根点:附录C的模拟和讨论。

  4. 与贝叶斯方法的比较:本文完全在频率学派框架内工作。贝叶斯方法(如贝叶斯因子、后验概率)天然允许对多个假设进行概率赋值,且没有频率学派的不对称性问题。分类检验与贝叶斯方法在理论(如最优性准则)和实践(如先验选择)上的关系是什么?扎根点:作者在intro中回避了贝叶斯方法,但这是一个明显的替代路线。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论