Classification testing: A new framework for drawing qualitative conclusions from quantitative estimates¶
作者: Andrew C. Eggers, Zikai Li
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.23315
一、领域脉络与小综述¶
这个方向是什么¶
本文所针对的根本问题是:如何从定量估计(点估计和标准误)中,做出有频率误差控制的定性结论(如“效应为正”、“效应可忽略”)。当前社会科学的主流实践是使用零假设显著性检验(NHST),但NHST存在一个根本性的不对称:它只能通过拒绝零假设来“证明”研究假设(如效应为正),却无法通过“未拒绝零假设”来“证明”零假设(如效应为零或可忽略)。本文提出的“分类检验”(classification testing)框架,旨在通过将参数空间划分为多个有实质意义的类别,并允许研究者以受控的错误率将待估参数归入任何一个类别(或宣布“无结论”),来克服这一不对称性。该方向目前处于方法论反思与整合阶段,已有多个分散的提议(如方向性双侧检验、等价性检验、三侧检验),但缺乏一个统一、直观且最优的框架。
发展脉络(history)¶
-
奠基工作:零假设显著性检验(NHST)及其批判
- Fisher / Neyman-Pearson 范式:奠定了频率学派假设检验的基础,但核心是“拒绝/不拒绝”一个单一零假设,无法直接支持对研究假设的肯定性结论。
- Gigerenzer et al. (2004):将当前社会科学中机械化的NHST实践称为“零仪式”(null ritual),批判其误读和滥用。
- Gill (1999), Nickerson (2000), Rosnow & Rosenthal (1992):持续批判NHST的逻辑缺陷,特别是“未拒绝零假设 ≠ 接受零假设”这一谬误。
- McShane et al. (2019), Cumming (2014), Greenland et al. (2016):倡导“新统计”,主张放弃统计显著性,转而关注点估计、置信区间和效应量。本文作者引用这些工作,但认为定性结论在社会科学中不可避免,因此需要更好的框架而非完全放弃。
-
主要进展:对NHST不对称性的修补
- 等价性检验(Equivalence Testing):
- Schuirmann (1987):提出“双单侧检验”(TOST)程序,用于检验效应是否可忽略(即|θ| < δ)。这是对NHST不对称性的重要修补,因为它允许研究者肯定零假设(效应可忽略)。
- Rainey (2014), Lakens (2017a), Hartman & Hidalgo (2018):将等价性检验引入社会科学,特别是用于安慰剂检验和论证“效应可忽略”。本文作者引用这些工作,但指出TOST是保守的(尤其当σ较大时),且只能肯定“可忽略”,不能肯定“非可忽略”。
- 方向性检验(Directional Testing):
- Kaiser (1960):提出“方向性双侧检验”(directional two-sided test),允许在拒绝双侧零假设后,根据估计值方向做出“效应为正”或“效应为负”的结论。
- Jones & Tukey (2000):独立提出类似的三决策方法(three-decision method),将结果分为“正”、“负”、“无结论”三类。本文的符号分类测试直接继承自这一思想。
- Cox et al. (1977):对双侧检验的实用主义解释,将结果分为上临界区、下临界区和中间区,但未实现正确的误差控制。
- 多结论检验(Multi-Conclusion Testing):
- Goeman et al. (2010):提出“三侧假设检验”(three-sided hypothesis testing),同时检验“优效性”、“等价性”和“劣效性”。本文的符号-幅度分类测试与之相关,但本文的方法更优(更强大)。
- Isager & Fitzgerald (2024), Riffenburgh & Wang (2025):提出类似的三分类测试,但阈值固定,不随估计精度调整。
- 等价性检验(Equivalence Testing):
-
当前前沿与统一框架
- Finner & Strassburger (2002):提出“划分原则”(partitioning principle),为多决策问题提供了统一的误差控制框架。本文明确指出其分类测试是该原则的一个实例。
- Berger & Hsu (1996):改进了TOST的保守性,提出了更优的等价性检验。本文的幅度分类测试在“可忽略”类别的接受域上与Berger-Hsu方法一致,但本文的框架更简单(基于正态近似而非t分布),且额外提供了“非可忽略”的结论。
- 本文(Eggers & Li, 2026):本文的位置是整合与推广。它将Kaiser/Jones-Tukey的方向性检验、Schuirmann的等价性检验、Goeman等人的三侧检验统一到一个“分类检验”框架下,并基于最大最小准则(maximin criterion)推导了最优的接受域,解决了TOST的保守性和Goeman等人方法的次优性。
子线索聚类¶
- 等价性检验线索:Schuirmann (1987) → Rainey (2014) → Lakens (2017a) → Hartman & Hidalgo (2018) → Berger & Hsu (1996)。这一簇专注于如何肯定一个效应是可忽略的,核心工具是TOST及其改进。
- 方向性/多决策检验线索:Kaiser (1960) → Jones & Tukey (2000) → Cox et al. (1977) → Goeman et al. (2010) → Isager & Fitzgerald (2024)。这一簇专注于如何同时处理多个(通常是三个)可能的定性结论,核心思想是划分参数空间。
- 方法论批判与替代线索:Gigerenzer et al. (2004) → Gill (1999) → McShane et al. (2019) → Cumming (2014)。这一簇不提出新方法,而是批判NHST的弊端,并倡导更合理的统计实践(如关注置信区间)。本文作者引用这些批判,但认为定性结论不可避免,因此需要更好的框架。
这个方向在追问的核心问题¶
- 如何克服NHST的不对称性? 即如何让研究者既能“证明”研究假设,也能“证明”零假设(或其它竞争假设)?
- 如何设计一个统一的、最优的框架? 现有的方向性检验、等价性检验、三侧检验是分散的,能否用一个统一的框架来涵盖,并保证某种最优性(如最大最小功率)?
- 如何在实际应用中实现误差控制? 当有多个估计量、多个分类测试时,如何控制多重比较下的错误率(如FDR、FWER)?
- 如何定义“有实质意义的类别”? 类别边界(如δ)的选择依赖于研究者的主观判断,如何使其更透明、更可辩护?
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么? 作者将当前实践的缺口 frame 为“不对称性”(asymmetry):只能肯定研究假设,不能肯定其对立面。这使得研究者在面对开放性问题时,必须人为地指定一个零假设,且无法从“未拒绝”中得到任何有信息量的结论。作者将分类测试定位为“显然的下一步”,因为它直接解决了这个不对称性,允许对任何类别做出误差控制的肯定。
- 哪些竞争路线被他淡化或回避了? 作者淡化了“完全放弃假设检验,转向估计文化”的路线(如McShane et al. 2019)。作者承认定性结论不可避免,因此认为需要一个更好的检验框架,而不是放弃检验。作者也回避了贝叶斯方法,全文完全基于频率学派框架。作者没有讨论贝叶斯后验概率或贝叶斯因子作为替代方案的可能性。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用Wellek (2010) 的专著《Testing Statistical Hypotheses of Equivalence and Noninferiority》,这是等价性检验领域的标准参考书。作者也没有引用Romano (2005) 关于等价性检验最优性的论文,尽管本文的幅度分类测试在数学上与之相关。此外,作者没有引用任何关于多重比较的现代文献(如Benjamini & Hochberg 1995),尽管在附录中详细讨论了多重比较问题。这可能是为了保持intro的简洁,但值得研究者去查证这些遗漏是否意味着作者有意回避了某些竞争性更强的理论结果。
张力¶
未见明显对立引用。被引工作之间主要是互补和递进关系,而非矛盾。例如,等价性检验和方向性检验解决的是不同的问题,而本文试图将它们统一。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- θ:标量待估参数(estimand),如平均处理效应(ATE)。
- θ̂:θ的点估计量。
- σ:θ̂的标准误(standard error),假设已知或被一致估计。
- α:显著性水平,也是分类测试允许的最大误分类概率。
- δ:类别边界参数,用于定义“可忽略”效应的大小(如Cohen's d = 0.15)。
- C_j:第j个类别,是参数空间Θ的一个子集。例如,C₊ = (0, ∞) 表示“效应为正”。
- A_j:第j个类别的接受域(acceptance region),是估计量θ̂的样本空间的一个子集。如果θ̂ ∈ A_j,则判定θ属于C_j。
- z_{1-α}:标准正态分布的1-α分位数,即Φ⁻¹(1-α)。
- 模型:
- 假设估计量θ̂服从均值为θ、方差为σ²的正态分布:θ̂ ~ N(θ, σ²)。这是社会科学中常见的渐近正态性假设。
- σ可以是已知的,或者被一致估计(记为σ̂)。在本文的框架中,σ被视为已知或可被σ̂替代,且渐近性质成立。
- 可观测数据:
- 研究者实际能观测到的是点估计θ̂和标准误σ̂(或σ)。
- 想要但观测不到的量是真实的参数θ。研究者只能通过θ̂和σ̂来推断θ所属的类别。
第二步:讲最小内核——符号分类测试(Sign Classification Test)¶
这是整篇论文最核心、最简单的特例,也是理解整个框架的钥匙。
- 最简特例:假设我们只关心θ的符号(正或负),且只有一个边界点0。那么,参数空间被划分为两个类别:
- C₋ = (-∞, 0] (“效应为负或零”)
- C₊ = (0, ∞) (“效应为正”)
- 核心思路:我们想要设计一个规则,根据观测到的θ̂,要么将θ归入C₋,要么归入C₊,要么宣布“无结论”(inconclusive)。这个规则必须保证:无论θ的真实值是多少,将其错误地归入另一个类别的概率不超过α。
- 最优规则:
- 接受域为:
- A₋ = (-∞, -z_{1-α}σ] (如果θ̂ ≤ -1.645σ,则判定θ为负)
- A₊ = [z_{1-α}σ, ∞) (如果θ̂ ≥ 1.645σ,则判定θ为正)
- 如果θ̂落在(-z_{1-α}σ, z_{1-α}σ)之间,则宣布“无结论”。
- 接受域为:
- 为什么这个规则有效?
- 考虑最坏情况:当θ的真实值恰好位于边界点0时(属于C₋),误分类为C₊的概率是P(θ̂ ≥ z_{1-α}σ | θ=0) = α。同样,当θ从上方趋近于0时(属于C₊),误分类为C₋的概率也是α。
- 对于任何不在边界上的θ,误分类概率都小于α。因此,这个规则控制了误分类率。
- 与置信区间的关系:
- 这个规则等价于:如果1-2α置信区间(即θ̂ ± z_{1-α}σ)完全落在某个类别内,则做出分类。
- 例如,当α=0.05时,使用90%置信区间。如果整个90%置信区间都在0以上,则判定θ为正。如果整个90%置信区间都在0以下,则判定θ为负。否则,无结论。
- 这个“置信区间法”对于符号分类测试是精确的,但对于更复杂的分类(如幅度分类)只是近似。
一句话总结:符号分类测试的核心思想是,用两个单侧检验(而非一个双侧检验)来同时检验“θ为正”和“θ为负”这两个假设,从而允许研究者对任何一个方向做出误差控制的肯定结论,而不仅仅是“拒绝θ=0”。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了如何从定量估计中做出有频率误差控制的定性结论,提出了一个名为“分类检验”(classification testing)的统一框架,以克服传统零假设显著性检验(NHST)中只能肯定研究假设、不能肯定其对立面的不对称性。
- 核心工具/方法:核心工具是划分原则(partitioning principle)和最大最小准则(maximin criterion)。研究者首先将参数空间划分为多个有实质意义的类别,然后根据点估计和标准误,将待估参数归入某个类别(或宣布无结论),并保证误分类概率不超过预设的显著性水平α。对于三种实用场景(符号、幅度、符号-幅度),作者推导了最优的接受域。
- 主要结论:分类测试在逻辑上优于当前实践,因为它允许对任何类别做出误差控制的肯定结论,从而将研究假设置于被证伪的风险之下。与现有方法(如TOST、Goeman等人的三侧检验)相比,本文的框架更统一、更强大(在最大最小准则下最优)。通过一个媒体实验的再分析,展示了分类测试能产生更丰富的、有误差控制的结论。
关键设定与假设¶
- 设定:一个标量待估参数θ,一个渐近正态的估计量θ̂ ~ N(θ, σ²),其中σ²被一致估计。
- 假设:
- 渐近正态性:θ̂的抽样分布是渐近正态的。这是社会科学应用中的标准假设。
- 标准误一致估计:σ̂是σ的一致估计。这使得在应用中可以“plug-in”σ̂。
- 类别划分:研究者必须事先(最好预注册)将参数空间Θ划分为K个互斥且穷尽的类别C₁, ..., C_K。这是框架的核心,也是其应用的主要负担。
- 边界点选择:对于幅度和符号-幅度测试,需要选择一个有实质意义的边界δ(如Cohen's d = 0.15)。这个选择依赖于研究者的主观判断,但等价性检验也面临同样的问题。
- 相比已有文献的放宽/强化:
- 相比TOST:本文的幅度分类测试放宽了TOST的保守性,在σ较大时仍能做出“可忽略”的结论,并且额外允许做出“非可忽略”的结论。
- 相比Goeman et al. (2010):本文的符号-幅度分类测试强化了最优性,其接受域边界(z_dir, z_eq)随估计精度(σ/δ)自适应调整,而非使用固定阈值,从而在最大最小准则下达到最优。
主要结果¶
- 定理1(符号分类测试的最优性,Proposition 3):对于符号分类测试(两个类别,一个边界点0),唯一的最优规则是使用接受域A₋ = (-∞, -z_{1-α}σ]和A₊ = [z_{1-α}σ, ∞)。该规则在控制误分类率不超过α的前提下,最大化最坏情况下的正确分类概率(即最大最小功率)。
- 定理2(幅度分类测试的最优性,Proposition 4):对于幅度分类测试(三个类别:可忽略、非可忽略),最优的接受域由两个方程唯一确定:在边界点θ=δ处,将“可忽略”误分类为“非可忽略”的概率为α,将“非可忽略”误分类为“可忽略”的概率也为α。这解决了TOST的保守性问题。
- 定理3(符号-幅度分类测试的最优性,Proposition 5):对于符号-幅度分类测试(三个类别:负且大、可忽略、正且大),最优的接受域由两个方程唯一确定:在边界点θ=δ处,将“可忽略”误分类为“正且大”或“负且大”的总概率为α,将“正且大”误分类为“可忽略”或“负且大”的总概率也为α。
- 定理4(渐近有效性,Proposition 6):当使用一致估计的标准误σ̂替代真实σ时,上述分类测试的误分类率依概率收敛到α,即渐近有效。
证明路线与技术技巧¶
- 整体路线:
- 问题形式化:将分类测试问题形式化为一个多决策问题,定义误分类率和最大最小功率。
- 对称性与单调似然比:利用正态分布族的对称性和单调似然比性质,将最优接受域的形状限制为对称的区间或半直线。
- 最坏情况定位:证明误分类率的最大值总是在类别边界处达到(Proposition 1)。这使得误差控制问题简化为在边界点处控制误分类率。
- 最大最小准则:将问题转化为在边界点处,通过调整接受域边界,使得从每个相邻类别趋近边界时的误分类率都恰好等于α。这给出了一个方程组,其解唯一确定了最优接受域。
- 渐近论证:对于σ未知的情况,使用连续映射定理证明,当使用σ̂替代σ时,误分类率依概率收敛到α。
- 关键跳跃点:
- 从“控制误分类率”到“在边界点处控制误分类率”:这是整个证明的基石。作者通过单调性论证(Proposition 1)证明,对于任何合理的接受域,最坏情况下的误分类率总是发生在类别边界上。这使得一个复杂的全局优化问题简化为一个简单的局部问题。
- 从“两个独立约束”到“唯一解”:对于幅度和符号-幅度测试,有两个自由参数(如a和b),但有两个独立的约束(在边界点θ=δ处,从两边趋近的误分类率都等于α)。作者证明这两个约束恰好唯一确定了最优解。
- 技术技巧点名:
- 单调似然比(Monotone Likelihood Ratio):用于证明最优接受域的形状(如符号测试中的单侧区间)。
- 最大最小准则(Maximin Criterion):用于定义最优性,因为不存在一致最优势检验(UMP)。
- 连续映射定理(Continuous Mapping Theorem):用于证明使用估计标准误时的渐近有效性。
- 隐函数定理(Implicit Function Theorem):用于证明最优临界值z_dir和z_eq是r = δ/σ的连续函数。
真实例子与应用¶
- 数据/场景:Broockman and Kalla (2025) 的现场实验,研究让福克斯新闻观众观看CNN的影响。该实验有32个预注册的结果指标。
- 如何应用:作者将分类测试应用于这32个指标。对于每个指标,他们计算了点估计和标准误,然后分别进行了符号分类测试和符号-幅度分类测试(设定δ = 0.15个标准差)。
- 结果:
- 传统的双侧检验:16个显著,16个不显著。
- 符号分类测试:18个指标被分类了方向(17正1负),比双侧检验多分类了2个。
- 符号-幅度分类测试:2个指标被分类为“正且大”,12个被分类为“可忽略”,其余18个“无结论”。
- 组合分类测试:通过组合符号和符号-幅度测试的结果,作者对32个指标中的29个做出了有误差控制的定性结论(91%),而传统双侧检验只对16个(50%)做出了“效应不为零”的结论。
- 这个例子想说明什么:这个例子旨在展示分类测试相比传统双侧检验的丰富性和信息量。它不仅提供了更多的结论(从16个到29个),而且提供了更细致的结论(如“可忽略”和“正且大”),这些结论在传统框架下是无法以误差控制的方式做出的。
🔎 结论是否比证明窄¶
- 是的,存在一些泛化的claim。作者在正文中声称幅度分类测试“至少与任何现有等价性测试一样好”("at least as good as any existing equivalence test"),但附录E.2中的比较仅限于TOST和Berger-Hsu (1996)。作者没有与所有可能的等价性测试(如Wellek (2010) 中的其他方法)进行比较。这是一个需要研究者自行核验的泛化claim。
- 作者声称符号分类测试“与运行两个单侧检验等价,且无需多重比较校正”。这个结论在正文中得到了清晰的解释,且与Finner & Strassburger (2002) 的划分原则一致,是严格成立的。
- 作者在讨论部分提到,对于更精细的划分(超过3个类别),测试设计不再是唯一确定的。这是一个诚实的局限性声明,表明本文的理论结果主要针对简单、实用的分类问题。
四、开放问题¶
-
更精细的类别划分:本文主要关注2-3个类别的简单情况。对于更精细的划分(如4个或更多类别),如何设计最优的接受域?作者在Section 9中承认,此时“测试设计不再是唯一确定的”("the test design is no longer uniquely determined"),需要引入额外的准则(如最大化在某个先验分布下的期望功率)。这是一个明确的开放问题,扎根于论文的Discussion部分。
-
未知σ的有限样本性质:本文的渐近有效性(Proposition 6)依赖于σ̂的一致性和连续映射定理。对于小样本,当使用t分布而非正态近似时,分类测试的有限样本性质如何?作者在附录E.2中比较了与Berger-Hsu (1996) 的差异,后者使用t分布提供精确的有限样本控制,但依赖于常数方差假设。一个开放问题是:能否在更弱的假设下(如异方差)开发出有限样本有效的分类测试?
-
多重比较的整合:本文在附录C中讨论了如何使用分类p-value进行多重比较校正(如FDR、FWER),但这是作为“附加”功能提出的。一个更根本的开放问题是:能否将多重比较问题直接整合到分类测试的框架中?例如,当同时测试多个θ时,能否设计一个联合的分类规则,直接控制全局的误分类率,而不是事后进行校正?
-
与贝叶斯方法的比较:本文完全基于频率学派框架。一个自然的开放问题是:分类测试与贝叶斯方法(如基于后验概率的决策规则)相比,在逻辑、性质和实际表现上有何异同?贝叶斯方法可以自然地处理不确定性,并允许研究者根据后验概率做出决策,但需要指定先验。这个问题在本文中没有被提及,但值得研究者去探索。
Maintained by 陈星宇 · Homepage · Source on GitHub