跳转至

Evidence, Calibration, and Stability: A Triadic Framework for Hypothesis Testing Under Model Uncertainty

作者: Subir Hait
主题: 数理统计 / 假设检验
相关性: 8/10
链接: https://arxiv.org/abs/2608.27320


一、领域脉络与小综述

这个方向是什么

本文所涉子方向是假设检验在模型不确定性下的报告规范。根本问题是:一个检验结果(如 p 值、拒绝/不拒绝)被期望同时回答三个不同的问题——(1) 观测数据对假设提供了多少证据?(2) 检验程序在重复抽样下的误差控制是否达标?(3) 结论对模型假设的偏离有多敏感?现有文献分别处理了这些问题的某一方面(Fisherian 归纳推断、Neyman-Pearson 决策理论、稳健检验、敏感性分析、脆弱性指数、多宇宙分析、分布偏移稳定性等),但缺乏一个将三者分离并联合报告的形式框架。当前成熟度:方法碎片化,哲学争论持续,但已有足够多的工具可供综合。

发展脉络(history)

  • 奠基工作:Fisher (1925) 将显著性检验作为归纳推断工具,强调 p 值作为证据的连续度量;Neyman & Pearson (1933) 建立决策理论,用长期错误频率和功效评价规则。Lehmann (1993) 明确指出两种传统在哲学上不同,即使实践中常混合使用。这一区分是本文分离“证据”与“校准”的哲学基础。
  • 模型不确定性的早期警告:Box (1976) 指出所有模型都是简化的,但有些有用;White (1982) 证明误设定下 MLE 的渐近行为偏离名义性质。这些工作为稳定性坐标提供了必要性。
  • 稳健检验与分布鲁棒性:Huber (1965) 提出在理想分布邻域内控制最坏情况性能的稳健检验;Gao et al. (2018) 用 Wasserstein 不确定性集做稳健检验。这些方法关注程序层面的最坏情况性能,而非特定实现结论的稳定性。
  • 后数据敏感性分析:在观察性研究中,Zhao (2019) 和 Cinelli & Hazlett (2020) 提出敏感性值和稳健性值,量化隐藏偏倚需要多大才能改变结论。Walsh et al. (2014) 提出脆弱性指数(fragility index),统计随机试验中需要改变多少结局事件才能逆转显著性。这些工作直接测量“结论反转所需的最小扰动”,是本文稳定性坐标的直接前驱。
  • 多宇宙与规范曲线:Steegen et al. (2016) 和 Simonsohn et al. (2020) 通过展示多种合理分析选择下的结果变化来暴露模型不确定性。这些方法将稳定性问题离散化,但缺乏连续度量。
  • 分布偏移稳定性:Gupta & Rothenhäusler (2023) 提出 s-value,测量参数在 KL 散度球下的不稳定性;Rothenhäusler & Bühlmann (2023) 寻求跨分布偏移的鲁棒推断。s-value 与 ECS 稳定性最为接近,但 ECS 将其置于证据和校准的架构中。
  • 本文位置:作者声称“The open organizational problem is narrower.” 即不是提出新的证据/功效/稳健性理论,而是提供一个形式架构,将三个问题分离并联合报告,并给出稳定性半径的精确几何(仿射情形)和可认证的下界(非线性情形)。

子线索聚类

  1. 稳健检验与分布鲁棒性(Huber 1965; Gao et al. 2018; Rothenhäusler & Bühlmann 2023):关注程序在分布邻域上的最坏情况性能,属于设计/程序层面的稳定性。
  2. 后数据敏感性分析与脆弱性(Zhao 2019; Cinelli & Hazlett 2020; Walsh et al. 2014):关注特定实现结论反转所需的最小扰动,属于后数据的稳定性。ECS 稳定性坐标直接继承这一思路,但推广到一般扰动类。
  3. 多宇宙与规范曲线(Steegen et al. 2016; Simonsohn et al. 2020):通过离散分析选择集合暴露不确定性,可视为 ECS 稳定性的离散特例。
  4. 分布偏移稳定性(Gupta & Rothenhäusler 2023):用 KL 散度球测量参数不稳定性,与 ECS 稳定性坐标最接近,但 ECS 增加了证据和校准坐标。

这个方向在追问的核心问题

  • Q1:如何区分“数据提供的证据”与“程序的重复抽样性质”?——Fisher vs Neyman-Pearson 的传统争论。
  • Q2:如何量化结论对模型假设的依赖程度,并使其可报告?——敏感性分析、脆弱性指数、s-value 等各自给出答案,但缺乏统一尺度。
  • Q3:当证据、校准、稳定性给出不同信号时,如何综合判断?——ECS 主张合取(conjunctive)而非补偿。
  • Q4:在非预设(exploratory/secondary-data)分析中,如何避免事后构造校准标准?——ECS 区分确认性校准与描述性校准剖面。

⚠️ 作者的 framing(必须明确标注为作者说法)

作者将缺口 frame 为“组织性问题”(organizational problem),而非理论创新。原文:“The open organizational problem is narrower. A reader of a test result needs to distinguish at least three questions.” 他淡化或回避的竞争路线包括: - 稳健检验:作者明确说“Robust hypothesis testing is the closest source of confusion”,并强调 ECS 问的是“特定实现结论离反转有多远”,而非程序的最坏情况性能。他承认两者不同,但未讨论如何将稳健检验的邻域设定与 ECS 的稳定性坐标对接。 - 严重检验(severe testing):Mayo & Spanos (2006) 被列为“最接近的哲学桥梁”,但作者未深入讨论严重检验如何同时处理证据和校准,而是将其视为“bridge”而非替代。 - 贝叶斯因子/似然证据:作者提到“likelihood ratio, e-value, Bayes factor”可作为证据度量,但未讨论贝叶斯框架下校准和稳定性的自然对应(如先验敏感性分析)。这可能是故意保持框架的频次主义中立性。

什么明显该被引/该存在、却没出现在 intro 里? 作者未引用关于多重假设检验校正(如 Bonferroni、FDR)的文献,尽管多声明扩展(Section 4.2)涉及多个 claim。也未引用关于后选择推断(post-selection inference)的文献,尽管 ECS 的稳定性坐标与选择后的结论稳定性相关。这些可能是值得研究者去查的缺口。

张力

未见明显对立引用。各子线索之间互补多于冲突:稳健检验关注程序,敏感性分析关注实现,多宇宙关注离散选择,s-value 关注分布偏移。ECS 试图将它们统一在同一个报告架构下。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号:
  • \(X\):观测数据(随机变量/样本)。
  • \(\mathcal{M}_0\):基准分析模型(如正态假设、独立同分布等)。
  • \(T(X; \mathcal{M}_0)\):检验统计量,其较大值支持科学主张。
  • \(c\):声明的证据边界(如临界值)。
  • \(E(X) = T(X; \mathcal{M}_0) - c\):证据坐标,后数据量,符号表示结论方向,大小表示距边界的距离。
  • \(\phi(X)\):检验规则(如“若 \(T>c\) 则拒绝”)。
  • \(\mathcal{G}_0\):原假设下预设的数据生成分布类。
  • \(\mathcal{G}_1(\Delta^*)\):科学上重要的备择分布类,\(\Delta^*\) 为最小可检测效应。
  • \(\alpha_{\phi}^{\max} = \sup_{P \in \mathcal{G}_0} P\{\phi(X)=1\}\):最大 I 类错误率。
  • \(\pi_{\phi}^{\min}(\Delta^*) = \inf_{P \in \mathcal{G}_1(\Delta^*)} P\{\phi(X)=1\}\):最小功效。
  • \(\alpha^*\):可容忍的最大 I 类错误(预设)。
  • \(\pi^*\):所需的最小功效(预设)。
  • \(C(\phi) = \min\{\alpha^* - \alpha_{\phi}^{\max},\; \pi_{\phi}^{\min}(\Delta^*) - \pi^*\}\):校准坐标,程序层面的量,\(C \ge 0\) 表示满足预设要求。
  • \(u \in \mathbb{R}^q\):扰动向量,\(0\) 对应基准分析。
  • \(m(X; u)\):决策边界(margin),\(m>0\) 支持主张,\(m \le 0\) 不支持。
  • \(W\):对称正定矩阵,定义扰动范数 \(\|u\|_W = (u^\top W u)^{1/2}\)。
  • \(S(X) = \inf\{\|u\|_W : u \in \mathcal{U},\; m(X; u) \le 0\}\):稳定性半径,后数据量,若 \(m(X;0) \le 0\) 则 \(S=0\)。
  • \(e^*\):证据要求(如 \(e^*=0\))。
  • \(s^*\):最小可接受稳定性半径(预设)。
  • \(\Psi = (E, C, S)^\top\):ECS 剖面。
  • \(\mathcal{A}_{ECS} = \{(E,C,S): E > e^*,\; C \ge 0,\; S > s^*\}\):全支持区域。

  • 模型:论文不指定具体分布,而是给出一个通用架构。数据生成机制由基准模型 \(\mathcal{M}_0\) 定义,但允许扰动 \(u\) 改变模型。扰动可以是加性偏移、标准误膨胀、缺失机制、依赖参数等。关键假设是决策边界 \(m(X;u)\) 关于 \(u\) 的函数形式已知(仿射或光滑)。

  • 可观测数据:研究者观测到 \(X\),可计算 \(T(X;\mathcal{M}_0)\)、\(m(X;0)\)、以及扰动效应向量 \(a\)(若仿射)。扰动 \(u\) 本身不可观测,但假设其影响是已知的(如“每单位 \(u_1\) 导致位置偏移 \(b_0\) 个标准差”)。稳定性半径 \(S\) 是这些可观测量的函数。想要但观测不到的是:真实的扰动大小、扰动发生的概率、以及非线性情形下精确的失败集。

第二步:最小内核——单样本 t 检验 + 仿射扰动

最简特例:考虑单侧单样本 t 检验 \(H_0: \mu \le 0\) vs \(H_1: \mu > 0\),显著性水平 \(\alpha=0.05\)。设 \(X_1,\dots,X_n\) i.i.d. 来自某分布(基准假设正态),\(\bar{X}\) 样本均值,\(s\) 样本标准差。统计量 \(t = \bar{X} / (s/\sqrt{n})\),临界值 \(c = t_{n-1,0.95}\)。证据坐标 \(E = t - c\)。

扰动设定:声明两种扰动: - \(u_1\):加性位置偏移,每单位 \(u_1\) 导致均值偏移 \(b_0\) 个标准差(例如 \(b_0=0.10\))。 - \(u_2\):标准误膨胀,每单位 \(u_2\) 导致标准误乘以 \((1 + r_0 u_2)\)(例如 \(r_0=0.10\))。

扰动向量 \(u = (u_1, u_2)^\top\),范数取欧几里得(\(W=I\))。扰动后的决策边界为:

\[m(u) = \bar{X} - b_0 u_1 - c \frac{s}{\sqrt{n}} (1 + r_0 u_2).\]
整理成仿射形式 \(m(u) = m_0 - a^\top u\),其中
\[m_0 = \bar{X} - c \frac{s}{\sqrt{n}}, \quad a = \begin{pmatrix} b_0 \\ c (s/\sqrt{n}) r_0 \end{pmatrix}.\]
这里 \(m_0\) 是基准下置信边界(lower confidence bound),\(m_0 > 0\) 等价于拒绝原假设。

稳定性半径:由 Proposition 1,当 \(m_0 > 0\) 且 \(a \neq 0\) 时,

\[S = \frac{m_0}{\sqrt{a^\top a}} = \frac{m_0}{\sqrt{b_0^2 + [c (s/\sqrt{n}) r_0]^2}}.\]
证明:反转条件为 \(a^\top u \ge m_0\)。由 Cauchy-Schwarz 不等式,\((a^\top u)^2 \le (a^\top a)(u^\top u)\),故 \(\|u\| \ge m_0 / \sqrt{a^\top a}\),且取 \(u^* = (m_0 / a^\top a) a\) 达到等号。

核心思路:稳定性半径是马氏距离(此处欧氏)到失败超平面的距离。分子是观测到的“安全余量”(下置信边界),分母是扰动对决策边界的“杠杆效应”的范数。两个研究可以有相同的证据 \(E\)(即相同的 \(t-c\)),但若扰动效应不同(如标准误膨胀系数不同),稳定性半径可以不同。这就是 Proposition 3 的构造基础。

非线性推广:若决策边界不是仿射,例如 \(m(u) = m_0 - g^\top u + (K/2)\|u\|^2\)(二次余项),则 Lemma 1 给出一个保守下界 \(S \ge \min\{R, (\sqrt{G^2 + 2K m_0} - G)/K\}\),其中 \(G = \sqrt{g^\top W^{-1} g}\)。这保证了在余项有界时,仿射公式是局部有效的代理。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:提出 Evidence-Calibration-Stability (ECS) 框架,将假设检验的报告分解为三个正交坐标——证据(后数据)、校准(程序层面)、稳定性(后数据),并主张全支持是合取性的(一个坐标失败不能由其他坐标补偿)。
  2. 核心工具/方法:对有限维仿射扰动导出精确椭球稳定性半径(Proposition 1);对光滑非线性边界,通过均匀二次余项条件给出可认证的下界(Lemma 1);建立坐标不变性(Proposition 2)和多声明的矩阵扩展(Section 4.2);区分确认性校准与描述性校准剖面(Section 2.2.1)。
  3. 主要结论:三个坐标不可互相替代(Proposition 3);确认性 ECS 规则的 size 不超过单个分量检验的 level(Proposition 4);模拟显示常规拒绝与 ECS 全支持在低功效设计或边界效应附近存在显著差异。

关键设定与假设

  • 基准模型:论文不指定具体分布,但要求基准分析模型 \(\mathcal{M}_0\) 被明确声明。证据度量可以是检验统计量边界、似然比、e-value、贝叶斯因子等,但选择必须声明。
  • 扰动类 \(\mathcal{U}\):必须被声明,可以是 \(\mathbb{R}^q\)(无约束)、有界集、或离散集。扰动坐标代表不同形式的模型不确定性(偏移、膨胀、缺失、依赖等)。
  • 仿射假设(Proposition 1):决策边界 \(m(X;u) = m_0 - a^\top u\) 是精确的,且 \(\mathcal{U} = \mathbb{R}^q\)。若 \(\mathcal{U}\) 是子集,则需检查优化解是否可行。论文明确警告:“Calling the local formula 'exact' outside that setting would overstate what the geometry proves.”
  • 光滑非线性假设(Lemma 1):存在半径 \(R>0\) 和常数 \(K\ge 0\),使得对 \(\|u\|_W \le R\),有 \(|m(u) - m_0 - g^\top u| \le (K/2) \|u\|_W^2\)。这类似于二阶泰勒展开的余项控制,但要求均匀成立。
  • 校准的预设性:确认性校准要求 \(\alpha^*\)、\(\pi^*\)、\(\Delta^*\) 在分析前独立于数据固定。描述性校准剖面则无此要求。
  • 合取规则:全支持要求 \(E > e^*\)、\(C \ge 0\)、\(S > s^*\) 同时成立。Proposition 4 证明该交并检验的 size 不超过 \(\alpha\)(每个分量检验的 level),无需独立性假设。

相比已有文献:ECS 不要求扰动是概率性的(如 s-value 用 KL 散度),而是允许任意声明扰动类;不要求证据度量是 p 值(如脆弱性指数),而是允许灵活选择;不要求校准是预设的(如 Neyman-Pearson),而是区分确认性与描述性。

主要结果

  • Proposition 1(精确椭球稳定性半径):在仿射扰动 \(m(u)=m_0 - a^\top u\) 且 \(\mathcal{U}=\mathbb{R}^q\) 下,\(S = m_0 / \sqrt{a^\top W^{-1} a}\),达到该半径的扰动为 \(u^* = m_0 W^{-1} a / (a^\top W^{-1} a)\)。直觉:分子是安全余量,分母是扰动对边界的“杠杆”在 \(W^{-1}\) 度量下的范数。必要条件:\(m_0>0\),\(a\neq 0\)。解决的技术难点:将无穷维优化问题化为广义 Cauchy-Schwarz 不等式,得到闭式解。
  • Lemma 1(非线性下界证书):在二次余项条件下,\(S \ge \min\{R, (\sqrt{G^2 + 2K m_0} - G)/K\}\),其中 \(G = \sqrt{g^\top W^{-1} g}\)。直觉:即使非线性,只要余项被二次函数控制,就能保证在某个半径内结论不反转。必要条件:余项界在半径 \(R\) 内成立。解决的技术难点:将非线性问题转化为二次不等式求解,避免直接优化。
  • Proposition 2(坐标不变性):若 \(u = L v\) 且变换度量 \(W_v = L^\top W_u L\)、系数 \(a_v = L^\top a_u\),则椭球稳定性半径不变。意义:稳定性半径不应因坐标重参数化而改变(只要度量相应变换)。
  • Proposition 3(非塌缩):通过构造反例证明,不存在通用的一一变换使得任一坐标可由其他两个坐标恢复。意义:三个坐标回答不同问题,不能合并。
  • Proposition 4(size 控制):确认性 ECS 规则的全局 size 不超过每个分量检验的 level \(\alpha\)。证明:交并检验逻辑,无需独立性假设。

证明路线与技术技巧

整体路线(以 Proposition 1 为例): 1. 将稳定性半径定义为约束优化问题:\(\min \|u\|_W\) s.t. \(a^\top u \ge m_0\)。 2. 注意到目标函数是凸的,可行集是半空间,最小值必在边界 \(a^\top u = m_0\) 上达到。 3. 应用广义 Cauchy-Schwarz 不等式:\((a^\top u)^2 \le (a^\top W^{-1} a)(u^\top W u)\),得到下界 \(\|u\|_W \ge m_0 / \sqrt{a^\top W^{-1} a}\)。 4. 验证 \(u^* = m_0 W^{-1} a / (a^\top W^{-1} a)\) 满足 \(a^\top u^* = m_0\) 且 \(\|u^*\|_W = m_0 / \sqrt{a^\top W^{-1} a}\),达到下界。

关键跳跃点:从无穷维优化到闭式解,依赖于仿射结构和凸性。广义 Cauchy-Schwarz 是核心工具。

Lemma 1 的证明路线: 1. 对任意 \(\|u\|_W \le r \le R\),利用余项界和广义 Cauchy-Schwarz 得到下界 \(m(u) \ge m_0 - G r - (K/2) r^2\)。 2. 若该下界为正,则结论不反转。求解二次方程 \(m_0 - G r - (K/2) r^2 = 0\) 得正根 \(S_L\)。 3. 因此 \(S \ge \min\{R, S_L\}\)。

技术技巧点名: - 广义 Cauchy-Schwarz 不等式:用于仿射情形(Proposition 1)和非线性下界(Lemma 1)中的梯度项。 - 二次余项展开:用于非线性情形的局部近似,类似于泰勒定理但要求均匀界。 - 交并检验(intersection-union test):用于 Proposition 4 的 size 控制,无需独立性。 - 构造反例:Proposition 3 通过具体数值例子证明非塌缩。

真实例子与应用

Student 睡眠数据(Section 9): - 数据:R 内置 sleep 数据集,10 名患者两种药物的睡眠增加小时数之差(drug2 - drug1)。均值 1.58 小时,标准差 1.23 小时。 - 方法应用:单侧配对 t 检验 \(H_0: \mu \le 0\)。\(t=4.062\),临界值 1.833,证据 \(E=2.229\)。稳定性分析:声明加性偏移 \(b_0=0.25\) 小时,标准误膨胀 \(r_0=10\%\)。下置信边界 \(m_0 = 1.58 - 1.833 \times 0.389 = 0.867\) 小时。椭球稳定性半径 \(S = 0.867 / \sqrt{0.25^2 + (1.833 \times 0.389 \times 0.10)^2} = 3.33\)。若偏移加倍至 0.50,半径降至 1.72。 - 结果:ECS 剖面为 \(\Psi = (E=2.229, C=\text{not prespecified}, S=3.33)\)。校准标记为“未预设”,因为原始研究没有现代预设的最小效应和功效目标。作者强调“The missing coordinate is informative.” - 说明的问题:即使证据强、稳定性高,也不能事后构造校准标准。描述性功效曲线可以报告,但不能冒充确认性校准。

模拟研究(Section 8): - 设计:30,000 次独立样本,\(n \in \{40,71,100\}\),效应 \(\mu \in \{0,0.15,0.30,0.50\}\),三种误差分布(正态、\(t_3\)、对数正态)。基准分析:单侧 t 检验 \(\alpha=0.05\)。校准要求:功效 \(\ge 0.80\) 对 \(d^*=0.30\)。稳定性:\(b_0=0.10, r_0=0.10, s^*=1\)。 - 核心量化结论:\(n=40\) 时,即使 \(\mu=0.50\) 下拒绝率 92.4%,但设计未达校准要求(名义功效 0.587),全 ECS 支持为 0%。\(n=71, \mu=0.30\) 时,常规拒绝率 81.0%,但全 ECS 支持仅 51.0%,因为许多拒绝的稳定性半径 \(\le 1\)。\(n=100, \mu=0.30\) 时,全 ECS 支持升至 62.6%。分布偏离下,ECS 支持率变化不大(如 \(t_3\) 下 56.9% vs 正态 51.0%)。 - 说明的问题:ECS 在低功效设计或边界效应附近最有用,能过滤掉那些虽然统计显著但结构脆弱的结论。

🔎 结论是否比证明窄

  • Proposition 1 的精确性:只对仿射扰动且 \(\mathcal{U}=\mathbb{R}^q\) 成立。论文在 Section 4 明确警告:“Use Proposition 1 literally only when the perturbation map is affine and the unconstrained optimizer is admissible.” 但作者在后续模拟和例子中均使用仿射公式,未展示非线性情形的实际计算。非线性证书(Lemma 1)只给出下界,未给出精确半径或上界。
  • 多声明扩展(Section 4.2):只处理了仿射情形,且假设每个 \(a_j \neq 0\) 的行有有限半径。未讨论当某些 claim 的扰动效应为零(\(a_j=0\))时,联合半径的定义(论文设为 \(+\infty\))是否合理。
  • Proposition 4 的 size 控制:假设每个分量检验的 level 为 \(\alpha\),但未讨论稳定性半径 \(S\) 的检验如何构造(论文只给出点估计和 bootstrap 区间,未给出正式检验)。因此 Proposition 4 更多是逻辑声明,而非可操作的程序。
  • 模拟中的 bootstrap 覆盖:仅对四个正则场景验证,且覆盖略低于名义(0.934-0.945)。作者承认“near \(S=0\) or when a perturbation set has corners… ordinary bootstrap procedures may be nonregular.” 因此 bootstrap 的可靠性未被严格证明。

四、开放问题

  1. 更尖锐的非线性稳定性证书:Lemma 1 只给出下界,且依赖于均匀二次余项条件。能否在更一般的非线性(如凸、Lipschitz)下得到精确半径或更紧的界?扎根于 Section 11:“Sharper nonlinear certificates and principled model neighborhoods are two of them.”
  2. 有原则的模型邻域选择:ECS 要求用户声明扰动类 \(\mathcal{U}\) 和度量 \(W\),但未提供如何科学地选择这些对象的指导。例如,在观察性研究中,如何将未观测混杂的敏感性参数(如 Cinelli & Hazlett 的 \(R^2\))映射到 ECS 的扰动坐标?扎根于 Section 11:“principled model neighborhoods” 被列为开放问题。
  3. 稳定性半径的不确定性量化:论文仅给出点估计和初步 bootstrap,但承认非正则情形(\(S\) 接近 0、扰动集有角点、离散规范集)下推断困难。如何构造置信区间或假设检验?扎根于 Section 11:“Inference is harder too. Corners, radii near zero, discrete specification sets, or nonunique nearest failure points can produce nonregular sampling distributions.”
  4. ECS 在因果推断中的移植:论文未涉及因果推断,但研究者兴趣包括敏感性分析(如 IV、proximal CI 的 negative control 假设扰动)。ECS 的稳定性坐标可直接用于量化因果结论对识别假设偏离的敏感度。需要将扰动类定义为对未观测混杂、工具变量排除限制等假设的偏离,并推导相应的稳定性半径。扎根于论文的 general 架构(Section 2.3 的扰动定义可容纳任何参数化偏离),但具体实现需结合因果识别理论。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论