Evidence, Calibration, and Stability: A Triadic Framework for Hypothesis Testing Under Model Uncertainty¶
作者: Subir Hait
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2608.27320
一、领域脉络与小综述¶
这个方向是什么¶
本文所涉子方向是假设检验的报告与评估,核心问题在于:一个检验结果(如 p 值、显著性声明)通常被要求同时回答三个不同的问题——(1) 观测数据对原假设提供了多少证据?(2) 该检验程序在重复抽样下的错误率是否可接受?(3) 结论对模型假设的偏离有多敏感?传统上,Fisher 的显著性检验回答 (1),Neyman-Pearson 的决策理论回答 (2),而稳健检验、敏感性分析、脆弱性指数、多宇宙分析等方法各自回答 (3) 的某个侧面。该子方向当前成熟度较高,但缺乏一个统一的、非补偿性的报告架构——这正是本文试图填补的缺口。
发展脉络(history)¶
- 奠基工作:Fisher (1925) 提出显著性检验作为归纳推断工具,强调 p 值作为证据;Neyman & Pearson (1933) 建立决策规则,以长期错误频率和功效评估程序。Lehmann (1993) 明确指出两种传统在哲学上不同,即使实践中常被混用。Box (1976) 警告模型都是简化的,White (1982) 从误设定角度指出操作行为可能偏离名义水平。这些工作奠定了“证据”与“程序行为”分离的基础。
- 主要进展:Huber (1965) 开创稳健检验,研究理想分布邻域内的最坏情况性能;Gao et al. (2018) 用 Wasserstein 不确定性集做稳健检验。Mayo & Spanos (2006) 的 severe testing 试图用错误概率连接证据与校准。在观测研究中,Zhao (2019) 和 Cinelli & Hazlett (2020) 提出敏感性值与稳健性值,量化隐藏偏倚需要多大才能改变结论。Walsh et al. (2014) 提出脆弱性指数(fragility index),计数随机对照试验中多少结局事件翻转会逆转显著性。Steegen et al. (2016) 和 Simonsohn et al. (2020) 分别提出多宇宙分析与规范曲线分析,暴露不同合理分析选择下的结果变异。Gupta & Rothenhäusler (2023) 提出 s 值,度量参数在 KL 散度位移下的不稳定性;Rothenhäusler & Bühlmann (2023) 研究分布稳健推断,寻求跨位移泛化的程序。
- 当前 frontier:分布位移下的稳健推断(s 值、分布稳健推断)是较新的方向,但尚未与证据和校准维度系统整合。
- 本文位置:作者将上述工作定位为“对假设检验添加稳健性的广泛主张已不可行”,而将自身贡献限定为“更窄的组织性问题”——提供一个架构(ECS)将证据、校准、稳定性作为三个正交坐标分开报告,并强调非补偿性(一个坐标强不能挽救另一个坐标的失败)。作者明确声明“不声称证据、功效或稳健性本身是新的”,而是形式化综合。
子线索聚类¶
- 证据与 p 值争议:Wasserstein et al. (2019)、Greenland et al. (2016)、Goodman (1993)、Royall (1997)。这一簇关注 p 值的误用、证据的似然解释、以及如何超越二分显著性。
- 稳健性与敏感性分析:Huber (1965)、Gao et al. (2018)、Cinelli & Hazlett (2020)、Zhao (2019)、Walsh et al. (2014)、Gupta & Rothenhäusler (2023)、Rothenhäusler & Bühlmann (2023)。这一簇提供量化模型偏离对结论影响的具体工具,但各自针对不同扰动类型(分布邻域、隐藏偏倚、结局翻转、KL 位移)。
- 多宇宙与规范曲线:Steegen et al. (2016)、Simonsohn et al. (2020)。这一簇通过枚举合理分析选择来暴露分析不确定性,但通常不提供连续度量。
这个方向在追问的核心问题¶
- Q1:如何同时报告“数据说了什么”、“程序设计是否合理”、“结论对模型有多敏感”这三个不同性质的问题?
- Q2:是否存在一个统一的、非补偿性的报告格式,使得读者不会将证据强度、设计功效、模型稳健性混为一谈?
- Q3:对于后验(post-data)的稳定性度量,能否给出精确的几何刻画(如椭球半径)?当扰动非线性时,如何获得可认证的下界?
- Q4:当校准目标未预先指定时,应如何报告操作特征而不伪造设计历史?
当前主流方法(如仅报告 p 值、或仅报告敏感性值)各自只回答一个侧面,且常被错误地视为可互换。已知瓶颈包括:缺乏统一架构、稳定性度量常依赖特定扰动类型、非线性情形下精确解难以获得。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
作者将缺口 frame 成:“一个检验结果被要求承载太多意义,而现有文献已经分别回答了各部分,但缺少一个将它们分开报告并保持非补偿性的架构。” 作者声称 ECS 是“形式化综合”(formal synthesis),而非新理论。竞争路线被淡化或回避的方式: - 稳健检验(Huber, Gao)被定位为“程序层面的最坏情况性能”,而 ECS 的稳定性是“后验的、针对特定实现结论的距离”。作者认为两者不可替代,但未深入讨论当稳健检验本身也提供后验诊断时如何衔接。 - s 值(Gupta & Rothenhäusler)被承认“与 ECS 稳定性特别接近”,但作者强调差异在于 ECS 将稳定性与证据、校准并列,并使用非补偿性规则。作者未讨论 s 值是否也能嵌入 ECS 框架作为稳定性坐标的一个实例。 - 脆弱性指数(Walsh et al.)被指出“范围更窄”,但未讨论其离散设定与 ECS 连续半径之间的桥接。
什么明显该被引 / 该存在、却没出现在 intro 里?
- VanderWeele & Ding (2017) 的 E-value(流行病学中广泛使用的敏感性度量)未被引用。该工作与 Cinelli & Hazlett 类似,但更强调最小关联强度。这可能是作者有意聚焦于仿射扰动几何而回避因果框架,但值得研究者去查是否构成遗漏。
- 贝叶斯稳健性(如 Berger 的 ε-污染类)未被提及。作者在证据坐标中允许贝叶斯因子,但未讨论贝叶斯框架下的稳健性(如后验对先验的敏感性)。这可能是因为作者聚焦于频率学派检验,但论文并未明确限定频率学派。
张力¶
未见明显对立引用。各被引工作基本在各自设定下自洽,没有在同一条件下得出相反结论的冲突。但存在一种隐含张力:s 值(Gupta & Rothenhäusler)基于 KL 散度,而 ECS 的稳定性半径基于加权欧氏范数(由 W 定义)。两种度量在非线性扰动下可能给出不同排序,但作者未讨论这种不一致。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号(逐个点名): - \(X\):观测数据(随机变量或样本)。 - \(\mathcal{M}_0\):基准分析模型(如正态假设、独立同分布等)。 - \(T(X; \mathcal{M}_0)\):检验统计量,其较大值支持科学主张。 - \(c\):声明的证据边界(如临界值)。 - \(E(X) = T(X; \mathcal{M}_0) - c\):证据坐标,后验量,正数表示支持主张。 - \(\phi(X)\):检验规则(如“若 \(T>c\) 则拒绝”)。 - \(\mathcal{G}_0\):原假设下预设的数据生成分布类。 - \(\mathcal{G}_1(\Delta^*)\):科学上重要的备择分布类,\(\Delta^*\) 为最小效应。 - \(\alpha_\phi^{\max} = \sup_{P\in\mathcal{G}_0} P\{\phi(X)=1\}\):最大 I 类错误率。 - \(\pi_\phi^{\min}(\Delta^*) = \inf_{P\in\mathcal{G}_1(\Delta^*)} P\{\phi(X)=1\}\):最小功效。 - \(\alpha^*\):最大容忍 I 类错误;\(\pi^*\):最小要求功效。 - \(C(\phi) = \min\{\alpha^* - \alpha_\phi^{\max},\ \pi_\phi^{\min}(\Delta^*) - \pi^*\}\):校准坐标,预数据量,\(C\ge 0\) 表示满足要求。 - \(u \in \mathcal{U} \subseteq \mathbb{R}^q\):扰动向量,\(0\) 对应基准分析。 - \(m(X; u)\):决策边际,\(m>0\) 支持主张,\(m\le 0\) 不支持。 - \(W\):对称正定矩阵,定义扰动范数 \(\|u\|_W = (u^\top W u)^{1/2}\)。 - \(S(X) = \inf\{\|u\|_W : u\in\mathcal{U},\ m(X;u)\le 0\}\):稳定性半径,后验量。若 \(m(X;0)\le 0\) 则 \(S=0\);若无扰动可达失败则 \(S=+\infty\)。 - \(m_0 = m(X;0)\):基准决策边际。 - \(a \in \mathbb{R}^q\):仿射扰动下,\(m(X;u) = m_0 - a^\top u\) 中的系数向量。
模型:论文不指定单一数据生成机制,而是允许任意统计模型。关键假设是:决策边际 \(m(X;u)\) 在扰动 \(u\) 下是已知函数(可计算)。对于仿射情形,假设 \(m\) 是 \(u\) 的仿射函数且系数 \(a\) 已知(或可从数据估计)。对于非线性情形,假设 \(m\) 光滑且二阶余项有界。
可观测数据:研究者实际能观测到的是 \(X\)(样本),从而可计算 \(T(X)\)、\(m_0\)、以及仿射系数 \(a\)(若 \(m\) 形式已知)。扰动 \(u\) 是假设的、不可观测的,但研究者声明扰动类 \(\mathcal{U}\) 和度量 \(W\)。稳定性半径 \(S\) 是这些声明量的函数。
想要但观测不到:真实的数据生成分布(是否属于 \(\mathcal{G}_0\) 或 \(\mathcal{G}_1\))不可知;扰动 \(u\) 的真实值不可知;稳定性半径 \(S\) 是“如果扰动存在,需要多大才能翻转结论”的假设性度量,不是对真实世界的概率陈述。
第二步:讲最小内核¶
最简特例:单样本单侧 t 检验,扰动为仿射且无约束(\(\mathcal{U}=\mathbb{R}^2\)),度量 \(W=I\)(欧氏范数)。这是论文 Section 7 和 8 使用的例子,也是 Proposition 1 的直接应用。
交代记号(在特例下): - \(X = \{x_1,\dots,x_n\}\) 为 i.i.d. 样本,假设来自方差有限的分布。 - 检验 \(H_0: \mu \le 0\) vs \(H_1: \mu > 0\),显著性水平 \(\alpha=0.05\)。 - 统计量 \(t = \bar{x} / (s/\sqrt{n})\),临界值 \(c = t_{n-1,0.95}\)。 - 证据坐标 \(E = t - c\)。 - 基准决策边际 \(m_0 = \bar{x} - c \cdot (s/\sqrt{n})\)(即单侧置信下限)。 - 扰动 \(u = (u_1, u_2)^\top\),其中: - \(u_1\) 对应位置偏移:每单位 \(u_1\) 在均值上加 \(b_0 = 0.10\) 个标准差(即 \(b_0 \cdot s\)?论文写“0.10 outcome standard-deviation units”,即 \(b_0 = 0.10\) 乘以总体标准差,但实际用样本标准差近似)。 - \(u_2\) 对应标准误膨胀:每单位 \(u_2\) 将标准误乘以 \((1 + r_0 u_2)\),其中 \(r_0 = 0.10\)。 - 扰动后的决策边际:
核心思路:稳定性半径 \(S\) 是满足 \(m(u) \le 0\) 的最小 \(\|u\|\)。由于 \(m(u)\) 是 \(u\) 的仿射函数,失败集 \(\{u: m(u) \le 0\}\) 是一个半空间(由超平面 \(a^\top u = m_0\) 界定)。原点到该超平面的加权欧氏距离即为 \(S\)。由广义 Cauchy-Schwarz 不等式:
为什么这是最小内核:整篇论文的仿射稳定性几何(Proposition 1)本质上就是这个二维例子的直接推广到任意维 \(q\) 和任意正定 \(W\)。非线性部分的 Lemma 1 则是当 \(m(u)\) 不是精确仿射时,用二次余项界给出一个保守下界。因此,理解这个 t 检验例子就抓住了论文技术贡献的核心。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:提出了 Evidence-Calibration-Stability (ECS) 框架,将假设检验的报告分解为三个正交维度——证据(后验的 Fisherian 归纳推断)、校准(预数据的 Neyman-Pearson 设计行为)、稳定性(后验的模型扰动下结论翻转距离),并强调非补偿性(一个坐标强不能挽救另一个坐标的失败)。
- 核心工具 / 方法:对有限维仿射扰动,推导出精确的椭球稳定性半径(Proposition 1);对光滑非线性边际,通过一致二次余项条件给出认证下界(Lemma 1);建立了坐标不变性(Proposition 2)和多声明的矩阵扩展(Section 4.2);区分了确认性校准与描述性校准剖面(Section 2.2.1)。
- 主要结论:ECS 框架提供了一个非补偿性的三坐标报告架构;在仿射扰动下稳定性半径有闭式解(Mahalanobis 型距离);在非线性扰动下可通过二次余项获得可认证的下界;模拟和实例表明三个坐标可能导向不同解读,尤其在设计未达标或结论接近扰动边界时。
关键设定与假设¶
- 设定:论文不限定具体检验,但所有推导基于以下结构:存在一个基准分析模型 \(\mathcal{M}_0\),一个决策边际 \(m(X;u)\)(其符号决定结论),一个扰动集 \(\mathcal{U} \subseteq \mathbb{R}^q\)(含 0),以及一个度量矩阵 \(W\)(正定)。证据坐标 \(E\) 和稳定性半径 \(S\) 是后验的;校准坐标 \(C\) 是预数据的。
- 假设:
- 仿射扰动假设(Proposition 1):\(m(X;u) = m_0 - a^\top u\),且 \(\mathcal{U} = \mathbb{R}^q\)(无约束)。这是获得精确闭式解的关键。作者明确警告:当扰动非线性或受约束时,该公式仅为代理。
- 光滑非线性假设(Lemma 1):\(m(u)\) 在 \(\|u\|_W \le R\) 上满足一致二次余项界 \(|m(u) - m_0 - g^\top u| \le (K/2)\|u\|_W^2\),其中 \(g\) 是梯度,\(K\) 是常数。这要求 \(m\) 足够光滑(如二阶可微且 Hessian 有界)。
- 坐标不变性(Proposition 2):要求扰动变换 \(u = Lv\) 可逆,且度量相应变换 \(W_v = L^\top W_u L\)。这是纯代数条件。
- 多声明扩展(Section 4.2):假设每个声明的边际都是仿射的,且所有基准边际为正。
- 确认性校准:要求 \(\alpha^*\)、\(\pi^*\)、\(\Delta^*\) 独立于实现数据预先指定。这是科学规范假设,非统计假设。
- 相比已有文献:与 s 值(Gupta & Rothenhäusler)相比,ECS 的稳定性半径使用加权欧氏范数而非 KL 散度,且不要求分布位移的似然比可计算;与脆弱性指数(Walsh et al.)相比,ECS 允许连续扰动而非离散事件翻转;与 Cinelli & Hazlett 的稳健性值相比,ECS 的扰动坐标可包含任意形式的模型偏离(不仅是遗漏变量偏倚),但代价是需要显式声明扰动映射和度量。
主要结果¶
- Proposition 1(椭球稳定性半径):在仿射无约束扰动下,\(S = m_0 / \sqrt{a^\top W^{-1} a}\),且达到该半径的扰动为 \(u^* = m_0 W^{-1} a / (a^\top W^{-1} a)\)。证明使用广义 Cauchy-Schwarz 不等式。该结果将稳定性半径分解为基准边际与扰动敏感度的比值。
- Lemma 1(非线性下界):在二次余项界成立的半径 \(R\) 内,结论翻转不可能发生在任何满足 \(m_0 - G r - (K/2) r^2 > 0\) 的 \(r\) 处,其中 \(G = \sqrt{g^\top W^{-1} g}\)。因此 \(S \ge \min\{R,\ (\sqrt{G^2 + 2K m_0} - G)/K\}\)。当 \(K=0\) 时退化为仿射半径。该结果给出了一个保守的认证下界,但通常不是紧的。
- Proposition 2(坐标不变性):在可逆线性变换下,椭球稳定性半径不变。这保证了稳定性度量不依赖于扰动坐标的任意选择。
- Proposition 3(非collapse):通过构造反例证明,不存在通用的一一变换能从任意两个坐标恢复第三个。这是逻辑声明,非统计结果。
- Proposition 4(size 控制):若每个分量原假设以水平 \(\alpha\) 检验,则全局交集-并集检验的 size 不超过 \(\alpha\)。证明简单:至少一个分量原假设为真时,拒绝所有分量的概率不超过该分量的拒绝概率。
证明路线与技术技巧¶
- 整体路线(以 Proposition 1 为例):
- 将问题转化为:在约束 \(a^\top u \ge m_0\) 下最小化 \(\|u\|_W\)。
- 由于目标函数凸、可行集为半空间,最小值必在边界 \(a^\top u = m_0\) 上达到。
- 应用广义 Cauchy-Schwarz 不等式:\((a^\top u)^2 \le (a^\top W^{-1} a)(u^\top W u)\),代入边界条件得下界。
- 构造 \(u^*\) 验证等号可达。
- 关键跳跃点:广义 Cauchy-Schwarz 不等式的使用——将内积 \(a^\top u\) 与加权范数 \(\|u\|_W\) 联系起来,需要将 \(a\) 视为 \(W^{-1}\) 下的对偶向量。这是标准的凸优化技巧,但在此处被用于统计稳定性度量。
- 技术技巧点名:
- 广义 Cauchy-Schwarz:用于仿射半径推导。
- 二次余项界 + 梯度范数界:用于非线性下界(Lemma 1),本质上是 Taylor 展开 + 一致 Lipschitz 梯度。
- 交集-并集检验:用于 Proposition 4 的 size 控制,无需独立性假设。
- 构造反例:用于 Proposition 3 的非collapse证明,通过改变扰动系数或样本量来分离坐标。
真实例子与应用¶
- 模拟研究(Section 8):使用单样本单侧 t 检验,样本量 \(n=40,71,100\),效应 \(\mu=0,0.15,0.30,0.50\),误差分布为标准正态、标准化 \(t_3\)、标准化对数正态。基准分析为 t 检验 (\(\alpha=0.05\)),校准要求为功效 \(\ge 0.80\) 在 \(d^*=0.30\),稳定性阈值 \(s^*=1\)(扰动单位:位置偏移 \(b_0=0.10\) 标准差,标准误膨胀 \(r_0=0.10\))。结果:\(n=40\) 时即使效应大、拒绝率高,但因设计未达标(功效仅 0.587),全 ECS 支持率为 0;\(n=71\) 且 \(\mu=0.30\) 时,常规拒绝率 0.810,但全 ECS 支持率仅 0.510,因为许多拒绝的稳定性半径小于 1。该模拟验证了非补偿性逻辑:校准失败时,强证据和稳定性不能挽救;在边界附近,稳定性进一步过滤。
- 历史数据(Section 9):Student 睡眠数据(10 名患者,药物 2 减药物 1 的睡眠增加小时数)。配对 t 检验:均值差 1.58 小时,标准差 1.23,\(t=4.062\),单侧 \(p=0.0014\),证据边际 \(E=2.229\)。稳定性分析:声明位置偏移 \(b_0=0.25\) 小时、标准误膨胀 \(r_0=0.10\),得 \(S=3.33\)(超过 3 个参考扰动单位才能翻转)。校准:无预先指定的最小效应和功效目标,因此标记为“未预先指定”,仅报告描述性功效曲线。该例子展示了当校准缺失时,ECS 报告仍可提供证据和稳定性信息,但拒绝伪造设计历史。
🔎 结论是否比证明窄¶
- Proposition 1 的精确性:论文明确声明“Proposition 1 is exact only when the perturbation map is affine and the unconstrained optimizer is admissible”(Section 4.1 末尾)。但在 Section 7 的 t 检验例子中,扰动被假设为仿射(位置偏移和标准误膨胀的线性组合),而实际标准误膨胀是非线性的(乘以 \(1+r_0 u_2\)),但论文通过重新定义 \(m(u)\) 的表达式将其转化为仿射形式(因为 \(c s/\sqrt{n}\) 是常数)。这种转化依赖于“标准误膨胀因子”被线性化处理,即假设 \(u_2\) 直接乘在标准误上,而非乘在方差上。如果扰动是方差膨胀(如 \(s^2\) 乘以因子),则边际不再是仿射。论文未讨论这种非线性情形下的近似误差。
- Lemma 1 的下界:论文承认该下界是保守的(conservative certificate),且当 \(K>0\) 时通常不紧。在真实应用中,如果 \(K\) 未知或难以估计,该下界可能过于保守而失去实用性。论文未提供估计 \(K\) 的方法。
- 多声明扩展(Section 4.2):仅给出点估计 \(S_{\text{joint}}\),未提供联合置信区间或考虑多重比较。论文在 Limitations 中承认“uncertainty for multiple radii”是开放问题。
- Proposition 4 的 size 控制:仅适用于“每个分量原假设以水平 \(\alpha\) 检验”的情形,但稳定性半径 \(S\) 的检验(\(H_0^S: S \le s^*\))本身需要构造检验统计量,论文未给出具体构造(仅提到 bootstrap 下界可作为近似)。因此 Proposition 4 的逻辑框架成立,但实际应用时分量检验可能不精确。
四、开放问题(点到为止,扎根具体语句)¶
-
非线性稳定性半径的精确解或更紧界:论文在 Section 4.1 只给出二次余项下的保守下界,且承认“directional information about the second-order term can sharpen this conservative certificate, but that refinement is not required for the ECS architecture”(Section 4.1 末尾)。实际中,对于污染、缺失、测量误差等常见非线性扰动,能否获得精确解或可计算的紧界?这扎根于 Section 4.1 的“sharpening”提及和 Section 11 的“Nonlinear stability is harder than the affine formula suggests”。
-
稳定性半径的推断(置信区间):Section 8.4 的 bootstrap 实验显示覆盖接近但略低于名义水平,且论文承认“near \(S=0\), or when a perturbation set has corners or discrete model choices, ordinary bootstrap procedures may be nonregular”(Section 8.4 末尾)。如何构造在非正则情形下仍有效的置信区间(如基于子抽样或 m-out-of-n bootstrap)?这扎根于 Section 8.4 的 bootstrap 讨论和 Section 11 的“Inference is harder too”。
-
多声明联合稳定性半径的推断:Section 4.2 仅给出点估计 \(S_{\text{joint}}\),未提供联合置信区域或调整多重比较。论文在 Limitations 中提及“uncertainty for multiple radii”是开放问题(Section 11 末尾)。如何为多个声明的联合稳定性构造同时置信带?这扎根于 Section 4.2 的矩阵扩展和 Section 11 的“uncertainty for multiple radii”。
-
扰动度量 \(W\) 和扰动类 \(\mathcal{U}\) 的选择原则:论文强调稳定性半径依赖于声明,但未提供如何科学地选择 \(W\) 和 \(\mathcal{U}\) 的指导原则。Section 11 指出“Stability cannot be defined without a perturbation class and scale... In some applications, an ordered metric may be scientifically unjustified.” 如何将领域知识系统转化为 \(W\) 和 \(\mathcal{U}\)?是否存在类似于“最小有意义扰动”的校准方法?这扎根于 Section 11 的“stability cannot be defined without a perturbation class”和 Section 10 的“perturbation metric or reference scales”。
(注:以上开放问题均扎根于论文具体语句,不替研究者判断可行性。建议研究者确认这些是否真为 gap 时,可查阅近期关于分布稳健推断(Rothenhäusler & Bühlmann, 2023)和 s 值(Gupta & Rothenhäusler, 2023)的 intro,看它们是否也指向类似问题。)
Maintained by 陈星宇 · Homepage · Source on GitHub