Evidence, Calibration, and Stability: A Triadic Framework for Hypothesis Testing Under Model Uncertainty¶
作者: Subir Hait
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2608.27320
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的子方向是假设检验的稳健性与敏感性分析,其根本问题是:一个单一的检验结果(如 p 值、显著性声明)被要求同时承载太多信息——它既要描述观测数据对原假设的“证据”强度,又要保证该检验程序在重复抽样下的错误率(频率性操作特性),还要确保结论不因模型假设的微小扰动而反转。当前成熟度:经典理论(Fisher 推断、Neyman-Pearson 决策)已分别处理前两个任务,但实践中常被混用;稳健性与敏感性分析已积累大量工具,但缺乏一个统一的、形式化的报告架构来分离这三个角色。
发展脉络(history)¶
- 奠基工作:Fisher (1925) 将显著性检验作为归纳推断工具,强调 p 值衡量数据与零假设的不相容性;Neyman & Pearson (1933) 将检验视为决策规则,用长期错误频率和功效来评估程序。Lehmann (1993) 明确指出这两个传统在哲学上不同,即使实践中常被混合。留下的口子:这两个传统分别处理“证据”和“程序操作特性”,但未涉及模型假设本身的不确定性。
- 主要进展——稳健性与敏感性:Huber (1965) 开创稳健检验,研究理想分布邻域内的最坏情况性能。White (1982) 的误设定理论警告:在错误模型下的操作行为会偏离名义水平。Mayo & Spanos (2006) 的“严重检验”试图用错误概率桥接证据与校准。在观察性研究中,Zhao (2019) 和 Cinelli & Hazlett (2020) 提出敏感性/稳健性值,量化需要多大的隐藏偏倚才能改变结论。Walsh et al. (2014) 的脆弱性指数统计随机试验中需要改变多少个结局事件才能反转显著性。Steegen et al. (2016) 和 Simonsohn et al. (2020) 的多宇宙/规范曲线分析暴露不同分析选择下的结果变异。留下的口子:这些工具各自针对特定类型的模型不确定性(分布邻域、隐藏偏倚、事件反转、分析选择),但缺乏一个统一框架来同时报告证据、程序校准和结论稳定性。
- 当前 frontier——分布偏移与分布稳健推断:Gupta & Rothenhäusler (2023) 提出 s 值,用 Kullback-Leibler 散度球内的分布偏移来度量参数的不稳定性。Rothenhäusler & Bühlmann (2023) 研究分布稳健推断,寻找能跨偏移泛化的程序。留下的口子:s 值聚焦于稳定性,但未将其与证据和校准并列;分布稳健推断关注程序层面的泛化能力,而非单个结论的稳定性。
- 本文的位置:作者将上述工作定位为“对假设检验增加稳健性”的广泛主张,但认为开放的组织问题更窄——需要区分三个问题(证据、校准、稳定性),并提供一个形式化架构来分离它们。本文的贡献是提出 ECS 框架,将这三个角色作为正交坐标,并推导了精确的椭球稳定性半径(仿射扰动下)和认证下界(非线性扰动下),同时建立了坐标不变性和多声明扩展。
子线索聚类¶
- 经典检验哲学与程序评价:Fisher (1925)、Neyman & Pearson (1933)、Lehmann (1993)、Mayo & Spanos (2006)。这一簇关注检验的哲学基础、证据解释和程序的操作特性。
- 稳健性与敏感性分析:Huber (1965)、White (1982)、Gao et al. (2018)、Zhao (2019)、Cinelli & Hazlett (2020)、Walsh et al. (2014)。这一簇关注模型误设定或隐藏偏倚下结论的稳健性,提供各种敏感性度量(稳健性值、脆弱性指数等)。
- 多宇宙/规范曲线分析:Steegen et al. (2016)、Simonsohn et al. (2020)。这一簇通过枚举多个合理分析选择来暴露结论对分析决策的依赖性。
- 分布偏移与分布稳健推断:Gupta & Rothenhäusler (2023)、Rothenhäusler & Bühlmann (2023)。这一簇用分布偏移(如 KL 散度球)来度量参数或结论的不稳定性,并寻求能跨偏移泛化的推断程序。
这个方向在追问的核心问题¶
- 如何分离“证据”、“程序操作特性”和“模型稳健性”这三个概念? 当前主流方法常将它们混为一谈(如用 p 值同时表示证据和错误率),导致误解。
- 如何量化“结论反转所需的最小模型扰动”? 已有工具(如脆弱性指数、s 值)给出了特定设定下的答案,但缺乏一个统一的几何框架。
- 如何将“校准”从后验重构中区分出来? 许多观察性研究没有预设的最小效应和功效目标,事后用观测效应计算“观测功效”是循环论证。需要区分确认性校准(预设)和描述性校准剖面(事后)。
- 如何为非线性扰动提供可认证的稳定性下界? 仿射扰动下的精确解(如 Proposition 1)很简洁,但许多实际扰动(污染、缺失、测量误差)是非线性的,需要更复杂的工具。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么:作者认为“对假设检验增加稳健性”的广泛主张已不可行,开放的组织问题更窄——需要区分三个问题(证据、校准、稳定性),并提供一个形式化架构来分离它们。本文的 ECS 框架就是“显然的下一步”:它不声称提出新的证据理论、功效理论或稳健性理论,而是提供一个形式化架构来分离这些角色,并推导了精确的稳定性几何。
- 哪些竞争路线被他淡化或回避了:
- 贝叶斯假设检验:作者在 2.1 节提到“likelihood ratio, e-value, Bayes factor, or another monotone measure could replace the test-statistic margin”,但全文未深入讨论贝叶斯框架下的校准(如先验敏感性)和稳定性(如先验扰动)。贝叶斯学派有成熟的稳健贝叶斯分析(如 Berger, 1994),但未被引用。
- 决策理论框架:作者将 Neyman-Pearson 视为校准的基础,但未讨论更一般的决策理论(如 minimax 决策规则)如何与 ECS 整合。Gao et al. (2018) 的 Wasserstein 稳健检验被引用,但仅作为“设计类校准”的一个例子,未深入讨论其与 ECS 稳定性的关系。
- 多重比较与 FDR 控制:作者在 4.2 节给出了多声明的矩阵扩展,但未讨论多重比较校正(如 Bonferroni、FDR)如何影响校准坐标(如 α 的分配)或稳定性半径(如联合失败超平面的定义)。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 稳健贝叶斯分析(如 Berger, 1994; Insua & Ruggeri, 2000):贝叶斯学派有成熟的先验敏感性分析,与 ECS 的稳定性坐标高度相关。
- 局部敏感性分析(如 Gustafson, 2000; Saltelli et al., 2008):在因果推断和计量经济学中广泛使用,与 ECS 的椭球扰动几何有直接联系。
- 模型平均与模型选择不确定性(如 Burnham & Anderson, 2002; Hoeting et al., 1999):多宇宙分析是离散模型集,但模型平均提供了一种连续加权的方式,与 ECS 的稳定性概念有交叉。
- 非参数/半参数稳健检验(如 Neuhaus, 1982; Bickel et al., 1993):这些工作处理更一般的模型误设定,与 ECS 的非线性稳定性证书有潜在联系。
张力¶
未见明显对立引用。各被引工作在不同设定下(分布邻域、隐藏偏倚、事件反转、分析选择)提出不同的稳健性度量,但彼此不矛盾,而是互补。作者也明确承认这一点(Table 1 将各方法定位为 ECS 不同坐标的“邻居”或“特例”)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( X \):观测数据(随机变量或样本)。 - \( \mathcal{M}_0 \):基准分析模型(包含分布假设、检验统计量等)。 - \( T(X; \mathcal{M}_0) \):检验统计量,其较大值支持科学主张。 - \( c \):声明的证据边界(如临界值)。 - \( E(X) = T(X; \mathcal{M}_0) - c \):证据坐标(后验量,描述实现样本)。 - \( \phi(X) \):检验规则(如“若 \( T > c \) 则拒绝”)。 - \( \mathcal{G}_0 \):零假设下预设的数据生成分布类。 - \( \mathcal{G}_1(\Delta^*) \):科学上重要的备择分布类,其中 \( \Delta^* \) 是最小可检测效应。 - \( \alpha_{\phi}^{\max} = \sup_{P \in \mathcal{G}_0} P\{\phi(X) = 1\} \):最大 I 类错误率。 - \( \pi_{\phi}^{\min}(\Delta^*) = \inf_{P \in \mathcal{G}_1(\Delta^*)} P\{\phi(X) = 1\} \):最小功效。 - \( \alpha^* \):最大容忍 I 类错误率(预设)。 - \( \pi^* \):最小要求功效(预设)。 - \( C(\phi) = \min\{\alpha^* - \alpha_{\phi}^{\max}, \pi_{\phi}^{\min}(\Delta^*) - \pi^*\} \):校准坐标(程序层面的预设量)。 - \( u \in \mathbb{R}^q \):扰动向量,\( u = 0 \) 对应基准分析。 - \( m(X; u) \):决策余量(正数支持主张,非正数不支持)。 - \( W \):对称正定矩阵,定义扰动范数 \( \|u\|_W = (u^\top W u)^{1/2} \)。 - \( S(X) = \inf\{\|u\|_W : u \in \mathcal{U}, m(X; u) \leq 0\} \):稳定性半径(后验量,度量结论反转所需的最小扰动)。 - \( \mathcal{U} \subseteq \mathbb{R}^q \):声明的扰动集(\( 0 \in \mathcal{U} \))。 - \( a \in \mathbb{R}^q \):仿射扰动下,扰动坐标对决策余量的精确效应向量。 - \( m_0 = m(X; 0) \):基准决策余量。 - \( g \):非线性决策余量在基准模型处的梯度。 - \( K \):二次余项界常数。 - \( R \):二次余项界成立的半径。
模型: - 假设检验的一般设定:零假设 \( H_0 \) 对备择假设 \( H_1 \)。基准分析模型 \( \mathcal{M}_0 \) 指定了检验统计量 \( T \) 的分布(如 t 检验假设正态性)。校准坐标 \( C \) 基于预设的分布类 \( \mathcal{G}_0 \) 和 \( \mathcal{G}_1(\Delta^*) \)。稳定性坐标基于声明的扰动集 \( \mathcal{U} \) 和决策余量 \( m(X; u) \)。
可观测数据: - 研究者实际能观测到的是 \( X \)(样本数据)。由此可计算 \( T(X; \mathcal{M}_0) \)、\( E(X) \)、\( m_0 \)、\( a \)(若仿射模型成立)、\( g \)(若非线性模型可微分)等。想要但观测不到的是:真正的数据生成分布(是否属于 \( \mathcal{G}_0 \) 或 \( \mathcal{G}_1 \))、扰动 \( u \) 的真实值(稳定性半径只回答“需要多大扰动才能反转结论”,不回答“扰动实际有多大”)、以及校准坐标 \( C \) 中的 \( \alpha_{\phi}^{\max} \) 和 \( \pi_{\phi}^{\min}(\Delta^*) \)(这些是程序层面的理论量,需通过设计或模拟获得,而非从数据估计)。
第二步:讲最小内核¶
最简特例:单样本 t 检验(论文第 7 节)
考虑最简单的单侧单样本 t 检验:
这个特例揭示了论文的核心思路:ECS 框架将假设检验的报告拆分为三个正交坐标,每个坐标回答不同的问题。稳定性坐标在仿射扰动下退化为一个精确的椭球半径,其几何直观是“从基准点到失败超平面的 Mahalanobis 距离”。论文的一般情形(非线性扰动、多声明、坐标不变性)都是在这个最小内核上的扩展。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:提出了 Evidence-Calibration-Stability (ECS) 框架,将假设检验的报告拆分为三个正交维度——证据(后验推断)、校准(程序操作特性)和稳定性(结论反转所需的最小模型扰动),并建立了非补偿性的联合支持准则。
- 核心工具/方法:对有限维仿射扰动,推导出精确的椭球稳定性半径(Proposition 1);对光滑非线性边际,通过一致二次余项条件给出认证下界(Lemma 1);建立了坐标不变性(Proposition 2)和多声明的矩阵扩展;区分了确认性校准与描述性校准剖面。
- 主要结论:ECS 坐标不可互相约化(Proposition 3);确认性 ECS 规则的联合检验大小不超过各分量检验的显著性水平(Proposition 4);模拟(单样本 t 检验)和历史数据(Student 睡眠数据)显示三个坐标可导向不同解读。
关键设定与假设¶
- 设定:假设检验的一般设定,包括零假设 \( H_0 \)、备择假设 \( H_1 \)、基准分析模型 \( \mathcal{M}_0 \)、检验统计量 \( T \)、临界值 \( c \)、预设的分布类 \( \mathcal{G}_0 \) 和 \( \mathcal{G}_1(\Delta^*) \)、扰动集 \( \mathcal{U} \)、决策余量 \( m(X; u) \)、扰动范数矩阵 \( W \)。
- 假设:
- 证据坐标:无额外假设,仅要求 \( T \) 和 \( c \) 被声明。
- 校准坐标:要求预设 \( \alpha^* \)、\( \pi^* \)、\( \Delta^* \),且这些值独立于实现数据。对于描述性校准,要求外部合理的效应范围。
- 稳定性坐标:
- 仿射情形(Proposition 1):\( \mathcal{U} = \mathbb{R}^q \)(无约束),\( m(X; u) = m_0 - a^\top u \)(精确仿射),\( a \neq 0 \),\( W \) 对称正定。
- 非线性情形(Lemma 1):\( m(u) \) 光滑,存在半径 \( R > 0 \) 和常数 \( K \geq 0 \),使得对 \( \|u\|_W \leq R \) 有 \( |m(u) - m_0 - g^\top u| \leq (K/2) \|u\|_W^2 \)(一致二次余项界)。
- 坐标不变性(Proposition 2):\( L \) 可逆,\( W_v = L^\top W_u L \),\( a_v = L^\top a_u \)。
- 多声明扩展:每个基准余量 \( m_{0j} > 0 \),\( a_j \neq 0 \)。
- 联合检验大小(Proposition 4):每个分量检验在各自零假设下水平为 \( \alpha \)。
- 相比已有文献的放宽/强化:
- 放宽:与脆弱性指数(Walsh et al., 2014)相比,ECS 稳定性不限于离散事件反转,可处理连续扰动(如位置偏移、标准误膨胀)。与 s 值(Gupta & Rothenhäusler, 2023)相比,ECS 稳定性不限于 KL 散度球,可处理任意声明扰动集。
- 强化:与多宇宙分析(Steegen et al., 2016)相比,ECS 稳定性要求声明一个度量(\( W \)),从而可计算连续半径,而非仅枚举离散结果。与敏感性值(Cinelli & Hazlett, 2020)相比,ECS 稳定性不限于隐藏偏倚的特定参数化,可处理更一般的扰动类型。
主要结果¶
- Proposition 1(椭球稳定性半径):在仿射扰动 \( m(u) = m_0 - a^\top u \) 下,稳定性半径为 \( S = m_0 / \sqrt{a^\top W^{-1} a} \),最优扰动为 \( u^* = m_0 W^{-1} a / (a^\top W^{-1} a) \)。直觉:分子是基准余量(证据强度),分母是扰动对余量的“效率”(通过 \( W^{-1} \) 加权后的梯度范数)。必要条件:\( m_0 > 0 \),\( a \neq 0 \),\( \mathcal{U} = \mathbb{R}^q \)。解决的技术难点:将稳定性半径问题转化为凸优化(最小化 \( \|u\|_W \) 受限于 \( a^\top u \geq m_0 \)),利用广义 Cauchy-Schwarz 不等式得到精确解。
- Lemma 1(二次余项下界):在非线性扰动下,若二次余项界成立,则稳定性半径至少为 \( \min\{R, [\sqrt{G^2 + 2K m_0} - G]/K\} \),其中 \( G = \sqrt{g^\top W^{-1} g} \)。直觉:当 \( K=0 \)(全局仿射)时退化为精确半径;当 \( K>0 \) 时,二次项消耗部分余量,导致可认证半径小于仿射近似。必要条件:二次余项界在半径 \( R \) 内成立。解决的技术难点:将非线性优化问题松弛为二次下界,避免直接求解非凸优化。
- Proposition 2(坐标不变性):椭球稳定性半径在可逆线性变换下不变。直觉:稳定性半径应依赖于扰动的“科学意义”,而非坐标表示。必要条件:度量 \( W \) 随坐标变换而相应变换。
- Proposition 3(非约化性):ECS 三个坐标不能互相确定。构造:通过改变扰动效应(\( a \))或样本量(影响校准)来展示独立性。
- Proposition 4(联合检验大小):确认性 ECS 规则的全局大小不超过 \( \alpha \)。直觉:交集-并集检验的逻辑——只有所有分量都通过才宣布支持,因此错误概率受限于最差分量。必要条件:每个分量检验水平为 \( \alpha \),无需独立性假设。
证明路线与技术技巧¶
整体路线(以 Proposition 1 为例): 1. 问题转化:将稳定性半径定义为 \( S = \inf\{\|u\|_W : a^\top u \geq m_0\} \)(因为 \( m(u) \leq 0 \iff a^\top u \geq m_0 \))。 2. 凸性:目标函数 \( \|u\|_W \) 是凸的,可行集 \( \{u: a^\top u \geq m_0\} \) 是凸的(半空间),因此最小值在边界 \( a^\top u = m_0 \) 上达到。 3. 广义 Cauchy-Schwarz:对任意 \( u \),有 \( (a^\top u)^2 \leq (a^\top W^{-1} a)(u^\top W u) \)。因此,若 \( a^\top u = m_0 \),则 \( \|u\|_W \geq m_0 / \sqrt{a^\top W^{-1} a} \)。 4. 可达性:构造 \( u^* = m_0 W^{-1} a / (a^\top W^{-1} a) \),验证 \( a^\top u^* = m_0 \) 且 \( \|u^*\|_W = m_0 / \sqrt{a^\top W^{-1} a} \),因此下界可达。
关键跳跃点: - 从一般优化到精确闭式解:关键在于识别出问题等价于“在超平面 \( a^\top u = m_0 \) 上最小化 Mahalanobis 距离”,这有已知的闭式解。作者用广义 Cauchy-Schwarz 给出了一个简洁的证明。 - 非线性证书的松弛:Lemma 1 的关键跳跃是将非线性余量界与广义 Cauchy-Schwarz 结合,得到一个二次下界,从而将非线性优化松弛为二次方程求根。这个松弛是保守的(下界),但可认证。
技术技巧点名: - 广义 Cauchy-Schwarz 不等式:用于推导仿射情形下的精确下界(Proposition 1 证明)。 - 二次余项展开与一致界:用于非线性情形的认证下界(Lemma 1)。 - 坐标变换与度量变换:用于证明坐标不变性(Proposition 2)。 - 交集-并集检验:用于联合检验的大小控制(Proposition 4)。 - 非参数 Bootstrap:用于稳定性半径的不确定性量化(第 8.4 节)。
真实例子与应用¶
模拟研究(第 8 节): - 数据/场景:生成 30,000 个独立样本,组合样本量 \( n \in \{40, 71, 100\} \)、标准化均值效应 \( \mu \in \{0, 0.15, 0.30, 0.50\} \)、三种误差分布(标准正态、标准化 \( t_3 \)、标准化对数正态)。基准分析为单侧单样本 t 检验(\( \alpha = 0.05 \))。 - 方法应用:校准坐标基于正态模型预设 \( \pi^* = 0.80 \) 在 \( d^* = 0.30 \);稳定性坐标使用 \( b_0 = 0.10 \)、\( r_0 = 0.10 \)、\( s^* = 1 \)。计算每个样本的 ECS 剖面,并与传统拒绝率比较。 - 结果: - \( n=40 \) 时,即使 \( \mu=0.50 \) 下拒绝率 > 92%,但设计未满足校准要求(名义功效 0.587 < 0.80),因此全 ECS 支持率为 0。说明:ECS 的非补偿性——强证据不能弥补弱设计。 - \( n=71, \mu=0.30 \) 时,传统拒绝率约 0.810,但全 ECS 支持率仅 0.510,因为许多拒绝的稳定性半径 ≤ 1。说明:稳定性坐标在边界附近起额外过滤作用。 - 零假设下,传统拒绝率约 0.049,全 ECS 支持率仅 0.007(\( n=71 \))。说明:稳定性坐标不膨胀 I 类错误。 - 分布偏离(\( t_3 \)、对数正态)下,全 ECS 支持率变化不大(0.506-0.569),表明框架不机械奖励增加名义拒绝率的分布。 - 目的:展示 ECS 坐标如何导致与传统显著性不同的解读,特别是非补偿性逻辑和稳定性在边界附近的过滤作用。
历史数据:Student 睡眠数据(第 9 节): - 数据/场景:10 名患者两种安眠药的睡眠时间差异(药物 2 减药物 1),均值 1.58 小时,标准差 1.23 小时。单侧配对 t 检验。 - 方法应用:证据坐标 \( E = 4.062 - 1.833 = 2.229 \)。稳定性坐标:声明加法偏移 \( b_0 = 0.25 \) 小时、标准误膨胀 \( r_0 = 10\% \),计算得 \( S = 3.33 \)(若 \( b_0 \) 翻倍至 0.50,则 \( S = 1.72 \))。校准坐标:原始报告无预设最小效应和功效目标,因此标记为“未预设”,仅提供描述性功效曲线。 - 结果:ECS 剖面为 \( (E=2.229, C=\text{未预设}, S=3.33) \)。说明:即使证据强、稳定性高,也不能事后制造设计信息。缺失的校准坐标本身是信息性的。 - 目的:展示 ECS 在无预设设计的历史数据中的应用,强调确认性校准与描述性校准的区别。
🔎 结论是否比证明窄¶
- Proposition 1 的精确性:作者明确声明(第 4 节):“Use Proposition 1 literally only when the perturbation map is affine and the unconstrained optimizer is admissible. Otherwise solve the constrained or nonlinear problem, or report the affine value explicitly as a surrogate with an approximation certificate.” 这是一个诚实的限制——精确闭式解仅适用于仿射扰动且无约束的情形。
- Lemma 1 的保守性:作者承认二次余项下界是保守的(“conservative certificate”),且“Directional information about the second-order term can sharpen this conservative certificate, but that refinement is not required for the ECS architecture.” 这意味着更紧的非线性证书是开放问题。
- Bootstrap 覆盖:第 8.4 节报告 95% 百分位 Bootstrap 区间覆盖率为 0.934-0.945(略低于名义 0.95),且作者警告“Near \( S=0 \), or when a perturbation set has corners or discrete model choices, ordinary bootstrap procedures may be nonregular.” 因此,稳定性半径的推断理论尚不完整。
- 联合检验大小:Proposition 4 仅给出大小上界 \( \alpha \),但未讨论功效。在交集-并集检验中,功效可能很低(因为需要所有分量都通过),作者在“Limitations”中承认“The conjunctive rule is intentionally conservative.”
四、开放问题(点到为止,扎根具体语句)¶
-
更紧的非线性稳定性证书:Lemma 1 的二次余项下界是保守的。作者提到“Directional information about the second-order term can sharpen this conservative certificate”(第 4 节),但未给出具体方法。扎根:第 4 节“Directional information about the second-order term can sharpen this conservative certificate, but that refinement is not required for the ECS architecture.” 以及第 11 节“Sharper nonlinear certificates and principled model neighborhoods are two of them.”
-
稳定性半径的非正则推断:Bootstrap 在 \( S \) 接近 0 或扰动集有角点时可能失效。作者仅给出初步模拟(覆盖略低于名义),未提供理论保证。扎根:第 8.4 节“Near \( S=0 \), or when a perturbation set has corners or discrete model choices, ordinary bootstrap procedures may be nonregular.” 以及第 11 节“Inference is harder too. Corners, radii near zero, discrete specification sets, or nonunique nearest failure points can produce nonregular sampling distributions.”
-
离散扰动集(如多宇宙分析)的稳定性度量:作者承认当“no metric is defensible, the honest report is the worst-case margin across the finite set, not an artificial numerical radius”(第 6 节),但未给出如何将离散扰动集纳入 ECS 稳定性坐标的通用框架。扎根:第 6 节“If no metric is defensible, the honest report is the worst-case margin across the finite set, not an artificial numerical radius.” 以及第 11 节“In some applications, an ordered metric may be scientifically unjustified. A finite worst-case specification report is then preferable to an artificial continuous radius.”
-
ECS 框架与贝叶斯假设检验的整合:作者提到证据坐标可替换为贝叶斯因子(第 2.1 节),但未讨论贝叶斯框架下的校准(如先验敏感性)和稳定性(如先验扰动)。扎根:第 2.1 节“A likelihood ratio, e-value, Bayes factor, or another monotone measure could replace the test-statistic margin.” 以及第 11 节“Evidence is still philosophically contested. ... ECS can accommodate different evidence coordinates. Comparisons across those paradigms still require care.”
Maintained by 陈星宇 · Homepage · Source on GitHub