跳转至

When is statistical evidence strong enough? Using hypothesis tests to value data collection

作者: Aristotelis Epanomeritakis, Davide Viviano
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2609.09544


一、领域脉络与小综述

这个方向是什么
本文属于"统计决策理论 + 政策评估"的交叉地带:把显著性检验从"是否拒绝原假设"的二元判断,重新理解为"立即做政策决定 vs. 推迟决定、收集更多证据"的三分决策问题。核心问题是:给定一个带有抽样误差的政策效果估计,什么时候证据已经"足够强"到可以直接行动,什么时候应该花钱做后续实验?这个子方向试图为显著性水平的选择提供经济理论基础,而不是依赖 5% 或 1% 的惯例。当前成熟度中等:Neyman–Pearson 框架和 Wald 序贯分析是经典基石,但把显著性水平内生化为成本与精度的函数、并给出可报告的统计量(A-value)的做法,属于较新的尝试。

发展脉络(history)
- 奠基工作:Neyman and Pearson (1933) 建立假设检验的二元决策框架;Wald (1947) 引入序贯抽样,允许"继续收集数据"作为中间决策;Savage (1951) 提出 minimax regret 准则,为后文提供目标函数;Chow (1970) 提出带拒绝选项(reject option)的分类问题,是"弃权"概念的早期来源。 - 主要进展:Manski (2004) 将统计检验嵌入 treatment choice 的决策理论,指出传统显著性水平缺乏 welfare 基础;Tetenov (2012, 2016) 在 minimax regret 框架下推导最优显著性水平,发现 5% 惯例只有在特定损失函数下才合理;Azevedo et al. (2020, 2023) 研究最优 A/B 测试的显著性水平与样本量;Abadie et al. (2023) 用经验贝叶斯方法估计"证据的价值";Ramdas and Wang (2021, 2025) 与 Vovk and Wang (2021) 发展 e-values 和连续监测方法,允许证据强度随时间累积。 - 当前 frontier:在多个政策问题之间分配有限的实验资源,同时考虑每个问题的证据强度、福利影响和后续实验成本。本文的 Theorem 2 直接处理这一资源分配问题。 - 本文位置:作者把上述线索收拢为一个两阶段、两期的高斯位置模型:第一阶段看到初始估计 \(X_1\),选择立即行动或弃权;弃权则第二阶段看到独立估计 \(X_2\),再做最终决定。他们证明最优规则是阈值规则,并逆推出 A-value 作为"证据强度"的经济度量。

子线索聚类
1. 决策理论基础的假设检验:Neyman–Pearson (1933)、Manski (2004)、Tetenov (2012, 2016)、Kim and Choi (2021)。这条线质疑固定显著性水平,主张根据损失函数和先验/参数空间选择检验水平。 2. 序贯实验与停止规则:Wald (1947)、Arrow et al. (1949)、Chernoff (1961)、Adusumilli (2026)。这条线处理"何时停止收集数据",但多数文献假设连续时间或无限期,本文限制为两期。 3. 信息价值与贝叶斯/经验贝叶斯方法:Raiffa and Schlaifer (1961)、Grundy et al. (1954, 1956)、Abadie et al. (2023)、Azevedo et al. (2023)。这条线用先验分布计算额外数据的期望收益,本文则用 minimax regret 避免先验。 4. 多重检验与资源分配:本文 Theorem 2 涉及在多个政策间分配实验容量,但引言未深入引用 Benjamini–Hochberg 等 FDR 文献,而是从决策理论角度处理。

这个方向在追问的核心问题
- 显著性水平应该是多少?它如何随数据收集成本、政策后果的规模、后续实验的精度变化? - 如何用一个数字(如 A-value)同时概括"统计证据强度"和"经济上是否值得继续实验"? - 当实验资源有限时,如何跨政策排序"进一步实验的优先级"?

主流方法与已知瓶颈
- 主流方法:固定阈值(0.05)、p-value 报告、功效分析、贝叶斯因子、e-values。瓶颈在于这些方法要么忽略决策后果(p-value),要么需要先验(贝叶斯),要么只控制错误率而不直接对应福利(e-values)。 - 本文方法:minimax regret 不需要先验,但需要指定参数空间 \([- \bar\Delta, \bar\Delta]\) 和成本 \(c\);瓶颈在于这些量在实际政策评估中可能难以精确指定。

⚠️ 作者的 framing(这是作者的说法)
作者在引言中把现有争论框定为:显著性检验的批评者(Amrhein et al., 2019; Wasserstein and Lazar, 2016)与捍卫者之间的僵局,源于缺乏一个"经济上合理"的决策框架。作者声称他们的贡献是:在 minimax regret 下,最优决策自动变成一个显著性检验,其水平由成本与精度内生决定;因此"统计显著性"和"经济显著性"被统一在同一个框架里。他们强调自己的方法不需要先验,是频率学派的,并且适用于单个研究(不需要大量研究的分布假设)。他们淡化了贝叶斯/经验贝叶斯方法(Abadie et al., 2023)在利用跨研究信息上的优势,理由是这些方法依赖可交换性假设,在政策评估中未必成立。

什么明显该被引 / 该存在、却没出现在 intro 里?(值得去查的问题)
- 关于"价值信息"(value of information)的经典决策分析文献(如 Howard, 1966; Raiffa, 1968)没有被引用,尽管 A-value 本质上是一种 VOI 度量。 - 关于 minimax regret 估计的现代文献(如 Berger, 1985; van der Vaart, 1998)没有出现,作者直接使用了 Savage (1951) 的原始框架。 - 多重检验与 FDR 文献(Benjamini & Hochberg, 1995)未被讨论,尽管 Theorem 2 的资源分配问题与多重检验的"哪些发现值得跟进"有结构相似性。 - 连续监测/自适应设计的现代方法(如 group sequential designs, Jennison & Turnbull, 2000)未被引用,作者只提到 Wald 的经典序贯分析。

张力
- 论文自身展示了 A-value 排序与 empirical Bayes 排序的显著差异(Table 6),这构成一种张力:两种"价值"度量在同一个数据集上给出不同的实验优先级。作者将这种差异归因于经验贝叶斯对先验的依赖,但并未提供无先验情况下如何验证排序可靠性的准则。 - 另一个张力:minimax regret 的最优阈值在 \(\bar\Delta / s_1 \ge 0.76\) 时独立于 \(\bar\Delta\)(Proposition 1),这看似方便,但也意味着参数空间的上界在很大范围内不影响决策——这与直觉上"政策后果越大越应该谨慎"相悖。作者的解释是,当初始实验足够精确时,最坏情况由中等效应决定,而非极端效应。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

  • \(\Delta \in [-\bar\Delta, \bar\Delta]\):真实福利效应,未知。\(\Delta > 0\) 表示政策优于现状,\(\Delta < 0\) 表示政策有害。\(\bar\Delta\) 是已知的福利效应上界。
  • \(X_1 \sim N(\Delta, s_1^2)\):第一阶段可观测的估计量,无偏,方差 \(s_1^2\) 已知。这是研究者最初拿到的证据。
  • \(X_2 \sim N(\Delta, s_2^2)\):第二阶段可观测的估计量,独立于 \(X_1\),方差 \(s_2^2\) 已知。只有选择"弃权"才会收集到 \(X_2\)。
  • \(c \ge 0\):收集 \(X_2\) 并延迟决策的福利成本(例如实验费用、等待期间的机会成本)。
  • \(\delta_1(X_1) \in \{0, 1, \text{NA}\}\):第一阶段决策。1 = 立即实施政策;0 = 立即维持现状;NA = 弃权,进入第二阶段。
  • \(\delta_2(X_1, X_2) \in \{0, 1\}\):第二阶段最终决策,仅在 \(\delta_1 = \text{NA}\) 时使用。
  • 损失函数:若最终决策错误(选了 1 但 \(\Delta < 0\),或选了 0 但 \(\Delta > 0\)),损失 \(|\Delta|\);若弃权,额外损失 \(c\)。正确决策损失为 0。
  • Regret:某策略的期望损失减去"知道 \(\Delta\) 时的最优损失"(即 0)。Minimax regret 目标:在所有可测策略中最小化 \(\sup_{|\Delta| \le \bar\Delta} \text{Regret}\)。
  • 标准化参数:\(w = s_2 / s_1\)(后续实验相对精度),\(\gamma = c / s_1\)(标准化成本)。
  • \(\tau^\star(w, \gamma)\):最优第一阶段阈值。决策规则为:
    \[\delta_1^\star(X_1) = \begin{cases} 1 & X_1 / s_1 \ge \tau^\star, \\ 0 & X_1 / s_1 \le -\tau^\star, \\ \text{NA} & |X_1| / s_1 < \tau^\star. \end{cases}\]
    第二阶段决策为 \(\delta_2^\star = 1\{s_2^2 X_1 / s_1^2 + X_2 \ge 0\}\),即基于两期信息加权平均的符号。
  • A-value(Definition 2):
    \[A_{\text{value}}(X_1; s_1, w) = s_1 \inf\{\gamma : |X_1|/s_1 \ge \tau^\star(w, \gamma)\}.\]
    它是使当前证据刚好达到"立即行动"标准所需的后续实验成本。若实际成本 \(c < A_{\text{value}}\),则弃权;否则立即决策。

第二步:最小内核

把一般模型剥到只剩一个位置参数、一个观测、一个可选第二观测。假设 \(s_1 = s_2 = 1\)(等精度),\(\bar\Delta\) 足够大(\(\ge 0.76\)),成本 \(c\) 给定。那么最优规则是:

  • 若 \(X_1 \ge \tau^\star(c)\),实施政策;
  • 若 \(X_1 \le -\tau^\star(c)\),维持现状;
  • 若 \(|X_1| < \tau^\star(c)\),再做一次等精度实验,然后根据 \(X_1 + X_2\) 的符号决定。

这个规则看起来就像"双边 z 检验",但临界值 \(\tau^\star\) 不是 1.96,而是由成本 \(c\) 决定的递减函数。从 Table 1 可以读出几个关键数值(\(w=1\)):

标准化成本 \(c/s_1\) 最优阈值 \(\tau^\star\)
0.025 0.880
0.050 0.564
0.100 0.265
0.150 0.109
0.200 0.010
0.250 0

当 \(c \to 0\) 时,\(\tau^\star \to \infty\):免费证据使得任何初始证据都不足以立即行动,永远值得再收集一个观测。当 \(c\) 很大时,\(\tau^\star = 0\):后续实验太贵,直接根据 \(X_1\) 的符号决定。

A-value 在这个例子中就是:给定观测到 \(X_1 = x\),找到使 \(\tau^\star(c) = |x|\) 的那个成本 \(c\)。例如,若 \(x = 1.96\)(对应 p=0.05),则 \(A_{\text{value}} \approx 0.0015\)(Table 1 Panel B)。意思是:如果再做一次等精度实验的成本低于 0.0015 个福利单位,那么即使 p=0.05 也应当弃权、继续收集数据;如果成本高于 0.0015,则直接实施政策。这个例子展示了 A-value 的核心思想:它把 p-value 翻译成"值得为额外证据支付的最高价格"。

为什么这个内核是整篇论文的支撑?因为所有后续结果(A-value 的单调性、排序规则、regret bound)都建立在这个两期阈值规则之上。多期扩展(Theorem 3)只是把"再做一次实验"换成"再做若干次实验",但最优策略的结构不变:每一期都是关于累计证据的阈值规则。


三、这篇论文做了什么

三句话
① 研究问题:在 minimax regret 准则下,一个理性的政策制定者应该如何根据初始证据决定"立即行动"还是"收集更多证据"?
② 核心方法:建立两阶段高斯位置模型,将决策问题转化为阈值规则,并逆推出 A-value 作为衡量证据强度的经济指标;进一步扩展到多政策资源分配。
③ 主要结论:最优决策等价于一个显著性水平由成本与精度内生决定的统计检验;A-value 随 p-value 增大而增大、随初始精度增大而减小;按 A-value 排序分配有限实验资源具有有限样本 welfare 保证。

关键设定与假设

  • Assumption 1(无偏实验):\(X_1 \sim N(\Delta, s_1^2)\),方差已知。论文指出,若方差未知但可一致估计,则结论渐近成立。
  • Assumption 2(弃权 = 序贯抽样):弃权后收集 \(X_2 \sim N(\Delta, s_2^2)\),独立于 \(X_1\),成本 \(c\)。两期实验的精度比 \(w = s_2/s_1\) 是外生给定的。
  • Assumption 3(多政策独立性):\(J\) 个政策问题相互独立,每个有各自的 \(\Delta_j, s_{1j}, s_{2j}\),但共享一个容量约束:最多做 \(q\) 个后续实验。
  • 参数空间:\(\Delta \in [-\bar\Delta, \bar\Delta]\),\(\bar\Delta\) 已知。Proposition 1 要求 \(\bar\Delta / s_1 \ge 0.76\),以保证最坏情况出现在中等效应处,从而阈值不依赖于 \(\bar\Delta\)。
  • 损失函数:错误决策的损失等于 \(|\Delta|\),即政策效果的绝对值。这意味着犯错的代价与真实效应大小成正比。

主要结果

  1. Theorem 1(置信区间表示):存在 minimax regret 最优策略,形式为:
  2. 第一阶段:\(X_1/s_1 \ge \tau^\star\) 则实施,\(\le -\tau^\star\) 则拒绝,中间则弃权;
  3. 第二阶段:基于 \(s_2^2 X_1 / s_1^2 + X_2\) 的符号做最终决定。 \(\tau^\star\) 是某个 minimax 问题的解,只依赖于 \(w\) 和 \(\gamma = c/s_1\)。这个定理把"显著性检验"重新解释为"弃权区域"的边界。

  4. Proposition 1(阈值性质):

  5. (A) 当 \(\bar\Delta / s_1 \ge 0.76\) 时,\(\tau^\star\) 与 \(\bar\Delta\) 无关,只取决于 \(w\) 和 \(\gamma\)。
  6. (B) \(\tau^\star(w, \gamma)\) 对每个固定 \(w\) 是 \(\gamma\) 的连续、非增函数;\(\tau^\star(w, 0) = \infty\),且对 \(\gamma > 0\) 有限。直觉:后续实验越贵,越不需要很强的初始证据就立即行动。

  7. Proposition 2(A-value 性质):

  8. A-value 只通过 \(|X_1|/s_1\)(即 p-value)依赖数据;
  9. 固定 \(s_1, w\) 时,A-value 随 p-value 增大而增大(证据越弱,额外信息越值钱);
  10. 固定 p-value 时,A-value 随 \(s_1\) 增大而增大(初始估计越不精确,额外信息越值钱);
  11. 决策规则:弃权当且仅当 \(c < A_{\text{value}}\)。因此 A-value 是"盈亏平衡成本"。

  12. Theorem 2(top-q A-value 的 regret bound):在 \(J\) 个独立政策问题中,若只能做 \(q\) 个后续实验,选择 A-value 最大的 \(q\) 个政策进行后续实验。该策略的 regret 相对于无约束最优策略(每个政策都能免费获得第二期数据)的差距不超过:

    \[\frac{J-q}{J} \mathbb{E}_{\Delta=0}[A_{(q)}],\]
    其中 \(A_{(q)}\) 是第 \(q\) 大的 A-value。上界在 \(\Delta=0\) 处取得,且可解析计算。这给出了一个有限样本 welfare 保证:当边际 A-value 很小时,容量约束造成的损失很小。

  13. Theorem 3(多期扩展):将两期推广到 \(H\) 期,最优策略仍是阈值规则,每期阈值 \(\tau^\star_h\) 由剩余期数、成本序列和精度序列决定。证明使用 Wald (1950) 的 minimax 定理和动态规划。

证明路线与技术技巧

  • Theorem 1 的路线:先考虑 Bayes 问题,对任意先验 \(\pi\) 求最优策略;然后利用 minimax 定理(Wald, 1950)证明存在最小最大策略。关键步骤是证明最坏情况先验是对称两点分布(或连续对称分布),从而把无限维优化化为关于阈值 \(\tau\) 的一维优化。技术技巧包括:将 regret 分解为"错误决策概率 × \(|\Delta|\)"加上"弃权概率 × \(c\)";利用高斯分布的平移不变性,将问题标准化为 \(N(d,1)\),其中 \(d = \Delta/s_1\);通过变量替换 \(x = X_1/s_1\) 和 \(y = X_2/s_2\) 化简积分。
  • Proposition 1 的路线:证明 \(\tau^\star\) 的单调性使用隐函数定理和比较静态分析。关键引理是"弃权区域的边界满足某个方程",该方程左侧在 \(\tau\) 上严格递减,在 \(\gamma\) 上严格递增,从而保证唯一解和单调性。技术技巧包括:对高斯分布使用 Mills 不等式;利用 \(\tanh\) 函数的性质简化表达式。
  • Theorem 2 的路线:将多政策问题视为"独立子问题的组合"。对每个政策,A-value 是"继续实验的期望收益"的单调变换。容量约束下的最优选择是收益最大的 \(q\) 个。Regret bound 通过交换期望和上确界得到,关键不等式是:
    \[\sup_{\Delta} \mathbb{E}_\Delta[\text{regret}] \le \mathbb{E}_{\Delta=0}[\text{regret}],\]
    该不等式由 A-value 的单调性和高斯分布的对称性推出。技术技巧包括:随机占优、次序统计量的期望、以及 A-value 作为 \(s_1\) 的线性函数的尺度等变性。
  • Theorem 3 的路线:动态规划 + 反向归纳。每期的值函数是当前累计证据 \(T_h\) 的偶函数,且满足某个常微分方程。阈值 \(\tau^\star_h\) 由"继续 vs 停止"的边际条件决定。技术技巧包括:共轭先验(高斯先验下后验仍是高斯)、Bellman 方程的单调性、以及用概率测度变换处理最小最大问题。

真实例子与应用

  • 数据:42 个无条件现金转移(UCT)项目的估计效应和标准误,来自 Crosta et al. (2024) 的元分析数据集。效应量是家庭月消费变化(每 100 美元转移,2010 年美元购买力平价)。
  • 方法:对每个项目,假设后续实验与初始实验等精度(\(w=1\)),计算 A-value。然后比较三种排序规则:(i) 按 p-value 升序(传统"最显著优先");(ii) 按标准误降序("最不精确优先");(iii) 按 A-value 降序("最值得进一步实验优先")。
  • 结果:
  • A-value 分布强烈右偏:多数项目 A-value 接近 0(证据已经足够强或太弱,不值得再实验),少数项目 A-value 很大(初始估计不精确且效应接近零,进一步实验价值高)。
  • 与 p-value 排序相比,A-value 排序在 10 个名额中共享 7–8 个(无成本时)或 5–6 个(有成本时)。差异主要来自标准误:p-value 相同但标准误更大的项目,A-value 更大。
  • 与标准误排序相比,A-value 排序更倾向于"效应估计接近零但标准误大"的项目,而不是"效应估计为负但标准误大"的项目,因为后者即使进一步实验也不太可能改变政策建议。
  • 当实验成本 \(c\) 从 0 增加到 0.05 时,最优阈值 \(\tau^\star\) 从无穷大降到约 0.56,被选中的项目数量减少,且排序变化不大(Spearman 秩相关 > 0.9)。
  • 例子想说明什么:p-value 排序忽略了福利规模;标准误排序忽略了效应估计的位置;A-value 同时考虑了二者,并且给出了一个经济上可解释的"截止值"(成本低于 A-value 才值得实验)。

🔎 结论是否比证明窄

  • 论文在摘要和引言中声称"推荐报告 A-value 以确定哪里最需要额外数据收集",但 Theorem 2 的证明严格依赖于高斯性、已知方差、独立性、以及所有政策共享同一成本 \(c\)。对于非高斯、异方差、相关政策或成本异质的情况,论文没有给出证明,只在结论中推测"可以扩展"。
  • Proposition 1 的结论(\(\tau^\star\) 不依赖 \(\bar\Delta\))只在 \(\bar\Delta / s_1 \ge 0.76\) 时成立。对于初始实验非常不精确(\(s_1\) 很大)或政策后果上界很小的情况,阈值可能依赖 \(\bar\Delta\),但论文没有刻画这一区域的最优策略。
  • Theorem 3 的多期扩展只证明了阈值规则的存在性,没有给出阈值的解析表达式,也没有讨论"最优停止期数"的选择——即如果成本随期数变化,可能提前停止比继续实验更好,但论文假设期数 \(H\) 固定。
  • 实证部分只计算了 A-value 并比较排序,没有验证"按 A-value 排序"在真实数据上的 welfare 是否优于其他规则;Theorem 2 的 bound 是理论上的,没有在 42 个项目上计算实际 regret。

四、开放问题(点到为止,扎根具体语句)

  1. 最优后续实验精度的选择:论文在 Assumption 2 中把 \(s_2\)(后续实验的精度)视为给定,但在结论部分提到"选择后续实验的样本量作为初始证据的函数"是未来工作。具体要算的是:给定 \(X_1, s_1, c(n)\),最优的 \(n\)(样本量)是多少?这需要将 \(s_2(n)\) 和 \(c(n)\) 同时内生化。

  2. 非高斯与未知方差:Assumption 1 假设高斯且方差已知。论文在脚注中承认"方差未知时可用一致估计代替,结论渐近成立",但没有给出有限样本的 regret bound。开放问题是:在重尾分布或异方差下,阈值规则是否仍然 minimax?A-value 是否仍然单调?

  3. 相关政策与共享信息:Theorem 2 假设 \(J\) 个政策完全独立。实际中,不同政策的效果可能相关(例如同一国家的不同项目)。开放问题是:当 \(\Delta_j\) 之间存在相关性时,A-value 排序是否仍然最优?是否应该利用跨政策信息(如经验贝叶斯收缩)来改进排序?

  4. 成本异质性与预算内生:论文的容量约束是"最多做 \(q\) 个实验",但每个实验的成本可能不同(例如不同国家的数据收集成本不同)。结论部分提到"将 A-value 减去成本 \(c_j\) 进行排序"是直接扩展,但没有证明这种扩展的 regret bound。开放问题是:在成本异质且预算连续的情况下,最优选择是 A-value 最大的 \(q\) 个,还是需要调整?

  5. 多期模型中的最优停止:Theorem 3 假设固定期数 \(H\),但实际中研究者可以选择在任何一期停止。开放问题是:当 \(H\) 不固定且每期成本不同时,最优停止规则是什么?是否仍是阈值规则?阈值如何随时间衰减?

提醒:要确认以上哪些是真正的 gap,建议去读同一子领域近期约 5 篇论文的引言(例如关于"value of information"的决策分析文献、关于"minimax regret treatment choice"的计量经济学文献、关于"e-values"的序列检验文献)。如果多篇都指向同一个未解决问题,那很可能是共识性 gap;如果各篇说法互相矛盾,那可能是一个值得切入的争议点。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论