跳转至

How Replicable Are Statistically Significant Findings?

作者: Patrick Vu, Stefan Faridani
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.23257


一、领域脉络与小综述

这个方向是什么
本文属于元科学(metascience)中关于统计显著性发现可复制性的子方向。根本问题是:在实证科学中,一个恰好达到常规显著性阈值(如 \(p=0.05\))的发现,若用相同样本量重复研究,它保持统计显著的概率是多少?当前该方向已积累大量关于复制危机、发表偏倚和统计功效的讨论,但缺乏一个基于条件期望的、可被实际复制结果验证的度量。

发展脉络
- 奠基工作:Cohen (1988) 系统引入统计功效分析;Ioannidis (2005) 提出“大多数已发表研究发现是假的”,引发复制危机讨论;Open Science Collaboration (2015) 和 Camerer et al. (2016, 2018) 开展大规模系统复制项目,提供实际复制结果。
- 主要进展:Andrews and Kasy (2019) 提出选择性发表模型(metastudy approach),从已发表研究中估计真实效应分布并校正发表偏倚,为本文提供框架基础。van Zwet and Goodman (2022) 在医学文献中估计 predictive power(无发表偏倚),发现低复制性。Lang (2025) 估计经济学中 65% 的窄拒绝可能是错误拒绝。
- 当前 frontier:本文首次将 predictive power 与实际复制结果进行校准验证,并开发非参数估计量,将其推广到更大规模的经济学文献。
- 本文位置:作者在 Andrews and Kasy (2019) 框架上定义 predictive power,证明其不受发表偏倚影响,用三个复制项目验证其预测准确性优于预测市场,再开发非参数估计量应用于 Brodeur et al. (2020) 数据集。

子线索聚类
1. 复制预测方法:预测市场(Dreber et al., 2015; Gordon et al., 2021)、专家调查(DellaVigna et al., 2019, 2020)、机器学习。本文的模型预测仅用原始 p 值,却略优于预测市场。
2. 发表偏倚与功效分析:Andrews and Kasy (2019) 的 metastudy 方法;Vu (2024) 解释复制率低的原因(winner's curse);Elliott et al. (2022) 检测 p-hacking。
3. 非参数反卷积:Carrasco and Florens (2011) 的谱方法;Faridani (2026) 用于检验低功效文献。本文将其用于估计 predictive power。

核心问题与瓶颈
- 核心问题:① 给定 p 值的发现复制概率是多少?② 如何从已发表研究中估计这个概率?③ 低复制概率的原因是什么?④ 如何解释复制结果?
- 主流方法:参数假设(如 gamma 分布)估计真实效应分布,或使用复制数据直接计算。瓶颈:参数假设可能不成立;复制数据稀缺且样本量小。

⚠️ 作者的 framing
作者把缺口 frame 成“缺乏一个可验证的、基于条件期望的度量,且不受发表偏倚影响”,从而本文成为“显然的下一步”:定义 predictive power,证明其不变性,用已有复制项目验证,再开发非参数估计量推广。竞争路线(预测市场)被淡化——作者指出其校准不佳(图 1 和表 1)。
什么明显该被引却未出现:关于贝叶斯因子或后验概率的文献(如 Wasserstein et al., 2019 虽被引但仅作为背景);关于 p-hacking 检测的 Elliott et al. (2022) 被引但仅在相关文献中。未见明显对立引用。

张力
未见明显对立引用。各工作基本一致认为复制率低,但对原因有不同侧重(发表偏倚 vs. 低功效)。本文明确将低复制性归因于低功效而非发表偏倚,与部分强调发表偏倚的文献(如 Open Science Collaboration, 2015)形成张力,但作者用 invariance 论证和实证(图 5)支持其观点。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

  • 符号
  • \(i\):研究索引。
  • \(\beta_i\):真实效应(未观测)。
  • \(\hat{\beta}_i\):估计效应。
  • \(\sigma_i\):标准误。
  • \(z_i = \beta_i / \sigma_i\):归一化真实效应。
  • \(\hat{z}_i = \hat{\beta}_i / \sigma_i\):归一化估计效应。
  • \(p\):双侧 p 值。
  • \(R\):复制成功指示变量(\(|\hat{z}_r| \ge 1.96\) 且符号与原始估计相同)。
  • \(r(p) = \Pr(R=1 \mid p, \text{published})\):predictive power。
  • \(\pi(z)\):真实效应密度(未观测)。
  • \(\tilde{\pi}(z) = (\pi(z) + \pi(-z))/2\):对称化密度。
  • \(s(\hat{z})\):发表概率函数。
  • \(D\):发表指示变量。

  • 模型
    数据生成过程(Andrews and Kasy, 2019):

  • 从分布 \(\pi\) 中抽取真实效应 \(z\)。
  • 给定 \(z\),估计效应 \(\hat{z} \mid z \sim N(z, 1)\)。
  • 发表概率 \(\Pr(D=1 \mid \hat{z}) = s(\hat{z})\),\(s\) 对称且严格正。
    复制:\(\hat{z}_r \mid z \sim N(z, 1)\),且与 \(\hat{z}\) 条件独立。

  • 可观测数据
    已发表研究的 \(|\hat{z}|\)(或等价地 p 值)。不可观测:\(z\)、未发表的研究。

第二步:最小内核
考虑最简单情形:无发表偏倚(\(s(\hat{z}) \equiv 1\)),且真实效应分布 \(\pi(z)\) 已知。此时 predictive power 退化为:

\[r(p) = \frac{\int_{\mathbb{R}} [1 - \Phi(1.96 - z)] \, \varphi(\text{cv}(p) - z) \, \pi(z) \, dz}{\int_{\mathbb{R}} \varphi(\text{cv}(p) - z) \, \pi(z) \, dz},\]

其中 \(\text{cv}(p) = \Phi^{-1}(1 - p/2)\),\(\varphi\) 和 \(\Phi\) 分别为标准正态密度和分布函数。

解释:给定原始 p 值(即 \(|\hat{z}| = \text{cv}(p)\)),复制成功的概率等于在给定原始估计值下真实效应 \(z\) 的后验分布中,复制估计 \(\hat{z}_r\) 超过临界值且符号相同的期望。这个表达式是条件期望,因此最小化均方预测误差。论文的核心就是估计这个量,并证明它不依赖于 \(s(\cdot)\)。

为什么这是最小内核:所有一般性(发表偏倚、非参数估计)都是在这个表达式上“加壳”。发表偏倚只改变不同 p 值的相对频率,但不改变给定 p 值下的条件分布(Theorem 1 证明)。非参数估计则是用 Hermite 展开逼近 \(\tilde{\pi}\) 并校正发表偏倚。


三、这篇论文做了什么

三句话
① 研究了恰好达到常规显著性阈值的发现在相同样本量复制中保持显著的概率,定义了 predictive power \(r(p)\)。
② 使用 Andrews and Kasy (2019) 的元研究方法参数估计真实效应分布,并开发了一个基于 Hermite 多项式展开的非参数估计量。
③ 在实验经济学、心理学、社会科学三个复制项目中验证了 \(r(p)\) 的预测准确性优于预测市场,发现 \(p=0.05\) 时复制概率仅 0.10–0.25,低复制概率主要源于低统计功效而非发表偏倚。

关键设定与假设
- 参数估计(Section 3.2):采用 Vu (2024) 的估计结果,假设真实效应和标准误独立,均服从 gamma 分布。该假设是 Andrews and Kasy (2019) 的 metastudy 方法的一部分。
- 非参数估计(Section 5.1):
- 假设发表概率为已知临界值处的阶梯函数(式 (8)),且对称。
- 观测值在文章内相关但文章间独立(Assumption 1)。
- 真实效应密度 \(\pi\) 存在且有界高度。
- 发表偏倚参数 \(\theta_0\) 可由 caliper ratio 一致估计,速率 \(q \in (0, 1/2]\)。
- 验证(Section 3.3):使用实际复制样本量(非相同样本量)构造预测,与预测市场比较。

主要结果
- Theorem 1:给出 \(r(p)\) 的表达式(式 (1)),证明其不依赖于发表偏倚函数 \(s(\cdot)\)。
- Theorem 2:非参数估计量 \(\hat{r}_n(p)\) 一致(当截断参数 \(J_n \sim (2q/\log 2) \log(An)\) 时,收敛速率 \(n^{q \log 2 \cdot (1+2\gamma^2)/(2+2\gamma^2)}\))。
- 实证结果:
- 图 2:参数估计下,\(r(0.05)\) 在实验经济学、心理学、社会科学分别为 0.25、0.22、0.10;\(r(0.01)\) 分别为 0.40、0.37、0.23。
- 图 4:非参数估计下,经济学 RCT 的 \(r(0.05)=0.34\),DID=0.50,RDD=0.45,IV=0.43。
- 验证(图 1、表 1):predictive power 校准完美(联合检验 \(p=0.762\)),Brier score 0.216 优于预测市场 0.220。
- 图 5:\(r(0.05)\) 与中位数样本量对数线性相关。

证明路线与技术技巧
- 整体路线:
1. 推导 \(r(p)\) 表达式(Theorem 1),利用 \(s\) 的对称性消去发表偏倚。
2. 参数估计:用 Vu (2024) 的 gamma 分布估计 \(\tilde{\pi}\)。
3. 非参数估计:将 \(\tilde{\pi}\) 展开为 Hermite 多项式基(式 (4)),截断到 \(J_n\) 项;用逆概率加权(式 (7))校正发表偏倚;代入 \(r(p)\) 表达式得到估计量(式 (5))。
4. 证明一致性:分解为截断偏差和随机误差,平衡二者(Theorem B.2)。
- 关键跳跃点:
- Theorem 1 证明中,利用 \(s\) 对称性消去发表偏倚(式 (A.1) 中 \(s(x)=s(-x)\) 导致分子分母中的 \(s\) 抵消)。
- 非参数估计中,证明截断偏差以 \(\rho^{J_n} J_n^{3/4}\) 衰减(Lemma B.2, B.3),随机误差以 \(n^{-q} 2^{J_n/2}\) 增长,通过选择 \(J_n \sim \log n\) 平衡。
- 技术技巧:
- Hermite 多项式展开(Carrasco and Florens, 2011)用于反卷积。
- 逆概率加权(IPW)校正发表偏倚(式 (7))。
- Caliper ratio 估计阶梯函数发表偏倚(Faridani, 2026)。
- Cauchy 积分公式求 Hermite 系数界(Lemma B.2 证明)。
- 生成函数方法(Hermite 生成函数)推导 \(a_j, d_j\) 的界。

真实例子与应用
- 参数验证:三个复制项目(Camerer et al., 2016; OSC, 2015; Camerer et al., 2018)用于估计和验证。验证时使用实际复制样本量(非相同样本量),构造 modified predictive power(Lemma A.1)。
- 非参数应用:Brodeur et al. (2020) 数据集,21,740 个 t-ratio,按研究设计(RCT, RDD, DID, IV)分别估计。结果见图 4。图 5 显示复制概率与中位数样本量对数线性相关,说明低复制性主要源于小样本。
- 例子说明:验证 predictive power 的预测能力;展示非参数估计量在大型元样本上的可行性;强调低复制性并非主要由 p-hacking 或发表偏倚导致。

🔎 结论是否比证明窄
- Theorem 2 的一致性依赖于发表偏倚估计的速率 \(q\),实际中 \(q\) 可能未知或小于 1/2。作者未给出自适应选择 \(J_n\) 的方法。
- 非参数估计量不能用于小复制项目(Section 5 明确说“cannot be applied to the replication studies due to the small number of observations”)。
- 后验更新分析(图 3)仅基于参数估计,非参数部分无法做(Section 5.2 脚注 17:“The additional analyses in Figure 3 are not feasible with the nonparametric estimator because they require estimation of \(\tilde{\pi}\) itself.”)。
- 结论“低复制概率主要源于低统计功效”在参数和非参数下都成立,但非参数部分无法直接验证“winner’s curse”机制(图 C3 仅基于参数估计)。


四、开放问题

  1. 非参数估计量的有限样本性质:Theorem 2 的收敛速率依赖于发表偏倚估计的速率 \(q\),但实际中 \(q\) 可能小于 1/2。需要更精确的有限样本界或自适应截断选择。(扎根于 Theorem 2 的假设和证明中关于 \(q\) 的讨论,以及 Lemma B.1 中 \(q \le 1/2\) 的假设。)

  2. 研究间异质性的处理:当前模型假设 i.i.d.,但实际文献中研究可能来自不同子领域、不同样本量。如何将 predictive power 推广到允许异质性的设定?(扎根于 Section 2.1 的 i.i.d. 假设,以及 Section 5.2 按研究设计分组的做法——这暗示了异质性的存在但未建模。)

  3. 发表偏倚函数的更灵活建模:非参数估计假设发表概率为阶梯函数(式 (8))。更灵活的模型(如连续函数)下的识别和估计,以及 caliper ratio 估计量的稳健性。(扎根于 Section 5.1 的阶梯函数假设和 caliper ratio 估计方法。)

  4. 非正态检验统计量的推广:当前依赖 \(\hat{z} \mid z \sim N(z,1)\) 的正态近似。对于 t 统计量、F 统计量或非参数检验,predictive power 的表达式和估计方法如何调整?(扎根于 Section 2.1 的正态假设,以及 Section 3.1 中 OSC 2015 子样本筛选“well-approximated by z-statistics”的做法。)


Maintained by 陈星宇 · Homepage · Source on GitHub

评论