How Replicable Are Statistically Significant Findings?¶
作者: Patrick Vu, Stefan Faridani
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.23257
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的是实证科学中统计显著性发现的可复制性。具体而言,它回答一个根本问题:恰好达到常规显著性阈值(如 \(p=0.05\))的发现,在相同样本量的重复研究中保持显著的概率有多高?这个问题处于元科学(metascience)与假设检验理论的交汇处,核心关注的是统计功效、发表偏倚与p值分布之间的关系。该子方向当前成熟度较高:已有大量关于复制危机、功效分析、发表偏倚检测的文献,但直接对“给定p值的复制概率”进行系统估计与验证的工作较少,本文是其中一项关键进展。
发展脉络(history)¶
奠基工作:Cohen (1988) 系统定义了统计功效,指出许多研究功效不足。Ioannidis (2005) 提出“为什么大多数发表的研究发现是假的”,将低功效与发表偏倚联系起来。这些工作奠定了复制危机的理论基础。
主要进展:Andrews and Kasy (2019) 提出了选择性发表的结构模型,将发表概率建模为估计值的函数,并利用元分析数据识别真实效应分布。这是本文最直接的前身。van Zwet and Goodman (2022) 在医学研究中估计了预测功效(predictive power),但未建模发表偏倚。Lang (2025) 估计经济学中约65%的窄拒绝可能是错误拒绝。这些工作逐步将复制概率的估计从定性讨论推向定量建模。
当前frontier:预测复制结果的方法包括预测市场(Dreber et al., 2015; Gordon et al., 2021)、专家调查(DellaVigna et al., 2019, 2020)和机器学习。但这些方法资源密集,且缺乏理论保证。本文提出的预测功效曲线(predictive power curve)是一种基于模型的低代价替代方案。
本文的位置:作者声称这是“首次验证预测功效与实际复制结果”的工作(第4页:“to our knowledge, it is the first study to validate predictive power against actual replication outcomes”)。它同时建模了发表偏倚(Andrews and Kasy 2019 的框架),并开发了非参数估计量,将适用范围扩展到无复制数据的更大文献。
子线索聚类¶
- 复制与统计功效(Cohen, 1988; Ioannidis, 2005; Loken and Gelman, 2017; DellaVigna and Linos, 2022):关注功效不足如何导致低复制率,以及测量误差、p-hacking等的作用。
- 预测复制结果(Dreber et al., 2015; Altmejd et al., 2019; DellaVigna et al., 2019, 2020; Gordon et al., 2021):使用预测市场、调查、机器学习等方法预测复制是否成功。
- 选择性发表与p-hacking检测(Card and Krueger, 1995; Franco et al., 2014; Andrews and Kasy, 2019; Elliott et al., 2022; Brodeur et al., 2016, 2020):建模发表偏倚,利用p值分布的不连续性检测p-hacking。
核心问题与已知瓶颈¶
- 核心问题:给定p值的复制概率是多少?低复制性的主要原因是什么(低功效 vs. 发表偏倚 vs. p-hacking)?如何改进?
- 已知瓶颈:真实效应分布不可观测,需从已发表数据中识别;发表偏倚使估计复杂化;复制研究通常使用更大样本,导致复制率被高估;预测市场等资源密集方法难以推广。
⚠️ 作者的 framing¶
作者将缺口 frame 为“评估显著性检验本身”(第2页:“evaluate significance testing on its own terms”),声称低复制性主要源于低统计功效而非发表偏倚或p-hacking。他们淡化了p-hacking的作用,强调即使没有这些扭曲,低功效也会导致低复制性。竞争路线(如预测市场)被定位为资源密集且准确性略低。明显该被引但未出现在intro中的工作:关于p值校准的文献(如Benjamin et al. 2018的“重新定义统计显著性”虽被提及但未深入讨论),以及关于贝叶斯替代方法的文献(如Wasserstein et al., 2019)。这些可能暗示作者有意聚焦于频率学派框架内的评估。
张力¶
未见明显对立引用。各被引工作基本一致认为低功效是复制危机的重要原因,分歧主要在于发表偏倚和p-hacking的相对贡献。本文的独特贡献在于量化了给定p值下的复制概率,并证明其不受发表偏倚影响。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号(逐个点名):
- \(i\):研究索引。
- \(\beta_i\):真实效应(unobserved parameter)。
- \(\hat{\beta}_i\):效应估计(random variable)。
- \(\sigma_i\):标准误(assumed known)。
- \(z_i = \beta_i / \sigma_i\):归一化真实效应(true effect,unobserved)。
- \(\hat{z}_i = \hat{\beta}_i / \sigma_i\):归一化估计效应(estimated effect,observed after publication)。
- \(p\):双侧p值(observed)。
- \(\text{cv}(p) = \Phi^{-1}(1 - p/2)\):对应p值的临界值(deterministic function)。
- \(R\):复制成功指示变量(\(R = 1\) 若 \(|\hat{z}_r| \geq 1.96\) 且符号与原始估计相同)。
- \(r(p) = \Pr(R = 1 \mid p, D=1)\):预测功效(predictive power),即给定原始p值且已发表条件下的复制概率。
- \(\pi(z)\):真实效应密度(unobserved)。
- \(\tilde{\pi}(z) = (\pi(z) + \pi(-z))/2\):对称化真实效应密度(identified from data)。
- \(s(\hat{z})\):发表概率函数(assumed symmetric and strictly positive)。
- \(D\):发表指示变量(\(D=1\) 表示已发表)。
模型(选择性发表模型,Andrews and Kasy 2019):
- 真实效应从分布中抽取:\(z \sim \pi\)。
- 估计效应:\(\hat{z} \mid z \sim N(z, 1)\)(标准误归一化为1)。
- 发表选择:\(\Pr(D=1 \mid \hat{z}) = s(\hat{z})\),其中 \(s(\cdot)\) 对称且严格正。
可观测数据:已发表研究的双侧p值(或等价地 \(|\hat{z}|\))。不可观测:真实效应 \(z\),未发表的研究,以及发表概率函数 \(s(\cdot)\) 的具体形式(但假设其对称)。
第二步:最小内核¶
考虑最简特例:没有发表偏倚(\(s(\hat{z}) \equiv 1\)),且真实效应分布 \(\pi(z)\) 已知。此时,对于给定的p值,原始估计的绝对值固定为 \(\text{cv}(p)\)。复制成功的概率为:
直觉:给定原始p值,原始估计的绝对值是 \(\text{cv}(p)\),但真实效应 \(z\) 仍不确定。其后验密度正比于 \(\phi(\text{cv}(p) - z) \tilde{\pi}(z)\)(因为 \(\hat{z}\) 可以是 \(\text{cv}(p)\) 或 \(-\text{cv}(p)\),对称性导致使用 \(\tilde{\pi}\))。复制成功的概率是给定 \(z\) 下复制显著的概率 \(1 - \Phi(1.96 - z)\) 的加权平均。如果 \(\tilde{\pi}(z)\) 集中在零附近,则 \(r(p)\) 低;如果集中在大的 \(z\),则 \(r(p)\) 高。
为什么这是最小内核:论文的一般情形(有发表偏倚、非参数估计)本质上只是在这个公式基础上增加对 \(\tilde{\pi}\) 的估计和发表偏倚的校正。定理1证明,即使有发表偏倚,\(r(p)\) 的表达式不变(因为 \(s(\cdot)\) 在分子分母中抵消)。因此,整篇论文的核心数学任务就是估计对称化真实效应分布 \(\tilde{\pi}(z)\),然后代入上述公式计算 \(r(p)\)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在实证科学中,恰好达到常规显著性阈值(如 \(p=0.05\))的发现,在相同样本量的重复研究中保持显著的概率(预测功效 \(r(p)\))。
- 核心工具/方法:利用Andrews and Kasy (2019)的选择性发表模型,推导出 \(r(p)\) 仅依赖于对称化的真实效应分布 \(\tilde{\pi}(z)\),且不受发表偏倚影响;采用参数方法(metastudy approach)估计 \(\tilde{\pi}\) 并验证预测准确性;开发非参数估计量(基于Hermite多项式展开和谱截断)用于更大数据集。
- 主要结论:\(p=0.05\) 的发现复制概率在实验经济学为0.25,心理学0.22,社会科学0.10;低复制性主要源于低统计功效而非发表偏倚;非参数估计显示RCT的 \(p=0.05\) 复制概率为0.34,准实验研究更高(0.43-0.50)但仍低。
关键设定与假设¶
- 选择性发表模型(Section 2.1):\(z \sim \pi\),\(\hat{z} \mid z \sim N(z,1)\),发表概率 \(s(\hat{z})\) 对称且严格正。这是整个分析的基础。
- 复制定义:复制成功 = 双侧5%显著且符号与原始估计相同(与OSC 2015等一致)。
- 基准复制样本量:与原始研究相同(Section 2.2)。验证时使用实际复制样本量(Lemma A.1)。
- 参数估计假设(Section 3.2):真实效应和标准误独立,均服从Gamma分布(metastudy approach, Andrews and Kasy 2019)。这是较强的参数假设。
- 非参数估计假设(Section 5.1):
- 发表概率为已知临界值的阶梯函数(式8)。
- 存在一致估计 \(\hat{\theta}_n\) 满足 \(\sup_t |1/s_{\hat{\theta}_n}(t) - 1/s_{\theta_0}(t)| = O_p(n^{-q})\),\(q \in (0, 1/2]\)。
- 真实效应密度 \(\pi\) 存在且有界高度。
- 观测值在文章内可依赖,但文章间独立,每篇文章最多贡献 \(L\) 个观测(Assumption 1)。
- 相比已有文献的放宽/强化:相比van Zwet and Goodman (2022)(无发表偏倚),本文建模了发表偏倚;相比Andrews and Kasy (2019)(估计 \(\beta\) 分布而非 \(z\) 分布),本文直接估计 \(z\) 分布以计算预测功效;非参数估计放松了参数分布假设。
主要结果¶
理论结果: - 定理1(Predictive Power):\(r(p) = \frac{\int [1-\Phi(1.96-z)] \phi(\text{cv}(p)-z) \tilde{\pi}(z) dz}{\int \phi(\text{cv}(p)-z) \tilde{\pi}(z) dz}\),且不依赖发表偏倚函数 \(s(\cdot)\)。证明关键:\(s(\cdot)\) 在分子分母的条件概率中抵消(见附录A)。 - 定理2(非参数估计一致性):在给定条件下,非参数估计量 \(\hat{r}_n(p) \xrightarrow{p} r(p)\)。截断参数 \(J_n = \lfloor \frac{2q}{3\log 2} \log(An) \rfloor\) 对数增长。 - 定理B.2(收敛速率):\(\hat{r}_n(p) - r(p) = O_p\left( n^{\frac{q}{\log 2} \cdot \frac{1+2\gamma^2}{2+2\gamma^2}} (\log n)^{3/4} \right)\),其中 \(\gamma\) 是复制样本量与原始样本量之比的平方根。当 \(\gamma=1\)(相同样本量)时,速率由 \(q\) 决定;\(\gamma\) 越大速率越慢。
实证结果: - 验证(Section 3.3):预测功效与实际复制结果高度校准(联合检验 \(p=0.762\),不能拒绝完美校准),Brier score 0.216,优于预测市场的0.220(Table 1)。 - 参数结果(Figure 2):\(p=0.05\) 时复制概率:实验经济学0.25,心理学0.22,社会科学0.10。\(p=0.01\) 时分别为0.40, 0.37, 0.23。达到80%复制概率需 \(p<0.00006\)(经济学),仅16.7%的发现满足。 - 非参数结果(Figure 4):RCT的 \(r(0.05)=0.34\),DID=0.50,RDD=0.45,IV=0.43。达到80%复制概率需 \(p<0.00007\) 至 \(0.00029\)。 - 样本量解释(Figure 5):\(r(0.05)\) 与中位数样本量的对数近似线性相关,说明低复制性主要由小样本导致。
证明路线与技术技巧(理论型)¶
整体路线(以非参数估计为例,Section 5.1 + Appendix B):
- 识别:证明 \(\tilde{\pi}\) 可从已发表的 \(|\hat{z}|\) 分布中识别(Theorem B.1)。关键:利用Rademacher随机变量对称化,将问题转化为标准解卷积。
- 展开:将 \(\tilde{\pi}\) 用归一化Hermite多项式 \(\chi_j\) 展开:\(\tilde{\pi}(z) = \sum_{j=0}^\infty b_j \chi_j(\text{cv}(p)-z)\)。系数 \(b_j\) 可表示为已发表 \(|\hat{z}|\) 的逆概率加权矩(式7)。
- 截断:截断到前 \(J_n\) 项,控制偏差。偏差以 \(\left(\frac{1+2\gamma^2}{2+2\gamma^2}\right)^{J_n/2} J_n^{3/4}\) 指数衰减(Lemma B.2, B.3)。
- 估计系数:用逆概率加权估计 \(\hat{b}_j\),其中发表概率 \(s_{\hat{\theta}_n}\) 用caliper ratio估计(Faridani 2026)。
- 代入公式:将截断展开代入 \(r(p)\) 表达式,得到估计量 \(\hat{r}_n(p) = 1 - \frac{\sum_{j=0}^{J_n} a_j 2^{j/2} \hat{\mu}_j}{\sum_{j=0}^{J_n} d_j 2^{j/2} \hat{\mu}_j}\)(式5),其中 \(a_j, d_j\) 为已知常数。
- 误差分解:总误差 = 截断偏差 + 估计误差。截断偏差指数衰减,估计误差由 \(\hat{\theta}_n\) 的收敛速率 \(n^{-q}\) 和截断项数 \(J_n\) 控制。优化 \(J_n\) 使两者平衡,得到最终收敛速率。
关键跳跃点: - 发表偏倚抵消(定理1):证明 \(s(\cdot)\) 在条件概率中抵消,这是整个分析的基础。难点在于处理符号不确定性,利用对称性将分子分母中的 \(s\) 消去。 - 非参数识别(Theorem B.1):从已发表的 \(|\hat{z}|\) 识别 \(\tilde{\pi}\) 需要解卷积,且 \(\pi\) 本身不可识别(只能识别对称化版本)。证明利用Rademacher变量将问题转化为标准正态解卷积。 - 收敛速率推导(Theorem B.2):需要同时控制截断偏差(指数衰减)和估计误差(多项式衰减)。关键引理B.2和B.3给出了 \(a_j, d_j\) 的衰减界,利用Cauchy积分公式和Hermite多项式的生成函数。
技术技巧点名: - Hermite多项式展开:用于表示 \(\tilde{\pi}\) 和计算 \(r(p)\) 的积分。 - 谱截断(spectral cutoff):来自Carrasco and Florens (2011)的解卷积方法,用于正则化严重病态的解卷积问题。 - 逆概率加权(IPW):校正发表偏倚,权重为 \(1/s_{\hat{\theta}_n}(\hat{z})\)。 - Caliper ratio估计:利用临界值附近的不连续性估计发表概率阶梯函数(Faridani 2026)。 - Cauchy积分公式:用于推导Hermite系数 \(a_j\) 的指数衰减界(Lemma B.2)。
真实例子与应用¶
数据: - 参数估计:三个大规模复制项目——实验经济学(Camerer et al., 2016, 18项研究)、心理学(OSC, 2015, 73项)、实验社会科学(Camerer et al., 2018, 21项)。 - 非参数估计:Brodeur et al. (2020) 的经济学数据集,含21,740个t-ratio,来自684篇文章,按研究设计分为RCT、RDD、DID、IV。
如何应用: - 参数方法:使用Vu (2024) 的metastudy参数估计(Gamma分布),得到 \(\tilde{\pi}\),代入式(1)计算 \(r(p)\)。 - 非参数方法:对每个研究设计,用caliper ratio估计发表概率阶梯函数(临界值1.645, 1.96, 2.576),然后用IPW估计Hermite系数,截断 \(J_n\) 按定理2设置,计算 \(\hat{r}_n(p)\)。
结果: - 验证:预测功效与实际复制结果高度一致(Figure 1),Brier score优于预测市场(Table 1)。 - 参数结果:Figure 2显示各领域 \(r(p)\) 曲线,低复制性普遍。 - 非参数结果:Figure 4显示按研究设计的 \(r(p)\) 曲线,RCT最低,DID最高。 - 样本量解释:Figure 5显示 \(r(0.05)\) 与中位数样本量对数线性相关,说明低复制性主要由小样本导致。
例子想说明什么:验证预测功效的准确性,展示低复制性的普遍性,并证明其主要原因不是发表偏倚或p-hacking,而是低统计功效。
🔎 结论是否比证明窄¶
- 声称:“Low replicability reflects low power in original studies rather than publication bias”(摘要)。证明:定理1证明 \(r(p)\) 不依赖 \(s(\cdot)\),但这仅说明给定p值的复制概率不受发表偏倚影响。发表偏倚会改变p值的边际分布,从而影响整体复制率(即所有显著发现的平均复制概率)。论文在Section 4.1中承认这一点,但主要结论的表述可能被误解为“发表偏倚不重要”。实际上,论文的实证结果(Figure 5)显示样本量是主要驱动因素,但并未直接证明发表偏倚对整体复制率无影响。
- 声称:“p-hacking... unlikely to account for much of the low replicability”(Section 4.3)。证明:仅基于 \(r(0.06) \approx r(0.049)\) 的数值近似,未建模p-hacking对 \(\tilde{\pi}\) 估计的影响。这是一个较弱的论证。
- 非参数估计的收敛速率(Theorem B.2)依赖于发表偏倚参数估计的速率 \(q\),但实际中 \(q\) 可能很小(如 \(q=1/2\) 仅当 \(\hat{\theta}_n\) 以 \(n^{-1/2}\) 收敛)。论文未提供实际数据中 \(q\) 的估计或验证。
四、开放问题¶
-
非参数估计量的最优收敛速率:定理B.2给出的速率依赖于截断参数 \(J_n\) 的特定选择,但可能不是minimax最优。能否推导出在给定光滑性条件下的下界?这扎根于定理B.2的证明和Carrasco and Florens (2011)的谱方法。
-
复制样本量不同时的估计改进:论文考虑了 \(\gamma\) 倍样本量,但收敛速率随 \(\gamma\) 增大而减慢(Theorem B.2)。能否设计更高效的估计量,例如利用原始和复制数据的联合分布?这扎根于附录B中 \(\gamma\) 依赖的速率公式。
-
将方法推广到高维或因果推断设定:论文的框架基于单参数正态近似。对于高维回归、工具变量、断点回归等复杂因果模型,复制概率如何定义和估计?例如,当估计量为高维稀疏估计时,其渐近分布可能非正态。这扎根于论文第5节对观察性研究的讨论(RDD, DID, IV),但未处理高维问题。
-
考虑p-hacking的识别:论文声称低复制性不依赖p-hacking,但p-hacking可能改变 \(\tilde{\pi}\) 的估计(例如,通过使p值分布产生不连续性)。能否将p-hacking纳入模型并识别其对 \(r(p)\) 的影响?这扎根于论文第4.3节对p-hacking的讨论,但未提供正式识别条件。
Maintained by 陈星宇 · Homepage · Source on GitHub