跳转至

Does p-Hacking Mitigate or Exacerbate the Effects of Publication Bias?

作者: Yong Cai, Agathe Pernoud, Boli Xu
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2609.05372


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是选择性发表(publication bias)与 p-hacking 对元分析中效应估计偏倚的交互影响。其根本的统计问题是:当只有统计显著的结果被优先发表(选择性发表),且研究者可以通过操纵数据或分析方法来增加结果显著性(p-hacking)时,已发表文献中效应大小的均值估计会偏离真实效应,偏离的方向和程度取决于两种机制如何相互作用。当前该方向的成熟度处于“理论建模刚刚起步,大量工作仍以模拟或经验描述为主”的阶段。

发展脉络(history)

  • 奠基工作:Sterling (1959) 和 Rosenthal (1979) 最早系统性地记录了选择性发表(“文件抽屉”问题),指出显著结果更易被发表。Lane & Dunlap (1978)、Hedges (1984) 和 Iyengar & Greenhouse (1988) 则从理论上证明了选择性发表会导致效应估计的“放大偏倚”(amplification bias):已发表估计的期望绝对值大于真实效应。
  • 主要进展:Simonsohn et al. (2014) 提出了“p-hacking”这一术语,并开发了 p-curve 方法用于检测 p-hacking。Simonsohn (2020) 进一步区分了 fast p-hacking(如文件抽屉效应,导致 p 值大幅变化)和 slow p-hacking(如微小数据操纵,导致 p 值小幅变化)。Andrews & Kasy (2019) 提出了一个选择性发表的识别与校正框架,使用阶梯函数形式的发表概率,并假设研究者不进行 p-hacking。Friese & Frankenbach (2020) 通过模拟发现,p-hacking 和选择性发表会交互作用,且在特定条件下 p-hacking 可能缓解而非加剧偏倚——这是本文作者明确引用的“一个值得注意的例外”。
  • 当前 frontier:近期工作开始将 p-hacking 内生化到研究者的决策模型中。Jagadeesan & Viviano (2024) 和 Spiess (2025) 从规范(normative)角度设计最优发表规则或估计程序,以应对 p-hacking。Keane et al. (2026) 则理论分析了工具变量回归中的 p-hacking。本文的位置是:在 Andrews & Kasy (2019) 的设定基础上,引入 fast 和 slow 两种 p-hacking,并首次从理论上证明 p-hacking 对选择性发表偏倚的影响取决于选择强度,且可能缓解或加剧。

子线索聚类

  1. 选择性发表的检测与校正:包括 Hedges (1984)、Iyengar & Greenhouse (1988)、Vevea & Hedges (1995)、Andrews & Kasy (2019) 的 selection models;Egger et al. (1997)、Duval & Tweedie (2000)、Stanley (2008) 的 funnel asymmetry 和 meta-regression 方法;以及 Bartoš et al. (2023) 的贝叶斯模型平均。这一簇的核心是在无 p-hacking 的假设下识别和校正选择性发表偏倚。
  2. p-hacking 的检测:包括 p-curve (Simonsohn et al. 2014)、caliper tests (Gerber & Malhotra 2008a,b; Kudrin 2024)、以及 Brodeur et al. (2016) 的边界方法。这一簇主要关注检测 p-hacking 的存在,而非量化其对估计的影响。
  3. p-hacking 与选择性发表的交互效应:包括 Friese & Frankenbach (2020) 的模拟研究,以及本文的理论建模。这一簇是最新且最稀疏的,本文是第一个提供正式理论框架的工作。

核心问题与已知瓶颈

  • 核心问题 1:p-hacking 是加剧还是缓解选择性发表偏倚?现有模拟(Friese & Frankenbach 2020)发现缓解可能,但缺乏理论解释。
  • 核心问题 2:如何区分 p-hacking 和选择性发表对已发表估计的贡献?大多数检测方法(如 p-curve、caliper tests)无法区分两者(Brodeur et al. 2016 是例外,但只提供边界)。
  • 核心问题 3:在存在 p-hacking 时,如何识别和估计真实效应分布?Andrews & Kasy (2019) 的识别策略假设无 p-hacking,本文试图放松这一假设。
  • 已知瓶颈:理论建模困难,因为研究者行为(p-hacking 策略)是内生且复杂的;实证中,p-hacking 和选择性发表的数据生成过程难以分离。

⚠️ 作者的 framing

  • 作者的说法:作者将缺口 frame 为“现有研究主要采取经验或模拟方法,缺乏一个正式的理论框架来理解 p-hacking 如何与选择性发表交互”。因此,本文的“显然的下一步”是:在 Andrews & Kasy (2019) 的设定中引入 p-hacking,并分析其效应。
  • 被淡化或回避的竞争路线:作者淡化了规范(normative)方法(如 Jagadeesan & Viviano 2024; Spiess 2025),明确声明自己采取实证(positive)方法,即把发表规则视为给定。这回避了“最优发表规则设计”这一更复杂的问题。
  • 什么明显该被引/该存在、却没出现在 intro 里?:作者没有引用任何关于统计-计算权衡或计算约束下的推断的文献。这并非本文的缺点,但值得研究者注意:p-hacking 本质上是一种“计算行为”(研究者通过计算搜索来获得显著结果),与统计-计算权衡文献(如低度多项式障碍、SQ 下界)有潜在联系,但本文完全未触及。这是一个值得研究者去查的问题:是否存在将 p-hacking 建模为计算约束下的搜索问题的文献?

张力

未见明显对立引用。所有被引工作基本一致认为选择性发表导致偏倚,p-hacking 通常被认为加剧问题。Friese & Frankenbach (2020) 的缓解发现是唯一的例外,本文的理论结果为其提供了支撑。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号:
  • Θ:真实效应大小(参数,estimand)。
  • Σ:标准误(参数,已知给研究者)。
  • X:估计值(随机变量),X ~ N(Θ, Σ²)。
  • t:显著性阈值(如 1.96)。
  • δ:选择性发表程度(参数,δ > 1)。在两侧选择下,显著结果发表概率为 1,不显著结果为 1/δ。
  • κ_s、κ_f:慢速和快速 p-hacking 的成本缩放参数。
  • V:发表带来的奖励。
  • γ(δ):仅有选择性发表(无 p-hacking)时的期望已发表估计。
  • γ_h(δ):同时存在选择性发表和 p-hacking 时的期望已发表估计。
  • γ_s(δ)、γ_f(δ):仅有慢速或快速 p-hacking 时的期望已发表估计。
  • 模型:
  • 研究者面对一个潜在研究 (Θ, Σ) ~ μ。
  • 他先抽取一个初始估计 X₁ ~ N(Θ, Σ²)。
  • 他可以快速 p-hack:以递增成本 κ_f · c_n 独立重抽 X。
  • 他可以慢速 p-hack:以成本 κ_s · c(|Ẋ - X|, |Σ̂ - Σ|) 操纵估计和/或标准误,使报告结果 (Ẋ, Σ̂) 更显著。
  • 报告结果 (Ẋ, Σ̂) 以概率 p(Ẋ/Σ̂) 被发表,其中 p(·) 是阶梯函数(见下)。
  • 研究者最大化期望收益 V·p(·) - 成本。
  • 可观测数据:
  • 可观测:已发表论文中的报告估计 Ẋ 和报告标准误 Σ̂(或 t 统计量 Ẋ/Σ̂)。
  • 不可观测:真实效应 Θ、真实标准误 Σ、研究者是否进行了 p-hacking、以及未发表的估计值。
  • 关键识别假设:Θ|Σ = s ~ N(θ(s), σ²(s))(正态性假设),以及发表规则是已知的阶梯函数。

第二步:讲最小内核——两则选择性发表 + 仅有慢速 p-hacking

最简特例:两则选择性发表(δ_− = 1,即正负显著结果发表概率相同),且研究者只能进行慢速 p-hacking(κ_f → ∞,即不能重抽)。研究者只有一个初始估计 X₁。

核心思路:慢速 p-hacking 有两个相反效应: 1. 权重效应:研究者将一些不显著但接近显著的估计(|X₁| ∈ (X̄_s, tΣ))操纵到刚好显著(|Ẋ| = tΣ̂)。这减少了不显著估计在已发表样本中的权重,从而加剧了选择性发表偏倚(因为不显著估计的均值更接近真实值)。 2. 水平效应:被操纵后的估计恰好落在显著性阈值上,这是所有显著估计中绝对值最小的。这降低了已发表显著估计的均值,从而缓解了偏倚。

数学表达: - 无 p-hacking 时,期望已发表估计为 γ(δ)。 - 有慢速 p-hacking 时,期望已发表估计为 γ_s(δ)。 - 定理 1(简化版):存在阈值 δ_s 和 δ^s,使得: - 当选择性弱(δ < δ_s)时,权重效应主导,γ_s(δ) > γ(δ)(加剧)。 - 当选择性强(δ > δ^s)时,水平效应主导,γ_s(δ) < γ(δ)(缓解)。 - 直觉:当 δ → ∞(只有显著结果发表),权重效应消失(因为不显著结果本来就不发表),只剩下水平效应,因此缓解必然发生。

为什么这个特例是核心:整篇论文的证明路线本质上是在这个特例上叠加快速 p-hacking 和单侧选择。定理 1 的证明(附录 A.4)使用了 Lemma 1(比较两个对称核函数的期望)和 Lemma 2(ξ(x) 的性质),这些工具在后续定理中反复出现。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在选择性发表(仅发表统计显著结果)的背景下,p-hacking(快速型和慢速型)如何影响已发表估计的偏倚。
  2. 核心工具/方法:一个将研究者 p-hacking 行为内生化(成本-收益决策)的理论模型,结合正态性假设下的识别策略和最大似然估计。
  3. 主要结论:快速 p-hacking 总是加剧偏倚;慢速 p-hacking 在选择性弱时加剧、在选择性强的时缓解偏倚;在正态性假设下,可以识别真实效应分布和“仅选择性发表”的反事实均值。

关键设定与假设

  • 设定:在第二节已详述。关键补充:
  • 发表规则(公式 1):p(z) = 1 若 |z| ≥ t;= 1/δ₀ 若 -t < z < t;= 1/δ_− 若 z ≤ -t。两则选择对应 δ_− = 1;单侧选择对应 δ_− = δ₀。
  • 成本函数:慢速 p-hacking 成本 c(·,·) 满足 c₁₁ > 0, c₂₂ > 0, c₁₂ = 0(二阶可微、凸、交叉导数为零)。
  • 假设 1(关键):κ_s · C(0) > V,即从不显著估计操纵到显著的成本足够高,使得研究者不会改变估计的符号。这保证了慢速 p-hacking 的“对称性”。
  • 假设 2 & 3:平局规则(不 p-hack 当无差异;报告 p 值最低或 t 统计量最高的结果)。这些是为了简化分析,不影响定性结论。
  • 相比已有文献:相比 Andrews & Kasy (2019) 的“无 p-hacking”设定,本文引入了 p-hacking 成本函数和研究者决策。相比 Friese & Frankenbach (2020) 的模拟,本文提供了理论证明。

主要结果

  • 定理 1(慢速 p-hacking,两则选择):存在 1 < δ_s < δ^s < ∞,使得 δ > δ^s 时缓解,δ < δ_s 时加剧。证明见附录 A.4。
  • 定理 2(快速 p-hacking,两则选择):存在 δ_f,使得 δ > δ_f 时快速 p-hacking 加剧偏倚;当 δ → ∞ 时,快速 p-hacking 效应消失(因为所有不显著结果都不发表)。证明见附录 A.6。
  • 定理 3(两种 p-hacking,两则选择):存在 1 < δ_h < δ^h < ∞,使得 δ > δ^h 时缓解,δ < δ_h 时加剧。证明见附录 A.8。
  • 定理 4(政策含义):(a) 禁止快速 p-hacking 总是减少偏倚;(b) 当选择性足够强时,禁止慢速 p-hacking 反而增加偏倚。
  • 定理 5(单侧选择):类似结果成立(缓解/加剧取决于选择强度)。证明见在线附录 D.3。
  • 定理 6(识别):在 Θ|Σ = s ~ N(θ(s), σ²(s)) 假设下,(Θ, Σ) 的联合分布、δ、E(Θ)、E(γ) 和 E(γ_h) 均可识别。证明使用“无穷远识别”和反卷积论证。
  • 实证结果:
  • 行为助推(Mertens et al. 2022):E(γ_h) = 0.531,E(γ) = 0.959,缓解 54%。1/δ = 0.083(选择性强)。
  • 发展援助(Doucouliagos & Paldam 2011):E(γ_h) = 0.185,E(γ) = 0.121,加剧 27%。1/δ = 0.149(选择性较弱)。

证明路线与技术技巧(理论型)

  • 整体路线(以定理 1 为例):
  • 分类:将已发表结果按原始估计 |X₁| 分为三类:(a) 已显著 (≥ tΣ),(b) 可被慢速 p-hack (∈ (X̄_s, tΣ)),(c) 不显著且不值得 p-hack (≤ X̄_s)。
  • 表达期望:写出 γ(δ) 和 γ_s(δ) 作为这三类期望的加权平均(公式 7, 8)。
  • 比较极限:证明当 δ → ∞ 时,γ(δ) > γ_s(δ) > Θ(缓解)。关键步骤:
    • 使用 Lemma 1(比较核函数期望)证明 e_a > e^s_b(已显著估计的期望大于被 p-hack 估计的期望)。
    • 使用 Lemma 2(ξ(x) 的性质:x < ξ(x) < tΣ,严格递增)和 Lemma 3(有界函数的积分不等式)来比较两个期望。
  • 比较极限:证明当 δ → 1 时,γ_s(δ) > γ(δ)(加剧)。关键步骤:
    • 将问题转化为证明 Λ(δ) > 0,其中 Λ(δ) = (e^s_b - e_b/δ) - (1-1/δ)γ(δ)。
    • 使用隐函数定理和 L'Hospital 法则证明 lim_{λ→1} ∂(e^s_b - e_b)/∂λ = -∞(Lemma 4),从而 lim_{λ→1} Λ'(λ) < 0。
  • 连续性:由 γ(·) 和 γ_s(·) 的连续性,存在阈值使得缓解/加剧切换。
  • 关键跳跃点:
  • Lemma 4 的证明:需要计算 ∂(e^s_b - e_b)/∂λ,并证明其趋于 -∞。这依赖于 ∂X̄_s/∂λ → ∞(当 λ → 1 时,p-hacking 阈值对选择程度的变化率无穷大)和 ξ'(x) < 1(p-hack 后的估计对原始估计的导数小于 1)。这两个性质分别来自成本函数的凸性和包络定理。
  • 定理 3 的证明:需要处理两种 p-hacking 的交互。关键 Lemma 6 证明 η(x) = ψ(x)/φ(x) 对称,从而可以应用 Lemma 3 的类似论证。
  • 技术技巧点名:
  • Lemma 1:比较两个对称核函数期望的充分条件(m₁(x)/m₂(x) 单调递增)。这是整个理论部分的核心工具,用于比较各种情况下的期望。
  • 隐函数定理 & 包络定理:用于推导 ∂X̄_s/∂λ 和 ξ'(x)。
  • L'Hospital 法则:用于处理 X̄_s → tΣ 时的极限。
  • 反卷积论证(定理 6 证明):利用高斯卷积的解析性和傅里叶变换的非零性,从尾部观测识别整个分布。
  • 无穷远识别(identification-at-infinity):利用 b → ∞ 时 p_{f,1}(b,s) → 1 来识别 p_{Q,2}(s)。

真实例子与应用

  • 数据:
  • 行为助推:Mertens et al. (2022) 的 455 个估计(334 个研究),来自 213 篇已发表论文。效应量用 Cohen's d 衡量。
  • 发展援助:Doucouliagos & Paldam (2011, 2013) 的 1347 个估计(113 篇论文)。效应量用偏相关系数衡量。
  • 方法应用:
  • 每个研究只保留最显著的估计(“一篇论文至少需要一个显著结果才能发表”的假设)。
  • 设定 n* = 2(研究者最多重抽一次)、t_w = 4(慢速 p-hacking 的上限)。
  • 假设 Θ 和 Σ 独立,Σ ~ Gamma(κ, λ),C(X; Σ) = C̃(X/Σ)(成本只取决于原始 p 值)。
  • 使用最大似然估计(附录 B 的似然函数),对 t 统计量在 (-t, t) 和 (t, t_w] 区间内的观测进行删失处理。
  • 结果:
  • 行为助推:E(γ_h) = 0.531,E(γ) = 0.959,缓解 54%。1/δ = 0.083(选择性强)。图 1 显示 t 统计量在 1.96 处有明显堆积,与慢速 p-hacking 的缓解效应一致。
  • 发展援助:E(γ_h) = 0.185,E(γ) = 0.121,加剧 27%。1/δ = 0.149(选择性较弱)。图 2 显示无显著堆积,与加剧效应一致。
  • 例子想说明什么:验证理论预测(缓解/加剧取决于选择强度)在真实数据中确实可能出现,且方向与直觉一致(有堆积的文献更可能缓解)。

🔎 结论是否比证明窄

  • 是。理论结果(定理 1-5)是在给定 (Θ, Σ) 的条件下证明的,即点态成立。但实证部分(定理 6 和 MLE)需要在文献层面整合 (Θ, Σ) 的分布,并依赖正态性假设(Θ|Σ ~ N(θ(s), σ²(s)))和独立性假设(Θ 与 Σ 独立)。作者在 5.2 节明确承认“identification may be weak and estimation may be challenging in practice”,并在 5.3 节进一步施加了参数假设(Σ ~ Gamma)。因此,理论结果的普适性(点态成立)远宽于实证应用(需要强分布假设)。
  • 具体语句:定理 6 的证明(附录 A.10)依赖于“identification-at-infinity”和反卷积,这在有限样本中可能很弱。作者在 5.3 节说“To make headway, we impose that researchers can draw at most one additional estimate”,这进一步限制了模型的适用性。

四、开放问题(点到为止,扎根具体语句)

  1. 放松正态性假设的识别问题:定理 6 的识别依赖于 Θ|Σ ~ N(θ(s), σ²(s))。能否在更弱的分布假设(如对称性、尾部条件)下识别 E(γ)?这扎根于定理 6 的陈述和证明(附录 A.10),以及作者在 5.2 节“identification may be weak”的承认。

  2. 更一般的发表规则:本文假设发表概率是阶梯函数(公式 1)。如果发表概率是 p(z) 的连续函数(如 Andrews & Kasy 2019 中的更一般形式),理论结果(缓解/加剧的阈值)是否仍然成立?这扎根于作者在 1.1 节对 Andrews & Kasy (2019) 的引用,以及本文设定中“step function”的明确假设。

  3. p-hacking 对假阳性率的影响:本文只关注已发表估计的均值偏倚,明确声明“silent on... inflating the number of false positives”(结论部分)。一个自然的开放问题是:在本文的模型下,p-hacking 如何影响已发表结果中假阳性(Type I error)的比例?这扎根于作者在结论中的自我限制。

  4. 统计-计算权衡视角下的 p-hacking:本文的 p-hacking 模型(成本-收益)与统计-计算权衡文献中的“计算约束下的搜索”有潜在联系。p-hacking 本质上是一种计算搜索(在众多可能的分析决策中寻找能产生显著结果的那个)。能否将 p-hacking 建模为低度多项式算法或SQ 算法,并刻画其“计算阈值”?这扎根于研究者自己的兴趣(统计-计算权衡),以及本文对 p-hacking 的“搜索”性质的描述(如引言中“researchers have to make many small decisions”)。这是一个值得研究者去查的问题:去读近期约 5 篇关于“计算约束下的假设检验”或“多重比较的计算复杂性”的论文的 intro,看是否有人已经或正在做这个连接。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论