跳转至

Beyond Pretrends: A Discordance-Based Sensitivity Analysis for Difference-in-Differences

作者: Thomas Leavitt
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.19081


一、领域脉络与小综述

  • 这个方向是什么:本文属于因果推断中 DID(双重差分)设计的敏感性分析子领域。其根本问题是:在平行趋势假设下,DID 用对照组的事后变化来插补处理组的反事实变化,但该假设本身不可检验。传统敏感性分析(如 Rambachan and Roth 2023)通过限制处理组前趋势与事后趋势偏离的程度来评估结论稳健性,但这类方法只关注"处理组自身的前后趋势差异",忽略了"对照组事后变化是否偏离其自身前趋势"这一信息。本文提出的 discordance-based(不一致性)敏感性模型,将"多个插补来源之间的不一致程度"作为衡量结论对平行趋势假设依赖度的核心量。

  • 发展脉络(history):

  • 奠基工作:DID 的经典框架可追溯至 Angrist and Pischke (2008) 的《Mostly Harmless Econometrics》,该书系统阐述了平行趋势假设作为 DID 识别策略的核心地位。Cochran (1965, 1972) 和 Shadish et al. (2002)、Cook and Campbell (1979) 则从准实验设计的角度强调"多重证据交叉验证"(即 Rosenbaum 2015 的 "Cochran's Causal Crossword")对因果结论可信度的支撑作用——这是本文 discordance 思想的直接理论源头。
  • 主要进展:Rambachan and Roth (2023) 在 Review of Economic Studies 上提出了基于前趋势偏离的敏感性分析框架,允许研究者设定一个界 M,限制事后平行趋势偏离不超过 M 倍的前期最大偏离。这是当前 DID 敏感性分析的主流范式。Manski and Pepper (2018) 则从部分识别角度提出了有界变化假设(bounded-variation assumptions),为限制趋势偏离提供了另一种形式化途径。
  • 当前 frontier:Roth and Sant'Anna (2023) 与 Kahn-Lang and Lang (2020) 指出,平行前趋势既不是平行事后趋势的必要条件也不是充分条件,这动摇了 pretrends 检验作为 DID 可信度证据的根基。Egami and Yamauchi (2023) 进一步探讨了多前期的利用方式。与此同时,bracketing 方法(Ding and Li 2019; Hasegawa and Small 2017; Ye et al. 2024; Demetrescu et al. 2025)通过比较 DID 与滞后因变量调整(LDV)等替代估计量的方向性关系来界定真实效应范围,但这类方法依赖特定方向假设。
  • 本文的位置:Leavitt 将 discordance(不一致性)作为敏感性分析的核心量,形式化地证明 concordance(一致性)蕴含平行前趋势,但反之不成立——即平行前趋势是低敏感性的必要条件而非充分条件。这直接回应了 Roth and Sant'Anna (2023) 对 pretrends 检验局限性的批评,并提供了一个新的敏感性模型,其界 M 由"平行趋势插补与替代插补之间的最大不一致性"来校准。

  • 子线索聚类:

  • Pretrends-based 敏感性分析(Rambachan and Roth 2023; Manski and Pepper 2018):以处理组前趋势偏离为基准,限制事后偏离不超过 M 倍前期偏离。优点:直观、易实施;缺点:忽略对照组事后对前趋势的偏离,且平行前趋势既不充分也不必要。
  • Bracketing / 多重插补比较(Ding and Li 2019; Hasegawa and Small 2017; Ye et al. 2024; Demetrescu et al. 2025):通过比较不同识别假设下的估计量(如 DID vs. LDV)来界定效应范围,依赖估计量之间的方向性关系。
  • Discordance-based 敏感性模型(本文):以多个插补来源之间的不一致性为基准,形式化地衡量结论对平行趋势假设的依赖度。这是对前两条线索的整合与推广。

  • 这个方向在追问的核心问题:

  • 当平行趋势假设被违反时,结论在多大程度上会改变?(敏感性分析的基本问题)
  • 如何利用多个插补来源(如处理组前趋势、对照组事后变化)之间的不一致性来校准敏感性参数 M,而不是仅依赖处理组自身的前趋势?
  • 在什么条件下,concordance(多个插补来源一致)可以作为平行趋势假设可信度的充分证据?

  • ⚠️ 作者的 framing(这是作者的说法):作者将缺口 frame 为"现有 pretrends-based 方法忽略了对照组事后对前趋势的偏离,因此可能低估敏感性"。他声称 discordance-based 模型是"显然的下一步",因为它同时利用了处理组前趋势和对照组事后偏离两个信息源。被淡化的竞争路线包括:bracketing 方法(Ding and Li 2019; Ye et al. 2024)虽然也利用多个估计量,但依赖方向性假设(如 DID ≥ LDV),而本文的 discordance 模型不依赖这种方向性;此外,作者未讨论 Bayesian 敏感性分析或基于替代假设的完全非参数识别方法。

  • 张力:未见明显对立引用。但值得注意的是,Rambachan and Roth (2023) 的 pretrends 模型与本文的 discordance 模型在"什么构成敏感性证据"上有根本分歧:前者认为前趋势偏离是核心基准,后者认为跨插补来源的不一致性才是核心。这种分歧不是逻辑矛盾,而是对"什么信息最相关"的不同判断。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

  • 符号:
  • \(G \in \{0, 1\}\):组别指示,\(G=1\) 为处理组,\(G=0\) 为对照组。
  • \(t = 1, \ldots, T\):时期,\(T\) 为唯一的事后时期;\(T-1\) 为最后一个事前时期。
  • \(Z_{g,t} := \mathbb{1}\{G=g\}\mathbb{1}\{t=T\}\):处理指示,仅处理组在事后时期接受处理。
  • \(Y_{g,t}(0)\):组 \(g\) 在时期 \(t\) 的未处理潜在结果(潜在量,不可观测)。
  • \(Y_{g,t}(1)\):处理组在事后时期的处理潜在结果(仅 \(G=1, t=T\) 定义)。
  • \(Y_{g,t}\):观测结果,由一致性假设 \(Y_{g,t} = Z_{g,t}Y_{g,t}(1) + (1-Z_{g,t})Y_{g,t}(0)\) 连接。
  • \(\bar{Y}_{g,t}\):组 \(g\) 在时期 \(t\) 的总体均值(期望)。
  • \(\tau := \bar{Y}_{1,T}(1) - \bar{Y}_{1,T}(0)\):ATT(目标 estimand)。
  • \(\delta_t := \bar{Y}_{1,t}(0) - \bar{Y}_{1,t-1}(0) - [\bar{Y}_{0,t}(0) - \bar{Y}_{0,t-1}(0)]\):时期 \(t\) 的 trend difference(处理组与对照组在未处理状态下趋势之差)。
  • \(\epsilon_{g,t} := Y_{g,t} - \bar{Y}_{g,t-1}\):去趋势结果(detrended outcome),即组 \(g\) 在时期 \(t\) 的结果相对于其前一时期均值的偏离。
  • \(\lambda_{g,v} := |\bar{\epsilon}_{g,v}(0) - \bar{\epsilon}_{0,T}(0)|\):discordance,即替代插补来源(组 \(g\)、事前时期 \(v\))与平行趋势插补(对照组事后)之间的绝对距离。
  • \(M \geq 0\):敏感性参数,控制允许的最大 discordance 倍数。
  • \(\mathcal{V} \subseteq \{2, \ldots, T-1\}\):事前验证时期集合。
  • \(\Delta_{\mathcal{G} \times \mathcal{V}}\):\(\mathcal{G} \times \mathcal{V}\) 上的单位单纯形(权重空间)。

  • 模型:本文不假设特定参数模型,而是采用潜在结果框架。核心识别问题是 \(\bar{Y}_{1,T}(0)\) 不可观测。平行趋势假设 \(\delta_T = 0\) 使得 \(\bar{Y}_{1,T}(0) = \bar{Y}_{1,T-1}(0) + [\bar{Y}_{0,T}(0) - \bar{Y}_{0,T-1}(0)]\),从而 \(\tau = \text{DID} := \bar{Y}_{1,T} - \bar{Y}_{1,T-1} - [\bar{Y}_{0,T} - \bar{Y}_{0,T-1}]\)。

  • 可观测数据:研究者观测到 \(Y_{g,t}\) 对每个 \((g,t)\) 的样本均值(或个体层面数据),以及组别和时期指示。不可观测的是 \(\bar{Y}_{1,T}(0)\)(处理组的反事实事后结果)以及所有 \(\bar{Y}_{g,t}(0)\) 在 \(t=T\) 且 \(g=1\) 之外的值(虽然 \(\bar{Y}_{g,t}(0) = \bar{Y}_{g,t}\) 对 \(t < T\) 或 \(g=0\) 成立,因为未处理)。

第二步:最小内核

考虑最简单的设定:\(T=3\)(两个事前时期 \(t=1,2\),一个事后时期 \(t=3\)),\(\mathcal{V} = \{2\}\)(仅用最近的事前时期作为验证)。此时:

  • 平行趋势插补:\(\bar{Y}_{1,3}(0)\) 的插补值为 \(\bar{Y}_{1,2} + [\bar{Y}_{0,3} - \bar{Y}_{0,2}]\),对应 ATT 估计 \(\tau_{0,3} = \text{DID}\)。
  • 替代插补(基于处理组自身前趋势):\(\bar{Y}_{1,3}(0)\) 的插补值为 \(\bar{Y}_{1,2} + [\bar{Y}_{1,2} - \bar{Y}_{1,1}]\)(即处理组前趋势外推),对应 ATT 估计 \(\tau_{1,2}\)。
  • Discordance 定义为 \(\lambda_{1,2} = |\bar{\epsilon}_{1,2}(0) - \bar{\epsilon}_{0,3}(0)| = |(\bar{Y}_{1,2} - \bar{Y}_{1,1}) - (\bar{Y}_{0,3} - \bar{Y}_{0,2})|\),即处理组前趋势与对照组事后变化之间的绝对差。

核心命题:在 \(T=3\) 且 \(\mathcal{V}=\{2\}\) 的特例下,discordance-based 敏感性模型给出:

\[|\tau - \tau_{0,3}| \leq M \cdot \lambda_{1,2}.\]

这个不等式的含义是:如果平行趋势假设被违反,其违反程度(\(|\delta_3| = |\bar{Y}_{1,3}(0) - \bar{Y}_{1,2}(0) - [\bar{Y}_{0,3}(0) - \bar{Y}_{0,2}(0)]|\))被假设不超过 \(M\) 倍的 discordance \(\lambda_{1,2}\)。当 \(M=0\) 时,退化为平行趋势假设;当 \(M\) 增大时,识别集合变宽。

为什么这个特例是"最小内核":它揭示了 discordance-based 方法的本质——用"可观测的插补来源之间的不一致性"来校准"不可观测的平行趋势违反程度"。在 \(T=3\) 时,只有一个替代插补来源(处理组前趋势),discordance 退化为一个标量;当 \(T>3\) 或有多个组时,discordance 变为向量,需要取最大值或加权平均,但核心逻辑不变。本文的 Proposition 1 进一步证明,在一定的先验分布下,discordance 越大,平行趋势插补的期望误差越大——这为 discordance 作为敏感性度量提供了决策理论基础。

关键直觉:平行前趋势(\(\delta_2 = 0\))是 concordance 的必要条件(Proposition 2),但不是充分条件。在 Case 2(对照组事后偏离前趋势)中,即使前趋势完全平行,discordance 仍然很大,因此结论对平行趋势假设高度敏感。这正是 pretrends-based 方法失效的场景。

三、这篇论文做了什么

三句话: ① 研究了 DID 设计中平行趋势假设的敏感性分析问题,提出以"多个插补来源之间的不一致性(discordance)"为核心量的新敏感性模型。 ② 核心工具是潜在结果框架下的部分识别分析,结合决策理论中的 minimax regret 准则来形式化证明最大 discordance 加权方案的合理性。 ③ 主要结论是:concordance 蕴含平行前趋势但反之不成立;discordance-based 模型在 Case 2(对照组事后偏离前趋势)场景下比 pretrends-based 模型更敏感,且其界 \(M\) 有明确的决策理论基础。

关键设定与假设: - 设定:两组(处理/对照)、\(T\) 期、单一事后时期(\(T\));可扩展到多期(Section 6)。 - 假设: - Assumption 1(一致性):\(Y_{g,t} = Z_{g,t}Y_{g,t}(1) + (1-Z_{g,t})Y_{g,t}(0)\),即观测结果等于实际接受处理对应的潜在结果。这是标准假设,排除干扰和多种处理版本。 - 无额外假设:本文不假设平行趋势、不假设特定参数形式、不假设处理组与对照组的可交换性。所有识别来自敏感性模型(23)中的界 \(M\) 和 discordance 的构造。 - 相比已有文献:Rambachan and Roth (2023) 假设事后偏离不超过 \(M\) 倍的前期最大偏离;本文假设事后偏离不超过 \(M\) 倍的 discordance(跨插补来源的最大不一致性)。后者不需要前趋势数据,但需要至少一个替代插补来源。

主要结果: - Proposition 1:在一定的先验分布 \(\pi\) 下(其中 \(p_{\neg(0,T),(g,v)} > 0\)),平行趋势插补的期望绝对误差 \(\mathbb{E}_\pi[|\tau - \tau_{0,T}|]\) 严格递增于 discordance \(\lambda_{g,v}\)。这为 discordance 作为敏感性度量提供了形式化依据——discordance 越大,平行趋势插补的预期误差越大。 - Proposition 2:对于任何事前验证时期 \(v\),平行趋势违反程度 \(|\bar{\epsilon}_{1,v}(0) - \bar{\epsilon}_{0,v}(0)|\) 被 \(2\max\{\lambda_{1,v}, \lambda_{0,v}\}\) 所界定。这意味着 concordance(\(\lambda_{1,v}\) 和 \(\lambda_{0,v}\) 都小)蕴含平行前趋势,但反之不成立。 - Proposition 3:最大 discordance 加权方案 \(w^{\max}\) 是 minimax regret 问题(32)的解。即,在所有可能的权重选择中,将所有权重放在 discordance 最大的插补来源上,最小化了最坏情况下的 regret。 - Proposition 4:敏感性模型(23)的界是 sharp 的——存在配置使得不等式取等号,因此不能在不增加假设的情况下收紧。

证明路线与技术技巧: - 整体路线: 1. 将 ATT 分解为可观测的 DID 与不可观测的 trend difference \(\delta_T\)(公式 4-7)。 2. 定义 discordance \(\lambda_{g,v}\) 作为可观测的插补来源之间的绝对距离。 3. 用 \(M \cdot \lambda_{g,v}\) 界定 \(\delta_T\),得到部分识别区间。 4. 用决策理论(minimax regret)证明最大 discordance 加权是最优选择。 5. 用构造法证明界的 sharpness。 - 关键技巧: - 三角不等式(Proposition 2 证明):\(|\bar{\epsilon}_{1,v}(0) - \bar{\epsilon}_{0,v}(0)| \leq |\bar{\epsilon}_{1,v}(0) - \bar{\epsilon}_{0,T}(0)| + |\bar{\epsilon}_{0,v}(0) - \bar{\epsilon}_{0,T}(0)|\),将不可观测的平行趋势违反转化为可观测的 discordance 之和。 - 线性规划对偶(Proposition 3 证明):将 minimax regret 问题转化为线性规划,利用单纯形上的极值点性质证明最优解在顶点取得。 - 构造法(Proposition 4 证明):显式构造 \(\bar{\epsilon}_{1,T}(0)\) 的取值使得不等式取等号,证明界的 sharpness。

真实例子与应用: - 数据:Wilse-Samson (2013) 的南非种族隔离时期选举数据,153 个选区,其中 14 个含金矿(处理组),139 个不含(对照组)。处理为 1974-1977 年外籍矿工劳动力供给冲击(马拉维和莫桑比克撤出劳工)。 - 方法应用:计算平行趋势插补(对照组事后变化)与替代插补(处理组前趋势外推)之间的 discordance,发现最大 discordance 约为 0.147。在 \(M=1\) 时,ATT 的识别区间为 \([0.11-0.147, 0.11+0.147] = [-0.037, 0.257]\),包含零;而 pretrends-based 方法在 \(M=1\) 时给出的区间为 \([0.11-0.03, 0.11+0.03] = [0.08, 0.14]\),不包含零。 - 例子想说明什么:两种敏感性分析方法得出不同结论——pretrends-based 方法认为结论稳健(区间不包含零),而 discordance-based 方法认为结论高度敏感(区间包含零)。原因在于对照组事后变化(0.112)大幅偏离其前趋势(约 -0.035),而 pretrends-based 方法完全忽略了这一信息。这直接验证了作者的论点:平行前趋势不足以评估 DID 结论的稳健性。

🔎 结论是否比证明窄: - 作者在 Section 5.1 中声称 concordance 是"credibility"的必要条件,但 Proposition 2 只证明了 concordance 蕴含平行前趋势,并未直接证明 concordance 与"结论可信度"之间的因果关系。这是一个概念跳跃——从"数学蕴含"到"科学可信度"需要额外论证。 - Proposition 1 的证明依赖于先验分布 \(\pi\) 的具体设定(特别是 \(p_{\neg(0,T),(g,v)} > 0\)),但作者未讨论当 \(p_{\neg(0,T),(g,v)} = 0\) 时结论是否仍然成立。这是一个边界情况。 - 作者在 Section 6 声称扩展到多期设定,但只给出了符号层面的推广,未提供多期情形下的形式化命题或证明。这是一个"声称"而非"证明"。 - 作者在结论部分暗示 discordance-based 方法"优于"pretrends-based 方法,但未提供任何理论或模拟证据表明前者在某种意义下更优(如更短的识别区间、更小的覆盖误差等)。这是一个价值判断,而非数学结论。

四、开放问题

  1. 多期设定的形式化:Section 6 声称扩展到多期,但未给出形式化命题。要确认是否真 gap,可去读 Rambachan and Roth (2023) 的多期设定部分,看其是否已覆盖 discordance 的思想。

  2. discordance 的估计与推断:本文的 discordance \(\lambda_{g,v}\) 是总体量,但实际中只能估计。估计误差如何传播到 ATT 的识别区间?是否可以用 bootstrap 或 delta method 构造置信区间?这需要读本文的附录或后续工作。

  3. 权重选择的敏感性:Proposition 3 证明了最大 discordance 加权是 minimax 最优,但这是否意味着其他权重选择(如时间衰减权重)在某种意义下更差?作者未讨论权重选择的敏感性分析。

  4. 与 bracketing 方法的关系:作者在引言中提到 bracketing(Ding and Li 2019; Ye et al. 2024),但未深入比较 discordance-based 与 bracketing 方法在识别区间宽度上的差异。这是一个潜在的理论 gap。

  5. discordance 的可解释性:作者用南非选举数据展示了 discordance 的实际值(0.147),但未讨论如何为 \(M\) 的选择提供先验指导。\(M\) 的校准是敏感性分析的核心问题,作者未给出具体建议。

提示:若想确认上述某条是否为真 gap,建议去读 Rambachan and Roth (2023) 的 Section 5(多期设定)、Ye et al. (2024) 的 bracketing 方法,以及 Leavitt and Hatfield (2025) 的 equal expected prediction errors 框架——看这些工作是否已隐含或明确处理了 discordance 的思想。若近期约 5 篇相关论文都指向同一 gap,则大概率是共识;若互相打架,则可能是机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论