Using Pre-Trends for Inference in Difference-in-Differences¶
作者: Clément de Chaisemartin
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.21312
一、领域脉络与小综述¶
这个方向是什么¶
本子方向关注的是多期差分(Difference-in-Differences, DID)设定下的推断问题,核心挑战在于:当平行趋势假设(parallel trends assumption)可能不成立时,如何对处理效应进行有效的假设检验和置信区间构造。传统DID依赖平行趋势假设——即处理组和对照组在无处理情况下,其潜在结果的时间趋势相同。当存在多个预处理期时,研究者自然希望利用这些预趋势信息来放松或替代这一假设。当前该方向的成熟度处于方法快速涌现但共识尚未形成的阶段:已有多种利用预趋势的策略(预检验、等价检验、平滑约束、保形推断),但每种策略都有其特定的识别限制和适用场景,且彼此之间的相对优劣尚无系统比较。
发展脉络(history)¶
奠基工作:DID的经典框架(如Ashenfelter & Card, 1985)依赖于平行趋势假设,其推断通常基于大样本渐近理论。Conley & Taber (2011) 和 Ferman & Pinto (2019) 关注了“处理组很少”这一特殊设定,利用多个对照组的截面分布来近似处理组的冲击分布——这是对经典框架的一个重要补充,但并未直接利用预趋势的时间序列信息。
主要进展——预趋势的“诊断”与“利用”:一个重要的分支是用预趋势来诊断平行趋势假设。Roth (2022) 系统研究了“通过预趋势检验后条件推断”的问题,指出预趋势检验可能功效不足,且条件推断会扭曲估计和推断。Bilinski & Hatfield (2018) 和 Dette & Schumann (2024) 则提出用等价检验(equivalence test) 来寻找支持平行趋势的证据,而非仅仅“不能拒绝”原假设。另一个分支是用预趋势来约束或外推平行趋势的偏离:Rambachan & Roth (2023) 假设平行趋势的偏离在预处理期和处理后期间以某种已知方式演变(如平滑变化),从而构造稳健的置信集。这些工作都承认平行趋势可能不成立,但处理方式不同:Roth (2022) 和 Dette & Schumann (2024) 试图“诊断”偏离的大小,Rambachan & Roth (2023) 则试图“外推”偏离的模式。
当前前沿——保形推断(Conformal Inference)的引入:Chernozhukov, Wüthrich & Zhu (2021) 将保形推断框架引入反事实和合成控制推断,提供了一个通用框架:用预处理期的预测误差分布来校准处理后的预测误差。该框架适用于多种预测器(包括DID),且允许弱依赖时间序列。Lei & Candès (2021) 则将保形推断用于个体处理效应的区间估计。这些工作将DID推断从“依赖平行趋势”推向“依赖预测误差的分布稳定性”。
本文的位置:本文(de Chaisemartin, 2026)是上述保形推断框架的一个DID特化。它选择了一个特定的预测器——用对照组当期变化来预测处理组当期变化——从而使得预测误差恰好是未处理差分趋势(untreated differential trend)。这一选择的关键后果是:本文的识别限制不再是平行趋势,而是未处理差分趋势的绝对值分布随时间稳定。作者明确将本文定位为Chernozhukov, Wüthrich & Zhu (2021)框架的一个“简单且新颖的DID特化”,并强调其相比该框架中基于水平值的DID预测器的优势。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 基于平行趋势假设的推断:经典DID及其大样本推断。这一簇的核心是假设平行趋势成立,然后进行估计和检验。本文不直接属于这一簇,但与之对话——它试图在平行趋势可能不成立时提供替代方案。
- 基于预趋势的诊断与约束:包括Roth (2022)(预检验的条件推断)、Bilinski & Hatfield (2018) 和 Dette & Schumann (2024)(等价检验)、Rambachan & Roth (2023)(偏离的外推约束)。这一簇的核心是利用预趋势来评估或限制平行趋势的偏离。本文与之不同:它不诊断也不约束偏离,而是直接用预趋势的分布作为参考分布。
- 保形推断方法:包括Vovk, Gammerman & Shafer (2005)(经典保形推断)、Lei et al. (2018)(回归的分布自由预测推断)、Chernozhukov, Wüthrich & Zhu (2018, 2021)(反事实和合成控制的保形推断)、Lei & Candès (2021)(反事实和个体处理效应的保形推断)。这一簇的核心是利用可交换性或分布稳定性来校准预测误差。本文是这一簇在DID中的一个具体应用。
这个方向在追问的核心问题¶
- 如何在不依赖平行趋势假设的情况下进行DID推断? 这是最根本的问题。现有方法要么假设平行趋势,要么试图诊断/约束其偏离,要么依赖分布稳定性。
- 预趋势信息能提供多少识别力? 预趋势可以用于诊断(Roth, 2022)、约束(Rambachan & Roth, 2023)、或作为参考分布(本文)。不同策略对预趋势信息的利用程度和代价不同。
- 保形推断框架在时间序列DID中的适用性如何? 保形推断的经典有效性依赖于可交换性,这在时间序列中通常不成立。Chernozhukov, Wüthrich & Zhu (2018, 2021) 通过弱依赖假设和渐近论证来绕过这一限制。本文则依赖均匀一致性和概率积分变换。
- 检验的功效如何? 本文的检验在什么条件下有好的功效?当处理效应很大时,检验应该容易拒绝;但当处理效应中等时,功效取决于预趋势的变异性。本文没有给出功效分析。
⚠️ 作者的framing¶
作者将缺口frame成:现有保形DID方法(Chernozhukov, Wüthrich & Zhu, 2021)隐含平行趋势假设,而本文通过选择不同的预测器(基于变化而非水平值)来避免这一假设。作者强调,本文的识别限制(未处理差分趋势的绝对值分布稳定)比平行趋势更弱,因为它允许均值非零、随时间变化甚至改变符号。
被淡化或回避的竞争路线: - Rambachan & Roth (2023) 被提及,但作者仅说“本文允许差分趋势,但方式比Rambachan & Roth (2023)更受限”。作者没有详细比较两种方法的相对优劣——例如,Rambachan & Roth (2023) 允许更灵活的偏离模式(如线性趋势),而本文要求整个分布稳定。 - 等价检验(Dette & Schumann, 2024) 被提及,但作者没有讨论本文的检验与等价检验在目标上的根本区别:等价检验试图“确认”平行趋势近似成立,而本文则完全放弃平行趋势,转而依赖分布稳定性。
什么明显该被引/该存在、却没出现在intro里? - 关于检验功效的文献:本文的检验是渐近精确的,但功效如何?是否有关于此类“基于预趋势的秩检验”的功效分析?例如,当处理效应存在时,检验的拒绝概率如何随预趋势的变异性和样本量变化?这似乎是本文的一个明显缺口。 - 多处理组或交错处理(staggered adoption)设定:本文只考虑了一个处理组和一个对照组、单一处理时间点。交错处理设定下的DID推断是当前热点(如Callaway & Sant'Anna, 2021; Sun & Abraham, 2021; Goodman-Bacon, 2021),本文没有讨论如何扩展。
张力¶
未见明显对立引用。各被引工作之间没有彼此矛盾的结论,而是在不同设定下提出不同方法。例如,Roth (2022) 和 Dette & Schumann (2024) 都承认平行趋势可能不成立,但前者关注预检验的条件推断问题,后者则提供等价检验来寻找支持平行趋势的证据。两者并不矛盾,而是互补。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( g \in \{1, 2\} \):组别索引。组1为对照组(从未处理),组2为处理组(在时间 \( T \) 被处理)。
- \( t \in \{0, 1, \dots, T\} \):时间索引。\( T \) 为处理发生的时间点。
- \( Y_{g,t} \):组 \( g \) 在时间 \( t \) 的可观测结果。
- \( Y_{g,t}(0) \):组 \( g \) 在时间 \( t \) 的未处理潜在结果(counterfactual)。
- \( \tau = Y_{2,T}(1) - Y_{2,T}(0) \):处理组在时间 \( T \) 的处理效应,假设为非随机的常数。
- \( U_t(0) = Y_{2,t}(0) - Y_{2,t-1}(0) - [Y_{1,t}(0) - Y_{1,t-1}(0)] \):时间 \( t \) 的未处理差分趋势(untreated differential trend)。这是核心量。
- \( U_t = Y_{2,t} - Y_{2,t-1} - [Y_{1,t} - Y_{1,t-1}] \):时间 \( t \) 的可观测差分趋势。
- \( F(u) = P(|U_t(0)| \leq u) \):未处理差分趋势绝对值的连续累积分布函数,假设对所有 \( t \) 相同。
- \( \hat{F}(u; x) = \frac{1}{T} \sum_{t=1}^T \mathbf{1}\{|U_t - \mathbf{1}\{t=T\} x| \leq u\} \):在假设 \( \tau = x \) 下,调整后差分趋势绝对值的经验累积分布函数。
-
\( \alpha \):显著性水平。
-
模型:
- 数据生成机制:对于 \( t < T \),两组均未处理,因此 \( Y_{g,t} = Y_{g,t}(0) \)。对于 \( t = T \),处理组被处理,因此 \( Y_{2,T} = Y_{2,T}(0) + \tau \),对照组仍为 \( Y_{1,T} = Y_{1,T}(0) \)。
- 核心假设:\( |U_t(0)| \) 对所有 \( t \) 有相同的连续分布 \( F \)。这意味着未处理差分趋势的绝对值的分布是时间平稳的。
-
待估对象:\( \tau \)。
-
可观测数据:
- 研究者能观测到的是 \( Y_{g,t} \) 对所有 \( g \) 和 \( t \) 的值。
- 由此可计算 \( U_t \) 对所有 \( t = 1, \dots, T \) 的值。
- 关键:对于 \( t < T \),\( U_t = U_t(0) \) 是可观测的。对于 \( t = T \),\( U_T = U_T(0) + \tau \),因此 \( U_T(0) \) 是不可观测的(因为 \( \tau \) 未知)。这正是推断的困难所在。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设只有一个处理组、一个对照组,有 \( T \) 个预处理期(\( t = 1, \dots, T-1 \))和一个处理后期(\( t = T \))。我们想检验原假设 \( H_0: \tau = 0 \)(无处理效应)。
最简特例下的检验: 1. 计算所有时期的可观测差分趋势:\( U_1, U_2, \dots, U_{T-1}, U_T \)。 2. 在原假设下:\( U_T = U_T(0) \),因此所有 \( U_t \)(\( t = 1, \dots, T \))都是未处理差分趋势的实现值。 3. 核心想法:如果 \( |U_t(0)| \) 的分布是平稳的(对所有 \( t \) 相同),那么 \( |U_T| \) 应该与 \( |U_1|, \dots, |U_{T-1}| \) 来自同一个分布。因此,\( |U_T| \) 在 \( \{|U_1|, \dots, |U_T|\} \) 中的秩应该服从均匀分布。 4. 检验统计量:计算 \( |U_T| \) 在 \( \{|U_1|, \dots, |U_T|\} \) 中的经验分位数:\( \hat{F}(|U_T|; 0) = \frac{1}{T} \sum_{t=1}^T \mathbf{1}\{|U_t| \leq |U_T|\} \)。 5. 拒绝规则:如果 \( \hat{F}(|U_T|; 0) \geq 1 - \alpha \),则拒绝 \( H_0 \)。这意味着 \( |U_T| \) 是 \( T \) 个绝对值中最大的 \( \alpha \) 比例之一——即它异常地大,不太可能来自与预趋势相同的分布。
为什么这个检验有效? - 在原假设下,\( |U_T| \) 是来自分布 \( F \) 的一个新样本,与 \( |U_1|, \dots, |U_{T-1}| \) 独立同分布(假设独立性和平稳性)。 - 那么,\( |U_T| \) 在 \( T \) 个独立同分布样本中的秩的分布是均匀的。具体地,\( P(\hat{F}(|U_T|; 0) \geq 1 - \alpha) \approx \alpha \)。 - 本文的Proposition 1 将这一直觉推广到弱依赖(非独立)和渐近情形:只要经验分布函数 \( \hat{F}(u; x) \) 对 \( F(u) \) 一致收敛,且 \( F \) 连续,那么检验就是渐近精确的。
这个最小内核揭示了什么? - 本文的检验本质上是一个基于秩的检验,类似于Wilcoxon符号秩检验或Mann-Whitney U检验,但应用于时间序列的“端样本”问题。 - 它不要求平行趋势(\( E[U_t(0)] = 0 \)),只要求 \( |U_t(0)| \) 的分布平稳。这意味着处理组可以系统地比对照组增长得更快或更慢(即 \( E[U_t(0)] \neq 0 \)),只要这种差异的幅度的分布不随时间变化。 - 检验的功效取决于处理效应 \( \tau \) 是否使 \( |U_T| \) 变得异常大。如果 \( \tau \) 很大,\( |U_T| \) 很可能超过预趋势的 \( (1-\alpha) \) 分位数,从而被拒绝。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在多期DID设定下,当存在多个预处理期时,如何利用预处理期的差分趋势分布来对处理效应进行假设检验和置信区间构造,而不依赖传统的平行趋势假设。
- 核心工具/方法:提出一个基于秩的检验,将处理后的差分趋势与预处理期差分趋势的绝对值经验分布进行比较,通过概率积分变换和均匀一致性获得渐近精确的检验。
- 主要结论:在未处理差分趋势的绝对值分布平稳且经验分布函数一致收敛的条件下,该检验是渐近精确的(第一类错误率收敛到 \( \alpha \)),且置信集可通过检验反演得到。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 设定:两个组(一个处理组、一个对照组),\( T \) 个时期(\( T-1 \) 个预处理期,1 个处理后期)。处理效应 \( \tau \) 是非随机的常数。
- 核心假设:
- (1) 可观测与潜在结果的关系:\( U_t = U_t(0) \) 对 \( t < T \),\( U_T = U_T(0) + \tau \)。这直接来自DID设定和SUTVA(无干扰)。
- (2) 分布平稳性:\( P(|U_t(0)| \leq u) = F(u) \) 对所有 \( t \) 成立,且 \( F \) 是连续的。这是本文的核心识别假设。它比平行趋势弱(允许均值非零、时变、变号),但比“仅均值平稳”强(要求整个分布平稳)。
- (3) 均匀一致性:在原假设 \( H_0: \tau = x \) 下,\( \sup_{u \geq 0} |\hat{F}(u; x) - F(u)| \xrightarrow{P} 0 \)。这是渐近论证的技术条件。作者给出了一个充分条件:联合增量过程 \( (\Delta Y_{1,t}(0), \Delta Y_{2,t}(0)) \) 是严格平稳且遍历的(或严格平稳且强混合)。
- 相比已有文献的放宽/强化:
- 相比经典DID:放宽了平行趋势假设(\( E[U_t(0)] = 0 \))。
- 相比Chernozhukov, Wüthrich & Zhu (2021)的DID预测器:放宽了平行趋势假设(他们的预测器隐含平行趋势)。
- 相比Rambachan & Roth (2023):强化了假设——本文要求整个分布平稳,而Rambachan & Roth (2023)只对偏离的模式(如线性趋势)做约束。
主要结果¶
本文只有一个核心定理(Proposition 1),但它是整个方法的基础。
- Proposition 1:
- 陈述:假设 (1)-(3) 成立。在原假设 \( H_0: \tau = x \) 下,\( P(\hat{F}(|U_T - x|; x) \geq 1 - \alpha) \to \alpha \)。
- 直觉:在原假设下,\( |U_T - x| = |U_T(0)| \) 是来自分布 \( F \) 的一个样本。均匀一致性保证 \( \hat{F}(|U_T - x|; x) \) 收敛到 \( F(|U_T(0)|) \)。概率积分变换保证 \( F(|U_T(0)|) \sim \text{Unif}(0,1) \)。因此,检验统计量渐近服从均匀分布,拒绝概率收敛到 \( \alpha \)。
- 必要条件:分布平稳性 (2) 和均匀一致性 (3)。后者需要弱依赖条件(如遍历性或强混合)。
- 解决的技术难点:如何将保形推断的框架应用于DID,并明确其识别限制。难点不在于证明本身(证明很简单),而在于选择正确的预测器,使得识别限制从平行趋势变为分布平稳性。
证明路线与技术技巧¶
整体路线(3步逻辑主干):
- 在原假设下,将检验统计量转化为 \( |U_T(0)| \) 的经验分位数:\( \hat{F}(|U_T - x|; x) = \frac{1}{T} \sum_{t=1}^T \mathbf{1}\{|U_t(0)| \leq |U_T(0)|\} \)。
- 利用均匀一致性,将经验分位数替换为真实分位数:\( \hat{F}(|U_T - x|; x) = F(|U_T(0)|) + o_P(1) \)。
- 利用概率积分变换,得到渐近均匀分布:因为 \( F \) 连续,\( F(|U_T(0)|) \sim \text{Unif}(0,1) \)。因此,\( \hat{F}(|U_T - x|; x) \xrightarrow{d} \text{Unif}(0,1) \),拒绝概率收敛到 \( \alpha \)。
关键跳跃点: - 整个证明的关键跳跃点在于第2步:如何保证 \( \hat{F}(u; x) \) 对 \( F(u) \) 的一致收敛?这需要弱依赖条件。作者给出的充分条件是联合增量过程的严格平稳性和遍历性(或强混合性)。这是将保形推断从独立同分布情形推广到时间序列情形的标准技术。
技术技巧点名: - 概率积分变换(Probability Integral Transform):用于将连续分布的随机变量转化为均匀分布。这是整个检验渐近精确性的核心。 - 均匀收敛(Uniform Convergence):经验分布函数对真实分布函数的一致收敛。这是从“点wise”收敛到“uniform”收敛的关键,使得 \( \hat{F}(|U_T - x|; x) \) 可以用 \( F(|U_T(0)|) \) 来近似。 - 遍历定理(Ergodic Theorem):用于在弱依赖条件下建立经验分布函数的点wise收敛。
真实例子与应用¶
本文为纯理论/无实证例子。论文没有包含任何模拟实验或真实数据应用。作者仅在引言中提及“该方法在应用中有长预处理时间序列时尤其自然”,但没有提供任何实证演示。
🔎 结论是否比证明窄¶
- 结论的陈述:Proposition 1 声称检验是“渐近精确的”(asymptotically exact),即第一类错误率收敛到 \( \alpha \)。
- 证明的覆盖范围:证明依赖于假设 (2)(分布平稳性)和 (3)(均匀一致性)。假设 (3) 的充分条件是联合增量过程的严格平稳性和遍历性。
- 潜在的泛化问题:
- “渐近精确”是否意味着“有限样本精确”? 不。本文的检验是渐近的,不是有限样本精确的。这与经典保形推断(在可交换性下是有限样本精确的)不同。作者在引言中明确说“asymptotically exact”。
- 分布平稳性假设 (2) 是否可检验? 作者没有讨论。在实践中,研究者需要相信 \( |U_t(0)| \) 的分布在预处理期是平稳的。这本身就是一个假设,且可能被违反(例如,预处理期存在趋势性变化)。
- 功效如何? 论文完全没有讨论功效。一个检验即使第一类错误率控制得很好,如果功效很低,也是无用的。作者没有给出任何功效分析或模拟研究。这是一个明显的缺口。
四、开放问题¶
- 检验的功效分析:本文的检验在什么条件下有好的功效?当处理效应 \( \tau \) 存在时,拒绝概率如何随 \( |\tau| \)、预趋势的变异性 \( \text{Var}(|U_t(0)|) \)、以及预处理期数量 \( T \) 变化?是否存在一个“最小可检测效应量”?扎根点:论文全文未讨论功效。
- 分布平稳性假设的检验:如何检验 \( |U_t(0)| \) 的分布在预处理期是否平稳?如果预处理期存在趋势性变化(例如,\( |U_t(0)| \) 的方差随时间增大),本文的检验可能失效。是否存在一个“预检验”来评估这一假设的合理性?扎根点:假设 (2) 是核心识别条件,但未提供诊断方法。
- 交错处理(staggered adoption)设定的扩展:当多个组在不同时间点接受处理时,如何扩展本文的方法?这需要处理多个处理时间点和多个处理组,以及处理效应可能随时间变化的问题。扎根点:论文只考虑了一个处理组和一个处理时间点。
- 与Rambachan & Roth (2023) 的正式比较:本文的检验与Rambachan & Roth (2023) 的稳健置信集在什么条件下更优?两者对平行趋势偏离的假设不同(分布平稳性 vs. 平滑偏离),哪种假设在实证中更合理?是否存在一个统一的框架来比较这两种方法?扎根点:作者仅提及“本文允许差分趋势,但方式比Rambachan & Roth (2023)更受限”,没有深入比较。
Maintained by 陈星宇 · Homepage · Source on GitHub