Which Policy Works, and Where? Estimation and Inference for State-Level Treatment Effects in Difference-in-Differences¶
作者: Nichole Austin, Sunny R. Karim, Erin Strumpf, Matthew D. Webb
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.01467
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的子方向是双重差分(Difference-in-Differences, DiD)框架下,当政策采用时间交错(staggered adoption)且处理效应存在异质性时,如何定义、估计和推断有意义的处理效应。该方向的核心统计问题是:在面板数据中,当不同单位(如州)在不同时间点开始实施一项政策,且政策效果可能因单位、时间或政策内容而异时,如何从观测数据中识别和估计平均处理效应(ATT),并为其提供可靠的推断。当前该方向已从早期对传统双向固定效应(TWFE)估计量偏误的批判,发展到提出一系列“现代”DiD估计量(如Callaway & Sant'Anna, Sun & Abraham, Borusyak et al.),这些估计量通过明确选择对照组(从未处理或尚未处理的单位)来避免“禁止性比较”(forbidden comparisons)。本文在此基础上,进一步关注政策内容异质性——即同一时间采用政策的单位,其政策细节(如补贴金额、资格规则)可能不同,导致传统的按采用时间分组的“队列平均处理效应”(cohort ATT)可能掩盖有意义的政策差异。
发展脉络(history)¶
-
奠基工作:揭示TWFE的问题。
- Bertrand, Duflo & Mullainathan (2004) 最早系统性地指出,在DiD设定中,序列相关会导致标准误严重低估,并提出了聚类稳健标准误等解决方案。本文引用它来强调推断必须考虑州层面的聚类。
- Goodman-Bacon (2021) 将TWFE估计量分解为所有可能的2×2 DiD比较的加权平均,并指出当处理效应存在异质性时,比较“已处理 vs. 已处理”的单位会产生负权重,导致估计量不可解释。本文引用它来定义“禁止性比较”。
- De Chaisemartin & D'Haultfoeuille (2020) 独立地证明了TWFE在异质性处理效应下的加权平均性质,并提出了一个避免负权重的替代估计量。本文引用它来指出负权重问题。
-
主要进展:提出现代DiD估计量。
- Callaway & Sant'Anna (2021) 提出了一个里程碑式的框架,通过估计“队列×时间”处理效应(ATT_{g,t}),并明确使用从未处理或尚未处理的单位作为对照组,解决了TWFE的负权重问题。他们提出了一个两步估计策略,并证明了bootstrap的有效性。本文的核心批评对象正是这个框架:它虽然解决了“何时处理”的异质性,但忽略了“处理了什么”的异质性。
- Sun & Abraham (2021) 和 Borusyak, Jaravel & Spiess (2024) 也提出了类似的“插补”(imputation)或“交互加权”(interaction-weighted)估计量,旨在解决事件研究(event study)设定中,当存在异质性处理效应时,传统动态模型估计量的偏误。本文将它们归为“限制比较对象为未处理或尚未处理单位”的现代方法。
-
当前Frontier:有限样本推断与政策内容异质性。
- 有限样本推断:当处理组或对照组中“簇”(cluster,如州)的数量很少时,传统的聚类稳健标准误和bootstrap方法会严重失效。MacKinnon & Webb (2017, 2020) 系统性地研究了这一问题,并提出了随机化推断(Randomization Inference, RI)作为替代方案。MacKinnon, Nielsen & Webb (2023b) 和 Hansen (2025a,b) 则提出了基于Jackknife的方差估计方法,声称其在某些情况下比传统方法更可靠。本文正是在这些工作的基础上,评估Jackknife和RI在子总体ATT上的表现。
- 政策内容异质性:本文的作者团队(Karim, Webb, Austin, Strumpf)之前的工作——Karim et al. (2024) 的UN-DID和 Karim & Webb (2024) 的DID-INT——为本文提供了技术工具。UN-DID解决了数据不可池化(unpoolable)时的DiD估计问题,而DID-INT则通过允许协变量效应随州或时间变化,来处理“共同因果协变量”(CCC)假设的违反。本文将这些工具用于估计州级和策略级的ATT,从而将关注点从“何时处理”转向“处理了什么”。
-
本文的位置:本文位于上述两条线索的交汇点。它利用UN-DID和DID-INT这两个新工具,将现代DiD的估计框架从“队列×时间”层面下沉到“州×时间”层面,从而能够定义和估计州级、策略级等更细粒度的子总体ATT。同时,它系统性地评估了在这些子总体ATT上,Jackknife和RI这两种有限样本推断方法的表现,揭示了Jackknife在少数处理或对照州时的过拒绝问题,以及RI在州级ATT上的保守性。因此,本文是一个应用导向的方法学工作,它不提出全新的估计量,而是展示如何用现有工具回答一个被忽视的政策问题,并指出其推断上的陷阱。
子线索聚类¶
- 异质性处理效应下的DiD估计:核心是解决TWFE的负权重问题。代表工作:Goodman-Bacon (2021), De Chaisemartin & D'Haultfoeuille (2020), Callaway & Sant'Anna (2021), Sun & Abraham (2021), Borusyak et al. (2024)。这一簇的工作主要关注处理时间的异质性。
- 有限样本下的DiD推断:核心是当簇数量少或处理组/对照组簇数量少时,如何获得可靠的推断。代表工作:Bertrand et al. (2004), Conley & Taber (2011), MacKinnon & Webb (2017, 2020), MacKinnon et al. (2023b), Hansen (2025a,b), Karim et al. (2026)。这一簇的工作主要关注推断方法的有限样本性质。
- 处理内容异质性与新估计量:核心是处理政策细节的差异,或解决数据共享等实际问题。代表工作:Karim et al. (2024) (UN-DID), Karim & Webb (2024) (DID-INT)。本文属于这一簇,并将其与第一簇的估计框架和第二簇的推断问题结合起来。
这个方向在追问的核心问题¶
- 如何定义“有意义”的处理效应? 当政策内容、实施背景因州而异时,一个笼统的“平均处理效应”是否足够?如何将ATT分解为与政策设计、实施环境相关的子总体ATT?
- 如何为这些子总体ATT提供可靠的有限样本推断? 当子总体(如某个特定州、某个特定政策类型)包含的簇数量很少时,传统的渐近推断(如聚类稳健标准误)和现代方法(如Jackknife、bootstrap、RI)表现如何?各自的适用条件和陷阱是什么?
- 如何诊断平行趋势假设? 平行趋势假设是DiD的核心识别条件。当关注的是州级或策略级ATT时,所需的平行趋势假设更强(州级平行趋势 vs. 队列级平均平行趋势)。如何检验这些不同层级的平行趋势假设?本文明确指出,队列级的前趋势检验可能因正负偏离相互抵消而通过,但掩盖了州级平行趋势的违反(见图3)。
⚠️ 作者的Framing¶
- 作者把缺口frame成什么? 作者将缺口定位为:现有现代DiD文献(如Callaway & Sant'Anna)虽然解决了“处理时间”异质性,但忽略了“处理内容”异质性。他们声称,当政策细节在采用时间相同的队列内存在差异时,队列平均ATT无法回答政策制定者关心的具体问题(“哪个政策有效,在哪里有效?”)。因此,本文的“显然的下一步”是:定义并估计州级、策略级等子总体ATT,并研究其推断问题。
- 哪些竞争路线被他淡化或回避了? 作者明确表示“我们不提出新的估计量”(Section 4),而是使用UN-DID和DID-INT。这淡化了“提出新方法”这一竞争路线。他们回避了与更复杂的、能直接处理政策内容异质性的结构性模型或因子模型的比较。他们也没有深入讨论当处理效应本身是政策内容的函数时,如何建模这种交互作用。
- 什么明显该被引/该存在、却没出现在intro里? 作者没有引用任何关于高维DiD或机器学习在DiD中的应用(如使用因果森林估计异质性处理效应)的文献。这些方法也能处理异质性,但通常需要更复杂的假设或更大的样本量。作者可能认为这些方法对于“州级”这种粗粒度的异质性分析来说过于复杂,或者其推断性质在有限样本下更不清晰。这是一个值得研究者去查的问题:这些方法在类似设定下表现如何?
张力¶
未见明显对立引用。所有被引工作基本都认同TWFE在异质性处理效应下存在问题,并致力于提出改进方案。主要张力在于推断方法的选择:MacKinnon & Webb (2020) 推荐RI,而Hansen (2025a,b) 推荐Jackknife。本文的贡献之一就是直接比较了这两种方法在子总体ATT上的表现,并揭示了Jackknife的“双边界”过拒绝问题。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
i:个体(如工人),i = 1, ..., N。t:时期(如年份),t = 1, ..., T。s:州(jurisdiction),s = 1, ..., H。S_i是个体i所属的州。D_{s,t}:州s在时期t的处理状态(0=未处理,1=已处理)。D_{i,t} = D_{S_i, t}。Y_{i,t}:个体i在时期t的观测结果(如对数周薪)。Y_{i,t}(1), Y_{i,t}(0):个体i在时期t的潜在结果(处理/未处理)。G_s:州s首次接受处理的时期。如果从未处理,则G_s = ∞。ATT:平均处理效应(Average Treatment Effect on the Treated)。ATT_{g,t}:在时期g首次处理的队列(cohort),在时期t的平均处理效应。ATT_{s,t}:州s在时期t的平均处理效应。ATT_p:政策类型p的平均处理效应。θ:待估的ATT参数。H:总州数。J:早期采用政策的州数。L:晚期采用政策的州数。
-
模型:
- 潜在结果框架:
Y_{i,t} = D_{i,t} Y_{i,t}(1) + (1 - D_{i,t}) Y_{i,t}(0)。 - 处理是吸收的(absorbing):一旦一个州开始处理,它就会一直保持处理状态。
- 识别依赖于平行趋势假设(Parallel Trends Assumption)。对于州
s在时期t的ATT,其识别条件是:E[Y_{i,t}(0) - Y_{i,t'_s}(0) | S_i = s] = E[Δ\bar{Y}^C_{s,t}]其中t'_s = G_s - 1是处理前的最后一期,Δ\bar{Y}^C_{s,t}是对照组(从未处理或尚未处理的州)在相同时间跨度内的平均结果变化。这个假设意味着,如果处理州没有接受处理,其结果的趋势将与对照组的平均趋势相同。 - 其他关键假设:无预期效应(No Anticipation)、无跨州溢出效应(No Spillovers)。
- 潜在结果框架:
-
可观测数据:
- 研究者可以观测到:
Y_{i,t}(个体结果),D_{i,t}(处理状态),S_i(州标识),t(时期),以及可能的协变量X_{i,t}(如年龄、教育)。 - 不可观测的是潜在结果
Y_{i,t}(0)和Y_{i,t}(1)。对于处理州在处理后的时期,Y_{i,t}(0)是反事实,只能通过假设(平行趋势)来识别。
- 研究者可以观测到:
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:两个州、两个时期、一个处理州、一个对照州。
-
设定:
- 州
s=1在时期t=2开始处理(G_1 = 2),州s=2从未处理(G_2 = ∞)。 - 时期
t=1是处理前,t=2是处理后。 - 我们想估计州
s=1在时期t=2的处理效应ATT_{1,2}。
- 州
-
可观测数据:
- 处理州
s=1:\bar{Y}_{1,1}(处理前平均结果),\bar{Y}_{1,2}(处理后平均结果)。 - 对照州
s=2:\bar{Y}_{2,1}(处理前平均结果),\bar{Y}_{2,2}(处理后平均结果)。
- 处理州
-
核心思路:
- 计算处理州的趋势:
Δ\bar{Y}_1 = \bar{Y}_{1,2} - \bar{Y}_{1,1}。这个趋势包含了处理效应和自然的时间趋势。 - 计算对照州的趋势:
Δ\bar{Y}_2 = \bar{Y}_{2,2} - \bar{Y}_{2,1}。这个趋势只包含自然的时间趋势(因为对照州从未处理)。 - 平行趋势假设:假设如果没有处理,处理州的趋势将与对照州的趋势相同,即
E[Δ\bar{Y}_1(0)] = E[Δ\bar{Y}_2]。 - 识别:在平行趋势假设下,处理效应被识别为两个趋势之差:
ATT_{1,2} = Δ\bar{Y}_1 - Δ\bar{Y}_2 = (\bar{Y}_{1,2} - \bar{Y}_{1,1}) - (\bar{Y}_{2,2} - \bar{Y}_{2,1})。 这就是经典的2×2 DiD估计量。
- 计算处理州的趋势:
-
推广到本文的设定:
- 当有多个州和多个时期时,本文的UN-DID和DID-INT估计量本质上是在做多个这样的2×2比较,然后进行加权平均。
- 本文的核心贡献在于,它不满足于只计算一个总的平均效应。它允许我们为每一个处理州(如州
s=1)计算它自己的ATT_{1,2},然后可以按队列(所有在时期2处理的州)、按政策类型(所有实施A类政策的州)或按州本身来聚合这些ATT_{s,t}。 - 最小内核的数学困难:当处理州只有一个(
J=1)时,计算该州的ATT_{s,t}本身没有问题(就是上面的2×2比较)。但推断变得困难。例如,Jackknife方法需要“留一州”后重新估计。如果只有一个处理州,删除它后,该州的ATT就完全无法估计了。这就是本文反复强调的“Jackknife无定义”的情况。同样,如果只有一个对照州,删除它后,所有处理州的对照趋势估计都会变得不稳定,导致Jackknife过拒绝。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在交错采用(staggered adoption)的DiD设定下,当政策内容或实施背景在不同州之间存在差异时,如何定义、估计和推断比传统队列平均ATT(cohort ATT)更细粒度的子总体ATT,包括州级(state-specific)、政策类型级(policy-specific)和时期级(period-specific)ATT。
- 核心工具/方法:利用两个已有的DiD估计量——UN-DID(适用于数据不可池化场景)和DID-INT(适用于可池化数据,并允许灵活的协变量调整)——来构建“州×时间”层面的基本处理效应单元(
ATT_{s,t}),然后通过加权平均聚合到不同的子总体层面。在推断上,系统性地比较了随机化推断(RI) 和聚类Jackknife两种方法。 - 主要结论:在CPS模拟数据上的安慰剂法检验表明,RI的尺寸控制总体良好,但部分州特定检验偏保守;Jackknife方差估计在子总体ATT上可能无定义,有定义时在少量处理或对照州下会过度拒绝(呈现“U型”或“双边界”模式)。文章强调,估计量和推断方法的选择应与具体政策问题和实施背景匹配。
关键设定与假设¶
- 设定:面板数据,个体嵌套于州内,处理在州层面实施且是吸收的。存在多个处理时间点(交错采用)。政策内容(如补贴金额、资格规则)可能因州而异,即使采用时间相同。
- 关键假设:
- 平行趋势假设:这是核心识别假设。本文的关键创新在于区分了不同层级的平行趋势:
- 州级平行趋势(
ATT_{s,t}所需):每个处理州的反事实趋势必须与一个特定的对照组趋势相匹配。这是最强的假设。 - 队列级平均平行趋势(
ATT_{g,t}所需):一个队列内所有处理州的平均反事实趋势必须与对照组的平均趋势相匹配。这比州级假设弱,因为州级偏离可以相互抵消(见图3)。 - 政策类型级平均平行趋势(
ATT_{p,t}所需):实施同一类政策的州的平均反事实趋势必须与对照组的平均趋势相匹配。
- 州级平行趋势(
- 无预期效应(No Anticipation):在处理前,个体不会因为预期到未来的处理而改变行为。
- 无跨州溢出效应(No Spillovers):一个州的处理不会影响其他州的结果。
- 共同因果协变量(CCC)假设(仅对DID-INT):在调整协变量时,协变量对结果的影响在组间和时期之间是恒定的。DID-INT通过允许协变量系数随州或时间变化来放松这个假设。本文的Section 4.1专门讨论了CCC假设,并指出它对于Jackknife的实现方式(FastJack vs. TrueJack)至关重要。
- 平行趋势假设:这是核心识别假设。本文的关键创新在于区分了不同层级的平行趋势:
主要结果¶
- 理论结果:本文没有提出新的渐近理论。其主要理论贡献是定义和识别了子总体ATT(Proposition 1),并阐明了不同层级平行趋势假设之间的关系(Section 3.2)。它明确指出,队列级平行趋势是州级平行趋势的加权平均,因此更弱。
- 实证结果(模拟):
- Jackknife的“双边界”过拒绝:对于总体ATT、队列ATT和政策类型ATT,Jackknife的拒绝率在两种情况下显著高于5%:
- 当每个队列/政策类型中只有少数几个处理州时(如
J=1或J=2)。 - 当只有少数几个对照州时(如
J=19,H=40,只有2个对照州)。 这形成了一个U型曲线(见图5、6、8、10)。
- 当每个队列/政策类型中只有少数几个处理州时(如
- Jackknife无定义的情况:
- 对于州级ATT(
ATT_s),标准的“留一州”Jackknife永远无定义,因为删除该州后,其ATT无法估计。 - 对于队列ATT(
ATT_g),如果该队列只有一个处理州,Jackknife无定义。 - 对于政策类型ATT(
ATT_p),如果该政策类型只有一个处理州,Jackknife无定义。
- 对于州级ATT(
- RI的表现:
- 对于总体、队列和政策类型ATT,RI的拒绝率非常接近5%,表现稳健。
- 对于州级ATT,RI在只有一个处理州时表现保守(拒绝率低于5%)。
- 真实数据例子(最低工资):
- 数据:Callaway & Sant'Anna (2021) 使用的县级青少年就业数据(2001-2007),以及各州最低工资数据。
- 方法:使用无协变量的UN-DID/DID-INT估计州级ATT。
- 结果:总体ATT为-0.052(显著)。但州级ATT差异巨大,从-0.105(密歇根)到0.016(蒙大拿)。即使在同一个采用队列内(如2007年),不同州的ATT也差异显著(见图4)。这个例子旨在说明,队列平均ATT掩盖了州级效应的巨大异质性,而州级ATT能揭示这种异质性,并可能与政策内容(如最低工资增幅)相关。
- Jackknife的“双边界”过拒绝:对于总体ATT、队列ATT和政策类型ATT,Jackknife的拒绝率在两种情况下显著高于5%:
证明路线与技术技巧¶
本文是应用导向的,没有复杂的数学证明。其“证明”主要体现在模拟设计和结果分析上。
- 整体路线:
- 定义目标量:明确定义总体、队列、州、政策类型等不同层级的ATT。
- 选择估计工具:选择UN-DID和DID-INT作为构建“州×时间”ATT的工具。
- 设计模拟:使用CPS真实数据,随机分配“安慰剂法”(placebo law),确保所有估计的ATT的真实值为0。这样,任何拒绝都可以归因于推断方法的有限样本偏误。
- 比较推断方法:在大量模拟重复中,比较Jackknife和RI在不同样本量(
H)、不同处理组规模(J=L)和不同ATT层级下的实际拒绝率。 - 分析结果:通过绘制拒绝率曲线,揭示Jackknife的“双边界”模式和RI的稳健性。
- 关键跳跃点:本文没有传统意义上的“关键引理”。其核心洞察在于识别出Jackknife在子总体ATT上的两个失效边界(少数处理州和少数对照州),并系统性地用模拟证据证明了这一点。这个洞察本身是方法学上的贡献。
- 技术技巧点名:
- 随机化推断(RI):用于处理有限样本下的推断问题。本文使用了Racine & MacKinnon (2007) 的核平滑方法,当可用的随机化分配数量很少时(
S < 99),通过平滑p值的经验分布来获得更精确的p值。 - Jackknife方差估计:用于估计ATT的方差。本文区分了FastJack(固定第一阶段估计)和TrueJack(完全重估),并指出在DID-INT中,当协变量系数是州特定时,FastJack可以近似TrueJack;但当系数是共享的时,必须使用TrueJack。
- 安慰剂法模拟:使用真实数据(CPS)的结构,但随机分配处理状态,从而在保持数据复杂性的同时,确保真实效应为零。这是评估推断方法尺寸(size)的经典方法。
- 随机化推断(RI):用于处理有限样本下的推断问题。本文使用了Racine & MacKinnon (2007) 的核平滑方法,当可用的随机化分配数量很少时(
🔎 结论是否比证明窄¶
是的,结论比证明窄。 本文的结论主要基于模拟,而非严格的渐近理论。
- 具体语句:作者在Section 6.2.5总结道:“In these placebo-null simulations, RI rejection frequencies remain much closer to 5 percent... The principal departures occur for state-specific ATTs... This comparison concerns size under the placebo null; it does not establish a general ranking in power or computational cost.”
- 分析:作者明确承认,他们的结论仅限于零假设下的尺寸(size),并未涉及检验功效(power)。一个尺寸良好但功效极低的检验方法是没有实用价值的。作者在结论部分(Section 7)也承认:“The power of RI tests for jurisdiction-specific ATTs remains an important open question”。因此,本文的结论(RI尺寸好,Jackknife有双边界问题)是在特定模拟设定下关于尺寸的结论,不能泛化为“RI总是比Jackknife好”。对于功效的比较,本文没有提供证据。
四、开放问题¶
-
检验功效(Power)问题:本文只评估了零假设下的尺寸。对于州级ATT,RI表现保守(尺寸不足),但其功效如何?当存在真实效应时,RI能否有效检测出来?扎根于:Section 7 “The power of RI tests for jurisdiction-specific ATTs remains an important open question”。
-
州级平行趋势的诊断:本文指出,队列级的前趋势检验可能因正负抵消而通过,但掩盖了州级平行趋势的违反。如何开发出有效的、针对州级平行趋势的诊断工具?扎根于:Section 3.2 对图3的讨论,以及Section 7 “Methodological work should develop diagnostics for jurisdiction-level parallel trends”。
-
Jackknife的改进:本文揭示了Jackknife在少数处理或对照州时的过拒绝问题。是否存在改进的Jackknife方法(如bootstrap-t、wild bootstrap)能在这些边界情况下表现更好?扎根于:Section 6.2.5 对Jackknife“双边界”模式的描述。
-
更复杂的政策设计:本文假设处理是吸收的。如果处理是非吸收的(如政策被废除后又恢复),或者存在多值处理(如不同金额的补贴),本文的框架如何扩展?扎根于:本文的设定部分(Section 3.1)明确假设“Treatment is absorbing”。这是一个重要的限制。
Maintained by 陈星宇 · Homepage · Source on GitHub