跳转至

Two Margins in Difference-in-Differences with a Continuous Treatment

作者: Fangzhou Yu
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.09488


一、领域脉络与小综述

这个方向是什么

本子方向研究连续剂量、交错采纳的差分中的差分(DiD) 设定下的处理效应识别、估计与推断。核心统计问题是:当处理剂量是连续变量(而非二元),且各单位在不同时间点开始接受处理(交错采纳)时,如何从观测数据中分离出因果效应与选择偏差,并给出可操作的估计量和推断方法。当前该方向正处于从二元处理向连续剂量扩展的活跃期,主要挑战包括:剂量异质性、处理时机异质性、以及剂量与未观测混杂的关联。

发展脉络

  1. 奠基工作:二元处理交错DiD的稳健方法
  2. Callaway & Sant'Anna (2021) 和 Sun & Abraham (2021) 等建立了基于“从未处理”或“尚未处理”单位的队列-时间比较框架,避免了TWFE回归在异质性处理效应下的偏误。
  3. Goodman-Bacon (2021) 将二元TWFE系数分解为多个2×2比较的加权平均,揭示了权重问题。
  4. 这些工作为连续剂量扩展提供了“每个队列-时间比较单独处理”的模板。

  5. 主要进展:连续剂量DiD的识别与分解

  6. Callaway, Goodman-Bacon & Sant'Anna (2026, 即CGBS) 是直接前驱。他们提出剂量特异性平行趋势假设,识别了每个剂量水平上的处理效应(ATT(g,t,d|g,d)),并将连续剂量TWFE系数分解为因果响应与选择收益的加权平均。他们的权重依赖于未处理组大小,且分解中同时混入了水平比较和响应比较。
  7. 作者指出:“Our level margin is the average of their realized-dose effect over the cohort’s dose distribution.” 即本文的水平边际是CGBS剂量特异性效应在剂量分布上的平均。

  8. 当前frontier与本文位置

  9. 其他连续剂量方法包括:de Chaisemartin et al. (2024, 2026) 处理无“从不处理”单位的情形;Zhang (2026) 使用核平滑DML估计剂量特异性效应;Haddad et al. (2026) 处理时变连续剂量。
  10. 本文的位置:作者在CGBS的基础上,将每个队列-时间比较中的变异来源明确拆分为水平边际(处理组与未处理组的均值对比)和响应边际(处理组内剂量与结果变化的斜率),并证明OLS系数是二者的凸组合。作者建议分别报告这两个边际,而非混合系数。这一分离使得识别假设(PT-L vs PT-R)可以分别评估,且估计量无需密度估计或带宽选择。

子线索聚类

  • 线索A:连续剂量DiD的识别与估计
    包括CGBS (2026)、Zhang (2026)、de Chaisemartin et al. (2024, 2026)、Haddad et al. (2026)。这些工作关注如何在不同设定下(有无从不处理单位、时变剂量、重复截面)识别因果效应,通常需要剂量密度或核平滑。

  • 线索B:回归分解与权重
    包括Goodman-Bacon (2021)、CGBS (2026) 以及本文。这类工作将TWFE或类似回归系数分解为有意义的子比较的加权和,揭示混合系数的构成。

  • 线索C:敏感性分析与选择偏差
    包括Rambachan & Roth (2023)、Manski & Pepper (2018)。本文在响应边际的因果解释中引入了选择收益的敏感性分析(Theorem 4中的s0边界),与这些工作平行。

核心问题与瓶颈

  1. 如何从连续剂量DiD中分离因果响应与选择偏差?
    CGBS通过剂量特异性平行趋势假设做到了,但该假设同时要求水平平行趋势和响应平行趋势。本文将其拆开,允许分别检验。

  2. OLS系数到底测量了什么?
    本文证明它是两个不同比较的凸组合,且混合权重随未处理组比例变化。这解释了为什么同一数据下OLS系数可能因样本构成而改变。

  3. 如何做联合推断?
    本文提供了基于影响函数的堆叠推断方法,适用于多个队列-时间比较和事件时间聚合,且可扩展到协变量调整。

  4. 协变量如何影响两个边际?
    水平边际在条件平行趋势下仍可识别,但响应边际在残差化后定义不同(θ_R^(X)),且OLS系数仍包含水平成分(Proposition C.2)。

⚠️ 作者的framing

作者将缺口frame为:CGBS虽然分解了TWFE系数,但“their decomposition combines the two comparisons in a single coefficient with weights that depend on the untreated share”(Section 1)。本文的贡献是“separating the two comparisons and developing estimators and joint inference for their cohort-time and event-time parameters”。作者淡化了其他方法(如核平滑、密度估计)的复杂性,强调自己的估计量“involve no dose density, a derivative estimator, or a bandwidth”(Section 1)。
值得研究者去查的问题:作者在intro中未引用Hines et al. (2026) 的least-squares estimands(虽然正文中引用了),也未讨论与“average derivative effects”文献(Newey & Stoker, 1993)的深层联系。此外,对于“选择收益”的敏感性分析,作者只给出了常数边界s0,未讨论更一般的函数形式或与Rambachan & Roth (2023) 的pre-trend bound的直接结合。

张力

未见明显对立引用。各工作主要在设定(有无从不处理、时变剂量、重复截面)上不同,而非结论矛盾。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号(按论文定义,两期记号):

  • \(Y_1, Y_2\):基期和结果期的观测结果。
  • \(D\):剂量,处理组 \(D>0\),控制组 \(D=0\)。
  • \(T = \mathbf{1}\{D>0\}\):处理指示。
  • \(Y = Y_2 - Y_1\):结果变化(长差分)。
  • \(U = Y_2(0) - Y_1(0)\):未处理潜在结果变化。
  • \(\tau(d) = Y_2(d) - Y_2(0)\):剂量d的处理效应。
  • \(p = P(T=1)\),\(\rho = P(T=0) = 1-p\)。
  • \(Q = P(\cdot | T=1)\),\(E_+[\cdot]\) 表示在Q下的期望。
  • \(\mu_D = E_+[D]\),\(V_D = \text{Var}_+(D)\)。
  • \(\alpha(d) = (d - \mu_D)/V_D\):响应边际的表示子。
  • \(\tau_L = E_+[\tau(D)]\):水平边际(平均处理效应)。
  • \(\theta_R = \text{Cov}_+(D, Y)/V_D = E_+[\alpha(D)Y]\):响应指数(统计斜率)。
  • \(\delta_L = E[Y|T=1] - E[Y|T=0]\):水平对比(观测数据)。
  • \(\beta_{\text{TWFE}} = \text{Cov}(D,Y)/\text{Var}(D)\):两期TWFE系数。

模型:

  • 一致性:\(Y_2 = Y_2(D)\),\(Y_1 = Y_1(0)\)(无预期)。
  • 潜在结果:\(Y = U + \tau(D)\) 当 \(T=1\),\(Y = U\) 当 \(T=0\)。
  • 平行趋势假设:
  • PT-L:\(E[U|T=1] = E[U|T=0]\)(水平平行趋势)。
  • PT-R:\(E[U|D, T=1] = E[U|T=1]\) a.s. under Q(响应平行趋势)。
  • 正剂量变异:\(V_D > 0\)。

可观测数据:研究者观测到 \((Y_1, Y_2, D)\) 的i.i.d.样本。潜在结果 \(U, \tau(d)\) 不可观测。识别依赖于平行趋势假设。

第二步:最小内核——两期、一个处理组、一个控制组

最简特例:两期面板,一个处理组(所有处理单位在同一时间开始接受处理),一个从未处理的控制组。剂量 \(D\) 是连续正数(处理组)或0(控制组)。这是论文中每个队列-时间比较的通用模板。

核心命题(Theorem 3的两期版本):

\[\beta_{\text{TWFE}} = \lambda \theta_R + (1-\lambda) \frac{\delta_L}{\mu_D}, \quad \lambda = \frac{V_D}{V_D + \rho \mu_D^2}.\]
  • \(\theta_R\) 是处理组内结果变化对剂量的OLS斜率(响应指数)。
  • \(\delta_L\) 是处理组与控制组结果变化均值之差(水平对比)。
  • 在PT-L下,\(\delta_L = \tau_L\)(水平边际)。
  • 混合权重 \(\lambda\) 取决于处理组内剂量变异 \(V_D\)、均值 \(\mu_D\) 和控制组比例 \(\rho\)。

为什么这是最小内核:论文的全部技术(多期交错、协变量调整、事件时间聚合)都是在这个两期分解上叠加的。理解这个分解就抓住了论文的核心数学贡献:OLS系数不是单一因果参数,而是两个不同比较的加权平均,且权重随样本构成变化。

证明思路(两期):直接计算 \(\text{Cov}(D,Y)\) 和 \(\text{Var}(D)\) 的表达式,利用 \(D=0\) 当 \(T=0\) 的事实,得到:

\[\text{Var}(D) = p(V_D + \rho \mu_D^2), \quad \text{Cov}(D,Y) = p(V_D \theta_R + \rho \mu_D \delta_L).\]

相除即得。这个证明不依赖任何因果假设,是纯代数恒等式。在PT-L下,\(\delta_L = \tau_L\),从而得到因果解释。


三、这篇论文做了什么

三句话

  1. 研究问题:在连续剂量、交错采纳的DiD中,每个队列-时间比较包含两个不同的变异来源——处理组与控制组的水平对比(水平边际)和处理组内剂量与结果变化的关联(响应边际),论文将OLS系数分解为二者的凸组合,并分别提供估计量和联合推断方法。
  2. 核心工具:水平平行趋势(PT-L)和响应平行趋势(PT-R)两个非嵌套的识别假设;基于影响函数的堆叠推断;协变量调整下的交叉拟合DML。
  3. 主要结论:OLS系数是响应指数与水平对比(除以平均剂量)的凸组合,混合权重取决于未处理组比例;两个边际需要不同的识别假设且互不蕴含;在页岩气压裂应用中,水平边际拒绝联合零假设而响应边际未拒绝。

关键设定与假设

  • 交错采纳:处理开始时间 \(G\) 不同,剂量 \(D>0\) 固定不变,从未处理单位 \(G=\infty\) 剂量为0。
  • 队列-时间比较:每个比较 \(c=(g,t)\) 将队列 \(g\) 与在时间 \(t\) 尚未处理的单位配对,排除已处理单位作为控制。
  • 假设:
  • Assumption 1(正性和矩):\(0 < p < 1\),\(E[Y^2 + D^2] < \infty\)。
  • Assumption 2(正剂量变异):\(V_D > 0\)。
  • Assumption 3(一致性、无预期、潜在结果矩):\(Y_1 = Y_1(0), Y_2 = Y_2(D)\),\(E[U^2 + \tau(D)^2] < \infty\)。
  • Assumption 4(PT-L):\(E[U|T=1] = E[U|T=0]\)。
  • Assumption 5(PT-R):\(E[U|D, T=1] = E[U|T=1]\) a.s. under Q。
  • Assumption 6(面板一致性):多期版本。
  • Assumption 7(连通支撑、光滑性、兼容性):用于响应边际的导数表示。
  • Assumption 8-11:堆叠推断和DML所需的正则条件。

相比已有文献的放宽/强化:相比CGBS的剂量特异性平行趋势(同时要求PT-L和PT-R),本文将其拆开,允许只满足其中一个。但本文的响应边际因果解释需要额外的选择收益限制(Theorem 4中的S(d)=0或边界)。

主要结果

  1. Theorem 1(两期识别):PT-L识别水平边际 \(\tau_L = \delta_L\);PT-R识别响应指数为 \(\theta_R = \text{Cov}_+(D, \tau(D))/V_D\)。
  2. Theorem 3(两期TWFE分解):\(\beta_{\text{TWFE}} = \lambda \theta_R + (1-\lambda) \delta_L/\mu_D\),\(\lambda = V_D/(V_D + \rho \mu_D^2)\)。在PT-L下,\(\delta_L = \tau_L\)。
  3. Theorem 4(响应边际的导数表示与选择分解):在PT-R和光滑性下,\(\theta_R = \int W(d) q'(d) dd\),其中 \(q'(d) = \text{ACRT}(d|d) + S(d)\),\(S(d)\) 是选择导数。若 \(|S(d)| \leq s_0\),则 \(|\theta_R - \theta_R^{\text{causal}}| \leq s_0\)。
  4. Corollary 1(队列-时间版本):每个细胞 \(c=(g,t)\) 的OLS系数分解为 \(\beta_{\text{TWFE},g,t} = \lambda_{g,t} \theta_{R,g,t} + (1-\lambda_{g,t}) \delta_{L,g,t}/\mu_{D,g}\)。
  5. Theorem 5(堆叠推断):基线估计量的影响函数显式给出,联合渐近正态,协方差矩阵可一致估计。
  6. Theorem 6(加权聚合):事件时间聚合的推断,包括权重估计的不确定性。
  7. Theorem 7(协变量调整DML):交叉拟合估计量的渐近线性表示和效率界。

证明路线与技术技巧

整体路线(以两期分解为例):

  1. 写出 \(\text{Cov}(D,Y)\) 和 \(\text{Var}(D)\) 的表达式,利用 \(D=0\) 当 \(T=0\)。
  2. 将 \(\text{Cov}(D,Y)\) 分解为处理组内协方差和组间对比:\(\text{Cov}(D,Y) = p\{V_D \theta_R + \rho \mu_D \delta_L\}\)。
  3. 相除得到 \(\beta_{\text{TWFE}}\),整理为凸组合形式。
  4. 在PT-L下,\(\delta_L = \tau_L\),得到因果解释。

关键跳跃点:

  • 从两期到多期:每个队列-时间比较独立应用两期分解,但不同细胞间的协方差通过影响函数堆叠处理(Theorem 5)。难点在于处理不同细胞共享同一队列的剂量分布(\(\mu_{D,g}, V_g\) 跨时间固定),以及权重 \(\rho_{g,t}\) 随未处理组比例变化。
  • 响应边际的导数表示(Theorem 4):需要将 \(\theta_R = E_+[\alpha(D) \tau(D)]\) 转化为对 \(q'(d)\) 的积分。关键技巧是使用Yitzhaki (1996) 的OLS导数权重 \(W(d) = -E_+[\alpha(D) \mathbf{1}\{D \leq d\}]\),并应用Lemma A.1(符号测度积分恒等式)。这要求 \(q\) 绝对连续且 \(W\) 有界。
  • 选择分解:将 \(q'(d) = \text{ACRT}(d|d) + S(d)\) 代入,得到 \(\theta_R = \theta_R^{\text{causal}} + B_R^{\text{selection}}\)。这是CGBS分解的队列-时间版本。
  • 堆叠推断(Theorem 5):每个估计量的影响函数由样本矩的delta方法导出。关键技巧是将条件于 \(S^c=1\) 的影响函数通过 \(S^c/P(S^c=1)\) 运输到全面板分布,从而统一处理不同细胞间的依赖。
  • 协变量调整DML(Theorem 7):使用正交分数(C.7, C.8)消除 nuisance 估计偏差。响应分数是Clarke & Polselli (2026) 的残差-残差形式。交叉拟合保证 nuisance 收敛速率只需 \(o_P(n^{-1/4})\)。

技术技巧点名:

  • 影响函数(influence function):用于推导估计量的渐近方差和联合推断(Section 6.2)。
  • 堆叠(stacking):将多个细胞和边际的影响函数向量堆叠,保留跨细胞和跨边际的协方差。
  • 交叉拟合(cross-fitting):在DML中用于避免过拟合偏差(Section 7.2)。
  • 正交分数(orthogonal score):使得 nuisance 估计误差对目标估计的影响是二阶小量(Lemma C.2, C.3)。
  • 符号测度积分恒等式(Lemma A.1):将线性泛函转化为导数加权积分,用于导数表示。
  • 指数倾斜(exponential tilting):Proposition 3 给出响应指数的局部倾斜解释。

真实例子与应用

数据:Bartik et al. (2019) 的页岩气压裂数据,402个县,1990-2014年平衡面板。剂量是地质前景评分(连续、时间不变),处理开始年份是县所在页岩层首次压裂的年份。329个正剂量县,73个零剂量县(其中44个缺失评分被编码为0)。

方法应用:使用基线估计量(Section 6)对7个队列(2001, 2005-2010)在事件时间 \(e=0,\dots,4\) 估计水平对比和响应指数。每个细胞使用 \(G > g+e\) 作为控制。聚合使用全面板队列份额。

结果:

  • 水平对比在事件时间4为0.0474(i.i.d. SE 0.0116),响应指数为0.0284(i.i.d. SE 0.0082)。联合95% max-t区间从事件时间2起排除零。
  • 预趋势检验:水平领先项(\(e=-3,-2\))联合拒绝零假设(\(p<0.001\)),响应指数领先项未拒绝(\(p=0.322\))。作者因此报告水平路径为观测数据对比,保留响应路径的统计解释。
  • OLS系数分解:细胞级OLS系数中,响应指数权重 \(\lambda_{g,t}\) 在0.019-0.117之间,事件时间4时聚合OLS系数为0.0111,其中0.0097来自水平对比分量,0.0013来自响应指数分量。因此系数主要反映水平对比。
  • 缺失评分处理:移除44个缺失评分县后,水平对比从0.0432升至0.0513,响应指数不变(因为这些县只进入控制组)。

例子想说明什么:两个边际的预趋势诊断不同,且OLS系数主要由水平对比驱动。分别报告两个边际比报告单一OLS系数提供更多信息。

🔎 结论是否比证明窄

  • 响应边际的因果解释:Theorem 4 给出了在PT-R和光滑性下的导数表示,但实际应用中作者明确说“We do not impose those restrictions in this application”(Section 9.4)。因此论文的实证部分只报告了统计关联,未声称因果解释。结论中“The response-index leads do not reject”被解读为诊断而非因果证据。
  • 选择收益的敏感性分析:Theorem 4 给出了常数边界 \(s_0\) 下的保守置信区间,但论文在应用中未实施这一敏感性分析,只提到“A bound on the selection derivative gives a sensitivity bound for the causal component”(Section 1)。这属于“证明比结论宽”的情况——方法已开发但未在实证中展示。
  • 协变量调整:Theorem 7 提供了DML估计量和效率界,但应用中只使用了基线估计量,未展示协变量调整结果。作者在Section 7中承认“adjusted response objects carry the superscript (X)”且“conditioning on X changes the residual dose variation and the index itself”,但未在实证中比较调整前后的差异。

四、开放问题

  1. 选择收益的敏感性分析在实证中的应用:Theorem 4 给出了常数边界 \(s_0\) 下的保守推断,但论文未在页岩气数据中实施。未来工作可展示不同 \(s_0\) 下 \(\theta_R^{\text{causal}}\) 的置信区间变化,并与Rambachan & Roth (2023) 的pre-trend bound结合。扎根于Section 4.2最后一段:“Reporting this criterion over several values of \(s_0\) shows how much selection on gains the conclusion tolerates”。

  2. 多期交错TWFE系数的完整分解:论文只分解了每个队列-时间比较的OLS系数(Corollary 1),但未给出整个交错TWFE回归系数的分解(如Goodman-Bacon 2021对二元处理所做)。作者在Section 4.1末尾提到:“characterizing the pooled continuous-dose coefficient would require a separate decomposition”。这是一个明确的开放问题。

  3. 协变量调整下响应边际的因果解释:Proposition C.2 显示,即使部分出X,OLS系数仍包含水平成分。但调整后的响应指数 \(\theta_R^{(X)}\) 的因果解释需要条件PT-R和条件选择限制。论文未讨论当 \(V_g^{(X)} = 0\)(即X完全解释剂量变异)时的退化情形,也未给出条件选择限制的敏感性分析。扎根于Section 7.1和Appendix C.1。

  4. 与“平均导数效应”文献的深层联系:论文的响应指数 \(\theta_R\) 是Hines et al. (2026) 的最小二乘估计目标的一个特例,但作者未讨论 \(\theta_R\) 与Newey & Stoker (1993) 的加权平均导数之间的效率比较。未来工作可研究在非参数模型下 \(\theta_R\) 的半参数效率界,以及是否可以通过选择不同的表示子 \(\alpha\) 达到更高效。扎根于Proposition 2和Remark A.1。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论