Difference-in-differences with "bad controls"¶
作者: Carolina Caetano, Brantly Callaway, Stroud Payne, Hugo Sant'Anna
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.03881
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是双重差分(DiD)框架中,当平行趋势假设需在协变量上条件成立、但这些协变量本身可能受处理影响(即“坏控制变量”)时的识别与估计问题。该方向的核心张力在于:一方面,研究者希望纳入更多协变量以使平行趋势假设更可信;另一方面,若这些协变量是“坏控制”(即受处理影响),直接控制它们会引入“后处理偏差”(post-treatment bias),而简单丢弃它们又可能违背原始识别策略。该方向当前处于从“经验警示”向“系统识别理论”过渡的阶段——已有大量实证工作意识到坏控制的问题(Angrist & Pischke 2008),但直到最近才出现正式的识别条件与估计方法。
发展脉络(history)¶
- 奠基工作:坏控制问题的提出与警示
- Rosenbaum (1984):最早在因果推断中系统讨论“受处理影响的协变量”导致的偏差,指出调整这类变量会扭曲处理效应的估计。
- Angrist & Pischke (2008, Mostly Harmless Econometrics):将“坏控制”概念普及到经济学实证中,给出经典建议——“只控制那些不被处理本身引起的变量”。这一建议成为实证工作的主流做法,但作者并未提供正式的识别条件。
-
Robins & Greenland (1992) 与 Acharya, Blackwell & Sen (2016):在中介分析框架下讨论类似问题,但关注的是“直接效应 vs. 间接效应”的分解,而非本文关注的“坏控制作为协变量”的识别。
-
主要进展:DiD 框架下条件平行趋势与时间变化协变量
- Heckman, Ichimura & Todd (1997)、Abadie (2005):建立了条件平行趋势下 DiD 的识别与半参数估计框架,但假设协变量是外生的(不受处理影响)。
- Callaway & Sant’Anna (2021):将 DiD 推广到多期交错处理设定,并允许平行趋势条件于协变量,但同样假设协变量是“好”的(covariate exogeneity)。该文成为本文方法的核心工具之一。
-
Caetano & Callaway (2025):系统研究条件平行趋势下 DiD 的识别,揭示了 TWFE 回归的“隐藏线性偏差”(hidden linearity bias)——差分掉个体固定效应的同时也会差分掉时间变化协变量,从而改变识别策略或依赖正确模型设定。该文是本文的直接前驱。
-
当前 frontier:坏控制的正式识别与估计
- Lechner (2008)、Flores & Flores-Lagunes (2009):在横截面数据、无混淆性假设下,提出用“反事实协变量”来控制受处理影响的协变量。本文将其思路移植到 DiD 框架。
- Shahn et al. (2025)、Renson et al. (2023):在 DiD 框架下考虑时间变化协变量受处理影响,但他们的时序是“协变量→处理→结果”,而本文考虑的是“处理→协变量→结果”,后者更符合大多数社会科学应用。
- Knaus & Pfleiderer (2026):用 SWIG 图形式化条件平行趋势下的控制策略,可容纳坏控制。
- 本文 (Caetano, Callaway, Payne & Sant’Anna, 2026):首次在 DiD 框架下系统给出坏控制的正式定义(同时满足“结果相关性”与“受处理影响”),提出两种新识别策略(简单协变量无混淆性、协变量无混淆性),并给出 DML 估计量与预检验程序。
子线索聚类¶
- 线索 A:DiD 的识别与估计(核心文献)
- 经典条件 DiD:Heckman et al. (1997)、Abadie (2005)
- 多期交错处理:Callaway & Sant’Anna (2021)、Goodman-Bacon (2021)、Sun & Abraham (2021)、de Chaisemartin & D’Haultfoeuille (2020)
- 条件平行趋势的偏差诊断:Caetano & Callaway (2025)
-
插补估计量:Borusyak, Jaravel & Spiess (2024)、Gardner et al. (2023)、Liu, Wang & Xu (2024)
-
线索 B:坏控制变量与时间变化协变量
- 横截面设定:Lechner (2008)、Flores & Flores-Lagunes (2009)
- DiD 设定:Shahn et al. (2025)、Renson et al. (2023)、Knaus & Pfleiderer (2026)
-
中介分析视角:Deuchert, Huber & Schelker (2019)、Huber, Schelker & Strittmatter (2022)、Blackwell et al. (2026)
-
线索 C:双重/去偏机器学习(DML)在 DiD 中的应用
- Sant’Anna & Zhao (2020):提出 DiD 的双重稳健估计量,并给出半参数效率界。
- Chernozhukov et al. (2018):DML 的通用框架。
- Wager & Athey (2018):因果森林,作为 DML 中非参数估计器的例子。
这个方向在追问的核心问题¶
- 识别问题:当平行趋势需条件于协变量、且这些协变量受处理影响时,ATT 是否仍可识别?需要什么样的额外假设?
- 估计问题:如何构造对坏控制鲁棒的估计量?能否达到半参数效率界?
- 预检验问题:能否检验“协变量是否受处理影响”以及“无混淆性假设是否成立”?
- 交错处理扩展:上述结果能否推广到多期交错处理设定?
当前主流方法与已知瓶颈:主流做法是直接丢弃坏控制(Angrist & Pischke 的建议),但本文证明这等价于假设坏控制不影响结果趋势,违背坏控制的定义。另一种做法是直接包含坏控制,但会导致后处理偏差。瓶颈在于:坏控制的存在使得 ATT 的识别依赖于对“反事实协变量分布”的恢复,而这需要额外的无混淆性或冗余性假设。
⚠️ 作者的 framing¶
作者把缺口 frame 成什么:作者将坏控制问题定位为“DiD 框架下尚未被系统处理的识别与估计问题”,并声称“本文是第一个在 DiD 中给出坏控制正式定义并系统提出两种新识别策略的工作”。作者通过以下方式使本文成为“显然的下一步”: - 将已有工作(Caetano & Callaway 2025)中关于“时间变化协变量”的讨论明确聚焦到“坏控制”这一子类。 - 将 Lechner (2008) 和 Flores & Flores-Lagunes (2009) 在横截面无混淆性下的思路移植到 DiD 框架。 - 将 Callaway & Sant’Anna (2021) 的估计量作为“简单协变量无混淆性”下的直接应用。
哪些竞争路线被他淡化或回避了: - 中介分析路线:作者明确说“本文不如中介分析有野心”(只识别总效应,不分解直接/间接效应),但未讨论若研究者确实需要分解效应时,本文方法是否可扩展。 - 分布恢复路线:作者在 Remark 3 中提及可用 DiD 分布恢复方法(如 Callaway & Li 2019)来恢复 X_t(0) 的分布,但认为这些方法通常要求连续变量,对离散/混合协变量不适用。这一判断是否成立值得研究者自行查证。 - 线性假设下的简化:作者在附录 SC 中提及,在线性假设下只需恢复 E[ΔX_t(0)|D=1] 即可,但正文未强调这一更弱假设的可能性。
什么明显该被引/该存在、却没出现在 intro 里: - 时间变化处理(time-varying treatments)文献:作者在脚注 3 中提及,但未深入讨论。该文献(Robins 1986; Hernán & Robins 2020)处理的是“处理可随时间变化”的设定,与本文的“处理一次、协变量随后变化”不同,但两者在“后处理变量”的处理上有相通之处。 - 动态面板数据模型:作者在 Remark 2 中提及 Marx, Tamer & Tang (2025),但未在 intro 中讨论。动态面板模型中的“滞后因变量作为协变量”问题与本文的“滞后结果作为 W”有相似性。 - 图模型文献:作者引用了 Knaus & Pfleiderer (2026) 的 SWIG 框架,但未引用更早的 DAG 文献(如 Pearl 2009)中关于“后处理变量”的讨论。
张力¶
未见明显对立引用。各被引工作之间在“坏控制会导致偏差”这一点上高度一致,分歧主要在于如何解决。Lechner (2008) 和 Flores & Flores-Lagunes (2009) 在横截面下用无混淆性,本文在 DiD 下用类似思路,两者互补而非对立。Shahn et al. (2025) 的时序设定与本文不同,但作者明确指出了差异。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( D_i \in \{0,1\} \):处理状态,1=处理组,0=对照组。 - \( Y_{it} \):个体 i 在时期 t 的可观测结果。 - \( Y_{it}(1), Y_{it}(0) \):潜在结果(potential outcomes),分别对应接受处理和不接受处理。 - \( X_{it} \):可观测的“坏控制”变量(时间变化,可能受处理影响)。 - \( X_{it}(1), X_{it}(0) \):潜在坏控制变量。 - \( Z_i \):其他外生协变量(时间不变或外生时间变化)。 - \( W_i \):额外的外生协变量(仅在“协变量无混淆性”假设下出现)。 - \( \Delta Y_{it} = Y_{it} - Y_{i,t-1} \):结果的变化。 - \( t^* \):处理发生后的时期;\( t^*-1 \):处理前的时期。 - ATT = \( \mathbb{E}[Y_{t^*}(1) - Y_{t^*}(0) | D=1] \):处理组平均处理效应。
模型: - 两期设定:时期 \( t^*-1 \)(无人处理)和 \( t^* \)(部分处理)。 - 平行趋势假设(Assumption 2):条件于 \( (X_{t^*}(0), X_{t^*-1}, Z) \),处理组和对照组的未处理潜在结果变化均值相等。 - 坏控制的定义(Definition 1):\( X_t \) 同时满足“结果相关性”(Condition 1:\( X_t \) 影响未处理结果路径)和“受处理影响”(Condition 2:\( X_{t^*}(0) \) 与 \( X_{t^*}(1) \) 分布不同)。
可观测数据: - 研究者观测到:\( \{Y_{it^*}, Y_{i,t^*-1}, X_{it^*}, X_{i,t^*-1}, Z_i, D_i\}_{i=1}^n \)。 - 潜在量(不可观测):\( Y_{it^*}(0) \) 对处理组不可观测;\( X_{it^*}(0) \) 对处理组不可观测。
第二步:讲最小内核¶
最简特例:两期(\( t^*-1, t^* \)),单个坏控制变量 \( X_t \),无其他协变量 \( Z \) 和 \( W \)。
核心问题:在平行趋势假设下,ATT 的表达式为:
问题在于:\( X_{t^*}(0) \) 对处理组不可观测,因此无法直接计算 \( \mathbb{E}[m_0(X_{t^*}(0), X_{t^*-1}) | D=1] \)。
论文的关键想法:通过额外假设恢复 \( X_{t^*}(0) \) 在处理组中的分布。
-
方法 1(简单协变量无混淆性,Assumption 4):假设 \( X_{t^*}(0) \perp D \mid X_{t^*-1} \)。即,条件于预处理坏控制值,未处理潜在坏控制与处理状态独立。此时,处理组中 \( X_{t^*}(0) \) 的分布等于对照组中 \( X_{t^*} \) 的分布(条件于相同的 \( X_{t^*-1} \))。于是:
\[\text{ATT} = \mathbb{E}[\Delta Y_{t^*} | D=1] - \mathbb{E}[m_0(X_{t^*-1}) | D=1],\]其中 \( m_0(x_{t-1}) = \mathbb{E}[\Delta Y_{t^*} | X_{t^*-1}=x_{t-1}, D=0] \)。这个表达式只涉及可观测变量,可直接用 Callaway & Sant’Anna (2021) 估计。 -
方法 2(协变量无混淆性,Assumption 6):假设 \( X_{t^*}(0) \perp D \mid X_{t^*-1}, W \),其中 \( W \) 是额外观测到的协变量。此时,处理组中 \( X_{t^*}(0) \) 的分布可通过对照组中条件于 \( (X_{t^*-1}, W) \) 的 \( X_{t^*} \) 分布来恢复。ATT 的表达式变为:
\[\text{ATT} = \mathbb{E}[\Delta Y_{t^*} | D=1] - \mathbb{E}\big[ \mathbb{E}[ m_0(X_{t^*}, X_{t^*-1}) \mid X_{t^*-1}, W, D=0 ] \mid D=1 \big],\]这是一个嵌套期望,需要更复杂的估计(插补或 DML)。
为什么这个例子是“最小内核”:它去掉了多期交错处理、多个坏控制、外生协变量 Z 等一般性设定,只保留了两期、单个坏控制的核心识别困难。论文的一般情形(多期、交错处理、多个协变量)本质上是对这个两期例子的“加壳”——核心数学困难(恢复 \( X_{t^*}(0) \) 的分布)不变,只是需要处理更多的条件变量和更复杂的嵌套期望结构。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在 DiD 框架下,当平行趋势假设需条件于可能受处理影响的协变量(坏控制)时,如何识别和估计 ATT。
- 核心工具/方法:提出两种新识别策略——(i) 简单协变量无混淆性(条件于预处理坏控制值),(ii) 协变量无混淆性(条件于预处理坏控制值 + 额外协变量);并给出相应的插补估计量、双重稳健估计量和 DML 估计量。
- 主要结论:常见做法(直接包含或丢弃坏控制)均导致偏差;新方法在合理假设下可一致估计 ATT,且 DML 估计量在乘积率条件下达到 \( \sqrt{n} \)-一致与渐近正态。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- Assumption 1 (随机抽样):观测数据 i.i.d.
- Assumption 2 (条件平行趋势):\( \mathbb{E}[\Delta Y_{t^*}(0) | X_{t^*}(0), X_{t^*-1}, Z, D=1] = \mathbb{E}[\Delta Y_{t^*}(0) | X_{t^*}(0), X_{t^*-1}, Z, D=0] \)。相比已有文献(如 Callaway & Sant’Anna 2021),这里的创新在于条件变量包含 \( X_{t^*}(0) \)(未处理潜在坏控制),而非可观测的 \( X_{t^*} \)。
- Assumption 3 (重叠):\( P(D=1 | X_{t^*}(0), X_{t^*-1}, Z) < 1 \)。
- Assumption 4 (简单协变量无混淆性):\( X_{t^*}(0) \perp D \mid X_{t^*-1}, Z \)。这是方法 1 的核心假设,比 Assumption 6 更强(不需要额外协变量 W)。
- Assumption 5 (坏控制冗余性):\( \mathbb{E}[\Delta Y_{t^*}(0) | X_{t^*}(0), X_{t^*-1}, Z, D=0] = \mathbb{E}[\Delta Y_{t^*}(0) | X_{t^*-1}, Z, D=0] \)。这是方法 1 的替代假设,与 Assumption 4 非嵌套。
- Assumption 6 (协变量无混淆性):\( X_{t^*}(0) \perp D \mid X_{t^*-1}, W, Z \)。这是方法 2 的核心假设,比 Assumption 4 更弱(允许存在额外协变量 W)。
- Assumption 7 (重叠,扩展版):\( P(D=1 | X_{t^*-1}, W, Z) < 1 \)。
- Assumption 8 (线性条件,用于插补估计量):\( m_0 \) 和 \( \mathbb{E}[X_{t^*} | X_{t^*-1}, W, Z, D=0] \) 均为线性模型。
- Assumption 9 (乘积率条件,用于 DML):\( \|\hat{m}_0 - m_0\|_2 \cdot \|\hat{\omega}_0 - \omega_0\|_2 = o_p(n^{-1/2}) \) 等三个条件,确保 DML 估计量的 \( \sqrt{n} \)-一致性。
相比已有文献的放宽/强化: - 相比 Callaway & Sant’Anna (2021):放宽了“协变量外生性”(covariate exogeneity),允许协变量受处理影响。 - 相比 Caetano & Callaway (2025):聚焦于“坏控制”这一子类,给出正式定义和专门识别策略。 - 相比 Lechner (2008):将横截面无混淆性下的思路移植到 DiD 框架,并允许面板数据。
主要结果¶
定理 1(方法 1 的识别):在 Assumptions 1-4 下,ATT = \( \mathbb{E}[\Delta Y_{t^*} | D=1] - \mathbb{E}[m_0(X_{t^*-1}, Z) | D=1] \)。
- 直觉:Assumption 4 使 \( X_{t^*}(0) \) 在处理组和对照组中条件平衡,因此无需显式控制 \( X_{t^*} \),只需控制预处理值。
- 必要条件:Assumption 4 或 Assumption 5 之一成立。
- 解决的技术难点:绕过了对 \( X_{t^*}(0) \) 分布的直接恢复。
定理 2(方法 2 的识别):在 Assumptions 1, 2, 6, 7 下,ATT = \( \mathbb{E}[\Delta Y_{t^*} | D=1] - \mathbb{E}[ \mathbb{E}[ m_0(X_{t^*}, X_{t^*-1}, Z) \mid X_{t^*-1}, W, Z, D=0 ] \mid D=1 ] \)。
- 直觉:通过 W 恢复 \( X_{t^*}(0) \) 在处理组中的分布,再代入平行趋势。
- 必要条件:Assumption 6(协变量无混淆性)。
- 解决的技术难点:嵌套期望的识别与估计。
定理 3(交错处理扩展):在 Assumptions MP-1 至 MP-6 下,ATT(g,t) 可识别,表达式为嵌套期望形式(类似定理 2,但以 g-1 为基期)。
命题 4-7(估计量的渐近性质): - 插补估计量(Proposition 4):在正确线性模型下,\( \sqrt{n} \)-一致且渐近正态。 - 双重稳健估计量(Proposition 6):若要么 \( (m_0, \nu_0) \) 正确,要么 \( (p, \omega_0) \) 正确,则一致。 - DML 估计量(Proposition 7):在乘积率条件(Assumption 9)下,\( \sqrt{n} \)-一致且渐近正态,方差可通过影响函数一致估计。
证明路线与技术技巧¶
整体路线(以定理 2 为例): 1. 从 ATT 定义出发:ATT = \( \mathbb{E}[\Delta Y_{t^*} | D=1] - \mathbb{E}[\Delta Y_{t^*}(0) | D=1] \)。 2. 用平行趋势替换:\( \mathbb{E}[\Delta Y_{t^*}(0) | D=1] = \mathbb{E}[ m_0(X_{t^*}(0), X_{t^*-1}, Z) | D=1] \)(由 Assumption 2)。 3. 用无混淆性恢复分布:\( \mathbb{E}[ m_0(X_{t^*}(0), X_{t^*-1}, Z) | D=1] = \mathbb{E}[ \mathbb{E}[ m_0(X_{t^*}(0), X_{t^*-1}, Z) \mid X_{t^*-1}, W, Z, D=1 ] \mid D=1 ] \)(LIE),再由 Assumption 6 将内层条件期望中的 D=1 替换为 D=0。 4. 用可观测变量替换:对对照组,\( X_{t^*}(0) = X_{t^*} \),因此内层期望变为 \( \mathbb{E}[ m_0(X_{t^*}, X_{t^*-1}, Z) \mid X_{t^*-1}, W, Z, D=0 ] \)。
关键跳跃点: - 跳跃 1:从 \( \mathbb{E}[\Delta Y_{t^*}(0) | D=1] \) 到 \( \mathbb{E}[ m_0(X_{t^*}(0), X_{t^*-1}, Z) | D=1] \) 需要平行趋势假设(Assumption 2)。难点在于平行趋势条件于 \( X_{t^*}(0) \),而 \( X_{t^*}(0) \) 对处理组不可观测。作者通过 LIE 和 Assumption 2 的“条件均值相等”性质绕过了直接观测 \( X_{t^*}(0) \) 的需要。 - 跳跃 2:从 \( \mathbb{E}[ m_0(X_{t^*}(0), X_{t^*-1}, Z) | D=1] \) 到可观测表达式需要无混淆性假设(Assumption 4 或 6)。难点在于将条件分布从处理组转移到对照组。作者用无混淆性假设直接“交换”了条件分布中的 D 指标。
技术技巧点名: - Law of Iterated Expectations (LIE):反复使用,将期望分解为条件期望的期望。 - 条件分布交换:利用无混淆性假设,将处理组的条件分布替换为对照组的条件分布。 - Neyman 正交性:在 DML 估计量(Proposition 5-7)中,通过构造 Neyman 正交的得分函数(式 10),使得估计量对 nuisance 函数的估计误差不敏感。 - 交叉拟合(Cross-fitting):在 Algorithm 1 中,将数据分为 K 折,每折用其余数据估计 nuisance 函数,再用本折数据计算得分,避免过拟合偏差。 - 乘积率条件(Assumption 9):要求 nuisance 函数的 \( L_2 \) 误差乘积为 \( o_p(n^{-1/2}) \),这是 DML 文献的标准条件(Chernozhukov et al. 2018)。
真实例子与应用¶
数据:NLSY79(1979 年全国青年纵向调查),1992-2002 年双年数据,平衡面板 3,231 人。
场景:研究“工作置换(job displacement)”对收入的影响。坏控制变量是“职业得分”(occupation score,即该职业的典型对数工资中位数)。
方法应用: - 首先检验职业得分是否真的是坏控制:在协变量无混淆性假设下,估计处理对职业得分的影响(Figure 6),发现工作置换平均降低职业得分约 2%(边际显著),证实职业得分受处理影响。 - 然后估计 ATT:使用 9 种不同估计量(TWFE 含/不含坏控制、插补含/不含坏控制、平行趋势假设、简单无混淆性 ML、插补、双重稳健、ML),比较结果(Figure 8)。
结果: - 基线插补估计量(方法 2)给出 ATT ≈ -6.7%(SE=0.024),即工作置换平均降低收入约 7%。 - TWFE 估计量(含或不含坏控制)给出约 -10% 的效应,比基线大 40%。 - 插补估计量(含或不含坏控制)给出约 -3% 到 -4% 的效应,比基线小。 - DML 和双重稳健估计量(基于相同无混淆性假设)与基线插补估计量非常接近。
这个例子想说明什么: - 验证了职业得分确实是坏控制(受处理影响)。 - 展示了不同方法对坏控制的处理会导致定量差异(TWFE 高估,简单插补低估),而本文提出的方法(插补、DR、ML)给出居中且相互一致的估计。 - 强调了“含/不含坏控制作为稳健性检验”的常见做法可能产生误导——两种做法都偏离了本文方法的结果。
🔎 结论是否比证明窄¶
- Theorem 1 的证明严格依赖于 Assumption 4(简单协变量无混淆性)或 Assumption 5(坏控制冗余性)。作者在 Proposition 1 中给出了 Assumption 5 下的等价结果,但未讨论若两个假设都不成立时,ATT 是否仍可部分识别。
- Theorem 2 的证明严格依赖于 Assumption 6(协变量无混淆性)。作者在 Remark 3 中提及可用分布恢复方法(如 Callaway & Li 2019)替代,但未给出正式定理,且指出这些方法通常要求连续变量。
- 交错处理扩展(Theorem 3) 的证明依赖于 Assumption MP-5(一阶马尔可夫结构),即 \( X_t(0) \) 条件独立于历史仅通过 \( X_{t-1}(0) \)。作者在 Section 5.1.1 中给出了维度降低的扩展(Assumption MP-7),但未讨论若马尔可夫假设不成立时,是否仍可识别。
- DML 估计量(Proposition 7) 的渐近正态性依赖于 Assumption 9(乘积率条件)。作者指出该条件在 \( n^{-1/4} \) 收敛率下成立,但未给出具体哪些非参数估计器能达到该率(仅提及随机森林作为例子,引用 Wager & Athey 2018)。
四、开放问题¶
-
线性假设的放松:插补估计量(Section 6.1)依赖线性模型假设(Assumption 8)。能否在更弱的半参数或非参数结构下构造类似插补估计量?——扎根于 Assumption 8 和 Proposition 4 的证明。
-
W 的选择与敏感性:方法 2 中 W 的选择是任意的(只要满足无混淆性)。作者在 Remark 2 中建议用滞后结果 \( Y_{t^*-1} \),但未讨论若 W 选择不当(如遗漏重要混淆变量)时的敏感性。能否发展出类似“敏感性分析”的工具?——扎根于 Theorem 2 和 Remark 2。
-
预检验的正式理论:作者在 Remark 6 中提出用预处理期的伪 ATT 来检验假设,但未给出正式的检验统计量及其渐近分布。能否构造一个正式的假设检验(如基于 DML 的 Wald 检验)?——扎根于 Remark 6。
-
离散/混合坏控制的处理:作者在 Remark 3 中指出分布恢复方法通常要求连续变量,但未给出离散坏控制的专门处理。能否用本文的无混淆性方法直接处理离散坏控制(如职业类别)?——扎根于 Remark 3 和 Theorem 2 的证明(无混淆性假设不要求协变量连续)。
Maintained by 陈星宇 · Homepage · Source on GitHub