The PCDID Approach: Difference-in-Differences When Trends Are Potentially Unparallel and Stochastic¶
作者: Marc K. Chan, Simon S. Kwok
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 8/10
机构绿灯: University of Melbourne(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2021.1914636
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的是双重差分(Difference-in-Differences, DID) 中一个根本性的识别威胁:当处理组与对照组的潜在结果趋势不平行(non-parallel trends)时,经典 DID 估计量是有偏的。传统 DID 依赖的“平行趋势假设”要求,在未接受处理的情况下,处理组与对照组的平均结果变化趋势相同。当这一假设因未观测到的时变混杂因素而违反时,DID 失效。本文所针对的,正是如何放松这一假设,在“趋势可能不平行且随机”(Potentially Unparallel and Stochastic)的条件下,仍能识别和估计处理效应。该方向当前处于方法高度活跃但共识尚未形成的阶段——已有多种替代策略(如合成控制、交互固定效应、因子模型、工具变量 DID),但每种都有其强假设与适用边界。
发展脉络(history)¶
根据本文 introduction 及其引用的文献,可将该方向的发展脉络梳理如下:
-
奠基工作:经典 DID 与平行趋势假设的提出
- Ashenfelter & Card (1985):经典 DID 的早期应用,奠定了“处理组-对照组-前后比较”的基本框架。其核心识别假设是平行趋势,但作者已注意到该假设可能因处理前的个体异质性趋势而违反。
- Angrist & Pischke (2009):将 DID 作为“可信的因果推断”的核心工具之一进行推广,系统阐述了平行趋势假设及其检验(如事件研究图)。该工作使 DID 成为应用经济学的主流方法,但也暴露了其脆弱性——一旦平行趋势不成立,整个识别就崩溃。
-
主要进展:放松平行趋势假设的尝试
- Abadie, Diamond & Hainmueller (2010) —— 合成控制法(Synthetic Control):通过加权组合对照组单元来构造一个“合成处理组”,使其在处理前的结果路径与真实处理组尽可能匹配。该方法放松了平行趋势假设,但要求处理前有足够长的时期,且权重非负、和为1,限制了其适用性。
- Bai (2009) —— 交互固定效应模型(Interactive Fixed Effects, IFE):将未观测到的异质性建模为因子载荷与因子时间序列的乘积之和(即 \( \lambda_i' F_t \)),从而允许处理组与对照组的趋势差异由这些因子驱动。该模型为 DID 的放松提供了强大的数学框架,但估计需要迭代算法(如主成分 + 最小二乘),且因子数需事先指定。
- Gobillon & Magnac (2016):在 DID 框架下引入交互固定效应,并讨论了识别条件。他们指出,当处理组与对照组的因子载荷不同时,平行趋势假设自然被违反,而 IFE 模型可以捕捉这种差异。
- Callaway & Sant’Anna (2021):提出了在多期 DID 中处理“处理时间异质性”的框架,并给出了在平行趋势条件成立下的稳健估计量。该工作主要关注处理时间异质性,而非放松平行趋势本身。
-
当前 Frontier:因子代理方法与控制函数
- 本文(Chan & Kwok, 2022)—— PCDID:将 Bai (2009) 的 IFE 模型与“控制函数”(control function)思想结合。核心创新在于:不直接估计因子载荷和因子时间序列,而是用对照组数据构造因子代理变量(如主成分),并将其作为回归中的控制函数。这样做的好处是:① 避免了 IFE 模型中的迭代估计,计算更简单;② 对时间趋势的设定要求极弱(只需因子结构存在,不要求趋势的具体形式);③ 在回归框架下,可以自然地处理标准误和推断问题。
- 与之平行的竞争路线:① 工具变量 DID(如 Hudson, Hull & Liebersohn 2017):用工具变量处理平行趋势的违反,但需要有效的 IV,这在许多应用中难以获得。② 双重稳健 DID(如 Sant’Anna & Zhao 2020):结合倾向得分加权与结果回归,但核心仍依赖平行趋势假设(或条件平行趋势)。③ 基于因子模型的 DID(如 Xu 2017 的
gsynth包):直接估计 IFE 模型,但计算复杂且对因子数选择敏感。
子线索聚类¶
这些被引文献大致落在以下 3 条子线索上:
- 线索 A:加权匹配类方法(合成控制、倾向得分加权)。核心思想是通过加权使处理组与对照组在处理前“更可比”,从而放松平行趋势。代表:Abadie et al. (2010), Callaway & Sant’Anna (2021)。瓶颈:权重非负约束限制了匹配质量;处理前时期长度要求高。
- 线索 B:因子模型 / 交互固定效应类方法。核心思想是用低维因子结构捕捉未观测到的时变混杂。代表:Bai (2009), Gobillon & Magnac (2016), Xu (2017), 本文。瓶颈:因子数选择、因子载荷的异质性假设、估计的渐近性质。
- 线索 C:工具变量 / 结构方法。核心思想是用外生变异源替代平行趋势假设。代表:Hudson et al. (2017)。瓶颈:IV 的有效性难以验证,且在许多 DID 设定中难以找到合适的 IV。
这个方向在追问的核心问题¶
- 识别问题:在什么条件下,即使平行趋势不成立,处理效应仍可被识别?这些条件是否可检验或可辩护?
- 估计问题:如何构造一个计算可行、且具有良好有限样本性质的估计量?因子数选择、代理变量构造等细节如何影响估计?
- 推断问题:如何为放松平行趋势后的 DID 估计量构造有效的标准误和置信区间?如何处理序列相关和截面相关?
- 敏感性分析:当核心假设(如因子结构、因子数)被违反时,估计结果有多稳健?
⚠️ 作者的 framing¶
作者将缺口 frame 成:现有放松平行趋势的方法(如合成控制、IFE)要么计算复杂(需要迭代),要么对时间趋势的设定要求过强(如要求趋势为线性或多项式),要么缺乏清晰的因果参数解释。因此,本文的 PCDID 方法被定位为“一个简单、回归-based、且对趋势设定要求极弱的替代方案”。
-
被淡化或回避的竞争路线:
- 合成控制法:作者在 intro 中承认其“需要处理前有足够长的时期”,但未深入讨论其与 PCDID 在有限样本下的相对表现。合成控制在处理组只有一个单元时特别有用,而 PCDID 要求处理组和对照组都有多个单元(以构造因子代理)。
- 直接估计 IFE 模型:作者指出其“需要迭代算法”,但未讨论迭代算法(如 Bai 2009 的 EM 算法)在计算上是否真的比 PCDID 的回归更差。对于中等规模的数据,迭代算法可能也是可行的。
- 双重稳健 DID:作者完全未提及。这可能是因为双重稳健 DID 的核心仍是平行趋势(或条件平行趋势),与本文的因子结构假设正交。
-
什么明显该被引 / 该存在、却没出现在 intro 里?
- Xu (2017) 的
gsynth包:这是应用经济学中广泛使用的基于 IFE 的 DID 实现,直接与本文竞争。作者在 intro 中引用了 Bai (2009) 和 Gobillon & Magnac (2016),但未提及 Xu (2017) 这个更贴近应用的工作。这可能是一个值得研究者去查的 gap:作者是有意回避,还是认为 Xu (2017) 的方法论贡献不够大? - 关于因子数选择的文献:PCDID 需要选择因子代理的个数(即主成分个数)。作者在正文中提到了可以用 Bai & Ng (2002) 的信息准则,但未在 intro 中讨论因子数选择对识别和估计的影响。这是一个重要的开放问题。
- 关于“随机趋势”的文献:标题中的“Stochastic Trends”在 intro 中并未被明确定义或与“deterministic trends”对比。作者似乎用它来指代“未观测到的、由随机过程驱动的趋势”,但未引用任何关于单位根或协整的文献。这可能是一个概念上的模糊点。
- Xu (2017) 的
-
张力:未见明显对立引用。所有被引工作都承认平行趋势假设的脆弱性,并试图以不同方式放松它。它们之间的差异在于放松的方式和代价,而非根本性的矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( i = 1, \dots, N \):个体(units)索引。\( N \) 为总样本量。
- \( t = 1, \dots, T \):时间(periods)索引。\( T \) 为总时期数。
- \( D_{it} \):处理变量(treatment indicator)。\( D_{it} = 1 \) 表示个体 \( i \) 在时期 \( t \) 接受了处理,否则为 0。
- \( Y_{it} \):可观测的结果变量(outcome)。
- \( Y_{it}(1) \):潜在结果(potential outcome)——如果个体 \( i \) 在时期 \( t \) 接受了处理。
- \( Y_{it}(0) \):潜在结果——如果个体 \( i \) 在时期 \( t \) 未接受处理。
- \( \tau_{it} = Y_{it}(1) - Y_{it}(0) \):个体 \( i \) 在时期 \( t \) 的处理效应(treatment effect)。本文主要关注平均处理效应(ATT):\( \tau = \mathbb{E}[Y_{it}(1) - Y_{it}(0) \mid D_{it} = 1] \)。
- \( \lambda_i \):个体 \( i \) 的 \( r \times 1 \) 因子载荷向量(factor loadings)。\( r \) 是因子个数(未知,需估计)。
- \( F_t \):时期 \( t \) 的 \( r \times 1 \) 因子时间序列向量(factor time series)。
- \( \varepsilon_{it} \):个体 \( i \) 在时期 \( t \) 的 idiosyncratic 误差项(均值为 0,允许截面相关和序列相关)。
- \( X_{it} \):可观测的协变量向量(可选)。
- \( \beta \):协变量的系数向量。
- \( \alpha_i \):个体固定效应(individual fixed effects)。
- \( \xi_t \):时间固定效应(time fixed effects)。
-
模型: 本文的核心模型是交互固定效应(Interactive Fixed Effects, IFE)模型,用于描述未接受处理时的潜在结果:
\[Y_{it}(0) = \alpha_i + \xi_t + X_{it}'\beta + \lambda_i' F_t + \varepsilon_{it}\]其中,\( \lambda_i' F_t \) 是交互效应项,它允许每个个体 \( i \) 对共同的时间因子 \( F_t \) 有不同的响应(通过载荷 \( \lambda_i \))。平行趋势假设等价于要求 \( \lambda_i' F_t \) 在处理组和对照组中相同(即 \( \lambda_i \) 在处理组和对照组中分布相同),而本文放松了这一要求,允许 \( \lambda_i \) 在处理组和对照组中不同。处理效应模型为:
\[Y_{it} = Y_{it}(0) + \tau D_{it}\]即处理效应是常数(或可加)的。将两者结合,得到可观测结果的模型:\[Y_{it} = \alpha_i + \xi_t + X_{it}'\beta + \lambda_i' F_t + \tau D_{it} + \varepsilon_{it}\] -
可观测数据:
- 研究者能观测到:\( \{Y_{it}, D_{it}, X_{it}\} \) 对于所有 \( i = 1, \dots, N \) 和 \( t = 1, \dots, T \)。
- 研究者想要但观测不到:
- 潜在结果 \( Y_{it}(0) \) 和 \( Y_{it}(1) \)(只能观测到其中一个)。
- 因子载荷 \( \lambda_i \) 和因子时间序列 \( F_t \)。
- 个体固定效应 \( \alpha_i \) 和时间固定效应 \( \xi_t \)。
- idiosyncratic 误差 \( \varepsilon_{it} \)。
- 关键识别假设:未观测到的混杂趋势 \( \lambda_i' F_t \) 具有低维因子结构。这意味着,虽然每个个体有自己的趋势,但这些趋势是由少量共同的时间因子(\( F_t \))通过个体特定的载荷(\( \lambda_i \))线性组合而成的。
第二步:讲最小内核¶
最简特例:假设没有协变量(\( X_{it} = 0 \)),且处理只在最后一个时期 \( T \) 发生(即 \( D_{it} = 0 \) for \( t < T \),\( D_{iT} = 1 \) 对于处理组个体)。这是一个典型的“两期 DID”设定,但允许趋势不平行。
在这个特例下,模型退化为:
核心思路:经典 DID 通过“处理组前后变化 - 对照组前后变化”来消除 \( \alpha_i \) 和 \( \xi_t \),但无法消除 \( \lambda_i' F_t \) 的差异。PCDID 的想法是:用对照组的数据来“学习”因子时间序列 \( F_t \),然后将其作为控制函数放入回归中,从而控制住 \( \lambda_i' F_t \) 带来的混杂。
具体步骤(最简形式):
-
构造因子代理变量:只使用对照组(\( D_{it} = 0 \) 对所有 \( t \))的数据。对对照组个体,模型为:
\[Y_{it} = \alpha_i + \xi_t + \lambda_i' F_t + \varepsilon_{it}\]这是一个标准的 IFE 模型。我们可以用主成分分析(PCA)从对照组的 \( Y_{it} \) 数据中估计出因子时间序列 \( \hat{F}_t \)(即主成分得分)。\( \hat{F}_t \) 是 \( F_t \) 的相合估计(在 \( N_{control} \to \infty \) 和 \( T \to \infty \) 下)。 -
回归估计:将 \( \hat{F}_t \) 作为额外的回归变量,放入全样本的回归中:
\[Y_{it} = \alpha_i + \xi_t + \lambda_i' \hat{F}_t + \tau D_{it} + \text{error}\]这里,\( \lambda_i \) 被视为个体特定的系数(与 \( \hat{F}_t \) 交互),需要与 \( \alpha_i \) 和 \( \xi_t \) 一起估计。由于 \( \hat{F}_t \) 是已知的(从第一步得到),这是一个线性回归,可以用最小二乘法(OLS)估计。
为什么这个特例能体现核心思路?
- 识别:在经典 DID 中,\( \tau \) 的识别依赖于 \( \mathbb{E}[\Delta Y_{iT} \mid D=1] - \mathbb{E}[\Delta Y_{iT} \mid D=0] \),其中 \( \Delta Y_{iT} = Y_{iT} - Y_{i,T-1} \)。在 IFE 模型下,这个差分等于 \( \tau + (\lambda_i' \Delta F_T) \)。如果 \( \lambda_i \) 在处理组和对照组中不同,则 \( \mathbb{E}[\lambda_i' \Delta F_T \mid D=1] \neq \mathbb{E}[\lambda_i' \Delta F_T \mid D=0] \),导致经典 DID 有偏。PCDID 通过在回归中控制 \( \hat{F}_t \),相当于直接估计了 \( \lambda_i' F_t \) 项,从而消除了这个偏误。
- 估计:整个估计过程是两步法,但第二步是简单的 OLS。这比直接估计 IFE 模型(需要迭代)要简单得多。
- 推断:由于第二步是 OLS,标准误可以通过“夹心估计量”(sandwich estimator)或 bootstrap 来获得,且可以处理 \( \hat{F}_t \) 是估计量的事实(需要调整标准误)。
这个特例下要证的命题:在 \( N_{control} \to \infty \) 和 \( T \to \infty \) 下,\( \hat{\tau}_{PCDID} \) 是 \( \tau \) 的相合估计,且 \( \sqrt{N}(\hat{\tau}_{PCDID} - \tau) \) 渐近正态。论文的一般情形只是这个特例的“加壳”——加入协变量、多期处理、更一般的处理模式等。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在 DID 设定中,当处理组与对照组的潜在结果趋势因未观测到的交互固定效应(因子结构)而不平行时,如何识别和估计平均处理效应(ATT)。
- 核心工具 / 方法:提出了PCDID(Principal Components Difference-in-Differences) 估计量,一种基于回归的两步法:第一步,用对照组数据通过主成分分析(PCA)构造因子代理变量;第二步,将这些代理变量作为控制函数纳入全样本的线性回归中,从而估计处理效应。
- 主要结论:在因子结构假设下,PCDID 估计量是相合的且渐近正态的。作者给出了估计量的渐近方差公式,并证明了其渐近性质对时间趋势的设定要求极弱(只需因子结构存在,不要求趋势为线性或多项式)。实证部分用美国福利 waiver 项目的数据展示了该方法的实用性。
关键设定与假设¶
在第二节最简记号的基础上,补全完整设定:
-
模型:
\[Y_{it} = \alpha_i + \xi_t + X_{it}'\beta + \lambda_i' F_t + \tau D_{it} + \varepsilon_{it}\]其中,\( \lambda_i \) 是 \( r \times 1 \) 向量,\( F_t \) 是 \( r \times 1 \) 向量。\( r \) 是因子个数,未知但有限。 -
假设(核心):
- 因子结构假设:未观测到的混杂 \( \lambda_i' F_t \) 具有低维因子结构。这是整个方法的基础。
- 因子数已知或可一致估计:作者假设 \( r \) 是已知的,或者可以通过 Bai & Ng (2002) 的信息准则一致地估计。在实际操作中,研究者需要选择 \( r \)。
- 处理效应同质性:处理效应 \( \tau \) 对所有处理组个体和所有处理后的时期是常数。这是一个很强的假设,作者在正文中讨论了放松的可能性(如允许 \( \tau \) 随时间变化),但主要结果基于此假设。
- 无预期效应(No Anticipation):处理组个体在真正接受处理之前,不会因为预期到未来的处理而改变行为。即 \( Y_{it}(0) \) 在 \( t < T \) 时不受未来处理的影响。
- 对照组足够大:对照组个体数 \( N_0 \) 和时期数 \( T \) 都趋于无穷,且 \( N_0 / T \) 趋于一个常数。这是为了确保从对照组估计的因子代理 \( \hat{F}_t \) 是相合的。
- 因子载荷的异质性:允许处理组和对照组的因子载荷分布不同。这是放松平行趋势的关键。
- 误差项条件:\( \varepsilon_{it} \) 允许截面相关和序列相关,但需要满足一定的矩条件和弱相关性条件(如 mixing 条件),以确保中心极限定理成立。
-
相比已有文献的放宽或强化:
- 相比经典 DID:放宽了平行趋势假设。
- 相比合成控制:不需要处理前有足够长的时期,且允许处理组有多个单元。
- 相比直接估计 IFE 模型(如 Bai 2009):计算更简单(两步 OLS vs. 迭代),且对时间趋势的设定要求更弱(不需要假设趋势的具体形式)。但代价是:① 需要假设处理效应同质性;② 因子代理的估计误差会影响第二步的推断,需要调整标准误。
主要结果¶
定理 1(相合性):在正则条件下,\( \hat{\tau}_{PCDID} \xrightarrow{p} \tau \)。
- 直觉:第一步中,从对照组估计的 \( \hat{F}_t \) 是 \( F_t \) 的相合估计。第二步中,将 \( \hat{F}_t \) 作为控制函数放入回归,相当于在回归中“控制住”了 \( \lambda_i' F_t \) 项。由于 \( \hat{F}_t \) 的估计误差随 \( N_0, T \to \infty \) 而消失,因此 \( \hat{\tau}_{PCDID} \) 是相合的。
- 必要条件:\( N_0 \to \infty \),\( T \to \infty \),且 \( N_0 / T \to c \in (0, \infty) \)。因子数 \( r \) 已知或可一致估计。
- 解决的技术难点:需要证明 \( \hat{F}_t \) 的估计误差不影响 \( \hat{\tau} \) 的相合性。这通常需要用到 Bai (2009) 中关于 PCA 估计量的渐近性质。
定理 2(渐近正态性):在正则条件下,\( \sqrt{N}(\hat{\tau}_{PCDID} - \tau) \xrightarrow{d} N(0, V) \),其中 \( V \) 是渐近方差。
- 直觉:由于 \( \hat{\tau}_{PCDID} \) 是 OLS 估计量,其渐近正态性来自于中心极限定理。但方差 \( V \) 需要调整,以反映第一步中估计 \( \hat{F}_t \) 带来的不确定性。
- 必要条件:除了定理 1 的条件外,还需要误差项 \( \varepsilon_{it} \) 满足一定的弱相关性条件(如 mixing 条件),以确保 CLT 成立。
- 解决的技术难点:推导渐近方差 \( V \) 的表达式,并证明其可以被一致地估计。作者给出了一个“夹心估计量”形式的方差估计量,该估计量考虑了 \( \hat{F}_t \) 的估计误差。
定理 3(方差估计的一致性):作者提出的方差估计量 \( \hat{V} \) 是 \( V \) 的相合估计。
- 直觉:方差估计量需要“夹心”形式,以捕捉 \( \hat{F}_t \) 的估计误差和 \( \varepsilon_{it} \) 的异方差/自相关。
- 解决的技术难点:证明方差估计量的一致性需要用到高阶渐近展开,以处理 \( \hat{F}_t \) 的估计误差对第二步回归的影响。
证明路线与技术技巧¶
整体路线:
- 第一步:因子代理估计。只使用对照组数据,通过 PCA 估计因子时间序列 \( \hat{F}_t \)。这一步的渐近性质由 Bai (2009) 保证:\( \hat{F}_t \) 是 \( F_t \) 的相合估计,且 \( \hat{F}_t - H F_t = O_p(N_0^{-1/2} + T^{-1/2}) \),其中 \( H \) 是一个旋转矩阵(因为因子和载荷只能被识别到旋转)。
- 第二步:回归估计。将 \( \hat{F}_t \) 作为已知的回归变量,放入全样本的回归中,用 OLS 估计 \( \tau \) 和 \( \lambda_i \)。将 OLS 估计量 \( \hat{\tau} \) 写成关于真实参数和误差项的表达式。
- 渐近展开。将 \( \hat{\tau} - \tau \) 分解为三部分:
- A 部分:来自 \( \varepsilon_{it} \) 的“直接”影响(如果 \( F_t \) 已知,这就是 OLS 的误差项)。
- B 部分:来自 \( \hat{F}_t - H F_t \) 的“间接”影响(因为使用了估计的因子代理)。
- C 部分:高阶余项。
- 主导项分析。证明 A 部分和 B 部分都是 \( O_p(N^{-1/2}) \),且它们的联合分布是渐近正态的。C 部分是 \( o_p(N^{-1/2}) \),可以忽略。
- 方差估计。推导 A 部分和 B 部分的协方差结构,构造一个“夹心”方差估计量,并证明其一致性。
关键跳跃点:
- 处理 \( \hat{F}_t \) 的估计误差:这是整个证明中最吃功夫的部分。如果简单地将 \( \hat{F}_t \) 当作真实 \( F_t \) 代入回归,会低估标准误。作者需要证明,\( \hat{F}_t \) 的估计误差对 \( \hat{\tau} \) 的影响是渐近可忽略的(即 B 部分与 A 部分相比是 \( o_p(1) \)),或者需要将其纳入方差估计中。作者的处理方式是:证明 B 部分与 A 部分渐近独立,且其方差贡献可以通过一个“夹心”项来捕捉。
- 处理个体固定效应 \( \alpha_i \):在回归中,\( \alpha_i \) 需要被差分掉或作为虚拟变量估计。作者采用了“组内变换”(within transformation)或“虚拟变量最小二乘法”(LSDV)来处理。这增加了证明的复杂性,因为组内变换会引入序列相关。
- 处理截面相关和序列相关:误差项 \( \varepsilon_{it} \) 允许截面相关和序列相关,这使得中心极限定理的证明更加复杂。作者需要用到关于“mixing”或“网络依赖”的 CLT。
技术技巧点名:
- 主成分分析(PCA):用于从对照组数据中估计因子时间序列。
- 控制函数(Control Function):将估计的因子代理作为回归变量,以控制未观测到的混杂。
- 夹心方差估计量(Sandwich Variance Estimator):用于处理异方差和序列相关,并调整因子代理估计误差带来的额外方差。
- Bai (2009) 的因子模型渐近理论:作为第一步估计的基石,提供了 \( \hat{F}_t \) 的收敛速度和渐近分布。
- 中心极限定理(CLT) for weakly dependent data:用于证明 \( \hat{\tau} \) 的渐近正态性。
- Delta 方法 / 高阶渐近展开:用于处理 \( \hat{F}_t \) 的估计误差对第二步回归的影响。
真实例子与应用¶
- 数据 / 场景:美国福利 waiver 项目(welfare waiver programs)对福利案件量(welfare caseloads)的影响。数据是 1987-1996 年 50 个州的面板数据。一些州在 1992-1996 年间实施了福利 waiver(处理组),其他州没有(对照组)。
- 如何应用:
- 将福利案件量作为结果变量 \( Y_{it} \)。
- 将是否实施 waiver 作为处理变量 \( D_{it} \)。
- 用对照组(未实施 waiver 的州)的数据,通过 PCA 估计因子时间序列 \( \hat{F}_t \)。作者选择了 \( r = 2 \) 个因子(基于 Bai & Ng 准则)。
- 将 \( \hat{F}_t \) 作为控制函数,放入全样本的回归中,估计处理效应 \( \tau \)。
- 同时估计了经典 DID 和合成控制法作为对比。
- 结果:
- 经典 DID 估计出 waiver 使福利案件量显著下降(约 -10%)。
- 合成控制法估计出下降幅度较小(约 -5%),且不显著。
- PCDID 估计出下降幅度居中(约 -7%),且显著。
- 作者认为,PCDID 的结果更可信,因为它放松了平行趋势假设,且对趋势的设定要求更弱。
- 这个例子想说明什么:
- 验证理论:展示 PCDID 在真实数据上的可行性。
- 展示相对 baseline 的优势:经典 DID 可能因平行趋势不成立而高估处理效应;合成控制法可能因处理前时期不够长而低估。PCDID 提供了一个折中且更稳健的估计。
- 敏感性分析:作者还展示了不同因子数 \( r \) 下的结果,以说明结果对因子数选择的敏感性(结果相对稳健)。
🔎 结论是否比证明窄¶
- 窄结论 1:主要定理假设处理效应 \( \tau \) 是常数(同质性)。但在实证例子中,作者估计的是“平均”处理效应,并未检验处理效应的异质性。作者在正文中承认了这一点,并指出“将 PCDID 扩展到允许处理效应随时间或个体变化是未来工作”。
- 窄结论 2:主要定理要求 \( N_0, T \to \infty \)。但在许多 DID 应用中,\( T \) 可能很小(如 5-10 年)。作者在模拟研究中考察了有限样本性质,但未给出 \( T \) 很小时的严格理论保证。
- 窄结论 3:因子数 \( r \) 被假设为已知或可一致估计。但在实践中,因子数选择是一个难题,且错误指定 \( r \) 可能导致有偏估计。作者在正文中讨论了使用 Bai & Ng (2002) 准则,但未证明在 PCDID 框架下该准则的适用性(即,该准则是否能在存在处理效应的情况下一致地估计 \( r \)?)。
四、开放问题¶
- 因子数选择的敏感性:PCDID 对因子数 \( r \) 的选择有多敏感?是否存在一个数据驱动的方法,可以在 PCDID 框架下一致地选择 \( r \),且不依赖于处理效应的存在?(扎根于:正文中关于因子数选择的讨论,以及模拟研究中不同 \( r \) 下的结果。)
- 处理效应异质性:如何将 PCDID 扩展到允许处理效应随时间或个体变化?例如,允许 \( \tau_t \) 随时间变化,或允许 \( \tau_i \) 随个体特征变化。这需要修改模型和识别策略。(扎根于:作者在结论中提到的“未来工作”。)
- 有限样本推断:当 \( T \) 较小时(如 \( T < 10 \)),PCDID 的渐近近似是否仍然可靠?是否存在更好的 bootstrap 或有限样本校正方法?(扎根于:主要定理要求 \( T \to \infty \),但许多应用中的 \( T \) 很小。)
- 与合成控制法的比较:在什么条件下,PCDID 优于合成控制法,反之亦然?是否存在一个统一的框架,可以涵盖这两种方法?(扎根于:作者在 intro 中对比了两种方法,但未给出系统的比较。)
Maintained by 陈星宇 · Homepage · Source on GitHub