Synthetic controls with imperfect pretreatment fit¶
作者: Bruno Ferman, Cristine Pinto
来源: Quantitative Economics
主题: 因果推断
相关性: 8/10
链接: https://doi.org/10.3982/qe1596
一、领域脉络与小综述¶
这个方向是什么¶
本子方向研究的是面板数据因果推断中的合成控制法(Synthetic Control, SC)。其根本问题是:当只有单个处理单元(如一个州、一个国家)和多个控制单元(未受干预的州/国家)时,如何利用干预前(预处理期)的数据,构造一个“合成控制组”来估计干预对处理单元的因果效应。SC 的核心思想是:用控制单元的加权平均来逼近处理单元在未受干预时的潜在结果,权重由预处理期的拟合效果决定。当前该方向的成熟度较高,已有大量应用和理论工作,但预处理期拟合不完美(即合成控制无法完美匹配处理单元)时的性质分析仍是一个活跃且重要的子问题。
发展脉络(history)¶
-
奠基工作:Abadie, Diamond, and Hainmueller (2010, 2011, 2015)
- ADH (2010):提出了经典的 SC 方法,假设存在一组非负权重,使得合成控制能完美匹配处理单元在预处理期的结果变量和协变量。在该假设下,SC 估计量是无偏的。
- ADH (2011):将 SC 应用于加州控烟法案的评估,展示了其在实际应用中的价值。
- ADH (2015):提出了基于置换检验(permutation test)的推断方法,用于评估 SC 估计量的统计显著性。
- 留下的口子:这些奠基工作依赖于“完美预处理拟合”这一强假设。当该假设不成立时,SC 估计量的性质(偏差、方差)以及如何进行推断,是后续研究的核心问题。
-
主要进展:放宽完美拟合假设与理论分析
- Ferman and Pinto (2021)(本文作者的前期工作):在线性因子模型下,分析了当预处理期数 \(T_0\) 趋于无穷时,SC 估计量的渐近性质。他们发现,即使 \(T_0 \to \infty\),如果处理分配与因子载荷相关,SC 估计量仍可能存在渐近偏差。这直接挑战了“预处理期越多,SC 越准”的直觉。
- Arkhangelsky et al. (2021):提出了合成双重差分(Synthetic DiD, SDID)方法,将 SC 的权重思想与 DiD 的双向固定效应结合。该方法在预处理期拟合不完美时,通过引入单位固定效应和时间固定效应,试图同时控制时不变和时变混杂因素。
- Ben-Michael, Feller, and Rothstein (2021):提出了增广合成控制(Augmented SC, ASC)方法,在 SC 权重的基础上,用结果回归模型(如线性回归)来校正预处理期的拟合偏差。该方法在理论上可以降低偏差,但依赖于结果回归模型的正确设定。
- 留下的口子:这些工作虽然放宽了完美拟合假设,但各自引入了新的假设(如 SDID 的平行趋势假设、ASC 的回归模型正确设定)。本文试图在不引入额外强假设的前提下,分析 SC 在拟合不完美时的性质,并提出一个更稳健的估计量。
-
当前 frontier:稳健性与推断
- 本文的位置:本文站在 Ferman and Pinto (2021) 的基础上,进一步分析了去均值(demeaned)SC 估计量在预处理期拟合不完美时的性质。它不要求完美拟合,也不要求平行趋势,而是通过一个简单的去均值操作,在偏差和方差上均优于 DiD 估计量。同时,它提出了一个基于预处理期残差的规范检验(specification test),用于判断该估计量是否适用。这为应用研究者提供了一个更稳健、更易诊断的工具。
子线索聚类¶
这些被引文献大致落在以下 2-3 条子线索上:
- 经典 SC 及其扩展:以 ADH (2010, 2011, 2015) 为代表,核心是构造权重、依赖完美拟合假设。后续工作如 Doudchenko and Imbens (2016) 放松了非负权重约束,允许负权重以改善拟合。
- SC 与 DiD 的融合:以 Arkhangelsky et al. (2021) 的 SDID 和 Ben-Michael, Feller, and Rothstein (2021) 的 ASC 为代表,试图结合两种方法的优势,以应对拟合不完美或平行趋势不成立的情况。
- SC 的理论性质分析:以 Ferman and Pinto (2021) 和本文为代表,专注于在线性因子模型下,分析 SC 及其变体的渐近偏差、方差和推断方法。这条线索更偏重理论,为应用提供指导。
这个方向在追问的核心问题¶
- 识别问题:在什么条件下,SC 估计量能一致地估计因果效应?当完美拟合不成立时,偏差的来源和结构是什么?
- 估计问题:如何构造一个在拟合不完美时仍具有良好性质(低偏差、低方差)的估计量?去均值、增广、融合 DiD 等方法各有什么优劣?
- 推断问题:当 SC 估计量有偏时,如何进行有效的统计推断(如置信区间、假设检验)?基于置换检验的方法是否仍然有效?
- 模型选择与诊断:如何判断 SC 方法是否适用于给定的数据集?是否存在一个可靠的规范检验来指导应用?
当前主流方法与已知瓶颈:主流方法(SC, SDID, ASC)各有其适用条件和假设。瓶颈在于,这些假设(如完美拟合、平行趋势、回归模型正确)在实际应用中往往难以验证,且违反时估计量的性质会恶化。本文试图通过一个简单的去均值操作和一个规范检验来部分解决这个问题。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口 frame 为“当预处理期拟合不完美时,标准 SC 估计量有偏,且其偏差结构复杂,难以直接校正”。他们声称,一个简单的去均值操作就能显著改善 SC 估计量的性质,使其在偏差和方差上均优于 DiD,并且这个改进不需要额外的强假设。同时,他们提出的规范检验为应用研究者提供了一个“是否适用”的明确信号。
- 哪些竞争路线被他淡化或回避了:作者淡化了 SDID 和 ASC 等更复杂的融合方法。他们指出,这些方法虽然可能进一步降低偏差,但引入了额外的假设(如 SDID 的平行趋势、ASC 的回归模型),且其有限样本性质可能不如简单的去均值 SC 稳健。作者回避了与这些方法在更一般设定下的详细比较,而是将重点放在与 DiD 的对比上。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:作者没有引用 Chernozhukov, Wüthrich, and Zhu (2021) 关于 SC 推断的“精确 p 值”方法,也没有引用 Li (2020) 关于 SC 在因子模型下的 minimax 最优性分析。这些工作与本文的推断和理论分析直接相关,其缺失可能意味着作者有意将讨论范围限定在“拟合不完美”这一特定视角,或者这些工作与本文的结论存在张力。(值得研究者去查的问题)
张力¶
未见明显对立引用。所有被引工作基本都认同“完美拟合是 SC 有效性的关键”,分歧在于如何应对拟合不完美。本文的立场(去均值 SC 优于 DiD)与 Arkhangelsky et al. (2021) 的 SDID 立场(融合 SC 与 DiD 更好)存在竞争关系,但作者并未在 intro 中直接点明这种张力。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(i = 1, \dots, N\):单元(unit)索引。\(i=1\) 为处理单元,\(i=2, \dots, N\) 为控制单元。
- \(t = 1, \dots, T\):时间索引。\(t = 1, \dots, T_0\) 为预处理期(干预前),\(t = T_0+1, \dots, T\) 为后处理期(干预后)。
- \(Y_{it}\):单元 \(i\) 在时间 \(t\) 的可观测结果变量。
- \(Y_{it}(0)\):单元 \(i\) 在时间 \(t\) 的潜在结果(未受干预时的结果)。
- \(Y_{it}(1)\):单元 \(i\) 在时间 \(t\) 的潜在结果(受干预时的结果)。
- \(D_{it}\):处理指示变量。\(D_{it}=1\) 表示单元 \(i\) 在时间 \(t\) 受到干预。本文假设只有处理单元(\(i=1\))在后处理期(\(t > T_0\))受到干预,即 \(D_{1t}=1\) 当 \(t > T_0\),其余情况 \(D_{it}=0\)。
- \(\tau_{1t} = Y_{1t}(1) - Y_{1t}(0)\):处理单元在时间 \(t\) 的个体处理效应(ATT),是本文的目标 estimand。
- \(w_j\):赋予控制单元 \(j\) 的权重,\(\sum_{j=2}^N w_j = 1\)。SC 估计量使用的权重。
- \(\hat{Y}_{1t}^{SC} = \sum_{j=2}^N w_j Y_{jt}\):处理单元在时间 \(t\) 的合成控制结果。
- \(\hat{\tau}_{1t}^{SC} = Y_{1t} - \hat{Y}_{1t}^{SC}\):标准 SC 估计量。
- \(\hat{\tau}_{1t}^{DID} = (Y_{1t} - \bar{Y}_{1}^{pre}) - (\bar{Y}_{control,t} - \bar{Y}_{control}^{pre})\):双重差分(DiD)估计量,其中 \(\bar{Y}_{1}^{pre}\) 是处理单元预处理期的均值,\(\bar{Y}_{control,t}\) 是控制单元在时间 \(t\) 的均值,\(\bar{Y}_{control}^{pre}\) 是控制单元预处理期的均值。
- \(\hat{\tau}_{1t}^{DSC} = (Y_{1t} - \bar{Y}_{1}^{pre}) - \sum_{j=2}^N w_j (Y_{jt} - \bar{Y}_{j}^{pre})\):去均值 SC(Demeaned SC, DSC)估计量,是本文的核心估计量。其中 \(\bar{Y}_{i}^{pre} = \frac{1}{T_0} \sum_{t=1}^{T_0} Y_{it}\) 是单元 \(i\) 在预处理期的均值。
-
模型:本文假设潜在结果由一个线性因子模型生成:
\[Y_{it}(0) = \delta_t + \lambda_t' \mu_i + \epsilon_{it}\]其中:- \(\delta_t\):时间固定效应(common time effect)。
- \(\mu_i\):单元 \(i\) 的因子载荷(factor loadings),是一个 \(F \times 1\) 的向量,代表单元 \(i\) 的不可观测异质性。
- \(\lambda_t\):公共因子(common factors),是一个 \(F \times 1\) 的向量,代表随时间变化的不可观测冲击。
- \(\epsilon_{it}\):个体-时间特异性的随机误差项,均值为 0,且与 \(\mu_i\) 和 \(\lambda_t\) 独立。
- 处理效应是加法可分离的:\(Y_{it}(1) = Y_{it}(0) + \tau_{1t}\)(对于处理单元 \(i=1\) 在后处理期 \(t > T_0\))。
-
可观测数据:研究者能观测到所有单元在所有时间点的结果变量 \(Y_{it}\),以及处理指示变量 \(D_{it}\)。研究者无法观测到:
- 潜在结果 \(Y_{it}(0)\) 和 \(Y_{it}(1)\)(只能观测到其中之一)。
- 因子载荷 \(\mu_i\) 和公共因子 \(\lambda_t\)。
- 误差项 \(\epsilon_{it}\)。
- 处理效应的真实值 \(\tau_{1t}\)。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设只有一个公共因子(\(F=1\)),且没有时间固定效应(\(\delta_t = 0\))和误差项(\(\epsilon_{it} = 0\))。那么模型退化为:
在这个特例下,SC 的目标是找到一组权重 \(w_j\),使得合成控制的结果 \(\sum_{j=2}^N w_j Y_{jt} = \lambda_t \sum_{j=2}^N w_j \mu_j\) 能完美匹配处理单元在预处理期的结果 \(Y_{1t} = \lambda_t \mu_1\)。这等价于要求 \(\sum_{j=2}^N w_j \mu_j = \mu_1\)。如果存在这样的权重,那么 SC 估计量就是无偏的。
现在,假设预处理期拟合不完美,即我们找不到一组权重使得 \(\sum_{j=2}^N w_j \mu_j = \mu_1\)。设偏差为 \(b = \mu_1 - \sum_{j=2}^N w_j \mu_j \neq 0\)。那么标准 SC 估计量的偏差为:
现在考虑去均值 SC(DSC)估计量。首先,对每个单元的结果进行去均值(减去其预处理期的均值):
核心对比: - 标准 SC 的偏差是 \(\lambda_t b\)。 - DSC 的偏差是 \((\lambda_t - \bar{\lambda}^{pre}) b\)。
关键洞察:DSC 的偏差中,\(\lambda_t\) 被减去了其预处理期的均值 \(\bar{\lambda}^{pre}\)。这意味着: 1. 偏差的“时间趋势”被移除:如果 \(\lambda_t\) 在预处理期和后处理期有相似的趋势(例如,\(\lambda_t\) 是平稳的或缓慢变化的),那么 \(\lambda_t - \bar{\lambda}^{pre}\) 可能比 \(\lambda_t\) 小得多,从而降低了偏差。 2. 与 DiD 的联系:DiD 估计量可以看作一个特殊的 DSC,其中所有控制单元的权重相等(\(w_j = 1/(N-1)\))。DSC 通过使用 SC 权重(优化了预处理期拟合),在偏差和方差上通常优于 DiD。
这个最小内核揭示了本文的核心数学贡献:通过一个简单的去均值操作,将 SC 估计量的偏差从 \(\lambda_t b\) 变为 \((\lambda_t - \bar{\lambda}^{pre}) b\),从而在因子载荷偏差 \(b\) 存在时,有效降低了偏差对时间趋势的敏感性。论文的一般情形(多个因子、有误差项)只是这个特例的“加壳”,核心思想不变。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在线性因子模型下,当预处理期拟合不完美时,标准 SC 估计量存在与时间相关的渐近偏差,而去均值 SC(DSC)估计量能显著降低该偏差,并在偏差和方差上均优于 DiD 估计量。
- 核心工具 / 方法:提出了一个去均值 SC 估计量(DSC),并基于其预处理期残差推导了一个规范检验(specification test),用于判断 DSC 是否适用。
- 主要结论:DSC 估计量的渐近偏差为 \((\lambda_t - \bar{\lambda}^{pre})' b\),其中 \(b\) 是因子载荷的拟合偏差。当 \(T_0 \to \infty\) 时,DSC 的偏差趋于 0 的条件比标准 SC 更弱。规范检验可以检测出因子载荷偏差 \(b\) 是否显著,从而为应用研究者提供诊断工具。
关键设定与假设¶
- 潜在结果模型:\(Y_{it}(0) = \delta_t + \lambda_t' \mu_i + \epsilon_{it}\)(线性因子模型)。
- 处理效应:加法可分离,\(\tau_{1t}\) 是常数或随时间变化。
- 权重选择:SC 权重 \(w_j\) 通过最小化预处理期均方预测误差(MSPE)得到,通常有非负和求和为 1 的约束。本文的分析对权重选择方法没有强假设,只要求权重是预处理期数据的函数。
- 关键假设:
- 因子模型假设:潜在结果由 \(F\) 个公共因子和单元特定的因子载荷生成。这是 SC 方法的标准假设。
- 误差项假设:\(\epsilon_{it}\) 是均值为 0 的随机误差,与 \(\mu_i\) 和 \(\lambda_t\) 独立,且满足一定的矩条件和弱相关性条件(如 mixing)。
- 处理分配机制:处理分配(\(D_{it}\))可以与因子载荷 \(\mu_i\) 相关,但不能与误差项 \(\epsilon_{it}\) 相关(即条件外生性)。这是 SC 方法的核心识别假设。
- 预处理期数 \(T_0\) 趋于无穷:本文的渐近分析依赖于 \(T_0 \to \infty\),这是为了利用大数定律和中心极限定理。
- 相比已有文献的放宽或强化:
- 放宽:不要求预处理期完美拟合(即 \(\sum_{j=2}^N w_j \mu_j = \mu_1\) 不成立)。
- 强化:相比 ADH (2010),本文明确假设了线性因子模型,而 ADH 的原始框架更一般(不指定模型)。但线性因子模型是 SC 理论分析的标准框架。
主要结果¶
-
定理 1:标准 SC 估计量的渐近偏差:在因子模型下,当 \(T_0 \to \infty\) 时,标准 SC 估计量的渐近偏差为 \(\lambda_t' b\),其中 \(b = \mu_1 - \sum_{j=2}^N w_j \mu_j\) 是因子载荷的拟合偏差。这个偏差不随 \(T_0\) 增大而消失,除非 \(b=0\) 或 \(\lambda_t\) 与 \(b\) 正交。
- 直觉:即使有无限多的预处理期数据,SC 权重也只能最小化预处理期的拟合误差,但无法消除由因子载荷不匹配导致的偏差。这个偏差在后处理期会通过公共因子 \(\lambda_t\) 放大或缩小。
- 必要条件:\(b \neq 0\) 且 \(\lambda_t\) 与 \(b\) 不正交。
- 解决的技术难点:推导了 SC 权重在 \(T_0 \to \infty\) 时的概率极限,并证明了该极限权重不一定能消除因子载荷偏差。
-
定理 2:去均值 SC(DSC)估计量的渐近偏差:在相同设定下,DSC 估计量的渐近偏差为 \((\lambda_t - \bar{\lambda}^{pre})' b\),其中 \(\bar{\lambda}^{pre} = \frac{1}{T_0} \sum_{t=1}^{T_0} \lambda_t\)。
- 直觉:去均值操作移除了公共因子的时间均值,使得偏差只依赖于 \(\lambda_t\) 相对于其预处理期均值的偏离。如果 \(\lambda_t\) 是平稳的,那么 \(\lambda_t - \bar{\lambda}^{pre}\) 的期望为 0,从而偏差的期望也为 0。
- 必要条件:\(b \neq 0\),但 \(\lambda_t - \bar{\lambda}^{pre}\) 可能比 \(\lambda_t\) 小得多。
- 解决的技术难点:证明了去均值操作不会改变 SC 权重的概率极限,但会改变偏差的结构。
-
定理 3:DSC 与 DiD 的比较:在均方误差(MSE)意义上,DSC 估计量优于 DiD 估计量,即 \(MSE(\hat{\tau}_{1t}^{DSC}) \leq MSE(\hat{\tau}_{1t}^{DID})\)。
- 直觉:DiD 可以看作一个特殊的 DSC,其中所有控制单元的权重相等。DSC 通过优化权重(最小化预处理期 MSPE),在偏差和方差之间取得了更好的平衡,从而降低了 MSE。
- 必要条件:SC 权重能比等权重更好地拟合预处理期数据(这通常是成立的)。
- 解决的技术难点:推导了 DSC 和 DiD 的渐近方差表达式,并证明了 DSC 的方差不超过 DiD 的方差。
-
定理 4:规范检验:基于 DSC 估计量的预处理期残差 \(\hat{\epsilon}_{1t}^{DSC} = \tilde{Y}_{1t} - \sum_{j=2}^N w_j \tilde{Y}_{jt}\),构造了一个检验统计量,用于检验原假设 \(H_0: b = 0\)(即因子载荷完美匹配)。该检验统计量在 \(H_0\) 下渐近服从 \(\chi^2\) 分布。
- 直觉:如果因子载荷完美匹配,那么预处理期残差应该只包含随机误差 \(\epsilon_{it}\),其均值应为 0。如果残差显著偏离 0,则表明存在因子载荷偏差 \(b\),DSC 可能不适用。
- 必要条件:\(T_0\) 足够大,且误差项 \(\epsilon_{it}\) 满足一定的矩条件。
- 解决的技术难点:推导了预处理期残差的渐近分布,并考虑了 SC 权重估计带来的不确定性。
证明路线与技术技巧¶
-
整体路线:
- 建立因子模型:假设潜在结果由线性因子模型生成。
- 定义 SC 权重:SC 权重 \(w_j\) 通过最小化预处理期 MSPE 得到。证明在 \(T_0 \to \infty\) 时,权重收敛到一个概率极限 \(w_j^*\)。
- 推导偏差表达式:将 SC 和 DSC 估计量的偏差表示为因子载荷偏差 \(b\) 和公共因子 \(\lambda_t\) 的函数。
- 比较 MSE:推导 DSC 和 DiD 的渐近方差,并证明 DSC 的方差更小。
- 构造规范检验:基于预处理期残差,利用中心极限定理和 Delta 方法,推导检验统计量的渐近分布。
-
关键跳跃点:
- 跳跃点 1:证明 SC 权重的概率极限 \(w_j^*\) 不依赖于 \(T_0\),且能最小化一个“总体”MSPE。这需要用到一致大数定律(uniform law of large numbers)和因子模型的识别条件。
- 跳跃点 2:推导 DSC 估计量的偏差表达式时,需要处理去均值操作带来的相关性。关键引理是:去均值后的数据 \(\tilde{Y}_{it}\) 仍然服从一个因子模型,但公共因子被替换为 \(\lambda_t - \bar{\lambda}^{pre}\)。
- 跳跃点 3:证明 DSC 的方差小于 DiD 的方差。这需要用到矩阵不等式和 SC 权重的最优性性质。
-
技术技巧点名:
- 一致大数定律(Uniform Law of Large Numbers):用于证明 SC 权重的概率极限。
- 因子模型的识别条件:用于确保因子载荷和公共因子是可识别的(up to rotation)。
- Delta 方法:用于推导规范检验统计量的渐近分布。
- 矩阵不等式:用于比较 DSC 和 DiD 的方差。
真实例子与应用¶
本文没有提供真实数据例子或模拟实验。它是一篇纯理论论文,所有结论都是基于数学推导和渐近分析。作者在结论部分提到,他们的理论结果为应用研究者提供了实践指导,但并未亲自用数据验证。
🔎 结论是否比证明窄¶
- 结论的声称:作者声称 DSC 估计量在偏差和方差上均优于 DiD 估计量。
- 证明的覆盖范围:这个结论是在线性因子模型和\(T_0 \to \infty\) 的渐近框架下严格证明的。作者没有证明在有限样本下或当因子模型设定错误时,这个结论是否仍然成立。
- 潜在的泛化问题:作者在 intro 中暗示 DSC 是一个“稳健”的估计量,但“稳健”的定义是相对于 DiD 而言的。如果真实数据生成过程与线性因子模型有较大偏离(例如,存在非线性或交互效应),DSC 的性质可能会恶化。作者没有讨论这种情况。
四、开放问题¶
-
有限样本性质:本文的所有结论都是渐近的(\(T_0 \to \infty\))。在有限样本(特别是 \(T_0\) 较小)下,DSC 估计量的偏差和方差如何?规范检验的 size 和 power 如何?(扎根于:本文所有定理都依赖于 \(T_0 \to \infty\) 的渐近假设)
-
权重选择的影响:本文的分析假设 SC 权重是通过最小化预处理期 MSPE 得到的。如果使用其他权重选择方法(如带惩罚项的回归、交叉验证),DSC 的性质会如何变化?(扎根于:本文的证明依赖于 SC 权重的概率极限,但未讨论不同权重选择方法的影响)
-
与 SDID 和 ASC 的比较:本文只将 DSC 与 DiD 进行了比较。在更一般的设定下,DSC 与 SDID、ASC 等更复杂的融合方法相比,性能如何?是否存在一个统一的框架来比较这些方法?(扎根于:作者在 intro 中淡化了 SDID 和 ASC,但未提供与它们的详细比较)
-
多个处理单元:本文只考虑了单个处理单元的情况。当有多个处理单元时,如何推广 DSC 方法?(扎根于:本文的设定明确假设只有一个处理单元)
Maintained by 陈星宇 · Homepage · Source on GitHub