Same Root Different Leaves: Time Series and Cross‐Sectional Methods in Panel Data¶
作者: Dennis Shen, Peng Ding, Jasjeet Sekhon, Bin Yu
来源: Econometrica
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向的核心问题是:在面板数据(panel data)中,如何利用跨单位(cross-section)和跨时间(time series)的信息来识别和估计一个处理(treatment)对单个或多个受处理单位的因果效应? 当前,该领域已经发展出两大主流范式:一是水平回归(horizontal regression),它利用时间序列模式,假设在控制了可观测的时变协变量后,处理分配是“无混淆的”(unconfoundedness);二是垂直回归(vertical regression),它利用截面模式,通过构建一个由未受处理单位组成的“合成控制”(synthetic control)来模拟受处理单位的反事实。本文的核心贡献在于,它系统性地揭示了这两种范式在点估计上的代数等价性,但又在推断框架上存在根本性差异,从而迫使研究者必须明确其数据中随机性的来源。
发展脉络(history)¶
-
奠基工作:合成控制法的提出与推广
- Abadie, Diamond, and Hainmueller (2010):提出了经典的合成控制法(SCM),用于估计单个受处理单位的处理效应。其核心思想是,在未受处理的“捐赠池”(donor pool)中寻找一组权重,使得加权后的控制单位在预处理期的结果变量与受处理单位尽可能匹配。该方法因其透明性和可解释性而广受欢迎,被Athey和Imbens (2017) 誉为“过去15年政策评估文献中最重要的创新”。
- Abadie (2021):对合成控制法的可行性、数据要求和方法论方面进行了全面的综述,强调了其“单纯形回归”(simplex regression)的吸引力(稀疏性、可解释性)。
-
主要进展:方法的扩展与融合
- 从单一单位到多单位、从单一处理到多种处理:Agarwal等人 (2021) 提出了“合成干预”(Synthetic Interventions)框架,将合成控制的思想扩展到存在多种干预、多个受处理单位的场景,并利用主成分回归(PCR)进行估计。
- 从点估计到推断:Li (2020)、Cattaneo等人 (2021) 和 Chernozhukov等人 (2021, 2022) 的工作开始系统性地为合成控制法建立推断理论,提出了基于子抽样、预测区间和去偏t检验等方法。
- 与双重差分(DID)的融合:Arkhangelsky等人 (2021) 提出了“合成双重差分”(SDID),它结合了DID和合成控制的优点,通过同时估计单位权重和时间权重,实现了一种双重稳健的估计量。
- 正则化与去噪:Amjad等人 (2018) 和 Agarwal等人 (2021) 利用奇异值阈值化(singular value thresholding)和主成分回归(PCR)对数据矩阵进行去噪,提高了估计的鲁棒性。Ben-Michael等人 (2021) 提出了“增强型合成控制”(Augmented SCM),当预处理期拟合不佳时,通过岭回归进行偏差校正。
-
当前前沿:推断框架的澄清与统一
- 设计基础 vs. 模型基础:Abadie等人 (2020) 和 Bottmer等人 (2021) 的工作开始区分两种不同的推断框架:一种是基于“设计”(design-based)的,假设处理分配是随机的;另一种是基于“抽样”(sampling-based)的,假设数据是从一个超总体中随机抽取的。Bottmer等人 (2021) 证明,在随机分配假设下,标准合成控制估计量是有偏的,并提出了修正的无偏估计量(MUSC)。
- 本文的位置:本文站在这一前沿,直接比较了水平回归(无混淆性)和垂直回归(合成控制)这两种范式。它没有提出新的估计量,而是通过矩阵代数,严格证明了在无额外假设下,若干标准估计量(如两期DID、合成控制)的点估计是代数等价的。然而,它尖锐地指出,这两种方法假定的随机性来源不同(时间 vs. 单位),导致即使点估计相同,其对应的目标参数(estimand)和不确定性量化方式也截然不同。这迫使研究者必须明确其推断框架的合理性。
子线索聚类¶
- 合成控制法及其变体:这是最核心的线索,包括经典的SCM (Abadie et al., 2010)、增强型SCM (Ben-Michael et al., 2021)、稳健SCM (Amjad et al., 2018)、合成干预 (Agarwal et al., 2021) 以及惩罚性SCM (Abadie & L'Hour, 2021)。这些工作主要关注如何通过优化权重来构建反事实,并处理高维、缺失数据等问题。
- 面板数据中的推断框架:这条线索关注的是如何量化不确定性。包括基于设计的方法 (Abadie et al., 2020; Bottmer et al., 2021)、基于模型的方法 (Li, 2020; Cattaneo et al., 2021) 以及基于共形推断的方法 (Chernozhukov et al., 2021)。本文的核心贡献正是属于这一线索。
- 双重差分(DID)与合成控制的融合:以SDID (Arkhangelsky et al., 2021) 为代表,试图结合两种方法的优势,实现双重稳健性。本文的等价性证明也涵盖了DID估计量。
这个方向在追问的核心问题¶
- 识别问题:在什么条件下,我们可以从观测数据中唯一地识别出处理效应?合成控制法依赖于因子模型假设,而无混淆性依赖于条件独立性假设。这两种假设哪个更合理?
- 推断问题:给定一个点估计,如何正确地量化其不确定性?随机性来自哪里(是处理分配、单位抽样还是时间抽样)?不同的随机性来源会导致不同的方差公式和置信区间。
- 最优估计问题:在给定假设下,哪个估计量是最优的(例如,达到半参数效率界)?SDID和增强型SCM等双重稳健估计量是否在所有设定下都优于单一方法?
- 高维与复杂设定:当捐赠池数量(N)或时间期数(T)很大,甚至超过样本量时,如何有效地进行估计和推断?正则化方法(如LASSO、岭回归)和矩阵补全技术如何应用?
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么:作者将现有文献的缺口 frame 为“对水平回归和垂直回归这两种范式之间关系的系统性、形式化理解不足”。他们声称,尽管这两种方法在应用中被视为不同,但本文证明它们在点估计上是代数等价的,而真正的差异在于推断框架。这使得本文成为“显然的下一步”:它统一了看似不同的方法,并迫使研究者关注一个更根本的问题——随机性从何而来。
- 哪些竞争路线被他淡化或回避了:作者淡化了“哪种方法在实践中更好”的问题。他们没有比较两种方法在特定数据生成过程下的均方误差(MSE)或偏差,而是专注于它们的代数关系。他们回避了对因子模型假设和无混淆性假设的深入比较,而是将这两种假设视为两种不同范式的起点。他们也没有深入讨论当两种假设都违反时,估计量的表现如何。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:本文的intro没有引用关于半参数效率理论在面板数据中的应用。例如,如何推导出在无混淆性假设下,处理效应估计量的半参数效率界?这与本文讨论的“不同随机性来源导致不同目标参数”的主题高度相关,因为效率界也依赖于对数据生成过程的假设。这是一个值得研究者去查的问题。
张力¶
未见明显对立引用。所有被引工作都在一个共同的框架下发展,即通过不同的方式利用面板数据的结构来估计因果效应。主要的张力在于“设计基础”和“模型基础”两种推断框架之间的选择,但这更多是哲学和方法论上的差异,而非数学上的矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(N\):未受处理的“捐赠”单位(donor units)数量。
- \(T\):总时间期数。
- \(T_0\):处理发生的时间点(\(1 \le T_0 < T\))。预处理期为 \(t=1, \dots, T_0\),后处理期为 \(t=T_0+1, \dots, T\)。
- \(Y_{it}\):单位 \(i\) 在时间 \(t\) 的可观测结果。\(i=1\) 是受处理单位,\(i=2, \dots, N+1\) 是未受处理的捐赠单位。
- \(Y_{it}(1)\):单位 \(i\) 在时间 \(t\) 的潜在结果(如果接受处理)。
- \(Y_{it}(0)\):单位 \(i\) 在时间 \(t\) 的潜在结果(如果未接受处理)。
- \(W_{it}\):处理指示变量。对于受处理单位 \(i=1\),\(W_{1t}=0\) 当 \(t \le T_0\),\(W_{1t}=1\) 当 \(t > T_0\)。对于捐赠单位 \(i>1\),\(W_{it}=0\) 对所有 \(t\)。
- 可观测结果与潜在结果的关系:\(Y_{it} = Y_{it}(0) + \tau_{it} W_{it}\),其中 \(\tau_{it}\) 是单位 \(i\) 在时间 \(t\) 的处理效应。我们通常关心受处理单位在后处理期的平均处理效应:\(\tau = \frac{1}{T-T_0} \sum_{t=T_0+1}^T \tau_{1t}\)。
- 目标参数(estimand):\(\tau\),即受处理单位在后处理期的平均处理效应。
- 可观测数据:研究者可以观测到一个 \((N+1) \times T\) 的矩阵 \(\mathbf{Y}\),其行代表单位,列代表时间。第一行是受处理单位,其余行是捐赠单位。对于受处理单位,预处理期的数据是 \(Y_{1t}(0)\),后处理期的数据是 \(Y_{1t}(1)\)。对于捐赠单位,所有数据都是 \(Y_{it}(0)\)。
- 想要但观测不到的量:受处理单位在后处理期的反事实结果 \(Y_{1t}(0)\)(\(t > T_0\))。这是因果推断的核心缺失数据问题。
-
模型:本文不假设一个特定的数据生成模型。它从两种不同的“视角”出发:
- 水平回归视角(无混淆性):假设给定过去的协变量,处理分配是随机的。在这个最简单的例子中,它假设 \(E[Y_{1t}(0) | \text{过去信息}]\) 可以由一个时间序列模型(如ARIMA)预测。
- 垂直回归视角(合成控制):假设存在一组权重 \(\beta_i\)(\(i=2, \dots, N+1\)),使得在预处理期,受处理单位的结果可以近似表示为捐赠单位结果的线性组合:\(Y_{1t}(0) \approx \sum_{i=2}^{N+1} \beta_i Y_{it}(0)\)。这个线性关系假设在后处理期也成立。
-
可观测数据:研究者能观测到的是整个矩阵 \(\mathbf{Y}\)。他们知道哪些单位是受处理的,以及处理发生的时间。
第二步:讲最小内核¶
本文的核心思想可以用一个最简特例来理解:两期数据(\(T=2\)),一个受处理单位,\(N\)个捐赠单位,处理发生在第二期(\(T_0=1\))。
-
设定:
- 预处理期:\(t=1\)。所有单位都未受处理。
- 后处理期:\(t=2\)。单位1受处理,单位2到\(N+1\)未受处理。
- 我们想估计单位1在\(t=2\)的处理效应:\(\tau = Y_{12}(1) - Y_{12}(0)\)。我们观测到\(Y_{12}(1)\),但\(Y_{12}(0)\)是缺失的。
-
水平回归(无混淆性):
- 假设:\(E[Y_{12}(0) | Y_{11}] = \alpha_0 + \alpha_1 Y_{11}\)。即,反事实结果可以由其自身过去的值通过一个线性时间序列模型预测。
- 估计:用单位1的预处理期数据(只有一个点\(Y_{11}\))来拟合这个模型。但只有一个点,无法估计\(\alpha_0\)和\(\alpha_1\)。所以,水平回归在这里无法直接应用,除非有更复杂的模型(如假设\(\alpha_0=0, \alpha_1=1\),即随机游走)。
-
垂直回归(合成控制):
- 假设:存在一组权重\(\beta_i\),使得\(Y_{11}(0) = \sum_{i=2}^{N+1} \beta_i Y_{i1}(0)\)。即,受处理单位在预处理期的结果可以由捐赠单位的同期结果完美线性表示。
- 估计:在预处理期,通过最小二乘法(OLS)求解\(\beta_i\),使得\(\hat{Y}_{11} = \sum_{i=2}^{N+1} \beta_i Y_{i1}\)尽可能接近\(Y_{11}\)。由于只有一个预处理期,这是一个欠定系统(\(N\)个未知数,1个方程)。通常我们会施加约束,如\(\beta_i \ge 0\)且\(\sum \beta_i = 1\)(单纯形约束),或者使用正则化(如岭回归、LASSO)。
- 反事实预测:\(\hat{Y}_{12}(0) = \sum_{i=2}^{N+1} \hat{\beta}_i Y_{i2}\)。
- 处理效应估计:\(\hat{\tau} = Y_{12} - \hat{Y}_{12}(0)\)。
-
本文的核心发现(在这个特例下):
- 点估计等价:假设我们使用OLS来估计垂直回归的权重\(\beta_i\),并且我们不施加任何约束(即允许\(\beta_i\)为任意实数)。那么,OLS的解是\(\hat{\beta} = (Y_{1:1}) (Y_{1:1}^T Y_{1:1})^{-1}\),其中\(Y_{1:1}\)是捐赠单位在\(t=1\)的结果向量。这个解使得\(\hat{Y}_{11} = Y_{11}\)完美拟合。那么,反事实预测就是\(\hat{Y}_{12}(0) = \sum \hat{\beta}_i Y_{i2}\)。
- 现在,考虑一个水平回归的变体:我们使用OLS来拟合一个“单位固定效应”模型:\(Y_{it} = \alpha_i + \lambda_t + \tau W_{it} + \epsilon_{it}\)。在两期情况下,这个模型等价于两期DID。DID的估计量是:\(\hat{\tau}_{DID} = (Y_{12} - Y_{11}) - \frac{1}{N} \sum_{i=2}^{N+1} (Y_{i2} - Y_{i1})\)。
- 本文证明:当\(N=1\)(只有一个捐赠单位)时,无约束的合成控制估计量\(\hat{\tau}_{SC}\)和DID估计量\(\hat{\tau}_{DID}\)是代数等价的。更一般地,对于某些特定的估计量(如使用OLS估计权重的合成控制),其点估计与某些水平回归估计量(如DID)是相同的。
- 推断的根本差异:尽管点估计相同,但它们的方差估计完全不同。
- 水平回归(DID)的推断:假设随机性来自时间。它认为,如果我们能重复这个实验,每次都会得到不同的时间序列实现。因此,方差来自于时间序列的波动。它通常使用“聚类稳健标准误”(clustered standard errors),将单位作为聚类。
- 垂直回归(合成控制)的推断:假设随机性来自单位。它认为,如果我们能重复这个实验,每次都会从一个大总体中抽取不同的捐赠单位。因此,方差来自于不同单位之间的波动。它通常使用“安慰剂检验”(placebo tests)或基于单位抽样的方差公式。
- 结论:即使两个研究者使用完全相同的数据和完全相同的点估计,如果他们一个采用水平回归的推断框架,另一个采用垂直回归的推断框架,他们会得到不同的标准误、置信区间和p值。选择哪个框架,取决于研究者认为数据中的随机性主要来自哪里。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了面板数据中两种主流因果推断范式——水平回归(无混淆性)和垂直回归(合成控制)——之间的关系,特别是它们的点估计和推断框架。
- 核心工具/方法:本文的核心工具是矩阵代数。它将面板数据视为一个矩阵,将水平回归视为按行(时间)建模,垂直回归视为按列(单位)建模,并通过矩阵运算(如分块矩阵求逆、投影矩阵)来揭示估计量之间的代数等价性。
- 主要结论:在无额外假设下,对于若干标准估计量(如两期DID、合成控制、SDID),两种方法给出的点估计是代数等价的。然而,它们假定的随机性来源不同(时间 vs. 单位),导致即使点估计相同,其对应的目标参数(estimand)和不确定性量化方式也截然不同。研究者必须明确其推断框架的合理性。
关键设定与假设¶
- 设定:标准的面板数据设定,有\(N+1\)个单位(1个受处理,\(N\)个捐赠),\(T\)个时间点,处理发生在\(T_0\)之后。
- 核心假设(本文不依赖,而是用于区分两种范式):
- 水平回归假设(无混淆性):\(Y_{it}(0) \perp W_{it} | \text{过去的信息}\)。即,给定过去的结果和协变量,当前的处理分配是随机的。这通常通过一个时间序列模型(如ARIMA)来建模。
- 垂直回归假设(合成控制):存在一组权重\(\beta_i\),使得\(Y_{1t}(0) = \sum_{i=2}^{N+1} \beta_i Y_{it}(0)\)对所有\(t\)成立。这通常通过一个因子模型来证明。
- 本文的独特之处:本文不假设上述任何一个模型是正确的。它只是将这两种方法视为两种不同的“算法”,并研究它们在没有任何模型假设下的代数关系。这使得其等价性结论非常稳健。
主要结果¶
本文的主要结果是几个代数等价性定理。这里挑两个最关键的说:
-
定理1:两期DID与无约束合成控制的等价性
- 陈述:当\(T=2\)(两期数据)时,使用OLS估计权重的无约束合成控制估计量(即允许\(\beta_i\)为任意实数)与两期DID估计量在代数上完全相等。
- 直觉:在两期情况下,DID估计量可以写成\(\hat{\tau}_{DID} = (Y_{12} - Y_{11}) - \frac{1}{N} \sum_{i=2}^{N+1} (Y_{i2} - Y_{i1})\)。无约束合成控制估计量是\(\hat{\tau}_{SC} = Y_{12} - \sum_{i=2}^{N+1} \hat{\beta}_i Y_{i2}\),其中\(\hat{\beta}\)是通过OLS回归\(Y_{11}\)在\(Y_{i1}\)上得到的。本文证明,这两个表达式在代数上是恒等的。
- 必要条件:\(T=2\),且合成控制的权重通过OLS估计(无约束)。
- 解决的技术难点:证明的关键在于将DID的表达式重写为矩阵形式,并利用分块矩阵求逆公式(或Frisch-Waugh-Lovell定理)来揭示其与OLS投影的等价性。
-
定理2:多期合成控制与特定水平回归估计量的等价性
- 陈述:对于多期数据(\(T>2\)),使用OLS估计权重的合成控制估计量等价于一个特定的水平回归估计量,该水平回归估计量使用受处理单位在预处理期的结果作为协变量,并假设一个线性时间趋势。
- 直觉:这个定理将等价性从两期推广到了多期。它表明,合成控制法本质上是在做一个“时间上的回归”,即用捐赠单位的结果来预测受处理单位的结果,而这个预测过程与一个包含时间趋势的水平回归模型是等价的。
- 必要条件:合成控制的权重通过OLS估计(无约束)。
- 解决的技术难点:证明需要处理多期数据下的投影矩阵,并展示合成控制的预测值如何可以表示为水平回归的预测值。
证明路线与技术技巧¶
-
整体路线:
- 矩阵表示:将面板数据表示为一个\((N+1) \times T\)的矩阵\(\mathbf{Y}\)。将受处理单位(第一行)和捐赠单位(其余行)分开。
- 定义估计量:将水平回归和垂直回归的估计量都用矩阵运算表示。例如,DID估计量可以表示为\(\mathbf{a}^T \mathbf{Y} \mathbf{b}\)的形式,其中\(\mathbf{a}\)和\(\mathbf{b}\)是特定的向量。合成控制估计量可以表示为\(\mathbf{Y}_{1:} - \mathbf{Y}_{2:}^T \hat{\beta}\),其中\(\hat{\beta}\)是OLS解。
- 代数等价性证明:通过矩阵代数恒等式(如分块矩阵求逆、投影矩阵的性质),证明这两个表达式在代数上是相等的。核心是证明\(\hat{\beta}\)的表达式可以转化为一个与水平回归估计量中出现的矩阵运算相同的形式。
- 推断框架对比:在证明点估计等价后,分别推导在水平回归和垂直回归的随机性假设下,该点估计的方差。通过对比方差公式,揭示其根本差异。
-
关键跳跃点:
- 从“算法”到“代数”的跳跃:通常,研究者会为合成控制法假设一个因子模型,然后推导其统计性质。本文的跳跃在于,它完全剥离了统计模型,只将合成控制法视为一个纯粹的代数算法(用OLS拟合权重),然后证明这个算法与另一个算法(DID)在代数上等价。这使得结论非常干净,但也意味着它不涉及任何统计上的“好坏”判断。
- 从“点估计”到“推断”的跳跃:证明点估计等价后,作者立即转向推断。这个跳跃是本文的核心贡献。它指出,即使算法相同,对“数据是如何产生的”这一根本问题的不同看法(随机性来源)会导致完全不同的推断结论。
-
技术技巧点名:
- 分块矩阵求逆(Block matrix inversion):用于将合成控制估计量中的OLS解\(\hat{\beta}\)与水平回归估计量中的矩阵运算联系起来。
- 投影矩阵(Projection matrix):OLS估计量本质上是将结果向量投影到协变量空间上。本文利用投影矩阵的性质来展示不同估计量之间的等价性。
- Frisch-Waugh-Lovell定理:这个定理是计量经济学中用于“偏回归”(partialling out)的标准工具,本文用它来简化DID估计量的表达式,并揭示其与合成控制估计量的联系。
真实例子与应用¶
本文使用了三个来自合成控制文献的经典案例来说明其理论结果,而不是进行新的实证分析:
- 数据/场景:
- 巴斯克地区的恐怖主义 (Abadie & Gardeazabal, 2003)
- 加州第99号提案(烟草控制) (Abadie, Diamond, & Hainmueller, 2010)
- 西德统一 (Abadie, Diamond, & Hainmueller, 2015)
- 如何应用本文方法:对于每个案例,作者分别计算了水平回归(如DID)和垂直回归(如合成控制)的点估计和标准误。他们展示了,在某些设定下,点估计确实非常接近(甚至相等),但标准误和置信区间却大相径庭。
- 得到什么结果:例如,在加州第99号提案的案例中,DID和合成控制法给出了相似的点估计(人均香烟销量下降约20-25包),但DID的标准误远小于合成控制法的标准误。作者指出,这并不意味着DID更好,而是反映了两种方法对随机性来源的不同假设。
- 这个例子想说明什么:这些例子旨在验证和可视化本文的核心理论发现:点估计可能等价,但推断结论依赖于研究者选择的框架。它们警示研究者,不能仅仅因为点估计看起来合理就接受其推断结果,必须审视其推断框架的合理性。
🔎 结论是否比证明窄¶
- 是的,结论比证明窄。本文的证明严格限于使用OLS估计权重的无约束合成控制估计量。然而,在结论和讨论中,作者暗示这种等价性可能对更广泛的估计量(如使用岭回归、LASSO或单纯形约束的合成控制)也成立,或者至少提供了一个思考框架。例如,作者在文中提到“We establish this position to be partly false for estimation but generally true for inference.” 这里的“partly false”暗示等价性并非普遍成立。作者在讨论部分也指出,当使用正则化方法(如岭回归)时,点估计的等价性不再严格成立,但两种推断框架的根本差异仍然存在。因此,读者需要警惕,不要将本文的结论过度推广到所有合成控制变体。
四、开放问题¶
-
正则化下的等价性:本文的等价性证明主要针对无约束的OLS。当使用岭回归、LASSO或单纯形约束等正则化方法时,点估计的等价性在什么条件下近似成立?是否存在一个统一的框架来理解这些正则化方法下的水平-垂直关系?(扎根于本文对“implicit regularization”的讨论,以及其对Ben-Michael et al. (2021) 和 Arkhangelsky et al. (2021) 的引用。)
-
多处理单位与连续处理:本文主要关注一个受处理单位。当存在多个受处理单位,或者处理是连续变量时,水平回归和垂直回归的等价性如何推广?是否存在类似的代数结构?(扎根于本文对Agarwal et al. (2021) “Synthetic Interventions”的引用,该工作处理了多种干预的情况。)
-
半参数效率界:本文揭示了不同随机性来源导致不同目标参数。那么,在每种随机性假设下,处理效应估计量的半参数效率界是什么?是否存在一个“最优”的推断框架,或者效率界本身也依赖于对随机性来源的假设?(这是一个未被本文触及但与其主题高度相关的问题,值得研究者去查。)
-
模型误设下的稳健性:当水平回归和垂直回归的假设都错误时,哪种估计量更稳健?本文的代数等价性在模型误设下是否仍然成立,或者会崩溃?是否存在一种“双重稳健”的推断框架,能同时对两种随机性来源都提供有效的推断?(扎根于本文对SDID (Arkhangelsky et al., 2021) 的讨论,SDID试图融合两种方法,但其推断框架的随机性来源仍是一个开放问题。)
Maintained by 陈星宇 · Homepage · Source on GitHub