Small Samples and Short Panels: Evaluating Policy Evaluation Methods with Realistic Data¶
作者: Luke Stewart, Gary Hettinger, Youjin Lee, Nandita Mitra
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.01537
一、领域脉络与小综述¶
这个方向是什么¶
本方向关注纵向准实验设计中因果效应估计方法在有限样本(少量地理单元、短面板)下的实际表现。核心问题是:当传统渐近理论所需的“大量单元”或“长预处理期”无法满足时,SDiD、ASCM 等较新方法在偏差、方差和置信区间覆盖上是否仍可靠?该方向处于从理论推导向实证校准过渡的阶段——已有充分的大样本渐近理论,但缺乏针对健康政策评估中常见小样本场景的系统性有限样本评估。
发展脉络(history)¶
- 奠基工作:传统 DiD(平行趋势假设)和 SCM(Abadie & Gardeazabal, 2003; Abadie et al., 2010)是面板因果推断的两大支柱。SCM 通过加权控制单元构造反事实,但要求预处理拟合极好;DiD 则依赖平行趋势假设,在小样本下标准误严重偏倚(Bertrand et al., 2004)。
- 主要进展:为放松假设,出现了两条路线。一是双重稳健 DiD(Sant’Anna & Zhao, 2020),在条件平行趋势下结合倾向得分和结果回归;二是合成控制扩展,包括 SDiD(Arkhangelsky et al., 2021)和 ASCM(Ben-Michael et al., 2021)。SDiD 同时使用单元权重和时间权重,在潜在因子模型下给出渐近正态性;ASCM 通过结果模型(岭回归)校正 SCM 的预处理拟合偏差,并利用 conformal inference 进行推断。Ben-Michael et al. (2022) 进一步提出部分池化 SCM,处理交错采纳。
- 当前 frontier:这些新方法在理论上依赖“大量控制单元”或“长预处理期”(如 SDiD 要求 \(N_{co}, T_{pre} \to \infty\) 且 \(N_{co} / \log^2 N_{co} \cdot 1/(N_{tr} T_{post}) \max(N_{tr}, T_{post}) \to \infty\)),但健康政策评估中常只有几个州或城市、几个预处理时间点。Roth et al. (2023) 综述了 DiD 小样本推断,但未系统评估 SDiD/ASCM。本文的位置:填补这一空白——通过校准模拟,在真实数据中注入已知处理效应,系统评估 SDiD 和 ASCM 在有限样本下的偏差、方差和覆盖,给出实用指南。
子线索聚类¶
- 传统 DiD 及其小样本推断:Roth et al. (2023) 综述;Bertrand et al. (2004) 指出序列相关导致标准误偏倚;Lee & Wooldridge (2025) 提出小样本下折叠时间维度的简单推断;Sant’Anna & Zhao (2020) 提供双重稳健 DiD。
- 合成控制及其扩展:Abadie et al. (2010) 经典 SCM;Arkhangelsky et al. (2021) SDiD;Ben-Michael et al. (2021) ASCM;Ben-Michael et al. (2022) 部分池化 SCM;Xu (2017) 广义 SCM(交互固定效应);Athey et al. (2021) 矩阵补全。
- 推断方法:Chernozhukov et al. (2021) 为合成控制提供 conformal inference;Bilinski & Hatfield (2026) 非劣效性检验平行趋势;Rambachan & Roth (2023) 部分识别方法。
- 模拟研究设计:Morris et al. (2019) 提供模拟研究标准(ADEMP 框架),本文严格遵循。
这个方向在追问的核心问题¶
- 问题 1:当 \(N_{co}\) 或 \(T_{pre}\) 很小时,SDiD 和 ASCM 的偏差有多大?是否仍可接受?
- 问题 2:它们的置信区间覆盖是否接近名义水平?在什么条件下失效?
- 问题 3:当平行趋势假设成立时,使用 SDiD/ASCM 相对于传统 DiD 的效率损失有多大?
- 问题 4:是否存在可操作的样本量/面板长度阈值,指导研究者选择方法?
当前主流方法与已知瓶颈:SDiD 和 ASCM 的理论保证依赖于大样本渐近,但健康政策数据常只有 5-10 个预处理期和 6-40 个控制单元。现有文献缺乏对这些场景的系统模拟评估,且默认软件实现(如 synthdid 的方差估计)在小样本下可能失效(本文发现其低估方差)。
⚠️ 作者的 framing¶
作者把缺口 frame 成:“尽管 SDiD 和 ASCM 在理论上依赖弱于 DiD 和 SCM 的假设,但在小样本或短面板下缺乏偏差或覆盖率的理论保证”(引言第 2 段)。因此,本文通过校准模拟提供“实用指南”,成为“显然的下一步”。
被淡化或回避的竞争路线: - 作者未深入比较矩阵补全方法(Athey et al., 2021),仅在引言中提及,未纳入模拟。这可能是因为矩阵补全同样需要大量预处理期。 - 作者未讨论贝叶斯方法或基于因子模型的直接估计(如 Bai, 2009 的交互固定效应),尽管后者被用于校准。作者在 2.1 节提到 SDiD 不试图估计所有因子参数,因此可能更稳健,但未直接比较。 - 作者未考虑交错采纳(staggered adoption)场景,仅聚焦于同时采纳(simultaneous adoption),尽管 Ben-Michael et al. (2022) 专门处理交错采纳。作者在附录 B 中比较了部分池化 SCM,但主要结果仍限于同时采纳。
什么明显该被引 / 该存在、却没出现在 intro 里? - 没有引用 Callaway & Sant’Anna (2021) 关于交错 DiD 的论文,尽管该文也是近年重要进展。可能因为本文聚焦同时采纳。 - 没有引用 Ferman & Pinto (2021) 关于 SCM 在少量预处理期下推断的论文,该文直接相关。 - 没有引用 Conley & Taber (2011) 关于小样本 DiD 推断的早期工作。
这些缺失值得研究者去查,以确认作者是否刻意回避了某些竞争方法。
张力¶
未见明显对立引用。各被引工作基本互补:Roth et al. (2023) 综述 DiD 小样本推断,Arkhangelsky et al. (2021) 和 Ben-Michael et al. (2021) 分别提出 SDiD 和 ASCM,本文评估它们在小样本下的表现。唯一可能张力在于:SDiD 的理论假设要求 \(N_{co}\) 和 \(T_{pre}\) 都趋于无穷,但 ASCM 的有限样本误差界依赖于 \(T_{pre}^{-1/2}\),暗示长预处理期更重要。本文模拟结果确实显示 ASCM 在 \(T_{pre} \ge 20\) 时覆盖较好,而 SDiD 更依赖 \(N_{co}\)。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(Y_{it}\):单元 \(i\) 在时期 \(t\) 的可观测结果(随机变量)。 - \(W_{it}\):二元处理指示变量(1 表示接受处理,0 表示对照)。 - \(\tau_{it}\):单元 \(i\) 在时期 \(t\) 的处理效应(待估参数,本文设为常数 0 以评估偏差)。 - \(N\):总单元数;\(N_{tr}\):处理单元数;\(N_{co}\):对照单元数(\(N = N_{tr} + N_{co}\))。 - \(T\):总时期数;\(T_{pre}\):预处理期数;\(T_{post}\):处理后期数(\(T = T_{pre} + T_{post}\))。 - \(\mathbf{Y}\):\(N \times T\) 矩阵,元素 \(Y_{it}\)。 - \(\mathbf{L}\):\(N \times T\) 矩阵,表示无处理时的潜在结果(固定但未知)。 - \(\mathbf{E}\):\(N \times T\) 误差矩阵。 - \(\mathbf{\Gamma}\):\(N \times r\) 因子载荷矩阵(单元特定)。 - \(\mathbf{\Psi}\):\(T \times r\) 因子矩阵(时间特定)。 - \(r\):因子维度(本文中 soda 数据取 2,CPS 数据取 4)。 - ATT:平均处理效应(处理组在后期平均处理效应),本文估计的是 \(\frac{1}{N_{tr} T_{post}} \sum_{i: W_{it}=1} \sum_{t \in \text{post}} \tau_{it}\),模拟中 \(\tau_{it}=0\)。
模型:潜在因子模型(式 1):
可观测数据:研究者实际能观测到的是 \(\mathbf{Y}\) 和 \(\mathbf{W}\)(处理分配)。\(\mathbf{L}\)、\(\mathbf{\Gamma}\)、\(\mathbf{\Psi}\)、\(\mathbf{E}\) 均不可观测。识别依赖于因子模型的结构假设:\(\mathbf{L}\) 是低秩的(秩 \(r\)),且误差独立于处理分配(条件于因子)。想要但观测不到的是无处理时的反事实结果 \(\mathbf{L}\),以及处理效应 \(\boldsymbol{\tau}\)。
第二步:讲最小内核¶
最简特例:考虑只有 1 个处理单元(\(N_{tr}=1\))、1 个处理后期(\(T_{post}=1\))、少量对照单元(如 \(N_{co}=6\))和 5 个预处理期(\(T_{pre}=5\))的场景——这正是 soda 数据模拟的典型设置。此时,SDiD 和 ASCM 的核心任务是用 6 个对照单元在 5 个预处理期的数据,构造处理单元在后期 1 个时期的反事实估计。
SDiD 的最小内核: - 计算单元权重 \(\hat{\omega}_j\)(\(j=1,\dots,N_{co}\)),使得加权后的对照单元在预处理期的平均趋势与处理单元的趋势最接近(通过最小化预处理期加权结果差异,并加入正则化项)。 - 计算时间权重 \(\hat{\lambda}_t\)(\(t=1,\dots,T_{pre}\)),使得加权后的预处理期对照单元平均结果与处理后期对照单元平均结果最接近。 - 然后运行加权双向固定效应回归:\(\hat{\tau}_{\text{SDiD}} = \arg\min_{\tau, \alpha, \beta} \sum_{i,t} \hat{\omega}_i \hat{\lambda}_t (Y_{it} - \alpha_i - \beta_t - \tau W_{it})^2\),其中 \(\hat{\omega}_i\) 对处理单元设为 1,对照单元为 \(\hat{\omega}_j\);\(\hat{\lambda}_t\) 对处理后期设为 1,预处理期为 \(\hat{\lambda}_t\)。在 \(N_{tr}=1, T_{post}=1\) 时,该估计量简化为:\(\hat{\tau} = \left( Y_{1,\text{post}} - \sum_j \hat{\omega}_j Y_{j,\text{post}} \right) - \left( \sum_t \hat{\lambda}_t Y_{1,t} - \sum_{j,t} \hat{\omega}_j \hat{\lambda}_t Y_{j,t} \right)\),即处理单元与加权对照单元在后期结果之差,减去预处理期加权差异(类似 DiD 的双重差分,但权重不同)。
ASCM 的最小内核: - 先计算标准 SCM 权重 \(\hat{\omega}_j^{\text{SCM}}\)(仅基于预处理期拟合)。 - 用对照单元数据拟合一个结果模型(岭回归),将后期结果 \(Y_{j,\text{post}}\) 对预处理期结果 \(Y_{j,1},\dots,Y_{j,T_{pre}}\) 回归,得到预测函数 \(\hat{f}\)。 - 计算偏差项:\(\hat{B} = \sum_j \hat{\omega}_j^{\text{SCM}} \hat{f}(\mathbf{Y}_{j,\text{pre}}) - \hat{f}(\mathbf{Y}_{1,\text{pre}})\),即 SCM 加权对照单元的平均预测与处理单元预测之差。 - ASCM 估计:\(\hat{\tau}_{\text{ASCM}} = \left( Y_{1,\text{post}} - \sum_j \hat{\omega}_j^{\text{SCM}} Y_{j,\text{post}} \right) - \hat{B}\)。直观上,先用 SCM 得到初始反事实,再用结果模型校正因预处理拟合不佳导致的偏差。
核心困难:当 \(N_{co}=6, T_{pre}=5\) 时,SCM 的预处理拟合可能很差(因为对照单元少,无法完美平衡),导致偏差。ASCM 通过岭回归校正,但岭回归本身在短面板下可能过拟合。SDiD 通过同时优化单元和时间权重,试图在更弱的假设下获得稳健性,但其渐近理论要求 \(N_{co}\) 和 \(T_{pre}\) 都趋于无穷,这里显然不满足。因此,模拟评估成为必要。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在纵向准实验设计中,当样本量小(如 6 个对照单元)且面板短(如 5 个预处理期)时,SDiD 和 ASCM 在偏差、方差和置信区间覆盖上的实际表现。
- 核心工具 / 方法:采用校准模拟(calibrated simulation)——从两个真实数据集(YRBSS soda 消费数据、CPS 工资数据)中估计潜在因子模型参数,然后生成具有已知零处理效应的合成数据,系统变化 \(N_{tr}, N_{co}, T_{pre}, T_{post}\)。
- 主要结论:两种方法的点估计偏差通常较小(归一化偏差 < 0.1 个标准差);但推断性能差异显著——ASCM 的 conformal 置信区间在 \(T < 20\) 时严重过度覆盖(覆盖率达 100%),而 SDiD 的覆盖主要依赖于 \(N_{co}\)(单处理单元需至少 25 个对照单元才能接近名义水平)。当平行趋势成立时,SDiD 和 ASCM 的效率损失约为 DiD 的 1.1–2.25 倍。
关键设定与假设¶
- 数据生成:潜在因子模型(式 1),\(\mathbf{L} = \mathbf{\Gamma} \mathbf{\Psi}'\),\(\mathbf{\Gamma}\) 从多元正态分布中抽取(参数由真实数据估计),\(\mathbf{\Psi}\) 固定为真实数据估计值。误差 \(\mathbf{E}\) 服从 AR(1)(soda)或 AR(2)(CPS)过程,协方差矩阵由残差估计。
- 处理分配:非随机,概率与单元平均 \(\mathbf{L}\) 水平相关(通过 logistic 函数),模拟现实中处理与结果水平相关的常见情况。
- 估计方法:SDiD 使用
synthdidR 包默认设置(包括 placebo 方差估计);ASCM 使用augsynthR 包,岭回归作为结果模型,conformal inference 构造置信区间。部分池化 SCM 作为补充比较。 - 相比已有文献的差异:与 Ben-Michael et al. (2021) 的模拟相比,本文明确允许序列相关误差,并采用“分样本估计”避免处理效应污染因子结构(soda 数据中,因子载荷从排除 2017 年的数据估计,因子从排除费城的数据估计)。
主要结果¶
- 偏差:两种方法归一化偏差几乎始终低于 0.1 个标准差。ASCM 在 soda 数据(短面板)中偏差通常小于 SDiD;在 CPS 数据(长面板)中,当 \(N_{tr}=1\) 时 ASCM 偏差有时更大(如 \(T_{pre}=30, T_{post}=10, N_{co}=6\) 时 ASCM 偏差 0.071 vs SDiD -0.027)。
- 方差:ASCM 在 soda 数据中方差小于 SDiD;在 CPS 数据中 SDiD 方差更小(如 \(N_{tr}=1, N_{co}=10, T_{pre}=30, T_{post}=10\) 时 ASCM 方差是 SDiD 的 2.26 倍)。
- 覆盖:
- ASCM:当 \(T < 20\) 时,覆盖率为 100%(过度覆盖);当 \(T \ge 20\) 时,接近名义水平(约 95%),与 \(N_{co}\) 和 \(N_{tr}\) 几乎无关。
- SDiD:当 \(N_{tr}=1\) 时,需 \(N_{co} \ge 25\) 才能达到约 95% 覆盖;当 \(N_{tr}=6\) 时,\(N_{co} \ge 10\) 即可。面板长度影响较小。
- DiD(平行趋势成立时):始终接近名义覆盖。
- 相对效率(相对于 DiD):SDiD 的方差比为 1.09–2.25,ASCM 为 1.22–1.84。SDiD 的效率随 \(N_{co}\) 增加而改善,随 \(T\) 增加而恶化;ASCM 随 \(N_{co}\) 改善,但随 \(N_{tr}\) 增加可能恶化。
证明路线与技术技巧(本文为模拟研究,无理论证明,但可描述模拟设计的技术细节)¶
整体路线(模拟设计):
1. 校准:从真实数据用交互固定效应(Bai, 2009)估计 \(\hat{\mathbf{\Gamma}}, \hat{\mathbf{\Psi}}\),并拟合 \(\hat{\mathbf{\Gamma}}\) 的多元正态分布和误差协方差 \(\hat{\Sigma}_e\)(AR 结构)。
2. 生成合成数据:对每个模拟场景(固定 \(N_{tr}, N_{co}, T_{pre}, T_{post}\)),从 \(\hat{\mathbf{\Gamma}}\) 分布中抽取 \(N\) 个因子载荷,乘以 \(\hat{\mathbf{\Psi}}\)(截取所需时期)得到 \(\mathbf{L}\);然后按概率分配处理;最后从 \(\hat{\Sigma}_e\) 生成误差,相加得 \(\mathbf{Y}\)。
3. 估计:对每个合成数据集,用 synthdid 和 augsynth 估计 ATT(真值为 0),记录估计值、标准误(SDiD 用 placebo 法,ASCM 用 conformal 法)。
4. 汇总:计算偏差、经验标准误、覆盖率的 Monte Carlo 平均值及其 Monte Carlo 标准误(Morris et al., 2019)。模拟次数 1900 次,确保覆盖率的 MC 标准误 ≤ 1 个百分点。
关键跳跃点: - 处理效应污染问题:soda 数据中费城饮料税可能引入真实处理效应,导致因子结构被污染。作者通过分样本估计解决:因子载荷从排除 2017 年(税生效年)的数据估计,因子从排除费城的数据估计,从而得到无污染的低秩结构。 - 序列相关误差:与 Ben-Michael et al. (2021) 的模拟不同,本文允许误差具有 AR 结构,更贴近真实面板数据。这增加了模拟的现实性,但也可能影响方法表现(如 SDiD 的 placebo 方差估计可能对序列相关敏感)。
技术技巧点名: - 交互固定效应估计(Bai, 2009):用于从真实数据中提取因子结构,是校准的核心。 - AR 误差模型:拟合残差的 AR(1) 或 AR(2) 协方差,用于生成序列相关误差。 - Monte Carlo 标准误:严格遵循 Morris et al. (2019) 的 ADEMP 框架,报告每个性能指标的 MC 标准误,确保结果可靠性。 - 归一化:偏差和标准误除以每年内去均值后的结果标准差,使不同数据集的结果可比。
真实例子与应用¶
本文使用两个真实数据集进行校准模拟: - YRBSS soda 消费数据:7 个城市,2007–2017 年每两年一次(\(T=6\)),其中 2017 年费城实施饮料税。作者从该数据估计因子结构(\(r=2\)),然后生成模拟数据。该例子模拟了健康政策评估中常见的极少城市、极短面板场景。 - CPS 工资数据:50 个州,40 年(\(T=40\)),来自 Bertrand et al. (2004)。该例子提供了长面板,用于考察面板长度对方法性能的影响。
如何用上去:作者从每个数据集估计 \(\hat{\mathbf{\Gamma}}, \hat{\mathbf{\Psi}}, \hat{\Sigma}_e\),然后固定这些估计,改变 \(N_{tr}, N_{co}, T_{pre}, T_{post}\) 生成合成数据。处理效应设为 0,因此所有估计量的偏差直接反映方法在零假设下的表现。
结果说明:soda 数据模拟显示,在短面板下 ASCM 的 conformal 区间完全失效(100% 覆盖),而 SDiD 在控制单元足够多时覆盖尚可。CPS 数据模拟显示,当面板足够长(\(T \ge 20\))时,ASCM 覆盖恢复正常。这些结果验证了理论预期:ASCM 的 conformal 推断需要大量预处理期,而 SDiD 需要大量控制单元。
🔎 结论是否比证明窄¶
- 结论:“ASCM 的 conformal 置信区间在 \(T < 20\) 时严重过度覆盖” —— 该结论在模拟中成立,但作者仅测试了 \(T_{pre}=5, T_{post}=1\) 和 \(T_{pre}=15, T_{post}=5\) 等有限组合,未系统探索 \(T\) 在 10–20 之间的行为。严格来说,结论应限定于“本文模拟的特定因子模型和误差结构下”。
- 结论:“SDiD 在 \(N_{tr}=1\) 时需至少 25 个控制单元才能达到名义覆盖” —— 该结论基于 CPS 和 soda 两个校准数据集,但作者未证明其普遍性。在平行趋势成立时(表 3),SDiD 的覆盖模式类似,但偏差更小。作者在讨论中承认“性能依赖于底层数据生成过程”,因此该阈值应视为启发式而非定理。
- 作者在 2.1 节指出 SDiD 的渐近假设是充分非必要的,但模拟中 SDiD 在假设不满足时仍表现合理,这支持了作者的论点。然而,作者未提供理论解释为何在假设不满足时偏差仍小——这超出了本文范围。
四、开放问题¶
-
交错采纳场景下的有限样本性能:本文仅考虑同时采纳。Ben-Michael et al. (2022) 的理论表明交错采纳下部分池化 SCM 的误差界依赖于单独拟合质量,但缺乏系统模拟。扎根于本文第 2.3 节:“under simultaneous adoption, the finite sample error bound does not depend on the separate pre-treatment fit”。因此,交错采纳下 SDiD 和 ASCM 的表现是自然延伸。
-
更丰富的误差结构:本文仅使用 AR(1)/AR(2) 误差。若误差存在异方差、空间相关或厚尾,方法表现可能不同。扎根于本文第 5 节:“a broader collection of applications would yield more general conclusions”。
-
协变量调整:本文未纳入时变协变量。实际应用中常需调整协变量以增强平行趋势假设的可信度。SDiD 和 ASCM 如何纳入协变量及其在小样本下的表现未知。扎根于本文第 5 节:“We did not incorporate covariates”。
-
替代方差估计方法:作者发现
synthdid默认的 placebo 方差估计低估了真实方差(脚注 1),但未系统比较其他方差估计(如 jackknife、bootstrap)。SDiD 的推断在小样本下是否可改进?扎根于本文第 2.1 节:“Arkhangelsky et al. (2021) describe three methods to estimate the asymptotic variance”,但本文仅使用 placebo 法。 -
理论解释:为什么 SDiD 在渐近假设不满足时偏差仍小?是否存在有限样本误差界?这需要新的理论工作,而非模拟。扎根于本文第 2.1 节:“the assumptions listed here... are sufficient but not necessary”。
Maintained by 陈星宇 · Homepage · Source on GitHub