On the inconsistency of matching without replacement¶
作者: F Sävje
来源: Biometrika
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是因果推断中匹配估计量的理论性质,特别是无放回匹配(matching without replacement) 估计平均处理效应(Average Treatment Effect on the Treated, ATT)的相合性(consistency)问题。匹配是一种广泛使用的非参数或半参数方法,通过为每个处理单元匹配一个或多个协变量相似的对照单元来模拟随机化实验。该方向当前的核心争论是:匹配(尤其是无放回匹配)在什么条件下能给出相合的估计?本文直接挑战了“只要匹配基于正确的倾向得分,估计量就是相合的”这一普遍信念。
发展脉络(history)¶
- 奠基工作(2000s 初):Rosenbaum & Rubin (1983) 奠定了倾向得分匹配的理论基础,指出在强可忽略性假设下,匹配倾向得分可消除选择偏差。Dehejia & Wahba (2002) 和 Rosenbaum (2002) 推广了匹配方法在实证中的应用。Stuart (2010) 提供了匹配方法的综述,总结了当时的主流实践和理论共识。
- 主要进展(2006-2012):Abadie & Imbens (2006) 证明 bootstrap 对匹配估计量无效,并给出了解析方差估计量。Abadie & Imbens (2012) 建立了匹配估计量的鞅表示,推导了无放回匹配的渐近分布。这些工作将匹配估计量的理论推进到渐近正态性和方差估计,但未系统质疑相合性本身。本文引用语境指出:“The focus of this paper was point estimation in the tradition of Abadie and Imbens (2006, 2012)”,表明本文是在该传统下工作,但发现了根本性问题。
- 当前 frontier(2019-至今):King & Nielsen (2019) 发表《Why Propensity Scores Should Not Be Used for Matching》,指出倾向得分匹配(PSM)常增加不平衡性、模型依赖性和偏差。本文引用语境指出:“Indeed, because the propensity score is the coarsest balancing score, matching on any other balancing score (including the raw covariates) would only aggravate the concerns highlighted here, so the recommendations by King and Nielsen (2019) would not be a solution.” 这表明本文认为 King & Nielsen 的批评(建议用其他匹配方法替代 PSM)并不能解决无放回匹配的根本问题,因为问题出在“无放回”本身,而非“倾向得分”。
- 本文的位置:本文直接证明无放回匹配估计量在一般设定下不相合,并指出达到相合性需要极强假设(倾向得分 ≤ 1/2 或无混杂)。这直接挑战了 Abadie & Imbens (2012) 等工作中隐含的“无放回匹配是相合的”假设,并指出 King & Nielsen (2019) 的解决方案(改用其他匹配方法)不充分。
子线索聚类¶
- 匹配估计量的渐近理论:Abadie & Imbens (2006, 2012) 为代表,关注匹配估计量的渐近分布、方差估计和 bootstrap 失效。本文直接继承并挑战该线索的相合性假设。
- 匹配方法的实践与批评:Stuart (2010) 的综述和 King & Nielsen (2019) 的批评。本文认为 King & Nielsen 的批评(PSM 增加不平衡)是次要的,核心问题是无放回匹配的系统性偏差。
- 倾向得分匹配的替代方案:包括有放回匹配、核匹配、最近邻匹配等。本文的结论暗示,只有有放回匹配或基于其他得分的匹配(如马氏距离)可能避免该不一致性,但本文未深入探讨。
这个方向在追问的核心问题¶
- 匹配估计量何时相合? 当前主流方法(如 Abadie & Imbens 2012)假设匹配后样本近似代表目标总体,但本文证明无放回匹配会系统性地改变匹配集的条件分布。
- 无放回 vs. 有放回匹配的权衡? 有放回匹配可能减少偏差但增加方差,无放回匹配则相反。本文揭示无放回匹配的偏差可能不随样本量消失。
- 匹配的“得分”选择是否重要? 本文证明问题不限于倾向得分,任何得分(包括协变量本身)的无放回匹配都会产生类似问题。
- 如何修正无放回匹配的偏差? 本文未提供修正方法,但暗示需要极强假设或改用其他匹配策略。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口 frame 为“无放回匹配估计量在一般设定下不相合”,并指出这是“被广泛忽视的缺陷”。作者强调,即使匹配基于真实的倾向得分,无放回匹配也会导致不一致性,因为匹配过程改变了条件分布。作者将本文定位为“对应用匹配方法的实证研究具有重要警示意义”。
- 哪些竞争路线被他淡化或回避了:
- 有放回匹配:作者未深入讨论有放回匹配是否相合,仅暗示其可能避免该问题。但实际中有放回匹配的方差更大,且可能引入其他偏差。
- 其他匹配方法(如核匹配、局部线性匹配):作者未讨论这些方法是否受类似问题影响。
- 匹配后的回归调整:如 Abadie & Imbens (2011) 提出的“bias-corrected matching”,作者未提及是否可修正该不一致性。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:本文未引用 Abadie & Imbens (2011) 的“bias-corrected matching”方法,该方法通过回归调整匹配后的偏差,可能部分解决本文指出的问题。此外,Rosenbaum (2002) 关于“optimal matching”的讨论也未出现。这些缺失值得研究者去查:是否 bias-corrected matching 能克服无放回匹配的不一致性?
张力¶
未见明显对立引用。本文的结论与 Abadie & Imbens (2012) 的渐近正态性结果并不直接矛盾——后者可能隐含了相合性假设,但未明确检验。King & Nielsen (2019) 的批评与本文的结论方向一致(都指出 PSM 的问题),但本文认为 King & Nielsen 的解决方案不充分。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( Y_i(1) \):单元 \( i \) 的潜在结果(potential outcome)若接受处理。
- \( Y_i(0) \):单元 \( i \) 的潜在结果若未接受处理。
- \( T_i \in \{0,1\} \):处理指示变量(1 = 处理,0 = 对照)。
- \( X_i \):协变量向量(可观测)。
- \( e(X_i) = P(T_i=1 | X_i) \):倾向得分(propensity score)。
- \( \tau_{\text{ATT}} = E[Y_i(1) - Y_i(0) | T_i=1] \):目标 estimand,即处理组上的平均处理效应(ATT)。
- \( n_1 \):处理组样本量;\( n_0 \):对照组样本量;\( n = n_1 + n_0 \)。
- \( \mathcal{I}_1 = \{i: T_i=1\} \):处理组索引集;\( \mathcal{I}_0 = \{i: T_i=0\} \):对照组索引集。
- \( \mathcal{M}(i) \):为处理单元 \( i \) 匹配的对照单元集合(无放回,即每个对照单元最多被匹配一次)。
-
\( \hat{\tau}_{\text{ATT}} = \frac{1}{n_1} \sum_{i \in \mathcal{I}_1} \left( Y_i(1) - \frac{1}{|\mathcal{M}(i)|} \sum_{j \in \mathcal{M}(i)} Y_j(0) \right) \):匹配估计量。
-
模型:
- 数据生成机制:假设 \((Y_i(1), Y_i(0), T_i, X_i)\) 独立同分布(i.i.d.)来自某个联合分布。
- 强可忽略性(Strong Ignorability):\( (Y(1), Y(0)) \perp T \mid X \)(给定协变量,处理分配独立于潜在结果)。
- 重叠假设(Overlap):\( 0 < e(X) < 1 \) 几乎必然。
-
匹配基于倾向得分 \( e(X) \)(或任何其他得分 \( s(X) \)),使用最近邻匹配(1:1 或 1:K),无放回。
-
可观测数据:
- 研究者观测到:\( (Y_i, T_i, X_i) \),其中 \( Y_i = T_i Y_i(1) + (1-T_i) Y_i(0) \)(即每个单元只观测到其实际处理下的结果)。
- 不可观测:每个单元的反事实结果(\( Y_i(1) \) 若 \( T_i=0 \),或 \( Y_i(0) \) 若 \( T_i=1 \))。匹配通过用观测到的对照结果近似处理单元的反事实结果来估计 ATT。
第二步:讲最小内核¶
最简特例:假设只有一个二元协变量 \( X \in \{0,1\} \),且倾向得分 \( e(X) = P(T=1|X) \) 已知。处理组和对照组各 \( n \) 个单元(\( n_1 = n_0 = n \))。ATT 目标为:
现在进行 1:1 无放回匹配:为每个处理单元匹配一个倾向得分最接近的对照单元。由于 \( e(0) \) 和 \( e(1) \) 相差很大,处理组中 \( X=1 \) 的单元会优先匹配到对照组中 \( X=1 \) 的单元(如果存在)。但对照组中 \( X=1 \) 的单元很少(因为 \( e(1) \) 高,对照组中 \( X=1 \) 的概率低)。因此,无放回匹配会迫使一些处理组 \( X=1 \) 的单元匹配到对照组 \( X=0 \) 的单元,因为对照组中 \( X=1 \) 的单元被用完后,剩下的处理组 \( X=1 \) 单元只能匹配到 \( X=0 \) 的单元。
核心问题:匹配后,处理组中 \( X=1 \) 的单元被匹配到的对照单元的条件分布不再是 \( X=1 \) 的分布,而是混合了 \( X=0 \) 和 \( X=1 \)。这导致匹配后的样本不再代表原始 ATT 目标总体(即 \( P(X|T=1) \))。具体地,对于被匹配到 \( X=0 \) 对照的处理组 \( X=1 \) 单元,其反事实估计 \( Y_j(0) \) 来自 \( X=0 \) 的分布,而非 \( X=1 \) 的分布,从而引入偏差。
数学上:设 \( \mathcal{M}(i) \) 为处理单元 \( i \) 的匹配集。无放回匹配后,匹配样本的条件分布为:
本文的关键想法:无放回匹配的系统性偏差源于“匹配池”的耗尽——当处理组中某些协变量类型的单元数量超过对照组中相同类型的单元数量时,无放回匹配会强制使用不同类型的对照,从而改变条件分布。该偏差不随样本量增加而消失,除非假设不存在这种“耗尽”情况(即倾向得分 ≤ 1/2,或这些单元无混杂)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:无放回倾向得分匹配估计 ATT 的相合性。
- 核心工具 / 方法:通过反例和理论分析,证明无放回匹配估计量在一般设定下不相合,并刻画达到相合性所需的极强假设。
- 主要结论:无放回匹配估计量不一致,除非假设不存在倾向得分大于 1/2 的单元,或假设这些单元无混杂。该结论不限于倾向得分,适用于任何得分的无放回匹配。
关键设定与假设¶
- 设定:独立同分布样本,处理组和对照组,1:1 或 1:K 无放回最近邻匹配,基于倾向得分(或其他得分)。
- 假设:
- 强可忽略性:\( (Y(1), Y(0)) \perp T \mid X \)。
- 重叠假设:\( 0 < e(X) < 1 \)。
- 无放回匹配:每个对照单元最多被匹配一次。
- 匹配基于真实倾向得分(或任何已知得分)。
- 相比已有文献的强化/放宽:本文未假设匹配后样本的条件分布与原始分布一致(这是 Abadie & Imbens 2012 等隐含假设的),而是直接检验该假设是否成立。
主要结果¶
- 定理 1(不一致性):在一般设定下(存在倾向得分大于 1/2 的单元),无放回匹配估计量 \( \hat{\tau}_{\text{ATT}} \) 不是相合的。即,存在 \( \epsilon > 0 \) 使得 \( \lim_{n \to \infty} P(|\hat{\tau}_{\text{ATT}} - \tau_{\text{ATT}}| > \epsilon) > 0 \)。
- 直觉:当处理组中某些协变量类型的单元数量超过对照组中相同类型的单元数量时,无放回匹配会强制使用不同类型的对照,导致偏差不消失。
- 必要条件:存在 \( x \) 使得 \( e(x) > 1/2 \) 且 \( E[Y(0)|X=x] \neq E[Y(0)|X=x'] \) 对于某些 \( x' \)。
- 定理 2(相合性的充分条件):如果以下条件之一成立,则无放回匹配估计量相合:
- 所有单元的倾向得分 ≤ 1/2(即处理组单元数量不超过对照组中相同协变量类型的单元数量)。
- 对于倾向得分 > 1/2 的单元,无混杂假设成立(即 \( Y(0) \perp T \mid X \) 在这些单元中成立,但实际中这等价于假设这些单元无混杂,从而不需要匹配)。
- 直觉:条件 1 确保匹配池不会耗尽;条件 2 使得即使匹配到不同类型的对照,偏差也可忽略。
- 推论:该结论不限于倾向得分,对任何得分(包括协变量本身)进行无放回匹配都会产生类似问题。
证明路线与技术技巧¶
- 整体路线:
- 构造反例:给出一个简单设定(如二元协变量、线性结果模型),直接计算无放回匹配估计量的偏差,证明其不随样本量消失。
- 一般化:将反例推广到一般设定,通过分析匹配过程的条件分布,证明偏差的极限非零。
- 刻画相合性条件:推导出偏差消失的充要条件,即倾向得分 ≤ 1/2 或无混杂。
- 关键跳跃点:
- 匹配过程的组合分析:无放回匹配是一个组合优化问题(最小化距离总和),其解依赖于样本的排序。本文的关键是证明,当处理组中某些类型的单元数量超过对照组时,匹配解必然包含“跨类型”匹配,且这种跨类型匹配的比例不随样本量减少。
- 偏差的极限非零:通过计算匹配后样本的条件期望,证明偏差的极限是常数(非零),而非随样本量衰减。
- 技术技巧点名:
- 反例构造:使用最简单的设定(二元协变量、线性模型)来展示核心机制,避免复杂技术。
- 条件期望分解:将匹配估计量的偏差分解为“匹配正确”和“匹配错误”两部分,分别计算其极限。
- 组合极限论证:利用大数定律和匹配过程的组合性质,证明跨类型匹配的比例收敛到非零常数。
真实例子与应用¶
本文为纯理论论文,无真实数据例子或模拟实验。作者通过构造反例(如二元协变量、线性结果模型)来展示不一致性,但未提供实证验证。作者在结论中建议实证研究者谨慎使用无放回匹配,并考虑有放回匹配或 bias-corrected matching。
🔎 结论是否比证明窄¶
- 窄结论:本文的定理 1 和 2 严格在“无放回匹配基于真实倾向得分”的设定下证明。作者在结论中声称“该结论不限于倾向得分,对任何得分进行无放回匹配都会产生类似问题”,但该 claim 未在论文中严格证明,仅通过直觉论证(因为问题出在“无放回”本身,而非得分选择)。这属于“泛泛 claim”,需要读者自行验证。
- 未覆盖的情况:本文未讨论有放回匹配、核匹配、局部线性匹配、或匹配后回归调整(bias-corrected matching)是否相合。作者在结论中暗示这些方法可能避免该问题,但未提供证明。
四、开放问题¶
- 有放回匹配是否相合? 本文暗示有放回匹配可能避免不一致性,但未证明。扎根于本文结论:“The result is not driven by the use of propensity scores, and similar artifacts arise when matching on other scores as long as it is without replacement.” 需要严格证明有放回匹配的相合性条件。
- bias-corrected matching(Abadie & Imbens 2011)能否修正该不一致性? 本文未引用该方法。如果 bias-corrected matching 通过回归调整匹配后的偏差,可能部分解决该问题。需要验证其是否在本文的反例中相合。
- 匹配后样本的条件分布如何刻画? 本文仅给出偏差非零的定性结论,未给出偏差的显式表达式或收敛速率。能否用 minimax 框架分析该偏差的速率条件?扎根于本文的定理 1 证明。
- 该不一致性在连续协变量下是否更严重? 本文的反例基于离散协变量。连续协变量下,匹配的“耗尽”问题可能更复杂(因为协变量空间无限)。需要分析连续协变量下的相合性条件。
Maintained by 陈星宇 · Homepage · Source on GitHub