Optimal Covariate Balancing Conditions in Propensity Score Estimation¶
作者: Jianqing Fan, Kosuke Imai, Inbeom Lee, Han Liu, Yang Ning et al.
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向关注的是在逆概率加权(IPTW)框架下,如何通过估计倾向性评分(propensity score)来同时实现协变量平衡与平均处理效应(ATE)的一致估计。核心张力在于:传统的倾向性评分估计(如逻辑回归)追求模型拟合优度,但即使模型轻微误设,IPTW 估计量的偏倚也可能很大;而直接优化协变量平衡(covariate balancing)的方法虽然经验上表现好,但其理论性质(偏倚、效率、最优性)长期缺乏系统刻画。本文试图填补这一缺口。
发展脉络(history)¶
作者在引言中构建了一条清晰的线索,从奠基工作到当前 frontier:
- 奠基工作:IPTW 与倾向性评分估计
- Rosenbaum & Rubin (1983):提出倾向性评分,证明在无混淆性假设下,倾向性评分足以消除选择偏倚。这是整个领域的起点。
-
Hirano, Imbens & Ridder (2003):证明当倾向性评分用非参数方法(如 sieve)估计时,IPTW 估计量可以达到半参数效率界。这确立了“倾向性评分估计越灵活越好”的经典结论。
-
主要进展:协变量平衡方法的兴起
- Imai & Ratkovic (2014):提出协变量平衡倾向性评分(CBPS)方法,直接通过矩条件(moment conditions)优化协变量平衡,而非最大化似然。作者引用其“empirical studies show that the IPTW estimators can be sensitive to the misspecification of the propensity score model”,并指出 CBPS 在经验上表现良好。
- Zhao & Percival (2017):提出熵平衡(entropy balancing)方法,通过直接对权重施加平衡约束来估计 ATE。作者将其定位为“直接优化协变量平衡”的另一条路线。
-
Chan, Yam & Zhang (2016):提出协变量平衡一般化方法(CBG),将平衡条件与倾向性评分估计统一在 GMM 框架下。
-
当前 frontier:平衡条件的选择理论
- 作者指出,尽管 CBPS 等方法被广泛使用,“little is known about how the choice of balancing conditions affects their theoretical properties”。具体来说,现有工作没有回答:哪些协变量函数应该被平衡?平衡条件越多越好吗?最优平衡条件是什么?
- 本文的位置:在局部模型误设下刻画 CBPS-IPTW 估计量的渐近偏倚和效率,提出最优平衡函数的选择准则,并构造最优 CBPS-IPTW 估计量。
子线索聚类¶
这些被引文献大致落在三条子线索上:
-
线索 A:倾向性评分估计的经典方法(Rosenbaum & Rubin 1983, Hirano, Imbens & Ridder 2003, Robins, Rotnitzky & Zhao 1995)
这一簇关注如何通过估计倾向性评分来实现 ATE 的一致估计,核心工具是 MLE 或非参数 sieve 估计。经典结论是:倾向性评分估计越灵活,IPTW 估计量越接近半参数有效。 -
线索 B:直接优化协变量平衡的方法(Imai & Ratkovic 2014, Zhao & Percival 2017, Chan, Yam & Zhang 2016, Hainmueller 2012)
这一簇放弃似然最大化,转而直接对权重施加平衡约束。核心想法是:即使倾向性评分模型误设,只要协变量在加权后平衡,IPTW 估计量仍可能一致。但理论分析长期滞后于经验应用。 -
线索 C:双重稳健估计(Robins, Rotnitzky & Zhao 1995, Bang & Robins 2005, Chernozhukov et al. 2018)
这一簇关注当倾向性评分模型或结果模型之一正确时,估计量仍一致的性质。本文的最优 CBPS-IPTW 估计量被证明具有双重稳健性,因此可归入此线索。
这个方向在追问的核心问题¶
- 平衡条件的选择如何影响估计量的偏倚与效率? 更多平衡条件是否总是更好?
- 在局部模型误设下,CBPS-IPTW 估计量的渐近分布是什么? 偏倚项如何刻画?
- 是否存在最优的平衡函数选择准则? 如果有,如何构造相应的估计量?
- 如何放松参数假设,在非参数设定下实现全局有效估计?
当前主流方法是 CBPS 及其变体(Imai & Ratkovic 2014),已知瓶颈是缺乏对平衡条件选择的理论指导——实践中往往凭经验选择协变量的一阶矩(均值),但理论不清楚这是否最优。
⚠️ 作者的 framing¶
作者把缺口 frame 成:“尽管 CBPS 等方法经验上表现好,但平衡条件的选择对理论性质的影响未知”。这使得本文成为“显然的下一步”:先刻画偏倚与效率,再提出最优选择准则。
被淡化或回避的竞争路线: - 作者将熵平衡(Zhao & Percival 2017)和 CBG(Chan, Yam & Zhang 2016)定位为“相关但不同”的方法,但没有深入比较它们与 CBPS 在最优平衡条件上的差异。具体来说,熵平衡直接对权重施加约束而不显式估计倾向性评分,而本文的方法仍基于倾向性评分模型(参数或 sieve)。作者在引言中仅用一句话提及这些方法,没有讨论它们是否也能纳入本文的最优平衡框架。 - 作者没有讨论非参数倾向性评分估计(如 Hirano, Imbens & Ridder 2003)与 CBPS 在有限样本下的比较。理论上,非参数估计可以达到全局有效,但 CBPS 的优势在于对模型误设的稳健性——作者没有量化这种权衡。
什么明显该被引 / 该存在、却没出现在 intro 里? - Tan (2010) 关于“改进的 IPTW 估计量”的工作,该文在倾向性评分模型误设下提出了偏倚校正的 IPTW 估计量,与本文的局部模型误设分析直接相关。作者在正文中引用了 Tan (2010) 作为双重稳健估计的参考文献,但引言中没有提及。 - Graham, Pinto & Egel (2012) 关于“逆概率加权与协变量平衡”的计量经济学工作,该文在 GMM 框架下研究了平衡条件的选择。作者在正文中引用了这篇,但引言中没有突出。 - Athey, Imbens & Wager (2018) 关于“近似残差平衡”的方法,该文通过直接优化平衡来估计 ATE,与本文的平衡条件选择问题高度相关。未出现在引言中。
张力¶
未见明显对立引用。所有被引工作都承认协变量平衡方法在经验上的优势,分歧仅在于理论分析框架的选择(GMM vs. MLE vs. 直接权重优化)。作者通过将 CBPS 置于 GMM 框架下,统一了这些视角。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( T_i \in \{0,1\} \):处理变量,个体 \( i \) 是否接受处理。 - \( Y_i \):结果变量,个体 \( i \) 的观测结果。 - \( Y_i(1), Y_i(0) \):潜在结果(potential outcomes),分别表示个体 \( i \) 在接受处理和不接受处理时的结果。不可观测——每个个体只能观测到其中一个。 - \( \mathbf{X}_i \in \mathbb{R}^d \):协变量向量,个体 \( i \) 的预处理特征。可观测。 - \( \tau = \mathbb{E}[Y_i(1) - Y_i(0)] \):平均处理效应(ATE),目标 estimand。 - \( e(\mathbf{x}) = \mathbb{P}(T_i = 1 \mid \mathbf{X}_i = \mathbf{x}) \):倾向性评分(propensity score),待估计的未知函数。 - \( \boldsymbol{\beta} \in \mathbb{R}^p \):倾向性评分模型的参数向量(例如逻辑回归系数)。 - \( \mathbf{f}(\mathbf{X}_i) \in \mathbb{R}^k \):平衡函数(balancing functions),协变量的已知变换向量,用于构造矩条件。例如,\( \mathbf{f}(\mathbf{X}_i) = \mathbf{X}_i \) 表示平衡一阶矩。 - \( n \):样本量。
模型: - 无混淆性(unconfoundedness):\( (Y_i(1), Y_i(0)) \perp T_i \mid \mathbf{X}_i \)。即给定协变量,处理分配与潜在结果独立。 - 重叠(overlap):\( 0 < e(\mathbf{x}) < 1 \) 对所有 \( \mathbf{x} \) 成立。 - 倾向性评分模型:假设 \( e(\mathbf{x}) = e(\mathbf{x}; \boldsymbol{\beta}) \) 是参数模型(如逻辑回归 \( e(\mathbf{x}; \boldsymbol{\beta}) = \exp(\mathbf{x}^\top \boldsymbol{\beta}) / (1 + \exp(\mathbf{x}^\top \boldsymbol{\beta})) \))。本文也考虑 sieve 非参数扩展。 - 结果模型:\( \mu_t(\mathbf{x}) = \mathbb{E}[Y_i(t) \mid \mathbf{X}_i = \mathbf{x}] \),\( t = 0,1 \),用于双重稳健性分析。
可观测数据: - 研究者观测到 \( \{ (Y_i, T_i, \mathbf{X}_i) \}_{i=1}^n \),即每个个体的结果、处理状态和协变量。 - 不可观测:每个个体的反事实结果 \( Y_i(1-t) \)(若 \( T_i = t \)),以及真实的倾向性评分 \( e(\mathbf{x}) \)。
第二步:讲最小内核¶
最简特例:假设只有一个协变量 \( X_i \in \mathbb{R} \),倾向性评分模型为逻辑回归 \( e(X_i; \beta) = \exp(\beta X_i) / (1 + \exp(\beta X_i)) \),平衡函数取为 \( f(X_i) = X_i \)(即只平衡一阶矩)。CBPS 方法通过求解以下矩条件来估计 \( \beta \):
即加权后的处理组协变量均值等于加权后的对照组协变量均值。样本版本为:
核心思路:传统的 MLE 估计 \( \beta \) 最大化似然函数 \( \prod_i e(X_i; \beta)^{T_i} (1-e(X_i; \beta))^{1-T_i} \),这等价于求解得分方程 \( \sum_i (T_i - e(X_i; \beta)) X_i = 0 \)。而 CBPS 的矩条件要求的是加权后的协变量均值平衡,而非残差与协变量的正交性。当倾向性评分模型正确时,两种方法都一致;但当模型误设时,CBPS 的矩条件直接强制协变量在加权后平衡,从而可能减少 IPTW 估计量的偏倚。
在这个特例下,本文要回答的问题:如果只平衡一阶矩(\( f(X_i) = X_i \)),这是最优的选择吗?如果加入二阶矩 \( f(X_i) = (X_i, X_i^2)^\top \),会更好还是更差?本文的答案是:存在一个最优的平衡函数,它由结果模型的某种“最佳线性预测”决定,而非简单地包含所有协变量矩。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在 IPTW 框架下,系统分析 CBPS 方法中平衡条件的选择对 ATE 估计量的渐近偏倚和效率的影响,并提出最优平衡函数的选择准则。
- 核心工具 / 方法:将 CBPS 置于 GMM 框架下,在局部模型误设下推导 IPTW 估计量的渐近展开,利用半参数效率理论构造最优平衡函数,并通过 sieve 估计扩展至非参数设定。
- 主要结论:提出的最优 CBPS-IPTW 估计量具有双重稳健性(倾向性评分模型或结果模型之一正确时一致),且在两个模型均正确时达到局部半参数有效;sieve 扩展版本在更弱条件下实现全局有效,且渐近偏倚小于现有估计量。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
-
定义 1(CBPS 估计量):给定平衡函数 \( \mathbf{f}(\mathbf{X}) \in \mathbb{R}^k \),CBPS 估计量 \( \hat{\boldsymbol{\beta}}_{\text{CBPS}} \) 通过求解以下 GMM 矩条件得到:
\[\mathbb{E}\left[ \frac{T}{e(\mathbf{X}; \boldsymbol{\beta})} \mathbf{f}(\mathbf{X}) - \frac{1-T}{1-e(\mathbf{X}; \boldsymbol{\beta})} \mathbf{f}(\mathbf{X}) \right] = \mathbf{0}\]样本版本为 \( \frac{1}{n} \sum_{i=1}^n \mathbf{g}(Y_i, T_i, \mathbf{X}_i; \boldsymbol{\beta}) = \mathbf{0} \),其中 \( \mathbf{g} \) 是上述矩条件的样本模拟。 -
假设 1(局部模型误设):假设真实的倾向性评分 \( e_0(\mathbf{X}) \) 与参数模型 \( e(\mathbf{X}; \boldsymbol{\beta}_0) \) 相差一个局部偏离(local misspecification),即 \( e_0(\mathbf{X}) = e(\mathbf{X}; \boldsymbol{\beta}_0) + \delta_n(\mathbf{X}) / \sqrt{n} \),其中 \( \delta_n(\mathbf{X}) \) 有界。这是本文分析偏倚的关键假设——它允许模型“几乎正确”,从而可以用渐近理论刻画偏倚项。
-
假设 2(结果模型的正则性):结果回归函数 \( \mu_t(\mathbf{X}) \) 满足一定的光滑性条件(如 Lipschitz 或 Hölder 类),用于 sieve 估计的收敛速度分析。
-
相比已有文献的放宽 / 强化:
- 相比 Imai & Ratkovic (2014),本文放宽了对平衡函数选择的任意性——不再假设平衡函数是预先固定的,而是提出最优选择准则。
- 相比 Hirano, Imbens & Ridder (2003),本文强化了对倾向性评分模型的参数假设(局部模型误设),但通过 sieve 扩展又放宽回非参数设定。
主要结果¶
定理 1(局部模型误设下 CBPS-IPTW 的渐近偏倚): 假设局部模型误设(假设 1)成立,且平衡函数 \( \mathbf{f}(\mathbf{X}) \) 固定。则 CBPS-IPTW 估计量 \( \hat{\tau}_{\text{CBPS}} \) 的渐近偏倚为:
定理 2(最优平衡函数的选择): 在定理 1 的设定下,最小化渐近均方误差(AMSE)的最优平衡函数为:
定理 3(双重稳健性): 最优 CBPS-IPTW 估计量 \( \hat{\tau}_{\text{opt}} \) 具有双重稳健性: - 若倾向性评分模型正确(\( \delta_n = 0 \)),则 \( \hat{\tau}_{\text{opt}} \xrightarrow{p} \tau \)。 - 若结果模型 \( \mu_t(\mathbf{X}) \) 被正确指定(例如通过 sieve 估计),则即使倾向性评分模型误设,\( \hat{\tau}_{\text{opt}} \xrightarrow{p} \tau \)。 - 若两个模型均正确,则 \( \hat{\tau}_{\text{opt}} \) 达到局部半参数有效(渐近方差等于半参数效率界)。
定理 4(sieve 扩展的全局有效性): 当用 sieve 估计倾向性评分和结果模型时,最优 CBPS-IPTW 估计量在更弱条件下(如 \( e(\mathbf{X}) \) 和 \( \mu_t(\mathbf{X}) \) 属于 Hölder 类)达到全局半参数有效,且渐近偏倚小于现有 sieve IPTW 估计量(如 Hirano, Imbens & Ridder 2003)。
证明路线与技术技巧¶
整体路线(以定理 1 和 2 为例):
-
第一步:将 CBPS 估计量表示为 GMM 解。写出矩条件 \( \mathbb{E}[\mathbf{g}(\mathbf{O}; \boldsymbol{\beta})] = \mathbf{0} \),其中 \( \mathbf{O} = (Y, T, \mathbf{X}) \)。利用标准 GMM 理论,得到 \( \hat{\boldsymbol{\beta}}_{\text{CBPS}} \) 的渐近展开:
\[\sqrt{n}(\hat{\boldsymbol{\beta}}_{\text{CBPS}} - \boldsymbol{\beta}_0) = -\mathbf{H}^{-1} \frac{1}{\sqrt{n}} \sum_{i=1}^n \mathbf{g}(\mathbf{O}_i; \boldsymbol{\beta}_0) + o_p(1)\]其中 \( \mathbf{H} = \mathbb{E}[\partial \mathbf{g} / \partial \boldsymbol{\beta}^\top] \)。 -
第二步:将 IPTW 估计量展开。写出 \( \hat{\tau} = \frac{1}{n} \sum_i \frac{T_i Y_i}{e(\mathbf{X}_i; \hat{\boldsymbol{\beta}})} - \frac{1}{n} \sum_i \frac{(1-T_i)Y_i}{1-e(\mathbf{X}_i; \hat{\boldsymbol{\beta}})} \)。在 \( \hat{\boldsymbol{\beta}} \) 附近进行泰勒展开,得到:
\[\hat{\tau} - \tau = \frac{1}{n} \sum_i \psi(\mathbf{O}_i; \boldsymbol{\beta}_0) + \mathbb{E}\left[ \frac{\partial \tau}{\partial \boldsymbol{\beta}^\top} \right] (\hat{\boldsymbol{\beta}} - \boldsymbol{\beta}_0) + \text{偏倚项} + o_p(1/\sqrt{n})\]其中 \( \psi \) 是影响函数(influence function)。 -
第三步:代入局部模型误设。将 \( e_0(\mathbf{X}) = e(\mathbf{X}; \boldsymbol{\beta}_0) + \delta_n(\mathbf{X}) / \sqrt{n} \) 代入,分离出偏倚项。关键跳跃点:偏倚项来自 \( \delta_n \) 与结果异质性的交互,而平衡函数 \( \mathbf{f} \) 通过 \( \mathbf{H}^{-1} \) 影响偏倚的大小。
-
第四步:最小化 AMSE。将偏倚的平方与方差相加,对 \( \mathbf{f} \) 求变分(calculus of variations),得到最优平衡函数的显式解。关键跳跃点:这是一个函数空间中的优化问题,作者将其转化为一个加权最小二乘问题,从而得到闭式解。
技术技巧点名: - GMM 渐近理论:用于推导 CBPS 估计量的渐近分布(第一步)。 - 泰勒展开与影响函数:用于将 IPTW 估计量展开为线性项加偏倚项(第二步)。 - 局部模型误设框架:借鉴 Newey (1994) 和 Andrews (1994) 的技术,将模型误设参数化为 \( O(1/\sqrt{n}) \) 的偏离,从而在渐近分析中保留偏倚项(第三步)。 - 变分法 / 函数优化:用于求解最优平衡函数(第四步)。 - sieve 估计的收敛速度:用于定理 4 的全局有效性证明,利用 Newey (1997) 的 sieve 估计理论。
真实例子与应用¶
本文包含模拟研究和两个实证应用:
- 模拟研究:
- 数据生成:协变量 \( \mathbf{X} \in \mathbb{R}^5 \),倾向性评分为逻辑回归(线性或非线性),结果模型为线性或非线性。设置不同程度的模型误设(如遗漏交互项)。
- 方法对比:比较标准 IPTW(MLE 估计倾向性评分)、CBPS(平衡一阶矩)、最优 CBPS(本文方法)、双重稳健估计(AIPW)。
- 结果:在模型误设下,最优 CBPS 的偏倚和 RMSE 显著小于标准 CBPS 和 IPTW;当模型正确时,所有方法表现相近,但最优 CBPS 的效率接近半参数效率界。
-
想说明什么:验证理论预测——最优平衡函数确实减少了偏倚,且双重稳健性成立。
-
实证应用 1:就业培训项目(NSW):
- 数据:经典 Lalonde 数据集,评估就业培训对收入的影响。
- 方法应用:用逻辑回归估计倾向性评分,CBPS 平衡一阶矩,最优 CBPS 使用估计的最优平衡函数。
- 结果:最优 CBPS 估计的 ATE 与实验基准(随机化实验)更接近,且置信区间更窄。
-
想说明什么:展示在真实数据中,最优平衡条件选择能改善估计精度。
-
实证应用 2:医疗保险支出:
- 数据:RAND 健康保险实验数据,评估不同保险计划对医疗支出的影响。
- 方法应用:类似 NSW 分析,但协变量维度更高(~30)。
- 结果:最优 CBPS 在协变量平衡上表现更好(标准化差异更小),且 ATE 估计更稳定。
- 想说明什么:验证方法在高维协变量下的可行性。
🔎 结论是否比证明窄¶
- 定理 2 的最优平衡函数是在逻辑回归模型和线性结果模型的简化下推导的。作者在正文中声称“最优平衡函数的一般形式可由类似推导得到”,但没有给出一般非线性模型下的显式解。这是一个窄结论被泛化 claim 的例子——读者需要确认一般情况下的推导是否成立。
- 定理 4 的全局有效性依赖于 sieve 估计的收敛速度条件(如 \( e(\mathbf{X}) \) 属于 Hölder 类 \( \alpha \) 且 \( \alpha > d/2 \))。如果光滑性条件不满足(如 \( \alpha \) 很小),全局有效性可能不成立。作者在定理陈述中明确写了“under a set of much weaker assumptions”,但“weaker”是相对于参数假设而言,而非相对于所有非参数设定。
- 双重稳健性的证明假设结果模型通过 sieve 正确指定。如果结果模型也是参数模型且误设,双重稳健性不成立——这与标准双重稳健估计(如 AIPW)一致,但作者没有讨论结果模型误设的程度对偏倚的影响。
四、开放问题¶
-
最优平衡函数在非线性倾向性评分模型下的显式形式:定理 2 的推导假设逻辑回归模型。对于 probit、log-log 或其他链接函数,最优平衡函数是否仍有类似形式?扎根于定理 2 的证明(第 4 节,方程 4.5-4.7),其中显式使用了逻辑回归的导数结构。
-
高维协变量下的最优平衡条件选择:当 \( d \gg n \) 时,sieve 估计的收敛速度可能很慢,最优平衡函数的估计可能不稳定。作者在模拟中仅使用 \( d=5 \) 或 \( d=30 \),未讨论超高维情形。扎根于定理 4 的假设(光滑性条件 \( \alpha > d/2 \)),在高维下这一条件可能不现实。
-
平衡条件选择与变量选择的关系:如果协变量中存在无关变量(irrelevant covariates),最优平衡函数是否会自动忽略它们?作者没有讨论变量选择或稀疏性假设。扎根于定理 2 的推导,其中平衡函数是协变量的线性组合——如果某些协变量与结果无关,它们是否应从平衡函数中剔除?
-
纵向 / 时序设定下的最优平衡条件:本文仅考虑横截面数据。在纵向因果推断(如 DID、事件研究)中,平衡条件的选择可能涉及时间维度上的协变量平衡。扎根于本文的 future work 段落(第 7 节),作者提到“extending our framework to longitudinal settings is an important direction”。
提醒:要确认第 1 条是否是真 gap,建议去读 Tan (2010) 和 Graham, Pinto & Egel (2012) 的引言——如果它们也提到类似的最优平衡问题但未解决,则共识成立;如果它们有不同框架下的解,则可能是作者刻意回避的竞争路线。
Maintained by 陈星宇 · Homepage · Source on GitHub