Model-Assisted Complier Average Treatment Effect Estimates in Randomized Experiments with Noncompliance¶
作者: Jiyang Ren
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本方向关注的是随机实验中的非依从性(noncompliance)问题。在理想随机实验中,处理分配(assignment)完全决定实际接受的处理(treatment received),但现实中常出现参与者不遵守分配方案(如拒绝服药、对照组自行获取处理)。此时,直接比较“按分配分组”的意向治疗(ITT)效应会低估处理效果,而比较“按实际接受分组”则因选择偏倚而无效。工具变量(IV)方法,特别是依从者平均处理效应(CATE) 的识别与估计,成为标准解决方案。CATE定义为那些“无论分配为何都会依从分配”的亚组(compliers)的平均处理效应,在二值处理、二值结果且满足单调性等假设下,它等于结果与处理的ITT效应之比——即经典的Wald estimand。当前子方向的成熟度较高,已有大量关于CATE识别、估计与推断的工作,但如何利用协变量信息提升估计效率,尤其是在允许工作模型误设的稳健框架下,仍是活跃的研究前沿。
发展脉络(history)¶
- 奠基工作:Imbens & Angrist (1994) 和 Angrist, Imbens & Rubin (1996) 建立了LATE(Local Average Treatment Effect)框架,将CATE识别为Wald estimand,并给出了其与IV估计量的联系。这是整个子方向的基石。
- 主要进展:后续工作主要沿两条线展开。一是基于模型的方法,如Abadie (2003) 提出了半参数CATE估计量,利用协变量通过非参数或参数模型提升效率,但依赖于模型正确设定。二是基于设计的随机化推断,如Rosenbaum (2002) 和 Imbens & Rosenbaum (2005) 发展了在随机化框架下进行CATE推断的方法,其优势在于不依赖大样本渐近,但效率提升有限。
- 当前frontier:近期工作开始融合模型辅助与随机化推断。例如,Li & Ding (2017) 在完全随机实验的ITT效应估计中,提出了模型辅助估计量,允许工作模型误设,并证明了其效率增益。Zhao & Ding (2022) 进一步将模型辅助思想扩展到工具变量设定下的CATE估计,但主要关注连续结果。本文(Ren, 2024)则聚焦于二值结果这一常见但具有特殊挑战的设定,提出了三类模型辅助CATE估计量,并给出了完整的渐近理论与推断方法。
- 本文的位置:本文是模型辅助+随机化推断这一新兴路线在二值结果CATE问题上的系统化推进。它填补了Li & Ding (2017) 在ITT估计上的模型辅助方法向CATE估计的扩展空白,并解决了Zhao & Ding (2022) 在二值结果下可能遇到的效率与推断问题。
子线索聚类¶
- 基于模型的CATE估计:以Abadie (2003) 为代表,通过协变量建模(如线性、非参数)来估计CATE,效率高但依赖模型正确设定。本文的“模型辅助”方法属于此线索的稳健化变体。
- 基于设计的随机化推断:以Rosenbaum (2002) 为代表,强调随机化分配作为唯一概率来源,不依赖模型假设,但效率通常低于模型方法。本文的框架属于此线索,但通过引入工作模型来提升效率。
- 模型辅助的ITT估计:以Li & Ding (2017) 为代表,在完全随机实验的ITT效应估计中,将协变量信息通过工作模型融入随机化推断框架,允许模型误设。本文是此线索向CATE估计的直接推广。
- 工具变量设定下的模型辅助CATE估计:以Zhao & Ding (2022) 为代表,在连续结果下发展了模型辅助CATE估计。本文则聚焦于二值结果,并提出了针对二值结果特性的新估计量(如乘性CATE)。
这个方向在追问的核心问题¶
- 核心问题1:如何在不依赖模型正确设定的前提下,利用协变量信息提升CATE估计的效率?
- 核心问题2:对于二值结果,Wald estimand的估计量(比率形式)的方差估计与推断如何稳健地进行?
- 核心问题3:模型辅助方法能否扩展到更复杂的CATE形式(如乘性CATE、对数尺度CATE)?
- 已知瓶颈:现有模型辅助方法在二值结果下,由于结果变量的离散性,其渐近方差表达式更复杂,且Neyman型方差估计的保守性需要重新验证。此外,工作模型的选择(如线性概率模型 vs. logistic模型)对效率的影响尚不明确。
⚠️ 作者的 framing¶
作者将缺口frame为:“现有模型辅助CATE估计方法主要针对连续结果,而二值结果在随机实验中极为常见,且其方差结构与推断方法有特殊性,需要专门处理。” 作者通过强调二值结果的特殊性(如方差依赖于均值、比率估计量的有限样本偏误等),使本文成为“显然的下一步”。作者淡化了非参数CATE估计(如Abadie, 2003)的路线,认为其需要更复杂的非参数估计(如核平滑)且推断更困难。明显该被引/该存在、却没出现在intro里:作者未引用Ding & Li (2018) 关于随机化推断中方差估计的综述性工作,也未引用Imbens (2014) 关于IV方法在经济学中应用的经典综述。这可能意味着作者有意聚焦于更窄的统计技术细节,而非应用背景。值得研究者去查的问题:检查Ding & Li (2018) 是否讨论了二值结果下CATE的方差估计,以及Imbens (2014) 是否提到了模型辅助方法在IV设定下的应用。
张力¶
未见明显对立引用。所有被引工作基本沿同一方向推进,即“在随机化框架下,通过引入协变量信息提升CATE估计效率”,彼此之间是互补而非矛盾关系。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( N \):总样本量(个体数)。
- \( i = 1, \dots, N \):个体索引。
- \( Z_i \in \{0, 1\} \):处理分配(treatment assignment),随机化决定。\( Z_i = 1 \) 表示被分配到处理组,\( Z_i = 0 \) 表示对照组。
- \( D_i \in \{0, 1\} \):实际接受的处理(treatment received)。\( D_i = 1 \) 表示实际接受了处理,\( D_i = 0 \) 表示未接受。
- \( Y_i \in \{0, 1\} \):结果变量(outcome),二值。
- \( X_i \in \mathbb{R}^p \):协变量向量(covariates),在随机化前观测到,用于构建工作模型。
- 潜在结果框架:
- \( D_i(z) \):个体 \( i \) 在分配 \( Z_i = z \) 下的潜在处理接受状态(\( z = 0, 1 \))。
- \( Y_i(z, d) \):个体 \( i \) 在分配 \( Z_i = z \) 且实际接受处理 \( d \) 下的潜在结果(\( z, d = 0, 1 \))。
- 实际观测:\( D_i = D_i(Z_i) \),\( Y_i = Y_i(Z_i, D_i) \)。
- 依从者类型(基于 \( D_i(0), D_i(1) \)):
- 始终接受者(Always-taker):\( D_i(0) = D_i(1) = 1 \)。
- 从不接受者(Never-taker):\( D_i(0) = D_i(1) = 0 \)。
- 依从者(Complier):\( D_i(0) = 0, D_i(1) = 1 \)。
- 违抗者(Defier):\( D_i(0) = 1, D_i(1) = 0 \)(通常假设不存在,即单调性假设)。
- 参数/estimand:
- \( \tau_{\text{ITT}} = \mathbb{E}[Y_i(1, D_i(1)) - Y_i(0, D_i(0))] \):意向治疗效应(ITT)。
- \( \tau_{\text{ITT}, D} = \mathbb{E}[D_i(1) - D_i(0)] \):处理接受上的ITT效应。
- \( \tau_{\text{CATE}} = \mathbb{E}[Y_i(1, 1) - Y_i(0, 0) \mid \text{complier}] \):依从者平均处理效应(CATE)。
- Wald estimand:在单调性假设下,\( \tau_{\text{CATE}} = \frac{\tau_{\text{ITT}}}{\tau_{\text{ITT}, D}} \)。
-
样本量指标:\( N_1 = \sum_i Z_i \)(处理组样本量),\( N_0 = N - N_1 \)(对照组样本量)。假设完全随机实验,\( N_1/N \to \pi \in (0, 1) \)。
-
模型:
- 数据生成机制:完全随机实验。\( N \) 个个体中,随机选择 \( N_1 \) 个分配到处理组(\( Z_i = 1 \)),其余为对照组(\( Z_i = 0 \))。分配机制是唯一的概率来源。潜在结果 \( (Y_i(0,0), Y_i(0,1), Y_i(1,0), Y_i(1,1), D_i(0), D_i(1)) \) 被视为固定但未知的常数(Neyman式观点),或来自某个超总体(superpopulation)。本文采用超总体观点,即这些潜在结果是独立同分布(i.i.d.)来自某个未知分布。
- 关键假设:
- 单调性:\( D_i(1) \ge D_i(0) \) 对所有 \( i \) 成立(无违抗者)。
- 排他性约束:\( Y_i(z, d) = Y_i(d) \) 只依赖于实际接受的处理 \( d \),不依赖于分配 \( z \)(即分配只通过影响处理接受来影响结果)。
- 随机化:\( Z_i \) 与所有潜在结果独立。
- 正值性:\( \mathbb{P}(D_i(1) \neq D_i(0)) > 0 \)(存在依从者)。
-
要估的对象:\( \tau_{\text{CATE}} \)。
-
可观测数据:
- 研究者能观测到:\( (Z_i, D_i, Y_i, X_i) \) 对于 \( i = 1, \dots, N \)。
- 不可观测:个体的依从者类型(complier/always-taker/never-taker)是未知的,因为 \( D_i(0) \) 和 \( D_i(1) \) 不能同时观测到。潜在结果 \( Y_i(0), Y_i(1) \) 也只有一个被观测到。
第二步:讲最小内核¶
最简特例:假设没有协变量(\( X_i \) 不存在),且结果 \( Y_i \) 为二值。此时,CATE的估计问题退化为经典的Wald估计量:
最小内核:考虑最简单的模型辅助形式——差分调整(difference-in-means adjustment)。假设我们有一个工作模型 \( m(x) \) 来预测 \( Y_i \)(例如线性回归),以及一个工作模型 \( h(x) \) 来预测 \( D_i \)。那么,一个模型辅助的ITT估计量(对 \( \tau_{\text{ITT}} \))可以写为:
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在二值结果、二值处理的随机实验中,如何利用协变量信息,通过模型辅助方法提升依从者平均处理效应(CATE)的估计效率,并保证推断的稳健性(允许工作模型误设)。
- 核心工具/方法:提出了三类模型辅助CATE估计量——差分调整估计量、比率调整估计量和回归调整估计量,它们均基于随机化推断框架,通过工作模型对结果和处理接受进行预测,然后对Wald估计量的分子和分母分别进行模型辅助调整。
- 主要结论:所有三类模型辅助估计量都是CATE的相合估计,且渐近正态。它们的渐近方差不大于经典Wald估计量,即效率至少不降低。同时,给出了Neyman型保守方差估计量,使得在有限样本下也能进行有效的推断。方法还扩展到了乘性CATE(multiplicative CATE)的估计。
关键设定与假设¶
- 设定:完全随机实验,二值结果 \( Y_i \in \{0,1\} \),二值处理接受 \( D_i \in \{0,1\} \),协变量 \( X_i \in \mathbb{R}^p \) 在随机化前观测到。采用超总体观点(潜在结果i.i.d.来自某个分布)。
- 关键假设:
- 单调性(Assumption 1):\( D_i(1) \ge D_i(0) \) a.s.。这是CATE可识别为Wald estimand的标准条件。
- 排他性约束(Assumption 2):\( Y_i(z, d) = Y_i(d) \) a.s.。确保分配只通过处理接受影响结果。
- 随机化(Assumption 3):\( Z_i \perp\!\!\!\perp (Y_i(0), Y_i(1), D_i(0), D_i(1), X_i) \)。这是随机实验的基础。
- 正值性(Assumption 4):\( \mathbb{P}(D_i(1) \neq D_i(0)) > 0 \)。确保分母 \( \tau_{\text{ITT}, D} \) 非零。
- 相比已有文献的放宽/强化:
- 放宽:与Abadie (2003) 等基于模型的方法不同,本文不要求工作模型正确设定。工作模型 \( m(x) \) 和 \( h(x) \) 可以是任意函数(如线性回归、logistic回归等),即使它们与真实条件期望 \( \mathbb{E}[Y_i \mid X_i] \) 或 \( \mathbb{E}[D_i \mid X_i] \) 不一致,估计量仍然相合。
- 强化:与Li & Ding (2017) 的模型辅助ITT估计相比,本文将其推广到比率形式的CATE估计,需要处理分子和分母两个模型辅助估计量的联合渐近分布。与Zhao & Ding (2022) 相比,本文专门处理二值结果,其方差结构更复杂(如方差依赖于均值),且提出了针对二值结果的Neyman型方差估计。
主要结果¶
- 定理1(差分调整估计量的渐近性质):
- 陈述:设 \( \hat{\tau}_{\text{CATE, diff}} = \frac{\hat{\tau}_{\text{ITT, diff}}}{\hat{\tau}_{\text{ITT}, D, \text{diff}}} \),其中 \( \hat{\tau}_{\text{ITT, diff}} \) 和 \( \hat{\tau}_{\text{ITT}, D, \text{diff}} \) 是分别对 \( Y_i \) 和 \( D_i \) 进行差分调整后的模型辅助ITT估计量。则 \( \hat{\tau}_{\text{CATE, diff}} \) 是 \( \tau_{\text{CATE}} \) 的相合估计,且 \( \sqrt{N}(\hat{\tau}_{\text{CATE, diff}} - \tau_{\text{CATE}}) \xrightarrow{d} N(0, V_{\text{diff}}) \)。
- 直觉:差分调整通过减去工作模型的预测,减少了结果和处理接受中的噪声,从而降低了估计量的方差。由于随机化,调整项不会引入偏倚。
- 必要条件:工作模型 \( m(x) \) 和 \( h(x) \) 是固定的(不依赖于数据),或者通过样本分割(sample-splitting)来拟合以避免过拟合。本文假设工作模型是预先指定的或通过独立样本拟合的。
-
解决的技术难点:推导比率估计量的渐近方差需要处理分子和分母的协方差,以及Delta方法的应用。作者给出了 \( V_{\text{diff}} \) 的显式表达式,并证明了 \( V_{\text{diff}} \le V_{\text{Wald}} \)(Wald估计量的渐近方差)。
-
定理2(比率调整估计量的渐近性质):
- 陈述:比率调整估计量 \( \hat{\tau}_{\text{CATE, ratio}} \) 通过将 \( Y_i \) 和 \( D_i \) 分别除以工作模型的预测来调整,同样具有相合性和渐近正态性,且其渐近方差 \( V_{\text{ratio}} \le V_{\text{Wald}} \)。
- 直觉:比率调整适用于结果或处理接受与协变量呈比例关系的情形,例如当 \( Y_i \) 的期望与 \( X_i \) 成比例时。
-
必要条件:工作模型的预测值不能为零(对于 \( D_i \) 的预测需在(0,1)内)。
-
定理3(回归调整估计量的渐近性质):
- 陈述:回归调整估计量 \( \hat{\tau}_{\text{CATE, reg}} \) 通过将 \( Y_i \) 和 \( D_i \) 分别对协变量进行线性回归,然后使用回归系数进行预测和调整。其渐近方差 \( V_{\text{reg}} \le V_{\text{Wald}} \)。
- 直觉:这是最常用的模型辅助形式,通过线性回归来捕捉协变量与结果/处理接受之间的线性关系。
-
必要条件:线性回归模型是工作模型,允许误设。
-
定理4(Neyman型保守方差估计):
- 陈述:对于上述三类估计量,给出了Neyman型方差估计量 \( \hat{V}_{\text{Neyman}} \),满足 \( \mathbb{E}[\hat{V}_{\text{Neyman}}] \ge V \)(渐近方差),即它是保守的(overestimates the true variance)。
- 直觉:Neyman型方差估计通过在每个处理组内计算残差的样本方差来估计方差,它不依赖于工作模型的正确性,但会高估真实方差,从而保证置信区间的覆盖概率不低于名义水平。
-
解决的技术难点:对于二值结果,残差的方差与均值相关,需要仔细推导Neyman型估计量的期望,并证明其保守性。
-
定理5(乘性CATE的估计):
- 陈述:将模型辅助方法扩展到乘性CATE \( \tau_{\text{CATE, mult}} = \frac{\mathbb{E}[Y_i(1) \mid \text{complier}]}{\mathbb{E}[Y_i(0) \mid \text{complier}]} \) 的估计,给出了相应的模型辅助估计量及其渐近性质。
- 直觉:乘性CATE在流行病学中常见(如风险比),其估计量也是比率形式,但分子和分母是依从者亚组内的期望,而非ITT效应。作者通过重新参数化,将乘性CATE的估计转化为类似Wald estimand的形式。
证明路线与技术技巧¶
- 整体路线:
- 定义模型辅助ITT估计量:首先,对 \( \tau_{\text{ITT}} \) 和 \( \tau_{\text{ITT}, D} \) 分别构造模型辅助估计量(如差分调整、比率调整、回归调整)。这些估计量可以写成“Horvitz-Thompson型”估计量加上一个调整项的形式。
- 建立联合渐近分布:利用随机化推断的框架,将 \( \sqrt{N}(\hat{\tau}_{\text{ITT, MA}} - \tau_{\text{ITT}}, \hat{\tau}_{\text{ITT}, D, \text{MA}} - \tau_{\text{ITT}, D}) \) 的联合渐近分布推导为二元正态分布。关键在于证明调整项不影响相合性,且能降低方差。这通常通过线性化(linearization)和鞅差序列的中心极限定理(martingale difference CLT)来实现。
- 应用Delta方法:由于 \( \tau_{\text{CATE}} = \tau_{\text{ITT}} / \tau_{\text{ITT}, D} \),对二元正态向量应用Delta方法,得到 \( \hat{\tau}_{\text{CATE, MA}} \) 的渐近方差表达式。
- 效率比较:通过比较渐近方差表达式,证明 \( V_{\text{MA}} \le V_{\text{Wald}} \)。这通常归结为证明一个二次型不等式,其中 \( V_{\text{Wald}} \) 对应无调整(工作模型为常数)的特殊情况。
-
构造Neyman型方差估计:在每个处理组内,计算残差 \( Y_i - m(X_i) \) 和 \( D_i - h(X_i) \) 的样本方差,然后通过Delta方法组合得到 \( \hat{V}_{\text{Neyman}} \)。证明其保守性需要计算其期望,并利用Jensen不等式或Cauchy-Schwarz不等式。
-
关键跳跃点:
- 跳跃点1:如何证明模型辅助估计量的渐近方差严格小于Wald估计量(而非仅仅不大于)?作者通过引入一个“最优工作模型”的概念,证明了当工作模型与真实条件期望相关时,方差会严格减小。这需要推导方差差分的显式表达式。
-
跳跃点2:对于二值结果,Neyman型方差估计的保守性证明比连续结果更复杂,因为残差的方差依赖于其均值。作者通过将残差方差分解为“条件方差”和“均值方差”两部分,并证明后者非负,从而得到保守性。
-
技术技巧点名:
- Delta方法:用于从分子和分母的联合分布推导比率估计量的渐近分布。
- 鞅差序列的中心极限定理:用于证明模型辅助ITT估计量的渐近正态性,因为随机化分配可以视为一个鞅差序列。
- 线性化:将模型辅助估计量展开为“无调整估计量 + 调整项”的形式,便于分析。
- Neyman型方差估计:一种基于设计(design-based)的方差估计方法,不依赖模型假设,但通常保守。
- 样本分割(sample-splitting):虽然本文假设工作模型是固定的,但在实际应用中,如果工作模型需要从数据中拟合,可以使用样本分割来避免过拟合,从而保证渐近性质。
真实例子与应用¶
- 数据/场景:一项关于学术服务或激励对学业表现影响的随机实验。实验对象是某大学的学生,处理组学生被提供额外的学术辅导或经济激励,对照组则没有。但存在非依从性:部分处理组学生未使用服务,部分对照组学生可能自行寻求了类似帮助。
- 方法应用:作者将本文提出的三类模型辅助CATE估计量应用于该实验数据。协变量包括学生的GPA、性别、年级、专业等。工作模型使用线性回归(对结果和处理接受)和logistic回归(对处理接受)。
- 结果:模型辅助估计量给出了比经典Wald估计量更窄的置信区间(即更高的估计效率),且点估计值相似。例如,对于“是否通过课程”这一二值结果,模型辅助估计的CATE置信区间宽度比Wald估计量减少了约15-20%。
- 这个例子想说明什么:验证了模型辅助方法在实际数据中确实能提升效率,且推断结果稳健。同时,展示了不同工作模型(线性 vs. logistic)对效率提升的影响,说明即使工作模型误设,效率仍可能提升。
🔎 结论是否比证明窄¶
- 窄结论:作者在定理中假设工作模型是固定的(不依赖于数据)。但在实际应用中,工作模型通常是从数据中拟合的(如线性回归系数)。作者在讨论中提到了可以使用样本分割来缓解这个问题,但没有给出当工作模型通过同一数据拟合时的严格理论证明。这是一个典型的“证明比结论窄”的情况:严格证明的是“固定工作模型”下的性质,但实际推荐的是“数据拟合工作模型”的做法。
- 泛泛claim:作者在摘要和引言中声称“允许工作模型误设”,这在固定工作模型下是严格成立的。但当工作模型从数据中拟合时,误设仍然允许,但过拟合可能导致效率损失或偏倚,这一点作者没有充分讨论。作者在模拟中使用了样本分割,但未在真实例子中明确说明是否使用了样本分割。
四、开放问题¶
- 工作模型的数据依赖性问题:本文的理论严格假设工作模型是固定的。当工作模型(如线性回归系数)从同一数据中拟合时,其渐近性质如何?是否需要样本分割或交叉拟合(cross-fitting)来保证效率?这扎根于本文定理1-3的假设条件(工作模型固定)。
- 连续结果与多值处理的扩展:本文聚焦于二值结果和二值处理。将模型辅助方法扩展到连续结果(已有部分工作,如Zhao & Ding, 2022)和多值处理(如多水平剂量)是自然的下一步。这扎根于本文的局限性讨论(Limitations section)。
- 违抗者存在时的CATE估计:本文假设单调性(无违抗者)。当违抗者存在时,CATE不再可识别为Wald estimand。模型辅助方法能否扩展到更一般的IV设定(如proximal causal inference)来识别和估计更复杂的因果参数?这扎根于本文的假设1(单调性)。
- 高维协变量下的模型辅助:当协变量维度 \( p \) 很大(甚至大于样本量 \( N \))时,如何选择或正则化工作模型?本文的模型辅助框架能否与高维统计方法(如Lasso、随机森林)结合,并保持其稳健性?这扎根于本文对协变量维度的无限制假设(仅要求 \( p \) 固定)。
Maintained by 陈星宇 · Homepage · Source on GitHub