Assessing Causal Effects in a Longitudinal Observational Study With “Truncated” Outcomes Due to Unemployment and Nonignorable Missing Data¶
作者: Michela Bia, Alessandra Mattei, Andrea Mercatanti
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 8/10
链接: https://doi.org/10.1080/07350015.2020.1862672
一、领域脉络与小综述¶
这个方向是什么¶
本方向聚焦于纵向观察研究中,因“截断”(truncation by death)和“非随机缺失”(nonignorable missing data)同时存在时的因果效应估计问题。具体来说,在评估失业人员培训项目效果时,一个核心困难是:工资(outcome)只有在个体找到工作(intermediate post-treatment variable)后才能被观测到,而就业状态本身又受处理(培训)影响——这就是经典的“截断”问题。同时,个体可能因失访(attrition)而缺失后续的就业状态和工资信息,且缺失机制可能依赖于未观测到的潜在结果(即非随机缺失)。这两个问题交织在一起,使得传统的因果推断方法(如直接比较就业者的工资)会产生选择偏差。该子方向目前处于方法成熟但应用挑战仍在的阶段:主分层(principal stratification)框架已被广泛接受为处理截断问题的标准工具,但将其与非随机缺失数据(尤其是纵向设定下的缺失)结合,并应用于实际行政数据,仍属前沿。
发展脉络(history)¶
- 奠基工作:截断问题的因果框架。Angrist, Imbens, and Rubin (1996) 在随机实验的背景下,首次提出用“主分层”来处理“截断”问题,将个体按潜在就业状态分层,从而定义有意义的因果效应(如“对始终就业者的处理效应”)。这奠定了本领域的核心概念基础。
- 主要进展:主分层的扩展与贝叶斯推断。Frangakis and Rubin (2002) 将主分层正式化为一个通用框架,用于处理因中间变量导致的“截断”和“非依从性”问题。Imbens and Rubin (1997) 和 Hirano et al. (2000) 则发展了贝叶斯推断方法,通过引入潜在结果和分层结构,利用MCMC进行后验推断。这些工作将主分层从理论概念推向可操作的方法。
- 当前frontier:处理非随机缺失与纵向设定。Mattei, Mealli, and Pacini (2014) 将主分层框架扩展到处理非随机缺失数据,但仅限于横截面设定。Zhang, Rubin, and Mealli (2009) 则处理了纵向设定下的截断问题,但假设缺失是随机的(MAR)。本文的位置:作者声称,他们的工作是首次在纵向观察研究中,同时处理“截断”和“非随机缺失”这两个问题,并应用于评估培训项目的因果效应。他们通过将主分层同时用于定义因果效应和建模缺失机制,实现了这一整合。
子线索聚类¶
这些被引文献大致落在两条子线索上: 1. 主分层与截断问题:核心是定义和处理“truncation by death”。代表工作:Angrist, Imbens, and Rubin (1996); Frangakis and Rubin (2002); Zhang, Rubin, and Mealli (2009)。这一簇关注的是如何正确定义因果效应,以及如何识别和估计这些效应(通常需要强假设,如单调性、排除限制)。 2. 非随机缺失数据:核心是处理缺失机制依赖于未观测变量的情况。代表工作:Mattei, Mealli, and Pacini (2014); Little and Rubin (2002, textbook)。这一簇关注的是如何对缺失机制建模(如模式混合模型、选择模型),以及如何利用辅助信息或假设进行识别。
这个方向在追问的核心问题¶
- 如何定义有意义的因果效应? 当处理影响中间变量(如就业),而结果(如工资)只在中间变量的某个水平上被定义时,传统的ATE(平均处理效应)没有意义。主分层提供了替代方案,但如何选择分层变量和定义效应(如“对始终就业者的效应” vs. “对受处理诱导就业者的效应”)仍是一个开放问题。
- 如何识别这些效应? 主分层效应通常需要强假设(如单调性、排除限制、随机化)才能识别。在观察研究中,这些假设的合理性需要仔细论证。本文通过引入协变量和贝叶斯方法,在一定程度上放松了识别条件,但并未完全解决。
- 如何处理缺失数据? 当缺失机制是非随机时,识别变得更加困难。常用的方法包括模式混合模型(pattern-mixture model)和选择模型(selection model),但都需要对缺失机制做出不可检验的假设。本文采用主分层来建模缺失机制,本质上也是一种模式混合模型。
- 如何将方法应用于实际数据? 理论方法需要与真实数据的复杂性(如协变量多、样本量大、处理非随机分配)相结合。本文的应用(卢森堡行政数据)展示了如何将主分层框架落地,但同时也暴露了假设的强依赖性。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么? 作者声称,现有工作要么只处理了“截断”(如Zhang et al., 2009),要么只处理了“非随机缺失”(如Mattei et al., 2014),但没有同时处理两者。因此,他们的工作是“首次”在纵向设定下整合这两个问题,从而能够回答一个开放的经济学问题:失业期间保留工资(reservation wage)的趋势。
- 哪些竞争路线被他淡化或回避了? 作者完全回避了使用工具变量(IV)或断点回归(RDD)等替代方法。在观察研究中,处理非随机分配通常需要IV或RDD来识别因果效应。本文假设处理分配是“条件可忽略的”(conditional ignorability),即给定协变量后,处理是随机的。这是一个非常强的假设,在培训评估中可能不成立(因为培训选择可能基于未观测到的能力或动机)。作者没有讨论这个假设的合理性,也没有提供敏感性分析。
- 什么明显该被引/该存在、却没出现在intro里? 作者没有引用任何关于半参数效率理论或双重稳健估计(如DR-IPW、AIPW)的工作。在因果推断中,这些方法通常能提供更稳健的估计。本文完全依赖贝叶斯参数模型,其效率和对模型误设的敏感性值得关注。此外,作者没有引用任何关于敏感性分析的文献(如Rosenbaum bounds, VanderWeele's E-value),这对于评估其强假设的稳健性至关重要。
张力¶
未见明显对立引用。所有被引工作都基于主分层框架,只是在处理缺失数据和纵向设定上逐步扩展。没有发现不同作者在相同条件下得出相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( Z \):二元处理变量(\( Z=1 \) 表示接受培训,\( Z=0 \) 表示未接受)。
- \( X \):协变量向量(如年龄、教育、工作经历等)。
- \( S_t \):二元就业状态变量,在时间点 \( t \)(\( t=1,2 \))观测。\( S_t=1 \) 表示就业,\( S_t=0 \) 表示失业。
- \( Y_t \):工资(连续变量),仅在 \( S_t=1 \) 时被定义和观测。当 \( S_t=0 \) 时,\( Y_t \) 是“未定义的”(truncated)。
- \( R_t \):二元缺失指示变量,\( R_t=1 \) 表示个体在时间点 \( t \) 被观测到(即 \( S_t \) 和 \( Y_t \) 有数据),\( R_t=0 \) 表示个体失访(数据缺失)。
- 潜在变量(counterfactual):
- \( S_t(z) \):个体在 \( Z=z \) 下的潜在就业状态。
- \( Y_t(z) \):个体在 \( Z=z \) 下的潜在工资,仅在 \( S_t(z)=1 \) 时被定义。
- \( R_t(z) \):个体在 \( Z=z \) 下的潜在缺失指示变量。
- 主分层变量:\( G = (S_1(0), S_1(1), S_2(0), S_2(1)) \),一个16种可能取值的分类变量,用于刻画个体在两种处理状态下、两个时间点的潜在就业模式。
-
参数/estimand:因果效应定义为在主分层内的比较。例如,对于“始终就业者”(\( S_1(0)=S_1(1)=S_2(0)=S_2(1)=1 \)),因果效应是 \( E[Y_2(1) - Y_2(0) | G = (1,1,1,1)] \)。
-
模型:
- 数据生成机制:作者假设一个贝叶斯参数模型。具体来说,他们假设给定协变量 \( X \) 和主分层 \( G \) 后,潜在结果 \( (S_t(z), Y_t(z), R_t(z)) \) 服从一个特定的参数分布(如多元正态或逻辑回归)。模型通过一个分层结构来连接不同时间点和不同处理状态下的潜在变量。
-
关键假设:
- 条件可忽略性(Conditional Ignorability):\( Z \perp (S_t(z), Y_t(z), R_t(z)) | X \)。即给定协变量后,处理分配是随机的。
- 单调性(Monotonicity):\( S_t(1) \ge S_t(0) \) 对所有 \( t \) 成立。即培训不会导致个体失业(只会帮助或没有影响)。这个假设简化了主分层的结构。
- 排除限制(Exclusion Restriction):对于某些主分层,处理对工资没有直接影响(例如,对于“从不就业者”,处理不影响工资,因为工资未定义)。这个假设用于识别。
- 非随机缺失(Nonignorable Missingness):缺失机制 \( R_t \) 依赖于未观测的潜在结果 \( Y_t(z) \) 或 \( S_t(z) \)。作者通过主分层来建模这种依赖。
-
可观测数据:
- 研究者实际能观测到的是:\( (X, Z, S_t, Y_t, R_t) \) 对于每个个体。
- 当 \( R_t=0 \) 时,\( S_t \) 和 \( Y_t \) 都缺失。
- 当 \( R_t=1 \) 且 \( S_t=0 \) 时,\( Y_t \) 是“未定义的”(truncated),通常被编码为缺失或一个特殊值。
- 想要但观测不到的是:所有潜在变量 \( S_t(z), Y_t(z), R_t(z) \) 以及主分层 \( G \)。这些是推断的核心,但只能通过模型和假设来“填充”。
第二步:讲最小内核¶
最简特例:考虑只有两个时间点(\( t=1,2 \)),且假设单调性(\( S_t(1) \ge S_t(0) \))和排除限制。同时,假设没有缺失数据(\( R_t=1 \) 对所有个体成立)。这个特例是Zhang, Rubin, and Mealli (2009) 的核心设定。
在这个特例下,主分层 \( G \) 从16种简化为更少的模式。例如,在单调性下,\( S_t(1) \ge S_t(0) \) 意味着个体不可能在 \( Z=1 \) 时失业而在 \( Z=0 \) 时就业。因此,可能的模式包括: - 始终就业者:\( S_1(0)=S_1(1)=S_2(0)=S_2(1)=1 \) - 受处理诱导就业者(compliers):\( S_1(0)=0, S_1(1)=1, S_2(0)=0, S_2(1)=1 \)(或类似模式) - 从不就业者:\( S_1(0)=S_1(1)=S_2(0)=S_2(1)=0 \)
核心思路:因果效应只能在主分层内定义。例如,对于“始终就业者”,我们可以比较他们在 \( Z=1 \) 和 \( Z=0 \) 下的工资 \( Y_2(1) \) 和 \( Y_2(0) \)。对于“受处理诱导就业者”,我们只能观察到他们在 \( Z=1 \) 下的工资(因为他们只有在接受培训后才就业),而无法观测到他们在 \( Z=0 \) 下的工资(因为他们失业,工资未定义)。因此,对于这个分层,因果效应不可识别,除非我们施加额外的假设(如排除限制:培训对工资没有直接影响,只通过就业状态影响)。
最小内核的数学问题: - 要证的命题:在单调性和排除限制下,对于“始终就业者”的因果效应 \( E[Y_2(1) - Y_2(0) | G = (1,1,1,1)] \) 是可识别的。 - 证明怎么走: 1. 识别“始终就业者”:由于单调性,在 \( Z=1 \) 下就业的个体中,有一部分是“始终就业者”(他们在 \( Z=0 \) 下也会就业),另一部分是“受处理诱导就业者”。我们无法直接区分他们。但通过观察 \( Z=0 \) 下就业的个体,我们可以识别出“始终就业者”的一个子集(因为他们在 \( Z=0 \) 下就业,所以一定是“始终就业者”)。 2. 利用排除限制:对于“受处理诱导就业者”,假设排除限制成立,即培训对工资没有直接影响。那么,他们在 \( Z=1 \) 下的工资 \( Y_2(1) \) 等于他们在 \( Z=0 \) 下如果就业会得到的工资 \( Y_2(0) \)。但这个工资是未定义的,所以这个假设实际上无法直接使用。 3. 参数模型:在贝叶斯框架下,我们为潜在结果指定一个参数模型(如多元正态),并利用观测数据(\( Z=0 \) 下就业者的工资、\( Z=1 \) 下就业者的工资)来估计模型参数。然后,通过MCMC,我们可以从后验分布中“填充”缺失的潜在结果,从而估计因果效应。 - 为什么成立:这个识别依赖于参数模型的正确设定和强假设(单调性、排除限制)。在参数模型下,即使某些主分层的数据完全缺失(如“受处理诱导就业者”在 \( Z=0 \) 下的工资),模型也可以通过其他分层的参数来“外推”这些缺失值。这本质上是一种模型外推,其可靠性完全取决于模型假设的正确性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在纵向观察研究中,同时处理因失业导致的“截断”结果(truncation by death)和因失访导致的非随机缺失数据(nonignorable missing data),以评估培训项目对失业者工资的因果效应。
- 核心工具/方法:采用主分层(principal stratification) 来正确定义因果效应并建模非随机缺失机制,并使用贝叶斯方法进行推断(MCMC)。
- 主要结论:通过卢森堡行政数据的应用,发现外语培训项目对“始终就业者”的工资有正向但统计上不显著的效应,且效应随时间变化。作者声称他们的框架能够回答“保留工资趋势”这一开放经济学问题。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定: - 时间点:\( t=1,2 \)。\( t=1 \) 是培训结束后不久,\( t=2 \) 是更晚的时间点。 - 主分层:\( G = (S_1(0), S_1(1), S_2(0), S_2(1)) \)。由于单调性假设(\( S_t(1) \ge S_t(0) \)),可能的模式从16种减少到9种。作者进一步假设排除限制:对于某些分层(如“从不就业者”),处理对工资没有影响。 - 缺失机制:\( R_t \) 是二元缺失指示变量。作者假设缺失机制是非随机的,即 \( R_t \) 依赖于未观测的潜在结果 \( Y_t(z) \) 或 \( S_t(z) \)。他们通过主分层来建模这种依赖:不同主分层的个体有不同的缺失概率。 - 模型:作者假设一个贝叶斯分层模型。具体来说: - 给定协变量 \( X \) 和主分层 \( G \),潜在结果 \( (S_t(z), Y_t(z), R_t(z)) \) 服从一个参数分布。 - 主分层 \( G \) 本身服从一个多项分布,其概率是协变量 \( X \) 的函数(如多项逻辑回归)。 - 对于连续结果 \( Y_t(z) \),假设给定 \( X \) 和 \( G \) 后服从正态分布,均值是 \( X \) 和 \( G \) 的线性函数。 - 对于二元变量 \( S_t(z) \) 和 \( R_t(z) \),假设服从逻辑回归。 - 相比已有文献的放宽或强化: - 放宽:相比Zhang et al. (2009) 假设缺失随机(MAR),本文允许缺失是非随机的。 - 强化:相比Mattei et al. (2014) 处理横截面非随机缺失,本文扩展到纵向设定。但本文的参数模型假设比许多半参数方法更强。
主要结果¶
本文是应用型论文,没有定理。核心量化结论来自卢森堡行政数据(IGSS-ADEM)的应用: - 数据:约10,000名失业者,其中约1,000人接受了外语培训。协变量包括年龄、性别、国籍、教育、工作经历等。 - 因果效应:作者估计了培训对“始终就业者”(在 \( t=1,2 \) 都就业的个体)在 \( t=2 \) 时的工资效应。后验均值约为+5%(即培训使工资增加约5%),但95%后验区间包含零,因此统计上不显著。 - 与baseline对比:作者没有提供直接的baseline方法对比(如忽略缺失或假设MAR)。他们只是展示了他们的方法如何“纠正”了简单比较(如直接比较就业者工资)可能产生的偏差。 - 稳健性:作者进行了敏感性分析,通过改变先验分布的参数来评估结果对先验的敏感性。结果显示,效应估计对先验选择是稳健的(即后验区间仍然包含零)。
证明路线与技术技巧¶
本文是应用型论文,没有证明。技术技巧体现在贝叶斯模型构建和MCMC实现上: - 整体路线: 1. 模型构建:定义一个完整的贝叶斯分层模型,包括主分层分布、潜在结果分布、缺失机制分布。 2. 似然函数:基于观测数据写出似然函数。由于存在缺失数据和潜在变量,似然函数涉及对缺失值的积分。 3. MCMC采样:使用Gibbs采样或Metropolis-Hastings算法,从后验分布中采样。采样过程包括: - 给定当前参数,采样每个个体的主分层 \( G \)。 - 给定主分层,采样缺失的潜在结果 \( Y_t(z) \) 和 \( S_t(z) \)。 - 给定填充后的完整数据,更新模型参数。 4. 因果效应估计:从后验样本中计算因果效应(如 \( E[Y_2(1) - Y_2(0) | G = (1,1,1,1)] \)),并报告后验均值和区间。 - 关键跳跃点:最大的技术难点是处理缺失数据。由于缺失是非随机的,缺失机制必须被显式建模。作者通过将缺失指示变量 \( R_t \) 也视为一个潜在结果,并将其纳入主分层框架,从而实现了这一点。这相当于假设缺失机制完全由主分层和协变量决定。 - 技术技巧点名: - 数据增强(Data Augmentation):通过MCMC填充缺失的潜在结果,将缺失数据问题转化为完整数据问题。 - 模式混合模型(Pattern-Mixture Model):通过主分层来建模缺失机制,本质上是一种模式混合模型,其中“模式”由主分层定义。
真实例子与应用¶
- 用的什么数据/场景:卢森堡劳动力行政数据(IGSS-ADEM),评估外语培训项目对失业者工资的影响。这是一个典型的观察研究,培训选择是非随机的。
- 怎么把本文方法用上去:作者将数据整理成纵向格式(两个时间点),定义了协变量、处理、就业状态和工资。然后,他们运行了贝叶斯MCMC算法,估计了模型参数和因果效应。
- 得到什么结果:培训对“始终就业者”的工资有约+5%的效应,但不显著。作者还估计了“保留工资”的趋势(即失业者愿意接受的最低工资随时间的变化),发现培训可能提高了保留工资。
- 这个例子想说明什么:作者想展示他们的框架能够处理实际数据的复杂性(截断+缺失),并回答一个开放的经济学问题(保留工资趋势)。同时,他们也承认了方法的局限性(强假设、计算成本高)。
🔎 结论是否比证明窄¶
是。作者在引言中声称他们的框架能够“回答保留工资趋势这一开放经济学问题”,但在实际应用中,他们只估计了培训对“始终就业者”的工资效应,并没有直接估计“保留工资”本身。他们只是间接推断了保留工资的趋势(通过比较不同时间点的工资效应)。此外,他们的结论(效应不显著)比他们声称的“能够回答”要弱得多。作者没有提供任何形式化的证明来表明他们的框架确实能够识别保留工资趋势,而只是通过一个参数模型进行了推断。
四、开放问题¶
- 如何放松强假设? 本文依赖条件可忽略性、单调性和排除限制。这些假设在观察研究中很难验证。一个开放问题是:能否在放松这些假设(如允许未观测混杂、允许非单调性)的情况下,仍然识别因果效应? 这需要发展新的识别策略或敏感性分析方法。扎根于本文的“假设”部分(Section 2.2)。
- 如何提高计算效率? 贝叶斯MCMC方法计算成本高,尤其当样本量大或模型复杂时。一个开放问题是:能否开发出计算上更高效的估计方法(如EM算法、变分推断、或基于矩的方法)? 扎根于本文的“计算”部分(Section 4)。
- 如何评估模型误设的稳健性? 本文的结论完全依赖于参数模型的正确设定。一个开放问题是:能否发展出对模型误设更稳健的半参数或非参数方法? 例如,能否使用双重稳健估计或基于高效影响函数的方法?扎根于本文的“模型”部分(Section 3)。
- 如何扩展到更多时间点或更复杂的处理? 本文只考虑了二元处理和两个时间点。一个开放问题是:如何将框架扩展到多值处理、连续处理、或更多时间点的纵向设定? 这会导致主分层数量爆炸,需要新的简化策略。扎根于本文的“讨论”部分(Section 6)。
Maintained by 陈星宇 · Homepage · Source on GitHub