Nonparametric Instrumental Regression With Right Censored Duration Outcomes¶
作者: Jad Beyhum, Jean-Pierre Florens, Ingrid Van Keilegom
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 7/10
机构绿灯: KU Leuven(US News 前 50,免分进入精读)
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在存在未观测混杂的情况下,如何识别和估计一个右删失的持续时间变量(duration T)的因果效应。这里的“处理变量 Z”是离散的,且存在一个离散的工具变量(IV)来克服混杂。该方向的核心挑战在于,右删失(right censoring)使得我们无法完整观测到 T,这导致标准的 IV 方法(如两阶段最小二乘)不再适用,因为 T 的分布被截断,且处理效应(如 ATE)的定义和识别都依赖于对删失机制的假设。当前该方向的成熟度较低,大多数工作集中在参数或半参数模型上,非参数处理是前沿。
发展脉络(history)¶
- 奠基工作:工具变量与持续时间模型。早期工作(如 Amemiya 1974)将 IV 方法引入持续时间分析,但通常假设参数模型(如加速失效时间模型)。Honoré 1992 提出了一个半参数变换模型,允许删失,但处理变量是连续的,且未系统处理离散 IV 的识别问题。
- 主要进展:非线性逆问题与识别。Darolles, Fan, Florens, and Renault (2011) 开创性地将非参数 IV 回归视为一个线性逆问题(linear inverse problem),并提出了基于 Tikhonov 正则化的估计方法。然而,该工作假设 T 是完全观测的(无删失)。Carrasco, Florens, and Renault (2007) 系统总结了逆问题在计量经济学中的应用,但同样未涉及删失。
- 当前 frontier:处理删失的非参数 IV。Florens, Johannes, and Van Bellegem (2012) 首次将非参数 IV 扩展到右删失数据,但他们的模型是线性的(即假设 E[T|Z, X] 是 Z 和 X 的线性函数),且处理变量 Z 是连续的。Beyhum, Florens, and Van Keilegom (2023)(本文)将这一框架推广到非线性(非参数)设定,并专门处理离散处理变量 Z 和离散工具变量。这是该子方向的一个关键进展。
- 本文的位置:本文填补了“非参数 IV + 右删失 + 离散处理/工具”这一特定组合的空白。它建立在 Darolles et al. (2011) 的非参数 IV 框架和 Florens et al. (2012) 的删失 IV 框架之上,但将模型从线性推广到非线性,并处理了离散变量带来的独特识别问题(如方程组系统而非单一积分方程)。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 非参数 IV 回归(无删失):以 Darolles et al. (2011) 和 Newey & Powell (2003) 为代表。核心是解决积分方程
E[Y - g(Z) | W] = 0的识别与估计,其中 Y 是完全观测的。主要技术工具是 Tikhonov 正则化和希尔伯特空间理论。 - 删失数据下的 IV 方法:以 Florens et al. (2012) 和 Honoré (1992) 为代表。核心是处理删失带来的信息缺失。Florens et al. (2012) 将问题转化为一个线性逆问题,但假设了线性结构。本文属于这一条线索,但将其推广到非线性。
这个方向在追问的核心问题¶
- 识别问题:在给定离散 IV 和右删失的条件下,处理效应(如 ATE)是否可以被唯一确定?需要哪些条件(如工具变量的相关性、排除性、以及删失的独立性)?
- 估计问题:如何构造一个可行的、具有良好渐近性质的估计量?由于问题是非线性逆问题,正则化是必要的,但如何选择正则化参数并推导收敛速率?
- 部分识别:当完全识别失败时(例如,由于删失导致信息不足),能否得到处理效应的一个识别区间(bounds)?
⚠️ 作者的 framing¶
作者将缺口 frame 成:“现有非参数 IV 方法要么假设无删失(Darolles et al., 2011),要么假设线性模型(Florens et al., 2012)。我们首次在非线性且离散的设定下处理右删失。” 作者淡化了连续 IV 的情况(如 Darolles et al., 2011 中的连续 Z),并回避了与更复杂的半参数模型(如 Cox 比例风险模型 + IV)的直接比较。什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用任何关于“离散工具变量在非线性模型中的识别”的文献(例如,在非参数 IV 中,离散 IV 通常只能提供局部识别,而非全局识别)。这是一个值得研究者去查的问题:离散 IV 在非线性模型中的识别强度是否被充分讨论过?
张力¶
未见明显对立引用。所有被引工作都朝着“更一般化”的方向发展,没有出现彼此矛盾或在略不同条件下得相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
T:持续时间(duration),是一个非负随机变量。这是我们关心的结果变量。Z:离散处理变量(treatment),取值于一个有限集合{z_1, ..., z_K}。这是我们想评估因果效应的变量。W:离散工具变量(instrument),取值于一个有限集合{w_1, ..., w_J}。它用于解决 Z 与未观测混杂之间的相关性。C:右删失时间(censoring time),是一个非负随机变量。我们无法完全观测到 T,只能观测到Y = min(T, C)和删失指示符Δ = 1{T ≤ C}。U:未观测的混杂变量(unobserved confounders),影响 T 和 Z,但与 W 独立(给定 Z 和 X,但本文没有协变量 X)。g(z):我们想要估计的结构函数(structural function),即g(z) = E[T | Z = z, do(Z = z)]或更一般地,在 IV 框架下,它是满足E[T - g(Z) | W] = 0的函数。这是我们的 estimand。F_T(t | z, u):给定 Z 和 U 时 T 的条件分布函数。S_T(t | z, u) = 1 - F_T(t | z, u):条件生存函数。λ_T(t | z, u):条件风险函数(hazard function)。
- 模型:
- 数据生成机制:
(T, Z, W, C)由某个联合分布生成。关键假设是:- 工具变量排除性:
W与U独立,即W ⟂ U。 - 工具变量相关性:
W与Z相关(即Cov(Z, W) ≠ 0)。 - 非参数结构:
T和Z的关系由未知函数g(z)和未观测的U决定,即T = g(Z) + U或更一般的非可加形式。本文采用一个更一般的非参数模型:E[T - g(Z) | W] = 0。 - 随机右删失:
C与T独立,给定(Z, W)。即C ⟂ T | (Z, W)。
- 工具变量排除性:
- 要估的对象:
g(z)对于所有z的值。由于g(z)是非参数的,我们需要估计它在每个z处的取值。
- 数据生成机制:
- 可观测数据:
- 研究者实际能观测到的是:
(Y_i, Δ_i, Z_i, W_i)对于i = 1, ..., n。 Y_i = min(T_i, C_i)是观测到的持续时间(可能是删失的)。Δ_i = 1{T_i ≤ C_i}是删失指示符(1 表示未删失,0 表示删失)。- 想要但观测不到的是:
T_i本身(当Δ_i = 0时),以及未观测的混杂U_i。
- 研究者实际能观测到的是:
第二步:讲最小内核¶
本文的核心思路可以简化为一个最简特例:假设只有两个处理水平(Z ∈ {0, 1})和一个二值工具变量(W ∈ {0, 1})。我们想估计 g(1) - g(0),即 ATE。
在这个特例下,模型 E[T - g(Z) | W] = 0 退化为一个包含两个未知数(g(0) 和 g(1))的线性方程组:
- 当
W = 0时:E[T - g(Z) | W=0] = 0=>E[T | W=0] = g(0) * P(Z=0 | W=0) + g(1) * P(Z=1 | W=0) - 当
W = 1时:E[T - g(Z) | W=1] = 0=>E[T | W=1] = g(0) * P(Z=0 | W=1) + g(1) * P(Z=1 | W=1)
这里,E[T | W=w] 和 P(Z=z | W=w) 都是可以从观测数据 (Y, Δ, Z, W) 中估计的(尽管 T 有删失,但我们可以用 Kaplan-Meier 或 IPCW 方法估计 E[T | W=w])。因此,我们有一个2x2 的线性系统:
[ P(Z=0|W=0) P(Z=1|W=0) ] [ g(0) ] = [ E[T|W=0] ]
[ P(Z=0|W=1) P(Z=1|W=1) ] [ g(1) ] [ E[T|W=1] ]
核心思路:只要系数矩阵(即 P(Z=z | W=w) 构成的矩阵)是满秩的(即 P(Z=1|W=0) ≠ P(Z=1|W=1),也就是工具变量与处理变量相关),这个线性系统就有唯一解 (g(0), g(1))。这个解就是 ATE 的识别公式。
为什么这是最小内核? 因为:
1. 它去掉了所有关于删失的复杂处理(我们假设 T 是完全观测的,或者我们有一个完美的 E[T|W] 估计量)。
2. 它去掉了所有关于非线性逆问题的泛函分析(问题退化为一个简单的线性代数问题)。
3. 它清晰地展示了离散 IV 如何通过一个方程组系统来识别处理效应。当 Z 和 W 都是离散时,非参数 IV 问题本质上就是一个线性方程组求解问题。本文的一般化工作,就是在这个最小内核上,加入了右删失(使得 E[T|W] 的估计变得复杂)和更一般的非线性结构(可能涉及更复杂的函数形式,但核心识别逻辑仍然是解一个方程组)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在离散处理变量 Z 和离散工具变量 W 的设定下,如何非参数地识别和估计右删失持续时间 T 的因果效应(如 ATE)。
- 核心工具 / 方法:将识别问题转化为一个非线性方程组系统(源于
E[T - g(Z) | W] = 0),并提出了一个基于 Kaplan-Meier 估计和逆概率删失加权(IPCW)的两步估计程序来求解该系统。 - 主要结论:提供了局部和全局识别条件;推导了估计量的收敛速率(依赖于正则化参数的选择)和渐近正态性条件;当完全识别失败时,发展了部分识别结果(bounds)。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 设定:
(T, Z, W, C)独立同分布。Z和W是离散的,取值于有限集。T是连续的持续时间。C是随机右删失,与T独立给定(Z, W)。 - 核心假设:
- 工具变量排除性:
E[T - g(Z) | W] = 0。这是定义结构函数g的方程。它比标准的W ⟂ U更强,因为它直接假设了条件矩条件。 - 工具变量相关性:对于每个
z,P(Z=z | W=w)不是常数(即 W 对 Z 有预测能力)。这是识别的基础。 - 删失独立性:
C ⟂ T | (Z, W)。这是使用 Kaplan-Meier 或 IPCW 方法估计E[T|W]的关键。 - 支持条件:对于每个
(z, w)组合,P(T > t | Z=z, W=w)在某个足够大的t处非零,以确保 Kaplan-Meier 估计的尾部行为良好。
- 工具变量排除性:
- 相比已有文献:相比 Darolles et al. (2011)(无删失),本文增加了删失假设;相比 Florens et al. (2012)(线性模型),本文去掉了线性假设,但增加了 Z 和 W 离散的假设(这使得问题从解一个积分方程退化为解一个有限维方程组,技术上更简单,但应用范围更窄)。
主要结果¶
- 定理 1(局部识别):在给定假设下,结构函数
g(z)在每一个z处是局部可识别的。这意味着,如果存在两个不同的函数g和g'都满足E[T - g(Z) | W] = 0,那么它们在每个z处的差异必须为零。证明依赖于系数矩阵的满秩性。 - 定理 2(全局识别):在更强的条件下(如工具变量与处理变量有足够强的相关性),
g(z)是全局可识别的。这意味着解是唯一的。 - 定理 3(收敛速率):估计量
ĝ(z)的收敛速率取决于正则化参数(如核函数带宽)的选择。在最优带宽下,可以达到n^{-2/5}的速率(类似于非参数回归的速率)。这是通过将问题视为一个非线性逆问题,并应用 Tikhonov 正则化理论得到的。 - 定理 4(渐近正态性):在特定条件下(如带宽选择适当,且删失分布足够光滑),
ĝ(z)是渐近正态的。这允许进行置信区间构建和假设检验。 - 部分识别结果:当完全识别失败时(例如,由于删失导致某些
(z, w)组合的E[T|W]无法估计),作者给出了 ATE 的一个识别区间(bounds),该区间由可识别的条件期望的极值构成。
证明路线与技术技巧¶
- 整体路线:
- 第一步:识别。将
E[T - g(Z) | W] = 0转化为一个关于g(z)的线性方程组系统。证明该系统的系数矩阵(由P(Z=z | W=w)构成)在工具变量相关性假设下是满秩的,从而g(z)被唯一识别。 - 第二步:估计。用样本矩代替总体矩。用 Kaplan-Meier 估计量
Ê[T | W=w]估计E[T | W=w],用经验频率P̂(Z=z | W=w)估计P(Z=z | W=w)。然后求解这个估计出的线性系统,得到ĝ(z)。 - 第三步:渐近分析。将
ĝ(z) - g(z)分解为两部分:一部分来自Ê[T | W]的估计误差,另一部分来自P̂(Z|W)的估计误差。利用 Kaplan-Meier 估计量的渐近理论(如鞅表示)和 Delta 方法,推导出ĝ(z)的收敛速率和渐近分布。
- 第一步:识别。将
- 关键跳跃点:
- 从线性逆问题到线性方程组:这是本文最关键的跳跃。作者意识到,当 Z 和 W 都是离散时,非参数 IV 问题不再是一个泛函方程,而是一个有限维线性系统。这使得估计和推断大大简化,但也限制了应用范围。
- 处理删失:如何估计
E[T | W=w]?作者使用了 Kaplan-Meier 估计量。但 Kaplan-Meier 估计的是生存函数,而不是期望。因此,需要将E[T | W=w]表示为生存函数的积分:E[T | W=w] = ∫_0^∞ S_T(t | W=w) dt。然后,用 Kaplan-Meier 估计量Ŝ_T(t | W=w)来估计这个积分。这个积分估计的渐近性质是推导ĝ(z)渐近性质的关键。
- 技术技巧点名:
- Kaplan-Meier 估计量:用于估计条件生存函数
S_T(t | W=w)。 - 鞅表示(Martingale representation):用于推导 Kaplan-Meier 估计量的渐近性质,特别是其弱收敛到高斯过程。
- Delta 方法:用于将
Ê[T | W]和P̂(Z|W)的渐近性质传递到ĝ(z)。 - Tikhonov 正则化:虽然本文的线性系统是有限维的,但作者仍然讨论了正则化(如岭回归)来处理可能出现的病态问题(当工具变量很弱时)。
- Kaplan-Meier 估计量:用于估计条件生存函数
真实例子与应用¶
- 用的什么数据 / 场景:伊利诺伊州再就业奖金实验(Illinois Reemployment Bonus Experiment)。这是一个经典的劳动经济学实验,旨在研究向失业者提供再就业奖金(如果他们在规定时间内找到工作)是否会缩短失业持续时间。
- 怎么把本文方法用上去:
- 处理变量 Z:是否提供奖金(二值变量)。
- 工具变量 W:实验的随机分配(是否被分配到奖金组)。由于实验是随机化的,W 是 Z 的一个有效工具变量。
- 结果变量 T:失业持续时间(周数),存在右删失(有些人在实验结束时仍未找到工作)。
- 方法:用本文提出的非参数 IV 方法估计
g(1) - g(0),即奖金对平均失业持续时间的因果效应。
- 得到什么结果:估计结果显示,提供奖金显著缩短了失业持续时间。作者还比较了他们的非参数估计结果与一个参数模型(如加速失效时间模型)的结果,发现两者定性一致,但非参数估计的置信区间更宽(反映了非参数方法更高的方差)。
- 这个例子想说明什么:验证本文方法在真实数据上的可行性,并展示其相对于参数模型的灵活性(不需要假设特定的函数形式)。同时,也展示了工具变量在实验数据中的应用(即使实验是随机化的,也可能存在部分不依从,此时 IV 可以估计 complier average causal effect)。
🔎 结论是否比证明窄¶
是的。作者在引言中声称他们的方法适用于“非参数”设定,但证明部分严格依赖于 Z 和 W 都是离散的假设。对于连续 Z 或连续 W 的情况,问题会退化为一个真正的非线性积分方程,其识别和估计理论完全不同(需要用到希尔伯特空间理论和更复杂的正则化方法)。作者在结论部分也承认了这一点,并将其列为未来工作。因此,论文的实际贡献比其声称的“非参数”范围要窄——它严格适用于离散-离散情形。
四、开放问题¶
- 扩展到连续工具变量:本文的核心技巧(将问题转化为线性方程组)依赖于 Z 和 W 的离散性。如何将结果扩展到连续 W?这将需要处理一个非线性积分方程,其识别和估计理论(如 Darolles et al., 2011)需要被重新审视,并加入删失处理。扎根点:论文结论部分的“未来工作”段落。
- 更一般的删失机制:本文假设随机右删失(
C ⟂ T | (Z, W))。如果删失是信息性的(即与 T 相关,即使给定 Z 和 W),识别和估计将变得更加困难。如何放松这个假设?扎根点:论文假设 3(删失独立性)。 - 高维处理变量:如果 Z 是高维的(例如,多个处理变量),本文的线性系统将变得非常大,可能面临维数灾难。如何在高维设定下进行正则化或变量选择?扎根点:论文的设定中 Z 是低维离散的。
- 与半参数模型的比较:本文的非参数方法在灵活性上优于参数模型,但代价是更慢的收敛速率。是否存在一个半参数模型(如部分线性模型)能在灵活性和效率之间取得更好的平衡?扎根点:论文在模拟中与参数模型进行了比较,但未讨论半参数模型。
Maintained by 陈星宇 · Homepage · Source on GitHub