跳转至

Nonparametric Instrumental Regression With Right Censored Duration Outcomes

作者: Jad Beyhum, Jean-Pierre Florens, Ingrid Van Keilegom
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 7/10
机构绿灯: KU Leuven(US News 前 50,免分进入精读)
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在存在未观测混杂的情况下,如何识别和估计一个右删失的持续时间变量(duration T)的因果效应。这里的“处理变量 Z”是离散的,且存在一个离散的工具变量(IV)来克服混杂。该方向的核心挑战在于,右删失(right censoring)使得我们无法完整观测到 T,这导致标准的 IV 方法(如两阶段最小二乘)不再适用,因为 T 的分布被截断,且处理效应(如 ATE)的定义和识别都依赖于对删失机制的假设。当前该方向的成熟度较低,大多数工作集中在参数或半参数模型上,非参数处理是前沿。

发展脉络(history)

  • 奠基工作:工具变量与持续时间模型。早期工作(如 Amemiya 1974)将 IV 方法引入持续时间分析,但通常假设参数模型(如加速失效时间模型)。Honoré 1992 提出了一个半参数变换模型,允许删失,但处理变量是连续的,且未系统处理离散 IV 的识别问题。
  • 主要进展:非线性逆问题与识别Darolles, Fan, Florens, and Renault (2011) 开创性地将非参数 IV 回归视为一个线性逆问题(linear inverse problem),并提出了基于 Tikhonov 正则化的估计方法。然而,该工作假设 T 是完全观测的(无删失)。Carrasco, Florens, and Renault (2007) 系统总结了逆问题在计量经济学中的应用,但同样未涉及删失。
  • 当前 frontier:处理删失的非参数 IVFlorens, Johannes, and Van Bellegem (2012) 首次将非参数 IV 扩展到右删失数据,但他们的模型是线性的(即假设 E[T|Z, X] 是 Z 和 X 的线性函数),且处理变量 Z 是连续的。Beyhum, Florens, and Van Keilegom (2023)(本文)将这一框架推广到非线性(非参数)设定,并专门处理离散处理变量 Z 和离散工具变量。这是该子方向的一个关键进展。
  • 本文的位置:本文填补了“非参数 IV + 右删失 + 离散处理/工具”这一特定组合的空白。它建立在 Darolles et al. (2011) 的非参数 IV 框架和 Florens et al. (2012) 的删失 IV 框架之上,但将模型从线性推广到非线性,并处理了离散变量带来的独特识别问题(如方程组系统而非单一积分方程)。

子线索聚类

这些被引文献大致落在两条子线索上:

  1. 非参数 IV 回归(无删失):以 Darolles et al. (2011)Newey & Powell (2003) 为代表。核心是解决积分方程 E[Y - g(Z) | W] = 0 的识别与估计,其中 Y 是完全观测的。主要技术工具是 Tikhonov 正则化和希尔伯特空间理论。
  2. 删失数据下的 IV 方法:以 Florens et al. (2012)Honoré (1992) 为代表。核心是处理删失带来的信息缺失。Florens et al. (2012) 将问题转化为一个线性逆问题,但假设了线性结构。本文属于这一条线索,但将其推广到非线性。

这个方向在追问的核心问题

  1. 识别问题:在给定离散 IV 和右删失的条件下,处理效应(如 ATE)是否可以被唯一确定?需要哪些条件(如工具变量的相关性、排除性、以及删失的独立性)?
  2. 估计问题:如何构造一个可行的、具有良好渐近性质的估计量?由于问题是非线性逆问题,正则化是必要的,但如何选择正则化参数并推导收敛速率?
  3. 部分识别:当完全识别失败时(例如,由于删失导致信息不足),能否得到处理效应的一个识别区间(bounds)?

⚠️ 作者的 framing

作者将缺口 frame 成:“现有非参数 IV 方法要么假设无删失(Darolles et al., 2011),要么假设线性模型(Florens et al., 2012)。我们首次在非线性离散的设定下处理右删失。” 作者淡化了连续 IV 的情况(如 Darolles et al., 2011 中的连续 Z),并回避了与更复杂的半参数模型(如 Cox 比例风险模型 + IV)的直接比较。什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用任何关于“离散工具变量在非线性模型中的识别”的文献(例如,在非参数 IV 中,离散 IV 通常只能提供局部识别,而非全局识别)。这是一个值得研究者去查的问题:离散 IV 在非线性模型中的识别强度是否被充分讨论过?

张力

未见明显对立引用。所有被引工作都朝着“更一般化”的方向发展,没有出现彼此矛盾或在略不同条件下得相反结论的情况。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
    • T:持续时间(duration),是一个非负随机变量。这是我们关心的结果变量。
    • Z:离散处理变量(treatment),取值于一个有限集合 {z_1, ..., z_K}。这是我们想评估因果效应的变量。
    • W:离散工具变量(instrument),取值于一个有限集合 {w_1, ..., w_J}。它用于解决 Z 与未观测混杂之间的相关性。
    • C:右删失时间(censoring time),是一个非负随机变量。我们无法完全观测到 T,只能观测到 Y = min(T, C) 和删失指示符 Δ = 1{T ≤ C}
    • U:未观测的混杂变量(unobserved confounders),影响 T 和 Z,但与 W 独立(给定 Z 和 X,但本文没有协变量 X)。
    • g(z):我们想要估计的结构函数(structural function),即 g(z) = E[T | Z = z, do(Z = z)] 或更一般地,在 IV 框架下,它是满足 E[T - g(Z) | W] = 0 的函数。这是我们的 estimand
    • F_T(t | z, u):给定 Z 和 U 时 T 的条件分布函数。
    • S_T(t | z, u) = 1 - F_T(t | z, u):条件生存函数。
    • λ_T(t | z, u):条件风险函数(hazard function)。
  • 模型
    • 数据生成机制:(T, Z, W, C) 由某个联合分布生成。关键假设是:
      1. 工具变量排除性WU 独立,即 W ⟂ U
      2. 工具变量相关性WZ 相关(即 Cov(Z, W) ≠ 0)。
      3. 非参数结构TZ 的关系由未知函数 g(z) 和未观测的 U 决定,即 T = g(Z) + U 或更一般的非可加形式。本文采用一个更一般的非参数模型:E[T - g(Z) | W] = 0
      4. 随机右删失CT 独立,给定 (Z, W)。即 C ⟂ T | (Z, W)
    • 要估的对象g(z) 对于所有 z 的值。由于 g(z) 是非参数的,我们需要估计它在每个 z 处的取值。
  • 可观测数据
    • 研究者实际能观测到的是:(Y_i, Δ_i, Z_i, W_i) 对于 i = 1, ..., n
    • Y_i = min(T_i, C_i) 是观测到的持续时间(可能是删失的)。
    • Δ_i = 1{T_i ≤ C_i} 是删失指示符(1 表示未删失,0 表示删失)。
    • 想要但观测不到的是:T_i 本身(当 Δ_i = 0 时),以及未观测的混杂 U_i

第二步:讲最小内核

本文的核心思路可以简化为一个最简特例:假设只有两个处理水平(Z ∈ {0, 1})和一个二值工具变量(W ∈ {0, 1})。我们想估计 g(1) - g(0),即 ATE。

在这个特例下,模型 E[T - g(Z) | W] = 0 退化为一个包含两个未知数(g(0)g(1))的线性方程组

  • W = 0 时:E[T - g(Z) | W=0] = 0 => E[T | W=0] = g(0) * P(Z=0 | W=0) + g(1) * P(Z=1 | W=0)
  • W = 1 时:E[T - g(Z) | W=1] = 0 => E[T | W=1] = g(0) * P(Z=0 | W=1) + g(1) * P(Z=1 | W=1)

这里,E[T | W=w]P(Z=z | W=w) 都是可以从观测数据 (Y, Δ, Z, W) 中估计的(尽管 T 有删失,但我们可以用 Kaplan-Meier 或 IPCW 方法估计 E[T | W=w])。因此,我们有一个2x2 的线性系统

[ P(Z=0|W=0)  P(Z=1|W=0) ] [ g(0) ]   = [ E[T|W=0] ]
[ P(Z=0|W=1)  P(Z=1|W=1) ] [ g(1) ]     [ E[T|W=1] ]

核心思路:只要系数矩阵(即 P(Z=z | W=w) 构成的矩阵)是满秩的(即 P(Z=1|W=0) ≠ P(Z=1|W=1),也就是工具变量与处理变量相关),这个线性系统就有唯一解 (g(0), g(1))。这个解就是 ATE 的识别公式。

为什么这是最小内核? 因为: 1. 它去掉了所有关于删失的复杂处理(我们假设 T 是完全观测的,或者我们有一个完美的 E[T|W] 估计量)。 2. 它去掉了所有关于非线性逆问题的泛函分析(问题退化为一个简单的线性代数问题)。 3. 它清晰地展示了离散 IV 如何通过一个方程组系统来识别处理效应。当 Z 和 W 都是离散时,非参数 IV 问题本质上就是一个线性方程组求解问题。本文的一般化工作,就是在这个最小内核上,加入了右删失(使得 E[T|W] 的估计变得复杂)和更一般的非线性结构(可能涉及更复杂的函数形式,但核心识别逻辑仍然是解一个方程组)。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在离散处理变量 Z 和离散工具变量 W 的设定下,如何非参数地识别和估计右删失持续时间 T 的因果效应(如 ATE)。
  2. 核心工具 / 方法:将识别问题转化为一个非线性方程组系统(源于 E[T - g(Z) | W] = 0),并提出了一个基于 Kaplan-Meier 估计和逆概率删失加权(IPCW)的两步估计程序来求解该系统。
  3. 主要结论:提供了局部和全局识别条件;推导了估计量的收敛速率(依赖于正则化参数的选择)和渐近正态性条件;当完全识别失败时,发展了部分识别结果(bounds)。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 设定(T, Z, W, C) 独立同分布。ZW 是离散的,取值于有限集。T 是连续的持续时间。C 是随机右删失,与 T 独立给定 (Z, W)
  • 核心假设
    1. 工具变量排除性E[T - g(Z) | W] = 0。这是定义结构函数 g 的方程。它比标准的 W ⟂ U 更强,因为它直接假设了条件矩条件。
    2. 工具变量相关性:对于每个 zP(Z=z | W=w) 不是常数(即 W 对 Z 有预测能力)。这是识别的基础。
    3. 删失独立性C ⟂ T | (Z, W)。这是使用 Kaplan-Meier 或 IPCW 方法估计 E[T|W] 的关键。
    4. 支持条件:对于每个 (z, w) 组合,P(T > t | Z=z, W=w) 在某个足够大的 t 处非零,以确保 Kaplan-Meier 估计的尾部行为良好。
  • 相比已有文献:相比 Darolles et al. (2011)(无删失),本文增加了删失假设;相比 Florens et al. (2012)(线性模型),本文去掉了线性假设,但增加了 Z 和 W 离散的假设(这使得问题从解一个积分方程退化为解一个有限维方程组,技术上更简单,但应用范围更窄)。

主要结果

  • 定理 1(局部识别):在给定假设下,结构函数 g(z) 在每一个 z 处是局部可识别的。这意味着,如果存在两个不同的函数 gg' 都满足 E[T - g(Z) | W] = 0,那么它们在每个 z 处的差异必须为零。证明依赖于系数矩阵的满秩性。
  • 定理 2(全局识别):在更强的条件下(如工具变量与处理变量有足够强的相关性),g(z) 是全局可识别的。这意味着解是唯一的。
  • 定理 3(收敛速率):估计量 ĝ(z) 的收敛速率取决于正则化参数(如核函数带宽)的选择。在最优带宽下,可以达到 n^{-2/5} 的速率(类似于非参数回归的速率)。这是通过将问题视为一个非线性逆问题,并应用 Tikhonov 正则化理论得到的。
  • 定理 4(渐近正态性):在特定条件下(如带宽选择适当,且删失分布足够光滑),ĝ(z) 是渐近正态的。这允许进行置信区间构建和假设检验。
  • 部分识别结果:当完全识别失败时(例如,由于删失导致某些 (z, w) 组合的 E[T|W] 无法估计),作者给出了 ATE 的一个识别区间(bounds),该区间由可识别的条件期望的极值构成。

证明路线与技术技巧

  • 整体路线
    1. 第一步:识别。将 E[T - g(Z) | W] = 0 转化为一个关于 g(z) 的线性方程组系统。证明该系统的系数矩阵(由 P(Z=z | W=w) 构成)在工具变量相关性假设下是满秩的,从而 g(z) 被唯一识别。
    2. 第二步:估计。用样本矩代替总体矩。用 Kaplan-Meier 估计量 Ê[T | W=w] 估计 E[T | W=w],用经验频率 P̂(Z=z | W=w) 估计 P(Z=z | W=w)。然后求解这个估计出的线性系统,得到 ĝ(z)
    3. 第三步:渐近分析。将 ĝ(z) - g(z) 分解为两部分:一部分来自 Ê[T | W] 的估计误差,另一部分来自 P̂(Z|W) 的估计误差。利用 Kaplan-Meier 估计量的渐近理论(如鞅表示)和 Delta 方法,推导出 ĝ(z) 的收敛速率和渐近分布。
  • 关键跳跃点
    • 从线性逆问题到线性方程组:这是本文最关键的跳跃。作者意识到,当 Z 和 W 都是离散时,非参数 IV 问题不再是一个泛函方程,而是一个有限维线性系统。这使得估计和推断大大简化,但也限制了应用范围。
    • 处理删失:如何估计 E[T | W=w]?作者使用了 Kaplan-Meier 估计量。但 Kaplan-Meier 估计的是生存函数,而不是期望。因此,需要将 E[T | W=w] 表示为生存函数的积分:E[T | W=w] = ∫_0^∞ S_T(t | W=w) dt。然后,用 Kaplan-Meier 估计量 Ŝ_T(t | W=w) 来估计这个积分。这个积分估计的渐近性质是推导 ĝ(z) 渐近性质的关键。
  • 技术技巧点名
    • Kaplan-Meier 估计量:用于估计条件生存函数 S_T(t | W=w)
    • 鞅表示(Martingale representation):用于推导 Kaplan-Meier 估计量的渐近性质,特别是其弱收敛到高斯过程。
    • Delta 方法:用于将 Ê[T | W]P̂(Z|W) 的渐近性质传递到 ĝ(z)
    • Tikhonov 正则化:虽然本文的线性系统是有限维的,但作者仍然讨论了正则化(如岭回归)来处理可能出现的病态问题(当工具变量很弱时)。

真实例子与应用

  • 用的什么数据 / 场景:伊利诺伊州再就业奖金实验(Illinois Reemployment Bonus Experiment)。这是一个经典的劳动经济学实验,旨在研究向失业者提供再就业奖金(如果他们在规定时间内找到工作)是否会缩短失业持续时间。
  • 怎么把本文方法用上去
    • 处理变量 Z:是否提供奖金(二值变量)。
    • 工具变量 W:实验的随机分配(是否被分配到奖金组)。由于实验是随机化的,W 是 Z 的一个有效工具变量。
    • 结果变量 T:失业持续时间(周数),存在右删失(有些人在实验结束时仍未找到工作)。
    • 方法:用本文提出的非参数 IV 方法估计 g(1) - g(0),即奖金对平均失业持续时间的因果效应。
  • 得到什么结果:估计结果显示,提供奖金显著缩短了失业持续时间。作者还比较了他们的非参数估计结果与一个参数模型(如加速失效时间模型)的结果,发现两者定性一致,但非参数估计的置信区间更宽(反映了非参数方法更高的方差)。
  • 这个例子想说明什么:验证本文方法在真实数据上的可行性,并展示其相对于参数模型的灵活性(不需要假设特定的函数形式)。同时,也展示了工具变量在实验数据中的应用(即使实验是随机化的,也可能存在部分不依从,此时 IV 可以估计 complier average causal effect)。

🔎 结论是否比证明窄

是的。作者在引言中声称他们的方法适用于“非参数”设定,但证明部分严格依赖于 Z 和 W 都是离散的假设。对于连续 Z 或连续 W 的情况,问题会退化为一个真正的非线性积分方程,其识别和估计理论完全不同(需要用到希尔伯特空间理论和更复杂的正则化方法)。作者在结论部分也承认了这一点,并将其列为未来工作。因此,论文的实际贡献比其声称的“非参数”范围要窄——它严格适用于离散-离散情形。

四、开放问题

  1. 扩展到连续工具变量:本文的核心技巧(将问题转化为线性方程组)依赖于 Z 和 W 的离散性。如何将结果扩展到连续 W?这将需要处理一个非线性积分方程,其识别和估计理论(如 Darolles et al., 2011)需要被重新审视,并加入删失处理。扎根点:论文结论部分的“未来工作”段落。
  2. 更一般的删失机制:本文假设随机右删失(C ⟂ T | (Z, W))。如果删失是信息性的(即与 T 相关,即使给定 Z 和 W),识别和估计将变得更加困难。如何放松这个假设?扎根点:论文假设 3(删失独立性)。
  3. 高维处理变量:如果 Z 是高维的(例如,多个处理变量),本文的线性系统将变得非常大,可能面临维数灾难。如何在高维设定下进行正则化或变量选择?扎根点:论文的设定中 Z 是低维离散的。
  4. 与半参数模型的比较:本文的非参数方法在灵活性上优于参数模型,但代价是更慢的收敛速率。是否存在一个半参数模型(如部分线性模型)能在灵活性和效率之间取得更好的平衡?扎根点:论文在模拟中与参数模型进行了比较,但未讨论半参数模型。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论