跳转至

Instrumental Variable Estimation of Dynamic Treatment Effects on a Duration Outcome

作者: Jad Beyhum, Samuele Centorrino, Jean-Pierre Florens, Ingrid Van Keilegom
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本文研究的核心问题是:在动态处理(dynamic treatment)设定下,处理发生的时间点 Z 对后续持续时间 T(如康复时长、存活时间)的因果效应如何识别与估计? 这是一个典型的“时间-事件”因果推断问题,其特殊性在于:(1) 处理时间 Z 是内生的(非随机分配);(2) 结果变量 T 被随机右删失变量 C 截断;(3) 处理时间 Z 本身也被 T∧C 右删失(即若 T 先发生,则 Z 被截断)。该方向当前成熟度较低——大多数现有工作要么假设处理时间是固定的(非动态),要么假设处理时间外生,要么忽略删失结构。本文试图在完全非参数框架下解决识别问题,并在参数模型下给出估计与渐近理论。

发展脉络(history)

作者在引言中引用的工作可串成以下脉络:

  • 奠基工作:处理时间外生且无删失。Abbring & van den Berg (2003) 是经典起点,它研究了动态处理效应(处理时间 Z 对 T 的因果效应),但假设 Z 是外生的(即给定协变量后,Z 与 T 的误差项独立)。该工作奠定了“混合比例风险模型”(MPH)框架,但未处理内生性。
  • 主要进展:引入工具变量处理内生性。Bijwaard (2014) 将工具变量引入动态处理设定,但假设处理时间 Z 是完全可观测的(即无删失)。这在实际中不现实——因为 T 被删失时,Z 也可能被截断。作者引用该文时指出:“Bijwaard (2014) 假设 Z 是完全可观测的,这在实际中很少成立。”
  • 当前 frontier:同时处理内生性与删失。本文是第一个同时处理以下三个特征的设定:(1) 处理时间 Z 内生;(2) T 被随机右删失;(3) Z 被 T∧C 右删失。作者声称:“据我们所知,这是第一篇在动态处理设定中同时处理内生性与删失的工作。”
  • 本文的位置:本文填补了上述 gap,但仅给出参数模型下的估计与渐近理论,非参数估计(如 sieve)被留作未来工作。

子线索聚类

被引文献大致落在两条子线索上:

  1. 动态处理效应(外生设定):Abbring & van den Berg (2003)、Abbring (2012) 等。核心是假设处理时间外生,利用 MPH 模型或逆概率加权识别因果效应。瓶颈:内生性未被处理。
  2. 工具变量与持续时间模型:Bijwaard (2014)、Bijwaard et al. (2015) 等。引入 IV 处理内生性,但假设 Z 完全可观测。瓶颈:删失结构被忽略。

这个方向在追问的核心问题

  • 识别问题:在动态处理设定下,给定 IV 和删失结构,回归函数 \( m(z) = \mathbb{E}[T \mid Z = z, \text{uncensored}] \) 是否可识别?需要什么条件?
  • 估计问题:如何从右删失数据中估计 \( m(z) \)?参数模型 vs. 非参数模型?
  • 渐近理论:估计量的收敛速度、渐近分布、效率界是什么?
  • 实际应用:如何将方法应用于医学、经济学中的动态处理问题(如治疗时机对康复时长的影响)?

⚠️ 作者的 framing

作者将缺口 frame 成:“现有文献要么假设处理时间外生,要么假设处理时间完全可观测,而我们的设定同时处理内生性与删失。” 这使本文成为“显然的下一步”。但作者淡化了以下竞争路线: - 逆概率加权(IPW)方法:若删失机制可建模,IPW 可能更简单。作者仅用一句话提及:“IPW 需要正确指定删失模型,而我们的方法基于 IV,对删失机制更稳健。” - 半参数方法:作者仅给出参数模型下的估计,未讨论半参数(如部分线性模型)或非参数(如 sieve)估计。这可能是为了简化理论,但限制了方法的灵活性。

值得研究者去查的问题:为什么作者没有引用或讨论 “动态处理效应中的工具变量方法在删失数据下的非参数识别” 的已有工作?例如,是否存在关于“IV 在删失持续时间模型中的非参数识别”的文献(如 Honoré & Hu 2004 或类似工作)?作者在引言中未提及任何关于“非参数识别”的已有结果,这可能是该方向的真正 gap。

张力

未见明显对立引用。所有被引工作基本一致地认为:动态处理效应在删失数据下的识别与估计是一个开放问题,本文是第一个系统处理该问题的尝试。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \( Z \):处理时间(随机变量),即受试者接受处理的时间点。它是内生的(与误差项相关)。 - \( T \):持续时间(随机变量),即从某个起点到事件发生的时间(如康复时长)。它是我们关心的结果变量。 - \( C \):右删失时间(随机变量),独立于 \( T \)\( Z \)(给定协变量后)。\( T \)\( C \) 右删失。 - \( Y = T \land C \):可观测的持续时间(取 \( T \)\( C \) 的最小值)。 - \( \Delta = \mathbf{1}\{T \leq C\} \):删失指示符,\( \Delta = 1 \) 表示 \( T \) 未被删失(事件发生),\( \Delta = 0 \) 表示 \( T \) 被删失。 - \( \tilde{Z} = Z \land Y \):可观测的处理时间(取 \( Z \)\( Y \) 的最小值)。注意:\( Z \)\( Y \) 右删失。 - \( \Delta_Z = \mathbf{1}\{Z \leq Y\} \):处理时间删失指示符,\( \Delta_Z = 1 \) 表示 \( Z \) 未被删失(处理发生在事件或删失之前)。 - \( V \):工具变量(随机变量),解释 \( Z \) 且独立于 \( T \) 的误差项(给定协变量后)。 - \( m(z) = \mathbb{E}[T \mid Z = z] \):感兴趣的回归函数(因果效应)。注意:这是潜在结果的期望,因为 \( T \)\( Z \) 被删失时不可观测。 - \( \theta \):参数向量(若 \( m(z) \) 被参数化为 \( m(z; \theta) \))。

模型: - 数据生成机制:假设存在一个潜在结果 \( T(z) \)(若处理发生在时间 \( z \)),但实际观测到的 \( T \)\( T(Z) \)(即处理时间 \( Z \) 下的结果)。这是一个动态处理设定,因为处理时间 \( Z \) 本身是随机的。 - 内生性:\( Z \)\( T \) 的误差项相关(例如,更早接受处理的人可能有更严重的病情,导致更长的康复时间)。 - 工具变量:\( V \) 满足:(1) 相关性:\( V \)\( Z \) 相关;(2) 外生性:\( V \) 独立于 \( T \) 的误差项(给定协变量后);(3) 排他性:\( V \) 仅通过 \( Z \) 影响 \( T \)。 - 删失:\( C \) 独立于 \( (T, Z, V) \)(给定协变量后),且 \( C \) 的分布已知或可估计。

可观测数据: - 研究者实际能观测到的是:\( (Y, \Delta, \tilde{Z}, \Delta_Z, V) \) 的独立同分布样本。 - 关键不可观测量: - 当 \( \Delta = 0 \) 时,\( T \) 被删失,不可观测。 - 当 \( \Delta_Z = 0 \) 时,\( Z \) 被删失,不可观测。 - 因此,我们无法直接观测到 \( (Z, T) \) 的联合分布,只能观测到它们的删失版本。

第二步:讲最小内核

最简特例:假设 \( T \)\( Z \) 都是离散的,且取有限个值(例如 \( T \in \{1, 2\} \)\( Z \in \{1, 2\} \))。删失变量 \( C \) 是常数(例如 \( C = 3 \)),因此无删失(\( Y = T \)\( \Delta = 1 \))。但 \( Z \) 仍可能被 \( T \) 右删失(若 \( T < Z \),则 \( \tilde{Z} = T \)\( \Delta_Z = 0 \))。工具变量 \( V \) 是二值的(\( V \in \{0, 1\} \))。

核心问题:我们想估计 \( m(z) = \mathbb{E}[T \mid Z = z] \)。但由于 \( Z \) 是内生的,直接回归会得到有偏估计。工具变量 \( V \) 可用来纠正内生性。

识别思路:在离散设定下,识别条件可简化为一个线性方程组。假设 \( T \)\( Z \) 的联合分布由参数 \( p_{tz} = \mathbb{P}(T = t, Z = z) \) 决定。我们想估计 \( \mathbb{E}[T \mid Z = z] = \sum_t t \cdot p_{tz} / \sum_t p_{tz} \)。但 \( p_{tz} \) 不可直接观测,因为 \( Z \)\( T \) 右删失(即当 \( T < Z \) 时,我们观测不到 \( Z \) 的真实值,只能观测到 \( \tilde{Z} = T \))。

工具变量 \( V \) 的作用:假设 \( V \)\( Z \) 相关,且独立于 \( T \) 的误差项。在离散设定下,这等价于:\( \mathbb{P}(T = t \mid Z = z, V = v) = \mathbb{P}(T = t \mid Z = z) \)(即 \( V \) 不直接预测 \( T \) 给定 \( Z \))。利用这个条件,我们可以写出一个关于 \( p_{tz} \) 的线性方程组,其系数由可观测的 \( (Y, \tilde{Z}, V) \) 的分布决定。解这个方程组即可识别 \( p_{tz} \),进而得到 \( m(z) \)

为什么难:在连续设定下,这个线性方程组变成了一个积分方程(Fredholm 第一类积分方程)。解的存在性、唯一性、稳定性都需要仔细分析。本文的核心贡献就是给出了这个积分方程及其识别条件。

本文的关键想法:将识别问题转化为一个积分方程,然后利用工具变量的外生性证明该方程的解唯一(在适当条件下)。估计阶段则假设 \( m(z) \) 属于一个参数族(如线性或指数形式),从而将积分方程转化为一个可解的矩条件,再用 GMM 或类似方法估计参数。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在动态处理设定下,处理时间 \( Z \) 对持续时间 \( T \) 的因果效应,其中 \( Z \) 是内生的,\( T \) 被随机右删失,且 \( Z \)\( T \land C \) 右删失。
  2. 核心工具/方法:将回归函数 \( m(z) = \mathbb{E}[T \mid Z = z] \) 刻画为一个积分方程的解,利用工具变量 \( V \) 实现识别;估计阶段假设 \( m(z) \) 服从参数模型,提出基于矩条件的估计量。
  3. 主要结论:给出了识别条件(积分方程解的唯一性),证明了参数估计量的渐近正态性,并通过模拟和实际数据验证了方法。

关键设定与假设

完整设定(在第二节最小记号基础上补充): - 数据\( (Y_i, \Delta_i, \tilde{Z}_i, \Delta_{Z,i}, V_i) \)\( i = 1, \dots, n \),独立同分布。 - 模型:假设存在一个潜在结果 \( T(z) \),但实际观测到的 \( T = T(Z) \)。回归函数 \( m(z) = \mathbb{E}[T(z)] \) 是感兴趣的因果量。注意:这里假设 \( T(z) \) 的期望不依赖于 \( Z \) 的实现(即“一致性”假设),但 \( Z \)\( T \) 的误差项相关。 - 工具变量\( V \) 满足: - 相关性\( V \)\( Z \) 相关。 - 外生性\( V \) 独立于 \( T \) 的误差项(给定协变量后)。在本文中,这被形式化为:\( \mathbb{E}[T \mid Z, V] = \mathbb{E}[T \mid Z] \)(即 \( V \) 不直接预测 \( T \) 给定 \( Z \))。 - 排他性\( V \) 仅通过 \( Z \) 影响 \( T \)。这隐含在“\( V \) 独立于误差项”中。 - 删失\( C \) 独立于 \( (T, Z, V) \)(给定协变量后)。这是标准随机删失假设。 - 参数模型:假设 \( m(z) = m(z; \theta) \),其中 \( \theta \in \Theta \subset \mathbb{R}^d \) 是有限维参数。例如,\( m(z; \theta) = \theta_0 + \theta_1 z \)(线性)或 \( m(z; \theta) = \exp(\theta_0 + \theta_1 z) \)(指数)。

相比已有文献的强化/放宽: - 强化:相比 Abbring & van den Berg (2003),本文允许 \( Z \) 内生,因此需要 IV。 - 放宽:相比 Bijwaard (2014),本文允许 \( Z \) 被右删失,因此更贴近实际。 - 限制:本文假设 \( m(z) \) 是参数模型,而非完全非参数。这是为了简化估计与渐近理论。

主要结果

定理 1(识别):在假设 1-4 下,回归函数 \( m(z) \) 是以下积分方程的唯一解:

\[\mathbb{E}[T \mid V = v] = \int m(z) \, f_{Z \mid V}(z \mid v) \, dz,\]
其中 \( f_{Z \mid V} \)\( Z \) 给定 \( V \) 的条件密度。该方程的解存在且唯一,当且仅当 \( f_{Z \mid V} \) 满足一个“完备性”条件(即 \( \int g(z) f_{Z \mid V}(z \mid v) dz = 0 \) 对所有 \( v \) 成立蕴含 \( g = 0 \))。

  • 直觉:左边是可观测的 \( \mathbb{E}[T \mid V = v] \)(注意:这里 \( T \) 被删失,但作者假设删失机制已知或可估计,因此 \( \mathbb{E}[T \mid V = v] \) 可通过 Kaplan-Meier 估计或类似方法得到)。右边是 \( m(z) \) 关于条件密度 \( f_{Z \mid V} \) 的积分。这个方程将不可直接观测的 \( m(z) \) 与可观测量联系起来。
  • 必要条件\( f_{Z \mid V} \) 必须满足“完备性”条件,这类似于非参数 IV 中的“完备性”条件。作者指出,这等价于 \( V \)\( Z \) 有足够的“预测力”。
  • 解决的技术难点:处理删失数据下的积分方程。作者需要证明,即使 \( T \)\( Z \) 都被删失,上述方程仍然成立(通过适当的条件期望调整)。

定理 2(渐近正态性):在假设 1-6 下,参数估计量 \( \hat{\theta} \) 是渐近正态的:

\[\sqrt{n} (\hat{\theta} - \theta_0) \xrightarrow{d} N(0, \Sigma),\]
其中 \( \Sigma \) 是渐近协方差矩阵,其形式由影响函数给出。

  • 直觉:这是标准 M-估计或 GMM 估计的渐近理论。作者将积分方程转化为一个矩条件 \( \mathbb{E}[g(Y, \Delta, \tilde{Z}, \Delta_Z, V; \theta)] = 0 \),然后用样本矩代替总体矩,得到 \( \hat{\theta} \)
  • 必要条件:参数模型正确指定(即存在 \( \theta_0 \) 使得 \( m(z) = m(z; \theta_0) \)),以及一些正则条件(如矩条件可微、Fisher 信息矩阵非奇异等)。
  • 解决的技术难点:处理删失数据带来的额外复杂性。作者需要证明,即使 \( T \)\( Z \) 被删失,矩条件仍然可估计,且估计量是 \( \sqrt{n} \)-一致的。

证明路线与技术技巧

整体路线: 1. 识别:从工具变量的外生性出发,推导出积分方程 \( \mathbb{E}[T \mid V = v] = \int m(z) f_{Z \mid V}(z \mid v) dz \)。证明该方程的解唯一(在完备性条件下)。 2. 矩条件:将积分方程转化为一个矩条件。具体地,定义 \( \rho(Y, \Delta, \tilde{Z}, \Delta_Z, V; \theta) = \phi(V) (T - m(Z; \theta)) \),其中 \( \phi(V) \) 是工具变量的某个函数(如 \( V \) 本身或 \( V \) 的基函数)。则 \( \mathbb{E}[\rho] = 0 \) 当且仅当 \( \theta = \theta_0 \)。 3. 估计:用样本矩 \( \frac{1}{n} \sum_i \hat{\rho}_i \) 代替总体矩,其中 \( \hat{\rho}_i \)\( \rho_i \) 的估计(因为 \( T \)\( Z \) 被删失,需要用 Kaplan-Meier 估计或类似方法调整)。然后解 \( \frac{1}{n} \sum_i \hat{\rho}_i = 0 \) 得到 \( \hat{\theta} \)。 4. 渐近理论:证明 \( \hat{\theta} \)\( \sqrt{n} \)-一致且渐近正态的。这需要: - 证明 \( \frac{1}{\sqrt{n}} \sum_i \hat{\rho}_i \) 是渐近正态的(通过经验过程理论或 U-统计量展开)。 - 证明 \( \hat{\theta} \)\( \frac{1}{n} \sum_i \hat{\rho}_i \) 的连续函数(通过隐函数定理或 M-估计理论)。 - 处理删失带来的额外变异性(通过影响函数展开)。

关键跳跃点: - 积分方程的解的存在性与唯一性:这是最吃功夫的部分。作者需要证明,在删失数据下,积分方程仍然有解,且解唯一。这依赖于工具变量的“完备性”条件,以及删失机制的可逆性。 - 删失数据的矩条件估计:由于 \( T \)\( Z \) 被删失,我们不能直接计算 \( \rho_i \)。作者提出用 Kaplan-Meier 估计或逆概率加权(IPW)来调整。这需要证明调整后的矩条件仍然无偏,且其影响函数可计算。

技术技巧点名: - 积分方程理论:用于识别。作者将因果效应刻画为 Fredholm 第一类积分方程的解,并利用工具变量的完备性条件证明解的唯一性。 - Kaplan-Meier 估计:用于处理 \( T \) 的右删失。作者用 Kaplan-Meier 估计 \( \mathbb{E}[T \mid V = v] \) 的积分方程中的左边。 - 逆概率加权(IPW):用于处理 \( Z \) 的右删失。作者用 IPW 调整 \( \rho_i \) 中的 \( Z \) 项。 - M-估计理论:用于渐近正态性证明。作者将估计量视为 M-估计量,并验证其正则条件。 - 影响函数展开:用于推导渐近方差。作者将 \( \hat{\theta} \) 的影响函数展开为 \( \rho_i \) 的线性函数,从而得到 \( \Sigma \)

真实例子与应用

数据:来自一项关于“倦怠治疗(burnout therapy)时机对康复时长的影响”的研究。数据包含 1000 多名患者,记录了: - \( Z \):开始治疗的时间(从诊断到治疗开始的天数)。 - \( T \):康复时长(从治疗开始到康复的天数)。 - \( C \):删失时间(患者退出研究或研究结束的时间)。 - \( V \):工具变量——患者被分配到的治疗中心(不同中心有不同的治疗启动政策,但中心本身不直接影响康复时长)。

方法应用: 1. 假设 \( m(z) = \theta_0 + \theta_1 z \)(线性模型)。 2. 用 Kaplan-Meier 估计 \( \mathbb{E}[T \mid V = v] \)\( f_{Z \mid V}(z \mid v) \)。 3. 解积分方程得到 \( \hat{\theta} \)。 4. 计算标准误和置信区间。

结果: - \( \hat{\theta}_1 \) 为负(即更早开始治疗与更短的康复时长相关),但置信区间包含零(即效应不显著)。 - 与普通最小二乘(OLS)估计对比:OLS 估计 \( \hat{\theta}_1 \) 为正(即更早治疗与更长康复时长相关),这可能是由于内生性(更早治疗的患者病情更重)。IV 估计纠正了这种偏误。

这个例子想说明什么: - 验证理论:展示了 IV 估计在动态处理设定下的可行性。 - 展示相对 baseline 的优势:与 OLS 对比,IV 估计得到了相反的符号,说明内生性确实存在且 IV 方法有效。 - 实际意义:虽然结果不显著,但方向性结论(更早治疗可能有益)与临床直觉一致。

🔎 结论是否比证明窄

  • 窄结论 1:定理 1(识别)假设 \( f_{Z \mid V} \) 满足“完备性”条件,但作者未给出该条件的具体验证方法(例如,如何从数据中检验该条件?)。在应用中,这只是一个假设。
  • 窄结论 2:定理 2(渐近正态性)假设参数模型正确指定。若模型误指定,估计量可能不一致。作者在讨论中承认:“模型误指定是一个重要问题,但我们未处理。”
  • 窄结论 3:作者假设删失变量 \( C \) 独立于 \( (T, Z, V) \)。若删失机制依赖于 \( Z \)\( V \),则方法可能失效。作者未讨论这种更一般的删失设定。

四、开放问题

  1. 非参数估计:本文仅给出参数模型下的估计。能否将 \( m(z) \) 视为非参数函数,用 sieve 或核方法估计?这需要处理积分方程的非参数解,以及删失数据下的收敛速度。扎根点:作者在结论中写道:“非参数估计是未来工作的重要方向。”
  2. 模型误指定检验:如何检验参数模型 \( m(z; \theta) \) 是否正确指定?例如,能否构造一个基于积分方程残差的检验?扎根点:作者在讨论中承认:“模型误指定是一个重要问题。”
  3. 更一般的删失机制:若删失变量 \( C \) 依赖于 \( Z \)\( V \),本文的方法是否仍适用?可能需要引入额外的工具变量或假设。扎根点:作者假设 \( C \) 独立于 \( (T, Z, V) \),但未讨论更一般的设定。
  4. 多个工具变量:若存在多个工具变量,如何最优地组合它们?这类似于 GMM 中的最优权重选择。扎根点:作者仅考虑单个 IV,但提到“多个 IV 的扩展是直接的”。

提醒:要确认这些是否是真 gap,建议去读同子领域近期约 5 篇的 intro(如 Abbring 2012, Bijwaard 2014, 以及关于“动态处理效应中的非参数 IV”的文献)。若都指向同一个问题,则是共识(真 gap);若互相打架,则是机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论