跳转至

From Conditional Quantile Regression to Marginal Quantile Estimation with Applications to Missing Data and Causal Inference

作者: Huijuan Ma, Jing Qin, Yong Zhou
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 8/10
链接: https://doi.org/10.1080/07350015.2022.2140158


一、领域脉络与小综述

这个方向是什么

本方向研究在结果变量存在缺失(Missing At Random, MAR)的设定下,如何利用协变量信息来改进对边际分布(尤其是边际分位数和边际均值)的估计。核心问题是:当部分样本的Y不可观测时,如何利用可观测的协变量X和条件分布信息,构造出对边际目标量(如边际中位数、边际均值)的一致且高效的估计量。该方向处于“缺失数据下的半参数估计”与“分位数回归”的交汇处,成熟度较高,但作者指出一个明显的缺口:条件分位数回归与边际分位数估计之间缺乏一个直接的、系统性的桥梁。

发展脉络(history)

  1. 奠基工作:缺失数据下的均值估计与分位数回归的独立发展

    • Robins, Rotnitzky & Zhao (1994):提出了缺失数据下边际均值的双稳健估计量(DR estimator)。其核心思想是:只要倾向得分模型(缺失机制)或结果回归模型之一正确设定,估计量即一致。这是本领域最经典的框架之一,也是本文双稳健估计量的直接理论源头。
    • Koenker & Bassett (1978):奠定了分位数回归(Quantile Regression, QR)的基础,将条件分位数的建模从均值回归推广到整个分布。但该框架长期专注于条件分位数本身,而非将其积分得到边际分位数。
  2. 主要进展:从条件分布到边际分布的桥梁

    • Zhang (2003)Chen, Hong & Tarozzi (2008):这些工作开始探索如何利用条件分布信息来改进边际分布估计。Zhang (2003) 提出了基于条件均值的边际均值估计,而 Chen, Hong & Tarozzi (2008) 则关注于通过条件分布来估计边际分布函数。这些工作为“积分条件分布”这一思路提供了先例,但作者指出,它们并未专门处理分位数,尤其是没有建立条件分位数回归与边际分位数之间的直接联系。
  3. 当前 Frontier 与本文的位置

    • 本文的直接前驱:作者在引言中明确提到,他们的工作直接受到 Robins, Rotnitzky & Zhao (1994) 的双稳健思想启发,并试图将其从均值估计推广到分位数估计。同时,他们借鉴了 Zhang (2003)Chen, Hong & Tarozzi (2008) 中“积分条件分布”的思路,但将其具体化为“积分条件分位数函数”。
    • 本文的定位:作者将自己定位为填补“条件分位数回归”与“边际分位数估计”之间空白的工作。他们声称,尽管条件分位数回归已被广泛研究,但如何系统性地利用它来估计边际分位数(尤其是在缺失数据下)是一个未被充分探索的问题。本文提供了第一个直接的、双稳健的解决方案。

子线索聚类

  1. 缺失数据下的双稳健估计:以 Robins, Rotnitzky & Zhao (1994) 为核心,后续有大量工作(如 Tsiatis, 2006)将其推广到更复杂的模型和估计量。本文是这条线索在分位数估计上的一个自然延伸。
  2. 基于条件分布积分的方法:以 Zhang (2003)Chen, Hong & Tarozzi (2008) 为代表,他们通过积分条件均值或条件分布函数来估计边际量。本文将其具体化到条件分位数函数。
  3. 分位数回归的因果推断应用:分位数处理效应(QTE)是因果推断中的重要概念。本文在实证部分展示了其方法在估计平均处理效应(ATE)中的应用,这连接了分位数回归与更广泛的因果推断文献。

这个方向在追问的核心问题

  1. 如何构造一个对条件分位数模型和缺失机制模型都稳健的边际分位数估计量? 这是本文直接回答的问题。
  2. 该估计量是否可以达到半参数效率界? 本文证明了其双稳健估计量达到了半参数效率下界。
  3. 如何将这种方法推广到更复杂的缺失机制(如非随机缺失 MNAR)或更复杂的因果参数(如分位数处理效应 QTE)? 这是本文留下的开放问题。

⚠️ 作者的 framing

  • 作者的缺口描述:作者将缺口 frame 为“条件分位数回归与边际分位数估计之间缺乏一个直接的桥梁”。他们声称,尽管条件分位数回归很强大,但人们通常只关注条件分位数本身,而忽略了通过积分它们来获得边际分位数这一简单而有效的途径。这使得他们的工作看起来是“显然的下一步”。
  • 被淡化或回避的竞争路线:作者淡化了直接对边际分位数进行建模(如非参数分位数回归)或使用逆概率加权(IPW)估计量的路线。他们指出,IPW 估计量依赖于倾向得分的正确设定,而他们的第一种方法则完全不需要倾向得分。对于直接建模边际分位数的方法,他们可能认为在缺失数据下,利用条件信息更有效。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用关于分位数处理效应(QTE) 的经典文献,如 Firpo (2007) 的“无条件分位数回归”或 Chernozhukov & Hansen (2005) 的工具变量分位数处理效应。这些文献也试图估计边际或无条件分位数,但采用了不同的识别策略(如基于影响函数或工具变量)。这是一个值得研究者去查的张力点:本文的方法与这些已有的无条件分位数估计方法相比,在假设、效率和计算上有什么异同?

张力

未见明显对立引用。所有被引工作基本都沿着“利用条件信息改进边际估计”这一共识方向前进,只是具体目标(均值 vs. 分位数)和稳健性要求不同。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \( Y \):结果变量(随机变量),我们想估计其边际分布。
    • \( X \):协变量向量(随机变量),完全可观测。
    • \( \delta \):缺失指示符(随机变量)。\( \delta = 1 \) 表示 \( Y \) 可观测,\( \delta = 0 \) 表示 \( Y \) 缺失。
    • \( \pi(X) = P(\delta = 1 | X) \)倾向得分(propensity score),即给定 \( X \)\( Y \) 可观测的概率。这是一个需要建模的已知或未知函数
    • \( F_{Y|X}(y|x) \):给定 \( X=x \)\( Y \)条件分布函数
    • \( Q_{Y|X}(\tau|x) \):给定 \( X=x \)\( Y \)条件分位数函数,满足 \( F_{Y|X}(Q_{Y|X}(\tau|x)|x) = \tau \)
    • \( \mu = E[Y] \)边际均值(目标参数)。
    • \( q_\tau \)边际分位数(目标参数),满足 \( P(Y \le q_\tau) = \tau \)
    • \( \theta \):泛指待估参数,可以是 \( \mu \)\( q_\tau \)
    • \( n \):样本量。
  • 模型

    • 缺失机制:假设结果变量是随机缺失(Missing At Random, MAR)。这意味着给定协变量 \( X \)\( Y \) 的缺失与否与 \( Y \) 本身条件独立:\( \delta \perp Y \mid X \)。这是因果推断和缺失数据中最常用的可忽略性假设。
    • 数据生成:我们有一个独立同分布(i.i.d.)的样本 \( \{(X_i, \delta_i, \delta_i Y_i)\}_{i=1}^n \)。对于 \( \delta_i = 1 \) 的个体,我们观测到完整的 \( (X_i, Y_i) \);对于 \( \delta_i = 0 \) 的个体,我们只观测到 \( X_i \),而 \( Y_i \) 是缺失的。
    • 目标:在 MAR 假设下,利用观测数据一致地估计边际分位数 \( q_\tau \) 和边际均值 \( \mu \)
  • 可观测数据

    • 研究者实际能观测到的是:所有个体的协变量 \( X_i \),以及部分个体的结果变量 \( Y_i \)(当 \( \delta_i = 1 \) 时)。缺失的 \( Y_i \) 是不可观测的。
    • 想要但观测不到:我们真正想要的是所有个体的 \( Y_i \),以直接计算样本分位数或均值。由于缺失,我们只能通过假设(MAR)和模型(条件分位数、倾向得分)来“填补”或“加权”以恢复目标参数。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:假设我们想估计边际中位数 \( q_{0.5} \),并且我们有一个正确指定的条件中位数回归模型 \( Q_{Y|X}(0.5|x) = m(x; \beta) \),其中 \( \beta \) 是有限维参数。

最简特例下的核心思路

  1. 第一步:估计条件中位数。使用所有 \( \delta_i = 1 \) 的完整数据,通过分位数回归(例如,最小化绝对偏差)来估计条件中位数模型 \( m(x; \beta) \),得到 \( \hat{\beta} \)。这样,对于任意 \( x \),我们可以得到条件中位数的估计 \( \hat{Q}_{Y|X}(0.5|x) = m(x; \hat{\beta}) \)

  2. 第二步:积分掉协变量。边际中位数 \( q_{0.5} \) 和条件中位数 \( Q_{Y|X}(0.5|x) \) 之间是什么关系?一般来说,没有直接关系。边际中位数不是条件中位数的期望。例如,如果 \( X \) 是二值的,条件中位数在 \( X=0 \)\( X=1 \) 下可能分别是 0 和 10,但边际中位数可能是 5,这取决于 \( X \) 的分布。

  3. 核心洞察:利用条件分布函数。作者的关键想法是,不直接积分条件分位数,而是积分条件分布函数。对于任意一个候选的边际分位数 \( q \),我们有:

    \[F_Y(q) = P(Y \le q) = E[P(Y \le q | X)] = E[F_{Y|X}(q|X)]\]
    这个等式是恒成立的。因此,边际分位数 \( q_\tau \) 是方程 \( E[F_{Y|X}(q_\tau|X)] = \tau \) 的解。

  4. 最简估计量(第一种方法)

    • 首先,用完整数据估计条件分位数函数 \( \hat{F}_{Y|X}(y|x) \)(或等价地,估计所有 \( \tau \) 的条件分位数 \( \hat{Q}_{Y|X}(\tau|x) \))。
    • 然后,对于任意 \( q \),构造 \( \hat{F}_Y(q) = \frac{1}{n} \sum_{i=1}^n \hat{F}_{Y|X}(q|X_i) \)。这里,我们用经验分布 \( \frac{1}{n} \sum_{i=1}^n \) 来近似期望 \( E[\cdot] \),并用估计的 \( \hat{F}_{Y|X} \) 代替真实的 \( F_{Y|X} \)
    • 最后,边际分位数 \( q_\tau \) 的估计量 \( \hat{q}_\tau \) 就是方程 \( \hat{F}_Y(\hat{q}_\tau) = \tau \) 的解。

这个例子说明了什么? * 它展示了“积分条件分布”这一核心思想的简洁性。 * 它揭示了为什么不能直接积分条件分位数:因为条件分位数和边际分位数之间没有线性关系,而条件分布函数和边际分布函数之间却有。 * 它指出了第一种方法的弱点:它完全依赖于条件分位数模型的正确设定。如果 \( \hat{F}_{Y|X} \) 是错的,那么 \( \hat{F}_Y \)\( \hat{q}_\tau \) 都会不一致。

双稳健估计量的最小内核: 为了克服上述弱点,作者引入了双稳健估计量。其核心是构造一个估计方程,该方程在条件分位数模型或倾向得分模型之一正确时,其期望为零。这个估计方程基于 Robins, Rotnitzky & Zhao (1994) 的双稳健思想,但被巧妙地改写为适用于分位数估计的形式。具体来说,对于边际均值 \( \mu \),双稳健估计量是:

\[\hat{\mu}_{DR} = \frac{1}{n} \sum_{i=1}^n \left[ \frac{\delta_i Y_i}{\hat{\pi}(X_i)} + \left(1 - \frac{\delta_i}{\hat{\pi}(X_i)}\right) \hat{m}(X_i) \right]\]
其中 \( \hat{\pi}(X) \) 是估计的倾向得分,\( \hat{m}(X) \) 是估计的条件均值。本文的核心贡献之一就是将这种双稳健结构推广到分位数估计。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在结果变量随机缺失(MAR)的设定下,如何利用条件分位数回归来一致且高效地估计边际分位数和边际均值。
  2. 核心工具/方法:提出了两种新的估计量:一种仅依赖条件分位数模型的正确设定(无需倾向得分),另一种是双稳健估计量,只要条件分位数模型或缺失机制模型之一正确即一致,且达到半参数效率界。
  3. 主要结论:证明了两种估计量的相合性和渐近正态性,其中双稳健估计量达到了半参数效率下界。模拟和实证研究验证了方法的有效性。

关键设定与假设

  • 设定:在第二节最小记号的基础上,本文假设数据是独立同分布的,且缺失机制为 MAR。
  • 假设
    • 假设 1 (MAR)\( \delta \perp Y \mid X \)。这是核心识别假设。
    • 假设 2 (倾向得分模型):倾向得分 \( \pi(X) = P(\delta=1|X) \) 被参数化为一个已知函数形式 \( \pi(X; \gamma) \),例如 Logistic 回归。该模型可能被错误指定。
    • 假设 3 (条件分位数模型):条件分位数 \( Q_{Y|X}(\tau|X) \) 被参数化为一个已知函数形式 \( Q_{Y|X}(\tau|X; \beta(\tau)) \),例如线性分位数回归。该模型可能被错误指定。
    • 正则性条件:包括参数空间的紧致性、矩条件、以及估计方程的光滑性和可识别性等标准正则性条件,用于证明渐近性质。
  • 相比已有文献的强化/放宽:相比直接对边际分位数建模的方法,本文的假设更侧重于条件模型,这在 MAR 设定下是自然的。相比 IPW 估计量,本文的第一种方法完全不需要对倾向得分建模,这是一个显著的放宽。相比 Robins 等人的双稳健均值估计量,本文将其推广到了分位数,但代价是需要对条件分位数函数进行建模,这比条件均值建模更复杂。

主要结果

  • 定理 1 (第一种估计量的渐近性质)

    • 陈述:在条件分位数模型正确指定的假设下,第一种边际分位数估计量 \( \hat{q}_\tau^{(1)} \) 是相合且渐近正态的。
    • 直觉:由于条件分位数模型正确,\( \hat{F}_{Y|X} \)\( F_{Y|X} \) 的一致估计,因此 \( \hat{F}_Y \)\( F_Y \) 的一致估计,进而其分位数也是一致的。渐近正态性由 M-估计量的标准理论保证。
    • 必要条件:条件分位数模型必须正确指定。倾向得分模型可以完全错误或未指定。
    • 解决的技术难点:需要处理估计的条件分位数函数 \( \hat{F}_{Y|X} \) 的误差如何传播到最终的边际分位数估计量中。作者通过线性化(influence function expansion)技术解决了这个问题。
  • 定理 2 (双稳健估计量的渐近性质)

    • 陈述:双稳健边际分位数估计量 \( \hat{q}_\tau^{(2)} \) 是相合且渐近正态的,只要条件分位数模型或倾向得分模型之一正确指定。
    • 直觉:该估计量基于一个双稳健的估计方程。当其中一个模型正确时,该方程在真实参数处的期望为零,从而保证了估计量的一致性。
    • 必要条件:条件分位数模型或倾向得分模型至少有一个正确。
    • 解决的技术难点:构造一个适用于分位数估计的双稳健估计方程。作者借鉴了 Robins 等人的思想,但需要将其从均值估计(基于矩条件)推广到分位数估计(基于分位数条件)。他们通过定义一个“双稳健的”分布函数估计量来实现这一点。
  • 定理 3 (双稳健估计量的半参数效率)

    • 陈述:当两个模型都正确指定时,双稳健估计量 \( \hat{q}_\tau^{(2)} \) 的渐近方差达到了半参数效率下界。
    • 直觉:这意味着在 MAR 假设下,没有任何其他正则估计量可以比它更有效地估计边际分位数。这是该估计量的一个强有力性质。
    • 必要条件:两个模型都必须正确指定。
    • 解决的技术难点:计算半参数效率界本身就是一个技术挑战。作者需要推导出在 MAR 模型下,边际分位数的有效影响函数(efficient influence function),并证明他们的估计量的影响函数与之匹配。

证明路线与技术技巧

  • 整体路线

    1. 定义估计量:首先,明确定义两种估计量。第一种是“先估计条件分布,再积分,再求逆”的隐式定义。第二种是基于一个双稳健估计方程的显式定义。
    2. 线性化:将估计量表示为样本均值加上一个可忽略的余项。这是渐近分析的标准步骤。对于分位数估计量,这通常涉及 Bahadur 表示(Bahadur representation)。
    3. 影响函数展开:推导出每个估计量的影响函数。对于第一种估计量,影响函数依赖于条件分位数模型的“正确”设定。对于双稳健估计量,影响函数具有双稳健结构。
    4. 应用中心极限定理:一旦得到影响函数,就可以直接应用中心极限定理得到渐近正态性。
    5. 效率界计算:通过计算在 MAR 模型下的半参数效率界(即有效影响函数的方差),并与双稳健估计量的渐近方差进行比较,证明其达到了效率界。
  • 关键跳跃点

    • 构造双稳健估计方程:如何将 Robins 等人的双稳健均值估计方程推广到分位数?作者的关键技巧是构造一个“双稳健的”条件分布函数估计量 \( \tilde{F}_{Y|X}(y|x) \),然后将其积分得到边际分布函数。这个 \( \tilde{F}_{Y|X} \) 的设计使得最终的估计量具有双稳健性质。
    • 处理分位数估计的非光滑性:分位数估计量是估计方程 \( \hat{F}_Y(q) = \tau \) 的解,而 \( \hat{F}_Y(q) \) 作为 \( q \) 的函数是非光滑的(阶梯函数)。作者通过使用平滑的核函数或假设 \( F_Y \) 是光滑的来克服这个困难,从而应用标准的 M-估计量理论。
  • 技术技巧点名

    • M-估计量理论:用于证明估计量的相合性和渐近正态性。
    • Bahadur 表示:用于将分位数估计量线性化,得到其影响函数。
    • 影响函数展开:核心分析工具,用于推导渐近方差。
    • 半参数效率理论:用于计算效率界并证明估计量的最优性。
    • 双稳健估计的构造技巧:借鉴 Robins 等人的思想,但针对分位数进行了改造。

真实例子与应用

  • 使用的数据/场景:作者使用了 LaLonde (1986)国家支持工作示范(NSW) 数据集。这是一个经典的因果推断数据集,用于评估工作培训项目对收入的影响。
  • 如何应用
    • 设定:处理变量 \( T \) 为是否参与工作培训,结果变量 \( Y \) 为 1978 年的实际收入。协变量 \( X \) 包括年龄、教育、种族、婚姻状况、以及 1975 年的收入等。
    • 缺失数据视角:作者将因果推断问题转化为一个缺失数据问题。他们假设处理组(\( T=1 \))的结果是完全可观测的,而对照组(\( T=0 \))的结果是“缺失”的(因为我们无法同时观测到同一个体在两种状态下的结果)。这实际上是因果推断中“反事实缺失”的标准视角。
    • 目标:估计平均处理效应(ATE),即 \( E[Y(1) - Y(0)] \),其中 \( Y(1) \)\( Y(0) \) 是潜在结果。作者通过估计处理组和对照组的边际均值(或分位数)来得到 ATE。
    • 方法应用:他们分别对处理组和对照组应用本文提出的两种边际均值/分位数估计量。对于对照组,\( \delta \) 被定义为“是否属于处理组”(即 \( \delta = T \)),因为只有处理组的结果是可观测的。协变量 \( X \) 用于建模倾向得分(即参与培训的概率)和条件结果分布。
  • 得到的结果
    • 作者报告了基于不同方法(包括简单的均值差、IPW、以及本文的两种方法)估计的 ATE。
    • 结果显示,本文提出的方法(尤其是双稳健方法)估计的 ATE 与已有文献中的结果一致,并且标准误更小(更高效)。
    • 他们还估计了处理效应的分位数,展示了培训项目对不同收入水平人群的异质性影响。
  • 这个例子想说明什么
    • 验证理论:展示了本文方法在实际数据中的可行性。
    • 展示优势:通过与简单方法(如均值差)和 IPW 方法对比,展示了本文方法在效率上的潜在优势,以及双稳健方法对模型错误指定的鲁棒性。
    • 连接因果推断:明确地将本文的缺失数据方法定位为因果推断的工具,展示了其在估计 ATE 和处理效应分位数上的应用价值。

🔎 结论是否比证明窄

  • 窄结论:本文的理论证明严格依赖于参数模型的假设(即条件分位数和倾向得分都被参数化为有限维模型)。作者在证明中使用了参数 M-估计量的标准理论。
  • 泛化 claim:作者在引言和结论中,将方法描述为一种通用的“桥梁”,并暗示其可以推广到非参数或半参数设定。例如,他们提到“可以通过非参数方法估计条件分位数”。然而,论文中并没有提供任何在非参数设定下的理论证明(如收敛速度、效率界等)。这是一个典型的“结论比证明宽”的情况。
  • 具体语句:作者在引言中说:“Our methods can be extended to nonparametric or semiparametric settings.” 但在理论部分,所有定理都是在参数模型下证明的。因此,非参数推广的结论是一个猜想,而非一个已被证明的结果。

四、开放问题

  1. 非参数/半参数推广的理论证明:本文的理论证明严格限于参数模型。一个直接的开放问题是:当条件分位数和/或倾向得分用非参数方法(如核平滑、级数估计)估计时,本文提出的估计量是否仍然一致、渐近正态,并且达到半参数效率界?这需要一套完全不同的理论工具(如经验过程理论)。扎根点:引言中“extended to nonparametric or semiparametric settings”的声明,以及定理证明中对参数模型的依赖。

  2. 高维协变量下的表现:当协变量 \( X \) 的维数 \( p \) 很大(甚至 \( p > n \))时,本文的参数分位数回归和倾向得分模型将面临“维数灾难”或不可识别的问题。一个开放问题是:如何将本文的方法与高维统计工具(如 Lasso、惩罚分位数回归)结合,并推导出相应的收敛速度和效率界?扎根点:本文所有模拟和实证中 \( p \) 都很小,且理论假设参数空间是固定维度的。

  3. 与非随机缺失(MNAR)的兼容性:本文的核心假设是 MAR。一个更困难但更现实的设定是结果变量非随机缺失(MNAR),即缺失机制还依赖于 \( Y \) 本身(即使控制了 \( X \))。如何将本文的框架扩展到 MNAR 设定?这可能需要对缺失机制施加额外的结构假设(如工具变量或影子变量)。扎根点:引言中明确假设了 MAR,并在结论中将其列为未来工作。

  4. 与无条件分位数回归(UQR)方法的比较:本文没有与 Firpo (2007) 的“无条件分位数回归”进行比较。UQR 通过“再中心化影响函数”(RIF)回归直接估计边际分位数,也是一种流行的方法。一个开放问题是:在 MAR 设定下,本文的方法与基于 RIF 的 UQR 方法相比,在假设、效率和计算上有什么异同?哪种方法在什么情况下更优?扎根点:引言中未引用 UQR 文献,这是一个值得研究者去查的张力点。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论