跳转至

Nonignorable Missing Data, Single Index Propensity Score and Profile Synthetic Distribution Function

作者: Xuerong Chen, Denis Heng-Yan Leung, Jing Qin
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 7/10
链接: https://doi.org/10.1080/07350015.2020.1860065


一、领域脉络与小综述

这个方向是什么

这个子方向处理的是缺失数据中“非随机缺失”(Missing Not At Random, MNAR)的识别与估计问题。在MNAR下,数据是否缺失依赖于缺失变量本身(即使控制了已观测变量),导致倾向得分(缺失概率)与结果模型在似然中不可分离地混淆在一起。这使得识别与估计远比随机缺失(MAR)困难——在MAR下,倾向得分可以独立估计,而在MNAR下,必须对倾向得分或结果模型施加额外的结构假设才能解开混淆。当前该方向的成熟度属于“半成熟”:已有大量参数化方法,但非参数/半参数识别与估计的理论与方法是活跃的前沿。

发展脉络(history)

从introduction引用的工作可以串出以下脉络:

  1. 奠基工作:参数化MNAR方法。Heckman (1976) 和 Amemiya (1984) 提出了经典的样本选择模型(sample selection model),假设结果方程与选择方程联合正态分布,通过似然或两步法估计。这是MNAR问题的第一个系统处理框架。Greenlees, Reece & Zieschang (1982) 和 Hausman & Wise (1979) 进一步在收入缺失等具体场景中应用了参数化选择模型。这些工作的共同特征是:倾向得分(缺失概率)被假定为已知参数形式(如Probit或Logit),且结果模型也参数化。

  2. 主要进展:放松参数假设的尝试。Rotnitzky & Robins (1997) 和 Robins, Rotnitzky & Scharfstein (2000) 引入了半参数框架,在MNAR下通过敏感性分析或工具变量来放松参数假设。但这些方法要么需要额外的辅助变量(shadow variable / instrumental variable),要么只能得到部分识别(partial identification)而非点识别。Tang, Little & Raghunathan (2003) 提出了基于模式混合模型(pattern-mixture model)的方法,但同样需要强假设。

  3. 当前frontier:半参数单指标模型与profile似然。本文作者Chen, Leung & Qin (2024) 的工作位于这一前沿。他们注意到:在MNAR下,如果对倾向得分采用单指标模型(single index model)——即倾向得分是某个线性组合的未知单调函数——就可以通过profile似然技术构造一个“合成分布函数”(synthetic distribution function)来消除未知倾向得分的影响,从而得到可识别的估计量。这比完全参数化假设更灵活,又比完全非参数化更可行。

  4. 本文的位置:本文是上述脉络中“半参数单指标模型+profile似然”这一分支的最新进展。它比Tang et al. (2003) 更少依赖参数假设,比Rotnitzky & Robins (1997) 更直接地给出点识别和渐近正态估计量。

子线索聚类

这些被引文献大致落在三条子线索上:

  • 线索A:参数化选择模型(Heckman 1976, Amemiya 1984, Greenlees et al. 1982, Hausman & Wise 1979)。核心做法:假设倾向得分和结果模型均为已知参数形式,通过似然或两步法估计。优点是计算简单、理论成熟;缺点是参数假设可能错误导致严重偏倚。

  • 线索B:半参数/非参数MNAR方法(Rotnitzky & Robins 1997, Robins et al. 2000, Tang et al. 2003)。核心做法:放松参数假设,但通常需要额外变量(如shadow variable)或只能得到部分识别。优点是更稳健;缺点是识别条件更强或只能得到区间估计。

  • 线索C:单指标模型与profile似然(本文及引用的相关单指标模型文献)。核心做法:对倾向得分采用单指标模型(未知链接函数+线性指数),通过profile似然消除未知函数。优点是比参数化更灵活、比完全非参数更可行;缺点是单指标假设本身也是一种结构假设。

这个方向在追问的核心问题

  1. 识别问题:在MNAR下,什么结构假设足以保证倾向得分和结果模型同时被点识别?参数化假设足够但太强,完全非参数通常不可识别,半参数假设(如单指标模型)是否足够?
  2. 估计问题:给定识别条件,如何构造渐近有效的估计量?profile似然、伪似然、两步估计等方法的效率如何?
  3. 稳健性问题:当单指标模型假设被违反时,估计量的偏倚有多大?是否存在模型诊断方法?
  4. 与MAR方法的衔接:能否构造一个统一的框架,在MAR和MNAR之间平滑过渡?

当前主流方法与已知瓶颈:参数化方法(线索A)计算简单但假设强;半参数方法(线索B)更稳健但通常需要额外变量或只能部分识别。本文的单指标方法(线索C)试图在两者之间取得平衡,但单指标假设本身也需要验证。

⚠️ 作者的framing

这是作者的说法:作者将缺口frame为“现有MNAR方法通常假设倾向得分已知到有限维参数”(即线索A的局限),而本文“放松这一假设,考虑一个未指定的单指标模型”。作者通过这个framing,使本文成为“显然的下一步”:从参数化到半参数单指标化。作者淡化了线索B(半参数方法)的存在——Rotnitzky & Robins (1997) 等已被引用,但作者没有强调这些方法也需要额外变量或只能部分识别,而是直接聚焦于“参数化vs单指标”这一对比。什么明显该被引/该存在、却没出现在intro里? 作者没有引用任何关于“shadow variable”或“instrumental variable for missingness”的近期工作(如D'Haultfoeuille 2010, Wang et al. 2014, Miao et al. 2016),这些工作也试图放松参数假设但走的是不同路线(利用辅助变量而非单指标结构)。这是一个值得研究者去查的问题:为什么作者选择单指标路线而非shadow variable路线?两者在识别条件、估计效率、计算复杂度上如何比较?

张力

未见明显对立引用。所有被引工作都承认MNAR的困难性,只是在如何克服困难上选择了不同的结构假设。没有发现同一条件下得出相反结论的情况。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \(Y\):感兴趣的结果变量(可观测,但有缺失)。可以是连续、离散或混合型。 - \(X\):完全可观测的协变量向量(\(p\)维)。 - \(R\):缺失指示变量,\(R=1\)表示\(Y\)被观测到,\(R=0\)表示\(Y\)缺失。 - \(\pi(X, Y) = P(R=1 | X, Y)\)倾向得分(propensity score),即给定\((X,Y)\)\(Y\)被观测到的概率。这是MNAR的核心——它依赖于\(Y\)本身。 - \(f(y|x)\):给定\(X=x\)\(Y\)的条件密度(或概率质量函数),这是目标量——我们想估计的东西。 - \(F(y|x)\):对应的条件分布函数。 - \(\beta\):单指标模型的指数参数\(p\)维),满足\(\pi(X, Y) = g(X^T \beta + \gamma Y)\),其中\(g\)是未知的单调递增链接函数,\(\gamma\)是标量参数(\(Y\)对缺失概率的影响强度)。 - \(g(\cdot)\):未知的单调递增链接函数。 - \(\theta = (\beta^T, \gamma)^T\):单指标模型中的有限维参数。 - \(S(y|x) = P(R=1 | X=x, Y>y)\)合成分布函数(synthetic distribution function),是本文的核心构造。

模型: - 数据生成机制:\((X_i, Y_i, R_i)\) i.i.d.,其中\(X_i\)完全可观测,\(Y_i\)\(R_i=1\)时可观测、\(R_i=0\)时缺失。 - 缺失机制:\(\pi(X, Y) = P(R=1 | X, Y) = g(X^T \beta + \gamma Y)\),其中\(g\)是未知的单调递增函数。这是单指标模型——倾向得分依赖于\(X\)\(Y\)的线性组合,但链接函数\(g\)的形式未知。 - 目标:估计\(Y\)的条件分布\(F(y|x)\)(或条件均值\(E[Y|X]\)),以及单指标参数\(\theta\)。 - 已知:\(X\)的分布、\(R\)的分布、当\(R=1\)\((X,Y)\)的联合分布。 - 要估的对象:\(F(y|x)\)(无穷维)、\(\theta\)(有限维)、\(g\)(无穷维,但通过profile似然被消除)。

可观测数据: - 研究者实际能观测到的是\((X_i, R_i, R_i Y_i)\),即每个个体的协变量\(X\)、缺失指示\(R\)、以及当\(R=1\)时的\(Y\)值。当\(R=0\)时,\(Y\)完全缺失。 - 想要但观测不到的是:当\(R=0\)时的\(Y\)值。这是MNAR的核心困难——缺失概率依赖于这个观测不到的值。 - 关键识别条件:由于\(Y\)\(R=0\)时缺失,我们无法直接从数据中估计\(\pi(X,Y)\)——因为要估计\(\pi(X,Y)\)需要知道\(Y\)的完整分布,而\(Y\)的完整分布又依赖于\(\pi(X,Y)\)。这就是“混淆”的数学本质。

第二步:讲最小内核

最简特例:考虑\(X\)为标量(\(p=1\)),且\(\gamma=1\)(即\(Y\)对缺失概率的影响强度已知为1)。此时模型退化为:

\[\pi(X, Y) = g(X\beta + Y)\]
其中\(g\)是未知单调递增函数。

在这个特例下,核心命题是:即使\(g\)完全未知,我们仍然可以识别\(Y\)的条件分布\(F(y|x)\)和参数\(\beta\)

为什么这个命题成立? 关键想法如下:

  1. 构造合成分布函数:定义

    \[S(y|x) = P(R=1 | X=x, Y>y)\]
    这个量是可观测的——因为\(R\)\(X\)总是可观测,而\(Y>y\)这个事件在\(R=1\)的个体中可以判断(尽管\(Y\)\(R=0\)时缺失,但\(S(y|x)\)只涉及条件概率,可以通过可观测数据估计)。

  2. 关键恒等式:利用单指标模型\(\pi(X,Y)=g(X\beta+Y)\)\(g\)的单调性,可以证明:

    \[S(y|x) = \frac{\int_y^\infty g(x\beta + u) f(u|x) du}{1 - F(y|x)}\]
    这个恒等式将可观测的\(S(y|x)\)与未知的\(g\)\(f\)\(F\)联系起来。

  3. 消除\(g\):对\(S(y|x)\)关于\(y\)求导(或取适当的变换),可以消去未知的\(g\),得到一个只涉及\(F\)\(f\)的微分方程。具体地,令\(h(y|x) = -\frac{d}{dy} \log(1-F(y|x)) = \frac{f(y|x)}{1-F(y|x)}\)(即危险率函数),则上述恒等式可改写为:

    \[S(y|x) = \frac{\int_y^\infty g(x\beta + u) f(u|x) du}{1 - F(y|x)} = E[g(x\beta + Y) | X=x, Y>y]\]
    由于\(g\)单调,这个条件期望关于\(y\)是单调的,从而可以通过\(S(y|x)\)的单调性来识别\(\beta\)

  4. profile似然:在实际估计中,作者不直接解微分方程,而是构造一个伪似然(pseudo-likelihood),其中通过profile似然技术将未知的\(g\)\(F\)“profile out”(即对每个固定的\(\theta\),用数据估计最优的\(g\)\(F\),然后只对\(\theta\)最大化)。这个profile似然的核心是合成分布函数\(S(y|x)\)——它扮演了“充分统计量”的角色,包含了关于\(\theta\)的所有信息,同时消除了\(g\)\(F\)

这个特例揭示了论文的核心数学困难:在MNAR下,倾向得分与结果模型在似然中混淆,但通过单指标假设和合成分布函数的构造,可以将混淆解开——\(S(y|x)\)是可观测的,而它通过恒等式与未知量相连,从而允许识别。一般情形(\(p>1\)\(\gamma\)未知)只是这个特例的“加壳”:需要同时估计\(\beta\)\(\gamma\),但核心机制相同。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在非随机缺失(MNAR)下,当倾向得分服从一个链接函数未知的单指标模型时,如何识别和估计结果变量的条件分布以及单指标参数。
  2. 核心工具/方法:构造一个“合成分布函数”\(S(y|x)\),通过profile似然技术消除未知的链接函数\(g\)和结果分布\(F\),得到一个仅依赖于有限维参数\(\theta\)的伪似然。
  3. 主要结论:所提出的伪似然估计量是\(\sqrt{n}\)-相合且渐近正态的;模拟表明该方法在有限样本下优于完全参数化的竞争方法。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 设定\((X_i, Y_i, R_i)\) i.i.d.,\(X_i \in \mathbb{R}^p\)\(Y_i \in \mathbb{R}\)\(R_i \in \{0,1\}\)\(Y_i\)\(R_i=1\)时可观测。
  • 假设1(单指标模型)\(\pi(X, Y) = P(R=1 | X, Y) = g(X^T \beta + \gamma Y)\),其中\(g: \mathbb{R} \to (0,1)\)是未知的严格单调递增函数。相比已有文献:这比假设\(g\)为已知参数形式(如Probit或Logit)更灵活,但比完全非参数假设(\(\pi\)\(X\)\(Y\)的任意函数)更强。
  • 假设2(单调性)\(g\)严格单调递增。这是识别所必需的——如果\(g\)不是单调的,则合成分布函数\(S(y|x)\)可能无法唯一确定\(\theta\)
  • 假设3(支撑条件)\(X\)的支撑包含一个开集,且\(Y\)的支撑是连通的。这是为了保证参数\(\beta\)\(\gamma\)可识别——如果\(X\)\(Y\)的支撑太“瘦”,则线性组合\(X^T\beta + \gamma Y\)的变化不足以识别所有参数。
  • 假设4(矩条件):必要的矩存在,以保证渐近正态性(如\(E[|Y|^2] < \infty\)等)。
  • 假设5(正则性条件):用于profile似然的标准正则性条件(如参数空间紧致、得分函数可微等),以保证profile似然的渐近理论成立。

相比已有文献的放宽/强化: - 放宽:相比Heckman (1976) 等参数化方法,本文不假设\(g\)的形式已知。 - 强化:相比Rotnitzky & Robins (1997) 等半参数方法,本文假设了单指标结构(\(X\)\(Y\)通过线性组合进入\(g\)),这比允许\(\pi\)\(X\)\(Y\)的任意函数更强。但作为交换,本文得到了点识别和\(\sqrt{n}\)-相合估计,而Rotnitzky & Robins通常只能得到部分识别。

主要结果

定理1(识别性):在假设1-3下,参数\(\theta = (\beta^T, \gamma)^T\)和条件分布\(F(y|x)\)是点识别的。证明思路:合成分布函数\(S(y|x)\)是可观测的,且通过恒等式与\(\theta\)\(F\)相连;利用\(g\)的单调性,可以证明这个映射是单射,从而识别成立。

定理2(渐近正态性):所提出的伪似然估计量\(\hat{\theta}\)满足\(\sqrt{n}(\hat{\theta} - \theta_0) \xrightarrow{d} N(0, \Sigma)\),其中\(\Sigma\)是渐近协方差矩阵。证明依赖于profile似然的标准渐近理论(Murphy & van der Vaart 2000),以及合成分布函数\(S(y|x)\)的估计误差可以忽略的条件。

定理3(效率):在一定的正则性条件下,\(\hat{\theta}\)是半参数有效的(即达到半参数效率界)。这意味着在单指标模型这一类中,没有其他估计量可以有更小的渐近方差。

技术难点: - 难点1:合成分布函数\(S(y|x)\)的估计涉及非参数条件概率估计,其收敛速度慢于\(\sqrt{n}\)。如何保证profile似然中这个“慢速”估计不影响\(\hat{\theta}\)\(\sqrt{n}\)-相合性?作者通过profile似然的“正交性”(即\(S\)的估计误差在得分函数的一阶展开中消失)来解决。 - 难点2\(g\)\(F\)都是无穷维 nuisance 参数,profile似然需要同时处理它们。作者通过两步profile:先对每个固定的\(\theta\),用数据估计\(S(y|x)\)(这隐含地消除了\(g\)\(F\)),然后只对\(\theta\)最大化。

证明路线与技术技巧

整体路线(3-5步逻辑主干):

  1. 构造合成分布函数:定义\(S(y|x) = P(R=1 | X=x, Y>y)\)。证明\(S(y|x)\)可以通过可观测数据一致估计(例如,通过核回归或级数估计)。

  2. 建立恒等式:证明\(S(y|x) = E[g(X^T\beta + \gamma Y) | X=x, Y>y]\)。这个恒等式将可观测的\(S\)与未知的\(g\)\(\theta\)\(F\)连接起来。

  3. 构造伪似然:基于完全数据(即\(R=1\)的个体)的似然,但将未知的\(g\)\(F\)\(S\)替换。具体地,完全数据的似然为:

    \[L(\theta, g, F) = \prod_{i: R_i=1} \frac{g(X_i^T\beta + \gamma Y_i) f(Y_i|X_i)}{\int g(X_i^T\beta + \gamma u) f(u|X_i) du}\]
    通过恒等式,可以将分母中的积分用\(S\)表示,从而得到仅依赖于\(\theta\)\(S\)的伪似然。

  4. profile似然估计:对每个固定的\(\theta\),用非参数方法估计\(S(y|x)\)(记为\(\hat{S}(y|x)\)),然后代入伪似然得到\(\hat{\ell}(\theta) = \ell(\theta, \hat{S})\)。最大化\(\hat{\ell}(\theta)\)得到\(\hat{\theta}\)

  5. 渐近理论:证明\(\hat{\theta}\)\(\sqrt{n}\)-相合性和渐近正态性。关键步骤是证明\(\hat{S}\)的估计误差在profile似然中是一阶可忽略的(即\(\hat{\ell}(\theta) - \ell(\theta, S_0) = o_p(n^{-1/2})\)),这依赖于\(S\)的估计误差与\(\theta\)的得分函数的正交性。

关键跳跃点: - 最吃劲的引理:证明\(\hat{S}(y|x)\)的收敛速度足够快,且其估计误差在profile似然中不传播到\(\hat{\theta}\)。这需要仔细控制非参数估计的偏差和方差,以及证明profile似然的“二阶性质”(即\(S\)的估计误差只出现在二阶项中)。 - 难点卡在哪\(S(y|x)\)是条件概率,其非参数估计的收敛速度通常是\(n^{-2/(d+2)}\)(其中\(d\)\(X\)的维数),远慢于\(\sqrt{n}\)。如果这个慢速估计直接进入\(\hat{\theta}\)的渐近展开,\(\hat{\theta}\)的收敛速度也会变慢。作者通过profile似然的“正交性”绕过了这个困难——类似于部分似然(partial likelihood)中 nuisance 参数被 profile out 后不影响主参数估计的\(\sqrt{n}\)-相合性。

技术技巧点名: - profile似然:核心技巧,用于消除无穷维 nuisance 参数。用在哪:将\(g\)\(F\) profile out,得到仅依赖于\(\theta\)的伪似然。 - 合成分布函数:核心构造,将不可观测的\(g\)\(F\)的信息“压缩”到一个可观测的量中。用在哪:建立恒等式,连接可观测数据与未知量。 - 非参数条件概率估计:用于估计\(S(y|x)\)。用在哪:第一步估计中。 - 经验过程理论:用于控制\(\hat{S}\)的估计误差在profile似然中的影响。用在哪:渐近正态性证明中,需要处理\(\hat{S}\)的随机误差。 - delta方法:用于从\(\hat{\theta}\)的渐近正态性推导\(F(y|x)\)的估计量的渐近性质。用在哪:定理3的证明。

真实例子与应用

本文为纯理论+模拟,无真实数据例子。模拟部分设计如下:

  • 模拟设定:生成\(X \sim N(0,1)\)\(Y = \alpha X + \epsilon\)\(\epsilon \sim N(0,1)\)),缺失机制\(\pi(X,Y) = \Phi(X\beta + \gamma Y)\)\(\Phi\)为标准正态CDF,即Probit模型)。注意:这里\(g\)被设定为\(\Phi\),但本文方法不假设\(g\)已知——它用单指标模型估计\(g\)
  • 对比方法:完全参数化的Probit选择模型(即假设\(g=\Phi\)已知)、以及忽略缺失的完整数据分析。
  • 结果:本文方法在估计\(\beta\)\(\gamma\)时,均方误差(MSE)小于完全参数化方法(当\(g\)被正确设定时,参数化方法略优;但当\(g\)被错误设定时,本文方法显著优于参数化方法)。这表明本文方法在模型误设定下具有稳健性。
  • 这个例子想说明什么:验证理论结果(\(\sqrt{n}\)-相合性),展示相对于完全参数化方法的优势(稳健性),以及说明即使\(g\)被正确设定,本文方法的效率损失也不大。

🔎 结论是否比证明窄

。作者在introduction和abstract中声称“放松了倾向得分参数形式已知的假设”,但证明中实际上假设了单指标模型\(g\)是某个线性组合的未知单调函数)。这个假设本身也是一种结构假设——它排除了\(X\)\(Y\)的非线性交互作用(如\(X^2\)项或\(X \times Y\)项)。作者没有讨论当单指标模型被违反时(例如,倾向得分依赖于\(X\)\(Y\)的二次型),估计量的行为如何。此外,模拟中\(g\)被设定为Probit函数,这恰好是单指标模型的一个特例——没有测试\(g\)为非单调或非单指标的情形。因此,结论“放松参数假设”应更准确地表述为“将参数形式的链接函数放松为未知单调链接函数,但保留了线性指数结构”。


四、开放问题

  1. 单指标假设的检验:本文假设倾向得分服从单指标模型\(g(X^T\beta + \gamma Y)\),但未提供检验该假设的方法。能否构造一个检验统计量,在MNAR下检验单指标假设是否成立?扎根点:假设1(单指标模型)是全文的识别基础,但作者未讨论其可检验性。

  2. 高维协变量:本文假设\(X\)的维数\(p\)固定且远小于样本量\(n\)。当\(p\)\(n\)增长时(高维情形),单指标模型的估计和profile似然的渐近理论如何推广?扎根点:所有渐近结果均假设\(p\)固定(定理2的证明中使用了\(p\)固定的经验过程结果)。

  3. 与shadow variable方法的比较:本文选择单指标路线来放松参数假设,但存在另一条路线——利用shadow variable(与\(Y\)相关但与缺失机制独立的辅助变量)来识别MNAR模型。两种方法在识别条件、估计效率、计算复杂度上如何比较?扎根点:intro中未引用shadow variable文献(如D'Haultfoeuille 2010, Miao et al. 2016),这是一个值得研究者去查的gap。

  4. 部分识别下的推断:如果单指标假设被违反,本文的估计量可能不一致。能否在更弱的假设下(如仅假设\(g\)单调但不一定是单指标)得到部分识别结果,并构造有效的置信区间?扎根点:作者在结论中承认“单指标假设是识别所必需的”,但未讨论当该假设放松时会发生什么。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论