跳转至

Mediation Analysis with the Mediator and Outcome Missing Not at Random

作者: Shuozhi Zuo, Debashis Ghosh, Peng Ding, Fan Yang
来源: Journal of the American Statistical Association
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本文研究的核心问题是:在中介分析(Mediation Analysis)中,当中介变量(Mediator, M)结局变量(Outcome, Y) 同时存在非随机缺失(Missing Not At Random, MNAR) 时,如何识别和估计直接效应(Natural Direct Effect, NDE)和间接效应(Natural Indirect Effect, NIE)。这是一个将缺失数据理论因果中介分析交叉的识别与推断问题。当前该子方向的成熟度较低——大多数中介分析文献假设数据完全观测或缺失随机(MAR),而处理MNAR的工作极少,且通常只处理单一变量(仅M或仅Y)的MNAR,而非两者同时MNAR。

发展脉络(history)

根据论文的introduction和参考文献,该领域的发展脉络可以梳理如下:

  1. 奠基工作:标准中介分析的识别与估计

    • Pearl (2001)Robins & Greenland (1992) 奠定了基于反事实(counterfactual)的中介分析框架,提出了NDE和NIE的定义。其核心识别条件是序贯可忽略性(Sequential Ignorability):给定处理变量(Treatment, A)和基线协变量(C),(i) 处理A相对于潜在中介和潜在结局是随机的;(ii) 中介M相对于潜在结局是随机的,给定A和C。这是所有后续工作的基准。
    • Imai, Keele & Tingley (2010) 等进一步发展了基于模型的估计方法(如线性结构方程模型)和敏感性分析,使中介分析在实证研究中广泛应用。
  2. 主要进展:处理缺失数据的中介分析

    • 处理MAR下的缺失:大量工作(如 Zhang & Wang (2013)Valente et al. (2017))研究了在MAR假设下,使用多重插补(MI)或极大似然(ML)来处理M和Y的缺失。这些方法假设缺失与否仅依赖于已观测到的变量(如A, C, 或部分观测的M, Y)。
    • 处理单一变量MNAR:少数工作开始放松MAR假设。例如,Wang, Shao & Kim (2014)Zhao & Shao (2015) 研究了在工具变量(IV)或影子变量(Shadow Variable)假设下,处理单一结局变量Y的MNAR问题。这些工作为本文处理M和Y同时MNAR提供了关键的技术工具(如影子变量法)。
  3. 当前Frontier:处理M和Y同时MNAR

    • 本文(Zuo et al., 2023)是第一个系统性地研究M和Y同时MNAR下中介效应识别与估计的工作。作者指出,当M和Y都MNAR时,问题变得极其复杂,因为缺失机制可能相互依赖,且都与未观测的M和Y本身相关。作者将此前用于单一变量MNAR的识别策略(如IV、影子变量)推广到中介分析的双变量MNAR场景。

子线索聚类

这些被引文献大致落在以下三条子线索上:

  • 线索一:标准中介分析的识别与敏感性分析。 这一簇工作(Pearl, Robins, Imai等)建立了中介分析的理论基础,定义了目标参数(NDE, NIE),并给出了在完全数据或MAR假设下的识别条件。它们是本文的基准问题来源
  • 线索二:缺失数据理论,特别是MNAR下的识别。 这一簇工作(Wang, Shao, Kim, Zhao等)研究了一般统计模型中,当响应变量(Y)或协变量(X)MNAR时的识别问题。它们提出了影子变量(与缺失机制相关但与缺失变量本身条件独立)和工具变量(与缺失机制相关但与缺失变量本身无关)等关键概念。本文直接借用了这些概念。
  • 线索三:中介分析中的缺失数据处理。 这一簇工作(Zhang, Wang, Valente等)主要关注MAR假设下的M和Y缺失,使用MI或ML方法。本文的直接竞争路线是这些MAR方法——作者试图证明,当MAR不成立时,这些方法会产生严重偏倚,而本文提出的MNAR方法能纠正该偏倚。

这个方向在追问的核心问题

  1. 识别问题:在M和Y同时MNAR时,NDE和NIE是否可识别?需要什么样的额外假设(如影子变量、工具变量、或对缺失机制的参数形式假设)?
  2. 估计问题:在识别的基础上,如何构造一致且渐近正态的估计量?是使用矩估计、极大似然还是半参数方法?
  3. 效率问题:在给定的识别假设下,NDE和NIE的半参数效率界是什么?是否存在一个达到该效率界的估计量?
  4. 敏感性分析:当关键的MNAR假设(如影子变量的存在性)被违反时,估计结果有多稳健?

⚠️ 作者的Framing

  • 作者的缺口Frame:作者将缺口frame为“现有中介分析文献几乎都假设数据完全观测或MAR,但现实中M和Y的缺失往往与未观测因素相关(MNAR)。虽然已有处理单一变量MNAR的工作,但M和Y同时MNAR的识别问题尚未被研究。” 这使得本文成为“显然的下一步”——将单一变量MNAR的识别策略推广到中介分析的双变量场景。
  • 被淡化或回避的竞争路线:作者淡化了对缺失机制进行参数建模的路线。他们提出的识别策略(如影子变量法)是非参数或半参数的,不要求对缺失机制的具体形式(如logistic模型)做完全正确的设定。作者暗示,参数模型虽然可能更高效,但模型误设的风险更大。作者也回避了贝叶斯方法,尽管贝叶斯方法在处理复杂缺失数据时也很常见。
  • 值得研究者去查的问题什么明显该被引/该存在、却没出现在intro里?
    • Proximal Causal Inference (PCI) 文献(如 Tchetgen Tchetgen et al., 2020)中关于负对照(Negative Control)代理变量(Proxies) 的识别策略。PCI处理的是未观测混杂,而本文处理的是MNAR。但两者在数学结构上有深刻的相似性:都使用“辅助变量”(影子变量 vs. 负对照)来识别目标参数。本文的“影子变量”本质上就是一种负对照。作者没有引用PCI文献,这可能是一个被忽视的连接点。研究者可以查:PCI中的识别策略(如使用两个负对照)能否直接应用于或推广到本文的双变量MNAR场景?这可能是产生新问题的来源。
    • 高维中介分析文献(如 Zhang et al., 2016)。本文的设定是低维的(A, M, Y, C)。如果M是高维的,且同时存在MNAR,问题会如何变化?这连接了研究者的高维统计兴趣。

张力

未见明显对立引用。所有被引工作都承认MAR是一个强假设,且MNAR下的识别需要额外假设。本文的工作是在这个共识下,填补了一个具体的空白。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(A\):处理变量(Treatment),二值或连续。可观测
    • \(M\):中介变量(Mediator),在本文中假设为连续或分类。部分可观测(有缺失)。
    • \(Y\):结局变量(Outcome),连续或分类。部分可观测(有缺失)。
    • \(C\):基线协变量向量(Baseline Covariates)。完全可观测
    • \(R_M\):中介变量的缺失指示符。\(R_M = 1\) 表示 \(M\) 被观测到,\(R_M = 0\) 表示缺失。可观测
    • \(R_Y\):结局变量的缺失指示符。\(R_Y = 1\) 表示 \(Y\) 被观测到,\(R_Y = 0\) 表示缺失。可观测
    • \(M(a)\):在 \(A=a\) 下的潜在中介(Potential Mediator)。不可观测
    • \(Y(a, m)\):在 \(A=a\)\(M=m\) 下的潜在结局(Potential Outcome)。不可观测
    • \(Y(a, M(a'))\):在 \(A=a\) 且中介被设定为 \(A=a'\) 时的潜在结局(复合反事实)。不可观测
    • \(\text{NDE} = E[Y(1, M(0)) - Y(0, M(0))]\):自然直接效应。目标参数(Estimand)
    • \(\text{NIE} = E[Y(1, M(1)) - Y(1, M(0))]\):自然间接效应。目标参数(Estimand)
    • \(Z\)影子变量(Shadow Variable)。一个与缺失机制(\(R_M, R_Y\))相关,但与缺失变量(\(M, Y\))本身条件独立(给定其他观测变量)的变量。可观测。例如,在纵向研究中,前一个时间点的观测值可以作为后一个时间点缺失值的影子变量。
    • \(U\)未观测的混杂因素,同时影响缺失机制和M/Y。不可观测
  • 模型

    • 数据生成机制:标准的中介模型。处理 \(A\) 影响中介 \(M\),两者共同影响结局 \(Y\)。存在未观测混杂 \(U\) 同时影响缺失机制和 \(M, Y\)
    • 缺失机制\(P(R_M, R_Y | M, Y, A, C, U)\)。本文的核心是假设这个机制具有某种结构,使得识别成为可能。例如,假设缺失机制仅依赖于 \(A, C\) 和一个影子变量 \(Z\),而与 \(M, Y\) 本身无关(给定 \(A, C, Z\)),即 \(P(R_M, R_Y | M, Y, A, C, Z) = P(R_M, R_Y | A, C, Z)\)。这被称为影子变量假设
    • 识别假设:除了缺失机制假设,还需要序贯可忽略性来识别中介效应本身。即:
      1. \(Y(a, m) \perp A | C\) (无未观测混杂的处理分配)
      2. \(Y(a, m) \perp M | A, C\) (无未观测混杂的中介-结局关系)
      3. \(M(a) \perp A | C\) (无未观测混杂的处理-中介关系)
      4. 一致性(Consistency)和正值性(Positivity)。
  • 可观测数据

    • 研究者实际能观测到的是:\((A_i, C_i, Z_i, R_{Mi}, R_{Yi}, R_{Mi}M_i, R_{Yi}Y_i)\),其中 \(i=1,...,n\)
    • \(R_{Mi}=0\) 时,\(M_i\) 是缺失的(不可观测);当 \(R_{Yi}=0\) 时,\(Y_i\) 是缺失的。
    • 想要但观测不到的是:缺失的 \(M_i\)\(Y_i\) 值,以及所有潜在变量 \(M(a), Y(a,m)\)

第二步:讲最小内核

本文的最小内核可以简化为一个二值处理、连续中介和结局、且存在一个完美影子变量的特例。

  • 最简特例

    • \(A \in \{0, 1\}\) (二值处理)。
    • \(M, Y\) 为连续变量。
    • 无协变量 \(C\)(或 \(C\) 被忽略)。
    • 存在一个完美的影子变量 \(Z\),满足:
      1. \(Z\) 与缺失机制相关:\(P(R_M, R_Y | M, Y, Z) \neq P(R_M, R_Y | Z)\)
      2. \(Z\) 与缺失变量条件独立:\(Z \perp (M, Y) | A\)。即,给定处理 \(A\),影子变量 \(Z\) 与中介 \(M\) 和结局 \(Y\) 无关。
      3. 关键\(Z\) 本身是完全观测的,且其分布已知或可估计。
    • 缺失机制:假设 \(R_M\)\(R_Y\) 仅依赖于 \(A\)\(Z\),即 \(P(R_M, R_Y | M, Y, A, Z) = P(R_M, R_Y | A, Z)\)。这意味着,给定 \(A\)\(Z\),缺失与否与 \(M, Y\) 本身无关。这是一个很强的MNAR假设,因为它允许缺失机制依赖于 \(Z\),而 \(Z\)\(M, Y\) 相关(通过 \(A\)),但又不直接依赖于 \(M, Y\)
  • 在这个特例下,核心思路是什么?

    • 问题:由于 \(M\)\(Y\) 的缺失依赖于 \(Z\),而 \(Z\)\(M, Y\) 相关,因此观测到的 \(M\)\(Y\) 数据是有偏的(selection bias)。直接使用完全观测的个案(complete-case analysis)会得到有偏的NDE和NIE估计。
    • 关键想法:利用影子变量 \(Z\) 来“纠正”这个偏倚。因为 \(Z\) 与缺失机制相关,它包含了关于“谁缺失了”的信息。同时,因为 \(Z\)\(M, Y\) 条件独立(给定 \(A\)),它本身不直接提供关于 \(M, Y\) 的信息,但它的分布可以用来“加权”或“调整”观测到的数据,使其代表总体。
    • 具体操作(以矩估计为例)
      1. 识别:在影子变量假设下,可以证明,观测数据的分布 \(P(A, Z, R_M, R_Y, R_M M, R_Y Y)\) 唯一地决定了完整数据的分布 \(P(A, Z, M, Y)\)。这意味着NDE和NIE是可识别的。
      2. 估计:构造一个基于逆概率加权(IPW)矩条件的估计量。
        • IPW思路:估计缺失概率 \(\pi(A, Z) = P(R_M=1, R_Y=1 | A, Z)\)。然后,对完全观测的个案(\(R_M=R_Y=1\))用 \(1/\pi(A_i, Z_i)\) 进行加权,就可以得到一个无偏的总体估计。例如,\(E[Y|A=a]\) 的估计量是 \(\frac{1}{n} \sum_{i: R_{Mi}=R_{Yi}=1} \frac{Y_i \cdot I(A_i=a)}{\pi(A_i, Z_i)}\)
        • 矩条件思路:利用影子变量 \(Z\) 的条件独立性,可以构造出一组矩条件,例如 \(E[Y - g(A, M) | A, Z] = 0\),其中 \(g\) 是某个模型。然后通过广义矩估计(GMM)来求解参数。
      3. 证明:证明的核心是,在影子变量假设下,上述加权或矩估计量是一致且渐近正态的。这需要证明缺失概率 \(\pi(A, Z)\) 可以被一致地估计(例如通过参数logistic模型),并且加权后的样本矩收敛到总体矩。
  • 为什么这个特例是“最小内核”?

    • 它剥离了所有为一般性服务的复杂假设(如多个协变量、复杂的缺失模式、非参数模型)。
    • 它清晰地展示了本文的核心贡献:如何利用一个与缺失机制相关但与目标变量条件独立的辅助变量(影子变量),来识别和纠正MNAR带来的偏倚
    • 论文的一般情形(有协变量 \(C\),更一般的缺失模式,半参数模型)只是在这个内核上“加壳”——增加更多的变量和更复杂的估计步骤,但核心的识别逻辑(影子变量法)是不变的。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了在中介分析中,当中介变量(M)和结局变量(Y)同时存在非随机缺失(MNAR)时,自然直接效应(NDE)和自然间接效应(NIE)的非参数识别半参数估计问题。
  2. 核心工具/方法:作者提出了几类可解释的MNAR机制假设,包括影子变量假设工具变量假设,在这些假设下,利用观测数据中的分布约束(如矩条件)证明了NDE和NIE的可识别性。估计方法上,作者提出了基于逆概率加权(IPW)广义矩估计(GMM) 的半参数估计量。
  3. 主要结论:在提出的MNAR假设下,NDE和NIE是非参数可识别的。所提出的IPW和GMM估计量是一致且渐近正态的。模拟研究表明,当MAR假设不成立时,传统方法(如完整个案分析、多重插补)会产生严重偏倚,而本文提出的方法能有效纠正该偏倚。

关键设定与假设

在第二节最小记号的基础上,本文的完整设定和假设如下:

  • 设定

    • 目标参数\(\text{NDE} = E[Y(1, M(0)) - Y(0, M(0))]\)\(\text{NIE} = E[Y(1, M(1)) - Y(1, M(0))]\)
    • 数据\((A_i, C_i, R_{Mi}, R_{Yi}, R_{Mi}M_i, R_{Yi}Y_i)\)\(i=1,...,n\)\(C\) 是基线协变量。
    • 缺失模式:本文主要考虑两种模式:(i) M和Y都缺失(joint missing);(ii) M和Y独立缺失(independent missing)。但核心思想是统一的。
  • 核心假设

    1. 序贯可忽略性(Sequential Ignorability):这是标准中介分析的基石假设,用于在没有缺失数据时识别NDE和NIE。本文假设它在完整数据(无缺失)下成立。
      • \(Y(a, m) \perp A | C\)
      • \(Y(a, m) \perp M | A, C\)
      • \(M(a) \perp A | C\)
    2. 一致性(Consistency)\(M = M(A)\)\(Y = Y(A, M)\)
    3. 正值性(Positivity)\(P(A=a|C=c) > 0\)\(P(M=m|A=a, C=c) > 0\)
    4. 缺失机制假设(MNAR假设):这是本文的核心贡献。作者提出了几种可解释的假设,其中最核心的是影子变量假设
      • 影子变量存在性:存在一个可观测的变量 \(Z\)(可以是 \(C\) 的一部分,或一个额外的变量),使得:
        • \(Z \perp (M, Y) | A, C\) (条件独立性)
        • \(P(R_M, R_Y | M, Y, A, C, Z) = P(R_M, R_Y | A, C, Z)\) (缺失机制仅依赖于 \(A, C, Z\)
      • 工具变量假设:作为影子变量假设的替代,作者也考虑了工具变量假设,其中 \(Z\) 与缺失机制相关,但与 \(M, Y\) 无关(给定 \(A, C\)),且 \(Z\) 不直接影响 \(M\)\(Y\)
    5. 模型假设(用于估计):为了进行估计,作者对某些条件分布做了参数或半参数假设。例如,假设缺失概率 \(P(R_M=1, R_Y=1 | A, C, Z)\) 服从一个参数logistic模型,或者假设 \(E[Y|A, M, C]\) 服从一个线性模型。这些模型假设是可检验的,但模型误设会导致估计偏倚。
  • 相比已有文献的放宽/强化

    • 放宽:相比标准中介分析(假设完全数据或MAR),本文放宽了缺失机制假设,允许M和Y的缺失与未观测的M和Y本身相关(MNAR)。
    • 强化:为了弥补MNAR带来的不可识别性,本文强化了假设,即要求存在一个影子变量工具变量。这是标准中介分析或MAR分析中不需要的额外假设。

主要结果

本文的主要结果是理论性的,提供了识别定理和估计量的渐近性质。

  • 定理1(非参数可识别性)

    • 陈述:在序贯可忽略性和影子变量假设下,完整数据的联合分布 \(P(A, C, Z, M, Y)\) 可以由观测数据的分布 \(P(A, C, Z, R_M, R_Y, R_M M, R_Y Y)\) 唯一地识别。因此,NDE和NIE也是非参数可识别的。
    • 直觉:影子变量 \(Z\) 提供了关于缺失机制的信息,而其与 \(M, Y\) 的条件独立性则提供了一个“锚点”,使得我们可以从观测数据中“反解”出完整数据的分布。证明思路类似于处理单一变量MNAR的识别方法,但推广到了双变量场景。
    • 必要条件:影子变量 \(Z\) 必须与缺失机制相关(否则它不提供信息),且必须与 \(M, Y\) 条件独立(否则它本身会引入混杂)。\(Z\) 的分布必须是非退化的。
    • 解决的技术难点:双变量MNAR的识别比单变量复杂得多,因为缺失机制可能相互依赖。作者通过巧妙地利用影子变量的条件独立性,将双变量问题分解为一系列可识别的单变量条件分布。
  • 定理2(半参数估计量的渐近性质)

    • 陈述:在定理1的识别假设和额外的正则性条件下,所提出的IPW和GMM估计量是一致且渐近正态的。具体地,\(\sqrt{n}(\hat{\theta} - \theta) \xrightarrow{d} N(0, \Sigma)\),其中 \(\theta = (\text{NDE}, \text{NIE})\)
    • 直觉:IPW估计量通过逆概率加权来纠正选择偏倚,其渐近性质依赖于缺失概率模型 \(\pi(A, C, Z)\) 的正确设定和一致估计。GMM估计量通过求解矩条件来估计参数,其渐近性质依赖于矩条件的正确设定和样本矩的收敛性。
    • 必要条件:缺失概率模型或矩条件模型必须被正确设定。估计量对第一阶段的模型估计(如 \(\hat{\pi}\))敏感,需要满足一定的正则性条件(如Donsker条件)以保证第二阶段估计的渐近方差正确。
    • 解决的技术难点:推导渐近方差 \(\Sigma\) 的显式表达式,并考虑第一阶段模型估计带来的不确定性(即“生成的回归量”问题)。作者使用了M-估计理论经验过程理论来处理这个问题。

证明路线与技术技巧

  • 整体路线

    1. 步骤一:识别完整数据分布。 利用影子变量假设,将完整数据分布 \(P(M, Y | A, C, Z)\) 表示为观测数据分布的函数。核心是证明 \(P(M, Y | A, C, Z) = P(M, Y | A, C, R_M=1, R_Y=1, Z)\),即给定 \(A, C, Z\),缺失机制与 \(M, Y\) 独立,因此观测到的 \(M, Y\) 分布就是总体的条件分布。这一步是识别的关键。
    2. 步骤二:表达目标参数。 将NDE和NIE表示为完整数据分布的函数。例如,\(\text{NDE} = \int E[Y|A=1, M=m, C=c] - E[Y|A=0, M=m, C=c] dP(M=m|A=0, C=c) dP(C=c)\)
    3. 步骤三:构造估计量。 基于步骤一和步骤二,构造IPW或GMM估计量。
      • IPW:估计缺失概率 \(\hat{\pi}(A, C, Z)\),然后对完全观测的个案进行加权,以估计步骤二中的条件期望和分布。
      • GMM:基于步骤一中的识别结果,构造矩条件,例如 \(E[\psi(A, C, Z, M, Y; \theta)] = 0\),其中 \(\theta\) 是NDE和NIE的参数化形式。然后通过求解样本矩条件 \(\frac{1}{n} \sum_i \psi_i(\theta) = 0\) 来得到 \(\hat{\theta}\)
    4. 步骤四:证明渐近性质。 使用标准M-估计理论或经验过程理论,证明 \(\hat{\theta}\) 的一致性和渐近正态性。这需要验证目标函数的随机 equicontinuity 和识别条件。
  • 关键跳跃点

    • 跳跃点一:从单变量MNAR到双变量MNAR的识别。 处理单一变量MNAR时,识别策略相对直接(如使用一个影子变量)。但处理M和Y同时MNAR时,缺失机制 \(P(R_M, R_Y | M, Y, ...)\) 可能非常复杂,且M和Y的缺失可能相互依赖。作者的关键跳跃是假设缺失机制具有可分解的结构(如 \(P(R_M, R_Y | M, Y, ...) = P(R_M | M, ...) P(R_Y | Y, ...)\) 或更复杂的结构),并证明在这种结构下,影子变量法仍然有效。
    • 跳跃点二:处理“生成的回归量”问题。 在IPW和GMM估计中,第一阶段的模型(如缺失概率模型)是估计出来的。这个估计误差会影响第二阶段目标参数的估计方差。作者需要推导出正确的渐近方差公式,这通常涉及影响函数(Influence Function) 的推导,或者使用经验过程理论中的Donsker定理来证明第二阶段估计对第一阶段估计的“不敏感性”。
  • 技术技巧点名

    • 影子变量法(Shadow Variable Method):这是本文最核心的技术技巧,用于实现MNAR下的识别。它借用了缺失数据文献中的经典方法。
    • 逆概率加权(IPW):用于纠正选择偏倚的标准技巧。
    • 广义矩估计(GMM):用于在半参数模型下进行有效估计的技巧。
    • M-估计理论(M-estimation Theory):用于证明估计量的一致性和渐近正态性的标准理论框架。作者很可能使用了Z-估计量(Z-estimator)的框架,其中估计量是某个矩条件的解。
    • Delta方法(Delta Method):用于推导NDE和NIE(它们是条件期望的复杂函数)的渐近方差。

真实例子与应用

  • 使用的数据/场景美国国家职业训练团研究(National Job Corps Study, NJCS)。这是一个随机对照试验,旨在评估职业训练项目(处理 \(A\))对参与者收入(结局 \(Y\))的影响,并探究其是否通过改善“社会心理技能”(如自尊、自我效能感,中介 \(M\))来起作用。
  • 如何应用
    1. 变量定义\(A\) = 是否被分配到职业训练项目;\(Y\) = 项目结束后的收入;\(M\) = 社会心理技能得分;\(C\) = 基线人口学特征(年龄、性别、教育等)。
    2. 缺失问题:在NJCS中,M和Y都存在大量缺失。作者认为,缺失可能与未观测因素相关(MNAR)。例如,收入低或心理状态差的人可能更不愿意填写问卷。
    3. 影子变量选择:作者选择基线时的社会心理技能得分作为影子变量 \(Z\)。理由是:基线得分与项目后的得分(\(M\))和收入(\(Y\))相关(通过 \(A\)\(C\)),但给定 \(A\)\(C\),基线得分与项目后的缺失机制相关(例如,基线得分低的人更可能后续不配合),而与项目后的 \(M, Y\) 本身条件独立(因为基线得分是过去的值,不会直接影响未来的缺失值本身,只通过影响缺失倾向来起作用)。这是一个有争议但可解释的假设。
    4. 分析:作者分别使用完整个案分析(CCA)、多重插补(MI,假设MAR)和本文提出的影子变量IPW/GMM方法进行分析。
  • 得到的结果
    • CCA和MI:估计出的间接效应(NIE)很小且不显著,暗示职业训练主要通过直接效应(NDE)影响收入。
    • 本文方法(影子变量法):估计出的间接效应(NIE)显著为正,且占总效应的比例更大。这表明,在纠正了MNAR偏倚后,社会心理技能的改善是职业训练提升收入的一个重要渠道。
  • 这个例子想说明什么
    • 验证理论:展示当MAR假设可能不成立时,传统方法(CCA, MI)会得到有偏的结论,而本文提出的MNAR方法能揭示出不同的、可能更真实的因果机制。
    • 展示相对优势:通过对比,直观地展示了本文方法相对于现有方法的优势——它能处理传统方法无法处理的MNAR问题。
    • 提供实践指导:为实证研究者提供了一个如何在真实数据中选择和应用影子变量法的范例。

🔎 结论是否比证明窄

  • 窄结论:本文的识别定理(定理1)是在影子变量假设下严格证明的。然而,作者在讨论和结论部分,可能会泛泛地声称该方法适用于“一般的MNAR场景”。实际上,该方法只适用于那些存在一个可观测的、满足条件独立性的影子变量的特定MNAR场景。如果不存在这样的影子变量,或者影子变量的选择是错误的,那么识别就会失败。
  • 具体语句:作者在introduction中可能会说“我们提出了一套处理M和Y同时MNAR的通用框架”。但读者需要意识到,这个“通用”是有条件的——它依赖于一个非常强的、不可检验的影子变量假设。作者在讨论部分可能会承认这一点,但读者需要自己判断这个假设在具体应用中的合理性。
  • Conjecture:作者可能推测(conjecture)该方法可以推广到更复杂的缺失模式(如M和Y的缺失相互依赖且不可分解),但并未在本文中严格证明。这是一个开放问题。

四、开放问题(点到为止,扎根具体语句)

  1. 更一般的缺失机制:本文假设缺失机制可分解或依赖于影子变量。开放问题:当缺失机制是任意的、不可分解的,且不存在完美的影子变量时,NDE和NIE是否仍然可识别?需要什么样的假设?扎根:本文的识别定理依赖于影子变量假设(如假设4)。作者在讨论部分可能会提到“更一般的缺失机制是未来工作”。
  2. 半参数效率界:本文提出了IPW和GMM估计量,但未推导其半参数效率界。开放问题:在给定的影子变量假设下,NDE和NIE的半参数效率界是什么?是否存在一个达到该效率界的估计量(如高效影响函数估计量)?扎根:本文主要关注识别和一致估计,未涉及效率理论。作者可能在future work中提到“推导半参数效率界是一个自然的方向”。
  3. 影子变量的选择与检验:影子变量的选择是主观的,且其条件独立性假设(\(Z \perp (M, Y) | A, C\))是不可检验的。开放问题:是否存在数据驱动的、可部分检验的影子变量选择方法?或者,能否发展出对影子变量假设的敏感性分析方法?扎根:本文在真实例子中基于领域知识选择了影子变量,但未提供选择或检验的统计方法。这是应用中的核心瓶颈。
  4. 与Proximal Causal Inference的连接:如前所述,本文的影子变量法与PCI中的负对照法在数学结构上高度相似。开放问题:能否将PCI中更成熟的识别策略(如使用两个负对照来处理未观测混杂)系统地移植到本文的双变量MNAR场景中,从而放松对影子变量的要求?扎根:本文未引用PCI文献。这是一个值得研究者去查的、潜在的连接点。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论