Mediation analysis with the mediator and outcome missing not at random¶
讲者: Xueli Wang
会场: Variable Selection and FDR Control and Change Point Detection
报告题目: Mediation Analysis with Parallel Multiple Mediators: Missing Not at Random
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在因果中介分析中,当中介变量(M)和/或结局变量(Y)存在缺失,且缺失机制为“非随机缺失”(MNAR,即缺失概率依赖于未观测到的变量本身)时,如何非参数地识别自然直接效应(NDE)和自然间接效应(NIE)。其核心挑战在于,MNAR 下可观测数据的分布与完整数据分布之间存在一个“缺失数据机制”的未知桥梁,若不施加额外假设,目标参数(如 NDE/NIE)通常不可识别。当前该方向的成熟度较低,大部分工作集中在 MAR 假设下,而针对 MNAR 的识别理论尚在发展中。
发展脉络(history)¶
-
奠基工作:标准中介分析的识别与估计
- Pearl (2001) 和 Imai, Keele, & Tingley (2010a) 建立了在无缺失数据、且满足“顺序可忽略性”(sequential ignorability)假设下,NDE 和 NIE 的非参数识别公式(即中介公式)。这是整个领域的基石。
- Imai, Keele, & Yamamoto (2010b) 进一步讨论了该识别假设的实践含义,并提出了基于模拟的估计策略和敏感性分析方法。
- Valeri & VanderWeele (2013) 提供了在参数模型(如线性、logistic)下实现中介分析的 SAS/SPSS 宏,极大地推动了方法的应用。
-
主要进展:处理缺失数据(主要是 MAR)
- Qin et al. (2019) 在 NJCS 的多位点中介分析中,采用了基于倾向性得分的加权方法来处理中介和结局的缺失。本文引用语境明确指出,该方法“invoked the assumption of MAR that the missingness was independent of the mediator and outcome, given the observed treatment and covariates.” 这是处理该问题的标准做法,但假设较强。
- van Buuren & Groothuis-Oudshoorn (2011) 的 MICE 包是处理 MAR 缺失的通用多重插补工具,被本文作为基准方法之一。
-
当前 Frontier:处理 MNAR 缺失
- Yang, Wang, & Ding (2019) 研究了协变量 MNAR 下平均处理效应的识别问题,提出了基于“结果独立缺失”(outcome-independent missingness)的识别框架。本文引用语境将其归入“missing data literature”,并指出其使用了“shadow variable”方法。
- Miao et al. (2024) 系统研究了结局变量 MNAR 下的识别与半参数有效估计,核心工具是“影子变量”(shadow variable)。本文引用语境将其与 Yang et al. (2019) 等并列,作为处理 MNAR 的近期工作。
- Li et al. (2023) 在链图(chain graph)而非 DAG 框架下,研究了多变量非单调 MNAR 缺失的“自删失”(self-censoring)模型。本文引用语境将其作为处理 MNAR 的另一个近期进展。
- Dukes, Shpitser, & Tchetgen (2023) 和 Ghassami et al. (2023) 发展了“近端因果推断”(proximal causal inference)框架,利用代理变量(proxy)来处理未观测混杂,并扩展到中介分析。本文引用语境将其归为“recent proximal inference literature”。
-
本文的位置
- 本文是首次系统研究中介变量和结局变量同时 MNAR 下的 NDE/NIE 非参数识别问题。它填补了从“标准中介分析”到“处理 MAR 缺失”再到“处理 MNAR 缺失”这一链条上的关键空白。作者将之前处理 MNAR 的工作(如 Yang et al. 2019, Miao et al. 2024)中使用的“完整性条件”(completeness condition)和“影子变量”思想,创造性地应用于中介分析的特定缺失模式中。
子线索聚类¶
- 标准中介分析的理论与估计:包括 Pearl (2001), Imai et al. (2010a,b), Valeri & VanderWeele (2013), Hong (2010), Tchetgen & Shpitser (2012)。这一簇关注在无缺失、满足顺序可忽略性下的识别、估计和敏感性分析。
- 缺失数据方法:包括处理 MAR 的 MICE (van Buuren, 2011) 和加权法 (Qin et al., 2019),以及处理 MNAR 的各类方法。后者又可细分为:
- 基于完整性条件的方法:如 Yang et al. (2019), Miao et al. (2024),利用一个与缺失机制条件独立的变量(影子变量)来识别。
- 基于图形模型的方法:如 Mohan & Pearl (2021), Li et al. (2023),利用 DAG 或链图的结构来刻画可识别性条件。
- 工具变量法:如 Yang, Lorch, & Small (2014), Chen, Geng, & Zhou (2009),在 IV 框架下处理协变量或结局的 MNAR。
- 近端因果推断:Dukes et al. (2023), Ghassami et al. (2023)。这一簇利用代理变量处理未观测混杂,并已扩展到中介分析,但其关注点与本文的“缺失数据”问题不同。
这个方向在追问的核心问题¶
- 识别问题:在何种 MNAR 机制下,NDE 和 NIE 是可识别的?需要哪些假设(如完整性条件)?
- 估计问题:在识别的基础上,如何构造出有效且稳健的估计量(如 EM 算法、多重稳健估计)?
- 敏感性分析:当识别假设(如顺序可忽略性、特定的 MNAR 机制)被违反时,结论的稳健性如何?
- 复杂缺失模式:当协变量也 MNAR、存在多个中介变量、或存在非依从性时,问题如何解决?
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口 frame 为“现有中介分析工作大多假设 MAR,但实际数据(如 NJCS)中缺失很可能是 MNAR。虽然已有处理 MNAR 的通用方法(如影子变量),但尚未有工作系统研究中介变量和结局同时 MNAR 下的 NDE/NIE 识别。” 因此,本文的贡献是“首次”填补这一空白,通过提出一系列“可解释的”(interpretable)MNAR 机制(Assumptions 1-4)并证明在这些机制下 NDE/NIE 是可识别的。
- 被淡化或回避的竞争路线:
- 近端因果推断:作者在引言中提到了 Dukes et al. (2023) 和 Ghassami et al. (2023),但并未将其作为主要竞争路线。近端推断处理的是“未观测混杂”,而本文处理的是“缺失数据”,两者问题不同。作者可能淡化了近端推断方法在处理 MNAR 缺失时的潜力(例如,将缺失指示符视为代理变量)。
- 基于图形模型的方法:作者引用了 Mohan & Pearl (2021) 和 Li et al. (2023),但并未深入讨论其与本文 DAG 框架的异同。作者选择在标准 DAG 框架下工作,并假设了特定的条件独立关系,这比通用的图形模型方法更具体,但也可能更局限。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 值得查:关于“影子变量”方法在 MNAR 缺失数据中的更早期、更基础的理论工作,例如 Wang, Shao, & Kim (2014) 等。作者引用了 Miao et al. (2024),但该文是较新的工作。更早期的影子变量文献可能提供了更一般的识别框架,本文的 Assumptions 1-4 可能是其特例。
- 值得查:关于“工具变量”用于处理 MNAR 缺失的文献,作者在正文中提到了 Yang et al. (2014) 和 Chen et al. (2009),但在引言中并未将其作为一条主要线索来铺垫。这可能是因为本文的核心是中介分析,而非 IV 分析。
张力¶
未见明显对立引用。被引工作之间在假设和结论上基本是互补的,而非矛盾的。例如,处理 MAR 的方法(Qin et al. 2019)与处理 MNAR 的方法(Yang et al. 2019)针对的是不同的缺失机制,并不直接冲突。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
T:二元处理变量(t=0对照,t=1实验)。X:预处理协变量向量。M:中介变量(可连续、可离散)。Y:结局变量(可连续、可离散)。M(t):个体在T=t下的潜在中介值。Y(t, M(t')):个体在T=t、中介被设为T=t'下的值时的潜在结局。NDE = E[Y(1, M(0)) - Y(0, M(0))]:自然直接效应。NIE = E[Y(1, M(1)) - Y(1, M(0))]:自然间接效应。RM:中介缺失指示符(RM=1观测到,RM=0缺失)。RY:结局缺失指示符(RY=1观测到,RY=0缺失)。P(Y, M | T, X):给定T和X下Y和M的联合分布。这是识别 NDE/NIE 的关键。
- 模型:
- 数据生成机制遵循标准的中介分析框架,满足 SUTVA 和顺序可忽略性(
Y(t, m) ⟂⟂ T | X和Y(t, m) ⟂⟂ M(t') | T, X)。 - 缺失机制是 MNAR,即
RM和/或RY的分布依赖于未观测到的M或Y本身。
- 数据生成机制遵循标准的中介分析框架,满足 SUTVA 和顺序可忽略性(
- 可观测数据:
- 研究者能观测到:
T, X(完全观测)。 - 对于每个个体,能观测到
(M, RM)和(Y, RY)的组合。例如,当RM=1时,M被观测到;当RM=0时,M缺失。 - 想要但观测不到:缺失的
M和Y值,以及P(Y, M | T, X)这个完整数据分布。识别目标就是利用可观测数据,在 MNAR 假设下,唯一地恢复这个完整数据分布。
- 研究者能观测到:
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:只有中介变量 M 缺失,且缺失机制是 MNAR(依赖于 M 本身),而结局 Y 完全观测。这就是论文的 Assumption 1。
在这个特例下,识别 NDE/NIE 的关键是识别 P(Y, M | T, X)。由于 Y 完全观测,P(Y | M, T, X) 可以直接用完整案例(RM=1 的个体)来估计,因为 RM ⟂⟂ Y | (M, T, X)(Assumption 1 的核心)。所以,真正的困难在于识别 P(M | T, X)。
核心数学问题:如何从可观测数据中识别 P(M | T, X)?
关键想法:利用 Y 作为“工具”来识别缺失机制。
具体推导(离散情况):
1. 定义:
* P(M=m, Y=y, RM=1 | T=t, X=x):可观测(来自完整案例)。
* P(Y=y, RM=0 | T=t, X=x):可观测(来自 M 缺失但 Y 观测到的个体)。
* ζ_{t,x}(m) = P(RM=0 | M=m, T=t, X=x) / P(RM=1 | M=m, T=t, X=x):未知的缺失机制比率,是我们想要求解的。
-
建立方程:
- 对于每个
y,我们有:P(Y=y, RM=0 | T=t, X=x) = Σ_m P(M=m, Y=y, RM=0 | T=t, X=x)= Σ_m P(M=m, Y=y, RM=1 | T=t, X=x) * ζ_{t,x}(m) - 这是一个关于未知数
{ζ_{t,x}(m)}的线性方程组。方程的数量等于Y的类别数K,未知数的数量等于M的类别数J。
- 对于每个
-
识别条件(完整性条件):
- 要唯一地解出
ζ_{t,x}(m),需要方程的数量不少于未知数的数量,即K ≥ J,并且系数矩阵Θ_{tx}(其元素为P(M=m, Y=y, RM=1 | T=t, X=x))是列满秩的。这个条件就是论文中说的“P(Y, M, RM=1 | T=t, X=x)is complete inY”。 - 直觉:
Y必须与M相关(给定T, X),并且Y的变异性要足够大,才能“区分”出不同M值下的缺失机制。如果M ⟂⟂ Y | (T, X),那么Θ_{tx}的列是线性相关的,方程无唯一解。
- 要唯一地解出
-
结论:一旦解出
ζ_{t,x}(m),就能得到P(RM=1 | M=m, T=t, X=x),进而识别出P(M=m | T=t, X=x) = P(M=m, RM=1 | T=t, X=x) / P(RM=1 | M=m, T=t, X=x)。至此,P(Y, M | T, X)完全可识别,NDE/NIE 也随之可识别。
总结:这个最小内核展示了本文的核心数学贡献:在 MNAR 下,通过假设缺失机制与某个完全观测的变量(这里是 Y)条件独立,并利用该变量作为“工具”,可以将识别问题转化为一个线性方程组求解问题,其可解性由“完整性条件”保证。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在中介变量(
M)和结局变量(Y)都可能缺失,且缺失机制为非随机缺失(MNAR)的情况下,如何非参数地识别自然直接效应(NDE)和自然间接效应(NIE)。 - 核心工具 / 方法:提出了四种可解释的 MNAR 机制(Assumptions 1-4),每种机制都假设缺失指示符与某些变量条件独立。利用这些独立性,将识别问题转化为求解线性积分方程,其可解性依赖于“完整性条件”(completeness condition)。对于估计,采用了基于 EM 算法的参数化方法。
- 主要结论:在每种提出的 MNAR 机制下,只要相应的完整性条件成立,
P(Y, M | T, X)就是可识别的,从而 NDE 和 NIE 也是可识别的。模拟研究验证了理论,并展示了当完整性条件不满足时,参数化方法可能失败。在 NJCS 数据上的应用表明,考虑 MNAR 机制后,NIE 仍然显著,而 NDE 不显著。
关键设定与假设¶
- SUTVA:稳定单位处理值假设,即无隐藏处理变体、无个体间干扰。
- 顺序可忽略性:全文沿用标准假设,即
Y(t, m) ⟂⟂ T | X和Y(t, m) ⟂⟂ M(t') | T, X。这是中介分析的标准基石。 - 四种 MNAR 假设:这是本文的核心贡献,它们定义了缺失机制的结构。所有假设都条件于
T和X。- Assumption 1:
RM ⟂⟂ Y | (M, T, X)且Y完全观测。缺失只发生在M上,且M的缺失依赖于M本身,但与Y条件独立。 - Assumption 2:
(RY, RM) ⟂⟂ Y | (M, T, X)且RY ⟂⟂ M | (RM, T, X)。M的缺失依赖于M;Y的缺失依赖于RM,但与Y和M条件独立。 - Assumption 3:
RY ⟂⟂ (M, RM) | (Y, T, X)且RM ⟂⟂ (Y, RY) | (M, T, X)。M的缺失依赖于M;Y的缺失依赖于Y本身,两者相互独立。 - Assumption 4:
Y, RY, RM在给定(M, T, X)下相互独立。M的缺失依赖于M;Y的缺失依赖于M,但与Y和RM条件独立。
- Assumption 1:
- 完整性条件:这是非参数识别的关键假设。例如,在 Theorem 1 中,要求
P(Y, M, RM=1 | T=t, X=x)在Y上是完备的。这本质上是一个“满秩”条件,要求Y的变异性足够大,且与M相关。相比已有文献,本文将这些条件具体化到中介分析的缺失模式中。
主要结果¶
- Theorem 1:在 Assumption 1 下,如果
P(Y, M, RM=1 | T=t, X=x)在Y上完备,且P(RM=1 | M=m, T=t, X=x) > 0,则P(Y, M | T, X)可识别。直觉:Y完全观测,P(Y|M,T,X)由完整案例识别;完整性条件用于识别P(M|T,X)。 - Theorem 2:在 Assumption 2 下,分两种情况:
- (i) 如果
P(RM=0, RY=1 | M=m, T=t, X=x) > 0且P(Y, M, RM=1, RY=1 | T=t, X=x)在Y上完备,则P(Y, M | T, X)可识别。直觉:Y与缺失机制条件独立,P(Y|M,T,X)由完整案例识别;完整性条件用于识别P(M|T,X)。 - (ii) 如果
P(RM=0, RY=1 | M=m, T=t, X=x) = 0(单调缺失)且RM ⟂⟂ M | (T, X)(退化为 MAR),则P(Y, M | T, X)可识别。
- (i) 如果
- Theorem 3:在 Assumption 3 下,需要两个完整性条件:
P(Y, M, RM=1, RY=1 | T=t, X=x)在Y上完备 且 在M上完备。直觉:Y与RY相关,P(Y|M,T,X)不再由完整案例识别。需要同时识别P(RM|M,T,X)和P(RY|Y,T,X),这需要两个方程系统,因此需要Y和M的维度相等(J=K)。 - Theorem 4:在 Assumption 4 下,需要
P(M, Y†, RM=1 | T=t, X=x)在Y†上完备,其中Y† = (Y·RY, RY)。直觉:Y与缺失机制条件独立,P(Y|M,T,X)由完整案例识别;M对RY的影响提供了一个额外的约束,使得识别P(M|T,X)所需的完整性条件比 Theorem 1 更弱(Y†的维度比Y多一维)。
证明路线与技术技巧¶
- 整体路线:所有定理的证明都遵循一个统一的模式:
- 利用条件独立性:根据假设,将可观测数据的概率(如
P(Y=y, RM=0, RY=1 | T=t, X=x))表示为完整数据概率(P(Y=y, M=m | T=t, X=x))和缺失机制比率(如ζ_{t,x}(m))的积分/求和。 - 建立线性积分方程:将上一步的表达式转化为一个关于未知缺失机制比率的线性积分方程。方程的左端是可观测的,右端是已知的完整案例概率与未知比率的乘积的积分。
- 利用完整性条件求解:证明该积分方程有唯一解的条件是,完整案例的联合分布(如
P(Y, M, RM=1, RY=1 | T=t, X=x))在某个变量(如Y)上是完备的。这保证了线性算子是可逆的。 - 反解目标分布:一旦解出缺失机制比率,就可以反解出
P(RM | M, T, X)和/或P(RY | Y, T, X),进而得到P(Y, M | T, X)。
- 利用条件独立性:根据假设,将可观测数据的概率(如
- 关键跳跃点:最关键的跳跃在于将非参数识别问题转化为一个线性积分方程的可解性问题。这个跳跃依赖于对缺失机制的结构性假设(Assumptions 1-4),这些假设使得缺失机制比率可以从方程中分离出来。难点在于证明这个线性算子(由完整案例分布定义)是可逆的,这需要引入“完整性条件”这个抽象但强大的工具。
- 技术技巧点名:
- 完整性条件 (Completeness Condition):这是整个非参数识别的核心工具,用于保证积分方程解的唯一性。论文引用了 Newey & Powell (2003) 等文献来支持其使用。
- EM 算法 (Expectation-Maximization Algorithm):用于参数化估计。由于
M和Y有缺失,将缺失值视为潜在变量,通过 E 步计算其条件期望,M 步最大化完整数据似然。 - 分数插补 (Fractional Imputation):当
M或Y连续时,E 步中的积分难以解析计算。论文采用分数插补,从提议分布中抽取多个样本,并用重要性权重来近似条件期望。
真实例子与应用¶
- 数据:美国国家职业团研究(NJCS)。这是一个多站点随机对照试验,评估 Job Corps 项目对弱势青年就业和收入的影响。
- 场景:处理变量
T是是否被分配到 Job Corps 项目;中介变量M是是否获得教育证书或职业证书;结局变量Y是第四年的周薪。M和Y的缺失率均超过 20%。 - 方法应用:作者将本文提出的四种 MNAR 假设应用于 NJCS 数据,并采用两部分的参数模型(Gamma 和对数正态)来拟合右偏的周薪数据。通过比较不同模型的对数似然,选择了 Assumption 2 下的 Gamma 模型作为最佳模型。
- 结果:
- 在 Assumption 2 下,
M对RM的系数λ_m估计为 1.73(95% CI: 0.34, 3.33),表明获得证书的人更可能报告证书状态。 RM对RY的系数γ_{rM}估计为 1.87(95% CI: 1.76, 2.00),表明报告证书状态的人也更可能报告收入。- NIE 估计为 10.94(95% CI: 7.94, 14.29),显著为正,表明通过获得证书,项目显著提高了收入。
- NDE 估计为 12.93(95% CI: -1.95, 27.64),不显著。
- 在 Assumption 2 下,
- 例子想说明什么:这个例子旨在说明,即使在 MNAR 缺失下,本文提出的方法也能得到合理的、与领域知识一致的结论。更重要的是,它展示了如何通过模型比较(对数似然)来选择合适的 MNAR 机制,并揭示了在 NJCS 中,
M对RM和RM对RY的显著影响,这验证了 MNAR 假设的合理性。
🔎 结论是否比证明窄¶
- 是。论文的非参数识别结论(Theorems 1-4) 是严格在“完整性条件”下证明的。然而,在模拟和实际应用中,作者采用了参数化模型(如 logistic 回归、线性模型)。作者在正文中明确承认了这一点:“However, the nonparametric estimation for these quantities may suffer from the curse of dimensionality... Therefore, we adopt a parametric method to obtain likelihood-based inference.”
- 更关键的是,作者在模拟中展示了一个例子(Setting E,
M为三分类,Y为二分类),其中非参数识别所需的完整性条件不满足(J > K),但参数化 EM 算法仍然收敛。作者指出,此时参数估计的分布呈现“bimodality, skewness and other irregular patterns”,结果“may not be trustworthy”。这明确表明,论文的结论(可识别性)是建立在非参数完整性条件之上的,而参数化方法在条件不满足时可能给出误导性结果。作者引用了 Cox & Donnelly (2011) 的话来强调这一点:“If an issue can be addressed nonparametrically then it will often be better to tackle it parametrically; however, if it cannot be resolved nonparametrically then it is usually dangerous to resolve it parametrically.”
四、开放问题¶
- 协变量也 MNAR:论文假设协变量
X是完全观测的。但在 NJCS 数据中,X本身也有少量缺失(如教育水平 0.65%)。扎根于论文第 28 页:“First, prevalent missingness may exist in both the mediator/outcome and the covariates, and missingness of covariates may also be MNAR. Identifiability in this more complicated scenario is to be explored.” 这是一个直接且具体的开放问题。 - 非依从性(Noncompliance):NJCS 中存在单侧非依从性(约 30% 的实验组未参与项目)。论文将 NDE/NIE 解释为“项目分配”而非“项目参与”的效应。扎根于论文第 28 页:“Second, the NIE and NDE evaluated in the NJCS should be interpreted as the effects of the program assignment instead of the effects of the program... This one-sided noncompliance issue is to be addressed.” 如何将 MNAR 缺失与非依从性(如通过工具变量或主分层)结合,是一个重要的扩展方向。
- 多个中介变量:论文只考虑了一个中介变量。扎根于论文第 28 页:“Third, we considered a setting where there is a single mediator. In practice, cases with multiple mediators may arise, and the potential missingness mechanisms may vary depending on whether those mediators have a sequential relationship or parallel relationship, and etc.” 当存在多个中介变量且它们都有 MNAR 缺失时,识别问题会变得极其复杂。
- 顺序可忽略性的敏感性分析:论文假设了顺序可忽略性,但这一假设在 NJCS 中可能被违反。扎根于论文第 28 页:“Fourth, the sequential ignorability assumption could be violated in the NJCS. One approach to partly address this issue is to conduct sensitivity analysis...” 虽然论文在补充材料中做了关于 MNAR 机制的敏感性分析,但并未对顺序可忽略性本身进行敏感性分析。将两者结合,发展一个同时处理“未观测混杂”和“MNAR 缺失”的敏感性分析框架,是一个有挑战性的问题。
Maintained by 陈星宇 · Homepage · Source on GitHub