Selecting among Missingness Models for Sequential Outcomes with Nonignorable Nonresponse¶
作者: Yingying Wang, Yuan Liu, Shanshan Luo
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.09026
一、领域脉络与小综述¶
这个方向是什么¶
本方向研究纵向数据中序贯结局的非随机缺失(MNAR)问题,核心挑战是:当早期结局(Y₁)和后期结局(Y₂)都可能因非随机机制缺失时,如何从观测数据中恢复完整的联合分布,并进一步估计下游的因果或关联性泛函。当前成熟度:识别理论已有较多工作(工具变量、完备性条件、图模型),但模型选择——即当存在多个可识别的缺失机制图时,如何用数据决定哪一个更合理——仍是一个相对开放的问题。本文正是针对这一缺口提出形式化的两阶段选择程序。
发展脉络(history)¶
- 奠基工作:Little & Rubin (2002) 系统建立了缺失数据分类(MCAR/MAR/MNAR)和似然推断框架。Ma et al. (2003) 首次用有向无环图研究纵向二元结局的非随机缺失,提出基于一阶马尔可夫结构的可识别性图准则。Ding & Geng (2014) 在随机实验中建立了协变量非随机缺失下子组因果效应的可识别性条件。
- 主要进展(识别方法):D'Haultfoeuille (2010) 和 Newey & Powell (2003) 将完备性条件引入非参数工具变量和内生选择问题,成为后续缺失数据识别的基础工具。Miao et al. (2016) 证明了正态和正态混合模型在非随机缺失下的可识别性,并指出Logistic缺失机制比Probit更难识别。Sun et al. (2018) 利用工具变量给出了MNAR下非参数识别的充要条件,并发展了半参数估计量。Li et al. (2023) 提出链图自删失模型(self-censoring model)处理多元非单调缺失,通过完备性条件建立参数可恢复性。Nabi et al. (2026) 从反事实视角将缺失数据问题重新表述为因果推断问题,用缺失数据DAG编码潜在结果与响应指示符之间的独立性。
- 当前frontier与本文位置:上述工作主要关注给定一个缺失机制下的识别与估计,但实际应用中研究者常面临多个合理的缺失图模型。本文首次将模型选择引入序贯MNAR设定,聚焦两个科学上有区别的候选图族(M₁:R₁→R₂;M₂:Y₁→R₂),建立识别、估计、选择与选择后推断的完整框架。作者在引言中明确写道:“While these contributions demonstrate that graphical representations are invaluable… a critical practical challenge remains: when several plausible missingness graphs are available, which one should be used?” 本文正是对这一问题的直接回应。
子线索聚类¶
被引文献大致落在三条子线索上:
- 基于工具变量/完备性条件的识别方法:D'Haultfoeuille (2010), Miao et al. (2016, 2018), Sun et al. (2018), Jiang & Ding (2021)。这一簇的核心是用完备性或秩条件从积分方程中唯一解出缺失机制参数,适用于MNAR设定。
- 图模型与反事实视角的缺失数据建模:Ma et al. (2003), Tian (2015), Nabi et al. (2026), Li et al. (2023)。这一簇用DAG或链图编码缺失机制中的独立性假设,并推导可识别性条件。
- 模型选择与信息准则:Sawa (1978), Vuong (1989)。这一簇提供比较非嵌套/重叠模型的理论框架,本文直接将其应用于缺失图模型的选择。
这个方向在追问的核心问题¶
- 核心问题1:在多个可识别的MNAR机制下,如何从观测数据中区分它们?(本文直接回答)
- 核心问题2:当真实机制不在候选集中时,模型选择程序的行为如何?(本文通过M₁,₂类模拟部分回答)
- 核心问题3:选择后推断是否仍有效?如何调整?(本文给出固定优势下的有效性,边界情形需调整)
- 已知瓶颈:① 识别条件(完备性/秩条件)在实际中难以验证;② 模型选择依赖于似然,对参数模型设定敏感;③ 当候选模型观测上不可区分时,无法进一步比较。
⚠️ 作者的 framing¶
作者将缺口 frame 为:“两个候选图族 M₁ 和 M₂ 都是可识别的,且它们的观测数据模型有重叠;需要一种形式化程序来决定哪个更接近真实数据生成过程。” 作者淡化了以下竞争路线: - 敏感性分析(如 Scharfstein et al., 2021):作者承认其价值,但指出它“does not provide a formal statistical test to distinguish among competing missingness graphs”。 - 贝叶斯模型平均:未被提及。 - 更一般的图模型选择(如包含 M₁,₂ 类):作者明确将 M₁,₂ 排除在主比较之外,因为其不可识别(附录C给出反例)。
什么明显该被引/该存在、却没出现在 intro 里?
- 关于图模型结构学习(structure learning)的文献,如从数据中学习缺失图结构的方法(例如基于约束的算法),未被引用。这可能是因为本文假设候选图是预先指定的,而非从数据中学习。
- 关于模型选择后推断的通用理论(如 Leeb & Pötscher 关于后选择推断的警告),未被引用。本文在附录H.3中处理了边界情形,但正文仅给出固定优势下的简单结果。
张力¶
未见明显对立引用。被引工作之间在识别条件上存在互补关系(工具变量 vs. 完备性 vs. 图模型),但未发现直接矛盾的结论。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(Y_1 \in \{0,1\}\):早期结局(二元)。 - \(Y_2\):后期结局(连续或离散)。 - \(X\):完全观测的协变量向量。 - \(R_1 \in \{0,1\}\):\(Y_1\) 的响应指示符(1=观测到,0=缺失)。 - \(R_2 \in \{0,1\}\):\(Y_2\) 的响应指示符。 - 可观测数据:\(O = (X, R_1, R_1 Y_1, R_2, R_2 Y_2)\)。注意:当 \(R_1=0\) 时 \(Y_1\) 缺失;当 \(R_2=0\) 时 \(Y_2\) 缺失。 - 完整数据分布:\(F\),包含 \((X, Y_1, Y_2, R_1, R_2)\) 的联合分布。 - 目标泛函:\(\tau(F) = E_F\{h_F(X)\}\),例如标准化对比 \(\tau_{SC}(F) = E_F\{E_F(Y_2|Y_1=1,X) - E_F(Y_2|Y_1=0,X)\}\)。
模型: - 数据生成机制:假设存在一个真实的完整数据分布 \(F_0\),但研究者只能观测到 \(O\)。 - 候选模型族:M₁ 和 M₂,分别对应图1(f)和(i)。两个模型都假设至少一个结局是自删失(即 \(Y_1 \to R_1\) 或 \(Y_2 \to R_2\) 存在),且满足 Assumption 1:\(R_1 \perp\!\!\!\perp Y_2 \mid (Y_1, X)\)(第一个响应指示符与第二个结局条件独立)。 - M₁ 的额外假设(Assumption 2):\(X \perp\!\!\!\perp R_2 \mid (R_1, Y_2)\) 且 \(Y_1 \perp\!\!\!\perp R_2 \mid (X, R_1, Y_2)\)。这导致完整数据分解为:
可观测数据:研究者实际能观测到的是 \(O_i = (X_i, R_{1i}, R_{1i}Y_{1i}, R_{2i}, R_{2i}Y_{2i})\)。当 \(R_{1i}=0\) 时,\(Y_{1i}\) 缺失;当 \(R_{2i}=0\) 时,\(Y_{2i}\) 缺失。研究者想要但观测不到的是缺失的 \(Y_1\) 和/或 \(Y_2\) 的值,以及完整的联合分布。识别依赖于假设:通过观测到的条件分布(如 \(f(Y_2|X, R_1=1, R_2=1)\))和响应概率的积分方程,可以唯一恢复缺失的组件。
第二步:讲最小内核¶
最简特例:假设 \(Y_1\) 和 \(Y_2\) 都是二元变量,\(X\) 是离散的(取有限个值),且忽略 \(X\) 或将其视为分层变量。此时,识别条件退化为秩条件。
考虑 M₁ 的识别(Theorem 1)。核心方程是:
核心思路:整篇论文的数学本质是通过积分方程(或线性系统)的唯一可解性来识别缺失机制参数,然后基于观测数据似然比较两个候选模型。最小内核就是:在离散/有限维情形下,识别等价于一个矩阵的秩条件;模型选择等价于比较两个参数化模型拟合的观测数据似然,用 Vuong 检验判断它们是否可区分以及哪个更优。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在序贯结局(\(Y_1, Y_2\))都可能非随机缺失的纵向研究中,如何从两个可识别的候选缺失机制图族(M₁:\(R_1 \to R_2\);M₂:\(Y_1 \to R_2\))中选择更合适的模型,并基于所选模型进行下游泛函的推断。
- 核心工具/方法:① 基于完备性/秩条件的非参数识别;② 基于 EM 算法的似然估计;③ 两阶段 Vuong 型模型选择程序(第一阶段检验观测可区分性,第二阶段比较 KL 散度);④ 选择后推断理论(固定优势下 Wald 区间有效,边界情形需选择调整区间)。
- 主要结论:① 在 Assumptions 1-3 及完备性/秩条件下,M₁ 和 M₂ 的完整数据分布均可识别;② 两阶段程序在模拟中表现出良好的选择准确性(样本量≥2000时接近100%);③ 当所选模型有固定正期望对数似然优势时,普通 Wald 推断仍渐近有效;④ Job Corps 数据应用显示 M₁ 被选中,且间接效应(NIE)显著为正。
关键设定与假设¶
- Assumption 1(\(R_1 \perp\!\!\!\perp Y_2 \mid (Y_1, X)\)):这是时序排除限制,即给定早期结局和协变量,早期响应指示符对后期结局无额外预测力。这是两个候选模型共享的结构假设。
- Assumption 2(M₁ 的独立性):\(X \perp\!\!\!\perp R_2 \mid (R_1, Y_2)\) 和 \(Y_1 \perp\!\!\!\perp R_2 \mid (X, R_1, Y_2)\)。这刻画了 M₁ 图(图1(f))中 \(R_2\) 只依赖于 \(R_1\) 和 \(Y_2\),而不直接依赖于 \(X\) 或 \(Y_1\)。
- Assumption 3(M₂ 的独立性):\(R_1 \perp\!\!\!\perp R_2 \mid (X, Y_1)\),\(R_1 \perp\!\!\!\perp R_2 \mid (Y_1, Y_2)\),\(X \perp\!\!\!\perp R_2 \mid (Y_1, R_1, Y_2)\)。这刻画了 M₂ 图(图1(i))中 \(R_2\) 只依赖于 \(Y_1\) 和 \(Y_2\),而两个响应指示符在给定实质变量后条件独立。
- 完备性条件(Theorem 1 和 2):要求条件分布族 \(\{f(Y_2|X, R_1=r_1, R_2=1): x \in \text{supp}(X)\}\) 关于 \(Y_2\) 是完备的(或离散情形下矩阵列满秩)。这是非参数识别的核心条件,确保积分方程有唯一解。
- 混合分离条件(Theorem 1):要求 \(f(Y_2|Y_1=1,X) \neq f(Y_2|Y_1=0,X)\),用于从 \(f(Y_2|X)\) 的混合中唯一解出 \(P(Y_1|X)\)。
- 相比已有文献:本文的假设与 Miao et al. (2016)、Sun et al. (2018) 等类似,但专门针对序贯设定,并允许两个结局都缺失。与 Li et al. (2023) 的自删失模型相比,本文额外考虑了跨过程的依赖(\(R_1 \to R_2\) 或 \(Y_1 \to R_2\))。
主要结果¶
- Theorem 1(M₁ 识别):在 Assumptions 1-2 下,若对每个 \(r_1 \in \{0,1\}\),条件分布族 \(\{f(Y_2|X, R_1=r_1, R_2=1): x \in \text{supp}(X)\}\) 关于 \(Y_2\) 完备,且 \(f(Y_2|Y_1=1,X)\) 与 \(f(Y_2|Y_1=0,X)\) 几乎处处不同,则响应优势函数 \(\xi_{1,r_1}(Y_2)\) 和完整数据分布 \(f_{M_1}\) 被识别。
- Theorem 2(M₂ 识别):在 Assumptions 1 和 3 下,若对几乎每个 \(x\),矩阵 \(\Gamma(x)\)(由 \(f(X=x, Y_1=y_1, R_1=1, R_2=r_2)\) 构成)秩为2,且对每个 \(y_1\),条件分布族 \(\{f(Y_2|X, Y_1=y_1, R_1=1, R_2=1): x \in \text{supp}(X)\}\) 关于 \(Y_2\) 完备,则 \(\xi_1(x,y_1)\)、\(\xi_{2,y_1}(Y_2)\) 和完整数据分布 \(f_{M_2}\) 被识别。
- Theorem 3(方差检验统计量渐近分布):在 \(H_1^0: \omega^2_*=0\) 下,\(\hat{T}_n = n\hat{\omega}^2_n\) 依分布收敛到 \(\sum_{j=1}^{p+q} \lambda_j^2 \chi^2_{1,j}\),其中 \(\lambda_j\) 是矩阵 \(W\) 的特征值。这用于第一阶段检验。
- Theorem 4(模型选择统计量渐近正态):当 \(\omega^2_*>0\) 且 \(H_2^0\) 成立时,\(\hat{V}_n = LR_n/(\sqrt{n}\hat{\omega}_n) \xrightarrow{d} N(0,1)\)。这用于第二阶段比较。
- Theorem 5(选择后推断有效性):若数据生成律固定且 \(\mu_*>0\)(M₁ 有固定正期望似然优势),则 \(\sqrt{n}(\hat{\tau}_{M_1} - \tau_{M_1}^*) \mid \{\hat{c}=M_1\} \xrightarrow{d} N(0, V_{M_1})\),且普通 Wald 区间渐近覆盖 \(1-\alpha\)。
- Corollary 1(一致选择):在相同条件下,\(P(\hat{c}=M_1) \to 1\)。
证明路线与技术技巧¶
整体路线(以 M₁ 识别为例): 1. Step 1:利用 Assumption 2 将 \(P(R_2|R_1,Y_2)\) 与观测数据通过积分方程联系起来(方程(4))。 2. Step 2:由完备性条件(Lemma 3)保证积分方程的唯一解,从而识别 \(P(R_2|R_1,Y_2)\)。 3. Step 3:利用 Assumption 1 和已识别的 \(P(R_2|R_1,Y_2)\),从观测数据中恢复 \(f(Y_2|Y_1,X)\)。 4. Step 4:通过全概率公式和混合分离条件,从 \(f(Y_2|X)\) 中解出 \(P(Y_1|X)\),进而得到 \(f(Y_1,R_1|X)\)。
模型选择证明路线: 1. 定义 KLIC 和伪真参数 \(\theta^*_{M_1}, \theta^*_{M_2}\)。 2. 第一阶段:检验 \(\omega^2_* = \text{Var}(\log f_{M_1}/f_{M_2}) = 0\)。在 \(H_1^0\) 下,利用二阶展开和 M-估计理论,证明 \(n\hat{\omega}^2_n\) 收敛到加权卡方分布(Theorem 3)。 3. 第二阶段:当 \(\omega^2_*>0\) 时,利用中心极限定理和 Slutsky 引理,证明 \(\hat{V}_n \xrightarrow{d} N(0,1)\)(Theorem 4)。 4. 选择后推断:在固定优势下,利用选择概率趋于1,条件分布与无条件分布渐近等价(Theorem 5)。在边界情形(\(\sqrt{n}\mu_* \to \delta\)),推导联合正态极限和选择正态条件分布,构造弹性置信区间(附录H.3)。
关键跳跃点: - 从积分方程到唯一解的跳跃依赖于完备性条件,这是非参数识别的核心难点。作者在离散情形下将其转化为秩条件,并给出具体例子。 - 第一阶段检验的渐近分布是加权卡方,因为 \(\hat{\omega}^2_n\) 在 \(H_1^0\) 下是退化统计量,其极限分布由参数估计的协方差矩阵的特征值决定。这需要复杂的矩阵计算(Lemma A of Vuong 1989)。 - 选择后推断中,边界情形的选择正态分布需要联合展开和条件极限,作者在附录H.3中给出了完整的推导,包括 oracle 区间、置信集和弹性区间。
技术技巧点名: - 完备性/秩条件:用于识别积分方程的唯一解(Lemma 3)。 - EM 算法:用于参数估计,处理缺失数据(附录E)。 - Vuong 检验:用于非嵌套/重叠模型的似然比检验(Section 4)。 - 加权卡方分布:第一阶段检验的极限分布(Theorem 3)。 - M-估计理论:用于推导 MLE 的渐近性质(Assumption 5)。 - 联合展开与选择正态分布:用于边界情形的选择后推断(附录H.3)。
真实例子与应用¶
Job Corps 数据(Section 7): - 数据:美国国家 Job Corps 研究,14125 名年轻人,随机分配到实验组(提供 Job Corps 项目)或对照组。早期结局 \(Y_1\):30个月时是否获得教育/职业资格(如 GED)。后期结局 \(Y_2\):第四年周薪。13个基线协变量。 - 缺失情况:1285 人仅缺失 \(Y_1\),1563 人仅缺失 \(Y_2\),1666 人两者都缺失。 - 方法应用:分别拟合 M₁ 和 M₂ 模型,计算最大似然值和目标泛函(\(\tau_{SC}\)、自然间接效应 NIE、自然直接效应 NDE)。两阶段程序选择 M₁。 - 结果:M₁ 的 LogLik = -92445.24,M₂ 的 LogLik = -93287.55,M₁ 被选中。在 M₁ 下,NIE = 9.25 (95% CI: [7.56, 10.95]),NDE = 6.28 (95% CI: [-0.88, 13.45]),\(\tau_{SC} = 54.52\) (95% CI: [45.86, 63.17])。 - 说明:该例子展示了如何在实际数据中应用模型选择程序,并基于所选模型进行因果效应估计。结果支持 M₁(即第二个结局的缺失依赖于第一个结局是否被观测到)比 M₂(依赖于第一个结局的取值)更符合数据。
🔎 结论是否比证明窄¶
- Theorem 5 的结论要求“数据生成律固定且 \(\mu_*>0\)”,即所选模型有固定正期望似然优势。但作者在附录H.3中处理了更一般的边界情形(\(\sqrt{n}\mu_* \to \delta\)),并指出此时需要选择调整的置信区间。正文中仅给出固定优势下的简单结果,未强调边界情形的复杂性。读者可能误以为普通 Wald 区间总是有效。
- Corollary 1 声称“一致选择”,但这是点wise的(对固定数据生成律),而非 uniform over 参数空间。作者在附录H.3末尾明确说明“The results are pointwise for the cases \(\sqrt{n}\mu_{*,n} \to \delta\) and \(\mu_*>0\); they do not claim uniform validity over all intermediate sequences.” 但正文中未提及这一限制。
- 模拟中(Section 6.3),当真实机制属于 M₁,₂(两个候选模型都错误)时,Stage 2 的“无偏好”频率很高(93-96%),但作者指出这不应被解释为正确选择率。然而,正文中未给出当两个模型都错误时如何解释选择结果的正式理论。
四、开放问题¶
-
扩展到更一般的纵向设定:本文仅考虑两个时间点的序贯结局。作者在 Discussion 中写道:“extending the proposed framework to more general longitudinal or time-series settings with repeated outcomes and response indicators is an important direction.” 具体要解决的问题是:当有多个时间点(\(Y_1, Y_2, \dots, Y_T\))且每个都可能非随机缺失时,如何定义候选图族、建立识别条件并设计模型选择程序?这需要处理更复杂的图结构和更高的计算成本。
-
放松协变量不影响缺失指示符的假设:作者在 Discussion 中写道:“relaxing the assumption that some covariates do not directly affect the missingness indicators would require new identification results and estimation methods.” 当前假设(Assumptions 2 和 3)中,\(X\) 对 \(R_2\) 的影响被限制为通过 \(R_1\) 或 \(Y_1\) 间接作用。如果 \(X\) 直接作用于 \(R_2\),识别条件需要重新推导,可能涉及更复杂的完备性条件或工具变量。
-
处理 M₁,₂ 类不可识别的情况:附录C.2 给出了图1(j)(属于 M₁,₂)不可识别的反例。作者在正文中明确将 M₁,₂ 排除在主比较之外。一个开放问题是:是否可能通过额外假设(如参数模型、单调性、或工具变量)使 M₁,₂ 中的某些子图可识别?如果可以,如何将其纳入模型选择框架?
-
选择后推断的均匀有效性:附录H.3 中的弹性区间是点wise有效的,但作者声明“they do not claim uniform validity over all intermediate sequences.” 一个重要的开放问题是:能否构造在参数空间上均匀有效的选择后置信区间?这需要处理 \(\mu_*\) 接近零或为负时的非正则行为,可能涉及更精细的渐近理论(如局部渐近框架下的 minimax 调整)。
Maintained by 陈星宇 · Homepage · Source on GitHub