Emputation: Identification-Guided Neural Imputation Framework¶
作者: Yanjiao Yang, Yikun Zhang, Xinwei Shen, Yen-Chi Chen
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2607.05279
一、领域脉络与小综述¶
这个方向是什么¶
缺失数据是实证研究中的普遍问题。处理缺失数据的主流策略之一是插补(imputation):用模型填充缺失值,使得后续分析可以在完整数据上使用标准方法。插补的核心挑战在于:缺失值的分布(即外推分布,extrapolation distribution)从观测数据本身是不可识别的,必须依赖缺失机制假设(如 MCAR、MAR、MNAR)来保证识别性。传统统计方法通常选择简单的参数模型(如多元正态)并配合明确的缺失假设,可解释性强但可能无法捕捉复杂分布;而现代深度生成方法(如 VAE、GAN、扩散模型)能灵活拟合高维分布,但其训练目标往往不显式编码缺失假设,且多数在 MCAR/MAR 下评估,对 MNAR 的扩展有限。本文提出的 Emputation 框架试图桥接这两条路线:将缺失假设(以模式混合模型形式)直接嵌入到基于能量分数的深度生成训练目标中,使得神经网络学习的目标分布正是由该假设所识别的外推分布。
发展脉络(history)¶
-
奠基工作:Little (1993) 提出模式混合模型(pattern mixture model, PM),将联合分布分解为响应模式的边际分布和模式特定的数据分布,并指出外推密度不可识别,需要施加识别限制。Molenberghs et al. (1998) 提出 ACMV 假设,并证明在单调缺失下 ACMV 等价于 MAR。Daniels & Hogan (2008) 系统总结了 PM 框架下的识别理论与贝叶斯推断。这些工作奠定了缺失数据识别的理论基础,但模型通常较简单(如参数化或半参数化),难以扩展到高维复杂数据。
-
主要进展:在识别理论方面,Chen (2022) 提出模式图(pattern graphs),用图结构刻画非单调缺失下的识别限制;Suen & Chen (2026) 进一步提出树图(tree graphs),为每个非完整模式指定唯一父模式,通过路径分解实现非参数识别。在深度生成插补方面,Yoon et al. (2018) 提出 GAIN(基于 GAN),Mattei & Frellsen (2019) 提出 MIWAE(基于 VAE),Tashiro et al. (2021) 提出 CSDI(基于扩散模型)。这些方法在 MCAR/MAR 下表现良好,但直接条件采样困难,且评估多聚焦于点预测精度(RMSE),对分布对齐关注不足。
-
当前 frontier 与本文位置:近期工作开始将深度生成模型扩展到 MNAR,如 Ipsen et al. (2021) 的 not-MIWAE、Ma & Zhang (2021) 的可识别生成模型、Ghalebikesabi et al. (2021) 的模式集混合模型。然而,这些方法通常依赖潜变量模型和变分推断,训练目标并非直接由识别假设驱动。本文提出 Emputation,首次将 PM 框架下的识别假设(MCAR、CCMV、树图、单调缺失假设)系统地转化为深度生成模型的训练目标,通过掩码模式(masked pattern)和选择函数(selection function)编码识别策略,并利用能量分数的严格适当性保证总体最小化器恢复目标外推分布。作者在引言中明确将自身定位为“桥接统计与机器学习两个社区”。
子线索聚类¶
- 模式混合模型与识别理论:Little (1993)、Molenberghs et al. (1998)、Daniels & Hogan (2008)、Chen (2022)、Suen & Chen (2026)、Daniels et al. (2023)、Tchetgen et al. (2018)。这一簇关注如何通过限制条件(如 CCMV、ACMV、NCMV、树图)识别外推分布,以及贝叶斯推断方法。
- 深度生成插补:Yoon et al. (2018)、Li et al. (2019)、Mattei & Frellsen (2019)、Nazabal et al. (2020)、Tashiro et al. (2021)、Ouyang et al. (2023)、Zhang et al. (2025)。这一簇关注用 VAE、GAN、扩散模型等灵活模型进行插补,但训练目标通常不显式编码缺失假设。
- MNAR 下的深度生成模型:Ipsen et al. (2021)、Ma & Zhang (2021)、Ghalebikesabi et al. (2021)。这一簇尝试将深度生成模型扩展到 MNAR,但方法多基于潜变量模型和变分推断,与 PM 框架的识别假设结合不直接。
这个方向在追问的核心问题¶
- 如何将缺失数据识别假设系统性地嵌入深度生成模型的训练目标,使得学习到的分布正是由该假设所识别的外推分布?
- 在非单调缺失、MNAR 等复杂设定下,如何设计可扩展的深度插补方法,同时保持分布对齐而非仅点预测精度?
- 不同缺失假设(如 MCAR、CCMV、树图)对应的训练目标如何统一在一个框架下?
- 当前深度生成插补方法的理论保证(如识别性、渐近性质)仍不充分,如何建立?
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
作者将缺口 frame 为:“统计社区使用简单模型但可解释,机器学习社区使用深度模型但训练目标不编码缺失假设”——因此本文的“显然的下一步”是:将模式混合模型中的识别假设转化为深度生成模型的训练目标,从而同时获得灵活性和识别保证。作者通过掩码模式和选择函数这两个设计元素来统一不同假设,并强调能量分数的严格适当性保证了总体最优性。
被淡化或回避的竞争路线:作者在引言中简要提及了 not-MIWAE、Ma & Zhang (2021) 等 MNAR 深度生成方法,但未详细比较其与 Emputation 在识别假设表达上的差异。这些方法通过潜变量模型建模缺失机制,而 Emputation 通过 PM 框架直接指定外推分布,两者在识别策略上本质不同。作者未讨论哪种策略更优或更灵活。
什么明显该被引/该存在、却没出现在 intro 里? 作者未引用 Robins (1997) 关于非单调缺失下非参数识别限制的经典工作,也未引用 Vansteelandt et al. (2006) 关于敏感性分析的工作。此外,关于深度生成插补的理论分析(如 Mattei & Frellsen 2019 中关于 VAE 插补的识别性讨论)未被深入引用。这些可能是研究者值得去查的文献。
张力¶
未见明显对立引用。各条线索在各自设定下自洽,但不同缺失假设(如 MCAR vs. CCMV)对同一数据可能给出不同外推分布,这在实际应用中需要通过敏感性分析处理——本文在真实数据应用中也展示了这一点。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(X \in \mathbb{R}^d\):完整数据向量,可能含有缺失值。
- \(R \in \{0,1\}^d\):响应向量,\(R_j = 1\) 表示 \(X_j\) 被观测到,\(R_j = 0\) 表示缺失。
- \(\bar{R} = \mathbf{1}_d - R\):缺失指示的补集。
- 对于给定模式 \(r \in \{0,1\}^d\),\(X_r = (X_j : r_j = 1)\) 表示观测到的分量,\(X_{\bar{r}} = (X_j : r_j = 0)\) 表示缺失的分量。
- 观测数据:\((X_R, R)\),即观测到的部分和响应模式。
- 样本:\(\{(X_i, R_i)\}_{i=1}^n\) i.i.d.。
- \(|r| = \sum_j r_j\):模式大小。
- \(r_1 > r_2\):若 \(r_{1,j} \ge r_{2,j}\) 对所有 \(j\) 成立且至少一处严格大于。
- \(\mathcal{R} = \{r \neq \mathbf{1}_d : P(R=r) > 0\}\):非完整模式集合。
- 假设 \(P(R=\mathbf{1}_d | X) > 0\) a.s.。
- 外推分布:\(p(x_{\bar{r}} | x_r, r)\),即给定观测值和模式时缺失变量的条件分布。这是插补的目标,但不可识别。
-
模式混合模型分解:\(p(x, r) = p(x_{\bar{r}} | x_r, r) \, p(x_r, r)\),其中 \(p(x_r, r)\) 是可观测的,\(p(x_{\bar{r}} | x_r, r)\) 需要识别假设。
-
模型:数据生成机制由联合分布 \(p(x, r)\) 描述,但研究者只观测到 \((X_R, R)\)。插补的目标是学习外推分布 \(p(x_{\bar{r}} | x_r, r)\)。Emputation 假设该分布由某个识别假设(如 MCAR、CCMV)唯一确定,然后用神经网络 \(f_\theta\) 来近似它。神经网络 \(f_\theta: \mathbb{R}^d \times \{0,1\}^d \to \mathbb{R}^d\) 以噪声填充的观测和模式为输入,输出完整向量的预测。对于给定模式 \(r\),缺失部分的输出 \([f_\theta(x_r, \epsilon_{\bar{r}}, r)]_{\bar{r}}\) 定义了条件分布 \(p_{f_\theta}(\cdot | x_r, r)\)。
-
可观测数据:研究者实际观测到的是 \(\{(X_{i, R_i}, R_i)\}_{i=1}^n\),即每个样本的观测部分和缺失模式。完整数据 \(X_i\) 从未被完全观测到(除非 \(R_i = \mathbf{1}_d\))。外推分布 \(p(x_{\bar{r}} | x_r, r)\) 是想要但观测不到的,只能通过假设来识别。
第二步:讲最小内核——MCAR 下的 Emputation¶
最简特例:假设缺失机制为 MCAR(完全随机缺失),即 \(R \perp X\)。此时外推分布简化为 \(p(x_{\bar{r}} | x_r, r) = p(x_{\bar{r}} | x_r)\),与模式 \(r\) 无关。特别地,对于任意两个模式 \(r' > r\),有 \(p(x_{r'-r} | x_r, r) = p(x_{r'-r} | x_r, r')\),即缺失部分的条件分布等于在更完整模式下的对应条件分布。
Emputation 在 MCAR 下的构造: - 目标:学习一个神经网络 \(f\),使得对于每个模式 \(r\),其输出 \([f(x_r, \epsilon_{\bar{r}}, r)]_{\bar{r}}\) 的分布等于 \(p(x_{\bar{r}} | x_r)\)。 - 训练数据:每个观测 \(i\) 有模式 \(R_i\)。对于每个目标模式 \(r < R_i\)(即 \(r\) 比 \(R_i\) 缺失更多),我们可以利用观测 \(i\) 中比 \(r\) 多出来的那部分变量 \(X_{i, R_i - r}\) 作为“伪目标”,来训练 \(f\) 在模式 \(r\) 下的输出。 - 掩码模式:\(M_r(R_i) = R_i - r\)(即观测 \(i\) 中比模式 \(r\) 多出的坐标)。 - 选择函数:\(S_r(R_i) = \frac{1}{|R_i - r|} \mathbb{I}(r < R_i)\)(权重为多出变量数的倒数,防止大模式主导)。 - Emputation 风险(总体形式):
为什么这能恢复目标分布: - 能量分数是严格适当的:对于固定 \(x_r\),期望 \(-\text{ES}(p_f(\cdot | x_r, r), X_{R-r})\) 在 \(p_f(\cdot | x_r, r) = p(\cdot | x_r, R)\) 时唯一最小化。 - 在 MCAR 下,\(p(\cdot | x_r, R) = p(\cdot | x_r)\)(与 \(R\) 无关),且由于 \(R > r\),\(X_{R-r}\) 的条件分布正是 \(p(x_{R-r} | x_r)\)。 - 因此,总体风险的最小化迫使 \(p_f(x_{\bar{r}} | x_r, r) = p(x_{\bar{r}} | x_r)\),即恢复目标外推分布。
核心思路:通过掩码和选择,将识别假设(MCAR 下外推分布与模式无关)转化为一个监督学习问题:用更完整的观测来“教”网络在较不完整模式下的缺失部分分布。能量分数确保学习的是整个条件分布而非仅均值。
三、这篇论文做了什么¶
三句话¶
- 研究问题:如何将缺失数据识别假设(如 MCAR、CCMV、树图、单调缺失假设)系统地嵌入深度生成模型的训练目标,使得学习到的插补模型恢复由该假设所识别的外推分布。
- 核心工具/方法:提出 Emputation 框架,基于能量分数(engression 的扩展),通过掩码模式(masked pattern)和选择函数(selection function)编码识别假设,用神经网络参数化条件分布,并通过最小化 emputation 风险进行训练。
- 主要结论:在 MCAR、CCMV、树图、单调缺失(m-ACMV、m-CCMV、m-NCMV)假设下,emputation 风险的总体最小化器恢复正确的目标外推分布(定理 3.1-3.3、4.1、推论 4.2)。模拟实验显示 emputation 在分布对齐指标(能量距离、MMD²)上优于 MICE、missForest、GAIN 等基线;在 NACC 阿尔茨海默病数据上,emputation 与 MICE 结果一致,而完整病例分析存在偏差。
关键设定与假设¶
- 基本设定:数据 \((X, R)\) 来自模式混合模型,\(P(R=\mathbf{1}_d | X) > 0\) a.s.。神经网络 \(f_\theta\) 以噪声填充的观测和模式为输入,输出完整向量。训练使用 i.i.d. 样本。
- 识别假设:
- MCAR:\(R \perp X\)。外推分布 \(p(x_{\bar{r}} | x_r, r) = p(x_{\bar{r}} | x_r)\)。
- CCMV:\(p(x_{\bar{r}} | x_r, r) = p(x_{\bar{r}} | x_r, R=\mathbf{1}_d)\),即用完整病例的条件分布代替。
- 树图:每个非完整模式 \(r\) 有唯一父模式 \(\text{PA}(r) > r\),且 \(p(x_{\bar{r}} | x_r, r) = p(x_{\bar{r}} | x_r, R=\text{PA}(r))\)。通过路径分解为一步条件分布。
- 单调缺失假设(m-ACMV、m-CCMV、m-NCMV):针对单调缺失(如纵向研究中的 dropout),通过参考集 \(\omega(s)\) 识别一步预测分布 \(p(x_{s+1} | x_{\le s}, T=s)\)。
- 相比已有文献的放宽/强化:相比传统 PM 模型(通常用参数模型),Emputation 使用神经网络,更灵活;相比深度生成插补(如 GAIN、MIWAE),Emputation 显式编码识别假设,且训练目标直接对应外推分布,而非仅启发式。但 Emputation 目前仅覆盖了 PM 框架下的部分假设(非单调 MAR 未覆盖),且假设树图或单调结构已知。
主要结果¶
定理 3.1(MCAR):设 \(f^*\) 为 MCAR emputation 风险的总体最小化器。则对于任意模式 \(r\) 和给定 \((x_r, r)\),输出 \(\hat{X}_{\bar{r}} = [f^*(x_r, \epsilon_{\bar{r}}, r)]_{\bar{r}}\) 的密度满足 \(p_{f^*}(x_{\bar{r}} | x_r, r) = p(x_{\bar{r}} | x_r)\)。直觉:能量分数的严格适当性 + MCAR 下 \(p(\cdot | x_r, R) = p(\cdot | x_r)\)。必要条件:MCAR 假设成立;能量分数严格适当;总体风险可交换期望与求和。
定理 3.2(CCMV):类似地,CCMV emputation 风险的总体最小化器恢复 \(p(x_{\bar{r}} | x_r, R=\mathbf{1}_d)\)。技术难点:选择函数限制训练样本为完整病例,掩码模式为 \(\bar{r}\),需证明加权平均后的风险最小化仍指向正确分布。
定理 3.3(树图):树图 emputation 风险的总体最小化器恢复一步条件分布 \(p(x_{\text{PA}(r)-r} | x_r, R=\text{PA}(r))\),进而通过路径分解恢复完整外推分布。关键:树图假设保证了路径分解的唯一性和可识别性。
定理 4.1(m-ACMV):单调缺失下,m-ACMV emputation 风险的总体最小化器恢复 \(p(x_{s+1} | x_{\le s}, T \ge s+1)\),等价于 MAR 下的外推分布。
推论 4.2(m-CCMV、m-NCMV):类似结果,选择函数分别改为 \(I(T_i = d)\) 和 \(I(T_i = s+1)\)。
证明路线与技术技巧¶
整体路线(以 MCAR 为例): 1. 写出总体风险 \(\mathbb{E}[\hat{L}(f)]\),利用 i.i.d. 和期望线性性,将其表示为对 \((X_R, R)\) 和噪声 \(\epsilon\) 的期望。 2. 利用能量分数的定义,将风险重写为 \(\mathbb{E}_{X_R, R} \left[ \sum_{r < R} \frac{1}{|R-r|} \left( -\text{ES}(p_f(\cdot | x_r, r), X_{R-r}) \right) \right]\)。 3. 对每个固定的 \((x_r, r)\),内层期望 \(\mathbb{E}_{X_{R-r} \sim p(\cdot | x_r, R)} [-\text{ES}(p_f(\cdot | x_r, r), X_{R-r})]\) 在 \(p_f(\cdot | x_r, r) = p(\cdot | x_r, R)\) 时唯一最小化(能量分数严格适当)。 4. 在 MCAR 下,\(p(\cdot | x_r, R) = p(\cdot | x_r)\),且由于 \(R > r\),\(X_{R-r}\) 的条件分布正是 \(p(\cdot | x_r)\)。因此总体最小化器满足 \(p_{f^*}(x_{\bar{r}} | x_r, r) = p(x_{\bar{r}} | x_r)\)。 5. 对于 CCMV 和树图,类似步骤,但需将条件分布替换为完整病例或父模式下的分布,并相应调整选择函数。
关键跳跃点: - 能量分数的严格适当性保证了“点态”最优性:对于每个 \((x_r, r)\),风险分解后内层期望的最小化是独立的。这依赖于风险中求和与期望的可交换性,以及选择函数不依赖于 \(f\)。 - 在树图情况下,需要证明路径分解后的一步风险最小化足以恢复完整外推分布。这通过归纳法完成:先证明一步条件分布正确,然后利用乘积公式。
技术技巧点名: - 能量分数(energy score):作为严格适当的评分规则,用于学习条件分布而非仅均值。其形式为 \(\text{ES}(P, y) = \frac{1}{2} \mathbb{E}\|Y-Y'\| - \mathbb{E}\|Y-y\|\),第一项防止分布坍缩,第二项鼓励接近观测。 - 掩码模式与选择函数:将识别假设编码为数据变换和样本权重,使得不同假设只需修改这两个组件,框架统一。 - 路径分解(path decomposition):在树图和单调缺失下,将高维外推分布分解为一系列一维条件分布,降低学习难度,并允许顺序插补。 - 顺序插补(sequential imputation):训练后,对每个不完整观测,沿树图路径或单调顺序逐步填充缺失值,每一步使用已观测和已填充的部分作为输入。
真实例子与应用¶
数据:NACC(National Alzheimer’s Coordinating Center)数据,包含 4906 名有尸检数据的参与者。变量包括人口学(年龄、性别、种族、教育)、遗传(APOE ε4/ε2 携带状态)、临床(BMI、收缩压、老年抑郁量表 GDS、利尿剂使用)以及 AD 神经病理学评分(ADNC)。目标:分析认知弹性(resilience,在高 AD 病理下保持认知正常)和认知抵抗(resistance,在低 AD 病理下保持认知正常)的预测因素。
如何应用: - 缺失变量:BMI、收缩压、GDS 缺失率 40-50%,仅 36% 为完整病例。 - Emputation 在 MCAR 和 CCMV 假设下训练,并与 MICE 和完整病例分析(CC)比较。 - 分析模型:分别对弹性(ADNC 中/高子集)和抵抗(ADNC 低/无子集)拟合逻辑回归,报告 OR 和 95% 自助法置信区间。 - 敏感性分析:使用树图 emputation 和指数倾斜(exponential tilting)评估对 CCMV 假设的偏离。
结果: - 弹性模型:APOE ε4 携带与较低弹性相关(所有方法一致);女性与较高弹性相关;利尿剂使用在 MICE 和 emputation 下显著,CC 下不显著。 - 抵抗模型:APOE ε4 与较低抵抗相关;教育越高抵抗越高;GDS 与较低抵抗相关(MICE 和 emputation 显著,CC 不显著)。 - 完整病例分析在多个变量上估计值偏离,且置信区间更宽,提示选择偏倚。 - 树图 emputation 结果与 MCAR/CCMV 一致,支持结论稳健性。 - 敏感性分析显示主要关联(年龄、性别、APOE ε4、利尿剂)对 CCMV 偏离稳健,而 BMI 和 GDS 的关联较敏感。
这个例子想说明:Emputation 能在真实高缺失率数据中应用,且通过不同假设的敏感性分析增强结论可信度;相比完整病例分析,emputation 利用了更多观测信息,结果更稳定。
🔎 结论是否比证明窄¶
- 定理 3.1-3.3 和 4.1 严格证明了在相应假设下总体最小化器恢复目标分布。但论文未证明有限样本性质(如收敛速度、一致性),也未讨论神经网络近似误差的影响。作者在结论中承认“当前框架覆盖了单调缺失下的 MAR,但与非单调 MAR 的联系尚不明确”——这比证明的设定窄。
- 模拟中 emputation 在 MAR 下表现良好,但论文未提供理论保证,仅作为实证观察。
- 论文未讨论 emputation 估计量的半参数效率或 minimax 最优性,这些是研究者可能关心的理论问题。
四、开放问题(点到为止,扎根具体语句)¶
-
非单调 MAR 下的 emputation:论文仅覆盖了单调缺失下的 MAR(m-ACMV),但“extending emputation to nonmonotone MAR as well as to other nonparametric identification assumptions would broaden the class”(Section 8)。具体要解决的问题:如何为非单调 MAR 设计掩码模式和选择函数?非单调 MAR 的识别条件在 PM 框架下如何表达?这扎根于论文 Section 8 第一点。
-
其他评分规则的影响:“other distributional objectives, such as other kernel scoring rules, could also be incorporated”(Section 8)。具体问题:不同评分规则(如能量分数 vs. 最大均值差异 MMD)对插补性能的理论保证和实际效果有何差异?能量分数的严格适当性在有限样本下是否最优?这扎根于 Section 8 第二点。
-
选择模型的神经网络实现:“how to train neural generative imputation models under assumptions formulated through selection models remains an open problem”(Section 8)。选择模型(如 Diggle & Kenward 1994)通过建模缺失机制来识别,与 PM 框架互补。具体问题:能否将选择模型的似然或条件概率嵌入深度生成训练?这扎根于 Section 8 第三点。
-
有限样本理论:论文仅给出总体最优性,未提供收敛速率或一致性。研究者可追问:在神经网络函数类下,emputation 估计量的收敛速度如何?是否达到 minimax 最优?这扎根于论文未讨论的部分,但可从定理的总体性质自然延伸。建议去读同子领域近期约 5 篇的 intro(如深度生成插补的理论分析),确认这是否为共识 gap。
Maintained by 陈星宇 · Homepage · Source on GitHub