A New Look at Gaussian Mixtures in the Presence of Missing-at-Random Responses and Covariates¶
作者: Hung Tong, Antonio Punzo, Cristina Tortora
主题: 其他
相关性: 6/10
链接: https://arxiv.org/abs/2608.03757
一、领域脉络与小综述¶
这个方向是什么¶
本文处理的核心问题是:在响应变量 (Y) 和协变量 (X) 都含有缺失值的情况下,如何对多元线性回归和基于模型的聚类进行统计推断。缺失机制假设为随机缺失 (MAR),即缺失概率仅依赖于已观测到的数据,而不依赖于未观测到的数据本身。该方向的核心挑战在于:① 缺失值破坏了完整数据下的似然函数结构,需要迭代算法(如 EM)进行参数估计;② 在聚类场景下,缺失值不仅存在于变量中,还存在于未知的类别归属(潜在变量)中,形成双重缺失信息;③ 当协变量本身也是随机变量(而非固定设计)时,它们既参与回归预测,也参与聚类划分(即“分配依赖”),这比固定协变量的混合回归模型更灵活,但也更复杂。
当前该子方向的成熟度:方法学上已有大量工作,但大多局限于响应变量缺失,或协变量缺失但被当作固定值处理。 本文试图填补的缺口是:同时允许响应和协变量在 MAR 下缺失,且协变量是随机的——这在混合回归聚类文献中“很少被涉及”(作者原话)。
发展脉络(history)¶
奠基工作: - Rubin (1976):奠定了缺失数据的统计基础,定义了 MAR / MCAR / MNAR 机制,并证明了在 MAR 且参数可分离时,忽略缺失机制进行似然推断是合理的(ignorability)。这是所有后续工作的理论基石。 - Dempster, Laird & Rubin (1977):提出 EM 算法,为含缺失数据的 ML 估计提供了通用计算框架。本文的整个方法论都建立在此之上。 - Little (1992):专门综述了回归分析中协变量缺失的问题,指出 ML 估计在 MAR 下优于最小二乘法(后者仅对 MCAR 有效),并强调迭代方法的必要性。
主要进展(缺失数据 + 聚类): - Ghahramani & Jordan (1994):首次将 EM 算法用于含缺失值的高斯混合模型(GMM)聚类,不区分响应与协变量。这是本文在聚类部分初始化时直接调用的方法。 - Wang et al. (2004)、Wei et al. (2019)、Pillay et al. (2024):逐步将缺失数据下的混合模型从正态推广到 t 分布、广义双曲分布、偏斜正态分布等,增强了鲁棒性。但这些工作均未区分响应与协变量的角色,即所有变量在聚类中地位平等。 - Sportisse et al. (2024):将缺失机制从 MAR 扩展到 MNAR(非随机缺失),但聚焦于聚类本身,不涉及回归结构。
主要进展(混合回归模型,即 cluster-weighted model): - Hennig (2000):讨论了混合线性回归模型中“分配依赖”与“分配独立”的区别,指出固定协变量假设在应用中可能过于严格。 - Dang et al. (2017):提出了多元响应、多元协变量的高斯 cluster-weighted model,即本文的“无缺失版本”。该工作建立了模型的可识别性条件,并给出了 EM 算法。本文的直接前身——本文的聚类扩展正是将 Dang et al. (2017) 的模型推广到含 MAR 缺失值的情形。
当前 frontier 与本文位置: - 当前前沿:① 处理更复杂的缺失机制(MNAR);② 使用更灵活的分布(非高斯、混合分布族);③ 高维场景下的正则化;④ 贝叶斯方法提供不确定性量化。 - 本文的位置:在 Dang et al. (2017) 的完整数据框架上,添加了 MAR 缺失值的处理,且同时允许响应和协变量缺失。作者声称这是“当前文献中针对回归数据最通用的基于模型的聚类解决方案之一”。
子线索聚类¶
这些被引文献大致落在以下 3 条子线索上:
- 缺失数据机制与推断理论(Rubin 1976, Little 1992, Little & Rubin 2019, Carpenter & Smuk 2021, Mirzaei et al. 2022):关注缺失数据的分类、ignorability 条件、ML 与多重插补的理论基础。本文依赖此线索的结论来证明 MAR 下 EM 算法的合理性。
- 含缺失值的混合模型聚类(Ghahramani & Jordan 1994, Wang et al. 2004, Wei et al. 2019, Pillay et al. 2024, Tong & Tortora 2022):关注如何在聚类中处理缺失值,但不区分响应与协变量。本文的聚类扩展是此线索的一个特化——在混合回归框架下处理缺失值。
- 混合回归模型 / Cluster-weighted model(Hennig 2000, Dang et al. 2017, 以及应用文献如 Veeramisti et al. 2019, Lee et al. 2019):关注回归与聚类的联合建模,协变量可以是随机的。本文的“无缺失版本”直接来自 Dang et al. (2017),本文的贡献是将缺失值处理嵌入此框架。
这个方向在追问的核心问题¶
- 如何在缺失数据下保持回归系数的无偏估计? 当前主流方法:ML(EM 算法)和多重插补(MICE)。瓶颈:EM 需要分布假设正确,MICE 需要正确指定插补模型。
- 如何在聚类中同时利用响应和协变量的信息(分配依赖)? 当前主流方法:cluster-weighted model。瓶颈:固定协变量假设更简单但可能误导聚类。
- 当缺失值同时出现在响应和协变量中时,如何有效进行参数估计? 当前主流方法:将缺失部分视为潜在变量,通过 EM 的 E 步计算条件期望。瓶颈:计算复杂度随缺失模式增加,且需要联合分布假设。
- 如何放松高斯假设以增强鲁棒性? 当前主流方法:使用 t 分布、偏斜正态分布等。瓶颈:这些分布往往失去 EM 步的闭式解,需要数值积分或近似。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成:“现有混合回归模型(如 Dang et al. 2017)假设数据完整,而现有缺失数据聚类方法(如 Ghahramani & Jordan 1994)不区分响应与协变量。因此,将两者结合——在混合回归框架下同时处理响应和协变量的 MAR 缺失——是‘显然的下一步’。”
- 被淡化或回避的竞争路线:
- 多重插补(MICE):作者在模拟中将其作为 baseline(MRRC-GMI),但仅用了最简单的全局均值插补,而非更先进的多重插补(如 MICE 的预测均值匹配)。作者没有讨论为什么 EM 优于多重插补(除了计算简便)。
- 逆概率加权(IPW):在因果推断中处理 MAR 的常用方法,本文完全未提及。这可能是因为本文的目标是聚类而非因果效应估计。
- 非参数或半参数方法:本文完全依赖高斯参数假设,未讨论模型误设的后果。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- Little (1992) “Regression with missing X’s: a review” 被引了,但该综述中讨论的“条件得分法”、“伪似然法”等替代方案未被提及。
- Robins et al. (1994) 关于半参数效率与缺失数据的工作:这是缺失数据领域的重要理论进展,但本文未引用。这可能是因为本文聚焦于参数高斯模型,而非半参数框架。
- 高维缺失数据方法(如 Lasso 在缺失数据下的推广):本文未涉及,但作者在 future work 中提到了正则化。
张力¶
未见明显对立引用。所有被引工作基本在 MAR 假设下使用 EM 算法,方向一致。唯一的张力可能在于:固定协变量 vs. 随机协变量的假设——Hennig (2000) 批评固定协变量假设,而许多应用仍在使用它。本文明确站在随机协变量一侧。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - d = d_X + d_Y:总变量数,其中 d_X 是协变量个数,d_Y 是响应变量个数。 - X (d_X × 1):协变量随机向量。Y (d_Y × 1):响应随机向量。 - β ((1+d_X) × d_Y):回归系数矩阵,包含截距向量 b₀ (d_Y × 1) 和斜率矩阵 B (d_Y × d_X)。即 E[Y|X=x] = βᵀ [1; x] = b₀ + Bx。 - Σ_X (d_X × d_X):协变量的协方差矩阵。Σ_Y (d_Y × d_Y):给定 X 后 Y 的条件协方差矩阵。 - µ_X (d_X × 1):协变量的均值向量。 - ϑ = {µ_X, Σ_X, β, Σ_Y}:全部参数。 - 上标 o / m:表示观测到的 (observed) 和缺失的 (missing) 子向量。例如,对于第 i 个观测,X_i = [X_i^o; X_i^m],维度分别为 d_Xi^o 和 d_Xi^m(不同观测的缺失模式可以不同)。 - n:样本量。k:混合成分个数(聚类时)。 - Z_ij:聚类时的潜在变量,Z_ij = 1 表示第 i 个观测属于第 j 个成分。 - π_j:混合比例,∑π_j = 1。
模型: - 完整数据模型(无缺失):联合分布 p(x, y; ϑ) = p(y|x; β, Σ_Y) · p(x; µ_X, Σ_X),其中: - X ~ N(µ_X, Σ_X) (协变量的边际分布) - Y|X=x ~ N(βᵀ[1; x], Σ_Y) (响应的条件分布) - 这等价于 (X, Y) 联合服从 d 维多元正态分布,其均值与协方差矩阵可由 µ_X, Σ_X, β, Σ_Y 唯一确定(见论文公式 (3) 后的推导)。 - 聚类扩展(MRRC):p(x, y; ϑ) = ∑{j=1}^k π_j · N(y; β_jᵀ[1; x], Σ{Y|j}) · N(x; µ_{X|j}, Σ_{X|j})。
可观测数据: - 对于每个观测 i,我们能观测到的是 X_i^o 和 Y_i^o——即协变量和响应中未缺失的部分。 - 缺失的部分 X_i^m 和 Y_i^m 是不可观测的,只能通过模型假设和观测数据来推断(在 EM 的 E 步中计算条件期望)。 - 此外,在聚类场景下,类别归属 Z_i 也是不可观测的(潜在变量),同样需要在 E 步中估计其后验概率。 - 关键区分:可观测的是部分变量值 + 缺失模式指示器;想要但观测不到的是缺失的变量值 + 类别归属。
第二步:讲最小内核¶
本文的核心思路可以归结为一个最简特例:d_X = 1, d_Y = 1(一元线性回归,一个随机协变量),且只有一个成分(k=1,无聚类)。在这个特例下,所有复杂记号退化为简单形式,但核心数学困难——如何同时处理 X 和 Y 中的 MAR 缺失——已经完整呈现。
最简特例设定: - 模型:X ~ N(µ_X, σ_X²),Y|X=x ~ N(β₀ + β₁ x, σ_Y²)。参数 ϑ = {µ_X, σ_X², β₀, β₁, σ_Y²}。 - 可观测数据:对于每个 i,我们可能观测到 X_i 或缺失(记为 X_i^m),Y_i 或缺失(记为 Y_i^m)。缺失模式有四种可能:(X 观测, Y 观测)、(X 缺失, Y 观测)、(X 观测, Y 缺失)、(X 缺失, Y 缺失)。但论文假设“每行每列至少有一个观测值”,所以排除 (X 缺失, Y 缺失) 的情况(实际上该情况也可处理,但信息量极少)。 - MAR 假设:缺失概率仅依赖于已观测到的值,例如 P(X_i 缺失 | X_i, Y_i) = P(X_i 缺失 | Y_i^o)(如果 Y_i 被观测到)。
核心数学问题: 给定 n 个观测,每个观测可能缺失 X 或 Y(或都不缺),如何用 EM 算法得到 ϑ 的 ML 估计?
EM 算法的核心思想(在这个特例下): 1. E 步:用当前参数估计值 ϑ̇,计算缺失数据的条件期望,填入完整数据对数似然中。 - 如果 X_i 缺失但 Y_i 观测:需要计算 E[X_i | Y_i=y_i, ϑ̇] 和 E[X_i² | Y_i=y_i, ϑ̇]。 - 如果 Y_i 缺失但 X_i 观测:需要计算 E[Y_i | X_i=x_i, ϑ̇] 和 E[Y_i² | X_i=x_i, ϑ̇]。 - 如果两者都缺失:需要计算联合条件期望,但论文假设至少有一个观测,所以此情况被排除。 2. M 步:用“填充后”的完整数据,更新参数 ϑ̈。更新公式与完整数据下的 ML 估计完全相同,只是将缺失值替换为 E 步得到的条件期望。
为什么这个特例抓住了核心? - 当 X 缺失时,条件期望 E[X_i | Y_i] 依赖于联合正态性——这正是论文中 Proposition 3 和 7 在一元情形的退化版本。具体地,在正态假设下,(X, Y) 联合正态,所以 E[X|Y=y] = µ_X + (σ_XY/σ_Y²)(y - µ_Y),其中 µ_Y = β₀ + β₁ µ_X,σ_XY = β₁ σ_X²,σ_Y² = β₁² σ_X² + σ_Y²。这个公式直接给出了缺失 X 的“最优”插补值。 - 当 Y 缺失时,条件期望 E[Y_i | X_i] 就是回归预测 β₀ + β₁ X_i——这很直观。 - 关键洞察:当 X 缺失时,我们不能简单地用 X 的边际均值 µ_X 来插补,而必须利用 Y 的信息(通过联合分布)来获得更准确的条件期望。这正是论文中“条件-边缘分解”的优势所在——它显式地展示了观测到的 Y 如何帮助插补缺失的 X,反之亦然。
在这个特例下,要证的命题退化成什么? - 论文的一般命题(Proposition 7, 8, 9)退化为上述简单条件期望公式。 - 论文的 EM 算法退化为:迭代执行 (a) 用当前参数计算缺失值的条件期望;(b) 用填充后的数据更新参数(µ_X, σ_X² 用样本均值和方差;β₀, β₁ 用 OLS;σ_Y² 用残差方差)。 - 证明路线:由于 (X, Y) 联合正态,条件分布仍是正态,所以 E 步有闭式解;M 步的更新公式是完整数据 ML 估计的直接推广。收敛性由 EM 算法的标准理论保证(Wu, 1983)。
为什么一般情形更复杂? - 多元情形下,缺失模式更复杂(X 的部分分量缺失、Y 的部分分量缺失、两者都有部分缺失),需要分块矩阵求逆来处理条件分布(Proposition 3-6)。 - 聚类情形下,还需要处理类别归属 Z_ij 的缺失,使得 E 步需要计算加权的条件期望(权重为后验概率 ẑ_ij)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在响应变量 Y 和协变量 X 均存在 MAR 缺失值的情况下,如何对多元线性回归(一个成分)和混合多元线性回归(多个成分,用于聚类)进行最大似然估计。
- 核心工具 / 方法:使用条件-边缘分解将 (X, Y) 的联合分布建模为多元正态分布(或混合正态分布),并通过 EM 算法进行参数估计,其中 E 步利用多元正态的条件分布性质得到缺失值的闭式条件期望。
- 主要结论:① 在多元正态假设下,所有 E 步和 M 步的更新均有闭式解,无需数值积分;② 模拟研究表明,该方法在参数恢复和聚类准确性上优于“全局均值插补 + 标准 MRRC”的 baseline,尤其在高维和厚尾分布下优势明显;③ 在 Automobile 数据集上,该方法识别出两个有意义的汽车类别(豪华 vs. 经济型),并给出了可解释的回归系数。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- MAR 假设(第 3 节开头):缺失概率仅依赖于已观测到的数据,不依赖于未观测数据。这是 EM 算法“可忽略性”(ignorability)的前提。相比已有文献(如 Ghahramani & Jordan 1994),本文的 MAR 假设是标准的,未放宽也未加强。
- 联合正态性(公式 2):X ~ N(µ_X, Σ_X),Y|X=x ~ N(βᵀ[1; x], Σ_Y)。这等价于 (X, Y) 联合正态。相比 Dang et al. (2017),本文继承了完全相同的分布假设,只是增加了缺失值。相比 Wei et al. (2019),本文的分布假设更严格(后者使用广义双曲分布,可涵盖厚尾和偏斜)。
- “每行每列至少有一个观测值”(第 1 节):这是最一般的无约束缺失模式。实际上,如果某行所有变量都缺失,它不提供任何信息;如果某列所有值都缺失,该变量不可识别。这个假设是合理的。
- 聚类场景的额外假设(第 4 节):
- 混合成分个数 k 已知(通过 BIC 选择)。
- 各成分内,(X, Y) 服从成分特定的多元正态分布。
- 缺失机制在成分间是“可忽略的”(Sportisse et al., 2024 的条件),即缺失概率不依赖于成分归属。本文认为 MAR 自动满足此条件。
- 可识别性条件(第 4.2 节):引用 Dang et al. (2017) 的条件,即边际混合分布可识别且混合密度存在全序。本文声称在 MAR 下这些条件仍然充分。
主要结果¶
本文是方法型论文,没有传统意义上的“定理”,而是给出了 EM 算法的完整推导和闭式更新公式。核心结果可以归纳为:
- Proposition 7-9(第 3 节):给出了在 MAR 缺失下,缺失协变量 X^m 和缺失响应 Y^m 的条件期望和条件协方差的闭式表达式。这些表达式依赖于当前参数估计值和观测数据,通过分块多元正态条件分布公式得到。这是整个 EM 算法 E 步的基础。
- M 步更新公式(第 3 节末尾):给出了 µ_X, Σ_X, β, Σ_Y 的闭式更新公式。这些公式是完整数据 ML 估计的推广,其中缺失值被替换为 E 步的条件期望,并加入了协方差校正项(如 Ω_X|i, ∆_i 等)。
- Proposition 10-11(第 4 节):将上述结果推广到混合模型(k 个成分),给出了后验概率 ẑ_ij 的闭式公式(公式 13),以及成分特定的条件期望(公式 14-17)和协方差(公式 18-22)。
- 模拟研究结果(第 5 节):
- 低维 (d_X=2, d_Y=2):MRRC-EM(本文方法)在参数恢复上显著优于 MRRC-GMI(全局均值插补),尤其在协方差矩阵和回归系数的估计上。但在聚类准确性(ARI)上,MRRC-GMI 反而略优,作者解释为“均值插补将观测拉向质心,使聚类更容易”。
- 高维 (d_X=6, d_Y=4):MRRC-EM 在聚类准确性和参数恢复上均大幅优于 MRRC-GMI。这表明在高维下,简单插补的劣势变得明显。
- 厚尾分布 (Student's t):MRRC-EM 在参数恢复上仍优于 MRRC-GMI,但两者 ARI 均下降。在部分高缺失率场景下,MRRC-EM 的 ARI 甚至优于 MRRC-GMI。
- 真实数据例子(第 6 节):Automobile 数据集(n=205, d=15, 含缺失值)。使用 BIC 选择 k=2。两个聚类分别对应“豪华/高性能车”(81 辆)和“经济型车”(124 辆),与 Symboling rating 和 Make 的外部验证一致。回归系数(表 5)给出了每个聚类内各协变量对 Price 和 Normalized losses 的影响方向和大小。
证明路线与技术技巧¶
本文是方法推导而非理论证明,所以“证明路线”应理解为“EM 算法的推导路线”。
整体路线(3-5 步逻辑主干):
- 写出完整数据对数似然(公式 9):将缺失值 X^m, Y^m 视为潜在变量,写出如果它们被观测到时的对数似然 l_c(ϑ)。这分为两部分:l_c1(ϑ_X) 只涉及 X,l_c2(ϑ_Y) 涉及 Y 和 X。
- E 步:计算 Q 函数:Q(ϑ; ϑ̇) = E[l_c(ϑ) | 观测数据, ϑ̇]。关键在于计算两类条件期望:
- 涉及 X^m 的项(公式 10):需要 E[X^m | X^o, Y^o] 和 E[X^m X^{mᵀ} | X^o, Y^o]。
- 涉及 Y^m 和 X^m 的交叉项(公式 11):需要 E[Y^m | X^o, Y^o]、E[Y^m Y^{mᵀ} | X^o, Y^o]、以及 Cov(Y^m, X^m | X^o, Y^o)。
- 利用多元正态的条件分布性质(Proposition 3, 5, 6):在正态假设下,给定 (X^o, Y^o) 后,(X^m, Y^m) 的条件分布仍是正态,其均值和协方差有闭式公式(分块矩阵求逆)。Proposition 7-9 直接应用这些公式,给出了所需的全部条件期望。
- M 步:最大化 Q 函数:将 E 步得到的条件期望代入 Q 函数,对 ϑ 求导并令其为零,得到闭式更新公式。由于 Q 函数是 ϑ 的二次型(正态分布的对数似然),最大化有解析解。
- 聚类扩展:将上述步骤嵌入混合模型的 EM 框架。E 步额外计算后验概率 ẑ_ij(公式 13),M 步的更新公式变为加权版本(权重为 ẑ_ij)。
关键跳跃点:
- 最吃功夫的引理是 Proposition 7 和 8:它们给出了缺失协变量和缺失响应的条件期望公式。难点在于:当 X 和 Y 都部分缺失时,条件期望依赖于所有观测到的变量(包括 X^o 和 Y^o),而不是仅依赖于同类型的观测变量。例如,缺失的 X^m 的条件期望不仅依赖于观测到的 X^o,还依赖于观测到的 Y^o。作者通过将 (X^o, Y^o) 联合作为条件变量,直接应用多元正态的条件分布公式绕过了这个难点。
- 另一个关键点是 Proposition 9:它给出了 Cov(Y^m, X^m | X^o, Y^o) 的闭式公式。这个协方差项在 M 步更新 β 和 Σ_Y 时是必需的(出现在 ∆_i 中),因为 Y 的似然涉及 Y 和 X 的交叉项。如果忽略这个协方差(即假设 Y^m 和 X^m 条件独立),M 步更新将不正确。
技术技巧点名:
- 分块矩阵求逆 / Schur complement:用于推导多元正态的条件均值和协方差(Proposition 3, 5, 6 的证明)。这是整个 E 步的数学基础。
- EM 算法:标准工具,用于含缺失数据和潜在变量的 ML 估计。本文的贡献在于将其应用于混合回归 + 双变量缺失的特殊设定。
- 条件-边缘分解:将联合分布 p(x,y) 写为 p(y|x)p(x)。这不是新技术,但作者强调其“可解释性优势”——它显式展示了观测到的 Y 如何帮助插补缺失的 X,反之亦然。
- Aitken 加速准则:用于判断 EM 算法收敛,避免达到最大迭代次数后才停止。
真实例子与应用¶
数据:Automobile 数据集(UCI Machine Learning Repository),n=205 辆汽车,d=15 个连续变量。其中 2 个被指定为响应变量(Price, Normalized losses),13 个为协变量(如 Wheel base, Length, Horsepower 等)。数据含有缺失值(见表 1:Normalized losses 缺 41 个,Price 缺 4 个,Bore 和 Stroke 各缺 4 个,Horsepower 和 Peak RPM 各缺 2 个)。
方法应用步骤: 1. 标准化所有变量(减去均值,除以标准差)。 2. 用含缺失值的高斯混合模型(GMM,Ghahramani & Jordan 1994 的 EM 算法)初始化,k 从 1 到 4 用 BIC 选择。 3. 用 GMM 的硬分类结果初始化本文的 G-MRRC 模型(高斯混合回归 + 随机协变量),再次用 BIC 选择 k。 4. 最终选择 k=2(BIC=5119.78,远低于 k=1 的 5764.55)。
结果: - 聚类 1(81 辆车):包含 Audi, BMW, Jaguar, Mercedes-Benz, Porsche, Volvo 等豪华品牌,Symboling rating 偏低(风险低)。 - 聚类 2(124 辆车):包含 Chevrolet, Honda, Toyota 等经济型品牌,Symboling rating 偏高(风险高)。 - 回归系数(表 5)显示:在聚类 1 中,Engine size 增加 Price 但降低 Normalized losses;City MPG 降低两者。在聚类 2 中,Engine size 增加 Normalized losses 但降低 Price。 - 响应变量的相关性(表 6):两个聚类中 Price 和 Normalized losses 均呈弱负相关(-0.055 和 -0.092)。
这个例子想说明什么: - 验证方法可行性:在真实数据(含缺失值)上成功运行,得到有意义的聚类和回归系数。 - 展示可解释性优势:通过区分响应和协变量,可以给出每个聚类内“协变量如何影响响应”的定量解释,这是普通 GMM 做不到的。 - 展示分配依赖:协变量(如 Horsepower, Engine size)在聚类中起重要作用,验证了随机协变量假设的合理性。
🔎 结论是否比证明窄¶
- 窄结论 1:模拟研究中,MRRC-EM 在低维下的 ARI 反而低于 MRRC-GMI。作者的解释(“均值插补将观测拉向质心”)是合理的,但没有理论保证。这意味着在低维且高斯假设成立时,简单插补可能“意外地”更好——这是一个需要谨慎对待的发现。
- 窄结论 2:所有闭式解严格依赖于多元正态假设。作者在结论中承认,放松高斯假设后“闭式结构不再成立”,这使得扩展到非高斯分布“具有挑战性”。论文中模拟了 Student's t 分布(模型误设),但未给出理论上的鲁棒性保证。
- 窄结论 3:可识别性条件(第 4.2 节)引用 Dang et al. (2017) 和 Sportisse et al. (2024),但没有给出在 MAR 缺失下的完整证明。作者只是声称“条件简化为 Dang et al. (2017) 的条件”。对于严谨的理论研究者,这可能是一个缺口。
- 窄结论 4:论文没有讨论标准误的计算。EM 算法只给出点估计,但缺失数据下的标准误估计(如 Louis 方法、Bootstrap)未被提及。这使得该方法在推断(而非仅预测/聚类)场景下的应用受限。
四、开放问题¶
-
非高斯分布的扩展:本文的所有闭式解依赖于正态假设。如何将框架扩展到 t 分布、偏斜正态分布、或 copula 模型,同时保持 EM 步的(近似)闭式解?作者提到“离散尺度混合正态分布”作为第一步,但未给出具体方案。(扎根于:第 7 节“Future developments”第一段)
-
高维正则化:当 d_X 或 d_Y 接近或超过 n 时,协方差矩阵 Σ_X 和 Σ_Y 的估计会不稳定。如何引入 Lasso、图套索或因子模型等正则化技术,同时保持 EM 算法的可行性?(扎根于:第 7 节“Future developments”第二段)
-
标准误与推断:本文只给出了点估计,未讨论缺失数据下回归系数和聚类归属的不确定性量化。如何计算 EM 估计的渐近协方差矩阵(如 Louis 方法、 supplemented EM、或 Bootstrap)?(扎根于:全文未提及标准误,这是一个明显的缺口)
-
MNAR 机制的扩展:本文假设 MAR,但实际数据中缺失可能依赖于未观测值(MNAR)。如何将框架扩展到 MNAR,同时保持可识别性?Sportisse et al. (2024) 在纯聚类场景下做了尝试,但本文的回归 + 聚类设定下 MNAR 的处理尚未被探索。(扎根于:第 4.2 节引用 Sportisse et al. (2024) 讨论可识别性,但未将其方法整合进来)
-
计算效率与大规模数据:EM 算法的每次迭代需要 O(n × k × d²) 操作,且缺失模式不同导致每个观测的条件期望计算不同。对于大规模数据(n 很大或 d 很大),如何加速?作者提到“加速 EM 或变分近似”,但未给出具体方案。(扎根于:第 7 节“Future developments”最后一句)
Maintained by 陈星宇 · Homepage · Source on GitHub