跳转至

Asymptotics of Nonparametric Estimation under General Non-monotone MAR Missingness: A Nonparametric Maximum Likelihood Approach

作者: Yating Zou, Huimin Hu, Jeffrey Näf
主题: 非参数 / 半参数
相关性: 8/10
链接: https://arxiv.org/abs/2608.10113


一、领域脉络与小综述

这个方向是什么

本文研究的核心问题是:在非单调(non-monotone)随机缺失(MAR) 的缺失数据机制下,能否以及如何非参数地估计完整数据的分布(特别是密度函数),并建立其渐近理论。这里的“非单调”意味着缺失模式可以任意复杂,不要求变量按某种顺序依次缺失(如纵向数据中的失访)。该问题的根本困难在于:MAR 条件本身不限制缺失模式的结构,使得传统的逆概率加权(IPW)或基于完全观测变量子集的方法在理论上难以适用。本文的目标是在不建模缺失机制、不限制缺失模式配置的条件下,仅依赖 MAR 本身和一个自然的正性条件,证明 sieve 最大似然估计(MLE)的收敛速率,并展示该速率与完整数据情形下的 minimax 最优速率一致(至多差一个对数因子和一个与正性条件相关的常数)。

发展脉络

  • 奠基工作:Rubin (1976) 提出了 MAR 概念和“可忽略性”(ignorability)结果,指出在 MAR 和参数空间可分离的条件下,基于观测数据的 MLE 可以忽略缺失机制。然而,这一结果本身不保证任何统计性质(如相合性、渐近正态性)。
  • 主要进展(参数情形):Takai and Kano (2013) 首次在正则参数模型下证明了忽略 MLE 的相合性和渐近正态性,为 MAR 下 MLE 的合理性提供了形式化基础。但该结果不扩展到非参数估计。
  • 当前 Frontier(非参数情形):
    • 贝叶斯路线:Näf and Chérief-Abdellatif (2026) 给出了非参数贝叶斯估计在 MAR 下的后验收缩速率,首次证明即使是非单调 MAR,完整数据密度仍可被相合估计,且速率与完整数据情形相同(仅差一个常数)。这是本文的直接前驱。
    • 频率学派路线:本文是第一个在频率学派框架下建立类似结果的尝试。
    • 其他竞争路线:
      • IPW 与模式图:Sun and Tchetgen (2018)、Chen (2022) 等尝试用逆概率加权或模式图(pattern graphs)处理非单调缺失。但作者指出,一般 MAR 不定义正则模式图(regular pattern graph),因此 IPW 在一般 MAR 下不可行(见 Section 3.2 的例子)。
      • 基于完全观测变量子集的方法:Wang and Rao (2002)、Wei et al. (2012)、Chen et al. (2015) 等假设缺失概率只依赖于一组完全观测的变量,这比一般 MAR 强得多。
      • 经验似然:Liu and Fan (2023) 使用经验似然作为 IPW 的替代,但作者指出该方法仍限于受限的 MAR 设定。
      • Wasserstein 梯度流:Kremling et al. (2026) 结合忽略方法与 Wasserstein 梯度流,但未提供相合性结果,且需要缺失机制的平滑性条件(二阶导数存在且有界),这在本文的 MAR 挑战例子中不成立。
  • 本文的位置:本文填补了频率学派非参数估计在一般非单调 MAR 下的理论空白,提供了一个通用的 sieve MLE 收敛速率定理,并将其应用于密度估计,证明该估计量在 Hölder 类上达到 minimax 最优速率(至多对数因子)。这是对 Näf and Chérief-Abdellatif (2026) 贝叶斯结果的频率学派对应。

子线索聚类

  1. 参数 MLE 与可忽略性:Rubin (1976)、Takai and Kano (2013)。核心是证明在参数模型下,忽略 MLE 是合理的,但理论不扩展到非参数。
  2. 受限 MAR 下的非参数方法:Wang and Rao (2002)、Wei et al. (2012)、Chen et al. (2015)、Liu and Fan (2023)。这些方法假设缺失概率只依赖于完全观测变量,或使用经验似然等替代工具,无法处理一般非单调 MAR。
  3. 模式图与识别条件:Chen and Sadinle (2019)、Chen (2022)。通过假设缺失模式的图结构(如正则模式图)来识别分布,但一般 MAR 不满足这些条件。
  4. 贝叶斯非参数方法:Näf and Chérief-Abdellatif (2026)。在贝叶斯框架下建立后验收缩速率,是本文的直接前驱。
  5. 频率学派 sieve MLE(本文):本文。在频率学派框架下建立一般收敛速率,并应用于密度估计。

这个方向在追问的核心问题

  1. 相合性:在一般非单调 MAR 下,能否不建模缺失机制而相合地估计完整数据分布?
  2. 收敛速率:如果相合,收敛速率是多少?是否与完整数据情形相同?
  3. 最优性:该速率是否达到 minimax 最优?
  4. 计算可行性:是否存在可实现的算法来逼近该估计量?

当前主流方法与已知瓶颈:主流方法(IPW、基于完全观测变量子集的方法、模式图方法)要么在一般 MAR 下不可行,要么需要额外的强假设。贝叶斯方法提供了理论保证,但计算上可能复杂。本文的 sieve MLE 方法在理论上提供了频率学派的保证,且通过 EM 算法实现,计算上可行。

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将缺口 frame 为“在一般非单调 MAR 下,频率学派非参数估计的相合性和收敛速率问题尚未被回答”。他们将自己的工作定位为“提供频率学派版本的贝叶斯收缩速率结果”,并强调其方法的最小假设(仅需 MAR 和正性条件)和通用性(不限制缺失模式、不建模缺失机制)。
  • 哪些竞争路线被他淡化或回避了:
    • 贝叶斯方法:作者明确承认 Näf and Chérief-Abdellatif (2026) 是直接前驱,但将其定位为“贝叶斯版本”,而本文是“频率学派版本”。作者淡化了贝叶斯方法在计算上的复杂性(虽然本文的 EM 算法也可能有局部最优问题)。
    • 模式图方法:作者在 Section 3.2 的 MAR 挑战例子中明确指出,该例子无法用正则模式图表示,从而论证了 IPW 和模式图方法的局限性。这是一种有效的“排除法”,但可能忽略了模式图方法在更广泛设定下的潜力。
    • Wasserstein 梯度流:作者指出 Kremling et al. (2026) 需要缺失机制的平滑性条件,而本文不需要。这强化了本文假设的“最小性”。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:未见明显缺失。作者对相关文献的梳理相当全面,涵盖了参数、半参数、非参数、贝叶斯、频率学派等多个分支。

张力

未见明显对立引用。不同方法(IPW、模式图、贝叶斯、本文)适用于不同强度的假设,彼此之间是互补而非矛盾的关系。作者通过 MAR 挑战例子清晰地展示了不同方法的适用边界。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:
    • \(X_i \in \mathbb{R}^d\):第 \(i\) 个样本的完整数据向量(\(d\) 维),服从分布 \(P_0\),密度为 \(p_0\)。
    • \(M_i \in \{0,1\}^d\):第 \(i\) 个样本的缺失模式掩码。\((M_i)_j = 0\) 表示第 \(j\) 个分量被观测到,\(=1\) 表示缺失。
    • \(X_i^{(M_i)}\):第 \(i\) 个样本的观测到的子向量,即只包含 \((M_i)_j = 0\) 的那些分量。
    • \(\tilde{S}_n = \{(X_1^{(M_1)}, M_1), \dots, (X_n^{(M_n)}, M_n)\}\):实际观测到的数据集(部分观测向量 + 缺失模式)。
    • \(p^{(m)}(x^{(m)})\):在缺失模式 \(m\) 下,观测部分 \(x^{(m)}\) 的边际密度。即 \(p^{(m)}(x^{(m)}) = \int p(x^{(m)}, x^{(\bar{m})}) dx^{(\bar{m})}\),其中 \(x^{(\bar{m})}\) 是缺失部分。
    • \(P(M=m|X=x)\):缺失机制,即给定完整数据 \(x\) 时,缺失模式为 \(m\) 的条件概率。
    • \(\tilde{f}(x, m)\):对于一组函数 \(\{f^{(m)}\}_{m \in \{0,1\}^d}\),定义 \(\tilde{f}(x, m) = f^{(m)}(x^{(m)})\)。这允许我们将观测数据的期望写成 \(E_{(X,M)\sim P_0}[f^{(M)}(X^{(M)})] = P_0 \tilde{f}\)。
    • \(\text{fKL}(P_0 \| P)\):适应于缺失数据的 KL 散度,定义为 \(E_{(X,M)\sim P_0}[\log(p_0^{(M)}(X^{(M)}) / p^{(M)}(X^{(M)}))]\)。
    • \(\text{eH}(p_0, p)\):适应于缺失数据的 Hellinger 距离,定义为 \(\sqrt{\sum_m \int (\sqrt{p_0^{(m)}(x^{(m)})} - \sqrt{p^{(m)}(x^{(m)})})^2 P(M=m|x^{(m)}) dx^{(m)}}\)。
    • \(H(p_0, p)\):标准的完整数据 Hellinger 距离,\(\sqrt{\int (\sqrt{p_0(x)} - \sqrt{p(x)})^2 dx}\)。
  • 模型:
    • 数据生成机制:\((X_i, M_i)\) 独立同分布,\(X_i \sim P_0\)(密度 \(p_0\)),\(M_i\) 的条件分布由未知的缺失机制 \(P(M=m|X=x)\) 决定。
    • 关键假设:
      • MAR (Assumption 2.1):\(P(M=m|X=x) = P(M=m|X^{(m)} = x^{(m)})\)。即缺失只依赖于观测到的数据。
      • 正性条件 (Assumption 2.3):\(P(M=0|X=x) \ge c_0 > 0\)。即每个样本都有至少 \(c_0\) 的概率被完全观测到。
      • 忽略空模式 (Assumption 2.2):\(P(M=\mathbf{1}) = 0\),即不会所有分量都缺失。
    • 要估计的对象:完整数据的密度 \(p_0\)。
  • 可观测数据:
    • 研究者能观测到的是 \(\tilde{S}_n = \{(X_i^{(M_i)}, M_i)\}_{i=1}^n\),即每个样本的部分观测值及其缺失模式。
    • 不可观测的是完整数据 \(X_i\) 本身,以及缺失机制 \(P(M=m|X=x)\)。本文的核心在于不建模缺失机制,仅通过 MAR 和正性条件来识别 \(p_0\)。

第二步:讲最小内核

本文的最小内核是:在 MAR 下,基于观测数据的似然(忽略缺失机制)的最大化,等价于最小化一个适应于缺失数据的 KL 散度 \(\text{fKL}\),并且这个散度在正性条件下能唯一识别真实密度 \(p_0\)。 因此,我们可以通过最大化观测数据的似然来估计 \(p_0\),而无需处理缺失机制。

最简特例:\(d=2\),且只有一个变量可能缺失。

  • 设定:\(X = (X_1, X_2)\)。假设 \(X_1\) 总是被观测到,\(X_2\) 可能缺失。那么可能的缺失模式只有 \(m = (0,0)\)(完全观测)和 \(m = (0,1)\)(\(X_2\) 缺失)。
  • 可观测数据:对于每个样本 \(i\),我们观测到 \((X_{i1}, M_i)\)。如果 \(M_i = (0,0)\),则 \(X_{i2}\) 也观测到;如果 \(M_i = (0,1)\),则 \(X_{i2}\) 缺失。
  • MAR 假设:\(P(M=(0,1)|X_1=x_1, X_2=x_2) = P(M=(0,1)|X_1=x_1)\)。即 \(X_2\) 的缺失只依赖于 \(X_1\)。
  • 正性条件:\(P(M=(0,0)|X_1=x_1, X_2=x_2) \ge c_0 > 0\)。
  • 要估计的:\(p_0(x_1, x_2)\)。
  • 观测数据的似然:对于单个样本 \((x_1, m)\):
    • 如果 \(m=(0,0)\):似然为 \(p_0(x_1, x_2)\)。
    • 如果 \(m=(0,1)\):似然为 \(p_0^{(0,1)}(x_1) = \int p_0(x_1, x_2) dx_2\),即 \(X_1\) 的边际密度。
  • 核心思路:我们最大化 \(\prod_i p_0^{(M_i)}(X_i^{(M_i)})\)。这等价于最小化 \(\text{fKL}(P_0\|P) = E[\log(p_0^{(M)}(X^{(M)}) / p^{(M)}(X^{(M)}))]\)。
  • 为什么能识别 \(p_0\)?:Proposition 4.1 表明,在 MAR 和正性条件下,\(\text{fKL}(P_0\|P) = 0\) 当且仅当 \(P = P_0\)。这意味着,即使我们只观测到边际分布,最小化 \(\text{fKL}\) 也能唯一地恢复联合分布 \(p_0\)。这背后的直觉是:MAR 保证了缺失机制不提供关于 \(p_0\) 的额外信息,而正性条件保证了完全观测模式的存在,从而能“锚定”联合分布。
  • 推广到一般情形:当 \(d>2\) 且缺失模式非单调时,观测数据的似然是各个模式下的边际密度的乘积。本文的 Theorem 4.4 证明,只要满足类似的条件(MAR、正性、以及一些关于 sieve 的熵条件),sieve MLE 就能以与完整数据相同的速率(至多差一个常数 \(1/\sqrt{c_0}\))收敛到 \(p_0\)。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在一般非单调 MAR 缺失数据下,非参数估计(特别是密度估计)的渐近理论,即能否以及以多快的速度相合地估计完整数据分布。
  2. 核心工具 / 方法:基于 sieve 最大似然估计(sieve MLE),利用经验过程理论(empirical process theory)和适应于缺失数据的 Hellinger 距离(adapted Hellinger functional)来建立收敛速率。具体地,使用有限高斯混合(finite Gaussian mixtures)作为 sieve。
  3. 主要结论:在 MAR、正性条件和 Hölder 光滑类假设下,sieve MLE 可以达到 minimax 最优速率 \(n^{-\beta/(2\beta+d)}\)(至多一个对数因子),缺失数据仅通过常数 \(1/\sqrt{c_0}\) 影响速率,而不改变速率本身。

关键设定与假设

  • 完整设定:在第二节符号的基础上,本文进一步假设:
    • Sieve 空间:\(P_n = \{p_{F,\Sigma}: F \in \mathcal{F}_{N,a}, \Sigma \in \mathcal{D}_{\sigma, \delta_n}\}\),其中 \(p_{F,\Sigma}(x) = \int \phi(x-z, \Sigma) dF(z)\) 是高斯混合密度。\(\mathcal{F}_{N,a}\) 是支撑在 \([-a,a]^d\) 上、最多 \(N\) 个原子的离散分布。\(\mathcal{D}_{\sigma, \delta_n}\) 是协方差矩阵的集合,其特征值介于 \(\sigma^2\) 和 \(\sigma^2(1+\delta_n^2)n\) 之间。
    • Hölder 类 (Assumption 5.1):真实密度 \(p_0\) 属于一个 Hölder 光滑类,其 \(\beta\) 阶导数满足 Lipschitz 条件,且尾部以指数 \(e^{-b\|x\|^\tau}\) 衰减。
  • 相比已有文献的放宽或强化:
    • 放宽:相比 van der Vaart and Wellner (2023, Theorem 3.4.12) 的标准结果,本文利用 Kaji (2026) 的最新结果,避免了有界密度比(bounded density ratios)这一严格假设。这是本文的一个关键技术贡献,使得结果能应用于高斯位置族等密度比无界的情形。
    • 强化:相比贝叶斯方法 (Näf and Chérief-Abdellatif, 2026),本文提供了频率学派的保证。相比 Wasserstein 梯度流 (Kremling et al., 2026),本文不需要缺失机制的平滑性条件。

主要结果

  • 定理 4.4(一般收敛速率):在 MAR、正性条件以及三个技术条件((4')-(6'))下,观测数据 sieve MLE \(\hat{p}_n\) 满足:
    • \(\text{eH}(p_0, \hat{p}_n) = O_P(\delta_n \vee n^{-1/2})\)
    • \(H(p_0, \hat{p}_n) = O_P(\frac{1}{\sqrt{c_0}}(\delta_n \vee n^{-1/2}))\)
    • 直觉:该定理提供了一个通用框架。只要找到一个好的 sieve 序列 \(P_n\) 和一个好的近似 \(p_n \in P_n\),使得 (4')-(6') 成立,就能得到收敛速率。条件 (4') 要求 \(p_n\) 在适应 Hellinger 距离下逼近 \(p_0\);条件 (5') 控制观测数据似然比的尾部行为;条件 (6') 是标准的括号熵条件。
  • 定理 5.1(密度估计结果):在 Hölder 类假设下,使用特定的高斯混合 sieve(参数如 (11) 所示),定理 4.4 的条件被满足,从而得到:
    • \(H(p_0, \hat{p}_n) = O_P\left(\frac{C_4}{\sqrt{c_0}} n^{-\beta/(2\beta+d)} (\log n)^t\right)\)
    • 直觉:速率 \(n^{-\beta/(2\beta+d)}\) 是 Hölder 类上密度估计的 minimax 最优速率。对数因子 \((\log n)^t\) 是 sieve MLE 的常见代价,并非缺失数据引入。常数 \(C_4/\sqrt{c_0}\) 是缺失数据带来的唯一代价,其中 \(c_0\) 是正性条件中的下界。

证明路线与技术技巧

  • 整体路线(定理 4.4):
    1. 问题转化:将最大化观测数据似然转化为最小化适应 KL 散度 \(\text{fKL}\)。
    2. 建立距离关系:证明 \(\text{fKL}\) 与适应 Hellinger 距离 \(\text{eH}\) 之间的关系(Proposition B.1),以及 \(\text{eH}\) 与标准 Hellinger 距离 \(H\) 之间的关系(Proposition 4.3)。这允许我们在 \(\text{eH}\) 下工作,并最终将结果转化回 \(H\)。
    3. 应用经验过程理论:将 van der Vaart and Wellner (2023, Theorem 3.4.1) 应用于适应于缺失数据的准则函数。这需要验证三个条件:
      • 曲率条件:证明 \(\text{fKL}\) 在 \(\text{eH}\) 下是“凹”的,即 \(\text{fKL}(P_0\|P) \ge \text{eH}^2(p_0, p)\)(见 (38) 的证明)。
      • 模的连续性条件:证明经验过程 \(\sqrt{n}(P_n - P_0)\tilde{\ell}_{p_0, p}\) 在 \(\text{eH}\) 球上的最大值可以被一个括号熵积分控制。这里的关键技巧是将 \(\text{eH}\) 下的括号熵转化为标准 Hellinger 距离 \(H\) 下的括号熵(Lemma B.3),因为后者在具体 sieve 上更容易计算。
      • 序列条件:验证存在一个序列 \(\delta_n\) 使得上述两个条件成立,并且近似最大化条件 (7') 成立。
    4. 处理尾部:利用 Kaji (2026) 的引理,用 \(\text{eH}\) 和尾部项来控制 \(\text{fKL}\) 和似然比的二阶矩,从而避免有界密度比假设。
  • 关键跳跃点:
    • 从 \(\text{eH}\) 到 \(H\) 的括号熵传递 (Lemma B.3):这是证明中最吃劲的部分之一。作者需要证明,在 \(\text{eH}\) 下的局部 sieve \(\tilde{P}_{n, \delta}\) 的括号熵可以被 \(H\) 下的局部 sieve \(P_{n, \delta/\sqrt{c_0}}\) 的括号熵控制。这依赖于 \(\text{eH} \le H\) 和 \(H \le \text{eH}/\sqrt{c_0}\) 这两个不等式。
    • 局部化 (Lemma B.6, Corollary B.7):为了计算高斯混合 sieve 的括号熵,作者需要限制协方差矩阵的最大特征值。他们通过一个局部化论证,证明在 Hellinger 距离为 \(O(1)\) 的局部球内,协方差矩阵的最大特征值可以被一个常数 \(\bar{\sigma}^2\) 控制。这允许他们将整个 sieve 替换为一个“有帽的”子集 \(P_n^\star\),其括号熵更容易计算。
  • 技术技巧点名:
    • 经验过程理论 (Empirical Process Theory):核心工具,用于控制经验测度与真实测度之间的偏差。
    • 括号熵 (Bracketing Entropy):用于度量函数类的复杂度,是建立收敛速率的关键。
    • Kaji (2026) 的 Hellinger 界:用于建立 \(\text{fKL}\)、\(\text{eH}\) 和似然比尾部之间的关系,避免了有界密度比假设。
    • 适应 Hellinger 距离 (Adapted Hellinger Functional):本文引入的一个关键概念,是连接观测数据似然和完整数据分布之间的桥梁。
    • 局部化 (Localization):通过限制参数空间来简化熵计算。
    • Lipschitz 参数化 (Lemma B.8):证明高斯混合密度关于其参数是 Lipschitz 的,从而将参数空间的覆盖数转化为函数空间的括号数。

真实例子与应用

  • MAR 挑战例子 (Section 3.2, 6):
    • 数据:\(d=3\) 的多元正态分布,\(X_1, X_2\) 相关,\(X_3\) 独立。缺失机制如 (5) 所示,是一个复杂的非单调 MAR 机制。
    • 方法应用:使用本文提出的 MAR 高斯混合 EM 算法来估计完整数据密度,然后从中计算 \(X_1\) 的 0.1 分位数。
    • 结果:Figure 3 显示,该方法能较好地估计该分位数,中位数接近真实值,尽管变异性不可忽略。正性条件中的下界 \(c_0\) 从 0.01 到 0.1 变化时,性能没有明显变化。
    • 说明的问题:该例子旨在展示本文方法能够处理其他方法(如 IPW、基于完全观测变量子集的方法)无法处理的复杂非单调 MAR 情形。
  • 高维密度恢复模拟 (Section 6):
    • 数据:\(d=20\),数据生成自高斯混合、多元正态、多元逻辑斯蒂分布。训练数据被按照 MAR 机制截断,缺失水平从 10% 到 90% 变化。
    • 方法应用:将本文的 MAR 高斯混合方法与完整数据下的核密度估计(KDE)进行比较。
    • 结果:
      • 高斯混合数据 (Figure 4):本文方法在所有缺失水平下都优于完整数据 KDE,且缺失水平增加对性能影响很小。
      • 相关正态数据 (Figure 5):本文方法在能量距离(energy distance)上优于 KDE,但在密度得分(density score)上略逊于完整数据 KDE,且随缺失增加而下降。
      • 重尾逻辑斯蒂数据 (Figure 6):类似相关正态数据,本文方法在能量距离上优于 KDE,但密度得分随缺失增加而下降。
    • 说明的问题:本文方法在恢复整体分布(能量距离)方面非常稳健,但在精确估计密度值(密度得分)方面,尤其是在重尾和高缺失水平下,可能不如完整数据 KDE。这验证了理论结果:缺失数据不影响速率,但可能影响常数项。

🔎 结论是否比证明窄

  • 定理 4.4 的结论是严格的:它给出了 \(\text{eH}\) 和 \(H\) 下的收敛速率,并明确指出了常数 \(1/\sqrt{c_0}\) 的来源。证明中每一步都对应着具体的假设和引理。
  • 定理 5.1 的结论是严格的:它给出了在 Hölder 类下的具体速率,并明确指出了对数因子 \((\log n)^t\) 的来源(sieve 的熵)。证明中详细验证了定理 4.4 的条件。
  • 潜在比证明窄的地方:
    • Remark 2 (iii) 提到,如果真实密度是超光滑的(如正态位置混合),可以得到近参数速率 \(n^{-1/2}(\log n)^{(d+1+1/r_0)/2}\)。这个结论是基于相同的证明结构的推测,论文中并未给出完整的证明,只是说“following the same proof structure”。这是一个conjecture,而非严格证明。
    • Section 7 (Conclusion) 提到,改变 sieve 可能得到类似 Saha and Guntuboyina (2020) 的凸优化结果。这同样是推测,而非本文的贡献。

四、开放问题

  1. 凸优化实现:本文的 EM 算法是非凸的,且需要 BIC/AIC 选择分量数 \(N\)。作者在 Conclusion 中推测,通过改变 sieve(如使用 Saha and Guntuboyina (2020) 的估计量),可以将估计转化为一个无限维凸问题,从而避免非凸优化和模型选择问题。扎根于:Section 7, "it is likely possible to obtain similar results for an ignoring version of the estimator discussed in Saha and Guntuboyina (2020)."
  2. 非参数回归:作者提到定理 4.4 可能直接应用于非参数回归问题,如 Näf and Chérief-Abdellatif (2026) 中讨论的。扎根于:Section 7, "there might also be direct applications for nonparametric regression problems as in Näf and Chérief-Abdellatif (2026)."
  3. 更紧的速率:定理 5.1 的速率包含一个对数因子 \((\log n)^t\)。作者在 Remark 2 (ii) 中指出,这是 sieve MLE 的常见代价,但完整数据下的 minimax 速率没有这个因子。能否消除这个对数因子,或者证明它是必要的?扎根于:Remark 2 (ii), "The logarithmic factor is not an artifact of missingness... sieve MLEs are not known to attain the rate \(\varepsilon_n\)... at which the metric entropy of the target class balances the information in \(n\) observations."
  4. 更优的模型选择准则:模拟结果显示,BIC 在高缺失水平下表现更好,而 AIC 在低缺失水平下表现更好。作者指出,需要一个能考虑缺失数据信息损失的惩罚项。扎根于:Section 6, "this indicates that standard AIC/BIC is too simplistic, and instead a penalty is needed that factors in the information loss of the missing values."

Maintained by 陈星宇 · Homepage · Source on GitHub

评论