跳转至

A model where the least trimmed squares estimator is maximum likelihood

作者: Vanessa Berenguer-Rico, Søren Johansen, Bent Nielsen
来源: Journal of the Royal Statistical Society Series B
主题: 数理统计 / 假设检验
相关性: 3/10
机构绿灯: University of Oxford(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/jrsssb/qkad028


一、领域脉络与小综述

这个方向是什么

这个子方向关注的是稳健回归的统计基础,特别是如何为一种广泛使用的稳健估计量——最小修整平方(LTS)估计量——提供一个严格的、基于似然的统计模型。LTS 估计量通过寻找一个包含 h 个“好”观测的子样本,然后对该子样本应用普通最小二乘(OLS)来获得回归系数。尽管 LTS 在实践中非常流行,但其统计性质(如一致性、渐近分布)通常是在非似然框架下(如基于目标函数的渐近理论)建立的。本文试图填补这一空白:构造一个概率模型,使得 LTS 估计量恰好是该模型下的最大似然估计(MLE)。这个方向当前成熟度中等,已有大量关于 LTS 的算法和渐近性质的工作,但将其置于似然框架下的尝试非常罕见。

发展脉络(history)

根据论文的引言和参考文献,该领域的发展脉络如下:

  1. 奠基工作:LTS 的提出与基本性质

    • Rousseeuw (1984):提出了 LTS 估计量,作为最小中位数平方(LMS)估计量的替代。LTS 的目标函数是残差平方和最小的 h 个观测的平方和。Rousseeuw 证明了 LTS 的崩溃点(breakdown point) 可以达到 50%,使其成为高稳健性的估计量。这是 LTS 的起点,但当时缺乏渐近分布理论。
    • Rousseeuw & Leroy (1987):专著《Robust Regression and Outlier Detection》系统介绍了 LTS 及其应用,巩固了其在稳健统计中的地位。
  2. 主要进展:LTS 的渐近理论与算法

    • Víšek (2006):首次证明了 LTS 估计量的渐近正态性。这是理论上的重大突破,但证明依赖于复杂的非光滑目标函数理论,且假设了对称的误差分布。这为后续工作留下了口子:能否在更自然的模型下得到更简洁的渐近理论?
    • Rousseeuw & Van Driessen (2006):提出了 FAST-LTS 算法,极大地提高了 LTS 的计算效率,使其在大数据集上变得实用。这是算法上的关键进展。
    • Čížek (2008):研究了 LTS 的一致性收敛速度,证明了在一般条件下 LTS 是 \(n^{1/2}\)-一致的。这为后续的推断提供了理论基础。
  3. 当前 Frontier 与本文的位置

    • 本文 (Berenguer-Rico, Johansen & Nielsen, 2024):作者指出,尽管 LTS 有上述理论,但缺乏一个概率模型来将其解释为 MLE。他们构造了一个“异常值模型”(outlier model),其中异常值被定义为“其取值落在 h 个‘好’观测的观测范围之外”。在这个模型下,LTS 估计量恰好是 MLE。这为 LTS 提供了一个全新的、基于似然的解释,并打开了使用似然比检验、信息准则等经典统计工具的大门。本文的位置是为 LTS 提供似然基础,从而将其从“稳健估计”领域更紧密地连接到“经典统计推断”领域。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索一:LTS 的统计性质(理论):Rousseeuw (1984), Víšek (2006), Čížek (2008)。这一簇关注 LTS 的崩溃点、一致性、收敛速度和渐近分布。它们通常将 LTS 视为一个M-估计量目标函数的最小化器,并使用经验过程理论或非光滑分析来推导其性质。本文属于这一线索,但提供了全新的视角。
  • 线索二:LTS 的计算与算法:Rousseeuw & Van Driessen (2006)。这一簇关注如何高效地计算 LTS 估计量,因为其目标函数是组合优化的(需要找到最优的 h 个观测子集)。FAST-LTS 算法是这一线索的代表。

这个方向在追问的核心问题

  1. LTS 的统计推断如何做? 由于 LTS 不是 MLE,传统的似然比检验、AIC/BIC 等工具无法直接使用。如何构造有效的置信区间和假设检验?
  2. LTS 的模型假设是什么? LTS 是一个“无模型”的稳健方法。它隐含地假设了“大多数数据是好的,少数是坏的”,但“好”和“坏”的分布是什么?本文试图回答这个问题。
  3. 如何选择 h? h 是 LTS 的关键调优参数,决定了“好”观测的数量。现有方法多基于经验或交叉验证,缺乏统计上的最优选择准则。本文讨论了 h 的一致估计,这是对核心问题的直接回应。
  4. LTS 与其他稳健方法的联系? LTS 与 Huber 的 M-估计、分位数回归等有何深层联系?本文通过似然框架,可能为这种联系提供新的理解。

⚠️ 作者的 framing

  • 这是作者的说法:作者将缺口 frame 成“LTS 缺乏一个概率模型,因此无法进行基于似然的推断”。他们声称,他们提出的“异常值模型”是“自然的”(natural),并且“打开了统计讨论的大门”。他们淡化了现有渐近理论(如 Víšek 2006)的实用性,认为其依赖于对称误差等假设,而他们的模型更灵活。
  • 被淡化或回避的竞争路线:作者回避了与ε-污染模型(ε-contamination model)的深入比较。ε-污染模型是稳健统计的经典框架,其中数据以概率 \(1-\varepsilon\) 来自“好”分布,以概率 \(\varepsilon\) 来自“坏”分布。作者指出他们的模型“不同”(differs),但没有详细说明在什么条件下他们的模型比 ε-污染模型更合理或更易处理。他们也没有讨论Huber 的 M-估计,后者也有明确的似然解释(Huber 的 minimax 理论)。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用任何关于高维稳健回归高维 LTS 的工作(如 Loh & Wainwright 2015 或类似工作)。这可能是因为本文完全聚焦于低维(位置-尺度)情形,但作为一篇试图为 LTS 建立新基础的文章,讨论其在高维下的潜在推广或局限性是合理的。这是一个值得研究者去查的问题:高维 LTS 的似然解释是否存在类似的工作?

张力

未见明显对立引用。所有被引工作都承认 LTS 是一个有用的稳健工具,只是在理论基础上各有侧重。本文与 Víšek (2006) 的关系是互补而非对立:Víšek 提供了渐近正态性,本文提供了似然解释。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(n\):总样本量。
    • \(h\):被 LTS 算法视为“好”的观测数量。\(h\) 是用户指定的参数,通常满足 \(n/2 < h < n\)
    • \(y_1, \ldots, y_n\):可观测的独立同分布(i.i.d.)响应变量。在位置-尺度模型中,它们是标量。
    • \(\mu\):位置参数(要估计的“好”数据的均值)。
    • \(\sigma^2\):尺度参数(要估计的“好”数据的方差)。
    • \(F\):“好”观测的分布函数。假设为连续且严格递增。
    • \(G\):“坏”观测(异常值)的分布函数。
    • \(\theta = (\mu, \sigma^2)\):要估计的参数向量。
    • \(y_{(1)} \le \ldots \le y_{(n)}\):排序后的观测值。
    • \(y_{(1)}^h, \ldots, y_{(h)}^h\):排序后的“好”观测值。注意,这些是不可直接观测的,因为“好”与“坏”的标签是未知的。
    • \(R\):“好”观测的观测范围(observed range),即 \(R = [y_{(1)}^h, y_{(h)}^h]\)。这是本文模型的核心概念。
    • \(L(\theta)\):似然函数。
    • \(\hat{\mu}_{LTS}, \hat{\sigma}^2_{LTS}\):LTS 估计量。
  • 模型

    • 数据生成机制:存在一个未知的、大小为 \(h\) 的“好”观测子集。这些“好”观测 \(y_1^h, \ldots, y_h^h\) 是 i.i.d. 来自一个连续分布 \(F\),其密度为 \(f(y; \mu, \sigma^2) = \frac{1}{\sigma} \phi\left(\frac{y-\mu}{\sigma}\right)\),其中 \(\phi\) 是标准正态密度。关键假设:这些“好”观测的观测范围\(R = [y_{(1)}^h, y_{(h)}^h]\)
    • 异常值模型:剩下的 \(n-h\) 个“坏”观测 \(y_1^b, \ldots, y_{n-h}^b\) 是 i.i.d. 来自一个分布 \(G\),其支撑集完全位于区间 \(R\) 之外。也就是说,所有异常值要么小于所有“好”观测的最小值,要么大于所有“好”观测的最大值。\(G\) 的具体形式未知,且不需要被估计。
    • 要估的对象\(\mu\)\(\sigma^2\),即“好”观测的均值和方差。
  • 可观测数据

    • 研究者能观测到的是全部 \(n\) 个观测值 \(y_1, \ldots, y_n\),但不知道哪些是“好”的,哪些是“坏”的。
    • “好”观测的标签(哪些观测属于大小为 \(h\) 的子集)是潜在变量,不可观测。
    • “好”观测的观测范围 \(R\) 也是不可直接观测的,因为它依赖于未知的标签。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:位置模型(location model),且 \(\sigma^2 = 1\) 已知

  • 最简特例:假设 \(n=5\)\(h=3\)。我们有 5 个观测值:\(y_1, \ldots, y_5\)。我们相信其中有 3 个是“好”的,来自 \(N(\mu, 1)\);另外 2 个是“坏”的,其取值要么小于所有“好”观测的最小值,要么大于所有“好”观测的最大值。

  • 核心思路:在这个模型下,LTS 估计量 \(\hat{\mu}_{LTS}\) 就是 MLE。LTS 估计量定义为:

    \[\hat{\mu}_{LTS} = \arg\min_{\mu} \sum_{i=1}^{h} (y_{(i)} - \mu)^2\]
    其中 \(y_{(1)} \le \ldots \le (y_{(n)})\) 是排序后的观测值。注意,这里 LTS 直接对排序后的全部观测取最小的 h 个平方和,而不是先找出“好”子集。这等价于:先找到使残差平方和最小的 h 个观测,然后取它们的均值。

  • 为什么 LTS 是 MLE?

    1. 似然函数:在本文的异常值模型下,似然函数可以写成:

      \[L(\mu) = \prod_{i=1}^{h} f(y_i^h; \mu) \times \prod_{j=1}^{n-h} g(y_j^b)\]
      其中 \(f\)\(N(\mu, 1)\) 密度,\(g\) 是异常值密度。由于 \(g\) 的支撑集在 \(R\) 之外,且 \(f\)\(R\) 内为正,最大化 \(L(\mu)\) 等价于最大化“好”观测的似然,但前提是“好”观测的标签正确。

    2. 关键观察:对于任何给定的 \(\mu\),为了最大化似然,我们应该选择最可能是“好”的 h 个观测。在正态分布下,一个观测 \(y\) 的似然贡献是 \(\phi(y-\mu)\)。选择 h 个观测使得它们的似然乘积最大,等价于选择 h 个观测使得它们的残差平方和最小,即:

      \[\min_{\text{选择 h 个观测}} \sum_{i \in \text{selected}} (y_i - \mu)^2\]
      这正是 LTS 的目标函数。

    3. 异常值模型的角色:异常值模型的假设保证了,当我们选择残差平方和最小的 h 个观测时,这些观测恰好就是“好”观测。为什么?因为异常值要么非常小,要么非常大,它们的残差 \((y-\mu)^2\) 会非常大,因此不会被选入残差平方和最小的 h 个观测中。反之,任何“好”观测的残差相对较小,因此会被选入。

    4. 结论:因此,最大化似然函数 \(L(\mu)\) 等价于:

      \[\max_{\mu} \max_{\text{选择 h 个观测}} \prod_{i \in \text{selected}} \phi(y_i - \mu)\]
      这等价于:
      \[\min_{\mu} \min_{\text{选择 h 个观测}} \sum_{i \in \text{selected}} (y_i - \mu)^2\]
      这正是 LTS 估计量的定义。所以,\(\hat{\mu}_{LTS}\) 是 MLE。

  • 这个特例说明了什么:它揭示了 LTS 的核心机制:通过最小化残差平方和来自动识别“好”观测,而异常值模型保证了这种自动识别是有效的。论文的一般情形(位置-尺度模型)只是在这个特例上增加了对 \(\sigma^2\) 的估计,证明路线类似但更复杂。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:为最小修整平方(LTS)估计量构造一个概率模型,使其成为该模型下的最大似然估计(MLE),从而为 LTS 提供基于似然的统计推断基础。
  2. 核心工具 / 方法:提出一个新颖的“异常值模型”,其中异常值被定义为取值落在“好”观测的观测范围之外。利用该模型,将 LTS 的优化问题(最小化 h 个最小残差平方和)重新解释为似然最大化问题。
  3. 主要结论:在位置-尺度模型下,证明了 LTS 估计量是 \(h^{1/2}\)-一致的且渐近标准正态分布。还讨论了 h 的一致估计方法。

关键设定与假设

  • 设定:论文主要关注位置-尺度模型(location-scale model),即 \(y_i = \mu + \sigma \epsilon_i\),其中 \(\epsilon_i\) 是 i.i.d. 标准正态分布。这是 LTS 最经典的应用场景。论文也简要讨论了回归模型,但主要理论结果聚焦于位置-尺度情形。
  • 假设
    1. “好”观测的分布:“好”观测来自一个连续分布 \(F\),其密度 \(f\)对称的(关于 \(\mu\))且单峰的(unimodal)。正态分布满足此条件。这个假设比 Víšek (2006) 的对称误差假设更具体,但为似然推导提供了便利。
    2. 异常值模型:“坏”观测的分布 \(G\) 的支撑集完全位于“好”观测的观测范围 \(R\) 之外。这是最关键的假设,也是本文模型的独特之处。它比 ε-污染模型更强,因为它对异常值的位置施加了严格的约束。
    3. h 已知:在主要理论推导中,假设“好”观测的数量 \(h\) 是已知的。论文随后讨论了 h 的一致估计。
    4. 独立性:所有观测(“好”和“坏”)相互独立。
  • 与已有文献的对比
    • 相比 Víšek (2006):本文的假设更强(对称单峰 vs. 对称分布),但得到了更简洁的渐近分布(标准正态 vs. 复杂形式),并且提供了似然解释。
    • 相比 ε-污染模型:本文的异常值模型更具体,使得 LTS 成为 MLE,而 ε-污染模型下 LTS 通常不是 MLE。本文的模型为“污染”提供了一个清晰的、基于观测范围的几何定义。

主要结果

  • 定理 1(位置-尺度模型下 LTS 的渐近分布)

    • 陈述:在位置-尺度模型和上述假设下,LTS 估计量 \(\hat{\mu}_{LTS}\)\(\hat{\sigma}^2_{LTS}\)\(h^{1/2}\)-一致的,并且:
      \[\sqrt{h} (\hat{\mu}_{LTS} - \mu) \xrightarrow{d} N(0, \sigma^2)\]
      \[\sqrt{h} (\hat{\sigma}^2_{LTS} - \sigma^2) \xrightarrow{d} N(0, 2\sigma^4)\]
    • 直觉:这个结果非常简洁。它表明,基于 h 个“好”观测的 LTS 估计量,其渐近方差与基于 h 个 i.i.d. 正态观测的经典样本均值和样本方差的渐近方差完全相同。这意味着,在本文的模型下,LTS 估计量在渐近意义下是有效的(efficient),因为它达到了“好”观测的 Cramér-Rao 下界。
    • 必要条件\(h \to \infty\)\(n-h\) 固定或增长较慢。实际上,论文假设 \(h/n \to \tau \in (0.5, 1)\),即“好”观测的比例趋于一个常数。
    • 解决的技术难点:证明的关键在于处理 LTS 估计量的非光滑性。LTS 的目标函数不是光滑的,因为它依赖于排序后的残差。作者通过将 LTS 估计量重新表述为一个约束优化问题的解,并利用经验过程理论(empirical process theory)来建立一致性。然后,他们利用delta 方法排序统计量的渐近理论来推导渐近正态性。
  • 定理 2(h 的一致估计)

    • 陈述:提出一个基于信息准则(如 AIC 或 BIC)的方法来一致地估计 h。具体地,对于每个候选的 h,计算 LTS 估计量下的对数似然值,并加上一个惩罚项(如 \(2p\)\(p \log n\),其中 p 是参数个数)。选择使该准则最小化的 h。
    • 直觉:由于 LTS 现在是 MLE,我们可以使用经典模型选择工具。选择 h 相当于选择“好”观测的数量,这类似于选择模型的复杂度。信息准则在惩罚过拟合(选择太多“好”观测,即 h 太大)和欠拟合(选择太少“好”观测,即 h 太小)之间取得平衡。
    • 必要条件:需要证明该准则能一致地选择真实的 h。论文通过模拟和理论论证支持了这一点。

证明路线与技术技巧

  • 整体路线

    1. 重新参数化:将 LTS 估计问题重新表述为一个带约束的优化问题。约束条件是:存在一个大小为 h 的子集,其观测值都落在某个区间内。这个区间就是“好”观测的观测范围 \(R\)
    2. 建立一致性:利用经验过程理论,证明 LTS 估计量 \(\hat{\mu}_{LTS}\)\(\hat{\sigma}^2_{LTS}\)\(h^{1/2}\)-一致的。关键步骤是证明目标函数(对数似然)在参数的真值附近是“well-behaved”的,并且 LTS 估计量是目标函数的唯一最小值点。
    3. 推导渐近分布:在一致性的基础上,对 LTS 估计量进行一阶泰勒展开。由于 LTS 估计量是 MLE,其渐近分布由Fisher 信息矩阵决定。作者计算了在本文模型下,基于 h 个“好”观测的 Fisher 信息矩阵,并证明了其逆矩阵就是上述渐近方差。
    4. 处理排序统计量:证明中需要处理“好”观测的观测范围 \(R\) 的渐近性质。作者利用了排序统计量的渐近理论,特别是极值(最大值和最小值)的渐近分布。
  • 关键跳跃点

    • 从 LTS 到 MLE 的等价性证明:这是整个论文的基石。作者需要严格证明,在异常值模型下,最大化似然函数等价于最小化 LTS 的目标函数。这个跳跃依赖于异常值模型的假设,即异常值必须落在“好”观测的观测范围之外。
    • 处理 h 的未知性:当 h 未知时,似然函数变得复杂,因为需要同时估计 h 和参数。作者通过引入信息准则来绕过这个困难,并证明了其一致性。这个跳跃需要证明信息准则的惩罚项足够强,以防止过拟合。
  • 技术技巧点名

    • 经验过程理论(Empirical Process Theory):用于建立 LTS 估计量的一致性。具体地,作者使用了Glivenko-Cantelli 定理Donsker 定理来证明目标函数的一致收敛性。
    • 排序统计量的渐近理论(Asymptotic Theory of Order Statistics):用于处理“好”观测的观测范围 \(R\) 的渐近分布。作者使用了极值理论(Extreme Value Theory)中的结果。
    • Delta 方法(Delta Method):用于从 LTS 估计量的渐近正态性推导出其他量的渐近分布。
    • 信息准则(Information Criteria, AIC/BIC):用于一致地估计 h。

真实例子与应用

  • 本文为纯理论 / 无实证例子。论文包含模拟研究,但没有使用真实数据集。模拟研究旨在验证定理 1 和定理 2 的有限样本性质,例如验证 LTS 估计量的渐近正态性以及 h 的估计准则的表现。

🔎 结论是否比证明窄

  • 是的。论文的主要结论(定理 1)是在位置-尺度模型下证明的,且假设“好”观测来自正态分布。作者在引言和结论中声称这“为 LTS 提供了似然基础”,但严格来说,这个基础目前只适用于正态位置-尺度模型。对于更一般的回归模型(如线性回归),论文只是简要提及,并未给出完整的渐近理论。因此,“LTS 是 MLE”这个结论的适用范围比论文标题暗示的要窄。作者在结论中明确提到了“回归模型的推广是未来工作”,这承认了当前结论的局限性。

四、开放问题

  1. 回归模型的推广:本文的主要理论结果局限于位置-尺度模型。将异常值模型和 LTS 的似然解释推广到线性回归模型\(y_i = x_i^T \beta + \epsilon_i\))是一个直接且重要的开放问题。这需要处理高维协变量 \(x_i\) 带来的复杂性,并重新定义“好”观测的观测范围(可能在响应空间或残差空间中)。扎根于:论文结论部分明确提到“推广到回归模型是未来工作”。

  2. 非正态“好”观测分布:本文假设“好”观测来自正态分布。如果“好”观测来自其他分布(如 t-分布、拉普拉斯分布),LTS 是否仍然是 MLE?如果是,其渐近性质如何?如果不是,是否存在其他类似的“修整”估计量是 MLE?扎根于:论文假设 1 要求“好”观测的分布是对称且单峰的,但具体形式是正态。放宽这个具体形式是一个自然的问题。

  3. 异常值模型的合理性检验:本文的异常值模型是一个很强的假设(异常值必须落在“好”观测的观测范围之外)。如何检验这个假设是否成立?如果数据不满足这个假设,LTS 估计量的性质会如何变化?扎根于:论文在引言中承认其模型“不同于常用的 ε-污染模型”,但没有提供模型诊断或检验方法。

  4. 高维推广与计算-统计权衡:在高维设定下(\(p > n\)),LTS 的似然解释是否仍然成立?如果成立,其计算复杂度如何?是否存在类似于信息-计算差距(information-computation gap)的现象,即统计上可识别的模型在计算上难以求解?扎根于:论文未引用任何高维稳健回归的工作,这是一个明显的空白。对于一位对统计-计算权衡感兴趣的研究者,这是一个值得探索的方向。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论