跳转至

Asymptotics of AIC, BIC and Cp model selection rules in high-dimensional regression

作者: Zhidong Bai, Kwok Pui Choi, Yasunori Fujikoshi, Jiang Hu
来源: Bernoulli
主题: 高维统计 / 随机矩阵
相关性: 9/10
机构绿灯: National University of Singapore(US News 前 50,免分进入精读)
链接: https://doi.org/10.3150/21-bej1422


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是在高维线性回归(即预测变量个数 \(p\) 与样本量 \(n\) 可比,\(p/n \to c \in (0,1)\))的设定下,经典模型选择准则——AIC(Akaike Information Criterion)、BIC(Bayesian Information Criterion)和 \(C_p\)(Mallows’s \(C_p\))——的渐近行为。核心问题是:当 \(p\)\(n\) 同阶增长时,这些准则是否还能一致地选出真实模型(即包含所有真实非零系数的模型)?如果不能,其选择正确模型的概率收敛于什么?该方向将经典的低维渐近理论(\(p\) 固定、\(n \to \infty\))推广到高维比例情形,为实际中 \(p\)\(n\) 可比时的模型选择提供理论依据。当前成熟度:已有大量关于高维模型选择一致性的工作(如 Lasso、SCAD 等正则化方法),但关于经典信息准则(AIC/BIC/Cp)在高维比例下的精确渐近分析仍相对较少,本文是这一支线的关键进展。

发展脉络(history)

从经典低维到高维比例的渐近分析,本文的引用串起了一条清晰的线索:

  1. 奠基工作(低维经典)

    • Akaike (1973)Schwarz (1978) 分别提出了 AIC 和 BIC,其渐近性质在 \(p\) 固定、\(n \to \infty\) 下已被充分研究:BIC 具有模型选择一致性(概率趋于 1 选出真模型),而 AIC 则倾向于过拟合,其选择正确模型的概率收敛于一个小于 1 的常数。
    • Mallows (1973) 提出了 \(C_p\) 准则,其渐近行为与 AIC 类似。
    • Stone (1977) 证明了 AIC 与交叉验证的渐近等价性。
    • Shibata (1976)Nishii (1984) 给出了低维下 AIC/BIC 选择概率的精确表达式。这些工作构成了本文的经典基准。
  2. 主要进展(高维正则化方法)

    • 进入高维时代后,研究重心转向了正则化方法(如 Lasso、SCAD、Adaptive Lasso)的模型选择一致性。例如,Zhao & Yu (2006) 提出了 Lasso 一致的 Irrepresentable Condition(不可表示条件)。Fan & Li (2001) 提出了 SCAD 并证明了其 Oracle 性质。这些工作表明,在高维稀疏设定下,通过惩罚可以实现一致选择,但需要较强的条件(如稀疏性、不相干性)。
    • 然而,对于经典的 AIC/BIC/Cp 准则在高维比例(\(p/n \to c\))下的行为,直到本文之前,仍缺乏系统的渐近理论。Shibata (1984)Shibata (1988) 研究了 \(p\)\(n\) 增长时 AIC 的渐近效率,但未给出选择概率的极限。
  3. 当前 Frontier 与本文位置

    • 本文直接填补了上述空白。它没有采用正则化框架,而是回到经典的最小二乘估计(OLS),在 \(p/n \to c \in (0,1)\) 的设定下,利用随机矩阵理论(RMT)推导出 AIC、BIC 和 \(C_p\) 选择正确模型的概率极限。
    • 作者在引言中明确指出:“It is well known that in the classical setting where \(p\) is fixed and \(n \to \infty\), BIC is consistent, while AIC and \(C_p\) are not. However, the asymptotic properties of these criteria in the high-dimensional setting where \(p/n \to c \in (0,1)\) have not been fully understood.” 这直接定位了本文的贡献:将经典结论推广到高维比例情形,并揭示出信号强度对一致性的关键影响。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索一:经典模型选择准则的渐近理论。包括 Akaike (1973), Schwarz (1978), Mallows (1973), Stone (1977), Shibata (1976, 1984, 1988), Nishii (1984) 等。这一簇的核心是研究 AIC/BIC/Cp 在低维或 \(p\) 缓慢增长下的选择概率、效率与一致性。本文是这一线索在高维比例下的直接延伸。
  • 线索二:高维统计推断与随机矩阵理论。包括 Bai & Silverstein (2010)(RMT 标准教材)、Bai et al. (2007)(样本协方差矩阵特征值极值渐近)、Johnstone (2001)(Tracy-Widom 分布在高维 PCA 中的应用)。这一簇提供了本文的核心技术工具——Marchenko-Pastur 律及其极值渐近。本文是 RMT 在经典统计推断问题(模型选择)中的一次直接应用。

这个方向在追问的核心问题

  1. 一致性条件:在高维比例下,AIC/BIC/Cp 需要多强的信号(即非零回归系数的大小)才能一致地选出真模型?这个条件是否比低维情形更苛刻?
  2. 选择概率的极限:当信号强度不足以达到一致性时,这些准则选择正确模型的概率收敛于什么常数?这个常数如何依赖于 \(c = p/n\) 和信号强度?
  3. 与正则化方法的比较:在高维比例下,经典信息准则与 Lasso 等正则化方法在模型选择一致性上是否存在本质差异?各自的适用条件是什么?

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 成“经典低维结论在高维比例下的缺失”。他们声称,虽然正则化方法在高维稀疏设定下很流行,但经典信息准则因其简单性和无需调参(除了惩罚项系数)仍被广泛使用,因此理解其在高维下的行为是“显然的下一步”。
  • 被淡化或回避的竞争路线:作者淡化了正则化方法(如 Lasso)在高维模型选择中的主导地位。他们回避了与 Lasso 等方法的直接比较,例如没有讨论当 \(p/n \to c\) 且模型稀疏时,AIC/BIC 是否比 Lasso 更优或更差。他们选择了一个不同的设定:候选模型集包含真模型(即“正确模型”在候选集中),且所有候选模型都通过 OLS 拟合。这与 Lasso 的路径搜索不同。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:本文没有引用关于 高维 AIC/BIC 的修正版本 的工作,例如 修正的 BIC (mBIC)扩展的 BIC (EBIC)(如 Chen & Chen, 2008),这些工作专门为高维稀疏设定设计了新的惩罚项。作者选择研究原始版本的 AIC/BIC/Cp,这本身是一个合理的选择,但回避了这些修正版本的存在及其在高维下的表现,是一个值得研究者去查的问题:原始版本在高维比例下的表现是否比修正版本差很多?信号强度条件是否更苛刻?

张力

未见明显对立引用。所有被引工作都支持经典低维结论,而本文是将其推广到高维比例,属于“扩展”而非“推翻”。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
    • \(n\):样本量。
    • \(p\):预测变量个数。本文假设 \(p < n\),且 \(p/n \to c \in (0,1)\)
    • \(\mathbf{X} = (x_{ij})\)\(n \times p\) 的设计矩阵。假设为随机矩阵,其行向量独立同分布,且满足 Marcinkiewicz 型矩条件。
    • \(\mathbf{y} = (y_1, \dots, y_n)^\top\)\(n \times 1\) 响应向量。
    • \(\boldsymbol{\beta} = (\beta_1, \dots, \beta_p)^\top\)\(p \times 1\) 回归系数向量(参数)。
    • \(\boldsymbol{\varepsilon} = (\varepsilon_1, \dots, \varepsilon_n)^\top\)\(n \times 1\) 误差向量,假设 \(\varepsilon_i \sim N(0, \sigma^2)\) 独立同分布。
    • 模型:线性回归模型 \(\mathbf{y} = \mathbf{X} \boldsymbol{\beta} + \boldsymbol{\varepsilon}\)
    • 候选模型:考虑一个候选模型 \(M\),它对应 \(\boldsymbol{\beta}\) 的一个子集(即只包含部分预测变量)。设 \(M\) 包含 \(k\) 个预测变量。真模型 \(M_t\) 是包含所有非零 \(\beta_j\) 的模型,其大小为 \(k_t\)
    • 可观测数据:研究者能观测到 \((\mathbf{X}, \mathbf{y})\) 的完整样本。想要但观测不到的是:真模型 \(M_t\) 的具体构成(哪些 \(\beta_j\) 非零)以及 \(\sigma^2\) 的真值。
    • 估计量:对于候选模型 \(M\),其 OLS 估计量为 \(\hat{\boldsymbol{\beta}}_M\),残差平方和为 \(\text{RSS}(M) = \|\mathbf{y} - \mathbf{X}_M \hat{\boldsymbol{\beta}}_M\|^2\)
    • 模型选择准则
      • \(\text{AIC}(M) = n \log(\text{RSS}(M)/n) + 2k\)
      • \(\text{BIC}(M) = n \log(\text{RSS}(M)/n) + k \log n\)
      • \(C_p(M) = \text{RSS}(M)/\hat{\sigma}^2 - n + 2k\),其中 \(\hat{\sigma}^2\) 是全模型(包含所有 \(p\) 个变量)的 MSE 估计。
    • 选择规则:选择使准则值最小的模型。

第二步:讲最小内核

本文的核心思路可以浓缩为一个最简特例:假设真模型 \(M_t\) 只包含一个非零系数(\(k_t = 1\)),且候选模型集包含两个模型:一个欠拟合模型 \(M_0\)(不含任何变量,即只包含截距项,\(k=0\))和一个正确模型 \(M_t\)\(k=1\))。我们想研究 AIC/BIC/Cp 选择 \(M_t\) 的概率。

在这个特例下,问题退化为: * 可观测数据\(\mathbf{y} = \mathbf{x}_1 \beta_1 + \boldsymbol{\varepsilon}\),其中 \(\mathbf{x}_1\)\(n \times 1\) 的预测变量向量,\(\beta_1 \neq 0\) 是信号强度。 * 候选模型: * \(M_0\)\(\text{RSS}(M_0) = \|\mathbf{y}\|^2\)。 * \(M_t\)\(\text{RSS}(M_t) = \|\mathbf{y} - \mathbf{x}_1 \hat{\beta}_1\|^2\),其中 \(\hat{\beta}_1\) 是 OLS 估计。 * 选择准则的差值:选择 \(M_t\) 当且仅当 \(\text{AIC}(M_t) < \text{AIC}(M_0)\),即:

\[n \log\left(\frac{\text{RSS}(M_t)}{n}\right) + 2 \cdot 1 < n \log\left(\frac{\text{RSS}(M_0)}{n}\right) + 2 \cdot 0\]
化简得:
\[n \log\left(\frac{\text{RSS}(M_t)}{\text{RSS}(M_0)}\right) < -2\]
由于 \(\text{RSS}(M_t) < \text{RSS}(M_0)\),左边为负。这个不等式是否成立,取决于 \(\text{RSS}(M_t)/\text{RSS}(M_0)\) 有多小。

核心数学困难:在高维比例下(\(p/n \to c\)),即使只考虑一个变量,\(\text{RSS}(M_0)\)\(\text{RSS}(M_t)\) 的分布也受到高维设计矩阵的复杂影响。经典低维理论中,\(\text{RSS}(M_0) \sim \sigma^2 \chi^2_n\)\(\text{RSS}(M_t) \sim \sigma^2 \chi^2_{n-1}\) 的简单卡方分布不再成立,因为 \(\mathbf{x}_1\) 与其他未包含的变量(即使它们系数为零)存在相关性,导致 \(\text{RSS}(M_t)\) 的分布偏离卡方。

本文的关键想法:利用随机矩阵理论(RMT)来刻画 \(\text{RSS}(M_t)/\text{RSS}(M_0)\) 的渐近分布。具体地,这个比值可以写成关于样本协方差矩阵 \(\mathbf{S} = \mathbf{X}^\top \mathbf{X} / n\) 的某个特征值的函数。通过 Marchenko-Pastur 律,可以知道 \(\mathbf{S}\) 的特征值谱的极限行为,进而推导出 \(\text{RSS}(M_t)/\text{RSS}(M_0)\) 的渐近分布。然后,将这个渐近分布代入 AIC/BIC/Cp 的选择准则中,就可以计算出选择正确模型的概率极限。

结论:在这个最简特例下,本文的定理会告诉我们:当信号强度 \(\beta_1^2\) 足够大(超过某个依赖于 \(c\) 的阈值)时,BIC 选择 \(M_t\) 的概率趋于 1;而 AIC 和 \(C_p\) 选择 \(M_t\) 的概率收敛于一个小于 1 的常数(例如,当 \(c=0.5\) 时,这个常数可能约为 0.7)。这个常数不随 \(n\) 增长而改变,揭示了 AIC/Cp 在高维比例下的固有局限性。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在高维线性回归(\(p/n \to c \in (0,1)\))且误差正态的设定下,推导了 AIC、BIC 和 \(C_p\) 三种经典模型选择准则选择正确模型的概率极限表达式。
  2. 核心工具 / 方法:随机矩阵理论(RMT),特别是 Marchenko-Pastur 律、样本协方差矩阵特征值的极值渐近,以及扰动理论。
  3. 主要结论:当信号强度足够强时,BIC 仍具有模型选择一致性(概率趋于 1);而 AIC 和 \(C_p\) 则趋于选择过拟合模型,其选择正确模型的概率收敛于一个小于 1 的常数,该常数依赖于 \(c = p/n\) 和信号强度。

关键设定与假设

  • 设定:线性回归模型 \(\mathbf{y} = \mathbf{X} \boldsymbol{\beta} + \boldsymbol{\varepsilon}\),其中 \(\boldsymbol{\varepsilon} \sim N(0, \sigma^2 \mathbf{I}_n)\)
  • 假设
    1. 高维比例\(p/n \to c \in (0,1)\)。这是核心设定,区别于经典低维。
    2. 随机设计矩阵\(\mathbf{X}\) 的行向量独立同分布,且满足 Marcinkiewicz 型矩条件(即存在某个阶数的矩有界)。这比高斯假设更弱,允许更一般的分布。
    3. 候选模型集:假设候选模型集包含真模型 \(M_t\)(即“正确模型”在候选集中)。这是一个关键假设,意味着我们只关心“过拟合”和“欠拟合”的风险,而不考虑“模型错误指定”的情况。
    4. 信号强度:非零回归系数 \(\beta_j\) 的大小需要满足一定的条件(如 \(\beta_j^2 / \sigma^2\) 足够大),以保证 BIC 的一致性。这个条件在定理中会具体给出。
  • 相比已有文献的放宽或强化
    • 放宽:相比经典低维理论(\(p\) 固定),本文允许 \(p\)\(n\) 同阶增长,这是一个显著的放宽。
    • 强化:相比正则化方法(如 Lasso)的设定,本文假设候选模型集包含真模型,且所有模型都通过 OLS 拟合。这避免了 Lasso 的不可表示条件,但同时也限制了应用场景(例如,不能处理 \(p > n\) 的情况)。

主要结果

本文的核心结果是定理 1、2、3,分别对应 AIC、BIC 和 \(C_p\)。这里以 BIC 为例进行陈述(定理 2):

  • 定理 2(BIC 的一致性):在满足上述假设的条件下,如果信号强度足够强,即存在一个常数 \(\delta > 0\) 使得所有非零回归系数满足 \(\beta_j^2 / \sigma^2 > \delta\),则 BIC 选择真模型 \(M_t\) 的概率趋于 1,即:
    \[\lim_{n \to \infty} P(\text{BIC 选择 } M_t) = 1\]
  • 直觉:BIC 的惩罚项 \(k \log n\) 随着 \(n\) 增长而发散,这足以惩罚过拟合模型。在高维比例下,只要信号强度足够强,使得欠拟合模型(遗漏重要变量)的 RSS 显著大于正确模型,BIC 就能一致地选出真模型。
  • 必要条件:信号强度必须足够强。如果信号太弱,即使 BIC 也无法一致选择。
  • 解决的技术难点:证明的关键在于刻画过拟合模型和欠拟合模型下 RSS 的渐近分布。过拟合模型(包含真模型的所有变量外加一些无关变量)的 RSS 会偏小,但 BIC 的惩罚项 \(k \log n\) 会抵消这种优势。欠拟合模型(遗漏重要变量)的 RSS 会偏大,但需要精确量化这个“偏大”的程度,以确保 BIC 能识别出来。本文利用 RMT 给出了 RSS 的精确渐近表达式。

对于 AIC 和 \(C_p\)(定理 1 和 3): * 结论:AIC 和 \(C_p\) 选择真模型的概率收敛于一个小于 1 的常数 \(P_c\),该常数依赖于 \(c = p/n\) 和信号强度。例如,当 \(c=0.5\) 且信号强度适中时,\(P_c\) 可能约为 0.7。 * 直觉:AIC 和 \(C_p\) 的惩罚项是常数(2 和 2),不随 \(n\) 增长。在高维比例下,过拟合模型带来的 RSS 减少(即使只多包含一个无关变量)在渐近上可能超过这个常数惩罚,导致 AIC/Cp 倾向于选择更大的模型。

证明路线与技术技巧

  • 整体路线

    1. 将选择概率转化为关于 RSS 的渐近事件:首先,将“BIC 选择真模型”这一事件转化为关于不同候选模型 RSS 之间比较的不等式。例如,对于真模型 \(M_t\) 和一个过拟合模型 \(M_+\),BIC 选择 \(M_t\) 当且仅当 \(\text{RSS}(M_t) - \text{RSS}(M_+) < \sigma^2 (k_+ - k_t) \log n / n\)
    2. 刻画 RSS 的渐近分布:这是最核心的一步。利用 RMT,将 \(\text{RSS}(M)\) 表示为关于样本协方差矩阵 \(\mathbf{S} = \mathbf{X}^\top \mathbf{X} / n\) 的某个二次型。具体地,对于包含 \(k\) 个变量的模型 \(M\),其 RSS 可以写成 \(\text{RSS}(M) = \boldsymbol{\varepsilon}^\top (\mathbf{I}_n - \mathbf{P}_M) \boldsymbol{\varepsilon}\),其中 \(\mathbf{P}_M\) 是投影到 \(M\) 的列空间上的投影矩阵。在高维比例下,\(\mathbf{P}_M\) 的特征值分布由 Marchenko-Pastur 律控制。
    3. 应用 Marchenko-Pastur 律和极值渐近:通过 Marchenko-Pastur 律,可以得到 \(\text{RSS}(M)\) 的渐近期望和方差。更重要的是,利用特征值极值渐近(如 Bai et al., 2007),可以刻画 \(\text{RSS}(M)\) 的渐近分布,特别是其尾部行为。
    4. 推导选择概率的极限:将第 2 步得到的 RSS 渐近分布代入第 1 步的不等式中,通过计算概率极限,得到 BIC 选择真模型的概率趋于 1 的条件,以及 AIC/Cp 选择概率收敛的常数。
  • 关键跳跃点

    • 从经典卡方到 RMT 特征值:经典低维理论中,\(\text{RSS}(M) \sim \sigma^2 \chi^2_{n-k}\)。在高维比例下,这个简单的卡方分布不再成立。作者的关键跳跃是认识到 \(\text{RSS}(M)\) 的分布可以由 \(\mathbf{S}\) 的特征值谱完全刻画,从而将问题转化为 RMT 问题。
    • 处理过拟合与欠拟合的差异:过拟合模型和欠拟合模型下 RSS 的渐近行为有本质不同。过拟合模型下,RSS 的减少量(相对于真模型)是“小量”,需要精确到 \(O_p(1/n)\) 量级;而欠拟合模型下,RSS 的增加量是“大量”,是 \(O_p(1)\) 量级。作者需要分别处理这两种情况,并证明 BIC 的惩罚项 \(k \log n\) 足以区分它们。
  • 技术技巧点名

    • Marchenko-Pastur 律:用于刻画样本协方差矩阵 \(\mathbf{S}\) 的特征值谱的极限分布,是计算 RSS 渐近均值和方差的基础。
    • 特征值极值渐近(Bai et al., 2007):用于刻画 \(\mathbf{S}\) 的最大和最小特征值的渐近分布,这对于分析过拟合模型下 RSS 的尾部行为至关重要。
    • 扰动理论:用于分析当模型增加或减少变量时,投影矩阵 \(\mathbf{P}_M\) 的特征值如何变化,从而推导 RSS 的变化量。
    • 矩方法:用于证明 Marcinkiewicz 型矩条件下,样本协方差矩阵的谱分布收敛到 Marchenko-Pastur 律。

真实例子与应用

本文为纯理论论文,无实证例子。所有结果都是渐近定理,没有模拟实验或真实数据分析。作者在引言中提到了一个简单的数值例子(图 1),但那是为了直观展示 AIC/BIC/Cp 选择概率随 \(c\) 变化的趋势,并非严格的模拟验证。

🔎 结论是否比证明窄

  • 窄结论:定理的成立依赖于“候选模型集包含真模型”这一假设。在实际应用中,候选模型集可能不包含真模型(即模型错误指定),此时本文的结论是否成立是未知的。作者在结论部分明确提到了这一点:“Our results are derived under the assumption that the true model is in the candidate set. The case of model misspecification is an important topic for future research.
  • 泛泛 claim:作者在引言中声称“BIC is consistent in high-dimensional regression”,但定理的条件是信号强度足够强。如果信号强度很弱,BIC 也可能不一致。这个条件在定理陈述中是明确的,但在引言中的表述可能被读者误解为“无条件一致”。

四、开放问题

  1. 模型错误指定:当候选模型集不包含真模型时,AIC/BIC/Cp 的渐近行为如何?这是作者明确指出的未来工作(见结论部分)。研究者可以尝试将本文的 RMT 框架推广到模型错误指定的情形。
  2. 非正态误差:本文假设误差正态。如果误差分布是非正态的(如重尾分布),结论是否仍然成立?这需要更一般的 RMT 结果(如 Bai & Silverstein, 2010 中关于非正态数据的谱分布收敛定理)。
  3. 信号强度的精确阈值:本文给出了 BIC 一致性的充分条件(信号强度足够强),但未给出精确的阈值。这个阈值是否可以用 \(c\) 和信号强度的函数显式表达?是否存在一个“相变”点,低于该点 BIC 也无法一致?这类似于高维稀疏恢复中的“信噪比阈值”问题。
  4. 与正则化方法的比较:本文的结果与 Lasso 等正则化方法在高维模型选择上的结果有何联系?例如,当 \(p/n \to c\) 且模型稀疏时,BIC 的一致性条件是否比 Lasso 的不可表示条件更宽松或更严格?这是一个值得深入比较的问题。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论