跳转至

Optimal rates for aggregation of affine estimators

作者: Jingfu Peng
主题: 非参数 / 半参数
相关性: 6/10
链接: https://arxiv.org/abs/2609.07166


一、领域脉络与小综述

这个方向是什么

这个子方向是统计聚合理论,研究如何将多个候选估计量(estimators)组合成一个最终估计量,使其在某种损失/风险下尽可能接近最优组合(oracle)。核心问题是:给定一个候选估计量集合,聚合过程能达到多快的收敛速率?这个速率如何依赖于候选数量 \(M\)、样本量 \(n\)、以及候选估计量本身的性质(如是否依赖于同一数据)?该方向已发展出三种经典聚合类型:模型选择(MS)聚合、凸(C)聚合和线性(L)聚合,分别对应权重约束为单点、单纯形和全空间。

发展脉络

  • 奠基工作(2000-2004):Nemirovski (2000)、Tsybakov (2003)、Catoni (2004)、Yang (2004) 建立了聚合问题的极小化框架,将聚合分为 MS、C、L 三种类型,并给出了确定性候选情形下的极小化最优速率。例如,Tsybakov (2003) 证明了凸聚合的速率存在“elbow”现象:当 \(M \le \sqrt{n}\) 时,速率为 \(M/n\);当 \(M > \sqrt{n}\) 时,速率为 \(\sqrt{\log(eM/\sqrt{n})/n}\)。

  • 主要进展(2005-2012):一系列工作发展了达到这些最优速率的聚合过程,并建立了sharp oracle inequalities。关键工作包括:

  • Bunea, Tsybakov, Wegkamp (2007):在 Gaussian 回归中建立了 MS、C、L 聚合的速率,并证明了这些速率是最优的。
  • Juditsky, Rigollet, Tsybakov (2008):提出了 Mirror Averaging 算法,并证明了其满足 sharp oracle inequalities。
  • Rigollet & Tsybakov (2011, 2012):在稀疏估计中引入 Exponential Screening 和 Exponential Weighting,证明了稀疏 oracle 不等式。
  • Dalalyan & Salmon (2012):将聚合理论推广到仿射估计量(affine estimators),证明了指数加权聚合(EWA)在期望意义下满足 sharp oracle inequalities。
  • Dai, Rigollet, Zhang (2012):提出了 Q-aggregation,解决了模型选择聚合在偏差(deviation)意义下的最优性。
  • Bellec (2018):在仿射估计量的模型选择聚合中,建立了极小化最优速率,并证明了 Q-aggregation 达到该速率。这是第一个处理数据依赖候选(candidate estimators 与聚合权重从同一数据估计)的极小化结果。

  • 当前 Frontier(2018-2025):在 Bellec (2018) 解决了 MS 聚合后,凸和线性聚合的极小化速率仍是开放问题。现有工作(如 Peng, 2024, 2025; Peng et al., 2025)仅给出了凸聚合的上界,但未证明这些上界是否紧(即缺乏匹配的下界)。线性聚合的极小化速率则完全未知。

  • 本文的位置:本文填补了上述 gap,建立了凸聚合的匹配极小化上下界,并证明 Mallows' \(C_p\) 准则达到该最优速率。对于线性聚合,在最小稳定秩(minimum stable rank)条件下,也建立了匹配的上下界。

子线索聚类

  1. 经典纯聚合(Pure Aggregation):候选估计量是确定性的,或由独立于聚合数据的样本构造。核心问题是聚合阶段的速率。代表工作:Tsybakov (2003), Bunea et al. (2007), Rigollet & Tsybakov (2007, 2011, 2012), Juditsky et al. (2008), Lecué & Rigollet (2014)。

  2. 数据依赖候选的模型选择聚合:候选估计量从同一数据构造,但聚合目标只是选择最好的一个(MS 聚合)。代表工作:Leung & Barron (2006), Giraud (2008), Alquier & Lounici (2011), Dalalyan & Salmon (2012), Dai et al. (2014), Bellec (2018)(建立了极小化最优速率)。

  3. Mallows 模型平均(Mallows Model Averaging):计量经济学中,通过最小化 Mallows' \(C_p\) 准则来组合最小二乘估计量。代表工作:Hansen (2007), Wan et al. (2010), Zhang (2021), Peng et al. (2025)。这些工作主要关注渐近最优性(asymptotic optimality),而非非渐近的极小化速率。

核心问题与已知瓶颈

  • Q1:当候选估计量是数据依赖的仿射估计量时,凸聚合的极小化速率是否与确定性候选情形相同(即 \(M/n\) 或 \(\sqrt{\log(eM/\sqrt{n})/n}\))?
  • Q2:如果相同,能否构造一个达到该速率的聚合过程?
  • Q3:Mallows' \(C_p\) 准则是否是最优的?现有上界(如 Bellec, 2018 的 Proposition 7.2)给出的速率是 \(n^{-1/2}\),远劣于 \(M/n\),这是技术缺陷还是本质困难?
  • Q4:线性聚合的极小化速率是什么?需要什么条件?

已知瓶颈:现有凸聚合上界(如 Bellec, 2018; Peng, 2025)要么速率不紧(如 \(n^{-1/2}\)),要么依赖于限制性假设(如嵌套线性子空间、正交投影矩阵)。缺乏匹配的下界来确认这些上界是否最优。

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将现有文献的缺口总结为“凸和线性聚合的极小化速率未知”,并强调“即使候选估计量是数据依赖的,凸聚合的速率也不应改变”。这使得本文成为“显然的下一步”:既然 MS 聚合已被 Bellec (2018) 解决,那么凸和线性聚合就是自然延伸。
  • 哪些竞争路线被淡化或回避:
  • 样本分割(sample splitting):作者在 Section 1.1 提到,纯聚合框架需要样本分割,而本文研究的是“无样本分割”的设定。但作者并未讨论样本分割是否能在更弱的假设下达到相同速率,也未比较两种设定的优劣。
  • 非线性估计量:作者在 Section 5 承认,本文理论依赖于仿射结构,对于非线性估计量,“universal minimax rate depending only on \(n\) and \(M\) should not generally be expected”。这实际上回避了更一般的聚合问题。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:未见明显缺失。作者引用了该方向几乎所有关键工作,包括 Bellec (2018)、Dalalyan & Salmon (2012)、Dai et al. (2012) 等。

张力

未见明显对立引用。各工作之间在假设和结论上基本一致,只是逐步放宽条件、提升速率。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号:
  • \(Y = (Y_1, \ldots, Y_n)^\top \in \mathbb{R}^n\):可观测的响应向量。
  • \(f = (f_1, \ldots, f_n)^\top \in \mathbb{R}^n\):未知的回归均值向量(要估计的对象)。
  • \(\xi = (\xi_1, \ldots, \xi_n)^\top\):i.i.d. 均值为零的随机误差,方差 \(\sigma^2\)。
  • \(n\):样本量。
  • \(M\):候选仿射估计量的个数。
  • \(\hat{f}_m = A_m Y + b_m\):第 \(m\) 个候选仿射估计量,其中 \(A_m \in \mathbb{R}^{n \times n}\) 是确定性矩阵,\(b_m \in \mathbb{R}^n\) 是确定性截距向量。
  • \(w = (w_1, \ldots, w_M)^\top\):聚合权重向量。
  • \(\hat{f}_{w|M} = \sum_{m=1}^M w_m \hat{f}_m = A_w Y + b_w\):权重为 \(w\) 的聚合估计量,其中 \(A_w = \sum w_m A_m\), \(b_w = \sum w_m b_m\)。
  • \(W_C = \{w \in [0,1]^M: \sum w_m = 1\}\):凸聚合的权重约束(单纯形)。
  • \(W_L = \mathbb{R}^M\):线性聚合的权重约束(无约束)。
  • \(L_n(\hat{f}, f) = \|\hat{f} - f\|_n^2 = \frac{1}{n} \sum_{i=1}^n (\hat{f}_i - f_i)^2\):经验二次损失。
  • \(R_n(\hat{f}, f) = \mathbb{E}_f L_n(\hat{f}, f)\):风险。
  • \(\psi_{n,M}^C\):凸聚合的极小化速率,定义为 \(\psi_{n,M}^C = M/n\) 当 \(M \le \sqrt{n}\),否则 \(\psi_{n,M}^C = \sqrt{\log(eM/\sqrt{n})/n}\)。
  • \(\psi_{n,M}^L = M/n\):线性聚合的极小化速率(确定性候选情形)。
  • \(\|\cdot\|_{op}\):矩阵的算子范数(谱范数)。
  • \(\|\cdot\|_F\):矩阵的 Frobenius 范数。
  • \(\|\cdot\|_n\):向量的 \(\ell_2\) 范数除以 \(\sqrt{n}\)。

  • 模型:

  • 固定设计回归模型:\(Y_i = f_i + \xi_i\),其中 \(f_i = f(x_i)\),\(x_i\) 是确定性设计点。
  • 误差 \(\xi_i\) 是 i.i.d. 的 sub-Gaussian 或 Gaussian 随机变量,满足 \(\|\xi_i\|_{\psi_2} \le \kappa \sigma\)(\(\kappa \ge 1\) 为常数)。
  • 未知回归均值向量 \(f\) 属于某个参数空间 \(\mathcal{F} \subseteq \mathbb{R}^n\)(如 \(\mathcal{F}_n(F) = \{f: \|f\|_n \le F\}\))。

  • 可观测数据:

  • 可观测:响应向量 \(Y\),以及候选仿射估计量的矩阵 \(A_m\) 和截距 \(b_m\)(这些是确定性的,由研究者选择)。
  • 想要但观测不到:真正的回归均值向量 \(f\),以及误差 \(\xi\)。
  • 关键点:候选估计量 \(\hat{f}_m = A_m Y + b_m\) 依赖于 \(Y\),因此与聚合阶段使用的数据相同。这与“纯聚合”设定(候选由独立样本构造)不同。

第二步:最小内核

本文的核心思路可以用一个最简特例来理解:\(M=2\) 个候选仿射估计量,且 \(A_1, A_2\) 是标量(即 \(n=1\))。虽然论文处理的是一般 \(n\),但 \(n=1\) 的特例抓住了所有关键数学困难。

  • 最简特例设定:
  • \(n=1\):只有一个观测 \(Y = f + \xi\),\(\xi \sim N(0, \sigma^2)\)。
  • \(M=2\):两个候选仿射估计量:\(\hat{f}_1 = a_1 Y + b_1\),\(\hat{f}_2 = a_2 Y + b_2\),其中 \(a_1, a_2, b_1, b_2\) 是已知常数。
  • 凸聚合权重:\(w \in [0,1]\),聚合估计量为 \(\hat{f}_w = w \hat{f}_1 + (1-w) \hat{f}_2 = (w a_1 + (1-w) a_2) Y + (w b_1 + (1-w) b_2)\)。
  • 损失:\(L(\hat{f}_w, f) = (\hat{f}_w - f)^2\)。
  • 目标:找到权重 \(\hat{w}\),使得 \(L(\hat{f}_{\hat{w}}, f)\) 尽可能接近 \(\inf_{w \in [0,1]} L(\hat{f}_w, f)\)。

  • Mallows' \(C_p\) 准则:

  • 在 \(n=1\) 时,Mallows' \(C_p\) 准则简化为:
    \[C_p(w) = (\hat{f}_w - Y)^2 + 2\sigma^2 (w a_1 + (1-w) a_2).\]
  • 第一项是拟合误差,第二项是惩罚项,惩罚估计量的“复杂度”(即对 \(Y\) 的线性依赖程度)。

  • 核心思路:

  • 强凸性:\(C_p(w)\) 关于 \(\hat{f}_w\) 是强凸的(因为它是 \((\hat{f}_w - Y)^2\) 加上一个线性项)。这意味着,如果 \(\hat{w}\) 最小化 \(C_p\),那么对于任何 \(w\),有:

    \[C_p(\hat{w}) \le C_p(w) - (\hat{f}_{\hat{w}} - \hat{f}_w)^2.\]
    这个负二次项是推导 sharp oracle inequality 的关键。

  • 损失差的上界:通过代数运算,可以将损失差 \(\|\hat{f}_{\hat{w}} - f\|^2 - \|\hat{f}_w - f\|^2\) 与 \(C_p\) 的差和随机项联系起来。最终得到:

    \[\|\hat{f}_{\hat{w}} - f\|^2 - \|\hat{f}_w - f\|^2 \le 2\xi (\hat{f}_{\hat{w}} - \hat{f}_w) - 2\sigma^2 (a_{\hat{w}} - a_w) - \|\hat{f}_{\hat{w}} - \hat{f}_w\|^2.\]
    其中 \(a_w = w a_1 + (1-w) a_2\)。

  • 局部化与 chaining:随机项 \(2\xi (\hat{f}_{\hat{w}} - \hat{f}_w) - 2\sigma^2 (a_{\hat{w}} - a_w)\) 需要被控制。关键技巧是局部化:只考虑那些使得 \(\|\hat{f}_{\hat{w}} - \hat{f}_w\|\) 不太大的权重差,然后通过 chaining 技术(Lemma 3)将局部控制扩展到全局。这避免了全局分析中出现的次优速率。

  • Maurey 采样(大 \(M\) 情形):当 \(M\) 很大时(\(M > \sqrt{n}\)),直接控制所有 \(M\) 个候选的随机项会得到次优速率。作者使用 Maurey 采样两次:一次将 oracle 权重近似为 \(m\) 个候选的均匀混合(\(m \ll M\)),另一次将 Mallows 估计的权重也稀疏化。这相当于将有效候选数从 \(M\) 降到 \(m\),从而得到更快的速率。

  • 为什么这个特例抓住了核心:

  • 即使 \(n=1\),上述步骤 1-3 已经包含了证明的所有关键元素:强凸性、损失差分解、局部化、chaining。一般 \(n\) 只是将这些步骤从标量推广到向量,并使用更一般的矩阵范数。
  • 步骤 4(Maurey 采样)在 \(n=1\) 时也完全适用,因为其本质是组合概率论,与 \(n\) 无关。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在固定设计回归中,研究有限个仿射估计量的凸聚合和线性聚合的极小化最优速率,其中候选估计量和聚合权重从同一数据估计(无样本分割)。
  2. 核心工具/方法:对于凸聚合,使用最小化 Mallows' \(C_p\) 准则来估计权重;对于线性聚合,使用截断的 Mallows' \(C_p\) 准则。证明中使用了强凸性、局部化 empirical process、chaining、Maurey 采样等技巧。
  3. 主要结论:凸聚合的极小化速率与确定性候选情形相同(\(\psi_{n,M}^C\)),且 Mallows' \(C_p\) 达到该速率。线性聚合在最小稳定秩条件下,速率也为 \(M/n\)。

关键设定与假设

  • 模型:固定设计回归 \(Y = f + \xi\),\(\xi\) 为 i.i.d. sub-Gaussian 或 Gaussian 误差。
  • 候选仿射估计量:\(\hat{f}_m = A_m Y + b_m\),其中 \(A_m, b_m\) 是确定性的。
  • 关键假设:
  • 凸聚合(Theorem 2, 3):
    • Theorem 2(小 \(M\) 情形,\(M \le \sqrt{n}\)):只需 \(\max_m \|A_m\|_{op} \le A\)(算子范数有界)。对 \(b_m\) 和 \(f\) 无限制。
    • Theorem 3(大 \(M\) 情形,\(M > \sqrt{n}\)):额外需要 \(\max_m \|b_m\|_n \le B\) 和 \(\|f\|_n \le F\)(截距和均值向量有界)。
  • 线性聚合(Theorem 5):
    • 候选集合 \(\mathcal{M}\) 的线性空间维数为 \(D\)(\(D \le M\))。
    • 最小稳定秩条件:\(s_{\mathcal{A}(\mathcal{M})} \ge s\),即 \(\mathcal{A}(\mathcal{M})\) 中任何非零矩阵的稳定秩至少为 \(s\)。这防止了矩阵的 Frobenius 范数集中在单个奇异方向上。
  • 相比已有文献:
  • 放宽:相比 Bellec (2018) 的 Proposition 7.2(凸聚合上界为 \(n^{-1/2}\)),本文的假设更弱(只需算子范数有界),但得到了更快的速率 \(M/n\)。
  • 强化:相比 Peng et al. (2025)(需要嵌套线性子空间和正交投影),本文的假设更一般(允许任意仿射估计量),但需要 sub-Gaussian 误差假设(Peng et al. 使用四阶矩条件)。

主要结果

  • Theorem 1(凸聚合下界):存在候选集合 \(\mathcal{M} \in \mathcal{M}_{M,A}^{(0)}\)(零截距,算子范数有界),使得任何估计量 \(\tilde{f}\) 的 excess loss 至少为 \(c \sigma^2 \psi_{n,M}^C\),概率至少为 \(c_2\)。这证明了 \(\psi_{n,M}^C\) 是极小化下界。
  • Theorem 2(凸聚合上界,小 \(M\)):Mallows' \(C_p\) 估计量 \(\hat{f}_{\hat{w}|M}\) 满足,对任何 \(f\) 和 \(\mathcal{M} \in \mathcal{M}_{M,A}\),以概率 \(1 - e^{-x}\),
    \[L_n(\hat{f}_{\hat{w}|M}, f) - \inf_{w \in W_C} L_n(\hat{f}_{w|M}, f) \le C_{\kappa, A} \frac{\sigma^2 (M + x)}{n}.\]
    这匹配了 Theorem 1 的下界(当 \(M \le \sqrt{n}\) 时,\(\psi_{n,M}^C = M/n\))。
  • Theorem 3(凸聚合上界,大 \(M\)):在额外有界假设下,Mallows' \(C_p\) 估计量满足,以概率 \(1 - e^{-x}\),
    \[L_n(\hat{f}_{\hat{w}|M}, f) - \inf_{w \in W_C} L_n(\hat{f}_{w|M}, f) \le C_{\kappa, A} \left( \Lambda^2 \sqrt{\frac{\log(eM/\sqrt{n})}{n}} + \frac{\sigma^2 x}{n} \right),\]
    其中 \(\Lambda^2 = \sigma^2 + F^2 + B^2\)。这匹配了 \(\psi_{n,M}^C\) 在大 \(M\) 时的速率。
  • Theorem 4(线性聚合下界):在最小稳定秩条件下,存在候选集合使得任何估计量的 excess loss 至少为 \(c (F^2 \wedge \sigma^2 D / n)\)。
  • Theorem 5(线性聚合上界):截断 Mallows' \(C_p\) 估计量在最小稳定秩条件 \(s \ge C (D + x)\) 下,达到与下界匹配的速率。

证明路线与技术技巧

凸聚合(Theorem 2):

  1. 基本不等式:利用 Mallows' \(C_p\) 的强凸性(Lemma 4),得到损失差的上界:

    \[\|\hat{f}_{\hat{w}|M} - f\|^2 - \|\hat{f}_{w|M} - f\|^2 \le 2\xi^\top V_u - 2\sigma^2 \text{tr}(A_u) - \|V_u\|^2,\]
    其中 \(u = \hat{w} - w\),\(V_u = A_u Y + b_u\)。

  2. 随机项分解:将右边分解为 \(W(u) - \rho(u)^2\),其中 \(W(u)\) 是 centered 随机过程,\(\rho(u)^2 = \|a_u\|^2 + \sigma^2 \|A_u\|_F^2\) 是“信号+噪声”的度量。

  3. 局部化:定义局部集 \(\mathcal{D}_r = \{u: \rho(u) \le r\}\)。在 \(\mathcal{D}_r\) 上,使用 chaining(Lemma 3)控制 \(\sup_{u \in \mathcal{D}_r} |W(u)|\)。关键技巧是引入一个控制半范数 \(p_r(h) = \max\{\rho(h)/r, \|h\|_1/2\}\),它同时控制 \(\rho\) 和 \(\ell_1\) 范数,从而能统一处理矩阵和向量的随机项。

  4. Peeling:将整个空间 \(\mathcal{D}\) 分解为 dyadic annuli \(\mathcal{A}_k = \{u: r_{k-1} < \rho(u) \le r_k\}\)。在每个 annuli 上,利用局部化结果和 \(\rho(u)\) 的下界,证明 \(W(u) - \rho(u)^2 \le 0\)(对于 \(k \ge 1\)),从而只有内层 \(\mathcal{A}_0\) 贡献非零项。

  5. 最终界:内层贡献的项为 \(C \sigma^2 (M + x)/n\),得到 Theorem 2。

凸聚合(Theorem 3,大 \(M\)):

  1. 第一次 Maurey 采样:将 oracle 权重 \(w^\circ\) 近似为 \(m\) 个候选的均匀混合 \(\tilde{w}^\circ \in \mathcal{G}_m\)(Maurey 网格)。这给出了 \(L(w_1) \le L(w^\circ) + H(Y)/m\),其中 \(w_1\) 是网格上的最优权重,\(H(Y)\) 是最大候选能量。

  2. 均匀段控制:对网格 \(\mathcal{G}_m\) 中任意两点 \(g_0, g_1\),使用 Lemma 5(一维段不等式)控制随机项在连接它们的线段上的最大值。通过 union bound 得到全局控制 \(\Gamma_m(Y)\)。

  3. 第二次 Maurey 采样:将 Mallows 估计权重 \(\hat{w}\) 也稀疏化为 \(\tilde{w} \in \mathcal{G}_m\)。利用 \(\hat{w}\) 的最优性和段不等式,得到 \(L(\hat{w}) \le L(w_1) + V(Y)/m + 2\Gamma_m(Y)\),其中 \(V(Y)\) 是方差项。

  4. 组合:结合步骤 1 和 3,得到 \(L(\hat{w}) - L(w^\circ) \le 2H(Y)/m + 2\Gamma_m(Y)\)。然后控制 \(H(Y)\) 和 \(\Gamma_m(Y)\) 的概率尾,并优化 \(m\)(取 \(m \asymp \sqrt{n/\log(eM/\sqrt{n})}\)),得到 Theorem 3。

线性聚合(Theorem 5):

  1. 坐标变换:将候选集合的线性空间用一组基 \((C_k, c_k)\) 表示,将问题转化为 \(D\) 维线性回归。

  2. 自归一化恒等式:在基坐标下,Mallows 估计量的 excess loss 等于 \(q^\top G^{-1} q\),其中 \(q\) 是 score 向量,\(G\) 是 Gram 矩阵。

  3. 固定方向浓度:对任意方向 \(u\),利用 Hanson-Wright 不等式和稳定秩条件,得到 \(u^\top q\) 和 \(u^\top G u\) 的浓度界。

  4. 均匀化:通过 \(\varepsilon\)-net 和标准矩阵浓度,得到 \(\|H_f^{-1/2} q\|\) 和 \(\|H_f^{-1/2} G H_f^{-1/2} - I_D\|_{op}\) 的均匀界。

  5. 完成:在 \(G\) 可逆的事件上,\(q^\top G^{-1} q \le 2 \|H_f^{-1/2} q\|^2\),结合均匀界得到 Theorem 5。

技术技巧点名

  • Hanson-Wright 不等式(Lemma 2):用于控制二次型 \(\xi^\top S \xi\) 的浓度。
  • 有限维混合尾 chaining(Lemma 3):用于在局部集上控制随机过程的最大值。这是证明的核心技巧,它允许同时处理两个不同尺度的随机项(\(\sqrt{x}\) 和 \(x\) 项)。
  • Maurey 采样:用于将 \(M\) 个候选的聚合问题近似为 \(m\) 个候选的聚合问题(\(m \ll M\)),从而降低有效维数。
  • Peeling:将空间分解为 dyadic annuli,在每个 annuli 上分别控制,然后合并。
  • 稳定秩:用于控制线性聚合中 Gram 矩阵的条件数,防止过度拟合。

真实例子与应用

本文为纯理论论文,无实证例子。所有结果均为数学定理和证明。

🔎 结论是否比证明窄

  • Theorem 2 的结论比证明窄:Theorem 2 声称对任何 \(f \in \mathbb{R}^n\) 和 \(\mathcal{M} \in \mathcal{M}_{M,A}\) 成立。但证明中(Step 2)实际上假设了 \(\|A_u\|_{op} \le 2A\) 和 \(\|a_u\| \le r\)(局部化)。这些条件在局部集 \(\mathcal{D}_r\) 上成立,但通过 peeling 推广到全局时,需要确保 peeling 覆盖了整个空间。证明中通过选择 \(r_k\) 趋于无穷来保证这一点,因此结论是严格的。
  • Theorem 3 的结论与证明一致:证明中明确使用了 \(\|f\|_n \le F\) 和 \(\|b_j\|_n \le B\) 来控制 \(H(Y)\),结论也要求这些条件。
  • Theorem 5 的结论与证明一致:证明中明确使用了稳定秩条件来控制 \(\|C\|_{op}\),结论也要求该条件。

四、开放问题

  1. 线性聚合的最小稳定秩条件是否必要? 本文的线性聚合上界(Theorem 5)依赖于 \(s \ge C(D+x)\)。作者在 Section 5 承认:“it is not known whether this condition is necessary or can be substantially weakened.” 这是一个明确的开放问题:能否在更弱的条件下(如 \(s \ge 1\))达到相同速率?或者是否存在反例表明稳定秩条件本质上是必要的?

  2. 非线性估计量的聚合:本文理论依赖于仿射结构。对于一般的非线性估计量,作者在 Section 5 指出:“Without additional restrictions on the stability or complexity of the candidate procedures, a universal minimax rate depending only on \(n\) and \(M\) should not generally be expected.” 这是一个开放领域:对于哪些非线性估计量类(如深度神经网络、随机森林),可以建立类似的极小化速率?

  3. 其他权重约束下的聚合:本文研究了凸和线性聚合。作者在 Section 5 提到:“An important direction for future research is to develop a more general theory of linear aggregation and under other weight constraints.” 例如,\(\ell_1\) 球约束(稀疏聚合)或 \(\ell_q\) 球约束(\(0 < q < 1\))下的极小化速率是什么?

  4. Mallows' \(C_p\) 在非 Gaussian 误差下的最优性:本文假设误差为 sub-Gaussian。对于重尾误差(如只有有限矩),Mallows' \(C_p\) 是否仍然最优?或者需要其他准则(如 Huber 损失下的类似物)?


Maintained by 陈星宇 · Homepage · Source on GitHub

评论