跳转至

Analysis of the rate of convergence of two regression estimates defined by neural features which are easy to implement

作者: Alina Braun, Michael Kohler, Jeongik Cho, Adam Krzyżak
来源: Electronic Journal of Statistics
主题: 非参数 / 半参数
相关性: 6/10
链接: https://doi.org/10.1214/23-ejs2207


一、领域脉络与小综述

这个方向是什么

本文研究的核心问题是:如何在不进行昂贵的数据依赖优化(即不训练隐藏层权重)的前提下,利用神经网络的逼近能力,构造出在非参数回归中能达到良好收敛速度的估计量。 当前,深度神经网络在理论上已被证明能适应高维数据的低维结构(如光滑性、复合结构),但这些理论结果通常依赖于通过经验风险最小化(ERM)来训练整个网络,这在实践中是高度非凸且计算昂贵的。本文试图在“理论最优性”与“计算可行性”之间架一座桥——用随机初始化的特征(权重固定)加上一个简单的线性最小二乘输出层,来逼近那些需要全网络训练的估计量的收敛速度。

发展脉络(history)

作者在引言中引用的工作勾勒出一条清晰的线索:

  1. 奠基工作:神经网络逼近理论。作者引用 Cybenko (1989)Hornik et al. (1989) 来确立单隐层神经网络作为“通用逼近器”的地位——它们能以任意精度逼近任意连续函数。这是所有后续工作的理论起点。但早期工作只关心“逼近存在性”,不关心“从有限样本中学习”的统计速率。

  2. 主要进展:非参数回归中的神经网络速率。作者引用 Kohler & Krzyżak (2017)Schmidt-Hieber (2020) 作为关键转折点。这些工作证明了:在回归函数具有特定光滑性(如Hölder类)或复合结构(如加法模型、投影追踪)的假设下,深度神经网络估计量可以避免维数灾难,达到接近一维的收敛速率(如 \( n^{-2/(4+d)} \)\( n^{-2/(4+1)} \) 在对数因子内)。这些结果依赖于通过ERM训练整个网络。

  3. 当前Frontier:计算瓶颈与随机化方案。作者指出,上述理论结果“在实践中并不清楚如何精确实现”(原文:“In practice, however, it is not clear how this can be done exactly.”),因为ERM涉及非凸优化。这引出了本文的动机:能否用随机化替代优化? 作者引用了 Rahimi & Recht (2008) 的随机特征方法(用于核方法)和 Gorban et al. (2016) 的随机投影神经网络作为先例,但指出这些工作要么不涉及收敛速度分析,要么只针对特定结构。

  4. 本文的位置:本文是第一个(据作者声称)在非参数回归框架下,为“随机初始化权重 + 最小二乘输出层”这种易于实现的估计量,推导出明确的收敛速度,并证明在投影追踪假设下它能达到接近一维的速率。它填补了“理论最优但计算昂贵”与“计算便宜但缺乏理论保证”之间的空白。

子线索聚类

这些被引文献大致落在三条子线索上:

  • 线索A:神经网络逼近理论(Cybenko 1989, Hornik 1989, Barron 1993)。核心是证明神经网络能逼近什么函数,以及逼近误差如何随宽度/深度衰减。这些工作不涉及样本量 \( n \) 或统计速率。
  • 线索B:非参数回归中的神经网络速率(Kohler & Krzyżak 2017, Schmidt-Hieber 2020, Bauer & Kohler 2019)。核心是证明在光滑性或复合结构假设下,通过ERM训练的神经网络估计量能达到 minimax 最优或接近最优的收敛速度。这些工作建立了“神经网络可以避免维数灾难”的理论基础。
  • 线索C:随机化特征方法(Rahimi & Recht 2008, Gorban et al. 2016)。核心是用随机采样代替优化来生成特征,从而降低计算成本。Rahimi & Recht 针对的是核方法(随机傅里叶特征),Gorban 等人针对的是神经网络(随机投影)。但这些工作通常不提供非参数回归的收敛速度分析,或只给出较弱的界。

这个方向在追问的核心问题

  1. 逼近-估计权衡:给定一个函数类,需要多少随机特征(即网络宽度)才能同时保证逼近误差和估计误差都小?随机特征的数量如何随维数 \( d \) 和样本量 \( n \) 缩放?
  2. 结构假设的利用:随机特征方法能否像全训练网络一样,利用回归函数的低维结构(如加法模型、投影追踪、复合函数)来避免维数灾难?如果能,需要什么样的随机化策略(如多次随机投影)?
  3. 计算-统计效率的权衡:随机化方法节省了多少计算成本(如避免非凸优化),但付出了多少统计效率(如收敛速度变慢)?是否存在一个“免费午餐”的边界?
  4. 实现细节:随机权重的分布如何选择(如均匀分布、高斯分布)?激活函数如何选择(如sigmoid、ReLU)?这些选择如何影响收敛速度?

⚠️ 作者的 framing

作者把缺口 frame 成:“现有理论结果(如Kohler & Krzyżak 2017, Schmidt-Hieber 2020)虽然证明了神经网络能达到好速率,但它们的估计量是通过ERM定义的,在实践中难以精确实现。因此,我们需要一种‘易于实现’的替代方案,同时保留理论保证。” 这个 framing 隐含地假设了“ERM的不可实现性”是主要瓶颈,而随机化是自然的解决方案。

  • 被淡化/回避的竞争路线:作者没有讨论基于核方法(如RKHS) 的回归估计量,这些方法在计算上也是可行的(通过求解线性系统),并且也有成熟的收敛速度理论。作者也没有讨论局部多项式或样条方法,这些方法在低维时计算简单且理论成熟。作者似乎默认了“神经网络特征”是唯一能利用高维结构的方法,但实际中核方法(如通过随机傅里叶特征近似)也能达到类似效果。
  • 什么明显该被引/该存在、却没出现在intro里?:作者没有引用 Bach (2017) 关于随机特征与神经网络之间联系的突破性工作(“Breaking the curse of dimensionality with convex neural networks”),该工作证明了通过凸优化(如Lasso)训练随机特征网络可以达到 minimax 速率。也没有引用 Mei & Montanari (2022) 关于随机特征回归的泛化误差精确刻画(“The generalization error of random features regression: precise asymptotics and the double descent curve”),该工作为随机特征方法提供了更精细的统计力学分析。这些缺失可能意味着本文的理论分析相对基础(只给出上界,而非精确刻画),或者作者有意聚焦于更简单的“最小二乘拟合”设定。

张力

未见明显对立引用。所有被引工作基本一致地认为神经网络在理论上能避免维数灾难,但计算上存在挑战。本文的贡献在于为“随机化”这一具体计算策略提供了理论保证,与现有理论是互补而非矛盾的关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \( (X, Y) \):随机变量对,其中 \( X \in \mathbb{R}^d \)\( d \) 维预测变量,\( Y \in \mathbb{R} \) 是响应变量。
  • \( m(x) = \mathbb{E}[Y \mid X = x] \)回归函数,是本文要估计的目标(estimand)。
  • \( \{(X_1, Y_1), \ldots, (X_n, Y_n)\} \):独立同分布(i.i.d.)样本,来自 \( (X, Y) \) 的联合分布。
  • \( \sigma^2 = \mathbb{E}[(Y - m(X))^2] \):噪声方差,假设有限。
  • \( d \):预测变量的维数。
  • \( n \):样本量。
  • \( p \):神经网络隐藏层的宽度(即隐藏层神经元个数),是用户选择的超参数。
  • \( \sigma_{\text{act}} \):激活函数(如sigmoid、ReLU),本文主要使用sigmoid。
  • \( \hat{m}_n(x) \):基于样本构造的回归函数估计量。

  • 模型

  • 非参数回归模型\( Y = m(X) + \varepsilon \),其中 \( \varepsilon \) 是均值为0、方差为 \( \sigma^2 \) 的噪声,且 \( \varepsilon \)\( X \) 独立(或至少不相关)。没有对 \( m(x) \) 的参数形式做任何假设,只假设它属于某个光滑函数类(如Hölder类 \( \mathcal{C}^s \))或具有特定结构(如投影追踪形式)。
  • 神经网络结构:一个单隐层前馈神经网络,隐藏层有 \( p \) 个神经元,每个神经元有一个随机初始化的权重向量 \( w_j \in \mathbb{R}^d \) 和偏置 \( b_j \in \mathbb{R} \)。输出层是一个线性层,权重 \( a_j \in \mathbb{R} \) 通过最小二乘法拟合。
  • 随机化机制:权重 \( (w_j, b_j) \) 在训练前从某个固定分布(如均匀分布或高斯分布)中独立采样,之后固定不变。只有输出层权重 \( a_j \) 通过数据拟合。

  • 可观测数据

  • 可观测\( n \) 个样本 \( (X_i, Y_i) \),其中 \( X_i \)\( d \) 维向量,\( Y_i \) 是标量。研究者可以计算任何基于这些样本的统计量。
  • 不可观测/潜在:回归函数 \( m(x) \) 本身是未知的,只能通过样本估计。噪声 \( \varepsilon_i \) 也是不可观测的。随机权重 \( (w_j, b_j) \) 虽然是随机生成的,但生成后是已知的(因为研究者可以记录它们),因此它们不是潜在变量,而是可观测的“设计变量”。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:假设回归函数 \( m(x) \) 是光滑的(比如属于Hölder类 \( \mathcal{C}^s \)),且维数 \( d = 1 \)

在这个特例下,本文的第一个估计量(记为 \( \hat{m}_n^{(1)} \))是这样构造的:

  1. 生成随机特征:随机采样 \( p \) 个权重-偏置对 \( (w_j, b_j) \),其中 \( w_j \in \mathbb{R} \)(因为 \( d=1 \)),\( b_j \in \mathbb{R} \)。例如,从 \( [-1, 1] \) 上的均匀分布中采样。然后定义 \( p \) 个特征函数:

    \[\phi_j(x) = \sigma_{\text{act}}(w_j x + b_j), \quad j = 1, \ldots, p.\]
    这些 \( \phi_j(x) \)固定的、非线性的基函数。

  2. 最小二乘拟合:将 \( \hat{m}_n^{(1)}(x) \) 定义为这些基函数的线性组合,系数通过最小二乘法从数据中学习:

    \[\hat{m}_n^{(1)}(x) = \sum_{j=1}^p \hat{a}_j \phi_j(x),\]
    其中 \( \hat{a} = (\hat{a}_1, \ldots, \hat{a}_p)^\top \) 是以下最小二乘问题的解:
    \[\hat{a} = \arg\min_{a \in \mathbb{R}^p} \sum_{i=1}^n \left( Y_i - \sum_{j=1}^p a_j \phi_j(X_i) \right)^2.\]

这个特例下,要证的命题是什么?

命题:当 \( p \)\( n \) 以适当方式增长(例如 \( p \approx n^{1/(2s+1)} \))时,估计量 \( \hat{m}_n^{(1)} \) 的均方误差(MSE)收敛到0,且收敛速度为:

\[\mathbb{E}\left[ \int (\hat{m}_n^{(1)}(x) - m(x))^2 \, dP_X(x) \right] = O\left( n^{-\frac{2s}{2s+1}} \right).\]
这正是一维非参数回归的 minimax 最优速率(在Hölder光滑性假设下)。

为什么这个命题成立?核心思路(证明骨架)

  1. 逼近误差:因为 \( m(x) \) 是光滑的,且 sigmoid 激活函数是“通用逼近器”,所以存在一组系数 \( a_j^* \) 使得线性组合 \( \sum a_j^* \phi_j(x) \) 能以误差 \( O(p^{-s}) \) 逼近 \( m(x) \)。这依赖于神经网络逼近理论(如Barron 1993的变体)。关键:这个逼近误差只依赖于 \( p \)(宽度),不依赖于 \( n \)
  2. 估计误差:最小二乘估计的估计误差(即 \( \hat{a} \)\( a^* \) 的差异导致的误差)可以用经典的非参数回归的 VC 理论经验过程理论来界定。对于线性模型(在固定基函数下),估计误差的阶为 \( O(p/n) \)关键:这个估计误差只依赖于 \( p \)\( n \)
  3. 权衡:总误差 = 逼近误差 + 估计误差 ≈ \( O(p^{-s}) + O(p/n) \)。选择 \( p \) 来平衡这两项:令 \( p^{-s} \approx p/n \),解得 \( p \approx n^{1/(2s+1)} \),代入得总误差 ≈ \( n^{-2s/(2s+1)} \)

这个最小内核揭示了本文的核心数学困难:在一般高维情形(\( d > 1 \))下,逼近误差会变成 \( O(p^{-s/d}) \)(因为维数诅咒),导致总误差为 \( O(n^{-2s/(2s+d)}) \),这是次优的。为了克服这一点,本文引入了投影追踪(第二个估计量),通过多次随机投影将高维问题分解为多个一维问题的平均,从而恢复一维速率。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在非参数回归中,构造并分析了两种“易于实现”的估计量——它们使用随机初始化的神经网络特征(权重不训练),仅通过最小二乘法拟合输出层,并推导了它们在光滑函数类和投影追踪假设下的收敛速度。
  2. 核心工具/方法:随机神经网络特征 + 最小二乘拟合(第一个估计量);随机神经网络特征 + 投影追踪(第二个估计量,通过多次随机方向选择)。理论工具包括:神经网络逼近理论、非参数回归的minimax速率、经验过程理论、投影追踪的维度约简思想。
  3. 主要结论:在回归函数光滑的假设下,第一个估计量达到了标准的非参数收敛速度(受维数诅咒影响);在投影追踪假设下,第二个估计量达到了(对数因子以内的)一维收敛速度,从而避免了维数灾难。

关键设定与假设

  • 设定:非参数回归模型 \( Y = m(X) + \varepsilon \)\( X \)\( [0,1]^d \) 上取值(为方便理论分析,可推广到紧支撑分布)。样本 \( (X_i, Y_i) \) i.i.d.。
  • 假设1(光滑性):回归函数 \( m \) 属于 Hölder类 \( \mathcal{C}^s([0,1]^d) \),其中 \( s > 0 \) 是光滑性参数。这意味着 \( m \) 的所有 \( \lfloor s \rfloor \) 阶偏导数存在,且 \( \lfloor s \rfloor \) 阶偏导数是 \( (s - \lfloor s \rfloor) \)-Hölder连续的。相比已有文献:这是非参数回归的标准假设,没有放宽或强化。
  • 假设2(投影追踪结构):回归函数 \( m \) 可以表示为 \( m(x) = \sum_{k=1}^K g_k(\theta_k^\top x) \),其中 \( \theta_k \in \mathbb{R}^d \) 是单位向量(投影方向),\( g_k: \mathbb{R} \to \mathbb{R} \) 是光滑的一维函数。相比已有文献:这是投影追踪的标准假设,它假设高维函数可以通过少数几个一维函数的和来逼近。本文假设 \( K \) 是固定的(不随 \( n \) 增长),且 \( g_k \) 属于一维Hölder类。
  • 假设3(随机权重的分布):隐藏层权重 \( w_j \) 和偏置 \( b_j \) 从某个固定分布(如 \( [-1,1]^d \) 上的均匀分布)中独立采样。相比已有文献:这是本文的核心创新——用随机化替代优化。分布的选择会影响逼近误差的常数,但不影响速率。
  • 假设4(激活函数):激活函数 \( \sigma_{\text{act}} \) 是 sigmoid 函数 \( \sigma(x) = 1/(1+e^{-x}) \)相比已有文献:sigmoid 是经典选择,其光滑性和有界性便于理论分析。作者也提到结果可以推广到其他“sigmoidal”激活函数。

主要结果

定理1(第一个估计量,光滑函数类): 设 \( m \in \mathcal{C}^s([0,1]^d) \),且 \( p \) 个随机特征从适当分布中采样。则存在一个依赖于 \( s, d \) 的常数 \( C \),使得当 \( p \approx n^{d/(2s+d)} \) 时,估计量 \( \hat{m}_n^{(1)} \) 满足:

\[\mathbb{E}\left[ \int (\hat{m}_n^{(1)}(x) - m(x))^2 \, dP_X(x) \right] \leq C \cdot n^{-\frac{2s}{2s+d}} \cdot (\log n)^\gamma,\]
其中 \( \gamma \) 是一个小的对数指数(如 \( \gamma = 2 \))。直觉:这个速率与标准非参数回归的 minimax 下界 \( n^{-2s/(2s+d)} \) 匹配(至多差一个对数因子),因此是最优的(在 minimax 意义下)。必要条件\( p \) 必须随 \( n \) 增长,且 \( s \) 必须已知(用于选择 \( p \))。解决的技术难点:证明随机特征基函数族(\( \{\sigma(w_j^\top x + b_j)\} \))的 VC 维或覆盖数,以控制估计误差。

定理2(第二个估计量,投影追踪假设): 设 \( m(x) = \sum_{k=1}^K g_k(\theta_k^\top x) \),其中 \( g_k \in \mathcal{C}^s([-1,1]) \),且 \( \theta_k \) 是单位向量。则存在一个基于多次随机投影的估计量 \( \hat{m}_n^{(2)} \),使得当随机投影次数 \( M \) 足够大(如 \( M \approx n^{1/(2s+1)} \cdot \log n \))时,有:

\[\mathbb{E}\left[ \int (\hat{m}_n^{(2)}(x) - m(x))^2 \, dP_X(x) \right] \leq C \cdot n^{-\frac{2s}{2s+1}} \cdot (\log n)^\delta,\]
其中 \( \delta \) 是一个对数指数。直觉:这个速率不依赖于维数 \( d \),只依赖于一维光滑性参数 \( s \)。它达到了(对数因子以内的)一维 minimax 最优速率 \( n^{-2s/(2s+1)} \)必要条件:投影追踪假设必须成立(即 \( m \) 确实可以分解为有限个一维函数的和)。解决的技术难点:如何通过随机投影来“发现”正确的方向 \( \theta_k \),以及如何将多个随机投影的结果组合起来。

证明路线与技术技巧

整体路线(以定理1为例)

  1. 步骤1:定义逼近器。利用神经网络逼近理论,证明存在一组系数 \( a_j^* \) 使得 \( \sum a_j^* \sigma(w_j^\top x + b_j) \)\( O(p^{-s/d}) \) 的误差逼近 \( m(x) \)。这需要构造一个“近似恒等”的神经网络表示,并利用随机权重的覆盖性质。
  2. 步骤2:界定估计误差。将最小二乘估计 \( \hat{a} \)\( a^* \) 的差异导致的误差分解为偏差项和方差项。偏差项由步骤1的逼近误差控制。方差项通过经验过程理论(empirical process theory)来界定:对于线性模型,方差项的上界是 \( O(p/n) \),但需要验证基函数族 \( \{\sigma(w_j^\top x + b_j)\} \)覆盖数(covering number)或Rademacher复杂度。作者使用 sigmoid 函数的光滑性和有界性来推导这些复杂度界。
  3. 步骤3:权衡。选择 \( p \) 最小化总误差的上界:\( p^{-s/d} + p/n \)。解得 \( p \approx n^{d/(2s+d)} \),代入得速率 \( n^{-2s/(2s+d)} \)

关键跳跃点: - 跳跃点1:从“存在逼近”到“随机特征也能逼近”。经典的神经网络逼近理论(如Cybenko)证明存在一组权重和偏置使得逼近误差小,但这些权重是精心选择的。本文需要证明:随机采样的权重(从某个分布中)也能以高概率产生好的逼近。这需要用到概率近似正确(PAC) 的论证:如果权重分布是“稠密”的(即对任何方向都有非零概率采样到接近的权重),那么随着 \( p \) 增大,随机采样的特征集能以高概率覆盖所需的逼近方向。作者通过构造一个“网格”论证来证明这一点。 - 跳跃点2:处理随机特征之间的相关性。最小二乘估计的方差项通常假设基函数是正交的或近似正交的。但随机特征之间可能高度相关(例如,两个权重非常接近的神经元会产生几乎相同的特征)。作者需要证明:尽管存在相关性,但最小二乘估计的方差仍然可以被 \( O(p/n) \) 控制。这依赖于对设计矩阵 \( \Phi \in \mathbb{R}^{n \times p} \)(其元素为 \( \Phi_{i,j} = \sigma(w_j^\top X_i + b_j) \))的最小特征值的分析。作者假设随机权重的分布使得 \( \Phi^\top \Phi / n \) 的特征值以高概率远离0,这类似于限制性特征值条件(restricted eigenvalue condition)的随机版本。

技术技巧点名: - 覆盖数(Covering Number):用于界定函数类 \( \mathcal{F} = \{ \sum a_j \sigma(w_j^\top x + b_j) : \|a\|_2 \leq R \} \) 的熵,从而控制经验过程的随机波动。 - 概率不等式(Bernstein不等式、McDiarmid不等式):用于处理随机权重和随机样本的双重随机性。 - 神经网络逼近的“Barron类”技巧:虽然本文没有显式使用Barron类,但其逼近论证隐含地利用了类似的思想:将目标函数表示为无穷多个神经元的积分,然后用随机采样近似这个积分。 - 投影追踪的“随机方向”技巧:对于第二个估计量,作者不是试图估计最优投影方向 \( \theta_k \),而是随机采样大量方向,并对每个方向拟合一维回归,然后取平均。这类似于集成学习(ensemble learning)的思想,通过平均来降低方差。

真实例子与应用

本文为纯理论/无实证例子。论文没有包含任何模拟实验或真实数据分析。所有结论都是理论性的(收敛速度上界)。作者在引言中提到了“易于实现”作为动机,但没有提供任何代码或数值验证来展示这种易实现性。这是一个明显的缺失——读者无法判断这些理论速率在实际中是否可达,或者随机特征方法是否真的比全训练网络更稳定/更快。

🔎 结论是否比证明窄

是的,存在几处“证明比结论窄”的情况: 1. 定理1的速率:作者证明的是上界(即 \( O(n^{-2s/(2s+d)}) \)),但声称这是“最优的”。实际上,要证明最优性需要匹配的下界(即 \( \Omega(n^{-2s/(2s+d)}) \)),而本文没有提供下界。作者只是引用了非参数回归的经典 minimax 下界,但那个下界是针对所有估计量的,而本文的估计量是受限制的(只使用随机特征)。因此,不能保证随机特征估计量能达到这个下界——它可能比全训练网络更差。作者在结论中使用了“achieve”一词,但严格来说,他们只证明了上界,没有证明下界。 2. 定理2的对数因子:作者声称第二个估计量“达到了(对数因子以内的)一维速率”。但证明中出现的对数因子 \( (\log n)^\delta \) 可能不是紧的。作者没有讨论这个对数因子是否可以去掉,或者是否可以通过更精细的分析来改进。 3. 投影追踪假设的强度:定理2假设 \( m \) 可以精确表示为有限个一维函数的和(\( K \) 固定)。在实际中,这个假设可能过于严格——更合理的假设是 \( m \) 可以近似表示为这种形式(即存在一个小的逼近误差)。作者没有讨论当投影追踪假设近似成立时(即存在一个小的“模型误设”误差),估计量的行为会如何变化。

四、开放问题

  1. 下界问题:本文只证明了随机特征估计量的收敛速度上界。一个自然的问题是:是否存在一个下界,表明随机特征估计量(或任何使用随机化权重的估计量)在光滑函数类上不能比 \( n^{-2s/(2s+d)} \) 更快? 如果存在,那么随机化没有损失统计效率;如果不存在(即随机化可以更快),那么本文的上界可能不是紧的。扎根点:定理1的陈述中使用了“achieve”一词,但未提供下界证明。读者应检查是否已有文献(如Rahimi & Recht 2008的后续工作)提供了随机特征回归的 minimax 下界。

  2. 投影追踪假设的放松:本文假设 \( m \) 是精确的投影追踪形式(\( K \) 固定)。一个更现实的设定是 \( m \) 可以近似为这种形式,即存在一个小的“模型误设”误差 \( \epsilon_{\text{approx}} \)如何将 \( \epsilon_{\text{approx}} \) 纳入收敛速度分析?\( \epsilon_{\text{approx}} \)\( n \) 衰减时(例如,通过增加 \( K \)),速率是否会退化?扎根点:定理2的假设部分明确写了“\( m(x) = \sum_{k=1}^K g_k(\theta_k^\top x) \)”,没有讨论近似情况。读者可参考投影追踪的经典文献(如Friedman & Stuetzle 1981)中关于“backfitting”的讨论。

  3. 激活函数的选择:本文只分析了 sigmoid 激活函数。对于现代深度学习中更常用的 ReLU 激活函数,随机特征方法的逼近性质和收敛速度会如何变化?ReLU 不是有界函数,这可能会影响覆盖数或经验过程的界。扎根点:论文在引言中提到了“sigmoidal activation function”,但没有讨论其他选择。读者可参考 Yehudai & Shamir (2020) 关于 ReLU 随机特征的研究。

  4. 计算-统计权衡的量化:本文声称随机特征方法“易于实现”,但没有量化计算成本的节省。一个开放问题是:在给定计算预算(如浮点运算次数)下,随机特征估计量与全训练网络估计量相比,谁的统计效率更高? 这需要建立一个统一的计算-统计效率框架。扎根点:论文的标题和引言强调了“easy to implement”,但全文没有涉及任何计算复杂度分析。读者可参考 Bach (2017) 中关于“convex neural networks”的计算-统计权衡讨论。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论