Nonparametric linear feature learning in regression through regularisation¶
作者: Bertille Follain, Francis Bach
来源: Electronic Journal of Statistics
主题: 非参数 / 半参数
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本子方向研究的是高维非参数回归中的表示学习(representation learning),核心问题是:当响应变量 \(Y\) 仅依赖于输入 \(X \in \mathbb{R}^d\) 的一个低维线性子空间(即 \(Y = f(\beta_1^\top X, \dots, \beta_k^\top X) + \text{noise}\),\(k \ll d\))时,如何在不事先知道该子空间的情况下,同时学习这个线性子空间(特征)和子空间上的非参数回归函数 \(f\)。这个模型被称为多指标模型(multi-index model)。当前成熟度:这是一个经典但远未解决的问题——非参数收敛速度受维数诅咒(curse of dimensionality)制约,而多指标假设是打破维数诅咒的一种结构性假设,但子空间未知使得问题变成非凸的,理论分析困难。
发展脉络(history)¶
作者在引言中把相关工作串成了一条线,核心脉络如下:
-
奠基工作:单指标模型与切片逆回归(SIR)
- Li (1991):提出了切片逆回归(Sliced Inverse Regression, SIR),这是最早且最流行的充分降维(sufficient dimension reduction)方法之一。它假设 \(Y\) 仅依赖于 \(X\) 的少数几个线性组合,并通过逆矩(inverse moments)来估计这些方向。作者引用时指出:“SIR 及其变体(如 Li, 1991; Cook & Weisberg, 1991)是充分降维领域的基石,但它们通常假设 \(X\) 是椭圆对称分布(如高斯分布),且需要 \(Y\) 对 \(X\) 的条件期望是线性的(线性设计条件)。” 这留下了对非椭圆对称分布和非线性条件期望的缺口。
-
主要进展:从充分降维到非参数特征学习
- Hristache, Juditsky & Spokoiny (2001):提出了一个结合了投影寻踪(projection pursuit)和局部多项式回归的方法,用于估计单指标模型。作者引用:“他们通过迭代地旋转数据来对齐主导方向,这与我们的交替最小化思路有相似之处,但他们的方法依赖于局部多项式,计算成本高且理论分析复杂。”
- Dalalyan, Juditsky & Spokoiny (2008):将上述工作推广到多指标模型,并给出了非参数收敛速率。作者引用:“他们的工作证明了在 \(k\) 维子空间上进行非参数回归可以达到 \(O(n^{-2/(2+k)})\) 的速率,但他们的算法(基于局部多项式)在 \(d\) 很大时计算上不可行,且理论分析依赖于复杂的局部逼近。”
- Kpotufe, Srebro & Ben-David (2011):从理论上证明了,如果 \(Y\) 依赖于一个 \(k\) 维子空间,那么存在一个 \(O(n^{-2/(2+k)})\) 的 minimax 下界,并且可以通过核方法(如 \(k\)-NN)达到,但前提是子空间已知。作者引用:“他们的工作明确了已知子空间情况下的最优速率,但并未解决未知子空间的学习问题。”
-
当前 Frontier:联合估计与正则化方法
- Bach (2017):提出了一个基于 Hermite 多项式的单指标模型估计方法,通过惩罚函数导数的 \(L_2\) 范数来鼓励函数在无关方向上的平滑性。作者引用:“Bach (2017) 的工作是本文最直接的灵感来源。他证明了对于单指标模型(\(k=1\)),通过一个凸的惩罚项可以同时估计方向和函数,并给出了收敛速率。然而,他的方法依赖于一个关键的‘旋转不变性’假设,且仅限于 \(k=1\)。”
- 本文(Follain & Bach, 2024):作者将 Bach (2017) 的工作从单指标模型推广到多指标模型(\(k \ge 1\)),并去除了旋转不变性假设。他们提出的 RegFeaL 方法通过交替最小化来迭代地旋转数据,并利用 Hermite 多项式的正交性来构造一个可计算的估计量。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 线索一:充分降维(Sufficient Dimension Reduction, SDR)。这一簇方法(如 SIR, SAVE)旨在估计一个低维子空间,使得 \(Y\) 条件独立于 \(X\) 给定该子空间。它们通常基于矩方法(如逆矩),计算上相对简单,但依赖于较强的分布假设(如线性设计条件、椭圆对称性),且不直接给出子空间上的回归函数估计。
- 线索二:非参数特征学习(Nonparametric Feature Learning)。这一簇方法(如 Hristache et al., 2001; Dalalyan et al., 2008; Bach, 2017; 本文)旨在同时学习子空间和子空间上的非参数函数。它们通常基于经验风险最小化(ERM)加上某种正则化项(如导数惩罚),理论分析更复杂,但能直接得到预测函数,且对分布假设更宽松。
这个方向在追问的核心问题¶
- 可识别性(Identifiability):在什么条件下,低维子空间是唯一可识别的?例如,当 \(f\) 是线性函数时,子空间就不是唯一的(任何包含该线性组合方向的子空间都行)。通常需要 \(f\) 是“非线性的”或“非退化的”。
- 计算可行性(Computational Feasibility):联合估计问题是非凸的,如何设计一个可计算的、且具有理论保证的算法?交替最小化是常见策略,但其收敛性分析(尤其是全局收敛性)非常困难。
- 收敛速率(Convergence Rates):在未知子空间的情况下,非参数回归的收敛速率能否达到已知子空间时的最优速率 \(O(n^{-2/(2+k)})\)?还是会有额外的代价(如对数因子或更慢的速率)?
- 假设的强弱:现有方法(如 SIR)依赖于较强的分布假设(如 \(X\) 的椭圆对称性)。能否在更弱的假设(如 \(X\) 的矩条件)下实现特征学习?
⚠️ 作者的 framing¶
作者将缺口 frame 成:“Bach (2017) 的工作只解决了单指标模型(\(k=1\)),且依赖于旋转不变性假设。我们将其推广到多指标模型(\(k \ge 1\)),并去除了这个假设。” 因此,本文的定位是 Bach (2017) 的一个自然且非平凡的推广。
- 被淡化或回避的竞争路线:作者在引言中明确提到了 SIR 等充分降维方法,但指出它们“通常假设 \(X\) 是椭圆对称分布”,而本文的方法“在更弱的假设下工作”。作者没有详细讨论 SIR 在非椭圆对称分布下的变体(如基于核的 SDR 方法),也没有与这些方法进行实证比较。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:作者没有引用任何关于深度神经网络在多指标模型上的工作。近年来,有大量工作(如理论神经科学、深度学习理论)研究神经网络如何学习低维结构(如“特征学习”或“表示学习”)。这些工作通常使用梯度下降法,并分析其隐式正则化效应。作者回避了这一庞大的文献,可能是因为其理论框架(基于 Hermite 多项式和显式正则化)与深度学习的分析范式差异较大。这是一个值得研究者去查的问题:深度学习的相关结果是否与本文的结论一致或矛盾?
张力¶
未见明显对立引用。所有被引工作都认同“多指标模型是打破维数诅咒的有效结构”,只是在如何估计子空间和函数上采用了不同的技术路线。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(X \in \mathbb{R}^d\):\(d\) 维输入随机向量。\(d\) 可以很大(高维)。
- \(Y \in \mathbb{R}\):响应变量(标量)。
- \((X_i, Y_i)_{i=1}^n\):\(n\) 个独立同分布(i.i.d.)的可观测样本。
- \(k\):多指标模型的内在维度(intrinsic dimension),\(k \ll d\)。这是模型假设,通常未知。
- \(B \in \mathbb{R}^{d \times k}\):一个列正交矩阵(\(B^\top B = I_k\)),其列张成了 \(Y\) 所依赖的 \(k\) 维线性子空间。这是要估计的参数。
- \(f: \mathbb{R}^k \to \mathbb{R}\):定义在 \(k\) 维子空间上的非参数回归函数。这也是要估计的参数。
- \(\varepsilon\):均值为 0 的噪声,与 \(X\) 独立。
- \(\mathcal{H}\):一个再生核希尔伯特空间(RKHS),用于表示函数 \(f\)。本文具体使用 Hermite 多项式基。
- \(\Omega(f)\):对函数 \(f\) 的正则化项,具体是 \(f\) 的梯度(导数)的 \(L_2\) 范数的平方,即 \(\Omega(f) = \int \|\nabla f(z)\|^2 dP_Z(z)\),其中 \(Z = B^\top X\) 是低维表示。这个惩罚项鼓励 \(f\) 在子空间上是平滑的。
-
模型:
- 多指标模型:\(Y = f(B^\top X) + \varepsilon\)。
- 数据生成机制:\(X\) 服从某个未知分布 \(P_X\),\(\varepsilon\) 服从均值为 0、方差有限的分布,且 \(\varepsilon \perp X\)。
- 目标:在未知 \(B\) 和 \(f\) 的情况下,找到一个预测函数 \(\hat{g}: \mathbb{R}^d \to \mathbb{R}\),使得其期望风险 \(R(\hat{g}) = \mathbb{E}[(Y - \hat{g}(X))^2]\) 尽可能接近最优风险 \(R^* = \mathbb{E}[(Y - f(B^\top X))^2] = \mathbb{E}[\varepsilon^2]\)。
-
可观测数据:
- 研究者能观测到的是 \((X_i, Y_i)\) 对。\(X_i\) 是 \(d\) 维向量,\(Y_i\) 是标量。
- 不可观测的是:内在维度 \(k\)、子空间 \(B\)、函数 \(f\)、噪声 \(\varepsilon\)。所有推断都必须基于 \((X_i, Y_i)\)。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:单指标模型(\(k=1\))且 \(X\) 服从标准高斯分布。
-
最简特例设定:
- \(d=2\),\(k=1\)。即 \(Y = f(\beta^\top X) + \varepsilon\),其中 \(\beta \in \mathbb{R}^2\) 是一个单位向量(\(\|\beta\|=1\))。
- \(X \sim \mathcal{N}(0, I_2)\)(二维标准正态分布)。
- \(f: \mathbb{R} \to \mathbb{R}\) 是一个未知的、平滑的非线性函数。
- 我们观测到 \(n\) 个样本 \((X_i, Y_i)\)。
-
核心思路(Bach, 2017 的框架):
- 函数空间:将 \(f\) 用 Hermite 多项式展开。Hermite 多项式 \(h_j(x)\) 在标准高斯分布下是正交的。因此,任何平方可积函数 \(f\) 都可以写成 \(f(x) = \sum_{j=0}^\infty a_j h_j(x)\)。
- 关键观察:对于 \(d\) 维标准高斯向量 \(X\),函数 \(g(X) = f(\beta^\top X)\) 的 Hermite 展开有一个特殊结构。由于 \(X\) 是各向同性的(旋转不变),\(g(X)\) 的 Hermite 系数只依赖于 \(\beta\) 和 \(f\) 的系数。具体来说,\(g(X)\) 可以写成关于 \(X\) 的 Hermite 多项式 \(H_\alpha(X)\) 的线性组合,其中 \(\alpha\) 是一个多重指标。关键性质:\(g(X)\) 的 Hermite 展开中,只有那些“方向”与 \(\beta\) 对齐的项才有非零系数。换句话说,\(g(X)\) 的 Hermite 系数张成了一个秩为 1 的张量,其“方向”就是 \(\beta\)。
- 惩罚项的作用:作者考虑一个惩罚项 \(\Omega(g) = \mathbb{E}[\|\nabla g(X)\|^2]\)。对于 \(g(X) = f(\beta^\top X)\),这个惩罚项简化为 \(\Omega(g) = \mathbb{E}[f'(\beta^\top X)^2]\),它只惩罚 \(f\) 沿着 \(\beta\) 方向的导数,而不惩罚垂直于 \(\beta\) 的方向。这很关键:如果 \(g\) 依赖于多个方向,\(\Omega(g)\) 会惩罚所有方向上的导数,从而鼓励 \(g\) 只依赖于少数方向。
- 估计方法:求解一个惩罚经验风险最小化问题:
\[\hat{g} = \arg\min_{g \in \mathcal{H}} \frac{1}{n} \sum_{i=1}^n (Y_i - g(X_i))^2 + \lambda \Omega(g)\]其中 \(\mathcal{H}\) 是一个由 Hermite 多项式张成的函数空间。由于 Hermite 多项式的正交性和旋转不变性,这个优化问题可以转化为一个关于 \(g\) 的 Hermite 系数的凸问题(如果固定了 \(\beta\))。但 \(\beta\) 是未知的,所以问题是非凸的。
-
本文的推广(RegFeaL):
- 对于 \(k \ge 1\),上述思路需要推广。核心困难在于:当 \(k>1\) 时,\(g(X) = f(B^\top X)\) 的 Hermite 系数张成的张量是秩为 \(k\) 的,其“方向”由 \(B\) 的列张成。直接优化所有系数和 \(B\) 仍然是非凸的。
- RegFeaL 的解法:采用交替最小化。
- 固定 \(B\),优化 \(f\):给定一个子空间估计 \(\hat{B}\),我们可以将数据投影到该子空间上,得到 \(Z_i = \hat{B}^\top X_i\)。然后,我们只需要在 \(k\) 维空间上求解一个标准的惩罚非参数回归问题(用 Hermite 多项式),来估计 \(\hat{f}\)。这一步是凸的,可以高效求解。
- 固定 \(f\),优化 \(B\):给定一个函数估计 \(\hat{f}\),我们需要找到一个更好的子空间 \(B\)。这一步是非凸的,但作者利用 Hermite 多项式的性质,将问题转化为一个矩阵的奇异值分解(SVD)问题。具体来说,他们构造了一个 \(d \times d\) 的矩阵,其奇异向量与 \(B\) 的列相关。通过计算这个矩阵的前 \(k\) 个奇异向量,就可以更新 \(B\) 的估计。
- 迭代:重复步骤 1 和 2,直到收敛。
-
最小内核总结:本文的核心数学问题是:如何通过一个可计算的交替最小化算法,同时估计一个低维线性子空间 \(B\) 和该子空间上的非参数函数 \(f\),使得预测风险收敛到最优风险? 其关键想法是:利用 Hermite 多项式在标准高斯分布下的正交性和旋转不变性,将非凸的联合优化问题分解为两个子问题——一个凸的(固定 \(B\) 估计 \(f\)),另一个可以通过 SVD 高效求解(固定 \(f\) 更新 \(B\))。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高维非参数回归中,假设数据服从多指标模型(\(Y = f(B^\top X) + \varepsilon\)),本文研究了如何在不事先知道低维子空间 \(B\) 的情况下,同时学习该子空间和子空间上的非参数函数 \(f\)。
- 核心工具 / 方法:提出了 RegFeaL 方法,该方法基于经验风险最小化,并加入了对函数梯度的 \(L_2\) 范数惩罚。利用 Hermite 多项式的正交性和旋转不变性,通过交替最小化算法迭代地估计子空间和函数。
- 主要结论:在 \(X\) 服从标准高斯分布的假设下,证明了 RegFeaL 的期望风险以高概率收敛到最小风险(即噪声方差),并给出了显式的收敛速率。该速率与已知子空间时的最优速率 \(O(n^{-2/(2+k)})\) 一致(仅差一个对数因子)。
关键设定与假设¶
- 设定:多指标模型 \(Y = f(B^\top X) + \varepsilon\),其中 \(B \in \mathbb{R}^{d \times k}\) 是列正交矩阵,\(f: \mathbb{R}^k \to \mathbb{R}\) 是未知函数,\(\varepsilon\) 是均值为 0、方差为 \(\sigma^2\) 的次高斯噪声。
- 假设:
- \(X\) 的分布:\(X \sim \mathcal{N}(0, I_d)\)(标准高斯分布)。这是本文最关键的假设,也是与 Bach (2017) 一致的假设。它使得 Hermite 多项式的正交性和旋转不变性得以利用。相比 SIR 等方法的“线性设计条件”,这个假设更强(要求高斯性),但也更便于理论分析。
- \(f\) 的光滑性:\(f\) 属于一个由 Hermite 多项式定义的 Sobolev 空间,其光滑性参数 \(s > k/2\)。这保证了 \(f\) 足够光滑,使得惩罚项 \(\Omega(f)\) 有意义,并且 \(f\) 可以被 Hermite 多项式有效逼近。
- 可识别性条件:\(f\) 是“非退化的”,即 \(f\) 的梯度 \(\nabla f\) 的协方差矩阵 \(\mathbb{E}[\nabla f(B^\top X) \nabla f(B^\top X)^\top]\) 是满秩的。这保证了子空间 \(B\) 是可识别的(否则,如果 \(f\) 在某些方向上不变化,这些方向就无法被识别)。
- 内在维度 \(k\) 已知:这是一个很强的假设。作者在实验部分讨论了 \(k\) 未知的情况,但理论分析假设 \(k\) 是已知的。
主要结果¶
- 定理 1(风险收敛性):在以上假设下,存在一个正则化参数 \(\lambda\) 和算法迭代次数 \(T\) 的选择,使得 RegFeaL 的估计量 \(\hat{g}_T\) 满足:以高概率(至少 \(1 - \delta\)),
\[\mathbb{E}[(Y - \hat{g}_T(X))^2] \le \sigma^2 + C \cdot \left( \frac{k \log(n)}{n} \right)^{\frac{2s}{2s + k}}\]其中 \(C\) 是一个依赖于 \(s, k, \sigma\) 的常数,\(s\) 是 \(f\) 的光滑性参数。
- 直觉:期望风险收敛到最优风险 \(\sigma^2\)。收敛速率是 \(O(n^{-2s/(2s+k)})\),这与在已知 \(k\) 维子空间上进行非参数回归的 minimax 最优速率一致(仅差一个 \(\log(n)\) 因子)。这意味着,尽管子空间未知,RegFeaL 并没有付出额外的统计代价。
- 必要条件:\(n\) 需要足够大,且 \(f\) 足够光滑(\(s > k/2\))。
- 解决的技术难点:证明的关键在于控制交替最小化算法的收敛性,以及处理估计子空间 \(\hat{B}\) 与真实子空间 \(B\) 之间的误差对函数估计的影响。
证明路线与技术技巧¶
-
整体路线:
- Oracle 不等式:首先,假设我们知道真实的子空间 \(B\),那么最优的预测函数就是 \(f(B^\top X)\)。作者证明,如果算法能够找到一个子空间 \(\hat{B}\) 足够接近 \(B\),那么基于 \(\hat{B}\) 估计的函数 \(\hat{f}\) 的风险也会接近最优风险。
- 子空间估计误差的控制:核心是证明交替最小化算法能够以高概率找到一个子空间 \(\hat{B}\),使得其与真实子空间 \(B\) 之间的“距离”(用正弦角或投影矩阵的 Frobenius 范数衡量)以 \(O(n^{-2s/(2s+k)})\) 的速率收敛到 0。
- 函数估计误差的控制:在每一步迭代中,给定当前的子空间估计 \(\hat{B}\),函数估计 \(\hat{f}\) 的风险可以通过标准的惩罚非参数回归理论(如局部 Rademacher 复杂度)来控制。
- 组合:将子空间估计误差和函数估计误差结合起来,得到最终的风险界。
-
关键跳跃点:
- 从单指标到多指标的推广:Bach (2017) 的证明依赖于一个“旋转不变性”引理,该引理在 \(k=1\) 时成立,但在 \(k>1\) 时不再成立。本文的关键跳跃是构造了一个新的矩阵,其 SVD 可以用于更新子空间,而不需要旋转不变性假设。这个矩阵的构造利用了 Hermite 多项式的性质,将函数 \(f\) 的梯度信息编码到一个 \(d \times d\) 的矩阵中。
- 交替最小化的收敛性分析:证明交替最小化算法收敛到全局最优(或至少一个足够好的局部最优)是非常困难的。作者没有证明全局收敛,而是证明了如果初始子空间估计足够好(例如,通过一个初步的 SIR 估计得到),那么算法会收敛到真实子空间的一个邻域内。这个“足够好的初始值”假设是证明中的一个关键但合理的条件。
-
技术技巧点名:
- Hermite 多项式展开:用于将非参数函数 \(f\) 参数化,并利用其正交性简化计算和理论分析。
- 经验过程理论(Empirical Process Theory):用于控制经验风险与期望风险之间的差异,从而建立 Oracle 不等式。
- 局部 Rademacher 复杂度(Local Rademacher Complexity):用于推导惩罚非参数回归的收敛速率。
- 矩阵扰动理论(Matrix Perturbation Theory):用于分析估计子空间 \(\hat{B}\) 与真实子空间 \(B\) 之间的误差,特别是通过 Davis-Kahan \(\sin \Theta\) 定理来将子空间误差与构造的矩阵的估计误差联系起来。
- 交替最小化(Alternating Minimization):作为求解非凸优化问题的核心算法框架。
真实例子与应用¶
本文包含模拟实验和真实数据应用。
-
模拟实验:
- 数据:生成服从多指标模型的数据,\(X \sim \mathcal{N}(0, I_d)\),\(d\) 从 10 到 100,\(k\) 从 1 到 5。\(f\) 被设定为各种非线性函数(如正弦、指数、多项式组合)。
- 方法应用:将 RegFeaL 与以下基线方法进行比较:核岭回归(KRR,不利用低维结构)、SIR + 核岭回归(先降维再回归)、以及 Bach (2017) 的单指标方法(仅适用于 \(k=1\))。
- 结果:RegFeaL 在所有设定下都显著优于 KRR,尤其是在 \(d\) 较大时。当 \(k=1\) 时,RegFeaL 与 Bach (2017) 的方法性能相当。当 \(k>1\) 时,RegFeaL 优于 SIR + KRR,表明联合估计比两步法更有效。
- 想说明什么:验证了 RegFeaL 在有限样本下的有效性,并展示了其相对于现有方法的优势,特别是证明了联合估计的必要性。
-
真实数据应用:
- 数据:使用了两个 UCI 数据集:Parkinsons Telemonitoring(预测帕金森病患者的 UPDRS 评分,\(d=16\))和 Airfoil Self-Noise(预测机翼噪声,\(d=5\))。
- 方法应用:与模拟实验类似,比较 RegFeaL 与 KRR、SIR + KRR 等。
- 结果:在 Parkinsons 数据集上,RegFeaL 的预测误差(RMSE)比 KRR 低约 10%,比 SIR + KRR 低约 5%。在 Airfoil 数据集上,RegFeaL 与 SIR + KRR 性能相近,但优于 KRR。
- 想说明什么:展示了 RegFeaL 在真实世界问题中的实用性,并表明其性能优势在低维数据(\(d=5\))上仍然存在,尽管不如高维数据明显。
🔎 结论是否比证明窄¶
- 窄化点 1:定理 1 的收敛速率依赖于 \(X\) 是标准高斯分布的假设。作者在结论部分提到“将我们的结果推广到更一般的分布(如次高斯分布)是一个有趣的方向”,这表明当前的理论结果严格限制在高斯分布下。然而,在模拟实验中,作者也测试了 \(X\) 服从均匀分布的情况,并报告 RegFeaL 仍然有效,但没有给出理论保证。
- 窄化点 2:定理 1 假设内在维度 \(k\) 是已知的。作者在实验部分讨论了通过交叉验证选择 \(k\) 的方法,但理论分析并未涵盖 \(k\) 未知的情况。因此,结论中“以高概率收敛到最小风险”是在 \(k\) 已知的前提下成立的。
- 窄化点 3:证明依赖于初始子空间估计足够好的假设。虽然作者建议使用 SIR 作为初始化,但并未证明 SIR 一定能提供这样的初始值。因此,定理的结论是条件性的。
四、开放问题¶
- 更一般的分布假设:能否将 \(X\) 的分布从标准高斯推广到更一般的分布(如次高斯、或仅需有限矩)?这需要新的技术工具,因为 Hermite 多项式的正交性依赖于高斯分布。扎根点:论文结论部分“将我们的结果推广到更一般的分布(如次高斯分布)是一个有趣的方向”。
- 未知内在维度 \(k\):当 \(k\) 未知时,如何自适应地选择 \(k\)?能否给出一个数据驱动的选择方法,并证明其理论性质?扎根点:论文实验部分讨论了通过交叉验证选择 \(k\),但理论分析假设 \(k\) 已知。
- 全局收敛性:能否证明交替最小化算法从任意初始值出发都能收敛到全局最优(或至少一个“好”的局部最优)?目前的理论依赖于“足够好的初始值”。扎根点:论文证明中“假设初始子空间估计足够好”这一关键条件。
- 与深度学习的联系:本文的方法与深度神经网络在多指标模型上的表现有何联系?深度网络是否也能隐式地学习到低维子空间?能否从本文的理论框架出发,为深度学习的特征学习提供新的见解?扎根点:引言中未引用深度学习相关文献,这是一个明显的空白。
Maintained by 陈星宇 · Homepage · Source on GitHub