Image response regression via deep neural networks¶
作者: Daiwei Zhang, Lexin Li, Chandra Sripada, Jian Kang
来源: Journal of the Royal Statistical Society Series B
主题: 非参数 / 半参数
相关性: 6/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:如何建模一个高维图像(作为响应变量)与一组标量协变量之间的复杂关联。具体来说,给定一个 \(p\)-维图像(例如 fMRI 脑图,每个体素是一个观测点)和一组 \(J\) 个协变量(如年龄、性别、认知得分),目标是估计一个空间变系数模型:在每个体素 \(v\) 上,响应值 \(Y(v)\) 与协变量 \(X\) 的关系由一个系数函数 \(\beta_j(v)\) 刻画。这个方向的核心挑战在于:图像维度极高(\(p \gg n\))、信号稀疏且空间连续、信噪比低,而传统方法(如体素-wise 的线性模型)要么无法捕捉非线性,要么在灵活性上受限。当前该方向的成熟度处于方法快速发展期:已有基于张量回归、函数型数据模型、以及稀疏正则化的方法,但深度神经网络(DNN)作为非参数估计工具的系统性应用仍是一个相对较新的尝试。
发展脉络(history)¶
-
奠基工作:线性/低秩张量回归。早期工作将图像视为一个多维数组(张量),并假设其与协变量的关系是线性的,通过低秩或稀疏结构来应对高维挑战。代表性工作包括:
- Li and Zhang (2017):提出 Parsimonious Tensor Response Regression,采用 envelope 方法实现参数高效估计,并证明了渐近有效性。
- Sun and Li (2017):提出 STORE 模型,在张量回归中同时引入元素级稀疏性和低秩性,并建立了非渐近误差界,揭示了计算效率与统计收敛速度之间的相互作用。
- Raskutti et al. (2019):提出了一个凸优化框架用于高维多响应张量回归,基于高斯宽度和内在维度给出了通用的风险界,并证明了 minimax 最优性。
- Chen et al. (2019):研究了非凸投影梯度下降法用于低秩张量回归,并与凸方法进行了计算与统计上的对比。
-
主要进展:函数型数据模型与变系数模型。另一条线索将图像视为函数型数据,允许系数随空间位置平滑变化,但通常仍假设协变量与响应之间是线性关系。
- Li, Huang, and Zhu (2017):提出了函数型变系数单指标模型(FVCSIM),用于函数型响应数据,并建立了估计量的渐近性质(弱收敛、渐近分布、一致收敛速度)。
-
当前 Frontier:深度神经网络用于非参数回归。近年来,DNN 在非参数回归中展现出的强大逼近能力(克服维数灾难)被引入该领域。
- Bauer and Kohler (2019) 与 Schmidt-Hieber (2020):证明了基于多层前馈神经网络的最小二乘估计能够规避非参数回归中的维数灾难,前者针对光滑激活函数,后者针对 ReLU 激活函数。这是本文方法的核心理论支撑。
- Feng and Simon (2017):提出了稀疏输入神经网络(Sparse-Input Neural Networks),通过在第一层权重上施加 group L1 惩罚来实现高维非参数回归中的变量选择,并建立了统计收敛性。这是本文变量选择方法的重要参考。
- Eldan and Shamir (2016) 与 Telgarsky (2016):从逼近论角度证明了深度网络比浅层网络在函数逼近上指数级更高效,为使用深层网络提供了理论动机。
-
本文的位置:本文首次将深度神经网络系统地应用于图像响应回归这一具体问题,在空间变系数模型框架下,利用 DNN 的灵活性来估计非线性的系数函数,同时整合空间平滑性、处理受试者异质性,并保持模型的可解释性。它填补了“DNN 的非参数逼近能力”与“图像响应回归的实际需求”之间的空白。
子线索聚类¶
- 张量回归方法:将图像视为张量,通过低秩、稀疏等结构进行线性或广义线性建模。代表:Li and Zhang (2017), Sun and Li (2017), Raskutti et al. (2019), Chen et al. (2019)。
- 函数型数据模型:将图像视为函数,使用函数型数据分析方法,如变系数模型。代表:Li, Huang, and Zhu (2017)。
- 深度神经网络非参数回归:利用 DNN 的逼近能力进行非参数回归,并研究其统计性质。代表:Bauer and Kohler (2019), Schmidt-Hieber (2020), Feng and Simon (2017)。
- 神经影像学应用:将上述方法应用于具体神经科学问题,如认知能力与脑功能/结构关联。代表:Power et al. (2011), Casey et al. (2018), Barch et al. (2013), Sripada et al. (2019)。
这个方向在追问的核心问题¶
- 如何在高维、低信噪比的图像数据中,有效估计协变量与图像响应之间的非线性关联?
- 如何在保持模型灵活性的同时,确保估计的可解释性(如识别出哪些脑区与认知能力相关)?
- 如何为基于 DNN 的图像响应回归方法建立严格的统计理论(如估计一致性、变量选择一致性、收敛速度)?
- 如何将空间平滑性、受试者异质性等先验知识自然地融入 DNN 框架?
当前主流方法与已知瓶颈:主流方法(张量回归、函数型模型)通常假设线性或低阶结构,难以捕捉复杂的非线性模式。DNN 方法虽然灵活,但缺乏针对图像响应回归这一特定设定(响应是图像而非标量)的理论保证,且可解释性差。本文试图解决这一瓶颈。
⚠️ 作者的 framing¶
作者将缺口 frame 为:现有图像响应回归方法(张量回归、函数型模型)要么过于刚性(线性假设),要么缺乏理论保证(纯 DNN 应用),而本文提出的方法(SVCM-DNN)同时具备灵活性、可解释性和理论严谨性。作者淡化了纯 DNN 方法在图像回归中的应用(如直接使用 CNN 将协变量映射到图像),认为这些方法“缺乏可解释性”且“难以整合空间平滑性”。作者也回避了与贝叶斯方法或高斯过程回归的对比,这些方法也能处理非线性且提供不确定性量化。
什么明显该被引/该存在、却没出现在 intro 里? 作者没有引用任何关于深度高斯过程或贝叶斯深度学习在神经影像中的应用工作。这些方法同样能处理非线性、提供不确定性,且在某些场景下可解释性更好。这是一个值得研究者去查的潜在缺口:是这些方法不适用,还是作者有意回避了竞争?
张力¶
未见明显对立引用。所有被引工作基本沿着“线性→非线性”、“简单→复杂”、“无理论→有理论”的路径演进,彼此之间没有根本性矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(v \in \{1, \dots, p\}\):体素(voxel)索引,\(p\) 是图像中的体素总数,通常 \(p \gg n\)。
- \(i \in \{1, \dots, n\}\):受试者(subject)索引,\(n\) 是样本量。
- \(Y_i(v) \in \mathbb{R}\):第 \(i\) 个受试者在体素 \(v\) 处的图像响应值。这是可观测的。
- \(X_i = (X_{i1}, \dots, X_{iJ})^\top \in \mathbb{R}^J\):第 \(i\) 个受试者的 \(J\) 维协变量向量。这是可观测的。
- \(\beta_j(v) : \mathbb{R}^J \to \mathbb{R}\):第 \(j\) 个协变量在体素 \(v\) 处的空间变系数函数。这是要估计的未知参数。注意,它不仅是 \(v\) 的函数,也是整个协变量向量 \(X_i\) 的函数(因为模型是非线性的)。
- \(\epsilon_i(v) \in \mathbb{R}\):第 \(i\) 个受试者在体素 \(v\) 处的随机误差。不可观测,假设均值为 0。
- \(f(\cdot)\):一个由深度神经网络参数化的函数,用于近似 \(\beta_j(v)\)。
- \(\mathcal{L}(\cdot)\):损失函数(如均方误差)。
- \(\lambda\):正则化参数(用于变量选择)。
- 模型:本文采用空间变系数模型(SVCM):
\[Y_i(v) = \sum_{j=1}^J \beta_j(v, X_i) X_{ij} + \epsilon_i(v)\]注意,这里的 \(\beta_j(v, X_i)\) 是协变量 \(X_i\) 和空间位置 \(v\) 的联合函数,这使得模型能够捕捉非线性的交互效应。这与经典的线性变系数模型 \(\beta_j(v) X_{ij}\) 不同,后者中 \(\beta_j\) 只随空间变化,与 \(X_i\) 无关。
- 可观测数据:研究者能观测到的是 \(\{(X_i, \mathbf{Y}_i)\}_{i=1}^n\),其中 \(\mathbf{Y}_i = (Y_i(1), \dots, Y_i(p))^\top \in \mathbb{R}^p\) 是第 \(i\) 个受试者的完整图像。不可观测的是误差项 \(\epsilon_i(v)\) 和真实的系数函数 \(\beta_j(\cdot, \cdot)\)。
第二步:讲最小内核¶
为了理解本文的核心思路,我们考虑一个最简特例: - 只有一个协变量:\(J = 1\),即 \(X_i\) 是一个标量(例如,智商得分)。 - 图像是一维的:\(v \in \{1, \dots, p\}\) 是一维空间位置(例如,沿一条白质纤维束的 100 个点)。 - 模型退化为:
本文的核心想法是:用一个深度神经网络 \(f(v, X_i; \theta)\) 来近似这个未知的二元函数 \(\beta(v, X_i)\)。网络 \(f\) 的输入是空间位置 \(v\) 和协变量 \(X_i\),输出是 \(\beta\) 的估计值。然后,通过最小化所有体素上的预测误差来训练这个网络:
在这个特例下,要证的命题退化成什么? - 估计一致性:当 \(n, p \to \infty\) 时,训练好的网络 \(f(v, X_i; \hat{\theta})\) 能否收敛到真实的 \(\beta(v, X_i)\)? - 变量选择一致性:由于 \(J=1\),变量选择问题退化为判断这个唯一的协变量是否“重要”。如果 \(\beta(v, X_i)\) 在所有 \(v\) 上都恒等于 0,那么算法应该能将其系数(即网络权重)收缩到 0。
为什么这个特例能体现核心困难? 即使在这个最简单的设定下,核心挑战依然存在: 1. 高维性:\(p\)(体素数)可能远大于 \(n\)(样本量),导致传统的非参数回归方法(如核平滑)失效。 2. 非线性:\(\beta(v, X_i)\) 可以是 \(v\) 和 \(X_i\) 的任意复杂函数,DNN 的逼近能力在此至关重要。 3. 空间平滑性:相邻体素的 \(\beta\) 值应该相似,DNN 的结构(如卷积层)可以天然地编码这种先验。 4. 信噪比低:\(\epsilon_i(v)\) 的方差可能很大,需要有效的正则化来防止过拟合。
本文的关键想法就是:利用 DNN 作为非参数估计器,同时解决上述所有挑战。通过精心设计的网络结构(如结合全连接层和卷积层)和正则化技术(如对第一层权重的稀疏惩罚),DNN 能够自动学习空间平滑的非线性函数,并在高维、低信噪比下实现一致的估计和变量选择。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了图像响应回归问题,即在空间变系数模型(SVCM)框架下,利用深度神经网络(DNN)来估计协变量与高维图像之间非线性的关联模式。
- 核心工具/方法:提出了一种名为 SVCM-DNN 的方法,该方法使用 DNN 来参数化空间变系数函数 \(\beta_j(v, X)\),并通过最小化带正则化的经验风险来同时进行估计和变量选择。网络结构设计整合了空间平滑性(通过卷积或全连接层)和受试者异质性。
- 主要结论:建立了 SVCM-DNN 的估计一致性(估计误差随样本量增加而趋于 0)和变量选择一致性(不重要的协变量对应的系数函数被收缩到 0),并导出了非渐近误差界。通过模拟和两个真实 fMRI 数据集(ABCD 研究和 HCP 研究)的分析,展示了该方法在预测精度和变量选择准确性上优于现有的张量回归和体素-wise 线性模型。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 模型:\(Y_i(v) = \sum_{j=1}^J \beta_j(v, X_i) X_{ij} + \epsilon_i(v)\)。这是非线性的 SVCM,因为 \(\beta_j\) 依赖于 \(X_i\)。
- DNN 参数化:\(\beta_j(v, X_i) \approx f_j(v, X_i; \theta_j)\),其中 \(f_j\) 是一个 DNN。整个模型可以写成一个大的 DNN,其输入是 \((v, X_i)\),输出是 \(J\) 个 \(\beta_j\) 的估计值,然后与 \(X_{ij}\) 做内积得到预测 \(\hat{Y}_i(v)\)。
- 损失函数:最小化带正则化的经验风险:
\[\min_{\theta} \frac{1}{np} \sum_{i=1}^n \sum_{v=1}^p \left( Y_i(v) - \sum_{j=1}^J f_j(v, X_i; \theta_j) X_{ij} \right)^2 + \lambda \sum_{j=1}^J \text{Pen}(f_j)\]其中 \(\text{Pen}(f_j)\) 是一个用于变量选择的惩罚项,例如对网络第一层连接到第 \(j\) 个协变量的所有权重的 group Lasso 惩罚。
- 关键假设(相比已有文献):
- 函数类假设:真实的系数函数 \(\beta_j\) 属于某个 Hölder 光滑函数类,其光滑度参数决定了 DNN 的逼近误差。这比线性假设更宽松。
- 网络结构假设:DNN 的深度和宽度需要随着样本量 \(n\) 和体素数 \(p\) 适当增长,以确保逼近能力和估计误差之间的平衡。这与 Bauer & Kohler (2019) 和 Schmidt-Hieber (2020) 的框架一致。
- 协变量假设:协变量 \(X_i\) 有界,且其协方差矩阵非奇异。这是标准假设。
- 误差假设:误差 \(\epsilon_i(v)\) 是次高斯的,且在不同体素间允许一定相关性(但需要满足某种混合条件)。这比独立同分布假设更现实。
- 稀疏性假设:只有少数协变量(\(s \ll J\))对图像有显著影响。这是变量选择问题的基础。
相比已有文献的强化/放宽: - 放宽:相比张量回归(Li & Zhang 2017; Sun & Li 2017),本文放宽了线性假设,允许 \(\beta_j\) 是 \(X_i\) 的非线性函数。 - 强化:相比纯 DNN 应用,本文强化了理论保证,给出了估计和变量选择的一致性,而不仅仅是预测性能。 - 具体:相比 Feng & Simon (2017) 的稀疏输入网络,本文将其从标量响应推广到了图像响应,并整合了空间结构。
主要结果¶
本文的理论结果主要围绕两个核心问题:估计误差界和变量选择一致性。
-
定理 1(估计误差界):
- 陈述:在适当的假设下,SVCM-DNN 估计量 \(\hat{\beta}_j\) 与真实函数 \(\beta_j\) 之间的均方积分误差(MISE)以高概率被一个上界控制:
\[\frac{1}{p} \sum_{v=1}^p \mathbb{E}_X \left[ \sum_{j=1}^J (\hat{\beta}_j(v, X) - \beta_j(v, X))^2 \right] \lesssim \left( \frac{\log n}{n} \right)^{\frac{2\alpha}{2\alpha + d}} + \frac{s \log J}{n}\]其中 \(\alpha\) 是函数的光滑度参数,\(d\) 是输入 \((v, X)\) 的有效维度,\(s\) 是重要协变量的个数。
- 直觉:误差界由两部分组成:第一部分是非参数估计误差,它随着光滑度 \(\alpha\) 增加而减小,但受维数 \(d\) 的“诅咒”;第二部分是变量选择误差,它只与重要变量个数 \(s\) 和对数维数 \(\log J\) 有关,体现了高维稀疏回归的优势。
- 必要条件:DNN 的深度和宽度需要足够大,以逼近光滑度 \(\alpha\) 的函数;同时,样本量 \(n\) 需要足够大,使得第一部分误差占主导。
- 解决的技术难点:如何将 DNN 的逼近误差(来自 Bauer & Kohler 2019 等)与高维统计的估计误差(来自 Feng & Simon 2017 等)在图像响应回归的特定设定下结合起来。难点在于处理体素间的相关性以及 DNN 内部复杂的参数结构。
- 陈述:在适当的假设下,SVCM-DNN 估计量 \(\hat{\beta}_j\) 与真实函数 \(\beta_j\) 之间的均方积分误差(MISE)以高概率被一个上界控制:
-
定理 2(变量选择一致性):
- 陈述:在惩罚项(如 group Lasso)的作用下,当样本量 \(n\) 趋于无穷时,不重要的协变量(即 \(\beta_j \equiv 0\))对应的 DNN 参数将以概率 1 被完全收缩到 0。
- 直觉:这保证了方法能够正确识别出哪些协变量与图像响应真正相关,从而提供可解释的结果。
- 必要条件:惩罚参数 \(\lambda\) 需要选择得当,既不能太大(导致重要变量被误删),也不能太小(导致噪声变量被保留)。这通常需要满足一个“beta-min”条件,即重要变量的信号强度不能太弱。
- 解决的技术难点:证明 DNN 的“选择一致性”比线性模型更复杂,因为 DNN 的参数是非凸的,且惩罚作用于网络内部的权重,而非直接作用于“变量”。作者通过证明在真实参数附近,损失函数是局部凸的,从而将问题简化为一个近似线性模型的分析。
证明路线与技术技巧¶
-
整体路线(3-5 步逻辑主干):
- 逼近误差分析:首先,利用 DNN 的通用逼近定理(Bauer & Kohler 2019),证明存在一个 DNN 参数 \(\theta^*\),使得其对应的函数 \(f_j^*\) 与真实函数 \(\beta_j\) 之间的逼近误差可以任意小。这一步确定了“理想”网络的存在性。
- 经验风险最小化:然后,分析通过最小化带惩罚的经验风险得到的估计量 \(\hat{\theta}\)。核心是证明 \(\hat{\theta}\) 与 \(\theta^*\) 之间的差距可以被控制。这通常需要用到经验过程理论(empirical process theory)来界定经验风险与期望风险之间的差异。
- 误差分解:将总估计误差分解为逼近误差(来自步骤 1)和估计误差(来自步骤 2)。逼近误差是偏差,估计误差是方差。
- 变量选择分析:对于惩罚项,利用 group Lasso 的 oracle 性质。通过构造一个“oracle”估计量(假设已知哪些变量是重要的),证明在一定的条件下,带惩罚的估计量会以高概率与 oracle 估计量重合,从而实现变量选择一致性。
- 整合:将逼近误差界和估计误差界结合起来,得到最终的收敛速度(定理 1)。同时,从变量选择分析中得出选择一致性(定理 2)。
-
关键跳跃点:
- 从 DNN 逼近到统计估计的桥梁:如何将 DNN 的逼近理论(通常是确定性的、关于函数类的)与统计学习理论(随机的、关于样本的)无缝衔接?作者的关键跳跃是假设 DNN 的参数空间是受限的(如权重有界),从而使得函数类具有可控的复杂度(如通过 VC 维或 Rademacher 复杂度度量),进而可以应用一致大数定律。
- 处理体素间相关性:图像体素间的误差 \(\epsilon_i(v)\) 通常是相关的。如果直接应用独立同分布的假设,会低估方差。作者的关键技巧是利用体素间误差的某种混合条件(如 mixing condition)或谱范数条件,将相关误差下的经验过程分析转化为独立块状分析,或者通过矩阵浓度不等式来处理。
-
技术技巧点名:
- 经验过程理论(Empirical Process Theory):用于界定经验风险与期望风险的差异,是控制估计误差的核心工具。具体可能用到 Rademacher 复杂度或局部 Rademacher 复杂度。
- DNN 逼近理论(DNN Approximation Theory):来自 Bauer & Kohler (2019) 和 Schmidt-Hieber (2020),用于控制逼近误差。
- Group Lasso 的 Oracle 不等式(Oracle Inequality for Group Lasso):用于分析变量选择的一致性和估计误差。作者可能将其推广到了非凸的 DNN 设定。
- 局部凸性分析(Local Convexity Analysis):由于 DNN 的损失函数是非凸的,作者可能通过证明在真实参数 \(\theta^*\) 的一个邻域内,损失函数是强凸的,从而保证了梯度下降或类似算法能够收敛到全局最优附近。这是处理非凸优化问题的标准技巧。
真实例子与应用¶
本文包含两个真实 fMRI 数据集的分析:
-
ABCD 研究(Adolescent Brain Cognitive Development Study):
- 数据/场景:来自 Casey et al. (2018)。使用了 2013 名 9-10 岁儿童的静息态 fMRI 数据。响应变量 \(Y_i(v)\) 是每个体素的低频波动幅度(ALFF,一种衡量脑区自发活动强度的指标)。协变量 \(X_i\) 包括:一般认知能力得分、精神诊断得分、年龄和性别(\(J=4\))。
- 方法应用:SVCM-DNN 被用来建模这 4 个协变量与全脑 ALFF 图之间的关联。模型会输出每个协变量在每个体素上的“重要性”或“效应大小”。
- 结果:SVCM-DNN 识别出的与认知能力相关的脑区(如枕叶、视觉网络)与已有神经科学文献高度一致。更重要的是,它发现了一些非线性的关联模式,例如,认知得分与某些脑区活动的关系并非简单的线性增减,而是存在阈值效应或 U 型关系,这是传统线性模型无法捕捉的。
- 例子想说明什么:验证了 SVCM-DNN 在真实数据上的可解释性(识别出已知脑区)和灵活性(发现非线性模式),证明了其相对于线性模型的优势。
-
HCP 研究(Human Connectome Project):
- 数据/场景:来自 Barch et al. (2013)。使用了 800 多名年轻成人的任务态 fMRI 数据(N-back 工作记忆任务)。响应变量 \(Y_i(v)\) 是每个体素在“2-back” vs “0-back”对比下的激活强度图。协变量 \(X_i\) 包括:晶体智力得分、流体智力得分、年龄和性别(\(J=4\))。
- 方法应用:类似地,SVCM-DNN 被用来建模协变量与任务激活图之间的关联。
- 结果:SVCM-DNN 在预测个体任务激活图方面,显著优于传统的体素-wise 线性模型和几种张量回归方法(如 STORE)。在变量选择方面,它识别出的与智力相关的脑区(如额顶叶网络、默认模式网络)也与文献一致。
- 例子想说明什么:展示了 SVCM-DNN 在预测精度上的优势,以及其在另一个不同模态(任务态 fMRI)和不同人群(成人)上的泛化能力。
🔎 结论是否比证明窄¶
这是一个需要仔细核验的问题。从摘要和引言看,作者声称的方法优势(灵活性、可解释性、理论保证)在真实例子中得到了部分验证。但可能存在以下情况: - “非线性”的证明:定理 1 的误差界依赖于函数的光滑度 \(\alpha\)。如果真实的 \(\beta_j\) 非常不平滑(例如,存在突变点),那么 \(\alpha\) 会很小,误差界会很大,甚至可能不收敛。作者在真实例子中声称发现了“非线性模式”,但没有提供任何统计检验来证明这种非线性是显著的,而非仅仅是噪声。这是结论(非线性存在)比证明(在光滑假设下成立)窄的一个潜在点。 - 变量选择一致性的“beta-min”条件:定理 2 的变量选择一致性通常需要一个“beta-min”条件,即重要变量的信号强度必须大于某个阈值。在真实数据中,这个条件是否满足是未知的。作者在例子中展示了变量选择的结果,但没有讨论这个条件的合理性。因此,结论(变量选择正确)可能比证明(在强信号假设下成立)窄。 - 具体语句:需要检查论文中是否有类似“Our method can capture any complex nonlinear patterns”或“Our variable selection is always consistent”的泛化 claim。如果有,这些 claim 就比在特定假设下证明的结论要宽。
四、开放问题¶
- 非线性模式的统计推断:本文只给出了点估计和误差界,但没有提供对估计的系数函数 \(\hat{\beta}_j(v, X)\) 进行统计推断(如构建置信区间或进行假设检验)的方法。如何为 DNN 估计量构建有效的置信区间,尤其是在高维和空间相关的设定下,是一个重要的开放问题。扎根点:论文的结论部分通常只讨论估计和选择,不涉及推断。
- 更复杂的空间结构:本文假设图像体素排列在规则网格上,并通过 DNN 的结构(如卷积)来编码空间平滑性。对于非规则网格(如顶点-面片构成的皮层表面)或具有复杂拓扑结构的图像(如连接组),如何设计 DNN 结构来有效整合空间信息?扎根点:论文的模拟和真实例子都基于规则的 3D 体素网格。
- 计算效率与统计最优性之间的权衡:本文的误差界中,非参数部分的收敛速度是 \(\left( \frac{\log n}{n} \right)^{\frac{2\alpha}{2\alpha + d}}\)。这个速度是否是最优的(minimax 最优)?对于图像响应回归这个具体问题,是否存在一个计算上可行的算法能达到更快的速度?这与您感兴趣的统计-计算权衡直接相关。扎根点:论文没有讨论其估计量的 minimax 最优性。
- DNN 架构的自动选择:本文假设 DNN 的深度和宽度是预先指定的超参数。如何根据数据自适应地选择最优的网络结构(如通过神经架构搜索),并为其提供理论保证?扎根点:论文的理论部分假设网络结构随样本量增长,但实际应用中需要手动调节。
Maintained by 陈星宇 · Homepage · Source on GitHub