跳转至

Mathematical Foundations of Infinite-Dimensional Statistical Models

作者: Bodhisattva Sen
来源: Journal of the American Statistical Association
主题: 非参数 / 半参数
相关性: 7/10
机构绿灯: Columbia University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/01621459.2024.2308799


一、领域脉络与小综述

这个方向是什么

这个方向是无限维统计模型(Infinite-Dimensional Statistical Models)的数学基础,核心是研究当参数空间是无穷维函数空间(如 Sobolev、Besov 空间)时,统计推断(估计、检验、置信集)的理论性质。它回答的根本问题是:在函数空间中,给定有限样本,我们能以多快的速度估计一个未知函数?这个速率受哪些因素(光滑性、维数、信噪比)控制?以及如何构造达到最优速率的估计方法?该方向在 1990s-2000s 已高度成熟,形成了以 minimax 下界、核/样条/小波方法、函数空间嵌入理论为核心的经典体系。当前状态是“教科书级”的成熟领域——主要定理和证明框架已被多本专著(如 Tsybakov 2009, Giné & Nickl 2016, 以及本书)系统化。

发展脉络(history)

由于用户提供的材料只有本书的摘要和元数据,没有具体的 introduction 文本,以下发展脉络基于该领域公认的经典文献构建(这些文献是本书必然引用的核心工作):

  1. 奠基工作(1940s-1970s)
  2. Rosenblatt (1956) & Parzen (1962):提出了核密度估计,首次给出了非参数密度估计的逐点均方收敛速率。留下了“如何刻画全局最优速率”的问题。
  3. Stone (1980, 1982):建立了非参数回归和密度估计的 minimax 下界理论,证明了在 Hölder 光滑类上,核估计可以达到最优收敛速率。这是该领域第一个系统性框架。

  4. 主要进展(1980s-1990s)

  5. Donoho & Johnstone (1994, 1995):提出小波阈值估计(VisuShrink, SureShrink),证明了在 Besov 空间上,小波方法可以自适应地达到最优或接近最优的收敛速率,且能处理非光滑(如尖峰)函数。这是“自适应估计”的里程碑。
  6. Tsybakov (2009, 第一版):系统整理了非参数估计的 minimax 理论,包括核、局部多项式、样条、小波方法,以及下界推导的 Assouad 引理、Fano 不等式等工具。这本书成为该领域的标准研究生教材。
  7. Giné & Nickl (2016):从经验过程理论出发,为密度估计和回归提供了更深刻的概率论基础,特别是关于 bootstrap 置信集的理论。

  8. 当前 frontier(2010s-至今)

  9. 方向已从“经典非参数”转向更复杂的结构:高维非参数(稀疏加性模型)、形状约束(单调、凸)、网络数据、因果推断中的非参数估计等。本书作为教科书,覆盖的是经典核心,而非这些前沿。

  10. 本文的位置

  11. 本书(Sen 的专著)定位为“数学基础”教科书,旨在为研究生和研究人员提供从泛函分析、函数空间到非参数估计 minimax 理论的系统化桥梁。它不声称有新结果,而是整合和清晰化已有理论。其价值在于:将分散在论文中的证明(如 Stone 的下界、Donoho 的小波自适应)统一在一个自洽的数学框架下。

子线索聚类

该领域的被引文献大致落在以下 3 条子线索上:

  1. 核与局部多项式方法
  2. 核心工作:Rosenblatt (1956), Parzen (1962), Stone (1980, 1982), Tsybakov (2009)。
  3. 做什么:用核函数加权平均来估计密度或回归函数,研究带宽选择、边界效应、最优收敛速率。
  4. 优点:直观、计算简单、理论成熟。缺点:在低光滑性或不连续函数上表现不佳;对维数灾难敏感。

  5. 样条方法

  6. 核心工作:Wahba (1990), Eubank (1999), Gu (2013)。
  7. 做什么:用分段多项式(样条)拟合数据,通过惩罚(如光滑样条)控制复杂度。理论基于 Sobolev 空间的再生核 Hilbert 空间(RKHS)框架。
  8. 优点:自然处理非均匀设计、边界效应小;与高斯过程回归有深刻联系。缺点:理论分析比核方法复杂;高维时计算成本高。

  9. 小波方法

  10. 核心工作:Donoho & Johnstone (1994, 1995), Donoho et al. (1995), Mallat (2009)。
  11. 做什么:将函数在小波基下展开,通过阈值处理小波系数来去噪。理论基于 Besov 空间——比 Sobolev 空间更灵活,能刻画函数的局部光滑性。
  12. 优点:自适应(无需知道函数光滑性)、能处理非光滑函数、计算快速(O(n))。缺点:对设计点要求高(通常需等距);在低维(d=1,2)最有效,高维小波基构造复杂。

这个方向在追问的核心问题

  1. 最优收敛速率:给定函数类(如 d 维 Sobolev 类),估计的 minimax 风险是多少?这个速率如何随维数 d 和光滑性 s 变化?(答案:通常为 n^{-2s/(2s+d)}。)
  2. 自适应估计:能否构造一个估计器,在不事先知道函数光滑性 s 的情况下,达到与知道 s 时相同的(或接近的)最优速率?(小波阈值方法给出了肯定答案,但代价是对数因子。)
  3. 置信集:如何构造非参数函数的置信区间/带,使其渐近覆盖概率正确,且宽度达到最优?(这比点估计难得多,涉及偏差校正、undersmoothing 或 bootstrap 方法。)
  4. 维数灾难:当 d 很大时,非参数速率变得极慢(n^{-2s/(2s+d)} 接近 n^{-1})。如何通过结构假设(可加性、稀疏性、低维流形)来缓解?

⚠️ 作者的 framing

由于没有本书的 introduction 原文,以下基于教科书的一般惯例推断:

  • 作者的缺口 frame:作者很可能将缺口 frame 为“现有教材要么太偏应用(缺乏严格证明),要么太偏泛函分析(与统计脱节)”,因此本书的目标是“在泛函分析与统计推断之间架桥”。这是教科书的标准叙事。
  • 被淡化或回避的竞争路线:教科书通常不会淡化竞争路线,而是全面覆盖。但可能回避了以下内容:
  • 深度学习方法:近年来神经网络在非参数估计中表现出色(如 Bauer & Kohler 2019, Schmidt-Hieber 2020),但本书作为“数学基础”教科书,可能不涉及这些较新的、理论尚在发展的方法。
  • 计算-统计权衡:非参数估计的计算复杂度(如核方法的 O(n²) 计算)及其与统计精度的关系,通常不在经典教科书中讨论。
  • 什么明显该被引/该存在、却没出现在 intro 里?:无法判断,因为没有 intro 文本。但一个合理的猜测是:如果本书只覆盖 Sobolev 和 Besov 空间,那么Hölder 空间(Tsybakov 2009 的核心)和RKHS 框架(Wahba 1990)可能被作为预备知识或单独章节处理,而非主线。

张力

未见明显对立引用。该领域的主要结果(minimax 速率、自适应估计)已被广泛验证和接受,不同方法(核 vs 样条 vs 小波)之间是互补而非矛盾的关系。唯一的张力可能在于“自适应估计是否真的‘免费’”——小波阈值方法在 Besov 空间上自适应,但在 Sobolev 空间上会损失对数因子;而 Lepski 方法(Lepski 1991)可以做到无对数损失的自适应,但计算更复杂。这种张力是技术性的,而非根本性的矛盾。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( X_1, X_2, \dots, X_n \):独立同分布(i.i.d.)的随机样本,来自某个未知分布 \( P \)。 - \( f \):未知的概率密度函数(PDF),是我们要估计的目标。\( f: \mathbb{R}^d \to [0, \infty) \),满足 \( \int f(x) dx = 1 \)。 - \( \hat{f}_n \):基于样本构造的密度估计量(estimator)。 - \( \| \cdot \|_p \)\( L^p \) 范数,\( \|f\|_p = (\int |f(x)|^p dx)^{1/p} \)。最常用的是 \( L^2 \) 范数(均方积分误差,MISE)和 \( L^\infty \) 范数(一致误差)。 - \( \Sigma(s, L) \)Sobolev 类。定义:\( \Sigma(s, L) = \{ f: [0,1]^d \to \mathbb{R} \mid f \text{ 的 } s \text{ 阶弱导数存在,且 } \|f^{(s)}\|_2 \le L \} \)。参数 \( s > 0 \) 控制光滑性(越大越光滑),\( L > 0 \) 控制尺度。 - \( \mathcal{B}_{pq}^s \)Besov 类。比 Sobolev 类更一般,通过 \( L^p \) 范数下的模量连续性和小波系数刻画。参数 \( s \)(光滑性)、\( p \)(函数空间范数)、\( q \)(精细调谐)。当 \( p=q=2 \) 时退化为 Sobolev 类。 - \( R(\hat{f}_n, f) = \mathbb{E}_f [ \| \hat{f}_n - f \|_2^2 ] \):均方积分误差(MISE),是衡量估计性能的标准风险。 - \( \inf_{\hat{f}_n} \sup_{f \in \mathcal{F}} R(\hat{f}_n, f) \)minimax 风险。在所有可能的估计量中,在最坏情况函数 \( f \) 下的最小可能风险。这是非参数估计的“黄金标准”。

模型: - 数据生成机制\( X_i \overset{i.i.d.}{\sim} f \),其中 \( f \) 是未知的、属于某个光滑函数类(如 Sobolev 类 \( \Sigma(s, L) \))的密度函数。 - 已知:样本量 \( n \),函数类 \( \mathcal{F} \)(如 \( s \)\( L \) 已知),以及函数空间的结构(如 Sobolev 范数的定义)。 - 要估的对象:整个函数 \( f \)(而非有限维参数)。这是一个无限维参数估计问题。

可观测数据: - 可观测\( n \) 个 i.i.d. 样本点 \( X_1, \dots, X_n \in \mathbb{R}^d \)。每个样本点是一个 \( d \) 维向量。 - 不可观测:真实的密度函数 \( f \)、其导数、其小波系数、以及任何关于 \( f \) 的全局性质(如光滑性 \( s \))。所有关于 \( f \) 的信息都必须从样本中推断。

第二步:讲最小内核

最简特例\( d=1 \)(一维密度估计),\( s=2 \)(二阶 Sobolev 类),\( L=1 \)。即:

\[\mathcal{F} = \Sigma(2, 1) = \{ f: [0,1] \to \mathbb{R} \mid f, f', f'' \in L^2[0,1], \int_0^1 (f''(x))^2 dx \le 1 \}\]
我们想估计 \( f \)\( L^2 \) 范数下的 minimax 风险。

核心命题(这是整本书要证明的经典结果的特例):

\[\inf_{\hat{f}_n} \sup_{f \in \Sigma(2,1)} \mathbb{E}_f [ \| \hat{f}_n - f \|_2^2 ] \asymp n^{-4/5}\]
即最优收敛速率是 \( n^{-4/5} \)。这个速率由两个因素决定:维数 \( d=1 \) 和光滑性 \( s=2 \),公式为 \( n^{-2s/(2s+d)} = n^{-4/5} \)

为什么是这个速率?核心思路: 1. 下界(不可能更快):用Assouad 引理Fano 不等式。构造一个“困难”的子问题:在 \( \Sigma(2,1) \) 中嵌入 \( M \approx n^{1/5} \) 个“几乎正交”的函数 \( f_1, \dots, f_M \),使得任意两个函数之间的距离 \( \|f_i - f_j\|_2 \approx n^{-2/5} \)。然后证明:基于 \( n \) 个样本,无法可靠地区分这 \( M \) 个函数(因为每个函数之间的 Kullback-Leibler 散度很小)。这迫使 minimax 风险至少为 \( n^{-4/5} \)。 2. 上界(可以做到):用核密度估计,带宽 \( h \approx n^{-1/5} \)。核估计的偏差 \(\approx h^2\)(因为 \( f'' \) 有界),方差 \(\approx 1/(nh)\)。选择 \( h \) 使偏差²与方差平衡:\( h^4 \approx 1/(nh) \Rightarrow h \approx n^{-1/5} \),此时风险 \(\approx h^4 + 1/(nh) \approx n^{-4/5}\)

这个特例揭示了整本书的核心数学困难: - 下界需要构造“困难函数集”并计算信息散度——这是泛函分析与信息论的结合。 - 上界需要精确控制偏差-方差权衡——这是函数空间嵌入理论(Sobolev 嵌入定理)与概率不等式(如 Bernstein 不等式)的结合。 - 一般化到更高维 \( d \) 和更一般的光滑类(Besov)时,下界构造更复杂(需要小波基),上界需要更精细的工具(如小波阈值、局部多项式)。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:本书系统建立了无限维统计模型(主要是非参数密度估计和回归)的数学基础,从函数空间(Sobolev、Besov)和算子理论出发,严格推导了核、样条、小波等方法的 minimax 最优收敛速率。
  2. 核心工具/方法:泛函分析(Sobolev 空间、嵌入定理、算子谱理论)、概率论(经验过程、浓度不等式)、信息论(Fano 不等式、Assouad 引理)、小波分析(多分辨率分析、阈值规则)。
  3. 主要结论:对于 d 维 Sobolev 类 \( \Sigma(s, L) \),密度估计的 minimax 最优速率为 \( n^{-2s/(2s+d)} \);对于 Besov 类,小波阈值估计可以自适应地达到该速率(至多差一个对数因子)。本书还覆盖了回归、置信集、以及更一般的函数空间。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 函数空间:本书主要考虑 Sobolev 类 \( \Sigma(s, L) \) 和 Besov 类 \( \mathcal{B}_{pq}^s \)。假设 \( s > d/2 \) 以保证函数连续(Sobolev 嵌入定理)。\( L \) 是已知的常数(控制函数尺度)。
  • 设计点:对于回归,假设设计点 \( X_i \) 是 i.i.d. 来自某个分布,或固定等距设计。对于密度估计,假设样本 i.i.d.。
  • 核函数:假设核函数 \( K \)\( s \) 阶核(即满足 \( \int K = 1 \)\( \int x^j K(x) dx = 0 \)\( j=1,\dots,s-1 \),且 \( \int |x|^s |K(x)| dx < \infty \))。这确保偏差项可以展开到 \( s \) 阶。
  • 小波基:假设使用正则小波(如 Daubechies 小波),具有足够的消失矩和光滑性,以匹配 Besov 空间的刻画。
  • 相比已有文献:本书的假设是标准的,没有放宽或强化。其贡献在于将分散的证明整合在一个统一的框架下。

主要结果

由于本书是教科书,其“主要结果”是经典定理的系统呈现。以下列出 3 个最关键定理(以密度估计为例):

定理 1(核估计的 minimax 最优性,Sobolev 类): - 陈述:设 \( f \in \Sigma(s, L) \) 定义在 \( [0,1]^d \) 上,使用 \( s \) 阶核 \( K \) 和带宽 \( h \asymp n^{-1/(2s+d)} \) 的核密度估计 \( \hat{f}_n \)。则:

\[\sup_{f \in \Sigma(s, L)} \mathbb{E}_f [ \| \hat{f}_n - f \|_2^2 ] \le C n^{-2s/(2s+d)}\]
其中 \( C \) 只依赖于 \( s, L, K, d \)。 - 直觉:偏差 \( \approx h^s \),方差 \( \approx 1/(nh^d) \),平衡得 \( h \asymp n^{-1/(2s+d)} \),风险 \( \approx n^{-2s/(2s+d)} \)。 - 必要条件:核函数必须是 \( s \) 阶的;函数类必须是 Sobolev 类(或更一般的 Hölder 类)。 - 解决的技术难点:需要精确控制边界效应(在 \( [0,1]^d \) 边界附近,核估计有额外偏差),通常通过边界核或反射方法处理。

定理 2(minimax 下界,Sobolev 类): - 陈述:存在常数 \( c > 0 \),使得:

\[\inf_{\hat{f}_n} \sup_{f \in \Sigma(s, L)} \mathbb{E}_f [ \| \hat{f}_n - f \|_2^2 ] \ge c n^{-2s/(2s+d)}\]
- 直觉:构造 \( M \approx n^{d/(2s+d)} \) 个“几乎正交”的函数,每个函数之间的 \( L^2 \) 距离 \( \approx n^{-s/(2s+d)} \)。用 Assouad 引理将估计问题转化为 \( M \) 个二元假设检验问题,每个检验的误差概率下界为常数,从而总风险下界为 \( M \times (距离)^2 \approx n^{-2s/(2s+d)} \)。 - 必要条件:函数类必须足够“大”(包含足够多的“远距离”函数)。 - 解决的技术难点:构造满足 Sobolev 光滑性约束的“困难函数集”——通常使用光滑的 bump 函数,将其平移并缩放,确保每个 bump 的 \( s \) 阶导数有界。

定理 3(小波阈值估计的自适应最优性,Besov 类): - 陈述:设 \( f \in \mathcal{B}_{pq}^s \) 定义在 \( [0,1] \) 上(\( d=1 \)),使用硬阈值或软阈值小波估计 \( \hat{f}_n^* \),阈值 \( \lambda \asymp \sqrt{(\log n)/n} \)。则:

\[\sup_{f \in \mathcal{B}_{pq}^s} \mathbb{E}_f [ \| \hat{f}_n^* - f \|_2^2 ] \le C (\log n) n^{-2s/(2s+1)}\]
其中 \( C \) 只依赖于 \( s, p, q \)。注意:速率 \( n^{-2s/(2s+1)} \) 是最优的(与知道 \( s \) 时相同),但多了一个对数因子 \( \log n \)。 - 直觉:小波将函数分解为不同分辨率的分量。在低分辨率(大尺度)上,系数估计是稳定的(方差小),直接保留;在高分辨率(小尺度)上,系数被噪声淹没,通过阈值将其置零。阈值的选择平衡了“保留信号”和“去除噪声”。 - 必要条件:小波基必须与 Besov 空间匹配(即小波系数范数等价于 Besov 范数);阈值必须随 \( n \) 增长(以控制最大噪声)。 - 解决的技术难点:需要证明阈值估计在 Besov 空间上的风险上界——这涉及对小波系数的高斯尾概率估计、以及 Besov 范数与 \( \ell_p \) 范数之间的等价性。

证明路线与技术技巧

整体路线(以定理 1 和 2 为例)

  1. 上界(定理 1)
  2. 步骤 1:偏差-方差分解。将 MISE 分解为 \( \mathbb{E}[\| \hat{f}_n - f \|_2^2] = \| \mathbb{E}[\hat{f}_n] - f \|_2^2 + \mathbb{E}[\| \hat{f}_n - \mathbb{E}[\hat{f}_n] \|_2^2] \)。第一项是偏差平方,第二项是方差。
  3. 步骤 2:控制偏差。用 Taylor 展开:\( \mathbb{E}[\hat{f}_n(x)] = \int K_h(x-y) f(y) dy \),其中 \( K_h(u) = h^{-d} K(u/h) \)。由于 \( K \)\( s \) 阶核,偏差 \( \mathbb{E}[\hat{f}_n(x)] - f(x) \approx h^s f^{(s)}(x) \)(忽略低阶项)。积分得 \( \|偏差\|_2^2 \le C h^{2s} \|f^{(s)}\|_2^2 \le C h^{2s} L^2 \)
  4. 步骤 3:控制方差\( \text{Var}(\hat{f}_n(x)) \approx \frac{1}{nh^d} f(x) \int K^2 \)。积分得 \( \int \text{Var} \le \frac{C}{nh^d} \)
  5. 步骤 4:平衡。选择 \( h \asymp n^{-1/(2s+d)} \),得风险 \( \le C (h^{2s} + 1/(nh^d)) \asymp n^{-2s/(2s+d)} \)

  6. 下界(定理 2)

  7. 步骤 1:构造困难函数集。选择光滑的 bump 函数 \( \phi \)(支撑在 \( [0,1]^d \) 内,\( \|\phi^{(s)}\|_2 \le 1 \))。定义 \( f_\theta(x) = f_0(x) + \delta \sum_{j=1}^M \theta_j \phi(N(x - x_j)) \),其中 \( f_0 \) 是某个基准密度(如均匀分布),\( \theta_j \in \{0,1\} \)\( N \) 是缩放因子,\( x_j \) 是网格点。选择 \( N \approx n^{1/(2s+d)} \)\( \delta \approx n^{-s/(2s+d)} \),使得每个 \( f_\theta \) 仍在 \( \Sigma(s, L) \) 内。
  8. 步骤 2:转化为假设检验。用 Assouad 引理:\( \inf_{\hat{f}_n} \sup_{f} \mathbb{E}[\| \hat{f}_n - f \|_2^2] \ge \frac{M}{2} \delta^2 \inf_{\psi} \frac{1}{M} \sum_{j=1}^M P(\psi_j \neq \theta_j) \),其中 \( \psi \) 是基于样本对 \( \theta_j \) 的检验。
  9. 步骤 3:控制检验误差。用 Fano 不等式或 Le Cam 引理:任意两个不同的 \( f_\theta \)\( f_{\theta'} \) 之间的 KL 散度 \( \approx n \delta^2 / N^d \approx 1 \)。因此,无法可靠地区分它们,检验误差下界为常数。
  10. 步骤 4:代入。得风险下界 \( \ge c M \delta^2 \approx n^{-2s/(2s+d)} \)

关键跳跃点: - 下界构造中的“缩放”:如何选择 \( N \)\( \delta \) 使得 \( f_\theta \) 仍在函数类中,同时 \( M \) 尽可能大?这需要 Sobolev 嵌入定理的精确常数。 - Assouad 引理的使用:需要将 \( M \) 个二元检验问题“解耦”,这要求构造的函数集是“几乎正交”的(即不同 bump 的支撑几乎不重叠)。

技术技巧点名: - Assouad 引理:用于下界证明,将估计问题转化为多个二元假设检验。 - Fano 不等式:另一种下界工具,通过信息论给出误差概率下界。 - Bernstein 不等式 / 浓度不等式:用于控制核估计的方差项(特别是 \( L^\infty \) 范数下的风险)。 - Sobolev 嵌入定理:用于证明函数类中的函数是连续的(\( s > d/2 \)),以及控制偏差项。 - 小波多分辨率分析:用于 Besov 空间的刻画和小波阈值估计的构造。 - Stein 的无偏风险估计(SURE):用于自适应选择阈值(SureShrink)。

真实例子与应用

本书为纯理论教科书,无实证例子。它不包含真实数据应用或模拟实验。其“例子”是数学上的示例(如计算特定函数类的 Sobolev 范数、验证核函数的阶数等),用于说明理论概念。

🔎 结论是否比证明窄

作为教科书,本书的结论与证明是匹配的——它只陈述已被严格证明的定理。但需要注意以下几点(这些是教科书固有的局限,而非作者的误导):

  1. 假设已知光滑性 \( s \):定理 1 和 2 假设 \( s \)\( L \) 已知。在实际中,\( s \) 通常是未知的。小波阈值方法(定理 3)解决了自适应问题,但代价是对数因子。本书可能没有强调“自适应估计是否真的‘免费’”这一微妙之处。
  2. 边界效应:定理 1 的证明通常假设函数定义在 \( \mathbb{R}^d \) 上(无边界)或使用边界修正。在实际的紧支撑(如 \( [0,1]^d \))上,边界附近的收敛速率可能更慢。本书可能只在脚注或习题中提及。
  3. 高维诅咒:定理 1 的速率 \( n^{-2s/(2s+d)} \)\( d \) 大时极慢。本书可能没有深入讨论如何通过结构假设(如可加性)来缓解,因为这是更前沿的内容。

四、开放问题

  1. 自适应估计的无对数损失版本:在 Sobolev 类上,是否存在一个估计器,在不事先知道 \( s \) 的情况下,达到精确的 minimax 速率 \( n^{-2s/(2s+d)} \)(无对数因子)?Lepski 方法(Lepski 1991)给出了肯定答案,但计算复杂。本书定理 3 的小波方法有对数损失,这是否是本质的?(扎根于:定理 3 的陈述中 \( (\log n) \) 因子。)

  2. 高维非参数的结构化假设:当 \( d \) 很大时,经典速率 \( n^{-2s/(2s+d)} \) 接近 \( n^{-1} \)(无信息)。如何通过可加性、稀疏性、或低维流形假设来获得更快的速率?本书可能只在最后一章或习题中提及,但未深入。(扎根于:本书的覆盖范围——经典非参数,而非高维结构。)

  3. 置信集的最优性:对于非参数函数的置信区间/带,其最优宽度是否与点估计的 minimax 速率相同?已知结果(如 Giné & Nickl 2016)表明,在适当条件下,置信带的宽度可以接近 \( n^{-s/(2s+d)} \)(点估计速率的平方根),但需要 undersmoothing 或 bootstrap。本书是否覆盖了这些结果?(扎根于:本书的目录——如果包含置信集章节,则这是一个开放问题;如果不包含,则是一个缺失。)

  4. 计算-统计权衡:对于某些非参数问题(如高维非参数回归),是否存在一个“计算上可行”的估计器,其统计精度显著低于信息论下界?这是统计-计算权衡领域的问题,与本书的经典框架正交,但值得交叉。(扎根于:本书完全不涉及计算复杂度,这是一个明显的缺口。)


Maintained by 陈星宇 · Homepage · Source on GitHub

评论