跳转至

Functional linear regression from sparse to dense designs: a pooling-ridge method and minimax optimality

作者: Shunxing Yan, Fang Yao
主题: 非参数 / 半参数
相关性: 7/10
链接: https://arxiv.org/abs/2608.25468


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是函数型线性回归(functional linear regression)在离散观测(discretely observed)下的最优预测问题。核心统计问题是:当预测变量 \(X(t)\) 和/或响应变量 \(Y(s)\) 是随机函数,但实际观测到的只是每个个体在少量、不规则时间点上的带噪测量值时,如何估计斜率函数 \(\beta\)(标量-函数回归)或 \(\beta(s,t)\)(函数-函数回归),并使得预测风险达到 minimax 最优。这个问题的难度在于:它本质上是一个无限维逆问题(ill-posed inverse problem),又被离散、带噪的观测进一步复杂化。过去二十年,对于完全观测(fully observed)的函数型数据,该问题的 minimax 最优率已被解决(Yuan & Cai, 2010; Hall & Horowitz, 2007);但对于离散观测(从稀疏到密集的各种采样方案),最优率一直悬而未决。本文声称首次解决了这一开放问题。

发展脉络

奠基工作(2005-2007): - Yao, Müller & Wang (2005a):首次系统研究了稀疏纵向数据下的函数型线性回归。他们提出基于 FPCA 的方法,通过条件期望估计主成分得分,允许预测变量和响应变量在不同时间点观测。这是稀疏设计下最早的实用方法,但理论分析未给出 minimax 最优率。 - Hall & Horowitz (2007) 和 Cai & Hall (2006):在完全观测假设下,基于 FPCA 研究了标量-函数回归的收敛率,证明了 FPCA 方法在某些条件下能达到最优率。这些工作奠定了该领域的理论基准,但完全忽略了离散观测的影响。

主要进展(2009-2012): - Crambes, Kneip & Sarda (2009):提出了平滑样条估计量,并在完全观测下证明了预测误差的 minimax 最优率。这是 RKHS 方法在函数型回归中的早期重要工作。 - Yuan & Cai (2010) 和 Cai & Yuan (2012):在 RKHS 框架下,通过平滑正则化(ridge-type penalty)统一处理了标量-函数回归的预测和估计问题,得到了比 FPCA 方法更锐利的最优率结果,且条件更弱。这些工作成为 RKHS 方法的标杆,但仍然假设函数被完全观测。 - Dou, Pollard & Zhou (2012):将函数型回归推广到指数族,用测度变换(change-of-measure)技巧建立了 minimax 最优率。同样假设完全观测。

当前 Frontier 与本文位置: - Cai & Yuan (2011) 和 Li & Hsing (2010):转向离散观测下的均值和协方差估计,发现了收敛率中的相变现象(phase transition):当采样频率达到某个阈值时,最优率从依赖总观测数 \(nm_x\) 转变为仅依赖样本量 \(n\)。这些工作为离散观测下的理论分析奠定了基础,但只处理了均值/协方差,未涉及回归。 - Zhou, Yao & Zhang (2023):最接近本文的工作。他们研究了离散观测下的标量-函数回归,在足够密集的采样下建立了收敛率。但如本文指出,他们没有精确刻画相变边界,因此对密集设计的要求比必要的高(即要求 \(m_x\) 比实际相变点更大)。 - Zhou, Wei & Yao (2025):改进了离散观测下 FPCA 的理论结果(特征函数、特征值的矩界),但本文指出这些结果不足以建立各种采样频率下线性模型的最优率。 - 本文(Yan & Yao, 2026):声称首次在任意采样方案(从稀疏到密集)下,同时为标量-函数和函数-函数回归建立了 minimax 最优率,并精确刻画了相变边界。方法上,他们提出pooling-ridge 估计,将 RKHS 正则化与 pooling 策略(从所有个体 pooled 离散观测中无偏估计算子)结合。

子线索聚类

  1. FPCA 方法:以 Yao, Müller & Wang (2005a)、Hall & Horowitz (2007)、Zhou, Yao & Zhang (2023) 为代表。核心思路是先估计协方差函数和特征函数,再通过主成分得分进行回归。优点是在稀疏设计下通过 pooling 提高了效率;缺点是理论分析复杂(特征函数估计的偏差和方差难以控制),且通常需要高斯假设或特定工作假设。
  2. RKHS 正则化方法:以 Yuan & Cai (2010)、Cai & Yuan (2012)、Crambes, Kneip & Sarda (2009)、Sun et al. (2018) 为代表。核心思路是在 RKHS 中通过 ridge 型惩罚直接估计斜率函数。优点是理论更简洁、条件更弱、可处理模型误设;缺点是传统上假设函数被完全观测,对离散观测的处理(如预平滑或积分近似)在稀疏设计下引入不可忽略的偏差。
  3. 离散观测下的相变理论:以 Cai & Yuan (2011)、Li & Hsing (2010)、Zhang & Wang (2016) 为代表。这些工作专注于均值/协方差估计,发现了收敛率随采样频率变化的相变现象。本文的贡献之一是将这种相变分析首次推广到函数型线性回归这一更复杂的逆问题。

这个方向在追问的核心问题

  1. 离散采样如何影响预测风险的最优收敛率? 即,在什么条件下,离散观测的代价可以忽略(达到完全观测的最优率)?在什么条件下,收敛率会退化?
  2. 相变边界在哪里? 边界由哪些参数决定(样本量 \(n\)、采样频率 \(m_x\)、斜率函数光滑度 \(r_b\)、预测变量光滑度 \(r_c\)、核与协方差的匹配程度 \(s\))?
  3. 函数-函数回归是否比标量-函数回归有更复杂的相变结构? 响应函数的离散观测会引入额外的相变吗?
  4. 能否构造一个统一的估计量,在任意采样方案下都达到 minimax 最优? 现有方法要么针对完全观测(RKHS),要么针对稀疏设计(FPCA),缺乏统一框架。

已知瓶颈:离散观测下的函数型回归是一个无限维逆问题,其难度在于:① 稀疏设计下,每个个体的信息极少,必须通过 pooling 来恢复整体结构;② 但 pooling 又引入了复杂的依赖结构(clustered dependence);③ 逆问题的 ill-posedness 与离散观测的偏差交织,使得传统的偏差-方差权衡分析失效。

⚠️ 作者的 framing

作者把缺口 frame 成:现有 RKHS 方法假设完全观测,FPCA 方法虽能处理离散观测但理论分析不完整,且两者都未解决 minimax 最优率问题。因此,本文的 pooling-ridge 估计是“显然的下一步”——它结合了两者的优点(RKHS 的简洁理论与 FPCA 的 pooling 策略),并首次给出了完整的相变刻画。

被淡化或回避的竞争路线: - FPCA 方法的理论进展:作者承认 Zhou, Yao & Zhang (2023) 和 Zhou, Wei & Yao (2025) 是最相关的工作,但指出它们要么未精确刻画相变(前者),要么结果不足以直接用于回归(后者)。作者没有深入讨论这些 FPCA 方法是否可能通过更精细的分析达到类似的最优率——这暗示作者认为 RKHS 框架是更自然的路径。 - 预平滑 + 完全观测 RKHS 方法:作者明确否定了这一路线(“pre-smoothing does not work in sparse design”),但未讨论在中等密集设计下预平滑是否可能达到接近最优的率。

什么明显该被引 / 该存在、却没出现在 intro 里? - Mostafaiy, Faridrohani & Chenouri (2019):这篇论文在参考文献中,但 intro 中只提到它“proposed a function-on-function linear regression estimator for sparse noisy data, based on RKHS-regularized estimation of covariance and FPCA”,并指出“the corresponding theoretical analysis with a diverging number of components is unavailable”。作者将其定位为“相关尝试”而非主要竞争路线。 - Sang & Li (2026):这篇非线性函数-函数回归论文也被引用,但作者指出其稀疏观测处理依赖于 FPCA 恢复,采样频率的影响未知。 - 值得研究者去查的问题:是否存在其他基于张量方法或低秩结构(如 Wang, Wong & Zhang, 2022)的函数型回归工作?这些工作是否可能提供不同的相变刻画?此外,Balasubramanian, Müller & Sriperumbudur (2025) 的 Gaussian Stein 方法是否可推广到离散观测?

张力

未见明显对立引用。所有被引工作基本沿着“完全观测 → 离散观测下的均值/协方差 → 离散观测下的回归”这一渐进路径,彼此之间没有根本矛盾。唯一的张力可能在于:FPCA 方法(如 Yao, Müller & Wang, 2005a)和 RKHS 方法(如 Yuan & Cai, 2010)在完全观测下都能达到最优率,但哪个框架更适合推广到离散观测?本文选择了 RKHS 框架。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(X(t)\):定义在紧集 \(\mathcal{T}_x\) 上的随机函数(预测变量),均值为 0(为简化)。 - \(Y\):标量响应(标量-函数回归)或 \(Y(s)\):定义在 \(\mathcal{T}_y\) 上的随机函数(函数-函数回归)。 - \(\beta_0(t)\):标量-函数回归的斜率函数(未知参数)。 - \(\beta_0(s,t)\):函数-函数回归的斜率函数(未知参数)。 - \(n\):样本量(个体数)。 - \(m_x\):每个个体的预测变量观测次数(假设所有个体相同,即 \(m_{x,i} \asymp m_x\))。 - \(m_y\):每个个体的响应变量观测次数(函数-函数回归)。 - \(T_{ij}\):第 \(i\) 个个体的第 \(j\) 个观测时间点,独立同分布于设计测度 \(\nu_x\)。 - \(S_{il}\):第 \(i\) 个个体的第 \(l\) 个响应观测时间点,独立同分布于 \(\nu_y\)。 - \(X_{ij} = X_i(T_{ij}) + \varepsilon_{ij}\):可观测的带噪预测变量测量值,\(\varepsilon_{ij}\) 为 i.i.d. 测量误差(均值为 0,有界四阶矩)。 - \(Y_{il} = Y_i(S_{il}) + e_{il}\):可观测的带噪响应变量测量值,\(e_{il}\) 为 i.i.d. 测量误差。 - \(e_i\):标量-函数回归中的标量噪声(均值为 0,有限方差)。 - \(U_i(s)\):函数-函数回归中的随机误差过程(均值为 0,连续协方差函数)。 - \(C(t_1, t_2) = \text{Cov}(X(t_1), X(t_2))\):预测变量的协方差函数。 - \(K(t_1, t_2)\):定义在 \(\mathcal{T}_x\) 上的再生核,对应的 RKHS 为 \(\mathcal{H}(K)\)。 - \(K_y(s_1, s_2)\):定义在 \(\mathcal{T}_y\) 上的再生核。 - \(K(s_1, t_1; s_2, t_2) = K_y(s_1, s_2) K_x(t_1, t_2)\):张量积核。 - \(\lambda\):正则化参数(ridge penalty)。 - \(\Gamma\):从 \(\mathcal{H}(K)\) 到 \(\mathcal{H}(K)\) 的算子,定义为 \(\Gamma = \iint K_{t_1} C(t_1, t_2) K_{t_2}^* \, d\nu_x(t_1) d\nu_x(t_2)\),其中 \(K_t(u) = K(t, u)\),\(K_t^* f = f(t)\)。 - \(\hat{\Gamma}\):\(\Gamma\) 的无偏估计(基于 pooling 离散观测)。 - \(L_K\):积分算子,\((L_K f)(t) = \int_{\mathcal{T}_x} K(t, u) f(u) d\nu_x(u)\)。 - \(L_C\):积分算子,\((L_C f)(t) = \int_{\mathcal{T}_x} C(t, u) f(u) d\nu_x(u)\)。 - \(\Pi = L_K^{1/2} L_C L_K^{1/2}\):\(\Gamma\) 在 \(L^2\) 上的共轭表示。 - \(\{\gamma_k, \varphi_k\}\):\(\Pi\) 的特征值和特征函数,\(\gamma_k \asymp k^{-2r}\)。 - \(s\):刻画 \(\gamma_k^{-1} \|L_K^{1/2} \varphi_k\|_{L^2}^2 \asymp k^{2s}\) 的参数,反映核与协方差的匹配程度。 - \(\alpha\):刻画斜率函数光滑度的参数,\(\|\Pi^{\alpha/2} L_K^{-1/2} \beta_0\|_{L^2} \lesssim 1\)。\(\alpha=0\) 表示 \(\beta_0 \in \mathcal{H}(K)\)。

模型: - 标量-函数回归:\(Y_i = \int_{\mathcal{T}_x} X_i(t) \beta_0(t) d\nu_x(t) + e_i\)。 - 函数-函数回归:\(Y_i(s) = \int_{\mathcal{T}_x} X_i(t) \beta_0(s, t) d\nu_x(t) + U_i(s)\)。 - 预测变量 \(X_i(t)\) 是均值为 0 的随机过程,协方差函数为 \(C\)。 - 斜率函数 \(\beta_0\) 属于或接近某个 RKHS \(\mathcal{H}(K)\)(允许模型误设)。 - 观测时间点 \(T_{ij}\) 和 \(S_{il}\) 独立同分布于设计测度 \(\nu_x\) 和 \(\nu_y\)。

可观测数据: - 标量-函数回归:\(\{(Y_i, X_{ij}, T_{ij}) : i=1,\dots,n, j=1,\dots,m_x\}\)。即,每个个体有一个标量响应 \(Y_i\),以及 \(m_x\) 个带噪的预测变量测量值 \(X_{ij}\) 及其时间点 \(T_{ij}\)。 - 函数-函数回归:\(\{(Y_{il}, S_{il}, X_{ij}, T_{ij}) : i=1,\dots,n, j=1,\dots,m_x, l=1,\dots,m_y\}\)。即,每个个体有 \(m_y\) 个带噪的响应测量值和 \(m_x\) 个带噪的预测变量测量值。

不可观测(潜在)量: - 完整的函数轨迹 \(X_i(t)\) 和 \(Y_i(s)\)。 - 斜率函数 \(\beta_0(t)\) 或 \(\beta_0(s,t)\)。 - 协方差函数 \(C(t_1, t_2)\)。 - 噪声项 \(\varepsilon_{ij}, e_{il}, e_i, U_i(s)\)。

第二步:最小内核——对齐特征函数下的标量-函数回归

为了理解本文的核心思路,我们考虑一个最简特例:假设核 \(K\) 和协方差函数 \(C\) 共享相同的特征函数(aligned eigenfunctions),即 \(\phi_k^C = \phi_k^K = \varphi_k\) 对所有 \(k\) 成立。进一步假设: - \(C\) 的特征值 \(\mu_k \asymp k^{-2r_c}\)(\(r_c > 1/2\) 刻画预测变量的光滑度)。 - \(K\) 的特征值 \(\lambda_k \asymp k^{-2r_b}\)(\(r_b > 1/2\) 刻画斜率函数的光滑度)。 - 斜率函数 \(\beta_0 \in \mathcal{H}(K)\)(即 \(\alpha = 0\))。

在这个特例下,\(\Pi = L_K^{1/2} L_C L_K^{1/2}\) 的特征值 \(\gamma_k = \mu_k \lambda_k \asymp k^{-2(r_b + r_c)}\),因此 \(r = r_b + r_c\)。参数 \(s\) 满足 \(\gamma_k^{-1} \|L_K^{1/2} \varphi_k\|_{L^2}^2 = (\mu_k \lambda_k)^{-1} \lambda_k = \mu_k^{-1} \asymp k^{2r_c}\),所以 \(s = r_c\)。

核心思路:本文的 pooling-ridge 估计量 \(\hat{\beta} = (\hat{\Gamma} + \lambda I)^{-1} \frac{1}{n} \sum_{i=1}^n Y_i \frac{1}{m_x} \sum_{j=1}^{m_x} X_{ij} K(T_{ij}, \cdot)\)。关键创新在于 \(\hat{\Gamma}\) 的构造:

\[\hat{\Gamma} = \frac{1}{n} \sum_{i=1}^n \frac{1}{m_x(m_x-1)} \sum_{j_1 \neq j_2} X_{ij_1} X_{ij_2} K_{T_{ij_1}} K_{T_{ij_2}}^*.\]
这个估计量是 \(\Gamma\) 的无偏估计,即使 \(m_x\) 很小(甚至 \(m_x=2\))也成立。为什么?因为 \(\mathbb{E}[X_{ij_1} X_{ij_2}] = C(T_{ij_1}, T_{ij_2})\)(当 \(j_1 \neq j_2\) 时,测量误差 \(\varepsilon_{ij_1}\) 和 \(\varepsilon_{ij_2}\) 独立且均值为 0,所以交叉项消失),而 \(\mathbb{E}[K_{T_{ij_1}} K_{T_{ij_2}}^*] = K_{T_{ij_1}} K_{T_{ij_2}}^*\) 是确定的。因此,\(\hat{\Gamma}\) 的期望正好是 \(\Gamma = \iint K_{t_1} C(t_1, t_2) K_{t_2}^* d\nu_x(t_1) d\nu_x(t_2)\)。

为什么这解决了稀疏设计的问题? 传统的 RKHS 方法(如 Yuan & Cai, 2010)需要计算 \(\int X_i(t) \beta(t) d\nu_x(t)\),这在稀疏设计下只能用 \(m_x^{-1} \sum_j X_{ij} \beta(T_{ij})\) 近似,引入 \(O(m_x^{-1})\) 的偏差。而本文通过 pooling 所有个体的离散观测来估计算子 \(\Gamma\),避免了每个个体内部的积分近似,从而消除了稀疏设计下的主要偏差来源。

在这个特例下,要证的命题退化成什么? 定理 3.1 的结论(在 Remark 3.1 中给出)是:

\[\mathbb{E}_{\beta_0}(\hat{\beta}) = O_p\left( n^{-\frac{2r_b + 2r_c}{2r_b + 2r_c + 1}} + (n m_x)^{-\frac{2r_b + 2r_c}{2r_b + 4r_c + 1}} \right).\]
第一项是完全观测下的 minimax 最优率(Yuan & Cai, 2010)。第二项是离散观测带来的额外代价。相变发生在 \(m_x \asymp n^{\frac{2r_c}{2r_b + 2r_c + 1}}\): - 当 \(m_x\) 远大于此阈值(密集设计),第二项被第一项主导,达到完全观测的最优率。 - 当 \(m_x\) 远小于此阈值(稀疏设计),第一项被第二项主导,率退化为 \((n m_x)^{-\frac{2r_b + 2r_c}{2r_b + 4r_c + 1}}\)。

“curse of smoothness”:注意相变阈值 \(n^{\frac{2r_c}{2r_b + 2r_c + 1}}\) 随 \(r_c\) 增大而增大。这意味着预测变量越光滑(\(r_c\) 越大),需要越密集的采样才能进入密集设计 regime。这是因为光滑的预测变量在高频成分上信息更少,需要更多观测来捕捉这些成分——这是函数型回归作为逆问题的特有现象,在均值/协方差估计中不存在。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在离散观测(从稀疏到密集的任意采样方案)下,函数型线性回归(包括标量-函数和函数-函数)的 minimax 最优预测问题。
  2. 核心工具/方法:提出 pooling-ridge 估计,通过将所有个体的离散观测 pooled 在一起,构造算子 \(\Gamma\) 的无偏估计 \(\hat{\Gamma}\),然后在 RKHS 中求解 ridge 正则化问题 \(\hat{\beta} = (\hat{\Gamma} + \lambda I)^{-1} \hat{\Delta}\),其中 \(\hat{\Delta}\) 是 \(\mathbb{E}[Y X K]\) 的无偏估计。
  3. 主要结论:首次建立了离散观测下函数型线性回归的 minimax 最优收敛率,精确刻画了相变边界。标量-函数回归有一个相变点(两个 regime);函数-函数回归最多有三个相变点(三个 regime),取决于预测变量和响应变量的采样频率。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • Assumption 1(预测变量的四阶矩条件):对任意 \(f \in L^2(\mathcal{T}_x, \nu_x)\),\(\mathbb{E}[(\int X f)^4] \leq C (\mathbb{E}[(\int X f)^2])^2\)。这要求 \(X\) 的线性泛函有亚高斯型的尾部。高斯过程满足此条件(\(C=3\))。
  • Assumption 2(标量-函数回归的谱条件):
  • (a) \(\Pi = L_K^{1/2} L_C L_K^{1/2}\) 的特征值 \(\gamma_k \asymp k^{-2r}\),且 \(\gamma_k^{-1} \|L_K^{1/2} \varphi_k\|_{L^2}^2 \asymp k^{2s}\),其中 \(1/2 < r - s \leq r_b\),\(r - r_b > 1/2\),且 \(K^{(r - r_b)/r_b}\) 有界。
  • (b) 斜率函数满足 \(\|\Pi^{\alpha/2} L_K^{-1/2} \beta_0\|_{L^2} \lesssim 1\),其中 \(-1 \leq \alpha < (2r - 2s - 1)/(2r)\)。
  • 含义:参数 \(r\) 刻画了 \(\Pi\) 的谱衰减,决定了完全观测下的 minimax 率 \(n^{-2r/(2r+1)}\)。参数 \(s\) 刻画了核 \(K\) 与协方差 \(C\) 的“对齐程度”:\(s\) 越大,表示 \(C\) 越光滑(或 \(K\) 与 \(C\) 越不对齐),离散观测的代价越大。\(\alpha\) 允许模型误设:\(\alpha=0\) 表示 \(\beta_0 \in \mathcal{H}(K)\);\(\alpha>0\) 表示 \(\beta_0\) 比 \(\mathcal{H}(K)\) 中的函数更光滑(更快收敛);\(\alpha<0\) 表示 \(\beta_0\) 不在 \(\mathcal{H}(K)\) 中(更慢收敛)。
  • Assumption 3(函数-函数回归的谱条件):类似 Assumption 2,但分解为 \(\Pi = \Pi_y \otimes \Pi_x\),其中 \(\Pi_x = L_{K_x}^{1/2} L_C L_{K_x}^{1/2}\) 的特征值 \(\gamma_u^x \asymp u^{-2r_x}\),\(\Pi_y = L_{K_y}\) 的特征值 \(\gamma_v^y \asymp v^{-2r_y}\)。此外,\(\Pi_x\) 的特征函数满足 \(\gamma_u^x)^{-1} \|L_{K_x}^{1/2} \varphi_u^x\|_{L^2}^2 \asymp u^{2s}\),且 \(\|\varphi_v^y\|_{L^4} \lesssim 1\)。
  • 相比已有文献的放宽/强化:相比 Yuan & Cai (2010) 和 Sun et al. (2018),本文的假设允许 \(\beta_0 \notin \mathcal{H}(K)\)(通过 \(\alpha\) 参数化),这是对模型误设的鲁棒性。但 Assumption 2(a) 和 3(a) 中关于 \(K^{(r-r_b)/r_b}\) 有界的条件,是为了下界构造而引入的,可能比某些现有工作更强。

主要结果

定理 3.1(标量-函数回归的上界): - 若 \(\lambda \asymp n^{-\frac{2r}{2(1-\alpha)r+1}} + (n m_x)^{-\frac{2r}{2(1-\alpha)r+2s+1}}\),则 \(\mathbb{E}_{\beta_0}(\hat{\beta}) = O_p\left( n^{-\frac{2(1-\alpha)r}{2(1-\alpha)r+1}} + (n m_x)^{-\frac{2(1-\alpha)r}{2(1-\alpha)r+2s+1}} \right)\)。 - 直觉:第一项来自样本量 \(n\) 的限制(完全观测下的最优率),第二项来自离散观测的代价。正则化参数 \(\lambda\) 平衡了偏差(\(O(\lambda^{1-\alpha})\))和方差(\(O(n^{-1} \lambda^{-1/(2r)} + (n m_x)^{-1} \lambda^{-(2s+1)/(2r)})\))。 - 必要条件:\(\lambda\) 的阶必须使得 \(\hat{\Gamma} + \lambda I\) 以概率趋于 1 正定(Proposition 3.1)。

定理 3.2(标量-函数回归的下界): - 存在常数 \(c > 0\),使得 \(\lim_{n \to \infty} \inf_{\tilde{\beta}} \sup_{P \in \mathcal{Q}} P\left( \mathbb{E}_{\beta_0}(\tilde{\beta}) > c (n^{-\frac{2(1-\alpha)r}{2(1-\alpha)r+1}} + (n m_x)^{-\frac{2(1-\alpha)r}{2(1-\alpha)r+2s+1}}) \right) > 0\)。 - 含义:上界和下界匹配,因此 pooling-ridge 估计量是 minimax 最优的。

定理 3.3(函数-函数回归的上界): - 若 \(\lambda \asymp n^{-\frac{2r_x}{2(1-\alpha)r_x+1}} + (n m_x)^{-\frac{2r_x}{2(1-\alpha)r_x+2s+1}} + (n m_y)^{-\frac{2r_y}{2(1-\alpha)r_y+1}}\),则

\[\mathbb{E}_{\beta_0}(\hat{\beta}) = O_p\left( n^{-\frac{2(1-\alpha)r_x}{2(1-\alpha)r_x+1}} + (n m_x)^{-\frac{2(1-\alpha)r_x}{2(1-\alpha)r_x+2s+1}} \log n + (n m_y)^{-\frac{2(1-\alpha)r_y}{2(1-\alpha)r_y+1}} \log n \right).\]
- 直觉:三个项分别对应样本量、预测变量离散观测、响应变量离散观测的贡献。\(\log n\) 因子在 \(r_x \neq (2s+1) r_y\) 和 \(r_x \neq r_y\) 时可去除。 - 相变分析:当 \(r_y \geq r_x\) 时,响应变量的离散观测不主导(第三项被第一项吸收),只有一个相变点(\(m_x\))。当 \(r_y < r_x\) 时,最多三个相变点,对应密集、预测变量稀疏、响应变量稀疏三个 regime(见表 2 和图 2)。

定理 3.4(函数-函数回归的下界):匹配上界,证明最优性。

证明路线与技术技巧

整体路线(以标量-函数回归为例):

  1. 偏差-方差分解:将 \(\hat{\beta} - \beta_0\) 分解为偏差项和方差项。定义 \(\beta_\lambda = (\Gamma + \lambda I)^{-1} \Gamma \beta_0\)(即 \(\beta_0\) 在正则化下的“目标”),则

    \[\hat{\beta} - \beta_0 = (\hat{\Gamma} + \lambda I)^{-1} \hat{\Delta} - \beta_0 = \underbrace{(\hat{\Gamma} + \lambda I)^{-1} (\hat{\Delta} - \Gamma \beta_0)}_{\text{方差}} + \underbrace{[(\hat{\Gamma} + \lambda I)^{-1} \Gamma - I] \beta_0}_{\text{偏差}}.\]
    偏差项进一步写为 \((\Gamma + \lambda I)^{-1} \Gamma \beta_0 - \beta_0 = -\lambda (\Gamma + \lambda I)^{-1} \beta_0\),其范数可被 \(\lambda^{1-\alpha}\) 控制(利用 Assumption 2(b))。

  2. 方差项的控制:方差项的核心是 \(\|L_C^{1/2} (\hat{\Gamma} + \lambda I)^{-1} (\hat{\Delta} - \Gamma \beta_0)\|_{L^2}\)。通过谱分解,将其转化为对 \(\hat{\Gamma} - \Gamma\) 和 \(\hat{\Delta} - \Gamma \beta_0\) 的范数控制。关键引理是:

    \[\|L_C^{1/2} (\hat{\Gamma} + \lambda I)^{-1} f\|_{L^2} \lesssim \lambda^{-1/(2r)} \|f\|_{L^2} \quad \text{(利用 } \gamma_k \asymp k^{-2r} \text{)}.\]
    因此,方差项的上界由 \(\lambda^{-1/(2r)} \|\hat{\Delta} - \Gamma \beta_0\|_{L^2}\) 和 \(\lambda^{-(2s+1)/(2r)} \|\hat{\Gamma} - \Gamma\|_{\text{op}}\) 控制(后者来自 \(\hat{\Gamma}\) 的方差对 \(\lambda\) 的依赖)。

  3. \(\hat{\Delta}\) 和 \(\hat{\Gamma}\) 的集中性:这是证明中最吃劲的部分。\(\hat{\Delta} = \frac{1}{n} \sum_i Y_i \frac{1}{m_x} \sum_j X_{ij} K(T_{ij}, \cdot)\) 和 \(\hat{\Gamma}\) 都是 U-统计量(或广义 U-统计量)的线性组合,具有聚类依赖结构(同一个体内的观测相关,不同个体间独立)。作者使用经验过程理论(empirical process)和矩方法来建立它们的收敛速度:

  4. \(\|\hat{\Delta} - \Gamma \beta_0\|_{L^2}^2 = O_p( n^{-1} + (n m_x)^{-1} )\)。
  5. \(\|\hat{\Gamma} - \Gamma\|_{\text{op}} = O_p( n^{-1/2} \lambda^{-1/(2r)} + (n m_x)^{-1/2} \lambda^{-(2s+1)/(2r)} )\),其中 \(\|\cdot\|_{\text{op}}\) 是算子范数。

  6. 平衡偏差和方差:选择 \(\lambda\) 使偏差项 \(\lambda^{1-\alpha}\) 与方差项 \(n^{-1} \lambda^{-1/(2r)} + (n m_x)^{-1} \lambda^{-(2s+1)/(2r)}\) 同阶,得到定理 3.1 中的率。

关键跳跃点: - \(\hat{\Gamma}\) 的算子范数集中性:\(\hat{\Gamma}\) 是四阶 U-统计量(涉及 \(X_{ij_1} X_{ij_2} K_{T_{ij_1}} K_{T_{ij_2}}^*\)),其算子范数的控制需要处理高阶矩和聚类依赖。作者通过将 \(\hat{\Gamma} - \Gamma\) 分解为多个部分(如主项、交叉项、测量误差项),并利用 Assumption 1 的四阶矩条件来 bound 每个部分的谱范数。 - 下界构造:定理 3.2 的下界构造是技术性的。作者需要构造一个“最坏情况”的参数空间 \(\mathcal{Q}\),使得任何估计量都无法超越给定的率。这通常涉及假设检验(如 Le Cam 的 two-point method 或 Fano 不等式)和信息论下界。具体地,作者可能构造两个难以区分的斜率函数 \(\beta_0\) 和 \(\beta_1\),使得它们的预测风险差异很大,但基于离散观测的似然比很小。

技术技巧点名: - 经验过程理论:用于处理聚类依赖结构下的 U-统计量集中性。 - 谱分析:将算子 \(\Gamma\) 和 \(\hat{\Gamma}\) 对角化,利用特征值衰减率 \(\gamma_k \asymp k^{-2r}\) 来控制逆算子的范数。 - 矩方法:用于 bound \(\hat{\Gamma} - \Gamma\) 的算子范数,通过计算其矩的迹(trace)来得到谱范数的上界。 - 无偏估计的构造:\(\hat{\Gamma}\) 使用 \(j_1 \neq j_2\) 的交叉项来消除测量误差的偏差,这是 pooling 策略的关键。 - 下界构造:可能涉及假设检验(如 two-point method)和信息不等式(如 Fano 或 Assouad)。

真实例子与应用

本文包含两个真实数据例子:

  1. 小麦数据集(Wheat dataset)(标量-函数回归):
  2. 数据:100 个小麦样本的 NIR 光谱(701 个波长,1100-2500 nm)和蛋白质含量。原始数据密集,作者通过随机选择 \(m_x = 5, 10, 20\) 个测量点来模拟稀疏设计。
  3. 方法应用:将 80 个样本作为训练集,20 个作为测试集。重复 100 次随机划分和稀疏化。使用 Matérn 3/2 核。
  4. 结果:在所有 \(m_x\) 下,本文方法(Proposed)的平均预测误差最低(表 5)。例如,\(m_x=5\) 时,Proposed 误差 0.8029,而次优的 FullyRKHS 为 0.8261。
  5. 说明什么:验证了方法在稀疏设计下的优势,且随着 \(m_x\) 增加,优势缩小(符合相变理论)。

  6. CONTENT 儿童生长数据集(函数-函数回归):

  7. 数据:197 名儿童从出生到 300 天的 BMI Z-score 纵向数据。预测变量是前 150 天的轨迹(稀疏,中位数 14 个观测),响应变量是 151-300 天的轨迹(更稀疏,中位数 7 个观测)。
  8. 方法应用:将数据随机分为训练集和测试集(测试集大小为训练集的两倍,以减少评估方差)。重复 100 次。
  9. 结果:本文方法在所有指标(均值、中位数、标准差、四分位数)上均优于五种基准方法(表 6)。例如,Proposed 的均值误差 0.3536,而次优的 MC 为 0.3823。
  10. 说明什么:展示了方法在真实稀疏纵向数据上的实用性,特别是当响应变量也稀疏时,本文方法仍能保持优势。

🔎 结论是否比证明窄

  • 函数-函数回归的 \(L^2\) 估计误差:作者在 Remark 3.2 末尾明确承认:“it is unclear whether the proposed estimator can achieve minimax optimal rate in terms of \(L^2\) error. In fact, even for fully observed function-on-function regression (Lian, 2015; Sun et al., 2018; Dette and Tang, 2024), the optimality of RKHS estimator in terms of \(L^2\) estimation error is still unestablished.” 这是一个诚实的限制——本文的结论只针对预测风险(\(\|L_C^{1/2}(\hat{\beta} - \beta_0)\|_{L^2}\)),而非 \(L^2\) 估计误差本身。
  • \(\log n\) 因子:定理 3.3 的上界包含 \(\log n\) 因子,但下界(定理 3.4)没有。作者指出当 \(r_x \neq (2s+1) r_y\) 和 \(r_x \neq r_y\) 时可去除,但未证明在所有情况下都能去除。这意味着在非对齐情况下,上界可能不是严格紧的(但下界表明率本身是最优的,\(\log n\) 因子可能是技术 artifacts)。
  • 假设的紧性:Assumption 2(a) 中 \(K^{(r-r_b)/r_b}\) 有界的条件用于下界构造。作者未讨论这个条件是否必要,或者是否可以被更弱的条件替代。

四、开放问题

  1. 函数-函数回归的 \(L^2\) 估计误差的 minimax 最优率:本文只建立了预测风险的最优率。对于 \(L^2\) 估计误差(\(\|\hat{\beta} - \beta_0\|_{L^2}\)),即使在完全观测下,RKHS 估计量的最优性也未建立(见 Remark 3.2 末尾)。这是一个明确的开放问题,扎根于本文 Remark 3.2 的最后一句。

  2. \(\log n\) 因子的去除:定理 3.3 中函数-函数回归的上界包含 \(\log n\) 因子,但下界没有。作者指出在某些条件下可去除,但未给出一般情况下的证明。这是否意味着上界可以进一步收紧?扎根于定理 3.3 的陈述和定理 3.4 的对比。

  3. 自适应选择正则化参数 \(\lambda\):本文的 \(\lambda\) 选择依赖于未知参数 \(r, s, \alpha\)。作者在模拟中使用了两步交叉验证(先基于有偏准则 \(\tilde{L}\) 筛选,再基于无偏准则 \(\hat{L}\) 选择),但未给出理论保证。能否构造一个数据自适应的 \(\lambda\) 选择方法(如 Lepski 型方法或折交叉验证),使其达到与 oracle 选择相同的 minimax 最优率?扎根于 Section 4 的交叉验证描述。

  4. 更一般的观测方案:本文假设所有个体的采样频率 \(m_{x,i} \asymp m_x\) 同阶。在实际纵向数据中,采样频率可能高度异质(如 CONTENT 数据中 \(m_x\) 从 5 到 17)。能否将理论推广到异质采样频率?扎根于 Section 1.2 的简化假设“we assume that the sampling frequencies of all predictor functions are in the same order as \(m_x\)”。

  5. 非线性模型:本文只处理了线性回归。对于非线性函数型回归(如 Sang & Li, 2026 的 RKHS 方法),离散观测下的 minimax 最优率是否也有类似的相变结构?扎根于参考文献 [22] 和作者在 intro 中的提及。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论