跳转至

Functional linear regression from sparse to dense designs: a pooling-ridge method and minimax optimality

作者: Shunxing Yan, Fang Yao
主题: 非参数 / 半参数
相关性: 7/10
链接: https://arxiv.org/abs/2608.25468


一、领域脉络与小综述

这个方向是什么

这个子方向是函数型线性回归在离散观测数据下的最优预测。核心统计问题是:当预测变量 \(X(t)\) 和/或响应变量 \(Y(s)\) 是随机函数,但实际观测到的只是它们在离散时间点上的带噪声测量值时,如何估计斜率函数 \(\beta\) 并实现预测风险的 minimax 最优性。这个问题横跨函数型数据分析(FDA)、非参数回归和逆问题理论,其核心困难在于:离散采样引入的误差与无限维逆问题的 ill-posedness 交织在一起,使得从“完全观测”到“稀疏观测”的过渡并非连续——存在相变(phase transition)现象。该方向当前成熟度:均值与协方差函数的相变已被完全刻画(Cai & Yuan, 2011; Li & Hsing, 2010),但线性回归的相变自 Yao, Müller & Wang (2005a,b) 提出以来,二十年间未被解决——这正是本文要填补的缺口。

发展脉络

奠基工作(2005-2007):Yao, Müller & Wang (2005a) 首次将函数型线性回归推广到稀疏纵向数据场景,提出基于 FPCA 的条件期望估计方法,但未给出 minimax 最优性。Hall & Horowitz (2007) 和 Cai & Hall (2006) 建立了完全观测数据下 FPCA 方法的收敛率,并证明了在某些条件下 PCA 技术能达到最优收敛率。这些工作奠定了函数型线性回归的理论基础,但都假设函数被完全观测——这在实践中几乎不成立。

RKHS 方法的兴起(2010-2012):Yuan & Cai (2010) 提出 RKHS 框架下的光滑正则化方法,证明其预测误差达到 minimax 最优率,且条件弱于 FPCA 方法。Cai & Yuan (2012) 进一步给出了自适应预测。这些工作将 RKHS 工具引入函数型线性回归,但仍然假设完全观测。Dou, Pollard & Zhou (2012) 将结果推广到指数族模型,Qu, Wang & Wang (2016) 推广到 Cox 模型——但都未处理离散观测。

离散观测下的相变发现(2010-2011):Cai & Yuan (2011) 和 Li & Hsing (2010) 在研究均值函数和协方差函数估计时,首次发现了相变现象:当采样频率 \(m\) 超过某个阈值时,收敛率不再随 \(m\) 增加而改善。这些工作揭示了离散观测对简单估计问题的影响,但线性回归作为逆问题,其相变行为远更复杂——作者在引言中明确说:“Similar phase transition phenomena have been widely conjectured, but there have been no significant theoretical advancements over the past decades.”

函数-函数回归的进展(2013-2018):Crambes & Mas (2013) 推导了完全观测下函数-函数回归的预测误差。Lian (2015) 和 Sun et al. (2018) 在 RKHS 框架下建立了函数-函数回归的 minimax 最优率。但这些工作仍然假设完全观测。Mostafaiy, Faridrohani & Chenouri (2019) 尝试处理稀疏噪声数据,但“the corresponding theoretical analysis with a diverging number of components is unavailable”。

近期进展与本文位置:Zhou, Yao & Zhang (2023) 研究了标量-函数回归的离散观测情形,但“their requirement of dense design imposes unnecessarily high-order sampling frequency”——即未能精确刻画相变边界。Zhou, Wei & Yao (2025) 改进了 FPCA 的理论结果,但“is not adequate to establish the minimax optimal rate of linear models with various sampling frequencies”。本文的位置:首次在任意采样方案(从稀疏到密集)下,同时对标量-函数和函数-函数回归,实现了 minimax 最优性,并精确刻画了相变边界。

子线索聚类

  1. FPCA 方法(Yao, Müller & Wang 2005a; Hall & Horowitz 2007; Cai & Hall 2006; Zhou, Yao & Zhang 2023; Zhou, Wei & Yao 2025):通过估计协方差函数和主成分得分来估计斜率函数。优势是能处理稀疏数据(通过池化策略),劣势是理论分析复杂(需要处理发散维数的特征函数估计),且相变边界未被精确刻画。

  2. RKHS 方法(Yuan & Cai 2010; Cai & Yuan 2012; Lian 2015; Sun et al. 2018; Dette & Tang 2024):通过光滑正则化直接估计斜率函数。优势是理论简洁、条件弱,劣势是几乎全部假设完全观测——对离散观测的处理要么依赖预光滑(稀疏时引入不可忽略的偏差),要么被回避。

  3. 离散观测下的池化策略(Cai & Yuan 2011; Li & Hsing 2010; Zhang & Wang 2016; Yan, Yao & Zhou 2025):在均值/协方差估计中,通过池化所有受试者的离散观测来估计边际量。这些工作揭示了相变现象,但未处理线性回归这一逆问题。

  4. 函数-函数回归的特殊方法(Luo & Qi 2017; Sun et al. 2018; Mostafaiy, Faridrohani & Chenouri 2019; Sang & Li 2026):处理响应也是函数的情形。其中 RKHS 方法(Sun et al. 2018)和信号压缩方法(Luo & Qi 2017)假设完全观测;稀疏数据方法(Mostafaiy et al. 2019; Sang & Li 2026)要么理论不完整,要么依赖预恢复。

核心问题与已知瓶颈

  1. 离散采样如何影响收敛率? 对于均值/协方差,相变已被完全刻画;对于线性回归,相变边界未知。
  2. 稀疏设计下如何实现 minimax 最优? 现有 RKHS 方法依赖完全观测,预光滑在稀疏时引入不可忽略的偏差。
  3. 函数-函数回归中,预测变量和响应变量的采样频率如何共同影响收敛率? 可能有多达三个相变。
  4. “光滑性诅咒”(curse of smoothness):预测变量越光滑(\(r_c\) 越大),相变边界越晚出现——这是线性回归作为逆问题所特有的,在均值/协方差估计中不存在。

⚠️ 作者的 framing

作者把缺口 frame 成:“Optimal estimation for linear regression of discretely observed functional data remains unknown since Yao, Müller and Wang (2005a,b) due to the difficulty of an infinite-dimensional inverse problem complicated by discrete and noisy measurements.” 即这是一个长期悬而未决的开放问题,而本文的 pooling-ridge 方法是“显然的下一步”——它结合了 RKHS 方法的简洁性和 FPCA 池化策略的数据效率。

被淡化/回避的竞争路线: - FPCA 方法(Yao, Müller & Wang 2005a; Zhou, Yao & Zhang 2023)被描述为“theoretical analysis of principal component estimation is still challenging”——作者暗示其理论不完整,但未正面比较两种方法的实际性能。 - 预光滑+完全观测 RKHS 方法被描述为“introduces significant bias when functions are sparsely sampled”——但未讨论在中等密集采样下预光滑是否足够。 - 作者未讨论贝叶斯方法或深度学习方法(尽管 Yan, Yao & Zhou 2025 是深度回归,但那是作者自己的前期工作)。

什么明显该被引/该存在、却没出现在 intro 里? - 没有引用核岭回归的饱和效应(Li, Zhang & Lin 2024,即被引[16])——虽然该文被列在参考文献中,但 intro 未讨论饱和效应对本文结果的影响。饱和效应指当目标函数过于光滑时,KRR 无法达到信息论下界——这与本文中 \(\alpha\) 参数的上界 \(\alpha < (2r-2s-1)/(2r)\) 有直接关联。 - 没有引用函数型数据中的计算-统计权衡文献——虽然这与研究者兴趣相关,但本文是纯统计理论,不涉及计算复杂度。

张力

未见明显对立引用。所有被引工作基本一致地认为:离散观测下的函数型线性回归最优性是一个开放问题,且 RKHS 方法在完全观测下已达到最优。分歧主要在于如何扩展到离散观测——FPCA 派和 RKHS 派各自有不同策略,但本文试图统一两者。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(X(t)\):定义在紧集 \(\mathcal{T}_x\) 上的随机函数(预测变量),均值 \(\mu_X(t)=0\)(为简化)。 - \(Y\):标量响应(标量-函数回归)或 \(Y(s)\):定义在 \(\mathcal{T}_y\) 上的随机函数(函数-函数回归)。 - \(\beta_0(t)\) 或 \(\beta_0(s,t)\):未知斜率函数(要估计的对象)。 - \(C(t_1, t_2) = \text{Cov}(X(t_1), X(t_2))\):预测变量的协方差函数。 - \(K(t_1, t_2)\):选定的再生核(RKHS 的核函数),\(\mathcal{H}(K)\) 为其对应的 RKHS。 - \(\mathcal{L}_K\):积分算子,\((\mathcal{L}_K f)(\cdot) = \int_{\mathcal{T}_x} K(\cdot, t) f(t) d\nu_x(t)\)。 - \(\Pi = \mathcal{L}_K^{1/2} \mathcal{L}_C \mathcal{L}_K^{1/2}\):核心算子,其谱决定收敛率。 - \(\{\gamma_k\}\):\(\Pi\) 的特征值,\(\gamma_k \asymp k^{-2r}\)。 - \(s\):刻画 \(\mathcal{L}_K^{1/2} \varphi_k\) 的范数衰减,\(\gamma_k^{-1} \|\mathcal{L}_K^{1/2} \varphi_k\|_{L^2}^2 \asymp k^{2s}\)。 - \(\alpha\):刻画斜率函数 \(\beta_0\) 的正则性,\(\|\Pi^{\alpha/2} \mathcal{L}_K^{-1/2} \beta_0\|_{L^2}^2 \lesssim 1\)。 - \(n\):样本量(受试者个数)。 - \(m_x, m_y\):每个受试者的预测变量/响应变量的采样频率(假设所有受试者同阶)。 - \(T_{ij}, S_{il}\):第 \(i\) 个受试者的第 \(j\) 个预测变量观测时间点、第 \(l\) 个响应变量观测时间点。 - \(\varepsilon_{ij}, e_{il}\):测量噪声(独立同分布,零均值,有界四阶矩)。 - \(\lambda\):岭正则化参数(调优参数)。 - \(\hat{\beta}\):本文提出的 pooling-ridge 估计量。

模型(标量-函数回归为例):

\[Y_i = \int_{\mathcal{T}_x} X_i(t) \beta_0(t) d\nu_x(t) + e_i, \quad i=1,\dots,n\]
其中 \(e_i\) 是独立噪声,零均值、有限方差。假设 \(\beta_0 \in \mathcal{H}(K)\) 或更一般地满足 \(\|\Pi^{\alpha/2} \mathcal{L}_K^{-1/2} \beta_0\|_{L^2}^2 \lesssim 1\)。

可观测数据: - 预测变量:\(X_{ij} = X_i(T_{ij}) + \varepsilon_{ij}\),\(j=1,\dots,m_x\)——即每个受试者只在 \(m_x\) 个离散时间点上有带噪声的观测值。 - 响应变量:\(Y_i\)(标量)或 \(Y_{il} = Y_i(S_{il}) + e_{il}\),\(l=1,\dots,m_y\)(函数)。 - 不可观测:完整的函数轨迹 \(X_i(\cdot)\) 和 \(Y_i(\cdot)\),以及无噪声版本 \(X_i(t), Y_i(s)\)。

第二步:最小内核——对齐特征函数下的标量-函数回归

这是整篇论文最核心的简化特例:假设协方差函数 \(C\) 和核函数 \(K\) 共享相同的特征函数,即 \(\phi_k^C = \phi_k^K = \varphi_k\) 对所有 \(k\) 成立。此时: - \(C\) 的特征值 \(\mu_k \asymp k^{-2r_c}\)(\(r_c\):预测变量的光滑度) - \(K\) 的特征值 \(\lambda_k \asymp k^{-2r_b}\)(\(r_b\):斜率函数的光滑度) - \(\Pi = \mathcal{L}_K^{1/2} \mathcal{L}_C \mathcal{L}_K^{1/2}\) 的特征值 \(\gamma_k \asymp k^{-2(r_b + r_c)}\),即 \(r = r_b + r_c\) - \(\gamma_k^{-1} \|\mathcal{L}_K^{1/2} \varphi_k\|_{L^2}^2 \asymp k^{2r_c}\),即 \(s = r_c\) - 假设 \(\beta_0 \in \mathcal{H}(K)\),即 \(\alpha = 0\)

在这个特例下,本文要证明的核心命题是:

\[\mathbb{E}_{\beta_0}(\hat{\beta}) = O_p\left( n^{-\frac{2r_b+2r_c}{2r_b+2r_c+1}} + (n m_x)^{-\frac{2r_b+2r_c}{2r_b+4r_c+1}} \right)\]
且这是 minimax 最优的。

为什么这个特例抓住了本质? - 第一项 \(n^{-(2r_b+2r_c)/(2r_b+2r_c+1)}\) 是完全观测下的 minimax 最优率(Yuan & Cai 2010),对应“样本量 \(n\) 的限制”。 - 第二项 \((n m_x)^{-(2r_b+2r_c)/(2r_b+4r_c+1)}\) 是离散采样引入的额外项,对应“总观测点数 \(n m_x\) 的限制”。 - 相变边界:当 \(m_x \asymp n^{2r_c/(2r_b+2r_c+1)}\) 时,两项同阶;当 \(m_x\) 更大时,第一项主导(密集设计),当 \(m_x\) 更小时,第二项主导(稀疏设计)。

“光滑性诅咒”的直观解释:\(r_c\) 越大(预测变量越光滑),相变边界 \(n^{2r_c/(2r_b+2r_c+1)}\) 越大——即需要更多的观测点才能进入密集设计。这是因为光滑的预测变量在高频成分上信息少,而线性回归作为逆问题需要恢复这些高频成分。

证明的核心想法(在特例下): 1. 构造无偏算子估计 \(\hat{\Gamma}\),其偏差为 0(因为池化策略去掉了对角线项 \(j_1=j_2\))。 2. 在谱域中分析 \(\hat{\Gamma} + \lambda I\) 的逆:偏差来自正则化 \(\lambda\),方差来自 \(\hat{\Gamma} - \Gamma\) 的波动。 3. 偏差项 \(\asymp \lambda^{1-\alpha} = \lambda\)(因为 \(\alpha=0\))。 4. 方差项分解为两部分:\(n^{-1}\lambda^{-1/(2r)}\)(来自 \(n\) 个受试者的波动)和 \((n m_x)^{-1}\lambda^{-(2s+1)/(2r)} = (n m_x)^{-1}\lambda^{-(2r_c+1)/(2r_b+2r_c)}\)(来自离散采样的波动)。 5. 选择 \(\lambda\) 平衡偏差和方差,得到上述收敛率。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在预测变量和/或响应变量仅在离散时间点被观测(从稀疏到密集)的设定下,函数型线性回归(包括标量-函数和函数-函数两种模型)的 minimax 最优预测问题。
  2. 核心工具/方法:提出“池化岭估计”(pooling-ridge estimation),将 FPCA 中的池化策略与 RKHS 方法结合——通过池化所有受试者的离散观测来构造算子的无偏估计,再代入岭正则化框架。
  3. 主要结论:首次实现了离散观测下函数型线性回归的 minimax 最优性,精确刻画了相变边界——标量-函数回归有一个相变(两个 regime),函数-函数回归最多有三个相变(取决于预测变量和响应变量的采样频率)。

关键设定与假设

完整记号(在第二节基础上补充): - \(\Gamma: \mathcal{H}(K) \to \mathcal{H}(K)\):理论算子,\(\Gamma = \iint K_{t_1} C(t_1, t_2) K_{t_2}^* d\nu_x(t_1) d\nu_x(t_2)\)。 - \(\hat{\Gamma}\):\(\Gamma\) 的无偏估计,通过池化所有受试者的离散观测构造(去掉对角线项 \(j_1=j_2\) 以消除偏差)。 - \(\Pi = \mathcal{L}_K^{-1/2} \mathcal{S}_K^* \Gamma \mathcal{S}_K^{*-1} \mathcal{L}_K^{1/2}\):\(\Gamma\) 在 \(L^2\) 上的共轭表示。 - \(\{\gamma_k, \varphi_k\}\):\(\Pi\) 的特征系统。

关键假设:

Assumption 1(预测变量的四阶矩条件):对任意 \(f \in L^2(\mathcal{T}_x, \nu_x)\),

\[\mathbb{E}\left[ \left( \int_{\mathcal{T}_x} X(t) f(t) d\nu_x(t) \right)^4 \right] \leq C \left( \mathbb{E}\left[ \left( \int_{\mathcal{T}_x} X(t) f(t) d\nu_x(t) \right)^2 \right] \right)^2.\]
这等价于要求 \(\int X f\) 的峰度有界。高斯过程满足此条件(\(C=3\))。相比已有文献:与 Yuan & Cai (2010) 和 Cai & Yuan (2012) 相同,是 RKHS 方法的标准假设。

Assumption 2(标量-函数回归的谱条件): - (a) \(\Pi\) 的特征值 \(\gamma_k \asymp k^{-2r}\),且 \(\gamma_k^{-1} \|\mathcal{L}_K^{1/2} \varphi_k\|_{L^2}^2 \asymp k^{2s}\),其中 \(1/2 < r-s \leq r_b\),\(r - r_b > 1/2\),且 \(K^{(r-r_b)/r_b}\) 有界。 - (b) 斜率函数满足 \(\|\Pi^{\alpha/2} \mathcal{L}_K^{-1/2} \beta_0\|_{L^2}^2 \lesssim 1\),其中 \(-1 \leq \alpha < (2r-2s-1)/(2r)\)。

相比已有文献的放宽/强化: - 放宽:允许 \(\beta_0 \notin \mathcal{H}(K)\)(通过 \(\alpha\) 参数化),即模型误设定情形。Yuan & Cai (2010) 假设 \(\beta_0 \in \mathcal{H}(K)\)(对应 \(\alpha=0\))。 - 强化:需要刻画 \(\gamma_k^{-1} \|\mathcal{L}_K^{1/2} \varphi_k\|_{L^2}^2\) 的衰减(参数 \(s\)),这在完全观测下不需要——因为离散观测的方差项依赖于 \(s\)。 - 新引入:\(K^{(r-r_b)/r_b}\) 的有界性用于下界构造。

Assumption 3(函数-函数回归的谱条件):类似 Assumption 2,但分别对 \(\Pi_x = \mathcal{L}_{K_x}^{1/2} \mathcal{L}_C \mathcal{L}_{K_x}^{1/2}\) 和 \(\Pi_y = \mathcal{L}_{K_y}\) 做假设,并增加对 \(\Pi_y\) 特征函数 \(L^4\) 范数的均匀有界性假设。

主要结果

Proposition 3.1(\(\hat{\Gamma} + \lambda I\) 的正定性):在 Assumption 1-2 下,若 \(\lambda \asymp n^{-2r/(2(1-\alpha)r+1)} + (n m_x)^{-2r/(2(1-\alpha)r+2s+1)}\),则 \(\hat{\Gamma} + \lambda I\) 以概率趋于 1 正定。这保证了估计量的良定义性。

Theorem 3.1(标量-函数回归的上界):在 Assumption 1-2 下,取上述 \(\lambda\),则

\[\mathbb{E}_{\beta_0}(\hat{\beta}) = O_p\left( n^{-\frac{2(1-\alpha)r}{2(1-\alpha)r+1}} + (n m_x)^{-\frac{2(1-\alpha)r}{2(1-\alpha)r+2s+1}} \right).\]

Theorem 3.2(标量-函数回归的下界):存在常数 \(c>0\),使得

\[\lim_{n\to\infty} \inf_{\tilde{\beta}} \sup_{P \in \mathcal{Q}} \mathbb{P}\left( \mathbb{E}_{\beta_0}(\tilde{\beta}) > c\left( n^{-\frac{2(1-\alpha)r}{2(1-\alpha)r+1}} + (n m_x)^{-\frac{2(1-\alpha)r}{2(1-\alpha)r+2s+1}} \right) \right) > 0.\]
上下界匹配,证明 minimax 最优性。

Theorem 3.3(函数-函数回归的上界):在 Assumption 1 和 3 下,取

\[\lambda \asymp n^{-\frac{2r_x}{2(1-\alpha)r_x+1}} + (n m_x)^{-\frac{2r_x}{2(1-\alpha)r_x+2s+1}} + (n m_y)^{-\frac{2r_y}{2(1-\alpha)r_y+1}},\]
则
\[\mathbb{E}_{\beta_0}(\hat{\beta}) = O_p\left( n^{-\frac{2(1-\alpha)r_x}{2(1-\alpha)r_x+1}} + (n m_x)^{-\frac{2(1-\alpha)r_x}{2(1-\alpha)r_x+2s+1}} \log n + (n m_y)^{-\frac{2(1-\alpha)r_y}{2(1-\alpha)r_y+1}} \log n \right).\]
对数因子在 \(r_x \neq (2s+1)r_y\) 和 \(r_x \neq r_y\) 时可去掉。

Theorem 3.4(函数-函数回归的下界):匹配上界(去掉对数因子),证明 minimax 最优性。

相变总结(以对齐特例 \(\alpha=0\) 为例): - 标量-函数回归:相变在 \(m_x \asymp n^{2r_c/(2r_b+2r_c+1)}\)。稀疏时率 \((n m_x)^{-(2r_b+2r_c)/(2r_b+4r_c+1)}\),密集时率 \(n^{-(2r_b+2r_c)/(2r_b+2r_c+1)}\)。 - 函数-函数回归:当 \(r_{bx} + r_c \leq r_{by}\) 时,类似标量-函数(一个相变)。当 \(r_{bx} + r_c > r_{by}\) 时,最多三个相变,边界由 (1) 式给出,对应密集、预测变量稀疏主导、响应变量稀疏主导三个 regime。

证明路线与技术技巧

整体路线(以标量-函数回归为例):

  1. 算子估计:构造 \(\hat{\Gamma}\) 为 \(\Gamma\) 的无偏估计。关键技巧:在池化求和时去掉 \(j_1=j_2\) 项,消除测量噪声 \(\varepsilon_{ij}\) 引入的偏差。\(\hat{\Gamma}\) 的方差分析需要处理四阶矩(Assumption 1 保证有界)。

  2. 谱分解:将问题转化到 \(\Pi\) 的谱域。定义 \(\hat{\Pi} = \mathcal{L}_K^{-1/2} \mathcal{S}_K^* \hat{\Gamma} \mathcal{S}_K^{*-1} \mathcal{L}_K^{1/2}\),则 \(\hat{\beta}\) 满足 \((\hat{\Pi} + \lambda I) \mathcal{L}_K^{1/2} \hat{\beta} = \hat{\xi}\),其中 \(\hat{\xi}\) 是经验版本的右端项。

  3. 偏差-方差分解:

  4. 偏差:\(\mathbb{E}[\hat{\beta}] - \beta_0 = (\Pi + \lambda I)^{-1} \Pi \beta_0 - \beta_0 = -\lambda (\Pi + \lambda I)^{-1} \beta_0\),其范数 \(\asymp \lambda^{1-\alpha}\)(利用 \(\beta_0\) 的正则性假设)。
  5. 方差:\(\hat{\beta} - \mathbb{E}[\hat{\beta}] = (\hat{\Pi} + \lambda I)^{-1} \hat{\xi} - (\Pi + \lambda I)^{-1} \mathbb{E}[\hat{\xi}]\),通过扰动分析展开。

  6. 方差上界:利用 \(\hat{\Pi} - \Pi\) 的谱范数界和 \(\hat{\xi} - \mathbb{E}[\hat{\xi}]\) 的 \(L^2\) 范数界。关键计算:

  7. \(\|\hat{\Pi} - \Pi\|_{\text{op}} = O_p( n^{-1/2} \lambda^{-(1-1/(2r))} + (n m_x)^{-1/2} \lambda^{-(2s+1)/(2r)} )\)。
  8. \(\|\hat{\xi} - \mathbb{E}[\hat{\xi}]\|_{L^2} = O_p( n^{-1/2} + (n m_x)^{-1/2} )\)。
  9. 方差项 \(\asymp \lambda^{-1} \cdot\)(上述量的乘积),得到 \(n^{-1} \lambda^{-1/(2r)} + (n m_x)^{-1} \lambda^{-(2s+1)/(2r)}\)。

  10. 调优:选择 \(\lambda\) 使偏差 \(\lambda^{1-\alpha}\) 与方差主导项平衡,得到定理中的率。

关键跳跃点: - 无偏估计的构造:去掉 \(j_1=j_2\) 项是核心想法。若保留对角线项,偏差为 \(O(m_x^{-1})\),在稀疏时不可忽略。去掉后,\(\hat{\Gamma}\) 无偏,但方差增大(因为少用了 \(n m_x\) 个观测中的 \(n m_x\) 个对角线项——实际上只损失了 \(1/(m_x-1)\) 的比例,可忽略)。 - 谱范数界:\(\|\hat{\Pi} - \Pi\|_{\text{op}}\) 的界需要精细的 empirical process 论证。关键引理:对任意 \(f,g \in L^2\),

\[\langle f, (\hat{\Pi} - \Pi) g \rangle = \frac{1}{n} \sum_{i=1}^n \frac{1}{m_x(m_x-1)} \sum_{j_1 \neq j_2} X_{ij_1} X_{ij_2} \langle f, \mathcal{L}_K^{-1/2} K_{T_{ij_1}} \rangle \langle \mathcal{L}_K^{-1/2} K_{T_{ij_2}}, g \rangle - \langle f, \Pi g \rangle.\]
这是一个二阶 U-统计量(在受试者间独立,在受试者内依赖)。利用 Assumption 1 和谱分解,将其转化为对特征函数 \(\varphi_k\) 的求和,再通过截断技巧控制高阶项。 - 下界构造:采用标准的 two-point 或 Le Cam 方法。构造两个难以区分的参数 \(\beta_0\) 和 \(\beta_1\),使得它们的预测风险差异足够大,但似然比有界。关键技巧:利用 \(K^{(r-r_b)/r_b}\) 的有界性保证构造的 \(\beta\) 在 RKHS 中。

技术技巧点名: - 池化无偏估计:去掉对角线项消除偏差——这是本文方法的核心创新。 - RKHS 谱分解:将问题转化到 \(\Pi\) 的谱域,利用特征值衰减控制各项。 - 二阶 U-统计量的矩界:处理 \(\hat{\Pi} - \Pi\) 的方差时,需要计算四阶矩(Assumption 1)。 - 截断技巧:在谱范数界中,将无穷和截断到前 \(K\) 项,控制截断误差。 - Le Cam 下界:构造两个难以区分的参数,利用似然比的有界性证明 minimax 下界。

真实例子与应用

本文有真实数据例子。

例 1:小麦数据集(标量-函数回归) - 数据:Kalivas (1997) 的小麦近红外光谱数据,100 个样本,每个样本在 701 个波长上有光谱测量,响应变量是蛋白质含量。 - 方法应用:随机将数据分为 80 训练/20 测试。由于原始数据密集,人为稀疏化到 \(m_x = 5, 10, 20\) 个观测点。使用 Matérn 3/2 核,五折交叉验证调参。 - 结果:在所有稀疏度下,本文方法预测误差最低(表 5)。例如 \(m_x=5\) 时,本文误差 0.8029,次优方法 FullyRKHS 为 0.8261。 - 说明什么:验证了方法在稀疏采样下的优势。即使数据本身光滑(预光滑可能有效),本文方法仍优于预光滑+完全观测 RKHS。

例 2:CONTENT 儿童生长数据(函数-函数回归) - 数据:197 名儿童,BMI Z-score 从出生到 300 天的纵向测量。预测变量:前 150 天的测量(稀疏,中位数 14 个点);响应变量:151-300 天的测量(更稀疏,中位数 7 个点)。 - 方法应用:使用 Matérn 3/2 核的 tensor 积,五折交叉验证。随机分割训练/测试(1:2 比例),重复 100 次。 - 结果:本文方法在所有指标(均值、中位数、标准差、四分位数)上最优(表 6)。例如均值误差 0.3536,次优方法 MC 为 0.3823。 - 说明什么:在真实稀疏纵向数据中,本文方法优于 FPCA 方法和预恢复+完全观测 RKHS 方法。特别是,OPFFR-S(先恢复再回归)表现较差(0.4992),说明预恢复在稀疏时引入较大偏差。

🔎 结论是否比证明窄

  • 函数-函数回归的 \(L^2\) 估计误差:作者在 Remark 3.2 末尾明确承认:“it is unclear whether the proposed estimator can achieve minimax optimal rate in terms of \(L^2\) error. In fact, even for fully observed function-on-function regression (Lian, 2015; Sun et al., 2018; Dette and Tang, 2024), the optimality of RKHS estimator in terms of \(L^2\) estimation error is still unestablished.” 这是一个明确的窄结论——本文只证明了预测风险(\(\|(\mathcal{I} \otimes \mathcal{L}_C)^{1/2}(\hat{\beta} - \beta_0)\|_{L^2}^2\))的最优性,未证明 \(L^2\) 估计误差的最优性。
  • 对数因子:Theorem 3.3 的上界包含对数因子,但下界(Theorem 3.4)不含。作者声称对数因子在 \(r_x \neq (2s+1)r_y\) 和 \(r_x \neq r_y\) 时可去掉——这意味着在等式中对数因子可能无法去掉,但作者未给出严格证明。
  • 相变边界的精确性:相变边界(如 (1) 式)是在“对齐特征函数”的 toy 例子下给出的。对于一般情形(非对齐),相变边界由参数 \(r, s\) 决定,但作者未给出类似 (1) 式的显式表达式。
  • \(\alpha\) 的上界:Assumption 2(b) 要求 \(\alpha < (2r-2s-1)/(2r)\)。作者在证明中用到 \(\|\Pi^{-\alpha/2} \mathcal{L}_K^{1/2}\|_{\text{HS}} < \infty\),这需要 \(\alpha\) 不超过某个阈值。若 \(\alpha\) 超过此阈值(即 \(\beta_0\) 过于光滑),本文方法可能无法达到最优率——这与核岭回归的饱和效应(Li, Zhang & Lin 2024)一致,但作者未深入讨论。

四、开放问题

  1. 函数-函数回归的 \(L^2\) 估计误差最优性:本文只证明了预测风险的最优性。能否证明 \(\|\hat{\beta} - \beta_0\|_{L^2}\) 的 minimax 最优率?作者在 Remark 3.2 中明确将此列为开放问题。扎根:Remark 3.2 最后一句。

  2. 非对齐情形下的显式相变边界:本文的相变边界(如 (1) 式)是在“\(C\) 与 \(K\) 共享特征函数”的 toy 例子下给出的。在一般非对齐情形下,相变边界由参数 \(r, s\) 决定,但能否给出类似 (1) 式的显式表达式?扎根:Section 1.2 的 toy 例子和 Remark 3.1。

  3. 对数因子的紧性:Theorem 3.3 的上界包含对数因子,但下界不含。在 \(r_x = (2s+1)r_y\) 或 \(r_x = r_y\) 时,对数因子是否必要?扎根:Theorem 3.3 的陈述和 Theorem 3.4 的对比。

  4. 饱和效应与 \(\alpha\) 上界的联系:Assumption 2(b) 要求 \(\alpha < (2r-2s-1)/(2r)\)。当 \(\alpha\) 超过此阈值(即 \(\beta_0\) 过于光滑)时,pooling-ridge 方法是否仍能达到最优率?是否需要改用其他正则化策略(如迭代 Tikhonov)?扎根:Assumption 2(b) 的陈述和 Li, Zhang & Lin (2024) 关于 KRR 饱和效应的结果。

  5. 扩展到非线性模型:本文的方法能否扩展到函数型单指标模型(Balasubramanian, Müller & Sriperumbudur 2025)或广义线性模型(Dou, Pollard & Zhou 2012)的离散观测情形?扎根:Introduction 中提到的“unified approach via Gaussian Stein identity”和指数族模型。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论