跳转至

Personalizing black-box models for nonparametric regression with minimax optimality

作者: Sai Li, Linjun Zhang
主题: 其他
相关性: 0/10
链接: https://arxiv.org/abs/2601.01432


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是少样本个性化(few-shot personalization):给定一个在外部源数据上训练好的“黑箱”预训练模型 \( f^{(ptr)} \),如何利用极少量(\( n \) 很小)来自目标分布的标记样本,构造一个针对目标分布的最优预测器。核心统计挑战在于:预训练模型可能完全不相关甚至有害,且其内部机制不可访问;目标样本量远小于经典非参数回归所需;同时,研究者可以主动设计样本采集方案(而非被动接收随机样本)。本文在非参数回归框架下,首次给出了这个问题的minimax最优率,并提出了达到该率的算法。

发展脉络(history)

  1. 奠基工作:经典非参数回归与迁移学习

    • Tsybakov (2008) 等经典教材建立了非参数回归的minimax理论,其中Hölder光滑度 \( \theta_2 \) 决定了收敛速率 \( n^{-2\theta_2/(2\theta_2+d)} \)。这是本文的基准——当完全不使用预训练模型时,个性化问题退化为经典问题。
    • Cai & Wei (2021) 研究了非参数分类的迁移学习,其设定允许访问源数据(individual-level source data),并利用源数据与目标数据的相似性来提升目标任务的性能。本文引用了它,但明确指出其与个性化的关键区别:个性化中源数据不可访问,预训练模型是黑箱。
  2. 主要进展:预测驱动推断(PPI)与主动统计推断

    • Angelopoulos et al. (2023, Science) 提出了PPI框架,将预训练模型的预测作为“代理变量”,结合少量标记样本和大量未标记样本,对总体均值进行推断。这是与本文最接近的文献之一。
    • Zrnic & Candès (2024, ICML) 将PPI扩展到主动学习设定,研究如何选择样本进行标记以优化对总体均值的推断。
    • 本文作者的定位:作者明确指出,PPI与个性化的两个关键区别是:(a) PPI目标是总体均值,而本文目标是回归函数(即个体预测);(b) PPI是半监督设定(少量标记+大量未标记),而本文是纯少样本设定(只有少量标记),且协变量分布可由用户指定。作者认为,PPI的采样规则是为推断均值设计的,而本文需要为个性化(估计回归函数)设计不同的采样规则。
  3. 当前前沿:LLM个性化与联邦学习

    • Kim & Yang (2024) 等大量工作从算法/实证角度研究LLM的少样本个性化(如prompt tuning、user-specific reward)。本文引用了这些工作,但指出它们缺乏形式化的统计分析和minimax最优性保证。这为本文的理论贡献留下了明确的空间。
  4. 本文的位置:本文声称是首批为少样本个性化提供严格minimax最优统计处理的工作之一。它填补了从“算法/实证”到“统计理论”的空白,并首次将“主动采样设计”与“非参数回归的minimax理论”结合到个性化问题中。

子线索聚类

  1. 迁移学习与领域泛化(Transfer Learning & Domain Generalization):这类方法假设可以访问源数据(individual-level data),并利用源数据来提升目标域性能。代表工作:Cai & Wei (2021), Li et al. (2022, JRSS-B), Tian & Feng (2023, JASA), Reeve et al. (2021, AoS), Peters et al. (2016, JRSS-B), Rojas-Carulla et al. (2018, JMLR), Fan et al. (2024, AoS), Li & Zhang (2025, JASA)。与本文的张力:本文强调,个性化中源数据不可访问,只能访问预训练模型本身,这是一个更受限但更现实的设定。

  2. 预测驱动推断(Prediction-Powered Inference, PPI):这类方法利用预训练模型作为代理变量,结合少量标记和大量未标记样本进行推断。代表工作:Angelopoulos et al. (2023, Science), Angelopoulos et al. (2023, arXiv), Zrnic & Candès (2024, ICML)。与本文的张力:本文指出,PPI的目标是总体均值而非回归函数,且其采样是随机的而非主动设计的。本文的采样规则是为个性化(估计函数)量身定制的。

  3. LLM个性化(LLM Personalization):这类工作从算法/实证角度研究如何将通用LLM适配到个人用户。代表工作:Kim & Yang (2024), Salehi et al. (2024, ACL), Shenfeld et al. (2025, arXiv)。与本文的张力:本文认为这些工作缺乏统计理论保证,而本文提供了minimax最优性。

这个方向在追问的核心问题

  1. 统计获益的量化:在少样本设定下,利用一个可能不完美的黑箱预训练模型,能带来多少统计上的提升(即收敛速率的改善)?本文的答案是:通过降低有效Hölder复杂度(\( \gamma_1(\theta) \) 变小或 \( \gamma_2(\theta) \) 变大),可以获得更快的收敛速率。
  2. 鲁棒性保证:当预训练模型完全不相关时,个性化方法能否保证不差于仅使用目标样本的经典方法?本文的答案是:通过将 \( \theta_1=0 \) 纳入候选集,自适应过程可以“关闭”预训练模型,实现“无伤害保证”(no-harm guarantee)。
  3. 最优采样策略:在给定采样预算 \( n \) 下,如何主动选择协变量点进行标记,以最小化最终预测器的MISE?本文的答案是:最优采样密度应与噪声标准差 \( \sigma(x) \) 成正比(\( p_X^*(x) \propto \sigma(x) \))。
  4. Minimax最优率:这个个性化问题的统计最优率是什么?本文的答案是:\( n^{-2\gamma_2/(2\gamma_2+d)} + \bar{\sigma}^2/n \),其中 \( \gamma \) 是偏差函数 \( \delta_{\theta,x}(\cdot) \) 的局部Hölder参数。

⚠️ 作者的 framing

  • 作者如何frame缺口:作者将缺口定位为“缺乏对少样本个性化问题的形式化统计分析和minimax最优性保证”。他们通过对比迁移学习(需要源数据)、PPI(目标不同、采样不同)和LLM个性化(缺乏理论),将自己塑造成“首个提供严格统计理论”的工作。
  • 被淡化或回避的竞争路线:
    • 直接微调(Fine-tuning):作者在引言中承认,即使对于开源模型,直接微调也可能计算上不可行。但本文的方法本质上是一种“预测后校正”,而非参数微调。作者没有深入讨论当预训练模型是参数化模型(如神经网络)时,参数微调与本文的非参数校正之间的统计-计算权衡。这是一个值得研究者去查的问题。
    • 贝叶斯方法:本文完全采用频率学派minimax框架。贝叶斯个性化方法(如高斯过程先验结合预训练模型)在少样本场景下也很自然,但未被讨论。
  • 什么明显该被引/该存在、却没出现在intro里?
    • 关于主动学习(Active Learning)的统计理论:本文的采样方案本质上是一种主动学习策略。虽然引用了Zrnic & Candès (2024),但更广泛的主动学习文献(如查询合成、不确定性采样)的统计理论未被提及。例如,关于主动学习在非参数回归中minimax最优性的经典工作(如Castro et al., 2005; Wang et al., 2018)未被引用。这是一个值得研究者去查的潜在缺口:本文的采样策略与经典主动学习理论有何异同?
    • 关于“黑箱”模型的统计学习理论:本文假设 \( f^{(ptr)} \) 是黑箱,但并未利用其任何结构(如它是某个神经网络的输出)。近年来关于“预测不确定性量化”和“模型集成”的文献(如Deep Ensembles, Conformal Prediction)也未在intro中讨论。这些方法也能处理黑箱模型,但目标不同。

张力

未见明显对立引用。所有被引工作都在各自的设定下成立,本文通过改变设定(黑箱、少样本、主动采样)来创造自己的贡献空间。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号:

    • \( y \in \mathbb{R} \):响应变量。
    • \( x \in \mathcal{X} \subseteq \mathbb{R}^d \):协变量,定义域 \( \mathcal{X} = [0,1]^d \)。
    • \( f^*(x) \):目标回归函数,是我们要估计的未知函数。
    • \( f^{(ptr)}(x) \):预训练模型,一个已知的、黑箱的、从外部数据学习到的函数。它可以是任意函数,不一定与 \( f^* \) 相关。
    • \( \epsilon \):噪声,满足 \( \mathbb{E}[\epsilon | x] = 0 \),方差 \( \text{Var}(\epsilon | x) = \sigma^2(x) \)(允许异方差)。
    • \( n \):采样预算,即我们可以从目标分布中获取的标记样本总数。\( n \) 很小(少样本)。
    • \( \theta = (\theta_1, \theta_2)^\top \):平滑参数。\( \theta_1 \) 是Hölder常数(控制函数值的最大变化幅度),\( \theta_2 \) 是Hölder指数(控制光滑度,\( 0 < \theta_2 \leq 1 \))。
    • \( \delta(x) = f^*(x) - f^{(ptr)}(x) \):偏差函数,即预训练模型与真实函数之间的差距。
    • \( \delta_{\theta, x}(\cdot) = f^*(\cdot) - \omega_{\theta, x} \circ f^{(ptr)}(\cdot) \):局部平滑后的偏差函数。\( \omega_{\theta, x} \) 是一个局部平滑算子。
    • \( \gamma(\theta) = (\gamma_1(\theta), \gamma_2(\theta)) \):有效Hölder参数,描述 \( \delta_{\theta, x}(\cdot) \) 在点 \( x \) 附近的局部光滑度。
    • \( h \):核估计的带宽。
    • \( \bar{\sigma} = \frac{1}{|\mathcal{X}|} \int_{\mathcal{X}} \sigma(x) dx \):平均噪声水平。
    • MISE(\( \hat{f} \)) = \( \mathbb{E} \left[ \int_{\mathcal{X}} \{ \hat{f}(x) - f^*(x) \}^2 dx \right] \):均方积分误差,本文的风险度量。
  • 模型:

    • 数据生成机制:\( y = f^*(x) + \epsilon \),其中 \( \mathbb{E}[\epsilon | x] = 0 \)。
    • 假设:\( f^* \) 属于Hölder类 \( H(\theta^*) \),即 \( |f^*(x_1) - f^*(x_2)| \leq \theta_1^* \|x_1 - x_2\|_2^{\theta_2^*} \)。
    • 噪声 \( \epsilon \) 是次高斯的,方差函数 \( \sigma^2(x) \) 也是光滑的(属于某个Hölder类)。
    • 已知量:预训练模型 \( f^{(ptr)} \)(可以查询其输出,但不能访问其内部参数或训练数据)。
    • 待估量:目标回归函数 \( f^* \)。
  • 可观测数据:

    • 研究者可以主动设计采样方案。他们首先决定在哪些协变量点 \( x_i \) 上获取标签。
    • 对于每个选定的 \( x_i \),他们从目标分布中观测到对应的响应 \( y_i \)。
    • 因此,可观测数据是 \( \{(x_i, y_i)\}_{i=1}^n \),其中 \( x_i \) 是主动选择的,\( y_i \) 是被动观测的。
    • 不可观测:\( f^* \) 本身,以及噪声 \( \epsilon_i \)。预训练模型 \( f^{(ptr)} \) 的内部机制也是不可观测的(黑箱)。

第二步:讲最小内核

本文的核心思路可以浓缩为以下最简特例:

最简特例:假设 \( d=1 \),\( \mathcal{X} = [0,1] \),噪声是同方差的(\( \sigma^2(x) = \sigma^2 \) 为常数),且预训练模型 \( f^{(ptr)} \) 是一个常数函数,即 \( f^{(ptr)}(x) = c \) 对所有 \( x \in [0,1] \) 成立。这个常数 \( c \) 可能接近 \( f^* \) 的均值,也可能完全不相关。

在这个特例下,本文要解决的问题是:给定 \( n \) 个可以主动选择位置的样本 \( (x_i, y_i) \),如何估计 \( f^* \)?

核心思路: 1. 偏差函数:\( \delta(x) = f^*(x) - c \)。估计 \( f^* \) 等价于估计 \( \delta(x) \)。 2. 局部平滑:由于 \( f^{(ptr)} \) 是常数,\( \omega_{\theta, x} \circ f^{(ptr)} \) 会将其“拉平”到点 \( x \) 附近的一个常数。实际上,如果 \( f^{(ptr)} \) 本身是常数,那么 \( \omega_{\theta, x} \circ f^{(ptr)} = f^{(ptr)} = c \)。所以这一步在这个特例下是平凡的。 3. 偏差估计:我们使用一个简单的核估计来估计 \( \delta(x) \):

\[\hat{\delta}_h(x) = \frac{\sum_{i=1}^n (y_i - c) \cdot \mathbb{I}(|x_i - x| \leq h)}{1 \vee \sum_{i=1}^n \mathbb{I}(|x_i - x| \leq h)}\]
这本质上就是用局部平均来估计 \( f^*(x) - c \)。 4. 最终估计:\( \hat{f}^{(fsp)}(x) = c + \hat{\delta}_h(x) \)。

这个特例揭示了什么? * 经典非参数回归:如果 \( c=0 \),那么 \( \hat{f}^{(fsp)} \) 就是标准的Nadaraya-Watson核估计,其MISE率为 \( n^{-2\theta_2^*/(2\theta_2^*+1)} \)。 * 个性化带来的提升:如果 \( c \) 非常接近 \( f^* \) 的均值,那么 \( \delta(x) \) 的“有效”Hölder常数 \( \gamma_1 \) 会远小于 \( \theta_1^* \)。例如,如果 \( f^*(x) = \sin(x) \),而 \( c=0 \),那么 \( \delta(x) = \sin(x) \),其Hölder常数约为1。但如果 \( c \) 恰好是 \( \sin(x) \) 在 \( [0,1] \) 上的平均值(约0.46),那么 \( \delta(x) \) 的波动幅度(即 \( \gamma_1 \))会小得多。根据本文的定理,当 \( \gamma_1 \) 很小时,MISE率可以接近 \( n^{-1} \)(参数速率),这比经典的非参数速率快得多。 * “无伤害”保证:如果 \( c \) 完全不相关(例如 \( c=100 \)),那么 \( \delta(x) \) 的Hölder常数 \( \gamma_1 \) 会很大。此时,通过自适应选择 \( \theta_1=0 \)(即完全忽略预训练模型),本文的方法可以退化为经典核估计,从而保证性能不差于基线。

这个特例的推广:本文的一般设定允许 \( f^{(ptr)} \) 是任意函数,而不仅仅是常数。此时,\( \omega_{\theta, x} \circ f^{(ptr)} \) 的作用就是将 \( f^{(ptr)} \) 在点 \( x \) 附近“修剪”成一个局部Hölder函数,使得偏差函数 \( \delta_{\theta, x} \) 具有更好的局部光滑性(更小的 \( \gamma_1 \) 或更大的 \( \gamma_2 \))。这相当于在利用预训练模型信息的同时,通过局部平滑来防止其不规则性对估计造成破坏。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在非参数回归的少样本个性化设定下,如何利用一个黑箱预训练模型 \( f^{(ptr)} \) 和 \( n \) 个主动采样的目标样本,构造一个对目标回归函数 \( f^* \) 的minimax最优估计量。
  2. 核心工具/方法:提出一个三步算法:(a) 基于估计的噪声方差进行自适应采样(\( \hat{p}_X(x) \propto \hat{\sigma}(x) \));(b) 对预训练模型进行局部平滑(\( \theta \)-local-smoothing),然后估计平滑后的偏差函数 \( \delta_{\theta, x} \);(c) 通过交叉验证自适应地选择平滑参数 \( \theta \)。
  3. 主要结论:证明了该估计量的MISE上界为 \( O(\gamma_1^2 h^{2\gamma_2} + \bar{\sigma}^2/(n h^d)) \),通过优化带宽得到率 \( O(n^{-2\gamma_2/(2\gamma_2+d)} + \bar{\sigma}^2/n) \)。同时,建立了该问题的minimax下界,证明该率是最优的。该方法具有“无伤害保证”:当预训练模型无信息时,其性能不差于仅使用目标样本的经典非参数估计。

关键设定与假设

  • Hölder类(定义1):\( f \in H(\theta) \) 意味着 \( |f(x_1) - f(x_2)| \leq \theta_1 \|x_1 - x_2\|_2^{\theta_2} \)。关键创新:本文允许 \( \theta_1 \) 随 \( n \) 趋于0,这不同于经典理论中假设 \( \theta_1 \) 为固定常数。这使得本文能够刻画个性化带来的“有效光滑度”提升。
  • 局部光滑性(定义2):\( f \in L_x(\theta) \) 意味着上述不等式仅在点 \( x \) 处成立(而非全局)。这是一个比全局Hölder更弱的条件,用于描述局部平滑后的偏差函数。
  • 条件1(全局光滑性):\( f^* \in H(\theta^*) \)。标准假设。
  • 条件2(次高斯噪声):噪声是次高斯的,方差函数 \( \sigma^2(x) \) 是光滑的。允许异方差,这是本文设计自适应采样策略的动机。
  • 条件3(密度比条件,用于扩展4.2):假设最优采样密度 \( p_X^* \) 与未标记数据分布 \( q_X \) 的比值是指数族形式(\( p_X^*/q_X = \exp\{x^\top \beta\} \))。这是一个较强的参数化假设,用于在只有未标记数据时进行重要性采样。

主要结果

  • 定理1(MISE上界):对于固定的 \( \theta \),在提出的自适应采样方案下,估计量 \( \hat{f}_\theta^{(fsp)} \) 的MISE满足:

    \[\text{MISE}(\hat{f}_\theta^{(fsp)}) \lesssim \gamma_1^2(\theta) h^{2\gamma_2(\theta)} + \frac{\bar{\sigma}^2}{n h^d}.\]

    • 直觉:第一项是偏差(由局部光滑度 \( \gamma \) 和带宽 \( h \) 决定),第二项是方差(由平均噪声水平和局部样本量决定)。自适应采样使得方差项中的噪声水平从 \( \sigma^2(x) \) 降低为平均噪声 \( \bar{\sigma}^2 \)。
    • 必要条件:\( |\mathcal{X}_1| \) 足够小,以确保每个局部邻域有足够样本。\( h = n^{-c_0} \) 是多项式衰减的。
    • 解决的技术难点:证明了自适应采样方案(算法1)的方差项与最优采样方案(\( p_X^* \))的方差项同阶(引理2)。
  • 定理2(自适应后的MISE):通过交叉验证选择的 \( \hat{\theta} \) 能够达到最优 \( \theta \) 的MISE,代价是一个可忽略的 \( O((\log n)^2 / n) \) 项。

    • 直觉:交叉验证有效地在候选集 \( \Theta \) 中搜索,找到了使验证误差最小的 \( \theta \)。由于 \( |\Theta| = O((\log n)^2) \),搜索代价很小。
    • 必要条件:候选集 \( \Theta \) 是离散的且覆盖了参数空间。
  • 定理3(Minimax下界):在函数空间 \( \mathcal{F}_\theta(\theta^*, \gamma, \sigma_0) \) 上,任何基于 \( n \) 个样本和预训练模型的估计量 \( \hat{f} \),其MISE满足:

    \[\inf_{\hat{f}} \sup_{f^* \in \mathcal{F}_\theta} \text{MISE}(\hat{f}) \geq C \left( \gamma_1^{\frac{2d}{2\gamma_2+d}} \sigma_0^{\frac{4\gamma_2}{2\gamma_2+d}} n^{-\frac{2\gamma_2}{2\gamma_2+d}} + \frac{\sigma_0^2}{n} \right).\]

    • 直觉:下界由两部分组成:一个非参数率(与 \( \gamma_2 \) 相关)和一个参数率(与 \( \sigma_0^2/n \) 相关)。当 \( \gamma_1 \) 很小时,参数率占主导,表明个性化可以突破经典非参数率的限制。
    • 必要条件:\( \theta_1 \leq C_1 \theta_1^* \) 且 \( \theta_2 \geq \theta_2^* \),确保局部平滑后的偏差函数不比原始函数更粗糙。
    • 解决的技术难点:构造了一个难以区分的函数对,使得任何估计量都必须付出至少下界所示的代价。下界中的 \( \inf_{p_X} \) 表明,即使允许最优采样,也无法超越这个率。

证明路线与技术技巧

  • 整体路线:

    1. MISE分解:将MISE分解为偏差平方和方差。
    2. 偏差上界:利用局部光滑性 \( \delta_{\theta, x} \in L_x(\gamma) \),证明核估计的偏差为 \( O(\gamma_1 h^{\gamma_2}) \)。
    3. 方差上界:将方差项写为 \( \int_{\mathcal{X}} \frac{\sigma^2(x)}{n_h(x)} dx \) 的形式。然后证明,在自适应采样方案下,\( n_h(x) \approx n h^d \hat{p}_X(x) \),且 \( \int \frac{\sigma^2(x)}{\hat{p}_X(x)} dx \approx \bar{\sigma}^2 \)。
    4. 引理2(自适应采样最优性):这是方差分析的核心。它证明,即使使用估计的 \( \hat{\sigma}(x) \) 进行采样,方差项仍然被 \( \bar{\sigma}^2/(n h^d) \) 控制。证明中需要处理 \( \hat{\sigma}(x) \) 的估计误差,并利用条件 \( |\mathcal{X}_1| \) 来控制估计误差较大的区域。
    5. 定理2(自适应):使用标准交叉验证论证,证明 \( \hat{\theta} \) 选择的模型在MISE上接近最优。关键在于验证集误差是MISE的无偏估计,且其方差可控。
    6. 定理3(下界):使用标准的假设检验方法(Le Cam's lemma或Fano's inequality)。构造两个难以区分的函数 \( f_1^* \) 和 \( f_2^* \),它们都满足函数空间 \( \mathcal{F}_\theta \) 的条件,但相差很大。下界中的参数率 \( \sigma_0^2/n \) 来自估计一个常数,非参数率来自估计一个非参数函数。
  • 关键跳跃点:

    • 从“固定采样”到“自适应采样”的方差分析:在经典非参数回归中,方差项是 \( \int \sigma^2(x)/(n h^d p_X(x)) dx \)。当 \( p_X \) 是均匀分布时,这简化为 \( \bar{\sigma}^2/(n h^d) \)。本文的关键跳跃在于证明,当 \( p_X \) 是自适应的(\( \propto \sigma(x) \))时,方差项仍然是 \( \bar{\sigma}^2/(n h^d) \),但这里的 \( \bar{\sigma} \) 是平均噪声,而不是最大噪声。这带来了潜在的速率提升。
    • 局部平滑算子的设计:\( \omega_{\theta, x} \) 的设计是本文的一个技术亮点。它允许在点 \( x \) 附近“修剪”预训练模型,使其局部行为可控,同时保证在点 \( x \) 处 \( \omega_{\theta, x} \circ f^{(ptr)}(x) = f^{(ptr)}(x) \)。这使得偏差校正成为可能,而无需假设 \( f^{(ptr)} \) 本身是光滑的。
  • 技术技巧点名:

    • 局部平滑算子(\( \theta \)-local-smoothing):用于将任意函数转化为局部Hölder函数,是处理黑箱模型不规则性的核心技巧。
    • 核估计:用于估计偏差函数 \( \delta_{\theta, x} \)。
    • 自适应采样/重要性采样:通过估计噪声方差来指导样本采集,以最小化方差。
    • 交叉验证:用于自适应选择平滑参数 \( \theta \),实现“无伤害保证”。
    • Minimax下界构造:使用标准的假设检验论证,但需要精心构造函数空间 \( \mathcal{F}_\theta \) 以同时包含参数和非参数成分。

真实例子与应用

  • 数据:加州房价数据集(California Housing dataset),包含20640个街区组(census block group)的记录。目标变量是街区组的房价中位数。特征包括经度、纬度、房龄、人口、收入等。
  • 场景:目标域是“近湾区域”(near bay region),有2290个样本。研究者将其中1000个留作测试集,其余1290个视为“未标记”数据。采样预算 \( n=500 \)。
  • 方法应用:
    1. 使用算法4(基于未标记数据的采样),从1290个未标记样本中主动选择500个进行标记。
    2. 使用三种不同的预训练模型:
      • DeepSeek-V3.2:通过提示工程让AI模型给出一个预测房价的公式。
      • 随机森林(RF):使用湾区外数据(18350个样本)训练。
      • LightGBM:同样使用湾区外数据训练。
    3. 对每个预训练模型,应用本文的个性化方法(FSP)得到个性化估计量。
  • 结果(图4):
    • 所有三个预训练模型(DeepSeek, RF, LightGBM)的预测误差都大于仅使用目标样本的经典非参数方法(ST)。这表明预训练模型与目标域存在分布偏移,且DeepSeek的公式完全不准确。
    • 经过本文的个性化方法(fsp.DeepSeek, fsp.RF, fsp.lightGBM)后,所有三个模型的预测误差都显著降低,并且低于经典非参数方法(ST)。
  • 这个例子想说明什么:
    • 验证理论:展示了即使预训练模型本身很差(如DeepSeek),个性化方法也能通过少量目标样本进行有效校正,实现“无伤害”甚至“有增益”的效果。
    • 展示相对优势:个性化方法(FSP)优于仅使用目标样本的基线方法(ST),也优于直接使用预训练模型(PTR)。这证明了整合外部知识(即使是有偏的)的价值。
    • 实际可行性:在真实数据上验证了算法的有效性,并展示了其处理不同来源(AI模型、统计模型、树模型)的黑箱预训练模型的能力。

🔎 结论是否比证明窄

  • 定理3的下界是在函数空间 \( \mathcal{F}_\theta(\theta^*, \gamma, \sigma_0) \) 上建立的。这个空间的定义依赖于一个固定的、已知的 \( \theta \)(局部平滑参数)。然而,在实际应用中,\( \theta \) 是通过数据自适应选择的(定理2)。下界并没有直接证明对于自适应选择的 \( \hat{\theta} \),minimax率仍然成立。定理2只证明了 \( \hat{\theta} \) 能达到最优固定 \( \theta \) 的MISE,但最优固定 \( \theta \) 本身可能依赖于 \( n \) 和未知的 \( f^* \)。因此,严格来说,定理3的下界是针对“先知”设定(知道最优 \( \theta \))的,而定理1和2的上界是针对自适应 \( \hat{\theta} \) 的。作者在定理2的陈述中使用了“oracle risk over \( \Theta \)”,这暗示了这一点。这是一个值得注意的细微差别。
  • “无伤害保证” 在定理2中是通过将 \( \theta_1=0 \) 纳入候选集 \( \Theta \) 来实现的。当 \( \theta_1=0 \) 时,\( \hat{f}_\theta^{(fsp)} \) 退化为仅使用目标样本的核估计。因此,定理2保证了 \( \hat{f}_{\hat{\theta}}^{(fsp)} \) 的MISE不超过该核估计的MISE加上一个可忽略项。这是一个严格的证明,结论与证明一致。

四、开放问题

  1. 扩展到其他模型:作者在讨论中明确提到,“研究参数模型(如高维线性模型和广义线性模型)的个性化是一个有趣的问题”。(扎根于Section 7, Discussion)。这需要将本文的非参数框架适配到高维或参数化设定,并重新建立minimax最优性。
  2. 更复杂的平滑度:本文的Hölder类限制在 \( \theta_2 \leq 1 \)。扩展到更高阶的光滑度(如 \( \theta_2 > 1 \))或更一般的函数类(如Sobolev类、Besov类)是一个自然的方向。(扎根于Definition 1)。这可能需要更复杂的局部平滑算子(如局部多项式)。
  3. 主动学习与个性化:本文的采样策略是“先估计方差,再按方差采样”。一个更激进的主动学习策略是“迭代式”的:根据当前估计的不确定性,逐步选择下一个最有信息量的点进行标记。这种迭代策略的统计最优性尚未被研究。(扎根于Algorithm 1的“一次性”设计,以及与Zrnic & Candès (2024) 的对比)。
  4. 预训练模型的结构化利用:本文完全将预训练模型视为黑箱。如果预训练模型是某个已知架构的神经网络(如ResNet),能否利用其内部表示(如中间层特征)来获得更好的个性化效果?这需要将本文的非参数框架与表示学习理论结合。(扎根于“black-box”这一核心假设,以及引言中提到的“computationally prohibitive” fine-tuning)。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论