跳转至

Combining pre-trained models via localized model averaging

讲者: Ziwen Gao
会场: Model Averaging and Related Spheres (MARS)
报告题目: Combining Pre-Trained Large Models Based on Localized Model Averaging
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是模型平均(Model Averaging),特别是频率学派模型平均。其根本的统计问题是:给定一组候选模型(或预测程序),如何通过加权组合得到一个比任何单个模型都更稳健、更准确的预测器。该方向的核心挑战在于权重选择——既要避免过拟合,又要实现某种最优性(如渐近等价于不可知的最佳组合)。当前,该方向已从全局常数权重(GlobalMA)发展到局部化、输入依赖的权重(LocalMA),本文即属于后者。

发展脉络

奠基工作:模型平均的思想可追溯到Bates and Granger (1969)的预测组合,以及贝叶斯模型平均(Clyde et al., 1996; Hoeting et al., 1999)。这些工作奠定了“组合优于选择”的基本直觉。

主要进展(全局权重):频率学派模型平均在2000年代后蓬勃发展,主要分为三条技术路线: 1. 自适应加权:Yang (2001) 和 Yuan and Yang (2005) 证明了通过混合策略可以实现对候选模型集合的自适应,即风险与最优模型的风险之比趋于1。 2. 极小极大最优聚合:Juditsky and Nemirovski (2000)、Yang (2000a,b)、Tsybakov (2003) 等建立了聚合(aggregation)的极小极大最优率,回答了“组合多个估计器能达到多好”的问题。 3. 渐近最优性:Hansen (2007) 提出了Mallows模型平均(MMA),通过最小化Mallows Cp准则选择权重,并证明了其渐近最优性(in-sample风险等价于不可知的最佳组合)。后续工作(Wan et al., 2010; Zhang et al., 2020; Peng and Yang, 2022)将这一理论推广到更一般的设定。

当前frontier与本文位置:现有理论主要针对全局常数权重,即权重不随输入X变化。然而,当候选模型在不同输入区域表现迥异时(如不同公司预训练的模型),全局权重无法捕捉这种异质性。本文提出的局部模型平均(LocalMA) 将权重建模为X的函数,并用神经网络估计,从而在保持渐近最优性的同时,大幅提升灵活性。作者明确指出:“Most existing model averaging methods are essentially global in nature, i.e., the weights are independent of the covariates X”(引言第2段)。本文填补了“局部化权重+渐近最优性”这一理论空白。

子线索聚类

被引文献大致落在以下3条子线索上:

  • 线索1:全局模型平均的理论与方法(核心文献:Hansen, 2007; Wan et al., 2010; Zhang et al., 2020; Peng and Yang, 2022; Peng, Li and Yang, 2025)。这一簇专注于常数权重的渐近最优性(in-sample风险),通常基于Mallows Cp或交叉验证准则。其瓶颈在于:当候选模型在不同区域表现不同时,常数权重无法达到最优。
  • 线索2:局部化模型选择与加权(核心文献:Pan et al., 2006; Yang, 2008)。这一簇提出了输入依赖的权重或选择方法,但缺乏渐近最优性的理论保证。Pan et al. (2006) 的权重是“模型做出正确预测的概率”,Yang (2008) 则专注于局部模型选择(而非平均)。本文是第一个在局部权重设定下建立渐近最优性的工作。
  • 线索3:混合专家模型(MoE)(核心文献:Jacobs et al., 1991; Shazeer et al., 2017; Fedus et al., 2022; Dai et al., 2024)。MoE与本文方法类似,但有两个关键区别:(a) MoE中专家和门控网络的参数联合估计,而本文仅估计权重函数的参数(PTM固定);(b) 大多数MoE的门控网络是线性变换+softmax,而本文使用神经网络,更灵活。作者明确区分了这两点(引言第4段)。

这个方向在追问的核心问题

  1. 渐近最优性能否推广到局部权重? 全局权重的渐近最优性已有成熟理论,但局部权重的灵活性是否会导致过拟合或无法实现最优?本文回答了“是”。
  2. out-of-sample风险的渐近最优性如何建立? 大多数现有工作(Wan et al., 2010; Xie, 2015; Fang et al., 2019; Peng et al., 2025)只关注in-sample风险。作者指出“the asymptotic optimality of out-of-sample loss/risk has received much less attention”(引言第2段)。本文同时建立了in-sample和out-of-sample的最优性。
  3. 神经网络估计权重时,逼近误差如何控制? 本文的权重函数用神经网络近似,需要处理神经网络逼近Hölder类的误差,这是理论分析的新难点。

⚠️ 作者的framing

作者将缺口frame为:“现有模型平均方法本质上是全局的,无法适应不同PTM在不同输入区域的相对优势”。因此,本文的“显然的下一步”是:将权重局部化,并用神经网络实现,同时证明其渐近最优性

被淡化或回避的竞争路线: - MoE:作者承认MoE与本文相似,但强调两个区别(联合估计 vs. 仅估计权重;线性门控 vs. 神经网络门控)。然而,MoE的联合估计可能带来更好的性能(因为专家参数也可调整),本文未讨论这种权衡。 - 贝叶斯模型平均(BMA):BMA也可通过先验实现某种“局部化”(如协变量依赖的先验),但作者未提及。 - 非参数核加权:另一种局部化思路是用核函数对X空间进行局部加权,但作者未将其作为竞争方法讨论。

什么明显该被引/该存在、却没出现在intro里? - 局部线性回归/核回归:这些经典的非参数方法本质上是“局部加权”,与本文的局部权重思想有深层联系,但未被引用。 - 随机森林/局部学习:随机森林通过树结构实现局部加权,也是一种输入依赖的权重,但未被讨论。 - 更近期的MoE理论工作:如关于MoE的泛化界或oracle不等式的工作(若有),本文未引用。

张力

未见明显对立引用。被引工作之间在“全局权重是否足够”上存在隐含张力:Hansen (2007) 等全局方法假设常数权重足够,而Pan et al. (2006) 和本文则主张局部化。但这不是直接矛盾,而是不同设定下的不同结论。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \( (X_i, Y_i) \in \mathcal{X} \times \mathcal{Y} \)\( i=1,\dots,n \):独立同分布的可观测数据。\( X_i \)\( p \) 维协变量,\( Y_i \) 是响应。 - \( f_0(x) = \mathbb{E}[Y \mid X=x] \):真实的回归函数(目标)。 - \( \hat{f}_1, \dots, \hat{f}_M \)\( M \) 个预训练模型(PTM)给出的估计。它们被视为固定函数(不依赖于当前数据 \( D \))。 - \( w_m(X) \):第 \( m \) 个PTM在输入 \( X \) 处的权重,满足 \( \sum_{m=1}^M w_m(X) = 1 \)\( w_m(X) \ge 0 \)。 - \( \hat{f}_{w_X}(X) = \sum_{m=1}^M w_m(X) \hat{f}_m(X) \):局部模型平均预测。 - \( \ell(y, \hat{y}) \):损失函数(如平方损失、交叉熵)。 - \( \mathcal{W}_X = \{ w_X = \text{softmax}(g(X)) : g \in \mathcal{G} \} \):权重函数空间,其中 \( g: \mathbb{R}^p \to \mathbb{R}^M \) 属于某个函数类 \( \mathcal{G} \)(本文假设为Hölder类)。 - \( a_N \):一个趋于无穷的序列,用于刻画PTM的收敛速度(见Condition 1)。 - \( f_m^*(X) \)\( \hat{f}_m(X) \) 的极限值(伪真值,pseudo-true value)。 - \( \kappa = \alpha + \nu \):Hölder光滑度参数(\( \alpha \) 为整数部分,\( \nu \in (0,1] \) 为Hölder指数)。 - \( D \):神经网络隐藏层数;\( S \):神经网络总参数数;\( W \):最大宽度。

模型: - 数据生成机制:\( Y_i = f_0(X_i) + \varepsilon_i \),其中 \( \varepsilon_i \) 是均值为0的噪声(分布可任意,只要满足次Weibull条件)。 - PTM \( \hat{f}_m \) 是预先训练好的,视为固定函数。它们可能来自不同公司、不同数据集,因此对 \( f_0 \) 的逼近质量在不同 \( X \) 区域不同。 - 权重函数 \( w_X \) 通过神经网络参数化:\( w_X = \text{softmax}( \tilde{g}(X) ) \),其中 \( \tilde{g} \) 是神经网络的输出(最后一层softmax之前)。神经网络的参数 \( \{A_l, b_l\} \) 是待估对象。

可观测数据: - 研究者能观测到:\( n \) 个独立同分布样本 \( \{(X_i, Y_i)\}_{i=1}^n \)。 - 研究者还能获得:\( M \) 个PTM在任意 \( X \) 处的预测值 \( \hat{f}_m(X) \)。这些PTM是预先给定的,不依赖于当前数据。 - 研究者不能直接观测到:真实的回归函数 \( f_0 \)、最优权重函数 \( w_X^* \)、以及PTM的极限 \( f_m^* \)。这些只能通过假设和估计来逼近。

第二步:最小内核

最简特例:考虑一维协变量 \( p=1 \)\( M=2 \) 个PTM,且它们都是线性函数: - \( \hat{f}_1(x) = a_1 + b_1 x \)\( \hat{f}_2(x) = a_2 + b_2 x \)。 - 真实回归函数 \( f_0(x) \) 是某个非线性函数(例如 \( f_0(x) = x^3 \)),使得两个线性PTM在不同 \( x \) 区域各有优势。 - 损失函数为平方损失:\( \ell(y, \hat{y}) = (y - \hat{y})^2 \)

在这个特例下,本文的核心思路是什么?

  1. 全局模型平均(GlobalMA):权重 \( w_1, w_2 \) 是常数,预测为 \( \hat{f}_w(x) = w_1 \hat{f}_1(x) + w_2 \hat{f}_2(x) \)。由于两个线性模型都无法完美拟合 \( f_0 \),常数权重只能得到一个“折中”的线性预测,其风险(MSE)不会随 \( n \) 增大而趋于0(因为偏差无法消除)。

  2. 局部模型平均(LocalMA):权重是 \( x \) 的函数,例如 \( w_1(x) = \frac{e^{g(x)}}{1+e^{g(x)}} \)\( w_2(x) = 1 - w_1(x) \),其中 \( g(x) \) 是一个神经网络。通过最小化经验损失 \( \frac{1}{n} \sum_{i=1}^n (Y_i - w_1(X_i) \hat{f}_1(X_i) - w_2(X_i) \hat{f}_2(X_i))^2 \),我们可以学到:

  3. \( x \) 使得 \( \hat{f}_1(x) \) 更接近 \( f_0(x) \) 的区域,\( w_1(x) \approx 1 \)
  4. \( x \) 使得 \( \hat{f}_2(x) \) 更接近 \( f_0(x) \) 的区域,\( w_2(x) \approx 1 \)
  5. 这样,局部加权后的预测 \( \hat{f}_{w_X}(x) \) 可以逼近 \( f_0(x) \),其风险可以随 \( n \) 增大而趋于0(因为权重函数可以逼近任意光滑函数,从而“选择”每个 \( x \) 处的最佳PTM)。

这个特例揭示了本文的核心数学困难:如何证明,当权重函数 \( w_X \) 由神经网络参数化时,最小化经验损失得到的 \( \hat{w}_X \) 能够实现渐近最优性(即其风险与不可知的最佳局部权重 \( w_X^* \) 的风险之比趋于1)?这需要同时控制: - 估计误差:神经网络参数估计的方差; - 逼近误差:神经网络对最优权重函数 \( w_X^* \) 的逼近能力(假设 \( w_X^* \) 属于Hölder类); - PTM的误差\( \hat{f}_m \)\( f_m^* \) 之间的差距。

本文的定理1-3正是在这些误差之间取得平衡,给出了神经网络深度、宽度、样本量 \( n \)、协变量维数 \( p \)、PTM收敛速度 \( a_N \) 之间的条件。


三、这篇论文做了什么

三句话

  1. 研究问题:给定多个预训练模型(PTM),如何通过输入依赖的局部权重(而非全局常数权重)将它们组合,以实现最优预测,并证明这种组合的渐近最优性。
  2. 核心方法:将权重建模为协变量 \( X \) 的神经网络函数(softmax输出),通过最小化一般损失函数(如平方损失、交叉熵)的经验风险来估计权重参数。
  3. 主要结论:在Hölder光滑性、次Weibull损失等条件下,证明了LocalMA的in-sample风险和out-of-sample风险均渐近等价于不可知的最佳局部加权组合,且估计的权重函数一致收敛到最优权重集。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 设定\( n \) 个i.i.d.观测 \( \{(X_i, Y_i)\} \)\( M \) 个固定PTM \( \hat{f}_1, \dots, \hat{f}_M \)。权重函数 \( w_X = \text{softmax}(g(X)) \),其中 \( g \) 由神经网络参数化:\( g(X) = A_D \sigma_{D-1}(\cdots \sigma_1(A_1 X + b_1) \cdots) + b_D \),激活函数为ReLU(隐藏层)和softmax(输出层)。参数通过最小化经验损失 \( L_n(w_X, \hat{f}) = \frac{1}{n} \sum_{i=1}^n \ell(Y_i, \sum_{m=1}^M w_m(X_i) \hat{f}_m(X_i)) \) 估计。

  • 关键假设

  • Condition 1(PTM收敛性):存在序列 \( a_N \to \infty \) 和常数 \( c \),使得 \( \max_i \mathbb{E}^{1/4}[ |a_N(\hat{f}_m(X_i) - f_m^*(X_i))|^4 ] \le c \)。这给出了PTM的收敛速度上界(\( a_N \) 越大,收敛越快)。\( f_m^* \) 是伪真值,即 \( \hat{f}_m \) 在某种极限下的目标。
  • Condition 2(损失函数的尾部行为)\( \ell(Y, f_{w_X}^*(X)) \mid X \)\( \ell(Y, \hat{f}_{w_X}(X)) \mid \hat{f} \) 是次Weibull随机变量(参数 \( (B_\ell, \gamma) \)\( (\tilde{B}_\ell, \tilde{\gamma}) \))。这允许损失函数无界,但控制其尾部概率。\( \gamma=1/2 \) 对应次高斯,\( \gamma=1 \) 对应次指数。
  • Condition 3(损失函数的Lipschitz连续性):存在随机变量 \( H(V_i) \) 使得 \( |\ell(Y_i, f_i) - \ell(Y_i, f_i')| \le H(V_i) |f_i - f_i'| \),且 \( \max_i \mathbb{E}^{1/4} |H(V_i)|^4 \le c_1 \)。这控制了损失函数对预测值变化的敏感度。
  • Condition 4(权重函数的Hölder光滑性)\( g \) 的每个分量属于Hölder类 \( \mathcal{H}^\kappa(\mathcal{X}, c_0) \),其中 \( \kappa = \alpha + \nu > 0 \)。这是神经网络逼近理论的标准假设。
  • Condition 5(维数与网络大小的条件):涉及 \( M, p, n, a_N, \xi_n \)(in-sample风险的下界)之间的复杂关系。核心是:\( M \) 不能太大(相对于 \( n \)\( \xi_n \)),\( p \) 不能太大(否则神经网络逼近误差项 \( n^{-\kappa/((2\gamma+2)p)} \) 会主导),神经网络深度 \( D \) 和参数数 \( S \) 需要适当增长。
  • Condition 6(out-of-sample版本):类似于Condition 5,但用out-of-sample风险的下界 \( \xi^* \) 代替 \( \xi_n \)

相比已有文献的放宽/强化: - 放宽:权重从常数变为函数,灵活性大幅提升。 - 强化:需要Hölder光滑性假设(Condition 4)和更复杂的维数条件(Condition 5/6),这是局部化带来的代价。 - 与MoE的区别:本文不联合估计专家参数,因此理论分析更简单(只需处理权重估计误差,无需处理专家参数估计与权重估计的交互)。

主要结果

定理1(In-sample渐近最优性)

\[\frac{R_{\text{in}}^0(\hat{w}_X, f^*)}{\inf_{w_X \in \mathcal{W}_X} R_{\text{in}}^0(w_X, f^*)} \xrightarrow{p} 1, \quad n \to \infty.\]
- 直觉:LocalMA的in-sample风险(定义为 \( n^{-1} \sum_{i=1}^n \mathbb{E}_{Y|X}[\ell\{Y_i, \hat{f}_{\hat{w}_{X_i}}(X_i)\}] - \delta_{n,\ell} \))渐近等价于不可知的最佳局部加权组合的风险。 - 必要条件:Condition 1-5成立,且神经网络深度 \( D \asymp n^{1/(4\gamma+4)} \lceil \log_2(8 n^{1/(4\gamma+4)}) \rceil \),宽度 \( W \asymp p^{\lfloor \kappa \rfloor + 1} \)。 - 解决的技术难点:需要同时控制神经网络逼近误差(Hölder类逼近率)和估计误差(经验风险最小化的泛化界)。作者通过次Weibull浓度不等式和神经网络逼近理论实现了这一点。

定理2(Out-of-sample渐近最优性)

\[\frac{R_{\text{out}}^0(\hat{w}_{X^*})}{\inf_{w_{X^*} \in \mathcal{W}_{X^*}} R_{\text{out}}^0(w_{X^*})} \xrightarrow{p} 1, \quad n \to \infty.\]
- 直觉:对于新观测 \( (X^*, Y^*) \),LocalMA的预测风险也渐近最优。 - 额外条件:Condition 6(out-of-sample版本)和 \( \max_m \mathbb{E}_X [\hat{f}_m(X)]^4 = O_p(1) \)(PTM的四阶矩有界)。 - 意义:out-of-sample最优性比in-sample更难证明,因为需要处理新点 \( X^* \) 的随机性。本文是少数同时建立两者最优性的工作之一。

定理3(权重一致性)

\[d(\hat{w}_X, \mathcal{W}_X^*) \xrightarrow{p} 0, \quad n \to \infty,\]
其中 \( d(w_X, \mathcal{W}_X^*) = \inf_{w_X' \in \mathcal{W}_X^*} \mathbb{E}_X \| w_X - w_X' \|_2 \)\( \mathcal{W}_X^* \) 是最优权重集(使in-sample风险最小化的权重函数集合)。 - 直觉:估计的权重函数 \( \hat{w}_X \)\( L_2 \) 距离下收敛到最优权重集。 - 意义:这验证了局部权重确实能“学习”到不同区域的最佳PTM。

一个比较LocalMA与GlobalMA的示例(论文第11页): - 作者构造了一个例子,其中 \( \inf_{w_X \in \mathcal{W}_X} R_{\text{in}}^0(w_X, f^*) = O_p(n^{-1/10}) \)(随 \( n \) 趋于0),而 \( \inf_{w \in \mathcal{W}} R_{\text{in}}^0(w, f^*) = \Omega_p(1) \)(有界远离0)。这直观展示了局部权重的严格优势:当全局权重无法消除偏差时,局部权重可以通过“选择”每个区域的最佳PTM来使风险衰减。

证明路线与技术技巧

整体路线(以定理1为例): 1. 定义目标:证明 \( \frac{R_{\text{in}}^0(\hat{w}_X, f^*)}{\inf_{w_X \in \mathcal{W}_X} R_{\text{in}}^0(w_X, f^*)} \xrightarrow{p} 1 \)。等价于证明 \( R_{\text{in}}^0(\hat{w}_X, f^*) \le (1+o_p(1)) \inf_{w_X} R_{\text{in}}^0(w_X, f^*) \)。 2. 分解风险:将 \( R_{\text{in}}^0(\hat{w}_X, f^*) \) 分解为经验损失 \( L_n(\hat{w}_X, \hat{f}) \) 加上一个“偏差项”(由于用 \( \hat{f} \) 代替 \( f^* \) 以及用经验期望代替真实期望引起)。 3. 控制经验损失:由于 \( \hat{w}_X \) 最小化 \( L_n(w_X, \hat{f}) \),有 \( L_n(\hat{w}_X, \hat{f}) \le L_n(w_X^*, \hat{f}) \) 对任意 \( w_X^* \in \mathcal{W}_X \) 成立。然后利用次Weibull浓度不等式和Lipschitz条件,将 \( L_n(w_X^*, \hat{f}) \)\( R_{\text{in}}^0(w_X^*, f^*) \) 联系起来。 4. 控制逼近误差:由于 \( \mathcal{W}_X \) 是神经网络函数类,而最优权重可能不在该类中(但属于Hölder类),需要引入一个“近似最优”的 \( w_X^* \in \mathcal{W}_X \),使其风险与 \( \inf_{w_X \in \mathcal{W}_X} R_{\text{in}}^0(w_X, f^*) \) 足够接近。这依赖于神经网络的Hölder类逼近率(\( O(n^{-\kappa/((2\gamma+2)p)}) \))。 5. 合并:通过选择适当的神经网络深度和宽度(Condition 5),使得所有误差项(估计误差、逼近误差、PTM误差)相对于 \( \xi_n = \inf_{w_X} R_{\text{in}}^0(w_X, f^*) \) 都是 \( o_p(1) \),从而得到结论。

关键跳跃点: - 从经验损失到风险的跳跃:需要证明 \( L_n(w_X, \hat{f}) \)\( R_{\text{in}}^0(w_X, f^*) \) 之差在 \( \mathcal{W}_X \) 上一致地小。这需要处理两个困难:(a) \( \hat{f} \)\( f^* \) 的差异(通过Condition 1控制);(b) 经验期望与真实期望的差异(通过次Weibull浓度和神经网络复杂度控制)。 - 神经网络逼近Hölder类的误差:这是本文理论的新颖之处。作者需要引用神经网络逼近理论(如Chen et al., 2022; Jiao et al., 2023)来得到逼近率 \( O(n^{-\kappa/((2\gamma+2)p)}) \),并将其纳入Condition 5。

技术技巧点名: - 次Weibull随机变量及其浓度不等式:用于处理无界损失函数(Condition 2)。作者在补充材料中给出了平方损失和交叉熵损失满足次Weibull条件的验证。 - 神经网络逼近理论:用于控制Hölder类函数被ReLU神经网络逼近的误差(Condition 4)。具体引用Chen et al. (2022) 和 Jiao et al. (2023) 的结果。 - 经验过程/一致收敛:通过控制神经网络函数类的复杂度(如伪维数或覆盖数),得到经验损失到风险的均匀收敛速度。这体现在Condition 5中的 \( \{MSD\log(S)\log(n)\}^{\gamma+1/2} n^{-1/2} \tilde{\xi}_n^{-1} = o_p(1) \) 项。 - 伪真值(pseudo-true value):引入 \( f_m^* \) 作为 \( \hat{f}_m \) 的极限,使得PTM的误差可以分解为“偏差”(\( f_m^* - f_0 \))和“方差”(\( \hat{f}_m - f_m^* \))。这是处理模型误设的标准技巧(White, 1982; Lv and Liu, 2014)。

真实例子与应用

本文包含三个真实数据例子,均用于验证LocalMA相对于GlobalMA(GW和EWMA)的优越性:

  1. 中国租房数据(回归任务)
  2. 数据:北京和上海各区的月租金(对数),10个协变量(房间数、面积、设施等)。
  3. 方法:将每个区的数据用于训练一个PTM(神经网络或随机森林),共 \( M=13 \) 个PTM。然后用剩余数据训练权重函数(神经网络),并在测试集上比较MSPE。
  4. 结果:当PTM为神经网络时,LocalMA在所有 \( \rho \)(用于训练PTM的数据比例)下均取得最低MSPE;当PTM为随机森林时,LocalMA接近但略逊于直接训练的随机森林(DirectModel)。作者解释为“LocalMA method demonstrates the most efficient utilization”(第5.1节)。
  5. 说明:这个例子展示了LocalMA在“PTM来自不同数据源”场景下的优势,特别是当PTM质量随 \( \rho \) 变化时,LocalMA能自适应调整权重。

  6. 多语言毒性检测(文本分类任务)

  7. 数据:6种语言的句子,二分类(有毒/无毒)。将希伯来语和印地语视为“少数语言”,其他4种语言用于训练PTM(TinyBERT)。
  8. 方法:用4个PTM(每种非少数语言一个)和少数语言的训练数据估计权重,在测试集上比较分类准确率。
  9. 结果:LocalMA在大多数 \( \rho \) 下取得最高准确率,而GW和EWMA几乎不变(因为全局权重无法利用少数语言数据)。
  10. 说明:这个例子展示了LocalMA在“迁移学习”场景下的优势——利用多数语言的信息来提升少数语言的分类性能。

  11. CIFAR-10(图像分类任务)

  12. 数据:10类图像,4个公司分别用不同模型(ResNet18, DenseNet121, GoogLeNet, EfficientNetB0)在ImageNet上预训练,然后用自己的数据微调最后一层。
  13. 方法:4个PTM(每个公司一个),用收集到的部分CIFAR-10训练数据估计权重,在测试集上比较准确率。
  14. 结果:LocalMA的准确率随 \( \rho \)(收集数据比例)增加而提升,最高达69.97%,显著高于GW(64.87%)和EWMA(65.05%)。
  15. 说明:这个例子模拟了“不同公司拥有不同预训练模型”的现实场景,展示了LocalMA如何通过局部加权超越任何单个PTM和全局平均。

总结:三个例子覆盖了回归、文本分类、图像分类,验证了LocalMA在多种任务和数据类型上的有效性。核心结论是:当PTM在不同输入区域表现不同时,LocalMA能自适应地分配权重,从而显著优于全局方法。

🔎 结论是否比证明窄

  • 定理1和2的“渐近最优性”:证明的是风险之比依概率收敛到1,但没有给出收敛速度。作者在Condition 5和6中给出了神经网络大小与 \( n \) 的关系,但未证明这些条件是紧的(即是否必要)。因此,结论是“存在性”而非“最优率”。
  • 定理3的“权重一致性”:证明的是 \( d(\hat{w}_X, \mathcal{W}_X^*) \xrightarrow{p} 0 \),但 \( \mathcal{W}_X^* \)集合而非单个函数。这意味着权重可能收敛到多个最优函数中的任意一个,而非唯一的最优权重。作者未讨论唯一性条件。
  • Condition 5和6的复杂性:这些条件涉及 \( M, p, n, a_N, \xi_n, \gamma, \kappa \) 等多个参数,且包含 \( o_p(1) \) 项。在实际应用中,这些条件很难验证。作者在Remark 2中承认了高维 \( p \) 带来的“slower convergence”,并建议使用流形假设,但未给出具体定理。
  • “首次用神经网络估计权重”的claim:作者声称“This work is the first to employ a neural network for estimating the weights in optimal model averaging and to develop corresponding theoretical insights”(引言第5段)。但MoE文献中已有用神经网络作为门控网络的工作(如Shazeer et al., 2017),虽然MoE的设定不同(联合估计)。因此,这个“first”需要限定在“最优模型平均(optimal model averaging)”这一特定子领域内。

四、开放问题

  1. MoE的oracle不等式:作者在结论中提出“plan to establish oracle inequalities for MoE”(第6节)。这是一个明确的开放问题:能否将本文的渐近最优性理论推广到MoE(即专家参数也联合估计)的设定?扎根于论文第25页:“In future work, we plan to establish oracle inequalities for MoE and provide a theoretical understanding of its performance”。

  2. 高维协变量下的维度诅咒:Condition 5中的项 \( n^{-\kappa/((2\gamma+2)p)} \) 表明,当 \( p \) 很大时,神经网络逼近误差会主导,导致收敛速度极慢。作者在Remark 2中建议使用流形假设,但未给出具体定理。开放问题:能否在流形假设下得到更快的收敛率(如 \( n^{-\kappa/((2\gamma+2)d)} \),其中 \( d \ll p \) 是流形维数)?扎根于论文第11页Remark 2。

  3. out-of-sample最优性的更弱条件:定理2需要Condition 6,其中 \( \xi^* \) 是out-of-sample风险的下界。但 \( \xi^* \) 可能为0(当PTM能完美拟合 \( f_0 \) 时),此时条件不成立。开放问题:能否在 \( \xi^* = 0 \) 或接近0时建立out-of-sample最优性(例如,通过考虑相对风险而非绝对风险)?扎根于论文第12页Condition 6。

  4. 权重一致性的唯一性:定理3只证明了 \( \hat{w}_X \) 收敛到最优权重集 \( \mathcal{W}_X^* \),但未保证唯一性。开放问题:在什么条件下,最优权重函数是唯一的?这需要更强的可识别性条件(如PTM的预测函数线性无关,且损失函数严格凸)。扎根于论文第13页Theorem 3。

  5. 与MoE的实证比较:本文在模拟和真实数据中只比较了GlobalMA(GW, EWMA)和DirectModel,未与MoE(联合估计专家和门控)比较。开放问题:在PTM固定 vs. 联合估计的设定下,LocalMA与MoE的性能差异如何?这需要设计实验来分离“权重灵活性”和“专家参数可调性”的影响。扎根于论文第4页对MoE的讨论。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论