跳转至

Prediction-Only Distillation in Linear and Logistic Regression

作者: Hien Dang, Pratik Patil, Alessandro Rinaldo
主题: 其他
相关性: 6/10
链接: https://arxiv.org/abs/2607.15450


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是预测蒸馏(prediction-only distillation),具体设定为:教师模型(如岭回归或逻辑回归)训练完成后,原始标注数据不可用,只能访问教师预测器本身和一批新的无标签协变量(可能分布外)。学生模型在这些新协变量上通过教师伪标签训练,最终预测器是教师与学生预测的仿射组合(prediction mixing)。核心问题是:仅凭无标签数据能否改进一个固定教师? 该方向当前处于理论探索阶段,主要在高维比例渐近框架下对线性模型进行精确刻画。

发展脉络(history)

  • 奠基工作:知识蒸馏(KD)。Buciluă et al. (2006); Ba and Caruana (2014); Hinton et al. (2015) 提出从高容量教师向紧凑学生迁移知识。随后自蒸馏(SD) 出现(Furlanello et al., 2018; Zhang et al., 2022),模型用自己的预测重新训练。这些工作主要依赖原始训练数据。

  • 同X自蒸馏的严格改进保证。Das and Sanghavi (2023) 和 Pareek et al. (2024) 在固定设计下分析一步和重复自蒸馏。Dang et al. (2026) 在随机设计下建立岭回归的点态严格改进保证、比例渐近结果和调参方法。Lecoiu et al. (2026) 进一步证明,对于尖峰协方差矩阵,多轮自蒸馏在谱收缩估计量中达到最优。这些结果依赖于共享设计的几何恒等式。

  • 新鲜X伪标签与纯蒸馏。Ildiz et al. (2025) 研究高维无岭回归中的纯蒸馏;Moniri and Hassani (2025) 研究岭回归;Wu et al. (2026) 分析随机特征岭回归中的标度律。这些工作关注“弱到强”蒸馏(Burns et al., 2023),但纯蒸馏学生不一定优于教师(Moniri and Hassani, 2025 指出当教师过正则化时,纯蒸馏学生无法改进甚至更差)。

  • 分类中的自蒸馏理论。Das and Sanghavi (2023); Jeong and Chung (2025) 研究线性探测(冻结特征骨干上的线性分类器)和逻辑回归。Carmon et al. (2019); Javanmard et al. (2025); Takanami et al. (2025); Saglietti and Zdeborová (2022) 在高斯混合模型下分析。Das et al. (2025) 证明在某些条件下用教师硬标签重新训练可以提高准确率。

  • 本文位置:本文研究预测唯一的新鲜X设定,原始标注数据不可用,同X几何恒等式失效。作者提出预测混合自蒸馏(PMSD),证明在岭回归中,对于几乎所有正则化参数对,混合风险严格小于教师风险;在逻辑回归中,预测混合可以同时优于教师和纯蒸馏学生。

子线索聚类

  1. 同X自蒸馏(Das and Sanghavi, 2023; Pareek et al., 2024; Dang et al., 2026; Lecoiu et al., 2026):共享设计,利用几何恒等式保证改进。
  2. 新鲜X纯蒸馏(Ildiz et al., 2025; Moniri and Hassani, 2025; Wu et al., 2026):无标签数据上的伪标签训练,关注弱到强蒸馏,但改进不保证。
  3. 分类中的自蒸馏(Das and Sanghavi, 2023; Jeong and Chung, 2025; Carmon et al., 2019; Javanmard et al., 2025; Takanami et al., 2025; Saglietti and Zdeborová, 2022):线性探测或高斯混合模型,分析标签噪声下的准确率。
  4. 模型崩溃与递归训练(Shumailov et al., 2024; Alemohammad et al., 2023; Dohmatob et al., 2024; Gerstgrasser et al., 2024; Schaeffer et al., 2025; Dohmatob et al., 2025; He et al., 2026; Garg et al., 2026; Bakshi and Chakraborty, 2026):递归训练合成数据导致性能退化,本文与之不同(固定有限轮次,混合预测而非递归替换数据)。

这个方向在追问的核心问题

  1. 新鲜无标签数据能否保证改进教师? 纯蒸馏学生可能更差,预测混合能否提供严格改进?
  2. 改进的条件是什么? 依赖于教师正则化、学生正则化、协方差结构、信号对齐等。
  3. 最优混合权重如何调参? 无标签数据本身是否足够?是否需要少量标注校准集?
  4. 分类任务中预测混合是否同样有效? 逻辑回归下能否超越教师和纯蒸馏学生?

⚠️ 作者的 framing

作者将缺口 frame 为:同X自蒸馏的严格改进保证依赖于共享设计,在预测唯一的新鲜X设定中这些几何恒等式消失(原文:“The same-X result relies on geometric identities induced by the shared design, and these identities disappear when the student is trained on a fresh design independent of the teacher’s design.”)。因此,本文的“显然下一步”是:在新鲜X设定下,通过预测混合(仿射组合)能否恢复严格改进? 作者淡化了纯蒸馏学生可能更差的事实,转而强调混合可以保证改进。竞争路线(如弱到强蒸馏)被提及但未深入比较。明显该被引但未出现的工作:本文未引用任何关于计算-统计权衡低度多项式障碍的文献,这可能是因为该方向与计算复杂度无关。此外,关于集成学习(如bagging)与预测混合的联系也未讨论。

张力

未见明显对立引用。各子线索之间在设定上不同(同X vs 新鲜X,回归 vs 分类),结论互补而非矛盾。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(x \in \mathbb{R}^p\):协变量向量。 - \(y \in \mathbb{R}\):响应变量(标量)。 - \(X \in \mathbb{R}^{n_t \times p}\):教师训练设计矩阵,行 i.i.d. 来自分布 \(P_x\)。 - \(\tilde{X} \in \mathbb{R}^{n_s \times p}\):新鲜无标签协变量矩阵,行 i.i.d. 来自分布 \(\tilde{P}_x\)(可能 OOD)。 - \(y \in \mathbb{R}^{n_t}\):教师训练标签向量。 - \(\lambda_t > 0\):教师岭回归正则化参数。 - \(\lambda_s > 0\):学生(纯蒸馏)岭回归正则化参数。 - \(\beta_{\lambda_t} \in \mathbb{R}^p\):教师岭回归系数。 - \(\beta_{\text{pd},\lambda_s} \in \mathbb{R}^p\):纯蒸馏学生岭回归系数。 - \(\xi \in \mathbb{R}\):混合权重(仿射组合,非凸)。 - \(f_{\lambda_t}(x) = x^\top \beta_{\lambda_t}\):教师预测。 - \(f_{\text{pd},\lambda_s}(x) = x^\top \beta_{\text{pd},\lambda_s}\):纯蒸馏学生预测。 - \(f_{\text{pmsd},\lambda_t,\lambda_s,\xi}(x) = (1-\xi) f_{\lambda_t}(x) + \xi f_{\text{pd},\lambda_s}(x)\):预测混合学生。 - \((x_0, y_0)\):独立测试点,来自教师训练分布(in-distribution)。 - \(R(f) = \mathbb{E}[(y_0 - f(x_0))^2 \mid \mathcal{D}_{\text{lab}}, \mathcal{D}_{\text{unlab}}]\):条件平方预测风险。 - \(R(\lambda_t), R_{\text{pd}}(\lambda_s), R_{\text{pmsd}}(\lambda_t,\lambda_s,\xi)\):相应风险。 - \(C(\lambda_t,\lambda_s) = \mathbb{E}[(y_0 - f_{\lambda_t}(x_0))(y_0 - f_{\text{pd},\lambda_s}(x_0)) \mid \mathcal{D}_{\text{lab}}, \mathcal{D}_{\text{unlab}}]\):教师-学生残差相关性。 - \(D(\lambda_t,\lambda_s) = R(\lambda_t) + R_{\text{pd}}(\lambda_s) - 2C(\lambda_t,\lambda_s) = \mathbb{E}[(f_{\lambda_t}(x_0) - f_{\text{pd},\lambda_s}(x_0))^2 \mid \mathcal{D}_{\text{lab}}, \mathcal{D}_{\text{unlab}}]\):教师与学生预测的均方差异。 - \(\xi^\star(\lambda_t,\lambda_s) = \arg\min_\xi R_{\text{pmsd}}(\lambda_t,\lambda_s,\xi)\):最优混合权重。 - \(R^\star_{\text{pmsd}}(\lambda_t,\lambda_s) = R_{\text{pmsd}}(\lambda_t,\lambda_s,\xi^\star)\):最优混合风险。

模型: - 教师训练数据:\((x_i, y_i)\) i.i.d.,满足 \(y_i = x_i^\top \beta + \varepsilon_i\),其中 \(\beta = \Sigma_t^{-1} \mathbb{E}[xy]\)\(\Sigma_t = \mathbb{E}[xx^\top]\)\(\varepsilon_i\) 均值为0,方差 \(\sigma^2\)。 - 新鲜无标签协变量:\(\tilde{x}_i\) i.i.d.,协方差 \(\Sigma_s\)。 - 假设 \(\Sigma_t\)\(\Sigma_s\) 可同时对角化(即存在正交矩阵 \(U\) 使两者对角化)。 - 教师和学生均使用岭回归估计。

可观测数据: - 可观测:教师训练数据 \(X, y\)(但假设在预测唯一设定中不可用),教师预测器 \(f_{\lambda_t}\)(可查询),新鲜无标签协变量 \(\tilde{X}\),教师在新鲜协变量上的预测 \(\hat{y}_{\lambda_t} = f_{\lambda_t}(\tilde{X})\)。 - 不可观测:真实响应 \(y\) 在新鲜协变量上的值,教师训练数据(在预测唯一设定中不可用),教师正则化参数 \(\lambda_t\)(未知),真实参数 \(\beta\),噪声方差 \(\sigma^2\),协方差矩阵 \(\Sigma_t, \Sigma_s\) 等总体量。

第二步:最小内核

最简特例:各向同性设计,相同正则化,相同样本量比例。

\(\Sigma_t = \Sigma_s = I_p\)\(\lambda_t = \lambda_s = \lambda\)\(n_t = n_s = n\),因此 \(\gamma_t = \gamma_s = p/n\)。此时教师和学生使用相同正则化,新鲜协变量与教师训练协变量同分布。论文 Corollary 4.4 给出:

\[R(\lambda) - C(\lambda, \lambda) = -\frac{\kappa}{2 b_t^2} R'(\lambda),\]

其中 \(\kappa\) 是固定点方程的解,\(b_t = (1 - \gamma_t \text{tr}(\Sigma_t^2 G_t^2))^{-1}\)\(G_t = (\Sigma_t + \kappa I_p)^{-1}\)。因此,只要 \(R'(\lambda) \neq 0\),就有 \(R^\star_{\text{pmsd}}(\lambda, \lambda) < R(\lambda)\),且最优混合权重 \(\xi^\star\) 的符号与 \(R'(\lambda)\) 相反。

核心思路:预测混合风险是 \(\xi\) 的二次函数(Proposition 3.1),最优混合风险严格小于教师风险当且仅当 \(R(\lambda_t) - C(\lambda_t, \lambda_s) \neq 0\)。在比例渐近下,该差值可表示为有限个迹和二次型的确定性等价,且几乎处处非零。因此,对于几乎所有正则化参数对,混合严格改进教师。


三、这篇论文做了什么

三句话

  1. 研究问题:在预测唯一设定下(教师训练数据不可用,仅能访问教师预测器和新鲜无标签协变量),通过教师与学生预测的仿射组合(预测混合),能否严格改进教师?
  2. 核心工具:比例渐近框架下的确定性等价(deterministic equivalents),利用随机矩阵理论推导岭回归风险、残差相关性和最优混合权重的极限表达式。
  3. 主要结论:对于岭回归,在一般各向异性协方差和确定性信号下,最优混合风险严格小于教师风险(对几乎所有正则化参数对);最优混合权重无法仅从无标签数据识别,但可用少量独立标注校准集一致估计;对于二元逻辑回归,预测混合可同时优于教师和纯蒸馏学生。

关键设定与假设

  • Assumption A(数据分布)
  • (a) 教师训练协变量 \(X = Z \Sigma_t^{1/2}\)\(Z\) 有 i.i.d. 零均值、单位方差、有界 \((4+\mu)\) 阶矩的条目;\(\Sigma_t\) 正定,特征值有界远离0和∞。
  • (b) 新鲜无标签协变量 \(\tilde{X} = \tilde{Z} \Sigma_s^{1/2}\),类似条件。
  • (c) \(\Sigma_t\)\(\Sigma_s\) 可同时对角化(即存在正交矩阵 \(U\) 使两者对角化)。
  • (d) 训练标签 \(y\) 有零均值和有界 \((4+\nu)\) 阶矩。
  • Assumption B(逻辑回归特征):特征范数为1,Gram矩阵在同类内非对角元为常数 \(c \in (0,1)\),异类间为0。
  • 相比已有文献:同X自蒸馏(Dang et al., 2026)假设共享设计,本文放松为新鲜独立设计;纯蒸馏文献(Moniri and Hassani, 2025)主要关注弱到强蒸馏,本文不假设学生更强;逻辑回归部分沿用Das and Sanghavi (2023) 的设定。

主要结果

  • Theorem 3.2(一般各向异性风险渐近):在Assumption A下,教师风险 \(R(\lambda_t)\)、纯蒸馏学生风险 \(R_{\text{pd}}(\lambda_s)\)、残差相关性 \(C(\lambda_t,\lambda_s)\) 均收敛到确定性极限,由有限个迹和二次型给出(公式(8)-(10))。最优混合权重和风险也收敛到确定性极限。
  • Proposition 4.1 & 4.2(严格改进的充分条件):教师退化集 \(\Lambda_t\) 大小至多 \(4m-1\)\(m\)\(\Sigma_t\) 不同特征值个数);对于 \(\lambda_t \notin \Lambda_t\),学生平局集 \(\Lambda_s(\lambda_t)\) 大小不超过 \(\Sigma_s\) 不同特征值个数减1。因此,对于几乎所有 \(\lambda_s\),最优混合风险严格小于教师风险。
  • Corollary 4.3-4.5(特例):各向同性设计下,退化仅发生在岭最优值 \(\lambda_t^\star = \gamma_t \sigma^2 / r^2\);尖峰协方差下最多 \(s\) 个学生平局值;各向同性新鲜协变量下,只要 \(\sum_i c_i \neq 0\),对所有 \(\lambda_s\) 严格改进。
  • Theorem 5.1(校准一致性):用独立标注校准集估计三个经验矩,得到 \(\hat{\xi}^\star_{\text{cal}}\)\(\hat{R}^\star_{\text{pmsd,cal}}\),在 \(n_{\text{cal}} \to \infty\) 下一致收敛到真值,无需 \(p/n_{\text{cal}}\) 条件。
  • Theorem 6.1-6.3(逻辑回归):在Assumption B下,存在阈值 \(\rho_0\) 使得当 \(\rho \in (\rho_0, 0.5)\) 时,纯蒸馏学生只有 \(100(1-\rho)\%\) 准确率,而预测混合学生可达100%准确率;当 \(\rho > 0.5\) 时,纯蒸馏学生准确率为0%,但预测混合学生仍可达100%。

证明路线与技术技巧

整体路线(岭回归部分): 1. 风险分解:Proposition 3.1 将最优混合风险表示为教师风险减去 \((R-C)^2/D\),其中 \(D = \mathbb{E}[(f_{\lambda_t} - f_{\text{pd},\lambda_s})^2]\)。 2. 确定性等价:利用随机矩阵理论的各向异性局部律,将 \(\lambda_t Q_{\lambda_t}\) 替换为 \(\kappa_t G_t\),其中 \(G_t = (\Sigma_t + \kappa_t I)^{-1}\)\(\kappa_t\) 满足固定点方程。类似地处理学生侧。 3. 计算 \(R-C\)\(D\) 的极限:通过插入确定性矩阵 \(A = \Sigma_t G_s\) 等,将二次型 \(\beta^\top G_t^a G_s^b \Sigma_t \beta\) 和迹 \(\gamma_t \text{tr}(\Sigma_t^2 G_t^a G_s^b)\) 作为基本构件。Lemma C.1 给出 \(\lambda_t Q_{\lambda_t} A Q_{\lambda_t}\) 的确定性等价。 4. 严格改进条件:将 \(R-C\) 表示为 \(\sum_i c_i / (\tilde{\sigma}_i + \kappa_s)\),其中 \(c_i\) 依赖于信号对齐和噪声。通过多项式根数分析,证明几乎处处非零。 5. 校准一致性:直接应用大数定律,因为教师和学生预测器在给定 \(\mathcal{G}\) 下是固定的,无需高维条件。

关键跳跃点: - 从同X到新鲜X:共享设计下的几何恒等式(如 \(\beta_{\lambda_t} - \beta_{\text{pd},\lambda_s} = \lambda_s Q_{\lambda_s} \beta_{\lambda_t}\) 在新鲜X下仍成立,但 \(Q_{\lambda_s}\)\(Q_{\lambda_t}\) 独立,导致耦合的确定性等价。 - 处理两个独立随机矩阵的耦合:利用同时对角化假设,将问题转化为标量谱求和。 - 逻辑回归部分:利用特征正交性将问题简化为两个标量方程(Lemma F.1, F.2),通过分析固定点解的极限行为证明阈值存在。

技术技巧点名: - 随机矩阵理论的各向异性局部律(Knowles and Yin, 2017; Rubio and Mestre, 2011)。 - 固定点方程与 resolvent 技巧(Hastie et al., 2022)。 - 多项式根数分析(Proposition 4.2 的符号变化论证)。 - 校准估计的连续映射定理(Theorem 5.1)。 - 逻辑回归中 sigmoid 函数的单调性和固定点迭代(Lemma F.1, F.2)。

真实例子与应用

  • 岭回归:使用 UCI Blog Feedback 数据集(\(n_t=2619, n_s=5240, p=280\)),图2展示教师风险、纯蒸馏学生风险和最优混合风险随 \(\lambda_t\) 的变化,验证严格改进。图4使用各向同性高斯新鲜协变量,同样显示改进。图6用校准集估计混合权重,在 Blog Feedback、Airfoil、CIFAR-10 上验证一致性。
  • 逻辑回归:使用 Caltech-101、Caltech-256、CIFAR-100 数据集,在冻结的 ResNet-34 特征上训练线性分类器。表1和附录 I.2 报告测试准确率,显示预测混合学生优于教师和纯蒸馏学生,尤其在高正则化或高噪声率下。
  • 本文为理论方法论文,包含真实数据实验

🔎 结论是否比证明窄

  • Theorem 3.2 的确定性等价在 Assumption A(c)(同时对角化)下严格证明,但作者在讨论中声称“可以扩展到非同时对角化情况”(Section 7.3 提到“within the class of covariances \(\Sigma_s\) that are simultaneously diagonalizable with \(\Sigma_t\)”),未给出证明。因此,一般非对角化情况下的结论是 conjecture。
  • 逻辑回归的 Theorem 6.1-6.3 依赖于 Assumption B(特征范数1,同类内相关常数),作者引用 Jeong and Chung (2025) 的实证验证,但未证明该假设在真实数据上近似成立。因此,结论的适用范围受限于该假设。
  • 校准一致性 Theorem 5.1 要求分母 \(D\) 有界远离0,这在退化情况(如 \(\lambda_t = \lambda_t^\star\) 且各向同性)下不成立,但作者指出此时任何 \(\xi\) 都是最优的,因此校准仍可工作(但一致性不保证)。

四、开放问题

  1. 非同时对角化协方差:Theorem 3.2 的确定性等价依赖于 \(\Sigma_t\)\(\Sigma_s\) 可同时对角化。作者在 Section 7.3 提到“jointly optimizing \(\Sigma_s\) and \(\lambda_s\) for a given teacher is considerably more involved”,但未给出一般情况下的结果。扎根点:Assumption A(c) 和 Section 7.3 的讨论。

  2. 最优新鲜协方差结构:Proposition 7.1 在无岭极限下将最优 \(\Sigma_s\) 谱设计转化为二次规划,但仅适用于 \(\gamma_t, \gamma_s < 1\)\(\lambda_t, \lambda_s \to 0\)。一般正则化下的最优设计未知。扎根点:Section 7.3 最后一句“Optimizing the fresh covariate distribution beyond the simultaneously diagonalizable ridgeless setting is a natural direction for future work.”

  3. 逻辑回归的有限样本保证:Theorem 6.1-6.3 是渐近结果(\(n \to \infty\)),未给出有限样本界或收敛速度。扎根点:Section 6 的设定中“as \(n \to \infty\)”反复出现。

  4. 多轮预测混合:本文仅研究单轮预测混合。Lecoiu et al. (2026) 在同X设定下证明多轮自蒸馏可达到谱收缩最优。新鲜X设定下多轮混合是否也能达到类似最优?扎根点:Section 7.2 比较了新鲜X PMSD 与同X SD,但未讨论多轮。

  5. 校准集的标签成本:Theorem 5.1 需要独立标注校准集,但未讨论如何最小化其大小或通过主动学习降低标签成本。扎根点:Section 5 最后一句“Reducing the label cost of this calibration step through alternative sampling or model-assisted evaluation schemes is a natural direction for future work.”


Maintained by 陈星宇 · Homepage · Source on GitHub

评论