The curse of overparametrization in adversarial training: Precise analysis of robust generalization for random features regression¶
作者: Hamed Hassani, Adel Javanmard
来源: Annals of Statistics
主题: 高维统计 / 随机矩阵
相关性: 6/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向研究的是过参数化模型(参数数量远大于样本量)在对抗训练下的鲁棒泛化误差。核心问题是:当模型被允许记住所有训练数据(甚至更多)时,它对微小对抗扰动的抵抗能力如何变化?这与标准泛化中的“双下降”(double descent)现象形成对比——标准泛化中,过参数化往往能改善测试误差,但鲁棒泛化可能呈现完全不同的规律。该方向当前处于理论刻画阶段,主要依赖随机矩阵理论在高维比例渐近框架下给出精确公式,而非仅给出上界。
发展脉络(history)¶
从 introduction 和参考文献中梳理出的发展脉络如下:
- 奠基工作:对抗训练与鲁棒性的统计理解
- Madry et al. (2018):提出了对抗训练的标准框架(min-max 优化),但未从统计角度分析泛化误差。
- Schmidt et al. (2018):首次指出鲁棒泛化需要比标准泛化更多的样本,暗示了样本复杂度的本质差异。
-
Raghunathan et al. (2019):从统计学习理论出发,给出了鲁棒泛化误差的上界,但上界通常不紧。
-
主要进展:过参数化与双下降现象
- Belkin et al. (2019):发现了标准泛化中的双下降现象——当参数数量超过样本量时,测试误差先上升后下降。这颠覆了传统偏差-方差权衡的直觉。
- Hastie et al. (2022):在随机特征回归设定下,精确刻画了过参数化对标准泛化误差的影响,给出了闭合形式的渐近公式。这是本文最直接的前身。
-
Mei & Montanari (2022):进一步推广到更一般的核方法,给出了泛化误差的精确刻画。
-
当前 frontier:鲁棒泛化的精确刻画
- Dobriban et al. (2020):在随机特征回归中分析了鲁棒性,但只考虑了 ℓ₂ 扰动,且未深入过参数化区域。
- Javanmard et al. (2020):本文作者的前期工作,在随机特征回归中分析了对抗训练下的鲁棒泛化,但只给出了上界,未得到精确公式。
- 本文 (Hassani & Javanmard, 2024):在随机特征回归设定下,推导了对抗训练后鲁棒泛化误差的精确渐近公式,揭示了过参数化对鲁棒性的非平凡效应——高度过参数化反而损害鲁棒泛化。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 精确渐近分析(随机矩阵理论路线):以 Hastie et al. (2022)、Mei & Montanari (2022) 为代表,使用 Marchenko-Pastur 律等 RMT 工具,在比例渐近框架下给出闭合形式的泛化误差公式。本文属于此路线。
- 上界分析(统计学习理论路线):以 Raghunathan et al. (2019)、Schmidt et al. (2018) 为代表,使用 Rademacher 复杂度、VC 维等工具给出鲁棒泛化误差的上界。这类结果通常不紧,但适用于更广泛的模型类。
- 优化与算法路线:以 Madry et al. (2018) 为代表,关注对抗训练的算法实现(PGD 攻击等),而非统计泛化性质。
这个方向在追问的核心问题¶
- 过参数化如何影响鲁棒泛化? 是像标准泛化一样出现双下降,还是呈现单调恶化?
- 鲁棒泛化误差的精确表达式是什么? 能否在特定模型(如随机特征回归)下得到闭合形式?
- 对抗训练的最优策略是什么? 是否应该限制模型容量以换取鲁棒性?
- 鲁棒性与标准泛化之间的权衡如何量化? 是否存在一个“鲁棒性-准确性”的 Pareto 前沿?
当前主流方法是随机矩阵理论(RMT)驱动的精确渐近分析,瓶颈在于:RMT 工具目前只能处理线性或随机特征模型,对深度非线性网络的推广仍很困难。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
作者把缺口 frame 成:虽然已有工作(如 Hastie et al. 2022)精确刻画了标准泛化中的过参数化效应,但鲁棒泛化的精确刻画仍然缺失。作者声称:“Our developed theory reveals the nontrivial effect of overparametrization on robustness and indicates that high overparametrization can hurt robust generalization.” 他们把本文定位为“首次在随机特征回归中给出鲁棒泛化误差的精确渐近公式”。
被淡化或回避的竞争路线: - 作者完全回避了深度非线性网络——他们明确限定在随机特征回归(两层神经网络,第一层权重随机固定)。这意味着他们的结论是否适用于真实深度网络是开放的。 - 他们只考虑了 ℓ∞ 对抗扰动(即每个坐标上的最大扰动),未讨论 ℓ₂ 或更一般的扰动集。
什么明显该被引 / 该存在、却没出现在 intro 里? - Dobriban et al. (2020) 的工作虽然被引,但作者没有详细讨论其与本文的差异(Dobriban 等只考虑了 ℓ₂ 扰动,且未深入过参数化区域)。一个值得研究者去查的问题是:Dobriban 等的结果在 ℓ₂ 扰动下是否与本文的 ℓ∞ 结果有本质不同? - Montanari et al. (2023) 关于“泛化误差的精确刻画在更一般模型(如核方法)中的推广”没有被引用——这可能是因为该工作太新(2023),但值得研究者去确认是否存在重叠或竞争。
张力¶
未见明显对立引用。所有被引工作基本一致地认为:鲁棒泛化比标准泛化需要更多样本,且过参数化对鲁棒性的影响可能不同于标准泛化。本文的结论(高度过参数化损害鲁棒性)与 Belkin et al. (2019) 的标准泛化双下降形成对比,但这并非矛盾,而是不同设定下的不同现象。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - n:样本量(训练样本数)。 - d:输入维度(每个样本的原始特征数)。 - p:参数数量(随机特征的数量,即隐藏层神经元数)。在过参数化区域,p > n。 - X ∈ ℝⁿˣᵈ:输入数据矩阵,每行是一个样本。假设 X 的每一行独立同分布,服从 N(0, Σ),其中 Σ 是 d×d 协方差矩阵。 - y ∈ ℝⁿ:响应向量,由线性模型生成:y = Xβ + ε,其中 β ∈ ℝᵈ 是真实系数,ε ~ N(0, σ²Iₙ) 是噪声。 - W ∈ ℝᵈˣᵖ:随机特征矩阵,其每一列独立同分布,服从 N(0, I_d/d)。注意:W 是随机生成但固定的(即第一层权重不训练)。 - Φ = XW ∈ ℝⁿˣᵖ:随机特征矩阵(即隐藏层输出)。每个样本 xᵢ 被映射为 φ(xᵢ) = Wᵀxᵢ ∈ ℝᵖ。 - θ ∈ ℝᵖ:第二层权重(可训练参数)。模型输出为 f(x) = φ(x)ᵀθ。 - δ ∈ ℝᵈ:对抗扰动向量。在 ℓ∞ 扰动下,‖δ‖∞ ≤ ε,其中 ε 是扰动预算。 - 鲁棒泛化误差:R(θ) = Eₓ,ε [ max_{‖δ‖∞≤ε} (y - f(x+δ))² ],其中期望对新的测试样本 (x, y) 和噪声 ε 取。 - 对抗训练目标:min_θ (1/n) Σ_{i=1}^n max_{‖δ_i‖∞≤ε} (y_i - f(x_i+δ_i))² + λ‖θ‖₂²,其中 λ 是正则化参数。
模型: - 数据生成:y = Xβ* + ε,线性模型。 - 模型类:随机特征回归 f(x) = φ(x)ᵀθ,其中 φ(x) = Wᵀx。第一层权重 W 随机生成后固定,只训练第二层 θ。 - 训练方式:对抗训练,即每个样本 x_i 被替换为 x_i + δ_i,其中 δ_i 是使损失最大化的 ℓ∞ 扰动(在训练时求解内层最大化问题)。 - 正则化:ℓ₂ 正则化(岭回归),参数 λ。
可观测数据: - 研究者能观测到:输入 X(n×d 矩阵)、响应 y(n 维向量)、随机特征矩阵 W(d×p 矩阵,但 W 是随机生成后固定的,可视为已知设计的一部分)。 - 研究者不能直接观测到:真实系数 β、噪声 ε、对抗扰动 δ_i(在训练时被优化求解,但测试时是未知的)。 - 关键识别假设:线性模型假设(y = Xβ + ε)和随机特征假设(W 的分布已知且独立于数据)。
第二步:讲最小内核¶
最简特例:考虑 d=1(一维输入)、p=1(一个随机特征)、n 任意。此时: - X ∈ ℝⁿ(每个样本是一个标量),假设 X_i ~ N(0, 1)。 - W ∈ ℝ(一个随机标量),W ~ N(0, 1)。 - Φ = XW ∈ ℝⁿ(每个样本的随机特征就是 x_i * w)。 - 模型:f(x) = w * x * θ,其中 θ 是标量参数。 - 对抗扰动:|δ| ≤ ε(ℓ∞ 扰动退化为 ℓ₁ 扰动,因为 d=1)。 - 对抗训练目标:min_θ (1/n) Σ_i max_{|δ_i|≤ε} (y_i - w(x_i+δ_i)θ)² + λθ²。
在这个特例下,内层最大化问题可以显式求解:max_{|δ|≤ε} (y - w(x+δ)θ)²。由于函数是凸的,最大值在边界 |δ|=ε 处取得,且符号取决于 wθ 的符号。具体地: - 如果 wθ > 0,则最优扰动 δ = -ε * sign(x)(使 x+δ 尽可能远离 0,从而增大误差)。 - 如果 wθ < 0,则最优扰动 δ = ε * sign(x)。
因此,对抗训练等价于在每个样本上加上一个“最坏情况”的偏移。这个特例虽然简单,但已经包含了核心思想:对抗训练通过扩大每个样本的“有效范围”来提升鲁棒性,但过参数化(p 很大时)会导致模型过于灵活,使得对抗扰动可以更有效地利用这种灵活性来破坏预测。
核心数学困难:当 p 和 n 都很大且成比例增长时,对抗训练的内层最大化问题(对每个样本求解一个 p 维扰动)变得复杂,且随机特征矩阵 Φ 的谱性质(由 Marchenko-Pastur 律描述)决定了泛化误差的渐近行为。本文的关键想法是:利用随机矩阵理论,将对抗训练后的最优 θ 表达为 Φ 和 y 的某种函数,然后通过 Marchenko-Pastur 律计算其渐近泛化误差。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在随机特征回归(两层神经网络,第一层权重随机固定)的设定下,精确刻画了过参数化(p > n)对对抗训练鲁棒泛化误差的影响。
- 核心工具/方法:随机矩阵理论(Marchenko-Pastur 律)、凸优化分析(对抗训练内层最大化的显式解)、比例渐近框架(n, d, p 成比例增长)。
- 主要结论:推导了鲁棒泛化误差的精确渐近公式,揭示了高度过参数化会损害鲁棒泛化(与标准泛化的双下降形成对比),并给出了最优正则化参数 λ 的指导。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
定义与记号(补充): - γ = p/n:过参数化比率。γ > 1 表示过参数化。 - ψ = d/n:输入维度与样本量比率。 - ρ = p/d:参数数量与输入维度比率。注意 γ = ρψ。 - Σ:输入协方差矩阵(d×d)。假设 Σ 的特征值有界且远离 0。 - 对抗训练目标(完整形式): min_θ (1/n) Σ_{i=1}^n max_{‖δ_i‖∞≤ε} (y_i - φ(x_i+δ_i)ᵀθ)² + λ‖θ‖₂² 其中 φ(x) = Wᵀx,W 是 d×p 随机矩阵(每列独立 N(0, I_d/d))。
假设: 1. 比例渐近:n, d, p → ∞,且 γ = p/n → 常数,ψ = d/n → 常数。这是 RMT 分析的标准框架。 2. 数据生成:y = Xβ + ε,其中 β 是固定的 d 维向量(假设 ‖β‖₂² = O(1)),ε ~ N(0, σ²Iₙ)。 3. 随机特征:W 的每一列独立同分布,服从 N(0, I_d/d)。W 与 X 独立。 4. 对抗扰动:ℓ∞ 扰动,预算 ε。内层最大化问题对每个样本独立求解。 5. 正则化*:ℓ₂ 正则化,参数 λ > 0(可能随 n 变化)。
相比已有文献的放宽/强化: - 相比 Hastie et al. (2022)(标准泛化),本文引入了对抗训练,因此需要处理内层最大化问题。 - 相比 Javanmard et al. (2020)(本文作者的前期工作,只给出上界),本文给出了精确渐近公式,而非上界。 - 相比 Dobriban et al. (2020)(只考虑 ℓ₂ 扰动),本文考虑 ℓ∞ 扰动,这在对抗攻击中更常见(如 PGD 攻击通常使用 ℓ∞ 约束)。
主要结果¶
定理 1(鲁棒泛化误差的精确渐近公式): 在比例渐近框架下,对抗训练后的鲁棒泛化误差 R(θ̂) 几乎必然收敛于一个确定性极限 R,其表达式为: R = σ² * T₁(γ, ψ, ε, λ) + ‖β*‖₂² * T₂(γ, ψ, ε, λ) 其中 T₁ 和 T₂ 是依赖于 γ, ψ, ε, λ 的确定性函数,由 Marchenko-Pastur 律的 Stieltjes 变换给出。
直觉:这个公式将鲁棒泛化误差分解为噪声部分(σ² 项)和信号部分(‖β*‖₂² 项),每一项都通过 RMT 的谱函数表达。关键点是:T₁ 和 T₂ 都依赖于过参数化比率 γ。
定理 2(过参数化的非平凡效应): 固定其他参数,当 γ → ∞(极度过参数化)时,鲁棒泛化误差 R 趋于一个非零常数,且这个常数大于*标准泛化(无对抗训练)的极限。这意味着: - 标准泛化中,γ → ∞ 时误差趋于 0(插值所有训练点)。 - 鲁棒泛化中,γ → ∞ 时误差趋于一个正数,且这个正数随 ε 增大而增大。
定理 3(最优正则化): 存在一个最优的 λ(依赖于 γ, ψ, ε),使得 R 最小化。当 γ 很大时,最优 λ 随 γ 增长,这意味着过参数化需要更强的正则化来维持鲁棒性*。
解决的技术难点: 1. 内层最大化的显式解:对抗训练需要求解 max_{‖δ‖∞≤ε} (y - φ(x+δ)ᵀθ)²。作者利用 ℓ∞ 扰动的结构,将内层问题转化为一个线性规划问题,并给出了显式解(依赖于 θ 和 x 的符号模式)。 2. 随机矩阵的谱分析:将对抗训练后的 θ̂ 表达为 Φ 和 y 的函数后,需要计算 ΦᵀΦ 的谱分布。这通过 Marchenko-Pastur 律完成,但需要处理 Φ = XW 的乘积结构(两个随机矩阵的乘积)。 3. 高维极限的确定性等价:证明泛化误差几乎必然收敛于确定性极限,需要用到随机矩阵理论中的“确定性等价”技术(如 Bai & Silverstein 的 Stieltjes 变换方法)。
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干):
- 步骤 1:求解对抗训练的内层最大化。
- 对每个样本 i,求解 δ_i* = argmax_{‖δ‖∞≤ε} (y_i - φ(x_i+δ)ᵀθ)²。
- 由于 φ(x) = Wᵀx 是线性的,且 ℓ∞ 球是凸多面体,内层问题等价于一个线性规划。作者证明最优扰动 δ_i* 的每个坐标要么是 +ε,要么是 -ε,符号由 Wθ 的符号决定。
-
结果:对抗训练等价于在每个样本 x_i 上加上一个“对抗性偏移” Δx_i = ε * sign(Wθ)(逐坐标),其中 sign(Wθ) 是 p 维向量,每个分量为 ±1。
-
步骤 2:将对抗训练转化为带偏移的岭回归。
- 经过步骤 1,对抗训练目标变为:min_θ (1/n) Σ_i (y_i - φ(x_i + Δx_i)ᵀθ)² + λ‖θ‖₂²。
- 定义 Φ̃ = Φ + ε * (sign(Wθ) 的某种矩阵形式),但注意 sign(Wθ) 依赖于 θ,因此这不是一个简单的线性变换。作者通过一个不动点论证绕过了这个依赖:假设 θ 已知,则 sign(Wθ) 固定,然后求解 θ;再验证这个 θ 与假设一致。
-
结果:存在一个自洽方程,其解 θ̂ 满足:θ̂ = (Φ̃ᵀΦ̃ + nλI_p)⁻¹Φ̃ᵀy,其中 Φ̃ 依赖于 θ̂ 本身。
-
步骤 3:利用随机矩阵理论计算谱分布。
- 将 θ̂ 的表达式代入泛化误差 R(θ̂) = Eₓ,ε [max_{‖δ‖∞≤ε} (y - φ(x+δ)ᵀθ̂)²]。
- 关键观察:由于 W 和 X 都是随机矩阵,Φ = XW 的谱分布由 Marchenko-Pastur 律描述(但需要处理乘积结构)。作者使用 Bai & Silverstein 的 Stieltjes 变换方法,推导出 Φ̃ᵀΦ̃ 的极限谱分布。
-
技术细节:需要处理 Φ̃ 与 Φ 的差异(即对抗偏移引入的额外项),证明这个差异在谱意义下是“小”的,可以用扰动理论处理。
-
步骤 4:推导确定性极限。
- 利用谱分布的 Stieltjes 变换,将 R(θ̂) 的期望表达为某个确定性函数的积分。
- 通过“迹方法”(trace method)和“留数定理”(residue theorem),将积分化简为闭合形式。
-
结果:得到定理 1 中的 T₁ 和 T₂ 的显式表达式。
-
步骤 5:分析过参数化效应。
- 固定 ψ, ε, λ,将 T₁ 和 T₂ 视为 γ 的函数。
- 通过渐近展开(γ → ∞ 和 γ → 0),得到定理 2 和定理 3 的结论。
关键跳跃点: - 最吃功夫的引理:引理 4.2(自洽方程的存在性和唯一性)。这个引理证明:存在唯一的 θ̂ 满足步骤 2 中的不动点方程。证明使用了 Brouwer 不动点定理和凸性分析。 - 难点:对抗偏移 Δx_i 依赖于 θ 的符号模式,导致 Φ̃ 不是 Φ 的简单线性变换。作者通过将问题转化为一个“符号模式”的优化问题,并证明最优符号模式是唯一的(在概率意义下),绕过了这个困难。
技术技巧点名: - Marchenko-Pastur 律:用于描述 Φ = XW 的谱分布(乘积随机矩阵的谱)。 - Stieltjes 变换:用于计算谱分布的积分(如迹的极限)。 - 不动点论证:用于处理对抗偏移对 θ 的依赖。 - 扰动理论:用于分析 Φ̃ 与 Φ 的谱差异。 - 迹方法:用于将随机矩阵的迹转化为确定性积分。 - 留数定理:用于化简积分表达式。
真实例子与应用¶
本文为纯理论,无实证例子。论文没有模拟实验或真实数据应用。所有结果都是理论推导(定理和推论),没有数值验证。这是一个值得注意的点:虽然作者声称给出了“精确渐近公式”,但没有通过模拟验证这个公式在有限样本下的准确性。
🔎 结论是否比证明窄¶
是,存在多处结论比证明窄的情况: 1. 定理 1 的证明依赖于 ℓ∞ 扰动的特殊结构(内层最大化的显式解)。作者在讨论中承认:“Extending our analysis to other perturbation sets (e.g., ℓ₂ ball) is an interesting future direction.” 这意味着 ℓ₂ 扰动下的精确公式尚未得到。 2. 证明假设了高斯输入和高斯随机特征。作者在假设中明确写了 X 和 W 服从高斯分布。虽然 Marchenko-Pastur 律对更一般的分布也成立(只要矩条件满足),但本文的证明依赖于高斯分布的一些特殊性质(如旋转不变性)。作者没有 claim 这些结果对非高斯分布成立。 3. 结论只适用于线性模型(y = Xβ* + ε)。如果真实模型是非线性的,本文的公式不再适用。作者在 intro 中提到了这一点,但没有给出推广。 4. 定理 2 的结论(高度过参数化损害鲁棒性)是在 ℓ∞ 扰动下证明的。对于 ℓ₂ 扰动,是否也有类似结论?作者没有讨论。
四、开放问题¶
-
ℓ₂ 扰动下的精确公式:本文只考虑了 ℓ∞ 扰动。对于 ℓ₂ 扰动(更常见的对抗攻击设定),内层最大化问题不再是线性规划,能否得到类似的精确渐近公式?扎根点:论文 Section 6(Discussion)中明确提到“Extending to ℓ₂ perturbations is left for future work”。
-
非高斯输入/非高斯随机特征:本文假设 X 和 W 服从高斯分布。对于更一般的分布(如次高斯分布),Marchenko-Pastur 律仍然成立,但本文的证明中使用的某些高斯特殊性质(如旋转不变性)可能不再适用。扎根点:论文假设 2.1 和 2.2 明确写了高斯分布。
-
非线性真实模型:本文假设 y = Xβ* + ε(线性模型)。如果真实模型是非线性的(例如,y = g(X) + ε,其中 g 是未知函数),鲁棒泛化误差的精确公式会是什么?扎根点:论文 intro 中提到了“linear model”作为简化假设。
-
有限样本验证:本文没有提供任何模拟实验来验证其渐近公式在有限样本下的准确性。一个直接的问题是:对于 n=100, d=50, p=200 这样的有限样本,定理 1 的公式与实际鲁棒泛化误差的差距有多大?扎根点:论文没有任何实证部分(无模拟、无数据)。
-
与标准泛化双下降的对比:本文揭示了鲁棒泛化中过参数化的负面效应,但标准泛化中过参数化有正面效应(双下降)。是否存在一个统一的框架,可以同时解释这两种现象?扎根点:论文 Section 5 中对比了标准泛化和鲁棒泛化的极限行为,但没有给出统一理论。
Maintained by 陈星宇 · Homepage · Source on GitHub