跳转至

What should post-training optimize? A test-time scaling law perspective

讲者: Muheng Li
会场: Recent Advances in Reinforcement Learning
报告题目: What Should Post-Training Optimize? A Test-Time Scaling Law Perspective
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是大语言模型(LLM)的后训练(post-training)目标与测试时(test-time)部署策略之间的错配。具体来说,标准后训练(如RLHF)优化的是单次响应的期望奖励,而实际部署中常用best-of-N采样(生成N个响应,选奖励最高的那个),其性能由奖励分布的上尾决定,而非均值。因此,一个自然的问题是:后训练应该优化什么目标,才能与测试时的best-of-N策略对齐?这个方向当前处于快速发展但尚未成熟的阶段——已有若干测试时感知的训练方法被提出,但大多假设训练时每个提示的采样预算与部署时相同(即“预算匹配”),而这在实践中往往不成立。

发展脉络(history)

从论文的引言和相关工作(Section A)中,可以梳理出以下脉络:

  1. 奠基工作:单响应后训练(RLHF / DPO)

    • Ouyang et al. (2022):RLHF通过强化学习微调策略以最大化奖励,同时用KL散度约束策略与参考模型的距离。这是标准后训练的范式。
    • Rafailov et al. (2023):DPO直接优化偏好目标,无需显式运行在线RL。这些方法优化的是单次响应的期望奖励,与best-of-N部署不匹配。
    • Kirk et al. (2023) & O’Mahony et al. (2024):实证表明RLHF和奖励微调会降低生成多样性,而多样性正是best-of-N策略所依赖的。这从反面指出了错配的严重性。
  2. 主要进展:测试时策略与扩展律

    • Snell et al. (2024):将测试时计算视为一个独立的扩展维度,表明它可以比模型参数扩展更有效。这为大规模测试时搜索提供了动机。
    • Brown et al. (2024):重复采样研究表明,覆盖率随尝试次数可预测地增长。
    • Li et al. (2026)(作者自己的前期工作):刻画了best-of-N的扩展律,表明可以通过外推上尾统计量,用少量样本(m≪N)预测大量样本(N)下的best-of-N性能。这是本文的直接技术基础。
  3. 当前前沿:测试时感知的后训练

    • Chow et al. (2024):提出了best-of-N感知的RL目标,但需要训练时采样N个响应来估计梯度(预算匹配)。
    • Bagirov et al. (2025):通过max@k优化对齐best-of-N采样,同样需要训练时采样k个响应。
    • Ousherovitch & Tewari (2026):提出Compute Aligned Training,将测试时策略视为算子并推导相应训练损失。
    • Tang et al. (2025):优化通用的k样本测试时目标(如pass@k、多数投票)。
    • 本文的位置:本文指出,上述测试时感知方法都假设训练时每个提示的采样预算与部署时相同(即“预算匹配”),而这在训练需要覆盖大量提示、部署可以分配更多计算时是不现实的。本文研究的是预算不匹配(m≪N)的设定,并利用尾外推来构造梯度估计器。

子线索聚类

这些被引文献大致落在三条子线索上:

  • 线索一:单响应后训练(RLHF / DPO)。核心是优化单次响应的期望奖励或偏好。代表:Ouyang et al. (2022), Rafailov et al. (2023), Kirk et al. (2023)。留下的口子:不适用于best-of-N部署。
  • 线索二:测试时策略与扩展律。研究如何通过增加测试时计算(如重复采样、搜索)来提升性能,并刻画其扩展规律。代表:Snell et al. (2024), Brown et al. (2024), Li et al. (2026)。留下的口子:如何利用扩展律来指导后训练,而非仅仅预测。
  • 线索三:测试时感知的后训练。直接优化与测试时策略对齐的目标。代表:Chow et al. (2024), Bagirov et al. (2025), Ousherovitch & Tewari (2026)。留下的口子:大多假设预算匹配,未考虑m≪N的实用场景。

这个方向在追问的核心问题

  1. 后训练应该优化什么目标? 是单次响应的期望奖励,还是best-of-N的期望最大值,或是其他测试时策略的目标?
  2. 如何在不匹配的预算下优化这个目标? 当训练时每个提示只有少量样本(m),而部署时使用大量样本(N)时,如何构造有效的训练信号?
  3. 尾部分布的结构能否被利用? 奖励分布的上尾是否具有可参数化的简单形式(如高斯尾),从而允许从少量样本外推到大量样本?
  4. 理论保证是什么? 这种外推估计器的偏差、方差和收敛性如何?

当前主流方法与已知瓶颈:主流方法是直接计算测试时目标(如best-of-N的期望最大值)或其梯度,但这需要训练时采样N个响应(预算匹配)。瓶颈在于:当N很大时,训练时每个提示的采样成本过高,无法覆盖大量提示。

⚠️ 作者的framing

  • 作者把缺口frame成什么? 作者将缺口明确表述为“预算不匹配”(budget-mismatch regime),即训练时每个提示的采样预算m远小于部署时的预算N。作者声称,现有测试时感知方法(如Chow et al., Bagirov et al.)都假设预算匹配,而本文是第一个系统研究预算不匹配下如何优化best-of-N性能的工作。
  • 哪些竞争路线被他淡化或回避了?
    • BoNBoN (Gui et al., 2024):这篇工作通过训练模型来模仿best-of-N的分布,从而将采样成本摊销。作者在Section A中提及了它,但将其定位为“预测best-of-N值或摊销其输出分布”,与本文“构造策略梯度估计器”的目的不同。作者淡化了BoNBoN作为一种替代方案的可能性——它不需要在训练时采样大量样本,而是通过一个单独的蒸馏步骤来逼近best-of-N分布。
    • InfAlign (Balashankar et al., 2024):该工作推导了依赖于测试时规则的奖励变换。作者在Section A中提及,但未深入比较。
    • pass@k策略优化 (Walder & Karkhanis, 2025):该工作为pass@k及其梯度推导了低方差无偏估计器。作者在Section A中提及,但未讨论其是否适用于预算不匹配场景。
  • 什么明显该被引/该存在、却没出现在intro里? 论文的intro和related work部分似乎已经比较全面。一个可能被忽略的视角是计算-统计权衡(statistical-computational tradeoff)——在预算不匹配下,是否存在一个根本性的信息论下界,使得任何多项式时间算法都无法达到某个精度?本文的估计器是多项式时间的,但并未讨论其是否是最优的。这可能是研究者可以去查的问题。

张力

未见明显对立引用。所有被引工作基本都认同“后训练目标应与测试时策略对齐”这一方向,分歧主要在于如何实现(预算匹配 vs. 预算不匹配,直接优化 vs. 蒸馏等)。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • x:提示(prompt),来自分布 P_X
    • y:响应(response),由策略 π_θ(·|x) 生成。
    • θ:策略参数。
    • R(x, y):奖励模型,为每个提示-响应对分配一个标量分数。
    • R_θ(x) := R(x, y), y ~ π_θ(·|x):给定提示x和策略θ下的奖励随机变量
    • F_{θ,x}(t) := P(R_θ(x) ≤ t | x):奖励的累积分布函数。
    • r_{θ,α}(x) := F^{-1}_{θ,x}(1-α):奖励分布的上α分位数
    • μ_{θ,α}(x) := E[R_θ(x) | R_θ(x) ≥ r_{θ,α}(x), x]:上α尾的条件期望
    • σ_{θ,α}(x) := Var[R_θ(x) | R_θ(x) ≥ r_{θ,α}(x), x]^{1/2}:上α尾的条件标准差
    • η_{θ,α}(x) := (r_{θ,α}(x), μ_{θ,α}(x), σ_{θ,α}(x)):上α尾的总体统计量向量(待估对象)。
    • V_N(θ; x) := E[max_{1≤i≤N} R(x, y_i) | x]:best-of-N的期望最大值(目标)。
    • J_TT(θ):测试时感知的总体目标(式4)。
    • Ĵ_TT(θ):基于高斯尾近似的替代目标(式7)。
    • m:训练时每个提示的采样预算(rollout budget)。
    • N:部署时每个提示的采样预算(test-time budget)。
    • α:尾部分位数参数(如0.25)。
    • c_N:N个独立标准高斯随机变量的期望最大值。
    • ẽ_N:经过调整的尾外推系数(Lemma 1)。
    • S_θ(x, y) := ∇_θ log π_θ(y|x)策略得分函数(score function)。
    • g_θ(x) := ∇_θ (μ_{θ,α}(x) + ẽ_N σ_{θ,α}(x)):替代目标的总体梯度(Lemma 2)。
    • ĝ_m^{dir}(θ; x):基于m个样本的直接插件估计器(式11)。
    • ĝ_m^{fo}(θ; x):基于m个样本的固定阶去偏估计器(Theorem 2)。
  • 模型

    • 数据生成机制:提示 x ~ P_X,给定x,响应 y ~ π_θ(·|x),奖励 R = R(x, y)
    • 核心假设(Assumption 1):对于每个提示x和参数θ,奖励分布的上2α尾是高斯分布,即 p_{θ,x}(r) = φ(r; μ_θ(x), σ_θ^2(x)) 对所有 r ≥ r_{θ,2α}(x) 成立。这里 μ_θ(x)σ_θ^2(x)潜在高斯分布的均值和方差,它们本身是未知的,但可以通过尾部分布来识别。
    • 要估的对象:策略参数 θ,使得替代目标 Ĵ_TT(θ) 最大化。
  • 可观测数据

    • 训练时:对于每个提示x,研究者可以观测到 m 个独立同分布的响应 y_1, ..., y_m ~ π_θ(·|x),以及对应的奖励 R_i = R(x, y_i)无法观测到的是总体尾统计量 η_{θ,α}(x) 和潜在高斯参数 (μ_θ(x), σ_θ(x))
    • 部署时:对于每个提示x,研究者可以观测到 N 个响应(N >> m),并选择奖励最高的那个。想要但观测不到的是 V_N(θ; x) 的精确值(因为N很大,但理论上可以通过采样近似)。

第二步:讲最小内核

最简特例:假设只有一个提示 x,且奖励分布 R_θ(x)标准高斯分布 N(0, 1)。此时,μ_θ(x)=0, σ_θ(x)=1。取 α=0.25,则上α分位数 r_{θ,α}(x) = Φ^{-1}(0.75) ≈ 0.674。上α尾的条件期望 μ_{θ,α}(x) ≈ 1.27,条件标准差 σ_{θ,α}(x) ≈ 0.59

核心问题:我们想优化 V_N(θ; x) = E[max_{1≤i≤N} R_i],即N个独立标准高斯随机变量的期望最大值。但训练时我们只有 m << N 个样本。

核心思路: 1. 用尾统计量近似目标:Lemma 1告诉我们,V_N(θ; x) 可以很好地近似为 μ_{θ,α}(x) + ẽ_N σ_{θ,α}(x)。在这个特例中,μ_{θ,α}(x)σ_{θ,α}(x) 是已知的(因为总体分布已知),所以我们可以精确计算这个近似值。但一般情况下,它们是未知的。 2. 从少量样本估计尾统计量:我们只有 m 个样本 R_1, ..., R_m。我们可以用这些样本来估计 η_{θ,α}(x) = (r_{θ,α}(x), μ_{θ,α}(x), σ_{θ,α}(x))。具体做法是:取这m个样本中最大的 ⌈αm⌉ 个(即上α尾样本),计算它们的阈值 r̂_m、均值 μ̂_m 和标准差 σ̂_m。这就是“直接插件估计器”的基础。 3. 构造梯度估计器:Lemma 2告诉我们,替代目标 μ_{θ,α}(x) + ẽ_N σ_{θ,α}(x) 的梯度可以写成策略梯度的形式: g_θ(x) = (1/α) * E[ I{R ≥ r_{θ,α}(x)} * ẽ_R_{η_{θ,α}(x)}(R) * S_θ(x, y) ], 其中 ẽ_R_η(u) 是一个“尾形状奖励”,它只依赖于上尾的响应,并包含了线性项和二次项。 4. 插件估计:将未知的总体尾统计量 η_{θ,α}(x) 替换为从m个样本中估计出的 η̂_m,就得到了直接插件估计器 ĝ_m^{dir}(θ; x)

这个特例揭示了论文的核心数学困难:用少量样本(m)估计的尾统计量 η̂_m 与真实值 η 之间存在偏差(bias)和方差(variance)。这个偏差和方差会传递到梯度估计器中。Theorem 1表明,直接插件估计器的偏差是 O(1/m),方差是 O(1/m)。为了消除偏差,作者进一步构造了固定阶去偏估计器(Prefix-TEA),将偏差降低到 O(1/m^k)(k为任意固定阶数),同时保持方差为 O(1/m)

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在LLM后训练中,当训练时每个提示的采样预算(m)远小于部署时best-of-N的预算(N)时,如何有效优化best-of-N性能。
  2. 核心工具/方法:利用奖励分布上尾的高斯假设,构造了尾外推优势估计器(TEA) 及其固定阶去偏版本(Prefix-TEA),从少量样本中估计best-of-N目标的策略梯度。
  3. 主要结论:TEA和Prefix-TEA在理论上具有可控的偏差和方差(Theorem 1, 2),并能保证后训练的收敛性(Proposition 1);在指令跟随任务的实验中,它们在不同模型、奖励模型和预算设置下一致优于GRPO和现有测试时感知基线。

关键设定与假设

  • Assumption 1(高斯尾假设):对于每个提示x和参数θ,奖励分布的上2α尾是高斯分布。这是整个尾外推方法的基础。作者声称该假设在多个模型和奖励模型对上得到实证支持(引用Li et al., 2026)。相比已有文献,这是一个新的结构假设,它使得从少量样本外推到大量样本成为可能。它比“奖励分布完全已知”弱,但比“无任何结构”强。
  • Assumption 2(得分函数有界):策略得分函数 S_θ(x, y) 的范数有界,且 μ_θ(x), σ_θ(x), KL 散度的二阶导数一致有界。这是一个标准的技术假设,用于控制梯度的波动。
  • Assumption 3(尾标准差有正下界)σ_θ(x) ≥ σ_min > 0。这确保了尾部分布不会退化,使得外推有意义。
  • 与已有文献的对比:相比Chow et al. (2024)和Bagirov et al. (2025)的预算匹配设定,本文放宽了对训练时采样预算的要求(m≪N)。相比Li et al. (2026)的预测任务,本文强化了目标——不仅要预测,还要优化。

主要结果

  • Theorem 1(直接插件估计器的偏差-方差):对于直接插件估计器 ĝ_m^{dir},其偏差为 O(√log N / m),方差为 O(log N / m)。这意味着随着m增大,估计器会收敛,但存在一个 O(1/m) 的系统偏差。
  • Theorem 2(固定阶去偏估计器的偏差-方差):对于固定阶去偏估计器 ĝ_m^{fo},其偏差可以降低到 O(√log N / m^k)(k为任意固定阶数),方差仍为 O(log N / m)。这通过广义jackknife方法实现,消除了低阶偏差项。
  • Proposition 1(后训练收敛性):在标准梯度上升更新下,使用TEA或Prefix-TEA的梯度估计,替代目标 Ĵ_TT 的梯度范数的平均平方误差可以被控制。收敛误差由初始差距、偏差项 B_m(TEA为 O(log N / m^2),Prefix-TEA为 O(log N / m^{2k}))、步长和学习率共同决定。
  • 实验结论:在UltraFeedback、HH-helpful等数据集上,使用Llama-3.2-1B、Llama-3.1-8B、Qwen3-4B等模型,TEA和Prefix-TEA在best-of-N性能上显著优于GRPO、GRPO-Z、BoN-max mean、Chow BoN-RL、CAT-BoN等基线。增益在预算不匹配(m=16, N=512)时仍然显著。通过LLM裁判(DeepSeek-v4 Pro)的检查,确认了奖励模型增益不是虚假的。

证明路线与技术技巧(理论型)

整体路线(以Theorem 1为例): 1. 问题分解:将直接插件估计器的误差分解为两部分:(P_m - P)φ_{η̂_m}(同批评估误差)和 P(φ_{η̂_m} - φ_η)(插件误差)。前者是使用同一批数据既估计尾统计量又评估梯度的代价,后者是尾统计量估计误差导致的梯度偏差。 2. 控制同批评估误差:使用留一法(leave-one-out) 技巧。对于每个样本 y_i,构造一个不包含它的留一尾统计量 η̂_m^{(-i)},该统计量与 y_i 独立。然后通过比较 φ_{η̂_m}(y_i)φ_{η̂_m^{(-i)}}(y_i) 来控制误差。这需要证明 η̂_mη̂_m^{(-i)} 之间的差异很小(Lemma 9, 10),这依赖于尾统计量的稳定性(如顺序统计量的间距)。 3. 控制插件误差:利用 H(η') = P φ_{η'} 的局部光滑性(Lemma 7),将 H(η̂_m) - H(η) 线性化,得到 Ḣ_η (η̂_m - η) 加上一个二次余项。然后利用尾统计量估计的偏差和方差(Corollary 2)来界定期望。 4. 合成:将两部分误差的界合成,得到最终的偏差和方差界。

关键跳跃点: - Lemma 9(留一尾统计量的差异):证明 ||η̂_m - η̂_m^{(-1)}|| 可以被 D_1(相邻顺序统计量的间距)和 B_1/m(边界项)控制。这需要精细地分析删除一个样本后,上α尾的阈值、均值和标准差如何变化。难点在于处理阈值变化和边界样本的进出。 - Lemma 11(同批评估误差):证明 E[||(P_m - P)φ_{η̂_m}||] = O(√log N / m)。这依赖于留一法技巧和Lemma 9、10的结果。关键点是,虽然 η̂_m 与所有样本相关,但通过留一法,可以将其与单个样本的相关性解耦。

技术技巧点名: - 留一法(Leave-one-out):用于解耦估计器与样本之间的依赖关系,是分析同批评估误差的核心技巧。 - 广义jackknife(Generalized jackknife):用于构造固定阶去偏估计器(Prefix-TEA)。通过组合不同前缀大小的交叉拟合估计器,并选择适当的权重来抵消偏差展开中的低阶项(Appendix D.5)。 - 交叉拟合(Cross-fitting):在固定阶去偏估计器中,将数据分为独立的“估计尾统计量”和“评估梯度”两部分,以简化分析。 - 顺序统计量分析:用于控制尾阈值 r̂_m 的估计误差,包括其偏差、方差和指数型集中界(Lemma 4, 5, 6)。 - Rosenthal矩不等式:用于控制尾均值和尾标准差的估计误差的高阶矩(Lemma 17)。

真实例子与应用

  • 数据/场景:主要使用UltraFeedback数据集(指令跟随任务)的提示子集,以及Anthropic/hh-rlhf数据集(有帮助的对话)。奖励模型使用Skywork-Reward-V2-Llama-3.1-8BSkywork-Reward-V2-Qwen3-8B。策略模型使用Llama-3.2-1B-InstructLlama-3.1-8B-Instruct(LoRA微调)和Qwen3-4B-Instruct-2507
  • 怎么用:在标准的GRPO训练框架中,将每个提示的m个响应的奖励替换为TEA或Prefix-TEA计算出的优势值(advantage)。这些优势值是stop-gradient的,只用于加权策略梯度。
  • 得到什么结果
    • 主结果(Figure 1, Table 1, 2):在UltraFeedback上,TEA和Prefix-TEA在所有best-of-N预算(N=1到256)下都优于GRPO和所有测试时感知基线。例如,在N=128时,TEA比GRPO的奖励分数高约1.57。
    • 缩放实验(Figure 1b, Table 4):当训练预算m从16变化到64,评估预算N从128变化到512时,TEA在所有(m, N)组合下都优于GRPO。即使在m=16, N=512的极端不匹配情况下,TEA仍带来+0.867的增益。
    • 鲁棒性实验(Section 4.5):TEA的增益在更换数据集(HH-helpful)、更换奖励模型(Qwen3-8B RM)、更换策略模型(Llama-3.1-8B, Qwen3-4B)时仍然稳健。
    • 机制诊断(Figure 3):TEA产生的梯度方向与经验best-of-128 oracle梯度更对齐(余弦相似度更高),并且训练后的策略将奖励分布整体右移,尤其是在高奖励尾部。
  • 这个例子想说明什么:TEA和Prefix-TEA是一种实用、有效且鲁棒的方法,可以在预算不匹配的现实场景中提升LLM的best-of-N性能。实验结果验证了理论分析(偏差-方差权衡),并展示了其相对于现有基线的优势。

🔎 结论是否比证明窄

  • 高斯尾假设的局限性:论文的所有理论结果(Theorem 1, 2, Proposition 1)都依赖于Assumption 1(高斯尾假设)。作者在Discussion中承认,这是一个“固定参数形式”,并指出“探索适应任何尾结构的方法”是未来方向。因此,结论的严格适用范围被限制在奖励分布上尾近似为高斯的场景。论文的实验虽然支持了这一假设(Table 14显示QQ图线性度很高),但并未证明它在所有LLM和奖励模型组合下都成立。
  • 固定阶去偏的常数依赖:Theorem 2中的常数 C_{k,J} 依赖于 (α, G, σ_min, M_R, k, J)。作者在Remark 1中承认,固定阶去偏的常数可能很大,因此其优势只在m和P足够大时才能体现。实验中的Prefix-TEA(k=2, J=4)确实没有在所有场景下都优于TEA(如Table 1中TEA的增益略高于Prefix-TEA),这与理论一致。
  • 收敛性保证的局限性:Proposition 1保证的是替代目标 Ĵ_TT 的梯度收敛,而非原始目标 J_TT。Corollary 3在额外假设(梯度支配条件)下才将保证扩展到 J_TT,但梯度支配条件本身是一个很强的假设,在非凸的神经网络优化中通常不成立。

四、开放问题(点到为止,扎根具体语句)

  1. 非高斯尾的扩展:论文的整个方法建立在Assumption 1(高斯尾)之上。作者在Discussion中明确提到:“we use a Gaussian upper-tail approximation... it is interesting to explore methods that adapt to any tail structure, rather than relying on a fixed parametric form.” 这是一个明确的开放问题:如何构造一个对任意尾结构(如幂律尾、Gumbel尾)都自适应的尾外推估计器?
  2. 非平滑奖励的扩展:作者在Discussion中提到:“it is an important future direction to extend the idea to non-smooth reward distributions, such as zero-one rewards in the pass@k setting.” 当奖励是离散的(如0/1正确性)时,高斯尾假设不再成立,需要新的理论工具。
  3. 其他测试时策略的扩展:作者在Discussion中提到:“It is useful to extend the methods to other test-time strategies beyond best-of-N, such as tree search methods, self-refine procedures, or interaction with external tools.” 这些策略的扩展律可能更复杂,需要设计不同的外推形式。
  4. 计算-统计权衡:本文的估计器是多项式时间的,但并未讨论其是否是最优的。是否存在一个信息论下界,表明任何多项式时间算法在预算不匹配下都无法达到某个精度?这与研究者的“统计-计算权衡”兴趣高度相关。可以检查本文的偏差-方差界是否可以被改进,或者是否存在一个根本性的障碍。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论