跳转至

Universal priors: solving empirical Bayes via Bayesian inference and pretraining

讲者: Yanjuan Han
会场: 复杂数据学习理论与算法
报告题目: Universal Priors: Solving Empirical Bayes via Bayesian Inference and Pretraining
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是经验贝叶斯(Empirical Bayes, EB) 中的均值估计问题,具体设定为:观测数据 \(X_i \sim \text{Poi}(\theta_i)\),其中潜在参数 \(\theta_i\) 独立同分布于某个未知的先验分布 \(G_0\)。目标是构造一个估计量 \(\hat{\theta}_i(X^n)\),使其均方误差(MSE)尽可能接近“知道真实先验 \(G_0\)”的贝叶斯预言机(即后验均值 \(\theta_{G_0}(X_i) = \mathbb{E}_{G_0}[\theta_i | X_i]\))。性能由遗憾(regret) 衡量:\(\text{Regret}(\hat{\theta}^n; G_0) = \mathbb{E}_{G_0}[\frac{1}{n} \|\hat{\theta}^n(X^n) - \theta^n\|_2^2] - \min_{\theta^*(\cdot)} \mathbb{E}_{G_0}[\frac{1}{n} \|\theta^*(X^n) - \theta^n\|_2^2]\)。该方向的核心挑战是:在完全不知道 \(G_0\) 的情况下,设计一个对所有可能的 \(G_0\) 都表现良好的估计量。该领域已有超过60年的历史,从Robbins的经典工作开始,到近年来的非参数极大似然(NPMLE)、最小距离方法、经验风险最小化(ERM)等,理论成熟度较高,最优遗憾率已被精确刻画。本文则引入了一个全新的视角:用预训练的Transformer来“学习”一个通用的贝叶斯估计器,从而将计算成本从测试时转移到训练时。

发展脉络(history)

  • 奠基工作:Robbins (1951, 1956) 提出了经验贝叶斯框架和经典的Robbins估计器,其核心思想是通过“f-建模”(直接估计边际分布)来构造估计量。Stein (1956) 和 James & Stein (1961) 的悖论揭示了“借用信息”的威力,为EB提供了动机。
  • 主要进展(g-建模与NPMLE):Kiefer & Wolfowitz (1956) 和 Lindsay (1983) 提出了非参数极大似然(NPMLE),通过直接估计先验 \(G\) 来构造贝叶斯估计量。Jiang & Zhang (2009) 证明了NPMLE在正态均值模型中的近最优性。Polyanskiy & Wu (2021) 精确刻画了Poisson和正态模型下的最小最大遗憾率,为 \(\Theta(\frac{1}{n}(\frac{\log n}{\log \log n})^2)\)(紧支集先验)和 \(\Theta(\frac{\log^3 n}{n})\)(次指数先验)。Jana, Polyanskiy, Teh & Wu (2023) 提出了基于ERM的单调估计器,在保持理论保证的同时提高了计算效率。Jana, Polyanskiy & Wu (2025) 通过最小距离方法(包括NPMLE)证明了最优遗憾。
  • 当前Frontier与本文位置:Teh, Jabbour & Polyanskiy (2025) 首次将Transformer应用于Poisson EB问题,实验表明预训练的Transformer在性能和速度上均优于NPMLE。本文(Cannella, Teh, Han & Polyanskiy, 2026)则从理论上解释了这一现象,核心贡献是:证明了存在一种简单的“通用先验”(universal prior),使得在该先验下训练的贝叶斯估计器(即后验均值)对所有可能的测试先验 \(G_0\) 都能达到近最优的遗憾界(\(\tilde{O}(1/n)\))。同时,利用后验收缩理论解释了Transformer的“长度泛化”现象。与本文同时且独立的并发工作Ignatiadis & Kankanala (2026) 也通过后验收缩为Dirichlet过程先验下的贝叶斯估计器建立了类似的遗憾保证,但动机不同(后者更偏向贝叶斯非参数理论,本文更偏向机器学习中的预训练与摊销推断)。

子线索聚类

  1. 经典EB方法(f-建模与g-建模):包括Robbins估计器(f-建模)、NPMLE(g-建模)、最小距离方法 [Jana, Polyanskiy & Wu, 2025]。这些方法通常需要在测试时对每个新数据集求解一个优化问题。
  2. ERM方法:Barbehenn & Zhao (2022) 和 Jana, Polyanskiy, Teh & Wu (2023) 将EB问题转化为一个函数类上的经验风险最小化问题,避免了显式估计先验,但同样需要在测试时训练。
  3. 预训练/摊销推断方法:本文及Teh, Jabbour & Polyanskiy (2025) 的工作。核心思想是通过在大量合成数据上预训练一个模型(如Transformer),使得在测试时只需一次前向传播即可得到估计量,实现了计算成本的摊销。这与TabPFN [Hollmann et al., 2023, 2025] 的思路一脉相承。
  4. 贝叶斯经验贝叶斯(Bayes EB):Deely & Lindley (1981) 提出使用分层贝叶斯模型(即先验之先验,PoP)来解决EB问题。Datta (1991) 证明了渐近最优性。本文及Ignatiadis & Kankanala (2026) 的工作则提供了非渐近的遗憾保证。

这个方向在追问的核心问题

  1. 最优遗憾率:对于给定的模型(Poisson, Gaussian)和先验类(紧支集、次指数),最小最大遗憾的精确阶是什么?[PW21] 已基本解决。
  2. 计算-统计权衡:如何在保持统计最优性的同时,降低计算成本?ERM方法比NPMLE更快,但预训练方法(如本文)进一步将计算从测试时转移到训练时。
  3. 长度泛化:为什么在较短序列上训练的Transformer能在更长序列上表现良好?本文通过分数后验(fractional posterior)给出了一个统计解释。
  4. 可采纳性(Admissibility):哪些EB估计量是可采纳的?本文证明分层贝叶斯估计量通常是可采纳的,而NPMLE在某些条件下是不可采纳的。

⚠️ 作者的 framing

  • 作者的缺口:作者将缺口 frame 为“为什么一个在预设训练分布下训练的预训练贝叶斯估计器能适应所有可能的测试分布?” 他们指出,现有的EB方法(Robbins, NPMLE, ERM)都需要在测试时求解优化问题,而预训练方法则实现了“成本摊销”。他们的理论贡献是证明了存在“通用先验”,使得预训练贝叶斯估计器对所有测试先验都近最优。
  • 被淡化/回避的竞争路线:作者淡化了Transformer架构细节和训练动力学的作用。他们明确说“rather than analyzing the training dynamics or architecture-specific details of transformers, we adopt the key assumption that the transformers can approximate the Bayes estimator”。这意味着他们的理论并不依赖于Transformer的具体实现,而是依赖于“近似贝叶斯估计器”这一假设。他们回避了分析Transformer的表示能力或优化过程如何保证这一近似。
  • 值得查的问题:作者在引言中提到了“Bayes empirical Bayes”的并发工作 [IK26],但并未深入比较。此外,关于Transformer如何实现贝叶斯推断的机制性解释(如 [XRLM22, MWS25] 提出的隐式贝叶斯推断),本文并未直接引用或讨论,而是采用了更直接的“后验收缩”视角。一个值得研究者去查的问题是:本文的“通用先验”构造(Dirichlet过程混合)与 [IK26] 中使用的Dirichlet过程先验有何异同?它们的遗憾界哪个更紧?此外,本文的“长度泛化”解释依赖于一个特定的Transformer长度泛化模型 [FdHP25],这个模型是否适用于所有Transformer架构(例如,带有位置编码的Transformer)?

张力

未见明显对立引用。不同方法(Robbins, NPMLE, ERM, 预训练)在统计性能上通常可以互相比较,但在计算复杂度和适用场景上存在权衡。例如,Robbins估计器计算最快但性能不稳定,NPMLE性能好但计算慢,ERM在两者之间,预训练方法则通过大量离线计算换取极快的在线推断。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(n\): 序列长度(样本量)。
    • \(\theta_i \in [0, A]\): 第 \(i\) 个潜在参数(均值),是不可观测的随机变量。
    • \(X_i \in \mathbb{N}\): 第 \(i\) 个观测数据,服从以 \(\theta_i\) 为均值的泊松分布。
    • \(\theta^n = (\theta_1, \dots, \theta_n)\), \(X^n = (X_1, \dots, X_n)\): 参数向量和观测向量。
    • \(G_0 \in \mathcal{P}([0, A])\): 未知的“真实”先验分布,\(\theta_i \stackrel{i.i.d.}{\sim} G_0\)。这是不可观测的。
    • \(\Pi \in \mathcal{P}(\mathcal{P}([0, A]))\): 先验之先验(PoP),即先验分布上的分布。这是研究者选择的
    • \(G \sim \Pi\): 从PoP中随机抽取的一个先验分布。
    • \(G_\Pi = \mathbb{E}_\Pi[G^{\otimes n}]\): 由PoP \(\Pi\) 诱导出的 \(n\) 维联合先验分布。
    • \(\theta_{G_0}(x) = \mathbb{E}_{G_0}[\theta | X = x]\): 贝叶斯预言机估计量(后验均值),知道真实先验 \(G_0\) 时的最优估计。
    • \(\theta^n_\Pi(X^n) = \mathbb{E}_{G_\Pi}[\theta^n | X^n]\): 分层贝叶斯估计量,即在PoP \(\Pi\) 下的后验均值向量。这是本文研究的核心对象。
    • \(\text{Regret}(\hat{\theta}^n; G_0) = \mathbb{E}_{G_0}[\frac{1}{n} \|\hat{\theta}^n(X^n) - \theta_{G_0}(X^n)\|_2^2]\): 遗憾,衡量估计量 \(\hat{\theta}^n\) 与贝叶斯预言机之间的期望平方距离。
    • \(f_G(x) = \mathbb{E}_{\theta \sim G}[\text{Poi}(x; \theta)]\): 在先验 \(G\) 下的边际概率质量函数(pmf)。
    • \(H(f, g)\): Hellinger距离,\(H^2(f, g) = \sum_x (\sqrt{f(x)} - \sqrt{g(x)})^2\)
    • \(\chi^2(P\|Q)\): 卡方散度。
    • \(TV(P, Q)\): 全变差距离。
  • 模型

    • 数据生成机制\(\theta_i \stackrel{i.i.d.}{\sim} G_0\),然后 \(X_i | \theta_i \stackrel{ind.}{\sim} \text{Poi}(\theta_i)\)\(G_0\) 是未知的,但已知其支撑在 \([0, A]\) 内。
    • 统计模型:这是一个非参数模型,因为 \(G_0\) 可以是 \([0, A]\) 上的任意概率分布。
    • 已知/未知\(A\) 是已知的。\(G_0\) 是完全未知的。\(\theta_i\) 是潜在变量,不可观测。
  • 可观测数据

    • 可观测:研究者能观测到的是 \(X^n = (X_1, \dots, X_n)\),即 \(n\) 个泊松计数。
    • 不可观测/潜在\(\theta^n = (\theta_1, \dots, \theta_n)\)\(G_0\) 都是不可观测的。所有推断都必须基于 \(X^n\) 和对 \(G_0\) 的假设(或通过EB框架绕过对 \(G_0\) 的直接估计)。

第二步:讲最小内核

本文的核心数学问题可以归结为:为什么一个在特定“简单”先验 \(\Pi\) 下训练出来的贝叶斯估计器 \(\theta^n_\Pi\),能够对任意未知的真实先验 \(G_0\) 都表现良好?

最简特例:考虑Poisson EB模型,先验支撑在 \([0, A]\) 上。本文的关键定理(Theorem 1.1)表明,一个极其简单的PoP \(\Pi\) 就能实现通用性。这个PoP \(\Pi\) 的构造如下: - 从 \([0, A]\) 上的均匀分布中独立抽取 \(k\) 个“原子位置” \(\lambda_1, \dots, \lambda_k\)。 - 从 \(k\) 维狄利克雷分布 \(\text{Dir}(1, \dots, 1)\) 中抽取一个“权重向量” \((w_1, \dots, w_k)\)。 - 由此构造一个离散先验 \(G = \sum_{j=1}^k w_j \delta_{\lambda_j}\)。 - 然后,\(n\) 维参数向量 \(\theta^n\) 是从 \(G^{\otimes n}\) 中独立同分布抽取的,即每个 \(\theta_i\) 都独立地从同一个离散分布 \(G\) 中抽样。

在这个特例下,核心思路是什么? 1. 后验收缩(Posterior Contraction):给定观测数据 \(X^n\),后验分布 \(\Pi(G | X^n)\) 会“收缩”到真实先验 \(G_0\) 附近。也就是说,随着 \(n\) 增大,后验分布会集中在那些与 \(G_0\) 生成的边际分布 \(f_{G_0}\) 很接近的 \(G\) 上。 2. 为什么这能解释通用性?:分层贝叶斯估计量 \(\theta^n_\Pi\) 的第 \(i\) 个分量可以写成 \(\theta_{G_i}(X_i)\),其中 \(G_i = \mathbb{E}_{\Pi}[G | X^{-i}]\) 是去掉第 \(i\) 个观测后,对先验 \(G\) 的后验均值。由于后验收缩,\(G_i\) 会非常接近 \(G_0\)。因此,\(\theta_{G_i}(X_i)\) 也会非常接近贝叶斯预言机 \(\theta_{G_0}(X_i)\)。这就解释了为什么一个在“错误”先验下训练的估计器能适应“正确”的测试先验。 3. 为什么PoP要这么构造?:这个PoP \(\Pi\) 被称为“厚先验”(thick prior),因为它对任何可能的真实先验 \(G_0\) 的邻域都赋予了足够的概率质量。具体来说,对于任意 \(G_0\),存在一个离散先验 \(G\)(由 \(k\) 个原子构成)非常接近 \(G_0\)(在边际分布的Hellinger距离下),并且 \(\Pi\)\(G\) 的一个小邻域内(在 \(\chi^2\) 散度下)的概率至少为 \(e^{-O(\log^2 n / \log \log n)}\)。这个概率虽然很小,但足以在贝叶斯公式的分母中产生足够的“证据”来驱动后验收缩。

一句话总结:本文的核心数学思想是,一个精心构造的、足够“厚”的先验之先验(PoP),能够通过贝叶斯后验收缩机制,使得在该PoP下训练出的贝叶斯估计器自动适应未知的真实先验,从而在经验贝叶斯问题中达到近最优的遗憾。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:从理论上解释了为什么一个在合成数据上预训练的Transformer能够有效解决Poisson经验贝叶斯(EB)问题,并适应任意未知的测试先验分布。
  2. 核心工具/方法:提出了“通用先验”(universal prior)的概念,并利用贝叶斯统计中的后验收缩(posterior contraction)理论来证明其通用性。对于长度泛化,使用了分数后验(fractional posterior)的概念。
  3. 主要结论:存在一个简单的“先验之先验”(PoP),使得在该PoP下训练的分层贝叶斯估计器对所有测试先验都能达到 \(\tilde{O}(1/n)\) 的近最优遗憾界。该理论还解释了Transformer的长度泛化现象,即当测试序列长度大于训练长度时,Transformer实际上是在进行分数后验推断。

关键设定与假设

  • 模型:Poisson EB模型,\(X_i | \theta_i \sim \text{Poi}(\theta_i)\)\(\theta_i \stackrel{i.i.d.}{\sim} G_0\)
  • 先验支撑:真实先验 \(G_0\) 的支撑在 \([0, A]\) 内,\(A\) 已知。这是主要设定,论文也讨论了次指数先验的扩展(Theorem 3.1)。
  • 训练先验(PoP):训练数据由一个“先验之先验” \(\Pi\) 生成。本文的核心是构造一个具体的 \(\Pi\)(Algorithm 1):从均匀分布中抽取 \(k\) 个原子,从狄利克雷分布中抽取权重,构成一个离散先验 \(G\),然后 \(\theta^n\)\(G^{\otimes n}\) 中抽取。
  • Transformer假设:论文不分析Transformer的架构细节,而是假设Transformer能够很好地逼近分层贝叶斯估计量 \(\theta^n_\Pi\)。这个假设通过数值实验(Section 4.2)进行验证。
  • 长度泛化模型:论文采用 [FdHP25] 中的Transformer长度泛化模型,即Transformer的输出可以表示为 \(T_i(X^n) = f(X_i, \mu_n)\),其中 \(\mu_n\) 是输入序列的经验分布。这个模型要求Transformer没有位置编码和因果掩码。

主要结果

  1. 定理1.1(通用先验的存在性):对于Poisson EB模型,使用Algorithm 1中构造的PoP \(\Pi\)(其中原子数 \(k = \lceil c_0 \frac{\log n}{\log \log n} \rceil\)),其对应的分层贝叶斯估计器 \(\theta^n_\Pi\) 对所有测试先验 \(G_0 \in \mathcal{P}([0, A])\) 的遗憾满足:
    \[\sup_{G_0} \text{Regret}(\theta^n_\Pi; G_0) \leq C \frac{\log^3 n}{n (\log \log n)^2}.\]
    这个界与已知的最优遗憾率 \(\Theta(\frac{1}{n}(\frac{\log n}{\log \log n})^2)\) 只差一个 \(\log n\) 因子,因此是近最优的。
  2. 定理1.2(厚先验的通用性):如果一个PoP \(\Pi\) 是“厚”的(Definition 2),那么其对应的分层贝叶斯估计器 \(\theta^n_\Pi\) 是通用的,并且遗憾界可以由厚度函数的参数控制。定理1.1是定理1.2的一个推论。
  3. 定理1.3(长度泛化):对于在长度 \(n\) 上训练的分层贝叶斯估计器 \(\theta^n_\Pi\),当应用于更长的测试序列 \(n_{\text{test}} > n\) 时,其表现等价于一个基于分数后验(\(\alpha = n / n_{\text{test}}\))的贝叶斯估计器。其遗憾界为 \(\tilde{O}(1/n)\),而不是 \(\tilde{O}(1/n_{\text{test}})\),这意味着性能在 \(n_{\text{test}} \gg n\) 时会饱和。这解释了 [TJP25] 中的实验现象。
  4. 命题1.2(可采纳性):分层贝叶斯估计器 \(\theta^n_\Pi\) 通常是可采纳的,而NPMLE估计器在某些条件下(如 \(A \geq 3\) 为整数)是不可采纳的。这是一个有趣的对比,表明贝叶斯方法在决策理论上有其优势。

证明路线与技术技巧(理论型)

整体路线(以定理1.2为例): 1. 步骤1:将遗憾与Hellinger距离联系起来:利用引理2.1(来自 [JPW25]),将分层贝叶斯估计器的遗憾上界与后验均值 \(G_i\) 和真实先验 \(G_0\) 的边际分布之间的Hellinger距离联系起来。即 \(\text{Regret} \lesssim \mathbb{E}[H^2(f_{G_i}, f_{G_0})]\)。 2. 步骤2:利用后验收缩控制Hellinger距离:核心是引理2.4(后验收缩引理)。它表明,对于厚先验 \(\Pi\),给定前 \(n-1\) 个观测 \(X^{n-1}\),后验分布 \(\Pi(G | X^{n-1})\) 会以高概率集中在 \(G_0\) 附近,即 \(\mathbb{E}_{\Pi(G|X^{n-1})}[H^2(f_G, f_{G_0})]\) 很小。 3. 步骤3:连接后验均值与后验分布:引理2.3表明,\(G_i = \mathbb{E}_{\Pi}[G | X^{-i}]\) 是后验分布 \(\Pi(G | X^{-i})\) 的均值。由于Hellinger距离是凸的,\(\mathbb{E}_{\Pi(G|X^{-i})}[H^2(f_G, f_{G_0})]\) 的上界可以传递到 \(H^2(f_{G_i}, f_{G_0})\)。 4. 步骤4:整合得到最终界:将步骤1-3结合起来,并利用引理2.2(局部覆盖数上界)和厚先验的条件(\(E(n^{-2}, r_n) \leq n r_n^2\))来选择合适的参数 \(\varepsilon_n\)\(r_n\),最终得到定理1.2的遗憾界。

关键跳跃点: - 后验收缩引理(引理2.4)的证明:这是整个证明最吃功夫的部分。它借鉴了 [GGVDV00] 的经典后验收缩框架,但需要适应EB问题的特定设定。关键难点在于: - 构造检验函数:需要构造一个检验 \(\phi_n\) 来区分 \(f_{G_0}\) 和远离 \(f_{G_0}\)\(f_G\)。这依赖于局部覆盖数(引理2.2)和 [GGVDV00, Theorem 7.1] 的检验构造。 - 控制分母:贝叶斯公式的分母 \(\int \Pi(dG) \prod_{i=1}^{n-1} \frac{f_G(X_i)}{f_{G_0}(X_i)}\) 需要被下界控制。这依赖于厚先验的条件(\(\Pi\)\(G_0\) 附近有足够质量)和Bernstein型不等式,来确保该积分不会太小。 - 从后验收缩到遗憾的桥梁:引理2.1(遗憾-Hellinger不等式)和引理2.3(后验均值的结构)是连接后验收缩结果和最终遗憾界的关键桥梁。

技术技巧点名: - 后验收缩(Posterior Contraction):整个证明的核心框架,用于分析贝叶斯后验的渐近行为。 - 局部覆盖数(Local Covering Number):用于控制检验函数的构造和误差概率(引理2.2)。 - \(\chi^2\) 散度与Bernstein不等式:用于控制贝叶斯公式分母的下界(引理2.4证明中的分母部分)。 - 分数后验(Fractional Posterior):用于解释长度泛化现象(引理2.5)。 - 遗憾-Hellinger不等式:将估计误差与分布距离联系起来(引理2.1)。 - Carathéodory定理与矩匹配:用于证明离散先验可以近似任意连续先验(引理1.1的证明)。

真实例子与应用

  • 数据/场景:论文使用合成数据和真实数据(NHL曲棍球、MLB棒球、BookCorpusOpen)进行实验,但这些实验主要来自 [TJP25]。本文的实验(Section 4)旨在验证其理论假设。
  • 如何应用
    1. 验证通用先验(Section 4.1):按照Algorithm 1训练一个Transformer(T24U50),然后在来自不同PoP(神经PoP、多项PoP)的测试数据上评估其遗憾。与NPMLE和 [TJP25] 中的其他Transformer(T24N50, T24Nr)进行比较。
    2. 验证贝叶斯推断假设(Section 4.2):在一个简单的PoP(\(\Pi_m = \frac{1}{m} \sum_{i=1}^m \delta_{G_i}\))下,比较训练好的Transformer的输出与真实分层贝叶斯估计器 \(\theta^n_\Pi\) 的输出。结果显示它们非常接近,验证了“Transformer近似贝叶斯估计器”的假设。
    3. 验证长度泛化机制(Section 4.2):将Transformer应用于不同长度的测试序列,并与基于不同 \(\alpha\) 值的分数后验贝叶斯估计器进行比较。结果清晰地显示,Transformer的输出与 \(\alpha = n / n_{\text{test}}\) 的分数后验估计器最接近,完美验证了定理1.3。
  • 结果
    • \(n_{\text{test}} = n\) 时,所有预训练Transformer都优于NPMLE。
    • 随着 \(n_{\text{test}}\) 增加,Transformer的遗憾继续下降,但改善速度放缓,符合定理1.3的预测。
    • Transformer的输出与理论上的贝叶斯估计器(包括分数后验)高度一致。
  • 例子想说明什么:这些实验旨在验证理论的核心假设,即(1)Transformer确实学到了一个近似的贝叶斯估计器,(2)其长度泛化行为可以通过分数后验来解释。它们不是用来展示方法在实际应用中的绝对优势,而是作为理论的“概念验证”。

🔎 结论是否比证明窄

  • 有限批次(Finite Batches):定理1.1和1.2考虑的是总体水平(\(M \to \infty\))的ERM。引理3.1将结果推广到有限批次 \(M\),但条件是 \(M\) 需要达到超多项式大小(\(\exp(O(\log^2 n / \log \log n))\))。论文承认“this is consistent with the large data requirements observed in practical pretraining”,但这确实是一个很强的条件。结论的适用范围(有限M)比证明中假设的(无限M)要窄
  • 大A的情况:论文在Section 3.2中讨论了当 \(A = A_n \gg \log n\) 时的情况,并指出需要验证一个条件(\(-\log \Pi_{X^n | X^{n-1}} = O(\text{polylog}(n))\)),但将其留作猜想(conjecture)。结论(定理1.1的遗憾界)在 \(A\) 很大时并未被严格证明
  • Transformer的逼近误差:论文的核心假设是Transformer能很好地逼近 \(\theta^n_\Pi\)。虽然实验支持这一点,但论文没有提供任何关于Transformer逼近误差的理论保证。因此,所有关于“预训练Transformer”的结论都依赖于这个未证明的假设。结论的强度(Transformer能达到 \(\tilde{O}(1/n)\) 遗憾)比证明中严格保证的(\(\theta^n_\Pi\) 能达到 \(\tilde{O}(1/n)\) 遗憾)要弱。

四、开放问题

  1. 缩小遗憾界中的 \(\log n\) 因子:定理1.1的遗憾界比已知最优界多一个 \(\log n\) 因子。作者在Section 3.2中讨论了通过“剥壳论证”(peeling argument)来改进的可能性,但指出存在两个技术障碍:Poisson混合的Hellinger距离与 \(\chi^2\) 散度不等价,以及缺乏一个均匀的非渐近版本的局部等价结果。扎根点:Section 3.2, “a peeling argument into shells in [GGVDV00, Theorem 2.4] could improve the rate... but a rigorous proof faces two obstacles.”
  2. 有限批次 \(M\) 的条件:引理3.1要求 \(M\) 为超多项式大小。能否在更温和的条件(如多项式大小)下证明相同的遗憾界?这可能需要利用Transformer的特定结构(如低秩性、平滑性)来改进泛化误差界。扎根点:Lemma 3.1 和其后的讨论 “We leave it to future study if a better condition on \(M\) can be obtained by assuming different structures of \(\hat{\theta}^n\).”
  3. 大支撑 \(A\) 的情况:当先验支撑 \(A\)\(n\) 增长时(如 \(A = O(n^2)\)),本文的通用先验构造是否仍然有效?作者将其留作猜想。扎根点:Section 3.2, “We leave the verification of this condition as a conjecture.”
  4. Transformer逼近的理论保证:本文的核心假设是Transformer能逼近 \(\theta^n_\Pi\)。能否从理论上证明,对于本文构造的特定PoP \(\Pi\),存在一个参数规模合理的Transformer能够以足够高的精度逼近 \(\theta^n_\Pi\)?这需要结合Transformer的通用逼近定理 [FdHP25] 和 \(\theta^n_\Pi\) 的具体结构(如平滑性、对称性)进行分析。扎根点:Introduction, “we adopt the key assumption that the transformers can approximate the Bayes estimator \(\theta^n_\Pi\)”。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论