Beyond Tweedie's Formula: Conditional Score Modeling for Empirical Bayes Inference¶
作者: Shonosuke Sugasawa, Zhigen Zhao
主题: 其他
相关性: 8/10
链接: https://arxiv.org/abs/2609.11136
一、领域脉络与小综述¶
这个方向是什么¶
本文属于经验贝叶斯(Empirical Bayes, EB)推断的一个子方向:在“大规模同时推断”场景下,利用所有观测数据来估计先验分布(或等价地,边际分布),从而对每个单元的潜变量进行收缩估计。经典设定是正态均值问题:观测 \(y_i \sim N(\theta_i, \sigma^2)\),\(\theta_i\) 来自未知先验 \(G\),目标是用 \(y_i\) 和全体数据估计 \(\theta_i\)。该方向已从同方差、无协变量的情形,发展到异方差、带协变量的情形,并从不确定性量化(区间估计)扩展。当前成熟度:点估计的理论(minimax 率、自适应)已较完善,但全后验推断(区间、分布)在带协变量、异方差设定下仍不充分。
发展脉络(history)¶
- 奠基工作:Stein (1981)、Efron & Morris (1973)、Morris (1983) 建立了参数经验贝叶斯框架(正态-正态共轭先验)。Robbins (1956) 提出 Tweedie 公式,将后验均值表达为观测值加上边际密度得分的函数,开启了 f-建模(直接估计边际密度)路线。
- 主要进展(点估计):
- g-建模:Kiefer & Wolfowitz (1956)、Laird (1978) 提出非参数最大似然估计(NPMLE)估计混合分布;Jiang & Zhang (2009) 证明了 GMLEB 在正态均值问题中的 minimax 最优性;Brown & Greenshtein (2009) 给出了非参数 EB 的渐近最优性;Koenker & Mizera (2014) 引入凸优化方法。
- f-建模:Efron (2011, 2016) 系统发展了基于 Tweedie 公式的 f-建模,用核密度估计或 deconvolution 估计边际得分;Narasimhan & Efron (2020) 提供了 R 包 deconvolveR;Ghosh et al. (2025) 建立了 SURE/得分匹配与 EB 风险的联系。
- 带协变量的 EB:Ignatiadis & Wager (2019) 提出协变量驱动的 EB 点估计(Covariate-powered EB),用黑箱预测模型合成协变量信息;Fay & Herriot (1979) 的小域估计是经典参数化例子。
- 当前 frontier:
- 不确定性量化:Ignatiadis & Wager (2022) 为非参数 EB 构造了置信区间,但限于同方差、无协变量情形;Zhao & Sugasawa (2026) 提出了异方差 f-建模的区间估计。
- 全后验推断:Pericchi et al. (1993) 指出指数族中后验累积量可由边际密度表示,但未用于带协变量设定。
- 本文的位置:作者声称同时解决两个缺口——(1) 将 f-建模从点估计扩展到全后验推断(通过证明条件得分决定后验 MGF);(2) 将 f-建模推广到带协变量和异方差情形(通过条件得分建模和 Hyvärinen 得分匹配)。这是“显然的下一步”:在 Ignatiadis & Wager (2019) 的协变量 EB 点估计基础上,加上 Ghosh et al. (2025) 的 SURE/得分匹配工具,再结合 Pericchi et al. (1993) 的 MGF 表示,得到全后验推断框架。
子线索聚类¶
- g-建模(先验估计):Kiefer & Wolfowitz (1956), Laird (1978), Jiang & Zhang (2009), Koenker & Mizera (2014), Saha & Guntuboyina (2020)。核心是估计混合分布 \(G\),然后通过贝叶斯公式计算后验。优点:可直接得到后验分布;缺点:逆问题困难,协变量引入后维数灾难。
- f-建模(边际得分估计):Efron (2011, 2016, 2019), Brown & Greenshtein (2009), Greenshtein & Park (2009), Narasimhan & Efron (2020), Ghosh et al. (2025)。核心是估计边际密度 \(m(y)\) 或其得分 \(s(y) = \partial \log m(y)/\partial y\),通过 Tweedie 公式得到后验均值。优点:避免逆问题;缺点:传统上只给点估计,且难以处理协变量。
- 带协变量的 EB:Fay & Herriot (1979), Rao & Molina (2015), Ignatiadis & Wager (2019), Love et al. (2014)。核心是让先验或边际依赖于协变量 \(x\)。Ignatiadis & Wager (2019) 是当前最灵活的协变量 EB 点估计方法,但未提供后验分布。
- 不确定性量化:Ignatiadis & Wager (2022), Zhao & Sugasawa (2026)。前者在同方差无协变量下构造置信区间;后者在异方差无协变量下构造区间。本文是第一个在带协变量、异方差下同时提供点估计和区间估计的 f-建模方法。
这个方向在追问的核心问题¶
- 如何在不显式建模先验的情况下,从带协变量的观测中恢复全后验分布? 传统 f-建模只给后验均值,本文用条件得分函数决定后验 MGF 来回答。
- 如何避免协变量依赖的归一化常数? 能量模型 + Hyvärinen 得分匹配直接估计得分,归一化常数自动消去。
- 异方差下如何保持 f-建模的简洁性? 本文用加权 Hyvärinen 得分和变系数得分模型处理。
- 区间估计的覆盖率和长度能否同时优于线性 EB 和直接 MLE? 模拟显示本文方法在非线性协变量效应下保持名义覆盖且区间更短。
⚠️ 作者的 framing¶
作者把缺口 frame 成:“经典 f-建模只做点估计,且难以处理协变量和异方差;我们证明条件得分决定后验 MGF,从而可以全后验推断,并用得分匹配直接估计条件得分。” 竞争路线(g-建模)被淡化:作者说 g-建模“涉及逆问题”,而 f-建模“避免逆问题”。但 g-建模(如 NPMLE)也能处理协变量(通过混合分布依赖于协变量),只是计算更复杂。作者回避了 g-建模在带协变量下的最新进展(如 Gu & Koenker 2017 的 income dynamics 应用)。明显该被引但未出现在 intro 中的工作:例如,基于深度学习的 EB 方法(如 DNN-based prior estimation)、变分 EB 方法;以及更直接的竞争方法——用高斯过程或核方法直接建模后验均值(而非得分)的文献。这些缺失可能意味着作者有意将框架限制在得分匹配的简洁性上。
张力¶
未见明显对立引用。所有被引工作基本一致认为 f-建模在点估计上有效,但缺乏后验推断和协变量处理。本文是自然延伸。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(i = 1,\dots,n\):单元索引。
- \(y_i\):可观测的响应(标量)。
- \(\theta_i\):不可观测的潜变量(目标参数)。
- \(x_i\):可观测的协变量(向量)。
- \(\sigma^2\):已知的观测方差(同方差设定);\(\sigma_i^2\):异方差设定下已知的单元特定方差。
- \(g_{x_i}(\theta_i)\):给定 \(x_i\) 下 \(\theta_i\) 的先验分布(未知,非参数)。
- \(m(y_i|x_i) = \int \phi(y_i; \theta_i, \sigma^2) g_{x_i}(\theta_i) d\theta_i\):条件边际密度(\(\phi\) 是正态密度)。
- \(s(y_i, x_i) = \partial \log m(y_i|x_i) / \partial y_i\):条件得分函数(核心推断对象)。
- \(\delta(y_i, x_i) = y_i + \sigma^2 s(y_i, x_i)\):Tweedie 公式给出的后验均值。
- \(M_{\theta_i}(t) = E[\exp(t\theta_i) | y_i, x_i]\):后验矩生成函数。
- \(\psi\):得分函数模型中的参数向量(如基展开系数)。
- \(B_j(y, x; h)\):基函数,\(h\) 为带宽。
-
\(\lambda\):岭正则化参数。
-
模型:
- 数据生成:\(y_i | \theta_i \sim N(\theta_i, \sigma^2)\),\(\theta_i | x_i \sim g_{x_i}\)(未知,可依赖于 \(x_i\))。
- 目标:从可观测的 \((y_i, x_i)\) 推断每个 \(\theta_i\) 的后验分布(均值、方差、分位数)。
-
已知:\(\sigma^2\)(或 \(\sigma_i^2\))已知;协变量 \(x_i\) 已知。
-
可观测数据:\(\{(y_i, x_i)\}_{i=1}^n\)。不可观测:\(\theta_i\) 和先验 \(g_{x_i}\)。关键识别假设:给定 \(x_i\),\(\theta_i\) 与 \(y_i\) 的条件分布由正态似然和先验决定,但先验完全未知。我们只能通过边际 \(m(y_i|x_i)\) 来间接学习后验。
第二步:最小内核¶
最简特例:同方差 (\(\sigma^2\) 已知且相同)、无协变量 (\(x_i\) 不存在或常数)。此时模型退化为经典正态均值问题:\(y_i \sim N(\theta_i, \sigma^2)\),\(\theta_i \sim G\)(未知)。目标:从 \(y_1,\dots,y_n\) 估计每个 \(\theta_i\) 的后验分布。
核心命题(本文 Theorem 1 的特例):后验 MGF 为
为什么这是最小内核:整个论文的一般性(协变量、异方差、指数族)都是在这个恒等式的基础上加壳。无协变量时,条件得分退化为普通得分,但恒等式仍然成立。这个恒等式的证明只需要分部积分和正态似然的性质(见原文 Theorem 1 证明思路)。它表明:一旦估计出 \(s(z)\),就可以通过积分得到后验 MGF,进而通过矩匹配或特征函数反演得到后验分布。因此,整篇论文的核心数学贡献就是发现了这个恒等式(以及它在指数族中的推广),并指出它使得 f-建模可以从点估计扩展到全后验推断。
在这个特例下,要证的命题退化成:后验分布完全由边际得分函数决定。证明路线:写出后验 MGF 的定义,用正态似然和贝叶斯公式展开,然后利用边际密度 \(m(y)\) 的表达式进行积分变换,最终得到只含 \(s(z)\) 的积分形式。关键技巧:将 \(\exp(t\theta)\) 与正态核结合,完成平方,然后对 \(\theta\) 积分得到边际密度之比。
为什么这个恒等式重要:传统 Tweedie 公式只给出后验均值(一阶矩),而该恒等式给出所有矩(通过 MGF)。因此,无需估计先验 \(G\),只需估计一维函数 \(s(z)\),即可恢复整个后验分布。这大大简化了问题:从非参数估计一个函数(先验)降维到非参数估计另一个函数(得分),但后者更容易(因为得分是边际密度的对数导数,可直接用得分匹配估计,避免归一化常数)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在带协变量和异方差的正态均值问题(以及指数族推广)中,如何仅通过估计条件边际得分函数,实现经验贝叶斯的全后验推断(点估计、区间估计、分布近似)。
- 核心工具/方法:证明条件得分函数决定后验 MGF(Theorem 1);用能量模型表示条件密度,用 Hyvärinen 得分匹配(等价于 SURE)直接估计得分,避免归一化常数;用基展开和岭回归得到闭式解;用矩匹配离散化近似后验分布。
- 主要结论:提出的 Cf-modeling 在模拟中(非线性协变量效应、非高斯潜变量、异方差)比线性 EB、deconvolution EB、covariate-powered EB 有更小的加权 MSE 和区间得分,且保持名义覆盖;在 RNA-seq 数据中展示了自适应收缩和更合理的区间。
关键设定与假设¶
- 设定:正态观测模型(Section 2)和指数族观测模型(Section 3)。核心是条件独立:给定 \(x_i\),\(\theta_i\) 独立同分布(来自 \(g_{x_i}\)),且 \(y_i\) 给定 \(\theta_i\) 条件独立。
- 假设:
- 方差 \(\sigma^2\)(或 \(\sigma_i^2\))已知(在异方差扩展中已知)。
- 得分函数模型(3)的基展开足够灵活以近似真实得分(非参数一致性未证明,但模拟支持)。
- 后验 MGF 存在且解析(Theorem 1 要求积分收敛,Corollary 1 要求解析延拓)。
- 对于离散 Hyvärinen 得分(Poisson 情形),支持为 \(\{0,1,2,\dots\}\),边界处理用一阶差分。
- 相比已有文献:放宽了无协变量、同方差、正态先验的假设;强化了从点估计到全后验推断的目标。
主要结果¶
- Theorem 1(核心):在正态模型下,后验 MGF 由条件得分函数通过积分表示。证明思路:写出 \(M_{\theta_i}(t) = \int \exp(t\theta) \phi(y_i;\theta,\sigma^2) g_{x_i}(\theta) d\theta / m(y_i|x_i)\),将 \(\exp(t\theta)\phi(y_i;\theta,\sigma^2)\) 合并为 \(\phi(y_i + \sigma^2 t; \theta, \sigma^2) \cdot \exp(y_i t + \frac12 \sigma^2 t^2)\),然后分子分母用边际密度表示,得到 \(M_{\theta_i}(t) = \exp(y_i t + \frac12 \sigma^2 t^2) \cdot m(y_i + \sigma^2 t | x_i) / m(y_i | x_i)\),最后将 \(m\) 的对数导数积分即得。技术难点:需要边际密度在复平面上的解析性以保证特征函数版本(Corollary 1)。
- Corollary 2(Tweedie 公式推广):后验均值 \(E(\theta_i|y_i,x_i) = y_i + \sigma^2 s(y_i,x_i)\)。这是 Theorem 1 取 \(t=0\) 的一阶导数。
- 后验方差公式:\(\text{Var}(\theta_i|y_i,x_i) = \sigma^2 + \sigma^4 \partial s(y_i,x_i)/\partial y_i\)(由 MGF 二阶导数得到)。
- Theorem 2(指数族推广):对于自然指数族 \(p(y_i|\theta_i) = \exp((y_i\theta_i - A(\theta_i))/\phi + c(y_i,\phi))\),后验 MGF 为 \(M_{\theta_i}(t) = q(y_i + \phi t | x_i) / q(y_i | x_i)\),其中 \(q\) 是载波调整边际函数。证明类似,用指数族核的平移性质。
- 估计方法:得分函数用基展开 \(s(y,x;\psi) = \sum \psi_j B_j(y,x)\),最小化 Hyvärinen 得分(2),得到闭式岭估计(5)。超参数 \((h,\lambda)\) 通过留一交叉验证(7)选择,有闭式表达式(利用 Sherman-Morrison 公式)。
- 后验分布近似:用离散网格 + 矩匹配(最小化 MGF 差异)得到离散后验,进而构造置信区间。
证明路线与技术技巧¶
- 整体路线(以 Theorem 1 为例):
- 写出后验 MGF 定义,将 \(\exp(t\theta)\) 与正态核结合。
- 完成平方:\(\exp(t\theta) \phi(y_i;\theta,\sigma^2) = \phi(y_i + \sigma^2 t; \theta, \sigma^2) \cdot \exp(y_i t + \frac12 \sigma^2 t^2)\)。
- 分子积分变为 \(\exp(y_i t + \frac12 \sigma^2 t^2) \cdot m(y_i + \sigma^2 t | x_i)\)。
- 分母为 \(m(y_i | x_i)\),故 \(M_{\theta_i}(t) = \exp(y_i t + \frac12 \sigma^2 t^2) \cdot m(y_i + \sigma^2 t | x_i) / m(y_i | x_i)\)。
- 取对数,将 \(m\) 的比写为 \(\log m(y_i + \sigma^2 t | x_i) - \log m(y_i | x_i) = \int_{y_i}^{y_i + \sigma^2 t} s(z, x_i) dz\)。
- 关键跳跃点:从 MGF 到积分形式的转换依赖于边际密度 \(m\) 的解析性质(允许积分路径在复平面上移动),这在 Corollary 1 中明确假设。对于实值 \(t\),只需 \(m\) 在实轴上光滑即可。
- 技术技巧点名:
- 完成平方:将 \(\exp(t\theta)\) 吸收进正态核,是经典技巧。
- Hyvärinen 得分匹配:用于估计非归一化密度,避免计算归一化常数。本文将其与 SURE 等价性(Ghosh et al. 2025)结合,并用于条件密度。
- Sherman-Morrison 公式:用于推导留一交叉验证的闭式表达式(7),避免 \(O(n^2)\) 计算。
- 矩匹配离散化:用有限网格点上的离散分布近似后验,通过最小化 MGF 差异求解权重,这是将连续后验压缩为有限维的实用技巧。
真实例子与应用¶
- 数据:airway RNA-seq 数据集(Himes et al. 2014),关注 17 号染色体上的基因。对每个基因,从标准差异表达模型得到估计的 log 倍数变化 \(y_i\) 和方差 \(\sigma_i^2\)。按方差大小分为三组(低、中、高方差),重点报告中方差组(\(0.1 \le \sigma_i^2 < 1\),343 个基因)。
- 方法应用:用异方差正态模型 \(y_i | \theta_i, \sigma_i^2 \sim N(\theta_i, \sigma_i^2)\),协变量 \(x_i\) 包括 log 均值归一化表达量和 log 基因长度。比较 CF、线性 EB(正态-正态)、deconvolution EB(Efron 2016)、covariate-powered EB(Ignatiadis & Wager 2019)。
- 结果:
- 线性 EB 的标准化残差 Q-Q 图显示尾部偏离正态,说明正态先验假设过强。
- CF 的收缩模式比线性 EB 更自适应:对于相同观测值,CF 估计因协变量不同而不同;线性 EB 过度收缩大观测值。
- 90% 置信区间不包含零的基因数:ML 52,线性 EB 30,CF 46。CF 比线性 EB 更少遗漏真实信号。
- 得分图显示 CF 的得分随协变量非线性变化但较集中,线性 EB 有极端得分值导致过度收缩。
- 这个例子想说明:CF 在真实数据中能适应非线性协变量效应和非正态潜变量,提供更合理的收缩和区间估计,优于线性 EB 和忽略协变量的 deconvolution 方法。
🔎 结论是否比证明窄¶
- 窄的地方:Theorem 1 和 2 的证明假设方差已知且似然为指数族。但论文在模拟和真实数据中使用了已知方差(从 DESeq2 估计得到),这在实际中方差是估计的,存在不确定性。作者未讨论方差估计误差对后验推断的影响。此外,后验分布近似(离散化 + 矩匹配)缺乏理论保证(如收敛速度、覆盖率的渐近性质)。作者在 Section 6 承认“theoretical guarantees for posterior inference”是开放问题。
- 泛泛 claim:作者在 intro 说“the conditional score function provides a complete characterization of the posterior distribution”,这在 Theorem 1 下严格成立(给定真实得分),但实际中得分是估计的,估计误差如何传播到后验分布未量化。模拟中覆盖接近名义水平,但无理论证明。
四、开放问题¶
- 后验推断的理论保证:本文的离散化后验近似(矩匹配)缺乏渐近覆盖率和区间长度的理论结果。作者在 Section 6 提到“theoretical guarantees for posterior inference”是未来方向。扎根于 Section 2.4 的离散化方法和 Section 6 的“interesting questions about numerical stability, uncertainty propagation, and theoretical guarantees”。
- 高维协变量:基展开的维度 \(J\) 随协变量维数增长可能爆炸,如何自适应选择基函数或使用深度学习表示得分?作者在 Section 6 提到“richer and more adaptive representations may be useful in problems involving high-dimensional covariates”。
- 方差未知:本文假设 \(\sigma_i^2\) 已知,但实际中方差需估计。方差估计误差如何影响后验推断?能否将方差也纳入得分建模(如联合得分)?这直接关联到 Zhao & Sugasawa (2026) 的工作(该文处理未知方差但无协变量)。
- 多元参数:本文只处理标量 \(\theta_i\)。对于多元潜变量(如基因网络中的多个效应),如何推广条件得分恒等式?作者在 Section 6 提到“Extensions to multivariate parameters”。
- 计算-统计权衡:本文方法计算简单(闭式解),但基展开的灵活性受限于预设形式。是否存在更复杂的模型(如神经网络)能获得更好的统计效率,但需要更昂贵的计算?这与研究者的“statistical-computational tradeoff”兴趣潜在相关,但本文未触及。可顺带提醒:要确认该方向是否真存在 gap,可读近期关于“deep empirical Bayes”的文献(如用神经网络估计先验或得分的工作)。
Maintained by 陈星宇 · Homepage · Source on GitHub