A Tutorial on Bregman Projection in Statistics¶
作者: Gunhee Cho, Jae Kwang Kim, Yumou Qiu
主题: 其他
相关性: 6/10
链接: https://arxiv.org/abs/2606.21714
一、领域脉络与小综述¶
这个方向是什么¶
本文属于信息几何(information geometry)与统计估计的统一视角这一子方向。其根本问题是:能否将一大批看似无关的统计方法(极大似然、最大熵、调查校准、GMM、EM、变分推断、扩散模型等)统一理解为同一个几何操作——在某个 Bregman 散度下把参考点投影到一个约束流形上? 这个方向的成熟度较高:Bregman 散度与凸对偶的数学框架自 1960 年代(Csiszár 的 I-divergence 几何)就已建立,信息几何在 1980-90 年代由 Amari 等人系统化,但"用一个统一的投影定理覆盖从经典估计到现代生成模型"的综述性整理仍是一个持续被填充的位置。本文的定位不是提出新定理,而是把散落的文献用同一个几何语言重新组织。
发展脉络¶
- 奠基工作:Csiszár (1975) 的 I-divergence 几何与投影定理(文献[9])奠定了"在散度下投影到约束集"的数学基础;Amari (1985, 文献[23]) 将 e-平坦/m-平坦双平坦结构引入统计流形,建立了信息几何的现代框架。这两支分别对应本文的"投影定理"(§3)与"双坐标系统"(§2.2)。
- Bregman 散度与指数族的精确对应:Banerjee et al. (2005, 文献[4]) 证明了"Bregman 散度与指数族的一一对应"——每个正则指数族都对应一个 Bregman 散度,其 cumulant 的共轭就是生成函数。这是本文把 GLM 读作投影操作的理论支点。
- 估计方程与散度最小化的统一:Grünwald & Dawid (2004, 文献[17]) 将最大熵、最小散度、博弈论与稳健贝叶斯决策统一到"得分函数 + 散度"的框架下,指出最小化 Bregman 散度等价于一个 M-估计问题,且与严格适当的评分规则(strictly proper scoring rules)一一对应。这是本文 §6-§7 将最大熵、校准、GMM 统一起来的直接先导。
- 现代生成模型的散度视角:近十年的工作把变分推断和生成模型重新表述为散度最小化——Li & Turner (2016, 文献[31]) 的 Rényi 变分推断、Wan et al. (2020, 文献[49]) 的 f-散度变分推断、Ho et al. (2020, 文献[20]) 的扩散模型、Lipman et al. (2022, 文献[32]) 的 flow matching、Song et al. (2019-2021, 文献[45,46]) 的 score-based 生成模型。这些工作各自独立地使用了"平方误差/得分匹配/速度场回归"等目标,但本文指出它们共享同一个 Bregman 结构。
- 本文的位置:作者(Cho, Kim, Qiu)把上述所有工作放进同一个"投影定理 + 双坐标"框架,并特别强调一个此前未被系统化的观察——GLM 的得分方程、最大熵的矩匹配、校准的权重调整、EM 的 E 步、变分推断的 ELBO、扩散模型的得分匹配,全部是同一个投影定理在不同坐标下的实例。本文的贡献是"统一"而非"新定理"。
子线索聚类¶
- 信息几何与投影定理(Csiszár 1975; Amari & Nagaoka 2000; Zhang 2004):建立双平坦结构与散度投影的数学基础。这条线是本文 Part I 的直接来源。
- Bregman 散度与指数族/估计理论(Banerjee et al. 2005; Grünwald & Dawid 2004):把散度最小化与似然估计、M-估计、评分规则联系起来。这条线支撑本文 §5-§7 的统计解读。
- 变分推断与生成模型的散度视角(Li & Turner 2016; Wan et al. 2020; Ho et al. 2020; Song et al. 2019; Lipman et al. 2022; Albergo et al. 2022-2025):把 KL 替换为一般散度,或把生成问题转化为回归问题。这条线是本文 §8 的素材。
- 调查抽样与校准估计(Deville & Särndal 1992; Kim, Kwon, Qiu 2026):校准权重作为散度投影的经典应用。这条线是本文 §7 的直接背景,且作者之一(Kim)是该子领域的活跃贡献者。
这个方向在追问的核心问题¶
- 统一性:哪些统计方法本质上共享同一个几何结构?这个问题的答案决定了"投影定理"能覆盖多少方法。
- 生成模型的散度选择:当 KL 被替换为一般 Bregman 散度(或 f-散度)时,变分推断和生成模型的估计量在效率、稳健性、计算可行性上如何变化?这是 §8.5 和 §9 反复触及的问题。
- 生成函数的统计角色:生成函数 G 的选择不仅是数学工具,它决定了估计量的效率-稳健性权衡(§9 的"robustness through the generator")。如何从数据中选择 G 是开放问题。
- 非平坦情形的投影:当约束集不是仿射(m-平坦)或指数族(e-平坦)时,投影定理的精确性如何退化?本文的框架在弯曲流形上只能作为近似或类比。
⚠️ 作者的 framing(这是作者的说法)¶
作者把缺口 frame 成:"大量统计方法——从经典 GLM 到现代扩散模型——都是同一个 Bregman 投影操作的特例,但此前缺乏一个统一的、自包含的教程来展示这一点。" 作者在 §1 和 §10 中反复强调"one construction"、"the whole picture is one construction",暗示本文是"显然的下一步"——即把散落的文献用统一语言重述。
被淡化或回避的竞争路线: - f-散度与 Bregman 散度的关系:作者在 §8.3 和 §9 提到 f-散度变分推断,但明确说 f-散度"meets the Bregman family only at KL"(§8.3),暗示 Bregman 框架不能覆盖 f-散度族。这是一个真实的边界,但作者没有深入讨论 f-散度框架(如 Nguyen et al. 2010 的 f-GAN 理论)是否也能统一同样多的方法。 - 最优传输(OT)路线:Wasserstein GAN(文献[3])和 OT-based 生成模型被归为"outside the Bregman projection theorem"(§8.5),但作者没有讨论 OT 框架与 Bregman 框架在生成建模中的相对优劣。 - 计算复杂性:作者没有讨论投影操作在无限维或高维空间中的计算可行性,而这恰恰是变分推断和扩散模型实际应用中的核心瓶颈。
什么明显该被引 / 该存在、却没出现在 intro 里? - Amari 的 α-散度与 Tsallis 的联系:作者提到 Tsallis 生成器(§2.1 Example 1),但没有引用 Amari 关于 α-散度与 Tsallis 熵之间联系的经典工作(Amari 2009, "α-divergence is unique member of the f-divergence family that is also a Bregman divergence")。这是一个明显的遗漏,因为作者在 §8.3 说 f-散度与 Bregman 只在 KL 相交,但 α-散度(Tsallis 的特例)恰好是那个交点。 - Score matching 的原始理论:作者引用了 Hyvärinen (2005, 文献[22]) 的积分分部积分技巧,但没有引用 Vincent (2011, 文献[48]) 的 denoising score matching 与 Tweedie's formula 的联系,而后者是扩散模型训练的理论基础。 - 信息几何中的投影算法:作者没有讨论 Csiszár & Tusnády (1984, 文献[10]) 的交替投影算法在 EM 和变分推断中的具体收敛性质,而这正是"投影"作为算法而非仅作为几何描述的关键。
张力¶
未见明显对立引用。各条子线索之间没有直接矛盾,但存在一个微妙的张力:Bregman 散度框架(本文)与 f-散度框架(文献[49])在变分推断中的竞争。作者承认 f-散度只在 KL 点与 Bregman 相交,但 f-散度变分推断(如 Rényi、χ²)在实践中被广泛使用且有时表现更好(如更稳健的后验近似)。这个张力在 §9 的"generator selection"问题中被部分承认,但没有被正面处理。
二、最核心、最简单的例子 / 数学内核¶
第一步:符号、模型、可观测数据¶
核心记号(贯穿全文,一次性立清):
| 记号 | 含义 | 类型 |
|---|---|---|
| \(G: I \to \mathbb{R}\) | 严格凸生成函数,定义在开区间 \(I \subseteq \mathbb{R}\) 上 | 已知/选定的数学对象 |
| \(F = G^*\) | \(G\) 的凸共轭(Legendre-Fenchel 变换),定义在 \(I^* = G'(I)\) 上 | 由 \(G\) 导出 |
| \(d_G(s,t) = G(s) - G(t) - G'(t)(s-t)\) | 点态 Bregman 距离 | 基本几何量 |
| \(D_G(p \| q) = \int_\Xi d_G(p(\xi), q(\xi)) d\mu(\xi)\) | 可分离 Bregman 散度(函数空间上的) | 目标函数/距离 |
| \(p, q: \Xi \to I\) | 密度或正测度(未归一化) | 随机对象(分布) |
| \(p_0\) | 参考点(如先验、设计权重、均匀分布) | 已知/给定的分布 |
| \(M(c) = \{p: E_p[T] = c\}\) | 矩约束集(m-平坦) | 约束流形 |
| \(E = \{p_\lambda = \nabla F(\nabla G(p_0) + \langle \lambda, T \rangle)\}\) | 指数族(e-平坦) | 模型流形 |
| \(T: \Xi \to \mathbb{R}^k\) | 充分统计量/矩函数 | 已知函数 |
| \(\lambda \in \mathbb{R}^k\) | Lagrange 乘子/自然参数 | 参数(待估) |
| \(\theta = \nabla G(p)\) | e-坐标(自然坐标) | 对偶坐标 |
| \(p = \nabla F(\theta)\) | m-坐标(均值坐标) | 原始坐标 |
| \(\hat{p}_n\) | 经验分布 | 数据驱动的对象 |
| \(y\) | 观测数据(GLM 中) | 可观测 |
| \(X\) | 设计矩阵(GLM 中) | 可观测 |
| \(\beta\) | 回归系数 | 参数(待估) |
模型(本文的核心数学对象):
- 数据生成机制:在统计应用中,观测数据 \(y_1, \ldots, y_n\) 来自某个未知分布 \(P_0\)。研究者设定一个模型族(如指数族、GLM、矩约束模型),并希望找到模型中最接近"真相"的点。
- 投影操作:给定参考点 \(p_0\)(如均匀分布、设计权重、先验)和约束集 \(M(c)\)(矩约束)或模型族 \(E\)(指数族),Bregman 投影是:
- e-投影:\(\min_{p \in M(c)} D_G(p \| p_0)\)(固定第二变元,变第一变元)
- m-投影:\(\min_{p \in E} D_G(p_0 \| p)\)(固定第一变元,变第二变元)
- 可观测数据:研究者能观测到的是样本 \(\{y_i\}\) 及其函数(如矩 \(T(y_i)\) 的样本均值 \(\hat{c} = \frac{1}{n}\sum_i T(y_i)\))。不可观测的是真实分布 \(P_0\) 本身——它只能通过矩约束或似然间接地被"投影"逼近。
关键区分(对因果推断与半参数尤其重要): - 可观测:样本、设计权重、辅助变量(如总体总量 \(X\))。 - 不可观测/潜在:真实分布 \(P_0\)、潜在结果、反事实量。在本文的框架中,这些不可观测量通过矩约束(如 \(E_p[T] = c\))被间接地"锚定"——投影定理保证:只要矩约束被满足,投影点就是唯一的,且满足 Pythagorean 分解。
第二步:最小内核¶
剥掉所有统计外衣后,本文的数学内核是这样一个命题:
最小内核(Bregman 投影定理的退化形式):设 \(G\) 是严格凸函数,\(F = G^*\) 为其共轭。给定参考点 \(p_0\) 和仿射约束集 \(M(c) = \{p: E_p[T] = c\}\),则 1. 存在唯一性:e-投影 \(p^* = \arg\min_{p \in M(c)} D_G(p \| p_0)\) 存在且唯一,且具有闭式形式
\[> p^* = \nabla F(\nabla G(p_0) + \langle \lambda^*, T \rangle), >\]其中 \(\lambda^*\) 是 Lagrange 乘子,由矩约束 \(E_{p^*}[T] = c\) 唯一确定(模约束零空间)。 2. Pythagorean 定理:对任意 \(p \in M(c)\),\[> D_G(p \| p_0) = D_G(p \| p^*) + D_G(p^* \| p_0). >\]3. 对偶性:e-投影在 \(G\)-几何下是"正交投影",而通过共轭 \(G \leftrightarrow F\),m-投影是同一个操作在共轭坐标下的镜像。
为什么这个内核"一看就懂":考虑最简单的欧几里得情形——\(G(t) = \frac{1}{2}t^2\),则 \(D_G(p\|q) = \frac{1}{2}\|p - q\|^2\) 就是平方距离。此时: - e-投影 = 把点 \(p_0\) 正交投影到仿射超平面 \(M(c)\) 上; - Pythagorean 定理 = 勾股定理:\(\|p - p_0\|^2 = \|p - p^*\|^2 + \|p^* - p_0\|^2\); - 闭式解 = 投影公式 \(p^* = p_0 + \lambda^* T\),其中 \(\lambda^*\) 由约束 \(E_{p^*}[T] = c\) 解出。
统计外衣只是换生成函数: - \(G(t) = t\log t\)(Shannon)→ KL 散度 → 最大熵、GLM、EM; - \(G(t) = \frac{1}{2}t^2\)(二次)→ 平方距离 → 最小二乘、GMM; - \(G(t) = -\log t + t - 1\) → 经验似然; - \(G(t) = \frac{t^\alpha - t}{\alpha(\alpha-1)}\)(Tsallis)→ α-散度 → 稳健估计。
本文的全部技术内容,就是把这个最小内核的证明写严格(存在唯一性、约束规格、无穷维扩展),然后逐个验证每个统计方法确实是在特定 \(G\) 和特定约束集下的这个投影。 读者只要抓住"投影 + Pythagorean + 共轭对偶"这三点,就能理解全文的骨架。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:如何用一个几何操作——Bregman 投影——统一解释从经典统计(GLM、最大熵、调查校准、GMM、EM)到现代机器学习(变分推断、变分自编码器、期望传播、扩散模型、flow matching、GAN)的十余种估计与推断方法。
- 核心工具/方法:以严格凸生成函数 \(G\) 及其共轭 \(F\) 建立双坐标系统(e-坐标 \(\theta = \nabla G(p)\) 与 m-坐标 \(p\)),证明 Bregman 投影的存在唯一性(Theorem 1)与 Pythagorean 分解,然后逐一验证每个统计方法都是该投影在特定 \(G\)、特定约束集下的实例。
- 主要结论:所有被讨论的方法共享同一个数学结构——e-投影(信息投影,固定参考点变第一变元)与 m-投影(矩投影,固定第一变元变第二变元)——且二者的对偶性由 Legendre 共轭 \(G \leftrightarrow F\) 精确刻画。方法的差异仅在于生成函数 \(G\) 的选择(决定散度几何)和约束集的形状(决定模型族)。
关键设定与假设¶
在最小内核的基础上,本文的完整设定需要以下假设:
- (A1) 生成函数正则性:\(G \in C^2(I)\) 严格凸,\(I \subseteq \mathbb{R}\) 为开区间。这保证 \(G'\) 是严格单调的,从而 \(G'\) 是从 \(I\) 到 \(I^* = G'(I)\) 的同胚,Legendre 变换良定义。统计含义:保证 e-坐标与 m-坐标之间的变换是一对一的,投影点唯一。
- (A2) 可行集非空:\(M(c) = \{p: E_p[T] = c, D_G(p\|p_0) < \infty\}\) 非空。统计含义:矩约束必须与参考点兼容(如校准问题中辅助总量必须落在可行范围内)。
- (A3) 对偶可达:对偶目标 \(\Phi(\lambda) = \langle \lambda, c \rangle - \int F(\nabla G(p_0) + \langle \lambda, T \rangle) d\mu + C_0\) 在 \(\lambda^* \in \text{ri}(D)\) 处达到上确界。统计含义:Lagrange 对偶无对偶间隙,原问题与对偶问题等价。这是保证投影点具有闭式形式(10)的关键。
- (A4) 可微性:可在 \(\text{ri}(D)\) 上对 \(\Phi\) 求导,且 \(\nabla \Phi(\lambda) = c - E_{p^*_\lambda}[T]\)。统计含义:得分方程/矩条件可微,Z-估计量良定义。
相比已有文献的放宽/强化: - 放宽:本文不要求 \(G\) 是某个特定指数族的 cumulant,而是对任意满足 (A1) 的凸函数建立投影定理。这比 Banerjee et al. (2005) 的"Bregman 散度 ↔ 指数族"对应更一般——后者要求散度与指数族一一对应,本文允许任意凸生成函数。 - 强化:本文的 Pythagorean 定理(Theorem 1)要求约束集是仿射的(矩约束),这比 Csiszár (1975) 的一般凸约束集更具体,但换来了闭式解(10)。对于非仿射约束(如弯曲指数族),本文明确承认投影定理不再精确成立(§8.5 对 VAE 和 EP 的讨论)。
主要结果¶
定理层面(Part I):
- Theorem 1(e-投影的存在唯一性与 Pythagorean 定理):在 (A1)-(A4) 下,问题 (7) 有唯一解 \(p^*\),形式为 (10),且对任意可行 \(p\) 满足 (11)。证明路线:先构造 Lagrange 对偶(Lemma 3),证明对偶函数 \(\Phi\) 的凹性与可达性(Lemma 4),再由强对偶得到原问题解的存在性;唯一性由 \(G\) 的严格凸性保证;Pythagorean 分解由三恒等式 (6) 中交叉项在投影点处消失得到。
- Corollary 1(m-投影的对偶性):m-投影是 e-投影在共轭生成函数 \(F\) 下的镜像。证明:直接应用 Lemma 1(对偶散度恒等式)将 \(D_G(p_0 \| p)\) 转化为 \(D_F(\nabla G(p) \| \nabla G(p_0))\),然后对 \(F\) 应用 Theorem 1。
- Proposition 2(得分方程 = 矩条件):投影的驻点条件等价于 \(E_{p^*}[T] = c\),且 Hessian 为广义信息矩阵。证明:对 \(\Phi\) 求导,利用 (A4) 将导数放入积分号。
应用层面(Part II):
- GLM(§5):在典范连接下,极大似然估计同时是 e-投影(自然坐标)和 m-投影(均值坐标)。关键等式:得分方程 \(X^\top(y - \mu) = 0\) 正是 Pythagorean 正交性 (12)。证明路线:验证 GLM 的似然是 \(F\)-散度,模型流形是 e-平坦的,数据点(饱和模型)的 e-投影落在模型流形上。
- 最大熵(§6):最大熵分布是参考分布(均匀)在矩约束下的 e-投影。关键等式:\(p^* \propto p_0 e^{\langle \lambda^*, T \rangle}\),即 Gibbs 形式。证明路线:直接应用 Theorem 1,其中 \(G(t) = t\log t\)。
- 调查校准(§7):校准权重是设计权重在矩约束(辅助总量)下的 e-投影。关键等式:\(w_i = d_i e^{\lambda^\top x_i}\)(乘数法)。证明路线:与最大熵相同,只是参考点从均匀分布换成设计权重。
- EM(§8.1):E 步是 e-投影(在数据边际约束下),M 步是 m-投影(在模型流形上)。关键等式:E 步计算后验 \(q = \tilde{p}(x)p(z|x;\theta)\),M 步最大化期望完整数据对数似然。证明路线:验证 E 步的投影形式 (19) 和 M 步的投影形式 (20),并指出交替投影的单调性。
- 变分推断(§8.2-8.3):VI 是受限 e-投影(限制在变分族 \(\mathcal{Q}\) 上),VAE 是摊销的受限 e-投影。关键等式:ELBO 最大化等价于最小化 \(KL(q\|p(\cdot|x;\theta))\)。证明路线:验证 ELBO 是 Bregman 散度的负值,变分族 \(\mathcal{Q}\) 一般不是平坦的,因此 Pythagorean 定理不精确成立,只能作为近似。
- 期望传播(§8.4):EP 是局部 m-投影(逐站点匹配矩)。关键等式:\(q^{\text{new}} = \arg\min_{q' \in E} KL(r_j \| q')\),等价于矩匹配 \(E_{q^{\text{new}}}[T] = E_{r_j}[T]\)。证明路线:验证 EP 的站点更新是 Corollary 1 的 m-投影。
- 扩散模型与 flow matching(§8.5):score matching 和 flow matching 的平方损失是二次生成函数下的 Bregman 散度。关键等式:\(\frac{1}{2}E\|s_\theta - s_{\text{data}}\|^2 = D_G(s_\theta \| s_{\text{data}})\),其中 \(G(s) = \frac{1}{2}\|s\|^2\)。证明路线:验证平方损失是二次 Bregman 散度,score matching 和 flow matching 是在函数空间上的投影。
真实例子与应用¶
本文没有传统的真实数据实验,但包含三个"worked examples"(§5.5):
- 高斯线性回归:\(G(t) = \frac{1}{2}t^2\),e-投影 = 普通最小二乘投影,Pythagorean 定理退化为勾股定理,得分方程 = 正规方程。
- 逻辑回归:\(G(t) = t\log t + (1-t)\log(1-t)\)(Bernoulli cumulant),e-投影 = 逻辑回归的 IRLS 迭代,得分方程 = \(X^\top(y - \mu) = 0\)。
- 泊松回归:\(G(t) = t\log t - t\),e-投影 = 泊松回归,得分方程 = \(X^\top(y - \mu) = 0\)。
这三个例子的作用是验证:在典范连接下,GLM 的拟合确实同时是 e-投影和 m-投影,且得分方程就是 Pythagorean 正交性。它们不是用来展示新方法的性能,而是用来展示统一框架的解释力。
🔎 结论是否比证明窄¶
是的,存在几处"证明窄、声称宽"的地方:
-
§8.2-8.3(VI 和 VAE):文中明确说变分族 \(\mathcal{Q}\) "一般既不是 e-平坦也不是 m-平坦"(§8.2),因此 Pythagorean 定理不精确成立。但 §8.3 仍将 VAE 描述为"摊销的受限 e-投影",并暗示其与精确投影的相似性。严格来说,Theorem 1 只对仿射约束集成立,而变分族是弯曲的,所以 VAE 的"投影"只是类比,不是定理的推论。文中没有给出弯曲情形下投影的误差界。
-
§8.5(扩散模型和 flow matching):文中说 score matching 和 flow matching 的平方损失是"二次生成函数下的 Bregman 散度",但没有证明这个函数空间上的投影满足 Theorem 1 的条件((A2)-(A4) 在无穷维函数空间上的验证被略过)。文中承认这是"neighboring geometry"而非精确投影。
-
§9(generator selection):文中提出"如何从数据中选择生成函数 \(G\)"作为开放问题,但没有给出任何理论结果(如 minimax 最优生成函数的存在性)。这只是一个研究方向的声明。
-
§7(校准):文中引用 Kim, Kwon, Qiu (2026) 的结果,称校准估计量"渐近等价于一个去偏预测估计量",但没有在本文中证明这个等价性,只是引用。读者需要去读原文验证。
四、开放问题¶
以下开放问题均扎根于本文的具体语句:
-
生成函数的选择(§9, "Robustness through the generator"):文中指出 \(G\) 是"tuning knob"(§9),并提到指数倾斜生成器在模型误设定下保持 \(\sqrt{n}\)-一致性(引用文献[44]),而经验似然生成器可能失去该性质。要研究的问题:是否存在一个数据驱动的准则来选择 \(G\),使得估计量在效率与稳健性之间达到可证明的最优权衡?文中建议用样本分裂的校准代价作为选择准则,但没有理论保证。
-
非平坦族上的投影误差(§8.2, "the family \(\mathcal{Q}\) is in general neither e-flat nor m-flat"):Theorem 1 只对仿射约束集精确成立。要研究的问题:当约束集是弯曲的(如变分族、神经网络参数族)时,Bregman 投影的误差是否有可证明的界?文中没有给出任何弯曲情形的定量结果。
-
无穷维函数空间上的投影(§8.5, score matching 和 flow matching):文中将平方损失解释为函数空间上的 Bregman 散度,但没有验证 Theorem 1 的条件在无穷维空间中是否成立。要研究的问题:在什么条件下,score matching 和 flow matching 的估计量是良定义的投影?需要什么样的正则性条件?
-
校准代价作为模型选择准则(§9, "the calibration cost ... is a natural goodness-of-fit criterion"):文中提出用 \(D_G(\hat{\omega}(\hat{\theta}_G)\|\hat{P}_n)\) 作为选择 \(G\) 的准则,但承认"由于 \(\hat{\theta}_G\) 已经最小化了该准则,直接比较会双重 dipping"。要研究的问题:样本分裂的校准代价是否具有可证明的模型选择一致性?这需要建立校准代价作为风险估计量的理论性质。
-
Bregman 投影与半参数效率的联系(§5.4, "the score equation is the orthogonality"):文中展示了 GLM 的得分方程是 Pythagorean 正交性,但没有讨论半参数效率界。要研究的问题:Bregman 投影的 Pythagorean 分解是否能推广到半参数模型,从而给出效率影响函数的几何刻画?这与你的效率理论兴趣直接相关。
提醒:要确认上述问题是否是真 gap,建议去读以下近期文献的 intro(各约 5 篇):(i) 信息几何与变分推断的交叉(如 Knoblauch et al. 2019 之后的 generalized variational inference 文献);(ii) 扩散模型的 score matching 理论(Song et al. 2021 之后的收敛性分析);(iii) 调查抽样中的校准估计(Kim 组 2023-2026 的工作)。如果这些文献的 intro 都指向同一个未解决问题,那就是共识性 gap;如果它们互相打架(例如对生成函数选择给出相反建议),那反而是更好的机会。
Maintained by 陈星宇 · Homepage · Source on GitHub