跳转至

Wasserstein bounds for denoising diffusion probabilistic models via the Föllmer process

讲者: Yuta Koike
会场: Probability and Asymptotic Theory
报告题目: Sampling Error Bounds for the Denoising Diffusion Probabilistic Model via the Föllmer Process
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

本子方向研究去噪扩散概率模型(DDPM)的采样误差,具体目标是:给定一个未知的目标分布 \(P^*\),DDPM 通过一个离散化的反向扩散过程生成样本 \(Y_N\),理论分析要回答 \(Y_N\) 的分布与 \(P^*\) 之间的 2-Wasserstein 距离 \(W_2(Y_N, P^*)\) 如何受步数 \(N\)、维度 \(d\)、分数估计误差 \(\varepsilon_{\text{score}}\)、方差调度 \(\{\beta_i\}\)、初始化 \(\hat{\mu}\) 以及目标分布 \(P^*\) 的几何性质(如 log-concavity、weak log-concavity)影响。当前成熟度:快速发展的活跃领域,2023-2025 年涌现了大量工作,但最优的 \(W_2\) 界(特别是 \(\sqrt{d/N}\) 阶)的充分条件、tightness 以及与非强对数凹分布的兼容性仍是开放问题。

发展脉络

  1. 奠基工作(2015-2020):Sohl-Dickstein et al. (2015) 提出扩散模型框架,Ho et al. (2020) 提出 DDPM 并展示高质量图像生成。Song et al. (2020) 将扩散模型统一为 SDE 框架,引入反向 SDE 和 ancestral sampling。这些工作奠定了算法基础,但理论分析(尤其是 Wasserstein 界)几乎空白。

  2. 早期收敛性分析(2022-2023):De Bortoli (2022) 首次在流形假设下给出 \(W_1\) 收敛界。Chen et al. (2023) 和 Conforti et al. (2025) 在 KL 散度下给出用户友好界,但需要 score 的 Lipschitz 均匀性假设。Oko et al. (2023) 证明扩散模型在 Besov 空间下是 minimax 最优分布估计器。这些工作主要关注 TV/KL 距离,Wasserstein 分析仍不成熟。

  3. Wasserstein 界的爆发(2024-2025):Arsenyan et al. (2025) 首次在 \(W_2\) 下达到 \(\sqrt{d/N}\) 阶,但需要目标分布满足特定结构(如 Gaussian tail)。Wang & Wang (2024) 在 Gaussian tail 假设下得到类似界。Beyler & Bach (2025) 给出统一框架分析 DDPM 和 DDIM 的 \(W_2\) 界,强调 score 空间正则性的重要性。Stéphanovitch (2026) 建立 flow matching 的 Lipschitz 正则性理论,得到最优 \(\sqrt{d}/N\) 率。Gentiloni Silveri & Ocello (2025) 在弱对数凹假设下改进 \(W_2\) 界,放松了强对数凹要求。

  4. 本文位置:Koike (2026) 通过 Föllmer 过程视角统一和改进了现有 \(W_2\) 界。主要贡献:(i) 在一般 Lipschitz 条件下得到最优 \(\sqrt{d\eta}\) 阶上界(\(\eta\) 为最大步长),恢复并统一了 [2, 61, 65] 的结果;(ii) 证明 DDPM 满足对数 Sobolev 不等式(LSI),从而通过 Otto-Villani 定理从 KL 界导出 \(W_2\) 界;(iii) 对一般 log-concave 分布,即使目标不满足二次运输成本不等式(T2),仍能达到最优 \(W_2\) 界。

子线索聚类

  • 线索 A:基于反向 SDE 离散化的分析(主流):将 DDPM 视为反向 OU 过程的 Euler-Maruyama 离散化。代表工作:Beyler & Bach (2025)、Arsenyan et al. (2025)、Gao et al. (2025)。技术核心:控制离散化误差 \(\Delta_i = \int_{t_i}^{t_{i+1}} (v_r - v_{t_i}) dr\),通常需要 score 的 Lipschitz 条件或目标分布的强正则性。
  • 线索 B:基于概率流 ODE 的分析:将扩散模型视为概率流 ODE 的离散化。代表工作:Kremling et al. (2025)、Song et al. (2020)。优势:ODE 的确定性允许更精细的误差分析,但需要额外的正则性假设。
  • 线索 C:基于 Föllmer 过程的视角(本文):将 DDPM 视为 Föllmer 过程的离散化。Föllmer 过程的漂移是鞅,简化了误差分解(偏差项自动消失)。代表工作:Koike (2026)、Eldan et al. (2020)。优势:允许更灵活的方差调度(如 cosine schedule),且初始化误差分析更精确。

核心问题与瓶颈

  1. 最优 \(W_2\) 界的充分条件:现有 \(\sqrt{d/N}\) 阶界通常需要目标分布满足强条件(如 strong log-concavity、Gaussian tail、或 score 的 Lipschitz 均匀性)。瓶颈:这些条件是否必要?能否在更弱假设(如 log-concavity)下达到相同阶?
  2. 初始化误差的刻画\(W_2\) 界中通常包含 \(t_0 |\mu - \hat{\mu}|\) 项(\(t_0\) 为初始时间)。瓶颈:当 \(|\mu - \hat{\mu}|\) 较大时,如何控制?本文 Theorem 3.6 给出部分答案,但依赖 \(t_0\) 的精细选择。
  3. 分数估计误差的传播:假设 [H](\(L^2\) 误差)与 [H'](population 版本)之间的鸿沟。瓶颈:[H] 不直接对应训练目标,而 [H'] 需要额外的 Lipschitz 假设。本文 Theorem 3.3 在 [H'] 下给出界,但需要 \(s_i\) 的 Lipschitz 条件。
  4. 方差调度的普适性:几何调度(2.3)常用于理论分析,但 cosine 调度(Example 2.3)在实践更优。瓶颈:能否在 cosine 调度下达到相同最优界?本文 Proposition 3.2 给出部分肯定答案。

⚠️ 作者的 framing

  • 作者把缺口 frame 成:现有 \(W_2\) 界要么假设强条件(如 T2 不等式),要么只适用于特定方差调度。本文通过 Föllmer 过程视角统一处理,并证明在 log-concave 分布下即使没有 T2 不等式也能达到最优界。
  • 被淡化的竞争路线:Beyler & Bach (2025) 的分析框架被提及但未深入比较。作者指出他们的分析需要更强的 score 空间正则性(见 [16] 的引用语境),而本文的 Föllmer 过程视角允许更弱的条件。
  • 明显该被引/该存在、却没出现在 intro 里的工作:未见明显缺失。但值得注意:作者引用了自己的另一篇工作 [37](Koike, 2026)来建立 Föllmer 过程与 DDPM 的联系,这篇工作可能对理解本文的技术基础至关重要。
  • 张力:未见明显对立引用。不同工作主要在假设强度上存在梯度(strong log-concavity → weak log-concavity → log-concavity),结论一致指向 \(\sqrt{d/N}\) 阶最优性。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \(P^*\):目标分布(未知,需生成样本)。
  • \(\mu, \Sigma\)\(P^*\) 的均值与协方差矩阵。
  • \(S_t P^*\)\(t\) 时刻的扰动分布,即 \(\sqrt{t} \xi + \sqrt{1-t} Z\),其中 \(\xi \sim P^*\)\(Z \sim N(0, I_d)\) 独立。
  • \(\pi_t\)\(S_t P^*\) 的密度函数。
  • \(\nabla \log \pi_t\)score 函数(真实)。
  • \(s_i\):学习到的 score proxy(在时间点 \(t_i\))。
  • \(\beta_i\):方差调度(noise schedule),满足 \(0 < \beta_i < 1\)
  • \(t_i\):离散时间点,由 (2.1) 定义:\(t_i = (1-\delta) \prod_{j=i}^{N-1} (1-\beta_j)\)\(t_N = 1-\delta\)\(\delta\) 为 early stopping 参数)。
  • \(h_i = t_{i+1} - t_i\):有效步长。
  • \(Y_i\):DDPM 生成的样本序列(\(i=0,\dots,N\)),由递归 (2.2) 定义。
  • \(\hat{\mu}\):初始化均值(通常为 0)。
  • \(W_2(P, Q)\):2-Wasserstein 距离。
  • \(\text{KL}(P|Q)\):KL 散度。
  • \(\varepsilon_{\text{score}}(t)\):score 近似误差的上界函数。
  • \(L(t)\):Lipschitz 参数函数。
  • \(\Lambda = 1 \vee \|\Sigma\|_{\text{op}}\):协方差算子范数的截断。
  • \(\eta\):最大步长上界(\(\max_i h_i \leq \eta\) 或类似条件)。

  • 模型

  • 数据生成\(P^*\) 是未知的,但假设其有有限二阶矩。DDPM 通过反向扩散过程生成样本:从 \(Y_0 \sim N(\sqrt{t_0} \hat{\mu}, I_d)\) 开始,逐步去噪。
  • 统计模型:DDPM 采样器 (2.2) 是离散化的反向 SDE。核心假设是 score 函数 \(\nabla \log \pi_t\) 可由 \(s_i\) 近似,且满足 Lipschitz 条件(如 (3.1) 或 (3.7))。
  • 要估的对象\(P^*\) 本身(分布估计)。\(W_2(Y_N, P^*)\) 衡量生成分布与真实分布的差异。

  • 可观测数据

  • 可观测:训练数据(来自 \(P^*\) 的 i.i.d. 样本),用于训练 score 网络 \(s_i\)。生成的样本 \(Y_N\)
  • 潜在/不可观测:真实的 score 函数 \(\nabla \log \pi_t\)。目标分布 \(P^*\) 的精确形式。
  • 识别依赖:通过假设 [H] 或 [H'] 将 score 近似误差与可观测的 \(L^2\) 范数联系起来。通过 Lipschitz 条件 (3.1) 或 (3.7) 控制 score 的平滑性。

第二步:最小内核

最简特例:考虑 \(P^* = N(\mu, I_d)\)(标准高斯),\(\hat{\mu} = \mu\)\(\delta = 0\)(无 early stopping),\(\varepsilon_{\text{score}} \equiv 0\)(score 已知),方差调度为常数 \(\beta_i = \beta\)\(\beta\) 很小)。此时,DDPM 生成的 \(Y_N\) 应服从 \(N(\mu, I_d)\)\(W_2(Y_N, P^*) = 0\)

在这个特例下,论文的核心思路退化成什么?

  1. Föllmer 过程视角:Föllmer 过程 \(X_t\) 满足 \(X_1 \sim P^*\),且条件于 \(X_1\) 是 Brownian bridge。其漂移 \(v(t, x) = \frac{1}{\sqrt{t}} \nabla \log f_t(x/\sqrt{t})\),其中 \(f_t\)\(S_t P^*\) 相对于 \(N(0, I_d)\) 的密度。对于高斯 \(P^*\)\(v(t, x) = \frac{\mu - x}{1-t}\)

  2. 离散化:DDPM 采样器 (2.2) 等价于 Föllmer 过程的 Euler-Maruyama 离散化 (4.3)。当 score 已知时,离散化误差完全由步长 \(h_i\) 决定。

  3. 误差分解:Lemma 4.9 将 \(W_2(Y_N, P^*)\) 分解为:

  4. 初始化误差\(\|X_{t_0} - X_{t_0}^N\|_2\),其中 \(X_{t_0}^N = t_0 \hat{\mu} + W_{t_0}\)。当 \(\hat{\mu} = \mu\) 时,此项为 0。
  5. 离散化误差\(\sqrt{\sum_i \mathbb{E}[|\Delta_i|^2]}\),其中 \(\Delta_i = \int_{t_i}^{t_{i+1}} (v_r - v_{t_i}) dr\)。对于高斯 \(P^*\)\(v_r\) 是线性的,\(\Delta_i\) 可精确计算。
  6. score 近似误差:当 \(\varepsilon_{\text{score}} \equiv 0\) 时,此项为 0。
  7. early stopping 误差:当 \(\delta = 0\) 时,此项为 0。

  8. 关键跳跃点:Lemma 4.1 证明 Föllmer 过程的漂移 \(v_t\) 是鞅,且满足 \(v_t = \mu + \int_0^t \nabla v(s, X_s) dW_s\)。这允许使用 Itô 等距控制 \(\mathbb{E}[|\Delta_i|^2]\)。对于高斯 \(P^*\)\(\nabla v(s, X_s) = -\frac{1}{1-s} I_d\),因此 \(\mathbb{E}[|\Delta_i|^2] \leq d h_i^2 \int_{t_i}^{t_{i+1}} \frac{ds}{(1-s)^2} \approx d h_i^2 / (1-t_{i+1})\)

  9. 结论:在特例下,Theorem 3.1 的上界退化为 0(因为 \(L(s) = 0\)\(\mu = \hat{\mu}\)\(\varepsilon_{\text{score}} = 0\)),与真实值一致。更一般地,Proposition 3.1 给出下界,表明 \(t_0 |\mu - \hat{\mu}|\)\(\sqrt{d} \eta\) 项是必要的。

这个特例揭示了论文的核心数学困难:当 \(P^*\) 非高斯时,\(\nabla v(s, X_s)\) 不再是常数,需要 Lipschitz 条件 (3.1) 或 (3.7) 来控制其变化。Föllmer 过程的鞅性质使得离散化误差的 \(L^2\) 分析简化为对 \(\nabla v\) 的积分,避免了反向 SDE 分析中常见的复杂耦合论证。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:DDPM 采样器在 2-Wasserstein 距离下的误差界,特别是最优 \(\sqrt{d/N}\) 阶的充分条件。
  2. 核心工具/方法:将 DDPM 视为 Föllmer 过程的离散化(而非传统反向 OU 过程),利用其漂移的鞅性质简化误差分解。
  3. 主要结论:(i) 在一般 Lipschitz 条件下得到最优 \(\sqrt{d\eta}\) 阶上界(Theorem 3.1-3.3);(ii) 证明 DDPM 满足对数 Sobolev 不等式(Theorem 3.4),从而通过 T2 不等式从 KL 界导出 \(W_2\) 界;(iii) 对 log-concave 分布,即使目标不满足 T2 不等式,仍能达到最优 \(W_2\) 界(Theorem 3.5-3.6)。

关键设定与假设

  • 假设 [H](L2 score 误差)\(\|\nabla \log \pi_{t_i}(Y_i) - s_i(Y_i)\|_2 \leq \varepsilon_{\text{score}}(t_i)\)含义:score 近似误差在生成分布 \(Y_i\) 下被控制。与已有文献:比 [H'](在 \(S_{t_i} P^*\) 下控制)更强,但更直接用于 Wasserstein 分析。
  • 假设 [H'](population score 误差)\(\|\nabla \log \pi_{t_i}(\xi) - s_i(\xi)\|_2 \leq \varepsilon_{\text{score}}(t_i)\)\(\xi \sim S_{t_i} P^*\)含义:更贴近训练目标。代价:需要额外 Lipschitz 条件 (3.11) 才能用于 Wasserstein 界(Theorem 3.3)。
  • Lipschitz 条件 (3.1)(双侧)\(-t L(t) I_d \preceq \nabla^2 \log f_t(x) \preceq t L(t) I_d\)含义\(\log f_t\) 的 Hessian 被 \(t L(t)\) 控制。放宽:相比已有工作(如 [2] 需要 \(\int_0^1 L(s) ds < \infty\)),本文允许 \(L(t)\) 发散(如 \(L(t) \sim 1/t\)),但此时 Theorem 3.1 的界可能退化。
  • Lipschitz 条件 (3.7)(单侧)\(\nabla^2 \log f_t(x) \preceq t L(t) I_d\)含义:仅需上界,下界由 (3.6) 自动满足。优势:更弱,允许处理弱对数凹分布。
  • 方差调度条件 (3.8)\(h_i \leq \eta \sqrt{1 - t_{i+1}}\)含义:步长随 \(t\) 接近 1 而减小。与 (3.9) 比较:(3.9) 要求 \(h_i \leq \eta \min\{t_i, 1-t_{i+1}\}\),更强。本文 (3.8) 允许 cosine 调度(Proposition 3.2)。
  • log-concave 假设\(P^*\) 是 log-concave 分布。含义:密度函数 \(\log \pi\) 是凹函数。放宽:相比 strong log-concavity,log-concave 允许更重的尾部(如指数分布)。

主要结果

  • Theorem 3.1(双侧 Lipschitz + 无 early stopping)
  • 陈述:在 [H]、\(\delta=0\)\(\max \beta_i \leq 3/4\) 和 (3.1) 下,
    \[W_2(Y_N, P^*) \leq e^{\int_{t_0}^{t_N} L(s) ds} \left\{ t_0 \left( |\mu - \hat{\mu}| + \sqrt{d \int_0^{t_0} L(s)^2 ds} \right) + \sqrt{d \eta} \sqrt{\int_{t_0}^{t_N} L(s)^2 ds} + 2 \int_{t_0}^{t_N} \frac{\varepsilon_{\text{score}}(s)}{\sqrt{s}} ds \right\}.\]
  • 直觉:误差由初始化(\(t_0\) 项)、离散化(\(\sqrt{d\eta}\) 项)和 score 近似(积分项)组成。指数因子 \(e^{\int L}\) 来自 Lipschitz 条件的累积。
  • 必要条件\(\int_{t_0}^{t_N} L(s)^2 ds < \infty\)。若 \(L(s) \sim 1/s\),则积分发散,界退化。
  • 技术难点:控制离散化误差 \(\mathbb{E}[|\Delta_i|^2]\) 需要 \(\nabla v\) 的 Frobenius 范数界,由 (3.1) 通过 Lemma 4.11 得到。

  • Theorem 3.2(单侧 Lipschitz + early stopping)

  • 陈述:在 [H]、\(\max \beta_i \leq 3/4\)、(3.7)、(3.8) 和 \(t_0 \vee \delta \leq 1/2\) 下,
    \[W_2(Y_N, P^*) \leq \sqrt{2} e^{\int_{t_0}^{t_N} L(s) ds} \left\{ t_0 |\mu - \hat{\mu}| + \sqrt{d} t_0 \left( 2\sqrt{t_0} \vee \sqrt{\int_0^{t_0} L(s)^2 ds} \right) + \sqrt{d \log(1/\delta) + (\text{Tr}(\Sigma) \vee d)} \eta + 2 \int_{t_0}^{t_N} \frac{\varepsilon_{\text{score}}(s)}{\sqrt{s}} ds \right\} + \sqrt{\delta^2 \text{Tr}(\Sigma) + d \delta}.\]
  • 改进:下界由 (3.6) 自动满足,无需假设。离散化误差界 (Lemma 4.10) 利用 \(v_t\) 的鞅性质和 Lemma 4.3,得到 \(\sum \|\Delta_i\|_2^2 \leq d \eta^2 \log(1/\delta) + (\text{Tr}(\Sigma) \vee d) \eta^2\)
  • 技术难点:Lemma 4.10 的证明需要巧妙利用 \(h_i^2 \leq \eta^2 (1-t_{i+1})\) 和 telescoping sum。

  • Theorem 3.4(DDPM 满足 LSI)

  • 陈述:若 \(s_i\) 满足 (3.11),则 \(Y_N\) 的分布满足 \(\text{LS}(2 e^{2 \int_{t_0}^{t_N} L(s) ds})\)
  • 意义:通过 Otto-Villani 定理,\(W_2(Y_N, P^*) \leq \sqrt{2 \cdot 2 e^{2 \int L}} \sqrt{\text{KL}(S_{t_N} P^* \| P_{Y_N})}\)。因此,若已有 KL 界(如 Jiao et al. 2025),可立即得到 \(W_2\) 界(至多差对数因子)。
  • 证明路线:归纳法,利用 Lipschitz 映射保持 LSI 的性质(Vempala & Wibisono 2023, Lemma 16-17)。

  • Theorem 3.5(log-concave 分布,\(\hat{\mu}\) 接近 \(\mu\)

  • 陈述:在 [H]、\(\max \beta_i \leq 3/4\)、(3.14) 和 \(t_0 \vee \delta \leq 1/2\) 下,若 \(P^*\) 是 log-concave,则
    \[W_2(Y_N, P^*) \leq C \left\{ |\mu - \hat{\mu}| + \Lambda \sqrt{d t_0} + \left( \Lambda \sqrt{d \log(1/t_0)} + \sqrt{d \log(1/\delta)} \right) \eta + \int_{t_0}^{t_N} \frac{\varepsilon_{\text{score}}(s)}{s^{3/2}} ds \right\} + \sqrt{\delta^2 \text{Tr}(\Sigma) + d \delta}.\]
  • 关键:即使 \(P^*\) 不满足 T2 不等式(如 log-concave 但非强对数凹),仍能达到 \(\sqrt{d \eta}\) 阶(\(\eta \sim 1/N\))。代价是 score 近似误差的积分权重变为 \(1/s^{3/2}\)(比 Theorem 3.1 的 \(1/\sqrt{s}\) 更重)。
  • 技术难点:需要精细的 \(L^4\) 初始化误差界(Lemma 4.17)和 \(\nabla m\) 的二阶导数界(Lemma 4.18),利用 log-concave 分布的凸几何性质(Klartag & Lehec 的薄壳界)。

  • Theorem 3.6(log-concave 分布,一般 \(\hat{\mu}\)

  • 陈述:在 Theorem 3.5 的假设下,若 \(t_0 \leq (\Lambda d^2)^{-1}\)\(\sqrt{\Lambda d \log(1/t_0)} \eta \leq 1\),则
    \[W_2(Y_N, P^*) \leq C' \left\{ \sqrt{\Lambda t_0} |\mu - \hat{\mu}| + \Lambda^{-1/4} t_0^{1/4} |\mu - \hat{\mu}|^2 + \Lambda^{3/2} \sqrt{d t_0} + \left( \Lambda \sqrt{d \log(1/t_0)} + \sqrt{d \log(1/\delta)} \right) \eta + 4 \int_{t_0}^{t_N} \frac{\varepsilon_{\text{score}}(s)}{s^{3/2}} ds \right\} + \sqrt{\delta^2 \text{Tr}(\Sigma) + d \delta}.\]
  • 改进:当 \(|\mu - \hat{\mu}|\) 较大时,通过选择 \(t_k \approx \sqrt{t_0/\Lambda}\) 作为分界点,在早期步使用更精细的 \(L^4\) 分析(Lemma 4.19),将初始化误差从 \(t_0 |\mu - \hat{\mu}|\) 改进为 \(\sqrt{\Lambda t_0} |\mu - \hat{\mu}| + \Lambda^{-1/4} t_0^{1/4} |\mu - \hat{\mu}|^2\)

证明路线与技术技巧

整体路线(以 Theorem 3.2 为例)

  1. 步骤 1:Föllmer 过程表示。将 DDPM 样本 \(Y_N\) 与 Föllmer 过程 \(X_t\) 的离散化 \(X_{t_i}^N\) 联系起来(Section 4.1)。关键:\(Y_N \overset{d}{=} t_N^{-1/2} \hat{X}_{t_N}\),其中 \(\hat{X}_{t_i}\)\(X_{t_i}^N\) 的 score 近似版本。
  2. 步骤 2:误差分解。Lemma 4.9:\(W_2(Y_N, P^*) \leq t_N^{-1/2} (\|\hat{X}_{t_N} - X_{t_N}^N\|_2 + \|X_{t_N}^N - X_{t_N}\|_2) + W_2(S_{t_N} P^*, P^*)\)。三项分别对应 score 近似、离散化+初始化、early stopping。
  3. 步骤 3:控制离散化误差。Lemma 4.6(\(p=2\)):\(\|X_{t_N} - X_{t_N}^N\|_2 \leq e^{\int L} \|X_{t_0} - X_{t_0}^N\|_2 + \sqrt{\sum_i e^{2 \int L} \|\Delta_i\|_2^2}\)。其中 \(\Delta_i = \int_{t_i}^{t_{i+1}} (v_r - v_{t_i}) dr\)
  4. 步骤 4:控制 \(\|\Delta_i\|_2^2\)。Lemma 4.10:利用 \(v_t\) 的鞅性质和 Lemma 4.3,得到 \(\sum \|\Delta_i\|_2^2 \leq d \eta^2 \log(1/\delta) + (\text{Tr}(\Sigma) \vee d) \eta^2\)。关键跳跃:\(h_i^2 \leq \eta^2 (1-t_{i+1})\) 允许 telescoping sum。
  5. 步骤 5:控制初始化误差\(\|X_{t_0} - X_{t_0}^N\|_2 \leq t_0 |\mu - \hat{\mu}| + \sqrt{d} t_0 (2\sqrt{t_0} \vee \sqrt{\int_0^{t_0} L(s)^2 ds})\)。利用 (4.24) 和 Lemma 4.11。
  6. 步骤 6:控制 score 近似误差。Lemma 4.7:\(\|\hat{X}_{t_N} - X_{t_N}^N\|_2 \leq e^{\int L} \sum_i e^{\int L} \varepsilon_{\text{score}}(t_i) h_i / \sqrt{t_i} \leq 2 e^{\int L} \int_{t_0}^{t_N} \varepsilon_{\text{score}}(s) / \sqrt{s} ds\)
  7. 步骤 7:控制 early stopping 误差。Lemma 4.8:\(W_2(S_{t_N} P^*, P^*) \leq \sqrt{\delta^2 \text{Tr}(\Sigma) + d \delta}\)
  8. 步骤 8:合并。代入 \(t_N^{-1/2} \leq \sqrt{2}\),得到最终界。

关键跳跃点: - Lemma 4.1(Föllmer 漂移的鞅表示):证明 \(v_t = \mu + \int_0^t \nabla v(s, X_s) dW_s\)。这是整个分析的基础,使得离散化误差的 \(L^2\) 范数可通过 Itô 等距转化为 \(\nabla v\) 的积分。 - Lemma 4.10(离散化误差的通用界):利用 \(h_i^2 \leq \eta^2 (1-t_{i+1})\) 和 Lemma 4.3 的恒等式 \(\mathbb{E}[|v_t|^2] = \frac{d - \mathbb{E}[\text{Tr}(\Gamma_t)]}{1-t} + \text{Tr}(\Sigma) - d\),将 \(\sum \|\Delta_i\|_2^2\) 转化为 telescoping sum。这是 Theorem 3.2 达到 \(\sqrt{d\eta}\) 阶的关键。 - Lemma 4.12(log-concave 分布的算子范数界):证明 \(\|\|V_t\|_{\text{op}}\|_p \lesssim p \Lambda\)\(\mathbb{E}[\|V_t\|_F^2] \lesssim \Lambda^2 d\)。这是 Theorem 3.5-3.6 处理 log-concave 分布的基础,利用了 Klartag & Lehec 的薄壳界和 Guan 的 slicing 问题结果。 - Lemma 4.19(log-concave 分布的初始化误差精细界):通过将早期步(\(t_i\) 小)的误差分析从 \(L^2\) 提升到 \(L^4\),并利用 \(\nabla m\) 的二阶导数界(Lemma 4.18),将初始化误差从 \(t_0 |\mu - \hat{\mu}|\) 改进为 \(\sqrt{\Lambda t_0} |\mu - \hat{\mu}| + \Lambda^{-1/4} t_0^{1/4} |\mu - \hat{\mu}|^2\)

技术技巧点名: - Föllmer 过程:核心创新,将 DDPM 与一个漂移为鞅的 SDE 联系起来,简化误差分解。 - 鞅表示与 Itô 等距:用于控制离散化误差 \(\|\Delta_i\|_2\)。 - \(L^p\) 空间的 2-光滑性:Lemma 4.5,用于 \(p>2\) 时的误差传播(Theorem 3.6 需要 \(p=4\))。 - 凸几何中的薄壳界与 slicing 问题:Lemma 4.12 的证明依赖 Klartag & Lehec (2025) 和 Guan (2024) 的结果。 - Brascamp-Lieb 不等式:用于 Lemma 4.18 中 \(\nabla^2 m\) 的界。 - Freedman 不等式:用于 Lemma A.8 的证明(控制 \(\|V_t\|_{\text{op}}\) 的尾部概率)。 - Otto-Villani 定理:将 LSI 转化为 T2 不等式,从而从 KL 界导出 \(W_2\) 界(Corollary 3.3)。

真实例子与应用

本文为 纯理论分析,无真实数据例子或模拟实验。所有结果均为定理和推论,没有实证验证。

🔎 结论是否比证明窄

  • Theorem 3.1 的指数因子:上界包含 \(e^{\int L}\),但 Proposition 3.1 的下界(高斯情形)显示该因子可能不是必要的。作者在 Corollary 3.1 中通过弱对数凹假设给出了 \(\lambda\) 的具体形式,但未证明该因子的 tightness。
  • Theorem 3.5 的 \(\int \varepsilon_{\text{score}} / s^{3/2} ds\):当 \(\varepsilon_{\text{score}}(t) \sim \varepsilon / \sqrt{1-t}\) 时,该积分 \(\lesssim \varepsilon / \sqrt{t_0}\),比 Theorem 3.1 的 \(\int \varepsilon_{\text{score}} / \sqrt{s} ds \lesssim \varepsilon\) 更差。作者在 Remark 3.7 中承认这一点,但未讨论是否可改进。
  • Theorem 3.6 的 \(t_0\) 条件:需要 \(t_0 \leq (\Lambda d^2)^{-1}\)\(t_0 \leq c (\Lambda \log^4(d+1))^{-1}\)。这些条件在 \(d\) 很大时非常严格(\(t_0 \sim 1/d^2\)),可能限制实际应用。作者未讨论是否可放松。
  • log-concave 假设的必要性:Theorem 3.5-3.6 依赖 log-concave 分布的凸几何性质(Lemma 4.12)。作者在 Section 3 末尾提问“是否能在更一般分布下达到最优界”,但未给出答案。

四、开放问题

  1. 初始化误差中 \(\sqrt{d} t_0^{3/2}\) 项的最优性:Proposition 3.1 的下界暗示该项可能可改进为 \(\sqrt{d} t_0^2\)。作者在 Theorem 3.1 后明确提到“We leave the optimality of this term for future work”。扎根:Theorem 3.1 证明后的讨论。

  2. log-concave 分布下 score 近似误差的积分权重:Theorem 3.5 的 \(\int \varepsilon_{\text{score}} / s^{3/2} ds\) 比 Theorem 3.1 的 \(\int \varepsilon_{\text{score}} / \sqrt{s} ds\) 更差。能否在 log-concave 假设下改进到 \(\int \varepsilon_{\text{score}} / \sqrt{s} ds\)扎根:Remark 3.7 和 Theorem 3.5 的陈述。

  3. 非 log-concave 分布下的最优性:Theorem 3.5-3.6 假设 \(P^*\) 是 log-concave。能否推广到更一般的分布(如满足 Poincaré 不等式或 LSI 的分布)?扎根:Section 3 末尾的讨论:“it is natural to ask whether one can obtain a bound of order \(\sqrt{d\eta}\) even when the target distribution does not satisfy a quadratic transportation cost inequality”。

  4. Föllmer 过程视角的进一步应用:本文仅分析了 DDPM(ancestral sampling)。能否将 Föllmer 过程视角应用于其他采样器(如 DDIM、probability flow ODE)?扎根:Section 1 提到“Our analysis is based on interpreting the DDPM sampler as a discretization of the Föllmer process, rather than the reverse Ornstein–Uhlenbeck process”,但未讨论其他采样器。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论