跳转至

Nonparametric quantile inference using Dirichlet processes

作者: Nils Lid Hjort, Sonia Petrone
主题: 非参数 / 半参数
相关性: 7/10
链接: https://arxiv.org/abs/2608.08355


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在非参数设定下,如何对分位数函数 \(Q(y) = F^{-1}(y)\) 进行贝叶斯推断,包括点估计、区间估计和不确定性量化。核心挑战在于,分位数是分布函数 \(F\) 的非线性泛函,即使 \(F\) 的先验(如 Dirichlet 过程)是离散的,其后验推断(尤其是后验均值)却可能产生光滑曲线,这需要一套不同于分布函数推断的数学工具。当前成熟度:已有零散结果(如后验分布的特征、与核估计的联系),但缺乏统一的显式公式、Bernstein–von Mises (BvM) 定理以及扩展到两样本和回归的完整框架。

发展脉络(history)

从论文的引言和参考文献,可以梳理出以下脉络:

  • 奠基工作:Ferguson (1973, 1974) 提出了 Dirichlet 过程作为概率测度上的先验,并给出了其基本性质(如边缘 Beta 分布)。Doksum (1974a) 引入了移位函数 \(D(x) = G^{-1}(F(x)) - x\) 用于两样本比较,并给出了其非参数估计的渐近分布。Parzen (1979, 1982) 提出了比较分布 \(\pi(y) = G(F^{-1}(y))\) 作为分析两样本差异的工具。这些工作奠定了分位数相关函数在频率学派框架下的基础。
  • 主要进展:Hjort (1986, 1996) 研究了 Dirichlet 过程的“钉住”(pinned down)性质,即条件于某些集合上的概率后,子过程独立且仍为 Dirichlet。这一性质被本文用于推导多个分位数的联合后验分布。Sheather 和 Marron (1990) 以及 Cheng (1995) 研究了核光滑分位数估计,并指出 Bernstein 多项式型估计(即本文的 \(bQ_0\))与核估计的渐近等价性。Lo (1987) 对贝叶斯 bootstrap 进行了大样本研究,为本文的 BvM 定理提供了背景。
  • 当前 frontier:Hjort 和 Walker (2006) 提出了分位数金字塔过程(quantile pyramid processes),这是一种更直接的分位数先验构建方法,但依赖 MCMC 模拟。Conti (2004) 独立地得到了后验分位数过程的 BvM 结果,使用了强匈牙利表示(strong Hungarian representation),但本文指出其方法在边界 \(y\) 接近 0 或 1 时不如本文的直接方法。
  • 本文的位置:本文在 Dirichlet 过程框架下,首次给出了分位数后验均值和方差的显式表达式(公式 (8) 和 (10)),并证明了后验分位数过程的 BvM 定理(Proposition 4)。与 Hjort 和 Walker (2006) 的分位数金字塔相比,本文提供了无需模拟的显式公式;与 Conti (2004) 相比,本文的证明更直接(使用 Doss 和 Gill (1992) 的函数 delta 方法),且覆盖了 \(y \in [\varepsilon, 1-\varepsilon]\) 的内部区域。

子线索聚类

这些被引文献大致落在三条子线索上:

  1. 贝叶斯非参数先验与推断:Ferguson (1973, 1974), Hjort (1986, 1996, 2003), Lo (1987), Diaconis 和 Freedman (1986a, 1986b)。这一簇关注 Dirichlet 过程及其变体的性质、后验计算和一致性。本文属于此簇,但聚焦于分位数这一特定泛函。
  2. 分位数函数的频率学派估计:Sheather 和 Marron (1990), Cheng (1995), Shorack 和 Wellner (1986)。这一簇研究核光滑分位数估计、经验分位数过程的渐近理论。本文通过建立 \(bQ_0\) 与核估计的联系(Remark 1)以及 BvM 定理,将贝叶斯与频率学派结果桥接起来。
  3. 分位数相关的应用与函数:Doksum (1974a), Parzen (1979, 1982), Lorenz (1905), Aaberge (2001), Laake, Laake 和 Aaberge (1985)。这一簇关注移位函数、比较分布、Lorenz 曲线和 Gini 指数等。本文为这些函数提供了贝叶斯版本(Section 5-6)。

这个方向在追问的核心问题

  • 问题 1:如何对分位数函数进行非参数贝叶斯推断,且后验均值是光滑的?已知瓶颈:Dirichlet 过程后验的分布函数估计(如 \(eF_n\))是阶梯函数,但分位数后验均值却是光滑的,这一“光滑性增益”的数学机制需要阐明。
  • 问题 2:贝叶斯分位数估计是否具有频率学派有效性(即后验置信区间是否达到名义覆盖)?已知瓶颈:非参数贝叶斯中 BvM 定理不一定成立(Diaconis 和 Freedman, 1986a, 1986b),需要验证 Dirichlet 过程下分位数泛函是否满足 BvM。
  • 问题 3:如何将分位数推断扩展到更复杂的设定(如两样本比较、回归)?已知瓶颈:频率学派已有 Doksum 移位函数和 Parzen 比较分布的渐近理论,但贝叶斯版本缺乏显式公式和 BvM 结果。

⚠️ 作者的 framing

作者将缺口 frame 成:“Dirichlet 过程下分位数后验的显式公式和 BvM 定理尚未被充分研究”,从而让本文成为“显然的下一步”。具体来说: - 作者声称 Ferguson (1973, p. 224) 曾指出后验期望“难以计算,甚至可能不存在”,而本文给出了存在性条件和显式公式(Proposition 2)。 - 作者将非信息极限 \(a \to 0\) 下的 \(bQ_0\) 与 Bernstein 多项式光滑分位数估计联系起来,并指出其“自动”产生一个无需光滑参数的密度估计(Section 4)。 - 被淡化或回避的竞争路线:Hjort 和 Walker (2006) 的分位数金字塔过程被提及,但作者强调其依赖 MCMC 模拟,而本文提供显式公式。然而,分位数金字塔可能更灵活(如允许非 Dirichlet 先验),本文未深入比较。 - 什么明显该被引却没出现:论文未引用任何关于分位数回归的贝叶斯非参数方法(如 Kottas 和 Gelfand, 2001 虽被引用,但那是半参数中位数回归,而非分位数回归)。此外,关于高维分位数回归分位数过程的 bootstrap 方法的近期工作也未出现。这可能是值得研究者去查的 gap。

张力

被引工作之间未见明显对立。但存在一个隐含张力:Dirichlet 过程先验的离散性 vs. 分位数后验均值的光滑性。作者在 Section 4 中明确承认“这应被视为数学上的巧合”(mathematical happenstance),而非理论上的必然。这一张力在 Diaconis 和 Freedman (1986a, 1986b) 关于贝叶斯估计不一致性的讨论中有所体现,但本文的 BvM 定理表明在此设定下无此问题。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \(F\):未知的分布函数(随机变量,服从 Dirichlet 过程先验)。
  • \(Q(y) = F^{-1}(y) = \inf\{t: F(t) \ge y\}\):分位数函数(\(y \in [0,1]\)),是本文的 estimand。
  • \(F_0\):先验基准分布(prior guess),是已知的概率分布。
  • \(a > 0\):Dirichlet 过程的强度参数(precision parameter)。
  • \(\alpha(\cdot) = a F_0(\cdot)\):Dirichlet 过程的参数测度。
  • \(X_1, \ldots, X_n\):i.i.d. 样本,来自真实分布 \(F_{\text{tr}}\)
  • \(F_n\):经验分布函数。
  • \(x_{(1)} < \cdots < x_{(n)}\):有序样本。
  • \(\text{Be}(\cdot; b, c)\)\(\text{be}(\cdot; b, c)\):Beta 分布的分布函数和密度函数,参数为 \((b, c)\)
  • \(W_0(y)\):定义在 \([0,1]\) 上的 Brownian bridge,均值为 0,协方差为 \(y_1(1-y_2)\)\(y_1 \le y_2\))。
  • \(q_{\text{tr}}(y) = 1 / f_{\text{tr}}(Q_{\text{tr}}(y))\):真实分位数密度函数。

  • 模型

  • 数据生成机制:\(X_1, \ldots, X_n \mid F \stackrel{\text{i.i.d.}}{\sim} F\),其中 \(F\) 是随机分布。
  • 先验:\(F \sim \text{Dir}(a F_0)\),即 Dirichlet 过程,参数测度为 \(a F_0\)
  • 后验:给定数据,\(F \mid \text{data} \sim \text{Dir}(a F_0 + n F_n)\),即更新后的 Dirichlet 过程,参数测度为 \(a F_0 + n F_n\)
  • 要估的对象:分位数函数 \(Q(y)\) 及其后验分布。

  • 可观测数据

  • 可观测:样本 \(X_1, \ldots, X_n\) 的具体数值(假设无重复),以及由此计算的经验分布 \(F_n\)
  • 不可观测(潜在量):真实的 \(F\)\(Q\)。后验推断依赖于 Dirichlet 过程的性质,将 \(F\) 视为随机变量。

第二步:最小内核——非信息极限 \(a \to 0\) 下的分位数后验均值

本文的核心思路可以通过非信息极限 \(a \to 0\) 这一最简特例来理解。在这个特例下,Dirichlet 过程先验退化为“无信息”先验,后验分布完全由数据驱动。

  • 最简特例:设 \(a = 0\)。此时,后验 Dirichlet 过程 \(\text{Dir}(n F_n)\) 的支撑集中在数据点上。具体来说,随机分布 \(F\) 以概率 1 是离散的,其质量集中在 \(n\) 个数据点 \(x_{(1)}, \ldots, x_{(n)}\) 上,且这些点的概率权重 \((D_1, \ldots, D_n)\) 服从 Dirichlet 分布,参数为 \((1, \ldots, 1)\)(即均匀分布在单纯形上)。

  • 核心命题:在 \(a=0\) 下,分位数 \(Q(y)\) 的后验均值 \(bQ_0(y)\) 有显式表达式:

    \[bQ_0(y) = \sum_{i=1}^n \binom{n-1}{i-1} y^{i-1} (1-y)^{n-i} x_{(i)}.\]
    这是一个关于 \(y\)\((n-1)\) 次多项式,从 \(bQ_0(0) = x_{(1)}\) 光滑地上升到 \(bQ_0(1) = x_{(n)}\)

  • 为什么这是最小内核

  • 这个公式揭示了整篇论文的核心机制:后验分位数均值是数据点的加权平均,权重是二项式概率。这些权重来自 Dirichlet 过程后验的 Beta 分布性质(公式 (5))。
  • 它直接给出了一个光滑的分位数估计,无需任何光滑参数选择。
  • 从它出发,可以推导出密度估计(Section 4)、Lorenz 曲线和 Gini 指数(Section 5)、以及两样本比较的贝叶斯版本(Section 6)。
  • 论文的一般情形(\(a > 0\))只是在这个公式上增加了先验 \(F_0\) 的“收缩”项,但核心结构不变。

  • 证明思路(在最小内核下)

  • 由 Dirichlet 过程后验,\(F\) 在数据点上的概率权重 \((D_1, \ldots, D_n) \sim \text{Dir}(1, \ldots, 1)\)
  • 分位数 \(Q(y)\) 等于 \(x_{(N(y))}\),其中 \(N(y)\) 是满足 \(D_1 + \cdots + D_i \ge y\) 的最小 \(i\)
  • 事件 \(\{Q(y) = x_{(i)}\}\) 等价于 \(\{S_{i-1} < y \le S_i\}\),其中 \(S_i = D_1 + \cdots + D_i\)
  • 由于 \((S_1, \ldots, S_{n-1})\)\(n-1\) 个均匀顺序统计量,\(\Pr\{S_{i-1} < y \le S_i\} = \binom{n-1}{i-1} y^{i-1} (1-y)^{n-i}\)
  • 因此,后验均值 \(bQ_0(y) = \sum_{i=1}^n x_{(i)} \Pr\{Q(y) = x_{(i)}\}\) 即得公式。

  • 读者收获:读完这一节,读者应理解:本文在数学上干的事,本质上是用 Dirichlet 过程后验的 Beta 分布性质,将分位数后验均值表示为数据点的加权平均,权重是二项式概率,从而得到一个光滑估计。所有后续结果(BvM 定理、密度估计、两样本扩展)都是在这个核心公式上叠加渐近分析和函数变换。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在 Dirichlet 过程先验下,对分位数函数 \(Q(y) = F^{-1}(y)\) 进行非参数贝叶斯推断,包括后验分布的特征、显式后验均值和方差公式、以及后验过程的 Bernstein–von Mises 定理。
  2. 核心工具/方法:利用 Dirichlet 过程的 Beta 边缘分布性质、钉住(pinned down)性质、以及 Doss 和 Gill (1992) 的函数 delta 方法,推导出分位数后验的显式表达式和渐近分布。
  3. 主要结论:给出了后验均值和方差的显式公式(公式 (8) 和 (10));证明了后验分位数过程 \(\sqrt{n}(Q - bQ_a)\) 收敛到 Brownian bridge 乘以分位数密度(Proposition 4);由此导出了自动的、无需光滑参数的非参数密度估计(公式 (11));并将方法扩展到 Lorenz 曲线、Gini 指数、Doksum 移位函数、Parzen 比较分布和分位数回归。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 设定:数据 \(X_1, \ldots, X_n\) i.i.d. 来自真实分布 \(F_{\text{tr}}\)。先验为 \(F \sim \text{Dir}(a F_0)\),其中 \(a > 0\) 固定,\(F_0\) 为已知连续分布。后验为 \(F \mid \text{data} \sim \text{Dir}(a F_0 + n F_n)\)
  • 假设
  • Proposition 3 和 4 的假设\(F_{\text{tr}}\) 具有正且连续的密度 \(f_{\text{tr}}\)(保证分位数密度 \(q_{\text{tr}}\) 存在且连续)。此外,对于 Proposition 2,要求先验均值 \(E_0|X| = \int |x| dF_0(x)\) 有限(保证后验均值存在)。
  • 相比已有文献:本文的假设与经典经验过程理论(Shorack 和 Wellner, 1986)一致,未额外放宽或强化。但与 Hjort 和 Walker (2006) 的分位数金字塔相比,本文的 Dirichlet 过程先验假设更具体(后者更灵活)。
  • 关键假设的统计含义\(f_{\text{tr}}\) 正且连续保证了分位数过程 \(\sqrt{n}(F_n^{-1} - Q_{\text{tr}})\) 的弱收敛,这是 BvM 定理成立的基础。

主要结果

  • Proposition 1:对于固定 \(a > 0\),后验概率质量集中在数据点上的总和趋于 1(当 \(n \to \infty\))。这说明了即使先验有信息,后验也渐近地被数据主导。
  • Proposition 2:后验均值 \(bQ_a(y)\) 存在且有限当且仅当先验均值 \(E_0|X|\) 有限。这解决了 Ferguson (1973) 提出的存在性问题。
  • Proposition 4(核心 BvM 定理):在 \(F_{\text{tr}}\) 有正连续密度的条件下,后验分位数过程 \(\sqrt{n}(Q(y) - eF_n^{-1}(y)) \mid \text{data}\) 几乎必然收敛到 \(q_{\text{tr}}(y) W_0(y)\),其中 \(eF_n = (a F_0 + n F_n)/(a+n)\) 是后验均值分布函数。直觉:后验分位数过程与频率学派经验分位数过程渐近等价,且后验不确定性由 Brownian bridge 刻画。必要条件\(f_{\text{tr}}\) 正且连续;\(y \in [\varepsilon, 1-\varepsilon]\) 以避免边界效应。解决的技术难点:需要将 Dirichlet 后验的弱收敛(Proposition 3)通过函数 delta 方法(Doss 和 Gill, 1992)映射到分位数泛函上。
  • 推论\(bQ_0(y) \pm 1.96 \sqrt{bV_0(y)}\) 是渐近点wise 95% 置信/可信区间(在频率学派和贝叶斯意义下均成立)。

证明路线与技术技巧

整体路线(以 Proposition 4 为例): 1. Step 1:分布函数后验的 BvM(Proposition 3):证明后验分布函数过程 \(\sqrt{n}(F - eF_n) \mid \text{data}\) 收敛到 \(W_0(F_{\text{tr}}(\cdot))\)。证明分两步:有限维收敛(利用 Dirichlet 向量的渐近正态性)和 tightness(利用四阶矩不等式和 Billingsley 的定理)。 2. Step 2:函数 delta 方法:将 Step 1 的结果通过逆泛函 \(F \mapsto Q = F^{-1}\) 映射到分位数过程。使用 Doss 和 Gill (1992) 的定理 2,该定理给出了在 Hadamard 可微泛函下后验过程的弱收敛。关键条件是 Step 1 中的收敛在 Skorokhod 拓扑下成立,且逆泛函在 \(F_{\text{tr}}\) 处 Hadamard 可微(导数为 \(-1/f_{\text{tr}}(Q_{\text{tr}}(\cdot))\))。 3. Step 3:得到分位数后验的极限:由 Step 2,\(\sqrt{n}(Q - eF_n^{-1}) \mid \text{data}\) 收敛到 \(-W_0(F_{\text{tr}}(Q_{\text{tr}}(y))) / f_{\text{tr}}(Q_{\text{tr}}(y)) = q_{\text{tr}}(y) W_0(y)\)(因为 \(-W_0\)\(W_0\) 同分布)。 4. Step 4:等价性:证明 \(\sqrt{n}(eF_n^{-1} - F_n^{-1}) \to_p 0\)(由 Step 1 和函数 delta 方法),从而后验分位数过程与频率学派经验分位数过程渐近等价。

关键跳跃点: - 从 Dirichlet 后验到分布函数后验的 tightness:需要计算四阶矩 \(E\{V_n(s,t]^2 V_n(t,u]^2 \mid \text{data}\}\),并证明其被 \(3 eF_n(s,t] eF_n(t,u]\) 控制。这依赖于 Dirichlet 分布的高阶矩公式(论文中给出了 \((U,V,W)\) 的显式表达式)。这一计算是技术性的,但确保了 tightness。 - 函数 delta 方法的“几乎必然”版本:Doss 和 Gill (1992) 的定理 2 是“依概率”版本,但本文需要“几乎必然”版本以得到 Proposition 4 的 a.s. 收敛。作者声称通过使用 Proposition 3 证明中构造的概率为 1 的集合 \(\Omega\),可以扩展该定理。

技术技巧点名: - Dirichlet 分布的高阶矩计算:用于证明分布函数后验的 tightness(Section 7.1)。 - 函数 delta 方法(Doss 和 Gill, 1992):将分布函数后验的收敛“提升”到分位数后验,避免了直接处理分位数过程的复杂计算。 - Beta 分布的偏积分公式(公式 (A1)):用于简化后验概率质量的计算(如公式 (4) 和 (6))。 - 表示定理:将 \(Q(y)\) 表示为 \(x_{(N(y))}\),其中 \(N(y)\) 是累积和过程,从而将分位数问题转化为顺序统计量问题(Section 2.4)。

真实例子与应用

  • 数据 1:Bjerkedal (1960) 的豚鼠生存数据(Section 6, Figure 3):
  • 场景:65 只对照组和 60 只治疗组豚鼠的生存时间,研究结核杆菌的影响。
  • 方法应用:使用非信息极限下的贝叶斯 Doksum 移位函数估计 \(bD_0(x)\),并计算点wise 90% 可信带。
  • 结果\(bD_0(x)\) 与 Doksum 的样本估计 \(eD(x)\) 非常接近。可信带显示:弱豚鼠(早死)因治疗而延长寿命,强豚鼠(晚死)因治疗而大幅缩短寿命(例如,预期寿命 500 天的豚鼠减少约 200 天)。这与 Doksum (1974a) 的结论一致。
  • 目的:验证贝叶斯方法在实际数据上的可行性,并展示其与频率学派方法的等价性。
  • 数据 2:Laake, Laake 和 Aaberge (1985) 的住院与死亡数据(Section 6, Figure 4):
  • 场景:367 名住院患者(176 男,191 女)和 6140 名死亡者(2989 男,3151 女)的年龄分布,研究住院年龄与死亡年龄的关系。
  • 方法应用:估计分位数差异 \(\Lambda(y) = G^{-1}(y) - F^{-1}(y)\)(其中 \(G\) 为死亡年龄分布,\(F\) 为住院年龄分布),使用 \(b\Lambda(y) = bQ_G(y) - bQ_F(y)\) 和点wise 95% 可信带。
  • 结果:除极年轻和极老年外,住院年龄与死亡年龄近似相差一个常数偏移(女性约 7 年,男性约 6 年)。这与 Laake 等人的结论一致。
  • 目的:展示方法在分组比较中的应用,并验证可信带的覆盖性质。

🔎 结论是否比证明窄

  • 窄的地方:Proposition 4 的收敛是在 \(D[\varepsilon, 1-\varepsilon]\) 空间上(\(y\) 远离 0 和 1),但论文在应用(如 Figure 3 和 4)中使用了整个 \(y\) 范围的可信带。作者在 Section 9 中承认,Conti (2004) 的工作处理了边界情况,但本文的方法在边界处可能不成立。因此,边界处的 BvM 定理未被严格证明,但被泛泛 claim 为“点wise 覆盖正确”。
  • Conjecture 的地方:Section 9 中关于“更信息化的两样本先验”(如假设 \(G(t) = F((t-\delta)/\tau)\))的讨论,作者仅提出这是一个 fruitful 的方向,但未给出任何理论或计算细节。这属于 conjecture 而非结论。
  • 未证明的 claim:Section 4 中声称密度估计 \(bf_0\) 的“自动”性质(无需光滑参数)是一个优点,但未与最优核密度估计(收敛速度 \(n^{-2/5}\))进行理论比较。作者在 Remark 1 中承认 \(bQ_0\) 的平滑量约为 \(O(n^{-1/2})\),这比最优带宽 \(O(n^{-1/3})\) 更小(即欠平滑),但未讨论这对密度估计的影响。

四、开放问题(点到为止,扎根具体语句)

  1. 边界处的 BvM 定理:Proposition 4 的收敛仅在 \(D[\varepsilon, 1-\varepsilon]\) 上成立。对于 \(y\) 接近 0 或 1,后验分位数过程的极限分布是什么?是否仍为 Brownian bridge?扎根:Section 7.2 中“works best on \(D[\varepsilon, 1-\varepsilon]\)”以及 Section 9 中提及 Conti (2004) 的工作。
  2. 同时置信带:论文给出了点wise 可信带,但未构造同时(simultaneous)置信带。Section 9 中提到了通过模拟后验过程或利用极限分布(如 \(\max |W_0(y)|\))的两种方法,但未给出具体实现或理论保证。扎根:Section 9 “Simultaneous confidence bands”段落。
  3. 更信息化的两样本先验:论文假设 \(F\)\(G\) 独立,但在 Doksum 移位函数分析中,若假设 \(G(t) = F((t-\delta)/\tau)\)(位置-尺度平移),可能得到更高效的推断。如何构建此类先验并进行后验计算?扎根:Section 9 “More informative priors for two-sample problems”段落。
  4. 分位数回归的完整贝叶斯推断:Section 8 给出了分位数回归的贝叶斯估计公式,但依赖对 \(\beta\) 后验的模拟(MCMC)。能否得到类似 Section 3 的显式公式(如后验均值的闭式解)?扎根:Section 8 中“The simplest implementation might be to draw a large number of \(\beta\)s from the posterior density”表明当前方法非显式。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论