Efficient Bayesian estimation and use of cut posterior in semiparametric hidden Markov models¶
作者: Daniel Moss, Judith Rousseau
来源: Electronic Journal of Statistics
主题: 非参数 / 半参数
相关性: 7/10
链接: https://doi.org/10.1214/23-ejs2201
一、领域脉络与小综述¶
这个方向是什么¶
本方向关注有限状态隐马尔可夫模型(HMM)中转移矩阵与非参数发射密度的联合估计问题。核心统计挑战在于:转移矩阵是有限维参数(低维、感兴趣的目标),而发射密度是无穷维参数(高维、nuisance),两者通过似然函数耦合。研究者希望同时得到转移矩阵的半参数有效估计(即渐近方差达到半参数效率下界)和发射密度的一致估计(以某个收缩率收敛),并保证贝叶斯推断的渐近正确性(Bernstein-von Mises 定理成立)。当前该方向的成熟度中等:转移矩阵的渐近理论已有若干结果,但非参数发射密度的贝叶斯推断及其与参数部分的联合渐近性质仍不完整。
发展脉络(history)¶
- 奠基工作:HMM 的经典渐近理论
- Leroux (1992):证明了有限状态 HMM 中 MLE 的相合性,奠定了参数部分估计的基础。
- Bickel, Ritov & Rydén (1998):建立了 HMM 中参数 MLE 的渐近正态性,并给出了转移矩阵估计的渐近方差表达式。这是半参数效率理论在 HMM 中的早期应用。
- Douc, Moulines & Stoffer (2004):进一步推广了 MLE 的渐近性质,处理了非平稳初始分布等更一般的设定。
-
口子:这些工作主要关注参数部分,非参数发射密度的估计及其与参数部分的交互未被系统处理。
-
主要进展:非参数 HMM 与贝叶斯方法
- Gassiat & Rousseau (2014):在非参数 HMM 中证明了 Dirichlet 过程混合先验下发射密度的后验收缩率,首次给出了非参数贝叶斯 HMM 的收缩率理论。
- Vernet (2015):建立了非参数 HMM 中发射密度后验的 Bernstein-von Mises 定理,但仅适用于独立同分布观测(即无时间依赖),且要求发射密度属于某个光滑类。
-
口子:这些结果要么只处理发射密度(忽略转移矩阵的估计),要么对时间依赖结构施加了强限制。
-
当前 frontier:模块化贝叶斯与 cut posterior
- Plummer (2015):在因果推断和复杂模型中系统提出了 cut posterior 的概念——当模型的一部分(如转移矩阵)对另一部分(如发射密度)的误设敏感时,通过“切断”似然中的耦合来保护参数估计。
- Carmona & Nieto-Barajas (2021):在 HMM 中应用了 cut posterior,但缺乏理论保证(收缩率、渐近正态性)。
- 本文的位置:作者将 cut posterior 引入非参数 HMM 的贝叶斯推断,并首次给出了联合的半参数 Bernstein-von Mises 定理(转移矩阵)和收缩率定理(发射密度),填补了“模块化贝叶斯在 HMM 中的理论空白”。
子线索聚类¶
- 线索 A:半参数效率理论在 HMM 中的应用
包括 Bickel et al. (1998)、Douc et al. (2004) 以及本文。核心是计算转移矩阵估计的 efficient influence function,并证明其渐近方差达到半参数下界。 - 线索 B:非参数贝叶斯 HMM 的收缩率
包括 Gassiat & Rousseau (2014)、Vernet (2015) 以及本文。核心是使用 Dirichlet 过程混合先验或类似非参数先验,证明发射密度后验以某个速率收敛到真值。 - 线索 C:模块化贝叶斯与 cut posterior
包括 Plummer (2015)、Carmona & Nieto-Barajas (2021) 以及本文。核心是当模型部分误设时,通过 cut posterior 保护感兴趣参数的推断,并建立其渐近性质。
这个方向在追问的核心问题¶
- 转移矩阵的估计能否达到半参数效率下界? 当前主流方法(如 MLE)在发射密度被正确指定时是有效的,但一旦发射密度被误设,效率可能丧失。
- 非参数发射密度的后验收缩率是多少? 已知结果(Gassiat & Rousseau, 2014)给出了一个速率,但该速率是否最优?与转移矩阵的估计如何交互?
- cut posterior 在 HMM 中是否保持渐近正确性? 即 cut posterior 是否仍能给出相合且渐近正态的推断?
- 平滑概率(smoothing probabilities)的贝叶斯推断是否可行? 平滑概率是 HMM 中重要的潜在变量后验,其收缩率通常需要样本分割技巧,能否避免?
⚠️ 作者的 framing¶
作者将缺口 frame 为:“现有工作要么只处理参数部分(Bickel et al., 1998),要么只处理非参数部分(Gassiat & Rousseau, 2014),且 cut posterior 在 HMM 中缺乏理论保证。” 因此本文成为“显然的下一步”:同时处理两部分,并给出 cut posterior 的收缩率定理。
- 被淡化或回避的竞争路线:作者未讨论频率学派的模块化估计(如 two-step estimation with cross-fitting),也未与贝叶斯非参数中的 joint posterior(即不 cut 的完整贝叶斯方法)进行对比。
- 明显该被引 / 该存在、却没出现在 intro 里:
- van der Vaart (1998) 的半参数效率理论:虽然 Bickel et al. (1998) 被引,但 van der Vaart 的经典教材未被提及,可能因为作者假设读者已熟悉。
- Castillo & Rousseau (2015) 关于非参数贝叶斯收缩率的通用框架:该文给出了后验收缩率的通用条件,本文的收缩率定理(Theorem 3.2)本质上是在应用该框架,但未明确引用。
- 关于 cut posterior 的早期理论工作:如 Liu, Gelman & Hill (2014) 在因果推断中提出的“cutting feedback”概念,本文仅引了 Plummer (2015),可能遗漏了更早的文献。
张力¶
未见明显对立引用。所有被引工作基本一致地认为:HMM 中参数与非参数部分的联合推断是困难的,cut posterior 是一种有前景的解决方案,但缺乏理论。本文填补了这一空白。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( X_t \in \{1, \dots, K\} \):有限状态隐状态(潜在变量),\( K \) 已知。
- \( Y_t \in \mathbb{R}^d \):观测变量(发射),连续或离散。
- \( \Pi = (\pi_{ij})_{i,j=1}^K \):转移矩阵,其中 \( \pi_{ij} = P(X_{t+1}=j \mid X_t=i) \)。这是有限维参数,目标 estimand。
- \( f_j(y) \):状态 \( j \) 下的发射密度(非参数),\( j=1,\dots,K \)。这是无穷维参数,nuisance。
- \( \theta = (\Pi, f_1, \dots, f_K) \):完整参数。
- \( Y_{1:T} = (Y_1, \dots, Y_T) \):可观测数据(长度为 \( T \) 的时间序列)。
- \( X_{1:T} \):潜在状态序列(不可观测)。
- \( \mu \):初始分布 \( P(X_1 = j) \),通常假设已知或与 \( \Pi \) 一起估计。
-
\( \ell_T(\theta) = \log p_\theta(Y_{1:T}) \):边际对数似然(对潜在状态求和后得到)。
-
模型:
- 数据生成机制:\( X_t \) 是齐次 Markov 链,转移矩阵 \( \Pi \);给定 \( X_t = j \),\( Y_t \sim f_j \) 独立于过去。
- 可观测数据的边际分布:\( p_\theta(Y_{1:T}) = \sum_{x_{1:T}} \mu(x_1) \prod_{t=1}^{T-1} \pi_{x_t, x_{t+1}} \prod_{t=1}^T f_{x_t}(Y_t) \)。
-
已知:\( K \) 已知,\( \mu \) 已知或可估计。未知:\( \Pi \) 和 \( f_1, \dots, f_K \)。
-
可观测数据:研究者实际能观测到的是 \( Y_{1:T} \)(长度为 \( T \) 的序列)。不可观测的是 \( X_{1:T} \)(潜在状态)和发射密度 \( f_j \) 的函数形式。转移矩阵 \( \Pi \) 只能通过似然函数间接识别。
第二步:讲最小内核¶
最简特例:假设 \( K=2 \)(两个状态),且发射密度 \( f_1, f_2 \) 是已知光滑类(如 Hölder 光滑度为 \( \beta \)),转移矩阵 \( \Pi \) 是 \( 2\times 2 \) 的随机矩阵。本文的核心数学问题可退化为:
在 \( K=2 \) 且发射密度光滑度已知的情况下,能否同时得到 \( \Pi \) 的半参数有效估计(渐近方差达到下界)和 \( f_1, f_2 \) 的后验收缩率(以 \( T^{-\beta/(2\beta+1)} \) 收敛)?
在这个特例下: - 转移矩阵的估计:Bickel et al. (1998) 已证明 MLE 是半参数有效的,但要求发射密度被正确指定。本文的贡献在于:即使发射密度被误设(如使用非参数先验),cut posterior 仍能保证 \( \Pi \) 的渐近正态性,且方差达到半参数下界。 - 发射密度的估计:Gassiat & Rousseau (2014) 已证明 Dirichlet 过程混合先验下后验收缩率为 \( T^{-\beta/(2\beta+1)} \)。本文的贡献在于:当 \( \Pi \) 也被估计时(而非已知),该收缩率仍然成立,且不需要样本分割。 - 关键跳跃点:作者需要证明一个反演不等式:边际密度 \( p_\theta(y) = \sum_{j=1}^K \pi_j f_j(y) \)(其中 \( \pi_j \) 是平稳分布)的 \( L^1 \) 距离可以控制发射密度 \( f_j \) 的 \( L^1 \) 距离。在 \( K=2 \) 时,这个不等式退化为:如果 \( \|p_{\theta_1} - p_{\theta_2}\|_1 \) 很小,且转移矩阵 \( \Pi_1, \Pi_2 \) 足够接近,则 \( \|f_{j,1} - f_{j,2}\|_1 \) 也很小。这个不等式的证明依赖于转移矩阵的可识别性条件(如 \( \Pi \) 是遍历的且特征值分离)。
为什么这个特例抓住了核心:一般 \( K \) 的证明只是这个特例的“加壳”——反演不等式需要处理更复杂的线性代数(平稳分布与特征向量),收缩率定理需要处理多个发射密度的同时估计,但核心数学困难(反演不等式 + 后验收缩率的通用条件)在 \( K=2 \) 时已经出现。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:有限状态 HMM 中转移矩阵(有限维参数)与非参数发射密度(无穷维参数)的联合贝叶斯估计问题,特别关注 cut posterior 的渐近性质。
- 核心工具 / 方法:半参数效率理论(计算转移矩阵的 efficient influence function)、Bernstein-von Mises 定理(证明 cut posterior 的渐近正态性)、后验收缩率通用框架(Castillo & Rousseau, 2015 的变体)、反演不等式(连接边际密度与发射密度的 \( L^1 \) 距离)。
- 主要结论:① 转移矩阵的 cut posterior 满足半参数 Bernstein-von Mises 定理(即渐近正态且方差达到半参数下界);② 发射密度的 cut posterior 以某个速率收缩到真值(该速率由发射密度的光滑度决定);③ 平滑概率的后验也以相同速率收缩,且无需样本分割。
关键设定与假设¶
- 假设 1(可识别性):转移矩阵 \( \Pi \) 是遍历的(irreducible and aperiodic),且其平稳分布 \( \pi \) 的所有分量严格正。这保证了 HMM 的可识别性(即不同的 \( (\Pi, f) \) 生成不同的观测分布)。
- 假设 2(光滑度):发射密度 \( f_j \) 属于某个 Hölder 类 \( \Sigma(\beta, L) \)(光滑度 \( \beta > 0 \),常数 \( L > 0 \))。这是非参数收缩率的标准假设。
- 假设 3(先验):发射密度使用 Dirichlet 过程混合先验(或类似非参数先验),满足 Castillo & Rousseau (2015) 的收缩率条件。转移矩阵使用共轭 Dirichlet 先验。
- 假设 4(cut posterior 的构造):cut posterior 定义为 \( \pi_{\text{cut}}(\Pi, f \mid Y_{1:T}) = \pi(\Pi \mid Y_{1:T}) \cdot \pi(f \mid \Pi, Y_{1:T}) \),其中第一个因子是 \( \Pi \) 的边际后验(对 \( f \) 积分),第二个因子是给定 \( \Pi \) 下 \( f \) 的条件后验。这等价于“切断”了 \( f \) 对 \( \Pi \) 的反馈。
- 相比已有文献:本文放宽了 Vernet (2015) 中“独立同分布观测”的假设(允许时间依赖),但强化了发射密度的光滑度假设(Vernet 允许更一般的非参数类)。相比 Gassiat & Rousseau (2014),本文增加了转移矩阵的估计(他们假设 \( \Pi \) 已知)。
主要结果¶
- 定理 3.1(半参数 Bernstein-von Mises):
- 陈述:在正则条件下,转移矩阵 \( \Pi \) 的 cut posterior 满足:\( \sqrt{T}(\hat{\Pi} - \Pi_0) \mid Y_{1:T} \xrightarrow{d} N(0, V_{\text{eff}}) \),其中 \( V_{\text{eff}} \) 是半参数效率下界(即 Bickel et al., 1998 中 MLE 的渐近方差)。
- 直觉:cut posterior 虽然切断了发射密度对转移矩阵的反馈,但转移矩阵的估计仍然有效,因为发射密度的误设不影响转移矩阵的渐近效率(只要发射密度被正确指定或使用非参数先验)。
- 必要条件:发射密度的后验收缩率足够快(快于 \( T^{-1/2} \)),以保证对转移矩阵的“污染”可忽略。
-
解决的技术难点:需要证明 cut posterior 的渐近等价于“oracle posterior”(即假设发射密度已知时的后验),这依赖于发射密度后验的收缩率。
-
定理 3.2(发射密度的收缩率):
- 陈述:在假设 1-3 下,发射密度 \( f_j \) 的 cut posterior 以速率 \( \epsilon_T = T^{-\beta/(2\beta+1)} \) 收缩到真值 \( f_{j,0} \),即 \( E^{\Pi_0, f_0}[ \pi_{\text{cut}}( \|f_j - f_{j,0}\|_1 > M\epsilon_T \mid Y_{1:T}) ] \to 0 \) 对某个 \( M > 0 \)。
- 直觉:这个速率与独立同分布非参数密度估计的最优 minimax 速率一致,说明时间依赖没有恶化收缩率。
- 必要条件:反演不等式(Lemma 4.1)成立,且转移矩阵的估计误差足够小(由定理 3.1 保证)。
-
解决的技术难点:需要将 HMM 的似然函数转化为“近似独立同分布”的形式,然后应用 Castillo & Rousseau (2015) 的通用收缩率框架。
-
定理 3.3(平滑概率的收缩率):
- 陈述:平滑概率 \( P(X_t = j \mid Y_{1:T}) \) 的后验也以速率 \( \epsilon_T \) 收缩到真值。
- 直觉:平滑概率是潜在状态的后验,其收缩率与发射密度相同,说明 cut posterior 没有损失对潜在状态的推断质量。
- 关键点:避免了常见的样本分割技巧(将数据分成两部分,一部分估计转移矩阵,另一部分估计发射密度),因为 cut posterior 天然实现了“模块化”。
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干):
- Step 1:建立反演不等式(Lemma 4.1)
证明:如果两个 HMM 的边际密度 \( p_{\theta_1}, p_{\theta_2} \) 在 \( L^1 \) 距离上接近,且转移矩阵 \( \Pi_1, \Pi_2 \) 接近,则发射密度 \( f_{j,1}, f_{j,2} \) 也在 \( L^1 \) 距离上接近。 -
为什么这样走:发射密度的收缩率不能直接从边际密度的收缩率读出,因为边际密度是发射密度的混合。反演不等式提供了“从边际到发射”的桥梁。
-
Step 2:证明转移矩阵 cut posterior 的 Bernstein-von Mises 定理
使用半参数效率理论:计算转移矩阵的 efficient influence function,证明 cut posterior 的渐近方差等于该 influence function 的方差。 -
关键跳跃点:需要证明 cut posterior 的“有效得分函数”与 oracle posterior 相同。这依赖于发射密度后验的收缩率足够快(快于 \( T^{-1/2} \)),使得对转移矩阵的“污染”可忽略。
-
Step 3:证明发射密度 cut posterior 的收缩率
应用 Castillo & Rousseau (2015) 的通用框架:① 构造一个“测试函数”来区分真值与远离真值的候选;② 证明先验质量在真值附近足够大;③ 证明似然比在远离真值的区域指数衰减。 -
关键跳跃点:HMM 的似然函数不是独立同分布的,因此需要将似然比转化为“近似独立”的形式。作者使用鞅差分解(martingale difference decomposition)来处理时间依赖。
-
Step 4:结合反演不等式与收缩率
从 Step 3 得到边际密度 \( p_\theta \) 的收缩率,然后通过反演不等式得到发射密度 \( f_j \) 的收缩率。 -
Step 5:证明平滑概率的收缩率
使用平滑概率的表达式 \( P(X_t = j \mid Y_{1:T}) = \frac{\alpha_t(j) \beta_t(j)}{\sum_k \alpha_t(k) \beta_t(k)} \)(前向-后向算法),证明该表达式对发射密度和转移矩阵的估计误差是 Lipschitz 连续的,因此收缩率传递。
技术技巧点名: - 反演不等式:核心工具是线性代数(平稳分布与特征向量)和 \( L^1 \) 距离的三角不等式。在 \( K=2 \) 时,反演不等式退化为一个简单的代数不等式;一般 \( K \) 时需要处理特征值分解。 - 鞅差分解:用于处理 HMM 似然比的时间依赖。将 \( \log p_\theta(Y_{1:T}) - \log p_{\theta_0}(Y_{1:T}) \) 写成鞅差的和,然后应用指数不等式。 - Castillo & Rousseau (2015) 的通用收缩率框架:该框架要求后验的“测试函数”存在且似然比满足某种指数衰减。作者验证了 HMM 满足这些条件。 - 半参数效率理论:计算转移矩阵的 efficient influence function 时,需要用到 HMM 的“score function”和“tangent space”。作者引用了 Bickel et al. (1998) 的结果,但将其推广到 cut posterior 设定。
真实例子与应用¶
本文包含模拟实验(Section 5),但没有真实数据例子。
- 模拟设定:\( K=2 \),\( T=500, 1000, 2000 \),转移矩阵 \( \Pi = [[0.8, 0.2], [0.3, 0.7]] \),发射密度 \( f_1 = N(0, 1), f_2 = N(2, 1) \)。先验:转移矩阵使用 Dirichlet(1,1) 先验,发射密度使用 Dirichlet 过程混合先验(基分布为 \( N(0, 10) \),精度参数 \( \alpha=1 \))。
- 如何应用:使用 MCMC 采样 cut posterior:① 用 Gibbs 采样更新转移矩阵(给定发射密度);② 用条件 Dirichlet 过程混合更新发射密度(给定转移矩阵)。cut 的实现很简单:在更新转移矩阵时,不将发射密度的似然纳入。
- 结果:
- 转移矩阵的 cut posterior 均值接近真值,且覆盖概率接近 95%(验证 Bernstein-von Mises 定理)。
- 发射密度的 cut posterior 均值与真值接近,且随着 \( T \) 增大,\( L^1 \) 误差以 \( T^{-1/3} \) 衰减(与理论速率 \( \beta=1 \) 时的 \( T^{-1/3} \) 一致)。
- 与 joint posterior(不 cut)对比:当发射密度被误设时(如使用错误的先验),cut posterior 对转移矩阵的估计更稳健(偏差更小)。
- 这个例子想说明什么:① 理论结果(收缩率、Bernstein-von Mises)在有限样本下成立;② cut posterior 的实现简单(只需修改 MCMC 的更新步骤);③ 在模型误设时,cut posterior 比 joint posterior 更稳健。
🔎 结论是否比证明窄¶
- 定理 3.1 的证明依赖于发射密度后验的收缩率快于 \( T^{-1/2} \),但作者在定理陈述中未明确要求这一条件(仅说“在正则条件下”)。实际上,如果发射密度的光滑度 \( \beta < 1/2 \),收缩率可能慢于 \( T^{-1/2} \),此时定理 3.1 可能不成立。作者在 Remark 3.1 中提到了这一点,但未给出具体条件。
- 定理 3.2 的收缩率 \( T^{-\beta/(2\beta+1)} \) 是 minimax 最优的吗? 作者未证明下界,仅给出了上界。对于独立同分布数据,该速率是最优的;但在 HMM 中,时间依赖可能降低最优速率(如长期记忆过程)。作者在 Section 6 中承认这是开放问题。
- 平滑概率的收缩率(定理 3.3) 的证明依赖于反演不等式和发射密度的收缩率,但未考虑平滑概率的“边界效应”(如 \( t=1 \) 或 \( t=T \) 时收缩率可能更慢)。作者在证明中假设了 \( t \) 远离边界。
四、开放问题¶
- 发射密度收缩率的最优性:定理 3.2 给出的速率 \( T^{-\beta/(2\beta+1)} \) 是否在 HMM 中也是 minimax 最优的?时间依赖是否会导致更慢的最优速率?
-
扎根:Section 6(Future work):“It would be interesting to derive lower bounds for the estimation of the emission densities in HMMs.”
-
cut posterior 的渐近效率损失:定理 3.1 证明 cut posterior 对转移矩阵是半参数有效的,但这是否以发射密度的效率损失为代价?即 cut posterior 对发射密度的收缩率是否比 joint posterior 更慢?
-
扎根:Section 6:“The cut posterior may lead to a loss of efficiency for the emission densities compared to the joint posterior, but this remains to be quantified.”
-
更一般的非参数发射密度类:本文假设发射密度属于 Hölder 类。能否推广到更一般的非参数类(如 Sobolev 类、Besov 类)?或者允许发射密度有不同光滑度(如 \( f_1 \) 光滑但 \( f_2 \) 粗糙)?
-
扎根:Section 6:“Extensions to other smoothness classes or to heterogeneous smoothness across states are left for future work.”
-
cut posterior 在更复杂模型中的应用:本文的框架能否推广到状态空间模型(连续状态)或隐半马尔可夫模型(状态持续时间建模)?
- 扎根:Section 6:“The modular approach could be applied to more complex latent variable models, such as state-space models or hidden semi-Markov models.”
提醒:要确认第 1 条是否是真 gap,建议去读 Gassiat & Rousseau (2014) 和 Vernet (2015) 的 intro——如果它们都未讨论下界,则第 1 条是共识性开放问题(真 gap);如果已有下界结果(如某篇未引用的工作),则本文的 claim 可能被削弱。
Maintained by 陈星宇 · Homepage · Source on GitHub