跳转至

Inverse Probability Weighting in a Post-Bayesian World

作者: Owen Thomas, William Denault, Valeria Vitelli
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2606.28685


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是广义贝叶斯推断(Generalised Bayesian Inference),其根本问题是:当标准贝叶斯规则(似然 × 先验)因模型设定错误、数据偏差或似然不可计算而不再适用时,如何构造一个“仍然像贝叶斯后验”的更新规则,使其在某种意义下收敛到有意义的参数值(通常是使某个损失函数或散度最小的“伪真值”)。该方向当前处于快速扩张期:从最初对似然幂次化的简单推广,已发展到使用任意损失函数、评分规则、散度乃至分类器来定义后验。

发展脉络

  1. 奠基工作:Bissiri et al. (2016) 提出了“一般贝叶斯更新”框架,证明只要给定一个损失函数,就可以通过指数倾斜(exponential tilting)的方式更新信念,而似然只是负对数损失的特例。这打开了“用任意损失代替似然”的大门。Grünwald (2012) 的 safe Bayesian 则从学习率角度提出了幂次后验(power posterior),即把似然整体提升到某个 α 次幂。

  2. 主要进展——散度与评分规则:Jewson et al. (2018) 系统研究了用 f-散度(TV、Hellinger 等)代替 KL 散度进行贝叶斯更新的统计原理,指出 KL 对尾部过于敏感,而其他散度可提供稳健性。Miller & Dunson (2019) 的“粗化后验”(coarsened posterior)通过条件于“模型生成的数据接近观测数据”而非“等于观测数据”,导出了似然幂次化,并给出了稳健性理论。Knoblauch et al. (2022) 从变分推断视角统一了多种广义贝叶斯方法,将其视为优化问题。

  3. 当前 frontier——模拟推断与密度比估计:在似然不可计算(simulator-based models)的场景中,Cranmer et al. (2020) 综述了神经后验估计(NPE)等方法,Thomas et al. (2022) 则用分类器估计贝叶斯更新中的密度比。Pacchiardi et al. (2024) 使用评分规则(energy score / kernel score)定义后验,Dellaporta et al. (2022) 用 MMD 后验自助法。这些工作都在解决“似然不可得”或“模型设定错误”的问题,但尚未系统处理数据本身的偏差(selection bias)——即观测数据来自一个与目标分布不同的分布。

  4. 本文的位置:本文声称填补的缺口是——将广义贝叶斯框架从“模型设定错误”扩展到“数据分布偏差”。具体做法是用分类器估计密度比 \( r(x) = q(x)/g(x) \),然后用该比值对似然进行逆概率加权(IPW),从而将后验的收敛目标从观测分布 \( G \) 切换到目标分布 \( Q \)。这本质上是把频率学派中 IPW 的偏差校正思想移植到贝叶斯框架中,并用广义贝叶斯语言重新解释。

子线索聚类

  • 线索 A:似然幂次化与稳健贝叶斯(Grünwald 2012, Miller & Dunson 2019, Bissiri et al. 2016)——通过调整似然的指数或使用粗化来应对模型设定错误。
  • 线索 B:散度驱动的广义贝叶斯(Jewson et al. 2018, Knoblauch et al. 2022, Loaiza-Maya et al. 2021)——用 KL 以外的散度或评分规则定义后验,追求稳健性或预测性能。
  • 线索 C:模拟推断中的密度比估计(Thomas et al. 2022, Cranmer et al. 2020, Pacchiardi et al. 2024, Dellaporta et al. 2022)——在似然不可计算时,用分类器或评分规则近似后验。
  • 线索 D:贝叶斯自助法与重加权(Rubin 1981, Lyddon et al. 2019)——通过对数据点随机重加权来近似后验,与本文的确定性重加权有概念关联。

这个方向在追问的核心问题

  1. 如何定义“正确”的后验更新规则? 当似然不可用或模型设定错误时,什么损失/散度/评分规则是合理的?其统计性质(一致性、渐近正态性、频率有效性)如何?
  2. 如何应对数据偏差? 标准贝叶斯假设观测数据来自目标分布,但实际中观测数据可能因选择偏差、缺失数据等原因偏离目标。IPW 在频率学派中已成熟,但在贝叶斯框架中如何正当化?
  3. 密度比估计的误差如何传播? 当用分类器估计权重时,估计误差对后验的收敛和不确定性量化有何影响?
  4. 后验的不确定性是否可信? 广义贝叶斯后验的方差通常不等于频率方差(sandwich vs. naive),如何构造频率有效的置信区间?

⚠️ 作者的 framing

这是作者的说法:作者将缺口 frame 为“广义贝叶斯推断已处理了模型设定错误,但尚未处理数据分布偏差(selection bias)”,因此本文是“显然的下一步”——用 IPW 将后验的收敛目标从 \( G \) 切换到 \( Q \)。作者淡化了以下竞争路线: - 完全贝叶斯方法:如果对偏差机制建模(如对选择概率指定一个参数模型),可以用标准贝叶斯推断,但作者认为这“难以正当化 IPW 对贝叶斯规则的修改”(引用 Robins et al. 2015)。 - 多重插补或加权似然贝叶斯:已有贝叶斯 IPW 方法,但作者认为它们缺乏“后贝叶斯框架下的统一解释”。 - 因果推断中的贝叶斯方法:如贝叶斯加性回归树(BART)用于处理效应估计,但本文不涉及因果效应,只关注分布偏差校正。

什么明显该被引/该存在、却没出现在 intro 里? - 贝叶斯因果推断中的 IPW 文献:如贝叶斯边际结构模型(Bayesian MSM)中的 IPW 使用,作者仅在讨论中提及“因果推断是未来工作”,但未在 intro 中定位这些已有工作。 - 重要性重采样(importance sampling)在贝叶斯计算中的广泛使用:如粒子滤波、SMC 中的重要性权重,这些与本文的权重估计有直接技术关联,但未被引用。 - 密度比估计的经典文献:如 Sugiyama et al. (2012) 的专著《Density Ratio Estimation in Machine Learning》,本文仅引用了 Thomas et al. (2022) 等少数工作。

张力

未见明显对立引用。所有被引工作基本在“广义贝叶斯是好的、有用的”这一共识下,差异在于具体用什么损失/散度/评分规则。本文的贡献是概念性的(重新解释),而非挑战已有结论。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \( X_i \in \mathcal{X} \):可观测的随机变量(协变量/特征),i.i.d. 来自分布 \( G \)
  • \( G \):观测数据的真实分布,密度为 \( g(x) \)。这是研究者实际能观测到的分布
  • \( Q \):目标分布(理想的无偏分布),密度为 \( q(x) \)。这是研究者想要推断的分布,但无法直接从中大量采样。
  • \( \theta \in \Theta \subset \mathbb{R}^d \):参数,是推断的目标。
  • \( p(x|\theta) \):统计模型(似然),是研究者假设的分布族。
  • \( \ell_\theta(x) = \log p(x|\theta) \):对数似然。
  • \( r(x) = q(x)/g(x) \):密度比(权重函数),将 \( G \) 下的期望转换为 \( Q \) 下的期望。
  • \( w_i = \hat{r}(X_i) \):估计的权重,用于重加权似然。
  • \( \pi(\theta) \):先验密度。
  • \( \pi_n(\theta) \):广义后验密度,定义为 \( \pi_n(\theta) \propto \pi(\theta) \prod_{i=1}^n p(X_i|\theta)^{w_i} \)
  • \( L_n(\theta; w) = \frac{1}{n} \sum_{i=1}^n w_i (-\ell_\theta(X_i)) \):经验加权风险。
  • \( L(\theta; w) = \mathbb{E}_G[w(X)(-\ell_\theta(X))] \):总体加权风险。
  • \( \theta^* = \arg\min_\theta L(\theta; w) \):伪真值(population minimiser)。
  • \( n \):来自 \( G \) 的大样本量(“Big N”)。
  • \( m \):来自 \( Q \) 的小样本量(“Small N”),用于训练分类器估计权重。

  • 模型

  • 数据生成机制:\( X_i \sim G \)(i.i.d.),但研究者希望推断 \( Q \) 下的参数。
  • 统计模型:\( p(x|\theta) \) 是一个参数族(如高斯、逻辑回归),研究者假设该族可能正确也可能错误。
  • 已知:\( G \)\( Q \) 的样本(\( n \) 个来自 \( G \)\( m \) 个来自 \( Q \)),以及先验 \( \pi(\theta) \)
  • 要估的对象:\( \theta^* = \arg\min_\theta \mathbb{E}_Q[-\ell_\theta(X)] \),即 \( Q \) 下的 KL 投影参数。

  • 可观测数据

  • 可观测\( \{X_i\}_{i=1}^n \) 来自 \( G \)\( \{X'_j\}_{j=1}^m \) 来自 \( Q \)
  • 不可观测:密度 \( g \)\( q \) 本身(除非是模拟例子),以及 \( r(x) = q(x)/g(x) \)
  • 关键识别假设\( Q \ll G \)(即 \( q(x) > 0 \Rightarrow g(x) > 0 \)),否则权重在某些点无定义。

第二步:最小内核

最简特例:假设 \( p(x|\theta) = \mathcal{N}(\mu, \sigma^2) \)\( G = \mathcal{N}(0, 2) \)\( Q = \mathcal{N}(1, 1) \)。这是本文 Section 5.1 的模拟例子。

  • 在这个特例下,要证的命题退化成什么? 标准贝叶斯后验(无权重)会收敛到 \( \theta^*_G = (0, 2) \)(即 \( G \) 下的 KL 投影)。本文声称:用权重 \( w_i = q(X_i)/g(X_i) \) 重加权似然后,后验会收敛到 \( \theta^*_Q = (1, 1) \)(即 \( Q \) 下的 KL 投影)。

  • 证明怎么走?

  • 权重计算:由于 \( g \)\( q \) 已知(模拟中),\( r(x) = q(x)/g(x) \) 可解析写出。实际中则用分类器估计。
  • 重加权似然:后验为 \( \pi_n(\theta) \propto \pi(\theta) \prod_{i=1}^n p(X_i|\theta)^{w_i} \)。在 log 尺度上,这等价于最小化 \( \frac{1}{n} \sum_i w_i (-\ell_\theta(X_i)) \)
  • 期望转换\( \mathbb{E}_G[w(X)(-\ell_\theta(X))] = \int g(x) \frac{q(x)}{g(x)} (-\ell_\theta(x)) dx = \int q(x) (-\ell_\theta(x)) dx = \mathbb{E}_Q[-\ell_\theta(X)] \)
  • 收敛:由大数定律,经验加权风险收敛到 \( \mathbb{E}_Q[-\ell_\theta(X)] \),其最小化点为 \( \theta^*_Q \)。后验在 \( \theta^*_Q \) 处集中(Theorem 2)。

  • 为什么这个特例抓住了核心? 整个论文的数学内核就是用一个期望下的权重将另一个期望下的目标函数“伪装”成当前样本下的目标函数。这个操作不依赖于高斯假设,也不依赖于参数维数——它只依赖于密度比 \( r(x) \) 的存在性和可估计性。所有更复杂的设定(逻辑回归、真实数据)只是在这个内核上加了更复杂的似然和权重估计方法。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在广义贝叶斯框架下,如何用逆概率加权(IPW)校正因数据分布偏差(selection bias)导致的后验偏差,使后验收敛到目标分布 \( Q \) 下的 KL 投影参数。
  2. 核心工具/方法:用分类器(逻辑回归)估计密度比 \( r(x) = q(x)/g(x) \),然后用该比值作为权重重加权似然,定义广义后验 \( \pi_n(\theta) \propto \pi(\theta) \prod_i p(X_i|\theta)^{w_i} \)
  3. 主要结论:该广义后验在标准 M-估计条件下一致收敛到 \( \theta^* = \arg\min_\theta \mathbb{E}_Q[-\ell_\theta(X)] \)(Theorem 2),且满足局部 Bernstein–von Mises 近似(Theorem 3),但后验方差(\( I^{-1}/n \))一般不等于频率方差(\( I^{-1}JI^{-1}/n \)),因此原始后验区间不可信(Remark 1)。当权重由独立样本估计时,额外方差 \( K_c \) 会进入渐近方差(Theorem 4)。

关键设定与假设

  • 设定\( X_1, \ldots, X_n \sim G \)(i.i.d.),另有 \( X'_1, \ldots, X'_m \sim Q \)(独立,用于训练分类器)。参数族 \( p(x|\theta) \) 可能正确也可能错误。
  • 假设(Appendix C):
  • Assumption 1(参数正则性)\( \ell_\theta(x) \)\( \theta^* \) 邻域内二次连续可微,且梯度和 Hessian 有可积包络。
  • Assumption 2(可识别性与非奇异性)\( L(\theta; w) \) 有唯一最小化点 \( \theta^* \),且 \( I = \mathbb{E}_G[w(X) H_{\theta^*}(X)] \) 正定。
  • Assumption 3(矩条件)\( \mathbb{E}_G[w(X)^2 \|s_{\theta^*}(X)\|^2] < \infty \)
  • Assumption 4(Glivenko–Cantelli):函数类 \( \{x \mapsto w(x) \ell_\theta(x) : \theta \in \mathcal{N}\} \)\( G \)-GC 的(一致大数定律)。
  • Assumption 5(Donsker):加权得分函数类 \( \{x \mapsto w(x) s_{\theta^*}(x)^\top v : \|v\|=1\} \) 是 Donsker 的。
  • Assumption 6(先验)\( \pi(\theta) \)\( \theta^* \) 邻域内连续且严格正。
  • Assumption 7(参数化比率估计)\( r(x) = r_{\gamma_0}(x) \) 对某个有限维参数 \( \gamma_0 \),且 \( \hat{\gamma}_m \) 满足 \( \sqrt{m}(\hat{\gamma}_m - \gamma_0) \xrightarrow{d} N(0, \Sigma_\gamma) \)
  • 相比已有文献:这些假设是 M-估计和 misspecified BvM 的标准条件(van der Vaart 1998, Kleijn & van der Vaart 2012),本文并未引入新的技术假设。关键创新在于将权重 \( w(x) \) 解释为密度比 \( q(x)/g(x) \),从而改变收敛目标。

主要结果

  • Theorem 1(存在唯一性):在 Assumptions 1, 3, 4 下,\( L(\theta; w) \) 在紧集上达到最小值;若 \( L \) 严格凸,则最小化点唯一。这是标准结论,无新意。
  • Theorem 2(后验集中):在 Assumptions 1, 3, 4, 2, 6 下,对任意 \( \varepsilon > 0 \)\( \pi_n(\{\theta : \|\theta - \theta^*\| > \varepsilon\}) \xrightarrow{P} 0 \)。证明用标准 Wald 型论证:在 \( \theta^* \)\( \varepsilon \)-邻域外,经验风险比 \( \theta^* \) 处至少大 \( 2\eta > 0 \),因此后验质量指数衰减。
  • Theorem 3(渐近正态性与局部后验高斯性):在 Assumptions 1-6 下,\( \sqrt{n}(\hat{\theta}_n - \theta^*) \xrightarrow{d} N(0, I^{-1}JI^{-1}) \),且后验满足局部 BvM 近似 \( \pi_n(\sqrt{n}(\theta - \hat{\theta}_n) \in B) \approx N(0, I^{-1})(B) \)关键点:后验方差 \( I^{-1}/n \) 一般不等于频率方差 \( I^{-1}JI^{-1}/n \),因此后验区间不可信(Remark 1)。这是 misspecified BvM 的标准结论(Kleijn & van der Vaart 2012),本文直接套用。
  • Theorem 4(插件权重的渐近效应):当权重由独立样本估计时,若 \( m/n \to \infty \)(权重样本远大于推断样本),则渐近方差恢复为 \( I^{-1}JI^{-1} \)(无额外噪声);若 \( m/n \to c \in (0, \infty) \),则方差膨胀为 \( I^{-1}(J + K_c)I^{-1} \),其中 \( K_c = c A \Sigma_\gamma A^\top \)\( A = \mathbb{E}_G[\dot{r}_{\gamma_0}(X) s_{\theta^*}(X)^\top] \)。这是本文唯一的新理论贡献——量化了权重估计误差对推断的影响。

证明路线与技术技巧

  • 整体路线(Theorem 3 为例)
  • 得分展开:将经验得分在 \( \theta^* \) 处泰勒展开,得到 \( \sqrt{n}(\hat{\theta}_n - \theta^*) = -[\nabla^2 L_n(\bar{\theta}_n; w)]^{-1} \sqrt{n} \nabla L_n(\theta^*; w) \)
  • 得分渐近正态性\( \sqrt{n} \nabla L_n(\theta^*; w) = -G_n(w s_{\theta^*}) \xrightarrow{d} N(0, J) \)(由 Donsker 假设)。
  • Hessian 收敛\( \nabla^2 L_n(\bar{\theta}_n; w) \xrightarrow{P} I \)(由 Glivenko–Cantelli 假设和 \( \bar{\theta}_n \xrightarrow{P} \theta^* \))。
  • Slutsky:组合得 \( \sqrt{n}(\hat{\theta}_n - \theta^*) \xrightarrow{d} N(0, I^{-1}JI^{-1}) \)
  • BvM:引用 Kleijn & van der Vaart (2012) 的 misspecified BvM 定理,验证其条件(局部二次展开、先验正性、得分 CLT)。

  • 关键跳跃点

  • Theorem 4 的方差分解:将插件权重的效应分解为 \( S_n^{(1)} \)(oracle 得分)和 \( S_n^{(2)} \)(权重估计误差)。\( S_n^{(2)} \) 的泰勒展开需要 \( \dot{r}_{\gamma_0} \)\( s_{\theta^*} \) 的交叉矩存在(Assumption 7),且二次项 \( O_p(m^{-1}) \) 可忽略。这是最吃功夫的部分,因为需要处理两个独立样本(\( n \)\( m \))的渐近。
  • Remark 1 的实践含义:明确指出后验方差 \( I^{-1}/n \) 不可信,建议用 sandwich 方差 \( I^{-1}JI^{-1}/n \) 构造置信区间。这是对 practitioners 的重要警告。

  • 技术技巧点名

  • M-估计标准论证(van der Vaart 1998, Ch. 5):用于 Theorem 2 和 3。
  • Misspecified BvM(Kleijn & van der Vaart 2012):直接引用,未重新证明。
  • Delta method / 泰勒展开:用于 Theorem 4 中权重估计误差的传播。
  • 独立样本的渐近联合分布\( \sqrt{n} S_n^{(1)} \)\( \sqrt{n} S_n^{(2)} \) 的独立性来自样本分割(权重估计样本与推断样本独立)。

真实例子与应用

  • 模拟 1:高斯均值和方差估计(Section 5.1)
  • 数据\( n=200 \) 来自 \( G = N(0,2) \)\( m=50 \) 来自 \( Q = N(1,1) \)
  • 方法:逻辑回归(4 阶正交基)估计权重,5 折 CV,brms 做贝叶斯更新。
  • 结果:标准后验严重有偏(\( \mu \) 偏 -1.01),odds 加权后验几乎无偏(\( \mu \) 偏 0.009),但后验 SD 更大(0.141 vs 0.148),覆盖率为 63%(远低于名义 90%)。EDS 从 200 降到 107。
  • 说明:验证了 IPW 可校正偏差,但代价是有效样本量下降和频率覆盖不足。

  • 模拟 2:多元线性回归(Section 5.2)

  • 数据\( n=500 \) 来自有偏注册分布(选择概率与 outcome 相关),\( m=200 \) 来自无偏临床分布。
  • 方法:逻辑回归(所有二次项和两两交互)估计权重,brms 做回归。
  • 结果:odds 加权后验对截距和 sex 系数的覆盖率达到 91% 和 90%(接近名义),但 biomarker 和 age 的覆盖率仅 44% 和 50%。EDS 从 500 降到 265。
  • 说明:展示了在更复杂设定下的行为,但覆盖率不一致暗示权重估计或模型设定仍有问题。

  • 真实数据:PSA 预测前列腺癌死亡率(Section 5.3-5.5)

  • 数据:挪威前列腺癌联盟数据(\( n=81429 \)),用 log(PSA) 预测 10 年死亡率。目标分布 \( Q \) 为挪威 39 岁以上男性人口年龄分布。
  • 方法:逻辑回归估计权重(年龄为唯一协变量),brms 做逻辑回归。
  • 结果:标准后验的 log-OR 为 0.66(有偏,因为数据中年轻人少),glm 加权后验的 log-OR 为 0.759(更接近“真值”的上界)。EDS 从 81429 降到 52500。
  • 说明:展示了方法在大规模真实数据上的可行性,但作者承认无法验证“真值”,只能提供上下界。

🔎 结论是否比证明窄

  • Theorem 2 的“后验集中”:证明假设了 \( L(\theta; w) \)\( \theta^* \)\( \varepsilon \)-邻域外至少大 \( \Delta_\varepsilon > 0 \),这需要可识别性(Assumption 2)。但文中未讨论当 \( L(\theta; w) \) 有多个全局最小化点时的情况——此时后验可能集中在多个点上,而非唯一的 \( \theta^* \)
  • Theorem 4 的“插件权重”:证明假设了权重由独立样本估计(Assumption 7),且 \( r(x) = r_{\gamma_0}(x) \) 是参数化的。但实际中权重可能用非参数分类器(如随机森林)估计,且可能与推断样本共享数据(尽管用了 CV)。作者在 Remark 4 中承认了这一点,并建议用 cross-fitting 来放松 Donsker 要求,但未给出正式证明。
  • Remark 1 的“后验过集中”:明确指出后验方差不可信,但未提供如何构造频率有效置信区间的具体方法(仅建议“用 sandwich 方差做 Laplace 近似”)。这在实践中可能不 trivial,尤其是当后验非高斯时。
  • Section 5 的模拟:模拟中权重由逻辑回归估计,但 Theorem 4 的假设要求权重是参数化的且 \( \sqrt{m} \)-一致估计。逻辑回归满足此条件,但模拟中 \( m=50 \) 很小,\( \sqrt{m} \) 渐近可能不准确。作者未讨论有限样本下的偏差。

四、开放问题

  1. 非参数权重估计的渐近理论:Theorem 4 假设权重由参数模型估计(Assumption 7)。当用随机森林、神经网络等非参数分类器估计权重时,其渐近分布未知,方差膨胀项 \( K_c \) 如何计算?扎根点:Remark 4 提到“cross-fitting 可放松 Donsker 要求”,但未给出非参数情形的正式结果。

  2. 后验校准方法:Remark 1 指出后验方差不可信,但未给出通用的校准方法。如何构造频率有效的置信区间(如通过 double bootstrap 或 sandwich 校正的 Laplace 近似)?扎根点:Theorem 3 后的 Remark 1 明确说“应使用 sandwich 校正协方差”,但未提供算法。

  3. 权重估计与推断共享数据时的偏差:本文用 CV 估计权重,但 Theorem 4 假设权重样本独立于推断样本。当 CV 折叠数有限时,权重估计误差与推断误差的相关性如何影响渐近方差?扎根点:Appendix A 建议 cross-fitting,但理论部分(Theorem 4)仅处理了独立样本情形。

  4. 扩展到因果推断:本文仅处理了 selection bias(分布偏差),但 IPW 在因果推断中用于处理混淆偏差(confounding)。如何将本文框架扩展到边际结构模型(MSM)或工具变量?扎根点:Discussion 提到“clear extensions to other potential sources of biases, including ... causality”,但未给出任何具体结果。

  5. 高维参数空间:本文的模拟和理论都假设参数维数固定(\( d \) 小)。当 \( d \)\( n \) 增长时,权重估计(分类器)和后验集中需要哪些额外条件?扎根点:Discussion 提到“applicability to higher-dimensional parameter spaces could be explored through the use of regularised logistic regression”,但未给出理论。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论