Nonparametric targeted Bayesian estimation of class proportions in unlabeled data¶
作者: Iván Díaz, Oleksander Savenkov, Hooman Kamel
来源: Biostatistics
主题: 因果推断
相关性: 6/10
机构绿灯: Cornell University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biostatistics/kxaa022
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的子方向是非参数/半参数模型中的贝叶斯推断,具体聚焦于目标参数(低维泛函)的贝叶斯估计。其根本问题是:在非参数模型中,当研究者只关心一个低维参数(如平均处理效应、类别比例)而 nuisance 参数(如条件密度、回归函数)是高维或无穷维时,能否设计一个贝叶斯程序,使其后验分布具有频率学派意义上的最优性质(如渐近正态、高效、双重稳健)?该方向当前成熟度中等:经典 Bernstein–von Mises (BvM) 定理在参数模型中已成熟,但在非参数模型中,由于后验对 nuisance 参数先验的敏感性,BvM 性质往往不成立或需要极强假设。本文试图通过只对目标参数指定先验(而非整个模型)来绕开这一困难。
发展脉络(history)¶
从 introduction 引用的工作可梳理出以下脉络:
- 奠基工作:非参数贝叶斯的 BvM 问题。Shen (2002) 和 Castillo & Nickl (2013, 2014) 证明了在某些非参数模型中后验分布的 BvM 性质,但需要 nuisance 参数以参数速率(n^{-1/2})估计,这在许多实际设定中不现实。这些工作留下了“非参数 BvM 需要强假设”的认知。
- 主要进展:Targeted Learning 框架。van der Laan & Rubin (2006) 和 van der Laan & Rose (2011, 2018) 提出了 targeted learning(目标学习)框架,核心思想是:不估计整个数据分布,而是通过构造一个针对目标参数的“波动”(fluctuation),使最终估计量对 nuisance 参数误差不敏感(即双重稳健)。该框架主要关注频率学派估计量(如 TMLE),但未涉及贝叶斯推断。
- 当前 frontier:贝叶斯与 Targeted Learning 的结合。本文是这一结合的代表。作者引用 Díaz et al. (2021) 作为直接前身——该文提出了一个贝叶斯目标估计量,但未证明 BvM 性质。本文在此基础上证明了 BvM 定理,并推广至任意路径可微参数。
- 本文的位置:作者将缺口 frame 为“现有非参数贝叶斯方法要么需要参数速率估计 nuisance(如 Castillo & Nickl),要么未提供频率性质保证(如 Díaz et al. 2021)”。本文声称填补了这一缺口:只需 nuisance 以慢于参数速率估计,即可获得高效、双重稳健的后验。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 非参数贝叶斯的 BvM 理论(Shen 2002, Castillo & Nickl 2013, 2014, 2016):关注后验分布对 nuisance 先验的敏感性,通常需要 nuisance 以参数速率估计。这些工作为本文提供了理论基准——本文声称在更弱条件下获得 BvM。
- Targeted Learning 与双重稳健估计(van der Laan & Rubin 2006, van der Laan & Rose 2011, 2018, Díaz et al. 2021):关注构造对 nuisance 误差不敏感的估计量。本文从中借用了“波动”构造和高效影响函数(EIF)的概念,但将其嵌入贝叶斯框架。
这个方向在追问的核心问题¶
- 问题 1:在非参数模型中,后验分布何时具有频率学派意义上的最优性质(BvM)?当前主流方法(如 Castillo & Nickl)需要参数速率估计 nuisance,瓶颈在于实际中 nuisance 往往只能以慢于 n^{-1/2} 的速率估计。
- 问题 2:如何将 targeted learning 的“只关注目标参数”思想与贝叶斯推断结合?当前主流(van der Laan & Rose)是频率学派,贝叶斯版本(Díaz et al. 2021)缺乏理论保证。
- 问题 3:双重稳健性在贝叶斯框架下如何定义和验证?频率学派中双重稳健性指估计量在 nuisance 之一正确时仍一致;贝叶斯中则需后验均值的双重稳健性。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
作者把缺口 frame 成:“现有非参数贝叶斯方法需要参数速率估计 nuisance,而我们的方法只需慢于参数速率。” 这是作者的说法。竞争路线被他淡化或回避了: - 作者未深入讨论完全贝叶斯方法(如 Gaussian process 先验)在类似问题上的表现——这些方法虽不保证 BvM,但在实践中可能表现良好。作者仅引用 Castillo & Nickl 等理论工作,未提及实际应用中的替代方案。 - 作者未讨论频率学派 TMLE 的贝叶斯替代——TMLE 本身已高效且双重稳健,为何需要贝叶斯版本?作者仅以“贝叶斯主观主义”和“后验不确定性量化”为由,但未与 TMLE 的置信区间做系统比较。
什么明显该被引/该存在、却没出现在 intro 里? - 缺失 1:关于贝叶斯非参数中后验收缩速率的文献(如 Ghosal & van der Vaart 2017 的专著)未被引用。这些工作讨论了后验对先验的敏感性,与本文的“只对目标参数指定先验”直接相关。 - 缺失 2:关于双重稳健贝叶斯方法的近期工作(如 Ray & van der Vaart 2020, 2021)未被引用。这些工作提出了类似“只对目标参数指定先验”的想法,但未证明 BvM。 - 缺失 3:关于路径可微参数的高效估计的经典文献(如 Bickel et al. 1993, van der Vaart 1998)未被引用。本文的核心工具——高效影响函数——正是来自这些文献。
值得研究者去查的问题:这些缺失是否意味着作者有意回避了竞争方法?还是这些文献确实不直接相关?建议查 Ray & van der Vaart (2020, 2021) 和 Ghosal & van der Vaart (2017) 的 intro,看它们是否提出了类似想法。
张力¶
未见明显对立引用。所有被引工作(Shen, Castillo & Nickl, van der Laan & Rose, Díaz et al.)在“非参数 BvM 需要强假设”这一点上一致,分歧仅在于如何绕开。本文提出的“只对目标参数指定先验”是一种新尝试,但未与现有方法产生直接矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - O:可观测数据,是一个随机变量,取值于某个样本空间。在本文的类别比例例子中,O = (X, Y),其中 X 是协变量向量,Y 是类别标签(0 或 1)。 - P:数据生成分布,属于非参数模型 M(即所有可能的分布)。 - ψ = Ψ(P):目标参数,是一个从 M 到 R^d 的泛函。在例子中,ψ = P(Y=1),即类别 1 的比例。 - η:nuisance 参数,是 P 中除 ψ 外的部分。在例子中,η = (μ(X), π(X)),其中 μ(X) = E[Y|X](条件均值函数),π(X) = P(Y=1|X)(倾向得分,但这里 Y 是类别标签,所以 π(X) = μ(X))。 - D*(O; ψ, η):目标参数 ψ 的高效影响函数(EIF),是一个满足 E[D] = 0 且 Var(D) = 效率界的函数。在例子中,D(O; ψ, η) = (Y - μ(X)) / (某个归一化因子) + (μ(X) - ψ)。 - n:样本量。 - O_1, ..., O_n:i.i.d. 样本。 - ψ_n:ψ 的某个估计量。 - η_n*:η 的某个估计量(通常来自外部数据或交叉拟合)。
模型: - 数据生成机制:O_i = (X_i, Y_i) ~ i.i.d. P,其中 P 属于非参数模型 M(即对 P 无任何参数化假设,除了某些正则性条件)。 - 目标:估计 ψ = P(Y=1)(类别比例)。 - 已知:无。所有参数(ψ, η)都是未知的,需从数据估计。 - 要估的对象:ψ(低维,1 维),以及 η(高维/无穷维,需用非参数方法估计)。
可观测数据: - 研究者实际能观测到的是:n 个 i.i.d. 样本 (X_i, Y_i),其中 X_i 是协变量(如患者年龄、病史等),Y_i 是类别标签(如是否患有某种疾病)。 - 潜在/不可观测:无。但注意,在更一般的因果推断设定中(如处理效应估计),Y 可能是潜在结果(counterfactual),此时可观测的是 (X, A, Y_obs),其中 A 是处理变量,Y_obs 是实际观测到的结果。本文的类别比例例子不涉及潜在结果,因此所有量都是可观测的。
第二步:讲最小内核¶
最简特例:假设我们想估计一个二值类别(如疾病/健康)在人群中的比例 ψ = P(Y=1),但我们只有无标签数据(即 Y 缺失),但有协变量 X 的完整观测。此外,我们有一个外部有标签数据集(或一个已训练好的预测模型),可以估计 μ(X) = E[Y|X](条件概率)。这是本文的核心设定。
在这个特例下,要证的命题退化成什么? - 目标参数:ψ = E[Y] = E[E[Y|X]] = E[μ(X)]。 - 可观测数据:无标签数据中的 X_i(i=1,...,n),以及一个外部估计的 μ_n(X)(来自有标签数据或模型)。 - 核心困难:μ_n(X) 是估计的,有误差。如果直接用样本均值 (1/n) Σ Y_i,但 Y_i 缺失,所以不可行。如果直接用 (1/n) Σ μ_n(X_i),则估计量对 μ_n 的误差敏感。 - 本文的方法:构造一个“波动”后的目标参数后验,使其对 μ_n 的误差不敏感。
最小内核的数学表述: 1. 定义目标参数:ψ = E[Y]。 2. 写出 EIF:对于非参数模型,ψ 的 EIF 是 D(O; ψ, μ) = Y - ψ(因为 Y 是二值的,且无协变量时,EIF 就是 Y - ψ)。但这里我们有协变量 X,所以 EIF 是 D(O; ψ, μ) = (Y - μ(X)) + (μ(X) - ψ) = Y - ψ(注意,这个简化是因为 μ(X) 是条件期望,所以 E[Y - μ(X)|X] = 0,因此 EIF 实际上就是 Y - ψ,但更一般的形式是 D = (Y - μ(X)) + (μ(X) - ψ))。 3. 构造“波动”后的似然:作者定义了一个“波动”后的似然函数,其中目标参数 ψ 被显式地参数化,而 nuisance μ 被当作已知(但实际用估计值 μ_n 代替)。具体地,他们考虑一个参数化子模型(parametric submodel){P_ε: ε ∈ R},使得在 ε=0 时,P_0 = P,且 ∂/∂ε log p_ε(O)|_{ε=0} = D(O; ψ, μ)。然后,他们将 ψ 作为这个子模型中的参数,并对其指定先验。 4. 后验分布:在给定数据 O_1,...,O_n 和估计的 μ_n 下,ψ 的后验分布是: π(ψ | data, μ_n) ∝ π(ψ) * Π_{i=1}^n p_ε(O_i; ψ, μ_n) 其中 p_ε 是波动后的似然,π(ψ) 是 ψ 的先验。 5. BvM 定理:作者证明,在正则条件下,这个后验分布收敛到 N(ψ_0, I_n^{-1}),其中 ψ_0 是真值,I_n 是 Fisher 信息(等于 n * Var(D*)^{-1})。这意味着后验均值是高效、渐近线性的,且后验方差正确覆盖了真值。
为什么这个特例抓住了核心? - 它剥离了所有为一般性服务的技术假设(如多维参数、复杂 nuisance 结构),只留下最本质的“用估计的 nuisance 做贝叶斯推断”。 - 核心困难是:如果直接用估计的 μ_n 代入似然,后验可能不收敛到正确分布(因为 μ_n 的误差会污染后验)。本文的关键想法是:通过“波动”构造一个对 μ_n 误差不敏感的似然,使得后验只依赖于 μ_n 的慢于参数速率的误差,而不受其影响。 - 证明的核心是:波动后的似然在 ψ 附近是二次的,且其曲率由 EIF 的方差决定,从而后验是渐近高斯的。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在非参数模型中,如何对目标参数(如类别比例)进行贝叶斯推断,使得后验分布具有频率学派意义上的高效性、双重稳健性和渐近正态性(BvM 性质),且仅需 nuisance 参数以慢于参数速率估计。
- 核心工具/方法:基于 targeted learning 框架,构造一个“波动”后的似然函数,其中目标参数被显式参数化,而 nuisance 参数被当作已知(用外部估计值代替),然后只对目标参数指定先验并输出后验。
- 主要结论:证明了 Bernstein–von Mises 定理,保证后验分布收敛到高效、渐近线性估计量的分布;后验均值是双重稳健的(即当 nuisance 之一正确时仍一致);后验方差正确覆盖了真值。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 设定:可观测数据 O = (X, Y),其中 Y ∈ {0,1} 是类别标签,X ∈ R^d 是协变量。目标参数 ψ = P(Y=1)。Nuisance 参数 η = (μ, π),其中 μ(X) = E[Y|X](条件均值),π(X) = P(Y=1|X)(但注意,由于 Y 是二值的,π(X) = μ(X),所以实际上只有一个 nuisance)。更一般地,本文考虑任意路径可微参数 ψ = Ψ(P),其 EIF 为 D*(O; ψ, η)。
- 假设:
- 非参数模型:P 属于非参数模型 M,即对 P 无任何参数化假设,除了某些正则性条件(如存在密度、矩条件等)。
- 路径可微性:Ψ 在 P 处是路径可微的,且其 EIF D* 存在且唯一。
- Nuisance 估计速率:存在一个估计量 η_n(来自外部数据或交叉拟合),使得 ||η_n - η_0|| = o_p(n^{-1/4}),其中 ||·|| 是某个范数(如 L2 范数)。这是比参数速率(n^{-1/2})更慢的条件——实际上,n^{-1/4} 是许多非参数估计量(如核平滑、随机森林)能达到的速率。
- 先验:目标参数 ψ 的先验 π(ψ) 是连续的、有紧支撑的,且在真值 ψ_0 处为正。
- 波动构造:存在一个参数化子模型 {P_ε: ε ∈ R},使得在 ε=0 时,P_0 = P,且 ∂/∂ε log p_ε(O)|_{ε=0} = D*(O; ψ, η)。这个子模型是“最小”的(即只波动目标参数方向)。
- 相比已有文献放宽或强化了哪些:
- 相比 Castillo & Nickl (2013, 2014):放宽了 nuisance 估计速率要求(从 n^{-1/2} 到 n^{-1/4}),但强化了“只对目标参数指定先验”这一构造(Castillo & Nickl 是对整个模型指定先验)。
- 相比 Díaz et al. (2021):强化了理论保证(证明了 BvM),但假设条件类似(都需要 n^{-1/4} 速率)。
主要结果¶
本文的核心结果是定理 1(Bernstein–von Mises 定理)和定理 2(双重稳健性)。以下以类别比例例子陈述:
- 定理 1(BvM):在假设 1-5 下,目标参数 ψ 的后验分布满足: sup_{B ∈ B(R)} | Π( √n (ψ - ψ_n) ∈ B | data, μ_n ) - N(0, σ^2)(B) | → 0 in probability, 其中 ψ_n 是后验均值,σ^2 = Var(D*)^{-1} 是效率界。这意味着后验分布收敛到高效、渐近线性估计量的分布。
- 直觉:波动后的似然在 ψ 附近是二次的,其曲率由 EIF 的方差决定,因此后验是渐近高斯的。
- 必要条件:nuisance 估计速率 o_p(n^{-1/4})。这是关键——如果 nuisance 估计太慢(如 n^{-1/3}),则后验可能不收敛。
-
解决的技术难点:如何控制 nuisance 估计误差对后验的影响?作者通过波动构造,使后验只依赖于 nuisance 误差的“二阶项”(即 (μ_n - μ_0)^2),从而只需 n^{-1/4} 速率。
-
定理 2(双重稳健性):后验均值 ψ_n 是双重稳健的:如果 μ_n 或 π_n(在更一般设定中)之一正确,则 ψ_n 一致估计 ψ_0。在类别比例例子中,由于 π = μ,双重稳健性退化为“如果 μ_n 一致,则 ψ_n 一致”。
- 直觉:EIF 的期望在 nuisance 之一正确时为零,因此后验均值对 nuisance 误差不敏感。
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干): 1. 构造波动后的似然:定义参数化子模型 {P_ε},使得 ε 是目标参数 ψ 的“波动方向”。将 ψ 作为这个子模型中的参数,并写出似然函数 L_n(ψ, η_n) = Π_{i=1}^n p_ε(O_i; ψ, η_n)。 2. 展开对数似然:在真值 ψ_0 附近,对 log L_n(ψ, η_n) 做二阶泰勒展开。关键项是: - 一阶项:√n (ψ - ψ_0) * (1/√n) Σ D(O_i; ψ_0, η_0) —— 这是渐近正态的。 - 二阶项:- (n/2) (ψ - ψ_0)^2 * Var(D) —— 这是二次的,决定了后验的曲率。 - 交叉项:涉及 (ψ - ψ_0) * (η_n - η_0) —— 这是需要控制的。 3. 控制交叉项:利用波动构造的性质,证明交叉项是 o_p(1)(即渐近可忽略),只要 ||η_n - η_0|| = o_p(n^{-1/4})。这是证明的核心跳跃点。 4. 应用后验展开:将展开后的对数似然代入后验公式,得到后验分布近似于 N(ψ_n, I_n^{-1}),其中 ψ_n 是后验均值,I_n 是 Fisher 信息。 5. 验证 BvM:证明后验分布与 N(ψ_n, I_n^{-1}) 之间的总变差距离趋于 0,从而完成 BvM 定理的证明。
关键跳跃点: - 跳跃点 1:如何证明交叉项 (ψ - ψ_0) * (η_n - η_0) 是 o_p(1)?这需要利用 EIF 的“双稳健”性质:E[D(O; ψ_0, η_0)] = 0,且 E[D(O; ψ_0, η_n)] 对 η_n 的误差是二阶的。作者通过经验过程理论(empirical process)和交叉拟合(cross-fitting)来控制这一项。 - 跳跃点 2:如何保证波动后的似然确实是合法的似然(即积分等于 1)?作者通过构造一个特定的参数化子模型(如“logistic 波动”),使得波动后的密度是归一化的。
技术技巧点名: - 高效影响函数(EIF):用于构造波动方向。这是 semiparametric theory 的核心工具。 - 经验过程理论:用于控制 nuisance 估计误差的随机项。具体地,作者使用Donsker 类和Glivenko–Cantelli 类的条件,确保经验过程的一致收敛。 - 交叉拟合(cross-fitting):将数据分成 K 折,用 K-1 折估计 nuisance,用剩余 1 折计算后验。这避免了 Donsker 条件,允许 nuisance 估计量更灵活(如随机森林、神经网络)。 - 后验展开(Laplace 近似):用于证明后验分布是渐近高斯的。这是贝叶斯非参数中的标准技巧,但需要验证对数似然的二次性。
真实例子与应用¶
本文包含一个真实数据例子:
- 用的什么数据/场景:隐源性卒中(embolic strokes of undetermined source, ESUS)患者的数据。目标是估计 ESUS 中来自隐匿性心脏或大动脉粥样硬化病灶的比例。数据包含协变量 X(患者年龄、性别、病史等)和类别标签 Y(是否来自心脏/大动脉病灶)。但 Y 在部分患者中缺失(因为需要额外检查才能确定病因),因此这是一个“无标签数据”问题。
- 怎么把本文方法用上去:作者用外部有标签数据(来自其他研究)训练了一个预测模型 μ_n(X) = P(Y=1|X),然后用本文的贝叶斯目标估计方法,在无标签数据上估计 ψ = P(Y=1)。他们指定了一个均匀先验 π(ψ) ~ Uniform(0,1),并计算了后验均值和 95% 可信区间。
- 得到什么结果:后验均值约为 0.35(即 35% 的 ESUS 来自心脏/大动脉病灶),95% 可信区间为 [0.28, 0.42]。这个结果与之前的研究一致。
- 这个例子想说明什么:验证方法在实际数据上的可行性,并展示其与现有知识的吻合度。但注意,这个例子没有与 baseline 方法(如 TMLE、完全贝叶斯方法)做系统比较,因此只能作为“演示”而非“验证”。
🔎 结论是否比证明窄¶
- 窄处 1:定理 1 的 BvM 结果是在假设 nuisance 估计速率 o_p(n^{-1/4}) 下证明的。但作者在讨论中声称“只需慢于参数速率”,这比 n^{-1/4} 更宽泛(因为 n^{-1/4} 是慢于 n^{-1/2} 的,但并非所有慢于 n^{-1/2} 的速率都满足 n^{-1/4})。例如,如果 nuisance 估计速率是 n^{-1/3},则满足 n^{-1/4} 条件;但如果速率是 n^{-1/5},则不满足。因此,“慢于参数速率”这一说法是误导性的——实际条件是“慢于参数速率但快于 n^{-1/4}”。
- 窄处 2:定理 2 的双重稳健性是在假设波动构造正确下证明的。如果波动构造不合法(如选择的子模型不满足 EIF 条件),则双重稳健性可能不成立。作者未讨论波动构造的鲁棒性。
- 窄处 3:所有结果都依赖于交叉拟合。如果交叉拟合的折数 K 选择不当(如 K=2 导致样本量太小),则结果可能不成立。作者未讨论 K 的选择对结果的影响。
四、开放问题¶
-
更弱的 nuisance 估计速率:定理 1 需要 ||η_n - η_0|| = o_p(n^{-1/4})。能否放宽到 o_p(n^{-1/3}) 或更慢?这需要更精细的控制交叉项,可能涉及高阶影响函数(HOIF)或更高阶的展开。扎根于定理 1 的证明中“交叉项控制”部分(具体语句:作者在证明中假设 ||η_n - η_0|| = o_p(n^{-1/4}) 以保证交叉项为 o_p(1))。
-
波动构造的自动选择:本文假设波动构造是已知的(即 EIF 已知)。但在许多实际设定中,EIF 的解析形式可能未知或难以计算。能否开发一种数据驱动的波动构造,自动适应目标参数?扎根于第 2 节“波动构造”部分(作者说“我们假设存在一个参数化子模型...”)。
-
高维 nuisance:本文假设 nuisance 是低维或无穷维但可用非参数方法估计。如果 nuisance 是高维(如 d >> n),则 n^{-1/4} 速率可能无法达到。能否将本文方法推广到高维设定,利用稀疏性或其他结构?扎根于第 5 节“讨论”部分(作者说“我们的方法可推广至高维设定,但需要进一步研究”)。
-
与完全贝叶斯方法的比较:本文未与完全贝叶斯方法(如 Gaussian process 先验)做系统比较。在什么条件下,完全贝叶斯方法也能达到类似性质?扎根于第 1 节“引言”部分(作者说“我们的方法避免了完全贝叶斯方法的敏感性”)。建议查 Ray & van der Vaart (2020, 2021) 和 Ghosal & van der Vaart (2017) 的 intro,看它们是否提出了类似想法。
Maintained by 陈星宇 · Homepage · Source on GitHub