SADA: Safe and Adaptive Aggregation of Multiple Black-Box Predictions in Semi-Supervised Learning¶
讲者: Jiwei Zhao
会场: Statistical Methods in Generative AI and Network Models
报告题目: SADA: Safe and Adaptive Aggregation of Multiple Black-Box Predictions
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是半监督学习(SSL)中的预测驱动推断,其根本问题是:当只有少量带标签数据(n 小)而大量无标签数据(N 大)可用时,如何利用来自黑箱模型(如 LLM、预训练模型)的预测标签来提升对某个参数 θ* 的统计推断效率(方差更小)或预测精度(风险更低),同时保证即使预测质量很差,也不会比只用标签数据更差。当前该方向的成熟度处于快速发展期:基础框架(PPI)已建立,但处理多个预测、保证安全性、以及扩展到预测任务仍是开放问题。
发展脉络(history)¶
-
奠基工作:传统 SSL 与 PPI 的提出
- Zhu (2005); van Engelen & Hoos (2020):综述了传统 SSL 方法(自训练、协同训练、图传播),这些方法通常依赖强假设(如流形假设、聚类假设)来利用无标签数据。
- Angelopoulos et al. (2023) (PPI):开创性地提出了预测驱动推断(PPI) 框架。核心思想是:用无标签数据上的预测均值来校正标签数据上的估计,得到一个无偏估计量。关键贡献:不要求预测模型的质量,推断是有效的。留下的口子:PPI 的方差可能比只用标签数据还大(当预测质量差时),且只处理单个预测。
-
主要进展:PPI 的改进与扩展
- Angelopoulos et al. (2024) (PPI++):通过引入一个标量权重
ω来缩放预测的贡献,并选择最优ω以最小化方差。关键贡献:保证了“安全性”——方差永远不会比标签基线大。留下的口子:对于向量参数,PPI++ 不能保证在所有方向上方差都更小;且仍只处理单个预测。 - Zrnic & Candès (2024) (Cross-PPI); Fisch et al. (2024) (Stratified PPI); Ji et al. (2025) (Recalibrated PPI):这些工作从不同角度(交叉验证、分层、重校准)改进了 PPI 的效率或适用性,但都聚焦于单个预测源。
- Miao et al. (2025) (Post-prediction adaptive inference):提出了一个“假设宽松”的适应性推断方法,与本文目标相近,但未明确处理多个预测的聚合。
- Angelopoulos et al. (2024) (PPI++):通过引入一个标量权重
-
当前 Frontier 与本文位置
- 当前 Frontier:如何在一个统一的框架内,安全地聚合来自多个、质量未知的黑箱预测,并自适应地利用其中最好的预测,以达到接近或达到半参数效率界。
- 本文 (SADA) 的位置:本文直接填补了这个空白。它提出了一个通用的加权估计方程框架,将 PPI 和 PPI++ 作为特例(
K=1时),并给出了最优权重的闭式解。其核心贡献是证明了该框架同时具备安全性(Theorem 3.1)和自适应性(Theorem 3.2),且适用于推断和预测两种任务。
子线索聚类¶
- 传统 SSL 方法:自训练 (Lee, 2013)、协同训练 (Blum & Mitchell, 1998)、图方法 (Jebara et al., 2009)。这些方法通常旨在提升预测模型本身,而非进行统计推断。
- PPI 及其变体:PPI (Angelopoulos et al., 2023)、PPI++ (Angelopoulos et al., 2024)、Cross-PPI (Zrnic & Candès, 2024)、Stratified PPI (Fisch et al., 2024)。这一簇的核心是推断,利用单个预测来校正标签数据上的估计量。
- SSL 中的半参数/效率理论:Chakrabortty & Cai (2018); Azriel et al. (2022); Song et al. (2023); Deng et al. (2024)。这一簇从半参数理论出发,研究如何利用无标签数据提升 M-估计的效率,通常假设无标签数据上的协变量分布已知或可建模。本文的 Theorem 3.2(ii) 直接与这一簇对话,证明了在特定条件下达到半参数效率界。
- 缺失数据与因果推断:Rubin (1976); Robins et al. (1994)。SSL 问题可视为一个缺失数据问题(标签缺失)。本文的框架与缺失数据中的“增强估计方程”思想有深刻联系,但本文不假设缺失机制(如 MAR),而是将预测视为一种“代理”变量。
这个方向在追问的核心问题¶
- 安全性:如何保证利用预测后的推断/预测性能永远不会比只用标签数据差?PPI 未能保证,PPI++ 在标量参数上保证了,但向量参数上不保证。本文的 SADA 在矩阵意义下保证了(Theorem 3.1)。
- 自适应性:当有多个预测时,如何自动识别并利用其中最好的一个(甚至多个的组合),而无需事先知道哪个最好?本文的 SADA 通过数据驱动的最优权重实现了这一点(Theorem 3.2)。
- 效率界:在最优情况下,利用无标签数据和预测能达到的效率极限是什么?本文证明了当某个预测等于条件均值函数时,可以达到半参数效率界(Theorem 3.2(ii))。
- 预测任务:PPI 框架主要针对推断,如何将其核心思想(安全、自适应地利用预测)扩展到提升预测模型的精度(降低 excess risk)?本文的 Section 4 专门处理了这个问题。
⚠️ 作者的 framing¶
- 作者的缺口框架:作者将缺口 frame 为“现有 PPI 方法(1)只处理单个预测;(2)不能保证向量参数的安全性;(3)不直接处理预测任务”。因此,SADA 被定位为“显然的下一步”——一个统一的、同时解决这三个问题的综合性框架。
- 被淡化/回避的竞争路线:
- 直接集成(Ensembling):作者在引言中提及“heuristic selection or ensembling”,但将其一笔带过,认为其“缺乏原则性框架”。然而,一个精心设计的集成方法(如 stacking)也可能达到类似的自适应效果。作者没有与集成学习文献进行深入比较。
- 贝叶斯方法:作者完全回避了贝叶斯半监督学习方法,这些方法通过先验分布自然地对预测不确定性进行建模和聚合。
- 什么明显该被引/该存在、却没出现在 intro 里?
- 集成学习(Ensemble Learning) 的经典文献(如 Breiman, 1996; Zhou, 2012)。SADA 本质上是一种加权集成方法,但权重是基于方差-协方差结构而非预测性能。与 stacking 等方法的理论联系和区别值得探讨。
- 多重插补(Multiple Imputation):Rubin (2004)。SSL 中的标签缺失问题与多重插补有很强的类比性。PPI 和 SADA 可以看作是一种“单次插补”加“方差校正”的方法。与多重插补的对比(尤其是在处理多个预测源时)是缺失的。
张力¶
未见明显对立引用。所有被引工作都在朝着“更安全、更高效地利用无标签/预测数据”这一方向前进,只是路径和假设不同。本文的贡献在于统一和推广了这些路径。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
Y:标量结果变量(ground truth)。X:协变量向量。θ*:p维目标参数,通过得分方程E[s(X, Y; θ*)] = 0定义。s(x, y; θ):用户指定的p维得分函数。Ŷ = (Ŷ₁, ..., Ŷₖ)ᵀ:来自K个黑箱模型的预测标签向量。K固定,不随样本量增长。n:带标签样本量。N:总样本量(标签 + 无标签)。L = {(xᵢ, yᵢ), i=1,...,n}:带标签数据集。U = {xᵢ, i=n+1,...,N}:无标签数据集(仅有协变量)。ŷᵢ:第i个样本的预测标签向量。W:(Kp) × p的权重矩阵,用于聚合多个预测的得分函数。H = E[∂s(X, Y; θ*)/∂θᵀ]:得分函数的期望 Hessian 矩阵。Σ_nv = var{s(X, Y; θ*)}:标签数据得分函数的方差。S(x, ŷ; θ) = (s(x, ŷ₁; θ)ᵀ, ..., s(x, ŷₖ; θ)ᵀ)ᵀ:将所有预测的得分函数堆叠成的(Kp)维向量。
-
模型:
- 数据生成机制:
(X, Y)服从某个联合分布P。预测Ŷ由某个未知的、可能是随机的黑箱过程生成,该过程可能依赖于X和/或其他潜变量。 - 统计模型:这是一个半参数模型。参数部分由得分方程
E[s(X, Y; θ*)] = 0定义。非参数部分是(X, Y, Ŷ)的联合分布,除了正则性条件外,没有其他限制。关键:预测Ŷ的生成过程被视为完全未知的“黑箱”,不对其质量或形式做任何假设。 - 要估的对象:
θ*。
- 数据生成机制:
-
可观测数据:
- 可观测:
- 对所有
N个样本:协变量xᵢ和预测标签向量ŷᵢ。 - 对前
n个样本:真实标签yᵢ。
- 对所有
- 不可观测/潜在:
- 对后
N-n个样本:真实标签yᵢ(这是缺失的)。 - 预测
Ŷ的生成机制(黑箱)。
- 对后
- 识别关键:SADA 不试图识别
Y的缺失机制或预测的生成机制。它通过构造一个无偏的增强估计方程来工作,该方程在期望上等于原始的得分方程,无论预测质量如何。这个无偏性来自于:E[ (1/(N-n)) Σ_{i=n+1}^N s(xᵢ, ŷᵢ; θ) - (1/n) Σ_{i=1}^n s(xᵢ, ŷᵢ; θ) ] = 0,因为标签和无标签样本的(X, Ŷ)分布相同。
- 可观测:
第二步:讲最小内核——均值估计¶
本文的核心思想可以通过一个最简单的例子——均值估计——来完全理解。
- 最简特例:设
p=1,s(x, y; θ) = y - θ。那么θ* = E[Y],即结果变量的总体均值。 - 交代记号:
θ* = E[Y]。- 标签数据均值:
ȳ = (1/n) Σ_{i=1}^n yᵢ。 - 预测均值:
¯ŷ_k = (1/N) Σ_{i=1}^N ŷ_{k,i}(对所有样本),¯ŷ_k^L = (1/n) Σ_{i=1}^n ŷ_{k,i}(仅标签样本)。 - 权重向量:
ω = (ω₁, ..., ωₖ)ᵀ ∈ ℝᴷ。
- 核心思路:
考虑一族无偏估计量:
θ̂(ω) = ȳ + Σ_{k=1}^K ω_k ( ¯ŷ_k - ¯ŷ_k^L )- 当
ω = 0时,θ̂(0) = ȳ,即只用标签数据的朴素估计量。 - 当
K=1, ω₁=1时,θ̂(1) = ȳ + (¯ŷ₁ - ¯ŷ₁^L),即 PPI 估计量。 - 这个估计量是无偏的,因为
E[¯ŷ_k - ¯ŷ_k^L] = 0。
- 当
- 最小化方差:
计算
θ̂(ω)的方差:Var(θ̂(ω)) = (1/n) Var(Y) + [N/(n(N-n))] ωᵀ Var(Ŷ) ω - (2/n) ωᵀ Cov(Ŷ, Y)这是一个关于ω的二次型。通过求导,得到最优权重:ω_opt = ((N-n)/N) Var(Ŷ)⁻¹ Cov(Ŷ, Y)将ω_opt代入,得到 SADA 估计量θ̂_sada的方差:Var(θ̂_sada) = (1/n) Var(Y) - (1/n - 1/N) * Cov(Ŷ, Y)ᵀ Var(Ŷ)⁻¹ Cov(Ŷ, Y) - 为什么成立(安全性与自适应性):
- 安全性:上式第二项是一个非负的“效率增益”。它等于 0 当且仅当
Cov(Ŷ, Y) = 0(所有预测与真实结果不相关)。此时ω_opt = 0,θ̂_sada = ȳ。因此,SADA 的方差永远不会大于朴素估计量的方差。 - 自适应性:
- 完美预测:如果
Ŷ₁ ≡ Y,则Cov(Ŷ, Y) = (Var(Y), Cov(Ŷ₂, Y), ...)ᵀ。通过计算可得ω_opt = ((N-n)/N, 0, ..., 0)ᵀ。这意味着算法自动将所有权重放在完美预测上,忽略其他。此时θ̂_sada = (1/N) Σ_{i=1}^N ŷ_{1,i},方差为Var(Y)/N,相当于用全部N个样本的“真实”标签进行估计,收敛速率从n^{-1/2}提升到N^{-1/2}。 - 达到效率界:如果所有预测都是
X的函数(Ŷ_k = f_k(X)),且其中一个等于条件均值E[Y|X],则θ̂_sada的渐近方差等于半参数效率界。这是 Theorem 3.2(ii) 在均值估计下的特例。
- 完美预测:如果
- 安全性:上式第二项是一个非负的“效率增益”。它等于 0 当且仅当
总结:这个最小内核清晰地展示了 SADA 的核心机制:通过一个加权校正项来利用预测,权重由预测与真实结果的协方差结构决定,从而自动实现“安全”(不更差)和“自适应”(利用最好的)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在半监督学习框架下,如何安全且自适应地聚合来自多个、质量未知的黑箱模型的预测,以提升对由得分方程定义的参数的统计推断效率,以及提升预测模型的精度。
- 核心工具/方法:提出 SADA 框架,通过构造一个包含多个预测得分函数的增强估计方程,并求解一个闭式的最优权重矩阵(Proposition 1)来最小化估计量的渐近方差(推断任务)或经验风险的方差(预测任务)。
- 主要结论:SADA 估计量在渐近意义下永远不会比只用标签数据的估计量差(安全性,Theorem 3.1);当某个预测完美匹配真实标签或等于条件均值函数时,SADA 能自适应地达到更快的收敛速率或半参数效率界(自适应性,Theorem 3.2);对于预测任务,SADA 的 excess risk 收敛速率不慢于标签基线,且在完美预测下可提升至
N^{-1/2}(Theorem 4.1)。
关键设定与假设¶
- 设定:半监督学习,
n个带标签样本(X, Y),N-n个无标签样本(X)。对所有N个样本,都有来自K个黑箱模型的预测Ŷ。K固定。 - 假设:
- Assumption 1 (推断任务):标准 M-估计正则性条件。
θ*在参数空间内部;得分函数s满足矩条件和可微性。这些条件保证了θ̂_nv的相合性和渐近正态性,是进行泰勒展开的基础。 - Assumption 2 (预测任务):损失函数
ℓ有界且连续;ℓ_θ及其变换是次高斯随机变量;参数空间Θ的 Dudley 熵积分有限。这些是保证经验风险最小化一致收敛和导出 excess risk 界的标准条件。 - 关键无假设:对预测
Ŷ的质量、形式、生成过程没有任何假设。这是 SADA 区别于许多 SSL 方法的核心优势。预测可以是分类的、连续的、有偏的、甚至与Y无关。 - 与已有文献的对比:相比 PPI (Angelopoulos et al., 2023),SADA 不要求预测是“无偏的”或“校准的”。相比 PPI++ (Angelopoulos et al., 2024),SADA 对向量参数也能保证矩阵意义下的安全性(Theorem 3.1 的
Var(θ̂_sada) ⪯ Var(θ̂_nv)),而 PPI++ 只对标量参数保证。相比传统 SSL (Chakrabortty & Cai, 2018),SADA 不假设E[Y|X]的模型形式。
- Assumption 1 (推断任务):标准 M-估计正则性条件。
主要结果¶
-
Theorem 3.1 (安全性):
- 陈述:在 Assumption 1 下,SADA 估计量
θ̂_sada是渐近正态的,且其渐近方差Var(θ̂_sada) = (1/n) H⁻¹ Σ_opt H⁻ᵀ,其中Σ_opt = Σ_nv - ((N-n)/N) Σ_g,而Σ_g是半正定矩阵。 - 直觉:
Σ_g代表了利用预测带来的效率增益。由于Σ_g半正定,Var(θ̂_sada) ⪯ Var(θ̂_nv)在矩阵意义下成立,即 SADA 的每个分量的方差都不大于朴素估计量。 - 必要条件:
Var{S(X, Ŷ; θ*)}非奇异(否则用广义逆)。 - 解决的技术难点:证明
Σ_g的半正定性,并证明用估计的Ŵ_opt代替真实的W_opt不影响渐近分布(T₂ = o_p(n^{-1/2})部分)。
- 陈述:在 Assumption 1 下,SADA 估计量
-
Theorem 3.2 (自适应性):
- 陈述 (i):如果某个
Ŷ_k ≡ Y,则θ̂_sada的收敛速率从n^{-1/2}提升到N^{-1/2},其渐近方差等于用全部N个真实标签的 Oracle 估计量。 - 陈述 (ii):如果所有预测都是
X的函数,且某个预测的得分函数等于条件均值µ(x) = E[s(x, Y; θ*)|x],则θ̂_sada达到半参数效率界。 - 直觉:这两个结果展示了 SADA 的“自适应”能力。算法不需要知道哪个预测最好,最优权重
W_opt会自动将权重集中在那个最好的预测上。 - 解决的技术难点:证明在
Ŷ₁ ≡ Y或s(x, ŷ₁; θ*) ≡ µ(x)的条件下,W_opt退化为((N-n)/N, 0, ..., 0)ᵀ的块对角形式。这需要利用块矩阵求逆公式(如 Lu & Shiou, 2002)。
- 陈述 (i):如果某个
-
Theorem 4.1 (预测任务的 Excess Risk):
- 陈述:在 Assumption 2 下,SADA 预测器的 excess risk 以
O_p(n^{-1/2} + N^{-1/2})的速率收敛。如果某个预测完美匹配真实标签,速率提升至O_p(N^{-1/2})。 - 直觉:这个界保证了 SADA 在预测任务上的“安全性”——其收敛速率不比只用标签数据的
n^{-1/2}速率慢(Theorem S2 证明了n^{-1/2}是标签基线的最优 minimax 速率)。在完美预测下,有效样本量从n提升到N。 - 必要条件:Assumption 2 中的次高斯性和熵积分条件。
- 陈述:在 Assumption 2 下,SADA 预测器的 excess risk 以
证明路线与技术技巧¶
-
整体路线(推断任务):
- 构造估计方程族:定义
θ̂(W)为方程 (3) 的解。 - 渐近展开:对
θ̂(W)在θ*处进行泰勒展开,得到其渐近线性表示。 - 计算渐近方差:基于展开式,计算
Var(θ̂(W))作为W的函数。 - 求解最优权重:将方差视为
W的二次型,通过求导(或配方法)得到闭式最优解W_opt(Proposition 1)。 - 证明安全性:将
W_opt代入方差表达式,证明Var(θ̂(W_opt)) ⪯ Var(θ̂(0))(Theorem 3.1)。 - 证明自适应性:在特定条件下(如
Ŷ₁ ≡ Y),计算W_opt的具体形式,并代入θ̂(W_opt)得到其渐近分布,与 Oracle 或效率界比较(Theorem 3.2)。 - 处理估计的权重:证明用
Ŵ_opt代替W_opt不影响渐近分布(Lemma S1 和T₂ = o_p(n^{-1/2})的论证)。
- 构造估计方程族:定义
-
关键跳跃点:
- 从标量
ω到矩阵W:PPI++ 只处理标量权重ω,其方差最小化是一个简单的二次型问题。SADA 需要处理(Kp) × p的权重矩阵W,方差最小化变成了一个矩阵优化问题。关键跳跃在于作者巧妙地将其转化为一个关于W的二次型,并通过配方法直接得到了闭式解,避免了复杂的矩阵微积分。 - 证明
Σ_g的半正定性:这是证明安全性的核心。Σ_g的形式类似于一个“广义方差比”,其半正定性可以通过柯西-施瓦茨不等式或将其写成一个二次型的期望来证明。 - 自适应性证明中的块矩阵求逆:在证明 Theorem 3.2 时,需要计算
Var(Ŷ)⁻¹ Cov(Ŷ, Y)。当Ŷ₁ ≡ Y时,Var(Ŷ)和Cov(Ŷ, Y)具有特殊的块结构。作者利用 2×2 块矩阵求逆公式(Lu & Shiou, 2002)精确地计算出了W_opt的形式。
- 从标量
-
技术技巧点名:
- 泰勒展开与 M-估计理论:用于推导
θ̂(W)的渐近线性表示。 - 块矩阵求逆:用于证明自适应性的两个特例(Supplementary Section S3, S5)。
- 经验过程理论与 Dudley 熵积分:用于推导预测任务中 excess risk 的非渐近上界(Theorem S1 的证明)。这是处理无限维参数空间
Θ复杂性的标准工具。 - Talagrand 浓度不等式:用于将经验过程的期望界转化为高概率界(Theorem S1 的证明)。
- Le Cam 的两点法:用于证明标签基线
n^{-1/2}的 minimax 最优性(Theorem S2 的证明)。
- 泰勒展开与 M-估计理论:用于推导
真实例子与应用¶
本文包含两个真实数据应用,分别对应推断和预测任务。
-
推断任务:在线请求的礼貌性分析
- 数据:来自 Danescu-Niculescu-Mizil et al. (2013) 的维基百科和 Stack Exchange 的请求文本,有人工标注的礼貌性评分(1-25 分)。
- 方法应用:目标参数是礼貌性评分对“指示性情态特征”的回归系数。作者将 1000 个请求中的一部分视为无标签数据(隐藏其真实评分),并使用 GPT-4o、Llama-3-8B、DeepSeek-V3 三个 LLM 为所有请求生成预测的礼貌性评分。然后,用 SADA 聚合这三个预测来估计回归系数。
- 结果:图 3 显示,SADA 的标准差在所有标签样本量
n下都低于或等于朴素估计量(安全性),并且通常低于 PPI 和 PPI++(即使它们用了最好的单个 LLM)。图 4 显示 SADA 的置信区间更窄,且点估计更接近 Oracle(用全部真实标签的回归结果)。 - 说明的问题:这个例子展示了 SADA 在推断任务中的实际效果:当有多个质量参差不齐的 LLM 预测时,SADA 能安全地聚合它们,自动利用其中最好的信息,从而得到比任何单个预测源都更稳定、更高效的推断。
-
预测任务:ImageNet 图像分类
- 数据:ImageNet-5 数据集(5 个类别,6500 张图片)。
- 方法应用:目标是最小化分类的交叉熵损失。作者用 EfficientNet-B0 和 RegNetY-008 两个模型在部分标签数据上训练,为所有训练图片生成伪标签
Ŷ₁和Ŷ₂。然后,用 SADA 的预测版本(Algorithm 1)来训练一个 DaViT-T 分类器。 - 结果:图 5 显示,在不同标签-无标签比例下,SADA 的 Top-1 准确率始终高于朴素基线(只用标签数据训练)和使用单个伪标签的 PPI。
- 说明的问题:这个例子展示了 SADA 在预测任务中的优势。即使伪标签来自不完美的模型,SADA 也能通过自适应加权来提升最终预测模型的精度,且效果优于仅依赖单个伪标签源。
🔎 结论是否比证明窄¶
- Theorem 3.2(ii) 的陈述:该定理声称,当所有预测是
X的函数且某个预测的得分函数等于条件均值µ(x)时,SADA 达到半参数效率界。这个条件非常强。在实际中,我们几乎不可能知道哪个预测的得分函数恰好等于µ(x)。作者在证明中(Supplementary Section S5)也明确假设了s(x, ŷ₁; θ*) ≡ µ(x)。因此,这个结论的适用范围比“只要有一个好预测”这个泛泛的说法要窄得多。它要求这个好预测必须是条件均值的完美估计,而不仅仅是与Y相关。 - Theorem 4.1 的界:论文给出的 excess risk 界是
O_p(n^{-1/2} + N^{-1/2})。这个界虽然保证了安全性,但并没有证明 SADA 在预测任务上比简单的集成方法(如对多个预测器的输出取平均)有理论上的优势。作者在模拟中展示了 SADA 优于 PPI,但没有与一个精心设计的集成基线(如 stacking)进行比较。因此,SADA 在预测任务上的“自适应”优势更多是经验性的,而非理论上的压倒性证明。
四、开放问题¶
-
分布偏移(Distribution Shift):本文假设标签和无标签数据来自同一分布。作者在讨论中明确指出这是未来方向。扎根点:Section 7, "An essential assumption in this paper is that the labeled and unlabeled data are drawn from the same distribution." 如何将 SADA 扩展到协变量偏移或标签偏移场景,并保持安全性和自适应性,是一个直接且重要的开放问题。
-
多个预测的统计-计算权衡:本文假设
K固定。当K很大(例如,来自一个大型模型集成或许多不同的 LLM)时,Var(Ŷ)的估计和求逆可能变得不稳定或计算成本高昂。是否存在一个“信息-计算”的权衡?即,为了获得聚合多个预测的微小效率增益,是否值得付出显著增加的计算成本?扎根点:Section 2, "Throughout, we assume that K is fixed and does not grow with the sample size." 这个假设限制了方法在高维预测空间的应用。 -
高维扩展:本文的推断框架是针对固定维度的参数
θ*。当θ*的维度p很大(例如,高维线性回归)时,W矩阵的维度变为(Kp) × p,估计和存储都变得困难。如何将 SADA 的安全性和自适应性扩展到高维稀疏设定?扎根点:论文的设定是p维参数,但未讨论p与n的关系。这与 Deng et al. (2024) 等在高维 SSL 上的工作形成了对比,后者专门处理了高维问题。 -
与其他框架的结合:SADA 的核心是增强估计方程。这个思想是否可以与双重稳健估计(如 AIPW)或去偏机器学习(DML)结合?例如,当
s(x, y; θ)是某个复杂模型的得分时,能否用机器学习来估计µ(x) = E[s(x, Y; θ*)|x],然后将其作为一个“预测”输入 SADA,从而获得双重稳健性?扎根点:Theorem 3.2(ii) 表明,当某个预测等于µ(x)时达到效率界。这暗示了将 SADA 与µ(x)的估计结合的可能性。
Maintained by 陈星宇 · Homepage · Source on GitHub