跳转至

SADA: Safe and Adaptive Aggregation of Multiple Black-Box Predictions in Semi-Supervised Learning

讲者: Jiwei Zhao
会场: Statistical Methods in Generative AI and Network Models
报告题目: SADA: Safe and Adaptive Aggregation of Multiple Black-Box Predictions
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是半监督学习(SSL)中的预测驱动推断,其根本问题是:当只有少量带标签数据(n 小)而大量无标签数据(N 大)可用时,如何利用来自黑箱模型(如 LLM、预训练模型)的预测标签来提升对某个参数 θ* 的统计推断效率(方差更小)或预测精度(风险更低),同时保证即使预测质量很差,也不会比只用标签数据更差。当前该方向的成熟度处于快速发展期:基础框架(PPI)已建立,但处理多个预测、保证安全性、以及扩展到预测任务仍是开放问题。

发展脉络(history)

  1. 奠基工作:传统 SSL 与 PPI 的提出

    • Zhu (2005); van Engelen & Hoos (2020):综述了传统 SSL 方法(自训练、协同训练、图传播),这些方法通常依赖强假设(如流形假设、聚类假设)来利用无标签数据。
    • Angelopoulos et al. (2023) (PPI):开创性地提出了预测驱动推断(PPI) 框架。核心思想是:用无标签数据上的预测均值来校正标签数据上的估计,得到一个无偏估计量。关键贡献:不要求预测模型的质量,推断是有效的。留下的口子:PPI 的方差可能比只用标签数据还大(当预测质量差时),且只处理单个预测。
  2. 主要进展:PPI 的改进与扩展

    • Angelopoulos et al. (2024) (PPI++):通过引入一个标量权重 ω 来缩放预测的贡献,并选择最优 ω 以最小化方差。关键贡献:保证了“安全性”——方差永远不会比标签基线大。留下的口子:对于向量参数,PPI++ 不能保证在所有方向上方差都更小;且仍只处理单个预测。
    • Zrnic & Candès (2024) (Cross-PPI); Fisch et al. (2024) (Stratified PPI); Ji et al. (2025) (Recalibrated PPI):这些工作从不同角度(交叉验证、分层、重校准)改进了 PPI 的效率或适用性,但都聚焦于单个预测源。
    • Miao et al. (2025) (Post-prediction adaptive inference):提出了一个“假设宽松”的适应性推断方法,与本文目标相近,但未明确处理多个预测的聚合。
  3. 当前 Frontier 与本文位置

    • 当前 Frontier:如何在一个统一的框架内,安全地聚合来自多个、质量未知的黑箱预测,并自适应地利用其中最好的预测,以达到接近或达到半参数效率界。
    • 本文 (SADA) 的位置:本文直接填补了这个空白。它提出了一个通用的加权估计方程框架,将 PPI 和 PPI++ 作为特例(K=1 时),并给出了最优权重的闭式解。其核心贡献是证明了该框架同时具备安全性(Theorem 3.1)和自适应性(Theorem 3.2),且适用于推断和预测两种任务。

子线索聚类

  1. 传统 SSL 方法:自训练 (Lee, 2013)、协同训练 (Blum & Mitchell, 1998)、图方法 (Jebara et al., 2009)。这些方法通常旨在提升预测模型本身,而非进行统计推断。
  2. PPI 及其变体:PPI (Angelopoulos et al., 2023)、PPI++ (Angelopoulos et al., 2024)、Cross-PPI (Zrnic & Candès, 2024)、Stratified PPI (Fisch et al., 2024)。这一簇的核心是推断,利用单个预测来校正标签数据上的估计量。
  3. SSL 中的半参数/效率理论:Chakrabortty & Cai (2018); Azriel et al. (2022); Song et al. (2023); Deng et al. (2024)。这一簇从半参数理论出发,研究如何利用无标签数据提升 M-估计的效率,通常假设无标签数据上的协变量分布已知或可建模。本文的 Theorem 3.2(ii) 直接与这一簇对话,证明了在特定条件下达到半参数效率界。
  4. 缺失数据与因果推断:Rubin (1976); Robins et al. (1994)。SSL 问题可视为一个缺失数据问题(标签缺失)。本文的框架与缺失数据中的“增强估计方程”思想有深刻联系,但本文不假设缺失机制(如 MAR),而是将预测视为一种“代理”变量。

这个方向在追问的核心问题

  1. 安全性:如何保证利用预测后的推断/预测性能永远不会比只用标签数据差?PPI 未能保证,PPI++ 在标量参数上保证了,但向量参数上不保证。本文的 SADA 在矩阵意义下保证了(Theorem 3.1)。
  2. 自适应性:当有多个预测时,如何自动识别并利用其中最好的一个(甚至多个的组合),而无需事先知道哪个最好?本文的 SADA 通过数据驱动的最优权重实现了这一点(Theorem 3.2)。
  3. 效率界:在最优情况下,利用无标签数据和预测能达到的效率极限是什么?本文证明了当某个预测等于条件均值函数时,可以达到半参数效率界(Theorem 3.2(ii))。
  4. 预测任务:PPI 框架主要针对推断,如何将其核心思想(安全、自适应地利用预测)扩展到提升预测模型的精度(降低 excess risk)?本文的 Section 4 专门处理了这个问题。

⚠️ 作者的 framing

  • 作者的缺口框架:作者将缺口 frame 为“现有 PPI 方法(1)只处理单个预测;(2)不能保证向量参数的安全性;(3)不直接处理预测任务”。因此,SADA 被定位为“显然的下一步”——一个统一的、同时解决这三个问题的综合性框架。
  • 被淡化/回避的竞争路线
    • 直接集成(Ensembling):作者在引言中提及“heuristic selection or ensembling”,但将其一笔带过,认为其“缺乏原则性框架”。然而,一个精心设计的集成方法(如 stacking)也可能达到类似的自适应效果。作者没有与集成学习文献进行深入比较。
    • 贝叶斯方法:作者完全回避了贝叶斯半监督学习方法,这些方法通过先验分布自然地对预测不确定性进行建模和聚合。
  • 什么明显该被引/该存在、却没出现在 intro 里?
    • 集成学习(Ensemble Learning) 的经典文献(如 Breiman, 1996; Zhou, 2012)。SADA 本质上是一种加权集成方法,但权重是基于方差-协方差结构而非预测性能。与 stacking 等方法的理论联系和区别值得探讨。
    • 多重插补(Multiple Imputation):Rubin (2004)。SSL 中的标签缺失问题与多重插补有很强的类比性。PPI 和 SADA 可以看作是一种“单次插补”加“方差校正”的方法。与多重插补的对比(尤其是在处理多个预测源时)是缺失的。

张力

未见明显对立引用。所有被引工作都在朝着“更安全、更高效地利用无标签/预测数据”这一方向前进,只是路径和假设不同。本文的贡献在于统一和推广了这些路径。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • Y:标量结果变量(ground truth)。
    • X:协变量向量。
    • θ*p 维目标参数,通过得分方程 E[s(X, Y; θ*)] = 0 定义。
    • s(x, y; θ):用户指定的 p 维得分函数。
    • Ŷ = (Ŷ₁, ..., Ŷₖ)ᵀ:来自 K 个黑箱模型的预测标签向量。K 固定,不随样本量增长。
    • n:带标签样本量。
    • N:总样本量(标签 + 无标签)。
    • L = {(xᵢ, yᵢ), i=1,...,n}:带标签数据集。
    • U = {xᵢ, i=n+1,...,N}:无标签数据集(仅有协变量)。
    • ŷᵢ:第 i 个样本的预测标签向量。
    • W(Kp) × p 的权重矩阵,用于聚合多个预测的得分函数。
    • H = E[∂s(X, Y; θ*)/∂θᵀ]:得分函数的期望 Hessian 矩阵。
    • Σ_nv = var{s(X, Y; θ*)}:标签数据得分函数的方差。
    • S(x, ŷ; θ) = (s(x, ŷ₁; θ)ᵀ, ..., s(x, ŷₖ; θ)ᵀ)ᵀ:将所有预测的得分函数堆叠成的 (Kp) 维向量。
  • 模型

    • 数据生成机制:(X, Y) 服从某个联合分布 P。预测 Ŷ 由某个未知的、可能是随机的黑箱过程生成,该过程可能依赖于 X 和/或其他潜变量。
    • 统计模型:这是一个半参数模型。参数部分由得分方程 E[s(X, Y; θ*)] = 0 定义。非参数部分是 (X, Y, Ŷ) 的联合分布,除了正则性条件外,没有其他限制。关键:预测 Ŷ 的生成过程被视为完全未知的“黑箱”,不对其质量或形式做任何假设。
    • 要估的对象:θ*
  • 可观测数据

    • 可观测
      • 对所有 N 个样本:协变量 xᵢ 和预测标签向量 ŷᵢ
      • 对前 n 个样本:真实标签 yᵢ
    • 不可观测/潜在
      • 对后 N-n 个样本:真实标签 yᵢ(这是缺失的)。
      • 预测 Ŷ 的生成机制(黑箱)。
    • 识别关键:SADA 不试图识别 Y 的缺失机制或预测的生成机制。它通过构造一个无偏的增强估计方程来工作,该方程在期望上等于原始的得分方程,无论预测质量如何。这个无偏性来自于:E[ (1/(N-n)) Σ_{i=n+1}^N s(xᵢ, ŷᵢ; θ) - (1/n) Σ_{i=1}^n s(xᵢ, ŷᵢ; θ) ] = 0,因为标签和无标签样本的 (X, Ŷ) 分布相同。

第二步:讲最小内核——均值估计

本文的核心思想可以通过一个最简单的例子——均值估计——来完全理解。

  • 最简特例:设 p=1s(x, y; θ) = y - θ。那么 θ* = E[Y],即结果变量的总体均值。
  • 交代记号
    • θ* = E[Y]
    • 标签数据均值:ȳ = (1/n) Σ_{i=1}^n yᵢ
    • 预测均值:¯ŷ_k = (1/N) Σ_{i=1}^N ŷ_{k,i}(对所有样本),¯ŷ_k^L = (1/n) Σ_{i=1}^n ŷ_{k,i}(仅标签样本)。
    • 权重向量:ω = (ω₁, ..., ωₖ)ᵀ ∈ ℝᴷ
  • 核心思路: 考虑一族无偏估计量: θ̂(ω) = ȳ + Σ_{k=1}^K ω_k ( ¯ŷ_k - ¯ŷ_k^L )
    • ω = 0 时,θ̂(0) = ȳ,即只用标签数据的朴素估计量。
    • K=1, ω₁=1 时,θ̂(1) = ȳ + (¯ŷ₁ - ¯ŷ₁^L),即 PPI 估计量。
    • 这个估计量是无偏的,因为 E[¯ŷ_k - ¯ŷ_k^L] = 0
  • 最小化方差: 计算 θ̂(ω) 的方差: Var(θ̂(ω)) = (1/n) Var(Y) + [N/(n(N-n))] ωᵀ Var(Ŷ) ω - (2/n) ωᵀ Cov(Ŷ, Y) 这是一个关于 ω 的二次型。通过求导,得到最优权重: ω_opt = ((N-n)/N) Var(Ŷ)⁻¹ Cov(Ŷ, Y)ω_opt 代入,得到 SADA 估计量 θ̂_sada 的方差: Var(θ̂_sada) = (1/n) Var(Y) - (1/n - 1/N) * Cov(Ŷ, Y)ᵀ Var(Ŷ)⁻¹ Cov(Ŷ, Y)
  • 为什么成立(安全性与自适应性)
    • 安全性:上式第二项是一个非负的“效率增益”。它等于 0 当且仅当 Cov(Ŷ, Y) = 0(所有预测与真实结果不相关)。此时 ω_opt = 0θ̂_sada = ȳ。因此,SADA 的方差永远不会大于朴素估计量的方差。
    • 自适应性
      1. 完美预测:如果 Ŷ₁ ≡ Y,则 Cov(Ŷ, Y) = (Var(Y), Cov(Ŷ₂, Y), ...)ᵀ。通过计算可得 ω_opt = ((N-n)/N, 0, ..., 0)ᵀ。这意味着算法自动将所有权重放在完美预测上,忽略其他。此时 θ̂_sada = (1/N) Σ_{i=1}^N ŷ_{1,i},方差为 Var(Y)/N,相当于用全部 N 个样本的“真实”标签进行估计,收敛速率从 n^{-1/2} 提升到 N^{-1/2}
      2. 达到效率界:如果所有预测都是 X 的函数(Ŷ_k = f_k(X)),且其中一个等于条件均值 E[Y|X],则 θ̂_sada 的渐近方差等于半参数效率界。这是 Theorem 3.2(ii) 在均值估计下的特例。

总结:这个最小内核清晰地展示了 SADA 的核心机制:通过一个加权校正项来利用预测,权重由预测与真实结果的协方差结构决定,从而自动实现“安全”(不更差)和“自适应”(利用最好的)。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在半监督学习框架下,如何安全且自适应地聚合来自多个、质量未知的黑箱模型的预测,以提升对由得分方程定义的参数的统计推断效率,以及提升预测模型的精度。
  2. 核心工具/方法:提出 SADA 框架,通过构造一个包含多个预测得分函数的增强估计方程,并求解一个闭式的最优权重矩阵(Proposition 1)来最小化估计量的渐近方差(推断任务)或经验风险的方差(预测任务)。
  3. 主要结论:SADA 估计量在渐近意义下永远不会比只用标签数据的估计量差(安全性,Theorem 3.1);当某个预测完美匹配真实标签或等于条件均值函数时,SADA 能自适应地达到更快的收敛速率或半参数效率界(自适应性,Theorem 3.2);对于预测任务,SADA 的 excess risk 收敛速率不慢于标签基线,且在完美预测下可提升至 N^{-1/2}(Theorem 4.1)。

关键设定与假设

  • 设定:半监督学习,n 个带标签样本 (X, Y)N-n 个无标签样本 (X)。对所有 N 个样本,都有来自 K 个黑箱模型的预测 ŶK 固定。
  • 假设
    • Assumption 1 (推断任务):标准 M-估计正则性条件。θ* 在参数空间内部;得分函数 s 满足矩条件和可微性。这些条件保证了 θ̂_nv 的相合性和渐近正态性,是进行泰勒展开的基础。
    • Assumption 2 (预测任务):损失函数 有界且连续;ℓ_θ 及其变换是次高斯随机变量;参数空间 Θ 的 Dudley 熵积分有限。这些是保证经验风险最小化一致收敛和导出 excess risk 界的标准条件。
    • 关键无假设对预测 Ŷ 的质量、形式、生成过程没有任何假设。这是 SADA 区别于许多 SSL 方法的核心优势。预测可以是分类的、连续的、有偏的、甚至与 Y 无关。
    • 与已有文献的对比:相比 PPI (Angelopoulos et al., 2023),SADA 不要求预测是“无偏的”或“校准的”。相比 PPI++ (Angelopoulos et al., 2024),SADA 对向量参数也能保证矩阵意义下的安全性(Theorem 3.1 的 Var(θ̂_sada) ⪯ Var(θ̂_nv)),而 PPI++ 只对标量参数保证。相比传统 SSL (Chakrabortty & Cai, 2018),SADA 不假设 E[Y|X] 的模型形式。

主要结果

  • Theorem 3.1 (安全性)

    • 陈述:在 Assumption 1 下,SADA 估计量 θ̂_sada 是渐近正态的,且其渐近方差 Var(θ̂_sada) = (1/n) H⁻¹ Σ_opt H⁻ᵀ,其中 Σ_opt = Σ_nv - ((N-n)/N) Σ_g,而 Σ_g 是半正定矩阵。
    • 直觉Σ_g 代表了利用预测带来的效率增益。由于 Σ_g 半正定,Var(θ̂_sada) ⪯ Var(θ̂_nv) 在矩阵意义下成立,即 SADA 的每个分量的方差都不大于朴素估计量。
    • 必要条件Var{S(X, Ŷ; θ*)} 非奇异(否则用广义逆)。
    • 解决的技术难点:证明 Σ_g 的半正定性,并证明用估计的 Ŵ_opt 代替真实的 W_opt 不影响渐近分布(T₂ = o_p(n^{-1/2}) 部分)。
  • Theorem 3.2 (自适应性)

    • 陈述 (i):如果某个 Ŷ_k ≡ Y,则 θ̂_sada 的收敛速率从 n^{-1/2} 提升到 N^{-1/2},其渐近方差等于用全部 N 个真实标签的 Oracle 估计量。
    • 陈述 (ii):如果所有预测都是 X 的函数,且某个预测的得分函数等于条件均值 µ(x) = E[s(x, Y; θ*)|x],则 θ̂_sada 达到半参数效率界。
    • 直觉:这两个结果展示了 SADA 的“自适应”能力。算法不需要知道哪个预测最好,最优权重 W_opt 会自动将权重集中在那个最好的预测上。
    • 解决的技术难点:证明在 Ŷ₁ ≡ Ys(x, ŷ₁; θ*) ≡ µ(x) 的条件下,W_opt 退化为 ((N-n)/N, 0, ..., 0)ᵀ 的块对角形式。这需要利用块矩阵求逆公式(如 Lu & Shiou, 2002)。
  • Theorem 4.1 (预测任务的 Excess Risk)

    • 陈述:在 Assumption 2 下,SADA 预测器的 excess risk 以 O_p(n^{-1/2} + N^{-1/2}) 的速率收敛。如果某个预测完美匹配真实标签,速率提升至 O_p(N^{-1/2})
    • 直觉:这个界保证了 SADA 在预测任务上的“安全性”——其收敛速率不比只用标签数据的 n^{-1/2} 速率慢(Theorem S2 证明了 n^{-1/2} 是标签基线的最优 minimax 速率)。在完美预测下,有效样本量从 n 提升到 N
    • 必要条件:Assumption 2 中的次高斯性和熵积分条件。

证明路线与技术技巧

  • 整体路线(推断任务)

    1. 构造估计方程族:定义 θ̂(W) 为方程 (3) 的解。
    2. 渐近展开:对 θ̂(W)θ* 处进行泰勒展开,得到其渐近线性表示。
    3. 计算渐近方差:基于展开式,计算 Var(θ̂(W)) 作为 W 的函数。
    4. 求解最优权重:将方差视为 W 的二次型,通过求导(或配方法)得到闭式最优解 W_opt(Proposition 1)。
    5. 证明安全性:将 W_opt 代入方差表达式,证明 Var(θ̂(W_opt)) ⪯ Var(θ̂(0))(Theorem 3.1)。
    6. 证明自适应性:在特定条件下(如 Ŷ₁ ≡ Y),计算 W_opt 的具体形式,并代入 θ̂(W_opt) 得到其渐近分布,与 Oracle 或效率界比较(Theorem 3.2)。
    7. 处理估计的权重:证明用 Ŵ_opt 代替 W_opt 不影响渐近分布(Lemma S1 和 T₂ = o_p(n^{-1/2}) 的论证)。
  • 关键跳跃点

    • 从标量 ω 到矩阵 W:PPI++ 只处理标量权重 ω,其方差最小化是一个简单的二次型问题。SADA 需要处理 (Kp) × p 的权重矩阵 W,方差最小化变成了一个矩阵优化问题。关键跳跃在于作者巧妙地将其转化为一个关于 W 的二次型,并通过配方法直接得到了闭式解,避免了复杂的矩阵微积分。
    • 证明 Σ_g 的半正定性:这是证明安全性的核心。Σ_g 的形式类似于一个“广义方差比”,其半正定性可以通过柯西-施瓦茨不等式或将其写成一个二次型的期望来证明。
    • 自适应性证明中的块矩阵求逆:在证明 Theorem 3.2 时,需要计算 Var(Ŷ)⁻¹ Cov(Ŷ, Y)。当 Ŷ₁ ≡ Y 时,Var(Ŷ)Cov(Ŷ, Y) 具有特殊的块结构。作者利用 2×2 块矩阵求逆公式(Lu & Shiou, 2002)精确地计算出了 W_opt 的形式。
  • 技术技巧点名

    • 泰勒展开与 M-估计理论:用于推导 θ̂(W) 的渐近线性表示。
    • 块矩阵求逆:用于证明自适应性的两个特例(Supplementary Section S3, S5)。
    • 经验过程理论与 Dudley 熵积分:用于推导预测任务中 excess risk 的非渐近上界(Theorem S1 的证明)。这是处理无限维参数空间 Θ 复杂性的标准工具。
    • Talagrand 浓度不等式:用于将经验过程的期望界转化为高概率界(Theorem S1 的证明)。
    • Le Cam 的两点法:用于证明标签基线 n^{-1/2} 的 minimax 最优性(Theorem S2 的证明)。

真实例子与应用

本文包含两个真实数据应用,分别对应推断和预测任务。

  1. 推断任务:在线请求的礼貌性分析

    • 数据:来自 Danescu-Niculescu-Mizil et al. (2013) 的维基百科和 Stack Exchange 的请求文本,有人工标注的礼貌性评分(1-25 分)。
    • 方法应用:目标参数是礼貌性评分对“指示性情态特征”的回归系数。作者将 1000 个请求中的一部分视为无标签数据(隐藏其真实评分),并使用 GPT-4o、Llama-3-8B、DeepSeek-V3 三个 LLM 为所有请求生成预测的礼貌性评分。然后,用 SADA 聚合这三个预测来估计回归系数。
    • 结果:图 3 显示,SADA 的标准差在所有标签样本量 n 下都低于或等于朴素估计量(安全性),并且通常低于 PPI 和 PPI++(即使它们用了最好的单个 LLM)。图 4 显示 SADA 的置信区间更窄,且点估计更接近 Oracle(用全部真实标签的回归结果)。
    • 说明的问题:这个例子展示了 SADA 在推断任务中的实际效果:当有多个质量参差不齐的 LLM 预测时,SADA 能安全地聚合它们,自动利用其中最好的信息,从而得到比任何单个预测源都更稳定、更高效的推断。
  2. 预测任务:ImageNet 图像分类

    • 数据:ImageNet-5 数据集(5 个类别,6500 张图片)。
    • 方法应用:目标是最小化分类的交叉熵损失。作者用 EfficientNet-B0 和 RegNetY-008 两个模型在部分标签数据上训练,为所有训练图片生成伪标签 Ŷ₁Ŷ₂。然后,用 SADA 的预测版本(Algorithm 1)来训练一个 DaViT-T 分类器。
    • 结果:图 5 显示,在不同标签-无标签比例下,SADA 的 Top-1 准确率始终高于朴素基线(只用标签数据训练)和使用单个伪标签的 PPI。
    • 说明的问题:这个例子展示了 SADA 在预测任务中的优势。即使伪标签来自不完美的模型,SADA 也能通过自适应加权来提升最终预测模型的精度,且效果优于仅依赖单个伪标签源。

🔎 结论是否比证明窄

  • Theorem 3.2(ii) 的陈述:该定理声称,当所有预测是 X 的函数且某个预测的得分函数等于条件均值 µ(x) 时,SADA 达到半参数效率界。这个条件非常强。在实际中,我们几乎不可能知道哪个预测的得分函数恰好等于 µ(x)。作者在证明中(Supplementary Section S5)也明确假设了 s(x, ŷ₁; θ*) ≡ µ(x)。因此,这个结论的适用范围比“只要有一个好预测”这个泛泛的说法要窄得多。它要求这个好预测必须是条件均值的完美估计,而不仅仅是与 Y 相关。
  • Theorem 4.1 的界:论文给出的 excess risk 界是 O_p(n^{-1/2} + N^{-1/2})。这个界虽然保证了安全性,但并没有证明 SADA 在预测任务上比简单的集成方法(如对多个预测器的输出取平均)有理论上的优势。作者在模拟中展示了 SADA 优于 PPI,但没有与一个精心设计的集成基线(如 stacking)进行比较。因此,SADA 在预测任务上的“自适应”优势更多是经验性的,而非理论上的压倒性证明。

四、开放问题

  1. 分布偏移(Distribution Shift):本文假设标签和无标签数据来自同一分布。作者在讨论中明确指出这是未来方向。扎根点:Section 7, "An essential assumption in this paper is that the labeled and unlabeled data are drawn from the same distribution." 如何将 SADA 扩展到协变量偏移或标签偏移场景,并保持安全性和自适应性,是一个直接且重要的开放问题。

  2. 多个预测的统计-计算权衡:本文假设 K 固定。当 K 很大(例如,来自一个大型模型集成或许多不同的 LLM)时,Var(Ŷ) 的估计和求逆可能变得不稳定或计算成本高昂。是否存在一个“信息-计算”的权衡?即,为了获得聚合多个预测的微小效率增益,是否值得付出显著增加的计算成本?扎根点:Section 2, "Throughout, we assume that K is fixed and does not grow with the sample size." 这个假设限制了方法在高维预测空间的应用。

  3. 高维扩展:本文的推断框架是针对固定维度的参数 θ*。当 θ* 的维度 p 很大(例如,高维线性回归)时,W 矩阵的维度变为 (Kp) × p,估计和存储都变得困难。如何将 SADA 的安全性和自适应性扩展到高维稀疏设定?扎根点:论文的设定是 p 维参数,但未讨论 pn 的关系。这与 Deng et al. (2024) 等在高维 SSL 上的工作形成了对比,后者专门处理了高维问题。

  4. 与其他框架的结合:SADA 的核心是增强估计方程。这个思想是否可以与双重稳健估计(如 AIPW)或去偏机器学习(DML)结合?例如,当 s(x, y; θ) 是某个复杂模型的得分时,能否用机器学习来估计 µ(x) = E[s(x, Y; θ*)|x],然后将其作为一个“预测”输入 SADA,从而获得双重稳健性?扎根点:Theorem 3.2(ii) 表明,当某个预测等于 µ(x) 时达到效率界。这暗示了将 SADA 与 µ(x) 的估计结合的可能性。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论