High-dimensional semi-supervised learning: in search of optimal inference of the mean¶
作者: Yuqian Zhang, Jelena Bradic
来源: Biometrika
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本子方向研究的是半监督学习(Semi-Supervised Learning, SSL)中的统计推断问题。核心设定是:研究者拥有大量无标签数据(样本量 N)和少量有标签数据(样本量 n),且 N >> n。传统直觉认为,无标签数据能提升估计精度,但量化这一收益——即无标签数据究竟能在多大程度上降低均值估计的渐近方差、能否改变收敛速率——是统计理论的核心问题。当前该方向的成熟度处于理论框架已建立但边界条件仍在探索的阶段:经典半监督推断理论(如 Zhang et al., 2019; Chakrabortty & Cai, 2018)已给出线性模型下的效率界,但高维、非参数或半参数设定下的最优推断仍是开放问题。
发展脉络(history)¶
奠基工作: - Zhang et al. (2019) 和 Chakrabortty & Cai (2018) 是半监督推断的奠基性工作。它们首次严格证明了:在参数模型(如线性回归)下,无标签数据可将均值估计的渐近方差从 O(1/n) 降低到 O(1/N) 的量级,即无标签数据能改变收敛速率。但这两篇工作均假设 outcome 模型是正确指定的参数模型(如线性),且要求 outcome 模型可被根号 n 一致估计。
主要进展: - Azriel et al. (2022) 将半监督推断扩展到高维稀疏线性模型,证明了在 Lasso 估计下,无标签数据仍能提升效率。但该工作依赖稀疏性假设(s = o(n/log p)),且要求 outcome 模型是线性的。 - Deng et al. (2023) 提出了半监督下的双重稳健估计,允许 outcome 模型或 propensity 模型之一被错误指定。但该工作仍要求 outcome 模型可被根号 n 一致估计,且未处理高维设定。
当前 frontier: - 非参数 / 半参数设定下的半监督推断:现有工作大多假设 outcome 模型是参数或稀疏高维的,但实际应用中 outcome 模型可能是非参数(如核方法、随机森林)或半参数(如部分线性模型)。这些模型通常无法达到根号 n 一致估计(例如非参数回归的收敛速率是 n^{-2/(2+d)},远慢于根号 n)。因此,一个关键问题是:当 outcome 模型只能以慢于根号 n 的速率一致估计时,半监督学习是否还能提供根号 n 推断?
本文的位置: - 本文(Zhang & Bradic, 2024)直接回答了上述问题。它提出一种 k 折交叉拟合双重稳健估计量,在仅需 outcome 模型慢于根号 n 的一致估计(如高维、非参数或半参数模型)的条件下,仍能实现根号 n 收敛的均值推断。这是首次将半监督推断的适用范围从参数/稀疏高维模型扩展到任意慢速一致估计的模型。
子线索聚类¶
这些被引文献大致落在 2 条子线索上:
- 参数/半参数半监督推断(Zhang et al., 2019; Chakrabortty & Cai, 2018; Azriel et al., 2022; Deng et al., 2023):
- 核心假设:outcome 模型是参数或稀疏高维的,且可被根号 n 一致估计。
- 方法:基于 influence function 或双重稳健估计。
-
瓶颈:无法处理非参数或半参数 outcome 模型。
-
非参数/高维半监督推断(本文):
- 核心假设:outcome 模型只需慢于根号 n 的一致估计(如非参数回归的 n^{-2/(2+d)})。
- 方法:k 折交叉拟合双重稳健估计。
- 贡献:首次证明慢速估计下仍可根号 n 推断。
这个方向在追问的核心问题¶
- 无标签数据能改变收敛速率吗? 在参数模型下,答案是肯定的(从 O(1/n) 到 O(1/N))。但在非参数模型下,答案是否定的——收敛速率仍由有标签样本量 n 决定,但渐近方差可被降低。
- outcome 模型需要多精确? 现有工作大多要求根号 n 一致估计。本文证明:只需慢于根号 n 的一致估计即可。
- 双重稳健性在半监督下如何体现? 本文证明:只要 outcome 模型或 propensity 模型之一被正确指定,估计量就是根号 n 一致的。
- 效率界是什么? 本文推导了半监督设定下均值估计的 semiparametric efficiency bound,并证明所提估计量达到该界。
⚠️ 作者的 framing¶
这是作者的说法:作者将缺口 frame 成“现有半监督推断方法均要求 outcome 模型可被根号 n 一致估计,这排除了高维、非参数或半参数模型”。因此,本文的贡献是“首次在慢速估计下实现根号 n 推断”。作者淡化了以下竞争路线: - 直接使用无标签数据做非参数回归(如核方法、随机森林)——这些方法本身就能利用无标签数据提升预测精度,但作者认为它们“无法提供根号 n 推断”。 - 基于模型平均或集成的方法——作者未讨论这些方法在半监督下的表现。
什么明显该被引 / 该存在、却没出现在 intro 里? - 半监督下的非参数效率界:是否存在关于非参数回归在半监督设定下的 minimax 下界?作者未引用相关文献(如 Yang et al., 2017 关于半监督 minimax 下界的工作)。 - 半监督下的因果推断:作者将方法扩展到 HTE 估计,但未引用半监督因果推断的已有工作(如 Kallus et al., 2018 关于半监督 ATE 估计的工作)。
张力¶
未见明显对立引用。现有工作均支持“无标签数据能提升效率”这一结论,分歧仅在于提升的程度(参数模型下可改变速率,非参数模型下仅降低方差)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - Y:结果变量(outcome),标量,可观测。 - X:协变量(covariates),p 维向量,可观测。 - R:标签指示变量(label indicator),R=1 表示 Y 被观测,R=0 表示 Y 缺失。可观测。 - n:有标签样本量(R=1 的样本数)。 - N:无标签样本量(R=0 的样本数),且 N >> n。 - 总样本量:M = n + N。 - μ:目标 estimand,即 E[Y](总体均值)。要估计的对象。 - m(x):outcome 回归函数,m(x) = E[Y | X=x]。要估计的 nuisance 函数。 - π(x):标签概率(propensity score),π(x) = P(R=1 | X=x)。要估计的 nuisance 函数。 - g(x):辅助函数(auxiliary function),用于构建 influence function。要估计的 nuisance 函数。
模型: - 数据生成机制:{(X_i, R_i, Y_i)} 是 i.i.d. 样本,其中 Y_i 在 R_i=1 时被观测,R_i=0 时缺失。 - 缺失机制:MAR(Missing At Random),即 R ⊥ Y | X。这是半监督学习的标准假设。 - 目标:基于可观测数据 {(X_i, R_i, R_i Y_i)} 推断 μ = E[Y]。
可观测数据: - 有标签数据:{(X_i, Y_i) : R_i=1},共 n 个样本。 - 无标签数据:{X_i : R_i=0},共 N 个样本。 - 不可观测:缺失的 Y 值(R_i=0 时的 Y_i)。
第二步:讲最小内核¶
最简特例:假设 p=1(一维协变量),且 outcome 模型 m(x) 是非参数回归(如核方法),其收敛速率是 n^{-2/3}(当 d=1 时),远慢于根号 n。此时,传统方法(如直接用有标签数据做样本均值)的方差是 O(1/n),而本文方法的目标是:在 m(x) 只能以 n^{-2/3} 速率估计的条件下,仍实现根号 n 收敛的 μ 估计。
核心思路: 1. 构建 influence function:对于均值 μ,其 efficient influence function(EIF)是:
-
交叉拟合(cross-fitting):将数据分成 K 折,用 K-1 折估计 nuisance 函数(m 和 π),在第 K 折上计算 EIF 的样本均值。交叉拟合消除了 nuisance 估计误差对根号 n 推断的影响。
-
双重稳健性:只要 m(x) 或 π(x) 之一被正确指定,估计量就是根号 n 一致的。在半监督设定下,π(x) 通常可被精确估计(因为 R 的缺失机制是已知的或可被参数模型拟合),因此即使 m(x) 估计很慢,估计量仍能根号 n 收敛。
为什么成立: - 交叉拟合后的 EIF 样本均值可写成:
最小内核总结:本文的核心数学贡献是:在 outcome 模型只能以慢于根号 n 的速率一致估计时,通过交叉拟合和双重稳健性,仍能实现根号 n 收敛的均值推断。这等价于:半监督设定下,均值估计的收敛速率由有标签样本量 n 决定,但渐近方差可被无标签数据降低(通过第二项中的 m 估计)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在半监督学习设定下(有标签样本量 n << 无标签样本量 N),如何对总体均值 μ = E[Y] 进行根号 n 收敛的推断,即使 outcome 模型 m(x) 只能以慢于根号 n 的速率一致估计。
- 核心工具 / 方法:提出一种 k 折交叉拟合双重稳健估计量,结合 influence function 和交叉拟合技术,在仅需 m(x) 慢速一致估计的条件下实现根号 n 推断。
- 主要结论:所提估计量是根号 n 一致的、渐近正态的,且达到半监督设定下的 semiparametric efficiency bound;方法可扩展到异质性处理效应(HTE)的估计。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
定义: - μ = E[Y](目标 estimand)。 - m(x) = E[Y | X=x](outcome 回归函数)。 - π(x) = P(R=1 | X=x)(标签概率)。 - g(x) = E[Y | X=x, R=1](有标签数据下的 outcome 回归)。注意:在 MAR 假设下,g(x) = m(x)。
假设: 1. MAR(Missing At Random):R ⊥ Y | X。这是半监督学习的标准假设,确保无标签数据提供关于 m(x) 的信息。 2. 重叠(Overlap):存在常数 c > 0,使得 π(x) ≥ c 对所有 x 成立。确保 propensity score 不退化。 3. 慢速一致估计:存在序列 {a_n} 满足 a_n → 0 且 a_n √n → ∞(即慢于根号 n),使得: - ||\hat{m} - m||_2 = O_p(a_n)(outcome 模型的一致估计)。 - ||\hat{\pi} - π||_2 = O_p(a_n)(propensity 模型的一致估计)。 这是本文的核心放宽:传统方法要求 a_n = O(1/√n),本文允许 a_n 慢于 1/√n。 4. 有界性:Y 和 m(x) 有界,π(x) 有界远离 0 和 1。
相比已有文献的放宽: - 相比 Zhang et al. (2019) 和 Chakrabortty & Cai (2018):本文不要求 m(x) 是参数模型或可根号 n 一致估计。 - 相比 Azriel et al. (2022):本文不要求 m(x) 是稀疏高维线性模型。 - 相比 Deng et al. (2023):本文不要求 m(x) 可根号 n 一致估计。
主要结果¶
定理 1(根号 n 一致性与渐近正态性): - 陈述:在假设 1-4 下,所提交叉拟合双重稳健估计量 \(\hat{\mu}\) 满足:
定理 2(效率界): - 陈述:在半监督设定下,均值估计的 semiparametric efficiency bound 是 V(即定理 1 中的渐近方差)。所提估计量达到该界。 - 直觉:V 是半监督设定下所有正则估计量的渐近方差下界。无标签数据通过 Var[m(X)] 项降低了方差。 - 必要条件:同定理 1。
定理 3(扩展到 HTE): - 陈述:对于异质性处理效应 τ(x) = E[Y(1) - Y(0) | X=x],所提方法可估计其均值 E[τ(X)],且同样达到根号 n 收敛和效率界。 - 直觉:HTE 估计可视为两个均值估计的差,每个均值估计都可用本文方法处理。
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干):
- 构建交叉拟合估计量:
- 将数据分成 K 折(K=5 或 10)。
- 对每折 k,用其余 K-1 折数据估计 \(\hat{m}_{-k}\) 和 \(\hat{\pi}_{-k}\)。
- 在第 k 折上计算:
\[\hat{\mu}_k = \frac{1}{n_k} \sum_{i \in \text{fold } k, R_i=1} \frac{1}{\hat{\pi}_{-k}(X_i)} (Y_i - \hat{m}_{-k}(X_i)) + \frac{1}{M_k} \sum_{i \in \text{fold } k} \hat{m}_{-k}(X_i)\]其中 n_k 是第 k 折的有标签样本数,M_k 是第 k 折的总样本数。
-
最终估计量:\(\hat{\mu} = \frac{1}{K} \sum_{k=1}^K \hat{\mu}_k\)。
-
分解误差:
-
将 \(\hat{\mu} - \mu\) 分解为:
\[\hat{\mu} - \mu = \frac{1}{M} \sum_{i=1}^M (m(X_i) - \mu) + \frac{1}{n} \sum_{i: R_i=1} \frac{1}{\pi(X_i)} (Y_i - m(X_i)) + \text{交叉项}\]第一项是 m(X) 的样本均值(用全部数据),第二项是加权残差(用有标签数据),交叉项包含 nuisance 估计误差。 -
控制交叉项:
-
交叉项可写成:
\[\frac{1}{n} \sum_{i: R_i=1} \frac{1}{\hat{\pi}_{-k(i)}(X_i)} (Y_i - \hat{m}_{-k(i)}(X_i)) - \frac{1}{n} \sum_{i: R_i=1} \frac{1}{\pi(X_i)} (Y_i - m(X_i))\]通过泰勒展开和交叉拟合的独立性,证明交叉项是 o_p(1/√n)。 -
应用中心极限定理:
- 第一项(m 的样本均值)是 O_p(1/√M) = o_p(1/√n)(因为 M >> n)。
- 第二项(加权残差)是 O_p(1/√n),且渐近正态。
-
因此,\(\hat{\mu} - \mu\) 由第二项主导,收敛速率为 1/√n。
-
证明效率界:
- 计算 EIF 的方差,证明 V 是 semiparametric efficiency bound。
- 证明所提估计量的渐近方差等于 V。
关键跳跃点: - 交叉项的控制:最吃功夫的引理是“交叉拟合后,nuisance 估计误差对根号 n 推断的影响是 o_p(1)”。这需要证明:
技术技巧点名: - 交叉拟合(cross-fitting):用于消除 nuisance 估计误差对根号 n 推断的影响。这是本文的核心技巧,使得慢速一致估计成为可能。 - 双重稳健性(double robustness):只要 m(x) 或 π(x) 之一被正确指定,估计量就是根号 n 一致的。在半监督设定下,π(x) 通常可被精确估计,因此即使 m(x) 估计很慢,估计量仍有效。 - Efficient influence function(EIF):用于构建根号 n 一致的估计量,并推导效率界。 - 泰勒展开与经验过程理论:用于控制交叉项。
真实例子与应用¶
本文为纯理论 / 无实证例子。论文包含模拟实验,但未使用真实数据。模拟实验设计如下: - 数据生成:X 从均匀分布或正态分布生成,Y = m(X) + ε,其中 m(x) 是线性、非线性或高维稀疏函数。 - 设定:n = 100, 200, 500;N = 1000, 5000, 10000;p = 10, 50, 100。 - 方法对比:本文方法 vs. 样本均值(仅用有标签数据)vs. 半监督线性回归(Zhang et al., 2019)。 - 结果:本文方法在所有设定下均达到根号 n 收敛,且渐近方差接近理论效率界 V。相比之下,样本均值的方差是 Var[Y](更大),半监督线性回归在模型错误指定时偏差很大。
🔎 结论是否比证明窄¶
是。作者在 intro 中 claim 方法适用于“高维、非参数或半参数模型”,但证明中假设了: - 有界性:Y 和 m(x) 有界。这排除了重尾分布或 unbounded outcome 的设定。 - 重叠假设:π(x) ≥ c > 0。这排除了标签概率趋近于 0 的区域(即某些协变量值下几乎无标签数据)。 - 慢速一致估计:要求 ||\hat{m} - m||_2 = o_p(1)。这排除了 m(x) 完全不可估计的设定(如高维线性模型在 p >> n 且无稀疏性假设时)。
这些假设在 intro 中被提及但未强调其限制性。例如,对于高维非参数模型(如 p 很大时的核方法),慢速一致估计可能要求样本量 n 足够大,这在实践中可能不满足。
四、开放问题¶
-
重尾或 unbounded outcome 下的半监督推断:本文假设 Y 和 m(x) 有界。若 Y 是重尾分布(如 Cauchy),根号 n 推断是否仍可能?需要哪些额外假设?(扎根于定理 1 的“有界性”假设。)
-
非参数 m(x) 的 minimax 下界:本文证明了半监督设定下均值估计的效率界 V,但未给出非参数 m(x) 的 minimax 下界。是否存在一个“半监督 minimax 下界”,表明无标签数据最多能将方差降低到 V?(扎根于定理 2 的效率界推导,但未与 minimax 下界对比。)
-
高维 p >> n 下的半监督推断:本文假设 m(x) 可被一致估计(即使慢速)。在高维 p >> n 且无稀疏性假设时,m(x) 可能完全不可估计。此时半监督学习是否还能提供任何收益?(扎根于假设 3 的“慢速一致估计”要求。)
-
半监督下的因果推断(ATE / ATT):作者将方法扩展到 HTE 估计,但未讨论 ATE 或 ATT 的估计。在半监督设定下(如大量无标签数据),ATE 的 semiparametric efficiency bound 是什么?是否也能在慢速 nuisance 估计下实现根号 n 推断?(扎根于定理 3 的 HTE 扩展,但未涉及 ATE。)
提醒:要确认第 2 条是否是真 gap,建议去读半监督 minimax 下界的近期文献(如 Yang et al., 2017; Lafferty & Wasserman, 2007)。若这些文献已给出下界,则本文的效率界 V 可能不是最优的。
Maintained by 陈星宇 · Homepage · Source on GitHub