Prediction-Powered Linear Regression: A Balance Between Interpretation and Prediction¶
讲者: Xinyu Zhang
会场: Financial Econometrics
报告题目: Prediction-Powered Linear Regression: A Balance between Interpretation and Prediction
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:在仅有少量标注数据(labeled data)和大量未标注数据(unlabeled data)的半监督学习(SSL)设定下,如何利用未标注数据来提升线性回归模型的预测精度,同时保持模型的可解释性。 该方向试图在“纯线性模型的可解释性”与“黑箱机器学习(ML)模型的高预测精度”之间取得平衡。当前,该方向正处于快速发展期,主要挑战在于如何稳健地处理由模型设定、调参和ML算法选择带来的多重不确定性。
发展脉络(history)¶
-
奠基工作:半监督学习(SSL)与预测驱动推断(PPI)的独立发展
- SSL 的统计基础:早期SSL工作关注如何利用未标注数据提升估计效率。例如,Chakrabortty and Cai (2018) 在线性回归SSL框架下提出了比普通最小二乘(OLS)更有效的估计量。Song et al. (2024) 和 Kim et al. (2024) 将这一思路推广到一般的M-估计问题。这些工作奠定了SSL的统计理论,但并未与先进的ML算法深度整合。
- PPI 的提出:Angelopoulos et al. (2023a) 提出了标准的PPI框架,其核心创新是:即使ML预测模型质量不高,也能通过结合标注数据和ML生成的伪标签(pseudo-labels)进行有效的统计推断(如构造置信区间)。这是该方向的一个里程碑,因为它提供了一个通用的、理论上有保证的框架来利用ML预测。
-
主要进展:PPI的效率改进与SSL的泛化
- PPI 效率提升:标准PPI在某些情况下效率可能低于仅用标注数据的方法。为此,Angelopoulos et al. (2023b) 提出了PPI++,通过引入一个功率调参参数(power tuning parameter)λ来更灵活地控制未标注数据的贡献,从而提升效率。其他变体如 Zrnic and Candès (2024) 的cross-PPI和 Gu and Xia (2024) 的local PPI也旨在解决不同场景下的效率问题。
- SSL 的泛化:SSL方法被扩展到更复杂的模型和设定。例如,Chakrabortty et al. (2022) 研究了半监督分位数估计,Kim et al. (2024) 提出了半监督U-统计量。这些工作展示了SSL框架的广泛适用性。
-
当前 Frontier:整合模型平均与PPI,处理多重不确定性
- 模型平均(Model Averaging):在传统回归中,模型平均(如 Hansen, 2007 的Mallows模型平均,Hansen and Racine, 2012 的Jackknife模型平均)已被证明能有效降低模型选择的不确定性,提升预测稳健性。
- 本文的位置:本文(Zhang, 2026)是第一个将模型平均思想系统性地引入PPI框架的工作。它明确指出,现有PPI方法存在三种未被同时处理的“不确定性”:模型设定不确定性(选哪些协变量)、调参不确定性(λ选多少)和ML算法不确定性(用哪个黑箱模型)。本文提出的PUMA框架,通过构建一个覆盖所有候选策略(模型×λ×算法)的集合,并用一个数据驱动的Mallows型准则来分配权重,从而统一地处理了这三种不确定性。这是该方向的一个自然且重要的推进。
子线索聚类¶
- 半监督学习(SSL)理论:关注在SSL设定下,如何利用未标注数据提升参数估计或推断的效率。代表工作:Chakrabortty and Cai (2018), Song et al. (2024), Kim et al. (2024), Zhang and Bradic (2022)。这些工作通常假设一个特定的统计模型(如线性模型),并推导出更有效的估计量。
- 预测驱动推断(PPI):关注如何将黑箱ML模型的预测结果与少量标注数据结合,进行有效的统计推断(如置信区间、假设检验)。代表工作:Angelopoulos et al. (2023a, 2023b), Zrnic and Candès (2024), Gu and Xia (2024)。这些工作的核心是构造一个“修正”的估计量或损失函数,以保证推断的有效性。
- 模型平均(Model Averaging):关注如何通过加权组合多个候选模型来提升预测精度,而非选择一个单一模型。代表工作:Hansen (2007), Hansen and Racine (2012), Lu and Su (2015), Zhu et al. (2019)。这些工作通常为权重选择提供理论最优性保证(如渐近最优预测风险)。
- 后预测推断(Post-Prediction Inference):关注在将ML预测结果直接用于下游分析时,如何纠正由此产生的偏差和方差膨胀。代表工作:Wang et al. (2020), Miao et al. (2025)。这些工作与PPI密切相关,但更侧重于“纠正”而非“利用”。
这个方向在追问的核心问题¶
- 如何稳健地利用未标注数据? 当ML预测质量不佳时,如何避免“垃圾进,垃圾出”的问题?PPI通过构造修正损失函数来解决,但修正的程度(λ)如何自适应地选择?
- 如何平衡可解释性与预测精度? 线性模型可解释性强但预测精度有限,ML模型反之。如何在一个框架内同时获得两者的优点?
- 如何处理多重不确定性? 在PPI框架下,模型选择、调参、算法选择都会引入不确定性。忽略任何一种都可能导致次优甚至错误的结论。如何设计一个统一的框架来同时处理这些不确定性?
- 理论保证是什么? 对于提出的新方法,能否证明其在预测风险上的渐近最优性(即达到不可达的“神谕”预测的性能)?能否给出估计量的收敛速度?
⚠️ 作者的 framing¶
- 作者的缺口定义:作者将现有PPI工作的缺口明确frame为“未能同时处理模型不确定性、调参不确定性和ML算法不确定性”。作者声称,现有PPI方法要么选择一个单一模型(如Angelopoulos et al. 2023a),要么固定调参参数(如Angelopoulos et al. 2023b),要么依赖单一ML算法,因此其性能是脆弱的。本文的PUMA通过模型平均“统一地”解决了这些问题,成为“显然的下一步”。
- 被淡化/回避的竞争路线:作者在引言中提到了“后预测推断”(Wang et al., 2020; Miao et al., 2025)作为相关但不同的工作。作者淡化了这些方法,因为它们侧重于“纠正”而非“利用”预测,且通常不提供预测最优性保证。作者也回避了与更复杂的非线性模型平均方法(如基于贝叶斯的模型平均)的直接比较,而是专注于其提出的基于Mallows准则的线性组合。
- 值得研究者去查的问题:什么明显该被引/该存在、却没出现在intro里? 作者引用了大量模型平均文献,但未提及贝叶斯模型平均(BMA)。BMA是处理模型不确定性的经典方法,其与PPI的结合可能是一个自然的方向。作者也未讨论集成学习(Ensemble Learning) 中的“堆叠(Stacking)”方法,该方法也是一种通过加权组合多个模型来提升预测性能的范式。探究PUMA与这些方法的联系与区别,是一个有价值的研究起点。
张力¶
未见明显对立引用。所有被引工作基本在同一个“利用未标注数据提升统计性能”的大框架下,彼此之间是互补或递进关系,而非矛盾关系。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
n: 标注样本量。N: 未标注样本量。p: 真实数据生成过程(DGP)中所有协变量的维度(可能很大或无穷)。q: 实际观测到的协变量维度(q ≤ p)。X_i ∈ R^q: 第i个观测的可观测协变量向量(标注和未标注数据都有)。Y_i ∈ R: 第i个观测的可观测响应变量(仅标注数据有)。X_i^* ∈ R^p: 第i个观测的潜在/真实协变量向量(不可完全观测)。µ_i = g(X_i^*): 真实的回归函数,是本文想要预测的目标。ϵ_i: 均值为0、方差为σ²的随机误差。f_m(·): 第m个预训练的ML算法(黑箱),用于生成伪标签。λ_m ∈ [0, 1]: 第m个候选策略的功率调参参数,控制未标注数据的贡献。θ^(m) ∈ R^{k_m}: 第m个候选线性工作模型的回归系数向量(待估参数)。w = (w_1, ..., w_M)^T: 权重向量,位于M维单纯形W上,用于加权组合M个候选策略的预测。bµ(w): 基于权重w的模型平均预测值。R(w) = E[||bµ(w) - µ||^2 | X^*]: 给定真实协变量下的预测风险(期望平方损失)。
-
模型:
- 真实数据生成过程(DGP):
Y_i = g(X_i^*) + ϵ_i,其中g(·)是一个未知的平滑函数。这个模型是高度非参数的,是“真相”。 - 工作模型(Candidate Models):为了可解释性和计算便利,我们使用一系列线性模型来近似DGP。第
s1个候选模型为:Y_i = X_i^{(s1)T} θ^{(s1)} + e_i^{(s1)},其中X_i^{(s1)}是X_i的一个子集(维度k_{s1}),e_i^{(s1)}是近似误差。这些模型都是“错误”的(misspecified),除非它们恰好包含了所有真实协变量且g是线性的。 - PPI++修正损失:为了利用未标注数据,我们不直接对工作模型做OLS,而是最小化一个修正损失函数(公式3):
L^{(m)}_{λ_m, f_m}(θ^{(m)}) = L_n^{(m)}(θ^{(m)}) + λ_m [ ̃L_N^{f_m}(θ^{(m)}) - L_n^{f_m}(θ^{(m)}) ]L_n^{(m)}: 基于标注数据的平方损失。̃L_N^{f_m}: 基于未标注数据和ML预测f_m(̃X)的平方损失。L_n^{f_m}: 基于标注数据和ML预测f_m(X)的平方损失。- 这个修正的核心思想是:用
̃L_N^{f_m} - L_n^{f_m}来估计“如果未标注数据有真实标签,其损失会是多少”的偏差,从而对L_n^{(m)}进行校正。
- 真实数据生成过程(DGP):
-
可观测数据:
- 可观测:
{(X_i, Y_i)}_{i=1}^n(标注数据)和{̃X_i}_{i=n+1}^{n+N}(未标注数据,只有协变量)。 - 想要但观测不到:未标注数据的真实响应
̃Y_i,以及真实DGP中的全部协变量X_i^*。本文的目标是预测µ_i = g(X_i^*),但只能通过可观测的X_i和ML预测f_m(X_i)来间接估计。
- 可观测:
第二步:讲最小内核¶
本文的核心数学问题可以简化为一个加权最小二乘问题。
最简特例:假设我们只有一个候选线性模型(M=1),一个ML算法f,和一个固定的调参参数λ。那么PUMA就退化为PPI++。此时,我们要解决的问题是:
给定标注数据(X, Y)和未标注数据(̃X, f(̃X)),找到一个线性系数θ,使得修正损失L_λ(θ)最小。
这个修正损失是:
L_λ(θ) = (1/2n) ||Xθ - Y||² + λ [ (1/2N) ||̃Xθ - f(̃X)||² - (1/2n) ||Xθ - f(X)||² ]
为什么这个特例能体现核心思路?
1. 可解释性:最终预测是Xθ,是线性的,因此可解释。
2. 利用未标注数据:损失函数中包含了未标注数据项||̃Xθ - f(̃X)||²,它鼓励θ使得线性模型的预测与ML的预测f(̃X)在未标注数据上保持一致。
3. 偏差校正:减去||Xθ - f(X)||²项是为了校正ML预测f可能存在的系统性偏差。如果f在标注数据上表现很好(即f(X) ≈ Y),那么L_n^f和L_n接近,修正项λ[̃L_N^f - L_n^f]就近似于λ̃L_N^f,即主要依赖ML的预测。如果f有偏差,这个减法项会抵消掉一部分偏差。
4. 调参:λ控制了对ML预测的信任程度。λ=0时退化为仅用标注数据的OLS;λ=1时是标准的PPI。
在这个特例下,证明怎么走?
最小化L_λ(θ)是一个凸二次优化问题,有闭式解(公式4):
bθ_λ = [ (1-λ)X^TX + rλ ̃X^T̃X ]^{-1} [ X^TY + rλ ̃X^T f(̃X) - λ X^T f(X) ]
其中r = n/N。
这个闭式解是本文所有后续理论分析的基础。当推广到多个候选策略(M>1)时,核心问题就变成了:如何选择权重w来组合这M个闭式解bθ^{(m)},使得最终的预测bµ(w) = X Σ w_m bθ^{(m)}的预测风险R(w)最小?
本文的核心技术贡献就是提出了一个Mallows型准则C(w)(公式7),它是R(w)的无偏估计(至多差一个常数),因此最小化C(w)就等价于(渐近地)最小化R(w)。整个证明路线就是围绕证明这个“等价性”展开的。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在半监督学习设定下,如何通过模型平均(Model Averaging)来统一处理预测驱动推断(PPI)框架中存在的模型设定、调参参数和ML算法选择三种不确定性,以实现线性模型的可解释性与ML模型高预测精度的平衡。
- 核心工具/方法:提出了PUMA框架。它首先利用PPI++为每个候选策略(模型×λ×算法)生成一个闭式线性估计量,然后通过最小化一个Mallows型准则(
C(w))来数据自适应地确定这些估计量的最优加权组合权重。 - 主要结论:在温和的正则条件下,PUMA的预测风险在样本内和样本外均达到渐近最优(即与不可达的“神谕”预测风险之比趋近于1),并且其系数估计量具有一致性。
关键设定与假设¶
- 设定:半监督学习,
n个i.i.d.标注数据(X_i, Y_i),N个i.i.d.未标注数据{̃X_i},均来自同一联合分布。真实DGP为Y_i = g(X_i^*) + ϵ_i,其中g未知,X_i^*是潜在的高维真实协变量,我们只能观测到其子集X_i。 - 假设:
- Condition 1 (矩条件):误差项
ϵ_i的条件4G阶矩有界。这是证明模型平均渐近最优性的标准条件,用于控制高阶矩,确保大数定律和中心极限定理的适用性。与Hansen (2007)等文献一致。 - Condition 2 (风险发散条件):最小风险
ξ = inf_w R(w)发散到无穷的速度不能太快,即M ξ^{-2G} Σ_m R(w^o_m)^G = o_p(1)。这个条件要求所有候选策略的风险不能远大于最小风险,否则模型平均无法“拯救”一个极差的候选策略。这是模型平均理论中保证权重选择准则有效的关键条件,与Wan et al. (2010)类似。 - Condition 3 (特征值条件):标注和未标注数据的协方差矩阵的特征值有界且远离0。这是保证线性回归估计量稳定性的标准条件,确保矩阵可逆且条件数可控。与Wang (2011)一致。
- Condition 4 (有界性条件):
E(||µ||^2) = O(n)且n^{-1} k_{M^*}^2 = O(1)。前者限制了真实回归函数的大小,后者允许最大候选模型的维度k_{M^*}随样本量n发散,但速度不能太快(如k_{M^*} = o(n^{1/2}))。这是处理高维候选模型的标准条件。 - Condition 5-7 (样本外最优性条件):这些条件进一步限制了协变量矩、估计量的收敛速度以及风险的发散速度,以保证样本外预测风险的最优性。例如,Condition 7要求
n^{1/2} M^{1/2} k_{M^*}^2 / E(ξ) = o(1),这要求候选策略数量M和最大维度k_{M^*}不能增长太快,且模型整体上要有足够的“误设”程度(即E(ξ)不能太小)。
- Condition 1 (矩条件):误差项
主要结果¶
- 定理1 (已知方差下的样本内渐近最优性):当误差方差
σ²已知时,由Mallows准则C(w)(公式7)选出的权重ew,其预测损失L(ew)与所有可能权重下的最小损失inf_w L(w)之比依概率收敛到1。这意味着PUMA的预测性能渐近地达到了“神谕”水平。 - 定理2 (未知方差下的样本内渐近最优性):当
σ²未知,用其估计量bσ²_{M^*}替代时,上述渐近最优性依然成立。这保证了方法的实用性。 - 定理3 (样本外渐近最优性):在更强的条件下,PUMA的期望样本外预测损失
E(L_new(ew))与所有可能权重下的最小期望样本外损失inf_w E(L_new(w))之比趋近于1。这证明了PUMA对新数据的预测能力也是渐近最优的。 - 定理4 (估计一致性):当候选模型中存在一个正确设定的线性模型时,PUMA的系数估计量
bθ(ew)以O_p(√(M k_{M^*}/n))的速度收敛到真实参数θ。如果M和k_{M^*}固定,则收敛速度为O_p(1/√n),与经典参数估计一致。
证明路线与技术技巧¶
-
整体路线:
- 构造风险的无偏估计:首先证明Mallows准则
C(w)的条件期望E(C(w)|X^*)等于预测风险R(w)加上一个与w无关的常数nσ²(见Remark 1)。这一步是核心,它将一个不可观测的优化问题(最小化R(w))转化为一个可观测的优化问题(最小化C(w))。 - 证明准则的集中性:证明
C(w)在其期望附近高度集中,即sup_{w∈W} |C(w) - E(C(w)|X^*)| = o_p(ξ)。这需要用到Condition 1-4来控制高阶矩和协方差矩阵的谱范数,并利用经验过程理论中的极大不等式(如对M个随机变量的最大值进行控制)。 - 建立最优性:由
C(w)的无偏性和集中性,可以推导出L(ew) ≤ inf_w L(w) + o_p(ξ)。再结合L(ew) ≥ inf_w L(w),即可得到L(ew) / inf_w L(w) → 1。定理2的证明需要额外处理bσ²_{M^*}的估计误差,证明其影响是o_p(ξ)。 - 样本外最优性:证明样本外风险
E(L_new(w))与样本内风险E(L(w))之间的渐近等价性,然后利用定理1和2的结论。这需要Condition 5-7来保证这种等价性。
- 构造风险的无偏估计:首先证明Mallows准则
-
关键跳跃点:
- 难点:证明
C(w)的集中性,特别是处理ϕ(w)和ψ(w)项(公式6),它们包含了ML预测f_m(X)和f_m(̃X)。这些预测是随机的,且其分布依赖于ML算法的内部机制,这使得传统的模型平均理论分析变得复杂。 - 作者的解法:作者巧妙地利用了PPI++修正损失的结构,使得
bθ^{(m)}有闭式解。这允许他们将bµ(w)分解为P(w)Y + ϕ(w) - ψ(w)(公式6)。然后,他们通过假设ML预测f_m是“预训练”的(即独立于当前标注数据),或者通过施加矩条件(如Condition 6)来控制f_m的随机性,从而将问题转化为对P(w)Y、ϕ(w)和ψ(w)这些线性/二次型量的分析。这避免了直接对复杂的ML模型进行建模。
- 难点:证明
-
技术技巧点名:
- Mallows型准则:核心技巧,将模型平均问题转化为一个可观测的二次优化问题。
- 矩条件与极大不等式:用于控制随机变量的高阶矩和最大值,是证明集中性的标准工具。
- 特征值条件:保证协方差矩阵的逆矩阵存在且范数有界,是处理线性模型的基础。
- 闭式解:利用PPI++的闭式解,将复杂的模型平均问题简化为对一组线性估计量的加权组合,极大地简化了理论分析。
真实例子与应用¶
- 数据/场景:洛杉矶无家可归者数据(Los Angeles Homeless Dataset)。这是一个经典的半监督学习案例,其中265个非热点区域有标注数据(被调查),1545个非热点区域只有协变量(未调查)。目标是根据区域特征(如商业用地比例、空置房比例等)预测该区域的无家可归者总数。
- 方法应用:
- 候选模型:基于p值构建了5个嵌套的线性模型。
- 候选ML算法:使用了XGBoost和随机森林两种算法,在244个热点区域上预训练。
- 候选调参:考虑了5个λ值 {0, 0.25, 0.5, 0.75, 1}。
- 评估:将265个标注样本按不同比例(50%-90%)随机分为训练集和测试集,重复500次,计算预测均方误差(PMSE)。
- 结果:
- PUMA在所有训练/测试比例下都取得了最低的PMSE和标准误,显著优于所有对比方法(PEMA, PAIC, PBIC, PLARM, PML1, PML2, PLAM1, PLAM0, PPI++ML1, PPI++ML2, LARM)。
- 对比方法的失败原因被归因于它们忽略了某一种或多种不确定性。例如,PML2(只用随机森林)优于PML1(只用XGBoost),说明算法选择很重要;PLAM1(固定λ=1)表现不佳,说明调参很重要。
- 估计出的系数(表2)具有经济直觉:空置房比例(PctVacant)和商业用地比例(Commercial)对无家可归者数量有正向影响,而自有住房比例(PctOwnerOcc)有负向影响。
- 这个例子想说明什么:这个例子旨在验证PUMA在实际应用中的优越性,证明其通过同时处理三种不确定性,能够比任何忽略其中一种不确定性的方法都取得更好的预测性能。同时,线性模型的结构使得系数估计具有可解释性,与常识相符。
🔎 结论是否比证明窄¶
- 是。论文的渐近最优性(定理1-3)依赖于Condition 2,即最小风险
ξ必须发散到无穷。这意味着,如果存在一个候选策略的预测风险已经非常小(例如,ξ不随n增长),那么定理的结论可能不成立。作者在证明中明确依赖于此条件来保证o_p(1)项。然而,在论文的摘要和引言中,他们泛泛地声称“asymptotic prediction optimality”,没有明确强调这个条件。在实际应用中,如果某个候选模型(如正确的线性模型)已经非常好,PUMA的渐近最优性保证可能不适用,尽管模拟和实证中它仍然表现良好。 - 另一个窄点:定理4的估计一致性依赖于“存在至少一个正确设定的模型”这一假设。如果所有候选模型都是误设的(这在实践中很常见),那么
bθ(ew)收敛到哪个“真值”是不清楚的。论文没有讨论在完全误设情况下的估计行为。
四、开放问题¶
- 最优权重的收敛率:论文证明了预测风险的渐近最优性,但未给出最优权重向量
bw本身的收敛速度。这是一个自然的理论延伸。扎根点:论文第6节“Discussion”中明确提到:“First, the convergence rate of the optimal weight vector remains unclear and warrants further investigation.” - 与大型语言模型(LLM)的整合:作者提出将LLM作为ML算法之一整合进PUMA框架,以处理非结构化数据。这需要解决LLM预测的不确定性量化问题,以及如何设计自适应权重策略。扎根点:论文第6节“Discussion”中提到:“Second, integrating large language models into the prediction-powered mechanisms to enable information extraction from unstructured data represents an exciting frontier.”
- 更一般的损失函数:本文的Mallows准则和理论分析是针对平方损失(预测风险)的。能否将PUMA框架推广到其他损失函数(如分位数损失、Huber损失)?这需要重新设计权重选择准则并建立相应的渐近理论。扎根点:论文的模型平均部分引用了大量针对不同损失函数的工作(如Lu and Su, 2015的分位数模型平均),但本文自身并未处理一般损失函数。
- 统计-计算权衡:PUMA的计算复杂度随候选策略数量
M线性增长。当M非常大时(例如,考虑所有可能的协变量子集),如何设计高效的算法来求解权重优化问题(公式10)?是否存在一个“统计-计算”的权衡,即为了达到最优预测性能,需要多少计算资源?扎根点:论文未讨论计算复杂度,但这是一个自然的问题,尤其对于高维模型平均。
Maintained by 陈星宇 · Homepage · Source on GitHub