Heterogeneous Multisource Transfer Learning via Model Averaging for Positive-Unlabeled Data¶
讲者: Kuangnan Fang
会场: Statistics for Business
报告题目: Heterogeneous Multisource Transfer Learning via Model Averaging for Positive-Unlabeled Data
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本论文研究的子方向是 “面向正-无标签(PU)数据的异质多源迁移学习”。其根本的统计问题是:在目标域只有正例(positive)和无标签(unlabeled)样本、且样本量很小的情况下,如何利用多个辅助源域(source domains)的信息来提升目标域的分类性能?这些源域的数据标注模式可能完全不同(完全标注、半监督、或同样是PU),且由于隐私保护,源域与目标域之间不能直接共享原始数据。当前该方向的成熟度较低——大多数迁移学习方法假设源域与目标域有相似的标注结构,或依赖目标域有负标签,而PU数据特有的“无负标签”结构使得这些方法失效。
发展脉络(history)¶
-
奠基工作:PU学习的统计方法。Ward et al. (2009) 和 Song & Raskutti (2020) 提出了基于修正最大似然估计(MLE)的PU学习框架,通过EM算法处理“只有正例被标注”的缺失数据问题。Song & Raskutti (2020) 进一步将ℓ1惩罚引入PU逻辑回归,实现了高维变量选择。这些工作奠定了PU数据的统计建模基础,但留下一个口子:它们主要关注单数据集的大样本场景,在小样本下性能急剧下降。
-
主要进展:迁移学习进入PU领域。为了应对小样本问题,研究者开始引入辅助数据。Li et al. (2021)、Cai & Wei (2021)、Tian & Feng (2023) 等提出了两阶段迁移学习框架(如TransLasso),先利用源域数据估计参数,再在目标域上进行微调。然而,作者指出这些方法“prove inadequate”(第3页)——它们要么需要源域数据共享(违反隐私),要么在第二阶段需要目标域的负标签进行参数校正,而PU数据恰恰缺少负标签。
-
当前Frontier:模型平均作为隐私保护的迁移工具。Hu & Zhang (2023) 和 Zhang et al. (2024) 提出了基于模型平均的迁移学习,通过聚合各域的模型参数(而非原始数据)来实现知识迁移,并自动降低误导性源域的权重。但作者指出,这些工作使用平方损失(squared loss)作为权重选择标准,而平方损失“implicitly treats all unlabeled instances as negative examples, introducing systematic bias”(第4页),因此不适用于PU数据。
-
本文的位置:本文是第一个将模型平均与PU数据结合的工作,并专门处理异质标注模式(完全标注、半监督、PU)的源域。它填补了“PU数据下隐私保护迁移学习”这一空白,并首次为模型平均在高维PU分类中提供了渐近理论。
子线索聚类¶
这些被引文献大致落在三条子线索上:
-
线索一:PU学习的统计方法(Ward et al. 2009; Song & Raskutti 2020; Liu et al. 2025)。核心是设计修正的似然函数或EM算法来处理“只有正例被标注”的缺失数据问题。本文直接继承了这一线索的似然函数构造(公式1)。
-
线索二:迁移学习与模型平均(Li et al. 2021; Tian & Feng 2023; Hu & Zhang 2023; Zhang et al. 2024)。核心是利用源域信息提升目标域性能,其中模型平均方法通过加权聚合各域参数实现隐私保护。本文的框架属于这一线索,但针对PU数据做了关键适配。
-
线索三:KL散度在模型平均中的应用(Ando & Li 2017; Zou et al. 2022; Yuan et al. 2024)。这些工作使用KL散度作为权重选择标准,但作者指出它们主要关注“in-sample”KL散度,而本文首次引入了“out-of-sample”KL散度(第5页),并证明了其最优性。
这个方向在追问的核心问题¶
- 如何在小样本PU数据下有效利用异质源域信息? 当前主流方法是两阶段迁移学习(如TransLasso),但它在PU数据下因缺少负标签而失效。模型平均是一个替代方案,但权重选择标准(平方损失 vs. KL散度)需要针对PU数据重新设计。
- 如何在隐私保护下实现知识迁移? 主流方法要求共享原始数据或梯度,违反隐私约束。模型平均通过只共享参数来规避这一问题,但其理论性质(特别是权重最优性)在PU数据下尚未被研究。
- 高维PU分类的迁移学习理论是什么? 现有模型平均工作(如Hu & Zhang 2023)在高维设定下没有提供渐近理论。本文试图填补这一空白。
⚠️ 作者的 framing¶
-
作者把缺口 frame 成什么? 作者将现有工作的缺口概括为三点:(1) 两阶段迁移学习框架(如TransLasso)在PU数据下“prove inadequate”(第3页),因为缺少负标签;(2) 现有模型平均方法使用平方损失,对PU数据有系统性偏差;(3) 现有KL散度加权方法只处理“in-sample”情形,且高维理论缺失。因此,本文的TLMA-PU框架被呈现为“显然的下一步”——它同时解决了这三个问题。
-
哪些竞争路线被他淡化或回避了? 作者淡化了半监督迁移学习的路线。虽然论文中提到了半监督数据作为源域的一种类型,但作者没有深入讨论“将目标域PU数据视为半监督问题”的可能性(即通过某种方式从无标签数据中提取负标签信息)。此外,作者回避了对抗性域适应(adversarial domain adaptation) 这一竞争路线——这类方法通过对抗训练学习域不变特征,但通常需要共享原始数据,且理论性质不如模型平均清晰。
-
什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用任何关于差分隐私(differential privacy) 的文献。虽然论文声称“privacy-preserving”,但只通过不共享原始数据来实现,没有引入任何正式的隐私保证(如ε-差分隐私)。这是一个明显的缺口——如果研究者关心“真正的”隐私保护,本文的方法可能不够。此外,作者没有引用Ben-David et al. (2010) 等关于域适应理论(如HΔH散度)的经典工作,这些工作为迁移学习的可行性提供了理论框架。
张力¶
未见明显对立引用。所有被引工作基本是互补的,没有在相同设定下得出相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
m:域索引。m=0表示目标域(PU数据),m=1,...,M表示源域。x_i^(m) ∈ ℝ^p:第m个域中第i个样本的p维协变量向量。y_i^(m) ∈ {0,1}:第m个域中第i个样本的真实标签(1=正例,0=负例)。这是潜在变量,在PU数据中不可观测。z_i^(m) ∈ {0,1}:第m个域中第i个样本的标签指示符(1=该样本被标注,0=未标注)。这是PU数据中唯一可观测的标签信息。对于完全标注数据,z_i^(m) = 1对所有i成立,且y_i^(m)可观测。β^(m) ∈ ℝ^p:第m个域的参数向量,是待估的统计量。n_m:第m个域的样本量。π_1^(m) = Pr(y_i^(m)=1):第m个域中正例的总体比例,假设已知。b^(m) = n_L^(m) / (π_1^(m) n_U^(m)):PU数据中的一个辅助参数,其中n_L^(m)是标注的正例数,n_U^(m)是未标注样本数。w = (w_0, w_1, ..., w_M)^⊤:权重向量,满足w_m ∈ [0,1]且∑_m w_m = 1。这是模型平均的核心参数。
-
模型:
- 真实标签
y_i^(m)服从逻辑回归模型:Logit(Pr(y_i^(m)=1 | x_i^(m))) = x_i^(m)⊤ β^(m)。 - PU数据的观测机制:假设标签缺失完全随机(SCAR),即
Pr(z_i^(m)=1 | y_i^(m)=1, x_i^(m)) = Pr(z_i^(m)=1 | y_i^(m)=1),与协变量x_i^(m)无关。这意味着正例被标注的概率是一个常数,不依赖于其特征。 - 目标域(
m=0)的似然函数是非标准形式(公式1),因为它需要将不可观测的y_i^(0)积分掉,只基于可观测的z_i^(0)进行推断。
- 真实标签
-
可观测数据:
- 目标域(PU):研究者能观测到的是
(x_i^(0), z_i^(0))。其中z_i^(0)=1的样本是已确认的正例;z_i^(0)=0的样本是未标注的,其中既包含未检测到的正例,也包含负例。真实标签y_i^(0)是不可观测的。 - 源域(完全标注):能观测到
(x_i^(m), y_i^(m))。 - 源域(半监督):能观测到
(x_i^(m), y_i^(m), z_i^(m)=1)(部分样本)和(x_i^(m), z_i^(m)=0)(其余样本)。 - 源域(PU):与目标域相同,能观测到
(x_i^(m), z_i^(m))。
- 目标域(PU):研究者能观测到的是
第二步:讲最小内核¶
本文的最小内核可以剥离为以下最简特例:
- 设定:只有一个源域(
M=1)和一个目标域(m=0),且两者都是PU数据。目标域样本量n_0很小,源域样本量n_1很大。协变量维度p=1(一维)。两个域的真实参数分别为β^(0)和β^(1),它们可能不同(异质)。 - 问题:如何利用源域的大样本估计
ˆβ^(1)来改进目标域的小样本估计ˆβ^(0),从而得到更好的预测模型? - 核心思路:不直接使用
ˆβ^(1),也不假设β^(0)=β^(1),而是构造一个加权平均估计量ˆβ(w) = w_0 ˆβ^(0) + w_1 ˆβ^(1),其中w_0 + w_1 = 1。权重w_1反映了源域对目标域的“有用性”。如果源域与目标域非常相似(β^(1) ≈ β^(0)),则w_1应接近1;如果完全不相关,则w_1应接近0。 - 如何选权:通过K折交叉验证,最小化目标域上的KL散度。具体来说,将目标域数据分成K份,每次用K-1份估计
ˆβ^(0),然后用剩下的1份计算加权估计量的负对数似然(公式4)。选择使这个交叉验证损失最小的(w_0, w_1)。 - 为什么难:因为PU数据的似然函数不是标准指数族形式(见Remark 3.1),其高阶导数不为零,且非凸,导致传统的模型平均最优性证明(如Ando & Li 2017)失效。本文的核心技术贡献就是为这种非标准似然重新建立了权重最优性理论。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在目标域为PU数据且样本量小、源域标注模式异质(完全标注/半监督/PU)且不能共享原始数据的场景下,如何通过模型平均实现隐私保护的迁移学习。
- 核心工具/方法:提出TLMA-PU框架,为每种源域类型设计专门的似然函数估计参数,然后通过最小化目标域上的KL散度(通过交叉验证)来学习最优权重,对源域参数进行加权平均。
- 主要结论:在模型误设下,证明了权重估计的渐近最优性(KL散度与不可实现的最优权重渐近相等);在模型正确设定下,证明了非信息源域的权重收敛到0;并将这些理论扩展到高维(ℓ1惩罚)设定。
关键设定与假设¶
- SCAR假设(Remark 2.2):PU数据中,正例被标注的概率与协变量
x无关。这是PU学习中的标准假设,但也是很强的假设。如果违反(即标签缺失与特征相关,称为“selected at random”或SAR),则需要额外估计f(x),计算复杂且难以在隐私约束下实现。 - 类先验
π_1^(m)已知:每个域中正例的总体比例是已知的。这在PU学习中很常见(如通过外部知识或验证集估计),但在实际中可能不准确。 - 条件1(伪真值存在性与收敛性):每个域的MLE收敛到其伪真值
β*^(m),且收敛速度为O_p(p^{1/2} n_m^{-1/2})。这是标准假设。 - 条件4/5(模型差异足够大):
inf_w KL*(w)(或OKL*(w))的衰减速度不能快于p M^{1/2} n^{-1/2}。这意味着目标模型与真实模型之间必须有显著差异,否则最优权重的识别性会变差。这是一个技术性假设,用于控制近似误差。 - 高维条件(11-13):假设稀疏性(
√(¯s log p / n) = o(1))、协变量服从次高斯分布、以及ℓ1惩罚估计量的收敛率(O_p(√(s_m log p / n_m)))。这些是高维统计中的标准条件。
主要结果¶
- 定理3.1(样本内KL最优性):在模型误设下,
KL(ˆw) / inf_{w∈W} KL(w) →_p 1。即,通过交叉验证选择的权重ˆw,其对应的KL散度渐近等价于理论上最优的(但不可实现的)权重对应的KL散度。 - 定理3.2(样本外KL最优性):类似定理3.1,但针对新样本的KL散度(
OKL)。这比样本内结果更适用于迁移学习场景,因为最终目标是预测新数据。 - 定理3.3(权重收敛):在目标模型正确设定下,非信息源域(其参数与目标域参数差异较大)的权重之和
∥ˇw∥收敛到0。这意味着方法会自动丢弃无用的源域。 - 定理4.1-4.3(高维扩展):将上述三个定理扩展到高维设定,其中参数通过ℓ1惩罚估计。关键变化是收敛率从
O_p(p^{1/2} n^{-1/2})变为O_p(√(s log p / n)),且需要额外的稀疏性条件(如条件16:√(¯s p^2 log p / n^3) = o(1),限制了p最多以n^{3/2}的速度增长)。
证明路线与技术技巧¶
-
整体路线:
- 定义风险与准则:定义KL散度
KL(w)和交叉验证准则CV(w)。目标是证明CV(w)是KL(w)的渐近无偏估计。 - 分解差异:将
CV(w) - KL(w)分解为几个部分,包括估计误差(ˆβ与β*的差异)和近似误差(KL(w)与KL*(w)的差异)。 - 控制估计误差:利用泰勒展开和条件1-3,证明估计误差项在
w上一致地以O_p(p^{1/2} n^{-1/2})的速度收敛到0。 - 处理非标准似然:这是关键跳跃点。由于PU似然不是标准指数族,其泰勒展开的高阶项不会消失。作者通过引入条件4(
ξ_n足够大),使得近似误差项(KL(w) - KL*(w))相对于inf_w KL*(w)可以忽略,从而保证CV(w)的最优性可以传递到KL(w)。 - 高维扩展:类似路线,但将估计误差的收敛率替换为高维版本,并利用稀疏性条件(如条件11)和次高斯性条件(条件12)来控制高维带来的额外误差。
- 定义风险与准则:定义KL散度
-
关键跳跃点:
- 非标准似然的处理(Remark 3.1):PU似然函数
L_PU不是标准指数族形式,其关于β的二阶及以上导数不为零,且E(z|x) = g'(η)/h'(η),形式复杂。这使得传统的模型平均最优性证明(依赖于指数族的性质)失效。作者通过直接对CV(w) - KL(w)进行泰勒展开,并利用条件4(inf_w KL*(w)足够大)来吸收高阶项,绕过了这一困难。 - 高维权重收敛(定理4.3):在高维下证明非信息源域权重收敛到0,需要处理ℓ1惩罚带来的额外偏差。作者通过条件16(
√(¯s p^2 log p / n^3) = o(1))来确保惩罚偏差不会破坏权重估计的一致性。这个条件限制了p的增长速度,是一个较强的假设。
- 非标准似然的处理(Remark 3.1):PU似然函数
-
技术技巧点名:
- 泰勒展开与一致收敛:用于控制
CV(w) - KL(w)的差异,并证明其在w上一致收敛。 - 经验过程理论:虽然没有明确提及,但“一致收敛”的证明通常需要用到经验过程或Glivenko-Cantelli类的概念。
- ℓ1惩罚与稀疏性:在高维部分,使用ℓ1惩罚进行变量选择,并利用稀疏性条件(如
√(s log p / n) = o(1))来控制估计误差。 - 次高斯性:假设协变量服从次高斯分布,以利用其尾部性质来控制高维下的随机误差。
- 泰勒展开与一致收敛:用于控制
真实例子与应用¶
- 数据:来自中国某P2P借贷平台的真实数据,包含10个省份的贷款记录。目标域是样本量最小的黑龙江省(507个样本,
p_L=0.21),被设定为PU数据。其余9个省份根据样本量和标注情况被分为完全标注源域(3个)、半监督源域(3个)和PU源域(3个)。 - 方法应用:将TLMA-PU应用于该数据,使用13个协变量(包括贷款金额、利率、期限等),通过100次随机划分训练/测试集来评估性能。
- 结果:图5展示了TLMA-PU在AUC_adj指标上优于Single-PU、TransLasso和Equal-Weighted方法。作者声称“the proposed method performs well, achieving a relatively high overall AUC_adj”。
- 这个例子想说明什么:验证TLMA-PU在真实世界、小样本、异质源域场景下的有效性,特别是相对于其他迁移学习方法的优势。但需要注意的是,这个例子的规模很小(只有13个变量,目标域507个样本),且没有提供标准误差或置信区间,因此结论的统计显著性存疑。
🔎 结论是否比证明窄¶
- 定理4.3的适用范围:定理4.3(高维权重收敛)依赖于条件16(
√(¯s p^2 log p / n^3) = o(1)),这限制了p最多以n^{3/2}的速度增长。作者在第21页明确承认:“establishing weight convergence theory under exponential scalingp ≍ exp(n^α)... would necessitate a broader set of technical assumptions”。因此,该定理的结论比论文标题中“High-Dimensional”的泛泛声称要窄——它只适用于多项式增长的维度,而非指数增长的超高维场景。 - SCAR假设的局限性:论文的所有理论都建立在SCAR假设之上。作者在Remark 2.2中提到了SCAR被违反的情况(即SAR),但只是说“requires additional assumptions and becomes computationally complex”,并没有提供任何理论或方法上的解决方案。因此,论文的结论严格局限于SCAR设定,对更现实的SAR设定没有贡献。
四、开放问题¶
- 放松SCAR假设:本文所有理论都依赖于“标签缺失完全随机”(SCAR)假设。当标签缺失与协变量相关(SAR)时,似然函数需要额外估计
f(x),且参数可识别性需要新的假设。这是一个明确的开放问题,扎根于Remark 2.2中作者对SAR的讨论。 - 真正的差分隐私保证:本文声称“privacy-preserving”,但只通过不共享原始数据来实现,没有提供任何正式的隐私保证(如ε-差分隐私)。如何将差分隐私技术(如梯度加噪)整合到TLMA-PU框架中,并分析其对权重最优性和预测性能的影响,是一个值得研究的方向。这扎根于第6节(Conclusion) 中作者对“differential privacy techniques”的简短提及。
- 高维权重收敛的指数增长场景:定理4.3只适用于多项式增长的维度(
p ≍ n^γ, γ < 3/2)。当p以指数速度增长(p ≍ exp(n^α))时,权重收敛的理论尚属空白。作者在第21页明确指出了这一限制,这是一个具体的理论缺口。 - 时变数据分布的自适应迁移:作者在结论中提到“data distributions may exhibit temporal dynamics”,但本文的方法假设数据分布是静态的。如何设计能够在线自适应分布漂移的迁移学习算法,是另一个开放问题。这扎根于第6节中作者对“adaptive transfer learning algorithms”的展望。
Maintained by 陈星宇 · Homepage · Source on GitHub