Hierarchical Projection for Adaptive Knowledge Transfer¶
讲者: Tian Gu
会场: Advances in Causal Inference and Adaptive Learning
报告题目: Hierarchical Projection for Adaptive Knowledge Transfer
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
高维迁移学习(High-dimensional Transfer Learning)要解决的根本问题是:当目标数据样本量很小(甚至远小于维度 \(p\))时,如何从一组可能相关、也可能无关的源数据中借用信息,以提升目标模型的估计或预测精度。核心挑战在于:源与目标之间的“相关性”是未知且异质的——有些源高度相关(信息可借),有些源几乎无关甚至有害(负迁移)。当前成熟度:已有若干奠基性工作建立了高维线性模型下的 minimax 最优率,并推广到广义线性模型;但大多数方法要么假设源与目标共享相同的特征空间和稀疏模式,要么只做全局源选择而不做特征级选择,要么需要个体级数据(无法用于联邦/隐私场景)。本文试图填补的缺口是:同时进行源选择(全局)和特征选择(局部),且仅需源模型的参数估计(而非个体数据)。
发展脉络(history)¶
- 奠基工作:Li, Cai & Li (2020) 提出了 Trans-Lasso,在高维线性回归中首次建立了迁移学习的 minimax 最优率,并给出了当“信息源集合已知”和“未知”两种情况下的可证方法。该工作奠定了“迁移学习可以加速收敛”的理论基础,但假设源与目标共享相同的特征空间且差异是稀疏的。
- 主要进展:Tian & Feng (2021) 将框架推广到高维广义线性模型(GLM),Li, Zhang, Cai & Li (2023) 进一步给出了 TransHDGLM 的 minimax 最优估计和推断。这些工作扩展了适用模型,但依然依赖全局相似性度量(如 \(\ell_1\) 或 \(\ell_2\) 距离),无法处理“部分特征相关、部分特征无关”的情形。
- 异质性与特征不匹配:Duan, Ning & Chen (2019) 提出了异质分布式推断方法,允许各站点有 site-specific 的 nuisance 参数;Chang, Russo & Paul (2024) 处理了特征空间不完全重叠的异质迁移学习。这些工作开始放松“特征空间相同”的假设,但方法仍以全局对齐为主。
- 贝叶斯与投影方法:Pal & Ghoshal (2024) 提出了稀疏投影后验(sparse projection-posterior),将密集后验投影到稀疏子空间,实现了高维贝叶斯推断的收缩率和覆盖性质。Wang & Ghosal (2023) 等将投影后验用于单调回归。这些工作为本文提供了“投影”这一技术工具。
- 本文的位置:Gu (2024) 提出的 ProjectionTL 将层次贝叶斯建模(源选择)与投影后验(特征选择)结合,形成一个两阶段框架。它区别于 Trans-Lasso 等全局方法的地方在于:第一阶段用数据驱动权重聚合源信息(全局对齐),第二阶段通过投影只保留与目标信号局部一致的特征。这使得方法能同时做源选择和特征选择,且仅需源模型的参数估计(无需个体数据),适用于联邦/隐私场景。
子线索聚类¶
- 全局相似性迁移(Li et al. 2020, Tian & Feng 2021, Li et al. 2023):假设源与目标参数差异是稀疏的,用 \(\ell_1\) 惩罚或两步法估计差异。优点:理论成熟,有 minimax 率。缺点:无法处理“部分特征相关、部分无关”的局部异质性。
- 异质/特征不匹配迁移(Duan et al. 2019, Chang et al. 2024, Zhao et al. 2023, Asiaee & Pal 2026):允许源与目标有不同的特征集或分布,通常通过校准方程或密度比来对齐。优点:更贴近实际。缺点:通常需要个体级数据或强假设。
- 贝叶斯信息借用(Jin & Yin 2021, Zhang & Yin 2023, Lai et al. 2024):使用先验(如 unit information prior、horseshoe prior)来自适应地借用历史数据。优点:自然提供不确定性量化。缺点:多为单源或需要个体数据;多源时权重选择缺乏理论保证。
- 投影后验方法(Pal & Ghoshal 2024, Wang & Ghosal 2023):将密集后验投影到稀疏/单调子空间,实现收缩和覆盖。优点:计算简单、理论清晰。缺点:原本用于单样本问题,未涉及迁移。
这个方向在追问的核心问题¶
- Q1:如何在不假设源与目标参数差异是全局稀疏的前提下,实现有效的迁移?(即允许部分特征高度一致、部分特征完全无关)
- Q2:当只有源模型的参数估计(而非个体数据)可用时,能否实现与使用个体数据相当的性能?
- Q3:如何同时进行源选择(哪些源有用)和特征选择(哪些特征可借)?两者是否存在交互?
- Q4:迁移学习中的不确定性量化(如置信区间)在高维下如何构造?
当前主流方法(Trans-Lasso, TransGLM)主要回答 Q1 的全局稀疏版本;贝叶斯方法(TRADER)回答 Q2 和 Q3 的部分;投影后验方法回答 Q3 的特征选择部分。本文试图将 Q2 和 Q3 统一在一个框架中。
⚠️ 作者的 framing¶
作者将缺口 frame 为:“现有方法要么只做全局源选择(如 Trans-Lasso),要么只做特征选择(如 LASSO),缺乏同时处理两者的统一框架”。因此 ProjectionTL 被定位为“两阶段解耦”的显然下一步。作者淡化了以下竞争路线: - Trans-Lasso 及其变体:作者认为它们只做全局差异稀疏,无法处理局部异质性。但 Trans-Lasso 实际上可以通过分组惩罚扩展,作者未讨论。 - CONCERT (Zhang et al. 2024):使用条件 spike-and-slab 先验实现协变量特定的信息借用,与本文目标相似。作者将其列为对比方法,但未深入讨论其与投影后验的优劣。 - TRADER (Lai et al. 2024):贝叶斯多源迁移,使用 guide horseshoe prior。作者同样列为对比,但指出 TRADER 需要个体数据(实际上 TRADER 也使用预训练模型参数,可能不需要个体数据?需核实)。
明显该被引/该存在、却没出现在 intro 里:由于本文只有 abstract,无法判断 intro 中是否遗漏了重要工作。但根据提供的被引论文列表,作者引用了 Li et al. (2020), Tian & Feng (2021), Li et al. (2023), Gu et al. (2022), Lai et al. (2024), Zhang et al. (2024) 等,覆盖了主要线索。一个可能的遗漏是 “迁移学习中的 minimax 下界” 工作(如 Cai & Wei 2021 等),但本文是方法型论文,可能不要求。
张力¶
未见明显对立引用。各工作基本在“全局 vs 局部”、“个体数据 vs 参数估计”、“频率 vs 贝叶斯”等维度上互补,而非矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(p\):特征维度(高维,\(p \gg n\))。
- \(n\):目标样本量(小)。
- \(K\):源数据集个数。
- \(\beta \in \mathbb{R}^p\):目标模型的回归系数(待估参数)。
- \(\beta^{(k)} \in \mathbb{R}^p\):第 \(k\) 个源模型的回归系数(未知,但可通过源数据估计得到 \(\hat{\beta}^{(k)}\))。
- \(X \in \mathbb{R}^{n \times p}\):目标特征矩阵(可观测)。
- \(Y \in \mathbb{R}^n\):目标响应向量(可观测)。
- \(\sigma^2\):误差方差(未知)。
- \(\mu \in \mathbb{R}^p\):层次先验的均值向量(源加权平均)。
- \(\tau^2\):层次先验的方差(控制整体借用强度)。
- \(\lambda\):投影步骤中的惩罚参数(控制稀疏性)。
-
\(w_k\):第 \(k\) 个源的数据驱动权重(\(\sum_k w_k = 1\))。
-
模型:
- 目标数据生成:\(Y = X\beta + \varepsilon\),\(\varepsilon \sim N(0, \sigma^2 I_n)\)。
- 源模型:每个源有自己的回归系数 \(\beta^{(k)}\),但源数据不可直接访问,仅提供 \(\hat{\beta}^{(k)}\)(及其协方差估计)。
-
假设:\(\beta\) 与 \(\beta^{(k)}\) 之间存在某种相关性,但具体形式未知。ProjectionTL 不假设差异稀疏,而是通过层次先验和投影自适应地决定借用哪些部分。
-
可观测数据:
- 目标:\((X, Y)\)(个体级数据)。
- 源:\(\{\hat{\beta}^{(k)}\}_{k=1}^K\)(参数估计,可能还有标准误)。不可观测的是源个体数据、源特征矩阵、以及 \(\beta^{(k)}\) 的真值。
- 想要但观测不到:\(\beta\) 与每个 \(\beta^{(k)}\) 的差异模式(哪些特征一致、哪些不一致)。
第二步:最小内核¶
考虑最简特例:\(p=2\)(两个特征),\(K=2\)(两个源),目标样本量 \(n=10\),源数据不可得,仅提供两个源的系数估计: - 源1:\(\hat{\beta}^{(1)} = (0.8, 0.1)^\top\) - 源2:\(\hat{\beta}^{(2)} = (0.2, 0.9)^\top\)
目标真实 \(\beta = (0.75, 0.85)^\top\)(两个特征都重要,但源1只在第一个特征上接近,源2只在第二个特征上接近)。传统全局迁移(如 Trans-Lasso)会假设 \(\beta - \beta^{(k)}\) 稀疏,但这里两个源与目标的差异都不是稀疏的(源1差异为 \((-0.05, 0.75)\),源2差异为 \((0.55, -0.05)\)),因此全局方法会失效——要么只选一个源(丢失另一个特征的信息),要么平均两个源(得到 \((0.5, 0.5)\),两个特征都偏离)。
ProjectionTL 的两阶段思路: 1. 第一阶段(全局源选择):计算每个源与目标的相似度(例如基于余弦相似度或预测误差)。假设源1和源2的权重分别为 \(w_1=0.5, w_2=0.5\)(因为两者各有优势)。构建层次先验:\(\beta \sim N(\mu, \tau^2 I)\),其中 \(\mu = w_1 \hat{\beta}^{(1)} + w_2 \hat{\beta}^{(2)} = (0.5, 0.5)^\top\)。这个先验均值已经比单源好,但仍不准确。 2. 第二阶段(特征级投影):从后验分布 \(\pi(\beta | X, Y)\) 中采样(后验是正态分布,因为共轭)。然后对每个后验样本应用一个投影映射 \(P\),将其投影到稀疏子空间。例如,使用 \(\ell_1\) 投影:\(P(\beta) = \arg\min_{\theta} \|\theta - \beta\|_2^2 + \lambda \|\theta\|_1\)。由于目标数据本身有信号,后验均值会向真实 \(\beta\) 收缩,投影后得到稀疏估计。在这个例子中,投影后可能得到 \((0.75, 0.85)\)(如果 \(\lambda\) 足够小)或 \((0.75, 0)\)(如果 \(\lambda\) 大,但第二个特征被错误地压缩)。关键在于:投影步骤允许每个特征独立地决定是否保留先验信息,从而纠正第一阶段全局平均带来的偏差。
这个最小内核揭示了论文的核心数学困难:如何设计投影映射,使得在特征级上既能借用源信息(当源与目标一致时),又能丢弃源信息(当不一致时),同时保持后验收缩率和覆盖性质。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高维线性回归的迁移学习设定下,当只有源模型的参数估计(而非个体数据)可用时,如何同时进行源选择(全局)和特征选择(局部),以避免负迁移并提升目标估计精度。
- 核心工具/方法:提出 ProjectionTL 框架,第一阶段用数据驱动权重构建层次贝叶斯先验(源引导的全局对齐),第二阶段用稀疏投影后验(sparse projection-posterior)进行特征级选择性借用。
- 主要结论:通过模拟和真实生物医学数据,ProjectionTL 在估计精度、稳定性和可解释性上优于 Trans-Lasso、TRADER、TransGLM、CONCERT 等对比方法;理论部分(若有)应给出后验收缩率和覆盖性质(但 abstract 未明确提及定理,需查看全文)。
关键设定与假设¶
- 设定:高维线性回归,\(p \gg n\)。目标数据 \((X, Y)\) 可用。源数据不可直接访问,仅提供预训练模型的参数估计 \(\{\hat{\beta}^{(k)}\}_{k=1}^K\)(可能还有协方差矩阵)。源与目标可能共享部分特征,但特征空间相同(假设无特征不匹配)。
- 假设:
- (A1) 目标模型正确:\(Y = X\beta + \varepsilon\),\(\varepsilon\) 次高斯或正态。
- (A2) 源估计的一致性:每个 \(\hat{\beta}^{(k)}\) 是 \(\beta^{(k)}\) 的相合估计(例如,源样本量足够大)。
- (A3) 稀疏性:真实 \(\beta\) 是稀疏的(非零坐标数 \(s \ll p\))。
- (A4) 源与目标的关系:存在一个未知的权重向量 \(w \in \Delta^{K-1}\) 使得 \(\beta\) 接近 \(\sum_k w_k \beta^{(k)}\),但允许每个特征有偏差。具体地,假设 \(\beta_j\) 与 \(\sum_k w_k \beta_j^{(k)}\) 的差异在大多数特征上小,但少数特征上大(即“局部异质性”)。
- (A5) 投影后验的收缩条件:需要设计矩阵 \(X\) 满足限制特征值条件(restricted eigenvalue condition)以保证 LASSO 投影的收敛性。
相比已有文献:本文不假设 \(\beta - \beta^{(k)}\) 是稀疏的(如 Trans-Lasso),而是通过两阶段解耦来放松这一假设。相比 TRADER(使用 horseshoe prior),本文的投影步骤提供了更明确的稀疏性控制。
主要结果¶
由于只有 abstract,无法列出具体定理。但根据方法描述和类似文献,预期结果包括: - 后验收缩率:在适当条件下,ProjectionTL 的后验分布以 \(s \log p / n\) 的速率收缩到真实 \(\beta\)(与使用目标数据单独估计的 minimax 率相同,但常数更小,因为借用源信息降低了有效维度)。 - 覆盖性质:通过投影后验构造的 credible set 具有正确的渐近覆盖概率(类似 Pal & Ghoshal 2024 的结果)。 - 负迁移避免:当源与目标完全无关时,第一阶段权重会趋于 0,投影后验退化为仅使用目标数据的 LASSO 后验,从而避免负迁移。
证明路线与技术技巧(推测,基于方法描述)¶
- 整体路线:
- 第一阶段:层次先验构建。定义权重 \(w_k\) 为源估计与目标数据之间的某种相似度(如余弦相似度或预测损失)。构建先验 \(\beta \sim N(\mu, \tau^2 I)\),其中 \(\mu = \sum_k w_k \hat{\beta}^{(k)}\),\(\tau^2\) 由数据驱动(如经验贝叶斯)。
- 第二阶段:后验采样与投影。计算后验 \(\pi(\beta | X, Y) \propto \phi(Y; X\beta, \sigma^2 I) \cdot \phi(\beta; \mu, \tau^2 I)\),得到正态后验(共轭)。然后对每个后验样本应用投影映射 \(P(\beta) = \arg\min_\theta \|\theta - \beta\|_2^2 + \lambda \|\theta\|_1\),得到稀疏投影后验分布。
- 收缩率证明:利用 Pal & Ghoshal (2024) 的框架,将投影后验的收缩率转化为两个误差之和:(a) 未投影后验的收缩率(由先验和似然决定),(b) 投影映射的逼近误差。通过选择 \(\lambda \asymp \sqrt{\log p / n}\),可以证明投影后验以最优速率收缩。
-
覆盖性质:通过构造一个去偏的投影映射(debiased projection),使得投影后验的均值渐近正态,从而 credible set 达到名义覆盖。
-
关键跳跃点:如何证明投影步骤不会破坏第一阶段已经借用的信息?即,当源信息在某个特征上正确时,投影应保留该特征;当源信息错误时,投影应将其压缩到零。这需要投影映射的“选择性”性质——论文可能通过将投影问题转化为一个带权重的 LASSO 来实现,其中权重由第一阶段的后验方差决定。
-
技术技巧点名:
- 层次贝叶斯建模:用于全局源聚合。
- 稀疏投影后验:来自 Pal & Ghoshal (2024) 的框架,使用 \(\ell_1\) 投影。
- 经验贝叶斯:用于选择 \(\tau^2\) 和 \(\lambda\)。
- 限制特征值条件:用于控制 LASSO 投影的误差。
- 去偏投影:用于覆盖性质(类似 Pal & Ghoshal 2024 中的 Debiased Group LASSO Projection Map)。
真实例子与应用¶
abstract 提到“real-world biomedical applications”,但未给出具体名称。根据作者背景(Tian Gu 之前的工作涉及遗传风险预测,如 Lu et al. 2024),可能使用 eMERGE 网络数据或类似基因表达数据。具体例子需查看全文。若论文确实包含实证,应描述:数据来源、目标与源的定义、如何应用 ProjectionTL、与 baseline 的对比结果(如预测 AUC 或估计误差)。由于信息不足,此处留空。
🔎 结论是否比证明窄¶
由于缺乏全文,无法判断。但需注意:abstract 声称“simultaneously perform source selection and feature selection”,但理论证明可能只在“源权重已知”或“源数量固定”的条件下成立。若论文未证明源权重估计的收敛性,则结论可能比证明宽。建议研究者阅读全文时关注:定理中是否假设 \(w_k\) 是已知的或由 oracle 给出? 若假设已知,则实际两阶段方法(先估计 \(w_k\) 再投影)的理论性质需要额外论证。
四、开放问题¶
- 源权重估计的理论性质:本文第一阶段使用数据驱动权重(如余弦相似度),但未在 abstract 中给出该估计量的收敛率或对最终估计的影响。这是一个明确的 gap:能否证明权重估计的误差以 \(O(1/\sqrt{n})\) 或更快的速率衰减?扎根于:方法描述中“data-driven weights”未提供理论保证。
- 特征不匹配场景的扩展:本文假设源与目标特征空间相同。当特征集不完全重叠时(如 Chang et al. 2024),如何将投影后验与特征映射结合?扎根于:作者在 intro 中引用了 Chang et al. 2024 但未将其纳入框架。
- 非线性模型的推广:本文限于线性回归。能否将投影后验思想推广到 GLM 或非参数模型?扎根于:作者在对比中引用了 TransGLM (Li et al. 2023),但未讨论非线性情况。
- 计算复杂度与可扩展性:投影后验需要对每个后验样本求解一个 LASSO 问题,当 \(p\) 很大时计算成本高。是否存在更高效的近似(如变分投影)?扎根于:方法描述中未讨论计算效率。
提醒:要确认上述 gap 是否真为 gap,建议阅读同子领域近期约 5 篇论文的 intro(如 Li et al. 2023, Lai et al. 2024, Zhang et al. 2024, Pal & Ghoshal 2024, Chang et al. 2024),看它们是否都指向同一问题。若指向一致,则为共识 gap;若互相打架,则可能是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub