跳转至

Transfer Learning with Heterogeneous Feature Spaces in Linear Regression

作者: Zejing Zheng, Rui Huang, Junlong Zhao
主题: 其他
相关性: 7/10
链接: https://arxiv.org/abs/2609.08526


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是异质特征空间下的迁移学习(Transfer Learning with Heterogeneous Feature Spaces, HFS)。其根本统计问题是:当目标域(target domain)拥有完整的 p 维协变量,而各源域(source domain)仅观测到目标协变量的一个子集(即 Θ_k ⊊ Θ_0)时,如何利用源域数据来提升目标域线性回归模型的估计与预测精度。该问题的核心困难在于:源域与目标域的特征空间不完全重叠,经典的同特征空间迁移方法(如 Trans-Lasso, Li et al., 2022)无法直接应用,而传统的缺失数据填补方法(如 MissForest, Stekhoven & Bühlmann, 2012)因"块状缺失"(block missingness)——即某些特征在源域中完全未观测——而失效。该方向当前处于快速发展但尚未成熟的阶段:已有工作多聚焦于同特征空间或部分重叠的设定,对"源域特征严格包含于目标域特征"这一极端但常见的 HFS 情形,缺乏系统性的理论与方法。

发展脉络

奠基工作:迁移学习的统计框架可追溯至 Pan & Yang (2010) 的综述,其系统梳理了迁移学习的分类与基本假设。在统计迁移学习的理论奠基上,Cai & Wei (2021) 首次为非参数分类问题建立了迁移学习的 minimax 收敛速率,并构造了自适应分类器,为后续工作提供了"何时迁移有效"的理论基准。同期,Li, Cai & Li (2022) 提出了 Trans-Lasso,针对高维线性回归的同特征空间迁移问题,建立了估计与预测的最优速率,并证明了当源域与目标域参数差异稀疏时,迁移可显著加速收敛。这一工作成为后续众多迁移学习统计方法的基准框架。

主要进展:在 Trans-Lasso 的基础上,研究者开始探索更复杂的模型与设定。Li, Zhang, Cai & Li (2023) 将迁移学习推广至高维广义线性模型(GLMs),提出了 TransHDGLM 算法,建立了 minimax 最优估计速率,并构造了可用于置信区间构建的 debiased 估计量。Tian & Feng (2023) 进一步考虑了源域选择问题,提出了无需预先知道哪些源域有用的自适应迁移方法。在模型结构方面,Li, Cai & Li (2023) 将迁移学习引入高斯图模型,提出了 Trans-CLIME,实现了图估计的精度提升与 FDR 控制。Zhao, Kundu, Saha & Chatterjee (2023) 则首次明确处理了 HFS 问题,但他们的设定是"源域与目标域特征空间部分重叠"(Θ_0 ∩ Θ_k ≠ ∅),且仅利用源域的汇总统计量,方法上依赖于特征重叠部分的回归校准。

当前 frontier:HFS 的极端情形——源域特征严格是目标域特征的子集(Θ_k ⊊ Θ_0)——直到最近才被 Zhao, Zheng & Leng (2026) 的 RIW-TL 方法触及。RIW-TL 通过残差重要性加权(residual importance weighting)处理同特征空间下的分布偏移,但其方法本身并未针对特征空间不一致设计。本文(Zheng, Huang & Zhao, 2026)正是在这一缺口上提出 HIW 方法:它允许每个源域观测目标协变量的任意子集,通过投影矩阵 G^(k) 将源域特征映射到目标域空间,再结合重要性加权与样本选择来控制迁移偏差。本文的位置:它是首个在"源域特征为目标的真子集"这一极端 HFS 设定下,同时建立 entry-wise 与全局收敛速率的工作,且方法上通过分类器(而非直接密度估计)来构造权重,规避了高维条件密度估计的困难。

子线索聚类

被引文献大致落在三条子线索上:

  1. 同特征空间迁移学习(Homogeneous Transfer):以 Li et al. (2022) 的 Trans-Lasso 为核心,包括 Tian & Feng (2023)、Li et al. (2023) 的 TransHDGLM、Zhao et al. (2026) 的 RIW-TL。这类方法假设源域与目标域特征空间一致,核心问题是处理系数差异(parameter shift)与分布偏移(covariate shift)。关键假设:源域与目标域参数差异稀疏(即 ‖β^(k) − β^(0)‖ 的 ℓ₀ 范数小),或残差分布可比较。

  2. 异质特征空间迁移(Heterogeneous Transfer):以 Zhao et al. (2023) 为代表,处理源域与目标域特征空间部分重叠的情形。这类方法通常需要特征重叠部分足够丰富,以建立可靠的校准关系。关键假设:重叠特征对非重叠特征有较强的预测能力(即条件分布 X_{Θ_0∖Θ_k} | X_{Θ_k} 可识别)。本文的 HIW 方法属于此线索,但将设定推广到"源域特征为目标的真子集"这一更极端情形。

  3. 高维稀疏回归的估计理论:作为技术基础,包括 Bickel et al. (2009) 的 Lasso 与 Dantzig Selector 的 oracle 不等式、Negahban et al. (2012) 的 decomposable regularizers 统一框架、Mourtada (2022) 的精确 minimax 风险分析。这些工作为本文高维情形的证明提供了工具。

这个方向在追问的核心问题

  1. 何时迁移有益? 即源域与目标域的相似性(如 ‖β^(k) − G^(k)β^(0)‖ 的大小)如何决定迁移带来的收益。Cai & Wei (2021) 与 Li et al. (2022) 均给出了"迁移增益"的精确刻画,但都是在同特征空间下。在 HFS 下,由于投影矩阵 G^(k) 的引入,相似性的度量变得更加复杂——本文的定理 1 与定理 2 给出了部分回答,但"最优投影矩阵的选择"仍是开放问题。

  2. 如何避免负迁移? 当源域与目标域差异过大时,迁移反而会损害目标域性能。现有方法(如 Trans-Lasso)通过源域选择或加权来缓解,但 HFS 下的负迁移机制尚不清晰。本文通过样本选择(即只保留权重有界的样本)来控制这一风险,但选择阈值的自适应选取未解决。

  3. entry-wise 与全局速率的权衡:在 HFS 下,不同坐标的估计精度取决于该坐标在多少源域中被观测(即 N_j 的大小)。本文首次给出了 entry-wise 速率,但"如何利用这一信息进行自适应推断(如构造逐坐标置信区间)"是自然的下一步。

  4. 投影矩阵的构造:本文的定理 1 表明,任何满足条件 5 的投影矩阵在 population 层面都有效,但有限样本下的最优选择(即最小化常数项)未解决。本文第 4.1 节提出了数据融合(data-fused)与目标导向(target-oriented)两种启发式构造,但缺乏理论保证。

⚠️ 作者的 framing:作者将缺口 frame 为"现有 HFS 方法(Zhao et al., 2023; Chang et al., 2024)要么要求特征空间部分重叠且依赖难以验证的校准条件,要么缺乏 entry-wise 速率与负迁移控制机制"。因此,本文的贡献被定位为"首个在源域特征为目标的真子集设定下,同时实现样本选择、投影插补与 entry-wise 速率的方法"。作者淡化了以下竞争路线:(a) 直接对源域缺失特征做多重填补后再用同特征空间迁移方法(作者认为块状缺失使填补不可行);(b) 将 HFS 视为特殊的协变量缺失问题并用缺失数据理论处理(作者认为目标导向的插补比源导向的插补更优,但未与缺失数据文献系统比较)。

张力:被引文献之间未见明显对立结论。但存在一个微妙的张力:Zhao et al. (2023) 的方法依赖源域汇总统计量(summary statistics),而本文的方法需要源域个体数据(individual-level data)来训练分类器。在联邦学习或隐私受限的场景下,本文方法的适用性受限,而作者未讨论这一 trade-off。另一个张力是:Li et al. (2022) 的 Trans-Lasso 在源域选择上采用"全有或全无"(all-in-all-out)策略,而本文的样本选择是"部分采用"(sample-level),两者在理论上哪个更优尚无直接比较。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

符号清单(逐个点名):

符号 含义 类型
p 目标域协变量总数(全特征空间维度) 维度指标
Θ_0 = [p] 目标域观测到的特征指标集合 集合
Θ_k ⊆ [p] 第 k 个源域观测到的特征指标集合,|Θ_k| = p_k 集合
n_0, n_k 目标域、第 k 个源域的样本量 样本量
N = Σ_{k=0}^{K} n_k 总样本量 样本量
y_i^(k), x_i^(k) 第 k 个域的第 i 个观测的响应与协变量向量 随机变量(观测)
x̃_i^(k) ∈ ℝ^{p_k} 第 k 个源域实际观测到的协变量子向量(仅含 Θ_k 中的坐标) 随机变量(观测)
β^(k) ∈ ℝ^p 第 k 个域的回归系数向量(源域系数定义在完整特征空间上,但仅 Θ_k 部分可识别) 参数(目标:β^(0))
θ^(k) ∈ ℝ^{p_k} 第 k 个源域约简模型的系数(对应观测到的特征) 参数(中间量)
ϵ_i^(k) 回归误差,均值为零,与协变量独立 随机变量(不可观测)
Σ^(k) 第 k 个域的协变量协方差矩阵 参数(未知)
G^(k) ∈ ℝ^{p_k × p} 投影矩阵,将完整特征映射到观测特征:x̃^(k) = G^(k) x^(k) 设计参数(可调)
ω^(k) 第 k 个源域的重要性权重(密度比) 估计对象
ν 研究者指定的参考误差,密度 f_ν 设计参数(可调)
S_0 = {j : β_j^(0) ≠ 0} 目标系数的支撑集,|S_0| = s_0 参数(稀疏性)
N_j = n_0 + N_j^dir + N_j^imp 第 j 个坐标的有效样本量 导出量
γ_0, γ_k, q_k 初始估计器的收敛速率 导出量

模型(数据生成机制):

  • 目标域(完整观测):y_i^(0) = (x_i^(0))^T β^(0) + ϵ_i^(0),观测到完整 p 维协变量。
  • 源域 k(部分观测):完整模型为 y_i^(k) = (x_i^(k))^T β^(k) + ϵ_i^(k),但我们只能观测到 x̃_i^(k) = G^(k) x_i^(k) ∈ ℝ^{p_k}(即仅 Θ_k 中的坐标)。因此,实际拟合的是约简模型: y_i^(k) = (x̃_i^(k))^T θ^(k) + ϵ̃_i^(k),其中 θ^(k) 是约简系数,ϵ̃_i^(k) 是约简误差(一般与 x̃^(k) 相关)。

  • 可观测数据:目标域 {(y_i^(0), x_i^(0))}{i=1}^{n_0},各源域 {(y_i^(k), x̃_i^(k))}{i=1}^{n_k},k = 1, …, K。注意:源域的完整协变量 x^(k) 从未被观测到,因此无法直接计算 x^(k) 与 x̃^(k) 的关系。

  • 不可观测 / 潜在量:源域的完整协变量 x^(k)、完整系数 β^(k)、约简误差 ϵ̃^(k) 的条件密度 f_k(ϵ̃^(k) | x̃^(k))。这些量只能通过假设(条件 1-2)和初始估计间接处理。

核心识别问题:由于源域仅观测到特征子集,约简系数 θ^(k) 与目标系数 β^(0) 之间不存在直接对应关系。本文通过投影矩阵 G^(k) 构造"理想响应" y^(k0) = (x̃^(k))^T G^(k) β^(0) + ν,将源域数据"对齐"到目标参数 β^(0) 上。但 y^(k0) 是潜在量(因为 β^(0) 未知),需要通过初始估计 β^(0)_in 来近似。

第二步:最小内核

剥掉所有一般性假设后,本文的核心数学问题是:

如何用"部分特征观测"的源域数据来估计目标域线性回归系数 β^(0),并给出每个坐标的 entry-wise 收敛速率?

最简特例(p = 2, K = 1, Θ_1 = {1}):

设目标域观测到完整二维协变量 x^(0) = (x_1, x_2),源域仅观测到第一个特征 x̃^(1) = x_1。目标模型为 y^(0) = β_1^(0) x_1 + β_2^(0) x_2 + ϵ^(0)。源域约简模型为 y^(1) = θ_1 x_1 + ϵ̃^(1),其中 θ_1 是 x_1 对 y^(1) 的边际效应(包含了 x_2 通过相关性传递的影响)。

本文的方法: 1. 用目标域数据估计 β^(0)in(OLS,n_0 个样本)。 2. 选择投影矩阵 G^(1) = [1, 0](即只保留第一个坐标)。 3. 构造理想响应 y^(10) = x_1 · β_1^(0) + ν(ν 是标准正态参考误差)。 4. 对源域每个样本 i,计算权重 ω_i^(1) = f_ν(y_i^(1) − x{1i} β_1^(0)) / f_1(y_i^(1) − x_{1i} θ_1 | x_{1i}),其中 f_1 是源域约简误差的条件密度。 5. 用加权最小二乘估计 β^(0)hiw,目标函数为: Σ{i∈D_0} (y_i^(0) − (x_i^(0))^T β)² + Σ_{i∈D_1} ω_i^(1) (y_i^(1) − x_{1i} β_1)²

为什么这个例子能体现核心困难?

  • 困难 1(块状缺失):x_2 在源域中完全未观测,无法用标准填补方法。投影矩阵 G^(1) 将源域"压缩"到一维,但代价是丢失了 x_2 的信息——β_2^(0) 只能从目标域估计,其速率是 1/n_0 而非 1/(n_0 + n_1)。
  • 困难 2(权重估计):权重 ω_i^(1) 的分母是条件密度 f_1(ϵ̃^(1) | x_1),这是高维条件密度,直接估计会遭遇维数灾难。本文用分类器(逻辑回归)来间接估计权重,但分类器的收敛速率(q_k)会进入最终误差界。
  • 困难 3(偏差控制):如果投影矩阵 G^(1) 选择不当(例如,x_2 对 y^(0) 的影响很大,但 G^(1) 完全忽略了 x_2),那么源域数据携带的信息与目标参数 β^(0) 的关联很弱,迁移增益有限甚至为负。本文通过样本选择(只保留权重有界的样本)来控制这一风险,但选择阈值 R 的选取直接影响偏差-方差权衡。

在这个特例下,定理 1 的结论退化为: (β̂_1^(0) − β_1^(0))² = O_p(1/N_1),其中 N_1 = n_0 + n_1(因为 x_1 在源域中被直接观测,N_1^dir = n_1)。 (β̂_2^(0) − β_2^(0))² = O_p(1/n_0)(因为 x_2 仅在目标域观测,N_2 = n_0)。

这个例子揭示了本文的核心思想:迁移学习的收益是"坐标特异"的——每个坐标的估计精度取决于该坐标在多少个源域中被观测到(N_j),而投影矩阵 G^(k) 的作用就是决定哪些坐标能"借用"源域信息。本文的 entry-wise 速率正是对这一直觉的严格刻画。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在异质特征空间(HFS)下——即每个源域仅观测目标协变量的一个子集——如何通过投影插补与重要性加权,利用源域数据提升目标域线性回归的估计精度,并建立 entry-wise 与全局收敛速率。
  2. 核心工具 / 方法:提出 HIW(Heterogeneous Importance Weighting)估计器,其核心是 (i) 用投影矩阵 G^(k) 将源域特征对齐到目标空间;(ii) 用基于伪响应的分类器估计条件误差密度比作为重要性权重;(iii) 通过样本选择(只保留权重有界的样本)控制负迁移风险。
  3. 主要结论:在低维与高维(稀疏)两种情形下,HIW 估计器达到 entry-wise 速率 O_p((1+g)/N_j) 与全局速率 O_p(Σ_j (1+g)/N_j),其中 N_j 是坐标 j 的有效样本量(包含直接观测与插补贡献),g 是权重估计与投影矩阵估计的代价项;在源域与目标域足够相似的条件下,该速率严格优于仅用目标域的 OLS/Lasso。

关键设定与假设

设定: - 目标域:y^(0) = (x^(0))^T β^(0) + ϵ^(0),观测完整 p 维协变量,样本量 n_0。 - 源域 k:y^(k) = (x^(k))^T β^(k) + ϵ^(k),仅观测子向量 x̃^(k) = G^(k) x^(k) ∈ ℝ^{p_k},样本量 n_k。 - 目标:估计 β^(0),允许使用所有源域数据。

假设(逐条说明统计含义):

  1. 条件 1(次高斯性与特征值条件):x^(0) 与 x̃^(k) 为次高斯随机向量,且 Σ^(0) 与 Σ^(k)_{Θ_k,Θ_k} 的特征值有界。这是高维回归的标准条件,保证协方差矩阵的可逆性与集中不等式成立。相比同特征空间迁移(Li et al., 2022),这里额外要求源域观测子矩阵的特征值有界,即源域观测到的特征之间不能完全共线。

  2. 条件 2(误差密度条件):源域约简误差的条件密度 f_k(ϵ̃^(k) | x̃^(k)) 有界且为正,参考误差 ν 的密度 f_ν 对称、有界、为正。这保证重要性权重 ω^(k) 有定义且可估计。相比同特征空间方法,这里不需要源域与目标域误差分布相同,只需满足密度比有界(即支撑包含关系)。

  3. 条件 3(初始估计器收敛性):β^(0)_in 和 θ^(k)_in 分别以速率 γ_0 和 γ_k 收敛到 β^(0) 和 θ^(k)。这是技术性假设,保证权重估计和投影矩阵估计的误差可控。在低维下 γ_0 = p/n_0,高维下 γ_0 = s_0 log p / n_0。

  4. 条件 4(后选择协方差条件):Σ^sel_{S_0,S_0} 的特征值有界。这是高维稀疏回归的标准条件(类似 restricted eigenvalue),保证 Lasso 型估计在支撑集上的可识别性。

  5. 条件 5(投影矩阵条件):G^(k){•,Θ_k} = I{p_k}(即投影矩阵在观测特征上为单位阵),且 ‖G^(k)‖₁ 有界。这是本文的关键假设之一:它保证了插补后的源域协变量在观测特征上与真实值一致,且插补部分不会过度放大噪声。相比 Chang et al. (2024) 要求的"源域与目标域特征映射足够相似",条件 5 更弱且可验证。

相比已有文献的放宽/强化: - 放宽:不要求源域与目标域特征空间相同(Li et al., 2022),不要求特征重叠部分足够大(Zhao et al., 2023),不要求源域特征映射与目标域足够相似(Chang et al., 2024)。 - 强化:要求投影矩阵满足条件 5(观测特征上为单位阵),这比 Chang et al. (2024) 的设定更具体,但也限制了投影矩阵的选择范围。

主要结果

定理 1(低维):在 p ≪ min_k n_k 且条件 1-5 下,对每个坐标 j ∈ [p], (β̂^(0)hiw,j − β_j^(0))² = O_p((1+g)/N_j), 其中 N_j = n_0 + Σ{k∈Ξ_j} E(n_{I_k}) (Σ^(k)I){j,j} + Σ_{k∉Ξ_j} E(n_{I_k}) (G^(k){•,j})^T Σ^(k)_I G^(k){•,j}, g = Σ_{k=1}^{K} E(n_{I_k}) [γ_0 ∧ (M_k + h_k)]²。

直觉: - N_j 是坐标 j 的"有效样本量":直接观测到 x_j 的源域贡献 (Σ^(k)I){j,j} 的加权和,未观测到 x_j 的源域通过投影矩阵 G^(k) 的列范数贡献插补信息。 - g 是权重估计与样本选择的代价:如果源域与目标域差异大(h_k 大),或者权重估计不准(γ_0 大),则 g 增大,速率变差。 - 当 g = O(1)(即源域与目标域足够相似),速率退化为 O_p(1/N_j),优于仅用目标域的 O_p(1/n_0)。

定理 2(高维全局):在稀疏性假设下, ‖β̂^(0)_hiw − β^(0)‖₂² = O_p(ρ_m² s_0 log s_0 / N_min,S_0 · (1+g)), 其中 ρ_m = N_max,S_0 / N_min,S_0 是支撑集上有效样本量的不平衡度。

定理 3(高维 entry-wise):在更强的条件 7 下,对 j ∈ S_0, (β̂^(0)_hiw,j − β_j^(0))² = O_p(log s_0 / N_j · (1+g))。

证明路线与技术技巧:

  1. 整体路线(3-5 步):
  2. Step 1:将 HIW 估计器重写为加权最小二乘形式,权重 ω̂^(k)_i 由分类器估计。
  3. Step 2:将估计误差分解为"权重估计误差"与"投影矩阵估计误差"两部分,分别控制。
  4. Step 3:对权重估计误差,利用分类器的收敛速率(q_k)和样本选择集合 I_k 的构造,证明其贡献为 g 项。
  5. Step 4:对投影矩阵估计误差,利用条件 5 和初始估计器的收敛速率(γ_0, γ_k),证明其贡献可并入 g 项。
  6. Step 5:对加权最小二乘的随机误差项,利用次高斯集中不等式和有效样本量 N_j 的定义,得到 entry-wise 速率。

  7. 关键引理:

  8. 引理 A.2:样本选择集合 I_k 上的权重有界性。证明在 I_k 上,ω^(k)_i 一致有界,从而加权最小二乘的随机误差可控。
  9. 引理 A.5:δ_n = o_p(1),即比较集合 Φ_k^− 和 Φ_k^+ 与 Φ_k 的差异随样本量消失。这保证了后选择协方差矩阵 Σ^sel 的估计一致性。
  10. 引理 A.6:Φ_k^− ⊆ Φ_k ⊆ Φ_k^+ 的概率趋于 1,且三者的样本量同阶。

  11. 技术技巧点名:

  12. 分类器替代密度估计:用逻辑回归等分类器的 odds 来估计密度比,避免直接估计高维条件密度。这是本文的核心技巧,将密度估计问题转化为分类问题,利用分类器的泛化误差界(q_k)来控制权重估计误差。
  13. 样本选择(sample selection):通过阈值 R 和 M_k 只保留权重有界的样本,将"全样本加权"转化为"子样本加权",从而避免极端权重导致的方差爆炸。这是控制负迁移的关键机制。
  14. entry-wise 分析:不同于全局 ℓ₂ 分析,entry-wise 分析需要对每个坐标单独控制误差,利用有效样本量 N_j 的坐标特异性。这要求对加权最小二乘的影响函数进行逐坐标展开。
  15. 交叉拟合(cross-fitting):通过数据分割(Step 5),保证初始估计器与最终估计器使用的数据独立,避免过度拟合。

真实例子与应用

GTEx 数据:本文使用基因型-组织表达(GTEx)数据集,目标是预测 HES5 基因在两种脑组织(海马体、尾状核基底节)中的表达水平。协变量为中枢神经系统神经元分化通路中的 153 个基因的表达水平。13 个脑组织中,2 个作为目标域,11 个作为源域。由于不同组织测序覆盖度不同,源域天然缺失部分基因的表达数据,形成 HFS。

方法应用: 1. 对每个源域组织,仅保留其观测到的基因子集,用分类器估计权重。 2. 构造投影矩阵 G^(k)(数据融合版与目标导向版)。 3. 用 HIW/AHIW 估计 β^(0),并与仅用目标域的 Lasso 比较。

结果:图 3 显示,在 α=0(原始缺失)和 α=0.3(额外移除 30% 源域特征)两种设置下,HIW 和 AHIW 的预测 MSE 均低于 target-Lasso。AHIW 在 α=0.3 时优势更明显,说明自适应投影矩阵在特征缺失更严重时更有价值。

这个例子想说明什么:验证 HIW 在真实 HFS 场景中的有效性,特别是当源域特征缺失比例较高时,自适应投影矩阵(AHIW)能更好地平衡偏差与方差。同时,附录 C 中的样本选择比例分析表明,当 α=0.3 时 AHIW 更"挑剔"(保留更少的源域样本),说明更强的特征缺失使得源域数据的可靠性下降,需要更严格的筛选。

四、开放问题

  1. 投影矩阵 G^(k) 的最优选择:本文定理 1 表明任何满足条件 5 的投影矩阵在 population 层面有效,但有限样本下的最优选择未解决。第 4.1 节的数据融合与目标导向构造是启发式的,缺乏理论保证。扎根点:第 4.1 节"we define B_DF ... and use G^(k) = G^(k)_DF for HIW in the numerical studies",但未给出选择 ρ_1, ρ_2 的理论准则。值得追问:是否存在一个数据驱动的准则(如最小化估计误差上界)来选择 G^(k)?这与协方差矩阵估计中的收缩估计(shrinkage estimation)可能有联系。

  2. 源域特征并集小于目标域的情形:本文假设 ∪_k Θ_k = [p],即所有目标特征至少在某个源域中被观测。若某些特征在所有源域中都缺失(∪_k Θ_k ⊊ [p]),HIW 是否仍然有效?扎根点:Remark 2 仅讨论了 ∪_k Θ_k = [p] 的放松条件,未涉及并集严格小于目标域的情形。值得追问:此时是否可以通过源域特征间的相关性结构来插补完全缺失的特征?这与矩阵补全(matrix completion)问题有关。

  3. 非线性模型的推广:本文仅处理线性回归。将 HIW 推广至广义线性模型(如 logistic 回归)或非参数回归时,投影插补与重要性权重的理论性质如何变化?扎根点:第 6 节"Future research could extend this method to generalized linear models, nonparametric regression"。值得追问:在 GLM 中,投影矩阵 G^(k) 需要满足什么条件才能保证 population 层面的有效性?分类器估计权重的方法是否仍然适用?

  4. entry-wise 速率的自适应推断:定理 3 给出了 entry-wise 速率,但未讨论如何利用这一信息构造逐坐标的置信区间。扎根点:定理 3 的速率依赖于 N_j,但 N_j 本身需要估计。值得追问:能否构造一个数据驱动的 N̂_j,使得基于 HIW 的置信区间在覆盖率和长度上达到最优?

  5. 源域数量 K 趋于无穷的渐近:本文假设 K 固定。当 K 随样本量增长时(如联邦学习中大量客户端),HIW 的收敛速率如何变化?扎根点:第 2.1 节假设 K 固定,未讨论 K → ∞ 的情形。值得追问:当 K 增长时,权重估计的累积误差是否可控?是否需要引入源域选择的稀疏性约束?

提示:要确认上述问题是否为真 gap,建议去读近 5 年关于迁移学习的高维统计文献(如 NeurIPS、AoS、JRSS-B 上的相关论文)的引言部分——如果多个独立工作都指向同一问题,那大概率是共识性 gap;如果只有本文提到,则可能是作者为自洽而设的"伪 gap"。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论