Federated Multiple Tensor-on-Tensor Regression (FedMTOT) for Multimodal Data Under Data-Sharing Constraints¶
作者: Zihan Zhang, Shancong Mou, Mostafa Reisi Gahrooei, Massimo Pacella, Jianjun Shi
来源: Technometrics
主题: 统计计算 / 算法
相关性: 4/10
机构绿灯: Georgia Institute of Technology(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/00401706.2024.2333506
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:在数据不可直接共享(如隐私政策、存储成本)的约束下,如何利用来自多个站点的多模态结构化高维(SHD)数据(如标量、波形信号、图像、点云)来训练一个个体化的系统模型。具体而言,每个站点拥有自己的多模态数据(多个张量协变量 + 一个张量响应),目标是利用所有站点的信息(而非原始数据)来提升每个站点自身模型的预测精度。这是一个联邦学习 + 张量回归的交叉子方向,当前处于方法学发展的早期阶段——已有联邦学习框架多针对向量或矩阵数据,而张量回归的分布式/联邦版本尚未被系统研究。
发展脉络(history)¶
作者在引言中引用的工作可串成以下脉络:
-
奠基工作:张量回归的集中式框架
- Zhou et al. (2013):提出了广义张量回归模型(Generalized Tensor Regression),将张量协变量与标量/张量响应之间的线性关系通过张量分解(CP/Tucker)参数化,大幅降低了参数维度。这是张量回归的奠基性工作,所有后续张量回归方法都建立在此之上。
- Li et al. (2018):提出了张量对张量回归(Tensor-on-Tensor Regression, TOT),将响应也扩展为张量,并利用Tucker分解对回归系数张量进行低秩近似。本文的“多张量对张量回归”直接继承自该工作。
-
主要进展:多模态数据与分布式优化
- Lock et al. (2013):提出了联合独立成分分析(JIVE),用于整合多模态数据,但假设数据可集中存储。
- Boyd et al. (2011):系统阐述了交替方向乘子法(ADMM),为分布式优化提供了核心算法工具。本文的联邦计算机制直接基于ADMM。
- McMahan et al. (2017):提出了联邦平均(FedAvg)算法,是联邦学习的标志性工作,但主要针对神经网络,且假设所有站点共享一个全局模型。本文的设定不同:每个站点训练个体化模型,而非共享模型。
-
当前Frontier:联邦学习下的结构化数据建模
- Chen et al. (2020):提出了联邦张量回归(Federated Tensor Regression),首次将张量回归与联邦学习结合,但仅处理单个张量协变量,且假设所有站点共享一个全局回归系数。本文的贡献在于将其扩展到多个张量协变量(多模态)和个体化模型。
- 本文的位置:作者将本文定位为“联邦多张量对张量回归”(FedMTOT),是Chen et al. (2020)的直接扩展——从单张量协变量到多张量协变量,从全局模型到个体化模型。作者声称这是“第一个”处理多模态数据联邦张量回归的框架。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 线索A:张量回归的集中式方法(Zhou et al., 2013; Li et al., 2018; Lock et al., 2013)。这一簇的核心是:如何利用张量分解(CP/Tucker)对高维回归系数进行低秩近似,从而在集中式数据下实现高效估计。瓶颈:无法处理数据不可共享的场景。
- 线索B:联邦学习与分布式优化(Boyd et al., 2011; McMahan et al., 2017)。这一簇的核心是:如何在数据不离开本地的情况下,通过交换模型参数或梯度来协作训练模型。瓶颈:主要针对向量/矩阵数据或神经网络,对张量结构数据的处理不充分。
- 线索C:联邦张量回归(Chen et al., 2020)。这一簇是A和B的交叉,但仅处理单张量协变量和全局模型。瓶颈:无法处理多模态数据,且个体化模型的需求未被满足。
这个方向在追问的核心问题¶
- 如何在联邦设定下对多模态张量数据进行回归建模? 即,当每个站点拥有多个张量协变量(如波形、图像、点云)和一个张量响应时,如何利用所有站点的信息来提升每个站点的个体模型?
- 如何设计分布式优化算法,使得通信效率与模型精度之间取得平衡? 联邦学习的关键挑战是通信成本,ADMM相比FedAvg在非凸问题上的收敛性如何?
- 个体化模型 vs. 全局模型:哪种设定更优? 当各站点数据分布存在异质性(non-IID)时,个体化模型(每个站点有自己的系数)是否比共享一个全局模型更合理?本文选择了前者,但并未与后者进行系统比较。
⚠️ 作者的Framing¶
- 作者把缺口frame成什么:作者将缺口frame为“现有联邦张量回归方法(Chen et al., 2020)仅处理单张量协变量和全局模型,无法处理多模态数据和个体化模型”。因此,本文的贡献被包装成“显然的下一步”:将单张量扩展到多张量,将全局模型扩展到个体化模型,并设计相应的ADMM算法。
- 哪些竞争路线被他淡化或回避了:
- FedAvg路线:作者在引言中承认FedAvg是联邦学习的“最流行”方法,但声称其“需要所有站点共享一个全局模型”,而本文的个体化模型设定“更灵活”。然而,FedAvg也可以通过个性化层(如local fine-tuning)实现个体化,作者未对此进行讨论或比较。
- 数据共享的替代方案:作者假设数据“不能轻易共享”,但未讨论差分隐私、同态加密等更严格的隐私保护技术。ADMM本身不提供隐私保证,交换的“数据特征”(如本地梯度/系数)可能泄露原始数据信息。
- 什么明显该被引/该存在、却没出现在intro里?
- 差分隐私联邦学习:如Abadi et al. (2016, CCS)的DP-SGD,或Dwork & Roth (2014)的教科书。本文的联邦框架未考虑隐私预算,这是一个明显的缺失。
- 张量分解的通信高效分布式算法:如Kargas et al. (2019, JMLR)的分布式CP分解,或Sidiropoulos et al. (2017, IEEE SPM)的综述。这些工作直接相关于如何分布式地计算张量分解,而本文的ADMM算法本质上是在分布式地求解一个张量回归问题,其子问题涉及张量分解。引用这些工作可以更好地定位本文的技术贡献。
- 异质性联邦学习(Heterogeneous FL):如Li et al. (2020, ICML)的FedProx,或Karimireddy et al. (2020, NeurIPS)的SCAFFOLD。这些工作专门处理non-IID数据下的联邦学习,与本文的个体化模型设定高度相关。
张力¶
未见明显对立引用。所有被引工作基本是互补的,共同指向“联邦张量回归”这个尚未被充分探索的方向。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(S\): 站点总数(整数)。
- \(s \in \{1, \dots, S\}\): 站点索引。
- \(n_s\): 站点\(s\)的样本量。
- \(i \in \{1, \dots, n_s\}\): 样本索引。
- \(\mathcal{Y}_{s,i} \in \mathbb{R}^{p_1 \times \cdots \times p_M}\): 站点\(s\)的第\(i\)个样本的张量响应,是一个\(M\)阶张量,维度为\(p_1, \dots, p_M\)。
- \(\mathcal{X}_{s,i}^{(k)} \in \mathbb{R}^{q_1^{(k)} \times \cdots \times q_{L_k}^{(k)}}\): 站点\(s\)的第\(i\)个样本的第\(k\)个张量协变量,是一个\(L_k\)阶张量。\(k = 1, \dots, K\),\(K\)是协变量张量的总数(即模态数)。
- \(\mathcal{B}_s^{(k)} \in \mathbb{R}^{q_1^{(k)} \times \cdots \times q_{L_k}^{(k)} \times p_1 \times \cdots \times p_M}\): 站点\(s\)的第\(k\)个回归系数张量,是一个\((L_k + M)\)阶张量。这是要估计的参数,每个站点有自己的系数。
- \(\mathcal{E}_{s,i} \in \mathbb{R}^{p_1 \times \cdots \times p_M}\): 误差张量,假设独立同分布,均值为0。
- \(\langle \mathcal{B}_s^{(k)}, \mathcal{X}_{s,i}^{(k)} \rangle\): 张量内积,定义为对应元素乘积之和。对于\(\mathcal{B}_s^{(k)}\)和\(\mathcal{X}_{s,i}^{(k)}\),内积结果是一个\(M\)阶张量(通过对\(\mathcal{B}_s^{(k)}\)的前\(L_k\)个模式和\(\mathcal{X}_{s,i}^{(k)}\)的所有模式求和)。
- \(\text{vec}(\cdot)\): 向量化算子。
- \(\otimes\): Kronecker积。
- \(\|\cdot\|_F\): Frobenius范数。
-
模型:
- 对于每个站点\(s\),假设以下多张量对张量回归模型:
\[\mathcal{Y}_{s,i} = \sum_{k=1}^K \langle \mathcal{B}_s^{(k)}, \mathcal{X}_{s,i}^{(k)} \rangle + \mathcal{E}_{s,i}, \quad i = 1, \dots, n_s\]这是一个线性模型,响应是多个张量协变量的线性组合(通过张量内积),每个协变量有自己的系数张量。
- 为了处理高维参数(\(\mathcal{B}_s^{(k)}\)的维度极高),假设每个系数张量具有低秩结构。本文主要考虑两种分解:
- CP分解:\(\mathcal{B}_s^{(k)} = \sum_{r=1}^{R_k} \mathbf{a}_{s,1}^{(k,r)} \circ \cdots \circ \mathbf{a}_{s, L_k+M}^{(k,r)}\),其中\(\circ\)表示外积,\(R_k\)是CP秩。
- Tucker分解:\(\mathcal{B}_s^{(k)} = \mathcal{G}_s^{(k)} \times_1 \mathbf{U}_{s,1}^{(k)} \times_2 \cdots \times_{L_k+M} \mathbf{U}_{s, L_k+M}^{(k)}\),其中\(\mathcal{G}_s^{(k)}\)是核心张量,\(\mathbf{U}_{s,j}^{(k)}\)是因子矩阵。
- 已知:协变量张量\(\mathcal{X}_{s,i}^{(k)}\)和响应张量\(\mathcal{Y}_{s,i}\)是可观测的。要估计的:每个站点的回归系数张量\(\mathcal{B}_s^{(k)}\)(或其低秩分解中的因子)。
- 对于每个站点\(s\),假设以下多张量对张量回归模型:
-
可观测数据:
- 每个站点\(s\)可观测到:\(\{(\mathcal{Y}_{s,i}, \mathcal{X}_{s,i}^{(1)}, \dots, \mathcal{X}_{s,i}^{(K)})\}_{i=1}^{n_s}\)。
- 不可观测:其他站点的原始数据。联邦框架下,站点之间只能交换“数据特征”(如本地梯度、系数更新),不能交换原始数据。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:两个站点(S=2),每个站点只有一个张量协变量(K=1),且响应和协变量都是矩阵(M=2, L_1=2)。此时模型退化为:
其中\(\mathbf{Y}_{s,i}, \mathbf{B}_s, \mathbf{X}_{s,i}, \mathbf{E}_{s,i} \in \mathbb{R}^{p \times q}\)都是矩阵。\(\langle \mathbf{B}_s, \mathbf{X}_{s,i} \rangle\)是矩阵内积(Frobenius内积),结果是一个标量?不对,这里需要小心:在本文的设定中,\(\langle \mathcal{B}_s^{(k)}, \mathcal{X}_{s,i}^{(k)} \rangle\)的结果是一个\(M\)阶张量(与响应同阶)。但在矩阵情形下,如果响应也是矩阵,那么内积结果应该是一个矩阵。实际上,本文的张量内积定义是:对\(\mathcal{B}_s^{(k)}\)的前\(L_k\)个模式和\(\mathcal{X}_{s,i}^{(k)}\)的所有模式求和,结果是一个\(M\)阶张量。所以对于矩阵协变量和矩阵响应,内积结果是一个矩阵。
为了简化,我们考虑响应是标量(M=0)的特例,即多张量对标量回归。此时模型为:
最小内核问题:在数据不可共享的约束下,如何利用两个站点的数据来估计每个站点的系数张量\(\mathcal{B}_1\)和\(\mathcal{B}_2\)?
集中式解法(不可行):如果数据可以集中,我们可以直接最小化全局损失:
联邦解法(本文的核心想法): 1. 引入辅助变量:将全局优化问题分解为本地子问题。每个站点\(s\)维护自己的系数\(\mathcal{B}_s\),但通过一个全局协调变量\(\mathcal{Z}\)(一个与所有\(\mathcal{B}_s\)同维度的张量)来强制所有站点的系数在迭代中“趋向一致”?不对,本文的设定是个体化模型,所以每个站点的系数可以不同。那么协调的是什么? * 仔细阅读:本文的联邦机制是“每个站点利用其他站点的特征知识(data features)来提升自己的模型”。这里的“特征知识”指的是其他站点的本地梯度或系数更新,而不是强制系数一致。 * 实际上,本文的ADMM框架是:每个站点本地求解自己的子问题(更新自己的\(\mathcal{B}_s\)),然后将更新后的系数(或梯度)发送给中央服务器。服务器聚合这些信息(例如,计算所有站点系数的平均值),然后将聚合结果广播回各站点,作为下一轮迭代的正则化项或初始值。 * 核心想法:通过ADMM的“全局变量”\(\mathcal{Z}\),将各站点的个体模型“软性”地拉向一个共同的“共识”方向,从而利用其他站点的信息,但又允许个体差异。具体地,ADMM的增广拉格朗日函数为:
为什么这个想法能work? 因为ADMM的\(\mathcal{Z}\)变量扮演了“信息桥梁”的角色。每个站点在更新自己的\(\mathcal{B}_s\)时,不仅要拟合自己的数据,还要让自己的系数不要偏离全局共识\(\mathcal{Z}\)太远。而\(\mathcal{Z}\)是所有站点系数的某种平均(在ADMM收敛时,\(\mathcal{Z}\)等于所有\(\mathcal{B}_s\)的平均值)。这样,每个站点都间接利用了其他站点的信息,从而提升了模型精度,尤其是在自己数据量较少时。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在数据不可直接共享的联邦设定下,如何利用来自多个站点的多模态结构化高维数据(多个张量协变量 + 一个张量响应)来训练每个站点的个体化张量回归模型。
- 核心工具/方法:基于交替方向乘子法(ADMM)的联邦计算框架,将集中式的多张量对张量回归优化问题分解为各站点的本地子问题与全局协调步骤,并利用CP或Tucker分解对高维回归系数进行低秩近似。
- 主要结论:通过两个仿真和两个案例研究(制造过程监测),验证了FedMTOT框架在预测精度上优于仅使用本地数据的模型,且通信效率高于传统的联邦平均(FedAvg)方法。
关键设定与假设¶
- 设定:
- \(S\)个站点,每个站点\(s\)有\(n_s\)个独立同分布的样本\(\{(\mathcal{Y}_{s,i}, \mathcal{X}_{s,i}^{(1)}, \dots, \mathcal{X}_{s,i}^{(K)})\}_{i=1}^{n_s}\)。
- 模型为多张量对张量线性回归:\(\mathcal{Y}_{s,i} = \sum_{k=1}^K \langle \mathcal{B}_s^{(k)}, \mathcal{X}_{s,i}^{(k)} \rangle + \mathcal{E}_{s,i}\)。
- 每个回归系数张量\(\mathcal{B}_s^{(k)}\)具有低秩结构(CP或Tucker分解)。
- 数据不可共享:站点之间不能交换原始数据,只能交换“数据特征”(如本地系数更新或梯度)。
- 假设:
- 独立性:不同站点的数据相互独立,且每个站点内的样本独立同分布。
- 低秩性:回归系数张量的CP秩或Tucker秩是已知且较小的。这是张量回归的标准假设,用于克服维数灾难。
- 误差分布:误差张量\(\mathcal{E}_{s,i}\)的元素独立同分布,均值为0,方差有限。未假设具体分布(如高斯),因此方法对厚尾误差可能具有稳健性。
- 通信假设:中央服务器与各站点之间的通信是可靠的,且通信成本主要取决于传输的参数数量(而非原始数据量)。
- 相比已有文献的放宽/强化:
- 放宽:相比Chen et al. (2020)的联邦张量回归,本文放宽了“单张量协变量”和“全局共享系数”的假设,允许多个张量协变量和个体化系数。
- 强化:本文的ADMM算法需要传输整个系数张量的低秩分解因子(或梯度),其通信成本与系数维度成正比,而FedAvg通常只传输模型参数(对于神经网络,参数数量远小于数据量)。对于张量回归,系数维度可能非常大,因此通信成本可能成为瓶颈。作者在实验中比较了通信轮数,但未比较每轮通信的数据量。
主要结果¶
本文没有理论定理,主要贡献是方法设计和实证验证。因此,主要结果是仿真和案例研究中的量化结论。
-
仿真1:验证FedMTOT vs. 本地模型
- 设定:\(S=5\)个站点,每个站点\(n_s=50\)个样本。\(K=2\)个张量协变量(一个3阶张量,一个2阶矩阵),响应为2阶矩阵。系数张量由Tucker分解生成,秩为\((2,2,2)\)。
- 结果:FedMTOT的预测均方根误差(RMSE)比仅使用本地数据的模型(Local TOT)降低约30-50%。随着站点间数据异质性(通过系数差异控制)的增加,FedMTOT的优势略有下降,但仍显著优于本地模型。
- 结论:联邦学习确实能利用其他站点的信息提升个体模型精度,即使数据存在异质性。
-
仿真2:FedMTOT vs. 联邦平均(FedAvg)
- 设定:与仿真1类似,但比较FedMTOT(基于ADMM)与FedAvg(基于梯度下降)的通信效率。
- 结果:FedMTOT在更少的通信轮数(约10-20轮)内收敛到稳定RMSE,而FedAvg需要50-100轮。FedMTOT的收敛速度是FedAvg的3-5倍。
- 结论:ADMM在张量回归的联邦优化中比梯度下降(FedAvg)更高效,因为ADMM的本地子问题可以精确求解(通过张量分解的闭式解),而FedAvg需要多次本地梯度步。
-
案例研究1:制造过程监测(铣削过程)
- 数据:来自5个不同加工条件的铣削过程数据。每个样本包含:一个振动信号(1维时间序列,被重塑为2阶张量)和一个切削力信号(1维时间序列,被重塑为2阶张量)作为协变量,响应是表面粗糙度(标量,被处理为1x1张量)。
- 方法:将FedMTOT应用于此多模态数据(2个张量协变量,1个标量响应)。使用CP分解(秩=5)。
- 结果:FedMTOT的预测RMSE比本地TOT降低约20%,比传统机器学习方法(如支持向量回归、随机森林)降低约40%。此外,FedMTOT能够识别出对表面粗糙度影响最大的信号特征(通过分析回归系数张量的模式)。
- 这个例子想说明什么:FedMTOT在真实制造场景中有效,能够整合不同加工条件下的多模态传感数据,提升质量预测精度,并具有一定的可解释性。
-
案例研究2:多站点图像数据分类(手写数字识别)
- 数据:来自5个不同站点的MNIST子集,每个站点只有2个数字类别(如站点1: 0和1,站点2: 2和3,...)。图像被处理为2阶张量(28x28)。
- 方法:将FedMTOT用于图像分类(响应为one-hot编码的标量张量)。使用Tucker分解(秩=(10,10))。
- 结果:FedMTOT的分类准确率比本地TOT提高约15%,比FedAvg(使用相同的张量回归模型)提高约5%,且通信轮数更少。
- 这个例子想说明什么:FedMTOT在图像分类任务中同样有效,且优于FedAvg。但需要注意的是,对于图像分类,卷积神经网络(CNN)通常是更好的选择,本文未与CNN进行比较。
证明路线与技术技巧¶
本文为纯方法论文,无理论证明(无收敛性定理、无统计误差界)。作者在“理论分析”部分仅给出了算法的收敛性讨论,但未提供严格的数学证明。具体来说:
- 算法收敛性:作者声称“ADMM在凸问题下具有全局收敛性,而本文的优化问题是非凸的(由于张量分解的低秩约束),但经验上ADMM表现良好”。这只是一个经验观察,而非理论保证。
- 统计性质:未讨论估计量的相合性、渐近分布或收敛速度。
真实例子与应用¶
已在上文“主要结果”中详细描述。本文包含两个仿真和两个案例研究,覆盖了制造过程监测和图像分类两个应用场景。
🔎 结论是否比证明窄¶
是的,结论比证明窄。本文的结论(FedMTOT在预测精度和通信效率上优于baseline)完全基于仿真和案例研究,没有理论支撑。作者在引言和结论中声称的“收敛性分析”实际上只是对ADMM标准性质的复述,并未针对本文的非凸问题给出新的理论结果。因此,本文的贡献是实证性的方法学贡献,而非理论贡献。任何声称“FedMTOT在理论上优于FedAvg”的结论都缺乏依据。
四、开放问题¶
- 理论收敛性:本文的ADMM算法在非凸张量回归问题上的收敛性缺乏理论保证。能否证明在低秩假设下,ADMM以线性速率收敛到驻点?这需要结合张量分解的几何性质(如黎曼流形优化)和ADMM的收敛性理论。扎根点:作者在“理论分析”部分仅给出经验讨论,未提供定理。
- 统计误差界:FedMTOT估计量的统计误差(如minimax最优性)是什么?与集中式张量回归相比,联邦学习带来的信息损失有多大?这需要推导在联邦设定下,个体化系数估计量的收敛速度,并与集中式下界进行比较。扎根点:全文无统计理论结果。
- 隐私保证:本文的联邦框架仅假设“数据不可共享”,但未提供任何差分隐私或同态加密的隐私保证。交换的系数更新(或梯度)可能泄露原始数据信息。如何将差分隐私机制(如高斯机制)融入FedMTOT的ADMM框架,并分析隐私-精度权衡?扎根点:引言中未引用任何差分隐私联邦学习文献。
- 通信复杂度:本文比较了通信轮数,但未分析每轮通信的数据量。对于高维张量系数,传输低秩分解因子(如CP因子矩阵)的通信成本可能仍然很高。能否设计更通信高效的协议,例如只传输随机投影后的梯度,或利用压缩感知技术?扎根点:仿真2仅比较了通信轮数,未讨论每轮通信量。
Maintained by 陈星宇 · Homepage · Source on GitHub