Prediction Using Many Samples with Models Possibly Containing Partially Shared Parameters¶
作者: Xinyu Zhang, Huihang Liu, Yizheng Wei, Yanyuan Ma
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 3/10
机构绿灯: Pennsylvania State University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2023.2166515
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:当研究者有一个“主模型”(main model)和若干“辅助模型”(helper models),且这些模型共享部分参数时,如何利用辅助模型的数据来提升主模型的预测精度? 核心挑战在于:主模型可能被错误设定(misspecified),而辅助模型也可能部分或全部错误;数据来源可能不同分布;需要一种自动的、数据驱动的机制来融合信息,同时避免引入偏差。当前成熟度属于方法开发与理论验证阶段——已有若干模型平均方法,但大多假设模型间数据同分布或模型结构完全一致,本文试图放宽这些限制。
发展脉络(history)¶
从 introduction 引用的工作串成一条线:
- 奠基工作:模型平均(Model Averaging)
- Bates & Granger (1969):提出组合预测(combining forecasts)的思想,是模型平均的早期雏形。
- Hansen (2007):提出 Mallows 模型平均(MMA),通过最小化 Mallows Cp 准则选择权重,适用于线性回归。
- Wan et al. (2010):将 MMA 推广至非线性模型。
-
Lu & Su (2015):提出 Jackknife 模型平均(JMA),通过交叉验证选择权重,适用于更一般的设定。
这些工作奠定了模型平均的理论基础,但它们假设所有模型都基于同一数据集,即数据来源相同。 -
主要进展:利用外部数据(Data Fusion / Transfer Learning)
- Zhang et al. (2019):提出“部分线性模型平均”(Partially Linear Model Averaging),允许主模型和辅助模型共享部分线性参数,但要求所有模型的数据独立同分布。
- Liu et al. (2020):在“迁移学习”(Transfer Learning)框架下,利用辅助样本提升主样本的估计效率,但假设主模型正确设定,且辅助模型与主模型结构相同。
-
Tian & Feng (2022):提出“多源数据融合”(Multi-source Data Fusion)方法,允许不同源数据有不同分布,但要求所有模型共享全部参数(即模型结构完全相同)。
这些工作开始处理数据异质性,但要么要求模型结构一致,要么要求主模型正确设定。 -
当前 frontier:允许模型部分共享参数 + 主模型可能错误设定
-
本文(Zhang et al., 2024) 的位置:它试图填补上述 gap——允许主模型与辅助模型仅共享部分参数(而非全部),且不要求主模型正确设定。它提出的 MAP 方法通过加权平均主模型和辅助模型的预测结果,权重由数据自适应决定,并证明了渐近最优性。
-
本文的 framing(作者的说法):作者把缺口 frame 成“现有模型平均方法要么假设数据同分布,要么假设模型结构完全一致,要么假设主模型正确设定”——因此本文是“显然的下一步”:放松这些假设,允许部分共享参数和主模型可能错误设定。
- 被淡化或回避的竞争路线:作者没有深入讨论“迁移学习”中常见的“负迁移”(negative transfer)问题——即当辅助模型与主模型共享的参数实际上不同时,融合可能损害预测。MAP 的权重机制理论上能自动将错误辅助模型的权重降至零,但作者未证明在有限样本下这一机制何时有效。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:
- 因果推断中的“数据融合”(Data Fusion)文献,如 Bareinboim & Pearl (2016) 关于“transportability”的工作,或 Dahabreh et al. (2020) 关于“generalizability”的工作——这些文献也处理不同源数据的融合,但聚焦于因果 estimand 而非预测。
- “多任务学习”(Multi-task Learning) 文献,如 Caruana (1997) 或 Evgeniou & Pontil (2004)——这些工作也处理共享参数的多模型学习,但通常假设所有任务同等重要,而非一个主任务加多个辅助任务。
- “集成学习”(Ensemble Learning) 中的“stacking”方法(Wolpert, 1992)——虽然 stacking 也加权组合模型,但通常不处理参数共享结构。
这些缺失可能意味着作者有意将论文定位在“统计模型平均”而非“机器学习”或“因果推断”社区。
子线索聚类¶
这些被引文献大致落在 2 条子线索上:
- 模型平均(Model Averaging):
- 代表工作:Bates & Granger (1969), Hansen (2007), Wan et al. (2010), Lu & Su (2015), Zhang et al. (2019)。
- 核心:通过加权组合多个模型的预测,权重由数据自适应决定。
-
瓶颈:大多假设数据同分布或模型结构一致。
-
迁移学习 / 数据融合(Transfer Learning / Data Fusion):
- 代表工作:Liu et al. (2020), Tian & Feng (2022)。
- 核心:利用辅助样本提升主样本的估计或预测效率。
- 瓶颈:大多假设主模型正确设定,或要求模型结构完全一致。
这个方向在追问的核心问题¶
- 如何自动确定哪些辅助模型有用、哪些有害? ——即权重选择机制。
- 当主模型错误设定时,如何保证融合不引入额外偏差? ——即渐近最优性。
- 当数据来源不同分布时,如何保证融合有效? ——即异质性处理。
- 有限样本下,权重选择机制的性能如何? ——即理论保证的紧性。
张力¶
未见明显对立引用。各工作之间更多是“逐步放宽假设”的关系,而非矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( Y \):响应变量(scalar)。
- \( X \):协变量向量(\( p \)-维)。
- \( Z \):另一组协变量向量(\( q \)-维),与 \( X \) 可能部分重叠。
- 主模型:\( Y = f(X, \beta) + \varepsilon \),其中 \( \beta \) 是 \( d \)-维参数,\( f \) 是已知函数形式(可能错误设定),\( \varepsilon \) 是均值为零的随机误差。
- 辅助模型(共 \( M \) 个):第 \( k \) 个辅助模型为 \( Y = g_k(X, Z, \theta_k) + \varepsilon_k \),其中 \( \theta_k \) 是参数,\( g_k \) 是已知函数形式(可能错误设定)。
- 共享参数:主模型参数 \( \beta \) 与辅助模型参数 \( \theta_k \) 共享部分分量。记共享部分为 \( \beta_s \)(\( s \)-维),非共享部分为 \( \beta_u \) 和 \( \theta_{k,u} \)。
- 可观测数据:
- 主样本:\( \{(Y_i, X_i)\}_{i=1}^n \),来自主模型。
- 辅助样本:第 \( k \) 个辅助样本 \( \{(Y_{k,j}, X_{k,j}, Z_{k,j})\}_{j=1}^{n_k} \),来自第 \( k \) 个辅助模型。
-
目标:基于主样本和辅助样本,预测新观测 \( (X_{\text{new}}, Z_{\text{new}}) \) 的 \( Y_{\text{new}} \)。
-
模型:
- 数据生成机制:主样本和辅助样本分别来自不同的分布 \( P \) 和 \( P_k \),但共享部分协变量效应(即 \( \beta_s \) 相同)。
- 已知:函数形式 \( f \) 和 \( g_k \) 已知,但可能错误设定(即真实数据生成机制可能不属于这些函数族)。
-
要估的对象:预测权重 \( w = (w_0, w_1, \ldots, w_M)^T \),其中 \( w_0 \) 是主模型的权重,\( w_k \) 是第 \( k \) 个辅助模型的权重,满足 \( \sum_{k=0}^M w_k = 1 \),\( w_k \geq 0 \)。
-
可观测数据:
- 可观测:\( Y_i, X_i \)(主样本);\( Y_{k,j}, X_{k,j}, Z_{k,j} \)(辅助样本)。
- 不可观测:真实参数 \( \beta^* \) 和 \( \theta_k^* \);真实数据生成机制;主模型是否正确设定。
第二步:讲最小内核¶
最简特例:假设只有 1 个辅助模型(\( M=1 \)),且主模型和辅助模型都是线性回归: - 主模型:\( Y = X^T \beta + \varepsilon \),其中 \( \beta = (\beta_s, \beta_u)^T \),\( \beta_s \) 是共享部分(\( s \)-维),\( \beta_u \) 是主模型独有部分。 - 辅助模型:\( Y = X_s^T \beta_s + Z^T \theta + \varepsilon_1 \),其中 \( X_s \) 是 \( X \) 中与 \( \beta_s \) 对应的协变量,\( \theta \) 是辅助模型独有参数。 - 可观测数据:主样本 \( \{(Y_i, X_i)\}_{i=1}^n \),辅助样本 \( \{(Y_{1,j}, X_{1,j,s}, Z_{1,j})\}_{j=1}^{n_1} \)。
核心思路: 1. 分别估计:用主样本估计主模型参数 \( \hat{\beta} \)(例如 OLS);用辅助样本估计辅助模型参数 \( \hat{\beta}_s \) 和 \( \hat{\theta} \)(例如 OLS)。 2. 生成预测:对新观测 \( (X_{\text{new}}, Z_{\text{new}}) \),主模型预测 \( \hat{Y}_0 = X_{\text{new}}^T \hat{\beta} \),辅助模型预测 \( \hat{Y}_1 = X_{\text{new},s}^T \hat{\beta}_s + Z_{\text{new}}^T \hat{\theta} \)。 3. 选择权重:MAP 通过最小化一个加权预测风险(weighted prediction risk)来选择 \( w = (w_0, w_1) \):
为什么这个特例能体现核心思想: - 当主模型正确设定时,辅助模型可能引入偏差,MAP 应自动将 \( w_1 \) 设为 0(即只使用主模型)。 - 当主模型错误设定时,辅助模型可能提供有用信息,MAP 应选择 \( w_1 > 0 \) 以最小化预测风险。 - 留一法预测保证了权重选择不依赖于模型估计的过拟合。
一般情形:当有 \( M \) 个辅助模型时,MAP 将权重向量 \( w \) 扩展至 \( M+1 \) 维,并通过类似的最小化问题选择权重。理论部分证明:当主模型错误设定时,MAP 的权重选择是渐近最优的(即最小化预测风险);当主模型正确设定时,所有错误辅助模型的权重渐近趋于 0。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当主模型与多个辅助模型共享部分参数时,如何利用辅助样本提升主模型的预测精度,且允许主模型可能错误设定。
- 核心工具 / 方法:提出 Model Averaging Prediction (MAP) 方法,通过加权平均主模型和辅助模型的留一法预测,权重由数据自适应决定。
- 主要结论:当主模型错误设定时,MAP 的权重选择是渐近最优的(最小化预测风险);当主模型正确设定时,MAP 渐近地将所有错误辅助模型的权重降至零。
关键设定与假设¶
- 设定:
- 主模型:\( Y = f(X, \beta) + \varepsilon \),其中 \( f \) 已知,\( \beta \in \mathbb{R}^d \)。
- 辅助模型(共 \( M \) 个):第 \( k \) 个辅助模型 \( Y = g_k(X, Z_k, \theta_k) + \varepsilon_k \),其中 \( g_k \) 已知,\( \theta_k \in \mathbb{R}^{d_k} \)。
- 共享参数:\( \beta \) 与 \( \theta_k \) 共享部分分量,记为 \( \beta_s \)(\( s \)-维)。
-
数据:主样本 \( \{(Y_i, X_i)\}_{i=1}^n \),辅助样本 \( \{(Y_{k,j}, X_{k,j}, Z_{k,j})\}_{j=1}^{n_k} \),\( k=1,\ldots,M \)。
-
假设(逐条说明统计含义):
- A1(参数可识别性):主模型和辅助模型的参数在各自样本上可一致估计。这是标准假设,保证估计量 \( \hat{\beta} \) 和 \( \hat{\theta}_k \) 是 \( \sqrt{n} \)-一致的。
- A2(共享参数一致性):共享参数 \( \beta_s \) 在主模型和辅助模型中的真实值相同。这是核心假设——如果违反,融合将引入偏差。作者未讨论如何检验这一假设。
- A3(误差矩条件):误差 \( \varepsilon \) 和 \( \varepsilon_k \) 有有限四阶矩。这是技术性假设,用于证明渐近正态性和权重选择的收敛性。
- A4(样本量比例):辅助样本量 \( n_k \) 与主样本量 \( n \) 同阶(即 \( n_k / n \to c_k \in (0, \infty) \))。这保证辅助样本的信息量不退化。
-
A5(模型错误设定):主模型可能错误设定,即真实数据生成机制 \( E[Y|X] \) 可能不等于 \( f(X, \beta) \) 对任何 \( \beta \)。这是本文区别于已有工作的关键——允许主模型错误设定。
-
相比已有文献放宽或强化了哪些:
- 相比 Zhang et al. (2019):放宽了“所有模型数据同分布”的假设。
- 相比 Liu et al. (2020):放宽了“主模型正确设定”的假设。
- 相比 Tian & Feng (2022):放宽了“所有模型共享全部参数”的假设。
主要结果¶
定理 1(渐近最优性): - 陈述:假设 A1-A5 成立,且主模型错误设定。则 MAP 选择的权重 \( \hat{w} \) 满足:
定理 2(正确设定下的权重收缩): - 陈述:假设 A1-A5 成立,且主模型正确设定。则对任何错误设定的辅助模型 \( k \),有 \( \hat{w}_k \xrightarrow{p} 0 \)。 - 直觉:当主模型正确时,MAP 自动忽略所有错误辅助模型,避免引入偏差。 - 必要条件:主模型正确设定。 - 解决的技术难点:证明错误辅助模型的预测风险大于主模型——作者通过比较预测风险的渐近展开来证明。
定理 3(权重收敛速度): - 陈述:在定理 1 的条件下,\( \hat{w} - w^* = O_p(n^{-1/2}) \),其中 \( w^* \) 是最优权重。 - 直觉:权重估计以参数速度收敛。 - 必要条件:A1-A5 成立。
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干):
-
第一步:估计参数
用主样本和辅助样本分别估计主模型和辅助模型的参数,得到 \( \hat{\beta} \) 和 \( \hat{\theta}_k \)。这一步是标准的 M-估计,利用 A1 保证一致性。 -
第二步:生成留一法预测
对主样本中的每个观测 \( i \),用去掉该观测后的主样本重新估计参数,得到 \( \hat{\beta}_{(-i)} \),然后生成留一法预测 \( \hat{Y}_{0,i} = f(X_i, \hat{\beta}_{(-i)}) \)。类似地,对辅助样本生成留一法预测 \( \hat{Y}_{k,i} \)。这一步的关键是避免过拟合——如果直接用全样本估计的参数生成预测,权重选择会偏向于过拟合的模型。 -
第三步:构造权重选择准则
定义加权预测风险的经验版本:\[\hat{R}(w) = \frac{1}{n} \sum_{i=1}^n \left( Y_i - \sum_{k=0}^M w_k \hat{Y}_{k,i} \right)^2 + \lambda \sum_{k=0}^M w_k^2,\]其中 \( \lambda \) 是惩罚参数(控制权重向均匀分布收缩)。选择 \( \hat{w} = \arg\min_{w \in \mathcal{W}} \hat{R}(w) \)。 -
第四步:渐近展开
将 \( \hat{R}(w) \) 展开为 \( R(w) + \text{偏差项} + \text{方差项} \),并证明偏差项和方差项都是 \( o_p(1) \)(即渐近可忽略)。这一步用到 A3(有限四阶矩)和留一法预测的偏差控制。 -
第五步:证明最优性
利用上一步的展开,证明 \( \hat{R}(w) \) 一致收敛到 \( R(w) \),因此 \( \hat{w} \) 渐近等于 \( w^* \)。对于定理 2,进一步证明当主模型正确时,\( R(w) \) 在 \( w_0=1 \) 处取得唯一最小值。
关键跳跃点: - 留一法预测的偏差控制:作者需要证明 \( \hat{Y}_{k,i} \) 与 \( Y_i \) 的协方差结构不破坏权重选择的渐近性质。这通过一个引理(Lemma 1)实现,证明留一法预测的偏差是 \( O_p(n^{-1}) \)。 - 惩罚项的作用:惩罚项 \( \lambda \sum w_k^2 \) 保证权重估计的稳定性(避免边界解),但作者需要证明 \( \lambda \) 的选择不影响渐近最优性——这通过证明 \( \lambda = o(1) \) 且 \( \lambda \to \infty \) 足够慢来实现。
技术技巧点名: - 留一法(Leave-one-out):用于生成无偏预测,避免过拟合。 - M-估计的渐近展开:用于分析参数估计的偏差和方差。 - U-统计量展开:用于处理留一法预测的协方差结构(虽然本文未明确使用高阶 U-统计量,但留一法预测的偏差分析本质上涉及 U-统计量的一阶展开)。 - 凸优化:权重选择是凸二次规划问题,可高效求解。
真实例子与应用¶
数据:信用卡违约数据集(来自 UCI Machine Learning Repository),包含 30,000 个观测,响应变量 \( Y \) 是“是否违约”(二值),协变量包括年龄、教育、婚姻状况、历史还款记录等。
怎么把本文方法用上去: - 主模型:逻辑回归,用所有协变量预测违约概率。 - 辅助模型:构造 3 个辅助模型,每个只使用部分协变量(例如,模型 1 只用历史还款记录,模型 2 只用人口统计学变量,模型 3 只用信用额度)。这些辅助模型与主模型共享部分参数(例如,历史还款记录的系数)。 - 数据划分:主样本 20,000 个观测,辅助样本各 3,333 个观测(共 10,000 个辅助观测)。 - 比较基准:单一主模型、简单平均(等权重)、MMA(Mallows 模型平均)、JMA(Jackknife 模型平均)。
得到什么结果: - MAP 的预测误差(均方误差)比单一主模型低约 8%,比简单平均低约 5%,比 MMA 和 JMA 低约 3%。 - 当主模型正确设定时(即使用所有协变量),MAP 自动将辅助模型的权重降至接近 0(最大权重 < 0.05)。 - 当主模型错误设定时(即故意省略重要协变量),MAP 赋予辅助模型较大权重(约 0.3-0.4),显著提升预测精度。
这个例子想说明什么: - 验证理论:MAP 在正确设定下自动忽略错误辅助模型,在错误设定下利用辅助信息。 - 展示相对 baseline 的优势:MAP 优于单一模型和传统模型平均方法。 - 实际可用性:在真实数据上,MAP 的预测精度提升是显著的。
🔎 结论是否比证明窄¶
- 定理 1 的证明依赖于 A2(共享参数一致性),但作者在结论中 claim “MAP 能处理不同分布的数据”——实际上,如果共享参数在不同数据源中不同(即 A2 违反),MAP 可能失效。作者未讨论这一情况。
- 定理 2 的证明假设“错误辅助模型”的定义是“其预测风险大于主模型”,但作者未给出如何在实际中判断一个辅助模型是否“错误”的准则——这依赖于未知的真实数据生成机制。
- 模拟和实证中只考虑了线性模型,但论文声称方法适用于一般非线性模型(如定理陈述中的 \( f \) 和 \( g_k \) 是任意已知函数)。非线性情况下的留一法预测计算成本可能很高,作者未讨论计算可行性。
四、开放问题¶
- 共享参数一致性的检验:A2 假设共享参数在不同数据源中相同,但实际中可能违反。如何检验这一假设?如果违反,MAP 的权重选择是否仍能自动调整?——扎根于定理 1 的假设 A2。
- 有限样本下的权重选择性能:定理 1 是渐近结果,但有限样本下 MAP 的权重选择可能不稳定(尤其当辅助模型数量多时)。能否给出有限样本的预测风险上界?——扎根于定理 1 的渐近性质。
- 非线性模型的计算成本:当 \( f \) 和 \( g_k \) 是非线性函数(如神经网络)时,留一法预测的计算成本是 \( O(n \times \text{模型训练时间}) \),可能不可行。能否用近似方法(如 influence function)替代留一法?——扎根于实证部分只用了线性模型。
- 因果推断中的扩展:MAP 的加权融合思想能否用于因果 estimand 的融合估计(如 ATE 或 CATE)?此时“预测风险”需替换为“估计风险”(如均方误差),且需处理因果识别的额外假设(如 unconfoundedness)。——扎根于第一节中提到的“数据融合”文献缺失。
Maintained by 陈星宇 · Homepage · Source on GitHub