跳转至

The Anatomy and Boundary of Adaptation under Temporal Tabular Shift

作者: Tianyu Wang, Xi Vincent Wang, Lihui Wang, Mian Li, Zhihao Liu
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2609.12136


一、领域脉络与小综述

这个方向是什么

本文研究的根本问题是:在时间序列中部署一个冻结的表格基础模型(frozen tabular foundation model)时,随着世界漂移(temporal drift),模型性能会下降。操作者必须决定是否在线自适应(prequential adaptation,即每次预测后标签才揭示,利用严格过去的标签进行修正)。然而,自适应有时帮助、有时伤害,且现有方法排名无法预测何时发生。本文的核心问题是:冻结模型在时间表格漂移下的退化中,有多少是可纠正的?从什么信息中纠正?代价是什么? 该方向当前成熟度:实证上已有大量TTA方法,但缺乏对“可纠正性”的理论边界分析;理论上,分布漂移的经典bound(如Ben-David et al. 2010a)和协变量漂移校正(Shimodaira 2000)均假设条件不变或仅控制协变量漂移,而概念漂移(p(y|x)变化)下的识别问题未被充分处理。本文引入部分识别(partial identification)框架,将问题从“估计漂移”转向“识别漂移的不可识别性”。

发展脉络(history)

  • 奠基工作:Manski (2003) 建立了部分识别程序,报告与可观测数据和假设一致的参数值集,而非强制点识别。Molinari (2020) 综述了其发展。本文的“wall”概念直接源自Manski的识别集,但适应于冻结表示和时间漂移窗口。
  • 主要进展:
  • 领域自适应理论:Ben-David et al. (2010a,b) 给出了无监督域自适应的不可能性定理,但未量化剩余模糊性。Ben-David and Urner (2012) 量化了无目标标签时的硬度。本文的Theorem 6.2则精确给出了识别集直径(wall),且证明无标签数据无法缩小它。
  • 标签漂移:Lipton et al. (2018) 和 Garg et al. (2020) 从黑箱预测器的混淆矩阵中恢复漂移的标签边缘。本文将其作为两个“崩溃类”之一(Theorem 6.3),即当漂移属于标签漂移类时,识别集坍缩为单点。
  • 表示级限制:Zhao et al. (2019) 和 Johansson et al. (2019) 给出了不变表示的信息论下界。本文的Wall B(Theorem 6.4)形式化了冻结表示丢弃的信息,并证明其与Wall A正交。
  • 半参数效率与非光滑泛函:Chernozhukov et al. (2018) 和 Kennedy (2024) 的DML框架用于学习wall的速率。Lepski et al. (1999) 和 Cai and Low (2011) 的非光滑泛函下界用于低于阈值的情况。Tsybakov (2004) 的边际条件(margin condition)被用于阈值γ* = d0/(2αs)。
  • 当前frontier:本文处于将部分识别与时间漂移下的自适应边界结合的前沿。它区分了两种正交的障碍(识别墙和表示墙),并给出了从带标签历史学习识别墙的阈值和速率。
  • 本文的位置:作者将缺口frame为“识别问题而非估计问题”——现有方法排名假设漂移是可纠正的,而本文问的是“多少是可纠正的”。他们淡化算法比较,强调部分识别框架下的不可约性。

子线索聚类

  1. 实证TTA方法:Sun et al. (2020), Wang et al. (2021, 2022), Zhao et al. (2023) 等,主要是视觉中心的经验研究,缺乏对可纠正性的理论分析。本文的Part I提供了诊断分类学,Part II则从理论上解释为何可纠正信号可能很小。
  2. 分布漂移理论:Ben-David et al. (2010a,b), Mansour et al. (2009) 等,通过可计算散度控制目标风险,但概念漂移出现在无标签数据无法确定的项中。本文的Theorem 6.2直接证明在agnostic TV漂移类中,无标签数据无法缩小识别集。
  3. 部分识别与标签漂移:Manski (2003), Molinari (2020), Lipton et al. (2018), Garg et al. (2020)。本文的wall是Manski识别集直径的适应,标签漂移作为崩溃类。
  4. 表示级限制:Zhao et al. (2019), Johansson et al. (2019)。本文的Wall B形式化了表示丢弃的信息,并证明其与Wall A正交。
  5. 半参数效率与非光滑泛函:Chernozhukov et al. (2018), Cai and Low (2011), Tsybakov (2004)。本文的阈值γ* = d0/(2αs) 来自边际条件,正则分支的√N速率来自DML,非正则分支的下界来自Cai-Low构造。

核心问题与已知瓶颈

  • 核心问题:(1) 在无标签数据下,目标条件分布能被识别到什么程度?(2) 从带标签历史中学习识别墙的速率是多少?(3) 两个正交的障碍(识别墙和表示墙)如何分离?
  • 已知瓶颈:现有方法排名无法预测何时自适应会伤害;经典域自适应理论无法处理概念漂移;无标签数据无法确定条件漂移;表示维度d0和漂移光滑度αs共同决定阈值。

⚠️ 作者的framing

作者将缺口frame成:“方法排名预设漂移是可纠正的,而本文问的是多少是可纠正的,从什么信息,以什么代价。” 他们淡化竞争路线(如算法比较、经验TTA),强调部分识别框架下的不可约性。他们回避了“如何设计更好的自适应算法”这一常见问题,而是专注于“信息极限”。明显该被引但未出现在intro中的工作:例如,关于时间序列中概念漂移检测的经典文献(如Gama et al. 2014)虽在Section 2提及,但未深入讨论其与识别问题的关系;另外,关于“可识别性”在因果推断中的更广泛文献(如Pearl的do-calculus)未被引用,但本文的框架更接近Manski的部分识别而非结构因果模型。值得研究者去查:是否有其他工作将部分识别直接应用于时间漂移下的预测模型?Kong et al. (2022) 被引用,但他们的目标是确定目标联合分布,而本文研究识别集的直径。

张力

未见明显对立引用。各子线索之间互补而非矛盾:实证TTA提供现象,分布漂移理论提供bound,部分识别提供框架,半参数效率提供速率。作者将不同线索整合为统一的“wall”概念。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(X\):协变量空间(Polish空间),\(Y\):标签空间(二元{0,1}或实数)。 - \(\phi: X \to \mathbb{R}^D\):冻结的嵌入函数(\(D=192\)),\(h_0\):冻结的读出函数,定义源条件分布 \(p_0(\cdot|x) = h_0(\phi(x))\),均值 \(\eta_0(x) = p_0(1|x)\)。 - \(p_W\):窗口\(W\)的协变量分布(可观测)。\(\eta_W(x) = \mathbb{E}_{p_W}[y|x]\):目标条件均值(不可观测)。 - \(\beta: X \to [0,1]\):漂移预算(prior),假设 \(p_W(\cdot|x) \in B_{\beta(x)} = \{q: D_{TV}(q, p_0(\cdot|x)) \leq \beta(x)\}\)。 - 识别集 \(I(\beta) = \{q: q(\cdot|x) \in B_{\beta(x)} \text{ for all } x\}\)。 - 墙(wall)\(D_\Delta(\beta; R) = \sup_{q,q' \in I(\beta)} \mathbb{E}_{x \sim p_W(\cdot|R)}[\Delta(f_q(x), f_{q'}(x))]\),其中\(\Delta\)是某种差异度量(如均值差、决策翻转)。 - 在二元情形下,均值差异的墙:\(D_{\text{mean}}(\beta; R) = \mathbb{E}_{p_W(\cdot|R)}[w_\beta]\),其中 \(w_\beta(x) = \min(1, \eta_0(x)+\beta(x)) - \max(0, \eta_0(x)-\beta(x))\)。 - 决策翻转墙:\(D_{01}(\beta; R) = \Pr_{p_W(\cdot|R)}[|\eta_0(x) - 1/2| \leq \beta(x)]\)。 - 冻结价格:\(\rho_\beta(x) = 2\max(0, \beta(x) - |\eta_0(x)-1/2|)\)。

模型: - 数据生成:每个窗口\(W\)中,协变量\(x \sim p_W\),标签\(y \sim \text{Bernoulli}(\eta_W(x))\)(分类)或\(y = \eta_W(x) + \epsilon\)(回归)。冻结模型提供\(\eta_0(x)\)。唯一假设是漂移预算\(\beta\):\(\eta_W(x) \in [\max(0, \eta_0(x)-\beta(x)), \min(1, \eta_0(x)+\beta(x))]\)(二元情形)。 - 可观测数据:在无标签阶段,只能观测到协变量\(x\)的样本(i.i.d. from \(p_W\))以及冻结模型\(\phi, h_0\)。标签\(y\)在预测后才揭示,且只能用于严格过去的标签前缀。 - 潜在/不可观测:目标条件均值\(\eta_W(x)\)、漂移的具体形式、识别集内的真实条件。

第二步:最小内核——单窗口的识别集直径与不可约性

最简特例:二元分类,单窗口,无标签数据(\(n=0\)),漂移预算\(\beta(x)\)已知。此时,可观测数据只有协变量分布\(p_W\)(但无标签,所以实际上连\(p_W\)的样本也没有?Theorem 6.2考虑有i.i.d.无标签样本,但结论与样本量无关,所以\(n=0\)也成立)。核心命题:在agnostic TV漂移类中,目标条件均值\(\eta_W\)的识别集直径(wall)等于\(\mathbb{E}_{p_W}[w_\beta]\),且任何无标签统计量都无法缩小它,风险常数与样本量无关。

具体推导: - 对于每个\(x\),由于\(D_{TV}(q, p_0) = |\eta_q - \eta_0|\)(二元情形),预算球\(B_{\beta(x)} = [\eta_0(x)-\beta(x), \eta_0(x)+\beta(x)]\)截断到[0,1]。所以\(\eta_W(x)\)可以取该区间内的任何值。 - 识别集\(I(\beta)\)包含所有满足\(\eta_q(x) \in [\eta_-(x), \eta_+(x)]\)的条件分布,其中\(\eta_- = \max(0, \eta_0-\beta)\),\(\eta_+ = \min(1, \eta_0+\beta)\)。区间宽度\(w_\beta = \eta_+ - \eta_-\)。 - 均值差异墙:\(D_{\text{mean}}(\beta; R) = \mathbb{E}_{p_W(\cdot|R)}[w_\beta]\),由端点对\((\eta_-, \eta_+)\)达到。 - 不可约性(Theorem 6.2):考虑两个世界\(P_-\)和\(P_+\),分别对应条件均值\(\eta_-\)和\(\eta_+\)。它们的联合分布为\(p_W \otimes q_-\)和\(p_W \otimes q_+\)。无标签样本的观测分布都是\(p_W^{\otimes n}\)(因为标签从未被观测),所以两个世界在观测上不可区分(\(D_{TV}=0\))。Le Cam两点引理给出:任何随机化估计量\(\hat{\theta}_n\)(估计区域均值\(\theta(P) = \mathbb{E}_{p_W(\cdot|R)}[\eta_q]\))的极大风险至少为\(\frac{1}{2}|\theta(P_+) - \theta(P_-)| = \frac{1}{2} \mathbb{E}[w_\beta]\),且这个下界与\(n\)无关。上界由零数据中点估计量达到。因此,墙的高度完全由先验\((\beta, p_0, p_W)\)决定,无标签数据无法提供任何信息。

这个最小内核揭示了整篇论文的核心思想:在无标签信息状态下,条件漂移的识别集直径是一个假设(prior),而非测量。任何声称“无标签数据检测到小漂移”的监测器实际上是在报告所选的先验。这个不可约性定理(Theorem 6.2)是Part II所有边界结果的基础。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在时间表格漂移下,冻结基础模型的预序自适应(prequential adaptation)中,可纠正信号的来源和极限是什么?具体地,将观测到的增益分解为四种机制(全局去偏、新鲜度、局部重估计、排名重校准),并证明在agnostic TV漂移类中,目标条件分布仅能被部分识别,其识别集直径(wall)无法被无标签数据缩小。
  2. 核心工具/方法:部分识别(Manski框架)、Le Cam两点论证、半参数效率理论(DML)、边际条件(Tsybakov margin)、非光滑泛函下界(Cai-Low构造)、以及嵌入空间的几何分析(intrinsic dimension, Hölder smoothness)。
  3. 主要结论:识别墙(Wall A)的直径等于平均预算的期望,且不可约;表示墙(Wall B)是冻结表示丢弃的信息,与Wall A正交;从带标签历史学习Wall A的速率存在阈值\(\gamma^* = d_0/(2\alpha_s)\):当\(\gamma > \gamma^*\)时,可以\(\sqrt{N}\)速率估计;当\(\gamma=0\)时,下界条件依赖于一个开放的affinity估计;在八个工业流上,代理指标落在困难一侧。

关键设定与假设

  • 单窗口设定(Sections 6.1-6.2):Polish协变量空间,Borel核和预算,i.i.d.无标签样本,机制先验(B)(预算为唯一约束,无跨协变量耦合)。
  • 多窗口学习墙(Section 6.4):额外假设(A0)-(A7),包括:
  • (A0) 窗口和锚点:K个窗口,每个窗口有\(m_j\)个无标签i.i.d.样本和\(k_j \geq k_{\min}\)个MCAR锚点标签。
  • (A1) 响应曲线平稳性:存在函数\(\Psi\)使得\(\mathbb{E}[\bar{b}_j | r_j = r] = \Psi(r)\)对所有窗口成立。
  • (A2) 支持/相关性:锚点加权混合新奇律\(\bar{\mu}\)在区间\(J\)上有正密度。
  • (A3) 光滑度和内在维度:每个\(\eta_j\)在\(\phi\)坐标下是\((L, \alpha_s)\)-Hölder的,且支撑的加倍内在维度\(\leq d\)。
  • (A4) 形状:\(\Psi\)非递减、Lipschitz、范围\(\leq 1\)。
  • (A5) 比率误差:无标签比率估计的sup误差有界。
  • (A5') 比率误差的外生性:漂移噪声\(\xi = \bar{b} - \Psi(r)\)满足\(\mathbb{E}[\xi | r, \hat{r}] = 0\)。
  • (A6) 新奇覆盖:新窗口的新奇律\(\nu\)相对于\(\bar{\mu}\)有界。
  • (A7) 密度上界。
  • (T) 横截性:\(\bar{P}(\bar{\eta}_J(X) = \eta_0(X)) = 0\)。
  • (Mgn\(\gamma\)) 边际:\(\bar{P}(0 < |\bar{\eta}_J - \eta_0| \leq t) \lesssim t^\gamma\)。
  • 相比已有文献:放宽了条件不变假设(允许概念漂移),但引入了预算先验和边际条件。与经典域自适应理论相比,本文不假设条件不变,而是用TV预算约束漂移。

主要结果

  • Theorem 6.1(精确约化):在单窗口正则条件下,点态直径\(\delta^\Delta_\beta(x)\)可测,且\(D^\Delta(\beta; R) = \mathbb{E}_{p_W(\cdot|R)}[\delta^\Delta_\beta(x)]\)。在二元均值差异下,\(D_{\text{mean}}(\beta; R) = \mathbb{E}[w_\beta] = 2\mathbb{E}[\beta] - c(\beta; R)\),其中\(c\)是剪辑项。决策翻转直径\(D_{01}(\beta; R) = \Pr[|\eta_0 - 1/2| \leq \beta]\)。
  • Theorem 6.2(无标签不可约性):在机制先验(B)下,对于任何\(n\)(包括无穷),区域均值泛函的minimax风险为\(\frac{1}{2} D_{\text{mean}}(\beta; R)\),常数与\(n\)无关。任何检验的势等于大小,任何置信集的期望直径至少为\((1-2\alpha)D_{\text{mean}}\)。
  • Theorem 6.3(规范崩溃类):(i) 协变量漂移:识别集坍缩为单点\(\{p_0\}\),墙为零。(ii) 标签漂移:在已知类条件且线性独立时,目标先验可从无标签数据以\(\sqrt{n}\)速率识别,墙为零。
  • Theorem 6.4(Wall B与正交性):Wall B = \(\mathbb{E}[\text{Var}(\eta_W | \mathcal{F}_\phi)]\),表示冻结表示丢弃的信息。任何部署预测器的超额风险可分解为Wall B + 可达到误差,且Wall A完全在\(\mathcal{F}_\phi\)中,两者在\(L^2\)投影几何中正交。
  • Theorem 6.5(借用确定性):在冻结读出上,部署的Wall A等于纤维平均的\(w_\beta\);在纤维并集上等于原始墙;在子纤维区域上存在符号差距。
  • Theorem 6.6(边际边界的正则分支):当\(\gamma > \gamma^* = d_0/(2\alpha_s)\)时,覆盖部分墙\(D_{\text{cov}}\)可被\(\sqrt{N}\)-正则估计,渐近方差为\(V = 4\mathbb{E}_{\bar{\mu}}[w^2\sigma_b^2] + 4\tau_{\text{NT}} \text{Var}_\nu(\Psi)\),且无正则估计量能改进速率。
  • Proposition 6.7(固定K下界,\(\gamma=0\),条件于gap (2c)):\(\inf_{\hat{\theta}} \sup \mathbb{E}|\hat{\theta} - \theta| \gtrsim (N/K)^{-a}/\sqrt{K}\)(对数因子),意味着非正则性。
  • Proposition 6.8(增长K速率,\(\gamma=0\),条件于gap (2c)):minimax速率为\((N/K)^{-a}\)(对数因子),独立窗口平均不改善最坏情况速率。

证明路线与技术技巧

Theorem 6.2(不可约性)的证明路线: 1. 构造世界:对每个\(x\),定义\(\eta_- = \max(0, \eta_0-\beta)\),\(\eta_+ = \min(1, \eta_0+\beta)\),它们定义了两个Markov核\(q_-\)和\(q_+\),均在预算球内。 2. 辅助性:无标签样本的观测分布为\(p_W^{\otimes n}\),与\(q\)无关(因为标签从未被观测)。因此两个世界\(P_- = p_W \otimes q_-\)和\(P_+ = p_W \otimes q_+\)在观测上不可区分(\(D_{TV}=0\))。 3. Le Cam两点下界:任何随机化估计量\(\hat{\theta}_n\)的极大风险至少为\(\frac{1}{2}|\theta(P_+) - \theta(P_-)|(1 - D_{TV}) = \frac{1}{2}\mathbb{E}[w_\beta]\)。 4. 上界:零数据中点估计量\(\hat{\theta}_* = \mathbb{E}[(\eta_- + \eta_+)/2]\)达到该风险。 5. 推论:检验的势等于大小,置信集直径下界。

技术技巧:Le Cam两点方法、辅助性论证、Kuratowski–Ryll-Nardzewski选择定理(用于一般差异度量)。

Theorem 6.6(正则分支)的证明路线: 1. 符号恢复:利用Stage-1 sup-norm估计\(\hat{\eta}_J\),在事件\(\|\hat{\eta}_J - \bar{\eta}_J\|_\infty \leq \varepsilon_1\)上,符号翻转仅当\(0 < b \leq \varepsilon_1\)。在边际条件(Mgn\(\gamma\))下,加权符号误差\(\mathbb{E}[b \mathbf{1}_{\hat{s} \neq s}] \leq C \varepsilon_1^{1+\gamma}\)。 2. 阈值计算:\(\varepsilon_1 \asymp k^{-a}\),其中\(a = \alpha_s/(2\alpha_s + d_0)\),\(k = N/K\)。要求\(\varepsilon_1^{1+\gamma} = o(N^{-1/2})\)给出\(\gamma > \gamma^* = d_0/(2\alpha_s)\)。 3. 一步估计量分解:\(\hat{D}_{\text{cov}} - D_{\text{cov}} = 2[(\nu_m - \nu)\hat{\Psi} + (\bar{P}_N - \bar{P})(\hat{w}(\hat{b}_{\text{obs}} - \hat{\Psi}))] + 2R_2\),其中\(R_2\)包含乘积余项、比率余项和符号Stage-1余项。 4. Neyman正交性:乘积余项\(R_{\text{prod}} = \int (\hat{\Psi} - \Psi)(w - \hat{w}) d\bar{\mu}\)是双稳健的,在\(\|\hat{\Psi} - \Psi\|_{L^2} \|\hat{w} - w\|_{L^2} = o_P(N^{-1/2})\)下可忽略。 5. CLT:交叉拟合替代Donsker条件,Lindeberg-Feller给出渐近正态性,方差由EIF的方差给出。 6. 效率下界:Hájek-Le Cam卷积定理给出正则估计量的方差下界。

技术技巧:DML2(交叉拟合)、Efficient Influence Function、Neyman正交性、边际条件与符号恢复、Cai-Low多项式逼近(用于下界)、Le Cam两点方法(用于非正则分支)。

真实例子与应用

  • 八个TabReD工业流(Section 4, Table 1):展示了四种增益机制的分解。例如,delivery-eta上93%的增益来自运行均值(C1),weather上主导机制是局部重估计(C3),homecredit-default上自适应造成伤害(-2.28 AUC点)。
  • 半合成数据(Section 6.6):控制\(d_0, \alpha_s, \gamma\),验证阈值机制。四个臂分别改变一个参数跨过\(\gamma^*\),结果:高于阈值的臂斜率接近-1/2(正则),低于阈值的臂斜率远离-1/2(偏置主导)。
  • 23个数据集的代理估计与敏感性分析(Section 6.5, Figure 5):TabReD流提供噪声代理,15个额外基准在\((\alpha_s, \gamma) = (1,1)\)下进行敏感性分析。所有点落在困难侧(\(\gamma < \gamma^*\)),但未建立总体相位定律。

🔎 结论是否比证明窄

  • Theorem 6.6的结论(\(\sqrt{N}\)正则性)依赖于假设(H6)(sup-norm密度比率速率),而该假设从原始假设的推导是“graded partial”(部分完成)。因此,定理证明的是“如果(H6成立,则结论成立”,但(H6)本身是否可从(A0)-(A7)推导出来尚未完全解决。
  • 下界Proposition 6.7和6.8条件于gap (2c)(一个开放的affinity估计),因此这些下界是条件性的,并非无条件定理。
  • 论文在Section 6.4末尾明确标注了每个声明的状态(proven, partial, conditional, cited-standard, conjecture),例如Theorem 6.6的CLT继承Section G的“partial”资格,而Proposition 6.7是“conditional on gap (2c)”。

四、开放问题(点到为止,扎根具体语句)

  1. gap (2c)的解决:Proposition 6.7和6.8的下界依赖于一个开放的affinity估计(gap (2c)),即Appendix K中排列混合affinity的定量重求和估计。论文指出“its band structure and first band are proven, and exact-rational enumeration supports the general estimate, which remains open”(Section 6.4)。解决此gap将完成\(\gamma=0\)时的下界证明。

  2. 正边际子阈值区域(\(0 < \gamma < \gamma^*\))的适应:论文在Section 6.4末尾指出“the margin adaptation for \(0 < \gamma < \gamma^*\) remains open”(Remark H.8(iv))。目前只有\(\gamma=0\)的条件性下界和\(\gamma > \gamma^*\)的正则上界,中间区域既无上界也无下界。

  3. 排名货币的墙理论:论文的墙理论是在条件均值货币(proper-loss, conditional-mean)下陈述的,而排名(AUC)落在范围之外。Section 8指出“a ranking-currency analogue of the wall theory itself remains open”。对于分类部署,排名增益(C4)无法被平方误差天花板捕捉,因此需要一个排名货币下的识别理论。

  4. 模式与语义漂移:论文在Section 8指出“Schema and semantic drift, where the covariate space itself changes, lie outside our formalism altogether, and are in our view the deepest open formal gap in the area.” 当协变量空间本身变化时,当前框架(固定\(\phi\)和\(X\))不适用。

  5. 筛选规则的声音性:Section 7.1的局部修正筛选规则在回顾性评估中未产生错误适应,但论文强调“its soundness can be checked only with labels the deployment lacks, so it must be validated on semi-synthetic controls with matched covariate laws”(Section 8)。因此,在未见流上的声音性尚未建立。

提醒:要确认这些是否为真gap,建议阅读同子领域近期约5篇论文的intro——如果都指向同一问题,则是共识(真gap);如果互相打架,则可能是机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论