The Anatomy and Boundary of Adaptation under Temporal Tabular Shift¶
作者: Tianyu Wang, Xi Vincent Wang, Lihui Wang, Mian Li, Zhihao Liu
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2609.12136
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:在时间序列中部署一个冻结的表格基础模型(frozen tabular foundation model)时,随着世界漂移(temporal drift),模型性能会下降。操作者必须决定是否在线自适应(prequential adaptation,即每次预测后标签才揭示,利用严格过去的标签进行修正)。然而,自适应有时帮助、有时伤害,且现有方法排名无法预测何时发生。本文的核心问题是:冻结模型在时间表格漂移下的退化中,有多少是可纠正的?从什么信息中纠正?代价是什么? 该方向当前成熟度:实证上已有大量TTA方法,但缺乏对“可纠正性”的理论边界分析;理论上,分布漂移的经典bound(如Ben-David et al. 2010a)和协变量漂移校正(Shimodaira 2000)均假设条件不变或仅控制协变量漂移,而概念漂移(p(y|x)变化)下的识别问题未被充分处理。本文引入部分识别(partial identification)框架,将问题从“估计漂移”转向“识别漂移的不可识别性”。
发展脉络(history)¶
- 奠基工作:Manski (2003) 建立了部分识别程序,报告与可观测数据和假设一致的参数值集,而非强制点识别。Molinari (2020) 综述了其发展。本文的“wall”概念直接源自Manski的识别集,但适应于冻结表示和时间漂移窗口。
- 主要进展:
- 领域自适应理论:Ben-David et al. (2010a,b) 给出了无监督域自适应的不可能性定理,但未量化剩余模糊性。Ben-David and Urner (2012) 量化了无目标标签时的硬度。本文的Theorem 6.2则精确给出了识别集直径(wall),且证明无标签数据无法缩小它。
- 标签漂移:Lipton et al. (2018) 和 Garg et al. (2020) 从黑箱预测器的混淆矩阵中恢复漂移的标签边缘。本文将其作为两个“崩溃类”之一(Theorem 6.3),即当漂移属于标签漂移类时,识别集坍缩为单点。
- 表示级限制:Zhao et al. (2019) 和 Johansson et al. (2019) 给出了不变表示的信息论下界。本文的Wall B(Theorem 6.4)形式化了冻结表示丢弃的信息,并证明其与Wall A正交。
- 半参数效率与非光滑泛函:Chernozhukov et al. (2018) 和 Kennedy (2024) 的DML框架用于学习wall的速率。Lepski et al. (1999) 和 Cai and Low (2011) 的非光滑泛函下界用于低于阈值的情况。Tsybakov (2004) 的边际条件(margin condition)被用于阈值γ* = d0/(2αs)。
- 当前frontier:本文处于将部分识别与时间漂移下的自适应边界结合的前沿。它区分了两种正交的障碍(识别墙和表示墙),并给出了从带标签历史学习识别墙的阈值和速率。
- 本文的位置:作者将缺口frame为“识别问题而非估计问题”——现有方法排名假设漂移是可纠正的,而本文问的是“多少是可纠正的”。他们淡化算法比较,强调部分识别框架下的不可约性。
子线索聚类¶
- 实证TTA方法:Sun et al. (2020), Wang et al. (2021, 2022), Zhao et al. (2023) 等,主要是视觉中心的经验研究,缺乏对可纠正性的理论分析。本文的Part I提供了诊断分类学,Part II则从理论上解释为何可纠正信号可能很小。
- 分布漂移理论:Ben-David et al. (2010a,b), Mansour et al. (2009) 等,通过可计算散度控制目标风险,但概念漂移出现在无标签数据无法确定的项中。本文的Theorem 6.2直接证明在agnostic TV漂移类中,无标签数据无法缩小识别集。
- 部分识别与标签漂移:Manski (2003), Molinari (2020), Lipton et al. (2018), Garg et al. (2020)。本文的wall是Manski识别集直径的适应,标签漂移作为崩溃类。
- 表示级限制:Zhao et al. (2019), Johansson et al. (2019)。本文的Wall B形式化了表示丢弃的信息,并证明其与Wall A正交。
- 半参数效率与非光滑泛函:Chernozhukov et al. (2018), Cai and Low (2011), Tsybakov (2004)。本文的阈值γ* = d0/(2αs) 来自边际条件,正则分支的√N速率来自DML,非正则分支的下界来自Cai-Low构造。
核心问题与已知瓶颈¶
- 核心问题:(1) 在无标签数据下,目标条件分布能被识别到什么程度?(2) 从带标签历史中学习识别墙的速率是多少?(3) 两个正交的障碍(识别墙和表示墙)如何分离?
- 已知瓶颈:现有方法排名无法预测何时自适应会伤害;经典域自适应理论无法处理概念漂移;无标签数据无法确定条件漂移;表示维度d0和漂移光滑度αs共同决定阈值。
⚠️ 作者的framing¶
作者将缺口frame成:“方法排名预设漂移是可纠正的,而本文问的是多少是可纠正的,从什么信息,以什么代价。” 他们淡化竞争路线(如算法比较、经验TTA),强调部分识别框架下的不可约性。他们回避了“如何设计更好的自适应算法”这一常见问题,而是专注于“信息极限”。明显该被引但未出现在intro中的工作:例如,关于时间序列中概念漂移检测的经典文献(如Gama et al. 2014)虽在Section 2提及,但未深入讨论其与识别问题的关系;另外,关于“可识别性”在因果推断中的更广泛文献(如Pearl的do-calculus)未被引用,但本文的框架更接近Manski的部分识别而非结构因果模型。值得研究者去查:是否有其他工作将部分识别直接应用于时间漂移下的预测模型?Kong et al. (2022) 被引用,但他们的目标是确定目标联合分布,而本文研究识别集的直径。
张力¶
未见明显对立引用。各子线索之间互补而非矛盾:实证TTA提供现象,分布漂移理论提供bound,部分识别提供框架,半参数效率提供速率。作者将不同线索整合为统一的“wall”概念。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(X\):协变量空间(Polish空间),\(Y\):标签空间(二元{0,1}或实数)。 - \(\phi: X \to \mathbb{R}^D\):冻结的嵌入函数(\(D=192\)),\(h_0\):冻结的读出函数,定义源条件分布 \(p_0(\cdot|x) = h_0(\phi(x))\),均值 \(\eta_0(x) = p_0(1|x)\)。 - \(p_W\):窗口\(W\)的协变量分布(可观测)。\(\eta_W(x) = \mathbb{E}_{p_W}[y|x]\):目标条件均值(不可观测)。 - \(\beta: X \to [0,1]\):漂移预算(prior),假设 \(p_W(\cdot|x) \in B_{\beta(x)} = \{q: D_{TV}(q, p_0(\cdot|x)) \leq \beta(x)\}\)。 - 识别集 \(I(\beta) = \{q: q(\cdot|x) \in B_{\beta(x)} \text{ for all } x\}\)。 - 墙(wall)\(D_\Delta(\beta; R) = \sup_{q,q' \in I(\beta)} \mathbb{E}_{x \sim p_W(\cdot|R)}[\Delta(f_q(x), f_{q'}(x))]\),其中\(\Delta\)是某种差异度量(如均值差、决策翻转)。 - 在二元情形下,均值差异的墙:\(D_{\text{mean}}(\beta; R) = \mathbb{E}_{p_W(\cdot|R)}[w_\beta]\),其中 \(w_\beta(x) = \min(1, \eta_0(x)+\beta(x)) - \max(0, \eta_0(x)-\beta(x))\)。 - 决策翻转墙:\(D_{01}(\beta; R) = \Pr_{p_W(\cdot|R)}[|\eta_0(x) - 1/2| \leq \beta(x)]\)。 - 冻结价格:\(\rho_\beta(x) = 2\max(0, \beta(x) - |\eta_0(x)-1/2|)\)。
模型: - 数据生成:每个窗口\(W\)中,协变量\(x \sim p_W\),标签\(y \sim \text{Bernoulli}(\eta_W(x))\)(分类)或\(y = \eta_W(x) + \epsilon\)(回归)。冻结模型提供\(\eta_0(x)\)。唯一假设是漂移预算\(\beta\):\(\eta_W(x) \in [\max(0, \eta_0(x)-\beta(x)), \min(1, \eta_0(x)+\beta(x))]\)(二元情形)。 - 可观测数据:在无标签阶段,只能观测到协变量\(x\)的样本(i.i.d. from \(p_W\))以及冻结模型\(\phi, h_0\)。标签\(y\)在预测后才揭示,且只能用于严格过去的标签前缀。 - 潜在/不可观测:目标条件均值\(\eta_W(x)\)、漂移的具体形式、识别集内的真实条件。
第二步:最小内核——单窗口的识别集直径与不可约性¶
最简特例:二元分类,单窗口,无标签数据(\(n=0\)),漂移预算\(\beta(x)\)已知。此时,可观测数据只有协变量分布\(p_W\)(但无标签,所以实际上连\(p_W\)的样本也没有?Theorem 6.2考虑有i.i.d.无标签样本,但结论与样本量无关,所以\(n=0\)也成立)。核心命题:在agnostic TV漂移类中,目标条件均值\(\eta_W\)的识别集直径(wall)等于\(\mathbb{E}_{p_W}[w_\beta]\),且任何无标签统计量都无法缩小它,风险常数与样本量无关。
具体推导: - 对于每个\(x\),由于\(D_{TV}(q, p_0) = |\eta_q - \eta_0|\)(二元情形),预算球\(B_{\beta(x)} = [\eta_0(x)-\beta(x), \eta_0(x)+\beta(x)]\)截断到[0,1]。所以\(\eta_W(x)\)可以取该区间内的任何值。 - 识别集\(I(\beta)\)包含所有满足\(\eta_q(x) \in [\eta_-(x), \eta_+(x)]\)的条件分布,其中\(\eta_- = \max(0, \eta_0-\beta)\),\(\eta_+ = \min(1, \eta_0+\beta)\)。区间宽度\(w_\beta = \eta_+ - \eta_-\)。 - 均值差异墙:\(D_{\text{mean}}(\beta; R) = \mathbb{E}_{p_W(\cdot|R)}[w_\beta]\),由端点对\((\eta_-, \eta_+)\)达到。 - 不可约性(Theorem 6.2):考虑两个世界\(P_-\)和\(P_+\),分别对应条件均值\(\eta_-\)和\(\eta_+\)。它们的联合分布为\(p_W \otimes q_-\)和\(p_W \otimes q_+\)。无标签样本的观测分布都是\(p_W^{\otimes n}\)(因为标签从未被观测),所以两个世界在观测上不可区分(\(D_{TV}=0\))。Le Cam两点引理给出:任何随机化估计量\(\hat{\theta}_n\)(估计区域均值\(\theta(P) = \mathbb{E}_{p_W(\cdot|R)}[\eta_q]\))的极大风险至少为\(\frac{1}{2}|\theta(P_+) - \theta(P_-)| = \frac{1}{2} \mathbb{E}[w_\beta]\),且这个下界与\(n\)无关。上界由零数据中点估计量达到。因此,墙的高度完全由先验\((\beta, p_0, p_W)\)决定,无标签数据无法提供任何信息。
这个最小内核揭示了整篇论文的核心思想:在无标签信息状态下,条件漂移的识别集直径是一个假设(prior),而非测量。任何声称“无标签数据检测到小漂移”的监测器实际上是在报告所选的先验。这个不可约性定理(Theorem 6.2)是Part II所有边界结果的基础。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在时间表格漂移下,冻结基础模型的预序自适应(prequential adaptation)中,可纠正信号的来源和极限是什么?具体地,将观测到的增益分解为四种机制(全局去偏、新鲜度、局部重估计、排名重校准),并证明在agnostic TV漂移类中,目标条件分布仅能被部分识别,其识别集直径(wall)无法被无标签数据缩小。
- 核心工具/方法:部分识别(Manski框架)、Le Cam两点论证、半参数效率理论(DML)、边际条件(Tsybakov margin)、非光滑泛函下界(Cai-Low构造)、以及嵌入空间的几何分析(intrinsic dimension, Hölder smoothness)。
- 主要结论:识别墙(Wall A)的直径等于平均预算的期望,且不可约;表示墙(Wall B)是冻结表示丢弃的信息,与Wall A正交;从带标签历史学习Wall A的速率存在阈值\(\gamma^* = d_0/(2\alpha_s)\):当\(\gamma > \gamma^*\)时,可以\(\sqrt{N}\)速率估计;当\(\gamma=0\)时,下界条件依赖于一个开放的affinity估计;在八个工业流上,代理指标落在困难一侧。
关键设定与假设¶
- 单窗口设定(Sections 6.1-6.2):Polish协变量空间,Borel核和预算,i.i.d.无标签样本,机制先验(B)(预算为唯一约束,无跨协变量耦合)。
- 多窗口学习墙(Section 6.4):额外假设(A0)-(A7),包括:
- (A0) 窗口和锚点:K个窗口,每个窗口有\(m_j\)个无标签i.i.d.样本和\(k_j \geq k_{\min}\)个MCAR锚点标签。
- (A1) 响应曲线平稳性:存在函数\(\Psi\)使得\(\mathbb{E}[\bar{b}_j | r_j = r] = \Psi(r)\)对所有窗口成立。
- (A2) 支持/相关性:锚点加权混合新奇律\(\bar{\mu}\)在区间\(J\)上有正密度。
- (A3) 光滑度和内在维度:每个\(\eta_j\)在\(\phi\)坐标下是\((L, \alpha_s)\)-Hölder的,且支撑的加倍内在维度\(\leq d\)。
- (A4) 形状:\(\Psi\)非递减、Lipschitz、范围\(\leq 1\)。
- (A5) 比率误差:无标签比率估计的sup误差有界。
- (A5') 比率误差的外生性:漂移噪声\(\xi = \bar{b} - \Psi(r)\)满足\(\mathbb{E}[\xi | r, \hat{r}] = 0\)。
- (A6) 新奇覆盖:新窗口的新奇律\(\nu\)相对于\(\bar{\mu}\)有界。
- (A7) 密度上界。
- (T) 横截性:\(\bar{P}(\bar{\eta}_J(X) = \eta_0(X)) = 0\)。
- (Mgn\(\gamma\)) 边际:\(\bar{P}(0 < |\bar{\eta}_J - \eta_0| \leq t) \lesssim t^\gamma\)。
- 相比已有文献:放宽了条件不变假设(允许概念漂移),但引入了预算先验和边际条件。与经典域自适应理论相比,本文不假设条件不变,而是用TV预算约束漂移。
主要结果¶
- Theorem 6.1(精确约化):在单窗口正则条件下,点态直径\(\delta^\Delta_\beta(x)\)可测,且\(D^\Delta(\beta; R) = \mathbb{E}_{p_W(\cdot|R)}[\delta^\Delta_\beta(x)]\)。在二元均值差异下,\(D_{\text{mean}}(\beta; R) = \mathbb{E}[w_\beta] = 2\mathbb{E}[\beta] - c(\beta; R)\),其中\(c\)是剪辑项。决策翻转直径\(D_{01}(\beta; R) = \Pr[|\eta_0 - 1/2| \leq \beta]\)。
- Theorem 6.2(无标签不可约性):在机制先验(B)下,对于任何\(n\)(包括无穷),区域均值泛函的minimax风险为\(\frac{1}{2} D_{\text{mean}}(\beta; R)\),常数与\(n\)无关。任何检验的势等于大小,任何置信集的期望直径至少为\((1-2\alpha)D_{\text{mean}}\)。
- Theorem 6.3(规范崩溃类):(i) 协变量漂移:识别集坍缩为单点\(\{p_0\}\),墙为零。(ii) 标签漂移:在已知类条件且线性独立时,目标先验可从无标签数据以\(\sqrt{n}\)速率识别,墙为零。
- Theorem 6.4(Wall B与正交性):Wall B = \(\mathbb{E}[\text{Var}(\eta_W | \mathcal{F}_\phi)]\),表示冻结表示丢弃的信息。任何部署预测器的超额风险可分解为Wall B + 可达到误差,且Wall A完全在\(\mathcal{F}_\phi\)中,两者在\(L^2\)投影几何中正交。
- Theorem 6.5(借用确定性):在冻结读出上,部署的Wall A等于纤维平均的\(w_\beta\);在纤维并集上等于原始墙;在子纤维区域上存在符号差距。
- Theorem 6.6(边际边界的正则分支):当\(\gamma > \gamma^* = d_0/(2\alpha_s)\)时,覆盖部分墙\(D_{\text{cov}}\)可被\(\sqrt{N}\)-正则估计,渐近方差为\(V = 4\mathbb{E}_{\bar{\mu}}[w^2\sigma_b^2] + 4\tau_{\text{NT}} \text{Var}_\nu(\Psi)\),且无正则估计量能改进速率。
- Proposition 6.7(固定K下界,\(\gamma=0\),条件于gap (2c)):\(\inf_{\hat{\theta}} \sup \mathbb{E}|\hat{\theta} - \theta| \gtrsim (N/K)^{-a}/\sqrt{K}\)(对数因子),意味着非正则性。
- Proposition 6.8(增长K速率,\(\gamma=0\),条件于gap (2c)):minimax速率为\((N/K)^{-a}\)(对数因子),独立窗口平均不改善最坏情况速率。
证明路线与技术技巧¶
Theorem 6.2(不可约性)的证明路线: 1. 构造世界:对每个\(x\),定义\(\eta_- = \max(0, \eta_0-\beta)\),\(\eta_+ = \min(1, \eta_0+\beta)\),它们定义了两个Markov核\(q_-\)和\(q_+\),均在预算球内。 2. 辅助性:无标签样本的观测分布为\(p_W^{\otimes n}\),与\(q\)无关(因为标签从未被观测)。因此两个世界\(P_- = p_W \otimes q_-\)和\(P_+ = p_W \otimes q_+\)在观测上不可区分(\(D_{TV}=0\))。 3. Le Cam两点下界:任何随机化估计量\(\hat{\theta}_n\)的极大风险至少为\(\frac{1}{2}|\theta(P_+) - \theta(P_-)|(1 - D_{TV}) = \frac{1}{2}\mathbb{E}[w_\beta]\)。 4. 上界:零数据中点估计量\(\hat{\theta}_* = \mathbb{E}[(\eta_- + \eta_+)/2]\)达到该风险。 5. 推论:检验的势等于大小,置信集直径下界。
技术技巧:Le Cam两点方法、辅助性论证、Kuratowski–Ryll-Nardzewski选择定理(用于一般差异度量)。
Theorem 6.6(正则分支)的证明路线: 1. 符号恢复:利用Stage-1 sup-norm估计\(\hat{\eta}_J\),在事件\(\|\hat{\eta}_J - \bar{\eta}_J\|_\infty \leq \varepsilon_1\)上,符号翻转仅当\(0 < b \leq \varepsilon_1\)。在边际条件(Mgn\(\gamma\))下,加权符号误差\(\mathbb{E}[b \mathbf{1}_{\hat{s} \neq s}] \leq C \varepsilon_1^{1+\gamma}\)。 2. 阈值计算:\(\varepsilon_1 \asymp k^{-a}\),其中\(a = \alpha_s/(2\alpha_s + d_0)\),\(k = N/K\)。要求\(\varepsilon_1^{1+\gamma} = o(N^{-1/2})\)给出\(\gamma > \gamma^* = d_0/(2\alpha_s)\)。 3. 一步估计量分解:\(\hat{D}_{\text{cov}} - D_{\text{cov}} = 2[(\nu_m - \nu)\hat{\Psi} + (\bar{P}_N - \bar{P})(\hat{w}(\hat{b}_{\text{obs}} - \hat{\Psi}))] + 2R_2\),其中\(R_2\)包含乘积余项、比率余项和符号Stage-1余项。 4. Neyman正交性:乘积余项\(R_{\text{prod}} = \int (\hat{\Psi} - \Psi)(w - \hat{w}) d\bar{\mu}\)是双稳健的,在\(\|\hat{\Psi} - \Psi\|_{L^2} \|\hat{w} - w\|_{L^2} = o_P(N^{-1/2})\)下可忽略。 5. CLT:交叉拟合替代Donsker条件,Lindeberg-Feller给出渐近正态性,方差由EIF的方差给出。 6. 效率下界:Hájek-Le Cam卷积定理给出正则估计量的方差下界。
技术技巧:DML2(交叉拟合)、Efficient Influence Function、Neyman正交性、边际条件与符号恢复、Cai-Low多项式逼近(用于下界)、Le Cam两点方法(用于非正则分支)。
真实例子与应用¶
- 八个TabReD工业流(Section 4, Table 1):展示了四种增益机制的分解。例如,delivery-eta上93%的增益来自运行均值(C1),weather上主导机制是局部重估计(C3),homecredit-default上自适应造成伤害(-2.28 AUC点)。
- 半合成数据(Section 6.6):控制\(d_0, \alpha_s, \gamma\),验证阈值机制。四个臂分别改变一个参数跨过\(\gamma^*\),结果:高于阈值的臂斜率接近-1/2(正则),低于阈值的臂斜率远离-1/2(偏置主导)。
- 23个数据集的代理估计与敏感性分析(Section 6.5, Figure 5):TabReD流提供噪声代理,15个额外基准在\((\alpha_s, \gamma) = (1,1)\)下进行敏感性分析。所有点落在困难侧(\(\gamma < \gamma^*\)),但未建立总体相位定律。
🔎 结论是否比证明窄¶
- Theorem 6.6的结论(\(\sqrt{N}\)正则性)依赖于假设(H6)(sup-norm密度比率速率),而该假设从原始假设的推导是“graded partial”(部分完成)。因此,定理证明的是“如果(H6成立,则结论成立”,但(H6)本身是否可从(A0)-(A7)推导出来尚未完全解决。
- 下界Proposition 6.7和6.8条件于gap (2c)(一个开放的affinity估计),因此这些下界是条件性的,并非无条件定理。
- 论文在Section 6.4末尾明确标注了每个声明的状态(proven, partial, conditional, cited-standard, conjecture),例如Theorem 6.6的CLT继承Section G的“partial”资格,而Proposition 6.7是“conditional on gap (2c)”。
四、开放问题(点到为止,扎根具体语句)¶
-
gap (2c)的解决:Proposition 6.7和6.8的下界依赖于一个开放的affinity估计(gap (2c)),即Appendix K中排列混合affinity的定量重求和估计。论文指出“its band structure and first band are proven, and exact-rational enumeration supports the general estimate, which remains open”(Section 6.4)。解决此gap将完成\(\gamma=0\)时的下界证明。
-
正边际子阈值区域(\(0 < \gamma < \gamma^*\))的适应:论文在Section 6.4末尾指出“the margin adaptation for \(0 < \gamma < \gamma^*\) remains open”(Remark H.8(iv))。目前只有\(\gamma=0\)的条件性下界和\(\gamma > \gamma^*\)的正则上界,中间区域既无上界也无下界。
-
排名货币的墙理论:论文的墙理论是在条件均值货币(proper-loss, conditional-mean)下陈述的,而排名(AUC)落在范围之外。Section 8指出“a ranking-currency analogue of the wall theory itself remains open”。对于分类部署,排名增益(C4)无法被平方误差天花板捕捉,因此需要一个排名货币下的识别理论。
-
模式与语义漂移:论文在Section 8指出“Schema and semantic drift, where the covariate space itself changes, lie outside our formalism altogether, and are in our view the deepest open formal gap in the area.” 当协变量空间本身变化时,当前框架(固定\(\phi\)和\(X\))不适用。
-
筛选规则的声音性:Section 7.1的局部修正筛选规则在回顾性评估中未产生错误适应,但论文强调“its soundness can be checked only with labels the deployment lacks, so it must be validated on semi-synthetic controls with matched covariate laws”(Section 8)。因此,在未见流上的声音性尚未建立。
提醒:要确认这些是否为真gap,建议阅读同子领域近期约5篇论文的intro——如果都指向同一问题,则是共识(真gap);如果互相打架,则可能是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub