Nonparametric Goodness-of-fit Testing under Covariate Shift¶
作者: Zhen Hou, Dong Xia
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2608.04860
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是协变量偏移下的非参数拟合优度检验。根本的统计问题是:当标记数据(source population, P)与检验目标(target population, Q)的协变量分布不同时,如何基于source数据,对目标分布下的回归函数f是否等于某个候选函数f0进行假设检验。该方向当前处于从“估计”向“推断”过渡的阶段:已有大量工作研究协变量偏移下的估计(如何用source数据无偏/高效地估计目标风险),但不确定性量化*(如何构造置信集、进行假设检验)远未成熟。本文是首批系统处理该推断问题的理论工作之一。
发展脉络¶
-
奠基工作:重要性加权(IW)的提出
- Shimodaira [2000]:在参数似然模型下提出重要性加权,证明密度比ρ(x) = dQ/dP是渐近最优的加权函数。这是IW方法的起点。
- Sugiyama et al. [2007]:提出重要性加权交叉验证(IWCV),指出普通交叉验证在协变量偏移下是有偏的。这推动了模型选择在偏移下的研究。
-
主要进展:非参数估计的理论与算法
- Cortes et al. [2008, 2010]:建立了IW在有限伪维数函数类下的泛化界,将IW理论从参数推广到非参数学习。
- Ma et al. [2023]:这是本文最直接的竞争/前驱工作。作者证明了截断重要性加权核岭回归(IWKRR) 在协变量偏移下达到minimax最优收敛速率。他们发现,截断(truncation)密度比(用min{ρ(x), τ_n}代替ρ(x))可以稳定估计量,在引入可控偏差的同时大幅降低方差。本文的估计器直接继承自Ma et al. [2023]。
- Pathak et al. [2022]:提出了一个新的相似性度量(ball-probability ratio)来刻画协变量偏移,并得到了Hölder连续函数在偏移下的minimax最优率。
- Schmidt-Hieber and Zamolodtchikov [2024]:研究了局部加倍条件下的局部收敛率,与迁移学习相关。
- Wang [2026]:提出了“有效样本量”neff的概念,用于量化source-to-target的兼容性,并研究了伪标签方法。
-
当前Frontier:从估计到推断
- Singh and Vijaykumar [2023]:这是本文在方法论上的核心参照。该工作为无协变量偏移的KRR开发了推断程序(置信集),使用了乘子自助法(multiplier bootstrap)和Gaussian近似。本文的核心技术路线(Bahadur表示 → Gaussian耦合 → 乘子自助法)直接借鉴并推广了该工作。
- Shang et al. [2025]:研究了数据整合下的KRR推断,构建了局部和全局的自助法置信区间。
- Tibshirani et al. [2019], Barber et al. [2023]:开发了协变量偏移下的预测区间(加权共形预测)。这是相关但不同的路线:他们预测的是未来响应Y,而本文推断的是回归函数f*本身。共形预测是分布自由的,而本文需要控制偏差和协方差结构。
-
本文的位置:本文是首次将非参数KRR的推断理论(置信集、假设检验)系统性地推广到协变量偏移设定下。它填补了Ma et al. [2023](估计)和Singh & Vijaykumar [2023](无偏移推断)之间的空白。
子线索聚类¶
- 重要性加权与截断:Shimodaira [2000], Cortes et al. [2008, 2010], Ma et al. [2023], Gogolashvili et al. [2023]。这一簇关注如何通过加权(及截断)来修正分布偏移,以实现无偏或高效估计。
- 非参数推断与自助法:Chernozhukov et al. [2014a,b, 2017], Singh and Vijaykumar [2023], Shang et al. [2025]。这一簇关注如何构造置信集/带,核心工具是Gaussian近似和乘子自助法。
- 协变量偏移下的预测:Tibshirani et al. [2019], Barber et al. [2023]。这一簇关注预测区间,方法上更依赖共形预测,与函数级推断不同。
- 分布偏移的度量:Kpotufe and Martinet [2018](γ-transfer exponent), Pathak et al. [2022](ball-probability ratio), Mansour et al. [2009](discrepancy distance)。这一簇提供不同的工具来量化source和target的相似性,但本文的Assumption 4.4(regularized transfer coverage)是一个更精细的、与核和正则化相关的算子支配条件。
核心问题与瓶颈¶
- 核心问题1:如何将source分布下的估计误差(在RKHS或L2(P)范数下)转化为target分布L2(Q)下的推断误差?这需要一种“转移”条件。
- 核心问题2:当密度比ρ(x)有重尾或无界时,重要性加权估计量的方差会爆炸,如何稳定推断过程?
- 核心问题3:如何校准置信集的半径,使其在target分布下具有正确的覆盖概率?这需要精确的分布近似(Gaussian近似、自助法近似)。
- 当前瓶颈:已有的推断方法(如Singh & Vijaykumar [2023])不处理分布偏移;已有的偏移处理方法(如Ma et al. [2023])只关注估计率,不提供不确定性量化。将两者结合的主要困难在于:IWKRR估计量、推断损失(L2(Q)范数)和关键技术工具(RKHS算子)生活在不同的几何空间中,需要巧妙的算子理论来桥接。
⚠️ 作者的Framing¶
- 作者的缺口frame:作者将缺口frame成“已有工作主要关注估计,而推断(不确定性量化)远未得到理解”。他们把自己的工作定位为“对Ma et al. [2023]的估计工作的自然延伸”,并声称“提供了肯定的答案”。
- 被淡化/回避的竞争路线:
- 共形预测路线(Tibshirani et al. [2019])被明确区分开,作者指出其目标是预测区间而非函数级推断,且是分布自由的。这一定位是合理的,但作者没有讨论在函数级推断问题上,共形预测方法是否可能被改造(例如,对f*的某个泛函进行推断)。
- 直接估计密度比:作者假设密度比ρ(x)是已知的,并在讨论部分承认这可能是限制性的。他们提到了几种估计方法(KLIEP, KMM等),但明确表示“它们对推断的影响尚不清楚且难以刻画”。这实际上回避了一个关键问题:当ρ(x)被估计时,整个推断过程的一阶近似和覆盖保证会如何变化?
- 什么明显该被引/该存在、却没出现在intro里?:这是一个值得研究者去查的问题。例如,是否存在关于“协变量偏移下非参数置信集”的早期或并行工作?作者引用了大量关于“估计”和“无偏移推断”的文献,但可能遗漏了某些在特定模型(如线性模型、广义线性模型)下处理偏移推断的工作。此外,关于“半参数效率理论”在偏移推断中的应用,intro中几乎没有提及,尽管这可能是研究者(陈星宇)的强项。
张力¶
未见明显对立引用。所有被引工作基本沿着“估计→推断”的脉络发展,彼此之间没有根本性的矛盾。Ma et al. [2023]的估计率与本文的推断率在条件上是一致的(都需要谱衰减和矩条件),只是本文的条件更强(为了推断)。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
-
符号:
P,Q: 分别代表source和target的联合分布(在X×R上)。P_X,Q_X是协变量边际分布。ρ(x) = dQ_X / dP_X (x): target-to-source密度比,假设已知。f*(x) = E[Y | X=x]: 未知的回归函数,是我们要推断的目标。f0(x): 一个已知的候选函数,我们要检验H0: f* = f0在L2(Q)意义下是否成立。D = {(X_i, Y_i)}_{i=1}^n: 从source分布P中独立同分布观测到的样本。H: 与核函数k(·,·)相关的再生核希尔伯特空间(RKHS)。L2(Q): 关于target分布Q_X的L2空间。||g||_{L2(Q)}^2 = ∫ g(x)^2 dQ(x)。L_Q,L_P: 分别关于Q和P的核积分算子(kernel integral operator)。Σ_Q = E_Q[k_X ⊗_H k_X]: RKHS协方差算子。w_n(x) = min{ρ(x), τ_n}: 截断后的密度比权重,τ_n是截断水平。λ_n: 岭回归的正则化参数。f̂: 截断IWKRR估计量,由公式(2.3)定义。f_{P_w}: 截断IWKRR的总体版本,由公式(2.5)定义。U_i: 影响函数(influence function)元素,是Bahadur表示的核心。V = E[U_i ⊗_{L2(Q)} U_i]: 渐近协方差算子。B: 乘子自助法统计量,用于校准置信集半径。
-
模型:
- 数据生成机制:
Y = f*(X) + ε,其中E[ε|X] = 0。source和target的条件分布相同:P_{Y|X} = Q_{Y|X}。 f*是未知的,但假设它满足“source条件”(Assumption 4.2):f* = L_{P_{w0}}^s (g*),其中L_{P_{w0}}是带截断权重w0 = min{ρ, τ_0}的积分算子。这刻画了f*相对于核积分算子的光滑性。- 误差
ε假设一致有界(Assumption 4.1)。 - 核函数
k(·,·)有界:sup_x k(x,x) ≤ κ^2。
- 数据生成机制:
-
可观测数据:
- 可观测:
n个独立同分布的source样本{(X_i, Y_i)}_{i=1}^n。密度比ρ(x)已知(或可估计)。 - 不可观测/想要但观测不到:
- 目标分布Q下的样本(没有标签
Y)。 - 真实的回归函数
f*。 - 随机误差
ε_i。 - 总体IWKRR估计量
f_{P_w}。 - 影响函数
U_i(因为它依赖于f*和f_{P_w})。
- 目标分布Q下的样本(没有标签
- 可观测:
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:一维协变量、高斯核、有界密度比、无截断。
-
最简设定:
X是一维的,P_X = N(0,1),Q_X = N(1,1)。密度比ρ(x) = exp(x - 0.5),且假设它在整个支撑集上有界(例如,我们只考虑一个紧集)。- 核函数为高斯RBF核
k(x, x') = exp(-(x-x')^2/2)。 - 由于密度比有界,我们选择
τ_n足够大,使得w_n(x) = ρ(x),即不进行截断。此时P_w = Q,L_{P_w} = L_Q。 - 我们想检验
H0: f* = f0。
-
核心思路(在这个特例下):
- 估计:用source数据
D训练一个普通的(非加权)KRR估计量f̂。由于没有协变量偏移,f̂在L2(P)下是f*的一致估计。 - 问题:但我们的检验是在L2(Q)下进行的。由于
P ≠ Q,f̂在L2(Q)下的误差可能很大,且其分布未知。 - 解决方案(本文的核心):我们转而使用重要性加权KRR(IWKRR)。在这个特例下,IWKRR就是普通的KRR,但损失函数被加权了:
f̂ = argmin_{f∈H} (1/n) Σ_i ρ(X_i) (Y_i - f(X_i))^2 + λ_n ||f||_H^2。 由于E_P[ρ(X)(Y-f(X))^2] = E_Q[(Y-f(X))^2],这个估计量是针对target风险的无偏估计。因此,f̂在L2(Q)下是f*的一致估计。 - 推断:为了构造置信集
{f: ||f̂ - f||_{L2(Q)} ≤ ĉ_{α,n}},我们需要知道||f̂ - f*||_{L2(Q)}的分布。- Bahadur表示:在适当的正则条件下,
√n (f̂ - f*)可以被一个经验过程近似:√n (f̂ - f*) ≈ (1/√n) Σ_i U_i,其中U_i是独立的影响函数。 - Gaussian近似:这个经验过程可以用一个中心化的Gaussian过程
Z ~ N(0, V)来近似,其中V = E[U_i ⊗ U_i]是协方差算子。 - 乘子自助法:由于
U_i未知,我们无法直接模拟Z。乘子自助法通过构造一个可计算的统计量B,使得B的条件分布(给定数据)也近似于Z的分布。B的构造巧妙地利用了残差和随机乘子,避免了直接估计U_i。
- Bahadur表示:在适当的正则条件下,
- 结论:
||f̂ - f*||_{L2(Q)}的分布可以用||B||_{L2(Q)}的条件分布来近似。因此,我们可以用B的样本分位数ĉ_{α,n}来校准置信集的半径。
- 估计:用source数据
-
这个特例揭示了本文的核心数学困难:
- 即使在这个最简特例下,证明Gaussian近似和自助法近似的有效性也需要精细的算子理论。因为
U_i生活在RKHSH中,而我们需要在L2(Q)空间中控制其范数。这需要用到L_Q^{1/2}这个酉同构(Lemma 2.2)来桥接两个空间。 - 当密度比无界或重尾时(一般情况),截断
w_n(x) = min{ρ(x), τ_n}是必要的。这引入了额外的偏差,使得L_{P_w} ≠ L_Q,从而需要更复杂的“兼容性条件”(Assumption 4.4, 4.5)来保证source和target几何之间的转移。
- 即使在这个最简特例下,证明Gaussian近似和自助法近似的有效性也需要精细的算子理论。因为
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在协变量偏移下,基于source数据,如何构造关于target分布下回归函数
f*的L2(Q)-范数置信集,并进行拟合优度检验。 - 核心工具/方法:结合截断重要性加权核岭回归(IWKRR) 与乘子自助法(multiplier bootstrap),通过算子理论(酉同构、兼容性条件)桥接source和target的几何空间,并利用Gaussian近似和反集中不等式(anti-concentration)建立覆盖保证。
- 主要结论:在适当的算子兼容性条件(regularized transfer coverage, non-degenerate covariance)下,证明了所构造的置信集具有非渐近有效性,并给出了覆盖概率的显式误差率。该误差率依赖于密度比的矩条件(有界、次指数、重尾)和核积分算子的谱衰减(多项式、指数)。
关键设定与假设¶
- 关键记号:见第二节。
- 核心假设:
- Assumption 4.1 (有界噪声):
|ε| ≤ σ。这是技术性假设,可放宽到次高斯,但作者留作未来工作。 - Assumption 4.2 (Source条件):
f* = L_{P_{w0}}^s (g*)。这是KRR文献中的标准光滑性假设,但这里用的是截断后的加权算子L_{P_{w0}}。s越大,f*越光滑。 - Assumption 4.3 (有效维数):
N_λ = tr((L_Q + λI)^{-1} L_Q) ≤ E_d λ^{-d}。这刻画了核的“有效复杂度”。d越小(谱衰减越快),有效维数越小。 - Assumption 4.4 (正则化转移覆盖):
||L_Q^{1/2} (L_{P_w} + λ_n I)^{-1/2}||_{H→H} ≤ C_1。这是最关键的假设,它保证了source侧的加权风险可以控制target侧的L2(Q)范数。它等价于||f||_{L2(Q)}^2 ≤ C_1^2 (E_P[w_n(X) f(X)^2] + λ_n ||f||_H^2)。这个条件比简单的密度比有界更精细,它依赖于核、截断水平和正则化。 - Assumption 4.5 (非退化协方差):
(L_{P_w}+λ_n I)^{-1} L_{P_w} (L_{P_w}+λ_n I)^{-1} ⪰_H C_2^{-2} (L_Q+λ_n I)^{-1} L_Q (L_Q+λ_n I)^{-1}。这个条件防止了Gaussian近似的协方差算子在target几何下退化,是反集中不等式成立的必要条件。
- Assumption 4.1 (有界噪声):
主要结果¶
- Theorem 4.1 (一般覆盖保证):在Lemma 4.1(密度有界)和近似不等式(4.1)-(4.3)成立的前提下,置信集的误覆盖率满足:
|P(f* ∉ CS_α(f̂)) - α| ≲ η + √τ_n Δ。 其中Δ = Δ_G + Δ_B + Δ_bias是Gaussian近似、自助法近似和偏差的总误差。这个定理将覆盖保证问题分解为三个可独立控制的误差项。 - Corollary 4.2-4.4 (显式误差率):在具体的密度比和谱衰减条件下,给出了
Δ的显式界,并由此得到覆盖概率的收敛速度。例如:- 有界密度比 + 多项式谱衰减 (β>5):
|P - α| ≲ n^{-(β-5)(β+10) / [6(β+3)(2β+5)]} log^3 n。 - 次指数密度比 + 指数谱衰减:
|P - α| ≲ n^{-9/100} log^3 n。 - 重尾密度比 (θ>7) + 指数谱衰减:
|P - α| ≲ n^{-(θ-7) / [2(5θ-2)]} (log n)^{...}。 这些结果明确展示了密度比尾部越重、谱衰减越慢,收敛速度就越慢。
- 有界密度比 + 多项式谱衰减 (β>5):
- Theorem 4.2 (功效保证):在固定备择假设下(
||f* - f0||_{L2(Q)} = δ > 0),如果估计误差和临界值都趋于0,则检验的功效趋于1。
证明路线与技术技巧¶
-
整体路线:
- 偏差-方差分解:将
√n (f̂ - f*)分解为偏差项√n (f_{P_w} - f*)和方差项√n (f̂ - f_{P_w})。通过“欠光滑”(undersmoothing,即让λ_n足够小)使偏差项渐近可忽略。 - Bahadur表示:证明方差项
√n (f̂ - f_{P_w})可以被一个经验过程(1/√n) Σ_i U_i在L2(Q)范数下良好近似(Proposition 4.2)。U_i是显式的影响函数。 - Gaussian耦合:用Gaussian元素
Z ~ N(0, V)来耦合(couple)这个经验过程(Proposition 4.3)。这需要控制有限维投影的耦合误差和无限维尾部的谱截断误差。 - 自助法耦合:证明可计算的乘子自助法统计量
B的条件分布(给定数据)可以耦合到同一个Gaussian元素Z(Corollary 4.1)。这分为两步: a. 证明B与一个“oracle”自助法统计量B_ora接近(Proposition 4.4)。B_ora依赖于未知的f_{P_w},但具有与Z相同的条件协方差。 b. 证明B_ora的条件分布可以耦合到Z(Proposition 4.5)。 - 覆盖保证:利用Gaussian元素
Z的范数密度的有界性(反集中不等式,Lemma 4.1),将||f̂ - f*||_{L2(Q)}的分位数与||B||_{L2(Q)}的条件分位数联系起来,从而证明置信集的覆盖概率(Theorem 4.1)。
- 偏差-方差分解:将
-
关键跳跃点:
- 几何不匹配:IWKRR估计量
f̂生活在RKHSH中,其估计误差由加权source风险控制。但推断目标L2(Q)是另一个空间。作者通过L_Q^{1/2}这个酉同构(Lemma 2.2)将L2(Q)中的元素映射到H中,从而在H的算子演算框架下统一处理所有量。这是整个理论得以建立的基石。 - 截断带来的偏差:截断
w_n使得L_{P_w} ≠ L_Q,导致f_{P_w} ≠ f_Q(无截断的总体IWKRR)。这引入了额外的偏差,并且使得L_{P_w}和L_Q之间的关系变得复杂。Assumption 4.4 (regularized transfer coverage) 正是为了量化这种关系而设计的。 - 自助法近似的可行性:如何构造一个不依赖于未知量的自助法统计量?作者巧妙地利用了残差
ε̂_i = Y_i - f̂(X_i)和乘子h_{ij},构造了B(公式3.2)。证明B的条件分布能近似Z的分布,需要精细地控制f̂与f_{P_w}的差异,以及经验算子L_{P_w^n}与总体算子L_{P_w}的差异。
- 几何不匹配:IWKRR估计量
-
技术技巧点名:
- 算子理论:大量使用RKHS积分算子、协方差算子及其分数幂。
L_Q^{1/2}作为酉同构是关键。 - 经验过程理论:用于控制
L_{P_w^n} - L_{P_w}的算子范数(Lemma F.12)和(1/n) k_x^T W ε的RKHS范数(Lemma F.14)。使用了Hilbert空间上的Bernstein不等式(Minsker [2017])。 - Gaussian耦合:使用了Zaitsev [1987]的有限维Gaussian耦合定理和Hilbert空间上的Bernstein不等式来处理无限维尾部。
- 乘子自助法:利用anti-symmetric结构构造
B,使其条件协方差是经验协方差的无偏估计。 - 反集中不等式:使用了Götze et al. [2019]关于高斯元素范数密度上界的定理(Lemma F.9),这是将Gaussian近似转化为覆盖概率的关键。
- 谱截断与优化:在推导显式误差率时,通过优化截断水平
m来平衡有限维耦合误差和无限维尾部误差。
- 算子理论:大量使用RKHS积分算子、协方差算子及其分数幂。
真实例子与应用¶
- 数据:2022年消费者金融调查(SCF)数据。将未加权的记录视为source分布
P,将带有调查权重的记录视为target分布Q。 - 如何应用:
- Study 1 (预测家庭净资产):用IWKRR估计
f*,然后检验几个候选函数(如普通KRR、加权均值、零函数)是否等于f*。结果拒绝了所有候选函数,包括在source上训练的普通KRR,说明协变量偏移确实影响了模型在target上的表现。 - Study 2 (收入与持股概率):检验持股概率函数
f*(z)是否为收入的非递减函数。这是一个复合检验。通过计算f̂到单调函数类M_↑的投影距离,并利用自助法构造该距离的置信区间,结果未能拒绝原假设。
- Study 1 (预测家庭净资产):用IWKRR估计
- 结果:验证了方法的可行性。在模拟中,覆盖概率接近名义水平,检验功效随分离度
δ增大而迅速趋近于1。 - 例子想说明什么:主要目的是验证理论(覆盖概率)和展示方法在实际问题中的应用。特别是,Study 1展示了source-only模型在target上可能被拒绝,而加权方法可以揭示这一点。
🔎 结论是否比证明窄¶
- 是的,存在明显的“窄证明、宽声称”:
- 作者在Corollary 4.2-4.4中给出的显式误差率,依赖于非常具体的谱衰减假设(
µ_k ≍ k^{-β}或µ_k ≍ exp(-c k^ζ))和密度比矩条件。这些条件比Theorem 4.1的一般条件强得多。 - 作者在证明中假设了有界噪声(Assumption 4.1),但在讨论中声称可以推广到次高斯噪声,并给出了附录A。然而,附录A中的Corollary A.1-A.3仍然依赖于更强的“次高斯特征”假设(Assumption A.1),这并非标准假设。
- 作者假设密度比已知,但在实际应用中这几乎不可能。讨论部分虽然提到了估计方法,但明确表示“它们对推断的影响尚不清楚”。因此,论文的核心结论(覆盖保证)严格依赖于“ρ已知”这一理想化假设。
- 作者在Theorem 4.1的证明中,依赖于Lemma 4.1(密度有界)来使用反集中不等式。但Lemma 4.1本身又依赖于Assumption 4.5(非退化协方差)和具体的谱衰减条件。因此,Theorem 4.1的普适性可能被其引用的引理的条件所限制。
- 作者在Corollary 4.2-4.4中给出的显式误差率,依赖于非常具体的谱衰减假设(
四、开放问题¶
- 未知密度比下的推断:当
ρ(x)需要从无标签数据中估计时,整个推断过程的一阶近似和覆盖保证会如何变化?这是论文明确指出的未来工作(Section 7),也是最大的开放问题。扎根于:Section 7 "Unknown density ratio"。 - 更弱的噪声和核假设:能否将有界噪声(Assumption 4.1)放宽到次高斯噪声,同时保持非渐近的覆盖保证?附录A做了部分工作,但引入了更强的“次高斯特征”假设。能否在更弱的条件下得到类似结果?扎根于:Assumption 4.1 和 Appendix A。
- 更优的误差率:Corollary 4.2-4.4中给出的显式误差率是否是最优的?特别是,对密度比矩和谱衰减的要求(如
β>5,θ>7)是否可以被改进?作者自己也承认“这些条件可能可以改进”(Section 7)。扎根于:Section 7 "Density ratio moment condition and kernel spectral decay rate"。 - 其他推断目标:本文只考虑了
L2(Q)-范数下的置信球。能否将方法推广到其他更有信息量的推断目标,例如逐点置信区间或均匀置信带(uniform confidence band)?作者在intro中提到了后者的挑战性(Section 1.1 "Nonparametric inference"),但未给出解决方案。扎根于:Section 1.1 对 "uniformly valid pointwise confidence intervals" 的讨论。
Maintained by 陈星宇 · Homepage · Source on GitHub