Conditional Independence Testing in Hilbert Spaces with Applications to Functional Data Analysis¶
作者: Anton Rask Lundborg, Rajen D. Shah, Jonas Peters
来源: Journal of the Royal Statistical Society Series B
主题: 数理统计 / 假设检验
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:当协变量 \(Z\) 是连续型随机变量(甚至函数型随机变量)时,如何检验随机变量 \(X\) 和 \(Y\) 的条件独立性,即检验 \(X \perp\!\!\!\perp Y \mid Z\)。这是一个在因果推断、图模型和变量选择中处于核心地位的假设检验问题。该方向的成熟度目前处于“已知不可能存在无假设的通用有效检验,因此必须引入额外建模假设来构造实用检验”的阶段。本文的工作正是在此共识下,将问题从有限维推广到函数型数据(X, Y, Z 均为函数),并提出了一个基于回归残差内积的、可均匀控制第一类错误的检验方法。
发展脉络(history)¶
-
奠基工作:条件独立性检验的“不可能性”定理
- Shah & Peters (2020):证明了在 \(Z\) 为连续随机变量的一般设定下,任何有效的条件独立性检验(即能控制第一类错误)都无法对任何替代假设具有非平凡的功效。这一“不可能性”结果奠定了该领域的基石,迫使后续研究必须引入额外的建模假设(如对回归函数形式的假设)来构造有意义的检验。本文直接引用了该定理(Theorem 8),并将其作为自己工作的出发点。
-
主要进展:基于回归残差的检验方法
- Shah & Peters (2020):在“不可能性”定理之后,他们提出了广义协方差度量(GCM)检验。该方法通过非线性地回归 \(X\) 和 \(Y\) 对 \(Z\),然后计算残差之间的样本协方差作为检验统计量。他们证明了该检验的有效性几乎完全依赖于回归的弱要求(即回归函数能很好地拟合数据)。本文的检验统计量正是 GCM 在函数型数据上的直接推广。
- 本文作者:将 GCM 检验从有限维的 \(X, Y, Z\) 推广到三者均为函数型随机变量的情形。这是该子方向在数据类型上的一个关键拓展。
-
当前 Frontier:函数型数据下的条件独立性检验
- Qiao et al. (2019, 2020):研究了同一 EEG 数据集,但他们的目标是估计条件独立图(即输出一个图结构),而不是检验图中某条边是否存在。本文明确指出,他们的工作与 Qiao 等人的工作是互补的:本文关注的是假设检验,而非图估计。这构成了本文在当前 frontier 上的定位。
-
本文的位置:本文是第一个(据作者所述)在 X, Y, Z 均为函数型随机变量时,提出一个可计算、可均匀控制第一类错误的条件独立性检验方法的工作。它填补了从有限维 GCM 检验到函数型数据检验之间的空白。
子线索聚类¶
-
条件独立性检验的理论基础:这条线索关注检验的可行性、不可能性以及一般性框架。
- Shah & Peters (2020):证明了“不可能性”定理,并提出了 GCM 检验。
- Constantinou & Dawid (2017):讨论了扩展的条件独立性概念及其在因果推断中的应用,为条件独立性的不同定义提供了理论基础。
-
函数型数据回归方法:这是本文方法的核心工具来源。这条线索提供了如何从函数型数据中学习回归函数(即 \(E[X|Z]\) 和 \(E[Y|Z]\))的各种方法。
- 线性模型:Hall & Horowitz (2007), Cai & Hall (2006), Crambes & Mas (2013), Delaigle & Hall (2012), Goldsmith et al. (2011), Reiss & Ogden (2007), Shin (2009), Yuan & Cai (2010) 等,涵盖了 scalar-on-function, function-on-scalar, function-on-function 等多种线性回归设定。
- 非线性/非参数模型:Fan et al. (2015) (函数型可加回归), Ferraty & Vieu (2006), Ferraty et al. (2011), Yao & Müller (2010) 等。
- 软件实现:Brockhaus et al. (2020) (FDboost 包), Scheipl et al. (2015) (pffr 函数) 等,使得这些方法易于应用。
-
函数型图模型:这条线索将条件独立性检验应用于函数型数据的图模型构建。
- Qiao et al. (2020):提出了“双重函数型图模型”,用于估计高维函数型数据中的条件独立图。本文将其作为实证对比和应用场景。
这个方向在追问的核心问题¶
- 如何克服“不可能性”定理? 核心问题在于,既然通用有效检验不存在,那么需要引入什么样的、可验证的建模假设,才能构造出既有功效又能控制第一类错误的检验?
- 如何将检验方法推广到函数型数据? 当 \(X, Y, Z\) 是无限维的随机函数时,回归、残差计算、统计量的渐近分布等所有环节都面临新的挑战(如逆问题的不适定性、函数空间的复杂性)。
- 如何实现均匀的第一类错误控制? 在函数型数据这种复杂设定下,能否保证检验的 size 在 \(H_0\) 下对一系列数据生成过程(例如,不同的协方差结构)都得到控制,而不仅仅是点态渐近有效?
- 检验的功效如何? 在引入的建模假设下,检验对哪些类型的替代假设有检测能力?其功效与样本量、函数的光滑性、信噪比等参数的关系如何?
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口 frame 为“现有条件独立性检验方法(如 GCM)仅适用于有限维随机变量,而函数型数据在应用中日渐普遍,因此需要将其推广到函数型设定”。这使得他们的工作成为“显然的下一步”。
- 被淡化/回避的竞争路线:作者淡化了其他可能的检验方法,例如基于核方法的条件独立性检验(如 KCIT),这些方法理论上也能处理函数型数据(通过核技巧),但作者在引言中并未深入讨论其与本文方法的优劣。作者强调其方法的“简单性”(基于内积)和“均匀控制”的理论保证,这暗示了核方法可能在计算或理论分析上更复杂。
- 什么明显该被引/该存在、却没出现在 intro 里? 作者没有引用任何关于基于核的条件独立性检验(如 Zhang et al., 2011, "Kernel-based conditional independence test" 或类似工作)的文献。这是一个值得研究者去查的问题:是作者认为这些方法不适用于函数型数据,还是有意回避了比较?此外,关于函数型数据中的图模型估计,作者引用了 Qiao et al. (2020),但没有引用更早的、可能更基础的函数型图模型工作(如基于 Gaussian copula 或非参数方法的)。
张力¶
未见明显对立引用。所有被引工作基本遵循“不可能性定理 → 引入假设 → 构造检验”的共识路径。Shah & Peters (2020) 的“不可能性”与本文的“可检验性”之间不存在矛盾,因为后者依赖于额外的建模假设(如函数型线性模型)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(X, Y, Z\):函数型随机变量。它们是定义在某个紧区间(如 \([0,1]\))上的随机函数。例如,\(X = \{X(t): t \in [0,1]\}\)。
- \(n\):样本量。
- \(\{(X_i, Y_i, Z_i)\}_{i=1}^n\):从 \((X, Y, Z)\) 的联合分布中独立同分布观测到的 \(n\) 个样本。每个样本 \(X_i\) 是一个函数。
- \(H_0: X \perp\!\!\!\perp Y \mid Z\):原假设,即在给定 \(Z\) 的条件下,\(X\) 和 \(Y\) 条件独立。
- \(r_X(t) = E[X(t) | Z]\):给定 \(Z\) 时 \(X\) 的条件期望函数。这是一个从 \(Z\) 的函数空间到 \(X\) 的函数空间的映射。
- \(r_Y(t) = E[Y(t) | Z]\):类似地,\(Y\) 的条件期望函数。
- \(\epsilon_X = X - r_X(Z)\):\(X\) 的残差函数。
- \(\epsilon_Y = Y - r_Y(Z)\):\(Y\) 的残差函数。
- \(\langle \cdot, \cdot \rangle\):函数空间(通常是 \(L^2\) 空间)上的内积。例如,\(\langle f, g \rangle = \int f(t) g(t) dt\)。
- \(\hat{r}_X, \hat{r}_Y\):基于样本估计的回归函数。
- \(\hat{\epsilon}_{X,i} = X_i - \hat{r}_X(Z_i)\):样本内残差。
- \(T_n\):检验统计量。
-
模型:
- 数据生成机制:\((X, Y, Z)\) 是联合分布为 \(P\) 的三个函数型随机变量。我们不对其分布做全局参数假设,但为了构造检验,需要假设回归函数 \(r_X\) 和 \(r_Y\) 可以被很好地估计。
- 在理论分析中,作者主要考虑函数型线性模型作为回归方法的一个具体实例。例如,\(E[X(t)|Z] = \int \beta_X(s,t) Z(s) ds\),其中 \(\beta_X\) 是一个未知的系数函数。这是一个线性但无限维的模型。
- 要估的对象:回归函数 \(r_X\) 和 \(r_Y\)(或它们的参数化形式,如 \(\beta_X\)),以及检验统计量 \(T_n\) 的分布。
-
可观测数据:
- 研究者能观测到的是 \(n\) 个独立的函数三元组 \(\{(X_i, Y_i, Z_i)\}_{i=1}^n\)。在实际中,这些函数是在离散网格点上观测到的,但本文的理论分析假设函数本身是完整可观测的(或观测误差可忽略)。
- 想要但观测不到:残差函数 \(\epsilon_X\) 和 \(\epsilon_Y\) 的真实值,因为它们依赖于未知的回归函数 \(r_X\) 和 \(r_Y\)。我们只能通过估计的回归函数得到估计的残差 \(\hat{\epsilon}_X\) 和 \(\hat{\epsilon}_Y\)。检验的核心困难就在于,用估计的残差代替真实残差后,如何控制检验的 size。
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:假设 \(X, Y, Z\) 都是一维实值随机变量(即退化为非函数型数据),并且我们使用线性回归来估计 \(E[X|Z]\) 和 \(E[Y|Z]\)。
在这个特例下,本文的方法退化为 Shah & Peters (2020) 的 GCM 检验的一个特例:
- 原假设:\(H_0: X \perp\!\!\!\perp Y \mid Z\)。
- 回归:用线性回归拟合 \(X\) 对 \(Z\) 和 \(Y\) 对 \(Z\),得到残差 \(\hat{\epsilon}_{X,i} = X_i - \hat{\beta}_X Z_i\) 和 \(\hat{\epsilon}_{Y,i} = Y_i - \hat{\beta}_Y Z_i\)。
- 检验统计量:计算残差的样本协方差:
\[T_n = \frac{1}{n} \sum_{i=1}^n \hat{\epsilon}_{X,i} \hat{\epsilon}_{Y,i}\]
- 核心命题:如果线性回归模型是正确的(即 \(E[X|Z] = \beta_X Z\) 且 \(E[Y|Z] = \beta_Y Z\)),那么在 \(H_0\) 下,真实残差 \(\epsilon_X\) 和 \(\epsilon_Y\) 是独立的,因此 \(E[\epsilon_X \epsilon_Y] = 0\)。然而,由于我们使用的是样本内残差 \(\hat{\epsilon}\),它们之间存在由参数估计引入的相关性,导致 \(T_n\) 的均值不为零。
- 本文的关键想法:作者证明了,当样本内预测误差(即 \(\frac{1}{n}\sum_i \hat{\epsilon}_{X,i}^2\) 和 \(\frac{1}{n}\sum_i \hat{\epsilon}_{Y,i}^2\))足够小时,由参数估计引入的偏差可以被控制,从而 \(T_n\) 的分布可以近似为一个均值为零的正态分布。这使得我们可以通过估计 \(T_n\) 的方差来构造一个渐近有效的检验,并且这种有效性是均匀的(即对一系列满足条件的分布都成立)。
推广到函数型数据:当 \(X, Y, Z\) 是函数时,上述逻辑完全不变,只是将标量乘积 \(\hat{\epsilon}_{X,i} \hat{\epsilon}_{Y,i}\) 替换为函数内积 \(\langle \hat{\epsilon}_{X,i}, \hat{\epsilon}_{Y,i} \rangle\)。回归方法从线性回归推广到函数型线性回归(如岭回归)。整个证明的核心挑战在于,在无限维的函数空间中,如何保证“样本内预测误差足够小”这一条件成立,以及如何推导出检验统计量的渐近分布。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:研究了当 \(X, Y, Z\) 均为函数型随机变量时,条件独立性检验 \(X \perp\!\!\!\perp Y \mid Z\) 的问题。
- 核心工具/方法:提出了一种基于回归残差内积的检验统计量(广义希尔伯特协方差度量,GHCM),该统计量计算简单,其有效性依赖于回归方法能提供足够小的样本内预测误差。
- 主要结论:证明了即使在理想化的高斯设定下,任何检验的功效都无法超过其水平(即“不可能性”定理在函数型设定下依然成立)。随后,在函数型线性模型下,证明了使用岭回归作为回归方法时,GHCM 检验能均匀控制第一类错误,且无需协方差算子特征值的下界或特征间距条件。
关键设定与假设¶
- 设定:\((X, Y, Z)\) 是定义在紧区间上的、平方可积的随机函数。观测到 \(n\) 个独立同分布的样本 \(\{(X_i, Y_i, Z_i)\}_{i=1}^n\)。
- 假设(用于理论分析):
- 回归函数的可估计性:存在一种回归方法,能产生估计 \(\hat{r}_X\) 和 \(\hat{r}_Y\),使得样本内预测误差 \(\frac{1}{n}\sum_i \|\hat{\epsilon}_{X,i}\|^2\) 和 \(\frac{1}{n}\sum_i \|\hat{\epsilon}_{Y,i}\|^2\) 以高概率小于某个常数。这是保证检验 size 控制的核心条件。
- 函数型线性模型:在主要理论结果中,作者假设 \(E[X|Z]\) 和 \(E[Y|Z]\) 是 \(Z\) 的线性函数(即函数型线性模型)。这是为了应用岭回归并推导其预测误差界。
- 协方差算子的迹有限:\(Z\) 的协方差算子 \(C_Z\) 的迹是有限的(即 \(E[\|Z\|^2] < \infty\)),这是一个非常弱的条件。
- 无特征值下界或间距条件:这是本文结果的一个亮点。与许多函数型线性回归的文献(如 Hall & Horowitz, 2007; Cai & Hall, 2006)不同,本文的证明不要求 \(C_Z\) 的特征值有正的下界,也不要求特征值之间的间距足够大。这使得结果适用于更广泛的协方差结构。
- 相比已有文献的放宽或强化:
- 放宽:相比 Shah & Peters (2020) 的 GCM 检验,本文将其从有限维推广到无限维的函数空间。相比许多函数型线性回归的收敛速率结果,本文不要求特征值下界或间距条件。
- 强化:本文对第一类错误控制的要求是均匀的(uniform),而不仅仅是点态渐近的。这比许多现有检验的理论保证更强。
主要结果¶
- 定理 1(不可能性):即使 \((X, Y, Z)\) 是联合高斯的函数型随机变量,任何检验的功效(在任意替代假设下)都不能超过其显著性水平。这个定理将 Shah & Peters (2020) 的有限维结果推广到了无限维,再次强调了引入额外假设的必要性。
- 定理 2(GHCM 检验的均匀 size 控制):这是本文的核心定理。它给出了 GHCM 检验统计量在 \(H_0\) 下渐近正态的充分条件。该条件主要依赖于回归方法的样本内预测误差。具体来说,如果存在一个序列 \(\delta_n \to 0\),使得样本内预测误差的平方根以高概率小于 \(\delta_n\),那么 GHCM 检验统计量除以它的一个特定方差估计量后,依分布收敛到标准正态分布,且这种收敛是均匀的。
- 定理 3(岭回归下的具体实现):在函数型线性模型下,使用岭回归作为回归方法,定理 2 的条件可以被满足。具体地,作者证明了岭回归的样本内预测误差以高概率趋于零,且其收敛速率取决于岭参数的选择和协方差算子的谱衰减。这个结果不依赖于特征值下界或间距条件,是技术上的一个关键突破。
证明路线与技术技巧¶
-
整体路线:
- 定义统计量:定义 GHCM 统计量 \(T_n = \frac{1}{n} \sum_{i=1}^n \langle \hat{\epsilon}_{X,i}, \hat{\epsilon}_{Y,i} \rangle\)。
- 分解偏差:将 \(T_n\) 分解为“理想项”(使用真实残差 \(\epsilon_X, \epsilon_Y\) 的内积)和“偏差项”(由使用估计残差 \(\hat{\epsilon}\) 代替真实残差 \(\epsilon\) 引起)。在 \(H_0\) 下,理想项的期望为零。
- 控制偏差:核心工作是证明偏差项在 \(H_0\) 下是渐近可忽略的。作者将偏差项进一步分解为几个部分,每个部分都可以用样本内预测误差的平方根来界定。这是证明中最关键的一步,它建立了“好的回归 → 好的检验”这一逻辑链条。
- 方差估计与标准化:估计 \(T_n\) 的渐近方差。作者提出了一个方差估计量 \(\hat{V}_n\),并证明在 \(H_0\) 下,\(T_n / \sqrt{\hat{V}_n} \xrightarrow{d} N(0,1)\)。
- 均匀性论证:为了证明收敛是均匀的,作者使用了关于经验过程和高斯近似的一些经典结果(如 Bengs & Holzmann, 2019 中的均匀中心极限定理),并仔细验证了所需的条件在函数型设定下仍然成立。
-
关键跳跃点:
- 从“预测误差小”到“检验偏差小”:这是整个证明的枢纽。作者需要证明,如果回归函数估计得好(样本内预测误差小),那么由估计残差引入的检验统计量的偏差就小。这个跳跃依赖于对残差和回归函数估计量的精细的代数操作和概率不等式。
- 岭回归预测误差界的推导:在函数型线性模型下,证明岭回归的样本内预测误差趋于零,且不依赖于特征值下界。这需要巧妙地利用岭回归的解析解和迹不等式,绕开了对协方差算子可逆性的要求。
-
技术技巧点名:
- 经验过程理论:用于处理函数型数据中经验均值与总体均值的偏差,特别是在均匀性论证中。
- 迹不等式:用于界定岭回归中涉及协方差算子逆的项的范数。
- 均匀中心极限定理:来自 Bengs & Holzmann (2019),用于证明检验统计量在 \(H_0\) 下对一系列分布均匀地收敛到正态分布。
- 留一法(Leave-one-out)思想:在证明岭回归预测误差界时,可能隐含地使用了留一法技巧来处理样本内预测的依赖性。
真实例子与应用¶
本文包含两个真实数据应用和一个模拟研究。
-
截断函数型线性模型中的置信区间:
- 数据/场景:模拟数据,生成自一个截断函数型线性模型 \(Y = \int_0^\theta \beta(t) X(t) dt + \epsilon\),其中 \(\theta\) 是未知的截断点。目标是构造 \(\theta\) 的置信区间。
- 方法:利用 GHCM 检验来检验关于 \(\theta\) 的假设 \(H_0: \theta = \theta_0\)。具体地,对于每个候选的 \(\theta_0\),构造一个检验,然后通过反转检验来得到 \(\theta\) 的置信区间。
- 结果:展示了 GHCM 检验能产生覆盖概率接近名义水平的置信区间,且区间长度合理。
- 说明:这个例子展示了 GHCM 检验如何作为一个“构件”用于更复杂的推断问题,而不仅仅是作为一个独立的检验。
-
EEG 数据的函数型图模型边检验:
- 数据/场景:来自一项关于酒精中毒研究的 EEG 数据集。每个受试者的 EEG 信号被记录在多个电极通道上,每个通道的信号被视为一个函数。目标是检验在给定其他所有通道的条件下,某两个通道的信号是否条件独立(即图中是否存在边)。
- 方法:将 GHCM 检验应用于每一对通道,并对多重比较进行校正(如 Bonferroni 校正),从而得到一个条件独立图。
- 结果:作者展示了 GHCM 检验发现的图结构,并与 Qiao et al. (2020) 的估计方法得到的结果进行了比较。他们发现两种方法在整体结构上相似,但 GHCM 检验在某些边上给出了不同的结论。
- 说明:这个例子展示了 GHCM 检验在真实高维函数型数据上的应用,并强调了其与现有图估计方法的互补性(检验 vs. 估计)。
🔎 结论是否比证明窄¶
- 窄的结论:定理 3 的证明严格依赖于函数型线性模型的假设。虽然作者在引言和讨论中暗示该方法可能适用于更广泛的非线性模型(只要回归方法足够好),但并没有给出在一般非线性模型下均匀控制第一类错误的严格证明。作者在文中明确写道:“We show this requirement is met by ridge regression in functional linear model settings...”,这表明其核心理论保证目前仅限于线性模型。
- 泛化的 claim:作者在摘要和引言中声称该方法“type I error is controlled uniformly when the in-sample prediction errors are sufficiently small”。这个 claim 本身是定理 2 的准确陈述,是严格的。但“sufficiently small”这个条件在非线性模型下是否总能被满足,则是一个开放问题。作者在讨论部分也承认了这一点,并指出这是一个未来工作方向。
四、开放问题¶
-
非线性回归下的理论保证:本文的核心理论结果(定理 3)依赖于函数型线性模型。能否将 GHCM 检验的均匀 size 控制推广到更一般的非线性回归方法(如函数型可加模型、核回归)?这需要为这些方法建立类似的样本内预测误差界。扎根于:本文定理 3 的设定和讨论部分对非线性模型的展望。
-
功效的理论分析:本文主要关注第一类错误的控制,对检验的功效(power)只做了模拟研究,缺乏系统的理论分析。在函数型线性模型下,GHCM 检验对哪些类型的替代假设(例如,\(X\) 和 \(Y\) 通过 \(Z\) 的某个特定方向相关)具有最优或接近最优的检测能力?其功效与函数型主成分的衰减速率、信噪比等参数的关系如何?扎根于:本文模拟研究和结论部分对功效的讨论。
-
高维函数型数据的可扩展性:在 EEG 例子中,作者对每对变量进行了多重检验。当函数型变量的数量 \(p\) 很大时(例如,数百个电极通道),这种两两检验的计算成本会很高。能否开发出更高效的、能同时检验所有边的全局检验方法,或者利用函数型数据的结构(如空间邻近性)来改进多重比较校正?扎根于:本文的 EEG 数据应用和讨论部分。
-
与核方法的比较:本文没有与基于核的条件独立性检验(如 KCIT)进行比较。一个值得探索的问题是:在函数型数据设定下,GHCM 检验与 KCIT 在计算复杂度、对模型假设的敏感性、以及有限样本下的 size 和 power 方面有何异同?扎根于:本文引言中未提及核方法这一明显的竞争路线。
Maintained by 陈星宇 · Homepage · Source on GitHub