跳转至

Nonparametric conditional local independence testing

作者: Alexander Mangulad Christgau, Lasse Petersen, Niels Richard Hansen
主题: 因果推断
相关性: 8/10
链接: https://doi.org/10.1214/23-aos2323


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是连续时间随机过程中的因果推断,具体聚焦于"条件局部独立性"(conditional local independence)的非参数检验问题。该方向要回答的根本问题是:在观测到多个随时间演化的过程(如事件史、纵向追踪数据)时,如何判断一个过程是否"直接"影响另一个过程的演化,且这种判断不依赖于对过程动态的强参数模型假设。这一概念是局部独立图(local independence graph)建模的基础,也是连续时间下 Granger 因果的推广。该方向的成熟度处于"概念框架已建立、但推断工具仍以参数/半参数模型为主"的阶段——本文试图填补的正是非参数检验这一空白。

发展脉络(history)

  • 奠基工作:Schweder (1970) 首次为马尔可夫过程引入"局部独立性"概念,作为连续时间下"过去不直接影响未来演化"的形式化。Aalen (1987) 将其推广到一般计数过程与生存分析框架,并建立了局部独立性与 Granger 非因果(Granger, 1969)的连续时间对应关系。这一阶段确立了概念与基本性质,但缺乏系统性的检验方法。
  • 图模型与因果解释:Didelez (2007, 2008, 2015) 系统研究了局部独立性的代数性质,引入局部独立图作为多元过程间直接影响的图形表示,并探讨了其因果语义。Mogensen and Hansen (2020) 进一步将局部独立图推广到部分观测系统,提出边缘化局部独立图的概念。这一阶段将局部独立性从单个假设提升为图结构学习的基石,但推断仍依赖模型假设。
  • 参数/半参数检验的局限:在生存分析和事件史分析中,检验"协变量是否影响事件发生"通常基于 Cox 比例风险模型(本文第 2.2 节和第 6 节详细讨论了这一点)。然而,Cox 模型对基线风险函数和协变量效应形式有明确假设,且对未观测混杂和模型误设敏感。作者在第 2.2 节明确指出,基于边际 Cox 模型的检验在模型误设下会错误拒绝局部独立性假设(第 6.3 节的模拟证实了这一点)。
  • 非参数检验的兴起:在经典条件独立性检验领域,Shah and Peters (2020) 提出广义协方差度量(GCM),Petersen and Hansen (2021) 提出基于分位数回归的部分 copula 方法,Lundborg, Shah and Peters (2022) 提出 GHCM。这些方法的核心思想是:构造一个对 nuisance 参数(条件均值/条件分布)估计误差不敏感的统计量,从而在非参数估计仅以适度速率收敛时仍能控制检验水平。本文作者明确将这些思想从静态条件独立性推广到连续时间动态过程的局部独立性。
  • 本文的位置:作者将 GCM 的思想与计数过程的鞅理论结合,引入"局部协方差度量"(Local Covariance Measure, LCM)作为偏离局部独立性的泛函参数,并基于双机器学习(double machine learning, Chernozhukov et al., 2018)构造检验。本文声称是第一个具有统一水平与功效保证的非参数条件局部独立性检验(第 1 节末段)。

子线索聚类

  1. 局部独立性的概念与图模型(Schweder 1970; Aalen 1987; Didelez 2007, 2008, 2015; Mogensen and Hansen 2020; Røysland et al. 2022):关注局部独立性的定义、代数性质、图表示与因果识别。这一线索为本文提供了假设的定义框架,但不涉及具体检验方法。
  2. 计数过程的鞅方法与生存分析(Andersen et al. 1993; Aalen 1987):提供了本文的技术基础——计数过程的强度、补偿子、鞅表示,以及 Cox 模型等半参数工具。本文的 LCM 定义和渐近理论完全建立在这一框架之上。
  3. 条件独立性检验与双机器学习(Shah and Peters 2020; Petersen and Hansen 2021; Lundborg, Shah and Peters 2022; Chernozhukov et al. 2018):提供了本文的推断策略——通过 residualization 实现 Neyman 正交化,使检验统计量对 nuisance 估计误差不敏感。本文的核心创新是将这一策略从静态设定推广到动态过程设定。
  4. Hawkes 过程与事件序列的因果推断(Achab et al. 2017; Bacry et al. 2017; Cai et al. 2022; Xu, Farajtabar and Zha 2016; Zhou, Farajtabar and Zha 2013):机器学习社区对事件序列因果推断的关注,主要基于线性 Hawkes 模型的核函数估计。作者在第 1 节指出,这类方法依赖参数模型假设,且 Hawkes 模型不封闭于边缘化(第 2.2 节),因此模型误设风险高。

⚠️ 作者的 framing(这是作者的说法)

作者将缺口 frame 为:现有局部独立性检验要么依赖参数模型(如 Cox 模型),要么无法处理动态过程中的条件依赖结构。具体而言,作者在第 1 节和第 2.2 节论证了:(i) 基于 Cox 模型的检验在模型误设下无效(第 6.3 节模拟证实);(ii) 静态条件独立性检验(GCM 等)无法直接推广,因为局部独立性涉及的是"给定历史"的逐时刻影响,而非静态条件分布;(iii) 因此需要一个新的泛函参数(LCM)和相应的非参数检验程序。作者淡化的竞争路线包括:基于 Hawkes 模型的核方法(认为其依赖线性假设且不封闭于边缘化)、以及基于参数生存模型的检验(认为其受模型误设影响)。作者没有讨论:非参数检验的功效相对于参数检验的损失有多大?在哪些实际场景中,参数模型的稳健性(如 Cox 模型对某些误设的鲁棒性)可能优于非参数方法?

张力

未见明显对立引用。各线索之间是互补关系:概念框架(线索 1)→ 技术基础(线索 2)→ 推断策略(线索 3)→ 应用动机(线索 4)。唯一潜在的张力在于:机器学习社区(线索 4)倾向于使用 Hawkes 模型这类参数化但灵活的模型,而本文主张完全非参数的方法。作者对此的回应是 Hawkes 模型不封闭于边缘化(第 2.2 节),但这并不构成对 Hawkes 模型本身的否定,而是对其在部分观测系统中适用性的质疑。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

符号清单(逐个点名):

记号 含义 类型
\(N = (N_t)_{t \in [0,1]}\) 目标计数过程(如死亡指示过程 \(N_t = \mathbf{1}(T \leq t)\)) 可观测随机过程
\(X = (X_t)_{t \in [0,1]}\) 待检验的协变量过程(如养老金储蓄),càglàd 可观测随机过程
\(\mathcal{F}_t\) 基准滤波(由 \(N\) 及其他协变量的历史生成) 滤波/信息流
\(\mathcal{G}_t\) 扩展滤波(\(\mathcal{F}_t\) 加上 \(X\) 的历史) 滤波/信息流
\(\lambda_t\) \(N\) 的 \(\mathcal{F}_t\)-强度(可预测过程) 未知 nuisance 参数(函数)
\(\underline{\lambda}_t\) \(N\) 的 \(\mathcal{G}_t\)-强度 未知 nuisance 参数(函数)
\(\Lambda_t = \int_0^t \lambda_s ds\) \(\mathcal{F}_t\)-补偿子 由 \(\lambda\) 导出
\(M_t = N_t - \Lambda_t\) \(\mathcal{F}_t\)-鞅(补偿计数过程) 由 \(N, \lambda\) 导出
\(G_t\) 残差过程(residual process),满足 $E(G_t \mathcal{F}_{t-}) = 0$
$\Pi_t = E(X_t \mathcal{F}_{t-})$ \(X\) 的可预测投影
\(\gamma_t = E\left(\int_0^t G_s dM_s\right)\) 局部协方差度量(LCM) 目标 estimand(泛函参数)
\(\hat{\gamma}^{(n)}_t\) LCM 的估计量 估计量
\(\hat{\lambda}^{(n)}\)、\(\hat{G}^{(n)}\) \(\lambda\) 和 \(G\) 的非参数估计 nuisance 估计量
\(n\) 样本量(独立同分布的过程个数) 指标
\(\Theta\) 参数空间(所有可能的分布) 指标
\(\Theta_0 \subset \Theta\) 局部独立性假设成立的参数子集 指标
\(V(t) = E\left(\int_0^t G_s^2 dN_s\right)\) LCM 估计量的渐近方差函数 导出量
\(S\) $\sup_{0 \le t \le 1} \hat{\gamma}^{(n)}_t

模型(数据生成机制):

  • 观测 \(n\) 个独立同分布的三元组 \((N_j, X_j, \mathcal{F}_j)_{j=1,\dots,n}\),每个都是 \([0,1]\) 上的随机过程。
  • \(N_j\) 是 \(\mathcal{F}_j\)-适应计数过程,具有 \(\mathcal{F}_j\)-强度 \(\lambda_j\)。
  • \(X_j\) 是 càglàd 过程,\(\mathcal{G}_j\) 是由 \(\mathcal{F}_j\) 和 \(X_j\) 生成的扩展滤波。
  • 关键结构:\(N_j\) 的 \(\mathcal{G}_j\)-强度记为 \(\underline{\lambda}_j\)。局部独立性假设 \(H_0\) 等价于 \(\underline{\lambda}_j = \lambda_j\)(即 \(X\) 的历史不改变 \(N\) 的强度),也等价于 \(M_j\) 是 \(\mathcal{G}_j\)-鞅。

可观测数据:研究者能观测到 \(N_j\)(事件发生时刻)、\(X_j\)(协变量过程轨迹)、以及生成 \(\mathcal{F}_j\) 的其他过程(如 \(Z_j\))。不可观测:真实的强度过程 \(\lambda_j\) 和 \(\underline{\lambda}_j\),以及残差过程 \(G_j\)(因为 \(G_j\) 的定义依赖于 \(\Pi_j = E(X_j | \mathcal{F}_{j-})\),这是未知的)。

估计目标:\(\gamma_t\)(LCM),一个 \([0,1]\) 上的函数。在 \(H_0\) 下 \(\gamma_t \equiv 0\);在备择下 \(\gamma_t\) 偏离零函数。检验 \(H_0\) 等价于检验 \(\gamma_t \equiv 0\)。

第二步:最小内核

最小内核:假设 \(X\) 是时间无关的标量(即 \(X_t = X\) 对所有 \(t\)),且 \(\mathcal{F}_t\) 仅由 \(N\) 的历史生成(无其他协变量 \(Z\))。此时:

  • \(\Pi_t = E(X | \mathcal{F}_{t-})\) 是 \(X\) 对 \(N\) 历史的回归函数。
  • 残差过程退化为 \(G_t = X - E(X | \mathcal{F}_{t-})\),即 \(X\) 对 \(N\) 历史回归的残差。
  • LCM 简化为 \(\gamma_t = E\left(\int_0^t (X - E(X|\mathcal{F}_{s-})) dM_s\right)\)。

要证明的核心命题(在这个最小内核下):

命题(最小版本):在 \(H_0\)(\(N\) 局部独立于 \(X\) 给定 \(\mathcal{F}\))下,\(\gamma_t = 0\) 对所有 \(t \in [0,1]\) 成立。反之,若 \(\gamma_t \neq 0\) 对某个 \(t\) 成立,则 \(H_0\) 不成立。

为什么成立:在 \(H_0\) 下,\(M\) 是 \(\mathcal{G}\)-鞅。由于 \(G\) 是 \(\mathcal{G}\)-可料的(因为 \(G_t\) 由 \(X\) 和 \(\mathcal{F}_{t-}\) 决定),随机积分 \(\int_0^t G_s dM_s\) 是 \(\mathcal{G}\)-鞅,期望为零。因此 \(\gamma_t = 0\)。

证明的关键步骤(在最小内核下): 1. 写出 \(\gamma_t\) 的估计量 \(\hat{\gamma}^{(n)}_t = \frac{1}{n}\sum_{j=1}^n \int_0^t \hat{G}^{(n)}_{j,s} d\hat{M}^{(n)}_{j,s}\),其中 \(\hat{G}^{(n)}\) 和 \(\hat{\lambda}^{(n)}\) 是基于训练集(或交叉拟合)的 nuisance 估计。 2. 将 \(\hat{\gamma}^{(n)}_t\) 分解为 \(U^{(n)}_t + R^{(n)}_{1,t} + R^{(n)}_{2,t} + R^{(n)}_{3,t} + D^{(n)}_{1,t} + D^{(n)}_{2,t}\)(见原文方程 (17))。 3. 证明 \(U^{(n)}\) 是鞅,其分布收敛到高斯鞅(由鞅中心极限定理)。 4. 证明 \(R_1, R_2, R_3\) 在交叉拟合和 nuisance 估计的适度速率条件下收敛到零(这是双机器学习的关键——通过样本分割打破 nuisance 估计与主估计之间的相关性)。 5. 在 \(H_0\) 下 \(D_1 = D_2 = 0\);在备择下 \(D_1\) 驱动检验功效。

这个最小内核揭示了本文的核心思想:将"局部独立性"这一动态假设转化为"残差过程与鞅的协方差是否为零"这一可检验的泛函参数问题。残差化(residualization)是关键——它使得 nuisance 参数(\(\lambda\) 和 \(\Pi\))的估计误差不进入一阶渐近项,从而允许使用慢速收敛的非参数估计器。

一般化:从最小内核到完整设定,需要处理:(i) \(X\) 随时间变化(càglàd 过程);(ii) 存在额外协变量 \(Z\)(此时 \(\mathcal{F}_t\) 包含 \(Z\) 的历史);(iii) 检验统计量从端点 \(\hat{\gamma}^{(n)}_1\) 推广到 \(\sup\) 范数 \(\sup_t |\hat{\gamma}^{(n)}_t|\)。这些推广增加了技术复杂性(需要 uniform 收敛和 Skorokhod 空间上的弱收敛),但核心思想不变。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在连续时间随机过程框架下,如何非参数地检验"计数过程 \(N\) 是否条件局部独立于过程 \(X\) 给定滤波 \(\mathcal{F}\)"这一假设。
  2. 核心工具/方法:引入局部协方差度量(LCM)\(\gamma_t = E(\int_0^t G_s dM_s)\) 作为偏离 \(H_0\) 的泛函参数,基于双机器学习(double machine learning)构造估计量,结合鞅理论、均匀弱收敛和交叉拟合证明其渐近性质。
  3. 主要结论:在 nuisance 估计量(\(\lambda\) 和 \(G\))以适度速率一致收敛的条件下,LCM 估计量以 \(\sqrt{n}\) 速率均匀收敛到高斯鞅;基于 \(\sup\) 范数的检验统计量在 \(H_0\) 下收敛到 \(\sup\) 布朗桥,从而可以构造渐近水平 \(\alpha\) 的检验,并对 \(\|\gamma\|_\infty \ge c n^{-1/2}\) 的局部备择具有一致功效。

关键设定与假设

设定(在第二节最小记号基础上补全):

  • \(n\) 个独立同分布的过程三元组 \((N_j, X_j, \mathcal{F}_j)\),定义在公共概率空间 \((\Omega, \mathcal{F}, P)\) 上,时间区间 \([0,1]\)。
  • \(N_j\) 是 \(\mathcal{F}_j\)-适应计数过程,\(\mathcal{F}_j\) 是右连续完备滤波。
  • \(X_j\) 是 càglàd 实值过程,\(\mathcal{G}_j\) 是由 \(\mathcal{F}_j\) 和 \(X_j\) 生成的扩展滤波。
  • \(N_j\) 有 \(\mathcal{G}_j\)-强度 \(\underline{\lambda}_j\) 和 \(\mathcal{F}_j\)-强度 \(\lambda_j\)。\(H_0\):\(\underline{\lambda}_j = \lambda_j\)(即 \(X\) 不提供关于 \(N\) 的额外预测信息)。

核心假设(逐条说明统计含义):

  • 假设 4.1(有界性):\(\lambda\) 和 \(G\) 一致有界。统计含义:保证随机积分是真正的鞅(而非局部鞅),且矩条件成立。这是技术性假设,作者在讨论部分承认可以放宽。
  • 假设 4.2(nuisance 估计速率):\(\|\hat{G}^{(n)} - G\|_2 = o_P(1)\),\(\|\hat{\lambda}^{(n)} - \lambda\|_2 = o_P(1)\),且 \(\sqrt{n}\|\hat{G}^{(n)} - G\|_2 \|\hat{\lambda}^{(n)} - \lambda\|_2 = o_P(1)\)。统计含义:这是双机器学习的关键条件——两个 nuisance 参数的估计误差的乘积必须为 \(o_P(n^{-1/2})\)。这比要求每个 nuisance 估计都达到 \(\sqrt{n}\) 速率弱得多。例如,若两个 nuisance 都以 \(n^{-1/4}\) 速率收敛,则乘积为 \(n^{-1/2}\),满足条件。这正是非参数估计(如核平滑、随机森林)可以达到的速率。
  • 假设 5.1(方差下界):\(V^\theta(1) \ge \delta_1 > 0\) 对所有 \(\theta \in \Theta\)。统计含义:保证检验统计量的分母不会退化,从而检验具有非平凡的功效。

相比已有文献的放宽/强化: - 相比 Cox 模型检验:放宽了模型假设——不要求强度比满足比例风险形式,允许任意非参数形式。 - 相比静态条件独立性检验(GCM 等):强化了设定——处理的是动态过程中的逐时刻影响,而非静态条件分布;同时放宽了 nuisance 估计的要求——GCM 需要 nuisance 以 \(n^{-1/4}\) 速率收敛,本文的假设 4.2 允许更慢的速率(只要乘积条件满足)。 - 相比 Hawkes 过程方法:放宽了线性假设——不要求强度是历史事件的线性函数。

主要结果

定理 4.6(核心定理):

  • (i) 在 \(H_0\) 下,\(\sqrt{|J_n|}\hat{\gamma}^{(n)} \Rightarrow U\) 在 \(D[0,1]\) 中,其中 \(U\) 是均值零的连续高斯鞅,方差函数为 \(V(t) = E(\int_0^t G_s^2 dN_s)\)。
  • (ii) 对加法残差过程,\(\sqrt{|J_n|}(\hat{\gamma}^{(n)} - \gamma)\) 在 \(D[0,1]\) 中一致 tight,且 \(\sqrt{|J_n|}\|\hat{\gamma}^{(n)} - \gamma\|_\infty = O_P(1)\)。

定理 5.1(水平控制):在假设 4.1、4.2、5.1 下,LCT 统计量 \(\hat{T}_n = \sqrt{|J_n|} \sup_{0\le t\le 1} |\hat{\gamma}^{(n)}_t| / \sqrt{\hat{V}_n(1)}\) 在 \(H_0\) 下收敛到 \(S = \sup_{0\le t\le 1} |B_t|\),其中 \(B\) 是标准布朗运动。因此检验 \(\Psi_n = \mathbf{1}(\hat{T}_n > z_{1-\alpha})\) 具有渐近水平 \(\alpha\)。

定理 5.2(功效):对加法残差过程,存在 \(c > 0\) 使得对所有满足 \(\|\gamma^\theta\|_\infty \ge c|J_n|^{-1/2}\) 的 \(\theta\),检验的功效至少为 \(\beta > \alpha\)。即检验对 \(\sqrt{n}\) 局部备择具有一致功效。

证明路线(3-5 步逻辑主干):

  1. 分解:将 \(\sqrt{|J_n|}\hat{\gamma}^{(n)}\) 分解为 \(U^{(n)} + R^{(n)}_1 + R^{(n)}_2 + R^{(n)}_3 + D^{(n)}_1 + D^{(n)}_2\)(方程 17)。其中 \(U^{(n)}\) 是"oracle"鞅项(使用真实 nuisance),\(R\) 项是 nuisance 估计误差引起的余项,\(D\) 项是 \(H_0\) 与备择之间的偏差项。
  2. 控制 \(U^{(n)}\):证明 \(U^{(n)}\) 是鞅,其二次变差收敛到 \(V(t)\)。利用鞅中心极限定理(Rebolledo 定理)的均匀版本(定理 C.4),得到 \(U^{(n)} \Rightarrow U\) 在 \(D[0,1]\) 中。
  3. 控制余项 \(R_1, R_2, R_3\):利用交叉拟合(样本分割)使 nuisance 估计与主样本独立,然后通过条件期望和 Cauchy-Schwarz 不等式将 \(R\) 项绑定到 \(\sqrt{n}\|G - \hat{G}\|_2 \|\lambda - \hat{\lambda}\|_2\)。假设 4.2 保证这些项为 \(o_P(1)\)。\(R_3\) 通过 Doob 不等式控制。
  4. 控制偏差项 \(D_1, D_2\):在 \(H_0\) 下 \(D_1 = D_2 = 0\)。在备择下,\(D_1\) 的期望等于 \(\sqrt{|J_n|}\gamma\),驱动检验功效。\(D_2\) 对加法残差过程为零(因为 \(X\) 在 \(\hat{G} - G\) 中抵消),对一般残差过程可能有偏差,作者未完全解决。
  5. 方差估计与连续映射:证明 \(\hat{V}_n(t)\) 一致收敛到 \(V(t)\),然后利用连续映射定理得到检验统计量的极限分布。

技术技巧点名:

  • 交叉拟合(cross-fitting):将样本分为 \(K\) 折,每折的 nuisance 估计基于其他 \(K-1\) 折,从而打破 nuisance 估计与主估计之间的相关性。这是双机器学习的核心技巧,用于避免 Donsker 类条件。
  • 均匀鞅中心极限定理(定理 C.4):将经典的 Rebolledo 定理推广到均匀收敛(在参数空间 \(\Theta\) 上一致),这是获得 uniform level 控制的关键。
  • Skorokhod 空间 \(D[0,1]\) 上的弱收敛:将有限维收敛 + tightness 结合,得到过程级收敛。
  • 链式不等式(chaining):用于控制余项 \(R_1\) 的随机等度连续性。
  • Neyman 正交化:通过残差过程 \(G_t = X_t - \Pi_t\) 实现正交化,使得分函数对 nuisance 参数的一阶偏差不敏感。

真实例子与应用

模拟研究(第 6 节):

  • 数据生成:基于第 2.2 节的 Cox 模型,\(N_t = \mathbf{1}(T \leq t)\),强度为 \(\lambda^{\text{full}}_t = \mathbf{1}(T \geq t)\lambda_0(t) e^{Y_t + \beta Z_t}\),其中 \(Y\) 是未观测过程,\(Z\) 是观测协变量。\(X\)(养老金储蓄)通过历史模型 \(X_t = \int_0^t Z_s \rho_X(s,t) ds + V_t\) 依赖于 \(Z\),而 \(Y\) 通过 \(Y_t = \int_0^t Z_s \rho_Y(s,t) ds + W_t\) 依赖于 \(Z\)。当 \(\rho_Y \neq 0\) 时,\(Z\) 通过 \(Y\) 间接影响 \(N\),而 \(X\) 与 \(Y\) 通过 \(Z\) 相关,因此 \(N\) 不局部独立于 \(X\) 给定 \(Z\) 的历史。
  • 方法:比较 X-LCT 与基于边际 Cox 模型的检验(检验 \(\alpha_1 = 0\) 在模型 (11) 中)。
  • 结果:
  • 在 \(H_0\) 下(\(\rho_Y = 0\)),X-LCT 的 p 值近似均匀分布(图 5),而 Cox 检验的 p 值在零核(\(\rho_X = 0\))时近似均匀,但在非零核时严重 sub-uniform(过度拒绝)。
  • 在备择下(\(\rho_Y \neq 0\)),X-LCT 的功效随 \(n\) 增加而增加(图 6),而 Cox 检验在某些设置下完全没有功效(因为边际 Cox 模型无法捕捉通过 \(Y\) 的间接效应)。
  • 交叉拟合对消除偏差至关重要:不使用交叉拟合的 X-LCT 在 \(H_0\) 下有明显偏差(图 3 和图 4)。
  • 这个例子说明什么:边际 Cox 模型检验在模型误设下(遗漏 \(Y\) 或 \(X\) 的时变效应)会失效,而 X-LCT 作为非参数方法,不需要指定强度函数的具体形式,因此对模型误设具有鲁棒性。

🔎 结论是否比证明窄

  • 明确窄的地方:
  • 定理 4.6(ii) 只对加法残差过程证明了 \(D_2\) 的收敛性。对一般残差过程(如分位数残差),\(D_2\) 的行为未完全刻画,作者在第 7 节承认这一点。
  • 假设 4.1 要求 \(\lambda\) 和 \(G\) 一致有界,这在实践中可能不成立(如强度无上界的计数过程)。作者在第 7 节推测可以放宽为矩条件,但未给出证明。
  • 功效定理 5.2 只对 \(\|\gamma\|_\infty \ge c n^{-1/2}\) 的备择成立,这是"局部备择"——对固定备择(\(\|\gamma\|_\infty\) 不随 \(n\) 衰减)的功效是平凡的,但对更弱的备择(如 \(\|\gamma\|_\infty = o(n^{-1/2})\))没有结果。
  • 模拟只覆盖了 Cox 模型这一种数据生成机制,未测试其他类型的计数过程(如 Hawkes 过程)或更复杂的依赖结构。
  • 可能被泛化的地方:作者在第 1 节声称"第一个非参数条件局部独立性检验",但这一声明依赖于对"非参数"的定义——如果允许半参数模型(如部分线性 Cox 模型),则已有工作可能更早。作者没有系统比较与半参数方法的优劣。

四、开放问题

  1. 一般残差过程的 \(D_2\) 项:作者只对加法残差过程证明了 \(D_2\) 的收敛性。对分位数残差或其他非线性残差,\(D_2\) 是否仍可忽略?这需要新的技术来处理非可加残差带来的偏差。(扎根于第 7 节:"For a general residual process, it seems possible for \(D^{(n)}_2\) to have a bias of order \(\sqrt{|J_n|}g(n)\).")

  2. 放宽有界性假设:假设 4.1 要求 \(\lambda\) 和 \(G\) 一致有界。能否放宽为矩条件或更弱的尾部条件?这需要更精细的鞅不等式和均匀收敛理论。(扎根于第 7 节:"we believe that it is possible to relax Assumption 4.1 to a weaker form of control on the magnitudes of \(\lambda\) and \(G\) as functions of time, for example, moment bounds uniform in \(\theta\).")

  3. nuisance 估计的速率条件:假设 4.2 要求 \(\sqrt{n}\|G - \hat{G}\|_2 \|\lambda - \hat{\lambda}\|_2 = o_P(1)\)。对高维 nuisance(如高维协变量下的正则化估计),这个条件是否成立?需要研究高维稀疏模型下的速率条件。(扎根于第 7 节和附录 D 中对历史回归方法的讨论。)

  4. 功效的局部备择方向:定理 5.2 只覆盖 \(\|\gamma\|_\infty \ge c n^{-1/2}\) 的备择。对更弱的备择(如 \(\gamma\) 在 \(L^2\) 范数下衰减但 \(\sup\) 范数不衰减),检验的功效如何?这需要更精细的局部功效分析。

  5. 扩展到一般半鞅:作者在第 7 节推测结果可以推广到 \(N\) 为一般半鞅的情形,但未给出具体条件。这需要处理连续部分和跳跃部分的交互。

  6. 实际应用中的 nuisance 估计选择:附录 D 中讨论了历史线性回归等估计方法,但未给出明确的选择准则。在实际应用中,如何选择 \(\hat{\lambda}\) 和 \(\hat{G}\) 的估计方法以达到假设 4.2 的速率条件?


提示:若要确认上述开放问题是否为真 gap,建议去读以下近期文献的引言部分(约 5 篇):(1) 关于条件独立性检验的近期工作(如 Lundborg et al. 2022 之后的后续工作);(2) 关于局部独立性图学习的近期工作(如 Mogensen and Hansen 2022 之后的后续工作);(3) 关于双机器学习在生存分析中的应用。如果这些文献的引言都指向同一批未解决问题,那就是共识性 gap;如果它们互相矛盾(例如,有的声称已解决 \(D_2\) 问题,有的认为未解决),那就是机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论