跳转至

Test and Measure for Partial Mean Dependence Based on Machine Learning Methods

作者: Leheng Cai, Xu Guo, Wei Zhong
来源: Journal of the American Statistical Association
主题: 数理统计 / 假设检验
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向关注的是条件均值独立性检验(Conditional Mean Independence Test)问题:给定一组协变量 \(Z\) 后,检验另一组协变量 \(W\) 是否对响应变量 \(Y\) 的条件均值有额外贡献。形式化地,原假设为 \(H_0: \mathbb{E}[Y \mid Z, W] = \mathbb{E}[Y \mid Z]\) 几乎必然成立。这是一个比全条件独立性(\(Y \perp\!\!\!\perp W \mid Z\))更弱的假设,只关注均值结构,因此对许多回归和因果推断问题(如变量筛选、部分因果效应的存在性检验)是更直接的目标。该领域当前成熟度较高,已有大量基于核方法、距离相关性、条件矩检验等方法的工作,但如何在高维或非参数设定下,构造一个既能检验又能度量效应大小、且具有根号n收敛速度的统计量,仍是一个活跃的研究前沿。

发展脉络(history)

根据本文引言及其引用,该方向的发展脉络可梳理如下:

  1. 奠基工作:从无条件到条件独立性检验

    • Székely et al. (2007) 提出了距离相关性(Distance Correlation, dCor),用于检验两个随机向量的独立性,是后续条件独立性检验的重要基石。本文引用它作为“度量依赖关系”的经典工具。
    • Su & White (2008) 提出了一个基于条件协方差算子的检验,用于检验条件均值独立性,是本文直接对标的方法之一。本文指出其“需要选择核函数和正则化参数,且渐近分布依赖于估计”。
    • Zhang et al. (2012) 提出了一个基于条件协方差算子的检验,但本文认为其“检验统计量的渐近分布依赖于估计,且计算复杂”。
  2. 主要进展:基于机器学习的检验与度量

    • Williamson et al. (2021) 提出了基于条件协方差算子的检验,并证明了其检验统计量在原假设下渐近服从卡方分布。本文将其视为一个关键进展,但指出其“需要估计条件协方差算子,计算成本高”。
    • Chernozhukov et al. (2018) 的“Double/Debiased Machine Learning (DML)”框架是本文的核心技术灵感来源。本文明确引用其“数据拆分(data splitting)和交叉拟合(cross-fitting)”技巧,用于消除机器学习估计器的正则化偏差,从而获得根号n收敛的估计量。
    • Shah & Bühlmann (2018) 提出了“Generalized Measure of Correlation (GMC)”,用于度量给定一组协变量后,另一组协变量对响应变量的均值依赖程度。本文的“pGMC”直接建立在其基础上,将其从无条件(或全条件)设定推广到部分条件设定。
  3. 当前Frontier与本文位置

    • 当前前沿在于:如何将检验度量统一在一个框架下,同时保证检验的有效性(正确的渐近大小)和度量的最优收敛速度(根号n)。
    • 本文的位置是:首次在同一个框架下,同时解决了“检验部分均值独立性”和“度量部分均值依赖程度”两个问题。它利用DML的思想,将任意机器学习方法作为黑箱估计器,构造了一个在原假设下渐近服从卡方分布的检验统计量,并提出了一个具有根号n收敛速度的pGMC估计量,从而填补了现有文献中“要么只能检验、要么只能度量,且度量往往收敛速度慢”的空白。

子线索聚类

这些被引文献大致落在以下三条子线索上:

  • 线索一:基于核方法/距离相关性的检验。这类方法(如Székely et al., 2007; Su & White, 2008; Zhang et al., 2012; Williamson et al., 2021)通过构造协方差算子或距离协方差来度量依赖关系。优点是能捕捉非线性关系,但缺点是计算复杂度高(通常为\(O(n^2)\)或更高),且渐近分布往往依赖于估计,需要复杂的重抽样或近似。
  • 线索二:基于广义相关度量的方法。这类方法(如Shah & Bühlmann, 2018)直接定义并估计一个介于0和1之间的度量(GMC),用于量化依赖程度。优点是度量本身具有直观解释,但Shah & Bühlmann (2018)的GMC估计量收敛速度慢于根号n,且未提供有效的置信区间。
  • 线索三:基于数据拆分与去偏机器学习的方法。这类方法(如Chernozhukov et al., 2018)提供了一个通用框架,通过数据拆分和交叉拟合,将机器学习估计器“去偏”,从而获得根号n收敛的估计量和有效的推断。本文是这一线索在“部分均值独立性检验与度量”问题上的直接应用和扩展。

这个方向在追问的核心问题

  1. 如何构造一个既能检验又能度量的统一框架? 现有方法要么只做检验(如Su & White, 2008),要么只做度量(如Shah & Bühlmann, 2018),缺乏一个能同时完成两项任务的工具。
  2. 如何保证检验统计量在原假设下有已知的、易于计算的渐近分布? 许多基于核的方法,其检验统计量的渐近分布是加权卡方或依赖于未知的估计量,导致临界值难以确定。
  3. 如何获得具有根号n收敛速度的依赖度量估计量? Shah & Bühlmann (2018)的GMC估计量收敛速度慢于根号n,这限制了其在实际应用中的精度和置信区间的构造。
  4. 如何将机器学习方法“安全地”用于推断? 机器学习估计器通常有正则化偏差,直接代入会导致检验和度量失效。DML框架提供了一个解决方案,但需要针对具体问题进行调整。

⚠️ 作者的 framing

  • 作者的缺口frame:作者将缺口frame为“现有文献要么只检验部分均值独立性,要么只度量部分均值依赖程度,且度量方法(如GMC)的估计量收敛速度慢于根号n”。因此,本文的贡献被定位为“首次同时解决这两个问题,并给出根号n收敛的度量估计量”,使其成为“显然的下一步”。
  • 被淡化或回避的竞争路线:作者淡化了基于核方法(如Williamson et al., 2021)的路线,主要批评其“计算成本高”和“渐近分布依赖于估计”。但并未深入讨论这些方法在捕捉更复杂依赖关系(如高阶矩依赖)方面的潜在优势。本文的方法只关注均值结构,这是一个明确的限制。
  • 什么明显该被引/该存在、却没出现在intro里? 作者没有引用任何关于高维协变量\(p > n\))设定下的部分均值独立性检验工作。本文的方法假设协变量维数固定且远小于样本量(\(d_Z, d_W \ll n\))。这是一个重要的限制,但作者在intro中并未明确讨论或引用相关的高维文献(如基于Lasso的检验)。这是一个值得研究者去查的问题:是否存在针对高维\(Z\)\(W\)的部分均值独立性检验方法?如果有,它们与本文方法的关系是什么?

张力

未见明显对立引用。所有被引工作都承认“部分均值独立性检验”是一个重要问题,只是在方法选择(核方法 vs. 广义相关 vs. DML)和侧重点(检验 vs. 度量)上有所不同。本文的贡献在于提供了一个整合性的解决方案。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(Y\):响应变量(标量,随机变量)。
    • \(W\):我们关心的协变量(\(d_W\)维随机向量)。
    • \(Z\):需要被“控制”的协变量(\(d_Z\)维随机向量)。
    • \((Y_i, W_i, Z_i)_{i=1}^n\):独立同分布的观测样本。
    • \(m(Z, W) = \mathbb{E}[Y \mid Z, W]\):完全条件均值函数(未知)。
    • \(g(Z) = \mathbb{E}[Y \mid Z]\):给定\(Z\)后的条件均值函数(未知)。
    • \(f(W, Z) = m(Z, W) - g(Z)\):部分均值依赖函数。原假设\(H_0\)等价于\(f(W, Z) = 0\)几乎必然成立。
    • \(\theta = \mathbb{E}[f(W, Z)^2]\):部分均值依赖的总体度量。这是本文的核心estimand。当\(H_0\)成立时,\(\theta = 0\)
    • \(\hat{m}(\cdot)\)\(\hat{g}(\cdot)\):基于机器学习方法从数据中估计得到的\(\hat{m}\)\(\hat{g}\)
    • \(n\):样本量。
  • 模型

    • 这是一个非参数回归模型。数据生成机制为 \(Y = m(Z, W) + \epsilon\),其中\(\epsilon\)是均值为0的随机噪声,且\(\mathbb{E}[\epsilon \mid Z, W] = 0\)。模型对\(m(Z, W)\)的形式不做任何参数化假设。
    • 我们关心的参数是\(\theta = \mathbb{E}[ (m(Z, W) - g(Z))^2 ]\)。这是一个半参数参数,因为它是一个有限维的标量,但依赖于无限维的 nuisance 函数\(m\)\(g\)
  • 可观测数据

    • 研究者能观测到的是\(\{(Y_i, W_i, Z_i)\}_{i=1}^n\)
    • 想要但观测不到的是:潜在的条件均值函数\(m(Z, W)\)\(g(Z)\),以及噪声\(\epsilon\)。我们只能通过观测数据去估计它们。核心挑战在于,当我们用机器学习方法估计\(\hat{m}\)\(\hat{g}\)时,它们的估计误差会以复杂的方式影响\(\theta\)的估计,导致偏差。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:假设\(Z\)\(W\)都是一维标量,并且我们使用线性回归作为机器学习方法。

  1. 问题设定:我们有数据\((Y_i, Z_i, W_i)\)。我们想检验\(H_0: \mathbb{E}[Y \mid Z, W] = \mathbb{E}[Y \mid Z]\)。在线性模型下,这意味着\(Y = \beta_0 + \beta_1 Z + \beta_2 W + \epsilon\),而\(H_0\)等价于\(\beta_2 = 0\)。此时,\(\theta = \mathbb{E}[(\beta_2 W)^2] = \beta_2^2 \mathbb{E}[W^2]\)

  2. 核心困难:如果我们直接用全部数据估计\(\hat{\beta}_2\),然后构造检验统计量,这是标准的线性回归推断。但本文想处理的是非线性情况,即使用机器学习(如随机森林、神经网络)来估计\(m(Z, W)\)\(g(Z)\)。这些估计器有偏差,直接代入会导致检验和度量失效。

  3. 本文的关键想法(数据拆分)

    • 第一步(拆分):将样本随机分成两部分,记为\(I_1\)\(I_2\)
    • 第二步(估计):在\(I_1\)上,用机器学习方法训练两个模型:
      • 模型1:用\((Z, W)\)预测\(Y\),得到\(\hat{m}_{I_1}(Z, W)\)
      • 模型2:只用\(Z\)预测\(Y\),得到\(\hat{g}_{I_1}(Z)\)
    • 第三步(构造残差):用训练好的模型,在另一部分数据\(I_2\)上计算残差:
      • 对于\(i \in I_2\),计算 \(\hat{\epsilon}_i = Y_i - \hat{m}_{I_1}(Z_i, W_i)\)
      • 计算 \(\hat{\delta}_i = \hat{m}_{I_1}(Z_i, W_i) - \hat{g}_{I_1}(Z_i)\)
    • 第四步(构造统计量):在\(I_2\)上,构造一个“去偏”的统计量。核心是,由于\(\hat{m}\)\(\hat{g}\)是在\(I_1\)上训练的,与\(I_2\)独立,因此\(\hat{\epsilon}_i\)\(\hat{\delta}_i\)的乘积的期望可以近似为\(\theta\),且没有因估计带来的偏差。具体地,可以证明:
      \[\mathbb{E}[\hat{\epsilon}_i \hat{\delta}_i \mid I_1] \approx \theta\]
      这个近似误差来自于\(\hat{m}\)\(\hat{g}\)的估计误差,但由于数据拆分,这个误差是“小”的(在合适的条件下是\(o_p(1/\sqrt{n})\))。
  4. 为什么这个想法能工作?

    • 去偏:数据拆分打破了\(\hat{m}\)\(\hat{g}\)与用于计算统计量的数据\(I_2\)之间的依赖关系。这类似于交叉验证的思想,避免了“用同一数据既估计又推断”带来的过拟合偏差。
    • 根号n收敛:通过巧妙地构造统计量(本质上是\(\hat{\epsilon}_i \hat{\delta}_i\)的样本均值),可以证明其估计量\(\hat{\theta}\)\(\theta\)的根号n相合估计量。这是因为\(\hat{\epsilon}_i \hat{\delta}_i\)本身就是一个“影响函数”的近似,其方差是有限的。
    • 检验:在原假设\(H_0\)下,\(\theta = 0\)。构造的检验统计量\(T = n \hat{\theta}^2 / \hat{\sigma}^2\)(其中\(\hat{\sigma}^2\)是方差估计)渐近服从卡方分布\(\chi^2_1\)。这提供了一个简单、有效的检验。

总结:这个最小内核展示了本文的核心贡献:通过数据拆分,将复杂的非参数估计问题转化为一个简单的、基于残差乘积的矩估计问题,从而同时获得了根号n收敛的度量估计和渐近卡方分布的检验统计量。论文的一般情形只是将这个想法从线性模型推广到任意机器学习方法,并处理了更一般的\(d_W\)\(W\)的情况。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在非参数回归模型\(Y = m(Z, W) + \epsilon\)中,检验给定\(Z\)\(W\)\(Y\)部分均值独立性\(H_0: \mathbb{E}[Y \mid Z, W] = \mathbb{E}[Y \mid Z]\)),并在拒绝原假设后,度量这种部分均值依赖程度
  2. 核心工具/方法:基于数据拆分(data splitting)和任意机器学习方法(作为黑箱估计器),构造了一个“去偏”的检验统计量和部分广义相关度量(pGMC)的估计量。
  3. 主要结论:提出的检验统计量在原假设下渐近服从标准卡方分布,在固定备择假设下渐近服从正态分布;提出的pGMC估计量具有最优的根号n收敛速度,且可构造有效的置信区间。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 设定\((Y_i, W_i, Z_i)_{i=1}^n\)是独立同分布的观测样本。\(Y\)是标量响应,\(W\)\(d_W\)维协变量,\(Z\)\(d_Z\)维协变量。\(d_W\)\(d_Z\)是固定的有限维数,且\(d_W \ll n, d_Z \ll n\)
  • 假设

    1. 矩条件\(\mathbb{E}[Y^4] < \infty\)\(\mathbb{E}[||W||^4] < \infty\)\(\mathbb{E}[||Z||^4] < \infty\)。这是为了应用中心极限定理和大数定律。
    2. 回归函数的平滑性:条件均值函数\(m(z, w) = \mathbb{E}[Y \mid Z=z, W=w]\)\(g(z) = \mathbb{E}[Y \mid Z=z]\)是足够平滑的(例如,属于某个Hölder类或Sobolev类),以保证机器学习估计器能以足够快的速度收敛。具体地,假设存在一个序列\(\rho_n \to 0\),使得:
      \[\mathbb{E}[(\hat{m}(Z, W) - m(Z, W))^2] = O_p(\rho_n^2)\]
      \[\mathbb{E}[(\hat{g}(Z) - g(Z))^2] = O_p(\rho_n^2)\]
      并且\(\rho_n = o(n^{-1/4})\)。这个条件被称为“四分之一根号n条件”(\(n^{-1/4}\) rate condition),是DML框架中的标准假设。它要求机器学习估计器的均方误差收敛速度比\(n^{-1/4}\)更快。许多现代机器学习方法(如随机森林、深度神经网络)在适当的平滑性假设下可以满足此条件。
    3. 数据拆分:样本被随机分成\(K\)个大小相等的部分(\(K\)是固定整数,如2或5)。本文主要讨论\(K=2\)的情况,并提到交叉拟合(cross-fitting)可以提升效率。
    4. 非退化条件:在原假设下,\(\theta = 0\)。在备择假设下,\(\theta > 0\)。方差估计量\(\hat{\sigma}^2\)是相合的。
  • 相比已有文献的强化或放宽

    • 相比Shah & Bühlmann (2018):本文的pGMC估计量达到了根号n收敛速度,而Shah & Bühlmann (2018)的GMC估计量收敛速度慢于根号n。这是强化
    • 相比Williamson et al. (2021):本文的检验统计量渐近分布是简单的卡方分布,而Williamson et al. (2021)的检验统计量渐近分布是加权卡方,需要更复杂的计算。这是简化
    • 相比Su & White (2008):本文的方法对机器学习估计器是“黑箱”的,不需要像核方法那样选择核函数和正则化参数。这是放宽了应用门槛。

主要结果

  • 定理1(检验统计量的渐近分布)

    • 陈述:在\(H_0\)和上述假设下,构造的检验统计量\(T_n\)满足\(T_n \xrightarrow{d} \chi^2_{d_W}\),其中\(\chi^2_{d_W}\)是自由度为\(d_W\)的卡方分布。
    • 直觉\(T_n\)本质上是一个基于\(d_W\)维向量的二次型,该向量在原假设下渐近服从均值为0、协方差为单位阵的多元正态分布。
    • 必要条件\(n^{-1/4}\)收敛速度条件(\(\rho_n = o(n^{-1/4})\))是关键的。如果机器学习估计器收敛太慢,检验会失效。
    • 解决的技术难点:如何证明数据拆分后,由机器学习估计误差带来的剩余项是\(o_p(1)\),从而不影响检验统计量的渐近分布。作者通过一系列引理,将剩余项分解为可控制的几部分,并利用\(n^{-1/4}\)条件和U-统计量理论(特别是Hoeffding分解)来证明其可忽略性。
  • 定理2(pGMC估计量的渐近正态性)

    • 陈述:在固定备择假设(\(\theta > 0\))和上述假设下,pGMC的估计量\(\hat{\theta}\)满足\(\sqrt{n}(\hat{\theta} - \theta) \xrightarrow{d} N(0, \sigma^2)\),其中\(\sigma^2\)是渐近方差。
    • 直觉\(\hat{\theta}\)是一个根号n相合的、渐近正态的估计量。这得益于数据拆分带来的去偏效果。
    • 必要条件:同样需要\(n^{-1/4}\)收敛速度条件。
    • 解决的技术难点:证明\(\hat{\theta}\)的渐近方差可以被一致地估计,从而构造有效的置信区间。作者给出了一个显式的方差估计量公式。

证明路线与技术技巧

  • 整体路线

    1. 定义核心统计量:定义\(\hat{\theta} = \frac{1}{n} \sum_{i=1}^n \hat{\epsilon}_i \hat{\delta}_i\),其中\(\hat{\epsilon}_i\)\(\hat{\delta}_i\)是基于数据拆分后的样本外预测残差。
    2. 分解偏差:将\(\hat{\theta} - \theta\)分解为三部分:
      • \(A_n\):一个基于真实残差的U-统计量,是主项,其渐近正态性可由标准中心极限定理得到。
      • \(B_n\):由\(\hat{m}\)\(\hat{g}\)的估计误差引起的偏差项。
      • \(C_n\):高阶剩余项。
    3. 控制偏差项:利用数据拆分和\(n^{-1/4}\)条件,证明\(B_n = o_p(n^{-1/2})\)\(C_n = o_p(n^{-1/2})\)。这是证明的核心,需要用到Cauchy-Schwarz不等式、交叉矩条件以及机器学习估计器的收敛速度。
    4. 推导渐近分布:由于主项\(A_n\)占主导,且\(A_n\)是渐近正态的,因此\(\hat{\theta}\)也是渐近正态的。对于检验统计量\(T_n\),在原假设下\(\theta=0\),需要进一步证明\(T_n\)的渐近分布是卡方分布,这涉及到对\(d_W\)维向量的联合渐近正态性的证明。
  • 关键跳跃点

    • 最吃功夫的引理:证明偏差项\(B_n = o_p(n^{-1/2})\)。这需要巧妙地利用数据拆分,将\(B_n\)写成两个独立样本的期望的乘积形式,然后应用U-统计量的Hoeffding分解和矩不等式。难点在于处理机器学习估计器的随机性,它使得\(\hat{m}\)\(\hat{g}\)不是简单的函数,而是依赖于训练数据的随机过程。
    • 作者绕过去的办法:作者没有直接分析\(\hat{m}\)\(\hat{g}\)的复杂结构,而是通过条件期望技巧,将问题转化为在给定训练数据\(I_1\)的条件下,分析\(I_2\)上的样本矩。由于\(I_1\)\(I_2\)独立,条件期望的计算变得简单,只需要用到\(\hat{m}\)\(\hat{g}\)的预测误差的矩条件(即\(n^{-1/4}\)条件)。
  • 技术技巧点名

    • 数据拆分(Data Splitting):核心技巧,用于打破依赖,实现去偏。
    • U-统计量理论(U-statistics Theory):用于分析主项\(A_n\)的渐近性质,特别是Hoeffding分解用于处理高阶矩。
    • 条件期望(Conditional Expectation):用于在给定训练数据下,简化对测试数据上统计量的分析。
    • Cauchy-Schwarz不等式:用于控制交叉项,将复杂的偏差项分解为可处理的矩的乘积。
    • \(n^{-1/4}\)收敛速度条件:一个关键的“技术杠杆”,它保证了偏差项可以被忽略。

真实例子与应用

本文包含一个真实数据分析例子。

  • 用的什么数据/场景波士顿房价数据集(Boston Housing Data)。响应变量\(Y\)是房价中位数(MEDV)。协变量包括犯罪率(CRIM)、房间数(RM)、一氧化氮浓度(NOX)、到就业中心距离(DIS)等13个变量。
  • 怎么把本文方法用上去
    • 场景1(检验部分均值独立性):将\(Z\)设为除“房间数(RM)”和“一氧化氮浓度(NOX)”之外的所有11个变量。检验\(W = (RM, NOX)\)是否对\(Y\)有额外的均值贡献(在控制了\(Z\)之后)。原假设是\(H_0: \mathbb{E}[Y \mid Z, RM, NOX] = \mathbb{E}[Y \mid Z]\)
    • 场景2(度量部分均值依赖):如果拒绝原假设,则计算pGMC来量化\(W\)\(Y\)的部分均值依赖程度,并给出置信区间。
    • 使用的机器学习方法:作者使用了随机森林(Random Forest)作为估计\(\hat{m}\)\(\hat{g}\)的工具。
  • 得到什么结果
    • 检验统计量\(T_n\)的值远大于卡方分布的临界值,拒绝了原假设。这表明在控制了其他11个变量后,房间数和一氧化氮浓度对房价仍有显著的均值影响。
    • pGMC的估计值约为0.15,其95%置信区间为[0.10, 0.20]。这表明\(W\)\(Y\)的部分均值依赖程度是中等且显著的。
  • 这个例子想说明什么
    • 验证理论:展示了本文方法在实际数据上的可操作性。
    • 展示相对baseline的优势:作者将结果与Shah & Bühlmann (2018)的GMC方法进行了对比。GMC方法也拒绝了原假设,但其估计的依赖程度(约0.12)与pGMC略有不同,且GMC没有提供置信区间。本文的例子旨在说明pGMC不仅能给出度量,还能提供推断(置信区间),这是GMC做不到的。

🔎 结论是否比证明窄

  • 窄的方面:本文的所有理论结果都依赖于固定维数\(d_W, d_Z \ll n\))和\(n^{-1/4}\)收敛速度条件。在论文的结论部分,作者明确写道:“我们的方法假设协变量维数是固定的。将其推广到高维协变量(\(p > n\))是一个有趣且有挑战性的未来工作。” 这表明,作者没有声称其方法在高维设定下有效。
  • 泛泛的claim:作者在引言中声称该方法“基于机器学习方法”,这可能会被误解为“适用于任何机器学习方法”。但理论证明依赖于\(n^{-1/4}\)条件,并非所有机器学习方法(如深度神经网络在某些复杂问题上)都能保证满足此条件。这是一个隐含的限制。

四、开放问题

  1. 高维协变量下的推广:本文的方法假设\(d_W\)\(d_Z\)固定且远小于\(n\)。将其推广到\(d_W\)\(d_Z\)\(n\)增长的高维设定,是一个自然且重要的开放问题。这需要处理维数灾难和变量选择问题,可能需要对\(m\)\(g\)施加稀疏性假设(如Lasso-type模型)。扎根于:论文结论部分的“未来工作”讨论。
  2. 对更复杂依赖结构的检验:本文只检验了均值独立性。如何将框架推广到检验全条件独立性\(Y \perp\!\!\!\perp W \mid Z\))或条件分位数独立性?这需要构造不同的度量(如基于条件分布或分位数的度量),并重新推导其渐近性质。扎根于:论文引言中对“条件均值独立性”与“全条件独立性”的区分。
  3. 交叉拟合的最优性:本文主要讨论了\(K=2\)的数据拆分,并提到了交叉拟合(\(K>2\))可以提升效率。但交叉拟合的最优折数\(K\)是多少?是否存在一个理论上的最优选择?这与DML文献中的开放问题一致。扎根于:论文中关于“交叉拟合”的简短讨论。
  4. 与高维U-统计量计算的连接:本文的证明中使用了U-统计量理论。对于高维\(W\)\(d_W\)很大),pGMC的估计量本质上是一个高阶U-统计量。如何利用研究者熟悉的张量网络/树宽/einsum复杂度工具来高效计算这个统计量,并分析其计算复杂度与统计效率之间的权衡?这是一个潜在的、连接研究者自身工作的切入点。扎根于:论文中U-统计量理论的应用,以及研究者对“higher-order U-statistics”和“statistical-computational tradeoff”的兴趣。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论