Model-free and Distributionally Robust Feature Screening with False Discovery Control for High-Dimensional Heterogeneous Data¶
作者: Cong Cheng, Runze Li, Yuan Ke
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2609.23635
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的子方向是高维特征筛选(feature screening),其根本统计问题是:当特征维度 \(p\) 远超样本量 \(n\) 时,如何在不拟合完整模型的前提下,快速、可靠地剔除大量无关特征,将维度降到适合后续精细建模的规模。该方向的成熟度较高——自 Fan & Lv (2008) 提出 SIS 以来,近二十年涌现了大量变体,但多数方法仍依赖线性模型假设、矩条件或同分布假设,对"特征边际分布高度异质"的数据(如金融中不同股票的收益分布差异巨大)缺乏鲁棒性。本文试图在这一缺口上做出贡献。
发展脉络(history)¶
- 奠基工作:Fan & Lv (2008) 提出 SIS,基于 Pearson 相关系数做边际筛选,并证明了在线性模型下的 sure screening 性质。这是整个领域的起点,其核心思想——"用边际相关性排序特征"——至今仍是主流范式。但它的局限也很明确:仅捕捉线性关联,且对重尾或非线性关系失效。
- 模型-free 化转向:Zhu, Li, Li & Zhu (2011) 提出基于距离相关(distance correlation)的 DC-SIS,首次将 screening 从线性模型推广到一般回归设定,无需指定模型形式。Li, Zhong & Zhu (2012) 进一步系统化了 DC-SIS 的理论与算法。这一脉的关键贡献是:用独立性度量替代相关系数,从而捕捉非线性关联。但 DC-SIS 对特征分布仍有隐含要求(如有限二阶矩)。
- 鲁棒性与异质性处理:Cui, Li & Zhong (2015) 将 screening 推广到判别分析(分类响应);Zhou & Zhu (2018)、Liu et al. (2022) 等进一步引入条件分布函数、秩变换等工具,试图放松分布假设。Liu, Ke, Liu & Li (2022) 提出的模型-free screening + FDR 控制框架(即本文的 PC-FDR 对比方法)是最近的直接竞争者,它用投影相关(projection correlation)做度量,并引入 knockoff 特征来控制 FDR。
- Wasserstein 依赖度量的兴起:Mordant & Segers (2022) 提出基于最优传输的 Wasserstein 依赖度量,理论上可捕捉任意形式的依赖,但如本文指出,其值受边际分布尺度影响,无法直接用于跨特征比较。Ozair et al. (2019)、Catalano et al. (2024)、De Keyser & Gijbels (2025) 等将其推广到表示学习与高维设定,但均未解决"边际异质性下的可比性"问题。
- 本文的位置:作者声称,现有模型-free 方法要么依赖矩条件(DC-SIS),要么对边际分布敏感(Wasserstein 依赖),要么需要样本分割(knockoff)。本文提出 Copula 散度(Copula Divergence),通过 probit 变换将边际标准化,从而在不依赖模型、不依赖矩条件、不依赖同分布假设的前提下,实现可跨特征比较的依赖度量,并配套 FDR 控制程序。
子线索聚类¶
- 基于相关系数的 screening(SIS 及其变体):依赖线性模型,计算最快,但假设最强。
- 基于独立性度量的 screening(DC-SIS、MDC-SIS、投影相关):模型-free,但通常需要矩条件或同分布假设。
- 基于最优传输的依赖度量(Wasserstein 依赖、Copula 散度):理论上最一般,但计算成本高,且如何做推断(尤其 FDR 控制)是开放问题。
- FDR 控制与 screening 的结合(knockoff、数据分割):解决"筛多少"的问题,但 knockoff 依赖特征联合分布的可估计性,数据分割牺牲效率。
这个方向在追问的核心问题¶
- 如何在不指定模型的前提下定义"相关"? 现有答案从线性相关 → 距离相关 → 投影相关 → 最优传输距离,每一步都在放松假设,但代价是计算与推断难度上升。
- 如何保证跨特征的度量可比性? 当特征边际分布差异巨大时,任何依赖原始尺度的度量都会失真。这是本文的核心切入点。
- 如何在 screening 阶段控制错误发现率? 传统 screening 只保证"不遗漏"(sure screening),但允许大量误选;FDR 控制需要构造有效的零分布或置换分布,在高维异质性下尤其困难。
⚠️ 作者的 framing(这是作者的说法)¶
作者将缺口 frame 为:"现有模型-free screening 方法要么依赖矩条件(如 DC-SIS),要么对边际分布敏感(如 Wasserstein 依赖),要么需要样本分割(如 knockoff)。" 因此,本文的 Copula 散度是"显然的下一步"——它同时解决这三个问题。被淡化的竞争路线包括:基于秩的相关系数(如 Spearman's ρ)其实也能实现边际不变性,但作者未在 intro 中讨论;条件 screening 方法(如条件距离相关)能处理特征间相关性,但本文完全未提及。值得去查的问题:为什么不用秩相关?秩相关与 probit 变换后的相关性有何本质区别?作者未给出比较。
张力¶
未见明显对立引用。但一个潜在张力是:Mordant & Segers (2022) 的 Wasserstein 依赖度量被本文批评为"边际敏感",但该文作者可能认为这种敏感性本身携带信息(即边际尺度差异也是依赖的一部分)。两种立场各有道理,取决于应用场景。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据¶
符号清单(逐个点名):
| 记号 | 含义 | 类型 |
|---|---|---|
| \(Y\) | 响应变量(连续) | 可观测随机变量 |
| \(X_j\) | 第 \(j\) 个特征(连续) | 可观测随机变量 |
| \(\mathbf{X} = (X_1, \dots, X_p)^\top\) | 全部 \(p\) 个特征 | 可观测随机向量 |
| \(F_Y(\cdot)\), \(F_{X_j}(\cdot)\) | \(Y\) 和 \(X_j\) 的边际 CDF | 未知分布函数(需估计) |
| $F_{Y | X}(\cdot | \cdot)$ |
| $\mathcal{A} = {j : F_{Y | X} \text{ 函数依赖于 } X_j}$ | 活跃特征集(目标 estimand) |
| \(\mathcal{A}^c\) | 非活跃特征集 | 参数/目标量 |
| \(\mathcal{S}_\mathcal{A} = \|\mathcal{A}\|\) | 活跃特征个数 | 标量指标 |
| \(p\) | 特征维度 | 标量指标 |
| \(n\) | 样本量 | 标量指标 |
| \(\Phi(\cdot)\), \(\phi(\cdot)\) | 标准正态 CDF 和密度 | 已知函数 |
| \(S_j = \Phi^{-1}(F_{X_j}(X_j))\) | 第 \(j\) 个特征的 probit 变换 | 潜在/不可观测(依赖未知 \(F_{X_j}\)) |
| \(T = \Phi^{-1}(F_Y(Y))\) | 响应的 probit 变换 | 潜在/不可观测 |
| \(\gamma_{S,T}\) | \((S,T)\) 的联合分布 | 潜在分布 |
| \(\phi \otimes \phi\) | 两个独立标准正态的联合分布 | 已知分布(零假设下的参照) |
| \(\mathcal{W}_r(\mu, \nu)\) | \(r\)-Wasserstein 距离 | 度量 |
| \(CD(X_j, Y; r)\) | Copula 散度 | 参数/目标量 |
| \(\widehat{CD}(X_j, Y; r)\) | Copula 散度的样本估计 | 统计量 |
| \(\hat{F}_{X_j}(\cdot)\), \(\hat{F}_Y(\cdot)\) | 经验 CDF | 可观测(由样本计算) |
| \(\hat{s}_i, \hat{t}_i\) | 经验 probit 变换后的样本点 | 可观测(由样本计算) |
| \(\mathcal{H}\) | 零分布经验测度集合(由置换构造) | 构造对象 |
| \(\hat{F}_W(\cdot)\) | 零分布的经验 CDF | 构造对象 |
| \(\hat{U}_j\) | 特征 \(j\) 的"去偏"统计量 | 统计量 |
| \(\alpha\) | 目标 FDR 水平 | 用户设定参数 |
| \(T_\alpha\) | FDR 控制阈值 | 数据驱动阈值 |
模型(本文的核心设定):
- 无模型假设:不假设 \(Y\) 与 \(\mathbf{X}\) 之间有任何参数化关系(线性、可加、单指标等均不需要)。
- 活跃特征定义:\(j \in \mathcal{A}\) 当且仅当 \(F_{Y|X}\) 函数依赖于 \(X_j\)。等价地,\(X_j \not\perp Y \mid \mathbf{X}_{-j}\)(给定其他特征时,\(X_j\) 与 \(Y\) 不独立)。
- 边际异质性:允许 \(F_{X_1}, \dots, F_{X_p}\) 完全不同(如不同股票收益的分布差异巨大)。
- 稀疏性:\(\mathcal{S}_\mathcal{A} \ll p\),且允许 \(\mathcal{S}_\mathcal{A}\) 随 \(n\) 缓慢增长。
可观测数据:\(\{(x_i, y_i)\}_{i=1}^n\),其中 \(x_i = (x_{i,1}, \dots, x_{i,p})^\top \in \mathbb{R}^p\),\(y_i \in \mathbb{R}\)。不可观测:真实的边际 CDF \(F_{X_j}, F_Y\),以及真实的活跃集 \(\mathcal{A}\)。
关键识别逻辑:由于 \(S_j\) 和 \(T\) 的边际分布都被标准化为标准正态,\(CD(X_j, Y; r) = \mathcal{W}_r(\gamma_{S,T}, \phi \otimes \phi)\) 度量的是纯依赖结构,与边际尺度无关。若 \(X_j \perp Y\),则 \(\gamma_{S,T} = \phi \otimes \phi\),\(CD = 0\);若 \(X_j\) 与 \(Y\) 有任何形式的依赖,则 \(CD > 0\)。因此,Copula 散度是"零当且仅当独立"的边际不变度量。
第二步:最小内核¶
最简特例:假设 \(p = 2\),即只有一个候选特征 \(X_1\) 和一个响应 \(Y\)。此时活跃集 \(\mathcal{A}\) 要么是 \(\{1\}\)(若 \(X_1\) 与 \(Y\) 相关),要么是 \(\emptyset\)(若独立)。
要证的核心命题(退化为单特征情形):
当 \(X_1 \perp Y\) 时,\(\widehat{CD}(X_1, Y; r) \xrightarrow{p} 0\),且收敛速度足够快,使得在阈值 \(t_n \asymp n^{-\kappa}\) 下,\(X_1\) 不会被选入 \(\hat{\mathcal{A}}\)。
为什么这个命题非平凡:
-
经验 probit 变换引入相关性:\(\hat{s}_i = \Phi^{-1}\left(\frac{n}{n+1}\hat{F}_{X_1}(x_i)\right)\) 和 \(\hat{t}_i = \Phi^{-1}\left(\frac{n}{n+1}\hat{F}_Y(y_i)\right)\) 都是基于同一组样本计算的秩统计量。即使 \(X_1\) 与 \(Y\) 独立,\(\{\hat{s}_i\}\) 和 \(\{\hat{t}_i\}\) 之间也会因为秩的有限样本相关性而产生伪依赖。这就是本文提到的"double dipping"问题(Kriegeskorte et al., 2009)在 screening 语境下的体现。
-
Wasserstein 距离的估计误差:\(\widehat{CD}\) 是经验测度 \(\hat{\gamma}_{\hat{S},\hat{T}}\) 与 \(\phi \otimes \phi\) 之间的 Wasserstein 距离。即使真实 \(CD = 0\),由于经验测度的波动,\(\widehat{CD} > 0\) 几乎必然。需要控制这个波动幅度。
-
高维联合:当 \(p\) 很大时,需要同时对 \(p\) 个特征做上述判断,且要控制同时犯错的概率(FDR),而非单个特征的错误率。这需要理解 \(\{\widehat{CD}(X_j, Y; r)\}_{j=1}^p\) 的联合波动行为。
证明的核心思路(从定理 2.2/2.3 反推):
- 第一步:证明经验 probit 变换的收敛速度。\(\hat{s}_i\) 与 \(s_i\) 的差异由经验 CDF 的收敛速度控制,即 \(\sup_x |\hat{F}_{X_j}(x) - F_{X_j}(x)| = O_p(n^{-1/2})\)(Dvoretzky-Kiefer-Wolfowitz 不等式)。
- 第二步:利用 Wasserstein 距离对测度扰动的 Lipschitz 性质,将 \(\widehat{CD}\) 的误差分解为"经验测度误差" + "probit 变换误差"。
- 第三步:对 \(r=1\),利用 Kantorovich-Rubinstein 对偶,将 Wasserstein 距离转化为关于有界 Lipschitz 函数的 supremum,从而可以用经验过程理论(如 Talagrand 不等式)得到集中不等式。这就是定理 2.2 中 \(\log^2 n\) 项的来源。
- 第四步:对 \(r=2\),Wasserstein 距离没有简单的对偶形式,需要利用四阶矩条件(对应定理 2.3 中额外的 \(\exp(-C_2(n\varepsilon^2)^\beta)\) 项),通过更精细的耦合论证得到次高斯-次指数混合的集中界。
FDR 控制的最小逻辑(定理 4.1 的直觉):
- 对每个特征 \(j\),构造统计量 \(\hat{U}_j = \hat{F}_W(\widehat{CD}(X_j, Y; r)) - 1/2\),其中 \(\hat{F}_W\) 是零分布的经验 CDF。
- 关键性质:当 \(j \in \mathcal{A}^c\)(零假设成立)时,\(\hat{U}_j\) 近似对称于零(因为 \(\widehat{CD}\) 的零分布被 \(\hat{F}_W\) 校准)。
- 因此,\(\#\{j : \hat{U}_j \leq -t\}\) 可以作为 \(\#\{j \in \mathcal{A}^c : \hat{U}_j \geq t\}\) 的保守估计——这就是"镜像估计"(mirror estimation)思想。
- 定理 4.1 的条件 2(\(\mathrm{Var}[S_c] = o(p_0^2)\))本质上要求 \(\{\hat{U}_j\}_{j \in \mathcal{A}^c}\) 的波动不能太大,即零假设下的统计量不能有太强的长程相关性。这是 FDR 控制成立的关键。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高维异质性数据下,如何构建一个既不需要模型假设、又对特征边际分布差异鲁棒、还能控制 FDR 的特征筛选方法。
- 核心工具/方法:提出 Copula 散度(Copula Divergence),通过 probit 变换将边际标准化后,用 Wasserstein 距离度量联合分布与独立分布的偏离;配套提出 CD-Screen 筛选算法和 CD-FDR 错误发现率控制程序。
- 主要结论:CD-Screen 在温和条件下满足 sure screening 和 rank consistency;CD-FDR 在条件 2 下渐近控制 FDR;模拟和实证(S&P 500 与通胀)显示方法在异质性非线性场景下优于现有方法。
关键设定与假设¶
| 假设 | 内容 | 统计含义 | 与文献比较 |
|---|---|---|---|
| 条件 1(a) | \(\min_{j \in \mathcal{A}} [CD(X_j, Y; r)]^r \geq c_1 n^{-\kappa_1}\),\(\kappa_1 \in [0, 1/2)\) | 活跃特征的最小信号强度不能衰减太快 | 与 SIS 的 $\min |
| 条件 1(b) | 活跃与不活跃特征的 CD 值之间有 gap \(\geq c_2 n^{-\kappa_2}\),\(\kappa_2 \in [0, 1/(2r))\) | 活跃与不活跃特征可区分 | 比 1(a) 更强,用于 rank consistency |
| 条件 2 | \(p_0 \to \infty\),\(\mathrm{Var}[S_c] = o(p_0^2)\) | 零假设下统计量的波动不能太大 | 与 Dai et al. (2023) 的条件类似,但针对 Copula 散度重新表述 |
| 连续性 | \(X_j\) 和 \(Y\) 的边际 CDF 连续 | 保证 probit 变换良定义 | 标准假设 |
| 稀疏性 | \(\mathcal{S}_\mathcal{A} \ll p\) | 活跃特征远少于总特征数 | 所有 screening 方法的标准假设 |
相比已有文献的放宽/强化: - 放宽:不要求线性模型(vs SIS)、不要求有限矩条件(vs DC-SIS 需要 \(E|X|^2 < \infty\))、不要求特征同分布(vs 多数方法隐含此假设)。 - 强化:条件 1(b) 要求活跃/不活跃特征的 CD 值有均匀 gap,这在某些弱信号场景下可能过强。
主要结果¶
定理 2.2(\(r=1\) 的估计误差):
- 直觉:估计误差以 \(\sqrt{\log n / n}\) 的速度收敛(忽略对数项),这是非参数估计的典型速率。
- 关键点:不需要任何矩条件,仅依赖 Wasserstein-1 距离的对偶表示和 DKW 不等式。
- 技术难点:经验 probit 变换 \(\hat{s}_i\) 与真实 \(s_i\) 的差异需要精细控制,因为 \(\hat{F}_{X_j}\) 在尾部区域的收敛速度较慢。
定理 2.3(\(r=2\) 的估计误差):
- 直觉:\(r=2\) 的收敛速率降为 \(n^{-1/4}\)(忽略对数项),比 \(r=1\) 慢。这是因为 Wasserstein-2 距离对尾部更敏感,需要更强的集中不等式。
- 关键点:额外的 \(\exp(-C_2(n\varepsilon^2)^\beta)\) 项来自对 Wasserstein-2 距离的矩控制,反映了平方距离的"重尾"特性。
- 技术难点:Wasserstein-2 距离没有简单的对偶形式,需要利用四阶矩的集中不等式(可能涉及 Talagrand 的运输不等式或 HCI 条件)。
定理 3.1(Sure screening):
- 含义:只要活跃特征的最小信号 \(\geq c_1 n^{-\kappa_1}\),CD-Screen 以高概率不遗漏任何活跃特征。
- 必要条件:\(n^{1-2\kappa_1} / \log^2 n \to \infty\),即 \(\kappa_1 < 1/2\)。这允许信号随 \(n\) 衰减,但不能太快。
定理 3.2(Rank consistency):
- 含义:在条件 1(b) 下,活跃特征在排序中一致地排在不活跃特征之前。
- 必要条件:\(\log p = o(n^{1-2\kappa_2}/\log^2 n)\),即维度可以随 \(n\) 指数增长,但指数不能太大。
定理 4.1(FDR 控制):
- 含义:CD-FDR 程序在渐近意义下将 FDR 控制在预设水平之下。
- 关键条件:条件 2(\(\mathrm{Var}[S_c] = o(p_0^2)\)),即零假设下统计量的波动不能太大。这个条件比通常的"弱依赖"假设更弱,但需要验证。
证明路线与技术技巧¶
整体路线(从定理 2.2/2.3 到 3.1/3.2/4.1):
- 估计误差控制(定理 2.2/2.3):先证明单个特征的 \(\widehat{CD}\) 以高概率接近真实 \(CD\)。核心工具是 Wasserstein 距离的稳定性 + 经验 CDF 的 DKW 不等式。
- 并集界(定理 3.1):对 \(p\) 个特征取并集界,得到 sure screening。这里需要 \(p\) 不能太大(\(\log p = o(n^{1-2\kappa_1}/\log^2 n)\))。
- 排序一致性(定理 3.2):利用条件 1(b) 的 gap,将"排序错误"事件转化为"估计误差超过 gap/2"的事件,再用定理 2.2/2.3 的界。
- FDR 控制(定理 4.1):构造零分布的经验 CDF \(\hat{F}_W\),利用镜像估计的思想。关键步骤是证明 \(\hat{U}_j\) 在零假设下近似对称,且 \(\#\{j : \hat{U}_j \leq -t\}\) 是 \(\#\{j \in \mathcal{A}^c : \hat{U}_j \geq t\}\) 的保守估计。
关键技术技巧:
- 经验 probit 变换:用 \(\hat{s}_i = \Phi^{-1}\left(\frac{n}{n+1}\hat{F}_{X_j}(x_i)\right)\) 代替 \(s_i = \Phi^{-1}(F_{X_j}(x_i))\)。这里的 \(\frac{n}{n+1}\) 因子是为了避免 \(\hat{F}_{X_j}(x_i) = 1\) 时 \(\Phi^{-1}\) 发散。这个变换的误差由 DKW 不等式控制。
- Wasserstein 距离的三角不等式:将 \(\widehat{CD}\) 的误差分解为
\[\mathcal{W}_r(\hat{\gamma}_{\hat{S},\hat{T}}, \phi \otimes \phi) \leq \mathcal{W}_r(\hat{\gamma}_{\hat{S},\hat{T}}, \gamma_{S,T}) + \mathcal{W}_r(\gamma_{S,T}, \phi \otimes \phi)\]第一项是估计误差,第二项是真实 CD。关键在于控制第一项。
- 对偶表示(\(r=1\)):利用 Kantorovich-Rubinstein 对偶,将 \(\mathcal{W}_1\) 转化为 \(\sup_{\|f\|_{Lip} \leq 1} |\int f d\mu - \int f d\nu|\),从而可以用经验过程理论。
- 四阶矩控制(\(r=2\)):对于 \(r=2\),需要控制 \(\mathcal{W}_2^2\) 的矩,这涉及四阶矩条件。作者可能使用了类似 Talagrand 的运输不等式或 HCI 条件。
- 镜像估计:FDR 控制的核心技巧。通过构造零分布的经验 CDF,将 FDP 的分子(假发现数)用 \(\#\{j : \hat{U}_j \leq -t\}\) 来估计。这个技巧在 Dai et al. (2023) 中也有使用,但本文针对 Copula 散度重新构造了 \(\hat{U}_j\)。
真实例子与应用¶
实证数据:S&P 500 指数中 489 只股票的月度收益率(2020 年 1 月至 2023 年 12 月,\(n = 48\)),响应变量为美国月度通胀率(基于 CPI)。目标:筛选出与通胀率有显著边际关联的股票。
方法应用: 1. 对每只股票 \(j\),计算其收益率与通胀率的 Copula 散度 \(\widehat{CD}(X_j, Y; r)\)。 2. 用 CD-FDR 程序在 \(\alpha = 0.20\) 水平下选择阈值 \(T_\alpha\)。 3. 选出的股票(平均约 6 只)包括 Cincinnati Financial (CINF)、Darden Restaurants (DRI)、NRG Energy (NRG)、Uber Technologies (UBER)、Ross Stores (ROST)、Home Depot (HD)。
结果解读: - 选出的股票主要来自金融、消费、能源板块,与通胀敏感行业一致。 - 作者强调,这些股票的收益率分布高度异质(偏度、峰度差异大),传统基于 Pearson 相关或矩条件的方法可能失效。 - 作者还进行了下游预测比较:先用 CD-FDR 筛选,再拟合随机森林,发现比用全部特征或 SIS 筛选的预测误差更低(具体数值在附录 A.3)。
例子想说明什么: 1. 实用性:方法在 \(n \ll p\)(\(48 \ll 489\))且特征高度异质时仍能有效工作。 2. 可解释性:选出的股票在经济意义上合理,说明方法捕捉到了真实的依赖结构。 3. 下游收益:筛选后建模的预测性能提升,说明筛选不是"为筛而筛"。
四、开放问题¶
-
高维联合分布下的 FDR 控制:定理 4.1 的条件 2(\(\mathrm{Var}[S_c] = o(p_0^2)\))在特征强相关时可能不成立。扎根于:条件 2 的讨论(第 4 节)。需要研究:当特征间存在长程相关时,CD-FDR 是否仍然有效?是否需要修正镜像估计?
-
\(r=2\) 的收敛速率是否可以改进:定理 2.3 的速率 \(n^{-1/4}\) 比 \(r=1\) 的 \(n^{-1/2}\) 慢。扎根于:定理 2.3 的陈述。是否可以通过更强的矩条件或不同的证明技术(如利用平方 Wasserstein 距离的特殊结构)将速率提升到 \(n^{-1/2}\)?
-
Copula 散度的计算复杂度:计算 \(\widehat{CD}\) 需要求解最优传输问题,当 \(n\) 较大时计算成本高。扎根于:第 2.3 节的估计方法。是否有更高效的近似算法(如 Sinkhorn 散度)能在保持统计性质的同时降低计算成本?
-
非线性依赖的刻画:Copula 散度捕捉的是任意形式的依赖,但无法区分"强非线性依赖"和"弱线性依赖"的方向。扎根于:第 6 节的讨论。是否需要引入方向性度量(如 copula 回归)来补充?
-
与条件 screening 的结合:本文只做边际 screening,未考虑条件 screening(即给定其他特征后的相关性)。扎根于:第 1 节对条件 screening 文献的引用(如 Wen et al. 2018)。如何将 Copula 散度推广到条件设定?
提醒:若要确认上述问题是否为真 gap,建议去读以下近期文献的 intro(各约 5 篇):(i) 高维 screening 的 FDR 控制(2023-2025);(ii) 基于最优传输的依赖度量(2022-2025);(iii) 异质性数据的特征筛选(2023-2025)。如果这些文献的 intro 都指向同一问题,那就是共识性 gap;如果互相打架,则可能是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub