A Conditional Distribution Equality Testing Framework using Deep Generative Learning¶
讲者: Siming Zheng
会场: Statistics with Deep Learning
报告题目: A Conditional Distribution Equality Testing Framework Using Deep Generative Learning
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是条件分布相等性检验:给定两个独立随机样本 \(D_1 = \{(Y_{1,i}, X_{1,i})\}_{i=1}^{n_1}\) 和 \(D_2 = \{(Y_{2,i}, X_{2,i})\}_{i=1}^{n_2}\),检验原假设 \(H_0: P_{1,Y|X} = P_{2,Y|X}\) 是否成立。这是一个基础但困难的统计检验问题,其困难根源在于:当协变量 \(X\) 是连续或高维时,无法直接比较给定相同 \(X\) 值时的条件分布。该问题在协变量偏移(covariate shift)和因果发现(causal discovery)中有直接应用。当前该子方向的成熟度较低——直接针对该问题的文献“仍然有限”(论文原文),大多数现有工作是通过将其转化为条件独立性检验来间接处理。
发展脉络(history)¶
- 奠基工作:条件独立性检验的困难性。Shah & Peters (2020) 严格证明了条件独立性检验是一个“特别困难的假设检验问题”:一个有效的检验在任意备择假设下都没有检验势。这一结论直接影响了条件分布相等性检验——因为后者可以通过构造一个伪变量 \(W\)(指示样本来源)转化为条件独立性检验 \(Y \perp W \mid X\)。Shah & Peters 的结论意味着:任何试图“统一有效”地解决该问题的检验都是不可能的,必须依赖于额外的假设或近似。
- 主要进展:条件独立性检验的具体方法。针对条件独立性检验,文献中发展了三类方法:(1) 核方法(Zhang et al., 2011; Wang et al., 2015),在高维协变量下可能失效;(2) 置换方法(Berrett et al., 2020),需要近似 \(X|Z\) 的分布;(3) 生成学习方法(Bellot & van der Schaar, 2019; Shi et al., 2021; Zhang et al., 2025),利用GAN等生成模型来近似条件分布。这些方法虽然提供了有价值的思路,但论文指出它们“缺乏对目标问题(1)的特异性”,在样本不平衡(\(n_2 \ll n_1\))时性能可能受损。
- 当前前沿:直接针对条件分布相等性检验的方法。最近,Hu & Lei (2024) 和 Chen & Lei (2025) 提出了基于条件密度比和边际密度比估计的检验。论文指出这些方法“在高维协变量下可能具有挑战性和不稳定性”,且密度比估计的收敛率“通常取决于两个样本中较小的样本量”,因此在样本不平衡时可能无效。
- 本文的位置:本文提出一个通用框架,通过深度生成学习和数据分割,将条件检验转化为无条件检验。其核心创新在于:利用较大的数据集 \(D_1\) 学习条件生成器,然后在较小的数据集 \(D_2\) 上生成合成数据,从而避免密度比估计或合并数据学习。论文声称该方法“特别适用于两个样本不平衡的情况”。
子线索聚类¶
- 条件独立性检验方法:包括核方法(Zhang et al., 2011; Wang et al., 2015)、置换方法(Berrett et al., 2020)、生成学习方法(Bellot & van der Schaar, 2019; Shi et al., 2021; Zhang et al., 2025)。这些方法通过构造伪变量 \(W\) 将条件分布相等性检验转化为条件独立性检验。
- 直接条件分布相等性检验方法:包括 Hu & Lei (2024) 的加权共形预测方法(WCPT)和 Chen & Lei (2025) 的去偏U统计量方法。这些方法直接针对原问题,但依赖于密度比估计。
- 深度生成学习方法:包括条件GAN(Zhou et al., 2023a)、混合密度网络(MDN, Zhou et al., 2023b)、条件流匹配(Lipman et al., 2023)等。本文利用这些方法作为条件生成器学习的工具。
- 无条件两样本检验方法:包括基于秩的检验(Vardi & Zhang, 2000; Rousson, 2002)、积分概率度量检验(Baringhaus & Franz, 2004; Székely et al., 2004; Ramdas et al., 2017)等。本文的框架将这些方法作为最终的无条件检验步骤。
这个方向在追问的核心问题¶
- 如何在高维或连续协变量下进行条件分布相等性检验? 这是该问题的根本困难,因为无法直接比较给定相同 \(X\) 值时的条件分布。
- 如何处理样本不平衡的情况? 当 \(n_2 \ll n_1\) 时,密度比估计和合并数据学习方法可能失效。这是本文重点解决的问题。
- 如何避免密度比估计? 密度比估计在高维下不稳定,且收敛率受限于小样本量。本文通过生成学习避免了这一步骤。
- 检验的最优性是什么? 论文在补充材料中建立了 minimax 下界,并声称某些检验可以达到该下界。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将现有方法的不足归结为两点:(1) 通过条件独立性检验间接处理时,“缺乏对目标问题的特异性”,在样本不平衡时性能受损;(2) 直接方法(Hu & Lei, 2024; Chen & Lei, 2025)依赖于密度比估计,在高维下不稳定且受限于小样本量。作者将自己的方法定位为“可以避免密度比估计或合并数据分布学习”,因此“在样本不平衡时仍然有效”。
- 哪些竞争路线被他淡化或回避了:作者在引言中承认 GCIT 和 DRGCIT 是“有价值的”,但声称它们“缺乏特异性”。然而,在模拟实验中,DRGCIT 在多个模型下与 GCA-CDET 表现相当甚至更好(如 M1、M3、M4)。作者将这种“缺乏特异性”归因于“这些方法并非专门为条件分布相等性检验设计”,但并未提供理论证据说明为什么这种“缺乏特异性”必然导致性能下降。此外,作者回避了与 Hu & Lei (2024) 的 WCPT 在理论上的直接比较——WCPT 也有有限样本覆盖保证,但作者只提到其“密度比估计在高维下不稳定”。
- 什么明显该被引 / 该存在、却没出现在 intro 里:论文未引用 Shah & Peters (2020) 关于条件独立性检验困难性的结论在条件分布相等性检验中的直接含义。Shah & Peters 的 Remark 4 明确建立了两个问题的联系,但论文只在引言中提及该 remark,并未深入讨论其对本框架的 implications——例如,本框架是否也面临类似的“无统一有效检验”的困境?此外,论文未引用 Lei & Candès (2021) 关于反事实和个体处理效应的共形推断工作,尽管该工作与条件分布检验有密切联系(论文在引言中提到了该引用,但未在正文中深入讨论)。
张力¶
未见明显对立引用。所有被引工作基本一致认为条件分布相等性检验是一个困难问题,且现有方法各有局限。论文的贡献在于提出一个新的框架来规避这些局限。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \(X \in \mathcal{X} \subseteq \mathbb{R}^d\):协变量(covariate),\(d\) 维。 - \(Y \in \mathcal{Y} \subseteq \mathbb{R}^p\):响应变量(response),\(p\) 维。 - \(D_1 = \{(Y_{1,i}, X_{1,i})\}_{i=1}^{n_1}\):来自第一个总体的样本,样本量 \(n_1\)。 - \(D_2 = \{(Y_{2,i}, X_{2,i})\}_{i=1}^{n_2}\):来自第二个总体的样本,样本量 \(n_2\)。 - \(P_{k,Y|X}\):第 \(k\) 个总体的条件分布(\(k=1,2\)),即给定 \(X\) 时 \(Y\) 的分布。 - \(P_{k,X}\):第 \(k\) 个总体的边际分布。 - \(H_0: P_{1,Y|X} = P_{2,Y|X}\):原假设,两个条件分布相等。 - \(H_1: P_{1,Y|X} \neq P_{2,Y|X}\):备择假设。 - \(\hat{V}\):从 \(D_1\) 学习到的条件生成器,用于从 \(P_{1,Y|X}\) 生成样本。 - \(D_{21}, D_{22}\):将 \(D_2\) 随机等分为两个子集,各含 \(n_2/2\) 个样本。 - \(\hat{D}_{21} = \{(\hat{Y}_{21,i}, X_{21,i})\}_{i=1}^{n_2/2}\):使用 \(\hat{V}\) 在 \(D_{21}\) 的协变量上生成的合成数据集。 - \(\eta_i \sim \text{Unif}[0,1]\):用于生成 \(\hat{Y}_{21,i}\) 的随机噪声。
模型: - 数据生成机制:两个样本 \(D_1\) 和 \(D_2\) 分别来自两个未知的联合分布 \(P_{1,Y,X}\) 和 \(P_{2,Y,X}\),且样本独立同分布。 - 目标:检验条件分布 \(P_{1,Y|X}\) 和 \(P_{2,Y|X}\) 是否相等。 - 关键假设:\(n_1\) 可以远大于 \(n_2\)(样本不平衡情况),且 \(D_1\) 足够大以学习一个良好的条件生成器。
可观测数据: - 可观测:\(D_1\) 和 \(D_2\) 中的 \((Y, X)\) 对。 - 不可观测:条件分布 \(P_{1,Y|X}\) 和 \(P_{2,Y|X}\) 本身,以及生成函数 \(V\)(满足 \(V(x, \eta) \sim P_{1,Y|X=x}\))。 - 核心困难:由于 \(X\) 是连续的,无法直接比较给定相同 \(X\) 值时的条件分布。
第二步:讲最小内核¶
最简特例:假设 \(d=1\)(一维协变量),\(p=1\)(一维响应),且 \(P_{1,Y|X}\) 是已知的(即生成函数 \(V\) 已知)。这是论文框架的“Oracle”版本。
在这个特例下: 1. 已知条件:我们知道如何从 \(P_{1,Y|X}\) 生成样本。例如,假设 \(P_{1,Y|X=x} = N(\beta x, 1)\),则生成函数为 \(V(x, \eta) = \beta x + \Phi^{-1}(\eta)\),其中 \(\Phi\) 是标准正态 CDF。 2. 数据:\(D_2 = \{(Y_{2,i}, X_{2,i})\}_{i=1}^{n_2}\) 来自未知的 \(P_{2,Y,X}\)。 3. 步骤: - 将 \(D_2\) 随机等分为 \(D_{21}\) 和 \(D_{22}\),各含 \(n_2/2\) 个样本。 - 对 \(D_{21}\) 中的每个 \(X_{21,i}\),使用已知的 \(V\) 生成 \(\tilde{Y}_{21,i} = V(X_{21,i}, \eta_i)\),得到 \(\tilde{D}_{21} = \{(\tilde{Y}_{21,i}, X_{21,i})\}_{i=1}^{n_2/2}\)。 - 现在,\(\tilde{D}_{21} \sim P_{1,Y|X} \times P_{2,X}\)(因为生成使用了 \(P_{1,Y|X}\),但协变量来自 \(P_{2,X}\)),而 \(D_{22} \sim P_{2,Y|X} \times P_{2,X}\)。 4. 核心思路:检验 \(H_0: P_{1,Y|X} = P_{2,Y|X}\) 等价于检验两个联合分布 \(P_{1,Y|X} \times P_{2,X}\) 和 \(P_{2,Y|X} \times P_{2,X}\) 是否相等。由于这两个联合分布基于相同的边际分布 \(P_{2,X}\),且样本独立,我们可以使用任何无条件两样本检验(如 Kolmogorov-Smirnov 检验、能量距离检验等)来检验它们是否相等。 5. 为什么成立:如果 \(P_{1,Y|X} = P_{2,Y|X}\),则 \(\tilde{D}_{21}\) 和 \(D_{22}\) 来自相同的联合分布 \(P_{2,Y|X} \times P_{2,X}\),因此无条件两样本检验应接受原假设。如果 \(P_{1,Y|X} \neq P_{2,Y|X}\),则两个联合分布不同,检验应拒绝。
这个特例揭示了论文的核心数学思想:通过生成学习,将条件检验转化为无条件检验。一般情形下,\(P_{1,Y|X}\) 未知,需要用 \(D_1\) 学习一个估计 \(\hat{V}\)。论文的理论贡献在于证明:当 \(\hat{V}\) 足够好(收敛率足够快)时,这种转化仍然有效。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:提出了一个通用框架,用于检验两个条件分布 \(P_{1,Y|X}\) 和 \(P_{2,Y|X}\) 是否相等,特别关注样本不平衡(\(n_2 \ll n_1\))的情况。
- 核心工具/方法:利用深度生成学习(具体为混合密度网络 MDN)从较大的数据集 \(D_1\) 学习条件生成器,然后通过数据分割在较小的数据集 \(D_2\) 上生成合成数据,将条件检验转化为无条件两样本检验。作为具体实例,提出了生成分类准确率条件分布相等性检验(GCA-CDET)。
- 主要结论:建立了 MDN 条件生成器的 \(L_1\) 收敛率(定理 4.1),证明了 GCA-CDET 的检验一致性(定理 4.2),并在补充材料中建立了 minimax 下界并声称某些检验可以达到该下界。
关键设定与假设¶
- 设定:两个独立样本 \(D_1\) 和 \(D_2\),分别来自 \(P_{1,Y,X}\) 和 \(P_{2,Y,X}\)。目标检验 \(H_0: P_{1,Y|X} = P_{2,Y|X}\)。假设 \(X \in [0,1]^d\),\(Y \in [0,1]^p\)(有界支撑,为理论分析简化)。
- 假设 1:\(f_{1,Y,X} \in \mathcal{H}_{M,\beta,c_1,c_2}\),即第一个总体的联合密度属于 Hölder 类,光滑参数 \(\beta \geq 1\),且密度有上下界 \(c_1, c_2\)。这是保证 MDN 能够以一定速率逼近真实条件密度的关键。
- 假设 2:MDN 的网络结构(深度、宽度、大小)满足特定条件,且参数空间 \(\Theta_{\text{mix}}\) 保证估计的密度有界且方差项有下界。这是定理 4.1 证明中 offset Rademacher 复杂度分析的技术条件。
- 假设 3:\(n_2 n_1^{-\omega_0} \to 0\),其中 \(\omega_0 = (2\beta - \delta)/(c_p(\beta+d))\),\(\delta \in (0, 2\beta)\)。这要求 \(n_2\) 相对于 \(n_1\) 不能增长太快,以确保 MDN 估计的误差可以忽略。这是 GCA-CDET 一致性证明的关键——它保证了生成器的误差不会破坏检验的渐近性质。
- 假设 4:分类器网络 \(\mathcal{R}\) 的结构满足特定条件,以保证其能够达到非参数回归的最优收敛率。这是定理 4.2 证明中分类器误差分析的技术条件。
- 假设 5:在备择假设下,\(\|f_{1,Y|X} - f_{2,Y|X}\|_2 \geq \varepsilon\),即条件密度在 \(L_2\) 范数下分离。这是保证检验势趋于 1 的条件。
与已有文献的比较: - 相比 Hu & Lei (2024) 和 Chen & Lei (2025) 的密度比估计方法,本文不要求估计密度比,因此避免了密度比估计在高维下的不稳定性和小样本量依赖。 - 相比 Bellot & van der Schaar (2019) 的 GCIT 和 Shi et al. (2021) 的 DRGCIT,本文不合并两个数据集进行生成学习,而是仅用 \(D_1\) 学习生成器,因此在小样本 \(D_2\) 的情况下,生成器质量不受 \(D_2\) 大小的影响。 - 假设 3 是本文特有的——它要求 \(n_2\) 相对于 \(n_1\) 足够小,这恰好是本文声称擅长的“样本不平衡”场景。如果 \(n_2\) 与 \(n_1\) 相当,该假设可能不成立,此时本文的理论保证可能失效。
主要结果¶
定理 4.1(MDN 条件密度估计的非渐近上界): - 陈述:在假设 1 和 2 下,\(\mathbb{E}_{D_1} \| f_{1,Y|X} - \hat{f}_{1,Y|X} \|_1 \leq C n_1^{-\frac{2\beta}{c_p(\beta+d)}} \log^{7/2} n_1\),其中 \(c_p = 2p^2 + 4p + 4\)。 - 直觉:该定理给出了 MDN 估计的条件密度在 \(L_1\) 范数下的收敛率。收敛率随维度 \(d\) 和 \(p\) 的增加而恶化(维度诅咒),但通过假设 2 中精心设计的网络结构,达到了接近非参数最优的速率(除对数因子外)。 - 必要条件:假设 1 要求真实密度属于 Hölder 类,假设 2 要求网络结构足够复杂以逼近该类函数。 - 解决的技术难点:证明使用了 offset Rademacher 复杂度(Liang et al., 2015),这是一种比传统局部化技术更简洁的工具。论文声称这是“首次将 offset Rademacher 复杂度应用于神经网络密度估计”,并称该技术“可以显著简化与神经网络相关的证明”。
定理 4.2(GCA-CDET 的检验一致性): - 陈述:在假设 2-5 下,(1) 在原假设下,\(\lim_{n_2 \to \infty} \mathbb{E}_{H_0} \phi_{\text{acc},\alpha}(D_1, D_2) \leq \alpha\)(类型 I 误差受控);(2) 在备择假设下,\(\lim_{n_2 \to \infty} \mathbb{E}_{H_1} \phi_{\text{acc},\alpha}(D_1, D_2) = 1\)(检验势趋于 1)。 - 直觉:该定理表明,当 \(n_2\) 足够大且 \(n_2\) 相对于 \(n_1\) 足够小时,GCA-CDET 能够控制类型 I 误差并具有渐近一致的检验势。关键条件是假设 3,它保证了 MDN 生成器的误差(随 \(n_1\) 衰减)相对于 \(n_2\) 的样本量可以忽略。 - 必要条件:假设 3 要求 \(n_2 n_1^{-\omega_0} \to 0\),即 \(n_2\) 不能比 \(n_1\) 增长太快。如果 \(n_2\) 与 \(n_1\) 同阶,该假设不成立,此时定理 4.2 的结论可能不成立。 - 解决的技术难点:证明需要处理两个误差来源:(1) MDN 生成器的估计误差(由定理 4.1 控制);(2) 分类器的估计误差(由假设 4 保证达到最优收敛率)。证明的关键在于证明这两个误差的累积效应在假设 3 下可以忽略。
补充材料中的 minimax 下界(定理 S.4 & 推论 S.5): - 论文声称在补充材料中建立了条件分布相等性检验的 minimax 下界,并证明一个生成置换检验可以达到该下界,其自适应版本可以达到至多一个迭代对数因子的下界。这为框架的最优性提供了理论支持。
证明路线与技术技巧¶
定理 4.1 的证明路线: 1. 步骤 1:将 \(L_1\) 误差转化为经验过程问题。利用 \(L_1\) 范数与总变差距离的关系,以及密度估计的经典不等式,将 \(\|f_{1,Y|X} - \hat{f}_{1,Y|X}\|_1\) 的上界转化为对经验过程 \(\sup_{f \in \mathcal{F}} |\mathbb{P}_n f - \mathbb{P}f|\) 的控制,其中 \(\mathcal{F}\) 是适当的函数类。 2. 步骤 2:使用 offset Rademacher 复杂度。论文的关键技术贡献是推导了一个新的 offset Rademacher 复杂度不等式(引理 S.7),该不等式可以直接给出神经网络密度估计的收敛率,而无需传统的局部化技术(如 Farrell et al., 2021 使用的)。 3. 步骤 3:计算 offset Rademacher 复杂度。对于 MDN 对应的函数类,计算其 offset Rademacher 复杂度,得到与网络结构(深度、宽度、大小)相关的上界。 4. 步骤 4:选择最优网络结构。通过假设 2 中精心设计的网络结构(深度和宽度随 \(n_1\) 增长),最小化收敛率,得到定理 4.1 中的速率。
关键跳跃点: - offset Rademacher 复杂度的应用:这是论文声称的“独立兴趣”的技术贡献。传统上,神经网络密度估计的收敛率证明需要复杂的局部化技术(如 Farrell et al., 2021)。论文通过 offset Rademacher 复杂度简化了这一过程。具体来说,引理 S.7 给出了一个不等式,将经验过程的偏差项与 offset Rademacher 复杂度联系起来,从而可以直接得到收敛率。 - 网络结构的设计:假设 2 中网络深度和宽度的具体表达式(\(D_{\text{Fmix}} = 21L\lceil \log_2(8L) \rceil (\lfloor \beta \rfloor + 1)^2 + 2(p+d)\),\(W_{\text{Fmix}} = 38(\lfloor \beta \rfloor + 1)^2 (p+d)^{\lfloor \beta \rfloor + 13p+d} N \lceil \log_2(8N) \rceil\))是经过精心设计的,以确保网络能够同时逼近 Hölder 类函数并具有可控的复杂度。这些表达式来自神经网络逼近理论(如 Jiao et al., 2021)。
定理 4.2 的证明路线: 1. 步骤 1:将检验统计量分解。将分类误差 \(\hat{e}_1 + \hat{e}_0 - 1\) 分解为三个部分:生成器误差、分类器误差、以及随机波动。 2. 步骤 2:控制生成器误差。利用定理 4.1 和假设 3,证明生成器误差(即 \(\hat{P}_{1,Y|X}\) 与 \(P_{1,Y|X}\) 的差异)在 \(n_2 \to \infty\) 时趋于 0。 3. 步骤 3:控制分类器误差。利用假设 4,证明分类器 \(\hat{C}_{n_2}\) 的误差(即分类误差与最优分类误差的差异)在 \(n_2 \to \infty\) 时趋于 0。 4. 步骤 4:应用中心极限定理。在原假设下,证明 \(\hat{e}_1 + \hat{e}_0 - 1\) 的标准化版本渐近服从标准正态分布,从而得到类型 I 误差控制。在备择假设下,证明 \(\hat{e}_1 + \hat{e}_0 - 1\) 趋于负无穷,从而检验势趋于 1。
技术技巧点名: - Offset Rademacher 复杂度:用于定理 4.1 的证明,简化神经网络密度估计的收敛率分析。 - 数据分割:用于避免生成数据与原始数据的相关性,这是论文框架的核心步骤。 - 分类准确率检验:将两样本检验转化为分类问题,利用分类误差的渐近正态性构造检验统计量。 - 非参数回归的最优收敛率:假设 4 保证分类器网络能够达到 Stone (1982) 的最优收敛率。
真实例子与应用¶
模拟实验: - 数据:六种模型(M1-M6),包括线性/非线性、同方差/异方差、单变量/双变量响应、低维/高维协变量。协变量分布包括正态分布和均匀混合分布。 - 方法应用:将 GCA-CDET 与 Oracle 版本(已知 \(P_{1,Y|X}\))、GCIT、DRGCIT、WCPT 进行比较。GCA-CDET 使用两种分类器:神经网络(NN)和线性逻辑回归(LLR)。 - 结果: - Oracle 方法的类型 I 误差和检验势接近名义水平,验证了框架的动机。 - GCA-CDET 的类型 I 误差和检验势与 Oracle 方法相当或接近,优于其他方法。 - 在样本不平衡时(M5 高维、M6 双变量响应),GCA-CDET 表现优于 GCIT 和 WCPT。 - GCA-CDET 的计算时间远低于 DRGCIT(约 1/10)。 - 这个例子想说明什么:验证 GCA-CDET 在有限样本下的有效性,特别是其在样本不平衡和高维场景下的优势。
真实数据模拟(Bike Sharing 数据集): - 数据:17,379 个观测,12 个协变量,响应为每小时自行车租赁次数。 - 方法应用:从数据集中随机抽取 \(n_1\) 和 \(n_2\) 个样本作为 \(D_1\) 和 \(D_2\)。实验 (i) 直接使用抽取的样本(原假设成立),实验 (ii) 对 \(D_2\) 的 \(Y\) 加 0.5(备择假设成立)。 - 结果:在实验 (i) 中,GCA-CDET 的类型 I 误差控制优于 GCIT 和 WCPT,特别是在 \(n_2\) 较小(1000, 2000)时。在实验 (ii) 中,所有方法(除 GCIT 外)的检验势均为 1.00。 - 这个例子想说明什么:展示 GCA-CDET 在真实数据分布下的稳健性,特别是在样本不平衡时对类型 I 误差的控制。
真实数据分析: - Wine Quality 数据集:4,898 个白葡萄酒和 1,599 个红葡萄酒样本,11 个理化变量,响应为感官评分。检验白葡萄酒和红葡萄酒的条件分布是否相同。所有方法的 p 值均小于 0.05,拒绝原假设。GCA-CDET 的 p 值(\(5.48 \times 10^{-33}\) 和 \(2.51 \times 10^{-57}\))远小于 GCIT(0.006)和 WCPT(0.020)。在额外的实验中,GCA-CDET 在样本不平衡时表现出更好的类型 I 误差控制和更高的检验势。 - HIV-1 Drug Resistance 数据集:5,718 个观测,319 个二元协变量(基因突变指示),响应为药物耐药性水平。检验两个药物类别(NRTIs 和 NNRTIs)的条件分布是否相同。GCA-CDET 的 p 值远小于 0.05,拒绝原假设,与医学研究一致。WCPT 在某些情况下给出大于 0.05 的 p 值,导致相反的结论。 - 这些例子想说明什么:展示 GCA-CDET 在真实高维数据(HIV 数据集有 319 个协变量)下的有效性,以及其在样本不平衡时(Wine 数据集中白葡萄酒样本远多于红葡萄酒)的优势。
🔎 结论是否比证明窄¶
- 定理 4.2 的证明依赖于假设 3,该假设要求 \(n_2 n_1^{-\omega_0} \to 0\)。这意味着当 \(n_2\) 与 \(n_1\) 同阶时,定理 4.2 的结论可能不成立。然而,论文在模拟实验中设置了 \(n_1 = n_2\) 的情况,并声称 GCA-CDET 仍然有效。这是结论比证明宽的一个例子——模拟结果暗示方法在 \(n_1 = n_2\) 时也有效,但理论保证只覆盖了 \(n_2 \ll n_1\) 的情况。
- 定理 4.1 的收敛率包含对数因子 \(\log^{7/2} n_1\),但论文在补充材料中声称某些检验可以达到 minimax 下界(至多一个迭代对数因子)。这意味着定理 4.1 的收敛率可能不是最优的,但论文没有证明 MDN 估计本身是否达到最优。
- 论文声称“我们的框架可以容纳任何条件生成学习方法和两样本检验方法”,但理论分析仅针对 MDN 和分类准确率检验。其他生成方法(如条件扩散模型)和两样本检验(如能量距离检验)的理论性质未被分析。
四、开放问题¶
-
数据分割和合成数据生成的随机性。论文在讨论部分承认:“由于 \(D_2\) 的数据分割和通过学习的条件生成器及 \(D_1\) 的数据生成,提出的检验本质上是随机化的。” 如果不仔细记录随机种子,研究者可以通过报告不同分割和生成下的最佳结果来“选择”结果。论文建议使用基于 e 值的去随机化技术(Ren et al., 2023; Bashari et al., 2024; Ren & Barber, 2024)作为可能的解决方案。扎根点:论文第 7 节讨论部分第 (1) 点。
-
考虑其他条件生成学习方法。论文仅使用 MDN 作为条件生成器。论文在讨论部分指出:“考虑其他最先进的条件生成学习方法,如条件随机插值、条件 Föllmer 流和条件扩散模型,将是有趣的。” 这些方法可能提供更好的生成质量或更快的采样速度。扎根点:论文第 7 节讨论部分第 (2) 点。
-
当 \(n_2\) 与 \(n_1\) 同阶时的理论保证。定理 4.2 的证明依赖于假设 3(\(n_2 n_1^{-\omega_0} \to 0\)),但模拟实验显示方法在 \(n_1 = n_2\) 时也有效。一个开放问题是:能否在 \(n_2\) 与 \(n_1\) 同阶时建立类似的理论保证?这可能需要对生成器误差和分类器误差进行更精细的联合分析。扎根点:定理 4.2 的假设 3 与模拟实验设置(\(n_1 = n_2\))之间的张力。
-
MDN 估计的最优性。定理 4.1 的收敛率包含对数因子 \(\log^{7/2} n_1\),但补充材料中的 minimax 下界表明最优速率可能更快(至多一个迭代对数因子)。一个开放问题是:能否改进 MDN 估计的收敛率,使其达到 minimax 最优?或者,是否存在其他生成方法(如条件扩散模型)能够达到更优的收敛率?扎根点:定理 4.1 的收敛率与补充材料中 minimax 下界之间的差距。
Maintained by 陈星宇 · Homepage · Source on GitHub