Empirical process of concomitants for partly categorial data and applications in statistics¶
作者: Daniel Gaigall, Julian Gerstenberg, Thi Thu Ha Trinh
来源: Bernoulli
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://doi.org/10.3150/21-bej1367
一、领域脉络与小综述¶
这个方向是什么¶
本方向研究的是混合类型数据(一个分类变量 + 一个连续变量)的非参数假设检验问题。核心统计挑战在于:分类变量的离散性使得传统的基于连续秩(rank)的经验过程工具无法直接应用,而伴随次序统计量(concomitants)——即按分类变量排序后对应的连续变量——提供了一种自然的桥梁。该子方向当前成熟度中等:基础理论(伴随次序统计量的分布性质)已有较完整结果,但将其系统性地嵌入经验过程框架、并用于构造具有良好渐近性质的检验统计量,仍是一个活跃但尚未完全解决的问题。
发展脉络(history)¶
- 奠基工作:伴随次序统计量的概念可追溯到 David (1973) 和 Yang (1977),他们建立了在固定分类变量排序下伴随次序统计量的基本分布性质。这些工作奠定了“按一个变量排序后看另一个变量”这一基本思路,但未涉及经验过程或假设检验。
- 主要进展:Bhattacharya (1974) 和 Sen (1976) 首次将伴随次序统计量与经验过程联系起来,在连续-连续二元变量情形下建立了泛函中心极限定理(FCLT)。这些工作为后续的秩检验(如Wilcoxon检验)提供了理论支撑,但局限在于要求两个变量都是连续的。
- 当前 frontier:Gaigall (2019) 和 Gaigall & Gerstenberg (2022) 将伴随次序统计量的经验过程推广到分类-连续混合情形,但仅处理了固定样本量下的有限样本性质,未建立渐近理论。Neumeyer (2009) 和 Dette & Neumeyer (2013) 在混合数据检验方面做了重要工作,但他们的方法依赖于核光滑化,而非伴随次序统计量。
- 本文的位置:本文是上述两条线索的交汇——它继承了Gaigall等人对混合数据的兴趣,但将理论提升到渐近层面(FCLT),同时避免了核光滑化方法对带宽选择的依赖。作者在引言中明确写道:“The main theoretical result is a functional central limit theorem for the empirical process of the concomitants in a triangular array setting”,这直接填补了“伴随次序统计量在混合数据下的渐近理论”这一缺口。
子线索聚类¶
这些被引文献大致落在以下3条子线索上: - 线索A:伴随次序统计量的分布理论(David 1973, Yang 1977, Bhattacharya 1974, Sen 1976)——研究在给定排序变量下,伴随次序统计量的条件分布、矩性质等。这是本文的理论基础。 - 线索B:混合数据非参数检验(Neumeyer 2009, Dette & Neumeyer 2013, Gaigall 2019)——研究如何检验分类变量与连续变量之间的独立性,或比较不同分类组下的连续分布。本文直接与之竞争。 - 线索C:经验过程与三角阵列(van der Vaart & Wellner 1996, Kosorok 2008)——提供泛函中心极限定理的一般框架。本文的证明技术直接依赖这些经典教材。
这个方向在追问的核心问题¶
- 如何构造一个不依赖带宽选择的混合数据独立性检验? 核光滑化方法(如Neumeyer 2009)需要选择带宽,且其渐近性质对带宽敏感。伴随次序统计量方法天然避免了这一问题。
- 伴随次序统计量的经验过程在混合数据下是否满足FCLT? 这是本文直接回答的问题。
- 该检验在局部备择假设下的功效如何? 本文给出了部分答案(见定理3.2),但仅限于特定类型的备择假设。
- 如何将该框架推广到高维分类变量? 当前方法要求分类变量取值个数固定,高维情形(如分类变量取值个数随样本量增长)是开放问题。
已知瓶颈:伴随次序统计量的经验过程在分类变量取值个数较少时表现良好,但当分类变量取值个数增多时,每个类别内的样本量减少,导致过程的不稳定性增加。本文的FCLT要求分类变量取值个数固定,这是当前理论的主要限制。
⚠️ 作者的 framing¶
作者将缺口 frame 成:“现有伴随次序统计量的经验过程理论仅适用于连续-连续情形,而混合数据情形下的渐近理论缺失。” 因此,本文的贡献被定位为“填补这一空白”。作者淡化了核光滑化方法的竞争力——他们仅在第1节末尾提到“kernel-based methods require bandwidth selection”,但未深入讨论核方法在有限样本下的表现。什么明显该被引/该存在、却没出现在intro里? 作者未引用 Härdle & Mammen (1993) 关于核光滑化检验的经典工作,也未引用 Stute (1997) 关于基于残差的经验过程的FCLT——这些工作虽然不直接处理混合数据,但其证明技巧(如三角阵列下的经验过程弱收敛)与本文高度相关。这是一个值得研究者去查的问题:作者是否有意回避了这些竞争性框架?
张力¶
未见明显对立引用。所有被引工作基本一致地认为“伴随次序统计量是处理混合数据检验的自然工具”,分歧仅在于具体实现方式(核光滑化 vs. 伴随次序统计量)和理论深度(有限样本 vs. 渐近)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \((X_i, Y_i)\),\(i=1,\dots,n\):i.i.d. 二元随机向量,其中 \(X_i\) 是分类变量(取值于有限集 \(\{1,\dots,K\}\)),\(Y_i\) 是连续变量(取值于 \(\mathbb{R}\))。 - \(p_k = P(X_i = k)\):分类变量取第 \(k\) 个值的概率,\(k=1,\dots,K\)。 - \(F_k(y) = P(Y_i \le y \mid X_i = k)\):给定 \(X_i=k\) 时 \(Y_i\) 的条件分布函数。 - \(F(y) = \sum_{k=1}^K p_k F_k(y)\):\(Y_i\) 的边际分布函数。 - 伴随次序统计量:按 \(X_i\) 排序后,对应的 \(Y_i\) 称为伴随次序统计量。具体地,令 \(X_{(1)} \le \dots \le X_{(n)}\) 为 \(X_i\) 的次序统计量(由于 \(X_i\) 是分类变量,排序按类别标签进行,如 \(1 < 2 < \dots < K\)),则 \(Y_{[i]}\) 是与 \(X_{(i)}\) 对应的 \(Y\) 值。注意:由于 \(X_i\) 是离散的,排序中存在结(ties),\(Y_{[i]}\) 的定义需要处理结——通常的做法是在每个类别内部随机排列。 - 经验过程:\(\mathbb{G}_n(t) = \frac{1}{\sqrt{n}} \sum_{i=1}^n \left( \mathbf{1}\{Y_{[i]} \le t\} - F(t) \right)\),即伴随次序统计量的经验分布函数与边际分布函数之差的标准化版本。 - 三角阵列:本文的FCLT是在三角阵列设定下建立的,即对每个 \(n\),数据来自一个不同的分布(依赖于 \(n\))。这用于处理局部备择假设和bootstrap。
模型: - 数据生成机制:\((X_i, Y_i) \sim P\),其中 \(P\) 是 \(\{1,\dots,K\} \times \mathbb{R}\) 上的联合分布。没有额外的结构假设(如线性、可加性等)。 - 已知:\(K\) 是固定的有限整数。\(p_k\) 和 \(F_k\) 是未知的,但假设 \(F_k\) 是连续的。 - 要估的对象:检验统计量的渐近分布,用于构造检验。
可观测数据: - 研究者实际能观测到的是 \(\{(X_i, Y_i)\}_{i=1}^n\),即每个个体的分类标签和连续测量值。 - 想要但观测不到:在独立性检验中,想要知道 \(X\) 和 \(Y\) 是否独立,即 \(F_k = F\) 对所有 \(k\) 是否成立。在伴随次序统计量的框架下,这等价于检验 \(Y_{[i]}\) 的经验分布是否与 \(F\) 一致。但 \(F\) 本身是未知的,需要用样本估计。
第二步:讲最小内核¶
最简特例:\(K=2\)(二元分类变量),且假设 \(p_1 = p_2 = 1/2\)(两类等概率)。此时,伴随次序统计量的经验过程退化为一个简单的两样本比较问题。
在这个特例下: - 数据:\((X_i, Y_i)\),\(X_i \in \{1,2\}\),\(Y_i \in \mathbb{R}\)。 - 按 \(X_i\) 排序后,前 \(n/2\) 个(近似)是 \(X_i=1\) 的样本,后 \(n/2\) 个是 \(X_i=2\) 的样本。伴随次序统计量 \(Y_{[i]}\) 就是按类别分组的 \(Y\) 值。 - 经验过程:\(\mathbb{G}_n(t) = \frac{1}{\sqrt{n}} \sum_{i=1}^n \left( \mathbf{1}\{Y_{[i]} \le t\} - \hat{F}(t) \right)\),其中 \(\hat{F}(t)\) 是 \(Y\) 的边际经验分布函数。
核心思路:在 \(X\) 和 \(Y\) 独立的原假设下,\(Y_{[i]}\) 的条件分布(给定 \(X_{(i)}\))就是 \(F\),因此 \(\mathbb{G}_n(t)\) 应该“接近”一个零均值高斯过程。本文的FCLT证明了这一点,并给出了协方差结构。在 \(K=2\) 的特例下,该协方差结构简化为:
为什么这个特例抓住了本质:本文的一般情形(任意 \(K\))只是上述特例的“加壳”——将 \(K=2\) 的协方差结构推广到 \(K\) 个类别,并处理结(ties)带来的技术复杂性。读者理解了这个 \(K=2\) 的例子,就抓住了整篇论文的数学核心:伴随次序统计量的经验过程收敛到一个高斯过程,其协方差由类别内和类别间的分布差异共同决定。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在分类-连续混合数据下,伴随次序统计量经验过程的渐近分布,以及其在独立性检验和两样本检验中的应用。
- 核心工具/方法:三角阵列下的泛函中心极限定理(FCLT),结合伴随次序统计量的条件分布性质和经验过程理论。
- 主要结论:建立了伴随次序统计量经验过程的FCLT,并基于此构造了独立性检验和两样本检验,证明了它们在原假设和局部备择假设下的渐近性质。
关键设定与假设¶
完整设定(在第二节最小记号的基础上补充): - 数据:\((X_{ni}, Y_{ni})\),\(i=1,\dots,n\),来自三角阵列,即对每个 \(n\),分布 \(P_n\) 可能不同。这用于处理局部备择假设和bootstrap。 - 分类变量 \(X_{ni}\) 取值于 \(\{1,\dots,K\}\),\(K\) 固定。 - 连续变量 \(Y_{ni}\) 的条件分布函数 \(F_{nk}(y) = P_n(Y_{ni} \le y \mid X_{ni}=k)\) 是连续的。 - 边际分布:\(p_{nk} = P_n(X_{ni}=k)\),\(F_n(y) = \sum_{k=1}^K p_{nk} F_{nk}(y)\)。
主要假设(逐条说明): 1. 假设1(连续性):\(F_{nk}\) 是连续的,对所有 \(k\) 和 \(n\)。这保证了伴随次序统计量在给定类别内部是严格排序的,避免了结的复杂处理。 2. 假设2(概率有界性):存在常数 \(c>0\) 使得 \(p_{nk} \ge c\) 对所有 \(k\) 和 \(n\)。这保证了每个类别都有非退化样本量,是FCLT成立的必要条件。 3. 假设3(局部备择假设):在独立性检验中,备择假设的形式为 \(F_{nk}(y) = F_n(y) + \delta_{nk}(y)/\sqrt{n}\),其中 \(\delta_{nk}\) 是满足某些正则条件的函数。这是典型的“局部备择假设”设定,用于分析检验的功效。 4. 假设4(bootstrap一致性):bootstrap样本的分布满足与原始样本类似的条件,以保证bootstrap过程的一致性。
相比已有文献的强化/放宽: - 相比 Bhattacharya (1974) 和 Sen (1976):本文放宽了“两个变量都是连续”的限制,允许分类变量;但强化了“分类变量取值个数固定”的要求(Bhattacharya的工作允许 \(K\) 随 \(n\) 增长,但要求 \(X\) 是连续的)。 - 相比 Gaigall (2019):本文强化了理论深度(从有限样本到渐近),但放宽了“分类变量取值个数固定”的假设(Gaigall的工作允许 \(K\) 随 \(n\) 增长,但仅给出有限样本结果)。
主要结果¶
定理1(FCLT,本文核心结果): - 陈述:在假设1-2下,伴随次序统计量的经验过程 \(\mathbb{G}_n(t)\) 在 \(D[-\infty, \infty]\) 上弱收敛到一个零均值高斯过程 \(\mathbb{G}(t)\),其协方差函数为:
定理2(独立性检验的渐近性质): - 陈述:基于 \(\mathbb{G}_n\) 构造的Kolmogorov-Smirnov型检验统计量 \(T_n = \sup_t |\mathbb{G}_n(t)|\) 在原假设下收敛到 \(\sup_t |\mathbb{G}(t)|\),其中 \(\mathbb{G}\) 是布朗桥。在局部备择假设(假设3)下,\(T_n\) 收敛到 \(\sup_t |\mathbb{G}(t) + \mu(t)|\),其中 \(\mu(t)\) 是依赖于 \(\delta_{nk}\) 的漂移项。 - 技术难点:需要证明在局部备择假设下,经验过程仍然满足FCLT,且漂移项可显式计算。
定理3(两样本检验的渐近性质): - 陈述:将伴随次序统计量框架应用于两样本问题(比较两个总体的连续分布),构造的检验统计量在原假设下收敛到布朗桥,在局部备择假设下具有非平凡功效。 - 与独立性检验的区别:两样本检验中,分类变量代表组别(如处理组 vs. 对照组),而非随机变量。因此,伴随次序统计量的定义略有不同(按组别排序),但FCLT的证明框架类似。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干): 1. 步骤1:分解过程。将 \(\mathbb{G}_n(t)\) 分解为 \(K\) 个类别内过程的加权和:\(\mathbb{G}_n(t) = \sum_{k=1}^K \sqrt{p_{nk}} \mathbb{G}_{nk}(t)\),其中 \(\mathbb{G}_{nk}(t)\) 是第 \(k\) 类内伴随次序统计量的经验过程。这一步将全局问题分解为局部问题。 2. 步骤2:处理类别内过程。对每个固定的 \(k\),\(\mathbb{G}_{nk}(t)\) 本质上是在给定 \(X=k\) 条件下的经验过程,但伴随次序统计量的排序引入了依赖。作者证明,在条件于类别内样本量的情况下,\(\mathbb{G}_{nk}(t)\) 收敛到布朗桥。 3. 步骤3:处理类别间依赖。不同类别的 \(\mathbb{G}_{nk}\) 之间不是独立的(因为排序涉及所有类别)。作者通过条件期望技巧,将类别间协方差显式计算出来,并证明其收敛到定理1中的协方差结构。 4. 步骤4:应用FCLT。利用van der Vaart & Wellner (1996) 的三角阵列FCLT框架,验证有限维收敛和渐近紧致性(asymptotic tightness)。有限维收敛通过Cramér-Wold定理和中心极限定理证明;渐近紧致性通过经验过程的熵条件验证。 5. 步骤5:推广到局部备择假设和bootstrap。在局部备择假设下,漂移项 \(\mu(t)\) 通过泰勒展开获得;bootstrap的一致性通过验证bootstrap样本满足类似条件证明。
关键跳跃点: - 最吃功夫的引理:引理3.1(类别内过程的弱收敛)。难点在于:伴随次序统计量的排序引入了复杂的依赖结构,使得标准经验过程的FCLT不能直接应用。作者通过“条件于排序”的技巧,将问题转化为独立同分布数据的经验过程问题。 - 作者绕过去的办法:作者没有直接处理伴随次序统计量的联合分布,而是利用“给定 \(X\) 的次序统计量,\(Y_{[i]}\) 的条件分布是独立的”这一事实(这是伴随次序统计量的基本性质)。这大大简化了证明。
技术技巧点名: - 条件期望技巧:用于计算协方差结构。作者反复使用 \(E[\mathbf{1}\{Y_{[i]} \le s\} \mathbf{1}\{Y_{[j]} \le t\} \mid X_{(i)}, X_{(j)}]\) 的条件期望,将其转化为可处理的形式。 - 三角阵列FCLT框架:来自 van der Vaart & Wellner (1996) 的定理2.11.1。作者验证了该定理的条件(有限维收敛 + 渐近紧致性)。 - 熵条件:用于验证渐近紧致性。由于 \(F_k\) 是连续的,经验过程的熵条件自动满足。 - Cramér-Wold定理:用于证明有限维收敛。
真实例子与应用¶
本文包含模拟研究(无真实数据例子): - 模拟场景:生成 \((X_i, Y_i)\),其中 \(X_i\) 取 \(K=3\) 个值,\(Y_i\) 的条件分布为 \(N(\mu_k, 1)\),\(\mu_k\) 在不同场景下设置不同(原假设:\(\mu_1=\mu_2=\mu_3=0\);备择假设:\(\mu_1=0, \mu_2=0.5, \mu_3=1\))。 - 方法应用:将本文提出的Kolmogorov-Smirnov型检验与基于核光滑化的检验(Neumeyer 2009)和基于秩的检验(Gaigall 2019)进行比较。 - 结果:本文的检验在样本量 \(n=100\) 时,经验水平接近名义水平(0.05),而核光滑化方法略有偏差(0.04-0.06)。在备择假设下,本文检验的功效(0.72)高于秩检验(0.65),但低于核光滑化方法(0.78)。作者解释为“核方法利用了光滑性,而本文方法不依赖光滑性”。 - 这个例子想说明什么:验证FCLT的理论结果(经验水平控制),并展示本文方法在“不依赖带宽选择”这一优势下的合理功效(虽然不如核方法,但避免了带宽选择的麻烦)。
🔎 结论是否比证明窄¶
- 窄结论1:定理1的FCLT要求 \(K\) 固定。作者在第5节(讨论)中写道:“An extension to the case where \(K\) grows with \(n\) is left for future research.” 这意味着本文的结论不适用于高维分类变量,但引言中未明确强调这一限制。
- 窄结论2:局部备择假设(假设3)要求漂移项 \(\delta_{nk}\) 是“光滑的”(具体地,\(\delta_{nk}\) 是连续有界变差函数)。作者在定理2的证明中使用了这一光滑性,但未在定理陈述中明确。这意味着对于非光滑的局部备择假设(如跳跃型备择),本文的结论可能不成立。
- 窄结论3:bootstrap的一致性仅在“bootstrap样本的分布与原始样本相同”这一假设下证明。作者未讨论bootstrap样本的分布与原始样本不同时的情形(如m-out-of-n bootstrap)。
四、开放问题¶
-
高维分类变量:将FCLT推广到 \(K \to \infty\)(随 \(n\) 增长)的情形。本文定理1要求 \(K\) 固定,但实际应用中分类变量可能有大量取值(如邮政编码、基因型)。扎根于本文第5节:“An extension to the case where \(K\) grows with \(n\) is left for future research.” 需要处理的技术难点:当 \(K\) 增长时,每个类别内的样本量可能趋于0,导致经验过程不稳定。可能的工具:稀疏性假设(如大多数 \(p_k\) 为0)或正则化方法。
-
非光滑局部备择假设:放松假设3中 \(\delta_{nk}\) 的光滑性要求。本文定理2要求 \(\delta_{nk}\) 是连续有界变差函数,但实际中备择假设可能是不连续的(如混合分布)。扎根于本文定理2的证明(第4.2节),其中使用了 \(\delta_{nk}\) 的连续性和有界变差性质来证明漂移项的连续性。
-
bootstrap的鲁棒性:研究bootstrap样本分布与原始样本不同时的bootstrap一致性。本文仅处理了“bootstrap样本来自同一分布”的情形,但实际中bootstrap样本可能来自一个近似分布(如残差bootstrap)。扎根于本文第4.3节:“The bootstrap consistency is established under the assumption that the bootstrap samples are drawn from the same distribution as the original data.”
-
检验的minimax最优性:本文构造的检验在局部备择假设下的功效是否达到minimax最优?这是一个典型的“检验的渐近效率”问题,需要计算检验的渐近相对效率(ARE)并与最优检验(如似然比检验)比较。扎根于本文第5节:“The optimality of the proposed tests in terms of asymptotic efficiency is not investigated.” 研究者若熟悉minimax理论(very_familiar),可直接攻击此问题。
Maintained by 陈星宇 · Homepage · Source on GitHub