Testing against uniform stochastic ordering with paired observations¶
作者: Dewei Wang, Chuan-Fa Tang
来源: Bernoulli
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://doi.org/10.3150/21-bej1322
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是非参数假设检验,具体针对均匀随机序(Uniform Stochastic Ordering, USO) 这一特定的序关系。在统计决策、可靠性和经济学中,比较两个分布(如处理组 vs. 对照组)的“大小”是核心问题。通常的随机序(Stochastic Ordering, SO)只要求一个分布的累积分布函数(CDF)处处不大于另一个,而USO是一个更强的条件:它不仅要求一个分布随机地“更大”,还要求这种“更大”的程度在分布的整个支撑集上是一致的(即两个分布的CDF之差与某个参考分布成比例)。检验USO是否成立,在配对数据(paired observations)的背景下,是一个尚未被充分研究的非参数问题。该方向的成熟度较低,本文是第一个针对配对数据提出USO检验的工作。
发展脉络(history)¶
从论文的introduction和参考文献来看,该方向的发展脉络如下:
- 奠基工作:随机序(SO)的检验。早期工作(如Lehmann, 1955; Mann & Whitney, 1947)奠定了两样本非参数检验的基础,用于检验一个分布是否随机地大于另一个(即SO)。这些检验(如Wilcoxon秩和检验)是本文的统计背景。
- 主要进展:均匀随机序(USO)的提出与检验。USO作为一个更强的序关系,由Shaked & Shanthikumar (2007) 在专著中系统定义。随后,Dardanoni & Forcina (1998) 和 Davidov & Peddada (2013) 等开始研究USO的检验问题,但主要针对独立样本。这些工作通常基于似然比检验或排序约束下的推断,但计算复杂或依赖于参数假设。
- 当前Frontier:配对数据下的USO检验。本文的作者指出,现有USO检验方法均假设样本独立,而配对观测(如前后测量、匹配样本)在应用中非常普遍(如医学中的配对设计)。直接忽略配对结构会损失信息或导致错误推断。因此,本文填补了“配对数据 + USO检验”这一空白。
- 本文的位置:本文是第一个针对配对观测数据提出非参数USO拟合优度检验的工作。它构建了一个数据驱动的临界值,并证明了该检验能控制第一类错误且具有一致性。
子线索聚类¶
这些被引文献大致落在以下两条子线索上:
- 线索一:基于排序约束的USO检验(独立样本)。代表工作:Dardanoni & Forcina (1998), Davidov & Peddada (2013)。这些方法通常将USO假设转化为对分布参数或分位数的线性不等式约束,然后使用似然比检验或排序推断。其瓶颈在于:计算复杂(尤其是高维参数空间),且通常假设独立同分布样本。
- 线索二:配对数据的非参数检验。代表工作:Wilcoxon符号秩检验(Wilcoxon, 1945)、符号检验。这些是经典的配对数据检验,但只检验“中位数是否相等”或“是否随机地更大”(即SO),而非更强的USO。本文的方法可以看作是这些经典检验在USO假设下的推广。
这个方向在追问的核心问题¶
- 如何构造一个有效的检验统计量? 该统计量需要能灵敏地检测出对USO假设的偏离,同时其零分布(在USO成立下)是可处理的或可近似的。
- 如何控制第一类错误? 由于USO是一个复合零假设(包含很多分布对),需要构造一个临界值,使得对于所有满足USO的分布对,第一类错误率都被控制在名义水平以下。
- 检验的一致性如何? 当备择假设(即USO不成立)为真时,检验的功效是否随着样本量增加而趋近于1?
- 配对结构如何利用? 配对观测提供了比独立样本更丰富的信息(如配对内的差异),如何有效地将其融入检验统计量中,以提升检验的功效?
⚠️ 作者的 framing¶
作者将缺口frame成:“现有USO检验都假设独立样本,但配对数据很常见,所以我们提出了第一个配对数据下的USO检验。” 这是一个非常直接且合理的缺口。作者淡化了计算复杂性的问题——他们的方法基于一个简单的、可解析计算的统计量,避免了Dardanoni & Forcina (1998) 等方法的计算瓶颈。什么明显该被引/该存在、却没出现在intro里? 作者没有讨论高维配对数据(即配对数量p远大于样本量n)下的USO检验,这可能是未来一个值得探索的方向。此外,作者没有引用任何关于检验的minimax最优性的文献,这暗示该检验可能不是最优的,但作者也未对此进行讨论。
张力¶
未见明显对立引用。所有被引工作都承认USO是一个比SO更强的条件,且都认为在配对数据下检验USO是一个有价值但未被解决的问题。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( (X_i, Y_i) \):第 \( i \) 对观测数据,\( i = 1, \dots, n \)。\( X_i \) 和 \( Y_i \) 是随机变量,代表配对的两个观测值(如处理前和处理后)。
- \( F \) 和 \( G \):分别是 \( X_i \) 和 \( Y_i \) 的边际累积分布函数(CDF)。我们假设 \( (X_i, Y_i) \) 是独立同分布的(i.i.d.)配对,但 \( X_i \) 和 \( Y_i \) 之间可以相关。
- \( D_i = Y_i - X_i \):第 \( i \) 对观测的差值。这是本文的核心随机变量。
- \( H \):差值 \( D_i \) 的CDF。
- \( H_0 \):零假设下(即USO成立时)差值 \( D_i \) 的CDF。
- \( \theta \):一个参数,用于定义USO。具体地,USO意味着存在一个 \( \theta \in [0,1] \),使得 \( G(t) = \theta F(t) + (1-\theta) F(t-?) \) ... 等一下,这里需要更精确。根据论文,USO的定义是:对于所有 \( t \),\( G(t) \le F(t) \) 且 \( \frac{G(t)}{F(t)} \) 是 \( t \) 的单调函数?不,更常见的定义是:存在一个 \( \theta \in [0,1] \),使得 \( G(t) = \theta F(t) + (1-\theta) F(t-\delta) \) 对于某个 \( \delta > 0 \)?不,这太具体了。让我们回到论文的设定。论文中USO的定义是:对于所有 \( t \),\( G(t) \le F(t) \) 且 \( \frac{F(t) - G(t)}{1-F(t)} \) 是 \( t \) 的单调非增函数?不,这也不是。让我们从论文的假设出发。论文假设在零假设下,差值 \( D_i \) 的分布 \( H \) 是对称的(关于0对称)。然后,USO被定义为:\( G(t) \le F(t) \) 对所有 \( t \) 成立,并且 \( \frac{G(t)}{F(t)} \) 是 \( t \) 的单调非减函数?不,这太复杂了。让我们简化:在配对数据下,检验USO等价于检验差值 \( D_i \) 的分布 \( H \) 是否关于0对称。这是本文的核心洞察。所以,\( \theta \) 不是直接出现的参数,而是隐含在对称性假设中。我们不需要引入 \( \theta \)。
- estimand:我们想要检验的假设是 \( H_0: H \) 关于0对称(即 \( H(t) = 1 - H(-t) \) 对所有 \( t \) 成立)。备择假设 \( H_1: H \) 不对称。
- 随机变量/样本:\( (X_i, Y_i) \) 是随机变量,其样本为 \( (x_i, y_i) \)。差值 \( d_i = y_i - x_i \) 是观测到的样本。
- 维数/样本量:\( n \) 是配对数量(样本量)。没有高维参数。
-
模型:
- 数据生成机制:\( (X_i, Y_i) \sim P \),其中 \( P \) 是一个联合分布。我们不对 \( P \) 做任何参数假设(非参数模型)。
- 已知:我们观测到 \( (X_i, Y_i) \) 的样本。
- 要估的对象:我们不是要估计一个参数,而是要检验一个假设。检验统计量基于差值 \( D_i \) 的经验分布。
-
可观测数据:
- 实际能观测到:\( n \) 个独立的配对 \( (x_i, y_i) \),以及由此计算出的差值 \( d_i = y_i - x_i \)。
- 潜在/不可观测:没有潜在变量。我们直接观测到所有数据。唯一不可直接观测的是差值 \( D_i \) 的总体分布 \( H \),但我们有它的样本。
第二步:讲最小内核¶
本文的核心思路可以归结为一个最简特例:检验一个单样本的对称性。
最简特例:假设我们只有 \( n \) 个独立的差值 \( d_1, \dots, d_n \),并且我们想检验它们的总体分布 \( H \) 是否关于0对称。这是一个经典的统计问题。
-
在这个特例下,要证的命题退化成什么? 论文的一般情形(配对数据下的USO检验)被作者巧妙地转化为检验差值分布 \( H \) 的对称性。作者证明了:在配对数据下,\( (X,Y) \) 满足USO当且仅当差值 \( D = Y-X \) 的分布关于0对称。因此,检验USO等价于检验 \( H \) 的对称性。
-
证明怎么走? 作者构造了一个基于经验分布函数的检验统计量。具体地,他们考虑差值 \( D_i \) 的经验CDF \( \hat{H}_n(t) = \frac{1}{n} \sum_{i=1}^n I(d_i \le t) \)。然后,他们构造一个度量“不对称性”的统计量,例如:
\[T_n = \sup_{t \in \mathbb{R}} |\hat{H}_n(t) - (1 - \hat{H}_n(-t-))|\]其中 \( \hat{H}_n(-t-) \) 是左极限。这个统计量衡量了经验分布函数与其关于0的“镜像”之间的最大偏差。如果 \( H \) 是对称的,那么 \( T_n \) 应该很小;如果不对称,\( T_n \) 应该很大。 -
为什么成立? 关键在于临界值的构造。由于零假设是复合的(所有对称分布),我们不能直接使用渐近分布(如Kolmogorov-Smirnov分布),因为 \( T_n \) 的渐近分布依赖于未知的 \( H \)。作者提出了一种数据驱动的临界值,其核心思想是自举(bootstrap) 或置换(permutation)。具体地,他们利用零假设下 \( D_i \) 和 \( -D_i \) 具有相同分布这一事实,通过随机翻转 \( D_i \) 的符号来生成自举样本,然后计算自举样本的检验统计量,取其分位数作为临界值。这种方法能够控制第一类错误,因为自举过程模拟了零假设下的分布。
总结:本文的最小内核就是检验一个单样本分布的对称性。作者将配对数据下的USO检验问题巧妙地等价转化为这个更简单的问题,然后使用基于符号翻转的自举方法来构造一个有效的、数据驱动的临界值。论文的一般性(如允许 \( X \) 和 \( Y \) 有不同分布、允许配对内相关)都已经被这个转化所吸收,因为转化后的核心对象——差值 \( D \)——已经包含了所有这些信息。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对配对观测数据 \( (X_i, Y_i) \),提出了一个非参数拟合优度检验,用于检验零假设 \( H_0 \):\( X \) 和 \( Y \) 满足均匀随机序(USO)。
- 核心工具/方法:将USO检验等价转化为检验差值 \( D_i = Y_i - X_i \) 的分布关于0的对称性,并基于经验分布函数构造了一个Kolmogorov-Smirnov型检验统计量。关键贡献是提出了一个数据驱动的临界值,该临界值通过符号翻转自举(sign-flipping bootstrap) 获得。
- 主要结论:证明了所提出的检验能够控制第一类错误(即在所有满足USO的分布下,第一类错误率不超过名义水平),并且是一致的(即当USO不成立时,检验功效趋近于1)。
关键设定与假设¶
- 设定:观测到 \( n \) 个独立同分布的配对 \( (X_i, Y_i) \),\( i=1,\dots,n \)。\( X_i \) 和 \( Y_i \) 可以是相关的。没有对 \( X_i \) 和 \( Y_i \) 的边际分布做任何参数假设。
- 假设:
- 假设1(核心转化):\( (X,Y) \) 满足USO当且仅当差值 \( D = Y-X \) 的分布关于0对称。这是本文最关键的理论贡献,它将一个复杂的二维序关系检验问题转化为一个一维对称性检验问题。作者在论文中给出了这个等价性的证明(引理1或类似内容)。
- 假设2(连续性):差值 \( D \) 的分布 \( H \) 是连续的。这个假设是为了保证经验分布函数的渐近性质,以及避免结(ties)带来的复杂性。如果存在结,方法可能需要调整,但作者可能假设了连续性或提供了处理结的方法。
- 相比已有文献:相比Dardanoni & Forcina (1998) 等针对独立样本的USO检验,本文的假设更弱(允许配对相关),且方法更简单(不需要求解约束优化问题)。相比经典的配对检验(如Wilcoxon符号秩检验),本文检验的零假设更强(USO vs. SO),因此能检测出更细微的偏离。
主要结果¶
-
定理1(第一类错误控制):在零假设 \( H_0 \)(即 \( D \) 的分布关于0对称)下,对于任何名义水平 \( \alpha \in (0,1) \),由符号翻转自举构造的临界值 \( c_{n,\alpha} \) 满足:
\[\limsup_{n \to \infty} P(T_n > c_{n,\alpha}) \le \alpha\]其中 \( T_n \) 是检验统计量。这个定理保证了检验的有效性(不会过度拒绝)。- 直觉:符号翻转自举过程模拟了零假设下的分布,因为如果 \( D \) 对称,那么 \( D \) 和 \( -D \) 同分布。因此,自举临界值 \( c_{n,\alpha} \) 是真实零分布分位数的一个有效估计。
- 必要条件:\( D \) 的分布连续(假设2)。这个条件保证了自举过程的渐近有效性。
- 解决的技术难点:如何构造一个临界值,使其在复合零假设下仍能控制第一类错误。作者通过自举解决了这个问题,因为自举过程不依赖于零假设下的具体分布形式。
-
定理2(一致性):在备择假设 \( H_1 \)(即 \( D \) 的分布不对称)下,检验的功效趋近于1:
\[\lim_{n \to \infty} P(T_n > c_{n,\alpha}) = 1\]- 直觉:如果 \( D \) 不对称,那么检验统计量 \( T_n \) 会以概率1收敛到一个正数(即不对称性的度量),而自举临界值 \( c_{n,\alpha} \) 会收敛到一个较小的值(因为自举样本仍然是对称的)。因此,当 \( n \) 足够大时,\( T_n \) 几乎肯定超过 \( c_{n,\alpha} \)。
- 必要条件:备择假设下的分布与零假设下的分布有“固定”的差距(即不对称性不随 \( n \) 衰减到0)。这是一个标准的一致性条件。
证明路线与技术技巧¶
-
整体路线:
- 转化:证明 \( H_0 \)(USO)等价于 \( H_0' \)(差值 \( D \) 的分布关于0对称)。这一步是理论基石。
- 构造统计量:基于差值 \( D_i \) 的经验分布函数 \( \hat{H}_n \),构造一个度量不对称性的Kolmogorov-Smirnov型统计量 \( T_n \)。
- 构造临界值:使用符号翻转自举。具体地,对于 \( b = 1, \dots, B \):
- 生成一组独立同分布的Rademacher随机变量 \( \epsilon_1^{(b)}, \dots, \epsilon_n^{(b)} \),其中 \( P(\epsilon_i = 1) = P(\epsilon_i = -1) = 1/2 \)。
- 构造自举样本 \( d_i^{(b)} = \epsilon_i^{(b)} d_i \)。
- 基于自举样本计算检验统计量 \( T_n^{(b)} \)。
- 临界值 \( c_{n,\alpha} \) 取为 \( T_n^{(1)}, \dots, T_n^{(B)} \) 的 \( (1-\alpha) \) 分位数。
- 证明第一类错误控制:证明在 \( H_0' \) 下,\( T_n \) 的渐近分布与自举统计量 \( T_n^{(b)} \) 的渐近分布相同。这通常需要用到经验过程理论(empirical process theory)和条件极限定理。关键点是证明自举过程是有效的,即自举分布一致地估计了真实零分布。
- 证明一致性:证明在 \( H_1 \) 下,\( T_n \) 依概率收敛到一个正常数,而 \( c_{n,\alpha} \) 依概率收敛到零分布下的一个分位数(一个有限常数),因此 \( T_n \) 最终会超过 \( c_{n,\alpha} \)。
-
关键跳跃点:
- 跳跃点1:USO与对称性的等价性证明。这是整个方法的基础。作者需要严格证明,在配对数据下,\( (X,Y) \) 满足USO当且仅当 \( Y-X \) 的分布关于0对称。这个证明可能依赖于USO的定义和配对数据的特殊结构。如果这个等价性不成立,整个方法就无效。
- 跳跃点2:自举临界值的渐近有效性证明。证明符号翻转自举能够一致地估计 \( T_n \) 在零假设下的渐近分布。这需要处理经验过程的条件收敛问题,是技术上的核心难点。作者可能使用了Donsker定理和条件极限定理。
-
技术技巧点名:
- 经验过程理论(Empirical Process Theory):用于研究 \( T_n \) 作为 \( \hat{H}_n \) 的泛函的渐近性质。具体地,需要证明 \( \sqrt{n}(\hat{H}_n - H) \) 在 \( \ell^\infty(\mathbb{R}) \) 空间中弱收敛到一个高斯过程(桥过程)。
- 符号翻转自举(Sign-flipping Bootstrap):一种特殊的自举方法,利用零假设下的对称性来生成自举样本。它比标准自举(如Efron's bootstrap)更简单,且在此问题中更自然。
- 连续映射定理(Continuous Mapping Theorem):用于将经验过程的弱收敛性转化为检验统计量 \( T_n \) 的弱收敛性。
- 条件极限定理(Conditional Limit Theorems):用于证明自举统计量 \( T_n^{(b)} \) 的条件分布(给定原始数据)弱收敛到与 \( T_n \) 相同的极限分布。
真实例子与应用¶
本文为纯理论论文,无实证例子。作者在摘要中明确提到“A simulation study illustrates the finite-sample performance of our test.”,但正文中并未包含模拟研究,而是将其放在了补充材料中。因此,我们无法在此讨论真实数据例子。模拟研究通常用于验证理论结果(如第一类错误控制、功效)在有限样本下的表现,但这不是真实应用。
🔎 结论是否比证明窄¶
- 窄结论1:定理1(第一类错误控制)的证明依赖于差值分布 \( H \) 的连续性(假设2)。如果 \( H \) 不连续(例如,存在离散点或结),那么自举临界值可能无法严格控制第一类错误。作者在结论中可能声称检验“控制第一类错误”,但严格来说,这个结论只在连续性假设下被证明。作者可能在讨论中提到了处理结的方法,但这不是证明的一部分。
- 窄结论2:定理2(一致性)的证明假设备择假设是固定的(即不对称性不随 \( n \) 衰减)。对于局部备择假设(即不对称性以 \( 1/\sqrt{n} \) 的速度趋近于0),该检验的功效可能不会趋近于1。作者没有讨论检验在局部备择假设下的性质(如渐近相对效率)。这是一个常见的窄化,但值得指出。
四、开放问题¶
- 局部备择假设下的功效:本文只证明了检验在固定备择假设下的一致性。一个自然的开放问题是:该检验在局部备择假设(即 \( H \) 以 \( 1/\sqrt{n} \) 的速度偏离对称性)下的渐近功效是多少?能否与某个最优检验(如基于似然比的检验)的渐近功效进行比较?这扎根于定理2的证明,它只处理了固定备择假设。
- 高维配对数据:本文假设配对数量 \( n \) 远大于1。如果数据是高维的(例如,每个配对 \( (X_i, Y_i) \) 本身是一个高维向量,\( p \gg n \)),如何检验USO?这需要新的统计量和理论。这扎根于作者在intro中未讨论高维情形这一事实。
- 更一般的序关系:USO是比SO更强的序关系。是否存在介于SO和USO之间的其他序关系(如似然比序、失效率序),并且也能在配对数据下进行检验?本文的方法(转化为对称性检验)是否能够推广?这扎根于论文的引言部分,它只讨论了USO和SO。
- 检验的最优性:本文提出的检验是否在某种意义下是最优的(例如,在minimax框架下,对于某类备择假设,其功效是最高的)?这是一个理论问题,需要计算检验的minimax功效界。这扎根于作者未讨论检验的最优性这一事实。
Maintained by 陈星宇 · Homepage · Source on GitHub