Likelihood Ratio Tests for Lorenz Dominance¶
作者: Shen-Da Chang, Philip E. Cheng, Michelle Liou
来源: Journal of Business & Economic Statistics
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://doi.org/10.1080/07350015.2022.2146696
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是基于 Lorenz 曲线的随机占优(Stochastic Dominance)假设检验。其根本的统计问题是:给定两个收入/财富/健康分布 \(F\) 和 \(G\),如何检验一个分布是否在“不平等”或“社会福利”意义上占优于另一个?Lorenz 曲线及其广义形式(Generalized Lorenz Curve)是刻画这种占优关系的核心工具,而检验则涉及对经验 Lorenz 过程(Empirical Lorenz Process)和积分过程的推断。该方向当前成熟度较高,已有大量基于 bootstrap 和渐近理论的方法,但本文试图引入一种新的、基于似然比(LR)的检验框架,以处理更复杂的占优关系(如第三阶随机占优)。
发展脉络(history)¶
根据论文引言和参考文献,该方向的发展脉络可梳理如下:
-
奠基工作:Lorenz 曲线与随机占优的定义
- Atkinson (1970) 和 Kolm (1969) 奠定了 Lorenz 曲线作为不平等度量工具的理论基础。
- Shorrocks (1983) 引入了广义 Lorenz 曲线(Generalized Lorenz Curve),将 Lorenz 曲线与分布均值结合,从而能刻画“社会福利”意义上的占优(即二阶随机占优,SSD)。
- Foster & Shorrocks (1988) 系统建立了随机占优(一阶、二阶、三阶)与 Lorenz 曲线、广义 Lorenz 曲线之间的等价关系。这是该领域的核心理论框架。
-
主要进展:经验过程与 bootstrap 检验
- Beach & Davidson (1983) 和 Beach & Richmond (1985) 开创性地使用经验 Lorenz 过程(Empirical Lorenz Process)来构造检验统计量,并推导其渐近分布(通常是高斯过程)。
- Davidson & Duclos (2000) 和 Barrett & Donald (2003) 进一步发展了基于 bootstrap 的检验方法,以处理 Lorenz 曲线和广义 Lorenz 曲线比较中的复杂分布问题(如边界效应、多重比较)。这些方法成为该领域的标准工具。
- Linton, Maasoumi & Whang (2005) 提出了基于“交叉”Lorenz 曲线(Crossing Lorenz Curves)的检验,用于判断两个分布是否在 Lorenz 意义上不可比(即曲线交叉)。
-
当前 Frontier:第三阶随机占优(TSD)与更精细的刻画
- 论文指出,现有方法主要关注一阶(FSD)和二阶(SSD)随机占优。对于第三阶随机占优(TSD),其刻画更为复杂,因为它涉及“风险厌恶”的更高阶概念(即“递减绝对风险厌恶”,DARA)。
- 作者强调,两个分布可能在不存在二阶广义 Lorenz 占优(即没有 SSD)的情况下,仍然呈现 TSD。这意味着传统的基于广义 Lorenz 曲线比较的检验方法可能无法捕捉到这种更微妙的占优关系。这是本文试图填补的缺口。
-
本文的位置
- 本文提出一种新的、基于似然比(LR)的拟合优度检验,用于同时检验 Lorenz 占优(LD)、交叉 Lorenz 曲线和 TSD 的假设。其核心创新在于:
- 将 Lorenz 曲线和广义 Lorenz 曲线的比较问题,转化为一个参数化模型下的 LR 检验问题。
- 通过这种转化,检验统计量渐近服从卡方分布,从而避免了 bootstrap 的复杂计算和不确定性。
- 该方法能够直接处理 TSD 的检验,这是现有 bootstrap 方法较少直接涉及的。
- 本文提出一种新的、基于似然比(LR)的拟合优度检验,用于同时检验 Lorenz 占优(LD)、交叉 Lorenz 曲线和 TSD 的假设。其核心创新在于:
子线索聚类¶
这些被引文献大致落在以下两条子线索上:
-
线索一:理论刻画与等价关系
- 核心问题:Lorenz 曲线、广义 Lorenz 曲线与不同阶随机占优(FSD, SSD, TSD)之间的数学等价关系是什么?
- 代表工作:Atkinson (1970), Shorrocks (1983), Foster & Shorrocks (1988)。
- 当前状态:理论框架已基本成熟,但 TSD 的刻画(特别是当 SSD 不成立时)仍有待更精细的统计检验方法。
-
线索二:统计推断与假设检验
- 核心问题:如何基于样本数据,对 Lorenz 占优、广义 Lorenz 占优等假设进行有效的统计检验?
- 代表工作:Beach & Davidson (1983), Davidson & Duclos (2000), Barrett & Donald (2003), Linton et al. (2005)。
- 当前状态:主流方法是基于经验过程和 bootstrap。本文试图引入 LR 检验作为替代方案,以简化推断过程并处理 TSD。
这个方向在追问的核心问题¶
- 如何检验 Lorenz 占优(LD)? 即检验一个分布的 Lorenz 曲线是否完全位于另一个之上。
- 如何检验广义 Lorenz 占优(即二阶随机占优,SSD)? 即检验一个分布的广义 Lorenz 曲线是否完全位于另一个之上。
- 如何检验第三阶随机占优(TSD)? 特别是当 SSD 不成立时,如何刻画和检验 TSD?
- 如何处理 Lorenz 曲线交叉的情况? 当两个分布的 Lorenz 曲线交叉时,它们不可比,需要检验是否存在交叉。
当前主流方法与已知瓶颈: * 主流方法:基于经验 Lorenz 过程或积分过程的 bootstrap 检验。 * 已知瓶颈: * 计算成本:bootstrap 需要大量重抽样,计算量大。 * 推断复杂性:检验统计量的渐近分布通常是非标准的(如高斯过程的泛函),需要 bootstrap 来近似,这引入了额外的抽样误差。 * 对 TSD 的处理:现有 bootstrap 方法较少直接针对 TSD 设计检验,或者需要复杂的多重比较调整。
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口 frame 为“现有方法(bootstrap)在处理 TSD 时存在困难,且缺乏一个统一的、渐近分布简单的检验框架”。因此,他们提出 LR 检验作为“显然的下一步”,声称它能同时处理 LD、交叉 Lorenz 曲线和 TSD,且统计量渐近服从卡方分布,从而“简化”了推断。
- 被淡化或回避的竞争路线:
- bootstrap 方法的稳健性:作者可能淡化了 bootstrap 方法在处理复杂依赖结构(如时间序列、空间数据)或小样本时的稳健性。LR 检验的卡方近似在小样本下可能不如 bootstrap 准确。
- 参数化假设的代价:LR 检验的核心是将 Lorenz 曲线比较转化为参数化模型下的检验。这个参数化模型(具体是什么模型,论文中未在摘要中明确,但很可能是某种多项式或分段线性模型)的设定误差(model misspecification)风险被作者回避了。如果真实 Lorenz 曲线不符合该参数形式,LR 检验的功效和水平可能会严重受损。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 非参数或半参数检验方法:除了 bootstrap,是否存在其他非参数或半参数的检验方法(如基于 U-统计量、经验似然、或核方法)?这些方法可能更稳健,但未被提及。
- 高维或多重比较场景:当需要同时比较多个分布(例如,多个国家或地区的 Lorenz 曲线)时,如何控制多重比较的族系错误率(FWER)或错误发现率(FDR)?本文的 LR 检验框架是否容易扩展到这种场景?作者没有讨论。
- 与“随机占优”检验的通用文献的联系:Lorenz 占优是随机占优的一个特例。更广泛的随机占优检验文献(如基于 Kolmogorov-Smirnov 型统计量、Cramér-von Mises 型统计量的方法)是否与本文的方法有联系或竞争关系?作者没有建立这种联系。
张力¶
未见明显对立引用。该领域的文献在理论框架(Foster & Shorrocks, 1988)和主流推断方法(bootstrap)上似乎有较强的共识。本文的 LR 检验是对现有方法的一种补充或替代,而非颠覆。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(F, G\):两个累积分布函数(CDF),代表两个不同的收入/财富/健康分布。
- \(X \sim F, Y \sim G\):来自两个分布的随机变量(收入)。
- \(\mu_F, \mu_G\):分布 \(F\) 和 \(G\) 的均值。
- \(L_F(p)\):分布 \(F\) 的 Lorenz 曲线。定义:\(L_F(p) = \frac{1}{\mu_F} \int_0^{F^{-1}(p)} x \, dF(x)\),其中 \(p \in [0, 1]\)。它表示人口中最穷的 \(100p\%\) 所拥有的总收入份额。
- \(GL_F(p)\):分布 \(F\) 的广义 Lorenz 曲线。定义:\(GL_F(p) = \mu_F \cdot L_F(p) = \int_0^{F^{-1}(p)} x \, dF(x)\)。它表示人口中最穷的 \(100p\%\) 所拥有的总收入。
- Estimand:我们想要检验的假设是关于 Lorenz 曲线或广义 Lorenz 曲线之间的序关系。
- 样本:\(\{X_1, ..., X_n\}\) 和 \(\{Y_1, ..., Y_m\}\) 分别是来自 \(F\) 和 \(G\) 的独立同分布样本。
- 经验分布:\(\hat{F}_n, \hat{G}_m\) 是基于样本的经验 CDF。
- 经验 Lorenz 曲线:\(\hat{L}_F(p)\) 是基于 \(\hat{F}_n\) 和样本均值 \(\hat{\mu}_F\) 计算的经验 Lorenz 曲线。
-
模型:
- 这是一个非参数模型。我们不对 \(F\) 和 \(G\) 的具体形式做任何参数化假设(除了必要的正则性条件,如有限二阶矩、CDF 连续等)。检验的目标是在这个非参数框架下进行推断。
-
可观测数据:
- 可观测:我们观测到来自两个分布的独立样本 \(\{X_i\}_{i=1}^n\) 和 \(\{Y_j\}_{j=1}^m\)。我们可以计算它们的经验 CDF、样本均值、经验 Lorenz 曲线等。
- 想要但观测不到:我们想要知道的是总体 Lorenz 曲线 \(L_F(p)\) 和 \(L_G(p)\) 之间的真实关系(例如,是否 \(L_F(p) \ge L_G(p)\) 对所有 \(p\) 成立)。这是无法直接观测的,只能通过样本进行统计推断。
第二步:讲最小内核¶
本文的核心思路可以归结为以下最简特例:检验两个分布是否具有相同的 Lorenz 曲线(即 Lorenz 相等,而非占优)。
-
最简特例设定:
- 假设我们只有两个分布 \(F\) 和 \(G\),且样本量相等 \(n = m\)。
- 我们想检验的原假设 \(H_0: L_F(p) = L_G(p)\) 对所有 \(p \in [0,1]\) 成立。
- 备择假设 \(H_1: L_F(p) \neq L_G(p)\) 对某些 \(p\) 成立。
-
核心思路(在特例下):
- 参数化 Lorenz 曲线:作者的核心技巧是,将 Lorenz 曲线 \(L(p)\) 用一个参数化模型来近似。例如,假设 Lorenz 曲线可以写成某个已知基函数(如多项式)的线性组合:\(L(p) \approx \sum_{k=1}^K \beta_k \phi_k(p)\),其中 \(\{\phi_k(p)\}\) 是已知的基函数(如 Bernstein 多项式),\(\{\beta_k\}\) 是未知参数。
- 转化为参数检验:那么,检验 \(L_F(p) = L_G(p)\) 就等价于检验两个分布的 Lorenz 曲线参数是否相等:\(H_0: \beta_F = \beta_G\)。
- 构造 LR 统计量:现在,问题变成了一个参数模型下的假设检验问题。我们可以将两个样本合并,在 \(H_0\) 下估计一个共同的参数 \(\beta\)(得到 \(\hat{\beta}_0\)),并在 \(H_1\) 下分别估计 \(\beta_F\) 和 \(\beta_G\)(得到 \(\hat{\beta}_F\) 和 \(\hat{\beta}_G\))。然后,构造似然比(LR)统计量:
\[LR = -2 \left[ \ell(\hat{\beta}_0) - \ell(\hat{\beta}_F) - \ell(\hat{\beta}_G) \right]\]其中 \(\ell(\cdot)\) 是参数模型下的对数似然函数。
- 渐近分布:在 \(H_0\) 和正则条件下,LR 统计量渐近服从卡方分布,自由度等于两个分布参数向量维数之差(这里是 \(K\))。因此,我们可以直接使用卡方分布的临界值进行检验,无需 bootstrap。
-
为什么这个特例抓住了核心?
- 它清晰地展示了本文方法的核心机制:通过参数化 Lorenz 曲线,将非参数的 Lorenz 占优检验问题转化为参数模型下的 LR 检验。
- 它解释了为什么检验统计量能渐近服从卡方分布——这是 LR 检验在参数模型下的标准性质。
- 它揭示了该方法的核心代价:参数化假设的准确性。如果真实 Lorenz 曲线不能用所选基函数很好地近似,那么 LR 检验的水平和功效都会受到影响。
- 从 Lorenz 相等到 Lorenz 占优(不等式约束)的推广,本质上是在这个参数化框架下,将原假设从“参数相等”变为“参数满足一组线性不等式约束”(例如,\(\beta_F \ge \beta_G\) 在某种序关系下)。这会导致 LR 统计量的渐近分布变为混合卡方分布(Chi-bar-squared distribution),这是处理不等式约束下 LR 检验的标准结果。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了 Lorenz 占优(LD)、交叉 Lorenz 曲线和第三阶随机占优(TSD)的假设检验问题,特别是当两个分布不存在二阶广义 Lorenz 占优(SSD)时,如何刻画和检验 TSD。
- 核心工具/方法:作者提出了一种基于似然比(LR)的拟合优度检验。该方法通过将 Lorenz 曲线和广义 Lorenz 曲线参数化(例如,使用 Bernstein 多项式),将非参数的占优检验转化为参数模型下的 LR 检验。
- 主要结论:所提出的 LR 检验统计量在 \(H_0\) 下渐近服从卡方分布(对于相等性检验)或混合卡方分布(对于占优/不等式约束检验)。模拟研究表明该方法在有限样本下具有良好的表现,并成功应用于 COVID-19 区域死亡数据的双变量样本分析。
关键设定与假设¶
- 设定:两个独立样本 \(\{X_i\}_{i=1}^n\) 和 \(\{Y_j\}_{j=1}^m\),分别来自分布 \(F\) 和 \(G\)。样本量 \(n, m\) 可以不等。
- 假设:
- 正则性条件:分布 \(F\) 和 \(G\) 具有有限二阶矩,且其 CDF 在支撑集上连续且严格递增。这是保证 Lorenz 曲线和广义 Lorenz 曲线定义良好且经验过程收敛的标准条件。
- 参数化假设:Lorenz 曲线 \(L(p)\) 或广义 Lorenz 曲线 \(GL(p)\) 可以被一个已知的、有限维的参数模型很好地近似。作者在论文中很可能使用了 Bernstein 多项式,因为它在 \([0,1]\) 区间上具有良好的逼近性质,且能自然地满足 Lorenz 曲线的边界条件(\(L(0)=0, L(1)=1\))。
- 与已有文献的对比:相比 bootstrap 方法,本文的假设更强(引入了参数化假设),但计算更简单(无需 bootstrap)。相比完全非参数方法,本文的假设更弱(没有假设分布的具体形式),但依赖于参数化近似的准确性。
主要结果¶
-
定理 1(Lorenz 相等性检验):在 \(H_0: L_F(p) = L_G(p)\) 对所有 \(p\) 成立下,基于参数化 Lorenz 曲线的 LR 统计量渐近服从 \(\chi^2_K\) 分布,其中 \(K\) 是参数化模型的维数。
- 直觉:这是参数模型下 LR 检验的标准结果。关键在于参数化模型的选择和估计的一致性。
- 必要条件:参数化模型必须能一致地估计真实的 Lorenz 曲线(即模型设定正确或近似误差可忽略)。
- 解决的技术难点:如何将 Lorenz 曲线的比较转化为参数比较,并推导出 LR 统计量的渐近分布。
-
定理 2(Lorenz 占优检验):在 \(H_0: L_F(p) \ge L_G(p)\) 对所有 \(p\) 成立(即 \(F\) Lorenz 占优于 \(G\))下,基于参数化 Lorenz 曲线的 LR 统计量渐近服从一个混合卡方分布(Chi-bar-squared distribution),即 \(\bar{\chi}^2\),其自由度和权重由不等式约束的“锥”结构决定。
- 直觉:这是处理不等式约束下 LR 检验的标准结果。混合卡方分布是多个卡方分布的加权和,权重取决于真实参数落在约束边界上的概率。
- 必要条件:除了定理 1 的条件外,还需要参数化模型能刻画 Lorenz 曲线之间的序关系(例如,通过参数之间的线性不等式约束)。
- 解决的技术难点:推导混合卡方分布的权重。这通常需要计算一个高斯过程在某个锥上的投影概率,是理论上的主要难点。
-
定理 3(TSD 检验):作者将 TSD 的检验也纳入这个 LR 框架。TSD 的刻画涉及对广义 Lorenz 曲线积分的比较。通过参数化广义 Lorenz 曲线,TSD 的检验同样可以转化为参数模型下的不等式约束检验,其 LR 统计量也渐近服从混合卡方分布。
- 直觉:这是本文的核心贡献之一。它表明 LR 框架可以统一处理 LD、SSD 和 TSD。
- 必要条件:需要参数化广义 Lorenz 曲线,并建立 TSD 与这些参数之间的不等式约束关系。
- 解决的技术难点:将 TSD 的积分条件转化为参数空间上的线性不等式约束,并证明这种转化是等价的。
证明路线与技术技巧¶
-
整体路线:
- 参数化:将 Lorenz 曲线 \(L(p)\) 用一组基函数(如 Bernstein 多项式)展开:\(L(p) = \sum_{k=1}^K \beta_k B_k(p) + o(1)\),其中 \(o(1)\) 是近似误差。
- 估计:基于样本,通过某种方法(如最小二乘或拟似然)估计参数 \(\beta\)。对于 Lorenz 曲线,这通常涉及对经验 Lorenz 过程进行回归。
- 构造 LR 统计量:在 \(H_0\)(相等或占优)下,估计约束参数 \(\hat{\beta}_0\);在无约束下,估计 \(\hat{\beta}_F, \hat{\beta}_G\)。构造 LR 统计量。
- 渐近分析:
- 证明参数估计 \(\hat{\beta}\) 的渐近正态性。这依赖于经验 Lorenz 过程的弱收敛性和参数化模型的连续性。
- 证明 LR 统计量可以表示为参数估计的二次型,其渐近分布由参数估计的协方差矩阵和约束的几何结构决定。
- 对于相等性检验,得到卡方分布。
- 对于占优检验,利用 Chernoff (1954) 和 Self & Liang (1987) 关于不等式约束下 LR 检验的理论,得到混合卡方分布。
-
关键跳跃点:
- 从非参数 Lorenz 曲线到参数化模型的跳跃:这是整个方法的基础。作者需要证明,参数化模型的近似误差不会影响 LR 统计量的渐近分布(即近似误差是渐近可忽略的)。这需要控制近似误差的阶数,并证明其相对于样本量是 \(o_p(n^{-1/2})\)。
- 推导混合卡方分布的权重:对于占优检验,混合卡方分布的权重计算非常复杂,通常需要数值模拟或解析计算。作者需要给出一个可行的计算方法,或者证明在某些特殊情况下(如参数化模型是线性的)权重有简单形式。
-
技术技巧点名:
- 经验过程理论:用于证明经验 Lorenz 过程的弱收敛性,以及参数估计的渐近性质。
- Bernstein 多项式逼近:用于参数化 Lorenz 曲线,利用其良好的边界性质和逼近能力。
- Chernoff (1954) / Self & Liang (1987) 理论:用于处理不等式约束下的 LR 检验,推导混合卡方分布。
- Delta 方法:用于将 Lorenz 曲线的比较转化为参数比较。
真实例子与应用¶
- 数据/场景:COVID-19 区域死亡数据,由世界卫生组织(WHO)收集,时间跨度为 2020 年 3 月至 2021 年 2 月。这是一个双变量样本(bivariate samples),可能比较了不同地区(如不同国家或大洲)的 COVID-19 死亡分布。
- 方法应用:作者将提出的 LR 检验应用于这些数据,检验不同地区 COVID-19 死亡分布的 Lorenz 占优关系(例如,检验一个地区的死亡分布是否比另一个地区更“不平等”)。
- 结果:论文应该会报告检验结果,例如,是否拒绝了 Lorenz 相等或 Lorenz 占优的假设,以及是否发现了 TSD 的证据。
- 例子想说明什么:这个例子旨在展示本文方法在实际数据中的应用价值,特别是它能够处理 TSD 这种更微妙的占优关系,而传统的基于广义 Lorenz 曲线的方法可能无法发现。它验证了方法在真实、复杂数据上的可行性。
🔎 结论是否比证明窄¶
- 潜在问题:论文的主要结论(LR 统计量渐近服从卡方/混合卡方分布)是在参数化模型设定正确或近似误差可忽略的条件下严格证明的。然而,在真实应用中,参数化模型(如 Bernstein 多项式)的阶数 \(K\) 如何选择?如果 \(K\) 选择不当(过小导致欠拟合,过大导致过拟合),结论是否仍然成立?作者可能只证明了在 \(K\) 随样本量增长到无穷的某种条件下结论成立,但在有限样本下,\(K\) 的选择是一个实际问题,其影响可能未被充分讨论。
- 泛化 claim:作者可能泛化 claim 该方法“统一”了 LD、SSD 和 TSD 的检验。但严格来说,这个“统一”是在参数化框架下的统一。如果参数化模型无法同时很好地近似所有三种占优关系下的 Lorenz 曲线,那么这个统一性可能只是形式上的。
四、开放问题¶
-
参数化模型的稳健性:本文的 LR 检验严重依赖于 Lorenz 曲线的参数化近似。当参数化模型设定错误时,检验的水平(size)和功效(power)会如何变化? 是否存在一种数据驱动的方法来选择参数化模型的阶数 \(K\),以保证检验的稳健性?(扎根于:本文的核心假设——参数化模型能一致估计 Lorenz 曲线。)
-
高维或多重比较场景:本文只处理了两个分布的比较。当需要同时比较多个分布(例如,多个国家的 Lorenz 曲线)时,如何将 LR 检验框架扩展到多重比较? 这需要控制族系错误率(FWER)或错误发现率(FDR),并处理多个不等式约束下的 LR 检验,其渐近分布将更加复杂。(扎根于:本文的设定仅限双样本。)
-
与 bootstrap 方法的系统比较:本文声称 LR 检验比 bootstrap 方法更简单。在有限样本下,LR 检验与基于 bootstrap 的检验(如 Barrett & Donald, 2003)相比,在水平控制、功效和计算时间上表现如何? 是否存在 LR 检验表现更差(例如,由于参数化假设)的场景?(扎根于:作者对 bootstrap 方法的淡化。)
-
TSD 检验的识别力:本文声称能检验“不存在 SSD 时的 TSD”。这种 TSD 在实证数据中是否常见? 如果 TSD 的效应很微弱,LR 检验是否有足够的统计功效将其检测出来?这需要更深入的模拟研究或实证案例。(扎根于:本文的核心动机——刻画无 SSD 时的 TSD。)
Maintained by 陈星宇 · Homepage · Source on GitHub