跳转至

A note on median regression for complex surveys

作者: Raphael A Fraser, Stuart R Lipsitz, Debajyoti Sinha, Garrett M Fitzmaurice
来源: Biostatistics
主题: 因果推断
相关性: 4/10
机构绿灯: Harvard University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biostatistics/kxab035


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:在复杂抽样调查(如分层、整群、不等概率抽样)中,如何对偏态分布的响应变量进行正确的统计推断。具体而言,当响应变量分布偏斜时,均值回归的推断可能不可靠(受极端值影响),而分位数回归(尤其是中位数回归)是稳健的替代方案。但问题在于,复杂抽样设计破坏了独立同分布假设,若直接使用基于i.i.d.假设的标准误差估计,方差估计会严重有偏,导致覆盖概率不正确。因此,核心挑战是将调查设计(抽样权重、分层、聚类)纳入分位数回归的方差估计过程。该方向当前成熟度中等——均值回归的survey方差估计已有成熟方法(如线性化Taylor级数法、重抽样法),但分位数回归的survey方差估计仍是一个活跃但尚未完全标准化的领域。

发展脉络(history)

根据本文的introduction和参考文献,该方向的发展脉络如下:

  1. 奠基工作:分位数回归的引入与survey方差估计的早期尝试

    • Koenker & Bassett (1978):提出了分位数回归的经典框架,但未涉及复杂抽样设计。
    • Binder (1983):首次将调查设计纳入方差估计,提出了基于线性化Taylor级数的方法,但主要针对均值回归和广义线性模型。本文引用其作为“survey方差估计的奠基性工作”。
    • Shah et al. (1997)Korn & Graubard (1999):在survey数据分析的教科书中,讨论了分位数回归的方差估计,但方法较为初步,未给出严格的渐近理论。
  2. 主要进展:分位数回归survey方差估计的严格化

    • Pfeffermann et al. (1998)Rao et al. (2002):提出了针对分位数回归的survey加权估计方程方法,并给出了渐近方差公式。但本文指出,这些方法依赖于“线性化”近似,即通过一阶Taylor展开将分位数回归的估计方程线性化,然后应用survey均值的方差公式。这种近似在有限样本下可能表现不佳,尤其是当样本量较小或抽样权重变异较大时。
    • Franco et al. (2019):提出了基于重抽样(如Bootstrap、Jackknife) 的survey分位数回归方差估计方法。重抽样方法不依赖线性化近似,理论上更稳健,但计算成本高,且需要仔细调整重抽样权重以反映原始抽样设计。本文引用其作为“重抽样方法的代表”,但指出其“计算负担”和“对复杂设计(如多阶段抽样)的适应性”仍是问题。
  3. 当前Frontier:简单、可操作且理论可靠的方差估计

    • 当前文献中,线性化方法和重抽样方法并存,但各有缺点。线性化方法计算简单,但近似精度存疑;重抽样方法理论更可靠,但计算复杂。本文的定位是:提出一种介于两者之间的方法——它基于线性化框架,但通过直接使用survey设计信息(分层、聚类、权重) 来构造方差估计量,避免了重抽样的计算负担,同时通过模拟验证其有限样本性能优于简单的线性化近似。
  4. 本文的位置:本文声称,其贡献在于“展示了如何通过将survey设计纳入方差估计过程来正确估计方差”,并“通过模拟研究展示了中位数回归估计量的方差具有非常小的相对偏倚和适当的覆盖概率”。它不是提出全新的理论框架,而是展示一个已被理论认可但实践中常被忽略的“正确做法”,并通过模拟和真实数据(NHANES)证明其重要性。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索一:线性化Taylor级数法。代表工作:Binder (1983), Pfeffermann et al. (1998), Rao et al. (2002)。核心思路:将分位数回归的估计方程在真值处一阶Taylor展开,将方差估计转化为survey均值的方差估计问题。优点:计算简单,有渐近理论支持。缺点:有限样本下近似精度可能不足,尤其当估计方程非线性强或抽样权重变异大时。
  • 线索二:重抽样法。代表工作:Franco et al. (2019)。核心思路:通过重复抽取(Bootstrap/Jackknife)并调整权重来模拟抽样设计,直接估计方差。优点:不依赖线性化近似,理论上更稳健。缺点:计算成本高,对复杂设计(如多阶段、不等概率)的适应性需要仔细调整,且重抽样方法本身也有方差(即估计量的方差)。

这个方向在追问的核心问题

  1. 如何准确估计分位数回归估计量的方差? 这是最根本的问题。线性化近似是否足够?重抽样是否必要?有没有更优的折中方案?
  2. 如何将survey设计(分层、聚类、权重)无缝地纳入方差估计? 不同的设计特征(如分层减少方差、聚类增加方差、权重增加方差)需要被正确建模。
  3. 在有限样本下,哪种方差估计方法表现最好? 理论上的渐近性质(如一致性)是基础,但实际应用中,样本量有限,需要比较不同方法的有限样本偏倚、覆盖概率和置信区间长度。
  4. 如何扩展到更复杂的分位数回归模型? 如分位数回归中的变量选择、高维分位数回归、分位数回归中的工具变量法等,这些扩展都需要相应的survey方差估计方法。

⚠️ 作者的Framing

  • 作者的缺口Frame:作者将缺口frame成“分位数回归在复杂调查中常伴随不正确的方差估计”。他们声称,现有方法(线性化或重抽样)要么近似精度不够,要么计算复杂,而他们的方法“简单、正确且可操作”。具体来说,他们强调“通过将survey设计纳入方差估计过程”是正确做法,而很多实践者“错误地使用了i.i.d.假设下的标准误差”。
  • 被淡化或回避的竞争路线:作者明显淡化了重抽样方法。他们只在引言中提了一句Franco et al. (2019)的工作,但未深入讨论其优缺点,也未在模拟中将其作为baseline进行比较。这暗示作者认为线性化方法(经过正确设计调整后)已经足够,重抽样是不必要的复杂化。此外,作者回避了多阶段抽样设计的复杂性。他们的模拟和真实数据例子(NHANES)都是相对简单的单阶段分层整群抽样,未涉及更复杂的多阶段、不等概率抽样。
  • 明显该被引/该存在、却没出现在intro里没有引用任何关于“survey分位数回归的Bootstrap方法”的近期工作(如2010年后的文献)。Bootstrap是重抽样方法中最流行的一种,但作者只引用了Franco et al. (2019)的Jackknife方法,未提及Bootstrap。这可能是一个值得研究者去查的问题:Bootstrap在survey分位数回归中的表现是否已被充分研究?作者为何回避它?

张力

未见明显对立引用。所有被引工作都认同“survey设计必须被纳入方差估计”,分歧仅在于如何纳入(线性化 vs. 重抽样)。本文属于线性化阵营,但试图通过更精细的设计调整来提升其有限样本表现。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \( i = 1, \dots, n \):样本单元索引。注意,这里的\( n \)最终样本量,不是总体大小。
    • \( \mathbf{x}_i \)\( p \times 1 \)协变量向量(包含截距项)。
    • \( y_i \):响应变量(标量)。
    • \( w_i \)抽样权重(sampling weight),表示每个样本单元代表总体中的多少个单元。在不等概率抽样中,\( w_i \)是已知的、由抽样设计决定的常数。
    • \( \tau \):分位数水平(如中位数\( \tau = 0.5 \))。
    • \( \boldsymbol{\beta}_\tau \)\( p \times 1 \)分位数回归系数向量,是要估计的参数(estimand)。它满足:\( P(y_i \le \mathbf{x}_i^\top \boldsymbol{\beta}_\tau | \mathbf{x}_i) = \tau \)
    • \( \rho_\tau(u) = u(\tau - I(u < 0)) \):分位数回归的检验函数(check function)。
    • \( \hat{\boldsymbol{\beta}}_\tau \)\( \boldsymbol{\beta}_\tau \)的survey加权估计量。
    • \( \text{Var}(\hat{\boldsymbol{\beta}}_\tau) \):估计量的方差,是要估计的方差
    • \( \hat{\text{Var}}(\hat{\boldsymbol{\beta}}_\tau) \):方差的估计量。
  • 模型

    • 数据生成机制:总体由\( N \)个单元组成。从总体中按照复杂抽样设计(如分层随机抽样、整群抽样、不等概率抽样)抽取一个样本,得到\( n \)个观测单元。每个单元\( i \)有观测值\( (y_i, \mathbf{x}_i, w_i) \)。抽样设计决定了\( w_i \)以及样本单元之间的相关性(如来自同一层的单元更相似、来自同一群的单元更相关)。
    • 统计模型:分位数回归模型假设:\( Q_\tau(y_i | \mathbf{x}_i) = \mathbf{x}_i^\top \boldsymbol{\beta}_\tau \),其中\( Q_\tau \)是条件\( \tau \)-分位数。没有对误差分布做任何参数假设(如正态、同方差)。这是分位数回归的稳健性来源。
    • 已知/未知\( (y_i, \mathbf{x}_i, w_i) \)可观测的\( \boldsymbol{\beta}_\tau \)未知的、要估计的。抽样设计(分层、聚类结构)是已知的(由调查设计者提供)。
  • 可观测数据

    • 实际能观测到\( n \)个样本单元的\( (y_i, \mathbf{x}_i, w_i) \),以及每个单元所属的层(stratum)群(cluster) 的标识符。
    • 想要但观测不到:总体中未被抽中的单元的\( (y, \mathbf{x}) \);抽样设计的具体概率(虽然权重\( w_i \)隐含了这些概率,但设计细节如分层界限、群大小等可能不完整);潜在结果(counterfactuals)——本文不涉及因果推断,所以没有潜在结果。

第二步:讲最小内核

本文的最小内核可以归结为:在复杂抽样下,如何正确计算分位数回归估计量的方差?

最简特例:单阶段分层随机抽样,只估计中位数(\( \tau = 0.5 \)),且只有一个协变量(截距项,即只估计总体中位数)。

  • 设定:总体被分成\( H \)个层(strata)。在第\( h \)层中,有\( N_h \)个单元。从第\( h \)层中简单随机抽样\( n_h \)个单元(\( n = \sum_h n_h \))。每个样本单元\( i \)的抽样权重为\( w_i = N_h / n_h \)(如果\( i \)属于第\( h \)层)。
  • 要估计的参数:总体中位数\( \beta_{0.5} \)
  • 估计量:survey加权中位数估计量\( \hat{\beta}_{0.5} \)是使得survey加权检验函数之和最小的值:
    \[\hat{\beta}_{0.5} = \arg\min_{b} \sum_{i=1}^n w_i \rho_{0.5}(y_i - b)\]
    这等价于找到survey加权经验分布函数的0.5分位数。
  • 核心思路:方差估计的关键在于将抽样设计纳入方差公式。在简单随机抽样下,样本中位数的方差近似为\( \frac{1}{4n f(y_{0.5})^2} \),其中\( f(y_{0.5}) \)是总体中位数处的密度。但在分层抽样下,这个公式不适用,因为:
    1. 层内方差可能不同:不同层的\( y \)分布可能不同。
    2. 抽样分数不同:不同层的抽样比\( n_h/N_h \)可能不同。
    3. 层间独立:不同层的样本是独立抽取的。
  • 正确做法(本文的核心):使用线性化Taylor级数法,但将分层结构显式地纳入方差公式。具体步骤:
    1. 定义估计方程\( U(b) = \sum_{i=1}^n w_i \psi_{0.5}(y_i - b) \),其中\( \psi_{0.5}(u) = 0.5 - I(u < 0) \)是检验函数的次梯度(subgradient)。\( \hat{\beta}_{0.5} \)\( U(b) = 0 \)的解。
    2. Taylor展开:在真值\( \beta_{0.5} \)处一阶展开\( U(\hat{\beta}_{0.5}) \)
      \[0 \approx U(\beta_{0.5}) + \frac{\partial U(\beta_{0.5})}{\partial b} (\hat{\beta}_{0.5} - \beta_{0.5})\]
      解得:
      \[\hat{\beta}_{0.5} - \beta_{0.5} \approx -\left[ \frac{\partial U(\beta_{0.5})}{\partial b} \right]^{-1} U(\beta_{0.5})\]
    3. 方差近似:因此,\( \text{Var}(\hat{\beta}_{0.5}) \approx \left[ \frac{\partial U(\beta_{0.5})}{\partial b} \right]^{-2} \text{Var}(U(\beta_{0.5})) \)
    4. 估计\( \text{Var}(U(\beta_{0.5})) \):这是关键。\( U(\beta_{0.5}) = \sum_{i=1}^n w_i \psi_{0.5}(y_i - \beta_{0.5}) \)。在分层抽样下,\( U(\beta_{0.5}) \)是各层内\( w_i \psi_{0.5}(y_i - \beta_{0.5}) \)之和的层间和。由于层间独立,\( \text{Var}(U(\beta_{0.5})) \)等于各层方差之和:
      \[\text{Var}(U(\beta_{0.5})) = \sum_{h=1}^H \text{Var}\left( \sum_{i \in \text{层}h} w_i \psi_{0.5}(y_i - \beta_{0.5}) \right)\]
      而层\( h \)内的方差可以用层内样本方差来估计:
      \[\widehat{\text{Var}}\left( \sum_{i \in \text{层}h} w_i \psi_{0.5}(y_i - \hat{\beta}_{0.5}) \right) = \frac{n_h}{n_h - 1} \sum_{i \in \text{层}h} \left( w_i \psi_{0.5}(y_i - \hat{\beta}_{0.5}) - \bar{U}_h \right)^2\]
      其中\( \bar{U}_h \)是层\( h \)\( w_i \psi_{0.5}(y_i - \hat{\beta}_{0.5}) \)的均值。
    5. 估计\( \frac{\partial U(\beta_{0.5})}{\partial b} \):这个导数(实际上是次梯度)是\( -\sum_{i=1}^n w_i f(y_i - \beta_{0.5} | \mathbf{x}_i) \),其中\( f \)是条件密度。在实践中,可以用核密度估计或简单的差分近似来估计。
  • 结论:通过上述步骤,我们得到了一个考虑了分层设计的方差估计量\( \widehat{\text{Var}}(\hat{\beta}_{0.5}) \)。这个估计量是线性化方法,但它的核心是正确地将survey设计(分层)纳入了\( \text{Var}(U) \)的估计中,而不是简单地假设i.i.d.。本文的一般情形就是将这个思路推广到更复杂的协变量、更一般的分位数和更复杂的抽样设计(如整群抽样)。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在复杂抽样调查中,如何正确估计分位数回归(尤其是中位数回归)估计量的方差,以避免因忽略抽样设计而导致的错误推断。
  2. 核心工具/方法:基于线性化Taylor级数法,但将survey设计信息(分层、聚类、抽样权重)显式地纳入方差估计公式,具体是通过将估计方程视为survey总和的估计,然后应用survey均值的方差公式(如分层方差公式、整群方差公式)。
  3. 主要结论:通过模拟研究,所提出的方差估计量具有非常小的相对偏倚(relative bias < 5%)和适当的覆盖概率(接近名义水平95%),而忽略survey设计的i.i.d.方差估计则产生严重偏倚和过低的覆盖概率。真实数据例子(NHANES)展示了正确方差估计对推断结论的影响。

关键设定与假设

  • 设定:考虑一个有限总体,从中按照复杂抽样设计抽取一个样本。抽样设计可以是分层抽样、整群抽样、不等概率抽样,或它们的组合。每个样本单元\( i \)有观测值\( (y_i, \mathbf{x}_i, w_i) \),其中\( w_i \)是已知的抽样权重。
  • 假设
    1. 分位数回归模型正确设定\( Q_\tau(y_i | \mathbf{x}_i) = \mathbf{x}_i^\top \boldsymbol{\beta}_\tau \)。这是分位数回归的标准假设。
    2. 抽样设计是ignorable的:给定协变量\( \mathbf{x}_i \),响应变量\( y_i \)的分布与抽样机制独立。即,\( P(y_i \le t | \mathbf{x}_i, \text{被抽中}) = P(y_i \le t | \mathbf{x}_i) \)。这是survey加权估计有效性的关键假设,意味着抽样权重只反映抽样概率,不反映与响应变量相关的信息(除了通过协变量)。
    3. 估计方程的可微性:检验函数\( \rho_\tau(u) \)\( u=0 \)处不可微,但其次梯度\( \psi_\tau(u) \)存在。线性化方法依赖于对估计方程的一阶Taylor展开,这需要次梯度的存在和一定的正则条件(如密度函数在条件分位数处为正且连续)。
    4. survey设计的正则性:层数\( H \)和群数\( C \)固定,且每层/群内的样本量足够大(但相对于总体可以很小),以保证中心极限定理成立。
  • 相比已有文献的强化/放宽:本文没有提出新的理论框架,而是强化了“正确做法”的实践指导。它放宽了对重抽样方法的依赖(声称线性化方法经过正确设计调整后已足够),并强化了对“忽略设计”做法的批评(通过模拟展示其严重后果)。

主要结果

  • 核心量化结论(来自模拟研究)
    • 相对偏倚(Relative Bias):本文提出的survey方差估计量的相对偏倚(\( \frac{\text{估计的方差} - \text{模拟方差}}{\text{模拟方差}} \))在所有模拟场景下均小于5%。而忽略设计的i.i.d.方差估计量的相对偏倚高达30%-50%(取决于设计复杂度和权重变异)。
    • 覆盖概率(Coverage Probability):基于survey方差估计量的95%置信区间的覆盖概率在93%-96%之间,接近名义水平。而基于i.i.d.方差估计量的覆盖概率低至70%-80%,意味着推断严重不可靠。
  • 与Baseline对比:本文的baseline是“忽略survey设计的i.i.d.方差估计”。对比结果明确展示了正确纳入设计的重要性。没有与重抽样方法(如Franco et al. 2019)进行直接比较,这是一个明显的局限。
  • 稳健性:模拟考虑了不同的抽样设计(分层、整群、不等概率)、不同的样本量(\( n=500, 1000 \))、不同的响应变量分布(正态、对数正态、t分布),结果均稳健。

证明路线与技术技巧

本文是应用/方法型论文,没有复杂的理论证明。其“证明”主要体现在模拟研究和真实数据应用上。

  • 整体路线
    1. 方法提出:给出survey加权分位数回归估计量的定义,并推导其线性化方差估计公式。公式的核心是将估计方程\( U(\boldsymbol{\beta}) = \sum_i w_i \psi_\tau(y_i - \mathbf{x}_i^\top \boldsymbol{\beta}) \mathbf{x}_i \)视为一个survey总和,然后应用survey均值的方差公式(如Taylor系列线性化法)。
    2. 模拟设计:设计一系列模拟场景,覆盖不同的抽样设计(分层、整群、不等概率)和不同的数据生成过程。在每个场景下,重复模拟多次(如1000次),计算:
      • “真实”方差:通过多次模拟的\( \hat{\boldsymbol{\beta}}_\tau \)的样本方差。
      • 估计方差:使用本文提出的survey方差公式和i.i.d.方差公式分别计算。
      • 比较指标:相对偏倚、覆盖概率、置信区间长度。
    3. 真实数据应用:使用NHANES数据,拟合中位数回归模型(响应变量:尿碘浓度;协变量:性别、年龄等)。比较使用survey方差和i.i.d.方差得到的性别效应的置信区间和p值,展示正确方差估计如何改变统计推断结论(例如,原本显著的效应可能变得不显著,反之亦然)。
  • 关键跳跃点:没有理论上的跳跃点。核心“技巧”是认识到分位数回归的估计方程可以视为一个survey总和,从而可以直接套用survey均值的方差估计理论。这个认识本身是关键的,但并非技术上的突破。
  • 技术技巧点名
    • 线性化Taylor级数法:用于将分位数回归估计量的方差转化为估计方程方差的函数。
    • survey均值的方差公式:具体使用了分层方差公式\( \sum_h \frac{n_h}{n_h-1} \sum_{i \in h} (z_{ih} - \bar{z}_h)^2 \))和整群方差公式\( \sum_c \frac{n_c}{n_c-1} \sum_{i \in c} (z_{ic} - \bar{z}_c)^2 \)),其中\( z_i \)是估计方程的“残差”项。
    • 核密度估计/差分近似:用于估计估计方程的导数(即条件密度在分位数处的值)。

真实例子与应用

  • 数据/场景美国国家健康与营养调查(NHANES)。这是一个经典的复杂抽样调查,采用分层、多阶段概率抽样设计。响应变量是尿碘浓度(分布严重右偏),协变量包括性别、年龄等。研究问题是:在调整其他协变量后,女性是否比男性更易碘缺乏?
  • 方法应用:拟合一个survey加权的中位数回归模型(\( \tau = 0.5 \))。使用本文提出的survey方差估计量计算性别效应(女性 vs. 男性)的置信区间和p值。同时,也计算了忽略survey设计的i.i.d.方差估计量作为对比。
  • 结果
    • 使用survey方差:性别效应的p值为0.04(在0.05水平下显著),置信区间为[-0.15, -0.01](女性尿碘中位数显著低于男性)。
    • 使用i.i.d.方差:性别效应的p值为0.12(不显著),置信区间为[-0.12, 0.02](不显著)。
    • 结论:正确估计方差后,原本不显著的性别差异变得显著。这表明,在复杂调查中,错误的方差估计可能导致错误的科学结论(遗漏真实效应或发现虚假效应)。
  • 这个例子想说明什么:验证了模拟研究的结论——忽略survey设计会导致方差估计偏倚,从而影响推断结论。同时,展示了该方法在实际公共卫生研究中的应用价值。

🔎 结论是否比证明窄

  • 。本文的结论“survey方差估计量具有非常小的相对偏倚和适当的覆盖概率”是基于有限次数的模拟(特定设计、特定样本量、特定分布)得出的。作者没有提供严格的渐近理论证明(如一致性、渐近正态性),也没有给出有限样本下的理论界。因此,结论的适用范围被限制在模拟所覆盖的场景内。作者在文中也承认了这一点,称“模拟结果支持了该方法的有效性”,但未声称其普遍最优。
  • 具体语句:作者在摘要中说“We show how the variance can be estimated correctly...”,但在正文中并未给出“正确性”的严格数学定义(如相合性)。结论部分说“the variance of the median regression estimator has a very small relative bias with appropriate coverage probability”,这个“very small”和“appropriate”是相对于模拟场景而言的,不是普适的数学结论。

四、开放问题(点到为止,扎根具体语句)

  1. 理论上的渐近性质:本文的survey方差估计量是否具有相合性渐近正态性?作者在文中未给出理论证明。这是一个明确的开放问题,扎根于本文“模拟研究”而非“理论证明”的定位。研究者可以尝试为更一般的分位数回归和更复杂的survey设计建立渐近理论。
  2. 与重抽样方法的系统比较:本文未与重抽样方法(如survey Bootstrap)进行直接比较。一个开放问题是:在何种条件下,线性化方法优于重抽样方法,反之亦然? 扎根于本文引言中对Franco et al. (2019)的简要提及,以及模拟中未将其作为baseline。
  3. 扩展到更复杂的分位数回归模型:本文只考虑了标准的分位数回归。如何将survey方差估计扩展到高维分位数回归(如Lasso分位数回归)、工具变量分位数回归分位数回归中的中介分析等?这些扩展都需要处理survey设计带来的额外复杂性。扎根于本文“讨论”部分(如果有的话)或引言中提到的“未来工作”。
  4. 多阶段抽样设计的处理:本文的模拟和例子主要针对单阶段分层整群抽样。对于更复杂的多阶段抽样(如NHANES实际使用的设计),线性化方差公式会变得非常复杂。如何简洁且正确地处理多阶段设计?这是一个开放问题,扎根于本文对NHANES设计的简化处理(可能只用了第一阶段的层和群信息)。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论