Nonparametric Quantile Regression Estimation With Mixed Discrete and Continuous Data¶
作者: Degui Li, Qi Li, Zheng Li
来源: Journal of Business & Economic Statistics
主题: 非参数 / 半参数
相关性: 6/10
机构绿灯: Texas A&M University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2020.1730856
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:当协变量同时包含连续型和离散型(如性别、教育水平、地区编码)时,如何非参数地估计条件分位函数。传统非参数方法(如核平滑、局部多项式)几乎都假设协变量是连续的,对离散变量要么当作连续处理(引入偏差),要么分层估计(样本量剧减)。该方向试图在保持非参数灵活性的同时,系统处理离散协变量的“离散性”——即核函数在离散变量上的定义、带宽选择、以及渐近理论。当前成熟度中等:已有若干离散核函数提议和混合协变量下的均值回归工作,但分位数回归(尤其是局部线性版本)的完整理论(渐近分布、一致收敛速度、数据驱动带宽的最优性)尚未建立——这正是本文填补的缺口。
发展脉络(history)¶
- 奠基工作:离散核函数的提出
- Aitchison & Aitken (1976):首次为离散变量构造核函数(用于判别分析),奠定了离散核的基本形式。
-
Racine & Li (2004):将离散核引入非参数回归,提出混合协变量下的Nadaraya-Watson估计,并建立了一致性。这是本文直接引用的核心奠基工作——作者说“Racine and Li (2004) proposed a nonparametric kernel regression method with mixed categorical and continuous data”,并指出其只处理了条件均值。
-
主要进展:从均值到分位数、从Nadaraya-Watson到局部线性
- Li & Racine (2008):将离散核扩展到条件密度估计,并给出交叉验证带宽选择。
- Hall, Racine & Li (2007):提出混合数据下的交叉验证方法,证明其渐近最优性(针对均值回归)。
- Yu & Jones (1998):将局部线性平滑用于条件分位数估计(仅连续协变量),建立了渐近正态性。这是分位数回归局部线性化的标准参考。
-
Cai & Xu (2008):将局部线性分位数估计扩展到时间序列,但协变量仍为连续。
-
当前frontier:混合协变量下的分位数回归
-
本文之前,没有工作同时做到:(a) 混合离散-连续协变量、(b) 局部线性(而非Nadaraya-Watson)、(c) 数据驱动带宽的渐近最优性、(d) 一致收敛速度。作者在intro中明确说:“to the best of our knowledge, there is no theoretical work on the nonparametric estimation of conditional quantile functions with mixed discrete and continuous covariates using local linear smoothing techniques.”
-
本文的位置:本文是第一个将局部线性分位数回归与离散核结合、并给出完整渐近理论(包括数据驱动带宽的最优性)的工作。它填补了从“均值回归+混合数据”到“分位数回归+混合数据”的缺口。
子线索聚类¶
这些被引文献大致落在3条子线索上:
-
线索1:离散核函数的设计与理论(Aitchison & Aitken 1976; Racine & Li 2004; Li & Racine 2008; Hall, Racine & Li 2007)
这条线专注于离散核的构造(有序/无序离散变量)、带宽选择、以及混合数据下均值/密度估计的渐近理论。本文直接继承其离散核框架。 -
线索2:非参数条件分位数估计(Yu & Jones 1998; Cai & Xu 2008; Fan & Gijbels 1996)
这条线专注于局部多项式/局部线性方法在分位数回归中的应用,但协变量几乎全是连续的。本文将其扩展到混合数据。 -
线索3:交叉验证带宽选择的最优性理论(Hall, Racine & Li 2007; Li & Racine 2004)
这条线为混合数据下的交叉验证提供了渐近最优性证明(针对均值回归)。本文将其推广到分位数回归的check loss函数下。
这个方向在追问的核心问题¶
- 离散核函数的选择:有序 vs 无序离散变量是否应使用不同核?带宽如何随离散变量水平数变化?
- 收敛速度:混合数据下,分位数估计的收敛速度是否受离散变量影响(即“维数诅咒”是否因离散变量而减轻)?
- 带宽选择的最优性:交叉验证在分位数回归(非平方损失)下是否仍保持渐近最优?
- 一致收敛性:在混合数据下,能否建立局部线性分位数估计的一致收敛速度(对后续推断如置信带构建至关重要)?
已知瓶颈:离散变量的存在使得传统核方法的泰勒展开和偏差分析需要重新处理——离散核的“阶”概念与连续核不同,且带宽的收敛速度可能不同(离散变量的最优带宽往往收敛到0的速度比连续变量慢)。
⚠️ 作者的framing¶
作者把缺口frame成:“现有工作要么只处理均值回归(Racine & Li 2004),要么只处理连续协变量下的分位数回归(Yu & Jones 1998),要么只处理Nadaraya-Watson(而非局部线性)的分位数估计(Li & Racine 2008只做了密度)。因此,局部线性分位数回归 + 混合离散-连续协变量 + 数据驱动带宽最优性是一个自然的、未被填补的缺口。”
被淡化/回避的竞争路线: - 可加模型/广义可加模型:如果离散变量水平数不多,可加模型(如Hastie & Tibshirani 1990)可能更简洁且可解释,但作者未讨论。 - 基于树的方法(随机森林分位数回归):Meinshausen (2006) 的quantile regression forests天然处理混合数据,但作者未引用或比较。 - 稀疏高维方法:如果离散变量水平数很多(如邮政编码),本文方法可能面临维数诅咒,但作者未讨论此场景。
什么明显该被引/该存在、却没出现在intro里? - Meinshausen (2006) “Quantile Regression Forests”:这是处理混合数据分位数回归的流行方法,且被广泛使用。作者在模拟中与“quantile regression forest”做了比较(见模拟部分),但intro中未引用该文献——这是一个明显的遗漏。 - Chaudhuri (1991) “Nonparametric Estimates of Regression Quantiles and Their Local Bahadur Representation”:这是局部线性分位数估计的早期理论工作(仅连续协变量),但作者引用的是Yu & Jones (1998)而非Chaudhuri (1991)——后者更早建立了Bahadur表示,对本文的证明可能更直接相关。
张力¶
未见明显对立引用。所有被引工作基本是互补的——一个做均值、一个做连续分位数、一个做离散核设计。没有出现“在相同设定下结论相反”的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( Y \):响应变量(标量,连续),如电影票房收入。 - \( \mathbf{X}^c \):连续型协变量(\( q \)-维向量),如电影评分、上映天数。 - \( \mathbf{X}^d \):离散型协变量(\( p \)-维向量),每个分量取有限个值(如电影类型:动作/喜剧/剧情等)。注意:离散变量可以是有序(如星级评分1-5)或无序(如电影类型)。 - \( \mathbf{X} = (\mathbf{X}^c, \mathbf{X}^d) \):全部协变量。 - \( \tau \):分位水平(\( 0 < \tau < 1 \)),如 \( \tau = 0.5 \) 对应中位数。 - \( g_\tau(\mathbf{x}) \):条件分位函数,即 \( Q_{Y|\mathbf{X}}(\tau | \mathbf{x}) \),是本文要估计的目标。 - \( \hat{g}_\tau(\mathbf{x}) \):估计量。 - \( K(\cdot) \):连续变量的核函数(如Epanechnikov核)。 - \( L(\cdot, \cdot) \):离散变量的核函数(如Aitchison-Aitken核)。 - \( h \):连续变量的带宽(标量,>0)。 - \( \lambda \):离散变量的带宽(标量,\( 0 \le \lambda \le 1 \))。注意:\( \lambda = 0 \) 时离散核退化为指示函数(即只使用完全匹配的样本),\( \lambda = 1 \) 时退化为均匀权重(忽略离散变量)。 - \( n \):样本量。 - \( \{(Y_i, \mathbf{X}_i^c, \mathbf{X}_i^d)\}_{i=1}^n \):独立同分布样本。
模型: - 无参数模型:\( Y_i = g_\tau(\mathbf{X}_i) + \varepsilon_i \),其中 \( \varepsilon_i \) 满足 \( P(\varepsilon_i \le 0 | \mathbf{X}_i) = \tau \)(即 \( \varepsilon_i \) 的 \( \tau \)-分位数为0)。没有对误差分布做任何参数假设。 - 目标:估计 \( g_\tau(\mathbf{x}) \) 对任意 \( \mathbf{x} = (\mathbf{x}^c, \mathbf{x}^d) \)。
可观测数据: - 研究者能观测到 \( \{(Y_i, \mathbf{X}_i^c, \mathbf{X}_i^d)\}_{i=1}^n \)。 - 不可观测:误差 \( \varepsilon_i \) 的分布、条件分位函数 \( g_\tau \) 的导数(需要估计)。 - 关键识别假设:\( g_\tau(\mathbf{x}) \) 是 \( \mathbf{x}^c \) 的平滑函数(二阶连续可微),但对 \( \mathbf{x}^d \) 无平滑性假设——离散变量的变化是跳跃的。
第二步:讲最小内核¶
最简特例:假设只有 一个连续协变量 \( X^c \)(标量)和 一个二值离散协变量 \( X^d \in \{0, 1\} \)(如性别)。我们要估计条件中位数 \( g_{0.5}(x^c, x^d) \)。
在这个特例下,本文的核心思路是什么?
-
局部线性近似:对每个固定的 \( (x^c, x^d) \),在 \( x^c \) 附近做一阶泰勒展开:
\[g_{0.5}(X^c, X^d) \approx g_{0.5}(x^c, x^d) + g'_{0.5}(x^c, x^d)(X^c - x^c),\]其中 \( g' \) 是 \( x^c \) 的导数。注意:对离散变量 \( X^d \) 不做泰勒展开——它只通过核函数加权。 -
加权分位数回归:求解以下局部加权check loss最小化问题:
\[(\hat{a}, \hat{b}) = \arg\min_{a,b} \sum_{i=1}^n \rho_{0.5}(Y_i - a - b(X_i^c - x^c)) \cdot K_h(X_i^c - x^c) \cdot L_\lambda(X_i^d, x^d),\]其中 \( \rho_\tau(u) = u(\tau - I(u<0)) \) 是check loss,\( K_h(u) = K(u/h)/h \),\( L_\lambda \) 是离散核。然后 \( \hat{g}_{0.5}(x^c, x^d) = \hat{a} \)。 -
离散核的作用:假设 \( L_\lambda(X^d, x^d) \) 定义为:
- 若 \( X^d = x^d \),权重为1;
-
若 \( X^d \neq x^d \),权重为 \( \lambda \)(\( 0 \le \lambda \le 1 \))。 当 \( \lambda = 0 \) 时,只使用与目标 \( x^d \) 相同性别的样本(即分层估计);当 \( \lambda > 0 \) 时,也借用其他性别的样本,但给予较低权重。带宽 \( \lambda \) 控制“跨离散类别借力”的程度。
-
为什么这比分层估计好? 如果 \( g_{0.5}(x^c, 0) \) 和 \( g_{0.5}(x^c, 1) \) 形状相似(例如都是 \( x^c \) 的递增函数,只是截距不同),那么借用另一性别的样本可以降低方差,而偏差增加有限。最优 \( \lambda \) 会在偏差-方差权衡中找到平衡点。
-
交叉验证选择带宽:最小化以下CV准则:
\[CV(h, \lambda) = \sum_{i=1}^n \rho_\tau(Y_i - \hat{g}_{\tau, -i}(\mathbf{X}_i)),\]其中 \( \hat{g}_{\tau, -i} \) 是去掉第 \( i \) 个样本后估计的条件分位函数。本文证明:这样选出的 \( (\hat{h}, \hat{\lambda}) \) 渐近等价于最小化某个“理想”风险的最优带宽。
这个特例揭示了论文的核心数学困难:当离散变量水平数增加时,\( \lambda \) 的收敛速度变慢(因为离散核的“有效样本量”受限于每个类别的样本数),且偏差分析需要同时处理连续核的泰勒展开和离散核的跳跃。本文的一般情形只是这个特例的“加壳”——多个连续变量、多个离散变量、一般分位水平 \( \tau \)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在协变量同时包含连续型和离散型(有序/无序)时,用局部线性平滑结合离散核函数来非参数估计条件分位函数,并建立完整的渐近理论。
- 核心工具/方法:局部线性分位数回归 + Aitchison-Aitken型离散核 + 交叉验证带宽选择(针对check loss)。
- 主要结论:① 数据驱动交叉验证带宽渐近最优(等价于最小化某理想风险);② 局部线性分位数估计量渐近正态(均方收敛速度 \( n^{-2/(4+q)} \) 量级,受连续变量维数 \( q \) 主导);③ 一致收敛速度(\( O_p(n^{-2/(4+q)} \log n) \) 量级);④ 模拟和实证(IMDb数据)验证了方法有效性。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
-
离散变量类型:\( \mathbf{X}^d \) 包含 \( p \) 个离散变量,每个可以是有序(如教育水平)或无序(如种族)。对有序离散变量,核函数考虑顺序信息(如 \( L(x^d_j, x^d_{j'}) = \lambda^{|x^d_j - x^d_{j'}|} \));对无序离散变量,核函数为 \( L(x^d_j, x^d_{j'}) = 1 \) 若相等,否则 \( \lambda \)。本文主要处理无序情况,有序情况在讨论中提及但未深入。
-
假设1(平滑性):\( g_\tau(\mathbf{x}^c, \mathbf{x}^d) \) 对 \( \mathbf{x}^c \) 二阶连续可微,且二阶偏导数在紧支撑上有界。这是局部线性估计的标准假设。
-
假设2(设计密度):连续协变量 \( \mathbf{X}^c \) 的边际密度 \( f(\mathbf{x}^c) \) 在支撑上连续且正定。离散协变量的分布是多项分布(每个组合有正概率)。
-
假设3(核函数):连续核 \( K \) 是对称、有界、二阶核(\( \int u K(u) du = 0 \),\( \int u^2 K(u) du < \infty \))。离散核 \( L \) 满足 \( L(x^d, x^d) = 1 \),且 \( 0 \le L(x^d, x^{d'}) \le 1 \) 对 \( x^d \neq x^{d'} \)。
-
假设4(带宽条件):\( h \to 0 \),\( nh^q \to \infty \);\( \lambda \to 0 \),\( n\lambda \to \infty \)(对无序离散变量)。注意:离散带宽 \( \lambda \) 的收敛速度比连续带宽 \( h \) 慢——这是混合数据的关键特征。
-
相比已有文献的强化/放宽:
- 相比Racine & Li (2004)(均值回归):本文处理分位数回归,check loss的非光滑性需要更精细的渐近分析(如Bahadur表示)。
- 相比Yu & Jones (1998)(仅连续协变量):本文增加了离散核,需要处理离散变量带来的偏差项和方差项的新结构。
- 相比Hall, Racine & Li (2007)(交叉验证最优性针对均值回归):本文将最优性理论推广到check loss,需要处理非平方损失下的风险展开。
主要结果¶
定理1(交叉验证带宽的渐近最优性): - 陈述:设 \( (\hat{h}, \hat{\lambda}) \) 为交叉验证选择的最优带宽,\( (h_0, \lambda_0) \) 为最小化某“理想”风险(已知 \( g_\tau \) 时的最优带宽)。则在正则条件下,
定理2(渐近分布): - 陈述:对任意内点 \( \mathbf{x} = (\mathbf{x}^c, \mathbf{x}^d) \),
定理3(一致收敛速度): - 陈述:在紧支撑上,
证明路线与技术技巧¶
整体路线(3-5步逻辑主干):
-
第一步:线性化(Bahadur表示)
将局部线性分位数估计量 \( \hat{g}_\tau(\mathbf{x}) \) 近似为加权最小二乘估计量。关键引理:在check loss下,\( \hat{g}_\tau(\mathbf{x}) \) 满足\[\hat{g}_\tau(\mathbf{x}) - g_\tau(\mathbf{x}) \approx \frac{1}{nh^q f(\mathbf{x}^c) f_{Y|\mathbf{X}}(g_\tau(\mathbf{x})|\mathbf{x})} \sum_{i=1}^n K_h(X_i^c - x^c) L_\lambda(X_i^d, x^d) \psi_\tau(Y_i - g_\tau(\mathbf{x})),\]其中 \( \psi_\tau(u) = \tau - I(u<0) \) 是check loss的次梯度。这一步将非光滑优化问题转化为线性统计量。 -
第二步:偏差-方差分解
对上述线性表示取期望得偏差(\( h^2 + \lambda \) 量级),取方差得 \( 1/(nh^q) \) 量级。离散变量带来的额外偏差项 \( \lambda \) 来自:当 \( X_i^d \neq x^d \) 时,\( g_\tau(X_i^c, X_i^d) \neq g_\tau(X_i^c, x^d) \),这个差异被离散核“平滑”后产生偏差。 -
第三步:交叉验证最优性
将CV准则展开为:\[CV(h, \lambda) = \text{常数} + \iint \text{MSE}(\hat{g}_\tau(\mathbf{x})) f(\mathbf{x}) d\mathbf{x}^c \sum_{\mathbf{x}^d} + o_p(\text{主项}),\]其中MSE是均方误差。证明的关键是:leave-one-out估计量 \( \hat{g}_{\tau, -i} \) 与全样本估计量 \( \hat{g}_\tau \) 的差异是 \( o_p(1/\sqrt{nh^q}) \) 量级,因此CV准则近似于“理想”风险的蒙特卡洛估计。 -
第四步:一致收敛速度
使用empirical process理论(特别是核估计的uniform consistency结果)处理 \( \sup \) 范数。关键工具是:对核函数类 \( \{K_h(\cdot - x^c)L_\lambda(\cdot, x^d) : x^c, x^d\} \) 的覆盖数(covering number)进行控制,然后应用Bernstein不等式和union bound。
关键跳跃点: - Bahadur表示的余项控制:check loss的非光滑性意味着线性化会留下余项 \( R_n \),需要证明 \( R_n = o_p(1/\sqrt{nh^q}) \)。这需要用到“分位数回归的渐近线性表示”的标准技巧(如Koenker 2005的定理4.1),但本文需要处理离散核带来的额外复杂性。 - 交叉验证的leave-one-out展开:对于check loss,leave-one-out估计量的影响不是简单的“去掉一个点”,因为分位数估计是非线性的。本文使用“infinitesimal jackknife”技巧(或称为“线性化后的leave-one-out近似”)来绕过这个困难。
技术技巧点名: - Bahadur表示:将分位数估计量线性化为加权和,是分位数回归渐近理论的标准工具。本文用其处理离散核。 - U-统计量展开:在交叉验证最优性证明中,CV准则的期望展开涉及二阶U-统计量结构(因为 \( \rho_\tau(Y_i - \hat{g}_{\tau, -i}) \) 是 \( i \) 和所有其他样本的函数)。本文使用Hájek投影(或称为“线性化”)来得到主项。 - 覆盖数 + Bernstein不等式:用于一致收敛速度的证明。这是核估计uniform consistency的标准工具(如Einmahl & Mason 2005)。 - Taylor展开 + 积分近似:用于偏差项的计算(连续部分的二阶偏差来自核的对称性,离散部分的偏差来自 \( \lambda \) 的线性项)。
真实例子与应用¶
数据:IMDb电影数据集,包含票房收入(\( Y \),对数变换)、在线评分(\( X^c \),连续)、电影类型(\( X^d \),离散,如动作/喜剧/剧情等)。
方法应用: - 估计条件中位数(\( \tau = 0.5 \))和条件分位数(\( \tau = 0.25, 0.75 \))的票房收入作为评分和类型的函数。 - 使用交叉验证选择带宽 \( h \) 和 \( \lambda \)。 - 与以下方法比较:① 忽略离散变量的局部线性分位数回归(即 \( \lambda = 0 \) 的分层估计);② 将离散变量当作连续处理的局部线性分位数回归;③ 分位数回归森林(quantile regression forest)。
结果: - 本文方法在均方误差(MSE)上优于分层估计(因为借用了跨类型信息)和“离散当连续”方法(因为避免了错误指定)。 - 与分位数回归森林相比,本文方法在低维(\( q=1, p=1 \))时表现更好,但在高维时可能不如(作者未深入讨论)。 - 实证发现:评分对票房的影响在低分位(\( \tau=0.25 \))比高分位(\( \tau=0.75 \))更陡——即低票房电影对评分更敏感。
这个例子想说明什么: - 验证理论:交叉验证确实能自动选择合理的 \( \lambda \)(在0.2-0.4之间),表明跨类型借力是有益的。 - 展示优势:相比分层估计,本文方法在样本量有限的类别(如“纪录片”类型样本少)中显著降低了方差。 - 实际洞察:分位回归揭示了评分-票房关系的异质性,这是均值回归无法捕捉的。
🔎 结论是否比证明窄¶
- 窄的地方:定理2(渐近分布)要求 \( \mathbf{x} \) 是“内点”(即 \( \mathbf{x}^c \) 不在支撑边界附近)。边界点的渐近分布(偏差项不同)未处理——作者在讨论中承认“边界效应需要单独分析”。
- 泛化的地方:作者在结论中声称方法适用于“任意离散变量”,但证明主要针对无序离散变量。有序离散变量的核函数(如 \( \lambda^{|x^d - x^{d'}|} \))的渐近理论需要不同的偏差分析(因为有序离散变量的“距离”有方向性),本文未深入。
- 未证明的claim:作者在模拟中说“本文方法优于一些现有方法”,但只与分层估计和分位数回归森林做了比较,未与更近期的混合数据方法(如基于样条的方法)比较。
四、开放问题¶
-
有序离散变量的渐近理论:本文主要处理无序离散变量,但有序离散变量(如教育水平)的核函数(如 \( \lambda^{|x^d - x^{d'}|} \))的偏差结构不同——偏差项可能包含 \( \lambda \) 的高阶项而非线性项。需要重新推导渐近分布和最优带宽。扎根于:作者在“离散核函数”一节中只给出了无序离散核的定义,有序情况仅在讨论中提及。
-
高维离散变量(\( p \) 大)时的维数诅咒:当离散变量水平数很多(如邮政编码有数千个)时,每个类别的样本量可能很小,\( \lambda \) 的最优收敛速度可能极慢(甚至不收敛)。是否存在稀疏结构假设(如只有少数离散变量重要)下的改进方法?扎根于:定理3的一致收敛速度中,\( \lambda \) 项不随 \( p \) 变化——但实际中 \( p \) 大时 \( \lambda \) 可能无法收敛到0。
-
边界点的渐近分布:定理2只适用于内点。边界点的偏差项包含 \( O(h) \) 而非 \( O(h^2) \),且离散核在边界处的行为可能不同。需要建立边界修正(如局部线性+边界核)后的渐近理论。扎根于:作者在讨论中承认“边界效应需要单独分析”。
-
与分位数回归森林的理论比较:模拟显示本文方法在低维时优于分位数回归森林,但高维时可能相反。是否存在一个理论上的“维数阈值”,在此之下局部线性方法占优、之上树方法占优?扎根于:模拟部分提到“当 \( q \) 较大时,quantile regression forest表现更好”,但未给出理论解释。
提醒:要确认第2条(高维离散变量)是否是真gap,建议去读近期关于“混合数据非参数估计”的5篇论文的intro——如果都指向“离散变量维数诅咒”作为开放问题,则是共识性缺口;如果互相打架(有的认为可忽略、有的认为关键),则是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub