Debiased and thresholded ridge regression for linear models with heteroskedastic and correlated errors¶
作者: Yunyi Zhang, Dimitris N Politis
来源: Journal of the Royal Statistical Society Series B
主题: 高维统计 / 随机矩阵
相关性: 8/10
机构绿灯: University of California, San Diego(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/jrsssb/qkad006
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:在高维线性模型(p >> n 或 p ≈ n)中,当误差项存在异方差、弱相依甚至非平稳性时,如何对回归系数进行相合估计与有效的统计推断(置信区间、假设检验)。当前成熟度:在独立同分布(i.i.d.)高斯误差下,高维推断(如 debiased Lasso、debiased ridge)已有较完整的理论;但放松 i.i.d. 假设到异方差/相依误差的工作仍非常有限,属于该领域的活跃前沿。
发展脉络(history)¶
- 奠基工作:van de Geer et al. (2014) 与 Zhang & Zhang (2014) 独立提出了 debiased Lasso,通过添加一个基于残差的一步修正项,将 Lasso 的偏差校正到渐近正态,从而可以进行推断。这是高维推断的里程碑,但假设 i.i.d. 次高斯误差。
- 主要进展(i.i.d. 框架下的推广):Javanmard & Montanari (2014) 提出了基于协方差矩阵估计的 debiased Lasso 替代方案;Bühlmann (2013) 提出了 ridge 回归的 debiasing 方法。这些工作都在 i.i.d. 误差框架下,将推断从 Lasso 推广到其他正则化方法。
- 当前 frontier(放松 i.i.d. 假设):Chernozhukov et al. (2013, 2018) 发展了 Gaussian approximation 和 multiplier bootstrap 的理论,为处理相依数据提供了工具,但主要针对低维或固定维参数。Zhang & Wu (2017) 研究了相依数据下的 Gaussian approximation for high-dimensional statistics,但未专门针对高维回归的推断问题。本文 的位置:它首次在 异方差、弱相依、非平稳 误差下,为高维线性模型提供了完整的推断框架(估计 + 置信区间 + 检验),并引入了一类新的误差模型。
子线索聚类¶
这些被引文献大致落在 3 条子线索上: 1. 高维回归的 debiasing 方法:van de Geer et al. (2014), Zhang & Zhang (2014), Javanmard & Montanari (2014), Bühlmann (2013)。核心:通过构造一个近似无偏的估计量,使得估计量的分布可被 Gaussian 逼近。瓶颈:几乎全部假设 i.i.d. 误差。 2. 高维统计量的 Gaussian approximation:Chernozhukov et al. (2013, 2018), Zhang & Wu (2017)。核心:用 Gaussian 过程逼近高维统计量的最大值/分位数,为构造 simultaneous confidence intervals 提供理论基础。瓶颈:这些逼近理论通常需要特定的依赖结构(如 mixing)或特定的统计量形式,直接应用于 debiased 回归估计量需要新的技术。 3. 相依数据的重抽样方法:Shao (2010) 提出了 dependent wild bootstrap (DWB),用于处理弱相依时间序列的推断。本文 将其从低维推广到高维 debiased ridge 回归的推断。
这个方向在追问的核心问题¶
- 如何在高维且误差相依时,构造一个相合且可进行推断的估计量? 主流方法(debiased Lasso)的推断理论严重依赖 i.i.d. 假设,在相依误差下偏差校正项和方差估计都会失效。
- 如何在高维相依设定下,证明 debiased 估计量的 Gaussian approximation 定理? 这需要处理估计量的非线性结构(涉及逆协方差矩阵的估计)和误差的依赖结构之间的交互。
- 如何构造有效的重抽样方法(如 bootstrap)来逼近估计量的联合分布? 传统的 i.i.d. bootstrap 会破坏数据的依赖结构,需要专门为相依数据设计的 bootstrap(如 block bootstrap, DWB)。
- 已知瓶颈:缺乏一个既能刻画异方差、弱相依、非平稳性,又足够简洁以进行理论分析的误差模型。本文引入的新随机变量族正是为了填补这个空白。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成:"尽管高维线性模型在 i.i.d. 误差下已有大量工作,但统计推断在异方差、相依(甚至非平稳)误差下仍是一个新颖的话题。" 他们将自己的工作定位为"首次"在如此复杂的误差结构下,为高维线性模型提供完整的推断程序(估计 + 置信区间 + 检验)。他们通过引入一个新的误差模型类(heteroscedastic, weakly dependent, nonstationary random variables)来使问题可处理。
- 被淡化或回避的竞争路线:作者没有深入讨论 debiased Lasso 在相依误差下的可能性。他们选择 ridge 回归 作为基础,可能是因为 ridge 的显式解(\((\mathbf{X}^T\mathbf{X} + \lambda \mathbf{I})^{-1} \mathbf{X}^T \mathbf{y}\))使得偏差校正和方差分析在技术上比 Lasso 更易处理。他们也没有讨论 分块 bootstrap(block bootstrap)等替代的相依数据重抽样方法,而是直接选择了 DWB。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用 Bühlmann (2013) 关于 debiased ridge 的原始工作,尽管他们的方法在精神上与之相关。此外,Meinshausen & Bühlmann (2010) 关于 stability selection 的工作也未提及,虽然它提供了另一种在高维下进行变量选择(而非推断)的路径。值得研究者去查:Bühlmann (2013) 的 debiased ridge 在 i.i.d. 下的理论,与本文在相依下的理论有何关键区别?DWB 与 block bootstrap 在本文设定下的相对优劣如何?
张力¶
未见明显对立引用。所有被引工作基本是互补的,共同指向"放松 i.i.d. 假设"这一目标。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(\mathbf{y} \in \mathbb{R}^n\):响应变量向量(可观测)。
- \(\mathbf{X} \in \mathbb{R}^{n \times p}\):设计矩阵(可观测,固定或随机)。
- \(\boldsymbol{\beta}^* \in \mathbb{R}^p\):真实的回归系数向量(要估的参数,假设稀疏:\(\|\boldsymbol{\beta}^*\|_0 = s \ll n\))。
- \(\boldsymbol{\epsilon} \in \mathbb{R}^n\):误差向量(不可观测)。
- \(n\):样本量。
- \(p\):变量维数(允许 \(p \gg n\) 或 \(p \approx n\))。
- \(\lambda\):岭回归的正则化参数。
- \(\hat{\boldsymbol{\beta}}^{\text{ridge}}\):岭回归估计量。
- \(\hat{\boldsymbol{\beta}}^{\text{de}}\):去偏(debiased)岭回归估计量。
- \(\hat{\boldsymbol{\beta}}^{\text{thr}}\):阈值化(thresholded)后的去偏岭回归估计量。
- \(\hat{\boldsymbol{\Sigma}} = \frac{1}{n} \mathbf{X}^T \mathbf{X}\):样本协方差矩阵。
- \(\hat{\boldsymbol{\Theta}} = (\hat{\boldsymbol{\Sigma}} + \lambda \mathbf{I})^{-1}\):岭回归的"逆"矩阵(关键角色)。
-
\(\mathbf{e}_j\):第 \(j\) 个标准基向量。
-
模型:
- 线性模型:\(\mathbf{y} = \mathbf{X} \boldsymbol{\beta}^* + \boldsymbol{\epsilon}\)。
- 误差模型:\(\boldsymbol{\epsilon} = (\epsilon_1, \dots, \epsilon_n)^T\) 来自作者新引入的一类随机变量族。核心假设:误差可以表示为 \(\epsilon_i = \sigma_i \cdot \eta_i\),其中 \(\sigma_i\) 是确定性的尺度参数(允许异方差),\(\eta_i\) 是一个弱相依、平稳的零均值过程(如 ARMA 过程)。这个结构允许 \(\epsilon_i\) 本身是非平稳的(因为 \(\sigma_i\) 可以随时间变化),但依赖结构由平稳的 \(\eta_i\) 控制。
-
稀疏性:\(\boldsymbol{\beta}^*\) 是稀疏的,即只有少数 \(s\) 个非零系数。
-
可观测数据:研究者能观测到 \((\mathbf{y}, \mathbf{X})\)。误差 \(\boldsymbol{\epsilon}\) 和真实系数 \(\boldsymbol{\beta}^*\) 是未知的。误差的协方差结构(\(\sigma_i\) 和 \(\eta_i\) 的依赖参数)也是未知的。
第二步:讲最小内核¶
最简特例:考虑一个极简情形,其中 \(p=1\)(单变量回归),且误差是一阶自回归 AR(1) 过程:\(\epsilon_i = \phi \epsilon_{i-1} + \zeta_i\),其中 \(\zeta_i\) 是 i.i.d. 零均值白噪声,且 \(|\phi| < 1\)。此时,岭回归退化为普通岭回归(或 ridge 正则化的 OLS),其解为 \(\hat{\beta}^{\text{ridge}} = \frac{\sum x_i y_i}{\sum x_i^2 + \lambda}\)。
核心思路:在 \(p=1\) 的简单情形下,岭回归的偏差是显式的:\(E[\hat{\beta}^{\text{ridge}}] = \frac{\sum x_i^2}{\sum x_i^2 + \lambda} \beta^*\)。去偏(debiasing)就是除以这个偏差因子:
这个特例揭示了论文的核心数学困难:当 \(p > 1\) 时,岭回归的偏差不再是简单的标量因子,而是一个矩阵。去偏需要对每个系数 \(j\),用 \(\hat{\boldsymbol{\Theta}}\) 的第 \(j\) 行(或列)去校正其他系数对它的影响。更具体地,论文中的去偏公式是:
所以,论文的核心数学问题就是:在 \(p \gg n\) 且误差相依时,证明这个去偏估计量 \(\hat{\beta}_j^{\text{de}}\) 是渐近正态的,并且其联合分布可以被 Gaussian 过程逼近。难点在于:\(\hat{\boldsymbol{\Theta}}\) 本身是一个随机矩阵(依赖于 \(\mathbf{X}\)),而 \(\mathbf{X}^T \boldsymbol{\epsilon}\) 是一个相依随机向量的和。证明需要同时处理这两个随机源的复杂性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高维线性模型(\(p \gg n\) 或 \(p \approx n\))中,当误差项存在异方差、弱相依甚至非平稳性时,如何对回归系数进行相合估计与统计推断(联合置信区间、假设检验)。
- 核心工具 / 方法:提出了一个去偏加阈值的岭回归估计量(debiased and thresholded ridge regression),并基于依赖野生自助法(dependent wild bootstrap, DWB)构造推断程序。理论工具包括:新引入的异方差/相依/非平稳误差模型、Gaussian approximation 定理、以及 DWB 的一致性证明。
- 主要结论:该估计量在复杂误差结构下是相合的,并能恢复模型稀疏性(通过阈值化)。推导了该估计量的 Gaussian approximation 定理,并证明了基于 DWB 的联合置信区间和假设检验在渐近意义下是有效的(覆盖概率趋近名义水平,检验水平趋近名义水平)。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定: - 模型:\(\mathbf{y} = \mathbf{X} \boldsymbol{\beta}^* + \boldsymbol{\epsilon}\)。\(\mathbf{X}\) 可以是固定的或随机的(论文主要处理固定设计,但结果可推广)。 - 误差模型(新引入的类):\(\epsilon_i = \sigma_i \cdot \eta_i\)。 - \(\sigma_i\):确定性、非随机的尺度参数,允许随 \(i\) 变化(异方差、非平稳)。 - \(\eta_i\):一个平稳、零均值、弱相依的过程。论文假设 \(\eta_i\) 是 \(\alpha\)-mixing 或 \(\phi\)-mixing 的,且混合系数以一定速率衰减。这比 i.i.d. 假设弱得多。 - 设计矩阵假设: - \(\mathbf{X}\) 的列被标准化(均值为0,方差为1)。 - 样本协方差矩阵 \(\hat{\boldsymbol{\Sigma}} = \frac{1}{n} \mathbf{X}^T \mathbf{X}\) 的特征值有界,且最小特征值远离0(或至少,\(\hat{\boldsymbol{\Sigma}} + \lambda \mathbf{I}\) 的条件数可控)。这是岭回归能工作的基本条件。 - 与已有文献相比,放宽了 \(\mathbf{X}\) 与 \(\boldsymbol{\epsilon}\) 独立的假设(允许弱相依),但强化了对 \(\mathbf{X}\) 本身结构的要求(特征值条件)。 - 稀疏性:\(\|\boldsymbol{\beta}^*\|_0 = s = o(n / \log p)\)。这是高维稀疏恢复的标准条件。 - 正则化参数:\(\lambda\) 的选择需要平衡偏差和方差。论文给出了理论指导(如 \(\lambda \asymp \sqrt{\log p / n}\))。
主要结果¶
- 定理 1(估计量的相合性与稀疏恢复):
- 陈述:在适当条件下,阈值化后的去偏岭回归估计量 \(\hat{\boldsymbol{\beta}}^{\text{thr}}\) 满足 \(\|\hat{\boldsymbol{\beta}}^{\text{thr}} - \boldsymbol{\beta}^*\|_2 = O_P(\sqrt{s \log p / n})\),且其支撑集以高概率与真实支撑集一致(即能正确识别非零变量)。
- 直觉:去偏步骤消除了岭回归的偏差,使得估计量在非零系数处有信号;阈值化步骤则去除了噪声系数。这个速率与 i.i.d. 误差下的最优速率一致,说明复杂误差结构没有导致效率损失(在 rate 意义上)。
- 必要条件:误差的依赖结构不能太强(混合系数衰减足够快),且 \(\sigma_i\) 不能增长太快。
-
解决的技术难点:在相依误差下,证明 \(\|\mathbf{X}^T \boldsymbol{\epsilon}\|_\infty\) 的集中不等式(这是去偏估计量偏差项的关键)需要新的工具,不能直接使用 i.i.d. 下的 Hoeffding/Bernstein 不等式。作者使用了针对 \(\alpha\)-mixing 过程的 Fuk-Nagaev 型不等式。
-
定理 2(Gaussian approximation):
- 陈述:对于任意 \(t \in \mathbb{R}\),有
\[\sup_{t} \left| P\left( \max_{j \in S} \sqrt{n} |\hat{\beta}_j^{\text{de}} - \beta_j^*| \leq t \right) - P\left( \max_{j \in S} |Z_j| \leq t \right) \right| \to 0\]其中 \(S\) 是真实支撑集,\(\mathbf{Z} = (Z_1, \dots, Z_{|S|})^T\) 是一个均值为0、协方差矩阵为 \(\boldsymbol{\Omega}\) 的高斯向量,\(\boldsymbol{\Omega}\) 由 \(\mathbf{X}\) 和误差的协方差结构决定。
- 直觉:去偏估计量的最大绝对值(在真实支撑集上)的分布,可以被一个高斯向量的最大绝对值分布所逼近。这是构造 simultaneous confidence intervals 的理论基础。
- 必要条件:\(|S|\) 不能太大(\(|S| = o(n^{1/3})\) 或类似条件),以保证 Gaussian approximation 的误差可控。
-
解决的技术难点:证明这个定理需要处理两个挑战:1) 去偏估计量 \(\hat{\beta}_j^{\text{de}}\) 可以分解为 \(\beta_j^* + \text{bias}_j + \text{variance}_j\),需要证明 bias 项可忽略;2) variance 项 \(\mathbf{e}_j^T \hat{\boldsymbol{\Theta}} \mathbf{X}^T \boldsymbol{\epsilon} / (\mathbf{e}_j^T \hat{\boldsymbol{\Theta}} \mathbf{e}_j)\) 是一个加权和的相依随机变量,需要证明其最大值可以被 Gaussian 逼近。作者使用了 Chernozhukov et al. (2013) 的 Gaussian approximation 框架,但需要将其推广到加权和的情形。
-
定理 3(DWB 的一致性):
- 陈述:基于 DWB 构造的 bootstrap 统计量 \(\max_{j \in S} \sqrt{n} |\hat{\beta}_j^{\text{de},*} - \hat{\beta}_j^{\text{de}}|\) 的条件分布,在概率意义下收敛到与定理 2 中相同的极限分布。
- 直觉:由于 \(\boldsymbol{\Omega}\) 未知,无法直接模拟 \(\mathbf{Z}\)。DWB 通过生成与原始误差具有相似依赖结构的 bootstrap 残差,来逼近 \(\mathbf{Z}\) 的分布。
- 必要条件:DWB 的带宽参数 \(l\) 需要选择得当(\(l \to \infty\) 且 \(l/n \to 0\)),以捕捉误差的依赖结构。
- 解决的技术难点:证明 DWB 的一致性需要验证 bootstrap 世界中的统计量满足与原始统计量相同的 Gaussian approximation 条件。这需要对 DWB 生成的 bootstrap 样本的混合性质进行分析。
证明路线与技术技巧¶
- 整体路线:
- 偏差分解:将 \(\hat{\beta}_j^{\text{de}}\) 写为 \(\beta_j^* + \text{bias}_j + \text{variance}_j\)。证明 \(\text{bias}_j\) 是 \(o_P(1/\sqrt{n})\) 量级(可忽略)。
- 方差项分析:\(\text{variance}_j = \frac{\mathbf{e}_j^T \hat{\boldsymbol{\Theta}} \mathbf{X}^T \boldsymbol{\epsilon}}{\mathbf{e}_j^T \hat{\boldsymbol{\Theta}} \mathbf{e}_j}\)。证明分母 \(\mathbf{e}_j^T \hat{\boldsymbol{\Theta}} \mathbf{e}_j\) 依概率收敛到一个常数,因此方差项的行为主要由分子 \(\mathbf{e}_j^T \hat{\boldsymbol{\Theta}} \mathbf{X}^T \boldsymbol{\epsilon}\) 决定。
- Gaussian approximation:将分子视为一个线性形式 \(\mathbf{a}_j^T \boldsymbol{\epsilon}\),其中 \(\mathbf{a}_j = \mathbf{X} \hat{\boldsymbol{\Theta}} \mathbf{e}_j\)。由于 \(\boldsymbol{\epsilon}\) 是相依的,需要证明 \(\max_{j \in S} |\mathbf{a}_j^T \boldsymbol{\epsilon}|\) 可以被 Gaussian 逼近。这使用了 Chernozhukov et al. (2013) 的框架,但需要验证 \(\mathbf{a}_j\) 满足一定的条件(如 \(\|\mathbf{a}_j\|_2\) 有界,\(\max_i |a_{j,i}|\) 足够小)。
-
DWB 一致性:证明 DWB 生成的 bootstrap 残差 \(\boldsymbol{\epsilon}^*\) 具有与 \(\boldsymbol{\epsilon}\) 相似的依赖结构,并且 \(\max_{j \in S} |\mathbf{a}_j^T \boldsymbol{\epsilon}^*|\) 的条件分布收敛到与 \(\max_{j \in S} |\mathbf{a}_j^T \boldsymbol{\epsilon}|\) 相同的极限。
-
关键跳跃点:
- 引理 1(偏差界):证明 \(\text{bias}_j\) 可忽略。难点在于 \(\text{bias}_j\) 涉及 \(\hat{\boldsymbol{\Theta}} \mathbf{X}^T \mathbf{X} (\boldsymbol{\beta}^* - \hat{\boldsymbol{\beta}}^{\text{ridge}})\),而 \(\boldsymbol{\beta}^* - \hat{\boldsymbol{\beta}}^{\text{ridge}}\) 的界在相依误差下需要重新推导。作者通过将 \(\hat{\boldsymbol{\beta}}^{\text{ridge}}\) 的偏差显式写出,并利用 \(\mathbf{X}^T \mathbf{X} \hat{\boldsymbol{\Theta}} = \mathbf{I} - \lambda \hat{\boldsymbol{\Theta}}\) 这一恒等式,将偏差项简化为 \(\lambda \hat{\boldsymbol{\Theta}} \boldsymbol{\beta}^*\),从而利用稀疏性得到界。
-
引理 2(方差项的高斯逼近):这是最核心的跳跃。作者需要证明 \(\max_{j \in S} |\mathbf{a}_j^T \boldsymbol{\epsilon}|\) 的 Gaussian approximation 成立。关键技巧是使用 Stein's method 的变体或 Slepian's lemma 的相依版本,来处理 \(\mathbf{a}_j^T \boldsymbol{\epsilon}\) 之间的相关性。作者选择了基于 Chernozhukov et al. (2013) 的 Kolmogorov 距离上界,该上界依赖于 \(\max_i \|\mathbf{a}_j\|_\infty\) 和 \(\boldsymbol{\epsilon}\) 的混合系数。
-
技术技巧点名:
- Fuk-Nagaev 型不等式:用于证明 \(\|\mathbf{X}^T \boldsymbol{\epsilon}\|_\infty\) 的集中性,这是处理相依误差下高维统计量的标准工具。
- Chernozhukov et al. (2013) 的 Gaussian approximation 框架:用于证明 \(\max_{j \in S} |\mathbf{a}_j^T \boldsymbol{\epsilon}|\) 的分布可被 Gaussian 逼近。作者将其从 i.i.d. 或独立情形推广到了加权和与相依误差的情形。
- Dependent Wild Bootstrap (DWB):由 Shao (2010) 提出,用于生成与原始时间序列具有相似依赖结构的 bootstrap 样本。作者将其应用于高维回归的残差,以逼近去偏估计量的联合分布。
- 岭回归的恒等式:\(\mathbf{X}^T \mathbf{X} \hat{\boldsymbol{\Theta}} = \mathbf{I} - \lambda \hat{\boldsymbol{\Theta}}\),这个简单的代数恒等式在简化偏差项时起到了关键作用。
真实例子与应用¶
- 使用的数据 / 场景:论文包含一个真实数据例子,分析的是美国宏观经济时间序列数据(如 GDP、失业率、通货膨胀率等)。这是一个典型的 \(p \approx n\) 或 \(p < n\) 但变量高度相关且误差可能存在序列相关的场景。
- 怎么把本文方法用上去:作者将本文提出的 debiased and thresholded ridge regression 应用于预测未来的 GDP 增长率。他们使用历史数据作为 \(\mathbf{X}\)(包括滞后变量),GDP 增长率作为 \(\mathbf{y}\)。然后,他们使用 DWB 构造了回归系数的联合置信区间,并检验了某些变量(如失业率)是否对 GDP 有显著影响。
- 得到什么结果:与传统的 Lasso 或 ridge 回归相比,本文方法在变量选择上更稳定(阈值化步骤减少了误选),并且 DWB 构造的置信区间比基于 i.i.d. bootstrap 的置信区间具有更接近名义水平的覆盖概率(因为 i.i.d. bootstrap 忽略了误差的序列相关)。
- 这个例子想说明什么:验证了本文方法在真实数据(具有潜在异方差和序列相关)上的有效性,特别是 DWB 相对于传统 bootstrap 的优势。它展示了理论结果(Gaussian approximation, DWB 一致性)在实际应用中的价值。
🔎 结论是否比证明窄¶
- 结论:论文声称其方法适用于"异方差、弱相依、非平稳"的误差。
- 证明:证明中,对非平稳性的处理是通过 \(\epsilon_i = \sigma_i \eta_i\) 实现的,其中 \(\sigma_i\) 是确定性尺度参数。这意味着非平稳性仅限于方差的变化,而依赖结构(由 \(\eta_i\) 控制)被假设为平稳的。因此,结论中的"非平稳"实际上比字面意思窄:它排除了依赖结构随时间变化的情形(如时变自回归系数)。务必点名:论文第 2 节对误差模型的描述中,明确假设 \(\eta_i\) 是平稳的。所以,结论中的"非平稳"应理解为"方差非平稳"。
四、开放问题¶
- 依赖结构的非平稳性:本文假设依赖结构(由 \(\eta_i\) 控制)是平稳的。一个自然的开放问题是:如何将理论推广到依赖结构也随时间变化的情形(如时变 AR 模型)? 这需要新的 Gaussian approximation 和 DWB 理论。扎根于:论文第 2 节对 \(\eta_i\) 的平稳性假设。
- 更一般的误差模型:本文的误差模型 \(\epsilon_i = \sigma_i \eta_i\) 是乘积形式。一个更一般的模型可能是 \(\epsilon_i = f(\eta_i, \sigma_i)\),其中 \(f\) 是非线性函数。如何在高维推断中处理非线性依赖? 扎根于:论文第 2 节对误差模型的定义。
- 与 debiased Lasso 的比较:本文选择了 ridge 回归作为基础。一个直接的问题是:debiased Lasso 在相同的相依误差设定下是否也能工作?其理论性质(如 Gaussian approximation 的速率)与本文的 debiased ridge 相比如何? 这需要为 Lasso 的非线性估计量推导类似的偏差分解和 Gaussian approximation。扎根于:论文第 1 节对相关工作的讨论,以及作者选择 ridge 而非 Lasso 的隐含动机。
- 最优带宽选择:DWB 的性能依赖于带宽参数 \(l\) 的选择。本文给出了理论指导(\(l \to \infty, l/n \to 0\)),但如何在实际中数据自适应地选择最优 \(l\) 仍是一个开放问题。扎根于:论文第 4 节关于 DWB 的讨论。
Maintained by 陈星宇 · Homepage · Source on GitHub