Lasso Universality Under Linearly Dependent Covariates in the Sparse Regime¶
作者: Soroush Mesforush, Rahul Parhi
主题: 高维统计 / 随机矩阵
相关性: 7/10
链接: https://arxiv.org/abs/2608.08390
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向研究的是高维线性回归中估计量的“高斯普适性”(Gaussian universality)。核心问题是:当一个估计量(如 Lasso)的统计行为(如均方误差、相位转移阈值)是在设计矩阵为 i.i.d. 高斯的假设下被精确刻画时,这个刻画在多大程度上对非高斯、非独立的设计矩阵仍然成立?如果成立,我们就说该估计量是“普适的”。这个方向的根本动机是:真实数据的设计矩阵几乎从不满足 i.i.d. 高斯假设,但理论分析又极度依赖该假设;普适性定理为“用高斯设计做理论分析,然后放心地应用到实际设计”提供了数学保证。当前该方向的成熟度较高,已有大量针对 i.i.d. 子高斯设计、旋转不变设计、块依赖设计的普适性结果,但对更一般的行-列同时混合依赖(即协变量矩阵的行和列都呈现线性依赖结构)的普适性研究尚不完整。
发展脉络¶
-
奠基工作:Donoho & Tanner (2009) [17] 在压缩感知中观察到稀疏恢复的相位转移现象,并猜测其具有普适性。这项工作为后续的普适性研究提供了核心问题(相位转移的普适性)和实验证据。Bayati, Lelarge & Montanari (2015) [3] 证明了多面体几何中相位转移的普适性,并建立了与近似消息传递(AMP)算法的联系,这是早期的重要理论突破。同时,Lindeberg 原理的推广(Chatterjee, 2006 [13]; Korada & Montanari, 2010 [23])为普适性证明提供了经典的技术路线:通过逐元素替换和矩匹配来证明统计量对分布细节不敏感。
-
主要进展(i.i.d. 与旋转不变设计):Bayati & Montanari (2011) [4] 首次严格推导了 Lasso 在高斯 i.i.d. 设计下的渐近均方误差。Thrampoulidis, Abbasi & Hassibi (2018) [18] 利用凸高斯极小极大定理(CGMT)将精确误差分析推广到一大类正则化 M-估计量。Han & Shen (2023) [31] 建立了一个更一般的普适性框架,覆盖了多种正则化回归估计量。这些工作主要依赖设计矩阵的 i.i.d. 或旋转不变结构。
-
当前 Frontier(依赖设计):近期工作开始处理非 i.i.d. 的依赖设计。Lahiry & Sur (2024) [36] 将普适性推广到块依赖线性模型,其中协变量在块内可以相关,但块间独立。Tsuda & Imaizumi (2026) [51] 进一步扩展了块依赖框架,并开发了适用于块依赖的广义 Lindeberg 原理。Dudeja, Sen & Lu (2024) [25] 引入了一个“普适性类”的概念,通过一组确定性条件(固定谱分布和“通用”奇异向量)来刻画设计矩阵,并证明同一类中的矩阵在正则化最小二乘中表现相同。Moniri & Hassani (2025) [43] 考虑了线性依赖的协变量模型 X=AZB,但只证明了岭回归的普适性。
-
本文的位置:本文声称填补了“当协变量矩阵同时具有行依赖和列依赖(线性依赖结构)时,Lasso 在稀疏 regime 下的普适性”这一空白。它直接推广了 Moniri & Hassani (2025) [43] 的模型(从岭回归到 Lasso),并处理了比块依赖 [36, 51] 更一般的行-列同时混合依赖。其证明策略的关键创新在于将原始-对偶验证(PDW)框架(Wainwright, 2009 [53])从支持恢复问题“借用”到普适性证明中,通过先证明“oracle Lasso”(已知真实支持)的普适性,再证明在特定条件下 oracle 解就是全 Lasso 解,从而传递普适性。
子线索聚类¶
- 基于 Lindeberg 原理的普适性:这条线索通过逐元素替换和矩匹配来证明。代表工作:Chatterjee (2006) [13], Korada & Montanari (2010) [23], Hu & Lu (2023) [33](随机特征模型)。优点是技术相对通用,但通常需要较强的矩条件或独立性假设。
- 基于 CGMT / AMP 的普适性:这条线索利用凸高斯极小极大定理或近似消息传递的状态演化来刻画估计量的渐近行为,并证明该行为对设计矩阵的分布不敏感。代表工作:Thrampoulidis et al. (2018) [18], Bayati et al. (2015) [3], Celentano, Montanari & Wei (2023) [12](一般高斯设计)。优点是能给出精确的渐近公式,但通常要求设计矩阵具有某种“旋转不变”或“i.i.d.”结构。
- 基于谱条件的普适性:这条线索通过固定设计矩阵的谱分布和奇异向量结构来定义普适性类。代表工作:Dudeja, Sen & Lu (2024) [25]。优点是能处理更确定性的设计,但证明通常更复杂,且对“通用奇异向量”的定义可能限制其适用范围。
- 依赖设计的普适性:这条线索专门研究具有特定依赖结构(如块依赖、线性依赖)的设计矩阵。代表工作:Lahiry & Sur (2024) [36], Tsuda & Imaizumi (2026) [51], Moniri & Hassani (2025) [43]。本文属于此线索,但声称处理了更一般的行-列同时混合依赖。
这个方向在追问的核心问题¶
- 普适性的边界在哪里? 对于哪些类型的估计量(Lasso, Ridge, 弹性网, M-估计量)和哪些类型的设计矩阵(i.i.d., 旋转不变, 块依赖, 线性依赖, 因子模型, 图依赖),普适性成立?已知的边界条件(如稀疏度、信噪比、谱条件)是什么?
- 普适性失效的条件是什么? 是否存在设计矩阵的依赖结构(如强长程相关、特定稀疏结构)会破坏普适性?例如,Wen et al. (2025) [55] 的工作表明在某些二次缩放随机特征模型中高斯等价性会失效。
- 如何将普适性从“点估计”推广到“推断”? 目前多数普适性结果关注点估计(如均方误差),但统计推断(如置信区间、假设检验)的普适性研究相对较少。Celentano et al. (2023) [12] 在这方面有初步进展,但仅限于一般高斯设计。
- 普适性证明的技术路线能否统一? 现有的 Lindeberg、CGMT、谱条件等方法各有优劣,是否存在一个更统一的框架能覆盖更广泛的设定?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者在引言中明确指出:“there is a gap in the literature when considering general row/column dependencies, which motivates our investigation, particularly in the sparse regime.” 他们将自己的工作定位为“首次允许更一般的行-列同时混合依赖”,从而成为“显然的下一步”。他们通过引用 Moniri & Hassani (2025) [43](岭回归)和 Dudeja et al. (2024) [25](普适性类)来建立自己工作的动机和模型基础。
- 哪些竞争路线被他淡化或回避了:作者淡化了基于 CGMT 的路线,因为 CGMT 通常需要设计矩阵具有某种“旋转不变”结构(如 X = UΣV^T,其中 U, V 是 Haar 随机矩阵),而他们的模型 X=AZB 允许 A 和 B 是任意确定性矩阵,不要求旋转不变性。他们也回避了与基于 Lindeberg 原理的普适性工作的直接比较,尽管他们的证明(如 Lemma 2 的 Hanson-Wright 不等式)本质上也是一种“替换”论证,但更依赖于谱条件而非逐元素矩匹配。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用任何关于统计-计算权衡或低度多项式障碍的文献。对于一位对“信息-计算差距”感兴趣的研究者来说,这是一个值得注意的缺失。普适性定理通常描述的是统计上可能达到的最优行为(如最小化均方误差),但并未讨论计算上是否可达。如果 Lasso 的普适性成立,那么其计算复杂度(通过 FISTA 等算法)是否也具有普适性?或者,是否存在某些依赖结构使得 Lasso 的统计行为是普适的,但计算求解却变得困难?这个问题在本文中完全没有被触及。
张力¶
未见明显对立引用。所有被引工作都指向“普适性在更广泛的设定下成立”这一趋势,只是各自处理的依赖结构和技术路线不同。没有发现彼此矛盾或在略不同条件下得相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
n: 样本量(观测数)。d: 特征维度(变量数)。y ∈ R^n: 可观测的响应变量向量。X ∈ R^{n×d}: 可观测的设计矩阵(协变量矩阵)。β* ∈ R^d: 未知的真实系数向量,是要估计的参数。ξ ∈ R^n: 不可观测的噪声向量,假设为ξ ~ N(0, σ² I_n),且与X独立。S = supp(β*): 真实支持集,即β*中非零元素的位置集合。k = |S|是稀疏度。X_S ∈ R^{n×k}: 设计矩阵X中仅由支持集S对应的列组成的子矩阵。β*_S ∈ R^k: 真实系数向量中非零元素组成的子向量。λ > 0: Lasso 的正则化参数。Z ∈ R^{n×d}: 潜在变量矩阵,其元素是 i.i.d. 的、均值为 0、方差为 1 的次高斯随机变量。A ∈ R^{n×n},B ∈ R^{d×d}: 确定性矩阵,分别控制行和列的线性依赖。X = A Z B。τ_n = (1/n) tr(A^T A): 一个标量,是A^T A的迹的平均。h_n = β*_S - \hat{β}^{det}: 确定性解与真实值的差。\hat{β}: 全 Lasso 解(公式 1.2)。\hat{β}^{oracle}: Oracle Lasso 解(公式 1.3),已知真实支持集S。\hat{β}^{det}: 确定性 Lasso 解(公式 1.4),是 oracle Lasso 的渐近极限。
-
模型:
- 数据生成机制:
y = X β* + ξ,其中X = A Z B。 - 这是一个高维稀疏线性回归模型。
β*是k-稀疏的(k = o(n)),即非零元素个数远小于样本量。 A和B是已知的、确定性的矩阵,它们编码了协变量之间的线性依赖结构。Z是唯一的随机来源(除了噪声ξ),其分布可以是次高斯的(如 Rademacher, Uniform, centered-Bernoulli)。- 要估计的对象是
β*,使用 Lasso 估计量\hat{β}。
- 数据生成机制:
-
可观测数据:
- 研究者能观测到的是
(y, X),即响应向量和设计矩阵。 - 研究者不知道
β*、ξ、Z。他们知道X的生成模型X=AZB,但A和B是已知的(或可以估计的),而Z是未知的潜在变量。 - 研究者想要的是
β*的估计,以及这个估计的误差(如均方误差||\hat{β} - β*||²)。普适性定理保证:只要A和B满足某些条件,那么无论Z是高斯分布还是其他次高斯分布,Lasso 的渐近均方误差都是一样的。
- 研究者能观测到的是
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:当 A = I_n 且 B = I_d 时,模型退化为 X = Z,即设计矩阵是 i.i.d. 次高斯的。在这个特例下,Lasso 的普适性已经被广泛研究(如 Bayati & Montanari, 2011 [4])。本文的贡献在于将这一结果推广到 A ≠ I_n 且 B ≠ I_d 的情形。
那么,支撑整篇论文的最小内核是什么?是证明“oracle Lasso”的普适性,并证明在特定条件下“oracle Lasso”的解就是“全 Lasso”的解。
让我们用最简例子来理解这个内核。假设 k=1(只有一个非零系数),S = {1}。那么 β*_S = β*_1 是一个标量,X_S = X_1 是设计矩阵的第一列。Oracle Lasso 问题(公式 1.3)退化为一个一元 Lasso:
\hat{β}^{oracle} = argmin_{β ∈ R} (1/(2n)) ||y - X_1 β||² + λ|β|
\hat{β}^{oracle} = sign(X_1^T y / n) * (|X_1^T y|/n - λ)_+
(x)_+ = max(x, 0)。
现在,X_1 = A Z B e_1,其中 e_1 是第一个标准基向量。令 b_1 = B e_1 ∈ R^d,则 X_1 = A (Z b_1)。Z b_1 是一个 n 维向量,其元素是 Z 的行与 b_1 的内积。由于 Z 是 i.i.d. 次高斯的,Z b_1 的元素是独立的(因为 Z 的行独立),但方差为 ||b_1||²。然后 A 再对这个向量进行线性变换,引入行依赖。
本文的核心想法是:尽管 X_1 的结构复杂,但 (1/n) X_1^T y 这个关键统计量会集中到它的期望附近,而这个期望只依赖于 A 和 B,不依赖于 Z 的具体分布(只要 Z 是均值为 0、协方差为 I 的次高斯分布)。具体来说,Lemma 2 证明了:
(1/n) p^T W^T A^T A W q ≈ τ_n p^T q
W 是 Z 或高斯矩阵 G,p, q 是确定性向量。在这个一元例子中,p = q = b_1,所以 (1/n) X_1^T X_1 ≈ τ_n ||b_1||²。类似地,(1/n) X_1^T y ≈ τ_n b_1^T B β*。因此,oracle Lasso 的解 \hat{β}^{oracle} 会集中到确定性解 \hat{β}^{det} 附近,而 \hat{β}^{det} 只依赖于 A 和 B,与 Z 的分布无关。这就证明了 oracle Lasso 的普适性。
接下来,要证明全 Lasso 的解等于 oracle Lasso 的解。这需要证明,对于所有不在支持集 S 中的坐标 j,其对应的 KKT 条件中的次梯度绝对值严格小于 1。这等价于证明 |(1/n) X_j^T r_S| < λ,其中 r_S = y - X_S \hat{β}^{oracle} 是残差。本文的 Assumption 5 和 Lemma 5 保证了这一点。在一元例子中,j ≠ 1,需要证明 |(1/n) X_j^T r_S| < λ。由于 X_j = A Z b_j,r_S = X_1 (β*_1 - \hat{β}^{oracle}) + ξ,这个条件最终可以归结为对 A 和 B 的谱条件(Assumption 5),它确保了活跃和非活跃坐标之间的“不相关性”足够强。
所以,本文在数学上干了一件什么事?它证明了:在 X = A Z B 模型下,对于稀疏的 β*,Lasso 的均方误差的渐近行为完全由 A 和 B 决定,而与 Z 的分布(只要它是次高斯的)无关。证明分两步:1) 证明 oracle Lasso 的普适性(通过集中不等式);2) 证明在特定条件下全 Lasso 等于 oracle Lasso(通过原始-对偶验证框架)。
三、这篇论文做了什么¶
-
三句话:
- 研究了什么问题:在高维稀疏线性回归模型
y = Xβ* + ξ中,当设计矩阵具有线性依赖结构X = A Z B(A和B是确定性矩阵,Z是 i.i.d. 次高斯矩阵)时,Lasso 估计量的均方误差是否具有高斯普适性。 - 核心工具 / 方法:证明策略是两阶段的。首先,利用 Hanson-Wright 不等式等集中不等式证明“oracle Lasso”(已知真实支持集)的解收敛到一个确定性问题(公式 1.4)的解,从而建立 oracle Lasso 的普适性。然后,借用原始-对偶验证(PDW)框架(Wainwright, 2009 [53]),在特定的方向性严格对偶可行条件(Assumption 5)下,证明全 Lasso 的解以高概率等于 oracle Lasso 的解,从而将普适性传递给全 Lasso。
- 主要结论:在 Assumptions 1-5 下,对于
W ∈ {Z, G}(G是与Z同均值协方差的高斯矩阵),全 Lasso 解\hat{β}(W)的均方误差||\hat{β}(W) - β*||²的期望和概率收敛到同一个极限,即 Lasso 的均方误差是普适的(Corollary 2)。
- 研究了什么问题:在高维稀疏线性回归模型
-
关键设定与假设:
- Assumption 1 (稀疏性):
β*是k-稀疏的,且k = o(n)。这是“稀疏 regime”的定义,也是 PDW 框架成立的关键。 - Assumption 2 (线性依赖模型):
X = A Z B,A和B是算子范数有界的确定性矩阵,Z是 i.i.d. 次高斯矩阵。这定义了本文考虑的依赖结构。相比 i.i.d. 设计,它允许行和列同时存在线性依赖。 - Assumption 3 (谱分布):
A^T A和B^T B的经验谱分布弱收敛到某个极限分布。这个假设主要用于例子(如 Section 3.5 的随机正交矩阵),并非证明主定理所必需。 - Assumption 4 (活跃集特征值条件):
λ_min( (1/n) tr(A^T A) B_S^T B_S ) ≥ κ > 0。这保证了确定性目标函数(公式 1.4)是强凸的,从而 oracle Lasso 的解是唯一且稳定的。这是 PDW 框架中的标准条件。 - Assumption 5 (方向性严格对偶可行条件):
max_{j∈S^c} | (1/n) tr(A^T A) b_j^T B_S h_n | ≤ (1-η)λ,其中h_n = β*_S - \hat{β}^{det}。这是本文的关键创新假设。它比 Wainwright (2009) [53] 中的ℓ_∞ → ℓ_∞算子范数条件更弱,因为它只要求在特定的残差方向h_n上成立,而不是对所有可能的子梯度方向。这个条件确保了活跃和非活跃坐标之间的“方向性不相关性”,是连接 oracle 解和全解的核心桥梁。
- Assumption 1 (稀疏性):
-
主要结果:
- Proposition 1 (Oracle Lasso 的收敛性):在 Assumptions 1, 2, 4 下,oracle Lasso 的解
\hat{β}^{oracle}_S以概率收敛到确定性解\hat{β}^{det}。这个收敛对Z和G都成立。 - Corollary 1 (Oracle Lasso 的 SE 普适性):作为 Proposition 1 的直接推论,oracle Lasso 的均方误差
||\hat{β}^{oracle}_S - β*_S||²在Z和G下是渐近等价的(期望和概率收敛)。 - Theorem 1 (全 Lasso 等于 Oracle Lasso):在 Assumptions 1, 2, 4, 5 下,全 Lasso 的解以趋于 1 的概率是唯一的,并且等于 oracle Lasso 的解。这个结论对
Z和G都成立。 - Corollary 2 (全 Lasso 的 SE 普适性):作为 Corollary 1 和 Theorem 1 的直接推论,全 Lasso 的均方误差
||\hat{β} - β*||²在Z和G下是渐近等价的。这是本文的最终结论。
- Proposition 1 (Oracle Lasso 的收敛性):在 Assumptions 1, 2, 4 下,oracle Lasso 的解
-
证明路线与技术技巧:
- 整体路线:
- Oracle 普适性:证明 oracle Lasso 的解收敛到确定性解。这通过证明 oracle Lasso 的目标函数(公式 4.8)在任意紧集上一致收敛到确定性目标函数(公式 2.8)来实现。关键步骤是 Lemma 3,它利用 Lemma 2 的集中不等式证明了
(1/n) X_S^T X_S和(1/n) X_S^T ξ分别收敛到它们的期望。然后利用目标函数的强凸性(Lemma 4)得到解的收敛性。 - Oracle-to-Full 桥接:证明全 Lasso 的解等于 oracle Lasso 的解。这通过验证 KKT 条件来实现。关键步骤是 Lemma 5,它证明了对于非活跃坐标
j ∈ S^c,(1/n) X_j^T r_S集中到τ_n b_j^T B_S h_n。结合 Assumption 5(|τ_n b_j^T B_S h_n| ≤ (1-η)λ),可以证明|(1/n) X_j^T r_S| < λ以高概率成立,这意味着 oracle 解满足全 Lasso 的 KKT 条件。然后通过凸性论证证明该解是唯一的。
- Oracle 普适性:证明 oracle Lasso 的解收敛到确定性解。这通过证明 oracle Lasso 的目标函数(公式 4.8)在任意紧集上一致收敛到确定性目标函数(公式 2.8)来实现。关键步骤是 Lemma 3,它利用 Lemma 2 的集中不等式证明了
- 关键跳跃点:最吃功夫的引理是 Lemma 5,它需要同时控制三个项的收敛性(公式 5.1, 5.2, 5.3)。特别是公式 5.1,它需要证明
(1/n) X_j^T X_S h_n对τ_n b_j^T B_S h_n的集中性,其中h_n本身是依赖于\hat{β}^{det}的随机量(尽管是确定性的)。作者通过将h_n视为固定向量,然后利用 Lemma 2 的集中不等式和联合界(union bound)来处理所有j ∈ S^c。难点在于h_n的范数需要被控制(Lemma 4 保证了这一点),并且d可以远大于n,但联合界仍然有效,因为指数衰减速度exp(-cn)压倒了log(d)的增长。 - 技术技巧点名:
- Hanson-Wright 不等式:用于证明 Lemma 2 中的二次型集中(公式 4.3)。这是处理
p^T W^T A^T A W q这类二次型的关键工具。 - 次高斯随机变量的性质:用于证明 Lemma 2 中的线性型集中(公式 4.4),以及 Lemma 1 中的矩有界性。
- ε-网(Net)论证:用于将向量/矩阵范数的控制转化为对有限多个方向上的投影的控制(Lemma 3, Lemma 5 的证明中)。
- Weyl 不等式:用于从
||Δ_n||_op的收敛性推导λ_min(\hat{Q}_n)的收敛性(Lemma 4 的证明)。 - Vitali 定理:用于从概率收敛和一致可积性(由 Lemma 1 保证)推导均方收敛(Corollary 1 的证明)。
- 原始-对偶验证(PDW)框架:用于证明全 Lasso 解等于 oracle Lasso 解(Theorem 1 的证明)。这是从支持恢复文献中借用的思想。
- Hanson-Wright 不等式:用于证明 Lemma 2 中的二次型集中(公式 4.3)。这是处理
- 整体路线:
-
真实例子与应用:
- 本文包含数值模拟实验(Section 6)。
- 用的什么数据 / 场景:模拟数据。设定
n=500,d = ⌈γn⌉,γ ∈ [0.05, 4]。稀疏度k = ⌊n^{1/3}⌋。信号β*的ℓ_2范数为 1,采用三种稀疏信号轮廓:几何衰减、锚点-扩散、归一化幂律。噪声ξ的标准差σ=0.2。Lasso 正则化参数λ = γ。 - 怎么把本文方法用上去:生成设计矩阵
X = A Z B,其中A和B从三种模型中选择:离散正弦变换(DST)矩阵、缩放高斯矩阵、均匀随机正交矩阵。Z从四种分布中采样:标准高斯、Rademacher、均匀、中心化 Bernoulli。然后计算全 Lasso 和 oracle Lasso 的解(使用 FISTA 算法),并记录它们的均方误差。每个参数设置重复 50 次取平均。 - 得到什么结果:对于所有九种
(A, B)和信号轮廓的组合,非高斯Z分布(Rademacher, Uniform, Centered-Bernoulli)下的均方误差曲线都与高斯Z下的曲线紧密贴合。同时,全 Lasso 和 oracle Lasso 的曲线也几乎重合。 - 这个例子想说明什么:数值实验旨在验证理论预测:1) Lasso 的均方误差在
X=AZB模型下是普适的,不依赖于Z的分布;2) 在满足假设的条件下,全 Lasso 的表现与 oracle Lasso 相同,从而支持了 Theorem 1 的结论。
-
🔎 结论是否比证明窄:
- 本文的主要结论(Corollary 2)是“全 Lasso 的均方误差是普适的”。这个结论是在 Assumptions 1-5 下严格证明的。然而,Assumption 5 是一个很强的、方向性的条件,它依赖于确定性解
\hat{β}^{det}。作者在 Section 3 中通过几个例子(正交变换、缩放高斯、随机正交矩阵)验证了该条件成立,但并未给出一个通用的、易于验证的充分条件。因此,结论的适用范围可能比作者声称的“更一般的行-列同时混合依赖”要窄,因为它依赖于一个难以直接验证的假设。 - 作者在结论(Section 7)中声称“The oracle estimator concentrates around a deterministic lasso problem, and a directional strict dual-feasibility condition makes this estimator the unique full lasso solution with high probability.” 这准确地反映了证明内容。但“directional strict dual-feasibility condition”本身是一个需要验证的条件,而不是一个普适成立的结论。
- 数值实验只覆盖了
n=500和特定的A, B结构,没有探索更极端的依赖结构或更大的维度,因此对理论普适性的支持是有限的。
- 本文的主要结论(Corollary 2)是“全 Lasso 的均方误差是普适的”。这个结论是在 Assumptions 1-5 下严格证明的。然而,Assumption 5 是一个很强的、方向性的条件,它依赖于确定性解
四、开放问题¶
- Assumption 5 的通用验证:本文的核心假设 Assumption 5 是一个方向性条件,依赖于确定性解
\hat{β}^{det}。能否找到一个更简单、更通用的充分条件(例如,基于A和B的谱性质或B_S和B_{S^c}之间的某种不相关性度量)来保证 Assumption 5 成立?这扎根于 Assumption 5 本身及其在 Section 3 中通过具体例子验证的方式。 - 非凸损失函数的普适性:本文只考虑了 Lasso(凸损失 + ℓ1 正则化)。对于非凸损失函数(如用于鲁棒回归的 Huber 损失)或非凸正则化(如 ℓq 正则化,0<q<1),在
X=AZB模型下是否仍有普适性?这扎根于本文的证明强烈依赖于目标函数的凸性和强凸性(Lemma 4)。 - 统计推断的普适性:本文只证明了点估计(均方误差)的普适性。对于基于 Lasso 的统计推断(如去偏 Lasso 的置信区间、假设检验),其渐近分布是否也具有普适性?这扎根于本文的结论(Corollary 2)只涉及均方误差,未涉及分布。Celentano et al. (2023) [12] 对一般高斯设计做了推断,但本文的依赖结构更复杂。
- 计算复杂度的普适性:本文证明了 Lasso 的统计行为是普适的。那么,求解 Lasso 的算法(如 FISTA, ADMM)的收敛速度或计算复杂度是否也具有普适性?是否存在某些依赖结构使得统计行为普适,但计算求解却变得困难(例如,需要更多迭代)?这扎根于本文完全没有讨论计算方面的问题,且研究者对统计-计算权衡感兴趣。
Maintained by 陈星宇 · Homepage · Source on GitHub