跳转至

From dense grids to valid inference: Accounting for regularization bias in nonparametric random coefficient models

作者: Lingwei Kong, Maximilian Osterhaus, Michael Pen
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2607.25416


一、领域脉络与小综述

这个方向是什么

这个子方向关注的是非参数随机系数(Random Coefficients, RC)模型中的统计推断问题。具体来说,研究者希望从个体层面的离散选择数据(如消费者在多个商品间的选择)中,恢复出个体偏好(即随机系数)的未知分布,并进一步对该分布的平均泛函(如平均支付意愿、平均弹性、福利变化)进行点估计和区间估计。当前的核心挑战在于:为了灵活地估计分布,研究者常使用“固定网格”方法,但网格的密度与估计的稳定性之间存在根本性矛盾——网格过密会导致设计矩阵严重共线性,需要正则化;而正则化又会引入偏误,使得传统的基于渐近正态性的推断方法失效。本文正是在这个矛盾点上,为一种特定的正则化估计量(惩罚固定网格估计量)开发了“偏误感知”的推断程序。

发展脉络(history)

  1. 奠基工作:固定网格估计量的提出

    • Bajari, Fox, and Ryan (2007) / Fox, Kim, Ryan, and Bajari (2011):提出了固定网格估计量(FKRB估计量)。核心思想是将未知的连续RC分布近似为一个在预设网格点上的离散分布,然后通过线性概率模型估计每个网格点的概率质量。这是一个计算上非常吸引人的非参数方法。
    • Fox, il Kim, and Yang (2016):为FKRB估计量提供了收敛性结果,证明了随着网格变密,估计的分布可以在弱拓扑下逼近真实分布。
  2. 主要进展:应对共线性与正则化

    • Heiss, Hetzenecker, and Osterhaus (2022):指出了FKRB估计量在密集网格下的严重共线性问题,并提出了一个关键改进——在目标函数中加入ℓ2惩罚项(弹性网络,ENet估计量)。他们证明了该惩罚项可以稳定估计,并实现了支撑恢复(support recovery)。本文的引用语境:“Heiss et al. (2022) analyze support recovery in this setting and propose adding an ℓ2-penalty to stabilize estimation.” 这为本文的研究对象(ENet估计量)奠定了基础。
    • Escanciano (2023):从一个更一般的角度指出,在包含非参数未观测异质性的结构模型中,许多特征(如RC分布的某些分位数)是不规则识别的,其效率界是无穷大。这从理论上解释了为什么在密集网格下,即使没有正则化,对某些泛函的推断也会非常困难。
  3. 当前Frontier:正则化偏误下的推断

    • 在Heiss et al. (2022)的ENet估计量被提出后,一个自然的问题是:如何基于这个有偏的估计量进行有效的推断?已有的推断方法(如bootstrap)并未明确处理由ℓ2惩罚引入的“正则化偏误”。
    • Fang and Santos (2018):指出标准bootstrap对于方向可微(directionally differentiable)的变换可能失效,这为在约束优化(如非负约束)背景下使用bootstrap提出了警告。
    • Chen, Liao, and Sun (2014) / Chen and Pouzo (2015):建立了筛分推断(sieve inference) 框架,用于处理半/非参数条件矩模型中的推断问题。本文的引用语境:“The analysis builds on the sieve-inference frameworks of Chen et al. (2014) and Chen and Pouzo (2015), adapted to the fixed-grid estimator...” 本文的核心技术路线正是将这个成熟的筛分推断框架适配到惩罚固定网格估计量上。
  4. 本文的位置:本文是上述脉络的“下一步”。它接受了Heiss et al. (2022)提出的ENet估计量作为起点,承认其正则化偏误的存在,并利用Chen et al. (2014)的筛分推断框架,系统地构建了一个能够容纳(而非消除)正则化偏误的置信区间构造方法。它没有试图去“去偏”(如Chernozhukov et al., 2018的DML),而是选择“偏误感知”(bias-aware),这构成了其独特的技术定位。

子线索聚类

  1. 非参数RC分布的估计方法

    • 固定网格法:FKRB (Fox et al., 2011) 和 ENet (Heiss et al., 2022)。这是本文的核心。
    • 似然基方法:Train (2008, 2016) 使用离散混合、多项式、样条等近似。
    • 贝叶斯方法:Rossi et al. (2012), Burda et al. (2008) 使用无限混合正态分布。
    • 这些方法各有优劣,本文聚焦于固定网格法,因为其计算可处理性。
  2. 正则化偏误的推断与校正

    • 去偏/正交化方法:Chernozhukov et al. (2018, 2022) 的自动去偏机器学习(DML)。本文明确区分了自己的路径:“In contrast to approaches that remove first-order regularization effects through debiasing or orthogonalization... we retain the penalized estimator and incorporate a bound on its bias into the interval.”
    • 偏误感知方法:本文的方法。它不试图消除偏误,而是量化并纳入置信区间。
    • 边界/不等式约束推断:Andrews (1999), Fan and Shi (2023), Fang et al. (2023)。这些方法处理了非负约束带来的推断问题,但本文指出它们“do not directly address the additional displacement induced by the ℓ2-penalty.”
  3. 筛分推断(Sieve Inference)

    • Chen et al. (2014) 和 Chen and Pouzo (2015) 的框架是本文的理论基石。这个框架为在参数空间随样本量增长(筛分空间)时,对泛函进行推断提供了通用工具,包括处理不规则泛函。

这个方向在追问的核心问题

  1. 如何平衡近似偏误与正则化偏误? 网格越密,近似越好,但共线性越强,需要的正则化越强,正则化偏误越大。如何选择网格和惩罚参数?
  2. 如何对正则化后的估计量进行有效推断? 传统的bootstrap或基于渐近正态的区间会因正则化偏误而失效。如何构造一个覆盖真实目标(或最佳网格近似目标)的置信区间?
  3. 对于不规则识别的泛函(如分位数),推断是否可能? Escanciano (2023) 的结果表明,某些泛函的估计是困难的。本文的方法是否能够处理这类泛函?
  4. 如何将推断方法推广到更复杂的设定? 如高维RC、面板数据、更复杂的非线性泛函。

⚠️ 作者的Framing

  • 作者把缺口frame成什么? 作者将缺口frame为:在Heiss et al. (2022)的ENet估计量被广泛使用后,缺乏一个能够处理其正则化偏误的、形式化的推断程序。他们将自己的工作定位为“显然的下一步”,即填补这个方法论空白。他们强调,他们的方法不是去“去偏”,而是“偏误感知”,这使其与主流的DML路线区分开来,并声称这更适用于ENet估计量。
  • 哪些竞争路线被他淡化或回避了? 作者明确淡化了去偏/正交化方法(如DML)。他们给出的理由是“we retain the penalized estimator and incorporate a bound on its bias into the interval.” 这暗示了去偏方法可能不适用于这个特定的估计量,或者实现起来更复杂。他们也没有深入讨论贝叶斯方法,尽管贝叶斯方法天然地提供了后验推断。这可能是因为贝叶斯方法计算成本高,且其推断结果对先验敏感。
  • 什么明显该被引/该存在、却没出现在intro里? 这是一个值得研究者去查的问题。例如,是否有其他工作尝试对固定网格估计量进行推断?是否有工作专门研究了ℓ2惩罚下泛函的渐近分布?是否有工作将筛分推断应用于类似的正则化估计问题?这些都需要通过检索来确认。一个可能的候选是:关于“惩罚M估计量”的推断理论,如关于LASSO或Ridge回归的推断,但本文的设定(非负约束、概率单纯形)更为特殊。

张力

未见明显对立引用。各工作之间是互补和递进的关系:FKRB提出方法,Heiss et al. (2022)解决其共线性问题,Escanciano (2023)指出其推断的固有困难,本文则试图解决这个困难。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • i = 1, ..., N: 个体索引。
    • j = 0, 1, ..., J: 备选方案索引,j=0是外部选项。
    • y_{i,j}: 可观测的二元选择变量,若个体i选择方案j则为1,否则为0。
    • x_{i,j}: 可观测的K维协变量向量(如价格、时间)。
    • δ_0: d_δ固定系数向量(所有个体相同)。
    • β: d_β随机系数向量(个体间异质)。
    • F_0: β的真实未知分布。这是核心估计目标。
    • τ(δ_0, F_0): 感兴趣的平均泛函,如平均支付意愿 E[ -β_k / β_m ]
    • R_N: 预设的网格点数量
    • B_{R_N} = {β_1, ..., β_{R_N}}: 预设的网格点集合
    • θ_r: 网格点β_r对应的概率质量θ = (θ_1, ..., θ_{R_N})'
    • μ_N: ℓ2惩罚参数,控制正则化强度。
    • α = (δ, F_θ): 模型参数,包含固定系数和由θ决定的离散分布。
    • α^0_N: 未惩罚的最佳固定网格近似,即未惩罚目标函数Q^0_N(α)在筛分空间A_N上的最小值点。
    • α^μ_N: 惩罚伪真值,即惩罚目标函数Q^μ_N(α)在筛分空间A_N上的最小值点。
    • bα^μ_N: 惩罚样本估计量,即样本惩罚目标函数bQ^μ_N(α)的最小值点。
  • 模型

    • 数据生成机制:个体i的效用函数为 u_{i,j} = x'_{i,j,1} δ_0 + x'_{i,j,2} β_i + ε_{i,j},其中β_i ~ F_0ε_{i,j}是独立同分布的Type I极值误差。这导致混合Logit模型:给定β_i,选择概率是Logit形式;无条件选择概率是 P(y_{i,j}=1 | x_i) = ∫ g_j(x_i, δ_0, β) dF_0(β),其中g_j是Logit核函数。
    • 统计模型:研究者用一个离散分布 F_θ(·) = Σ_{r=1}^{R_N} θ_r 1{β_r ≤ ·} 来近似F_0。这导致一个线性概率近似模型y_{i,j} ≈ Σ_{r=1}^{R_N} g_j(x_i, δ, β_r) θ_r + ϵ_{i,j}。这是一个线性回归问题,但回归系数θ受到概率单纯形约束(非负且和为1)。
    • 已知/未知g_j(Logit核函数)是已知的。δ_0F_0(或θ)是未知的、要估计的。μ_N是通过交叉验证选择的。
  • 可观测数据

    • 研究者能观测到的是:(y_i, x_i) 对,其中y_i = (y_{i,1}, ..., y_{i,J})'是选择向量,x_i是协变量矩阵。
    • 想要但观测不到的量:个体的随机系数β_i是潜在变量,无法直接观测。其分布F_0是推断目标。误差项ε_{i,j}也是不可观测的。

第二步:讲最小内核

本文的核心数学困难可以浓缩为一个最简特例假设没有固定系数(δ已知或不存在),且只关心一个线性泛函,比如平均随机系数 τ = E[β]

在这个特例下,模型退化为: y_i ≈ X_i θ + ϵ_i 其中X_i是一个J × R_N的矩阵,其第r列是g(x_i, β_r)θR_N维概率质量向量。

惩罚估计量 bθ^μ_N 通过求解以下问题得到: min_θ (1/(2N)) Σ_i ||y_i - X_i θ||^2 + (μ_N/2) ||θ||^2_2 s.t. θ_r ≥ 0, Σ θ_r = 1

核心问题:我们想对 τ(θ) = Σ_r β_r θ_r 进行推断。但由于ℓ2惩罚,bθ^μ_N 是有偏的,它收敛到 θ^μ_N(惩罚伪真值),而不是 θ^0_N(未惩罚的最佳网格近似)。因此,τ(bθ^μ_N) 的渐近分布是围绕 τ(θ^μ_N) 的,而不是 τ(θ^0_N)

本文的关键想法: 1. 承认并量化偏误:不试图消除偏误,而是承认 τ(bθ^μ_N)τ(θ^μ_N) 的一个渐近正态估计。然后,他们找到一个可行上界来量化 |τ(θ^0_N) - τ(θ^μ_N)|,即正则化偏误。 2. 构造保守区间:最终的置信区间是 τ(bθ^μ_N) ± (采样不确定性 + 正则化偏误上界)。这个区间是渐近保守的,即它覆盖 τ(θ^0_N) 的概率至少为名义水平。 3. 技术工具:为了得到采样不确定性(方差)和偏误上界,他们使用了筛分Riesz表示子(sieve Riesz representer)。对于线性泛函 τ(θ) = a'θ,其Riesz表示子 v_τ 满足 a'v = <v_τ, v>_μ,其中 <·,·>_μ 是由惩罚目标函数的Hessian矩阵定义的内积。这个内积在密集网格下是良定义的,因为它包含了ℓ2惩罚项 μ_N ||θ||^2,从而保证了正定性。||v_τ||_μ 的范数直接与泛函的方差和偏误上界相关。

一句话总结:本文的核心是,在一个因正则化而变得良态但引入偏误的估计问题中,通过将推断目标从“真实参数”调整为“惩罚伪真值”,并利用筛分Riesz表示子来同时量化采样方差和正则化偏误,从而构造一个保守但可行的置信区间。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对非参数随机系数模型中的平均泛函(如平均支付意愿、弹性),当使用Heiss et al. (2022)的惩罚固定网格估计量(ENet)时,如何构造一个能够容纳正则化偏误的有效置信区间。
  2. 核心工具/方法:将Chen et al. (2014)的筛分推断框架适配到ENet估计量上。核心工具是筛分Riesz表示子,用于线性化泛函并量化其采样方差和正则化偏误。对于规则泛函,还提供了一个更简单的bootstrap程序
  3. 主要结论:在活跃集稳定性等假设下,证明了惩罚插值估计量 τ(bα^μ_N) 围绕惩罚伪真值 τ(α^μ_N) 渐近正态。并构造了一个渐近保守的置信区间,该区间覆盖未惩罚的最佳固定网格目标 τ(α^0_N)。蒙特卡洛模拟和实证应用表明,该方法在密集网格下表现良好,且区间宽度合理。

关键设定与假设

  • 模型:混合Logit模型(公式1),允许固定系数和随机系数并存。
  • 估计量:惩罚固定网格估计量(公式4),即ENet估计量。它最小化加权最小二乘损失加上一个ℓ2惩罚项 (μ_N/2) Σ θ_r^2,并受概率单纯形约束。
  • 目标泛函:平均泛函 τ(δ_0, F_0) = ∫∫ s(x, δ_0, β) dF_0(β) dG(x)(公式2),包括平均WTP、弹性、福利变化等。
  • 关键假设
    • Assumption 1 (Active set stability):这是最关键的假设之一。它要求惩罚伪真值 α^μ_N 和未惩罚最佳网格近似 α^0_N 共享同一个活跃集(即概率质量非零的网格点集合),并且样本估计量 bα^μ_N 的活跃集以概率趋近于1与它们相同。这个假设保证了局部分析可以在活跃集上进行,避免了非负边界约束带来的复杂问题。相比已有文献,这是对Heiss et al. (2022)支撑恢复结果的强化,并将其从样本扩展到总体。
    • Assumption 2 (Sieve variance):要求由惩罚目标函数Hessian定义的范数 ||·||_μ 与由得分方差定义的范数 ||·||_{sd,μ}可比较的。这是筛分推断框架的标准条件,保证了局部二次展开的有效性。相比已有文献,这里的 ||·||_{sd,μ} 包含了ℓ2惩罚项 μ_N ||θ_v||^2,这是对Chen et al. (2014)的调整。
    • Assumption 3 (Bounded Riesz representer):对于规则泛函,要求Riesz表示子的范数 ||v^τ_N||_μ 一致有界。这保证了bootstrap程序的有效性。
    • Assumption 4 (Negligible weight on the lower spectral band):一个更精细的条件,要求泛函的Riesz表示子在Hessian矩阵的特征空间中,对由ℓ2惩罚主导的“低曲率”方向赋予的权重很小。这保证了正则化偏误可以被 √(2μ_N) σ_N 界住,从而简化bootstrap程序。

主要结果

  • Theorem 1 (Asymptotic Normality):在Assumptions 1, 2, B.1-B.3下,√N {τ(bα^μ_N) - τ(α^μ_N)} / σ_N →_d N(0, 1)。这个定理建立了惩罚插值估计量围绕惩罚伪真值的渐近正态性。σ_N 是渐近标准差。
  • Corollary 2 (Conservative Confidence Interval):在Theorem 1的基础上,结合一个偏误上界 |τ(α^0_N) - τ(α^μ_N)| ≤ ||v^τ_N||_μ ||α^0_N - α^μ_N||_μ,构造了一个渐近保守的置信区间。这个区间覆盖的是未惩罚的最佳固定网格目标 τ(α^0_N)。区间半宽为 c_N(q) = N^{-1/2} Φ^{-1}(1-q/2) σ_N + ||v^τ_N||_μ ||α^0_N - α^μ_N||_μ
  • Lemma 4 (Bounding the regularization bias):在Assumptions 1, B.4(v)下,||α^0_N - α^μ_N||_μ ≤ √μ_N + o(1)。这个引理给出了正则化偏误在 ||·||_μ 范数下的一个简洁上界,该上界与惩罚参数 μ_N 的平方根成正比。
  • Corollary 6 (Bootstrap Procedure):对于规则泛函(Assumption 3),在额外条件下(Assumption 4),提供了一个基于bootstrap的可行置信区间:τ(bα^μ_N) ± (Φ^{-1}(1-q/2) N^{-1/2} s_B + √(2μ_N) s_B),其中 s_B 是bootstrap标准差。这个程序避免了直接估计Riesz表示子。

证明路线与技术技巧

  • 整体路线

    1. 局部化:利用活跃集稳定性(Assumption 1),将分析限制在活跃集 S_N 上。在这个子空间内,非负约束不再起作用,问题简化为一个无约束(或仅有线性约束)的优化问题。
    2. 二次展开:在惩罚伪真值 α^μ_N 附近,对惩罚目标函数 Q^μ_N(α) 进行局部二次展开。由于ℓ2惩罚,Hessian矩阵 H^μ_N 是正定的,即使在原问题(未惩罚)是病态的情况下。这定义了内积 <·,·>_μ 和范数 ||·||_μ
    3. 线性化泛函:对目标泛函 τ(α)α^μ_N 处进行方向导数展开。利用Riesz表示定理,存在一个筛分Riesz表示子 v^τ_N,使得 Dτ(α^μ_N)[v] = <v^τ_N, v>_μ
    4. 建立渐近正态性:通过将估计量的偏差 bα^μ_N - α^μ_N 投影到 v^τ_N 方向上,可以证明 τ(bα^μ_N) - τ(α^μ_N) 的渐近行为等价于一个经验过程 (1/√N) Σ_i Dℓ^μ_N(z_i, α^μ_N)[v^τ_N],从而由中心极限定理得到渐近正态性(Theorem 1)。
    5. 量化偏误:利用Cauchy-Schwarz不等式和Lemma 4,将正则化偏误 |τ(α^0_N) - τ(α^μ_N)| 界住。
    6. 构造可行区间:用样本估计量 bv^τ_Nbσ_N 替换理论量,得到可行的置信区间(Corollary B.3)。对于规则泛函,bootstrap程序(Corollary 6)提供了一个更简单的替代方案。
  • 关键跳跃点

    • 从病态到良态:未惩罚问题中,Hessian矩阵 H^0_N 可能是奇异的。引入ℓ2惩罚后,H^μ_N = H^0_N + μ_N I 变为正定,使得局部二次展开成为可能。这是整个理论成立的基石。
    • 处理边界约束:非负约束 θ_r ≥ 0 是推断的难点。Assumption 1(活跃集稳定性)巧妙地绕过了这个问题,它保证了在局部邻域内,零权重的网格点不会影响一阶展开,从而将问题简化为一个无约束问题。
    • 偏误上界的推导:Lemma 4中 ||α^0_N - α^μ_N||_μ ≤ √μ_N 的证明是关键。它利用了 α^0_Nα^μ_N 分别是最小化未惩罚和惩罚目标函数的点,通过一阶条件(或变分不等式)和Cauchy-Schwarz不等式推导得出。
  • 技术技巧点名

    • 筛分推断框架:整个理论框架直接继承自Chen et al. (2014)和Chen and Pouzo (2015)。
    • 筛分Riesz表示子:用于线性化泛函并连接泛函的导数与目标函数的Hessian矩阵。
    • 活跃集稳定性:一个关键的几何/概率假设,用于处理约束优化中的边界问题。
    • 经验过程理论:用于处理 bQ^μ_N(α) 的随机性,并证明估计量的收敛速率(Lemma B.1)。
    • bootstrap:用于规则泛函的方差估计和偏误调整(Corollary 6)。

真实例子与应用

  • 数据:Meijer and Rouwendal (2006) 的出行方式选择(stated-preference travel-choice data)数据集。该数据来自1987年对荷兰铁路公司NS乘客的调查,包含235名受访者,每人完成约12.5个选择任务,共2929个观测。
  • 方法应用
    • 模型设定:效用函数包含票价(fare)、旅行时间(time)的随机系数,以及换乘次数(interchanges)和舒适度(comfort)的固定系数。
    • 估计:使用ENet和FKRB估计量,网格点数 R ∈ {25, 81, 289}。惩罚参数通过5折交叉验证选择。
    • 推断:使用本文提出的偏误感知置信区间(Corollary 6),基于500次bootstrap。
    • 基准模型:参数化的双变量对数正态(Log-N)混合Logit模型。
  • 结果
    • 点估计差异:非参数方法(FKRB和ENet)估计的平均旅行时间系数绝对值远大于参数模型,导致平均时间价值(VoT)估计值显著更高(Log-N: 9.36 EUR/h, FKRB: 16.25 EUR/h, ENet: 25.77 EUR/h)。
    • 分布差异:非参数方法估计的VoT分布具有更厚的尾部(图3),即存在更多对时间价值极高的个体。参数模型则快速衰减。
    • 推断结果:ENet的置信区间虽然比Log-N宽,但仅比FKRB略宽,说明偏误校正并未导致区间过度保守。更重要的是,Log-N和ENet的VoT点估计值落在彼此的置信区间之外,表明参数假设对经济结论有实质性影响。
  • 这个例子想说明什么:这个例子旨在验证理论(展示方法在真实数据上的可行性)并展示相对基准的优势(说明参数模型可能因错误设定而严重低估VoT,而非参数方法能揭示更丰富的异质性,且本文的推断程序能提供可靠的统计结论)。

🔎 结论是否比证明窄

  • 窄结论:Corollary 2和Corollary 6的置信区间覆盖的是未惩罚的最佳固定网格目标 τ(α^0_N),而不是真实总体目标 τ(α_0)。作者在文中明确指出了这一点:“The coverage statement concerns the best fixed-grid target τ(α^0_N). It extends to τ(α_0) under an additional approximation condition such as negligible approximation bias |τ(α^0_N) - τ(α_0)| = o(N^{-1/2} σ_N).” 这意味着,如果网格不够密,导致近似偏误(sieve approximation bias)不可忽略,那么本文的区间可能无法覆盖真实总体目标。这是一个重要的限制。
  • 泛泛claim:作者在摘要和引言中声称方法适用于“一大类线性和非线性泛函”。虽然理论上确实如此(只要满足光滑性条件),但证明和模拟主要针对的是平均WTP和平均弹性。对于更复杂的非线性泛函(如福利变化),其Riesz表示子的估计和偏误上界的计算可能会更复杂,其有限样本表现需要进一步验证。
  • conjecture:文中没有明显的conjecture。

四、开放问题

  1. 数据驱动的网格选择:作者在结论中提到“Developing data-driven methods that jointly select the location and number of grid points would be valuable.” 这是一个明确的未来工作方向。扎根点:Section 6, 第一段。
  2. 显式处理筛分近似偏误:当前方法要求近似偏误可忽略。一个自然的扩展是构造一个同时考虑正则化偏误和筛分近似偏误的置信区间。扎根点:Section 6, 第二段:“An interesting extension would be to construct confidence intervals that explicitly account for sieve approximation bias, particularly in high-dimensional applications...”
  3. 高维RC模型:当随机系数维度 d_β 增加时,网格点数量 R_N 呈指数增长,导致“维度灾难”。本文的方法在计算上可能变得不可行。如何将本文的推断思想扩展到高维RC模型(例如,通过稀疏网格或低秩近似)是一个开放问题。扎根点:Section 2.1, 脚注2:“the fixed-grid estimator presented below suffers from the curse of dimensionality, making it computationally feasible only for models with relatively few random coefficients in practice.”
  4. 与其他正则化方法的比较:本文专注于ℓ2惩罚。是否可以将其扩展到其他正则化方法,如LASSO(ℓ1惩罚)?LASSO会引入不同的偏误结构,其推断可能更复杂。扎根点:本文的整个设定都基于ℓ2惩罚,但Heiss et al. (2022)也讨论了弹性网络(同时包含ℓ1和ℓ2)。这是一个自然的延伸。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论