跳转至

Asymptotics for Model Selection in Probabilistic Principal Component Analysis

作者: Mathias Drton, Andrew McCormack, Daniel Windisch
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.23513


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是奇异学习理论(Singular Learning Theory)在模型选择中的应用,具体针对概率主成分分析(PPCA)模型中主成分个数(即模型阶数)的选择问题。其根本的统计问题是:当统计模型在参数空间某些点处Fisher信息矩阵不满秩(即模型是“奇异的”)时,经典模型选择准则(如BIC)的惩罚项(基于参数维度的一半)不再正确,导致模型选择偏差。该方向旨在利用代数几何工具(实对数规范阈值,RLCT)来刻画奇异模型边际似然的渐近行为,并据此构造一致的模型选择准则(如奇异贝叶斯信息准则,sBIC)。当前该方向已从理论框架走向具体模型的应用,但每个新模型的学习系数计算仍是一个非平凡的技术挑战。

发展脉络(history)

  • 奠基工作:Watanabe (2009, 2018)。Watanabe 建立了奇异学习理论的完整框架,证明了对于奇异模型,边际似然对数的渐近展开由学习系数 λ 和其多重性 m 决定,而非简单的“参数维度/2”。这一理论为处理非正则模型提供了代数几何工具(实对数规范阈值,RLCT)。留下的口子:理论框架是通用的,但每个具体模型的 (λ, m) 需要单独计算,且计算过程高度依赖代数几何技巧。
  • 主要进展:sBIC 的提出与学习系数的计算。Drton & Plummer (2017) 提出了奇异贝叶斯信息准则(sBIC),它利用已知的 (λ, m) 值来构造一个模型选择准则,该准则在渐近意义下等价于真实边际似然(误差 O_p(1)),且具有一致性。留下的口子:sBIC 的实用性完全取决于能否为所考虑的模型计算出 (λ, m)。随后,一系列工作开始为具体模型计算学习系数,包括:Aoyagi & Watanabe (2005) 对降秩回归、Aoyagi (2009, 2019, 2024) 对神经网络、Rousseau & Mengersen (2011) 和 Yamazaki & Watanabe (2003) 对混合模型、Drton et al. (2017) 对高斯潜树模型、以及 Drton et al. (2025) 对因子分析模型。本文引用语境指出:“The pair (λ, m) has been fully or partially determined for a growing number of pertinent statistical models...”(Section 1, p.2),并特别指出“at present there are only a few models... for which the learning coefficients are completely characterized”(Section 1, p.2)。
  • 当前 Frontier 与本文位置:本文填补了 PPCA 模型学习系数的空白。作者在引言中明确说:“The present work provides a complete characterization of the learning coefficients and their multiplicities for PPCA.”(Section 1, p.2)。此外,本文还将结果推广到“分区噪声 PPCA 模型”(partitioned noise PPCA model),该模型统一了 PPCA 和因子分析模型,并给出了其学习系数公式(Theorem 5.1)。因此,本文是奇异学习理论在潜变量模型(特别是降维模型)模型选择问题上的一个关键应用和理论推进。

子线索聚类

这些被引文献大致落在以下 2-3 条子线索上: 1. 奇异学习理论的基础与代数方法:以 Watanabe (2009, 2018) 和 Lin (2010, 2017) 为代表。这一簇专注于发展 RLCT 的计算理论(如解析奇点消解、和规则、链式法则),为后续应用提供数学工具。Lin (2010) 的摘要明确指出:“The accurate asymptotic evaluation of marginal likelihood integrals is a fundamental problem in Bayesian statistics... we translate this into a problem of computational algebraic geometry, namely, to determine the real log canonical threshold of a polynomial ideal”。 2. sBIC 的提出与在具体模型上的应用:以 Drton & Plummer (2017) 为核心,以及 Drton et al. (2017) 对潜树模型、Drton et al. (2025) 对因子分析模型、以及本文对 PPCA 模型的应用。这一簇专注于将奇异学习理论转化为可操作的模型选择准则,并攻克特定模型的学习系数计算难题。本文引用语境指出:“The sBIC was proposed as a methodology that uses knowledge of the values of (λ_kr, m_kr) to construct a model selection criterion...”(Section 3, p.5)。 3. PPCA 模型选择的其他(非奇异学习)方法:以 Minka (2000) 的 Laplace 近似、Bai et al. (2018) 的随机矩阵理论方法、Bouveyron et al. (2020) 的 Normal-Gamma 方法、Josse & Husson (2012) 的 GCV 方法为代表。这一簇尝试用不同策略(贝叶斯近似、高维渐近、交叉验证)解决同一问题,但作者指出它们要么忽略了奇异性(Minka),要么在高维下有特定条件(Bai et al.),要么对先验敏感(Bouveyron et al.)。本文的 sBIC 方法被定位为对这些方法的改进。

这个方向在追问的核心问题

  1. 学习系数的计算:对于一个给定的奇异统计模型,其 RLCT(即学习系数 λ)是多少?这是应用 sBIC 的前提,也是该方向最核心的技术挑战。
  2. sBIC 的一致性:在什么条件下,基于已知 (λ, m) 构造的 sBIC 能够以概率趋于 1 选择最小的真实模型?Drton & Plummer (2017) 给出了理论保证,但该保证依赖于 (λ, m) 的正确性。
  3. 高维扩展:当维度 p 随样本量 n 增长时,奇异学习理论的渐近展开(如公式 3.3)是否仍然成立?经典 Laplace 近似在高维下的有效性是当前活跃的研究领域(如 Katsevich 2024, 2026; Tang & Reid 2025),但奇异模型下的高维渐近仍是开放问题。
  4. 模型间的比较:如何利用 sBIC 在嵌套或非嵌套的奇异模型之间进行选择?本文通过“分区噪声 PPCA 模型”框架,初步解决了 PPCA 与因子分析模型之间的选择问题。

⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)

  • 作者把缺口 frame 成什么:作者将缺口 frame 为“PPCA 模型的奇异结构导致经典 BIC 过度惩罚,而现有文献(如 Minka 2000)使用的 Laplace 近似忽略了这一奇异性,因此其渐近有效性存疑”。作者声称:“A subtle point is that the validity of a Laplace approximation requires a statistical model to be identifiably parameterized with a positive definite Fisher information matrix. However, as discussed in Section 2, the PPCA model possesses singularities that cause the requisite regularity conditions for a Laplace approximation to be violated, a fact that has not been accounted for in previous works.”(Section 1, p.2)。这使得本文的 sBIC 方法成为“显然的下一步”。
  • 哪些竞争路线被他淡化或回避了:
    • 高维情形下的 AIC/BIC 一致性:Bai et al. (2018) 证明了在特定高维框架下(p 增长,r 有界,特征值间隙足够大),AIC 和 BIC 是一致的。作者在引言中引用了这一结果,但将其定位为“despite this”(尽管如此),并强调本文关注的是固定 p、大 n 的经典渐近。作者没有深入讨论当特征值间隙不够大时,Bai et al. 的结果是否失效,以及 sBIC 在这种情形下是否仍有优势。
    • 完全贝叶斯方法:Hoff (2007) 的完全贝叶斯分析(使用 MCMC)是可行的,但作者以“computationally involved for the practitioner”为由将其排除在主要比较之外。这回避了 sBIC 作为一种近似方法,与精确贝叶斯方法在有限样本下的性能对比。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:未见明显缺失的关键引用。该领域的核心工作(Watanabe, Drton, Lin, Aoyagi)均已覆盖。

张力

未见明显对立引用。不同工作(如 Bai et al. 2018 的高维 AIC/BIC 一致性与本文的固定 p 奇异渐近)是在不同设定下得出的结论,并非直接矛盾。Drton et al. (2025) 对因子分析模型的学习系数计算与本文对 PPCA 的计算是互补的,共同构成了对潜变量模型奇异性的更完整理解。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • p:观测数据的维度(变量个数)。
    • n:样本量。
    • k:候选 PPCA 模型中的主成分(PC)个数,k = 0, 1, ..., p-1。
    • r:真实数据生成过程中,最小的主成分个数,即 Σ_0 ∈ M_r \ M_{r-1}。
    • X_i:第 i 个观测到的 p 维随机向量,i = 1, ..., n。
    • Z_i:第 i 个观测对应的 r 维潜变量(主成分得分),Z_i ~ N_r(0, I_r)。
    • W:p × k 的载荷矩阵,是模型的参数。
    • σ²:噪声方差,是模型的参数(标量)。
    • Σ:p × p 的协方差矩阵,Σ = WW^T + σ² I_p。
    • Σ_0:真实的协方差矩阵。
    • M_k:具有 k 个主成分的 PPCA 模型,即所有形如 WW^T + σ² I_p 的协方差矩阵的集合。
    • λ_k(Σ_0) 或 λ_kr:当真实模型为 M_r 时,模型 M_k(k ≥ r)的学习系数。
    • m_k(Σ_0) 或 m_kr:对应的多重性。
    • φ_k(W, σ²):参数化映射,φ_k(W, σ²) = WW^T + σ² I_p。
    • I_{p,k}(Σ_0):纤维理想,由 WW^T + σ² I_p - Σ_0 的所有元素生成的理想。
    • RLCT(I; φ):理想 I 关于权重函数 φ 的实对数规范阈值。
  • 模型:

    • 数据生成机制:观测数据 X_i 独立同分布于 p 维零均值高斯分布,其协方差矩阵为 Σ_0。Σ_0 属于某个未知的 PPCA 模型 M_r,即 Σ_0 = W_0 W_0^T + σ_0² I_p,其中 W_0 是 p × r 矩阵,σ_0² > 0。
    • 候选模型:对于每个候选的 PC 个数 k,我们考虑模型 M_k,其参数为 (W, σ²),其中 W ∈ ℝ^{p×k},σ² > 0。模型假设数据来自 N_p(0, WW^T + σ² I_p)。
    • 已知/未知:p 和 n 已知。W 和 σ² 是待估参数。r 是未知的,是模型选择的目标。
  • 可观测数据:

    • 可观测:n 个 p 维观测向量 X_1, ..., X_n。样本协方差矩阵 (1/n) Σ_i X_i X_i^T 是充分统计量。
    • 不可观测/潜在:潜变量 Z_i(主成分得分)是不可观测的。真实的载荷矩阵 W_0 和噪声方差 σ_0² 也是未知的。模型选择的目标就是推断出 r,即 W_0 的列数。

第二步:讲最小内核

本文的核心数学问题是:计算 PPCA 模型 M_k 在真实模型为 M_r(r ≤ k)时的学习系数 λ_kr 和多重性 m_kr。

最简特例:p = 2,k = 1,r = 0(真实模型是纯噪声,Σ_0 = I_2)。

在这个特例下: - 模型:M_1 的参数是 W = (w_1, w_2)^T ∈ ℝ² 和 σ² > 0。协方差矩阵为 Σ = WW^T + σ² I_2。 - 真实分布:Σ_0 = I_2,即 r=0。 - 要计算的量:学习系数 λ_10。

为什么这是最小内核? 因为 Σ_0 = I_2 是 M_1 中的一个奇异点(W = 0 时,Fisher 信息矩阵不满秩)。这个例子包含了奇异学习理论的核心困难:在奇异点处,似然函数无法用二次型近似,边际似然积分的主导项由代数几何决定。

核心思路(在这个特例下): 1. 边际似然积分:p(X|M_1) = ∫_{ℝ²} ∫_0^∞ [∏_{i=1}^n p(X_i|W, σ², M_1)] φ_1(W, σ²) dσ² dW。当 n 很大时,积分的主要贡献来自参数空间中使 Σ 接近 I_2 的区域,即 W 接近 0 的区域。 2. 局部化与代数化:在 W=0 附近,Σ - I_2 ≈ WW^T + (σ² - 1)I_2。纤维理想 I_{2,1}(I_2) 由 WW^T + σ² I_2 - I_2 的元素生成,即 w_1² + σ² - 1, w_2² + σ² - 1, w_1 w_2。 3. 奇点消解(Blow-up):直接计算这个积分很困难,因为被积函数在 W=0 处有奇点。作者使用代数几何中的“blow-up”技巧来“消解”这个奇点。对于这个特例,一个关键的 blow-up 是沿着 W=0 和 σ=0 的线性子空间进行。在 blow-up 后的新坐标系下,被积函数变得简单,积分可以分解为几个标准形式的积分。 4. 计算 RLCT:通过 blow-up 和“和规则”(Sum Rule),可以将原积分分解为几个更简单积分的 RLCT 之和。对于 p=2, k=1, r=0 的情况,计算过程(如 Theorem 4.8 证明所示)最终会得到 RLCT 为 (2, 1)。根据 Fact 4.2,学习系数 λ = RLCT / 2 = 1。多重性 m = 1。 5. 结果解读:λ_10 = 1。而经典 BIC 的惩罚项是 (dim(M_1)/2) * log n。M_1 的参数维度是 dim(ℝ²) + 1 = 3,所以 BIC 惩罚是 (3/2) log n。由于 1 < 1.5,sBIC 的惩罚更小,因此更倾向于选择更大的模型(即包含更多 PCs 的模型),这与模拟结果(sBIC 比 BIC 更敏感)一致。

总结:这个最简例子展示了,在奇异点处,学习系数 λ 小于参数维度的一半。本文的核心工作就是通过复杂的代数几何计算,将这种“小于”的精确值(公式 4.1)推广到任意 p, k, r 的情形。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了概率主成分分析(PPCA)模型中主成分个数选择的模型选择问题,该模型在参数空间存在奇异点(Fisher 信息矩阵不满秩),导致经典 BIC 准则失效。
  2. 核心工具/方法:利用 Watanabe 的奇异学习理论,通过代数几何方法(实对数规范阈值 RLCT、奇点消解、blow-up)完整刻画了 PPCA 模型及其推广形式(分区噪声 PPCA 模型)的边际似然渐近行为,并基于此构造了奇异贝叶斯信息准则(sBIC)。
  3. 主要结论:给出了 PPCA 模型学习系数 λ_kr 和多重性 m_kr 的显式公式(Theorem 4.1),并将其推广到分区噪声 PPCA 模型(Theorem 5.1)。模拟和真实数据实验表明,sBIC 在模型选择上优于经典 BIC,且比其它竞争方法(如 Normal-Gamma、GCV)更稳健。

关键设定与假设

  • 设定:固定维度 p,大样本 n → ∞。观测数据 X_i 独立同分布于零均值高斯分布 N_p(0, Σ_0)。真实协方差矩阵 Σ_0 属于某个 PPCA 模型 M_r,其中 r 是未知的。
  • 假设:
    1. 模型嵌套:PPCA 模型是嵌套的,即 M_0 ⊂ M_1 ⊂ ... ⊂ M_{p-1}(公式 2.1)。
    2. 先验分布:在每个模型 M_k 的参数 (W, σ²) 上,放置一个光滑且处处为正的 Lebesgue 密度 φ_k(Section 3, p.5)。这个假设保证了 RLCT 的计算可以忽略先验的具体形式(可设为 1)。
    3. 真实模型:真实协方差矩阵 Σ_0 属于 M_r \ M_{r-1},即它恰好有 r 个主成分(公式 3.2)。
    4. 代数几何假设:为了计算 RLCT,需要假设参数空间是紧的(可以通过截断实现,不影响渐近),并且纤维理想由多项式生成(Section 4.1)。
  • 相比已有文献的放宽/强化:
    • 放宽:相比于 Minka (2000) 使用的 Laplace 近似,本文不要求 Fisher 信息矩阵在参数空间处处满秩,因此适用于奇异模型。
    • 强化:相比于 Bai et al. (2018) 的高维结果,本文的设定是固定 p,因此不要求特征值间隙或高维渐近框架。本文的结果是精确的学习系数公式,而 Bai et al. 的结果是 AIC/BIC 在高维下的一致性。

主要结果

  • 定理 4.1(核心定理):对于 PPCA 模型 M_k,当真实模型为 M_r(0 ≤ r ≤ k ≤ p-1)时,学习系数和多重性为: λ_kr = (pk + r(p - k + 1) + 2) / 4,m_kr = 1。
  • 直觉:λ_kr 是 k 和 r 的二次函数。当 r = k(非奇异点)时,λ_kk = (pk + k(p - k + 1) + 2)/4 = (k(2p - k + 1) + 2)/4。而模型 M_k \ M_{k-1} 的流形维度为 k(p - k) + k(k+1)/2 + 1,其一半恰好等于 λ_kk,与经典 BIC 一致。当 r < k(奇异点)时,λ_kr < λ_kk,即惩罚更小。
  • 必要条件:Σ_0 ∈ M_r \ M_{r-1},先验光滑且处处为正。
  • 解决的技术难点:通过一系列代数变换(对角化、限制参数空间、blow-up、和规则),将复杂的纤维理想 RLCT 计算分解为几个已知 RLCT 的简单理想之和。

  • 定理 5.1(推广):对于分区噪声 PPCA 模型 M_{k,d}(d 是 p 的一个整数划分,s 是划分的块数),当真实模型为 M_{r,e}(e 是 d 的加细)时,学习系数为: λ_{kr}^{de} = (pk + r(p - k + 1) + 2s) / 4,多重性为 1。

  • 直觉:该公式统一了 PPCA(s=1)和因子分析(s=p)模型。s 越大,惩罚越大,反映了因子分析模型有更多噪声参数。
  • 解决的技术难点:处理了更复杂的噪声结构,需要更精细的 blow-up 和代数操作。

证明路线与技术技巧(理论型)

  • 整体路线:

    1. 连接学习系数与 RLCT:通过 Fact 4.2,将学习系数 λ 的计算转化为计算纤维理想 I_{p,k}(Σ_0) 的全局 RLCT。
    2. 简化问题:
      • 利用正交不变性(Lemma 4.7),假设 Σ_0 是对角矩阵。
      • 利用参数空间的流形结构(Lemma 4.6),将 W 限制在 L_{r,+}^{p×k} 形式(分块下三角矩阵),这对应于固定了旋转自由度。
    3. 代数变换:通过一系列可逆的代数变换(如 W_21 → W_21 W_11^T,W_21 → W_21 + A(ψ)_21),将纤维理想简化为两个不相交的理想 I_1 和 I_2 之和。
    4. 奇点消解(Blow-up):对 I_2 的变量(W_22 和 σ 或 ψ)进行 blow-up,以消解 W_22=0, σ=0 处的奇点。在 blow-up 的不同坐标卡(chart)上,I_2 被简化为一个单项式理想(如 ⟨σ²⟩ 或 ⟨w_pk²⟩)。
    5. 应用和规则(Fact 4.4):由于 I_1 和 I_2 的变量在 blow-up 后被解耦,可以应用和规则,将总 RLCT 分解为 I_1 的 RLCT 和 I_2 的 RLCT 之和。
    6. 计算各部分的 RLCT:
      • I_1 的 RLCT:I_1 = ⟨W_11 W_11^T - I_r⟩ 定义了一个光滑的实解析簇,其余维数为 r(r+1)/2,因此 RLCT 为 (r(r+1)/2, 1)(Fact 4.5)。
      • I_2 的 RLCT:在 blow-up 的每个坐标卡上,I_2 被简化为 ⟨σ²⟩ 或 ⟨w_pk²⟩。其 RLCT 可以通过计算一个一维积分得到,结果为 ((p-r)(k-r) + 2s)/2, 1)(其中 s 是噪声分块数,对于 PPCA s=1)。
    7. 汇总:将各部分 RLCT 相加,并加上之前被“和规则”暂时忽略的 W_21 变量的贡献 (p-r)r,得到总 RLCT,再除以 2 得到学习系数。
  • 关键跳跃点:

    • 从 Fisher 信息矩阵的秩亏到纤维理想:这是奇异学习理论的核心跳跃。它将对似然函数局部行为的分析,转化为对参数空间上代数簇的几何分析。
    • Blow-up 的选择:选择沿着 W_22 = 0 和 σ = 0(或 ψ = 0)的线性子空间进行 blow-up,这是消解该特定奇点的标准代数几何技巧。选择哪个坐标卡(σ-chart 或 w_pk-chart)需要保证最终结果一致,这本身是一个技术验证点。
    • “和规则”的应用条件:确保在 blow-up 后,I_1 和 I_2 的变量是“不相交”的,这是应用和规则的前提。证明中通过仔细的代数操作(如利用 I_2 的生成元消去 I_1 中的交叉项)来满足这一条件。
  • 技术技巧点名:

    • 实对数规范阈值 (RLCT):核心分析工具,用于量化奇异点处积分渐近行为。
    • 奇点消解 (Resolution of Singularities):通过 blow-up 将复杂的奇点转化为简单的“正常交叉”奇点。
    • Blow-up:沿着线性子空间 {W_22 = 0, σ = 0} 进行 blow-up,是消解该奇点的具体操作。
    • 和规则 (Sum Rule):将解耦后的理想之和的 RLCT 分解为各部分 RLCT 之和。
    • 链式法则 (Chain Rule):用于处理参数变换(如 W_21 → W_21 W_11^T)对 RLCT 的影响。
    • 纤维理想 (Fiber Ideal):将统计问题(边际似然积分)转化为代数问题(理想 RLCT 计算)的关键桥梁。

真实例子与应用

  • 数据:
    1. Decathlon 数据:p=10 个十项全能项目,n=24 名 2008 年奥运会顶尖男运动员的成绩。
    2. Wine 数据:p=14 种味觉品质,n=21 种不同的葡萄酒。
  • 方法应用:作者将 sBIC 应用于 PPCA 模型和因子分析(FA)模型的联合选择。对于每个候选的 PC/因子个数 k,计算 PPCA 和 FA 模型的 sBIC 值。sBIC 值被归一化到 [0,1] 区间,最大值对应的模型被选中。
  • 结果:
    • Decathlon 数据:sBIC 选择了具有 4 个因子的 FA 模型,而 BIC 选择了具有 1 个 PC 的 PPCA 模型。
    • Wine 数据:sBIC 选择了具有 8 个 PC 的 PPCA 模型,而 BIC 选择了具有 4 个 PC 的 PPCA 模型。
  • 例子想说明什么:这两个例子旨在说明 sBIC 在实际应用中比 BIC 更“敏感”,倾向于选择更大的模型(更多 PCs 或因子)。作者认为,基于 scree plot(图 5),BIC 选择的模型(如 Decathlon 的 1 个 PC)可能过于保守,因为许多特征值都贡献了显著方差。这验证了 sBIC 修正了 BIC 过度惩罚的预期效果。

🔎 结论是否比证明窄

  • 结论:Theorem 4.1 和 5.1 是在固定 p、大 n 的渐近框架下严格证明的。
  • 比证明窄的地方:作者在结论部分(Section 7, p.19)明确将“高维扩展”(large-p settings)列为开放问题。因此,本文的结论不直接适用于高维情形。作者引用了 Katsevich (2024, 2026) 和 Tang & Reid (2025) 关于高维 Laplace 近似的工作,但指出“Obtaining asymptotic log-marginal likelihood expansions in high-dimensions when singularities are present is a challenging open direction.” 这意味着,虽然本文的 sBIC 在模拟中(p=20)表现良好,但其理论保证仅限于 p 固定。将结果推广到 p → ∞ 需要额外的理论工作。

四、开放问题(点到为止,扎根具体语句)

  1. 高维扩展:将本文的固定 p 渐近结果推广到 p 随 n 增长的高维情形。扎根:Section 7, p.19: “One immediate question is how to extend the present results to the large-p settings that are prevalent in the high-dimensional covariance matrix estimation literature... Obtaining asymptotic log-marginal likelihood expansions in high-dimensions when singularities are present is a challenging open direction.”
  2. 分层 PCA 模型的学习系数:计算更一般的“分层 PCA”(Stratified PCA)模型的学习系数。扎根:Section 7, p.20: “Determining the learning coefficients for the larger class of stratified PCA models remains an open question.”
  3. 典型相关分析(CCA)的模型选择:将奇异学习理论应用于概率 CCA 模型,以选择典型方向的个数。扎根:Section 7, p.21: “...canonical correlation analysis (CCA) has a probabilistic formulation akin to PPCA... a study of the learning coefficients of this model is warranted; these learning coefficients can be used to perform model selection on the number of canonical directions.”
  4. sBIC 在有限样本下的行为:虽然 sBIC 具有渐近一致性,但其在有限样本下的表现(特别是当信号较弱或模型接近时)的理论刻画尚不完整。扎根:模拟结果(如 Figure 4)显示,在 n=30 时,sBIC 和 BIC 都倾向于选择小模型,其有限样本性质值得进一步研究。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论