Asymptotics for Model Selection in Probabilistic Principal Component Analysis¶
作者: Mathias Drton, Andrew McCormack, Daniel Windisch
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.23513
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:当统计模型在参数空间的某些点处不满足正则性条件(即 Fisher 信息矩阵降秩、模型不可识别)时,如何正确刻画贝叶斯边际似然的渐近行为,并基于此构建一致的模型选择准则。 经典 BIC 的推导依赖于参数化是正则的(可识别、Fisher 信息正定),但在许多实际模型中——如混合模型、因子分析、神经网络、降秩回归——参数空间存在奇异点,导致 BIC 的维度惩罚过度,倾向于选择过小的模型。当前成熟度:奇异学习理论(singular learning theory)已提供了完整的理论框架(Watanabe, 2009),但将其应用于具体模型并计算出学习系数(learning coefficient / real log canonical threshold)仍是一个活跃的、需要大量代数几何技巧的领域。
发展脉络(history)¶
-
奠基工作:Watanabe 的奇异学习理论 (2009)。Watanabe [42] 建立了贝叶斯边际似然在非正则模型下的渐近展开理论,指出渐近行为由学习系数 λ 和其重数 m 决定,而非参数维数的一半。这一理论将统计问题转化为代数几何问题——计算实对数规范阈值(RLCT)。
-
主要进展:sBIC 的提出与学习系数的计算。Drton & Plummer (2017) [16] 提出了奇异贝叶斯信息准则(sBIC),解决了学习系数依赖于未知真实参数值这一“循环论证”悖论,使得奇异学习理论可用于实际模型选择。与此同时,一系列工作开始为具体模型计算学习系数:Aoyagi & Watanabe (2005) [6] 完成了降秩回归;Aoyagi (2009, 2024) [3, 5] 研究了神经网络;Rousseau & Mengersen (2011) [33] 和 Yamazaki & Watanabe (2003) [44] 研究了混合模型;Drton et al. (2017) [15] 计算了高斯潜树模型的 RLCT。
-
当前 frontier:因子分析与 PPCA 的完整刻画。Drton, Gross, Kosta, Leykin et al. (2025) [14] 给出了因子分析模型学习系数的精确公式。本文(Drton, McCormack, Windisch, 2026)则完成了 PPCA 模型的完整刻画,并进一步引入了“分区噪声 PPCA 模型”这一统一框架,将 PPCA 和因子分析作为特例纳入。
-
本文的位置:本文填补了“PPCA 模型奇异学习系数”这一空白,并将结果推广到分区噪声模型,使得在 PPCA 与因子分析之间进行模型选择成为可能。作者在引言中明确说:“The present work provides a complete characterization of the learning coefficients and their multiplicities for PPCA.”(第 2 页)
子线索聚类¶
- 线索 1:奇异学习理论在具体模型上的应用。包括降秩回归 [6]、神经网络 [3, 5]、混合模型 [33, 44, 4]、潜树模型 [15]、因子分析 [14]、以及本文的 PPCA。这些工作的共同特点是:使用代数几何方法(爆破、实对数规范阈值)计算学习系数。
- 线索 2:PPCA 模型选择的其他方法。包括基于 AIC/BIC 的方法 [1, 34]、基于 Laplace 近似的贝叶斯方法(Minka, 2000 [32])、基于随机矩阵理论的高维一致性分析(Bai et al., 2018 [8])、以及基于精确边际似然的贝叶斯方法(Bouveyron et al., 2020 [12];Hoff, 2007 [19])。这些方法要么忽略了奇异结构(Laplace 近似),要么依赖于高维渐近框架(随机矩阵理论),要么计算复杂(MCMC)。
- 线索 3:代数几何方法在统计中的应用。包括 Lin (2010, 2017) [30, 2] 关于 RLCT 计算的一般代数策略,以及 Drton et al. (2005) [7] 关于因子分析模型不变量的代数几何研究。这些工作为学习系数的计算提供了数学工具。
这个方向在追问的核心问题¶
- 学习系数的计算:对于给定的非正则模型,如何计算其学习系数 λ 和重数 m?这通常需要复杂的代数几何构造(爆破、正规交叉除子)。
- 模型选择准则的构建:当学习系数依赖于未知真实参数时,如何构建一个可行的、一致的模型选择准则?sBIC 是当前的主要答案。
- 高维扩展:当维度 p 随样本量 n 增长时,奇异学习理论的渐近展开是否仍然成立?Laplace 近似在高维下的有效性是一个活跃的研究方向(Katsevich, 2024 [18];Tang & Reid, 2021 [15])。
- 模型之间的比较:如何将奇异学习理论应用于不同模型族之间的选择(如 PPCA vs. 因子分析)?本文的分区噪声模型是第一步。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者声称,PPCA 模型选择问题中,经典 BIC 因忽略奇异结构而过度惩罚,导致选择过少的成分。他们通过奇异学习理论“正确”地刻画了边际似然渐近,从而 sBIC 能“纠正”这一偏差。作者在引言中写道:“In PCA and related settings, the BIC is well known to penalize complex models heavily, often resulting in overly simple models [12, 20]. The sBIC imposes a smaller penalty and is more sensitive in detecting signals in the eigenvalues.”(第 3 页)——这明确将 sBIC 定位为 BIC 的改进。
- 哪些竞争路线被他淡化或回避了:
- 高维随机矩阵理论方法(Bai et al., 2018 [8])被提及,但作者仅说“在足够大的特征值间隙下,AIC 和 BIC 在高维中是一致的”,然后迅速转向自己的固定-p、大-n 框架。作者没有讨论当 p 也增长时,sBIC 是否仍然有效,也没有与高维方法进行直接比较。
- 基于精确边际似然的贝叶斯方法(Bouveyron et al., 2020 [12];Hoff, 2007 [19])被提及,但作者认为它们“computationally involved”(第 2 页),从而回避了与这些方法的深入比较。在模拟中,作者将 Bouveyron 等人的 NG 方法作为 baseline,但指出其性能对超参数敏感且大样本下不一致。
- 交叉验证方法(GCV, Josse & Husson, 2012 [24])被用作 baseline,但在线性特征值结构下表现极差(几乎从不选择大模型),作者以此凸显 sBIC 的优越性。
- 什么明显该被引 / 该存在、却没出现在 intro 里:
- 关于高维 PPCA 模型选择的最新工作:Hung, Huang & Ing (2022) [20] 的广义信息准则(GIC)被引用,但仅作为“BIC 过度惩罚”的一个证据。作者没有讨论 GIC 是否也能处理奇异结构。
- 关于奇异学习理论在高维下的扩展:Katsevich (2024) [18] 和 Tang & Reid (2021) [15] 被引用,但仅在结论部分作为未来方向提及。作者没有在引言中讨论这些工作与本文的关系。
- 关于 PPCA 模型几何的微分几何视角:Vandereycken et al. (2009) [41] 被引用,但仅用于证明 R^{p×k}_* / O(k) 是光滑流形。作者没有深入讨论 PPCA 模型的流形结构(如 Grassmann 流形)与学习系数计算之间的联系。
张力¶
未见明显对立引用。所有被引工作基本一致地认为:PPCA 模型存在奇异点,经典 BIC 会过度惩罚,需要修正。不同方法之间的差异主要体现在修正方式(sBIC vs. 精确贝叶斯 vs. 高维随机矩阵理论)和适用场景(固定-p vs. 高维)上。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
p:观测向量的维度(正整数)。n:样本量。k:候选主成分个数(0 ≤ k ≤ p-1)。r:真实主成分个数(0 ≤ r ≤ p-1),即真实协方差矩阵 Σ₀ 所属的最小 PPCA 模型 M_r 的索引。W:p × k 的载荷矩阵(参数)。σ²:噪声方差(标量,>0)。Z_i:r 维潜变量向量(不可观测)。ε_i:p 维噪声向量(不可观测)。X_i:p 维观测向量(可观测)。Σ₀:真实协方差矩阵(p × p,正定)。M_k:具有 k 个主成分的 PPCA 模型,即所有形如WW^T + σ²I_p的协方差矩阵的集合。λ_kr:当真实模型为 M_r(r ≤ k)时,模型 M_k 的学习系数。m_kr:对应的重数。φ_k(W, σ²) = WW^T + σ²I_p:参数化映射。I_{p,k}(Σ₀):纤维理想,由WW^T + σ²I_p - Σ₀的条目生成。-
RLCT(I; φ):理想 I 关于权重函数 φ 的实对数规范阈值。 -
模型:
- 数据生成机制:
X_i = W Z_i + ε_i,其中Z_i ~ N_r(0, I_r),ε_i ~ N_p(0, σ²I_p),且 Z_i 与 ε_i 独立。 - 边际分布:
X_i ~ N_p(0, Σ),其中Σ = WW^T + σ²I_p。 - 模型 M_k 的参数空间:
(W, σ²) ∈ R^{p×k} × R_{>0}。 -
待估对象:主成分个数 r(模型选择问题),以及载荷矩阵 W 和噪声方差 σ²(若需要)。
-
可观测数据:
- 可观测:
X_1, ..., X_n,i.i.d. 来自N_p(0, Σ₀)。 - 不可观测(潜在):潜变量
Z_i,噪声ε_i。 - 关键识别假设:模型假设
X_i服从均值为零的高斯分布,协方差矩阵具有“spiked”结构(前 r 个特征值大于后 p-r 个相等的特征值)。
第二步:讲最小内核¶
最简特例:p = 2,k = 1,r = 0 或 r = 1。
- 设定:
p = 2,k = 1。此时W = (w₁₁, w₂₁)^T是一个二维向量。- 参数化映射:
φ₁(W, σ²) = WW^T + σ²I₂ = [[w₁₁² + σ², w₁₁w₂₁], [w₁₁w₂₁, w₂₁² + σ²]]。 - 模型 M₁ 包含所有形如
[[a, b], [b, c]]且满足a > 0, c > 0, ac - b² > 0的协方差矩阵(即所有 2×2 正定矩阵)。实际上,当p=2时,M₁ = S²_{++}(所有正定矩阵),因为任何正定矩阵都可以写成WW^T + σ²I₂的形式(取 W 为特征向量乘以 sqrt(特征值 - 最小特征值),σ² 为最小特征值)。 -
模型 M₀:
{σ²I₂ : σ² > 0},即标量矩阵。 -
奇异点:
-
当
W = 0时,φ₁(0, σ²) = σ²I₂ ∈ M₀。此时 Jacobian 矩阵J_{φ₁}(0, σ²)的秩为 1(而非满秩 3),Fisher 信息矩阵降秩。因此,M₁ 在 M₀ 处是奇异的。 -
学习系数:
- 情况 1:真实模型为 M₀(r=0)。即
Σ₀ = σ₀²I₂。此时,真实参数位于奇异点。根据定理 4.1,λ₁₀ = (1·1 + 0·(2-1+1) + 2) / 4 = (1 + 0 + 2) / 4 = 3/4。注意:k=1, r=0, p=2,代入公式λ_kr = (k + r(p - k + 1) + 2) / 4得(1 + 0 + 2)/4 = 3/4。 -
情况 2:真实模型为 M₁ \ M₀(r=1)。即
Σ₀有两个不同的特征值。此时,真实参数位于非奇异点。根据定理 4.1,λ₁₁ = (1·1 + 1·(2-1+1) + 2) / 4 = (1 + 2 + 2) / 4 = 5/4。注意:k=1, r=1, p=2,代入公式得(1 + 1·2 + 2)/4 = 5/4。这等于 M₁ 的维数(3)的一半,符合正则模型的情况。 -
核心思路:
- 当真实模型是 M₀(奇异情况)时,学习系数
λ₁₀ = 3/4小于正则情况下的λ₁₁ = 5/4。这意味着在奇异点处,边际似然的衰减速度更慢(惩罚更小),因此经典 BIC 使用(dim/2) log n = (3/2) log n作为惩罚会过度惩罚,倾向于选择 M₀ 而非 M₁。 - sBIC 使用正确的学习系数
λ₁₀ = 3/4来构建惩罚,从而纠正了 BIC 的偏差。 - 这个例子直观地展示了:奇异结构导致学习系数小于参数维数的一半,这是 sBIC 比 BIC 更“宽容”的根本原因。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在概率主成分分析(PPCA)模型中,如何正确选择主成分个数 k?经典 BIC 因忽略模型奇异结构而过度惩罚,本文利用奇异学习理论给出了边际似然的正确渐近展开,并基于 sBIC 构建了模型选择准则。
- 核心工具 / 方法:代数几何中的实对数规范阈值(RLCT)计算,具体包括:纤维理想、爆破(blow-up)、链式法则(Fact 4.3)、求和法则(Fact 4.4)等技巧,用于推导 PPCA 模型及其推广(分区噪声 PPCA 模型)的学习系数。
- 主要结论:定理 4.1 给出了 PPCA 模型学习系数的精确公式:
λ_kr = (k + r(p - k + 1) + 2) / 4,重数m_kr = 1。定理 5.1 将这一结果推广到分区噪声 PPCA 模型,使得 PPCA 和因子分析模型的选择成为可能。模拟和真实数据实验表明,sBIC 在模型选择上显著优于 BIC,且在大样本下能以概率趋于 1 选择最小真实模型。
关键设定与假设¶
- PPCA 模型:
M_k = {WW^T + σ²I_p : W ∈ R^{p×k}, σ² > 0}。假设观测数据X_i独立同分布于N_p(0, Σ₀),且Σ₀ ∈ M_r \ M_{r-1}(即真实模型有恰好 r 个主成分)。 - 先验分布:在每个模型 M_k 的参数空间
(W, σ²)上,假设先验密度ϕ_k是光滑且处处为正的(但除此之外任意)。这一假设保证了 RLCT 的计算中,先验的影响仅体现在一个常数因子中,不影响学习系数。 - 固定 p,大 n 渐近:本文的所有理论结果都是在
p固定、n → ∞的框架下建立的。作者在结论部分明确将高维扩展(p随n增长)列为未来方向。 - 零均值假设:主要结果假设观测均值为零。Remark 4.9 指出,若均值未知,只需在每个学习系数上加
p/2,模型选择结果基本不变。 - 与已有文献的对比:
- 相比 BIC:本文放宽了 Fisher 信息正定的正则性假设,允许模型存在奇异点。
- 相比 Minka (2000) 的 Laplace 近似:本文指出 Laplace 近似在奇异点处无效,而奇异学习理论提供了正确的渐近。
- 相比 Bai et al. (2018) 的高维一致性:本文采用固定-p 框架,而 Bai 等人采用高维框架(
p/n → c)。两者互补,但本文未讨论高维下 sBIC 的性质。
主要结果¶
- 定理 4.1(PPCA 学习系数):设
0 ≤ r ≤ k ≤ p-1,真实协方差矩阵Σ₀ ∈ M_r \ M_{r-1}。则在任意光滑、处处正的光滑先验下,模型 M_k 的边际似然展开(3.3)中的学习系数和重数为:λ_kr = (k + r(p - k + 1) + 2) / 4,m_kr = 1。 - 直觉:学习系数由
k(候选 PC 数)、r(真实 PC 数)和p(维度)共同决定。当r = k(非奇异点)时,λ_kk = (k + k(p - k + 1) + 2) / 4 = (k(p - k + 2) + 2) / 4。可以验证,这等于M_k \ M_{k-1}的维数(k(p - k) + k(k+1)/2 + 1)的一半,与正则模型一致。 - 必要条件:
p ≥ 1,0 ≤ r ≤ k ≤ p-1。先验光滑且处处为正。 -
解决的技术难点:PPCA 模型的奇异点位于
M_{k-1}中,其几何结构复杂(不是光滑流形,而是分层空间)。作者通过爆破技巧将奇异点处的积分分解为不同“chart”上的积分,并利用求和法则和链式法则分别计算每个 chart 的 RLCT,最终取最小值。 -
定理 5.1(分区噪声 PPCA 模型学习系数):设
d是p的一个整数分拆,e是d的加细。M_{k,d}是d-分区噪声 PPCA 模型。若Σ₀从M_{r,e}中“一般地”选取,则学习系数为:λ^{de}_{kr} = (k + r(p - k + 1) + 2s) / 4,其中s是分拆d的块数。 - 直觉:学习系数仅依赖于噪声分区的块数
s,而与真实模型的分区e无关。PPCA(s=1)和因子分析(s=p)是特例。 - 意义:该定理提供了一个统一框架,使得可以在 PPCA 和因子分析之间进行模型选择。Corollary 5.3 给出了当仅比较 PPCA 和因子分析(相同 k)时,sBIC 的简单形式。
证明路线与技术技巧¶
- 整体路线(以定理 4.1 为例):
- 转化为 RLCT 计算:利用 Fact 4.2,将学习系数问题转化为计算纤维理想
I_{p,k}(Σ₀)的全局 RLCT。 - 简化参数空间:利用 Lemma 4.6 和 Lemma 4.7,将参数
W限制在L^{p×k}_{r,+}(分块下三角矩阵)中,并将Σ₀对角化为diag(d₁, ..., d_r, 0, ..., 0) + c²I_p。 - 变换与消去:通过一系列可逆的变量变换(
τ = σ² - c²,W₂₁ → W₂₁ W₁₁^T等),将纤维理想简化为两个不相交理想的直和:I₁ = ⟨W₁₁ W₁₁^T - D⟩和I₂ = ⟨W₂₂ W₂₂^T + σ² I_{p-r}⟩,外加一个来自W₂₁的贡献(p-r)r。 - 爆破:对
I₂的零点集(W₂₂ = 0, σ = 0)进行爆破。考虑两个 chart:σ-chart 和w_{pk}-chart。 - 计算每个 chart 的 RLCT:
- 在
σ-chart 上,I₂的拉回变为⟨σ²⟩,其 RLCT 为((p-r)(k-r) + 2) / 2。I₁的拉回定义了一个光滑流形(W₁₁ W₁₁^T = I_r),其 RLCT 为r(r+1)/2。 - 在
w_{pk}-chart 上,得到相同的 RLCT。
- 在
-
求和:利用求和法则(Fact 4.4),将所有贡献相加:
(p-r)r + r(r+1)/2 + ((p-r)(k-r) + 2) / 2 = (pk + r(p - k + 1) + 2) / 2。除以 2 得到学习系数。 -
关键跳跃点:
- 从纤维理想到两个不相交理想的分解:这是整个证明中最巧妙的一步。通过一系列变量变换(
W₂₁ → W₂₁ W₁₁^T,然后消去W₂₁项),作者成功地将W₂₁的贡献分离出来(作为一个可加的常数(p-r)r),并将剩余部分分解为I₁(仅涉及W₁₁)和I₂(仅涉及W₂₂和σ)。这使得问题大大简化。 -
爆破的选择:对
I₂的零点集进行爆破是处理奇异性的标准技巧。作者选择爆破W₂₂ = 0和σ = 0的线性子空间,并证明在所有 chart 上得到的 RLCT 相同,从而避免了复杂的 chart 比较。 -
技术技巧点名:
- 实对数规范阈值(RLCT):核心概念,用于量化奇异点处的积分渐近。
- 纤维理想:将统计问题(边际似然积分)转化为代数几何问题(理想在零点附近的 RLCT)。
- 爆破(Blow-up):用于“解消”奇异点的标准代数几何技巧。本文中用于处理
W₂₂ = 0, σ = 0处的奇异性。 - 链式法则(Fact 4.3):用于处理变量变换下的 RLCT 变换,包括 Jacobian 行列式的贡献。
- 求和法则(Fact 4.4):用于将不相交理想的 RLCT 相加。
- 光滑点引理(Fact 4.5):用于计算光滑流形(如
W₁₁ W₁₁^T = I_r)的 RLCT。
真实例子与应用¶
- 模拟实验:
- 数据:从
N_p(0, Σ₀)生成数据,Σ₀具有“spiked”协方差结构(前 r 个特征值大于后 p-r 个相等的特征值)。 - 场景:
p = 5和p = 20,n ∈ {30, 50, 250, 4000},r从 0 到p-1。两种特征值结构:等值(isotropic)和线性递增(linear)。 - 方法:sBIC vs. BIC vs. 两种 Normal-Gamma (NG) 方法 vs. 广义交叉验证 (GCV)。
- 结果:
- sBIC 在几乎所有设定下都优于 BIC,尤其是在中等样本量(
n=250)和中等 r 时,sBIC 的正确选择比例远高于 BIC(例如,p=20, c=2, r=9时,sBIC 为 75.6%,BIC 仅为 0.3%)。 - NG 方法对超参数敏感,且在大样本下不一致(倾向于选择过大的模型)。
- GCV 在线性特征值结构下表现极差,几乎从不选择大模型。
- sBIC 在几乎所有设定下都优于 BIC,尤其是在中等样本量(
-
说明:这些实验旨在验证 sBIC 的理论优势(纠正 BIC 的过度惩罚),并展示其相对于其他方法的稳健性。
-
真实数据例子:
- 数据 1:2008 年奥运会十项全能数据(
n=24, p=10)。sBIC 选择因子分析模型(4 个因子),BIC 选择 PPCA 模型(1 个主成分)。 - 数据 2:葡萄酒味觉数据(
n=21, p=14)。sBIC 选择 PPCA 模型(8 个主成分),BIC 选择 PPCA 模型(4 个主成分)。 - 说明:这些例子展示了 sBIC 倾向于选择比 BIC 更大的模型,这与模拟结果一致。作者认为,基于 scree plot,BIC 选择的模型可能过于保守。
🔎 结论是否比证明窄¶
- 结论比证明窄的潜在点:
- 定理 4.1 和 5.1 的证明依赖于“一般地选取 Σ₀”这一条件。在定理 5.1 的证明中,作者明确说“As Σ₀ is chosen generically, we can pick L and, hence, Q generically. Consequently, we may assume that ... this term is actually strictly larger than 0.”(第 14 页)。这意味着,如果 Σ₀ 是“非一般”的(例如,某些系数恰好为零),则证明中的“单位”(unit)论证可能失效,学习系数可能不同。作者在 Remark 4.10 中声称 PPCA 的学习系数与 Σ₀ 的选择无关,但这一结论是否对分区噪声模型也成立,并未严格证明。
- sBIC 的“一致性”:作者在摘要中说 sBIC “selecting the smallest true model with probability converging to one”。但这一结论在论文中并未以定理形式严格证明。作者引用了 Drton & Plummer (2017) [16] 的 sBIC 理论,该理论在一般条件下证明了 sBIC 的一致性。本文只是将 PPCA 的学习系数代入该框架,因此一致性是继承的,而非本文独立证明的。
- 高维扩展:作者在结论部分将高维扩展列为未来方向,但并未在论文中给出任何高维下的理论结果。因此,本文的所有结论严格限于固定 p 的框架。
四、开放问题¶
-
高维扩展:当维度
p随样本量n增长时(如p/n → c),PPCA 模型的学习系数是否仍然由定理 4.1 给出?Laplace 近似在高维下的有效性(Katsevich, 2024 [18];Tang & Reid, 2021 [15])能否与奇异学习理论结合?扎根点:论文第 7 节(Conclusion and Future Directions)第一段:“One immediate question is how to extend the present results to the large-p settings that are prevalent in the high-dimensional covariance matrix estimation literature [9].” -
各向同性 PPCA 和分层 PCA 的学习系数:本文的分区噪声模型假设噪声方差在不同组内相等,但主成分的范数可以不同。一个替代模型是各向同性 PPCA(
Σ = τ² WW^T + σ²I,W 的列具有单位范数),其中模型之间没有包含关系。另一个更一般的模型是分层 PCA(Σ = Σ_i σ_i² W_i W_i^T)。这些模型的学习系数尚未确定。扎根点:论文第 7 节第二段:“Generalizing both PPCA and isotropic PCA is stratified PCA... Determining the learning coefficients for the larger class of stratified PCA models remains an open question.” -
典型相关分析(CCA)的奇异学习理论:CCA 有一个类似于 PPCA 的概率公式,该模型也存在奇异点。计算其学习系数可用于选择典型方向的数量。扎根点:论文第 7 节最后一句:“Lastly, we mention that canonical correlation analysis (CCA) has a probabilistic formulation akin to PPCA [7]. As this model also has singularities, a study of the learning coefficients of this model is warranted.”
-
sBIC 的有限样本性质:本文仅给出了 sBIC 的渐近一致性,但未提供任何有限样本下的误差界或置信区间。能否利用您熟悉的非参数统计和 minimax 界工具,推导 sBIC 在有限样本下的选择误差概率?扎根点:论文的模拟部分展示了 sBIC 在有限样本下的表现,但缺乏理论保证。
Maintained by 陈星宇 · Homepage · Source on GitHub