Adaptive Transfer Clustering: A Unified Framework¶
讲者: Zhongyuan Lyu
会场: Recent Advances in Network Analysis and Related Areas
报告题目: Adaptive Transfer Clustering: A Unified Framework
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:如何利用一个与目标数据来自同一组对象、但反映不同潜在分组结构的辅助(源)数据,来提升目标数据的聚类精度。核心挑战在于,两个数据集的真实标签(如社区划分、类别归属)可能相似但不完全相同,且这种差异程度(用参数ε表示)是未知的。当前成熟度处于早期阶段——大多数迁移学习工作聚焦于监督或半监督场景,而针对无监督聚类(尤其是标签存在未知差异的情况)的理论与方法尚不成熟。
发展脉络(history)¶
-
奠基工作:多视图聚类与单视图聚类。多视图聚类([5] Bickel & Scheffer, 2004)是这一方向的早期雏形,它假设多个视图(数据集)共享完全相同的聚类结构,并通过联合优化或生成模型来整合信息。然而,这一假设在现实中过于理想——不同视图可能反映不同的分组结构(如社交网络与属性数据)。
-
主要进展:参数迁移与模型假设。针对高斯混合模型(GMM),[62] Tian et al. (2022) 和 [65] Wang et al. (2019) 提出了基于EM的迁移聚类方法,假设源域与目标域的判别系数或均值/协方差结构相似。但作者指出,这些工作“typically assume similar parameter structures in the source and the target domains, which contain different subjects”,即它们处理的是不同对象的不同视图,而非同一对象的不同视图。更关键的是,它们没有处理标签本身存在差异(即ε>0)的情况。
-
当前前沿:标签差异与多视角网络。近年来,网络社区检测领域开始关注标签差异。[12] Chen, Liu & Ma (2022) 研究了多层网络在标签翻转下的社区检测极限,但作者指出“their method is not adaptive to an unknown flipping probability”。[13] Cohen-Addad et al. (2024) 提出了多视图随机块模型(SBM),但假设标签结构在各视图间同质。[23] Gao & Ma (2022) 提出了一个检验问题——判断两个GMM数据集是否共享相同的聚类结构,并给出了精确的检测边界。然而,作者强调,对于聚类(标签估计)任务,“it remains unknown whether a naïve dichotomous strategy, based on their testing procedure, is optimal”。
-
本文的位置:本文提出一个统一的迁移聚类框架,首次在理论上处理了“同一组对象、不同视图、标签存在未知差异”这一设定。它不假设标签完全一致(ε=0),也不假设完全无关(ε=1/2),而是通过自适应选择惩罚参数λ来平衡“借用源数据”与“容忍标签差异”之间的偏差-方差权衡。其理论贡献在于,在双组分对称GMM下,给出了最优聚类错误率的显式形式,并证明了所提ATC算法无需知道ε即可达到该率。
子线索聚类¶
-
线索一:多视图聚类(共享标签假设)。代表工作:[5] Bickel & Scheffer (2004), [42] Kumar et al. (2011), [26] Gao, Bien & Witten (2020), [27] Gao, Witten & Bien (2022)。这一簇假设不同视图的标签完全一致,通过联合建模或测试来整合信息。本文与之不同,明确允许标签不一致。
-
线索二:带辅助信息的网络社区检测(同质或异质标签)。代表工作:[6] Binkiewicz, Vogelstein & Rohe (2017), [7] Braun, Tyagi & Biernacki (2022), [12] Chen, Liu & Ma (2022), [13] Cohen-Addad et al. (2024), [36] James et al. (2024), [73] Yan & Sarkar (2021)。这一簇处理网络(SBM)与节点特征(GMM)的联合聚类。其中,[12] 考虑了标签翻转但非自适应,[7] 假设相同聚类结构。本文的方法可应用于此类“上下文SBM”场景,且具备自适应性。
-
线索三:聚类结构检验。代表工作:[23] Gao & Ma (2022), [26] Gao, Bien & Witten (2020)。这一簇关注的是“两个数据集是否共享相同聚类结构”的假设检验问题。本文指出,检验与聚类(标签估计)是不同任务,最优检验策略不一定导出最优聚类策略,并给出了一个详细的比较(附录B)。
这个方向在追问的核心问题¶
- 如何量化“借用”的收益? 当源数据与目标数据的标签差异ε很小时,借用源数据能带来多大的精度提升?本文用α = log(1/ε)/(4SNR) 来刻画,并给出了显式的错误率改进(从exp(-SNR)到exp(-SNR·min{(1+α)², 2}))。
- 如何自适应地选择“借用”程度? 当ε未知时,如何自动决定是应该完全借用(数据池化)、完全不借用(独立学习)、还是部分借用?本文的核心贡献就是通过Goldenshluger-Lepski方法+参数自助法实现了这种自适应。
- 理论最优性是什么? 在给定ε和SNR下,最优的聚类错误率是多少?本文给出了匹配的下界(Theorem 3),证明了ATC可以达到该率。
- 框架的通用性如何? 该方法能否推广到GMM以外的模型(如SBM、LCM)?本文通过一个通用框架(Section 3)和针对CLCM的理论(Theorem 7)给出了肯定回答。
⚠️ 作者的 framing¶
-
作者把缺口 frame 成什么? 作者将现有工作的缺口定位为:它们要么假设不同对象的不同视图(参数迁移),要么假设相同标签(多视图聚类),要么处理标签差异但非自适应([12])。因此,本文的“显然的下一步”是:针对同一对象的不同视图,在标签差异未知的情况下,提出一个自适应的、理论最优的迁移聚类框架。
-
哪些竞争路线被他淡化或回避了?
- 直接估计ε的路线:作者在Lemma 1中明确指出,当ε很小时(如ε = n^{-β}),直接通过独立学习估计的ε̂ 可能不一致,因此不能作为λ的可靠插件估计量。这为他们的GL方法提供了动机。
- 联合建模([K]×[K]标签空间)的路线:作者在Section 3.2中明确讨论了为什么不直接估计一个联合模型。理由包括:计算效率低(K²个簇)、簇大小不平衡、以及当源和目标数据模型不同时(如SBM+GMM)拟合困难。这实际上是在淡化一种看似更直接的竞争方法。
-
什么明显该被引/该存在、却没出现在intro里?
- 论文主要关注“同一对象的不同视图”,但intro中引用的多视图聚类文献(如[5], [26], [27])大多也处理同一对象。作者在Section 3.2中才详细对比了与[26, 27]的差异。一个更早的、明确处理“不同视图、不同标签”的文献(如某些关于“多视角学习中的标签噪声”的工作)可能被遗漏,但鉴于这是一个较新的子方向,这并非严重缺陷。
- 论文的核心技术是Goldenshluger-Lepski方法,这在非参数估计中很经典。作者引用了[28] Goldenshluger & Lepski (2008) 和 [54] Page & Grünewälder (2021)。对于熟悉该方法的读者,这足够了。
张力¶
未见明显对立引用。各条线索(多视图、网络、检验)之间是互补而非矛盾的关系。唯一的张力可能存在于[23]的检验框架与本文的聚类框架之间,但作者在附录B中明确阐述了二者的区别与联系,并指出在可检测区域(Region R1,det),聚类任务可以比检验任务做得更好(即即使差异可检测,最优聚类策略也可能是忽略它)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
n: 样本量(对象个数)。K: 潜在类别数(本文主要考虑K=2)。Z*_0 ∈ {±1}^n: 目标数据的真实潜在标签向量(我们想要估计的对象)。Z*_1 ∈ {±1}^n: 源数据的真实潜在标签向量。X_0 ∈ R^n: 目标数据的观测值(一维)。X_1 ∈ R^n: 源数据的观测值(一维)。µ > 0: 高斯混合模型的均值参数(信号强度)。σ > 0: 高斯混合模型的标准差(噪声水平)。SNR := µ²/(2σ²): 信噪比。ε ∈ [0, 1/2]: 标签差异参数,即P(Z*_{1,i} ≠ Z*_{0,i})。这是未知的、需要自适应处理的关键参数。λ ≥ 0: 惩罚参数,控制对标签差异的容忍度。λ=0对应独立学习(ITL),λ→∞对应数据池化(DP)。ℓ(Z, Z'): 归一化汉明距离(误分类率)。Φ(·): 标准正态分布的累积分布函数。
-
模型(以最简的一维双组分对称GMM为例):
- 目标数据
X_0和源数据X_1均来自同一组n个对象。 - 每个对象
i有两个潜在标签Z*_{0,i}和Z*_{1,i},它们独立同分布地取自Rademacher分布(等概率为±1),且P(Z*_{1,i} ≠ Z*_{0,i}) ≤ ε。 - 给定标签,观测数据由高斯分布生成:
X_{0,i} | Z*_{0,i} ~ N(Z*_{0,i} * µ, σ²)X_{1,i} | Z*_{1,i} ~ N(Z*_{1,i} * µ, σ²) - 参数
(µ, σ)在热身部分假设已知,在一般理论中需要估计。
- 目标数据
-
可观测数据:研究者能观测到的是
(X_0, X_1),即来自两个不同视图的n个样本。想要但观测不到的是真实标签(Z*_0, Z*_1)以及差异参数ε。所有推断都必须基于(X_0, X_1)和模型假设。
第二步:讲最小内核¶
最简特例:一维、双组分、对称GMM,且 (µ, σ) 已知。
核心问题:给定 (X_0, X_1),如何估计 Z*_0,使得误分类率 ℓ(Ẑ_0, Z*_0) 尽可能小,且无需知道 ε?
关键想法:考虑一个带惩罚的联合MAP估计:
(Ẑ^λ_{0,i}, Ẑ^λ_{1,i}) = argmin_{u,v ∈ {±1}} [ (X_{0,i} - uµ)²/(2σ²) + (X_{1,i} - vµ)²/(2σ²) + λ * I(u ≠ v) ]
这个优化可以简化为:
(Ẑ^λ_{0,i}, Ẑ^λ_{1,i}) = argmin_{u,v ∈ {±1}} [ -µ(uX_{0,i} + vX_{1,i}) + λσ² * I(u ≠ v) ]
为什么这个特例是核心?
1. 退化为已知方法:当λ=0时,Ẑ^0_0 = sgn(X_0),即独立学习(ITL)。当λ→∞时,Ẑ^∞_0 = sgn(X_0 + X_1),即数据池化(DP)。
2. 偏差-方差分解:Theorem 1给出了 Ẑ^λ_0 的误分类率上界 M(µ/σ, ε, λ),它可以分解为:
- 随机误差(方差) ψ(λ) = Φ(-√2µ/σ) + Φ(-µ/σ - λ/(2µ/σ)) * Φ(µ/σ - λ/(2µ/σ)):这是当标签完全匹配(ε=0)时的误差,随λ增大而减小(因为借用更多数据降低了噪声)。
- 系统误差(偏差) ϕ(λ) = 2ε * Φ(-µ/σ + λ/(2µ/σ)):这是由标签差异引入的误差,随λ增大而增大(因为更大的λ强制标签一致,从而放大了差异的影响)。
3. 最优λ:Theorem 2和3表明,最优的λ 正比于 log((1-ε)/ε),它恰好平衡了偏差和方差。当ε很小时,λ很大,近似于数据池化;当ε很大时,λ很小,近似于独立学习。
4. 自适应挑战:λ 依赖于未知的ε。直接估计ε(如通过比较ITL估计的标签)在ε很小时会失败(Lemma 1)。因此,需要一种不依赖ε估计的自适应方法。
本文的核心思路:通过Goldenshluger-Lepski方法,构造一个数据驱动的代理 bϕ(λ) + bψ(λ) 来逼近真实的误分类率 M(µ/σ, ε, λ),然后选择使该代理最小的λ。其中,bψ(λ) 通过参数自助法(在ε=0的假设下生成模拟数据)来估计方差项,bϕ(λ) 通过比较不同λ下的估计结果来估计偏差项。这样,就绕开了对ε的直接估计。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对同一组对象、但反映不同潜在分组结构的目标和源数据,提出了一个统一的迁移聚类框架,旨在自适应地利用源数据来提升目标数据的聚类精度,而无需知道两组标签之间的差异程度ε。
- 核心工具/方法:提出了自适应迁移聚类(ATC)算法,其核心是结合Goldenshluger-Lepski(GL)方法和参数自助法,来自动选择惩罚参数λ,从而在“借用源数据”(降低方差)和“容忍标签差异”(控制偏差)之间实现最优权衡。
- 主要结论:在双组分对称高斯混合模型(GMM)下,证明了ATC算法可以达到与已知ε的最优估计器相匹配的聚类错误率,该率显式地优于仅使用目标数据的独立学习(ITL)和数据池化(DP)策略。该框架可推广到随机块模型(SBM)和潜在类模型(LCM)。
关键设定与假设¶
- 核心设定:
(X_0, X_1)是来自同一组n个对象的两个视图的数据。Z*_0和Z*_1是它们各自的潜在标签,且P(Z*_{1,i} ≠ Z*_{0,i}) ≤ ε。目标是估计Z*_0。 - 关键假设:
- Assumption 1 (Separability):对数后验密度可分解为各样本之和。这对于GMM和LCM成立,但对于SBM不直接成立。作者在Remark 2中指出,SBM的优化可以通过条件似然分解来处理,将其他样本的标签和观测视为参数。
- Assumption 2 (Parameter Estimation Error):参数估计量
(bΘ_0, bΘ_1)与数据(X_0, X_1)独立,且其估计误差足够小,以至于在“干净”模型(ε=0)下,使用估计参数得到的标签估计与使用真实参数得到的标签估计之间的差异,可以被真实标签的误差率所控制(γ倍)。这个假设保证了参数自助法的有效性。 - Assumption 3 (GMM参数估计):对于d维GMM,存在一个独立于数据的估计量
(bµ, bσ),使得∥bµ - µ∥/∥µ∥和|bσ/σ - 1|以高概率被一个很小的δ_n控制。这在实际中可以通过EM算法等方法满足(Remark 4)。
- 相比已有文献的放宽/强化:相比[62, 65]等参数迁移工作,本文放宽了“不同对象”的假设,转向“同一对象、不同视图”。相比[5, 26]等多视图聚类工作,本文放宽了“标签完全一致”的假设,允许ε>0。相比[12],本文强化了自适应性,无需知道ε。
主要结果¶
- Theorem 1 (TC估计器的误差界):对于一维GMM,给出了
Ẑ^λ_0的误分类率上界M(µ/σ, ε, λ),并揭示了其偏差-方差分解结构。 - Theorem 2 (最优TC的误差率):证明了存在一个最优的λ,使得
Ẑ^λ_0的期望误分类率不超过C₀ * exp(-SNR * min{(1+α)², 2}),其中α = log(1/ε)/(4SNR)。这个率优于ITL的exp(-SNR)和DP的exp(-SNR * min{4α, 2})。 - Theorem 3 (下界):证明了任何估计器
bZ_0的误分类率至少为(1/4) * M(µ/σ, ε, log((1-ε)/ε)),与Theorem 2的上界匹配,从而证明了TC估计器(在已知ε时)的最优性。 - Theorem 4 & Corollary 1 (ATC的自适应最优性):证明了ATC算法(无需知道ε)以高概率达到与Theorem 2相同的误分类率(忽略一个可忽略的
log(M/ζ)/n项),从而实现了自适应最优性。 - Theorem 6 (d维GMM的ATC):将Theorem 4的结果推广到d维对称GMM,其中均值µ和标准差σ未知但可被一致估计。
- Theorem 7 (双类上下文LCM的ATC):将结果推广到目标数据为LCM、源数据为GMM的混合模型,给出了ATC达到“如同无差异”的聚类率的条件(
α > 1/(1+√(1+r)),其中r是两个SNR的比值)。
证明路线与技术技巧¶
-
整体路线:
- 建立TC估计器的误差界:通过分析
Ẑ^λ_0的决策边界(Theorem 1的证明),将其误分类率分解为与λ相关的方差项ψ(λ)和偏差项ϕ(λ)。 - 确定最优λ:通过优化
M(µ/σ, ε, λ)得到最优λ的理论形式λ* ∝ log((1-ε)/ε),并证明其达到的率(Theorem 2)。 - 证明下界:通过构造一个贝叶斯最优分类器(MAP),并利用Fano不等式或直接的概率计算,证明任何估计器都无法超越由
M(µ/σ, ε, log((1-ε)/ε))给出的率(Theorem 3)。 - 实现自适应(核心):
- 构造代理:定义一个代理目标函数
bϕ(λ) + bψ(λ),其中bψ(λ)估计方差,bϕ(λ)估计偏差。 - 估计方差
bψ(λ):通过参数自助法(Algorithm 1/3)。在“干净”模型(ε=0)下生成模拟数据,计算不同λ下的标签估计,并用其与数据池化估计(λ=∞)的差异的样本分位数来估计ψ(λ)。这利用了ψ(λ)在ε=0时是已知的、可模拟的。 - 估计偏差
bϕ(λ):利用Goldenshluger-Lepski方法(Algorithm 2)。对于每个λ,计算bϕ(λ) = max_{λ' < λ} [ D(Ẑ^λ_0, Ẑ^{λ'}_0) - bψ(λ') ]_+。这个量通过比较不同λ下的估计结果,并减去已估计的方差,来作为偏差的代理。 - 选择λ:选择使
bϕ(λ) + bψ(λ)最小的λ作为bλ。
- 构造代理:定义一个代理目标函数
- 证明自适应最优性:通过一个Oracle不等式(Lemma 2),证明如果
bψ(λ)是ψ(λ)的一个好的上界,那么ATC的误差可以被min_λ {ϕ(λ) + ψ(λ)}控制。然后通过Lemma 3证明参数自助法确实能提供这样的bψ(λ)。
- 建立TC估计器的误差界:通过分析
-
关键跳跃点:
- 从已知ε到未知ε:这是本文最核心的跳跃。直接估计ε不可行(Lemma 1),因此作者没有走“先估计ε,再代入λ*”的路线,而是绕开ε,直接通过GL方法选择λ。这个跳跃依赖于一个巧妙的观察:偏差
ϕ(λ)和方差ψ(λ)都可以通过可观测的量来构造代理,而无需知道ε。 - 构造
bψ(λ)的可行性:方差项ψ(λ)是在ε=0的假设下定义的。作者通过参数自助法,在“干净”模型下生成数据,从而能够模拟和估计这个量。这要求参数(µ, σ)可以被一致估计(Assumption 3),并且自助法生成的样本分布与真实“干净”模型的分布足够接近。
- 从已知ε到未知ε:这是本文最核心的跳跃。直接估计ε不可行(Lemma 1),因此作者没有走“先估计ε,再代入λ*”的路线,而是绕开ε,直接通过GL方法选择λ。这个跳跃依赖于一个巧妙的观察:偏差
-
技术技巧点名:
- Goldenshluger-Lepski (GL) 方法:用于自适应非参数估计的经典方法。本文将其创造性地应用于离散的模型选择问题(选择λ),而不是函数估计中的带宽选择。这是本文方法论的基石。
- 参数自助法 (Parametric Bootstrap):用于在“干净”模型下生成模拟数据,从而估计方差项
ψ(λ)。这是实现GL方法的关键工具。 - 偏差-方差分解:将聚类误差分解为随机误差和系统误差,为理解迁移学习中的权衡提供了清晰的框架。
- Oracle不等式:通过Lemma 2,将自适应估计器的误差与最优Oracle估计器的误差联系起来,是证明自适应最优性的标准技术。
- 概率不等式:大量使用Bernstein不等式、Hoeffding不等式等来建立高概率界。
真实例子与应用¶
本文包含三个真实数据例子和一个模拟研究部分(Section D)。
-
Lazega Lawyers Network:
- 数据:
n=66名律师。目标数据X_0:律师在事务所的年限(连续变量,用GMM建模)。源数据X_1:强同事关系网络(用SBM建模)。真实标签Z*_0:律师身份(合伙人/助理)。Z*_1:办公室所在地(哈特福德/波士顿)。 - 方法应用:将ATC应用于此,目标是用年限数据(辅以网络信息)来聚类律师身份。
- 结果:ATC的误分类率为0.076,显著优于仅使用目标数据的ITL(0.151)、仅使用网络的ITL(0.394)以及CASC(0.348)、SDP(0.106)、NAC(0.5)等基线方法。ATC的ARI(0.716)也远高于其他方法。
- 说明:这个例子展示了ATC在“目标数据信号强、源数据信号弱”的场景下,如何有效借用源数据中的微弱信息来进一步提升聚类性能。图2直观地展示了ATC选择的λ恰好使真实误差最小化。
- 数据:
-
TIMSS 2019 Data:
- 数据:
n=259名新加坡八年级学生。目标数据X_0:对17个科学相关题目的回答(二元数据,用LCM建模)。源数据X_1:对17个数学相关题目的回答(二元数据,用LCM建模)。真实标签Z*_0:学生是否认为自己擅长科学。Z*_1:学生是否认为自己擅长数学。 - 方法应用:用ATC来聚类学生,目标是用科学题目的回答(辅以数学题目的回答)来推断学生对自己科学能力的认知。
- 结果:ATC的误分类率为0.347,优于仅使用目标数据的ITL(0.371)。右图的提琴图显示ATC比DP和ITL更稳健。
- 说明:这个例子展示了ATC在“目标数据和源数据来自同一类型模型(LCM)”时的应用。图4的热图展示了ATC估计出的每个类别的项目参数,有助于解释聚类结果。
- 数据:
-
Business Relation Network:
- 数据:
n=312家公司。目标数据X_0:供应商网络(用SBM建模)。源数据X_1:标准化股票收盘价(d=102,用GMM建模)。真实标签Z*_0:公司所属的5个行业板块。 - 方法应用:用ATC来聚类公司,目标是用供应商网络(辅以股价信息)来推断公司所属行业。
- 结果:ATC的误分类率为0.535,优于仅使用目标数据的ITL(0.734)、DP(0.551)以及CASC(0.692)、SDP(0.663)、NAC(0.625)等基线方法。ATC的ARI(0.134)也优于DP(0.129)。
- 说明:这个例子展示了ATC在“目标数据信号极弱(SNR低)”的场景下,如何通过大量借用源数据(选择大λ,近似于DP)来获得巨大提升。作者指出,在这个低SNR场景下,DP已经接近最优,ATC的微小改进(0.016)验证了其自适应性。
- 数据:
🔎 结论是否比证明窄¶
- Theorem 5 (一般理论) 的结论依赖于一个关键的假设:存在一个非递减的确定性函数
ϕ(λ)使得P(D(bZ^λ_0, \bar{Z}^λ_0) ≤ ϕ(λ), ∀λ∈Λ) ≥ 1-ζ/2。这个假设在GMM下通过Lemma 8和9被验证,但对于LCM和SBM,作者仅在Theorem 7和8中给出了针对特定参数设定(如已知参数、特定渐近)的证明。论文在“Discussion”部分明确承认:“It would be of great interest to extend the analysis in Theorem 5 to LCMs and SBMs, which requires more technical efforts.” 因此,Theorem 5的通用性在论文中并未被完全证明,它更像是一个为GMM特例服务的框架性定理。对于LCM和SBM,结论是在更窄的设定下(如已知参数、特定渐近)被证明的。
四、开放问题¶
-
将一般理论(Theorem 5)推广到LCM和SBM:论文在Section 6中明确指出了这一点。当前的理论分析(Theorem 7, 8)依赖于已知参数和特定的渐近条件。一个开放问题是,在参数未知、且需要满足Assumption 2(参数估计误差可控)的条件下,能否为LCM和SBM建立与GMM类似的自适应最优性保证?这需要更精细的技术来处理SBM的非可分解后验(Remark 2)和LCM的离散数据特性。
-
扩展到K>2个类别:论文的所有理论结果都集中在K=2的情形。将偏差-方差分解、GL方法以及最优λ的形式推广到多类(K>2)是一个自然但非平凡的扩展。惩罚项
λ * I(u≠v)需要被推广为更一般的标签差异度量,如λ * D(Z_0, Z_1),其中D是一个合适的距离函数。 -
扩展到其他无监督学习任务:论文在Remark 1和Section 6中提到,该框架可以适应于混合成员模型、因子模型等。一个开放问题是,如何将ATC的核心思想(GL方法+自助法)应用于连续潜在变量(如因子得分)的估计,而不仅仅是离散的聚类标签。这需要重新定义“标签差异”和相应的惩罚项。
-
与检验框架的更深层整合:论文在附录B中比较了ATC与[23]的检验框架,并指出在可检测区域,聚类任务可以做得比检验任务更好。一个有趣的问题是,能否将ATC的框架反过来用于构造一个自适应的、更强大的检验统计量?论文在附录C中给出了一个初步的测试程序,但其理论性质(如功效)尚未被分析。
Maintained by 陈星宇 · Homepage · Source on GitHub