A Flexible Framework for Synthesizing Categorical Sequences with Application to Human Activity Patterns¶
作者: Zuofu Huang, Julian Wolfson, Jayne A. Fulkerson, Ryan Demmer, Helen N. Chen
来源: Journal of Computational and Graphical Statistics
主题: 统计计算 / 算法
相关性: 2/10
机构绿灯: University of Minnesota(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/10618600.2025.2450461
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是分类序列的合成(categorical sequence synthesis),其根本的统计/科学问题是:给定一个从真实复杂过程观测到的多天连续分类序列(例如,一个人每天每10分钟的活动类型:工作、通勤、休闲、睡眠),如何生成一个统计上逼真且可参数化控制的合成序列,用于隐私保护、缺失数据插补或统计方法评估。当前成熟度:这是一个应用驱动的领域,方法多从时间序列建模(如马尔可夫链、隐马尔可夫模型)移植,但专门针对“多天连续、个体间异质性大、需保留长程依赖(如活动持续时间分布)”这一特定数据结构的通用框架尚不成熟。
发展脉络(history)¶
作者在引言中引用的工作串成了一条清晰的线索:
-
奠基工作:传统序列合成方法
- 隐马尔可夫模型 (HMM):作者引用
Rabiner (1989)作为HMM的经典综述,指出HMM通过隐藏状态生成观测序列,能捕捉序列的某些动态特性。但作者认为,HMM的“隐藏状态”在合成任务中是一个缺点——它使得直接控制合成序列的显式特征(如“增加周末的休闲活动比例”)变得困难,因为你需要调整的是不可解释的隐藏状态参数。 - 传统马尔可夫链 (MC):作者引用
Bishop (2006)作为MC的标准参考。MC直接建模观测状态的转移概率,参数直观。但作者指出,标准的一阶MC无法捕捉长程依赖,例如,它难以生成与真实数据匹配的“活动持续时间分布”(duration distribution),因为一阶MC的停留时间服从几何分布,而真实活动持续时间往往有更复杂的分布(如对数正态、幂律)。
- 隐马尔可夫模型 (HMM):作者引用
-
主要进展:针对特定应用或改进的序列模型
- 高阶马尔可夫链 (Higher-order MC):作者引用
Ching & Ng (2006)关于高阶马尔可夫链的专著。高阶MC通过考虑过去多个时间步的状态来捕捉长程依赖。但作者认为,这会导致状态空间指数爆炸(对于有K个类别的序列,d阶MC的状态空间大小为K^d),在类别数较多时不可行。 - 可变阶马尔可夫链 (Variable-order MC):作者引用
Bühlmann & Wyner (1999)提出的可变阶马尔可夫链(如上下文树模型)。这类方法通过只保留有统计显著性的历史状态来缓解状态空间爆炸。但作者认为,这些方法缺乏一个直观的机制来修改合成序列的全局特征(如改变活动的时间分布),其参数化能力有限。 - 生成对抗网络 (GANs) 用于序列:作者引用
Esteban et al. (2017)提出的TimeGAN,这是将GAN应用于时间序列合成的代表性工作。作者承认GAN能生成高度逼真的序列,但指出其训练不稳定、难以解释、且同样难以直接控制合成序列的特定属性。
- 高阶马尔可夫链 (Higher-order MC):作者引用
-
当前Frontier与本文位置
- 作者将当前frontier定位为:需要一种平衡“真实性”与“可参数化性” 的方法。现有方法要么过于简单(一阶MC)无法捕捉复杂依赖,要么过于复杂(HMM, GAN)难以解释和控制。
- 本文的位置:作者提出
paired Markov Chain (paired-MC),声称它填补了“在保留关键序列特征(如活动持续时间分布)的同时,提供一个直观机制来修改合成序列特征”这一空白。paired-MC的核心思想是:显式地建模“状态转移”和“状态持续时间”这两个过程,而不是将它们隐含在单一转移矩阵中。
子线索聚类¶
这些被引文献大致落在两条子线索上:
-
线索一:基于转移概率的显式建模
- 做什么:直接对观测状态的转移概率进行建模。代表方法:一阶MC、高阶MC、可变阶MC。
- 优点:参数直观、可解释性强、易于控制。
- 缺点:捕捉长程依赖(尤其是持续时间分布)能力有限,或面临状态空间爆炸。
- 本文的贡献:paired-MC属于此线索,但通过“配对”机制(将当前状态与上一状态配对)和显式的持续时间建模,试图克服传统MC的缺点。
-
线索二:基于隐变量的隐式建模
- 做什么:引入不可观测的隐变量(隐藏状态、噪声向量)来驱动序列生成。代表方法:HMM, GAN。
- 优点:能捕捉复杂的非线性依赖和长程结构。
- 缺点:参数不直观、难以解释、难以直接控制合成序列的显式特征、训练可能不稳定(GAN)。
- 本文的回避:作者明确回避了这条线索,认为其“可参数化性”不足。
这个方向在追问的核心问题¶
- 如何同时保留“转移模式”和“持续时间分布”? 这是序列合成中最核心的统计挑战。一阶MC只能保留转移模式(且是短程的),而忽略了持续时间分布。
- 如何提供一个直观、可解释的参数化机制? 用户(如流行病学家)希望不仅能生成逼真的数据,还能通过调整少数有意义的参数(如“增加周末的久坐时间”)来生成反事实或用于敏感性分析的场景。
- 如何平衡模型复杂度与计算可行性? 高阶MC理论上可以解决长程依赖,但计算代价过高。需要找到一种在复杂度和可行性之间的折中方案。
- 如何评估合成数据的“真实性”? 这是一个开放问题。常用的方法包括比较边际分布、转移概率、自相关函数等,但缺乏一个统一的、统计上严格的准则。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么:作者将缺口 frame 为“现有方法(MC, HMM, GAN)在同时满足‘真实性’和‘可参数化性’这两个需求上的失败”。作者声称,paired-MC通过其“配对”和“显式持续时间建模”的设计,同时解决了这两个问题,成为“显然的下一步”。
- 哪些竞争路线被他淡化或回避了:
- 可变阶马尔可夫链:作者承认其能缓解状态空间爆炸,但仅用一句“缺乏修改全局特征的直观机制”就将其淡化。实际上,可变阶MC(如上下文树)的参数化能力可能被低估了。
- 基于深度学习的序列生成模型(如TimeGAN):作者承认其逼真性,但用“训练不稳定、难以解释”将其回避。对于许多应用,逼真性可能是压倒性的需求,而可解释性可以牺牲。
- 半马尔可夫模型 (Semi-Markov Model):这是最直接的竞争对手。半马尔可夫模型显式地建模状态持续时间分布,与paired-MC的核心思想非常接近。作者在引言中完全没有提及半马尔可夫模型,这是一个值得注意的缺失。
- 什么明显该被引/该存在、却没出现在 intro 里?
- 半马尔可夫模型 (Semi-Markov Model):如上所述,这是最明显的缺失。半马尔可夫模型(也称为隐半马尔可夫模型,HSMM)是处理序列持续时间建模的标准工具。作者回避它,可能是因为HSMM通常与隐藏状态结合(HSMM),而作者想要一个完全基于观测状态的模型。但纯观测状态的半马尔可夫模型(也称为“显式持续时间马尔可夫链”)是存在的,且与paired-MC高度相关。
- 生存分析中的“停留时间”建模:活动持续时间本质上是一个“停留时间”(sojourn time)问题,这在生存分析中有大量成熟的方法(如Cox比例风险模型、加速失效时间模型)。作者没有引用任何生存分析文献,这可能是一个被忽略的、更强大的工具集。
张力¶
未见明显对立引用。所有被引工作基本是互补的,各自解决序列建模的不同方面。主要的张力在于“可解释性 vs. 逼真性”这一经典权衡,作者通过提出paired-MC试图打破这一权衡。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( S_t \in \{1, 2, \dots, K\} \):在时间点 \( t \) 的观测状态(如活动类型)。\( K \) 是类别总数。
- \( T \):序列的总长度(如总时间步数)。
- \( N \):个体总数(如果有多个个体)。
- \( \mathbf{S} = (S_1, S_2, \dots, S_T) \):一个完整的观测序列。
- \( P(S_t = j | S_{t-1} = i) \):一阶马尔可夫链的转移概率,从状态 \( i \) 转移到状态 \( j \)。
- \( D_i \):状态 \( i \) 的持续时间(停留时间),是一个随机变量。
- \( P(D_i = d) \):状态 \( i \) 的持续时间分布,即一个状态连续出现 \( d \) 个时间步的概率。
- 参数/estimand:paired-MC要估计的参数是配对转移概率和持续时间分布。具体来说,它不估计 \( P(S_t | S_{t-1}) \),而是估计 \( P(S_t | S_{t-1}, S_{t-2}) \) 的某种简化形式(见下文)。
- 潜在量:无。这是一个纯观测数据的生成模型,没有反事实或潜在变量。
-
模型:
- 数据生成机制:作者提出的
paired-MC模型假设序列的生成过程由两个耦合的机制驱动:- 配对转移:下一个状态 \( S_t \) 的分布不仅依赖于前一个状态 \( S_{t-1} \),还依赖于前一个状态与再前一个状态的关系,即“配对” \( (S_{t-2}, S_{t-1}) \)。作者将其简化为一个二阶马尔可夫链,但通过一个巧妙的参数化来避免状态空间爆炸。
- 显式持续时间:模型不直接通过转移概率来隐式地生成持续时间,而是显式地从数据中学习每个状态的持续时间分布 \( P(D_i = d) \)。在生成序列时,模型会先根据持续时间分布决定当前状态要停留多久,然后再根据配对转移概率决定下一个状态是什么。
- 什么当作已知:\( K \)(类别数)是已知的。序列长度 \( T \) 是给定的。
- 什么是要估的对象:配对转移概率矩阵(大小为 \( K^2 \times K \))和每个状态的持续时间分布(一个长度为 \( T \) 的向量,或一个参数化分布)。
- 数据生成机制:作者提出的
-
可观测数据:
- 研究者实际能观测到的是什么:一个或多个完整的分类序列 \( \mathbf{S} \)。例如,一个用户一周内每10分钟的活动类型记录,共 \( T = 7 \times 24 \times 6 = 1008 \) 个时间点,每个点取值为 \( \{1, 2, \dots, K\} \) 中的一个。
- 哪些是潜在/不可观测:无。所有数据都是直接观测的。模型假设序列的生成过程完全由观测到的状态决定,没有隐藏状态。
第二步:讲最小内核¶
最简特例:假设只有 \( K=2 \) 个状态:{0: “工作”, 1: “休息”}。我们想合成一个长度为 \( T \) 的序列。
传统一阶MC的做法: 1. 从数据中估计一个 \( 2 \times 2 \) 的转移矩阵 \( P \),其中 \( P_{01} \) 是从“工作”转到“休息”的概率,\( P_{10} \) 是从“休息”转到“工作”的概率。 2. 生成序列:从初始状态开始,每一步根据当前状态和转移矩阵 \( P \) 随机选择下一个状态。 3. 问题:在这个模型下,连续“工作” \( d \) 个时间步的概率是 \( (1 - P_{01})^{d-1} \times P_{01} \),这是一个几何分布。如果真实数据中“工作”的持续时间分布是“通常持续2-4小时,很少超过6小时”,几何分布无法捕捉这种模式(它倾向于产生很多短持续时间和少量极长持续时间)。
paired-MC的做法(最小内核): 1. 估计持续时间分布:从真实数据中,统计所有“工作”片段的持续时间。例如,你发现“工作”持续1个时间步的概率是5%,2个是20%,3个是30%,4个是25%,5个是15%,6个及以上是5%。这就是 \( P(D_{工作} = d) \)。同样地,估计 \( P(D_{休息} = d) \)。 2. 估计配对转移概率:这里的关键是“配对”。我们不直接看 \( S_{t-1} \rightarrow S_t \),而是看 \( (S_{t-2}, S_{t-1}) \rightarrow S_t \)。但在 \( K=2 \) 的情况下,这会产生 \( 2^2 = 4 \) 种配对,每种配对对应一个转移到“工作”或“休息”的概率。例如: * 从配对 (工作, 休息) 转移到 工作 的概率很高(因为休息后通常要工作)。 * 从配对 (休息, 工作) 转移到 休息 的概率很低(因为刚工作完,不太可能马上休息)。 * 从配对 (工作, 工作) 转移到 工作 的概率是0(因为如果当前是工作,且上一个也是工作,说明我们正处于一个“工作”的持续期中,此时应该由持续时间分布决定何时结束,而不是由转移概率决定)。 * 从配对 (休息, 休息) 转移到 休息 的概率是0(同理)。 3. 生成序列: * 步骤1:从初始状态 \( S_1 \) 开始(例如“工作”)。 * 步骤2:从 \( P(D_{工作} = d) \) 中抽取一个持续时间 \( d \)。这意味着接下来的 \( d \) 个时间步(\( S_1 \) 到 \( S_d \))都是“工作”。 * 步骤3:在 \( S_d \)(“工作”)之后,我们需要决定下一个状态 \( S_{d+1} \)。此时,我们看配对 \( (S_{d-1}, S_d) = (工作, 工作) \)。根据配对转移概率,从 (工作, 工作) 转移到 工作 的概率是0,所以 \( S_{d+1} \) 必定是“休息”。 * 步骤4:现在状态变为“休息”。从 \( P(D_{休息} = d) \) 中抽取一个持续时间 \( d' \)。接下来的 \( d' \) 个时间步都是“休息”。 * 步骤5:重复步骤3和4,直到序列长度达到 \( T \)。
这个最小内核说明了什么: * 核心思路:paired-MC将“何时切换状态”(由持续时间分布决定)和“切换到哪个状态”(由配对转移概率决定)解耦。 * 为什么能解决传统MC的问题:通过显式地使用从数据中学习的持续时间分布,paired-MC可以生成与真实数据任意形状的持续时间分布相匹配的序列,而不再受限于几何分布。 * 为什么叫“配对”:在决定“切换到哪个状态”时,它依赖于前两个状态的配对。这个设计的巧妙之处在于,当序列处于一个状态的持续期内时(如 (工作, 工作)),配对转移概率强制状态保持不变(概率为0),从而将控制权完全交给持续时间分布。只有当状态发生切换时(如 (工作, 休息)),配对转移概率才真正发挥作用,决定下一个状态是什么。这避免了传统二阶MC中状态空间爆炸的问题,因为大多数配对(如 (工作, 工作), (休息, 休息))的转移概率是退化的(确定性为0或1)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:如何合成多天连续的分类序列(如人类活动模式),使其在保留关键统计特征(如活动持续时间分布、转移模式)的同时,提供一个直观的机制来修改合成序列的特征。
- 核心工具/方法:提出了
paired Markov Chain (paired-MC)框架。该框架通过显式建模状态的持续时间分布和一个基于“配对”(前两个状态)的转移概率模型来生成序列。 - 主要结论:在两个真实数据集(智能手机应用记录的人类活动时间使用模式、可穿戴加速度计测量的体力活动强度)上,paired-MC在保留活动持续时间分布、转移模式等关键特征方面,优于传统一阶马尔可夫链和隐马尔可夫模型。
关键设定与假设¶
- 设定:数据是多天连续的、离散时间的分类序列。每个时间点记录一个活动类别。序列可以来自多个个体。
- 假设:
- 序列是分段平稳的:模型假设每个状态的持续时间分布和配对转移概率在整个序列中是恒定的。这是一个很强的假设,对于跨越多天、可能受昼夜节律影响的活动模式来说可能不成立。作者通过按时间段(如工作日/周末)分别建模来部分缓解这个问题。
- 配对转移的马尔可夫性:下一个状态 \( S_t \) 的分布只依赖于前两个状态 \( (S_{t-2}, S_{t-1}) \),而与更早的历史无关。这是一个二阶马尔可夫假设。作者通过引入“配对”的概念,并让处于同一状态持续期内的配对转移概率退化为0,使得这个二阶假设在实践中的影响被限制在状态切换的时刻。
- 持续时间独立性:模型假设每个状态的持续时间 \( D_i \) 是独立同分布的,且与序列的历史(除了当前状态)无关。这意味着,一个“工作”片段的持续时间分布,不会因为它之前是“休息”还是“通勤”而改变。
- 无个体异质性:模型假设所有个体共享相同的持续时间分布和配对转移概率。这是一个很强的简化。作者在讨论中承认了这一点,并指出未来工作可以考虑引入个体层面的随机效应。
- 相比已有文献的放宽或强化:
- 相比一阶MC:放宽了“持续时间服从几何分布”的限制,允许任意形状的持续时间分布。
- 相比高阶MC:强化了模型结构(通过配对和持续时间解耦),避免了状态空间爆炸,使得模型在 \( K \) 较大时仍然可行。
- 相比HMM:强化了可解释性和可参数化性,因为所有参数(持续时间分布、配对转移概率)都直接对应可观测的序列特征。
主要结果¶
本文是应用/方法型,没有理论定理。核心量化结论来自两个真实数据实验:
-
数据集1:人类活动时间使用模式 (ATUS-like data)
- 数据:来自一个智能手机应用,记录了用户每天的活动类型(如睡眠、工作、通勤、休闲、家务等,共 \( K=10 \) 类),每10分钟一个记录,持续多天。
- 评估指标:比较合成序列与真实序列在以下方面的分布:
- 活动持续时间分布:每个活动类别持续时间的概率分布。
- 转移模式:从一个活动到另一个活动的转移概率矩阵。
- 一天内的时间分布:每个活动在一天24小时中出现的概率分布。
- 结果:
- paired-MC vs. 一阶MC:paired-MC在所有活动类别的持续时间分布上都显著优于一阶MC。一阶MC生成的持续时间分布呈几何分布,与真实数据的分布(通常有峰值、长尾)严重不符。paired-MC则能很好地匹配真实分布。
- paired-MC vs. HMM:paired-MC在保留持续时间分布方面也优于HMM。HMM虽然能捕捉一些长程依赖,但其生成的持续时间分布仍然不如paired-MC准确。在转移模式和一天内的时间分布上,paired-MC与HMM表现相当或略优。
- 参数化修改示例:作者展示了如何通过简单地修改持续时间分布来改变合成序列的特征。例如,将“睡眠”的持续时间分布向右平移(增加平均睡眠时间),合成序列中“睡眠”的总时间就会相应增加,而其他活动的模式基本保持不变。这验证了paired-MC的“可参数化性”。
-
数据集2:体力活动强度 (NHANES accelerometer data)
- 数据:来自国家健康与营养调查(NHANES)的加速度计数据,记录了参与者一周内每分钟的体力活动强度,分为三类:久坐、轻度活动、中高强度活动(\( K=3 \))。
- 评估指标:同上。
- 结果:
- paired-MC vs. 一阶MC:结论与数据集1一致,paired-MC在捕捉活动持续时间分布方面有压倒性优势。
- paired-MC vs. HMM:paired-MC在保留“中高强度活动”的持续时间分布上表现更好,而HMM倾向于生成更短、更频繁的中高强度活动片段。在久坐和轻度活动的持续时间分布上,两者表现接近。
- 结论:paired-MC在更简单的三分类序列上同样有效,验证了其通用性。
证明路线与技术技巧¶
本文是应用型,没有数学证明。其“技术技巧”主要体现在方法设计上:
-
整体路线(方法设计):
- 数据预处理:将原始序列转换为“片段”(episode)列表。每个片段包含:起始时间、状态、持续时间。
- 参数估计:
- 从片段列表中,为每个状态 \( i \) 估计其持续时间分布 \( \hat{P}(D_i = d) \)。可以使用经验分布(直方图)或拟合一个参数化分布(如对数正态分布)。
- 从片段列表中,识别所有“状态切换”的时刻。对于每个切换,记录切换前的配对 \( (S_{t-2}, S_{t-1}) \) 和切换后的状态 \( S_t \)。注意,当 \( S_{t-2} = S_{t-1} \) 时,这个配对是无效的(因为它发生在持续期内),会被忽略。然后,从这些有效的切换记录中,估计配对转移概率 \( \hat{P}(S_t | S_{t-2}, S_{t-1}) \)。
- 序列生成:
- 初始化:随机选择一个初始状态 \( S_1 \) 和初始持续时间 \( d_1 \)。
- 循环:对于当前状态 \( i \),从 \( \hat{P}(D_i = d) \) 中抽取一个持续时间 \( d \),生成 \( d \) 个时间步的状态 \( i \)。然后,根据配对 \( (S_{t-1}, S_t) \) 和 \( \hat{P}(S_{t+1} | S_{t-1}, S_t) \) 抽取下一个状态 \( j \)。重复此过程。
-
关键跳跃点:方法设计上的关键跳跃点在于将“状态切换”和“状态持续”视为两个独立的过程。这个想法本身并不复杂,但作者将其与“配对”机制结合,创造了一个既简单又有效的框架。这个跳跃点解决了传统MC的“几何分布困境”。
-
技术技巧点名:
- 经验分布 vs. 参数化分布:作者在估计持续时间分布时,既可以使用非参数的经验分布(灵活性高),也可以使用参数化分布(如对数正态,可参数化性更强)。这是一个实用的权衡。
- 配对转移的“退化”设计:将配对 \( (i, i) \) 的转移概率设为 \( P(S_{t+1}=i | S_{t-1}=i, S_t=i) = 0 \),这是一个关键的“技巧”。它确保了在状态持续期内,模型不会通过转移概率提前结束该状态,从而将控制权完全交给持续时间分布。这使得模型在数学上非常干净。
- 数据预处理为片段:将原始序列转换为片段列表,是简化后续参数估计的关键步骤。这使得估计持续时间分布和配对转移概率变得非常直接。
真实例子与应用¶
(已在“主要结果”中详细描述,此处总结) * 数据/场景:两个真实数据集:1) 智能手机应用记录的10类人类活动时间使用模式;2) NHANES加速度计记录的3类体力活动强度。 * 如何应用:将原始序列预处理为片段,估计每个状态的持续时间分布和配对转移概率,然后用估计出的参数生成合成序列。 * 得到什么结果:paired-MC在保留活动持续时间分布方面显著优于一阶MC和HMM。在转移模式和一天内的时间分布上,与HMM表现相当或略优。 * 例子想说明什么:1) 验证了paired-MC在复杂(10类)和简单(3类)序列上都能生成逼真的数据。2) 展示了paired-MC的“可参数化性”——通过修改持续时间分布可以直观地控制合成序列的特征。
🔎 结论是否比证明窄¶
本文为纯应用/方法型,没有理论证明。其结论完全基于两个数据集上的实证比较。因此,结论的泛化性是有限的。作者声称paired-MC“优于”一阶MC和HMM,但这个结论严格局限于: * 这两个特定的数据集。 * 使用的评估指标(持续时间分布、转移模式、时间分布)。 * 比较的HMM和MC的具体实现方式(作者没有详细说明HMM的配置,如隐藏状态数量)。
作者没有提供任何理论保证(如一致性、收敛速度),也没有在更广泛的模拟场景下测试方法的稳健性。因此,结论的“宽度”可能比作者声称的要窄。例如,对于具有周期性模式(如每周7天的周期)的序列,paired-MC的表现如何?作者没有讨论。
四、开放问题(点到为止,扎根具体语句)¶
-
如何引入个体异质性? 作者在讨论中承认:“Our model assumes that all individuals share the same transition and duration parameters. An extension could incorporate random effects to account for between-subject variability.”(原文讨论部分)。这是一个明确的开放问题:如何将paired-MC扩展为混合效应模型或分层模型,以允许不同个体有不同的活动模式?
-
如何扩展到非平稳序列? 作者通过按时间段(工作日/周末)分别建模来部分处理非平稳性,但这是一种粗糙的处理方式。一个更根本的问题是:如何将paired-MC与一个能捕捉昼夜节律或周周期的时变模型结合?例如,让持续时间分布或配对转移概率成为一天中时间(time-of-day)的函数。
-
如何与半马尔可夫模型进行严格的比较? 如前所述,作者在引言中完全回避了半马尔可夫模型(Semi-Markov Model)。一个重要的开放问题是:paired-MC与一个显式建模状态持续时间的观测状态半马尔可夫模型相比,在统计性能(逼真性)和计算效率上究竟孰优孰劣?这是一个值得研究者去查的、被作者刻意忽略的竞争路线。
-
如何提供理论保证? 本文完全缺乏理论分析。一个开放问题是:能否为paired-MC的估计量(持续时间分布、配对转移概率)建立一致性或收敛速度?例如,在什么条件下,基于经验分布的估计量是 \( \sqrt{n} \)-一致的?这需要用到U-统计量或经验过程理论,与研究者“very_familiar”的武器库(非参数统计、高维渐近)有直接联系。
Maintained by 陈星宇 · Homepage · Source on GitHub