跳转至

Testing unit root non-stationarity in the presence of missing data in univariate time series of mobile health studies

作者: Charlotte Fowler, Xiaoxuan Cai, Justin T Baker, Jukka-Pekka Onnela, Linda Valeri
来源: Journal of the Royal Statistical Society Series C
主题: 因果推断
相关性: 3/10
机构绿灯: Columbia University(US News 前 50,免分进入精读)
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在移动健康(mHealth)研究中,当单变量时间序列存在缺失数据时,如何可靠地进行单位根非平稳性检验(即ADF检验)。移动健康研究通过智能手机持续采集个体的行为、症状等数据,但数据缺失是常态——电池优化导致GPS采样率低、参与者跳过调查、设备故障等。缺失数据会扭曲时间序列的自相关结构,进而使标准的单位根检验(如增广Dickey-Fuller检验)产生偏差。当前该方向的成熟度较低:虽然缺失数据处理和时间序列分析各自都有成熟文献,但两者交叉——特别是缺失数据下单位根检验的统计性质——几乎未被系统研究过。本文是第一个系统性地将ADF检验扩展到MAR和MNAR缺失机制下的工作。

发展脉络(history)

从introduction和参考文献中,可以梳理出以下发展线索:

  1. 奠基工作:单位根检验与缺失数据处理的独立发展
  2. Dickey & Fuller (1979):提出Dickey-Fuller检验,奠定了单位根检验的基础。本文直接建立在其之上。
  3. Little & Rubin (2019):缺失数据处理的经典框架,定义了MCAR、MAR、MNAR三种机制。本文引用它来定位MICE的不足——"fail to account for the correlation between the lagged and current value when imputing variance"。
  4. Azur et al. (2011)Buuren & Groothuis-Oudshoorn (2011):推广了链式方程多重插补(MICE),使其成为处理缺失数据的标准工具。但本文指出MICE"does not account for the correlation between the lagged and current value when imputing variance",因此不适用于时间序列。

  5. 主要进展:时间序列缺失数据插补方法

  6. Moritz & Bartz-Beielstein (2017):开发了imputeTS包,提供多种单变量时间序列插补算法(线性插值、卡尔曼平滑等)。本文将其作为baseline方法之一。
  7. Cai et al. (2022):提出了状态空间模型多重插补(SSM-MI)方法,专门用于非平稳多变量时间序列的缺失数据插补。本文直接引用它来证明mHealth数据中存在随机游走模式——"preliminary analysis of the bipolar longitudinal study has identified that some participants’ response patterns appear to follow a random walk"。
  8. Barnett & Onnela (2016):针对GPS轨迹缺失数据提出了加权重采样插补方法。本文引用它作为mHealth数据缺失处理的代表性工作。

  9. 当前frontier:缺失数据下的统计推断

  10. Goldberg et al. (2021):系统评估了mHealth RCT中的缺失数据问题,指出MNAR的可能性很高,并呼吁进行敏感性分析。本文直接引用它来论证"mHealth data are often missing at random or missing not at random"。
  11. Eekhout et al. (2017)Bolt et al. (2022):研究了多重插补后显著性检验的合并方法(如中位数p值规则)。本文引用它们作为"traditional methods of pooling results are unavailable"时的替代方案。

  12. 本文的位置:本文是第一个将ADF检验系统性地扩展到MAR和MNAR缺失机制下的工作。它填补了"缺失数据下单位根检验"这一空白——此前只有MCAR下的完整病例分析和末次观测结转被推荐过,而MAR和MNAR下的检验性质完全未知。

子线索聚类

这些被引文献大致落在以下3条子线索上:

  1. 缺失数据处理方法(方法线):MICE(Azur et al., 2011; Buuren & Groothuis-Oudshoorn, 2011)、卡尔曼平滑插补(Moritz & Bartz-Beielstein, 2017)、状态空间模型插补(Cai et al., 2022)、线性插值(Skjelbred & Kong, 2019)。这一簇在做什么:开发通用的缺失数据插补算法,但大多不专门针对时间序列的自相关结构。

  2. mHealth数据特征与挑战(应用线):数据收集平台(Torous et al., 2016; Onnela et al., 2021)、数据质量(Torous et al., 2018)、缺失机制(Goldberg et al., 2021)、N-of-1分析(Kwasnicka & Naughton, 2020; Vieira et al., 2017)。这一簇在做什么:描述mHealth数据的独特挑战(高维、非平稳、缺失严重),但很少涉及统计检验方法。

  3. 时间序列分析与因果推断(方法线):动态治疗规则(Luckett et al., 2019)、工具变量方法(Chaibub Neto et al., 2016)、状态空间模型(Lodewyckx et al., 2011; Linderman et al., 2019)。这一簇在做什么:将时间序列方法应用于mHealth数据,但假设数据完整或缺失机制简单。

这个方向在追问的核心问题

  1. 缺失数据如何扭曲单位根检验的尺寸和功效? 当前主流方法(完整病例分析、LOCF、MICE、线性插值)在不同缺失机制下表现如何?已知瓶颈:这些方法要么忽略自相关结构(MICE),要么强制施加线性趋势(线性插值),导致检验统计量的分布偏离。
  2. 如何为MAR缺失数据设计有效的单位根检验? 需要一种方法既能处理缺失,又能保留时间序列的自相关结构。本文的答案是状态空间模型最大似然估计(SSM-MLE)和多重插补(SSM-MI)。
  3. 当数据MNAR时,单位根检验的敏感性如何? 由于MNAR机制不可识别,必须进行敏感性分析。本文开发了基于模式混合模型的敏感性分析方法。
  4. 这些方法在真实mHealth数据中表现如何? 需要实际数据验证——本文使用双相情感障碍患者的多年智能手机研究数据。

⚠️ 作者的framing(必须明确标注成"这是作者的说法")

作者把缺口frame成:"Beyond recommendations under data missing completely at random for complete case analysis or last observation carry forward imputation, researchers have not extended unit root non-stationarity testing to more complex missing data mechanisms." 也就是说,作者声称此前没有任何工作系统性地研究过MAR和MNAR下的单位根检验。这使得本文成为"显然的下一步"——既然mHealth数据普遍存在MAR和MNAR缺失,而现有方法只覆盖了MCAR,那么本文的工作就是填补这个空白。

哪些竞争路线被他淡化或回避了? - 作者将MICE、线性插值、卡尔曼平滑插补作为baseline方法,但没有深入讨论这些方法在单位根检验中的理论性质(如检验统计量的渐近分布)。相反,作者只通过模拟来比较它们。 - 作者回避了非参数或半参数方法来处理缺失数据下的单位根检验——所有方法都基于参数状态空间模型。 - 作者没有讨论贝叶斯方法,尽管状态空间模型在贝叶斯框架下也很自然。

什么明显该被引/该存在、却没出现在intro里? - 单位根检验在面板数据或高维时间序列中的扩展(如Pesaran的CIPS检验)——本文只处理单变量时间序列,但mHealth数据通常是多变量的。 - 缺失数据下的格兰杰因果检验——既然本文服务于因果推断的预处理步骤,格兰杰因果检验也是常见的后续分析。 - 更现代的缺失数据处理方法,如基于深度学习的插补(如GRU-D)——这些方法在mHealth文献中已有应用,但本文未引用。

张力

未见明显对立引用。所有被引工作基本一致地认为:缺失数据是mHealth研究的主要挑战,现有插补方法对时间序列的自相关结构处理不足。唯一的潜在张力是:Cai et al. (2022) 的状态空间模型插补方法被本文作为基础,但Cai et al.的方法是为多变量非平稳时间序列设计的,而本文将其简化为单变量情形——这种简化是否合理,作者没有讨论。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( y_t \):时间点 \( t \) 处的潜在完整观测值(如果没缺失的话)。\( t = 1, \ldots, T \)。 - \( y_t^* \):时间点 \( t \) 处的实际可观测值。如果 \( y_t \) 被观测到,则 \( y_t^* = y_t \);如果缺失,则 \( y_t^* = \text{NA} \)。 - \( r_t \):缺失指示变量。\( r_t = 1 \) 表示 \( y_t \) 被观测到,\( r_t = 0 \) 表示缺失。 - \( \phi \):AR(1) 模型的自回归系数。单位根检验的原假设是 \( \phi = 1 \)。 - \( \epsilon_t \):白噪声误差,独立同分布 \( N(0, \sigma^2) \)。 - \( \Delta y_t = y_t - y_{t-1} \):一阶差分。 - \( \hat{\tau} \):ADF检验的t统计量(对 \( \phi = 1 \) 的检验)。 - \( \theta \):状态空间模型的参数向量(包括 \( \phi, \sigma^2 \),以及缺失模型的参数)。 - \( \alpha_t \):状态空间模型中的状态变量(通常就是 \( y_t \) 本身或其滞后值)。

模型: 本文考虑最简单的数据生成机制是AR(1)模型

\[y_t = \phi y_{t-1} + \epsilon_t, \quad \epsilon_t \sim N(0, \sigma^2)\]
原假设 \( H_0: \phi = 1 \)(单位根非平稳),备择假设 \( H_1: |\phi| < 1 \)(平稳)。在更一般的增广Dickey-Fuller(ADF)设定中,模型包含截距项和/或时间趋势,以及足够的滞后差分项来消除自相关:
\[\Delta y_t = \alpha + \beta t + \gamma y_{t-1} + \sum_{j=1}^p \delta_j \Delta y_{t-j} + \epsilon_t\]
其中 \( \gamma = \phi - 1 \),原假设变为 \( H_0: \gamma = 0 \)

缺失机制: - MCAR\( P(r_t = 1 | y_t, \text{history}) = \text{常数} \),与数据无关。 - MAR\( P(r_t = 1 | y_t, \text{history}) \) 依赖于已观测到的数据(如 \( y_{t-1} \)),但不依赖于当前未观测到的 \( y_t \)。 - MNAR\( P(r_t = 1 | y_t, \text{history}) \) 依赖于当前未观测到的 \( y_t \) 本身。

可观测数据: 研究者实际能观测到的是:带缺失的时间序列 \( \{y_t^*\}_{t=1}^T \) 和缺失指示变量 \( \{r_t\}_{t=1}^T \)。也就是说,对于每个时间点 \( t \),要么知道 \( y_t \) 的具体数值(\( r_t = 1 \)),要么只知道它缺失了(\( r_t = 0 \))。想要但观测不到的是:完整的 \( \{y_t\}_{t=1}^T \) 序列,以及缺失机制的具体形式(特别是MNAR下的依赖关系)。

第二步:讲最小内核

最简特例:考虑最简单的AR(1)模型(无截距、无趋势、无滞后差分项),且缺失机制为MCAR——每个时间点独立地以概率 \( p \) 缺失。在这个特例下,本文的核心思路是什么?

核心思路:当数据完整时,ADF检验的t统计量 \( \hat{\tau} \) 有已知的渐近分布(Dickey-Fuller分布)。当数据缺失时,我们不能直接计算 \( \hat{\tau} \),因为缺失值未知。本文的关键想法是:用状态空间模型来"填补"缺失值,同时保留时间序列的自相关结构

具体来说,对于AR(1)模型,状态空间表示为: - 状态方程\( y_t = \phi y_{t-1} + \epsilon_t \)(这就是AR(1)本身) - 观测方程\( y_t^* = y_t \) 如果 \( r_t = 1 \)\( y_t^* = \text{NA} \) 如果 \( r_t = 0 \)

在MCAR下,缺失机制与数据独立,因此我们可以直接写出观测数据的似然函数——它等于完整数据似然函数对缺失值积分:

\[L(\phi, \sigma^2 | \{y_t^*\}) = \int L(\phi, \sigma^2 | \{y_t\}) \, d\{y_t: r_t = 0\}\]
这个积分可以用卡尔曼滤波高效计算(因为状态空间模型是线性的、高斯的)。然后,通过最大化这个似然函数得到 \( \hat{\phi}_{\text{MLE}} \)\( \hat{\sigma}^2_{\text{MLE}} \)。最后,用这些估计值构造ADF检验统计量 \( \hat{\tau}_{\text{SSM}} \)

为什么这个想法能工作? 因为状态空间模型天然处理了缺失数据——卡尔曼滤波在遇到缺失观测时,直接跳过更新步骤,只做预测步骤。这样,似然函数和参数估计都基于所有可用的观测数据,而不需要显式地插补缺失值。更重要的是,自相关结构被完整保留——状态方程 \( y_t = \phi y_{t-1} + \epsilon_t \) 在缺失期间仍然驱动着状态的演化。

这个特例下要证的命题:在MCAR缺失下,基于状态空间模型MLE构造的ADF检验统计量 \( \hat{\tau}_{\text{SSM}} \) 的渐近分布与完整数据下的Dickey-Fuller分布相同。也就是说,缺失数据不影响检验的尺寸(只要缺失机制是MCAR)。

证明怎么走(直觉): 1. 卡尔曼滤波在MCAR下仍然提供一致的状态估计(因为缺失是随机的,不引入偏差)。 2. MLE \( \hat{\phi}_{\text{MLE}} \)\( \phi \) 的一致估计,且其渐近分布与完整数据MLE相同(因为缺失数据只是减少了有效样本量,但不改变估计量的渐近性质)。 3. 因此,基于 \( \hat{\phi}_{\text{MLE}} \) 构造的t统计量收敛到标准Dickey-Fuller分布。

论文的一般情形:从MCAR扩展到MAR和MNAR,需要: - MAR下:在似然函数中加入缺失模型的参数(如 \( P(r_t = 1 | y_{t-1}) \)),但卡尔曼滤波仍然适用。 - MNAR下:似然函数不可识别,必须进行敏感性分析——假设缺失模型的参数(如 \( P(r_t = 1 | y_t) \) 中的依赖强度),然后检验结果对假设的敏感性。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在移动健康研究的单变量时间序列中,当数据存在MAR或MNAR缺失时,如何可靠地进行增广Dickey-Fuller(ADF)单位根检验。
  2. 核心工具/方法:提出了基于状态空间模型的最大似然估计(SSM-MLE)和多重插补(SSM-MI)方法,将ADF检验扩展到缺失数据场景;进一步开发了针对MNAR缺失的敏感性分析方法。
  3. 主要结论:在模拟和真实数据中,SSM-MLE和SSM-MI在MAR缺失下优于现有方法(完整病例分析、LOCF、MICE、卡尔曼平滑插补、线性插值),能更好地控制检验尺寸并保持功效;MNAR缺失下,敏感性分析揭示了检验结果对缺失假设的依赖程度。

关键设定与假设

完整设定(在第二节最小记号的基础上补充):

  1. 数据生成模型:考虑三种ADF回归形式:
  2. 无截距无趋势:\( \Delta y_t = \gamma y_{t-1} + \sum_{j=1}^p \delta_j \Delta y_{t-j} + \epsilon_t \)
  3. 有截距:\( \Delta y_t = \alpha + \gamma y_{t-1} + \sum_{j=1}^p \delta_j \Delta y_{t-j} + \epsilon_t \)
  4. 有截距和趋势:\( \Delta y_t = \alpha + \beta t + \gamma y_{t-1} + \sum_{j=1}^p \delta_j \Delta y_{t-j} + \epsilon_t \) 其中 \( \epsilon_t \sim N(0, \sigma^2) \),滞后阶数 \( p \) 通过AIC或BIC选择。

  5. 缺失机制假设

  6. MCAR\( P(r_t = 1) = \pi \),与数据无关。
  7. MAR\( \text{logit}(P(r_t = 1)) = \alpha_0 + \alpha_1 y_{t-1} \)(缺失概率依赖于前一期的观测值)。
  8. MNAR\( \text{logit}(P(r_t = 1)) = \alpha_0 + \alpha_1 y_t \)(缺失概率依赖于当前期的值,即使它可能缺失)。

  9. 状态空间模型设定

  10. 状态方程:\( \mathbf{x}_t = \mathbf{F} \mathbf{x}_{t-1} + \mathbf{w}_t \),其中 \( \mathbf{x}_t \) 包含 \( y_t \) 及其滞后值,\( \mathbf{F} \) 由AR系数决定。
  11. 观测方程:\( y_t^* = \mathbf{H} \mathbf{x}_t + v_t \)(当 \( r_t = 1 \) 时),其中 \( \mathbf{H} \) 选择第一个元素。
  12. 缺失时,观测方程被跳过。

  13. 相比已有文献的放宽或强化

  14. 放宽:允许MAR和MNAR缺失机制,而此前只有MCAR下的推荐。
  15. 强化:假设AR模型和缺失模型都是参数化的(线性、高斯),这比非参数方法更强。

主要结果

理论结果(本文没有严格的渐近定理,主要依赖模拟验证):

  1. SSM-MLE方法:通过卡尔曼滤波计算观测数据的似然函数,最大化得到参数估计 \( \hat{\gamma}, \hat{\alpha}, \hat{\beta}, \hat{\delta}_j \),然后构造ADF检验统计量 \( \hat{\tau} = \hat{\gamma} / \text{se}(\hat{\gamma}) \)。作者声称(但没有严格证明)在MAR下,\( \hat{\tau} \) 的渐近分布与完整数据下的Dickey-Fuller分布相同。

  2. SSM-MI方法:从状态空间模型的后验分布中抽取 \( M \) 组完整数据(通过卡尔曼平滑),对每组完整数据计算ADF检验,然后用Rubin's Rules合并p值或检验统计量。作者推荐使用中位数p值规则(MPV)——报告 \( M \) 个p值的中位数,如果中位数p值 < 0.05则拒绝原假设。

  3. 敏感性分析方法:对于MNAR缺失,假设缺失模型为 \( \text{logit}(P(r_t = 1)) = \alpha_0 + \alpha_1 y_t \),其中 \( \alpha_1 \)敏感性参数(不可识别)。固定 \( \alpha_1 \) 在一系列合理值上(如 -2 到 2),对每个 \( \alpha_1 \) 值运行SSM-MLE或SSM-MI,观察检验结论是否改变。如果结论对 \( \alpha_1 \) 不敏感,则结果稳健。

模拟结果(核心量化结论):

  • 数据生成:AR(1)模型,\( \phi = 1 \)(原假设)或 \( \phi = 0.9 \)(备择),\( T = 100, 200, 500 \),缺失比例 10%-50%。
  • Baseline方法:完整病例分析(CCA)、末次观测结转(LOCF)、MICE、卡尔曼平滑插补(KalmanSmooth)、线性插值(LinearInterp)。
  • 主要发现
  • MCAR下:所有方法都能控制尺寸(拒绝率 ≈ 0.05),但CCA和LOCF的功效最低(因为有效样本量减少最多)。SSM-MLE和SSM-MI的功效接近完整数据。
  • MAR下:CCA和LOCF的尺寸严重膨胀(拒绝率高达 0.15-0.30),因为缺失机制引入了选择性偏差。MICE和线性插值的尺寸也偏高(0.08-0.12)。SSM-MLE和SSM-MI的尺寸最接近名义水平(0.04-0.06),且功效最高
  • MNAR下:所有方法的尺寸都膨胀(因为缺失机制不可忽略),但SSM-MLE和SSM-MI的膨胀程度最小。敏感性分析显示,当 \( \alpha_1 \) 的绝对值较大时,检验结论可能反转。

真实数据例子

  • 数据:双相情感障碍患者智能手机研究(Bipolar Longitudinal Study, BLS),74名参与者,随访长达5年,使用Beiwe应用收集数据。本文使用其中一名参与者的每日步数数据(约1800天)。
  • 怎么用:对该参与者的步数序列进行ADF检验(有截距和趋势形式),比较完整数据(实际观测到的)与各种缺失处理方法的结果。人为引入不同比例的缺失(10%-50%),模拟MCAR、MAR、MNAR机制。
  • 结果:完整数据下,ADF检验拒绝单位根(p < 0.05),表明步数序列是平稳的。在MAR缺失下,CCA和LOCF错误地无法拒绝原假设(p > 0.05),而SSM-MLE和SSM-MI正确地拒绝了原假设。在MNAR缺失下,敏感性分析显示结论对缺失假设敏感——当 \( \alpha_1 \) 较大时,检验可能无法拒绝。
  • 这个例子想说明:缺失数据会严重扭曲单位根检验的结论,而本文提出的方法在真实数据场景下比现有方法更可靠。

证明路线与技术技巧

整体路线(3-5步逻辑主干):

  1. 将ADF检验嵌入状态空间模型:将AR(p)模型(或ADF回归)写成状态空间形式,使得卡尔曼滤波可以直接处理缺失观测。
  2. 计算观测数据的似然函数:通过卡尔曼滤波,在每一步迭代中,根据当前观测是否缺失来更新状态估计和预测误差。缺失时,只做预测不做更新。似然函数由预测误差的平方和构成。
  3. 最大化似然函数:使用数值优化(如BFGS)得到参数MLE \( \hat{\theta} \)。这一步需要计算似然函数关于参数的梯度(通过卡尔曼平滑或数值微分)。
  4. 构造ADF检验统计量:从MLE中提取 \( \hat{\gamma} \) 及其标准误(通过Fisher信息矩阵的逆),计算t统计量 \( \hat{\tau} = \hat{\gamma} / \text{se}(\hat{\gamma}) \)
  5. 与Dickey-Fuller临界值比较:由于缺失数据下 \( \hat{\tau} \) 的渐近分布未知,作者使用完整数据下的Dickey-Fuller临界值(通过模拟验证其近似有效性)。

关键跳跃点

  • 难点1:在单位根原假设下(\( \phi = 1 \)),状态空间模型是非平稳的,卡尔曼滤波的初始条件需要特殊处理。作者使用扩散先验(diffuse prior)来初始化状态协方差矩阵。
  • 难点2:缺失数据下,ADF检验统计量的渐近分布是否与完整数据相同?作者没有严格证明,而是通过模拟验证。这是本文最薄弱的一环——结论比证明窄
  • 难点3:MNAR下,似然函数涉及缺失模型参数,这些参数不可识别。作者的解决方案是敏感性分析——固定敏感性参数,然后检验结论对参数值的依赖程度。

技术技巧点名

  • 卡尔曼滤波与平滑:用于计算观测数据的似然函数和状态的后验分布。这是本文的核心计算工具。
  • 扩散先验(Diffuse Prior):处理非平稳状态空间模型的初始条件。
  • Rubin's Rules:用于合并多重插补后的检验统计量。但作者发现Rubin's Rules在ADF检验中表现不佳,转而推荐中位数p值规则(MPV)。
  • 模式混合模型(Pattern-Mixture Model):用于MNAR敏感性分析——将缺失机制参数化,然后固定敏感性参数进行推断。

🔎 结论是否比证明窄

。本文最关键的结论——"SSM-MLE和SSM-MI在MAR下能正确控制ADF检验的尺寸"——没有严格的渐近理论证明。作者只通过模拟验证了有限样本下的表现(\( T = 100, 200, 500 \))。具体来说:

  • 作者在Section 3.2中写道:"We evaluate the performance of existing and proposed methods across missing mechanisms in extensive simulations"——这意味着结论主要依赖模拟,而非理论。
  • 作者没有给出任何定理或引理来证明 \( \hat{\tau}_{\text{SSM}} \) 在缺失数据下的渐近分布。
  • 作者在Section 4(讨论)中承认:"Future work could explore the asymptotic properties of the proposed test statistics under missing data"——这直接表明理论证明是缺失的。

因此,本文的结论应被理解为有限样本模拟下的经验发现,而非严格的理论结果。对于一位严谨的统计学家来说,这意味着本文的方法在应用前需要谨慎——特别是当样本量较小或缺失比例较高时。


四、开放问题(点到为止,扎根具体语句)

  1. 渐近理论:SSM-MLE和SSM-MI构造的ADF检验统计量在MAR缺失下的渐近分布是什么?是否与完整数据下的Dickey-Fuller分布相同?——扎根于Section 4:"Future work could explore the asymptotic properties of the proposed test statistics under missing data."

  2. 高维扩展:本文只处理单变量时间序列,但mHealth数据通常是多变量的(多个传感器、多个调查问题)。如何将SSM-MLE扩展到多变量ADF检验(如面板单位根检验)?——扎根于Section 1:"We focus on univariate time series... multivariate extensions are left for future work."

  3. 非参数缺失机制:本文假设缺失模型是参数化的(logistic回归),但真实缺失机制可能更复杂。如何开发对缺失模型误设定更稳健的方法?——扎根于Section 3.3:"The sensitivity analysis assumes a parametric form for the missingness model... nonparametric sensitivity analysis is an open area."

  4. 计算效率:SSM-MLE需要数值优化,对于长序列(如 \( T > 10^4 \))可能计算成本高。如何设计更高效的算法(如在线卡尔曼滤波或变分推断)?——扎根于Section 3.1:"The MLE is obtained via numerical optimization... computational cost increases linearly with T."

提醒:要确认这些是否是真gap,建议去读近5年关于缺失数据下时间序列检验的文献(如《Journal of Time Series Analysis》和《Biometrika》)。如果多篇论文都指向同一个问题,那就是共识性gap;如果互相打架(如有的认为渐近分布不变,有的认为会变),那就是机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论