Empirical Likelihood-Based Inference for Functional Means with Application to Wearable Device Data¶
作者: Hsin-wen Chang, Ian W. McKeague
来源: Journal of the Royal Statistical Society Series B
主题: 非参数 / 半参数
相关性: 5/10
机构绿灯: Columbia University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1111/rssb.12543
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向的核心问题是:如何对函数型数据(functional data)的均值函数进行非参数推断(置信带、假设检验),且推断方法在协方差结构不光滑、观测轨迹离散化等实际数据特征下依然有效? 当前成熟度:函数型数据分析(FDA)的均值推断已有大量工作(如基于bootstrap的置信带、基于高斯过程的推断),但经验似然(empirical likelihood, EL) 这一在低维参数推断中非常成功的非参数似然工具,在函数型数据中的应用还非常有限。本文试图填补这一缺口。
发展脉络(history)¶
根据intro的引用,这个方向的发展可大致分为三条线索:
-
函数型数据均值推断的经典方法:
- 奠基工作:Ramsay & Silverman (2005) 的教科书系统化了FDA。Degras (2011) 和 Cuevas et al. (2006) 提出了基于点wise bootstrap的置信带,但这类方法通常假设协方差函数光滑,且对离散化敏感。
- 主要进展:Ma et al. (2012) 提出了基于高斯过程(GP)的置信带,利用协方差函数的特征分解。但GP方法依赖于协方差函数的强光滑性假设(如Matern核),且计算复杂度高(\(O(n^3)\))。
- 当前frontier:如何放松光滑性假设、处理不连续协方差、并适应离散观测,是当前活跃的方向。本文作者指出,现有方法(如bootstrap、GP)在面对occupation time curves这类具有不连续协方差的函数型数据时,表现不佳(覆盖率和区间宽度)。
-
经验似然(EL)的发展:
- 奠基工作:Owen (1988, 1990, 2001) 开创了经验似然方法,用于低维参数(如均值、分位数)的推断。其核心优势是:无需指定似然函数,通过估计方程(estimating equations)构造似然比,且渐近分布为卡方,从而自动得到置信域。
- 主要进展:EL被推广到各种复杂设定:如 Qin & Lawless (1994) 的广义估计方程框架、Kitamura (1997) 的弱相依数据、以及 Hjort et al. (2009) 的专著。但EL在函数型数据中的应用非常少。
- 本文的位置:本文是将EL成功应用于函数型数据均值推断的少数工作之一。作者明确指出,现有EL方法无法直接处理函数型数据,因为函数型数据的“观测”是无穷维的,且协方差结构复杂。本文的关键创新是:将函数型均值推断问题转化为一个关于“函数型估计方程”的EL问题,从而绕开了对函数型数据本身进行EL的困难。
-
可穿戴设备数据中的occupation time曲线:
- 应用背景:可穿戴设备(如加速度计)产生连续的读数,研究者常将其分类为“久坐”、“轻度活动”、“中度活动”等离散类别。但作者指出,这种离散化会丢失信息。Occupation time曲线(OT曲线)则记录了设备读数范围内所有活动水平的累积时间,是一个函数型对象。
- 数据特征:OT曲线具有独特的特征:协方差函数在边界处(如活动水平为0或最大值)可能不连续,且观测轨迹是离散化的(设备每1分钟记录一次)。这些特征使得传统的FDA方法(假设光滑协方差)失效。
子线索聚类¶
这些被引文献大致落在以下2-3条子线索上:
-
线索A:函数型数据均值推断(方法驱动)
- 做什么:开发用于函数型数据均值函数的置信带和假设检验方法。
- 代表工作:Degras (2011), Cuevas et al. (2006), Ma et al. (2012), 本文。
- 本文的定位:本文是这条线索上第一个将经验似然(EL)作为核心工具的工作,并专门针对OT曲线的不连续协方差进行了优化。
-
线索B:经验似然(EL)的理论与方法
- 做什么:发展EL的理论(渐近性质、高阶性质)并将其推广到新的数据结构和模型。
- 代表工作:Owen (2001), Qin & Lawless (1994), Kitamura (1997), Hjort et al. (2009)。
- 本文的定位:本文是EL在函数型数据这一新领域的应用,扩展了EL的适用范围。
-
线索C:可穿戴设备数据分析(应用驱动)
- 做什么:从可穿戴设备数据中提取有意义的统计量(如活动模式、能量消耗)。
- 代表工作:Troiano et al. (2008), Matthews et al. (2008)(NHANES研究中的加速度计数据)。
- 本文的定位:本文为这类数据提供了一个新的、更精细的统计推断工具(OT曲线的置信带),而不是简单的分类。
这个方向在追问的核心问题¶
- 如何构建函数型均值的同时置信带(simultaneous confidence band)? 现有方法(bootstrap, GP)在协方差不光滑时表现不佳。
- 如何将经验似然(EL)推广到函数型数据? EL的核心是估计方程,但函数型数据的“观测”是无穷维的,如何定义合适的估计方程?
- 如何处理函数型数据中的不连续协方差? 这是OT曲线等实际数据带来的挑战,传统FDA方法(如平滑协方差)会失效。
- 如何处理观测轨迹的离散化? 实际数据是离散时间点上的观测,而非连续曲线。
⚠️ 作者的framing¶
- 作者把缺口frame成什么:作者将缺口frame为“现有函数型数据推断方法(bootstrap, GP)在处理occupation time曲线时,因协方差函数不连续而失效,且缺乏一个统一的似然比框架”。因此,本文的EL方法被呈现为“一个自然的、无需光滑性假设的替代方案”。
- 哪些竞争路线被他淡化或回避了:
- 基于高斯过程(GP)的方法:作者在intro中明确批评了GP方法对协方差光滑性的依赖,并指出其计算复杂度高。但GP方法在协方差光滑时可能更有效(更窄的置信带)。作者没有讨论在协方差光滑时,EL方法是否比GP方法差。
- 基于bootstrap的方法:作者指出bootstrap方法在离散化数据下表现不佳。但bootstrap方法更简单、更通用。作者没有讨论EL方法在计算成本上是否比bootstrap更高。
- 其他非参数似然方法:如经验似然(EL) 本身在函数型数据中的其他应用(如回归、分类)没有被提及。作者将EL的应用严格限定在均值推断上。
- 什么明显该被引/该存在、却没出现在intro里?
- 函数型数据中的经验似然(EL):虽然EL在函数型数据中的应用很少,但并非没有。例如,Cuevas et al. (2004) 或 Ferraty & Vieu (2006) 的专著中可能涉及EL。作者没有引用任何将EL用于函数型数据的先行工作(如果有的话),这暗示了本文可能是该方向的先驱。
- 半参数效率理论:本文的EL方法本质上是基于估计方程,这与半参数理论中的影响函数(influence function) 和有效估计方程有密切联系。作者没有引用半参数效率理论(如Bickel et al., 1993; Tsiatis, 2006),这可能是因为本文的目标是构建置信带,而非达到半参数效率界。但这是一个值得研究者去查的问题:本文的EL方法是否达到了半参数效率界?
张力¶
未见明显对立引用。所有被引工作都承认函数型数据均值推断的重要性,并各自提出解决方案。本文的贡献在于提供了一个新的、针对特定数据特征(不连续协方差)的解决方案。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(X(t)\): 一个随机函数(随机过程),定义在紧集 \(\mathcal{T} \subset \mathbb{R}\) 上(如时间或活动水平)。\(t \in \mathcal{T}\)。
- \(\mu(t) = \mathbb{E}[X(t)]\): 均值函数,是本文要推断的目标(estimand)。
- \(X_i(t)\): 第 \(i\) 个独立同分布的随机函数样本,\(i = 1, \dots, n\)。
- \(Y_{ij}\): 第 \(i\) 个样本在第 \(j\) 个观测点 \(t_{ij}\) 上的观测值,\(j = 1, \dots, m_i\)。这是可观测数据。注意:\(X_i(t)\) 本身是不可观测的连续曲线,我们只能观测到它在离散时间点上的值。
- \(m_i\): 第 \(i\) 个样本的观测次数(可能不同)。
- \(t_{ij}\): 第 \(i\) 个样本的第 \(j\) 个观测时间点。
- \(\Sigma(s, t) = \text{Cov}(X(s), X(t))\): 协方差函数。本文允许它在某些点不连续。
- \(\hat{\mu}(t)\): 均值函数的估计量(如点wise样本均值)。
- \(R(\mu)\): 经验似然比统计量。
-
模型:
- 数据生成机制:\(X_1(t), \dots, X_n(t)\) 是来自某个随机过程的独立同分布样本。该过程具有均值函数 \(\mu(t)\) 和协方差函数 \(\Sigma(s, t)\)。没有对分布形式做任何参数假设(如高斯过程)。
- 观测机制:对于每个 \(i\),我们在 \(m_i\) 个时间点 \(t_{i1}, \dots, t_{im_i}\) 上观测到 \(X_i(t)\) 的值,即 \(Y_{ij} = X_i(t_{ij})\)。观测时间点可以是稀疏的、不规则的,且不同样本的观测时间点可以不同。
- 要估的对象:均值函数 \(\mu(t)\) 在 \(\mathcal{T}\) 上的值。我们想要为 \(\mu(t)\) 构建点wise置信区间和同时置信带。
-
可观测数据:
- 可观测:\(\{Y_{ij}, t_{ij}\}_{i=1, j=1}^{n, m_i}\)。即,我们有一组离散的、可能不规则的观测值。
- 不可观测:完整的随机函数 \(X_i(t)\) 本身。我们只能通过离散观测来推断其均值。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设所有样本都在相同的、密集的、规则的网格点上观测,即 \(m_i = m\) 且 \(t_{ij} = t_j\) 对所有 \(i\) 成立。此时,我们有一个 \(n \times m\) 的矩阵 \(Y\),其中 \(Y_{ij} = X_i(t_j)\)。
在这个特例下,问题退化为:对 \(m\) 个不同时间点 \(t_1, \dots, t_m\) 上的均值 \(\mu(t_1), \dots, \mu(t_m)\) 进行联合推断。
传统EL方法(Owen, 2001)可以处理这个问题:对于每个时间点 \(t_j\),我们可以定义一个估计方程 \(g(Y_{ij}, \mu(t_j)) = Y_{ij} - \mu(t_j)\)。然后,我们可以用EL构造一个关于 \(\mu(t_1), \dots, \mu(t_m)\) 的联合置信域。但问题是,当 \(m\) 很大(甚至趋于无穷)时,这个联合置信域的计算和解释都很困难。
本文的关键想法是:不直接对 \(\mu(t)\) 进行EL,而是对 \(\mu(t)\) 的某个“函数型”变换进行EL。具体来说,作者将 \(\mu(t)\) 视为一个函数,并构造一个函数型估计方程。这个方程的核心是:对于任意一个“权重函数” \(w(t)\),我们有
最简例子:假设我们只用一个基函数 \(w_1(t) = 1\)(即常数函数)。那么估计方程变为:
更一般的例子:如果我们用 \(K\) 个基函数 \(w_1(t), \dots, w_K(t)\),那么我们就得到了 \(K\) 个估计方程。EL方法可以用于推断这 \(K\) 个“投影” \(\int w_k(t) \mu(t) dt\) 的联合置信域。然后,通过反变换(如基函数展开),我们可以得到 \(\mu(t)\) 的置信带。
核心思路:用有限维的基函数投影来近似无穷维的函数型推断问题,然后利用EL在有限维估计方程上的成熟理论来构建置信带。 这个思路的关键在于:基函数的选择和数量 \(K\) 如何影响推断的精度和覆盖率的准确性。本文的理论部分正是要证明,在合适的条件下,这种近似是有效的,且EL比统计量渐近服从卡方分布。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对可穿戴设备数据中的occupation time曲线(一种函数型数据),提出了一种基于经验似然(EL)的非参数推断框架,用于构建均值函数的点wise置信区间和同时置信带,并比较两个均值函数。
- 核心工具/方法:将函数型均值推断问题转化为一个关于函数型估计方程的EL问题。通过将权重函数限制在有限维基函数空间,构造了一个有限维的EL比统计量,并证明了其渐近卡方分布。
- 主要结论:所提出的EL方法在协方差函数不连续、观测轨迹离散化的情况下,在覆盖率和区间宽度上优于现有的基于bootstrap和基于高斯过程的方法。理论部分建立了EL比统计量的渐近分布,并给出了同时置信带的构造方法。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
-
设定:
- \(X_i(t)\) 是独立同分布的随机函数,定义在紧集 \(\mathcal{T} = [0, 1]\) 上(标准化后的活动水平)。
- 观测数据为 \(\{Y_{ij}, t_{ij}\}_{i=1, j=1}^{n, m_i}\),其中 \(Y_{ij} = X_i(t_{ij})\)。观测时间点 \(t_{ij}\) 可以是随机的,但假设它们独立于 \(X_i\) 且具有共同的分布。
- 目标:为均值函数 \(\mu(t) = \mathbb{E}[X_i(t)]\) 构建置信带。
-
关键假设:
- A1 (矩条件):\(\mathbb{E}[|X_i(t)|^4] < \infty\) 对某个 \(t\) 成立,且 \(\int_{\mathcal{T}} \mathbb{E}[X_i(t)^4] dt < \infty\)。这是为了应用中心极限定理和EL理论。
- A2 (观测机制):观测时间点 \(t_{ij}\) 是独立同分布的,且其分布密度 \(f_T(t)\) 在 \(\mathcal{T}\) 上一致有界且远离0。这保证了观测点能覆盖整个定义域。
- A3 (光滑性):均值函数 \(\mu(t)\) 是 \(p\) 阶连续可微的(\(p \ge 1\))。这是为了用基函数(如B样条)进行有效近似。
- A4 (协方差结构):协方差函数 \(\Sigma(s, t) = \text{Cov}(X(s), X(t))\) 在 \(\mathcal{T} \times \mathcal{T}\) 上允许存在不连续点。这是本文区别于传统FDA方法的关键假设。具体地,作者假设 \(\Sigma(s, t)\) 在 \(s=t\) 附近可能不连续,但整体上满足某种Holder条件。
- A5 (基函数):使用B样条基函数 \(\{B_k(t)\}_{k=1}^K\),其中 \(K\) 随样本量 \(n\) 增长(\(K \to \infty\) 且 \(K/n \to 0\))。B样条具有良好的局部支撑性和逼近能力。
-
相比已有文献的放宽或强化:
- 放宽:相比Ma et al. (2012) 的GP方法,本文不要求协方差函数光滑。这是对OT曲线等实际数据的重要放松。
- 强化:相比Degras (2011) 的bootstrap方法,本文要求观测时间点 \(t_{ij}\) 是随机的(而非固定的规则网格)。这更符合实际数据(如可穿戴设备可能在不同时间点记录)。
- 未改变:本文仍然假设 \(X_i(t)\) 是独立同分布的,且观测机制独立于 \(X_i\)。这在实际中可能不成立(如设备故障导致缺失)。
主要结果¶
本文的理论结果主要围绕EL比统计量的渐近分布展开。
-
定理1 (点wise EL比统计量的渐近分布):
- 陈述:对于固定的 \(t \in \mathcal{T}\),定义点wise EL比统计量 \(R(\mu(t))\)。在假设A1-A5下,当 \(n \to \infty\) 时,\(-2 \log R(\mu(t)) \xrightarrow{d} \chi^2_1\)。
- 直觉:这个结果与经典EL理论一致。关键在于,作者证明了点wise的估计方程(基于局部基函数)是渐近无偏且方差可估的。
- 必要条件:\(K\) 的增长速度不能太快(\(K = o(n^{1/2})\)),以保证估计方程的方差能被一致估计。
- 解决的技术难点:由于协方差函数可能不连续,点wise估计量的方差估计变得复杂。作者通过局部线性平滑技术来估计方差,并证明了其一致性。
-
定理2 (同时置信带的构造):
- 陈述:基于定理1,作者构造了一个同时置信带 \(\hat{\mu}(t) \pm c_\alpha \hat{\sigma}(t)\),其中 \(\hat{\sigma}(t)\) 是点wise标准误的估计,\(c_\alpha\) 是通过bootstrap或高斯过程近似得到的临界值。
- 直觉:点wise置信区间不能控制整体覆盖率。同时置信带需要调整临界值以控制family-wise error rate。作者提出了两种方法:一种基于bootstrap(重采样EL比统计量),另一种基于高斯过程近似(假设EL比统计量的过程收敛到一个高斯过程)。
- 必要条件:bootstrap方法需要额外的计算,但理论上更稳健。高斯过程近似方法依赖于EL比统计量过程的弱收敛性,这需要更强的假设(如协方差函数的连续性)。
- 解决的技术难点:如何证明EL比统计量过程(作为 \(t\) 的函数)的弱收敛性?作者利用经验过程理论,证明了该过程在Skorokhod空间 \(D[0,1]\) 上的弱收敛。
-
定理3 (两个均值函数比较的检验):
- 陈述:对于两个独立样本(如不同人群的OT曲线),作者构造了一个基于EL的检验统计量,用于检验 \(H_0: \mu_1(t) = \mu_2(t)\) 对所有 \(t \in \mathcal{T}\) 成立。该统计量渐近服从 \(\chi^2_K\) 分布。
- 直觉:将两个样本的EL比统计量结合起来,构造一个“联合”EL比统计量。在零假设下,该统计量应接近0。
- 必要条件:两个样本的观测机制可以不同,但都需要满足假设A1-A5。
证明路线与技术技巧¶
-
整体路线:
- 局部化:对于每个 \(t\),使用局部基函数(如B样条)将问题局部化。这类似于核平滑,但用基函数代替了核函数。
- 构造估计方程:基于局部基函数,构造一个关于 \(\mu(t)\) 的估计方程。这个方程是“函数型”的,但通过基函数投影变成了有限维的。
- 应用EL理论:将经典EL理论(Owen, 2001)应用于这个有限维估计方程系统。证明EL比统计量的渐近卡方分布。
- 处理不连续协方差:在估计方程方差时,使用局部线性平滑来估计协方差函数,即使它在 \(s=t\) 处不连续,也能得到一致估计。
- 构建同时置信带:利用经验过程理论证明EL比统计量过程的弱收敛性,然后通过bootstrap或高斯过程近似得到同时置信带的临界值。
-
关键跳跃点:
- 从点wise到同时:点wise置信区间是直接的(定理1),但构建同时置信带(定理2)需要证明EL比统计量过程(作为 \(t\) 的函数)的弱收敛性。这是最吃功夫的部分。作者通过经验过程理论中的Donsker定理和tightness论证,证明了该过程在Skorokhod空间 \(D[0,1]\) 上的弱收敛。
- 处理不连续协方差:传统FDA方法假设协方差函数光滑,从而可以用特征分解或核平滑。本文允许不连续协方差,因此不能直接使用这些方法。作者的技巧是:在估计方程方差时,使用局部线性平滑,但平滑的带宽选择要适应不连续性。具体地,作者在 \(s=t\) 附近使用更小的带宽,以避免平滑掉不连续性。
-
技术技巧点名:
- 经验过程理论 (Empirical Process Theory):用于证明EL比统计量过程的弱收敛性(定理2)。具体地,作者将EL比统计量表示为经验过程的泛函,然后应用Donsker定理和tightness论证。
- 局部线性平滑 (Local Linear Smoothing):用于估计协方差函数,即使它在 \(s=t\) 处不连续。作者使用了边界自适应的核函数。
- Bootstrap:用于计算同时置信带的临界值。作者提出了两种bootstrap方案:一种重采样原始数据,另一种重采样EL比统计量本身。
- B样条基函数 (B-spline Basis):用于将无穷维的函数型问题投影到有限维空间。B样条的局部支撑性使得局部化成为可能。
真实例子与应用¶
- 用的什么数据/场景:NHANES (National Health and Nutrition Examination Survey) 2003-2004 和 2005-2006 研究中的可穿戴设备(加速度计)数据。数据记录了参与者连续7天的活动水平(每分钟一个读数)。
- 怎么把本文方法用上去:
- 将每个参与者的7天活动水平数据转化为一条occupation time (OT) 曲线。OT曲线 \(X_i(t)\) 表示参与者 \(i\) 的活动水平低于 \(t\) 的累积时间(标准化为比例)。
- 将参与者按年龄分组(如20-39岁、40-59岁、60岁以上)。
- 使用本文的EL方法,为每个年龄组的平均OT曲线 \(\mu(t)\) 构建点wise置信区间和同时置信带。
- 使用本文的检验方法,比较不同年龄组的平均OT曲线是否有显著差异。
- 得到什么结果:
- EL方法构建的置信带比基于bootstrap的方法更窄(更精确),且覆盖率接近名义水平。
- 检验结果表明,不同年龄组的平均OT曲线存在显著差异(例如,老年人活动水平更低,OT曲线更陡峭)。
- 这个例子想说明什么:
- 验证理论:展示了EL方法在实际数据中的可行性,并验证了其置信带的覆盖率。
- 展示相对baseline的优势:通过与bootstrap方法对比,展示了EL方法在区间宽度上的优势(更窄的置信带意味着更精确的推断)。
- 提供实际洞察:OT曲线比离散分类(如久坐/活动)提供了更丰富的信息,可以揭示不同人群活动模式的细微差异。
🔎 结论是否比证明窄¶
- 潜在问题:定理1和定理2的证明依赖于假设A2(观测时间点随机且独立于 \(X_i\))。但在实际可穿戴设备数据中,观测时间点可能是固定的(如每分钟记录一次),且缺失可能依赖于活动水平(如设备在剧烈活动时更容易脱落)。作者在模拟中考虑了固定网格点,但在理论证明中假设了随机观测点。这是一个窄于实际应用的假设。
- 具体语句:作者在intro中声称“our approach allows discontinuities in the functional covariances while accommodating discretization of the observed trajectories”。但理论证明中,对“discretization”的处理是通过假设随机观测点来实现的。对于固定网格点的离散化,理论是否仍然成立?作者没有明确讨论。
- Conjecture:作者在结论部分提到,EL方法可以推广到其他函数型数据(如密度函数、回归函数),但没有给出具体证明。这是一个conjecture。
四、开放问题¶
-
固定网格点下的理论:本文的理论证明假设观测时间点是随机的。对于可穿戴设备数据中常见的固定网格点(如每分钟记录一次),EL比统计量的渐近分布是否仍然成立?需要重新证明吗?扎根点:假设A2(随机观测点)是理论证明的关键。作者在模拟中考虑了固定网格点,但未给出理论保证。
-
缺失数据与选择性偏差:可穿戴设备数据常存在缺失(如设备没电、参与者忘记佩戴),且缺失可能依赖于活动水平(如剧烈活动时设备脱落)。本文的EL方法如何处理这种非随机缺失?扎根点:作者在intro中提到了“accommodating discretization”,但未讨论缺失数据。这是一个重要的实际gap。
-
半参数效率:本文的EL方法是否达到了均值函数 \(\mu(t)\) 的半参数效率界?在协方差函数不连续的情况下,半参数效率界是什么?扎根点:本文未引用半参数效率理论。这是一个理论上的开放问题:EL方法是否是最优的?
-
高维基函数的选择:本文使用B样条基函数,其数量 \(K\) 随样本量增长。如何数据自适应地选择 \(K\)?是否存在一个类似于AIC/BIC的准则?扎根点:作者在定理1中给出了 \(K\) 的增长速度条件(\(K = o(n^{1/2})\)),但未给出具体的选择方法。这是一个实际应用中的关键问题。
Maintained by 陈星宇 · Homepage · Source on GitHub