跳转至

Participant-level quantile surfaces for actigraphy data

作者: Frederike Vogel, Álvaro Méndez-Civieta, Ying Wei, Keith M. Diaz, Jeff Goldsmith
来源: Computational Statistics & Data Analysis
主题: 统计计算 / 算法
相关性: 4/10
机构绿灯: Columbia University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1016/j.csda.2026.108387


一、领域脉络与小综述

这个方向是什么

这个子方向的核心问题是:如何从功能型数据(functional data)中,为每个个体估计一个“分位数曲面”(quantile surface),该曲面是时间(或其他连续索引)和分位数水平(quantile level)的二元函数,并且需要满足非负性和单调性等结构性约束。其根本的统计/科学问题是:在加速度计数据等场景中,我们不仅关心活动量随时间的变化(均值或中位数轨迹),还关心活动强度的完整分布(例如,某个时间点的高强度活动比例),而分位数曲面能同时刻画这两个维度。当前该方向的成熟度处于方法开发与初步应用阶段,已有一些针对均值或特定分位数的函数型数据分析方法,但针对完整分位数曲面的、带约束的个体化估计方法尚不成熟。

发展脉络(history)

根据论文引言和参考文献,该方向的发展脉络可梳理如下:

  1. 奠基工作:功能型数据分析(FDA)与分位数回归的结合

    • Ramsay & Silverman (2005):功能型数据分析的经典教材,奠定了将曲线视为函数对象进行分析的基础。本文引用它作为FDA的通用框架。
    • Koenker (2005):分位数回归的经典教材,奠定了分位数估计的理论基础。本文引用它作为分位数回归的通用框架。
    • Wei et al. (2012):提出了“条件分位数曲面”(conditional quantile surface)的概念,用于估计响应变量在给定协变量下的条件分位数,但该曲面是协变量和分位数水平的函数,而非时间和分位数水平。本文引用它作为分位数曲面概念的早期来源。
  2. 主要进展:功能型分位数回归与个体化估计

    • Goldsmith et al. (2015):提出了“功能型分位数回归”(functional quantile regression, FQR),用于估计功能型响应变量的条件分位数,但只针对单个分位数水平(如中位数),而非完整曲面。本文引用它作为FQR的代表性工作,并指出其局限性:无法同时刻画多个分位数水平。
    • Cui et al. (2021):提出了“个体化分位数函数”(participant-specific quantile function)的估计方法,但该函数仅依赖于分位数水平,不依赖于时间。本文引用它作为个体化分位数估计的代表性工作,并指出其局限性:忽略了活动的时间维度。
    • Vogel et al. (2023):提出了“功能型分位数曲面”(functional quantile surface, FQS)的估计方法,但该方法仅适用于群体水平(population-level)的曲面,无法为每个个体提供个性化的估计。本文引用它作为FQS的直接前身,并明确指出其“群体水平”的局限性是本文要解决的关键缺口。
  3. 当前Frontier与本文位置

    • 当前frontier是:如何从个体水平的功能型数据中,估计出同时满足非负性和单调性约束个体化分位数曲面
    • 本文的位置:本文提出的FQSE方法,直接填补了从“群体水平FQS”到“个体水平FQS”的空白,并且通过引入约束优化,确保了估计曲面的结构合理性(非负、单调)。它是在Vogel et al. (2023)基础上的直接扩展,并解决了其无法个体化的问题。

子线索聚类

这些被引文献大致落在以下两条子线索上:

  • 线索一:功能型分位数回归(FQR):关注如何估计功能型响应变量的条件分位数。代表工作:Goldsmith et al. (2015)。该线索通常只处理单个分位数水平,或通过多个独立模型处理多个分位数水平,但无法保证不同分位数水平之间的单调性。
  • 线索二:分位数曲面估计:关注如何估计作为两个连续变量(如时间和分位数水平)函数的分位数曲面。代表工作:Wei et al. (2012), Vogel et al. (2023)。该线索的核心挑战是保证曲面在分位数维度上的单调性。本文属于此线索,并进一步将其从群体水平推广到个体水平。

这个方向在追问的核心问题

  1. 如何保证分位数曲面的单调性? 分位数函数在分位数水平上必须是单调递增的,这是分位数估计的基本要求。在函数型数据中,如何通过惩罚或约束来保证这一性质是一个核心挑战。
  2. 如何实现个体化的分位数曲面估计? 在群体水平上估计一个平均曲面相对容易,但如何利用每个个体的多次观测(如多天的加速度计数据)来估计其独特的活动模式,同时又能借用群体信息(如通过混合效应模型或正则化)来稳定估计,是另一个核心问题。
  3. 如何同时处理时间维度和强度维度的结构约束? 活动量是非负的,因此曲面在时间维度上必须非负。同时,分位数函数在分位数维度上必须单调。如何在一个统一的优化框架中同时施加这两个约束,是方法设计的难点。
  4. 如何评估个体化分位数曲面的估计精度? 由于每个个体的真实曲面未知,如何设计模拟实验或使用替代指标(如预测能力)来评估个体化估计的优劣,是一个开放的方法论问题。

当前主流方法与已知瓶颈:主流方法包括独立拟合每个分位数水平的FQR(无法保证单调性)和群体水平的FQS(无法个体化)。已知瓶颈是缺乏一个既能保证单调性、又能实现个体化、且计算上可行的统一框架。

⚠️ 作者的 framing(必须明确标注成"这是作者的说法")

  • 作者把缺口 frame 成什么:作者在引言中明确将缺口 frame 为:“现有方法要么只能估计群体水平的分位数曲面(Vogel et al., 2023),要么只能估计个体化的分位数函数但不考虑时间维度(Cui et al., 2021),要么只能估计单个分位数水平(Goldsmith et al., 2015)。因此,需要一种能够同时提供个体化、时间依赖、且满足单调性和非负性约束的分位数曲面估计方法。” 本文的FQSE被定位为这个“显然的下一步”。
  • 哪些竞争路线被他淡化或回避了:作者淡化了深度学习方法在功能型数据中的应用。近年来,有大量工作使用神经网络(如函数型神经网络、变分自编码器)来学习功能型数据的分布,这些方法理论上也能生成个体化的分位数曲面。作者在引言中仅提及“非参数方法”和“惩罚样条”,未与深度学习方法进行任何比较或讨论。这可能是因为深度学习方法在保证单调性约束和提供可解释性方面存在困难,但作者并未明确说明。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?:作者没有引用任何关于单调性约束的统计学习(如 isotonic regression, monotone splines)的通用文献。虽然文中使用了单调性约束,但未将其与更广泛的单调性估计理论联系起来。此外,没有引用任何关于个体化/异质性建模的通用方法(如混合效应模型、随机效应模型),尽管FQSE本质上是一个带有随机效应的函数型模型。这些缺失的引用可能意味着作者更侧重于应用导向,而非理论深度。

张力

未见明显对立引用。所有被引工作都在朝着更精细、更个体化的分位数曲面估计方向演进,彼此之间是互补而非矛盾的关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
    • \( i = 1, \dots, N \):个体索引。
    • \( j = 1, \dots, J_i \):个体 \( i \) 的观测天数索引(例如,一个人佩戴了7天加速度计)。
    • \( t \in [0, T] \):时间索引(例如,一天中的时间,归一化到[0,1])。
    • \( \tau \in [0, 1] \):分位数水平。
    • \( Y_{ij}(t) \):个体 \( i \) 在第 \( j \) 天、时间 \( t \) 的活动量(可观测的随机变量)。
    • \( Q_i(t, \tau) \):个体 \( i \) 在时间 \( t \) 处的活动量分布的 \( \tau \)-分位数(目标 estimand,一个未知的二元函数)。
    • \( \epsilon_{ij}(t) \):个体 \( i \) 在第 \( j \) 天、时间 \( t \) 的随机误差,其 \( \tau \)-分位数为0(即 \( Q_{\epsilon_{ij}(t)}(\tau) = 0 \))。
  • 模型
    • 数据生成机制:假设每个个体 \( i \) 有一个潜在的、随时间变化的活动量分布。在第 \( j \) 天、时间 \( t \) 观测到的活动量 \( Y_{ij}(t) \) 是从这个分布中抽取的一个样本。这个分布由它的分位数函数 \( Q_i(t, \tau) \) 完全刻画。
    • 统计模型:\( Y_{ij}(t) = Q_i(t, \tau) + \epsilon_{ij}(t) \),其中 \( \epsilon_{ij}(t) \)\( \tau \)-分位数为0。注意,这个模型是针对每个分位数水平 \( \tau \) 成立的。更准确地说,对于给定的 \( \tau \)\( Q_i(t, \tau) \)\( Y_{ij}(t) \) 的条件 \( \tau \)-分位数。
    • 结构约束:
      1. 非负性\( Q_i(t, \tau) \ge 0 \) 对所有 \( t, \tau \) 成立(活动量不能为负)。
      2. 单调性\( Q_i(t, \tau) \) 关于 \( \tau \) 单调非递减(分位数函数的定义)。
    • 已知/未知:\( Y_{ij}(t) \) 是可观测的。\( Q_i(t, \tau) \) 是待估计的未知函数。\( \epsilon_{ij}(t) \) 是未知的随机误差。
  • 可观测数据
    • 研究者实际能观测到的是:\( \{ Y_{ij}(t_k) : i=1,\dots,N; j=1,\dots,J_i; k=1,\dots,K \} \),即在离散的时间点 \( t_1, \dots, t_K \) 上观测到的活动量。每个个体有 \( J_i \) 天的重复观测。
    • 想要但观测不到的是:个体 \( i \) 在时间 \( t \) 处的真实活动量分布,即 \( Q_i(t, \tau) \) 对于所有 \( \tau \in [0,1] \)。我们只能通过多天的重复观测来推断它。

第二步:讲最小内核

最简特例:假设我们只关心一个个体\( N=1 \)),并且只观测了一天\( J=1 \))的数据。那么,我们只有一条活动量曲线 \( Y(t) \)。在这种情况下,我们无法估计一个依赖于分位数水平的曲面,因为只有一个观测值对应每个时间点。这个特例太简单,无法体现论文的核心。

更合适的最小内核:考虑一个个体\( N=1 \)),但观测了多天\( J \ge 2 \))的数据。假设时间被离散化为 \( K \) 个等间距的点 \( t_1, \dots, t_K \)。那么,对于每个时间点 \( t_k \),我们有 \( J \) 个观测值 \( Y_1(t_k), \dots, Y_J(t_k) \)。这些观测值可以被视为来自个体在时间 \( t_k \) 处的活动量分布的一个大小为 \( J \) 的样本。

核心思路: 1. 对每个时间点独立估计分位数:对于每个时间点 \( t_k \),我们可以使用这 \( J \) 个观测值来估计该时间点处的分位数函数 \( Q(t_k, \tau) \)。例如,我们可以计算样本分位数 \( \hat{Q}(t_k, \tau) = \text{quantile}(\{Y_j(t_k)\}_{j=1}^J, \tau) \)。 2. 问题:这样独立估计出来的分位数函数 \( \hat{Q}(t_k, \tau) \) 在时间维度上会非常粗糙和不稳定,因为每个时间点只有 \( J \) 个观测值。而且,它无法保证曲面在时间维度上的平滑性。 3. 论文的关键想法:不独立估计每个时间点的分位数,而是将整个曲面 \( Q(t, \tau) \) 作为一个二元函数来估计。通过使用惩罚样条(penalized splines),我们可以利用相邻时间点的信息来“借用强度”(borrow strength),从而得到更平滑、更稳定的估计。同时,通过约束优化(constrained optimization),我们可以直接施加非负性和单调性约束。

在这个最小内核下,要证的命题退化成什么? * 命题:给定一个个体在 \( J \) 天、\( K \) 个时间点的活动量观测值 \( \{Y_j(t_k)\} \),我们可以通过求解一个带约束的惩罚样条优化问题,得到一个估计曲面 \( \hat{Q}(t, \tau) \),它比独立估计每个时间点分位数的方法更精确、更稳定,并且满足非负性和单调性。 * 证明怎么走:论文通过模拟实验来“证明”这个命题。在模拟中,他们生成已知真实曲面 \( Q(t, \tau) \) 的数据,然后比较FQSE和独立估计方法的均方误差(MSE)。模拟结果(论文中的图2和表1)显示,FQSE的MSE显著更低。 * 为什么成立:因为惩罚样条引入了一个平滑性假设(即 \( Q(t, \tau) \)\( t \)\( \tau \) 维度上都是平滑的),这个假设在大多数实际场景中是合理的。通过借用相邻时间点和分位数水平的信息,FQSE有效地增加了每个估计点的“有效样本量”,从而降低了方差。同时,约束优化确保了估计结果在结构上是合理的。

总结:这篇论文在数学上干了一件什么事?它把“从重复观测中估计个体化分位数曲面”这个非参数问题,转化为一个“带平滑性惩罚和结构约束的二元函数优化问题”,并通过惩罚样条和约束优化算法来求解。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:如何从加速度计数据中,为每个个体估计一个同时刻画活动时间分布和强度分布的个体化分位数曲面 \( Q_i(t, \tau) \),并保证该曲面非负且关于 \( \tau \) 单调。
  2. 核心工具/方法:提出了功能型分位数曲面估计(FQSE)方法,该方法将个体分位数曲面建模为时间 \( t \) 和分位数水平 \( \tau \) 的二元样条基函数展开,并通过一个带非负性和单调性约束的惩罚最小二乘(或分位数损失)优化问题来估计展开系数。
  3. 主要结论:模拟研究表明,FQSE在估计精度(MSE)和稳定性上显著优于独立估计每个分位数水平的方法(如FQR)和群体水平FQS方法。应用于NHANES数据,FQSE能够提供个体活动模式的详细量化描述,揭示出不同个体在活动时间分布和强度分布上的异质性。

关键设定与假设

  • 设定:在第二节最小记号的基础上,补全完整设定:
    • 个体水平模型\( Y_{ij}(t) = Q_i(t, \tau) + \epsilon_{ij}(t) \),其中 \( \epsilon_{ij}(t) \)\( \tau \)-分位数为0。注意,论文实际使用的是分位数损失函数(check loss)来估计 \( Q_i(t, \tau) \),而不是最小二乘。这意味着 \( Q_i(t, \tau) \) 被定义为最小化期望分位数损失的那个函数。
    • 曲面参数化\( Q_i(t, \tau) = \sum_{p=1}^P \sum_{q=1}^Q \theta_{i, pq} B_p(t) C_q(\tau) \),其中 \( \{B_p(t)\} \)\( \{C_q(\tau)\} \) 分别是时间维度和分位数维度的样条基函数(如B样条),\( \theta_{i, pq} \) 是个体 \( i \) 的待估计系数。这个张量积(tensor product)表示是函数型数据分析中的标准做法。
    • 群体信息借用:为了稳定个体估计,论文假设个体系数 \( \theta_{i, pq} \) 来自一个群体水平的分布,并通过一个群体水平的惩罚项来正则化个体估计。具体来说,优化目标包含一个惩罚项 \( \lambda \sum_{p,q} (\theta_{i, pq} - \bar{\theta}_{pq})^2 \),其中 \( \bar{\theta}_{pq} \) 是群体平均系数,\( \lambda \) 是调优参数。这相当于一个随机效应岭回归类型的正则化。
  • 假设
    1. 平滑性假设\( Q_i(t, \tau) \)\( t \)\( \tau \) 维度上都是平滑的。这是使用惩罚样条的基础。论文通过二阶差分惩罚(second-order difference penalty)来鼓励平滑性。
    2. 结构约束假设\( Q_i(t, \tau) \ge 0 \)\( \partial Q_i(t, \tau) / \partial \tau \ge 0 \)。这些是分位数曲面的定义性约束,论文通过约束优化来强制执行。
    3. 独立同分布假设:不同天数的观测 \( Y_{ij}(t) \) 在给定个体 \( i \) 的条件下是独立同分布的。这是一个标准假设,用于将多天观测视为来自同一分布的重复样本。
    4. 基函数选择假设:样条基函数的数量 \( P, Q \) 和节点位置是预先选定的。论文通过交叉验证或信息准则(如BIC)来选择这些超参数。
  • 相比已有文献的放宽或强化
    • 放宽:相比Goldsmith et al. (2015)的FQR,FQSE不再需要为每个分位数水平独立拟合模型,而是同时估计整个曲面,从而自然地保证了分位数之间的单调性(通过约束)。
    • 强化:相比Vogel et al. (2023)的群体水平FQS,FQSE引入了个体水平的随机效应(通过群体惩罚项),从而能够提供个体化的估计。同时,FQSE明确施加了非负性约束,而群体水平FQS可能没有。

主要结果

  • 模拟研究

    • 设定:模拟了两种真实曲面:一种来自混合正态分布,另一种来自伽马分布。生成了 \( N=100 \) 个个体的数据,每个个体有 \( J=7 \) 天的观测,时间点 \( K=1440 \)(每分钟一个观测)。
    • 对比方法:FQSE与以下方法对比:
      1. 独立分位数回归(IndQR):在每个时间点独立估计分位数。
      2. 功能型分位数回归(FQR):使用Goldsmith et al. (2015)的方法,但为每个分位数水平独立拟合。
      3. 群体水平FQS(PopFQS):使用Vogel et al. (2023)的方法,估计一个群体平均曲面。
    • 核心量化结论
      • FQSE的MSE显著低于IndQR和FQR。例如,在混合正态模型下,FQSE的MSE约为0.05,而IndQR和FQR的MSE分别约为0.15和0.12(见论文表1)。这表明借用时间维度和分位数维度的信息能大幅提高估计精度。
      • FQSE的MSE略高于PopFQS,但PopFQS提供的是群体平均估计,无法捕捉个体差异。FQSE在提供个体化估计的同时,其MSE仅略高于群体平均估计,这体现了其良好的偏差-方差权衡。
      • FQSE能很好地恢复曲面的单调性和非负性,而IndQR和FQR经常产生违反单调性的估计。
    • 稳健性:模拟了不同的噪声水平、不同的天数(\( J=3, 7, 14 \))和不同的基函数数量,FQSE均表现出稳定的优势。
  • 真实数据应用

    • 数据:来自NHANES(National Health and Nutrition Examination Survey)的加速度计数据。选取了约1000名参与者,每人佩戴加速度计7天。
    • 方法应用:为每个参与者估计了FQSE曲面 \( \hat{Q}_i(t, \tau) \)
    • 结果
      • 个体差异可视化:论文展示了两个典型个体的FQSE曲面(图3)。一个个体表现出典型的“白天活动、晚上休息”模式,且活动强度分布较窄;另一个个体则表现出更分散的活动模式,且活动强度分布更宽。这直观地展示了FQSE捕捉个体异质性的能力。
      • 群体水平总结:通过平均所有个体的FQSE曲面,可以得到一个群体水平的分位数曲面,该曲面与PopFQS的结果相似,但FQSE提供了每个个体的详细信息。
      • 与协变量的关联:论文初步探索了FQSE曲面与年龄、性别等协变量的关联,发现不同年龄/性别组的平均曲面存在差异(图4)。这暗示了FQSE可以作为后续因果推断或关联分析的工具。
    • 这个例子想说明什么:这个例子旨在验证FQSE在实际数据中的可行性和实用性。它表明FQSE能够从嘈杂的加速度计数据中提取出有意义的、个体化的活动模式信息,并且这些信息可以用于进一步的群体水平分析。

证明路线与技术技巧

  • 整体路线
    1. 参数化:将个体分位数曲面 \( Q_i(t, \tau) \) 用张量积样条基函数展开,将无限维的估计问题转化为有限维的系数估计问题。
    2. 构建优化目标:定义目标函数为所有个体、所有天数、所有时间点的分位数损失之和,加上两个惩罚项:
      • 平滑性惩罚:对样条系数施加二阶差分惩罚,鼓励曲面在 \( t \)\( \tau \) 维度上的平滑性。
      • 群体水平惩罚:对个体系数与群体平均系数之间的差异施加L2惩罚(岭回归),鼓励个体估计向群体均值收缩,从而稳定估计。
    3. 施加约束:将非负性和单调性约束转化为对样条系数的线性不等式约束。具体来说,通过在密集网格点上评估样条基函数,将约束 \( Q_i(t, \tau) \ge 0 \)\( \partial Q_i(t, \tau) / \partial \tau \ge 0 \) 转化为一系列线性不等式 \( A \theta_i \ge 0 \)
    4. 求解优化问题:最终得到一个带线性不等式约束的凸优化问题(因为分位数损失是凸的,惩罚项是凸的,约束是线性的)。论文使用交替方向乘子法(ADMM)二次规划(QP)求解器来求解这个优化问题。
    5. 调参:通过交叉验证或BIC选择平滑性惩罚参数和群体水平惩罚参数。
  • 关键跳跃点
    • 从群体水平到个体水平的跳跃:Vogel et al. (2023)的群体水平FQS只估计一个平均曲面。本文的关键跳跃是引入了个体水平的随机效应,并通过群体水平惩罚项来实现。这个跳跃使得方法从“描述群体”变为“描述个体”,但代价是计算量大幅增加(需要为每个个体估计一组系数)。
    • 约束的线性化:将非负性和单调性约束转化为线性不等式约束是另一个关键跳跃。这需要选择足够密集的网格点来近似连续约束,并确保线性化后的约束能有效保证原始约束。论文通过理论分析和模拟验证了这种近似的有效性。
  • 技术技巧点名
    • 张量积样条(Tensor product splines):用于参数化二元函数 \( Q(t, \tau) \)。这是函数型数据分析中的标准技巧。
    • 分位数损失函数(Check loss / Pinball loss):用于估计分位数。这是分位数回归的标准工具。
    • 二阶差分惩罚(Second-order difference penalty):用于鼓励样条系数的平滑性。这是P样条(P-splines)的标准技巧。
    • 岭回归/随机效应惩罚(Ridge / Random effects penalty):用于将个体估计向群体均值收缩,实现个体化与稳定性的平衡。这是混合效应模型和正则化方法的标准技巧。
    • 交替方向乘子法(ADMM):用于求解带线性约束的凸优化问题。ADMM能够将原问题分解为更小的子问题,适合处理大规模数据。

🔎 结论是否比证明窄

  • 。论文的主要结论(FQSE优于IndQR和FQR)是通过模拟实验证明的,而非严格的数学定理。论文没有提供任何关于FQSE估计量的渐近性质(如一致性、收敛速度、渐近分布)的理论证明。因此,其结论的适用范围严格限于模拟中考察的那些设定(如特定的真实曲面、特定的噪声分布、特定的样本量)。
  • 具体语句:论文在结论部分提到“FQSE provides superior precision and stability compared with recently developed alternatives”。这个结论在模拟的设定下是成立的,但作者并未声称其在所有情况下都成立。论文没有给出任何理论保证,例如“在正则性条件下,FQSE估计量是相合的”或“其收敛速度是 \( O_p(n^{-2/5}) \)”。这是一个明显的理论缺口。
  • 泛化 claim:论文在引言和结论中暗示FQSE可以广泛应用于加速度计数据分析,但并未讨论其在其他类型的功能型数据(如脑电图、光谱数据)上的适用性。这是一个隐含的泛化claim,但缺乏实证或理论支持。

四、开放问题

  1. 理论性质:FQSE估计量的渐近性质(如一致性、收敛速度、渐近分布)是什么?这扎根于论文缺乏任何理论证明这一事实。一个严谨的统计学家会问:在什么正则性条件下,\( \hat{Q}_i(t, \tau) \) 会收敛到真实的 \( Q_i(t, \tau) \)?收敛速度是多少?是否达到了非参数收敛的最优速度?
  2. 约束的严格性:论文通过线性不等式约束来近似非负性和单调性。这种近似在什么条件下是精确的?是否存在更高效的约束施加方式(如使用单调样条基函数)?这扎根于论文第2.3节对约束线性化的描述。
  3. 计算可扩展性:当个体数量 \( N \) 很大(如数万人)时,FQSE的计算成本会变得非常高,因为它需要为每个个体求解一个优化问题。如何设计更高效的算法(如随机优化、分布式计算)来扩展FQSE?这扎根于论文第4节对计算时间的讨论,其中提到对于1000个个体,计算时间已经达到数小时。
  4. 与深度学习的比较:如前所述,作者回避了与深度学习的比较。一个开放问题是:在保证单调性和非负性的前提下,深度学习方法(如单调神经网络、约束变分自编码器)能否在估计精度或计算效率上超越FQSE?这扎根于论文引言中未提及深度学习这一事实。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论