跳转至

Deep Imputation for Skeleton data (DISK) for behavioral science

作者: France Rose, Monika Michaluk, Timon Blindauer, Bogna M. Ignatowska-Jankowska, Liam O’Shaughnessy et al.
来源: Nature Methods
主题: 其他
相关性: 6/10
链接: https://doi.org/10.1038/s41592-025-02893-y


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于动物行为学计算神经科学的交叉领域,具体是动物姿态估计与运动分析。这个子领域的核心科学问题是:如何从视频中自动、精确地追踪动物的身体部位(如爪子、鼻子、尾巴),并从中提取有意义的运动行为(如步态、跳跃、社交互动)。目前该领域已相当成熟,以 DeepLabCut、SLEAP 等开源工具为代表,能够以高精度追踪数十个关键点。然而,一个关键的瓶颈是数据缺失——由于遮挡、快速运动、光照变化或追踪器本身的错误,大量关键点坐标会丢失,导致后续分析无法进行或产生偏差。
  • 本文的位置:它针对的是姿态追踪数据中缺失值的填补问题。现有的填补方法要么需要人工标注(昂贵且主观),要么过于简单(如线性插值)而无法捕捉复杂的时空依赖。本文提出的 DISK 是一个纯数据驱动的深度学习方法,利用关键点之间的空间关系和时间动力学来填补缺失值,无需任何人工标注。它填补了“高精度追踪”和“可靠下游分析”之间的关键缺口。

二、关键术语扫盲

  1. 姿态估计 (Pose Estimation):从图像或视频中推断出动物身体关键部位(如关节、鼻子、尾巴尖)的二维或三维坐标。可以理解为给动物身体的每个“关节点”打上标签。
  2. 关键点 (Keypoint):姿态估计的目标,即动物身体上被追踪的特定位置,例如“左前爪”、“右眼”、“脊柱中点”。每个关键点通常用 (x, y) 或 (x, y, z) 坐标表示。
  3. 骨架 (Skeleton):由一组关键点及其连接关系(如“左肩”连接到“左肘”)构成的图结构,定义了动物的身体拓扑结构。
  4. 追踪数据 (Tracking Data):从视频的每一帧中提取的所有关键点坐标的集合,形成一个多变量时间序列。例如,一个10帧的视频追踪20个关键点,数据就是一个10×40的矩阵。
  5. 缺失数据 (Missing Data):在追踪数据中,由于遮挡、追踪失败等原因,某些关键点在特定帧的坐标是未知的。本文处理的是坐标缺失,而非图像缺失。
  6. 插补 (Imputation):用合理的估计值替换缺失数据的过程。本文的 DISK 就是一种插补方法。
  7. 时空依赖性 (Spatiotemporal Dependencies):这是 DISK 的核心假设。空间依赖性指同一帧内不同关键点的位置是相关的(例如,左前爪和右前爪的运动通常是对称的);时间依赖性指同一关键点在相邻帧的位置是平滑变化的(例如,爪子的运动轨迹是连续的)。
  8. 自监督学习 (Self-Supervised Learning):一种无需人工标注标签的训练方法。DISK 通过随机掩盖(mask)一部分已知的关键点坐标,然后训练模型去预测这些被掩盖的值,从而学习到数据的时空结构。这与 BERT 在自然语言处理中“完形填空”的思路类似。
  9. 潜在表示 (Latent Representation):深度学习模型在内部学习到的、对原始数据的一种压缩和抽象的表达。DISK 在学习插补的过程中,其内部编码器会生成一个低维的潜在向量,这个向量被认为捕捉了动物的“动作”或“行为状态”。
  10. 下游分析 (Downstream Analysis):在数据被插补完整后进行的科学分析,例如检测步态周期、量化运动速度、比较不同实验组(如药物 vs. 对照组)的行为差异。本文的核心论点是:更好的插补能带来更可靠的下游分析结果。
  11. 多动物场景 (Multi-animal Setup):同时追踪多个动物(如两只小鼠互动)的场景。这带来了额外的挑战,如动物之间的遮挡、身份交换(ID switching)等,导致数据缺失模式更复杂。
  12. 标记式 vs. 无标记式追踪 (Marker-based vs. Markerless Tracking):标记式追踪需要在动物身上粘贴反光标记,精度高但侵入性强;无标记式追踪直接从视频中分析,非侵入性但更易出错。DISK 声称适用于两种系统的输出。

三、这个领域的人在关心什么

动物行为学的研究者正在追问一个根本问题:如何将动物的复杂、连续的行为,客观、可量化地分解为基本单元(行为“词汇”),并理解这些单元如何受基因、神经回路、药物和环境的影响? 传统的做法是人工观察和编码,但这种方法耗时、主观、难以规模化。过去十年,基于深度学习的姿态估计工具(如 DeepLabCut, Mathis et al., 2018; SLEAP, Pereira et al., 2022)革命性地解决了“如何追踪”的问题,使得从视频中提取高维、高帧率的运动轨迹成为可能。

然而,这带来了一个新的瓶颈:数据质量。在真实的实验环境中,追踪数据几乎总是存在缺失。一个常见的场景是,当小鼠转身或跳跃时,其爪子或尾巴会被身体遮挡,导致追踪器丢失。如果简单地丢弃这些缺失帧,会破坏时间序列的连续性,并可能引入选择偏差(例如,只分析“简单”的运动)。如果使用简单的线性插值,则会忽略关键点之间复杂的非线性耦合关系(例如,一个爪子的运动会影响身体重心的位置,进而影响另一个爪子的运动),导致下游分析(如步态检测)产生错误。

当前主流的方法和局限是: - 线性插值:简单快速,但假设运动是线性的,无法处理复杂的非线性动力学,尤其当缺失段较长时效果极差。 - 基于物理模型的插值:如卡尔曼滤波或平滑样条,需要假设一个运动模型(如恒定速度),在快速、非周期性的行为中表现不佳。 - 人工标注:最准确,但极其昂贵、耗时,且在不同标注者间存在主观性,无法规模化处理海量数据。

本文的 DISK 正是针对这些局限,提出了一种数据驱动、无需模型假设、无需人工标注的填补方法。它不依赖于任何先验的运动模型,而是直接从大量数据中学习关键点之间的时空依赖关系。与上述方法相比,DISK 的优势在于:(1) 能处理长段、复杂的缺失模式;(2) 能利用多关键点之间的空间约束;(3) 完全自动化。

四、数据问题

  • 数据来源:通过视频录制动物行为实验,然后使用姿态估计软件(如 DeepLabCut, SLEAP)或标记式运动捕捉系统从视频中提取关键点坐标。本文使用了7种不同的动物数据集,包括小鼠、果蝇、斑马鱼、线虫等,涵盖了单动物和多动物场景。
  • 数据形态多变量时间序列。每一帧是一个高维向量,包含所有关键点的 (x, y) 坐标(或 (x, y, z))。维度 = 关键点数量 × 坐标维度(通常为2或3)。时间长度从数百帧到数万帧不等。
  • 结构特征
    • 空间图结构:关键点之间通过骨架连接,形成图结构。这是强先验信息,但 DISK 并未显式利用图神经网络,而是通过全连接网络隐式学习。
    • 时间序列结构:运动是连续的,因此时间序列具有强自相关性平滑性
    • 周期性:许多行为(如行走、奔跑)具有周期性,这为插补提供了额外的结构。
  • Noise & 测量误差:噪声主要来自姿态估计器的输出,通常是非高斯的,表现为“抖动”(jitter)或“跳跃”(jump)。缺失数据本身不是噪声,而是信息完全丢失。
  • Selection / Bias / 缺失 / Censoring / Truncation / 计算约束
    • 缺失模式非随机缺失 (MNAR) 是核心问题。缺失通常发生在快速运动、遮挡或动物身体自遮挡时,这些正是行为分析中最关键的时刻。因此,简单地删除缺失数据会引入严重的选择偏差,使分析偏向于“简单”或“慢速”的行为。
    • 计算约束:训练一个深度学习模型需要GPU,但推理(插补)过程相对快速。本文的 DISK 作为一个独立软件包发布,旨在降低使用门槛。
  • 哪些是“漂亮的统计学问题”,哪些是“纯工程或纯领域难题”?
    • 漂亮的统计学问题非随机缺失下的插补是一个经典的统计挑战。如何利用时空依赖结构(如低秩性、图结构、函数型数据)来建模缺失数据,并给出不确定性量化,是统计学家可以大展身手的地方。选择偏差的纠正也是一个核心问题。
    • 纯工程或纯领域难题:深度学习模型的具体架构设计(如 Transformer 的层数、注意力头数)、训练策略(如 masking 比例)、以及针对不同动物骨架的调参,更多是工程优化。领域难题包括如何定义“好的”插补(是像素级精度还是下游行为检测的准确性?),以及如何验证插补结果在生物学上的合理性。

五、方法与模型问题

  • 文章用的分析方法:DISK 的核心是一个基于 Transformer 的深度神经网络。其工作流程如下:
    1. 输入:一个包含缺失值的关键点坐标时间序列片段。缺失值被标记为特殊的“掩码”(mask)。
    2. 编码:模型首先将每个关键点的坐标和掩码信息嵌入到一个高维空间。然后,一个时间 Transformer 处理时间维度,捕捉每个关键点随时间变化的动力学;一个空间 Transformer 处理空间维度,捕捉同一帧内不同关键点之间的依赖关系。这两个 Transformer 是交替或并行工作的。
    3. 解码:模型输出每个关键点在每一帧的预测坐标,包括对缺失位置的预测。
    4. 训练:模型通过自监督学习训练。在训练时,随机掩盖一部分已知的关键点坐标,然后让模型去预测这些被掩盖的值。损失函数是预测值与真实值之间的均方误差(MSE)。这样,模型就学会了利用时空上下文来填补“空洞”。
  • 关键假设
    • 时空平滑性与相关性:这是模型能够工作的根本前提。如果运动是完全随机的,任何插补都无法成功。
    • 数据量足够:深度学习模型需要大量数据来学习有效的时空模式。
    • 缺失模式与训练时的掩盖模式相似:模型在训练时随机掩盖,但实际缺失往往是结构化的(如连续帧的同一关键点)。模型需要泛化到这种模式。
  • 推断 / 计算手段深度学习(Transformer)。训练使用梯度下降和反向传播。推理是前向传播。
  • 核心结论 + 不确定性量化
    • 核心结论:DISK 在多种动物数据集上,在插补精度(MSE)上显著优于线性插值和基线深度学习方法。更重要的是,使用 DISK 插补后的数据,在下游分析(如步态检测)中能检测到更多的运动事件,并且在比较不同实验条件时,统计结果更稳健(即更少的假阳性或假阴性)。
    • 不确定性量化几乎没有。本文没有为插补值提供任何置信区间或预测区间。这是一个显著的统计缺陷。模型输出的是一个点估计,用户无法知道这个估计有多可靠。对于关键的科学结论,这可能是危险的。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 评分:4/5 星
    • 理由:对非动物行为学背景的统计学家来说,这是一篇非常好的入门读物。问题设定(追踪数据缺失)清晰直观,方法框架(自监督学习填补时空数据)易于理解,且论文用大量篇幅展示了插补如何影响下游分析,这让统计学家能立刻看到“数据质量”与“科学结论”之间的直接联系。缺点是对缺失机制(MNAR)的讨论不够深入,且完全没有不确定性量化,这可能会让统计学家感到不满足。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 科学趣味性非常高。这个问题本身——如何从嘈杂、不完整的运动数据中可靠地提取行为——是连接“原始观测”和“科学知识”的核心桥梁。它触及了几乎所有实证科学都会遇到的普遍问题:数据缺失和测量误差。了解动物行为学家如何用深度学习工具解决这个问题,对任何关心数据质量的统计学家来说都是一种有益的“开眼界”。
    • 方法学空间巨大。本文的方法学空间是开放的,而非封闭的。它提出了一个清晰的统计挑战,但给出的解决方案(纯深度学习点估计)在统计学家看来只是一个起点。这里有大量的口子:
      • 不确定性量化 (UQ):这是最明显的缺口。如何为插补值提供合理的置信区间?可以尝试贝叶斯深度学习、深度集成、或基于 conformal prediction 的方法。
      • 缺失机制建模:本文假设缺失是随机的(通过随机掩盖训练),但实际缺失是 MNAR。一个更严谨的统计模型应该显式地对缺失机制进行建模(例如,使用 selection model 或 pattern-mixture model),以纠正由此产生的偏差。
      • 利用低秩结构:关键点坐标的时间序列通常具有低秩性(因为运动由少数几个“行为基元”驱动)。可以探索使用矩阵补全(matrix completion)或函数型主成分分析(FPCA)等方法,这些方法天然地处理缺失数据,并能提供不确定性度量。
      • 因果推断的接口:下游分析(如比较药物组和对照组的行为)本质上是一个因果推断问题。如果插补过程引入了偏差,那么后续的因果估计也会是有偏的。如何将插补的不确定性传播到因果效应估计中,是一个有趣且有价值的问题。
    • 现实相关性非常高。缺失数据是几乎所有领域(医学、经济学、社会科学、气候学)的普遍问题。本文所面对的“高维、强时空依赖、非随机缺失”的数据模式,在传感器数据、脑成像数据、金融时间序列中都非常常见。因此,这里发展出的统计思想(即使不是具体算法)具有很强的可迁移性。
    • 明确结论很有意思值得留意。虽然方法本身是纯深度学习应用,但它揭示了一个具有丰富统计内涵的科学问题。对于关心缺失数据、测量误差、选择偏差和不确定性量化的统计学家来说,这是一个绝佳的“问题矿藏”。
  3. 武器库匹配度

    • 无明显接口,纯科普阅读。你的武器库(非参数统计、高维渐近、因果推断、U-统计量)与本文的核心方法(Transformer 自监督学习)没有直接的技术重叠。虽然你可以用非参数回归或矩阵补全的思想来思考一个更“统计”的替代方案,但这属于“问题发现”而非“方法迁移”。本文的价值在于让你看到一个有趣的、值得投入统计智慧的科学问题,而不是提供一个可以直接套用的统计工具。
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述 / 科普
      • 本文的引言部分已经是一个很好的起点。此外,可以阅读 DeepLabCut 的原始论文:Mathis, A., et al. (2018). "DeepLabCut: markerless pose estimation of user-defined body parts with deep learning." Nature Neuroscience. 这篇论文是姿态估计领域的奠基之作,能让你理解数据是如何产生的。
    • 关键的奠基或代表论文
      • Pereira, T. D., et al. (2022). "SLEAP: A deep learning system for multi-animal pose tracking." Nature Methods. 这是多动物追踪的标杆工具,本文的数据集之一就来自 SLEAP。阅读它可以了解多动物场景下的数据缺失问题有多复杂。
      • Graving, J. M., et al. (2019). "DeepPoseKit, a software toolkit for fast and robust animal pose estimation using deep learning." eLife. 另一个重要的姿态估计工具,其设计哲学和数据处理流程值得了解。
    • 可以动手玩的公开数据集 / 挑战赛
      • 本文的代码和数据是开源的,可以从其 GitHub 仓库 (https://github.com/bozeklab/DISK.git) 获取。这是最直接的动手资源。你可以下载一个小鼠数据集,人为制造缺失,然后用 DISK 插补,再尝试用简单的统计方法(如线性插值、矩阵补全)做对比,亲身体验不同方法的优劣。

七、术语小抄

英文术语 中文 一句话解释
Pose Estimation 姿态估计 从图像/视频中推断动物身体关键部位(如关节)坐标的技术。
Keypoint 关键点 被追踪的特定身体部位,如“左前爪”、“鼻子”。
Skeleton 骨架 由关键点及其连接关系构成的图,定义身体拓扑。
Tracking Data 追踪数据 所有关键点在每一帧的坐标集合,是一个多变量时间序列。
Imputation 插补 用合理的估计值替换缺失数据的过程。
Spatiotemporal Dependencies 时空依赖性 关键点坐标在空间上(同一帧内)和时间上(相邻帧间)的相关性。
Self-Supervised Learning 自监督学习 一种无需人工标签的训练方法,通过预测数据自身的一部分来学习。
Masking 掩盖 在训练时故意隐藏一部分数据,让模型去预测,是自监督学习的常用技巧。
Latent Representation 潜在表示 模型内部学习到的对原始数据的低维、抽象表达,可捕捉“动作”或“状态”。
Downstream Analysis 下游分析 数据插补完成后进行的科学分析,如检测步态、比较实验组差异。
Markerless Tracking 无标记追踪 直接从视频中分析动物姿态,无需在动物身上粘贴标记。
MNAR (Missing Not At Random) 非随机缺失 数据缺失的概率与缺失值本身有关,是追踪数据中最棘手的缺失类型。
Transformer 变换器 一种基于自注意力机制的深度学习架构,擅长捕捉长距离依赖关系。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论