Deep Imputation for Skeleton data (DISK) for behavioral science¶
作者: France Rose, Monika Michaluk, Timon Blindauer, Bogna M. Ignatowska-Jankowska, Liam O’Shaughnessy et al.
来源: Nature Methods
主题: 其他
相关性: 6/10
链接: https://doi.org/10.1038/s41592-025-02893-y
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于动物行为学与计算神经科学的交叉领域,具体是动物姿态估计与运动分析。这个子领域的核心科学问题是:如何从视频中自动、精确地追踪动物的身体部位(如爪子、鼻子、尾巴),并从中提取有意义的运动行为(如步态、跳跃、社交互动)。目前该领域已相当成熟,以 DeepLabCut、SLEAP 等开源工具为代表,能够以高精度追踪数十个关键点。然而,一个关键的瓶颈是数据缺失——由于遮挡、快速运动、光照变化或追踪器本身的错误,大量关键点坐标会丢失,导致后续分析无法进行或产生偏差。
- 本文的位置:它针对的是姿态追踪数据中缺失值的填补问题。现有的填补方法要么需要人工标注(昂贵且主观),要么过于简单(如线性插值)而无法捕捉复杂的时空依赖。本文提出的 DISK 是一个纯数据驱动的深度学习方法,利用关键点之间的空间关系和时间动力学来填补缺失值,无需任何人工标注。它填补了“高精度追踪”和“可靠下游分析”之间的关键缺口。
二、关键术语扫盲¶
- 姿态估计 (Pose Estimation):从图像或视频中推断出动物身体关键部位(如关节、鼻子、尾巴尖)的二维或三维坐标。可以理解为给动物身体的每个“关节点”打上标签。
- 关键点 (Keypoint):姿态估计的目标,即动物身体上被追踪的特定位置,例如“左前爪”、“右眼”、“脊柱中点”。每个关键点通常用 (x, y) 或 (x, y, z) 坐标表示。
- 骨架 (Skeleton):由一组关键点及其连接关系(如“左肩”连接到“左肘”)构成的图结构,定义了动物的身体拓扑结构。
- 追踪数据 (Tracking Data):从视频的每一帧中提取的所有关键点坐标的集合,形成一个多变量时间序列。例如,一个10帧的视频追踪20个关键点,数据就是一个10×40的矩阵。
- 缺失数据 (Missing Data):在追踪数据中,由于遮挡、追踪失败等原因,某些关键点在特定帧的坐标是未知的。本文处理的是坐标缺失,而非图像缺失。
- 插补 (Imputation):用合理的估计值替换缺失数据的过程。本文的 DISK 就是一种插补方法。
- 时空依赖性 (Spatiotemporal Dependencies):这是 DISK 的核心假设。空间依赖性指同一帧内不同关键点的位置是相关的(例如,左前爪和右前爪的运动通常是对称的);时间依赖性指同一关键点在相邻帧的位置是平滑变化的(例如,爪子的运动轨迹是连续的)。
- 自监督学习 (Self-Supervised Learning):一种无需人工标注标签的训练方法。DISK 通过随机掩盖(mask)一部分已知的关键点坐标,然后训练模型去预测这些被掩盖的值,从而学习到数据的时空结构。这与 BERT 在自然语言处理中“完形填空”的思路类似。
- 潜在表示 (Latent Representation):深度学习模型在内部学习到的、对原始数据的一种压缩和抽象的表达。DISK 在学习插补的过程中,其内部编码器会生成一个低维的潜在向量,这个向量被认为捕捉了动物的“动作”或“行为状态”。
- 下游分析 (Downstream Analysis):在数据被插补完整后进行的科学分析,例如检测步态周期、量化运动速度、比较不同实验组(如药物 vs. 对照组)的行为差异。本文的核心论点是:更好的插补能带来更可靠的下游分析结果。
- 多动物场景 (Multi-animal Setup):同时追踪多个动物(如两只小鼠互动)的场景。这带来了额外的挑战,如动物之间的遮挡、身份交换(ID switching)等,导致数据缺失模式更复杂。
- 标记式 vs. 无标记式追踪 (Marker-based vs. Markerless Tracking):标记式追踪需要在动物身上粘贴反光标记,精度高但侵入性强;无标记式追踪直接从视频中分析,非侵入性但更易出错。DISK 声称适用于两种系统的输出。
三、这个领域的人在关心什么¶
动物行为学的研究者正在追问一个根本问题:如何将动物的复杂、连续的行为,客观、可量化地分解为基本单元(行为“词汇”),并理解这些单元如何受基因、神经回路、药物和环境的影响? 传统的做法是人工观察和编码,但这种方法耗时、主观、难以规模化。过去十年,基于深度学习的姿态估计工具(如 DeepLabCut, Mathis et al., 2018; SLEAP, Pereira et al., 2022)革命性地解决了“如何追踪”的问题,使得从视频中提取高维、高帧率的运动轨迹成为可能。
然而,这带来了一个新的瓶颈:数据质量。在真实的实验环境中,追踪数据几乎总是存在缺失。一个常见的场景是,当小鼠转身或跳跃时,其爪子或尾巴会被身体遮挡,导致追踪器丢失。如果简单地丢弃这些缺失帧,会破坏时间序列的连续性,并可能引入选择偏差(例如,只分析“简单”的运动)。如果使用简单的线性插值,则会忽略关键点之间复杂的非线性耦合关系(例如,一个爪子的运动会影响身体重心的位置,进而影响另一个爪子的运动),导致下游分析(如步态检测)产生错误。
当前主流的方法和局限是: - 线性插值:简单快速,但假设运动是线性的,无法处理复杂的非线性动力学,尤其当缺失段较长时效果极差。 - 基于物理模型的插值:如卡尔曼滤波或平滑样条,需要假设一个运动模型(如恒定速度),在快速、非周期性的行为中表现不佳。 - 人工标注:最准确,但极其昂贵、耗时,且在不同标注者间存在主观性,无法规模化处理海量数据。
本文的 DISK 正是针对这些局限,提出了一种数据驱动、无需模型假设、无需人工标注的填补方法。它不依赖于任何先验的运动模型,而是直接从大量数据中学习关键点之间的时空依赖关系。与上述方法相比,DISK 的优势在于:(1) 能处理长段、复杂的缺失模式;(2) 能利用多关键点之间的空间约束;(3) 完全自动化。
四、数据问题¶
- 数据来源:通过视频录制动物行为实验,然后使用姿态估计软件(如 DeepLabCut, SLEAP)或标记式运动捕捉系统从视频中提取关键点坐标。本文使用了7种不同的动物数据集,包括小鼠、果蝇、斑马鱼、线虫等,涵盖了单动物和多动物场景。
- 数据形态:多变量时间序列。每一帧是一个高维向量,包含所有关键点的 (x, y) 坐标(或 (x, y, z))。维度 = 关键点数量 × 坐标维度(通常为2或3)。时间长度从数百帧到数万帧不等。
- 结构特征:
- 空间图结构:关键点之间通过骨架连接,形成图结构。这是强先验信息,但 DISK 并未显式利用图神经网络,而是通过全连接网络隐式学习。
- 时间序列结构:运动是连续的,因此时间序列具有强自相关性和平滑性。
- 周期性:许多行为(如行走、奔跑)具有周期性,这为插补提供了额外的结构。
- Noise & 测量误差:噪声主要来自姿态估计器的输出,通常是非高斯的,表现为“抖动”(jitter)或“跳跃”(jump)。缺失数据本身不是噪声,而是信息完全丢失。
- Selection / Bias / 缺失 / Censoring / Truncation / 计算约束:
- 缺失模式:非随机缺失 (MNAR) 是核心问题。缺失通常发生在快速运动、遮挡或动物身体自遮挡时,这些正是行为分析中最关键的时刻。因此,简单地删除缺失数据会引入严重的选择偏差,使分析偏向于“简单”或“慢速”的行为。
- 计算约束:训练一个深度学习模型需要GPU,但推理(插补)过程相对快速。本文的 DISK 作为一个独立软件包发布,旨在降低使用门槛。
- 哪些是“漂亮的统计学问题”,哪些是“纯工程或纯领域难题”?
- 漂亮的统计学问题:非随机缺失下的插补是一个经典的统计挑战。如何利用时空依赖结构(如低秩性、图结构、函数型数据)来建模缺失数据,并给出不确定性量化,是统计学家可以大展身手的地方。选择偏差的纠正也是一个核心问题。
- 纯工程或纯领域难题:深度学习模型的具体架构设计(如 Transformer 的层数、注意力头数)、训练策略(如 masking 比例)、以及针对不同动物骨架的调参,更多是工程优化。领域难题包括如何定义“好的”插补(是像素级精度还是下游行为检测的准确性?),以及如何验证插补结果在生物学上的合理性。
五、方法与模型问题¶
- 文章用的分析方法:DISK 的核心是一个基于 Transformer 的深度神经网络。其工作流程如下:
- 输入:一个包含缺失值的关键点坐标时间序列片段。缺失值被标记为特殊的“掩码”(mask)。
- 编码:模型首先将每个关键点的坐标和掩码信息嵌入到一个高维空间。然后,一个时间 Transformer 处理时间维度,捕捉每个关键点随时间变化的动力学;一个空间 Transformer 处理空间维度,捕捉同一帧内不同关键点之间的依赖关系。这两个 Transformer 是交替或并行工作的。
- 解码:模型输出每个关键点在每一帧的预测坐标,包括对缺失位置的预测。
- 训练:模型通过自监督学习训练。在训练时,随机掩盖一部分已知的关键点坐标,然后让模型去预测这些被掩盖的值。损失函数是预测值与真实值之间的均方误差(MSE)。这样,模型就学会了利用时空上下文来填补“空洞”。
- 关键假设:
- 时空平滑性与相关性:这是模型能够工作的根本前提。如果运动是完全随机的,任何插补都无法成功。
- 数据量足够:深度学习模型需要大量数据来学习有效的时空模式。
- 缺失模式与训练时的掩盖模式相似:模型在训练时随机掩盖,但实际缺失往往是结构化的(如连续帧的同一关键点)。模型需要泛化到这种模式。
- 推断 / 计算手段:深度学习(Transformer)。训练使用梯度下降和反向传播。推理是前向传播。
- 核心结论 + 不确定性量化:
- 核心结论:DISK 在多种动物数据集上,在插补精度(MSE)上显著优于线性插值和基线深度学习方法。更重要的是,使用 DISK 插补后的数据,在下游分析(如步态检测)中能检测到更多的运动事件,并且在比较不同实验条件时,统计结果更稳健(即更少的假阳性或假阴性)。
- 不确定性量化:几乎没有。本文没有为插补值提供任何置信区间或预测区间。这是一个显著的统计缺陷。模型输出的是一个点估计,用户无法知道这个估计有多可靠。对于关键的科学结论,这可能是危险的。
六、对统计学家的判断¶
-
这篇文章作为科普读物质量如何?
- 评分:4/5 星
- 理由:对非动物行为学背景的统计学家来说,这是一篇非常好的入门读物。问题设定(追踪数据缺失)清晰直观,方法框架(自监督学习填补时空数据)易于理解,且论文用大量篇幅展示了插补如何影响下游分析,这让统计学家能立刻看到“数据质量”与“科学结论”之间的直接联系。缺点是对缺失机制(MNAR)的讨论不够深入,且完全没有不确定性量化,这可能会让统计学家感到不满足。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:非常高。这个问题本身——如何从嘈杂、不完整的运动数据中可靠地提取行为——是连接“原始观测”和“科学知识”的核心桥梁。它触及了几乎所有实证科学都会遇到的普遍问题:数据缺失和测量误差。了解动物行为学家如何用深度学习工具解决这个问题,对任何关心数据质量的统计学家来说都是一种有益的“开眼界”。
- 方法学空间:巨大。本文的方法学空间是开放的,而非封闭的。它提出了一个清晰的统计挑战,但给出的解决方案(纯深度学习点估计)在统计学家看来只是一个起点。这里有大量的口子:
- 不确定性量化 (UQ):这是最明显的缺口。如何为插补值提供合理的置信区间?可以尝试贝叶斯深度学习、深度集成、或基于 conformal prediction 的方法。
- 缺失机制建模:本文假设缺失是随机的(通过随机掩盖训练),但实际缺失是 MNAR。一个更严谨的统计模型应该显式地对缺失机制进行建模(例如,使用 selection model 或 pattern-mixture model),以纠正由此产生的偏差。
- 利用低秩结构:关键点坐标的时间序列通常具有低秩性(因为运动由少数几个“行为基元”驱动)。可以探索使用矩阵补全(matrix completion)或函数型主成分分析(FPCA)等方法,这些方法天然地处理缺失数据,并能提供不确定性度量。
- 因果推断的接口:下游分析(如比较药物组和对照组的行为)本质上是一个因果推断问题。如果插补过程引入了偏差,那么后续的因果估计也会是有偏的。如何将插补的不确定性传播到因果效应估计中,是一个有趣且有价值的问题。
- 现实相关性:非常高。缺失数据是几乎所有领域(医学、经济学、社会科学、气候学)的普遍问题。本文所面对的“高维、强时空依赖、非随机缺失”的数据模式,在传感器数据、脑成像数据、金融时间序列中都非常常见。因此,这里发展出的统计思想(即使不是具体算法)具有很强的可迁移性。
- 明确结论:很有意思值得留意。虽然方法本身是纯深度学习应用,但它揭示了一个具有丰富统计内涵的科学问题。对于关心缺失数据、测量误差、选择偏差和不确定性量化的统计学家来说,这是一个绝佳的“问题矿藏”。
-
武器库匹配度:
- 无明显接口,纯科普阅读。你的武器库(非参数统计、高维渐近、因果推断、U-统计量)与本文的核心方法(Transformer 自监督学习)没有直接的技术重叠。虽然你可以用非参数回归或矩阵补全的思想来思考一个更“统计”的替代方案,但这属于“问题发现”而非“方法迁移”。本文的价值在于让你看到一个有趣的、值得投入统计智慧的科学问题,而不是提供一个可以直接套用的统计工具。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述 / 科普:
- 本文的引言部分已经是一个很好的起点。此外,可以阅读 DeepLabCut 的原始论文:Mathis, A., et al. (2018). "DeepLabCut: markerless pose estimation of user-defined body parts with deep learning." Nature Neuroscience. 这篇论文是姿态估计领域的奠基之作,能让你理解数据是如何产生的。
- 关键的奠基或代表论文:
- Pereira, T. D., et al. (2022). "SLEAP: A deep learning system for multi-animal pose tracking." Nature Methods. 这是多动物追踪的标杆工具,本文的数据集之一就来自 SLEAP。阅读它可以了解多动物场景下的数据缺失问题有多复杂。
- Graving, J. M., et al. (2019). "DeepPoseKit, a software toolkit for fast and robust animal pose estimation using deep learning." eLife. 另一个重要的姿态估计工具,其设计哲学和数据处理流程值得了解。
- 可以动手玩的公开数据集 / 挑战赛:
- 本文的代码和数据是开源的,可以从其 GitHub 仓库 (
https://github.com/bozeklab/DISK.git) 获取。这是最直接的动手资源。你可以下载一个小鼠数据集,人为制造缺失,然后用 DISK 插补,再尝试用简单的统计方法(如线性插值、矩阵补全)做对比,亲身体验不同方法的优劣。
- 本文的代码和数据是开源的,可以从其 GitHub 仓库 (
- 入门综述 / 科普:
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Pose Estimation | 姿态估计 | 从图像/视频中推断动物身体关键部位(如关节)坐标的技术。 |
| Keypoint | 关键点 | 被追踪的特定身体部位,如“左前爪”、“鼻子”。 |
| Skeleton | 骨架 | 由关键点及其连接关系构成的图,定义身体拓扑。 |
| Tracking Data | 追踪数据 | 所有关键点在每一帧的坐标集合,是一个多变量时间序列。 |
| Imputation | 插补 | 用合理的估计值替换缺失数据的过程。 |
| Spatiotemporal Dependencies | 时空依赖性 | 关键点坐标在空间上(同一帧内)和时间上(相邻帧间)的相关性。 |
| Self-Supervised Learning | 自监督学习 | 一种无需人工标签的训练方法,通过预测数据自身的一部分来学习。 |
| Masking | 掩盖 | 在训练时故意隐藏一部分数据,让模型去预测,是自监督学习的常用技巧。 |
| Latent Representation | 潜在表示 | 模型内部学习到的对原始数据的低维、抽象表达,可捕捉“动作”或“状态”。 |
| Downstream Analysis | 下游分析 | 数据插补完成后进行的科学分析,如检测步态、比较实验组差异。 |
| Markerless Tracking | 无标记追踪 | 直接从视频中分析动物姿态,无需在动物身上粘贴标记。 |
| MNAR (Missing Not At Random) | 非随机缺失 | 数据缺失的概率与缺失值本身有关,是追踪数据中最棘手的缺失类型。 |
| Transformer | 变换器 | 一种基于自注意力机制的深度学习架构,擅长捕捉长距离依赖关系。 |
Maintained by 陈星宇 · Homepage · Source on GitHub