跳转至

Inference for sparsely sampled Gauss-Markov processes under outcome-dependent dropout

作者: Alexander Aue, Siegfried H\"ormann, Maximilian Ofner
主题: 非参数 / 半参数
相关性: 7/10
链接: https://arxiv.org/abs/2609.23617


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是稀疏纵向/函数型数据的分布建模。其根本科学问题是:当每个个体只在少数几个(可能是随机的)时间点被观测时,如何从这些碎片化的观测中恢复潜在随机过程的完整分布特征——而不仅仅是均值与协方差函数。传统函数型数据分析(FDA)的主流范式(如 Yao et al. 2005 的 PACE 方法)以均值函数和协方差函数为核心对象,通过平滑技术估计这两个二阶矩,再以此为基础进行主成分分析、回归与预测。然而,二阶矩并不足以刻画一个随机过程的完整分布;对于需要预测未来轨迹的分布、计算首达时间(first-passage time)、构造预测带等"分布级"推断任务,仅靠均值与协方差是不够的。本文的切入点正是:将潜在过程建模为线性随机微分方程(SDE)的解(Gauss-Markov 过程),从而获得一个完整的概率模型,并在此模型下发展似然推断。

这个方向的成熟度处于上升期但尚未定型。SDE 驱动的函数型数据建模在近五年开始受到关注(如 Comte & Genon-Catalot 2020、Mohammadi et al. 2024、Zhou & Müller 2025),但大多数工作仍聚焦于特定观测方案(如完全观测或密集观测)或特定推断目标(如轨迹重建)。本文的独特之处在于同时处理两个在实际应用中普遍存在、但在 FDA 文献中很少被联合考虑的困难:稀疏观测与结果依赖的脱落(outcome-dependent dropout, ODD)。

发展脉络(history)

奠基工作: 稀疏函数型数据的方法论基础由 Yao et al.(2005)奠定——他们提出了在稀疏、不规则观测下估计均值与协方差函数的局部平滑方法,并建立了 PACE(Principal Analysis by Conditional Expectation)算法。这一工作确立了"先估计二阶矩、再以此为基进行下游推断"的 FDA 标准范式。同期,Li and Hsing(2010)给出了稀疏设计下非参数均值与协方差估计的一致收敛速度,为后续理论分析提供了基准框架。

主要进展: 将 SDE 引入函数型数据建模是近年来的重要突破。Comte and Genon-Catalot(2020)首次系统研究了基于 i.i.d. SDE 路径的漂移函数非参数估计,但假设路径被连续观测。Mohammadi et al.(2021/2024)将这一框架推广到稀疏观测,建立了从稀疏样本估计 SDE 漂移与扩散系数的矩方法——其核心思想是:先估计均值与协方差函数,再利用 SDE 系数与矩之间的微分方程关系反解出漂移与扩散。这一方法在完全随机缺失(MCAR) 下是有效的,但正如本文作者所指出的,它在 ODD 下会产生系统性偏差,因为观测到的样本不再是潜在过程的无偏代表。Zhou and Müller(2025)则从另一个角度切入,关注稀疏函数型数据的轨迹重建,但同样未处理非随机缺失。

当前 frontier 与本文位置: 当前的前沿问题是如何在非随机缺失下进行函数型数据的分布推断。本文直接回应了这一挑战:作者证明了 ODD 机制满足 MAR 条件(Proposition 3),从而似然推断可以忽略缺失机制而保持有效性——这是 Rubin(1976)经典 MAR 理论在函数型数据场景下的直接应用。在此基础上,本文提出了筛子极大似然估计(sieve MLE),建立了收敛速度(Theorem 4),并证明了 minimax 最优性(Theorem 6)。与 Mohammadi et al.(2024)的矩方法相比,本文的似然方法在 ODD 下避免了偏差;与 Zhou and Müller(2025)的轨迹重建相比,本文提供了完整的分布模型,从而支持预测带、首达时间等分布级推断。

子线索聚类

被引文献大致落在三条子线索上:

  1. 稀疏函数型数据的二阶矩估计(Yao et al. 2005; Li and Hsing 2010):核心问题是"如何从稀疏观测中估计均值与协方差"。方法以局部平滑为主,理论以一致收敛速度为核心。已知瓶颈: 二阶矩不刻画分布,且对缺失机制敏感。

  2. SDE 驱动的函数型数据建模(Comte & Genon-Catalot 2020; Mohammadi et al. 2021/2024; Zhou & Müller 2025):核心问题是"如何从离散观测中恢复 SDE 的系数"。方法包括矩匹配(moment matching)与轨迹重建。已知瓶颈: 矩方法依赖 MCAR 假设,在 ODD 下有偏;轨迹重建方法不提供完整分布。

  3. 缺失数据机制与纵向推断(Rubin 1976; Seaman et al. 2013; Farewell et al. 2022; Wilson et al. 2025):核心问题是"缺失机制何时可以被忽略"。MAR 框架提供了理论基准,但在函数型数据场景下的应用尚不成熟。本文的 Proposition 3 正是将 MAR 理论推广到 ODD 机制下的函数型数据。

本文的位置: 本文处于线索 2 与线索 3 的交汇处——用 SDE 提供分布模型(线索 2),用 MAR 理论处理缺失机制(线索 3),从而填补了"非随机缺失下的分布级函数型推断"这一空白。

这个方向在追问的核心问题

  1. 分布级推断的可识别性: 在稀疏观测下,SDE 的漂移与扩散系数是否可识别?本文通过假设每个个体至少有两个观测点(n_i ≥ 2)来保证转移密度的可识别性,但更一般的观测方案(如部分个体只有一个观测点)下的可识别性条件尚不明确。

  2. 非随机缺失下的推断有效性: 矩方法在 ODD 下有偏,似然方法在 MAR 下有效——但当缺失机制是 MNAR(非随机缺失)时,似然方法是否仍然稳健?本文未涉及这一更困难的情形。

  3. 最优收敛速度的刻画: 本文证明了 sieve MLE 在加权范数下的 minimax 最优性(至多差对数因子),但常数项是否最优、以及是否存在自适应达到最优常数的方法,仍是开放问题。

  4. 计算可行性: 筛子极大似然估计涉及高维非线性优化(参数维度 d = 3M + 2 随 M 增长),本文未讨论计算复杂度或全局收敛性保证。

⚠️ 作者的 framing(这是作者的说法)

作者将本文的核心贡献 frame 为:"在 ODD 下,似然方法优于矩方法"。具体而言,作者声称:(i) 矩方法在 ODD 下不一致,而似然方法一致(Section 3.3 与 Appendix A 的示例);(ii) 似然方法在扩散系数上达到更快的收敛速度(Theorem 4);(iii) 该速度是 minimax 最优的(Theorem 6)。作者还强调,完整的概率模型使得"预测带、首达时间、肿瘤年龄估计"等分布级推断成为可能——这是矩方法无法提供的。

被淡化或回避的竞争路线: 作者将矩方法(Mohammadi et al. 2024)作为主要对比基准,但没有讨论:(a) 贝叶斯方法(如基于 MCMC 的 SDE 后验推断)在 ODD 下的表现;(b) 半参数方法(如基于加权估计方程的稳健推断)是否能在 ODD 下达到类似效果;(c) 当 SDE 模型设定错误时(如真实过程不是 Gauss-Markov),似然方法的稳健性如何。

明显该被引、却没出现在 intro 里的: 作者没有引用 Rubin 因果推断框架下的工具变量方法或边际结构模型——这些方法同样处理非随机缺失/依从性问题,且与本文的 MAR 论证有潜在联系。此外,Tsybakov(2009) 的 minimax 下界技术被用于 Theorem 6 的证明,但作者没有引用 Donoho & Liu(1991) 或 Ibragimov & Has'minskii(1981) 等更早的 minimax 下界经典文献。

张力

未见明显对立引用。 被引文献之间没有直接矛盾。不过存在一个隐含张力:Yao et al.(2005)和 Li and Hsing(2010)的矩方法框架假设 MCAR,而本文的似然方法假设 MAR——这两者在 ODD 下给出不同结论(矩方法有偏,似然方法无偏)。这并非文献间的矛盾,而是不同假设下的必然差异,但作者没有明确讨论"当 ODD 的阈值 δ₀ 未知时,MAR 假设是否仍然成立"这一关键问题。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

潜在过程(目标对象): - 对每个个体 i = 1, …, N,存在一个潜在随机过程 X_i = (X_i(t) : t ∈ [0, T]),满足线性 SDE: dX_i(t) = [b₁(t)X_i(t) + b₂(t)]dt + σ(t)dB_i(t),X_i(0) ~ N(m₀, v₀)。 - 参数 / 待估对象(estimands): - b₁(t):漂移系数中的乘性项(t 的函数),控制均值回归速度。 - b₂(t):漂移系数中的加性项(t 的函数),控制时间趋势。 - σ(t):扩散系数(t 的函数),控制瞬时波动率。 - m₀, v₀:初始分布的均值与方差(标量)。 - 已知 / 假设已知: - B_i 为标准布朗运动,独立于 X_i(0)。 - b₁, b₂, σ 均为 [0, T] 上的光滑函数(满足 Assumption 3 的 Fourier 系数多项式衰减条件)。 - σ(t) > 0 对所有 t ∈ [0, T]。

可观测数据: - 对每个个体 i,观测时间点 T_{i1} < … < T_{in_i} 在 [0, T] 上独立均匀分布(与 X_i 独立)。 - 观测值 X_{ij} = X_i(T_{ij}),j = 1, …, n_i。 - 关键: 观测是否发生受 ODD 机制控制——个体 i 的第 j 个观测点 T_{ij} 被观测当且仅当 max{X_{i1}, …, X_{i,j-1}} ≤ δ₀(即此前所有观测值均未超过阈值 δ₀)。一旦某个观测值超过 δ₀,该个体后续所有观测点均缺失。 - 可观测数据形态: 对每个个体 i,观测到 (T_{i1}, X_{i1}), …, (T_{i,n_i}, X_{i,n_i}),其中 n_i 是随机变量(取决于 X_i 是否首次超过 δ₀)。

重要区分: - 可观测: (T_{ij}, X_{ij}) 对,j = 1, …, n_i。 - 不可观测(潜在): X_i 在未观测时间点的取值;超过 δ₀ 之后的全部轨迹;n_i 的截断机制本身(即"本应观测但被截断"的观测点)。

第二步:最小内核

最小设定: 假设每个个体恰好有 n_i = 2 个观测时间点(T_{i1} < T_{i2}),且 T_{i1} 和 T_{i2} 独立均匀分布在 [0,1] 上。ODD 机制简化为:第二个观测点 T_{i2} 被观测当且仅当 X_{i1} ≤ δ₀。若 X_{i1} > δ₀,则个体 i 只有第一个观测点。

核心数学问题: 给定可观测数据 {(T_{i1}, X_{i1}, T_{i2}, X_{i2}) : i = 1, …, N}(其中 X_{i2} 可能缺失),估计参数 (b₁, b₂, σ, m₀, v₀)。

为什么矩方法会失败: 矩方法(如 Mohammadi et al. 2024)首先估计均值函数 μ(t) = E[X(t)] 和二阶矩函数 ν(t) = E[X²(t)],然后利用 ODE 关系 b₁ = μ̇/μ 和 σ² = ν̇ − 2b₁ν 反解参数。但在 ODD 下,观测到的样本均值 E[X_{i2} | X_{i1} ≤ δ₀] 不等于无条件均值 E[X_{i2}],因为 X_{i2} 的观测概率与 X_{i1} 的取值相关(X_{i1} 越大,越可能超过 δ₀ 导致缺失)。因此,矩估计量收敛到条件矩而非无条件矩,产生系统性偏差。

为什么似然方法有效: 关键在于 Proposition 3 证明的 MAR 性质。ODD 机制下,观测指标 I_{ij}(第 j 个观测是否发生)只依赖于已观测到的历史值 {X_{i1}, …, X_{i,j-1}},而不依赖于当前或未来的潜在值 X_{ij}。这正是 Rubin(1976)MAR 的定义。在 MAR 下,观测数据的似然函数可以分解为"完整数据的似然"乘以"缺失机制的似然",而后者不包含参数信息。因此,最大化观测似然等价于最大化完整数据似然,从而得到一致估计。

最小例子的数学表述: 在 n_i = 2 的设定下,观测似然为:

L_obs = ∏{i: X{i1} ≤ δ₀} f(X_{i1}, X_{i2} | T_{i1}, T_{i2}) × ∏{i: X{i1} > δ₀} f(X_{i1} | T_{i1}) × P(X_{i1} > δ₀ | T_{i1})

其中 f 是 Gauss-Markov 过程的转移密度(由 SDE 参数决定)。关键观察: 第二项 P(X_{i1} > δ₀ | T_{i1}) 虽然依赖于参数,但它正是"完整数据似然"中 X_{i1} 的边缘密度在 (δ₀, ∞) 上的积分——它不包含缺失机制的任何额外参数。因此,最大化 L_obs 等价于最大化完整数据似然,矩方法中出现的"条件化偏差"在似然框架中被自动消除。

这个最小内核揭示了本文的核心数学贡献: 在 ODD 下,似然函数仍然"知道"缺失机制的结构(因为它通过观测到的 X_{i1} 值隐式地包含了截断信息),而矩方法丢弃了这种结构信息,只使用观测值的边际矩,从而丢失了识别所需的信息。


三、这篇论文做了什么

三句话

  1. 研究了什么问题: 在稀疏观测且存在结果依赖脱落(ODD)的纵向数据中,如何一致地估计驱动潜在 Gauss-Markov 过程的漂移与扩散系数,并实现分布级推断。
  2. 核心工具 / 方法: 利用 ODD 机制的 MAR 性质,建立筛子极大似然估计(sieve MLE),直接估计 SDE 的系数函数,而非通过二阶矩间接反解。
  3. 主要结论: 在加权范数下建立了 sieve MLE 的收敛速度(Theorem 4),并证明该速度是 minimax 最优的(至多差对数因子,Theorem 6);模拟和肿瘤数据应用展示了似然方法在 ODD 下优于矩方法,并支持预测带、首达时间等分布级推断。

关键设定与假设

  • Assumption 1(初始分布): X(0) ~ N(0, v₀),v₀ > 0。这保证了过程在 t = 0 附近有非退化变异,避免识别退化。
  • Assumption 2(稀疏观测): 每个个体恰好 n_i = 2 个观测点。这是最稀疏的可识别设计——少于 2 个观测点无法识别转移密度。作者指出推广到 n_i ≥ 2 是直接的,但理论分析聚焦于 n_i = 2 以简化记号。
  • Assumption 3(光滑性): b₁, b₂, σ 的 Fourier 系数满足 |b₁ₖ|, |b₂ₖ|, |σₖ| ≤ Ck^{-β},β > 1。这保证了系数函数的 Hölder 光滑性,是 sieve 逼近误差分析的标准条件。
  • ODD 机制(Proposition 3): 观测指标只依赖于已观测的历史值,即 MAR。这是似然推断有效性的核心假设。相比已有工作的放宽: Mohammadi et al.(2024)隐含假设 MCAR;本文将其放宽到 MAR。相比已有工作的强化: 本文假设 ODD 的阈值 δ₀ 是已知常数;若 δ₀ 未知,MAR 性质可能不再成立(因为缺失机制本身包含未知参数)。

主要结果

Theorem 4(加权范数下的收敛速度):设 M ~ N^{1/(2β)},则 ∥b̂₁_N − b₁₀∥²_b + ∥b̂₂_N − b₂₀∥²_b + ∥σ̂²_N − σ₀²∥²_σ = O_p(log(N) · N^{-(2β-1)/(2β)})。

  • 直觉:速度由两个因素决定——sieve 逼近误差(M^{-2β})和估计方差(M/N)。最优平衡 M ~ N^{1/(2β)} 给出上述速度。
  • 必要条件:β > 1(光滑性),v₀ > 0(初始变异),n_i ≥ 2(可识别性)。
  • 技术难点:ODD 使得观测似然不再是完整数据的简单乘积,而是包含截断概率的复杂函数。作者通过证明 MAR 性质,将观测似然分解为"完整数据似然 × 缺失机制似然",从而将问题转化为标准 sieve MLE 分析。

Theorem 6(minimax 最优性):存在常数 c > 0,使得 liminf_{N→∞} inf_{b̂} sup_{P∈P} P(∥b̂ − b₀∥²_L2 ≥ c · N^{-(2β-1)/(2β+2)}) > 0。

  • 含义:Theorem 4 的 L² 速度(由 Corollary 5 给出)在 minimax 意义下是最优的(至多差 log 因子)。
  • 证明路线:构造两个参数值 b⁽¹⁾, b⁽²⁾,使得它们在 L² 范数下相距 2s,但对应的观测分布之间的 KL 散度有界。然后应用 Tsybakov(2009)的 Theorem 2.5。

Corollary 5(L² 范数下的收敛速度): ∥b̂₁_N − b₁₀∥²_L2 = O_p(log(N) · N^{-(2β-1)/(2β+2)}), ∥σ̂²_N − σ₀²∥²_L2 = O_p(log(N) · N^{-(2β-1)/(2β+1)})。

  • 注意:σ² 的速度快于 b₁, b₂,因为扩散系数通过条件方差识别,其信息矩阵条件数更优。

证明路线与技术技巧

整体路线(以 Theorem 4 为例):

  1. MAR 分解:证明观测似然 L_obs 与完整数据似然 L_full 之差只依赖于缺失机制,而缺失机制不包含参数信息。因此,最大化 L_obs 等价于最大化 L_full。
  2. 局部二次逼近:将 L_obs 在真值 θ₀ 处做二阶 Taylor 展开,得到 L_obs(θ) − L_obs(θ₀) ≈ −(1/2)(θ − θ₀)ᵀ I(θ₀)(θ − θ₀) + 噪声项, 其中 I(θ₀) 是 Fisher 信息算子。
  3. 信息算子的特征值分析:证明 I(θ₀) 在加权范数 ∥·∥_b 和 ∥·∥_σ 下是有界可逆的。这是最技术性的部分——需要利用 Gauss-Markov 过程的转移密度结构,将信息算子与积分算子联系起来,并借助 Fourier 基下的对角化。
  4. 经验过程控制:用 Bernstein 不等式和 chaining 技术控制噪声项的 sup-norm,得到 sup_{θ: d(θ,θ₀)≤r} |(L_obs − L)(θ) − (L_obs − L)(θ₀)| = O_p(√(M log M / N) · r)。
  5. 结合逼近误差:将 sieve 逼近误差(M^{-2β})与估计方差(M/N)平衡,得到最终速度。

关键技巧点名:

  • 加权范数设计:∥f∥²_b 和 ∥f∥²_σ 不是标准的 L² 范数,而是根据似然的 Fisher 信息设计的自适应范数。这使得信息算子的条件数有界,避免了标准 L² 分析中的技术困难。
  • Fourier 基对角化:利用余弦基下积分算子的近似对角化,将无限维问题转化为有限维特征值问题。
  • Tsybakov 下界:在 Theorem 6 中,使用 Varshamov-Gilbert 引理构造 2^{m/8} 个分离的参数点,然后应用 KL 散度的 tensorization 性质。

真实例子与应用

肿瘤生长数据(Section 7):N = 66 只小鼠的肿瘤体积数据,观测至肿瘤体积超过 2 cm³ 即终止(ODD 机制,阈值 δ₀ = log(2))。

  • 数据使用方式:对 log 变换后的肿瘤体积建模为 Gauss-Markov 过程(即原始尺度上的 Gompertz 型生长模型)。
  • 三个推断任务:
  • 预测带:利用 Doob 表示构造同时预测带(Proposition 8),覆盖未来肿瘤轨迹的 75% 概率。作者指出,矩方法无法构造这样的预测带,因为它不提供完整条件分布。
  • 首达时间:利用 Volterra 积分方程(15)计算肿瘤达到 2 cm³ 的首达时间密度。估计的中位首达时间为 34 天,与观测数据一致。
  • 肿瘤年龄估计:利用似然框架估计未知的时间平移 λ(即肿瘤的"年龄"),通过最大化观测似然得到。预测误差的中位绝对偏差约为 2 天。
  • 例子想说明什么:完整的概率模型使得"分布级"推断成为可能,而不仅仅是二阶矩推断。作者特别指出,矩方法在 ODD 下不仅参数估计有偏,而且无法提供预测带和首达时间等推断——这些是分布级推断的核心对象。

🔎 结论是否比证明窄

是的,存在几处"证明窄于结论"的地方:

  1. Theorem 4 的加权范数 vs Corollary 5 的 L² 范数:Theorem 4 的证明是在加权范数 ∥·∥_b 和 ∥·∥_σ 下完成的,但 Corollary 5 声称 L² 范数下的速度。作者在 Appendix D 中通过 Lemma 21-23 建立了加权范数与 L² 范数之间的不等式,但这些不等式依赖于 M 的选取(M ~ N^{1/(2β)} 或 N^{1/(2β+1)}),且常数可能不是最优的。严格来说,L² 速度的证明需要额外的条件(如 Fourier 系数的下界),这些条件在正文中没有明确陈述。

  2. Theorem 6 的 minimax 下界仅覆盖 L² 范数:下界是针对 L² 范数建立的,但 Theorem 4 的证明是在加权范数下进行的。加权范数下的 minimax 最优性并未被证明——虽然直觉上应该成立,但技术上需要重新构造下界。

  3. ODD 机制的普适性:Proposition 3 证明的 MAR 性质是针对阈值型 ODD(观测终止当且仅当历史最大值超过 δ₀)的。作者在结论中声称该方法适用于"更一般的 ODD 机制",但没有给出任何形式化的论证。例如,若观测概率依赖于当前值 X_{ij} 本身(而非历史最大值),MAR 性质可能不再成立。

  4. n_i = 2 的限制:Assumption 2 假设每个个体恰好 2 个观测点。作者声称推广到 n_i ≥ 2 是直接的,但没有给出推广后的收敛速度。对于 n_i 随 N 增长的情形(半密集观测),速度可能会改变。


四、开放问题

以下问题均扎根于本文的具体语句:

  1. 未知阈值 δ₀ 的估计:本文假设 ODD 的阈值 δ₀ 已知(Section 3.2)。若 δ₀ 未知,MAR 性质是否仍然成立?似然函数将包含缺失机制的参数,需要联合估计。这直接关系到 Rubin(1976)框架中"忽略缺失机制"的适用边界。扎根点:Proposition 3 的证明依赖于 δ₀ 已知。

  2. 非 Gauss-Markov 过程的推广:本文的模型是线性 SDE(2),其解是 Gauss-Markov 过程。对于非线性漂移或非高斯噪声(如跳跃扩散),似然函数不再有显式表达式,sieve MLE 的收敛速度分析需要全新的技术。扎根点:Section 8 提到"nonlinear or non-Gaussian SDE models"作为未来工作。

  3. n_i 随 N 增长时的速度:本文假设 n_i = 2(Assumption 2)。当每个个体的观测次数随 N 增长时,收敛速度是否会改变?是否存在"稀疏"与"密集"观测之间的过渡阈值?扎根点:Section 8 提到"alternative observation and dropout mechanisms"。

  4. 半参数效率:本文建立了 sieve MLE 的收敛速度,但未讨论半参数效率——即 sieve MLE 是否达到半参数效率界(如通过 efficient influence function 刻画)。对于有限维参数(如 m₀, v₀),是否存在比 sieve MLE 更高效的估计量?扎根点:Theorem 4 只给出了收敛速度,未涉及效率。

  5. ODD 与因果推断的连接:本文的 ODD 机制与因果推断中的依从性(noncompliance) 或截断(truncation by death) 问题有结构相似性。将本文的似然框架与因果推断中的 g-computation 或 IPW 结合,可能为处理非随机缺失下的因果效应估计提供新工具。扎根点:Section 1 提到 ODD 在临床试验中的应用(治疗因超过安全阈值而终止)。


提醒:若要确认上述问题是否为真 gap,建议去读以下近期文献的 intro(各约 5 篇):(i) 稀疏函数型数据与 SDE 交叉方向的近期工作(如 Journal of the American Statistical Association 2023-2025 年相关论文);(ii) 缺失数据与因果推断交叉方向的近期综述(如 Statistical Science 上的 missing data 专题);(iii) 筛 MLE 半参数效率的最新进展(如 Annals of Statistics 2024-2025 年相关论文)。若这些文献的 intro 都指向同一问题,则大概率是共识性 gap;若互相矛盾,则可能是机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论