跳转至

Missing at random: a stochastic process perspective

作者: D M Farewell, R M Daniel, S R Seaman
来源: Biometrika
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向致力于为缺失数据(missing data)分析中最核心的假设——“缺失完全随机”(Missing At Random, MAR)——提供一个严格、统一且可扩展的测度论基础。其根本问题是:在什么条件下,我们可以忽略缺失机制(missingness mechanism)而直接对观测到的数据进行似然推断?当前,尽管MAR在应用中被广泛使用,但其定义在连续空间、纵向数据、以及更一般的“粗化”(coarsening)框架下仍存在模糊性,且缺乏一个能自然衔接随机过程理论的数学语言。

发展脉络(history)

  • 奠基工作:Rubin (1976) 奠定了MAR的经典定义,指出在似然推断中,若缺失数据是MAR且观测数据是“观测完全随机”(observed at random),则忽略缺失机制是合理的。这是整个领域的基石。
  • 主要进展与澄清
    • Seaman et al. (2013) 系统性地澄清了MAR定义的模糊性,提供了标准化定义,并区分了不同推断范式(频率学派、贝叶斯)下“有效推断”的含义。本文引用它来强调MAR定义在不可数空间上的适用性。
    • Gill et al. (1997) 和 Lu & Copas (2004) 则进一步研究了MAR条件何时是必要的。Lu & Copas (2004) 在参数模型族内证明,当响应模型是完备的(complete)时,忽略缺失机制的似然推断有效当且仅当缺失机制是MAR。这为MAR的“充分必要性”提供了更精确的刻画。
  • 当前Frontier与本文位置
    • Commenges & Gégout-Petit (2005) 已经将可忽略性(ignorability)条件推广到了随机过程框架,处理了离散时间观测和连续时间删失。本文引用它作为“随机过程视角”的先驱。
    • Farewell et al. (2017) 则从图模型角度,提出了“稳定性”(stability)条件,用于处理一般纵向数据中的可忽略性,且不依赖于“缺失数据”的概念。本文引用它作为其“纵向数据”视角的同类工作。
    • 本文 的定位是:在标准缺失数据框架下,用停时集σ-代数(stopping-set sigma algebra)和集索引滤子(set-indexed filtration)的语言,重新表述MAR条件。它声称其理论比现有工作更“自然”和“可扩展”,能无缝衔接协变量、连续时间纵向数据和更一般的粗化观测。

子线索聚类

  1. 经典MAR定义与澄清:Rubin (1976), Seaman et al. (2013)。核心是定义MAR、MCAR,并讨论其在似然推断中的充分性。
  2. MAR的充分性与必要性:Gill et al. (1997), Lu & Copas (2004)。核心是探究在什么条件下,MAR不仅是充分的,也是必要的。
  3. 随机过程与纵向数据视角:Commenges & Gégout-Petit (2005), Farewell et al. (2017), 本文。核心是将缺失/粗化过程视为一个随机过程,用滤子、停时等工具来刻画可忽略性条件,尤其适用于纵向和连续时间数据。

这个方向在追问的核心问题

  1. MAR的严格定义:在一般(不可数、非离散)空间中,MAR的精确数学定义是什么?如何避免“Y_obs”这类符号带来的模糊性?
  2. 可忽略性的充分必要条件:除了MAR,还需要什么条件(如参数可分离性、模型完备性)才能保证忽略缺失机制是合理的?
  3. 纵向与连续时间数据的可忽略性:当数据是随时间动态观测的(如纵向研究),如何定义和检验可忽略性?经典的MAR定义是否足够?
  4. 粗化数据(Coarsened Data)的统一框架:能否找到一个统一的数学框架,同时涵盖缺失数据、删失数据、分组数据等所有“粗化”情形?

⚠️ 作者的 framing(必须明确标注成"这是作者的说法")

  • 作者把缺口 frame 成什么:作者认为,现有MAR定义(如Rubin, 1976)依赖于“Y_obs”这种符号,它在连续空间中定义模糊,且无法自然处理“观测模式”(pattern of missingness)的动态变化。作者声称,通过引入“停时集σ-代数”和“集索引滤子”,可以提供一个更自然、更严格、且更易于扩展的测度论基础。这使得MAR条件被重新解释为一个可测性条件(即某个随机过程适应于一个滤子),从而与随机过程理论无缝衔接。
  • 哪些竞争路线被他淡化或回避了
    • 作者淡化了图模型方法(如Farewell et al., 2017的“稳定性”条件)。虽然引用了它,但并未深入比较其与本文“停时集”框架在表达力和可操作性上的优劣。作者似乎认为其框架更“基础”。
    • 作者回避了潜在结果框架(Potential Outcomes)下的缺失数据问题。虽然引用了Pearl (2009) 的因果推断,但本文的核心是“看到”(seeing)而非“干预”(doing),并未将MAR与因果识别中的交换性(exchangeability)条件进行深入对比。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
    • 缺失数据的多重插补(Multiple Imputation, MI):MI是处理MAR数据最常用的方法之一,其理论基础(如Rubin的插补规则)与MAR的定义紧密相关。本文作为一篇纯理论论文,未提及MI,可能是一个值得研究者去查的缺口:本文的测度论框架能否为MI提供新的理论洞见或证明?
    • 缺失数据下的半参数效率理论:例如,Tsiatis (2006) 的《Semiparametric Theory and Missing Data》是这一领域的经典。本文未引用,可能意味着其理论尚未与半参数效率界(如Efficient Influence Function)建立联系。这为研究者提供了一个潜在方向:将本文的“停时集”框架与半参数效率理论结合。

张力

未见明显对立引用。所有被引工作基本都认同MAR的核心地位,只是在定义、充分性条件和应用场景上存在细微差异和逐步深化。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • Y:一个随机变量,代表我们想要但可能缺失的完整数据。取值于某个可测空间 (Y, B_Y)
    • M:一个随机变量,代表缺失模式。例如,对于单变量Y,M可以是一个0/1指示变量(1=缺失,0=观测到)。取值于某个可测空间 (M, B_M)
    • R:一个随机变量,代表观测到的数据。它由Y和M共同决定。例如,如果M=0,则R=Y;如果M=1,则R是一个表示“缺失”的特殊符号(如NA)。
    • θ:我们感兴趣的参数,它刻画了Y的分布 P_θ(Y)
    • ψ:缺失机制的参数,它刻画了给定Y时M的条件分布 P_ψ(M | Y)
    • P:完整数据的联合分布,由 P_θ(Y)P_ψ(M | Y) 决定。
    • Q:一个“工作独立性”(working independence)条件分布,定义为 Q(A | M) = P_θ(A | M)。它假设在给定M的条件下,Y的分布与完整数据模型中的条件分布相同,但忽略了缺失机制。这是进行“忽略缺失机制”的似然推断时所使用的分布。
    • σ-代数:一个集合族,对可数并、可数交和补集封闭。它刻画了在某个时刻我们“知道”的信息。
    • 停时集σ-代数:本文的核心创新。它是由所有“停时集”(stopping sets)生成的σ-代数。一个停时集是一个集合,其是否被观测到取决于过去的信息。例如,在纵向数据中,“在时间t之前是否死亡”就是一个停时集。
  • 模型

    • 数据生成机制:首先,从分布 P_θ(Y) 生成一个完整的Y。然后,根据缺失机制 P_ψ(M | Y) 生成M。最后,观测到的数据R是Y和M的函数。
    • 统计模型:我们假设一个参数化或半参数化的模型 {P_θ,ψ: θ∈Θ, ψ∈Ψ}。核心问题是:我们能否仅基于观测到的R(以及M)来推断θ,而无需对ψ进行建模?
  • 可观测数据

    • 研究者实际能观测到的是什么:对于每个个体,我们观测到 (M, R)。即,我们知道缺失模式M,以及在该模式下观测到的数据R。例如,在单变量缺失的例子中,我们观测到 (M, M*Y + (1-M)*NA)
    • 哪些是潜在/不可观测的:完整的Y是永远无法观测到的。我们只能通过假设(如MAR)来“连接”观测到的R和未观测到的Y。

第二步:讲最小内核

最简特例:单变量Y,二值缺失(M=0/1)

在这个最简单的例子中,我们可以剥去所有复杂的测度论,直接看到本文的核心思想。

  • 设定

    • Y是一个随机变量,可能取值于实数轴。
    • M是一个0/1变量,M=1表示Y缺失,M=0表示Y被观测到。
    • 观测数据是 (M, R),其中 R = Y 如果 M=0,否则 R = NA
  • 经典MAR定义

    • 经典定义(Rubin, 1976)说,缺失机制是MAR,如果给定观测到的Y(即 Y_obs),缺失概率与未观测到的Y(即 Y_mis)无关。用公式表示: P(M=1 | Y) = P(M=1 | Y_obs)
    • 在这个二值例子中,Y_obs 就是当 M=0 时观测到的Y值。所以,MAR意味着:对于所有 yP(M=1 | Y=y)y 属于“被观测到的Y的取值集合”时,是一个常数(即只依赖于 Y_obs 的取值,而不依赖于 Y_mis 的取值)。
  • 本文的“随机过程”视角

    • 本文的核心思想是:将“观测过程”视为一个随机过程。在这个二值例子中,我们可以想象一个“观测过程” {Z_t},其中 t 是一个“时间”索引(这里时间就是“是否被观测到”这个事件)。
    • 停时集:在这个例子中,只有一个“停时集”:{Y被观测到}。这个集合是否发生,取决于M。
    • 集索引滤子:本文定义了一个“滤子” {F_S},其中 S 是一个集合。F_S 包含了在“知道S是否被观测到”之前的所有信息。例如,F_{Y被观测到} 包含了在知道Y是否被观测到之前的所有信息(即,只有M的信息)。
    • 核心等价条件:本文证明,经典的MAR条件等价于:随机过程 {P(M=1 | Y)} 适应于由停时集生成的滤子。在这个二值例子中,这意味着:P(M=1 | Y) 这个随机变量,在知道“Y是否被观测到”这个事件之前,就已经是“可测的”(即,可以被确定)。换句话说,P(M=1 | Y) 不能依赖于Y的具体取值,而只能依赖于M本身。这正是MAR的另一种表述。
  • 为什么这个视角有用?

    • 严格性:它避免了“Y_obs”这个模糊符号,用严格的σ-代数语言定义了“已知信息”。
    • 可扩展性:这个“适应于滤子”的条件可以自然地推广到更复杂的情况。例如,在纵向数据中,我们可以定义一系列停时集(如“在时间t是否被观测到”),然后要求缺失概率过程适应于由这些停时集生成的滤子。这比经典MAR定义更直观、更强大。

总结:本文的核心数学贡献是,将MAR这个统计假设,重新表述为一个关于随机过程可测性的条件。这个最小内核告诉我们,整篇论文的本质工作就是:定义“停时集σ-代数”和“集索引滤子”,然后证明经典MAR条件等价于某个随机过程适应于这个滤子。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在标准缺失数据框架下,为“缺失完全随机”(MAR)假设提供一个严格、自然且可扩展的测度论基础。
  2. 核心工具/方法:引入“停时集σ-代数”(stopping-set sigma algebra)和“集索引滤子”(set-indexed filtration)的概念,将观测数据刻画为停时集σ-代数,并将MAR条件重新表述为特定随机过程适应于该滤子的可测性条件。
  3. 主要结论:证明了在这种新框架下,经典MAR条件等价于该可测性条件,并且该条件保证了似然比的标准分解(即,可以忽略缺失机制进行推断)。该理论可自然扩展至含协变量、连续时间纵向数据以及更一般的粗化观测。

关键设定与假设

  • 设定:论文在第二节“Framework”中建立了完整的测度论框架。
    • 完整数据:由一个随机变量 X 表示,取值于可测空间 (X, B_X)X 可以是向量,包含所有感兴趣的变量。
    • 缺失模式:由一个随机变量 M 表示,取值于可测空间 (M, B_M)M 可以是任意复杂的结构,例如一个指示哪些变量被观测到的向量。
    • 观测数据:由一个随机变量 R 表示,它是 (X, M) 的一个确定性函数。论文用 R = f(X, M) 表示,其中 f 是一个已知函数。
    • 联合分布:完整数据的联合分布由 P 表示,其密度(相对于某个乘积测度)为 p(x, m)
    • 工作独立性分布:定义一个“工作独立性”条件分布 Q,其密度为 q(x | m) = p(x | m)Q 是我们在“忽略缺失机制”时使用的分布。
  • 核心假设
    • 参数可分离性:假设 p(x, m) = p_θ(x) * p_ψ(m | x),其中 θψ 是变分独立的参数。这是似然推断中“可忽略性”的标准前提。
    • MAR条件:论文的核心就是重新定义MAR。经典定义是:P(M=m | X) = P(M=m | X_obs),其中 X_obsX 中在模式 m 下被观测到的部分。本文将其重新表述为:随机过程 {P(M=m | X) : m ∈ M} 适应于由停时集生成的滤子
  • 相比已有文献的强化/放宽
    • 强化:相比经典定义,本文的表述在数学上更严格,因为它用σ-代数明确刻画了“已知信息”,避免了“Y_obs”的模糊性。
    • 放宽:本文的框架可以处理更一般的“粗化”模式,而不仅仅是“缺失”。例如,它可以处理区间删失(interval censoring)或分组数据(grouped data),其中观测到的不是一个点,而是一个集合。

主要结果

  • 定理1(似然比分解):在本文的框架下,如果MAR条件(即可测性条件)成立,那么完整数据的似然比 dP/dQ 可以分解为两个部分的乘积:一个部分只依赖于缺失模式M,另一个部分只依赖于观测数据R。这个分解是“忽略缺失机制”进行推断的数学基础。
    • 直觉:这个定理是说,如果缺失机制是MAR,那么完整数据的似然函数可以写成“缺失机制的似然”乘以“观测数据的似然”。由于参数可分离,我们可以忽略缺失机制的部分,只基于观测数据的似然来推断θ。
    • 必要条件:论文在第三节“Necessity”中讨论了逆问题。它指出,在某些条件下(如模型完备性),MAR也是似然比分解的必要条件。这呼应了Lu & Copas (2004) 的工作。
  • 定理2(扩展至协变量):当存在完全观测到的协变量Z时,MAR条件可以自然地扩展为:P(M=m | X, Z) = P(M=m | X_obs, Z)。在本文的框架下,这等价于要求随机过程适应于一个包含Z信息的滤子。
  • 定理3(扩展至连续时间纵向数据):对于连续时间纵向数据,观测时间点本身是随机的。本文的框架可以处理这种情况:将每个可能的观测时间点视为一个“停时”,并定义相应的停时集σ-代数。MAR条件则要求缺失概率过程适应于由这些停时生成的滤子。

证明路线与技术技巧(理论型必写,要具体)

  • 整体路线
    1. 定义停时集σ-代数:首先,严格定义“停时集”和由所有停时集生成的σ-代数 G。这个σ-代数刻画了在知道“哪些集合被观测到”之前的所有信息。
    2. 定义集索引滤子:然后,定义一个由 G 的子σ-代数组成的“滤子” {F_S},其中 S 是一个停时集。F_S 包含了在知道S是否被观测到之前的所有信息。
    3. 重新表述MAR:证明经典MAR条件等价于:对于每个缺失模式 m,随机变量 P(M=m | X)G-可测的。这等价于说,随机过程 {P(M=m | X) : m ∈ M} 适应于滤子 {F_S}
    4. 证明似然比分解:利用上述可测性条件,通过测度论中的Radon-Nikodym定理和条件期望的性质,证明 dP/dQ 可以分解为 dP_M/dQ_MdP_R|M/dQ_R|M 的乘积,其中 P_M 是M的边缘分布,P_R|M 是给定M时R的条件分布。
  • 关键跳跃点
    • 从“Y_obs”到“停时集”:最关键的跳跃是将“观测到的数据”这个模糊概念,替换为“停时集σ-代数”这个严格的数学对象。这需要证明,所有关于“观测到了什么”的信息,都可以由停时集σ-代数来刻画。
    • 可测性条件的等价性证明:证明经典MAR条件(一个关于条件概率的等式)等价于一个关于随机变量可测性的条件(P(M=m | X)G-可测的)。这个证明依赖于对σ-代数的精细操作。
  • 技术技巧点名
    • 测度论:Radon-Nikodym定理、条件期望、σ-代数、滤子。这些是整篇论文的数学语言。
    • 停时理论:来自随机过程理论,用于定义“停时集”和“集索引滤子”。
    • 条件概率的版本:论文中多次强调“版本”(version)的概念,因为条件概率是几乎必然定义的,需要小心处理不同版本之间的等价性。

真实例子与应用

本文为纯理论 / 无实证例子。 论文在第五节“Examples”中提供了几个理论示例,用于说明其框架如何应用于不同场景: - 示例1:单变量缺失:用本文的框架重新表述了经典的MAR例子。 - 示例2:含协变量的缺失:展示了如何将协变量信息纳入滤子。 - 示例3:连续时间纵向数据:展示了一个简单的连续时间观测过程,其中观测时间点是随机的。本文用其框架定义了该场景下的MAR条件。 - 示例4:粗化数据:展示了一个区间删失的例子,其中观测到的不是一个精确值,而是一个区间。本文的框架可以自然地处理这种“粗化”。

这些例子旨在验证理论,展示其框架的通用性和可扩展性,而非进行实证比较。

🔎 结论是否比证明窄

  • 。论文在引言和摘要中声称其理论可以“自然扩展”到“更一般的粗化观测”。然而,在正文中,其证明和主要定理(如定理1的似然比分解)主要是在“缺失数据”的框架下建立的。对于“粗化”的更一般情形(如分组数据、随机删失),论文仅在第五节用示例进行了说明,并未给出一个统一的、严格的定理证明。因此,其“一般性”的声称可能比其严格证明的范围要宽。这是一个值得研究者去查的潜在缺口:能否为“一般粗化”情形提供一个与定理1同样严格的证明?

四、开放问题(点到为止,扎根具体语句)

  1. 一般粗化数据的严格理论:本文的框架能否为“一般粗化数据”(如分组数据、随机删失)提供一个与定理1(似然比分解)同样严格的、统一的测度论证明?还是说,每个粗化场景都需要单独的证明?扎根点:第五节“Examples”中的示例4(粗化数据)是说明性的,而非一个通用定理。
  2. 与半参数效率理论的结合:本文的“停时集σ-代数”能否用于推导缺失数据下半参数效率界(Efficient Influence Function)?例如,能否用其框架重新推导Tsiatis (2006) 中的结果?扎根点:论文未引用Tsiatis (2006) 或任何关于半参数效率的文献,这是一个明显的理论空白。
  3. 与多重插补(MI)的联系:本文的似然比分解(定理1)是MI的理论基础之一。能否用本文的“停时集”语言,为MI的插补模型(imputation model)的选择和诊断提供新的理论指导?扎根点:论文未提及MI,但定理1直接关系到“忽略缺失机制”的似然推断,而MI是这种推断最常用的实现方式。
  4. 与因果推断中“交换性”条件的联系:本文引用了Pearl (2009) 的因果推断,但未深入比较。能否将本文的“停时集”框架与因果推断中的“交换性”(exchangeability)或“无混杂”(unconfoundedness)条件联系起来?例如,在纵向因果推断中,时变混杂和缺失数据常常同时存在,本文的框架能否为处理这种复杂情况提供统一视角?扎根点:引言中提到了与因果推断中“seeing and doing”的类比,但正文并未展开。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论