跳转至

Testing selection on observables in parametric models with refreshment samples

作者: Grigory Franguridi, Arie Kapteyn
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.23508


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:在面板数据中,当样本因非随机流失(attrition)或缺失(nonresponse)而产生选择偏差时,如何利用“刷新样本”(refreshment sample)——即在后续波次中独立抽取的新样本——来诊断和纠正这种偏差。其核心统计挑战在于,仅凭面板数据本身无法区分“随机缺失”(MAR,即selection on observables)与“非随机缺失”(NMAR,即selection on unobservables),而刷新样本提供了额外的信息,使得原本不可检验的MAR假设变得可检验。当前该方向的成熟度处于“方法已建立但实证应用有限”的阶段:识别理论(Hirano et al., 2001)和估计方法(Franguridi et al., 2026a)已有,但缺乏一个简单、可操作的统计检验来评估MAR假设的合理性。

发展脉络

  • 奠基工作:Hirano, Imbens, Ridder, and Rubin (2001)。这篇Econometrica论文首次系统性地提出了在存在刷新样本时,面板数据中非随机流失的识别问题。他们引入了“可加非可忽略性”(additive nonignorability, AN)假设:选择概率可分解为p(z1, z2) = exp(k1(z1) + k2(z2))。在此假设下,联合分布f(z1, z2)可由三个可识别对象(第一期分布f1、平衡面板分布fs、刷新样本分布f2)唯一确定。该工作奠定了整个子领域的理论基础,但留下的口子是:估计f_AN需要求解一个函数优化问题(KL投影),计算上不直接,限制了实证应用。

  • 主要进展(识别与估计):

    • Bhattacharya (2008) 和 Hoonhout and Ridder (2019) 将AN框架扩展到多期面板,并发展了相应的估计方法。Hoonhout and Ridder (2019) 在Journal of Business & Economic Statistics上提出了非参数估计策略,但计算复杂度仍然较高。
    • Franguridi, Hahn, Hoonhout, Kapteyn, and Ridder (2026a) 做出了关键突破:他们证明了AN下的KL投影问题可以通过迭代比例拟合(raking)算法高效求解,即使数据是连续且中等维度的。该工作为f_AN的估计提供了计算上可行的工具,并建立了raking估计量的一致性和收敛速度,以及一个用于估计渐近方差的递推公式。这是本文的直接技术基础。
    • Franguridi and Kosenkova (2024) 提出了一个替代的识别假设,该假设允许一个闭式(closed-form)估计量,无需调参或优化,进一步降低了计算门槛。
  • 当前Frontier与本文位置:尽管识别和估计问题已取得进展,但缺乏一个正式的、有良好渐近性质的统计检验来评估MAR假设本身。现有工作(如Deng et al., 2013)主要关注在MAR或AN假设下进行推断,而非检验这些假设。本文直接填补了这个缺口:它利用Franguridi et al. (2026a)的raking框架,构建了一个基于Hellinger距离的检验统计量,并证明了其在参数模型下的渐近分布(广义卡方分布),从而为MAR假设提供了一个可操作的诊断工具。

子线索聚类

  1. 识别与估计理论(核心理论线):Hirano et al. (2001) → Bhattacharya (2008) → Hoonhout and Ridder (2019) → Franguridi et al. (2026a)。这条线专注于在AN假设下,如何从可观测分布中识别和估计目标联合分布f(z1, z2)。核心工具是KL投影、raking算法和最优传输理论。
  2. 实证应用与贝叶斯方法(应用线):Deng, Hillygus, Reiter, Si, and Zheng (2013) → Si, Reiter, and Hillygus (2015)。这条线侧重于将刷新样本用于实际面板数据分析,主要采用贝叶斯方法(如完全贝叶斯分析、多重插补)来处理流失问题,并强调刷新样本在诊断和调整偏差中的价值。这些工作通常不提供正式的频率学派检验。
  3. 计算与闭式估计(计算线):Franguridi and Kosenkova (2024) → Franguridi and Liu (2025)。这条线致力于降低估计方法的计算复杂度,例如通过寻找闭式解或利用正则化最优传输(Sinkhorn算法)来处理部分识别问题。本文的检验统计量依赖于Franguridi et al. (2026a)的raking算法,属于计算线的延伸。

这个方向在追问的核心问题

  1. MAR假设是否合理? 这是实证研究的根本问题。当前主流方法是在MAR下进行推断(如IPW),但缺乏检验其合理性的工具。
  2. 如何利用刷新样本进行有效推断? 在AN假设下,如何高效、稳健地估计目标参数?已知瓶颈是计算复杂度和对高维数据的适应性。Franguridi et al. (2026a)的raking算法部分解决了这个问题。
  3. 检验的统计性质如何? 检验统计量的渐近分布是什么?如何获得有效的临界值?本文直接回答了这个问题。
  4. 如何扩展到更复杂的设定? 如多期面板、非参数/半参数模型、混合数据类型等。

⚠️ 作者的 framing

  • 作者的缺口frame:作者将缺口明确frame为“MAR假设在面板数据中常见但不可检验,而刷新样本使其可检验,但现有文献缺乏一个正式的统计检验”。因此,本文被定位为“显然的下一步”:在已有的识别(Hirano et al., 2001)和估计(Franguridi et al., 2026a)框架上,构建一个检验。
  • 被淡化或回避的竞争路线:
    • 贝叶斯方法:Deng et al. (2013) 等贝叶斯方法虽然不提供频率学派检验,但能通过模型比较(如DIC)或后验预测p值来评估模型拟合。作者在引言中仅提及Deng et al. (2013)作为刷新样本应用的例子,未将其作为检验方法的竞争对手进行讨论。
    • 非参数检验:作者明确将设定限制在参数模型(Assumption 1),回避了非参数或半参数检验的复杂性。这既是本文的局限,也是其简洁性的来源。
  • 什么明显该被引/该存在、却没出现在intro里?:作者没有引用任何关于“检验MAR假设”的现有文献(即使是在其他设定下,如缺失数据或因果推断中的敏感性分析)。这可能意味着在面板数据+刷新样本的特定设定下,本文确实是第一个正式的频率学派检验。但研究者应自行确认是否存在其他检验MAR的方法(例如,基于工具变量或代理变量的方法)。

张力

未见明显对立引用。该子领域的文献在核心假设(AN)和主要方法(raking)上具有较好的一致性,本文是对该共识框架的补充而非挑战。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • Z_it = (Y_it, X_it):个体i在时期t(t=1,2)的结果变量和协变量的堆叠向量。这是研究的目标变量。
    • S_i:选择指示变量。S_i = 1表示个体i在第二期仍留在样本中(stayer),S_i = 0表示流失(attritor)。
    • f(z1, z2):目标联合分布,即(Z_1, Z_2)在总体中的联合概率密度。这是我们最终想知道的,但由于流失,无法直接观测。
    • f_1(z1):第一期边际分布。由第一期所有样本(n_1个)识别。
    • f_s(z1, z2):平衡面板(selected)分布,即f(z1, z2 | S=1)。由两期都观测到的样本(stayers)识别。
    • f_2(z2):第二期边际分布。由刷新样本(n_r个)识别。
    • f_MAR(z1, z2):在MAR假设下估计的联合分布。
    • f_AN(z1, z2):在AN假设下估计的联合分布。
    • p(z1, z2) = P(S=1 | Z1=z1, Z2=z2):选择概率。
    • γ = (γ_1', γ_2', γ_s')':参数向量,分别参数化f_1, f_2, f_s。
    • n = n_1 + n_r:合并样本量。
    • T_n:检验统计量,基于f_AN和f_MAR之间的平方Hellinger距离。
  • 模型:

    • 数据生成机制:总体中存在一个未观测的联合分布f(z1, z2)。个体根据一个未知的选择机制p(z1, z2)决定是否在第二期留下。我们观测到:
      1. 第一期所有个体的Z_1(来自f_1)。
      2. 第二期stayers的(Z_1, Z_2)(来自f_s)。
      3. 一个独立的刷新样本Z_2^r(来自f_2)。
    • 核心假设:在备择假设下,选择概率满足可加非可忽略性(AN):p(z1, z2) = exp(k1(z1) + k2(z2))。这比MAR(p(z1, z2) = p(z1))更弱,因为它允许选择依赖于未观测的Z_2。
    • 参数化假设:f_1, f_2, f_s属于已知的参数族(如高斯分布、离散分布),由有限维参数γ刻画。这是本文理论推导的关键前提。
  • 可观测数据:

    • 可观测的:
      1. 第一期样本:{Z_1i}_{i=1}^{n_1},来自f_1。
      2. 平衡面板样本:{(Z_1i, Z_2i) : S_i=1},来自f_s。
      3. 刷新样本:{Z_2j^r}_{j=1}^{n_r},来自f_2。
    • 想要但观测不到的:
      1. 流失个体的Z_2。
      2. 目标联合分布f(z1, z2)。
      3. 选择概率p(z1, z2)。
    • 关键识别逻辑:在AN假设下,f(z1, z2)可由f_1, f_s, f_2唯一确定(通过KL投影)。在MAR假设下,f(z1, z2)可由f_1和f_s确定(通过IPW)。因此,比较这两个估计的联合分布,就可以检验MAR。

第二步:讲最小内核——离散数据特例

为了看清核心思路,我们考虑一个最简特例:Z_1和Z_2都是二值离散变量,取值于{0, 1}。所有分布都是多项分布,参数就是概率质量函数本身。

  • 记号特化:

    • f_1 = (p_1(0), p_1(1)),其中p_1(z1) = P(Z_1 = z1)。
    • f_2 = (p_2(0), p_2(1)),其中p_2(z2) = P(Z_2 = z2)。
    • f_s是一个2x2的联合概率表:f_s(z1, z2) = P(Z_1=z1, Z_2=z2 | S=1)。
    • 可观测数据:n_1个Z_1样本,n_s个(Z_1, Z_2)样本(stayers),n_r个Z_2样本(刷新样本)。
  • 最小内核:检验MAR等价于检验一个边际条件。

    • MAR下的联合分布f_MAR:在MAR下,P(S=1 | Z_1, Z_2) = P(S=1 | Z_1)。可以推导出: f_MAR(z1, z2) = f_1(z1) * f_s(z2 | z1),其中f_s(z2 | z1) = f_s(z1, z2) / Σ_{z2'} f_s(z1, z2')。 这意味着,在MAR下,第二期的边际分布(由f_MAR推出)为: t(z2) = Σ_{z1} f_1(z1) * f_s(z2 | z1)。
    • AN下的联合分布f_AN:在AN下,f_AN是满足其边际分别为f_1和f_2,且最接近f_s(在KL散度意义上)的分布。对于离散数据,这个KL投影问题可以通过raking算法求解,其解是唯一的。
    • 检验的等价形式:本文的核心洞察是,检验H_0: f_MAR = f_AN等价于检验H_0: t(z2) = f_2(z2)。也就是说,在MAR下,由第一期数据和平衡面板数据“预测”出的第二期边际分布t,应该与从刷新样本直接观测到的第二期边际分布f_2一致。如果它们不一致,就说明MAR不成立,因为AN假设下的f_AN会“纠正”这个不一致,使其边际与f_2匹配。
  • 在这个特例下,检验统计量是什么?

    • 我们估计t和f_2:ˆt(z2) = Σ_{z1} ˆf_1(z1) * ˆf_s(z2 | z1),ˆf_2(z2)是刷新样本中Z_2=z2的比例。
    • 检验统计量T_n(平方Hellinger距离)在离散情况下简化为: T_n = 1/2 * Σ_{z1, z2} ( √(ˆf_AN(z1, z2)) - √(ˆf_MAR(z1, z2)) )^2。
    • 在H_0下,f_AN = f_MAR,所以T_n应该很小。作者证明,n * T_n的渐近分布是一个广义卡方分布,其形式为1/2 * g_0' H(γ_0) g_0,其中g_0是参数估计量的渐近正态极限,H是Hellinger距离的Hessian矩阵。对于离散情况,这个分布可以进一步简化为一个关于(ˆt - ˆf_2)的二次型(见论文附录B,Proposition 3)。
  • 为什么这个特例抓住了核心?

    • 它剥离了所有连续分布和复杂计算的细节,直接揭示了检验的本质:比较两个对第二期边际分布的估计。一个来自MAR假设下的IPW(ˆt),一个来自刷新样本的直接估计(ˆf_2)。如果它们“足够接近”,就不拒绝MAR。
    • 这个特例也展示了为什么刷新样本是必要的:没有ˆf_2,我们就没有基准来比较ˆt,MAR就不可检验。
    • 论文的一般情形(高斯、连续)只是这个离散特例的“加壳”:用参数模型(如高斯)来估计f_1, f_2, f_s,然后用raking算法计算f_AN,最后计算Hellinger距离。其核心数学困难在于推导T_n的渐近分布,这需要处理参数估计的不确定性在非线性统计量(Hellinger距离)中的传播。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在存在刷新样本的面板数据中,如何检验“缺失随机”(MAR,即selection on observables)这一常见但通常不可检验的假设。
  2. 核心工具/方法:利用Hirano et al. (2001)的“可加非可忽略性”(AN)假设作为备择,构建一个基于f_AN(AN下估计的联合分布)和f_MAR(MAR下估计的联合分布)之间平方Hellinger距离的检验统计量。f_AN的估计依赖于Franguridi et al. (2026a)的raking算法。
  3. 主要结论:在输入分布(f_1, f_2, f_s)为参数模型时,该检验统计量在原假设(MAR)下收敛到一个广义卡方分布,其极限分布可通过Franguridi et al. (2026a)的递推公式估计。蒙特卡洛模拟显示检验具有良好的有限样本性质(准确的size和较高的power),并在UAS数据的一个子集上强烈拒绝了MAR假设。

关键设定与假设

  • 设定:两期面板数据,第二期存在非随机流失。存在一个独立的第二期刷新样本。
  • 核心假设:
    1. 可加非可忽略性(AN):p(z1, z2) = exp(k1(z1) + k2(z2))。这是备择假设下的工作模型,比MAR更弱。作者聚焦于指数链接函数,因其计算便利性(raking)。
    2. 参数模型(Assumption 1):f_1, f_2, f_s属于已知的参数族,且其参数γ可以√n速率一致估计。这是本文理论推导的核心,它使得f_AN和f_MAR成为参数γ的平滑函数,从而可以应用delta方法。相比Franguridi et al. (2026a)中raking算法的非参数一致性结果,本文为了得到检验统计量的显式渐近分布,付出了参数化的代价。
    3. 正则性条件:密度函数对参数二次连续可微,且在真实参数处为正。这是应用delta方法的标准条件。
  • 相比已有文献的强化/放宽:
    • 强化:相比Hirano et al. (2001)和Franguridi et al. (2026a)的非参数/半参数框架,本文强化了分布假设(参数化),以换取检验统计量渐近分布的显式形式。
    • 放宽:相比在MAR下直接做IPW的常见做法,本文放宽了识别假设,允许在备择假设下存在非随机缺失(AN)。

主要结果

  • 定理1(核心理论结果):在Assumption 1和原假设H_0: f_MAR = f_AN(即MAR成立)下,检验统计量n * ˆT_n依分布收敛到1/2 * g_0' H(γ_0) g_0,其中g_0 ~ N(0, Ω(γ_0))是参数估计量的渐近分布,H(γ_0)是平方Hellinger距离在γ_0处的Hessian矩阵。

    • 直觉:ˆT_n是γ的函数。在H_0下,f_AN和f_MAR相等,所以T(γ_0)=0且一阶导数为0。因此,ˆT_n的渐近行为由二阶项主导,即(ˆγ - γ_0)的二次型。这个二次型的核是Hessian矩阵H。
    • 必要条件:参数模型假设(Assumption 1)是定理成立的必要条件,它保证了T(γ)的足够光滑性和ˆγ的√n-相合性与渐近正态性。
    • 解决的技术难点:推导H(γ_0)的表达式,并证明它不依赖于f_AN和f_MAR的二阶导数(这简化了计算)。这得益于Hellinger距离的特殊性质。
  • 离散数据下的显式结果(Proposition 3, Appendix B):对于离散数据,检验统计量n * ˆT_n的渐近分布可以简化为一个关于(ˆt - ˆf_2)的二次型:1/8 * (√n(ˆt - ˆf_2))' S^+ (√n(ˆt - ˆf_2)),其中S是一个与f_1, f_s有关的矩阵,S^+是其Moore-Penrose逆。这个结果更清晰地揭示了检验的本质:它等价于检验由IPW预测的第二期边际ˆt与刷新样本边际ˆf_2是否相等。

    • 技术难点:推导√n(ˆt - ˆf_2)的渐近分布(Lemma 2),这需要处理ˆt作为ˆf_1和ˆf_s的复杂函数的渐近线性展开,并考虑面板样本和刷新样本的独立性与不同样本量。

证明路线与技术技巧

  • 整体路线(基于定理1的证明):

    1. 定义函数:将检验统计量ˆT_n视为参数估计量ˆγ的函数:ˆT_n = T(ˆγ)。
    2. 在原假设下展开:在H_0: f_AN(·, γ_0) = f_MAR(·, γ_0)下,T(γ_0) = 0且梯度∇T(γ_0) = 0。
    3. 二阶delta方法:对T(ˆγ)在γ_0处进行二阶泰勒展开:T(ˆγ) ≈ 1/2 * (ˆγ - γ_0)' ∇²T(γ_0) (ˆγ - γ_0)。
    4. 计算Hessian矩阵:计算∇²T(γ_0),并证明其等于1/4 * E[(s_AN(Z, γ_0) - s_MAR(Z, γ_0))(s_AN(Z, γ_0) - s_MAR(Z, γ_0))'],其中s_AN和s_MAR是f_AN和f_MAR的得分函数。这个表达式不涉及二阶导数,是Hellinger距离带来的便利。
    5. 应用连续映射定理:由√n(ˆγ - γ_0) ⇝ N(0, Ω)和∇²T(γ_0)的表达式,得到n * T(ˆγ) ⇝ 1/2 * g_0' H(γ_0) g_0。
  • 关键跳跃点:

    • 计算f_AN的得分函数s_AN:f_AN没有闭式表达式,它是raking算法无限次迭代的极限。如何计算其对参数γ的导数?这是证明中最吃功夫的部分。作者依赖Franguridi et al. (2026a)的递推公式(公式7),该公式给出了raking迭代中每一步的密度f^(t)及其梯度∇_γ f^(t)的递推关系。通过迭代这个递推关系T次(T足够大),可以得到f_AN及其梯度的近似。这个递推公式的推导本身就是一个技术贡献。
    • 处理raking算法的无限迭代:理论上f_AN是T→∞的极限。作者的处理方式是:在实践中,我们运行有限次迭代T,并证明当T足够大时,近似误差可以忽略。这依赖于raking算法的几何收敛速度(Rüschendorf, 1995)。
  • 技术技巧点名:

    • 二阶delta方法:用于处理统计量在原假设下的一阶退化(梯度为0),得到非退化的极限分布。
    • Hellinger距离:选择它而非KL散度,是因为其Hessian矩阵的简洁形式(不涉及二阶导数),简化了理论推导。
    • raking算法(迭代比例拟合):作为计算f_AN的核心算法,它本质上是一个交替KL投影过程,将复杂的函数优化问题转化为一系列简单的边际调整步骤。
    • 递推公式求导:对raking迭代公式进行符号微分,得到梯度的递推关系,从而可以计算f_AN对参数的导数。这是将raking算法从“估计”工具升级为“推断”工具的关键。
    • 非参数bootstrap:用于估计检验统计量的临界值。由于极限分布是广义卡方,直接估计其分位数可能复杂,bootstrap提供了一个实用的替代方案。

真实例子与应用

  • 数据:Understanding America Study (UAS) 的一个子集。UAS是一个约15,000名美国受访者的在线面板。
  • 场景:研究财富持有(financial wealth)如何受收入、教育和认知能力的影响。数据来自两个波次(Wave 1: 2021-2023, Wave 2: 2023-2025)。Wave 1有9,725个观测,其中7,432个也出现在Wave 2(stayers)。Wave 2有2,264个新受访者(刷新样本)。
  • 方法应用:
    1. 变量处理:将四个解释变量(教育、收入、认知、财富)都离散化为三个类别(如教育分为高中及以下、一些大学、大学及以上)。这使得数据适用于论文中离散数据的理论框架(Appendix B)。
    2. 认知变量构建:从五个认知测试(Serial Sevens, Picture Vocabulary等)中,通过一个考虑了练习效应和年龄的因子分析模型,提取出一个单一的“认知”因子得分。
    3. 检验实施:使用离散数据的检验程序,计算检验统计量和p值。
  • 结果:检验强烈拒绝了MAR假设,p值为5 × 10⁻⁶。这意味着Wave 2的流失与Wave 2中未观测到的变量(如认知能力下降)有关。
  • 这个例子想说明什么:展示了该检验在实际面板数据分析中的应用价值。它提供了一个具体的、可操作的例子,说明如何将理论付诸实践,并得出了一个有实质意义的结论(即MAR假设在该数据中不成立),这警示研究者在使用标准IPW方法时需要谨慎。同时,它也展示了检验的威力(即使在中等样本量下也能检测到偏离)。

🔎 结论是否比证明窄

  • 窄的结论:定理1的证明严格依赖于参数模型假设(Assumption 1)。论文的结论“我们的检验统计量在原假设下收敛到广义卡方分布”仅在参数设定下被严格证明。论文在引言中提及“原则上,所有理论结果可以推广到任何光滑链接函数G”,但并未给出证明。同样,扩展到非参数或半参数设定也只是展望。
  • 泛化的claim:论文标题和摘要中的“Testing selection on observables in parametric models”是准确的。但在结论部分(Section 6)说“This assumption becomes testable when a refreshment sample is available”,这是一个更泛化的陈述。严格来说,本文证明的是在参数模型和AN假设下,该假设是可检验的。对于非参数设定,检验的存在性和性质仍是开放问题。
  • 值得研究者去查的问题:论文的实证例子将所有变量离散化,这符合其离散数据理论。但这是否是最佳实践?如果变量是连续的,离散化会损失信息。论文附录A提供了高斯情况的公式,但未在实证中使用。研究者可以思考:对于连续数据,是否应该直接使用高斯假设?或者,是否存在一个更稳健的半参数检验,不依赖于分布假设?

四、开放问题

  1. 扩展到半参数/非参数设定:本文的检验严格依赖于参数模型假设。一个自然的开放问题是:能否构建一个不依赖于分布假设的、基于经验似然或最优传输的检验?这需要处理非参数估计的慢收敛率对检验统计量渐近分布的影响。扎根点:Assumption 1是定理1的核心,论文未讨论其放松的可能性。
  2. 多期面板的检验:本文仅考虑了两期面板。对于三期或更多期的面板,AN假设和raking算法可以推广(如Hoonhout and Ridder, 2019),但相应的MAR检验会变得更加复杂,因为需要比较多个时间点的分布。扎根点:论文的框架是两期的,结论部分未提及多期扩展。
  3. 检验的power分析:本文通过模拟展示了power,但缺乏理论上的power分析。例如,对于给定的偏离MAR的程度(如AN假设中k_2(z_2)的大小),检验的power如何随样本量和维度变化?是否存在一个“最小可检测的偏离”?扎根点:论文的模拟部分(Section 4)展示了特定DGP下的power,但未提供理论保证。
  4. 与其他检验方法的比较:本文未与任何替代的检验方法进行比较(因为可能是第一个)。但研究者可以思考:是否存在基于工具变量或代理变量的MAR检验?如果有,本文的检验与它们相比有何优劣?扎根点:论文的引言和文献综述部分未提及任何直接的竞争性检验方法。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论