跳转至

Testing selection on observables in parametric models with refreshment samples

作者: Grigory Franguridi, Arie Kapteyn
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.23508


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是面板数据中样本选择(如流失、无应答)假设的检验问题,具体而言,是检验“基于可观测变量的选择”(Missing At Random, MAR)这一核心假设是否成立。在面板数据中,样本流失是普遍且严重的问题,它会导致估计偏差。MAR假设(即流失概率仅依赖于已观测到的变量)是许多标准加权调整方法(如逆概率加权,IPW)有效的前提。然而,MAR假设本身通常是不可检验的,因为流失与否可能依赖于未观测到的变量。本方向的核心科学问题是:在没有外部信息的情况下,能否以及如何检验MAR假设? 当前,该方向的一个关键进展是认识到,当存在“补充样本”(refreshment sample)时,MAR假设变得可检验,从而为纵向因果推断提供了一个重要的诊断工具。

发展脉络(history)

  • 奠基工作:Hirano, Imbens, Ridder, and Rubin (2001)。这篇论文是本文的基石。它首次提出了加性不可忽略性(Additive Nonignorability, AN) 假设,即选择概率可以分解为仅依赖于已观测变量和仅依赖于未观测变量的两个函数的乘积(p(z1, z2) = exp(k1(z1) + k2(z2)))。该假设比MAR更弱,且允许在存在补充样本时,从三个可识别的分布(第一期分布、平衡面板分布、补充样本分布)中恢复出目标联合分布。Hirano et al. (2001) 证明了AN假设下的识别性,但留下的口子是:其估计方法需要求解一个复杂的泛函最小化问题,计算上具有挑战性。

  • 主要进展:Franguridi, Hahn, Hoonhout, Kapteyn, and Ridder (2026a)。这篇论文(本文作者之一的前期工作)直接解决了Hirano et al. (2001)留下的计算瓶颈。它证明了AN假设下的密度估计问题可以通过迭代比例拟合(raking)算法高效求解,该算法收敛速度快,且适用于连续和高维数据。更重要的是,它推导了基于raking的密度估计量的渐近方差,并给出了一个简单的递归公式来估计该方差。这为本文的检验统计量提供了计算可行性和渐近分布估计的关键工具。

  • 当前Frontier与本文位置:在Hirano et al. (2001)的识别框架和Franguridi et al. (2026a)的计算工具基础上,本文向前迈出了关键一步:将MAR假设的可检验性从理论可能性转化为一个具体的、可操作的统计检验。本文构造了一个基于Hellinger距离的检验统计量,比较了在MAR假设下有效的IPW估计分布与在AN假设下有效的raking估计分布。本文的核心贡献在于:在参数模型设定下,严格推导了该检验统计量的渐近分布(广义卡方分布),并提供了基于bootstrap的临界值计算方法。这使得研究者能够对MAR假设进行正式的假设检验,而不仅仅是依赖其不可检验性。

  • 其他相关进展:

    • Deng, Hillygus, Reiter, Si, and Zheng (2013) 和 Si, Reiter, and Hillygus (2015) 从贝叶斯和半参数角度倡导使用补充样本诊断和调整流失偏差,为本文提供了实证应用的背景和动机。
    • Franguridi and Kosenkova (2024) 提出了一个在AN假设下的闭式估计量,避免了raking迭代,但本文的检验框架依赖于raking算法来估计AN密度,因此更直接地建立在Franguridi et al. (2026a)之上。
    • Hoonhout and Ridder (2019) 将AN框架推广到多期面板,但本文聚焦于两期面板,这是检验MAR的最简设定。

子线索聚类

这些被引文献大致落在以下三条子线索上: 1. 识别与估计路线:核心是Hirano et al. (2001)的AN识别框架,以及后续的估计方法发展,包括Franguridi et al. (2026a)的raking算法和Franguridi and Kosenkova (2024)的闭式估计。这条线索关注“在AN假设下,如何从数据中恢复目标分布”。 2. 检验路线:这是本文的核心贡献。它利用识别与估计路线提供的工具(特别是raking算法),构造了一个检验统计量来检验一个更窄的假设(MAR)。这条线索关注“如何判断AN框架下的一个特殊情形(MAR)是否成立”。 3. 实证应用与倡导:以Deng et al. (2013)为代表,这类工作通过案例和模拟,向实证研究者展示补充样本的价值,并提供了贝叶斯或多重插补等分析方法。它们为本文的检验方法提供了应用场景和动机。

这个方向在追问的核心问题

  1. MAR假设是否成立? 这是最根本的问题。在无补充样本时,它不可检验;有补充样本时,它变得可检验,但检验方法需要发展。
  2. 如何构造一个有效的检验统计量? 该统计量应能区分MAR和AN(或更一般的非MAR机制),且其渐近分布应可计算或可估计。
  3. 检验的统计性质如何? 包括检验的size(第一类错误控制)和power(对非MAR备择假设的检测能力),以及这些性质对样本量、维度、流失率的敏感性。
  4. 检验的稳健性如何? 当参数模型设定错误时,检验的size和power会如何变化?这是从参数模型向半参数或非参数模型推广的核心动力。

⚠️ 作者的framing

  • 作者的缺口frame:作者将缺口frame成“MAR假设虽然常用但不可检验,而补充样本使其变得可检验,但缺乏一个具体的、可操作的检验方法”。因此,本文的定位是“填补这个空白,提供一个基于AN假设的、计算可行的检验”。
  • 被淡化或回避的竞争路线:
    • 非参数/半参数检验:本文明确将设定限制在参数模型(Assumption 1)。作者在引言中承认“原则上,所有理论结果可以推广到任何光滑的连接函数G”,但并未讨论如何将检验推广到非参数密度估计的情形。这暗示了非参数推广是一个开放问题,但作者选择在参数框架下先建立基础。
    • 其他距离度量:作者选择了Hellinger距离,并指出“原则上可以考虑其他统计距离,如KL散度,但渐近分布公式会更复杂”。这回避了KL散度或其他距离可能带来的不同统计性质(如对分布尾部更敏感)。
    • 其他识别假设:本文的备择假设是AN。作者没有讨论如果真实机制是其他形式的非MAR(例如,选择概率依赖于Z1和Z2的非可加函数),检验的power会如何。AN是一个特定的、但相对灵活的备择假设。
  • 什么明显该被引/该存在、却没出现在intro里? 未见明显缺失的关键引用。本文的引用链条非常清晰,从Hirano et al. (2001)到Franguridi et al. (2026a),再到实证应用文献,逻辑连贯。

张力

未见明显对立引用。所有被引工作都建立在Hirano et al. (2001)的AN框架之上,或是对其的扩展和应用,彼此之间没有根本性的矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • Z1, Z2:分别为第1期和第2期的随机变量(可以是多维的,包含结果和协变量)。
    • S:指示变量,S=1表示个体在第2期仍留在样本中(即“stay”),S=0表示流失。
    • p(z1, z2) = P(S=1 | Z1=z1, Z2=z2):选择概率,即给定所有变量下个体留在样本中的概率。
    • f1(z1):第1期数据的边际密度,可直接从第一期样本估计。
    • f2(z2):第2期数据的边际密度,不可直接观测,因为流失个体的Z2缺失。
    • fs(z1, z2) = f(z1, z2 | S=1):平衡面板(即第2期仍在样本中的个体)的联合密度,可直接从平衡面板数据估计。
    • fMAR(z1, z2):在MAR假设下,目标总体(无流失)的联合密度。
    • fAN(z1, z2):在AN假设下,目标总体的联合密度。
    • γ:参数向量,用于参数化f1, f2, fs。
    • n1, nr:第一期样本量和补充样本量。总样本量n = n1 + nr。
    • Z^r_2:补充样本中的第2期变量,它是从f2(z2)中独立抽取的。
  • 模型:

    • 数据生成机制:一个两期面板。第一期所有个体都观测到Z1。第二期,个体以概率p(z1, z2)留在样本中,观测到Z2;否则流失,Z2缺失。此外,独立地从目标第2期边际分布f2(z2)中抽取一个补充样本Z^r_2。
    • 统计模型:本文假设f1, f2, fs属于参数族(如高斯分布、多项分布)。参数γ是待估对象。选择概率p(z1, z2)是未知的,但被假设满足AN形式(p(z1, z2) = exp(k1(z1) + k2(z2)))。MAR是AN的一个特例,即k2(z2)为常数。
  • 可观测数据:

    • 可观测:
      1. 第一期样本:{Z1_i}_{i=1}^{n1},来自f1(z1)。
      2. 平衡面板样本:{(Z1_i, Z2_i) : S_i=1},来自fs(z1, z2)。
      3. 补充样本:{Z^r_2_j}_{j=1}^{nr},来自f2(z2)。
    • 不可观测(潜在):
      1. 流失个体的Z2。
      2. 选择概率p(z1, z2)。
      3. 目标总体联合分布f(z1, z2)。

第二步:讲最小内核——离散情形下的检验

为了理解本文的核心思路,我们剥去高斯分布等复杂设定,考虑一个最简特例:Z1和Z2都是离散变量,且取值有限(例如,Z1取值为a=1,...,A,Z2取值为b=1,...,B)。这是论文Appendix B中专门处理的情形。

在这个特例下,所有分布都退化为概率质量函数: - f1(a) = P(Z1 = a) - f2(b) = P(Z2 = b) - fs(a, b) = P(Z1 = a, Z2 = b | S=1)

核心思路:检验MAR是否成立,等价于检验以下两个分布是否一致: 1. 在MAR下估计的Z2边际分布:t(b) = Σ_a f1(a) * fs(b|a),其中fs(b|a) = fs(a,b) / fs,1(a),fs,1(a) = Σ_b fs(a,b)。这个t(b)是IPW加权后得到的Z2边际分布。 2. 直接从补充样本观测到的Z2边际分布:f2(b)。

如果MAR成立,那么t(b)应该等于f2(b)。因此,检验统计量可以基于t(b)和f2(b)之间的差异来构造。

检验统计量:本文使用Hellinger距离的离散版本,但Appendix B中证明,检验统计量n * T_n的渐近分布等价于一个关于√n (t̂ - f̂2)的二次型: n * T_n → (1/8) * (√n (t̂ - f̂2))' * S⁺ * (√n (t̂ - f̂2)) 其中S是一个与f1和fs有关的矩阵,S⁺是其Moore-Penrose逆。t̂和f̂2分别是t和f2的样本估计。

为什么这个例子是核心: - 它剥离了所有连续分布和参数模型的复杂性,直接揭示了检验的本质:比较IPW加权后的分布与补充样本分布。 - 它展示了检验统计量的渐近分布是一个广义卡方分布(即一个二次型),其极限分布依赖于t̂和f̂2的联合渐近正态性。 - 它清晰地展示了计算上的关键点:需要估计S矩阵,而S的估计依赖于f1和fs的估计。

论文的一般情形(高斯、参数模型)只是这个离散例子的“加壳”:将离散概率质量函数替换为参数化的连续密度(如高斯),将求和替换为积分,将频率估计替换为MLE,但核心的“比较两个分布”的思想和“二次型极限分布”的结构完全一致。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了在存在补充样本的面板数据中,如何检验“基于可观测变量的选择”(MAR)这一核心假设。
  2. 核心工具/方法:构造了一个基于Hellinger距离的检验统计量,该距离衡量了在MAR假设下有效的IPW估计分布与在更弱的AN假设下有效的raking估计分布之间的差异。raking算法用于估计AN密度。
  3. 主要结论:当输入分布为参数模型时,该检验统计量在原假设(MAR成立)下收敛到一个广义卡方分布。该极限分布可以通过Franguridi et al. (2026a)的递归公式进行估计,从而得到临界值。蒙特卡洛模拟验证了检验具有良好的size控制和power。

关键设定与假设

  • 两期面板:论文聚焦于两期面板(t=1,2),这是检验MAR的最简设定。多期面板的推广是开放问题。
  • 补充样本:假设存在一个独立于原始面板的、来自目标第2期边际分布f2(z2)的补充样本。这是检验MAR成为可能的关键外部信息。
  • 加性不可忽略性(AN)假设:备择假设下的选择概率形式为p(z1, z2) = exp(k1(z1) + k2(z2))。这是Hirano et al. (2001)的核心假设,它比MAR更弱,但足以在补充样本下识别目标分布。本文的检验是在AN框架下检验其特例MAR。
  • 参数模型假设(Assumption 1):这是本文最关键的假设。它要求f1, f2, fs属于参数族,且参数估计量是√n-相合且渐近正态的。这个假设保证了检验统计量的渐近分布是广义卡方分布,且可以通过delta方法推导。相比已有文献(如Deng et al. (2013)的贝叶斯方法),本文的假设更具体,但也更严格。
  • 光滑性假设:密度函数关于参数二次连续可微,这是delta方法成立的标准条件。

主要结果

  • Theorem 1(核心定理):在Assumption 1下,若MAR成立,则检验统计量n * T̂_n依分布收敛到(1/2) * g_0' * H(γ_0) * g_0,其中g_0是均值为0、协方差为Ω(γ_0)的正态随机向量,H(γ_0)是Hellinger距离在真实参数处的Hessian矩阵。这个结果的关键在于:

    • 直觉:由于在原假设下fAN = fMAR,Hellinger距离的一阶导数为0,因此其渐近行为由二阶项决定,即一个关于参数估计量√n(γ̂ - γ_0)的二次型。
    • 必要条件:参数模型假设(Assumption 1)是推导该极限分布的必要条件。
    • 解决的技术难点:如何计算H(γ_0)?它依赖于fAN和fMAR的得分函数之差。fAN的得分函数需要通过raking算法的递归公式来估计,这是Franguridi et al. (2026a)的主要贡献之一,本文直接利用了这一结果。
  • 离散情形的Proposition 3(Appendix B):该命题将Theorem 1具体化到离散情形,给出了一个更简洁的极限分布表达式:n * T̂_n → (1/8) * G' * S⁺ * G,其中G是均值为0、协方差为V的正态随机向量。这个结果更直观地展示了检验统计量与t̂ - f̂2(IPW加权分布与补充样本分布之差)的二次型之间的关系。

  • 蒙特卡洛模拟(Section 4):

    • 数据:高斯数据,Z ~ N(0, Σ),选择概率为P(S=1 | Z1, Z2) = exp(α - 0.05 * ||Z2||^2)(H1)或常数(H0)。
    • 结果:在H0下,经验拒绝率接近名义水平10%,表明size控制良好。在H1下,power随样本量n增加而迅速提高,当n=10000时达到100%。这验证了检验的有效性。
  • 真实例子(Section 5):

    • 数据:Understanding America Study (UAS) 面板数据的一个子集,研究财富持有如何受收入、教育和认知的影响。变量被离散化为三个类别。
    • 结果:检验强烈拒绝MAR假设(p值为5 * 10⁻⁶),表明第2期的流失与第2期的未观测变量(如认知能力下降)有关。
    • 这个例子想说明什么:展示了本文提出的检验在真实数据中的应用,并揭示了一个常见的MAR假设可能不成立,从而为后续的敏感性分析或使用更稳健的AN模型提供了依据。

证明路线与技术技巧

  • 整体路线:

    1. 参数化:将f1, f2, fs参数化为f1(·, γ1), f2(·, γ2), fs(·, γs),从而fAN和fMAR也成为参数γ的函数。
    2. 估计fMAR:利用MAR假设和Bayes公式,fMAR可以表示为f1和fs的简单函数,因此其估计f̂MAR可以通过插件法得到。
    3. 估计fAN:利用raking算法,从fs出发,通过交替投影到具有边际f1和f2的分布集上,迭代收敛到fAN。其估计f̂AN是样本版本的raking算法结果。
    4. 计算检验统计量:计算f̂AN和f̂MAR之间的Hellinger距离T̂_n。
    5. 推导渐近分布:将T̂_n视为参数γ的函数T(γ̂)。在原假设H0: fAN = fMAR下,T(γ_0)=0且∇T(γ_0)=0。应用二阶delta方法,n * T̂_n的极限分布由T在γ_0处的Hessian矩阵H(γ_0)和√n(γ̂ - γ_0)的极限分布决定。
    6. 估计临界值:H(γ_0)可以通过插件法估计,其中fAN和fMAR的得分函数(一阶导数)可以通过raking算法的递归公式(Section 3.4)计算。然后利用bootstrap从√n(γ̂ - γ_0)的渐近分布中生成样本,计算T̂_n的bootstrap分布,从而得到临界值。
  • 关键跳跃点:

    • 从一阶到二阶:检验统计量在原假设下的一阶导数为0,这意味着检验的power主要来自二阶项。这既是优点(简化了极限分布),也是挑战(需要计算Hessian矩阵)。
    • 计算fAN的得分函数:fAN不是显式函数,而是raking算法的极限。如何计算其对参数γ的导数?本文利用了Franguridi et al. (2026a)的递归公式,将fAN的导数也通过一个类似的递归过程计算出来。这是整个证明中最吃功夫的部分,因为它需要将raking迭代的每一步对参数的依赖都考虑进去。
  • 技术技巧点名:

    • 二阶delta方法:用于处理统计量在原假设下导数为零的情形,是推导检验统计量极限分布的核心工具。
    • raking算法(迭代比例拟合):用于在AN假设下估计目标联合分布,是连接识别与计算的关键桥梁。
    • Jacobian递归(Proposition 1, Appendix A):在高斯情形下,给出了raking迭代参数对输入参数γ的Jacobian矩阵的递归公式,是计算fAN得分函数的具体实现。
    • 影响函数展开(Influence Function Expansion):在离散情形(Lemma 2)中,用于推导√n(t̂ - f̂2)的渐近正态性及其协方差矩阵。

🔎 结论是否比证明窄

  • 窄的结论:Theorem 1的结论严格依赖于参数模型假设(Assumption 1)。作者在结论中(Section 6)并未明确声称该检验可以推广到非参数设定,而是将推广留作未来工作。因此,论文的结论(“检验统计量收敛到广义卡方分布”)在证明上仅限于参数模型。
  • 泛泛的claim:作者在引言中提到“原则上,所有理论结果可以推广到任何光滑的连接函数G”,这是一个conjecture,并未在本文中证明。同样,将检验推广到多期面板也只是在结论中提及,没有理论证明。
  • 值得研究者去查的问题:作者在Remark 3.1中提到了检验“对称的MAR”(即选择概率仅依赖于Z2)的可能性,但并未深入展开。这是一个潜在的扩展方向。

四、开放问题

  1. 非参数推广:本文的检验严格依赖于参数模型假设。一个自然的开放问题是:如何将检验推广到半参数或非参数设定? 例如,当f1, f2, fs用核密度估计或级数估计时,检验统计量的渐近分布是什么?是否还能保持广义卡方形式?这扎根于本文的Assumption 1和Section 6中“将结果推广到非参数设定”的提及。

  2. 高维设定:当Z1和Z2的维度d较高时,参数模型(如高斯)的估计和raking算法的计算都会面临挑战。检验在高维下的size和power如何?是否存在维数灾难? 本文的模拟中d仅为2和4,远低于高维统计的典型场景。这扎根于Section 4的模拟设定。

  3. 多期面板的检验:本文仅考虑了两期面板。如何将检验推广到三期或更多期的面板? 在多期情形下,AN假设的识别和raking算法会更复杂,检验统计量的构造和渐近分布也会相应变化。这扎根于Section 6中“多期面板的推广”的提及。

  4. 检验的稳健性:当参数模型设定错误时(例如,真实分布是t分布,但假设为高斯),检验的size是否会严重扭曲?是否存在对模型设定更稳健的检验统计量? 这扎根于本文对参数模型的严格依赖,是一个典型的模型误设问题。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论