跳转至

Testing selection on observables in parametric models with refreshment samples

作者: Grigory Franguridi, Arie Kapteyn
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.23508


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:在面板数据中,当样本因非随机原因(如流失、无响应)而缺失时,如何对“缺失机制”的假设进行统计检验。核心挑战在于,最常用的假设——缺失随机(MAR,即selection on observables)——在仅有面板数据时是不可检验的。本文利用一种特殊的辅助数据——刷新样本(refreshment sample)——来构造一个可检验的假设,从而允许研究者对MAR假设的合理性进行正式的统计推断。该方向当前处于“从识别理论走向可操作检验”的阶段,已有成熟的识别结果,但缺乏一个通用、计算可行的检验程序。

发展脉络(history)

  • 奠基工作:Hirano, Imbens, Ridder, and Rubin (2001)。这篇Econometrica论文首次系统性地证明了:在存在刷新样本的情况下,通过引入可加非可忽略性(additive nonignorability, AN)假设,可以非参数地识别面板数据中因非随机流失而缺失的联合分布。AN假设(选择概率为exp(k1(z1) + k2(z2)))比MAR更弱,且将MAR作为特例包含在内。该文奠定了整个子方向的理论基础,但留下的口子是:识别出的分布需要通过求解一个泛函最小化问题来获得,这在计算上具有挑战性,限制了其实际应用。
  • 主要进展:Franguridi et al. (2026a)。这篇论文(作者与本文高度重叠)解决了Hirano et al. (2001)留下的计算瓶颈。它证明了AN下的识别问题等价于一个KL投影问题,并且该问题可以通过迭代比例拟合(raking / iterative proportional fitting)算法高效求解。该文建立了raking估计量的一致性和收敛速度,并给出了一个用于估计渐近方差的递归公式。留下的口子是:它主要关注估计,并未提供一个正式的假设检验程序来评估MAR是否成立。
  • 当前frontier与本文位置:本文直接站在Franguridi et al. (2026a)的肩膀上,将其raking算法从“估计工具”升级为“检验工具”。本文的核心贡献是:在参数模型设定下,构造了一个基于Hellinger距离的检验统计量,该统计量在原假设(MAR)下收敛到广义卡方分布,且其临界值可以通过Franguridi et al. (2026a)的递归公式计算。因此,本文填补了从“识别与估计”到“假设检验”的关键空白。

子线索聚类

这些被引文献大致落在两条子线索上: 1. 识别与估计策略:核心是回答“在AN假设下,如何从可观测数据中恢复目标分布?”这条线索包括Hirano et al. (2001)(理论识别)、Franguridi et al. (2026a)(raking算法)、Franguridi and Kosenkova (2026)(闭式估计量)、以及Hoonhout and Ridder (2019)(多期面板)。它们共同构建了从理论到算法的工具箱。 2. 刷新样本的应用与推广:核心是论证刷新样本的价值并推广其应用场景。这条线索包括Deng et al. (2013)(全面论证刷新样本在诊断和调整流失偏倚中的作用)、Si et al. (2015)(半参数选择模型)、以及Chen et al. (2017)(零售数据中的应用)。它们为本文的检验方法提供了实证动机和背景。

这个方向在追问的核心问题

  1. MAR假设是否成立? 这是所有面板数据分析者都面临的根本问题,因为错误的MAR假设会导致有偏估计。
  2. 如何利用刷新样本构造一个可操作的检验? 这是从理论识别走向实际应用的关键一步。
  3. 检验的统计性质如何? 包括检验的渐近分布、有限样本下的size和power,以及对模型假设(如参数形式)的敏感性。
  4. 当前主流方法与已知瓶颈:主流方法是直接假设MAR,然后使用IPW或基于模型的插补。已知瓶颈是MAR不可检验,且其合理性常受质疑。本文提出的检验方法直接针对这一瓶颈,但代价是依赖于AN假设和参数模型设定。

⚠️ 作者的framing

  • 作者把缺口frame成什么? 作者将缺口frame为:“MAR假设虽然常用但不可检验,而刷新样本的存在使其变得可检验,但缺乏一个通用的检验程序。” 因此,本文被定位为“显然的下一步”:提供一个基于已有识别和估计工具(AN假设 + raking算法)的正式检验。
  • 哪些竞争路线被他淡化或回避了? 作者明确选择了参数模型作为设定。这回避了半参数或非参数检验的复杂性。作者在Remark 3.1中提到了检验对称假设(选择概率只依赖于Z2)的可能性,但并未深入。此外,作者完全回避了与基于工具变量(IV)或proximal causal inference的检验方法的比较,尽管这些方法也旨在处理不可观测的混淆因素。
  • 什么明显该被引/该存在、却没出现在intro里? 这是一个值得研究者去查的问题。例如,是否有文献在proximal causal inference框架下,利用“负控制变量(negative control)”来检验MAR或类似假设?如果有,本文的检验方法与proximal CI的检验方法在假设、识别策略和计算上有什么异同?这可能是连接本文与研究者更熟悉的proximal CI领域的一个潜在桥梁。

张力

未见明显对立引用。所有被引工作都一致认为:在存在刷新样本时,AN假设是一个比MAR更弱且有用的识别假设,而raking算法是求解AN下识别问题的有效工具。本文的工作是这一共识的自然延伸。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:
  • Z_it = (Y_it, X_it):个体i在时期t(t=1,2)的观测数据,包含结果变量Y和协变量X。
  • S_i:指示变量,S_i = 1表示个体i在第二期仍留在样本中(即“留存者”),S_i = 0表示流失。
  • p(z1, z2) = P(S_i = 1 | Z_1i = z1, Z_2i = z2):选择概率,即给定完整数据下个体留存的概率。这是不可观测的,因为流失者的Z_2缺失。
  • f(z1, z2):目标联合分布,即我们想要估计的、无流失情况下的(Z1, Z2)分布。这是想要但观测不到的。
  • f_1(z1):第一期的边际分布。可观测,因为第一期没有流失。
  • f_s(z1, z2) = f(z1, z2 | S=1):留存者的联合分布。可观测,因为留存者的(Z1, Z2)都完整。
  • f_2(z2):第二期的边际分布。可观测,因为刷新样本Z^r_i2是从这个分布中独立抽取的。
  • n:第一期样本量。n_r:刷新样本量。总样本量n_total = n + n_r。
  • γ = (γ1, γ2, γs):参数向量,分别参数化f_1, f_2, f_s。

  • 模型:

  • 数据生成机制:一个两期面板,第一期所有个体都被观测。第二期,个体以概率p(z1, z2)留存,流失者的Z_2缺失。此外,独立抽取一个刷新样本Z^r_i2,其分布与目标第二期边际分布f_2相同。
  • 核心假设(备择假设):选择概率满足可加非可忽略性(AN),即p(z1, z2) = exp(k1(z1) + k2(z2))。这意味着选择概率在对数尺度上是可加的。
  • 核心假设(原假设):缺失随机(MAR),即p(z1, z2) = p(z1),选择概率只依赖于第一期观测值。
  • 参数模型假设(Assumption 1):f_1, f_2, f_s属于已知的参数族(如高斯分布、多项分布),且参数γ可以以√n速率一致估计。

  • 可观测数据:

  • 可观测:
    1. 第一期数据:{Z_1i}_{i=1}^n。
    2. 留存者数据:{(Z_1i, Z_2i) : S_i = 1}。
    3. 刷新样本数据:{Z^r_i2}_{i=1}^{n_r}。
  • 想要但观测不到:
    1. 流失者的Z_2。
    2. 目标联合分布f(z1, z2)。
    3. 选择概率p(z1, z2)。

第二步:讲最小内核——离散数据特例

为了看清核心思路,我们考虑一个最简特例:Z1和Z2都是二值变量,取值0或1。所有分布都是多项分布,参数就是概率。

  • 可观测数据:
  • f_1(0), f_1(1):从第一期数据估计。
  • f_s(0,0), f_s(0,1), f_s(1,0), f_s(1,1):从留存者数据估计。
  • f_2(0), f_2(1):从刷新样本估计。

  • 核心问题:我们想检验MAR是否成立。在离散情况下,MAR意味着选择概率p(z1, z2)不依赖于z2。这等价于说,在给定Z1的条件下,留存者的Z2分布与目标Z2分布相同。即,对于所有z1,有P(Z2 = b | Z1 = a, S=1) = P(Z2 = b | Z1 = a)。但后者不可观测。

  • 核心思路:本文的检验不直接检验这个条件,而是比较两个可估计的联合分布:

  • f_MAR:在MAR假设下,我们可以用IPW或更简单的公式估计联合分布。对于离散情况,f_MAR(a, b) = f_1(a) * f_s(b|a)。这个分布的第二边际是t(b) = Σ_a f_1(a) * f_s(b|a)。
  • f_AN:在更弱的AN假设下,我们可以通过raking算法,从f_s出发,交替投影到边际f_1和f_2上,最终收敛到f_AN。这个分布的第二边际恰好等于刷新样本的边际f_2。

  • 检验逻辑:

  • 如果MAR成立,那么f_MAR和f_AN应该相等。特别地,f_MAR的第二边际t应该等于f_2。
  • 如果MAR不成立(但AN成立),那么f_MAR和f_AN会不同。f_MAR的第二边际t会偏离f_2。
  • 因此,检验MAR等价于检验t = f_2。本文的Hellinger距离统计量T_n就是衡量f_MAR和f_AN的整体差异,而不仅仅是第二边际的差异。

  • 在这个特例下,要证的命题退化成什么?

  • 原假设H0: MAR成立。
  • 检验统计量n * T_n在原假设下收敛到一个广义卡方分布。对于离散情况,附录B的Proposition 3给出了一个更具体的结果:n * T_n收敛到(1/8) * G' * S^+ * G,其中G是一个均值为0、协方差为V的高斯向量,S和V都是可观测数据的函数。
  • 这个结果的核心是:√n * (t - f_2)收敛到一个高斯分布,而T_n是这个高斯向量的二次型。因此,检验的关键就是估计这个二次型的分布。

  • 为什么这个特例能体现核心数学困难?

  • 困难不在于计算f_MAR或f_AN(在离散情况下,raking算法就是简单的矩阵乘法),而在于推导T_n的渐近分布。这需要:
    1. 对T_n进行二阶泰勒展开(因为一阶导数为0)。
    2. 将T_n表示为(t - f_2)的二次型加上一个可忽略的余项。
    3. 推导√n * (t - f_2)的渐近正态性,这需要计算其影响函数和渐近方差。
    4. 处理S矩阵的奇异性(因为概率有和为1的约束),使用Moore-Penrose逆。
  • 本文的定理1和附录B的证明,正是处理了这些在一般参数模型下的技术细节。

三、这篇论文做了什么

  • 三句话:
  • 研究了什么问题:在存在刷新样本的面板数据中,如何对“缺失随机(MAR)”这一常用但不可检验的假设进行统计检验。
  • 核心工具/方法:构造了一个基于Hellinger距离的检验统计量,该距离衡量了在MAR假设下估计的联合分布f_MAR与在更弱的可加非可忽略性(AN)假设下估计的联合分布f_AN之间的差异。f_AN的估计使用了Franguridi et al. (2026a)的raking算法。
  • 主要结论:在参数模型设定下,该检验统计量在原假设(MAR)下收敛到一个广义卡方分布,其临界值可以通过Franguridi et al. (2026a)的递归公式计算。蒙特卡洛模拟验证了检验的良好有限样本性质(size控制准确,power高),并在UAS数据的一个子集上进行了实证应用。

  • 关键设定与假设:

  • 设定:两期面板数据,第二期存在非随机流失,并有一个独立的刷新样本。
  • 核心假设:
    1. AN假设(备择假设):选择概率p(z1, z2) = exp(k1(z1) + k2(z2))。这是本文检验的“备择世界”的模型。它比MAR更弱,允许选择依赖于未观测的Z2。
    2. MAR假设(原假设):p(z1, z2) = p(z1)。这是本文要检验的零假设。
    3. 参数模型假设(Assumption 1):f_1, f_2, f_s属于已知的参数族,且参数可以√n速率一致估计。这是本文推导渐近分布的核心假设,也是其与更一般的半参数方法的主要区别。
    4. 正则性条件:密度函数关于参数二次连续可微且在支撑上为正(Assumption 1(ii)),参数估计量渐近正态(Assumption 1(iii))。
  • 相比已有文献的放宽或强化:

    • 放宽:相比直接假设MAR,本文允许在备择假设下检验其合理性。
    • 强化:相比Hirano et al. (2001)的非参数识别结果,本文为了得到可操作的检验,强化了假设,要求输入分布是参数化的。这使得渐近分布的理论推导成为可能。
  • 主要结果:

  • 定理1(核心结果):在Assumption 1下,在原假设MAR成立时,检验统计量n * T_n依分布收敛到(1/2) * g_0' * H(γ_0) * g_0,其中g_0是均值为0、协方差为Ω(γ_0)的高斯向量,H(γ_0)是Hellinger距离的Hessian矩阵。这个分布是一个广义卡方分布。
    • 直觉:T_n在γ_0处的一阶导数为0(因为f_AN = f_MAR),所以其渐近行为由二阶导数决定。二阶导数恰好是f_AN和f_MAR的得分函数之差的二阶矩。
    • 必要条件:参数模型假设、正则性条件、以及γ_0满足MAR。
    • 解决的技术难点:推导T_n的Hessian矩阵H(γ_0)的显式表达式,并证明其与二阶导数无关,从而简化了渐近分布的形式。
  • 附录B的Proposition 3(离散数据特例):给出了离散情况下更具体的渐近分布形式:n * T_n收敛到(1/8) * G' * S^+ * G,其中G是均值为0、协方差为V的高斯向量。这个结果更直观地展示了检验统计量与“第二边际差异”(t - f_2)的关系。
  • 蒙特卡洛模拟结果(Table 1):

    • Size:在H0(MAR成立)下,对于n=2000, 5000, 10000和d=2, 4,经验拒绝率都在名义水平10%附近(0.090到0.116之间),表明size控制良好。
    • Power:在H1(AN成立,但MAR不成立)下,power随样本量增加而迅速提高。当n=10000时,power达到100%。即使在n=2000时,power也超过58%。
    • 这个例子想说明:本文提出的检验方法在有限样本下具有良好的统计性质,能够准确控制第一类错误,并对非可忽略的流失机制具有很高的检验功效。
  • 证明路线与技术技巧:

  • 整体路线:
    1. 定义检验统计量:将T_n定义为f_AN和f_MAR的平方根密度之间的Hellinger距离。
    2. 参数化:假设f_1, f_2, f_s是参数化的,因此f_AN和f_MAR也是参数γ的函数。T_n可以写成T(ˆγ)。
    3. 二阶Delta方法:由于在原假设下f_AN = f_MAR,T(γ)在真值γ_0处的一阶导数为0。因此,T(ˆγ)的渐近行为由其二阶泰勒展开决定。
    4. 计算Hessian矩阵:计算T(γ)在γ_0处的Hessian矩阵H(γ_0)。证明的关键步骤是展示H(γ_0)可以简化为f_AN和f_MAR的得分函数之差的二阶矩,而不涉及二阶导数。
    5. 应用Delta方法:由√n(ˆγ - γ_0) → N(0, Ω),结合二阶Delta方法,得到n * T_n → (1/2) * g_0' * H(γ_0) * g_0。
  • 关键跳跃点:
    • 从一阶导数为0到二阶Delta方法:这是处理“退化”检验统计量的标准技巧。关键在于证明一阶导数确实为0,这依赖于f_AN = f_MAR在原假设下成立。
    • 简化Hessian矩阵:证明H(γ_0)中涉及二阶导数的项在积分后为0,这是本文的一个技术亮点。它使得最终的渐近分布只依赖于一阶导数(得分函数),大大简化了计算。
  • 技术技巧点名:

    • 二阶Delta方法:用于处理一阶导数为0的统计量。
    • Hellinger距离:选择Hellinger距离而非KL散度,是因为其Hessian矩阵的简化性质(不涉及二阶导数),使得渐近分布更易处理。
    • raking算法 / 迭代比例拟合:用于估计f_AN。本文直接借用了Franguridi et al. (2026a)的算法和其导数递归公式。
    • 影响函数 / 渐近线性表示:在离散情况的证明中(Lemma 2),通过推导√n(t - f_2)的影响函数,建立了其渐近正态性。
  • 真实例子与应用:

  • 用的什么数据/场景:来自Understanding America Study (UAS) 的一个子集。研究的问题是:财富持有如何受到收入、教育和认知的影响。数据包含两波(Wave 1: 2021-2023, Wave 2: 2023-2025),Wave 1有9725个观测,其中7432个在Wave 2中留存,Wave 2有2264个刷新样本。
  • 怎么把本文方法用上去:将四个解释变量(教育、收入、认知、金融财富)都离散化为三个类别。然后,在参数多项分布模型下,计算检验统计量T_n及其p值。
  • 得到什么结果:检验强烈拒绝了MAR假设,p值为5 * 10^{-6}。
  • 这个例子想说明:在实际的面板数据中,MAR假设可能是不合理的。Wave 2的流失可能与Wave 2中未观测到的变量(如认知能力下降)有关。这展示了本文检验方法的实用价值,能够为研究者提供关于MAR假设合理性的正式证据。

  • 🔎 结论是否比证明窄:

  • 是。本文的核心定理(Theorem 1)是在参数模型假设(Assumption 1)下严格证明的。然而,作者在结论和摘要中,有时会使用更宽泛的语言,如“develop a statistical test of MAR”。这可能会让读者误以为该方法适用于非参数或半参数设定。作者在Section 3.2的开头明确说明了“under the assumption that the densities ... are parametric”,但在更宏观的表述中,这个限制条件容易被忽略。
  • 具体语句:摘要中的“We develop a statistical test of MAR based on a distance between two estimated distributions”和结论中的“We propose to test the MAR assumption against a weaker alternative of additive nonignorability”都没有明确强调参数假设。虽然正文中已说明,但读者需注意,该检验的渐近理论严格依赖于参数模型。将其推广到半参数或非参数设定是一个开放问题。

四、开放问题

  1. 半参数/非参数推广:本文的渐近理论严格依赖于参数模型假设(Assumption 1)。一个自然的开放问题是:如何将检验推广到半参数或非参数设定?例如,能否使用DML(Double/Debiased Machine Learning)框架,用非参数方法估计f_1, f_2, f_s,并构造一个渐近正态的检验统计量?这扎根于本文的Assumption 1和Section 3.2的开头。
  2. 其他距离的检验:作者提到(Footnote 3)原则上可以使用其他统计距离(如KL散度),但渐近分布会更复杂。一个开放问题是:是否存在其他距离,其渐近分布比Hellinger距离更易处理,或者在某些备择假设下具有更高的power?这扎根于本文的Footnote 3。
  3. 多期面板的推广:本文只考虑了两期面板。Hoonhout and Ridder (2019)已经将AN识别推广到了多期。一个开放问题是:如何将本文的检验方法推广到多期面板,并处理非终期流失(nonterminal attrition)?这扎根于本文的Section 2(两期设定)和引用的Hoonhout and Ridder (2019)。
  4. 与Proximal Causal Inference的联系:本文的AN假设p(z1, z2) = exp(k1(z1) + k2(z2))在结构上与proximal causal inference中利用“负控制变量”进行识别有相似之处。一个值得探索的问题是:能否将本文的检验思路应用于proximal CI框架,用于检验“负控制变量”的有效性或“无未观测混杂”的假设?这扎根于本文的Section 1(作者framing中回避的竞争路线)和研究者自身的primary_interests。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论