跳转至

Testing selection on observables in parametric models with refreshment samples

作者: Grigory Franguridi, Arie Kapteyn
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.23508


一、领域脉络与小综述

这个方向是什么

本方向关注的是面板数据中因样本流失(attrition)或非随机无应答(nonresponse)导致的选择偏差问题。核心统计挑战在于:当个体是否在第二期被观测到(即是否“留存”)与第二期的结果变量(如收入、认知得分)相关时,仅使用留存样本进行推断会产生偏差。传统上,研究者常假设“基于可观测变量的选择”(selection on observables),即缺失数据机制为随机缺失(Missing At Random, MAR),意味着流失概率仅依赖于第一期已观测到的变量。然而,MAR假设在实证中往往不成立,且仅凭面板数据本身无法检验。本子方向的核心问题是:如何利用辅助数据(如刷新样本)来放松、检验或替代MAR假设,从而在非随机流失下仍能进行有效推断?

当前该方向的成熟度属于方法活跃期:已有多种识别策略(如加性不可忽略性假设、基于工具变量的方法),但大多数方法在计算或假设上仍有门槛,且缺乏对MAR假设本身的正式统计检验——这正是本文试图填补的缺口。

发展脉络(history)

  • 奠基工作:MAR假设与逆概率加权(IPW)。在面板数据中,若MAR成立,则可通过估计倾向得分(propensity score)并对留存样本进行逆概率加权(IPW)来获得无偏估计。这是最常用的基准方法,但其核心缺陷在于不可检验。

  • 主要进展:引入刷新样本(refreshment sample)以放松MAR。Hirano, Imbens, Ridder, and Rubin (2001) 提出了加性不可忽略性(Additive Nonignorability, AN)假设:流失概率可分解为仅依赖于第一期变量的部分和仅依赖于第二期变量的部分的乘积(指数形式)。在此假设下,利用刷新样本(即从第二期目标总体中独立抽取的新样本),联合分布f(z1, z2)可被完全识别。该文奠定了本子领域的理论基础,但留下的口子是:估计需要求解一个函数优化问题,计算复杂。

  • 当前Frontier:计算可行且可检验的方法。后续工作沿着两条路径推进:

    • 路径一(识别与估计):Deng, Hillygus, Reiter, Si, and Zheng (2013) 和 Si, Reiter, and Hillygus (2015) 发展了贝叶斯和半参数方法。Franguridi and Kosenkova (2024) 提出了一个闭式(closed-form)估计量,无需调参或优化。Franguridi, Hahn, Hoonhout, Kapteyn, and Ridder (2026a) 则证明了迭代比例拟合(raking)算法可高效求解AN假设下的密度估计问题,并给出了渐近方差和收敛率。
    • 路径二(检验):本文是第一条路径的自然延伸——既然AN假设下的估计已可行,那么就可以用它来构造对MAR假设的检验。
  • 本文的位置:本文是第一个在刷新样本框架下,对MAR假设提出正式统计检验的工作。它直接利用了Franguridi et al. (2026a)的raking算法和递推公式,将检验统计量的极限分布刻画为广义卡方分布,从而使得检验可操作。

子线索聚类

  1. 识别与估计线索:核心是“在AN假设下,如何从可观测分布(f1, f2, fs)恢复目标联合分布f(z1,z2)”。代表工作:Hirano et al. (2001)(理论识别),Franguridi et al. (2026a)(raking算法与渐近理论),Franguridi and Kosenkova (2024)(闭式估计)。
  2. 应用与实证线索:将上述方法应用于具体面板数据,评估流失影响。代表工作:Deng et al. (2013)(贝叶斯方法,AP-Yahoo! News Election Poll),Gatz et al. (2026)(UAS认知数据),以及本文的实证部分。
  3. 检验线索:本文是此线索的唯一代表。它提出了一种基于Hellinger距离的检验统计量,比较MAR和AN两种假设下估计出的联合分布。

这个方向在追问的核心问题

  1. 识别问题:在非随机流失下,需要多强的假设才能从可观测数据中识别出目标分布?AN假设是否是最弱且可操作的?
  2. 估计问题:给定识别策略,如何高效、稳定地估计目标分布及其参数?raking算法是否收敛,其渐近性质如何?
  3. 检验问题:如何正式地检验MAR假设的合理性?检验的功效如何,对何种偏离敏感?
  4. 稳健性问题:当AN假设本身也被违反时,估计和检验的稳健性如何?

当前主流方法与已知瓶颈:主流方法依赖于AN假设,并通过raking或闭式估计实现。瓶颈在于:① 大多数方法假设参数模型(如高斯或离散),限制了灵活性;② 对MAR的检验是本文首次提出,尚无半参数或非参数版本;③ 对AN假设本身的检验仍是空白。

⚠️ 作者的 framing

作者将缺口框架为:“MAR假设在刷新样本下变得可检验,但此前没有正式的统计检验方法”。因此,本文的贡献被定位为“显然的下一步”——既然AN假设下的估计(raking)已经可行,那么用它来检验MAR就是自然延伸。

被淡化或回避的竞争路线: - 作者明确将AN假设作为备择假设,但未讨论AN假设本身是否可检验。如果AN假设不成立,检验的结论可能不可靠。 - 作者假设输入分布为参数模型(高斯或离散),淡化了非参数或半参数方法的可能性。文中提到“原则上可推广到任何光滑链接函数G”,但未展开。 - 作者未与基于工具变量(IV)的检验方法进行比较。在某些设定下,IV也可用于检验选择偏差,但本文未提及。

什么明显该被引/该存在、却没出现在intro里? - 关于非参数检验的文献:例如,基于分布匹配或最大均值差异(MMD)的检验方法,这些方法可能不需要参数模型假设。作者未讨论为何选择参数化路径。 - 关于AN假设的检验:既然AN是备择假设,那么检验AN本身是否合理也是一个自然的问题。作者未提及任何相关工作或可能性。

张力

未见明显对立引用。所有被引工作基本在AN假设框架下推进,彼此互补而非矛盾。Hirano et al. (2001) 提供理论识别,Franguridi et al. (2026a) 提供计算工具,本文提供检验方法,形成一条清晰的逻辑链。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • Z1:第一期观测到的变量(向量),对所有单元都观测到。
    • Z2:第二期变量(向量),仅对留存单元观测到。
    • S:指示变量,S=1表示单元在第二期留存(被观测到),S=0表示流失。
    • p(z1, z2) = P(S=1 | Z1=z1, Z2=z2):选择概率(propensity score)。
    • f(z1, z2):目标联合密度(我们想推断的总体分布)。
    • f1(z1):Z1的边缘密度(可直接从第一期数据估计)。
    • f2(z2):Z2的边缘密度(可从刷新样本估计)。
    • fs(z1, z2) = f(z1, z2 | S=1):留存样本的联合密度(可直接从留存样本估计)。
    • f_MAR(z1, z2):在MAR假设下估计出的联合密度。
    • f_AN(z1, z2):在AN假设下估计出的联合密度。
    • n1:第一期样本量。
    • nr:刷新样本量。
    • n = n1 + nr:总样本量(用于渐近分析)。
  • 模型:

    • 数据生成机制:一个两期面板。第一期,所有n1个单元都观测到Z1。第二期,只有S=1的单元观测到Z2。此外,独立地从Z2的边际分布中抽取一个大小为nr的刷新样本Z2^r。
    • 流失机制:未知,由选择概率p(z1, z2)刻画。
    • 关键假设:
      • MAR(原假设H0):p(z1, z2) = p(z1),即流失概率仅依赖于Z1。
      • AN(备择假设H1):p(z1, z2) = exp(k1(z1) + k2(z2)),即流失概率可分解为Z1和Z2的函数的乘积(指数形式)。MAR是AN的一个特例(当k2(z2)为常数时)。
    • 参数模型假设(Assumption 1):f1, f2, fs属于参数族,即f1(·, γ1), f2(·, γ2), fs(·, γs),其中γ = (γ1', γ2', γs')'是有限维参数。
  • 可观测数据:

    • 可观测:
      1. 第一期数据:{Z1i}_{i=1}^{n1}。
      2. 留存样本数据:{(Z1i, Z2i) : Si=1}。
      3. 刷新样本数据:{Z2j^r}_{j=1}^{nr}。
    • 不可观测(潜在/反事实):
      1. 流失单元的Z2值。
      2. 选择概率p(z1, z2)本身。
      3. 目标联合分布f(z1, z2)。

第二步:讲最小内核——离散数据情形

本文的核心思路在离散数据(附录B)中最为清晰,可以剥离所有高斯假设和raking迭代的复杂性。

最简特例:假设Z1和Z2都是离散变量,分别有A和B个取值。那么所有分布都可以用概率质量函数(或矩阵)表示。

  • 可观测对象:

    • f1(a) = P(Z1=a):一个A维向量。
    • f2(b) = P(Z2=b):一个B维向量。
    • fs(a, b) = P(Z1=a, Z2=b | S=1):一个A x B矩阵。
    • 定义fs(b|a) = fs(a,b) / fs,1(a),其中fs,1(a) = Σ_b fs(a,b)。
  • MAR下的估计(f_MAR): 在MAR下,P(S=1|Z1, Z2) = P(S=1|Z1),因此f_MAR(a, b) = f1(a) * fs(b|a)。其第二期边际为t(b) = Σ_a f1(a) * fs(b|a)。

  • AN下的估计(f_AN): 在AN下,f_AN是满足边际约束(第一期为f1,第二期为f2)且最接近fs(在KL散度意义下)的分布。在离散情形下,这个解可以通过迭代比例拟合(IPF/raking) 得到,最终形式是f_AN(a, b) = f1(a) * f2(b) * exp(λ(a) + μ(b)),其中λ和μ是拉格朗日乘子。

  • 检验的核心思想:

    • 原假设H0(MAR):f_MAR = f_AN。这意味着f_MAR的第二期边际t(b)必须等于f2(b)。因为f_AN强制其第二期边际为f2,如果f_MAR的第二期边际不等于f2,那么f_MAR就不满足AN假设下的边际约束,从而与f_AN不同。
    • 检验统计量:检验MAR等价于检验t(b) = f2(b)是否成立。本文的Hellinger距离检验统计量Tn,在离散情形下,其渐近行为等价于检验√n( t̂ - f̂2 )是否显著偏离零。
  • 最小内核的数学问题: 命题:在离散设定下,检验MAR假设等价于检验以下假设: H0: t = f2,其中t(b) = Σ_a f1(a) * fs(b|a)。 证明思路:f_MAR和f_AN的Hellinger距离为零,当且仅当f_MAR的第二期边际等于f2。而f_MAR的第二期边际正是t。因此,检验f_MAR = f_AN等价于检验t = f2。

    为什么这个最小内核抓住了核心? 它剥离了所有关于raking迭代、高斯分布、Hellinger距离计算的复杂性,直接揭示了检验的本质:比较IPW加权后的第二期分布(t)与刷新样本分布(f2)是否一致。如果MAR成立,两者应相等;否则,差异就提供了违反MAR的证据。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在存在刷新样本的面板数据中,如何正式检验“基于可观测变量的选择”(MAR)假设。
  2. 核心工具/方法:通过比较在MAR假设下(IPW)和在AN假设下(raking)估计出的联合分布之间的Hellinger距离,构造检验统计量;并利用参数模型假设和二阶delta方法,推导出该统计量在原假设下收敛到广义卡方分布。
  3. 主要结论:当输入分布为参数模型时,检验统计量n * T̂n渐近服从一个由参数估计量的协方差矩阵和Hellinger距离的Hessian矩阵决定的广义卡方分布;蒙特卡洛模拟显示该检验具有良好的尺寸控制和较高的功效;在UAS数据的一个子集上,该检验强烈拒绝了MAR假设。

关键设定与假设

  • 设定:两期面板,第二期存在非随机流失,并有一个独立的刷新样本。
  • 关键假设:
    • Assumption 1 (参数模型):f1, f2, fs属于参数族,且其参数γ的估计量γ̂是√n-相合且渐近正态的。这是推导检验统计量渐近分布的核心假设,也是本文方法的主要局限性。
    • AN假设(备择假设):选择概率p(z1, z2) = exp(k1(z1) + k2(z2))。这个假设比MAR弱,但并非无假设。它允许流失依赖于Z2,但限制了依赖的形式(乘积可分解)。
    • MAR假设(原假设):p(z1, z2) = p(z1)。这是被检验的对象。
  • 相比已有文献的强化/放宽:
    • 强化:相比Hirano et al. (2001)的非参数识别,本文强化了参数模型假设,以获得检验统计量的闭式渐近分布。
    • 放宽:相比仅依赖MAR的IPW方法,本文放宽了原假设,允许在备择假设下存在非随机流失。

主要结果

  • 定理1(渐近分布):在Assumption 1和原假设MAR下,检验统计量n * T̂n依分布收敛到1/2 * g0' * H(γ0) * g0,其中g0 ~ N(0, Ω(γ0)),H(γ0)是Hellinger距离的Hessian矩阵,Ω(γ0)是参数估计量的渐近协方差矩阵。

    • 直觉:由于在原假设下,f_AN = f_MAR,Hellinger距离的一阶导数为零。因此,检验统计量的行为由二阶项主导,即参数估计误差的二次型。
    • 必要条件:参数模型假设(Assumption 1)和原假设MAR成立。
    • 解决的技术难点:如何计算H(γ0)。作者利用Franguridi et al. (2026a)中开发的raking算法导数递推公式,给出了f_AN和f_MAR对γ的得分函数(score function)的显式计算方法,从而可以估计H(γ0)。
  • 蒙特卡洛模拟结果(表1):

    • 尺寸控制:在H0(MAR成立)下,对于d=2,4和n=2000,5000,10000,经验拒绝率均在10%的名义水平附近(0.090-0.116),表明检验具有良好的尺寸控制。
    • 功效:在H1(AN成立,且选择依赖于||Z2||^2)下,功效随样本量增加而迅速提升。当n=10000时,功效达到100%。即使在n=2000时,功效也超过58%。
    • 结论:模拟验证了检验在有限样本下的有效性。

证明路线与技术技巧

  • 整体路线:

    1. 参数化:将f1, f2, fs参数化为f1(·, γ1), f2(·, γ2), fs(·, γs)。
    2. 估计:通过raking算法(Franguridi et al., 2026a)从参数化输入中估计f_AN(·, γ),通过IPW公式估计f_MAR(·, γ)。
    3. 距离计算:定义检验统计量T̂n为f_AN和f_MAR之间的平方Hellinger距离。
    4. 极限分布推导: a. 将T̂n视为参数γ的函数T(γ̂)。 b. 在原假设H0: f_AN = f_MAR下,T(γ0) = 0且一阶导数∇T(γ0) = 0。 c. 应用二阶delta方法:n * T̂n ≈ n * (1/2) * (γ̂ - γ0)' * ∇²T(γ0) * (γ̂ - γ0)。 d. 计算Hessian矩阵∇²T(γ0),证明其等于H(γ0),即得分函数之差的期望外积。 e. 由√n(γ̂ - γ0) → N(0, Ω),得到n * T̂n收敛到1/2 * g0' * H(γ0) * g0,这是一个广义卡方分布。
  • 关键跳跃点:

    • 从一阶到二阶:证明∇T(γ0) = 0是应用二阶delta方法的前提。这依赖于原假设下f_AN = f_MAR,使得Hellinger距离的梯度在真值处为零。
    • Hessian矩阵的计算:计算∇²T(γ0)需要f_AN和f_MAR对γ的一阶导数(即得分函数)。f_MAR的得分函数容易计算,但f_AN的得分函数需要通过raking迭代的导数递推公式(公式7)来获得,这是技术上的核心难点。
  • 技术技巧点名:

    • 二阶delta方法:用于处理统计量在原假设下导数为零的情况,得到非退化的极限分布。
    • raking算法(迭代比例拟合):用于在AN假设下,从参数化边际分布中恢复联合分布f_AN。
    • 递推公式求导:对raking迭代过程进行自动微分(公式7),以获得f_AN对参数的导数,这是估计Hessian矩阵H(γ0)的关键。
    • 广义卡方分布:极限分布是参数估计量的二次型,其分布不是标准卡方,而是加权卡方和,需要通过数值方法(如bootstrap)或特征值分解来获取临界值。

真实例子与应用

  • 数据:Understanding America Study (UAS) 的一个子集,包含Wave 1 (2021-2023) 和 Wave 2 (2023-2025) 的数据。变量包括收入、教育、认知和金融财富,均被离散化为三个类别。
  • 如何应用:将Wave 1的9,725个观测作为第一期数据,其中7,432个在Wave 2留存。Wave 2的2,264个新受访者作为刷新样本。使用本文提出的检验方法,在参数模型(离散)下计算检验统计量和p值。
  • 结果:检验强烈拒绝了MAR假设,p值为5 * 10^{-6}。
  • 这个例子想说明什么:展示了本文提出的检验在真实面板数据中的可操作性,并提供了一个实证证据,表明在UAS中,Wave 2的流失可能与Wave 2中未观测到的变量(如认知能力下降)相关,因此不能简单地假设MAR。

🔎 结论是否比证明窄

  • 窄化之处:定理1的证明严格依赖于参数模型假设(Assumption 1)。然而,在引言和结论中,作者将方法描述为一种通用的检验框架。例如,结论中说“When the input distributions are parameterized...”,这准确地反映了证明的适用范围。但在引言中,作者说“We develop a statistical test of MAR...”,没有明确强调参数模型的限制,可能会让读者误以为该方法适用于更广泛的非参数设定。
  • 泛化claim:作者在Remark 3.1中提到可以检验“对称的MAR”(即选择依赖于Z1而非Z2),但并未给出该情形下的理论证明或模拟结果。这是一个conjecture,而非已证明的结论。
  • AN假设的检验:本文检验的是MAR vs. AN。如果AN假设本身不成立(例如,选择概率是Z1和Z2的更复杂函数),那么检验的结论(拒绝MAR)可能仍然正确,但解释(“存在对Z2的依赖”)可能不准确。作者未讨论AN假设被违反时的稳健性。

四、开放问题

  1. 放松参数模型假设:本文的渐近理论严格依赖于参数模型假设(Assumption 1)。一个自然的开放问题是:能否将检验推广到半参数或非参数设定? 例如,当f1, f2, fs通过核密度估计或级数估计得到时,检验统计量的渐近分布是什么?这需要处理非参数估计的慢收敛率和偏差问题。扎根点:Assumption 1 (i) “The densities ... belong to parametric families”。

  2. 检验AN假设本身:本文以AN为备择假设。但AN本身也是一个假设。能否构造一个检验来评估AN假设相对于更一般(如非参数)的流失机制的合理性? 这可能需要额外的数据或更强的识别条件。扎根点:作者在脚注1中提到“In principle, all the theoretical results of this paper can be generalized to any smooth link function G”,但这并未解决AN假设本身的可检验性问题。

  3. 高维情形下的检验:当Z1和Z2的维度d较高时,参数模型(如高斯)的估计和raking算法的计算复杂度都会增加。检验在高维下的表现如何?是否存在维数灾难?能否利用稀疏性假设来改进? 扎根点:蒙特卡洛模拟中仅考虑了d=2,4的低维情形。

  4. 与其他检验方法的比较:本文未与任何其他检验MAR的方法进行比较(因为这是第一个)。未来工作可以系统地比较本文的检验与基于其他识别策略(如工具变量)的检验方法在功效和稳健性上的差异。 扎根点:引言中未提及任何竞争性的检验方法。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论