Testing selection on observables in parametric models with refreshment samples¶
作者: Grigory Franguridi, Arie Kapteyn
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.23508
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:在面板数据中,当样本因非随机原因(如流失、无响应)而缺失时,如何对“缺失机制”的假设进行统计检验。核心挑战在于,最常用的假设——缺失随机(MAR,即selection on observables)——在仅有面板数据时是不可检验的。本文利用一种特殊的辅助数据——刷新样本(refreshment sample)——来构造一个可检验的假设,从而允许研究者对MAR假设的合理性进行正式的统计推断。该方向当前处于“从识别理论走向可操作检验”的阶段,已有成熟的识别结果,但缺乏一个通用、计算可行的检验程序。
发展脉络(history)¶
- 奠基工作:Hirano, Imbens, Ridder, and Rubin (2001)。这篇Econometrica论文首次系统性地证明了:在存在刷新样本的情况下,通过引入可加非可忽略性(additive nonignorability, AN)假设,可以非参数地识别面板数据中因非随机流失而缺失的联合分布。AN假设(选择概率为
exp(k1(z1) + k2(z2)))比MAR更弱,且将MAR作为特例包含在内。该文奠定了整个子方向的理论基础,但留下的口子是:识别出的分布需要通过求解一个泛函最小化问题来获得,这在计算上具有挑战性,限制了其实际应用。 - 主要进展:Franguridi et al. (2026a)。这篇论文(作者与本文高度重叠)解决了Hirano et al. (2001)留下的计算瓶颈。它证明了AN下的识别问题等价于一个KL投影问题,并且该问题可以通过迭代比例拟合(raking / iterative proportional fitting)算法高效求解。该文建立了raking估计量的一致性和收敛速度,并给出了一个用于估计渐近方差的递归公式。留下的口子是:它主要关注估计,并未提供一个正式的假设检验程序来评估MAR是否成立。
- 当前frontier与本文位置:本文直接站在Franguridi et al. (2026a)的肩膀上,将其raking算法从“估计工具”升级为“检验工具”。本文的核心贡献是:在参数模型设定下,构造了一个基于Hellinger距离的检验统计量,该统计量在原假设(MAR)下收敛到广义卡方分布,且其临界值可以通过Franguridi et al. (2026a)的递归公式计算。因此,本文填补了从“识别与估计”到“假设检验”的关键空白。
子线索聚类¶
这些被引文献大致落在两条子线索上: 1. 识别与估计策略:核心是回答“在AN假设下,如何从可观测数据中恢复目标分布?”这条线索包括Hirano et al. (2001)(理论识别)、Franguridi et al. (2026a)(raking算法)、Franguridi and Kosenkova (2026)(闭式估计量)、以及Hoonhout and Ridder (2019)(多期面板)。它们共同构建了从理论到算法的工具箱。 2. 刷新样本的应用与推广:核心是论证刷新样本的价值并推广其应用场景。这条线索包括Deng et al. (2013)(全面论证刷新样本在诊断和调整流失偏倚中的作用)、Si et al. (2015)(半参数选择模型)、以及Chen et al. (2017)(零售数据中的应用)。它们为本文的检验方法提供了实证动机和背景。
这个方向在追问的核心问题¶
- MAR假设是否成立? 这是所有面板数据分析者都面临的根本问题,因为错误的MAR假设会导致有偏估计。
- 如何利用刷新样本构造一个可操作的检验? 这是从理论识别走向实际应用的关键一步。
- 检验的统计性质如何? 包括检验的渐近分布、有限样本下的size和power,以及对模型假设(如参数形式)的敏感性。
- 当前主流方法与已知瓶颈:主流方法是直接假设MAR,然后使用IPW或基于模型的插补。已知瓶颈是MAR不可检验,且其合理性常受质疑。本文提出的检验方法直接针对这一瓶颈,但代价是依赖于AN假设和参数模型设定。
⚠️ 作者的framing¶
- 作者把缺口frame成什么? 作者将缺口frame为:“MAR假设虽然常用但不可检验,而刷新样本的存在使其变得可检验,但缺乏一个通用的检验程序。” 因此,本文被定位为“显然的下一步”:提供一个基于已有识别和估计工具(AN假设 + raking算法)的正式检验。
- 哪些竞争路线被他淡化或回避了? 作者明确选择了参数模型作为设定。这回避了半参数或非参数检验的复杂性。作者在Remark 3.1中提到了检验对称假设(选择概率只依赖于Z2)的可能性,但并未深入。此外,作者完全回避了与基于工具变量(IV)或proximal causal inference的检验方法的比较,尽管这些方法也旨在处理不可观测的混淆因素。
- 什么明显该被引/该存在、却没出现在intro里? 这是一个值得研究者去查的问题。例如,是否有文献在proximal causal inference框架下,利用“负控制变量(negative control)”来检验MAR或类似假设?如果有,本文的检验方法与proximal CI的检验方法在假设、识别策略和计算上有什么异同?这可能是连接本文与研究者更熟悉的proximal CI领域的一个潜在桥梁。
张力¶
未见明显对立引用。所有被引工作都一致认为:在存在刷新样本时,AN假设是一个比MAR更弱且有用的识别假设,而raking算法是求解AN下识别问题的有效工具。本文的工作是这一共识的自然延伸。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
Z_it = (Y_it, X_it):个体i在时期t(t=1,2)的观测数据,包含结果变量Y和协变量X。S_i:指示变量,S_i = 1表示个体i在第二期仍留在样本中(即“留存者”),S_i = 0表示流失。p(z1, z2) = P(S_i = 1 | Z_1i = z1, Z_2i = z2):选择概率,即给定完整数据下个体留存的概率。这是不可观测的,因为流失者的Z_2缺失。f(z1, z2):目标联合分布,即我们想要估计的、无流失情况下的(Z1, Z2)分布。这是想要但观测不到的。f_1(z1):第一期的边际分布。可观测,因为第一期没有流失。f_s(z1, z2) = f(z1, z2 | S=1):留存者的联合分布。可观测,因为留存者的(Z1, Z2)都完整。f_2(z2):第二期的边际分布。可观测,因为刷新样本Z^r_i2是从这个分布中独立抽取的。n:第一期样本量。n_r:刷新样本量。总样本量n_total = n + n_r。-
γ = (γ1, γ2, γs):参数向量,分别参数化f_1,f_2,f_s。 -
模型:
- 数据生成机制:一个两期面板,第一期所有个体都被观测。第二期,个体以概率
p(z1, z2)留存,流失者的Z_2缺失。此外,独立抽取一个刷新样本Z^r_i2,其分布与目标第二期边际分布f_2相同。 - 核心假设(备择假设):选择概率满足可加非可忽略性(AN),即
p(z1, z2) = exp(k1(z1) + k2(z2))。这意味着选择概率在对数尺度上是可加的。 - 核心假设(原假设):缺失随机(MAR),即
p(z1, z2) = p(z1),选择概率只依赖于第一期观测值。 -
参数模型假设(Assumption 1):
f_1,f_2,f_s属于已知的参数族(如高斯分布、多项分布),且参数γ可以以√n速率一致估计。 -
可观测数据:
- 可观测:
- 第一期数据:
{Z_1i}_{i=1}^n。 - 留存者数据:
{(Z_1i, Z_2i) : S_i = 1}。 - 刷新样本数据:
{Z^r_i2}_{i=1}^{n_r}。
- 第一期数据:
- 想要但观测不到:
- 流失者的
Z_2。 - 目标联合分布
f(z1, z2)。 - 选择概率
p(z1, z2)。
- 流失者的
第二步:讲最小内核——离散数据特例¶
为了看清核心思路,我们考虑一个最简特例:Z1和Z2都是二值变量,取值0或1。所有分布都是多项分布,参数就是概率。
- 可观测数据:
f_1(0), f_1(1):从第一期数据估计。f_s(0,0), f_s(0,1), f_s(1,0), f_s(1,1):从留存者数据估计。-
f_2(0), f_2(1):从刷新样本估计。 -
核心问题:我们想检验MAR是否成立。在离散情况下,MAR意味着选择概率
p(z1, z2)不依赖于z2。这等价于说,在给定Z1的条件下,留存者的Z2分布与目标Z2分布相同。即,对于所有z1,有P(Z2 = b | Z1 = a, S=1) = P(Z2 = b | Z1 = a)。但后者不可观测。 -
核心思路:本文的检验不直接检验这个条件,而是比较两个可估计的联合分布:
f_MAR:在MAR假设下,我们可以用IPW或更简单的公式估计联合分布。对于离散情况,f_MAR(a, b) = f_1(a) * f_s(b|a)。这个分布的第二边际是t(b) = Σ_a f_1(a) * f_s(b|a)。-
f_AN:在更弱的AN假设下,我们可以通过raking算法,从f_s出发,交替投影到边际f_1和f_2上,最终收敛到f_AN。这个分布的第二边际恰好等于刷新样本的边际f_2。 -
检验逻辑:
- 如果MAR成立,那么
f_MAR和f_AN应该相等。特别地,f_MAR的第二边际t应该等于f_2。 - 如果MAR不成立(但AN成立),那么
f_MAR和f_AN会不同。f_MAR的第二边际t会偏离f_2。 -
因此,检验MAR等价于检验
t = f_2。本文的Hellinger距离统计量T_n就是衡量f_MAR和f_AN的整体差异,而不仅仅是第二边际的差异。 -
在这个特例下,要证的命题退化成什么?
- 原假设
H0: MAR成立。 - 检验统计量
n * T_n在原假设下收敛到一个广义卡方分布。对于离散情况,附录B的Proposition 3给出了一个更具体的结果:n * T_n收敛到(1/8) * G' * S^+ * G,其中G是一个均值为0、协方差为V的高斯向量,S和V都是可观测数据的函数。 -
这个结果的核心是:
√n * (t - f_2)收敛到一个高斯分布,而T_n是这个高斯向量的二次型。因此,检验的关键就是估计这个二次型的分布。 -
为什么这个特例能体现核心数学困难?
- 困难不在于计算
f_MAR或f_AN(在离散情况下,raking算法就是简单的矩阵乘法),而在于推导T_n的渐近分布。这需要:- 对
T_n进行二阶泰勒展开(因为一阶导数为0)。 - 将
T_n表示为(t - f_2)的二次型加上一个可忽略的余项。 - 推导
√n * (t - f_2)的渐近正态性,这需要计算其影响函数和渐近方差。 - 处理
S矩阵的奇异性(因为概率有和为1的约束),使用Moore-Penrose逆。
- 对
- 本文的定理1和附录B的证明,正是处理了这些在一般参数模型下的技术细节。
三、这篇论文做了什么¶
- 三句话:
- 研究了什么问题:在存在刷新样本的面板数据中,如何对“缺失随机(MAR)”这一常用但不可检验的假设进行统计检验。
- 核心工具/方法:构造了一个基于Hellinger距离的检验统计量,该距离衡量了在MAR假设下估计的联合分布
f_MAR与在更弱的可加非可忽略性(AN)假设下估计的联合分布f_AN之间的差异。f_AN的估计使用了Franguridi et al. (2026a)的raking算法。 -
主要结论:在参数模型设定下,该检验统计量在原假设(MAR)下收敛到一个广义卡方分布,其临界值可以通过Franguridi et al. (2026a)的递归公式计算。蒙特卡洛模拟验证了检验的良好有限样本性质(size控制准确,power高),并在UAS数据的一个子集上进行了实证应用。
-
关键设定与假设:
- 设定:两期面板数据,第二期存在非随机流失,并有一个独立的刷新样本。
- 核心假设:
- AN假设(备择假设):选择概率
p(z1, z2) = exp(k1(z1) + k2(z2))。这是本文检验的“备择世界”的模型。它比MAR更弱,允许选择依赖于未观测的Z2。 - MAR假设(原假设):
p(z1, z2) = p(z1)。这是本文要检验的零假设。 - 参数模型假设(Assumption 1):
f_1,f_2,f_s属于已知的参数族,且参数可以√n速率一致估计。这是本文推导渐近分布的核心假设,也是其与更一般的半参数方法的主要区别。 - 正则性条件:密度函数关于参数二次连续可微且在支撑上为正(Assumption 1(ii)),参数估计量渐近正态(Assumption 1(iii))。
- AN假设(备择假设):选择概率
-
相比已有文献的放宽或强化:
- 放宽:相比直接假设MAR,本文允许在备择假设下检验其合理性。
- 强化:相比Hirano et al. (2001)的非参数识别结果,本文为了得到可操作的检验,强化了假设,要求输入分布是参数化的。这使得渐近分布的理论推导成为可能。
-
主要结果:
- 定理1(核心结果):在Assumption 1下,在原假设MAR成立时,检验统计量
n * T_n依分布收敛到(1/2) * g_0' * H(γ_0) * g_0,其中g_0是均值为0、协方差为Ω(γ_0)的高斯向量,H(γ_0)是Hellinger距离的Hessian矩阵。这个分布是一个广义卡方分布。- 直觉:
T_n在γ_0处的一阶导数为0(因为f_AN = f_MAR),所以其渐近行为由二阶导数决定。二阶导数恰好是f_AN和f_MAR的得分函数之差的二阶矩。 - 必要条件:参数模型假设、正则性条件、以及
γ_0满足MAR。 - 解决的技术难点:推导
T_n的Hessian矩阵H(γ_0)的显式表达式,并证明其与二阶导数无关,从而简化了渐近分布的形式。
- 直觉:
- 附录B的Proposition 3(离散数据特例):给出了离散情况下更具体的渐近分布形式:
n * T_n收敛到(1/8) * G' * S^+ * G,其中G是均值为0、协方差为V的高斯向量。这个结果更直观地展示了检验统计量与“第二边际差异”(t - f_2)的关系。 -
蒙特卡洛模拟结果(Table 1):
- Size:在
H0(MAR成立)下,对于n=2000, 5000, 10000和d=2, 4,经验拒绝率都在名义水平10%附近(0.090到0.116之间),表明size控制良好。 - Power:在
H1(AN成立,但MAR不成立)下,power随样本量增加而迅速提高。当n=10000时,power达到100%。即使在n=2000时,power也超过58%。 - 这个例子想说明:本文提出的检验方法在有限样本下具有良好的统计性质,能够准确控制第一类错误,并对非可忽略的流失机制具有很高的检验功效。
- Size:在
-
证明路线与技术技巧:
- 整体路线:
- 定义检验统计量:将
T_n定义为f_AN和f_MAR的平方根密度之间的Hellinger距离。 - 参数化:假设
f_1,f_2,f_s是参数化的,因此f_AN和f_MAR也是参数γ的函数。T_n可以写成T(ˆγ)。 - 二阶Delta方法:由于在原假设下
f_AN = f_MAR,T(γ)在真值γ_0处的一阶导数为0。因此,T(ˆγ)的渐近行为由其二阶泰勒展开决定。 - 计算Hessian矩阵:计算
T(γ)在γ_0处的Hessian矩阵H(γ_0)。证明的关键步骤是展示H(γ_0)可以简化为f_AN和f_MAR的得分函数之差的二阶矩,而不涉及二阶导数。 - 应用Delta方法:由
√n(ˆγ - γ_0) → N(0, Ω),结合二阶Delta方法,得到n * T_n → (1/2) * g_0' * H(γ_0) * g_0。
- 定义检验统计量:将
- 关键跳跃点:
- 从一阶导数为0到二阶Delta方法:这是处理“退化”检验统计量的标准技巧。关键在于证明一阶导数确实为0,这依赖于
f_AN = f_MAR在原假设下成立。 - 简化Hessian矩阵:证明
H(γ_0)中涉及二阶导数的项在积分后为0,这是本文的一个技术亮点。它使得最终的渐近分布只依赖于一阶导数(得分函数),大大简化了计算。
- 从一阶导数为0到二阶Delta方法:这是处理“退化”检验统计量的标准技巧。关键在于证明一阶导数确实为0,这依赖于
-
技术技巧点名:
- 二阶Delta方法:用于处理一阶导数为0的统计量。
- Hellinger距离:选择Hellinger距离而非KL散度,是因为其Hessian矩阵的简化性质(不涉及二阶导数),使得渐近分布更易处理。
- raking算法 / 迭代比例拟合:用于估计
f_AN。本文直接借用了Franguridi et al. (2026a)的算法和其导数递归公式。 - 影响函数 / 渐近线性表示:在离散情况的证明中(Lemma 2),通过推导
√n(t - f_2)的影响函数,建立了其渐近正态性。
-
真实例子与应用:
- 用的什么数据/场景:来自Understanding America Study (UAS) 的一个子集。研究的问题是:财富持有如何受到收入、教育和认知的影响。数据包含两波(Wave 1: 2021-2023, Wave 2: 2023-2025),Wave 1有9725个观测,其中7432个在Wave 2中留存,Wave 2有2264个刷新样本。
- 怎么把本文方法用上去:将四个解释变量(教育、收入、认知、金融财富)都离散化为三个类别。然后,在参数多项分布模型下,计算检验统计量
T_n及其p值。 - 得到什么结果:检验强烈拒绝了MAR假设,p值为
5 * 10^{-6}。 -
这个例子想说明:在实际的面板数据中,MAR假设可能是不合理的。Wave 2的流失可能与Wave 2中未观测到的变量(如认知能力下降)有关。这展示了本文检验方法的实用价值,能够为研究者提供关于MAR假设合理性的正式证据。
-
🔎 结论是否比证明窄:
- 是。本文的核心定理(Theorem 1)是在参数模型假设(Assumption 1)下严格证明的。然而,作者在结论和摘要中,有时会使用更宽泛的语言,如“develop a statistical test of MAR”。这可能会让读者误以为该方法适用于非参数或半参数设定。作者在Section 3.2的开头明确说明了“under the assumption that the densities ... are parametric”,但在更宏观的表述中,这个限制条件容易被忽略。
- 具体语句:摘要中的“We develop a statistical test of MAR based on a distance between two estimated distributions”和结论中的“We propose to test the MAR assumption against a weaker alternative of additive nonignorability”都没有明确强调参数假设。虽然正文中已说明,但读者需注意,该检验的渐近理论严格依赖于参数模型。将其推广到半参数或非参数设定是一个开放问题。
四、开放问题¶
- 半参数/非参数推广:本文的渐近理论严格依赖于参数模型假设(Assumption 1)。一个自然的开放问题是:如何将检验推广到半参数或非参数设定?例如,能否使用DML(Double/Debiased Machine Learning)框架,用非参数方法估计
f_1,f_2,f_s,并构造一个渐近正态的检验统计量?这扎根于本文的Assumption 1和Section 3.2的开头。 - 其他距离的检验:作者提到(Footnote 3)原则上可以使用其他统计距离(如KL散度),但渐近分布会更复杂。一个开放问题是:是否存在其他距离,其渐近分布比Hellinger距离更易处理,或者在某些备择假设下具有更高的power?这扎根于本文的Footnote 3。
- 多期面板的推广:本文只考虑了两期面板。Hoonhout and Ridder (2019)已经将AN识别推广到了多期。一个开放问题是:如何将本文的检验方法推广到多期面板,并处理非终期流失(nonterminal attrition)?这扎根于本文的Section 2(两期设定)和引用的Hoonhout and Ridder (2019)。
- 与Proximal Causal Inference的联系:本文的AN假设
p(z1, z2) = exp(k1(z1) + k2(z2))在结构上与proximal causal inference中利用“负控制变量”进行识别有相似之处。一个值得探索的问题是:能否将本文的检验思路应用于proximal CI框架,用于检验“负控制变量”的有效性或“无未观测混杂”的假设?这扎根于本文的Section 1(作者framing中回避的竞争路线)和研究者自身的primary_interests。
Maintained by 陈星宇 · Homepage · Source on GitHub