Statistical Inference with Nonignorable Non-Probability Survey Samples¶
讲者: Changbao Wu
会场: Advanced Methods for Inference with Data from Multiple Sources
报告题目: Calibration-Based Estimation Method for Nonignorable Non-Probability Survey Samples
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是非概率样本的统计推断,具体而言,是如何利用一个参考概率样本提供的辅助信息,对来自未知参与机制的非概率样本进行总体均值的估计和推断。其根本的统计问题是:当样本的选取机制(参与机制)未知且可能与研究变量相关时,如何从有偏样本中恢复总体参数。该方向当前处于快速发展期,但大部分工作建立在“参与机制可忽略”(即给定协变量后,参与与否与结果变量独立)的假设之上,对“不可忽略”机制的处理仍非常有限。
发展脉络(history)¶
-
奠基工作:建立“两样本”框架与可忽略假设下的基本方法
- Rivers (2007) 和 Valliant & Dever (2011) 奠定了本文所依赖的核心框架:存在一个非概率样本(含响应变量y和协变量x),以及一个参考概率样本(仅含协变量x和抽样权重)。Rivers (2007) 提出了“样本匹配”(sample matching)方法,并证明在“面板成员身份可忽略”的假设下,匹配估计量是一致的。Valliant & Dever (2011) 则系统性地讨论了使用伪似然方法估计倾向得分(参与概率)以调整志愿者网络调查的偏差。
- Chen et al. (2020) 是本文最直接的“前身”。他们在相同的两样本设定下,提出了一个完整的推断框架:用伪似然估计倾向得分(假设可忽略),然后构造了逆概率加权(IPW)、回归预测和双重稳健(DR)三种总体均值估计量,并给出了方差估计。本文将其称为“doubly robust inference with nonprobability survey samples”,并指出其核心假设是参与机制可忽略(γ=0)。
-
主要进展:处理不可忽略缺失数据的识别与估计
- Kim & Morikawa (2023) 是本文最直接相关的竞争工作。他们首次在非概率样本的语境下处理了不可忽略的参与机制,但假设辅助变量(x)在整个有限总体层面是已知的(即总体协变量分布已知)。他们提出了一个基于经验似然(EL)的校准方法来估计参与概率,并构造了总体均值的EL估计量。本文指出,该方法的有效性依赖于参与机制和结果回归的参数模型假设,且其校准方法在本文的两样本设定下会遇到“多个解”的问题。
- 在更广泛的不可忽略缺失数据文献中,Miao et al. (2016)、Liu et al. (2022) 和 Li et al. (2023) 的工作被本文引用,以强调参数可识别性是一个普遍挑战。特别是 Li et al. (2023) 指出了IPW方法在不可忽略缺失数据中的不稳定性(源于矩母函数估计),并提出了一个基于条件似然的补救方法。这些工作为本文处理非概率样本中的不可忽略性提供了理论基础。
-
当前Frontier与本文位置
- 当前的前沿是:在更现实的两样本设定下(参考概率样本仅提供协变量信息,而非总体协变量分布),如何对不可忽略的参与机制进行有效的统计推断。本文直接填补了这一空白。它继承了Chen et al. (2020)的两样本框架,但放弃了可忽略性假设;它借鉴了Kim & Morikawa (2023)处理不可忽略性的思路,但将其适配到两样本设定,并提出了一个更稳定(无多解问题)的伪似然估计方法。
子线索聚类¶
这些被引文献大致落在以下三条子线索上:
-
基于倾向得分的方法(Propensity Score-based Methods):核心是估计非概率样本的参与概率(倾向得分),然后通过加权(IPW)或校准来调整偏差。
- 代表工作:Valliant & Dever (2011), Chen et al. (2020), Wang et al. (2021), Chen et al. (2022), Liu & Valliant (2023), Kim & Morikawa (2023)。
- 核心问题:如何利用参考概率样本的信息来估计倾向得分?如何处理模型误设和极端权重?
- 本文贡献:提出了一个在两样本设定下处理不可忽略机制的伪似然估计方法,避免了校准方法的多解问题。
-
基于模型预测的方法(Model-based Prediction / Mass Imputation):核心是假设一个从非概率样本中估计的回归模型可以“移植”到总体或概率样本上,从而预测未观测到的响应。
- 代表工作:Rivers (2007), Chen et al. (2020), Kim et al. (2021), Yang et al. (2021)。
- 核心问题:如何保证回归模型的可移植性(transportability)?如何处理模型误设?
- 本文贡献:在不可忽略机制下,推导了条件期望E(y|x)的显式表达式(Proposition 2.2),并基于此构造了回归预测估计量。
-
双重稳健与集成方法(Doubly Robust and Integrated Methods):结合倾向得分加权和结果回归,以期在其中一个模型正确时仍能获得一致估计。
- 代表工作:Chen et al. (2020), Rafei et al. (2020, 2022), Wang et al. (2020)。
- 核心问题:如何构造在更复杂设定下(如不可忽略机制、非参数模型)仍具有双重稳健性的估计量?
- 本文贡献:构造了AIPW估计量,但明确指出在不可忽略机制下,该估计量不再具有双重稳健性(Remark 2.3),因为条件均值m(x)依赖于参与模型和结果模型两者。
这个方向在追问的核心问题¶
- 识别问题(Identifiability):在不可忽略的参与机制下,模型参数(尤其是参与模型中的γ)是否可识别?需要什么样的条件(如工具变量)?
- 估计问题(Estimation):如何稳定、有效地估计参与概率和总体均值?特别是在两样本设定下,如何利用参考概率样本的信息?
- 稳健性问题(Robustness):当参与模型或结果模型被误设时,估计量的表现如何?能否构造出双重稳健甚至更高阶稳健的估计量?
- 推断问题(Inference):如何为估计量构造有效的方差估计和置信区间?特别是在涉及两个独立样本(非概率和概率)时,如何正确量化不确定性?
⚠️ 作者的 framing¶
- 作者的缺口描述:作者将缺口明确frame为“现有文献大多假设参与机制是可忽略的(ignorable),但这一假设在实践中可能不成立(例如,心情好的人更愿意参与调查)”。因此,本文是“显然的下一步”:在相同的两样本框架下,放松可忽略性假设,处理非可忽略机制。
- 被淡化/回避的竞争路线:
- Kim & Morikawa (2023) 被明确提及,但作者通过模拟(Table 2)展示了其校准方法存在“多解”问题,而本文的伪似然方法没有,从而突出了本文方法的稳定性优势。作者也指出Kim & Morikawa的方法假设辅助变量在总体层面已知,而本文的设定更现实(仅从概率样本中获取)。
- 非参数方法(如Wang et al. (2020)的核匹配,Rafei et al. (2020)的BART)被提及,但仅限于可忽略机制。作者在Section 5中将其列为未来工作,暗示当前论文专注于参数模型,这是处理非可忽略性时的一个常见但重要的起点。
- 什么明显该被引/该存在、却没出现在intro里?
- 值得研究者去查的问题:本文引用了Miao et al. (2024)关于“影子变量”(shadow variable)的识别与半参数效率理论的工作,但仅在参考文献列表中,未在intro中讨论。Miao et al. (2024)提供了一个比本文Proposition 2.1更一般的非参数识别条件,并给出了半参数效率界。本文的识别条件(基于工具变量z)是Miao et al. (2024)框架的一个特例。检查Miao et al. (2024)是否提供了更优的识别策略或效率下界,是评估本文理论贡献深度的一个关键点。
张力¶
未见明显对立引用。所有被引工作基本在同一个渐进发展的框架内,没有出现对同一问题得出相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
U = {1, ..., N}: 有限总体,包含N个单元。i: 总体中的单元索引。x_i: 单元i的辅助变量(协变量)向量。可观测于所有样本。y_i: 单元i的响应变量(研究变量)。可观测于非概率样本,不可观测于概率样本和总体。R_i = I(i ∈ S_A): 单元i是否被纳入非概率样本的指示变量。不可观测于总体,仅对非概率样本中的单元已知(R_i=1)。S_A: 非概率样本,大小为n_A。可观测数据为{(x_i, y_i), i ∈ S_A}。S_B: 参考概率样本,大小为n_B。可观测数据为{(x_i, d_i^B), i ∈ S_B},其中d_i^B是已知的抽样权重。π_A(x, y; θ) = P(R=1 | x, y): 参与概率(倾向得分),是目标参数,依赖于x和y。θ = (α, β^T, γ)^T: 参与概率模型中的未知参数向量。γ是衡量非可忽略性的关键参数(γ=0表示可忽略)。f(y | x; ξ): 在非概率样本中,给定x时y的条件概率密度/质量函数,是目标参数。ξ: 结果模型中的未知参数向量。μ_0 = N^{-1} Σ_{i=1}^N y_i: 有限总体均值,是最终要估计的因果/总体参数。
-
模型:
- 参与机制模型:
π_A(x, y; θ) = 1 / (1 + exp(α + x^T β + γ y))。这是一个逻辑回归模型,假设参与概率由x和y共同决定。 - 结果模型:
f(y | x, R=1; ξ)。假设在非概率样本中,y的条件分布具有参数形式。例如,对于二值y,可以是逻辑回归:P(y=1 | x, R=1) = exp(ξ_0 + x^T ξ_1) / (1 + exp(ξ_0 + x^T ξ_1))。
- 参与机制模型:
-
可观测数据:
- 研究者实际能观测到的是两个独立样本:
- 非概率样本
S_A:{(x_i, y_i), i ∈ S_A}。这是“有偏”的,因为参与机制未知且可能与y相关。 - 概率样本
S_B:{(x_i, d_i^B), i ∈ S_B}。这是“无偏”的(在抽样设计下),但缺少y。
- 非概率样本
- 想要但观测不到的量:
- 总体中所有单元的
y_i(除了S_A中的)。 - 总体中所有单元的参与指示
R_i(除了S_A中的)。 - 总体协变量分布
P(x)(只能通过S_B的加权估计来近似)。
- 总体中所有单元的
- 研究者实际能观测到的是两个独立样本:
第二步:讲最小内核¶
本文的核心思路可以浓缩为以下最简特例:二值响应变量y(0/1),逻辑回归参与模型,逻辑回归结果模型。
在这个特例下,论文要解决的核心数学问题是:
如何利用一个仅含x的概率样本 S_B,来纠正一个同时依赖x和y的参与机制(γ≠0)所导致的非概率样本 S_A 的偏差,从而一致地估计总体均值 μ_0?
核心思路(三步走):
-
估计结果模型
f(y|x; ξ):由于在S_A中(x, y)都观测到了,可以直接用最大似然估计(MLE)得到ˆξ。这一步是标准的。 -
估计参与模型
θ(关键跳跃):这是最困难的一步。我们不能直接用S_A中的(x, y)和R=1来拟合逻辑回归,因为S_A只包含了R=1的单元,我们不知道R=0的单元(总体中未参与的人)的(x, y)。- 关键想法:作者构造了一个伪似然函数。这个伪似然函数不直接使用
(x, y),而是使用P(R=1|x),即给定x的参与概率。 - 通过一个数学推导(公式3),
P(R=1|x)可以写成:P(R=1|x) = 1 / (1 + exp(α + x^T β + c(x; γ, ξ)))其中c(x; γ, ξ) = log{E[exp(γ y) | x, R=1]}。这个c(x; γ, ξ)是一个“校正项”,它捕捉了y对参与概率的影响,并且可以通过第一步估计的ˆξ和S_A中的数据计算出来。 - 现在,
P(R=1|x)变成了一个关于θ和已知的c(x; γ, ˆξ)的逻辑回归模型。关键是,P(R=1|x)是可以从数据中识别的:- 对于
S_A中的单元,R=1,我们可以计算log(P(R=1|x)/P(R=0|x))。 - 对于
S_B中的单元,我们可以用其权重d_i^B来估计P(R=0|x)。
- 对于
- 基于此,作者构造了一个伪似然函数
ℓ(θ, ˆξ),它由两部分组成:一部分来自S_A(贡献了“成功”的信息),另一部分来自S_B(贡献了“失败”的信息,通过加权估计)。最大化这个伪似然函数,就可以得到ˆθ。
- 关键想法:作者构造了一个伪似然函数。这个伪似然函数不直接使用
-
估计总体均值
μ_0:有了ˆθ和ˆξ,就可以构造三种估计量:- IPW:用
π_A(x_i, y_i; ˆθ)对S_A中的y_i进行加权平均。 - Regression:利用
S_B中的x_i,通过一个推导出的条件期望公式m(x; ˆθ, ˆξ) = E(y|x)(Proposition 2.2),预测每个y_i,然后加权平均。 - AIPW:结合上述两者,试图获得一些稳健性(但非双重稳健)。
- IPW:用
一句话总结:本文的核心数学贡献在于,通过引入一个依赖于结果模型的校正项c(x; γ, ξ),将不可忽略的参与概率模型π_A(x, y; θ)转化为一个关于P(R=1|x)的可识别模型,从而使得在两样本设定下,可以用伪似然方法同时估计参与和结果模型的参数。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在非概率样本的参与机制不可忽略(即参与概率依赖于响应变量y)时,如何利用一个仅含协变量x的参考概率样本,对有限总体均值进行统计推断。
- 核心工具/方法:提出了一个伪似然方法来估计参与概率模型中的参数,并在此基础上构造了逆概率加权(IPW)、回归预测(REG)和增强型IPW(AIPW)三种总体均值估计量。
- 主要结论:在参数模型假设和可识别条件下,所提出的三个估计量都是
√N-相合且渐近正态的,并给出了显式的渐近方差公式。模拟和真实数据分析表明,该方法能有效纠正因忽略非可忽略性而产生的偏差,且优于现有的可忽略性假设下的方法和Kim & Morikawa (2023)的校准方法。
关键设定与假设¶
- 数据设定:两样本设定,如公式(1)所示。非概率样本
S_A有(x, y),概率样本S_B有(x, d^B)。这是本文与Kim & Morikawa (2023)(假设总体x已知)的关键区别。 - 模型假设:
- 参与模型:逻辑回归模型,如公式(2)所示。假设参与概率是
x和y的线性函数(经logit变换后)。这是参数假设,是本文方法有效性的核心。 - 结果模型:
y|x, R=1的参数分布f(y|x; ξ)。这也是参数假设。
- 参与模型:逻辑回归模型,如公式(2)所示。假设参与概率是
- 可识别性条件:Proposition 2.1给出了参数
θ可识别的条件。核心是存在一个工具变量(instrumental variable)z,它影响y的分布,但不影响参与概率(即β_z=0)。这个条件保证了α + x^T β + c(x; γ, ξ)中的参数可以被唯一确定。 - 正则条件:C1-C7(在补充材料中),是证明渐近正态性所需的标准条件,如矩条件、光滑性、设计非退化等。
- 与已有文献的对比:
- 相比Chen et al. (2020):放宽了
γ=0(可忽略)的假设。 - 相比Kim & Morikawa (2023):将辅助信息从“总体
x分布已知”放宽到“从概率样本S_B中估计”,并提出了一个更稳定的(无多解)估计方法。
- 相比Chen et al. (2020):放宽了
主要结果¶
- 定理2.4(渐近正态性):这是本文的核心理论结果。它给出了
√N(ˆµ - µ_0)的渐近分布是均值为0的正态分布,并提供了三个估计量(IPW, REG, AIPW)的渐近方差σ^2的显式表达式。- 直觉:方差由两部分组成:
- 来自非概率样本
S_A的变异性:这部分反映了在给定参与概率下,S_A中y的随机性。方差公式中包含了π_i^A (1-π_i^A)项,这是伯努利方差的体现。 - 来自概率样本
S_B的变异性:这部分反映了用S_B来估计总体x分布和某些期望时产生的抽样误差。方差公式中包含了V_B(·)项,这是设计方差。
- 来自非概率样本
- 必要条件:模型可识别(Proposition 2.1)和正则条件C1-C7。
- 解决的技术难点:如何将两个独立来源的变异性(
S_A的模型方差和S_B的设计方差)正确地组合起来,并给出一个可操作的方差估计公式。方差公式中的V_B(·)项需要用到概率样本的联合包含概率,这在实践中可能很复杂。
- 直觉:方差由两部分组成:
证明路线与技术技巧¶
-
整体路线:
- Step 1: 估计结果模型:用MLE从
S_A得到ˆξ。这是标准的M-估计。 - Step 2: 估计参与模型:用伪似然最大化得到
ˆθ。伪似然函数ℓ(θ, ˆξ)是建立在P(R=1|x)的表达式上的。这一步是关键,它通过c(x; γ, ˆξ)将S_A和S_B的信息结合起来。 - Step 3: 构造总体均值估计量:将
ˆθ和ˆξ代入IPW、REG或AIPW的公式。 - Step 4: 推导渐近分布:将
ˆµ视为ˆθ和ˆξ的函数,通过影响函数展开(influence function expansion)或Delta方法,将ˆµ - µ_0线性化为S_A和S_B中独立观测量的和,然后应用中心极限定理。方差公式中的复杂表达式正是来自这个线性化过程。
- Step 1: 估计结果模型:用MLE从
-
关键跳跃点:
- 从
π_A(x, y; θ)到P(R=1|x)的转化:这是整个方法的基石。它通过引入c(x; γ, ξ),将不可直接观测的π_A(x, y; θ)转化为一个可识别的P(R=1|x)。这个转化依赖于一个关键的积分/期望运算:P(R=1|x) = ∫ π_A(x, y; θ) f(y|x) dy。对于逻辑回归模型,这个积分可以解析地写成公式(3)的形式。 - 伪似然函数的构造:如何利用
S_A和S_B来估计P(R=1|x)中的参数。作者巧妙地利用了逻辑回归的“case-control”似然结构,将S_A视为“case”,将S_B(加权后)视为“control”的代理,从而构造了一个可以同时使用两个样本的伪似然。
- 从
-
技术技巧点名:
- M-估计理论:用于证明
ˆξ和ˆθ的相合性和渐近正态性。 - 影响函数(Influence Function):用于推导
ˆµ的渐近方差。方差公式中的复杂表达式本质上是ˆµ的影响函数的方差。 - 设计方差(Design-based Variance):用于处理来自概率样本
S_B的变异性。公式(6)是Horvitz-Thompson方差估计量的推广。 - Delta方法:用于将
ˆµ作为(ˆθ, ˆξ)的函数进行线性化。
- M-估计理论:用于证明
真实例子与应用¶
- 数据/场景:ESPACOV调查,旨在评估COVID-19疫情对西班牙居民情绪的影响。数据包含一个概率样本(
S_B,通过短信邀请随机生成的手机号)和一个非概率样本(S_A,通过社交媒体广告招募)。 - 方法应用:
- 将情绪自我评估(好心情/非好心情)作为二值响应变量
y。 - 选取了8个协变量
x,包括年龄、教育水平、性别、对政府行动的评价等。 - 将“健康自我评估”(
x8)作为工具变量z,假设它影响情绪但不直接影响参与(在控制了其他变量后)。 - 拟合了逻辑回归的参与模型和结果模型,并用本文提出的伪似然方法估计了参数。
- 将情绪自我评估(好心情/非好心情)作为二值响应变量
- 结果:
- 参与模型:发现年龄较大、教育水平较高的人更倾向于参与非概率调查,这与已有研究一致。关键参数
γ的估计值为-0.538,但p值为0.463,不显著。作者将此归因于样本量小,并引用心理学文献支持非可忽略性的存在。 - 总体均值估计:本文方法估计的好心情比例为30.0%-31.2%,而基于可忽略性假设的Chen et al. (2020)方法估计的比例为40.4%-41.7%,高出约32%。这表明忽略非可忽略性会带来显著的偏差。非概率样本的原始均值是43.9%,进一步证实了有偏性。
- 参与模型:发现年龄较大、教育水平较高的人更倾向于参与非概率调查,这与已有研究一致。关键参数
- 这个例子想说明什么:该例子旨在验证本文方法的实用性,并展示忽略非可忽略性假设可能导致的严重偏差。它提供了一个真实场景,其中参与机制很可能与响应变量(情绪)相关,从而凸显了本文工作的价值。
🔎 结论是否比证明窄¶
- 是。作者在Section 5中明确承认:“The effectiveness of our proposed methods relies on parametric assumptions on models for the participation mechanism and the outcome regression as in Kim and Morikawa (2023).” 这意味着所有理论结果(定理2.4)都是在参数模型假设下严格证明的。然而,作者在引言和结论中多次使用“nonignorable non-probability survey samples”这样的一般性表述,这可能会让读者误以为方法适用于任何非可忽略机制。实际上,它只适用于参数逻辑回归模型下的非可忽略性。
- 具体语句:作者在Section 5中写道:“Extending our methods to using nonparametric models for the nonignorable participation mechanism is a promising direction for future research.” 这句话明确承认了当前工作的参数局限性,并指出非参数扩展是一个开放问题。因此,论文的结论(方法有效)严格受限于其证明所依赖的参数假设。
四、开放问题¶
-
非参数/半参数扩展:如何将本文的伪似然方法扩展到参与机制或结果模型为非参数或半参数的情形?例如,能否用核方法或系列方法来近似
c(x; γ, ξ),从而放松对f(y|x, R=1)的参数假设?这扎根于Section 5的“Extending our methods to using nonparametric models for the nonignorable participation mechanism is a promising direction for future research.” -
工具变量的选择与检验:Proposition 2.1的可识别性依赖于存在一个有效的工具变量
z。在实际应用中,如何从众多协变量中选择一个有效的工具变量?更重要的是,能否基于观测数据检验工具变量的有效性假设(即β_z=0)?这扎根于Proposition 2.1中对工具变量z的定义和依赖。 -
有限样本下的推断改进:模拟结果显示,当非概率样本量
n_A=500时,Wald型置信区间的覆盖率低于名义水平(约90-92%)。这表明渐近正态近似在有限样本下可能不够精确。能否开发出更精确的有限样本推断方法,如bootstrap或基于经验似然的置信区间?这扎根于Table 5中E(n_A)=500时覆盖率偏低的结果。 -
双重稳健性的恢复:Remark 2.3明确指出,在非可忽略机制下,AIPW估计量不再具有双重稳健性。能否通过修改AIPW的构造方式(例如,使用不同的
m(x)估计量或不同的权重),在非可忽略设定下恢复某种形式的双重稳健性?这扎根于Remark 2.3的陈述。
Maintained by 陈星宇 · Homepage · Source on GitHub