A Unified Bayesian Model for Voter Turnout Estimation: Combining Surveys, Aggregate Data, and Selection Correction¶
作者: Margus Niitsoo, Reimo Rebane, Tarmo Jüristo
主题: 其他
相关性: 6/10
链接: https://arxiv.org/abs/2608.14062
一、领域脉络与小综述¶
这个方向是什么¶
本文所属的子方向是小区域选民投票率估计(small-area turnout estimation),其根本科学问题是:在仅有有偏调查数据和聚合级官方投票统计的条件下,如何可靠地估计精细人口统计子组(如年龄×性别×教育×民族×地区)的投票率。当前成熟度:方法学上已有多种独立工具(MRP、生态推断、Heckman选择模型),但缺乏一个统一的贝叶斯框架同时处理调查过度报告、非可忽略无应答和生态谬误——这正是本文声称要填补的缺口。
发展脉络(从 introduction 引用的工作串成)¶
- 奠基工作:
- Robinson (1950) 提出生态谬误(ecological fallacy),指出从聚合数据推断个体行为可能产生系统性偏差——这是整个生态推断子领域的起点。
- Heckman (1978, 1979) 提出样本选择模型(Heckman selection model),用两阶段方法校正非随机缺失导致的偏差,但需要排除限制(exclusion restriction)或辅助变量。
-
King (1997) 提出贝叶斯生态推断方法,利用逻辑边界(logical bounds)从2×2聚合表恢复个体行为,但被 Cho (1998) 和 Freedman (1999) 批评其对分布假设敏感。
-
主要进展:
- Park, Gelman, and Bafumi (2004) 提出多水平回归与后分层(MRP),用分层模型从调查数据估计子组均值,再通过普查权重聚合——成为调查推断的标准工具,但假设组内缺失可忽略。
- Ghitza and Gelman (2013) 提出后处理校准(GG),对MRP估计施加区域级标量偏移以匹配已知聚合总数——这是本文引用的“当前政治科学文献中最先进的方法”(state-of-the-art),但作者指出它是ad hoc的两步法,不保留不确定性。
-
Jackson, Best, and Richardson (2006, 2008) 在流行病学中提出分层相关回归(hierarchical related regression),将个体级样本与聚合疾病计数联合建模,共享回归系数——这是本文联合似然的核心机制,但假设个体样本具有代表性(缺失可忽略),且仅涉及少量协变量。
-
当前 frontier:
- 非可忽略无应答(non-ignorable nonresponse)的校正:Bailey (2025) 使用随机化响应工具变量和双重稳健估计;Sciarini and Goldberg (2016) 研究投票过度报告与调查参与的关系。
- 生态推断的R×C表扩展:Pavía and Thomsen (2025) 提出ecolRxC,用潜在结构方法处理多类别表。
-
贝叶斯选择模型的稳健化:Ding (2014) 提出selection-t模型,用t分布替代正态误差。
-
本文的位置:作者声称提出“一个系统的、基于模型的整合”(a systematic, model-based integration),将调查数据、聚合投票边际和普查信息统一在一个贝叶斯框架中,包含三个递进模型(EI、PM、FS),其中FS模型在随机接触假设下加入Heckman式选择校正,并使用信息先验进行识别。
子线索聚类¶
- 调查推断与MRP:Park et al. (2004), Ghitza and Gelman (2013), Gao et al. (2021), Si (2020)。这一簇关注如何从有偏调查中通过分层模型和后分层得到子组估计,核心挑战是模型设定与先验选择。
- 生态推断(EI):King (1997), King, Rosen, and Tanner (1999), Rosen et al. (2001), Wakefield (2004), Pavía and Thomsen (2025)。这一簇从聚合数据推断个体行为,核心挑战是识别与分布假设。
- 选择模型与缺失数据:Heckman (1978, 1979), Leung and Yu (1996), Ding (2014), Bailey (2025)。这一簇处理非随机缺失,核心挑战是排除限制与弱识别。
- 联合模型(aggregate + individual):Jackson, Best, and Richardson (2006, 2008)。这一簇将两种数据源在共享系数下联合建模,但假设个体样本代表性。
核心问题与已知瓶颈¶
- 核心问题:
- 如何从有偏调查中恢复无偏的子组投票率?
- 如何利用聚合边际约束来校正调查偏差?
- 如何识别并校正非可忽略无应答?
-
如何量化并传播不确定性?
-
主流方法与瓶颈:
- MRP:假设组内缺失可忽略,无法处理非可忽略无应答。
- GG校准:两步法,不保留不确定性,且将偏差归因于区域异质性而非选择机制。
- 生态推断:易受生态谬误影响,且无法利用个体级协变量。
- Heckman选择模型:需要排除限制或辅助变量,在调查中难以获得。
⚠️ 作者的 framing(必须明确标注为作者的说法)¶
作者将缺口 frame 为:“Neither precedent addresses the non-ignorable non-response”(Jackson和GG都没有处理非可忽略无应答),因此本文的FS模型成为“显然的下一步”。竞争路线(GG校准)被淡化:“an ad hoc procedure that does not formally model the data-generating process end-to-end”(第2页)。作者回避了更复杂的因果推断方法(如工具变量、双重稳健估计),而是依赖信息先验进行识别。明显该被引但没出现:更现代的因果推断方法如双重稳健估计(如Bailey 2025虽被引,但仅作为随机化响应工具的例子)、半参数效率理论(如高效影响函数)——这些在政治科学调查文献中已有应用,但本文未涉及。这可能是由于本文是应用导向的方法学论文,而非理论创新。
张力¶
未见明显对立引用。各子线索之间互补而非矛盾:MRP与生态推断分别处理不同数据源,选择模型处理缺失机制,联合模型试图整合。但Leung and Yu (1996) 指出样本选择模型与两部分模型(two-part model)在不同条件下各有优劣,且选择模型易受共线性问题影响——本文在模拟中专门测试了共线性场景(correlated βs, βo),但未深入讨论这一张力。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(c \in \{1,\dots,C\}\):人口统计单元格(如年龄×性别×教育×民族×地区的组合)。 - \(r \in \{1,\dots,R\}\):区域(如爱沙尼亚的24个地区)。 - \(N_c\):单元格\(c\)的普查人口数(已知)。 - \(N_r = \sum_{c \in r} N_c\):区域\(r\)的合格选民总数(已知)。 - \(V_r\):区域\(r\)的官方投票数(已知,可观测)。 - \(N_S\):调查样本量。 - \(n_c\):调查中属于单元格\(c\)的受访者人数(可观测)。 - \(i\):个体索引,属于某个单元格\(c\)。 - \(X_i\):个体\(i\)的人口统计协变量(可观测)。 - \(O_i \in \{0,1\}\):个体\(i\)的投票意图(调查中报告,可观测;但可能存在过度报告)。 - \(\eta^o_i\):个体\(i\)的潜在投票倾向(线性预测器,参数)。 - \(\beta^o_0\):投票倾向的截距(参数)。 - \(\beta^o_{d,j}\):第\(d\)个协变量第\(j\)类别的效应(参数,有分层先验)。 - \(\Phi(\cdot)\):标准正态CDF(probit链接)。 - \(p_r = \frac{\sum_{c \in r} N_c \Phi(\eta^o_c)}{N_r}\):模型隐含的区域平均投票率(后验预测)。 - \(\beta^{\text{oor}}\):调查过度报告偏差项(参数,仅用于调查似然)。 - \(\eta^s_i\):个体\(i\)的潜在调查参与倾向(参数,仅用于FS模型)。 - \(\rho\):投票倾向与参与倾向误差的相关系数(参数,仅用于FS模型)。 - \(S_i \in \{0,1\}\):个体\(i\)是否参与调查(潜在变量,仅部分可观测:受访者\(S_i=1\),非受访者不可观测)。
模型(以最完整的FS模型为例): - 投票倾向:\(O_i^* = \eta^o_i + \beta^{\text{oor}} \cdot S_i + \epsilon^o_i\),其中\(\epsilon^o_i \sim N(0,1)\),且\(O_i = I(O_i^* > 0)\)。 - 参与倾向:\(S_i^* = \eta^s_i + \epsilon^s_i\),其中\(\epsilon^s_i \sim N(0,1)\),且\(S_i = I(S_i^* > 0)\)。 - 误差相关:\((\epsilon^o_i, \epsilon^s_i) \sim N(0, \Sigma)\),\(\Sigma\)有单位方差和相关系数\(\rho\)。 - 线性预测器:\(\eta^o_i = \beta^o_0 + \sum_{d} \beta^o_{d, j[i]}\),\(\eta^s_i = \beta^s_0 + \sum_{d} \beta^s_{d, j[i]}\),其中类别效应有分层先验(零和约束)。 - 聚合似然:\(V_r \sim \text{Binomial}(N_r, p_r)\),其中\(p_r\)由\(\eta^o_c\)经后分层得到。 - 调查参与似然(FS特有):\((n_c)_c \sim \text{Multinomial}(N_S, (\pi^s_c)_c)\),其中\(\pi^s_c = \frac{\Phi(\eta^s_c) N_c}{\sum_{c'} \Phi(\eta^s_{c'}) N_{c'}}\)(随机接触假设)。
可观测数据: - 普查单元格计数\(N_c\)(已知)。 - 区域投票数\(V_r\)(已知)。 - 调查数据:每个受访者的协变量\(X_i\)和投票意图\(O_i\),以及每个单元格的受访者人数\(n_c\)。 - 不可观测:非受访者的投票意图、个体的潜在倾向\(\eta^o_i, \eta^s_i\)、误差相关\(\rho\)、过度报告偏差\(\beta^{\text{oor}}\)。
第二步:最小内核¶
论文的核心思路是将调查数据和聚合数据通过共享的单元格级投票倾向\(\eta^o_c\)联合建模,从而利用聚合边际约束来校正调查偏差。最简特例:假设只有一个区域(\(R=1\))和两个人口统计单元格(\(C=2\),例如“年轻”和“年老”)。此时: - 普查:\(N_1, N_2\)已知,总人口\(N = N_1 + N_2\)。 - 官方投票:\(V\)已知(总投票数)。 - 调查:样本量\(N_S\),其中年轻受访者\(n_1\),年老受访者\(n_2\),报告投票数分别为\(O_1^{\text{sum}}, O_2^{\text{sum}}\)。
模型退化为: - 投票倾向:\(\eta^o_1 = \beta^o_0 + \beta^o_{\text{young}}\),\(\eta^o_2 = \beta^o_0 + \beta^o_{\text{old}}\)(零和约束:\(\beta^o_{\text{young}} + \beta^o_{\text{old}} = 0\))。 - 调查似然(PM模型):\(O_i \sim \text{Bernoulli}(\Phi(\eta^o_i + \beta^{\text{oor}}))\)。 - 聚合似然:\(V \sim \text{Binomial}(N, p)\),其中\(p = \frac{N_1 \Phi(\eta^o_1) + N_2 \Phi(\eta^o_2)}{N}\)。
核心识别机制:聚合似然提供了关于\(\beta^o_0\)和\(\beta^o_{\text{young}} - \beta^o_{\text{old}}\)的约束(因为\(p\)是\(\eta^o_1, \eta^o_2\)的函数),而调查似然提供了关于\(\beta^o_{\text{young}} - \beta^o_{\text{old}}\)和\(\beta^{\text{oor}}\)的信息。如果没有聚合数据,\(\beta^o_0\)和\(\beta^{\text{oor}}\)在调查中完全混淆(因为只有\(\eta^o_i + \beta^{\text{oor}}\)可识别)。聚合数据通过固定\(p\)(即总投票率)来解开混淆:\(\beta^{\text{oor}}\)吸收调查过度报告,而\(\beta^o_0\)由官方总投票率确定。这就是PM模型的核心思想:聚合边际锚定总体水平,调查数据提供组间对比。
对于FS模型,额外加入选择机制:假设年轻人和老年人的参与倾向不同(\(\eta^s_1, \eta^s_2\)),且参与与投票误差相关(\(\rho\))。此时,调查样本不是随机子样本,而是有选择性的。FS模型通过普查单元格计数\(N_c\)和受访者计数\(n_c\)来推断参与倾向,再通过\(\rho\)校正投票倾向的偏差。但识别需要信息先验,因为\(\beta^{\text{oor}}\)和\(\beta^s_0\)在弱识别脊上。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:如何从有偏调查数据、官方聚合投票边际和普查单元格计数中联合估计精细人口统计子组的选民投票率,并校正非可忽略无应答和过度报告。
- 核心工具/方法:提出三个递进的贝叶斯分层模型——多水平生态推断(EI)、联合调查与边际模型(PM)、全选择模型(FS),其中FS在随机接触假设下加入Heckman式选择校正,并使用信息先验进行识别。
- 主要结论:在基于爱沙尼亚普查的模拟中,FS在强选择偏差或严重删失下显著优于现有基准(GG校准),但对未建模的选择噪声敏感;在2023年爱沙尼亚议会选举应用中,PM与GG表现相当,FS有微弱改进但依赖信息先验。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - 人口统计维度:年龄(7类)、性别(2)、教育(3)、民族(2)、地区(24),共\(C = 7 \times 2 \times 3 \times 2 \times 24 = 2016\)个单元格(实际普查中部分组合可能为空)。 - 线性预测器:\(\eta^o_i = \beta^o_0 + \sum_{d=1}^5 \beta^o_{d, j[i]}\),每个维度的类别效应有分层先验\(\beta^o_{d[j]} \sim N(0, \tau^o_d)\),\(\tau^o_d \sim \text{Half-Normal}(0, \sigma^o_0)\),且零和约束。 - 调查过度报告:PM和FS中,调查似然使用\(\eta^{o*}_i = \eta^o_i + \beta^{\text{oor}}\),其中\(\beta^{\text{oor}}\)有不对称拉普拉斯先验(偏向正值)。 - 选择模型(FS):\(\eta^s_i = \beta^s_0 + \sum_{d} \beta^s_{d, j[i]}\),类似分层先验。参与似然:\((n_c)_c \sim \text{Multinomial}(N_S, (\pi^s_c)_c)\),其中\(\pi^s_c = \frac{\Phi(\eta^s_c) N_c}{\sum_{c'} \Phi(\eta^s_{c'}) N_{c'}}\)(随机接触假设)。 - 误差相关:\((\epsilon^o_i, \epsilon^s_i) \sim N(0, \Sigma)\),\(\Sigma\)有单位方差和相关系数\(\rho\),\(\rho\)有变换Beta先验(偏向正相关)。 - 聚合似然:\(V_r \sim \text{Binomial}(N_r, p_r)\),其中\(p_r = \frac{\sum_{c \in r} N_c \Phi(\eta^o_c)}{N_r}\)。
关键假设: - 随机接触假设(FS):调查接触过程与人口统计协变量无关,仅参与决策有选择性。这通过使用普查\(N_c\)作为接触基数来建模。 - 条件独立性(PM, FS):给定共享系数\(\theta\),调查数据和聚合数据条件独立。作者承认这轻微双重计数了受访者,但认为在现实抽样分数下可忽略。 - probit链接:选择probit而非logit,以便于双变量正态的数学处理。 - 信息先验(FS):\(\beta^{\text{oor}}\)、\(\beta^s_0\)、\(\rho\)使用信息先验,因为模型存在弱识别脊。
与已有文献的对比: - 相比Jackson et al. (2006):本文处理非可忽略无应答(通过选择模型),且使用高维人口统计交叉分类。 - 相比Ghitza and Gelman (2013):本文是单阶段贝叶斯模型,不确定性传播完整,而非两步校准。 - 相比经典Heckman模型:本文利用聚合边际和普查数据提供部分识别,减少对排除限制的依赖。
主要结果¶
理论型:本文是应用方法学论文,无传统定理证明。主要结果来自模拟和实证。
模拟结果(基于爱沙尼亚普查的合成数据,11个种子,ADEMP框架): - 基线场景(中等选择偏差,\(\beta^s_0 = -1\),\(\rho=0.5\),\(N_S=1000\),区域边际): - FS表现最好,PM次之,然后GG、EI、BP。 - FS的中位KL散度比GG低57%(bootstrap 95% CI [43%, 79%]),总变差距离低36%。 - 配对比较:FS在10/11个种子上KL低于GG(Wilcoxon p=0.003),PM在所有11个种子上优于GG(p=0.001)。 - 后验区间校准:PM和FS达到近名义90%覆盖率,且区间宽度比GG窄3-5倍(1D边际宽度0.039 vs 0.187);BP严重过度自信(覆盖率≤0.06)。 - 关键场景: - 强删失(\(\beta^s_0 = -3\),仅0.6%人口可接触):PM和FS在2D边际上表现与基线相近,但FS因先验中心偏移而低估选择严重性,与PM趋同。 - 误差相关\(\rho\)变化:\(\rho\)从0到1,所有模型变差,但FS保持最低距离;\(\rho=0\)时所有模型(除EI)表现相似。 - 小样本(\(N_S < 500\)):PM和FS方差较大但准确性仍优于简单模型。 - 选择噪声(5%随机翻转):FS的优势消失,与PM和GG持平或更差。作者指出这是FS的关键敏感性:当选择机制未被准确建模时,优势消失。 - 其他场景:共线性、聚合偏差、非正态误差(skewed t)下,模型排序稳定;FS对未建模选择噪声敏感。
实证结果(2023年爱沙尼亚议会选举,\(N_S=1192\),区域边际): - 已知验证边际:年龄和性别(其他边际不可得)。 - BP最差;EI后验极宽(几乎覆盖0-100%);GG、PM、FS表现相似,FS有微弱但不显著的改进。 - 当加入三个已知总边际(PM3, FS3)时,FS3的\(\rho\)后验模态从0.4升至0.6,估计向FS方向倾斜。 - 框架不匹配问题:二项式边际似然导致年龄边际系统性偏差(高估年轻组),改用beta-二项式(学习浓度参数~430-490)略有改善(MAE从0.066降至0.063),但未消除偏差。 - 作者强调:FS的表现依赖信息先验;使用平坦先验时FS退化为PM。
证明路线与技术技巧¶
本文无传统证明,但模型推导和计算实现包含关键技术细节。
整体路线(以FS模型为例): 1. 模型设定:双变量probit选择模型,联合建模投票倾向和参与倾向,误差相关\(\rho\)。 2. 数据增强:引入潜在变量\(u_i \sim N(0,1)\)截断至\((-\eta^s_i, \infty)\),将双变量CDF分解为单变量CDF的积分(公式10),从而简化MCMC采样。 3. 似然分解:给定\(u_i\),条件投票概率为\(\Phi((\eta^o_i + \rho u_i)/\sqrt{1-\rho^2})\),参与似然由截断正态密度给出。 4. 参与边际似然:利用随机接触假设,将受访者单元格计数建模为多项分布,概率正比于\(\Phi(\eta^s_c) N_c\)。 5. 聚合似然:与PM相同,使用后分层概率\(p_r\)的二项式似然。 6. MCMC采样:使用NUTS(No-U-Turn Sampler),通过重参数化、对数空间计算和概率裁剪解决发散问题。
关键跳跃点: - 弱识别脊:\(\beta^{\text{oor}}\)、\(\beta^s_0\)、\(\rho\)在似然中形成脊,导致MCMC混合不良。作者通过信息先验(不对称拉普拉斯、Student-t、变换Beta)来正则化,但承认这不能完全消除问题(5.3%的拟合有\(\hat{R}>1.1\),91%是FS模型)。 - 随机接触假设:将普查计数作为接触基数,使得即使没有非受访者协变量也能建模选择。这是Heckman模型在调查中的实用变通。
技术技巧点名: - 数据增强(data augmentation):引入潜在\(u_i\)将双变量probit转化为条件单变量probit + 截断正态。 - 重参数化(reparameterization):解决NUTS发散问题(具体细节在配套包中)。 - 信息先验(informative priors):用于弱识别参数,基于经验知识(如响应率低于50%)。 - beta-二项式边际似然(扩展):用学习浓度参数软化二项式约束,处理框架不匹配。 - ADEMP模拟框架:遵循Morris et al. (2019)的结构化模拟设计。
真实例子与应用¶
数据:2023年爱沙尼亚议会选举(Riigikogu elections 2023)。普查数据来自2021年人口与住房普查(RL21303),包含年龄、性别、教育、民族、地区的交叉表(867,608名合格选民)。官方投票数据来自国家选举办公室(区域级投票数)。调查数据来自Norstat的两波CATI调查(2023年2-3月,N=1,192),询问投票意图。
方法应用: - 预处理:排除海外选民(约5-10%,投票率10.7%),按比例分配其选票至选区;仅使用电话调查的前80%受访者以匹配随机接触假设。 - 拟合所有模型(BP, EI, GG, PM, FS),使用区域级投票边际。 - 额外拟合PM3和FS3,加入年龄、性别、民族三个已知总边际作为输入。
结果: - 验证边际(年龄、性别):BP最差;EI后验极宽;GG、PM、FS相似,FS有微弱改进。 - 后验边际图(图4)显示EI几乎无信息;GG、PM、FS收敛到相似值,FS略微偏离。 - 当加入三个总边际(PM3, FS3),FS3的\(\rho\)后验模态升至0.6,估计向FS方向倾斜,表明更多数据支持选择效应。 - 框架不匹配:二项式边际似然导致年龄边际系统性偏差(高估年轻组),beta-二项式略有改善但未消除。
这个例子想说明什么: - 验证模型在真实数据上的可行性,展示PM与当前最优(GG)相当,FS有潜在改进但依赖先验。 - 暴露框架不匹配问题(普查与投票框架不一致),提示需要更灵活的边际似然。 - 强调FS的识别依赖信息先验,建议同时报告PM和FS结果。
🔎 结论是否比证明窄¶
- 明确窄的claim:作者在模拟中声称FS“substantially improves over established benchmarks, particularly under strong selection bias or heavy censoring”(摘要),但模拟中FS的优势在强删失时因先验偏移而减弱(与PM趋同),且对选择噪声敏感。作者在讨论中承认:“the advantage of FS should only be expected when the survey’s selection mechanism is reasonably well captured by the model”(第11页)。
- 实证结论的局限:作者明确说“the method has only been tested on exactly one election in one country”(第14页),因此不应过度推广。
- 未证明的conjecture:作者推测FS可以“help separate over-reporting from selection effects”(第15页),但实证中这一分离依赖信息先验,且未提供独立验证。
- 弱识别问题:作者承认FS的MCMC混合问题(\(\hat{R}\)偏高),但声称“the reported comparisons are robust to the convergence warnings”(附录2.4),然而这一结论基于排除2/11个种子后的稳定性,并非严格证明。
四、开放问题(点到为止,扎根具体语句)¶
-
更丰富的预测器建模:作者提到“Future work should also explore richer modeling choices for \(\eta^o\) and \(\eta^s\): structured priors (Si 2020; Gao et al. 2021) could stabilize estimation in sparse settings, while machine-learning approaches such as BART (Chipman, George, and McCulloch 2010) might capture complex non-linearities”(第15页)。具体扎根:第15页“Future work should also explore...”。
-
多分类结果(投票选择):作者指出“generalizing the framework to multinomial outcomes... would allow the model to estimate not just who votes, but who they vote for”(第15页),但FS的选择校正扩展“considerably more involved and will need to be left for a follow-up paper”。具体扎根:第15页“Perhaps the most significant potential extension...”。
-
更广泛的实证测试:作者强调“as our empirical application covers a single election, the models—FS especially—should be tested on a wider range of datasets to better understand their sensitivity to real-world selection noise and to refine the informative priors”(第15页)。具体扎根:第15页“Finally, as our empirical application covers a single election...”。
-
弱识别的理论刻画:FS模型中\(\beta^{\text{oor}}\)、\(\beta^s_0\)、\(\rho\)的弱识别脊是经验观察(附录2.4),但缺乏理论分析(如Fisher信息矩阵的秩亏、后验收缩率)。这为理论统计学家提供了一个问题:能否给出该模型可识别性的充分条件?具体扎根:附录2.4描述“the weak-identification ridge between \(\beta^s_0\), \(\beta^{\text{oor}}\), and \(\rho\)”。
提醒:要确认这些是否为真gap,建议阅读近期约5篇相关论文(如Bailey 2025, Si 2020, Gao et al. 2021, Pavía and Thomsen 2025, Ding 2014)的intro,看它们是否都指向类似方向。若一致,则为共识性缺口;若互相打架,则可能是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub