Candidate Set Size and Voting Behavior: A Front-Door Approach to Causal Moderation¶
作者: Masayuki Haruhara
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2608.20779
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是因果调节效应(causal moderation),即在处理变量(treatment)随机化、但调节变量(moderator)非随机的情况下,如何识别调节变量如何改变处理效应的大小。这是一个典型的因果推断中的交互效应识别问题,其难点在于:调节变量往往与结果存在未观测混杂,导致其与处理效应的关联不能直接解释为因果。本文的贡献在于将平行估计框架(Parallel Estimation Framework, PEF) 与前门调整(Front-Door Criterion, FDC) 结合,为这类问题提供了一种新的识别策略。
发展脉络¶
-
奠基工作:因果调节效应的识别框架
- Bansak (2021) 提出了平行估计框架(PEF),其核心思想是:当处理变量 \(T\) 随机化时,可以在 \(T\) 的每个取值水平内,估计调节变量 \(S\) 对结果 \(Y\) 的效应,然后取这些效应在 \(T\) 不同水平间的差异,从而识别出 \(S\) 如何改变 \(T\) 的因果效应(即平均处理调节效应,ATME)。Bansak 的框架依赖于两个关键假设:\(T\) 的随机化(Assumption 1)和 \(S\) 在给定协变量 \(X\) 下的条件可忽略性(Assumption 2)。本文引用语境:“exploiting the fact that candidates’ page assignments in the CIP are determined by lottery, we apply the parallel estimation framework (PEF) of Bansak (2021).” 该框架为处理随机化、调节变量非随机的问题提供了基础,但其对调节变量 \(S\) 的条件可忽略性假设在实际中往往难以满足。
-
主要进展:前门调整的复兴与应用
- Pearl (1995) 提出了前门准则(FDC),为存在未观测混杂时识别因果效应提供了一条替代路径。其核心思想是:利用一个外生的中介变量 \(M\),将解释变量 \(H\) 对结果 \(Y\) 的总效应分解为 \(H \rightarrow M\) 和 \(M \rightarrow Y\) 两个部分,从而绕过 \(H\) 与 \(Y\) 之间的未观测混杂 \(U\)。
- Glynn and Kashin (2017, 2018) 和 Bellemare et al. (2024) 将 FDC 从理论推向应用。Bellemare et al. (2024) 系统阐述了 FDC 的识别假设(如无直接效应、中介外生性等),并提供了一个实证案例(Uber/Lyft 拼车对小费的影响)。本文引用语境:“In addition, this paper contributes to applied econometrics by providing a way to identify FDC settings that are more suitable than those in existing studies (e.g., Bellemare et al., 2024; Glynn and Kashin, 2017; 2018; Pearl, 1995).” 这些工作展示了 FDC 在实证研究中的潜力,但正如 Huntington-Klein (2021) 所指出的,FDC 的适用场景仍然难以寻找,因为需要找到一个既外生又完全中介的变量。
-
当前 Frontier:PEF 与 FDC 的结合
- 本文是首次将 PEF 与 FDC 结合的工作。作者指出,现有应用 PEF 的研究在处理调节变量的内生性时,要么仅依赖观测协变量调整(如 Emeriau et al., 2026),要么处理变量本身也非随机(如 Bernardi and Ghirardi, 2025)。本文的定位是提供一个“模型案例”(model case),其中处理变量是随机化的,且调节变量的内生性可以通过 FDC 解决,从而为 PEF 的应用提供了一个更干净的识别环境。
子线索聚类¶
-
平行估计框架(PEF)的应用:这一簇研究关注如何利用随机化处理来识别调节效应。代表工作包括 Bansak (2021) 的理论框架,以及将其应用于具体实验的研究,如 Carlsson et al. (2024)(挪威政治家对少数族裔候选人的偏见)、Kozyreva et al. (2023)(内容审核困境)、Pickett et al. (2024)(警察多样性对恐惧感的影响)。这些应用通常假设调节变量在给定协变量后是条件可忽略的,但本文指出这一假设在观测研究中可能不成立。
-
前门调整(FDC)的实证应用:这一簇研究致力于寻找和利用 FDC 的适用场景。代表工作包括 Bellemare et al. (2024)(Uber 拼车)、Glynn and Kashin (2017, 2018)(职业培训项目)。这些工作展示了 FDC 的可行性,但也暴露了其应用门槛高的问题。本文通过利用“制度规则”(即市政条例规定的宣传册格式)来生成外生中介,为寻找 FDC 场景提供了一个新的思路。
-
选择过载与投票行为:这一簇研究是本文的应用背景,探讨候选人数量如何影响选民决策。代表工作包括 Cunow et al. (2021) 和 Goidel and Armstrong (2025) 的实验研究,以及 Meredith and Salant (2013) 和 Söderlund et al. (2021) 的观测研究。这些研究普遍发现,候选人数量增加会强化选票顺序效应(BOE)或首页效应,表明选民采用了更简单的决策策略。本文的贡献在于将这一结论从实验室/投票站环境推广到竞选期间的信息获取过程,即时间约束相对宽松的场景。
核心问题与瓶颈¶
- 核心问题 1:当调节变量非随机时,如何识别其对处理效应的因果调节作用?现有方法(如协变量调整)依赖于“无未观测混杂”的强假设,这在许多应用中难以满足。
- 核心问题 2:如何为前门调整(FDC)找到可信的应用场景?FDC 需要找到一个外生的、完全中介的变量,这在实践中非常困难。
- 核心问题 3:候选人数量增加是否以及在多大程度上改变了选民在真实选举中的决策过程?现有实验证据的外部有效性受到质疑,而观测研究又面临内生性问题。
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将现有文献的缺口 frame 为“现有研究要么在实验室/投票站等强时间约束下进行(外部有效性存疑),要么在观测研究中未能充分解决调节变量的内生性”。因此,本文的“显然的下一步”是:在一个处理变量随机化、调节变量内生性可通过 FDC 解决的现实场景中,检验候选人数量对选民决策过程的影响。
- 被淡化或回避的竞争路线:作者回避了使用工具变量(IV) 来处理调节变量内生性的可能性。例如,如果存在一个影响候选人数量但不直接影响选民决策过程的工具变量,也可以识别调节效应。作者没有讨论为什么 FDC 比 IV 更优或更适用。
- 值得研究者去查的问题:作者在引言中声称“the FDC is considered difficult to apply because suitable settings are hard to find”,并引用 Huntington-Klein (2021)。但作者没有提及后门调整(back-door adjustment) 与 FDC 的混合策略(如 Glynn and Kashin, 2018 提出的 hybrid adjustments),这些策略在 FDC 假设不完全满足时仍可能提供有偏但更紧的界。此外,作者没有引用任何关于因果中介分析(causal mediation analysis) 的现代文献(如 Imai, Keele, Tingley 等的工作),这些工作提供了在更弱假设下识别中介效应的框架(如基于序贯可忽略性)。这可能是作者有意回避,因为那些方法通常需要处理变量也是非随机的,或者需要更复杂的敏感性分析。
张力¶
- 未见明显对立引用:被引文献之间在“候选人数量增加会强化简单决策策略”这一核心结论上是一致的,尽管具体机制(如 BOE vs. 首页效应)和场景(实验室 vs. 真实选举)有所不同。关于候选人数量对投票率/无效票的影响,文献中存在混合结果(如 Bol and Ivandic, 2022 发现增加投票率,而 Nagler, 2015 发现增加无效票),但这并非本文关注的核心。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型与可观测数据¶
-
符号:
- \(T_i\):处理变量,表示候选人 \(i\) 在宣传册(CIP)中的位置。\(T_i = 1\) 表示在首页或尾页(front/back page),\(T_i = 0\) 表示在内页(inner pages)。这是一个随机化的二元变量。
- \(H_i\):调节变量,表示候选人 \(i\) 所在选举的候选人总数。这是一个连续(或计数)变量,非随机。
- \(M_i\):中介变量,表示候选人 \(i\) 所在选举的宣传册总页数。这是一个连续(或计数)变量,由 \(H_i\) 和市政条例机械决定。
- \(Y_i\):结果变量,表示候选人 \(i\) 是否胜选(winning dummy)。\(Y_i = 1\) 表示胜选,\(Y_i = 0\) 表示落选。
- \(X_i^F\):用于前门调整的协变量,在本文中主要是市政固定效应(municipality fixed effects)。
- \(M_i(h)\):潜在中介变量,表示当候选人总数为 \(h\) 时,宣传册总页数的取值。
- \(Y_i(t, h, m)\):潜在结果,表示当处理为 \(t\)、候选人总数为 \(h\)、宣传册总页数为 \(m\) 时,候选人 \(i\) 的胜选结果。
-
模型:本文假设一个线性数据生成过程(DGP)。具体地,作者假设:
- 中介变量模型:\(M_i = \theta_0 H_i + \mu_w + v_i\),其中 \(\mu_w\) 是市政固定效应,\(v_i\) 是误差项。
- 结果变量模型:\(Y_i = \theta_1 M_i + \zeta H_i + \eta_w + \mathbf{x}_i \boldsymbol{\beta} + \varepsilon_i\),其中 \(\eta_w\) 是市政固定效应,\(\mathbf{x}_i\) 是候选人特征(如年龄、性别、是否在职等),\(\varepsilon_i\) 是误差项。
- 这两个模型在 \(T_i = 1\) 和 \(T_i = 0\) 的样本中分别估计,因此系数 \(\theta_0, \theta_1, \zeta\) 都带有下标 \(t\)。
-
可观测数据:研究者可以观测到每个候选人的:
- 处理变量 \(T_i\)(首页/尾页 vs. 内页)
- 调节变量 \(H_i\)(该选举的候选人总数)
- 中介变量 \(M_i\)(该选举的宣传册总页数)
- 结果变量 \(Y_i\)(是否胜选)
- 协变量 \(X_i^F\)(市政固定效应)和 \(\mathbf{x}_i\)(候选人特征)
- 不可观测的是潜在结果 \(Y_i(t, h, m)\) 和潜在中介 \(M_i(h)\),以及未观测混杂 \(U\)(如选举热度)。
第二步:最小内核¶
本文的核心数学问题可以简化为一个线性情形下的特例:假设处理变量 \(T\) 是二元的且完全随机化,调节变量 \(H\) 是连续的,中介变量 \(M\) 是连续的,且所有关系都是线性的。在这个特例下,本文要识别的平均处理中介调节效应(AMTME) 退化为一个简单的乘积之差。
最简特例: - 假设没有协变量 \(X^F\),且所有变量都是中心化的(均值为0)。 - 数据生成机制为: - \(M = \theta_0 H + \epsilon_M\),其中 \(\epsilon_M\) 与 \(H\) 独立(由 FDC 假设保证)。 - \(Y = \tau T + \zeta H + \theta_1 M + \epsilon_Y\),其中 \(\epsilon_Y\) 与 \(T, H, M\) 独立(由随机化 \(T\) 和 FDC 假设保证)。 - 注意:这里 \(\tau\) 是 \(T\) 的直接效应,\(\zeta\) 是 \(H\) 的直接效应,\(\theta_1\) 是 \(M\) 的效应。
核心思路: 1. 在 \(T=1\) 的样本中,估计 \(H\) 对 \(M\) 的效应 \(\theta_0\)(通过回归 \(M\) 在 \(H\) 上),以及 \(M\) 对 \(Y\) 的效应 \(\theta_{11}\)(通过回归 \(Y\) 在 \(M\) 和 \(H\) 上)。那么,\(H\) 通过 \(M\) 对 \(Y\) 的间接效应为 \(\theta_0 \times \theta_{11}\)。 2. 在 \(T=0\) 的样本中,同样估计 \(\theta_0\) 和 \(\theta_{10}\),得到间接效应 \(\theta_0 \times \theta_{10}\)。 3. AMTME 就是这两个间接效应的差:\(\theta_0 \times (\theta_{11} - \theta_{10})\)。
为什么这个特例抓住了核心: - 这个特例清晰地展示了本文方法的两步走逻辑:第一步,利用 FDC 识别 \(H\) 通过 \(M\) 对 \(Y\) 的因果效应(即 \(\theta_0 \times \theta_{1t}\));第二步,利用 PEF 比较这个效应在 \(T=1\) 和 \(T=0\) 之间的差异,从而得到 \(T\) 的调节效应。 - 这个特例也揭示了为什么需要 FDC:如果直接回归 \(Y\) 在 \(H\) 上,会得到 \(\zeta + \theta_0 \theta_1\),但 \(\zeta\) 可能由于未观测混杂 \(U\) 而有偏。FDC 通过聚焦于 \(M\) 这个外生中介,绕过了对 \(\zeta\) 的识别。 - 论文的一般情形只是在这个线性特例上加入了协变量 \(X^F\)(市政固定效应)和更一般的线性模型设定。
三、这篇论文做了什么¶
三句话¶
- 研究问题:当处理变量(宣传册页面位置)随机化、但调节变量(候选人总数)非随机时,如何识别候选人总数对页面位置效应(首页/尾页效应)的因果调节作用。
- 核心方法:将平行估计框架(PEF)与前门调整(FDC)结合,通过一个外生的中介变量(宣传册总页数)来识别调节效应,并在线性模型下给出了识别公式。
- 主要结论:利用东京165个市议会选举数据(1987-2023),发现每增加一名候选人,通过增加宣传册总页数这一渠道,会使首页效应(首页候选人相对于内页候选人的胜选概率优势)增加0.322个百分点,相当于基线效应的8.0%;而尾页效应无显著变化。
关键设定与假设¶
-
设定:
- 处理变量 \(T_i\):三分类(首页、尾页、内页),但分析中合并为二元(首页/尾页 vs. 内页)。
- 调节变量 \(H_i\):连续变量(候选人总数)。
- 中介变量 \(M_i\):连续变量(宣传册总页数)。
- 协变量 \(X_i^F\):市政固定效应(municipality fixed effects)。
- 协变量 \(\mathbf{x}_i\):候选人特征(年龄、性别、是否在职、党派)。
-
关键假设:
- Assumption 1 (T的随机化):\(\{Y_i(t, h, m)\}_{t,h,m}, \{M_i(h)\}_h, H_i, X_i^F \perp\!\!\!\perp T_i\)。这由日本选举法规定的抽签机制保证。
- Assumption 2 (M的条件外生性,对Y而言):\(\{Y_i(t, h, m)\}_{t,h,m} \perp\!\!\!\perp M_i \mid H_i, X_i^F\)。这意味着,在给定候选人总数和市政固定效应后,宣传册总页数与潜在结果独立。作者论证,由于总页数由市政条例机械决定,且条例在样本期内不变,因此这个假设成立。
- Assumption 3 (H的条件外生性,对M而言):\(\{M_i(h)\}_h \perp\!\!\!\perp H_i \mid X_i^F\)。这意味着,在给定市政固定效应后,候选人总数与潜在中介变量独立。作者论证,由于市政条例决定了页数-候选人数的映射关系,且条例不变,因此这个假设成立。
- 线性假设:中介变量模型和结果变量模型都是线性的。
- SUTVA/一致性:候选人的结果不受其他候选人页面位置的影响(合理,因为页面位置是随机分配的,且每个候选人的信息独立)。
- 共同支撑:在给定协变量后,处理变量和调节变量的取值有重叠。
-
与已有文献的对比:
- 相比 Bansak (2021) 的 PEF,本文放宽了对调节变量 \(S\) 的条件可忽略性假设(Assumption 2 in Bansak),转而使用 FDC 来识别 \(S\) 的效应。
- 相比 Bellemare et al. (2024) 的 FDC 应用,本文强化了识别环境:处理变量 \(T\) 是随机化的,这为 PEF 的应用提供了基础,并且中介变量 \(M\) 的外生性由制度规则保证,而非统计假设。
主要结果¶
- 核心量化结论(Table 6):
- 对于首页效应:每增加一名候选人,通过总页数渠道,首页效应增加 0.322 个百分点(\(p < 0.05\))。基线首页效应为 4.023 个百分点,因此该增加相当于基线效应的 8.0%。
- 对于尾页效应:每增加一名候选人,通过总页数渠道,尾页效应增加 0.153 个百分点,但统计上不显著(\(p > 0.1\))。
- 中间结果(Tables 3-5):
- 第一阶段的估计(Table 3)显示,候选人总数对总页数有显著的正向影响(系数约 0.1),且在不同页面位置组中一致。
- 第二阶段的估计(Table 4)显示,总页数对胜选概率的影响在首页组为正且显著(1.472),在内页组为负且显著(-1.333),在尾页组为负但不显著。
- 乘积估计(Table 5)显示,候选人总数通过总页数渠道对胜选概率的间接效应在首页组为正(0.148,\(p<0.1\)),在内页组为负(-0.174,\(p<0.05\)),在尾页组为负但不显著。
证明路线与技术技巧¶
-
整体路线(见附录 Proof of Proposition 1):
- Step 1: 识别 \(H\) 对 \(M\) 的因果效应。利用 Assumption 3(\(H\) 的条件外生性),证明 \(E[M_i | H_i = h, X_i^F] = \nu(h, x)\),其导数 \(\partial \nu / \partial h = \theta_0\)。由于 \(T\) 随机化,\(\theta_0\) 在 \(T=1\) 和 \(T=0\) 组中相同。
- Step 2: 识别 \(M\) 对 \(Y\) 的因果效应(在给定 \(T\) 和 \(H\) 下)。利用 Assumption 2(\(M\) 的条件外生性),证明 \(E[Y_i | T_i = t, H_i = h, M_i = m, X_i^F] = \mu_t(h, m, x)\),其导数 \(\partial \mu_t / \partial m = \theta_{1t}\)。
- Step 3: 计算 \(H\) 通过 \(M\) 对 \(Y\) 的间接效应。在线性假设下,该效应为 \(\theta_0 \times \theta_{1t}\),这正是 \(\gamma_t^{FD}\)。
- Step 4: 取 \(T=1\) 和 \(T=0\) 组的差异。得到 \(\delta^{PE \times FD} = \theta_0 (\theta_{11} - \theta_{10})\),这等于 AMTME 的定义。
-
关键跳跃点:
- 跳跃点 1:如何将 FDC 的识别逻辑(通常用于识别 \(H\) 对 \(Y\) 的总效应)嵌入到 PEF 中(用于识别 \(T\) 的调节效应)。作者的解决方法是:在 \(T\) 的每个水平内,分别应用 FDC 来识别 \(H\) 通过 \(M\) 对 \(Y\) 的效应,然后取差。这个跳跃在数学上是直接的,但概念上是新颖的。
- 跳跃点 2:如何保证 Assumptions 2 和 3 在实证中成立。作者巧妙地利用了“市政条例不变”这一制度细节,将 \(M\) 的外生性建立在制度规则而非统计假设之上。这是本文最核心的技术技巧。
-
技术技巧点名:
- 前门调整(FDC):用于处理调节变量 \(H\) 与结果 \(Y\) 之间的未观测混杂。
- 平行估计框架(PEF):用于在随机化处理 \(T\) 下,比较不同 \(T\) 水平下 \(H\) 的效应差异。
- 线性假设与乘积系数:将复杂的因果调节效应简化为两个线性回归系数的乘积之差,极大地简化了估计和推断。
- 聚类标准误与聚类自助法:在推断中,标准误聚类在市政层面,以处理同一选举内候选人之间的相关性。乘积系数的标准误通过聚类自助法(cluster bootstrap)计算。
真实例子与应用¶
- 数据:东京165个市议会选举数据(1987-2023),包含8,450名候选人。数据来源包括国立国会图书馆、Election.com等。
- 场景:日本选举中的“候选人信息宣传册”(CIP)。宣传册的页面位置由抽签决定(随机化处理 \(T\)),总页数由候选人总数和市政条例机械决定(外生中介 \(M\))。
- 方法应用:
- 将样本按页面位置分为三组:首页、尾页、内页。
- 在每组内,用 OLS 估计两个方程:
- 第一阶段:\( \text{总页数} = \theta_{0t} \times \text{候选人总数} + \text{市政固定效应} \)
- 第二阶段:\( \text{胜选} = \theta_{1t} \times \text{总页数} + \zeta_t \times \text{候选人总数} + \text{市政固定效应} + \text{候选人特征} \)
- 计算乘积 \(\hat{\gamma}_t^{FD} = \hat{\theta}_{0t} \times \hat{\theta}_{1t}\)。
- 计算差异 \(\hat{\delta}^{PE \times FD} = \hat{\gamma}_1^{FD} - \hat{\gamma}_0^{FD}\)。
- 结果:首页效应显著增加,尾页效应不显著。
- 例子想说明什么:
- 验证理论:将实验室中“选择过载”导致简单决策的结论,推广到真实选举的竞选期间(时间约束较弱),表明该现象具有普遍性。
- 展示方法优势:通过 FDC 解决了调节变量(候选人总数)的内生性问题,而这是纯 PEF 或纯协变量调整无法做到的。同时,通过 PEF 比较了不同处理水平下的效应,这是纯 FDC 无法做到的。
- 提供政策启示:候选人数量增加会扭曲选民选择,因此可能需要通过划分选区或调整提名成本来优化候选人数量。
🔎 结论是否比证明窄¶
- 是。作者在 Proposition 1 中严格证明,在线性假设下,\(\delta^{PE \times FD}\) 识别了 AMTME。然而,在实证分析中,作者直接使用了线性 OLS 模型,并声称结果“substantial”。作者在 Limitations 部分(Section 5.3)承认了线性假设的限制,指出“the results of this paper may fail to capture nonlinear relationships between the number of candidates and the front / back page effect”。因此,结论的严格性仅限于线性设定,而作者在结论部分(Section 6)的泛化表述(如“an increase in the number of candidates changes ordinary voter behavior”)可能超出了证明所覆盖的范围。
- 此外,作者在 Proposition 1 的证明中,明确假设了“linearity means that the conditional mean causal-response surfaces can be written as ...”,并指出“importantly, \(\zeta_t\) is not restricted to zero”。这意味着证明允许 \(H\) 对 \(Y\) 存在直接效应(\(\zeta_t\)),但实证模型(11)中包含了 \(\zeta_t\),这与证明一致。然而,作者在实证中没有检验线性假设是否合理,也没有进行任何非线性设定(如加入 \(H^2\) 项)的稳健性检验。这构成了一个“证明比结论窄”的典型例子。
四、开放问题¶
-
非线性调节效应:本文假设候选人总数对首页/尾页效应的影响是线性的。但文献(如 Shah and Wolford, 2007)发现选择过载效应可能是倒U型的。扎根点:Section 5.3 Limitations 第一点:“the results of this paper may fail to capture nonlinear relationships between the number of candidates and the front / back page effect”。一个直接的开放问题是:能否在非参数或半参数设定下识别 AMTME,并检验其非线性形式?
-
其他中介路径:本文仅识别了通过“宣传册总页数”这一条路径的调节效应。但候选人数量增加还可能通过其他路径(如竞选活动强度、媒体报道量)影响选民决策。扎根点:Section 5.3 Limitations 第二点:“the analysis uses the FDC, it identifies only the part of the effect of the number of candidates on the front / back page effect that operates through the total number of CIP pages”。一个开放问题是:如何将本文的框架扩展到存在多个中介变量的情况,或者如何对未通过 \(M\) 的路径进行敏感性分析?
-
样本选择偏差:本文的数据集仅包含165个选举,占同期东京全部487个选举的约34%。数据缺失可能非随机。扎根点:Section 5.3 Limitations 第三点:“If tendencies for election records to be preserved or for pamphlet formats to be revised are correlated with the number of candidates or the front / back page effect, the results may not represent the overall pattern”。一个开放问题是:如何对由数据缺失导致的样本选择偏差进行校正,或进行更严谨的敏感性分析?
-
异质性处理效应:本文估计的是平均效应,但候选人数量对首页/尾页效应的影响可能因选民特征(如教育水平、政治知识)或选举特征(如竞争激烈程度)而异。扎根点:Section 5.3 Limitations 第四点:“this paper cannot examine heterogeneity in the effect of the number of candidates on the front / back page effect”。一个开放问题是:如何将本文的框架扩展到允许处理效应异质性的情况,例如通过引入处理变量与协变量的交互项,或使用因果森林等机器学习方法?
Maintained by 陈星宇 · Homepage · Source on GitHub