Candidate Set Size and Voting Behavior: A Front-Door Approach to Causal Moderation¶
作者: Masayuki Haruhara
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.20779
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是因果调节效应(causal moderation),具体而言:当研究者关心一个处理变量(treatment)的因果效应如何被另一个变量(moderator)所改变时,如果处理变量是随机分配的,但调节变量是非随机的(即存在未观测混杂),如何识别这个调节效应?这是一个介于“因果推断”与“交互效应分析”之间的交叉问题。当前成熟度:方法上已有并行估计框架(PEF)处理随机处理+非随机调节,但该框架要求调节变量在给定协变量后条件外生——这在许多实际场景中难以满足。本文试图通过引入前门调整(front-door adjustment)来放松这一要求。
发展脉络(history)¶
- 奠基工作:Bansak (2021) 提出了并行估计框架(PEF),核心想法是:当处理变量T随机时,可以在T的每个水平内估计调节变量S对结果Y的效应,然后跨T水平差分,得到T与S的因果交互效应。该框架要求S在给定协变量后条件外生(即无未观测混杂)。这是本文的直接方法学起点。
- 主要进展(前门调整的复兴):Pearl (1995) 提出了前门准则(FDC),用于在存在未观测混杂时,通过一个外生中介变量M来识别H对Y的因果效应。Bellemare et al. (2024) 和 Glynn & Kashin (2017; 2018) 将FDC应用于实证经济学,展示了其可行性,但也指出合适的FDC设定很难找到(Huntington-Klein, 2021)。本文作者引用这些工作,将其定位为“FDC的应用范例”,但认为它们没有解决“调节变量非随机”这一特定问题。
- 当前frontier与本文位置:本文是第一个将PEF与FDC结合的工作。作者声称,在PEF框架下,当调节变量S非随机时,可以用FDC来识别S对结果的因果效应(通过一个外生中介M),从而避免对S的条件外生性假设。本文的实证应用(东京市议会选举)提供了一个“理想”的FDC设定:中介变量(总页数)由制度规则机械决定,且不随时间变化。
子线索聚类¶
这些被引文献大致落在三条子线索上: 1. 并行估计框架(PEF)的应用:Bansak (2021) 是方法奠基;Carlsson et al. (2024)、Kozyreva et al. (2023)、Krajewski et al. (2025)、Pickett et al. (2024) 是实验研究,处理随机、调节非随机,但仅通过观测协变量调整;Bernardi & Ghirardi (2025) 和 Emeriau et al. (2026) 是观测研究,处理非随机或仅调整观测协变量。本文作者指出,这些应用“cannot be said to fully resolve endogeneity due to unobserved factors”。 2. 前门调整(FDC)的实证应用:Bellemare et al. (2024) 和 Glynn & Kashin (2017; 2018) 展示了FDC在观测数据中的使用。本文作者引用它们作为“FDC settings that are more suitable than those in existing studies”的对比对象。 3. 投票行为中的选择过载(choice overload):Cunow et al. (2021)、Goidel & Armstrong (2025)、Söderlund et al. (2021) 等实验和观测研究,发现候选人数量增加会强化首因效应(ballot order effect / front page effect)。本文的实证贡献在于将这一结论推广到“时间约束相对较弱”的竞选期信息获取过程。
这个方向在追问的核心问题¶
- 识别问题:当处理变量随机但调节变量非随机时,如何识别调节效应?现有PEF要求调节变量条件外生,但这一假设在实际中常被违反。
- 中介路径:调节效应是通过什么机制(中介)传导的?本文聚焦于“总页数”这一机械中介,但其他路径(如选民注意力分配、竞选策略调整)可能同样重要。
- 外部有效性:实验室/投票站中的选择过载结论能否推广到真实选举的较长决策周期?
- 非线性:候选人数量与投票行为之间是否存在非线性关系(如倒U型)?本文的线性假设可能掩盖这一点。
⚠️ 作者的framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口frame成什么:作者声称,现有PEF应用(实验或观测)要么只调整观测协变量(无法解决未观测混杂),要么处理非随机。本文通过“随机处理 + 前门调整”提供了一个“model case”(模型案例),即“the conditions under which the FDC identifies causal effects are satisfied”。作者将本文定位为“PEF与FDC的首次结合”,并强调其FDC设定(中介由制度规则机械决定)比现有FDC应用(如Bellemare et al., 2024)更干净。
- 哪些竞争路线被他淡化或回避了:作者完全回避了工具变量(IV) 方法。如果调节变量S非随机,一个自然的替代方案是寻找S的工具变量。作者没有讨论为什么IV不适用或不如FDC。此外,作者没有讨论半参数效率理论——本文的估计量(两步法乘积)是否达到半参数有效界?是否有更高效的估计量(如双稳健估计)?这些在因果推断文献中是标准问题,但本文完全未涉及。
- 什么明显该被引/该存在、却没出现在intro里? 本文没有引用任何关于因果中介分析(causal mediation analysis) 的现代文献(如Imai, Keele & Tingley, 2010; Tchetgen Tchetgen & Shpitser, 2012; 以及关于前门调整的效率理论工作)。考虑到本文的核心是“通过中介识别调节效应”,这似乎是一个明显的缺失。此外,没有引用任何关于半参数有效估计或双机器学习(DML) 的文献——这些工具可以直接用于改进本文的估计效率。
张力¶
未见明显对立引用。被引文献在“候选人数量增加会强化首因效应”这一结论上基本一致,分歧主要在于外部有效性和机制解释。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( T_i \in \{0, 1\} \):处理变量,表示候选人i是否出现在首页(front page)或尾页(back page) vs. 内页(inner pages)。在本文中,T是随机分配的(由抽签决定)。 - \( H_i \in \mathbb{R} \):调节变量,表示候选人i所在选举的候选人总数(number of candidates)。H是非随机的,可能受选举热度等未观测因素影响。 - \( M_i \in \mathbb{R} \):中介变量,表示候选人i所在选举的CIP总页数(total number of CIP pages)。M由H和市政固定规则机械决定。 - \( Y_i \in \{0, 1\} \):结果变量,表示候选人i是否当选(winning dummy)。 - \( X_i^F \):用于前门调整的协变量,在本文中主要是市政固定效应(municipality fixed effects)。 - \( M_i(h) \):潜在中介变量,当H被设为h时的M值。 - \( Y_i(t, h, m) \):潜在结果,当T=t, H=h, M=m时的Y值。 - \( \nu(h, x) = \mathbb{E}[M_i(h) | X_i^F = x] \):中介变量的条件均值函数。 - \( \mu_t(h, m, x) = \mathbb{E}[Y_i(t, h, m) | H_i = h, X_i^F = x] \):结果变量的条件均值函数。
模型:本文假设线性数据生成过程(DGP): - \( M_i = \theta_0 H_i + \mu_w + v_{wy} \)(第一阶段,其中\( \mu_w \)是市政固定效应) - \( Y_i = \theta_{1t} M_i + \zeta_t H_i + \eta_w + x_i \beta_t + \varepsilon_i \)(第二阶段,在T=t的层内估计)
可观测数据:研究者实际能观测到的是: - 每个候选人的T(随机分配)、H(选举层面的候选人总数)、M(选举层面的总页数)、Y(是否当选)、X^F(市政固定效应)以及候选人层面的协变量x(年龄、性别、是否现任、党派)。 - 想要但观测不到的量:潜在结果\( Y_i(t, h, m) \)和潜在中介\( M_i(h) \);以及未观测混杂U(如选举热度),它同时影响H和Y,但通过M的机械性被阻断。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设T是二值(首页 vs. 内页),H是二值(候选人少 vs. 多),M是二值(页数少 vs. 多)。在这个特例下,本文要回答的问题是:H(候选人数量)如何改变T(首页效应)对Y(胜选概率)的因果效应?
最小内核:支撑整篇论文的核心数学问题是:当T随机、H非随机时,如何识别H对T效应的调节作用? 本文的关键想法是:通过一个外生中介M(总页数)来“代理”H的变异,从而绕过H的未观测混杂。
最简特例下的识别策略: 1. 第一步(PEF):由于T随机,我们可以分别估计在T=1(首页)和T=0(内页)的层内,H对Y的效应。但H非随机,所以这个效应不是因果的。 2. 第二步(FDC):在T=1的层内,我们想估计H对Y的因果效应。但H有混杂。我们找到一个中介M(总页数),它满足: - M只受H和市政固定效应影响(机械决定),不受未观测混杂U影响。 - M对Y的效应,在给定H和X^F后,是因果的(因为M是外生的)。 3. 第三步(乘积):在T=1的层内,H对Y的因果效应(通过M的路径)可以分解为: - H对M的因果效应(\( \theta_0 \)):由市政固定效应和线性模型识别。 - M对Y的因果效应(\( \theta_{11} \)):在T=1层内,由线性模型识别。 - 乘积\( \theta_0 \times \theta_{11} \)就是H通过M对Y的因果效应。 4. 第四步(差分):在T=0的层内,同样得到\( \theta_0 \times \theta_{10} \)。两者的差\( \theta_0 (\theta_{11} - \theta_{10}) \)就是平均中介处理调节效应(AMTME)——即H通过M对T效应的调节作用。
为什么这个特例抓住了核心:在一般情形下(H和M连续),上述逻辑完全不变,只是将“二值差分”替换为“导数乘积”。本文的证明(Proposition 1)本质上就是把这个特例的识别逻辑推广到连续情形,并验证线性假设下乘积与差分的等价性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当处理变量(首页/尾页 vs. 内页)随机分配、但调节变量(候选人数量)非随机时,如何识别调节变量通过一个外生中介(CIP总页数)对处理效应的调节作用(即平均中介处理调节效应,AMTME)。
- 核心工具/方法:将Bansak (2021)的并行估计框架(PEF)与Pearl (1995)的前门调整(FDC)结合,提出一个两步乘积估计量:先估计H对M的因果效应(\( \theta_0 \)),再在T的每个水平内估计M对Y的因果效应(\( \theta_{1t} \)),取乘积后跨T差分。
- 主要结论:在东京165个市议会选举数据(1987-2023)中,每增加一名候选人,通过总页数渠道使首页效应(对胜选概率的影响)增加0.322个百分点(p<0.05),为基线首页效应(4.023个百分点)的8.0%;尾页效应无显著增加。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 处理变量T:三分类(首页、尾页、内页),但分析中分别将首页与内页、尾页与内页配对为二值处理。T由抽签随机分配(满足Assumption 1)。
- 调节变量H:连续变量(候选人数量),非随机。本文通过FDC处理其内生性。
- 中介变量M:连续变量(CIP总页数),由H和市政固定规则机械决定。关键识别假设:
- Assumption 2(中介条件外生性):给定H和X^F,M与潜在结果独立。这要求M不受未观测混杂U影响。本文声称,由于M由制度规则机械决定(且市政固定效应吸收了跨市政差异),这一假设成立。
- Assumption 3(调节变量对中介的条件外生性):给定X^F,H与潜在中介独立。这要求H的变异中,与X^F相关的部分被吸收后,剩余部分与潜在中介无关。本文声称,由于市政固定效应吸收了跨市政差异,且H的变异仅来自选举层面,这一假设成立。
- 线性假设:本文假设H对M、M对Y的效应是线性的。这是识别策略的核心——乘积估计量在线性模型下等价于链式法则的导数乘积。
- 与已有文献的对比:相比Bansak (2021)的PEF,本文放松了“调节变量条件外生”的假设,代之以“中介条件外生”和“调节变量对中介条件外生”两个假设。相比Bellemare et al. (2024)的FDC应用,本文的FDC设定更干净(中介由制度规则机械决定,而非由研究者选择)。
主要结果¶
- 理论结果(Proposition 1):在SUTVA、共同支撑、完全随机化处理、线性性以及Assumptions 1-3下,估计量\( \delta^{PE \times FD} = \gamma_1^{FD} - \gamma_0^{FD} \)识别AMTME。证明分四步:①H对M的因果效应在T的每个水平内相同(\( \theta_{0t} = \theta_0 \));②M对Y的因果效应在T的每个水平内由线性模型识别(\( \theta_{1t} \));③乘积\( \theta_0 \theta_{1t} \)识别H通过M对Y的因果效应;④跨T差分得到AMTME。
- 实证结果:
- 第一阶段(H对M):每增加一名候选人,总页数增加约0.1页(首页层0.100,尾页层0.096,内页层0.131***)。
- 第二阶段(M对Y):总页数每增加一页,首页层胜选概率增加1.472个百分点(),内页层减少1.333个百分点(),尾页层不显著。
- 乘积(H通过M对Y的效应):首页层+0.148个百分点(),内页层-0.174个百分点(*),尾页层不显著。
- 差分(AMTME):首页效应增加0.322个百分点(**),尾页效应增加0.153个百分点(不显著)。
证明路线与技术技巧¶
整体路线(Proposition 1的证明): 1. Step 1:利用Assumption 3(H对M的条件外生性)和线性性,证明\( \mathbb{E}[M_i | H_i = h, X_i^F = x] = \nu(h, x) \),且其导数\( \theta_0 \)在T的每个水平内相同。 2. Step 2:利用Assumption 2(M对Y的条件外生性)和线性性,证明\( \mathbb{E}[Y_i | T_i = t, H_i = h, M_i = m, X_i^F = x] = \mu_t(h, m, x) \),且其关于m的导数\( \theta_{1t} \)在T=t的层内被识别。 3. Step 3:在线性性下,H通过M对Y的因果效应(在T=t层内)等于\( \theta_0 \theta_{1t} \),这正是\( \gamma_t^{FD} \)。 4. Step 4:跨T差分得到\( \delta^{PE \times FD} = \theta_0 (\theta_{11} - \theta_{10}) \),代入AMTME的定义验证相等。
关键跳跃点: - 跳跃1:从“H对M的效应在T的每个水平内相同”到“乘积估计量识别中介效应”。这依赖于线性性——如果效应是非线性的,乘积估计量可能不等于链式法则的导数乘积。作者在附录中明确假设了线性性(公式18-19)。 - 跳跃2:从“M对Y的效应在T=t层内被识别”到“该效应是因果的”。这依赖于Assumption 2——M在给定H和X^F后与潜在结果独立。作者声称这一假设由制度规则保证,但未提供正式检验。
技术技巧点名: - 前门调整(FDC):核心识别策略,用于处理H的内生性。 - 并行估计框架(PEF):核心识别策略,用于处理T的随机性和H的非随机性。 - 线性模型与OLS:估计方法,简单但依赖线性性。 - 聚类标准误与聚类bootstrap:推断方法,用于处理选举层面的聚类。 - 乘积估计量:将两步估计的系数相乘,得到中介效应。这是FDC的标准做法。
真实例子与应用¶
- 数据:东京23个特别区及26个市的165次市议会选举(1987-2023),共8,450名候选人。数据来源为国立国会图书馆、市政档案、Election.com等。
- 场景:候选人信息手册(CIP)的页面位置由抽签随机分配(处理T),总页数由候选人数量(H)和市政固定规则机械决定(中介M)。选民可以在竞选期间(数天至数周)阅读CIP并决定投票。
- 方法应用:将样本按T(首页/尾页 vs. 内页)分层,在每个层内估计H对M的效应(第一阶段)和M对Y的效应(第二阶段),取乘积后跨层差分。
- 结果:每增加一名候选人,首页效应增加0.322个百分点(p<0.05),为基线首页效应(4.023个百分点)的8.0%。尾页效应无显著增加。
- 这个例子想说明什么:①验证理论——在时间约束相对较弱的真实选举中,候选人数量增加仍会强化首因效应(首页效应),说明选择过载不仅发生在实验室/投票站。②展示方法——提供了一个“理想”的FDC设定,其中介由制度规则机械决定,且不随时间变化,可作为未来FDC应用的模板。
🔎 结论是否比证明窄¶
- 窄结论1:Proposition 1的证明假设了线性性(公式18-19),但作者在实证中直接使用线性模型,未讨论非线性情况。作者在Limitations中承认“the analysis uses...a linearity assumption”,但未提供非线性下的识别结果或稳健性检验。
- 窄结论2:Proposition 1识别的是AMTME,即“通过M路径的调节效应”。作者在Limitations中明确承认“the analysis uses the FDC, it identifies only the part of the effect...that operates through the total number of CIP pages”。但作者在结论中声称“an increase in the number of candidates changes voting decision making”,这似乎暗示了总效应,而非仅通过M的路径。这是一个需要区分的点。
- 窄结论3:实证结果仅适用于候选人数量在25-82之间的选举。作者在Limitations中承认“the results may fail to capture nonlinear relationships...when the number of candidates is in the single digits”。
四、开放问题¶
-
非线性与阈值效应:本文假设线性,但文献(如Shah & Wolford, 2007; Taagepera et al., 2014)发现选择过载可能存在倒U型关系(峰值在3或10个选项)。能否在非线性模型(如半参数或非参数)下识别AMTME?这需要放松线性性假设,可能涉及更复杂的识别策略(如核方法或级数估计)。扎根点:Section 5.3 Limitations第一段。
-
其他中介路径:本文仅识别了通过“总页数”的路径。但候选人数量增加还可能通过其他机制影响投票行为(如选民注意力分配、竞选策略调整、媒体关注度变化)。能否在DAG中引入多个中介,并识别每个路径的贡献?这涉及多中介分析或路径特定效应(path-specific effects) 的识别问题。扎根点:Section 5.3 Limitations第二段。
-
效率理论与最优估计:本文使用两步OLS乘积估计量,但未讨论其半参数效率界。是否存在更高效的估计量(如双稳健估计、DML)?能否推导出AMTME的半参数有效界?这直接连接研究者的semiparametric theory和efficiency theory兴趣。扎根点:全文未涉及效率理论,这是一个明显的缺口。
-
数据选择偏差:数据集仅包含165/487次选举,且早期选举记录保存不全。如果记录保存与候选人数量或首页效应相关,估计可能不一致。能否设计一个选择模型或加权方案来纠正这一偏差?扎根点:Section 5.3 Limitations第三段。
Maintained by 陈星宇 · Homepage · Source on GitHub