跳转至

Which Effect of Race? Causal Inference without Holding All Else Equal

作者: Thomas Leavitt
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.16371


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在因果推断框架下,如何定义、识别和估计一个“类别变量”(如种族、宗教、民族)的因果效应,当这个类别本身不可避免地与一系列非类别属性(如语言、居住地、犯罪记录)相关联时。传统方法通过“控制其他变量不变”来隔离类别变量的“纯净”效应,但这恰恰剥离了类别在现实世界中的社会内容。当前成熟度:这是一个高度活跃且充满争议的领域,处于因果推断、社会科学方法论和种族/性别哲学的交叉点。核心张力在于:一个“好”的因果效应,是否必须是一个“其他一切相等”的对比?

发展脉络(history)

  1. 奠基工作:因果推断框架与“不可操纵”的种族

    • Holland (1986)Rubin (1974) 的潜在结果框架为因果效应提供了严谨定义,但明确指出“种族”无法被操纵,因此不能像传统处理变量那样定义个体层面的种族效应。
    • Greiner & Rubin (2011) 提出一个关键转向:将效应定义在决策者(如雇主、检察官)身上,而非被操纵的个体身上。效应是决策者对两个不同种族化个体的反应差异。这为后续研究提供了可操作的基础。
    • Bertrand & Mullainathan (2004) 的经典审计研究(“Are Emily and Greg More Employable than Lakisha and Jamal?”)是“其他一切相等”设计的典范,通过随机化简历上的名字来隔离种族信号,同时保持其他所有特征不变。该设计被广泛认为是“可信推断”的标准。
  2. 主要进展:识别“种族效应”的挑战与回应

    • Sen & Wasow (2016) 提出“种族作为一捆棍子”(Race as a Bundle of Sticks)的隐喻,承认种族由多个属性(棍子)构成。他们的回应是研究单根“棍子”的效应(如一个特定的名字),而不是整个“捆”的效应。这实质上接受了“其他一切相等”的前提,但将目标从“种族”缩小到“种族信号”。
    • Kohler-Hausmann (2019)Hu & Kohler-Hausmann (2025) 从“厚建构主义”种族观出发,提出不相容性回应。他们认为,种族类别本身包含了其索引的非种族属性。因此,一个“其他一切相等”的对比,恰恰剥离了种族类别的社会内容,不能被视为“种族”的效应。他们的结论是,潜在结果框架不适用于检测种族歧视,或者必须与规范性探究相结合。
    • Hainmueller, Hopkins & Yamamoto (2014) 在conjoint实验中推广了平均边际成分效应(AMCE),这是“其他一切相等”效应在多元选择情境下的一个特例。de la Cuesta, Egami & Imai (2022) 进一步改进了AMCE的外部有效性,通过校准属性分布来匹配目标总体。
  3. 当前Frontier与本文位置

    • 当前前沿的争论焦点是:在承认种族是“厚”类别的前提下,能否在不放弃因果推断的情况下,定义并识别其效应?
    • 本文(Leavitt, 2026) 的位置是:挑战上述两个回应共享的前提——“种族的因果效应必须是其他一切相等的对比”。作者证明,这个前提是一个选择,而不是可信推断的要求。通过将“选择效应”和“恢复效应”这两个问题分离,作者证明同一个随机化设计可以恢复一族效应,从“其他一切相等”到“种族内效应”。这为“厚建构主义”和因果推断之间架起了一座桥梁。

子线索聚类

  1. 审计/实地实验与“其他一切相等”设计:以 Bertrand & Mullainathan (2004)Pager (2003)Quillian et al. (2017) 为代表。核心是使用精心设计的刺激(如简历、测试者)来隔离种族信号,控制所有其他变量。这一簇的贡献在于提供了高度可信的因果估计,但代价是默认选择了“其他一切相等”效应。
  2. Conjoint实验与AMCE:以 Hainmueller & Hopkins (2015)Hainmueller et al. (2014)de la Cuesta et al. (2022) 为代表。通过同时随机化多个属性来估计每个属性的边际效应。AMCE是“其他一切相等”效应的一种形式。这一簇的方法论贡献在于处理多维选择,但同样默认了“其他一切相等”的对比。
  3. 批评性文献与“厚建构主义”:以 Kohler-Hausmann (2019)Hu (2023)Hu & Kohler-Hausmann (2025)Sen & Wasow (2016) 为代表。这一簇从哲学和社会学角度质疑标准因果推断方法。Sen & Wasow 的回应是研究“信号”而非“类别”;Kohler-Hausmann 等人的回应是认为因果推断不适用。本文直接与这一簇对话,提供了一个中间路径。

这个方向在追问的核心问题

  1. 定义问题:种族的“因果效应”应该是什么?是剥离了所有关联属性的“纯净”名义成员效应,还是包含了这些关联属性的“类别作为构成”的效应?
  2. 识别问题:在给定一个研究设计(如随机化实验)后,它能识别出哪个(些)效应?传统观点认为设计只能识别“其他一切相等”效应。本文挑战了这一点。
  3. 选择问题:如果多个效应都可以被识别,研究者应该如何选择?这个选择是统计性的还是实质性的(如基于种族概念或规范性理论)?
  4. 感知与暴露的张力:在感知为基础的制度下(如名字诱导感知),研究者无法自由选择效应,因为感知本身是潜在结果。如何理解这种“非选择”下的效应?

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将文献中的核心缺口 frame 为“捆绑”。他认为,文献对“其他一切相等”设计的辩护,错误地将两个问题捆绑在一起:① 研究应该估计种族的哪个效应(estimand commitment);② 设计能否恢复该效应(recovery condition)。作者的贡献是解绑这两个问题,证明同一个设计可以恢复一族效应,从而将选择效应变成一个实质性(而非统计性)的决策。
  • 哪些竞争路线被他淡化或回避了
    • 作者淡化了 Kohler-Hausmann (2019) 的更强结论,即潜在结果框架从根本上不适用于检测歧视。作者通过证明“种族内效应”是一个定义良好的因果效应来回应,但并未完全解决 Kohler-Hausmann 关于“反事实因果思维”在歧视检测中可能产生误导的更深层哲学担忧。
    • 作者回避了观测研究中的识别问题。本文的识别结果完全依赖于随机化(配置或线索的完全随机分配)。在观测研究中,当需要依赖无混杂性等假设时,本文的效应族是否还能被识别?作者在结论中提到了这一点,但未深入。
  • 什么明显该被引/该存在、却没出现在 intro 里?:未见明显缺失的关键引用。作者引用了该领域几乎所有核心文献,包括支持者和批评者。

张力

未见明显对立引用。文献中的不同观点(如 Sen & Wasow 的“信号”回应 vs. Kohler-Hausmann 的“不相容”回应)并非基于矛盾的实证发现,而是源于对“种族是什么”这一前提的不同理解。本文的核心贡献正是通过挑战它们共享的前提来调和这种张力。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • i ∈ {1, ..., N}: 决策者-决策对(unit),例如一位检察官阅读一份案卷。
    • z ∈ {0, 1}: 种族化属性(racially constituted attribute),例如案卷上标明的种族(0=白人,1=黑人)。
    • v ∈ V: 非种族特征向量(nonracial features),例如逮捕地点、前科记录。V 是有限集合。
    • t_i = (z, v) ∈ T: 配置(configuration),即unit i 遇到的完整案卷。T = {0, 1} × V 是配置空间。
    • y_i(t) = y_i(z, v): 潜在结果(potential outcome),即unit i 在配置 t 下的反应(例如是否起诉)。这是要估的对象
    • τ_i(t, t') = y_i(t) - y_i(t'): 单位层面的效应。
    • ρ(v): 一个共同的概率分布,用于加权非种族特征 v
    • q_z(v): 种族条件分布,即在种族 z 下非种族特征 v 的分布。
    • g_z(v): 目标效应中,对种族 z 下的非种族特征 v 的加权分布。对于AEE,g_0 = g_1 = ρ;对于AEWR,g_z = q_z
  • 模型

    • 数据生成机制:本文考虑的是随机化实验。在暴露为基础(exposure-based)的制度下,配置 t_i = (z, v)完全随机分配的(Assumption 3)。这意味着每个unit i 被分配到每个配置 (z, v) 的概率是固定的、已知的,且不依赖于unit i 的任何属性。
    • 已知:分配机制(即每个配置的单元数 n_{z,v})。研究者指定的加权分布 g_z(v)
    • 要估的对象:一族因果效应 θ(g_0, g_1),它是单位层面种族效应的加权平均。
  • 可观测数据

    • 可观测:每个unit i 被分配到的配置 T_i,以及该unit 的观测结果 Y_i = y_i(T_i)
    • 不可观测/潜在:每个unit i 在其他配置下的潜在结果 y_i(z', v'),其中 (z', v') ≠ T_i。这是因果推断的基本问题。此外,在感知为基础(perception-based)的制度下,感知到的种族 z_i(w) 和非种族特征 v_i(w) 也是潜在结果,通常不可观测。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:一个只有两个种族(z=0, 1)和一个二元非种族特征(v ∈ {0, 1})的实验

  • 设定:假设我们研究检察官的起诉决定。z=1 表示案卷标明“黑人”,z=0 表示“白人”。v=1 表示逮捕发生在高犯罪率、以黑人为主的社区(如布朗斯维尔),v=0 表示发生在低犯罪率、以白人为主的社区(如上东区)。
  • 可观测数据:我们随机分配案卷给检察官。每个案卷包含一个种族 z 和一个社区 v。我们观测到每个检察官的起诉决定 Y_i
  • 核心问题:我们想估计“种族”对起诉决定的影响。但“黑人”和“白人”这两个群体在社区分布上天然不同(q_1(v=1) 很大,q_0(v=1) 很小)。如果我们“控制社区不变”(即 v=v'),我们比较的是“在布朗斯维尔被捕的黑人”和“在布朗斯维尔被捕的白人”。后者是一个“非典型”的白人。如果我们“让社区随种族变化”(即 vv' 可以不同),我们比较的是“在布朗斯维尔被捕的黑人”和“在上东区被捕的白人”,这更符合现实中的群体对比。

  • 最小内核:两个极端效应

    1. 其他一切相等效应 (AEE):我们强制 v = v'。效应是 τ_i((1, v), (0, v)) = y_i(1, v) - y_i(0, v)。然后我们用一个共同的分布 ρ(v) 来平均这些 v 特定的效应。例如,ρ(v=1) = ρ(v=0) = 0.5。这个效应回答的是:“如果我们将一个黑人和一个白人置于完全相同的社区,起诉率的差异是多少?”
    2. 种族内效应 (AEWR):我们允许 vv' 不同。效应是 y_i(1, v) - y_i(0, v')。然后我们用种族特定的分布 q_z(v) 来加权。例如,对于黑人,我们用 q_1(v) 加权 y_i(1, v);对于白人,我们用 q_0(v') 加权 y_i(0, v')。这个效应回答的是:“一个典型的黑人(在布朗斯维尔被捕)和一个典型的白人(在上东区被捕)之间的起诉率差异是多少?”
  • 核心数学困难与关键想法

    • 困难:传统观点认为,要得到无偏估计,我们必须“控制混杂”,即让 zv 独立(profile-blindness)。但这会强制 v=v',从而只能估计AEE。
    • 关键想法:作者证明,我们不需要 zv 独立。我们只需要单位盲性(unit-blindness),即每个unit i 被分配到每个配置的概率相同。只要每个配置 (z, v) 都有至少一个单元,我们就可以无偏地估计每个配置的单元均值 µ(z, v) = E[Y_i | T_i = (z, v)]。然后,任何加权平均 θ(g_0, g_1) = Σ_v g_1(v)µ(1, v) - Σ_v g_0(v)µ(0, v) 都是无偏的。选择不同的 g_z 就定义了不同的效应。随机化本身不选择效应,它只保证我们能恢复任何我们选择的效应

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了在种族歧视的实证研究中,如何定义和识别种族的因果效应。它挑战了“种族的因果效应必须是‘其他一切相等’对比”这一普遍前提。
  2. 核心工具/方法:作者提出了一个效应族框架,该框架将同一个随机化设计下可识别的效应从“其他一切相等效应”(AEE)扩展到“种族内效应”(AEWR)及其混合形式。核心工具是解绑“选择效应”和“恢复效应”这两个问题,并利用单位盲性(而非轮廓盲性)作为识别条件。
  3. 主要结论:① 同一个随机化设计可以无偏地恢复一族因果效应,而不仅仅是AEE。② 选择哪个效应是一个实质性(基于种族概念和规范性理论)而非统计性的决策。③ 在感知为基础的制度下,自然种族效应(NREC)是一个定义良好的因果效应,其识别条件比文献中假设的“线索稳定性”更弱。④ 通过重新分析一个西班牙语竞选实验,作者展示了AEE和AEWR可以得出截然相反的结论(一个发现同族偏好,一个没有)。

关键设定与假设

  • SUTVA (Assumption S1 & S2):稳定单元处理值假设。在暴露制度下,一个unit的潜在结果只取决于它自己的配置,不受其他unit配置的影响(无干扰),且同一决策者的不同决策之间无延续效应。在感知制度下,类似假设适用于线索、感知种族和感知非种族特征。
  • 完全随机分配 (Assumption 3 & 4):配置(或线索)是完全随机分配的,每个配置(或线索)的单元数是固定的。这保证了单位盲性,即分配概率不随unit变化。
  • 感知充分性 (Assumption 1):在感知制度下,线索对结果的影响完全通过其诱导的感知配置(感知种族和感知非种族特征)来传导,没有其他直接渠道。
  • 无非违者 (Assumption S3):在感知制度下,没有unit会反向感知线索(即把黑人线索感知为白人,反之亦然)。
  • 存在至少一个依从者 (Assumption S4):在感知制度下,至少有一个unit的感知种族会随线索变化(从0到1)。
  • 无非孤立非种族感知变化 (Assumption 2):在感知制度下,对于非依从者(感知种族不随线索变化的unit),其感知的非种族特征也不会随线索变化。这是识别NREC的关键假设,比文献中的“线索稳定性”更弱。

主要结果

  1. 效应族定义 (Section 4):严格定义了AEE、AEWR和混合效应,将它们统一表示为 θ(g_0, g_1) = Σ_v g_1(v)µ(1, v) - Σ_v g_0(v)µ(0, v)。这为后续的识别和估计提供了统一框架。
  2. 识别结果 (Proposition 1 & 2)
    • 暴露制度 (Proposition 1)单位盲性足以无偏地恢复效应族中的任何成员。轮廓盲性zv 独立)既不必要也不充分用于推断;它的作用是选择AEE这个特定的效应。这是本文最核心的理论贡献。
    • 感知制度 (Proposition 2):在无非违者和感知充分性下,无非孤立非种族感知变化 (Assumption 2) 足以使Wald比率(∆_Y / ∆_Z)等于自然种族效应(NREC)。这比文献中要求的“线索稳定性”(对所有unit都要求 v_i(0) = v_i(1))更弱。
  3. 估计与推断 (Section 7)
    • 暴露制度:提出了一个简单的插件估计量 ˆθ = Σ_v g_1(v)ˆµ(1, v) - Σ_v g_0(v)ˆµ(0, v),其中 ˆµ(z, v) 是单元均值。证明了该估计量的无偏性(Proposition S3)和一致性(Proposition S5)。
    • 方差与置信区间:推导了精确方差(Proposition S4),并给出了一个保守的方差上界(Corollary S2),该上界只依赖于可识别的单元内方差。基于此,可以构建保守的置信区间。证明了方差估计量的一致性(Proposition S6)和中心极限定理(Proposition S7)。
    • 感知制度:使用Wald比率估计量 \NREC = ˆ∆_Y / ˆ∆_Z,并给出了基于Delta方法的保守置信区间。

证明路线与技术技巧

  • 整体路线

    1. 定义效应族:将一族效应统一表示为加权单元均值的差 θ(g_0, g_1)
    2. 证明无偏性:在完全随机分配下,证明插件估计量 ˆθθ 的无偏估计。关键在于,E[ˆµ(z, v)] = µ(z, v),因为分配是随机的。这个证明不依赖于 zv 的独立性。
    3. 推导方差:利用随机分配下指示变量的协方差结构(Lemma S1),推导出 ˆθ 的精确方差。方差中包含不可识别的跨单元协方差。
    4. 构造保守方差:通过两种方式获得保守方差上界:① 直接丢弃不可识别的单元间效应方差 S^2(ψ)(Neyman式);② 使用Cauchy-Schwarz不等式对跨单元协方差进行上界估计。取两者中较小的一个作为最终上界(Corollary S2)。
    5. 建立渐近理论:在正则条件下,证明 ˆθ 的一致性、方差估计量的一致性以及中心极限定理,为构建渐近有效的置信区间提供理论基础。
  • 关键跳跃点

    • 从“轮廓盲性”到“单位盲性”:这是本文最关键的跳跃。传统观点认为,要识别种族效应,必须让种族 z 与非种族特征 v 独立(轮廓盲性)。作者证明,这实际上是选择了AEE这个效应,而不是识别了它。真正的识别条件仅仅是单位盲性。这个跳跃是通过将“选择效应”和“恢复效应”解绑实现的。
    • 从“线索稳定性”到“无非孤立非种族感知变化”:在感知制度下,文献要求线索不能改变任何人的非种族感知(线索稳定性)。作者证明,这个条件对于识别NREC来说过强了。只需要非依从者的非种族感知不变(Assumption 2),而依从者的非种族感知可以自由变化。这个跳跃是通过将依从者和非依从者的角色分开实现的。
  • 技术技巧点名

    • 随机化推断:整个证明框架是设计-based的,依赖于完全随机分配的性质。
    • 有限总体中心极限定理:使用了Li & Ding (2017) 的有限总体CLT来证明 ˆθ 的渐近正态性。
    • Delta方法:用于构造NREC比率估计量的置信区间。
    • Cauchy-Schwarz不等式:用于对不可识别的跨单元协方差进行上界估计,从而获得保守的方差估计。

真实例子与应用

  • 数据/场景:重新分析了 Zárate et al. (2024) 的候选人评价实验。该实验研究西班牙裔选民是否更偏好西班牙裔候选人。实验随机化候选人的种族(Anglo vs. Hispanic)和竞选演讲的语言(英语、非母语西班牙语、母语西班牙语)。
  • 如何应用
    • 暴露制度:将候选人的种族 z 和语言 v 视为随机分配的配置。研究者可以自由选择加权分布 g_z(v)。作者使用竞选广告数据(Table 1)来定义 q_z(种族内语言分布)和 ρ(共同分布)。
      • AEE:使用共同分布 ρ 加权语言。结果:效应为 -0.01,不显著。
      • AEWR:使用种族特定分布 q_z 加权语言。结果:效应为 0.10,显著。
    • 感知制度:将候选人的名字和标签视为一个线索 w。使用感知种族测量作为第一阶段,估计NREC。结果:在英语条件下,NREC显著为正;在西班牙语条件下,不显著。
  • 结果AEE和AEWR给出了截然相反的结论。AEE显示没有同族偏好,而AEWR显示存在。这个差异源于AEE将Anglo候选人主要置于“母语西班牙语”这个非典型配置下,而AEWR则比较了典型的Anglo(非母语西班牙语)和典型的Hispanic(母语西班牙语)候选人。
  • 这个例子想说明什么:这个例子完美地展示了本文的核心论点:选择哪个效应(AEE vs. AEWR)直接决定了研究发现。它不是一个统计问题,而是一个关于“种族类别是什么”的实质性选择。如果研究者认为语言是种族类别的一部分(厚建构主义),那么AEWR是更合适的效应;如果认为语言是可分离的(古典主义),那么AEE是合适的。

🔎 结论是否比证明窄

  • 。本文的识别结果(Proposition 1 & 2)是在完全随机化的强假设下严格证明的。然而,作者在结论(Section 9)中将其推广到更广泛的场景,如“将效应族推广到观测研究”。这是一个conjecture,因为观测研究需要依赖无混杂性等不可验证的假设,而本文并未证明在这些假设下,效应族中的每个成员都能被识别。作者在结论中承认了这一点(“where identification assumptions replace the randomization this paper assumes”),但并未提供任何证明或条件。

四、开放问题

  1. 如何将效应族推广到观测研究? 在观测研究中,识别需要依赖无混杂性等假设。这些假设是否足以识别整个效应族,还是只能识别特定的成员(如AEE)?这需要发展新的识别条件和估计方法。扎根点:Section 9, “carrying the estimands to observational studies, where identification assumptions replace the randomization this paper assumes.”
  2. 如何为效应族中的每个成员构造半参数有效估计量并推导效率界? 本文只给出了基于随机化的简单插件估计量。对于更复杂的设定(如观测研究、连续型非种族特征),可以发展基于高效影响函数(EIF)的估计量,并推导半参数效率界。这与研究者的 very_familiar 工具(estimation theory in causal inference)和 moderately_familiar 工具(semiparametric theory)高度契合,属于立即可做的follow-up。
  3. 如何将效应族框架与“统计-计算权衡”联系起来? 当非种族特征 v 的维度很高时,计算所有配置的单元均值 µ(z, v) 可能不可行。是否存在计算上更高效的估计量(如基于核方法或稀疏模型的估计量)?这些估计量的统计效率与计算成本之间是否存在权衡?这与研究者的 primary_interests(statistical-computational tradeoff)高度相关,但需要研究者先熟悉本文的因果推断框架。扎根点:本文假设 V 是有限集,但未讨论高维情况。
  4. 在感知制度下,如何放松“无非孤立非种族感知变化 (Assumption 2)”? 该假设要求非依从者的非种族感知不变。如果这个假设不成立,Wald比率估计什么?能否发展出基于工具变量或敏感性分析的方法来处理这种情况?扎根点:Proposition 2 和 Proposition 3 的证明依赖于 Assumption 2。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论