跳转至

Randomization tests for model specification in causal inference under network interference

作者: Supriya Tiwari, Pallavi Basu
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.22890


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是:在存在网络干扰(network interference)的随机实验中,如何检验研究者所选择的“暴露映射”(exposure mapping)是否被正确指定。暴露映射是将高维的干扰模式(每个单元的结果依赖于所有其他单元的处理状态)降维为一个低维的、可处理的暴露变量(例如“邻居中处理的比例”)。它是定义和估计溢出效应(spillover effects)的标准工具。然而,暴露映射的选择通常由分析者主观决定,其正确性很少被检验。如果暴露映射被误设,基于它的估计量(如 Horvitz-Thompson 估计量)就会产生偏倚。因此,一个数据驱动的模型设定检验方法对于确保因果推断的有效性至关重要。这个子方向目前处于早期发展阶段,已有一些关于误设后果的理论分析,但缺乏通用的、可操作的检验方法。

发展脉络(history)

  1. 奠基工作:暴露映射的提出与形式化

    • Hong and Raudenbush [2006]:首次提出“暴露映射”的概念,用于处理多水平观测数据中的干扰问题。
    • Manski [2013] 和 Aronow and Samii [2017]:将暴露映射形式化,将其作为识别和估计溢出效应的核心工具。Aronow and Samii [2017] 的工作是设计基础(design-based)推断的基石,它假设暴露映射是正确指定的,并在此假设下给出了 Horvitz-Thompson 估计量的无偏性和方差公式。
  2. 主要进展:误设后果的理论分析与稳健性框架

    • Leung [2022] 和 Sävje [2024]:系统地研究了暴露映射误设对标准估计量性能的影响。一个核心发现是,标准估计量对某些受控形式的误设具有稳健性。Sävje [2024] 特别区分了暴露映射的两个角色:定义溢出估计量(spillover estimand)和编码因果机制(causal mechanism)。他指出,误设主要影响后者。
    • Sävje et al. [2021]、Hu et al. [2022]、Wang et al. [2020]:提出了另一种稳健性框架,即使用“边缘化估计量”(marginalized estimands)来研究溢出效应。这种方法不依赖显式的暴露映射,因此对多种形式的干扰具有稳健性,但其代价是无法获得关于溢出机制的洞察。
  3. 当前 Frontier:模型设定检验的兴起

    • Gao et al. [2026](本文引用的并发工作):首次提出了一个针对暴露映射模型设定的检验框架,并给出了一个重要的不可能性结果:如果不限制潜在结果函数的模型空间,就不可能构造一个有效的随机化检验。他们随后在一个“线性均值模型”(linear-in-means model)的受限备择空间下,证明了其检验的一致性。这是目前最接近本文的工作。
    • Hoshino and Yanagi [2026]:提出了另一种暴露映射设定检验方法,其框架要求研究者指定一个“更精细的”备择暴露映射。这需要额外的先验知识。
    • 本文(Tiwari and Basu):在 Gao et al. [2026] 的不可能性结果背景下,本文声称在更广泛的潜在结果函数类上工作,并通过数值研究(而非理论证明)来展示检验的功效。其核心创新在于:利用 OLS 估计量的设计基础解释,证明了在正确设定下,OLS 系数渐近地不依赖于具体的处理分配向量,从而可以构造一个近似的随机化检验。

子线索聚类

  1. 暴露映射的定义与估计:这条线索关注如何用暴露映射来定义和估计溢出效应。核心工作是 Aronow and Samii [2017],它提供了设计基础下的推断框架。Sävje [2024] 则深入探讨了误设的影响。
  2. 稳健的溢出效应估计:这条线索试图绕过暴露映射,通过定义边缘化估计量来获得对干扰的稳健性。代表工作是 Sävje et al. [2021] 和 Hu et al. [2022]。其优点是稳健,缺点是无法揭示机制。
  3. 模型设定检验:这是最新的线索,直接针对暴露映射的正确性进行检验。核心工作是 Gao et al. [2026](理论导向,证明了不可能性和在受限模型下的一致性)和本文(方法导向,提出一个基于 OLS 残差的近似随机化检验)。Hoshino and Yanagi [2026] 是另一条路径,需要指定备择模型。

这个方向在追问的核心问题

  1. 可检验性:在什么条件下,暴露映射的误设是可以被检验的?Gao et al. [2026] 的不可能性结果给出了一个重要的上界。
  2. 检验功效:对于一个给定的检验,它在检测不同类型的误设(如遗漏高阶邻居、函数形式错误)时,功效如何?本文主要通过模拟来回答这个问题。
  3. 与现有推断框架的兼容性:如何将模型设定检验无缝地整合到现有的设计基础或超总体推断框架中?本文选择了设计基础框架。
  4. 多重检验:当研究者有多个候选暴露映射时,如何控制族系错误率(FWER)?本文在附录中讨论了嵌套假设下的序贯检验。

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 为“尽管已有工作研究了误设的后果,但缺乏一个数据驱动的方法来检验暴露映射是否被正确指定”。他们将自己的工作定位为填补这个方法论空白。
  • 被淡化或回避的竞争路线:
    • Gao et al. [2026] 的不可能性结果:作者承认了这个并发工作,并指出其关键贡献是理论上的不可能性和在受限模型下的一致性。作者声称自己的工作是在“更广泛的潜在结果模型函数类”上工作,但回避了一个关键问题:他们是否在理论上证明了其检验在更广泛类下的一致性?从 Theorem 2 看,他们只证明了渐近有效性(控制第一类错误),而没有证明一致性(功效趋于1)。他们用“通过数值研究说明功效”来替代理论证明。这实际上是在回避 Gao et al. [2026] 提出的核心理论挑战。
    • 边缘化估计量方法:作者承认其稳健性,但指出其“无法获得对溢出机制的洞察”。这为他们的方法(旨在揭示机制)提供了合理性。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
    • 关于“条件随机化检验”(Conditional Randomization Test, CRT)的文献:作者在 intro 中提到“条件随机化检验文献中的一个关键主题是确保潜在结果的可插补性”,并指出他们的工作不同,因为“我们没有观察到真实的残差”。然而,CRT 文献(如 Candès et al. 2018, Barber et al. 2020)正是处理模型设定检验(尤其是对模型残差的条件独立性检验)的成熟框架。CRT 的核心思想是,在给定一个充分统计量(如暴露映射)的条件下,检验残差是否与处理变量独立。这与本文的框架高度相似。作者没有深入讨论 CRT 与本文方法的关系,也没有解释为什么 CRT 框架不能直接应用(例如,CRT 通常需要知道或能够采样备择假设下的残差分布,而本文通过 OLS 估计来近似)。这是一个值得研究者去查的潜在张力点。
    • 关于“设计基础 OLS”的文献:作者引用了 Abadie et al. [2020] 来“调和设计视角和抽样视角下的标准误”,但 Abadie et al. [2020] 的核心结果是关于 OLS 估计量的方差估计。本文的核心理论结果(Lemma 3)是证明 OLS 系数在正确设定下收敛到一个常数,这与 Abadie et al. [2020] 的结论(OLS 系数是随机变量,其方差由设计决定)似乎有微妙的不同。作者需要更清晰地解释这种“收敛到常数”是如何在有限样本的设计基础框架下成立的。

张力

未见明显对立引用。所有被引工作基本都认同暴露映射是处理网络干扰的有用工具,分歧在于如何应对其误设风险(是使用稳健估计量还是进行检验)。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:
    • N: 总体中的单元数。
    • i, j: 单元索引。
    • Z ∈ {0, 1}^N: 处理分配向量。Z_i = 1 表示单元 i 被处理。
    • Z_obs: 实际观测到的处理分配向量。
    • Y_i(Z): 单元 i 的潜在结果,是整个处理分配向量 Z 的函数。
    • Y_obs: 实际观测到的结果向量,Y_obs = Y(Z_obs)。
    • G ∈ {0, 1}^{N×N}: 网络的邻接矩阵。G_{ij}=1 表示 i 和 j 相连。
    • N_i: 单元 i 的邻居集合。
    • e_i(Z) ∈ ℝ^{k+1}: 单元 i 的暴露映射,是 Z 的低维函数。例如,e_i(Z) = (Z_i, 平均邻居处理比例)。
    • R_i(Z): 有限样本残差,定义为 Y_i(Z) - E_Z[Y_i(Z) | e_i(Z)]。
    • ˜R_i(Z): 修正后的残差,从 Y_i(Z) 中减去基线固定效应 c_i 后,再减去条件期望。在零假设下,˜R_i(Z) = c_i,与 Z 无关。
    • β: OLS 回归系数向量。
    • ϕ(·): 一个基函数,用于将暴露映射 e_i 变换为回归变量。
  • 模型:
    • 数据生成机制:这是一个设计基础(design-based)的框架。总体 P、网络 G、协变量 X 和潜在结果函数 Y_i(·) 都被视为固定的。唯一的随机性来源是处理分配 Z。
    • 处理分配机制:假设是伯努利随机化实验(Assumption 1)。Z_i ~ i.i.d. Bernoulli(p),且 Z 与所有潜在结果独立。
    • 待估对象:我们想要检验的零假设是:暴露映射 e_i(Z) 是正确指定的。这意味着,对于所有 Z 和所有 i,Y_i(Z) 完全由 e_i(Z) 决定,即 Y_i(Z) = E[Y_i(Z) | e_i(Z)]。等价地,残差 R_i(Z) = 0 或修正残差 ˜R_i(Z) 与 Z 无关。
  • 可观测数据:
    • 可观测:Z_obs(处理分配)、Y_obs(结果)、G(网络)、X(协变量,本文未重点使用)。
    • 不可观测 / 潜在:对于任何 Z ≠ Z_obs 的潜在结果 Y_i(Z)。这是因果推断的核心反事实。本文的关键挑战在于,检验统计量依赖于残差 ˜R(Z),而残差本身依赖于不可观测的 Y(Z)。

第二步:讲最小内核

本文的最小内核可以提炼为:在正确设定的暴露映射下,OLS 回归系数是“设计不变的”。

最简特例:考虑一个最简单的网络干扰模型,其中只有直接效应和一阶溢出效应(即只有邻居的处理状态会影响结果)。假设暴露映射是正确指定的,形式为 e_i(Z) = (Z_i, f(Z_{N_i})),其中 f 是某个函数(例如,邻居中处理的比例)。我们用一个线性模型来近似条件期望: Y_i(Z) ≈ β_0 + β_1 * Z_i + β_2 * f(Z_{N_i}) + c_i 其中 c_i 是单元 i 的基线效应。

核心思路: 1. 零假设下的关键性质:如果暴露映射 e_i(Z) 是正确指定的,那么残差 ˜R_i(Z) = Y_i(Z) - E[Y_i(Z) | e_i(Z)] 应该只包含与处理无关的基线效应 c_i。这意味着,对于任何两个不同的处理分配向量 Z 和 Z',我们有 ˜R_i(Z) = ˜R_i(Z') = c_i。残差是处理不变的。 2. OLS 系数的行为:现在,考虑用 OLS 将 Y(Z) 对 [1, ϕ(e(Z))] 进行回归,得到系数 ˆβ(Z)。这个系数是 Z 的函数。在零假设下,由于 Y(Z) = E[Y|e] + c,而 E[Y|e] 是 e(Z) 的函数,c 是常数,因此 Y(Z) 对 e(Z) 的线性投影(即 OLS 系数)应该不依赖于具体的 Z 实现。换句话说,ˆβ(Z) 应该收敛到同一个常数 β_0,无论 Z 是什么。 3. 构造检验:这个性质是构造检验的关键。我们可以用观测数据 (Z_obs, Y_obs) 来估计 ˆβ_obs。然后,对于任何反事实的处理分配 Z,我们可以用 ˆβ_obs 来“预测”反事实的结果 ˆY(Z) = ˆβ_obs · ϕ(e(Z)),并计算反事实的残差 ˆ˜R(Z) = ˆY(Z) - ˆβ_obs · ϕ(e(Z))。由于 ˆβ_obs 是 β_0 的一致估计,在零假设下,ˆ˜R(Z) 应该近似等于 c,与 Z 无关。因此,任何基于 Z 和 ˆ˜R(Z) 的检验统计量(如本文提出的图形相关性 T_GC)的分布,都可以通过随机化 Z 来生成,从而得到一个近似的随机化检验。

这个最小内核要解决的数学困难:我们无法直接观测到真实的残差 ˜R(Z),因为我们需要知道 Y(Z)。本文的关键想法是,通过证明 OLS 系数在零假设下的“设计不变性”,我们可以用观测数据估计出的系数 ˆβ_obs 来近似地插补所有反事实的残差,从而绕开了直接观测反事实的难题。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在存在网络干扰的随机实验中,如何检验研究者选择的暴露映射(exposure mapping)是否被正确指定。
  2. 核心工具 / 方法:提出了一个基于设计(design-based)的模型设定检验框架,核心是构造一个近似随机化检验(approximate randomization test)。该检验利用 OLS 估计量在零假设下的渐近不变性来插补反事实残差,并使用一个基于网络的图形相关性(Graphical Correlation)统计量 T_GC。
  3. 主要结论:理论上证明了该检验的渐近有效性(asymptotic validity),即在零假设下,当样本量趋于无穷时,第一类错误率能被控制在名义水平。通过大量模拟展示了其在检测遗漏溢出效应和函数形式误设时的良好功效,并在一个实地实验数据上进行了应用。

关键设定与假设

  • 设定:设计基础框架,总体固定,唯一随机性来自处理分配。伯努利随机化实验(Assumption 1)。
  • 假设:
    • Assumption 2 (Bounded outcomes and exposures):潜在结果和暴露映射有界。这是为了应用大数定律和集中不等式。
    • Assumption 3 (Bounded degree of graph):网络的最大度 Δ(G) 有界(≤ κ)。这个假设非常强,它限制了依赖关系的范围,是证明 OLS 系数一致性的关键。它意味着网络是稀疏的。作者在模拟中使用了小世界网络(度固定)和随机块模型(度随样本量增长),并观察到后者在样本量增大时功效下降,这被归因于违反了此假设。
    • Assumption 4 (Positive definiteness):设计矩阵 E[ [1, ϕ(e)][1, ϕ(e)]^T ] 的特征值一致有正下界。这是 OLS 估计量可识别和一致性的标准条件。
    • Assumption 5 (Bounded discrepancy variation):条件均值函数 E[˜Y_i | e_i] 与线性基模型 β_0 · ϕ(e_i) 之间的最大均方误差有界(≤ s^2)。这个假设量化了线性模型近似的误差,是处理“模型误设”的关键。s 被用作一个敏感性参数(sensitivity parameter)。
    • 零假设 H_0 (Hypothesis 4):修正残差 ˜R_i(Z) 在处理分配 Z 下是不变的。这是检验的核心。

主要结果

  • Theorem 1 (Oracle 检验的有效性):如果真实的残差 ˜R_obs 已知,那么基于此的随机化检验(Procedure 2)在有限样本下是精确有效的(E[I(pval ≤ α) | H_0] ≤ α)。这是一个理想化的基准。
  • Theorem 2 (近似检验的渐近有效性):这是本文的核心理论结果。它证明了当使用 OLS 估计的残差 ˆ˜R 时,Procedure 3 是渐近有效的。具体来说,存在一个依赖于敏感性参数 s 的修正因子 C',使得对于任意小的 ϵ > 0,有: lim_{ϵ→0} lim sup_{N→∞} E[ I(ˆpval_ϵ ≤ α) | H_0 ] ≤ α 其中 ˆpval_ϵ 是一个经过 ϵ 和 C's 修正的 p 值。
    • 直觉:这个定理表明,即使线性模型是近似的(s > 0),只要样本量足够大,检验的第一类错误率也能被控制在一个略高于名义水平 α 的水平上。C's 项量化了模型近似误差对检验有效性的影响。
    • 解决的技术难点:证明的关键在于处理“估计的残差”与“真实残差”之间的差异。作者通过证明 OLS 系数 ˆβ 的一致性(Lemma 3),以及检验统计量 T 的 Lipschitz 性质(Proposition 1),将估计误差的影响控制住,从而证明了近似随机化检验的分布与 Oracle 检验的分布是渐近接近的。
  • Proposition 1 (检验统计量的 Lipschitz 性质):证明了提出的图形相关性统计量 T_GC^{(k)} 是残差 ˜r 的 Lipschitz 函数,Lipschitz 常数为 C/√N。这个性质是 Theorem 2 证明中控制估计误差的关键。

证明路线与技术技巧

  • 整体路线:
    1. 建立 Oracle 基准:首先证明如果真实残差已知,随机化检验是精确有效的(Theorem 1)。
    2. 证明 OLS 系数的一致性:在零假设下,证明 OLS 系数 ˆβ_obs 收敛到同一个常数 β_0,无论处理分配如何(Lemma 3)。这是整个近似方法的基础。
    3. 控制估计误差:证明基于 ˆβ_obs 估计的残差 ˆ˜R 与真实残差 ˜R 之间的差异在概率上收敛到 0。
    4. 利用 Lipschitz 性质:由于检验统计量 T 是 Lipschitz 的,T(Z, ˆ˜R) 与 T(Z, ˜R) 之间的差异可以被 ||ˆ˜R - ˜R|| 控制。
    5. 渐近有效性证明:通过一系列概率不等式(如 Markov 不等式),将基于估计残差的检验的 p 值与基于 Oracle 残差的检验的 p 值联系起来,最终证明前者在渐近意义下控制第一类错误(Theorem 2)。
  • 关键跳跃点:
    • 从 Oracle 到近似:最关键的跳跃在于,如何证明用 ˆβ_obs 插补的反事实残差 ˆ˜R(Z) 与真实的反事实残差 ˜R(Z) 足够接近。这依赖于 Lemma 3 和 Assumption 5。
    • 处理模型误设:Assumption 5 允许线性模型是近似的。证明中需要处理这个近似误差 δ。作者通过引入一个修正因子 C's 来吸收这个误差,并证明只要这个误差有界,检验的渐近有效性仍然成立(尽管需要放宽第一类错误控制)。
  • 技术技巧点名:
    • Janson [2004] 的集中不等式:用于证明 Lemma 2 和 Lemma 3 中,在依赖图(dependency graph)下的样本均值和 OLS 系数的一致性。这是处理网络依赖数据的关键工具。
    • Lipschitz 函数性质:用于将残差的估计误差转化为检验统计量的误差,从而建立近似分布与真实分布的联系。
    • 概率不等式(Markov 不等式):用于证明 Theorem 2 中,P_Z(|Δˆr - Δˆr_obs| ≥ ϵ) 项收敛到 0。
    • Weyl 不等式:用于在 Lemma 3 的证明中,通过样本协方差矩阵与总体协方差矩阵的差异来 bound 其最小特征值。

真实例子与应用

  • 数据:来自 Paluck et al. [2016] 的关于美国中学生反冲突规范的实地实验数据。
  • 场景:研究同伴影响如何促进反欺凌行为。实验在 56 所学校中进行,其中 28 所被随机分配接受干预。在干预学校中,约 10% 的“社交参照者”(social referents)被随机邀请参加反冲突会议。
  • 方法应用:作者将分析聚焦于干预学校中的社交参照者(样本量 850)。他们检验了 Aronow and Samii [2017] 在重新分析该数据时使用的暴露映射 e_i = (Z_i, I(∑_{j∈N(i)} Z_j > 0)) 是否被正确指定。他们使用 Procedure 3 和 T_GC^{(1)} 统计量,通过 2000 次随机化生成零分布。
  • 结果:得到的 p 值为 0.317,因此无法拒绝该暴露映射被正确指定的零假设。作者还报告了其他暴露映射的 p 值(如 e_i = (Z_i) 的 p 值为 0.055,接近显著)。
  • 这个例子想说明什么:展示了该方法在实际数据分析中的可用性,并说明对于这个特定的数据集和暴露映射,没有证据表明存在模型误设。这验证了 Aronow and Samii [2017] 的分析选择。

🔎 结论是否比证明窄

是的,存在明显的“窄证明、宽声称”的情况。 1. 理论结果窄于方法声称:Theorem 2 只证明了渐近有效性(控制第一类错误),没有证明一致性(功效趋于 1)。作者在摘要和引言中声称“建立了有利的功效性质”,但这完全依赖于模拟研究,而非理论证明。这与 Gao et al. [2026] 形成了对比,后者在受限模型下证明了检验的一致性。作者在结论中也承认“研究理论功效性质是一个重要的理论方向”。 2. 假设的强度:Assumption 3(有界度)是一个非常强的假设,它排除了许多现实世界中存在的密集网络(如社交网络中的“超级连接者”)。作者在模拟中观察到,当使用随机块模型(其平均度随样本量增长)时,检验功效下降,这直接指向了该假设的局限性。然而,在理论部分,作者并没有讨论当此假设被违反时,检验的性质会如何变化。 3. 线性模型假设:整个理论建立在 Assumption 5(线性基模型近似)之上。虽然作者将其作为敏感性参数来处理,但方法的核心是 OLS 回归。作者在结论中承认“研究如何选择基模型是一个重要的扩展”,这表明当前的理论框架对模型形式有较强的依赖性。

四、开放问题

  1. 理论功效分析:本文只证明了渐近有效性,未证明一致性。Gao et al. [2026] 的不可能性结果暗示,在一般模型类下,可能无法构造一致的检验。一个开放问题是:在本文的假设(如有界度网络)下,能否证明所提检验的一致性?或者,是否存在一个理论上的功效上界?(扎根于:Section 7 "Another interesting theoretical direction is to examine theoretical power properties of the procedure" 以及 Gao et al. [2026] 的 impossibility result。)

  2. 密集网络下的方法改进:本文的模拟显示,当网络平均度随样本量增长(如随机块模型)时,检验功效下降。这违反了 Assumption 3(有界度)。一个开放问题是:如何修改检验统计量或证明策略,使其在密集网络下仍然有效?(扎根于:Section 7 "Our procedure’s performance drops in dense graph settings, creating a methodological gap to improve upon.")

  3. 基模型的选择与校准:本文的理论依赖于 Assumption 5 中的线性基模型,并将 s 作为敏感性参数。一个开放问题是:如何从数据中自适应地选择基函数 ϕ(·)?如何更好地校准敏感性参数 s,以便在拒绝零假设时,能区分是由暴露映射误设还是由线性模型近似误差导致的?(扎根于:Section 7 "It will be an important extension to study, principally, how to choose the basis model and better calibrate the sensitivity parameter.")

  4. 扩展到观察性研究:本文的方法完全依赖于随机化实验的设计。一个开放问题是:如何将类似的模型设定检验思想扩展到观察性研究,其中处理分配机制是未知的,需要依赖未观测混杂的假设?(扎根于:Section 7 "Although this work focuses on interference settings, it would be interesting to investigate the proposed model-testing framework in other settings, including ... observational studies.")


Maintained by 陈星宇 · Homepage · Source on GitHub

评论