Randomization tests for model specification in causal inference under network interference¶
作者: Supriya Tiwari, Pallavi Basu
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.22890
一、领域脉络与小综述¶
这个方向是什么¶
本子方向的核心问题是:在存在网络干扰(network interference)的随机实验中,如何检验研究者所选择的“暴露映射”(exposure mapping)是否被正确指定?暴露映射是将每个单元的高维干扰模式(即所有其他单元的处理状态)降维为一个低维的“暴露变量”的函数,是定义和估计溢出效应(spillover effects)的常用工具。当前主流方法几乎都假设暴露映射是正确指定的,但这一假设通常由分析者主观选择,缺乏实证验证。本文试图填补这一空白:提出一个基于设计(design-based)的随机化检验框架,用于检验暴露映射是否被正确指定。
发展脉络(history)¶
-
奠基工作:暴露映射的提出与形式化
- Hong and Raudenbush (2006) 和 Manski (2013) 首次提出“暴露映射”的概念,将其作为处理高维干扰的降维工具。
- Aronow and Samii (2017) 将其形式化,并证明了在正确指定的暴露映射下,Horvitz-Thompson 等估计量的无偏性。这是该领域的标准参考框架。
-
主要进展:对误设的鲁棒性与边际化估计量
- Sävje (2024) 对暴露映射的误设进行了系统分析,发现标准估计量对某些“受控的”误设形式是鲁棒的。该文还区分了暴露映射的两种角色:定义溢出估计量(spillover estimand)和编码因果机制(causal mechanism)。作者指出,误设主要影响后者。
- Sävje et al. (2021)、Hu et al. (2022)、Wang et al. (2020) 等提出了“边际化估计量”(marginalized estimands)框架,该框架不依赖显式的暴露映射,对多种形式的干扰具有鲁棒性。但本文作者指出,其代价是无法获得关于溢出机制的具体洞见。
-
当前 Frontier:对暴露映射的实证检验
- Gao et al. (2026)(本文引用的“concurrent work”)是当前最直接相关的竞争工作。它提出了一个“不可能性结果”:在不限制潜在结果函数模型空间的情况下,不可能构造出有信息的随机化检验来检验暴露映射的正确性。随后,他们将备择模型空间限制在线性均值模型(linear-in-means model)内,并证明了其检验的一致性。本文作者明确指出了与 Gao et al. (2026) 的关键区别:本文处理的是“更广泛的潜在结果模型函数类”,并通过数值研究展示检验功效,而非理论上的功效分析。
- Hoshino and Yanagi (2026) 考虑了暴露映射与一个更精细的备择暴露映射之间的层次关系,以此构建检验。本文作者指出,该框架需要预先指定一个更精细的备择暴露映射,而本文的框架则不需要。
- 本文的位置:本文试图在 Gao et al. (2026) 的“不可能性”结果和 Hoshino and Yanagi (2026) 的“需指定备择”框架之间,开辟一条新路径。它不依赖对备择模型空间的强假设,而是通过证明 OLS 系数在正确指定下的渐近不变性,构建一个“近似”随机化检验,并证明其渐近有效性。
子线索聚类¶
- 暴露映射的识别与估计:Aronow and Samii (2017), Sävje (2024), Leung (2022)。这一簇关注在给定暴露映射下,如何定义和估计因果效应,以及误设对估计量的影响。
- 边际化估计量:Sävje et al. (2021), Hu et al. (2022), Wang et al. (2020)。这一簇试图绕过暴露映射的指定,通过边际化处理来定义鲁棒的溢出效应。
- 网络干扰下的随机化检验:Athey et al. (2018), Basse et al. (2019), Puelz et al. (2022), Zhang and Zhao (2025), Zhong (2024), Tiwari and Basu (2024)。这一簇主要关注检验“是否存在干扰”,而非检验干扰的“具体机制”。本文属于这一簇,但目标是检验机制。
- 模型设定检验:Gao et al. (2026), Hoshino and Yanagi (2026)。这一簇直接针对暴露映射的模型设定进行检验,是本文最直接的竞争领域。
这个方向在追问的核心问题¶
- 如何在不依赖强备择假设的情况下,检验暴露映射的正确性? 这是本文试图回答的核心问题。Gao et al. (2026) 的“不可能性”结果表明,这需要某种形式的限制。
- 检验的功效如何? 即,当暴露映射被误设时,检验能以多大概率检测出来。本文主要通过模拟研究来展示,而 Gao et al. (2026) 则提供了理论上的功效分析。
- 检验对条件均值函数(conditional mean response function)的误设是否鲁棒? 本文的检验依赖于对条件均值函数的线性近似。当这个近似不准确时,检验的 Type I error 是否会膨胀?本文通过引入一个“敏感性参数”(sensitivity parameter)来处理这个问题。
- 如何处理多重检验? 当研究者有多个候选暴露映射时,如何控制 Family-wise Error Rate (FWER)?本文在附录中讨论了嵌套假设下的序贯检验。
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口 frame 为“现有方法假设暴露映射是正确指定的,但缺乏实证检验工具”。他们将自己的工作定位为“第一个”系统性地解决这个问题的数据驱动方法。他们通过强调 Gao et al. (2026) 的“不可能性”结果和 Hoshino and Yanagi (2026) 的“需指定备择”框架,来凸显自己方法的“更广泛适用性”和“无需备择”的优势。
- 被淡化或回避的竞争路线:作者淡化了 Gao et al. (2026) 的理论贡献(一致性证明),并回避了与该方法在理论功效上的直接比较。他们仅通过模拟来展示自己的功效,而没有与 Gao et al. (2026) 的方法进行对比。此外,对于边际化估计量(Sävje et al., 2021 等),作者仅指出其“无法获得机制洞见”的缺点,但没有深入讨论其与本文方法在应用场景上的互补性。
- 值得研究者去查的问题:Gao et al. (2026) 的具体“不可能性”结果是什么?它的假设和本文的假设(如 Assumption 3 有界度)之间是否存在重叠或冲突? 如果本文的 Assumption 3(有界度)成立,是否就能绕过 Gao et al. (2026) 的“不可能性”结果?这是一个值得深挖的张力点。另外,Hoshino and Yanagi (2026) 的“层次关系”框架与本文的“嵌套假设”框架(Appendix B.1)之间有何异同? 两者都涉及多重检验,但一个需要指定备择,一个不需要。
张力¶
- 未见明显对立引用。但存在一个潜在的张力:Gao et al. (2026) 的“不可能性”结果暗示,在没有限制的模型空间下,任何检验都是无信息的。本文通过 Assumption 3(有界度)和 Assumption 5(有界近似误差)对模型空间施加了限制,从而绕过了这个不可能性。这个张力是本文理论贡献的核心,值得研究者仔细评估:这些限制是否合理?是否足够弱以至于能覆盖大多数实际应用?
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
N: 总体中的单元数。i, j ∈ [N]: 单元索引。Z ∈ {0, 1}^N: 处理分配向量。Z_i = 1表示单元i被处理。Y_i(Z): 单元i在全局处理向量Z下的潜在结果。G ∈ {0, 1}^{N×N}: 邻接矩阵,G_{ij}=1表示i和j相连。N_i: 单元i的邻居集合。e_i(Z) ∈ ℝ^{k+1}: 单元i的暴露映射,是Z的低维函数。例如,e_i = (Z_i, proportion of treated neighbors)。R_i(Z) = Y_i(Z) - E_Z[Y_i(Z) | e_i(Z)]: 有限样本残差。在正确指定下,R_i(Z) = 0。\tilde{R}_i(Z): 修正后的残差,包含了基线固定效应c_i。在正确指定下,\tilde{R}_i(Z) = c_i(与Z无关)。ϕ(e_i) ∈ ℝ^d: 暴露映射e_i的一个基函数变换,用于线性模型。\bar{β} = [β_c, β]: 线性模型的系数,β_c是截距,β是d维斜率。\hat{β}^{obs}: 基于观测数据(Z^{obs}, Y^{obs})的 OLS 估计量。β_0: 总体 OLS 最小化器。T_{GC}^{(k)}: 基于图距离k的“图形相关性”检验统计量。
-
模型:
- 设计:这是一个基于设计(design-based) 的框架。所有随机性仅来自处理分配机制
P(Z),而潜在结果{Y_i(z)}、网络G和协变量X被视为固定。 - 处理分配:
P(Z)是已知的,由实验者控制。本文主要考虑 Bernoulli 随机化:Z_i ~ i.i.d. Bernoulli(p)。 - 潜在结果模型:没有对
Y_i(Z)的全局形式做假设,但假设存在一个暴露映射e_i(Z),使得Y_i(Z)的条件均值E[Y_i(Z) | e_i(Z)]能够被一个线性基函数模型\bar{β}·[1, ϕ(e_i)]很好地近似(Assumption 5)。 - 网络:
G是固定的、简单的、无向图。假设最大度Δ(G) ≤ κ(Assumption 3)。
- 设计:这是一个基于设计(design-based) 的框架。所有随机性仅来自处理分配机制
-
可观测数据:
- 研究者观测到的是一个处理分配向量
Z^{obs}及其对应的潜在结果Y^{obs} = Y(Z^{obs})。 - 对于其他所有
Z ≠ Z^{obs},对应的Y(Z)是不可观测的(反事实)。 - 网络
G和协变量X(如果有)是已知的。 - 关键点:残差
\tilde{R}_i(Z)是不可观测的,因为它依赖于E[Y_i(Z) | e_i(Z)]。本文的核心挑战就是如何用可观测数据来估计这个残差,并构建一个有效的检验。
- 研究者观测到的是一个处理分配向量
第二步:讲最小内核¶
最简特例:考虑一个最简单的网络干扰场景:一个星形图,中心单元 i=1,外围单元 i=2,...,N。假设只有中心单元的处理状态会影响外围单元,但外围单元之间无干扰。暴露映射为 e_i(Z) = (Z_i, Z_1),即每个单元的结果只取决于自己的处理和中心单元的处理。
- 可观测数据:我们观测到一次实验的结果
(Z^{obs}, Y^{obs})。 - 核心思路:如果暴露映射
e_i = (Z_i, Z_1)是正确指定的,那么对于外围单元i,其潜在结果Y_i(Z)只取决于(Z_i, Z_1)。这意味着,如果我们固定Z_i和Z_1,Y_i就是一个常数。因此,残差\tilde{R}_i(Z)应该与Z无关。例如,对于外围单元i,\tilde{R}_i(Z) = c_i(一个常数)。 - 检验逻辑:如果暴露映射是误设的(例如,真实机制还依赖于
Z_2,但我们的e_i没有包含它),那么残差\tilde{R}_i(Z)就会随Z_2的变化而变化,从而与Z相关。检验统计量T_{GC}^{(1)}正是用来捕捉这种残差与邻居处理状态之间的相关性。 - 为什么难:我们无法直接观测到
\tilde{R}_i(Z)。我们只能观测到\tilde{R}_i(Z^{obs})。为了进行随机化检验,我们需要知道对于所有可能的Z,\tilde{R}_i(Z)的值。本文的关键想法是:在正确指定的暴露映射下,OLS 系数\hat{β}会收敛到一个常数β_0,这个常数与具体的Z无关。因此,我们可以用\hat{β}^{obs}来“近似”所有反事实下的\tilde{R}_i(Z),即\hat{\tilde{R}}_i(Z) = Y_i(Z) - \hat{β}^{obs}·ϕ(e_i(Z))。然后,我们就可以像 Fisher 随机化检验一样,通过随机重排Z来生成检验统计量的零分布。
一句话总结:这篇论文在数学上干了一件什么事?它证明了,在暴露映射正确指定的零假设下,基于 OLS 的残差估计量 \hat{\tilde{R}}_i(Z) 在渐近意义下与处理向量 Z 无关,从而可以用它来构造一个渐近有效的随机化检验,以检验暴露映射是否被正确指定。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在存在网络干扰的随机实验中,如何检验研究者选择的暴露映射(exposure mapping)是否被正确指定。
- 核心工具/方法:提出了一个基于设计(design-based)的随机化检验框架。该框架利用 OLS 估计残差,并证明在零假设下 OLS 系数收敛于一个与处理分配无关的常数,从而可以像 Fisher 随机化检验一样,通过重排处理分配来生成检验统计量的零分布。
- 主要结论:证明了该检验的渐近有效性(Theorem 2),并通过模拟研究展示了其在检测暴露映射误设(包括遗漏溢出效应和函数形式误设)方面的良好功效。在 Paluck et al. (2016) 的实地实验数据上进行了应用。
关键设定与假设¶
- Assumption 1 (Randomized experiment):处理分配机制
P(Z)是已知的,且Z与潜在结果独立。本文主要考虑 Bernoulli 随机化。 - Assumption 2 (Bounded outcomes and exposures):潜在结果和暴露映射是有界的。这是一个标准的技术性假设,用于控制矩。
- Assumption 3 (Bounded degree of graph):网络的最大度
Δ(G) ≤ κ。这个假设至关重要,它限制了依赖结构的复杂性,使得大数定律(如 Janson (2004) 的定理)可以应用。相比已有文献,这个假设比一些要求网络是稀疏的假设更强,但比要求网络是独立的假设更弱。 - Assumption 4 (Positive definiteness):设计矩阵
E[ [1, ϕ(e)][1, ϕ(e)]^T ]是正定的,且最小特征值一致有界。这是 OLS 可识别性的标准条件。 - Assumption 5 (Bounded discrepancy variation):条件均值函数
E[\tilde{Y}_i | e_i]与线性模型β_0·ϕ(e_i)之间的均方误差有界于s^2。这个假设是本文理论的核心,它量化了线性模型近似的误差。s被用作一个“敏感性参数”(sensitivity parameter),当s > 0时,检验的 Type I error 会有一个修正项。
主要结果¶
- Theorem 1 (Oracle 检验的有效性):如果真实的残差
\tilde{R}^{obs}是已知的,那么基于此的随机化检验(Procedure 2)在有限样本下是精确有效的(Type I error ≤ α)。这是一个经典结果,作为后续工作的基准。 - Theorem 2 (估计残差检验的渐近有效性):这是本文的核心理论结果。它证明,在 Assumptions 1-5 下,基于 OLS 估计残差的随机化检验(Procedure 3)是渐近有效的。具体来说,对于任意小的 Type I error 膨胀,存在一个
ϵ使得当样本量足够大时,修正后的 p-value\hat{pval}_ϵ能控制 Type I error 在α水平。这个修正项C's正是由 Assumption 5 中的模型近似误差s驱动的。- 直觉:由于 OLS 系数
\hat{β}^{obs}收敛到β_0,用\hat{β}^{obs}估计的残差\hat{\tilde{R}}会收敛到真实残差\tilde{R}(加上一个由s决定的误差)。因此,基于\hat{\tilde{R}}的检验会“近似”于基于\tilde{R}的精确检验,其误差由s控制。 - 解决的技术难点:如何证明 OLS 系数在基于设计的框架下、在存在网络依赖的情况下收敛到常数。作者使用了 Janson (2004) 关于部分依赖随机变量的大偏差定理,并利用 Assumption 3(有界度)来界定依赖图的色数。
- 直觉:由于 OLS 系数
- Proposition 1 (检验统计量的 Lipschitz 性质):证明了提出的图形相关性检验统计量
T_{GC}^{(k)}是 Lipschitz 的,这是 Theorem 2 成立的一个关键条件。
证明路线与技术技巧¶
-
整体路线:
- Oracle 基准:首先证明如果真实残差已知,随机化检验是精确有效的(Theorem 1)。
- 估计残差:用 OLS 从观测数据中估计残差
\hat{\tilde{R}}^{obs}。 - 系数收敛性:证明在零假设下,OLS 系数
\hat{β}^{obs}收敛到总体最小化器β_0(Lemma 3)。这是整个论证的基石。证明依赖于:a) 样本 MSE 损失函数收敛到总体 MSE(Lemma 2,使用 Janson (2004) 的大偏差定理);b) 设计矩阵的最小特征值一致有界(Assumption 4)。 - 残差收敛性:由系数收敛性,可以推出
\hat{\tilde{R}}^{obs}收敛到\tilde{R}^{obs}(加上一个由s决定的误差)。 - 检验统计量的 Lipschitz 性质:证明检验统计量
T对残差是 Lipschitz 的(Proposition 1)。这意味着残差的微小变化只会导致检验统计量的微小变化。 - 渐近有效性:结合以上步骤,证明基于
\hat{\tilde{R}}的检验统计量的分布,与基于\tilde{R}的检验统计量的分布,在渐近意义下相差不超过一个由s决定的量。从而得到 Theorem 2。
-
关键跳跃点:
- 从系数收敛到检验有效性:这是最吃功夫的地方。即使
\hat{β}^{obs} → β_0,也不能直接推出检验有效,因为检验需要的是所有反事实下的残差估计。作者巧妙地利用了 Lipschitz 性质和系数收敛性,将问题转化为比较两个随机变量T(Z, \hat{\tilde{r}})和T(Z, \tilde{r})的分布,并证明它们的差异在概率上收敛到 0。 - 处理模型近似误差
s:当s > 0时,\hat{β}^{obs}不会收敛到真实的β_0(因为线性模型是误设的),而是收敛到某个“最佳线性近似”β_0。这导致残差估计有一个系统性偏差。作者通过引入一个修正项C's来处理这个偏差,并证明修正后的 p-value 能控制 Type I error。这个修正项的大小可以通过一个“敏感性分析”来探索。
- 从系数收敛到检验有效性:这是最吃功夫的地方。即使
-
技术技巧点名:
- Janson (2004) 的大偏差定理:用于证明在存在网络依赖(有界度)的情况下,样本均值(如 MSE 损失、设计矩阵)收敛到总体均值。
- 依赖图(dependency graph)与色数(chromatic number):用于界定 Janson 定理中的常数,从而得到指数级收敛速度。
- Weyl 不等式:用于证明样本设计矩阵的最小特征值以高概率远离零。
- 概率积分变换(Probability integral transform):用于证明 Theorem 1 中 p-value 的均匀性。
- Lipschitz 函数的性质:用于将残差的收敛性转化为检验统计量分布的收敛性。
真实例子与应用¶
- 数据:Paluck et al. (2016) 关于美国中学生反冲突规范的实地实验数据。该实验在 56 所学校中进行,旨在研究同伴影响如何促进反欺凌行为。
- 方法应用:
- 作者将分析聚焦于处理学校中的“社会参照者”(social referents),样本量为 850。
- 他们检验的暴露映射是
e_i = (Z_i, I(∑_{j∈N(i)} Z_j > 0)),即“自己是否被处理”和“是否有至少一个被处理的朋友”。这个映射在 Aronow and Samii (2017) 对该数据的再分析中被使用。 - 他们使用 Procedure 3 和检验统计量
T_{GC}^{(1)},通过 2000 次随机重排生成零分布。
- 结果:得到的 p-value 为 0.317,无法拒绝零假设。这意味着,基于该数据,没有证据表明暴露映射
e_i = (Z_i, I(∑_{j∈N(i)} Z_j > 0))被误设。作者还报告了其他两个检验的 p-value:e_i = (Z_i)的 p-value 为 0.055(接近显著),e_i结合T_{GC}^{(2)}的 p-value 为 0.799。 - 这个例子想说明什么:这个例子旨在验证本文提出的方法在真实数据上的可操作性,并展示其如何为研究者提供关于暴露映射选择是否合理的实证证据。它表明,在 Paluck et al. (2016) 的数据中,常用的暴露映射是合理的。
🔎 结论是否比证明窄¶
- 是的。Theorem 2 的渐近有效性依赖于一个修正的 p-value
\hat{pval}_ϵ,而不是直接使用\hat{pval}。作者在模拟中(Table 2)直接使用了未修正的\hat{pval},并发现 Type I error 控制得很好。这表明在模拟设定的条件下,修正项可能很小或可以忽略。但理论保证是针对修正后的 p-value 的。作者在文中也承认了这一点,并建议通过敏感性分析来探索修正项的影响。 - 另一个窄化:Theorem 2 的证明依赖于 Assumption 3(有界度)。在模拟中,当使用 Stochastic Block Model (SBM) 且样本量增大导致平均度增加时,检验功效出现了下降。作者将此归因于对 Assumption 3 的违反。这表明,该理论结果在稠密图下可能不成立,这是一个重要的局限性。
- 结论的泛化:作者在结论部分提到“虽然本文关注干扰场景,但研究提出的模型检验框架在其他场景(包括随机实验和观察性研究)中也会很有趣”。这是一个泛化的 claim,但本文的理论和模拟都只针对随机实验下的网络干扰场景。将其推广到观察性研究需要额外的识别假设(如无混杂性),这并非本文所证明的。
四、开放问题¶
-
理论功效分析:本文主要通过模拟展示功效,但缺乏像 Gao et al. (2026) 那样的理论功效分析(consistency)。扎根点:Section 7 提到“It will be an interesting extension to study, principally, how to choose the basis model and better calibrate the sensitivity parameter. Another interesting theoretical direction is to examine theoretical power properties of the procedure”。这是一个明确的开放问题。
-
稠密图下的方法:模拟显示,当网络变稠密(违反 Assumption 3)时,检验功效下降。扎根点:Section 5.2 讨论 SBM 结果时指出“an increase in density reduces variability within the population, potentially leading to lower power, and also violates Assumption 3”。Section 7 也提到“Our procedure’s performance drops in dense graph settings, creating a methodological gap to improve upon”。这是一个具体的、由模拟结果驱动的开放问题。
-
与 Gao et al. (2026) 的“不可能性”结果的调和:本文的 Assumption 3(有界度)和 Assumption 5(有界近似误差)是否足以绕过 Gao et al. (2026) 的“不可能性”结果?如果可以,那么这两个假设的“代价”是什么?扎根点:Section 1 引用了 Gao et al. (2026) 的“impossibility result”,但并未在理论部分与之进行深入比较。这是一个值得研究者去深挖的张力点。
-
多重检验的 FWER 控制:本文在 Appendix B.1 中讨论了嵌套假设下的序贯检验,但未讨论更一般的多重检验场景(如非嵌套的多个候选暴露映射)。扎根点:Section 2.2 提出了 Hypothesis 2(多个暴露映射),但正文并未给出一个通用的 FWER 控制程序。Appendix B.1 的序贯检验只适用于嵌套结构。这是一个明显的缺口。
Maintained by 陈星宇 · Homepage · Source on GitHub