Randomization tests for model specification in causal inference under network interference¶
作者: Supriya Tiwari, Pallavi Basu
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.22890
一、领域脉络与小综述¶
这个方向是什么¶
本子方向研究的是网络干扰下因果推断中的模型设定检验。当实验单元通过一个已知网络相互连接时,一个单元的处理状态会影响其他单元的潜在结果(即干扰/spillover)。为了识别和估计 spillover 效应,常用工具是暴露映射(exposure mapping)——将高维的处理向量降维为低维的“累积处理”表示。但暴露映射由分析者指定,若指定错误(即未捕捉真实的干扰机制),则 Horvitz-Thompson 等估计量会产生偏倚。因此,需要一种数据驱动的方法来检验暴露映射是否被正确指定。该方向当前成熟度较低:已有工作主要研究误设对估计量的影响(偏倚分析),但缺乏系统性的检验方法。本文是首批提出正式假设检验框架的工作之一。
发展脉络(history)¶
- 奠基工作:Hong and Raudenbush [2006] 提出暴露映射概念;Manski [2013] 和 Aronow and Samii [2017] 将其形式化,用于定义和估计 spillover 效应。这些工作假设暴露映射是正确指定的,未考虑检验问题。
- 误设影响分析:Leung [2022] 和 Sävje [2024] 研究了暴露映射误设对标准估计量的影响,发现在受控的误设形式下估计量具有稳健性。Sävje [2024] 进一步区分了暴露映射的两种角色:定义 spillover estimand 和编码因果机制,指出误设主要影响后者。
- 边际化 estimand 路线:Sävje et al. [2021]、Hu et al. [2022]、Wang et al. [2020] 提出使用边际化 estimand 来避免暴露映射的显式使用,从而对干扰形式更稳健,但代价是无法获得干扰机制的洞察。
- 随机化检验用于干扰:Athey et al. [2018]、Basse et al. [2019]、Puelz et al. [2022]、Zhang and Zhao [2025]、Zhong [2024]、Tiwari and Basu [2024] 等发展了随机化检验来检验是否存在干扰(而非检验干扰机制的具体形式)。Pouget-Abadie et al. [2019] 使用分层实验设计检验干扰。
- 本文位置:本文是首个(与 Gao et al. [2026] 同时)提出暴露映射模型设定检验的随机化检验框架。Gao et al. [2026] 证明了在没有限制潜在结果函数空间时不可能构造有信息的检验,并在线性-in-means 模型下给出了一致性检验。本文则工作在更广泛的潜在结果函数类上,通过数值研究展示功效。
子线索聚类¶
- 暴露映射的定义与估计(Hong and Raudenbush 2006; Manski 2013; Aronow and Samii 2017; Sävje 2024):聚焦于如何用暴露映射降维、定义 estimand、估计 spillover 效应,假设映射正确。
- 误设的稳健性分析(Leung 2022; Sävje 2024):研究暴露映射误设对估计量的影响,发现某些误设下估计量仍一致。
- 边际化 estimand 路线(Sävje et al. 2021; Hu et al. 2022; Wang et al. 2020):避免显式暴露映射,通过边际化定义 spillover 效应,稳健但无机制洞察。
- 随机化检验用于干扰(Athey et al. 2018; Basse et al. 2019; Puelz et al. 2022; Zhang and Zhao 2025; Zhong 2024; Pouget-Abadie et al. 2019):检验是否存在干扰,而非检验干扰机制的具体形式。
- 暴露映射模型设定检验(本文; Gao et al. 2026; Hoshino and Yanagi 2026):最新子线索,直接检验暴露映射是否被正确指定。Hoshino and Yanagi [2026] 要求指定一个更细的替代暴露映射。
核心问题与已知瓶颈¶
- 核心问题:给定一个暴露映射 \(e\),如何检验它是否捕捉了所有相关的干扰信息(即 \(Y_i(Z) = \mathbb{E}[Y_i(Z) \mid e_i(Z)]\) 对所有 \(Z\) 成立)?
- 已知瓶颈:
- 潜在结果函数空间太大,无限制时不可能构造有信息的检验(Gao et al. 2026 的不可行性结果)。
- 残差不可观测,只能估计,导致检验的渐近有效性需要额外假设。
- 网络密度增大时,检验功效可能下降(本文模拟发现)。
- 多重检验时 FWER 控制需要嵌套结构或调整。
⚠️ 作者的 framing(必须明确标注为“作者的说法”)¶
作者将缺口 frame 为:“虽然已有工作研究了暴露映射误设对估计量的影响,但缺乏数据驱动的方法来检验暴露映射是否被正确指定”(引言第2段:“there has been relatively little methodological progress in empirically investigating appropriate exposure mappings”)。作者将本文定位为“developing a data-driven method to test if the exposure mapping is correctly specified”,并强调其框架不要求指定替代暴露映射(与 Hoshino and Yanagi [2026] 对比)。作者淡化了 Gao et al. [2026] 的不可行性结果,称其“在限制替代模型空间为线性-in-means 模型下给出了一致性检验”,而本文“工作在更广泛的潜在结果函数类上,通过数值研究展示功效”。值得研究者去查的问题:Gao et al. [2026] 的不可行性结果是否适用于本文的设定(如网络度有界、潜在结果有界)?作者在结论中提及“it is an interesting extension to see if the impossibility result also holds if the alternative model space is restricted to a subclass, for instance, potential outcomes with a bounded degree of the network as considered in this work”。此外,作者未引用任何关于高维回归或稀疏模型选择的文献(如 Lasso 用于选择暴露映射成分),这可能是另一个被回避的竞争路线。
张力¶
未见明显对立引用。但存在一个潜在张力:Gao et al. [2026] 的不可行性结果暗示,在无限制的替代模型下不可能构造有信息的检验,而本文声称在更广泛的函数类上通过数值研究展示功效。这需要仔细检查本文的假设(如度有界、潜在结果有界、线性基模型)是否实际上限制了替代模型空间,从而绕过了不可行性。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(N\):总体单元数。
- \(G \in \{0,1\}^{N \times N}\):简单无向图邻接矩阵,\(G_{ij}=1\) 表示 \(i\) 与 \(j\) 相连。
- \(\mathcal{N}_i = \{j: G_{ij}=1\}\):\(i\) 的邻居集;\(\bar{\mathcal{N}}_i = \mathcal{N}_i \cup \{i\}\)。
- \(Z \in \{0,1\}^N\):二元处理分配向量,\(Z_i=1\) 表示处理。
- \(Y_i(Z)\):单元 \(i\) 在全局处理向量 \(Z\) 下的潜在结果(固定网络和协变量)。
- \(e_i(Z) \in \mathbb{R}^{k+1}\):暴露映射,是 \(Z\) 的低维函数,通常 \(e_i = (Z_i, f(Z_{\mathcal{N}_i}), \dots)\)。
- \(R_i(Z) = Y_i(Z) - \mathbb{E}_Z[Y_i(Z) \mid e_i(Z)]\):有限样本残差(定义1)。
- \(\tilde{R}_i(Z) = Y_i(Z) - \mathbb{E}[\tilde{Y}_i(Z) \mid e_i(Z)]\):修正残差,其中 \(\tilde{Y}_i(Z) = Y_i(Z) - c_i\),\(c_i\) 为基线固定常数,且 \(\tilde{Y}(\mathbf{0})=0\)(定义2)。
- \(\phi: \mathbb{R}^k \to \mathbb{R}^d\):连续基函数。
- \(\bar{\beta} = (\beta_c, \beta)\):线性基模型系数,\(\beta_c \in \mathbb{R}, \beta \in \mathbb{R}^d\)。
-
\(T_{\text{GC}}^{(k)}\):图相关检验统计量(式13),度量距离 \(k\) 的邻居处理与残差的相关性。
-
模型:
- 设计框架:所有随机性来自处理分配机制 \(P(Z)\),已知且由实验者控制。假设 Bernoulli 实验:\(Z_i \sim \text{i.i.d. Bernoulli}(p)\)(Assumption 1)。
- 潜在结果:无分布假设,仅假设有界(Assumption 2:\(|Y_i(z)| \leq B\))。
- 网络:度有界(Assumption 3:\(\Delta(G) \leq \kappa\))。
- 暴露映射:给定一个候选暴露映射 \(e\),假设条件均值函数 \(\mathbb{E}[Y_i(Z) \mid e_i(Z)]\) 可被线性基模型 \(\bar{\beta} \cdot [1, \phi(e_i)]\) 近似,近似误差有界(Assumption 5:\(\sup_z \frac{1}{N} \sum_i \|\mathbb{E}[\tilde{Y}_i \mid e_i] - \beta_0 \cdot \phi(e_i)\|^2 \leq s^2\))。
-
零假设(Hypothesis 4):\(\tilde{R}_i(Z) = \tilde{R}_i(Z')\) 对所有 \(Z,Z'\) 成立,即残差与处理分配无关。
-
可观测数据:
- 观测到一次实验的结果:\((Z^{\text{obs}}, Y^{\text{obs}})\),其中 \(Z^{\text{obs}} \sim P(Z)\),\(Y^{\text{obs}} = Y(Z^{\text{obs}})\)。
- 网络 \(G\) 和协变量 \(X\)(若有)视为固定。
- 不可观测:其他处理向量下的潜在结果 \(Y(z)\) 以及真实残差 \(R_i(Z)\)。残差只能通过估计条件均值得到。
第二步:最小内核¶
最简特例:考虑一个只有两个单元 \(i=1,2\) 且它们相连(\(G_{12}=1\))的总体。处理分配 \(Z = (Z_1, Z_2)\),Bernoulli 实验 \(P(Z_i=1)=0.5\)。假设潜在结果模型为线性:
检验问题:研究者怀疑 spillover 效应是否存在,即暴露映射是否应包含邻居处理。考虑两个候选暴露映射: - \(e^{(1)}_i = (Z_i)\)(仅自身处理,忽略 spillover) - \(e^{(2)}_i = (Z_i, Z_{\text{neighbor}})\)(包含邻居处理)
零假设 \(H_0\):\(e^{(1)}\) 是正确指定的,即 \(Y_i(Z) = \mathbb{E}[Y_i(Z) \mid Z_i]\) 对所有 \(Z\) 成立。这等价于 \(\tau_s = 0\)。
核心思路:在 \(H_0\) 下,残差 \(\tilde{R}_i(Z) = Y_i(Z) - \mathbb{E}[\tilde{Y}_i(Z) \mid Z_i] = c_i\)(因为 \(\tilde{Y}_i(Z) = \tau_d Z_i + \tau_s Z_{\text{neighbor}}\),但 \(H_0\) 下 \(\tau_s=0\),所以 \(\mathbb{E}[\tilde{Y}_i \mid Z_i] = \tau_d Z_i\),残差为 \(c_i\)),与 \(Z\) 无关。因此,若将观测到的残差(通过线性回归估计)与随机重排的处理向量计算图相关统计量 \(T_{\text{GC}}^{(1)} = \frac{\sum_i \sum_j G_{ij} Z_i \tilde{R}_j}{\|\tilde{R}\| \|Z\|}\),则在 \(H_0\) 下该统计量的分布应近似于将 \(Z\) 随机置换后的分布。若观测到的 \(T_{\text{GC}}^{(1)}\) 落在分布尾部,则拒绝 \(H_0\)。
为什么这个特例抓住了核心:论文的一般设定允许任意网络、任意暴露映射形式、任意基函数,但核心数学困难在于:残差不可观测,只能用 OLS 估计,且估计误差在干扰下如何控制。在两单元特例中,OLS 估计 \(\hat{\tau}_d, \hat{\tau}_s\) 的渐近性质(如收敛到常数)已经体现了 Lemma 3 的思想。检验统计量 \(T_{\text{GC}}^{(1)}\) 的 Lipschitz 性质(Proposition 1)在特例中退化为简单计算。因此,理解这个特例就抓住了论文的“最小内核”。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在网络干扰下,如何检验一个给定的暴露映射是否被正确指定(即是否捕捉了所有相关的干扰信息)。
- 核心工具/方法:基于设计框架的随机化检验(randomization test),利用 OLS 估计残差,构造图相关检验统计量 \(T_{\text{GC}}^{(k)}\),并证明渐近有效性。
- 主要结论:在度有界、潜在结果有界、线性基模型近似误差有界的假设下,所提出的估计残差随机化检验(Procedure 3)是渐近有效的(Theorem 2);模拟和实际数据展示了良好的功效。
关键设定与假设¶
- Assumption 1(随机化实验):\(Z \perp Y(z)\) 对所有 \(z\),且 \(P(Z)\) 已知,本文考虑 Bernoulli 实验。这保证了设计-based 推断的合理性。
- Assumption 2(有界结果与暴露):\(|Y_i(z)| \leq B\),且暴露映射局部有界。确保矩存在。
- Assumption 3(度有界):\(\Delta(G) \leq \kappa\)。限制依赖结构,使依赖图染色数有界,从而可用大偏差不等式(Janson 2004)。
- Assumption 4(设计矩阵正定):\(\mathbb{E}_{I,Z}[[1,\phi(e)][1,\phi(e)]^T]\) 一致正定。保证 OLS 估计量存在且收敛。
- Assumption 5(有界近似误差):\(\sup_z \frac{1}{N} \sum_i \|\mathbb{E}[\tilde{Y}_i \mid e_i] - \beta_0 \cdot \phi(e_i)\|^2 \leq s^2\)。这是关键假设:条件均值函数可以被线性基模型近似,且近似误差有界 \(s\)。\(s\) 作为敏感性参数出现。
- 相比已有文献:与 Gao et al. [2026] 相比,本文不要求替代模型空间限制为线性-in-means,但通过 Assumption 5 限制了近似误差,这实际上也是一种限制。与 Hoshino and Yanagi [2026] 相比,本文不要求指定更细的替代暴露映射。
主要结果¶
- Theorem 1(oracle 有效性):若真实残差已知,则 Procedure 2(基于真实残差的随机化检验)在有限样本下精确控制 Type I error。证明是标准随机化推断结果(概率积分变换)。
- Lemma 2(MSE 估计的一致性):在 \(H_0\) 下,样本 MSE 估计量 \(\hat{L}_{e^{\text{obs}}}(m)\) 依概率收敛到总体 MSE \(L_{P_N,Z}(m)\)。证明使用 Janson [2004] 的大偏差不等式,依赖度有界假设。
- Lemma 3(OLS 系数的一致性):在 \(H_0\) 下,\(\hat{\bar{\beta}}^{\text{obs}} \xrightarrow{p} \bar{\beta}_0\)。证明通过设计矩阵和响应向量的收敛性,以及最小特征值下界。
- Theorem 2(估计残差检验的渐近有效性):在 Assumptions 1-5 下,Procedure 3 的 p 值满足 \(\lim_{\epsilon \to 0} \limsup_{N \to \infty} P(\hat{p}_{\text{val}}^\epsilon \leq \alpha \mid H_0) \leq \alpha\),其中 \(\hat{p}_{\text{val}}^\epsilon\) 是经过 \(\epsilon\) 扰动的 p 值(式23)。证明的关键是:OLS 系数在 \(H_0\) 下收敛到同一常数,使得反事实残差的估计误差可控制,且 Lipschitz 检验统计量将残差误差转化为 p 值误差。
- Proposition 1(检验统计量的 Lipschitz 性质):\(T_\beta^{(k)}(Z, \tilde{r})\) 在 \(\tilde{r}\) 上是 Lipschitz 的,Lipschitz 常数为 \(C/\sqrt{N}\),其中 \(C = 2\kappa^k / (\sqrt{c_0} - 2s)\)。这保证了 Theorem 2 的条件成立。
证明路线与技术技巧(理论型)¶
整体路线(Theorem 2 证明): 1. Oracle 基准:若真实残差已知,随机化检验精确有效(Theorem 1)。 2. 估计残差与真实残差的差距:定义 \(\hat{r} = Y - \hat{\beta} \cdot \phi(e)\),\(r_0 = Y - \beta_0 \cdot \phi(e)\),\(\delta = \beta_0 \cdot \phi(e) - \mathbb{E}[\tilde{Y} \mid e]\)。则 \(\hat{r} - r_0 = (\beta_0 - \hat{\beta}) \cdot \phi(e)\)。Lemma 3 表明 \(\hat{\beta} \xrightarrow{p} \beta_0\),故 \(\|\hat{r} - r_0\| = o_p(\sqrt{N})\)。 3. 检验统计量的 Lipschitz 性:Proposition 1 给出 \(|T(Z, \hat{r}) - T(Z, r_0)| \leq (C/\sqrt{N}) \|\hat{r} - r_0\|\),因此 \(T(Z, \hat{r}) - T(Z, r_0) \xrightarrow{p} 0\)。 4. 反事实残差估计:对于反事实处理向量 \(Z\),需要估计 \(\hat{r}(Z)\)。作者利用 OLS 系数收敛性,证明 \(\hat{\beta}(Z) \xrightarrow{p} \beta_0\) 同样成立,因此 \(\hat{r}(Z) - r_0(Z) \xrightarrow{p} 0\)。 5. p 值误差控制:通过一系列不等式(式70-76),将估计残差下的 p 值与 oracle p 值联系起来,最终得到渐近有效性,并引入敏感性参数 \(s\) 来吸收近似误差。
关键跳跃点: - Lemma 3 的证明:需要同时处理设计矩阵和响应向量的收敛性,并利用最小特征值下界保证 OLS 系数的收敛。这里使用了 Janson [2004] 的大偏差不等式,依赖度有界假设。 - Theorem 2 中反事实残差估计的收敛性:式(90)-(98) 展示了如何将 \(\hat{\beta}_r(Z) - \hat{\beta}^{\text{obs}}\) 与近似误差 \(s\) 联系起来。关键步骤是使用一阶条件(式93)和 Cauchy-Schwarz 不等式得到 \(\|\hat{\beta}_r(Z) - \hat{\beta}^{\text{obs}}\| \leq 4B's/\lambda + o_p(1)\)。 - 敏感性参数的出现:最终 p 值需要减去 \(C's\) 来校正近似误差,这来自式(89) 的推导。
技术技巧点名: - Janson [2004] 的大偏差不等式:用于证明 Lemma 2 和 Lemma 3 中样本均值的收敛性,利用依赖图染色数有界(\(\kappa^{2k}+1\))。 - Weyl 不等式:用于 Lemma 3 中保证 \(\lambda_{\min}(\hat{\Sigma}_N) \geq \lambda/2\) 以概率趋近1。 - 概率积分变换:用于 Theorem 1 的 oracle 有效性证明。 - Lipschitz 函数与 Markov 不等式:用于 Theorem 2 中控制估计误差对 p 值的影响。 - 一阶条件与 Cauchy-Schwarz:用于 bound \(\|\hat{\beta}_r(Z) - \hat{\beta}^{\text{obs}}\|\)。
真实例子与应用¶
数据:Paluck et al. [2016] 的 anti-conflict norms 实验,涉及美国 56 所中学的 anti-bullying 干预。作者使用其中 28 所处理学校中的“社会参照者”(social referents)作为分析人群,去除孤立节点后样本量 850。网络平均出度为 1.14。
方法应用: - 暴露映射 \(e_i = (Z_i, I(\sum_{j \in \mathcal{N}_i} Z_j > 0))\),即自身处理 + 是否有处理过的朋友。 - 使用 Procedure 3,检验统计量 \(T_\beta^{(1)}\),生成 2000 次随机处理分配构造零分布。 - 包含学校固定效应作为回归变量,以近似完全随机化实验。
结果: - 对于 \(e\),p 值 = 0.317,无法拒绝零假设,即该暴露映射未被拒绝。 - 对于 \(e_2 = (Z_i)\)(仅自身处理),p 值 = 0.055,接近显著。 - 对于 \(e\) 使用 \(T_\beta^{(2)}\)(二阶图相关),p 值 = 0.799。
这个例子想说明什么:验证了方法在实际数据中的可行性,并展示了如何通过检验结果指导暴露映射的选择。作者指出,由于未拒绝 \(e\),且未使用校正项,决策对条件均值函数的近似误差是稳健的(因为校正项只会增大 p 值)。
🔎 结论是否比证明窄¶
- Theorem 2 的渐近有效性依赖于 Assumption 5(有界近似误差 \(s\)),且最终 p 值需要减去 \(C's\) 的校正项。但在模拟和实际应用中,作者未使用校正项,仅报告了未校正的 p 值。作者在模拟中声称“Type I error is appropriately controlled at the chosen significance level of 0.05 in the study”且“no correction term was added to the procedure”,这实际上比 Theorem 2 的结论更强(Theorem 2 要求校正)。作者在 DGP IV(式31)中展示了当近似误差存在时,未校正的 Type I error 会膨胀(图2),但未在主要模拟中系统评估校正项的必要性。
- 结论中关于多重检验的 FWER 控制(Theorem 3)仅针对嵌套假设(如深度检验),且证明直接引用 Theorem 2。但实际应用中,若同时检验多个非嵌套暴露映射,FWER 控制未得到理论保证。
- 模拟中 SBM 网络下功效下降被归因于平均度增加违反 Assumption 3,但作者未提供理论解释或修正方法。
四、开放问题¶
-
理论功效分析:本文仅通过模拟展示功效,未提供理论功效界或一致性证明。作者在结论中提及“It will be an important extension to study, principally, how to choose the basis model and better calibrate the sensitivity parameter. Another interesting theoretical direction is to examine theoretical power properties of the procedure”。扎根于结论段:“Theoretical study of power properties will also aid in developing a principled procedure for selecting exposure models.”
-
Gao et al. [2026] 的不可行性结果是否适用于本文设定:作者在结论中写道:“Gao et al. [2026] presents an impossibility result for a general alternative model class, and it is an interesting extension to see if the impossibility result also holds if the alternative model space is restricted to a subclass, for instance, potential outcomes with a bounded degree of the network as considered in this work.” 这是一个明确的开放问题。
-
高维暴露映射或高维基函数:当暴露映射维度 \(k\) 或基函数维度 \(d\) 随 \(N\) 增长时,OLS 估计可能失效。作者在附录 B.1.1 中提及低阶 \(\beta\) 交互模型时指出“As the number of regressors can be much larger than the sample size, owing to combinatorial terms, a direct application of Procedure 3 is not feasible. It is an interesting extension to examine whether the sparsity arising from the graph’s bounded degree can be exploited to develop a model specification test based on high-dimensional regression.” 扎根于附录 B.1.1 末尾。
-
密集网络下的方法改进:模拟显示 SBM 网络下功效下降,作者在结论中写道:“Our procedure’s performance drops in dense graph settings, creating a methodological gap to improve upon.” 这是一个具体的方法论缺口。
-
扩展到观察性研究:作者在结论中提及:“Although this work focuses on interference settings, it would be interesting to investigate the proposed model-testing framework in other settings, including randomized experiments and observational studies.” 但未给出具体方向。
Maintained by 陈星宇 · Homepage · Source on GitHub