Randomization tests for model specification in causal inference under network interference¶
作者: Supriya Tiwari, Pallavi Basu
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.22890
一、领域脉络与小综述¶
这个方向是什么¶
本子方向解决的根本问题是:在存在网络干扰(network interference)的随机实验中,如何检验研究者所假设的“暴露映射”(exposure mapping)是否被正确指定。暴露映射将每个单元的高维处理向量(所有邻居的处理状态)降维为一个低维函数,是定义和估计溢出效应(spillover effect)的标准工具。但它的正确性通常由分析者假定,缺乏实证检验手段。本文提出一种基于设计(design-based)的随机化检验框架,用于检验暴露映射的模型设定是否正确。
发展脉络(history)¶
- 奠基工作:Hong and Raudenbush (2006) 提出暴露映射概念,Manski (2013) 和 Aronow and Samii (2017) 将其形式化,用于在干扰下识别因果效应。Aronow and Samii (2017) 给出了基于Horvitz-Thompson估计量的设计推断框架,但假设暴露映射正确。
- 主要进展:Leung (2022) 和 Sävje (2024) 研究了暴露映射误设对标准估计量的影响,发现某些受控误设下估计量仍稳健。Sävje et al. (2021)、Hu et al. (2022)、Wang et al. (2020) 提出边缘化estimand(marginalized estimand),避免显式使用暴露映射,但代价是无法揭示溢出机制。随机化检验(FRT)被推广到干扰场景:Athey et al. (2018)、Basse et al. (2019)、Puelz et al. (2022)、Zhang and Zhao (2025)、Zhong (2024)、Tiwari and Basu (2024) 分别发展了检验干扰存在性或特定溢出效应的FRT方法。
- 当前frontier:Gao et al. (2026) 证明了在不限制潜在结果模型空间时,无法构造有信息的暴露映射设定检验(不可行性结果),并在线性-in-means模型下给出了一致检验。Hoshino and Yanagi (2026) 利用层次暴露映射关系构建检验,但需要指定一个更细的备择暴露映射。
- 本文位置:本文在Gao et al. (2026)的不可行性结果之后,提出一个在更宽泛的潜在结果函数类下工作的检验框架,不要求指定备择暴露映射,而是通过残差不变性构造随机化检验,并证明渐近有效性。
子线索聚类¶
- 暴露映射的误设影响与稳健性(Leung 2022, Sävje 2024):研究误设对估计量的影响,发现某些误设下估计量仍稳健,但未提供检验方法。
- 边缘化estimand(Sävje et al. 2021, Hu et al. 2022, Wang et al. 2020):避免暴露映射,直接定义平均溢出效应,稳健但无法揭示机制。
- 随机化检验用于干扰(Athey et al. 2018, Basse et al. 2019, Puelz et al. 2022, Zhang and Zhao 2025, Zhong 2024, Tiwari and Basu 2024):检验干扰存在性或特定溢出效应,但未直接检验暴露映射的设定。
- 暴露映射设定检验(Gao et al. 2026, Hoshino and Yanagi 2026, 本文):直接检验暴露映射是否正确指定。Gao et al. 给出不可行性结果并在线性模型下构造检验;Hoshino and Yanagi 需要指定更细的备择映射;本文基于残差不变性,不要求备择映射。
这个方向在追问的核心问题¶
- 可检验性边界:在什么条件下,暴露映射的设定是可检验的?Gao et al. (2026) 的不可行性结果是否适用于更一般的模型类?
- 检验的功率:如何构造对误设敏感的检验统计量?本文使用图形相关统计量,但功率依赖于网络结构。
- 多重检验:当有多个候选暴露映射时,如何控制FWER?本文讨论了嵌套假设下的序贯检验。
- 与估计的衔接:检验结果如何指导后续的因果估计?例如,拒绝一个暴露映射后,如何选择替代映射?
⚠️ 作者的framing¶
作者将缺口frame为:“现有方法假设暴露映射正确,缺乏实证检验手段;本文填补这一空白”。作者淡化或回避的竞争路线: - 边缘化estimand:作者承认其稳健性,但指出“no insight into the spillover mechanism can be gained”(Section 1),从而将本文定位为能揭示机制的检验。 - Gao et al. (2026):作者将其视为并发工作,并指出Gao et al. 的不可行性结果是在“without imposing restrictions on the model space”下成立,而本文“work with a broader class of potential outcome model functions”(Section 1),但并未明确说明本文的模型类比Gao et al. 的“线性-in-means”更宽还是不同。值得研究者去查:Gao et al. 的不可行性结果是否依赖于特定的模型空间定义?本文的假设(有界度、有界结果、线性基模型)是否恰好避开了不可行性条件? - Hoshino and Yanagi (2026):作者提到其需要指定更细的备择暴露映射,而本文不需要,这是本文的一个优势。
什么明显该被引/该存在、却没出现在intro里? 未见明显缺失。但可注意:本文使用OLS估计残差,但未引用Abadie et al. (2020) 关于设计推断与OLS标准误的调和(虽然引用了,但仅在intro末尾提及)。此外,关于“低阶β交互模型”(Cortez-Rodriguez et al. 2023)在附录B.1.1中才出现,intro未提及,可能因为这不是本文核心。
张力¶
未见明显对立引用。各工作在不同设定下结论一致:暴露映射误设会导致偏差,但某些受控误设下估计量仍稳健;检验暴露映射需要额外假设。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(N\):总体大小(固定)。
- \(G \in \{0,1\}^{N \times N}\):简单无向邻接矩阵,\(G_{ij}=1\) 表示单元 \(i\) 和 \(j\) 相连。
- \(\mathcal{N}_i = \{j: G_{ij}=1\}\):单元 \(i\) 的邻居集。
- \(Z \in \{0,1\}^N\):二元处理分配向量,\(Z_i=1\) 表示处理,\(Z_i=0\) 表示对照。
- \(Y_i(Z)\):单元 \(i\) 在全局处理向量 \(Z\) 下的潜在结果(固定,非随机)。
- \(e_i(Z)\):暴露映射,将 \(Z\) 映射为低维向量,例如 \(e_i(Z) = (Z_i, \frac{1}{|\mathcal{N}_i|}\sum_{j\in\mathcal{N}_i} Z_j)\)。
- \(R_i(Z) = Y_i(Z) - \mathbb{E}_Z[Y_i(Z) | e_i(Z)]\):有限样本残差(定义1)。\(\mathbb{E}_Z\) 表示对 \(Z\) 的分布取期望,因为设计-based框架下所有随机性来自 \(Z\)。
- \(\tilde{R}_i(Z)\):修正残差(定义2),分离出基线常数 \(c_i\),使得 \(\tilde{Y}_i(\mathbf{0})=0\),且 \(\tilde{R}_i(Z) = Y_i(Z) - \mathbb{E}[\tilde{Y}_i(Z)|e_i(Z)]\)。在零假设下,\(\tilde{R}_i(Z) = c_i\) 与 \(Z\) 无关。
- \(Z_{\text{obs}}, Y_{\text{obs}}\):观测到的处理分配和结果。
- \(P(Z)\):已知的处理分配机制(本文假设Bernoulli实验,\(Z_i \sim \text{i.i.d. Bernoulli}(p)\))。
- \(\phi(\cdot)\):基函数,\(\phi: \mathbb{R}^k \to \mathbb{R}^d\),用于线性基模型 \(m(e) = \bar{\beta} \cdot [1, \phi(e)]\)。
- \(\hat{\bar{\beta}}_{\text{obs}}\):OLS系数,由 \(Y_{\text{obs}}\) 对 \([1, \phi(e_{\text{obs}})]\) 回归得到。
-
\(T_{\text{GC}}^{(k)}\):图形相关检验统计量(式13),度量 \(Z\) 与残差 \(\tilde{R}\) 在距离 \(k\) 的邻居上的相关性。
-
模型:
- 数据生成机制:固定总体 \(P\) 和网络 \(G\),潜在结果 \(Y(Z)\) 是确定的(非随机)。随机性仅来自处理分配 \(Z \sim P(Z)\)(设计-based框架)。观测数据为 \((Z_{\text{obs}}, Y_{\text{obs}})\),其中 \(Y_{\text{obs}} = Y(Z_{\text{obs}})\)。
- 暴露映射 \(e(Z)\) 是研究者假设的降维函数。零假设 \(H_0\):暴露映射正确指定,即 \(\tilde{R}_i(Z)\) 与 \(Z\) 无关(对所有 \(Z\) 相等)。等价地,\(Y_i(Z) = \mathbb{E}[\tilde{Y}_i(Z)|e_i(Z)] + c_i\),其中 \(\mathbb{E}[\tilde{Y}_i(Z)|e_i(Z)]\) 完全捕捉了处理对结果的影响。
-
为构造可计算的检验,假设条件均值函数可用线性基模型近似:\(\mathbb{E}[\tilde{Y}_i|e_i] \approx \beta_0 \cdot \phi(e_i)\),且近似误差有界(Assumption 5)。
-
可观测数据:
- 可观测:\(Z_{\text{obs}}\)(处理分配向量),\(Y_{\text{obs}}\)(结果向量),网络 \(G\),协变量 \(X\)(本文未强调)。
- 不可观测:其他处理分配下的潜在结果 \(Y(z)\)(\(z \neq Z_{\text{obs}}\)),以及真实残差 \(\tilde{R}_i(Z)\)(因为 \(\mathbb{E}[\tilde{Y}_i|e_i]\) 未知)。研究者只能通过观测数据估计残差。
第二步:最小内核¶
最简特例:考虑一个线性模型,真实暴露映射为 \(e_i^{(1)} = (Z_i, \bar{Z}_{\mathcal{N}_i})\),其中 \(\bar{Z}_{\mathcal{N}_i} = \frac{1}{|\mathcal{N}_i|}\sum_{j\in\mathcal{N}_i} Z_j\)。假设真实潜在结果模型为:
现在,研究者错误地假设暴露映射为 \(e_i^{(2)} = (Z_i)\)(即忽略溢出效应)。那么,在 \(e^{(2)}\) 下,条件均值 \(\mathbb{E}[Y_i|e_i^{(2)}] = \tau_d Z_i + \tau_s \mathbb{E}[\bar{Z}_{\mathcal{N}_i}|Z_i]\)。由于 \(\mathbb{E}[\bar{Z}_{\mathcal{N}_i}|Z_i] = p\)(Bernoulli实验下),残差 \(\tilde{R}_i^{(2)}(Z) = Y_i - \tau_d Z_i - \tau_s p = \tau_s (\bar{Z}_{\mathcal{N}_i} - p) + c_i\),它依赖于 \(Z\)(通过 \(\bar{Z}_{\mathcal{N}_i}\)),因此零假设被违反。
核心思路:在零假设下,残差 \(\tilde{R}\) 与 \(Z\) 无关,因此任何基于 \(Z\) 和 \(\tilde{R}\) 的检验统计量在随机化下应具有已知分布(类似FRT)。如果残差已知,我们可以直接进行精确随机化检验(Procedure 2)。由于残差未知,我们用OLS估计残差,并证明估计残差下的随机化检验渐近有效(Theorem 2)。检验统计量 \(T_{\text{GC}}^{(1)}\) 度量 \(Z_i\) 与邻居残差 \(\tilde{R}_j\) 的相关性——如果暴露映射正确,这种相关性应为零;如果存在未捕捉的溢出,则相关。
最小内核的数学困难:残差不可观测,只能用估计值代替。估计误差会导致检验的Type I error膨胀。本文的关键想法是:在零假设下,OLS系数 \(\hat{\beta}\) 收敛到常数 \(\beta_0\)(Lemma 3),因此估计残差 \(\hat{\tilde{R}}\) 与真实残差 \(\tilde{R}\) 的差异随 \(N\) 趋于零。通过Lipschitz条件,检验统计量的差异也可控,从而渐近有效性成立。
三、这篇论文做了什么¶
三句话¶
- 研究问题:在网络干扰的随机实验中,如何检验研究者假设的暴露映射是否被正确指定(即是否捕捉了所有相关溢出机制)。
- 核心方法:基于设计-based框架,利用残差在零假设下与处理分配无关的性质,构造随机化检验;由于残差未知,用OLS估计残差,并证明估计残差下的随机化检验渐近有效。
- 主要结论:提出了一个可操作的检验程序(Procedure 3),证明了其渐近有效性(Theorem 2),并通过模拟和真实数据(Paluck et al. 2016的反冲突干预实验)展示了良好的Type I error控制和功率。
关键设定与假设¶
- Assumption 1 (Randomized experiment):处理分配机制已知且独立于潜在结果,本文考虑Bernoulli实验(\(Z_i \sim \text{i.i.d. Bernoulli}(p)\))。
- Assumption 2 (Bounded outcomes and exposures):潜在结果有界(\(|Y_i(z)| \leq B\)),暴露映射局部有界(\(||e_i(z')|| \leq b_z\)),一致于 \(N\)。
- Assumption 3 (Bounded degree):图的最大度 \(\Delta(G) \leq \kappa\),常数 \(\kappa\)。这限制了依赖范围,是证明收敛性的关键。
- Assumption 4 (Positive definite design):期望设计矩阵 \(\mathbb{E}_{I,Z}[[1,\phi(e)][1,\phi(e)]^T]\) 正定,一致于 \(N\)。
- Assumption 5 (Bounded discrepancy variation):条件均值函数与线性基模型之间的最大均方误差有界:\(\sup_{z} \frac{1}{N}\sum_i ||\mathbb{E}[\tilde{Y}_i|e_i] - \beta_0 \cdot \phi(e_i)||^2 \leq s^2\)。\(s\) 是敏感性参数,控制模型误设程度。
相比已有文献:本文的假设与Aronow and Samii (2017) 类似(有界度、有界结果),但额外需要线性基模型近似条件均值(Assumption 5)。Gao et al. (2026) 的不可行性结果不需要有界度,但本文通过有界度获得了可检验性。
主要结果¶
- Theorem 1 (Oracle validity):如果真实残差已知,Procedure 2(基于真实残差的随机化检验)在有限样本下精确控制Type I error(\(P(pval \leq \alpha | H_0) \leq \alpha\))。这是FRT的标准结果,证明简单(概率积分变换)。
- Theorem 2 (Asymptotic validity of estimated residual test):在Assumptions 1-5下,Procedure 3(基于估计残差的随机化检验)渐近有效,但需一个修正因子:存在 \(C'>0\) 使得
\[\lim_{\epsilon \to 0} \limsup_{N \to \infty} P_{Z_{\text{obs}}}(\hat{pval}_\epsilon \leq \alpha | H_0) \leq \alpha,\]其中 \(\hat{pval}_\epsilon = P_Z(T(Z, \hat{\tilde{r}}_{\text{obs}}) \geq T(Z_{\text{obs}}, \hat{\tilde{r}}_{\text{obs}}) - C' s - \epsilon)\)。直观上,由于模型近似误差 \(s\),Type I error可能膨胀,但通过一个可调的 \(\epsilon\) 可以控制。实际中,\(s\) 可作为敏感性参数报告。
- Proposition 1 (Lipschitz property of test statistic):图形相关统计量 \(T_\beta^{(k)}\) 在零假设下是Lipschitz的,Lipschitz常数为 \(C/\sqrt{N}\),满足Theorem 2的条件。
- Theorem 3 (FWER control for nested hypotheses):对于嵌套假设(如检验溢出深度),序贯检验(Procedure 4)渐近控制FWER。
证明路线与技术技巧¶
整体路线(Theorem 2): 1. 定义差异:设 \(\Delta \hat{r} = T(Z, \hat{r} + \delta) - T(Z_{\text{obs}}, \hat{r}_{\text{obs}} + \delta_{\text{obs}})\),其中 \(\hat{r}\) 是估计残差,\(\delta\) 是模型近似误差。零假设下,真实残差 \(r\) 与 \(Z\) 无关,但估计残差有偏差。 2. Lipschitz控制:利用Proposition 1,\(|T(Z, \hat{r}) - T(Z, r_0)| \leq (C/\sqrt{N}) ||\hat{r} - r_0||\),其中 \(r_0\) 是线性基模型下的残差。由于 \(\hat{\beta} \xrightarrow{p} \beta_0\)(Lemma 3),\(||\hat{r} - r_0|| \xrightarrow{p} 0\),因此 \(T(Z, \hat{r}) \approx T(Z, r_0)\)。 3. 近似误差处理:将 \(\Delta \hat{r}\) 分解为三项,其中一项涉及 \(||\delta'|| + ||\delta_{\text{obs}}||\),其期望有界于 \(2s\)(Assumption 5)。通过Weyl不等式和Janson的大偏差定理,证明 \(\hat{\beta}_r(Z) - \hat{\beta}_{\text{obs}}\) 有界于 \(4B's/\lambda + o_p(1)\)(式98)。 4. 概率不等式:利用Markov不等式和收敛性,证明 \(P_{Z_{\text{obs}}}(P_Z(|\Delta \hat{r} - \Delta \hat{r}_{\text{obs}}| \geq \epsilon) > \epsilon) \to 0\),从而将估计残差检验的Type I error上界与oracle检验的Type I error上界联系起来。 5. 最终上界:得到 \(\limsup_N P_{Z_{\text{obs}}}(\hat{pval}_\epsilon \leq \alpha) \leq \alpha + \epsilon\),取 \(\epsilon \to 0\) 得渐近有效性。
关键跳跃点: - Lemma 3 (OLS系数收敛):证明 \(\hat{\bar{\beta}}_{\text{obs}} \xrightarrow{p} \bar{\beta}_0\)。难点在于处理依赖结构(网络干扰导致残差相关)。使用Janson (2004) 的大偏差定理,依赖图的色数上界为 \(\kappa^{2k}+1\)(有界度假设),从而得到指数收敛率。 - 式(98)的界:证明 \(\hat{\beta}_r(Z) - \hat{\beta}_{\text{obs}}\) 有界。这需要将 \(\hat{\beta}_r(Z)\) 表达为 \(\hat{\beta}_{\text{obs}}\) 加上一个涉及残差和 \(\delta\) 的项,然后利用 \(\frac{1}{N}\sum \phi(e_i)r_i\) 的收敛性和 \(\frac{1}{N}\sum \phi(e_i)\delta_i\) 的界(\(B's\))。这里用到了零假设下 \(r_i\) 与 \(Z\) 无关的性质,使得 \(\frac{1}{N}\sum \phi(e_i)r_i\) 的期望为零(式94)。
技术技巧点名: - Janson (2004) 大偏差:用于证明样本均值的收敛性(Lemma 2, 3),处理依赖数据。 - 依赖图与色数:将残差项的依赖结构建模为图,色数上界由有界度给出。 - Weyl不等式:用于控制最小特征值的下界(式57)。 - Lipschitz性质:用于将估计残差与真实残差的差异转化为检验统计量的差异。 - 概率积分变换:用于oracle检验的精确有效性(Theorem 1)。
真实例子与应用¶
数据:Paluck et al. (2016) 的反冲突干预实验,56所美国中学,其中28所随机接受干预。在干预学校中,识别出“社交参照者”(social referents,约10%的学生),再随机50%邀请参加反欺凌活动。分析聚焦于社交参照者(去除孤立节点后 \(N=850\)),网络平均出度1.14。
方法应用: - 假设暴露映射 \(e_i = (Z_i, I(\sum_{j\in\mathcal{N}_i} Z_j > 0))\)(是否有处理朋友),这是Aronow and Samii (2017) 使用的映射。 - 使用Procedure 3,检验统计量 \(T_\beta^{(1)}\),生成2000个随机处理分配,计算p值。 - 结果:p值 = 0.317,不拒绝零假设。作者还检验了 \(e_i = (Z_i)\)(p=0.055)和 \(e_i\) 配合 \(T_\beta^{(2)}\)(p=0.799)。 - 说明:该例子展示了方法在实际数据中的可用性,并说明不拒绝原假设意味着所选暴露映射与数据一致。由于未使用修正项(\(s=0\)),决策是稳健的(因为修正只会增大p值)。
🔎 结论是否比证明窄¶
- Theorem 2 的结论是渐近有效性,但需要修正因子 \(\epsilon\) 和敏感性参数 \(s\)。在实际操作中,作者建议报告 \(s\) 的敏感性分析(Section 4.1),但并未给出选择 \(s\) 的具体准则。模拟中(Table 2)未使用修正项,Type I error仍受控,但作者在DGP IV中展示了当模型误设较大时Type I error膨胀(Figure 2),说明修正项是必要的。因此,结论“渐近有效”严格依赖于 \(s\) 的界,而 \(s\) 在实践中未知。
- Theorem 3 关于FWER控制,证明仅针对嵌套假设,且需要渐近有效性(依赖Theorem 2)。对于非嵌套多重检验,本文未提供理论保证。
- 模拟部分:在随机块模型(SBM)下,随着样本量增加功率下降(Table 1, 2),作者归因于平均度增加(违反Assumption 3)。这暗示方法在密集图下可能失效,但论文未给出理论解释或补救措施。
四、开放问题¶
-
理论功率分析:本文仅通过模拟展示功率,未提供理论功率界。Gao et al. (2026) 给出了不可行性结果,但本文的模型类(有界度、线性基近似)是否允许非平凡功率?能否证明在某种备择下检验的一致性?——扎根于Section 7:“It will be an important extension to study... theoretical power properties of the procedure”。
-
高维暴露映射的检验:附录B.1.1讨论的低阶β交互模型,当β较大时,回归参数数量指数增长,直接应用OLS不可行。能否利用有界度假设下的稀疏性,发展高维版本的检验?——扎根于Appendix B.1.1:“a direct application of Procedure 3 is not feasible... an interesting extension to examine whether the sparsity... can be exploited”。
-
敏感性参数的选择:Theorem 2中的修正项依赖于 \(s\)(Assumption 5),但 \(s\) 未知。作者建议网格搜索,但未给出理论指导。能否构造一个数据驱动的 \(s\) 选择方法(如通过交叉验证或bootstrap)?——扎根于Section 7:“how to choose the basis model and better calibrate the sensitivity parameter”。
-
密集图下的性能改进:模拟显示在SBM(平均度随N增长)下功率下降,违反Assumption 3。能否放松有界度假设,例如允许度增长但控制某种稀疏性(如图是稀疏的,但最大度可增长)?——扎根于Section 7:“Our procedure’s performance drops in dense graph settings, creating a methodological gap to improve upon”。
提醒:要确认这些是否是真gap,建议阅读Gao et al. (2026) 的不可行性结果,以及近期关于网络干扰下模型设定检验的文献(如Hoshino and Yanagi 2026),看是否已有解决上述问题的尝试。
Maintained by 陈星宇 · Homepage · Source on GitHub