跳转至

Causal Inference with Noncompliance and Unknown Interference

作者: Tadao Hoshino, Takahide Yanagi
来源: Journal of the American Statistical Association
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本子方向研究的是在社会网络干扰(一个体的处理影响其他个体的结果)与非依从性(个体实际接受的处理与分配的处理不一致)同时存在时的因果推断问题。其核心挑战在于:网络干扰的形式通常是未知且复杂的(例如,一个体的结果可能受其所有邻居的处理影响),而非依从性又引入了工具变量(IV)的经典识别问题。当前成熟度较低——大多数现有工作要么只处理干扰(假设完美依从),要么只处理非依从(假设无干扰),而将两者结合的工作非常有限,且通常对干扰形式施加了很强的结构假设(如已知的暴露映射或参数化模型)。

发展脉络(history)

  • 奠基工作:无干扰下的非依从性。Angrist, Imbens, and Rubin (1996) 建立了工具变量框架下的依从者平均处理效应(CACE)识别理论,核心假设是排他性约束(工具变量仅通过处理影响结果)和单调性(无违者者)。这是本文的基准设定。
  • 主要进展:已知形式的网络干扰。Hudgens and Halloran (2008) 提出了部分干扰(partial interference)框架,假设网络可划分为不连通的组,组内干扰但组间无干扰。Manski (2013) 和 Aronow and Samii (2017) 引入了暴露映射(exposure mapping)概念,将复杂的网络溢出效应总结为个体处理状态的某个函数(如“是否至少有一个邻居被处理”),但要求暴露映射是已知且正确指定的。Forastiere et al. (2021) 在部分干扰下结合了非依从性,但暴露映射仍为已知。
  • 当前 frontier:未知干扰形式下的推断。本文作者指出,现有工作“通常假设暴露映射是已知的”(原文引用句),而实际中研究者可能不知道干扰如何发生。本文的贡献在于:在暴露映射可能误设的情况下,讨论ITT和CACE的可识别性,并发展非参数估计方法。
  • 本文的位置:本文是第一个(据作者声称)在未知干扰形式存在非依从的设定下,系统研究ITT和CACE识别与估计的工作。它通过引入“工具变量的暴露映射”这一新概念,将未知干扰问题转化为一个有限维统计量的识别问题,从而绕开了对干扰形式的完全建模。

子线索聚类

  1. 部分干扰与已知暴露映射:Hudgens and Halloran (2008), Aronow and Samii (2017), Forastiere et al. (2021)。这一簇假设网络可划分为不连通的组,且暴露映射是已知的(如“组内被处理的比例”)。优点是识别简单,缺点是实际中网络可能不满足部分干扰,且暴露映射的误设会导致偏差。
  2. 近似邻域干扰(ANI):Leung (2022), Sävje, Aronow, and Hudgens (2021)。这一簇放松了部分干扰,假设干扰随网络距离衰减(即只有“近邻”的处理影响结果),但通常假设完美依从。本文的渐近理论建立在ANI框架上。
  3. 工具变量与干扰的结合:本文是这一簇的核心工作。其他相关但更早的工作包括:Kang and Imbens (2016) 讨论了在部分干扰下使用IV,但暴露映射仍为已知;DiTraglia et al. (2020) 在未知干扰下使用IV,但聚焦于检验而非估计。

这个方向在追问的核心问题

  1. 可识别性:在未知干扰下,ITT和CACE是否可识别?需要什么条件?
  2. 估计方法:如何构造相合且渐近正态的估计量,而不需要对干扰形式做参数化假设?
  3. 稳健性:当暴露映射被误设时,估计量是否仍然有意义(即,它估计的是什么参数)?
  4. 效率:在给定暴露映射下,最优估计量是什么?如何达到半参数效率界?

已知瓶颈:未知干扰导致“维数灾难”——每个个体的潜在结果依赖于所有邻居的处理,使得参数空间随网络大小指数增长。现有方法要么通过强结构假设(如已知暴露映射)回避,要么通过近似(如ANI)牺牲精度。

⚠️ 作者的 framing

作者将缺口 frame 为:“现有工作通常假设暴露映射是已知的,但实际中研究者可能不知道干扰如何发生。” 因此,本文的“显然的下一步”是:在暴露映射可能误设的情况下,研究ITT和CACE的识别与估计。作者通过引入“工具变量的暴露映射”这一新概念,将未知干扰问题转化为一个有限维统计量的识别问题,从而绕开了对干扰形式的完全建模。

被淡化或回避的竞争路线: - 完全非参数识别:作者没有讨论是否可以在完全不指定暴露映射的情况下识别ITT或CACE(例如,通过假设网络结构是随机的或使用图核方法)。这可能是由于完全非参数识别通常需要更强的假设(如网络是稀疏的或处理分配是随机的)。 - 基于模型的干扰推断:作者回避了使用参数化或半参数模型(如空间自回归模型)来建模干扰的路线。这些模型虽然需要更强的假设,但可能提供更高效的估计。

什么明显该被引/该存在、却没出现在 intro 里? - Basse and Feller (2018):讨论了在部分干扰下使用IV的识别问题,但暴露映射仍为已知。本文应引用并说明其与本文的差异(已知 vs. 未知暴露映射)。 - VanderWeele and Tchetgen Tchetgen (2011):讨论了在干扰存在下使用IV的边界方法。本文未提及,但边界方法可能是处理未知干扰的另一种思路。 - Ogburn et al. (2020):讨论了在干扰存在下使用IV的敏感性分析。本文未提及,但敏感性分析是处理未知干扰的实用工具。

张力

未见明显对立引用。所有被引工作都承认未知干扰是一个困难问题,且本文的贡献在于提供了一个新的解决思路。但有一个潜在的张力:ANI框架假设干扰随距离衰减,而本文的识别结果并不依赖这一假设。这意味着本文的识别部分比估计部分更一般,但估计部分(渐近理论)却依赖于ANI。这可能导致一个“识别-估计”之间的gap:识别条件可能在实际中无法被估计方法所利用(例如,当网络很大且干扰不衰减时)。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( i = 1, \dots, n \):个体索引。 - \( \mathbf{G} \)\( n \times n \) 的邻接矩阵,\( G_{ij} = 1 \) 表示 \( j \)\( i \) 的邻居(干扰关系)。可观测。 - \( Z_i \in \{0, 1\} \):个体 \( i \)分配处理(工具变量)。可观测。 - \( D_i \in \{0, 1\} \):个体 \( i \)实际接受处理可观测。 - \( Y_i \):个体 \( i \)结果可观测。 - \( \mathbf{Z} = (Z_1, \dots, Z_n) \):所有个体的分配处理向量。 - \( \mathbf{D} = (D_1, \dots, D_n) \):所有个体的实际处理向量。 - \( Y_i(\mathbf{z}, \mathbf{d}) \):个体 \( i \)潜在结果,当分配处理向量为 \( \mathbf{z} \)、实际处理向量为 \( \mathbf{d} \) 时。不可观测。 - \( D_i(\mathbf{z}) \):个体 \( i \)潜在实际处理,当分配处理向量为 \( \mathbf{z} \) 时。不可观测。 - \( \mathbf{Z}_{-i} \):除 \( i \) 外所有个体的分配处理向量。 - \( \mathcal{N}_i \):个体 \( i \) 的邻居集合(由 \( \mathbf{G} \) 定义)。 - \( \mathbf{Z}_{\mathcal{N}_i} \):个体 \( i \) 的邻居的分配处理向量。 - \( \mathbf{D}_{\mathcal{N}_i} \):个体 \( i \) 的邻居的实际处理向量。

模型: - 数据生成机制:个体 \( i \) 的结果 \( Y_i \) 和实际处理 \( D_i \) 可能依赖于所有个体的分配处理 \( \mathbf{Z} \) 和实际处理 \( \mathbf{D} \)。即,存在潜在的全局干扰。 - 工具变量\( Z_i \)\( D_i \) 的工具变量,满足排他性约束\( Z_i \) 仅通过 \( D_i \) 影响 \( Y_i \))和相关性\( Z_i \)\( D_i \) 相关)。 - 非依从性\( D_i \) 可能不等于 \( Z_i \)(即,个体可能不依从分配处理)。 - 未知干扰:干扰的形式(即,哪些邻居的处理影响结果)是未知的。

可观测数据: - 研究者实际能观测到的是:\( \{ (Y_i, D_i, Z_i, \mathbf{G}) \}_{i=1}^n \),即每个个体的结果、实际处理、分配处理,以及整个网络的邻接矩阵。 - 想要但观测不到的是:潜在结果 \( Y_i(\mathbf{z}, \mathbf{d}) \) 和潜在实际处理 \( D_i(\mathbf{z}) \)。这些只能通过假设(如排他性约束、单调性)和工具变量来识别。

第二步:讲最小内核

最简特例:假设网络是一个完全二分图,即所有个体被分为两组:处理组\( Z_i = 1 \))和对照组\( Z_i = 0 \)),且组内无干扰,组间有干扰。更具体地,假设: - 网络只有两个个体:\( i = 1, 2 \)。 - 个体1的邻居只有个体2,个体2的邻居只有个体1(即,一个简单的边)。 - 分配处理 \( Z_1, Z_2 \in \{0, 1\} \) 是独立随机分配的(例如,抛硬币)。 - 实际处理 \( D_1, D_2 \in \{0, 1\} \) 可能不依从分配处理(例如,个体1可能拒绝接受处理即使 \( Z_1 = 1 \))。 - 结果 \( Y_1, Y_2 \) 可能受所有分配处理和实际处理的影响(即,存在全局干扰)。

核心问题:我们想估计意向治疗效应(ITT),即分配处理对结果的平均因果效应,但允许干扰存在。例如,个体1的ITT定义为:

\[\text{ITT}_1 = \mathbb{E}[Y_1(Z_1=1, Z_2) - Y_1(Z_1=0, Z_2)],\]
其中期望是对 \( Z_2 \) 的边缘分布取的。注意,这里 \( Y_1 \) 可能还依赖于 \( D_1, D_2 \),但通过排他性约束,我们假设 \( Z_1 \) 仅通过 \( D_1 \) 影响 \( Y_1 \),且 \( Z_2 \) 仅通过 \( D_2 \) 影响 \( Y_1 \)

本文的关键想法:引入工具变量的暴露映射 \( \mathbf{h}(\mathbf{Z}) \),它是一个固定维度的统计量,用于总结 \( \mathbf{Z} \) 中影响个体 \( i \) 结果的部分。例如,对于个体1,我们可以定义暴露映射为:

\[h_1(\mathbf{Z}) = (Z_1, Z_2),\]
即,个体1的结果依赖于所有分配处理(因为网络很小)。更一般地,我们可以定义 \( h_1(\mathbf{Z}) = (Z_1, \sum_{j \in \mathcal{N}_1} Z_j) \),即个体1的结果依赖于自己的分配处理和邻居中被处理的数量。

识别条件:为了识别ITT,我们需要条件独立性

\[Y_i(\mathbf{z}, \mathbf{d}) \perp \mathbf{Z} \mid \mathbf{h}(\mathbf{Z}),\]
即,给定暴露映射 \( \mathbf{h}(\mathbf{Z}) \),分配处理 \( \mathbf{Z} \) 与潜在结果独立。这类似于倾向得分匹配中的“无混淆性”假设,但这里是在工具变量设定下。

在这个特例下: - 假设暴露映射 \( h_1(\mathbf{Z}) = (Z_1, Z_2) \)正确指定的(即,\( Y_1 \) 确实只依赖于 \( Z_1 \)\( Z_2 \))。那么,ITT可以识别为:

\[\text{ITT}_1 = \mathbb{E}[Y_1 \mid Z_1=1, Z_2=0] - \mathbb{E}[Y_1 \mid Z_1=0, Z_2=0],\]
其中我们固定 \( Z_2=0 \) 来消除干扰。更一般地,我们需要对 \( Z_2 \) 的边缘分布取平均。 - 如果暴露映射是误设的(例如,我们错误地假设 \( h_1(\mathbf{Z}) = Z_1 \)),那么估计的ITT可能是有偏的。本文讨论了这种误设下的识别结果:估计量仍然估计某个“加权平均”的ITT,但权重取决于暴露映射的误设程度。

核心思路:通过将未知干扰总结为工具变量的暴露映射,本文把高维的干扰问题转化为一个有限维的识别问题。然后,通过逆概率加权(IPW)来估计ITT和CACE,其中权重是暴露映射的条件概率。这个思路的本质是:用暴露映射来“控制”干扰,就像在无干扰设定中用倾向得分来控制混杂一样

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在社交网络干扰形式未知且存在非依从性的情况下,如何识别和估计意向治疗效应(ITT)和依从者平均处理效应(CACE)。
  2. 核心工具/方法:引入“工具变量的暴露映射”概念,将未知干扰总结为固定维度的统计量;基于此,在暴露映射可能误设的情况下推导ITT和CACE的识别条件;然后使用逆概率加权(IPW)构造非参数估计量。
  3. 主要结论:在近似邻域干扰(ANI)框架下,IPW估计量是相合且渐近正态的;暴露映射的误设会导致估计量估计一个“加权平均”的ITT/CACE,但该加权平均仍有因果解释。

关键设定与假设

完整设定(在第二节最小记号的基础上补充): - 潜在结果框架\( Y_i(\mathbf{z}, \mathbf{d}) \)\( D_i(\mathbf{z}) \) 是潜在结果,其中 \( \mathbf{z}, \mathbf{d} \in \{0, 1\}^n \)。 - SUTVA-like 假设:作者假设排他性约束\( Z_i \) 仅通过 \( D_i \) 影响 \( Y_i \))和单调性\( D_i(1) \geq D_i(0) \)),这是CACE识别的标准假设。 - 暴露映射:定义 \( \mathbf{h}(\mathbf{Z}) = (h_1(\mathbf{Z}), \dots, h_n(\mathbf{Z})) \),其中 \( h_i(\mathbf{Z}) \)\( \mathbf{Z} \) 的某个固定维度的函数(例如,\( h_i(\mathbf{Z}) = (Z_i, \sum_{j \in \mathcal{N}_i} Z_j) \))。关键:暴露映射是研究者指定的,可能正确也可能错误。 - 条件独立性\( Y_i(\mathbf{z}, \mathbf{d}) \perp \mathbf{Z} \mid \mathbf{h}(\mathbf{Z}) \)\( D_i(\mathbf{z}) \perp \mathbf{Z} \mid \mathbf{h}(\mathbf{Z}) \)。这是识别的基础。 - 近似邻域干扰(ANI):假设干扰随网络距离衰减,即存在一个“邻域半径” \( r \),使得个体 \( i \) 的结果只依赖于距离 \( \leq r \) 的邻居的处理。这用于渐近理论。

相比已有文献的放宽或强化: - 放宽:相比 Forastiere et al. (2021),本文不要求暴露映射已知且正确;相比 Hudgens and Halloran (2008),本文不要求部分干扰。 - 强化:相比 Leung (2022),本文引入了非依从性,因此需要额外的IV假设(排他性、单调性)。

主要结果

定理1(ITT的识别): - 陈述:在条件独立性假设下,ITT可以识别为:

\[\text{ITT}_i = \mathbb{E}\left[ \frac{Y_i \cdot \mathbf{1}\{Z_i = 1\}}{\mathbb{P}(Z_i = 1 \mid \mathbf{h}(\mathbf{Z}))} - \frac{Y_i \cdot \mathbf{1}\{Z_i = 0\}}{\mathbb{P}(Z_i = 0 \mid \mathbf{h}(\mathbf{Z}))} \right].\]
- 直觉:这是逆概率加权(IPW)的版本,其中权重是暴露映射的条件概率。如果暴露映射正确,则权重消除了干扰带来的混杂。 - 必要条件:暴露映射必须满足“重叠”条件(即,\( 0 < \mathbb{P}(Z_i = 1 \mid \mathbf{h}(\mathbf{Z})) < 1 \) 几乎必然)。 - 解决的技术难点:在暴露映射误设时,上述表达式仍然估计某个“加权平均”的ITT,但权重取决于误设程度。作者证明了这一点。

定理2(CACE的识别): - 陈述:在排他性约束和单调性下,CACE可以识别为:

\[\text{CACE}_i = \frac{\mathbb{E}\left[ \frac{Y_i \cdot \mathbf{1}\{Z_i = 1\}}{\mathbb{P}(Z_i = 1 \mid \mathbf{h}(\mathbf{Z}))} - \frac{Y_i \cdot \mathbf{1}\{Z_i = 0\}}{\mathbb{P}(Z_i = 0 \mid \mathbf{h}(\mathbf{Z}))} \right]}{\mathbb{E}\left[ \frac{D_i \cdot \mathbf{1}\{Z_i = 1\}}{\mathbb{P}(Z_i = 1 \mid \mathbf{h}(\mathbf{Z}))} - \frac{D_i \cdot \mathbf{1}\{Z_i = 0\}}{\mathbb{P}(Z_i = 0 \mid \mathbf{h}(\mathbf{Z}))} \right]}.\]
- 直觉:这是IV估计量的IPW版本,分子是ITT,分母是“依从者比例”的IPW估计。 - 必要条件:分母不为零(即,存在依从者)。

定理3(渐近正态性): - 陈述:在ANI框架下,IPW估计量 \( \widehat{\text{ITT}}_i \)\( \widehat{\text{CACE}}_i \)\( \sqrt{n} \)-相合且渐近正态的。 - 必要条件:网络是稀疏的(每个个体的邻居数有界),且暴露映射的维度固定。 - 解决的技术难点:ANI框架保证了干扰的“局部性”,从而使得估计量的方差可以控制。作者使用了U-统计量理论来推导渐近方差。

证明路线与技术技巧

整体路线: 1. 识别部分:在条件独立性假设下,将ITT和CACE表示为IPW形式。关键步骤是证明:

\[\mathbb{E}[Y_i \mid \mathbf{h}(\mathbf{Z})] = \mathbb{E}[Y_i(\mathbf{z}, \mathbf{d}) \mid \mathbf{h}(\mathbf{Z})],\]
这依赖于条件独立性。 2. 估计部分:使用非参数方法估计暴露映射的条件概率 \( \mathbb{P}(Z_i = 1 \mid \mathbf{h}(\mathbf{Z})) \)。作者建议使用核回归或系列估计。 3. 渐近理论:在ANI框架下,证明IPW估计量的相合性和渐近正态性。关键步骤是: - 将估计量分解为“oracle”部分(已知条件概率)和“估计误差”部分。 - 使用U-统计量理论处理估计误差,其中ANI保证了U-统计量的“退化”性质。 - 应用中心极限定理。

关键跳跃点: - 暴露映射的误设处理:当暴露映射误设时,条件独立性不成立。作者证明,此时IPW估计量仍然估计一个“加权平均”的ITT/CACE,其中权重是真实暴露映射与误设暴露映射的“差异”。这个结果依赖于一个关键引理:误设下的IPW估计量等价于一个“正确指定”的IPW估计量,但权重被重新校准。 - ANI框架下的方差控制:在ANI下,每个个体的结果只依赖于有限个邻居的处理,因此估计量的方差可以分解为“局部”项的和。作者使用Stein's method(或类似技术)来证明渐近正态性。

技术技巧点名: - 逆概率加权(IPW):用于消除干扰和混杂。 - U-统计量理论:用于处理估计量的方差分解,特别是在ANI框架下。 - 核回归/系列估计:用于非参数估计条件概率。 - Stein's method(可能):用于证明渐近正态性(作者未明确说明,但这是处理依赖数据的标准工具)。

真实例子与应用

数据:反冲突干预学校项目(Anti-Conflict Intervention School Program)的实验数据。这是一个随机对照试验,其中学校被随机分配接受反冲突干预(\( Z_i = 1 \))或对照(\( Z_i = 0 \))。学生可能不依从(即,实际参与干预 \( D_i \) 可能不等于分配)。网络由学生之间的友谊关系定义。

方法应用: - 定义暴露映射 \( h_i(\mathbf{Z}) = (Z_i, \sum_{j \in \mathcal{N}_i} Z_j) \),即个体自己的分配处理和邻居中被处理的数量。 - 使用IPW估计ITT和CACE,其中条件概率 \( \mathbb{P}(Z_i = 1 \mid \mathbf{h}(\mathbf{Z})) \) 通过核回归估计。 - 比较不同暴露映射(如只考虑自己的分配处理)的结果,以展示误设的影响。

结果: - 当暴露映射正确指定时,ITT估计为负(干预减少了冲突),CACE估计为更大的负值(依从者的效应更大)。 - 当暴露映射误设(只考虑自己的分配处理)时,ITT估计偏向零,表明误设导致低估效应。

这个例子想说明什么: - 验证理论:暴露映射的误设确实会导致偏差。 - 展示方法:IPW估计量在实际数据中可行。 - 强调重要性:在存在干扰时,忽略邻居的处理会导致严重的偏差。

🔎 结论是否比证明窄

  • 窄结论:定理1和2的识别结果依赖于条件独立性假设,但作者在实证例子中并未验证这一假设(例如,通过检验 \( Y_i \perp \mathbf{Z} \mid \mathbf{h}(\mathbf{Z}) \))。因此,结论的适用范围可能比证明窄——在实际中,条件独立性可能不成立,导致估计量有偏。
  • 泛泛 claim:作者声称方法适用于“未知干扰形式”,但渐近理论依赖于ANI框架(干扰随距离衰减)。如果干扰是“长程”的(例如,全局网络效应),则ANI不成立,渐近理论失效。作者在结论中未明确讨论这一限制。
  • Conjecture:作者在讨论中推测,暴露映射的误设可以通过“模型平均”或“交叉验证”来缓解,但未提供理论证明。这只是一个conjecture。

四、开放问题

  1. 暴露映射的选择:如何从数据中自动选择暴露映射?作者未提供数据驱动的选择方法。扎根于:论文第3节讨论“暴露映射的误设”,但未给出选择准则。
  2. 半参数效率:IPW估计量是否达到半参数效率界?作者未推导EIF。扎根于:论文第4节仅给出渐近方差,但未与效率界比较。
  3. 高维网络:当网络很大且稀疏时,ANI框架是否仍然成立?作者假设邻居数有界,但实际中网络可能更复杂。扎根于:论文第5节的ANI假设。
  4. 敏感性分析:当条件独立性假设不成立时,如何量化偏差?作者未提供敏感性分析工具。扎根于:论文第6节的“讨论”部分提到“未来工作可考虑放松条件独立性”。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论