Estimating a Continuous Treatment Model with Spillovers: A Control Function Approach¶
作者: Tadao Hoshino
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是存在网络溢出效应(spillover effects)的因果推断,具体而言,是当个体的处理变量(treatment)是连续型(continuous)时,如何识别和估计自身处理与邻居处理(通过社会网络加权平均)对个体结果的因果效应。该方向的核心挑战在于:自身处理与邻居处理通常都是内生变量(endogenous),且网络结构引入了复杂的依赖关系。当前该方向的成熟度处于“方法快速发展但仍有大量开放问题”的阶段,尤其是在连续处理设定下,识别与估计的理论尚不完整。
发展脉络(history)¶
作者在引言中梳理了以下发展脉络,我们将其串成一条线:
-
奠基工作:网络溢出效应的基本框架
- Manski (1993):提出了“反射问题”(reflection problem),奠定了社会交互效应(social interaction effects)的识别基础。作者引用其指出,在存在内生交互效应时,识别需要排除性限制(exclusion restrictions)。
- Bramoullé, Djebbari, and Fortin (2009):在Manski的基础上,证明了当网络中存在“不相连的个体”(intransitive triads)时,可以利用网络结构作为工具变量来识别线性社会交互模型。这是后续网络IV方法的理论基石。
-
主要进展:处理内生性与二元处理溢出
- Goldsmith-Pinkham and Imbens (2013):将网络溢出与处理效应(treatment effects)结合,但主要关注二元处理(binary treatment)和个体处理效应的异质性。作者引用其指出,该工作为网络环境下的因果推断提供了重要框架,但未处理连续处理。
- Liu (2022):研究了存在网络溢出时的连续处理模型,但假设处理是外生的(exogenous)。作者引用其指出,该工作是一个重要的特例,但内生性问题是实践中更常见的挑战。
- Hoshino and Yanagi (2023):作者自己的前期工作,研究了存在网络溢出时的内生二元处理模型,并提出了一个控制函数方法。本文是其向连续处理设定的自然推广。
-
当前Frontier:连续处理与内生性
- 本文 (Hoshino, 2024):在连续处理设定下,同时处理自身处理与邻居处理的内生性。作者采用控制函数方法(control function approach),结合工具变量,实现了非参数识别,并提出了一个半参数三步估计程序。
子线索聚类¶
这些被引文献大致落在以下两条子线索上:
-
线索一:社会交互效应的识别与估计(Manski, 1993; Bramoullé et al., 2009)
- 核心问题:如何从观测数据中区分内生交互效应(endogenous effects)、外生交互效应(exogenous/contextual effects)和相关效应(correlated effects)?
- 主流方法:利用网络结构(如不相连的个体)作为工具变量,在线性均值回归框架下进行识别。
- 与本文的关系:本文继承了这一线索中利用网络结构作为IV的思想,但将其应用场景从“线性均值结果”扩展到了“连续处理效应模型”。
-
线索二:网络环境下的因果推断(处理效应)(Goldsmith-Pinkham & Imbens, 2013; Liu, 2022; Hoshino & Yanagi, 2023)
- 核心问题:在存在网络溢出的情况下,如何定义和估计个体处理效应(如直接效应、溢出效应)?
- 主流方法:基于潜在结果框架(potential outcomes framework),假设处理分配机制(如无混淆性)或使用工具变量。现有工作多聚焦于二元处理。
- 与本文的关系:本文是这条线索在“连续处理”和“内生处理”两个维度上的交叉点,填补了现有文献的空白。
这个方向在追问的核心问题¶
- 识别问题:在存在网络溢出时,如何非参数地识别连续处理变量的直接效应和溢出效应,特别是当两者都是内生变量时?
- 估计问题:如何设计一个在实证上可行、且具有良好有限样本性质的估计程序(如半参数方法)?
- 工具变量选择:在网络环境中,什么样的变量可以作为有效的工具变量?如何利用网络结构本身来构造IV?
- 稳健性:当网络结构被误设(如测量误差、网络定义不准确)时,估计结果有多稳健?
⚠️ 作者的Framing¶
- 作者把缺口frame成什么:作者将现有文献的缺口明确表述为“没有工作同时处理连续处理、网络溢出和内生性”。Liu (2022) 处理了连续处理但假设外生性;Hoshino and Yanagi (2023) 处理了内生性但限于二元处理。因此,本文被定位为“显然的下一步”——将这两个方向结合。
- 哪些竞争路线被他淡化或回避了:
- 无混淆性(Unconfoundedness)路线:作者在引言中明确提到,当处理是内生时,基于无混淆性的方法(如逆概率加权、匹配)会失效,因此他选择控制函数/IV路线。但他没有深入讨论,在哪些条件下,无混淆性假设可能比IV假设更合理或更易满足。
- 双稳健(Doubly Robust)或去偏机器学习(DML)路线:作者没有提及或比较这些更现代的因果推断方法。这些方法在处理高维协变量和复杂模型时可能更具优势,但作者选择了更传统的三步估计。
- 什么明显该被引/该存在、却没出现在intro里?
- 关于网络溢出效应的非参数/半参数效率理论:例如,是否存在关于直接效应和溢出效应的半参数效率界(semiparametric efficiency bound)的文献?作者没有引用任何关于效率界的工作,这暗示本文可能没有追求最优的估计效率。
- 关于连续处理变量的广义倾向得分(Generalized Propensity Score, GPS)方法:在无混淆性假设下,GPS是处理连续处理的标准方法。作者没有讨论GPS方法在存在网络溢出时的可能扩展或局限性。
张力¶
未见明显对立引用。作者引用的工作基本是互补的,共同指向了“连续处理+网络溢出+内生性”这个未被探索的交叉点。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(i = 1, \dots, N\):个体索引。
- \(N\):样本量。
- \(T_i \in \mathbb{R}\):个体 \(i\) 的连续处理变量(continuous treatment),是内生变量。
- \(Y_i \in \mathbb{R}\):个体 \(i\) 的结果变量(outcome)。
- \(X_i \in \mathbb{R}^d\):个体 \(i\) 的外生协变量向量(exogenous covariates)。
- \(G\):\(N \times N\) 的邻接矩阵(adjacency matrix),\(G_{ij} = 1\) 如果 \(i\) 和 \(j\) 是邻居,否则为0。对角线元素 \(G_{ii} = 0\)。
- \(w_{ij}\):网络权重,通常定义为 \(w_{ij} = G_{ij} / \sum_{j} G_{ij}\),即对每个个体的邻居权重进行归一化。
- \(\bar{T}_i = \sum_{j \neq i} w_{ij} T_j\):个体 \(i\) 的邻居平均处理(neighbors' average treatment),是内生变量。
- \(Z_i \in \mathbb{R}^p\):个体 \(i\) 的工具变量向量(instrumental variables),与 \(T_i\) 和 \(\bar{T}_i\) 相关,但与误差项无关。
- \(U_i\):不可观测的混杂因素(unobserved confounders),影响 \(T_i\)、\(\bar{T}_i\) 和 \(Y_i\)。
- \(\epsilon_i\):外生误差项(exogenous error term),与 \(Z_i\) 和 \(X_i\) 无关。
- 潜在结果:\(Y_i(t, \bar{t})\),表示当个体 \(i\) 的处理被设为 \(t\),其邻居的平均处理被设为 \(\bar{t}\) 时的潜在结果。这是一个连续-连续的潜在结果函数。
- 目标参数(Estimand):条件均值潜在结果函数 \(m(t, \bar{t}, x) = \mathbb{E}[Y_i(t, \bar{t}) | X_i = x]\)。我们关心的是这个函数,特别是其对 \(t\) 和 \(\bar{t}\) 的偏导数(即直接效应和溢出效应)。
-
模型:
- 结果方程:\(Y_i = m(T_i, \bar{T}_i, X_i) + U_i + \epsilon_i\)。这里 \(m(\cdot)\) 是未知的结构函数(structural function),\(U_i\) 是未观测到的个体异质性(混杂因素)。
- 处理方程:\(T_i = h(Z_i, X_i) + V_i\),其中 \(V_i\) 是处理方程中的误差项,与 \(U_i\) 相关(导致内生性)。\(h(\cdot)\) 是未知函数。
- 内生性来源:\(U_i\) 与 \(T_i\) 和 \(\bar{T}_i\) 相关,因为 \(U_i\) 与 \(V_i\) 相关,而 \(V_i\) 驱动了 \(T_i\),进而通过网络结构驱动了 \(\bar{T}_i\)。
-
可观测数据:
- 研究者可以观测到:\(\{Y_i, T_i, X_i, Z_i, G\}_{i=1}^N\)。
- 研究者无法观测到:\(U_i\) 和 \(\epsilon_i\)。潜在结果 \(Y_i(t, \bar{t})\) 也是不可观测的,只能通过假设来识别其条件均值。
第二步:讲最小内核¶
本文的核心思路可以用一个线性模型的特例来理解。假设我们忽略协变量 \(X_i\),并假设结构函数是线性的:
这里,\(\alpha\) 是直接效应,\(\beta\) 是溢出效应。问题是 \(T_i\) 和 \(\bar{T}_i\) 都与 \(U_i\) 相关,所以OLS估计是有偏的。
控制函数方法的核心想法是:如果我们能找到一个“控制函数”(control function),它能够捕捉 \(U_i\) 中与 \(T_i\) 和 \(\bar{T}_i\) 相关的部分,那么我们就可以在回归中控制它,从而消除内生性偏误。
最小内核的推导: 1. 第一步:估计处理方程。我们假设处理方程也是线性的:\(T_i = \gamma Z_i + V_i\)。通过OLS回归 \(T_i\) 对 \(Z_i\),我们可以得到残差 \(\hat{V}_i = T_i - \hat{\gamma} Z_i\)。这个残差 \(\hat{V}_i\) 就是 \(V_i\) 的估计。 2. 第二步:构造控制函数。关键假设是,\(U_i\) 与 \(V_i\) 的关系是线性的:\(U_i = \lambda V_i + \eta_i\),其中 \(\eta_i\) 与 \(T_i\) 和 \(\bar{T}_i\) 无关。那么,原结果方程可以写成:
这个最小内核说明了什么: * 本文的核心数学困难在于:内生性不仅来自个体自身的处理,还通过网络结构传播到邻居的平均处理。因此,控制函数不能只包含个体自身的处理方程残差,还必须包含邻居的残差。 * 在非参数和半参数的一般设定下,这个想法被推广为:先用非参数方法估计 \(T_i\) 和 \(\bar{T}_i\) 的条件分布(给定IV),然后构造一个包含个体和邻居残差的多维控制函数,最后在结果方程中非参数地控制这个控制函数。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在存在网络溢出效应且处理变量为连续型时,如何识别和估计自身处理与邻居平均处理对结果的因果效应,其中两者均为内生变量。
- 核心工具/方法:采用控制函数方法(control function approach),利用工具变量(IV)构造一个包含个体自身和邻居处理方程残差的多维控制函数,从而在结果方程中控制不可观测的混杂因素。
- 主要结论:在适当的条件(如IV的排除性、网络结构的非退化性)下,条件均值潜在结果函数 \(m(t, \bar{t}, x)\) 可以被非参数识别。进一步,对于一个半参数模型(结果方程是部分线性的),作者提出了一个三步估计程序,并证明了其渐近正态性。
关键设定与假设¶
在第二节最小记号的基础上,本文的完整设定和关键假设如下:
-
设定:
- 结果方程:\(Y_i = m(T_i, \bar{T}_i, X_i) + \epsilon_i\),其中 \(\mathbb{E}[\epsilon_i | T_i, \bar{T}_i, X_i, U_i] = 0\)。注意,这里作者将不可观测的混杂因素 \(U_i\) 吸收进了 \(m(\cdot)\) 函数的非参数形式中,但内生性是通过 \(T_i\) 和 \(\bar{T}_i\) 与 \(m(\cdot)\) 中的未观测部分相关来体现的。更精确地说,作者假设存在一个不可观测的标量 \(U_i\),使得 \(m(t, \bar{t}, x) = \mathbb{E}[Y_i | T_i=t, \bar{T}_i=\bar{t}, X_i=x, U_i]\),并且 \(U_i\) 与 \(T_i\) 和 \(\bar{T}_i\) 相关。
- 处理方程:\(T_i = g(Z_i, X_i, U_i)\),其中 \(g(\cdot)\) 是未知函数,\(U_i\) 是导致内生性的标量混杂因素。\(Z_i\) 是工具变量。
- 关键假设(简化版):
- (A1)工具变量排除性:\(Z_i\) 与结果方程中的误差项无关,即 \(\mathbb{E}[\epsilon_i | Z_i, X_i, U_i] = 0\)。
- (A2)控制函数存在性:存在一个已知(或可估计)的“控制函数” \(V_i = \phi(T_i, Z_i, X_i)\),使得 \(U_i\) 的条件分布给定 \((T_i, Z_i, X_i)\) 只依赖于 \(V_i\)。在本文的设定中,\(V_i\) 被构造为处理方程 \(T_i = g(Z_i, X_i, U_i)\) 的“广义残差”,例如,如果 \(g\) 是单调的,则 \(V_i\) 可以是 \(U_i\) 本身(通过逆函数得到)。
- (A3)网络结构非退化:网络结构 \(G\) 是已知且固定的,并且满足某些正则条件,例如,每个个体的邻居数量不能太少,且网络不能是完全连通的(以保证有足够的变异性来识别溢出效应)。
- (A4)共同支撑:对于所有可能的 \((t, \bar{t}, x)\),控制函数 \(V_i\) 和 \(\bar{V}_i\) 的联合分布有足够的支撑,以保证非参数回归的可进行性。
-
相比已有文献的强化/放宽:
- 相比Liu (2022):放宽了处理外生性的假设,允许 \(T_i\) 和 \(\bar{T}_i\) 都是内生的。
- 相比Hoshino and Yanagi (2023):将处理变量从二元推广到连续,这带来了技术上的挑战,因为控制函数和识别条件需要适应连续处理的空间。
主要结果¶
-
定理1:非参数识别(Theorem 1)
- 陈述:在假设A1-A4下,条件均值潜在结果函数 \(m(t, \bar{t}, x)\) 可以被非参数识别。具体地,\(m(t, \bar{t}, x) = \mathbb{E}[Y_i | T_i=t, \bar{T}_i=\bar{t}, X_i=x, V_i=v, \bar{V}_i=\bar{v}]\),其中 \(v\) 和 \(\bar{v}\) 是控制函数 \(V_i\) 和 \(\bar{V}_i\) 在给定 \((t, \bar{t}, x)\) 下的特定值。
- 直觉:通过控制 \(V_i\) 和 \(\bar{V}_i\),我们有效地“固定”了不可观测的混杂因素 \(U_i\) 及其在网络中的传播,从而使得 \(T_i\) 和 \(\bar{T}_i\) 的变异性变得外生。因此,给定这些控制函数后,\(Y_i\) 对 \(T_i\) 和 \(\bar{T}_i\) 的条件期望就等于结构函数。
- 必要条件:工具变量 \(Z_i\) 必须能够解释 \(T_i\) 的变异性,并且网络结构必须提供足够的变异性来区分 \(T_i\) 和 \(\bar{T}_i\) 的效应。
- 解决的技术难点:如何将传统的标量控制函数方法扩展到包含网络溢出的多维情形。作者证明了,只需要控制个体自身的残差 \(V_i\) 和邻居平均残差 \(\bar{V}_i\) 这两个标量,就足以消除所有内生性偏误。
-
定理2:半参数三步估计的渐近性质(Theorem 2)
- 陈述:对于一个半参数模型,其中结果方程被假设为 \(Y_i = \alpha T_i + \beta \bar{T}_i + \gamma' X_i + \lambda(V_i, \bar{V}_i) + \epsilon_i\)(即 \(m(\cdot)\) 对 \(T_i, \bar{T}_i, X_i\) 是线性的,但对控制函数 \(V_i, \bar{V}_i\) 是未知的非参数函数),作者提出的三步估计量 \(\hat{\alpha}, \hat{\beta}, \hat{\gamma}\) 是 \(\sqrt{N}\)-一致且渐近正态的。
- 三步估计程序:
- 第一步:用非参数方法(如级数估计)估计处理方程 \(T_i = g(Z_i, X_i) + V_i\),得到残差 \(\hat{V}_i\)。
- 第二步:用非参数方法估计 \(\bar{V}_i\) 的代理变量,即 \(\hat{\bar{V}}_i = \sum_{j \neq i} w_{ij} \hat{V}_j\)。
- 第三步:用半参数方法(如部分线性回归)估计结果方程,其中 \(T_i, \bar{T}_i, X_i\) 作为线性部分,\(\hat{V}_i\) 和 \(\hat{\bar{V}}_i\) 作为非参数部分(通过级数或核方法)。
- 解决的技术难点:三步估计中,第一步和第二步的估计误差会传播到第三步。作者需要证明,这种传播不会破坏第三步估计量的 \(\sqrt{N}\)-收敛速度。这通常需要用到经验过程理论(empirical process theory)和U-统计量理论,以控制非参数估计的残余项。
证明路线与技术技巧¶
-
整体路线:
- 识别(Identification):证明在给定控制函数 \(V_i\) 和 \(\bar{V}_i\) 后,\(T_i\) 和 \(\bar{T}_i\) 的条件均值独立于误差项。这依赖于控制函数假设和网络结构的性质。
- 估计(Estimation):设计一个可行的三步估计程序。
- 渐近理论(Asymptotic Theory):证明三步估计量的渐近正态性。这通常包括:
- 线性化(Linearization):将三步估计量表示为样本均值的和加上一个可忽略的余项。
- 影响函数(Influence Function):推导出估计量的影响函数,这是证明渐近正态性的关键。
- 随机展开(Stochastic Expansion):使用经验过程理论来证明非参数第一步估计的误差对第三步的影响是可忽略的。
-
关键跳跃点:
- 控制函数的构造:如何从连续处理方程中提取一个标量的控制函数 \(V_i\)?作者假设处理方程 \(T_i = g(Z_i, X_i, U_i)\) 关于 \(U_i\) 是严格单调的,从而可以通过逆函数 \(U_i = g^{-1}(T_i, Z_i, X_i)\) 来定义 \(V_i = U_i\)。这是一个很强的假设,但也是控制函数方法在连续处理设定下的标准做法。
- 邻居平均控制函数的必要性:证明仅仅控制 \(V_i\) 是不够的,必须同时控制 \(\bar{V}_i\)。这是本文的核心洞察,也是与标准控制函数方法的关键区别。
- 三步估计的渐近方差:推导出三步估计量的渐近方差表达式,并证明它可以通过样本进行一致估计。
-
技术技巧点名:
- 经验过程理论(Empirical Process Theory):用于处理非参数第一步估计(如级数估计)的随机误差,并证明这些误差在第三步中可以被“平均掉”。
- U-统计量理论(U-statistics Theory):由于 \(\bar{V}_i\) 是其他个体残差的加权平均,第三步估计中会涉及到U-统计量类型的项。作者需要用到U-统计量的渐近理论来控制这些项。
- 级数估计(Series Estimation):用于非参数地估计处理方程和结果方程中的非参数部分(如 \(\lambda(V_i, \bar{V}_i)\))。
- 部分线性模型(Partially Linear Model):半参数模型的选择使得作者可以利用Robinson (1988) 的经典方法进行估计,这简化了渐近理论。
真实例子与应用¶
- 数据/场景:作者使用日本47个都道府县(prefectures)的年度面板数据(1983-2013),研究区域失业率对犯罪率的因果效应。网络被定义为地理上的邻近关系(共享边界的都道府县)。
- 如何应用:
- 处理变量 \(T_i\):都道府县 \(i\) 在年份 \(t\) 的失业率。
- 邻居平均处理 \(\bar{T}_i\):与都道府县 \(i\) 相邻的所有都道府县在年份 \(t\) 的平均失业率。
- 结果变量 \(Y_i\):都道府县 \(i\) 在年份 \(t\) 的犯罪率(如每10万人中的犯罪案件数)。
- 工具变量 \(Z_i\):作者使用滞后一期的全国失业率与都道府县特定的人口结构(如年轻人口比例) 的交互项作为工具变量。其逻辑是,全国性经济冲击会影响地方失业率,但与地方犯罪率的直接关联较弱(通过地方失业率间接影响)。
- 控制函数:通过第一步回归得到残差 \(\hat{V}_i\) 和 \(\hat{\bar{V}}_i\),然后在第三步中控制它们。
- 结果:
- 作者发现,自身失业率对犯罪率有显著的正向直接效应。
- 邻居平均失业率对犯罪率也有显著的正向溢出效应,即一个地区的失业率上升会推高邻近地区的犯罪率。
- 与不考虑内生性的OLS估计相比,控制函数方法得到的效应估计值更大,表明OLS可能因遗漏变量(如地方执法力度、社会资本)而低估了真实效应。
- 这个例子想说明什么:
- 验证理论:展示所提出的方法在真实数据上的可行性。
- 展示相对baseline的优势:通过与OLS和忽略溢出效应的模型进行比较,说明考虑内生性和网络溢出效应的重要性,以及控制函数方法在纠正偏误方面的作用。
🔎 结论是否比证明窄¶
- 作者在定理1中声称非参数识别了 \(m(t, \bar{t}, x)\),但该识别依赖于控制函数 \(V_i\) 是标量的假设(即不可观测的混杂因素 \(U_i\) 是标量)。如果存在多个维度的不可观测混杂因素,该识别策略可能失效。作者在文中承认了这一限制(见Section 2.1末尾的讨论),但并未在主要结论中强调这一点。
- 三步估计的渐近正态性证明依赖于一系列正则条件(如核函数、带宽选择、级数项数等),这些条件在实证中可能难以验证。作者在定理2的陈述中列出了这些条件,但并未讨论当这些条件不满足时估计量的行为。
四、开放问题¶
- 多维混杂因素:本文的识别依赖于不可观测的混杂因素 \(U_i\) 是标量的假设。要证什么:如何将控制函数方法扩展到存在多维不可观测混杂因素(即 \(U_i\) 是向量)的情形?这可能需要更复杂的工具变量策略或不同的识别假设。扎根点:Section 2.1末尾作者对“标量 \(U_i\)”假设的讨论。
- 网络内生性:本文假设网络结构 \(G\) 是外生给定的。要估什么:当网络本身是内生的(例如,个体选择与谁成为朋友,而这种选择与结果相关)时,如何识别和估计处理效应?扎根点:作者在引言中提到了“网络形成”(network formation)问题,但未在本文中处理。
- 高维网络与稀疏性:本文的渐近理论假设网络规模 \(N\) 固定或增长缓慢。要算什么:当网络规模 \(N\) 很大且网络结构稀疏时,三步估计的计算复杂度和统计性质如何?是否存在更高效的算法?扎根点:本文的估计程序需要计算所有个体的邻居平均残差,这在大型网络中计算量是 \(O(N^2)\)。
- 效率界与最优估计:本文提出的三步估计量是否是半参数有效的?要证什么:对于所考虑的半参数模型,直接效应 \(\alpha\) 和溢出效应 \(\beta\) 的半参数效率界(semiparametric efficiency bound)是什么?是否存在可以达到该效率界的估计量(如去偏机器学习方法)?扎根点:本文没有讨论效率问题,这是一个自然的理论延伸。
Maintained by 陈星宇 · Homepage · Source on GitHub