Semiparametric Spatial Autoregressive Panel Data Model with Fixed Effects and Time-Varying Coefficients¶
作者: Xuan Liang, Jiti Gao, Xiaodong Gong
来源: Journal of Business & Economic Statistics
主题: 非参数 / 半参数
相关性: 6/10
机构绿灯: Australian National University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2021.1979564
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向致力于在面板数据(panel data) 的框架下,同时处理空间依赖(spatial dependence) 和模型参数的非参数时变性(nonparametric time-varying coefficients)。其根本的统计问题是:当观测数据同时具有截面间的空间相关性(如相邻城市的经济产出相互影响)和时间维度上的结构变化(如资本对产出的弹性随时间变化)时,如何有效地进行参数估计和统计推断。当前该领域的成熟度处于方法扩展期——已有大量工作分别处理空间面板或时变系数,但将两者结合并给出完整渐近理论的半参数模型尚属少数。
发展脉络(history)¶
根据本文引言及其引用的文献,该方向的发展脉络可梳理如下:
-
奠基工作:空间面板数据模型的参数化处理
- Anselin (1988) 和 Elhorst (2003, 2014):奠定了空间计量经济学的基础,特别是空间自回归(SAR)面板数据模型的极大似然估计(MLE)和工具变量(IV)方法。这些工作假设所有系数(包括空间自回归系数ρ和解释变量系数β)都是常数。
- Lee & Yu (2010):在固定效应SAR面板模型下,系统地研究了MLE的渐近性质,解决了因固定效应带来的“incidental parameter problem”。这是本文直接依赖的核心技术基础之一。
-
主要进展:引入时变系数
- Cai (2007) 和 Li et al. (2011):将非参数时变系数引入面板数据模型,但未考虑空间依赖。他们使用局部线性或核方法估计系数函数β(t),并建立了渐近正态性。这为本文的时变系数部分提供了方法论来源。
- Su & Ullah (2006) 和 Sun et al. (2009):在非空间面板中处理了更一般的非参数和半参数时变结构。
-
当前Frontier:同时处理空间依赖与时变系数
- 本文 (Liang, Gao & Gong, 2022) 的位置:作者明确指出,现有文献要么处理空间依赖(假设系数常数),要么处理时变系数(假设无空间依赖)。本文的贡献在于首次(作者声称)将两者结合,提出一个半参数SAR面板数据模型,其中空间自回归系数ρ和误差方差σ²为常数,而解释变量的系数β(t)为时间的未知光滑函数。这填补了“空间依赖”与“结构变化”之间的交叉空白。
子线索聚类¶
这些被引文献大致落在两条子线索上:
-
线索一:空间面板数据模型(参数)
- 核心问题:如何一致且有效地估计空间自回归系数ρ和解释变量系数β,并处理固定效应。
- 代表工作:Anselin (1988), Elhorst (2003, 2014), Lee & Yu (2010)。
- 当前瓶颈:假设所有系数不随时间变化,无法捕捉经济关系的结构性演变。
-
线索二:时变系数面板数据模型(非空间)
- 核心问题:如何用非参数方法估计随时间平滑变化的系数β(t),并建立推断。
- 代表工作:Cai (2007), Li et al. (2011), Su & Ullah (2006)。
- 当前瓶颈:假设截面独立,忽略了空间溢出效应,可能导致估计偏误和无效推断。
这个方向在追问的核心问题¶
- 识别问题:在同时存在空间滞后项(Wy)和时变系数β(t)的情况下,模型参数(ρ, σ², β(t))是否可被唯一识别?需要哪些排除性限制?
- 估计方法:如何设计一个计算可行且统计高效的估计程序?直接对非线性似然函数进行局部线性化是否可行?
- 渐近理论:在N(截面数)和T(时间长度)都趋于无穷的双重渐近框架下,估计量的收敛速度、渐近分布是什么?固定效应带来的偏差如何修正?
- 推断问题:如何对时变系数β(t)进行逐点或同时置信带构建?如何检验系数是否真的随时间变化(即H0: β(t) = β)?
⚠️ 作者的Framing¶
- 作者的缺口定位:作者将缺口明确frame为“现有空间面板模型是常系数”与“现有非空间时变系数模型忽略空间依赖”之间的空白。因此,本文是“显然的下一步”——将两个成熟但独立的子领域合并。
- 被淡化/回避的竞争路线:
- 完全非参数的空间-时间模型:作者回避了将空间权重矩阵W也建模为时间的函数(即W(t)),或允许ρ(t)也随时间变化。这大大简化了模型,但可能限制了应用范围。
- 工具变量(IV)/ GMM方法:作者选择了拟极大似然(QML)方法,而回避了在空间计量中同样流行的IV/GMM路线。IV方法在处理内生性时可能更灵活,但作者未讨论为何QML在此设定下更优。
- 值得研究者去查的问题:
- 缺失的引用:引言中未提及动态空间面板模型(如包含滞后因变量Wy_{t-1})的文献。这类模型也处理时间维度,但机制不同(状态依赖 vs. 系数变化)。作者为何不讨论或对比?这可能是一个未被充分讨论的竞争性解释。
- 缺失的引用:未提及因子模型(Factor Model) 或交互固定效应(Interactive Fixed Effects) 文献(如Bai, 2009)。这些模型通过潜因子捕捉截面间的强相关性和时变结构,与空间模型(通过已知权重矩阵W捕捉局部相关性)是两种不同的建模哲学。作者为何选择空间模型而非因子模型?这背后是对空间结构先验知识的依赖程度问题。
张力¶
未见明显对立引用。所有被引工作都在各自的简化假设下推进,彼此之间没有直接矛盾,只是覆盖了不同的模型特征(空间 vs. 时变)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( i = 1, \dots, N \):截面单位(如城市)的索引。
- \( t = 1, \dots, T \):时间周期的索引。
- \( y_{it} \):第 \( i \) 个截面在第 \( t \) 期的因变量(可观测标量)。
- \( \mathbf{y}_t = (y_{1t}, \dots, y_{Nt})' \):第 \( t \) 期的因变量向量(\( N \times 1 \))。
- \( \mathbf{x}_{it} \):第 \( i \) 个截面在第 \( t \) 期的 \( k \times 1 \) 解释变量向量(可观测)。
- \( \mathbf{X}_t = (\mathbf{x}_{1t}, \dots, \mathbf{x}_{Nt})' \):第 \( t \) 期的解释变量矩阵(\( N \times k \))。
- \( \mathbf{W} \):已知的 \( N \times N \) 空间权重矩阵,对角线为0,行标准化(每行和为1)。它编码了截面间的空间邻接或距离关系。
- \( \rho \):空间自回归系数(标量常数),衡量空间溢出效应的强度。\( |\rho| < 1 \) 保证模型平稳。
- \( \boldsymbol{\beta}(t) = (\beta_1(t), \dots, \beta_k(t))' \):\( k \times 1 \) 时变系数向量,是时间 \( t \) 的未知光滑函数(待估的非参数部分)。
- \( \mu_i \):第 \( i \) 个截面的固定效应(标量常数),捕捉不随时间变化的个体异质性。
- \( \boldsymbol{\mu} = (\mu_1, \dots, \mu_N)' \):固定效应向量(\( N \times 1 \))。
- \( \varepsilon_{it} \):第 \( i \) 个截面在第 \( t \) 期的误差项(不可观测标量)。
- \( \boldsymbol{\varepsilon}_t = (\varepsilon_{1t}, \dots, \varepsilon_{Nt})' \):第 \( t \) 期的误差向量(\( N \times 1 \))。
- \( \sigma^2 \):误差项的方差(标量常数),假设 \( \varepsilon_{it} \) 独立同分布,均值为0,方差为 \( \sigma^2 \)。
- \( \mathbf{S}_t(\rho) = \mathbf{I}_N - \rho \mathbf{W} \):\( N \times N \) 矩阵,用于简化模型表达。
- \( \boldsymbol{\theta} = (\rho, \sigma^2)' \):模型的参数部分(有限维)。
- \( \tau = t/T \):归一化时间,将时间区间映射到 [0, 1]。
-
模型: 本文的核心模型是:
\[\mathbf{y}_t = \rho \mathbf{W} \mathbf{y}_t + \mathbf{X}_t \boldsymbol{\beta}(t) + \boldsymbol{\mu} + \boldsymbol{\varepsilon}_t, \quad t = 1, \dots, T\]或者写成简化形式:\[\mathbf{y}_t = \mathbf{S}_t(\rho)^{-1} \left( \mathbf{X}_t \boldsymbol{\beta}(t) + \boldsymbol{\mu} + \boldsymbol{\varepsilon}_t \right)\]这是一个半参数模型,因为:- 参数部分:\( \rho \) 和 \( \sigma^2 \) 是未知常数。
- 非参数部分:\( \boldsymbol{\beta}(t) \) 是未知的光滑函数。
- 讨厌参数:\( \mu_i \) 是 \( N \) 个固定效应,其数量随 \( N \) 增长,属于“incidental parameters”。
-
可观测数据: 研究者能观测到的是:
- \( \{ \mathbf{y}_t, \mathbf{X}_t \}_{t=1}^T \):所有时间点的因变量向量和解释变量矩阵。
- \( \mathbf{W} \):已知的空间权重矩阵。 研究者无法直接观测到的是:
- \( \boldsymbol{\beta}(t) \):时变系数函数。
- \( \rho, \sigma^2 \):常数参数。
- \( \mu_i \):固定效应。
- \( \varepsilon_{it} \):误差项。 识别和估计的核心就是仅凭可观测数据,在模型假设下,反推出这些不可观测的量。
第二步:讲最小内核¶
本文的最小内核是一个仅有两个截面(N=2)、一个解释变量(k=1)、且无固定效应(μ_i=0)的特例。在这个特例下,核心思路变得极其清晰。
-
最简特例设定:
- \( N = 2 \),\( k = 1 \)。空间权重矩阵为 \( \mathbf{W} = \begin{pmatrix} 0 & 1 \\ 1 & 0 \end{pmatrix} \)(行标准化后,每个截面只受另一个截面影响)。
- 无固定效应:\( \mu_1 = \mu_2 = 0 \)。
- 模型退化为:
\[\begin{pmatrix} y_{1t} \\ y_{2t} \end{pmatrix} = \rho \begin{pmatrix} 0 & 1 \\ 1 & 0 \end{pmatrix} \begin{pmatrix} y_{1t} \\ y_{2t} \end{pmatrix} + \begin{pmatrix} x_{1t} \\ x_{2t} \end{pmatrix} \beta(t) + \begin{pmatrix} \varepsilon_{1t} \\ \varepsilon_{2t} \end{pmatrix}\]即:\[y_{1t} = \rho y_{2t} + x_{1t} \beta(t) + \varepsilon_{1t}\]\[y_{2t} = \rho y_{1t} + x_{2t} \beta(t) + \varepsilon_{2t}\]
-
核心思路:
-
消除空间依赖:将模型写成简化形式。对于 \( t \) 时刻,有:
\[\mathbf{y}_t = \mathbf{S}(\rho)^{-1} \mathbf{X}_t \beta(t) + \mathbf{S}(\rho)^{-1} \boldsymbol{\varepsilon}_t\]其中 \( \mathbf{S}(\rho) = \mathbf{I}_2 - \rho \mathbf{W} = \begin{pmatrix} 1 & -\rho \\ -\rho & 1 \end{pmatrix} \)。其逆矩阵为 \( \mathbf{S}(\rho)^{-1} = \frac{1}{1-\rho^2} \begin{pmatrix} 1 & \rho \\ \rho & 1 \end{pmatrix} \)。 -
写出似然函数:给定 \( \rho \) 和 \( \beta(t) \),\( \mathbf{y}_t \) 的条件分布是多元正态(假设 \( \varepsilon_{it} \) 正态)。其对数似然函数(忽略常数项)为:
\[\ell_t(\rho, \sigma^2, \beta(t)) = -\frac{1}{2} \log(\sigma^2) + \log |\mathbf{S}(\rho)| - \frac{1}{2\sigma^2} \left( \mathbf{S}(\rho) \mathbf{y}_t - \mathbf{X}_t \beta(t) \right)' \left( \mathbf{S}(\rho) \mathbf{y}_t - \mathbf{X}_t \beta(t) \right)\]其中 \( \log |\mathbf{S}(\rho)| = \log(1-\rho^2) \) 是雅可比项,它来源于从 \( \boldsymbol{\varepsilon}_t \) 到 \( \mathbf{y}_t \) 的变换。 -
局部线性化:对于任意给定的时间点 \( \tau_0 = t_0/T \),假设 \( \beta(t) \) 在 \( t_0 \) 附近是光滑的,可以用局部线性近似:
\[\beta(t) \approx \beta(t_0) + \beta'(t_0)(t - t_0)\]其中 \( \beta'(t_0) \) 是导数。 -
局部拟极大似然估计(Local Linear QMLE):
- 目标:在 \( t_0 \) 的邻域内,最大化加权的对数似然函数。权重由核函数 \( K(\cdot) \) 和带宽 \( h \) 决定。
- 具体地,我们求解:
\[\max_{\rho, \sigma^2, a, b} \sum_{t=1}^T K\left(\frac{t - t_0}{h}\right) \ell_t(\rho, \sigma^2, a + b(t-t_0))\]其中 \( a = \beta(t_0) \),\( b = \beta'(t_0) \)。
-
为什么这个特例能说明核心思路:
- 雅可比项:\( \log(1-\rho^2) \) 的存在使得估计 \( \rho \) 时必须考虑空间结构,这与非空间模型(\( \rho=0 \))有本质区别。
- 内生性:\( y_{2t} \) 出现在 \( y_{1t} \) 的方程中,且 \( y_{2t} \) 本身也依赖于 \( \varepsilon_{1t} \)(通过 \( \mathbf{S}(\rho)^{-1} \)),因此 \( y_{2t} \) 与 \( \varepsilon_{1t} \) 相关。这就是空间自回归模型的内生性来源。QMLE通过最大化联合似然(而非条件似然)来处理这种内生性。
- 局部化:通过核权重,我们将一个全局的时变系数问题,转化为一系列局部的“常数系数”问题。在每个局部,模型近似于一个标准的SAR模型,可以用标准的QMLE理论处理。
- 核心困难:这个最小内核揭示了本文的核心困难在于同时处理:① 由空间滞后项 \( \rho \mathbf{W} \mathbf{y}_t \) 带来的内生性;② 由固定效应 \( \mu_i \) 带来的 incidental parameter problem;③ 由时变系数 \( \beta(t) \) 带来的非参数收敛速度问题。在 \( N=2 \) 的特例中,固定效应被省略,但内生性和非参数问题依然存在。
-
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文提出了一个半参数空间自回归面板数据模型,其中解释变量的系数是时间的未知光滑函数,而空间自回归系数和误差方差是常数,并考虑了固定效应。
- 核心工具/方法:提出了一种局部线性拟极大似然估计(Local Linear QMLE) 方法,通过将核加权似然函数与剖面似然(profile likelihood)技巧相结合,同时估计常数参数(\( \rho, \sigma^2 \))和非参数时变系数(\( \beta(t) \))。
- 主要结论:在正则条件下,证明了 \( \rho \) 和 \( \sigma^2 \) 的估计量是 \( \sqrt{NT} \)-一致的且渐近正态的;非参数估计量 \( \hat{\beta}(t) \) 具有标准的非参数收敛速度(\( \sqrt{Nh} \)),并且也是渐近正态的。蒙特卡洛模拟验证了有限样本性能,应用研究揭示了中国城市劳动报酬存在显著空间依赖且影响因素随时间变化。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 模型:\( \mathbf{y}_t = \rho \mathbf{W} \mathbf{y}_t + \mathbf{X}_t \boldsymbol{\beta}(t) + \boldsymbol{\mu} + \boldsymbol{\varepsilon}_t \)
- 关键假设:
- 误差项:\( \varepsilon_{it} \) 独立同分布,均值为0,方差为 \( \sigma^2 \),且四阶矩有限。相比已有文献:这是标准假设,未放宽。
- 空间权重矩阵:\( \mathbf{W} \) 是已知、非随机、行标准化的矩阵,对角线为0。\( \mathbf{I}_N - \rho \mathbf{W} \) 对所有 \( |\rho| < 1 \) 非奇异。相比已有文献:这是标准假设。
- 固定效应:\( \mu_i \) 是未知常数,可能与 \( \mathbf{X}_t \) 相关。相比已有文献:这是标准假设,允许任意相关性。
- 时变系数:\( \beta_j(t) \) 在 \( [0,1] \) 上二阶连续可导。相比已有文献:这是非参数回归的标准光滑性假设。
- 核函数与带宽:核函数 \( K(\cdot) \) 是对称、有界、二阶核。带宽 \( h \) 满足 \( h \to 0 \),\( Nh \to \infty \),\( Nh^5 \to 0 \)(即 undersmoothing,用于消除渐近偏差)。相比已有文献:这是局部线性估计的标准条件。
- 双重渐近:\( N, T \to \infty \) 且 \( N/T \to c \in (0, \infty) \)。相比已有文献:这是面板数据渐近理论的标准框架,允许 \( N \) 和 \( T \) 同阶增长。
- 识别条件:解释变量 \( \mathbf{X}_t \) 是外生的(\( E[\varepsilon_{it} | \mathbf{X}] = 0 \)),且与固定效应 \( \mu_i \) 相关。相比已有文献:这是标准假设,但未讨论弱工具变量或内生解释变量的情况,这是一个局限。
主要结果¶
本文的理论结果主要体现在两个定理中:
-
定理1(常数参数的渐近性质):
- 陈述:在正则条件下,QMLE \( \hat{\rho} \) 和 \( \hat{\sigma}^2 \) 是 \( \sqrt{NT} \)-一致的,且:
\[\sqrt{NT} \begin{pmatrix} \hat{\rho} - \rho_0 \\ \hat{\sigma}^2 - \sigma_0^2 \end{pmatrix} \xrightarrow{d} N(0, \boldsymbol{\Sigma})\]其中 \( \boldsymbol{\Sigma} \) 是渐近协方差矩阵,其具体形式由论文给出。
- 直觉:这个结果说明,尽管模型包含非参数部分 \( \beta(t) \),但常数参数 \( \rho \) 和 \( \sigma^2 \) 仍然可以以参数速率(\( \sqrt{NT} \))被估计。这是因为对 \( \beta(t) \) 的估计(收敛速度为 \( \sqrt{Nh} \))带来的误差,在估计 \( \rho \) 和 \( \sigma^2 \) 时是渐近可忽略的(通过 undersmoothing 实现)。
- 必要条件:\( N, T \to \infty \),且带宽 \( h \) 满足 undersmoothing 条件。
- 解决的技术难点:如何从剖面似然中推导出 \( \rho \) 和 \( \sigma^2 \) 的得分函数和信息矩阵,并证明其渐近正态性。难点在于处理非参数部分带来的“生成回归量(generated regressor)”问题。
- 陈述:在正则条件下,QMLE \( \hat{\rho} \) 和 \( \hat{\sigma}^2 \) 是 \( \sqrt{NT} \)-一致的,且:
-
定理2(非参数系数的渐近性质):
- 陈述:在正则条件下,对于任意 \( \tau_0 \in (0,1) \),局部线性QMLE \( \hat{\beta}(\tau_0) \) 是 \( \sqrt{Nh} \)-一致的,且:
\[\sqrt{Nh} \left( \hat{\beta}(\tau_0) - \beta(\tau_0) - \text{bias} \right) \xrightarrow{d} N(0, \boldsymbol{\Omega})\]其中 bias 是 \( O(h^2) \) 阶的,\( \boldsymbol{\Omega} \) 是渐近协方差矩阵。
- 直觉:这个结果说明,\( \beta(t) \) 的估计量达到了非参数回归的标准最优收敛速度 \( \sqrt{Nh} \)。其渐近方差形式与标准局部线性估计类似,但需要调整以反映空间依赖和 \( \rho \) 的估计误差。
- 必要条件:\( N, T \to \infty \),\( h \to 0 \),\( Nh \to \infty \)。
- 解决的技术难点:如何证明在估计 \( \beta(t) \) 时,用 \( \hat{\rho} \) 代替真实 \( \rho_0 \) 带来的影响是渐近可忽略的。这需要证明 \( \hat{\rho} \) 的收敛速度(\( \sqrt{NT} \))快于 \( \hat{\beta}(t) \) 的收敛速度(\( \sqrt{Nh} \)),从而保证“插件法(plug-in)”的有效性。
- 陈述:在正则条件下,对于任意 \( \tau_0 \in (0,1) \),局部线性QMLE \( \hat{\beta}(\tau_0) \) 是 \( \sqrt{Nh} \)-一致的,且:
证明路线与技术技巧(理论型)¶
-
整体路线:
- 剖面似然(Profile Likelihood):将模型视为关于 \( \rho, \sigma^2 \) 和 \( \beta(t) \) 的优化问题。对于给定的 \( \rho, \sigma^2 \),可以显式地(或通过局部线性回归)得到 \( \beta(t) \) 的估计 \( \hat{\beta}(t; \rho, \sigma^2) \)。将这个估计代回原似然函数,得到一个只关于 \( \rho, \sigma^2 \) 的“剖面似然函数”。
- 估计常数参数:最大化剖面似然函数,得到 \( \hat{\rho}, \hat{\sigma}^2 \)。这一步的证明依赖于标准M估计理论,但需要处理非参数部分带来的影响。关键引理是证明剖面得分函数的渐近线性展开(influence function representation)。
- 估计非参数系数:将 \( \hat{\rho}, \hat{\sigma}^2 \) 代入,通过局部线性QMLE得到 \( \hat{\beta}(t) \)。这一步的证明依赖于局部线性估计的标准理论,但需要证明 \( \hat{\rho} \) 的估计误差不影响 \( \hat{\beta}(t) \) 的一阶渐近分布。
- 联合渐近分布:结合前两步,利用Cramér-Wold定理和中心极限定理,推导出所有估计量的联合渐近分布。
-
关键跳跃点:
- 跳跃点1:证明剖面似然函数对 \( \rho \) 的得分函数可以写成 \( \sum_{t=1}^T \sum_{i=1}^N \) 形式的独立和(加上一个可忽略的余项)。这需要利用U-statistics的Hájek投影或类似技巧,因为原始得分函数涉及 \( \mathbf{S}(\rho)^{-1} \),它耦合了所有截面。
- 跳跃点2:证明在估计 \( \beta(t) \) 时,用 \( \hat{\rho} \) 代替 \( \rho_0 \) 带来的误差是 \( o_p(1/\sqrt{Nh}) \) 阶的。这需要证明 \( \hat{\rho} - \rho_0 = O_p(1/\sqrt{NT}) \),而 \( 1/\sqrt{NT} = o(1/\sqrt{Nh}) \)(因为 \( h \to 0 \) 且 \( Nh \to \infty \))。这个“速率比较”是证明插件法有效性的核心。
-
技术技巧点名:
- 局部线性回归(Local Linear Regression):用于估计 \( \beta(t) \) 及其导数。
- 拟极大似然估计(QMLE):即使误差项非正态,估计量仍然一致且渐近正态。
- 剖面似然(Profile Likelihood):将半参数问题转化为参数问题,简化了常数参数的估计和推断。
- 泰勒展开与高阶展开:用于推导得分函数的渐近线性表示。
- 核光滑(Kernel Smoothing):用于局部化似然函数。
- U-统计量投影(Hájek Projection):用于处理空间依赖带来的复杂相关性结构。
真实例子与应用¶
- 使用的数据/场景:中国地级及以上城市的劳动报酬数据。数据集包含 \( N = 285 \) 个城市,时间跨度为 \( T = 10 \) 年(2003-2012)。解释变量包括:资本存量(capital)、外商直接投资(FDI)、经济结构(第二产业占比,industry)、人力资本(教育支出,education)等。空间权重矩阵 \( \mathbf{W} \) 基于城市间的地理距离构建。
- 如何应用本文方法:将本文提出的半参数SAR面板数据模型应用于该数据集。估计了常数空间自回归系数 \( \rho \) 和误差方差 \( \sigma^2 \),并估计了每个解释变量对劳动报酬影响的时变系数 \( \beta_j(t) \)。
- 得到的结果:
- 空间依赖:\( \hat{\rho} \) 显著为正(约0.6-0.7),表明中国城市间的劳动报酬存在显著的正向空间溢出效应——一个城市的劳动报酬提高会带动其邻近城市的劳动报酬提高。
- 时变影响:资本、FDI和经济结构对劳动报酬的影响随时间变化。例如,资本的影响在2008年金融危机后有所下降,而经济结构(工业化)的影响在样本后期有所上升。人力资本的影响则相对稳定。
- 这个例子想说明什么:
- 验证理论:展示了所提方法在有限样本下的可行性,并得到了符合经济直觉的结果。
- 展示相对优势:通过与常系数SAR模型和忽略空间依赖的时变系数模型进行对比(通过模型选择准则如AIC/BIC,或预测表现),作者可以论证本文模型的优越性。例如,常系数模型会错误地认为资本的影响是恒定的,而忽略空间依赖的模型会遗漏空间溢出效应,导致对 \( \beta(t) \) 的估计有偏。
🔎 结论是否比证明窄¶
- 窄结论1:定理1和2的渐近正态性依赖于 \( N, T \to \infty \) 且 \( N/T \to c \in (0, \infty) \)。作者在结论部分可能泛泛地说“适用于面板数据”,但证明严格依赖于这个双重渐近框架。对于 \( T \) 固定而 \( N \) 很大的“短面板”,结论是否成立未经证明。
- 窄结论2:证明中假设了误差项 \( \varepsilon_{it} \) 的独立同分布和同方差。结论部分可能声称方法对异方差稳健,但论文并未提供异方差稳健的标准误公式或理论证明。这是一个明显的gap。
- 窄结论3:模型假设空间权重矩阵 \( \mathbf{W} \) 是已知且固定的。结论部分可能暗示方法可用于未知 \( \mathbf{W} \) 的情况,但所有理论都依赖于 \( \mathbf{W} \) 已知。这是一个很强的假设,在实际应用中,\( \mathbf{W} \) 的设定往往是主观且有争议的。
四、开放问题¶
-
异方差和序列相关下的稳健推断:本文假设误差项 \( \varepsilon_{it} \) 独立同分布。在面板数据中,异方差和序列相关很常见。扎根于:论文假设部分(Assumption A1)和定理证明中对协方差矩阵的推导。一个直接的开放问题是:如何构造对异方差和序列相关稳健的标准误,并证明其有效性?
-
空间权重矩阵 \( \mathbf{W} \) 的未知性:本文假设 \( \mathbf{W} \) 已知。但在许多应用中,\( \mathbf{W} \) 的设定(如基于距离的阈值、经济距离等)是模型选择的一部分。扎根于:模型设定部分。开放问题是:当 \( \mathbf{W} \) 未知或包含待估参数时,如何同时估计 \( \mathbf{W} \) 和模型参数?这可能导致识别问题。
-
内生解释变量:本文假设 \( \mathbf{X}_t \) 是外生的。但在经济应用中,解释变量(如政策变量)往往具有内生性。扎根于:识别条件部分。开放问题是:如何将工具变量(IV)或控制函数(Control Function)方法引入本文的半参数SAR框架,以处理内生解释变量?
-
时变空间效应:本文假设空间自回归系数 \( \rho \) 是常数。但在长期面板中,空间依赖的强度本身也可能随时间变化。扎根于:模型设定部分(\( \rho \) 被设为常数)。开放问题是:如何将模型扩展为 \( \rho(t) \) 也是时变的?这需要处理两个非参数函数(\( \rho(t) \) 和 \( \beta(t) \))的识别和估计问题,并可能面临“维数灾难”或“峰度问题”。
Maintained by 陈星宇 · Homepage · Source on GitHub