Price Dividend Ratio and Long-Run Stock Returns: A Score-Driven State Space Model¶
作者: Davide Delle Monache, Ivan Petrella, Fabrizio Venditti
来源: Journal of Business & Economic Statistics
主题: 经济理论 / 应用
相关性: 3/10
机构绿灯: University of Warwick(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2020.1763805
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:如何对具有时变参数的状态空间模型进行统计推断。具体来说,它关注的是系统矩阵(如状态转移矩阵、观测矩阵)本身随时间平滑变化的情形,并假设这种变化由条件似然的得分(score) 驱动。该方向处于经济时间序列建模与统计滤波理论的交叉地带,成熟度中等——已有大量时变参数模型(如TVP-VAR、随机波动率),但将时变机制与似然得分直接挂钩、并给出统一滤波框架的工作相对较少。
发展脉络(history)¶
根据论文引言,该方向的发展可梳理为以下主线:
- 奠基工作:状态空间模型与卡尔曼滤波的经典框架
-
Harvey (1989) 和 Durbin & Koopman (2012) 奠定了线性高斯状态空间模型的基础,卡尔曼滤波提供了最优状态估计。但这些工作假设系统矩阵是已知常数,无法处理参数时变。
-
主要进展:时变参数状态空间模型
-
Cogley & Sargent (2005) 和 Primiceri (2005) 将VAR模型推广为时变参数形式(TVP-VAR),允许系数随时间随机游走。这是经济时间序列中处理时变参数的主流方法。但作者指出:这些模型通常假设时变参数遵循外生给定的随机过程(如随机游走),其演化机制与数据本身(似然)无关,且需要大量先验设定。
-
当前frontier:得分驱动模型(Score-Driven Models)
- Creal, Koopman & Lucas (2013) 和 Harvey (2013) 提出了广义自回归得分(GAS)模型,将时变参数更新为条件似然得分的函数。这是本文的直接前驱。作者指出:GAS模型主要针对观测方程的参数(如波动率)建模,而状态空间模型中的系统矩阵(如状态转移矩阵)的时变问题尚未被系统处理。
-
Blasques, Koopman & Lucas (2015) 给出了得分驱动模型的渐近理论(一致性、渐近正态性),但同样聚焦于观测方程参数。
-
本文的位置:作者将得分驱动思想从观测方程参数推广到状态空间模型的系统矩阵(状态转移矩阵、观测矩阵),并为此推导了一个新滤波器,允许同时估计状态向量和时变矩阵。这是对GAS框架的直接扩展,填补了“得分驱动系统矩阵”这一缺口。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 线索A:时变参数状态空间模型(TVP类)——以Cogley & Sargent (2005)、Primiceri (2005)为代表。核心做法:假设参数遵循外生随机过程(如随机游走),用贝叶斯MCMC估计。优点:灵活;缺点:先验敏感、计算成本高、时变机制与数据似然无关。
- 线索B:得分驱动模型(GAS类)——以Creal, Koopman & Lucas (2013)、Harvey (2013)为代表。核心做法:将时变参数更新为条件似然得分的函数,参数演化由数据自身驱动。优点:无需MCMC、似然可解析计算、信息更新高效;缺点:此前仅用于观测方程参数,未处理系统矩阵。
本文:将线索B的方法论推广到线索A的问题设定(系统矩阵时变),并给出具体滤波算法。
这个方向在追问的核心问题¶
- 如何设计时变参数的演化机制?——外生随机过程 vs. 数据驱动(如得分驱动)?哪种更合理、更可解释?
- 如何高效估计时变系统矩阵?——贝叶斯MCMC vs. 解析滤波?计算成本与统计效率的权衡。
- 时变参数模型的理论性质(一致性、渐近分布)如何?——得分驱动模型的渐近理论已有部分结果(Blasques et al., 2015),但针对系统矩阵的情形尚未建立。
- 如何将时变参数模型应用于具体经济问题?——如本文的股价股息比与长期预期收益率关系。
已知瓶颈:得分驱动系统矩阵的滤波器的理论性质(如一致性、渐近正态性) 尚未被严格证明;模型选择(如得分函数的滞后阶数、是否包含截距项)缺乏系统准则。
⚠️ 作者的framing¶
作者把缺口frame成:现有得分驱动模型(GAS)只处理观测方程参数,而状态空间模型的系统矩阵时变问题尚未被纳入该框架。因此,本文的贡献是“显然的下一步”——将得分驱动推广到系统矩阵,并给出一个可操作的滤波器。
被淡化或回避的竞争路线: - TVP-VAR类方法(Cogley & Sargent, 2005)被作者定位为“外生随机游走,先验敏感”,但未深入讨论其与得分驱动方法的相对优劣(如:在什么条件下得分驱动优于随机游走?)。 - 贝叶斯非参数方法(如Dirichlet过程混合模型)处理时变参数的可能性未被提及。
什么明显该被引/该存在、却没出现在intro里? - 状态空间模型的贝叶斯推断文献(如Koop & Korobilis, 2010的TVP-VAR变分贝叶斯方法)未被引用。这可能是因为作者聚焦于频率学派滤波,但贝叶斯方法在时变参数领域是主流,回避它可能削弱了论文的定位。 - 得分驱动模型的渐近理论文献(Blasques et al., 2015)虽被引用,但未讨论其理论结果是否可直接推广到系统矩阵情形——这是本文的一个潜在弱点(见下文“结论是否比证明窄”)。
张力¶
未见明显对立引用。线索A和线索B的方法论差异(外生随机游走 vs. 数据驱动)更多是设计哲学不同,而非彼此矛盾。作者未指出任何“在相同条件下得出相反结论”的工作。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( y_t \):可观测的时间序列(标量或向量),\( t = 1, \dots, T \)。 - \( \alpha_t \):不可观测的状态向量(latent state)。 - \( Z_t \):观测矩阵(将状态映射到观测),允许时变。 - \( T_t \):状态转移矩阵,允许时变。 - \( c_t \):状态方程中的截距项(可时变)。 - \( d_t \):观测方程中的截距项(可时变)。 - \( \theta_t \):时变参数向量,包含 \( Z_t, T_t, c_t, d_t \) 中所有时变元素的集合。本文的核心是让 \( \theta_t \) 的演化由得分驱动。 - \( f_t \):条件似然的得分(score),即 \( \partial \log p(y_t | \mathcal{F}_{t-1}, \theta_t) / \partial \theta_t \),其中 \( \mathcal{F}_{t-1} \) 是截至 \( t-1 \) 的信息集。 - \( \psi \):静态参数(hyperparameters),控制得分驱动机制的更新方程(如步长、平滑参数)。
模型(以最简单的线性高斯状态空间模型为例): - 观测方程:\( y_t = Z_t \alpha_t + d_t + \varepsilon_t \),\( \varepsilon_t \sim \mathcal{N}(0, H_t) \)。 - 状态方程:\( \alpha_t = c_t + T_t \alpha_{t-1} + \eta_t \),\( \eta_t \sim \mathcal{N}(0, Q_t) \)。 - 时变参数演化(得分驱动):\( \theta_{t+1} = \omega + A s_t + B \theta_t \),其中 \( s_t \) 是得分的某种缩放版本(如 \( s_t = S_t \cdot \partial \log p(y_t | \mathcal{F}_{t-1}, \theta_t) / \partial \theta_t \),\( S_t \) 是缩放矩阵),\( \omega, A, B \) 是静态参数 \( \psi \) 的一部分。
可观测数据:研究者实际能观测到的是 \( y_1, \dots, y_T \)(时间序列数据)。不可观测的是: - 状态向量 \( \alpha_t \)(需通过滤波估计)。 - 时变参数 \( \theta_t \)(需通过得分驱动方程和滤波联合估计)。 - 静态参数 \( \psi \)(需通过似然最大化估计)。
关键识别问题:时变参数 \( \theta_t \) 的演化由得分驱动,而得分本身依赖于 \( \theta_t \) 和状态 \( \alpha_t \) 的当前估计——这形成了一个递归耦合:要估计 \( \theta_t \),需要知道得分;要计算得分,需要知道 \( \theta_t \) 和 \( \alpha_t \)。本文的滤波器正是为了解决这个耦合问题。
第二步:讲最小内核¶
最简特例:假设模型退化为无状态变量的纯观测方程(即 \( \alpha_t \) 不存在,\( y_t \) 直接由时变参数 \( \theta_t \) 生成): - \( y_t = \theta_t + \varepsilon_t \),\( \varepsilon_t \sim \mathcal{N}(0, 1) \)。 - 时变参数演化:\( \theta_{t+1} = \omega + a \cdot s_t + b \cdot \theta_t \),其中 \( s_t = \partial \log p(y_t | \theta_t) / \partial \theta_t = y_t - \theta_t \)(高斯似然的得分就是残差)。 - 此时,模型退化为GAS(1,1)模型(Creal et al., 2013):\( \theta_{t+1} = \omega + a (y_t - \theta_t) + b \theta_t \)。
这个特例下要证的命题:给定观测序列 \( y_1, \dots, y_T \),如何估计静态参数 \( (\omega, a, b) \) 和时变参数序列 \( \theta_1, \dots, \theta_T \)?
证明怎么走: 1. 滤波:给定 \( \theta_t \) 和 \( y_t \),得分 \( s_t = y_t - \theta_t \) 可直接计算。然后 \( \theta_{t+1} = \omega + a s_t + b \theta_t \) 给出下一步的时变参数。 2. 似然:条件似然 \( p(y_t | \theta_t) = \mathcal{N}(y_t; \theta_t, 1) \),因此对数似然可解析写出。 3. 估计:最大化条件对数似然 \( \sum_{t=1}^T \log p(y_t | \theta_t) \) 关于静态参数 \( (\omega, a, b) \),其中 \( \theta_t \) 由滤波递归给出。
为什么成立:因为得分 \( s_t \) 是 \( y_t \) 的线性函数,滤波递归是线性的,似然是高斯且可解析计算的。整个估计问题退化为一个非线性但可微的优化问题(关于静态参数),可用数值优化求解。
论文的一般情形:当引入状态向量 \( \alpha_t \) 后,得分 \( s_t \) 不再直接是 \( y_t \) 的简单函数,而是需要通过卡尔曼滤波先估计 \( \alpha_t \),再计算得分。这构成了本文的核心技术贡献——将卡尔曼滤波与得分驱动更新耦合,推导出一个新的滤波递归。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:如何对具有时变系统矩阵(状态转移矩阵、观测矩阵)的状态空间模型进行统计推断,其中时变由条件似然的得分驱动。
- 核心工具/方法:推导了一个新滤波器,将卡尔曼滤波与得分驱动更新耦合,允许同时估计状态向量和时变矩阵;并给出了基于条件似然的静态参数估计方法。
- 主要结论:将该方法应用于1880年以来美国股价股息比数据,发现其长期均衡值随时间显著上升,伴随长期预期股票收益率下降,后者主要归因于自然利率下降而非风险溢价下降。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 模型结构:线性高斯状态空间模型(观测方程和状态方程均为线性、高斯噪声),但允许系统矩阵 \( Z_t, T_t, c_t, d_t \) 时变。
- 时变参数演化:\( \theta_{t+1} = \omega + A s_t + B \theta_t \),其中 \( s_t = S_t \cdot \partial \log p(y_t | \mathcal{F}_{t-1}, \theta_t) / \partial \theta_t \),\( S_t \) 是缩放矩阵(通常取信息矩阵的逆或平方根)。
- 假设:
- 线性高斯假设:观测噪声和状态噪声均为高斯分布。这是卡尔曼滤波的基础,也是得分解析可计算的前提。
- 得分驱动假设:时变参数的演化完全由条件似然的得分决定,无其他外生驱动因素。
- 静态参数可识别性:静态参数 \( \psi = (\omega, A, B) \) 可通过条件似然最大化唯一估计。
- 滤波稳定性:时变参数 \( \theta_t \) 的演化方程满足某些稳定性条件(如 \( B \) 的特征值在单位圆内),以确保滤波不发散。
- 相比已有文献:
- 相比TVP类方法(Cogley & Sargent, 2005):放宽了“参数遵循外生随机游走”的假设,改为数据驱动;强化了“时变机制由得分决定”的结构性假设。
- 相比GAS模型(Creal et al., 2013):放宽了“仅观测方程参数时变”的限制,推广到系统矩阵;保留了得分驱动的基本框架。
主要结果¶
本文为应用/方法型论文,核心贡献是方法(新滤波器)和实证发现。理论结果较弱(无渐近定理)。
方法贡献: - 新滤波器:将卡尔曼滤波与得分驱动更新耦合。具体来说,在每个时间步 \( t \): 1. 给定 \( \theta_t \) 和 \( \alpha_{t-1} \),用标准卡尔曼滤波预测步骤得到 \( \alpha_{t|t-1} \) 和 \( P_{t|t-1} \)。 2. 计算条件似然 \( p(y_t | \mathcal{F}_{t-1}, \theta_t) \) 及其得分 \( s_t \)。 3. 用得分驱动方程更新 \( \theta_{t+1} \)。 4. 用卡尔曼滤波更新步骤得到 \( \alpha_{t|t} \) 和 \( P_{t|t} \)。 - 静态参数估计:最大化条件对数似然 \( \sum_{t=1}^T \log p(y_t | \mathcal{F}_{t-1}, \theta_t) \) 关于 \( \psi \),其中 \( \theta_t \) 由滤波递归给出。
实证发现(核心量化结论): - 数据:1880-2019年美国年度股价股息比(price-dividend ratio)、实际股票收益率、实际股息增长率。 - 方法应用:将股价股息比分解为预期股票收益率和预期股息增长率的函数,允许这两个成分的长期均值(即系统矩阵中的截距项)随时间由得分驱动变化。 - 结果: - 股价股息比的长期均衡值从1880年的约20上升到2019年的约40(上升约100%)。 - 长期预期股票收益率从约8%下降到约4%(下降约50%)。 - 长期预期股息增长率基本稳定在约2%。 - 归因分析:预期收益率的下降中,约70%可归因于自然利率(real interest rate)的下降,约30%归因于长期风险溢价的下降。 - 与baseline对比:与标准TVP-VAR模型(Cogley & Sargent, 2005)相比,得分驱动模型给出的时变模式更平滑、更稳定,且对先验设定不敏感。
证明路线与技术技巧¶
本文为应用型论文,无严格数学证明。技术路线如下:
整体路线(3步逻辑主干): 1. 模型设定:将股价股息比、预期收益率、预期股息增长率的关系嵌入一个状态空间模型,其中长期均值(截距项)由得分驱动时变。 2. 滤波与估计:应用本文提出的得分驱动滤波器,同时估计状态向量(预期收益率和股息增长率)和时变参数(长期均值)。 3. 归因分析:将估计出的长期预期收益率分解为自然利率和风险溢价两部分,分别考察其贡献。
关键跳跃点: - 如何将得分驱动机制嵌入卡尔曼滤波?——这是本文的核心技术难点。标准卡尔曼滤波假设系统矩阵已知,而本文需要同时估计它们。作者的解法是:在每个时间步,先用当前 \( \theta_t \) 运行卡尔曼滤波预测步骤,然后计算得分并更新 \( \theta_{t+1} \),再用更新后的 \( \theta_{t+1} \) 运行卡尔曼滤波更新步骤。这本质上是一个两步递归。 - 如何确保滤波稳定性?——作者通过选择适当的缩放矩阵 \( S_t \)(如信息矩阵的逆)和限制 \( B \) 的特征值在单位圆内来保证。
技术技巧点名: - 卡尔曼滤波:用于估计不可观测的状态向量(预期收益率和股息增长率)。 - 得分驱动更新:用于估计时变参数(长期均值)。 - 条件似然最大化:用于估计静态参数。 - 数值优化:用于最大化条件似然(使用拟牛顿法)。
真实例子与应用¶
数据:1880-2019年美国年度数据,包括: - 股价股息比(来自Shiller数据库)。 - 实际股票收益率(CRSP数据,经CPI调整)。 - 实际股息增长率(来自Shiller数据库)。 - 自然利率(来自Holston, Laubach & Williams, 2017的估计)。
方法应用: 1. 将股价股息比 \( pd_t \) 建模为预期收益率 \( r_t \) 和预期股息增长率 \( g_t \) 的函数:\( pd_t = \text{constant} + \sum_{j=0}^\infty \rho^j (g_{t+1+j} - r_{t+1+j}) \),其中 \( \rho \) 是贴现因子。 2. 将 \( r_t \) 和 \( g_t \) 的长期均值(记为 \( \mu_t^r \) 和 \( \mu_t^g \))设为得分驱动时变参数。 3. 用本文滤波器估计 \( r_t \)、\( g_t \)、\( \mu_t^r \)、\( \mu_t^g \)。
结果: - 图3显示:\( \mu_t^r \) 从1880年的约8%下降到2019年的约4%,\( \mu_t^g \) 稳定在约2%。 - 图4显示:股价股息比的长期均衡值从约20上升到约40。 - 表2显示:归因分析中,自然利率下降解释了预期收益率下降的约70%,风险溢价下降解释了约30%。
这个例子想说明什么: - 验证方法:得分驱动滤波器能够从股价股息比数据中提取出平滑、合理的时变长期预期收益率和股息增长率。 - 展示相对baseline的优势:相比TVP-VAR,得分驱动模型给出的时变模式更平滑,且对先验设定不敏感(作者在附录中进行了稳健性检验)。 - 提供经济洞见:长期预期收益率的下降主要由自然利率驱动,而非风险溢价——这对资产定价文献有重要含义。
🔎 结论是否比证明窄¶
是。本文的实证结论(自然利率驱动预期收益率下降)是基于特定模型设定(得分驱动状态空间模型)得出的,但作者在讨论中将其泛化为一般性经济事实(“长期预期收益率的下降主要归因于自然利率的下降”)。严格来说,这个结论只在本文的模型框架下成立,其他模型设定(如TVP-VAR、贝叶斯结构向量自回归)可能给出不同归因。
具体语句:作者在结论部分写道:“The fall in the long-run expected rate of return on stocks can be attributed mainly to a decrease in the natural rate of interest.” 这句话没有限定“在本文模型下”,而是作为一般性结论陈述。值得研究者去查:其他方法(如Laubach & Williams, 2003的自然利率估计方法)是否支持这一归因?
四、开放问题¶
-
得分驱动系统矩阵滤波器的渐近理论:本文未给出任何一致性或渐近正态性定理。Blasques et al. (2015) 的渐近理论是否可直接推广到系统矩阵情形?需要什么额外条件?(扎根于:本文方法部分无任何定理陈述,仅给出算法描述。)
-
模型选择准则:得分驱动方程中的滞后阶数(如 \( A \) 和 \( B \) 的维度)如何选择?是否有类似AIC/BIC的准则?(扎根于:作者在实证中固定了 \( A \) 和 \( B \) 为标量,未讨论更一般情形。)
-
非线性/非高斯推广:本文假设线性高斯状态空间模型。若观测方程或状态方程为非线性,或噪声非高斯,得分驱动滤波器是否仍可推导?(扎根于:作者在结论中提及“extensions to nonlinear models”作为未来工作。)
-
与其他时变参数方法的比较:在什么条件下得分驱动优于TVP随机游走?是否存在数据生成过程使得得分驱动方法失效?(扎根于:作者在引言中未深入讨论两种方法的相对优劣,仅指出TVP方法的“先验敏感”缺点。)
Maintained by 陈星宇 · Homepage · Source on GitHub