Estimation risk in conditional expectiles¶
作者: Marcelo Fernandes, Vitor Henriques, Eduardo Fonseca Mendes
主题: 经济理论 / 应用
相关性: 6/10
链接: https://arxiv.org/abs/2609.02673
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是在条件尺度模型(conditional scale model)下,对条件 expectile(条件期望分位数)进行统计推断。Expectile 是 Newey 和 Powell (1987) 提出的非对称最小二乘(ALS)估计量,是分位数(quantile)的最小二乘类比。近年来,expectile 作为风险度量工具受到金融和精算领域的关注,因为它同时满足一致性(coherent)、律不变性(law-invariant) 和可回溯测试性(elicitability)——这是唯一同时满足这三条性质的风险度量(Ziegel, 2016)。然而,现有文献对 expectile 的推断大多基于独立同分布(iid)数据或无条件设定,在时间序列条件尺度模型(如 GARCH)下的推断理论尚不完整。本文填补了这一缺口:它建立了条件 expectile 的两步估计量的相合性和渐近正态性,并量化了第一步尺度参数估计误差对第二步 expectile 估计的影响。
发展脉络¶
- 奠基工作:expectile 的定义与基本性质
- Newey and Powell (1987):提出 ALS 估计量,定义 expectile,证明其在线性回归模型下的相合性和渐近正态性。
- Jones (1994) 和 Yao and Tong (1996):建立 expectile 与分位数之间的映射关系,指出 expectile 是分位数的“平滑版本”,且两者在位置-尺度族下存在一一对应。
-
Holzmann and Klar (2016) 和 Krätschmer and Zähle (2017):建立无条件 expectile 的渐近理论——在 iid 设定下,样本 expectile 在有限二阶矩下是 √n-相合且渐近正态的;若分布连续,则 expectile 过程满足泛函中心极限定理。这是本文第二步估计的理论基础。
-
主要进展:expectile 作为风险度量
- Ziegel (2016):证明 expectile 是唯一同时满足一致性、律不变性和可回溯测试性的风险度量。这一结果直接推动了 expectile 在金融风险度量中的应用。
- Bellini and Di Bernardino (2017):将 expectile 解释为“为使期望损益比达到某个阈值所需追加的资本”,并建立了 expectile 与 omega ratio 的联系。
- Daouia, Girard and Stupfler (2018, 2020):研究极端 expectile(τ_n → 1)的估计,提出加权 ALS 估计量,并建立其渐近分布。他们的结果依赖于重尾分布假设,且收敛速度为 √{n(1-τ_n)},比 √n 慢。
-
Girard, Stupfler and Usseglio-Carleve (2021):将极端 expectile 估计扩展到条件异方差回归模型,采用两步法(先估计尺度参数,再用标准化残差估计极端 expectile)。他们发现:由于极端 expectile 的收敛速度(√{n(1-τ_n)})慢于第一步尺度参数估计的 √n 速度,第一步估计误差不影响第二步的渐近分布。这是本文最直接的竞争工作。
-
当前 frontier:条件 expectile 在时间序列模型下的推断
- Taylor (2008) 和 Kuan, Yeh and Hsu (2009):提出条件自回归 expectile(CARE)模型,直接对 expectile 建模,但缺乏完整的渐近理论。
-
Francq and Zakoïan (2015):在 GARCH 模型下,建立条件 VaR 和 ES 的两步估计量的渐近理论。他们先由 QML 估计尺度参数,再用标准化残差的经验分布估计无条件分位数/ES。本文直接借鉴了这一框架,但将目标从分位数/ES 替换为 expectile。
-
本文的位置:本文是第一个在条件尺度模型下,对固定水平 τ 的条件 expectile 建立完整两步估计渐近理论的工作。与 Girard et al. (2021) 的关键区别在于:固定水平 τ 的 expectile 估计以 √n 速度收敛(与第一步 QML 估计同速),因此第一步估计误差必须纳入渐近方差。本文的核心贡献就是量化了这一影响,并给出了可行的方差估计量和条件预测区间。
子线索聚类¶
- 无条件 expectile 的渐近理论(Holzmann and Klar, 2016; Krätschmer and Zähle, 2017):iid 设定,√n-相合,渐近正态,需有限二阶矩。
- 极端 expectile 的估计(Daouia et al., 2018, 2020; Girard et al., 2021):τ_n → 1,重尾分布,收敛速度慢于 √n,第一步估计误差可忽略。
- 条件风险度量的两步估计(Francq and Zakoïan, 2015; Gao and Song, 2008):GARCH 模型下,先 QML 估计尺度,再用标准化残差估计 VaR/ES。本文将此框架从分位数/ES 扩展到 expectile。
- expectile 作为风险度量的应用(Bellini and Di Bernardino, 2017; Chen, 2018; Taylor, 2022):expectile 与 VaR/ES 的比较,expectile-quantile 映射,omega ratio。
这个方向在追问的核心问题¶
- 如何量化第一步估计误差对第二步 expectile 估计的影响? 当两步估计同速(√n)时,渐近方差必须包含协方差项。
- 如何构造可行的方差估计量和预测区间? 需要一致地估计渐近方差中的各个分量(Ψ₀, σ²_ψ, J₀, Σ_θ, σ_ψθ)。
- 条件 expectile 在实际尾部风险度量中是否优于 VaR 和 ES? 尤其是在加密货币这类高波动、重尾的市场中。
⚠️ 作者的 framing¶
作者将缺口 frame 成:“现有文献对条件 expectile 的推断几乎空白,只有少数时间序列研究(Taylor, 2008; Kuan et al., 2009; Bellini and Di Bernardino, 2017; Girard et al., 2021),且 Girard et al. (2021) 只处理极端 expectile(τ_n → 1),其第一步估计误差可忽略。对于固定水平 τ,第一步估计误差不可忽略,因此需要新的渐近理论。”——这是作者的核心叙事。
被淡化/回避的竞争路线: - CARE 模型(Taylor, 2008; Kuan et al., 2009):直接对 expectile 建模,不依赖条件尺度模型。作者在 intro 中仅一笔带过,未讨论 CARE 模型是否更灵活或更稳健。 - 极端 expectile 的加权 ALS 估计(Daouia et al., 2018, 2020):作者承认其存在,但强调其收敛速度慢于 √n,因此第一步估计误差可忽略——这恰恰是本文与它们的区别所在。
什么明显该被引/该存在、却没出现在 intro 里? - Breckling and Chambers (1988):M-quantile 的早期工作,expectile 是其特例。本文引用了,但仅在 intro 末尾的文献综述中一笔带过。 - Efron (1991):回归百分位数与非对称平方损失。本文引用了,但同样未深入讨论。 - Abdous and Remillard (1995):expectile 与分位数在加权对称性下的关系。本文引用了,但未展开。
张力¶
未见明显对立引用。所有被引工作对 expectile 的基本性质(一致性、可回溯测试性、与分位数的关系)看法一致。唯一可能存在的张力是:Girard et al. (2021) 认为第一步估计误差可忽略(因为极端 expectile 收敛慢),而本文认为不可忽略(因为固定水平 expectile 收敛快)——但这并非矛盾,而是不同设定下的不同结论。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \( y_t \):第 \( t \) 天的对数收益率(连续复利),可观测。 - \( \eta_t \):第 \( t \) 天的创新(innovation),iid,均值为 0,方差为 1,不可观测。 - \( \sigma_t(\theta) \):条件波动率,是 \( \theta \) 的函数,依赖于过去收益率。\( \theta_0 \) 为真实参数。 - \( \theta \):条件方差模型的参数向量(如 GARCH 参数),待估。 - \( \tau \):expectile 水平,固定常数(如 0.05 或 0.01)。 - \( \xi_0 = \text{XP}^\eta_\tau \):创新的无条件 expectile,即 \( \mathbb{E}[\phi_\tau(\eta_t - \xi_0)] = 0 \) 的解,待估。 - \( c_{n+1} = \sigma_{n+1}(\theta_0) \xi_0 \):第 \( n+1 \) 天的条件 expectile,待估。 - \( \phi_\tau(u) = |\tau - \mathbf{1}(u \le 0)| u^2 \):expectile 的 check 函数(非对称平方损失)。 - \( \psi_t = \phi_\tau(\eta_t - \xi_0) \):在真实参数下的 estimating function。 - \( w_t = w_\tau(\eta_t - \xi_0) = |\tau - \mathbf{1}(\eta_t < \xi_0)| \):权重函数。 - \( \Psi_0 = \mathbb{E}[w_t] = \tau\{1 - F_\eta(\xi_0)\} + (1-\tau)F_\eta(\xi_0) \):权重的期望。 - \( D_t = \partial_\theta \log \sigma_t(\theta_0) \):对数波动率的梯度。 - \( J_0 = \mathbb{E}[D_t] \):梯度的期望。 - \( s_t = a(\eta_t) D_t \):QML 得分,其中 \( a(u) = \partial_s g(u, s)|_{s=1} \),\( g \) 是 QML 的 log-likelihood。 - \( H_0 \):QML 的负 Hessian 期望。 - \( \Sigma_\theta = H_0^{-1} \mathbb{E}[s_t s_t'] H_0^{-1} \):QML 估计量的渐近方差。 - \( \sigma_{\psi\theta} = H_0^{-1} \mathbb{E}[s_t \psi_t] \):QML 得分与 expectile score 的协方差。
模型:
可观测数据: - 研究者实际能观测到的是收益率序列 \( \{y_1, y_2, \dots, y_n\} \)。 - 不可观测的是创新 \( \{\eta_t\} \) 和真实波动率 \( \{\sigma_t(\theta_0)\} \)。 - 研究者只能通过第一步 QML 估计 \( \hat{\theta}_n \),然后计算标准化残差 \( \hat{\eta}_t = y_t / \tilde{\sigma}_t(\hat{\theta}_n) \) 来近似创新。
第二步:最小内核¶
最简特例:假设 \( \sigma_t(\theta_0) \equiv 1 \)(即无条件异方差),且 \( \eta_t \sim N(0,1) \)。此时模型退化为 iid 高斯序列。那么: - 第一步 QML 估计退化为估计均值(已知为 0)和方差(已知为 1),实际上不需要第一步。 - 第二步:样本 expectile \( \hat{\xi}_n = \arg\min_\xi \frac{1}{n} \sum_{t=1}^n \phi_\tau(y_t - \xi) \) 就是无条件 expectile 的 M-估计量。 - 由 Holzmann and Klar (2016),\( \sqrt{n}(\hat{\xi}_n - \xi_0) \xrightarrow{d} N(0, \sigma^2_\psi / \Psi_0^2) \),其中 \( \sigma^2_\psi = \mathbb{E}[\phi_\tau(\eta_t - \xi_0)^2] \),\( \Psi_0 = \mathbb{E}[w_\tau(\eta_t - \xi_0)] \)。
本文的一般情形:当 \( \sigma_t(\theta_0) \) 未知且需估计时,第一步 QML 估计 \( \hat{\theta}_n \) 引入额外不确定性。核心数学困难是:如何将第一步估计误差纳入第二步 expectile 估计的渐近方差? 本文的关键想法是:利用 Bahadur 表示将 \( \sqrt{n}(\hat{\xi}_n - \xi_0) \) 展开为 \( \Psi_0^{-1} \frac{1}{\sqrt{n}} \sum_{t=1}^n \psi_t - \xi_0 J_0' \sqrt{n}(\hat{\theta}_n - \theta_0) + o_p(1) \),从而将渐近方差分解为三部分:① 若创新可观测时的方差(\( \sigma^2_\psi / \Psi_0^2 \));② 第一步 QML 估计的方差(\( \xi_0^2 J_0' \Sigma_\theta J_0 \));③ 两者的协方差(\( -2\xi_0 \Psi_0^{-1} J_0' \sigma_{\psi\theta} \))。
一句话总结:本文在数学上干的事是:在条件尺度模型下,推导出固定水平 τ 的条件 expectile 的两步估计量的渐近方差显式表达式,并证明该方差包含第一步 QML 估计的贡献,且该贡献不可忽略(因为两步同速 √n)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在条件尺度模型(如 GARCH)下,建立条件 expectile 的两步估计量(先 QML 估计尺度参数,再用标准化残差估计 expectile)的相合性和渐近正态性。
- 核心工具/方法:Bahadur 表示 + 联合中心极限定理(martingale CLT)+ 均匀局部展开(处理 expectile score 的非光滑性)。
- 主要结论:给出了无条件 expectile 估计量的渐近方差显式公式(含第一步估计误差的贡献),以及条件 expectile 的可行预测区间;蒙特卡洛模拟验证了有限样本性能;加密货币实证表明条件 expectile 的预测区间比 VaR 和 ES 更窄。
关键设定与假设¶
- 模型:\( y_{t+1} = \sigma_t(\theta_0) \eta_{t+1} \),\( \eta_t \) iid(0,1),独立于过去收益率。这比 Girard et al. (2021) 的异方差回归模型更窄(无协变量),但更贴近金融时间序列。
- 假设 A1(创新与目标 expectile):\( \eta_t \) iid,均值为 0,方差为 1;\( F_\eta \) 在 \( \xi_0 \) 处连续。这比 Holzmann and Klar (2016) 的假设更弱(不需要绝对连续或密度有界)。
- 假设 A4(条件尺度与识别):\( \sigma_t(\theta) \) 有正下界,且 \( \theta = \theta_0 \) 是唯一使 \( \sigma_t(\theta) = \sigma_t(\theta_0) \) a.s. 的参数。这是 GARCH 模型的标准识别条件。
- 假设 A5(有限历史逼近):有限历史波动率 \( \tilde{\sigma}_t(\theta) \) 以几何速率逼近真实波动率 \( \sigma_t(\theta) \)。这是处理 GARCH 模型初始值问题的标准技巧。
- 假设 A6(矩条件):对 \( r=2 \) 只需二阶矩(相合性),对 \( r=4 \) 需四阶矩(渐近正态性)。这比 Francq and Zakoïan (2015) 对 VaR/ES 的要求(通常需四阶矩)一致。
- 假设 A11(观测预测状态):波动率递归满足几何收缩(如 GARCH 的 Lyapunov 指数为负)。这是构造条件 expectile 预测区间所需的技术条件。
相比已有文献的放宽/强化: - 相比 Girard et al. (2021):本文处理固定水平 τ(而非 τ_n → 1),因此第一步估计误差不可忽略——这是强化了推断难度。 - 相比 Francq and Zakoïan (2015):本文的目标从 VaR/ES 换为 expectile,expectile 的 score 函数 \( \phi_\tau \) 是连续可微的(除零点外),而 VaR 的 score 是阶梯函数——这是放宽了非光滑性,但 expectile 的渐近方差结构更复杂(需处理权重函数 \( w_t \) 的期望)。
主要结果¶
定理 1(相合性):在假设 A1-A8(r=2)下,\( \hat{\theta}_n \xrightarrow{a.s.} \theta_0 \) 且 \( \hat{\xi}_n \xrightarrow{a.s.} \xi_0 \)。这是标准结果,证明依赖于 QML 的相合性(Francq and Zakoïan, 2015)和 expectile 的强相合性(Holzmann and Klar, 2016)。
定理 2(渐近正态性):在假设 A1-A9(r=4)下,
定理 3(条件预测区间):在假设 A1-A9、A11(r=4)下,条件 expectile 的预测误差 \( \sqrt{n}(\hat{c}_{n+1} - c_{n+1}) \) 条件于 \( \mathcal{H}_n \)(最近 \( m_n \) 个创新)依分布收敛到 \( N(0, V_{n+1}) \),其中 \( V_{n+1} \) 的显式公式由定理 3 给出。推论 1 给出了可行的预测区间:用 \( \hat{V}_{n+1} \) 替代 \( V_{n+1} \),区间覆盖概率趋近名义水平。
证明路线与技术技巧¶
整体路线(以定理 2 为例): 1. 第一步:QML 的渐近线性表示(命题 2):\( \sqrt{n}(\hat{\theta}_n - \theta_0) = H_0^{-1} \frac{1}{\sqrt{n}} \sum_{t=1}^n s_t + o_p(1) \)。这是标准结果,证明依赖于 QML 得分和 Hessian 的有限历史逼近。 2. 第二步:expectile 的 Bahadur 表示(引理 4):\( \sqrt{n}(\hat{\xi}_n - \xi_0) = \Psi_0^{-1} \frac{1}{\sqrt{n}} \sum_{t=1}^n \psi_t - \xi_0 J_0' \sqrt{n}(\hat{\theta}_n - \theta_0) + o_p(1) \)。这是核心步骤,证明依赖于: - 引理 3(均匀局部展开):对 \( (\theta, \xi) \) 在 \( \sqrt{n} \)-邻域内,将 \( Q_n(\xi, \theta) \) 展开为线性项 + 可忽略余项。关键技术是引理 1(piecewise-linear identity),它给出了 \( \phi_\tau \) 的 Lipschitz 性质和“kink”余项的控制。 - 引理 2(有限历史逼近):确保用有限历史波动率 \( \tilde{\sigma}_t \) 替代真实波动率 \( \sigma_t \) 的误差为 \( O(1/n) \) a.s.,从而在 √n 尺度下可忽略。 3. 第三步:联合中心极限定理(引理 5):\( (\frac{1}{\sqrt{n}} \sum \psi_t, \sqrt{n}(\hat{\theta}_n - \theta_0))' \) 联合收敛到均值为 0、协方差矩阵为 \( \begin{pmatrix} \sigma^2_\psi & \sigma_{\psi\theta}' \\ \sigma_{\psi\theta} & \Sigma_\theta \end{pmatrix} \) 的高斯分布。证明依赖于 martingale CLT(Hall and Heyde, 1980),因为 \( (\psi_t, s_t') \) 是鞅差序列。 4. 第四步:将 Bahadur 表示与联合 CLT 结合,得到 \( V_\xi \) 的显式公式。
关键跳跃点: - 引理 3 的证明:处理 expectile score 的非光滑性(在 \( \xi_0 \) 处有 kink)。作者利用引理 1 将 kink 余项控制为 \( |h_t| \mathbf{1}\{|r_t| \le |h_t|\} \),然后证明该余项在 √n 尺度下可忽略。这需要 \( \eta_t \) 在 \( \xi_0 \) 处连续(假设 A1)和 \( h_t = O_p(1/\sqrt{n}) \)。 - 引理 4 的证明:建立 \( \sqrt{n}(\hat{\xi}_n - \xi_0) = O_p(1) \) 的速率。作者先证明 \( \sqrt{n} \tilde{Q}_n(\xi_0 + v/\sqrt{n}, \hat{\theta}_n) \) 在 \( |v| \le M \) 上一致紧,然后利用 \( \tilde{Q}_n \) 的严格单调性得到 \( \hat{\xi}_n \) 的 √n-相合性。
技术技巧点名: - Martingale CLT(Hall and Heyde, 1980):用于联合 CLT(引理 5)。 - Bahadur 表示:将 M-估计量展开为线性项 + 余项,是处理非光滑 score 的标准技巧。 - 均匀局部展开(引理 3):对非光滑 score 在 √n-邻域内做 Taylor 展开,控制 kink 余项。 - 有限历史逼近(引理 2):用几何衰减的初始值误差控制有限样本逼近误差。 - Bounded-Lipschitz 距离(定理 3):用于度量条件分布与高斯分布的弱收敛。
真实例子与应用¶
数据:2016-2023 年比特币(BTC)、以太坊(ETH)、币安币(BNB)和欧元(EUR)的日度对数收益率。样本量:BTC 2921 天,ETH/BNB 2243 天,EUR 2082 天。
方法应用: 1. 对每种货币,用滚动窗口(1000 天)估计 GJR-GARCH(1,1) 模型(含杠杆效应)。 2. 对每个窗口,计算标准化残差,估计无条件 expectile \( \hat{\xi}_n \) 在 \( \tau = 0.01 \) 水平。 3. 用一步向前波动率预测 \( \tilde{\sigma}_{n+1}(\hat{\theta}_n) \) 乘以 \( \hat{\xi}_n \) 得到条件 expectile 预测 \( \hat{c}_{n+1} \)。 4. 用推论 1 的公式计算 90% 预测区间。
核心结果: - 图 5:条件 expectile 的预测区间比 VaR 和 ES 更窄。具体地,XP 的区间宽度是 VaR 的 66.3%-89.8%,是 ES 的 35.2%-45.0%。 - 表 4:VaR 的 exceedance 频率接近名义 1% 水平(0.80%-1.29%),而 XP 的 exceedance 频率更高(1.29%-3.33%),因为 \( \tau = 0.01 \) 与 \( \alpha = 0.01 \) 对应不同的资本要求。 - 表 5:当通过 expectile-quantile 映射(公式 2)使 XP 与 VaR 的资本要求一致时(\( \tau(0.01) \) 约 0.32%-0.47%),XP 的预测区间宽度与 VaR/ES 相当或略宽(20%-25% 更宽)。
这个例子想说明什么:条件 expectile 在加密货币尾部风险度量中比 VaR 和 ES 更稳健(预测区间更窄),且通过 expectile-quantile 映射可以调整到与 VaR 相当的资本要求水平。
🔎 结论是否比证明窄¶
- 定理 2 的渐近方差公式是在假设 A1-A9(r=4)下严格证明的。但作者在 intro 中声称“我们量化了第一步估计误差对第二步的影响”——这严格成立,但仅限于固定水平 τ 且四阶矩存在的设定。对于极端 τ(τ_n → 1)或重尾分布(如 t₄ 分布,无四阶矩),该公式可能不成立。作者在蒙特卡洛中测试了 t₄ 分布,发现覆盖概率略低于名义水平(0.907-0.936),说明四阶矩条件可能是必要的。
- 定理 3 的条件预测区间依赖于假设 A11(几何收缩),这在 GARCH 模型下成立,但对于更一般的非线性波动率模型(如 EGARCH 的某些参数区域)可能不成立。作者未讨论这一限制。
- 推论 1 的可行预测区间依赖于假设 A10(plug-in 方差估计的 Lipschitz 条件),这在 Gaussian QML 下自动满足(因为 \( a(u) = u^2 - 1 \) 是 Lipschitz 的),但对于其他 QML 分布(如 t-分布)可能不成立。作者未讨论这一泛化。
四、开放问题¶
-
非零条件均值:本文假设条件均值为 0。作者在结论中明确提到“第一个方向是扩展到非零期望收益”(Francq and Zakoïan, 2018)。这需要将模型改为 \( y_{t+1} = \mu_t(\theta_0) + \sigma_t(\theta_0) \eta_{t+1} \),并处理两步估计(先均值、再方差、最后 expectile)的累积误差。扎根点:Section 6, "The first is to extend our asymptotic theory to deal with nonzero expected returns (Francq and Zakoïan, 2018)."
-
高维大组合:本文只处理单一资产。作者提到“第二个方向是研究大组合的高维情形”(Francq and Zakoïan, 2020)。这需要将条件 expectile 扩展到多变量设定,并处理维数诅咒和计算复杂度。扎根点:Section 6, "The second is to study the high-dimensional case of large portfolios (Francq and Zakoïan, 2020)."
-
极端 expectile 与固定水平 expectile 的统一框架:Girard et al. (2021) 处理极端 expectile(τ_n → 1,第一步估计误差可忽略),本文处理固定水平 τ(第一步估计误差不可忽略)。是否存在一个统一的渐近理论,能平滑过渡两个 regime?扎根点:Section 1 中作者对 Girard et al. (2021) 的讨论:"Unfortunately, this is not the case here. The estimation of expectiles at a fixed level τ converges at the same √n-rate as the estimation of the conditional mean and variance parameters, and hence the latter affects the asymptotic distribution of the former."——这暗示了两种 regime 的边界,但未给出统一刻画。
-
重尾分布下的稳健推断:蒙特卡洛中 t₄ 分布(无四阶矩)的覆盖概率略低(0.907-0.936)。是否存在对重尾分布更稳健的推断方法(如自举或子抽样)?扎根点:Table 1 中 t₄ 分布的结果,以及假设 A6 要求 r=4(四阶矩)的条件。
Maintained by 陈星宇 · Homepage · Source on GitHub