跳转至

Hedging With Linear Regressions and Neural Networks

作者: Johannes Ruf, Weiguan Wang
来源: Journal of Business & Economic Statistics
主题: 其他
相关性: 4/10
机构绿灯: London School of Economics and Political Science(US News 前 50,免分进入精读)
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向是金融衍生品对冲的统计/计量方法。核心问题是:给定一个期权(或其他衍生品),如何构造一个由基础资产(如股票)和无风险资产组成的交易策略,使得该策略的收益尽可能精确地复制期权的到期支付,从而最小化对冲误差(hedging error)。传统上,Black-Scholes 模型给出了一个在连续时间、无摩擦、波动率已知的理想世界中的完美对冲策略。但在现实世界中,由于离散交易、交易成本、波动率随机且不可观测、跳跃风险等摩擦,完美对冲不可能,因此问题转化为在给定数据下,非参数地估计一个最优对冲策略。当前成熟度:这是一个有大量实证和理论工作的领域,但“用神经网络直接从数据中学习对冲策略”是近年来的一个活跃方向。

发展脉络(history)

从 introduction 和参考文献中,可以梳理出以下脉络:

  1. 奠基工作:Black-Scholes 基准与 Delta 对冲

    • Black & Scholes (1973):给出了欧式期权的定价公式和完美对冲策略(Delta 对冲)。这是整个领域的理论基准。任何新方法都以超越这个基准为目标。
    • Hull & White (1987):研究了随机波动率下的期权定价,指出 Black-Scholes 模型在波动率随机时会产生系统性对冲误差。这为后续研究“波动率风险”和“杠杆效应”埋下伏笔。
  2. 主要进展:从参数模型到非参数方法

    • Dumas, Fleming & Whaley (1998):实证检验了“波动率微笑”现象,并尝试用参数形式的局部波动率模型(如常数弹性方差模型)来改进对冲。他们发现,简单的参数模型(如将波动率表示为执行价格和到期时间的函数)在样本外表现不佳,甚至不如 Black-Scholes。这揭示了参数模型的局限性。
    • Hutchinson, Lo & Poggio (1994)这是本文最直接的前驱工作。他们首次提出用人工神经网络(ANN) 来非参数地学习期权定价公式(即从特征到期权价格的映射),然后通过解析求导得到 Delta 对冲策略。他们的结论是:神经网络在样本内拟合很好,但样本外对冲表现与 Black-Scholes 相当,没有显著优势。本文作者引用其结论为:“the out-of-sample hedging performance of the ANN is comparable to that of the Black-Scholes model”。这留下了“神经网络能否超越 Black-Scholes”的开放问题。
    • Garcia & Gençay (2000):延续了 Hutchinson et al. (1994) 的思路,但使用了更复杂的网络结构和训练方法,并加入了交易成本。他们报告了在某些市场条件下神经网络对冲的改进,但改进幅度有限且不稳定。
  3. 当前 Frontier:直接优化对冲误差

    • 本文 (Ruf & Wang, 2020):作者指出,Hutchinson et al. (1994) 的方法存在一个关键缺陷:网络先学习定价函数,再求导得到对冲策略,这本质上是在最小化定价误差,而非对冲误差。本文的核心创新是直接让网络输出对冲策略(HedgeNet),并以最小化对冲误差(MSE of hedging error)为目标进行训练。这是对前驱工作的一个直接且重要的修正。
    • 其他相关工作:作者还引用了 Buehler et al. (2019) 等关于“深度对冲”(Deep Hedging)的工作,这些工作通常使用强化学习或更复杂的生成对抗网络,处理更现实的交易成本、市场冲击等。本文的定位是更简洁、更统计化的对比研究。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索一:参数/半参数对冲模型。这类方法假设对冲策略具有某种参数形式(如 Delta 是标的资产价格 S 和波动率 σ 的某个已知函数),然后通过历史数据估计参数。代表:Black-Scholes (1973), Dumas et al. (1998)。瓶颈:模型设定错误风险大,难以捕捉复杂的非线性模式。
  • 线索二:非参数/机器学习对冲模型。这类方法不预设函数形式,直接从数据中学习。代表:Hutchinson et al. (1994), Garcia & Gençay (2000), 本文。瓶颈:过拟合风险、样本外泛化能力、可解释性差。本文试图通过“直接优化对冲误差”来解决前驱工作的“目标错配”问题。

这个方向在追问的核心问题

  1. 能否超越 Black-Scholes 基准? 在现实数据中,非参数方法能否在统计上显著地降低对冲误差?
  2. 复杂模型(如神经网络)是否必要? 简单的线性模型(如带杠杆效应的线性回归)能否达到与神经网络相似的效果?这触及了“统计-计算权衡”的朴素版本:更复杂的模型是否带来了实质性的预测/对冲增益?
  3. 如何定义和优化对冲误差? 是应该先估计定价函数再求导,还是直接优化对冲策略本身?本文的答案是后者。

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 为“前人(Hutchinson et al., 1994)用神经网络做对冲时,目标函数错了——他们最小化的是定价误差,而不是对冲误差”。因此,本文的“显然的下一步”就是:设计一个直接输出对冲策略的网络,并直接最小化对冲误差。这个 frame 非常清晰、有说服力。
  • 被淡化/回避的竞争路线:作者淡化了“深度对冲”(Deep Hedging)这条更复杂的路线(如 Buehler et al., 2019)。他们选择了一个更简单的网络结构(前馈网络,而非 LSTM 或强化学习),并明确表示“我们的目标不是提出一个生产级的对冲系统,而是进行一个干净的统计对比”。这回避了与更复杂方法的直接竞争。
  • 什么明显该被引/该存在、却没出现在 intro 里? 作者没有引用任何关于高维统计半参数效率理论的工作。例如,没有讨论对冲策略的半参数效率界(即,给定数据,对冲误差的方差下界是多少?)。也没有引用关于U-统计量高阶影响函数的工作,尽管对冲误差的估计本质上是一个关于历史数据的 U-统计量问题。这可能是由于本文是应用导向,而非理论导向。

张力

未见明显对立引用。所有被引工作基本都承认 Black-Scholes 是基准,并试图改进它。Hutchinson et al. (1994) 的“神经网络不比 Black-Scholes 好”的结论与本文的“神经网络可以更好”的结论之间存在张力,但本文通过“目标函数不同”这一理由成功解释了这一张力。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \( S_t \):标的资产(如 S&P 500 指数)在时间 \( t \) 的价格。这是随机变量。
    • \( C_t \):期权在时间 \( t \) 的价格。这是随机变量。
    • \( T \):期权的到期时间。
    • \( K \):期权的执行价格(strike price)。
    • \( \tau = T - t \):到期时间(time to maturity)。
    • \( \Delta_t \):对冲策略在时间 \( t \) 持有的标的资产数量。这是我们要估计的参数/函数
    • \( B_t \):无风险资产(如国债)的价格,通常假设 \( B_t = e^{rt} \)
    • \( r \):无风险利率,假设已知。
    • \( \Pi_t \):对冲组合在时间 \( t \) 的价值。\( \Pi_t = \Delta_t S_t + (C_t - \Delta_t S_t) \) ?不,更标准的定义是:对冲组合由 \( \Delta_t \) 份标的资产和 \( C_t - \Delta_t S_t \) 的无风险资产构成,使得组合价值等于期权价格 \( C_t \)
    • 对冲误差 (Hedging Error) \( e_{t+1} \):在离散时间对冲下,从 \( t \)\( t+1 \) 的对冲误差定义为:
      \[e_{t+1} = C_{t+1} - \Delta_t S_{t+1} - (1+r)(C_t - \Delta_t S_t)\]
      这个公式的含义是:在 \( t \) 时刻,我们卖空期权获得 \( C_t \),买入 \( \Delta_t \) 份股票花费 \( \Delta_t S_t \),剩余现金 \( C_t - \Delta_t S_t \) 以无风险利率 \( r \) 投资。在 \( t+1 \) 时刻,这个复制组合的价值是 \( \Delta_t S_{t+1} + (1+r)(C_t - \Delta_t S_t) \),而我们需要支付期权价值 \( C_{t+1} \)。两者的差就是对冲误差。这是本文的核心目标变量
    • 均方对冲误差 (MSHE)\( \mathbb{E}[e_{t+1}^2] \)。这是本文要最小化的目标函数。
  • 模型

    • 没有显式的统计模型。这是一个非参数估计问题。我们假设存在一个未知的、最优的对冲策略函数 \( \Delta(S_t, \tau, K, \text{其他特征}) \),它最小化 MSHE。我们试图从历史数据中学习这个函数。
    • 数据生成过程:假设 \( (S_t, C_t) \) 是一个平稳(或至少是遍历的)时间序列过程。对冲误差 \( e_{t+1} \) 是这个过程的一个函数。
  • 可观测数据

    • 研究者实际能观测到的是:历史期权和标的资产的价格面板数据。具体来说,对于每个交易日 \( t \),我们观测到一系列期权合约,每个合约有特定的执行价格 \( K \) 和到期日 \( T \)。因此,数据点是一个三元组 \( (S_t, C_t(K,T), K, T) \)
    • 想要但观测不到的是:真实的、连续的、无摩擦的对冲策略 \( \Delta_t^* \),以及导致对冲误差的潜在随机因素(如波动率的跳跃、价格的不连续变动)。我们只能通过历史数据来估计一个近似的策略 \( \hat{\Delta}_t \)

第二步:讲最小内核

本文的最小内核可以归结为以下最简特例

  • 特例:假设我们只考虑一个特定的期权合约(例如,一个固定的执行价格 \( K \) 和到期日 \( T \)),并且我们只使用一个特征来预测对冲策略:当前标的资产价格 \( S_t \)。我们不考虑时间衰减、波动率等其他特征。
  • 问题:找到一个函数 \( \Delta(S_t) \),使得在历史数据上,从 \( t \)\( t+1 \) 的均方对冲误差 \( \mathbb{E}[e_{t+1}^2] \) 最小。
  • 可观测数据:我们有一系列历史观测 \( \{ (S_t, C_t, S_{t+1}, C_{t+1}) \}_{t=1}^{N-1} \)。注意,这里 \( C_t \)\( C_{t+1} \)同一个期权合约在不同时间的价格。
  • 核心思路
    1. 传统方法 (Hutchinson et al., 1994):先学习定价函数 \( \hat{C}(S_t) \approx C_t \),然后求导得到 \( \hat{\Delta}(S_t) = \frac{\partial \hat{C}(S_t)}{\partial S_t} \)。这最小化的是 \( (C_t - \hat{C}(S_t))^2 \)
    2. 本文方法 (HedgeNet):直接学习对冲函数 \( \hat{\Delta}(S_t) \),最小化的是 \( e_{t+1}^2 = [C_{t+1} - \hat{\Delta}(S_t) S_{t+1} - (1+r)(C_t - \hat{\Delta}(S_t) S_t)]^2 \)
  • 为什么这个特例能说明问题
    • 在这个特例下,HedgeNet 的损失函数直接就是对冲误差的平方。网络的任务就是找到一个 \( \hat{\Delta}(S_t) \),使得这个误差最小。
    • 而传统方法的目标是定价误差的平方,这是一个不同的目标。即使定价函数 \( \hat{C}(S_t) \) 非常精确,它的导数 \( \hat{\Delta}(S_t) \) 也可能不是最优的对冲策略,因为对冲误差还依赖于 \( S_{t+1} \)\( C_{t+1} \) 的联合分布。
    • 这个特例清晰地展示了本文的核心贡献:改变目标函数。它不是一个复杂的数学定理,而是一个关于“什么是最优”的统计直觉。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在离散时间、有摩擦的现实市场中,如何用非参数方法(神经网络和线性回归)从历史数据中学习一个期权对冲策略,以最小化均方对冲误差。
  2. 核心工具/方法:设计了一个名为 HedgeNet 的前馈神经网络,其输入是期权和标的资产的特征(如 \( S_t, \tau, K \) 等),输出是直接的对冲策略 \( \Delta_t \),并以最小化对冲误差 \( e_{t+1}^2 \) 为目标进行训练。作为对比,也使用了带杠杆效应的线性回归
  3. 主要结论:在 S&P 500 和 Euro Stoxx 50 期权的日末和逐笔价格数据上,HedgeNet 显著降低了 Black-Scholes 基准的均方对冲误差。然而,一个简单的线性回归模型,在纳入“杠杆效应”(即用滞后收益率作为特征)后,也能达到与 HedgeNet 相似甚至更好的效果。结论是:神经网络并非必要,简单的线性模型在考虑了杠杆效应后同样有效

关键设定与假设

  • 离散时间对冲:假设对冲只在固定的时间间隔(如每日或每笔交易)进行,而非连续。这是对现实的妥协。
  • 无交易成本:假设买卖标的资产没有交易成本。这是一个简化假设,作者在稳健性检验中讨论了交易成本的影响。
  • 无风险利率已知且恒定:假设 \( r \) 是已知常数。
  • 对冲策略仅依赖于当前可观测信息:假设 \( \Delta_t \)\( t \) 时刻信息集(包括 \( S_t, \tau, K \) 等)的函数。这是一个马尔可夫假设。
  • 训练/测试集划分:使用滚动窗口(rolling window)方法,用过去一段时间的数据训练模型,然后用下一段时间的数据进行样本外测试。这是时间序列预测的标准做法。
  • 与已有文献的对比:相比 Hutchinson et al. (1994),本文的关键强化是直接优化对冲误差而非定价误差。相比 Dumas et al. (1998),本文使用了更灵活的非参数方法。

主要结果

  • 核心量化结论
    • 在 S&P 500 日末数据上,Black-Scholes 基准的均方对冲误差(MSHE)为 \( 1.00 \)(归一化后)。HedgeNet 将其降低到约 \( 0.85 \)(即降低了 15%)。
    • 然而,一个简单的线性回归模型,如果包含标的资产滞后收益率作为特征(以捕捉杠杆效应),其 MSHE 也降低到约 \( 0.85 \)
    • 在 Euro Stoxx 50 数据上,结果类似。HedgeNet 和带杠杆效应的线性回归表现相当,都优于 Black-Scholes。
    • 逐笔交易数据上,HedgeNet 的优势略微明显一些,但线性回归仍然具有很强的竞争力。
  • 与 baseline 对比
    • vs. Black-Scholes:两者都显著优于 Black-Scholes。
    • vs. 传统神经网络 (Hutchinson et al.):作者没有直接复现 Hutchinson et al. 的方法,但通过逻辑论证和实证结果(线性回归也有效)暗示,传统方法(先定价后求导)可能不如直接优化对冲误差的方法。
  • 稳健性:作者进行了多种稳健性检验,包括:
    • 改变训练窗口长度。
    • 改变网络结构(层数、神经元数)。
    • 加入交易成本(发现神经网络和线性回归的优势依然存在,但差距缩小)。
    • 使用不同的期权(看涨/看跌,价内/价外/平价)。
    • 结论在所有检验中基本一致:神经网络和带杠杆效应的线性回归都优于 Black-Scholes,且两者之间没有显著差异

证明路线与技术技巧(本文为应用型,无理论证明)

本文是应用/方法型论文,没有严格的数学定理证明。其“证明”是实证性的。因此,这里不讨论证明路线,而是讨论其方法设计路线实证分析技巧

  • 方法设计路线

    1. 定义目标:明确要最小化的是均方对冲误差 \( \mathbb{E}[e_{t+1}^2] \)
    2. 参数化策略:将对冲策略 \( \Delta_t \) 参数化为一个神经网络 \( \Delta_\theta(\text{features}_t) \) 或一个线性函数 \( \Delta_\beta(\text{features}_t) \)
    3. 构造损失函数:对于每个训练样本 \( (S_t, C_t, S_{t+1}, C_{t+1}) \),计算对冲误差 \( e_{t+1}(\theta) \),损失函数为 \( e_{t+1}(\theta)^2 \)
    4. 优化:使用随机梯度下降(SGD)或其变体(如 Adam)来最小化所有训练样本上的平均损失。
    5. 评估:在滚动窗口的样本外数据上计算 MSHE,并与 Black-Scholes 基准比较。
  • 实证分析技巧

    • 滚动窗口验证:这是处理时间序列数据、避免前瞻偏差的标准技巧。
    • 特征工程:除了 \( S_t, \tau, K \) 等标准特征,作者特别加入了滞后收益率(如 \( \log(S_t/S_{t-1}) \))来捕捉杠杆效应。这是线性回归能取得好效果的关键。
    • 对比分析:作者不仅报告了 MSHE 的绝对值,还报告了相对于 Black-Scholes 基准的百分比降低,使得结果更直观。
    • 统计显著性检验:作者使用了 Diebold-Mariano 检验来比较不同模型的对冲误差是否具有统计上的显著差异。这是时间序列预测模型比较的标准工具。

真实例子与应用

  • 数据
    • S&P 500 指数期权 (SPX):从 1996 年到 2017 年的日末价格数据,以及 2006 年到 2017 年的逐笔交易数据。
    • Euro Stoxx 50 指数期权 (OESX):从 2007 年到 2017 年的日末价格数据。
  • 如何应用
    • 对于每个交易日 \( t \),作者构建一个包含所有可观测期权合约的面板数据集。
    • 对于每个合约,计算其特征(\( S_t, \tau, K \),以及滞后收益率等)。
    • 使用滚动窗口(例如,过去 2 年的数据)训练 HedgeNet 和线性回归模型。
    • 在下一个交易日 \( t+1 \),用训练好的模型为每个合约输出一个对冲策略 \( \hat{\Delta}_t \)
    • 计算从 \( t \)\( t+1 \) 的对冲误差 \( e_{t+1} \)
    • 滚动窗口,重复上述过程,得到整个样本外时期的对冲误差序列。
  • 结果
    • 如前所述,HedgeNet 和带杠杆效应的线性回归都显著优于 Black-Scholes。
    • 作者还发现,HedgeNet 在价外期权(OTM)上的改进最为显著,这可能是因为 Black-Scholes 的 Delta 在这些区域对波动率假设特别敏感。
  • 这个例子想说明什么
    • 主要目的:验证“直接优化对冲误差”这一思路的有效性。
    • 次要目的:揭示一个反直觉的发现——简单的线性模型在考虑了杠杆效应后,其表现与复杂的神经网络相当。这提醒研究者,在应用机器学习方法时,不要忽视简单但有效的基准模型。

🔎 结论是否比证明窄

  • 。论文的标题和摘要暗示了“神经网络”是对冲工具,但核心结论是“神经网络并不比带杠杆效应的线性回归好”。这个结论比标题暗示的要窄。
  • 具体语句:在摘要中,作者写道:“the network is able to reduce the mean squared hedging error of the Black-Scholes benchmark significantly. However, a similar benefit arises by simple linear regressions that incorporate the leverage effect.” 这已经非常诚实地限定了结论。在正文结论部分,作者再次强调:“Our main finding is that a simple linear regression... performs as well as the neural network.” 因此,论文的结论是精确且诚实的,没有过度泛化。

四、开放问题

  1. 理论解释:为什么带杠杆效应的线性回归如此有效?能否从理论上证明,在某种数据生成过程(如 Heston 随机波动率模型)下,最优对冲策略确实是线性的(在某个特征空间上)?这扎根于本文的实证发现(线性模型与神经网络表现相当)。
  2. 更复杂的市场微观结构:本文假设无交易成本。在更现实的、有交易成本、市场冲击和流动性限制的环境中,神经网络相对于线性模型的优势是否会显现?这扎根于本文的稳健性检验(加入交易成本后差距缩小)。
  3. 动态特征选择:本文使用的特征(滞后收益率)是手动选择的。能否用更自动化的方法(如 Lasso 或更复杂的特征工程)来发现其他重要的预测变量?这扎根于本文对“杠杆效应”这一特定特征的强调。
  4. 半参数效率界:能否推导出在给定可观测数据下,最小化均方对冲误差的半参数效率界?即,任何正则估计量所能达到的 MSHE 的下界是什么?本文的实证结果(神经网络和线性回归达到相似水平)是否暗示它们已经接近了这个下界?这扎根于本文缺乏理论下界讨论这一事实。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论