跳转至

Time preference effects in forecasting

作者: Yannick Hoga, Niklas V. Lehmann
主题: 经济理论 / 应用
相关性: 6/10
链接: https://arxiv.org/abs/2607.13759


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是预测评估中的激励相容性,具体而言,是当预测事件的发生时间不确定(即“时间变化事件”,time-varying events)时,如何设计奖励机制以激励预测者诚实报告其真实信念。该问题的根本困难在于:预测的评估(和奖励)只能在事件发生后进行,而事件发生的时间本身是不确定的。如果预测者对未来奖励存在时间贴现(偏好即时收益),那么这种“事后评估”机制会扭曲激励,导致预测者倾向于报告一个更早发生事件的概率,而非其真实期望。该方向当前处于从理论建模向实证验证过渡的阶段:已有大量关于评分规则激励相容性的理论,但将时间偏好纳入考量的工作极少,本文是首个系统性的理论与实证结合的研究。

发展脉络(history)

  1. 奠基工作:严格适当评分规则(Strictly Proper Scoring Rules)

    • Brier (1950):提出了Brier评分(二次评分规则),并指出存在激励相容的支付方案,能使预测者诚实报告其期望。这是整个领域的起点。
    • Lindley (1982):给出了一个关键引理(Lemma 4),证明了如果评分规则在条件于不同结果时被乘以不同的常数权重,则其将不再严格适当。本文的核心理论证明直接依赖于此引理。
    • Gneiting & Raftery (2007):系统性地总结了严格适当评分规则的理论,包括CRPS(连续排序概率评分),并证明了其严格适当性。本文的CRPS部分建立在此之上。
  2. 主要进展:预测者困境(Forecaster's Dilemma)与加权评分规则

    • Lerch et al. (2017):提出了“预测者困境”,指出当极端事件发生时,预测会获得不成比例的关注,这等价于对评分规则进行了结果依赖的加权,从而扭曲了最优预测。本文作者明确指出,他们的问题与预测者困境“共享相同的基本结构”,区别在于前者是外部(公众关注)导致的失衡,而本文是内部(时间贴现)导致的失衡。
    • Gneiting & Ranjan (2011):证明了任何形式的加权(threshold- or quantile-weighted)都会不可避免地扭曲最优预测。本文的Theorem 1的证明思路与Gneiting & Ranjan (2011)的Theorem 1的证明一致,但本文的证明更一般化,不要求T具有密度函数。
  3. 当前Frontier:行为经济学与信念揭示

    • Armantier & Treich (2013):通过实验发现,参与者在进行概率判断时,容易受到对冲或规避风险机会的影响,从而不诚实报告。
    • Ottaviani & Sorensen (2006):研究了预测者在竞争环境中策略性报告的行为,例如为了脱颖而出或从众。
    • Chambers & Lambert (2021):作者引用其指出“时间偏好[...]使揭示任务复杂化”,这是本文作者找到的唯一明确提及时间偏好与预测关系的文献,但该文献并未深入研究。本文作者将此视为一个明确的缺口。
  4. 本文的位置:本文填补了上述文献中的一个明确空白——没有工作研究时间偏好对预测激励的影响。作者将时间偏好效应定位为预测者困境的“内部版本”,并首次提供了来自真实世界预测锦标赛的实证证据。

子线索聚类

  1. 评分规则理论:Brier (1950), Lindley (1982), Gneiting & Raftery (2007), Gneiting & Ranjan (2011), Matheson & Winkler (1976), Hersbach (2000)。这一簇关注评分规则的数学性质,如严格适当性、分解(校准vs.精度)等。本文的理论部分(Section 2 & 3)属于此线索。
  2. 行为经济学与信念揭示:Armantier & Treich (2013), Charness et al. (2021), Hossain & Okui (2013), Danz et al. (2022), Abeler et al. (2019)。这一簇通过实验研究人们在激励下如何报告信念,发现人们会因风险规避、对冲、诚实偏好等原因偏离诚实报告。本文的实证部分(Section 4)与这一线索紧密相关,但使用了观测数据而非实验。
  3. 预测锦标赛中的策略行为:Ottaviani & Sorensen (2006), Witkowski et al. (2023)。这一簇研究预测者在竞争环境(如锦标赛)中的策略性报告行为,例如为了排名而调整预测。本文的实证背景(Metaculus)是一个预测锦标赛,但本文关注的激励来源(时间贴现)与竞争策略不同。

这个方向在追问的核心问题

  1. 激励相容性:对于一个时间不确定的事件,是否存在一个支付方案,能激励风险中性、时间贴现的预测者诚实报告其信念?
  2. 偏差方向与大小:如果存在偏差,其方向是什么(高估还是低估早期概率)?偏差的大小如何依赖于贴现率、事件的时间分布等参数?
  3. 实证存在性:在真实世界的预测中,时间偏好效应是否显著存在?其量级如何?
  4. 缓解策略:如何设计机制来消除或减轻时间偏好效应?

当前主流方法与已知瓶颈:主流方法是使用严格适当评分规则(如Brier评分、对数评分、CRPS)进行事后评估。已知瓶颈是,这些规则在时间贴现下不再激励相容。理论上的解决方案(如按比例增加未来奖励)在实践中难以实施,因为需要知道预测者的贴现率。

⚠️ 作者的 framing

  • 作者的缺口frame:作者将缺口frame为“时间偏好对预测的影响从未被研究过”。他们通过引入“时间固定事件”(time-fixed events)和“时间变化事件”(time-varying events)的区分,将问题具体化。他们声称,之前文献主要关注前者,而忽略了后者。这使得本文成为“显然的下一步”。
  • 被淡化或回避的竞争路线
    • 生存分析(Survival Analysis):作者在Introduction中明确提到了生存分析,并承认其与本文的“重叠”,但迅速将其定义为“更关注推断而非预测”,从而将其边缘化。这回避了一个问题:生存分析中的许多模型(如Cox比例风险模型)和概念(如风险函数)是否可以直接用于建模和校正这种预测偏差?
    • 风险厌恶(Risk Aversion):作者在脚注3中承认“风险厌恶是另一个可能导致不诚实报告的原因”,但全文假设预测者是风险中性的。这回避了风险厌恶与时间贴现的交互作用,以及如何区分二者的实证挑战。
  • 什么明显该被引/该存在、却没出现在intro里?:作者没有引用任何关于动态不一致性(dynamic inconsistency)双曲线贴现(hyperbolic discounting) 的行为经济学经典文献(如Laibson, 1997; O'Donoghue & Rabin, 1999)。本文的模型假设了一个简单的指数贴现(或常数贴现率r),而行为经济学的大量证据表明,人类的贴现往往是双曲线的(即对近期与远期的贴现率不同)。这是一个值得研究者去查的问题:如果使用双曲线贴现,本文的理论结论是否会改变?实证结果是否会更显著?

张力

未见明显对立引用。所有被引工作都指向一个共识:激励会影响报告行为,但时间偏好这个具体因素未被研究。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(X \in \{0, 1\}\)事件\(X=1\) 表示事件发生,\(X=0\) 表示事件未发生。这是研究者想要预测的目标变量
    • \(T\)事件发生的时间(如果发生)。对于时间变化事件,\(T\) 是一个随机变量,可以在多个时间点取值。在Section 2的离散例子中,\(T \in \{2, 3\}\)。在Section 3的连续时间模型中,\(T \in [0, \tau]\),其中 \(T=\tau\) 表示事件在时间窗 \([0, \tau)\) 内未发生(或更晚发生)。
    • \(G \in [0, 1]\)预测者报告的概率。这是研究者可观测的变量。
    • \(E[X]\)预测者的真实信念(期望)。这是不可观测的潜在变量。激励相容的目标是让 \(G = E[X]\)
    • \(S(G, X)\)严格适当评分规则,如Brier评分 \(S(G, X) = (X - G)^2\)。这是一个函数,用于评估预测的准确性。
    • \(r > 0\)贴现率。预测者偏好即时收益,因此对未来的奖励进行贴现。在Section 2中,\(r\) 是两期之间的贴现率;在Section 3中,\(r\) 是连续复利贴现率。
    • \(F(t) = P(T \le t)\)事件发生时间的真实累积分布函数(CDF)。这是不可观测的。
    • \(G(t)\)预测者报告的事件发生时间的CDF。这是可观测的(如果预测是分布式的)。
  • 模型

    • 数据生成机制:事件 \(X\) 及其发生时间 \(T\) 由某个未知的真实分布 \(F\) 生成。预测者拥有关于这个分布的私人信息(即其真实信念 \(E[X]\)\(F(t)\))。
    • 预测者行为:预测者是风险中性期望评分最小化者。他们选择一个报告 \(G\) 以最小化其期望贴现评分 \(E[S^d(G, X)]\),其中 \(S^d\) 是原始评分 \(S\) 经过贴现调整后的版本。
    • 已知:评分规则 \(S\) 是已知且固定的。贴现率 \(r\) 是预测者的私人参数,研究者未知。
    • 要估的对象:真实信念 \(E[X]\)\(F(t)\)。但研究者只能观测到报告 \(G\)
  • 可观测数据

    • 可观测:预测者的报告 \(G\)(或 \(G(t)\)),以及事件最终是否发生 \(X\) 和发生时间 \(T\)(如果发生)。
    • 不可观测:预测者的真实信念 \(E[X]\)(或 \(F(t)\))和贴现率 \(r\)
    • 关键识别问题:由于真实信念不可观测,研究者无法直接验证预测者是否诚实。本文的实证策略是比较两类事件的校准曲线:时间固定事件(无时间偏好效应)和时间变化事件(有时间偏好效应)。如果校准曲线存在系统性差异,则归因于时间偏好效应。

第二步:讲最小内核

本文的最小内核是Section 2中的最佳三局两胜制系列赛例子。这个例子剥离了所有连续时间、复杂分布等一般性设定,清晰地展示了核心机制。

  • 最简特例

    • 事件:Alice赢得一个最佳三局两胜的系列赛(\(X=1\))。目前比分是1-0,Alice领先。
    • 时间:系列赛可以在第2场比赛(\(T=2\))或第3场比赛(\(T=3\))后结束。如果Alice在第2场获胜,她立即赢得系列赛(\(X=1, T=2\))。如果Alice在第2场输了,则进入第3场决胜局(\(T=3\))。
    • 预测:预测者被问“Alice会赢得系列赛吗?”,并报告一个概率 \(G\)
    • 评分:使用Brier评分 \(S(G, X) = (X-G)^2\)。奖励在事件发生后立即支付。
    • 贴现:预测者贴现未来奖励。假设第2场后的奖励价值是第3场后的奖励价值的 \((1+r)\) 倍。即,贴现评分 \(S^d(G, X)\)\(T=2\) 时乘以 \((1+r)\),在 \(T=3\) 时不变。
  • 核心思路

    1. 真实信念:预测者的真实信念是 \(E[X] = P(T=2) + P(T=3)\),即Alice在第2场或第3场获胜的概率之和。
    2. 无贴现时的最优报告:如果 \(r=0\),最小化期望Brier评分 \(E[S(G, X)]\) 的最优报告是 \(G = E[X]\)。这是严格适当评分规则的性质。
    3. 有贴现时的期望评分:当 \(r>0\) 时,预测者最小化的是期望贴现评分 \(E[S^d(G, X)]\)。通过计算,可以得到条件期望:
      • \(E[S^d(G, X) | X=0] = G^2\)
      • \(E[S^d(G, X) | X=1] = (1-G)^2 \times (1 + P(T=2 | X=1) r)\)
    4. 关键跳跃:比较无贴现和有贴现的条件期望。在有贴现的情况下,当 \(X=1\) 时,评分被一个大于1的因子 \((1 + P(T=2 | X=1) r)\) 加权。这等价于Lindley (1982) Lemma 4中的“结果依赖权重”情形。
    5. 结果:应用Lindley (1982) Lemma 4,可以解出最小化期望贴现评分的最优报告 \(G\)
      \[G = \frac{E[X] + P(T=2) r}{1 + P(T=2) r}\]
    6. 结论:对于 \(r > 0\)\(P(T=2) > 0\),有 \(G > E[X]\)。即,预测者会报告一个高于其真实信念的概率。这是因为预测者可以通过“押注”Alice在第2场获胜(一个更早的、确定的奖励)来获得额外收益,即使这偏离了其真实信念。

这个例子完美地展示了本文的核心数学困难:如何将时间贴现(一个行为参数)转化为评分规则的条件权重,并证明这种权重破坏了严格适当性,导致预测偏差。论文的一般情形(连续时间、CRPS)只是将这个离散、二值的例子推广到了更一般的设定。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了当预测者对未来奖励存在时间贴现时,对“时间变化事件”(即发生时间不确定的事件)的预测评估机制会如何激励不诚实的报告行为。
  2. 核心工具/方法:理论部分使用贴现的严格适当评分规则(贴现Brier评分和贴现CRPS),并借助Lindley (1982) Lemma 4变分法(Calculus of Variations) 推导最优报告。实证部分利用Metaculus预测锦标赛数据,通过比较“时间固定事件”和“时间变化事件”的校准曲线,并使用逆概率处理加权(IPTW)被试内设计(Within-subject design) 来控制混杂。
  3. 主要结论:理论证明,任何在事件发生后立即评估的激励相容支付方案,在预测者存在时间贴现时都会变得激励不相容,导致预测者系统性地高估事件早期发生的概率。实证分析发现,Metaculus上的预测者确实表现出这种偏差,其预测在时间变化事件上显著高于时间固定事件,且该效应在控制主题和预测者自选择后依然稳健。

关键设定与假设

  • 设定
    • 预测者:风险中性、期望评分最小化者。
    • 评分规则:严格适当评分规则(Brier评分,CRPS)。
    • 贴现:指数贴现(常数贴现率 \(r\))。在Section 2中是离散的,在Section 3中是连续的(\(e^{-rt}\))。
    • 事件类型:时间固定事件(在预定时间点验证)和时间变化事件(可以在任意时间点发生或验证)。
  • 关键假设
    • SUTVA-like假设:预测者的报告不影响事件本身的发生。这是所有预测评估研究的基础假设。
    • 可忽略性(Ignorability)假设(实证部分):在控制了主题(通过IPTW)和预测者个体效应(通过被试内设计)后,事件是时间固定还是时间变化,与预测者的校准误差无关。这是本文实证识别策略的核心假设。作者通过稳健性检验(如使用不同样本、折叠数据)来支持这一假设。
    • 线性校准假设(实证部分):校准曲线是线性的(公式9)。作者论证了完美校准是线性的,且理论推导的偏差也是线性的(在离散例子中),因此线性模型是合理的。
    • 相比已有文献的放宽/强化
      • 放宽:相比Gneiting & Ranjan (2011) 和 Lerch et al. (2017) 的加权评分规则理论,本文的Theorem 1不要求T具有密度函数,允许T在τ处有概率质量(即事件可能永不发生)。这使得证明更复杂,需要用到变分法。
      • 强化:本文的实证部分提供了一个在真实世界、非实验环境下检验理论预测的机会,这是对之前纯理论或实验室实验研究的重要补充。

主要结果

  • 理论结果1(Section 2,公式5):对于离散时间、二值事件,使用贴现Brier评分时,最优报告 \(G\) 与真实信念 \(E[X]\) 的关系为:

    \[G = \frac{E[X] + P(T=2) r}{1 + P(T=2) r}\]

    • 直觉:偏差 \(G - E[X]\) 与贴现率 \(r\) 和事件早期发生的概率 \(P(T=2)\) 成正比。
    • 必要条件\(r > 0\)\(P(T=2) > 0\)
    • 解决的技术难点:将贴现转化为结果依赖的权重,并应用Lindley (1982) Lemma 4。
  • 理论结果2(Section 3,Theorem 1):对于连续时间、分布预测,使用贴现CRPS时,最优报告CDF \(G(t)\) 与真实CDF \(F(t)\) 的关系为:

    \[G(t) = F(t) \frac{E[e^{-rT} | T \le t]}{E[e^{-rT}]}\]

    • 直觉\(G(t) \ge F(t)\),即预测者会系统性地报告一个更早的CDF(将概率质量前移)。偏差的大小由贴现率 \(r\) 和条件期望 \(E[e^{-rT} | T \le t]\) 决定。
    • 必要条件\(r > 0\)
    • 解决的技术难点:将期望贴现CRPS写成一个积分,然后使用变分法(Euler-Lagrange方程)找到最小化该积分的函数 \(G(t)\)。证明的关键在于处理T在τ处的点质量,这需要用到Dacorogna (2008) 的变分法定理。
  • 实证结果(Section 4,Table 4)

    • 在控制了主题和预测者自选择后,时间变化事件预测的校准曲线与时间固定事件预测的校准曲线存在显著差异。
    • 关键系数 \(\beta_3\)(时间变化事件与预测值的交互项)显著为负(-0.129, p<0.001),表明对于给定的预测值,时间变化事件的实际发生频率更低。这等价于预测者对时间变化事件的预测值系统性偏高。
    • 效应量显著:例如,对于一个真实发生概率为30%的事件,对时间固定事件的预测平均为32.9%,而对时间变化事件的预测平均为36.4%(Table 5)。对于70%概率的事件,预测值分别为70.4%和79.1%。

证明路线与技术技巧

  • 整体路线(Theorem 1证明)

    1. 写出目标函数:将期望贴现CRPS \(E[CRPS^d(G, T)]\) 写成一个关于 \(G(t)\) 的积分(公式S.1)。
    2. 定义拉格朗日函数:将积分中的被积函数定义为拉格朗日函数 \(L(t, G(t))\)(公式S.2)。
    3. 应用变分法:由于 \(L\) 关于 \(G\) 是凸的,且满足增长条件,可以使用变分法中的Euler-Lagrange方程。该方程给出 \(G(t)\) 必须满足的一阶条件。
    4. 求解一阶条件:从Euler-Lagrange方程解出 \(G(t)\) 的表达式(公式S.3),其中包含一个待定常数 \(c\)
    5. 利用边界条件确定常数:利用 \(G(\tau) = 1\)(因为事件一定会在 \([0, \tau]\) 内或之后发生)这一边界条件,确定常数 \(c\)
    6. 得到最终形式:代入常数后,得到 \(G(t)\) 的最终表达式(公式S.4),并证明其是一个有效的CDF。
    7. 证明唯一性:利用 \(L\) 的严格凸性和Dacorogna (2008) 的定理,证明该解是唯一的。
    8. 证明 \(G(t) \ge F(t)\):利用 \(E[e^{-rT} | T \le t]\)\(t\) 的非减函数这一性质。
  • 关键跳跃点

    • 从离散到连续:从Section 2的离散、二值例子到Section 3的连续时间、分布预测,证明方法从简单的代数运算(Lindley引理)跃迁到变分法。这是技术难度上的一个主要跳跃。
    • 处理T在τ处的点质量:这是证明中最“吃劲”的部分。Gneiting & Ranjan (2011) 的证明假设T有密度,从而可以简化。本文的证明需要处理T在τ处的概率质量(即事件可能永不发生),这使得拉格朗日函数和边界条件更复杂,必须依赖Dacorogna (2008) 的更一般的变分法框架。
  • 技术技巧点名

    • 变分法(Calculus of Variations):用于求解连续时间下的最优预测函数 \(G(t)\)。具体使用了Euler-Lagrange方程和Dacorogna (2008) 的定理。
    • 逆概率处理加权(IPTW):用于平衡时间固定事件和时间变化事件在主题分布上的差异,是一种因果推断中常用的控制混杂的方法。
    • 被试内设计(Within-subject design):通过比较同一个预测者对两类事件的预测,来控制预测者个体特征(如能力、风险偏好)带来的混杂。
    • 随机效应元分析(Random-effects meta-analysis):用于汇总202个预测者的个体回归结果,得到平均处理效应。

真实例子与应用

  • 数据:Metaculus预测锦标赛数据,截至2024年8月,包含2005个二元事件。其中775个被分类为时间固定事件,798个为时间变化事件(只能提前发生)。
  • 方法应用
    1. 校准曲线:绘制所有预测者的聚合校准曲线(Figure 4),直观展示时间变化事件预测的系统性偏高。
    2. IPTW:使用逻辑回归估计每个预测属于时间变化事件的概率(基于80个主题标签),然后计算权重,以平衡两类事件的主题分布。
    3. 被试内回归:对每个满足条件(至少对40个不同事件做出80个预测)的预测者(共202个),拟合线性回归模型(公式9),估计其个人校准曲线。然后使用随机效应元分析汇总这些个体系数。
  • 结果:Table 4显示,在控制了主题和预测者自选择后,关键系数 \(\beta_3\) 显著为负,证实了时间偏好效应的存在。Table 5量化了偏差的大小。
  • 例子想说明什么:这个实证例子旨在验证理论预测(时间偏好导致预测偏高)在真实世界中的存在性和显著性。它表明,即使在非货币激励(声誉)下,时间偏好效应也足够强大,足以影响预测行为。同时,通过IPTW和被试内设计,作者试图论证该效应并非由主题差异或预测者自选择等混杂因素驱动。

🔎 结论是否比证明窄

  • 结论:作者在Abstract和Conclusion中声称“every incentive-compatible payment scheme... becomes incentive-incompatible... when forecasters discount the future”。这个结论非常强。
  • 证明的覆盖范围:证明严格覆盖了指数贴现(常数贴现率 \(r\))和特定评分规则(Brier评分和CRPS)。作者在Remark 2中承认,贴现函数 \(d(t)\) 可以是任何非增函数,证明可以“verbatim”推广。但证明并未覆盖双曲线贴现或其他更复杂的贴现形式。此外,证明假设预测者是风险中性的。
  • 窄于结论的地方:因此,结论“every incentive-compatible payment scheme”可能过于宽泛。它严格成立的前提是贴现函数是时间一致的(如指数贴现)且预测者风险中性。如果贴现是双曲线的(时间不一致),或者预测者是风险厌恶的,结论可能需要修正。作者在脚注3中承认了风险厌恶的问题,但未深入探讨。这是一个值得研究者去查的潜在缺口。

四、开放问题

  1. 估计贴现率 \(r\):本文的理论和实证都依赖于贴现率 \(r\),但 \(r\) 是预测者的私人参数,未被估计。能否利用Metaculus数据,结合事件的时间分布和预测偏差,来反事实地估计预测者的平均贴现率 \(r\)?这需要更复杂的结构模型。扎根点:Section 5讨论中提到的“estimating the size of the distortion as a function of time-to-event (or estimating \(r\)) is less straightforward than it may seem”,以及“surprisingly-early bias”的挑战。

  2. 设计激励相容的机制:作者在Section 5中讨论了四种解决方案,但认为每种都有缺陷。能否设计一个新的、激励相容的评分规则,使其在预测者存在时间贴现(甚至双曲线贴现)时仍能激励诚实报告?例如,是否可以设计一个“延迟支付”或“基于排名”的机制,使得奖励的期望现值与报告的真实性无关?扎根点:Section 5的讨论,特别是“there is no solution that comes without drawbacks”。

  3. 区分时间偏好与其他认知偏差:作者在Section 5的讨论中承认,无法完全区分时间偏好效应与“与时间变化事件密切相关的认知偏差”。能否设计一个实验室实验,通过随机分配预测者到时间固定/时间变化事件,并操纵奖励的支付时间,来干净地识别时间偏好的因果效应?扎根点:Section 5的“A cognitive bias that is closely associated with time-varying events cannot be distinguished from an effect that is caused by human preferences”,以及Conclusion中的“conducting a controlled experiment could deepen our understanding”。

  4. 推广到非二元事件和更一般的评分规则:本文的理论主要针对二元事件(Brier评分)和分布预测(CRPS)。能否将结论推广到多分类事件连续结果?对于其他严格适当评分规则(如对数评分),其贴现版本是否也具有类似的性质?扎根点:Section 2的Remark 1提到“The argument extends mutatis mutandis to any number of time steps... and to any discounting scheme and number of potential outcomes”,但并未给出具体证明。这是一个明确的推广方向。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论