跳转至

Dynamic Discrete Choice and Inverse Reinforcement Learning: Inferring Preferences and Beliefs From Human Behavior

作者: Pranjal Rawat, John Rust
主题: 经济理论 / 应用
相关性: 6/10
链接: https://arxiv.org/abs/2608.24362


一、领域脉络与小综述

这个方向是什么

动态离散选择(DDC)与逆强化学习(IRL)是两个独立发展但解决同一根本问题的子领域:从观测到的序贯行为数据中,推断决策者的偏好(奖励/效用函数)和信念(转移概率/状态信念)。两者均假设个体在马尔可夫决策过程(MDP)框架下最大化期望累积奖励。DDC 起源于 1980 年代的结构计量经济学,侧重用极大似然等经典统计方法进行参数估计和反事实政策评估;IRL 起源于 2000 年代的机器学习,侧重从专家演示中学习奖励函数以训练智能体。两个领域在数学上高度同构,但方法论传统、计算策略和最终目标存在显著差异。当前成熟度:DDC 在低维离散状态空间已有成熟的理论和算法(如 NFXP、NPL),但高维连续状态空间仍是开放挑战;IRL 借助深度神经网络和模型无关方法可扩展至高维,但识别问题和反事实预测的可靠性仍是瓶颈。

发展脉络(history)

  • 奠基工作:
  • Rust (1987):首次将 McFadden 的静态随机效用模型扩展到动态设定,在极值(EV)偏好冲击和条件独立性(CI)假设下,推导出多项 logit(softmax)选择概率和平滑 Bellman 方程,奠定了 DDC 的计量经济学基础。留下的口子:计算负担——嵌套固定点算法(NFXP)需要反复求解 MDP,状态空间稍大即不可行。
  • Ng & Russell (2000):正式提出 IRL 问题,指出其不适定性(多个奖励函数可解释同一行为),并提出最大间隔方法选择唯一解。留下的口子:最大间隔方法对噪声和次优演示敏感,且未利用概率框架。
  • 主要进展:
  • Hotz & Miller (1993):提出条件选择概率(CCP)估计子,通过非参数估计 π 来避免反复求解 MDP,大幅降低计算成本。留下的口子:CCP 估计子因第一阶段非参数估计噪声而效率低于 MLE。
  • Aguirregabiria & Mira (2002):提出嵌套伪似然(NPL)算法,通过交换 NFXP 的内外循环顺序,在保持渐近效率的同时减少策略迭代次数。他们证明 NPL 的零 Jacobian 性质使其对第一阶段估计噪声具有 Neyman 正交性。留下的口子:NPL 仍需要求解线性系统,对高维状态空间不适用。
  • Ziebart et al. (2008, 2010):引入最大因果熵(MCE)IRL,将 IRL 重新表述为约束优化问题(最大化熵,匹配专家特征期望),推导出与 DDC 完全相同的 softmax 策略和平滑 Bellman 方程。留下的口子:MCE IRL 是模型基础的,需要已知转移概率 p 和可枚举状态空间。
  • Ho & Ermon (2016):提出生成式对抗模仿学习(GAIL),将 IRL 转化为一个判别器-生成器博弈,实现模型无关的模仿学习。留下的口子:GAIL 学习的奖励函数不可迁移(bakes in dynamics),无法用于反事实预测。
  • Fu et al. (2018):提出对抗式 IRL(AIRL),通过结构化判别器(分解为奖励近似器 g_φ 和势函数 h_φ)实现可迁移奖励学习。留下的口子:可迁移性理论保证需要确定性动力学和状态无关奖励,经济应用中常不满足。
  • 当前 frontier:
  • 模型无关 IRL 与 DDC 的融合:Adusumilli & Eckardt (2025) 将时序差分(TD)学习与 CCP 估计子结合,提出模型无关的两阶段估计子,并利用 Neyman 正交化修正第一阶段噪声。Kang et al. (2025) 的 GLADIUS 估计子通过分别参数化 Q 和 EV 并求解 maxmin 问题,实现模型无关且全局收敛的 IRL。
  • 识别问题的突破:Cao et al. (2021) 证明在多个环境(不同转移律)下观测同一智能体,奖励可识别至多一个常数。Abbring & Daljord (2020) 证明在理性预期和特定奖励限制下,折扣因子 β 可识别。
  • 高维应用:Barnes et al. (2024) 在 Google Maps 上实现了最大规模 IRL 应用(3.6 亿参数,1.1 亿次行程)。Lee et al. (2026) 将 AIRL 扩展到序列化内容消费,使用章节文本作为高维状态变量。
  • 本文的位置:本文是一篇综述,系统比较 DDC 与 IRL 的数学等价性、方法论差异和共同挑战,旨在促进两个领域的交叉融合。它不提出新方法,而是提供一个统一的视角。

子线索聚类

  1. DDC 的计量经济学方法(Rust 1987, 1988; Hotz & Miller 1993; Aguirregabiria & Mira 2002; Su & Judd 2012; Luo & Sang 2024; Nguyen 2025):侧重极大似然、CCP 估计子、策略迭代、嵌套固定点算法。核心关注点:统计效率、反事实预测、识别条件。计算瓶颈:反复求解 MDP。
  2. IRL 的机器学习方法(Ng & Russell 2000; Ziebart et al. 2008, 2010; Ho & Ermon 2016; Fu et al. 2018; Haarnoja et al. 2017):侧重最大熵、对抗方法、soft Q-learning、深度神经网络。核心关注点:可扩展性、模型无关性、从专家演示中学习。计算瓶颈:高维 MDP 求解和函数近似。
  3. 识别问题与理论(Magnac & Thesmar 2002; Ng et al. 1999; Abbring & Daljord 2020; Cao et al. 2021; Kim et al. 2021):研究从观测行为唯一恢复 {β, r, p} 的条件。核心发现:无额外限制时,奖励仅能识别至一个等价类(potential-based reward shaping)。突破:多环境观测、已知锚定动作、理性预期假设。
  4. 模型无关估计与函数近似(Adusumilli & Eckardt 2025; Kang et al. 2025; van der Laan et al. 2026):结合 TD 学习、深度 Q 网络、Neyman 正交化,避免显式估计 p 或求解 MDP。核心挑战:有限样本下的偏差-方差权衡、半参数效率界。

这个方向在追问的核心问题

  1. 识别问题:给定观测行为 π,能否唯一恢复 {β, r, p}?需要哪些额外限制?不同限制对反事实预测的敏感性如何?
  2. 维度灾难:当状态空间 S 很大或连续时,如何高效求解 MDP 并估计参数?神经网络和随机化能否真正打破维度灾难?
  3. 模型无关 vs 模型基础:模型无关方法(如 TD、GAIL)避免估计 p,但隐含理性预期假设;模型基础方法(如 NFXP、MCE IRL)需要 p,但允许反事实预测。两者在效率、鲁棒性和可迁移性上的权衡是什么?
  4. 有界理性:人类并非完美理性优化者(如 AlphaZero 击败所有人类棋手),如何将 DDC/IRL 扩展到有界理性智能体(如理性疏忽、满足性行为)?

⚠️ 作者的 framing

作者将 DDC 和 IRL 描述为“从不同学科传统出发,解决同一核心问题”的两个领域,强调它们的数学等价性(soft Q-learning 与 EV 冲击下的 DDC 模型等价),并认为“交叉融合提供了实质性方法论进步的机会”。作者淡化的竞争路线: - 模仿学习(IL)和行为克隆(BC):作者承认 IL 是更简单的方法(不需要理性假设),但强调其无法进行反事实预测和迁移。然而,IL 在自动驾驶等应用中已取得巨大成功(Lu et al. 2023),且计算成本远低于 IRL。作者未深入讨论 IL 与 IRL 在实际应用中的性能对比。 - 纯 RL 方法:当奖励函数已知时,RL 可以直接学习最优策略,无需 IRL。作者以 AlphaZero 为例,但未讨论在奖励函数未知但可工程化设计(如自动驾驶中的车道保持、避障)的场景下,RL 是否比 IRL 更实用。 - 贝叶斯方法:作者提及 BIRL 和 MCMC,但未深入讨论贝叶斯方法在处理不确定性(如后验分布而非点估计)方面的优势。

什么明显该被引 / 该存在、却没出现在 intro 里? - 更近期的深度 RL 理论进展:如关于 DQN 收敛性的 Zhang et al. (2023) 在正文中被引用,但 intro 中未提及。这可能是由于 intro 聚焦于领域对比而非技术细节。 - 因果推断中的动态处理效应估计:如 Robins 的 g-computation 和 marginal structural models,它们也处理序贯决策下的反事实预测,但与 DDC/IRL 的交叉较少。这可能是一个值得研究者去查的 gap。

张力

未见明显对立引用。各工作主要在假设强度、计算策略和应用场景上存在差异,而非根本性矛盾。例如,DDC 强调理性预期和 EV 假设,IRL 则通过熵正则化实现混合策略,但两者在数学上等价(如本文所示)。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号:
  • \( S \):状态空间(有限集,|S| 个元素)。\( s \in S \) 表示一个具体状态。
  • \( A \):动作空间(有限集,|A| 个元素)。\( a \in A(s) \subseteq A \) 表示在状态 s 下可行的动作。
  • \( r(s, a) \):奖励函数(效用函数),是待估的参数/函数。在 DDC 中常参数化为 \( r_\theta(s, a) \)。
  • \( p(s' | s, a) \):转移概率,从状态 s 执行动作 a 后转移到 s' 的概率。在模型基础方法中需指定或估计。
  • \( \beta \in (0, 1) \):折扣因子,常假设已知,但也可估计。
  • \( \pi(a | s) \):策略(决策规则),给定状态 s 下选择动作 a 的概率。这是可观测的(从数据中估计)。
  • \( V(s) \):值函数,从状态 s 开始的最优期望累积折扣奖励。
  • \( Q(s, a) \):动作值函数(choice-specific value),在状态 s 执行动作 a 后的最优期望累积折扣奖励。
  • \( \varepsilon \):偏好冲击向量,维度 |A(s)|。个体观测到 ε,但研究者观测不到。在 DDC 中假设 ε 服从多元 Gumbel(Type I 极值)分布,尺度参数 σ。
  • \( \theta \):结构参数,参数化奖励函数 \( r_\theta \) 和/或转移概率 \( p_\theta \)。
  • \( \phi \):函数近似参数(如神经网络权重),用于近似 Q 函数 \( Q_\phi \) 或值函数 \( V_\phi \)。
  • \( \tau_i = \{(s_{it}, a_{it})\}_{t=0}^{T_i} \):第 i 个个体的轨迹(状态-动作序列)。
  • \( D = \{\tau_i\}_{i=1}^N \):观测数据集,包含 N 条轨迹。
  • \( \mu_D = \frac{1}{N} \sum_{i=1}^N \sum_{t=0}^{T_i} \beta^t \vec{r}(s_{it}, a_{it}) \):专家的经验折扣特征计数(当奖励为特征线性组合时)。
  • \( \vec{r}(s, a) = (r_1(s, a), ..., r_K(s, a)) \):K 个已知特征函数。
  • \( \rho(s, a) = (\rho_1(s, a), ..., \rho_K(s, a)) \):K 个基函数,用于近似 Q 或 R。
  • \( H(\pi(s)) = -\sum_{a \in A(s)} \pi(a|s) \log \pi(a|s) \):策略 π 在状态 s 的熵。
  • \( H_c(\pi) = E_\pi \{ -\sum_{t=0}^T \beta^t \log \pi(a_t|s_t) \} \):因果熵。
  • \( d_\pi(s, a) = E_\pi \{ \sum_{t=0}^\infty \beta^t I(s_t = s, a_t = a) \} \):折扣占用度量。
  • \( \text{BE}(\phi) \):Bellman 误差,\( E_{(s,a) \sim D} \{ [\Lambda(Q_\phi)(s, a) - Q_\phi(s, a)]^2 \} \)。
  • \( \text{TD}(\phi) \):时序差分误差,\( E_{(s,a,s') \sim D} \{ [r(s, a) + \beta \max_{a'} Q_\phi(s', a') - Q_\phi(s, a)]^2 \} \)。

  • 模型:

  • 数据生成机制:个体在无限时域、平稳 MDP 中行动。在每个时间 t,个体观测到状态 \( s_t \) 和偏好冲击 \( \varepsilon_t \),选择动作 \( a_t \in A(s_t) \),获得奖励 \( r(s_t, a_t) + \varepsilon_t(a_t) \),然后状态转移到 \( s_{t+1} \sim p(\cdot | s_t, a_t) \)。个体目标是最大化期望累积折扣奖励 \( E[\sum_{t=0}^\infty \beta^t (r(s_t, a_t) + \varepsilon_t(a_t))] \)。
  • 关键假设(DDC 标准设定):(1) 加性可分偏好冲击;(2) 条件独立性(CI):\( p(s', \varepsilon' | s, \varepsilon, a) = g(\varepsilon' | s') p(s' | s, a) \);(3) ε 服从多元 Gumbel 分布,尺度参数 σ,均值 0。
  • 待估对象:结构参数 θ(参数化 r 和/或 p),有时包括 β。

  • 可观测数据:

  • 可观测:状态-动作序列 \( \{(s_{it}, a_{it})\} \)。研究者可以观测到个体所处的状态和采取的动作。
  • 想要但观测不到:
    • 偏好冲击 \( \varepsilon_t \)(个体观测到,研究者观测不到)。
    • 奖励函数 \( r(s, a) \)(待推断的目标)。
    • 转移概率 \( p(s' | s, a) \)(在模型无关方法中不显式估计,但隐含在数据中)。
    • 个体的信念(主观转移概率,在理性预期假设下等于客观 p)。
    • 折扣因子 β(常假设已知)。

第二步:讲最小内核

最简特例:考虑一个单期(T=1)静态离散选择模型,这是 DDC 和 IRL 共享的最小内核。去掉动态性(β=0),MDP 退化为静态随机效用模型(RUM)。

  • 设定:状态空间 S 只有一个元素(或忽略状态)。动作空间 A = {1, 2, ..., J}。个体选择动作 a,获得效用 \( u(a) = r(a) + \varepsilon(a) \),其中 r(a) 是确定性奖励(待估),ε(a) 是独立同分布 Gumbel(0, σ) 冲击。个体选择最大化 u(a) 的动作。
  • 可观测数据:N 个独立个体的选择 \( \{a_i\}_{i=1}^N \)。
  • 核心命题:在 Gumbel 冲击假设下,选择概率为多项 logit(softmax)形式:
    \[\pi(a) = \frac{\exp(r(a)/\sigma)}{\sum_{a' \in A} \exp(r(a')/\sigma)}.\]
  • 证明思路:Gumbel 分布的一个关键性质是:若 \( \varepsilon(a) \) 独立同分布 Gumbel(0, σ),则 \( \max_{a} [r(a) + \varepsilon(a)] \) 服从 Gumbel 分布,且其期望为 \( \sigma \log \sum_a \exp(r(a)/\sigma) \)。选择概率 \( \pi(a) = P(r(a) + \varepsilon(a) \geq \max_{a' \neq a} [r(a') + \varepsilon(a')]) \) 可解析计算为上述 softmax 形式。
  • 这个最小内核说明了什么:
  • 识别问题:给定观测选择概率 π,只能识别奖励的差值 \( r(a) - r(a') \),而非绝对水平。例如,对所有 a 加上常数 C,π 不变。这对应 DDC 中的“奖励仅能识别至一个等价类”。
  • DDC 与 IRL 的等价性:在 DDC 中,ε 被解释为个体观测到但研究者观测不到的偏好冲击;在 IRL 中,softmax 策略被解释为最大熵正则化的结果(个体偏好混合策略)。两者导出完全相同的数学形式。
  • 极大似然估计:最大化 log 似然 \( \sum_i \log \pi_\theta(a_i) \) 等价于匹配经验选择频率与模型预测概率。梯度为 \( \nabla_\theta \log L = \frac{1}{N} \sum_i [\vec{r}(a_i) - E_{\pi_\theta} \vec{r}(a)] \),即经验特征均值与模型期望特征均值之差。这正是 MCE IRL 中的特征匹配约束。
  • 扩展到动态:当 β > 0 时,上述静态 logit 形式仍然成立,但 r(a) 被替换为 Q(s, a)(动作值函数),而 Q 本身是 Bellman 方程的解。动态的核心困难在于 Q 依赖于未来的奖励和转移概率,需要求解 MDP。

这个最小内核是整篇论文的数学基石:所有后续的 DDC 和 IRL 方法(NFXP、NPL、CCP 估计子、MaxEnt IRL、GAIL、AIRL、TD 估计子)都是在这个静态 logit 模型上添加动态结构(Bellman 方程)和/或函数近似(神经网络)得到的。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:系统比较动态离散选择(DDC)与逆强化学习(IRL)两个领域,揭示它们在数学框架(MDP、softmax 策略、平滑 Bellman 方程)上的等价性,并对比它们在估计方法、计算策略和最终目标上的差异。
  2. 核心工具/方法:以 MDP 为统一框架,通过推导 soft Q-learning 与 EV 冲击下 DDC 模型的等价性(公式 17-21),将两个领域的核心方法(NFXP、NPL、CCP 估计子 vs. MaxEnt IRL、GAIL、AIRL、TD 估计子)置于同一数学语言下进行比较。
  3. 主要结论:DDC 和 IRL 共享相同的数学基础(softmax 策略和平滑 Bellman 方程),但 DDC 侧重反事实政策评估(模型基础、极大似然),IRL 侧重从演示中训练智能体(模型无关、深度神经网络)。模型无关 IRL 估计子(如 TD-CCP、GLADIUS)是连接两个领域的有前景方向。两个领域共同面临识别问题和维度灾难。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • MDP 设定:平稳、无限时域、有限状态和动作空间(为简化 exposition,但讨论扩展到连续/高维)。MDP 由 {S, A, r, p, β} 定义。
  • DDC 标准假设(Section 3):
  • 加性可分偏好冲击:奖励可写为 \( r(s, a) + \varepsilon(a) \)。
  • 条件独立性(CI):\( p(s', \varepsilon' | s, \varepsilon, a) = g(\varepsilon' | s') p(s' | s, a) \)。
  • Gumbel 分布:ε 服从多元 Type I 极值分布,尺度参数 σ,均值 0。
  • 理性预期:个体的主观转移概率等于客观 p(在模型基础方法中)。
  • 折扣因子 β 已知(常假设,但 Abbring & Daljord (2020) 讨论其可识别性)。
  • IRL 设定(Section 4):
  • 专家演示:观测到专家轨迹 \( D = \{\tau_i\} \) 或专家策略 π_E。
  • 奖励参数化:常假设线性奖励 \( r_\theta(s, a) = \vec{r}(s, a)^\top \theta \)(CCP 估计子、MaxEnt IRL),或神经网络参数化(GCL、AIRL)。
  • 最大熵原则(MCE IRL):选择最大化因果熵的策略,同时匹配专家特征期望。
  • 模型无关性:不显式估计或使用 p(s'|s, a),仅依赖观测到的转移样本 (s, a, s')。
  • 相比已有文献的放宽/强化:
  • 放宽:本文讨论的模型无关方法(TD-CCP、GLADIUS)放宽了对 p 的显式建模要求。
  • 强化:DDC 的 EV/CI 假设是强分布假设,但带来解析便利性。IRL 的熵正则化假设(个体偏好混合策略)在经济学中缺乏直接行为基础(作者在脚注 9 中讨论)。

主要结果

本文是综述,无新定理。核心结果是对 DDC 和 IRL 数学等价性的系统阐述:

  • 结果 1(数学等价性):在 EV 冲击和 CI 假设下,DDC 模型的最优策略(公式 21)与最大因果熵 IRL 的最优策略(公式 8)完全相同,均为 softmax 形式。对应的值函数满足相同的平滑 Bellman 方程(公式 18-20)。直觉:DDC 中的偏好冲击 ε 在 IRL 中被重新解释为熵正则化项,两者在数学上不可区分。
  • 结果 2(估计方法对比):
  • DDC 方法:NFXP(嵌套固定点,内外循环)、NPL(交换循环顺序,零 Jacobian 性质)、CCP 估计子(两阶段,避免内循环)。核心:模型基础,需要 p。
  • IRL 方法:MaxEnt IRL(模型基础,求解平滑 Bellman 方程)、GAIL(模型无关,对抗训练,但奖励不可迁移)、AIRL(模型无关,结构化判别器实现可迁移奖励)、TD-CCP(模型无关,结合 TD 学习与 CCP 估计子)、GLADIUS(模型无关,分别参数化 Q 和 EV,全局收敛)。
  • 结果 3(识别问题):无额外限制时,奖励仅能识别至一个等价类 \( r_h(s, a) = r(s, a) + \beta \sum_{s'} h(s') p(s'|s, a) - h(s) \)(potential-based reward shaping)。突破:多环境观测(Cao et al. 2021)、已知锚定动作(Hotz & Miller 1993)、理性预期下的折扣因子识别(Abbring & Daljord 2020)。
  • 结果 4(维度灾难与函数近似):神经网络和随机化可缓解维度灾难,但无正式证明能“打破”它。Bellman 误差最小化(公式 5, 9)是核心计算问题,但存在局部最优和过拟合风险。目标网络、经验回放、双时间尺度 SGD 等技术用于稳定训练。

证明路线与技术技巧

本文无新证明,但详细阐述了关键推导:

  • 整体路线:从 MDP 的基本 Bellman 方程(公式 2)出发,引入偏好冲击 ε,推导出平滑 Bellman 方程(公式 18-20)和 softmax 策略(公式 21)。然后展示 DDC 的估计方法(NFXP、NPL、CCP)如何利用这些公式进行推断。接着介绍 IRL 的估计方法(MaxEnt、GAIL、AIRL、TD-CCP、GLADIUS),并指出它们与 DDC 方法的对应关系。
  • 关键跳跃点:
  • 从硬 Bellman 到软 Bellman(公式 2 → 18-20):关键步骤是利用 Gumbel 分布的性质,将 max 算子替换为 log-sum-exp(soft max)。这需要证明 \( E_\varepsilon [\max_a (Q(s, a) + \varepsilon(a))] = \sigma \log \sum_a \exp(Q(s, a)/\sigma) \)(公式 19)。这个跳跃将确定性最优策略转化为概率性 softmax 策略。
  • 从 DDC 到 IRL 的等价性(公式 21 vs 公式 8):关键步骤是认识到 DDC 中的 CCP(公式 21)与最大熵 IRL 中的最优策略(公式 8)形式完全相同。这需要证明最大熵 IRL 的 KKT 条件导出 softmax 策略和平滑 Bellman 方程。
  • 从模型基础到模型无关(公式 9 → 10 → 12 → 13):关键步骤是将 Bellman 误差(BE,需要 p)替换为时序差分误差(TD,不需要 p),然后通过目标网络技巧(FVI,公式 12)或半梯度方法(公式 13)来近似最小化 BE。
  • 技术技巧点名:
  • Contraction mapping:证明 Bellman 算子 Γ 和软 Bellman 算子 Γ_σ 是压缩映射,保证唯一不动点。
  • Policy iteration:Howard (1960) 的算法,交替进行策略评估(求解线性系统)和策略改进(argmax)。
  • Implicit Function Theorem:证明 Q_θ 和 V_θ 是 θ 的连续可微函数,用于 MLE 的渐近理论。
  • Zero Jacobian property:Aguirregabiria & Mira (2002) 证明 NPL 估计子的信息矩阵对第一阶段 CCP 估计噪声具有 Neyman 正交性。
  • Potential-based reward shaping:Ng et al. (1999) 的定理,刻画奖励的等价类。
  • Temporal difference (TD) learning:Sutton (1988) 的随机近似算法,用于模型无关的策略评估。
  • Target network / Fitted value iteration (FVI):Munos & Szepesvári (2008) 的技巧,将 TD 误差转化为回归问题。
  • Semi-gradient method:Sutton & Barto (2020) 的近似梯度方法,用于线性函数近似。
  • Experience replay:Mnih et al. (2015) 的 DQN 技巧,打破数据序列相关性。
  • Neyman orthogonal score:Chernozhukov et al. (2022) 的 DML 框架,用于修正第一阶段估计噪声。
  • Adversarial training / GAN:Ho & Ermon (2016) 的 GAIL,将 IRL 转化为 min-max 博弈。
  • Structured discriminator:Fu et al. (2018) 的 AIRL,分解奖励和势函数以实现可迁移性。

真实例子与应用

本文包含多个真实数据例子和模拟实验的引用:

  1. Gillingham et al. (2022) - 丹麦汽车税改革(Section 1):
  2. 数据/场景:丹麦新车高税率政策下的汽车拥有和交易数据。
  3. 方法:结构估计一个均衡模型,恢复消费者偏好。
  4. 结果:模拟显示降低新车税、提高汽油税可同时改善福利、增加税收、减少 CO2 排放。
  5. 说明:展示 DDC 模型在反事实政策评估中的价值——预测无历史先例的政策变化。

  6. Barnes et al. (2024) - Google Maps 路线偏好(Section 1, 4.5):

  7. 数据/场景:1.1 亿次 Google Maps 行程数据。
  8. 方法:大规模 IRL(3.6 亿参数),推断用户对交通、距离、坡度、安全、风景的权衡。
  9. 结果:RL 生成的路线推荐实现 16-24% 的全局路线质量提升。
  10. 说明:展示 IRL 在真实世界大规模应用中的可行性。

  11. Lee et al. (2026) - 序列化内容消费(Section 4.2, 4.5):

  12. 数据/场景:用户阅读/观看序列化内容(小说、电视剧)的行为数据,章节文本作为高维状态变量。
  13. 方法:AIRL 结合神经网络,利用退出选项(已知零奖励)作为锚定动作实现识别。
  14. 结果:估计出用户对继续阅读的偏好,评估反事实定价策略(如“等待免费”)。
  15. 说明:展示 AIRL 在经济应用中的可迁移性——从观测行为推断偏好,并用于反事实预测。

  16. Lu et al. (2023) - 自动驾驶(Section 4.5):

  17. 数据/场景:10 万英里城市驾驶数据。
  18. 方法:行为克隆(BC)+ 软 actor-critic(SAC)的混合方法。
  19. 结果:相比纯 BC,安全失败减少 38%。
  20. 说明:展示模仿学习与 RL 结合的优势,以及 IRL 在自动驾驶中的潜在价值。

  21. Zhao & Liang (2023) - 上海出租车路线(Section 4.5):

  22. 数据/场景:上海出租车 GPS 轨迹数据。
  23. 方法:AIRL 推断路线偏好。
  24. 结果:优于传统离散选择模型。
  25. 说明:展示 IRL 在路线选择建模中的应用。

🔎 结论是否比证明窄

  • 模型无关方法的效率界:Adusumilli & Eckardt (2025) 在 Section 4.3 中“conjecture that the TD estimator attains the semi-parametric efficiency bound when the transition density is unknown”(p. 24)。这是一个猜想,而非严格证明。论文未提供该效率界的正式推导或证明。
  • GLADIUS 的全局收敛性:Kang et al. (2025) 的 GLADIUS 在“realizability assumptions”下达到 \( O(1/T) + O(1/N) \) 的误差界。作者未讨论当 realizability 不成立时(即 Q 和 EV 不在参数化函数类中)的收敛性。
  • 神经网络打破维度灾难:Section 2.3 和 5 中,作者指出神经网络和随机化“may help break the curse of dimensionality”,但明确说明“there is no formal proof that they actually ‘break’ this curse”。这是一个谨慎的 claim,而非已证明的结论。
  • AIRL 的可迁移性:Fu et al. (2018) 的可迁移性理论保证(Section 4.2)需要“deterministic dynamics and state-only rewards”。作者指出“Without the state-only restriction, or under stochastic dynamics, the decomposition is approximate.” 这意味着在实际应用中(如 Lee et al. 2026 的序列化内容消费),可迁移性只是近似的,缺乏严格保证。

四、开放问题(点到为止,扎根具体语句)

  1. 模型无关 IRL 的半参数效率界:Adusumilli & Eckardt (2025) 猜想 TD 估计子达到转移密度未知时的半参数效率界(p. 24)。扎根:Section 4.3 末尾的 conjecture。要证什么:严格证明在 p 未知且非参数估计下,TD-CCP 估计子的渐近方差是否达到半参数效率下界。这需要结合半参数理论和 M-估计的渐近理论。

  2. 有限样本下识别问题的量化:Section 3.3 和 5 讨论了识别问题,但未给出有限样本下识别集(identified set)的刻画。扎根:Section 3.3 关于“partially identified”的讨论,以及 van der Laan et al. (2026) 关于反事实预测对识别限制敏感性的“call for caution”。要估什么:给定有限样本和特定假设(如锚定动作、多环境),能否构造出奖励函数识别集的置信区域?这需要结合部分识别(partial identification)和推断理论。

  3. 有界理性下的 DDC/IRL:Section 5 指出“there is relatively little work on how to adapt DDC and IRL to infer rewards of boundedly rational agents”。扎根:Section 5 的讨论,以及 Anderson et al. (2025) 关于网球运动员次优行为源于扭曲信念的发现。要做什么:开发能够区分“次优行为源于无法优化 vs. 非理性信念”的模型和估计方法。这可能需要结合理性疏忽(rational inattention)或认知层次(cognitive hierarchy)模型。

  4. 高维状态空间下函数近似的理论保证:Section 2.3 和 3.2 讨论了神经网络近似,但“there is no formal proof that they actually ‘break’ this curse”。扎根:Section 2.3 末尾的明确声明。要证什么:对于特定子类 MDP(如具有低维结构或光滑值函数),能否证明神经网络近似 + 随机化 SGD 的样本复杂度随状态维度多项式增长而非指数增长?这需要结合近似理论(如 Barron 1993)和随机优化理论。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论