跳转至

Dynamic Discrete Choice and Inverse Reinforcement Learning: Inferring Preferences and Beliefs From Human Behavior

作者: Pranjal Rawat, John Rust
主题: 经济理论 / 应用
相关性: 6/10
链接: https://arxiv.org/abs/2608.24362


一、领域脉络与小综述

这个方向是什么

本文综述的两个子领域——动态离散选择(DDC) 与逆强化学习(IRL)——从不同学科传统出发,解决同一核心问题:从观测到的序贯行为推断决策者的偏好(reward / utility function)。两者均假设个体在马尔可夫决策过程(MDP)框架下最大化期望奖励函数,且行为因未观测的随机冲击而呈现概率性。DDC 起源于 1980 年代的结构计量经济学(structural econometrics),核心目标是反事实政策评估(counterfactual policy evaluation);IRL 起源于 2000 年后的机器学习,核心目标是从专家示范中学习奖励函数,以训练智能体。尽管起源与动机不同,两者在数学上已高度趋同:IRL 中流行的“软 Q 学习”(soft Q-learning)框架与 DDC 在加性极值(EV)偏好冲击下的模型导出完全相同的 softmax(多项 logit)选择概率和平滑 Bellman 方程。

发展脉络(history)

奠基工作(1980s–1990s): - Rust (1987):将 McFadden (1973) 的静态随机效用模型扩展到动态设定,在 EV 偏好冲击 + 条件独立性(CI)假设下,导出了 softmax 形式的条件选择概率(CCP)和平滑 Bellman 方程(即本文的式 (18)–(21))。这是 DDC 的奠基论文。 - Hotz & Miller (1993):提出 CCP 估计器——先用非参数方法估计 CCP,再通过 Hotz-Miller 反演(式 (32))恢复选择特定值函数(Q)的差值,从而避免在参数搜索中反复求解 MDP。这是 DDC 中“两步法”的起源,显著降低了计算负担。 - Ng & Russell (2000):正式提出 IRL 问题,指出其不适定性(ill-posed),并给出最大间隔(maximum margin)解法。这是 IRL 领域的奠基论文。

主要进展(2000s–2010s): - Aguirregabiria & Mira (2002):提出 NPL(嵌套伪似然)估计器,将 CCP 估计与策略迭代(policy iteration)结合,通过“交换” NFXP 的内外循环顺序,在保持渐近效率的同时减少策略迭代次数。他们证明了 NPL 的“零 Jacobian 性质”,使参数估计对第一阶段 CCP 估计噪声具有 Neyman 正交性。 - Ziebart et al. (2008, 2010):提出 最大因果熵(MCE)IRL,从最大熵原理导出 softmax 策略和平滑 Bellman 方程,建立了 IRL 与 DDC 的数学等价性。Ziebart et al. (2010) 明确指出 MCE IRL 与 EV 冲击下的 DDC 模型“几乎同构”。 - Haarnoja et al. (2017):提出 软 Q 学习(soft Q-learning),将熵正则化引入 RL,解决了探索-利用困境,并证明了其收敛到 softmax 最优混合策略。该工作直接连接了 DDC 的 EV 冲击解释与 IRL 的熵正则化解释。 - Ho & Ermon (2016):提出 GAIL(生成式对抗模仿学习),将 IRL 转化为 occupancy measure 匹配的对抗训练,实现了模型无关(model-free)的 IRL。但 GAIL 学到的奖励函数不可迁移(non-portable)。 - Fu et al. (2018):提出 AIRL(对抗式 IRL),通过结构化的判别器(式 (35))实现奖励与 shaping potential 的解耦,在确定性动力学下证明了可迁移性。

当前 frontier(2020s–至今): - 模型无关 IRL 的渐近理论:Adusumilli & Eckardt (2025) 将 TD 学习与 CCP 估计器结合,提出模型无关的两步/三步估计器,并 conjecture 其达到半参数效率界。Kang et al. (2025) 的 GLADIUS 估计器在可实现性(realizability)假设下给出全局收敛率 O(1/T) + O(1/N)。 - 识别问题的深化:Cao et al. (2021) 证明在两种不同转移律的环境下可识别奖励至多一个常数;Abbring & Daljord (2020) 证明折扣因子在理性预期和特定奖励限制下可识别。 - 大规模应用:Barnes et al. (2024) 在 Google Maps 上部署了 3.6 亿参数的 IRL 模型,使用 1.1 亿次行程数据,实现了全球路线质量 16-24% 的提升——这是目前最大规模的 IRL 实际应用。

本文的位置:这是一篇综述论文(survey),旨在系统比较 DDC 与 IRL 的数学框架、估计方法和识别问题,并指出交叉融合的潜力。它不提出新方法,而是为两个领域的从业者提供统一的视角。

子线索聚类

  1. DDC 的估计方法(Rust, 1987; Hotz & Miller, 1993; Aguirregabiria & Mira, 2002; Su & Judd, 2012; Luo & Sang, 2024; Nguyen, 2025):聚焦于如何从观测数据中估计结构参数(奖励、转移概率、折扣因子),核心方法包括 NFXP、CCP 估计器、NPL、MPEC、SEES、NNES。这些方法通常是模型基础的(model-based),需要显式建模或估计转移概率 p(s'|s,a)。

  2. IRL 的熵方法与对抗方法(Ziebart et al., 2008, 2010; Ho & Ermon, 2016; Fu et al., 2018; Kaji et al., 2023):从最大熵原理或 occupancy measure 匹配出发,发展出 MaxEnt IRL、GAIL、AIRL 等算法。这些方法在 IRL 中更常见,且 GAIL/AIRL 是模型无关的。

  3. 识别问题(Hotz & Miller, 1993; Magnac & Thesmar, 2002; Ng et al., 1999; Abbring & Daljord, 2020; Cao et al., 2021; van der Laan et al., 2026):研究从观测行为到结构参数的反向映射是否唯一。核心结论是:无额外限制时,奖励只能被识别到“potential-based reward shaping”等价类(式 (r_h));需要归一化动作(anchor action)或多环境数据才能实现点识别。

  4. 模型无关 IRL 与函数逼近(Adusumilli & Eckardt, 2025; Kang et al., 2025; Jain et al., 2019):结合 TD 学习、深度神经网络和两步法,在避免显式建模转移概率的同时,处理高维状态空间。这是当前最活跃的交叉方向。

这个方向在追问的核心问题

  1. 识别问题:给定观测行为,能否唯一恢复奖励函数和信念(转移概率)?已知无额外限制时不可识别,但哪些限制(归一化动作、多环境、理性预期)足以实现点识别?反事实预测对识别假设的敏感性如何?
  2. 维数灾难:MDP 求解(内循环)的计算复杂度随状态空间维度指数增长。神经网络和随机化能否真正“打破”维数灾难?目前没有正式证明(本文第 2.3 节明确承认“there is no formal proof that they actually ‘break’ this curse”)。
  3. 模型无关 vs. 模型基础:模型无关方法(如 TD-CCP、GAIL)避免估计 p(s'|s,a),但隐含理性预期假设;模型基础方法(如 NFXP、NPL)需要估计 p,但允许反事实预测。两者在效率、稳健性和可迁移性之间的权衡是什么?
  4. 理性假设的合理性:AlphaZero 超越所有人类棋手,表明人类并非完美理性优化者。如何将 DDC/IRL 扩展到有界理性(bounded rationality)主体?目前“relatively little work” (本文第 5 节)。

⚠️ 作者的 framing

作者将缺口 frame 成“DDC 与 IRL 尽管起源不同,但数学框架高度相似,交叉融合可促进双方进步”。具体而言: - 作者强调 soft Q-learning 与 EV 冲击下的 DDC 模型等价(第 3 节),从而将 IRL 的熵正则化解释与 DDC 的随机效用解释统一。 - 作者将 模型无关 IRL(如 TD-CCP、GLADIUS)定位为 DDC 的“计算更高效”替代方案,并指出其“避免估计 p”的优势(第 4.3 节)。 - 作者淡化/回避的竞争路线: - 贝叶斯 IRL(BIRL)(Ramachandran & Amir, 2007)仅在 4.1 节一段提及,且指出其“label bias”问题,未深入讨论其与 DDC 中贝叶斯方法(Imai et al., 2009)的联系。 - 模仿学习(IL)与行为克隆(BC) 被定位为“reduced-form”方法,无法进行反事实预测,但未讨论 IL 在数据效率上的优势(如 Lu et al., 2023 的 BC-SAC 在自动驾驶中仅需少量示范)。 - 逆最优控制(IOC)传统(Kalman, 1964; Mombaur et al., 2010)仅在 4.4 节一段提及,未深入比较其与 IRL 在连续控制中的差异。 - 什么明显该被引/该存在、却没出现在 intro 里?:本文未引用任何关于 统计-计算权衡(statistical-computational tradeoff) 的文献,例如低度多项式障碍(low-degree polynomial barrier)或 SQ 下界。考虑到 DDC/IRL 的核心挑战之一是内循环 MDP 求解的计算复杂度,且神经网络方法缺乏“打破维数灾难”的正式证明,统计-计算权衡视角可能提供有价值的理论下界。这是值得研究者去查的问题。

张力

未见明显对立引用。各被引工作之间在数学框架上高度一致(均基于 MDP + softmax 策略),差异主要体现在估计方法和动机上。唯一的潜在张力是:模型无关方法(如 TD-CCP)是否真的能达到半参数效率界? Adusumilli & Eckardt (2025) 仅将其作为 conjecture 提出(第 4.3 节),而 DDC 文献中 NFXP/NPL 在正确设定下是参数有效的。这需要严格的理论证明。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \( s \in S \):状态变量(可观测),\( S \) 为有限状态空间,\( |S| \) 为状态数。 - \( a \in A(s) \):动作变量(可观测),\( A(s) \) 为状态 \( s \) 下的可行动作集,\( |A| \) 为动作数(假设各状态相同)。 - \( r(s, a) \):奖励函数(待估参数),表示在状态 \( s \) 下采取动作 \( a \) 的即时收益。 - \( p(s' | s, a) \):转移概率(已知或可估计),表示从状态 \( s \) 采取动作 \( a \) 后转移到 \( s' \) 的概率。 - \( \beta \in (0, 1) \):折扣因子(通常假设已知)。 - \( \pi(a | s) \):策略(条件选择概率),表示在状态 \( s \) 下选择动作 \( a \) 的概率。 - \( V(s) \):值函数,\( V(s) = \mathbb{E}_\pi \left[ \sum_{t=0}^\infty \beta^t r(s_t, a_t) \mid s_0 = s \right] \)。 - \( Q(s, a) \):动作值函数,\( Q(s, a) = r(s, a) + \beta \sum_{s'} V(s') p(s' | s, a) \)。 - \( \varepsilon(a) \):偏好冲击(不可观测),假设服从独立同分布的类型 I 极值(Gumbel)分布,尺度参数 \( \sigma \)。 - \( \theta \):结构参数向量,用于参数化奖励函数 \( r_\theta(s, a) \)。 - \( \phi \):函数逼近参数(如神经网络权重),用于近似 \( Q \) 或 \( V \)。 - \( \tau_i = \{(s_{it}, a_{it})\}_{t=0}^{T_i} \):第 \( i \) 个个体的轨迹(可观测数据)。 - \( D = \{\tau_i\}_{i=1}^N \):观测到的轨迹数据集。

模型: - 数据生成机制:个体在 MDP 框架下最大化期望折扣奖励,但研究者仅观测到状态 \( s \) 和动作 \( a \),未观测到偏好冲击 \( \varepsilon \)。个体实际观测到完整状态 \( (s, \varepsilon) \),并采用纯策略 \( \delta^*(s, \varepsilon) = \arg\max_a [Q(s, a) + \varepsilon(a)] \)。 - 关键假设(AS/CI/EV): - 加性可分(Additive Separability, AS):奖励可分解为 \( r(s, a) + \varepsilon(a) \)。 - 条件独立性(Conditional Independence, CI):\( p(s', \varepsilon' | s, \varepsilon, a) = g(\varepsilon' | s') p(s' | s, a) \),即 \( \varepsilon \) 的转移不依赖于当前 \( \varepsilon \)。 - 极值分布(Extreme Value, EV):\( \varepsilon(a) \) 独立同分布,服从 Gumbel 分布,尺度参数 \( \sigma \)。 - 在这些假设下,最优策略退化为 softmax 形式(式 (21)),且 \( Q \) 满足平滑 Bellman 方程(式 (18))。

可观测数据: - 研究者观测到的是 轨迹集合 \( D = \{\tau_i\} \),每条轨迹包含一系列状态-动作对 \( (s_{it}, a_{it}) \)。 - 不可观测的是:偏好冲击 \( \varepsilon_{it} \)、个体的真实奖励函数 \( r \)、转移概率 \( p \)(除非额外估计)、折扣因子 \( \beta \)(通常假设已知)。 - 核心统计问题:从 \( D \) 中推断 \( r \)(以及可能的 \( p \) 和 \( \beta \))。

第二步:最小内核

最简特例:有限状态空间 \( S = \{1, 2\} \),每个状态两个动作 \( A = \{0, 1\} \),线性奖励 \( r_\theta(s, a) = \theta_1 \cdot \mathbb{I}(a=1) + \theta_2 \cdot \mathbb{I}(s=2) \),转移概率 \( p(s'|s, a) \) 已知,折扣因子 \( \beta \) 已知,EV 冲击尺度 \( \sigma \) 已知。观测到 \( N \) 条长度为 \( T \) 的轨迹。

核心思路:在 AS/CI/EV 假设下,最优策略由 softmax 公式给出:

\[\pi_\theta(a|s) = \frac{\exp\{Q_\theta(s, a)/\sigma\}}{\sum_{a' \in A(s)} \exp\{Q_\theta(s, a')/\sigma\}},\]
其中 \( Q_\theta \) 是平滑 Bellman 方程(式 (18))的唯一不动点:
\[Q_\theta(s, a) = r_\theta(s, a) + \beta \sum_{s'} \sigma \log\left( \sum_{a'} \exp\{Q_\theta(s', a')/\sigma\} \right) p(s'|s, a).\]

这篇论文在数学上到底干了一件什么事:它系统展示了,在上述最简特例下,DDC 和 IRL 的估计方法(NFXP、CCP 估计器、NPL、MaxEnt IRL、GAIL、AIRL)都归结为同一个数学问题:从观测到的 \( \pi(a|s) \)(或轨迹)中,恢复 \( Q_\theta \) 和 \( r_\theta \),使得 \( Q_\theta \) 满足平滑 Bellman 方程,且 \( \pi_\theta \) 与观测数据匹配。不同方法的差异仅在于: - 如何求解内循环(\( Q_\theta \) 的不动点):NFXP 用策略迭代(模型基础),MaxEnt IRL 用软 Bellman 回溯(模型基础),GAIL 用 occupancy measure 匹配(模型无关)。 - 如何匹配观测数据:NFXP 用全似然,CCP 估计器用部分似然,GAIL 用 JS 散度。 - 如何克服识别问题:DDC 用归一化动作(anchor action),IRL 用多环境数据或熵正则化。

最小内核的数学困难:即使在这个最简特例下,内循环(求解 \( Q_\theta \) 的不动点)仍然需要 \( O(|S|^2 |A|) \) 次运算(若用值迭代)或 \( O(|S|^3) \) 次运算(若用策略迭代)。当 \( |S| \) 很大时(如连续状态离散化后 \( |S| = 10^6 \)),这变得不可行。因此,所有方法的核心挑战都是如何避免或加速内循环:CCP 估计器通过一次求解 \( R \) 和 \( Q_\varepsilon \) 来避免重复求解,模型无关 IRL 通过 TD 学习或 occupancy measure 匹配来完全绕过内循环。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:系统比较了动态离散选择(DDC)与逆强化学习(IRL)两个领域,它们从不同学科传统出发,解决同一核心问题——从观测到的序贯行为推断决策者的偏好(奖励函数)。
  2. 核心工具/方法:以马尔可夫决策过程(MDP)为统一框架,重点分析了 soft Q-learning(熵正则化 RL)与 EV 冲击下的 DDC 模型之间的数学等价性,并比较了 NFXP、CCP 估计器、NPL、MaxEnt IRL、GAIL、AIRL、TD-CCP、GLADIUS 等估计方法。
  3. 主要结论:DDC 与 IRL 在数学上高度趋同(相同的 softmax 选择概率和平滑 Bellman 方程),差异主要体现在估计方法(模型基础 vs. 模型无关)、对随机性的解释(未观测状态 vs. 熵偏好)和最终目标(反事实预测 vs. 智能体训练)上。交叉融合(特别是模型无关 IRL 与 DDC 两步法的结合)是富有前景的方向。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • MDP 设定:有限状态空间 \( S \)、有限动作空间 \( A \)、折扣因子 \( \beta \in (0,1) \)、奖励函数 \( r(s,a) \)、转移概率 \( p(s'|s,a) \)。策略 \( \pi(a|s) \) 是条件概率分布。
  • AS/CI/EV 假设(第 3 节):这是 DDC 的核心假设,也是连接 DDC 与 IRL 的桥梁。
  • AS:奖励可分解为 \( r(s,a) + \varepsilon(a) \)。
  • CI:\( p(s', \varepsilon' | s, \varepsilon, a) = g(\varepsilon' | s') p(s' | s, a) \)。
  • EV:\( \varepsilon(a) \) 独立同分布,服从 Gumbel 分布,尺度参数 \( \sigma \)。
  • 统计含义:这些假设使得 CCP 具有封闭形式的 softmax 表达式(式 (21)),且值函数具有封闭形式的 log-sum 表达式(式 (19)),从而避免了高维数值积分。
  • 相比已有文献:这是 DDC 的标准假设(Rust, 1987),IRL 的熵正则化方法(Ziebart et al., 2010)在数学上等价,但 IRL 将其解释为对策略熵的偏好而非未观测冲击。
  • 理性预期假设(第 3.3 节):个体的主观信念 \( p(s'|s,a) \) 等于客观转移概率。这是 DDC 中常用的强假设,也是模型无关 IRL 的隐含假设。
  • 线性奖励假设(第 3.1 节、第 4.3 节):\( r_\theta(s,a) = \vec{r}(s,a)^\top \theta \),其中 \( \vec{r} \) 是已知特征函数。这是 CCP 估计器和 TD-CCP 估计器的关键假设,使得 \( Q \) 可分解为 \( Q_r \) 和 \( Q_\varepsilon \) 的线性组合。
  • 归一化动作假设(第 3.3 节):存在一个“锚动作” \( a_s \in A(s) \) 使得 \( r(s, a_s) \) 已知。这是 DDC 中实现点识别的常用方法,IRL 中也有类似假设(如 Lee et al., 2026 的退出选项)。
  • 可实现性假设(Realizability)(第 4.3 节):真实 \( Q \) 和 \( EV \) 函数属于所选的函数逼近类(如线性组合或神经网络)。这是 GLADIUS 和 DQN 收敛性证明的关键假设。

主要结果

本文是综述,不包含新定理。但系统梳理了以下核心结果:

  1. 平滑 Bellman 方程与 softmax CCP(第 3 节,式 (18)–(21)):在 AS/CI/EV 假设下,\( Q \) 满足平滑 Bellman 算子 \( \Lambda_\sigma \) 的不动点方程,CCP 由 softmax 公式给出。这是 DDC 和 IRL 的共同数学基础。
  2. CCP 估计器的两阶段性质(第 3.1 节,式 (27)–(29)):当奖励为线性时,\( Q \) 可分解为 \( Q_r \)(来自已知特征)和 \( Q_\varepsilon \)(来自未观测冲击),两者均可通过一次求解线性系统得到,从而避免在参数搜索中重复求解 MDP。这是 Hotz-Miller 估计器的核心效率提升。
  3. NPL 的零 Jacobian 性质(第 3.1 节):在不动点处,\( \partial V(s)/\partial \pi = 0 \),使得 NPL 估计器对第一阶段 CCP 估计噪声具有 Neyman 正交性,达到与 NFXP 相同的渐近效率。
  4. MCE IRL 与 DDC 的等价性(第 4.1 节):最大因果熵 IRL 在 KKT 条件下导出与 DDC 完全相同的 softmax 策略和平滑 Bellman 方程。Ziebart et al. (2010) 明确指出两者“几乎同构”。
  5. AIRL 的可迁移性(第 4.2 节,式 (35)–(36)):在确定性动力学和状态仅依赖奖励的假设下,AIRL 的结构化判别器可解耦奖励与 shaping potential,使学到的奖励函数可迁移到新环境。
  6. GLADIUS 的全局收敛率(第 4.3 节):在可实现性假设下,GLADIUS 估计器以 \( O(1/T) + O(1/N) \) 的速率收敛到真实 \( Q \),这是首个针对最小化 Bellman 残差方法的全局收敛保证。

证明路线与技术技巧(理论型必写,要具体)

本文是综述,不包含新证明。但可梳理各关键结果的证明路线:

1. 平滑 Bellman 方程与 softmax CCP 的推导(第 3 节): - 整体路线:从带 EV 冲击的 MDP 出发 → 利用 EV 分布的性质(max-stability)推导 \( V(s,\varepsilon) \) 的表达式(式 (17))→ 对 \( \varepsilon \) 求期望得到 \( V(s) \) 的 log-sum 表达式(式 (19))→ 代入 Bellman 方程得到平滑 Bellman 方程(式 (18))→ 由 \( Q(s,a) + \varepsilon(a) \) 的比较得到 softmax CCP(式 (21))。 - 关键跳跃点:EV 分布的 max-stability 性质——\( \max_a [Q(s,a) + \varepsilon(a)] \) 的分布仍为 EV 分布,且其期望有封闭形式。这是整个推导的数学核心。 - 技术技巧:EV 分布的特性(Gumbel 分布的累积分布函数 \( F(x) = \exp(-\exp(-x/\sigma)) \)),log-sum 公式。

2. CCP 估计器的两阶段性质(第 3.1 节): - 整体路线:将 \( Q \) 分解为 \( Q_r \)(来自已知特征 \( \vec{r} \))和 \( Q_\varepsilon \)(来自未观测冲击 \( \varepsilon \))→ 分别推导两者满足的线性系统(式 (24)–(25))→ 用第一阶段非参数估计的 \( \hat{\pi} \) 和 \( \hat{p} \) 求解这两个线性系统 → 代入 softmax 公式得到部分似然(式 (29))→ 最大化部分似然得到 \( \hat{\theta} \)。 - 关键跳跃点:\( Q_r \) 和 \( Q_\varepsilon \) 的线性系统不依赖于 \( \theta \),因此只需在估计开始前求解一次,避免了 NFXP 的内循环。 - 技术技巧:线性系统的矩阵求逆(\( [I - \beta E_\pi]^{-1} \)),Hotz-Miller 反演(式 (32))。

3. NPL 的零 Jacobian 性质(第 3.1 节): - 整体路线:将 NPL 估计器视为 CCP 估计器的迭代版本 → 在不动点处,\( V(s) \) 对 \( \pi \) 的偏导数为零(因为 \( V \) 是 Bellman 方程的解,而 \( \pi \) 是 softmax 策略,两者在不动点处满足包络定理)→ 因此参数 \( \theta \) 的得分函数对第一阶段 \( \hat{\pi} \) 的噪声不敏感(Neyman 正交性)。 - 关键跳跃点:包络定理(Envelope Theorem)的应用——在最优策略下,值函数对策略的偏导数为零。 - 技术技巧:隐函数定理,包络定理。

4. MCE IRL 与 DDC 的等价性(第 4.1 节): - 整体路线:从最大因果熵问题(式 (33))出发 → 引入 Lagrange 乘子 \( \theta \) 约束特征匹配 → 求解 KKT 条件 → 得到 softmax 策略(式 (21))和平滑 Bellman 方程(式 (18)–(19))→ 与 DDC 的 AS/CI/EV 模型完全一致。 - 关键跳跃点:因果熵的变分导数与 Bellman 算子的联系。 - 技术技巧:Lagrange 对偶,KKT 条件,变分法。

5. AIRL 的可迁移性(第 4.2 节): - 整体路线:设计结构化判别器 \( f_\phi(s,a,s') = g_\phi(s,a) + \beta h_\phi(s') - h_\phi(s) \)(式 (35))→ 在对抗训练中,判别器学习区分专家与策略 occupancy measure → 在均衡点,\( g_\phi \) 恢复真实奖励(至多一个常数),\( h_\phi \) 恢复值函数。 - 关键跳跃点:在确定性动力学和状态仅依赖奖励的假设下,\( g_\phi(s) = r(s) + \text{const} \) 和 \( h_\phi(s) = V(s) + \text{const} \) 是唯一解。 - 技术技巧:potential-based reward shaping(Ng et al., 1999)的不变性,对抗训练。

真实例子与应用

本文包含多个真实数据例子和应用:

  1. Google Maps 路线偏好估计(Barnes et al., 2024,第 1 节、第 4.5 节):
  2. 数据:1.1 亿次行程数据,3.6 亿参数模型。
  3. 方法:大规模 IRL 估计路线偏好函数(权衡交通、距离、坡度、安全、风景)。
  4. 结果:RL 生成的推荐实现全球路线质量 16-24% 的提升。
  5. 说明:这是目前最大规模的 IRL 实际应用,展示了 IRL 在真实世界中的可扩展性。

  6. 上海出租车轨迹预测(Zhao & Liang, 2023,第 4.5 节):

  7. 数据:上海出租车 GPS 轨迹数据。
  8. 方法:AIRL 估计上下文相关的奖励函数。
  9. 结果:优于传统路径选择模型。
  10. 说明:展示了 AIRL 在确定性动力学(道路网络)下的成功应用。

  11. 小说/剧集消费行为(Lee et al., 2026,第 4.2 节、第 4.5 节):

  12. 数据:用户阅读/观看序列化内容的消费数据。
  13. 方法:AIRL 结合经济结构(退出选项作为归一化动作),使用神经网络处理非结构化文本状态。
  14. 结果:估计出用户对继续阅读 vs. 退出的偏好,并用于反事实定价分析(如“等待免费”策略对高意愿用户的影响)。
  15. 说明:展示了 AIRL 在经济学反事实预测中的应用,以及如何通过经济结构克服识别问题。

  16. 丹麦汽车税政策评估(Gillingham et al., 2022,第 1 节):

  17. 数据:丹麦汽车拥有和交易数据。
  18. 方法:结构估计(DDC)恢复消费者偏好。
  19. 结果:反事实模拟显示,降低新车税并提高汽油税可改善福利、增加税收、减少 CO₂ 排放。
  20. 说明:展示了 DDC 在政策评估中的经典应用。

  21. 自动驾驶(Lu et al., 2023; Remonda et al., 2021,第 4.5 节):

  22. 数据:10 万英里城市驾驶数据。
  23. 方法:BC-SAC(行为克隆 + 软演员-评论家)。
  24. 结果:相比纯模仿学习,安全故障减少 38%。
  25. 说明:展示了 IRL/IL 在自动驾驶中的实际效果,以及纯 RL 奖励(如圈速时间)与人类偏好的差异。

🔎 结论是否比证明窄

本文是综述,不包含新证明,但多处结论是 conjecture 或基于特定假设:

  1. “TD 估计器达到半参数效率界”(第 4.3 节,Adusumilli & Eckardt, 2025, p. 24):原文明确写为“they conjecture that the TD estimator attains ‘the semi-parametric efficiency bound when the transition density is unknown’”。这是一个 conjecture,尚未被严格证明。
  2. “神经网络和随机化打破维数灾难”(第 2.3 节):原文明确写为“there is no formal proof that they actually ‘break’ this curse”。这是一个开放问题,而非已证明结论。
  3. “GLADIUS 的全局收敛率 O(1/T) + O(1/N)”(第 4.3 节):该结果依赖于可实现性假设(真实 \( Q \) 和 \( EV \) 在函数类中),且收敛是在 Bellman 残差意义上,而非参数 \( \theta \) 本身。在非可实现性下,收敛性未知。
  4. “AIRL 的可迁移性”(第 4.2 节):Fu et al. (2018) 的证明仅适用于确定性动力学和状态仅依赖奖励的假设。在随机动力学或动作依赖奖励下,分解是近似的,可迁移性无严格保证。

四、开放问题(点到为止,扎根具体语句)

  1. 模型无关 IRL 的半参数效率界:Adusumilli & Eckardt (2025) 仅 conjecture TD 估计器达到半参数效率界(第 4.3 节,p. 24)。要证什么:在转移概率未知且非参数估计的条件下,推导 TD-CCP 估计器的渐近方差,并与半参数效率下界比较。扎根:本文第 4.3 节“they conjecture that the TD estimator attains ‘the semi-parametric efficiency bound when the transition density is unknown’”。

  2. 非可实现性下的 GLADIUS 收敛性:GLADIUS 的全局收敛率依赖于可实现性假设(真实 \( Q \) 和 \( EV \) 在函数类中)。要证什么:当函数逼近类存在 misspecification 时,GLADIUS 的收敛速率和极限点是什么?扎根:本文第 4.3 节“Under realizability assumptions... GLADIUS achieves global convergence with error O(1/T) + O(1/N)”。

  3. 有界理性(bounded rationality)下的 DDC/IRL:人类并非完美理性优化者(AlphaZero 超越人类),但现有 DDC/IRL 模型均假设理性。要估什么:如何从观测行为中同时推断奖励函数和“非理性程度”(如信息获取成本、计算限制)?扎根:本文第 5 节“there is relatively little work on how to adapt DDC and IRL to infer rewards of boundedly rational agents”。

  4. 高维状态空间下 DDC 估计的理论保证:SEES 和 NNES 等神经网络方法缺乏“打破维数灾难”的正式证明。要证什么:在何种光滑性/结构假设下,神经网络逼近的 DDC 估计器可以达到参数收敛速率(如 \( \sqrt{N} \))?扎根:本文第 2.3 节“there is no formal proof that they actually ‘break’ this curse”。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论