跳转至

Conformal Prediction Beyond the Horizon: Distribution-Free Inference for Policy Evaluation

讲者: Yukun Liu
会场: Advances in AI-Driven Statistical Learning
报告题目: Conformal Prediction Beyond the Horizon: Distribution-Free Inference for Policy Evaluation
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在强化学习(RL)中,如何为无限时域(infinite-horizon)策略的回报(return)构造分布自由(distribution-free)的预测区间(prediction interval, PI),使得区间覆盖概率在有限样本下有保证,而不依赖模型假设的正确性。当前成熟度:方法上已有若干尝试,但大多局限于有限时域、离散状态/动作空间或特定设定;无限时域 + 连续状态/动作空间 + 离策略的通用框架仍是空白。

发展脉络(history)

奠基工作:分布RL与共形预测的独立发展

  • Bellemare et al. (2017) [2]:提出分布RL范式,将学习目标从期望回报扩展为回报的完整分布,引入分布Bellman算子。这是本文所有DRL相关工作的理论起点。
  • Lei et al. (2018) [19]:建立分裂共形预测(split conformal prediction)的通用框架,给出有限样本边际覆盖保证。这是本文共形预测部分的方法论基石。
  • Tibshirani et al. (2019) [36]:将共形预测扩展到协变量偏移(covariate shift)设定,提出加权共形预测(WCP),要求已知似然比。这是本文处理分布偏移的直接参照,但作者明确选择不采用WCP。

主要进展:将共形预测引入RL

  • Zhang, Shi & Luo (2023) [41](COPP):首次将共形预测用于离策略评估,通过构造伪策略和轨迹子采样来近似可交换性。但作者指出其“applicability is largely limited to short-horizon problems with finite discrete action spaces”。
  • Foffano, Russo & Proutière (2023) [12]:提出基于WCP的离策略评估方法,使用重要性采样权重校正分布偏移。但作者指出其“suffers from the curse of horizon, as the importance weights accumulate multiplicatively over time, resulting in high variance in long-horizon settings”。
  • Dietterich & Hostetler (2022) [8]:将共形预测应用于有限时域MDP的轨迹级预测区间。这是早期尝试,但限于有限时域。

当前frontier与本文位置

当前frontier是:如何将共形预测扩展到无限时域RL,同时处理三个核心挑战——未观测回报、时间依赖、分布偏移。本文声称是“the first to tackle infinite-horizon off-policy prediction in general RL settings with arbitrary state and action spaces using conformal prediction”。其核心创新是:用k步截断伪回报(pseudo-return)替代不可观测的无限回报,用经验回放+随机子采样恢复近似可交换性,用加权子采样(而非WCP)校正分布偏移。

子线索聚类

这些被引文献大致落在三条子线索上:

  1. 风险感知RL与安全RL:关注策略学习中的风险度量(CVaR、熵风险等),不提供形式化不确定性量化。代表:[16] Howard & Matheson (1972)、[5] Chow et al. (2018)、[6] Chow et al. (2015)、[14] Gu et al. (2024)。
  2. 分布RL:关注回报分布的估计,但缺乏统计覆盖保证。代表:[2] Bellemare et al. (2017)、[7] Dabney et al. (2018)、[31] Rowland et al. (2024)。
  3. 共形预测在RL中的应用:直接构造预测区间,但受限于有限时域或离散空间。代表:[41] Zhang et al. (2023)、[12] Foffano et al. (2023)、[8] Dietterich & Hostetler (2022)。

这个方向在追问的核心问题

  1. 如何定义并构造无限时域回报的“可观测替代物”? 由于实际只能观测有限步轨迹,必须用某种方式近似不可观测的尾部回报。当前主流方法是截断+自举(如k步TD),但截断长度k的选择缺乏理论指导。
  2. 如何恢复共形预测所需的可交换性? RL数据天然是时序依赖的,且状态分布随时间/策略变化。现有方法要么假设有限时域([8]),要么使用高方差的重要性权重([12]),要么限于离散动作空间([41])。
  3. 如何在校正分布偏移的同时避免“时域诅咒”? 轨迹级重要性权重随步长指数增长,导致方差爆炸。本文的加权子采样方案试图绕过这一问题,但代价是引入了额外的子采样随机性。
  4. 覆盖保证的形式与紧度? 现有理论结果(如[12])使用全变差距离刻画覆盖偏差,但无法反映截断步长k的影响。本文改用Wasserstein距离,声称能给出更紧的界。

⚠️ 作者的framing

作者把缺口frame成:现有共形RL方法要么限于有限时域([8, 41]),要么受困于时域诅咒([12]),而本文是第一个在无限时域、任意状态/动作空间、离策略设定下提供分布自由预测区间的方法。作者强调其方法“modular”(可搭配任意DRL估计器)和“practical”(仅需观测测试轨迹的初始状态)。

被淡化或回避的竞争路线: - 加权共形预测(WCP):作者明确说“Why Not Use WCP”,理由是WCP需要观测完整测试轨迹的协变量,而本文设定下只能观测初始状态。但[12]实际上提出了优化近似方案(Eq. 14),作者仅以“introduces additional model assumptions and tends to exhibit high variance”一笔带过,未给出定量比较。 - 自适应共形预测(adaptive CP):作者在Related Work末尾提到“a growing line of work that applies adaptive conformal prediction to online safe RL settings [33, 43]”,但仅说“differs fundamentally from our setting”,未展开讨论是否可迁移。

什么明显该被引/该存在、却没出现在intro里? - Lei & Candès (2021) [20]:关于反事实和个体处理效应的共形推断。这篇论文与本文的设定高度相关(都是为不可观测的潜在结果构造PI),且被本文在附录中引用(用于证明中的总变差界),但intro的Related Work中未提及。这可能是一个值得研究者去查的线索:Lei & Candès的方法是否可直接迁移到RL设定? - Solari & Djordjilović (2022) [35]:多重分裂共形预测(multi split conformal prediction)。本文的B次子采样+聚合策略直接借鉴了该思想,但intro中未提及,仅在附录中引用。

张力

未见明显对立引用。各条线索的工作在各自设定下自洽,没有出现“在略不同条件下得相反结论”的情况。但存在一个隐含张力:WCP路线 vs. 加权子采样路线——前者需要完整测试轨迹的协变量,后者仅需初始状态但引入子采样随机性。两种路线在什么条件下孰优孰劣,目前没有系统比较。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号(逐个点名):

记号 含义 类型
\( \mathcal{S}, \mathcal{A} \) 状态空间、动作空间 集合
\( \pi_b, \pi \) 行为策略、目标策略 条件分布 \( \pi(a \mid s) \)
\( P \) 转移核:\( (S_{t+1}, R_t) \sim P(\cdot \mid S_t, A_t) \) 条件分布
\( \gamma \in (0,1) \) 折扣因子 标量参数
\( G^\pi(s) = \sum_{t=0}^\infty \gamma^t R_t \) 从状态 \( s \) 出发、遵循策略 \( \pi \)无限时域回报 随机变量(不可观测
\( \eta^\pi(s) \) \( G^\pi(s) \) 的概率分布 分布(目标 estimand
\( \hat{\eta}^\pi(s) \) 从训练数据学得的 \( \eta^\pi(s) \) 的估计 估计量
\( \hat{v}^\pi(s) = \mathbb{E}_{\hat{\eta}^\pi}[G] \) 估计的价值函数 标量
\( \zeta_i = \{(S_{it}, A_{it}, R_{it})\}_{t=0}^{T-1} \) \( i \) 条轨迹,长度 \( T \) 可观测数据
\( N \) 轨迹数 样本量
\( k \) 截断步长(用户选择) 超参数
\( \tilde{G}^{(k)}(S_{it}) \) k步伪回报 构造的替代变量
\( \theta(s, i) \) QTD中第 \( i \) 个分位数粒子 参数
\( m \) QTD中分位数粒子数 超参数
\( w_{\text{on}}(s), w_{\text{off}}(h_{0:k}) \) 重要性权重(on-policy / off-policy) 密度比
\( \hat{w}_{\text{on}}, \hat{w}_{\text{off}} \) 估计的重要性权重 估计量
\( \alpha \) 名义覆盖水平(如0.1) 标量
\( \xi \) 多重子采样聚合参数 标量
\( B \) 子采样重复次数 标量
\( \bar{W}_1(\eta^\pi, \hat{\eta}^\pi) = \sup_{s \in \mathcal{S}} W_1(\eta^\pi(s), \hat{\eta}^\pi(s)) \) 条件分布间的上确界1-Wasserstein距离 误差度量

模型(数据生成机制): - 环境是时间齐次MDP(Assumption 1-2):\( (S_{t+1}, R_t) \) 仅依赖于 \( (S_t, A_t) \),且转移分布不随时间变化。 - 策略是平稳马尔可夫策略(Assumption 3):\( A_t \sim \pi(\cdot \mid S_t) \),不依赖历史。 - 回报定义:\( G^\pi(s) = \sum_{t=0}^\infty \gamma^t R_t \),其中 \( R_t \) 是在策略 \( \pi \) 下生成的奖励。 - 分布Bellman算子 \( \mathcal{T}^\pi \)\( (\mathcal{T}^\pi \eta)(s) \overset{d}{=} R + \gamma G^\pi(S') \),其中 \( (R, S') \)\( \pi \) 生成,\( G^\pi(S') \sim \eta(S') \)。该算子是 \( \gamma \)-收缩的(Proposition 3)。

可观测数据: - 研究者实际能观测到的是 \( N \) 条长度为 \( T \) 的轨迹 \( \zeta_i = \{(S_{it}, A_{it}, R_{it})\}_{t=0}^{T-1} \),由行为策略 \( \pi_b \) 生成。 - 对于每个时间步 \( t \),可观测三元组 \( (S_{it}, A_{it}, R_{it}, S_{i,t+1}) \)。 - 不可观测的是:① 无限时域回报 \( G^\pi(S_{it}) \)(因为 \( T < \infty \));② 目标策略 \( \pi \) 下的完整轨迹(在离策略设定下);③ 测试轨迹的未来状态 \( S_{\text{test},1}, S_{\text{test},2}, \ldots \)(测试时仅观测初始状态 \( S_{\text{test}} \))。

第二步:最小内核

最简特例:两状态MDP(Example 1),且取截断步长 \( k=1 \)

在这个特例下,状态空间 \( \mathcal{S} = \{x_1, x_2\} \),动作空间无关紧要(转移概率直接由策略决定)。折扣因子 \( \gamma=0.8 \)。从 \( x_1 \) 出发的奖励分布为 \( N(2,1) \),从 \( x_2 \) 出发的为 \( N(1,1) \)

核心思路(去掉所有为一般性服务的技术假设后,剩下那个真正吃劲的命题):

命题:给定一个测试初始状态 \( S_{\text{test}} \),我们想要构造一个区间 \( \hat{C}(S_{\text{test}}) \) 使得 \( \Pr(G^\pi(S_{\text{test}}) \in \hat{C}(S_{\text{test}})) \geq 1-\alpha \),其中 \( G^\pi(S_{\text{test}}) \) 是无限时域回报,不可观测

关键想法(本文的解法):

  1. 用伪回报替代真回报:由于 \( G^\pi(S_{\text{test}}) \) 不可观测,我们构造一个可计算的替代物——1步伪回报:

    \[\tilde{G}^{(1)}(S_{it}) = R_{it} + \gamma \tilde{G}^\pi(S_{i,t+1})\]
    其中 \( \tilde{G}^\pi(S_{i,t+1}) \) 是从学得的回报分布 \( \hat{\eta}^\pi(S_{i,t+1}) \) 中采样的一个粒子。这个伪回报的分布是 \( (\mathcal{T}^\pi \hat{\eta}^\pi)(S_{it}) \),即对真实分布 \( (\mathcal{T}^\pi \eta^\pi)(S_{it}) = \eta^\pi(S_{it}) \) 的近似。

  2. 用经验回放恢复可交换性:从校准集 \( \mathcal{D}_{\text{cal}} \)随机子采样(而非按时间顺序取)\( l \) 个伪回报-状态对 \( (\tilde{G}^{(1)}_{it}, S_{it}) \),使得这些样本近似独立同分布。

  3. 用加权子采样校正分布偏移:在离策略设定下,校准集来自行为策略 \( \pi_b \),而测试状态来自目标策略 \( \pi \)。我们按估计的重要性权重 \( \hat{w}_{\text{off}}(S_{it}, A_{it}) \propto \pi(A_{it} \mid S_{it}) / \pi_b(A_{it} \mid S_{it}) \) 进行加权子采样,使得采样后的校准集近似来自目标策略的分布。

  4. 构造预测区间:计算非一致性得分 \( V_{it} = |\tilde{G}^{(1)}_{it} - \hat{v}^\pi(S_{it})| \),取 \( \hat{q}_{1-\alpha} \) 为这些得分的 \( \lceil l(1-\alpha) \rceil \)-th 顺序统计量,则预测区间为:

    \[\hat{C}(S_{\text{test}}) = \hat{v}^\pi(S_{\text{test}}) \pm \hat{q}_{1-\alpha}\]

为什么这个特例抓住了核心困难:即使在这个最简单的两状态、\( k=1 \) 设定下,三个核心挑战依然存在: - 未观测回报\( G^\pi(S_{it}) \) 不可观测,必须用 \( \tilde{G}^{(1)}_{it} \) 替代。 - 时间依赖:同一轨迹内的 \( (S_{it}, S_{i,t+1}) \) 是相关的,但随机子采样打破了这种依赖。 - 分布偏移:行为策略与目标策略的转移概率不同(如 \( x_1 \to x_2 \) 概率从0.4变为0.5),必须加权校正。

一般情形只是这个特例的“加壳”\( k>1 \) 只是用更多观测奖励 + 更少模型采样;连续状态空间只是用神经网络拟合分位数;离策略设定只是用更复杂的权重(含轨迹段乘积)。核心数学结构——用伪回报替代真回报、用子采样恢复可交换性——完全不变。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在无限时域RL中,为策略的回报构造分布自由的预测区间,同时处理未观测回报、时间依赖和分布偏移三个挑战。
  2. 核心工具/方法:将分布RL(QTD)与分裂共形预测结合,通过k步截断伪回报、经验回放随机子采样、加权子采样三个创新模块,实现可交换性的近似恢复。
  3. 主要结论:建立了渐近覆盖下界(Theorem 1 & 2),偏差由两部分组成——重要性权重估计误差 + 回报分布估计误差(以 \( \gamma^k \) 速率衰减);在合成数据和Mountain Car环境上的实验表明,该方法在覆盖率和区间长度上均优于DRL-QR和KDE-QR基线。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 数据划分:将 \( N \) 条轨迹的转移元组划分为训练集 \( \mathcal{D}_{\text{tr}} \)(用于训练DRL模型)和校准集 \( \mathcal{D}_{\text{cal}} \)(用于共形校准)。划分可在轨迹级或元组级进行。
  • DRL模型:采用QTD学习(Algorithm 1 of [31]),用 \( m \) 个分位数粒子 \( \{\theta(s,i)\}_{i=1}^m \) 近似回报分布 \( \eta^\pi(s) \)。更新规则为:
    \[\theta(s,i) \leftarrow \theta(s,i) + \rho \cdot \frac{1}{m} \sum_{j=1}^m [\tau_i - \mathbb{I}(r + \gamma \theta(s',j) - \theta(s,i) < 0)]\]
    其中 \( \tau_i = (2i-1)/(2m) \)。离策略设定下,\( a' \sim \pi(\cdot \mid s') \) 而非 \( \pi_b \)
  • 伪回报构造(式1):
    \[\tilde{G}^{(k)}(S_{it}) = \sum_{h=0}^{k-1} \gamma^h R_{i,t+h} + \gamma^k \tilde{G}^\pi(S_{i,t+k})\]
    其中 \( \tilde{G}^\pi(S_{i,t+k}) \sim \hat{\eta}^\pi(S_{i,t+k}) \)。由Proposition 4,\( \tilde{G}^{(k)}(S_{it}) \sim ((\mathcal{T}^\pi)^k \hat{\eta}^\pi)(S_{it}) \)
  • 重要性权重
  • On-policy(式2):\( w_{\text{on}}(s) \propto P(\delta=1 \mid s) / P(\delta=0 \mid s) \),其中 \( \delta \) 指示样本属于测试集还是校准集。
  • Off-policy(式3):\( w_{\text{off}}(s_0, a_0, \ldots, s_k) \propto \frac{dP_0(s_0)}{dP_{\text{cal}}(s_0)} \prod_{h=0}^{k-1} \frac{\pi(a_h \mid s_h)}{\pi_b(a_h \mid s_h)} \)
  • 假设
  • Condition 1(on-policy):① 回报分布 \( \eta^\pi(s) \) 有界Lebesgue密度(界为 \( L \));② 重要性权重估计的一阶矩有限。
  • Condition 2(off-policy):① 同Condition 1(i);② 重要性权重估计的一阶矩有限;③ 行为策略 \( \pi_b(a \mid s) \) 一致有界远离0(重叠条件)。
  • 相比已有文献:① 不要求有限状态/动作空间(vs. [41]);② 不要求完整测试轨迹(vs. [12]的WCP);③ 不要求有限时域(vs. [8])。

主要结果

Theorem 1(On-Policy覆盖保证)

\[\lim_{n \to \infty} \Pr\left( G^\pi(S_{\text{test}}) \in \hat{C}^{\text{on}}_{N,\alpha}(S_{\text{test}}) \right) \geq 1 - \alpha - \Lambda(\hat{w}_{\text{on}}, \hat{\eta}^\pi)\]
其中
\[\Lambda(\hat{w}_{\text{on}}, \hat{\eta}^\pi) = \frac{1}{2(T-k+1)} \sum_{t=0}^{T-k} \mathbb{E}[|\hat{w}_{\text{on}}(S_{it}) - w_{\text{on}}(S_{it})|] + \sqrt{2L \gamma^k \mathbb{E}[\bar{W}_1(\eta^\pi, \hat{\eta}^\pi)]}\]

  • 直觉:覆盖偏差由两部分组成——① 重要性权重估计误差(第一项),② 回报分布估计误差乘以 \( \gamma^{k/2} \)(第二项)。当 \( k \) 增大时,第二项以指数速率衰减,但第一项可能因权重估计困难而增大。
  • 必要条件:① 回报分布有界密度(保证Kolmogorov距离与Wasserstein距离的关系,Lemma 1);② 权重估计一致。
  • 解决的技术难点:用Wasserstein距离替代全变差距离来刻画覆盖偏差,使得 \( \gamma^k \) 衰减率可被显式捕捉(Proposition 3的收缩性质)。

Theorem 2(Off-Policy覆盖保证): 形式与Theorem 1完全相同,只是将 \( \hat{w}_{\text{on}} \) 替换为 \( \hat{w}_{\text{off}} \),且权重定义在轨迹段 \( H_{t:t+k} \) 上。

  • 直觉:离策略设定下,覆盖偏差的分解形式不变,但重要性权重估计误差更大(因为涉及行为策略与目标策略的比值乘积)。
  • 必要条件:额外要求行为策略的重叠条件(Condition 2(iii)),这是离策略估计的标准假设。

实验核心量化结论(Figure 2): - 在Example 1(两状态MDP)和Example 2(连续状态)中,本文方法(\( k=1,\ldots,5 \))在on-policy和off-policy设定下均达到接近名义90%的覆盖率。 - DRL-QR基线(直接取QTD分位数)在两种设定下均严重欠覆盖(覆盖率约60-80%)。 - 区间长度随 \( k \) 增大而增大(更多观测奖励 → 更高方差)。 - 在Mountain Car环境(Example 3)中,本文方法同样优于KDE-QR基线。

证明路线与技术技巧

整体路线(以Theorem 1为例,3-5步逻辑主干):

  1. 引入三个测试点:将真实测试点 \( (S_{\text{test}}, G^\pi(S_{\text{test}})) \) 与两个人工测试点比较:
  2. \( (S_{\text{test}}, \tilde{G}_{\text{test}}) \):状态分布同真实,但回报来自 \( (\mathcal{T}^\pi)^k \hat{\eta}^\pi \)(即用估计的回报分布)。
  3. \( (\hat{S}_{\text{test}}, \hat{G}_{\text{test}}) \):从加权子采样后的校准分布 \( \hat{F}_n \) 中抽取(与校准集可交换)。
  4. 分解覆盖概率
    \[\Pr(G_{\text{test}} \in \hat{C}) \geq \underbrace{\Pr(\hat{G}_{\text{test}} \in \hat{C})}_{M_1} - \underbrace{[\Pr(\hat{G}_{\text{test}} \in \hat{C}) - \Pr(\tilde{G}_{\text{test}} \in \hat{C})]}_{M_2} - \underbrace{[\Pr(\tilde{G}_{\text{test}} \in \hat{C}) - \Pr(G_{\text{test}} \in \hat{C})]}_{M_3}\]
  5. \( M_1 \geq 1-\alpha \):因为 \( (\hat{S}_{\text{test}}, \hat{G}_{\text{test}}) \) 与校准集可交换,标准分裂共形预测论证成立。
  6. \( M_3 \leq \sqrt{2L \gamma^k \mathbb{E}[\bar{W}_1(\hat{\eta}^\pi, \eta^\pi)]} \):利用Kolmogorov距离与Wasserstein距离的关系(Lemma 1)、分布Bellman算子的 \( \gamma \)-收缩性(Proposition 3)、以及Jensen不等式。
  7. \( M_2 \leq \frac{1}{2(T-k+1)} \sum_{t=0}^{T-k} \mathbb{E}[|\hat{w}_{\text{on}}(S_{it}) - w_{\text{on}}(S_{it})|] \):将 \( M_2 \) 分解为经验分布与目标分布的差异(\( M_{21} \))和权重估计误差(\( M_{22} \))。\( M_{21} \) 通过Glivenko-Cantelli论证收敛到0;\( M_{22} \) 通过总变差距离与权重估计误差的关系(式A.9 of [20])得到上界。

关键跳跃点: - Lemma 1的应用:将覆盖偏差从Kolmogorov距离转换到Wasserstein距离,使得 \( \gamma^k \) 衰减率可被利用。这是本文理论贡献的核心——如果使用全变差距离,则无法捕捉截断步长 \( k \) 的影响。 - Proposition 3的收缩性\( \bar{W}_p(\mathcal{T}^\pi \eta, \mathcal{T}^\pi \eta') \leq \gamma \bar{W}_p(\eta, \eta') \),使得 \( k \) 步伪回报的分布误差以 \( \gamma^k \) 速率衰减。 - \( M_{21} \) 的Glivenko-Cantelli论证:需要证明函数类 \( \{\hat{w}_{\text{on}}(s) \mathbb{I}(|g - \hat{v}^\pi(s)| \leq x) : x \in \mathbb{R}\} \) 是Donsker类,这依赖于 \( \hat{w}_{\text{on}} \) 的一致可积性(Condition 1(ii))。

技术技巧点名: - Wasserstein距离:用于刻画分布Bellman算子的收缩性,以及连接覆盖偏差与模型误差。 - Kolmogorov距离:作为Wasserstein距离与覆盖概率之间的桥梁(Lemma 1)。 - Glivenko-Cantelli定理:用于证明经验分布一致收敛到目标分布(\( M_{21} \to 0 \))。 - 总变差距离:用于将权重估计误差转化为覆盖偏差(\( M_{22} \) 的上界)。 - Jensen不等式:用于处理期望与平方根的顺序(\( M_3 \) 的最终上界)。 - 多重子采样聚合:借鉴[41, 35],用B次子采样+多数投票(式5)来稳定区间。

真实例子与应用

本文包含三个真实/合成数据例子:

  1. Example 1:两状态MDP(离散状态,高斯奖励)
  2. 数据\( N=400 \) 条轨迹,\( T=30 \) 步,\( \gamma=0.8 \)
  3. 方法应用:QTD学习20个分位数粒子,重要性权重用频率估计,\( k=1,\ldots,5 \)\( B=50 \)
  4. 结果:Figure 2显示本文方法达到近90%覆盖率,DRL-QR仅约60-80%。
  5. 想说明什么:验证理论(覆盖偏差随 \( k \) 增大而减小)、展示相对DRL-QR的优势(校正模型偏差)。

  6. Example 2:连续状态MDP(二元动作,线性高斯转移)

  7. 数据\( N=200 \) 条轨迹,\( T=30 \) 步,\( \gamma=0.8 \)
  8. 方法应用:QTD用神经网络(2→32→32→40)拟合30个分位数,重要性权重用逻辑回归估计。
  9. 结果:Figure 2显示类似模式——本文方法近90%覆盖率,DRL-QR欠覆盖。
  10. 想说明什么:展示方法在连续状态空间下的有效性。

  11. Example 3:Mountain Car(连续控制,经典RL基准)

  12. 数据:行为策略 \( \pi_b = 0.3\pi_Q + 0.7\pi_U \),目标策略 \( \pi = 0.2\pi_Q + 0.8\pi_U \)
  13. 方法应用:用KDE近似回报分布(而非QTD),以展示框架的“wrapper”性质。
  14. 结果:Figure 4(附录)显示本文方法近90%覆盖率,KDE-QR欠覆盖。
  15. 想说明什么:展示框架与任意回报分布估计器的兼容性,以及在复杂连续控制任务中的鲁棒性。

  16. Example 4(附录):高维两状态MDP(50维状态,其中49维是混淆变量)

  17. 数据\( N \) 条轨迹,状态为50维二元向量。
  18. 方法应用:QTD用线性回归+岭惩罚。
  19. 结果:Figure 5显示本文方法优于DRL-QR。
  20. 想说明什么:展示方法在高维设定下的有效性。

🔎 结论是否比证明窄

  • Theorem 1 & 2的假设:要求回报分布有界Lebesgue密度(Condition 1(i) & 2(i))。作者在Remark中承认“this assumption does not apply to discrete return distributions”,并指出Example 3(Mountain Car)的离散回报不满足该条件。但实验仍报告了Mountain Car的结果,且声称“our method effectively corrects the model bias”。这意味着理论保证不覆盖离散回报情形,但实验声称有效——这是一个值得注意的gap。
  • Theorem 1 & 2的结论:是渐近下界(\( n \to \infty \)),而非有限样本保证。作者在abstract中声称“asymptotic coverage guarantees”,但在intro中又说“finite-sample statistical guarantees”——后者可能误导读者。实际上,有限样本保证仅对标准分裂共形预测成立(在可交换性下),而本文的加权子采样破坏了精确可交换性,只能得到渐近结果。
  • Theorem 1 & 2的偏差项\( \Lambda(\hat{w}, \hat{\eta}^\pi) \) 依赖于 \( \mathbb{E}[|\hat{w} - w|] \)\( \mathbb{E}[\bar{W}_1(\hat{\eta}^\pi, \eta^\pi)] \),但未给出这些误差的显式上界(如收敛速率)。作者在实验部分通过选择 \( k=2,3 \) 来平衡两项,但未提供理论指导如何选择最优 \( k \)
  • Algorithm 1的聚合步骤(式5):使用B次子采样+多数投票,但Theorem 1的证明仅针对单个子采样区间(“it suffices to prove the validity of each single CP interval”)。聚合后的覆盖保证是否严格成立?作者引用[41, 35]作为依据,但未给出完整证明。

四、开放问题(点到为止,扎根具体语句)

  1. 截断步长 \( k \) 的最优选择:Theorem 1 & 2显示覆盖偏差随 \( k \) 增大而减小(\( \gamma^k \) 项),但实验(Table 1)显示 \( k \) 过大会导致过覆盖和更宽区间。作者在Conclusion中承认“the choice of \( k \) remains underexplored”,并建议“evaluating stability across multiple \( k \) values”。扎根语句:Conclusion第3-5行。

  2. 聚合方法的理论保证:Algorithm 1的式(5)用B次子采样+多数投票来稳定区间,但Theorem 1的证明仅针对单次子采样。作者引用[41, 35]作为依据,但未给出完整证明。扎根语句:Theorem 1证明第一段“Since \( \hat{C}^{\text{on}}_{N,\alpha}(S_{\text{test}}) \) combines \( B \) intervals following [41, 35], it suffices to prove the validity of each single CP interval.”

  3. 扩展到策略优化:作者在Conclusion中提出“extending our framework to policy optimization represents an exciting avenue for future work”。扎根语句:Conclusion倒数第2行。

  4. 离散回报的理论覆盖:Theorem 1 & 2要求回报分布有界Lebesgue密度,但Example 3(Mountain Car)的回报是离散的(恒为-1直到到达目标)。作者在Remark中承认该假设不适用于离散分布,但实验仍报告了有效覆盖。扎根语句:Theorem 1后的Remark:“this assumption does not apply to discrete return distributions... Hence, the bounded density condition is neither required nor meaningful for discrete returns, as in Example 3 of our experiments.”


Maintained by 陈星宇 · Homepage · Source on GitHub

评论