跳转至

Off-Policy Evaluation in Doubly Inhomogeneous Environments

作者: Zeyu Bian, Chengchun Shi, Zhengling Qi, Lan Wang
来源: Journal of the American Statistical Association
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本子方向研究的是离线策略评估(Off-Policy Evaluation, OPE) 问题。在强化学习(RL)中,OPE 的目标是:给定一个由某个“行为策略”(behavior policy)生成的、固定的历史交互数据集(离线数据),去估计另一个“目标策略”(target policy)的期望累积回报(value)。核心统计挑战在于:离线数据并非由目标策略生成,因此存在分布偏移(distribution shift),且通常无法通过随机化实验来纠正。当前,OPE 方法的主流框架(如重要性采样、Fitted Q-Evaluation、Doubly Robust 等)几乎都建立在两个关键假设之上:时间平稳性(temporal stationarity:奖励函数和转移函数不随时间变化)和个体同质性(individual homogeneity:所有个体共享相同的奖励和转移函数)。这篇论文研究的是当这两个假设同时被违反时的 OPE 问题,即“双重非平稳环境”(doubly inhomogeneous environments)。

发展脉络(history)

作者在引言中构建了一条清晰的脉络,将现有工作串成一条线:

  1. 奠基工作:标准 OPE 方法(平稳、同质)

    • Precup et al. (2000):提出了重要性采样(IS)方法,这是 OPE 的基石。它通过加权离线轨迹来纠正分布偏移,但方差随轨迹长度指数增长。
    • Le et al. (2019):提出了 Fitted Q-Evaluation (FQE),一种基于模型的 OPE 方法。它通过拟合状态-动作价值函数(Q 函数)来估计目标策略的价值,比 IS 更稳定,但依赖于函数逼近的准确性。
    • Kallus & Uehara (2020):提出了 Doubly Robust (DR) 估计量,结合了 IS 和模型估计,在两者之一正确时即可保证相合性,是当前 OPE 的理论黄金标准。作者引用它时,明确点出“DR 估计量在平稳同质假设下达到半参数效率界”,这为后续工作提供了效率基准。
  2. 主要进展:放松单一假设

    • 放松时间平稳性(非平稳时间序列)
      • Chen et al. (2021):研究了非平稳 MDP 下的 OPE,假设转移和奖励函数随时间平滑变化。他们利用核平滑或局部线性回归来捕捉时间趋势。作者引用它时,指出其“假设个体是同质的”,即所有个体共享相同的时间变化模式。
      • Shi et al. (2022):同样处理非平稳 MDP,但采用了不同的建模策略,如时间变化的低秩结构。作者引用它时,同样指出其“假设个体是同质的”
    • 放松个体同质性(异质性个体)
      • Liao et al. (2022):研究了具有异质性个体的 OPE,假设个体可以被划分为几个潜在的“类型”(latent class),每个类型有自己的 MDP。作者引用它时,指出其“假设时间平稳性”,即每个个体的 MDP 不随时间变化。
      • Uehara et al. (2022):在“上下文多臂赌博机”(contextual bandit)设定下处理个体异质性,但作者引用它时,指出其“不适用于完整的 MDP 设定”(即没有考虑状态转移)。
  3. 当前 Frontier 与本文位置

    • 本文的位置:作者明确指出,上述所有工作都只放松了一个假设,而同时放松两个假设(即双重非平稳)的工作是缺失的。本文是“第一个”在离线 RL 中为双重非平稳环境开发统计上合理的 OPE 方法的工作。它通过引入一个潜因子模型(latent factor model)来同时刻画奖励和转移函数在时间和个体两个维度上的异质性,从而填补了这一空白。

子线索聚类

这些被引文献大致落在以下两条子线索上:

  • 线索一:基于模型的 OPE 方法:这类方法通过直接或间接地估计 MDP 的转移和奖励函数来估计目标策略的价值。代表工作包括 FQE (Le et al., 2019) 以及本文提出的 model-based 方法。其优势在于方差通常较小,但依赖于模型假设的正确性。
  • 线索二:模型无关 / 重要性采样类方法:这类方法不显式建模 MDP,而是通过加权离线轨迹来纠正分布偏移。代表工作包括 IS (Precup et al., 2000) 和 DR (Kallus & Uehara, 2020)。其优势在于对模型误设更鲁棒,但方差可能很大。本文提出的 model-free 方法也属于此类,但利用了潜因子结构来降低方差。

这个方向在追问的核心问题

  1. 识别问题:在双重非平稳环境下,目标策略的价值是否仍然可以被识别(identifiable)?需要什么样的假设?
  2. 估计问题:如何设计一个统计上有效的估计量,使其在双重非平稳环境下具有相合性和合理的收敛速度?
  3. 效率问题:在给定的潜因子模型下,价值估计量的半参数效率界是什么?能否达到?
  4. 计算问题:如何高效地估计潜因子模型中的参数(如潜因子维数、因子载荷)?

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 成“现有 OPE 方法要么假设时间平稳,要么假设个体同质,但现实世界(如医疗数据)两者都可能不成立”。因此,本文的潜因子模型是“显然的下一步”,因为它能同时处理两种异质性。
  • 被淡化或回避的竞争路线
    • 非参数方法:作者没有深入讨论使用完全非参数的方法(如核方法、局部线性回归)来同时建模时间和个体异质性。这可能是由于“维度灾难”和“数据稀疏性”问题——在双重非平稳下,每个时间点-个体组合的数据量可能极少,非参数方法会失效。潜因子模型通过低秩结构引入了更强的假设,从而克服了稀疏性问题。
    • 混合效应模型:在统计学中,处理个体和时间异质性的标准方法是混合效应模型(如随机截距、随机斜率)。作者没有将其作为主要对比基线,可能是因为混合效应模型通常假设随机效应是高斯分布,且其与 RL 中的 OPE 框架(特别是价值函数的 Bellman 方程)的结合不如潜因子模型直接。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
    • 关于潜因子模型在因果推断中的识别理论:潜因子模型在因果推断中(如 Proximal Causal Inference, Tchetgen Tchetgen et al. 2020)有丰富的识别理论。本文的潜因子模型与这些工作有很强的联系,但引言中未提及。这是一个值得研究者去查的问题:本文的识别条件与 Proximal Causal Inference 中的识别条件有何异同?
    • 关于高维时间序列的因子模型:计量经济学中处理高维时间序列的因子模型(如 Bai & Ng, 2002; Fan et al., 2013)与本文的设定高度相关。这些工作提供了潜因子维数选择、因子载荷估计的成熟理论。本文的估计方法是否借鉴了这些工作?引言中未提及。

张力

未见明显对立引用。所有被引工作都承认标准 OPE 假设的局限性,并各自从不同角度进行放松。本文的工作是这些放松路线的自然汇合。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • t = 1, ..., T:时间点(离散)。
    • i = 1, ..., N:个体(独立同分布)。
    • S_{i,t} ∈ S:个体 i 在时间 t 的状态(state),是一个随机变量。
    • A_{i,t} ∈ A:个体 i 在时间 t 的动作(action),是一个随机变量。
    • R_{i,t} ∈ ℝ:个体 i 在时间 t 执行动作 A_{i,t} 后获得的即时奖励(reward),是一个随机变量。
    • π_b(A|S):行为策略(behavior policy),一个已知的条件概率分布,用于生成离线数据中的动作。已知
    • π_e(A|S):目标策略(target policy),一个已知的条件概率分布,我们要评估其价值。已知
    • V(π_e):目标策略的期望累积回报(value),即 E_{π_e}[Σ_{t=1}^T γ^{t-1} R_{i,t}],其中 γ ∈ [0,1) 是折扣因子。这是我们要估计的目标量(estimand)
    • Q_{i,t}(s, a):个体 i 在时间 t 的状态-动作价值函数(Q 函数),即 E_{π_e}[Σ_{k=t}^T γ^{k-t} R_{i,k} | S_{i,t}=s, A_{i,t}=a]。这是潜在量,因为离线数据中后续的动作不是由 π_e 生成的。
    • U_i ∈ ℝ^K:个体 i 的潜因子(latent factor),一个 K 维随机向量。不可观测
    • V_t ∈ ℝ^K:时间 t 的潜因子(latent factor),一个 K 维向量。不可观测
    • K:潜因子维数。未知,需要估计
    • θ:模型参数,包括因子载荷、基函数等。
  • 模型

    • 数据生成机制:作者假设奖励函数和转移函数(即 MDP)由潜因子模型驱动:
      • 奖励函数:E[R_{i,t} | S_{i,t}=s, A_{i,t}=a, U_i=u, V_t=v] = f_R(s, a, u, v; θ_R),其中 f_R 是一个已知形式的函数(如线性或通过基函数展开)。
      • 转移函数:P(S_{i,t+1}=s' | S_{i,t}=s, A_{i,t}=a, U_i=u, V_t=v) = f_T(s, a, s', u, v; θ_T),其中 f_T 是一个已知形式的函数。
    • 关键结构:个体异质性完全由 U_i 捕捉,时间异质性完全由 V_t 捕捉。给定 U_iV_t,不同个体和不同时间点的 MDP 是条件独立的。这构成了一个低秩结构:所有 N × T 个 MDP 的“参数”可以被分解为个体因子 U_i 和时间因子 V_t 的交互。
    • 已知部分π_b, π_e, γ, 函数形式 f_R, f_T
    • 要估的对象θ_R, θ_T, U_i (i=1..N), V_t (t=1..T), K。最终目标是 V(π_e)
  • 可观测数据

    • 研究者能观测到的是:{ (S_{i,t}, A_{i,t}, R_{i,t}, S_{i,t+1}) : i=1,...,N, t=1,...,T }。这是一个由 π_b 生成的、包含 N 条独立轨迹(每个个体一条)的数据集。
    • 不可观测的是:U_i, V_t,以及由 π_e 生成的任何反事实轨迹(counterfactual trajectories)。

第二步:讲最小内核

为了理解本文的核心思路,我们考虑一个最简特例线性奖励模型,无状态转移(即上下文多臂赌博机,Contextual Bandit)

  • 设定

    • T=1(只有一个时间点,所以没有时间异质性,V_t 退化为常数,设为 1)。
    • 状态 S_{i,1} 是上下文(context),动作 A_{i,1} 是选择的臂。
    • 奖励 R_{i,1} 由线性模型生成:R_{i,1} = U_i^T β_{A_{i,1}} + ε_{i,1},其中 U_i ∈ ℝ^K 是个体潜因子(不可观测),β_a ∈ ℝ^K 是动作 a 的系数向量(要估),ε_{i,1} 是零均值噪声。
    • 目标策略 π_e(A|S) 是一个已知的、可能依赖于状态的策略。
    • 我们要估计 V(π_e) = E_{π_e}[R_{i,1}]
  • 核心思路

    1. 识别:由于 U_i 不可观测,我们不能直接估计 β_a。但是,如果我们有多个动作的观测数据,我们可以利用不同动作下奖励的协方差结构来识别 U_i 的线性组合。例如,对于两个不同的动作 aa'Cov(R_{i,1}(a), R_{i,1}(a') | S) = β_a^T Cov(U_i | S) β_{a'}。这个协方差矩阵包含了关于 U_i 的信息。
    2. 估计:我们可以通过两步法来估计 V(π_e)
      • 第一步(因子估计):使用所有个体的数据,通过矩阵分解(如 PCA)来估计潜因子 U_i 和系数 β_a。具体地,将奖励矩阵 R ∈ ℝ^{N × |A|}(行是个体,列是动作)进行低秩分解,得到 R ≈ Û B^T,其中 ÛU_i 的估计,Bβ_a 的估计。
      • 第二步(价值估计):有了 ÛB,我们可以预测每个个体在目标策略下的期望奖励:E[ R_{i,1} | π_e ] ≈ Σ_a π_e(a|S_{i,1}) * (Û_i^T B_a)。然后对所有个体取平均,得到 V(π_e) 的估计。
  • 为什么这个特例是“最小内核”

    • 它保留了核心挑战:不可观测的个体异质性U_i)导致标准的 OPE 方法(如 IS 或 FQE)失效,因为它们假设所有个体同质。
    • 它展示了核心工具:低秩结构(奖励矩阵的低秩分解)是解决该挑战的关键。
    • 它去掉了时间异质性和状态转移的复杂性,使得核心思想一目了然。论文的一般情形(带状态转移的完整 MDP)本质上就是在这个赌博机内核上,加上一个时间维度的低秩结构V_t)和一个通过 Bellman 方程递归求解 Q 函数的步骤。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在离线强化学习中,当时间平稳性和个体同质性两个关键假设同时被违反(即双重非平稳环境)时,如何对目标策略进行有效的价值评估(OPE)。
  2. 核心工具 / 方法:提出了一类潜因子模型来刻画奖励和转移函数在时间和个体两个维度上的异质性,并在此基础上发展了基于模型(model-based)模型无关(model-free) 两种 OPE 框架。
  3. 主要结论:建立了所提价值估计量的相合性收敛速率,并在合成数据和真实医疗数据(MIMIC-IV)上展示了其优于现有 SOTA 方法(如标准 FQE、忽略异质性的方法)的表现。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 潜因子模型(核心假设)
    • 假设 1(奖励函数)E[R_{i,t} | S_{i,t}=s, A_{i,t}=a, U_i=u, V_t=v] = Σ_{k=1}^K u_k * v_t * φ_k(s, a),其中 φ_k 是已知的基函数。这是一个双线性形式,个体和时间因子通过乘积交互。
    • 假设 2(转移函数)P(S_{i,t+1}=s' | S_{i,t}=s, A_{i,t}=a, U_i=u, V_t=v) = Σ_{k=1}^K u_k * v_t * ψ_k(s, a, s'),其中 ψ_k 是已知的基函数。同样是一个双线性形式。
    • 假设 3(潜因子分布)U_i 是独立同分布的随机向量,均值为 0,协方差矩阵为 Σ_UV_t 是确定性或随机的时间序列,均值为 0,协方差矩阵为 Σ_VU_iV_t 相互独立。
    • 假设 4(可识别性):潜因子维数 K 是固定的,且因子载荷矩阵(由 φ_kψ_k 构成)满足一定的秩条件,以确保模型可识别。这类似于因子分析中的“旋转不变性”问题,作者通过施加正交约束(如 Σ_U = I_K)来解决。
  • 与已有文献的对比
    • 相比 Chen et al. (2021) 和 Shi et al. (2022):本文的模型更一般,因为它允许个体异质性(通过 U_i),而不仅仅是时间异质性。
    • 相比 Liao et al. (2022):本文的模型更一般,因为它允许时间异质性(通过 V_t),而不仅仅是离散的个体类型。潜因子模型可以看作是对离散类型模型的连续化推广。
    • 相比标准 OPE 方法:本文的假设更强(引入了潜因子结构),但这是为了在数据稀疏的双重非平稳环境下实现识别和有效估计所付出的代价。

主要结果

本文的理论结果主要围绕两个估计量展开:Model-basedModel-free

  • 结果 1:Model-based 价值估计量的相合性与收敛速率

    • 陈述:在正则条件下,基于潜因子模型估计出的 Q 函数 Q̂_{i,t}(s,a),进而得到的目标策略价值估计 V̂_MB(π_e),是相合的。其收敛速率为 O_p( (K^2 / sqrt(NT)) + (K^2 / sqrt(T)) + (K^2 / sqrt(N)) )
    • 直觉:收敛速率由三部分组成:估计潜因子模型参数(θ)的误差(K^2 / sqrt(NT))、估计时间因子 V_t 的误差(K^2 / sqrt(T))、估计个体因子 U_i 的误差(K^2 / sqrt(N))。当 NT 都很大时,主导项是 K^2 / sqrt(NT),这相当于用所有 N*T 个数据点来估计 K^2 个参数,达到了参数化的速率。
    • 必要条件:潜因子维数 K 已知或能被正确估计;基函数 φ_k, ψ_k 选择得当;行为策略 π_b 有足够的探索性(覆盖性条件)。
    • 解决的技术难点:如何同时估计 N+T 个潜因子(U_iV_t)以及全局参数 θ。作者采用了交替最小化(alternating minimization)或谱方法(spectral method)来求解这个高维非凸优化问题,并证明了其收敛性。
  • 结果 2:Model-free 价值估计量的相合性与收敛速率

    • 陈述:基于潜因子模型构造的加权双稳健(Weighted Doubly Robust, WDR) 估计量 V̂_MF(π_e) 也是相合的。其收敛速率与 Model-based 估计量相同,但常数项可能更小。
    • 直觉:WDR 估计量结合了 Model-based 的 Q 函数估计和重要性采样权重。其优势在于,即使 Q 函数估计有偏(模型误设),只要重要性采样权重正确,估计量仍然是相合的(双稳健性质)。在潜因子模型下,作者构造了基于潜因子的重要性采样权重 w_{i,t} = π_e(A_{i,t}|S_{i,t}) / π_b(A_{i,t}|S_{i,t}),但由于 U_iV_t 不可观测,这个权重需要被估计。
    • 必要条件:与 Model-based 类似,但额外要求重要性采样权重的估计是相合的。
    • 解决的技术难点:如何构造一个在潜因子模型下有效的 WDR 估计量。作者的关键技巧是将潜因子纳入 WDR 的“ nuisance”参数中,并证明其影响函数(influence function)的结构仍然允许进行有效的交叉拟合(cross-fitting)。

证明路线与技术技巧

  • 整体路线(以 Model-based 方法为例)

    1. 第一步:潜因子模型估计。将观测到的奖励和转移数据组织成张量(tensor)形式。利用张量分解(如 CP 分解)或矩阵谱分解(通过将数据折叠成矩阵)来获得潜因子 U_i, V_t 和参数 θ 的初始估计。
    2. 第二步:Q 函数估计。利用估计出的潜因子模型,通过向后递归(backward induction)求解 Bellman 方程,得到每个个体在每个时间点的 Q 函数估计 Q̂_{i,t}(s,a)。这一步是标准的,但计算量随 T 线性增长。
    3. 第三步:价值估计。对于每个个体 i,计算其在目标策略下的期望价值:V̂_i = Σ_t γ^{t-1} E_{π_e}[ Q̂_{i,t}(S_{i,t}, A_{i,t}) | S_{i,1} ]。然后对所有个体取平均:V̂_MB = (1/N) Σ_i V̂_i
    4. 第四步:误差分析。将估计误差分解为:V̂_MB - V(π_e) = (模型估计误差) + (Q 函数递归误差) + (抽样误差)。利用经验过程理论(empirical process theory)和浓度不等式(concentration inequalities)来界定每一项的阶。
  • 关键跳跃点

    • 从“矩阵分解”到“张量分解”:在赌博机特例中,数据是矩阵(个体 × 动作)。在完整 MDP 中,数据是张量(个体 × 时间 × 状态-动作对)。作者需要将矩阵分解的理论(如 PCA 的相合性)推广到张量分解。这是证明中最吃功夫的部分,因为张量分解的统计性质比矩阵分解复杂得多(如非唯一性、计算困难)。
    • 处理“潜因子”与“Q 函数”的耦合:Q 函数依赖于潜因子,而潜因子又通过 Q 函数影响价值估计。作者需要证明,在交替估计的过程中,误差不会累积放大。他们通过证明一个收缩性质(contraction property)来确保迭代过程的收敛性。
  • 技术技巧点名

    • 张量 CP 分解:用于从观测数据中估计潜因子模型参数。
    • 谱方法 / 奇异值分解(SVD):用于获得潜因子的初始估计,作为非凸优化的良好起点。
    • 交替最小二乘法(ALS):用于迭代优化潜因子和参数。
    • 经验过程理论:用于界定估计误差的随机波动。
    • 交叉拟合(Cross-fitting):在 Model-free 的 WDR 估计量中使用,以避免过拟合带来的偏差,是 DML(Debiased Machine Learning)的标准技巧。

真实例子与应用

  • 数据MIMIC-IV 医疗数据集,包含重症监护室(ICU)患者的电子健康记录。
  • 场景:作者构建了一个 RL 环境,其中:
    • 状态:患者当前的生理指标(如心率、血压、呼吸频率)。
    • 动作:医生是否给患者使用血管活性药物(vasopressors)。
    • 奖励:一个复合指标,反映患者 24 小时内的健康状况改善(如存活、器官功能恢复)。
    • 个体异质性:不同患者(如不同年龄、基础疾病)对药物的反应不同。
    • 时间异质性:患者的生理状态和对药物的反应会随时间(住院天数)变化。
  • 方法应用
    • 作者将提出的潜因子模型应用于该数据,估计每个患者 i 和每个住院日 t 的潜因子。
    • 然后,他们评估一个目标策略:一个更保守的用药策略(例如,只在特定生理指标阈值下才用药)。
    • 他们比较了本文提出的 Model-based 和 Model-free 方法与几个基线方法:标准 FQE(忽略异质性)、忽略时间异质性的潜因子模型、忽略个体异质性的潜因子模型。
  • 结果
    • 本文提出的方法(特别是 Model-free WDR)在估计目标策略价值时,均方误差(MSE)显著低于所有基线方法
    • 标准 FQE 由于忽略了双重异质性,产生了很大的偏差。
    • 只考虑一种异质性的方法表现次优,证明了同时建模两种异质性的必要性。
  • 这个例子想说明什么:验证了本文方法在真实世界复杂数据上的有效性,并直观地展示了忽略双重异质性会如何导致严重的 OPE 偏差,从而可能误导临床决策。

🔎 结论是否比证明窄

  • 窄结论 1:理论结果(收敛速率)是在潜因子维数 K 已知的假设下建立的。在实际应用中,K 需要通过数据驱动的方法(如交叉验证、特征值比值检验)来选择。作者在模拟实验中展示了 K 选择方法的有效性,但没有为 K 的选择提供严格的统计理论保证(如相合性)。因此,论文的结论(“我们的方法有效”)在实证上成立,但其理论覆盖范围比声称的“第一个统计上合理的 OPE 方法”要窄——它依赖于一个在实践中需要额外处理的未知参数。
  • 窄结论 2:理论结果假设潜因子模型是正确设定的(即真实 MDP 确实服从双线性形式)。如果模型误设,估计量的性质(如相合性)将不再有保证。作者在模拟实验中测试了对模型误设的稳健性(如非线性奖励),但没有提供理论上的稳健性分析。因此,论文的结论严格局限于其模型假设之内。

四、开放问题

  1. 潜因子维数 K 的自适应选择:本文的理论依赖于 K 已知。一个自然的开放问题是:能否设计一个数据驱动的 K 选择方法(如基于信息准则、特征值比值、或交叉验证),并证明其选择的 K 能使得价值估计量达到最优的收敛速率?扎根于:定理 1 和 2 的陈述中“假设 K 已知”。
  2. 半参数效率界:本文给出了估计量的收敛速率,但未讨论其是否达到了半参数效率界。在给定的潜因子模型下,V(π_e) 的半参数效率界是什么?本文提出的 Model-free WDR 估计量是否达到了这个界?扎根于:作者在引言中引用了 Kallus & Uehara (2020) 关于平稳同质环境下 DR 估计量达到效率界的工作,但未在本文中讨论效率问题。
  3. 模型误设下的稳健性:本文的潜因子模型假设了双线性形式。一个更现实的开放问题是:当真实 MDP 偏离这个假设时(例如,存在高阶交互项),本文的方法表现如何?能否发展出对模型误设更鲁棒的 OPE 方法,例如通过使用更灵活的潜因子模型(如深度神经网络)或引入模型平均?扎根于:模拟实验中对模型误设的有限测试,以及作者在结论中提到的“未来工作可以探索更灵活的模型”。
  4. 计算与统计的权衡:本文的潜因子模型估计涉及非凸优化(张量分解)。是否存在一个计算上高效(如多项式时间)且统计上最优的算法?或者,是否存在一个统计-计算权衡(statistical-computational tradeoff),即为了获得多项式时间算法,必须牺牲统计效率(例如,需要更大的样本量)?扎根于:作者在引言中未讨论计算复杂性,且其使用的 ALS 算法只能保证收敛到局部最优。这与研究者感兴趣的“信息-计算差距”问题直接相关。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论