Off-Policy Evaluation in Doubly Inhomogeneous Environments¶
作者: Zeyu Bian, Chengchun Shi, Zhengling Qi, Lan Wang
来源: Journal of the American Statistical Association
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本子方向研究的是离线策略评估(Off-Policy Evaluation, OPE) 问题。在强化学习(RL)中,OPE 的目标是:给定一个由某个“行为策略”(behavior policy)生成的、固定的历史交互数据集(离线数据),去估计另一个“目标策略”(target policy)的期望累积回报(value)。核心统计挑战在于:离线数据并非由目标策略生成,因此存在分布偏移(distribution shift),且通常无法通过随机化实验来纠正。当前,OPE 方法的主流框架(如重要性采样、Fitted Q-Evaluation、Doubly Robust 等)几乎都建立在两个关键假设之上:时间平稳性(temporal stationarity:奖励函数和转移函数不随时间变化)和个体同质性(individual homogeneity:所有个体共享相同的奖励和转移函数)。这篇论文研究的是当这两个假设同时被违反时的 OPE 问题,即“双重非平稳环境”(doubly inhomogeneous environments)。
发展脉络(history)¶
作者在引言中构建了一条清晰的脉络,将现有工作串成一条线:
-
奠基工作:标准 OPE 方法(平稳、同质)
- Precup et al. (2000):提出了重要性采样(IS)方法,这是 OPE 的基石。它通过加权离线轨迹来纠正分布偏移,但方差随轨迹长度指数增长。
- Le et al. (2019):提出了 Fitted Q-Evaluation (FQE),一种基于模型的 OPE 方法。它通过拟合状态-动作价值函数(Q 函数)来估计目标策略的价值,比 IS 更稳定,但依赖于函数逼近的准确性。
- Kallus & Uehara (2020):提出了 Doubly Robust (DR) 估计量,结合了 IS 和模型估计,在两者之一正确时即可保证相合性,是当前 OPE 的理论黄金标准。作者引用它时,明确点出“DR 估计量在平稳同质假设下达到半参数效率界”,这为后续工作提供了效率基准。
-
主要进展:放松单一假设
- 放松时间平稳性(非平稳时间序列):
- Chen et al. (2021):研究了非平稳 MDP 下的 OPE,假设转移和奖励函数随时间平滑变化。他们利用核平滑或局部线性回归来捕捉时间趋势。作者引用它时,指出其“假设个体是同质的”,即所有个体共享相同的时间变化模式。
- Shi et al. (2022):同样处理非平稳 MDP,但采用了不同的建模策略,如时间变化的低秩结构。作者引用它时,同样指出其“假设个体是同质的”。
- 放松个体同质性(异质性个体):
- Liao et al. (2022):研究了具有异质性个体的 OPE,假设个体可以被划分为几个潜在的“类型”(latent class),每个类型有自己的 MDP。作者引用它时,指出其“假设时间平稳性”,即每个个体的 MDP 不随时间变化。
- Uehara et al. (2022):在“上下文多臂赌博机”(contextual bandit)设定下处理个体异质性,但作者引用它时,指出其“不适用于完整的 MDP 设定”(即没有考虑状态转移)。
- 放松时间平稳性(非平稳时间序列):
-
当前 Frontier 与本文位置
- 本文的位置:作者明确指出,上述所有工作都只放松了一个假设,而同时放松两个假设(即双重非平稳)的工作是缺失的。本文是“第一个”在离线 RL 中为双重非平稳环境开发统计上合理的 OPE 方法的工作。它通过引入一个潜因子模型(latent factor model)来同时刻画奖励和转移函数在时间和个体两个维度上的异质性,从而填补了这一空白。
子线索聚类¶
这些被引文献大致落在以下两条子线索上:
- 线索一:基于模型的 OPE 方法:这类方法通过直接或间接地估计 MDP 的转移和奖励函数来估计目标策略的价值。代表工作包括 FQE (Le et al., 2019) 以及本文提出的 model-based 方法。其优势在于方差通常较小,但依赖于模型假设的正确性。
- 线索二:模型无关 / 重要性采样类方法:这类方法不显式建模 MDP,而是通过加权离线轨迹来纠正分布偏移。代表工作包括 IS (Precup et al., 2000) 和 DR (Kallus & Uehara, 2020)。其优势在于对模型误设更鲁棒,但方差可能很大。本文提出的 model-free 方法也属于此类,但利用了潜因子结构来降低方差。
这个方向在追问的核心问题¶
- 识别问题:在双重非平稳环境下,目标策略的价值是否仍然可以被识别(identifiable)?需要什么样的假设?
- 估计问题:如何设计一个统计上有效的估计量,使其在双重非平稳环境下具有相合性和合理的收敛速度?
- 效率问题:在给定的潜因子模型下,价值估计量的半参数效率界是什么?能否达到?
- 计算问题:如何高效地估计潜因子模型中的参数(如潜因子维数、因子载荷)?
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口 frame 成“现有 OPE 方法要么假设时间平稳,要么假设个体同质,但现实世界(如医疗数据)两者都可能不成立”。因此,本文的潜因子模型是“显然的下一步”,因为它能同时处理两种异质性。
- 被淡化或回避的竞争路线:
- 非参数方法:作者没有深入讨论使用完全非参数的方法(如核方法、局部线性回归)来同时建模时间和个体异质性。这可能是由于“维度灾难”和“数据稀疏性”问题——在双重非平稳下,每个时间点-个体组合的数据量可能极少,非参数方法会失效。潜因子模型通过低秩结构引入了更强的假设,从而克服了稀疏性问题。
- 混合效应模型:在统计学中,处理个体和时间异质性的标准方法是混合效应模型(如随机截距、随机斜率)。作者没有将其作为主要对比基线,可能是因为混合效应模型通常假设随机效应是高斯分布,且其与 RL 中的 OPE 框架(特别是价值函数的 Bellman 方程)的结合不如潜因子模型直接。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 关于潜因子模型在因果推断中的识别理论:潜因子模型在因果推断中(如 Proximal Causal Inference, Tchetgen Tchetgen et al. 2020)有丰富的识别理论。本文的潜因子模型与这些工作有很强的联系,但引言中未提及。这是一个值得研究者去查的问题:本文的识别条件与 Proximal Causal Inference 中的识别条件有何异同?
- 关于高维时间序列的因子模型:计量经济学中处理高维时间序列的因子模型(如 Bai & Ng, 2002; Fan et al., 2013)与本文的设定高度相关。这些工作提供了潜因子维数选择、因子载荷估计的成熟理论。本文的估计方法是否借鉴了这些工作?引言中未提及。
张力¶
未见明显对立引用。所有被引工作都承认标准 OPE 假设的局限性,并各自从不同角度进行放松。本文的工作是这些放松路线的自然汇合。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
t = 1, ..., T:时间点(离散)。i = 1, ..., N:个体(独立同分布)。S_{i,t} ∈ S:个体i在时间t的状态(state),是一个随机变量。A_{i,t} ∈ A:个体i在时间t的动作(action),是一个随机变量。R_{i,t} ∈ ℝ:个体i在时间t执行动作A_{i,t}后获得的即时奖励(reward),是一个随机变量。π_b(A|S):行为策略(behavior policy),一个已知的条件概率分布,用于生成离线数据中的动作。已知。π_e(A|S):目标策略(target policy),一个已知的条件概率分布,我们要评估其价值。已知。V(π_e):目标策略的期望累积回报(value),即E_{π_e}[Σ_{t=1}^T γ^{t-1} R_{i,t}],其中γ ∈ [0,1)是折扣因子。这是我们要估计的目标量(estimand)。Q_{i,t}(s, a):个体i在时间t的状态-动作价值函数(Q 函数),即E_{π_e}[Σ_{k=t}^T γ^{k-t} R_{i,k} | S_{i,t}=s, A_{i,t}=a]。这是潜在量,因为离线数据中后续的动作不是由π_e生成的。U_i ∈ ℝ^K:个体i的潜因子(latent factor),一个K维随机向量。不可观测。V_t ∈ ℝ^K:时间t的潜因子(latent factor),一个K维向量。不可观测。K:潜因子维数。未知,需要估计。θ:模型参数,包括因子载荷、基函数等。
-
模型:
- 数据生成机制:作者假设奖励函数和转移函数(即 MDP)由潜因子模型驱动:
- 奖励函数:
E[R_{i,t} | S_{i,t}=s, A_{i,t}=a, U_i=u, V_t=v] = f_R(s, a, u, v; θ_R),其中f_R是一个已知形式的函数(如线性或通过基函数展开)。 - 转移函数:
P(S_{i,t+1}=s' | S_{i,t}=s, A_{i,t}=a, U_i=u, V_t=v) = f_T(s, a, s', u, v; θ_T),其中f_T是一个已知形式的函数。
- 奖励函数:
- 关键结构:个体异质性完全由
U_i捕捉,时间异质性完全由V_t捕捉。给定U_i和V_t,不同个体和不同时间点的 MDP 是条件独立的。这构成了一个低秩结构:所有N × T个 MDP 的“参数”可以被分解为个体因子U_i和时间因子V_t的交互。 - 已知部分:
π_b,π_e,γ, 函数形式f_R,f_T。 - 要估的对象:
θ_R,θ_T,U_i(i=1..N),V_t(t=1..T),K。最终目标是V(π_e)。
- 数据生成机制:作者假设奖励函数和转移函数(即 MDP)由潜因子模型驱动:
-
可观测数据:
- 研究者能观测到的是:
{ (S_{i,t}, A_{i,t}, R_{i,t}, S_{i,t+1}) : i=1,...,N, t=1,...,T }。这是一个由π_b生成的、包含N条独立轨迹(每个个体一条)的数据集。 - 不可观测的是:
U_i,V_t,以及由π_e生成的任何反事实轨迹(counterfactual trajectories)。
- 研究者能观测到的是:
第二步:讲最小内核¶
为了理解本文的核心思路,我们考虑一个最简特例:线性奖励模型,无状态转移(即上下文多臂赌博机,Contextual Bandit)。
-
设定:
T=1(只有一个时间点,所以没有时间异质性,V_t退化为常数,设为 1)。- 状态
S_{i,1}是上下文(context),动作A_{i,1}是选择的臂。 - 奖励
R_{i,1}由线性模型生成:R_{i,1} = U_i^T β_{A_{i,1}} + ε_{i,1},其中U_i ∈ ℝ^K是个体潜因子(不可观测),β_a ∈ ℝ^K是动作a的系数向量(要估),ε_{i,1}是零均值噪声。 - 目标策略
π_e(A|S)是一个已知的、可能依赖于状态的策略。 - 我们要估计
V(π_e) = E_{π_e}[R_{i,1}]。
-
核心思路:
- 识别:由于
U_i不可观测,我们不能直接估计β_a。但是,如果我们有多个动作的观测数据,我们可以利用不同动作下奖励的协方差结构来识别U_i的线性组合。例如,对于两个不同的动作a和a',Cov(R_{i,1}(a), R_{i,1}(a') | S) = β_a^T Cov(U_i | S) β_{a'}。这个协方差矩阵包含了关于U_i的信息。 - 估计:我们可以通过两步法来估计
V(π_e):- 第一步(因子估计):使用所有个体的数据,通过矩阵分解(如 PCA)来估计潜因子
U_i和系数β_a。具体地,将奖励矩阵R ∈ ℝ^{N × |A|}(行是个体,列是动作)进行低秩分解,得到R ≈ Û B^T,其中Û是U_i的估计,B是β_a的估计。 - 第二步(价值估计):有了
Û和B,我们可以预测每个个体在目标策略下的期望奖励:E[ R_{i,1} | π_e ] ≈ Σ_a π_e(a|S_{i,1}) * (Û_i^T B_a)。然后对所有个体取平均,得到V(π_e)的估计。
- 第一步(因子估计):使用所有个体的数据,通过矩阵分解(如 PCA)来估计潜因子
- 识别:由于
-
为什么这个特例是“最小内核”:
- 它保留了核心挑战:不可观测的个体异质性(
U_i)导致标准的 OPE 方法(如 IS 或 FQE)失效,因为它们假设所有个体同质。 - 它展示了核心工具:低秩结构(奖励矩阵的低秩分解)是解决该挑战的关键。
- 它去掉了时间异质性和状态转移的复杂性,使得核心思想一目了然。论文的一般情形(带状态转移的完整 MDP)本质上就是在这个赌博机内核上,加上一个时间维度的低秩结构(
V_t)和一个通过 Bellman 方程递归求解 Q 函数的步骤。
- 它保留了核心挑战:不可观测的个体异质性(
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在离线强化学习中,当时间平稳性和个体同质性两个关键假设同时被违反(即双重非平稳环境)时,如何对目标策略进行有效的价值评估(OPE)。
- 核心工具 / 方法:提出了一类潜因子模型来刻画奖励和转移函数在时间和个体两个维度上的异质性,并在此基础上发展了基于模型(model-based) 和模型无关(model-free) 两种 OPE 框架。
- 主要结论:建立了所提价值估计量的相合性和收敛速率,并在合成数据和真实医疗数据(MIMIC-IV)上展示了其优于现有 SOTA 方法(如标准 FQE、忽略异质性的方法)的表现。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 潜因子模型(核心假设):
- 假设 1(奖励函数):
E[R_{i,t} | S_{i,t}=s, A_{i,t}=a, U_i=u, V_t=v] = Σ_{k=1}^K u_k * v_t * φ_k(s, a),其中φ_k是已知的基函数。这是一个双线性形式,个体和时间因子通过乘积交互。 - 假设 2(转移函数):
P(S_{i,t+1}=s' | S_{i,t}=s, A_{i,t}=a, U_i=u, V_t=v) = Σ_{k=1}^K u_k * v_t * ψ_k(s, a, s'),其中ψ_k是已知的基函数。同样是一个双线性形式。 - 假设 3(潜因子分布):
U_i是独立同分布的随机向量,均值为 0,协方差矩阵为Σ_U。V_t是确定性或随机的时间序列,均值为 0,协方差矩阵为Σ_V。U_i和V_t相互独立。 - 假设 4(可识别性):潜因子维数
K是固定的,且因子载荷矩阵(由φ_k和ψ_k构成)满足一定的秩条件,以确保模型可识别。这类似于因子分析中的“旋转不变性”问题,作者通过施加正交约束(如Σ_U = I_K)来解决。
- 假设 1(奖励函数):
- 与已有文献的对比:
- 相比 Chen et al. (2021) 和 Shi et al. (2022):本文的模型更一般,因为它允许个体异质性(通过
U_i),而不仅仅是时间异质性。 - 相比 Liao et al. (2022):本文的模型更一般,因为它允许时间异质性(通过
V_t),而不仅仅是离散的个体类型。潜因子模型可以看作是对离散类型模型的连续化推广。 - 相比标准 OPE 方法:本文的假设更强(引入了潜因子结构),但这是为了在数据稀疏的双重非平稳环境下实现识别和有效估计所付出的代价。
- 相比 Chen et al. (2021) 和 Shi et al. (2022):本文的模型更一般,因为它允许个体异质性(通过
主要结果¶
本文的理论结果主要围绕两个估计量展开:Model-based 和 Model-free。
-
结果 1:Model-based 价值估计量的相合性与收敛速率
- 陈述:在正则条件下,基于潜因子模型估计出的 Q 函数
Q̂_{i,t}(s,a),进而得到的目标策略价值估计V̂_MB(π_e),是相合的。其收敛速率为O_p( (K^2 / sqrt(NT)) + (K^2 / sqrt(T)) + (K^2 / sqrt(N)) )。 - 直觉:收敛速率由三部分组成:估计潜因子模型参数(
θ)的误差(K^2 / sqrt(NT))、估计时间因子V_t的误差(K^2 / sqrt(T))、估计个体因子U_i的误差(K^2 / sqrt(N))。当N和T都很大时,主导项是K^2 / sqrt(NT),这相当于用所有N*T个数据点来估计K^2个参数,达到了参数化的速率。 - 必要条件:潜因子维数
K已知或能被正确估计;基函数φ_k,ψ_k选择得当;行为策略π_b有足够的探索性(覆盖性条件)。 - 解决的技术难点:如何同时估计
N+T个潜因子(U_i和V_t)以及全局参数θ。作者采用了交替最小化(alternating minimization)或谱方法(spectral method)来求解这个高维非凸优化问题,并证明了其收敛性。
- 陈述:在正则条件下,基于潜因子模型估计出的 Q 函数
-
结果 2:Model-free 价值估计量的相合性与收敛速率
- 陈述:基于潜因子模型构造的加权双稳健(Weighted Doubly Robust, WDR) 估计量
V̂_MF(π_e)也是相合的。其收敛速率与 Model-based 估计量相同,但常数项可能更小。 - 直觉:WDR 估计量结合了 Model-based 的 Q 函数估计和重要性采样权重。其优势在于,即使 Q 函数估计有偏(模型误设),只要重要性采样权重正确,估计量仍然是相合的(双稳健性质)。在潜因子模型下,作者构造了基于潜因子的重要性采样权重
w_{i,t} = π_e(A_{i,t}|S_{i,t}) / π_b(A_{i,t}|S_{i,t}),但由于U_i和V_t不可观测,这个权重需要被估计。 - 必要条件:与 Model-based 类似,但额外要求重要性采样权重的估计是相合的。
- 解决的技术难点:如何构造一个在潜因子模型下有效的 WDR 估计量。作者的关键技巧是将潜因子纳入 WDR 的“ nuisance”参数中,并证明其影响函数(influence function)的结构仍然允许进行有效的交叉拟合(cross-fitting)。
- 陈述:基于潜因子模型构造的加权双稳健(Weighted Doubly Robust, WDR) 估计量
证明路线与技术技巧¶
-
整体路线(以 Model-based 方法为例):
- 第一步:潜因子模型估计。将观测到的奖励和转移数据组织成张量(tensor)形式。利用张量分解(如 CP 分解)或矩阵谱分解(通过将数据折叠成矩阵)来获得潜因子
U_i,V_t和参数θ的初始估计。 - 第二步:Q 函数估计。利用估计出的潜因子模型,通过向后递归(backward induction)求解 Bellman 方程,得到每个个体在每个时间点的 Q 函数估计
Q̂_{i,t}(s,a)。这一步是标准的,但计算量随T线性增长。 - 第三步:价值估计。对于每个个体
i,计算其在目标策略下的期望价值:V̂_i = Σ_t γ^{t-1} E_{π_e}[ Q̂_{i,t}(S_{i,t}, A_{i,t}) | S_{i,1} ]。然后对所有个体取平均:V̂_MB = (1/N) Σ_i V̂_i。 - 第四步:误差分析。将估计误差分解为:
V̂_MB - V(π_e) = (模型估计误差) + (Q 函数递归误差) + (抽样误差)。利用经验过程理论(empirical process theory)和浓度不等式(concentration inequalities)来界定每一项的阶。
- 第一步:潜因子模型估计。将观测到的奖励和转移数据组织成张量(tensor)形式。利用张量分解(如 CP 分解)或矩阵谱分解(通过将数据折叠成矩阵)来获得潜因子
-
关键跳跃点:
- 从“矩阵分解”到“张量分解”:在赌博机特例中,数据是矩阵(个体 × 动作)。在完整 MDP 中,数据是张量(个体 × 时间 × 状态-动作对)。作者需要将矩阵分解的理论(如 PCA 的相合性)推广到张量分解。这是证明中最吃功夫的部分,因为张量分解的统计性质比矩阵分解复杂得多(如非唯一性、计算困难)。
- 处理“潜因子”与“Q 函数”的耦合:Q 函数依赖于潜因子,而潜因子又通过 Q 函数影响价值估计。作者需要证明,在交替估计的过程中,误差不会累积放大。他们通过证明一个收缩性质(contraction property)来确保迭代过程的收敛性。
-
技术技巧点名:
- 张量 CP 分解:用于从观测数据中估计潜因子模型参数。
- 谱方法 / 奇异值分解(SVD):用于获得潜因子的初始估计,作为非凸优化的良好起点。
- 交替最小二乘法(ALS):用于迭代优化潜因子和参数。
- 经验过程理论:用于界定估计误差的随机波动。
- 交叉拟合(Cross-fitting):在 Model-free 的 WDR 估计量中使用,以避免过拟合带来的偏差,是 DML(Debiased Machine Learning)的标准技巧。
真实例子与应用¶
- 数据:MIMIC-IV 医疗数据集,包含重症监护室(ICU)患者的电子健康记录。
- 场景:作者构建了一个 RL 环境,其中:
- 状态:患者当前的生理指标(如心率、血压、呼吸频率)。
- 动作:医生是否给患者使用血管活性药物(vasopressors)。
- 奖励:一个复合指标,反映患者 24 小时内的健康状况改善(如存活、器官功能恢复)。
- 个体异质性:不同患者(如不同年龄、基础疾病)对药物的反应不同。
- 时间异质性:患者的生理状态和对药物的反应会随时间(住院天数)变化。
- 方法应用:
- 作者将提出的潜因子模型应用于该数据,估计每个患者
i和每个住院日t的潜因子。 - 然后,他们评估一个目标策略:一个更保守的用药策略(例如,只在特定生理指标阈值下才用药)。
- 他们比较了本文提出的 Model-based 和 Model-free 方法与几个基线方法:标准 FQE(忽略异质性)、忽略时间异质性的潜因子模型、忽略个体异质性的潜因子模型。
- 作者将提出的潜因子模型应用于该数据,估计每个患者
- 结果:
- 本文提出的方法(特别是 Model-free WDR)在估计目标策略价值时,均方误差(MSE)显著低于所有基线方法。
- 标准 FQE 由于忽略了双重异质性,产生了很大的偏差。
- 只考虑一种异质性的方法表现次优,证明了同时建模两种异质性的必要性。
- 这个例子想说明什么:验证了本文方法在真实世界复杂数据上的有效性,并直观地展示了忽略双重异质性会如何导致严重的 OPE 偏差,从而可能误导临床决策。
🔎 结论是否比证明窄¶
- 窄结论 1:理论结果(收敛速率)是在潜因子维数
K已知的假设下建立的。在实际应用中,K需要通过数据驱动的方法(如交叉验证、特征值比值检验)来选择。作者在模拟实验中展示了K选择方法的有效性,但没有为K的选择提供严格的统计理论保证(如相合性)。因此,论文的结论(“我们的方法有效”)在实证上成立,但其理论覆盖范围比声称的“第一个统计上合理的 OPE 方法”要窄——它依赖于一个在实践中需要额外处理的未知参数。 - 窄结论 2:理论结果假设潜因子模型是正确设定的(即真实 MDP 确实服从双线性形式)。如果模型误设,估计量的性质(如相合性)将不再有保证。作者在模拟实验中测试了对模型误设的稳健性(如非线性奖励),但没有提供理论上的稳健性分析。因此,论文的结论严格局限于其模型假设之内。
四、开放问题¶
- 潜因子维数
K的自适应选择:本文的理论依赖于K已知。一个自然的开放问题是:能否设计一个数据驱动的K选择方法(如基于信息准则、特征值比值、或交叉验证),并证明其选择的K能使得价值估计量达到最优的收敛速率?扎根于:定理 1 和 2 的陈述中“假设K已知”。 - 半参数效率界:本文给出了估计量的收敛速率,但未讨论其是否达到了半参数效率界。在给定的潜因子模型下,
V(π_e)的半参数效率界是什么?本文提出的 Model-free WDR 估计量是否达到了这个界?扎根于:作者在引言中引用了 Kallus & Uehara (2020) 关于平稳同质环境下 DR 估计量达到效率界的工作,但未在本文中讨论效率问题。 - 模型误设下的稳健性:本文的潜因子模型假设了双线性形式。一个更现实的开放问题是:当真实 MDP 偏离这个假设时(例如,存在高阶交互项),本文的方法表现如何?能否发展出对模型误设更鲁棒的 OPE 方法,例如通过使用更灵活的潜因子模型(如深度神经网络)或引入模型平均?扎根于:模拟实验中对模型误设的有限测试,以及作者在结论中提到的“未来工作可以探索更灵活的模型”。
- 计算与统计的权衡:本文的潜因子模型估计涉及非凸优化(张量分解)。是否存在一个计算上高效(如多项式时间)且统计上最优的算法?或者,是否存在一个统计-计算权衡(statistical-computational tradeoff),即为了获得多项式时间算法,必须牺牲统计效率(例如,需要更大的样本量)?扎根于:作者在引言中未讨论计算复杂性,且其使用的 ALS 算法只能保证收敛到局部最优。这与研究者感兴趣的“信息-计算差距”问题直接相关。
Maintained by 陈星宇 · Homepage · Source on GitHub