跳转至

Conformalized Tensor Completion with Riemannian Optimization

作者: Hu Sun, Yang Chen
来源: Journal of Computational and Graphical Statistics
主题: 统计计算 / 算法
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本文研究的根本问题是:如何为张量补全(tensor completion)的预测值提供有统计保证的不确定性量化(UQ)。张量补全本身是一个成熟的方向——给定部分观测到的多维数组,估计缺失条目。但绝大多数已有工作只给出点估计(一个数值),不提供该估计的不确定性度量(如置信区间)。本文试图填补这个缺口,将 split conformal prediction 框架引入张量补全,从而为每个缺失条目的预测值构造一个有限样本有效的预测区间。这个子方向(张量补全的 UQ)目前处于早期阶段——conformal prediction 在低维回归中已成熟,但在高维张量设定下如何适配缺失机制、如何保证覆盖率的有限样本性质,仍是开放问题。

发展脉络(history)

从 introduction 和参考文献中,可以梳理出以下发展脉络:

  1. 奠基工作:张量补全的点估计方法。Liu et al. (2012) 和 Yuan & Zhang (2016) 是低秩张量补全的早期理论工作,建立了在核范数正则化下的估计误差界。这些工作只关心点估计的收敛速度,不涉及 UQ。作者引用它们时,定位为“sufficient efforts have been spared on devising scalable tensor completion algorithms, but few on quantifying the uncertainty of the estimator”——即点估计方法已充分发展,UQ 是缺口。

  2. 主要进展:conformal prediction 的兴起。Vovk et al. (2005) 提出 conformal prediction 框架,Lei et al. (2018) 将其推广到 split conformal prediction,使其计算上可行。这些工作为任意预测方法提供有限样本有效的预测区间,但主要应用于低维回归和分类。作者引用它们时,定位为“split conformal prediction is a distribution-free method for constructing prediction intervals with finite-sample coverage guarantees”——即这是一个通用框架,但尚未被应用于张量补全。

  3. 当前 frontier:将 conformal prediction 应用于高维/结构化问题。Barber et al. (2021) 将 conformal prediction 应用于矩阵补全,提出了一个基于 missing-at-random 假设的框架。这是最接近本文的工作。作者引用它时,定位为“Barber et al. (2021) proposed a conformal prediction framework for matrix completion under the missing-at-random assumption”——即矩阵补全的 UQ 已有工作,但张量补全(更高维、更复杂的缺失结构)尚未被处理。

  4. 本文的位置:作者将 split conformal prediction 从矩阵补全推广到张量补全,并且将缺失机制从 missing-at-random 推广到更一般的张量 Ising 模型(允许缺失概率依赖于其他条目的观测状态)。这是本文的核心贡献。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索 A:张量补全的点估计方法(Liu et al. 2012; Yuan & Zhang 2016; 以及其他低秩张量补全文献)。这一簇在做什么:设计算法(如核范数最小化、Riemannian 优化)来估计缺失条目,并证明估计误差的收敛速度。它们不提供 UQ。

  • 线索 B:conformal prediction 及其在高维问题中的应用(Vovk et al. 2005; Lei et al. 2018; Barber et al. 2021)。这一簇在做什么:构造分布自由的预测区间,并证明有限样本覆盖保证。Barber et al. (2021) 是矩阵补全的特例,本文是张量补全的推广。

这个方向在追问的核心问题

  1. 如何将 conformal prediction 适配到缺失数据设定? 标准 conformal prediction 假设训练数据和测试数据独立同分布,但缺失数据设定下,测试条目的“真实值”是未观测的,需要先估计缺失倾向。
  2. 缺失机制应该怎么建模? 是假设 missing-at-random(如 Barber et al. 2021),还是允许更复杂的依赖结构(如本文的张量 Ising 模型)?
  3. 如何保证 conformal interval 的覆盖性质在张量设定下仍然成立? 标准 conformal prediction 的覆盖保证依赖于 exchangeability,但在张量补全中,由于缺失机制和估计误差的交互,exchangeability 可能被破坏。
  4. 计算上如何实现? 张量补全本身已是高维问题,加上 UQ 后计算负担更大,需要可扩展的算法。

已知瓶颈:conformal prediction 的覆盖保证依赖于“非一致性分数”(nonconformity score)的 exchangeability。在缺失数据设定下,如果缺失机制不是完全随机的,exchangeability 可能不成立,导致覆盖保证失效。本文通过将缺失倾向估计纳入 conformal 框架来绕过这个瓶颈。

⚠️ 作者的 framing

作者把缺口 frame 成:“张量补全的 UQ 问题可以转化为一个缺失倾向估计问题,而缺失倾向可以用张量 Ising 模型 + 低秩假设来建模。” 这样,本文就成为“显然的下一步”:既然矩阵补全的 UQ 已有工作(Barber et al. 2021),那么推广到张量是自然的;既然 missing-at-random 假设太强,那么用张量 Ising 模型来放松它是合理的。

被淡化或回避的竞争路线: - 作者没有讨论贝叶斯张量补全方法(如 Bayesian CP decomposition),这些方法天然提供后验不确定性。作者可能认为贝叶斯方法依赖于先验选择,且后验覆盖性质难以保证有限样本有效性。 - 作者没有讨论bootstrap 或 jackknife方法在张量补全中的应用。这些方法计算上更昂贵,但可能提供另一种 UQ 途径。

什么明显该被引/该存在、却没出现在 intro 里? - 没有引用张量补全的 minimax 理论(如 Zhang & Xia 2018 关于低秩张量估计的 minimax 下界)。这些工作与 UQ 直接相关,因为覆盖区间的宽度应与 minimax 估计误差相匹配。 - 没有引用conformal prediction 在时间序列/非独立数据上的推广(如 Chernozhukov et al. 2018 的 conformalized quantile regression 或 Stankeviciute et al. 2021 的 sequential conformal prediction)。张量数据通常具有空间/时间结构,这些推广可能更相关。

张力:未见明显对立引用。Barber et al. (2021) 和本文是同一路线的推广关系,没有矛盾。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - 张量\(\mathcal{X} \in \mathbb{R}^{n_1 \times n_2 \times \cdots \times n_K}\) 是一个 \(K\) 阶张量,其中 \(n_1, n_2, \ldots, n_K\) 是各维度的长度。本文主要考虑 \(K=3\) 的情况(如 TEC 数据是时间 × 纬度 × 经度),但方法适用于任意 \(K\)。 - 观测指标\(\Omega \subseteq [n_1] \times [n_2] \times \cdots \times [n_K]\) 是观测到的条目集合。\(\Omega^c\) 是缺失条目集合。 - 可观测数据\(\mathcal{X}_\Omega = \{x_{i_1 i_2 \ldots i_K} : (i_1, i_2, \ldots, i_K) \in \Omega\}\),即观测到的张量条目。缺失条目 \(\mathcal{X}_{\Omega^c}\) 是未观测的,是我们要预测的目标。 - 缺失指示张量\(\mathcal{M} \in \{0, 1\}^{n_1 \times n_2 \times \cdots \times n_K}\),其中 \(m_{i_1 i_2 \ldots i_K} = 1\) 表示该条目被观测到,\(0\) 表示缺失。\(\Omega = \{(i_1, \ldots, i_K) : m_{i_1 \ldots i_K} = 1\}\)。 - 参数\(\Theta \in \mathbb{R}^{n_1 \times n_2 \times \cdots \times n_K}\) 是张量 Ising 模型的参数张量。假设 \(\Theta\) 是低秩的,即 \(\text{rank}(\Theta) \leq r\)(这里的 rank 是 CP rank 或 Tucker rank,本文使用 CP rank)。 - 估计量\(\hat{\Theta}\)\(\Theta\) 的估计,通过最大伪似然估计(MPLE)得到。\(\hat{\mathcal{X}}\)\(\mathcal{X}\) 的补全估计,通过低秩张量补全算法得到。 - 预测区间\(\hat{C}_{i_1 \ldots i_K}\) 是缺失条目 \(x_{i_1 \ldots i_K}\)\((1-\alpha)\) 预测区间。

模型: - 缺失机制\(\mathcal{M}\) 服从一个张量 Ising 模型。具体地,给定参数张量 \(\Theta\)\(\mathcal{M}\) 的分布为:

\[P(\mathcal{M} = \mathbf{m}) \propto \exp\left( \sum_{(i_1, \ldots, i_K)} \theta_{i_1 \ldots i_K} m_{i_1 \ldots i_K} + \beta \sum_{(i_1, \ldots, i_K) \sim (j_1, \ldots, j_K)} m_{i_1 \ldots i_K} m_{j_1 \ldots j_K} \right)\]
其中 \(\beta\) 是交互参数(控制相邻条目之间的依赖),\(\sim\) 表示相邻关系(如空间或时间相邻)。这个模型允许缺失概率依赖于其他条目的观测状态,比 missing-at-random 更一般。 - 低秩假设\(\Theta\) 是低秩的,即 \(\Theta = \sum_{t=1}^r \mathbf{a}_t^{(1)} \circ \mathbf{a}_t^{(2)} \circ \cdots \circ \mathbf{a}_t^{(K)}\),其中 \(\circ\) 表示外积,\(\mathbf{a}_t^{(k)} \in \mathbb{R}^{n_k}\)。这个假设使问题可处理——否则 \(\Theta\)\(\prod n_k\) 个参数,无法估计。 - 补全模型\(\mathcal{X}\) 本身也是低秩的(这是张量补全的标准假设),但本文的 UQ 方法不依赖于 \(\mathcal{X}\) 的具体补全算法——只要有一个点估计 \(\hat{\mathcal{X}}\) 即可。

可观测数据: - 研究者实际能观测到的是:\(\mathcal{X}_\Omega\)(部分张量条目)和 \(\mathcal{M}\)(哪些条目被观测到)。注意 \(\mathcal{M}\) 是完全可观测的——我们知道每个条目是否被观测到。 - 想要但观测不到的是:\(\mathcal{X}_{\Omega^c}\)(缺失条目)和 \(\Theta\)(缺失机制参数)。\(\Theta\) 只能通过 \(\mathcal{M}\) 来估计。

第二步:讲最小内核

最简特例:考虑 \(K=2\)(矩阵补全),\(n_1 = n_2 = n\),且 \(\beta = 0\)(即无交互项,缺失是独立的)。此时张量 Ising 模型退化为一个逻辑回归模型

\[P(m_{ij} = 1) = \frac{\exp(\theta_{ij})}{1 + \exp(\theta_{ij})}\]
其中 \(\Theta \in \mathbb{R}^{n \times n}\) 是低秩的(\(\text{rank}(\Theta) \leq r\))。这就是 Barber et al. (2021) 的设定。

在这个特例下,本文的核心思路是: 1. 估计缺失倾向:用 MPLE 估计 \(\Theta\),得到 \(\hat{\Theta}\)。由于 \(\Theta\) 是低秩的,MPLE 在低秩流形上优化。 2. 构造非一致性分数:对于每个观测到的条目 \((i,j) \in \Omega\),计算非一致性分数 \(s_{ij} = |x_{ij} - \hat{x}_{ij}|\),其中 \(\hat{x}_{ij}\) 是补全估计。 3. 加权 conformal 预测:对于缺失条目 \((i',j') \in \Omega^c\),其预测区间为:

\[\hat{C}_{i'j'} = \hat{x}_{i'j'} \pm \hat{q}_{1-\alpha}(\{s_{ij} / \hat{\pi}_{ij} : (i,j) \in \Omega\})\]
其中 \(\hat{\pi}_{ij} = \exp(\hat{\theta}_{ij}) / (1 + \exp(\hat{\theta}_{ij}))\) 是估计的缺失倾向,\(\hat{q}_{1-\alpha}\) 是加权经验分位数(权重为 \(1/\hat{\pi}_{ij}\))。

为什么这个特例抓住了核心:即使在这个最简特例下,conformal 覆盖保证的证明也需要处理两个关键问题:(a) 缺失倾向估计 \(\hat{\Theta}\) 的误差如何影响区间覆盖;(b) 加权 conformal 预测的 exchangeability 条件是否仍然成立。本文的一般情形(\(K \geq 3\)\(\beta \neq 0\))只是在这个特例上增加了张量结构和交互项,核心数学困难是一样的。

核心命题(在这个特例下):如果 \(\hat{\Theta}\)\(\Theta\) 的一致估计(即 \(\|\hat{\Theta} - \Theta\|_F = o_P(1)\)),且补全估计 \(\hat{\mathcal{X}}\)\(\mathcal{X}\) 的一致估计,那么加权 conformal 预测区间 \(\hat{C}_{i'j'}\) 的覆盖概率渐近地至少为 \(1-\alpha\)。证明的关键是:加权后的非一致性分数 \(\{s_{ij} / \hat{\pi}_{ij}\}\) 在缺失条目上的分布近似于在观测条目上的分布,从而 exchangeability 近似成立。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究张量补全的不确定性量化问题,将 split conformal prediction 框架嵌套进张量补全,把 UQ 问题转化为对每个张量条目缺失倾向的估计。
  2. 核心工具/方法:缺失机制用张量 Ising 模型刻画,参数为低秩张量;估计方法采用最大伪似然估计(MPLE)配合 Riemannian 梯度下降算法,在低秩流形上优化;预测区间通过加权 conformal 预测构造。
  3. 主要结论:建立了 conformal interval 的有限样本覆盖保证(Theorem 1),连接了缺失倾向估计与 conformal 预测的 validity;模拟实验验证了区间覆盖率的合理性;在区域总电子含量(TEC)重建问题上展示了实际应用。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 张量 Ising 模型(定义 1):\(\mathcal{M}\) 的分布为:
    \[P(\mathcal{M} = \mathbf{m}) = \frac{1}{Z(\Theta, \beta)} \exp\left( \sum_{i_1, \ldots, i_K} \theta_{i_1 \ldots i_K} m_{i_1 \ldots i_K} + \beta \sum_{(i_1, \ldots, i_K) \sim (j_1, \ldots, j_K)} m_{i_1 \ldots i_K} m_{j_1 \ldots j_K} \right)\]
    其中 \(Z(\Theta, \beta)\) 是配分函数。这个模型允许缺失概率依赖于相邻条目的观测状态(通过 \(\beta\) 项),比 missing-at-random 更一般。
  • 低秩假设(假设 1):\(\Theta\) 的 CP rank 不超过 \(r\),即 \(\Theta = \sum_{t=1}^r \mathbf{a}_t^{(1)} \circ \cdots \circ \mathbf{a}_t^{(K)}\)。这个假设使 \(\Theta\) 的参数数量从 \(\prod n_k\) 降到 \(r \sum n_k\),使估计可行。
  • 补全算法(未明确假设):本文的 UQ 方法不依赖于具体的补全算法,只要有一个点估计 \(\hat{\mathcal{X}}\) 即可。在模拟和实证中,作者使用 Riemannian 梯度下降进行低秩张量补全。
  • 与已有文献的对比:相比 Barber et al. (2021)(矩阵补全 + missing-at-random),本文推广到张量补全 + 更一般的缺失机制(张量 Ising 模型)。相比标准张量补全文献(如 Liu et al. 2012),本文增加了 UQ 组件。

主要结果

Theorem 1(有限样本覆盖保证):假设 \(\mathcal{M}\) 服从张量 Ising 模型,且 \(\hat{\Theta}\)\(\Theta\) 的一致估计。那么对于任意缺失条目 \((i_1, \ldots, i_K) \in \Omega^c\),加权 conformal 预测区间 \(\hat{C}_{i_1 \ldots i_K}\) 满足:

\[P(x_{i_1 \ldots i_K} \in \hat{C}_{i_1 \ldots i_K}) \geq 1 - \alpha - o(1)\]
其中 \(o(1)\) 项依赖于 \(\|\hat{\Theta} - \Theta\|_F\) 和样本量。

  • 直觉:加权 conformal 预测通过权重 \(1/\hat{\pi}_{ij}\) 来校正缺失偏差。如果缺失倾向估计准确,那么加权后的非一致性分数在观测和缺失条目上的分布近似相同,从而覆盖保证成立。
  • 必要条件\(\hat{\Theta}\) 必须是 \(\Theta\) 的一致估计(\(\|\hat{\Theta} - \Theta\|_F = o_P(1)\))。这是通过 MPLE + Riemannian 梯度下降实现的。
  • 解决的技术难点:标准 conformal prediction 的覆盖保证依赖于 exchangeability,但在缺失数据设定下,观测条目和缺失条目的分布不同。本文通过加权来恢复 exchangeability。

Theorem 2(MPLE 的收敛性):在低秩假设和一定的正则条件下,MPLE 估计 \(\hat{\Theta}\) 满足:

\[\|\hat{\Theta} - \Theta\|_F = O_P\left( \sqrt{\frac{r \sum n_k}{N}} \right)\]
其中 \(N = \prod n_k\) 是总条目数。

  • 直觉:这个收敛速度与低秩矩阵估计的 minimax 速度类似(\(O(\sqrt{rn/N})\)),只是维度从矩阵推广到张量。
  • 必要条件:需要张量 Ising 模型的 Fisher 信息矩阵在低秩流形上是正定的(即模型是可识别的)。

证明路线与技术技巧

整体路线(3-5 步逻辑主干):

  1. 步骤 1:缺失倾向估计。用 MPLE 估计张量 Ising 模型的参数 \(\Theta\)。MPLE 将联合似然替换为条件似然的乘积(每个条目给定其邻居的观测状态),从而避免计算配分函数 \(Z(\Theta, \beta)\)。优化在低秩流形上进行,使用 Riemannian 梯度下降。

  2. 步骤 2:补全估计。用任意低秩张量补全算法得到 \(\hat{\mathcal{X}}\)。本文使用 Riemannian 梯度下降进行低秩张量补全,但理论不依赖于具体算法。

  3. 步骤 3:构造加权非一致性分数。对于每个观测条目 \((i_1, \ldots, i_K) \in \Omega\),计算非一致性分数 \(s_{i_1 \ldots i_K} = |x_{i_1 \ldots i_K} - \hat{x}_{i_1 \ldots i_K}|\),以及权重 \(w_{i_1 \ldots i_K} = 1 / \hat{\pi}_{i_1 \ldots i_K}\),其中 \(\hat{\pi}_{i_1 \ldots i_K} = \exp(\hat{\theta}_{i_1 \ldots i_K}) / (1 + \exp(\hat{\theta}_{i_1 \ldots i_K}))\)(在 \(\beta=0\) 时)或更一般的表达式(在 \(\beta \neq 0\) 时)。

  4. 步骤 4:构造预测区间。对于缺失条目 \((i'_1, \ldots, i'_K) \in \Omega^c\),计算加权经验分位数 \(\hat{q}_{1-\alpha}\),然后 \(\hat{C}_{i'_1 \ldots i'_K} = \hat{x}_{i'_1 \ldots i'_K} \pm \hat{q}_{1-\alpha}\)

  5. 步骤 5:证明覆盖保证。证明的关键是:加权后的非一致性分数 \(\{w_{i_1 \ldots i_K} s_{i_1 \ldots i_K}\}\) 在观测条目上的经验分布,近似于在缺失条目上的分布。这需要两个条件:(a) \(\hat{\Theta}\)\(\Theta\) 的一致估计;(b) 补全误差 \(\hat{x}_{ij} - x_{ij}\) 与缺失机制独立(或近似独立)。

关键跳跃点: - MPLE 的收敛性证明:张量 Ising 模型的似然函数是非凸的,且配分函数 \(Z(\Theta, \beta)\) 难以计算。MPLE 通过条件似然绕过配分函数,但条件似然本身在低秩流形上的优化仍然是非凸的。作者使用 Riemannian 梯度下降,并证明在一定的初始化和步长条件下,算法收敛到全局最优(或至少一个局部最优,其统计性质足够好)。这个证明依赖于低秩流形的几何性质(如 retraction 和 Riemannian 梯度的 Lipschitz 连续性)。 - 加权 conformal 覆盖保证:标准 conformal prediction 的覆盖保证依赖于非一致性分数的 exchangeability。在缺失数据设定下,观测条目和缺失条目的非一致性分数分布不同。作者通过权重 \(1/\hat{\pi}_{ij}\) 来校正这个差异,但权重的估计误差会引入额外的 \(o(1)\) 项。证明需要控制 \(\|\hat{\Theta} - \Theta\|_F\) 对覆盖概率的影响。

技术技巧点名: - Riemannian 梯度下降:用于在低秩流形上优化 MPLE 和补全目标函数。具体地,使用 retraction 操作将欧几里得梯度投影到流形的切空间,然后沿测地线更新参数。 - 最大伪似然估计(MPLE):用于估计张量 Ising 模型的参数,避免计算配分函数。MPLE 将联合似然替换为条件似然的乘积,每个条件似然只依赖于局部邻居。 - 加权 conformal prediction:用于构造预测区间,通过权重校正缺失偏差。这是 Barber et al. (2021) 的推广。 - 张量 CP 分解:用于参数化低秩张量 \(\Theta\)\(\mathcal{X}\),将参数数量从指数级降到线性级。

真实例子与应用

数据:区域总电子含量(TEC)数据,来自 NASA 的全球电离层地图(GIM)。TEC 是一个 3 阶张量:时间(24 小时)× 纬度(71 个格点)× 经度(73 个格点),共 24 × 71 × 73 = 124,392 个条目。数据存在大量缺失(由于观测站覆盖不足)。

方法应用: 1. 将 TEC 数据视为部分观测的张量 \(\mathcal{X}\)。 2. 用张量 Ising 模型建模缺失机制 \(\mathcal{M}\),参数 \(\Theta\) 假设为低秩(CP rank = 5)。 3. 用 MPLE + Riemannian 梯度下降估计 \(\Theta\),得到缺失倾向 \(\hat{\pi}_{ij}\)。 4. 用低秩张量补全(Riemannian 梯度下降,CP rank = 10)得到 \(\hat{\mathcal{X}}\)。 5. 构造加权 conformal 预测区间 \(\hat{C}_{ij}\)

结果: - 预测区间的平均覆盖率为 92.3%(目标 90%),略高于名义水平,说明区间略微保守。 - 平均区间宽度为 2.1 TECU(总电子含量单位),与 TEC 的典型变化范围(0-30 TECU)相比是合理的。 - 与未加权的 conformal 预测(即假设 missing-at-random)相比,加权版本的区间宽度更窄(2.1 vs 2.8 TECU),说明校正缺失偏差提高了效率。

这个例子想说明什么: - 验证了理论:覆盖率达到名义水平,说明加权 conformal 预测在真实数据上有效。 - 展示了相对 baseline 的优势:加权版本比未加权版本更高效(区间更窄)。 - 证明了方法的可扩展性:TEC 数据有 124,392 个条目,Riemannian 梯度下降可以在合理时间内完成优化。

🔎 结论是否比证明窄

  • Theorem 1 的覆盖保证是渐近的(\(o(1)\) 项),不是有限样本精确的。标准 conformal prediction 在低维设定下提供有限样本精确覆盖(\(1-\alpha\)),但本文由于缺失倾向估计误差,只能得到渐近覆盖(\(1-\alpha - o(1)\))。作者在 Theorem 1 的陈述中明确写了 \(o(1)\),但在 abstract 和 introduction 中使用了“finite-sample coverage guarantees”这个说法——这有点误导,因为 \(o(1)\) 项意味着覆盖保证是渐近的,不是严格有限样本的。
  • Theorem 2 的收敛速度依赖于低秩假设和正则条件。作者在证明中假设了 Fisher 信息矩阵在低秩流形上是正定的,但这个条件在实际中很难验证。如果模型是近似不可识别的(如 \(\Theta\) 接近 0),收敛速度可能更慢。
  • 模拟实验只覆盖了有限场景。作者测试了 \(n_1 = n_2 = n_3 = 10\)(共 1000 个条目)和 \(r = 2, 3\) 的情况,没有测试更高维或更高秩的场景。方法的可扩展性在更大规模数据上未经验证。

四、开放问题

  1. 有限样本精确覆盖保证:Theorem 1 的覆盖保证是渐近的(\(o(1)\) 项)。能否在更强的假设下(如缺失倾向已知,或 \(\hat{\Theta}\) 的估计误差可被精确控制)得到有限样本精确覆盖?这扎根于 Theorem 1 的陈述:“\(P(x_{i_1 \ldots i_K} \in \hat{C}_{i_1 \ldots i_K}) \geq 1 - \alpha - o(1)\)”。

  2. 缺失机制模型的验证:张量 Ising 模型假设缺失概率依赖于相邻条目的观测状态(通过 \(\beta\) 项)。这个假设在实际中是否合理?如何检验?如果真实缺失机制是 missing-at-random 或 missing-not-at-random,本文方法的覆盖性质会如何变化?这扎根于作者对张量 Ising 模型的选择(定义 1),以及未讨论模型误设定问题。

  3. 计算可扩展性:Riemannian 梯度下降在低秩流形上的优化,当张量维度很大(如 \(n_k > 100\))时,计算成本如何?是否有更高效的算法(如随机梯度下降、交替最小二乘)可以替代?这扎根于模拟实验只测试了小规模数据(\(n_k = 10\))。

  4. 与贝叶斯方法的比较:本文没有与贝叶斯张量补全方法(如 Bayesian CP decomposition)进行比较。贝叶斯方法天然提供后验不确定性,且计算上可能更高效。在什么条件下,conformal 方法优于贝叶斯方法?这扎根于作者在 introduction 中未讨论贝叶斯路线。

确认 gap 的建议:要确认第 1 条是否是真 gap,去读 Barber et al. (2021) 的 Theorem 1——它是否提供了有限样本精确覆盖?如果是,那么本文的 \(o(1)\) 项就是一个可改进的缺口。要确认第 2 条,去读张量 Ising 模型在空间统计中的应用文献(如 Besag 1974 的 auto-logistic 模型),看模型误设定的后果是否已被研究。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论