跳转至

Tensor-normal maximum likelihood estimation at the operator-norm sample threshold

作者: Hengzhi He, Guang Cheng
主题: 高维统计 / 随机矩阵
相关性: 7/10
链接: https://arxiv.org/abs/2608.10488


一、领域脉络与小综述

这个方向是什么

本方向研究张量正态分布(Tensor Normal Distribution)的协方差矩阵最大似然估计(MLE)。给定独立同分布的高斯张量观测值 \(X_i \in \mathbb{R}^{d_1} \otimes \cdots \otimes \mathbb{R}^{d_k}\),其协方差矩阵被假设为 Kronecker 乘积结构:\(\text{Cov}(X_i) = \Sigma_1 \otimes \cdots \otimes \Sigma_k\),其中每个 \(\Sigma_a \in \text{PD}(d_a)\) 是未知的正定因子协方差矩阵。核心问题是:在无稀疏性、无条件数假设的条件下,需要多少样本才能保证 MLE 存在唯一,并给出因子协方差矩阵的估计误差界?该问题处于高维统计、随机矩阵理论与信息几何的交叉点,当前成熟度属于活跃前沿——已有精确代数存在性分类,但非渐近有限样本保证仍在快速发展中。

发展脉络

  1. 奠基工作:代数存在性分类
    Drton, Kuriki & Hoff (2021) 通过矩阵束(matrix pencils)和 quiver 表示理论,给出了矩阵正态 MLE 几乎必然存在唯一的精确样本量阈值。Derksen & Makam (2021) 和 Derksen, Makam & Walter (2022) 进一步将这一分类推广到张量正态模型,利用 castling 变换和不变理论给出了完整的代数刻画。这些工作回答了“MLE 何时存在”的精确代数问题,但未提供非渐近的估计误差界或有限样本定位。

  2. 主要进展:非渐近保证与测地凸性
    Franks, Oliveira, Ramachandran & Walter (2026) 是本文的直接前驱。他们利用正定矩阵的仿射不变几何和随机完全正映射(random completely positive maps)的展开,首次建立了无条件数假设的有限样本保证。其张量结果要求样本阈值 \(nD \gtrsim k^2 d_{\max}^3\)(其中 \(D = \prod_a d_a\),\(d_{\max} = \max_a d_a\)),并给出了接近最优的 Fisher-Rao 误差率。他们明确将能否将阈值降低到 \(nD \gtrsim k^2 d_{\max}^2\) 列为公开问题(Section 6)。该工作的核心工具是随机 Gram 界(random Gram bound)和 scaling-flow 分析。

  3. 当前 frontier:算子范数阈值与最优性
    本文(He & Cheng, 2026)正面回答了上述公开问题,证明 \(nD \gtrsim k^2 d_{\max}^2\) 足以保证 MLE 存在唯一并达到接近最优的误差率。证明路线与 Franks et al. 不同:它保留了随机 Gram 事件在整个 Lie 代数上的形式(而非仅对称切空间),通过精确共轭将其运输到固定 Thompson 球,再结合约束 MLE 的灵敏性和等变 Kirszbraun 延拓。这一结果将样本阈值从立方尺度降到平方尺度,匹配了信息论下界对 \(d_{\max}\) 的依赖。

  4. 并行路线:替代估计量与渐近几何
    McCormack & Hoff (2025) 和 Drton, Grosdos & McCormack (2024) 研究了 Kronecker 协方差的其他估计量(如 partial trace 估计量)及其渐近行为,包括高维一致性(“维数祝福”现象)和有理 MLE 的代数性质。这些工作侧重于渐近几何和计算,而非非渐近有限样本保证。

子线索聚类

  • 线索 A:代数存在性分类(Drton et al., 2021; Derksen & Makam, 2021; Derksen et al., 2022)
    使用 quiver 表示、castling 变换和不变理论,给出 MLE 存在唯一的精确代数阈值。不提供误差界。

  • 线索 B:非渐近有限样本保证(Franks et al., 2026; He & Cheng, 2026)
    使用随机矩阵理论、测地凸性和信息几何,建立无条件数假设的 MLE 误差界。本文属于此线索,并改进了样本阈值。

  • 线索 C:替代估计量与渐近几何(McCormack & Hoff, 2025; Drton et al., 2024)
    研究 partial trace 估计量、有理 MLE 等,侧重于渐近效率和高维一致性。与 MLE 的有限样本保证互补。

  • 线索 D:鲁棒协方差估计(Soloveychik & Wiesel, 2014; Sun et al., 2016)
    在椭圆分布下研究带结构约束的 Tyler's M-estimator,强调鲁棒性和计算。与本文的 Gaussian Kronecker MLE 设定不同。

核心追问问题

  1. 样本阈值:需要多少样本才能保证 MLE 存在唯一?阈值对 \(d_{\max}\) 的最优依赖是 \(d_{\max}^2\) 还是 \(d_{\max}^3\)?
  2. 误差率:MLE 在 Fisher-Rao 度量和 Thompson 度量下的最优收敛速度是多少?
  3. 算法收敛:flip-flop 迭代算法在最优样本阈值下是否仍线性收敛?
  4. 推广性:该定位原理能否推广到其他由群作用生成的高斯模型?

⚠️ 作者的 framing

作者将缺口 frame 为:Franks et al. (2026) 的样本阈值 \(nD \gtrsim k^2 d_{\max}^3\) 能否改进到 \(nD \gtrsim k^2 d_{\max}^2\)? 他们声称这一改进是“统计而非装饰性的”(the distinction is statistical rather than cosmetic),因为立方尺度是常数 Frobenius 误差的阈值,而平方尺度是常数算子范数误差的自然阈值。作者淡化了以下竞争路线: - 代数分类路线(Derksen et al., 2022)被定位为“不提供非渐近定位或误差界”,但未讨论其精确阈值是否可能比本文的充分条件更紧。 - scaling-flow 分析(Franks et al., 2026 的核心工具)被明确回避,作者指出“∞-expansion 方法需要沿 scaling trajectory 的算子范数误差的一致控制,而这对于成对完全正映射不可用”。 - 鲁棒估计路线(Soloveychik & Wiesel, 2014; Sun et al., 2016)被定位为“针对椭圆或重尾分布,强调鲁棒性和计算”,与本文的 Gaussian 设定不同。

值得研究者去查的问题:本文未引用任何关于张量 U-统计量计算复杂度(如 treewidth / tensor contraction / einsum)的文献。考虑到研究者本人的工作,这是一个明显的空白——张量正态 MLE 的 flip-flop 迭代本质上涉及张量收缩,其计算成本是否可以用 tensor-network 复杂度刻画?本文的算子范数集中技术是否能为张量 U-统计量的误差传播提供新工具?

张力

未见明显对立引用。Franks et al. (2026) 和本文的结果是兼容的(后者改进了前者的阈值),代数分类路线和非渐近路线是互补的。McCormack & Hoff (2025) 的 partial trace 估计量与 MLE 的比较是渐近效率层面的,不直接矛盾。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(X_i \in \mathbb{R}^{d_1} \otimes \cdots \otimes \mathbb{R}^{d_k}\):第 \(i\) 个观测张量,\(i = 1, \dots, n\)。 - \(d_a\):第 \(a\) 个模式的维度,\(a = 1, \dots, k\)。 - \(D = \prod_{a=1}^k d_a\):张量的总元素数(即向量化后的维度)。 - \(d_{\max} = \max_a d_a\):最大模式维度。 - \(M = nD\):总样本量(观测数 × 每个观测的维度)。 - \(\Sigma_a \in \text{PD}(d_a)\):第 \(a\) 个模式的因子协方差矩阵(正定)。 - \(\Theta_a = \Sigma_a^{-1}\):第 \(a\) 个模式的因子精度矩阵。 - \(\Theta = \Theta_1 \otimes \cdots \otimes \Theta_k\):全精度矩阵(\(D \times D\))。 - \(\rho_x = \frac{1}{M} \sum_{i=1}^n x_i x_i^T\):样本二阶矩矩阵(\(D \times D\)),其中 \(x_i = \text{vec}(X_i)\) 是向量化的观测。 - \(\text{PD}(d)\):\(d \times d\) 正定矩阵锥。 - \(\text{Sym}_0(d) = \{A \in \mathbb{R}^{d \times d} : A = A^T, \text{tr} A = 0\}\):迹零对称矩阵空间。 - \(\text{Mat}_0(d; \mathbb{R}) = \{A \in \mathbb{R}^{d \times d} : \text{tr} A = 0\}\):迹零矩阵空间(不一定对称)。 - \(d_{\text{FR}}(A, B) = \frac{1}{\sqrt{2}} \| \log(A^{-1/2} B A^{-1/2}) \|_F\):Fisher-Rao 距离。 - \(d_{\text{op}}(A, B) = \| \log(A^{-1/2} B A^{-1/2}) \|_{\text{op}}\):Thompson 距离(算子范数)。 - \(d(\Theta, \Theta') = \sqrt{2/D} \, d_{\text{FR}}(\Theta, \Theta')\):归一化的仿射不变距离(本文使用)。

模型:

\[X_i \sim \mathcal{N}(0, \Sigma_1 \otimes \cdots \otimes \Sigma_k), \quad i = 1, \dots, n,\]
其中 \(\Sigma_a \in \text{PD}(d_a)\) 未知。等价地,向量化后的观测 \(x_i = \text{vec}(X_i) \sim \mathcal{N}(0, \Sigma_1 \otimes \cdots \otimes \Sigma_k)\)。因子协方差矩阵仅可识别到公共缩放因子,本文使用规范约定:\(\det(\Theta_a)^{1/d_a}\) 对所有 \(a\) 相同。

可观测数据: - 研究者实际能观测到的是 \(n\) 个张量 \(X_1, \dots, X_n\)(或等价地,\(n\) 个 \(D\) 维向量 \(x_1, \dots, x_n\))。 - 想要但观测不到的是因子协方差矩阵 \(\Sigma_1, \dots, \Sigma_k\)(或精度矩阵 \(\Theta_1, \dots, \Theta_k\))。这些只能通过 Kronecker 结构假设和 MLE 来识别和估计。

第二步:最小内核

最简特例:\(k=2\)(矩阵正态模型),且 \(d_1 = d_2 = d\)(平衡情形)。

在这个特例下,模型退化为:

\[X_i \in \mathbb{R}^{d \times d}, \quad X_i \sim \mathcal{N}(0, \Sigma_1 \otimes \Sigma_2), \quad i = 1, \dots, n.\]
这里 \(D = d^2\),\(d_{\max} = d\),\(M = n d^2\)。Franks et al. (2026) 的阈值是 \(n d^2 \gtrsim k^2 d^3 = 4 d^3\),即 \(n \gtrsim 4d\)。本文的阈值是 \(n d^2 \gtrsim k^2 d^2 = 4 d^2\),即 \(n \gtrsim 4\)(常数!)。

核心数学问题:在 \(n\) 为常数(如 \(n=4\))而 \(d\) 很大的情况下,能否保证 MLE 存在唯一并给出误差界?

为什么这是最小内核:因为 Franks et al. (2026) 的立方阈值 \(d_{\max}^3\) 在平衡情形下意味着 \(n\) 必须随 \(d\) 增长(\(n \gtrsim 4d\)),而平方阈值 \(d_{\max}^2\) 意味着 \(n\) 可以是常数。这一改进的统计意义在于:对于大维度的张量,即使只有少量观测(如 \(n=4\)),MLE 仍然有效。

在这个特例下,证明的核心思路: 1. 全 Lie 代数 Gram 界:在 \(k=2\) 情形下,Lie 代数 \(\mathfrak{g} = \mathbb{R} \oplus \text{Mat}_0(d; \mathbb{R}) \oplus \text{Mat}_0(d; \mathbb{R})\)。Lemma 1 证明,当 \(M = n d^2 \geq C k^2 d_{\max}^2 = 4C d^2\)(即 \(n \geq 4C\))时,随机 Gram 算子 \(E_x(Z) = \frac{1}{M} \sum_{i=1}^n \|K_Z x_i\|_2^2\) 在 \(\mathfrak{g}\) 上一致有界(\(\lambda_0 \|Z\|^2 \leq E_x(Z) \leq L_0 \|Z\|^2\))。关键点是:这个界对非对称的 \(Z_a\) 也成立(因为 Franks et al. 的 Theorem C.1 实际上是在整个 \(\text{Mat}_0(d; \mathbb{R})\) 上陈述的,尽管他们只用了对称部分)。 2. 运输到固定 Thompson 球:通过精确共轭(Lemma 2),将身份处的 Gram 界运输到半径为 \(R=1\) 的 Thompson 球 \(C_R\) 上,得到 Hessian 的一致上下界(\(\lambda_R I \preceq \text{Hess} f_x(\Theta) \preceq L_R I\))。运输损失仅为常数因子 \(e^{\pm 3R}\),不依赖于 \(d\) 或 \(k\)。 3. 约束 MLE 的 Lipschitz 性质:在 \(C_R\) 上最小化负对数似然,得到约束 MLE \(\theta_x\)。Lemma 3 证明 \(\theta_x\) 作为数据 \(x\) 的函数是 \(O(1/\sqrt{M})\)-Lipschitz 的(在仿射不变距离下)。 4. 等变算子范数定位:利用 Kirszbraun 延拓和正交群平均,将因子对数映射 \(F_a(\theta_x)\) 延拓为全局定义的、零均值的 Lipschitz 函数。高斯浓度不等式给出 \(F_a(\theta_x)\) 的算子范数界 \(O(d_a / \sqrt{M})\)。 5. 验证约束非活跃:梯度界(2.9)和强凸性给出 \(d(I_D, \theta_x) \leq O(\sqrt{k} d_{\max} / \sqrt{M})\),结合因子对数界证明 \(\theta_x\) 严格在 \(C_R\) 内部,因此等于无约束 MLE。

为什么这个特例抓住了本质:因为 \(k=2\) 且 \(d_1 = d_2\) 时,所有技术困难(非对称切空间、成对交叉项、算子范数集中)都已出现,而维度参数最少。一般 \(k \geq 3\) 的情形只是多了更多模式对和更大的常数因子 \(k^2\),证明结构完全相同。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:张量正态分布 MLE 的样本阈值能否从 Franks et al. (2026) 的 \(nD \gtrsim k^2 d_{\max}^3\) 降低到算子范数尺度 \(nD \gtrsim k^2 d_{\max}^2\)。
  2. 核心工具/方法:全 Lie 代数随机 Gram 界、精确共轭运输、约束 MLE 的 Lipschitz 灵敏性、等变 Kirszbraun 延拓、高斯浓度不等式。
  3. 主要结论:当 \(nD \geq C k^2 d_{\max}^2 t^2\) 时,MLE 以高概率存在唯一,全精度 Fisher-Rao 误差 \(O(\sqrt{k} d_{\max} / \sqrt{n})\),最大因子的 Thompson 误差 \(O(d_{\max} / \sqrt{nD})\),匹配高斯极小极大下界(至多 \(\sqrt{k}\) 因子)。

关键设定与假设

  • 设定:独立同分布高斯张量 \(X_i \sim \mathcal{N}(0, \Sigma_1 \otimes \cdots \otimes \Sigma_k)\),\(\Sigma_a \in \text{PD}(d_a)\) 未知。无稀疏性、无条件数假设、无 warm start。
  • 假设:
  • \(d_a \geq 2\)(单维模式可移除)。
  • 因子精度矩阵 \(\Theta_a = \Sigma_a^{-1}\) 使用规范约定(\(\det(\Theta_a)^{1/d_a}\) 相同)。
  • 样本量条件:\(M = nD \geq C k^2 d_{\max}^2 t^2\),其中 \(C\) 是通用常数,\(t \geq 1\) 是置信参数。
  • 相比已有文献的放宽:相比 Franks et al. (2026),样本阈值从 \(d_{\max}^3\) 降到 \(d_{\max}^2\);相比代数分类工作(Derksen et al., 2022),提供了非渐近误差界而非仅存在性。

主要结果

定理 1(核心结果):在 \(M \geq C k^2 d_{\max}^2 t^2\) 下,以概率至少 \(1 - C k e^{-c M/(k d_{\max})} - \sum_{a<b} p_{ab} - C k e^{-c t^2 d_{\max}}\),MLE 存在唯一且: - 全精度 Fisher-Rao 误差:\(d_{\text{FR}}(\hat{\Theta}, \Theta) \leq C \sqrt{k} d_{\max} t / \sqrt{n}\)。 - 因子 Fisher-Rao 误差:\(d_{\text{FR}}(\hat{\Theta}_a, \Theta_a) \leq C \sqrt{k d_a} d_{\max} t / \sqrt{nD}\)。 - 最大因子 Thompson 误差:\(d_{\text{op}}(\hat{\Theta}_a, \Theta_a) \leq C d_{\max} t / \sqrt{nD}\)(对 \(d_a = d_{\max}\))。

推论 1(因子 Thompson 界):对所有模式 \(a\),\(d_{\text{op}}(\hat{\Theta}_a, \Theta_a) \leq C t (d_a + d_{\max}/\sqrt{k}) / \sqrt{nD}\)。

命题 1(信息论下界):即使所有其他因子已知,估计单个因子的 Thompson 误差下界为 \(\Omega(d_a / \sqrt{nD})\),Fisher-Rao 误差下界为 \(\Omega(d_a^{3/2} / \sqrt{nD})\)。因此定理 1 对最大因子的 Thompson 界是最优的(至多常数因子)。

证明路线与技术技巧

整体路线(5 步逻辑主干):

  1. 全 Lie 代数 Gram 事件(Lemma 1):证明在 \(M \geq C k^2 d_{\max}^2\) 下,随机 Gram 算子 \(E_x(Z) = \frac{1}{M} \sum_{i=1}^n \|K_Z x_i\|_2^2\) 在 \(\mathfrak{g} = \mathbb{R} \oplus \bigoplus_{a=1}^k \text{Mat}_0(d_a; \mathbb{R})\) 上一致有界。关键:Franks et al. 的 Theorem C.1 实际上是对整个 \(\text{Mat}_0(d; \mathbb{R})\) 陈述的(尽管他们只用了对称部分),因此可以直接复用。交叉项通过块 Gershgorin 估计控制。

  2. 运输到固定 Thompson 球(Lemma 2):通过精确共轭 \(K_{H_G} = G K_Z G^{-1}\),将身份处的 Gram 界运输到半径为 \(R=1\) 的 Thompson 球 \(C_R\) 上。关键跳跃:运输损失仅为常数因子 \(e^{\pm 3R}\),不依赖于 \(d\) 或 \(k\),因为共轭是精确的而非近似的。这避免了 Franks et al. 的 scaling-flow 分析所需的逐点控制。

  3. 约束 MLE 的 Lipschitz 性质(Lemma 3):在 \(C_R\) 上最小化负对数似然,得到约束 MLE \(\theta_x\)。利用强测地凸性和变分不等式,证明 \(d(\theta_x, \theta_y) \leq C_R \|x - y\|_2 / \sqrt{M}\)。关键技巧:使用 Hessian 的上下界和沿测地线的导数估计。

  4. 等变算子范数定位(Section 6):

  5. 将因子对数映射 \(F_a(\theta_x)\) 延拓为全局 Lipschitz 函数(Kirszbraun 定理)。
  6. 通过正交群平均使其等变且零均值。
  7. 高斯浓度不等式给出 \(P(|u^T F_a(\theta_x) u| > s) \leq 2 \exp(-c M s^2 / d_a)\)。
  8. 球面 \(\varepsilon\)-net 给出算子范数界 \(O(d_a / \sqrt{M})\)。

  9. 验证约束非活跃(Section 7):梯度界和强凸性给出 \(d(I_D, \theta_x) \leq O(\sqrt{k} d_{\max} / \sqrt{M})\),结合因子对数界证明 \(\theta_x\) 严格在 \(C_R\) 内部,因此等于无约束 MLE。

关键跳跃点: - Lemma 1 的交叉项控制:成对交叉项 \(\text{tr}\{\rho_x^{(ab)} (Z_a^T \otimes Z_b)\}\) 需要控制 \(\Phi_{ab}(K) = \frac{1}{M} \sum_{r=1}^N A_r K A_r^T\) 的算子范数。Franks et al. 的 Theorem C.1 给出 \(\| \sum_{r=1}^N A_r \otimes A_r \|_{\text{op}} \leq C s^2 \sqrt{N} (d_a + d_b)\),但这是对 \(\text{Mat}_0(d; \mathbb{R})\) 而非仅对称矩阵的。难点:需要确认该定理确实适用于非对称矩阵(作者声称“importantly, (3.8) is an operator bound on the entire traceless matrix space, not only on symmetric matrices”)。 - Lemma 2 的精确共轭:Hessian 在 \(\Theta\) 处的二次型为 \(\frac{1}{M} \sum_{i=1}^n \|K_{H_G} G x_i\|_2^2\),其中 \(K_{H_G} = G K_Z G^{-1}\)。难点:虽然 \(H_a\) 对称,但 \(Z_a = G_a^{-1} H_a G_a\) 不一定对称,因此需要全 Lie 代数 Gram 界。 - Lemma 3 的 Lipschitz 常数:沿测地线的导数估计需要同时控制 \(\Theta_s^{1/2} (x-y)\) 和 \(A_s \Theta_s^{1/2} x\) 的范数,前者通过 \(C_R\) 的紧性控制,后者通过 Hessian 上界控制。

技术技巧点名: - 随机 Gram 界(Lemma 1):基于 Pisier (2012, 2014) 的随机矩阵不等式,用于控制随机完全正映射的算子范数。 - 块 Gershgorin 估计(Lemma 1 证明):用于将成对交叉项的范数控制转化为行和估计。 - 精确共轭(Lemma 2):将身份处的 Gram 界运输到非身份点,避免逐点分析。 - 强测地凸性与变分不等式(Lemma 3):用于建立约束 MLE 的 Lipschitz 性质。 - Kirszbraun 延拓(Section 6):将定义在子集上的 Lipschitz 映射延拓到全空间。 - 正交群平均(Section 6):通过 Haar 测度平均使延拓后的映射等变且零均值。 - 高斯浓度不等式(Section 6):用于 Lipschitz 函数的集中性。 - 球面 \(\varepsilon\)-net(Section 6):将算子范数控制转化为有限个方向的控制。

真实例子与应用

本文为纯理论论文,无实证例子。 作者在 Section 8 中仅通过信息论下界比较来验证最优性,未进行模拟或真实数据分析。

🔎 结论是否比证明窄

  • 定理 1 的 Thompson 界(2.15)仅对最大模式(\(d_a = d_{\max}\))成立,而对小模式的 Thompson 界在推论 1 中给出,但附加了额外的 \(d_{\max}/\sqrt{k}\) 项。作者明确承认“对于较小因子 \(a\),比较不那么尖锐……我们不声称对每个小因子都是极小极大的”(Section 8)。
  • 样本阈值中的 \(k^2\) 依赖未被证明是最优的。作者在 Section 9 中承认“对 \(k\) 的最优依赖未知”。
  • 定理 1 不保证 flip-flop 算法在改进样本阈值下的线性收敛。作者在 Section 9 中明确将此列为开放问题。
  • 定理 1 是充分条件而非必要条件。代数分类(Derksen et al., 2022)给出了精确的存在性边界,本文的阈值可能比必要阈值更保守。

四、开放问题(扎根具体语句)

  1. 最优的 \(k\) 依赖:定理 1 的样本阈值包含 \(k^2\) 因子,但信息论下界(命题 1)仅涉及 \(d_{\max}\) 而不涉及 \(k\)。作者在 Section 9 中承认“对 \(k\) 的最优依赖未知”。扎根:Section 9 “Second, the optimal dependence on \(k\) is unknown.”

  2. flip-flop 算法的收敛性:定理 1 建立了 MLE 的统计性质,但未证明 flip-flop 迭代算法在改进样本阈值 \(nD \gtrsim k^2 d_{\max}^2\) 下的线性收敛。扎根:Section 9 “Third, the argument establishes statistical properties of the MLE but does not prove linear convergence of the flip-flop algorithm at the improved sample threshold.”

  3. 抽象定位原理的推广:本文的约束优化器定位论证依赖于高斯 Lipschitz 浓度和正交群等变性。作者提出将其推广到其他由约化群作用生成的高斯模型。扎根:Section 9 “Finally, it would be useful to isolate an abstract version of the constrained-optimizer localization argument for other Gaussian models generated by reductive group actions.”

  4. 与张量 U-统计量计算复杂度的连接:本文未讨论张量正态 MLE 的计算成本(如 flip-flop 迭代的每次迭代复杂度),也未与张量收缩的 treewidth / einsum 复杂度建立联系。考虑到研究者本人的工作,这是一个值得探索的 gap——例如,flip-flop 迭代的每次迭代涉及张量收缩,其计算成本是否可以用 tensor-network 复杂度刻画?本文的算子范数集中技术是否能为张量 U-统计量的误差传播提供新工具?扎根:本文未引用任何关于张量计算复杂度的文献,这是一个明显的空白。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论