跳转至

Biplots for the Correlation Matrix

作者: Jan Graffelman
来源: Journal of Computational and Graphical Statistics
主题: 统计计算 / 算法
相关性: 1/10
机构绿灯: University of Washington(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/10618600.2025.2469757


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是相关矩阵的低秩可视化,具体而言,是如何通过双标图(biplot)这种二维散点图来近似展示一个 \(p \times p\) 相关矩阵 \(\mathbf{R}\) 的全部信息。双标图本质上是将数据矩阵 \(\mathbf{X}_{n \times p}\)(样本)和(变量)同时投影到低维(通常是二维)空间,使得读者能从一张图上同时看到样本的聚类、变量的方向以及变量之间的相关性(通过变量箭头的夹角余弦近似)。这个子方向的核心统计问题是:给定一个相关矩阵 \(\mathbf{R}\),如何找到一个低秩近似 \(\hat{\mathbf{R}}\)(秩 \(k=2\)),使得 \(\hat{\mathbf{R}}\) 既能保留 \(\mathbf{R}\) 的结构,又能被直观地画成一张图? 当前成熟度属于“经典方法已有共识,但改进空间仍存在”的阶段——经典做法是直接对 \(\mathbf{R}\) 做特征分解(PCA),但作者指出这种做法在拟合优度上并非最优。

发展脉络(history)

作者在引言中把相关双标图的发展串成了一条线,主要引用如下:

  1. 奠基工作:Gabriel (1971) 提出双标图。Gabriel 的原始双标图是对数据矩阵 \(\mathbf{X}\) 做奇异值分解(SVD),然后将行得分和列载荷画在同一张图上。这是所有双标图的起点。作者引用它时指出,Gabriel 的双标图默认对 \(\mathbf{X}\) 做了列中心化(减去列均值),这导致它可视化的是协方差矩阵而非相关矩阵。

  2. 主要进展:从协方差到相关的转变。为了可视化相关矩阵,研究者需要将数据标准化(使每列方差为1)。作者引用 Graffelman & Aluja-Banet (2003) 和 Graffelman (2005) 的工作,指出对标准化后的数据矩阵直接做 SVD 得到的双标图,其内积近似的是相关矩阵。但作者强调,这种“标准做法”有一个隐含的、未被充分讨论的问题:标准化后的数据矩阵的列均值不一定为零(因为标准化只调整了方差,没调整均值),而 Gabriel 的原始双标图框架要求数据矩阵是中心化的。因此,直接对标准化数据做 SVD 得到的双标图,其内积近似的是 \(\mathbf{R} + \mathbf{1}_n \mathbf{1}_n^\top \bar{\mathbf{x}} \bar{\mathbf{x}}^\top / n\)(一个被均值污染了的版本),而不是干净的 \(\mathbf{R}\)

  3. 当前 frontier:显式处理中心化问题。作者引用 Gower, Gardner & le Roux (2011) 的著作,指出他们提出了“相关双标图”(correlation biplot)的概念,并明确建议在 SVD 之前对标准化数据减去总体均值(即所有 \(n \times p\) 个元素减去一个共同的标量)。作者认为,这种“单标量调整”虽然比不做调整好,但仍然不是最优的,因为它假设所有变量共享同一个均值偏移,而实际上每个变量的均值偏移可能不同。

  4. 本文的位置:作者声称,本文是第一个提出列调整(每个变量用一个不同的标量去调整)和行列调整(同时调整行和列)来拟合相关矩阵的工作。作者开发了一个加权交替最小二乘(WALS)算法来实现列调整,并声称相比单标量调整,列调整能显著降低加权均方根误差(WRMSE)。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索一:双标图的构造方法。这一簇关注的是“给定一个数据矩阵,如何通过 SVD 或广义 SVD 构造双标图”。核心变量是中心化方式(无中心化、列中心化、行中心化、双中心化)和缩放方式(是否标准化)。代表工作:Gabriel (1971), Gower et al. (2011)。本文属于这一簇,因为它提出了新的中心化/缩放方式(列调整)。
  • 线索二:相关矩阵的低秩近似。这一簇关注的是“如何用低秩矩阵 \(\hat{\mathbf{R}}\) 去近似一个给定的相关矩阵 \(\mathbf{R}\)”。核心变量是近似准则(Frobenius 范数、加权 Frobenius 范数、最大似然)和\(\hat{\mathbf{R}}\) 的约束(是否要求 \(\hat{\mathbf{R}}\) 的对角线为 1、是否要求 \(\hat{\mathbf{R}}\) 半正定)。本文属于这一簇,因为它用加权 RMSE 作为准则,并且不要求 \(\hat{\mathbf{R}}\) 的对角线为 1(这是它和 PCA 的关键区别)。

这个方向在追问的核心问题

  1. 拟合优度 vs. 可解释性:如何平衡低维近似的精度(WRMSE 小)和双标图的可读性(变量箭头不重叠、样本点不拥挤)?本文的列调整虽然 WRMSE 更低,但作者承认“resulting biplots are harder to read”。
  2. 中心化策略的选择:对于相关矩阵的可视化,哪种中心化(无、总体均值、列均值、行列均值)在统计上最合理?作者认为“列调整”最合理,但并未给出理论证明(例如,它是否对应某种最优的 MLE)。
  3. 加权方案的设计:在加权最小二乘中,权重矩阵 \(\mathbf{W}\) 应该如何选择?作者使用了“对相关矩阵的每个元素赋予相同权重”的简单方案,但未讨论更复杂的加权(例如,给对角线元素更高权重,因为对角线是 1,是相关矩阵的“锚点”)。

⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)

  • 作者把缺口 frame 成什么:作者声称,现有相关双标图(包括 Gower et al. 2011 的单标量调整)的拟合优度是“sub-optimal”,因为它们的中心化方式不够灵活。作者把本文的列调整算法 frame 成“显然的下一步”——通过允许每个变量有自己的调整标量,可以更灵活地拟合相关矩阵,从而降低 WRMSE。
  • 哪些竞争路线被他淡化或回避了
    • 直接对 \(\mathbf{R}\) 做 PCA:这是最直接、最常用的方法(对 \(\mathbf{R}\) 做特征分解,取前两个特征向量)。作者在引言中只提了一句“PCA 双标图是次优的”,但没有详细比较。实际上,PCA 对 \(\mathbf{R}\) 的近似在 Frobenius 范数下是最优的(Eckart-Young 定理),而作者的加权 RMSE 准则与 Frobenius 范数不同,因此 PCA 在作者的准则下不是最优的——但这并不意味着 PCA 在“可视化”这个任务上更差。作者回避了“为什么加权 RMSE 是比 Frobenius 范数更好的可视化准则”这个关键问题。
    • 多维缩放(MDS):MDS 可以直接对距离矩阵(由相关矩阵转换而来)做低维嵌入,也是一种可视化相关矩阵的方法。作者完全没有提及 MDS。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
    • 关于低秩矩阵近似的经典文献:Eckart-Young 定理、加权低秩近似(如 Srebro & Jaakkola, 2003)、以及“矩阵补全”(matrix completion)的相关工作。这些文献直接讨论了“在加权 Frobenius 范数下如何做低秩近似”,而本文的 WALS 算法本质上是在解决一个加权低秩近似问题。作者没有引用这些文献,使得本文的算法看起来比实际更“新”。
    • 关于双标图可读性的心理学/可视化文献:双标图最终是给人看的,其有效性取决于人类的视觉感知。作者没有引用任何关于“如何设计双标图使其更易读”的实证研究(例如,箭头长度、角度、标签重叠的处理)。这使得“correlation tally sticks”这个提议看起来像是一个 ad hoc 的修补,而不是基于理论的设计。

张力

未见明显对立引用。所有被引工作都默认“双标图是好的可视化工具”,分歧只在于“如何构造它”。没有工作质疑双标图本身的有效性。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(\mathbf{X}_{n \times p}\):原始数据矩阵,\(n\) 个样本,\(p\) 个变量。这是可观测数据
    • \(\mathbf{1}_n\):长度为 \(n\) 的全 1 列向量。
    • \(\mathbf{J}_n = \mathbf{I}_n - \frac{1}{n}\mathbf{1}_n\mathbf{1}_n^\top\):中心化矩阵(减去列均值)。
    • \(\mathbf{Y}_{n \times p}\):标准化后的数据矩阵。\(\mathbf{Y} = \mathbf{X} \mathbf{D}^{-1/2}\),其中 \(\mathbf{D} = \text{diag}(\text{var}(X_1), \ldots, \text{var}(X_p))\)\(\mathbf{Y}\) 的每一列方差为 1,但列均值不一定为 0。这是可观测数据(由 \(\mathbf{X}\) 计算得到)。
    • \(\mathbf{R}_{p \times p} = \frac{1}{n-1} \mathbf{Y}^\top \mathbf{J}_n \mathbf{Y}\):样本相关矩阵。这是想要可视化但不可直接观测的(它是一个 \(p \times p\) 矩阵,无法直接画在二维平面上)。
    • \(\mathbf{Z}_{n \times p}\):对 \(\mathbf{Y}\) 进行某种“调整”后的矩阵。例如,\(\mathbf{Z} = \mathbf{Y} - \mathbf{1}_n \mathbf{c}^\top\),其中 \(\mathbf{c}\) 是一个 \(p \times 1\) 的调整向量。这是构造出来的量
    • \(\hat{\mathbf{R}}_{p \times p}\)\(\mathbf{R}\) 的低秩近似(秩 \(k=2\))。这是要估计的对象
    • \(\mathbf{U}_{n \times k}, \mathbf{V}_{p \times k}\):双标图的坐标矩阵。\(\mathbf{U}\) 是样本点坐标,\(\mathbf{V}\) 是变量箭头坐标。它们满足 \(\mathbf{Z} \approx \mathbf{U} \mathbf{V}^\top\)(一个秩 \(k\) 近似)。
    • \(c\):单标量调整参数(一个标量)。
    • \(\mathbf{c}_{p \times 1}\):列调整参数向量(\(p\) 个标量)。
    • \(\mathbf{W}_{p \times p}\):权重矩阵,用于加权 RMSE。本文中 \(\mathbf{W} = \mathbf{I}_p\)(所有元素等权)。
  • 模型

    • 没有显式的概率模型。这是一个纯代数/优化问题:给定一个 \(p \times p\) 的相关矩阵 \(\mathbf{R}\),找到一个秩 \(k\) 的矩阵 \(\hat{\mathbf{R}}\),使得加权 Frobenius 范数 \(\|\mathbf{W}^{1/2} \odot (\mathbf{R} - \hat{\mathbf{R}})\|_F\) 最小化。其中 \(\odot\) 是 Hadamard 积。
    • 本文的“模型”是:\(\mathbf{R}\) 可以被写成 \(\mathbf{Z}^\top \mathbf{Z} / (n-1)\) 的形式,其中 \(\mathbf{Z}\) 是某个“调整后的”数据矩阵。然后,对 \(\mathbf{Z}\) 做秩 \(k\) SVD 就得到了 \(\hat{\mathbf{R}}\) 的双标图表示。
  • 可观测数据

    • 研究者实际能观测到的是:原始数据矩阵 \(\mathbf{X}\)(或直接就是相关矩阵 \(\mathbf{R}\))。
    • 想要但观测不到的是\(\mathbf{R}\) 的低秩结构。研究者想通过双标图来“看到”这个结构。

第二步:讲最小内核

本文的核心思路可以用一个最简特例讲清楚:假设只有 \(p=2\) 个变量,我们想用一个二维双标图(\(k=2\))来可视化它们的相关矩阵 \(\mathbf{R}_{2 \times 2}\)。在这个特例下,秩 \(k=2\) 的近似是精确的(因为 \(\mathbf{R}\) 本身就是 \(2 \times 2\) 的,秩最多为 2),所以拟合优度不是问题。这个特例的价值在于展示“调整”操作的本质

  • 经典 PCA 双标图:对标准化数据 \(\mathbf{Y}_{n \times 2}\) 做 SVD:\(\mathbf{Y} = \mathbf{U} \mathbf{\Sigma} \mathbf{V}^\top\)。然后,取前 2 个奇异值和向量(实际上就是全部),得到双标图坐标:样本点 = \(\mathbf{U} \mathbf{\Sigma}\),变量箭头 = \(\mathbf{V}\)。此时,变量箭头的内积 \(\mathbf{V} \mathbf{V}^\top = \mathbf{I}_2\)(因为 \(\mathbf{V}\) 是正交矩阵),所以双标图上的箭头是正交的。但 \(\mathbf{R}\) 不一定正交(例如,\(\mathbf{R} = \begin{pmatrix} 1 & 0.8 \\ 0.8 & 1 \end{pmatrix}\))。因此,PCA 双标图无法通过箭头夹角来反映相关性(它总是显示正交,即相关性为 0)。这是 PCA 双标图的一个根本缺陷。

  • 本文的列调整双标图:作者想找到一个调整向量 \(\mathbf{c} = (c_1, c_2)^\top\),使得调整后的数据 \(\mathbf{Z} = \mathbf{Y} - \mathbf{1}_n \mathbf{c}^\top\) 的 SVD 能更好地近似 \(\mathbf{R}\)。具体来说,作者希望 \(\mathbf{Z}^\top \mathbf{Z} / (n-1) \approx \mathbf{R}\)。展开:

    \[\frac{1}{n-1} \mathbf{Z}^\top \mathbf{Z} = \frac{1}{n-1} (\mathbf{Y} - \mathbf{1}_n \mathbf{c}^\top)^\top (\mathbf{Y} - \mathbf{1}_n \mathbf{c}^\top) = \frac{1}{n-1} \mathbf{Y}^\top \mathbf{Y} - \frac{n}{n-1} \mathbf{c} \mathbf{c}^\top\]
    这里用到了 \(\mathbf{Y}^\top \mathbf{1}_n = n \bar{\mathbf{y}}^\top\)\(\bar{\mathbf{y}}\)\(\mathbf{Y}\) 的列均值向量)和 \(\mathbf{1}_n^\top \mathbf{1}_n = n\)。注意,\(\mathbf{Y}^\top \mathbf{Y} / (n-1) = \mathbf{R} + \frac{n}{n-1} \bar{\mathbf{y}} \bar{\mathbf{y}}^\top\)(因为 \(\mathbf{Y}\) 的列均值不为 0)。代入上式:
    \[\frac{1}{n-1} \mathbf{Z}^\top \mathbf{Z} = \mathbf{R} + \frac{n}{n-1} (\bar{\mathbf{y}} \bar{\mathbf{y}}^\top - \mathbf{c} \mathbf{c}^\top)\]
    为了让这个近似等于 \(\mathbf{R}\),我们需要 \(\bar{\mathbf{y}} \bar{\mathbf{y}}^\top = \mathbf{c} \mathbf{c}^\top\)。这意味着 \(\mathbf{c}\) 必须等于 \(\pm \bar{\mathbf{y}}\)。换句话说,列调整的最优解就是减去列均值\(\mathbf{c} = \bar{\mathbf{y}}\))。此时,\(\mathbf{Z}\) 就是中心化后的标准化数据,\(\mathbf{Z}^\top \mathbf{Z} / (n-1) = \mathbf{R}\) 精确成立。

  • 这个特例说明了什么

    1. 对于 \(p=2\),列调整(减去列均值)可以精确恢复相关矩阵。而 PCA 双标图(不做列调整)则不能。
    2. 这个特例揭示了本文的核心思想:通过调整数据矩阵的均值(或更一般地,通过一个可逆变换),使得调整后数据的内积矩阵更接近目标相关矩阵
    3. 对于 \(p > 2\)\(k=2\) 的情况,精确恢复是不可能的(因为 \(\mathbf{R}\) 的秩可能大于 2)。此时,列调整的目标是找到一个 \(\mathbf{c}\),使得 \(\mathbf{Z}^\top \mathbf{Z} / (n-1)\)最佳秩 2 近似(通过 SVD)的加权 RMSE 最小。这就是 WALS 算法要解决的问题。

一句话总结本文的核心数学问题:给定相关矩阵 \(\mathbf{R}\),找到一个调整向量 \(\mathbf{c}\) 和一个秩 2 矩阵 \(\hat{\mathbf{R}}\),使得 \(\|\mathbf{R} - \hat{\mathbf{R}}\|_F\) 最小化,其中 \(\hat{\mathbf{R}}\) 必须能写成 \((\mathbf{Y} - \mathbf{1}_n \mathbf{c}^\top)^\top (\mathbf{Y} - \mathbf{1}_n \mathbf{c}^\top) / (n-1)\) 的秩 2 SVD 近似的形式。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:如何构造相关矩阵的双标图,使得低维近似的加权均方根误差(WRMSE)最小。
  2. 核心工具 / 方法:提出了一种加权交替最小二乘(WALS)算法,用于估计一个列调整向量 \(\mathbf{c}\),使得对调整后的数据矩阵做 SVD 得到的双标图能更好地拟合原始相关矩阵。
  3. 主要结论:通过模拟和实际数据,作者展示了列调整双标图相比单标量调整双标图和经典 PCA 双标图,在 WRMSE 上有显著降低(例如,在某个数据集中,WRMSE 从 0.35 降到 0.20)。同时,作者引入了“相关计数棒”(correlation tally sticks)来增强双标图的可读性。

关键设定与假设

  • 设定:给定一个 \(n \times p\) 的数据矩阵 \(\mathbf{X}\),计算其相关矩阵 \(\mathbf{R}\)。目标是找到一个秩 \(k=2\) 的矩阵 \(\hat{\mathbf{R}}\) 来近似 \(\mathbf{R}\),并且这个 \(\hat{\mathbf{R}}\) 必须能通过一个双标图来可视化。
  • 假设
    • 数据矩阵 \(\mathbf{X}\) 是满秩的\(n > p\),且 \(\mathbf{X}\) 列满秩)。这是为了确保相关矩阵 \(\mathbf{R}\) 是可逆的(虽然本文不要求可逆)。
    • 加权方案:作者假设权重矩阵 \(\mathbf{W} = \mathbf{I}_p\),即所有相关矩阵元素在近似中同等重要。这是一个很强的假设,因为相关矩阵的对角线(都是 1)和非对角线(取值范围 [-1, 1])的“重要性”可能不同。
    • 低秩结构存在:作者假设 \(\mathbf{R}\) 可以被一个秩 2 矩阵很好地近似。如果 \(\mathbf{R}\) 的秩远大于 2,那么任何双标图都会丢失大量信息。
    • 与已有文献的对比:相比 Gower et al. (2011) 的单标量调整(假设所有变量共享一个均值偏移),本文的列调整假设每个变量有自己的均值偏移,因此更灵活。相比 PCA 双标图(不做任何调整),本文的调整操作允许双标图更准确地反映相关结构。

主要结果

  • 理论结果:本文没有严格的渐近理论或有限样本界。主要“结果”是算法和实证比较。
  • 算法结果:作者提出了 WALS 算法(Algorithm 1),用于迭代求解列调整向量 \(\mathbf{c}\)。算法步骤:
    1. 初始化 \(\mathbf{c} = \mathbf{0}\)(或随机)。
    2. 计算调整后的数据 \(\mathbf{Z} = \mathbf{Y} - \mathbf{1}_n \mathbf{c}^\top\)
    3. \(\mathbf{Z}\) 做秩 \(k\) SVD,得到 \(\hat{\mathbf{Z}} = \mathbf{U}_k \mathbf{\Sigma}_k \mathbf{V}_k^\top\)
    4. 计算残差 \(\mathbf{E} = \mathbf{R} - \hat{\mathbf{Z}}^\top \hat{\mathbf{Z}} / (n-1)\)
    5. 更新 \(\mathbf{c}\) 以最小化加权 Frobenius 范数 \(\|\mathbf{W}^{1/2} \odot \mathbf{E}\|_F\)。这一步通过一个封闭形式的解完成(见公式 10)。
    6. 重复步骤 2-5 直到收敛。
  • 实证结果
    • 模拟数据:作者生成了具有已知相关结构的数据,比较了 PCA、单标量调整和列调整的 WRMSE。结果显示,列调整的 WRMSE 最低,且随着 \(p\) 增大,优势更明显。
    • 实际数据:作者使用了两个数据集:
      1. “瑞士银行票据”数据\(n=200, p=6\)):这是一个经典数据集,包含真假瑞士法郎的六个测量指标。作者展示了 PCA 双标图、单标量调整双标图和列调整双标图。列调整双标图的 WRMSE 最低(0.20 vs. 0.35 for PCA)。作者还展示了“相关计数棒”——在变量箭头周围画上刻度线,表示该变量与其他变量的相关性大小。
      2. “纽约空气污染”数据\(n=111, p=7\)):包含臭氧、温度、风速等指标。类似地,列调整双标图显示了更低的 WRMSE。
    • 这些例子想说明什么:列调整双标图在量化指标(WRMSE)上优于现有方法,但作者也承认它在视觉上更难读(箭头更拥挤、更杂乱)。相关计数棒是为了弥补这个缺陷而提出的。

证明路线与技术技巧

  • 整体路线:本文的“证明”实际上是算法推导,而不是数学定理的证明。路线如下:
    1. 问题形式化:将寻找最优列调整向量 \(\mathbf{c}\) 的问题形式化为一个加权最小二乘问题。
    2. 交替最小二乘:将问题分解为两个子问题:固定 \(\mathbf{c}\) 求 SVD(步骤 3),固定 SVD 结果求 \(\mathbf{c}\)(步骤 5)。交替迭代直到收敛。
    3. 封闭形式更新:作者推导了在固定 SVD 结果下,\(\mathbf{c}\) 的最优更新公式(公式 10)。这个公式是线性的,因此计算效率高。
  • 关键跳跃点
    • 从“单标量调整”到“列调整”:这是本文的核心创新点。单标量调整假设所有变量共享一个均值偏移,而列调整允许每个变量有自己的偏移。这个跳跃使得问题从一维优化变成了 \(p\) 维优化,但作者通过 WALS 算法使其可解。
    • WALS 算法的收敛性:作者没有证明 WALS 算法一定收敛到全局最优解。这是一个典型的非凸优化问题(因为 SVD 步骤是非线性的),WALS 只能保证收敛到一个局部最优解。作者在文中提到“the algorithm usually converges in a few iterations”,但没有给出理论保证。
  • 技术技巧点名
    • 加权交替最小二乘(WALS):这是本文的核心算法工具。它被用来交替优化 \(\mathbf{c}\) 和 SVD 结果。
    • 封闭形式解:作者推导了 \(\mathbf{c}\) 的更新公式(公式 10),避免了在每次迭代中使用数值优化。
    • 相关计数棒:这是一个可视化技巧,通过在变量箭头上添加刻度线来显示相关性大小,类似于“风玫瑰图”或“雷达图”的变体。

真实例子与应用

  • 数据:瑞士银行票据数据(\(n=200, p=6\))和纽约空气污染数据(\(n=111, p=7\))。这两个都是统计可视化领域的经典数据集。
  • 怎么用:作者对每个数据集,计算相关矩阵 \(\mathbf{R}\),然后分别用 PCA、单标量调整和列调整方法构造双标图。对于列调整,运行 WALS 算法得到 \(\mathbf{c}\),然后对调整后的数据做 SVD。
  • 结果:列调整双标图的 WRMSE 最低。例如,在瑞士银行票据数据中,PCA 的 WRMSE 为 0.35,单标量调整为 0.28,列调整为 0.20。作者展示了三个双标图,并指出列调整双标图中变量箭头的夹角更准确地反映了相关矩阵中的实际相关性。
  • 这个例子想说明什么:列调整在数值上更优,但作者也承认其视觉上更复杂。相关计数棒被提出作为补救措施。

🔎 结论是否比证明窄

  • 。作者在摘要和引言中声称列调整双标图“outperform the usual correlation biplots”,但这个结论是基于两个特定数据集的 WRMSE 比较。作者没有提供任何理论保证(例如,在什么条件下列调整一定优于单标量调整?WRMSE 的降低是否具有统计显著性?)。因此,结论的泛化能力是未知的。
  • 具体语句:作者在结论部分说“The column adjustment is shown to improve the fit of the biplot to the correlation matrix in terms of the weighted root mean squared error.” 这个“shown”指的是在这两个数据集上展示,而不是在理论上证明。作者没有声称这是一个普遍成立的定理。

四、开放问题

  1. WALS 算法的全局收敛性:本文的 WALS 算法只能保证收敛到局部最优。是否存在一个全局最优的算法(例如,通过半定规划松弛)?或者,在什么条件下局部最优就是全局最优?(扎根于:作者未讨论算法收敛性,仅说“usually converges”。)
  2. 加权方案的选择:本文使用等权方案(\(\mathbf{W} = \mathbf{I}_p\))。如果给对角线元素(都是 1)更高权重,结果会如何?是否存在一个“最优”的加权方案,使得双标图在某种意义下(例如,最大化变量箭头的可区分性)最优?(扎根于:作者未讨论加权方案的选择。)
  3. 高维情形下的表现:当 \(p\) 很大(例如,\(p > n\))时,相关矩阵 \(\mathbf{R}\) 是奇异的,且低秩近似可能不稳定。本文的方法是否适用于高维稀疏相关矩阵?WALS 算法在高维下的计算复杂度如何?(扎根于:本文的模拟和实际数据中 \(p\) 都很小,未讨论高维情形。)
  4. 与矩阵补全的联系:本文的加权低秩近似问题与“矩阵补全”(matrix completion)有密切联系。矩阵补全领域有丰富的理论(如 Candès & Recht, 2009),能否将那些理论(例如,在什么条件下低秩近似是唯一的、可恢复的)应用到本文的问题中?(扎根于:作者未引用矩阵补全文献,这是一个明显的缺失。)

Maintained by 陈星宇 · Homepage · Source on GitHub

评论