跳转至

JCGS — Vol 34 Issue 4 · 2026-07-13

  • 共 48 篇 · Journal of Computational and Graphical Statistics
  • 目录核对 ✅ 48 篇全部抓到(对照 OpenAlex 49 篇)

本期导览

自动生成:归纳本期主要主题与脉络,不打分、不排名

JCGS Vol 34 Issue 4 的 48 篇论文可归纳为四条主线:因果推断与缺失数据处理、半参数/非参数方法、高维图模型与变量选择、以及统计计算与算法。因果推断方向有 5 篇,覆盖多处理效应估计、随机化检验的敏感性分析、删失协变量插补、外部数据整合以及分位数回归中的同质性检测。半参数/非参数方向有 3 篇,分别处理边际参数的有效估计、非负响应回归和动态关联度量。高维方向有 2 篇,涉及协变量依赖的图模型和异方差回归的变量选择。统计计算方向最为密集,约 20 篇,涵盖贝叶斯计算、在线学习、空间统计、网络模型和可视化等子主题。

因果推断主线中,Simultaneous Estimation of Multiple Treatment Effects 将稀疏性假设引入多处理效应估计,自动选择非零效应,可迁移至工具变量或近端因果推断中的变量选择问题。Sensitivity Analysis for Binary Outcome Misclassification 提出“警告准确率”概念,通过整数规划实现无模型敏感性分析,适用于随机化实验的结局误分类场景。Extrapolation Before Imputation 针对删失协变量,采用半参数生存估计加参数外推修正条件均值插补,为纵向因果推断中的协变量缺失提供了实用工具。An Integrated GMM Shrinkage Approach 在 GEE 框架下通过自适应 Lasso 从多个外部源中选择有效矩条件,实现 oracle 效率,直接关联因果推断中的外部数据整合问题。Pursuing Homogeneity and Sparsity 在分位数回归中同时检测同质性和稀疏性,其惩罚框架可迁移至异质性处理效应识别。

半参数/非参数主线中,Efficient Estimation of Parameters in Marginals 用 Bernstein-Kantorovich 多项式 copula 逼近未知联合分布,在避免 copula 误设的同时提升边际参数估计效率,达到半参数效率界。Assumption-Lean Regression for Nonnegative Response 利用变分表示构造无需分布假设的估计量,对零膨胀、比例数据具有鲁棒性。Fluid Correlation 在 RKHS 中定义并估计动态关联度量,提供渐近置信带。

高维主线中,High-Dimensional Covariate-Dependent Gaussian Graphical Models 将图模型参数化为协变量函数,建立 l2 误差界和符号一致性。Variable Selection for High-Dimensional Heteroscedastic Regression 提出两阶段算法,证明选择一致性,适用于异方差高维回归。

统计计算主线中,Gibbs Sampling Using Anti-Correlation Gaussian Data Augmentation 通过反相关高斯潜变量实现整块 Gibbs 采样,加速 L1-ball 型先验的后验计算。AutoGFI 将广义 fiducial 推断简化为残差 bootstrap,适用于张量回归等现代问题。ProSpar-GPNonstationary Spatial Modeling of Massive Global Satellite Data 分别通过 product-of-experts 和多分辨率近似处理大规模非平稳空间数据。Stochastic Gradient Descent-based Inference for Dynamic Network Models 将 SGD 引入动态网络模型,提升可扩展性。

与因果推断最贴合的论文是 Simultaneous Estimation of Multiple Treatment EffectsSensitivity Analysis for Binary Outcome MisclassificationExtrapolation Before ImputationAn Integrated GMM Shrinkage Approach。与半参数效率最相关的是 Efficient Estimation of Parameters in MarginalsAssumption-Lean Regression for Nonnegative Response。与高维统计最相关的是 High-Dimensional Covariate-Dependent Gaussian Graphical ModelsVariable Selection for High-Dimensional Heteroscedastic Regression

因果推断 (causal_inference, 5 篇)

1. 10.1080/10618600.2024.2449074 · arXiv — Simultaneous Estimation of Multiple Treatment Effects from Observational Studies

  • 作者: Xiaochuan Shi, Dehan Kong, Linbo Wang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1376-1385
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文针对观察性研究中存在未测量混杂时,同时估计多个处理效应的难题。经典方法依赖工具变量等代理变量,但在多处理场景下难以找到足够数量的代理变量。作者提出一种新方法,假设因果效应具有稀疏性,即只有少数处理有非零因果效应。方法核心是自动选择非零效应的处理,并给出稀疏的因果效应估计。通过模拟和GWAS数据集验证,该方法相比现有方法更有效且稳健。对您而言,本文连接了因果推断中的多处理效应估计与高维稀疏性假设,其自动选择非零效应的思路可迁移至您熟悉的proximal CI或IV设定下的变量选择问题。
  • 关键技术: sparse causal estimation, variable selection, multiple treatments, unmeasured confounding, GWAS data analysis
  • 为什么对您有用: 本文直接关联您primary interest中的因果推断(多处理效应估计与未测量混杂),其稀疏性假设与自动选择非零效应的机制,可视为高维统计思想在因果推断中的应用。您的武器库中'high-dimensional asymptotics'和'estimation theory in causal inference'可直接用于分析该方法的理论性质(如选择一致性、估计量的收敛速度)。中期可做:若想将方法推广至更复杂的识别策略(如proximal CI),需先在'moderately_familiar'的'identification theory in causal inference'上加强。

2. 10.1080/10618600.2025.2461222 · arXiv — Sensitivity Analysis for Binary Outcome Misclassification in Randomization Tests via Integer Programming

  • 作者: Siyu Heng, Pamela A. Shaw
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1528-1541
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文针对随机化实验中二元结局误分类问题,提出一种无模型、有限总体的敏感性分析方法。核心概念是“警告准确率”(warning accuracy),定义为使基于测量结局的随机化检验结果与基于真实结局的结果发生翻转所需的最小结局测量准确率阈值。该方法不依赖结局分布或建模假设,仅利用随机化设计本身,通过整数规划高效计算警告准确率及其相关量。作者将大规模整数规划问题根据随机化设计自适应重构,使得算法可扩展到大数据集。在Prostate Cancer Prevention Trial (PCPT) 数据上展示了应用,并提供了开源R包。该方法为随机化检验中结局误分类的敏感性分析提供了计算上可行的工具,且不引入额外假设。对您而言,该工作直接关联因果推断中的敏感性分析方向,且其整数规划计算策略可迁移至您熟悉的非参数统计和软件工具开发中。
  • 关键技术: randomization test, sensitivity analysis, outcome misclassification, integer programming, warning accuracy
  • 为什么对您有用: 直接连接您primary interest中的因果推断敏感性分析子方向,且其核心计算问题(整数规划)与您武器库中'软件工具开发'和'非参数统计'高度匹配。该文提出的警告准确率概念为随机化检验中结局误分类提供了一种无需额外假设的敏感性量化方法,您可立即利用熟悉的非参数统计和计算工具复现或扩展其算法。中期可做:若想将类似思路推广至更复杂的因果设计(如IV、proximal CI),需先在moderately_familiar的identification theory上长肌肉。

3. 10.1080/10618600.2024.2444323 · arXiv — Extrapolation Before Imputation Reduces Bias When Imputing Censored Covariates

  • 作者: Sarah C. Lotspeich, Tanya P. Garcia
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1322-1330
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文针对亨廷顿病临床试验中协变量(诊断时间)高度删失导致的缺失问题,提出了一种“先外推再插补”的策略。现有方法使用Cox模型与Breslow估计量估计生存函数,但积分仅在观测数据范围内进行,截断尾部导致偏差超过200%。作者将半参数生存估计与参数外推结合,将积分近似延拓至无穷,从而修正条件均值插补。模拟表明,即使参数外推模型设定错误,该方法仍能大幅降低偏差。该方法本质上是处理删失协变量时的一种敏感性分析工具,对因果推断中协变量缺失或删失的处理有直接参考价值。对您而言,该工作与primary interest中的因果推断(特别是纵向数据中的协变量缺失问题)紧密相关,且其“外推+插补”思路可迁移至proximal CI中negative control变量的删失处理。
  • 关键技术: Cox proportional hazards model, Breslow estimator, conditional mean imputation, parametric extrapolation, survival function integration
  • 为什么对您有用: 本文直接处理因果推断中常见的协变量删失问题,属于primary interest中因果推断(纵向数据)的子方向。技术层面,您可以用very_familiar的nonparametric statistics工具(如核平滑)替代其参数外推部分,以放松模型假设;同时,该问题的偏差分析框架可启发您用minimax bound验证其声称的偏差缩减是否最优。中期可做:需先在moderately_familiar的identification theory中熟悉删失协变量下的identification条件,再考虑将方法推广至proximal CI设定。

4. 10.1080/10618600.2025.2476087 — An Integrated GMM Shrinkage Approach with Consistent Moment Selection from Multiple External Sources

  • 作者: Fang Fang, Tian Long, Jun Shao, Lei Wang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: East China Normal University · University of Wisconsin–Madison · Nankai University
  • 分类: vol 34 · issue 4 · pp 1670-1679
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究在存在多个外部汇总统计数据源时,如何利用它们提升主样本(内部数据)的参数估计效率,同时避免因总体异质性导致的偏差。设定为广义估计方程(GEE)框架,目标参数由内部数据的矩条件识别,外部源提供额外的矩条件,但可能部分无效。提出一种集成的广义矩方法(GMM),通过数据驱动的方式从多个外部源中选择有效的矩方程,并与内部数据联合估计参数。该方法本质上是一种带惩罚的GMM估计,通过自适应Lasso或类似机制实现矩选择的一致性。理论证明了矩选择一致性、估计量的渐近正态性,以及在所有外部源样本量远大于内部样本量时的oracle效率——即与已知所有有效矩条件的oracle估计量渐近等价。模拟和实例验证了方法的有限样本表现。对您而言,该工作直接关联因果推断中的数据融合与敏感性分析问题,其矩选择与oracle效率的框架可迁移至proximal causal inference中利用多个negative control变量进行identification和效率提升的场景。
  • 关键技术: penalized GMM, moment selection consistency, data fusion, oracle efficiency, adaptive Lasso
  • 为什么对您有用: 直接连接到primary interest中的因果推断(数据融合、利用外部信息提升效率)和identification理论。技术武器库中'very_familiar'的'nonparametric statistics'和'estimation theory in causal inference'可直接用于理解其GMM框架和oracle效率论证;'moderately_familiar'的'identification theory in causal inference'可用于将矩选择思想迁移至proximal CI中多个negative control变量的选择问题。中期可做:需先在'moderately_familiar'的'identification theory in causal inference'上深入,以形式化proximal CI中矩条件的选择与检验。

5. 10.1080/10618600.2025.2460600 — Pursuing Homogeneity and Sparsity in Simultaneous Quantile Regression

  • 作者: Zhen Zeng, Weixin Yao
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Nanjing University of Finance and Economics
  • 分类: vol 34 · issue 4 · pp 1513-1527
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文提出 PHISQ 方法,在同时分位数回归框架下同时追求同质性和稀疏性。目标是在多个分位数水平上识别哪些预测变量对响应有同质效应(系数跨分位数恒定)和异质效应(系数随分位数变化),从而得到更简洁、可解释的模型。方法通过融合 Lasso 和融合惩罚项,在估计多个分位数回归系数时自动聚类同质系数并收缩不相关变量。理论部分证明了在温和正则条件下,PHISQ 估计量具有变量选择相合性和同质性结构恢复的一致性。模拟和实证表明,该方法能有效借力跨分位数信息提升尾部估计效率。对您而言,该工作将稀疏性与结构同质性检测结合,其惩罚框架和理论分析思路可迁移至因果推断中的异质性处理效应识别(如分位数处理效应),属于中期可做方向。
  • 关键技术: quantile regression, fused Lasso, homogeneity pursuit, simultaneous estimation, penalized estimation
  • 为什么对您有用: 本文连接您对因果推断中异质性处理效应的兴趣,特别是分位数处理效应的识别与估计。您武器库中'非参数统计'和'高维渐近理论'可直接用于分析其惩罚估计量的收敛性,但核心的融合惩罚与同质性聚类机制属于'中等熟悉'的M估计理论范畴,需先在此项上提升。中期可做:将PHISQ的同质性检测思路推广到分位数处理效应框架,识别哪些协变量对处理效应有跨分位数恒定影响。

高维统计 / 随机矩阵 (high_dim_rmt, 2 篇)

1. 10.1080/10618600.2025.2475139 · arXiv — High-Dimensional Covariate-Dependent Gaussian Graphical Models

  • 作者: Jiacheng Wang, Xin Gao
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1642-1654
  • 相关性 6/10 · novelty: application
  • 摘要: 本文提出 covariate-dependent Gaussian graphical model (cdexGGM),用于刻画网络结构随协变量(如时间、实验条件)变化的动态图模型。核心创新在于一种新的参数化方式,将边参数和顶点参数均建模为协变量的函数,并在似然框架下联合估计所有参数。针对高维场景,采用复合似然估计加 l1 惩罚实现稀疏动态网络结构发现,并建立了 l2 范数下的估计误差界和符号一致性。方法应用于流感疫苗基因网络(随时间演化)和唐氏综合征蛋白网络(因子实验设计)两个真实数据集,展示了实用性。对您而言,本文的高维图模型估计与符号一致性理论可连接到您在高维统计和随机矩阵理论方面的兴趣,但方法学 novelty 属于已有框架的扩展(covariate-dependent 参数化 + l1 惩罚),而非全新理论突破。
  • 关键技术: composite likelihood estimation, l1 penalization, covariate-dependent parameterization, sign consistency, high-dimensional graphical model
  • 为什么对您有用: 本文属于高维图模型的应用扩展,直接连接到您的高维统计兴趣,但 novelty 有限(主要是参数化技巧 + 复合似然)。从武器库看,您可以用 minimax bounds 工具分析其估计误差界是否紧,但核心方法(l1 惩罚 + 复合似然)属于您 moderately_familiar 的 M-estimation 范畴,无需新工具即可理解。中期可做:若想深入,需先在 moderately_familiar 的 semiparametric theory 上长肌肉(因为 covariate-dependent 参数化涉及半参数建模),但当前论文本身作为应用型方法论文,读全文价值中等。

2. 10.1080/10618600.2025.2450449 — Variable Selection for High-Dimensional Heteroscedastic Regression and Its Applications

  • 作者: Po-Hsiang Peng, Hai-Tang Chiou, Hsueh-Han Huang, Ching-Kang Ing
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: National Tsing Hua University · National Chung Cheng University · Institute of Statistical Science, Academia Sinica
  • 分类: vol 34 · issue 4 · pp 1386-1396
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文研究高维线性异方差模型中的变量选择问题。目标是在误差方差随协变量变化(异方差)的设定下,识别出对响应变量有显著影响的预测变量。作者受线性异方差函数与交互模型之间联系的启发,提出了一个两阶段算法:第一阶段使用某种变量选择方法(如Lasso)筛选候选变量,第二阶段基于第一阶段的结果构建异方差函数并进一步精炼选择。文章证明了该两阶段方法具有选择一致性,即随着样本量增大,能正确识别出真实相关变量的概率趋于1。数值模拟验证了方法在有限样本下的有效性。此外,文章将所提方法应用于半导体制造过程中的缺陷工具识别,展示了实际应用价值。该方法为高维异方差回归提供了一种可行的变量选择方案,对您在高维统计和因果推断中处理异方差性可能具有参考价值。
  • 关键技术: two-stage variable selection, high-dimensional linear heteroscedastic model, selection consistency, interaction model connection, semiconductor manufacturing application
  • 为什么对您有用: 本文直接关联您的高维统计兴趣,特别是高维异方差回归中的变量选择问题。您武器库中'高维渐近理论'和'非参数统计'可用于分析其选择一致性的证明细节,并评估其方法在更一般异方差结构下的表现。中期可做:若将方法扩展到因果推断中的异方差处理(如异方差IV估计),需先在'因果推断识别理论'上加强。

非参数 / 半参数 (nonparam_semipara, 3 篇)

1. 10.1080/10618600.2024.2441988 · arXiv — Efficient Estimation of Parameters in Marginals in Semiparametric Multivariate Models

  • 作者: Ivan Medovikov, Valentyn Panchenko, Artem Prokhorov
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1240-1252
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文考虑一类半参数多元模型,其中各单变量边际分布已知(含有限维参数),但联合分布完全未知。目标是在不指定联合分布(除边际外)的情况下有效估计边际参数。若假设边际独立并最大化拟似然,得到一致但非有效的QMLE;若假设一个参数copula(非独立),则得到完全MLE,该估计量在copula正确设定下有效,但误设时可能有偏。作者提出一个筛分MLE(SMLE),用Bernstein-Kantorovich多项式copula逼近未知的联合分布部分,从而在避免copula误设风险的同时提升QMLE的效率。理论部分推导了SMLE的渐近分布,并证明它达到了相应的半参数效率界。模拟表明,当边际间存在足够相关性时,SMLE的效率可接近完全MLE。实证部分以金融风险管理中的VaR预测展示了SMLE的实用价值。该工作直接连接您的半参数理论兴趣,特别是筛分M估计与半参数效率界的结合,且其Bernstein多项式逼近工具与您熟悉的非参数统计和M估计理论高度兼容。
  • 关键技术: sieve MLE, Bernstein-Kantorovich polynomial copula, semiparametric efficiency bound, quasi-likelihood, copula misspecification robustness
  • 为什么对您有用: 本文直接连接您的半参数与非参数理论兴趣,核心问题是边际参数的有效估计而不指定联合分布,这正是半参数效率理论的标准设定。您武器库中'非参数统计'和'M估计理论'(均为very_familiar)可直接用于理解其筛分估计的收敛性和效率界推导;'半参数理论'(moderately_familiar)可进一步验证其声称的效率界是否紧。中期可做:若想将类似Bernstein多项式逼近推广到您的高阶U统计量或因果推断设定中,需先在'semiparametric theory'上加强(moderately_familiar),特别是理解筛分估计的收敛速率与模型光滑性假设的关系。

2. 10.1080/10618600.2025.2459277 — Assumption-Lean Regression for Nonnegative Response via Variational Representation

  • 作者: Andrey Babkin
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1480-1486
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文针对非负响应变量(如半连续、零膨胀、比例数据)的回归问题,提出了一种无需对条件分布族做任何假设的“假设-精简”估计量。核心思想是利用非负响应的变分表示(variational representation)构造目标函数,从而避免对响应分布(如泊松、二项、伽马等)的显式建模。该估计量对过/欠分散、重尾等分布误设问题具有鲁棒性,且其渐近性质不依赖于真实条件分布。方法不涉及核估计,因此无需选择平滑参数。作者推导了估计量的相合性和渐近正态性,并提供了R代码实现。对您而言,本文展示了一种在非参数/半参数框架下处理非负响应回归的简洁思路,与您熟悉的非参数统计和M估计理论直接相关,可作为处理零膨胀或比例数据时的一种稳健替代方案。
  • 关键技术: variational representation, assumption-lean estimation, M-estimation, nonnegative response regression, robust estimation
  • 为什么对您有用: 本文属于非参数/半参数理论方向,提出了一种无需分布假设的回归估计方法,与您熟悉的非参数统计和M估计理论高度契合。您可以用非常熟悉的M-estimation理论框架(very_familiar)直接分析该估计量的有限样本性质或扩展至高维设定。中期可做:若想进一步推导其半参数效率界,需在moderately_familiar的semiparametric theory上加强。

3. 10.1080/10618600.2024.2444373 — Fluid Correlation: A Novel Nonparametric Metric to Assess the Dynamic Association

  • 作者: Yongkai Chen, Shushan Wu, Ping Ma, Wenxuan Zhong
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: University of Georgia
  • 分类: vol 34 · issue 4 · pp 1331-1343
  • 相关性 6/10 · novelty: new_method
  • 摘要: 该论文针对随机过程之间动态关联的度量问题,提出了一种新的非参数指标——流体相关性(fluid correlation)。传统方法仅提供固定的全局关联度量,无法刻画随时间变化的动态关联。作者在并发回归模型(concurrent regression models)框架下定义流体相关性,通过惩罚全最小二乘法(penalized total least squares)在再生核希尔伯特空间(RKHS)中估计该指标,并构建了渐近贝叶斯置信带进行不确定性量化。该方法的核心在于利用RKHS的灵活性捕捉时变关联结构,同时通过惩罚项控制模型复杂度。理论结果包括估计量的渐近性质与置信带的覆盖概率。实证部分展示了流体相关性在微生物动态关联分析中的应用,揭示了环境因素驱动的生态系统变化。该工作对您可能有用:它属于非参数统计与统计计算(RKHS、惩罚估计)的交叉,与您熟悉的非参数统计和逆问题工具直接相关,可作为中期可做的方向——需先在RKHS理论(moderately_familiar)上加强,以评估其估计量的minimax最优性。
  • 关键技术: reproducing kernel Hilbert space, penalized total least squares, concurrent regression models, Bayesian confidence bands, nonparametric dynamic association
  • 为什么对您有用: 该论文直接连接您的非参数统计兴趣,特别是RKHS框架下的函数型数据建模。您的技术武器库中'非参数统计'和'逆问题'非常熟悉,可用于分析其估计量的收敛速率和置信带覆盖性质。但核心的RKHS理论(如核函数选择、惩罚参数调优)属于moderately_familiar,需先在此项上提升才能深入评估方法的理论最优性。中期可做:先系统学习RKHS的渐近理论(如核估计的minimax率),再检验本文的置信带是否达到最优。

数理统计 / 假设检验 (hypothesis_testing, 2 篇)

1. 10.1080/10618600.2024.2444302 · arXiv — Multivariate Quantile-Based Permutation Tests with Application to Functional Data

  • 作者: Zdeněk Hlávka, Daniel Hlubinka, Šárka Hudecová
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1276-1290
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文针对多元检验统计量的置换检验问题,提出一种基于最优传输(optimal measure transportation)的新方法。传统方法需将多元统计量通过组合函数(combining functions)降为一维,再计算置换p值;本文直接利用经验中心-外围分布函数(empirical center-outward distribution function)将多元置换统计量映射为单一p值,避免了中间步骤。该方法计算简单,且能分解各分量对整体非一致性得分的贡献,从而解释拒绝原假设的原因。作者还将最优传输应用于部分p值向量,作为经典组合函数的替代。通过蒙特卡洛模拟和函数型数据实例,与标准方法进行了系统比较。对您而言,本文的置换检验框架与您对假设检验的兴趣直接相关,且最优传输视角可能为高维或函数型数据的非参数检验提供新工具。
  • 关键技术: optimal measure transportation, center-outward distribution function, permutation tests, combining functions, multivariate test statistics
  • 为什么对您有用: 本文属于假设检验方向,直接对应您的primary interest中的'mathematical statistics (hypothesis testing)'。技术层面,您武器库中'nonparametric statistics'和'high-dimensional asymptotics'可用于分析其经验分布函数的收敛性;但核心工具'optimal transport'不在您的very_familiar或moderately_familiar列表中,因此属于暂不可做——需要先补充最优传输理论(如Wasserstein距离、中心-外围分布函数的渐近性质)才能跟进。不过,若您仅需理解其方法框架并考虑在函数型数据中应用,则作为gateway reading是合适的。

2. 10.1080/10618600.2025.2469756 · arXiv — Powerful Significance Testing for Unbalanced Clusters

  • 作者: Thomas H. Keefe, J. S. Marron
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1578-1590
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对高维聚类验证中的显著性检验问题,聚焦于候选簇大小不平衡(如罕见疾病亚型)时 SigClust 方法检验力严重不足的困境。作者首先从理论上揭示了原方法失效的原因:其基于 k-means 的聚类强度统计量在簇大小差异大时对空分布估计偏差敏感。提出的改进方法采用一种新的广义 k-means 聚类,通过调整簇内离差平方和的权重来平衡大小差异的影响,从而在保持平衡情形性能的同时大幅提升不平衡情形下的检验力。理论分析给出了新统计量在原假设下的渐近分布,并利用高维随机矩阵理论中的 Marchenko-Pastur 律刻画了协方差结构的影响。实证部分使用肾癌基因表达高维数据集展示了方法的实际价值,并提供了 Python 实现。对您而言,本文直接连接 hypothesis testing 和 high-dimensional statistics 两个 primary interest,且其利用 RMT 分析检验统计量分布的技术路径与您的武器库高度匹配。
  • 关键技术: SigClust, generalized k-means, Marchenko-Pastur law, high-dimensional hypothesis testing, cluster validation
  • 为什么对您有用: 本文直接连接您的 primary interest 中的 hypothesis testing 和 high-dimensional statistics(RMT)。技术层面,其利用 Marchenko-Pastur 律分析检验统计量渐近分布的做法,您可以用 very_familiar 的 RMT 工具复现或推广到其他聚类验证设定。中期可做:若想将类似思路扩展到更复杂的聚类结构(如重叠簇),需先在 moderately_familiar 的 M-estimation theory 上长肌肉以处理广义 k-means 的估计方程。

统计计算 / 算法 (stat_computing, 22 篇)

1. 10.1080/10618600.2025.2450458 — Enhancing Adaptive Spline Regression: An Evolutionary Approach to Optimal Knot Placement and Smoothing Parameter Selection

  • 作者: Anton Thielmann, Thomas Kneib, Benjamin Säfken
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Czech Academy of Sciences, Institute of Mathematics · Clausthal University of Technology · University of Göttingen
  • 分类: vol 34 · issue 4 · pp 1397-1409
  • 相关性 5/10 · novelty: application
  • 摘要: 本文针对非参数曲线拟合中自适应样条回归的 knot 位置与平滑参数联合优化问题,提出基于粒子群优化(PSO)的进化算法。标准方法通常独立优化 knot 和惩罚参数,忽略了二者的相互依赖,且难以处理多协变量、非正态数据或分布回归场景。作者将 knot 位置和惩罚参数编码为粒子群中的个体,通过群体智能搜索全局最优,适用于 B-spline、P-spline 等多种基函数,并扩展至 GAMLSS 和分位数回归。模拟和实证表明该方法在曲率突变或陡变效应下优于传统自适应方法。代码开源。对您而言,本文属于统计计算中的数值优化方法,与您的软件开发和算法兴趣直接相关,但方法学 novelty 有限——PSO 是成熟技术,主要贡献在于工程整合与实验验证。
  • 关键技术: particle swarm optimization, adaptive spline regression, knot placement, smoothing parameter selection, GAMLSS
  • 为什么对您有用: 本文属于统计计算方向,与您的 statistical computing(数值方法、算法)兴趣直接相关。您的 very_familiar 武器库中的软件开发和 high-dimensional asymptotics 可用于评估该方法的计算复杂度与收敛性,但核心优化器(PSO)并非您当前武器库中的强项——您对进化算法不熟悉,因此属于暂不可做:若想深入改进该方法,需先补充群体智能或贝叶斯优化方面的工具。作为 gateway reading,本文可让您了解自适应样条优化的工程现状,但方法学深度不足以进入 deep-read 列表。

2. 10.1080/10618600.2024.2435480 · arXiv — Inference of Multiple High-Dimensional Networks with the Graphical Horseshoe Prior

  • 作者: Claudio Busatto, Francesco Claudio Stingo
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1202-1213
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文提出一种新的全贝叶斯方法 mGHS,用于推断多个相关的高维精度矩阵。该方法基于 Horseshoe 先验的多元收缩先验,在组间共享稀疏模式,从而在精度矩阵相似时提升后验边选择性能,而在组独立时无性能损失。mGHS 还提供相似性矩阵估计,有助于理解组间网络相似性。后验推断采用高效的 Metropolis-within-Gibbs 算法,其中局部方差参数通过一种新颖的修正拒绝抽样算法从三参数 Gamma 分布中采样。该方法在变量数量上扩展性好,是估计多个精度矩阵最快的全贝叶斯方法之一。边选择采用基于模型切割的新方法。模拟和真实数据(共享单车、基因组)表明 mGHS 优于竞争方法。对您而言,本文的贝叶斯计算策略(特别是修正拒绝抽样)和模型切割边选择方法,可作为统计计算中算法设计的参考,但整体与您的主要兴趣方向(因果推断、高维统计、U-统计量)关联较弱。
  • 关键技术: Graphical Horseshoe prior, Metropolis-within-Gibbs, modified rejection sampling, three-parameter Gamma distribution, model cuts for edge selection, multiple precision matrix estimation
  • 为什么对您有用: 本文属于统计计算方向,与您的 primary interest 中的 statistical computing 直接相关。您武器库中 'software development' 和 'high-dimensional asymptotics' 可用于评估其算法效率和理论性质,但核心贝叶斯计算工具(MCMC、修正拒绝抽样)不在您的 very_familiar 或 moderately_familiar 列表中,因此属于暂不可做——缺乏贝叶斯计算和 MCMC 诊断的熟练度。作为 gateway reading,本文展示了贝叶斯高维推断的计算挑战和解决方案,但若您不计划深入贝叶斯方法,则阅读价值有限。

3. 10.1080/10618600.2025.2473936 · arXiv — A Cepstral Model for Efficient Spectral Analysis of Covariate-Dependent Time Series

  • 作者: Zeda Li, Yuexiao Dong
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1612-1624
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文提出一种基于倒谱系数(cepstral coefficients)的快速谱分析方法,用于研究协变量与重复时间序列功率谱之间的关联。模型采用协变量依赖的Cramér谱表示和半参数对数谱模型,将每个序列的对数谱用少量倒谱系数表示,从而建立以倒谱系数为响应的多元线性模型。估计分两阶段:第一阶段基于Whittle似然估计截断的倒谱系数,第二阶段估计多元线性模型参数及协变量效应函数。该方法通过截断倒谱系数实现降维,显著降低计算成本,且可灵活适配多种多元线性模型估计方法。数值实验表明,在保持简洁性和较短计算时间的同时,该方法优于若干现有方法。对您而言,本文的倒谱系数降维策略与您熟悉的统计计算(数值方法)方向直接相关,其两阶段估计框架和计算效率分析可作为您开发高效时间序列分析工具的参考。
  • 关键技术: cepstral coefficients, Whittle likelihood, semiparametric log-spectral model, multivariate linear model, two-stage estimation
  • 为什么对您有用: 本文属于统计计算方向,与您的primary interest中的统计计算(数值方法、算法)直接相关。您非常熟悉的软件开发和统计计算技能可直接用于复现或扩展其两阶段估计框架,例如优化倒谱系数截断选择或开发并行化Whittle似然估计。中期可做:若您希望在时间序列谱分析领域建立方法学贡献,可结合您moderately_familiar的M-estimation理论,为第二阶段的多元线性模型估计提供更严谨的渐近理论。

4. 10.1080/10618600.2025.2473932 · arXiv — Gibbs Sampling Using Anti-Correlation Gaussian Data Augmentation, with Applications to L1-Ball-Type Models

  • 作者: Yu Zheng, Leo L. Duan
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1601-1611
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对 L1-ball 型先验(一种 spike-and-slab 的推广,通过将连续 precursor 分布变换到 L1-ball 边界来诱导精确零点)提出了一种新的数据增广方法——反相关高斯(anti-correlation Gaussian)潜变量,用于加速后验计算。核心机制是引入一个潜变量抵消掉潜高斯分布中的二次指数项,使得感兴趣参数在给定潜变量后条件独立,从而可以整块更新(block Gibbs sampling)。与 No-U-Turn Sampler 等现有算法相比,该 blocked Gibbs 采样器每轮计算成本极低,且马尔可夫链混合迅速。在线性模型下建立了算法的几何遍历性保证,并进一步将算法推广到一般潜高斯模型(如多元截断高斯、潜高斯过程)的后验估计。对您而言,本文属于统计计算方向的具体算法创新,其 block Gibbs 设计思路(通过潜变量解耦参数依赖)可直接迁移到您在高维因果推断或 U-statistic 计算中遇到的 MCMC 加速问题,且几何遍历性证明为理论分析提供了模板。
  • 关键技术: anti-correlation Gaussian data augmentation, block Gibbs sampling, geometric ergodicity, L1-ball-type priors, latent Gaussian models
  • 为什么对您有用: 本文属于统计计算方向,直接对应 primary interest 中的 statistical computing。其核心技术——通过潜变量解耦参数依赖实现 block Gibbs——与您 very_familiar 中的高维渐近和软件工程经验结合,可立即用于加速您因果推断项目中的后验采样(如 IV 或 mediation 模型中的 MCMC)。几何遍历性证明也提供了理论验证模板。中期可做:若需将类似思路推广到非高斯潜变量模型,需先在 moderately_familiar 的 M-estimation 理论上补强。

5. 10.1080/10618600.2025.2459287 — Online Kernel-Based Mode Learning

  • 作者: Tao Wang, Weixin Yao
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: University of Victoria · Family Court of Australia · University of California, Riverside
  • 分类: vol 34 · issue 4 · pp 1498-1512
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对大数据场景下存在异常值和重尾分布的问题,提出了一种基于核模式目标函数的在线学习估计方法。该方法将模式回归嵌入在线学习框架,通过数据子集逐步更新历史信息,无需存储全部数据。具体地,利用所有数据子集的局部模式估计量生成的渐近分布函数,通过最小化加权最小二乘型损失函数来高效更新估计量。为数值优化,作者提出了改进的模式期望最大化算法,兼顾存储友好性和计算效率。在协变量同质且误差同方差的假设下,证明了所得估计量与基于全数据计算得到的模式估计量渐近等价。蒙特卡洛模拟和实证研究验证了有限样本性能。对您而言,本文的在线学习框架与核模式回归的结合,以及其计算效率的优化思路,可迁移至您在高维统计或因果推断中处理大规模流式数据的场景。
  • 关键技术: kernel mode regression, online learning, weighted least squares, mode expectation-maximization algorithm, asymptotic equivalence
  • 为什么对您有用: 本文属于统计计算方向,直接连接您的 primary interest 中的 statistical computing。其在线学习框架与核模式回归的结合,可启发您在高维统计或因果推断中处理大规模流式数据时的计算策略。您的 technical_arsenal 中 'software development' 和 'high-dimensional asymptotics' 可直接用于复现或扩展其算法,属于立即可做的范畴。

6. 10.1080/10618600.2025.2450463 · arXiv — Estimating the Hawkes Process From a Discretely Observed Sample Path

  • 作者: Feng Chen, Tsz-Kit Jeffrey Kwan, Tom Stindl
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1419-1431
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对离散观测的 Hawkes 过程参数估计问题,提出基于状态空间表示与序贯蒙特卡洛(SMC,即粒子滤波)的似然函数无偏估计方法。由于离散观测下似然函数难以直接计算,作者将 Hawkes 过程建模为不完全数据问题,利用 SMC 近似似然,并结合 Metropolis-Hastings 算法构建马尔可夫链以逼近似然分布或参数后验分布。该方法的核心优势在于:估计量无偏,且能直接计算参数置信区间,而现有基准方法(如基于矩或伪似然的方法)通常无法提供区间估计。模拟实验表明,所提估计量的均方误差显著小于两种基准方法。最后,作者将方法应用于东京麻疹周病例数据,并与基准方法对比。论文提供了 Julia 包实现及技术证明。对您而言,本文展示了统计计算中粒子滤波与 MCMC 结合解决实际推断问题的完整范例,其无偏似然估计思路可迁移至您熟悉的因果推断或高维统计中的复杂似然问题,但核心方法(SMC)不在您当前武器库中,属于暂不可做方向。
  • 关键技术: sequential Monte Carlo, particle filter, Metropolis-Hastings, state-space representation, unbiased likelihood estimation, Hawkes process
  • 为什么对您有用: 本文属于统计计算方法论文,与您的 primary interest 中的“statistical computing”直接相关。但核心工具 SMC/粒子滤波不在您的 technical_arsenal 中(very_familiar 和 moderately_familiar 均未覆盖),因此属于暂不可做方向。不过,其“无偏似然估计 + MCMC”的框架对您理解复杂模型的计算策略有参考价值,可作为 gateway reading 了解粒子滤波在统计推断中的角色。

7. 10.1080/10618600.2024.2446357 · arXiv — Bayesian Partial Reduced-Rank Regression

  • 作者: Maria F. Pintado, Matteo Iacopini, Luca Rossini, Alexander Y. Shestopaloff
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1344-1355
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文提出贝叶斯部分降秩回归(BPRR),将响应变量和系数矩阵划分为低秩组和满秩组,以克服传统降秩回归忽略响应变量间组结构的局限。核心贡献有二:一是从数据中推断低秩/满秩的组归属,二是条件于组归属后估计对应的秩。两者均在贝叶斯框架下实现,基于部分折叠Gibbs采样器,利用Laplace近似边际似然和Metropolized Shotgun随机搜索高效估计组分配。合成与真实数据实验展示了该方法揭示隐藏结构的能力。对您而言,该文的计算策略(部分折叠Gibbs、Laplace近似、随机搜索)属于统计计算中的实用数值方法,与您的statistical computing兴趣直接相关。
  • 关键技术: partially collapsed Gibbs sampler, Laplace approximation of marginal likelihood, Metropolized Shotgun Stochastic Search, Bayesian reduced-rank regression, group allocation inference
  • 为什么对您有用: 本文属于statistical computing方向,提出了一种结合部分折叠Gibbs采样和Laplace近似的贝叶斯计算框架,属于您primary interest中的统计计算(numerical methods, algorithm)。您的武器库中software development和high-dimensional asymptotics可以用于评估该算法的收敛性和计算效率,但核心的贝叶斯计算工具(部分折叠Gibbs、随机搜索)您并不熟悉,属于暂不可做——需要先补充贝叶斯计算的基础知识。不过,作为gateway reading,本文清晰展示了贝叶斯降秩回归的计算流程,适合了解该领域的基本思路。

8. 10.1080/10618600.2024.2441165 · arXiv — AutoGFI: Streamlined Generalized Fiducial Inference for Modern Inference Problems in Models with Additive Errors

  • 作者: Wei Du, Jan Hannig, Thomas C. M. Lee, Yi Su, Chunzhe Zhang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1214-1225
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文提出 AutoGFI,一种简化的广义 fiducial 推断(GFI)方法,专门针对加性噪声模型。传统 GFI 需要复杂的数学推导和 MCMC 实现,而 AutoGFI 仅需一个拟合函数即可生成后验样本,大幅降低了使用门槛。方法核心是将 GFI 的结构性随机微分方程转化为基于残差 bootstrap 的采样方案,避免了显式似然或梯度计算。作者将 AutoGFI 应用于张量回归、矩阵补全和网络凝聚性回归三个现代高维问题,展示了其与专用方法(如贝叶斯张量回归、核范数正则化)相当的竞争性能。理论部分证明了在正则条件下 AutoGFI 的 Bernstein-von Mises 性质,即后验分布渐近正态且覆盖真实参数。对您而言,本文提供了一个“即插即用”的推断工具,特别适合您在高维统计和统计计算方向中需要快速不确定性量化(如张量分解或矩阵补全)的场景。
  • 关键技术: generalized fiducial inference, residual bootstrap, Bernstein-von Mises theorem, tensor regression, matrix completion, network cohesion regression
  • 为什么对您有用: 本文直接连接您的统计计算兴趣,特别是软件开发和算法实现。AutoGFI 的“仅需拟合函数”设计理念与您熟悉的软件工程思维高度契合,您可以用 very_familiar 的软件开发技能快速实现原型。中期可做:将 AutoGFI 扩展到您 moderately_familiar 的 HOIF 框架中,为高维因果推断提供不确定性量化——这需要先在 moderately_familiar 的 semiparametric theory 上提升对 GFI 与 influence function 关系的理解。

9. 10.1080/10618600.2024.2441986 · arXiv — Nonstationary Spatial Modeling of Massive Global Satellite Data

  • 作者: Huang Huang, Lewis R. Blake, Matthias Katzfuss, Dorit M. Hammerling
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: King Abdullah University of Science and Technology · Colorado School of Mines · Texas A&M University
  • 分类: vol 34 · issue 4 · pp 1226-1239
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对全球卫星遥感数据(如MODIS海表温度)的统计推断问题,目标是从不完整、含噪声的Level 2观测构建完整、高分辨率的Level 3格点场并量化不确定性。核心挑战是数据规模巨大(超过4300万观测)和全球过程的非平稳性。作者提出一种多分辨率近似(M-RA)的高斯过程模型,其非平稳全局协方差函数通过局部拟合获得,并针对海表温度应用设计了考虑陆地屏障的领域划分策略。计算实现面向分布式内存的高性能计算环境,据称是迄今用概率GP模型分析的最大数据集。与平稳方法相比,非平稳模型显著提升了预测性能。对您而言,本文展示了大规模空间统计计算中处理非平稳性与计算可扩展性的实用策略,其M-RA框架和分布式计算实现可作为您统计计算兴趣中处理大规模矩阵/张量问题的参考案例。
  • 关键技术: multi-resolution approximation (M-RA), Gaussian process, nonstationary covariance, distributed-memory computing, domain partitioning
  • 为什么对您有用: 本文属于统计计算(大规模空间统计)方向,是您secondary interest中astrostats的gateway-reading候选——它清晰展示了遥感数据的结构(噪声、缺失、非平稳性)和建模框架(GP、M-RA),适合作为入门读物。您的武器库中'nonparametric statistics'和'high-dimensional asymptotics'可帮助理解其GP近似理论,但核心计算技巧(分布式M-RA)不在very_familiar中,属于'暂不可做'——需先熟悉大规模GP近似方法(如Vecchia近似、tapering)才能跟进。不过,本文的领域划分思路与您熟悉的treewidth/tensor-contraction视角有潜在联系(划分策略影响计算图结构),值得花时间读全文以评估是否可迁移。

10. 10.1080/10618600.2025.2486728 — Simultaneous Outlier Detection and Prediction for Kriging with True Identification

  • 作者: Youjie Zeng, Zhanfeng Wang, Youngjo Lee, Niansheng Tang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: University of Science and Technology of China · Seoul National University · Yunnan University
  • 分类: vol 34 · issue 4 · pp 1717-1728
  • 相关性 3/10 · novelty: new_method
  • 摘要: 本文针对 Kriging 模型中异常值同时检测与预测的问题,提出了一种基于 normal-gamma 先验的新方法。该方法通过引入无界惩罚项来区分异常值与正常数据点,避免了传统 MCMC 的高计算成本,开发了简单高效的算法。在 increasing domain 框架下,作者证明了异常值检测的 true identification property 以及超参数估计的相合性,即方法能像事先已知异常值位置和数量一样准确识别。同时,在存在异常值的条件下,证明了预测的信息一致性。数值模拟和实际数据案例表明,该方法在异常值存在时能提供稳健的分析结果。对您而言,本文在统计计算方面展示了如何将贝叶斯先验与高效算法结合以解决空间统计中的鲁棒性问题,其算法设计思路(避免 MCMC 的近似推断)对您开发统计软件或处理高维计算问题有参考价值。
  • 关键技术: normal-gamma prior, unbounded penalty, true identification property, increasing domain asymptotics, information consistency
  • 为什么对您有用: 本文属于统计计算与空间统计的交叉,其核心贡献在于提出了一种无需 MCMC 的高效算法,这与您 primary interest 中的 'statistical computing (numerical methods, algorithm)' 直接相关。您武器库中 'very_familiar' 的 'software development' 和 'high-dimensional asymptotics' 可用于复现或扩展其算法(例如,将其惩罚机制推广到更高维的协变量空间)。中期可做:若想将其算法思想迁移到因果推断中的空间数据异常值检测,需先在 'moderately_familiar' 的 'identification theory in causal inference' 上建立空间因果框架。

11. 10.1080/10618600.2025.2490264 — ProSpar-GP: Scalable Gaussian Process Modeling with Massive Nonstationary Datasets

  • 作者: Kevin Li, Simon Mak
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Duke University
  • 分类: vol 34 · issue 4 · pp 1742-1759
  • 相关性 3/10 · novelty: new_method
  • 摘要: 针对大规模非平稳数据集的 GP 建模,提出 ProSpar-GP 方法。该方法采用 product-of-experts 框架,将多个稀疏 GP 专家放置于不同的局部非平稳区域,每个专家通过变分推断拟合,并利用 mini-batching 和 GPU 加速优化诱导点和长度尺度参数。理论证明了 ProSpar-GP 的 Kolmogorov 一致性,即其生成分布定义了预测空间上的有效随机过程,这为变分推断提供了稳定性保障。数值实验和卫星阻力模拟器代理建模应用表明,ProSpar-GP 在预测精度和计算效率上优于现有方法。该方法对您作为统计计算方向的研究者具有参考价值,特别是其结合变分推断与 GPU 加速的策略,以及处理非平稳性的 product-of-experts 框架,可迁移至您在高维统计或因果推断中涉及大规模数据建模的场景。
  • 关键技术: Product-of-Experts, Sparse Gaussian Process, Variational Inference, Mini-batching, GPU Acceleration, Kolmogorov Consistency
  • 为什么对您有用: 本文属于统计计算方向,直接对应您的 primary interest 中的 'statistical computing (numerical methods, algorithm)'。您武器库中的 'software development' 和 'nonparametric statistics' 可用于复现或改进其变分推断与 GPU 加速的代码实现。中期可做:若您想将此类 scalable GP 方法应用于因果推断中的非平稳响应面建模,需先在 'M-estimation theory' 上提升,以理解其变分推断的渐近性质。

12. 10.1080/10618600.2025.2475141 · arXiv — Enhancing Scalability in Bayesian Nonparametric Factor Analysis of Spatiotemporal Data

  • 作者: Yifan Cheng, Cheng Li
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1655-1669
  • 相关性 3/10 · novelty: new_method
  • 摘要: 本文针对贝叶斯非参数因子模型在中等规模时空数据上的计算瓶颈,提出了一套加速后验采样的算法框架。标准模型使用可分离的时间潜因子和空间因子载荷,并采用stick-breaking过程先验实现空间位置聚类,但时空维度增至数百时MCMC计算成本极高。作者引入了一种新的切片采样算法,允许各潜因子的空间混合成分数量在迭代中变化且保证非增,从而有效减少混合参数数量。同时,提出了空间潜最近邻高斯过程先验和针对stick-breaking过程中空间变化潜变量的序贯更新算法。新模型和采样算法在计算可扩展性和存储效率上显著提升,并在时空预测和空间聚类上保持强大的推断能力。大量模拟实验验证了计算效率和推断性能的改进。该工作对您的主要兴趣——统计计算(数值方法与算法)有直接参考价值,特别是切片采样和序贯更新策略可迁移至其他高维贝叶斯模型。
  • 关键技术: slice sampling, stick-breaking process prior, nearest-neighbor Gaussian process, sequential updating algorithm, Bayesian factor model, spatiotemporal data
  • 为什么对您有用: 本文直接对应您的主要兴趣——统计计算(数值方法与算法),提出了针对高维贝叶斯模型的可扩展采样算法。您的武器库中'软件开发和M-estimation理论'可用于评估其序贯更新算法的收敛性和计算复杂度,但核心的贝叶斯非参数工具(stick-breaking、NNGP)属于moderately_familiar范畴,需先熟悉这些先验结构才能动手改进。中期可做:先补强贝叶斯非参数建模(moderately_familiar),再尝试将切片采样策略推广至其他因子模型。

13. 10.1080/10618600.2025.2452935 · arXiv — Dynamic Supervised Principal Component Analysis for Classification

  • 作者: Wenbo Ouyang, Ruiyang Wu, Ning Hao, Hao Helen Zhang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1446-1455
  • 相关性 3/10 · novelty: new_method
  • 摘要: 本文针对高维空间中类别分布随时间或索引变量动态变化的问题,提出了一种动态监督主成分分析(DSPCA)框架。该方法通过核平滑技术识别最优子空间,实现监督降维,并分别应用于线性判别分析(LDA)和二次判别分析(QDA)。核心机制是:在索引变量邻域内加权估计类内和类间散度矩阵,再提取判别方向,从而得到随索引变化的决策规则。理论部分给出了子空间估计的收敛速率,并讨论了带宽选择的影响。数值模拟和真实数据实验表明,该方法在分类精度和计算效率上均有显著提升。对您而言,本文的核平滑降维策略与您在高维统计和统计计算方面的兴趣相关,其计算效率分析可借鉴到您熟悉的软件开发和算法设计工作中。
  • 关键技术: kernel smoothing, supervised dimension reduction, linear discriminant analysis, quadratic discriminant analysis, dynamic classification
  • 为什么对您有用: 本文属于统计计算方法在动态分类中的应用,与您的统计计算(算法)兴趣直接相关。您武器库中'非参数统计'和'高维渐近理论'可用于分析其核平滑估计的收敛性,而'软件开发'经验可帮助复现或扩展其算法。本文是入门级方法论文,值得花时间读全文以了解动态降维的通用框架。

14. 10.1080/10618600.2025.2455135 · arXiv — Generative Neural Networks for Characteristic Functions

  • 作者: Florian Brück
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1456-1465
  • 相关性 3/10 · novelty: new_method
  • 摘要: 本文提出一种基于生成神经网络的模拟算法,用于从仅能以黑箱形式访问的(多元)特征函数中采样。该方法利用最大均值差异(MMD)度量的特定表示来构建损失函数,从而直接融入目标特征函数,无需任何分布假设或维度限制。算法具有通用性,不依赖于特征函数的解析形式,且推导了关于MMD度量的近似质量的有限样本保证。模拟研究展示了该方法在多种特征函数设定下的有效性。该工作为统计计算中一类重要的模拟问题提供了新工具,尤其适用于特征函数已知但密度或分布函数难以解析表达的场景。对您而言,该文连接了统计计算与生成模型,其有限样本保证的推导思路可能对您在高维统计或因果推断中处理复杂分布模拟有借鉴价值。
  • 关键技术: Generative neural network, Maximum Mean Discrepancy (MMD), Characteristic function, Black-box simulation, Finite-sample guarantees
  • 为什么对您有用: 本文属于统计计算方向,直接对应您的primary interest中的统计计算(数值方法与算法)。其核心方法——利用MMD度量匹配特征函数——是一种新颖的模拟策略,您可以用very_familiar的软件开发和high-dimensional asymptotics工具来评估其在高维设定下的计算效率与收敛性。中期可做:若您希望将此类生成式模拟方法应用于因果推断中的反事实分布生成,需先在moderately_familiar的identification theory上加强,以理解分布匹配与因果estimand的衔接。

15. 10.1080/10618600.2024.2447478 · arXiv — Stochastic Gradient Descent-based Inference for Dynamic Network Models with Attractors

  • 作者: Hancong Pan, Xiaojing Zhu, Cantay Caliskan, Dino P. Christenson, Konstantinos Spiliopoulos, Dylan Walker et al.
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1366-1375
  • 相关性 3/10 · novelty: new_method
  • 摘要: 本文针对动态网络模型 CLSNA(Coevolving Latent Space Networks with Attractors)提出基于随机梯度下降(SGD)的参数估计方法,替代原有的 MCMC 方案。CLSNA 在潜在空间中刻画节点间的吸引/排斥力,但 MCMC 计算成本高且要求节点全程存在。作者引入 SGD 进行参数估计,并开发了基于 SGD 的不确定性量化方法,同时扩展模型以允许节点随时间加入或离开。模拟表明,SGD 方法在精度上与 MCMC 相当,但可扩展至更大网络。实证部分应用于美国国会议员在 X 平台上的纵向社交网络,发现共和党内部存在独特且日益增强的排斥力。本文的方法学贡献在于将 SGD 与不确定性量化引入动态网络模型,解决了可扩展性和节点动态性问题。对您而言,该工作展示了 SGD 在复杂统计模型(动态网络)中的计算优势,与您的统计计算兴趣直接相关,且其不确定性量化方法可迁移至其他大规模模型。
  • 关键技术: Stochastic Gradient Descent, uncertainty quantification via SGD, latent space network models, dynamic network with node dynamics, MCMC vs SGD scalability
  • 为什么对您有用: 本文属于统计计算方向,直接对应您的 primary interest 中的 statistical computing。SGD 参数估计与不确定性量化是您 very_familiar 的软件开发和 high-dimensional asymptotics 可攻的口子——您可以用 minimax 视角分析 SGD 估计量的收敛率,或利用高阶 U-stat 的树宽视角评估其计算复杂度。中期可做:若想深入不确定性量化的理论保证,需先在 moderately_familiar 的 M-estimation theory 上长肌肉。

16. 10.1080/10618600.2024.2442000 · arXiv — Generative Filtering for Recursive Bayesian Inference with Streaming Data

  • 作者: Ian Taylor, Andee Kaplan, Brenda Betancourt
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1263-1275
  • 相关性 3/10 · novelty: new_method
  • 摘要: 本文针对流式数据场景下的递归贝叶斯推断问题,提出了一种名为 Generative Filtering 的新方法。传统滤波方法(如粒子滤波)在多次递归更新后会出现样本退化(degeneracy)问题,即有效粒子数减少。Generative Filtering 通过并行更新策略,在保留滤波方法计算速度的同时,避免了重复应用后的分布退化。作者推导了该方法的收敛速率,并给出了使用充分统计量替代全数据存储的条件。通过模拟实验和一个生态学时间序列计数数据的应用,验证了该方法在缓解滤波退化方面的有效性。对您而言,本文属于统计计算方向的方法学贡献,其并行更新和退化缓解策略可能对您在高维或流式数据场景下的计算工具有启发。
  • 关键技术: Generative Filtering, recursive Bayesian inference, parallel updates, filter degeneracy, sufficient statistics, convergence rates
  • 为什么对您有用: 本文属于统计计算方向,直接对应您的 primary interest 中的 statistical computing。其核心问题是流式数据下的高效递归推断,与您熟悉的非参数统计和因果推断中的纵向数据设定有潜在交集。从技术武器库看,您对软件开发和算法实现非常熟悉,因此可以快速理解并复现其并行更新机制,属于立即可做的范畴——您可以直接评估该方法在您关注的因果推断(如纵向数据中的时变处理效应估计)中的适用性。

17. 10.1080/10618600.2024.2444313 — An Extension of the Unified Skew-Normal Family of Distributions and its Application to Bayesian Binary Regression

  • 作者: Paolo Onorati, Brunero Liseo
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: University of Padua · Sapienza University of Rome
  • 分类: vol 34 · issue 4 · pp 1291-1304
  • 相关性 3/10 · novelty: new_method
  • 摘要: 本文针对贝叶斯二元回归模型,提出了一类新的分布族——扰动统一偏正态(pSUN)分布,它是统一偏正态(SUN)分布的推广。核心贡献在于证明了当链接函数可表示为高斯CDF的尺度混合时,pSUN分布族对任何二元回归模型都是共轭的。对于流行的logit回归模型,结合高斯先验后,后验累积量和归一化常数可通过重要性采样高效计算,从而简化变量选择。对于更一般的先验分布,作者提供了简单的Gibbs采样算法。模拟和实际数据分析表明,在p>n的高维设定下,该方法在混合速度和精度上均优于现有方法。作者还提供了R包pSUN。该工作对您可能有用:它直接关联到您的统计计算兴趣,特别是贝叶斯计算中的共轭先验构造和重要性采样方法,且提供了可直接使用的软件工具。
  • 关键技术: Unified Skew-Normal (SUN) distribution, scale mixture of Gaussian CDFs, importance sampling, Gibbs sampling, conjugate prior, Bayesian binary regression
  • 为什么对您有用: 本文直接关联到您的统计计算兴趣,特别是贝叶斯计算中的共轭先验构造和重要性采样方法。您武器库中的'软件发展'技能可直接用于评估或扩展其R包pSUN的功能。中期可做:若您想深入理解其共轭性证明,需先在'半参数理论'上稍作提升,因为其尺度混合表示与半参数模型有联系。

18. 10.1080/10618600.2025.2485278 — Can You See The Change? Change Point Detection Using Visual Inference

  • 作者: Miguel Antonio Fudolig, Emily A. Robinson, Susan VanderPlas
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: University of Nevada, Reno · California Polytechnic State University · University of Nebraska–Lincoln
  • 分类: vol 34 · issue 4 · pp 1705-1716
  • 相关性 2/10 · novelty: application
  • 摘要: 本文通过视觉推理实验研究人类在散点图中检测变化点的能力,并与传统统计方法进行对比。实验采用平衡不完全区组设计,让参与者从一组散点图中选出最异常的一张,该图在垂直方向上有偏移。研究发现,参与者对较大偏移幅度的识别准确率更高,这与传统变化点检测方法一致;方差较大的数据识别率较低。偏移方向和变化点位置在低信噪比场景下对识别效果有显著影响。参与者对正确和错误选择的解释各不相同,且置信度与高信噪比下的识别准确率正相关。该工作揭示了人类视觉感知在变化点检测中的复杂性,为统计计算中的可视化方法提供了实证基础。对您而言,本文属于统计计算与可视化交叉的实证研究,可作为入门读物了解视觉推理实验的设计与分析框架。
  • 关键技术: visual inference, change point detection, balanced incomplete block design, signal-to-noise ratio, human perception experiment
  • 为什么对您有用: 本文属于统计计算与可视化交叉的实证研究,是gateway-reading范畴。武器库中'软件开发和统计计算'可支撑理解其实验设计和分析方法,但核心是心理学实验而非方法论创新,因此暂不可做——缺少实验设计(如BIBD分析)和视觉感知建模的专门工具。不过,作为入门读物,它清晰展示了如何用可视化方法评估统计问题,值得花时间读全文以了解该领域的研究范式。

19. 10.1080/10618600.2025.2468791 · arXiv — A New Projection Pursuit Index for Big Data

  • 作者: Yajie Duan, Javier Cabrera, Birol Emir
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1566-1577
  • 相关性 2/10 · novelty: application
  • 摘要: 本文针对大数据可视化中传统投影寻踪(Projection Pursuit, PP)索引计算成本过高的问题,提出了一种新的PP索引,该索引与数据压缩方法Data Nuggets结合,能在保持原始数据结构的前提下大幅降低计算量。方法的核心是将Guided Tour与Grand Tour框架整合,利用新PP索引动态生成低维投影序列,以发现聚类、离群点及非线性结构。在模拟和真实大数据应用中验证了其有效性,并提供了静态与动态图形工具。对您而言,本文属于统计计算与算法方向,其核心贡献在于计算效率而非理论创新,可作为gateway reading了解大数据可视化中的计算权衡。
  • 关键技术: Projection Pursuit, Guided Tour, Grand Tour, Data Nuggets, data compression for visualization
  • 为什么对您有用: 本文属于统计计算方向,与您的primary interest中的'statistical computing (numerical methods, algorithm)'直接相关。您武器库中'very_familiar'的'软件开发和high-dimensional asymptotics'可用于评估其Data Nuggets压缩的近似误差界,但核心的投影索引设计并非您熟悉的工具。本文是gateway reading,适合快速了解大数据可视化中的计算-精度权衡,但方法学深度有限,暂不可做后续拓展。

20. 10.1080/10618600.2025.2450461 — A Flexible Framework for Synthesizing Categorical Sequences with Application to Human Activity Patterns

  • 作者: Zuofu Huang, Julian Wolfson, Jayne A. Fulkerson, Ryan Demmer, Helen N. Chen
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: University of Minnesota · WinnMed · Indiana University – Purdue University Indianapolis
  • 分类: vol 34 · issue 4 · pp 1410-1418
  • 相关性 2/10 · novelty: application
  • 摘要: 本文针对移动应用和传感器产生的多天连续分类序列数据,提出了一种灵活的数据合成框架 paired Markov Chain (paired-MC)。该方法通过配对马尔可夫链建模序列的转移概率,能够生成高度逼真的合成序列,同时提供直观的机制来修改序列特征(如活动模式的时间分布)。在两项真实数据集(智能手机应用记录的人类日常活动时间使用模式、可穿戴加速度计测量的体力活动强度)上,paired-MC 在保留关键特征(如活动持续时间分布、转换模式)方面优于现有方法(如传统马尔可夫链、隐马尔可夫模型)。该方法的核心优势在于平衡了真实性与可参数化性,适用于隐私保护、缺失数据插补和统计方法评估。对您而言,本文提供了一个实用的统计计算工具,其 paired-MC 框架可直接应用于您感兴趣的流行病学队列研究中的活动模式合成,且其序列建模思路与您在高维统计和因果推断中处理纵向数据的需求有潜在连接。
  • 关键技术: paired Markov Chain, categorical sequence synthesis, transition probability modeling, data augmentation, activity pattern analysis
  • 为什么对您有用: 本文属于统计计算(数据合成)方向,与您的 primary interest 中的 statistical computing 直接相关。您武器库中 very_familiar 的软件开发和 high-dimensional asymptotics 可用于评估 paired-MC 的统计性质或扩展其到高维分类序列。中期可做:若您想将 paired-MC 用于因果推断中的纵向数据模拟(如模拟反事实序列),需先在 moderately_familiar 的 identification theory 上熟悉如何将合成数据与因果 estimand 连接。

21. 10.1080/10618600.2025.2476097 — Perception and Cognitive Implications of Logarithmic Scales for Exponentially Increasing Data: Perceptual Sensitivity Tested with Statistical Lineups

  • 作者: Emily A. Robinson, Réka Howard, Susan VanderPlas
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: California Polytechnic State University · University of Nebraska–Lincoln
  • 分类: vol 34 · issue 4 · pp 1680-1691
  • 相关性 1/10 · novelty: application
  • 摘要: 本文通过视觉推理实验(statistical lineups)研究了对数尺度在展示指数增长数据时对感知灵敏度的影响。实验要求参与者从一组图中识别出与其他图最不同的面板,比较了线性尺度与对数尺度在不同曲率数据下的表现。结果显示,两种尺度各有优势,取决于数据曲率的大小。该研究是系列三篇论文的首篇,旨在建立对数尺度可视化设计的细致指南。文章还展示了多模态图形测试方法,考察了不同交互层次下的图形认知效果。对您而言,本文属于统计计算与可视化交叉领域,虽然不直接涉及您的主要理论兴趣,但作为统计计算中图形设计原则的实证研究,可作为入门阅读了解可视化实验设计。
  • 关键技术: statistical lineups, visual inference, logarithmic transformation, perceptual sensitivity, multi-modal graphical testing
  • 为什么对您有用: 本文属于统计计算中的可视化实证研究,与您的secondary interest 'statistical computing' 相关。作为gateway reading,它清晰展示了统计lineup实验的设计流程和数据收集方式,适合了解可视化评估方法。武器库中'软件发展'项可支撑您复现或扩展此类实验,但核心问题(感知认知)不在您的主要技术栈内,属于暂不可做方向。

22. 10.1080/10618600.2025.2469757 — Biplots for the Correlation Matrix

  • 作者: Jan Graffelman
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Polytechnic University of Puerto Rico · University of Washington · Universitat Politècnica de Catalunya
  • 分类: vol 34 · issue 4 · pp 1591-1600
  • 相关性 1/10 · novelty: new_method
  • 摘要: 本文研究相关矩阵的双标图(biplot)可视化问题。经典的双标图通过主成分分析(PCA)对相关矩阵进行低秩近似,但作者指出,传统的中心化操作(如减去总体均值、列均值或行列均值)在可视化相关矩阵时会导致拟合优度次优。本文提出使用单标量调整、列标量调整或行列标量调整(通过加权交替最小二乘算法)来更灵活地拟合相关矩阵,从而改进低维近似的加权均方根误差。核心贡献在于:开发了一种迭代算法用于列调整,相比单标量调整能显著提升拟合优度;同时引入“相关计数棒”(correlation tally sticks)来增强双标图的可读性。实验部分通过实际数据集比较了不同方法的加权RMSE,展示了列调整在保留相关结构方面的优势。对您而言,本文属于统计计算与可视化方法,虽然不直接涉及因果推断或高维理论,但其矩阵低秩近似与加权最小二乘算法对您开发统计软件或处理相关矩阵可视化有参考价值。
  • 关键技术: weighted alternating least squares, low-rank approximation, correlation biplot, principal component analysis, correlation tally sticks, weighted root mean squared error
  • 为什么对您有用: 本文属于统计计算与可视化方向,与您的primary interest中的“statistical computing (numerical methods, algorithm)”直接相关。您武器库中的“software development”和“high-dimensional asymptotics”可用于评估其算法的收敛性与计算效率;特别是加权交替最小二乘的迭代算法,您可以用“nonparametric statistics”中的经验过程工具分析其估计稳定性。中期可做:若您想深入改进该算法(如加速收敛或处理高维稀疏相关矩阵),需先在“moderately_familiar”的“M-estimation theory”上加强,因为加权最小二乘可视为M估计的特例。

其他 (other, 14 篇)

1. 10.1080/10618600.2025.2451680 · arXiv — Variable Selection and Basis Learning for Ordinal Classification

  • 作者: Minwoo Kim, Sangil Han, Jeongyoun Ahn, Sungkyu Jung
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1432-1445
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对高维序数分类问题,提出了一种同时进行变量选择与基学习的方法。该方法扩展了稀疏多分类线性判别分析,核心创新在于为每个变量计算一个“序数权重”,该权重衡量变量组均值是否与响应变量的序数顺序一致,并对权重较小的变量施加更强的惩罚。通过一个两步构造过程,序数权重能以高概率正确区分序数变量与非序数变量。在维度远大于样本量的高维渐近框架下,证明了所提方法能根据可调参数的选择,一致地选择出判别变量或同时选择出序数与判别变量。此外,还讨论了在选出的判别变量中后筛选序数变量的两步程序。模拟与真实数据分析表明,该方法能提供稀疏且可解释的基,其基主要由序数变量构成。
  • 关键技术: sparse multiclass LDA, ordinal weight, variable selection, basis learning, high-dimensional asymptotics
  • 为什么对您有用: 本文属于高维分类与变量选择的方法学工作,与您的主要兴趣(高维统计、假设检验)有间接关联,但核心问题(序数分类的基学习)与您的因果推断、半参效率等核心方向距离较远。技术上,其序数权重的构造与高维一致性证明可视为一种特殊的假设检验问题,但武器库中的工具(如minimax界、U统计量)在此处并无直接应用口子。暂不可做:核心机器(序数分类的特定损失函数与权重构造)不在武器库中,且该问题与您的主要研究方向交集有限,不值得投入时间深入阅读。

2. 10.1080/10618600.2024.2434181 · arXiv — Truly Multivariate Structured Additive Distributional Regression

  • 作者: Lucas Kock, Nadja Klein
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1189-1201
  • 相关性 5/10 · novelty: application
  • 摘要: 本文针对高维响应变量的分布回归问题,提出了一种真正多变量的结构化加性分布回归模型。现有GAMLSS方法主要适用于单变量或双变量响应,当响应维度大于2或3时,计算和理论都极为困难。作者利用高斯copula建模响应变量的依赖结构,同时允许各边缘分布灵活变化,从而将GAMLSS的灵活性扩展到高维情形。模型高度参数化,但通过贝叶斯推断结合收缩先验实现可估计。模拟研究验证了方法的竞争力,并在儿童营养不良和柏林交通检测两个实际数据集上展示了其应用价值。本文主要贡献在于填补了高维响应分布回归的方法空白,但核心工具(高斯copula、贝叶斯收缩先验)在统计推断上较为常规。
  • 关键技术: Gaussian copula, GAMLSS, Bayesian shrinkage priors, structured additive regression, multivariate distributional regression
  • 为什么对您有用: 本文属于统计计算与贝叶斯方法的交叉应用,与您的主要兴趣(统计计算、高维统计)有间接关联。但核心方法(高斯copula+贝叶斯收缩)不在您的技术武器库中(您对贝叶斯推断不熟悉),且缺乏您关注的因果推断或半参效率理论元素。作为gateway阅读,本文对高维分布回归的建模思路有参考价值,但暂不可做——需要先补充贝叶斯高维推断的工具。

3. 10.1080/10618600.2025.2459285 — Sample-Specific Learning of Lymphovascular Invasion with Heterogeneous Spatial Patterns

  • 作者: Shih-Ting Huang, Robert B. West, Belén Rivero-Gutiérrez, Graham A. Colditz, Shu Jiang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Stanford University
  • 分类: vol 34 · issue 4 · pp 1487-1497
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对淋巴血管侵犯(LVI)的早期诊断问题,利用多重免疫荧光成像数据,提出了一种样本特异性的学习框架。核心设定是每个个体的活检图像存在显著的空间异质性,因此需要为每个样本单独建模。方法上,作者将 l1-惩罚逻辑回归与样本特异性学习结合,并推导了所提估计量的有限样本保证。算法方面,给出了计算高效的实现以支持实时分类。模拟研究验证了有限样本性能,并在斯坦福队列的内部和外部验证中展示了与病理学家标注的高度一致性。该工作主要面向医学影像分类应用,方法学贡献在于样本特异性框架与高维惩罚回归的结合,但未涉及因果推断、半参效率或高维随机矩阵等核心兴趣方向。
  • 关键技术: l1-penalized logistic regression, sample-specific learning, finite sample guarantees, multiplex immunofluorescence imaging
  • 为什么对您有用: 本文属于应用统计方法在医学影像分类中的工作,与您的主要兴趣(因果推断、高维统计、半参理论)无直接交集。武器库中的非参数统计或高维渐近工具可帮助理解其有限样本保证的推导,但核心问题(LVI分类)并非您的研究方向。作为流行病学领域的应用论文,它展示了真实数据(斯坦福队列)的分析流程,但方法学新颖性有限,不值得投入全文阅读。

4. 10.1080/10618600.2025.2458504 — Bayesian Regularized Regression Copula Processes for Multivariate Responses

  • 作者: Nadja Klein, Michael Stanley Smith, Ryan A. Chisholm, David J. Nott
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Karlsruhe Institute of Technology · Computing Center · The University of Melbourne · National University of Singapore
  • 分类: vol 34 · issue 4 · pp 1466-1479
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文提出一种基于回归copula过程的多变量响应分布回归模型。该模型利用高斯多变量回归的隐式copula,称为“回归copula过程”,以灵活刻画响应变量在协变量空间上的联合依赖结构。为处理高维协变量,作者将回归系数正则化,并创新性地引入了马蹄先验的多变量扩展版本。贝叶斯推断和分布预测采用高效的变分推断方法实现,适用于大规模数据集。该方法的一个关键优势是响应向量的边际分布可分别且准确地估计,从而使预测分布具有边际校准性质。文章通过两个应用展示了其有效性:一是对澳大利亚区域半小时电价的经济计量建模与预测,二是对树木物种丰度模型进行似然自由推断(LFI)中的多变量后验评估。对于您而言,本文的变分推断与正则化先验设计在统计计算方面有参考价值,但其核心方法(copula过程与多变量回归)与您的主要研究兴趣(因果推断、高维统计、U-统计量等)关联较弱。
  • 关键技术: Gaussian copula process, multivariate horseshoe prior, variational Bayes, distributional regression, marginal calibration
  • 为什么对您有用: 本文属于统计计算与贝叶斯方法范畴,与您的主要兴趣(因果推断、高维RMT、U-统计量)直接关联较弱。其变分推断和正则化先验设计在统计计算方面有参考价值,但核心方法(copula过程与多变量回归)并非您武器库中可直接攻克的点。作为gateway阅读,本文对统计计算方向有一定入门价值,但整体相关性不高。

5. 10.1080/10618600.2024.2441997 — Martingale Posterior Inference for Finite Mixture Models and Clustering

  • 作者: Carlos E. Rodríguez, Ramsés H. Mena, Stephen G. Walker
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Universidad Nacional Autónoma de México · The University of Texas at Austin
  • 分类: vol 34 · issue 4 · pp 1253-1262
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文在有限混合模型(未知分量数)的框架下,采用鞅后验推断(Martingale posterior inference)来量化聚类的不确定性。核心思想是为未知参数构造合适的鞅,从而绕过贝叶斯分析中常见的标签交换问题(label-switching problem),直接对聚类进行后验分析。该方法进一步扩展到有限总体设定,利用混合模型对缺失部分进行插补,并对感兴趣的参数进行推断。通过四个真实数据集展示了所提方法的实用性。对您而言,本文属于贝叶斯非参数与计算统计的交叉方向,与您的主要兴趣(非参数统计、统计计算)有间接关联,但方法学核心(鞅后验)与您的技术武器库(如高阶U统计量、半参理论)距离较远。
  • 关键技术: Martingale posterior inference, Finite mixture models, Label-switching avoidance, Posterior uncertainty quantification, Missing data imputation
  • 为什么对您有用: 本文属于统计计算与贝叶斯非参数的交叉方向,与您的主要兴趣(非参数统计、统计计算)有弱关联。但核心方法(鞅后验推断)不在您的技术武器库中(very_familiar 和 moderately_familiar 均未覆盖),且未涉及因果推断、高维统计或效率理论等您深耕的领域。暂不可做——缺乏鞅后验的理论基础和相关计算工具。

6. 10.1080/10618600.2024.2447462 — Bayesian Pairwise Comparison of High-Dimensional Images

  • 作者: Subharup Guha, Peihua Qiu
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: University of Florida
  • 分类: vol 34 · issue 4 · pp 1356-1365
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对高维图像对的比较问题,提出一种贝叶斯假设检验方法。核心设定是将两幅图像在像素级上比较,判断差异是否仅由随机误差和空间依赖引起。方法创新在于构造了空间随机划分模型(sRPM),这是Dirichlet过程的一种扩展,通过将空间邻近且强度相似的像素聚为簇,实现降维。检验统计量是一个单变量指标,能自适应空间相关性并对随机变异稳健。计算上采用两阶段MCMC策略处理高维像素带来的计算负担。模拟和卫星图像数据表明该方法在图像比较中具有高准确性。对您而言,本文属于图像分析的应用,与您的主要兴趣(因果推断、高维统计、U统计量等)无直接方法学关联,但可作为统计计算和贝叶斯方法在图像数据上应用的参考。
  • 关键技术: spatial random partition model (sRPM), Dirichlet process extension, Bayesian hypothesis testing, MCMC, dimension reduction via clustering
  • 为什么对您有用: 本文属于图像分析的应用,与您的主要兴趣(因果推断、高维统计、U统计量等)无直接方法学关联。作为gateway-reading,本文对统计学家友好,清晰阐述了图像比较问题、sRPM模型和贝叶斯检验框架,但问题本身(图像相似性检验)与您的统计计算兴趣(如einsum复杂度)关联弱。暂不可做:核心机器(空间聚类贝叶斯模型)不在您的武器库中,且缺乏与您熟悉工具的直接接口。

7. 10.1080/10618600.2025.2489537 · arXiv — Dependence-Based Fuzzy Clustering of Functional Time Series

  • 作者: Ángel López-Oriona, Ying Sun, Han Lin Shang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1729-1741
  • 相关性 3/10 · novelty: application
  • 摘要: 本文针对函数型时间序列的聚类问题,提出结合模糊C-中位数和模糊C-均值算法与一种新的基于分位数自相关函数扩展的相异性度量。该度量将经典分位数自相关从标量时间序列推广到函数型数据,从而能捕捉函数型时间序列的依赖结构差异。模拟实验表明,所提方法在聚类准确性和计算效率上均优于现有方法。实证部分应用于高频金融股票数据和多国年龄别死亡率改善数据,展示了方法的实用性。从方法学角度看,本文主要贡献在于提出了一种针对函数型数据的依赖结构聚类框架,但理论性质(如相合性、收敛速率)未深入讨论。对您而言,本文属于统计计算与函数型数据分析的应用,与您的主要兴趣(因果推断、高维统计等)关联较弱,但可作为了解函数型时间序列聚类方法的入门参考。
  • 关键技术: fuzzy C-medoids, fuzzy C-means, quantile autocorrelation, functional time series, dissimilarity measure
  • 为什么对您有用: 本文属于统计计算与函数型数据分析的应用,与您的主要兴趣(因果推断、高维统计、U-统计量等)关联较弱。作为gateway-reading,本文对函数型时间序列聚类的方法介绍清晰,但理论深度有限,且未涉及您武器库中的核心工具(如非参数统计、minimax界、U-统计量)。暂不可做:核心问题(函数型数据聚类)与您的技术栈距离较远,且缺乏可直接迁移的理论或计算问题。

8. 10.1080/10618600.2025.2484011 — Clustering Time-Evolving Networks Using Temporal Exponential-Family Random Graph Models with Conditional Dyadic Independence and Dynamic Latent Blocks

  • 作者: Amal Agarwal, Kevin H. Lee, Lingzhou Xue
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Pennsylvania State University · Western Michigan University
  • 分类: vol 34 · issue 4 · pp 1692-1704
  • 相关性 3/10 · novelty: application
  • 摘要: 本文针对时变网络的聚类问题,提出基于时间指数族随机图模型(temporal ERGM)的统计聚类框架。模型假设给定潜在块结构后,各时间点的边条件独立(条件dyadic独立性),并用隐马尔可夫结构刻画块结构的动态演化。该方法允许指定有意义的网络特征(如度、传递性等),同时通过隐马尔可夫模型推断动态潜在块。估计采用变分EM算法近似极大似然估计,模型选择基于集成分类似然(ICL)准则确定最优聚类数。模拟和真实数据实验展示了方法的数值性能。本文属于应用导向的方法学工作,方法本身是经典模型组合,理论贡献有限。对您而言,该文与您的主要兴趣(因果推断、高维统计、U统计量等)无直接技术关联,但如果您未来涉足动态网络因果推断或纵向网络数据分析,其模型框架(隐马尔可夫+条件独立)可作为入门参考。
  • 关键技术: temporal exponential-family random graph models, conditional dyadic independence, hidden Markov model, variational EM algorithm, integrated classification likelihood
  • 为什么对您有用: 本文属于网络聚类的方法学应用,与您的主要兴趣方向(因果推断、高维统计、U统计量、半参理论)无直接技术重叠。武器库中'非参数统计'或'高维渐近'难以直接攻入该文的变分EM+ICL框架。暂不可做——核心机器(变分推断、网络模型选择准则)不在武器库中。如果您未来想进入动态网络分析方向,本文可作为入门读物,但当前不值得花时间精读。

9. 10.1080/10618600.2025.2475137 — Multiplex Depth for Network-Valued Data and Applications

  • 作者: Maoyu Zhang, Linsui Deng, Wenlin Dai
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: Emory University · Renmin University of China · Chinese University of Hong Kong
  • 分类: vol 34 · issue 4 · pp 1625-1641
  • 相关性 3/10 · novelty: application
  • 摘要: 本文针对网络值数据(network-valued data)提出了一种新的深度概念——多重深度(multiplex depth),将Tukey深度从多变量数据推广到网络数据领域。该方法适用于二值网络和加权网络,能够实现数据排序和异常值检测。作者研究了多重深度的深度相关性质,建立了样本深度和基于深度的中位数估计量的一致性。为了便于实际应用,设计了高效的计算算法。通过模拟数据和神经科学来源的脑网络数据集,在数据排序、中心估计和异常值检测等关键任务上进行了全面评估。
  • 关键技术: Tukey depth, multiplex depth, depth-based median estimator, consistency of sample depth, network-valued data
  • 为什么对您有用: 本文属于统计计算与网络数据分析的交叉方向,与您的主要兴趣(统计计算)有弱关联,但核心方法(多重深度)并非您武器库中的工具。作为gateway阅读,本文对网络数据深度概念的介绍清晰,但方法学新颖性有限(主要是Tukey深度的推广),且与您的因果推断、高维统计等核心方向无直接连接。暂不可做——核心机器(网络深度理论)不在武器库里。

10. 10.1080/10618600.2025.2467649 · arXiv — Spatial Heterogeneous Additive Partial Linear Model: A Joint Approach of Bivariate Spline and Forest Lasso

  • 作者: Xin Zhang, Shan Yu, Zhengyuan Zhu, Xin Wang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1553-1565
  • 相关性 3/10 · novelty: new_method
  • 摘要: 本文针对空间加性部分线性模型,提出一种联合方法以同时识别空间异质性聚类和平滑空间效应。模型包含一个空间平滑截距(用三角剖分上的二元样条逼近)和一个空间异质系数(通过森林套索融合惩罚实现聚类)。森林套索是一种新的融合惩罚,能在大规模空间数据中高效地估计和计算聚类结构。理论部分建立了估计量的收敛性质,模拟表明该方法在估计精度和计算成本上优于现有方法。实证应用分析了美国卫星地表温度与地面站气温关系的空间模式。对您而言,本文的方法论(样条+融合惩罚)与您的非参数/半参数理论兴趣有间接关联,但核心问题(空间聚类)不在您的主要兴趣列表中,且缺乏因果推断或高维统计的深度连接。
  • 关键技术: bivariate spline over triangulation, forest lasso fusion penalty, spatial additive partial linear model, clustering via penalized regression
  • 为什么对您有用: 本文属于空间统计方法,与您的主要兴趣(因果推断、高维RMT、U统计量)无直接交集。武器库中的非参数统计(二元样条)和M估计理论(惩罚回归)可部分理解其技术,但核心的空间聚类问题并非您当前研究重点。作为gateway阅读价值有限,因为问题设定和工具链与您的方向距离较远,暂不可做。

11. 10.1080/10618600.2024.2444321 — Exploring the Relationship Between the Geometry of a Fixed Embedding of Image Data and Its Underlying Cluster Structure

  • 作者: Yan-Bin Chen, Khong-Loon Tiong, Chen-Hsiang Yeang
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 机构: National Taiwan University · Institute of Statistical Science, Academia Sinica
  • 分类: vol 34 · issue 4 · pp 1305-1321
  • 相关性 3/10 · novelty: application
  • 摘要: 本文研究在固定嵌入模型(即不重新训练嵌入网络)条件下,图像数据的聚类问题。作者提出 Merge & Expand (ME) 框架,通过分析嵌入空间的几何结构(如区域异质性)来推断底层聚类结构。核心方法包括:基于区域异质性指标评估聚类质量,并利用该信息引入第二个嵌入来改进聚类精度。实验在五个数据集上比较了多种聚类方法,表明 ME 框架在固定嵌入、简单 CNN 架构和常见损失函数下仍具有竞争力。文章还直观解释了合并种子区域时混淆的来源。主要贡献在于揭示了嵌入空间几何与聚类结构之间的关系,并为隐私保护或迁移学习场景提供了可行的聚类方案。对您而言,本文属于统计计算与算法应用,但方法学新颖性有限,且与您的主要兴趣(因果推断、高维统计、U-统计量等)无直接技术连接。
  • 关键技术: Merge & Expand (ME) framework, fixed embedding model, region heterogeneity measure, self-supervised clustering, transfer learning
  • 为什么对您有用: 本文属于统计计算与聚类算法应用,与您的主要兴趣(因果推断、高维统计、U-统计量、半参效率理论)无直接技术连接。虽然涉及嵌入空间几何分析,但未使用您武器库中的具体工具(如树宽/张量收缩、minimax 界、高阶影响函数)。作为 gateway reading 价值低:问题设定(固定嵌入聚类)与您的核心方向距离较远,且方法学贡献偏实验分析而非理论创新。暂不可做——核心机器不在武器库里(缺自监督学习/聚类算法领域知识)。

12. 10.1080/10618600.2025.2467645 · arXiv — Joint Clustering With Alignment for Temporal Data in a One-Point-per-Experiment Setting

  • 作者: Polina Arsenteva, Mohamed Amine Benadjaoud, Hervé Cardot
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1542-1552
  • 相关性 2/10 · novelty: application
  • 摘要: 本文针对“每实验仅观测一个时间点”的纵向数据(one-point-per-experiment setting),提出一种同时进行聚类与对齐(alignment)的联合方法。该设定常见于生物医学实验,例如每个细胞仅在一个时间点被测量,导致数据为横截面而非完整轨迹。方法通过非参数方式推断潜在的时间动态模式,并利用对齐步骤处理个体间时间尺度的异质性。模拟实验表明,该方法能有效利用数据中的不确定性、相关性及少量时间点信息。在真实数据上,作者将其应用于高能辐射治疗后细胞反应的编码数据,并辅以富集分析验证。从统计方法学角度看,本文属于应用驱动的算法开发,未涉及因果推断、高维理论或半参效率等核心兴趣方向。
  • 关键技术: temporal clustering, curve alignment, one-point-per-experiment, functional data analysis, enrichment analysis
  • 为什么对您有用: 本文属于应用统计方法,与您的主要兴趣(因果推断、高维统计、半参理论等)无直接交集。其核心设定(每实验单点观测)在流行病学或纵向因果推断中可能偶有出现,但本文未涉及因果识别或效率理论。作为gateway reading,本文对统计计算(聚类与对齐的联合优化)有一定参考价值,但武器库中无直接可攻的切入点,暂不可做。

13. 10.1080/10618600.2025.2554679 — Correction

  • 作者:
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1762-1762
  • 相关性 0/10 · novelty: minor
  • 摘要: 这是一篇更正(Correction)通知,针对发表在 Journal of Computational and Graphical Statistics 上的一篇关于多维尺度变换(MDS)聚类统计显著性的论文。更正内容通常涉及作者信息、参考文献或公式的修正,不包含新的方法或理论贡献。该通知本身不提供任何实质性的统计方法、数据或结果。因此,它不具备学术阅读价值,也无法与您的研究兴趣建立连接。建议忽略此条目,直接关注原论文或其它相关文献。
  • 为什么对您有用: 这是一篇更正通知,不包含任何实质性内容,与您的研究兴趣无任何关联。无需阅读。

14. 10.1080/10618600.2025.2559557 — Correction

  • 作者:
  • 期刊/来源: Journal of Computational and Graphical Statistics
  • 分类: vol 34 · issue 4 · pp 1763-1763
  • 相关性 0/10 · novelty: minor
  • 摘要: 本文是《Journal of Computational and Graphical Statistics》上的一篇勘误(Correction),针对原文章“Joint Clustering with Alignment for Temporal Data in a One-Point-per-Experiment Setting”进行更正。勘误内容通常涉及作者、公式、数据或参考文献的修正,不包含新的方法论或实证结果。由于是勘误,没有提供具体的技术细节或理论贡献。对于统计研究者而言,这篇勘误本身不提供可迁移的方法学内容。因此,它不属于任何主要或次要兴趣方向,也没有实质性的阅读价值。
  • 为什么对您有用: 这是一篇勘误,不包含新的方法或数据,与您的主要兴趣(因果推断、高维统计、U-统计量等)和次要兴趣(天体统计、经济理论、流行病学)均无直接关联。无需阅读全文。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论