JCGS — Vol 34 Issue 3 · 2026-07-13¶
- 共 31 篇 · Journal of Computational and Graphical Statistics
- 目录核对 ✅ 31 篇全部抓到(对照 OpenAlex 31 篇)
本期导览¶
自动生成:归纳本期主要主题与脉络,不打分、不排名。
这一期共31篇论文,整体上可归纳为四条主线:非参数与半参数方法(约5篇,涵盖低秩正则化、面板数据分位数回归、分布式核平滑、流形密度估计等)、统计计算与算法(约12篇,包括分布式分位数回归、矩阵补全、B样条神经网络生成器、图神经网络贝叶斯估计、聚类方法、MCMC隐私化、随机图采样等)、高维与网络结构推断(约5篇,涉及块对角协方差检测、高斯图回归、有向社区检测、网络子采样检验等),以及因果推断与假设检验(约3篇,包括多臂Qini曲线、copula对称性检验等)。此外,还有少量论文涉及函数型数据聚类、空间极值建模、交互式可视化代数框架等主题。
在非参数与半参数主线中,最突出的是对维度诅咒和分布式计算的应对。Sample Efficient Nonparametric Regression via Low-Rank Regularization 将低秩张量回归引入非参数设定,建立更快收敛速度;Grid Point Approximation for Distributed Nonparametric Smoothing and Prediction 提出网格点近似实现分布式核平滑的统计效率等价,且不要求数据随机分布;Quantile Regression and Homogeneity Identification of a Semiparametric Panel Data Model 则通过样条逼近和同质性识别算法处理面板数据中的分组结构。这三篇分别从降维、分布式计算和分组估计角度推进了非参数/半参数方法的实用性。
统计计算与算法是本期体量最大的主线,其中分布式与隐私保护计算尤为集中。Decentralized Learning of Quantile Regression: A Smoothing Approach 通过平滑损失和二次近似实现去中心化网络上的线性收敛;Differentially Private Methods for Compositional Data 和 MCMC for Bayesian Nonparametric Mixture Modeling Under Differential Privacy 分别将差分隐私扩展到成分数据和贝叶斯非参数混合模型,系统比较了隐私-效用权衡。此外,Neural Bayes Estimators for Irregular Spatial Data Using Graph Neural Networks 利用GNN的置换不变性实现可迁移的贝叶斯估计,摊销训练成本;A Majorization-Minimization Gauss-Newton Method for 1-Bit Matrix Completion 在矩阵补全中实现计算加速。这些工作共同展示了在计算约束(分布式、隐私、不规则数据)下设计高效统计推断算法的前沿进展。
高维与网络结构推断主线中,High-Dimensional Block Diagonal Covariance Structure Detection Using Singular Vectors 通过稀疏奇异向量近似避免直接估计协方差矩阵,适用于高维结构检测;Multi-Task Learning for Gaussian Graphical Regressions with High Dimensional Covariates 利用跨任务组稀疏惩罚显著降低误差率;Network Embedding-based Directed Community Detection with Unknown Community Number 通过嵌入加惩罚融合自动确定社区数。这三篇均涉及高维设定下的结构恢复与计算效率。
因果推断方向仅有一篇直接相关:Qini Curves for Multi-Armed Treatment Rules 将Qini曲线推广到多臂处理,提供预算约束下的最优分配评估和置信区间构造。此外,Quantile Regression and Homogeneity Identification of a Semiparametric Panel Data Model 中的分组估计策略可迁移至纵向数据的分组处理效应估计。对于因果推断研究者,建议优先看Qini Curves for Multi-Armed Treatment Rules;对于半参数/非参数方向,Sample Efficient Nonparametric Regression via Low-Rank Regularization 和 Quantile Regression and Homogeneity Identification 值得关注;对于高维统计,High-Dimensional Block Diagonal Covariance Structure Detection 和 Multi-Task Learning for Gaussian Graphical Regressions 是核心。
因果推断 (causal_inference, 1 篇)¶
1. 10.1080/10618600.2024.2418820 · arXiv — Qini Curves for Multi-Armed Treatment Rules¶
- 作者: Erik Sverdrup, Han Wu, Susan Athey, Stefan Wager
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 948-960
- 相关性 6/10 · novelty:
new_method - 摘要: 本文在 multi-armed treatment 设定下推广了 Qini 曲线,用于评估不同预算水平下最优选择单元和治疗臂的 targeting 规则的价值。目标 estimand 是 budget-constrained 下的 average treatment benefit,即给定预算下最优分配策略带来的期望结果。方法上,作者提出了一个高效算法计算多臂 Qini 曲线,并基于 bootstrap 构造了大样本下精确的逐点置信区间。这些置信区间可用于假设检验,比较最优组合臂与仅用子集臂或忽略协变量的非 targeting 规则在不同预算下的价值。模拟实验和选举投票应用展示了方法的统计性能。对您而言,本文是 causal inference 中 treatment allocation 评估的实用工具,其 bootstrap 推断框架可与您熟悉的 estimation theory 和软件工程能力结合,用于实际政策评估或流行病学干预研究。
- 关键技术:
Qini curve,multi-armed treatment rules,bootstrap confidence intervals,treatment targeting,budget-constrained optimization - 为什么对您有用: 本文直接连接您的 primary interest 中的 causal inference 子方向(treatment allocation 评估),且方法学上涉及 bootstrap 推断和假设检验,与您的 mathematical statistics 兴趣吻合。从技术武器库看,您可以用 very_familiar 的 estimation theory 和软件工程能力快速实现该算法并扩展到新设定(如 longitudinal 或 IV 场景),属于立即可做的 follow-up。
高维统计 / 随机矩阵 (high_dim_rmt, 2 篇)¶
1. 10.1080/10618600.2024.2422985 · arXiv — High-Dimensional Block Diagonal Covariance Structure Detection Using Singular Vectors¶
- 作者: Jan O. Bauer
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 1005-1016
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究高维数据中块对角协方差结构的检测问题,目标是在未知子向量个数和变量归属时识别出独立子向量对应的块对角模式。核心思路是利用协方差矩阵的特征向量与数据矩阵右奇异向量的等价性,通过对样本奇异向量施加稀疏近似来恢复总体特征向量的稀疏结构,从而揭示块对角结构。方法避免了直接估计高维协方差矩阵,计算上更高效。模拟和真实数据示例验证了方法的有效性。该问题与高维统计中的协方差结构推断紧密相关,且稀疏奇异向量近似技术对您在高维设定下的假设检验和结构检测工作有直接参考价值。
- 关键技术:
sparse singular vector approximation,block diagonal covariance detection,high-dimensional covariance structure,eigenvector sparsity - 为什么对您有用: 本文直接关联您的高维统计兴趣,特别是协方差结构推断与假设检验。您武器库中的高维渐近理论可用于分析该稀疏奇异向量近似方法的相合性与收敛速率,而 minimax 界工具可评估其检测阈值的紧性。中期可做:需先在 moderately_familiar 的 M-估计理论中熟悉稀疏正则化(如 Lasso)的 oracle 性质,以严格推导该方法的理论保证。
2. 10.1080/10618600.2024.2421246 · arXiv — Multi-Task Learning for Gaussian Graphical Regressions with High Dimensional Covariates¶
- 作者: Jingfei Zhang, Yi Li
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 961-970
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究高维协变量下高斯图模型精度矩阵的回归问题,目标是在节点数 p 和样本量 n 可比或 p > n 时,估计协变量对图结构(精度矩阵)的影响。传统方法通过逐节点 lasso 回归分别拟合每个节点,忽略了节点间因网络结构产生的相关性,导致误差率高。作者提出多任务学习估计量,引入跨任务组稀疏惩罚(cross-task group sparsity)和任务内元素稀疏惩罚(within-task element-wise sparsity),分别控制活跃协变量的选择和其对图边的影响。计算上采用增广拉格朗日算法,子问题用半光滑牛顿法求解。理论证明该多任务估计量的误差率显著低于逐节点回归,因为跨任务惩罚允许信息在节点间共享。模拟和脑癌基因共表达网络应用验证了方法的实用性。对您而言,该工作涉及高维图模型和稀疏估计,与您的高维统计和统计计算兴趣相关,其多任务学习框架可启发您在高维因果推断中处理多个相关响应变量的方法设计。
- 关键技术:
multi-task learning,Gaussian graphical regression,group lasso penalty,augmented Lagrangian algorithm,semi-smooth Newton method,node-wise lasso regression - 为什么对您有用: 该论文直接关联您的高维统计兴趣,特别是高维协变量下图模型估计问题。您的技术武器库中'高维渐近理论'和'非参数统计'可用于分析其多任务估计量的收敛性质,而'软件工程'经验可帮助复现其增广拉格朗日算法。中期可做:若您想将多任务学习框架扩展到因果图估计,需先在'因果推断识别理论'上加强,以处理协变量对因果图而非相关图的影响。
非参数 / 半参数 (nonparam_semipara, 4 篇)¶
1. 10.1080/10618600.2024.2414891 — Sample Efficient Nonparametric Regression via Low-Rank Regularization¶
- 作者: Jiakun Jiang, Jiahao Peng, Heng Lian
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Beijing Normal University · City University of Hong Kong · City University of Hong Kong, Shenzhen Research Institute · Jiangxi University of Finance and Economics
- 分类: vol 34 · issue 3 · pp 896-905
- 相关性 7/10 · novelty:
new_method - 摘要: 本文针对非参数回归中的维度诅咒问题,提出了一种基于低秩正则化的简单降维方法。该方法通过级数估计(series estimation)实现,将低秩概念从参数化的多元降秩回归和矩阵回归推广到非参数设定。对于维度 d>2,低秩假设通过张量回归(tensor regression)实现,从而利用多指标结构降低有效参数维度。理论部分建立了在(近似)低秩条件下估计量的更快收敛速度,并讨论了模型的局限性。模拟和真实数据分析表明,该方法在均方根误差上优于现有方法。对您而言,本文的非参数低秩张量回归框架与您在高维统计和统计计算(张量运算)方面的兴趣直接相关,其收敛速度分析也可与您的 minimax 界技术进行对比。
- 关键技术:
low-rank regularization,series estimation,tensor regression,nonparametric convergence rate,dimension reduction - 为什么对您有用: 本文连接您在高维统计和非参数理论方面的兴趣,具体涉及张量回归的低秩假设与收敛速度分析。您可以用 very_familiar 的 minimax 界工具来检验其声称的更快收敛速度是否紧,并利用 moderately_familiar 的 M-estimation 理论来审视其级数估计的渐近性质。中期可做:需先在 moderately_familiar 的 semiparametric theory 上进一步熟悉,以评估该方法在更一般半参数模型下的适用性。
2. 10.1080/10618600.2024.2433672 — Quantile Regression and Homogeneity Identification of a Semiparametric Panel Data Model¶
- 作者: Rui Li, Tao Li, Huacheng Su, Jinhong You
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Shanghai University of International Business and Economics · Shanghai University of Finance and Economics
- 分类: vol 34 · issue 3 · pp 1169-1187
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究半参数面板数据模型的分位数回归与同质性识别问题。模型包含固定个体效应和非线性时间趋势,且系数为变指数形式。采用样条逼近估计趋势函数、连接函数和指数参数,并建立了相应的收敛速度和渐近正态性。针对不同个体可能共享相同趋势函数的情形,提出基于二元分割的同质性识别算法,并利用广义贝叶斯信息准则确定阈值参数。进一步引入惩罚方法识别非参数函数中的常数和线性结构,通过分组观测实现更高效的估计并改善渐近性质。模拟研究和空气污染与地表综合数据集的实证分析验证了方法的有限样本表现。该文对您在半参数与非参数理论方向有参考价值,其分组估计策略可迁移至您熟悉的因果推断中纵向数据的分组处理效应估计。
- 关键技术:
spline approximation,binary segmentation,generalized Bayesian information criterion,penalized estimation,varying index coefficient model - 为什么对您有用: 本文属于半参数与非参数理论方向,与您的 primary interest 直接相关。其分组同质性识别与惩罚方法可迁移至您非常熟悉的非参数统计和因果推断中的纵向数据异质性处理效应估计,例如用样条逼近估计时变趋势。中期可做:需先在 moderately_familiar 的 semiparametric theory 上巩固,特别是分组估计的渐近效率理论。
3. 10.1080/10618600.2024.2409817 · arXiv — Grid Point Approximation for Distributed Nonparametric Smoothing and Prediction¶
- 作者: Yuan Gao, Rui Pan, Feng Li, Riquan Zhang, Hansheng Wang
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 824-836
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对分布式系统上的大规模数据集,研究核平滑的高效计算问题。作者发现传统的一步估计(one-shot estimator)在预测任务中效率低下,因此提出了一种新的网格点近似(GPA)方法。该方法通过在每个机器上对原始数据压缩为网格点上的加权核估计,再在中心节点聚合,无需机器间通信。理论证明,在温和条件下,GPA估计量的统计效率与全局估计量(即合并所有数据后的核估计)渐近等价。此外,该方法不要求数据在各机器上随机分布,具有更强的适用性。文章还开发了两种新的带宽选择器,并给出了理论支持。数值模拟和两个真实数据案例验证了方法的有效性。
- 关键技术:
kernel smoothing,distributed computing,grid point approximation,one-shot estimator,bandwidth selection - 为什么对您有用: 本文属于非参数统计与统计计算的交叉方向,直接对应您对非参数统计和统计计算的兴趣。您熟悉的非参数统计理论(如核估计的渐近性质)和软件开发能力,可以用于评估GPA方法在更复杂设定(如高维或半参数模型)下的推广,属于立即可做的范畴。
4. 10.1080/10618600.2024.2415543 — Distortion Corrected Kernel Density Estimator on Riemannian Manifolds¶
- 作者: Fan Cheng, Rob J. Hyndman, Anastasios Panagiotelis
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Australian Regenerative Medicine Institute · Monash University · The University of Sydney
- 分类: vol 34 · issue 3 · pp 906-922
- 相关性 3/10 · novelty:
new_method - 摘要: 本文研究流形学习降维后嵌入空间上的核密度估计问题。标准固定带宽KDE忽略了流形学习算法对原始Riemannian度量的扭曲,导致密度估计有偏。作者提出畸变校正核密度估计器(DC-KDE),核心思想是利用每个数据点处估计的Riemannian度量来构造局部自适应带宽,从而校正几何扭曲。方法不依赖特定流形学习算法,具有通用性。模拟实验在高达100维的ambient space中验证了DC-KDE在嵌入质量足够好时能显著提升密度估计精度,与真实流形密度的秩相关更高。应用部分使用爱尔兰智能电表数据对用电统计流形进行密度估计。对您而言,本文属于非参数统计与流形学习的交叉,其自适应带宽构造思路可迁移至高维统计中的密度估计问题,但核心工具(Riemannian度量估计)不在您当前武器库中,属于暂不可做方向。
- 关键技术:
kernel density estimation,Riemannian metric estimation,manifold learning,adaptive bandwidth,distortion correction - 为什么对您有用: 本文属于非参数统计与流形学习的交叉,直接对应您的primary interest中的非参数统计与高维统计。但核心机制依赖Riemannian几何的度量估计,而您的武器库中very_familiar项(非参数统计、minimax界)无法直接处理流形上的几何扭曲校正问题,moderately_familiar项也无相关工具。因此属于暂不可做方向——缺少Riemannian几何与流形学习的基础工具。
数理统计 / 假设检验 (hypothesis_testing, 2 篇)¶
1. 10.1080/10618600.2024.2432974 — Scalable Estimation and Two-Sample Testing for Large Networks via Subsampling¶
- 作者: Kaustav Chakraborty, Srijan Sengupta, Yuguo Chen
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: University of Illinois Urbana-Champaign · North Carolina State University
- 分类: vol 34 · issue 3 · pp 1127-1139
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对大规模网络的估计与两样本检验问题,提出了一种基于子采样的计算方法以降低计算成本。核心思想是将网络划分为带有重叠区域的小子图,在每个子图上进行推断,然后合并结果。作者首先在随机点积图模型下建立了子采样方法,并证明了其理论一致性;随后将方法推广到更一般的设定,并建立了类似的理论性质。通过模拟实验和真实数据分析展示了方法的性能。该方法为处理大规模网络统计推断提供了一种计算可行的途径,尤其适用于计算资源受限的场景。对您而言,该工作涉及假设检验与计算效率的权衡,与您对统计计算和假设检验的兴趣直接相关。
- 关键技术:
subsampling,random dot product graph,two-sample testing,network inference,overlap-based partitioning - 为什么对您有用: 本文直接关联您对假设检验和统计计算(computationally constrained statistics)的兴趣。其子采样策略可视为一种计算-统计权衡的实例,您可以用 minimax 下界工具分析其估计精度与子图大小、重叠区域的关系。中期可做:需先在 moderately_familiar 的 M-estimation 理论上巩固,以处理更一般的网络模型下的子采样推断。
2. 10.1080/10618600.2024.2432978 · arXiv — Visualization and Assessment of Copula Symmetry¶
- 作者: Cristian F. Jiménez-Varón, Hao Lee, Marc G. Genton, Ying Sun
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 1140-1152
- 相关性 3/10 · novelty:
new_method - 摘要: 本文针对 copula 对称性(反射对称、径向对称、联合对称)提出了一套可视化和假设检验方法。首先为每种对称性构造了特定的检验函数,并建立了其经验估计量的渐近性质。然后利用函数箱线图(functional boxplot)对样本检验函数进行可视化,直观度量偏离对称性的程度。同时引入非参数检验程序来评估偏离的显著性,确保可视化方法的可靠性。通过多种 copula 模型的模拟研究验证了检验的有效性。最后将方法应用于三个真实数据集:营养习惯调查、NASDAQ-100 前五公司股价、以及 S&P500 与 DAX 指数。该方法的核心在于将 copula 对称性检验转化为函数型数据的可视化与推断问题,属于非参数假设检验在依赖结构分析中的应用。对您而言,本文的非参数检验框架和函数箱线图可视化思路可迁移至您在高维统计或因果推断中诊断模型假设(如条件独立性、对称性)的场景,且其渐近理论部分与您熟悉的非参数统计和假设检验方向直接对接。
- 关键技术:
functional boxplot,rank-based testing,copula symmetry,empirical process,nonparametric testing - 为什么对您有用: 本文属于假设检验方向,直接对应您 primary interest 中的 'mathematical statistics (hypothesis testing)'。其非参数检验框架和渐近理论(经验过程)与您非常熟悉的非参数统计和 minimax 理论高度吻合,属于 '立即可做' 的范畴——您可以直接用 empirical process 工具分析其检验函数的收敛速率或构造更高效的检验统计量。此外,copula 对称性检验在因果推断的敏感性分析或高维依赖结构诊断中有潜在应用,可作为中期可做的延伸方向。
统计计算 / 算法 (stat_computing, 19 篇)¶
1. 10.1080/10618600.2024.2431060 — Decentralized Learning of Quantile Regression: A Smoothing Approach¶
- 作者: Jianwei Shi, Yue Wang, Zhongyi Zhu, Heng Lian
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Fudan University · City University of Hong Kong · City University of Hong Kong, Shenzhen Research Institute
- 分类: vol 34 · issue 3 · pp 1091-1101
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究去中心化网络上的分位数回归估计问题。在无中心协调节点的分布式网络中,现有方法收敛速度仅为次线性。作者提出一种基于平滑分位数损失的新方法,核心创新在于对Hessian矩阵使用大带宽、对梯度使用小带宽的二次近似策略,从而同时实现线性收敛速度和最优统计效率。该方法通过分布式ADMM算法实现,每轮通信仅需与邻居节点交换参数,保护数据隐私。理论分析证明了估计量的渐近正态性和半参数有效性。数值实验和真实数据分析验证了方法在有限样本下的优越性。该工作对您可能有用:其分布式计算框架与您熟悉的统计计算和软件工具开发方向直接相关,且平滑损失与二次近似的技巧可迁移至您关注的因果推断中的高效估计问题。
- 关键技术:
decentralized optimization,ADMM,smoothed quantile loss,quadratic approximation,linear convergence rate,distributed estimation - 为什么对您有用: 本文属于统计计算方向,直接连接您的primary interest中的统计计算(分布式算法)。您武器库中'软件工具开发'和'高维渐近理论'可用来分析该方法的通信复杂度与统计效率的权衡。中期可做:若您先在moderately_familiar的M估计理论上加强,可将此平滑二次近似技巧推广至分布式因果推断中的正交估计量。
2. 10.1080/10618600.2024.2428610 · arXiv — A Majorization-Minimization Gauss-Newton Method for 1-Bit Matrix Completion¶
- 作者: Xiaoqian Liu, Xu Han, Eric C. Chi, Boaz Nadler
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 1017-1029
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对 1-bit 矩阵补全问题,提出了一种名为 MMGN(Majorization-Minimization Gauss-Newton)的新方法。该方法基于 MM 原理,将原始非凸优化问题转化为一系列标准低秩矩阵补全子问题,每个子问题通过显式低秩分解并应用 Gauss-Newton 法求解。与现有方法(如基于凸松弛或谱方法的算法)相比,MMGN 在估计精度相当或更优的前提下,计算速度显著更快,且对底层矩阵的尖峰性(spikiness)更不敏感。在观测比例较小时,MMGN 相对于直接优化原始目标的通用优化方法(如梯度下降)展现出明显的计算优势。模拟和真实数据实验验证了其性能。对您而言,本文的 MM 框架和 Gauss-Newton 求解策略是统计计算中处理非凸优化问题的实用工具,尤其适合您在高维统计和矩阵补全问题中需要快速、稳定算法的场景。
- 关键技术:
Majorization-Minimization,Gauss-Newton method,low-rank matrix factorization,1-bit matrix completion,non-convex optimization - 为什么对您有用: 本文直接关联您的 primary interest 中的统计计算(numerical methods, algorithm),提出了一种计算高效的优化算法。您武器库中 very_familiar 的软件开发和 high-dimensional asymptotics 可直接用于复现和扩展该方法(例如,将其应用于其他类型的离散观测矩阵补全问题)。中期可做:若想将 MMGN 与您熟悉的 higher-order U-statistics 结合(例如,在 U-statistic 的优化问题中应用 MM 框架),需先在 moderately_familiar 的 M-estimation theory 上加强,以处理更复杂的损失函数。
3. 10.1080/10618600.2024.2431070 · arXiv — Monotone Cubic B-Splines with a Neural-Network Generator¶
- 作者: Lijun Wang, Xiaodan Fan, Huabai Li, Jun S. Liu
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 1102-1116
- 相关性 4/10 · novelty:
new_method - 摘要: 本文提出了一种在系数上施加单调性约束的三次B样条拟合方法,目标是在高噪声环境下仍能保证拟合曲线的单调性。作者探索了多种约束施加方式(如不等式约束、重新参数化),并比较了它们的理论和经验性质。核心贡献是提出了两种算法:一是基于标准优化(如二次规划)的直接求解器;二是训练一个多层感知机(MLP)作为生成器,以近似不同设定和扰动下的最优解。生成器方法在需要重复求解的场景(如Bootstrap构造置信带)中能大幅加速。模拟表明,该方法在噪声水平较高时显著优于不施加单调性约束的现有方法。最后,作者将方法应用于天体物理学中恒星形成时的偏振孔现象分析。对您而言,该文的MLP生成器加速重复求解的思路,与您统计计算(numerical methods, algorithm)兴趣中的计算效率问题直接相关,且其开源Julia代码可作为您软件开发的参考。
- 关键技术:
monotone cubic B-splines,constrained optimization,multi-layer perceptron (MLP) generator,bootstrap confidence bands,Julia implementation - 为什么对您有用: 本文属于统计计算(stat_computing)方向,核心是算法设计与加速。其MLP生成器加速重复求解的思路,可直接迁移到您感兴趣的bootstrap或交叉验证等计算密集型场景。您对软件开发的熟悉程度(very_familiar)足以让您快速复现或改进其Julia代码。中期可做:若想将生成器思想推广到更一般的约束样条或非参数回归,需先在M-estimation理论(moderately_familiar)上加强,以处理更复杂的约束和损失函数。
4. 10.1080/10618600.2024.2433671 · arXiv — Neural Bayes Estimators for Irregular Spatial Data Using Graph Neural Networks¶
- 作者: Matthew Sainsbury-Dale, Andrew Zammit-Mangion, Jordan Richards, Raphaël Huser
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 1153-1168
- 相关性 4/10 · novelty:
new_method - 摘要: 本文针对不规则空间数据(任意位置、任意数量的观测点)的参数点估计问题,提出基于图神经网络(GNN)的神经贝叶斯估计器。传统神经贝叶斯估计器受限于规则网格和固定位置集,每换一套数据就需要重新训练网络,实用性差。作者利用GNN的置换不变性和对不规则图结构的适应能力,训练一个可迁移的估计器:训练一次后,对同一空间模型(如高斯过程、max-stable过程)的任何配置或数量的位置及独立复制均可直接使用,从而摊销训练成本。估计器通过最小化贝叶斯风险(如均方误差)来逼近后验均值,并额外训练一个估计器来近似边际后验分位数以实现不确定性量化。在全局海表温度数据集上,该方法在单个GPU上几分钟内完成了2161个空间区域、每个区域数千个不规则点的参数估计。对您而言,本文展示了统计计算中“摊销推断”与图神经网络结合的前沿实践,属于statistical computing方向,可作为gateway reading了解GNN在空间统计中的应用潜力。
- 关键技术:
Graph Neural Networks (GNNs),Neural Bayes estimators,amortized inference,irregular spatial data,likelihood-free estimation,uncertainty quantification via posterior quantiles - 为什么对您有用: 本文属于stat_computing方向,是您primary interest中'statistical computing'的gateway reading。您的武器库中'软件开发和high-dimensional asymptotics'可帮助理解其计算架构和收敛性,但核心的GNN设计(消息传递、置换不变性)属于moderately_familiar之外的新工具——暂不可做直接复现,但值得花时间读全文以评估GNN能否用于您higher-order U-statistics中的tensor-contraction cost优化问题(例如用GNN学习最优收缩顺序)。
5. 10.1080/10618600.2024.2429706 — Functional Projection K -means¶
- 作者: Roberto Rocci, Stefano A. Gattone
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Sapienza University of Rome · University of Chieti-Pescara
- 分类: vol 34 · issue 3 · pp 1051-1062
- 相关性 4/10 · novelty:
new_method - 摘要: 本文提出一种函数型数据的同时聚类与降维方法——Functional Projection K-means。目标是在低维子空间中对函数型观测进行K-means聚类,子空间与聚类划分通过最小化降维空间内的组内离差联合估计。该方法在损失函数中加入负的总离差惩罚项,以避免子空间解释方差过低导致聚类无意义的问题。通过调节惩罚权重,可涵盖多种现有方法作为特例。估计过程中引入正则化项对质心进行平滑,将函数型数据的平滑处理与子空间、聚类划分的识别一体化,而非像多数文献那样仅作为预处理步骤。采用交替最小二乘算法进行参数估计,并在模拟与真实数据上验证了有效性。对您而言,该工作涉及统计计算中的交替优化与正则化技术,与您熟悉的软件开发和算法实现方向有直接关联。
- 关键技术:
alternating least squares,functional K-means,dimensionality reduction,penalized loss function,regularization for functional data - 为什么对您有用: 本文属于统计计算方法论文,直接对应您的primary interest中的statistical computing方向。您熟悉的软件开发技能可用于实现或扩展其交替最小二乘算法。该工作虽不涉及您核心的因果推断或高维理论,但作为计算方法的gateway reading,值得一读以了解函数型数据聚类的最新进展。
6. 10.1080/10618600.2024.2429705 · arXiv — Sparse Model-Based Clustering of Three-Way Data via Lasso-Type Penalties¶
- 作者: Andrea Cappozzo, Alessandro Casa, Michael Fop
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 1030-1050
- 相关性 4/10 · novelty:
new_method - 摘要: 针对矩阵变量数据(three-way data)的聚类问题,现有矩阵高斯混合模型因参数过多而难以应用于中等规模数据。本文提出一种稀疏模型聚类方法,假设混合成分的参数具有跨簇不同的稀疏模式,从而灵活实现简约化。估计采用带 group lasso 和 graphical lasso 惩罚的惩罚似然最大化,前者用于选择对聚类最有信息量的特征(变量×时间组合),后者用于识别簇内变量间的关联结构。方法在合成数据上经过广泛测试,并通过美国多城市随时间变化的犯罪模式数据验证了有效性。该工作将高维稀疏化技术引入矩阵混合模型,为多模态数据聚类提供了可解释的框架。对您而言,这是一篇统计计算与算法应用论文,其惩罚似然框架和特征选择思路可迁移到您熟悉的高维统计和软件工具开发中。
- 关键技术:
penalized likelihood,group lasso,graphical lasso,matrix Gaussian mixture,sparse clustering - 为什么对您有用: 本文属于统计计算与算法方向,直接对应您的 primary interest 中的 statistical computing。其惩罚似然估计和特征选择机制可借助您 very_familiar 的高维统计和软件工具进行复现或扩展。中期可做:若您想深入理解矩阵混合模型的收敛性质,需先在 moderately_familiar 的 M-estimation theory 上加强。
7. 10.1080/10618600.2024.2414889 · arXiv — Scalable Clustering: Large Scale Unsupervised Learning of Gaussian Mixture Models with Outliers¶
- 作者: Yijia Zhou, Kyle A. Gallivan, Adrian Barbu
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 884-895
- 相关性 4/10 · novelty:
new_method - 摘要: 本文提出一种基于损失最小化的可证明鲁棒的聚类算法,适用于含异常值的高斯混合模型。算法通过优化一个精心设计的损失函数来同时实现聚类和异常值识别,并提供了在特定假设下以高概率获得高精度的理论保证。该方法还可作为k-means的初始化策略,显著提升其性能。在ImageNet等大规模数据集上的实验表明,该算法在聚类大量类别时在速度和精度上均优于多种经典方法,且具有良好的可扩展性。理论分析部分给出了算法的收敛性保证和统计误差界。
- 关键技术:
loss minimization clustering,robust Gaussian mixture models,outlier detection,k-means initialization,theoretical convergence guarantees - 为什么对您有用: 本文属于统计计算方向,与您的primary interest中的'statistical computing (numerical methods, algorithm)'直接相关。该算法的大规模可扩展性和理论保证(收敛性、高概率精度界)是您熟悉的'nonparametric statistics'和'minimax bounds'可以切入分析的点。作为gateway reading,本文清晰阐述了算法设计、理论假设和实验验证,适合作为了解大规模聚类算法前沿的入门读物。
8. 10.1080/10618600.2024.2431072 · arXiv — flexBART: Flexible Bayesian Regression Trees with Categorical Predictors¶
- 作者: Sameer K. Deshpande
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 1117-1126
- 相关性 3/10 · novelty:
new_method - 摘要: 本文针对 BART(Bayesian additive regression trees)在处理类别型预测变量时的局限性,提出 flexBART 方法。标准 BART 实现采用 one-hot 编码,每次分裂只能移除一个类别,导致无法生成大多数可能的类别划分,限制了模型对类别间信息的部分池化能力。flexBART 通过允许回归树在节点分裂时将多个类别同时分配到左右分支,克服了这一限制。针对空间数据(如聚合到小区域的犯罪动态),作者进一步提出一种基于随机生成树删除随机边的决策规则先验,以生成空间连续的划分区域。该方法在棒球数据和社区犯罪数据上展现出优于现有 BART 实现的样本外预测性能,且 flexBART 软件包在更大数据集上具有更好的可扩展性。对您而言,本文属于统计计算方向,展示了如何通过算法创新(树分裂策略)解决实际数据建模中的关键问题,其软件实现思路对您开发统计软件有参考价值。
- 关键技术:
Bayesian additive regression trees,categorical predictor encoding,tree splitting strategy,random spanning tree prior,spatial partitioning - 为什么对您有用: 本文属于统计计算方向,直接关联您的 primary interest 中的 statistical computing(算法与软件)。您非常熟悉的软件开发和 M-estimation 理论可用于分析 flexBART 的树分裂策略对后验采样效率的影响,或设计更优的决策规则先验。中期可做:需先在 moderately_familiar 的 semiparametric theory 上长肌肉,以理解 BART 作为非参数回归工具的理论性质。
9. 10.1080/10618600.2024.2421984 — Latent Markov Time-Interaction Processes¶
- 作者: Rosario Barone, Alessio Farcomeni, Maura Mezzetti
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: University of Rome Tor Vergata
- 分类: vol 34 · issue 3 · pp 984-993
- 相关性 3/10 · novelty:
new_method - 摘要: 本文提出了一类参数与半参数潜马尔可夫时间交互过程(latent Markov time-interaction processes),将点过程与离散状态连续时间潜马尔可夫链结合,允许事件发生增加或降低未来事件概率(自激励/自抑制)。模型包含参数与非参数基线强度,并通过潜状态调制模型参数。后验推断基于一种新颖且高效的MCMC数据增广方法。模拟研究验证了方法的有效性;在2001-2017年欧洲恐怖袭击数据上的应用发现了两个不同的潜聚类,分别对应不同的袭击风险,并揭示了与GDP增长的负关联及自激励现象。该方法为纵向事件序列的因果推断提供了灵活的建模框架,尤其适用于存在未观测异质性的场景。对您而言,该文在统计计算(MCMC数据增广)和纵向因果推断(潜过程建模)两个方向均有参考价值。
- 关键技术:
latent Markov process,self-exciting point process,data augmentation MCMC,semiparametric baseline,discrete state continuous time - 为什么对您有用: 本文连接了您的纵向因果推断兴趣(潜过程建模处理未观测混杂)和统计计算兴趣(高效MCMC数据增广)。技术武器库中的'非参数统计'和'因果推断估计理论'可用于分析其半参数基线估计的收敛性;'M估计理论'(moderately_familiar)可用于推导其参数估计的渐近性质。中期可做:需先在'semiparametric theory'上加强,以严格推导该模型下因果参数的识别与效率界。
10. 10.1080/10618600.2024.2412174 · arXiv — Differentially Private Methods for Compositional Data¶
- 作者: Qi Guo, Andrés F. Barrientos, Víctor Peña
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 848-858
- 相关性 3/10 · novelty:
application - 摘要: 本文针对成分数据(compositional data)在差分隐私框架下的统计分析问题,提出基于Dirichlet分布的方法。成分数据是分量非负且和为常数的向量,在差分隐私文献中鲜有研究。作者探索了多种方法,包括贝叶斯方法(基于MCMC、近似贝叶斯计算和渐近近似)和自助法。通过大量模拟比较了这些方法的性能,并给出了基于证据的建议。最后,将方法应用于美国时间使用调查数据集。本文的核心贡献在于将差分隐私技术扩展到成分数据这一特定数据类型,并系统比较了不同推断策略的隐私-效用权衡。对您而言,本文展示了如何将隐私保护技术适配到非标准数据结构(成分数据),这与您对统计计算(数值方法、算法)的兴趣直接相关,且其贝叶斯推断和自助法的比较框架对您开发软件时考虑隐私保护有参考价值。
- 关键技术:
Differential privacy,Dirichlet distribution,Approximate Bayesian Computation,Markov chain Monte Carlo,Bootstrap - 为什么对您有用: 本文属于统计计算方向,直接对应您的primary interest中的'statistical computing (numerical methods, algorithm)'。您可以用very_familiar的'软件开发'和'非参数统计'技能来评估其隐私-效用权衡的实证设计,或将其贝叶斯推断框架作为您开发统计软件时处理隐私数据的参考案例。本文是方法学应用,无新理论突破,但可作为gateway reading了解差分隐私在非标准数据上的适配。
11. 10.1080/10618600.2024.2410911 · arXiv — MCMC for Bayesian Nonparametric Mixture Modeling Under Differential Privacy¶
- 作者: Mario Beraha, Stefano Favaro, Vinayak Rao
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 837-847
- 相关性 3/10 · novelty:
new_method - 摘要: 本文在差分隐私(DP)约束下,针对贝叶斯非参数混合模型提出了两种MCMC后验推断算法:一种基于边际似然的伪边际Metropolis-Hastings方法(类似Neal's Algorithm 5),另一种是条件方法。主要关注局部DP,但算法可扩展至全局DP机制。对于特定隐私机制和混合核,通过解析地边缘化辅助参数,使得标准(非隐私化)MCMC算法(如Neal's Algorithm 2)可以高效使用。方法通用,适用于任意混合模型和隐私机制。仿真和真实数据案例评估了不同隐私机制下的算法性能。对您而言,本文展示了如何在计算约束(隐私预算)下设计统计推断算法,与您对统计-计算权衡的兴趣直接相关,且其MCMC实现技巧(如伪边际、辅助参数解析积分)可迁移至您熟悉的贝叶斯非参数或高维推断场景。
- 关键技术:
differential privacy,Bayesian nonparametric mixture,pseudo-marginal Metropolis-Hastings,Neal's algorithm 5,local differential privacy,auxiliary variable marginalization - 为什么对您有用: 本文属于统计-计算权衡(computationally constrained statistics)的gateway reading:它明确给出了隐私预算(ε)这一计算/信息约束,并展示了在有限隐私预算下如何设计可行的MCMC算法。您作为该领域的outsider,本文的intro和算法描述清晰,不假设读者熟悉DP文献,适合入门。武器库中'软件开发和MCMC实现'可直接用于复现或扩展其算法;若要深入分析隐私-精度权衡的minimax最优性,需先熟悉moderately_familiar中的'DP机制的理论性质'(目前不在武器库中),因此属于中期可做。
12. 10.1080/10618600.2024.2429708 — No More, No Less than Sum of Its Parts: Groups, Monoids, and the Algebra of Graphics, Statistics, and Interaction¶
- 作者: Adam Bartonicek, Simon Urbanek, Paul Murrell
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: University of Auckland
- 分类: vol 34 · issue 3 · pp 1063-1074
- 相关性 2/10 · novelty:
new_method - 摘要: 本文探讨交互式数据可视化中图形、统计量与交互三者之间的代数结构依赖关系。作者指出,当可视化支持将数据拆分为子集再合并(如联动选择)时,底层统计量必须满足特定的代数性质(如结合律、单位元),否则交互行为会导致不一致的视觉结果。文章以范畴论中的群与幺半群为工具,形式化描述了统计量在数据分割与合并操作下应具备的封闭性与可组合性。核心贡献是提出一个代数框架,用于指导设计更灵活且语义一致的交互式图形系统。文中通过示例(如均值、计数、比例)说明哪些统计量适合交互式拆分合并,哪些则会产生歧义。对您而言,本文虽非直接的方法论论文,但其将统计计算与代数结构结合的分析视角,对您正在开发的统计软件(如R包或可视化工具)的底层架构设计有参考价值。
- 关键技术:
monoid,group,algebraic structure for aggregation,interactive graphics,linked selection,split-apply-combine - 为什么对您有用: 本文属于统计计算(stat_computing)方向,直接关联您的primary interest中的“statistical computing (numerical methods, algorithm)”以及“software development”这一very_familiar武器。文章提出的代数框架(幺半群)可用于指导您开发统计软件时,设计可组合、可交互的统计量计算模块——例如在您熟悉的einsum/treewidth框架中,若需支持用户交互式地拆分数据子集并重新聚合,本文的代数性质分析能帮助您判断哪些U-statistics或高阶统计量适合这种操作。中期可做:若想将本文思想落地到您的软件中,需先在moderately_familiar的“identification theory in causal inference”中理解数据拆分与因果估计量的交互兼容性(如ATE在子集上的可加性),但核心代数工具(群/幺半群)本身门槛不高,属于立即可读的gateway文献。
13. 10.1080/10618600.2024.2421248 — Multi-label Random Subspace Ensemble Classification¶
- 作者: Fan Bi, Jianan Zhu, Yang Feng
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: New York University
- 分类: vol 34 · issue 3 · pp 971-983
- 相关性 2/10 · novelty:
new_method - 摘要: 本文提出一种新的集成学习框架 mRaSE,用于多标签分类问题。给定一个基分类器(如多项逻辑回归、分类树、K近邻),mRaSE 首先随机采样大量子空间,然后通过交叉验证选择最优子空间,最后聚合这些弱学习器。该方法还提供了一种与基分类器无关的特征重要性排序。进一步,作者开发了迭代版本和 Super mRaSE,后者可接受多个基分类器作为输入。通过大量模拟和两个真实数据应用,mRaSE 在预测性能上优于随机森林和深度神经网络等主流方法。该方法已实现为 R 包 RaSEn 的更新版本。对于您而言,本文的集成学习框架和子空间采样策略可迁移至高维统计中的变量选择或因果推断中的模型平均问题,且 R 包实现便于直接使用。
- 关键技术:
Random Subspace Ensemble,multi-label classification,cross-validation selection,feature ranking,iterative ensemble,R package implementation - 为什么对您有用: 本文属于统计计算与算法方向,与您的 primary interest 中的 statistical computing 直接相关。其子空间采样和交叉验证选择机制可视为一种计算高效的模型平均策略,您可以用 very_familiar 的 minimax bounds 工具分析其泛化误差,或用 moderately_familiar 的 M-estimation 理论理解其选择一致性。中期可做:若想深入分析其理论性质(如子空间选择的一致性),需先在 moderately_familiar 的 M-estimation 理论上加强。
14. 10.1080/10618600.2024.2418817 · arXiv — Sampling Random Graphs with Specified Degree Sequences¶
- 作者: Upasana Dutta, Bailey K. Fosdick, Aaron Clauset
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 934-947
- 相关性 2/10 · novelty:
new_method - 摘要: 本文研究从配置模型(configuration model)中均匀采样指定度序列的随机图的问题。配置模型是网络科学中常用的零模型,用于评估观测网络的结构是否仅由度序列决定。标准方法是基于双边缘交换(double-edge swap)的马尔可夫链蒙特卡洛(MCMC)算法,但准确高效地检测链是否达到平稳分布一直是一个未解决的问题。作者提出了一种基于采样图同配性(assortativity)的算法,用于估计有效独立MCMC状态之间的间隔(gap),并基于509个经验网络的分析提出了一个计算高效的间隔估计启发式方法。他们进一步提出了一种基于Dickey-Fuller广义最小二乘检验的收敛检测方法,并证明该方法在准确性和效率上优于三种替代的马尔可夫链收敛检验。本文提供了实用的算法和软件实现,解决了网络统计中一个长期存在的计算问题。对您而言,这是一个统计计算与网络科学交叉的实用方法论文,其收敛诊断思路(基于图统计量的时间序列检验)可迁移到您熟悉的MCMC诊断问题中,且其软件实现经验对您的统计计算兴趣有直接参考价值。
- 关键技术:
Markov chain Monte Carlo,configuration model,double-edge swap,Dickey-Fuller GLS test,assortativity,convergence diagnostics - 为什么对您有用: 本文属于统计计算(stat_computing)方向,直接对应您的primary interest中的统计计算与算法。您对M-estimation和软件开发的熟悉程度(very_familiar)足以理解并评估其收敛诊断方法;其基于图统计量的时间序列检验思路,可视为一种特殊的假设检验问题,与您的hypothesis testing兴趣有连接。中期可做:若想深入改进其收敛检测方法,需在moderately_familiar的M-estimation理论(如鞅差序列的检验)上进一步积累。
15. 10.1080/10618600.2024.2421990 — Optimal Subsampling for Data Streams with Measurement Constrained Categorical Responses¶
- 作者: Jun Yu, Zhiqiang Ye, Mingyao Ai, Ping Ma
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Beijing Institute of Technology · King University · Peking University · University of Georgia
- 分类: vol 34 · issue 3 · pp 994-1004
- 相关性 2/10 · novelty:
new_method - 摘要: 本文针对高速大规模数据流中标签测量成本高、无法实时获取的问题,提出一种在线子抽样方法。在多元逻辑回归模型下,算法基于A-最优性准则顺序更新参数估计,仅需存储少量数据即可实现高效计算。理论部分严格建立了估计量的渐近性质,包括相合性和渐近正态性。数值实验在模拟和真实数据集上验证了方法的有效性。该方法属于统计计算中在线算法与最优子抽样的交叉,对您而言,其在线更新策略和A-最优性准则可迁移至您熟悉的因果推断中纵向数据或流式数据的估计问题,且计算框架与您擅长的软件开发和逆问题处理有直接接口。
- 关键技术:
A-optimality criterion,online subsampling,multinomial logistic model,sequential parameter estimation,asymptotic normality - 为什么对您有用: 本文属于统计计算方向,直接对应您的primary interest中的统计计算(数值方法、算法)。方法核心——在线子抽样与A-最优性准则——可迁移至因果推断中纵向数据或流式数据的估计问题,而您对非参数统计和逆问题的熟悉度(very_familiar)足以支撑理解其渐近理论。中期可做:若想将类似在线策略用于proximal CI或IV的流式设定,需先在moderately_familiar的identification theory上长肌肉(具体为负对照假设下的在线识别条件)。
16. 10.1080/10618600.2024.2414104 · arXiv — AddiVortes: (Bayesian) Additive Voronoi Tessellations¶
- 作者: Adam J. Stone, John Paul Gosling
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 859-871
- 相关性 2/10 · novelty:
new_method - 摘要: 本文提出 AddiVortes 模型,一种基于 Voronoi 剖分的加性集成回归模型。与决策树不同,Voronoi 剖分允许分区边界非正交且不平行于坐标轴,从而更灵活地捕捉复杂协变量空间结构。模型采用类似 BART 的加性“剖分之和”框架,通过贝叶斯回拟合 MCMC 算法进行后验采样,并使用正则化先验控制单个剖分的复杂度。在多个数据集上,AddiVortes 在预测性能上优于随机森林、BART 及其他主流黑箱回归模型。该方法本质上是统计计算与贝叶斯非参数建模的结合,对您而言,可作为统计计算方向的一个新算法案例,其 MCMC 实现和剖分策略可能启发您在高维或因果推断中设计更灵活的集成学习工具。
- 关键技术:
Voronoi tessellation,Bayesian additive model,backfitting MCMC,regularization prior,ensemble regression - 为什么对您有用: 本文属于统计计算方向,提出了一种新的集成回归算法,与您对统计计算(数值方法、算法)的兴趣直接相关。您的武器库中“软件发展”和“非参数统计”可用于复现或扩展该模型,例如用树宽/张量收缩视角分析 Voronoi 剖分的计算复杂度。中期可做:若您想深入其 MCMC 收敛性,需先在 moderately_familiar 的 M-估计理论或贝叶斯非参数上加强。
17. 10.1080/10618600.2024.2409789 — Network Embedding-based Directed Community Detection with Unknown Community Number¶
- 作者: Qingzhao Zhang, Jinlong Zhou, Mingyang Ren
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Xiamen University · Shanghai Jiao Tong University
- 分类: vol 34 · issue 3 · pp 812-823
- 相关性 2/10 · novelty:
new_method - 摘要: 本文针对有向网络的社区发现问题,同时估计社区数量并恢复社区结构。现有方法多假设社区数已知或仅适用于无向网络,本文通过将出节点和入节点嵌入低维向量空间,并引入惩罚融合迫使嵌入向量向中心收缩,从而自动确定社区数。方法的核心机制是网络嵌入与惩罚融合的结合,利用低维向量表示节点并施加融合惩罚以实现社区划分。理论方面建立了网络嵌入、有向社区检测和社区数估计的渐近一致性。仿真和脑功能网络数据表明该方法优于多种现有方法。对您而言,本文的统计计算思路(嵌入+惩罚融合)与您在高维统计和统计计算方面的兴趣相关,尤其是其算法实现和数值方法部分。
- 关键技术:
network embedding,penalized fusion,directed community detection,low-dimensional vector space,asymptotic consistency - 为什么对您有用: 本文属于统计计算方法在社区检测中的应用,与您的统计计算兴趣相关。您的武器库中'软件开发和数值方法'可直接用于复现或改进其算法实现,但核心方法(网络嵌入+惩罚融合)并非您非常熟悉的工具,属于中期可做——需先在 moderately_familiar 的 M-estimation 理论上加强以理解其惩罚机制。
18. 10.1080/10618600.2024.2407465 — A Latent Space Model for Weighted Keyword Co-Occurrence Networks with Applications in Knowledge Discovery in Statistics¶
- 作者: Yan Zhang, Rui Pan, Xuening Zhu, Kuangnan Fang, Hansheng Wang
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Xiamen University · Central University of Finance and Economics · Fudan University · Intelligent Health (United Kingdom) · Peking University
- 分类: vol 34 · issue 3 · pp 779-794
- 相关性 2/10 · novelty:
application - 摘要: 本文针对加权且动态的关键词共现网络,提出了一种潜变量空间模型。传统模型多针对无权网络,将频数二值化会损失大量信息;该模型直接利用加权边,并允许网络节点随时间演化,可评估新节点对网络连通性的影响。估计采用投影梯度下降算法,并建立了估计量的理论性质。在统计学期刊关键词网络的实证中,识别了各时期的热门关键词及关键词对之间的关联强度,并发现统计学家对新兴研究领域的兴趣逐年增长。对您而言,本文的潜变量空间建模思路和投影梯度下降算法可迁移至您在高维统计或因果推断中处理动态网络数据的场景,但方法学创新有限。
- 关键技术:
latent space model,weighted network,projected gradient descent,keyword co-occurrence network - 为什么对您有用: 本文属于统计计算与网络分析的应用,与您的主要兴趣(高维统计、统计计算)有弱连接。您的武器库中'非参数统计'和'高维渐近理论'可用于分析其潜变量估计的收敛性,但核心模型(潜空间网络)并非您当前主攻方向。作为gateway reading,本文方法学深度一般,不值得投入全文时间。
19. 10.1080/10618600.2024.2416521 — Efficient Sampling From the Watson Distribution in Arbitrary Dimensions¶
- 作者: Lukas Sablica, Kurt Hornik, Josef Leydold
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Vienna University of Economics and Business
- 分类: vol 34 · issue 3 · pp 923-933
- 相关性 1/10 · novelty:
new_method - 摘要: 本文针对任意维度 Watson 分布的随机采样问题,提出了两种高效算法。第一种算法将 Kent 等人为 Bingham 分布设计的拒绝采样方案适配到 Watson 分布,利用角中心高斯包络,并推导出最大化采样效率的参数闭式解,通过巧妙的矩阵求逆避免了维度灾难,在高维下仍能快速运行。第二种算法基于 Saw 方法,采用投影分布的自适应拒绝采样,同样适用于所有维度且采样速度快。模拟研究表明两种方法各有优势:第一种在小样本或大维度下更高效,第二种在大样本和更集中的分布下表现更好。两种算法均已实现在 R 包 watson 中。该工作属于统计计算中随机数生成的经典问题,对您作为统计计算软件开发者(R 包开发经验)有直接参考价值。
- 关键技术:
rejection sampling,angular central Gaussian envelope,adaptive rejection sampling,Watson distribution,matrix inversion trick - 为什么对您有用: 本文属于统计计算(随机数生成)方向,直接对应您 primary interest 中的 'statistical computing (numerical methods, algorithm)'。您武器库中 'software development' 一项(very_familiar)可直接用于阅读和评估其 R 包实现,甚至复现或扩展其算法。中期可做:若想深入改进采样效率(如针对更一般的分布族),需先在 'M-estimation theory'(moderately_familiar)上长肌肉,以理解其拒绝采样参数优化的理论框架。
其他 (other, 3 篇)¶
1. 10.1080/10618600.2024.2414113 — Heterogeneous Functional Regression for Subgroup Analysis¶
- 作者: Yeqing Zhou, Fei Jiang
- 期刊/来源: Journal of Computational and Graphical Statistics
- 机构: Tongji University · University of California, San Francisco · University of California System · Cancer Research And Biostatistics
- 分类: vol 34 · issue 3 · pp 872-883
- 相关性 5/10 · novelty:
new_method - 摘要: 本文提出异质性函数回归(Heterogeneous Functional Regression, HFR)模型,用于子组分析。设定中,响应变量与预测变量的关系随潜在子组变化,且被建模为辅助预测变量的未知函数。方法通过融合型组惩罚(fusion-type group-wise penalization)同时进行参数估计和子组识别。理论方面,建立了参数估计的非渐近收敛性、oracle性质和渐近正态性。模拟实验和阿尔茨海默病数据集的应用验证了方法有效性。该工作属于高维异质性建模与惩罚回归的交叉,但未涉及因果推断、半参效率或高阶U统计等核心兴趣方向。
- 关键技术:
fusion-type group-wise penalization,non-asymptotic convergence,oracle property,functional regression,subgroup identification - 为什么对您有用: 本文与主要兴趣(因果推断、半参理论、高阶U统计)无直接关联,属于高维异质性回归的方法学工作。武器库中的非参统计和M估计理论可用于理解其惩罚机制,但核心问题(子组识别与函数回归)不在当前研究主线上。暂不可做:缺乏直接连接点,且方法学新颖性有限(融合惩罚已有大量文献)。
2. 10.1080/10618600.2024.2431057 · arXiv — Local Clustering for Functional Data¶
- 作者: Yuanxing Chen, Qingzhao Zhang, Shuangge Ma
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 1075-1090
- 相关性 4/10 · novelty:
new_method - 摘要: 本文针对函数型数据提出局部聚类方法,解决现有方法假设整个测量域(如时间区间)上聚类结构单一的问题。方法基于基展开技术,通过新颖的惩罚项形式同时实现子区间识别、聚类和估计。理论部分建立了估计和聚类的一致性性质。模拟研究表明该方法显著优于多个竞争方法。在COVID-19美国各州日确诊数据中,识别出有意义的子区间和聚类结构。该方法对您而言属于应用统计方法,与您的主要兴趣方向(因果推断、高维统计等)无直接技术重叠,但可作为函数型数据分析的参考。
- 关键技术:
basis expansion,penalized clustering,functional data analysis,local clustering - 为什么对您有用: 本文属于函数型数据聚类的方法学论文,与您的主要兴趣方向(因果推断、高维统计、U统计量等)无直接技术连接。您的技术武器库中非参数统计和M估计理论可部分理解其基展开和惩罚框架,但核心问题(局部聚类识别)不在您的兴趣射程内。暂不可做——缺少函数型数据聚类领域的背景和工具。
3. 10.1080/10618600.2024.2409784 · arXiv — Efficient Modeling of Spatial Extremes over Large Geographical Domains¶
- 作者: Arnab Hazra, Raphaël Huser, David Bolin
- 期刊/来源: Journal of Computational and Graphical Statistics
- 分类: vol 34 · issue 3 · pp 795-811
- 相关性 3/10 · novelty:
new_method - 摘要: 本文针对大地理区域空间极值建模中极值依赖结构随距离衰减的问题,提出了一种新的贝叶斯框架。模型基于高斯尺度混合,其中高斯过程分量通过随机偏微分方程(SPDE)定义以获得稀疏精度矩阵,随机尺度分量则建模为具有紧支撑基函数的低秩Pareto尾或Weibull尾空间过程。该模型近似尾部平稳,能捕捉从渐近相关到渐近独立的广泛极值依赖结构。利用稀疏概率结构,设计了定制化的MCMC算法,优先校准尾部行为,实现高维空间上的快速贝叶斯计算。在孟加拉国强季风降雨数据上的应用表明,模型优于自然竞争模型,并用于推断边际降雨和空间聚合的长期重现水平。对您而言,本文虽不直接涉及您的主要兴趣方向,但其在空间极值建模中结合SPDE与低秩过程的计算策略,以及针对尾部校准的MCMC设计,可作为统计计算(computationally constrained statistics)领域的入门阅读,展示了在复杂模型下如何通过结构稀疏性实现高效推断。
- 关键技术:
Gaussian scale mixture,stochastic partial differential equation (SPDE),sparse precision matrix,low-rank spatial process,tail calibration MCMC - 为什么对您有用: 本文属于astrostats/空间统计的gateway reading,但更偏向计算统计。它展示了如何通过SPDE和低秩结构实现高维空间模型的高效计算,这与您对统计计算(statistical computing)的兴趣相关。您的武器库中'软件开发和逆问题'可帮助理解其计算框架,但核心的极值理论(如Pareto尾、极值依赖)不在您的技术栈中,因此属于暂不可做方向,仅适合作为了解空间统计计算范式的入门读物。
Maintained by 陈星宇 · Homepage · Source on GitHub