JRSSB — Vol 84 Issue 5 · 2026-07-05¶
- 共 16 篇 · Journal of the Royal Statistical Society Series B
- 目录核对 ✅ 16 篇全部抓到(对照 OpenAlex 17 篇)
本期导览¶
自动生成:归纳本期主要主题与脉络,不打分、不排名。
JRSSB Vol 84 Issue 5 的 16 篇论文可归纳为四条主线:因果推断与实验设计(4 篇)、高维统计与随机矩阵(2 篇)、假设检验与多重比较(5 篇)、以及计算方法与函数型数据分析(3 篇),另有 2 篇分别涉及 COVID-19 建模和极值图模型。因果推断主线覆盖了时空点过程、潜变量结构检验、网络关联数据回归和实验分组优化,体现了对复杂数据结构和识别假设的拓展。假设检验主线则聚焦于条件独立性、变点检测、多重比较校准和 FDR 控制,其中多篇引入了自归一化或协变量辅助的新工具。
在因果推断主线中,Causal Inference with Spatio-Temporal Data 将潜在结果框架推广至时空点过程,通过鞅理论建立估计量的一致性,并允许任意空间溢出和时间携带效应,同时提供敏感性分析工具。A Statistical Test to Reject the Structural interpretation of a Latent Factor Model 从因子分析出发,证明潜变量结构性假设的可检验性,利用协方差约束构造检验统计量,为量表开发提供诊断手段。Linear Regression and Its Inference on Noisy Network-Linked Data 提出带非参数网络效应的回归模型,对网络观测误差稳健,并发现网络密度相变现象。An Approximation Algorithm for Blocking of an Experimental Design 从组合优化角度最小化组内最大成对差异,给出多项式时间算法及其近似保证,直接服务于实验设计中的精度提升。
假设检验主线中,Conditional Independence Testing in Hilbert Spaces 针对函数型变量提出基于回归残差内积的检验,在函数型线性模型下均匀控制第一类错误,并应用于截断点置信区间和 EEG 图模型。Segmenting Time Series via Self-Normalisation 提出自归一化框架统一处理均值、方差等变点检测,无需一致估计长期方差,结合嵌套局部窗口算法实现一致分割。Calibrating the Scan Statistic 针对高斯序列变点检测,提出三种有限样本校准方法,克服渐近最优性在实际样本量下的粗糙性,并扩展至自然指数族和异方差分布。ZAP 直接使用 z 值结合协变量进行 FDR 控制,即使工作模型错误指定也能保证 FDR 控制,在模拟中优于 AdaPT 等基于 p 值的方法。General Bayesian Loss Function Selection 将 Hyvärinen 评分与 general Bayesian 更新结合,提出 ℋ-score 用于模型选择,允许模型为 improper 时仍能一致选择最优模型。
高维统计主线中,High-Dimensional Principal Component Analysis with Heterogeneous Missingness 针对异质性缺失提出 primePCA 方法,通过迭代插补实现主成分的几何收敛恢复,理论保证依赖于缺失机制的平均性质。Exact Clustering in Tensor Block Model 刻画了张量聚类的统计-计算权衡,提出高阶 Lloyd 算法和谱聚类,并给出奇异值间隙无关的估计误差界。计算方法主线中,Dimension-Free Mixing for High-Dimensional Bayesian Variable Selection 证明 informed MCMC 采样器的混合速率与维数无关,引入两阶段漂移条件作为理论工具。CovNet 用神经网络参数化协方差函数,实现多维域函数数据的通用逼近和高效特征分解。Empirical Likelihood-Based Inference for Functional Means 针对可穿戴设备数据中的 occupation time 曲线,构建经验似然比置信带,允许协方差不连续。
与因果推断方向最贴的论文是 Causal Inference with Spatio-Temporal Data(时空点过程因果效应)、A Statistical Test to Reject the Structural interpretation of a Latent Factor Model(潜变量因果结构检验)、Linear Regression and Its Inference on Noisy Network-Linked Data(网络关联数据因果推断)、An Approximation Algorithm for Blocking of an Experimental Design(实验分组优化)。与半参数/非参数方向最贴的是 Conditional Independence Testing in Hilbert Spaces(函数型条件独立性检验)、Segmenting Time Series via Self-Normalisation(非参数变点检测)、Empirical Likelihood-Based Inference for Functional Means(函数型均值非参数推断)。与高维方向最贴的是 High-Dimensional Principal Component Analysis with Heterogeneous Missingness(高维 PCA 缺失处理)、Exact Clustering in Tensor Block Model(张量聚类统计-计算权衡)、Dimension-Free Mixing for High-Dimensional Bayesian Variable Selection(高维贝叶斯变量选择 MCMC 混合)。
因果推断 (causal_inference, 4 篇)¶
1. 10.1111/rssb.12548 · arXiv — Causal Inference with Spatio-Temporal Data: Estimating the Effects of Airstrikes on Insurgent Violence in Iraq¶
- 作者: Georgia Papadogeorgou, Kosuke Imai, Jason Lyall, Fan Li
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 机构: University of Florida · Harvard University Press · Dartmouth College · Dartmouth Hospital · Duke University
- 分类: vol 84 · issue 5 · pp 1969-1999
- 相关性 9/10 · novelty:
new_method - 摘要: 本文扩展了潜在结果框架以处理时空点过程数据,将处理点过程建模为随机干预,定义因果估计量为指定区域内期望结果事件数。方法允许任意的空间溢出和时间携带效应模式,利用鞅理论证明估计量在时间周期数增加时的一致性和渐近正态性。提出针对未测量混杂的敏感性分析,并将其扩展到Hájek估计量。通过模拟研究考察有限样本性能,并应用于2007年2月至2008年7月美国空袭对伊拉克叛乱暴力影响的估计。分析表明,将日均空袭次数增加最多一个月可能导致更多叛乱袭击,且空袭可能将袭击从巴格达转移到400公里外的新地点。该工作对您有用,因为它将因果推断框架拓展到时空点过程这一复杂设定,与您对因果推断(特别是识别与估计)和纵向数据的兴趣直接相关。
- 关键技术:
potential outcomes framework,stochastic intervention,spatio-temporal point process,martingale theory,sensitivity analysis,Hájek estimator - 为什么对您有用: 本文直接连接您对因果推断(特别是纵向数据与空间溢出效应)的兴趣,将潜在结果框架推广到时空点过程,处理了空间溢出和时间携带效应。您的技术武器库中'因果推断中的估计理论'和'非参数统计'可用于理解其估计量的渐近性质,而'敏感性分析'方法可迁移至您关注的proximal CI或IV设定。中期可做:需先在'半参数理论'上加强,以处理更复杂的时空依赖结构。
2. 10.1111/rssb.12555 · arXiv — A Statistical Test to Reject the Structural interpretation of a Latent Factor Model¶
- 作者: Tyler J. VanderWeele, Stijn Vansteelandt
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 2032-2054
- 相关性 7/10 · novelty:
new_method - 摘要: 本文在因子分析框架下,研究潜变量模型的结构性解释(即潜变量是因果效应的唯一载体,而指标变量本身无直接因果作用)是否可被拒绝。作者证明,即使潜变量不可观测,该结构性假设仍具有可检验的实证含义:若指标变量对后续结果存在直接效应(不通过潜变量中介),则模型被拒绝。基于此,提出一个统计检验方法,利用观测数据中的协方差约束来检验该假设。方法的核心是构造一个检验统计量,其零分布对应于结构性假设成立时的参数约束,通过比较约束模型与无约束模型的拟合优度来做出推断。作者将方法应用于生活满意度量表(SWLS)与全因死亡率关联的数据分析,结果强烈拒绝了一个单维潜变量结构性解释的假设。讨论部分指出,该检验对量表开发、评估和使用以及因子分析实践具有重要启示。对您而言,本文直接连接因果推断中关于测量误差和潜变量因果解释的识别问题,且检验思路可迁移至您熟悉的proximal causal inference框架下的negative control检验。
- 关键技术:
factor analysis,structural equation modeling,likelihood ratio test,covariance constraints,testable implications of latent variable models - 为什么对您有用: 本文直接连接您的primary interest中因果推断的识别问题,特别是潜变量模型的结构性解释检验,与proximal CI中negative control假设的检验有深层类比。您可以用very_familiar的非参数统计和估计理论工具,将本文的似然比检验思路推广到更一般的半参数设定(如不假设正态性),这是立即可做的方向。
3. 10.1111/rssb.12554 · arXiv — Linear Regression and Its Inference on Noisy Network-Linked Data¶
- 作者: Can M. Le, Tianxi Li
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 1851-1885
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究网络关联数据(network-linked observations)下的线性回归及其推断问题。传统方法通常假设网络结构无误差观测,且对社交效应施加严格参数化假设。作者提出一个带非参数网络效应的回归模型,不要求关系数据或网络结构精确观测,且对网络扰动具有可证明的稳健性。在一般网络观测误差条件下建立了渐近推断框架,并针对误差来自随机网络模型的特定情形研究了方法的稳健性。发现了一个关于网络密度的相变现象:当无网络模型先验知识时,推断有效性随密度变化存在阈值;而知晓网络模型可显著改善推断性能。模拟研究验证了理论结果,并展示了方法在精度和计算效率上优于现有工作。应用于中学学生网络数据,研究教育研讨会在减少校园冲突中的效果。对您而言,该文将网络测量误差纳入因果推断框架,与您的proximal causal inference和sensitivity analysis兴趣直接相关,其非参数网络效应建模思路可迁移至您熟悉的identification theory工具。
- 关键技术:
nonparametric network effects,network perturbation robustness,phase transition in network density,asymptotic inference under network errors,random network models - 为什么对您有用: 本文直接连接您的primary interest中的causal inference子方向——网络关联数据下的回归推断,尤其关注网络测量误差对推断有效性的影响,与proximal CI中的negative control假设有相似精神。您的technical arsenal中'nonparametric statistics'和'estimation theory in causal inference'可直接用于分析其非参数网络效应估计量的收敛性质;'minimax bounds for estimation problems'可用于验证其相变阈值是否最优。中期可做:若想将网络误差建模与您的HOIF工具结合,需先在'moderately_familiar'的semiparametric theory上加强,以处理网络效应与个体效应的半参数分解。
4. 10.1111/rssb.12545 — An Approximation Algorithm for Blocking of an Experimental Design¶
- 作者: Bikram Karmakar
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 机构: University of Florida
- 分类: vol 84 · issue 5 · pp 1726-1750
- 相关性 4/10 · novelty:
new_method - 摘要: 本文研究实验设计中分组(blocking)的近似算法问题。目标是将实验单元划分为大小相等的组,以最小化组内单元之间的最大成对差异(max pairwise difference),从而提升处理效应估计的精度。作者证明,最小化最大成对差异可以保证在所有处理分配下,平均处理效应估计的误差都被一致地有界;而传统方法(如最小化平均或总和差异)在某些分配下仍可能产生大误差。由于最优分组是NP难的,作者提出了多项式时间算法,并给出了与最优分组差距的近似保证(provably close to optimal)。模拟研究表明,所提方法在创建更同质的分组方面优于现有启发式方法。该工作将组合优化与因果推断中的实验设计紧密结合,对您可能有用:它直接关联到您因果推断兴趣中的实验设计与估计精度问题,且其近似保证思路可迁移至您熟悉的非参数统计与极小极大界框架下进行理论分析。
- 关键技术:
polynomial-time approximation algorithm,blocked randomized design,max pairwise difference,NP-hardness,experimental design - 为什么对您有用: 本文直接连接您因果推断兴趣中的实验设计与估计精度子方向。您武器库中'非参数统计'和'极小极大界'可用于分析其近似保证的紧性,而'软件开发'技能可复现其算法并与现有R包(如blockrand)对比。中期可做:需先在'moderately_familiar'的M估计理论中熟悉分组设计的影响函数推导,才能将近似保证推广到更一般的估计量。
高维统计 / 随机矩阵 (high_dim_rmt, 2 篇)¶
1. 10.1111/rssb.12550 · arXiv — High-Dimensional Principal Component Analysis with Heterogeneous Missingness¶
- 作者: Ziwei Zhu, Tengyao Wang, Richard J. Samworth
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 2000-2031
- 相关性 8/10 · novelty:
new_method - 摘要: 本文研究高维主成分分析(PCA)在存在缺失观测值时的估计问题。在均匀缺失的简单模型下,作者证明了已有的观测比例加权(OPW)估计量可以(几乎)达到极小极大最优收敛速率,并呈现有趣的相变现象。然而,在更现实的异质性缺失机制下,OPW估计量的经验表现不佳,且在无噪声情形下无法精确恢复主成分。为此,作者提出了一种新方法 primePCA,它从OPW估计量出发,通过迭代地将观测到的数据矩阵条目投影到当前估计的列空间来插补缺失值,然后计算插补后数据矩阵的右奇异空间以更新估计。在无噪声情形下,primePCA的误差以几何速率收敛到零,且理论保证依赖于缺失机制的平均性质而非最坏情况性质。模拟和真实数据实验表明,primePCA在包括非完全随机缺失在内的多种场景下表现优异。该工作对您在高维统计和随机矩阵理论方面的兴趣有直接关联,特别是其关于相变和极小极大最优性的理论分析,以及处理异质性缺失的算法设计,可启发您在高维推断问题中考虑更复杂的缺失机制。
- 关键技术:
minimax optimal rate,phase transition,observed-proportion weighted (OPW) estimator,iterative imputation,singular value decomposition,geometric convergence - 为什么对您有用: 本文直接关联您对高维统计和随机矩阵理论的兴趣,特别是主成分分析在缺失数据下的极小极大最优性和相变分析。您可以用 very_familiar 中的 minimax bounds 和 high-dimensional asymptotics 工具来验证其声称的收敛速率是否紧,并考虑将 primePCA 的迭代插补思路推广到其他高维推断问题(如协方差矩阵估计)。中期可做:若想进一步分析 primePCA 在非随机缺失下的识别性,需先在 moderately_familiar 的 identification theory 上提升。
2. 10.1111/rssb.12547 · arXiv — Exact Clustering in Tensor Block Model: Statistical Optimality and Computational Limit¶
- 作者: Rungang Han, Yuetian Luo, Miaoyan Wang, Anru R. Zhang
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 1666-1698
- 相关性 8/10 · novelty:
new_theory - 摘要: 本文研究高维张量数据的聚类问题,提出张量块模型(Tensor Block Model),目标是在多路数据中识别异质子结构。核心贡献在于:1)提出两种计算高效的方法——高阶Lloyd算法(HLloyd)和高阶谱聚类(HSC),并给出在次高斯噪声假设下的收敛保证和统计最优性;2)在高斯张量块模型下,基于三种不同的信噪比区间,完整刻画了实现精确聚类的统计-计算权衡(statistical-computational trade-off)。技术工具包括高阶谱摄动分析和一种新颖的“奇异值间隙无关”张量估计误差界,这些与矩阵谱分析有本质区别。实证部分在合成和真实数据集上验证了方法的有效性。对您而言,本文直接连接您对统计-计算权衡(statistical-computational tradeoff)的兴趣,且其张量块模型与您熟悉的高阶U-统计量的张量收缩/树宽复杂度有潜在交叉——您可以用einsum复杂度视角分析HLloyd算法的计算代价。
- 关键技术:
tensor block model,high-order Lloyd algorithm,high-order spectral clustering,statistical-computational trade-off,spectral perturbation analysis,singular-value-gap-free error bound - 为什么对您有用: 本文直接连接您对统计-计算权衡(statistical-computational tradeoff)的兴趣,属于gateway reading:它清晰陈述了统计模型(张量块模型)、计算模型(多项式时间算法)和信噪比阈值,并明确展示了统计最优与计算可行之间的间隙。您可以用very_familiar的“高阶U-统计量的树宽/张量收缩复杂度”工具来分析HLloyd算法的计算代价(例如,其迭代步骤是否可映射为张量收缩的einsum复杂度问题)。中期可做:需先在moderately_familiar的“高阶U-统计量理论”上长肌肉,以理解其谱分析中的张量扰动界。
非参数 / 半参数 (nonparam_semipara, 1 篇)¶
1. 10.1111/rssb.12543 — Empirical Likelihood-Based Inference for Functional Means with Application to Wearable Device Data¶
- 作者: Hsin-wen Chang, Ian W. McKeague
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 机构: Academia Sinica · Columbia University
- 分类: vol 84 · issue 5 · pp 1947-1968
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对可穿戴设备数据中的occupation time曲线(即设备读数范围内所有活动水平的累积时间曲线)提出非参数推断框架。目标是对这类函数型均值进行置信带构建和比较,且允许函数协方差存在不连续性,并适应观测轨迹的离散化。方法核心是经验似然比(empirical likelihood ratio),通过将函数型数据转化为适当定义的 estimating equation 来构造似然比统计量,避免了传统函数型数据分析中强光滑性假设。理论部分建立了经验似然比统计量的渐近卡方分布,从而得到点wise置信区间和同时置信带。模拟表明该方法在覆盖率和区间宽度上优于现有函数型数据方法(如基于bootstrap的band)。最后用NHANES可穿戴设备数据演示了实际应用。对您而言,该文的经验似然框架与您熟悉的非参数统计和M-estimation理论有直接联系,且函数型数据中的协方差不连续性处理可能启发您在proximal CI或纵向设定中处理类似的不连续结构。
- 关键技术:
empirical likelihood ratio,functional data analysis,confidence bands,estimating equations,occupation time curves - 为什么对您有用: 连接非参数统计与函数型数据推断,经验似然比方法可视为您熟悉的最小上界/估计方程框架的拓展。武器库中'nonparametric statistics'和'M-estimation theory'可直接用于理解其渐近论证,但函数型数据的无穷维特性需要额外熟悉。中期可做:若想将经验似然推广到您的proximal CI设定,需先在'moderately_familiar'的semiparametric theory上加强,特别是influence function在函数型数据中的形式。
数理统计 / 假设检验 (hypothesis_testing, 5 篇)¶
1. 10.1111/rssb.12544 · arXiv — Conditional Independence Testing in Hilbert Spaces with Applications to Functional Data Analysis¶
- 作者: Anton Rask Lundborg, Rajen D. Shah, Jonas Peters
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 1821-1850
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究在 X、Y、Z 均为函数型随机变量时,条件独立性检验问题。作者首先证明,即使在理想化的高斯设定下,任何检验的功效都无法超过其水平,因此必须引入额外的建模假设。他们提出了一种基于回归残差内积的检验统计量,该统计量计算简单,且当样本内预测误差足够小时,能均匀控制第一类错误。在函数型线性模型下,使用岭回归即可满足该要求,且无需特征值间距条件或协方差算子特征值的下界。该方法被应用于截断函数型线性模型中截断点的置信区间构建,以及EEG数据的函数型图模型边检验。对您而言,该工作将高维/函数型数据的假设检验与回归残差方法结合,其理论分析(均匀控制type I error)可直接迁移至您熟悉的非参数检验或因果推断中的敏感性分析场景。
- 关键技术:
conditional independence testing,functional data analysis,ridge regression,residual-based test statistic,uniform type I error control - 为什么对您有用: 该论文直接关联您的主要兴趣——假设检验,且将问题推广至函数型数据这一高维设定。您武器库中'非参数统计'和'高维渐近理论'可直接用于理解其残差检验的均匀控制论证,并可能进一步探索其与因果推断中条件独立性检验的联系(如proximal causal inference中的negative control)。中期可做:若想将方法推广至更复杂的函数型因果结构,需先在'semiparametric theory'上加强,以处理非参数回归的收敛速率与检验功效的trade-off。
2. 10.1111/rssb.12552 — Segmenting Time Series via Self-Normalisation¶
- 作者: Zifeng Zhao, Feiyu Jiang, Xiaofeng Shao
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 机构: University of Notre Dame · Fudan University · China Datang Corporation (China) · University of Illinois Urbana-Champaign · Committee on Institutional Cooperation
- 分类: vol 84 · issue 5 · pp 1699-1725
- 相关性 6/10 · novelty:
new_method - 摘要: 本文针对多元时间序列的变点估计问题,提出了一种基于自归一化(self-normalisation, SN)的通用非参数框架。该方法无需一致估计长期方差,对时间依赖性具有稳健性,且能统一处理均值、方差、相关性和分位数等多种参数的变点检测。核心创新在于将SN检验统计量与一种新颖的嵌套局部窗口分割算法相结合,该算法在变点分析文献中尚属首次。由于SN检验中使用了不一致的长期方差估计量,作者发展了非标准的理论论证来推导所提变点检测方法的一致性和收敛速率。大量数值实验和真实数据分析表明,该方法相比现有主流方法具有更广的适用性和有效性。对您而言,该工作将假设检验与时间序列分割相结合,其自归一化技巧可迁移至您熟悉的因果推断中纵向数据的敏感性分析场景。
- 关键技术:
self-normalisation,change-point detection,nested local-window segmentation,long-run variance estimation,multivariate time series - 为什么对您有用: 本文属于假设检验与时间序列分析的交叉,直接对应您primary interest中的'mathematical statistics (hypothesis testing)'。其自归一化方法避免了长期方差的一致估计,这一技巧可应用于您熟悉的'high-dimensional asymptotics'工具来改进纵向因果推断中的变点检测问题。中期可做:需先在'moderately_familiar'的'M-estimation theory'上巩固,以处理更复杂的参数设定。
3. 10.1111/rssb.12549 — Calibrating the Scan Statistic: Finite Sample Performance Versus Asymptotics¶
- 作者: Guenther Walther, Andrew Perry
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 机构: Stanford Medicine · Stanford University
- 分类: vol 84 · issue 5 · pp 1608-1639
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究高斯序列模型中未知位置和长度的区间均值变点检测问题。传统scan统计量使用尺度依赖的临界值虽能渐近最优地同时检测所有信号长度,但对短信号功率损失严重。作者指出渐近最优性结果在实际样本量下过于粗糙,无法有效区分不同scan统计量的性能。为此提出三种有限样本校准方法:第一种针对高斯分布调整临界值;第二种通过尺度依赖的显著性水平调整,适用于任意已知零分布;第三种将扫描限制在稀疏窗口子集并应用加权Bonferroni校正,简单且通用。方法扩展至自然指数族、异方差对称分布(通过自归一化)及可交换观测(置换/秩/符号检验)。对您而言,本文的有限样本校准思路与您熟悉的非参数统计和假设检验方向直接相关,其自归一化技术可迁移至您的高维推断工作。
- 关键技术:
scan statistic,finite-sample calibration,scale-dependent critical values,weighted Bonferroni adjustment,self-normalization,exchangeable observations - 为什么对您有用: 本文属于假设检验方向,直接连接您的primary interest中的'mathematical statistics & hypothesis testing'。您武器库中'非参数统计'和'高维渐近理论'可用于分析其自归一化方法的有限样本性质,或将其校准思路推广至更复杂的变点检测设定。中期可做:需先在'moderately_familiar'的M估计理论中熟悉自归一化技术的理论框架,再考虑扩展。
4. 10.1111/rssb.12557 · arXiv — ZAP:Z-Value Adaptive Procedures for False Discovery Rate Control with Side Information¶
- 作者: Dennis Leung, Wenguang Sun
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 1886-1946
- 相关性 5/10 · novelty:
new_method - 摘要: 本文提出 ZAP (Z-Value Adaptive Procedures) 方法,用于在协变量辅助的多重假设检验中控制错误发现率 (FDR)。传统方法通常将原始检验统计量转换为 p 值,再结合协变量进行自适应检验,但这一转换会丢失方向信息,削弱协变量的辅助能力。ZAP 直接使用 z 值(保留符号和幅度)与协变量联合建模,通过一个工作模型模拟最优的 oracle 过程,其拒绝域显著不同于基于 p 值的自适应方法。核心理论贡献是:即使工作模型被错误指定,ZAP 仍能在极弱假设下保证 FDR 控制(无需对协变量分布或模型形式施加约束)。模拟和真实数据实验表明,相比 AdaPT、IHW 等基于 p 值的方法,ZAP 在功效上有实质性提升。该方法已实现为 R 包 zap。对您而言,本文属于假设检验方向中协变量自适应 FDR 控制的前沿工作,其“保留完整结构信息”的思路与您在高维统计中处理信号检测问题的兴趣直接相关。
- 关键技术:
Z-value adaptive procedures,false discovery rate control,covariate-adaptive multiple testing,oracle procedure emulation,working model misspecification robustness - 为什么对您有用: 本文属于 hypothesis_testing 方向,直接对应您的 primary interest 中的“数学统计与假设检验”。其核心创新——利用 z 值而非 p 值保留方向信息以提升协变量辅助 FDR 控制的功效——与您在高维统计中处理信号检测问题的兴趣高度相关。从技术武器库看,您对 minimax bounds 和高维渐近理论非常熟悉,可以立即用这些工具分析 ZAP 在稀疏信号设定下的最优性(例如,其功效是否达到 minimax 可检测边界),这是“立即可做”的 follow-up。此外,ZAP 对工作模型错误指定的稳健性证明涉及 empirical process 技巧,与您熟悉的非参数统计工具相通。
5. 10.1111/rssb.12553 · arXiv — General Bayesian Loss Function Selection and the use of Improper Models¶
- 作者: Jack Jewson, David Rossell
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 1640-1665
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究在损失函数定义的概率模型可能为 improper(非正常)时,如何从贝叶斯视角进行模型选择。作者将 Hyvärinen 评分与 general Bayesian updating 结合,提出 ℋ-score 作为模型选择准则,并证明该准则能一致地选择在 Fisher 散度下最接近数据生成真值的模型(即使该模型是 improper)。进一步,作者证明 ℋ-posterior 能一致地学习损失函数中的最优超参数,包括 general Bayesian 推断中的温度参数。在稳健回归和非参数密度估计两个例子中,常用损失函数对应的模型是 improper 的,标准模型选择工具无法适用,而 ℋ-score 提供了可行的方案。这些例子展示了 ℋ-score 在鲁棒性-效率权衡上的优势,并为核密度估计开启了贝叶斯推断的新途径。对您而言,本文提出的 improper 模型选择框架与您在高维统计和假设检验中的兴趣相关,尤其是其一致性和最优超参数学习的理论结果,可能为您的非参数和半参数方法研究提供新的工具。
- 关键技术:
Hyvärinen score,general Bayesian updating,Fisher divergence,improper models,ℋ-score,ℋ-posterior - 为什么对您有用: 本文连接您对假设检验和非参数/半参数理论的兴趣,特别是模型选择中 improper 模型的处理。您武器库中的非参数统计和 minimax 界可用于分析 ℋ-score 的收敛速率和最优性,而您对 M 估计理论的熟悉程度有助于理解 general Bayesian 框架下的超参数学习。中期可做:若您想将 ℋ-score 扩展到高维或因果推断设定,需先在 moderately_familiar 的 semiparametric theory 上加强,特别是处理 nuisance 参数时的影响函数推导。
统计计算 / 算法 (stat_computing, 2 篇)¶
1. 10.1111/rssb.12546 · arXiv — Dimension-Free Mixing for High-Dimensional Bayesian Variable Selection¶
- 作者: Quan Zhou, Jun Yang, Dootika Vats, Gareth O. Roberts, Jeffrey S. Rosenthal
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 1751-1784
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究高维贝叶斯变量选择中MCMC算法的混合时间。在Yang等人提出的温和高维假设下,作者设计了一种基于 informed proposal 的 Metropolis-Hastings 采样器,并证明其混合速率与协变量维数无关(dimension-free)。这是首个严格证明 informed MCMC 方法的混合速率足以抵消局部后验评估计算成本的高维结果。理论分析中,作者提出了“两阶段漂移条件”(two-stage drift condition)这一新工具,用于研究一般状态空间上马尔可夫链的收敛速率,可得到高维设定下的紧复杂度界。模拟和真实数据分析验证了算法的实际优势。对您而言,该论文直接关联统计计算中的MCMC算法理论,其“两阶段漂移条件”可能为分析其他高维采样器的复杂度提供新框架。
- 关键技术:
informed MCMC,two-stage drift condition,Metropolis-Hastings,Bayesian variable selection,dimension-free mixing time - 为什么对您有用: 本文属于统计计算(MCMC算法理论)的核心方向,直接对应您 primary interest 中的“statistical computing (numerical methods, algorithm)”。您武器库中“very_familiar”的“high-dimensional asymptotics”和“nonparametric statistics”可用于理解其高维假设和收敛性证明框架;而“moderately_familiar”的“M-estimation theory”可能帮助您将“两阶段漂移条件”推广到更一般的后验分布。中期可做:需先在“moderately_familiar”的“semiparametric theory”上长肌肉,以处理非参数模型下的MCMC复杂度。
2. 10.1111/rssb.12551 · arXiv — CovNet: Covariance Networks for Functional Data on Multidimensional Domains¶
- 作者: Soham Sarkar, Victor M. Panaretos
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 1785-1820
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对多维域函数数据(如图像、fMRI)的协方差估计问题,提出了一种名为 CovNet 的神经网络建模与估计框架。标准方法(如局部多项式平滑、FPCA)在二维及以上域中面临维数灾难和计算瓶颈,CovNet 通过将协方差函数参数化为一个可训练的网络,实现了对任意协方差的通用逼近(universal approximation)。该模型的核心优势在于:拟合时可直接利用现代深度学习工具(如自动微分、GPU 加速),且估计量具有显式的闭合形式特征分解,无需显式构造协方差矩阵即可高效计算特征函数和特征值。作者建立了估计量的相合性和收敛速率(依赖于网络复杂度与样本量)。模拟和静息态 fMRI 数据应用展示了其在实际高维函数数据中的可扩展性。对您而言,本文展示了如何将神经网络作为非参数协方差估计的计算工具,其“闭合形式特征分解”思路可能启发您在更高阶 U-统计量的张量网络计算中设计类似的可微分参数化,以降低树宽复杂度。
- 关键技术:
neural network parameterization,universal approximation,closed-form eigendecomposition,functional data analysis,multidimensional domains,covariance estimation - 为什么对您有用: 本文连接您的 statistical computing 兴趣,特别是神经网络作为非参数估计的计算工具。您的武器库中 software development 和 high-dimensional asymptotics 可直接用于复现和扩展其收敛速率分析;computation of higher-order U-statistics (treewidth / tensor contraction / einsum) 可尝试将 CovNet 的闭合特征分解思路推广到高阶协方差张量的低秩参数化,这是一个中期可做的方向——需先在 theory of higher-order U-statistics 上熟悉张量协方差结构的谱理论。
其他 (other, 2 篇)¶
1. 10.1111/rssb.12453 — Modelling the COVID-19 Infection Trajectory: A Piecewise Linear Quantile Trend Model¶
- 作者: Feiyu Jiang, Zifeng Zhao, Xiaofeng Shao
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 机构: Shanghai University of Engineering Science · Shanghai Business School · Fudan University · SAIC-GM (China) · University of Notre Dame · University of Illinois Urbana-Champaign · Committee on Institutional Cooperation
- 分类: vol 84 · issue 5 · pp 1589-1607
- 相关性 5/10 · novelty:
application - 摘要: 本文提出分段线性分位数趋势模型(piecewise linear quantile trend model),用于同时分析多个分位数水平上COVID-19每日新增病例的感染轨迹。模型通过变点(change-point)自然捕捉疫情增长率的阶段转换,具有直观性和可解释性。与均值趋势模型和最小二乘估计不同,该分位数方法对异常值稳健,能捕捉COVID-19感染曲线常见的异方差性,并在极弱假设下自动提供点预测和区间预测。基于自归一化(self-normalized, SN)检验统计量,作者提出了一种新的多变点分割算法,并在温和可验证假设下建立了分割一致性等理论保证。利用该方法分析了35个主要国家的感染曲线,发现了与各国疫情应对有效性相关的模式。进一步设计了简单的变点自适应两阶段预测方案,用于短期预测累计新增病例,预测准确,对公共卫生决策有价值。本文是应用导向的方法学工作,方法本身(分位数回归+变点检测)与您的主要兴趣方向(因果推断、高维统计、U统计量等)无直接技术重叠,但变点检测与分段建模的思路在纵向因果推断中可能有间接参考价值。
- 关键技术:
piecewise linear quantile trend model,self-normalized test statistic,multiple change-point estimation,segmentation consistency,change-adaptive forecasting - 为什么对您有用: 本文属于流行病学应用(secondary interest),但方法学核心是分位数回归与变点检测,与您的主要兴趣方向(因果推断、高维统计、U统计量)无直接技术重叠。武器库中的非参数统计和M估计理论可用于理解其分段建模的渐近性质,但变点检测本身并非您的核心工具。作为流行病学应用,本文提供了COVID-19数据分析的完整流程(数据清洗、模型选择、预测评估),可作为入门读物了解流行病学中感染曲线建模的常见问题与数据特征。暂不可做:核心机器(变点检测的分割算法与自归一化检验)不在武器库中,且该方向与您的主要兴趣距离较远,不值得投入时间深入。
2. 10.1111/rssb.12556 · arXiv — Structure Learning for Extremal Tree Models¶
- 作者: Sebastian Engelke, Stanislav Volgushev
- 期刊/来源: Journal of the Royal Statistical Society Series B
- 分类: vol 84 · issue 5 · pp 2055-2087
- 相关性 4/10 · novelty:
new_method - 摘要: 本文研究极值树图模型的结构学习问题。在多元极值事件的稀疏图模型中,树结构编码了条件独立性,有助于可视化复杂的极值依赖结构。作者提出了一种完全非参数的方法:利用极值相关系数和一种新的汇总统计量——极值变差函数(extremal variogram)作为最小生成树的权重,从而一致地恢复真实的树结构。该方法无需假设离散分布、密度存在或二元分布的参数模型,仅依赖简单的汇总统计量即可完成学习。理论结果表明,样本版本的这些统计量能够保证树结构的一致性恢复。模拟和实证研究验证了该方法在有限样本下的有效性。本文对您作为统计理论研究者可能有用,因为它展示了非参数方法在极值依赖结构学习中的威力,与您对非参数统计和树结构学习的兴趣相关。
- 关键技术:
extremal graphical models,extremal correlation,extremal variogram,minimum spanning tree,nonparametric structure learning - 为什么对您有用: 本文属于极值统计与图模型的交叉领域,与您的非参数统计和树结构学习兴趣相关。您武器库中的非参数统计和最小生成树工具可直接用于理解其方法,但该文的核心是极值依赖而非因果推断或高维统计,因此属于次要兴趣。中期可做:若想深入,需先在极值统计的依赖度量(如极值相关系数)上补充知识。
Maintained by 陈星宇 · Homepage · Source on GitHub