AoS — Vol 54 Issue 3 · 2026-07-04¶
- 共 20 篇 · Annals of Statistics
- 目录核对 ✅ 20 篇全部抓到(对照 OpenAlex 22 篇)
本期导览¶
自动生成:归纳本期主要主题与脉络,不打分、不排名。
这一期共 20 篇论文,整体上可归纳为四条主线:统计-计算权衡与算法推断(张量补全、在线张量学习、递归划分估计、seriation、QMC 置信区间、Vecchia 过程)、高维统计与随机矩阵(低秩张量推断、梯度下降推断、稀疏 PCA、迭代算法早停、矩阵时间序列因子模型)、假设检验与自适应推断(自适应稳健置信区间、广义距离协方差独立性检验、置换混合近似、高维 m-相依 CLT、两点检验率可达性、厚尾 AR 模型)、以及半参数数据融合与非参数分类(数据融合统一理论、图像分类模型)。此外还有一篇贝叶斯非参数新先验(马尔可夫棍子断裂过程)。
在统计-计算权衡主线上,多篇论文聚焦于“计算上可行的算法能否达到信息论下界”。张量补全中的统计推断一文证明独立初始化下统计最优样本量即可保证渐近正态推断,而依赖初始化下计算最优条件仍无需数据分割;在线张量学习提出 oRGrad 算法并揭示计算收敛、统计误差与遗憾界的三元权衡;递归自适应划分估计则显示贪心训练在目标函数不满足 MSP 时需指数级样本,而 ERM 仅需对数级,明确刻画了贪心算法的权衡代价;seriation 问题给出了多项式时间算法与 minimax 最优率的匹配,是权衡的正面结果。这些工作共同推进了对“何时计算代价不牺牲统计效率”的理解。
高维统计与随机矩阵主线中,多篇论文利用随机矩阵理论或状态演化来刻画迭代算法的分布并构造推断。低秩张量推断一文在异方差次高斯噪声下建立 HOOI 的 entrywise 渐近正态性,并给出数据驱动的置信区间;梯度下降推断在均值场 regime 下建立非渐近状态演化,并基于 Onsager 校正矩阵提出去偏推断;稀疏 PCA 通过整数规划实现可扩展的全局最优估计,并给出支持恢复保证;迭代算法早停利用 Marchenko-Pastur 律构造泛化误差的一致估计,实现数据驱动早停与去偏推断;矩阵时间序列 CP 因子模型通过联合对角化避免特征间隙限制,获得更快收敛。这些工作共同展示了从算法轨迹中提取统计推断信息的系统方法。
假设检验主线中,自适应稳健置信区间一文揭示污染比例未知时最优区间必须指数级变宽,并通过对所有分位数同时量化实现自适应;广义距离协方差独立性检验通过高斯逼近建立统一分布理论,覆盖任意维度且仅需弱矩条件;置换混合近似提出新的 χ² 散度控制方法,给出比矩方法更紧的界,并导出 de Finetti 型定理和差分隐私保证;高维 m-相依 CLT 通过“对偶归纳”技术获得仅含 poly-log 维度的 sharp Berry-Esseen 界;两点检验率可达性分析则刻画了对称对数凹分布族下估计量可达的率,并给出不可达的反例。
与因果推断最直接相关的是半参数数据融合一文,它统一了多源个体级数据融合的渐近有效推断理论,覆盖两样本 IV、测量误差验证等常见因果场景,适合优先阅读。半参数效率方向可关注该文以及张量补全中达到 Cramér–Rao 下界的工作。高维统计方向可优先看梯度下降推断、稀疏 PCA、迭代算法早停和低秩张量推断。假设检验方向可优先看自适应稳健置信区间和广义距离协方差独立性检验。
因果推断 (causal_inference, 1 篇)¶
1. 10.1214/25-aos2609 · arXiv — Towards a unified theory for semiparametric data fusion with individual-level data¶
- 作者: Ellen Graham, Marco Carone, Andrea Rotnitzky
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 9/10 · novelty:
new_theory - 摘要: 本文研究从多个独立数据源(如不同流行病学队列或外部验证研究)融合个体级数据时,对有限维目标参数进行半参数推断的统一理论。现有理论要求各数据源对应的条件分布来自目标联合分布的单一因子分解,但这一框架无法涵盖两样本工具变量分析、不同设计类型的流行病学研究整合、以及存在测量误差并辅以外部验证数据等常见融合问题。作者推导了一个更普适的理论,允许各数据源对应的条件分布不来自单一因子分解,从而覆盖上述场景。核心贡献是给出了正则渐近线性估计量的影响函数以及目标参数的有效影响函数的通用刻画,不依赖于具体参数或目标分布的统计模型。这一理论为基于机器学习的去偏、半参数有效估计(如DML)在数据融合中的应用提供了统一基础。对您而言,该工作直接连接因果推断中的IV和测量误差设定,且其影响函数刻画方法可借助您熟悉的半参数理论工具(如EIF推导)深入理解,中期可做的是将HOIF推广到多源融合场景。
- 关键技术:
efficient influence function,semiparametric efficiency bound,data fusion,two-sample instrumental variable,regular and asymptotically linear estimator,debiased machine learning - 为什么对您有用: 直接连接primary interest中的因果推断(IV、测量误差)和半参数效率理论。您可以用very_familiar的semiparametric theory工具验证其EIF刻画在具体融合场景下的紧性,中期可做的是将HOIF(moderately_familiar)推广到多源融合设定以构造高阶去偏估计量。
高维统计 / 随机矩阵 (high_dim_rmt, 5 篇)¶
1. 10.1214/25-aos2589 · arXiv — Statistical inference for low-rank tensors: Heteroskedasticity, subgaussianity, and applications¶
- 作者: Joshua Agterberg, Anru R. Zhang
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 8/10 · novelty:
new_theory - 摘要: 本文研究高维低Tucker秩张量在异方差次高斯噪声下的统计推断与不确定性量化问题。目标是对HOOI算法输出的奇异向量和张量条目构建置信区域与区间。核心方法包括:建立HOOI的非渐近分布理论,证明在异方差次高斯噪声下估计量的渐近正态性,并给出最优置信区间(对同方差高斯噪声达到最优)。关键技术工具包括entrywise收敛分析、对角删除初始化、以及张量高阶结构的谱理论。主要理论结果包括:HOOI估计量的entrywise收敛速率、置信区间的覆盖性质、以及基于这些结果的两样本检验和同时推断程序。所有程序完全数据驱动,无需样本分割,且自适应于噪声分布和信号强度。对您而言,本文的张量推断框架与您的高阶U统计量(树宽/张量收缩)工作有直接技术交集,尤其是张量分解的entrywise理论可迁移至U统计量的计算复杂度分析。
- 关键技术:
higher-order orthogonal iteration (HOOI),entrywise convergence,heteroskedastic subgaussian noise,tucker rank,confidence regions for singular vectors,two-sample test for tensor blockmodel - 为什么对您有用: 本文直接连接您的高维统计与张量分解兴趣,特别是张量HOOI的entrywise分布理论——这是您moderately_familiar中HOIF和高阶U统计量理论可攻的具体口子:您可以用树宽/张量收缩的复杂度视角分析HOOI的算法成本,或用minimax bound验证其置信区间的最优性是否紧。中期可做:需先在HOIF上长肌肉(具体是张量entrywise influence function的推导),但核心工具(非参数统计、高维渐近)已在very_familiar中。
2. 10.1214/25-aos2600 · arXiv — Gradient descent inference in empirical risk minimization¶
- 作者: Qiyang Han, Xiaocong Xu
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究梯度下降(GD)算法在高维经验风险最小化(ERM)中的统计推断问题,设定在样本量与信号维度成比例的均值场(mean-field) regime 下。核心目标是刻画 GD 迭代的联合分布,并基于此构建有效的统计推断方法。方法上,作者建立了非渐近的状态演化(state evolution)理论,该理论适用于一般非凸损失函数和非高斯数据,揭示了两个 Onsager 校正矩阵在刻画 GD 迭代间复杂依赖关系中的核心作用。基于联合状态演化,他们提出了一种去偏梯度下降推断(debiased gradient descent inference)算法:通过可观测损失导数方向的线性组合对 GD 迭代进行去偏校正,校正系数直接由 Onsager 矩阵给出,且可完全数据驱动地估计。该推断框架具有三个关键性质:(i) 适用于凸和非凸损失;(ii) 无需算法收敛,每步迭代均有效;(iii) 对模型误设具有一定鲁棒性。理论在单指标回归和广义逻辑回归模型中验证,其中自然损失函数可能呈现任意非凸景观。作为副产品,该框架还提供了每步迭代的泛化误差估计。本文对您的主要兴趣——高维统计与随机矩阵理论——有直接关联,其状态演化与 Onsager 校正技术是 RMT 在高维算法分析中的典型应用,且去偏推断框架与您熟悉的因果推断中的去偏机器学习(DML)思路有深层联系。
- 关键技术:
state evolution,Onsager correction,mean-field regime,debiased gradient descent,nonconvex loss,high-dimensional asymptotics - 为什么对您有用: 本文直接连接您的主要兴趣:高维统计与随机矩阵理论(RMT)。其核心工具——状态演化与 Onsager 校正——是 RMT 在高维算法分析中的经典应用,与您熟悉的 Marchenko-Pastur 律等工具同源。从技术武器库看,您可以用 very_familiar 的 minimax bounds 和高维渐近理论来验证本文声称的推断精度是否最优,或用 moderately_familiar 的 semiparametric theory 视角比较其去偏方法与 DML 的异同。中期可做:需先在 moderately_familiar 的 HOIF 上长肌肉,因为本文的去偏构造本质上是高阶影响函数的算法版本,理解其与 HOIF 的精确对应关系可能产生新问题。
3. 10.1214/25-aos2551 · arXiv — Sparse PCA: A new scalable estimator based on integer programming¶
- 作者: Kayhan Behdin, Rahul Mazumder
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究稀疏主成分分析(SPCA)问题,在经典 spiked covariance 模型下提出一种新的可扩展估计量。与以往将 SPCA 直接建模为混合整数规划(MIP)的方法不同,作者利用 spiked covariance 模型和多元高斯分布的性质构造了一个新的 MIP 形式,从而在保持全局最优性的同时大幅提升计算可扩展性。理论上,作者建立了所提估计量在估计误差和支持恢复方面的统计保证,并考虑了模型偏离和近似解的情形。算法上,作者设计了定制化的 MIP 求解算法,相比通用求解器显著加速,数值实验表明该方法可在数分钟内处理多达 20,000 个特征的问题,且统计性能优于现有流行方法。本文对您在高维统计和统计计算方向有直接参考价值,特别是其将计算可扩展性与统计最优性结合的设计思路,以及定制化算法与理论保证的衔接方式。
- 关键技术:
mixed integer programming,spiked covariance model,support recovery,custom MIP solver,estimation error bounds - 为什么对您有用: 本文直接连接您的高维统计兴趣(spiked covariance 模型下的稀疏 PCA)和统计计算兴趣(定制化算法与理论保证的结合)。您的 technical_arsenal 中 'high-dimensional asymptotics' 和 'minimax bounds for estimation problems' 可用来验证本文的统计保证是否紧,而 'software development' 可帮助您复现或扩展其定制化 MIP 求解器。中期可做:若您想在 'semiparametric theory' 上长肌肉,可进一步分析本文方法在更一般的协方差结构下的半参数效率。
4. 10.1214/25-aos2606 · arXiv — Uncertainty quantification for iterative algorithms in linear models with application to early stopping¶
- 作者: Pierre C. Bellec, Kai Tan
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究高维线性回归中迭代算法(GD、proximal GD、FISTA等)的迭代轨迹不确定性量化问题,设定为特征维度p与样本量n可比(p≍n)的高斯设计。核心贡献是提出泛化误差的n-一致估计量,该估计量在固定迭代步t处可证明一致,并利用该估计量实现数据驱动的早停选择——当泛化误差关于迭代步呈U型时,自动选取最小泛化误差的迭代步t̂。进一步,基于任意有限步迭代的估计量b̂_t,开发了去偏校正和分量置信区间构造技术,为迭代算法提供统计推断工具。理论证明依赖随机矩阵理论(Marchenko-Pastur律)和线性模型的高斯设计假设,模拟实验验证了方法的有限样本表现。对您而言,该工作直接连接高维统计与随机矩阵理论(primary interest),其早停策略的n-一致估计量构造思路可迁移至您熟悉的U-统计量计算框架(treewidth/einsum)中迭代算法的计算-统计权衡分析。
- 关键技术:
random matrix theory,Marchenko-Pastur law,n-consistent estimator,early stopping,debiased correction,Gaussian design - 为什么对您有用: 直接连接高维统计与随机矩阵理论(primary interest),其早停策略的n-一致估计量构造思路可迁移至您熟悉的U-统计量计算框架(treewidth/einsum)中迭代算法的计算-统计权衡分析。中期可做:需先在moderately_familiar的HOIF(高阶影响函数)上长肌肉,以将本文的线性模型推断推广至半参数设定。
5. 10.1214/25-aos2608 · arXiv — Identification and estimation for matrix time-series CP-factor models¶
- 作者: Jinyuan Chang, Yue Du, Guanglin Huang, Qiwei Yao
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对矩阵时间序列的CP因子模型提出了一种新的识别与估计方法。与基于广义特征分析的方法(Chang et al., 2023)不同,后者因依赖矩阵扰动分析,其估计量的收敛速度受特征间隙(eigengap)影响,而新方法通过将问题转化为多个矩阵的联合对角化(joint diagonalization),并精心选择线性系统基以避免近似共线性,实现了不受特征间隙限制的更快收敛速度。该方法还能处理因子载荷矩阵秩亏的情况,而广义特征分析方法要求满秩。理论部分建立了估计量的收敛速率,并通过模拟和真实数据展示了优势。对您而言,本文涉及高维矩阵时间序列的因子模型估计,其联合对角化技巧和收敛速度分析可能对您在高维统计和随机矩阵理论方面的兴趣有启发,尤其当您关注因子模型或张量分解的统计推断时。
- 关键技术:
CP-factor model,joint diagonalization,matrix perturbation analysis,eigengap-free convergence,rank-deficient factor loading - 为什么对您有用: 本文直接关联您的高维统计与随机矩阵理论兴趣,特别是因子模型估计中的特征间隙问题。您武器库中的高维渐近理论(very_familiar)可直接用于理解其收敛速率证明,而联合对角化技巧可能为您的U-统计量或张量分解工作提供新视角。中期可做:若您想将此类方法推广到更高阶张量时间序列,需先在moderately_familiar的高阶U-统计量理论上加强。
非参数 / 半参数 (nonparam_semipara, 1 篇)¶
1. 10.1214/26-aos2618 · arXiv — A novel statistical approach to analyze image classification¶
- 作者: Juntong Chen, Sophie Langer, Johannes Schmidt-Hieber
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对图像分类任务中变异性并非来自加性噪声、而是来自同一物体形状与特征变化的问题,提出一个可处理的监督图像分类模型。从函数估计角度看,每个像素是一个变量,大图像会导致高维函数恢复并遭受维数诅咒;但在所提出的图像变形模型中,增加像素数反而提升分辨率,使分类问题更易解决。文章引入并理论分析了三种方法:两种方法将图像对齐与单近邻分类器结合,在分离条件下证明可实现完美分类;第三种方法拟合卷积神经网络(CNN)到数据,并推导出依赖于样本量和变形类复杂度的误分类误差率。实证研究支持了理论发现。该工作为高维非参数分类提供了新视角,对您在高维统计与半参数理论方面的兴趣有直接启发。
- 关键技术:
image deformation model,one-nearest neighbor classifier,image alignment,convolutional neural network,misclassification error rate - 为什么对您有用: 本文直接连接您在高维统计与非参数理论方面的兴趣,提出了一个规避维数诅咒的图像分类模型。您的技术武器库中的非参数统计与高维渐近理论可用于分析该模型的 minimax 分类误差界,属于中期可做——需先在 moderately_familiar 的 M-估计理论上长肌肉以处理变形类的复杂度。
数理统计 / 假设检验 (hypothesis_testing, 6 篇)¶
1. 10.1214/25-aos2574 · arXiv — Adaptive robust confidence intervals¶
- 作者: Yuetian Luo, Chao Gao
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 7/10 · novelty:
new_theory - 摘要: 本文研究 Huber 污染模型下当污染比例未知时自适应置信区间的构造问题。目标是对高斯均值构造稳健置信区间,且区间长度能自适应于未知的污染比例。理论结果表明,自适应区间的最优长度必须比非自适应区间指数级地宽,这一下界是本质性的。最优构造通过同时对所有分位数进行不确定性量化实现,即同时估计所有分位数的置信集。方法进一步推广到一般稳健假设检验族,超越了高斯位置模型。与自适应稳健估计不同,本文揭示自适应稳健置信区间的最优长度关键依赖于分布的形状,而非仅依赖于污染比例。对您而言,本文在稳健推断与自适应推断的交叉点上给出了精确的 minimax 刻画,与您在高维统计和假设检验方面的兴趣直接相关。
- 关键技术:
Huber contamination model,adaptive confidence intervals,simultaneous uncertainty quantification,minimax lower bound,robust hypothesis testing - 为什么对您有用: 本文直接连接您在高维统计和假设检验方面的兴趣,特别是稳健推断中自适应性的 minimax 刻画。您可以用 minimax 下界技术(very_familiar)验证其下界是否紧,或将其框架推广到高维均值向量。中期可做:将本文的分布形状依赖性结果与您的 higher-order U-statistics 工作结合,探索 U-statistic 的稳健自适应推断。
2. 10.1214/25-aos2613 — Test of independence using generalized distance correlation¶
- 作者: Jianqing Fan, Zhipeng Lou, Danna Zhang
- 期刊/来源: Annals of Statistics
- 机构: Princeton University · University of California San Diego
- 分类: vol 54 · issue 3
- 相关性 7/10 · novelty:
new_theory - 摘要: 研究问题为两个随机向量之间的独立性检验。现有基于距离协方差的检验理论要么限于低维要么限于高维,且需要严格的分布假设。本文提出了样本广义距离协方差(generalized distance covariance)的统一分布理论,适用于任意维度的随机向量,仅需较弱的矩条件。核心方法是通过高斯逼近(Gaussian approximation)建立非渐近误差界,并证明样本广义距离协方差的渐近零分布是独立同分布卡方随机变量的线性组合。为实际估计渐近零分布,提出了半置换(half-permutation)程序,并给出了理论证明,表明其与已知边际分布下的oracle程序渐近等价。该工作统一了低维与高维独立性检验的理论框架,对您在高维统计和假设检验方面的兴趣有直接参考价值。
- 关键技术:
generalized distance covariance,Gaussian approximation,half-permutation,chi-squared mixture distribution,nonasymptotic error bound - 为什么对您有用: 直接连接到您在高维统计和假设检验方面的主要兴趣。该文统一了低维与高维独立性检验的理论,其高斯逼近和非渐近误差界技术可迁移到您熟悉的minimax bound框架中进行分析。中期可做:需先在moderately_familiar的HOIF或U-statistics理论上长肌肉,以评估其半置换程序在更高阶统计量下的推广性。
3. 10.1214/26-aos2619 · arXiv — Approximate independence of permutation mixtures¶
- 作者: Yanjun Han, Jonathan Niles-Weed
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究高维可交换混合分布(permutation mixtures)与其独立同分布对应分布之间的统计距离。作者提出一种新的χ2散度控制方法,比现有的矩或累积量方法更紧。技术核心包括:针对求和为零的变量的初等对称多项式的新Maclaurin型不等式,以及双随机半正定矩阵的积和式上界。作为推论,得到一个新的de Finetti型定理、高斯噪声下“混洗隐私模型”的差分隐私保证,以及复合决策问题中经验贝叶斯程序的一致性保证。对您而言,该工作的高维统计距离控制技术可能对您在高维假设检验或随机矩阵理论中的研究有直接启发。
- 关键技术:
χ2 divergence,Maclaurin-type inequality,elementary symmetric polynomials,permanent bounds,de Finetti theorem,differential privacy - 为什么对您有用: 该论文直接关联您在高维统计和假设检验方面的兴趣,其核心工具(Maclaurin型不等式、积和式上界)属于您非常熟悉的非参数统计和高维渐近工具。立即可做的方向:将χ2散度控制方法应用于高维独立性检验或随机矩阵谱分布的比较。
4. 10.1214/25-aos2616 · arXiv — Dual induction CLT for high-dimensional m-dependent data¶
- 作者: Heejong Bong, Arun Kumar Kuchibhotla, Alessandro Rinaldo
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 6/10 · novelty:
new_method - 摘要: 研究高维 m-相依随机向量之和的 Berry-Esseen 界,目标是在超矩形类上获得仅含维度 poly-log 依赖的 sharp 界。假设条件极弱:非退化协方差和有限三阶矩,样本复杂度达到最优阶 m^{(q-1)/(q-2)}/n。方法核心是提出一种新的“对偶归纳”技术,将反集中不等式与 Berry-Esseen 界通过 Lindeberg 交换方法联系起来,并利用相依数据的浓度不等式。所得速率(除对数项外)与单变量情形的最优速率匹配,在独立同分布特例下也给出目前最弱条件下的最优界。该归纳关系本身可能具有独立的方法学价值。对您而言,该工作直接关联高维统计与假设检验,其反集中- Berry-Esseen 归纳框架可尝试用您熟悉的 U-统计量投影技术推广到高阶统计量。
- 关键技术:
Berry-Esseen bound,m-dependent data,anticoncentration inequality,Lindeberg swapping,high-dimensional CLT,hyperrectangles - 为什么对您有用: 直接命中 primary interest 中的高维统计与假设检验:该文在高维 m-相依设定下给出近乎最优的 Berry-Esseen 界,其反集中-归纳框架可尝试用您非常熟悉的 U-统计量投影技术推广到高阶统计量(如 U-统计量的 CLT 加速)。中期可做:需先在 moderately_familiar 的 HOIF 理论上长肌肉,以处理高阶统计量的依赖结构。
5. 10.1214/25-aos2614 · arXiv — Attainability of two-point testing rates for finite-sample location estimation¶
- 作者: Spencer Compton, Gregory Valiant
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究单变量均值估计中Le Cam两点检验下界的可达性。设定分为两类:位置估计(分布已知至平移)和自适应位置估计(分布未知)。核心问题是:在什么条件下,存在估计量其误差至多比Hellinger模量多对数因子?主要结果:对具有共同均值的对称对数凹分布的混合族,设计了一个近线性时间、无调参的算法,几乎达到两点检验率。反例表明,即使对对称单峰分布,该率也不可达。对位置估计,证明单峰分布下率可达,对称分布下不可达。技术工具包括Hellinger距离、模量连续性、自适应算法设计。对您有用:本文连接了假设检验(两点法下界)与非参数估计(自适应率),其可达性分析可直接迁移到您熟悉的高维渐近和极小极大界框架。
- 关键技术:
Le Cam's two-point testing method,Hellinger modulus of continuity,adaptive estimation,near-linear time algorithm,symmetric log-concave mixtures - 为什么对您有用: 直接连接primary interest中的hypothesis testing(两点法下界)和非参数统计(自适应率可达性)。武器库中very_familiar的minimax bounds for estimation problems和high-dimensional asymptotics可直接用于分析其率是否紧;moderately_familiar的M-estimation theory可用于理解自适应算法的构造。中期可做:需先巩固moderately_familiar的identification theory in causal inference以将类似自适应思路迁移到因果推断设定。
6. 10.1214/25-aos2610 — A two-step estimating approach for heavy-tailed AR models with nonzero median GARCH-type noises¶
- 作者: Rui She, Linlin Dai, Shiqing Ling
- 期刊/来源: Annals of Statistics
- 机构: Southwestern University of Finance and Economics · Hong Kong University of Science and Technology
- 分类: vol 54 · issue 3
- 相关性 4/10 · novelty:
new_method - 摘要: 本文针对厚尾自回归(AR)模型,其中噪声服从非零中位数 GARCH 型过程且允许时变波动,提出了一种新颖的两步估计程序。第一步,在所有分位数水平 τ∈(0,1) 上建立自加权分位数回归估计量(SQE)用于 AR 参数 θ0,证明 SQE 减去偏差后以 n^{-1/2} 速率弱收敛到高斯过程;该偏差仅在 τ 等于噪声小于零的概率 τ0 时为零。第二步,基于 SQE 估计 τ0,再将估计的 τ0 代回 SQE 以估计 θ0,两者均具有相合性和渐近正态性。为逼近复杂分布,发展了随机加权自助法。该问题的非标准性在于 τ0 在常规分位数回归中可能不可识别,且现有方法无法验证 SQE 偏差的存在。与现有厚尾时间序列方法不同,本文无需噪声的对称性、尾指数或参数形式的先验信息,也无需零均值或零中位数等经典识别条件。对您而言,该文在假设检验(分位数回归推断)和数学统计(厚尾设定下的渐近理论)方面有直接关联,其两步估计思路可启发您在高维或因果推断中处理类似非标准识别问题。
- 关键技术:
self-weighted quantile regression,Gaussian process weak convergence,random weighting bootstrap,two-step estimation,heavy-tailed time series - 为什么对您有用: 本文直接关联您的 primary interest 中的 hypothesis testing 和 mathematical statistics,特别是分位数回归在厚尾时间序列中的推断问题。您的 technical arsenal 中 very_familiar 的 nonparametric statistics 和 high-dimensional asymptotics 可用于分析其 SQE 的渐近性质,而 moderately_familiar 的 M-estimation theory 可帮助理解其两步估计的识别条件。中期可做:若想将类似方法推广到高维或因果推断中的分位数处理效应估计,需先在 moderately_familiar 的 semiparametric theory 上加强。
统计计算 / 算法 (stat_computing, 6 篇)¶
1. 10.1214/25-aos2617 · arXiv — Statistical inference in tensor completion: Optimal uncertainty quantification and statistical-to-computational gaps¶
- 作者: Wanteng Ma, Dong Xia
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 9/10 · novelty:
new_method - 摘要: 本文研究张量补全中的统计推断问题,目标是在不完整且有噪声的观测下对张量线性形式进行最优不确定性量化。在 Tucker 低秩张量模型和随机缺失假设下,作者利用初始估计、去偏技术以及一步幂迭代构造渐近正态的检验统计量。该方法适用于构建置信区间、异方差和次指数噪声下的推断以及同时检验。理论结果表明该估计量达到了 Riemannian 流形上的 Cramér–Rao 下界,证明了其在不确定性量化上的最优性。文章系统考察了统计-计算之间的间隙,发现独立初始化下统计最优的样本量和信噪比即可保证准确推断;而依赖初始化下,计算最优的条件仍能保证渐近正态性且无需数据分割。数值模拟与理论结果一致。对您而言,本文直接连接您对统计-计算权衡的兴趣,且张量补全的推断问题与您熟悉的 higher-order U-statistics 的 tensor contraction 视角有潜在交叉。
- 关键技术:
debiasing,one-step power iteration,Tucker low-rank model,Cramér–Rao lower bound on Riemannian manifolds,statistical-to-computational gap,phase transition - 为什么对您有用: 本文直接连接您 primary interest 中的 statistical-computational tradeoff,清晰刻画了张量补全中统计最优与计算最优条件之间的相变,且对初始化策略的影响做了细致分析。您武器库中 very_familiar 的 tensor contraction / treewidth 视角可用于分析其一步幂迭代的计算成本,而 moderately_familiar 的 HOIF 理论可能为去偏步骤提供替代视角。中期可做:需先在 moderately_familiar 的 semiparametric theory 上进一步熟悉去偏估计的 influence function 框架,才能将本文的去偏思路推广到更一般的张量模型。
2. 10.1214/25-aos2588 · arXiv — Online tensor learning: Computational and statistical trade-offs, adaptivity and optimal regret¶
- 作者: Jingyang Li, Jian-Feng Cai, Yang Chen, Dong Xia
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 9/10 · novelty:
new_method - 摘要: 本文研究在线张量学习中的计算-统计权衡问题,提出统一的在线黎曼梯度下降(oRGrad)算法,适用于线性模型和广义线性模型。算法核心是每步仅处理一个样本,无需存储全部数据,显著降低内存和计算开销。在已知时间水平 T 时,通过固定步长达到统计最优性;在未知 T 时,自适应版本(adaptive-oRGrad)通过自适应步长选择实现 O(log T) 的最优遗憾界。理论分析揭示了计算收敛速度、统计误差和遗憾界之间的三元权衡(trilemma)。在噪声张量补全问题上,在线方法避免了离线方法中技术困难的修剪步骤,直接得到尖锐的逐元素统计误差。数值实验表明,在预测太阳 F10.7 指数的空间天气应用中,oRGrad 显著优于离线方法。该工作对您的高阶 U-统计量计算(树宽/张量收缩/einsum 复杂度)方向有直接参考价值,因为张量学习算法的计算成本与张量收缩路径优化密切相关。
- 关键技术:
online Riemannian gradient descent,regret analysis,tensor completion,computational-statistical tradeoff,adaptive step size - 为什么对您有用: 本文直接连接您的统计计算方向,特别是张量学习算法的计算-统计权衡。您武器库中'高阶 U-统计量的树宽/张量收缩/einsum 计算'可以用于分析 oRGrad 每步张量梯度计算的收缩成本,从而评估其计算效率是否最优。中期可做:需先在 moderately_familiar 的'高阶 U-统计量理论'上长肌肉,以形式化刻画在线张量学习中的计算-统计权衡边界。
3. 10.1214/25-aos2603 · arXiv — Statistical-computational trade-offs for recursive adaptive partitioning estimators¶
- 作者: Yan Shuo Tan, Jason M. Klusowski, Krishnakumar Balasubramanian
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 8/10 · novelty:
new_theory - 摘要: 本文研究递归自适应划分估计器(如决策树及其集成)在高维稀疏回归中的统计-计算权衡。设定为d个二元特征上的稀疏回归函数学习,目标函数f满足或不满足Abbe等人提出的Merged Staircase Property (MSP)——一种类似经典ANOVA建模中的遗传性约束。核心发现是:当f不满足MSP时,贪心训练需要exp(Ω(d))个样本才能达到低估计误差;而当f*满足MSP时,仅需O(log d)个样本。相比之下,经验风险最小化(ERM)训练无论MSP是否成立,都只需O(log d)个样本,从而明确展示了贪心训练的统计-计算权衡。证明方法创新性地将贪心递归划分解释为随机过程,并引入耦合技术。这一结果与两层神经网络在平均场机制下SGD训练的二分法形成直接对比。对您而言,本文是统计-计算权衡领域的优秀入门读物,清晰阐述了计算约束(贪心vs. ERM)如何影响样本复杂度,且其证明中使用的随机过程耦合技术可能与您熟悉的逆问题分析有技术共鸣。
- 关键技术:
Merged Staircase Property (MSP),greedy recursive partitioning,empirical risk minimization (ERM),stochastic process coupling,statistical-computational trade-off,sample complexity dichotomy - 为什么对您有用: 本文直接命中您primary interest中的'statistical-computational tradeoff'方向,且作为gateway reading非常合格:(a) 引言清晰定义了统计模型(稀疏回归)、计算模型(贪心算法vs. ERM)和MSP条件,不要求读者熟悉低度/SoS文献;(b) 阈值(样本复杂度O(log d) vs. exp(Ω(d)))精确陈述,证明策略用随机过程耦合给出,统计背景读者可跟进;(c) 问题本身值得关注——将决策树贪心训练与神经网络SGD训练做head-to-head比较,是实质性进展。武器库方面:您对minimax bounds和high-dimensional asymptotics非常熟悉,可直接理解其样本复杂度下界论证;但核心的MSP条件和随机过程耦合工具不在您的武器库中,属于'暂不可做'——需要先学习MSP的代数结构及其与ANOVA模型的联系。不过作为入门读物,值得花时间读全文。
4. 10.1214/25-aos2615 · arXiv — Minimax optimal seriation in polynomial time¶
- 作者: Yann Issartel, Christophe Giraud, Nicolas Verzelen
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 8/10 · novelty:
new_method - 摘要: 本文研究 seriation 问题,目标是从带噪观测的置换 Robinson 矩阵中恢复隐藏排序。在平均 Lipschitz 条件下建立了尖锐的 minimax 最优率,该条件严格推广了先前工作的双 Lipschitz 框架。设计了一个多项式时间算法,达到了这些最优率,解决了 Giraud, Issartel 和 Verzelen (2023) 提出的两个开放问题。分析还扩展到精确置换生成矩阵之外的更广泛矩阵类别。核心贡献在于证明了计算上可实现的算法与信息论下界之间的匹配,即统计-计算权衡的正面结果。对您而言,该工作直接关联到统计-计算权衡这一主要兴趣,且其多项式时间可达性的证明策略可作为理解该领域“可能性”结果的入门范例。
- 关键技术:
minimax optimal rates,polynomial-time algorithm,average-Lipschitz condition,Robinson matrix,seriation problem,statistical-computational tradeoff - 为什么对您有用: 本文直接命中您的主要兴趣——统计-计算权衡,且属于 gateway reading 范畴:(a) 引言清晰阐述了统计模型(Robinson 矩阵+噪声)和计算模型(多项式时间算法),不假设读者熟悉低度/SoS 文献;(b) 精确陈述了信号强度与样本量的阈值,并显式给出了统计下界与算法可达率之间的匹配;(c) 问题本身值得关注——解决了开放问题,且扩展了矩阵类别。武器库中 minimax bounds 和 high-dimensional asymptotics 可直接用于验证其下界紧性;中期可做:需在 moderately_familiar 的 HOIF 上长肌肉以处理更复杂的依赖结构。
5. 10.1214/26-aos2631 · arXiv — Quasi-Monte Carlo confidence intervals using quantiles of randomized nets¶
- 作者: Zexin Pan
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 4/10 · novelty:
new_method - 摘要: 本文研究准蒙特卡洛(QMC)积分中基于随机化网络估计量分位数的置信区间构造问题。设定为高维光滑被积函数(无穷可微类),使用线性扰动的数字网络估计量。核心机制是:对多个独立复制取中位数可大幅提升收敛速度,本文进一步证明取分位数可构造渐近有效的置信区间。技术工具包括误差分布分解——渐近对称主项加可忽略余项,以及二项分布驱动的名义覆盖概率。主要理论结果是:当样本量增大时,积分误差分布关于零对称,因此基于独立复制分位数的区间能以趋于名义水平的概率覆盖真值。对您有用:这是统计计算中数值积分与推断的交叉,与您武器库中的“软件开发和数值方法”直接相关,可作为 gateway reading 了解 QMC 推断的最新进展。
- 关键技术:
randomized quasi-Monte Carlo,linearly scrambled digital nets,quantile-based confidence intervals,error distribution decomposition,binomial distribution calibration - 为什么对您有用: 本文属于统计计算(数值积分与推断)方向,是您 secondary interest 中“statistical computing”的 gateway reading。武器库中“software development”和“nonparametric statistics”的 minimax 视角可用于评估其收敛率声称的紧致性。暂不可做:核心机器(随机化 QMC 的误差分布分析)不在武器库中,需先熟悉 scrambled net 理论。
6. 10.1214/25-aos2604 · arXiv — Vecchia Gaussian processes: On probabilistic and statistical properties¶
- 作者: Botond Szabo, Yichen Zhu
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 4/10 · novelty:
new_theory - 摘要: 本文系统研究了 Vecchia 近似作为独立随机过程的概率与统计性质,聚焦于各向同性 Matérn 高斯过程。核心贡献在于:提出将父节点集选为固定基数的 norming set,并证明 Vecchia 近似下的条件分布可通过多项式插值刻画。基于此,推导了 Vecchia 过程的小球概率和 RKHS 性质。在非参数回归模型中,证明了后验收缩率在最优 minimax 率下达到 oracle 重缩放和分层调参的一致性。数值实验验证了理论结果。对您而言,该工作为大规模 GP 近似提供了严格的理论基础,其 RKHS 和收缩率分析可直接迁移至您熟悉的非参数统计和 minimax 界工具。
- 关键技术:
Vecchia approximation,Matérn Gaussian process,polynomial interpolation,small ball probability,RKHS,posterior contraction rate - 为什么对您有用: 本文属于统计计算方向,与您 primary interest 中的 statistical computing 高度相关。它解决了 Vecchia 近似缺乏理论基础的痛点,其 RKHS 和 minimax 收缩率分析可直接用您 very_familiar 的非参数统计和 minimax 界工具来理解和验证。中期可做:若您想将类似稀疏近似思路推广到更高阶结构(如张量过程),需先在 moderately_familiar 的 HOIF 或高阶 U-stat 理论上长肌肉。
其他 (other, 1 篇)¶
1. 10.1214/25-aos2607 · arXiv — Markov stick-breaking processes¶
- 作者: María F. Gil-Leyva, Antonio Lijoi, Ramsés H. Mena, Igor Prünster
- 期刊/来源: Annals of Statistics
- 分类: vol 54 · issue 3
- 相关性 3/10 · novelty:
new_method - 摘要: 本文提出了一类全新的贝叶斯非参数先验——马尔可夫棍子断裂过程(Markov stick-breaking processes),将传统棍子断裂构造中独立同分布或独立的断裂长度变量替换为马尔可夫链。研究建立了该过程作为物种抽样过程(species sampling process)的适定性条件,并证明了其分布具有全拓扑支撑,这两点是贝叶斯非参数模型的基本要求。进一步分析了权重的随机序性质,并在温和条件下给出了Pitman–Yor过程的一个新刻画:它是唯一在大小偏序排列下保持不变的棍子断裂过程。文中还识别了两个具有良好性质的可处理子类,将Dirichlet过程、Pitman–Yor过程和几何先验作为特例包含在内。最后提供了后验推断算法所需的关键分布结果。本文属于贝叶斯非参数理论的方法论创新,与您的主要研究方向(因果推断、高维统计、U-统计量等)无直接交集。
- 关键技术:
stick-breaking construction,Markov chain,species sampling process,full topological support,size-biased permutation,Pitman–Yor process - 为什么对您有用: 本文属于贝叶斯非参数理论,与您的主要兴趣方向(因果推断、高维统计、U-统计量、半参效率理论等)无直接交集。您的技术武器库中缺乏贝叶斯非参数的核心工具(如Pólya urn scheme、species sampling model),因此暂不可做。如果您未来有意拓展贝叶斯方法在因果推断中的应用(如非参数贝叶斯工具变量),本文可作为入门阅读,但当前优先级不高。
Maintained by 陈星宇 · Homepage · Source on GitHub