跳转至

AoS — Vol 52 Issue 1 · 2026-07-04

  • 共 15 篇 · Annals of Statistics
  • 目录核对 ✅ 15 篇全部抓到(对照 OpenAlex 17 篇)

本期导览

自动生成:归纳本期主要主题与脉络,不打分、不排名

这一期《AoS》第52卷第1期的15篇论文,整体上围绕三条主线展开:高维与复杂结构下的推断与控制(包括独立性检验、变量选择、新颖性检测)、非参数与半参数方法的效率与自适应(凸函数估计、变分贝叶斯、迁移学习)、以及计算与统计的权衡及模型识别(张量PCA、离线强化学习、因果图模型)。此外,还有若干篇涉及时间序列因子模型、冷冻电镜中的群估计等特定应用场景的方法论工作。

高维推断与多重比较这条主线上,本期有多篇论文聚焦于控制错误发现率(FDR)或检验功效。例如,“Adaptive novelty detection with false discovery rate guarantee”将新颖性检测转化为多重检验问题,利用conformal inference构造p值,在可交换性假设下实现有限样本FDR控制。“StarTrek: Combinatorial variable selection with false discovery rate control”则针对高维图模型中的枢纽节点选择,通过高斯乘子自助法和Cramér型比较界来精确控制FDR。在独立性检验方面,“Testing for independence in high dimensions based on empirical copulas”将copula检验推广至高维,利用鞅中心极限定理处理p与n同阶增长的情形;“Rank-based indices for testing independence between two high-dimensional vectors”则基于秩统计量,给出了分布自由的检验方法,并与距离协方差检验进行了相对效率比较。这些工作共同展示了在高维场景下,从检验统计量的构造到FDR控制的多种技术路径。

另一条突出主线是非参数与半参数方法中的自适应性与最优性。“Estimation and inference for minimizer and minimum of convex functions”在非参数回归中建立了局部极小极大框架,揭示了同时估计最小值点与最小值的不确定性原理,并给出了自适应算法。“Adaptive variational Bayes”则提出一种在模型集合上自适应组合变分后验的框架,证明了其达到最优收缩率,并应用于稀疏模型和深度学习。“Transfer learning for contextual multi-armed bandits”在非参数上下文老虎机中建立了迁移学习的极小化收敛速率,并开发了自适应于未知光滑性的算法。这些工作都强调了在未知或复杂模型结构下,如何实现自适应且高效的推断。

此外,因果推断与模型识别方面,“Characterization of causal ancestral graphs for time series with latent confounders”为含未观测混杂的时间序列提出了一类新的因果图模型,并完整刻画了其马尔可夫等价类,为后续识别算法提供了更紧的框架。计算与统计权衡方面,“Statistical-computational trade-offs in tensor PCA and related problems via communication complexity”利用通信复杂度推导了内存受限算法的计算下界,解释了为何某些算法在样本量不足时需要更多迭代。离线强化学习方面,“Settling the sample complexity of model-based offline reinforcement learning”给出了表格型MDP下基于模型的悲观值迭代算法的minimax最优样本复杂度。

对于因果推断方向的研究者,可优先关注“Characterization of causal ancestral graphs for time series with latent confounders”;对于半参数效率与自适应方向,可看“Estimation and inference for minimizer and minimum of convex functions”和“Adaptive variational Bayes”;对于高维推断与多重比较,可看“Testing for independence in high dimensions based on empirical copulas”、“Rank-based indices for testing independence between two high-dimensional vectors”、“StarTrek”和“Adaptive novelty detection”。

因果推断 (causal_inference, 1 篇)

1. 10.1214/23-aos2325 · arXiv — Characterization of causal ancestral graphs for time series with latent confounders

  • 作者: Andreas Gerhardus
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 7/10 · novelty: new_theory
  • 摘要: 本文针对含未观测混杂因子的多元时间序列,提出了一类新的因果图模型——时间滞后因果祖先图(time-lag specific causal ancestral graphs)。作者完整刻画了这类图的性质,证明它们严格包含于现有常用模型类(如时间序列DAG或部分祖先图)中。因此,在不增加额外假设的前提下,新图能支持更强的因果推断(例如更精细的滞后结构识别)。进一步,作者给出了新图马尔可夫等价类的图形表示,该表示比当前最先进的因果发现算法所能学习的因果知识更丰富。理论贡献在于对时间序列因果图模型类的精确刻画,为后续识别和估计算法提供了更紧的模型框架。对您而言,本文直接关联到纵向因果推断中的identification问题,其图模型刻画方法可与您熟悉的非参数统计和因果推断估计理论结合,用于设计基于新图类的半参数估计器。
  • 关键技术: causal ancestral graphs, time series graphical models, Markov equivalence class, latent confounders, causal discovery
  • 为什么对您有用: 本文直接切入您primary interest中的纵向因果推断(longitudinal causal inference)和identification理论,提出了比现有模型类更紧的图表示,能提升因果推断的精度。您武器库中'非参数统计'和'因果推断估计理论'可直接用于设计基于新图类的半参数估计器(如DR估计或TMLE),属于立即可做的方向。

高维统计 / 随机矩阵 (high_dim_rmt, 2 篇)

1. 10.1214/23-aos2346 — Rates of estimation for high-dimensional multireference alignment

  • 作者: Zehao Dou, Zhou Fan, Harrison H. Zhou
  • 期刊/来源: Annals of Statistics
  • 机构: Yale University
  • 分类: vol 52 · issue 1
  • 相关性 7/10 · novelty: new_theory
  • 摘要: 本文研究连续多参考对齐(multireference alignment)模型,目标是从含噪声且经过圆周旋转的观测中估计圆周上的周期函数。该模型受冷冻电镜(cryo-EM)中类似高维问题的启发。在高噪声区(噪声方差 σ² ≳ K),对于傅里叶系数幅度大致均匀的信号,最小化最优率(minimax rate)为 σ⁶,且与维度 K 无关;该率通过双谱反演(bispectrum inversion)程序实现,论文给出了双谱反演的新稳定性界。在低噪声区(σ² ≲ K / log K),率变为 Kσ²,通过对边际化潜在旋转的最大似然估计(MLE)的尖锐分析建立。利用 Assouad 超立方体引理得到了在这两个区域之间插值的互补下界。分析还推广到傅里叶系数具有缓慢幂律衰减的信号。该结果对您可能有用:它直接连接高维统计与随机矩阵理论(RMT)中的 minimax 率问题,且双谱反演技术与高阶 U-统计量的张量收缩结构有潜在联系。
  • 关键技术: minimax rate, bispectrum inversion, Assouad's hypercube lemma, maximum likelihood estimation, multireference alignment, cryo-EM
  • 为什么对您有用: 本文直接连接高维统计与 minimax 率理论(primary interest),且双谱反演涉及三阶矩的代数结构,与 higher-order U-statistics 的张量收缩视角有潜在交叉。技术武器库中 minimax bounds 和 high-dimensional asymptotics 可直接用于理解其率界,而 moderately_familiar 的 HOIF 理论可能用于推导更高效的估计量。中期可做:需先熟悉双谱反演的具体代数操作(moderately_familiar 的 higher-order U-statistics 理论可辅助)。

2. 10.1214/23-aos2350 · arXiv — Rank and factor loadings estimation in time series tensor factor model by pre-averaging

  • 作者: Weilin Chen, Clifford Lam
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文研究时间序列张量因子模型的秩与因子载荷估计问题。在金融经济应用中,张量时间序列的异质成分往往存在序列相关和截面相关,这使现有假设白噪声或独立高斯噪声的方法失效。作者提出一种预平均(pre-averaging)方法,通过累积张量纤维(tensor fibre)的信息来更稳健地估计因子载荷空间,仅要求四阶矩有界。该方法先估计最强因子对应的方向,再用投影数据进行重估计,并给出了理论收敛速率。秩估计方面,借鉴Fan, Guo and Zheng (2022)的思路,利用投影数据的相关结构进行估计。模拟表明该方法在序列相关下优于传统HOOI等替代方案,并分析了矩阵型投资组合收益数据。对您而言,该工作涉及高维时间序列的因子模型与张量分解,与您的高维统计和统计计算兴趣直接相关,其预平均技巧和秩估计思路可迁移至您熟悉的因果推断中纵向数据或IV的因子结构处理。
  • 关键技术: pre-averaging, tensor factor model, higher order orthogonal iteration (HOOI), rank estimation, serial correlation, bounded fourth moments
  • 为什么对您有用: 本文直接连接您的高维统计兴趣(张量因子模型在序列相关下的估计),且其预平均技巧和秩估计方法可迁移至您非常熟悉的非参数统计与高维渐近工具。中期可做:若您想将类似方法用于因果推断中的纵向数据因子结构,需先在 moderately_familiar 的识别理论(identification theory in causal inference)上长肌肉,以理解因子载荷与因果参数的连接。

非参数 / 半参数 (nonparam_semipara, 1 篇)

1. 10.1214/24-aos2355 · arXiv — Estimation and inference for minimizer and minimum of convex functions: Optimality, adaptivity and uncertainty principles

  • 作者: T. Tony Cai, Ran Chen, Yuancheng Zhu
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 8/10 · novelty: new_theory
  • 摘要: 本文在非参数回归和白噪声模型下,研究凸回归函数的最小值点与最小值的估计与推断问题。采用非渐近局部极小极大框架,在单个函数上评估程序性能,提出了完全自适应且计算高效的算法,并给出了估计精度和置信区间期望长度的尖锐极小极大下界。该局部框架揭示了同时估计与推断最小值点与最小值的新现象,并建立了一个新颖的不确定性原理,表明对于任意凸回归函数,同时估计最小值点与最小值存在根本性的精度限制。类似的不确定性原理也适用于最小值点与最小值的置信区间期望长度。本文的理论结果对非参数统计中的自适应估计和推断具有重要参考价值。
  • 关键技术: local minimax framework, convex regression, adaptive estimation, uncertainty principle, nonasymptotic bounds, confidence intervals
  • 为什么对您有用: 本文直接关联非参数统计与极小极大理论(primary interest),其局部极小极大框架和不确定性原理为同时估计与推断多个目标提供了新视角。研究者可用其非常熟悉的非参数统计和极小极大界工具(very_familiar)深入理解该框架,并探索将其推广至因果推断中同时估计处理效应与最优处理策略等问题的可能性——立即可做。

数理统计 / 假设检验 (hypothesis_testing, 6 篇)

1. 10.1214/23-aos2348 · arXiv — Testing for independence in high dimensions based on empirical copulas

  • 作者: Axel Bücher, Cambyse Pakzad
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文研究高维情形下(变量数 p 可与样本量 n 同阶甚至更大)的独立性检验问题,目标不仅是检测两两独立性,还能检测更高阶的依赖结构。方法核心是将问题与 copula 连接,利用经验 copula 过程的 Möbius 变换构造检验统计量,该变换在固定维数下已有成功应用。基于鞅中心极限定理,作者证明了检验统计量在 p 与 n 同阶增长时渐近服从标准正态分布,从而可直接定义临界值。模拟研究验证了有限样本下的表现。对您而言,该工作将经典 copula 检验推广至高维,其鞅 CLT 技术路径与您熟悉的高维渐近理论直接对接,且检验高阶依赖的思路可能为您的 U-统计量工作提供新的假设检验框架。
  • 关键技术: empirical copula process, Möbius transformation, martingale central limit theorem, high-dimensional hypothesis testing, pairwise vs higher-order dependence
  • 为什么对您有用: 本文直接连接您 primary interest 中的 hypothesis testing 和 high-dimensional statistics。技术核心——鞅 CLT 与经验 copula 过程的 Möbius 变换——属于您 very_familiar 的高维渐近工具,可立即可做:您可以用 minimax bound 视角检验其检验功效是否最优,或用 U-统计量的树宽分析评估其计算成本。中期可做:若想将检验推广至更一般的依赖结构(如条件独立性),需先在 moderately_familiar 的 semiparametric theory 上长肌肉。

2. 10.1214/23-aos2339 — Rank-based indices for testing independence between two high-dimensional vectors

  • 作者: Yeqing Zhou, Kai Xu, Liping Zhu, Runze Li
  • 期刊/来源: Annals of Statistics
  • 机构: Tongji University · Intel (United States) · Anhui Normal University · Zhejiang Gongshang University · Renmin University of China · Pennsylvania State University
  • 分类: vol 52 · issue 1
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文针对两个高维随机向量之间的独立性检验问题,提出了三种基于秩的检验统计量,分别源自Hoeffding's D、Blum-Kiefer-Rosenblatt's R和Bergsma-Dassios-Yanagimoto's τ。在零假设下,作者证明了当维度随样本量任意发散时,检验统计量的分布收敛到正态分布,并给出了显式的收敛速率。由于秩统计量的单调变换不变性,这些分布自由的检验方法可直接用于重尾等一般分布。进一步,本文研究了局部功效,并与经典的基于距离协方差/相关的检验进行了高维下的相对效率比较。通过建立D、R、τ与二元正态Pearson相关系数的显式关系,理论结果表明:在Gaussian equicorrelation备择下,当分量尺度差异大时,所提检验优于距离协方差检验;且基于D、τ*、R的检验渐近效率依次递减。该工作对您在高维假设检验和U-statistic理论方面的兴趣有直接参考价值,尤其是秩统计量的高阶渐近分析。
  • 关键技术: rank-based independence tests, Hoeffding's D, Blum-Kiefer-Rosenblatt's R, Bergsma-Dassios-Yanagimoto's τ*, high-dimensional central limit theorem, local power analysis
  • 为什么对您有用: 直接连接到您对高维统计和假设检验的兴趣,特别是秩统计量在高维独立性检验中的渐近理论。您武器库中的高维渐近工具(如CLT、收敛速率)可直接用于理解本文的证明框架,而您对higher-order U-statistics的熟悉程度(尤其是treewidth/einsum视角)可用于分析D、R、τ*作为U-statistic的计算复杂度或高阶性质。中期可做:若想将本文的秩方法推广到更一般的相依结构或因果推断中的条件独立性检验,需先在moderately_familiar的HOIF或semiparametric theory上提升。

3. 10.1214/22-aos2227 · arXiv — The right complexity measure in locally private estimation: It is not the Fisher information

  • 作者: John C. Duchi, Feng Ruan
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 7/10 · novelty: new_theory
  • 摘要: 本文研究局部隐私模型下统计估计的实例特定(instance-specific)最优性,目标是在不依赖最坏情况 minimax 准则的前提下刻画每个具体问题的估计难度。核心贡献是提出局部模量(local modulus of continuity)以变分距离(variation distance)而非经典统计中的 Hellinger 距离来度量,并证明该量在局部差分隐私及其松弛定义下决定了收敛速率。方法上,作者发展了局部 minimax 风险框架,将隐私约束转化为对估计量分布的距离限制,从而导出信息论下界。与基于 Fisher 信息的经典效率理论不同,本文揭示了隐私估计中 Fisher 信息并非合适的复杂度度量,而变分距离模量才是关键。理论结果包括对适应性和最优性的精细刻画,表明在隐私约束下经典统计效率概念需要重新审视。对您而言,本文连接了高维统计中的 minimax 下界技术与隐私估计这一新兴方向,且其变分距离模量工具可能与您熟悉的非参 minimax 界技术有交叉,值得关注。
  • 关键技术: local modulus of continuity, variation distance, local minimax risk, differential privacy, instance-specific bounds
  • 为什么对您有用: 本文直接连接您 primary interest 中的 hypothesis testing 和 minimax bounds 技术,其提出的变分距离模量是经典统计中 Hellinger 距离在隐私约束下的替代品,您可以用 very_familiar 的非参 minimax 界工具验证其下界是否紧。中期可做:若想将这一框架推广到高维或 U-statistic 设定,需先在 moderately_familiar 的 semiparametric theory 上长肌肉(具体为 influence function 在隐私约束下的变形)。

4. 10.1214/23-aos2338 · arXiv — Adaptive novelty detection with false discovery rate guarantee

  • 作者: Ariane Marandon, Lihua Lei, David Mary, Etienne Roquain
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 6/10 · novelty: new_method
  • 摘要: 研究半监督新颖性检测问题,目标是在仅有一组“典型”正常样本(inliers)的情况下,以有限样本控制检测出的新颖点(outliers)的假发现率(FDR)。提出 AdaDetect 方法,可包裹任意概率分类算法,在仅需可交换性假设的条件下实现有限样本 FDR 控制,无需分布假设。核心机制是将新颖性检测转化为多重检验问题,利用 conformal inference 构造 p 值,并通过数据自适应学习变换函数来增强检测功效。进一步提出自适应于零假设比例的变体,保持有限样本 FDR 控制。在合成数据和真实数据(包括天体物理学应用)上验证了方法。对您而言,该方法将多重检验与 conformal inference 结合,为高维假设检验提供了新的有限样本 FDR 控制框架,与您对 hypothesis testing 的兴趣直接相关。
  • 关键技术: conformal inference, false discovery rate (FDR) control, multiple testing, exchangeability, data-adaptive transformation, semi-supervised novelty detection
  • 为什么对您有用: 直接连接 hypothesis testing 兴趣子方向,特别是有限样本 FDR 控制这一核心问题。您武器库中的 minimax bounds 和 high-dimensional asymptotics 可用于分析该方法的功效最优性,而 moderately_familiar 的 M-estimation theory 可用于理解其自适应变换的估计性质。中期可做:需先在 moderately_familiar 的 semiparametric theory 上长肌肉,以严格刻画其功效与分布假设的 trade-off。

5. 10.1214/23-aos2296 · arXiv — StarTrek: Combinatorial variable selection with false discovery rate control

  • 作者: Lu Zhang, Junwei Lu
  • 期刊/来源: Annals of Statistics
  • 机构: Harvard University Press
  • 分类: vol 52 · issue 1
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究高维图模型中的枢纽节点(hub node)选择问题,目标是在控制错误发现率(FDR)的前提下,筛选出度数超过给定阈值的节点。由于枢纽节点涉及离散组合结构,无法直接构造检验统计量,且多重检验间的复杂依赖关系难以刻画。方法上,作者提出 StarTrek filter,基于高斯乘子自助法(Gaussian multiplier bootstrap)构造最大检验统计量的 p 值,并利用 Cramér 型比较界(Cramér-type comparison bound)精确控制 FDR。与 Chernozhukov 等人(2014)的 Kolmogorov 距离比较界不同,本文的 Cramér 型界刻画了两个高维高斯随机向量分布函数的相对差异,这对 FDR 控制的理论分析至关重要。理论证明 StarTrek filter 能有效控制 FDR,并给出了分位数估计误差的精确上界。该方法还可推广至一般统计模型,如同步检验多个高维线性模型的稀疏水平。数值实验和 GTEx 基因表达数据验证了其有效性。对您而言,本文的高维假设检验与 FDR 控制方法直接关联您的 hypothesis testing 兴趣,且 Cramér 型比较界的技术工具可迁移至您熟悉的高维渐近分析领域。
  • 关键技术: Gaussian multiplier bootstrap, Cramér-type comparison bound, false discovery rate (FDR) control, hub node selection, high-dimensional graphical model, maximum test statistic
  • 为什么对您有用: 本文直接关联您的 primary interest 中的 hypothesis testing 和高维统计。其核心工具 Cramér 型比较界是您非常熟悉的高维渐近分析领域的前沿进展,可立即用于改进其他多重检验问题的理论界。中期可做:将本文的 FDR 控制框架与您 moderately_familiar 的 HOIF 结合,处理更复杂的离散结构检验问题。

6. 10.1214/23-aos2347 · arXiv — Supervised homogeneity fusion: A combinatorial approach

  • 作者: Wen Wang, Shihao Wu, Ziwei Zhu, Ling Zhou, Peter X.-K. Song
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文提出 L0-Fusion,一种基于组合优化的回归系数同质融合方法,旨在将回归系数自动分组为同质组,从而降低参数空间的内在维度并提升统计精度。方法核心是使用混合整数优化(MIO)直接求解 L0 惩罚的融合问题,而非传统的凸松弛(如 Lasso 类融合惩罚)。在理论上,作者定义了 MSE 分组敏感性(MSE grouping sensitivity)这一关键量,刻画了恢复真实分组的难度,并证明 L0-Fusion 在该敏感性最弱可能条件下达到分组一致性;若条件不满足,则分组误设的 minimax 风险不会收敛到零。在高维场景下,结合确定筛选集(sure screening)可大幅降低计算成本而不损失统计效率。算法上提供了 MIO 公式和热启动策略。模拟和真实数据分析表明,L0-Fusion 在分组准确性上优于现有方法。该文对您可能有用:其组合优化视角和 minimax 分组敏感性分析,可连接到您在高维统计和假设检验方面的兴趣,尤其是分组一致性的理论刻画与 minimax 界的推导。
  • 关键技术: mixed integer optimization (MIO), L0 penalization, MSE grouping sensitivity, minimax risk of group misspecification, sure screening, combinatorial grouping
  • 为什么对您有用: 本文直接关联您在高维统计和假设检验方面的兴趣,特别是分组一致性的 minimax 理论。您可以用 very_familiar 的 minimax 界工具验证其分组敏感性下界的紧性,或用 moderately_familiar 的 M-估计理论分析 MIO 估计量的渐近性质。中期可做:若想将 L0-Fusion 扩展到因果推断中的异质性处理效应分组,需先在 moderately_familiar 的识别理论(如 CATE 分组)上长肌肉。

统计计算 / 算法 (stat_computing, 1 篇)

  • 作者: Rishabh Dudeja, Daniel Hsu
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文研究张量 PCA 的统计-计算权衡问题,目标是在给定样本量下刻画算法运行时间与内存之间的 trade-off。作者利用通信复杂度(communication complexity)推导出内存受限算法的计算下界,具体给出了算法对数据集的 passes 次数、样本量和内存需求之间的权衡关系。下界表明,当样本量不足时,梯度下降和幂法等常用算法必须增加迭代次数才能成功估计未知参数。类似的下界也适用于非高斯成分分析(non-Gaussian component analysis),这类问题中低阶矩张量不携带参数信息。对于非对称张量 PCA 及其相关估计问题,作者得到了更强的下界。这些结果解释了为何许多估计器使用的内存状态远大于参数的有效维度。对您而言,本文是统计-计算权衡领域的 gateway reading,清晰展示了如何用通信复杂度工具建立下界,且与您熟悉的张量收缩复杂度有潜在联系。
  • 关键技术: communication complexity, memory-bounded algorithms, tensor PCA, statistical-computational gap, non-Gaussian component analysis, lower bounds
  • 为什么对您有用: 本文直接对应您 primary interest 中的 statistical-computational tradeoff 方向,且是 gateway reading 的典范:它清晰陈述了统计模型(张量 PCA)、计算模型(内存受限算法)和 trade-off 的具体形式(passes vs. sample size vs. memory),数学上精确给出了下界,并解释了梯度下降等算法的迭代次数为何随样本量变化。您 moderately_familiar 中的 HOIF 和 higher-order U-statistics 理论可用来分析张量收缩的计算成本,而本文的通信复杂度框架可能为您的 tensor-network / einsum 复杂度工作提供新的下界视角。中期可做:需先在 moderately_familiar 的 theory of higher-order U-statistics 上深入,以连接张量收缩的图论复杂度与通信复杂度下界。

其他 (other, 4 篇)

1. 10.1214/23-aos2292 · arXiv — Maximum likelihood for high-noise group orbit estimation and single-particle cryo-EM

  • 作者: Zhou Fan, Roy R. Lederman, Yi Sun, Tianhao Wang, Sheng Xu
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 6/10 · novelty: new_theory
  • 摘要: 本文研究高噪声下基于随机旋转(及可能线性投影)观测的函数估计问题,动机来自单颗粒冷冻电镜(cryo-EM)。核心设定是:每个样本是未知函数经随机旋转(及投影)后加噪声观测,目标是在旋转轨道意义下恢复函数。作者将Fisher信息特征值按群不变量的超越度分层,并将似然景观的临界点与一系列矩优化问题联系起来,推广了先前关于离散旋转群(无投影)的结果。对于SO(2)和SO(3)旋转下的几个函数估计例子(包括cryo-EM简化模型),计算了超越度及优化问题的具体形式,并肯定地解决了“三阶矩足以局部识别一般信号的旋转轨道”这一猜想。在两种小蛋白分子的低维电势图近似上,通过数值实验验证了Fisher信息特征值的噪声缩放与理论预测一致。本文属于高维统计与群作用下的非参数估计理论,其Fisher信息谱分析对您的高维统计和随机矩阵理论兴趣有参考价值。
  • 关键技术: Fisher information eigenvalue stratification, transcendence degree, moment optimization, group invariants, cryo-EM model
  • 为什么对您有用: 本文连接您的高维统计与随机矩阵理论兴趣,具体在Fisher信息矩阵特征值谱的渐近分析上,与RMT中谱分布研究有技术交叉。武器库中'高维渐近'和'非参数统计'可直接用于理解其超越度分层与噪声缩放的关系,但核心的群作用与代数几何工具(超越度、不变式环)不在当前武器库中,属于'暂不可做'——需先补充群表示论或计算代数几何基础。

2. 10.1214/23-aos2341 · arXiv — Transfer learning for contextual multi-armed bandits

  • 作者: Changxiao Cai, T. Tony Cai, Hongzhe Li
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文研究非参数上下文多臂老虎机(contextual multi-armed bandits)中的迁移学习问题,设定为协变量偏移(covariate shift)模型:在目标老虎机学习开始前,已有来自源老虎机的历史数据可用。核心目标是利用源域数据降低目标域的累积遗憾(cumulative regret)。文章建立了非参数设定下累积遗憾的极小化收敛速率(minimax rate),并提出了一个达到该速率的迁移学习算法。由于无法自适应未知光滑性参数,作者进一步在自相似性(self-similarity)假设下开发了数据驱动的算法,该算法能在未知参数空间上实现接近最优的统计保证(仅差对数因子)。模拟研究验证了利用源域数据改善目标域学习的实际收益。本文属于bandit与迁移学习的交叉,与您的主要兴趣(因果推断、高维统计、U统计量等)无直接技术重叠,但迁移学习框架与因果推断中的数据融合问题有概念上的联系。
  • 关键技术: minimax regret, nonparametric contextual bandits, covariate shift, transfer learning, self-similarity assumption
  • 为什么对您有用: 本文属于bandit与迁移学习的交叉,与您的主要兴趣(因果推断、高维统计、U统计量等)无直接技术重叠,但迁移学习框架与因果推断中的data fusion问题有概念上的联系。武器库中'非参数统计'和'极小化界'可帮助理解其速率推导,但核心bandit设定与您的技术栈距离较远,属于暂不可做方向——缺少bandit regret分析和在线学习工具。

3. 10.1214/23-aos2349 · arXiv — Adaptive variational Bayes: Optimality, computation and applications

  • 作者: Ilsang Ohn, Lizhen Lin
  • 期刊/来源: Annals of Statistics
  • 机构: Inha University · University of Maryland, College Park
  • 分类: vol 52 · issue 1
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文提出一种自适应变分贝叶斯(Adaptive Variational Bayes, AVB)框架,目标是在模型集合上实现自适应推断。该方法先对每个子模型独立计算变分后验,再通过特定权重组合得到整个模型空间的变分后验,并证明该组合后验是预定义逼近族中离真实后验最近的成员。在极一般的条件下,AVB 达到了最优收缩率(optimal contraction rate)的自适应性。针对子模型数量巨大的情形(如稀疏模型),作者还给出了保持可计算性和自适应最优性的具体策略。应用实例包括深度学习与稀疏因子模型,并推导了新的自适应推断结果。此外,文章刻画了变分贝叶斯的隐式正则化效应,并展示了自适应变分后验如何利用这一效应。
  • 关键技术: variational Bayes, adaptive inference, posterior contraction, model averaging, sparse models
  • 为什么对您有用: 本文属于贝叶斯非参数/高维推断的方法论工作,与您 primary interest 中的非参数理论、高维统计有交集,但核心工具(变分后验收缩、模型平均)不在您的技术武器库中。作为 gateway reading,它展示了变分贝叶斯在自适应推断上的最新进展,但您若想跟进,需先在 moderately_familiar 的 M-estimation 理论或 semiparametric 理论上补足变分推断的收敛性分析。目前暂不可做,因为核心机器(变分后验的 contraction 分析、ELBO 的优化 landscape)不在武器库内。

4. 10.1214/23-aos2342 · arXiv — Settling the sample complexity of model-based offline reinforcement learning

  • 作者: Gen Li, Laixi Shi, Yuxin Chen, Yuejie Chi, Yuting Wei
  • 期刊/来源: Annals of Statistics
  • 分类: vol 52 · issue 1
  • 相关性 5/10 · novelty: sharper_rate
  • 摘要: 本文研究离线强化学习(offline RL)的样本复杂度问题,目标是在表格型马尔可夫决策过程(MDP)下,利用预收集数据(无进一步探索)实现最优策略学习。核心设定包括γ折扣无限期(或有限期H)MDP,状态数S,以及由单策略裁剪集中系数C_clipped^⋆刻画的数据分布偏移。方法上,提出基于模型的“悲观”值迭代算法,采用Bernstein型惩罚项,无需复杂方差缩减技术。理论贡献在于证明该算法达到minimax最优样本复杂度:无限期情形为S C_clipped^⋆ / ((1-γ)^3 ε^2),有限期为H^4 S C_clipped^⋆ / ε^2(忽略对数因子),且无需任何预热成本。证明技术核心是留一法解耦论证与针对MDP的自约束技术。该结果对您可能有用:虽然主题是RL而非您的主要兴趣,但minimax最优性证明框架(留一法、自约束)与您在高维统计和U统计量中使用的概率工具(如empirical process、concentration inequality)有技术交叉,可作为统计-计算权衡(statistical-computational tradeoff)的入门阅读——本文清晰展示了统计最优性(minimax率)与算法实现(多项式时间)之间的界限。
  • 关键技术: model-based offline RL, pessimistic value iteration, Bernstein-style penalty, leave-one-out decoupling, self-bounding techniques, minimax optimal sample complexity
  • 为什么对您有用: 本文属于gateway-reading范畴(statistical-computational tradeoff),适合作为统计学家进入离线RL领域的入门读物。它清晰阐述了统计模型(MDP、集中系数)、计算模型(多项式时间算法)以及统计最优性(minimax率)与算法实现之间的界限,满足(a)可访问性、(b)数学清晰性、(c)问题值得关注三个标准。武器库中'minimax bounds for estimation problems'和'high-dimensional asymptotics'可直接用于理解其证明框架;但核心的RL-specific技术(如Bellman backup、pessimism原理)不在当前武器库中,属于'暂不可做'——需先补充RL基础(如MDP、值迭代)才能跟进。值得花时间读全文以了解统计-计算权衡在RL中的具体形态。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论