跳转至

2026-07-10 每日 arXiv 资讯

  • 高相关论文 2 篇 · 中相关 31 篇 · 其他 16 篇 · 会议/Seminar 事件 0 条

✍️ 手动录入的论文(精读)

你手动录入(粘贴 arXiv 链接 / 标题)申请精读、或收藏后补读的论文,由当天的定时任务精读。点标题旁的 🔍 精读 查看解读。

因果推断 (causal_inference, 1 篇)

1. 2510.14368 — Marginal Causal Effect Estimation with Continuous Instrumental Variables

  • 作者: Mei Dong, Lin Liu, Dingke Tang, Geoffrey Liu, Wei Xu, Linbo Wang
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文针对连续工具变量(IV)场景,提出识别平均处理效应(ATE)的新框架。现有方法多依赖强参数模型或同质处理效应假设,而非参数方法在高维协变量下表现不佳。作者通过条件加权平均导数效应(conditional weighted average derivative effects)识别ATE,并利用条件Riesz表示(conditional Riesz representer)统一了连续和分类IV的框架。在ATE通常过度识别的情况下,刻画半参数观测数据模型的切空间需要构造二阶参数子模型,这是本文的技术难点。基于该半参数模型的影响函数,作者开发了一个局部有效、三重稳健(triply robust)、有界且易于实现的估计量。该方法应用于Princess Margaret癌症中心的观察性临床研究,评估超重对非小细胞肺癌患者两年死亡率的因果效应(肥胖悖论)。对您而言,本文在连续IV的识别和半参数效率理论上提供了新视角,与您的因果推断和效率理论兴趣直接相关。
  • 关键技术: conditional Riesz representer, triply robust estimation, semiparametric efficiency bound, influence function, continuous instrumental variables, conditional weighted average derivative effects
  • 为什么对您有用: 本文直接连接您的primary interest中的因果推断(IV识别)和效率理论(半参数切空间与影响函数构造)。技术武器库中'identification theory in causal inference'和'semiparametric theory'(均属moderately_familiar)可用来理解其识别策略和效率论证;'estimation theory in causal inference'(very_familiar)可用于评估其三重稳健估计量的有限样本表现。中期可做:若想跟进连续IV的识别条件或扩展至异质性效应,需先在'semiparametric theory'上加强(moderately_familiar)。

非参数 / 半参数 (nonparam_semipara, 1 篇)

1. 2607.02943 — Geometric Information Decomposition for Weighted Empirical Measures on the Sphere

  • 作者: Kisung You
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文研究当数据已表示为球面上的加权概率测度(如重要性采样、求积规则或注意力加权嵌入)时,如何量化方向不确定性。标准做法是拟合 von Mises-Fisher (vMF) 分布并报告其浓度或熵,但这仅利用了均值方向信息,会遗漏对跖、轴向、带状或多模态结构。作者提出几何信息分解 (GID),通过拟合基于球面特征的最大熵投影的嵌套序列,并报告每一层增加的熵差。第一层熵差恢复 vMF 信息,第二层捕获 Fisher-Bingham/Bingham 型各向异性,后续层捕获更精细的角结构。论文证明了 GID 的不变性、一致性、远离零熵差时的渐近正态性,以及用于判断新层是否携带信息的二次型零校准。实验包括圆和球面示例、校准研究以及查询加权数字投影,展示了何时 vMF 不确定性足够、何时高阶间隙能揭示隐藏结构。该方法对非参数统计和假设检验有直接参考价值,特别是其嵌套投影框架可类比于高阶 U-统计量的分解思路。
  • 关键技术: maximum-entropy projection, nested sequence of spherical features, von Mises-Fisher distribution, Fisher-Bingham/Bingham anisotropy, quadratic-form null calibration, geometric information decomposition
  • 为什么对您有用: 本文直接关联非参数与半参数理论中的最大熵方法和假设检验,其嵌套投影框架与高阶 U-统计量的分解思想有结构相似性。技术武器库中'非参数统计'和'高阶 U-统计量的树宽/张量收缩计算'可用于分析 GID 的估计成本与渐近性质——例如,将熵差视为某种 U-统计量的投影,利用树宽刻画其计算复杂度。中期可做:需先在 moderately_familiar 的'高阶 U-统计量理论'上深入,以严格建立 GID 与高阶 U-统计量投影的联系。

⭐ 高相关论文(按主题分组)

因果推断 (causal_inference, 1 篇)

1. 2607.07524 — Robust Inference for Weighted Estimands

  • 作者: Vod Vilfort
  • 分类: econ.EM
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文研究加权估计量的稳健推断问题,目标是在异质性效应下对不同加权方案的估计量进行统一推断。作者首先建立了不同加权估计量之间差异的界,以及效应异质性的置信界。基于这些界,构造了最小化最坏情况偏差的估计量,以及在一类加权估计量上一致有效的置信区间。方法应用于两个实证案例:Lakdawala等人关于学校互联网接入对考试成绩影响的event study,以及Tennessee的Project STAR实验。结果表明,在第一个案例中结果对权重选择稳健,而在第二个案例中结果对基线权重的微小偏离敏感。该工作为处理加权估计量选择争议提供了形式化的推断工具,对您可能有用:它直接关联到因果推断中异质性处理效应的估计与敏感性分析,且其构造一致置信区间的思路可迁移至您熟悉的minimax bound框架。
  • 关键技术: weighted estimands, uniformly valid confidence intervals, worst-case bias minimization, effect heterogeneity bounds, event study
  • 为什么对您有用: 本文直接关联到您的primary interest中的因果推断(异质性处理效应、敏感性分析),且其核心技术——构造一致置信区间——与您非常熟悉的minimax bound框架高度契合,可视为一个立即可做的follow-up:用您掌握的nonparametric statistics和minimax bounds工具,可以检验其构造的界是否紧,或推广到更一般的加权方案。

数理统计 / 假设检验 (hypothesis_testing, 1 篇)

1. 2607.07588 — Testing the equality of estimable parameters

  • 作者: M. Romero-Madro\~nal, M. Remedios Sillero-Denamiel, M. Dolores Jim\'enez-Gamero
  • 分类: stat.ME
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文针对多个独立总体中由U-统计量定义的一类广泛参数(如方差、相关系数、Gini指数等)的相等性检验,提出了一个统一框架。考虑两种检验统计量:Wald型统计量和ANOVA型统计量。在固定维数下推导了Wald型统计量的渐近分布;在固定和递增维数(参数维数随样本量发散)下分别研究了ANOVA型统计量的渐近性质。基于这些极限分布,构建了无需参数假设的渐近精确检验程序。此外,针对固定维数下的ANOVA型统计量,研究了基于加权bootstrap的零分布估计方法。通过大量模拟评估了有限样本表现和计算效率,并用真实数据集展示了方法的实用性。该工作直接连接您对higher-order U-statistics和hypothesis testing的兴趣,特别是U-统计量框架在多样本比较中的统一应用。
  • 关键技术: U-statistics, Wald-type statistic, ANOVA-type statistic, weighted bootstrap, increasing-dimension asymptotics
  • 为什么对您有用: 本文直接连接您对higher-order U-statistics和hypothesis testing的兴趣,特别是U-统计量框架在多样本比较中的统一应用。您可以用very_familiar的higher-order U-statistics计算(treewidth/tensor contraction)来分析其检验统计量的计算复杂度,或用moderately_familiar的U-统计量理论验证其渐近结果是否可推广到高阶情形。中期可做:需先在moderately_familiar的higher-order U-statistics理论上深入,以处理高阶U-统计量的渐近分布。

📌 中相关论文(按主题分组)

因果推断 (causal_inference, 2 篇)

1. 2607.06912 — Causal Inference for Case Studies in Behavioral Health

  • 作者: Shane Sparkes
  • 分类: stat.ME
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文针对行为健康个案研究(observational N=1 设定)提出一套因果推断框架,目标是在存在未测量混杂时识别因果效应。核心创新是定义了一类称为 Ω estimands 的因果估计量,它基于结果变量支撑集(support)的函数对比,而非其分布对比。作者证明,在结构因果模型中,只要满足 positivity 假设,观测支撑与干预支撑即一致,无需知道、测量或调整混杂变量。两个可选条件扩展了框架:一是允许用客户回忆的基线替代稀疏测量的基线期,二是通过期望-平均恒等式将支撑对比与均值对比连接。论文采用 de Finetti 主观概率解释,并将框架置于基于测量的护理(measurement-based care)背景下。一个针对焦虑的认知行为疗法案例展示了提供者可使用的初等方法。对您而言,该工作为 N=1 或小样本因果推断提供了新识别策略,可能对纵向因果推断中的个体处理效应(ITE)估计有启发。
  • 关键技术: Ω estimands, support-based causal inference, positivity assumption, structural causal model, subjectivist probability
  • 为什么对您有用: 直接连接到 primary interest 中的因果推断(identification under unmeasured confounding)和纵向设定。技术武器库中 very_familiar 的 estimation theory in causal inference 可用来分析该框架的有限样本性质(如支撑估计的收敛速度),但核心识别策略(支撑对比而非分布对比)与常规因果推断工具差异较大,属于中期可做:需先在 moderately_familiar 的 identification theory in causal inference 上深入理解该框架的假设强度与可检验性。

2. 2607.07516 — Empirical Bayes Estimation of the Mean of a Function of the Latent Variable with Applications to the Treatment of Nonresponse

  • 作者: Eitan Greenshtein, Ya'acov Ritov
  • 分类: math.ST · stat.TH
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文在非参数经验贝叶斯框架下研究混合分布线性泛函的估计问题,目标是在混合分布仅部分可识别(如复杂抽样中无应答导致)时仍能有效估计。核心方法是将线性泛函应用于混合分布的半参数极大似然估计(semi-parametric MLE),并论证即使MLE不唯一,该估计量仍具有效率。理论贡献在于证明了在部分可识别设定下,基于MLE的泛函估计量是渐近有效的,无需完全识别混合分布。技术工具涉及半参数效率理论、经验过程以及混合分布的可识别性分析。实证部分通过模拟和实际数据展示了方法在无应答处理中的应用。对您而言,本文连接了因果推断中的缺失数据/无应答问题与半参数效率理论,且其部分可识别设定与proximal causal inference中的negative control假设有相似之处,值得关注。
  • 关键技术: semiparametric maximum likelihood, partial identification, empirical Bayes, linear functional estimation, nonresponse adjustment
  • 为什么对您有用: 本文直接关联您primary interest中的因果推断(无应答处理)和半参数效率理论。其部分可识别设定与proximal CI的negative control思路相通,可用您very_familiar的minimax bounds工具分析该估计量的最优性。中期可做:需先在moderately_familiar的identification theory上深入,以将方法推广至更一般的因果识别问题。

高维统计 / 随机矩阵 (high_dim_rmt, 3 篇)

1. 2607.06936 — Transfer Learning for Linear Discriminant Analysis with a Shared Classification Signal

  • 作者: Yonghan Zhang, Yimeng Fan, Wenya Luo, Jiang Hu
  • 分类: stat.ME · stat.ML
  • 相关性 7/10 · novelty: new_theory
  • 摘要: 本文研究高维二分类中线性判别分析的迁移学习问题。设定包含一个目标域和多个源域,每个域的均值差被分解为确定性公共成分(共享分类信号)和域特异性随机偏差。在spiked covariance模型下,推导了加权迁移分类器在目标域上的高斯校准误差的确定性极限,覆盖了同质和异质协方差两种情形。这些极限显式刻画了共享信号强度、域特异性变异、维度-样本量比以及spike结构对迁移性能的影响。基于极限结果,进一步得到了oracle迁移权重和一致的数据驱动插件估计量。同时,还刻画了目标域类别样本量不平衡导致的截距偏差,并给出了渐近最优校正。该工作将随机矩阵理论(Marchenko-Pastur律、spiked模型)与迁移学习结合,为高维分类中的知识迁移提供了精确的理论刻画。
  • 关键技术: spiked covariance model, Marchenko-Pastur law, Gaussian-calibrated error, transfer learning, linear discriminant analysis, oracle weights
  • 为什么对您有用: 直接连接到高维统计与随机矩阵理论(RMT)这一primary interest,具体是spiked covariance模型下分类误差的确定性极限推导。技术武器库中'high-dimensional asymptotics'和'minimax bounds for estimation problems'可直接用于验证其极限结果的紧性,或进一步推导迁移学习中的minimax最优率。中期可做:若想将迁移权重估计推广到更一般的协方差结构(如因子模型),需先在'moderately_familiar'的semiparametric theory上长肌肉。

2. 2607.07694 — Minimum Norm Interpolation via The Local Theory of Banach Spaces: The Role of Gaussianity

  • 作者: Gil Kur, Reese Pathak
  • 分类: math.ST · math.MG · math.PR · stat.TH
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究过参数化线性回归中最小范数插值(MNI)的统计性质,设定为各向同性高斯协变量且范数无闭式解。核心方法避开常用的凸高斯极小-最大定理(CGMT),转而使用高维几何与概率工具:首先利用各向同性位置下的“偏移”界控制MNI对真实参数的收缩量;其次,通过Cordero-Erausquin-Ledoux的L1-L2不等式变体结合Gluskin经典结果,证明ℓ1-MNI的“内在”方差至多为O(1/(n log(d/n)^2)),恢复了Wang等人[2022]的均方误差(MSE)锐界。技术关键包括对称高斯多面体P_{n,d}的几何分析(Fleury[2012])、各向同性常数比改进(Klartag-Kozma[2009]的界被提升至1+O((log(d/n))^{-2})),以及加权薄壳估计。对您而言,本文的高维几何与概率方法(如Talagrand不等式、高斯多面体)可直接用于高维统计推断中的锐化率分析,且其技术工具(如各向同性常数界)与您的随机矩阵理论和高维渐近兴趣高度契合。
  • 关键技术: minimum-norm interpolation, isotropic position, Talagrand L1-L2 inequality, symmetric Gaussian polytope, thin-shell estimate, isotropic constant
  • 为什么对您有用: 本文直接关联您的高维统计与随机矩阵理论兴趣,具体连接点为: (1) 研究ℓ1-MNI的MSE锐界,属于高维线性回归的经典问题,与您熟悉的高维渐近工具(如minimax界)直接对口; (2) 技术核心(高斯多面体、各向同性常数)可视为随机矩阵理论在几何概率中的延伸,您用Marchenko-Pastur律或浓度不等式即可复现其部分推导; (3) 立即可做:用您very_familiar的minimax界工具验证本文的MSE界是否紧,或将其推广到非高斯协变量设定。

3. 2607.07694 — Minimum Norm Interpolation via The Local Theory of Banach Spaces: The Role of Gaussianity

  • 作者: Gil Kur, Reese Pathak
  • 分类: math.ST · math.MG · math.PR · stat.TH
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究过参数化线性回归中最小范数插值(MNI)的统计性质,设定为各向同性高斯协变量且范数无闭式解。核心贡献在于避开常用的凸高斯极小极大定理(CGMT),转而使用高维几何与概率工具(如Talagrand L1-L2不等式、Gluskin经典结果、Fleury对称高斯多面体理论)来刻画MNI的收缩行为与均方误差。对于ℓ1范数MNI,作者证明其内在方差至多为O(1/(n log(d/n)^2)),并恢复了Wang et al. (2022)的锐利MSE界。此外,本文改进了高维几何中的两个独立结果:对称高斯多面体的各向同性常数与欧几里得球的比值以高概率不超过1+O((log(d/n))^{-2}),并给出了Fleury主定理的初等证明。对您而言,本文的高维几何与概率技术(如薄壳估计、各向同性常数分析)可迁移至随机矩阵理论中的谱分布精细刻画,且其“非CGMT”路径为高维统计推断提供了新视角。
  • 关键技术: Talagrand L1-L2 inequality, symmetric Gaussian polytope, isotropic constant, thin-shell estimate, minimum-norm interpolation, high-dimensional geometry
  • 为什么对您有用: 本文直接关联您的高维统计与随机矩阵理论兴趣,特别是通过对称高斯多面体与各向同性常数分析来研究MSE界,这与您武器库中的高维渐近理论高度契合。您可立即用非常熟悉的minimax界工具验证其声称的锐利率是否紧,中期可尝试将薄壳估计技术推广至非高斯协变量设定(需在moderately_familiar的高阶U统计量理论上长肌肉)。

非参数 / 半参数 (nonparam_semipara, 1 篇)

1. 2607.06797 — MAPLE: Mapper Based Localized Prediction with Data Driven Cover Selection for High dimensional Data

  • 作者: Md Moinul Ahsan, Priyam Das, Nitai D Mukhopadhyay
  • 分类: stat.ME
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文提出 MAPLE(Mapper-based Adaptive Prediction via Local Estimation),一种基于拓扑数据分析(TDA)的局部化预测框架,用于高维生物医学数据。该方法将条件类概率估计视为非参数问题,通过数据自适应的 Mapper 图定义邻域,在图中进行局部平均,从而捕捉预测空间的非线性、异质性和流形结构。核心贡献在于引入了一个基于偏差-方差权衡的数据驱动覆盖选择程序,为区间宽度和重叠度提供了最优渐近尺度。框架支持二分类、名义和有序结局,并包含基于置换的变量重要性度量。理论方面,在标准正则性条件下证明了逐点一致性和贝叶斯风险一致性。模拟表明,在异质性和高噪声设定下,MAPLE 一致优于或持平于多项回归、有序回归和随机森林。在帕金森病进展(PPMI)和胶质瘤分类(TCGA RNA-seq)数据上的应用展示了强预测精度和可解释的拓扑感知摘要。对您而言,该文将非参数局部估计与 TDA 的图结构结合,为高维异质性数据的预测建模提供了新思路,可连接至您的非参数统计和因果推断中的异质性处理效应估计兴趣。
  • 关键技术: Mapper graph, topological data analysis, localized averaging, bias-variance tradeoff cover selection, permutation-based variable importance, pointwise consistency
  • 为什么对您有用: 本文连接至您的非参数统计兴趣,具体为高维异质性数据的局部估计方法。您可用 very_familiar 的非参数统计和 minimax 界工具分析其覆盖选择的渐近最优性是否紧,或检验其点态一致性率。中期可做:若将 MAPLE 的图结构邻域思想迁移至因果推断中的异质性处理效应估计(如 CATE 的局部平滑),需先在 moderately_familiar 的识别理论(如 unconfoundedness 下的局部 IV)上长肌肉。

数理统计 / 假设检验 (hypothesis_testing, 8 篇)

1. 2607.06835 — Best Subset Selection in Linear Regression: Fixed-Design Error Bounds and Insights for Random Designs

  • 作者: Maxim Fedotov (Universitat Pompeu Fabra)
  • 机构: Universitat Pompeu Fabra
  • 分类: math.ST · stat.TH
  • 相关性 7/10 · novelty: new_theory
  • 摘要: 本文研究线性回归中最佳子集选择(Best Subset Selection)的精确支持恢复问题,在固定设计(fixed design)设定下推导了支持恢复失败概率的非渐近上界。该上界通过一个确定性子集可分离性参数(subset-separability parameter)表达,该参数衡量真实支持与竞争支持在投影后的可区分程度。结果适用于所有样本量 n 超过某个显式阈值的情况,该阈值由信噪比、设计矩阵的子集可分离性以及阶为 ln s + ln(d - s) 的对数因子决定。与随机设计分析不同,固定设计下不会出现全组合对数项(full log-combinatorial term),但作者讨论了当设计随机且可分离性参数需在众多竞争子集上一致控制时,该组合项可能重新出现。本文的固定设计框架和证明策略还指出了最佳子集选择有效复杂度可能降低的场景,例如在结构化设计或受限候选子集类下。对您而言,本文的非渐近上界推导和子集可分离性参数概念与您在高维统计和假设检验方面的兴趣直接相关,其固定设计视角为理解随机设计下的复杂度提供了新见解。
  • 关键技术: best subset selection, fixed-design analysis, subset-separability parameter, non-asymptotic bound, support recovery
  • 为什么对您有用: 本文直接连接您在高维统计和假设检验方面的兴趣,具体涉及高维线性回归中的支持恢复问题。您武器库中非常熟悉的高维渐近理论和极小极大界可用于验证本文上界的紧性,而中等熟悉的 M-估计理论可用于将固定设计结果推广到随机设计。中期可做:需先在 moderately_familiar 的 M-估计理论上长肌肉,以处理随机设计下的一致控制问题。

2. 2607.07245 — The Randomized BH Procedure: A Generalized Framework Encompassing Conformal and Competition Tests

  • 作者: Mingzhou Deng, Yan Fu
  • 分类: math.ST · stat.TH
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文提出 Randomized BH 程序,通过在经典 Benjamini-Hochberg (BH) 过程中引入随机化,构建了一个统一的 FDR 控制框架。作者证明经典 BH、竞争检验(competition tests)和共形检验(conformal tests)这三类方法均可视为该框架的特例。Randomized BH 放松了经典 FDR 控制所需的条件(如 p 值的正回归依赖性),使共形检验摆脱严格的交换性假设(允许通过预筛选构建校准集),并使竞争检验能够借助成熟的 p 值理论进行分析。框架的两个应用包括:从随机化视角深入分析复合 p 值,以及为分布式多重检验问题提供全局 FDR 控制的通用方法。数值模拟验证了理论结果的有效性。该工作对您在高维假设检验和多重比较方向的研究有直接参考价值,尤其是其统一框架可能启发您将 U-统计量或高维检验中的 FDR 控制问题纳入类似视角。
  • 关键技术: Randomized BH procedure, false discovery rate (FDR), conformal tests, competition tests, exchangeability assumption, distributed multiple testing
  • 为什么对您有用: 本文直接关联您 primary interest 中的 hypothesis testing 子方向,特别是多重检验的 FDR 控制。技术武器库中 very_familiar 的 high-dimensional asymptotics 和 moderately_familiar 的 M-estimation theory 可用于分析该随机化框架在非交换性设定下的渐近性质。中期可做:需先在 moderately_familiar 的 semiparametric theory 上长肌肉,以处理共形检验中预筛选步骤带来的选择性偏差。

3. 2607.07516 — Empirical Bayes Estimation of the Mean of a Function of the Latent Variable with Applications to the Treatment of Nonresponse

  • 作者: Eitan Greenshtein, Ya'acov Ritov
  • 分类: math.ST · stat.TH
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文在非参数经验贝叶斯框架下,研究混合分布线性泛函的估计问题。核心设定是混合分布仅部分可识别,这常见于存在无响应的复杂抽样场景。作者提出将线性泛函直接应用于混合分布的半参数极大似然估计(SMPLE)是一种有效工具,即使该极大似然估计不唯一。方法的核心机制是利用SMPLE的渐近性质,通过经验过程理论建立泛函估计的相合性和渐近正态性。主要理论结果表明,在部分可识别条件下,该估计量仍能达到半参数效率界。实证部分通过模拟和实际数据验证了方法在无响应处理中的有效性。对您而言,本文连接了非参数经验贝叶斯与部分可识别性下的因果推断问题,其中使用的半参数似然估计技术可迁移至您的proximal causal inference或缺失数据场景。
  • 关键技术: semiparametric maximum likelihood, partial identification, empirical Bayes, linear functionals, nonresponse adjustment
  • 为什么对您有用: 本文直接关联您的primary interest中的因果推断(缺失数据/无响应处理)和半参数理论。技术武器库中的'非参数统计'和'逆问题'可用于理解其部分可识别性下的估计策略,而'半参数理论'(moderately_familiar)是理解其效率结果的关键。中期可做:需先巩固半参数效率界理论,再探索将SMPLE思路推广至proximal causal inference中的部分可识别设定。

4. 2607.06835 — Best Subset Selection in Linear Regression: Fixed-Design Error Bounds and Insights for Random Designs

  • 作者: Maxim Fedotov (Universitat Pompeu Fabra)
  • 机构: Universitat Pompeu Fabra
  • 分类: math.ST · stat.TH
  • 相关性 7/10 · novelty: new_theory
  • 摘要: 本文研究线性回归中最佳子集选择(Best Subset Selection)在固定设计下的精确支持恢复问题。目标是在已知真实支持大小 s 和维度 d 时,推导 BSS 失败概率的非渐近上界。该上界通过一个确定性子集可分离性参数(subset-separability parameter)表达,该参数衡量真实支持与竞争支持在投影后的可区分程度。结果适用于所有超过某个充分阈值的样本量 n,该阈值由信噪比、设计矩阵的子集可分离性以及 ln s + ln(d - s) 的对数因子显式给出。与随机设计分析不同,固定设计下不会出现全组合对数项(full log-combinatorial term)。文章进一步讨论了当设计随机且可分离性参数需在众多竞争子集上一致控制时,该组合项如何重新出现。固定设计框架和证明策略还指出了 BSS 有效复杂度可能降低的场景,例如结构化设计或受限候选子集类。
  • 关键技术: Best subset selection, Exact support recovery, Non-asymptotic bound, Subset-separability parameter, Fixed-design analysis
  • 为什么对您有用: 本文直接关联您对高维统计和假设检验的兴趣,特别是支持恢复问题的非渐近理论。您武器库中'高维渐近理论'和'极小极大界'可直接用于分析其子集可分离性参数的紧性,或扩展至随机设计下的均匀控制问题。中期可做:需先在 moderately_familiar 的'半参数理论'上长肌肉,以处理更一般的误差分布或异方差设定。

5. 2607.07245 — The Randomized BH Procedure: A Generalized Framework Encompassing Conformal and Competition Tests

  • 作者: Mingzhou Deng, Yan Fu
  • 分类: math.ST · stat.TH
  • 相关性 7/10 · novelty: new_method
  • 摘要: 该文提出 Randomized BH 程序,将随机化引入 Benjamini-Hochberg 过程以控制错误发现率(FDR)。作者证明经典 BH 过程以及两类新兴的无零分布方法——竞争检验和共形检验——均是该框架的特例,共享统一的理论基础。Randomized BH 放松了经典 FDR 控制所需的条件,使共形检验摆脱严格的交换性假设,允许通过预筛选构建校准集,并使竞争检验能够通过成熟的 p 值理论进行分析。通过两个应用展示框架:一是从随机化视角深入分析复合 p 值,二是提出整合分布式多重检验问题同时保持全局 FDR 控制的通用方法。数值模拟验证了理论结果的有效性。该文对您可能有用:它直接连接您对假设检验的兴趣,尤其是多重比较和 FDR 控制这一经典统计推断问题,且其统一框架可能启发您在高维或多重检验场景中设计新的检验程序。
  • 关键技术: Randomized BH procedure, False Discovery Rate (FDR), conformal tests, competition tests, p-value theory, multiple testing
  • 为什么对您有用: 本文直接对应您 primary interest 中的 'hypothesis testing' 子方向,特别是多重比较与 FDR 控制这一经典统计推断问题。您武器库中 'nonparametric statistics' 和 'high-dimensional asymptotics' 的功底可用于分析该随机化框架在高维稀疏信号下的渐近性质(如 FDR 的收敛速度)。中期可做:若先熟悉 'semiparametric theory' 中的 influence function 技术,可尝试将 Randomized BH 与 debiased ML 结合,处理高维协变量调整下的多重检验问题。

6. 2607.06874 — Gaussian comparison above the median

  • 作者: Colin B. Fogarty
  • 分类: math.ST · stat.TH
  • 相关性 6/10 · novelty: new_theory
  • 摘要: 本文证明了一个针对闭凸集的高斯比较不等式,要求参考概率至少为1/2。对于协方差矩阵在Loewner序下有序的中心高斯向量,较小协方差分布赋予每个在较大协方差下测度至少1/2的闭凸集的概率不小于较大协方差分布。这提供了Anderson定理的单侧类比。在统计应用中,该结果证明了在显著性水平低于1/2时,使用保守协方差估计量进行单侧和顺序约束推断的合理性,前提是检验统计量的接受域是闭凸集但不一定对称。该结果直接关联到假设检验中协方差估计的稳健性,对您在高维统计和假设检验中的工作有直接参考价值。
  • 关键技术: Gaussian comparison inequality, Anderson's theorem, Loewner order, closed convex sets, conservative covariance estimation, order-restricted inference
  • 为什么对您有用: 该论文直接关联到您的数学统计与假设检验兴趣,特别是高维设定下协方差估计的稳健性。您武器库中的高维渐近理论可直接用于验证该不等式在高维稀疏设定下的紧性,属于立即可做的方向。

7. 2607.06874 — Gaussian comparison above the median

  • 作者: Colin B. Fogarty
  • 分类: math.ST · stat.TH
  • 相关性 6/10 · novelty: new_theory
  • 摘要: 本文证明了一个针对闭凸集的高斯比较不等式,其参考概率至少为1/2。对于协方差矩阵在Loewner序下有序的中心高斯向量,较小协方差分布赋予每个在较大协方差下测度至少1/2的闭凸集的概率至少与较大协方差分布一样大。这提供了Anderson定理对于高斯测度的单侧类比。在统计应用中,该结果证明了在显著性水平低于1/2时,使用保守协方差估计量进行单侧和有序约束推断的合理性,前提是检验统计量的接受域是闭凸集但不一定对称。该结果直接关联到假设检验中的多重比较和有序推断问题,为使用保守方差估计提供了理论保证。
  • 关键技术: Gaussian comparison inequality, Anderson's theorem, Loewner order, closed convex sets, one-sided inference, order-restricted inference
  • 为什么对您有用: 该论文直接关联到您的数学统计与假设检验兴趣,特别是关于高斯测度的比较不等式。您武器库中的非参数统计与高维渐近理论可用于验证该结果在更一般设定下的推广或紧性。中期可做:该结果在多重比较或有序推断中的应用,需先熟悉有序约束推断的具体设定。

8. 2607.07699 — Mitigating the Winner's Curse While Controlling Multiplicity: e-Process Methods for Anytime-Valid Inference in Dose-Ranging Trials

  • 作者: Victor K. de la Pena, Fangyuan Lin, Demissie Alemayehu, Victor H. de la Pena
  • 分类: stat.ME
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对 II 期剂量-反应试验中因重复选择最大观测效应而导致的 winner's curse 和多重性 Type I error 膨胀问题,提出了一种 anytime-valid 推断方法。核心目标是检验最佳剂量的真实效应是否超过临床有意义的界值。方法学起点是一个关于 running maximum 的选择溢价恒等式:对于剂量-对照得分,重新选择当前领先者的期望增益是一个可预测的选择费用。减去该费用后,残差在原假设下具有非正漂移;通过单边混合指数构造得到 e-process,进而实现 anytime-valid 全局检验。最终决策规则具有清晰的账目形式:原始最佳效应减去选择费用再减去监测界值,仅当剩余证据仍超过临床界值时才做出“GO”决策。作者给出了高斯和二元结果的 plug-in 实现,证明了有限样本 Type I 控制和最佳剂量效应的 anytime 置信下界,并通过实例和模拟进行了说明。该工作将 e-process 框架应用于临床试验的特定多重比较问题,对您在高维假设检验和因果推断中的多重性调整问题有直接参考价值。
  • 关键技术: e-process, anytime-valid inference, winner's curse correction, selection premium identity, mixture-exponential construction, running maximum
  • 为什么对您有用: 本文直接关联您 primary interest 中的 hypothesis testing 方向,具体解决了多重比较和选择偏差耦合下的推断问题。您武器库中 very_familiar 的 minimax bounds 和 high-dimensional asymptotics 可用于分析该 e-process 在更复杂多重性设定下的最优性;moderately_familiar 的 identification theory 可帮助将选择溢价恒等式推广到因果推断中的 subgroup selection 问题。中期可做:需先在 moderately_familiar 的 semiparametric theory 上长肌肉,以处理更一般的 outcome 分布和协变量调整。

统计计算 / 算法 (stat_computing, 6 篇)

1. 2607.07249 — Gradient-free stochastic optimization of derivatives under strong convexity

  • 作者: Arya Akhavan, Sirine Louati, Alexandre B. Tsybakov
  • 分类: math.ST · stat.TH
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究在仅能查询函数 g 的带噪值(而非梯度)的条件下,最小化 g 的 k 阶偏导数 f = ∂_j^k g 的问题。假设 g 具有 Hölder 光滑性 β+k(β≥2),且 f 在紧凸集 Θ 上强凸,作者提出基于核的 ∇f 估计器,并分析由其驱动的投影随机梯度算法。非渐近优化误差上界为 d^{(2β+k-1)/(β+k)} N^{-(β-1)/(β+k)},其中 N 为总查询次数。同时建立了 minimax 下界 N^{-(β-1)/(β+k)},证明该速率在 N 上是最优的。该工作将经典零阶优化推广到导数级目标,核心工具是核光滑与随机梯度下降的结合。对您而言,该文的非渐近误差分析与 minimax 下界技术可直接迁移到您熟悉的非参数统计与 minimax 界工具中,且其“梯度自由”设定与统计计算中的计算-信息折衷问题有潜在联系。
  • 关键技术: kernel-based gradient estimator, projected stochastic gradient descent, minimax lower bound, Hölder regularity, zero-order optimization
  • 为什么对您有用: 本文属于统计计算方向,直接连接您 primary interest 中的“statistical-computational tradeoff / computationally constrained statistics”。您可以用 very_familiar 的 minimax 界技术验证其下界是否紧,并思考该设定下是否存在低度多项式障碍(LDLR)——这是您作为 outsider 进入计算-信息折衷领域的理想 gateway reading。中期可做:需先在 moderately_familiar 的 HOIF 或更高阶 U-统计量上建立与核估计的联系。

2. 2607.07249 — Gradient-free stochastic optimization of derivatives under strong convexity

  • 作者: Arya Akhavan, Sirine Louati, Alexandre B. Tsybakov
  • 分类: math.ST · stat.TH
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究在仅能查询未知函数 g 的带噪值、无法直接获取梯度信息的情况下,最小化 g 的 k 阶偏导数 f = ∂_j^k g 的问题。假设 g 具有 Hölder 光滑性 β+k(β≥2),且 f 在紧凸集 Θ⊂ℝ^d 上强凸,同时满足有界性和 Lipschitz 正则性条件。作者提出基于核的 ∇f 估计量,并分析由该估计量驱动的投影随机梯度算法。得到非渐近优化误差上界 d^{(2β+k-1)/(β+k)} N^{-(β-1)/(β+k)},其中 N 为总查询次数。同时建立 minimax 下界 N^{-(β-1)/(β+k)},证明该速率在 N 上是最优的。该工作将经典零阶优化(梯度不可直接获取)推广到高阶导数优化场景,对统计计算中依赖梯度信息的算法设计具有理论指导意义。
  • 关键技术: kernel-based gradient estimation, projected stochastic gradient descent, minimax lower bound, Hölder regularity, zero-order optimization
  • 为什么对您有用: 本文直接关联统计计算中的随机优化问题,属于 primary interest。技术武器库中 'nonparametric statistics' 和 'minimax bounds for estimation problems' 可用于理解其核估计与下界构造;'inverse problems with random noise' 视角可分析其梯度估计的 ill-posedness。中期可做:若先熟悉 'semiparametric theory' 中的 influence function 技巧,可将该框架推广到更一般的损失函数。

3. 2607.06832 — When is multivariate kriging worthwhile? A design-geometry analysis of heterotopic multi-output Gaussian processes

  • 作者: Zexun Chen, Jun Fan, Kuo Wang
  • 分类: stat.ME · stat.CO
  • 相关性 5/10 · novelty: new_method
  • 摘要: 针对异位(heterotopic)多输出高斯过程建模中联合克里金(multivariate kriging)是否优于单变量克里金这一悬而未决的问题,本文在可分离多输出GP假设下给出了基于设计几何的解析答案。核心贡献是引入三个无需拟合即可计算的模型无关诊断指标:directed coverage、directed proximity和borrowing potential indices。作者推导了联合建模的oracle预测增益的精确恒等式,并利用径向函数下的局部几何界定了该增益的上界。进一步证明,交叉输出依赖性的可估计性由核加权的交叉设计交互质量(cross-design interaction mass)控制,并将该结果逐分量推广到线性区域化模型(LMC)。一个关键结论是:交错设计与分离设计在统计上不等价,即使两者重叠为零。最终整合为一项一阶净收益准则,用于判断联合建模是否值得。通过受控合成实验、M/M/1排队模拟和多污染物监测网络案例验证了准则的实用性。对您而言,本文提供了在计算统计中判断多输出模型收益的几何化准则,其诊断指标的设计思路可直接迁移至您熟悉的非参数统计和高维渐近框架中,用于评估复杂模型(如多任务学习)的预测增益。
  • 关键技术: separable multi-output Gaussian process, heterotopic design, directed coverage/proximity/borrowing potential indices, kernel-weighted cross-design interaction mass, linear model of coregionalisation, oracle prediction gain identity
  • 为什么对您有用: 本文属于统计计算(stat_computing)方向,直接对应您的primary interest中的'statistical computing (numerical methods, algorithm)'。您武器库中'nonparametric statistics'和'high-dimensional asymptotics'两项very_familiar工具可直接用于分析其诊断指标的渐近性质(如directed coverage的收敛速度),而'moderately_familiar'的M-estimation theory可用于检验其净收益准则的稳健性。中期可做:需先在'moderately_familiar'的semiparametric theory上长肌肉,以将本文的几何化准则推广到非可分离协方差结构。

4. 2607.06690 — tsbootstrap: Distribution-Free Uncertainty Quantification and Conformal Prediction for Time Series

  • 作者: Sankalp Gilda
  • 分类: stat.ME · cs.AI · cs.MS · q-fin.ST · stat.AP
  • 相关性 4/10 · novelty: application
  • 摘要: 该论文介绍 tsbootstrap 软件包,为时间序列数据提供分布自由的不确定性量化与共形预测方法。针对金融、传感等应用中时间序列破坏独立同分布可交换性假设的问题,该包实现了块、残差、筛子、野自助等重抽样方法,以及 EnbPI、ACI、NexCP、AgACI 等自适应共形校准器,通过统一的类型化 API 进行选择。在受控覆盖研究中,独立同分布自助法在依赖数据下严重欠覆盖,而依赖感知方法可缩小覆盖缺陷,其中筛子自助法在短记忆线性依赖下最接近名义覆盖。在共享固定统计量路径上,编译后端比 arch 包快数倍;流式 reduce 避免实例化 O(Bn) 的复制张量,将统计量数组的峰值额外内存限制在 O(B)。该软件为 MIT 许可(v0.6.1)。对您而言,该包直接服务于统计计算兴趣,其流式 reduce 与张量内存优化思路可迁移至您熟悉的更高阶 U-统计量计算(树宽/张量收缩)中,降低大 B 下的内存开销。
  • 关键技术: block bootstrap, sieve bootstrap, adaptive conformal prediction, streaming reduce, compiled backend, EnbPI
  • 为什么对您有用: 直接命中统计计算兴趣:该包实现了时间序列共形预测与自助法的统一计算框架,其流式 reduce 避免 O(Bn) 张量物化的设计,与您非常熟悉的更高阶 U-统计量计算(树宽/张量收缩)中的内存优化问题直接对应。武器库中 very_familiar 的软件开发和 high-dimensional asymptotics 可立即用于评估其编译后端与流式 reduce 的扩展性,中期可做:若需将类似流式策略推广到更一般的张量收缩场景,需先在 moderately_familiar 的更高阶 U-统计量理论上长肌肉(具体为树宽与收缩顺序的联合优化)。

5. 2607.07680 — Any-Dimensional Learning by Sampling

  • 作者: Eitan Levin, Venkat Chandrasekaran
  • 分类: math.ST · cs.LG · math.PR · stat.TH
  • 相关性 4/10 · novelty: new_theory
  • 摘要: 本文研究机器学习模型在输入维度可变(如不同长度的序列、不同节点数的图)时的泛化与压缩问题。核心设定是:模型在有限大小的输入上训练,能否推广到未见过的更大输入?以及如何对大输入进行采样降维,使模型输出近似不变?作者提出统一框架,利用随机采样映射(包括放回采样、随机分箱、物种采样)来比较不同大小的输入。框架的关键是刻画应用领域中的对称性和实例间关系,以确定哪种采样方式合适。对于关于采样连续的函数类(如矩多项式、图同态密度、置换不变Transformer、图神经网络),给出了显式的泛化误差界和压缩率。方法学上,该工作将统计采样理论与函数逼近结合,为任意维度学习提供了理论保障。对您而言,本文的采样降维思路与您在高阶U统计量计算中通过树宽/张量收缩降低计算复杂度的目标有深层共鸣——两者都涉及在保持统计性质的前提下压缩数据结构,且本文的泛化界分析可迁移至您的einsum复杂度分析。
  • 关键技术: random sampling maps, species sampling, moment polynomials, graph homomorphism densities, permutation-invariant transformers, sketching rates
  • 为什么对您有用: 本文直接连接您的统计计算兴趣,特别是统计-计算权衡下的采样降维问题。您的武器库中高阶U统计量的树宽/张量收缩计算可以攻本文的泛化界:本文的采样映射本质上是一种随机压缩,其泛化误差的紧性可以用U统计量的投影理论来检验——例如,对于矩多项式类,其采样误差的方差结构恰好对应一个高阶U统计量的方差分解,而您的treewidth视角可以给出计算成本与采样精度之间的显式tradeoff。中期可做:需先在moderately_familiar的高阶U统计量理论上长肌肉(特别是U统计量的投影方差分解与图同态密度的联系),然后即可将本文的采样率结果转化为具体的算法复杂度下界。

6. 2607.07680 — Any-Dimensional Learning by Sampling

  • 作者: Eitan Levin, Venkat Chandrasekaran
  • 分类: math.ST · cs.LG · math.PR · stat.TH
  • 相关性 4/10 · novelty: new_theory
  • 摘要: 本文研究如何将定义在不同大小输入(如点云、序列、图)上的机器学习模型,从训练时的小尺寸输入泛化到未见过的更大尺寸输入,以及如何对大输入进行降采样(sketch)以降低评估成本。核心思想是利用随机采样映射(包括有放回采样、随机分箱、物种采样)来比较不同尺寸的输入,并刻画函数类在采样意义下的连续性。作者给出了显式的泛化误差界和降采样率,适用于一大类函数,包括测度上的矩多项式、图的同态密度与计数、置换不变Transformer和图神经网络。该框架统一了多种采样策略,并依据问题实例的对称性和尺寸间关系来指导采样类型的选择。对您而言,本文的随机采样与函数连续性分析思路,可迁移至高维U-统计量的计算复杂度分析(如通过随机采样降低张量收缩的代价),属于统计计算中降采样策略的理论基础,值得关注。
  • 关键技术: random sampling maps, sketching, generalization bounds, moment polynomials, homomorphism densities, permutation-invariant transformers
  • 为什么对您有用: 本文直接关联到您的 primary interest 中的 statistical-computational tradeoff 和 statistical computing。其随机采样框架为理解“如何用较小输入近似大输入”提供了理论保证,这与您武器库中“higher-order U-statistics 的 treewidth/tensor contraction 计算代价”问题高度契合——您可以用本文的泛化界来刻画随机采样对 U-统计量估计精度的影响,属于中期可做:需先在 moderately_familiar 的“theory of higher-order U-statistics”上巩固,再结合本文的采样策略设计新的计算-精度权衡方案。

天体统计 (astrostats, 2 篇)

1. 2607.06604 — Fast Graph-based Higher-Order Clustering Statistics on the GPU

  • 作者: Cristiano G. Sabiu
  • 分类: astro-ph.IM · astro-ph.CO
  • 相关性 7/10 · novelty: application
  • 摘要: 本文是 GRAMSCI 算法的重大更新,用于快速计算嵌入在 ℝⁿ 中任意离散点集的 N 点空间相关函数。核心改进包括:将内层循环从二分搜索的 O(m log m) 替换为归并遍历算法,降至 O(m);实现了奇偶分解的 4 点相关函数,可检验星系分布的宇称破坏;在相同图上内部估计不连通 4pCF 以得到连通 4pCF。主要贡献是 GPU 移植(OpenACC):3pCF、4pCF 及奇偶分解 4pCF 核在单张消费级 GPU 上相比 64 线程 CPU 节点加速 2.6 倍(3pCF)至 9 倍(4pCF),并设计了超出显存的分片方案。在 24 GB 显存卡上测量了 9×10⁹ 条边的 BAO 尺度 3pCF,开销约 20%。代码在 DESI DR1 LRG 样本上验证,与 EZmock 系综对比。对您而言,这是一篇优秀的入门级 astrostatistics 读物,清晰展示了天文数据中高阶相关函数的计算挑战与工程解决方案,且其图数据库 + GPU 加速的思路与您熟悉的 higher-order U-statistics 计算(treewidth / einsum)有潜在连接。
  • 关键技术: kd-tree, graph database, N-point correlation function, GPU (OpenACC), merge-walk algorithm, parity decomposition
  • 为什么对您有用: 本文属于 astrostatistics 的 gateway reading:它清晰阐述了天文数据中高阶相关函数(3pCF、4pCF)的计算问题、数据结构和算法细节,不假设读者有天文学背景。您的武器库中 'higher-order U-statistics 的 treewidth / tensor contraction / einsum 复杂度' 可以直接与本文的图数据库 + 归并遍历算法对比:两者都在处理高阶组合计数的高效计算,但本文的图结构(kd-tree 邻接图)与您的 tensor-network 视角不同,可能启发新的计算策略。值得花时间读全文,因为 (a) 入门友好,(b) 问题本身(N 点相关函数的快速计算)是统计学家能理解的 genuine data-analysis 问题,(c) 数据侧(离散点集、尺度分箱、边缘效应)和模型侧(各向同性假设、奇偶分解)交代清楚。

2. 2607.06939 — Compensator-based inference for signal detection under unknown background: the binned data case

  • 作者: Aritra Banerjee, Sara Algeri
  • 分类: stat.ME · astro-ph.HE · astro-ph.IM · physics.data-an · stat.AP
  • 相关性 6/10 · novelty: application
  • 摘要: 本文研究在未知背景(nuisance component)下进行信号检测的推断问题,将问题建模为混合模型中一个分量被错误指定时的权重推断。作者 Banerjee 和 Algeri 在前期工作中证明,该推断的保守性完全由单一参数——补偿器(compensator)决定,且基于补偿器的推断方法无需估计错误指定分量的密度,从而避免了相关挑战。本文将该方法从 i.i.d. 数据推广到更常见的物理与天文学实验场景:数据为大量 bin 上的泊松计数。核心贡献在于展示了补偿器方法在 binned Poisson 数据下的适用性,并给出了相应的推断程序。模拟和实例分析验证了方法的有效性。对于您而言,这是一篇优秀的入门级天文学统计方法论文,清晰阐述了信号检测中的统计模型(混合模型、错误指定、泊松计数)和推断目标,适合作为了解 astrostatistics 数据结构和分析范式的起点。
  • 关键技术: compensator-based inference, mixture model with misspecified component, Poisson count data, signal detection under unknown background
  • 为什么对您有用: 本文属于 astrostatistics 的 gateway reading:它用清晰的统计语言(混合模型、错误指定、泊松计数)阐述了天文学中信号检测的核心问题,不预设天文学术语,适合作为入门读物。您的武器库中非参数统计和 minimax 界工具足以理解其理论框架,但本文方法本身不直接涉及您熟悉的更高阶 U-统计量或因果推断,属于中期可做方向——需先在 moderately_familiar 的识别理论或 M-估计理论上稍作延伸,才能将补偿器思想迁移到您自己的因果推断或高维设定中。值得花时间读全文以了解 astrostatistics 的数据与模型结构。

流行病学 (epidemiology, 2 篇)

1. 2607.07509 — Adjusting for Outcome Reporting Bias in Meta-analysis: A Multiple Imputation Approach

  • 作者: Cora Burgwinkel, Saverio Fontana, Leonhard Held
  • 分类: stat.ME
  • 相关性 6/10 · novelty: application
  • 摘要: 本文针对元分析中的结果报告偏倚(ORB)问题,提出一种基于多重插补的调整方法。ORB被视为缺失数据问题,即研究结果因统计显著性等选择性报告而缺失,导致汇总效应估计偏倚。方法上,作者在单变量和多变量元分析框架下,通过假设选择性非报告机制(如基于p值或效应大小的缺失概率模型),对缺失结果进行多重插补,然后结合标准元分析模型得到偏倚校正估计。模拟研究表明,调整幅度取决于假设的选择机制和异质性程度,选择越强则调整越大。应用于真实临床数据时,ORB调整后的效应估计系统性地向零偏移,表明未调整的元分析可能夸大治疗效果。多变量方法通过联合建模相关结局,允许跨结局借力,提高了估计效率。本文为元分析中ORB的敏感性分析提供了实用且灵活的工具,对流行病学领域的证据综合有直接价值。
  • 关键技术: multiple imputation, selective non-reporting mechanism, univariate meta-analysis, multivariate meta-analysis, sensitivity analysis
  • 为什么对您有用: 本文直接关联流行病学中的元分析偏倚问题,属于secondary interest中的流行病学应用。研究者可用very_familiar的estimation theory in causal inference中的缺失数据框架(如IPW、多重插补)来审视其选择机制假设的合理性,并考虑是否可将proximal causal inference中的negative control思想用于处理未测量的报告偏倚。中期可做:若想将方法推广到更复杂的异质性结构,需先在moderately_familiar的identification theory in causal inference上加强。

2. 2607.07247 — Comparing Imputation Methods for Clinical Prediction Model Development under Complex Missingness Scenarios: A Simulation Study Using Real-World Cardiac Data

  • 作者: Pakpoom Wongyikul, Noraworn Jirattikanwong, Natthanaphop Isaradech, Wuttipat Kiratipaisarl, Arintaya Phrommintikul, Wachiranun Sirikul, Phichayut Phinyo
  • 分类: stat.ME
  • 相关性 5/10 · novelty: application
  • 摘要: 本文通过模拟研究比较了五种缺失数据处理方法(完整病例分析、MICE、预测均值匹配、missForest、k近邻)在临床预测模型开发中的表现。基于一个完全观测的真实心脏队列(8245例患者),在MAR机制下构造了18种缺失场景,涵盖变量类型、预测因子-结局关系和缺失比例的变化。使用逻辑回归模型(向后逐步变量选择)评估各方法的区分度(AUC)、校准度、平均绝对预测误差、外部验证表现和计算时间。主要发现:当缺失涉及孤立线性或分类变量且缺失率30%-60%时,所有方法均能维持与完整数据模型相当的区分度(中位AUC约0.75);在复杂缺失模式下,多重插补表现出更大的预测不稳定性和过拟合,而k近邻在内部和外部验证中表现最一致且计算时间最短。该研究对您作为流行病学应用方向(secondary interest)的参考价值在于:提供了在真实数据背景下比较缺失数据处理策略的完整模拟框架,但方法学新颖性有限(novelty_flag=application),且未涉及您核心兴趣中的因果推断或半参数理论。
  • 关键技术: multiple imputation by chained equations (MICE), predictive mean matching, missForest, k-nearest neighbours imputation, simulation study under MAR, optimism-corrected AUC
  • 为什么对您有用: 本文属于流行病学应用(secondary interest),提供了在真实心脏队列数据上比较缺失数据处理方法的完整模拟框架。但方法学上属于经典技术的应用比较,未涉及您核心兴趣中的因果推断、半参数效率理论或高维统计。作为流行病学方向的入门级应用论文,可快速了解缺失数据方法在临床预测模型中的实际表现,但武器库中的工具(如非参数统计、M估计理论)在此处无直接攻击点——暂不可做后续方法学拓展。

其他 (other, 7 篇)

1. 2607.07286 — From Statistical to Structural Synergy: A Predictability Framework to Quantify the Effects due to High-Order Mechanisms

  • 作者: Yuri Antonacci, Chiara Bar`a, Laura Sparacino, Daniele Marinazzo, Luca Faes, Sebastiano Stramaglia
  • 分类: stat.ME
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文提出一个基于可预测性的框架,用于区分复杂网络系统中的高阶行为(HOBs,即统计上的协同或冗余依赖)与高阶机制(HOMs,即数据生成过程的结构或动态规则)。核心方法是结构协同(structural synergy),定义为两个源联合预测时超出最佳加性描述的额外预测能力,通过多项式回归比较含交互项的模型与加性模型来估计。模拟表明,即使没有HOMs,HOBs也可能出现;而由非加性机制产生的协同可能在观测到的协同-冗余平衡被冗余主导时隐藏,仅通过结构协同才能检测。应用于气候和皮层脑电数据,发现尽管HOBs以冗余为主,仍存在显著的非加性预测成分。该框架强调HOBs与HOMs可能分离,支持对复杂系统动态的机制知情解释。对您而言,本文涉及高阶交互的统计推断,与您对高阶U统计量和非参数理论的兴趣有概念性关联,但方法学上更偏向复杂系统而非您核心的因果推断或效率理论方向。
  • 关键技术: polynomial regression, interaction terms, predictability-based framework, synergy-redundancy balance
  • 为什么对您有用: 本文讨论高阶交互的统计检测,与您对高阶U统计量的兴趣有概念重叠,但方法学上(多项式回归 vs. U统计量投影)差异较大。武器库中'高阶U统计量的计算(树宽/张量收缩/einsum)'可尝试分析其多项式回归估计量的计算复杂度,但核心问题(区分统计依赖与生成机制)并非您主要方向。暂不可做——核心机器(复杂系统动力学、信息论协同度量)不在武器库中。

2. 2607.06790 — A generalized angular regression model with a circular random intercept and a scalar random slope

  • 作者: Aur\'elien Nicosia
  • 分类: stat.ME
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对聚类圆形响应数据(如重复方向实验、运动生态学中的朝向数据),提出了一种广义角回归的混合效应扩展模型。模型通过二维共识向量的方向定义均值方向,结合 von Mises 圆形随机截距和作用于一个共识向量系数的高斯标量随机斜率。条件于标量斜率,圆形截距可解析积分,得到一维边际似然,避免了通用随机斜率模型所需的高维积分。文章建立了设计条件可识别性条件、远离方差边界的聚类渐近似然理论,并提供了确定性求积、诊断和模型评估的实用框架。模拟研究评估了数值稳定性和有限样本表现,沙蚤重复朝向数据应用展示了方差分量推断的实际考量。
  • 关键技术: von Mises distribution, mixed-effects model, circular regression, analytical integration, cluster-asymptotic likelihood
  • 为什么对您有用: 本文属于统计方法学,但核心是圆形数据混合模型,与您的主要兴趣(因果推断、高维统计、U-统计量等)无直接交集。武器库中的非参数统计或M估计理论可辅助理解其渐近理论,但问题本身不涉及您熟悉的因果识别或高维推断框架。暂不可做:核心机器(圆形数据建模、von Mises 混合效应)不在武器库中,且与您的统计计算-计算折衷方向无关。

3. 2607.07159 — Recovering Latent Structures after Variational Bayesian Variable Selection: Fit Assessment and Factor-Number Selection in Partially Exploratory Factor Analysis

  • 作者: Jinsong Chen, Yi Jin
  • 分类: stat.ME · cs.CL
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对部分探索性因子分析(PEFA)中载荷结构和因子数弱指定的问题,提出了一套后选择评估框架。该方法基于部分验证性因子分析的变分贝叶斯(PCFA VA)正则化近似,通过 spike-and-slab 先验对未指定的载荷进行贝叶斯变量选择,得到包含概率。作者引入硬选择(阈值化概率为稀疏模式)和软选择(保留为权重计算有效参数数)两种方式,将收敛解转化为协方差模型,并推导了相应的自由度、绝对拟合诊断指标(RMSEA、SRMR、CFI、TLI)和相对准则(AIC、BIC、ELBO)。为确定因子数,提出了带持续下降保护的尺度无关增益规则。模拟表明绝对指标能成功跟踪载荷恢复并检测欠因子化,而原始准则会过因子化,所提增益规则能准确恢复真实维度,其中 ELBO 变体最稳健。最后,一个 100 项 PID-5 实例表明该模型拟合优于验证性 25 面模型,并能一致地恢复不同规范下的主要结构。本文属于方法学应用,对您的高维统计或因果推断方向直接帮助有限。
  • 关键技术: variational Bayesian variable selection, spike and slab priors, degrees of freedom adjustment, RMSEA/SRMR/CFI/TLI fit indices, gain rule for factor number selection
  • 为什么对您有用: 本文属于因子分析的方法学应用,与您的主要兴趣(因果推断、高维统计、U-统计量)无直接交集。武器库中的非参数统计或高维渐近工具难以直接迁移至因子分析的后选择推断问题。暂不可做,核心机器(变分贝叶斯、因子分析模型选择)不在武器库中。

4. 2607.06714 — Expectation-Maximization algorithm to estimate the forcing parameter of a nonlinear McKean-Vlasov diffusion

  • 作者: Eduardo Gutierrez-Turner, Kerlyns Martinez, Hector Olivero
  • 分类: math.ST · stat.TH
  • 相关性 4/10 · novelty: application
  • 摘要: 本文研究非线性McKean-Vlasov型随机微分方程中一个forcing参数的估计问题,该方程源自湍流动能瞬时模型,漂移项依赖于解的期望的幂次,引入代数非线性。作者提出基于期望最大化(EM)框架的估计算法,并证明了估计量的一致性。通过数值实验验证了方法的有限样本表现。该工作属于随机微分方程参数估计的经典设定,但非线性McKean-Vlasov结构带来额外挑战。EM算法在此处的应用是标准技术,理论贡献主要在于一致性证明。对您而言,该论文与您的主要兴趣(因果推断、高维统计、U统计量等)无直接交集,且方法学新颖性有限,属于应用导向的SDE参数估计工作。
  • 关键技术: Expectation-Maximization algorithm, McKean-Vlasov diffusion, stochastic differential equation, consistency proof
  • 为什么对您有用: 该论文与您的主要兴趣方向(因果推断、高维统计、U统计量、半参数理论等)无直接关联。McKean-Vlasov扩散的参数估计问题虽涉及非线性期望结构,但所用EM算法和一致性证明均为标准工具,不涉及您武器库中的核心方法(如minimax界、高阶U统计量、张量收缩等)。暂不可做——核心机器不在武器库里,且问题本身与您的统计计算-计算复杂度兴趣方向(信息-计算差距、低度多项式障碍等)也无交集。

5. 2607.07174 — Stochastic Inversion of Multivariate Uniform-Distribution-Preserving Transformations

  • 作者: Alexander J. McNeil, Johanna G. Ne\v{s}lehov\'a
  • 分类: math.ST · stat.TH
  • 相关性 4/10 · novelty: new_theory
  • 摘要: 本文研究多元单位立方体上保持均匀分布(UDP)的变换的随机逆变换。这类变换的每个分量是分段连续可微且保持均匀分布的,但整体可能非单射。作者引入随机化机制来定义逆变换,克服了非单射性带来的识别问题。该随机逆变换保留了服从某 copula 的随机向量的均匀边缘分布,但不同的随机化会导出不同的 copula。文章证明了多元随机逆变换的 copula 密度变换公式,并在二元情形下进行了数值说明。该工作属于 copula 理论与变换方法的交叉,与您的主要兴趣(因果推断、高维统计、U-统计量)无直接关联,但其中关于保持分布变换的逆问题思路可能对您在高维统计中处理非单射映射的逆问题有间接启发。
  • 关键技术: uniform distribution preserving transformation, stochastic inversion, copula density transformation, randomization
  • 为什么对您有用: 本文属于 copula 理论与变换方法的纯理论工作,与您的主要兴趣方向(因果推断、高维统计、U-统计量)无直接关联。武器库中无直接可攻工具,暂不可做。

6. 2607.06714 — Expectation-Maximization algorithm to estimate the forcing parameter of a nonlinear McKean-Vlasov diffusion

  • 作者: Eduardo Gutierrez-Turner, Kerlyns Martinez, Hector Olivero
  • 分类: math.ST · stat.TH
  • 相关性 4/10 · novelty: application
  • 摘要: 本文研究非线性McKean-Vlasov型随机微分方程中一个forcing参数的估计问题,该方程来源于湍流动能瞬时模型,漂移项依赖于解的期望的幂次,引入了代数非线性。作者提出基于期望最大化(EM)框架的估计算法,并证明了估计量的一致性。数值实验验证了方法的有限样本表现。该问题属于随机微分方程参数估计的经典设定,但非线性McKean-Vlasov类型在统计文献中相对少见。方法层面未涉及您核心兴趣中的因果推断、高维统计或半参效率理论。对您而言,该论文与主要研究方向(因果推断、高维统计、U-统计量等)无直接技术交集,且未提供可迁移的新方法论工具。
  • 关键技术: Expectation-Maximization algorithm, McKean-Vlasov diffusion, stochastic differential equation, consistency proof
  • 为什么对您有用: 本文主题为非线性随机微分方程的参数估计,与您的主要兴趣(因果推断、高维统计、半参理论)无直接关联。技术工具(EM算法、SDE理论)不在您的技术武器库核心范围内。该论文更适合作为随机过程领域的专门阅读,而非您当前研究方向的直接输入。暂不可做:核心机器(SDE参数估计、McKean-Vlasov理论)不在武器库中。

7. 2607.07174 — Stochastic Inversion of Multivariate Uniform-Distribution-Preserving Transformations

  • 作者: Alexander J. McNeil, Johanna G. Ne\v{s}lehov\'a
  • 分类: math.ST · stat.TH
  • 相关性 4/10 · novelty: new_theory
  • 摘要: 本文研究多元单位立方体上保持均匀分布(udp)的分段连续可微变换的随机逆变换。由于udp变换非单射,作者引入随机化来定义逆变换,该逆变换保持服从某copula的随机向量的均匀边缘分布,且不同随机化产生不同copula。主要理论贡献是证明了多元随机逆变换的copula密度变换公式,并在二元情形下进行了数值演示。该工作属于copula理论与变换方法的交叉,与您的主要兴趣(因果推断、高维统计、U统计量等)无直接技术关联。若您对copula建模在因果推断或纵向数据中的应用感兴趣,本文的变换框架可能提供一种构造灵活依赖结构的工具,但当前版本更偏向纯概率构造。
  • 关键技术: uniform distribution preserving transformation, stochastic inversion, copula density transformation, randomization
  • 为什么对您有用: 本文属于纯概率/统计理论,与您的主要兴趣方向(因果推断、高维统计、U统计量、半参效率理论等)无直接交集。作为gateway阅读,它不涉及您武器库中的任何具体工具(如minimax界、U统计量树宽、因果识别等),且未提供可直接迁移的方法论。暂不可做——核心机器(copula变换的随机逆)不在您的武器库中,且当前版本缺乏与您研究问题的明显连接。

🗂 其他论文(仅 LLM 评分,未生成摘要)

未生成中文摘要的论文,按 LLM 评分由高到低排列,仅保留评分与简评,便于回溯查全。一般为相关性低于展示阈值者;个别历史页也含当时因单日摘要上限未展开的高分篇目(评分仍清楚标着)。

1. 2607.06722 — Modality Analysis via Spacing with the Dimodal Software Libraries

  • 作者: Greg Kreider
  • 分类: stat.ME · astro-ph.EP · astro-ph.IM
  • 相关性 3/10
  • 评分理由: Modality detection software with astro applications; weak secondary match, no clear stats methodology transfer.

2. 2607.07215 — Robust Indicators of Spatial Association

  • 作者: Levi John Wolf, Wei Kang
  • 分类: stat.ME
  • 相关性 3/10
  • 评分理由: Spatial autocorrelation statistics are a specialized subfield of statistics with no clear connection to the researcher's primary interests in causal inference, high-dimensional theory, or U-statistics.

3. 2607.07543 — Equivalence testing in pesticide risk assessment -- Evaluation and practical guidance for design, analysis and interpretation

  • 作者: Dimitry Wintermantel, Julia Osterman, Magdalena M. Mair, Florian Hartig
  • 分类: stat.ME · q-bio.PE · q-bio.QM
  • 相关性 3/10
  • 评分理由: Equivalence testing in pesticide risk assessment is an applied statistics topic with no clear connection to the researcher's primary interests in causal inference or high-dimensional theory.

4. 2607.06674 — Efficient Optimal Image Reconstruction for the Nancy Grace Roman Space Telescope and Beyond: I. First Results with {\sc Effortless}

  • 作者: Kaili Cao
  • 分类: astro-ph.IM · astro-ph.CO
  • 相关性 3/10
  • 评分理由: 天文图像重建算法,涉及优化和计算效率,但属纯天文仪器方法,与研究者兴趣无直接关联。

5. 2607.07284 — Visualizing and forecasting subnational life-table death counts: Gap forecasting methods

  • 作者: Han Lin Shang, Andrea Nigri
  • 分类: stat.ME · stat.AP
  • 相关性 2/10
  • 评分理由: Forecasting subnational life-table death counts is a demographic application with standard time-series methods, unrelated to the researcher's primary interests.

6. 2607.07464 — Infinite hidden Markov models for cylindrical data

  • 作者: Federico P. Cortese, Luca Rossini
  • 分类: stat.ME · stat.AP
  • 相关性 2/10
  • 评分理由: Infinite hidden Markov models for cylindrical time series are a niche Bayesian modeling topic with no overlap with the researcher's primary interests.

7. 2607.06809 — "Perfect" spectra for ESO's HARPS spectrograph

  • 作者: Dinko Milakovi\'c, Guido Cupani, Bruce A. Bassett, Stefano Cristiani, Luca Pasquini
  • 分类: astro-ph.IM · astro-ph.EP
  • 相关性 2/10
  • 评分理由: 光谱重建的校准方法,技术性强但纯天文仪器,无统计或因果推断内容。

8. 2607.07263 — Machine learning pipeline for identifying tracks of muons and hadrons at GRAPES-3 muon telescope

  • 作者: Mansi Talwar, Sambit Sarkar, Pravata K. Mohanty
  • 分类: astro-ph.IM · astro-ph.HE · hep-ex
  • 相关性 2/10
  • 评分理由: 机器学习用于粒子识别,属高能物理应用,与研究者统计兴趣无直接关联。

9. 2607.07265 — The Deep Learning Cosmic Ray Energy Reconstruction Pipeline for the GRAPES-3 Experiment

  • 作者: Sambit Sarkar, Mansi Talwar, Pravata K. Mohanty
  • 分类: astro-ph.IM · astro-ph.HE · hep-ex
  • 相关性 2/10
  • 评分理由: 深度学习用于宇宙线能量重建,属高能物理应用,与研究者统计兴趣无直接关联。

10. 2607.06992 — A Study on Cumulative Residual Extropy of Linear Consecutive k-out-of-n:G Systems

  • 作者: Aman Pandey, Chanchal Kundu
  • 分类: math.ST · stat.TH
  • 相关性 1/10
  • 评分理由: Unrelated to primary or secondary interests; focuses on reliability theory and extropy measures.

11. 2607.06992 — A Study on Cumulative Residual Extropy of Linear Consecutive k-out-of-n:G Systems

  • 作者: Aman Pandey, Chanchal Kundu
  • 分类: math.ST · stat.TH
  • 相关性 1/10
  • 评分理由: Unrelated to primary or secondary interests; focuses on reliability theory and extropy measures.

12. 2607.07182 — A search for narrowband technosignatures from LTT 3780 with the Allen Telescope Array and the Karl G. Jansky Very Large Array

  • 作者: Chenoa D. Tremblay, Sofia Z. Sheikh, Vishal Gajjar, Nikku Madhusudhan, Isabel Gerrard, Daniel Czech, Talon Myburgh, David E. MacMahon, Ross A. Donnachie, Andrew P. V. Siemion, Matthew Lebofsky, Alex W. Pollak
  • 分类: astro-ph.IM
  • 相关性 1/10
  • 评分理由: SETI窄带技术信号搜索,纯天文观测,无统计方法或数据建模内容。

13. 2607.07413 — SETI's blind spot: Technological Acceleration and fleeting technosignatures

  • 作者: Michael A. Garrett
  • 分类: astro-ph.IM
  • 相关性 1/10
  • 评分理由: SETI理论模型,讨论技术信号持续时间,无统计方法或数据建模内容。

14. 2607.06650 — HDRL Staff Strategy Meeting Report

  • 作者: Brian Thomas, Robert Candey, Jack Ireland, Lan Jian, Rebecca Ringuette, Tressa Helvey-Kalsulke
  • 分类: astro-ph.IM · astro-ph.SR · cs.DL
  • 相关性 0/10
  • 评分理由: 会议报告,无统计方法或数据建模内容,完全无关。

15. 2607.06660 — A comparison of numerical schemes for driven subsonic MHD turbulence

  • 作者: R\"udiger Pakmor, Thomas Guillet, Rebekka Bieri, Christoph Pfrommer, Volker Springel, Romain Teyssier
  • 分类: astro-ph.IM
  • 相关性 0/10
  • 评分理由: 天体物理MHD湍流数值方案比较,无统计方法或数据建模内容,完全无关。

16. 2607.07592 — Decolonizing technosignatures: Reimagining technosignatures through an Indigenist lens

  • 作者: Hilding R. Neilson
  • 分类: astro-ph.IM
  • 相关性 0/10
  • 评分理由: Unrelated to any primary or secondary interest; philosophical essay on technosignatures, not statistics or data analysis.

Maintained by 陈星宇 · Homepage · Source on GitHub

评论