Biometrika — Vol 109 Issue 1 · 2026-07-06¶
- 共 18 篇 · Biometrika
- 目录核对 ✅ 18 篇全部抓到(对照 OpenAlex 20 篇)
本期导览¶
自动生成:归纳本期主要主题与脉络,不打分、不排名。
这一期《Biometrika》第109卷第1期共18篇论文,整体围绕因果识别与推断、假设检验与选择后推断、高维与分布式推断、以及非参数/半参数方法四条主线展开。因果推断方向集中探讨了动态治疗策略下的有效调整集、多原因二元结局的可识别性、缺失数据机制的测度论基础、协变量自适应随机化下的ATE推断,以及异质性分布式推断中的效率问题。假设检验方向则涵盖了基于点间排序的独立性检验、发散维数下的条件矩检验、稀疏信号的选择后置信区间、以及FCR调整区间的改进。高维与分布式推断涉及误设定GLM的模型选择、极值指数的分布式推断,以及网络数据的协变量降维。非参数/半参数方向包括计数过程的形状与大小指数、广义结构模型的backfitting检验、函数型线性判别分析,以及治愈比例的非参数估计。此外,还有序贯蒙特卡洛重采样优化和基因组变异发现的贝叶斯非参数方法。
在因果识别与推断主线中,最突出的工作是动态治疗策略下最优最小调整集的证明,该文将静态干预下的经典调整集概念推广至动态策略,并给出了非参数估计量渐近方差最小的理论保证。另一篇关于多原因二元结局可识别性的工作,利用处理与潜变量的高斯性与结局潜变量的非高斯性之间的不匹配,证明了在logit或cloglog链接下因果效应可识别,并提出了两步似然估计法。缺失数据机制方面,从随机过程视角重新审视MAR假设,将其等价于特定可测性条件,为proximal CI和纵向因果推断提供了严格的测度论基础。协变量自适应随机化下的ATE推断则提出了无模型估计量,适用于最小化法等主流方案,且渐近分布与随机化方法无关。
假设检验与选择后推断主线中,基于点间排序的符号协方差推广了经典符号协方差至多元及一般随机对象,其U-统计量结构保证了检验的一致性。发散维数下的ICM检验通过投影自适应模型维持了尺度正确性,并验证了wild bootstrap在发散维数下的有效性。稀疏信号的选择后推断方面,非参数经验贝叶斯方法在保持精确频率覆盖的同时最小化了平均区间长度,而FCR调整区间的改进则通过纳入选择事件信息来缩小区间,两者均直接关联高维统计中的多重检验问题。
高维与分布式推断主线中,误设定GLM的模型选择通过引入KL散度先验概率,提出了高维广义BIC准则,显式刻画了模型误设定和高维性的影响。极值指数的分布式推断则针对Hill估计量的非线性与尾部稀疏性,给出了oracle性质成立的充分条件。网络数据的协变量降维方法通过最小化基于连接概率与投影距离单调关系的损失函数,实现了不假设模型下的监督降维。
非参数/半参数主线中,计数过程的形状与大小指数模型通过两步秩估计实现了根号n收敛的渐近正态推断,并构建了独立性检验程序。广义结构模型的backfitting检验结合了smooth backfitting与bootstrap,适用于模型规范检验和变量选择。函数型线性判别分析通过L1型惩罚诱导函数稀疏性,实现了判别函数在定义域上的连续零区域识别。
与因果推断方向最贴的论文包括:动态治疗策略下的最优调整集、多原因二元结局的可识别性、缺失数据机制的随机过程视角、协变量自适应随机化下的ATE推断,以及异质性分布式推断。与半参数效率方向相关的有:计数过程的形状与大小指数模型、广义结构模型的backfitting检验。与高维方向相关的有:误设定GLM的模型选择、极值指数的分布式推断、稀疏信号的选择后推断、FCR调整区间的改进,以及发散维数下的ICM检验。
因果推断 (causal_inference, 5 篇)¶
1. 10.1093/biomet/asab018 · arXiv — Efficient adjustment sets in causal graphical models with hidden variables¶
- 作者: E Smucler, F Sapienza, A Rotnitzky
- 期刊/来源: Biometrika
- 分类: vol 109 · issue 1 · pp 49-65
- 相关性 8/10 · novelty:
new_method - 摘要: 本文在非参数因果图模型(允许隐变量)中研究动态治疗策略(treatment regime)下干预均值的估计问题。目标 estimand 是动态干预均值,即根据协变量决定治疗规则时的总体均值。作者首先给出了动态治疗策略下有效调整集(valid adjustment set)的定义,推广了静态干预下的经典定义。核心贡献是证明了存在一类“最优最小调整集”(optimal minimal adjustment set),在基于可观测变量的最小调整集中,该调整集能使非参数估计量的渐近方差最小。此外,对于“最小基数调整集”(minimum adjustment set),也给出了类似的最优性结果。当无隐变量或所有可观测变量均为治疗、结局或决策变量的祖先时,存在全局最优调整集。文章提供了多项式时间算法来计算这些最优调整集。由于静态干预是动态策略的特例,所有结果也适用于静态干预。该工作直接连接您的因果推断兴趣,特别是调整变量选择与效率理论,且算法部分与您的统计计算兴趣相关。
- 关键技术:
causal graphical models,adjustment sets,dynamic treatment regime,semiparametric efficiency,polynomial-time algorithms - 为什么对您有用: 直接连接您的 primary interest 中的因果推断(调整变量选择与效率)和效率理论(渐近方差最小化)。您的 very_familiar 武器库中的非参数统计和因果推断估计理论可直接用于理解其最优性证明;moderately_familiar 中的半参数理论可用于验证其效率界。中期可做:将最优调整集思想与您的 HOIF 工具结合,探索高阶调整集下的效率增益。
2. 10.1093/biomet/asab016 · arXiv — Identifiability of causal effects with multiple causes and a binary outcome¶
- 作者: Dehan Kong, Shu Yang, Linbo Wang
- 期刊/来源: Biometrika
- 机构: University of Toronto
- 分类: vol 109 · issue 1 · pp 265-272
- 相关性 7/10 · novelty:
new_theory - 摘要: 本文研究在共享混杂(shared confounding)设定下,多个处理变量条件独立于一个共同潜变量时的因果效应可识别性问题。目标 estimand 是处理对二元结局的平均因果效应(ATE),结局由一般二元选择模型(非 probit 链接)生成。已有文献表明,在处理服从线性高斯模型时,若无结局参数假设,因果效应不可识别。本文证明,当结局采用非 probit 的二元选择模型(如 logit 或 cloglog)时,因果效应是可识别的。识别策略利用处理与潜变量的高斯性与结局潜变量的非高斯性之间的不匹配(incongruence)。估计方面,作者提出两步似然估计法:第一步估计处理模型参数,第二步基于伪似然估计结局模型参数。理论结果包括估计量的相合性和渐近正态性。对您而言,本文在因果推断的 identification 理论中提供了一个精巧的负向结果反转案例,且其识别策略(利用分布不匹配)可能对您关注的 proximal causal inference 中的 negative control 设定有启发。
- 关键技术:
shared confounding,binary choice model,non-probit link,incongruence between Gaussian and non-Gaussian,two-step likelihood estimation - 为什么对您有用: 本文直接关联 primary interest 中的因果推断 identification 理论,特别是共享混杂设定下的可识别性边界问题。您的 technical arsenal 中 'identification theory in causal inference'(moderately_familiar)可直接用于理解其识别策略,而 'nonparametric statistics'(very_familiar)可用于评估其两步估计法的稳健性。中期可做:若想将本文的识别思路推广到更一般的结局模型(如多分类或连续结局),需先在 'semiparametric theory'(moderately_familiar)上提升,以处理非参数链接函数下的识别条件。
3. 10.1093/biomet/asab002 · arXiv — Missing at random: a stochastic process perspective¶
- 作者: D M Farewell, R M Daniel, S R Seaman
- 期刊/来源: Biometrika
- 分类: vol 109 · issue 1 · pp 227-241
- 相关性 7/10 · novelty:
new_theory - 摘要: 本文在标准缺失数据框架下,从随机过程视角重新审视缺失完全随机(MAR)假设。作者将观测数据刻画为停时集σ-代数,并证明通常的MAR条件等价于要求特定随机过程适应于一个集索引的滤子。这一可测性条件保证了似然比的标准分解。理论可自然扩展至含协变量、连续时间纵向数据以及更一般的粗化观测情形。对您而言,该工作为MAR假设提供了严格的测度论基础,有助于在proximal CI和纵向因果推断中更精确地处理缺失机制,且其随机过程视角与您熟悉的非参数统计和高维渐近理论有潜在交叉。
- 关键技术:
stopping-set sigma algebra,set-indexed filtration,coarsening at random,likelihood ratio factorization - 为什么对您有用: 本文直接关联您的primary interest中的因果推断(缺失数据处理)和纵向数据设定。您可以用very_familiar的非参数统计和逆问题工具来审视其可测性条件在proximal CI中的应用,例如将停时集σ-代数与negative control假设结合。中期可做:需先在moderately_familiar的identification theory上长肌肉,以将本文的随机过程框架转化为具体的识别条件。
4. 10.1093/biomet/asab015 · arXiv — Inference on the average treatment effect under minimization and other covariate-adaptive randomization methods¶
- 作者: Ting Ye, Yanyao Yi, Jun Shao
- 期刊/来源: Biometrika
- 分类: vol 109 · issue 1 · pp 33-47
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究在协变量自适应随机化(如最小化法、分层区组随机化)临床试验中,平均处理效应(ATE)的推断问题。现有理论大多依赖正确的响应-协变量模型或对随机化方法的深刻理解,本文提出若干无模型(model-free)ATE估计量,基于随机化所用协变量分层并进一步调整未用于随机化的协变量。估计量在包括最小化法在内的所有主流协变量自适应随机化方案下均具有渐近正态性,且渐近分布与随机化方法无关。构造了一致方差估计量用于渐近推断,并比较了渐近相对效率与有限样本性质。推荐使用所提估计量之一进行有效且无模型的推断。对您而言,该工作直接连接因果推断中ATE的识别与推断,尤其适用于临床试验等纵向设定,且其无模型性质与您熟悉的非参数统计和估计理论高度契合。
- 关键技术:
covariate-adaptive randomization,minimization,stratified permuted blocks,model-free estimation,asymptotic normality,variance estimation - 为什么对您有用: 本文直接连接您的主要兴趣——因果推断中的ATE估计与推断,特别在临床试验的纵向设定下。您非常熟悉的非参数统计和估计理论可直接用于理解其无模型估计量的渐近性质,且其方差估计方法可迁移至您关注的proximal CI或IV设定中的推断问题。中期可做:将本文的渐近理论推广至更复杂的因果结构(如mediation),需先在identification theory上长肌肉。
5. 10.1093/biomet/asab007 · arXiv — Heterogeneity-aware and communication-efficient distributed statistical inference¶
- 作者: Rui Duan, Yang Ning, Yong Chen
- 期刊/来源: Biometrika
- 机构: Harvard University · Cornell University · University of Pennsylvania
- 分类: vol 109 · issue 1 · pp 67-83
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对多中心研究中数据分布异质性(不同站点数据来自不同子总体或环境)下的分布式统计推断问题,提出了一种异质性感知的通信高效算法。现有分布式算法(如 surrogate likelihood 方法)通常假设数据同分布,忽略异质性会导致推断错误。作者通过引入密度比倾斜(density ratio tilting)技术,将高效评分函数(efficient score function)适配到异质设定,允许各站点拥有自己的 nuisance 参数。算法保持了与现有通信高效算法相同的通信成本(仅需共享聚合信息)。理论上建立了非渐近风险界,并在双索引渐近框架(站点内样本量和站点数同时趋于无穷)下推导了估计量的极限分布。当站点数增长速率慢于每站点样本量时,估计量的渐近方差达到 Cramér–Rao 下界。该方法可视为对分布式因果推断(如异质人群中的 ATE 估计)的直接扩展,其中 nuisance 参数(如倾向得分)可随站点变化。
- 关键技术:
density ratio tilting,efficient score function,surrogate likelihood,two-index asymptotics,distributed statistical inference,heterogeneous data - 为什么对您有用: 本文直接关联 primary interest 中的因果推断(异质人群的分布式估计)和效率理论(Cramér–Rao 下界)。技术武器库中 'estimation theory in causal inference' 和 'semiparametric theory' 可直接用于理解其 efficient score 构造和双索引渐近框架。中期可做:将 density ratio tilting 与 proximal causal inference 中的 negative control 结合,处理未观测混杂下的异质分布式推断——这需要先在 moderately_familiar 的 'identification theory in causal inference' 上长肌肉。
高维统计 / 随机矩阵 (high_dim_rmt, 1 篇)¶
1. 10.1093/biomet/asab005 — Large-scale model selection in misspecified generalized linear models¶
- 作者: Emre Demirkaya, Yang Feng, Pallavi Basu, Jinchi Lv
- 期刊/来源: Biometrika
- 机构: University of Tennessee at Knoxville · New York University · Indian School of Business · University of Southern California
- 分类: vol 109 · issue 1 · pp 123-136
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究高维误设定广义线性模型(misspecified GLM)下的大规模模型选择问题。目标是在候选模型集合中选出最优解释性模型,同时允许模型可能误设定且维度随样本量增长。作者基于Lv & Liu (2014)的框架,推导了后验模型概率的渐近展开,并引入KL散度来构造先验概率,从而提出高维广义贝叶斯信息准则(high-dimensional generalized BIC with prior probability)。新准则显式刻画了模型误设定和高维性对模型选择的影响。在超高维(ultrahigh dimensions)和温和正则条件下,建立了协方差对比矩阵估计的一致性以及模型选择的一致性。数值实验表明,该方法在模型选择一致性上优于主要竞争对手(如传统BIC、EBIC等)。对您而言,本文在高维统计与模型选择交叉点上提供了误设定下的理论一致性结果,其协方差对比矩阵估计技术可能与您的随机矩阵理论工具(如Marchenko-Pastur律)产生联系,值得关注。
- 关键技术:
high-dimensional generalized BIC,Kullback-Leibler divergence prior,covariance contrast matrix estimation,model selection consistency,ultrahigh dimensionality - 为什么对您有用: 本文连接您的高维统计兴趣(高维误设定GLM的模型选择),且其协方差对比矩阵估计的一致性证明可能用到随机矩阵理论(RMT)工具,这是您very_familiar的武器库。中期可做:若想深入分析该准则在更一般误设定结构下的有限样本表现,需先在moderately_familiar的M-estimation理论上加强。
非参数 / 半参数 (nonparam_semipara, 3 篇)¶
1. 10.1093/biomet/asab008 — Statistical inference on shape and size indexes for counting processes¶
- 作者: Yifei Sun, Sy Han Chiou, Kieren A Marr, Chiung-Yu Huang
- 期刊/来源: Biometrika
- 机构: Columbia University · The University of Texas at Dallas · Johns Hopkins University · Johns Hopkins Medicine · University of California, San Francisco
- 分类: vol 109 · issue 1 · pp 195-208
- 相关性 6/10 · novelty:
new_method - 摘要: 针对复发事件计数过程的强度函数,提出一个半参数单指标模型框架,将强度分解为 size(大小)和 shape(形状)两个分量,各自用单指标模型刻画,并施加单调性约束以保证协变量效应的方向可解释性。该模型涵盖了许多常用模型作为特例。为解决两个链接函数未知带来的分析困难,开发了两步秩估计程序,可在存在信息删失时估计回归参数。估计量是渐近正态的,收敛速度为根号 n。还构建了检验 size 和 shape 独立性的假设检验程序,用于模型选择。通过模拟和造血干细胞移植数据示例验证了方法。对您而言,该文在非参数/半参数框架下处理计数过程,其两步秩估计和渐近理论(根号 n 收敛)与您的非参数统计和 M-估计理论兴趣直接相关,且检验程序可联系到您的假设检验方向。
- 关键技术:
single-index model,rank-based estimation,counting process,monotone constraint,informative censoring,hypothesis testing for independence - 为什么对您有用: 该文直接关联您的非参数/半参数理论兴趣,特别是单指标模型和计数过程的半参数推断。您武器库中的非参数统计和 M-估计理论可用来分析其两步秩估计的渐近性质,例如验证根号 n 收敛率是否紧。中期可做:若您先熟悉 moderately_familiar 中的半参数理论(如 influence function 推导),可进一步探索该估计的效率界。
2. 10.1093/biomet/asaa108 — Backfitting tests in generalized structured models¶
- 作者: E Mammen, S Sperlich
- 期刊/来源: Biometrika
- 机构: Heidelberg University · University of Geneva
- 分类: vol 109 · issue 1 · pp 137-152
- 相关性 6/10 · novelty:
new_method - 摘要: 本文针对半参数广义结构模型(如广义可加模型、部分线性模型等)提出了一类基于bootstrap的检验方法。检验问题涵盖模型规范检验(如可分离性、函数形式、效应同质性)以及变量选择,其中原假设和备择假设均为非参数或半参数设定。所有估计量均通过smooth backfitting获得,这是一种基于核的迭代拟合方法,适用于高维协变量且无需显式逆矩阵运算。检验统计量构造为半参数与非参数估计量之间的某种距离或偏差度量,其零分布通过bootstrap逼近。模拟研究表明该方法在有限样本下具有良好的水平和功效表现。对您而言,本文展示了如何将backfitting与bootstrap结合用于半参数模型的假设检验,这与您对非参数/半参数理论及假设检验的兴趣直接相关,且其技术思路(如用smooth backfitting替代传统剖面似然)可能为您的M估计或U统计量工作提供新的检验构造视角。
- 关键技术:
smooth backfitting,bootstrap test,generalized structured models,semiparametric specification testing,nonparametric comparison - 为什么对您有用: 本文直接关联您的primary interest中的非参数/半参数理论与假设检验,具体子方向为半参数模型规范检验。您的技术武器库中'nonparametric statistics'和'M-estimation theory'(moderately_familiar)可直接用于理解其backfitting估计量的渐近性质,并可能将检验思想推广到您熟悉的higher-order U-statistics设定中。中期可做:若您想将此类检验扩展到高维或U统计量框架,需先在'semiparametric theory'上加强(moderately_familiar),以处理更复杂的半参数结构。
3. 10.1093/biomet/asaa107 · arXiv — Sparse functional linear discriminant analysis¶
- 作者: Juhyun Park, Jeongyoun Ahn, Yongho Jeon
- 期刊/来源: Biometrika
- 机构: Université Paris-Saclay · École Nationale Supérieure d’Informatique pour l’Industrie et l’Entreprise · University of Georgia · Yonsei University
- 分类: vol 109 · issue 1 · pp 209-226
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究函数型线性判别分析(FLDA)中的稀疏性问题,目标是在函数型数据分类中同时实现可解释性与良好性能。现有方法主要关注维度约简,但缺乏对判别函数在定义域上零子区域的识别能力。作者将FLDA重新表述为正则化问题,引入L1型惩罚∫|f|以诱导函数稀疏性,即判别函数在定义域上产生连续零区域。理论贡献包括:正则化解的存在性证明、零区域的存在性、以及在高斯数据下误分类概率收敛到贝叶斯误差的渐近性质。该方法不假设真实函数具有稀疏性,但能一致估计真实函数,无论其是否稀疏。模拟和真实数据实验表明,该方法在有限样本下优于现有方法。对您而言,本文的L1型函数稀疏化思路可迁移至高维统计中的函数型数据推断问题,其正则化框架与您熟悉的非参数统计和M估计理论有直接联系。
- 关键技术:
functional linear discriminant analysis,L1-type penalty,functional sparsity,domain selection,regularization - 为什么对您有用: 本文属于非参数/半参数理论方向,直接连接您对非参数统计和M估计理论的熟悉领域。其L1型函数稀疏化方法可视为您武器库中'非参数统计'和'高维渐近理论'的一个具体应用场景——您可以用minimax界分析该方法的收敛速率是否最优,或用U-统计量投影技术处理函数型数据中的高阶依赖。中期可做:若您先熟悉'半参数理论'中的影响函数工具,可进一步推导该方法的半参数效率界。
数理统计 / 假设检验 (hypothesis_testing, 5 篇)¶
1. 10.1093/biomet/asab011 — Interpoint-ranking sign covariance for the test of independence¶
- 作者: Haeun Moon, Kehui Chen
- 期刊/来源: Biometrika
- 机构: University of Pittsburgh
- 分类: vol 109 · issue 1 · pp 165-179
- 相关性 8/10 · novelty:
new_method - 摘要: 本文推广了 Bergsma & Dassios (2014) 的符号协方差到多元随机变量及更一般的随机对象,提出了基于点间排序的符号协方差(interpoint-ranking sign covariance)。该方法仅需定义有意义的相似性度量,即可适用于任意类型的随机对象,且证明了该统计量为零当且仅当两个随机变量独立。检验统计量是 U-统计量,其大样本性质保证了检验对一般类型备择假设的一致性。数值实验和数据分析展示了该方法优越的经验表现。该工作直接连接了您对 U-统计量理论和假设检验的兴趣,且其基于排序的构造为高维或复杂数据结构的独立性检验提供了新工具。
- 关键技术:
U-statistic,sign covariance,interpoint-ranking,independence test,consistency against general alternatives - 为什么对您有用: 本文直接连接您对 higher-order U-statistics 和 hypothesis testing 的兴趣。检验统计量是 U-统计量,其渐近理论(如投影、退化性)是您 very_familiar 的武器,可立即用于分析该统计量的高阶性质或构造更高效的变体。中期可做:若想将该方法推广到高维或复杂数据结构(如函数型数据),需在 moderately_familiar 的 higher-order U-statistics 理论上进一步积累。
2. 10.1093/biomet/asab009 · arXiv — Integrated conditional moment test and beyond: when the number of covariates is divergent¶
- 作者: Falong Tan, Lixing Zhu
- 期刊/来源: Biometrika
- 机构: Hong Kong Baptist University · Hunan University
- 分类: vol 109 · issue 1 · pp 103-122
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究经典 integrated conditional moment (ICM) 检验在协变量维数发散(diverging dimension)场景下的推广。当维数 p 随样本量 n 增长时,原始 ICM 检验的极限分布发生根本变化,且 wild bootstrap 逼近失效。作者提出一种投影自适应模型(projected adaptive-to-model)版本的 ICM 检验,通过将高维协变量投影到低维方向来维持检验的尺度正确性。理论方面,建立了新检验在原假设和备择假设下的渐近性质,证明其对 n^{-1/2} 阶局部备择假设的敏感性,并验证了 wild bootstrap 在发散维数下的有效性。同时推导了最小二乘估计量在参数维数以文献中最快可能速率发散时的一致性和渐近线性表示。数值实验表明新检验在高维情形下显著提升 ICM 检验的表现。该工作对您在高维假设检验方向的研究有直接参考价值,特别是其处理维数发散时检验统计量极限行为的技术路径。
- 关键技术:
integrated conditional moment test,projected adaptive-to-model,wild bootstrap,diverging dimension asymptotics,least squares estimator asymptotic linear representation - 为什么对您有用: 直接连接 primary interest 中的 hypothesis testing 和高维统计方向。本文处理维数发散时检验统计量的极限行为,您可以用 very_familiar 的高维渐近工具(如随机矩阵理论)来验证其声称的 bootstrap 有效性是否在更一般的协方差结构下成立。中期可做:需先在 moderately_familiar 的 M-estimation 理论上巩固对发散维数下估计方程渐近性的理解。
3. 10.1093/biomet/asab014 · arXiv — Optimal post-selection inference for sparse signals: a nonparametric empirical Bayes approach¶
- 作者: S Woody, O H M Padilla, J G Scott
- 期刊/来源: Biometrika
- 分类: vol 109 · issue 1 · pp 1-16
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究稀疏信号检测后的推断问题,即如何对经过选择(selection)后保留的信号幅度进行有效的置信区间估计。现有贝叶斯方法在调整选择偏差后得到的可信区间频率性质差,而频率学派方法则牺牲了贝叶斯收缩的优势导致区间过宽。作者提出一种非参数经验贝叶斯方法,构造最优的选择调整置信集(selection-adjusted confidence sets),在保持精确频率覆盖(uniformly over the parameter space)的同时最小化平均区间长度。该方法的关键在于利用非参数先验估计(如通过EM算法或核密度估计)来近似信号大小的分布,并基于后验分位数构造置信集。理论结果表明,在温和条件下,该方法渐近收敛于已知先验的Oracle贝叶斯分析结果。模拟和实例显示,该方法在保证相同覆盖概率的前提下,生成的置信区间显著短于现有频率学派后选择推断方法。对于您关注的假设检验与高维统计方向,本文提供了一种将经验贝叶斯与频率学派覆盖保证结合的新框架,其非参数先验估计技术可直接迁移至您熟悉的非参数统计与高维渐近分析工具。
- 关键技术:
nonparametric empirical Bayes,selection-adjusted confidence sets,post-selection inference,uniform coverage,oracle-Bayes consistency - 为什么对您有用: 本文直接连接您的primary interest中的假设检验与高维统计方向,具体涉及稀疏信号选择后的推断问题。您武器库中'非参数统计'和'高维渐近分析'两项very_familiar工具可直接用于理解其非参数先验估计的收敛性,而'minimax bounds for estimation problems'可用于验证其声称的最优区间长度是否紧。中期可做:若想将本文框架推广至更复杂的因果推断设定(如高维IV中的选择后推断),需先在moderately_familiar的'identification theory in causal inference'上长肌肉。
4. 10.1093/biomet/asab010 — General ways to improve false coverage rate-adjusted selective confidence intervals¶
- 作者: Haibing Zhao
- 期刊/来源: Biometrika
- 机构: Shanghai University of Finance and Economics
- 分类: vol 109 · issue 1 · pp 153-164
- 相关性 4/10 · novelty:
new_method - 摘要: 本文关注高维参数选择后推断中的置信区间构造问题。Benjamini & Yekutieli (2005) 提出的 FCR-adjusted 置信区间虽能控制错误覆盖率,但区间长度被均匀膨胀。作者提出两种改进方法:第一种通过将选择事件纳入计算来缩小区间;第二种进一步利用某些参数被选中概率极小的信息,避免目标水平的浪费。方法基于条件概率和选择概率的精确计算,理论证明改进后的区间仍保持 FCR 控制。乳腺癌数据集上的实证分析展示了方法的实用性。对您而言,该工作直接关联假设检验与高维统计中的选择后推断问题,且其利用选择事件信息的思路可迁移至因果推断中的多重检验或变量选择场景。
- 关键技术:
false coverage rate (FCR),post-selection inference,selective confidence intervals,conditional probability,selection event - 为什么对您有用: 该工作直接关联您 primary interest 中的 hypothesis testing 和高维统计方向,具体涉及选择后推断的置信区间构造。您的 technical arsenal 中 very_familiar 的 minimax bounds 和 high-dimensional asymptotics 可用于评估其改进区间的理论最优性;moderately_familiar 的 M-estimation theory 可帮助理解其条件概率计算的渐近性质。中期可做:若将选择事件信息与因果推断中的变量选择(如 IV 选择)结合,需先在 moderately_familiar 的 identification theory 上加强。
5. 10.1093/biomet/asab001 — Distributed inference for the extreme value index¶
- 作者: Liujun Chen, Deyuan Li, Chen Zhou
- 期刊/来源: Biometrika
- 机构: Fudan University · Erasmus University Rotterdam
- 分类: vol 109 · issue 1 · pp 257-264
- 相关性 4/10 · novelty:
new_method - 摘要: 本文研究极端值指数(extreme value index)在数据分布式存储场景下的推断问题。目标是在多机环境下估计极值指数,采用分治(divide-and-conquer)策略:每台机器基于局部数据计算Hill估计量,再通过加权平均得到全局估计量。核心挑战在于极值方法(如Hill估计)的非线性与尾部数据的稀疏性,使得一般分布式推断的oracle性质(即全局估计量与基于全数据的估计量渐近等价)不自动成立。作者提出了分布式Hill估计量,并建立了其渐近正态性理论。考虑了多种设定:每台机器样本量同质或异质、固定或随总样本量变化。在每种设定下给出了oracle性质成立的充分条件,部分情形下还证明了必要性。理论结果通过数值模拟验证。对您而言,本文涉及高维/分布式设定下的极值统计推断,与您在高维统计和假设检验方面的兴趣有交集,其分治框架下的渐近分析思路可迁移至其他heavy-tailed数据的分布式推断问题。
- 关键技术:
Hill estimator,divide-and-conquer,extreme value index,oracle property,asymptotic normality - 为什么对您有用: 本文属于假设检验与极值统计的交叉,直接连接到您在高维统计和假设检验方面的兴趣。技术层面,您非常熟悉的非参数统计与高维渐近理论可用于评估其oracle性质的证明是否紧致,尤其是尾部估计的收敛速率条件。中期可做:若想将分治框架推广至其他极值估计量(如矩估计、Pickands估计),需先在moderately_familiar的M估计理论中加强,以处理不同估计量的渐近方差结构。
统计计算 / 算法 (stat_computing, 1 篇)¶
1. 10.1093/biomet/asab004 · arXiv — Stratification and optimal resampling for sequential Monte Carlo¶
- 作者: Yichao Li, Wenshuo Wang, Ke Deng, Jun S Liu
- 期刊/来源: Biometrika
- 机构: Tsinghua University · Harvard University
- 分类: vol 109 · issue 1 · pp 181-194
- 相关性 3/10 · novelty:
new_method - 摘要: 本文研究序贯蒙特卡洛(SMC)算法中的重采样步骤,目标是优化重采样方差与收敛速率。在一维情形下,证明了最优传输重采样与排序后分层重采样等价,且两者均最小化重采样方差及原始与重采样经验分布之间的期望平方能量距离。对于一般d维情形,提出先使用Hilbert曲线对粒子排序再进行分层重采样的策略,将重采样方差从已知最优的O(m^{-(1+1/d)})改进至O(m^{-(1+2/d)}),并证明该速率对有序分层重采样方案是最优的。进一步给出了Hilbert曲线重采样下原始与重采样经验分布之间Wasserstein距离的几乎必然界。基于这些结果,当使用Hilbert曲线重采样并选择特定低差异序列时,序贯拟蒙特卡洛(SQMC)的均方误差可达O(n^{-1-4/[d(d+4)]}),这是首个低于o(n^{-1})的收敛速率。该工作对您作为统计计算方向的研究者很有价值,直接关联您对数值方法与算法的兴趣,且Hilbert曲线排序与分层重采样的组合策略可迁移至其他需要降维排序的统计计算问题。
- 关键技术:
Hilbert curve sorting,stratified resampling,optimal transport resampling,sequential Monte Carlo,Wasserstein distance bound,sequential quasi-Monte Carlo - 为什么对您有用: 本文直接对应您primary interest中的统计计算(数值方法与算法),提供了SMC重采样步骤的精确方差分析与最优收敛速率。您武器库中'非参数统计'与'高维渐近'的功底可用于理解其Hilbert曲线排序的维度依赖分析,而'软件工程'经验可帮助实现该算法。中期可做:将Hilbert曲线重采样策略推广至您moderately_familiar的HOIF框架中的粒子滤波问题,需先熟悉SMC基础。
其他 (other, 3 篇)¶
1. 10.1093/biomet/asab006 — Dimension reduction for covariates in network data¶
- 作者: Junlong Zhao, Xiumin Liu, Hansheng Wang, Chenlei Leng
- 期刊/来源: Biometrika
- 分类: vol 109 · issue 1 · pp 85-102
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对网络数据中协变量降维问题,提出一种网络监督降维方法(network-supervised dimension reduction),目标是在不假设模型的前提下,利用网络连接信息将协变量投影到低维空间,使得投影后距离近的节点更可能相连。该方法通过最小化一个基于连接概率与投影距离单调关系的损失函数来估计投影方向,其收敛速度依赖于一个称为网络效应因子的量,该因子与图着色问题中划分图所需的最小颜色数类似。有趣的是,该方法与主成分分析和线性判别分析有密切联系,可用于聚类和社区检测。数值实验和来自天文学的脉冲星候选数据集分析展示了方法的实用性。对您而言,本文属于应用导向的方法论文,与您的主要兴趣(因果推断、高维统计)无直接技术重叠,但网络监督降维的思路在流行病学或经济学中处理网络结构数据时可能有参考价值。
- 关键技术:
network-supervised dimension reduction,graph coloring,network effect factor,linear projection,community detection - 为什么对您有用: 本文属于应用统计方法论文,与您的主要兴趣(因果推断、高维统计、半参理论)无直接技术重叠,但网络监督降维的思路在流行病学或经济学中处理网络结构数据时可能有参考价值。您的武器库中非参数统计和估计理论可帮助理解其收敛率分析,但核心问题(网络监督降维)不在您当前的研究路径上,属于暂不可做方向。
2. 10.1093/biomet/asab012 — More for less: predicting and maximizing genomic variant discovery via Bayesian nonparametrics¶
- 作者: Lorenzo Masoero, Federico Camerlenghi, Stefano Favaro, Tamara Broderick
- 期刊/来源: Biometrika
- 机构: Massachusetts Institute of Technology · University of Milano-Bicocca
- 分类: vol 109 · issue 1 · pp 17-32
- 相关性 4/10 · novelty:
application - 摘要: 本文研究在固定预算下基因组测序中“数量 vs 质量”的资源最优分配问题,目标是最大化新发现的基因组变异数。作者提出一种贝叶斯非参数方法,基于 pilot study 数据预测 follow-up 中可发现的新变异数。该方法的核心是使用 Dirichlet process 或 Pitman-Yor process 等非参数先验对变异发现过程建模,通过后验预测分布给出新变异数的点估计和不确定性量化。与现有方法相比,该方法允许 pilot 和 follow-up 的实验条件(如测序深度、样本量)不同,从而能更灵活地用于预算优化。在癌症和人类基因组数据上,该方法在预测精度上可与现有方法竞争,并展示了如何通过调整质量与数量的资源分配来最大化变异发现。对您而言,本文属于应用导向的贝叶斯非参数方法,与您的主要兴趣(因果推断、高维统计等)无直接技术重叠,但可作为了解贝叶斯非参数在基因组学中应用的入门读物。
- 关键技术:
Bayesian nonparametrics,Dirichlet process,Pitman-Yor process,posterior predictive distribution,resource allocation optimization - 为什么对您有用: 本文属于应用统计方法,与您的主要兴趣(因果推断、高维统计、U-统计量等)无直接技术关联。作为 gateway reading,本文对贝叶斯非参数方法的介绍较为清晰,但未涉及您武器库中的具体工具(如 minimax 界、U-统计量计算)。因此,本文暂不可做,核心机器(贝叶斯非参数后验计算、预测分布推导)不在您当前武器库中。
3. 10.1093/biomet/asaa106 — Estimation of the cure rate for distributions in the Gumbel maximum domain of attraction under insufficient follow-up¶
- 作者: Mikael Escobar-Bach, Ross Maller, Ingrid Van Keilegom, Muzhi Zhao
- 期刊/来源: Biometrika
- 机构: Australian National University · Laboratoire Angevin de Recherche en Mathématiques · Université d'Angers · KU Leuven
- 分类: vol 109 · issue 1 · pp 243-256
- 相关性 2/10 · novelty:
application - 摘要: 本文研究在随访不足(insufficient follow-up)情形下,生存数据中治愈比例(cure proportion)的非参数估计问题。设定为:一部分个体被治愈(长期存活者),其余个体的事件时间服从一个属于 Gumbel 最大吸引域(Gumbel maximum domain of attraction)的分布。作者首先证明广义 Gamma 分布族(包括 Weibull、Gamma、log-normal 等常用生存分布)均属于 Gumbel 吸引域。然后利用极值理论中的外推技术,构造了一个治愈比例的非参数估计量,并在合理假设下证明了其相合性和渐近正态性。该估计量通过调整尾部行为来校正因随访不足导致的偏差。模拟研究表明,在随访不足的数据中,该估计量表现良好。最后,文章将方法应用于不同分期乳腺癌患者的生存数据,展示了其实际效用。对您而言,本文属于生存分析中一个特定技术问题的应用型工作,与您的主要兴趣方向(因果推断、高维统计等)关联较弱,但其中极值理论与非参数估计的结合思路可能对处理尾部稀疏数据有启发。
- 关键技术:
extreme value theory,Gumbel maximum domain of attraction,nonparametric estimation,cure proportion,extrapolation technique - 为什么对您有用: 本文属于生存分析中治愈比例估计的应用型工作,与您的主要兴趣(因果推断、高维统计、U-统计量等)直接关联较弱。但其中极值理论用于校正随访不足偏差的思路,对处理尾部稀疏数据(如罕见事件或长尾分布)有一定参考价值。武器库中'非参数统计'和'逆问题'的熟悉度可帮助理解其估计框架,但核心方法(极值吸引域、外推技术)不在您的技术库中,属于'暂不可做'的领域。
Maintained by 陈星宇 · Homepage · Source on GitHub