JASA — Vol 119 Issue 548 · 2026-07-05¶
- 共 48 篇 · Journal of the American Statistical Association
- 目录核对 ⚠️ 疑似漏 16 篇(对照 OpenAlex 64 篇):10.1080/01621459.2023.2267777、10.1080/01621459.2023.2271605、10.1080/01621459.2023.2259030、10.1080/01621459.2023.2271203、10.1080/01621459.2023.2270750 等
本期导览¶
自动生成:归纳本期主要主题与脉络,不打分、不排名。
JASA Vol 119 Issue 548 的 48 篇论文可归纳为四条主线:因果识别与策略学习(约 10 篇)、高维推断与假设检验(约 8 篇)、半参数/非参数方法(约 4 篇)、以及统计计算与算法(约 6 篇)。其余论文分散在空间统计、图模型、贝叶斯方法、书评与勘误等方向,与核心主线关联较弱。
因果推断主线最为突出,覆盖了从识别、估计到策略优化的完整链条。Policy Learning with Asymmetric Counterfactual Utilities 处理反事实联合分布不可识别时的稳健策略学习,将问题转化为极小化极大分类。Generalizing the Intention-to-Treat Effect 利用历史安慰剂数据推断主动对照的 ITT 效应,重点处理依从性与未测量混杂,并给出点识别与部分识别两种模式。Causal Inference with Noncompliance and Unknown Interference 引入“暴露映射”概念,在未知网络干扰下识别 ITT 和 CACE。Doubly Robust Interval Estimation for Optimal Policy Evaluation in Online Learning 在 bandit 设定下构造双重稳健置信区间。Reinforcement Learning in Latent Heterogeneous Environments 将聚类与 Q-learning 结合,自动识别异质子群体。Minimum Resource Threshold Policy Under Partial Interference 在干扰下估计最小处理比例。Balancing Covariates in Randomized Experiments with the Gram–Schmidt Walk Design 通过随机化设计同时平衡大量协变量。Model-Robust and Efficient Covariate Adjustment for Cluster-Randomized Experiments 处理整群随机实验中的协变量调整与群大小变异。Federated Offline Reinforcement Learning 将离线强化学习与联邦学习结合,处理多中心异质性。In Nonparametric and High-Dimensional Models, Bayesian Ignorability is an Informative Prior 揭示贝叶斯可忽略性在高维设定下实为强信息先验。
高维推断与假设检验主线中,Testing General Linear Hypotheses Under a High-Dimensional Multivariate Regression Model with Spiked Noise Covariance 利用随机矩阵理论处理尖峰噪声协方差下的线性假设检验。A Decorrelating and Debiasing Approach to Simultaneous Inference for High-Dimensional Confounded Models 在不可观测混杂下控制 FDR。Optimal and Safe Estimation for High-Dimensional Semi-Supervised Learning 给出半监督估计的极小化极大下界与安全估计量。Split Knockoffs for Multiple Comparisons 将 Knockoffs 拓展至方向性 FDR 控制。Semi-Distance Correlation and Its Applications 提出分类变量与高维向量的依赖度量,用于独立性检验与变量筛选。Bootstrap Inference in the Presence of Bias 证明 prepivoting 可在偏差未一致估计时恢复 bootstrap 有效性。Higher-Order Expansions and Inference for Panel Data Models 提供面板数据的高阶展开理论。A Kernel Measure of Dissimilarity between M Distributions 引入核多样本差异度量,检验分布相等性。
半参数/非参数主线中,Semiparametric Bayesian Inference for Local Extrema of Functions in the Presence of Noise 将局部极值推断视为半参数问题,后验收敛到混合高斯。Nonparametric Statistical Inference via Metric Distribution Function in Metric Spaces 在度量空间建立分布函数与对应定理。Dimension Reduction for Fréchet Regression 为度量空间响应变量提供充分降维。Extremal Random Forests 结合随机森林与极值理论进行极端分位数回归。
统计计算主线中,Fitting Latent Non-Gaussian Models Using Variational Bayes and Laplace Approximations 将非高斯潜模型后验转化为加权高斯问题。Online Statistical Inference for Stochastic Optimization via Kiefer-Wolfowitz Methods 给出 AKW 估计量的渐近分布与在线推断程序。Bounding Wasserstein Distance with Couplings 通过耦合链估计 MCMC 近似误差上界。Joint Tensor Modeling of Single Cell 3D Genome and Epigenetic Data with Muscle 提出半非负联合张量分解。Efficient Stochastic Generators with Spherical Harmonic Transformation 利用球谐变换与低秩近似生成气候模拟数据。
因果推断方向最值得优先阅读的论文包括:Policy Learning with Asymmetric Counterfactual Utilities(部分识别+稳健策略)、Generalizing the Intention-to-Treat Effect(识别假设与敏感性分析)、Causal Inference with Noncompliance and Unknown Interference(暴露映射+IV)、Doubly Robust Interval Estimation for Optimal Policy Evaluation in Online Learning(在线推断+双重稳健)。半参数效率方向可关注 Model-Robust and Efficient Covariate Adjustment for Cluster-Randomized Experiments(三重稳健性)和 Semiparametric Bayesian Inference for Local Extrema of Functions in the Presence of Noise(半参数贝叶斯)。高维方向可优先看 Testing General Linear Hypotheses Under a High-Dimensional Multivariate Regression Model with Spiked Noise Covariance(随机矩阵理论)和 A Decorrelating and Debiasing Approach to Simultaneous Inference for High-Dimensional Confounded Models(FDR控制+混杂)。
因果推断 (causal_inference, 12 篇)¶
1. 10.1080/01621459.2023.2300507 · arXiv — Policy Learning with Asymmetric Counterfactual Utilities¶
- 作者: Eli Ben-Michael, Kosuke Imai, Zhichao Jiang
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3045-3058
- 相关性 9/10 · novelty:
new_method - 摘要: 本文研究在决策者效用函数依赖于反事实联合分布(即同时考虑所有行动下的潜在结果)时的最优策略学习问题。标准策略学习假设效用仅取决于观测结果,但许多实际场景(如医疗中的“不伤害”原则)中,效用不对称地依赖于反事实对比(例如,治疗导致本可存活的患者死亡 vs. 未治疗导致患者死亡)。作者证明,这类不对称反事实效用函数导致期望效用不可识别,因此首先进行部分识别。基于统计决策理论,他们推导极小化极大决策规则,通过最小化相对于不同备选策略的最大期望效用损失来得到稳健策略。方法上,将学习极小化极大损失决策规则转化为求解中间分类问题,并证明有限样本超额期望效用损失受这些中间分类器的遗憾界控制。最后,将该框架应用于右心导管术对疑似肺动脉高压患者的决策问题。对您而言,本文在因果推断的识别与决策框架中引入了反事实联合分布的不对称性,与您的因果推断(特别是IV、mediation中的反事实设定)和半参数效率理论(部分识别下的决策规则)直接相关。
- 关键技术:
partial identification,minimax decision rules,counterfactual utility,policy learning,classification regret bounds - 为什么对您有用: 本文直接连接您的因果推断兴趣中的识别与决策问题,特别是反事实联合分布下的部分识别和极小化极大决策规则。您的技术武器库中“非参数统计”、“因果推断中的估计理论”和“识别理论”可直接用于分析其部分识别区间和决策规则的有限样本性质。中期可做:若想将本文的极小化极大框架推广到高维或半参数设定,需先在“半参数理论”上长肌肉(当前为moderately_familiar)。
2. 10.1080/01621459.2024.2360643 · arXiv — Generalizing the Intention-to-Treat Effect of an Active Control from Historical Placebo-Controlled Trials: A Case Study of the Efficacy of Daily Oral TDF/FTC in the HPTN 084 Study¶
- 作者: Qijia He, Fei Gao, Oliver Dukes, Sinead Delany-Moretlwe, Bo Zhang
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2478-2492
- 相关性 8/10 · novelty:
new_method - 摘要: 本文研究在无安慰剂组的主动对照试验(如HPTN 084)中,如何利用历史安慰剂对照试验数据推断主动对照(如TDF/FTC)相对于安慰剂的意向治疗(ITT)效应。在潜在结果框架下,作者重点讨论了依从性和未测量混杂的作用,详细阐述了点识别和部分识别两种推断模式所需的识别假设,并提出了在点识别假设下的估计量。为放松识别假设,还设计了系统的敏感性分析方法。该方法被应用于HPTN 084试验,利用Partners PrEP历史数据估计每日口服TDF/FTC的ITT效应。本文对您有用:它直接关联到因果推断中的识别与敏感性分析,且其处理未测量混杂的思路可与您的proximal causal inference工作形成互补。
- 关键技术:
potential outcomes framework,intention-to-treat effect,point identification,partial identification,sensitivity analysis,active-controlled trial - 为什么对您有用: 本文直接对应您primary interest中的因果推断(identification, sensitivity analysis),特别是利用历史数据做主动对照试验的ITT效应推断,涉及未测量混杂这一核心难题。您的武器库中'identification theory in causal inference'(moderately_familiar)可直接用于理解其识别假设的合理性,而'nonparametric statistics'(very_familiar)可用于评估其估计量的稳健性。中期可做:若想深入其敏感性分析方法,需先在proximal causal inference的negative control设定上长肌肉(moderately_familiar)。
3. 10.1080/01621459.2023.2289693 · arXiv — Model-Robust and Efficient Covariate Adjustment for Cluster-Randomized Experiments¶
- 作者: Bingkai Wang, Chan Park, Dylan S. Small, Fan Li
- 期刊/来源: Journal of the American Statistical Association
- 机构: University of Pennsylvania · Yale University
- 分类: vol 119 · issue 548 · pp 2959-2971
- 相关性 8/10 · novelty:
new_method - 摘要: 本文聚焦于整群随机实验中的协变量调整问题,目标是对群平均处理效应和个体平均处理效应进行稳健且高效的推断。首先,作者将广义估计方程和线性混合模型与加权 g-computation 结合,使得模型误设时仍能获得稳健的估计。进一步,针对现有方法无法处理因处理分配和群特征导致的群大小变异(post-randomization 变异)这一常见问题,提出了新的高效估计量。该估计量允许灵活使用机器学习估计 nuisance 函数,并证明了当 nuisance 函数一致估计时,估计量具有一致性、渐近正态性和半参有效性;若使用参数工作模型,则估计量具有三重稳健性。模拟和三个真实整群随机实验的数据分析表明,所提方法优于现有替代方案。对您而言,本文在因果推断的纵向/群组设定下提供了处理 cluster size variation 这一实际问题的具体工具,且其三重稳健性和 DML 框架可直接与您的 semiparametric efficiency 和 debiased ML 兴趣对接。
- 关键技术:
weighted g-computation,triple robustness,efficient influence function,cross-fitting,machine learning nuisance estimation,cluster-randomized experiments - 为什么对您有用: 本文直接连接到您的 primary interest 中的 causal inference(纵向/群组设定)和 efficiency theory(semiparametric efficiency bounds)。您可以用 very_familiar 的 estimation theory in causal inference 和 nonparametric statistics 来理解其 EIF 推导和 DML 框架,并进一步用 moderately_familiar 的 semiparametric theory 检验其三重稳健性条件是否紧。中期可做:若想将 cluster size variation 的处理推广到 proximal CI 或 IV 设定,需先在 moderately_familiar 的 identification theory in causal inference 上长肌肉。
4. 10.1080/01621459.2023.2284413 · arXiv — Causal Inference with Noncompliance and Unknown Interference¶
- 作者: Tadao Hoshino, Takahide Yanagi
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2869-2880
- 相关性 8/10 · novelty:
new_method - 摘要: 本文研究在社交网络干扰存在且个体可能不依从分配治疗时的因果推断问题。目标估计量为意向治疗效应(ITT)和依从者平均处理效应(CACE),关键挑战在于网络干扰形式未知且存在非依从。作者引入“暴露映射”(exposure mapping)新概念,将复杂的网络溢出效应总结为工具变量的固定维统计量,从而在暴露映射可能误设的情况下讨论ITT和CACE的可识别性。基于识别结果,采用逆概率加权(IPW)构建非参数估计量,并在近似邻域干扰(ANI)框架下证明估计量的相合性和渐近正态性。实证部分使用反冲突干预学校项目的实验数据说明方法应用,并提供了R包latenetwork。本文对您的主要兴趣——因果推断中IV、干扰和依从性的交叉设定——有直接参考价值,其暴露映射思路可迁移至proximal CI或mediation中的负对照设定。
- 关键技术:
exposure mapping,inverse probability weighting,approximate neighborhood interference,intention-to-treat effect,complier average causal effect,nonparametric estimation - 为什么对您有用: 本文直接连接您的主要兴趣——因果推断中的IV、干扰和依从性。技术武器库中'identification theory in causal inference'(moderately_familiar)可用来分析其暴露映射的识别条件是否紧,而'nonparametric statistics'(very_familiar)可验证其IPW估计量的收敛速率。中期可做:若想将暴露映射推广到连续干扰或高维网络,需先在'semiparametric theory'(moderately_familiar)上长肌肉以推导EIF。
5. 10.1080/01621459.2024.2308317 — Reinforcement Learning in Latent Heterogeneous Environments¶
- 作者: Elynn Y. Chen, Rui Song, Michael I. Jordan
- 期刊/来源: Journal of the American Statistical Association
- 机构: New York University · Amazon (United States) · University of California System · University of California, Berkeley
- 分类: vol 119 · issue 548 · pp 3113-3126
- 相关性 7/10 · novelty:
new_method - 摘要: 本文针对大规模异质性人群中的序贯决策问题,提出K-值异质性马尔可夫决策过程(K-Value Heterogeneous MDP)框架,目标是在潜在子群体结构未知的情况下,同时进行策略评估与策略优化。方法上,作者设计了自动聚类策略评估(auto-clustered policy evaluation)和自动聚类策略迭代(auto-clustered policy iteration)算法,能够在估计动作值函数和最优策略的同时自动识别同质子群体。算法核心机制是将聚类与强化学习中的Q-learning或策略梯度估计相结合,通过迭代优化实现子群体划分与价值函数估计的联合收敛。理论方面,建立了估计量的收敛速率并构造了置信区间,为异质性强化学习提供了统计推断基础。仿真实验验证了理论结果,在真实医疗数据集上的实证分析确认了价值异质性的存在并展示了方法的优势。对您而言,该工作将因果推断中的异质性处理效应(HTE)思想扩展到序贯决策场景,其自动聚类策略评估框架与您熟悉的因果推断估计理论(尤其是纵向数据中的g-computation和IPW)有直接技术关联,可作为中期可做的方向:需先在identification theory in causal inference上巩固,再考虑将proximal causal inference中的negative control思想引入异质性MDP的未观测混杂处理。
- 关键技术:
K-Value Heterogeneous MDP,auto-clustered policy evaluation,auto-clustered policy iteration,Q-learning with clustering,convergence rates for heterogeneous RL - 为什么对您有用: 该论文直接连接您的primary interest中的causal inference(纵向/序贯决策中的异质性处理效应)和identification theory。技术层面,您可以用very_familiar的nonparametric statistics和minimax bounds工具来审视其收敛速率是否最优,或用moderately_familiar的identification theory来思考其聚类假设是否可放松。中期可做:需先在identification theory in causal inference上长肌肉,才能将proximal causal inference的negative control框架引入该异质性MDP以处理未观测混杂。
6. 10.1080/01621459.2023.2279289 · arXiv — Doubly Robust Interval Estimation for Optimal Policy Evaluation in Online Learning¶
- 作者: Ye Shen, Hengrui Cai, Rui Song
- 期刊/来源: Journal of the American Statistical Association
- 机构: North Carolina State University
- 分类: vol 119 · issue 548 · pp 2811-2821
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究在线学习(bandit 算法)中,对当前策略的均值回报(value)进行实时推断的问题。目标是在自适应实验产生的依赖数据、未知最优策略以及探索-利用权衡的复杂环境下,构造最优策略 value 的置信区间。作者显式推导了常用 bandit 算法下探索非最优动作的概率,并利用该概率对每个动作的在线条件均值估计量进行有效推断。在此基础上,提出了双重稳健区间估计(DREAM)方法,该估计量具有双重保护一致性,且渐近正态,可构造 Wald 型置信区间。方法的核心技术工具包括:探索概率的显式推导、在线条件均值估计的推断、以及双重稳健估计框架。模拟和真实数据应用验证了方法的有效性。对您而言,本文连接了因果推断中的策略评估与在线学习场景,其双重稳健估计框架与您熟悉的因果推断估计理论(如 DR 估计)直接相关,且探索概率的推导方法可迁移至您关注的 IV 或 mediation 设定下的自适应实验推断。
- 关键技术:
doubly robust estimation,online learning,bandit algorithms,exploration probability,Wald-type confidence interval,adaptive experiment - 为什么对您有用: 本文直接连接您 primary interest 中的因果推断(策略评估)和 estimation theory(双重稳健估计)。您 very_familiar 的 estimation theory in causal inference 可直接用于理解其 DR 框架,而 moderately_familiar 的 identification theory 可帮助评估其探索概率假设在更复杂因果结构(如 IV、mediation)下的可推广性。中期可做:若将本文方法推广至带有未观测混杂的在线策略评估,需先在 moderately_familiar 的 identification theory 上长肌肉(如 proximal causal inference 的 negative control 假设如何融入 bandit 框架)。
7. 10.1080/01621459.2024.2304692 · arXiv — Identifiability and Consistent Estimation for Gaussian Chain Graph Models¶
- 作者: Ruixuan Zhao, Haoran Zhang, Junhui Wang
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3101-3112
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究高斯链图模型(chain graph model)的识别性与一致估计问题。链图模型同时包含无向边(表示对称条件依赖)和有向边(表示非对称因果关系),但现有文献因缺乏识别条件而进展有限。作者利用精度矩阵的低秩加稀疏分解,提出一组新的识别条件,将无向边与有向边区分开。基于这些条件,构建了一个高效的学习算法,能够完全恢复链图结构。理论分析证明了该算法在恢复真实链图结构上具有渐近一致性。数值实验和标准普尔500指数数据的实际应用进一步支持了方法的有效性。该工作对因果推断中混合图模型(如部分有向无环图)的识别与估计有直接参考价值。
- 关键技术:
low rank plus sparse decomposition,precision matrix estimation,chain graph model,identifiability conditions,asymptotic consistency - 为什么对您有用: 本文直接关联因果推断中混合图模型的识别问题,属于 primary interest 的 causal inference 子方向。技术武器库中 'nonparametric statistics' 和 'high-dimensional asymptotics' 可用于分析其低秩加稀疏分解的收敛性,而 'identification theory in causal inference' 可评估其识别条件在更一般因果设定下的可迁移性。中期可做:需先在 moderately_familiar 的 'identification theory in causal inference' 上深入理解混合图识别框架,再考虑将本文方法推广至非高斯或含隐变量的链图模型。
8. 10.1080/01621459.2023.2285474 · arXiv — Balancing Covariates in Randomized Experiments with the Gram–Schmidt Walk Design¶
- 作者: Christopher Harshaw, Fredrik Sävje, Daniel A. Spielman, Peng Zhang
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2934-2946
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究随机实验中协变量平衡与估计稳健性之间的权衡,并提出一种基于Gram-Schmidt Walk(GSW)的实验设计方法。目标是在给定稳健性参数(约束ATE估计量最坏情况MSE)的条件下,同时平衡大量协变量的所有线性函数。GSW设计通过一个随机化过程生成处理分配,其核心机制是将稳健性参数作为输入,在保证估计量有限样本MSE上界的同时,隐式地对潜在结果在协变量上的岭回归损失函数进行最小化。理论贡献包括:有限样本下MSE的显式上界,以及渐近性质——当协变量数量增长时,GSW设计能以可忽略的稳健性损失实现完美平衡,从而在大量样本中打破平衡与稳健性的折中。此外,文章给出了渐近正态性和保守方差估计量的条件,支持构造渐近有效的置信区间。对您而言,本文提供了一个新颖的实验设计视角,将协变量平衡问题形式化为一个可量化的权衡,其核心思想(通过随机化路径控制最坏情况MSE)与您在因果推断中的估计理论(尤其是有限样本性质)直接相关,且其技术工具(如Gram-Schmidt正交化、岭回归对偶视角)可能启发您在高维或敏感分析设定下的实验设计改进。
- 关键技术:
Gram-Schmidt Walk,covariate balance,worst-case MSE bound,ridge regression duality,finite-sample inference,asymptotic normality - 为什么对您有用: 本文直接连接您的primary interest——因果推断中的估计理论,特别是实验设计中的协变量平衡与稳健性权衡。您的技术武器库中'nonparametric statistics'和'minimax bounds for estimation problems'可用于分析GSW设计的有限样本MSE上界是否紧,而'high-dimensional asymptotics'可用于验证其渐近性质。中期可做:若您想将GSW设计扩展到非随机化或观察性研究(如IV或proximal CI设定),需先在'moderately_familiar'的'identification theory in causal inference'上加强,以处理未观测混杂。
9. 10.1080/01621459.2023.2284422 · arXiv — Minimum Resource Threshold Policy Under Partial Interference¶
- 作者: Chan Park, Guanhua Chen, Menggang Yu, Hyunseung Kang
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2881-2894
- 相关性 7/10 · novelty:
new_method - 摘要: 本文在部分干扰(partial interference)框架下,提出最小资源阈值策略(MRTP),目标是在给定区块内找到所需的最小处理比例,使得区块层面的结果(如无腹泻儿童的家庭比例)达到或超过预设目标。方法基于经验风险最小化,构造了一个非参数、双重稳健的损失函数来估计MRTP,并推导了估计量的超额风险界。该损失函数的设计利用了干扰下的识别结果,允许在区块内存在处理溢出效应。理论部分给出了MRTP估计的有限样本收敛速率,不依赖于参数模型假设。应用案例是塞内加尔的水、卫生与洗手(WASH)分配政策,以增加无腹泻儿童家庭比例为目标,MRTP优于现有分配策略。对您而言,本文在因果推断的干扰设定下提出了一个可操作的政策估计框架,其双重稳健损失函数和风险界分析可直接与您的非参数统计和因果推断兴趣对接。
- 关键技术:
partial interference,doubly robust loss function,empirical risk minimization,excess risk bound,minimum resource threshold policy - 为什么对您有用: 本文直接关联您的因果推断兴趣中的干扰(interference)设定,特别是部分干扰下的政策估计。您的非参数统计和M估计理论武器库(very_familiar)可直接用于分析其双重稳健损失函数的收敛性质,甚至可能改进其风险界。中期可做:若想将MRTP扩展到更复杂的干扰结构(如网络干扰),需先在identification theory(moderately_familiar)上加强。
10. 10.1080/01621459.2023.2278202 · arXiv — In Nonparametric and High-Dimensional Models, Bayesian Ignorability is an Informative Prior¶
- 作者: Antonio R. Linero
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2785-2798
- 相关性 7/10 · novelty:
new_theory - 摘要: 本文研究在非参数和高维模型中,贝叶斯可忽略性(Bayesian ignorability)假设对缺失数据问题的影响。作者指出,在存在高维 nuisance 参数时,可忽略性假设通常与关于混杂偏差的合理先验信念不兼容,因为它隐含地将选择偏差的先验集中在零附近。通过高维线性模型(岭回归先验)等实例,作者刻画了可忽略性对后验分布的影响,并展示了如何构建能编码合理混杂偏差信念的高维模型。该工作揭示了可忽略性假设在贝叶斯框架下并非“无信息”,而是一种强信息先验,对因果推断中的敏感性分析有直接启示。对您而言,本文连接了因果推断中的缺失数据机制与高维统计中的先验设定问题,且其关于混杂偏差先验集中性的分析,可借助您熟悉的 minimax 界工具进行量化验证。
- 关键技术:
Bayesian ignorability,selection bias,ridge regression prior,high-dimensional nuisance parameters,confounding bias,sensitivity analysis - 为什么对您有用: 本文直接连接您的 primary interest 中的因果推断(缺失数据机制与混杂偏差)和高维统计(岭回归先验下的后验集中性)。您可以用 very_familiar 的 minimax bounds 工具来量化文中声称的“先验集中性”是否紧,或进一步推导其 semiparametric efficiency 含义。中期可做:若想将分析推广到非参数模型,需先在 moderately_familiar 的 semiparametric theory 上长肌肉(如 influence function 的贝叶斯类比)。
11. 10.1080/01621459.2024.2310287 · arXiv — Federated Offline Reinforcement Learning¶
- 作者: Doudou Zhou, Yufeng Zhang, Aaron Sonabend-W, Zhaoran Wang, Junwei Lu, Tianxi Cai
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3152-3163
- 相关性 6/10 · novelty:
new_method - 摘要: 本文针对多中心医疗数据中离线强化学习(offline RL)的隐私保护与异质性挑战,提出了一种联邦学习框架。首先,建立多站点马尔可夫决策过程(MDP)模型,允许站点间存在同质与异质效应,并支持站点级特征分析。核心贡献是设计了首个联邦离线策略优化算法,仅需单轮通信交换汇总统计量,通信效率高。理论方面,给出了学习策略的次优性界,其收敛速率与数据未分布时(即集中式)的速率相当。通过模拟实验和脓毒症多中心数据集验证了方法的有效性。对您而言,该工作将因果推断中的动态治疗策略(DTR)与联邦学习结合,其异质性建模和通信高效策略优化思路可直接迁移至您关注的纵向因果推断和IV设定。
- 关键技术:
federated offline RL,multi-site Markov decision process,policy optimization,sample complexity,communication-efficient algorithm,heterogeneous effects - 为什么对您有用: 直接关联您primary interest中的因果推断(动态治疗策略/offline RL)和纵向设定。技术层面,您very_familiar的estimation theory in causal inference和high-dimensional asymptotics可用于分析其异质性建模的收敛性;其单轮通信策略与您熟悉的minimax bounds思路可结合,评估联邦设定下信息损失的下界。中期可做:若想深入联邦RL的统计效率,需先在moderately_familiar的identification theory in causal inference上补足多站点MDP的识别条件。
12. 10.1080/01621459.2023.2284979 · arXiv — Online Regularization toward Always-Valid High-Dimensional Dynamic Pricing¶
- 作者: Chi-Hua Wang, Zhanyu Wang, Will Wei Sun, Guang Cheng
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2895-2907
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究高维动态定价中的在线统计学习问题,目标是设计一个始终有效(always-valid)的定价策略,使得在决策过程中可以持续监控在线Lasso过程。现有方法多关注客户选择模型的忠实度,但难以适应在线学习模型的不确定性。作者提出基于乐观在线正则化最大似然定价(OORMLP)策略,核心创新在于将在线正则化方案与乐观原则结合,编码市场噪声知识到定价过程的乐观性中,赋予在线统计学习在全部决策点上的始终有效性。技术上,该方法利用非渐近鞅集中不等式推导出预测误差过程的时间一致非渐近oracle不等式,从而在过程层面解决动态定价问题。理论结果表明,OORMLP算法利用高维模型的稀疏结构,在决策时间范围内实现了对数级别的遗憾界。实验部分在合成和真实定价数据上验证了该方法相对于现有技术的优势。该论文对您在高维统计和因果推断中处理在线决策与序列检验问题具有参考价值,特别是其时间一致非渐近推断框架可迁移至您关注的纵向因果推断中的在线敏感性分析。
- 关键技术:
online Lasso,non-asymptotic martingale concentration,time-uniform oracle inequality,optimistic online regularization,logarithmic regret - 为什么对您有用: 本文直接连接您的高维统计(高维模型稀疏结构)和因果推断(在线决策中的序列检验)兴趣。技术核心——非渐近鞅集中不等式与时间一致oracle不等式——是您武器库中'高维渐近'和'逆问题'的延伸,可用来分析纵向因果推断中在线估计量的过程级性质。中期可做:需先在moderately_familiar的'identification theory in causal inference'上长肌肉,以将在线正则化框架适配到proximal causal inference的negative control设定中。
高维统计 / 随机矩阵 (high_dim_rmt, 5 篇)¶
1. 10.1080/01621459.2023.2278825 — Testing General Linear Hypotheses Under a High-Dimensional Multivariate Regression Model with Spiked Noise Covariance¶
- 作者: Haoran Li, Alexander Aue, Debashis Paul, Jie Peng
- 期刊/来源: Journal of the American Statistical Association
- 机构: Auburn University · University of California, Davis
- 分类: vol 119 · issue 548 · pp 2799-2810
- 相关性 8/10 · novelty:
new_method - 摘要: 本文研究高维多元回归模型下线性假设检验问题,其中响应变量维度远大于样本量,且噪声协方差矩阵具有尖峰结构(spiked structure)。目标是对回归系数矩阵的线性约束进行检验,例如检验某些协变量是否与一组响应变量无关。方法核心是构造一族基于加权投影的检验统计量:将数据投影到估计的潜在因子方向上,并用权重作为正则化参数来平衡信号与噪声。作者在零假设下建立了检验统计量的渐近正态性,并在局部备择假设族下刻画了检验的功效特性,同时提出了数据驱动的权重选择方法。理论推导依赖于随机矩阵理论中尖峰协方差模型的特征向量和特征值渐近性质。模拟研究和人类连接组计划(HCP)数据应用验证了方法的有限样本表现。该工作直接连接您对高维统计和随机矩阵理论的兴趣,特别是尖峰噪声协方差设定下的推断问题。
- 关键技术:
spiked covariance model,random matrix theory,weighted projection test,high-dimensional multivariate regression,local alternatives - 为什么对您有用: 本文直接连接您对高维统计和随机矩阵理论的兴趣,特别是尖峰噪声协方差设定下的推断问题。您武器库中'高维渐近理论'和'随机矩阵理论'可直接用于理解其检验统计量的渐近分布推导,而'minimax bound'视角可用于评估其功效是否最优。中期可做:若想将此类检验推广到更一般的线性假设(如子矩阵检验),需先在'moderately_familiar'的M估计理论中加强,以处理更复杂的约束结构。
2. 10.1080/01621459.2023.2283938 · arXiv — A Decorrelating and Debiasing Approach to Simultaneous Inference for High-Dimensional Confounded Models¶
- 作者: Yinrui Sun, Li Ma, Yin Xia
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2857-2868
- 相关性 8/10 · novelty:
new_method - 摘要: 本文研究高维混杂线性模型下的大规模同时假设检验问题,目标是在存在不可观测混杂因子时控制错误发现率(FDR)。模型允许响应变量和预测变量均受混杂影响,且混杂变量不可观测,这给推断带来本质困难。作者首先提出一种去相关(decorrelating)步骤,通过收缩混杂效应并减弱预测变量间的相关性;然后基于有偏初始估计量,在去相关设计下进行去偏(debiasing),得到去偏估计量并建立其渐近正态性。基于此构造标准化检验统计量,进一步提出同时推断程序以识别显著关联,并给出有限样本和渐近的FDR界。非渐近结果具有一般性和模型无关性,可独立使用。在最小信号强度条件下,所有关联可被以趋于1的概率检测到。模拟和真实数据研究验证了方法性能。
- 关键技术:
decorrelating procedure,debiasing under high-dimensional confounded models,simultaneous inference,false discovery rate control,asymptotic normality - 为什么对您有用: 本文直接关联您在高维统计和假设检验方面的兴趣,特别是混杂模型下的同时推断问题。您熟悉的非参数统计和minimax界工具可用于分析其去相关步骤的收敛速度,而您在高维渐近理论方面的功底有助于理解其渐近正态性证明。中期可做:若想将本文的decorrelating+debiasing框架推广到更一般的因果推断设定(如proximal CI),需先在semiparametric theory上加强(moderately_familiar项)。
3. 10.1080/01621459.2023.2277409 · arXiv — Optimal and Safe Estimation for High-Dimensional Semi-Supervised Learning¶
- 作者: Siyi Deng, Yang Ning, Jiwei Zhao, Heping Zhang
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2748-2759
- 相关性 7/10 · novelty:
new_method - 摘要: 本文研究高维半监督学习中的参数估计问题,设定为线性回归模型可能被错误指定。首先建立了半监督设定下参数估计的极小化极大下界,并证明仅使用标注数据的监督估计量无法达到该下界。提出一个最优半监督估计量,能在条件均值函数以适当速率一致可估时达到该下界,从而改进监督估计量。进一步提出一个安全半监督估计量,其表现始终不差于监督估计量。还扩展至多个半监督估计量的聚合,以应对条件均值函数的不同错误指定。数值模拟和真实数据分析验证了理论结果。对您而言,该文的高维极小化极大下界推导和半监督估计量的最优性分析,与您的高维统计和极小化极大界研究兴趣直接相关。
- 关键技术:
minimax lower bound,semi-supervised learning,high-dimensional linear model,model misspecification,safe estimator,estimator aggregation - 为什么对您有用: 本文直接连接您的高维统计和极小化极大界兴趣,其半监督设定下的下界推导和最优估计量构造是您熟悉的领域。技术武器库中的 minimax bounds for estimation problems 可直接用于验证其下界是否紧,而 high-dimensional asymptotics 可用于分析其估计量的收敛速率。中期可做:若想将半监督思想迁移至因果推断(如利用未标注数据改进ATE估计),需先在 moderately_familiar 的 identification theory in causal inference 上长肌肉。
4. 10.1080/01621459.2023.2297468 · arXiv — Dynamic Matrix Recovery¶
- 作者: Ziyuan Chen, Ying Yang, Fang Yao
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2996-3007
- 相关性 6/10 · novelty:
new_method - 摘要: 本文提出一个动态矩阵恢复的通用框架,目标是在稀疏观测下恢复随时间平滑演化的低秩矩阵。设定包括独立观测和具有时间相关性的观测两种情况,后者通过修正的集中不等式处理。方法上,通过池化邻近观测信息,利用低秩结构和时间平滑性,推导出两种设定下的尖锐估计误差界,揭示了内在平滑度、依赖性和有效样本量的影响。算法方面,提出动态快速迭代收缩阈值算法(FISTA),并刻画了算法收敛与统计收敛之间的相互作用。理论结果展示了在时间序列矩阵补全和压缩感知等特例中的优势。对您而言,该工作的高维矩阵恢复理论与您的高维统计和随机矩阵理论兴趣高度相关,其误差界推导和算法分析思路可直接借鉴。
- 关键技术:
dynamic matrix recovery,low-rank matrix,concentration inequalities,fast iterative shrinkage-thresholding algorithm (FISTA),temporal correlation,estimation error bounds - 为什么对您有用: 本文直接关联您的高维统计和随机矩阵理论兴趣,特别是动态低秩矩阵恢复的误差界分析。您可以用非常熟悉的 minimax 界工具验证其声称的 sharp rate 是否紧,或探讨其与更高阶 U-统计量在时间序列设定下的联系。中期可做:若想将方法推广至非独立同分布或更复杂的时间依赖结构,需先在 moderately_familiar 的 M-估计理论或识别理论上加强。
5. 10.1080/01621459.2023.2298028 — Clustering High-Dimensional Noisy Categorical Data¶
- 作者: Zhiyi Tian, Jiaming Xu, Jen Tang
- 期刊/来源: Journal of the American Statistical Association
- 机构: IQVIA (United Kingdom) · IQVIA (United States) · Duke University · Purdue University West Lafayette
- 分类: vol 119 · issue 548 · pp 3008-3019
- 相关性 4/10 · novelty:
new_method - 摘要: 本文针对高维含噪声分类数据的聚类问题,提出了一种通用的分类数据编码方法及基于谱聚类的计算高效算法。在统计模型下,假设数据包含 m 个属性、n 个样本、r 个真实簇,且每个条目以概率 ϵ 缺失,算法在条件 mn(1-ϵ) ≥ C M r² log³ M(M = max(n,m))下能以高概率精确恢复真实簇。同时,本文推导了必要条件 mn(1-ϵ)² ≥ r δ/2,在 m=n 且 r 固定时,充分条件与必要条件仅差 polylog(n) 因子。数值实验表明,该算法在聚类精度和计算效率上优于现有方法。对您而言,该文在高维分类数据聚类中提供了清晰的理论保证,其谱聚类与随机矩阵理论(RMT)的联系可能对您在高维统计与假设检验方面的兴趣有启发。
- 关键技术:
spectral clustering,categorical data encoding,random matrix theory,high-dimensional probability,exact recovery guarantee - 为什么对您有用: 本文直接关联您的高维统计与随机矩阵理论兴趣,其理论分析(充分与必要条件匹配)展示了 RMT 在聚类问题中的应用。您可以用 very_familiar 的高维渐近工具验证其谱阈值推导,或探索该算法在因果推断中处理混杂变量(如分类协变量)的潜力。中期可做:若需深入理解谱聚类与 RMT 的精确连接,需在 moderately_familiar 的 M-estimation 理论上加强。
非参数 / 半参数 (nonparam_semipara, 3 篇)¶
1. 10.1080/01621459.2024.2308333 · arXiv — Semiparametric Bayesian Inference for Local Extrema of Functions in the Presence of Noise¶
- 作者: Meng Li, Zejian Liu, Cheng-Han Yu, Marina Vannucci
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3127-3140
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究在噪声观测下推断函数局部极值(最大值/最小值)的问题,将函数视为无穷维 nuisance 参数,属于半参数设定。核心挑战在于局部极值个数未知且形状约束高度不规则。作者基于 Yu et al. 提出的导数约束高斯过程先验,发展了一种“包容性”方法,将可能多个的局部极值通过单一参数索引。给出了后验分布的闭式刻画,并研究了该非常规包容框架下的大样本行为:后验测度收敛到混合高斯分布,其分量数与真实极值个数匹配,从而实现了对多模态的后验探索。进一步提供了具有频率性质的极值点估计和区间估计。该方法计算简单快速,通过模拟和事件相关电位(ERP)真实数据进行了验证。对您而言,该工作将半参数贝叶斯与形状约束推断结合,其处理不规则 nuisance 参数的技术思路可能对您在高维或因果推断中处理复杂约束问题有启发。
- 关键技术:
derivative-constrained Gaussian process prior,semiparametric Bayesian inference,posterior contraction,mixture of Gaussians posterior,shape constraints - 为什么对您有用: 本文属于非参数/半参数理论方向,直接关联您的 primary interest。其核心是处理函数极值这一不规则形状约束下的半参数推断,技术武器库中的 minimax bounds 和 nonparametric statistics 可用于分析其 posterior contraction rate 是否最优。中期可做:若想将类似包容性框架推广到因果推断中的 dose-response 函数极值估计,需先在 moderately_familiar 的 semiparametric theory 上加强,特别是 influence function 在形状约束下的刻画。
2. 10.1080/01621459.2023.2277417 · arXiv — Nonparametric Statistical Inference via Metric Distribution Function in Metric Spaces¶
- 作者: Xueqin Wang, Jin Zhu, Wenliang Pan, Junhao Zhu, Heping Zhang
- 期刊/来源: Journal of the American Statistical Association
- 机构: University of Science and Technology of China · Sun Yat-sen University
- 分类: vol 119 · issue 548 · pp 2772-2784
- 相关性 6/10 · novelty:
new_method - 摘要: 本文针对度量空间中的非欧几里得数据对象(如函数、图、流形),提出了一类仅通过度量定义的“度量分布函数”(metric distribution function),以替代传统欧氏空间中的累积分布函数。核心贡献在于证明了度量空间中的对应定理(correspondence theorem)和Glivenko-Cantelli定理,从而为度量空间值数据的统计推断奠定了理论基础。基于该分布函数,作者进一步构造了同质性检验(homogeneity test)和相互独立性检验(mutual independence test),并给出了经验证据。该方法不依赖线性结构,仅需度量信息,适用于复杂数据对象。理论部分涉及非参数统计中的经典收敛性质,实证部分展示了在多种非欧数据上的表现。对您而言,本文提供了一种将非参数统计框架(如分布函数、经验过程)推广到一般度量空间的思路,与您的非参数统计和假设检验兴趣直接相关。
- 关键技术:
metric distribution function,Glivenko-Cantelli theorem,correspondence theorem,homogeneity test,mutual independence test,non-Euclidean data - 为什么对您有用: 本文直接关联您的非参数统计与假设检验兴趣,提出了度量空间中的分布函数概念,并建立了对应定理和Glivenko-Cantelli定理,这是非参数推断的基础。从武器库看,您对非参数统计和minimax界非常熟悉,可以立即用这些工具分析该分布函数的收敛速率是否最优,或将其与您熟悉的U-统计量方法结合,构造更高效的检验。中期可做:若想将方法推广到更复杂的因果推断设定(如度量空间中的处理效应检验),需先在semiparametric theory上加强。
3. 10.1080/01621459.2023.2277406 · arXiv — Dimension Reduction for Fréchet Regression¶
- 作者: Qi Zhang, Lingzhou Xue, Bing Li
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2733-2747
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对 Fréchet 回归(响应变量取值于度量空间)提出一种灵活的充分降维方法,旨在缓解高维预测变量带来的维数灾难,并提供可视化工具。核心思想是将度量空间值随机对象 Y 通过一个充分丰富的函数类(称为 ensemble)映射为实值随机变量 f(Y),然后对变换后的数据应用经典的充分降维方法。该函数类可由 cc-universal kernel 生成,从而保证能恢复 Fréchet 充分降维空间。作者建立了所提方法的一致性和渐近收敛速率。模拟研究覆盖 Wasserstein 空间、对称正定矩阵空间和球面等常见度量空间,展示了有限样本性能。通过联合国人类死亡率分布数据说明了数据可视化方面的应用。对您而言,本文的充分降维思路可迁移至因果推断中高维协变量的处理,例如在 Proximal CI 或 IV 设定中,利用类似 ensemble 映射降低协变量维度,同时保持识别条件。
- 关键技术:
sufficient dimension reduction,Fréchet regression,cc-universal kernel,ensemble of functions,metric space-valued response - 为什么对您有用: 本文连接非参数/半参数理论中的充分降维与度量空间回归,属于 primary interest 中的非参数统计。技术武器库中 'nonparametric statistics' 和 'high-dimensional asymptotics' 可直接用于理解其 ensemble 映射的收敛性;'minimax bounds for estimation problems' 可用于检验其渐近速率是否最优。中期可做:若想将本文方法推广至因果推断中的高维协变量降维,需先在 'identification theory in causal inference' 上长肌肉,以理解降维后识别条件的变化。
数理统计 / 假设检验 (hypothesis_testing, 6 篇)¶
1. 10.1080/01621459.2023.2279292 · arXiv — Split Knockoffs for Multiple Comparisons: Controlling the Directional False Discovery Rate¶
- 作者: Yang Cao, Xinwei Sun, Yuan Yao
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2822-2832
- 相关性 7/10 · novelty:
new_method - 摘要: 本文针对多重比较中带有结构约束(如总变分、小波变换、融合LASSO、趋势滤波等线性变换)的方向性错误发现率(directional FDR)控制问题,提出了一种扩展的Split Knockoffs方法。该方法通过变量分裂技术将严格的线性流形约束松弛到其邻域,从而构造出正交设计,同时提升了统计功效和方向性FDR控制效果。结合样本分裂方案,该方法能在松弛邻域扩大时有效将方向性FDR降至零。模拟实验和两个真实数据应用(阿尔茨海默病结构MRI分析和人类年龄比较)验证了方法的有效性。对您而言,该工作将Knockoffs框架从变量选择拓展到方向性推断,其变量分裂与正交设计技巧可能对您在高维假设检验或因果推断中的多重比较问题有借鉴意义。
- 关键技术:
Split Knockoffs,directional false discovery rate,variable splitting,linear transformation constraints,sample splitting,orthogonal design - 为什么对您有用: 本文直接关联您对假设检验和高维统计的兴趣,特别是多重比较中方向性FDR控制这一具体子方向。您的技术武器库中的非参数统计和M估计理论可用于分析其变量分裂松弛的渐近性质,而高维渐近工具可验证其FDR控制的理论保证。中期可做:需先在 moderately_familiar 的HOIF或半参数理论上提升,以处理更一般的结构约束下的推断问题。
2. 10.1080/01621459.2023.2284988 — Semi-Distance Correlation and Its Applications¶
- 作者: Wei Zhong, Zhuoxi Li, Wenwen Guo, Hengjian Cui
- 期刊/来源: Journal of the American Statistical Association
- 机构: Xiamen University · Capital Normal University
- 分类: vol 119 · issue 548 · pp 2919-2933
- 相关性 7/10 · novelty:
new_method - 摘要: 本文提出半距离相关(semi-distance correlation),用于度量一个分类变量与一个可能高维的随机向量之间的依赖关系。它是距离相关(distance correlation)的自然推广,核心性质是半距离相关为零当且仅当分类变量与随机向量独立。基于该度量,作者开发了两个重要应用:一是分类变量与高维随机向量之间的独立性检验,推导了检验统计量在原假设下的渐近分布,特别当维度趋于无穷时给出了显式的渐近正态分布,从而能高效计算 p 值;二是将半距离相关作为边际效用,用于超高维分类问题的分组变量筛选(groupwise variable screening),并证明了 sure screening 性质。模拟和真实数据分析展示了有限样本表现,并提供了 R 包 semidist。该工作将距离相关框架从两个连续随机向量扩展到分类-连续混合设定,在高维假设检验和变量筛选两个方向都有直接贡献。
- 关键技术:
distance correlation,semi-distance correlation,high-dimensional independence test,asymptotic normality under null,sure screening property,groupwise variable screening - 为什么对您有用: 直接连接到您的高维统计与假设检验兴趣:本文在高维设定下推导了检验统计量的显式渐近正态分布,这是您熟悉的 high-dimensional asymptotics 工具可以直接验证的。同时,该工作将距离相关推广到分类-连续混合情形,其理论分析(渐近分布、sure screening)与您武器库中的 minimax bounds 和 nonparametric statistics 有直接接口。中期可做:若想将半距离相关进一步嵌入因果推断的敏感性分析或工具变量设定(如分类处理变量与高维协变量的依赖度量),需先在 moderately_familiar 的 identification theory 上补足分类变量的因果识别框架。
3. 10.1080/01621459.2023.2277411 · arXiv — Higher-Order Expansions and Inference for Panel Data Models¶
- 作者: Jiti Gao, Bin Peng, Yayi Yan
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2760-2771
- 相关性 7/10 · novelty:
new_theory - 摘要: 本文针对具有序列相关和截面依赖的面板数据模型,提出了一种简单的推断方法。为了支持该推断方法,作者在简单且一般的条件下发展了新的高阶展开理论,包括Berry-Esseen界和Edgeworth展开。这些理论结果被显式地应用于一个包含交互效应的面板数据模型,该模型嵌套了许多传统面板数据模型作为特例。通过广泛的数值研究,展示了所提方法相对于几种自然竞争方法的优越性。该工作为面板数据的高阶渐近推断提供了统一的理论框架,其Edgeworth展开技术对于改进有限样本推断精度具有直接价值。
- 关键技术:
Berry-Esseen bound,Edgeworth expansion,higher-order expansions,panel data with interactive effects,cross-sectional dependence - 为什么对您有用: 本文直接关联到您对假设检验和高阶U统计量的兴趣,其核心工具是Berry-Esseen界和Edgeworth展开,属于高阶渐近理论。您可以用非常熟悉的非参数统计和高维渐近工具来审视其展开的紧性,例如检验其Edgeworth展开的余项阶数是否在您熟悉的minimax框架下最优。中期可做:若想将类似的高阶展开推广到您更熟悉的因果推断设定(如面板数据中的DID),需要先在中等熟悉的半参数理论上提升,以处理影响函数的非参数估计带来的额外偏差。
4. 10.1080/01621459.2023.2298036 · arXiv — A Kernel Measure of Dissimilarity between M Distributions¶
- 作者: Zhen Huang, Bodhisattva Sen
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3020-3032
- 相关性 6/10 · novelty:
new_method - 摘要: 本文针对 M≥2 个定义在一般可测空间上的分布,引入了一种非参数(核)多样本差异度量 KMD。该参数取值于 [0,1],当且仅当所有 M 个分布相同时为 0,当且仅当所有分布相互奇异时为 1,并满足数据处理不等式和双射变换不变性等 f-散度性质。基于独立观测的样本 KMD 估计可通过 k-近邻图在近线性时间内计算。作者基于样本 KMD 构造了易于实现的 M 个分布相等性检验,该检验对所有至少两个分布不等的备择假设一致。文章证明了样本 KMD 的中心极限定理,完整刻画了检验的渐近势和检测阈值。模拟和真实数据示例展示了方法的实用性,并提供了 R 包。该工作将核方法与图论工具结合,为多样本假设检验提供了新的非参数框架。
- 关键技术:
kernel mean embedding,k-nearest neighbor graph,maximum mean discrepancy (MMD),central limit theorem,hypothesis testing for equality of distributions - 为什么对您有用: 本文直接关联您的假设检验兴趣,提出了一种新的非参数多样本差异度量 KMD,其理论性质(CLT、渐近势)与您熟悉的非参数统计和 minimax 理论高度契合。您可以用非常熟悉的非参数统计工具(如经验过程、U-统计量投影)来深入分析 KMD 的检测阈值是否最优,或将其与您熟悉的更高阶 U-统计量方法结合,探索更复杂的多样本比较问题。中期可做:若想将 KMD 推广到高维或相依数据,需先在 moderately_familiar 的更高阶 U-统计量理论上长肌肉。
5. 10.1080/01621459.2023.2284980 · arXiv — Bootstrap Inference in the Presence of Bias¶
- 作者: Giuseppe Cavaliere, Sílvia Gonçalves, Morten Ørregaard Nielsen, Edoardo Zanelli
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2908-2918
- 相关性 6/10 · novelty:
new_method - 摘要: 本文研究当估计量存在渐近偏差(如模型平均、正则化估计、非参数回归等场景)时,如何通过bootstrap进行有效推断。核心问题是偏差项无法一致估计时,传统bootstrap失效。作者证明Beran的prepivoting方法(将原始bootstrap p值变换为渐近均匀随机变量)可以恢复bootstrap的有效性,即使偏差项未被一致估计。提出了两种实现方式:plug-in prepivoting和double bootstrap,并给出了保证bootstrap推断有效性的通用高阶条件。通过五个例子(模型平均、岭型正则化估计、非参数回归、无限方差位置模型、动态面板数据模型)展示了方法的实用性和实现细节。对您而言,本文的prepivoting技术可直接应用于您的因果推断或高维统计中处理有偏估计量的推断问题,尤其是当您使用正则化方法或模型平均时,该技术提供了一种无需一致估计偏差的稳健推断路径。
- 关键技术:
prepivoting,double bootstrap,asymptotically biased estimators,higher-order refinements,plug-in bootstrap - 为什么对您有用: 本文直接关联您的假设检验兴趣,特别是当估计量存在渐近偏差时(如高维正则化或因果推断中的模型平均)。您的技术武库中'非参数统计'和'高维渐近理论'可立即用于验证本文prepivoting方法在您熟悉的设定下的有限样本表现,属于立即可做的follow-up。
6. 10.1080/01621459.2023.2282644 — Optimal Subsampling via Predictive Inference¶
- 作者: Xiaoyang Wu, Yuyang Huo, Haojie Ren, Changliang Zou
- 期刊/来源: Journal of the American Statistical Association
- 机构: Nankai University · Shanghai Jiao Tong University
- 分类: vol 119 · issue 548 · pp 2844-2856
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究大数据场景下的最优子抽样问题,设定为半监督学习:已有少量标注数据,需从大量未标注数据中按预算抽取最具信息量的个体。目标是在控制错误选择率(FSR)的同时最大化子样本的多样性。方法核心是使用预测推断(predictive inference)量化未标注数据响应预测的不确定性,并将子抽样问题重新表述为带约束的优化问题。理论证明所提方法在渐近意义下最优,即子样本多样性收敛到其oracle版本且FSR受控。数值模拟和真实数据验证了方法的优越性能。该问题与您在高维统计和统计计算中的兴趣相关,特别是子抽样策略的渐近最优性分析可借鉴您熟悉的minimax bound工具。
- 关键技术:
predictive inference,false selection rate control,constrained optimization,subsampling,semi-supervised learning - 为什么对您有用: 本文连接您在高维统计和统计计算中的兴趣,特别是大数据子抽样策略的渐近最优性。您熟悉的minimax bound工具可直接用于分析其多样性收敛速率是否最优。中期可做:需先在moderately_familiar的M-estimation理论上长肌肉,以处理其约束优化问题的渐近性质。
统计计算 / 算法 (stat_computing, 5 篇)¶
1. 10.1080/01621459.2023.2296704 · arXiv — Fitting Latent Non-Gaussian Models Using Variational Bayes and Laplace Approximations¶
- 作者: Rafael Cabral, David Bolin, Håvard Rue
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2983-2995
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对潜变量非高斯模型(LnGM)提出一种基于变分贝叶斯(VB)和拉普拉斯近似的快速推断算法。LnGM 通过将潜过程设定为非高斯分布(如 Laplace、t 分布等),能自动处理时间序列或空间数据中的跳跃、尖峰等非高斯特征,而传统潜高斯模型(LGM)对此类特征敏感。核心方法是将 LnGM 的后验推断转化为一个加权 LGM 问题:利用 VB 框架,将非高斯潜变量的对数似然用二次近似替代,从而得到一个高斯近似后验,该近似自动对极端事件赋予较低权重,实现稳健推断。算法可应用于自回归过程、同时自回归模型(SAR)和空间 Matérn 模型等广泛模型类。作者开发了 R 包 ngvb,用户只需在 R-INLA 的 LGM 代码中添加一行即可扩展为 LnGM,极大降低了使用门槛。模拟和实证表明,该方法在计算速度上接近 LGM,而在非高斯数据上的预测和推断性能显著优于 LGM。对您而言,本文展示了变分贝叶斯与拉普拉斯近似在复杂潜变量模型中的高效实现,其软件工程思路(基于 R-INLA 的扩展)对您开发统计计算软件有直接参考价值。
- 关键技术:
Variational Bayes,Laplace approximation,latent non-Gaussian models,R-INLA,ngvb package,robust inference - 为什么对您有用: 本文属于统计计算方向,直接连接您的 primary interest 中的 statistical computing(数值方法与软件)。您的 technical_arsenal 中 very_familiar 的软件开发和 moderately_familiar 的 M-estimation 理论可用于分析该 VB 近似的收敛性(如 ELBO 的优化性质)。中期可做:若您想深入该方向,需先在 moderately_familiar 的 semiparametric theory 上长肌肉,以理解 VB 近似的渐近偏差与效率损失。
2. 10.1080/01621459.2023.2296703 · arXiv — Online Statistical Inference for Stochastic Optimization via Kiefer-Wolfowitz Methods¶
- 作者: Xi Chen, Zehua Lai, He Li, Yichen Zhang
- 期刊/来源: Journal of the American Statistical Association
- 机构: New York University · University of Chicago · Applied Mathematics (United States)
- 分类: vol 119 · issue 548 · pp 2972-2982
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究随机优化中模型参数的在线统计推断问题,具体采用 Kiefer-Wolfowitz 算法结合随机搜索方向。首先推导了 Polyak-Ruppert 平均型 Kiefer-Wolfowitz (AKW) 估计量的渐近分布,其渐近协方差矩阵依赖于搜索方向的分布和函数值查询复杂度。该分布结果揭示了统计效率与函数查询复杂度之间的权衡关系。进一步分析了如何选择随机搜索方向以最小化渐近协方差矩阵的某些汇总统计量。基于渐近分布,提出了两种构造有效置信区间的在线推断程序。该工作将在线推断方法拓展到基于梯度的随机优化框架之外,适用于目标函数不可微或梯度不可得的情形。对您而言,本文的统计计算视角(算法复杂度与统计效率的权衡)与您的 statistical-computational tradeoff 兴趣直接相关,且其在线推断框架可迁移至您熟悉的因果推断中的在线估计问题。
- 关键技术:
Kiefer-Wolfowitz algorithm,Polyak-Ruppert averaging,asymptotic distribution,online confidence interval,random search directions,function-value query complexity - 为什么对您有用: 本文直接连接您的 statistical-computational tradeoff 兴趣,明确刻画了函数查询复杂度与统计效率之间的权衡,属于该方向的 gateway reading。您的 very_familiar 武器库中的 high-dimensional asymptotics 和 estimation theory 可直接用于理解其渐近分布推导;若想进一步拓展至因果推断中的在线估计,需在 moderately_familiar 的 semiparametric theory 上稍加练习(如将 AKW 框架与 DML 的 cross-fitting 结合)。总体而言,本文值得花时间读全文,尤其适合作为进入统计计算权衡领域的入门读物。
3. 10.1080/01621459.2023.2287773 · arXiv — Bounding Wasserstein Distance with Couplings¶
- 作者: Niloy Biswas, Lester Mackey
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2947-2958
- 相关性 5/10 · novelty:
new_method - 摘要: 本文针对大数据场景下渐近有偏的MCMC近似方法(如随机梯度MCMC、变分贝叶斯、Laplace近似)的质量评估问题,提出基于马尔可夫链耦合的Wasserstein距离上界估计器。核心思想是构造一对耦合链,一条运行目标MCMC(无偏),另一条运行近似方法(有偏),利用耦合时间与Wasserstein距离的关系给出经验上界。理论部分证明了上界的有效性,并展示了在高维设定下估计器仍能保持良好性能。实证部分在4500维贝叶斯逻辑回归和50000维贝叶斯线性回归上验证了方法。该工作为计算统计中近似推断的误差量化提供了实用工具,对您而言,其耦合构造思路可迁移至您熟悉的M-estimation或因果推断中的敏感性分析场景,作为评估近似估计量偏差的补充手段。
- 关键技术:
Markov chain coupling,Wasserstein distance upper bound,asymptotically biased MCMC,stochastic gradient MCMC,variational Bayes approximation - 为什么对您有用: 本文属于统计计算(stat_computing)方向,直接对应您的primary interest中的'statistical computing (numerical methods, algorithm)'。您武器库中'nonparametric statistics'和'high-dimensional asymptotics'可用于理解其高维理论保证,而'软件development'经验可帮助复现或扩展其实验。中期可做:若想将耦合思想用于因果推断中的近似估计量(如proximal CI中的sieve估计)的偏差评估,需先在'moderately_familiar'的'identification theory in causal inference'上提升,以明确目标分布与近似分布的结构。
4. 10.1080/01621459.2024.2358557 — Joint Tensor Modeling of Single Cell 3D Genome and Epigenetic Data with Muscle¶
- 作者: Kwangmoon Park, Sündüz Keleş
- 期刊/来源: Journal of the American Statistical Association
- 机构: University of Wisconsin–Madison
- 分类: vol 119 · issue 548 · pp 2464-2477
- 相关性 3/10 · novelty:
new_method - 摘要: 本文提出 Muscle,一种半非负联合张量分解方法,用于同时分析单细胞 3D 基因组构象(scHi-C)和 DNA 甲基化数据。Muscle 利用 scHi-C 数据的固有张量结构,将两种模态整合到一个联合分解框架中,参数直接对应细胞类型特异性的下游分析关键成分。算法采用交替最小二乘法,并建立了估计量的最优性性质。通过数据驱动实验和模拟,Muscle 在细胞类型划分和模态关联揭示上优于单模态建模和基线多模态方法。该方法对您的主要兴趣——统计计算(张量分解算法)和因果推断中的多模态数据整合——有直接参考价值,特别是其张量分解框架可迁移至纵向因果推断中的多模态数据降维问题。
- 关键技术:
semi-nonnegative joint tensor decomposition,alternating least squares,scHi-C tensor structure,multi-modal integration,cell type delineation - 为什么对您有用: 本文连接您的统计计算兴趣(张量分解算法)和因果推断中的多模态数据整合。您非常熟悉的张量分解工具(treewidth / einsum)可直接用于分析 Muscle 的交替最小二乘算法的计算复杂度,例如评估其张量收缩成本。中期可做:需先在 moderately_familiar 的 HOIF 上长肌肉,以将张量分解框架与高阶影响函数结合,用于多模态因果效应的估计。
5. 10.1080/01621459.2024.2360666 · arXiv — Efficient Stochastic Generators with Spherical Harmonic Transformation for High-Resolution Global Climate Simulations from CESM2-LENS2¶
- 作者: Yan Song, Zubair Khalid, Marc G. Genton
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2493-2507
- 相关性 2/10 · novelty:
application - 摘要: 本文针对CESM2-LENS2高分辨率全球气候模拟数据计算与存储成本过高的问题,提出了一种高效的随机生成器(SG)。该方法利用球谐变换(SHT)将空间域数据转换到谱域,通过低秩近似大幅降低计算与存储开销。SG考虑了轴向对称性,并对陆地和海洋区域分别保留不同的秩,以捕捉复杂的非平稳空间依赖结构。为处理高时间分辨率数据的非高斯性,引入了修正的Tukey g-and-h(TGH)变换。这是首次尝试对CESM2-LENS2的日尺度地表温度模拟数据进行快速生成,并进行了细致的验证。该方法为高效气候建模与分析提供了一条有前景的补充路径,尤其适合计算资源受限的场景。对您而言,本文展示了统计计算中低秩近似与谱方法在大规模地球科学数据上的实际应用,与您的统计计算兴趣直接相关。
- 关键技术:
spherical harmonic transformation,low-rank approximation,Tukey g-and-h transformation,stochastic generator,axial symmetry modeling - 为什么对您有用: 本文属于统计计算(stat_computing)方向,是您secondary interest中astrostatistics的平行领域(地球科学大数据)。作为gateway reading,本文清晰阐述了数据规模(CESM2-LENS2)、噪声结构(非平稳空间依赖、非高斯性)和模型假设(低秩谱域近似),对统计学家友好。您的武器库中'软件开发和逆问题'可直接用于复现或改进其低秩近似算法,属于'立即可做'的范畴。
其他 (other, 17 篇)¶
1. 10.1080/01621459.2023.2300522 · arXiv — Extremal Random Forests¶
- 作者: Nicola Gnecco, Edossa Merga Terefe, Sebastian Engelke
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3059-3072
- 相关性 5/10 · novelty:
new_method - 摘要: 本文提出极值随机森林(ERF),用于高维复杂预测变量空间中的极端分位数回归。传统分位数回归在极端分位数处因数据稀疏而失效,现有极值回归方法(如线性、核、GAM)在高维或复杂回归函数下表现不佳。ERF 结合随机森林的灵活性与极值理论的 extrapolation 能力:利用分位数随机森林的权重构造局部似然,估计条件广义 Pareto 分布(GPD)的尺度与形状参数;并对形状参数施加惩罚以正则化其在预测变量空间中的变异性。在一般吸引域条件下,证明了无惩罚与有惩罚情形下参数估计的相合性。模拟表明 ERF 优于经典分位数回归及现有极值回归方法,并在美国工资数据的极端分位数预测中展示了应用。该方法对您在高维统计与因果推断中处理尾部极端值问题(如极端效应估计)具有潜在参考价值。
- 关键技术:
random forests,generalized Pareto distribution,local likelihood,extreme quantile regression,penalized shape parameter,consistency under domain of attraction - 为什么对您有用: 本文连接您的高维统计与因果推断兴趣,特别是处理极端值或尾部效应时的估计问题。您武器库中的非参数统计与高维渐近工具可用于分析 ERF 的局部似然估计性质,但核心极值理论(GPD、吸引域条件)不在您的熟悉或中等熟悉列表中,属于暂不可做方向。若您未来涉及极端因果效应或高维尾部推断,本文可作为入门读物。
2. 10.1080/01621459.2023.2298037 · arXiv — Robust Validation: Confident Predictions Even When Distributions Shift¶
- 作者: Maxime Cauchois, Suyash Gupta, Alnur Ali, John C. Duchi
- 期刊/来源: Journal of the American Statistical Association
- 机构: Stanford University
- 分类: vol 119 · issue 548 · pp 3033-3044
- 相关性 5/10 · novelty:
new_method - 摘要: 本文研究在训练与测试分布存在偏移(distribution shift)时,如何构建具有鲁棒覆盖保证的预测集(prediction set)。目标是在一个以训练分布为中心的 f-散度球内,对任意测试分布提供(几乎)正确的覆盖概率。方法基于 conformal inference,仅需训练数据可交换(exchangeable),即可在有限样本下实现近似有效的覆盖。核心步骤是估计未来数据偏移的幅度,并据此调整预测集以抵御偏移;作者提出了该偏移量的估计量并证明了其一致性。实验在 CIFAR-v4 和 ImageNet-V2 等大规模基准数据集上验证了方法的有效性。本文属于应用导向的方法学工作,方法本身不涉及因果推断或高维统计等您的主要兴趣方向。
- 关键技术:
conformal inference,f-divergence ball,distributionally robust optimization,prediction set,exchangeability - 为什么对您有用: 本文与您的主要兴趣方向(因果推断、高维统计、U-统计量等)无直接关联,属于统计预测与鲁棒性的一般性方法。您的武器库中非参数统计和 minimax 界可用于分析其覆盖保证的紧性,但核心 conformal inference 框架并非您熟悉的领域。作为 gateway reading 价值有限,因为问题设定(分布偏移下的预测集)与您的核心研究问题距离较远。建议仅作泛读了解。
3. 10.1080/01621459.2024.2382435 · arXiv — Statistical Inference of Cell-Type Proportions Estimated from Bulk Expression Data¶
- 作者: Biao Cai, Jingfei Zhang, Hongyu Li, Chang Su, Hongyu Zhao
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2521-2532
- 相关性 4/10 · novelty:
application - 摘要: 本文针对 bulk 基因表达数据中细胞类型比例估计的不确定性量化问题,提出了一种灵活的统计反卷积框架。该框架允许基因表达具有一般且 subject-specific 的协方差结构,突破了传统方法对独立同分布误差的强假设。核心方法是 DECALS(去相关约束最小二乘法),它通过去相关处理将约束最小二乘估计与协方差估计结合,同时给出比例估计及其抽样分布。模拟实验表明,DECALS 能准确量化估计的不确定性,而现有方法(如 CIBERSORT)无法做到。应用于 ROSMAP 和 GTEx 的死后脑组织数据后,发现考虑比例估计的不确定性可以更准确地识别阿尔茨海默病与对照组、男女性别之间的细胞类型特异性差异表达基因。本文的方法学贡献在于将统计推断(而非单纯点估计)引入生物信息学中的反卷积问题,对您而言,其协方差建模思路与您在高维统计和逆问题中的经验有潜在连接,但核心应用场景(bulk 转录组反卷积)与您的主要兴趣方向距离较远。
- 关键技术:
constrained least squares,decorrelation,covariance estimation,deconvolution,uncertainty quantification - 为什么对您有用: 本文属于生物信息学应用,与您的主要兴趣(因果推断、高维统计、U-统计量)无直接重叠。其协方差建模和去相关估计思路虽与您在高维统计中的经验有微弱连接,但核心问题(bulk 转录组反卷积)并非您的研究方向。作为 gateway reading 价值有限,因为问题设定和领域知识门槛较高,且方法学 novelty 主要在于应用层面的不确定性量化,而非统计理论创新。暂不可做——核心机器(反卷积模型、基因表达数据特性)不在您的武器库中。
4. 10.1080/01621459.2024.2308848 — Consistent Community Detection in Inter-Layer Dependent Multi-Layer Networks¶
- 作者: Jingnan Zhang, Junhui Wang, Xueqin Wang
- 期刊/来源: Journal of the American Statistical Association
- 机构: University of Science and Technology of China · Chinese University of Hong Kong
- 分类: vol 119 · issue 548 · pp 3141-3151
- 相关性 4/10 · novelty:
new_method - 摘要: 本文研究多层网络中的社区检测问题,重点解决层间依赖对社区结构推断的影响。作者将随机块模型(SBM)与Ising模型结合,用SBM刻画层内社区结构,用Ising模型捕捉层间依赖关系,提出一种交替更新算法进行参数估计和社区分配。理论部分建立了参数估计和社区检测的相合性,证明方法在层间存在依赖时仍能一致地恢复社区结构。模拟和真实基因网络数据验证了方法的有效性。该问题与您的主要兴趣方向(因果推断、高维统计、U统计量)无直接交集,但多层网络中的依赖建模思路对纵向因果推断中处理时间点间依赖有一定启发。
- 关键技术:
Stochastic Block Model,Ising model,alternating optimization,community detection consistency - 为什么对您有用: 本文属于网络数据分析,与您的主要兴趣方向(因果推断、高维统计、U统计量)无直接交集,但多层网络中的层间依赖建模思路对纵向因果推断中处理时间点间依赖有一定启发。武器库中非参数统计和M估计理论可用于理解其相合性证明,但核心问题不在您当前研究轨道上,暂不可做。
5. 10.1080/01621459.2024.2302200 · arXiv — A Composite Likelihood-Based Approach for Change-Point Detection in Spatio-Temporal Processes¶
- 作者: Zifeng Zhao, Ting Fung Ma, Wai Leong Ng, Chun Yip Yau
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3086-3100
- 相关性 4/10 · novelty:
new_method - 摘要: 本文针对非平稳时空过程,将其建模为分段平稳时空过程,沿时间维度进行变点估计。目标是在时空框架下同时估计变点个数、位置及每段内的模型参数。方法上,提出基于复合似然的准则函数用于变点与参数估计,并开发了剪枝动态规划算法以高效求解优化问题。理论方面,在递增域渐近框架下证明了估计量的相合性与分布,并发现时空设定下变点位置可精确恢复(而非经典时间序列的Op(1)定位误差),且无需惩罚项即可实现相合估计。此外,还建立了固定空间采样域(填充渐近)下的相合性。模拟与降水数据应用验证了方法有效性。该文主要贡献在时空统计与变点检测的方法论,与您的主要兴趣(因果推断、高维统计等)无直接技术交集,但复合似然与剪枝动态规划的思想在计算统计中或有参考价值。
- 关键技术:
composite likelihood,change-point detection,pruned dynamic programming,increasing domain asymptotics,infill asymptotics - 为什么对您有用: 本文属于时空统计与变点检测的方法论研究,与您的主要兴趣(因果推断、高维统计、U-统计量等)无直接技术重叠。作为计算统计方向的gateway阅读,其复合似然与剪枝动态规划的组合在计算效率上有一定参考价值,但武器库中缺乏时空过程建模与变点检测的核心工具(如分段平稳过程、递增域渐近),暂不可做。
6. 10.1080/01621459.2024.2302198 · arXiv — Graphical Principal Component Analysis of Multivariate Functional Time Series¶
- 作者: Jianbin Tan, Decai Liang, Yongtao Guan, Hui Huang
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3073-3085
- 相关性 4/10 · novelty:
new_method - 摘要: 本文研究多元函数型时间序列,其具有两个方向的依赖结构:时间序列上的序列依赖和同一时间点多个函数之间的图交互。作者提出了动态弱可分离性(dynamic weak separability)这一更一般的条件,用以刻画这种双向结构。基于该条件,建立了函数型图模型与动态主成分分析的统一框架,并进一步扩展到利用图级信息从污染函数数据中最优重构信号。研究了所得估计量的渐近性质,并通过大量模拟验证了方法的有效性。该方法被应用于中国监测网络收集的每小时空气污染数据。对您而言,本文涉及函数型数据分析与图模型的结合,但核心问题(函数型时间序列的降维与重构)与您的主要研究方向(因果推断、高维统计、U-统计量等)的直接关联较弱。
- 关键技术:
dynamic weak separability,functional graphical model,dynamic principal component analysis,multivariate functional time series,signal reconstruction - 为什么对您有用: 本文属于函数型数据分析与时间序列的交叉领域,与您的主要兴趣(因果推断、高维统计、U-统计量等)无直接重叠。虽然方法涉及图模型和主成分分析,但并未提供新的统计推断理论或计算效率突破,且与您的技术武器库(如非参数统计、minimax界、高阶U-统计量)的对接点不明显。作为gateway reading的价值有限,因为问题设定(函数型时间序列的图结构)对统计学家而言并非典型入门问题。暂不可做:核心机器(函数型数据分析、动态图模型)不在您的武器库中。
7. 10.1080/01621459.2024.2388909 — Functional Integrative Bayesian Analysis of High-Dimensional Multiplatform Clinicogenomic Data¶
- 作者: Rupam Bhattacharyya, Nicholas C. Henderson, Veerabhadran Baladandayuthapani
- 期刊/来源: Journal of the American Statistical Association
- 机构: University of Michigan · Michigan Center for Translational Pathology
- 分类: vol 119 · issue 548 · pp 2533-2547
- 相关性 3/10 · novelty:
application - 摘要: 本文提出 fiBAG 框架,用于整合多平台基因组学数据,在贝叶斯变量选择模型中融入上游功能证据以提高信号检测能力。核心设定是:响应变量为患者生存或癌症干性指标,协变量为高维蛋白质组/基因组标记,目标是在标记选择中利用先验功能信息。方法上,fiBAG 先用高斯过程模型量化标记与功能通路之间的(可能非线性)关联,通过贝叶斯因子计算功能证据强度;然后将这些证据映射到一种新颖的校准 spike-and-slab 先验上,从而引导变量选择。该先验的 spike 和 slab 部分均受功能证据调节,使得有强功能支持的标记更易被选中。模拟表明,fiBAG 比非整合方法有更高的检测功效。在 14 种癌症类型的泛癌分析中,fiBAG 识别出与癌症干性和生存相关的蛋白质组标记,并揭示了其细胞机制。对您而言,本文属于应用导向的贝叶斯变量选择工作,与您的主要兴趣(因果推断、高维统计、半参理论)方法学重叠有限,但可作为流行病学或基因组学应用方向的参考。
- 关键技术:
Bayesian variable selection,spike-and-slab prior,Gaussian process model,Bayes factor,multi-omics data integration - 为什么对您有用: 本文属于流行病学/基因组学应用,与您的 secondary interest 中的 epidemiology 方向相关。但方法学上以贝叶斯变量选择为主,与您武器库中的非参统计、高维渐近、因果推断等工具的直接连接较弱。作为应用论文,其多平台数据整合的分析流程(功能证据量化→先验校准→变量选择)可提供流行病学数据分析的参考,但您当前武器库(如 minimax 界、U-统计量、半参效率理论)难以直接攻入其核心机制。暂不可做——核心机器(贝叶斯变量选择、高斯过程先验校准)不在您的武器库中。
8. 10.1080/01621459.2024.2395504 · arXiv — Bayesian Structure Learning in Undirected Gaussian Graphical Models: Literature Review with Empirical Comparison¶
- 作者: Lucas Vogels, Reza Mohammadi, Marit Schoonhoven, Ş. İlker Birbil
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3164-3182
- 相关性 3/10 · novelty:
survey - 摘要: 本文系统综述了无向高斯图模型中的贝叶斯结构学习方法,覆盖了从传统MCMC到近年快速近似算法(如G-Wishart分布、贝叶斯收缩先验、可扩展变分推断)的广泛方法谱系。核心设定是:给定n个p维观测,目标是从后验分布中推断p×p精度矩阵的非零模式(即条件独立图)。方法层面,文章对比了基于G-Wishart共轭先验的MCMC采样器、连续收缩先验(如Bayesian graphical lasso、Horseshoe)、以及利用图拉普拉斯或分块吉布斯采样的可扩展算法。关键理论结果包括:部分方法在p≈1000时能在数分钟内完成图估计,但后验混合质量和图选择的一致性仍高度依赖先验调参。实证部分通过大规模模拟(不同n/p比、图拓扑)比较了约10种方法的ROC曲线、F1分数和计算时间,并给出了一个基因表达数据的案例分析。本文是一篇综述+实证比较,方法学novelty有限,但对您而言,可作为了解贝叶斯图模型工具集的快速入口——若您未来在高维因果推断中需要处理无向图先验(如结构方程建模前的骨架学习),本文能帮您快速筛选可扩展的贝叶斯方法。
- 关键技术:
G-Wishart distribution,Bayesian graphical lasso,continuous shrinkage priors,variational inference for graphical models,block Gibbs sampling,graphical model selection consistency - 为什么对您有用: 本文属于综述+实证比较,方法学novelty有限,但作为gateway reading有价值:(1) 连接您的高维统计兴趣——无向图模型是因果结构学习(如PC算法)的骨架步骤,贝叶斯方法能提供不确定性量化,这是频率派方法欠缺的;(2) 武器库中'minimax bounds for estimation problems'和'high-dimensional asymptotics'可用于评估本文所比较方法的图选择一致性是否达到已知最优率(如p≫n时的一致可识别条件),但本文未提供此类理论分析,因此您无法直接动手改进——属于'暂不可做',因为核心缺失是贝叶斯计算理论(如MCMC混合时间的理论分析)不在您的武器库中;(3) 若您未来想将贝叶斯图先验嵌入因果推断流程,本文可作为方法选型参考,但需额外补充后验一致性的理论工具。
9. 10.1080/01621459.2024.2370593 — Sparse Independent Component Analysis with an Application to Cortical Surface fMRI Data in Autism¶
- 作者: Zihang Wang, Irina Gaynanova, Aleksandr Aravkin, Benjamin B. Risk
- 期刊/来源: Journal of the American Statistical Association
- 机构: Emory University · University of Michigan · University of Washington Applied Physics Laboratory
- 分类: vol 119 · issue 548 · pp 2508-2520
- 相关性 3/10 · novelty:
application - 摘要: 本文提出一种新的稀疏独立成分分析(Sparse ICA)方法,用于估计神经影像中的空间静息态网络。传统ICA方法通过平滑近似非光滑目标函数引入稀疏性,但无法得到精确零解。作者利用relax-and-split框架直接求解非光滑非凸优化问题,同时平衡统计独立性与稀疏性,计算速度快。模拟实验表明,该方法在源信号及其时间序列的估计精度上优于现有方法。将该方法应用于自闭症儿童皮层表面静息态fMRI数据,发现自闭症儿童与正常儿童在某些脑区的活动差异。Sparse ICA选择的共激活位置比传统稠密成分更具可解释性。该方法计算快速且易于应用于大数据。
- 关键技术:
relax-and-split framework,non-smooth non-convex optimization,sparse ICA,resting-state fMRI - 为什么对您有用: 本文属于应用统计方法论文,与您的主要兴趣(因果推断、高维统计等)无直接重叠。但作为gateway reading,它展示了统计优化方法在神经影像数据分析中的应用,数据结构和噪声模型清晰,可作为了解fMRI数据统计分析的入门读物。您的武器库中的非参数统计和高维渐近理论可帮助理解其方法性质,但核心优化工具(relax-and-split)不在您的技术库中,属于暂不可做方向。
10. 10.1080/01621459.2024.2342639 — Dissecting Gene Expression Heterogeneity: Generalized Pearson Correlation Squares and the K -Lines Clustering Algorithm¶
- 作者: Jingyi Jessica Li, Heather J. Zhou, Peter J. Bickel, Xin Tong
- 期刊/来源: Journal of the American Statistical Association
- 机构: University of California, Los Angeles · University of California System · University of California, Berkeley · University of Southern California
- 分类: vol 119 · issue 548 · pp 2450-2463
- 相关性 3/10 · novelty:
application - 摘要: 本文针对基因表达数据中变量间异质性线性依赖关系的刻画问题,将经典 Pearson 相关系数平方推广为广义 Pearson 相关系数平方(gR²),以捕捉多个线性模式的混合。该方法无需参数模型假设,保持变量可交换性,并关注总体参数推断。为从无标签样本中计算 gR²,作者提出了 K-lines 聚类算法,可自适应选择聚类数 K。在推断方面,推导了样本统计量的渐近分布,实现了高效的统计推断。模拟验证了理论结果,并展示了 gR² 在捕捉混合线性依赖关系方面的功效优势。基因表达数据分析表明该方法能有效解析复杂但可解释的关系。本文属于应用导向的方法学工作,对您而言,其聚类+渐近推断的思路与您在高维统计和假设检验方面的兴趣有间接关联,但核心方法(K-lines 聚类、Pearson 平方的推广)与您的主要研究方向(因果推断、U-统计量、效率理论)距离较远。
- 关键技术:
generalized Pearson correlation square,K-lines clustering,asymptotic distribution,mixture of linear dependences,data-adaptive K selection - 为什么对您有用: 本文与您的主要兴趣方向(因果推断、高维统计、U-统计量)关联较弱,属于方法学应用型工作。其渐近分布推导和聚类算法对您在高维统计中的假设检验兴趣有微弱连接,但核心问题(异质性线性依赖的刻画)并非您武器库中熟悉工具的直接应用场景。暂不可做:缺乏与您 very_familiar 或 moderately_familiar 工具的直接接口,需额外投入学习聚类和基因表达数据分析领域。
11. 10.1080/01621459.2023.2279707 · arXiv — Bayesian Spline-Based Hidden Markov Models with Applications to Actimetry Data and Sleep Analysis¶
- 作者: Sida Chen, Bärbel Finkenstädt
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 2833-2843
- 相关性 3/10 · novelty:
application - 摘要: 本文提出一种基于B样条的贝叶斯隐马尔可夫模型(HMM),用B样条指定发射分布,替代传统参数化HMM,以增强建模灵活性。在贝叶斯框架下,通过跨维度马尔可夫链采样算法同时估计所有未知参数(包括状态数),并利用并行采样框架基于边际似然进行模型选择。模拟研究显示该方法在鲁棒性和可扩展性上优于现有方法。应用案例包括白鳍鲨活动数据分析,以及开发层次条件HMM用于人类昼夜节律和睡眠建模。该方法对您的主要兴趣(如因果推断中的纵向数据建模)可能提供非参数HMM的替代思路,但整体偏向贝叶斯计算与生物统计应用,与您核心的理论统计方向(如高维U统计量、半参效率理论)关联较弱。
- 关键技术:
B-spline emission distributions,trans-dimensional Markov chain sampling,marginal likelihood model selection,hierarchical conditional HMM - 为什么对您有用: 本文属于统计方法应用(生物统计/睡眠分析),与您的主要兴趣(因果推断、高维统计、半参理论)无直接交集。作为gateway reading,它展示了非参数HMM在纵向数据中的灵活建模,但武器库中的非参数统计和M估计理论可帮助理解其样条选择与收敛性,不过核心贝叶斯计算工具(跨维度MCMC)不在您的技术栈中,因此暂不可做。
12. 10.1080/01621459.2024.2412464 — Statistical Foundations Driving 21st Century Innovation¶
- 作者: Katherine B. Ensor
- 期刊/来源: Journal of the American Statistical Association
- 机构: American Statistical Association · Rice University
- 分类: vol 119 · issue 548 · pp 2427-2436
- 相关性 2/10 · novelty:
survey - 摘要: 本文是2022年JSM上ASA主席的总统演讲整理稿,旨在综述统计科学在21世纪创新中的核心作用。文章列举了统计学在疫苗研发、自动驾驶、火星探测、清洁能源、金融市场、医学实践等领域的实际贡献,强调统计基础对现代经济的支撑。作者还回顾了ASA在数据科学和AI方面的组织举措,包括建立ASA领导力研究所和社区分析项目。全文以宏观叙事为主,不涉及具体方法论或理论结果,属于学科宣传与展望性质。对您而言,本文不包含可操作的技术细节或新方法,但可作为了解统计学社会影响力的背景阅读。
- 为什么对您有用: 本文属于学科综述与展望,不涉及具体统计方法或理论。您的兴趣集中在因果推断、高维统计、半参效率等具体技术方向,本文无直接连接。武器库中的任何工具均无法用于分析本文。建议仅作背景了解,无需深入阅读。
13. 10.1080/01621459.2024.2330732 — An Efficient Coalescent Model for Heterochronously Sampled Molecular Data¶
- 作者: Lorenzo Cappello, Amandine Véber, Julia A. Palacios
- 期刊/来源: Journal of the American Statistical Association
- 机构: Universitat Pompeu Fabra · Barcelona School of Economics · Stanford University · Centre National de la Recherche Scientifique · Université Paris Cité · Mathématiques Appliquées à Paris 5 · Stanford Medicine
- 分类: vol 119 · issue 548 · pp 2437-2449
- 相关性 2/10 · novelty:
new_method - 摘要: 本文针对异时采样(heterochronous sampling)的分子序列数据,提出一种基于 Tajima 溯祖模型的高效推断方法。传统 Kingman 溯祖模型在样本量增大时计算复杂度高,而 Tajima 模型通过只追踪采样时间标签而非个体标签来降低状态空间。作者将 Tajima 模型扩展至异时采样场景,结合无限位点突变模型,构建了似然函数的高效算法。采用贝叶斯非参数方法(高斯过程先验)对有效种群大小轨迹进行推断,并设计了新的 MCMC 采样器以探索异时 Tajima 谱系空间。模拟和古代野牛 DNA 数据分析表明,该方法在计算效率和推断精度上优于现有方法。对您而言,本文虽不直接属于您的核心兴趣领域,但其在计算效率与统计推断之间的权衡思路(降低模型分辨率以换取可扩展性)与您对统计-计算权衡的兴趣有间接关联,可作为入门级阅读了解生物信息学中的计算挑战。
- 关键技术:
Tajima coalescent,heterochronous sampling,Bayesian nonparametrics,MCMC sampling,infinite-sites mutation model - 为什么对您有用: 本文属于生物信息学/群体遗传学领域,与您的核心兴趣(因果推断、高维统计等)无直接重叠。但作为 gateway reading,它清晰地展示了统计-计算权衡的一个实例:通过降低模型分辨率(从 Kingman 到 Tajima)换取计算可扩展性,这对您理解统计-计算权衡的通用概念有参考价值。您的武器库中非参数统计和 MCMC 知识足以理解本文方法,但本文不涉及您熟悉的 tensor/U-statistic 工具,属于暂不可做的方向。
14. 10.1080/01621459.2024.2406581 — Spatial Statistics for Data Science: Theory and Practice with R.,¶
- 作者: Chae Young Lim
- 期刊/来源: Journal of the American Statistical Association
- 机构: Seoul National University
- 分类: vol 119 · issue 548 · pp 3186-3187
- 相关性 1/10 · novelty:
survey - 摘要: 本文是对《Spatial Statistics for Data Science: Theory and Practice with R》一书的书评,该书系统介绍了空间统计学的可视化技术和统计方法,并提供了R语言实践指南。书评指出该书内容覆盖了空间数据探索、空间自相关分析、空间回归模型、地统计及点模式分析等核心主题。该书以数据科学视角组织内容,强调理论与R代码的紧密结合,适合作为入门教材或参考书。书评认为该书在空间统计教学和实际应用方面具有实用价值,但未提出新的统计理论或方法。对于您而言,这是一本空间统计领域的教学参考书,与您的主要研究兴趣(因果推断、高维统计等)无直接技术关联,但若未来涉及空间数据或地理编码的因果推断应用,可作为入门读物。
- 关键技术:
spatial autocorrelation,geostatistics,point pattern analysis,spatial regression,R programming - 为什么对您有用: 本文是书评,属于教学资源介绍,不涉及新方法或理论。与您的主要兴趣(因果推断、高维统计、U统计量等)无直接技术连接。武器库中的工具(如非参数统计、高维渐近)在此无直接应用口子。暂不可做——核心内容为空间统计教学,不涉及您武器库中的具体技术。
15. 10.1080/01621459.2024.2309339 — Structural Equation Modeling Using R/SAS: A Step-by-Step Approach with Real Data Analysis¶
- 作者: Lifeng Lin
- 期刊/来源: Journal of the American Statistical Association
- 机构: University of Arizona
- 分类: vol 119 · issue 548 · pp 3183-3184
- 相关性 1/10 · novelty:
survey - 摘要: 本文是一篇书评,介绍《Structural Equation Modeling Using R/SAS: A Step-by-Step Approach with Real Data Analysis》一书。该书旨在为初学者提供使用R和SAS进行结构方程模型(SEM)分析的实用指南,涵盖模型设定、识别、估计、评估和修正等步骤。书中通过真实数据分析案例,逐步演示了SEM的完整流程,并提供了R和SAS的代码。书评指出该书内容全面、易于理解,适合作为SEM入门教材或参考书。然而,该书在理论深度上有所欠缺,未深入讨论SEM的统计基础如渐近理论或识别条件。对于研究者而言,该书可作为快速上手SEM软件操作的实用工具,但无法提供方法论上的新见解。
- 关键技术:
structural equation modeling,R,SAS,latent variable modeling - 为什么对您有用: 本文为书评,不涉及新的统计方法或理论贡献。研究者若需快速了解SEM的软件实现,可作参考,但无法直接对接其因果推断或高维统计等核心兴趣。武器库中的工具(如非参统计、U统计量)在此无直接应用口子。暂不可做:本文不提供可攻的方法学问题。
16. 10.1080/01621459.2024.2412190 — Corrections to “Spatio-Temporal Cross-Covariance Functions under the Lagrangian Framework with Multiple Advections”¶
- 作者:
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3189-3189
- 相关性 0/10 · novelty:
minor - 摘要: 本文是对一篇已发表论文的勘误,该论文研究的是拉格朗日框架下具有多重平流效应的时空互协方差函数。勘误内容通常涉及修正公式、证明或数值结果中的错误。由于是勘误,不包含新的方法论贡献或实证分析。对于统计研究者而言,除非原始论文与自身研究方向高度相关,否则勘误本身通常不具有阅读价值。
- 为什么对您有用: 本文为勘误,不涉及新的统计方法或应用,与您的主要研究兴趣(因果推断、高维统计、U-统计量等)无直接关联。不建议花费时间阅读。
17. 10.1080/01621459.2024.2402959 — Correction¶
- 作者:
- 期刊/来源: Journal of the American Statistical Association
- 分类: vol 119 · issue 548 · pp 3188-3188
- 相关性 0/10 · novelty:
minor - 摘要: 这是一篇勘误(Correction),针对 Dorn & Guo (2023) 在 JASA 上发表的关于 sharp sensitivity analysis 的论文。勘误内容通常涉及对原文中公式、符号或推导的修正,不包含新的方法论或理论贡献。由于是勘误,没有提供新的研究问题、方法或结果。对于研究者而言,除非其工作直接依赖原文的具体结果,否则这篇勘误没有阅读价值。
- 为什么对您有用: 本文仅为勘误,不包含新的方法或理论,与任何研究方向均无直接关联。无需阅读。
Maintained by 陈星宇 · Homepage · Source on GitHub