跳转至

2026-08-27 每日 arXiv 资讯

  • 高相关论文 18 篇 · 中相关 74 篇 · 其他 61 篇 · 会议/Seminar 事件 0 条

⭐ 高相关论文(按主题分组)

因果推断 (causal_inference, 12 篇)

1. 2608.24602 — Toward a Semiparametric Efficiency Theory under Equality Constraints in Nested Markov Models

  • 作者: Razieh Nabi, Anna Guo, Lin Liu
  • 相关性 9/10 · novelty: new_theory
  • 摘要: 本文在嵌套马尔可夫模型(nested Markov models)框架下,发展半参数效率理论。嵌套马尔可夫模型由有向无环图(DAG)与隐变量诱导的Verma约束定义,这些约束超越了通常的条件独立性。核心观察是:Verma约束在图形fixing操作诱导的后验分布下,可表示为加权条件矩约束。利用这一表示,作者将约束转化为L2(P)中的加权正交关系,从而显式刻画了由单个Verma约束定义的模型的切空间正交补。基于此几何刻画,通过正交投影和等价最小方差公式,推导出半参数有效影响函数和效率界。对于多个Verma约束的模型,给出了正交补的一个子空间刻画(加权正交关系的和),但完整的切空间刻画仍为开放问题。本文连接了嵌套图结构与半参数希尔伯特空间几何,为嵌套马尔可夫模型的效率理论奠定了基础。对您而言,该工作直接推进了因果推断中半参数效率理论的前沿,特别是处理隐变量和复杂图约束的设定,与您的primary interest(因果推断identification与效率理论)高度契合。
  • 关键技术: nested Markov models, Verma constraints, tangent space orthocomplement, efficient influence function, weighted conditional moment restrictions, graphical fixing operations
  • 为什么对您有用: 本文直接连接您的primary interest中的因果推断identification与半参数效率理论,具体针对隐变量DAG下的Verma约束这一前沿设定。您的武器库中'identification theory in causal inference'和'semiparametric theory'(moderately_familiar)可直接用于理解其几何框架,并可尝试用'higher-order U-statistics'的视角分析其加权条件矩估计量的渐近性质。中期可做:在moderately_familiar的semiparametric theory上进一步深入,即可尝试将本文的单个约束刻画推广到多个约束的完整切空间刻画。

2. 2608.27140 — Graph-based causal variance decompositions: When "variance explained" means causation

  • 作者: Olli Saarela, Juha Karvanen
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文在因果图框架下重新审视了方差分解问题,目标是定义并识别具有因果解释的方差成分。传统方差分解依赖于条件顺序,其分量缺乏因果含义。作者提出基于拓扑排序的因果方差分解,允许逐分量评估识别性,且不要求变量系统满足因果充分性。方法上,通过有向无环图(DAG)定义因果方差分量,并引入受控效应解释(如干预后条件方差),特别适用于医疗公平性等场景。估计采用模型驱动的plug-in估计量,并结合近似贝叶斯方法进行不确定性量化。模拟研究评估了有限样本性能及对结果模型误设和灵活机器学习估计的敏感性。该工作连接了因果归因与机器学习中的变量重要性方法,为因果推断中的方差分解提供了严格的形式化框架。
  • 关键技术: causal variance decomposition, law of total variance, topological ordering, plug-in estimation, approximate Bayesian inference, variable importance
  • 为什么对您有用: 直接关联您对因果推断中identification和estimation的兴趣,特别是方差分解的因果解释问题。您的武器库中'identification theory in causal inference'和'estimation theory in causal inference'可直接用于评估其识别假设和估计量性质。中期可做:若想拓展至更高阶的方差分解或与U-statistics结合,需先在'moderately_familiar'的HOIF上长肌肉。

3. 2608.26606 — Analyzing Within-Subject Experiments: Identification, Testing, and Sensitivity

  • 作者: Shiyao Liu, Junni L. Zhang
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文在潜在结果框架下形式化了两期被试内设计(within-subject design),允许非均衡分配和异质性处理效应与遗留效应。主要目标是ATE的识别与推断。作者证明:pooled estimator仅在两个处理序列的平均遗留效应之差为零时才识别ATE,且其单元聚类标准误与设计-based标准误等价。在温和条件下,遗留效应检验的势严格低于仅用后测数据的ATE检验;两步法(先检验后pooling)产生的置信区间通常覆盖不足——当遗留效应差为零时,覆盖不足恰发生在pooling比后测分析更有效时(即被试内设计有价值时);当差非零时,除非差或样本量很大,否则覆盖不足是常态。本文还推导了敏感性分析,发现已发表结论在合理的遗留效应差范围内稳健。对您而言,这是一篇将识别、检验与敏感性分析系统整合于一个经典实验设计的因果推断论文,直接关联您的causal inference(identification, sensitivity analysis)兴趣,且其设计-based推断视角可与您的semiparametric efficiency theory知识对接。
  • 关键技术: potential outcomes framework, pooled estimator, carryover test, design-based standard error, sensitivity analysis
  • 为什么对您有用: 直接连接primary interest中的causal inference(identification, sensitivity analysis)。本文的识别条件(遗留效应差为零)和两步法覆盖不足的发现,可用您very_familiar的estimation theory in causal inference和minimax bounds工具来检验其sharpness或推广到多期/非平衡设计。中期可做:若想将遗留效应建模为高维协变量函数,需先在moderately_familiar的semiparametric theory上长肌肉。

4. 2608.25979 — The Symmetric Pair Matching Design: A Self-Controlled Method with Automatic Adjustment for Time Effects

  • 作者: Robin Denz, Filippo Saatkamp, Katharina Meiszl, Nina Timmesfeld
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文提出对称配对匹配设计(SPM),一种新型自对照研究设计,用于药物流行病学和疫苗安全性研究。SPM 通过设计本身而非显式建模来控制时间效应(如时间趋势和季节性),同时自动消除个体层面时不变混杂。与现有设计相比,SPM 同时利用事件发生前后的观察时间,保留更多信息,提高统计效率。作者推导了该方法的理论性质,并通过模拟验证其在存在结果和暴露时间趋势时仍能产生无偏估计,且效率优于或等于现有方法。SPM 扩展了自对照方法家族,为具有短暂暴露的观察性研究提供了实用替代方案。附有 R 包便于应用。对您而言,这是因果推断中识别策略的一个新设计,尤其适用于纵向数据和时间相关混杂场景,与您的纵向因果推断兴趣直接相关。
  • 关键技术: self-controlled design, symmetric pair matching, time effect adjustment, conditional logistic regression, simulation-based evaluation
  • 为什么对您有用: 本文属于因果推断中纵向设计的应用创新,直接关联您的 primary interest 中的 longitudinal causal inference 子方向。从技术武器库看,您对 estimation theory in causal inference 非常熟悉,可以立即评估 SPM 的识别假设是否可推广到更复杂的暴露模式(如连续暴露),或与 proximal causal inference 框架结合处理未测量混杂。中期可做:若想将 SPM 与 semiparametric theory 结合推导其效率界,需先在 moderately_familiar 的 semiparametric theory 上加强。

5. 2608.24085 — Orthogonal double residual learning for optimal individualized treatment rules

  • 作者: Jiaqi Tong, Fan Li
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文针对最优个体化治疗规则(ITR)的估计问题,提出正交双残差学习(ODRL)框架。ODRL 是首个直接方法,其目标函数具有通用 Neyman 正交性,既不依赖逆概率加权,也不要求限制性建模假设。该方法通过两阶段交叉拟合,利用治疗变量与结果变量的残差乘积构造代价敏感分类目标,使得 nuisance 估计误差对 regret 的影响是二阶乘积项,因此在重叠条件较弱时仍保持稳健。Fisher 一致的目标函数可适配一般决策规则筛(如 VC 类、决策树、支持向量机、深度 ReLU 网络)。作者建立了非渐近高概率值函数 regret 界,并证明有界得分 hinge 学习可保持正交性,而一般替代松弛则不能。模拟和两个真实数据应用(右心导管研究、牛津净零实验)展示了方法的优越性。该工作对您的主要兴趣——因果推断中的 ITR 估计与效率理论——有直接贡献,其 Neyman 正交性构造思路可迁移至您熟悉的 DML 框架中。
  • 关键技术: Neyman orthogonality, cross-fitting, cost-sensitive classification, double residual learning, VC-class regret bounds, surrogate relaxation
  • 为什么对您有用: 本文直接关联您的主要兴趣——因果推断中的最优 ITR 估计,且其 Neyman 正交性构造是您熟悉的 DML 框架的变体。您可以用 very_familiar 的 minimax 界工具验证其 regret 界是否紧,或用 moderately_familiar 的 HOIF 视角分析其正交性是否可推广到更高阶。中期可做:若想将 ODRL 扩展到连续治疗或动态方案,需先在 moderately_familiar 的 semiparametric theory 上长肌肉(特别是部分线性模型的 IF 推导)。

6. 2608.23971 — Causal Effects of Modified Treatment Policies under Positivity Violations: A Partial Identification Approach

  • 作者: Taehyeon Koo, Elizabeth A. Stuart, Kara E. Rudolph, Caleb H. Miles
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文研究连续处理变量(包括暴露混合物)下修正治疗策略(MTP)的因果效应识别问题,目标是在正定性假设被违反时仍能进行部分识别。标准MTP识别要求处理值在给定协变量后仍有正支持,但多变量处理或连续协变量易导致稀疏或无支持区域。作者将MTP的均值效应分解为两部分:正定性区域内可点识别的部分,以及区域外不可识别的部分。对区域外的条件均值,不采用参数外推模型,而是施加Lipschitz连续性约束,将区域外均值与区域内某个锚点均值关联,从而得到边界。为获得路径可微的边界估计量,作者提出“内部位移投影”方法,将锚点从区域边界向内移动,恢复影响函数的路径可微性。在已知正定性区域下,推导了影响函数,给出了其半参有效性的条件,并构造了渐近正态的估计量和置信区间。模拟显示,在正定性假设被违反时,所提区间仍能达到名义覆盖,而假设正定性的方法则覆盖不足。该工作对您而言,直接连接因果推断中正定性假设的敏感性分析这一子方向,且其部分识别框架与您熟悉的非参数统计和minimax界工具高度契合,可考虑用U-statistic投影或高阶影响函数来改进边界估计的收敛速率。
  • 关键技术: partial identification, modified treatment policy, Lipschitz continuity, influence function, pathwise differentiability, metric projection
  • 为什么对您有用: 直接连接您primary interest中的因果推断(正定性假设的敏感性分析)和半参效率理论(影响函数与路径可微性)。您武器库中very_familiar的nonparametric statistics和minimax bounds可用于检验其Lipschitz约束下边界估计的最优性,而moderately_familiar的HOIF可尝试将当前一阶影响函数方法推广到高阶以收紧边界。中期可做:需先在HOIF上长肌肉,当前论文的边界估计仅依赖一阶影响函数,高阶修正可能改善有限样本表现。

7. 2608.23472 — Evaluating the effects of policy interventions subject to early adoption: A case study of prescription drug monitoring programs and opioid dispensing

  • 作者: Sarika Aggarwal, Brent A. Coull, Nima Hejazi, Rachel C. Nethery
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文在 staggered policy implementation 的潜在结果框架下,形式化了政策干预在强制实施前被早期采纳(early adoption)的问题,并指出这违反了合成控制法(SCM)的 no-anticipation 假设,导致效应估计有偏。作者将总政策效应分解为早期采纳效应和强制实施效应两部分,并提出一个两阶段 SCM 程序:第一阶段利用强制实施前的数据,通过交互固定效应模型估计早期采纳效应;第二阶段将结果变量残差化后,应用 SCM 变体估计强制实施效应和总效应。模拟实验表明,即使在早期采纳与潜在因子相关的情况下,该方法相比传统 SCM 估计量也能减少偏差并改善不确定性量化。应用案例为美国各州的处方药监测计划(PDMP)与人均阿片类药物配发量,在考虑早期采纳后,估计显示 PDMP 可用性和强制实施均与配发量下降相关,但估计不精确且未达统计显著性。对您而言,本文在纵向因果推断中处理 anticipation 的识别与估计策略,直接关联您 primary interest 中的 longitudinal causal inference 和 sensitivity analysis,且其两阶段 residualization 思路可与您熟悉的 nonparametric statistics 和 estimation theory 结合,用于构建更稳健的估计量。
  • 关键技术: synthetic control method, interactive fixed effects model, no-anticipation assumption, staggered policy implementation, two-stage residualization, potential outcomes framework
  • 为什么对您有用: 本文直接切入您 primary interest 中的 longitudinal causal inference 和 sensitivity analysis,具体处理了政策评估中常见的 early adoption 问题,这是传统 SCM 方法的一个关键漏洞。您 very_familiar 中的 nonparametric statistics 和 estimation theory 可用于分析该两阶段估计量的 minimax 性质或提出更灵活的 nonparametric 版本(如用 sieve 替代交互固定效应模型)。中期可做:若您先在 moderately_familiar 的 identification theory 上深入理解 anticipation 假设的识别边界,可进一步扩展至更复杂的 treatment 模式(如 continuous treatment 或 time-varying confounding)。

8. 2608.23453 — Transporting Randomized Trial Effects to Real-World Populations via Riesz-Calibrated Optimal Transport

  • 作者: Anik Burman, Margaret Gamalo, Promit Ghosal, Prosenjit Kundu
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文研究将随机对照试验(RCT)的治疗效果外推至真实世界目标人群的问题,目标 estimand 是目标人群中的平均处理效应(ATE)。现有方法通常建模试验参与倾向性,易受模型误设和协变量分布弱重叠的影响。作者提出 RICOT 方法,基于半非平衡最优传输(semi-unbalanced OT)直接对齐试验与目标人群的协变量分布,并引入熵正则化。关键贡献是发现未校准的 OT 估计量存在不随样本量衰减的渐近偏差;RICOT 通过在传输问题中直接施加校准方程来消除该偏差,校准后的权重一致估计目标-试验密度比(即目标期望泛函的 Riesz 表示子),即使熵和源松弛参数固定为正。结合结果回归后,所得估计量具有双稳健性,并在适当速率条件下达到半参数效率界;方差可直接从影响函数估计,无需重抽样或重复 OT 优化。模拟表明,在多种重叠和模型误设场景下,RICOT 偏差低且覆盖接近名义水平,尤其优于倾向性评分方法。该方法对您的主要兴趣——因果推断中的外推性和效率理论——有直接价值,且其校准思路可与您熟悉的非参数统计和逆问题工具结合,用于处理更复杂的识别问题。
  • 关键技术: optimal transport, Riesz representer, calibration, doubly robust estimation, semiparametric efficiency bound, entropic regularization
  • 为什么对您有用: 本文直接关联您的主要兴趣——因果推断中的外推性(transportability)和效率理论。RICOT 的校准方程与 Riesz 表示子估计是您非常熟悉的非参数统计和逆问题工具可以攻克的:您可以用 minimax 下界分析校准权重的收敛速率,或用 U-statistic 投影技术刻画 OT 估计量的高阶偏差。中期可做:若您先在 moderately_familiar 的 semiparametric theory 上深入(特别是影响函数推导),可进一步探索 RICOT 在纵向或中介设定下的推广。

9. 2608.22890 — Randomization tests for model specification in causal inference under network interference

  • 作者: Supriya Tiwari, Pallavi Basu
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文研究网络干扰下因果推断中暴露映射(exposure mapping)的模型设定检验问题。暴露映射将高维的干扰模式降维为可处理的 spillover effect 定义,但若映射被错误指定,Horvitz-Thompson 等估计量会产生偏倚。作者提出一个基于设计(design-based)的模型设定检验框架,核心思想是利用随机化分配机制构造一个 randomization test,检验暴露映射是否被正确指定。该方法不需要对潜在结果分布做参数假设,仅依赖随机化分配的可交换性。理论部分证明了检验的渐近有效性(asymptotic validity),模拟和田野实验(anti-conflict norms 干预)展示了良好的检验功效。对您而言,该工作连接了因果推断中的网络干扰与假设检验两个子方向,且 randomization test 的构造思路可迁移到您熟悉的非参数统计和 M-estimation 框架中。
  • 关键技术: randomization test, exposure mapping, network interference, design-based inference, Horvitz-Thompson estimator, spillover effects
  • 为什么对您有用: 直接连接 primary interest 中的因果推断(网络干扰下的 spillover effect 识别与检验)和假设检验(模型设定检验)。技术武器库中 very_familiar 的非参数统计和 estimation theory in causal inference 可直接用于理解其 randomization test 的渐近性质,moderately_familiar 的 M-estimation theory 可用于分析暴露映射误设对估计量的影响。中期可做:若想将检验推广到更一般的 exposure mapping 形式(如连续型映射),需先在 moderately_familiar 的 semiparametric theory 上长肌肉,以处理非参数部分的收敛速度。

10. 2608.25814 — Nonparametric Bayesian Inference for Partially Identified Discrete Response Models

  • 作者: Elie Tamer, Christopher D. Walker
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文针对部分可识别的离散响应模型,提出了一种非参数贝叶斯推断框架。核心观察是,这类模型将简约形式的条件选择概率映射到一个识别集,因此对条件概率质量函数进行非参数贝叶斯推断即可得到识别集的贝叶斯推断。该框架嵌套了条件矩不等式和系数未知的线性系统作为特例,且无需将条件矩转化为无条件矩或离散化协变量。作者证明了在模型正确设定下后验对真实识别集具有相合性,后验能相合地检测模型误设,且在误设下对伪识别集也具有相合性。实现上采用了基于高斯过程的先验,后验采样可闭式计算,计算效率高。本文还展示了这些思想可推广至连续响应和聚合离散响应(如市场份额)。对您而言,该工作将贝叶斯非参数方法与部分识别(partial identification)这一因果推断中的核心议题结合,提供了不同于经典频率学派(如条件矩不等式)的推断路径,且其高斯过程先验与闭式后验的计算策略值得关注。
  • 关键技术: partial identification, nonparametric Bayesian inference, Gaussian process prior, identified set, conditional moment inequality, posterior consistency
  • 为什么对您有用: 本文直接连接您的 primary interest 中的 'causal inference (identification, sensitivity analysis)' 子方向,特别是部分识别这一在工具变量、缺失数据等因果问题中常见的设定。您的武器库中 'nonparametric statistics' 和 'estimation theory in causal inference' 非常熟悉,可直接用于理解其高斯过程先验的收敛性质,并评估其与频率学派部分识别方法(如条件矩不等式)的效率对比。中期可做:若想将本文的贝叶斯框架与您的 'semiparametric theory' 结合(如推导半参数效率界),需先在 'identification theory in causal inference' 上进一步熟悉。

11. 2608.25720 — Endogenous Selection and Spillovers: Bayesian Inference for Policy-Relevant Causal Effects

  • 作者: Duong Trinh
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文针对单一大规模网络或空间设定中同时存在内生选择进入处理(endogenous selection into treatment)和溢出效应(spillovers)的问题,提出了一个识别与估计政策相关因果效应的新框架。传统方法依赖无混杂或无干扰假设,在此类场景下通常不适用。作者引入了一个 Spillover Roy 模型,该模型联合建模内生处理选择和潜在结果,并通过邻居处理的低维暴露映射(exposure mapping)来刻画溢出效应。模型允许处理效应随个体对处理的潜在抵抗程度和邻居暴露水平而异。在此框架下,定义了政策变化下的直接、溢出和总效应,并证明了总效应可分解为政策诱导参与的直接成分和政策诱导邻居处理暴露变化的溢出成分。估计与推断方面,开发了带参数扩展的贝叶斯数据增广算法,实现了异质性因果效应和政策反事实的高效后验计算与一致的不确定性量化。对您而言,该工作将 Roy 模型与网络溢出效应结合,为因果推断中处理效应异质性和干扰问题的联合建模提供了新思路,尤其适用于流行病学或经济理论中的空间/网络数据场景。
  • 关键技术: Spillover Roy model, exposure mapping, Bayesian data augmentation with parameter expansion, policy-relevant causal effects decomposition, endogenous selection into treatment
  • 为什么对您有用: 本文直接连接您 primary interest 中的因果推断(IV、mediation、longitudinal 之外的网络溢出与内生选择交叉问题),且其 Spillover Roy 模型和效应分解框架可视为您 moderately_familiar 的 identification theory 在空间/网络场景下的拓展。从武器库看,中期可做:您需先在 moderately_familiar 的 identification theory 上长肌肉(具体为:理解并复现该 Roy 模型在无溢出时的识别条件,再推广至有溢出情形),之后可用 very_familiar 的 minimax bounds 分析其估计量的最优性,或用 higher-order U-statistics 的 treewidth 视角分析其贝叶斯算法的计算复杂度。

12. 2608.22706 — Double/Debiased Machine Learning for Functional-Form-Robust Spatial Autoregression

  • 作者: Jieun Lee
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文在空间自回归(SAR)模型中,针对空间权重矩阵 W 的未知函数形式问题,提出了双/去偏机器学习(DML)推断方法。目标是对低维 SAR 参数进行稳健推断,而 W 由地理和社会经济特征的未知函数生成,且这些特征可能具有内生性。方法核心包括:(1) 通过非线性控制函数处理 W 生成特征的内生性;(2) 构造算子正交的 SAR-IV/GMM 得分函数,消除估计 W 带来的一阶影响;(3) 采用缓冲空间交叉拟合(buffered spatial cross-fitting),分离评估得分与训练数据的空间足迹。在近邻依赖和空间混合创新场条件下,估计量达到渐近线性和根 n 正态性。蒙特卡洛模拟表明,当交互函数误设、特征内生且空间依赖时,该方法比非正交替代方法有更好的有限样本推断性能。美国糖尿病数据应用显示,不同 W 选择导致估计结果差异,且即使使用相同的学习 W,不同推断方法结果也不同,凸显了学习 W 时推断的重要性。对您而言,本文是 DML 框架在空间计量经济学中处理 nuisance 函数(W)的典型案例,其正交得分和空间交叉拟合思路可迁移至您熟悉的因果推断中的 IV 或 mediation 设定。
  • 关键技术: double/debiased machine learning, orthogonal score, spatial cross-fitting, control function, spatial autoregression, generated regressors
  • 为什么对您有用: 本文直接连接您的 primary interest 中的 causal inference(IV 和 sensitivity analysis)和 efficiency theory(DML 正交得分)。您武器库中 very_familiar 的 estimation theory in causal inference 和 nonparametric statistics 可直接用于理解其正交得分构造和 nuisance 函数估计率条件;moderately_familiar 的 semiparametric theory 可用于验证其渐近线性结果的效率性。中期可做:若想将空间交叉拟合推广至您熟悉的 longitudinal 或 mediation 设定,需先在 moderately_familiar 的 identification theory 上长肌肉(理解空间依赖下的 identification 假设)。

高维统计 / 随机矩阵 (high_dim_rmt, 1 篇)

1. 2608.24847 — On the privacy cost for dependent Gaussian data: spectral density estimation under local differential privacy

  • 作者: Yann Issartel, François Roueff
  • 相关性 8/10 · novelty: sharper_rate
  • 摘要: 本文研究局部差分隐私(LDP)下平稳高斯过程谱密度估计的 minimax 率。核心发现是:在强隐私(小 α)下,有效样本量从独立观测的 Nα² 降为 Nα⁴,这一额外代价源于时间相依性而非边际分布。下界证明基于一个针对私有化相依高斯观测的收缩界。上界通过构造问题特定的估计程序(而非通用私有化方案)达到该率,且无先前工作中的 polylog 损失。此外,本文还填补了固定滞后自协方差估计的对数间隙,并证明 LDP 下经典独立高斯实验的渐近等价性一般不成立。对您而言,该工作展示了高维时间序列中隐私约束与统计效率的 tradeoff,与您的 high-dimensional statistics 和 hypothesis testing 兴趣直接相关。
  • 关键技术: local differential privacy, minimax lower bound, spectral density estimation, contraction bound for privatized dependent data, Sobolev-type classes
  • 为什么对您有用: 本文直接关联您的高维统计与假设检验兴趣,特别是时间序列依赖结构在隐私约束下的 minimax 率。您武器库中的 minimax bounds for estimation problems 和 high-dimensional asymptotics 可立即用于验证其下界是否紧或推广到其他相依模型(如长记忆过程)。中期可做:需先在 moderately_familiar 的 M-estimation theory 上加强,以处理更一般的隐私机制(如 shuffle model)。

非参数 / 半参数 (nonparam_semipara, 2 篇)

1. 2608.27055 — How far can symmetry help? Phase transitions and symmetry selection in sparse functional data analysis

  • 作者: Jocelyn Nembe
  • 相关性 8/10 · novelty: new_theory
  • 摘要: 研究稀疏函数型数据分析中协方差面估计的相变现象,重点关注域对称性如何改变从二维非参数率到参数率 n^{-1} 的阈值 m_n^* ≍ n^{1/(2β)}。核心发现是:若过程与设计被一个 q 阶循环群保持,阈值位移至 n^{1/(2β)} q^{-1/2},平方根因子源于对称性作用于可用配对数的方差项,而参数基底不受群平均影响。位移存在饱和:当轨道细于带宽时,缩减因子为 min(q, c_K/h),通过 Poisson 求和与核自相关的正定性导出,此后率塌缩至一维非参数率。因此任何旋转对称(包括全圆群)无法将阈值降至 n^{1/(4β)} 以下;该下界由估计器从上方达到,由下界(至多多项式因子)从下方逼近。对称性在对数尺度上将经典阈值向常数采样推进了一半。均匀下界基于平稳子类的保正打包,间隙闭合留作开放问题。近似对称情形下风险增加逼近项,设计平面分裂为三个区域,其中一个区域无法通过额外采样触及;对称谱在 Fourier 坐标下显式表达,留出法选择对称水平,在饱和前达到领先常数一,饱和后达到绝对常数内。所有规律经数值验证。域重参数化不改变阈值。对您可能有用:该文将非参数率、相变与群对称性结合,其阈值位移分析可迁移至高维统计中结构先验下的 minimax 率研究。
  • 关键技术: phase transition, nonparametric rate, Poisson summation, kernel autocorrelation, minimax lower bound, hold-out selection
  • 为什么对您有用: 直接连接非参数与半参数理论中的 minimax 率分析,特别是协方差估计的相变阈值。武器库中'minimax bounds for estimation problems'和'nonparametric statistics'可直接用于验证其阈值位移的紧性(立即可做)。该文对对称性作用的精细刻画(平方根因子、饱和、不可达区域)为高维统计中结构先验下的率分析提供了新视角。

2. 2608.27155 — Nonparametric Identification of Two-Way Unobserved Heterogeneity

  • 作者: Hugo Freeman, Dennis Kristensen
  • 相关性 8/10 · novelty: new_theory
  • 摘要: 本文研究非参数面板回归模型 G_{it}=g(α_i,γ_t)+ε_{it} 中双向未观测异质性(α_i 和 γ_t)的识别问题。核心思路是将识别转化为构造可观测的、单射的代理变量,并利用双变量回归函数 g(α,γ) 在乘积域上的奇异值分解(SVD),其左奇异函数 {u_r} 作为 α 的代理。作者在“观测等价简化”下工作:若两个 α 值诱导相同的条件响应 g(α,·),则它们被视为同一,从而响应映射 α↦g(α,·) 本身是单射的。主要理论贡献有二:第一,该简化等价于全体左奇异特征函数集合 {u_r}_{r≥1} 的单射性,无需额外条件;第二,在单个“局部单射”条件下,有限个前导特征函数 U_R 对足够大的 R 是单射的。证明通过将全局单值性问题化为局部一阶条件加拓扑紧性论证,绕过了通常所需的全局雅可比条件。本文为面板数据中非参数因子模型的识别提供了简洁的理论框架,对您在高维统计和因果推断中处理未观测混杂的识别问题有直接参考价值。
  • 关键技术: singular value decomposition (SVD), injective proxy, local injectivity condition, topological compactness argument, observational equivalence simplification
  • 为什么对您有用: 本文直接关联您 primary interest 中的非参数识别理论,特别是因果推断中未观测混杂的识别问题(如面板数据中的双向固定效应模型)。技术武器库中“非参数统计”和“估计理论”可直接用于理解其 SVD 代理构造;而“identification theory in causal inference”可帮助您将本文的局部单射条件与因果推断中的负对照或代理变量条件做对比。中期可做:若将本文的识别结果扩展到有协变量的设定或与 proximal causal inference 结合,需先在“identification theory in causal inference”上进一步熟悉。

数理统计 / 假设检验 (hypothesis_testing, 1 篇)

1. 2608.25310 — Robust Nonparametric Testing for Structural Changes in Multivariate Volatility via Multiple Quantiles

  • 作者: Jilin Wu, Ruike Wu, Zhijie Xiao, Mengxi Zhang
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文针对多元波动率矩阵的结构变化检验问题,提出了一种基于分位数聚合的稳健非参数检验方法。该方法通过聚合有界广义分位数得分(bounded generalized quantile scores)构造检验统计量,并具有加权 leave-q-out U-统计量表示形式。通过删除邻近索引对,使得序列依赖引起的中心化效应渐近可忽略。所有实施所需的量(包括用于标准化的方差估计量)均在原假设下构造,无需指定备择假设下的波动率动态。标准化后的统计量收敛到标准正态分布。该方法避免了最小二乘和拟似然方法通常需要的有限四阶或八阶矩条件,同时通过跨分位数聚合利用了比单分位数方法更多的分布信息。蒙特卡洛模拟显示,在重尾创新下具有良好的尺寸和优越的检验功效,在高斯创新下也具有竞争力。对Fama-French三因子模型的应用提供了因子协方差矩阵不稳定性的证据。
  • 关键技术: weighted leave-q-out U-statistic, bounded generalized quantile scores, quantile aggregation, structural break testing, multivariate volatility
  • 为什么对您有用: 本文直接关联您对 hypothesis testing 和 higher-order U-statistics 的兴趣。U-统计量表示形式与您熟悉的 higher-order U-stat 计算(treewidth / tensor contraction)有技术接口——可以分析其 leave-q-out 结构的计算复杂度是否可通过 einsum 优化。中期可做:需先在 moderately_familiar 的 higher-order U-statistics 理论上深入,特别是 U-统计量的投影分解与渐近正态性证明。

其他 (other, 2 篇)

1. 2608.25463 — Berry--Esseen bounds and bootstrap approximations for the Hilbert-space norm of \(U\)-statistics

  • 作者: Nilanjan Chakraborty, Sayan Das
  • 相关性 10/10 · novelty: new_theory
  • 摘要: 本文在三角阵列框架下,针对取值于可分离Hilbert空间H_n(可随样本量变化,涵盖无限维及维数递增的欧氏空间)的非退化U-统计量的范数,建立了非渐近的Berry-Esseen界和bootstrap逼近。核心方法是将Stein方法推广到Hilbert空间,并结合Hoeffding分解对高阶项进行精细控制;逼近误差依赖于核的四阶矩以及Hájek投影协方差算子的谱几何(特别是前导特征方向之外的谱质量占比),因此能容纳奇异或近似低秩的协方差算子。对于H_n=R^{d_n},在坐标四阶矩条件下给出了显式维数依赖的界。同时建立了经验bootstrap、高斯加权bootstrap和jackknife multiplier bootstrap的逼近界,从而得到渐近尺寸正确且对协方差依赖的分离率一致的检验。以配对Kendall's tau系数向量的检验为例,给出了匹配的minimax下界,证明该分离率在稠密高斯相关备择下是minimax率最优的。该工作直接推进了您对higher-order U-statistics理论的理解,特别是其非渐近分布逼近和bootstrap推断,且其谱几何分析工具可迁移至您熟悉的treewidth/einsum计算复杂度视角下的U-统计量结构分析。
  • 关键技术: Berry-Esseen bounds in Hilbert spaces, Stein's method for Hilbert-space valued statistics, Hoeffding decomposition, spectral geometry of covariance operator, multiplier bootstrap, minimax lower bound for Kendall's tau
  • 为什么对您有用: 直接命中您primary interest中的higher-order U-statistics和hypothesis testing。本文的Hilbert空间Berry-Esseen界和bootstrap逼近是U-统计量推断的核心理论工具,其谱几何分析(协方差算子前导方向之外的谱质量)与您熟悉的treewidth/tensor contraction视角下的U-统计量计算复杂度有潜在交叉:协方差算子的有效秩可能对应einsum收缩图中的某种结构稀疏性。中期可做:需先在moderately_familiar的higher-order U-statistics理论上长肌肉(特别是Hoeffding分解的高阶项控制和谱分析),然后可尝试将本文的谱几何条件与您已有的treewidth-based计算复杂度刻画结合,探索U-统计量计算-统计折中的新表征。

2. 2608.26536 — Posterior consistency for subdiffusion inverse problems

  • 作者: Haoyu Lu, Shaokang Zu, Junxiong Jia
  • 相关性 8/10 · novelty: new_method
  • 摘要: 本文研究半线性时间分数阶次扩散方程中初始状态的贝叶斯反演问题,观测数据为含噪声的随机时空点观测。对未知初始条件赋予基于Whittle-Matérn过程的重新缩放高斯先验。在非线性项满足H^κ范数Lipschitz条件下,证明了解具有H^{2+κ}正则性。建立了预测误差在L^2范数下以及参数在Sobolev范数下的后验收缩率,收缩率为样本量的多项式函数,指数依赖于先验光滑性和空间维数。通过构造小波打包集并控制KL散度,证明了极小极大下界。该工作属于反问题与贝叶斯非参数交叉领域,与您的主要兴趣(非参数统计、高维渐近)有方法学上的间接关联,但核心问题设定(分数阶偏微分方程反演)偏离较远,且未涉及因果推断或U统计量等您深耕的方向。
  • 关键技术: Bayesian inverse problems, posterior contraction rates, Whittle-Matérn process, wavelet-packing set, minimax lower bound, semilinear subdiffusion equation
  • 为什么对您有用: 本文属于反问题与贝叶斯非参数理论,与您'非参数统计'和'高维渐近'兴趣有方法学交集(后验收缩率、极小极大下界),但核心设定(分数阶PDE反演)不在您的主要研究轨道内。武器库中'非参数统计'和'极小极大界'可理解其技术框架,但分数阶扩散方程的正则性分析需要额外PDE工具,目前暂不可做。作为跨领域阅读可拓宽视野,但非优先跟进方向。

📌 中相关论文(按主题分组)

因果推断 (causal_inference, 17 篇)

1. 2608.27289 — Combining covariate adjustment with information from secondary endpoints to improve precision in randomized trials

  • 作者: Jack M. Wolf, Joseph S. Koopmeiners, David M. Vock
  • 相关性 7/10 · novelty: application
  • 摘要: 本文研究在随机对照试验中,如何同时利用基线协变量调整和次要终点信息来提升主要终点平均处理效应的估计精度。目标 estimand 是主要终点的 ATE,设定为 RCT 框架,假设无混杂。方法层面,作者扩展了先前提出的单因子结构方程模型框架,将基线协变量纳入模型,同时保留 ATE 作为目标参数;为缓解模型误设敏感性,进一步将结构方程模型估计量与常规协变量调整估计量通过交叉验证模型平均进行组合。模拟结果表明,当结构方程模型正确设定时,终点信息借用带来的效率增益超过单纯协变量调整;模型误设会引入偏倚和覆盖不足,而模型平均能有效降低偏倚、改善覆盖。在低尼古丁香烟随机试验的实际应用中,模型平均估计量比未调整估计量精确 21%,比仅协变量调整精确 13%。本文对您可能有用:它直接关联因果推断中随机试验的效率提升问题,且模型平均策略可与您熟悉的非参数统计和 M-估计理论结合,用于设计更稳健的估计量。
  • 关键技术: structural equation modeling, covariate adjustment, cross-validated model averaging, efficiency borrowing from secondary endpoints
  • 为什么对您有用: 本文直接关联您 primary interest 中的因果推断(RCT 效率提升),且模型平均策略可与您 very_familiar 的非参数统计和 M-估计理论结合,用于分析估计量的偏差-方差权衡。中期可做:需先在 moderately_familiar 的 semiparametric theory 上巩固,以严格推导模型平均估计量的 semiparametric efficiency bound。

2. 2608.26610 — On efficiency gains via augmenting a tiny sample with a massive auxiliary sample

  • 作者: Yen-Chi Chen
  • 相关性 7/10 · novelty: new_theory
  • 摘要: 本文研究如何利用一个海量辅助样本来提升极小目标样本的估计效率。在Tukey分解框架下,目标分布与辅助分布通过odds ratio连接,两种主流方法是逆概率加权(IPW)和全似然(FL)。作者证明IPW方法受限于目标样本量,而FL方法在指数族及指数族混合模型下可使部分模型参数达到辅助样本量的收敛速率,即“完全效率增益”。对于非参数IPW方法,文章展示了其如何实现目标样本量的参数速率。此外,还讨论了如何用FL同时训练目标分布和odds ratio的神经网络模型。该工作对您在高维统计和因果推断中处理样本量不均衡问题(如罕见病队列或实验组样本极小)有直接参考价值,特别是其效率增益的理论刻画可启发您在半参数效率界框架下设计更优的估计量。
  • 关键技术: Tukey's factorization, inverse probability weighting, full-likelihood estimation, exponential family, odds ratio model, semiparametric efficiency
  • 为什么对您有用: 本文直接连接您的primary interest中的因果推断(样本选择偏差/传输学习)和效率理论。您可以用very_familiar的minimax bound工具验证其声称的“完全效率增益”是否紧,或用moderately_familiar的半参数理论分析非参数IPW的efficiency bound。中期可做:将FL方法推广到您的proximal CI设定中处理负对照变量。

3. 2608.26475 — Power and Sample Size Calculations for Hybrid Controlled Trials

  • 作者: Ke Zhu, Shu Yang, Xiaofei Wang
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文针对混合对照试验(HCT)的样本量计算问题,提出了一种前瞻性设计框架。HCT 通过引入外部对照(EC)来增强随机对照试验(RCT)的统计功效,但计划阶段 EC 与 RCT 对照的可比性未知,导致传统样本量公式失效。作者基于逆概率加权(IPW)估计量估计平均处理效应(ATE),并引入 5+3 设计参数:5 个常规 RCT 参数加上 3 个标量参数刻画 EC 可比性(无结果漂移的 EC 数量、协变量分布重叠系数、抽样机制与对照潜在结果的相关性)。在提出的工作模型下,证明了估计量的渐近正态性,且方差完全由这些设计参数决定,从而得到连续和二元结局的样本量公式。模拟评估了有限样本表现,并通过真实临床试验展示实用性。方法已实现为 R 包 hctdesign。该工作直接连接您的因果推断兴趣中的 IV/敏感性分析方向,其 IPW 估计量的方差公式化思路可迁移到您熟悉的非参数统计和因果推断估计理论中。
  • 关键技术: inverse probability weighting, asymptotic normality, sample size formula, external control comparability, overlap coefficient
  • 为什么对您有用: 本文属于因果推断中利用外部对照的识别与估计问题,直接连接您的 primary interest 中的因果推断(IV/敏感性分析)方向。您非常熟悉的非参数统计和因果推断估计理论(IPW 估计量的渐近性质)可直接用于理解其方差公式化推导,且该框架的 5+3 参数化思路可迁移到您关注的 proximal CI 或敏感性分析设定中。中期可做:若想将类似样本量公式推广到更复杂的识别策略(如 proximal g-formula),需先在 moderately_familiar 的识别理论(如 negative control 假设)上长肌肉。

4. 2608.26411 — Marginal Structural Models for Electricity Demand under Treatment-Confounder Feedback: A Continuous-Treatment Outcome-Adaptive and Fused LASSO Approach

  • 作者: Shalini Jayanetti, Sumeet Kalia
  • 相关性 7/10 · novelty: application
  • 摘要: 本文在时间序列设定下估计温度对电力需求的因果效应,目标 estimand 是连续型温度处理对日用电量的平均因果效应,面临时间相依混杂(treatment-confounder feedback)的挑战。作者采用 marginal structural model (MSM) 结合逆概率加权 (IPW),将原本用于面板数据的 MSM 推广到单条时间序列。核心方法贡献是将 outcome-adaptive LASSO 和 adaptive fused LASSO 从二元处理扩展到连续处理:使用密度比权重 (density-ratio weights) 估计连续处理的 IPW,并用加权协方差平衡准则 (weighted-covariance balance criterion) 选择混杂变量。Monte Carlo 模拟显示,未调整回归覆盖率为 0.12–0.15,而 stabilized outcome-adaptive 估计量几乎无偏且覆盖率约 0.92。在 Ontario 2018–2019 日度数据上,所有估计量均识别出显著的正二次温度效应,但累积三日估计因 positivity 限制和空气密度共线性而偏小。对您而言,本文是连续处理 MSM 在时间序列因果推断中的一个应用实例,其 outcome-adaptive LASSO 扩展思路可能对您在高维混杂选择与因果推断交叉方向的工作有参考价值。
  • 关键技术: marginal structural model, inverse probability weighting, outcome-adaptive LASSO, adaptive fused LASSO, density-ratio weights, time-varying confounding
  • 为什么对您有用: 本文直接连接您 primary interest 中的因果推断(时间序列下的 MSM 与连续处理 IPW),且涉及高维混杂选择(outcome-adaptive LASSO),属于您 moderately_familiar 的因果推断识别理论范畴。武器库中 very_familiar 的 estimation theory in causal inference 可直接用于评估其 IPW 估计量的有限样本性质,但连续处理密度比权重的理论性质(如渐近正态性)可能需要先熟悉 outcome-adaptive LASSO 的 oracle 性质(moderately_familiar 的 M-estimation theory)。中期可做:若想深入分析其权重估计的收敛率,需先在 M-estimation theory 上补足。

5. 2608.22957 — Identification and Inference for Causal Effects in Extremes under General Conditions

  • 作者: Lisa Leimenstoll, Melanie Schienle
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文研究极端事件(尾部)中因果效应的识别与推断问题,设定为线性结构因果模型,其中创新项服从重尾正则变化分布。与现有文献不同,允许系统中变量具有异质尾部指数,并考虑潜在重尾混杂因素的存在。核心因果度量是Causal Tail Coefficient (CTC),分析其在一般条件下的渐近行为。关键发现是:轻尾混杂因素渐近可忽略,但足够重的混杂因素会产生与直接因果效应不可区分的极端依赖模式;当有合适的代理变量时,可通过调整后的CTC恢复识别。基于此,开发了极端因果关系的估计与推断程序,包括因果方向检验和重尾混杂检验,并建立了渐近性质。模拟和气候/金融极端事件的应用展示了方法有效性。对您有用:本文连接了causal inference中的identification理论与extreme value theory,其利用尾部指数异质性进行识别的思路,可与您熟悉的proximal causal inference中的negative control设定形成互补——后者处理的是均值层面的未测量混杂,而本文处理的是尾部层面的混杂识别问题。
  • 关键技术: Causal Tail Coefficient (CTC), heavy-tailed regularly varying innovations, proxy variable adjustment, extreme value theory, heterogeneous tail indices
  • 为什么对您有用: (1) 直接连接到primary interest中的causal inference子方向——identification under unmeasured confounding,但设定在尾部而非均值,提供了新的识别策略(利用尾部指数异质性)。(2) 武器库中very_familiar的estimation theory in causal inference和high-dimensional asymptotics可用于分析其CTC估计量的渐近性质(如正则变化假设下的收敛速度),而moderately_familiar的identification theory in causal inference可用于评估其proxy-based adjustment的识别条件是否可放松。(3) 中期可做:若想将本文的尾部因果识别框架与proximal CI结合(例如在negative control设定下处理尾部混杂),需先在moderately_familiar的identification theory in causal inference上长肌肉(特别是proximal g-formula的尾部版本)。

6. 2608.22608 — Estimating Pathway Treatment Effects in the Presence of Intermediate Events with Multi-State Data

  • 作者: Yuhao Deng, Haoyu Wei, Donglin Zeng, Rui Song, Xiao-Hua Zhou
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文针对临床试验中生存终点存在中间事件(如疾病进展)时的路径处理效应估计问题。中间事件作为治疗诱导的混杂因素,使得自然效应中的序贯可忽略性假设或可分离效应中的可忽略成分条件失效。作者提出对事件状态间的转移施加假设性干预来模拟治疗机制,从而调整通过中间事件的效应并边际化未观测的治疗诱导混杂。基于反事实累积发生率的有效影响函数,构建了多重稳健且半参数有效的路径处理效应估计量。该框架可检验每个转移、每个事件以及每条路径上的处理效应。通过LEADER试验数据分析,发现利拉鲁肽显著降低心血管和微血管事件风险,且全因死亡率的降低主要由其对扩展的主要不良心血管事件的影响介导。本文对您有用:它直接连接您对因果推断中纵向数据与中介分析的兴趣,且其多重稳健估计量构建与您的半参数效率理论武器库高度契合。
  • 关键技术: efficient influence function, multiply robust estimation, counterfactual cumulative incidence, multi-state model, treatment-induced confounding, hypothetical intervention
  • 为什么对您有用: 本文直接关联您对因果推断中纵向数据与中介分析的兴趣,特别是处理诱导混杂下的路径效应识别。您的半参数效率理论(very_familiar)可直接用于验证其有效影响函数推导的紧性,而您的M估计理论(moderately_familiar)可进一步分析其多重稳健估计量的有限样本表现。中期可做:需先在HOIF(moderately_familiar)上长肌肉,以拓展至更高阶的路径效应分解。

7. 2608.22570 — Optimal Experimental Design for Network Experiments under Interference

  • 作者: Zuhra F. S. Lebbe, Asim K. Dey
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文研究网络干扰下的实验设计问题,目标是在存在干扰(interference)时优化处理分配以提升因果效应估计精度。现有方法多在小规模或简化网络上评估,缺乏可扩展性。作者提出一个基于Fisher信息矩阵的最优性准则,联合考虑分配平衡与网络拓扑结构,将设计问题转化为组合优化问题。为应对大规模网络,开发了一种高效的局部搜索算法。进一步,在干扰存在下研究了总效应、直接效应和间接效应的估计性质。在Erdős–Rényi、几何随机图、优先连接和随机块模型等多种随机图模型上的模拟实验表明,网络拓扑显著影响最优处理分配。在college housing和ego-Facebook网络上的应用展示了拓扑感知设计的实际优势。对您而言,本文连接了因果推断中的实验设计与网络干扰这一重要子方向,且其优化框架与您熟悉的非参数统计和估计理论有交集。
  • 关键技术: Fisher information matrix, local search algorithm, network interference, optimal experimental design, treatment effect estimation under interference
  • 为什么对您有用: 本文直接连接您因果推断兴趣中的实验设计与网络干扰子方向。您熟悉的非参数统计和估计理论可用于分析其Fisher信息矩阵准则的渐近性质,而您在高维统计中的经验可帮助评估该局部搜索算法在大规模网络上的计算-统计权衡。中期可做:需先在identification theory in causal inference上长肌肉,以深入理解其效应估计在复杂干扰模式下的识别条件。

8. 2608.23508 — Testing selection on observables in parametric models with refreshment samples

  • 作者: Grigory Franguridi, Arie Kapteyn
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文针对面板数据中常见的样本选择问题(如流失、无应答),提出了一种在存在刷新样本(refreshment sample)时可检验“基于可观测变量选择”(MAR)假设的统计检验方法。核心思想是比较两种加权估计的分布:一种是标准逆概率加权(IPW),在MAR下有效;另一种是Hirano et al. (2001)提出的加性不可忽略性假设下的替代加权。在输入分布为参数模型时,检验统计量在原假设下收敛到广义卡方分布,该极限分布可通过Franguridi et al. (2026)的递推公式估计。蒙特卡洛模拟验证了检验的有限样本表现,并应用于Understanding America Study (UAS)数据子集。该检验为面板数据中MAR假设的合理性提供了可操作的诊断工具,对您关注的纵向因果推断中的敏感性分析有直接参考价值。
  • 关键技术: inverse probability weighting, refreshment sample, generalized chi-squared distribution, additive nonignorability, parametric models, panel attrition
  • 为什么对您有用: 本文直接关联您primary interest中的纵向因果推断与敏感性分析:它提供了在面板流失场景下检验MAR假设的正式统计检验,这是您武器库中“causal inference estimation theory”可立即应用的场景。检验统计量的极限分布推导涉及参数模型下的分布理论,与您熟悉的“hypothesis testing”和“high-dimensional asymptotics”有交集。中期可做:若想将检验推广到半参数或非参数设定(如放松参数模型假设),需先在“semiparametric theory”上长肌肉,特别是EIF和双稳健估计的构造。

9. 2608.22605 — Closed-form estimation and uniform inference in additively separable triangular models with a nonseparable first stage

  • 作者: Keita Sunada
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文研究可加可分三角模型(additively separable triangular model)中结果方程的非参数识别与估计,允许第一阶段方程不可分,且内生变量与工具变量均为连续型。在工具变量与不可观测项独立的假设下,作者证明结果函数可表示为条件累积分布函数的闭式泛函,从而得到无需正则化的plug-in估计量。该估计量收敛速度为 n^{-m/(2m+1)},其中 m 为模型施加的光滑阶数,且该速率是极小极大最优的。作者进一步利用经验bootstrap构造了结果函数在紧集上同时一致的置信带。该工作为连续IV设定下的非参数估计提供了简洁、无需调参的替代方案,对您关注的因果推断中IV方法的识别与估计理论有直接参考价值。
  • 关键技术: additively separable triangular model, nonseparable first stage, closed-form plug-in estimator, minimax optimal rate, uniform confidence band, empirical bootstrap
  • 为什么对您有用: 直接连接您 primary interest 中的 IV 因果推断方向,特别是连续IV的非参数识别与估计。该文的闭式估计量无需正则化,其极小极大最优速率可与您熟悉的 minimax bounds 工具直接对比验证。中期可做:若将方法推广到高维或多阶段设定,需先在 moderately_familiar 的 semiparametric theory 上加强(如 influence function 推导)。

10. 2608.22286 — Uniform Inference on Quantile Effects under Network Interference

  • 作者: Zequn Jin, Gaoqian Xu, Zixin Yang, Zhengyu Zhang
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文研究网络实验中分位数处理效应与溢出效应的统一推断。在平均溢出效应掩盖异质性的背景下,作者定义结构分位数效应,比较不同暴露状态下结果分布的分位数,刻画自身处理与邻居处理对结果分布不同位置的影响。基于Leung (2020)的工作,首先在度分布稳定性和网络依赖协方差结构条件下建立估计的分位数效应过程的弱收敛性。主要贡献是提出基于高斯近似的统一置信带(UCB),该置信带以实际网络为条件,避免了上述稳定性要求。通过模拟研究和尼泊尔随机储蓄账户实验(Prina, 2015)的应用评估了所提方法。该工作直接连接您对因果推断中网络干扰下处理效应异质性推断的兴趣,特别是分位数视角为溢出效应的分布特征提供了新工具。
  • 关键技术: quantile treatment effects, network interference, uniform confidence bands, Gaussian approximation, spillover effects, weak convergence
  • 为什么对您有用: 本文直接连接您对因果推断中网络干扰下处理效应异质性推断的兴趣,特别是分位数视角为溢出效应的分布特征提供了新工具。您的武器库中'非参数统计'和'因果推断中的估计理论'可直接用于理解其弱收敛条件与UCB构造,属于立即可做的阅读与潜在方法迁移方向。

11. 2608.26558 — A Unified Adaptive Enrichment Design for Power Enhancement

  • 作者: Junzhe Shao, Aibo Gong, Juan Shen, Waverly Wei
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文提出一个统一的自适应富集设计框架,用于在随机对照试验中根据中期数据动态调整入组人群,以提高检验功效。传统富集设计通常采用“选赢家”的离散规则,可能导致最终估计中的赢家诅咒偏差,且需额外偏校正。作者将富集问题形式化为一个正则化优化问题:在第二阶段通过最大化功效目标并加入KL散度惩罚项来平滑地选择入组混合分布,避免离散规则。该框架统一了预设亚组和连续协变量两种设定,且自然地扩展到连续协变量下的入组优化。估计目标为数据自适应入组规则诱导的试验人群的平均处理效应,因此不确定性量化需同时考虑入组规则学习和结局估计的随机性。作者推导了最优入组规则估计量的影响函数表示,并将其纳入最终估计,得到决策不确定性与结局估计不确定性的显式渐近方差分解。模拟表明该方法相比传统富集方法显著提高了功效,并大幅降低了赢家诅咒偏差。对您而言,该工作直接关联因果推断中的自适应试验设计和估计,其影响函数分解思路可迁移至您熟悉的因果推断估计理论(如DML中的正交得分),且入组规则优化中的KL散度惩罚与您熟悉的非参数统计中的正则化思想相通。
  • 关键技术: adaptive enrichment design, influence function, Kullback-Leibler divergence regularization, data-adaptive enrollment rule, asymptotic variance decomposition
  • 为什么对您有用: 本文直接关联您primary interest中的因果推断(自适应试验设计)和效率理论(影响函数、渐近方差分解)。技术层面,您非常熟悉的影响函数和非参数统计工具可直接用于理解其估计框架,且入组规则优化中的KL正则化与您熟悉的非参数正则化方法相通。中期可做:若想进一步改进其估计量(如引入交叉拟合或双稳健估计),需先在moderately_familiar的HOIF或semiparametric theory上长肌肉。

12. 2608.26584 — DIRECT: Decomposing Audience Preference and Creative Effect in Visual Content Analytics

  • 作者: Yizhi Liu, Balaji Padmanabhan, Siva Viswanathan
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文针对视觉内容分析中“哪些视觉选择使帖子表现更好”这一常见问题,指出传统 pooled 系数估计混淆了两种截然不同的效应:受众偏好(audience preference,因创作者风格吸引不同构成的受众)和创作效果(creative effect,创作者偏离其惯常风格时受众的反应)。作者提出 DIRECT 框架,基于面板数据的因果推断方法,结合 Mundlak 组间-组内分解与双机器学习(DML),在潜在视觉-语言处理(由 CLIP 导出的视觉风格轴)共变于创作者内部的设定下分离这两种效应。应用于 232,088 条 Instagram 美容赞助帖子(1,527 位创作者,11 个 CLIP 视觉风格轴),发现 4/11 的属性上两种效应符号相反,2/11 的属性上 pooled 系数推荐了错误的创作方向(如肤色属性:pooled 系数偏好浅色,但创作效应显示受众更偏好比创作者基线更深的色调)。在留出创作者上,按 pooled 系数推荐会损失 31% 的可实现参与度增益。本文贡献了视觉内容分析中 estimand 不匹配的诊断、从观测面板数据恢复决策相关 estimand 的框架,以及三个可移植的诊断工具。对您而言,该工作直接连接因果推断中的 estimand 识别与 DML 应用,且面板数据分解思路可迁移至您熟悉的纵向因果推断设定。
  • 关键技术: double machine learning, Mundlak decomposition, panel data causal inference, CLIP-derived visual features, estimand mismatch diagnosis
  • 为什么对您有用: 直接连接您的 primary interest 中的因果推断(identification, estimation, DML)和纵向数据设定。本文的 Mundlak 分解 + DML 框架是您 very_familiar 的 estimation theory in causal inference 和 moderately_familiar 的 identification theory 的典型应用场景,可立即可做:用您熟悉的 DML 和面板因果推断工具复现或扩展其分解逻辑至其他平台数据。

13. 2608.25930 — Controlling for Omitted Variable Bias in Deep Neural Networks

  • 作者: Manuel Pfeuffer, Roshan Prakash Rane, Kerstin Ritter, Sonja Greven
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对深度神经网络中因图像可推断协变量(如人口统计变量)与结果相关而导致的遗漏变量偏差(即“捷径学习”)问题,提出了一种控制变量方法。现有方法(如公平性约束)仅限制预测与协变量的相关性,但未能校正偏差。作者基于广义加性模型(GAM)对模型输入和协变量的效应进行建模,并引入一种估计程序:对预训练网络的最后一层进行重新拟合,使用交叉拟合与岭惩罚来纳入协变量效应。通过正交化处理排除协变量的中介效应,并对协变量分布进行边际化以控制其影响,从而得到无偏、可解释的预测。在模拟图像和真实神经影像数据(含实验诱导的混杂)上验证了该方法能一致估计真实效应,且优于现有方法。该方法为深度学习中控制已知混杂变量提供了可操作的框架,对您关注的因果推断(特别是纵向/影像数据中的混杂控制)有直接参考价值。
  • 关键技术: control variable approach, generalized additive model, cross-fitting, ridge penalization, orthogonalization, shortcut learning
  • 为什么对您有用: 本文直接回应了您因果推断兴趣中“遗漏变量偏差”这一核心问题,且聚焦于深度学习这一您可能尚未深入但日益重要的应用场景。您的武器库中“非参数统计”和“因果推断中的估计理论”可直接用于分析其GAM+交叉拟合的估计性质(如收敛率、偏差-方差权衡),而“软件工程”技能可帮助您复现或扩展其代码。中期可做:若想将方法推广至更复杂的因果结构(如时变混杂),需先在“因果推断中的识别理论”上加强。

14. 2608.24038 — CUPED on Steroids: Multivariate Covariate Adjustment for Switchback Experiments

  • 作者: Sergei Pankratev, Palash Arora
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对 switchback 实验(一种聚类随机化设计)中的方差缩减问题,扩展了经典的 CUPED 方法。传统 CUPED 仅使用单一滞后期的实验前结果作为协变量,而本文提出引入多期滞后、周期性小时编码、聚类和小时固定效应等丰富协变量集,以解释随机化单元层面的结果变异。为防范过拟合和协变量泄漏,采用交叉拟合(cross-fitting)来保证方差缩减估计的诚实性。在纽约出租车数据上的模拟和实证分析表明,该方法相比传统 CUPED 能大幅提升统计功效。文章还推导了任意协变量调整所能达到的方差缩减上限的闭式表达式,并将实证结果与该上限联系起来。对您而言,本文是因果推断中方差缩减方法的一个实用扩展,尤其适用于平台实验和聚类设计场景,其交叉拟合和协变量选择策略可直接迁移到您的纵向或聚类因果推断工作中。
  • 关键技术: CUPED, switchback experiment, cross-fitting, covariate adjustment, variance reduction, fixed effects
  • 为什么对您有用: 本文直接关联您的 primary interest 中的因果推断(实验设计、方差缩减),且其核心方法——交叉拟合和协变量集构造——与您熟悉的非参数统计和因果推断估计理论高度契合。您可以用 very_familiar 的 minimax 界工具分析其方差缩减上限的紧性,或用 moderately_familiar 的 M-estimation 理论为其交叉拟合估计量建立渐近正态性。中期可做:若想将方法推广到更一般的聚类或纵向设定,需先在 moderately_familiar 的识别理论上补足(如处理时间固定效应与个体异质性的交互)。

15. 2608.23925 — Repairing Locally Misspecified GMM: An Empirical Bayes Approach

  • 作者: Patrick Kline
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文研究当矩条件存在可交换的 n^{-1/2} 阶设定误差时,GMM 估计的修复问题。目标是在工具变量(IV)设定中,当排除限制(exclusion restriction)被轻微违反时,对目标参数进行偏差校正和精度改进。作者提出了设定误差均值和方差的估计量,并在过度识别约束数量随样本量增长的新近框架下证明了其相合性。利用这些超参数估计,构造了一个可行的偏差校正估计量,并进一步提出了一个经验贝叶斯估计量,通过从偏差校正估计量中减去一阶估计误差的最佳线性预测来弱改进精度。借助组合中心极限定理,建立了两个估计量的渐近正态性,并提供了方差估计量以实现对设定误差敏感的频率推断。模拟表明,当存在排除限制违反时,该方法能显著改进标准两阶段最小二乘(2SLS)估计。对 Angrist and Krueger (1991) 的再分析显示,修复后的教育回报估计向 OLS 方向移动,且对控制变量设定的敏感性降低。本文与您的因果推断(IV 敏感性分析)和半参数理论(设定误差下的推断)兴趣高度相关,其经验贝叶斯框架可直接应用于您熟悉的 IV 设定下的敏感性分析问题。
  • 关键技术: Empirical Bayes, Generalized Method of Moments (GMM), Bias correction, Combinatorial central limit theorem, Overidentifying restrictions, Two-stage least squares (2SLS)
  • 为什么对您有用: 本文直接连接您的因果推断兴趣中的 IV 敏感性分析子方向,处理排除限制轻微违反时的估计和推断问题。您武器库中非常熟悉的非参数统计和因果推断估计理论可直接用于理解其偏差校正机制,而 moderately_familiar 的识别理论可用于评估其 exchangeable specification errors 假设在您关注的流行病学队列研究 IV 设定中的适用性。中期可做:若想将本文方法推广到更一般的非可交换设定误差,需先在 moderately_familiar 的半参数理论上长肌肉(具体为 influence function 的局部稳健性)。

16. 2608.25426 — {poscosea} : A Computationally Efficient Sensitivity Analysis for Bayesian Models using the posterior covariance representation

  • 作者: Yusaku Ohkubo, Yukito Iba
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对贝叶斯模型在模型误设定下不确定性度量可能失真的问题,提出一种计算高效的敏感性分析方法 PosCoSeA。核心思想是利用后验协方差表示来近似 leave-k-out 诊断和 bootstrap 重抽样,从而避免重复拟合模型。该方法本质上是一种基于影响函数的近似,与频率学派中利用 efficient influence function 进行 one-step 校正的思路有相似之处。作者通过模拟研究和真实生态数据验证了方法的有效性,并提供了 R 包实现。对您而言,该方法与您熟悉的因果推断中的敏感性分析(如 proximal CI 中的 negative control 假设检验)在计算策略上有可迁移性,尤其是后验协方差近似与 influence function 的类比值得关注。不过,本文方法学 novelty 一般,主要是计算技巧上的改进。
  • 关键技术: posterior covariance approximation, leave-k-out diagnostics, bootstrap resampling, influence function approximation, Bayesian model misspecification
  • 为什么对您有用: 本文属于敏感性分析(sensitivity analysis)范畴,直接连接到您 primary interest 中的因果推断敏感性分析子方向。您武器库中 very_familiar 的 estimation theory in causal inference 中的 influence function 工具可以用于理解其近似误差,但本文是贝叶斯框架,与您熟悉的频率学派半参效率理论有距离,属于中期可做:需先在 moderately_familiar 的 semiparametric theory 上进一步理解 influence function 与后验协方差的联系。

17. 2608.22499 — Fixed-\(T\) Dynamic Spatial Panel Model with Common Shocks

  • 作者: Jushan Bai, Jesse Chieh Chen
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文研究固定时间维度(T固定)、大横截面(N大)的动态空间面板模型,该模型包含观测回归量、交互效应以及同期和滞后空间依赖。将模型视为N维联立方程系统时,交互效应引入N个单位特定载荷向量,在T固定时估计这些载荷会产生类似Nickell偏差的 incidental parameters 问题。作者提出一种新视角:将同一模型视为T方程系统(N个观测),并结合空间增强随机载荷(SERL)设定,从而得到不含单位特定 incidental parameters 的拟似然函数。估计采用计算上可行的块坐标算法。模拟显示估计误差小且覆盖概率接近名义水平。对美国县级女性劳动参与率的应用揭示了显著的动态和空间依赖,以及教育在解释女性劳动参与率上升中的重要作用。对您而言,本文处理面板数据中交互效应与空间依赖的识别策略,与您 causal inference 中 longitudinal/panel 设定下的 identification 问题直接相关。
  • 关键技术: dynamic spatial panel model, interactive effects, incidental parameters problem, quasi-likelihood, block-coordinate algorithm, spatially enriched random loadings
  • 为什么对您有用: 本文属于 longitudinal/panel 设定下的因果推断,直接连接您的 primary interest 'causal inference (longitudinal)'。其核心挑战——固定T下交互效应导致的 incidental parameters 问题——与您武器库中 'estimation theory in causal inference' 和 'identification theory in causal inference' 高度相关,您可以用 'nonparametric statistics' 的视角评估其 SERL 设定的稳健性。中期可做:若想将本文的拟似然方法推广到更一般的因果 estimand(如动态处理效应),需先在 'semiparametric theory' 上长肌肉,以处理空间依赖下的 influence function 推导。

高维统计 / 随机矩阵 (high_dim_rmt, 1 篇)

1. 2608.26366 — Regularized High-Dimensional Additive Tensor Autoregressive Model

  • 作者: Debika Ghosh, Nilanjana Chakraborty, Samrat Roy
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对高维张量时间序列,提出正则化加性张量自回归模型(RATAR),将张量的行、列、管三个方向的时序依赖建模为加性分量,替代传统的Tucker分解形式,从而提升可解释性并降低计算负担。模型假设每个方向的转移矩阵具有低秩加稀疏结构,并通过凸优化(交替块最小化)进行估计,避免了非凸优化的困难。作者证明了模型参数的可识别性,并在高维尺度下给出了有限样本误差界。模拟和真实数据实验验证了模型在预测和参数恢复上的有效性。该工作对您在高维统计与张量计算方向有直接参考价值,尤其是其凸优化框架与低秩稀疏分解的结合,可能启发您在高阶U-统计量的计算复杂度分析中引入类似的结构化正则化策略。
  • 关键技术: alternating block minimization, low-rank plus sparse decomposition, convex optimization for tensor autoregression, finite-sample error bound, additive tensor decomposition
  • 为什么对您有用: 本文直接连接您的高维统计与张量计算兴趣:其加性张量分解避免了非凸Tucker分解,与您熟悉的凸优化和低秩正则化技术高度兼容。您可以用very_familiar的minimax bound工具验证其有限样本误差界是否紧,或将其低秩加稀疏结构迁移到高阶U-统计量的计算成本模型中(如通过einsum复杂度刻画张量收缩的树宽)。中期可做:需先在moderately_familiar的HOIF理论上长肌肉,以处理张量自回归中的识别性证明。

非参数 / 半参数 (nonparam_semipara, 7 篇)

1. 2608.25468 — Functional linear regression from sparse to dense designs: a pooling-ridge method and minimax optimality

  • 作者: Shunxing Yan, Fang Yao
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文研究函数型线性回归中,预测变量和响应变量均在离散时间点观测时的最优预测问题。目标是在从稀疏到密集的任意采样方案下,实现预测风险的 minimax 最优性。核心贡献是提出一种“池化岭估计”(pooling ridge estimation),将 pooling 策略与 RKHS 方法结合,利用所有受试者的离散观测数据对算子进行无偏估计。该方法统一处理标量-函数回归和函数-函数回归两种模型,首次在理论上精确刻画了离散采样对收敛速率的影响。对于标量-函数回归,存在一个相变点,将收敛行为分为两个 regime;对于函数-函数回归,最多可能出现三个相变,取决于预测变量和响应变量的采样频率。模拟和两个真实数据实证支持了所提方法的有效性。该工作对您在高维统计和非参数理论方面的兴趣有直接关联,其 minimax 最优性分析和相变刻画为理解稀疏/密集设计下的估计效率提供了新视角。
  • 关键技术: pooling ridge estimation, RKHS-based method, minimax optimality, phase transition, sparse to dense designs, functional linear regression
  • 为什么对您有用: 本文直接关联到您的非参数统计和高维统计兴趣,其核心问题是函数型数据中离散采样下的最优预测,属于非参数理论中的 minimax 界问题。技术层面,您武器库中的 minimax bounds for estimation problems 和 high-dimensional asymptotics 可直接用于验证其声称的相变速率是否紧,或推广到更一般的协方差结构。中期可做:若想将 pooling ridge 思想扩展到因果推断中的函数型处理效应估计,需先在 moderately_familiar 的 semiparametric theory 上长肌肉(具体为 influence function 在函数型数据中的形式)。

2. 2608.25997 — Statistical Properties of Nonparametric MLE under Laplace Noise

  • 作者: Yifei Xiong, Nianqiao Phyllis Ju, Vinayak Rao
  • 相关性 7/10 · novelty: new_theory
  • 摘要: 本文研究在本地差分隐私(LDP)框架下,对添加Laplace噪声的实值观测数据,使用非参数极大似然估计(NPMLE)恢复潜在机密数据分布的问题。首先证明在Laplace卷积模型下,NPMLE可转化为有限维优化问题:支撑集限制在观测集上,原无穷维混合分布优化简化为n维凸优化(混合权重)。随后在1-Wasserstein距离下分析NPMLE的统计收敛速率,并显式建立收敛速率与隐私噪声尺度之间的联系。当噪声尺度随样本量增长慢于n^{3/16}时,NPMLE保持相合性;而当噪声尺度达到√n量级或更大时,任何估计量都无法一致恢复潜在分布。该结果刻画了隐私保护强度与分布估计精度之间的基本权衡,对您而言,其非参数MLE的有限维约化技巧和Wasserstein收敛分析思路,可迁移至您熟悉的非参数统计与逆问题框架中。
  • 关键技术: Nonparametric Maximum Likelihood Estimator (NPMLE), Laplace convolution model, 1-Wasserstein distance convergence, finite-dimensional convex reformulation, local differential privacy (LDP)
  • 为什么对您有用: 本文直接连接您primary interest中的非参数统计与逆问题方向:Laplace噪声下的NPMLE本质上是一个卷积逆问题,其有限维约化技巧(支撑集限制在观测集)与您熟悉的非参数M估计理论高度契合。从武器库看,您可以用very_familiar的minimax bounds工具验证其声称的n^{3/16}阈值是否紧,或用非参数统计中的经验过程技术分析其Wasserstein收敛速率。中期可做:若想将类似分析推广到其他噪声分布(如高斯),需先在moderately_familiar的M-estimation理论上加强。

3. 2608.24450 — Maximum effective dimension and information gain

  • 作者: David Janz, Arya Akhavan, Alexandre B. Tsybakov
  • 相关性 7/10 · novelty: sharper_rate
  • 摘要: 该论文研究核 Gram 矩阵的最大有效维度和信息增益的上界,这两个量在贝叶斯优化、高斯过程回归和核方法的 regret 分析中起核心作用。作者利用核函数或对应再生核 Hilbert 空间的逼近性质,对任意设计点集建立了通用上界。覆盖了 Matérn 核和平方指数核等三种正则性区域(光滑、中等光滑、粗糙),并证明这些上界在常数因子内不可改进。技术工具包括核的逼近宽度、特征值衰减率和覆盖数等。主要贡献是统一并改进了现有关于有效维度和信息增益的界,且证明是紧的。对您而言,该工作与高维统计和核方法的 minimax 理论直接相关,其紧界结果可用于验证您在高维设定下提出的 estimator 是否达到最优收敛速率。
  • 关键技术: kernel Gram matrix, effective dimension, information gain, approximation width, Matérn kernel, minimax lower bound
  • 为什么对您有用: 该论文直接关联您在高维统计和核方法方面的兴趣,特别是 minimax 界和逼近理论。您可以用非常熟悉的 minimax bounds 和 nonparametric statistics 工具来验证其紧界结果是否适用于您自己的 estimator 分析,属于立即可做的 follow-up。

4. 2608.23150 — Spectral stability of empirical metric-measure Laplacians

  • 作者: Vincent Divol
  • 相关性 7/10 · novelty: sharper_rate
  • 摘要: 本文研究非参数谱估计的方差稳定性问题,具体针对固定带宽 h>0 的图拉普拉斯矩阵的经验谱。给定 n 个 i.i.d. 样本,目标是比较经验加权拉普拉斯算子 Δ_{μ_n}^h 与总体版本 Δ_μ^h 的特征值,在谱间隙条件下,将相对误差界控制在 1/√(n v_μ(h)) 量级,其中 v_μ(h) 是半径为 h 的球的最小质量。该界仅需 μ 属于新引入的 coarse PI 测度类,包含度量图、具有规则边界/角点/分支点的空间上的测度,以及这些空间在 O(h) 尺度上的离散化或加厚。相比已知仅适用于流形上密度正则性 s>2 的情形,本文去掉了对数因子,改进了现有最优结果。核心工具是 empirical process 和 concentration inequality,不依赖光滑性假设。对您而言,该结果直接关联非参数统计中的 minimax 下界和谱方法稳定性,且 coarse PI 类为高维或流形外设定下的谱分析提供了新入口。
  • 关键技术: graph Laplacian, spectral stability, coarse PI measure, empirical process, concentration inequality, nonparametric spectral estimation
  • 为什么对您有用: 本文直接关联您的非参数统计与高维统计兴趣,特别是谱方法的稳定性分析。您可以用 very_familiar 的 minimax 下界工具验证其 bound 的紧性,或用 moderately_familiar 的 M-estimation 理论将 coarse PI 类与现有正则性条件对比。中期可做:若想将结果推广到更高阶 U-统计量对应的谱问题,需先在 moderately_familiar 的 higher-order U-statistics 理论上长肌肉。

5. 2608.25718 — Estimation of a regression function from dependent data by over-parametrized deep neural networks learned by gradient descent

  • 作者: Michael Kohler, Adam Krzyżak, Vincent Molinero Römer
  • 相关性 5/10 · novelty: sharper_rate
  • 摘要: 本文研究基于指数β-混合相依数据的非参数回归函数估计问题,目标是最小化关于设计分布的L2误差。采用logistic激活函数的过参数化深度神经网络作为估计器,所有参数通过梯度下降法学习。在回归函数属于(p,C)-光滑函数类的假设下,推导了期望L2误差的收敛速率。特别地,当设计分布集中在一个d维流形上时,收敛速率仅依赖于流形维数d,而与设计空间的全维度d无关。这一结果体现了深度神经网络在低维流形结构下的自适应降维能力。理论证明依赖于神经网络的逼近误差、经验过程分析和梯度下降的优化动态。对您而言,本文的非参数收敛速率分析与您熟悉的非参数统计和minimax界工具直接相关,且流形自适应速率的推导思路可能迁移到您关注的因果推断中高维协变量的降维问题。
  • 关键技术: deep neural networks, logistic activation, gradient descent, beta-mixing dependent data, manifold adaptation, minimax rate of convergence
  • 为什么对您有用: 本文连接非参数统计与深度学习的理论交叉,属于您primary interest中的非参数与半参数理论。您武器库中'非参数统计'和'minimax bounds'可直接用于验证其收敛速率是否最优,而'高维渐近'工具可帮助理解流形维数d*与样本量的trade-off。中期可做:若想将流形自适应思想迁移到因果推断中的高维协变量调整,需先在'moderately_familiar'的识别理论上补强,特别是处理相依数据下的半参数效率界。

6. 2608.22553 — Non-asymptotic Analysis of Matérn Regression: The Roles of Target and Kernel Lengthscales

  • 作者: Daniel Sanz-Alonso
  • 相关性 5/10 · novelty: new_theory
  • 摘要: 本文在周期域上对 Matérn 核回归进行了非渐近有限样本分析,目标是在准均匀设计下同时刻画目标函数长度尺度和核长度尺度对恢复精度的影响。对于无噪声插值,证明了一个 minimax 结果:设计必须足够密集以解析目标长度尺度,并且核长度尺度不能过短——若核相对于点间距太短,即使目标被良好解析,仍会残留额外误差。对于带噪声的核岭回归,推导了一个三项固定岭风险分解:目标尺度偏差、核尺度偏差和方差,并展示了岭参数优化后产生四种不同贡献。当目标光滑度不超过核光滑度的两倍时,选择比目标更长的核长度尺度不会恶化 oracle 风险,而选择过短的核则会。因此,这些分辨率条件决定了准确恢复何时成为可能,而光滑度决定了误差随后下降的速度。该结果对您在高维非参数统计和统计计算中的工作有直接参考价值,特别是当您需要理解核方法在有限样本下的实际表现与理论光滑度假设之间的差距时。
  • 关键技术: Matérn kernel, kernel ridge regression, minimax optimality, fixed-ridge risk decomposition, lengthscale resolution, quasi-uniform designs
  • 为什么对您有用: 本文直接连接您的非参数统计兴趣,特别是核回归的有限样本理论。您可以用 very_familiar 的 minimax bounds 工具验证其声称的 sharp rate 是否紧,并进一步探索核长度尺度与计算复杂度之间的 tradeoff——这是统计-计算权衡方向的一个具体切入点。中期可做:需先在 moderately_familiar 的 M-estimation 理论上长肌肉,以将本文的固定设计分析推广到随机设计或自适应采样场景。

7. 2608.25811 — Limiting properties of monotone rearrangements of estimators when the truth is flat

  • 作者: Holger Dette, Marius Kroll, Stanislav Volgushev
  • 相关性 4/10 · novelty: new_theory
  • 摘要: 本文研究单调重排估计量在目标函数平坦区域(即无局部序关系)的极限分布理论。首先,针对均匀密度的直方图估计量,证明了其非递减重排在(0,1)紧子集上以参数速率弱收敛于一个经额外确定性中心化后的高斯过程,这一结果与严格单调密度下的已知结论截然不同。其次,在独立性假设下,考虑基于经验copula增量和棋盘近似的两种重排copula估计量,证明了在适当中心化和缩放后,两者在[0,1]^2上弱收敛于一个积分高斯过程,该过程此前未见报道。进一步,利用这些结果证明了一类广泛的重排copula基相依度量的渐近正态性。该工作填补了形状约束估计量在平坦区域分布理论的空白,对非参数统计中单调性约束推断有重要理论意义。对您而言,本文涉及的非参数估计极限分布理论(empirical process、弱收敛)与您熟悉的nonparametric statistics和minimax bounds工具直接相关,且平坦区域的处理技巧可能迁移到您关注的semiparametric theory中边界或退化情形下的推断问题。
  • 关键技术: monotone rearrangement, functional weak convergence, empirical process, copula estimation, checkerboard approximation, Gaussian process limit
  • 为什么对您有用: 本文直接关联到您的primary interest中的nonparametric statistics和semiparametric & nonparametric theory,特别是形状约束估计量的分布理论。您very_familiar的empirical process和minimax bounds工具可直接用于理解其证明策略(如弱收敛论证)。中期可做:若想将平坦区域技巧推广到您moderately_familiar的semiparametric theory中的boundary问题,需先熟悉copula过程的弱收敛工具(当前武器库中未明确列出,但属于empirical process的延伸)。

数理统计 / 假设检验 (hypothesis_testing, 20 篇)

1. 2608.27320 — Evidence, Calibration, and Stability: A Triadic Framework for Hypothesis Testing Under Model Uncertainty

  • 作者: Subir Hait
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文提出 Evidence-Calibration-Stability (ECS) 框架,将假设检验的报告拆分为三个正交维度:证据(Fisherian 后验推断)、校准(Neyman-Pearson 频率性操作特性)和稳定性(模型扰动下结论反转的临界距离)。核心贡献在于:对有限维仿射扰动,推导出精确的椭球稳定性半径;对光滑非线性边际,通过一致二次余项条件给出认证下界,明确仿射公式何时仅为代理。还建立了坐标不变性和多声明的矩阵扩展,并区分了确认性校准与描述性校准剖面。模拟(单样本 t 检验、Student 睡眠数据)显示三个坐标可导向不同解读。该框架是形式化综合,而非声称证据、功效或稳健性本身是新的。对您而言,该文直接连接 hypothesis testing 和 sensitivity analysis 子方向,其稳定性半径的几何推导可视为一种新的敏感性度量工具,且与您熟悉的 minimax bounds 和 inverse problems 视角有潜在交叉——可用非参数统计中的扰动界来扩展其非线性稳定性半径的紧性分析。
  • 关键技术: stability radius, ellipsoidal perturbation, uniform quadratic-remainder condition, coordinate invariance, multiverse analysis, fragility measures
  • 为什么对您有用: 直接连接 hypothesis testing 和 sensitivity analysis 子方向。技术武器库中 very_familiar 的 nonparametric statistics 和 minimax bounds 可用于检验其稳定性半径在非参数扰动下的紧性;moderately_familiar 的 identification theory 可帮助将 ECS 框架推广到因果推断的敏感性分析中。中期可做:需先在 moderately_familiar 的 semiparametric theory 上长肌肉,以处理半参数模型下的稳定性半径推导。

2. 2608.26422 — Online detection of distributional changes for time series in metric spaces

  • 作者: B. Cooper Boniece, Lajos Horváth, Lorenzo Trapani
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文针对取值于可分度量空间的序列相关数据,提出了一个在线检测分布变化的框架。该框架基于两样本U统计量,涵盖了能量距离和最大均值差异(MMD)的序贯版本,并能够处理时间依赖性。作者建立了有限和无限监测时域下的渐近理论,刻画了原假设下完整的渐近游程长度分布,从而实现了渐近的误报控制。此外,他们为序列相关观测形成的核矩阵建立了新的谱逼近结果,并据此构建了一个可行的蒙特卡洛校准程序。灵活的窗口构造涵盖了经典、Page型和全扫描历史基线监测,能够在不要求次高斯性或高阶矩的条件下,对早期和晚期变点实现短检测延迟。模拟实验在多种时间序列模型(线性、非线性、高维、函数型)中展示了可靠的误报控制,并在多种备择假设和变点位置下,其检测延迟显著短于近期专门为快速检测设计的程序。该方法在外汇汇率、电力市场曲线和航空运输网络等实际数据上的应用,展示了其在标量、函数型和网络值时间序列上的广泛适用性。对您而言,该工作将U统计量理论(您的核心武器)与在线变点检测这一重要应用场景紧密结合,其谱逼近和蒙特卡洛校准技术可能为您的更高阶U统计量计算或因果推断中的敏感性分析提供新思路。
  • 关键技术: two-sample U-statistics, energy distance, maximum mean discrepancy (MMD), spectral approximation of kernel matrices, Monte Carlo calibration, sequential changepoint detection
  • 为什么对您有用: 本文直接关联您对假设检验和高阶U统计量的兴趣,将U统计量(您的very_familiar武器)应用于在线变点检测这一经典问题。其核心创新在于为序列相关数据下的核矩阵谱逼近提供了新结果,这可以视为对U统计量投影理论的一种扩展,您可以用您熟悉的higher-order U-statistics的treeview/einsum复杂度分析来审视其计算成本或探索更高效的变体。中期来看,该方法中的蒙特卡洛校准程序可能启发您将HOIF(moderately_familiar) 中的重抽样技术用于更复杂的因果推断敏感性分析,属于中期可做(需先在HOIF上长肌肉)。

3. 2608.25918 — Random Invariance Testing on Quadratic Form Statistics with Application to Autocorrelation

  • 作者: Amitakshar Biswas, Adam B Kashlak
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文在非参数假设检验框架下,研究二次型统计量的随机不变性检验问题,并提出一种统一的闭合形式 p 值计算方法。核心设定是:检验统计量在某个紧群(如旋转群)作用下具有不变性,通过在该群上积分得到精确或近似 p 值,从而避免大规模 Monte Carlo 模拟。作者将这一框架应用于时间序列自相关检验,提出了 Durbin-Watson 检验的非参数变体,可针对任意滞后阶数进行检验。关键技术工具是紧群上的浓度不等式(如 Hoeffding 型不等式),由此导出每个滞后阶数的解析 p 值公式。模拟实验表明,该方法在检验功效上优于经典的 Breusch-Godfrey 和 Ljung-Box 检验。实际数据应用包括识别太阳辐射强度数据中约 11 年(132 个月)周期的自相关结构。该框架可推广至其他二次型统计量的不变性检验,对您而言,其群不变性视角与您熟悉的非参数统计和假设检验方向直接相关,且闭合形式 p 值的推导思路可迁移至您在高维或 U-统计量设定下的检验问题。
  • 关键技术: randomization testing, quadratic form statistics, concentration inequalities on compact groups, Durbin-Watson test, nonparametric autocorrelation test, closed-form p-value
  • 为什么对您有用: 本文直接连接您的 primary interest 中的 hypothesis testing 和 nonparametric statistics 子方向。您武器库中 very_familiar 的 nonparametric statistics 和 high-dimensional asymptotics 可直接用于理解其群不变性框架和浓度不等式推导,且其闭合形式 p 值的思路可尝试迁移到您熟悉的 U-统计量检验问题中,例如为高阶 U-统计量构造类似的群不变性检验。立即可做:用您已有的非参数检验和浓度不等式知识即可复现和扩展其方法。

4. 2608.23793 — Approximating the null distribution of generalized distance covariance

  • 作者: Dominic Edelmann
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文研究广义距离协方差(distance covariance)零分布的高效近似问题。传统方法依赖置换检验(计算成本高)或矩匹配(尾部不精确),而该文提出直接通过双中心距离矩阵的谱来近似极限分布(加权卡方和),并首次严格证明在可分度量空间上、对一类负型距离,经验谱能一致地近似零分布,从而给出渐近有效的检验。该方法覆盖了 Hilbert-Schmidt 独立性准则(HSIC)作为特例。算法上,作者设计了自适应部分特征分解策略,将计算复杂度从 O(n³) 降至 O(k n²),并引入收缩校正以匹配前两阶矩。模拟表明,该方法是唯一在经验第一类错误收敛到名义水平上表现稳定的非 Monte Carlo 程序。对您而言,该工作直接关联假设检验与高维统计中的谱方法,且其谱近似思路可迁移至您熟悉的 U-统计量或随机矩阵理论框架下的检验问题。
  • 关键技术: distance covariance, spectral approximation, weighted chi-square, Hilbert-Schmidt independence criterion, partial eigendecomposition, shrinkage correction
  • 为什么对您有用: 本文直接关联您 primary interest 中的假设检验与高维统计(随机矩阵理论),其核心是谱近似零分布——这正是您武器库中“高维渐近”与“非参数统计”的交叉点。具体而言,您可用 very_familiar 的 minimax bounds 工具来检验该文提出的经验谱一致收敛速率是否最优,或用 moderately_familiar 的 U-统计量理论分析其检验统计量的高阶性质。中期可做:若您想将谱近似推广到更一般的核或距离(如负型距离的泛化),需先在 moderately_familiar 的 M-估计理论上长肌肉。

5. 2608.23513 — Asymptotics for Model Selection in Probabilistic Principal Component Analysis

  • 作者: Mathias Drton, Andrew McCormack, Daniel Windisch
  • 相关性 7/10 · novelty: new_method
  • 摘要: 本文研究概率主成分分析(PPCA)中主成分个数选择的模型选择问题。PPCA 在模型奇异点处 Fisher 信息矩阵不满秩,导致经典 BIC 过度惩罚而选择过少的主成分。作者利用奇异学习理论(singular learning theory)完整刻画了 PPCA 边际似然的渐近行为,推导出奇异贝叶斯信息准则(sBIC)的具体形式。sBIC 以概率趋于 1 选择最小的真实模型,同时纠正了基于维度的 BIC 的过度惩罚。该方法还扩展到 PPCA 与因子分析模型之间的选择。模拟和真实数据验证了 sBIC 的有效性。对您而言,本文展示了奇异学习理论在非标准渐近问题中的应用,与您对假设检验和模型选择的理论兴趣直接相关。
  • 关键技术: singular learning theory, singular Bayesian information criterion (sBIC), marginal likelihood asymptotics, probabilistic PCA, model selection
  • 为什么对您有用: 本文直接关联您对假设检验和模型选择的兴趣,特别是处理 Fisher 信息矩阵不满秩的非标准渐近问题。您武器库中的 minimax bounds 和非参数统计工具可用于分析 sBIC 的收敛速率是否最优,而您对高维渐近的熟悉度可帮助理解 PPCA 在高维设定下的行为。中期可做:需先在 moderately_familiar 的 M-estimation 理论上长肌肉,以处理奇异模型下的估计量渐近性质。

6. 2608.26703 — Uncertainty quantification for expectation-calibrated predictions

  • 作者: Georgios Gavrilopoulos, Johanna Ziegel
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文针对条件均值的点预测提出校准置信区间(calibrated confidence intervals),以解决现有校准文献主要关注分类和概率预测而忽略点预测校准的问题。方法基于 conformal prediction 框架,在可交换性假设下提供分布自由的有限样本理论保证,且模型无关。核心机制是依赖一个通用的分箱方案(binning scheme),作者给出了两种具体实现:数据无关的固定分箱和基于 isotonic regression 的自适应分箱。在结构假设下,基于 isotonic regression 的校准置信区间具有强渐近一致性,且区间宽度渐近趋于零。模拟和高度不平衡的保险数据集上的实证结果验证了方法的有效性。对您而言,本文的 conformal prediction 与分箱结合的技术思路可迁移至因果推断中的预测不确定性量化,例如在 IV 或 mediation 分析中为条件均值预测提供校准区间。
  • 关键技术: conformal prediction, isotonic regression, distribution-free inference, binning scheme, calibrated confidence intervals
  • 为什么对您有用: 本文连接您对 hypothesis testing 和 conformal inference 的兴趣,核心是分布自由的有限样本置信区间构造。武器库中 very_familiar 的 nonparametric statistics 可直接用于理解其分箱与 isotonic regression 的渐近性质;moderately_familiar 的 semiparametric theory 可进一步分析其效率损失。中期可做:若将分箱方案与因果推断中的 DR 估计量结合,需先在 moderately_familiar 的 identification theory 上提升,以处理条件均值在 treatment 组间的校准问题。

7. 2608.24230 — Wild Bootstrap and Efron's Bootstrap for Debiased Cox Regression

  • 作者: Lena Schemet, Sarah Friedrich-Welz
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究 Cox 比例风险模型在 Lasso 变量选择后,对 debiased 估计量进行 bootstrap 推断的问题。目标是对高维时间-事件数据中的回归系数构造置信区间,克服 Lasso 选择后经典推断的困难。方法上,作者提出了两种基于得分的 bootstrap 方案:wild bootstrap(独立乘子)和 Efron bootstrap(中心化多项重抽样权重),两者均固定原始 Cox Lasso 拟合和 debiasing 矩阵,仅对决定 debiased 估计量一阶分布的得分贡献施加 bootstrap 权重。理论部分建立了两种 bootstrap 的渐近有效性,并通过大量模拟研究了有限样本表现。结果表明,在小样本和中样本设置下,bootstrap 区间比一阶 debiased Wald 区间具有更好的覆盖精度,改进幅度取决于模拟设置和调参规则。SUPPORT2 数据集的应用展示了方法的实用性。对您而言,本文的 bootstrap 推断框架可与您在高维统计和假设检验方面的兴趣对接,尤其是其基于得分的重抽样策略可能迁移到其他 debiased 估计量的推断问题。
  • 关键技术: debiased Lasso, Cox regression, wild bootstrap, Efron bootstrap, score-based inference, high-dimensional inference
  • 为什么对您有用: 本文直接关联您在高维统计和假设检验方面的兴趣,具体涉及 Lasso 选择后 debiased 估计量的推断问题。您的技术武库中 'high-dimensional asymptotics' 和 'estimation theory in causal inference' 可直接用于分析其 bootstrap 权重方案的理论性质,例如检验其 score 贡献的渐近正态性条件是否紧。中期可做:若想将类似 bootstrap 策略推广到因果推断中的 debiased 估计(如 DML),需先在 'semiparametric theory' 上长肌肉,以处理 nuisance 估计的额外变异性。

8. 2608.23315 — Classification testing: A new framework for drawing qualitative conclusions from quantitative estimates

  • 作者: Andrew C. Eggers, Zikai Li
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文提出“分类检验”(classification testing)框架,替代传统单一假设检验。研究者预先定义若干有实质意义的定性类别(如效应方向或大小区间),检验将估计量分配到某一类别,并控制错误分类率(类似传统检验的I类错误),否则判定为无结论。该方法适用于在多个竞争性解释之间做裁决,也适用于单一研究假设——因为分类检验迫使该假设面临被证伪的可能。作者通过一个知名媒体实验数据演示了框架,并提供了R包。对您而言,该工作直接关联假设检验这一主要兴趣,其“控制错误分类率”的思路可视为对传统检验逻辑的重新审视,但方法学新颖性有限,属于应用导向的框架性工作。
  • 关键技术: classification testing, hypothesis testing, error control, qualitative conclusions, R package
  • 为什么对您有用: 直接关联主要兴趣中的假设检验方向,提供了一个替代传统p值检验的框架。武器库中的非参数统计和M估计理论可用于分析该框架在更一般设定下的渐近性质(如估计量分布非正态时的分类错误率控制)。中期可做:需先熟悉分类检验的具体操作逻辑(moderately_familiar中的M估计理论可支撑),但核心概念简单,立即可读。

9. 2608.27310 — Conformal Prediction Through the Lens of Hypothesis Testing: Universality, Impossibility, and Optimality

  • 作者: Ryan J. Tibshirani, Rina Foygel Barber, Aaditya Ramdas
  • 相关性 6/10 · novelty: new_theory
  • 摘要: 本文从假设检验的经典视角重新审视共形预测(conformal prediction)的理论基础。作者将共形预测集构造视为对 n+1 个样本联合分布可交换性原假设的置换检验的逆过程,而非通常的逐点置换 p 值反演。这一视角转换使得共形预测的普适性(universality)和不可能性(impossibility)结果可以直接由 Neyman、Lehmann、Scheffé、Kraft、Le Cam 等人的经典假设检验理论导出,无需依赖共形预测文献中的专门论证。进一步,作者利用 Neyman-Pearson 引理推导出最优性结果:对于任意协变量与响应变量 (X,Y) 的联合分布及任意样本量,在可交换分布族中达到有效覆盖且效率最高的预测集方法,是使用逆条件密度 Y|X 作为非符合性得分(nonconformity score)的共形预测器。该结果将共形预测的最优性统一到经典统计决策理论框架下。对您而言,本文展示了假设检验与预测区间构造之间的深层对偶关系,直接连接您的假设检验与数学统计兴趣,且其理论推导风格(经典 Neyman-Pearson 框架)与您的统计理论偏好高度契合。
  • 关键技术: conformal prediction, permutation test, Neyman-Pearson lemma, exchangeability, hypothesis testing duality, optimal prediction sets
  • 为什么对您有用: 本文直接连接您的 primary interest 中的 hypothesis testing 和 mathematical statistics 子方向,将共形预测这一热门方法重新置于经典 Neyman-Pearson 假设检验框架下,提供了理论统一视角。您的武器库中 very_familiar 的 nonparametric statistics 和 minimax bounds 可直接用于评估其最优性结果(逆条件密度得分)在非参数设定下的可实现性——例如,当条件密度估计需用核方法或 sieve 时,收敛速率与预测集效率之间的 tradeoff 是一个立即可做的 follow-up 问题。此外,本文的 impossibility 结果与您 moderately_familiar 的 semiparametric theory 中的效率界有潜在联系,值得中期探索。

10. 2608.27209 — Connecting Riemannian Geometry and Statistical Inference for Correlation Matrices

  • 作者: Argyn Kuketayev
  • 相关性 6/10 · novelty: new_theory
  • 摘要: 本文建立了全秩相关矩阵的商仿射度量(quotient-affine metric)Riemannian几何与Jennrich(1970)经典相关矩阵相等性检验之间的精确联系。商仿射度量是2019年引入的几何结构,其测地距离无闭式解,且此前缺乏解析的渐近零分布。作者证明Jennrich统计量中的二次型恰好是商仿射度量张量的一半,这一恒等式源于从高斯Fisher信息中消除边际标准差与商掉对角缩放执行了相同的投影操作。因此,Jennrich统计量直接评估了局部商仿射二次型。主要理论结果是:对于两个独立高斯样本且总体相关矩阵相同,经有效样本量缩放后的平方测地距离依分布收敛到4χ²_d,其中d = p(p-1)/2。当p=2时,该结果退化为两样本Fisher z检验。该工作将经典假设检验结果嵌入现代Riemannian几何框架,为相关矩阵的统计推断提供了新的几何视角。
  • 关键技术: quotient-affine metric, Jennrich's test, Fisher information metric, Riemannian geometry of correlation matrices, asymptotic null distribution
  • 为什么对您有用: 该论文直接连接您的假设检验兴趣,具体涉及相关矩阵相等性检验这一经典问题。您武器库中'非参数统计'和'高维渐近理论'可以用于推广该结果到非高斯或高维设定(例如检验稀疏相关矩阵结构)。中期可做:需先在'moderately_familiar'的M估计理论中熟悉Riemannian流形上的M估计框架,然后可尝试推导该检验在非参数设定下的效率界。

11. 2608.25288 — The Sampling Distribution of the Log-Euclidean Distance Between Sample Correlation Matrices

  • 作者: Argyn Kuketayev
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究两个独立估计的样本相关矩阵之间的对数欧氏距离(log-Euclidean distance)在原假设(总体相关矩阵相等)下的渐近抽样分布。在有限四阶矩的一般抽样条件下,缩放后的平方距离收敛到独立χ²₁变量的加权和,权重由广义Fisher变换(GFT)坐标的渐近协方差决定。在独立高斯抽样下,该分布简化为无参数的4χ²_d分布。作者提供了闭式累积量生成函数、Lugannani-Rice鞍点分位数和显式Chernoff包络(无需求根),用于校准尾部概率。一阶矩给出了原假设下基线期望距离的简单经验法则(接近独立时E[d_LE] ≲ 2√(d/n)),量化了纯估计误差导致的平均分离。文章还建立了插件一致性、显式高斯协方差分解,并将距离统计量与坐标Wald检验进行了比较,刻画了局部功效。
  • 关键技术: Log-Euclidean distance, Generalized Fisher Transformation (GFT), saddlepoint approximation, Chernoff envelope, weighted chi-square distribution, plug-in consistency
  • 为什么对您有用: 本文直接关联您的假设检验兴趣,特别是高维相关矩阵的推断问题。您武器库中的高维渐近理论(very_familiar)可以直接用于验证其加权χ²极限的紧性,而您对U-statistics的熟悉(very_familiar)可用于分析其距离统计量的高阶性质。中期可做:若想将结果推广到非高斯或高维p>n情形,需先在moderately_familiar的M估计理论(如稳健协方差估计)上长肌肉。

12. 2608.24194 — Testing for Stable Intervals in Non-Stationary Time Series

  • 作者: Florian Heinrichs
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究非平稳时间序列中是否存在稳定区间的问题。在局部平稳误差假设下,将稳定性定义为信号函数 d(t) 在长度为 δ 的区间内偏离不超过阈值 Δ,并提出检验 H0: d_∞ ≥ Δ(不存在稳定区间)vs H1: d_∞ < Δ(存在稳定区间)。估计方法采用局部线性回归,构造基于 plug-in 的检验统计量。关键理论贡献在于:通过极值集(extremal sets)形式化检验统计量的渐近分布仅由近极值窗口决定,并推导了时变长期方差下核估计量的高斯与极值逼近。检验具有相合性和渐近水平控制,且将基于上确界的相关变化检验推广到时变长期方差和导数假设。模拟与生理/工程时间序列应用验证了方法。对您而言,该文在非平稳时间序列的假设检验框架中引入了极值理论工具,与您对 hypothesis testing 和 nonparametric estimation 的兴趣直接相关。
  • 关键技术: local linear regression, extremal sets, Gaussian approximation, extreme value approximation, time-varying long-run variance, plug-in test
  • 为什么对您有用: 该文直接连接您 primary interest 中的 hypothesis testing 和 nonparametric theory,具体子方向为非平稳时间序列的结构变化检验。您的 very_familiar 武器库中的 nonparametric statistics(局部线性回归)和 high-dimensional asymptotics(极值逼近)可直接用于理解其渐近理论。中期可做:若想将检验推广到更高阶的 U-statistic 型信号(如高阶导数或积分),需先在 moderately_familiar 的 theory of higher-order U-statistics 上长肌肉。

13. 2608.26522 — Inference for High-Dimensional Network Data

  • 作者: Yuya Sasaki, Baoning Zheng
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文针对高维网络依赖数据提出一种新的推断方法。依赖结构通过基于图距离的函数型依赖度量来刻画,使得近似理论能够捕捉依赖衰减与网络邻域增长之间的相互作用。在有限矩和 sub-Weibull 条件下,建立了最大模的高斯近似结果,给出了维度随网络规模增长时的显式条件。同时提出高维网络 HAC 协方差估计量并证明其收敛性,从而得到可行的同时推断程序。模拟实验展示了良好的有限样本表现。应用部分通过构建条件溢出效应函数的置信带,研究溢出效应如何随网络同质性指数变化,揭示了传统低维推断难以发现的异质性和局部显著性。
  • 关键技术: functional dependence measure, Gaussian approximation for maxima, network HAC covariance estimator, sub-Weibull tail conditions, simultaneous inference
  • 为什么对您有用: 本文直接连接您对高维统计推断和假设检验的兴趣,特别是网络依赖数据下的高斯近似理论。您熟悉的非参数统计和 minimax 界工具可用于分析其近似误差的紧性;而您 moderately_familiar 的 M-估计理论可帮助评估其 HAC 估计量的有限样本表现。中期可做:需先在 moderately_familiar 的 semiparametric theory 上加强,以处理更复杂的网络依赖结构。

14. 2608.23257 — How Replicable Are Statistically Significant Findings?

  • 作者: Patrick Vu, Stefan Faridani
  • 相关性 6/10 · novelty: new_method
  • 摘要: 本文研究在实证科学中,恰好达到常规显著性阈值(如 p=0.05)的发现,在相同样本量的重复研究中保持显著的概率。作者定义了“期望复制概率”(expected replication probability),即给定原始 p 值条件下复制研究得到显著结果的概率,并利用实验经济学、心理学和社会科学已发表研究的 p 值分布进行估计。通过对比实际复制结果(如 Many Labs 项目),验证该估计量优于预测市场的预测能力。核心发现:p=0.05 的发现,其复制概率在各领域仅 0.10–0.25,且低复制性主要源于原始研究的低统计功效(power),而非发表偏倚。作者进一步开发了一个非参数估计器,并将其应用于使用更大样本的经济学文献,发现复制概率虽有提高但仍偏低。结论是单一研究的统计显著性仅提供提示性证据,需要累积证据才能得出更强结论。对您而言,本文直接关联假设检验与统计功效的实践问题,其非参数估计方法可迁移至您熟悉的因果推断中敏感性分析或复制性评估场景。
  • 关键技术: replication probability estimation, nonparametric estimator, p-value distribution, statistical power, publication bias adjustment
  • 为什么对您有用: 本文直接关联您 primary interest 中的假设检验(hypothesis testing)和统计功效问题,属于您 very_familiar 的非参数统计与 minimax bounds 工具可覆盖的领域。具体而言,文中非参数估计器的构造思路可迁移至您熟悉的因果推断中复制性评估或敏感性分析(如 E-value 的扩展),且其基于 p 值分布的反事实推理框架与您 moderately_familiar 的 identification theory 有交叉。立即可做:您可用 very_familiar 的非参数统计工具(如经验过程、U-statistic 投影)分析该估计量的收敛速率或构造置信区间,无需额外学习新武器。

15. 2608.25272 — Valid test for multi-arm trials with generalized linear models under covariate-adaptive randomization

  • 作者: Guannan Zhai, Feifang Hu
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文研究协变量自适应随机化(CAR)下多臂试验中广义线性模型(GLM)端点的假设检验问题。首先,理论分析表明,当工作模型因遗漏协变量而误设时,标准Wald z统计量不收敛到标准多元正态分布,导致I类错误率膨胀或保守,且该行为依赖于GLM的具体类型(如logistic vs. Poisson)。其次,基于上述渐近结果,提出调整后的检验统计量,修正分布偏差,并将其与Simes型多重比较程序结合以控制族系I类错误率。方法核心是推导误设模型下z统计量的联合渐近分布,并构造校正项。模拟和转移性乳腺癌试验实例验证了方法的有效性。对您而言,本文提供了CAR框架下假设检验的严谨理论,直接连接您对hypothesis testing和causal inference(试验设计)的兴趣,且其误设模型下的渐近分析思路可迁移至您熟悉的M-estimation理论。
  • 关键技术: covariate-adaptive randomization, generalized linear model, Wald z-statistic, model misspecification, Simes-type multiple testing, asymptotic distribution
  • 为什么对您有用: 本文直接连接您对hypothesis testing和causal inference(试验设计)的兴趣,具体涉及CAR下多臂试验的检验问题。您武器库中very_familiar的M-estimation theory可直接用于理解其误设模型下的渐近推导,并可尝试用higher-order U-statistics的视角分析其调整统计量的高阶性质。中期可做:需先在moderately_familiar的semiparametric theory上进一步熟悉,以处理更一般的GLM误设情形。

16. 2608.22554 — Detection of Cognitive Diagnostic Model Misspecification using New Lancaster-Chesher Information Matrix Tests

  • 作者: Richard M. Golden, Reyhaneh Hosseinpourkhoshkbari
  • 相关性 5/10 · novelty: application
  • 摘要: 本文针对认知诊断模型(CDM)的模型误设定检测问题,提出基于信息矩阵(IM)等式的新型检验方法。核心思想是:若模型正确设定,则对数似然一阶导与二阶导给出的渐近协方差矩阵估计应一致;White (1982) 的经典检验通过比较两者来检测误设定,但自由度随参数维数增长。本文扩展 Presnell & Boos (2004) 的工作,利用 Golden et al. (2013, 2016) 的方法构造仅需 1 或 2 自由度的检验统计量,适用于复杂 CDM 模型。检验统计量具有解析形式,无需计算密集的 bootstrap 模拟。模拟研究表明,该检验在 CDM 模型和实际数据场景下具有良好的第一类错误控制和检验功效。对您而言,该工作属于假设检验中模型诊断的经典方向,其核心在于用低自由度检验解决高维参数模型误设定检测,与您对 hypothesis testing 的兴趣直接相关。
  • 关键技术: Information Matrix equality test, White's misspecification test, Presnell-Boos test, Cognitive Diagnostic Models, low-degree-of-freedom test
  • 为什么对您有用: 本文属于 hypothesis testing 子方向,具体是模型误设定检测的经典问题。您的武器库中 nonparametric statistics 和 high-dimensional asymptotics 可用于分析其检验统计量的渐近性质(如检验功效的 minimax 最优性),但该文核心是低自由度检验在特定参数模型(CDM)中的应用,方法学 novelty 有限,属于成熟技术的应用拓展。暂不可做:核心机器(CDM 模型的具体结构、IM 等式检验的解析推导)不在您武器库中,且该方向与您主要兴趣的交叉点较窄。

17. 2608.23960 — Learning from Uncertainty-dependent Missing Labels for Semi-supervised Classification

  • 作者: You-Gan Wang, Jinran Wu, Geoffrey J. McLachlan
  • 相关性 5/10 · novelty: new_theory
  • 摘要: 本文研究半监督分类中标签缺失概率依赖于后验分类不确定性的设定。目标是在给定特征下,利用缺失指示器作为可观测信号来改进分类器估计。作者发展了基于似然的信息理论,推导了正确设定下的Fisher信息分解,将部分标签成分与非负的机制曲率项分离。在联合误设定下,给出了Godambe-Eicker-Huber-White敏感性和三明治协方差分解。关键结论是:有利的缺失机制可以比完全标注或预算匹配的非信息性标注基线提供更多信息,但不能超过同时观测标签和机制指示器的增强实验。对于plug-in分类器,信息分解与基于边界的超额风险界相联系,在正则双成分混合设定下得到参数化n^{-1}超额风险率。该工作与您的假设检验和半监督学习兴趣相关,其信息分解框架可迁移到因果推断中的缺失数据问题。
  • 关键技术: Fisher information decomposition, Godambe-Eicker-Huber-White sandwich covariance, semi-supervised classification, missing not at random, excess-risk bounds
  • 为什么对您有用: 本文连接您的假设检验兴趣,其信息分解框架可应用于因果推断中的缺失数据敏感性分析。武器库中'非参数统计'和'高维渐近'可用于验证其信息界是否紧。中期可做:需先在'半参数理论'上提升,以处理更复杂的缺失机制模型。

18. 2608.22165 — Robust Scale Estimation in Additive Noise via Weighted Order Statistics

  • 作者: Jorge González Cázares, Arturo Jaramillo
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对加性噪声中尺度参数的非参数稳健估计问题,提出一类基于加权顺序统计量的方法。设定为弱稀疏系统,噪声序列无需独立、特定相依性或时间正则性假设。核心机制是利用排序观测值与参考噪声分布生成的确定性或随机代理进行比较,通过纯空间方法避免预滤波或时间去相关,从而保留潜在信号的稀疏结构。建立了加权损失函数的非渐近浓度不等式,其界限将信号贡献与有序噪声和代理之间的差异分离。进一步在独立和相关噪声场景(包括重尾参考分布)下控制代理差异。最后应用于连续时间随机过程的高频观测,为分数布朗运动和稳定Lévy噪声在低变差加性扰动下提供尺度估计。该方法对高维统计中噪声尺度估计的稳健性有直接参考价值。
  • 关键技术: order statistics, weighted loss functions, non-asymptotic concentration inequalities, proxy discrepancy control, heavy-tailed reference laws
  • 为什么对您有用: 本文直接关联高维统计中的稳健估计问题,其非参数框架和浓度不等式技术可用于改进稀疏信号恢复中的噪声尺度估计。武器库中'高维渐近理论'和'非参数统计'可直接用于分析其估计量的收敛速率,属于'立即可做'的范畴。

19. 2608.23064 — Sequentially valid inference for probabilistic inflation forecasts

  • 作者: Amadeo Grob, Maurizio Daniele, Johanna Ziegel
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对宏观经济预测中概率校准的序贯评估问题,提出基于 e-value 的序贯检验方法。传统固定样本检验无法在数据持续到达时保持有效性,而 e-value 方法允许在任意停止时间下进行有效推断(anytime-valid inference)。作者将这一框架应用于美国、欧元区和瑞士的通胀概率预测,发现序贯检验能在重大结构断裂期间捕捉到静态全样本检验遗漏的校准失效信号。方法核心是构造一个在零假设下为鞅的 e-process,从而保证连续监测下的错误控制。实证结果表明,序贯诊断能揭示预测失准的时间点和具体模式,对宏观预测评估具有实用价值。该工作连接了假设检验与时间序列预测评估,对您在高维假设检验和因果推断中的序贯分析(如纵向数据)有参考意义。
  • 关键技术: e-values, anytime-valid inference, sequential testing, probabilistic forecast calibration, martingale-based testing
  • 为什么对您有用: 本文属于假设检验方向,直接对应您 primary interest 中的 'hypothesis testing'。e-value 方法为序贯检验提供了新工具,可迁移至您熟悉的因果推断中的敏感性分析或纵向数据检验。武器库中 'nonparametric statistics' 和 'high-dimensional asymptotics' 可支撑理解其鞅构造与收敛性质,属于立即可做的阅读——无需额外工具即可评估该方法在您已有问题中的适用性。

20. 2608.26421 — Dimension comparison for Student's statistic under symmetric unimodality

  • 作者: Jacopo Lenzi
  • 机构: University of Bologna
  • 相关性 4/10 · novelty: new_theory
  • 摘要: 本文研究 Student t 统计量在对称单峰分布下的尾部概率比较问题,核心设定是比较均匀分布与一般对称单峰分布的自归一化和的尾部行为。方法上,利用 Edgeworth 展开在临界点 r=3 处首项消失的特性,在移动边界 r_n=3+λ/n 下推导出 n 维与 n-k 维尾部概率差的首非零项收敛到显式相曲面 H_δ(λ),其零曲线统一了固定、次线性与固定比例删除三种情形。通过 Khintchine 尺度混合表示,构造了一个紧支撑 C^∞ 对称单峰母分布,使得其 Student 尾部在足够大 n 下始终超过等尺度均匀分布的尾部。同时,分位数比序表明均匀分布最大化所有偶数矩及非负系数偶幂级数。还导出了固定置信度的维数展开及 n=6 处的精确反转。该结果对您在高维假设检验中理解 Student t 统计量的分布敏感性有直接参考价值。
  • 关键技术: Edgeworth expansion, self-normalized sum, Khintchine scale-mixture representation, phase surface, quantile-ratio order
  • 为什么对您有用: 本文直接关联您对假设检验的兴趣,特别是 Student t 统计量在高维设定下的分布行为。您武器库中'高维渐近'和'非参数统计'可直接用于验证其 Edgeworth 展开的精度或推广到其他对称单峰族。中期可做:若需将结果推广到非对称或重尾情形,需先在 moderately_familiar 的 M-估计理论上长肌肉。

统计计算 / 算法 (stat_computing, 6 篇)

1. 2608.27191 — Personalized Federated Learning for Tensor Regression

  • 作者: Kejun Chen, Xianqi Wei, Qianqian Zhu
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文提出一个个性化联邦张量回归框架,同时处理数据隐私、高维度和客户端异质性三个挑战。每个客户端的系数张量被分解为一个全局共享的低Tucker秩成分和一个局部稀疏偏差,通过两阶段隐私保护程序估计。作者建立了有限样本上界和极小化下界,量化了隐私-精度权衡,并证明了初始化与秩选择步骤的一致性。模拟实验表明,当各客户端数据稀缺时,联邦方法在估计和预测上优于纯局部方法;基于MRI的ADHD研究展示了其在真实隐私约束下的强性能。对您而言,该工作将张量回归与联邦学习结合,其低秩分解与稀疏偏差的设定可启发您在higher-order U-statistics计算中利用类似结构降低通信成本。
  • 关键技术: Tucker decomposition, federated learning, differential privacy, minimax lower bound, sparse deviation, low-rank approximation
  • 为什么对您有用: 该论文连接您的stat_computing兴趣,特别是张量分解与隐私保护联邦学习的结合。您武器库中very_familiar的higher-order U-statistics(treewidth/tensor contraction/einsum)可直接用于分析其低Tucker秩分解的计算复杂度与通信效率,中期可做:需先在moderately_familiar的identification theory上理解联邦设定下的参数可识别性。

2. 2608.25304 — SAUSS: Stochastic Approximation with Unbiased Simulated Scores for Limited Dependent Variable Models

  • 作者: Sokbae Lee, Yuan Liao, Myung Hwan Seo, Youngki Shin
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对多类别选择模型等有限因变量模型,提出了一种基于随机逼近的无偏模拟得分方法(SAUSS)。传统模拟极大似然估计因固定模拟次数引入偏差,且每次优化需全样本似然计算,计算成本高。SAUSS 在每次迭代中使用固定大小的 mini-batch 和条件无偏的模拟得分估计,避免了全样本计算。对于多项 probit 模型,接受-拒绝采样提供精确的条件抽样和无偏得分估计。在温和条件下,建立了平均估计量和迭代部分和过程的渐近理论,支持随机尺度推断和插件推断。模拟和实证表明,SAUSS 在不到模拟极大似然 1% 的计算时间内得到可比结果。该方法可推广至具有条件期望得分表示和精确条件抽样的有限因变量模型。对您而言,本文是统计计算中随机逼近与模拟方法结合的典型案例,其 mini-batch 无偏得分估计策略可启发您在高维或因果推断中设计计算高效的估计器。
  • 关键技术: Stochastic Approximation, Unbiased Simulated Scores, Mini-batch, Accept-Reject Sampling, Multinomial Probit, Averaged Estimator
  • 为什么对您有用: 本文属于统计计算方向,直接连接您的 primary interest 中的 statistical computing。其核心武器——随机逼近与 mini-batch 无偏得分——与您 very_familiar 中的软件开发和 high-dimensional asymptotics 有交集:您可以用高维渐近工具分析其 mini-batch 方差对估计量的影响,或用 einsum 框架优化其模拟得分计算。中期可做:若想将类似策略推广到因果推断中的半参数估计,需先在 moderately_familiar 的 semiparametric theory 上长肌肉(如 influence function 的 mini-batch 无偏估计)。

3. 2608.23802 — Graph-dependent shrinkage priors for Bayesian trend filtering

  • 作者: Andrea Mascaretti, Daniel R. Kowal
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文提出一种贝叶斯图趋势滤波框架,将图结构同时用于趋势估计、局部收缩先验和MCMC采样算法。核心贡献在于:1)在趋势项中引入图拉普拉斯惩罚以实现平滑和插值;2)设计图依赖的局部收缩先验(如Horseshoe型),增强对突变点的适应性并保证后验proper;3)利用图的稀疏/带状结构实现可扩展的MCMC推断。理论部分分析了先验的局部浓度和适应性,并给出了后验proper的条件。模拟表明,相比频率派和贝叶斯替代方法,该方法在点估计精度、区间估计宽度和计算效率上均有优势。应用案例为美国县级失业率数据的时空建模与预测。对您而言,本文展示了如何将图结构嵌入贝叶斯分层模型以同时提升统计效率和计算可扩展性,与您对统计计算(稀疏矩阵算法)和软件开发的兴趣直接相关。
  • 关键技术: graph trend filtering, shrinkage priors, sparse MCMC, banded matrix operations, local adaptivity
  • 为什么对您有用: 本文属于统计计算方向,核心是图结构在贝叶斯模型三环节(趋势、先验、采样)中的系统利用。您的武器库中'软件开发和稀疏矩阵算法'可直接用于复现或扩展其MCMC实现(如验证带状Cholesky分解的效率)。中期可做:若想将图依赖先验推广至更高阶结构(如张量图),需先在moderately_familiar的HOIF或U-statistics理论上长肌肉。

4. 2608.22627 — A general-purpose sensitivity method for multiple simultaneous parameter perturbations in stochastic reaction networks

  • 作者: David F. Anderson, Jingyi Ma
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文针对随机反应网络(连续时间马尔可夫链模型)中的灵敏度估计问题,提出了一种新的耦合构造方法——多路径堆叠耦合(MSC)。现有方差缩减耦合通常只针对一对参数路径,当需要同时估计多个参数扰动下的灵敏度时,重复使用会导致效率低下或需要应用特定的选择。MSC 是一种时空泊松构造,能够联合生成任意有限个参数化路径,且每一对边际分布与对应的分裂耦合对具有相同分布,从而直接继承已有的方差界。在有限状态空间下,本文还给出了有限差分分子均值和二阶矩的一阶展开。MSC 被应用于三个实际场景:同时估计多个一阶导数、使用更宽有限差分模板估计单个一阶导数、以及估计高阶导数。在磷酸化网络上的数值实验表明,MSC 在所有三个应用场景中均取得了最小的均方根误差。该工作对您作为统计计算方向的研究者具有参考价值,特别是其耦合构造思路可迁移到您熟悉的软件开发和逆问题计算中。
  • 关键技术: multi-path stacked coupling, Poisson construction, finite-difference sensitivity estimation, variance reduction, stochastic reaction networks
  • 为什么对您有用: 本文属于统计计算方向,直接对应您的 primary interest 中的 statistical computing。其核心贡献是一种通用的耦合构造方法,可被您熟悉的软件开发技能实现为通用工具。目前属于中期可做:您需要先在 moderately_familiar 的 M-estimation 理论中熟悉耦合的方差分析框架,才能将 MSC 思路推广到其他随机系统(如流行病学模型)的灵敏度估计。

5. 2608.23075 — When a neural surrogate cannot accelerate a solver: runtime share, closed-loop drift, and the economics of uncertainty gating in a stiff coupled simulation

  • 作者: L. Thümmler, T. Kuroda
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文报告了一个受控的端到端负结果,指出用神经网络代理加速多物理场耦合仿真时存在的三个结构性障碍,且这些障碍与网络本身质量无关。测试平台是广义相对论辐射流体力学代码中的隐式牛顿求解器,其最昂贵的物理例程每次调用占16.9%的临界路径墙钟时间,根据Amdahl定律,任何代理加速上限仅为1.2倍。即使代理每次调用便宜5.8倍,也只能达到与原始求解器持平的性能,而无需回退的稳定配置仅能达到同等水平。离线精度无法有效排序代理的部署性能:14个网络的池化Spearman误差与存活率相关性(rho=+0.73)是组间混杂,在控制条件下消失(rho=-0.04)。正确的分布外门控机制无法加速一个离开训练分布的循环:由于访问状态偏离数据流形73倍,门控延迟了96.8%至99.7%的单元,几乎不随代理质量变化,计入自身成本后导致0.94至0.96倍的减速。稳定性与保真度分离:一个永不崩溃的门控运行在6000步内累积了-19.9%的线性密度偏差,这是一种定向的弹道累积偏差,而非自回归文献关注的方差驱动发散。该结果对您作为统计计算方向的研究者具有直接参考价值,特别是关于计算-统计权衡中代理模型实际加速能力的量化分析。
  • 关键技术: Amdahl's law, surrogate modeling, out-of-distribution detection, runtime profiling, autoregressive error accumulation
  • 为什么对您有用: 本文直接关联您的统计计算兴趣,特别是计算约束下的统计方法(computationally constrained statistics)这一子方向。它提供了一个具体的负结果案例,展示了代理模型加速的瓶颈(Amdahl定律、分布偏移、门控成本),这与您武器库中'软件开发和逆问题'的经验可结合:您可以用profiling工具复现其运行时分析,或用U-statistic的树宽视角分析其误差累积的统计结构。中期可做:需先在moderately_familiar的M-estimation理论上长肌肉,以形式化其偏差的统计性质。

6. 2608.27063 — An Accurate and Single-Communication Federated Inference Algorithm

  • 作者: Laura Montagnani, Anthony CC Coolen, Marianne A Jonker
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文提出一种单次通信的联邦推断算法,用于多机构联合分析,特别适用于罕见病等小样本场景。该方法基于三阶泰勒展开来近似局部对数似然函数,相比已有的二阶展开方法能更好地捕捉似然函数的偏度等高阶特征。算法仅需一次汇总统计量交换,无需迭代通信,兼顾隐私保护与计算效率。模拟实验基于真实数据,重点考察了小局部样本量下的表现,结果显示三阶近似显著提升了推断精度。该方法在保持通信效率和隐私保护的同时,为联邦统计推断提供了更准确的替代方案。对您而言,该工作涉及高阶似然近似与统计计算,与您对统计计算(numerical methods)的兴趣直接相关,且其单次通信框架可启发分布式环境下的因果推断方法设计。
  • 关键技术: federated inference, third-order Taylor expansion, summary statistics exchange, privacy-preserving inference, small sample inference
  • 为什么对您有用: 本文属于统计计算(federated inference)方向,直接对应您的 primary interest 中的 statistical computing。其核心是使用高阶泰勒展开(三阶)改进似然近似,这与您熟悉的 higher-order U-statistics 中的高阶展开思想有潜在联系——您可以用 treewidth / tensor contraction 的视角分析三阶展开的计算成本(非常熟悉)。中期可做:若想将类似框架推广到因果推断(如分布式 IPW 或 DR 估计),需先在 moderately_familiar 的 semiparametric theory 上加强。

天体统计 (astrostats, 6 篇)

1. 2608.23534 — Strong Lensing Cosmology with Population-level Calibrated Neural Ratio Estimation

  • 作者: Sreevani Jarugula, Brian D. Nord, Aleksandra Ćiprijanović, Shubhendu Trivedi
  • 机构: Fermi National Accelerator Laboratory · Brown University · Massachusetts Institute of Technology
  • 相关性 7/10 · novelty: application
  • 摘要: 本文研究利用强引力透镜系统推断宇宙学参数(暗能量状态方程参数 w 和总物质密度 Ω_m)的问题。在下一代巡天将产生约 10^5 个星系-星系透镜系统的背景下,传统高维似然拟合面临计算瓶颈。作者采用神经比率估计(NRE)方法,通过模拟数据训练神经网络直接估计似然比,从而避免显式建模似然函数。关键创新在于引入事后后验覆盖校准(post hoc posterior coverage calibration)步骤,以缓解神经密度估计中常见的模型过度自信问题。实验表明,随着推断群体规模增大,两个参数的误差均下降;在标准 ΛCDM 宇宙下,100 个透镜样本的校准 NRE 模型对 w 的中位分数不确定度为 22.8%,对 Ω_m 为 2.9%。该工作为未来大规模巡天数据的高效宇宙学参数推断提供了一个可扩展的 proof-of-concept。对您而言,这是一篇优秀的 astrostatistics 入门读物:它清晰展示了天文数据(图像+光谱)的结构、模拟生成流程、以及一个统计学家会感兴趣的推断问题(高维似然不可解时的替代方案),且 exposition 对 outsider 友好。
  • 关键技术: Neural Ratio Estimation (NRE), post hoc posterior coverage calibration, simulation-based inference, population-level likelihood-free inference
  • 为什么对您有用: 本文属于 astrostatistics 的 gateway reading。它满足入门读物的所有条件:(a) 对 outsider 友好——不假设天文背景,清晰解释了强引力透镜的科学问题和数据生成过程;(b) 明确阐述了天文学家关心的更大科学问题(宇宙加速膨胀的测量);(c) 提出了一个真正的统计推断问题(高维似然不可解时的替代方案),且方法学(NRE + 校准)有统计学家可参与改进的空间。武器库方面:您对 simulation-based inference 不熟悉,但 nonparametric statistics 和 minimax bounds 的背景足以理解其核心思想(用神经网络逼近似然比)。本文值得花时间全文阅读,作为进入 astrostatistics 方向的起点。

2. 2608.27192 — Optimal transport regularized dynamic radio interferometric reconstruction

  • 作者: Andy Nilipour, Kotaro Moriyama, Shiro Ikeda, Kazunori Akiyama, Mareki Honma
  • 相关性 5/10 · novelty: application
  • 摘要: 本文提出一种基于最优传输(OT)距离的正则化方法,用于动态射电干涉成像(VLBI)的视频重建。在正则化最大似然(RML)框架下,OT正则项能更自然地捕捉物理运动信息,促进重建帧间的连贯动态,优于传统正则化项。作者在模拟的Sagittarius A*(银河系中心超大质量黑洞)的Event Horizon Telescope(EHT)观测数据上进行了测试,包括几何模型和广义相对论磁流体动力学模型。结果表明,加入OT正则项显著提升了动态重建质量,具体表现为轨道运动恢复更好、动态交叉相关指标更高。本文对您作为统计学家而言,是一篇很好的天文统计入门读物:它清晰阐述了VLBI数据生成机制(稀疏傅里叶采样、噪声结构)和重建问题的逆问题本质,并展示了如何将计算最优传输这一统计/机器学习工具应用于实际天文成像问题。
  • 关键技术: optimal transport regularization, regularized maximum likelihood (RML), very long baseline interferometry (VLBI), dynamic video reconstruction, Event Horizon Telescope (EHT)
  • 为什么对您有用: 本文属于astrostats的gateway reading,适合作为统计学家进入射电干涉成像领域的入门材料。它清晰交代了VLBI数据结构和重建问题的统计模型(稀疏傅里叶测量、噪声、正则化),并引入计算最优传输这一与您武器库中'非参数统计'和'逆问题'有交集的方法。作为入门读物,它值得花时间读全文以了解天文成像的数据挑战和现有方法框架,但短期内不直接产生可迁移的方法学问题。

3. 2608.22245 — Variational Bayesian Inference for the Spectral Structure of LISA Noise

  • 作者: Jianan Liu, Avi Vajpeyi, Renate Meyer, Jeung Eun Lee, Patricio Maturana-Russel
  • 相关性 5/10 · novelty: application
  • 摘要: 本文针对未来空间引力波探测器LISA的噪声谱密度矩阵估计问题,提出了一种基于平均场随机梯度变分贝叶斯(SGVB)的快速后验近似方法。在 blocked Whittle 似然的特征基表示框架下,作者对逆谱密度矩阵进行 Cholesky 分解,并用余弦基函数建模频率依赖的系数,辅以折扣正则化 horseshoe 先验。与 Hamiltonian Monte Carlo (HMC) 相比,SGVB 在自回归和移动平均过程的模拟中给出了接近的后验中位数谱估计,但计算成本大幅降低。在一年时长、固定延迟、平稳噪声的 LISA 模拟数据上,SGVB 的谱密度估计与 HMC 及 Welch 估计在 LISA 分析频段内一致。结果表明 SGVB 为长时段多变量 LISA 噪声分析提供了一种可扩展的贝叶斯方法。作为 astrostatistics 的入门级阅读,本文清晰阐述了数据结构(多通道时延干涉、长时段、相关噪声)和模型(Whittle 似然、Cholesky 分解、基函数先验),适合统计学家了解引力波数据分析中的实际谱估计挑战。
  • 关键技术: Stochastic Gradient Variational Bayes (SGVB), Blocked Whittle Likelihood, Cholesky Factorization, Regularized Horseshoe Prior, Spectral Density Estimation
  • 为什么对您有用: 本文属于 astrostatistics 的 gateway reading:它清晰展示了 LISA 引力波探测中多通道噪声谱估计的数据结构(长时段、相关噪声)和模型框架(Whittle 似然 + 贝叶斯先验),对不熟悉天文学的统计学家友好。武器库中的非参数统计和软件工程能力足以理解其方法,但核心的变分推断(SGVB)和谱估计细节属于新领域,暂不可做直接迁移;值得花时间读全文以了解引力波数据分析的统计问题全貌。

4. 2608.26524 — Background Intensity Estimation for Cassini-ISS Image Using Deep Learning-Based Diffusion Model

  • 作者: Yongxin Chen, Qingfeng Zhang, Tianle Zhou, Kai Tang
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对卡西尼号ISS图像中土星环系统背景强度估计问题,提出基于去噪扩散概率模型(DDPM)的深度学习框架。传统多项式拟合和统计方法在非均匀背景(如环隙区域、散射光)下因假设不匹配而失效,导致估计偏差且泛化性差。DDPM通过学习噪声模式并迭代重建背景,在环隙区域将背景强度估计误差相对多项式拟合降低62%。应用于环隙中未解析卫星的质心定位时,DDPM背景估计使线方向位置精度提升约14%,样本方向提升约15%。该框架自动捕捉空间相关性,无需手动调参,能泛化至多种背景类型。对您而言,这是一篇典型的astrostatistics入门级应用论文,清晰展示了天文成像中一个具体的数据分析问题(背景估计)及其深度学习解决方案,适合作为了解该领域数据结构和建模挑战的起点。
  • 关键技术: Denoising Diffusion Probabilistic Model (DDPM), background intensity estimation, astrometric centroiding, iterative noise-to-background reconstruction
  • 为什么对您有用: 本文属于astrostatistics gateway reading,清晰阐述了天文成像中背景估计这一核心数据预处理问题,并展示了DDPM这一现代生成模型的应用。作为入门读物,它很好地满足了(a)可访问性——不假设天文术语,(b)数据侧描述清晰(ISS图像结构、噪声、环隙区域),(c)问题本身值得统计学家关注——背景估计是许多天文测量(测光、天体测量)的基础步骤。武器库方面,您目前没有深度学习或扩散模型的直接工具,但本文作为概念性了解是合适的,暂不可做后续方法改进,但值得花时间读全文以拓宽对天文数据分析问题的认知。

5. 2608.26227 — Alfred: A Flexible, User-Friendly Python Package for Exoplanet Confirmation

  • 作者: Maxwell A. Kroft
  • 相关性 4/10 · novelty: application
  • 摘要: 本文介绍 Alfred,一个用于系外行星探测与确认的开源 Python 软件包。在 TESS 任务时代,大量候选行星需要后续观测与统计确认,而现有工具灵活性不足。Alfred 支持同时拟合凌星(transit)和径向速度(radial velocity)数据,适用于任意行星系统。软件采用 MIT 许可,可通过 pip 安装,文档正在完善中。该包主要面向天文学家,提供模块化、用户友好的接口,降低多望远镜数据联合分析的门槛。作为软件工具论文,方法学 novelty 有限,但填补了社区工具链的空白。对您而言,这是一篇 astrostatistics 方向的入门级 gateway reading,可了解系外行星确认的数据分析流程和软件生态。
  • 关键技术: transit fitting, radial velocity fitting, exoplanet confirmation, open-source Python package
  • 为什么对您有用: 本文属于 astrostatistics 方向的 gateway reading,适合作为统计学家进入系外行星数据分析的入门读物。武器库中的 nonparametric statistics 和 estimation theory 可用于评估其拟合方法的统计性质,但核心机器(天体物理建模、MCMC 采样细节)不在当前武器库中,属于暂不可做范畴。不过,作为了解该领域数据结构和软件生态的起点,值得花时间读全文。

6. 2608.25134 — Capra: Scalable HEALPix-Native Intensity Reconstruction for High-Resolution IMAP Analyses

  • 作者: Nikola Bukowiecka, Daniel B. Reisenfeld, Maciej Bzowski
  • 相关性 4/10 · novelty: application
  • 摘要: 本文提出 Capra 管线,用于从 IBEX 和 IMAP 任务的计数数据重建全天区 ENA 强度图。核心产品包括基线 boresight-assigned 图和可选 HEALPix 网格平滑图。平滑图能恢复大尺度 ENA 形态,同时减少采样引起的斑驳和条带伪影。与 Theseus 重建的对比显示大尺度结构一致,差异源于方法而非形态。验证了坐标变换下计数、率、强度的不变性,并在 Nside=64 分辨率下展示数值收敛。线程并行呈近似线性强扩展,内存使用有界,适合高分辨率 IMAP 重建。对您而言,这是一篇优秀的入门级 astrostatistics 读物,清晰展示了天文数据处理中从计数到网格化强度图的完整管线,以及 HEALPix 这一关键数据结构。
  • 关键技术: HEALPix grid, boresight-assigned map, thread-based parallelism, intensity reconstruction, event-counting data
  • 为什么对您有用: 本文属于 astrostatistics 入门读物,清晰展示了天文数据处理中从原始计数到网格化强度图的完整管线,以及 HEALPix 这一关键数据结构。您的武器库中 'software development' 和 'nonparametric statistics' 可直接用于理解其平滑方法(如是否可改进为自适应带宽或基于 U-statistic 的平滑)。值得花时间读全文,作为进入 astrostatistics 方向的起点。

经济理论 / 应用 (econ_theory, 3 篇)

1. 2608.24362 — Dynamic Discrete Choice and Inverse Reinforcement Learning: Inferring Preferences and Beliefs From Human Behavior

  • 作者: Pranjal Rawat, John Rust
  • 相关性 6/10 · novelty: survey
  • 摘要: 本文综述了动态离散选择(DDC)与逆强化学习(IRL)两个领域,它们从不同学科传统出发,解决同一基本问题:从观测到的序贯行为推断决策者的偏好。两者均假设个体在马尔可夫决策过程(MDP)框架下最大化期望奖励函数。文章指出,IRL中流行的soft Q-learning框架与DDC在加性极值偏好冲击下的模型等价,产生相同的softmax(多项logit)选择概率和平滑Bellman方程。DDC侧重极大似然估计、条件选择概率估计子和策略迭代方法;IRL则发展了最大熵方法、对抗方法和基于深度神经网络的无模型时序差分估计子等可扩展替代方案。文章认为,将无模型IRL估计子与计量经济学经典两步法结合是连接两个领域的有前景方向。两个领域共同面临识别问题(多个奖励函数可解释相同行为)和MDP求解的维度灾难。对您而言,本文是经济理论与机器学习交叉领域的优秀入门读物,清晰阐述了DDC的识别与估计框架,与您secondary interest中的经济理论应用直接相关。
  • 关键技术: dynamic discrete choice, inverse reinforcement learning, Markov decision process, soft Q-learning, maximum likelihood estimation, temporal difference learning
  • 为什么对您有用: 本文属于经济理论(econ_theory)的gateway-reading范畴。作为综述,它清晰阐述了DDC的识别与估计框架,适合作为进入该方向的入门读物。您的武器库中'因果推断中的估计理论'和'M估计理论'足以支撑理解DDC的极大似然和条件选择概率估计方法,但若想跟进无模型IRL与深度网络的结合,需在'moderately_familiar'的强化学习工具上补课。值得花时间读全文以建立经济理论与机器学习交叉领域的知识地图。

2. 2608.25901 — Cross-Section Estimation of Long-Run Relations Using Time-Compressed Data

  • 作者: Serena Ng, Nikolay Gospodinov
  • 相关性 5/10 · novelty: application
  • 摘要: 本文研究利用时间压缩数据(如长期差分或时间平均)进行横截面回归以估计长期关系的方法。在T×N面板中,非平稳I(1)数据的横截面方差随时间“扇出”而放大,使得基于压缩数据的横截面估计量可能具有超一致性和渐近正态性,无论回归元是平稳、非平稳还是高度持久。最快收敛速率可达√N T,这要求压缩方案既能放大非平稳信号,又能稀释回归噪声。遗漏固定效应会阻碍噪声稀释,但估计量仍保持超一致性。然而,当数据存在强均值回归或收敛趋势时,扇出效应会被削弱,这一问题在温度数据中尤为相关。本文通过三个应用(消费与收入、增长/通胀与人口变量、增长与气温变暖)展示了该方法的实证表现,发现前两个关系较为稳健,而气温变暖与增长的关系则脆弱。对您而言,本文属于经济理论方向的应用型工作,其横截面压缩估计的思路与您对面板数据因果推断(如longitudinal/IV)的兴趣有潜在交叉,但方法学新颖性有限。
  • 关键技术: cross-section regression, time-compressed data, long differencing, I(1) panel, super-consistency, fanning out effect
  • 为什么对您有用: 本文属于经济理论方向的应用型工作,连接您的secondary interest中的经济理论(应用数据集与模型)。其核心方法——利用非平稳面板的扇出效应实现超一致性估计——与您武器库中'高维渐近'和'因果推断中的估计理论'有潜在交叉,但本文更偏向实证应用而非方法论创新。作为gateway reading,本文对非平稳面板的横截面压缩给出了清晰设定和收敛率分析,适合作为进入经济时间序列/面板数据应用方向的入门读物。武器库中的'非参数统计'和'最小最大界'工具可直接用于评估其收敛率的最优性,属于中期可做:需先在'moderately_familiar'的'因果推断中的识别理论'上熟悉面板数据设定。

3. 2608.23988 — Estimation of Random-Coefficient Dynamic Panel Data Models with a Fixed T

  • 作者: Xun Tang, Pei Yu
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文研究固定时间维度 T 的动态线性面板数据模型,其中滞后因变量和严格外生协变量均带有个体特异性系数,且时变误差具有灵活协方差结构。在分布形式的严格外生性假设下,作者点识别了随机系数与结构误差的联合分布,并提出基于逆 Radon 变换的闭式多步估计量。建立了随机系数密度估计的一致收敛速率,以及时变结构误差条件密度估计的一致相合性。蒙特卡洛模拟展示了有限样本下的良好表现。该工作为经济学面板数据中的异质性建模提供了非参数识别与估计框架,对您作为经济学理论(应用因果工作)的次要兴趣具有直接参考价值。
  • 关键技术: inverse Radon transform, random coefficients, dynamic panel data, point identification, uniform convergence rate
  • 为什么对您有用: 本文属于经济理论(应用因果工作)方向,直接对应您的次要兴趣。其非参数识别策略(逆 Radon 变换)与您的武器库中'非参数统计'和'估计理论'高度匹配,可视为中期可做:需先在 moderately_familiar 的'识别理论'上巩固对分布形式严格外生性的理解。本文作为入门读物清晰,值得花时间读全文以了解面板数据异质性建模的现代方法。

流行病学 (epidemiology, 1 篇)

1. 2608.26929 — A Bayesian Longitudinal Model for Imputing Item-Level Missing Data in Trial-Based Economic Evaluations

  • 作者: Xiaoxiao Ling, Andrea Gabrio, Gianluca Baio
  • 相关性 5/10 · novelty: application
  • 摘要: 本文针对试验经济评价中多时间点多项目问卷的条目级缺失数据,提出一个贝叶斯纵向插补模型。模型采用转移模型(transition model)刻画纵向依赖,结合灵活分布假设(如偏态成本与计数数据)显式建模跨项目相关性,在统一框架内处理混合类型响应变量。通过真实临床试验数据展示其实用性,并讨论扩展到非随机缺失(MNAR)情形的途径。该方法填补了条目级插补在实践中的空白,但理论贡献有限,主要贡献在于应用层面的模型整合与实现。对您而言,本文可作为流行病学或卫生经济学中纵向缺失数据处理的应用案例参考,但方法论新颖性较低。
  • 关键技术: Bayesian longitudinal model, transition model, item-level imputation, missing not at random (MNAR), cost-effectiveness analysis
  • 为什么对您有用: 本文属于流行病学/卫生经济学的应用工作,与您的secondary interest(流行病学数据集、应用因果工作)直接相关。但武器库中very_familiar的因果推断估计理论或moderately_familiar的识别理论在此处无直接攻击口——本文是纯贝叶斯插补,不涉及因果识别或半参效率。作为gateway reading,本文清晰展示了纵向缺失数据的实际挑战(偏态、混合类型、跨项目依赖),但方法论深度有限,不值得花全文时间精读。

其他 (other, 13 篇)

1. 2608.25172 — Spatially orthogonal factor models for spatial transcriptomics and remote sensing data

  • 作者: Dan Cunha, Lukas M. Weber, Mark A. Friedl, Luis Carvalho
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文提出一种空间正交因子模型(SOFM),用于空间转录组学和遥感数据的潜在空间变异模式推断。模型直接参数化正交载荷矩阵,避免了传统空间PCA后处理正交化破坏空间先验信息的问题。作者推导了具有k个唯一奇异值和m-k个重复奇异值的SVD变换的采样分布,并证明正交载荷的MAP估计等价于经验协方差矩阵与空间先验协方差之和的特征分解。算法方面,开发了线性计算复杂度的MM-EM算法(相对于空间位置数),并扩展至held-out位置预测和非平稳先验协方差的验证策略。在人类脑空间转录组学和撒哈拉以南非洲大陆尺度物候学两个案例中展示了方法有效性。本文主要贡献在于统计计算与空间统计的交叉,对您而言可作为gateway reading了解空间转录组学数据分析的统计挑战,但核心方法(正交因子模型、MM-EM)与您的主要研究兴趣(因果推断、高维统计、U统计量)直接关联较弱。
  • 关键技术: orthogonal factor model, MM-EM algorithm, spatial prior covariance, MAP estimation, SVD transformation
  • 为什么对您有用: 本文属于统计计算与空间统计的交叉,可作为gateway reading了解空间转录组学这一新兴数据领域的统计挑战。武器库中'软件发展'和'高维渐近'可帮助理解其线性时间算法设计,但核心方法(正交因子模型、MM-EM)与您的主要兴趣方向(因果推断、U统计量、半参理论)直接关联较弱,暂不可做——缺乏空间统计和转录组学领域的领域知识。

2. 2608.25743 — Learning of deep neural network regression estimates using gradient descent with pruning

  • 作者: Michael Kohler, Vincent Molinero Römer, Adam Krzyżak
  • 相关性 5/10 · novelty: new_method
  • 摘要: 本文研究基于独立同分布数据的回归函数估计问题,以设计变量积分下的 L2 误差为准则。方法上,采用初始随机剪枝的全连接深度神经网络(激活函数为 logistic squasher),通过梯度下降拟合数据,其中步长根据数据自适应选择且非常数。理论贡献在于证明该网络估计量在回归函数为 (p,C)-光滑时达到(至多对数因子)最优极小化收敛速率,且当预测变量集中在低维流形邻域时能够规避维数诅咒。证明技术涉及神经网络逼近理论、梯度下降动力学分析和随机剪枝的统计效应。模拟实验验证了有限样本性能。本文对您作为统计计算与高维统计研究者的价值在于:其随机剪枝与自适应步长的结合策略可能启发您在 U-统计量或因果推断中设计计算高效的神经网络估计器,但核心方法(深度网络回归)与您的主要兴趣方向(因果推断、高维随机矩阵、U-统计量)距离较远。
  • 关键技术: gradient descent with data-dependent step sizes, random pruning of neural networks, minimax optimal rate of convergence, curse of dimensionality avoidance via low-dimensional manifold
  • 为什么对您有用: 本文属于深度学习的统计学习理论,与您的主要兴趣(因果推断、高维统计、U-统计量)无直接交集。作为统计计算方向的 gateway reading,它展示了随机剪枝与自适应梯度下降如何实现极小化最优收敛,但武器库中缺乏深度网络逼近理论(如 Barron 空间、ReLU 网络复杂度)这一核心工具,因此暂不可做。若您未来想进入深度学习的统计理论,需先熟悉神经网络逼近界和梯度下降动力学。

3. 2608.26805 — Expected Shortfall Model Averaging

  • 作者: Jianming Wu, Xinyu Zhang, Jie Zeng
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对金融经济学中广泛使用的尾部风险度量——预期损失(ES)的预测问题,提出了一种两阶段交叉验证模型平均方法。由于ES不具有可elicitable性且存在模型不确定性,直接预测困难。第一阶段通过分位数模型平均估计条件VaR;第二阶段构造变换响应变量,基于均方误差的模型平均来估计ES。在正确设定和模型误设两种情形下,建立了估计量的一致性和预测风险的渐近最优性。模拟和实证(美国股票收益率和宏观GDP增长数据)表明该方法预测准确、稳定且计算高效。对您而言,该文属于应用计量经济学范畴,与您的secondary interest(经济理论/应用因果)有弱关联,但方法学上未涉及您核心关注的因果推断或高维统计工具。
  • 关键技术: cross-validation model averaging, quantile regression, expected shortfall, value-at-risk, two-stage estimation
  • 为什么对您有用: 本文属于经济金融领域的预测方法应用,与您的secondary interest(经济理论/应用因果)有弱关联,但方法学上未涉及因果推断、高维统计或半参效率理论等核心兴趣。作为gateway reading,本文对模型平均和尾部风险预测的统计框架有清晰阐述,但武器库中的工具(如U-statistic、minimax bound)在此处无直接攻入口。暂不可做——核心机器(模型平均的渐近理论)不在武器库中,且该方向与您的主要兴趣交集有限。

4. 2608.26527 — Frequentist prediction intervals for random-effects meta-analysis via confidence-distribution propagation

  • 作者: Hisashi Noma, Guido Schwarzer
  • 相关性 4/10 · novelty: application
  • 摘要: 在随机效应元分析中,预测区间用于描述未来研究或新场景中真实效应的可能范围。传统频率学派区间因未充分传播异质性方差(τ²)的不确定性,在小样本下覆盖概率常不足。本文提出一种置信分布传播方法:首先通过逆推 Cochran's Q 的精确分布得到 τ² 的置信分布,然后从该分布中抽样 τ²,条件于每个 τ² 抽样值再从平均效应的正态置信分布中抽样,最后生成未来真实效应。预测限取为蒙特卡洛分布的样本分位数。模拟显示,该方法在多数场景下改善或维持了覆盖概率,宽度增加通常较小。同一蒙特卡洛样本还可同时给出平均效应和异质性指标的置信区间。方法已实现于 R 包 cdmeta。本文属于应用统计方法,对您的主要兴趣方向(因果推断、高维、U-统计等)无直接技术连接,但元分析是流行病学和循证医学的核心工具,可作为流行病学 secondary interest 的入门级方法参考。
  • 关键技术: confidence distribution, Cochran's Q, random-effects meta-analysis, Monte Carlo propagation, prediction interval
  • 为什么对您有用: 本文属于流行病学/循证医学领域的应用统计方法,与您的 secondary interest(流行病学)相关。作为方法论文,它清晰展示了元分析中异质性不确定性的传播策略,但技术工具(置信分布、Q统计量精确分布)不在您的 primary 武器库核心范围内。若您未来接触流行病学合作或元分析数据,本文可作为快速上手的参考方法,但无需深入精读。

5. 2608.26387 — Multilevel modelling of double-sampled clustered social networks with individual-level data on between-cluster ties

  • 作者: Fiona Steele, Justin Weltz, Eleanor A. Power, Jeremy Koster
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对聚类间有向网络数据(个体报告聚类间关系)提出一种多层社会关系模型(SRM)的推广。模型在个体和聚类两个层面纳入行动者、伙伴和二元效应,并利用“双重抽样”(每个关系由双方各自报告)来估计测量模型,从而调整和量化报告者偏差。该模型可视为一种多层结构方程模型,包含多个交叉分类随机效应,可通过贝叶斯 MCMC 方法估计。基于参数估计,作者提出两种从个体层面预测聚类间关系强度进而推导聚类级网络的方法。实证部分使用尼加拉瓜农村社区的社会支持网络数据,展示如何从个体报告的双向支持交换推导出家庭间网络。本文主要贡献在于网络测量误差建模和聚类级网络推断,但方法学上属于应用导向的模型扩展,未涉及新的统计理论或效率结果。
  • 关键技术: Social Relations Model (SRM), multilevel structural equation model, cross-classified random effects, double-sampling measurement model, Markov chain Monte Carlo (MCMC)
  • 为什么对您有用: 本文属于应用统计方法论文,与您的主要兴趣(因果推断、高维统计、U-统计量等)无直接交集。其网络测量误差建模思路对流行病学中的社会网络分析有一定参考价值,但方法学新颖性有限。作为流行病学/社会科学应用案例,可作入门阅读,但武器库中无直接可攻的技术口子——暂不可做。

6. 2608.26212 — Copula based dependent censoring in cure models with covariates

  • 作者: Morine Delhelle, Anouar El Ghouch, Ingrid Van Keilegom
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文在生存分析中研究带有治愈分数的混合治愈模型,并同时处理两种删失:可能与生存时间相关的依赖删失和独立的行政删失。模型通过Copula刻画依赖删失与生存时间之间的随机相关性,并允许协变量影响所有模型参数(包括治愈分数、依赖结构等)。这是对近期全参数混合治愈模型的扩展,引入了行政删失和协变量效应,使得模型更灵活且能提供个体化的估计。识别条件因协变量的引入而弱化。估计方法为全参数极大似然,理论性质(如渐近正态性)在正则条件下建立。模拟和实际数据分析展示了方法的有限样本表现。对您而言,本文属于生存分析中依赖删失与治愈模型的结合,与您的主要兴趣(因果推断、半参理论)方向不同,但Copula建模依赖结构的方法在因果推断的敏感性分析中可能有间接参考价值。
  • 关键技术: mixture cure model, copula, dependent censoring, administrative censoring, maximum likelihood estimation
  • 为什么对您有用: 本文属于生存分析方法论,与您的主要兴趣(因果推断、高维、U统计量)无直接重叠。Copula建模依赖删失的思路在因果推断的敏感性分析中可能有间接启发,但核心机器(混合治愈模型、全参数似然)不在您的武器库中。作为gateway阅读,本文对生存分析领域的统计学家有参考价值,但对您而言暂不可做,因为缺乏与您当前研究问题的直接连接。

7. 2608.25186 — Log-regularly varying scale mixture of asymmetric Laplaces for robust Bayesian quantile regression

  • 作者: Dongu Han, Genya Kobayashi, Shonosuke Sugasawa
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对贝叶斯分位数回归中非对称拉普拉斯(AL)分布对极端值敏感的问题,提出了一种稳健误差分布——AL与对数Pareto尺度混合非对称拉普拉斯(LPAL)的有限混合。与直接对AL进行对数Pareto扩展不同,该混合分布保留了预设分位数,且双尾呈对数正则变化行为。LPAL分量在目标分位数处具有无界密度,从而形成中心集中与超重尾并存的分布。作者建立了在任意极端污染下的后验稳健性,并给出了回归系数和尺度参数后验矩存在的充分条件。后验计算采用潜变量增广的Gibbs采样器和高效均值场变分贝叶斯近似。模拟显示该方法在中等污染下具有竞争力,在严重污染时能保持稳定的点估计和较集中的后验区间。二氧化碳和波士顿房价数据的应用表明,在几乎所有分位数水平和损失准则下预测性能良好。
  • 关键技术: Bayesian quantile regression, asymmetric Laplace distribution, log-regularly varying tails, posterior robustness, mean-field variational Bayes
  • 为什么对您有用: 本文属于贝叶斯分位数回归的稳健性方法,与您的主要兴趣(因果推断、高维统计)无直接交集,且未涉及您武器库中的核心工具(如U统计量、半参效率理论)。作为一般方法学论文,其技术路线(对数正则变化尾部分布、变分贝叶斯)与您的技术储备距离较远,暂不可做。

8. 2608.25083 — A Unified Framework for Heterogeneity, Contamination, and Missing Data in Multivariate Regression

  • 作者: Hung Tong, Cristina Tortora, Antonio Punzo
  • 相关性 4/10 · novelty: application
  • 摘要: 本文针对多元回归中同时存在缺失数据(MAR)、异常值(离群点与杠杆点)以及潜在组间异质性(聚类)的复杂场景,提出了一个统一框架——含污染的高斯聚类加权模型(CG-CWM)的扩展版本。模型将协变量视为随机变量,保留其对聚类的贡献,并通过引入潜在污染指标来区分正常点、离群点、好杠杆点和坏杠杆点。参数估计采用期望条件最大化(ECM)算法,同时处理四类不完全信息:缺失的响应与协变量、未知的组隶属关系、以及潜在的污染指标。在给定污染指标的条件下,响应与协变量的联合分布为多元高斯,从而得到缺失值条件分布的闭式解,将缺失不确定性直接纳入参数更新,无需预先插补。数值实验在不同缺失模式和污染水平下评估了性能,并给出了真实数据应用。该工作主要贡献在于将聚类、回归、缺失值处理和异常点检测整合为一个模型,但方法学上以算法实现和实证为主,理论深度有限。
  • 关键技术: Expectation-Conditional Maximization (ECM), Cluster-Weighted Model, Missing at Random (MAR), contaminated Gaussian mixture, good/bad leverage points detection
  • 为什么对您有用: 本文属于应用统计方法开发,与您的 primary interests(因果推断、高维、U-统计等)无直接交集。方法学 novelty 有限(主要是现有模型的扩展和 ECM 算法适配),且不涉及您武器库中的核心工具(如 minimax 界、U-统计、半参效率理论)。作为流行病学或经济学应用场景的参考价值一般,因为 MAR 假设在那些领域常被质疑。暂不可做——核心机器(缺失数据理论、稳健聚类)不在您的武器库中,且该方向与您的研究主线距离较远。

9. 2608.24371 — Groupwise Predictor Envelope Models for Multivariate Linear Regression

  • 作者: Sota Osumi, Akira Okazaki, Shuichi Kawano
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对多组多元线性回归问题,提出了一种分组预测变量包络模型(groupwise predictor envelope model)。该模型假设各组回归系数矩阵共享一个共同的预测变量包络子空间,同时允许组特异性的回归效应和误差协方差矩阵,从而在组间结构差异与效率提升之间取得平衡。估计方法通过构造目标函数来估计共同包络子空间,并在此基础上得到回归系数估计量。理论方面,建立了估计量的渐近正态性并给出了显式的渐近方差公式,证明了所提估计量比各组分别拟合包络模型得到的估计量渐近更有效。模拟研究验证了这一理论优势。该工作属于包络方法(envelope method)在分组数据场景下的推广,方法学贡献在于共享子空间假设下的联合估计框架。
  • 关键技术: envelope method, multivariate linear regression, common subspace estimation, asymptotic efficiency
  • 为什么对您有用: 本文属于多元统计中的包络方法,与您的主要兴趣(因果推断、半参理论)无直接交集,但包络方法在降维和效率提升上的思路与您熟悉的非参统计和极小极大界有间接关联。武器库中'非参统计'和'高维渐近'可帮助理解其渐近效率论证,但核心机器(包络子空间估计)不在您的技术栈中,属于暂不可做方向。作为方法学拓展阅读,可了解包络方法在分组数据上的最新进展,但优先级不高。

10. 2608.23900 — Handling mild outliers and unobserved values in compositional datasets using finite mixtures of mean-parametrised Dirichlet models

  • 作者: Jason Pillay, Andriëtte Bekker, Cristina Tortora, Antonio Punzo
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对异质性成分数据(compositional data)同时存在缺失值和异常值的问题,提出了一种基于Huber污染模型的有限混合模型。该模型直接在单纯形上定义污染,并假设缺失机制为随机缺失(MAR),从而在考虑污染的同时推导缺失部分的分布。作者证明了基于污染、均值参数化Dirichlet密度的观测对数似然最大化是一个凸优化问题,并据此开发了定制的EM算法。E步利用缺失部分分布的矩进行积分,M步虽无闭式解,但可通过逐元素迭代更新高效求解。数值实验展示了方法在不同缺失率、污染比例和样本量下的表现。对美国时间使用调查(ATUS)的应用识别出两个可解释的聚类(工作密集型与社交休闲型),并揭示了异常的时间使用组成;相比之下,传统Dirichlet混合模型识别出四个聚类,反映了异常值的影响和一个人为的聚类分裂。
  • 关键技术: Huber contamination model, mean-parametrised Dirichlet mixture, EM algorithm, convex optimization, missing at random (MAR)
  • 为什么对您有用: 本文属于成分数据分析的方法学工作,与您的主要兴趣(因果推断、高维统计等)无直接交集。但如果您未来涉足流行病学或经济学中的成分数据(如时间使用、支出比例),该文提供的异常值鲁棒聚类框架可能有用。目前武器库中缺乏成分数据建模的专门工具,暂不可做。

11. 2608.23538 — Interpretable AI with Local Distillation

  • 作者: Erin Craig, Yiling Huang, Snigdha Panigrahi
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文提出一种名为“局部蒸馏”的框架,旨在让黑箱AI模型(如梯度提升集成或表格基础模型)在保持高预测精度的同时,提供局部可解释的线性模型。核心思路是:在每个查询点,用一个正则化线性“学生”模型去拟合由黑箱“教师”模型引导的加权训练数据。教师模型通过两个机制定义局部性:(1) 根据预测结果相似性对训练样本加权;(2) 将教师模型在查询点的预测值作为一个伪观测值加入目标函数,其权重由数据估计。为进行统计推断,作者在局部目标函数中加入少量高斯随机化,并通过多次重拟合评估稳定性:选择频率识别可靠特征,聚类随机化拟合结果识别数据中的稳定子组。在Lasso惩罚下,作者证明了该随机化产生的特征选择概率在训练响应的小扰动下是稳定的。在17个基准数据集上,局部蒸馏几乎匹配了教师模型的精度,同时为每个测试点生成了稀疏线性模型。在高维癌症基因表达示例中,该方法识别出不同患者子组使用不同基因的局部模型,这种异质性对全局线性模型不可见,也难以从黑箱模型中提取。
  • 关键技术: local linear modeling, distillation, randomized lasso, stability selection, pseudo-observation weighting
  • 为什么对您有用: 本文属于统计计算与可解释AI的交叉方向,与您的primary interest中的'statistical computing'和'nonparametric theory'有间接关联——局部线性建模是平滑回归函数的经典非参数工具,而随机化Lasso的稳定性证明涉及高维统计。但本文的方法论核心(蒸馏+局部加权)与您的核心武器库(U-statistics、因果推断、半参效率理论)距离较远,属于'暂不可做':缺乏直接可攻的technical口子,且您对随机化Lasso稳定性理论并不熟悉。作为gateway阅读,本文对统计计算方向的可解释性方法有清晰阐述,但作为方法学贡献,其novelty更偏向应用与工程整合而非新理论。

12. 2608.22732 — Logistic Regression Equivalent Weights for Survey Inference: Construction and Asymptotic Properties

  • 作者: Seonghun Lee
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文在分类事后分层设定下,为 logistic 回归模型构建了调查推断的等价权重。由于基于 logistic 模型的人口估计量关于观测结果是非线性的,作者通过局部一阶表示定义等价权重,每个权重为人口估计量对相应观测结果的缩放导数,并给出了以拟合 logistic 模型和总体单元结构表达的显式闭式解。在有限总体超总体框架下,建立了有效样本量比率的收敛性、加权估计量的渐近线性性以及一致 plug-in 方差估计量。模拟实验考察了总体恢复、回归表现、有效样本量以及渐近方差近似的有限样本行为,结果显示 logistic 等价权重在有限样本点估计和近似有效的 plug-in 方差估计方面具有竞争力,有效样本量与替代的基于模型的加权方法相当。对“未来家庭与儿童福祉研究”的应用展示了所提权重和方差估计量在实证调查中的构建与使用。本文强调 logistic 等价权重与近期非线性多层回归事后分层中局部等价权重工作的联系,但聚焦于权重的频率学派解释、调查权重性质及其推断用途。
  • 关键技术: survey weighting, logistic regression equivalent weights, local first-order representation, plug-in variance estimator, finite-cell superpopulation framework
  • 为什么对您有用: 本文属于调查推断的方法学工作,与您的主要兴趣(因果推断、半参理论)无直接重叠,但其中等价权重的构造思路(通过局部一阶表示处理非线性估计量)与您熟悉的非参统计和估计理论有技术关联。作为 gateway reading,本文对调查加权框架的阐述清晰,适合了解设计-模型融合推断的入门。武器库中非参统计和估计理论足以理解其渐近论证,但核心问题(调查加权 vs 因果推断)与您当前方向距离较远,暂不可做。

13. 2608.25765 — Frequency Domain Bootstrap for Functional Time Series

  • 作者: Daniel Rademacher, Jens-Peter Kreiss, Efstathios Paparoditis
  • 相关性 4/10 · novelty: new_method
  • 摘要: 本文针对函数型时间序列提出了一种频域自助法(bootstrap)程序,应用于谱均值算子类。方法首先生成独立伪周期图算子,利用谱密度算子估计量,然后通过基于子样本卷积周期图算子的重抽样程序,对谱均值算子的前m维部分进行补充,以捕获过程的四阶结构。当分解参数m随样本量增大而趋于无穷时,该方法能一致估计过程的整个四阶结构。渐近理论在固定m和递增m下均建立了有效性,且对底层函数过程类的条件较宽松。该工作主要贡献在于将频域bootstrap从标量/向量时间序列推广到函数型数据,并处理了高阶谱特征。
  • 关键技术: frequency domain bootstrap, spectral mean operator, functional time series, periodogram operator, subsampling
  • 为什么对您有用: 本文属于函数型时间序列的统计推断,与您的主要兴趣(假设检验、非参数理论)有间接关联,但核心方法(频域bootstrap)不在您的技术武器库中。作为gateway reading,它清晰展示了函数型数据的频域分析框架,但您若想跟进,需先熟悉函数型数据分析基础(moderately_familiar之外)。暂不可做。

🗂 其他论文(仅 LLM 评分,未生成摘要)

未生成中文摘要的论文,按 LLM 评分由高到低排列,仅保留评分与简评,便于回溯查全。一般为相关性低于展示阈值者;个别历史页也含当时因单日摘要上限未展开的高分篇目(评分仍清楚标着)。

1. 2608.26553 — Tight differencing in spectral density estimation with centrosymmetric kernels

  • 作者: Yaxuan Wang, Kin Wai Chan
  • 相关性 3/10
  • 评分理由: 主题是谱密度估计,与 researcher 的 primary interests 无直接关联。

2. 2608.26510 — Wavelet-Based Bayesian Hierarchical Modeling with Regularized Horseshoe Priors for Spatially Correlated Functional Data

  • 作者: Alvaro Alexander Burbano-Moreno, Alex Rodrigo dos Santos Sousa, Luiz Koodi Hotta
  • 相关性 3/10
  • 评分理由: 主题是函数型数据的贝叶斯建模,与 researcher 的 primary interests 无直接关联。

3. 2608.26286 — A Coherent Framework for Semicontinuous Data Through Distributional Regularization, Censoring, and Compounded Occurrence-Severity Modeling

  • 作者: Jianping Philip Wang
  • 相关性 3/10
  • 评分理由: 半连续数据建模,与主要兴趣(因果推断、高维统计)无直接关联,方法学(分布正则化、删失)非核心。

4. 2608.25280 — Empirical-Bayes Elastic-Net Computation for Exponential Random Graph Models

  • 作者: Dan Han, Vicki Modisette, Ting Li, Akidul Haque
  • 相关性 3/10
  • 评分理由: 网络模型与弹性网正则化,与首要兴趣领域不直接相关。

5. 2608.24452 — A latent space network model for dynamic neural latent embedding

  • 作者: Riccardo Rastelli, Shizhe Chen
  • 相关性 3/10
  • 评分理由: 神经科学中的潜变量网络模型,与主要统计兴趣领域无关。

6. 2608.23825 — Efficient Bayesian Inference for Benter Models on Ranked Data

  • 作者: Michael Pearce
  • 相关性 3/10
  • 评分理由: 排名数据的贝叶斯模型,与主要兴趣领域(因果推断、高维统计等)无关。

7. 2608.23512 — Penalized likelihood estimation of probability density functions using compositional splines

  • 作者: Stanislav Škorňa, Jitka Machalová
  • 相关性 3/10
  • 评分理由: 密度估计的惩罚似然方法,与主要兴趣领域(因果推断、高维统计等)关联弱。

8. 2608.22659 — Statistical Methods for Multiple Language Model Comparison on a Shared Evaluation

  • 作者: Juan Francisco Mandujano Reyes
  • 相关性 3/10
  • 评分理由: Statistical methods for LLM comparison are outside the researcher's primary and secondary interests.

9. 2608.25766 — Pooling Mobility Obscures Epidemic Invasion Routes

  • 作者: Tiandong Wang, Wei Yang
  • 相关性 3/10
  • 评分理由: 流行病学中的流动性聚合问题,虽有应用背景但缺乏统计方法论深度,与主要兴趣无关。

10. 2608.22905 — Pre-Disclosure Experiment Menus: Oracle-Relative Risk and Joint Sample--Menu Asymptotics

  • 作者: Xinyu Song
  • 相关性 3/10
  • 评分理由: 核心是局部渐近决策理论,与主要兴趣(因果推断、高维统计)无直接关联,且抽象过于技术化,难以判断对统计计算或U-统计的适用性。

11. 2608.24811 — How does hazard exposure influence job choice? Evaluating time-dependent tradeoffs between salary and hazard risks

  • 作者: Richard Bernknopf, Leila Gonzales, Christopher Keane
  • 相关性 3/10
  • 评分理由: 主题为劳动经济学中的离散选择,与研究者主要兴趣(因果推断、高维统计等)无直接关联。

12. 2608.23732 — Principal Component Analysis for a Mix of Stationary and Nonstationary Variables

  • 作者: James D. Hamilton, Xinwei Ma, Jin Xi
  • 相关性 3/10
  • 评分理由: 主成分分析在混合平稳/非平稳变量中的应用,属于经典方法,与研究者主要兴趣无直接关联。

13. 2608.26326 — RadialPaths: Radial profiles in multi-centred astronomical structures

  • 作者: Rafael S. de Souza
  • 相关性 3/10
  • 评分理由: Astrostatistics gateway: introduces a new radial profile method, but the exposition is technical and the statistical dimension is weak.

14. 2608.26077 — Anatomy of an extensive air shower: building an optimal radio emission calculation

  • 作者: Juan Ammerman-Yebra, Harm Schoorlemmer
  • 相关性 3/10
  • 评分理由: Astrostatistics gateway: computational optimization for radio emission, but the exposition is highly domain-specific and not accessible.

15. 2608.25962 — Simulating an imaging atmospheric radio telescope to observe cosmic gamma rays and cosmic neutrinos

  • 作者: Sebastian Achim Mueller, Anne Timmermans, Juan Ammerman-Yebra, Harm Schoorlemmer
  • 相关性 3/10
  • 评分理由: Astrostatistics gateway: simulation of a radio telescope, but the exposition is technical and the statistical angle is minimal.

16. 2608.25173 — Deep Learning-Based Coarse Alignment and Cophasing of a Distributed-Aperture Telescope. Application to the Small ExoLife Finder (SELF)

  • 作者: N. Arteaga-Marrero, J. Iborra-Luis, A. Padrón-Brito, J. Kuhn
  • 相关性 3/10
  • 评分理由: 深度学习用于望远镜共相,有方法但属工程应用,与研究者主要兴趣无直接关联。

17. 2608.25113 — TESSExtractor: A web-based interactive tool for light-curve visualisation and period estimation using TESS full-frame images

  • 作者: Javier Serna, Jesús Hernández, Sean P. Matt, Giovanni Pinzón, Astaroth Elizabethson, Jorge Martínez-Palomera et al.
  • 相关性 3/10
  • 评分理由: TESS光变曲线提取与周期估计工具,有数据处理但无统计方法论贡献。

18. 2608.22763 — An Anchored Logistic Family for Bounded Trait Measurement and Growth: Origin Before Unit

  • 作者: Jaehwa Choi
  • 相关性 2/10
  • 评分理由: Latent trait measurement is unrelated to primary or secondary interests.

19. 2608.25892 — Weighted Estimation by Discrete-time Sparse Domination on Martingale Spaces

  • 作者: Wei Chen, Chaoyue Zhang, Gege Zhang
  • 相关性 2/10
  • 评分理由: 鞅空间上的稀疏控制,与研究者主要兴趣(因果推断、高维统计等)无关。

20. 2608.23859 — Ranking by points and ordinal models

  • 作者: Leszek Szczecinski
  • 相关性 2/10
  • 评分理由: 体育联赛排名模型,与主要兴趣领域无关。

21. 2608.23796 — Accelerating the Adoption of Residential Solar Power Systems: Policy Analysis using a Dynamic Structural Model

  • 作者: Sebastián Souyris, Jason A. Duan, Anantaram Balakrishnan, Varun Rai
  • 相关性 2/10
  • 评分理由: 应用导向的能源政策分析,使用动态结构模型,与研究者兴趣和方法论无显著关联。

22. 2608.26371 — Microscopy assessment of two multiple-transient candidates

  • 作者: Jun Yang, Beatriz Villarroel
  • 相关性 2/10
  • 评分理由: Pure astrophysics result (microscopy of historical plates) with no clear data/model exposition or statistical methodology; not a gateway read.

23. 2608.26322 — The MegaWave Radio Surveyor

  • 作者: T. Joseph W. Lazio, Evgenya Shkolnik, James Aguirre, Stuart D. Bale, Judd Bowman, Ruby Byrne et al.
  • 机构: Berkeley College · University of California, Berkeley · California Institute of Technology · Netherlands Institute for Radio Astronomy · Carnegie Institution for Science · UCLA Health · University of Zurich · Moscow Institute of Thermal Technology 等
  • 相关性 2/10
  • 评分理由: Mission proposal for a space interferometer; no data/model exposition or statistical methodology; not a gateway read.

24. 2608.26217 — Best practices for obtaining astrometric observations from JWST (274) NIRCam data

  • 作者: Marco Micheli, Bryan J. Holler
  • 相关性 2/10
  • 评分理由: JWST天体测量实践指南,有数据处理但无统计方法论,非入门级天文统计阅读。

25. 2608.25184 — Spatially Scanned STIS Spectra of the Exoplanet Host Star 55 Cnc

  • 作者: D. E. Welty, J. D. Lothringer, D. K. Sing, A. M. Jones, A. Riley, C. R. Proffitt
  • 机构: Space Telescope Science Institute · Johns Hopkins University · BAE Systems (Sweden)
  • 相关性 2/10
  • 评分理由: 系外行星宿主星光谱分析,涉及数据归约但无统计方法创新或清晰数据模型。

26. 2608.25075 — A Singular Value Decomposition Framework for Jovian Radio Emissions from Parker Solar Probe

  • 作者: Evan Wille, Zack Li, Marc Pulupa, Leon V. E. Koopmans, Philippe Zarka, Stuart Bale
  • 相关性 2/10
  • 评分理由: 纯天体物理信号处理,无统计方法或数据建模的清晰阐述,与研究者兴趣无关。

27. 2608.25045 — Study of Vibrations at SOAR

  • 作者: Andrei Tokovinin
  • 相关性 2/10
  • 评分理由: 望远镜振动工程问题,无统计方法或数据建模的清晰阐述,与研究者兴趣无关。

28. 2608.26202 — Engineering of titanium transition edge sensor wafers for the BA4-90/150 receiver of BICEP Array

  • 作者: A. Patel, P. A. R. Ade, Z. Ahmed, M. Amiri, D. Barkats, R. Basu Thakur et al.
  • 相关性 2/10
  • 评分理由: 探测器工程细节,无统计方法或数据建模的清晰阐述,与研究者兴趣无关。

29. 2608.25015 — Status of BICEP Array and Integration of the 220/270 GHz Receiver

  • 作者: A. Steiger, The BICEP/Keck Collaboration, P. A. R. Ade, Z. Ahmed, M. Amiri, D. Barkats et al.
  • 相关性 2/10
  • 评分理由: CMB实验状态报告,无统计方法或数据建模的清晰阐述,与研究者兴趣无关。

30. 2608.25014 — Optics and broadband anti-reflection coatings for the BA4-90/150 receiver

  • 作者: A. R. Polish, P. A. R. Ade, Z. Ahmed, M. Amiri, D. Barkats, R. Basu Thakur et al.
  • 相关性 2/10
  • 评分理由: 光学和镀膜工程,无统计方法或数据建模的清晰阐述,与研究者兴趣无关。

31. 2608.25013 — Advanced Time-Division Multiplexed Readout Chain for the BICEP Array 90/150 GHz Receiver

  • 作者: B. Cantrall, P. A. R. Ade, Z. Ahmed, M. Amiri, D. Barkats, R. Basu Thakur et al.
  • 相关性 2/10
  • 评分理由: 读出电子学工程,无统计方法或数据建模的清晰阐述,与研究者兴趣无关。

32. 2608.25012 — Optical characterization of the BICEP array 150 and 220/270GHz CMB polarimeters in the 2026 season

  • 作者: M. Izquierdo Poza, P. A. R. Ade, Z. Ahmed, M. Amiri, D. Barkats, R. Basu Thakur et al.
  • 相关性 2/10
  • 评分理由: CMB偏振仪光学表征,无统计方法或数据建模的清晰阐述,与研究者兴趣无关。

33. 2608.24661 — NIRC2-Pol: First Light of Near-Infrared Polarimetry on Keck II

  • 作者: Briley L. Lewis, Manxuan Zhang, Maxwell A. Millar-Blanchaer, Eduardo Marin, Jayke S. Nguyen, Carlos Alvarez et al.
  • 相关性 2/10
  • 评分理由: 天文仪器升级报告,无统计方法或数据建模的清晰阐述,与研究者兴趣无关。

34. 2608.24969 — Connecting Granulation and Magnetic Activity in Radial Velocities: The Next Breakthrough for High-Precision Spectroscopy

  • 作者: Ancy Anna John, Khaled Al Moulla, Federica Rescigno, Carmen San Nicolas Martinez, Andrew Collier Cameron, Thomas G. Wilson et al.
  • 相关性 2/10
  • 评分理由: 天文仪器会议摘要,无具体数据或统计方法,不满足astrostats入门阅读标准。

35. 2608.23441 — Inverting and Up-channelizing Critically-Sampled Polyphase Filter Banks

  • 作者: Stephen Fay, Mohan Agrawal, Hsin Cynthia Chiang, Aman Chokshi, Jonathan Sievers, Simon Tartakovsky
  • 相关性 2/10
  • 评分理由: 纯信号处理/射电天文方法,与统计兴趣无直接关联。

36. 2608.23270 — AI-Assisted Extraction of Follow-up Observations from GCN Circulars in Astro-COLIBRI

  • 作者: Fabian Schüssler, S. Bisero, M. Cellier, A. Ciric, B. Cornejo, I. Jaroschewski et al.
  • 相关性 2/10
  • 评分理由: 天文工具开发,无统计方法论或数据建模内容。

37. 2608.23088 — Effects of near-surface sedimentary structure on Newtonian noise for the Einstein Telescope: a 2-D numerical study

  • 作者: Shi Yao, Patrick Schillings, Johannes Erdmann, Andreas Rietbrock
  • 相关性 2/10
  • 评分理由: 地球物理数值模拟,与统计兴趣无直接关联。

38. 2608.22548 — Instrumental artifacts in photonic lantern spectroastrometry and their mitigation with PLred

  • 作者: Yoo Jung Kim, Michael P. Fitzgerald, Malena Bloom, Aidan Walk, Sebastien Vievard, Miles Lucas et al.
  • 相关性 2/10
  • 评分理由: 天文仪器伪影校正,无统计方法论内容。

39. 2608.22352 — Automated Shape-Model-Based Astrometry of Phobos from Mars Express SRC Images

  • 作者: Wangxin Lai, Qingfeng Zhang, Rui Zhang, Kai Tang, Chunyu Ding, Zhan Li et al.
  • 相关性 2/10
  • 评分理由: 天体测量自动化流水线,无统计方法论或数据建模内容。

40. 2608.22172 — Modeling the technical specifications for future multi-object spectroscopy instrumentation

  • 作者: Ummee Tania Ahmed, Andrew Hopkins, Simon Ellis
  • 相关性 2/10
  • 评分理由: 纯天文仪器工程论文,无统计方法或数据建模内容,与研究者兴趣无关。

41. 2608.23420 — Systematic Bias in Green Patent Classification: Silent Green and False Green

  • 作者: Hamid Bekamiri, Jan Auernhammer, Milad Abbasiharofteh, Jesper Lindgaard Christensen
  • 机构: Aalborg University · Technical Design (United States)
  • 相关性 1/10
  • 评分理由: 纯专利分类偏差研究,与统计兴趣(因果推断、高维统计等)完全无关。

42. 2608.27223 — Towards the exploration of astrophysical datacubes through volumetric rendering within CARTA

  • 作者: Ixaka Labadie-García, Adrianna Pińska, Angus Comrie, Michaela van Zyl, Manuel Parra-Royón, Susana Sánchez-Expósito et al.
  • 相关性 1/10
  • 评分理由: 天文数据可视化工具,虽属天文但无数据/模型统计问题阐述,不符合天文网关标准。

43. 2608.25867 — RISTRETTO: Assembly and Testing of the Seven-spaxel, High-resolution, Diffraction-limited Spectrograph

  • 作者: Leonie Hoerner, Bruno Chazelas, Nathanaël Restori, Christophe Lovis, Nicolas Blind, Ludovic Genolet et al.
  • 相关性 1/10
  • 评分理由: 纯天文仪器组装与测试论文,无统计或因果推断内容。

44. 2608.25863 — LP-Infinity: overcoming limits to the number of lifetime positions in the COS FUV channel

  • 作者: David J. Sahnow, Christian I. Johnson
  • 相关性 1/10
  • 评分理由: 哈勃太空望远镜仪器操作与探测器老化模型,无统计方法或数据建模。

45. 2608.25111 — CCAT: The Prime-Cam Instrument for the Fred Young Submillimeter Telescope -- Overview and Status

  • 作者: Eve M. Vavagiakis, Yuhan Wang, Lawrence T. Lin, Manuel Aravena, Jason E. Austermann, Frank Bertoldi et al.
  • 相关性 1/10
  • 评分理由: 亚毫米望远镜仪器概述与状态报告,无统计或数据建模内容。

46. 2608.23690 — A General Response Theory for Closure Phases through Visibility Nulls and Image Structure

  • 作者: Shokoufe Faraji, Avery E. Broderick
  • 相关性 1/10
  • 评分理由: 天文干涉测量理论,但过于专业且无统计方法讨论,不满足astrostats入门标准。

47. 2608.23148 — Development of an adaptive optics testbed at MPIA for the ELT/Planetary Camera and Spectrograph (PCS)

  • 作者: Raphaël Pourcelot, Thomas Bertram, Peter Bizenberger, Markus Feldt, Markus Kasper, Silvia Scheithauer et al.
  • 相关性 1/10
  • 评分理由: 自适应光学硬件测试平台,与统计兴趣无关。

48. 2608.27379 — The MICADO first light imager for the ELT: first on-bench performance tests of the SCAO hybrid LQG+Integrator controller

  • 作者: N. Levraud, F. Ferreira, A. Sevin, E. Gendron, N. Galland, H. -F. Raynaud et al.
  • 相关性 0/10
  • 评分理由: 自适应光学控制器工程论文,与统计兴趣完全无关。

49. 2608.24459 — A high-isolation wideband channelizer for MKID readouts: a custom HLS implementation on RFSoC

  • 作者: Alberto Hernandez Fernandez, David Diaz Martin, Jose Javier Diaz Garcia, Roger John Hoyland, Luis Fernando Rodriguez Ramos, Diego Portero Rodriguez et al.
  • 相关性 0/10
  • 评分理由: 纯硬件工程论文,与统计兴趣完全无关。

50. 2608.24445 — Forward modelling coronagraphic images with a fully physical, differentiable digital twin of MagAO-X: first laboratory results

  • 作者: Matthijs Mars, Sebastiaan Y. Haffert, Louis Desdoigts, Joseph D. Long, Rico Landman, Jared R. Males et al.
  • 相关性 0/10
  • 评分理由: 天文仪器光学建模论文,无统计方法或数据建模内容。

51. 2608.24442 — NEXT: The Netherlands EXoplanet Testbed I. Goals and opto-mechanical design

  • 作者: Rico Landman, Sebastiaan Haffert, Louis Desdoigts, Matthijs Mars, Dhwanil Patel, Daniel Smith et al.
  • 相关性 0/10
  • 评分理由: 天文仪器光学设计论文,无统计方法或数据建模内容。

52. 2608.24438 — No need to modulate: On-sky results of a Neural Network enhanced pyramid wavefront sensor and prospects for the ELTs

  • 作者: Rico Landman, Liam Koning, Sebastiaan Y. Haffert, Joseph D. Long, Jared R. Males, Matthijs Mars et al.
  • 相关性 0/10
  • 评分理由: 天文自适应光学系统论文,无统计方法或数据建模内容。

53. 2608.24343 — Digging dark holes on-sky with the Self-Coherent Camera: Preliminary results

  • 作者: Elena Tonucci, Sebastiaan Y. Haffert, Jared R. Males, Laird M. Close, Kyle van Gorkom, Olivier Guyon et al.
  • 相关性 0/10
  • 评分理由: 天文高对比度成像仪器论文,无统计方法或数据建模内容。

54. 2608.24339 — On-sky demonstration of self-learning predictive control with MagAO-X

  • 作者: Sebastiaan Y. Haffert, Jared R. Males, Parker T. Johnson, Laird M. Close, Olivier Guyon, Jay Kueny et al.
  • 相关性 0/10
  • 评分理由: 天文自适应光学控制论文,无统计方法或数据建模内容。

55. 2608.24333 — Sub-diffraction-limited coronagraphic imaging with nano-printed PIAACMC phase masks

  • 作者: Elena Tonucci, Sebastiaan Y. Haffert, Warren B. Foster, Jared R. Males, Olivier Guyon, Laird M. Close et al.
  • 相关性 0/10
  • 评分理由: 天文日冕仪光学设计论文,无统计方法或数据建模内容。

56. 2608.24324 — The final design of GMagAO-X: the wavefront sensing and control (WFS&C) architecture of GMagAO-X

  • 作者: Sebastiaan Y. Haffert, Jared R. Males, Laird M. Close, Olivier Guyon, Olivier Durney, Maggie Kautz et al.
  • 相关性 0/10
  • 评分理由: 天文仪器系统设计论文,无统计方法或数据建模内容。

57. 2608.24315 — Quantum-optimal instruments for high-contrast imaging with multi-plane light converters

  • 作者: Sebastiaan Y. Haffert, Yinzi Xin, Rico Landman
  • 相关性 0/10
  • 评分理由: 纯光学工程论文,与统计兴趣完全无关。

58. 2608.24308 — The Photonic Lantern Nuller: from concept to laboratory and on-sky demonstrations

  • 作者: Yinzi Xin, Nemanja Jovanovic, Dimitri Mawet, Daniel Echeverri, Yoo Jung Kim, Jonathan Lin et al.
  • 相关性 0/10
  • 评分理由: 天文仪器工程论文,无统计或数据建模内容。

59. 2608.24289 — Demonstration of simultaneous PIAA- coronagraphy and wavefront sensing using a single metasurface-based focal-plane optic

  • 作者: Dhwanil Patel, Sebastiaan Y. Haffert, Skyler Palatnick, Adam Taras, Maxwell A. Millar-Blanchaer, Matthijs Mars et al.
  • 相关性 0/10
  • 评分理由: 光学/光子学工程论文,无统计或数据建模内容。

60. 2608.24071 — Validation and extension of the PAWS Zemax model as a first step in the development of a Compact Arrayed Waveguide Stacked Multi-Object Spectrograph (CAWSMOS)

  • 作者: Fabienne Mangelsdorff, Andreas Stoll, Lars Zimmermann, Stefan Lischke, Riya M. Pattery, Kalaga Madhav et al.
  • 相关性 0/10
  • 评分理由: 光谱仪工程设计论文,与统计兴趣完全无关。

61. 2608.23668 — BlueBird 6 is Fainter than Block 1 Satellites

  • 作者: Anthony Mallama, Richard E. Cole
  • 相关性 0/10
  • 评分理由: 卫星亮度观测报告,无统计或数据建模内容。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论