跳转至

Confidence Horizons

作者: Chase Mathis, Ian Waudby-Smith
主题: 数理统计 / 假设检验
相关性: 7/10
链接: https://arxiv.org/abs/2608.03889


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是序贯推断中的“任意有效推断”(anytime-valid inference),其根本问题是:在数据持续到达、分析师可以随时“偷看”并可能提前停止实验的情况下,如何构造仍能保持频率覆盖或第一类错误控制的置信区间或检验。经典置信区间只在固定样本量下有效,而“置信序列”(confidence sequences)允许在任意停止时间下保持有效性,但代价是保守性——因为必须为无限时间水平分配误差预算。本文试图在“无限时间有效性”与“固定样本量有效性”之间找到一个中间地带:当实验存在一个已知的有限时间水平(如预算、伦理约束)时,放弃无限时间有效性,换取更紧的区间。

发展脉络(history)

从introduction和参考文献串起:

  • 奠基工作:Wald (1945) 的序贯检验、Darling & Robbins (1967) 的迭代对数不等式为序贯推断奠定基础。Pocock (1977) 和 O'Brien & Fleming (1979) 提出组序贯方法(group sequential methods),在预设的少数几个时间点进行中期分析,通过调整边界控制整体第一类错误。Wang & Tsiatis (1987) 将其推广为单参数族(参数q),统一了Pocock和O'Brien-Fleming边界。

  • 主要进展:Howard et al. (2021) 系统发展了非渐近置信序列(nonasymptotic confidence sequences),基于鞅不等式和Ville's inequality,在有限样本下保证时间均匀覆盖。但非渐近方法保守,且需要强矩假设(如有界或次高斯)。Waudby-Smith et al. (2024, 2023) 提出渐近置信序列(AsympCS),利用中心极限定理的序贯版本,在弱矩假设下获得渐近时间均匀覆盖,但仍然是无限时间水平,因此保守。

  • 当前frontier:在渐近置信序列的基础上,一些工作开始考虑有限时间水平下的优化。例如,Waudby-Smith & Ramdas (2024)、Voráček & Orabona (2026) 等通过调整参数使置信区间在某个固定时间点最紧;Koning & Van Meer (2026) 构造非渐近任意有效检验,使得最后一个检验与经典检验相同。但这些工作要么是非渐近的,要么没有显式利用有限时间水平来收紧边界。

  • 本文的位置:本文提出“置信水平线”(confidence horizons),明确在有限时间水平 [m, Δm] 上构造渐近任意有效推断,并推导出闭式渐近分位数(对于q∈{0,1/2,1}),避免了组序贯方法中反复数值积分的计算瓶颈。同时,将组序贯方法推广到鞅依赖数据,并证明其均匀性(uniformity over P, Δ, α)。论文声称:“We focus on eliminating this second source of conservativeness by deriving methods resembling asymptotic confidence sequences but that are only valid on bounded time horizons.”(第2页)

子线索聚类

被引文献大致落在三条子线索上:

  1. 非渐近置信序列:Howard et al. (2021)、Waudby-Smith & Ramdas (2024) 等。核心工具是鞅不等式和e-process,保证有限样本有效性,但保守且需要强矩假设。本文将其作为对比基准,但自身不采用e-process。

  2. 渐近置信序列:Robbins & Siegmund (1970)、Waudby-Smith et al. (2024, 2023)、Bibaut et al. (2022)。利用CLT的序贯版本,在弱矩假设下获得渐近时间均匀覆盖。本文的直接前身,但本文通过限制时间水平来收紧边界。

  3. 组序贯方法:Pocock (1977)、O'Brien & Fleming (1979)、Wang & Tsiatis (1987)、Jennison & Turnbull (2000)。在预设的少数几个时间点进行中期分析,通过数值积分计算边界。本文将其视为离散特例,并证明其连续极限就是置信水平线,同时给出闭式分位数,避免了数值积分。

这个方向在追问的核心问题

  • 核心问题1:如何在有限时间水平下获得比无限时间置信序列更紧的区间?误差预算如何最优分配?
  • 核心问题2:如何将组序贯方法的边界从离散时间点推广到连续时间,并避免反复数值积分?
  • 核心问题3:这些方法在鞅依赖数据(如自适应实验)下是否仍然有效?均匀性(uniformity over distributions)能否保证?
  • 已知瓶颈:无限时间置信序列的边界通常以 √(log t / t)√(log log t / t) 衰减,而固定样本量CLT区间以 1/√t 衰减。有限时间水平允许恢复到 1/√t 衰减,但需要精确的分布函数。

⚠️ 作者的framing

作者将缺口frame成:“The second factor is that confidence sequences enable considerable flexibility by permitting optional stopping at arbitrarily large sample sizes. This comes at a cost of ‘power’ at those sample sizes that are typically encountered in practice.”(第2页)因此,本文的“显然下一步”是:放弃无限时间有效性,换取有限时间下的更紧区间。

被淡化或回避的竞争路线: - 非渐近置信序列(如Howard et al.)虽然保守,但提供有限样本保证。本文只做渐近保证,回避了有限样本下的比较。 - 一些工作(如Koning & Van Meer, 2026)通过构造“最后一个检验与经典检验相同”的任意有效检验,也利用了有限时间水平,但本文没有详细比较。 - 关于e-process的渐近版本(Chugg et al., 2026; Massiani et al., 2026),本文仅在文献综述中提及,但未深入讨论。

明显该被引/该存在、却没出现在intro里的工作:可能包括一些关于“有限时间水平下最优停止”的贝叶斯或决策理论工作,但本文聚焦频率学派,可能有意忽略。另外,关于“自适应实验中的序贯推断”的近期工作(如Hadad et al., 2021)在Section 4中引用,但intro中未提及。

张力

未见明显对立引用。所有被引工作基本一致认为:无限时间有效性带来保守性,有限时间水平可以改善。本文与组序贯方法的关系是互补而非对立:组序贯是离散特例,置信水平线是连续推广。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - X₁, X₂, ...:在线到达的随机变量(可观测数据)。 - P:数据分布,属于分布族 𝒫。 - µ_P = E_P[X₁]:感兴趣的参数(均值)。 - m:起始样本量(start time),m ∈ ℕ。 - Δ ≥ 1:乘法水平(multiplicative horizon),即最大样本量为 ⌊Δm⌋。 - t:当前样本量,t ∈ [m, Δm]。 - ˆµ_t = (1/t) Σ_{i=1}^t X_i:样本均值。 - ˆσ_t:样本标准差(或一致估计量)。 - Ψ(·; Δ, q):随机变量 ζ(Δ, q) = sup_{s∈[1,Δ]} |W(s)| s^{q-1} 的分布函数,其中 W(s) 是标准Wiener过程。 - Ψ^{-1}(1-α; Δ, q):对应的上α分位数。 - q ∈ ℝ:边界形状参数(power of boundary decay)。

模型: - 数据 X₁, X₂, ... 独立同分布(i.i.d.)于分布 P,满足 E[X₁] = µ_PVar(X₁) = σ_P² > 0,且存在 κ > 2 使得 E[|X₁|^κ] < ∞(Proposition 3.1的条件)。更一般的独立非同分布或鞅依赖情形在Theorem 3.3和3.7中处理。 - 目标是构造序列 {¯C_t^{(Δ)}}_{t∈[m,Δm]},使得渐近覆盖概率为 1-α

可观测数据: - 研究者实际观测到的是 X₁, X₂, ..., X_t(在线流数据)。 - 不可观测的是:真实均值 µ_P、真实方差 σ_P²、以及潜在的反事实(在因果例子中)。 - 关键假设:通过CLT和强近似,可以用样本均值和样本方差逼近。

第二步:讲最小内核

最简特例:Proposition 3.1 —— q = 1/2 的“根CH”(rootCH)。

在这个特例下,论文的核心思路可以这样理解:

假设我们观测到 i.i.d. 数据 X₁, X₂, ...,想要对均值 µ 构造一个在时间窗口 [m, Δm] 上同时有效的置信区间序列。经典CLT置信区间在固定样本量 n 下是 ˆµ_n ± z_{1-α/2} σ/√n,但如果在多个时间点偷看,覆盖会崩溃。无限时间置信序列(AsympCS)通过使用更宽的边界(如 √(log t / t))来保证任意停止时间下的覆盖,但边界较宽。

本文的关键想法是:如果我们知道实验最多进行到 Δm,那么我们可以将误差预算只分配到这个有限窗口,从而使用更紧的边界——具体地,边界形状为 ˆσ_t · Ψ^{-1}(1-α; Δ, 1/2) / √t,其中 Ψ^{-1} 是Wiener过程在有限区间 [1, Δ] 上supremum的分布函数的分位数。这个边界与CLT边界形式相同(都是 1/√t 衰减),但乘子 Ψ^{-1} 大于 z_{1-α/2},因为需要同时覆盖多个时间点;但小于无限时间置信序列的乘子(如 √(2 log log t) 量级)。

数学上:要证的是

lim_{m→∞} P( ∀ t ∈ [m, Δm] : µ ∈ ˆµ_t ± ˆσ_t Ψ^{-1}(1-α; Δ, 1/2) / √t ) = 1-α.
证明的核心是:通过强近似(Komlós-Major-Tusnády)将部分和过程耦合到Wiener过程,然后利用Wiener过程在有限区间上的supremum分布已知(即 Ψ),从而将覆盖概率转化为 P( sup_{s∈[1,Δ]} |W(s)| / √s ≤ Ψ^{-1}(1-α; Δ, 1/2) ) = 1-α。这里的关键是:有限区间 [1,Δ] 上的supremum分布是紧的,且可以通过闭式或数值积分精确计算,避免了无限时间下的对数因子。

为什么这个特例是内核:因为一般情形(任意 q、独立非同分布、鞅依赖)的证明路线完全一样,只是强近似条件更强、分布函数 Ψ 的参数不同。q=1/2 对应Pocock边界(连续版本),q=1 对应O'Brien-Fleming边界。读者理解了这个特例,就抓住了整篇论文的数学本质。


三、这篇论文做了什么

三句话

  1. 研究问题:在有限时间水平 [m, Δm] 下,构造渐近任意有效的置信区间(称为“置信水平线”),以克服经典置信序列因无限时间水平导致的保守性。
  2. 核心工具:利用强近似(Strassen's strong approximation / KMT coupling)将部分和过程耦合到Wiener过程,将覆盖概率转化为Wiener过程在有限区间上的supremum分布,并推导出 q∈{0,1/2,1} 时的闭式分布函数(涉及双变量正态分布和抛物柱面函数)。
  3. 主要结论:对于独立数据(Theorem 3.3)和鞅依赖数据(Theorem 3.7),置信水平线是sharp的(渐近覆盖精确等于 1-α),且当 q≠1/2 时是P-强均匀的(uniform over P, Δ, α),当 q=1/2 时是P-弱均匀的(uniform over bounded Δ)。此外,将组序贯方法(Wang-Tsiatis)推广到鞅依赖数据并证明均匀性(Proposition 5.2, 5.4)。

关键设定与假设

在第二节最小记号基础上,补全完整设定:

  • Definition 2 (AsympCH)liminf_{m→∞} P( ∀ t ∈ [m, Δm] : θ_P ∈ ¯C_t^{(m,Δ)} ) ≥ 1-α。sharp当极限存在且等号成立。
  • Definition 3 (弱/强均匀):弱均匀要求 sup_{Δ∈[1,Δ̄]} sup_{α∈(0,1)} sup_{P∈𝒫} |P(...) - (1-α)| → 0;强均匀要求 Δ̄ = ∞
  • Condition 1 (Uniform Summability):存在 κ>2δ∈(0,(κ-2)/2),使得 sup_{P∈𝒫} Σ_{n=1}^∞ E_P[|X_n - E_P[X_n]|^κ] / n^{1+δ} < ∞ 且尾部趋于0。这比i.i.d.情形更强,允许非同分布但矩均匀有界。
  • Condition 2 (Variance Stability)lim_{m→∞} sup_{P∈𝒫} sup_{t≥m} t^ρ |V_{P,t}/t - σ_P²| = 0,且 liminf_{t→∞} inf_{P∈𝒫} σ_{P,t}² > 0。这保证方差累积速度稳定。
  • Condition 3 (Strongly Consistent Variance Estimator)lim_{m→∞} sup_{P∈𝒫} P( sup_{t≥m} log t | ˆσ_t² / ˜σ_{P,t}² - 1 | ≥ s ) = 0。要求方差估计量以对数速率一致收敛。
  • Condition 4 (Variances Converge Almost Surely):鞅依赖下,要求 P( lim_{t→∞} t^ρ |V_{P,t}/t - σ_P²| = 0 ) = 1
  • Condition 5 (Lindeberg Uniform Integrability):鞅依赖下,要求 Σ_{t=1}^∞ E_P[ (Y_t - µ_{P,t})² 1{...} | ℱ_{t-1} ] / V_t^{2/κ} < ∞ a.s.,这是Strassen强近似所需。

相比已有文献: - 相比AsympCS(Waudby-Smith et al., 2024),本文增加了对有限时间水平的显式利用,并推导了闭式分位数。 - 相比组序贯方法(Jennison & Turnbull, 2000),本文允许连续时间偷看(而非离散时间点),并给出了均匀性保证和鞅依赖下的有效性。

主要结果

Theorem 3.3 (独立数据):在Condition 1-3下,对任意 q∈ℝ¯C_t^{(m,Δ)} = ˆµ_t ± ˆσ_t (m/t)^q m^{-1/2} Ψ^{-1}(1-α; Δ, q) 构成sharp AsympCH。当 q≠1/2 时P-强均匀,q=1/2 时P-弱均匀。

Theorem 3.7 (鞅依赖数据):在Condition 4-5下,相同形式成立。

Proposition 3.4 (单侧):类似,但使用单侧分布函数 Ψ_+,且均匀性限制在 α ∈ (0, 1-α₁] 对于任意 α₁ > 1/2

Proposition 5.2 & 5.4 (组序贯方法的均匀性):Wang-Tsiatis边界在独立和鞅依赖数据下都是均匀有效的,且可推广到连续时间。

闭式分布函数:Section B.1-B.2给出 q∈{0,1/2,1} 时的 ΨΨ_+ 表达式。例如,q=1Ψ_+(x; Δ,1) = 2Φ₂(x, x/√Δ; 1/√Δ) - Φ(x)q=1/2 时涉及抛物柱面函数的无穷级数。

证明路线与技术技巧

整体路线(以Theorem 3.3为例,3-5步逻辑主干):

  1. 强近似:利用KMT耦合(Lemma A.12),将部分和过程 S_t - tµ_P 耦合到Wiener过程 W(t),误差为 ¯o_P(t^{γ} log t),其中 γ < -1/2。这使得我们可以用Wiener过程代替真实过程。
  2. 方差估计:利用Condition 3,将样本标准差 ˆσ_t 替换为真实标准差 σ_P,误差为 ¯o_P(1/log t)
  3. 尺度变换:将时间尺度从 [m, Δm] 变换到 [1, Δ],利用Wiener过程的自相似性:W(t) / √tt∈[m,Δm] 上的supremum分布等于 W(s) / √ss∈[1,Δ] 上的supremum分布乘以 m^{q-1/2}(Lemma A.1)。
  4. 分布收敛:经过上述替换后,覆盖概率收敛到 P( sup_{s∈[1,Δ]} |W(s)| s^{q-1} ≤ Ψ^{-1}(1-α; Δ, q) ) = 1-α
  5. 均匀性升级:利用分布函数 F(x; T, q) 的等度连续性和紧性(Lemma A.8),将点态收敛升级为均匀收敛(Lemma A.9,Pólya型引理)。

关键跳跃点: - 从离散时间到连续时间:Lemma A.11 将离散时间高斯过程耦合升级到连续时间Wiener过程,需要控制插值误差(Lemma A.17)。 - 方差累积的替换:Lemma A.10 允许将部分和除以累积方差 ˜σ_{P,t} 而非单个方差,这需要方差稳定性条件(Condition 2/4)。 - 分布函数的等度连续性:当 q=1/2 时,分布函数在 Δ→∞ 时失去等度连续性,因此只能得到弱均匀性。证明中利用Cameron-Martin范数(Lemma A.3)和LIL截断(Lemma A.5)来处理。

技术技巧点名: - 强近似:KMT (Komlós-Major-Tusnády) 耦合(Lemma A.12)和Strassen强近似(Lemma A.13),用于将部分和过程替换为Wiener过程。 - Cameron-Martin范数:用于控制分布函数的等度连续性(Lemma A.3)。 - Pólya型引理:Lemma A.9,将点态收敛升级为均匀收敛,需要分布函数的等度连续性和紧性。 - 抛物柱面函数:用于 q=1/2 时的闭式分布函数推导(Section B.2),涉及Ornstein-Uhlenbeck过程的首次通过时间。 - 双变量正态分布:用于 q∈{0,1} 时的闭式分布函数(Section B.1),通过反射原理和几何论证。 - 鞅的Marcinkiewicz-Zygmund SLLN和LIL:用于鞅依赖数据下的方差估计和收敛速率(Section A.4)。

真实例子与应用

Section 4: Neyman Allocation for Treatment Effect Estimation

  • 数据/场景:自适应实验,有 J 个处理臂,每个臂的潜在结果 Y_t(j) i.i.d. 来自分布 P_j,均值和方差未知。使用Kato et al. (2020) 的算法进行Neyman分配(根据估计方差分配样本),产生鞅依赖数据。
  • 方法应用:对每个臂 j,构造A2IPW估计量 ¯Z_t(j)(逆概率加权),然后应用Theorem 3.7的置信水平线(q=1/2)。需要验证Condition 4和5(Section A.4)。
  • 结果:Figure 5展示一次模拟的6个臂的置信水平线路径,per-arm覆盖接近0.95。Figure 6比较AsympCH与AsympCS、Neyman分配与均匀分配,显示AsympCH在期望停止时间上显著优于AsympCS,且Neyman分配进一步改善。
  • 这个例子想说明:置信水平线在自适应实验(鞅依赖)中有效,且比无限时间置信序列更紧,允许更早停止。

Section 6: Simulation Studies

  • 比较AsympCH(q∈{0,1/2,1})与AsympCS(Waudby-Smith et al., 2024)和非渐近CS(Howard et al., 2021)在i.i.d. Uniform(0,1)数据上的宽度和覆盖。Figure 9-10显示AsympCH宽度最窄,覆盖精确(接近名义水平),而AsympCS保守,CLT序列严重低估。
  • Figure 11展示近似误差随 m 增大而减小,对于偏态Beta分布,需要 m≈100 才能达到近似覆盖。

🔎 结论是否比证明窄

  • Theorem 3.3和3.7 的结论是sharp AsympCH,但证明中依赖强近似和方差估计条件。这些条件在i.i.d.或鞅依赖下是合理的,但论文没有讨论当条件不满足时(如重尾分布、方差估计不一致)的鲁棒性。
  • 均匀性:当 q=1/2 时,只得到弱均匀性(Δ̄ < ∞)。论文在Lemma A.4中明确指出,当 q=1/2 时,Cameron-Martin范数在 a=0b=∞ 时发散,因此等度连续性失败。这意味着对于 q=1/2,不能保证对任意大的 Δ 均匀。
  • 闭式分位数:只对 q∈{0,1/2,1} 给出闭式表达式。对于一般 q,论文说“closed-form distribution functions are unknown to us”并建议用Monte Carlo模拟(第9页)。这限制了方法的即用性。
  • 组序贯方法的均匀性:Proposition 5.2和5.4声称对任意 K∈ℕ 均匀,但证明中依赖Lemma A.14的均匀性,而Lemma A.14要求 T⊆[1,Δ]inf T=1, sup T=Δ。对于组序贯,T 是离散点集,但 inf T=1sup T=Δ 成立,因此均匀性成立。但论文没有讨论当组数 Km 增长时的情况(如 K = O(m)),此时离散点集可能变得稠密,但证明中的均匀性仍然成立,因为Lemma A.14对任意 T⊆[1,Δ] 成立。

四、开放问题

  1. 非渐近置信水平线:本文只做渐近保证。能否构造有限样本有效的置信水平线(非渐近),同时利用有限时间水平收紧边界?这需要类似e-process的工具,但针对有限时间水平优化。扎根于论文第2页:“The vast majority of confidence sequences in the literature are nonasymptotic... Methods with nonasymptotic validity tend to be conservative when compared to their asymptotic counterparts.” 以及第5页对非渐近CS的讨论。

  2. 一般 q 的闭式分位数:对于 q∉{0,1/2,1},论文只提供Monte Carlo模拟。能否推导出闭式或更高效的数值方法?这涉及Wiener过程加权supremum的分布,可能通过谱方法或积分方程。扎根于第9页:“For a general q, closed-form distribution functions are unknown to us. Nevertheless for general q, we can calculate Ψ^{-1}(α; Δ, q) through Monte Carlo simulation with arbitrary precision.”

  3. 多个不连续窗口:论文在Section C.1简要提到多个不连续窗口的情形,但未深入。如果分析师有多个可能的停止窗口(如 [m₁, Δ₁m₁] ∪ [m₂, Δ₂m₂]),如何构造联合有效的置信水平线?这需要计算Wiener过程在多个区间上的supremum分布。扎根于Section C.1:“What if instead we have a set of horizons that are disjoint: [m₁, m̄₁], [m₂, m̄₂], ..., [m_K, m̄_K].”

  4. 与e-process的渐近连接:论文提到渐近e-process(Chugg et al., 2026; Massiani et al., 2026),但未深入比较。能否将置信水平线的思想与e-process结合,构造渐近最优的e-process?这可能在计算效率和紧致性之间提供新权衡。扎根于第4页:“Finally, we mention the work of Chugg et al. [15] and Massiani et al. [43] who study asymptotic analogues of so-called e-processes... We neither make use of e-processes nor Ville’s inequality in this work.”

  5. 自适应实验中的最优停止:Section 4展示了Neyman分配下的应用,但停止规则是任意的。能否推导出在给定置信水平线下最小化期望样本量的最优停止规则?这涉及最优停止理论与序贯检验的结合。扎根于Remark 4.2:“If the experimenter is content at time t≈800 when arm 6 shows a statistically significant improvement upon arm 5, the experimenter can stop early.” 但论文没有给出最优停止的指导。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论