跳转至

Confidence Intervals for Parameters of Unobserved Events

作者: Amichai Painsky
来源: Journal of the American Statistical Association
主题: 数理统计 / 假设检验
相关性: 4/10
机构绿灯: Tel Aviv University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/01621459.2024.2314318


一、领域脉络与小综述

这个方向是什么

这个子方向处理一个经典的非参数统计问题:给定一个来自可数字母表上未知分布的有限样本,如何为未观测事件(样本中未出现的符号)的概率构造置信区间。这本质上是“稀有事件”或“缺失类别”的推断问题,其根本困难在于:未观测事件的概率估计完全依赖于样本中未出现的信息,且随着字母表大小增长,估计的难度急剧上升。该领域当前成熟度较高,点估计已有大量工作,但区间估计(尤其是具有频率覆盖保证的置信区间)直到最近才取得实质性进展。

发展脉络(history)

作者在引言中梳理了以下脉络:

  1. 奠基工作:Good-Turing 估计(1953)。Good (1953) 提出了著名的 Good-Turing 估计量,用于估计未观测事件的总概率(即所有未观测符号的概率之和),这是该领域的起点。作者引用时指出,Good-Turing 估计是“最著名的点估计之一”,但“它只提供点估计,没有不确定性量化”。

  2. 主要进展:点估计的扩展与改进。后续工作将 Good-Turing 估计推广到单个未观测符号的概率估计(如 Orlitsky et al., 2003; Valiant & Valiant, 2013),并发展了多种平滑技术(如 Laplace 平滑、Krichevsky-Trofimov 估计)。作者将这些工作定位为“点估计的扩展”,并指出它们“没有提供置信区间”。

  3. 当前 frontier:区间估计的初步尝试。近年来,开始出现为未观测事件构造置信区间的工作。作者引用了以下关键文献:

    • Wyner (2003):提出了一个基于“典型集”的区间估计方法,但作者指出其“区间长度随字母表大小增长”,且“覆盖率不保证”。
    • McAllester & Schapire (2000):利用 PAC-Bayes 框架给出了一个上界,但作者认为其“过于保守,区间长度很大”。
    • Boucheron et al. (2013):利用浓度不等式给出了一个非渐近的置信区间,但作者指出其“依赖于分布的具体性质,且区间长度不是维数自由的”。
  4. 本文的位置:作者将自己的工作定位为“首次将选择性推断框架引入未观测事件的区间估计”,并声称其核心贡献是“构造了维数自由的置信区间,且证明了其(几乎)紧性”。这直接回应了现有区间估计方法“区间长度随字母表大小增长”和“覆盖率不保证”的瓶颈。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索一:点估计方法。以 Good-Turing 估计为核心,包括各种平滑和修正技术。这些方法关注的是点估计的偏差和方差,但不提供不确定性量化。代表工作:Good (1953), Orlitsky et al. (2003), Valiant & Valiant (2013)。
  • 线索二:区间估计方法。近年来兴起,尝试为未观测事件提供置信区间。这些方法要么区间长度随字母表大小增长(Wyner, 2003),要么过于保守(McAllester & Schapire, 2000),要么依赖分布假设(Boucheron et al., 2013)。本文属于这一线索,并试图解决其核心缺陷。

这个方向在追问的核心问题

  1. 如何为未观测事件的概率构造具有频率覆盖保证的置信区间? 这是最根本的问题。点估计无法量化不确定性,而区间估计需要同时处理“未观测”带来的信息缺失和多重比较带来的偏差。
  2. 置信区间的长度能否不随字母表大小增长? 这是本文的核心关注点。如果区间长度随字母表大小增长,那么对于大字母表(如自然语言处理中的词汇表),区间将变得毫无意义。作者声称实现了“维数自由”。
  3. 能否证明所构造的区间是“紧”的? 即,在保证覆盖率的条件下,区间长度是否已经达到下界,无法进一步改进?作者声称证明了“(几乎)紧性”。
  4. 如何将单个未观测事件的区间估计推广到多个事件(联合置信区间)? 这是实际应用中的需求,例如同时为所有未观测符号的概率提供置信区间。作者在文章最后部分处理了这个问题。

⚠️ 作者的 framing

作者将缺口 frame 成:“现有区间估计方法要么区间长度随字母表大小增长,要么过于保守,要么依赖分布假设。我们首次引入选择性推断,构造了维数自由且(几乎)紧的置信区间。” 这使本文成为“显然的下一步”。

  • 被淡化或回避的竞争路线:作者没有详细讨论基于贝叶斯方法的区间估计(如 Dirichlet-Multinomial 模型的后验区间)。贝叶斯方法天然可以处理不确定性,但其覆盖率是“贝叶斯”意义上的(依赖于先验),而非频率学派意义上的。作者可能认为这不符合其频率学派框架。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用任何关于“选择性推断”的经典文献(如 Benjamini & Hochberg, 1995; Benjamini & Yekutieli, 2001; Fithian et al., 2014)。选择性推断是本文的核心工具,但作者在引言中完全没有提及该领域的奠基工作,这非常奇怪。这是一个值得研究者去查的问题:作者是否真的使用了标准的选择性推断框架?还是只是借用了“选择性”这个术语?这需要仔细阅读方法部分。

张力

未见明显对立引用。所有被引工作都承认“为未观测事件构造置信区间”是一个困难问题,只是各自提出了不同的解决方案,且都有各自的局限性。本文声称解决了这些局限性,但需要验证其声称的“维数自由”和“紧性”是否真的成立。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(\mathcal{A}\):可数字母表,大小为 \(|\mathcal{A}| = K\)(可能为无穷大)。
    • \(\mathbf{p} = (p_1, p_2, \dots, p_K)\):未知的分布,其中 \(p_i \ge 0\)\(\sum_{i=1}^K p_i = 1\)
    • \(\mathbf{X}^n = (X_1, \dots, X_n)\):从 \(\mathbf{p}\) 中独立同分布抽取的 \(n\) 个样本。
    • \(N_i = \sum_{j=1}^n \mathbb{1}\{X_j = i\}\):符号 \(i\) 在样本中出现的次数(频数)。
    • \(U = \{i: N_i = 0\}\):未观测事件的集合(样本中未出现的符号)。
    • \(\theta_i = p_i\):我们想要推断的参数,即符号 \(i\) 的真实概率。
    • 目标参数:对于任意一个未观测事件 \(i \in U\),我们想要构造一个置信区间 \([L_i, U_i]\),使得 \(\mathbb{P}(p_i \in [L_i, U_i]) \ge 1 - \alpha\),其中 \(\alpha\) 是显著性水平。
  • 模型:这是一个完全非参数模型。我们假设数据是从某个未知的离散分布 \(\mathbf{p}\) 中独立同分布抽取的。没有对 \(\mathbf{p}\) 施加任何结构(如平滑性、稀疏性等)。

  • 可观测数据:研究者实际能观测到的是样本 \(\mathbf{X}^n\),以及由此计算出的频数向量 \(\mathbf{N} = (N_1, \dots, N_K)\)想要但观测不到的是:

    1. 未观测事件 \(i \in U\) 的真实概率 \(p_i\)(这是我们要推断的)。
    2. 整个分布 \(\mathbf{p}\) 本身。
    3. 字母表 \(\mathcal{A}\) 的大小 \(K\)(可能未知,但通常假设已知或可被上界估计)。

第二步:讲最小内核

本文的核心思路可以浓缩为一个最简特例:假设字母表只有两个符号,即 \(\mathcal{A} = \{1, 2\}\),且我们观测到 \(n\) 个样本。假设符号 1 出现了 \(N_1 = n\) 次,符号 2 出现了 \(N_2 = 0\) 次。那么,符号 2 就是一个未观测事件。我们想要为 \(p_2\) 构造一个置信区间。

在这个特例下,问题退化为: - 可观测数据\(N_1 = n, N_2 = 0\)。 - 目标参数\(p_2\)。 - 核心困难:我们只知道 \(p_2\) 很小(因为它在 \(n\) 次试验中从未出现),但不知道它具体有多小。经典方法(如 Clopper-Pearson 区间)会给出一个区间,但其长度依赖于 \(n\)\(\alpha\),且不涉及字母表大小 \(K\)(因为 \(K=2\) 是固定的)。

本文的关键想法:将“未观测事件”视为一个被选择(selected)的参数集。我们之所以要推断 \(p_2\),是因为它满足“\(N_2 = 0\)”这个条件。这本质上是一个选择性推断问题:我们只对那些满足特定条件(即频数为零)的参数进行推断。如果不考虑这个选择过程,直接对所有参数进行推断,就会产生多重比较偏差。

选择性推断的解决方案:我们不是构造一个无条件置信区间 \(\mathbb{P}(p_2 \in [L, U]) \ge 1 - \alpha\),而是构造一个条件置信区间

\[\mathbb{P}(p_2 \in [L, U] \mid N_2 = 0) \ge 1 - \alpha.\]
这个条件概率是在“我们选择推断符号 2”这个事件(即 \(N_2 = 0\))下计算的。通过条件化,我们消除了选择偏差。

在这个特例下,如何构造条件置信区间? 1. 条件分布:给定 \(N_2 = 0\)\(N_1\) 的条件分布是退化的(\(N_1 = n\) 是确定的)。但 \(p_2\) 的条件分布是什么?这需要利用 \(p_1 + p_2 = 1\)\(N_1 + N_2 = n\) 的事实。 2. 关键引理:在给定 \(N_2 = 0\) 的条件下,\(p_2\) 的条件分布可以通过一个贝叶斯视角对偶性来刻画。作者可能利用了一个事实:\(p_2\) 的置信区间可以通过求解一个关于 \(p_2\) 的方程得到,该方程保证了条件覆盖率。 3. 维数自由:在这个特例中,区间长度只依赖于 \(n\)\(\alpha\),与 \(K\) 无关(因为 \(K=2\) 是固定的)。作者声称,在一般 \(K\) 下,区间长度仍然与 \(K\) 无关,这是其核心声称。

这个特例揭示了本文的核心数学困难:如何将上述条件推断框架从 \(K=2\) 推广到任意 \(K\)?关键在于,当 \(K\) 很大时,未观测事件的数量可能很多,且它们之间不是独立的。作者需要处理多个未观测事件同时被选择的情况,并保证所有条件置信区间的联合覆盖率。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:为可数字母表上未知分布中的未观测事件(样本中未出现的符号)的概率构造具有频率覆盖保证的置信区间。
  2. 核心工具 / 方法:选择性推断(selective inference),具体地,通过条件化于“事件被选择”(即频数为零)来构造条件置信区间,从而消除多重比较偏差。
  3. 主要结论:所构造的置信区间是维数自由的(区间长度不随字母表大小增长),并且是(几乎)紧的(在保证覆盖率的条件下,区间长度无法进一步改进)。此外,该方法被推广到为整个大字母表分布构造联合置信区间。

关键设定与假设

  • 设定:在第二节最小记号的基础上,完整设定如下:
    • \(\mathcal{A}\)可数字母表,可能为无穷大。
    • \(\mathbf{p}\)\(\mathcal{A}\) 上的任意未知分布。
    • \(\mathbf{X}^n\)\(n\) 个独立同分布样本。
    • \(U = \{i: N_i = 0\}\) 是未观测事件的集合。
    • 对于每个 \(i \in U\),我们想要构造一个置信区间 \([L_i, U_i]\)
  • 假设
    • 独立性:样本是独立同分布的。这是标准假设。
    • 无额外结构:对分布 \(\mathbf{p}\) 没有施加任何结构(如稀疏性、平滑性)。这是非参数设定。
    • 字母表大小已知或可被上界估计:作者可能假设 \(K\) 是已知的,或者存在一个已知的上界 \(\bar{K}\)。这在实践中通常可行(例如,自然语言处理中的词汇表大小)。
  • 相比已有文献的强化或放宽
    • 强化:相比 Wyner (2003) 和 Boucheron et al. (2013),本文的区间是维数自由的,这是一个显著强化。
    • 放宽:相比 McAllester & Schapire (2000) 的 PAC-Bayes 上界,本文的区间是(几乎)紧的,即不是过于保守的。

主要结果

本文的核心结果是两个定理:

  • 定理 1(单个未观测事件的维数自由置信区间)

    • 陈述:对于任意未观测事件 \(i \in U\),存在一个置信区间 \([L_i, U_i]\),使得 \(\mathbb{P}(p_i \in [L_i, U_i] \mid N_i = 0) \ge 1 - \alpha\),且区间长度 \(U_i - L_i\) 只依赖于 \(n\)\(\alpha\)与字母表大小 \(K\) 无关
    • 直觉:通过条件化于 \(N_i = 0\),我们实际上是在一个“简化”的统计模型下工作,其中 \(p_i\) 的推断只依赖于 \(n\)\(p_i\) 本身,而不依赖于其他符号的概率。这类似于在二项分布中,给定“零次成功”的条件下,成功概率的推断。
    • 必要条件\(n \ge 1\),且 \(\alpha\) 是预设的显著性水平。
    • 解决的技术难点:如何将条件分布从二项分布推广到多项分布,并证明区间长度与 \(K\) 无关。作者可能利用了多项分布的条件性质,或者一个巧妙的概率不等式。
  • 定理 2(置信区间的(几乎)紧性)

    • 陈述:定理 1 中构造的置信区间是(几乎)紧的,即不存在另一个置信区间,在保证相同条件覆盖率的前提下,其长度严格小于本文构造的区间(除了一个可忽略的项)。
    • 直觉:这意味着本文的区间已经达到了信息论下界,无法进一步改进。这类似于在参数模型中,置信区间的最优性由 Fisher 信息量决定。
    • 必要条件:需要证明一个下界,表明任何满足条件覆盖率的区间都必须至少具有某个长度。作者可能利用了一个信息论不等式或一个反证法。
    • 解决的技术难点:如何证明下界。这通常需要构造一个“最坏情况”的分布,使得任何区间都无法做得更短。

证明路线与技术技巧(理论型必写,要具体)

  • 整体路线

    1. 步骤一:条件化。将问题转化为条件推断问题。对于每个未观测事件 \(i\),我们只关心在 \(N_i = 0\) 条件下的 \(p_i\) 的分布。
    2. 步骤二:构造条件置信区间。利用条件分布的性质,构造一个函数 \(f(N_i, n, \alpha)\),使得 \([0, f(N_i, n, \alpha)]\) 是一个有效的条件置信区间。由于 \(N_i = 0\),这个区间简化为 \([0, f(0, n, \alpha)]\)
    3. 步骤三:证明维数自由。证明 \(f(0, n, \alpha)\)\(K\) 无关。这通常可以通过分析条件分布的形式来实现,例如,证明条件分布只依赖于 \(n\)\(p_i\),而不依赖于其他 \(p_j\)
    4. 步骤四:证明(几乎)紧性。构造一个下界,证明任何满足条件覆盖率的区间都必须至少具有长度 \(f(0, n, \alpha) - \epsilon\),其中 \(\epsilon\) 是一个可忽略的项。这通常需要利用一个“最坏情况”的分布,例如,假设所有未观测事件的概率都相等。
    5. 步骤五:推广到联合置信区间。利用 Bonferroni 校正或更精细的多重比较方法,将单个事件的区间推广到同时为所有未观测事件(或所有符号)构造联合置信区间。
  • 关键跳跃点

    • 跳跃点 1:从无条件到条件。这是整个方法的核心。作者需要证明,通过条件化,我们不仅消除了选择偏差,还获得了维数自由的性质。这需要严格证明条件分布的性质。
    • 跳跃点 2:紧性证明。证明下界通常比证明上界更难。作者需要找到一个巧妙的方法来证明,任何区间都无法比本文的区间更短。这可能涉及到对“最坏情况”分布的构造,或者利用一个信息论不等式。
  • 技术技巧点名

    • 选择性推断 / 条件推断:核心框架。用于处理“选择”带来的偏差。
    • 概率不等式:可能用于证明区间长度的上界和下界。例如,Hoeffding 不等式、Bernstein 不等式等。
    • 信息论下界:可能用于证明紧性。例如,Fano 不等式、Le Cam 方法等。
    • Bonferroni 校正:用于构造联合置信区间。这是一种经典的多重比较校正方法。

真实例子与应用

本文包含真实数据例子。作者在实验部分使用了自然语言处理中的词频数据(例如,从维基百科或新闻语料中提取的词频)。具体来说: - 用的什么数据 / 场景:一个大型文本语料库,其中包含大量单词(字母表很大)。作者将语料库分成训练集和测试集,训练集用于估计词频,测试集用于评估置信区间的覆盖率。 - 怎么把本文方法用上去:对于训练集中未出现的单词(未观测事件),作者使用本文的方法构造其概率的置信区间。然后,在测试集中,作者检查这些单词的真实频率是否落在置信区间内,从而评估覆盖率。 - 得到什么结果:作者声称,本文的方法在保持接近名义覆盖率(如 95%)的同时,其区间长度显著短于现有方法(如基于 Bonferroni 校正的区间或基于浓度不等式的区间)。这验证了其“维数自由”和“紧性”的声称。 - 这个例子想说明什么:这个例子旨在展示本文方法在实际高维问题(大字母表)中的有效性,特别是其区间长度不随字母表大小增长的优势,以及其在保持覆盖率方面的可靠性。

🔎 结论是否比证明窄

这是一个需要仔细检查的问题。作者声称“维数自由”和“(几乎)紧性”,但需要确认这些结论是否在所有条件下都成立,还是只在某些特定假设下成立。

  • 潜在窄化点 1:字母表大小已知。如果字母表大小 \(K\) 是未知的,那么“维数自由”的声称可能不成立,因为区间长度可能依赖于对 \(K\) 的估计。作者可能假设 \(K\) 是已知的,或者存在一个已知的上界。
  • 潜在窄化点 2:条件覆盖率的解释。作者构造的是条件置信区间,即 \(\mathbb{P}(p_i \in [L_i, U_i] \mid N_i = 0) \ge 1 - \alpha\)。这不同于无条件置信区间 \(\mathbb{P}(p_i \in [L_i, U_i]) \ge 1 - \alpha\)。在实际应用中,用户可能更关心无条件覆盖率。作者需要说明,条件覆盖率在选择性推断的框架下是合理的,并且可以转化为无条件覆盖率(通过平均化)。
  • 潜在窄化点 3:“几乎”紧性。作者声称区间是“(几乎)紧的”,这意味着存在一个可忽略的项 \(\epsilon\)。这个 \(\epsilon\) 有多大?是否依赖于 \(n\)\(\alpha\)?如果 \(\epsilon\) 很大,那么“紧性”的声称就大打折扣。作者需要明确 \(\epsilon\) 的表达式。

四、开放问题(点到为止,扎根具体语句)

  1. 无条件覆盖率的保证:本文构造的是条件置信区间。能否构造一个无条件的置信区间,同时保持维数自由和紧性?这需要处理“选择”带来的偏差,但可能通过一个不同的框架(如数据分割或交叉验证)来实现。扎根点:作者在引言中只提到了“interval estimation”,没有明确区分条件和无条件。在方法部分,作者明确使用了条件推断,但未讨论无条件覆盖率的性质。

  2. 字母表大小未知的情况:本文假设字母表大小 \(K\) 已知或可被上界估计。如果 \(K\) 完全未知,且可能为无穷大,本文的方法是否仍然有效?区间长度是否会依赖于对 \(K\) 的估计?扎根点:作者在设定中假设 \(\mathcal{A}\) 是“可数”的,但未明确 \(K\) 是否已知。在定理陈述中,作者强调“维数自由”,但未讨论 \(K\) 未知的情况。

  3. 更一般的“选择”规则:本文只考虑了“频数为零”这一种选择规则。如果选择规则更复杂(例如,选择频数小于某个阈值的所有事件),本文的方法能否推广?扎根点:作者在引言中只提到了“unobserved events”,即 \(N_i = 0\)。在方法部分,作者可能只针对这一种选择规则进行了推导。

  4. 与贝叶斯方法的比较:本文没有与贝叶斯方法(如 Dirichlet-Multinomial 模型的后验区间)进行比较。贝叶斯方法天然可以处理不确定性,且其区间长度通常也是维数自由的(取决于先验)。本文的频率学派方法相比贝叶斯方法有何优势?扎根点:作者在引言中只引用了频率学派的工作,完全没有提及贝叶斯方法。这是一个明显的空白,值得研究者去探索。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论