Efficient Human-in-the-Loop Active Learning: A Novel Framework for Data Labeling in AI Systems¶
讲者: Yiran Huang
会场: Advances in Fair and Efficient Machine Learning
报告题目: Efficient Human-in-the-Loop Active Learning: A Novel Framework for Data Labeling in AI Systems
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是主动学习(Active Learning, AL),其根本问题是:在标注预算有限的情况下,如何从大量未标注数据中自动选择最有信息量的样本交给专家标注,以最大化模型性能的提升。当前该领域已从简单的单点不确定性采样,发展到处理批量选择、深度模型、以及探索-利用平衡等复杂设定。本文试图将“如何标注”也纳入选择范围,即不仅选哪些样本,还选问什么问题(全标签 vs. 部分信息的二元问题)。
发展脉络(history)¶
- 奠基工作:Cohn et al. (1994) 提出通过主动学习改进泛化,奠定了“选择最有信息量的样本”这一核心范式。Settles & Craven (2008) 将不确定性采样系统应用于序列标注任务,确立了不确定性(熵、最小置信度、边际)作为主流查询准则的地位。
- 主要进展:Houlsby et al. (2011) 提出BALD(Bayesian Active Learning by Disagreement),将贝叶斯模型的不确定性(模型参数的后验不确定性)引入主动学习,成为贝叶斯方法的代表。Hanneke (2011) 给出了主动学习收敛率的理论分析,证明了在特定噪声条件下主动学习可以比被动学习快得多。Ash et al. (2020) 提出BADGE,通过“幻觉梯度”的多样性与幅度来选择批量样本,成为代表性方法中的SOTA。
- 当前frontier:探索-利用平衡(“冷启动”问题)成为焦点。Yuan et al. (2020) 利用自监督预训练损失缓解冷启动;Ren et al. (2021) 的综述指出模型初期不准确时,不确定性估计可能误导选择。批量主动学习(Hoi et al. 2006, Sener & Savarese 2017, Zhdanov 2019)也因效率需求而兴起。
- 本文的位置:作者声称现有方法只关注“选哪个样本”,而忽略了“怎么问”。他们引入“All”和“Any”两种新型查询(如“这些样本是否都属于类别c?”),并设计信息增益准则来同时选择查询类型和样本,再配合一个数据驱动的探索-利用框架来过滤冗余样本。
子线索聚类¶
- 不确定性方法:以熵(EN)、方差(VAR)、最小置信度(LC)为代表(Settles & Craven 2008, Nguyen et al. 2022)。简单、模型无关,但易受模型校准影响。
- 贝叶斯方法:以BALD为代表(Houlsby et al. 2011, Kirsch et al. 2019)。利用模型参数的后验不确定性,理论上更完备,但计算成本高。
- 代表性/多样性方法:以BADGE为代表(Ash et al. 2020),以及基于核心集(Sener & Savarese 2017)、密度(Xu et al. 2007)、聚类(Wang et al. 2017)的方法。旨在避免选择冗余样本。
- 数据驱动/元学习方法:如Konyushkova et al. (2017) 的“Learning Active Learning from Data”,Hsu & Lin (2015) 的“Active Learning by Learning”(将AL视为多臂老虎机问题)。试图从历史数据中学习查询策略。
这个方向在追问的核心问题¶
- 如何定义“信息量”:不确定性、多样性、代表性、预期模型变化,哪种度量最有效?能否统一?
- 如何平衡探索与利用:初期模型不可靠时,如何避免被误导,同时仍能高效探索?
- 如何扩展到批量与深度模型:批量选择如何避免冗余?深度模型的过自信问题如何缓解?
- 如何降低标注成本:除了减少样本数,能否通过更便宜的查询类型(如二元问题)进一步降本?
⚠️ 作者的framing¶
- 作者把缺口frame成:现有AL方法只考虑“问什么样本”,而忽略了“问什么问题”。他们声称引入“All/Any”查询可以(1)成本更低(并行感知、早期停止),(2)一次获取多个样本的信息,(3)更高效地探索空间。这使得他们的工作成为“显然的下一步”。
- 被淡化或回避的竞争路线:
- BADGE:作者承认BADGE是SOTA,但将其归为“代表性方法”,并声称自己的探索-利用框架能让传统方法(EN/VAR/LC)达到或超过BADGE。然而,BADGE本身也内在地处理了探索-利用(通过梯度多样性),作者并未深入比较两者机制上的差异。
- 贝叶斯方法(BALD):作者在实验中指出BALD在HAR数据集上表现差于随机采样,但归因于“探索-利用框架大幅提升了随机采样,而BALD可能过度关注参数不确定性而非准确性”。这回避了BALD在理论上的优势(模型不确定性)与实践中校准问题的张力。
- 批量主动学习:作者将自己的探索-利用框架扩展到批量设定,但并未与专门的批量方法(如BatchBALD, Kirsch et al. 2019)进行直接比较。
- 什么明显该被引/该存在、却没出现在intro里?
- BatchBALD (Kirsch et al. 2019):这是贝叶斯批量主动学习的代表性工作,直接扩展了BALD到批量。作者引用了Kirsch et al. 2019,但仅在列举贝叶斯方法时一笔带过,未在批量设定部分深入讨论。
- Learning Loss for Active Learning (Yoo & Kweon, 2019):一种通过预测损失来指导主动学习的代表性方法,在深度AL中很流行。未被引用。
- Core-set 方法 (Sener & Savarese, 2017):被引用,但仅作为批量AL的一个例子,未讨论其与本文探索-利用框架在“覆盖整个空间”这一目标上的相似性与差异。
- 关于“All/Any”查询成本的理论或实证分析:作者声称这些查询成本更低,但引用的心理学文献(Thornton & Gilden 2007, Buetti et al. 2016)是关于视觉搜索的,并非直接关于标注成本。缺乏对“成本更低”这一核心假设的严格论证或实验测量。
张力¶
未见明显对立引用。所有被引工作基本都认同“选择信息量大的样本”这一核心范式,差异在于如何定义和计算信息量。本文引入的新查询类型是对这一范式的扩展,而非颠覆。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( x_i \in \mathcal{X} \subset \mathbb{R}^d \):第 \( i \) 个样本的特征向量(可观测)。
- \( y_i \in \mathcal{Y} = \{1, 2, \dots, C\} \):第 \( i \) 个样本的真实类别标签(大部分不可观测,是我们要估计的目标)。
- \( N \):总样本量。
- \( D_{\text{full}} = \{(x_i, y_i)\}_{i=1}^N \):完整数据集(标签大部分未知)。
- \( D_0 \):初始已标注的小样本集。
- \( D^x_{\text{full}} = \{x_i\}_{i=1}^N \):所有样本的特征(完全可观测)。
- \( p_c(x; \theta) \):模型预测样本 \( x \) 属于类别 \( c \) 的概率,\( \theta \) 是模型参数。
- \( \mathbf{p}(x; \theta) = (p_1(x; \theta), \dots, p_C(x; \theta)) \):预测概率向量。
- \( Q_k \):第 \( k \) 种查询类型(如“Class”、“All”、“Any”)。
- \( q \):一次具体的查询实现(如“问样本 \( x_1, x_2 \) 是否都属于类别 1”)。
- \( a \):对查询 \( q \) 的答案(如“是”或“否”)。
- \( \text{Gain}(q; Q_k, \theta) \):在模型参数 \( \theta \) 下,查询 \( q \) 的预期信息增益。
- \( B \):总标注预算。
-
\( \text{cost}_k \):第 \( k \) 种查询的单次成本。
-
模型:
-
分类模型:\( p(\cdot; \theta): \mathbb{R}^d \to \mathcal{P} \),其中 \( \mathcal{P} \subset \mathbb{R}^C \) 是概率单纯形。模型通过最小化交叉熵损失在已标注数据 \( D_0 \) 上训练得到 \( \hat{\theta} \)。这是一个标准的概率分类模型,可以是逻辑回归、浅层神经网络或深度神经网络。
-
可观测数据:
- 可观测:所有样本的特征 \( x_i \),以及初始小样本集 \( D_0 \) 中的标签 \( y_i \)。
- 想要但观测不到:大部分样本的真实标签 \( y_i \)。这是主动学习要解决的核心问题——通过主动选择查询来获取这些标签(或部分信息)。
- 关键区分:在主动学习过程中,研究者可以主动向“oracle”(专家)发起查询。查询的结果(答案 \( a \))会成为新的可观测数据。本文的创新在于,查询不仅可以是“这个样本的标签是什么?”(全信息),也可以是“这些样本是否都属于类别c?”(部分信息)。
第二步:讲最小内核¶
最简特例:二分类问题(\( C=2 \)),只考虑两种查询:“Class”(问单个样本的标签)和“Is”(问“这个样本是否属于类别1?”)。假设“Class”成本为1,“Is”成本为 \( c_1 \leq 1 \)。信息增益函数采用总变差(Total Variation):\( G(\mathbf{p}||\mathbf{r}) = \frac{1}{2} \sum_{c=1}^2 |p_c - r_c| \)。
-
“Class”查询的信息增益: 对于样本 \( x \),其预测概率为 \( \mathbf{p} = (p_1, p_2) \)。如果查询后得到答案 \( a = c \)(即标签为c),则后验概率向量变为 \( \mathbf{e}_c \)(one-hot向量)。预期信息增益为:
\[\text{Gain}(x; \text{Class}, \theta) = \sum_{c=1}^2 p_c \cdot G(\mathbf{p} || \mathbf{e}_c) = p_1 \cdot \frac{1}{2}(|p_1-1| + |p_2-0|) + p_2 \cdot \frac{1}{2}(|p_1-0| + |p_2-1|)\]由于 \( p_1 + p_2 = 1 \),计算可得 \( \text{Gain}(x; \text{Class}, \theta) = p_1(1-p_1) + p_2(1-p_2) = 2p_1(1-p_1) \)。这恰好是方差(Variance)准则的2倍(方差定义为 \( \sum_c p_c(1-p_c) \))。所以在这个特例下,总变差信息增益等价于方差。 -
“Is”查询的信息增益: 对于样本 \( x \),问“它是否属于类别1?”。根据Lemma 1,最优的提问类别是当前预测概率最大的那个。假设 \( p_1 \geq p_2 \),则问“是否属于类别1?”。
- 如果答案是“是”(概率 \( p_1 \)),则后验概率向量变为 \( \mathbf{e}_1 = (1, 0) \)。信息增益为 \( G(\mathbf{p}||\mathbf{e}_1) = \frac{1}{2}(|p_1-1| + |p_2-0|) = \frac{1}{2}(1-p_1 + p_2) = 1-p_1 \)。
-
如果答案是“否”(概率 \( p_2 \)),则后验概率向量变为 \( \mathbf{e}_2 = (0, 1) \)。信息增益为 \( G(\mathbf{p}||\mathbf{e}_2) = \frac{1}{2}(|p_1-0| + |p_2-1|) = \frac{1}{2}(p_1 + 1-p_2) = p_1 \)。 预期信息增益为:
\[\text{Gain}(x; \text{Is}, \theta) = p_1 \cdot (1-p_1) + p_2 \cdot p_1 = p_1(1-p_1) + (1-p_1)p_1 = 2p_1(1-p_1)\]这与“Class”查询的信息增益完全相同! -
核心洞察:在这个最简特例下,“Is”查询和“Class”查询提供了相同的信息增益,但“Is”查询的成本更低(\( c_1 \leq 1 \))。因此,在相同的预算下,选择“Is”查询可以问更多次,从而获得更快的性能提升。这就是本文方法的核心优势:用更便宜的查询换取更多的信息获取次数。Theorem 3 的结论正是基于此:当 \( c_1 \) 很小时,本文框架的收敛率优于传统AL。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在分类主动学习中,如何同时选择查询类型(全标签 vs. 部分信息的二元问题)和查询样本,以在有限预算下最大化模型性能。
- 核心工具/方法:提出了一个多查询主动学习框架(ALMQ),该框架(a)通过概率作为桥梁,将来自不同查询(“Class”、“All”、“Any”)的全信息和部分信息统一整合到模型训练中;(b)定义了一个基于保守信息增益的准则来同时选择最优的查询类型和样本;(c)引入了一个数据驱动的探索-利用框架,通过模型引导的距离度量动态过滤冗余样本。
- 主要结论:在5个数据集(含2个真实图像数据集)上的实验表明,ALMQ方法显著优于所有基线方法(EN、VAR、LC、BALD、BADGE、RA)。理论分析表明,传统AL的不确定性上界以 \( O(B^{-\alpha/d}) \) 速率衰减,而本文框架在“Is”查询成本 \( c_1 \) 较小时能达到更好的速率。
关键设定与假设¶
- 设定:池式(pool-based)主动学习,分类问题,类别数 \( C \) 已知且固定。模型为概率分类模型(如神经网络+softmax)。专家是完美oracle(答案绝对正确)。
- 核心假设:
- A1-A6(Section 4):这些假设用于推导不确定性上界。A1(不确定性有界)、A2(数据分布支撑与空间一致)、A3(初始训练集不确定性低)、A4(不确定性Lipschitz连续)、A5(不确定性随信息增加而下降的点很少)、A6(高不确定性时高预测概率不可靠)。这些假设在主动学习文献中常见(如Sener & Savarese 2017),但A5和A6较强,不易验证。
- 成本假设:“All”和“Any”查询的成本低于“Class”查询。作者引用了心理学文献(Thornton & Gilden 2007, Buetti et al. 2016)和池化检测文献(Hogan et al. 2020, Song et al. 2022)来支持这一假设,但并未在实验中实际测量或控制成本,而是人为设定。
- 模型假设:模型形式为 \( p_c(x; \theta) = \sigma(h_c(x; \theta)) / \sum_l \sigma(h_l(x; \theta)) \),其中 \( \sigma \) 是正且递增的激活函数(如softmax)。这涵盖了大多数神经网络分类器。
主要结果¶
- Theorem 1(传统AL的不确定性上界):在假设A1-A5下,传统AL(每次选不确定性最大的点)的不确定性上界以 \( O(B^{-\alpha/d}) \) 速率衰减,优于随机采样的 \( O((n+B)^{-\alpha/d}) \)。这量化了主动学习的优势。
- Theorem 2(“All”和“Any”查询的信息增益显式表达式):对于两类常见的信息增益函数(基于凸函数 \( \phi \) 的 \( G \)),给出了“All”和“Any”查询信息增益的解析解。这使得计算成为可能,无需穷举搜索后验概率空间。例如,当 \( G \) 为总变差时,表达式变得相对简洁。
- Theorem 3(ALMQ框架的不确定性上界):在假设A1-A6下,当只有“Class”(成本1)和“Is”(成本 \( c_1 \leq 1 \))两种查询时,ALMQ框架的最终不确定性上界与Theorem 1形式相同,但有效预算 \( \tilde{B} \) 更大。当 \( c_1 \) 很小时,\( \tilde{B} \) 显著大于 \( B \),意味着更快的衰减速率。这从理论上证明了引入低成本查询的优势。
- Theorem 4(不确定性对logits gap的敏感性):证明了熵、方差、最小置信度这三种不确定性度量,在softmax激活下,其上下界仅由logits gap \( \delta(x) = h_{c(x)}(x) - \max_{c \neq c(x)} h_c(x) \) 决定。这意味着,只要一个点与已标注点的logits gap足够大,其不确定性就可能很高,从而为探索-利用框架(基于logits距离过滤)提供了理论依据。
证明路线与技术技巧¶
- 整体路线(Theorem 1 & 3):
- 定义不确定性:将不确定性 \( AL(x) \) 定义为“Class”查询的信息增益。
- 覆盖数论证:利用A4(Lipschitz连续性),将输入空间 \( \mathcal{X} \) 划分为半径为 \( r \) 的网格。每个网格内的点不确定性相近。
- 不确定性下降:每次查询选不确定性最大的点。根据A5,每次查询后,只有少数网格的不确定性会显著下降。通过精心选择网格半径 \( r \),可以保证在 \( B \) 次查询后,所有网格的不确定性都低于某个阈值。
- 速率计算:通过优化网格半径 \( r \) 与查询次数 \( B \) 的关系,得到 \( O(B^{-\alpha/d}) \) 的速率。
-
Theorem 3的扩展:将“Is”查询视为成本更低的“Class”查询。由于两者信息增益相同(Lemma 1),在相同预算下,“Is”查询可以执行更多次。通过一个关于随机查询选择的概率论证(平方加权采样),将“Is”查询的有效次数 \( \tilde{B} \) 与总预算 \( B \) 联系起来,从而得到更优的速率。
-
关键跳跃点:
- Theorem 2的证明:关键在于将“All”和“Any”查询的后验概率集合 \( \mathcal{P}(q, a, Q_k) \) 的minimization问题转化为一个可解的优化问题。作者利用 \( G \) 函数的可分解性(\( G(\mathbf{P}||\mathbf{R}) = \sum_i G(\mathbf{P}_{i\cdot}||\mathbf{R}_{i\cdot}) \))和凸性,将问题简化为对每个样本独立求解,最终得到显式表达式。
-
Theorem 3中 \( \tilde{B} \) 的推导:需要将“Is”查询的随机选择过程建模为一个随机游走或鞅,并利用集中不等式(如Azuma-Hoeffding)来界定在预算 \( B \) 内实际执行的“Is”查询次数的下界。这是证明中最技术性的部分。
-
技术技巧点名:
- 覆盖数(Covering Number):用于将连续空间离散化,是证明收敛率的标准技巧。
- Lipschitz连续性:假设A4,用于连接空间距离与不确定性差异。
- 凸优化:Theorem 2的证明中,利用凸函数 \( \phi \) 的性质来求解minimization问题。
- 集中不等式:Theorem 3的证明中,用于分析随机查询选择过程。
- MCdrop (Gal & Ghahramani, 2016):用于缓解深度模型的过自信问题,通过多次dropout采样来近似模型不确定性,从而更稳健地估计信息增益。
真实例子与应用¶
- 数据:5个数据集。3个模拟数据集(Handwriting, HAR, MNIST)和2个真实世界图像数据集(Animals-10, Brain Tumor MRI)。
- 如何应用:在每个数据集上,将训练集视为未标注池,测试集用于评估。初始随机选择少量样本(如20个)作为 \( D_0 \)。然后运行ALMQ算法,在每次迭代中,根据信息增益和探索-利用框架选择查询类型和样本,更新模型,直到预算耗尽。对比基线包括EN、VAR、LC、BALD、BADGE和RA。
- 结果:
- ALMQ在所有5个数据集上一致性地显著优于所有基线方法。
- 在Animals-10数据集上,ALMQ仅用600个样本就达到了接近全量数据(>20000样本)的性能。
- 探索-利用框架显著提升了传统方法(EN、VAR、LC、RA)的性能,使其能与BADGE竞争甚至超越。
- BALD在HAR数据集上表现不佳,EN在Animals数据集上表现不佳,说明没有单一准则普遍最优。
- 例子想说明什么:
- 验证理论:实验证明了多查询策略和探索-利用框架在实际中的有效性。
- 展示优势:ALMQ在各类数据(特征数据、图像数据、医学图像)和模型(逻辑回归、浅层NN、CNN、ResNet)上均表现优异,展示了其通用性和鲁棒性。
- 对比基线:清晰地展示了ALMQ相对于现有SOTA(BADGE)和经典方法的优势。
🔎 结论是否比证明窄¶
- 是。Theorem 3的证明仅针对“Class”和“Is”两种查询,且假设“Is”的信息增益与“Class”相同(在总变差下成立)。但实验中的ALMQ使用了6种查询(“Class”、“All” for m=1,2,3, “Any” for m=2,3),且信息增益函数为总变差。Theorem 3并未直接证明“All”和“Any”查询(m>1)的优势,其理论支撑仅限于“Is”查询(即m=1的“All”或“Any”)。作者在Section 4.2开头也承认“涉及多个点的设定分析上具有挑战性”。
- Theorem 1的结论(\( O(B^{-\alpha/d}) \)) 是针对“每次选不确定性最大的点”这一策略。但ALMQ的查询选择是随机的(基于平方加权采样),并非总是选最大的。Theorem 3虽然分析了随机选择,但仅针对两种查询。实验中的ALMQ策略与Theorem 1或3的精确设定并不完全一致。
- 探索-利用框架的理论验证(Theorem 4) 只证明了“logits gap大则不确定性可能高”,但并未证明“过滤掉logits距离近的点”这一具体操作能保证收敛或避免次优解。这是一个必要但不充分的条件。
四、开放问题¶
-
多查询的理论收敛率:本文Theorem 3仅处理了“Is”查询(m=1)。对于m>1的“All”和“Any”查询,其信息增益的显式表达式(Theorem 2)已给出,但相应的收敛率分析是开放的。扎根点:Section 4.2开头“The setting involving more than one point can be analytically challenging.”
-
非完美oracle:本文假设专家是完美oracle。现实中专家可能犯错(如误诊)。如何将标注噪声(label noise)或专家不确定性融入ALMQ框架,并分析其对收敛率的影响?扎根点:Section 7“A further assumption is that experts serve as perfect oracles, which can be violated in practice due to issues such as misdiagnosis.”
-
动态类别数:本文假设类别数 \( C \) 已知且固定。在流数据或开放世界设定中,新类别可能出现,旧类别可能消失。如何扩展ALMQ框架以处理动态类别?扎根点:Section 7“Another prerequisite in this paper is that the number of classes is known and fixed... Sun et al. (2016) and Mohamad et al. (2018) highlight that in streaming data, class distributions may evolve...”
-
查询成本的实证验证:作者声称“All”和“Any”查询成本更低,但仅引用了心理学和池化检测文献,未在实验中实际测量或控制成本。一个关键的开放问题是:在真实标注场景下(如图像分类、医学影像),这些新型查询的实际成本(时间、认知负荷)是否真的低于传统“Class”查询? 这需要设计用户实验来量化。扎根点:Section 1中关于成本优势的论述,以及Section 7中“The cost of the ‘All’ and ‘Any’ questions is typically smaller than that of the ‘Class’ question in the paper. This reflects a practical setting...”
Maintained by 陈星宇 · Homepage · Source on GitHub