跳转至

Competing Biases underlie Overconfidence and Underconfidence in LLMs

作者: Dharshan Kumaran, Stephen M. Fleming, Larisa Markeeva, Joe Heyward, Andrea Banino et al.
来源: Nature Machine Intelligence
主题: 其他
相关性: 5/10
机构绿灯: University College London(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-026-01217-9


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于认知科学人工智能安全的交叉领域,具体是AI 置信度校准(AI confidence calibration)。这个子领域的核心科学问题是:当 AI 系统(尤其是大型语言模型,LLM)给出一个答案时,它对自己的答案有多“确信”?这个“确信”程度(即置信度分数)是否准确反映了它实际答对的概率?如果置信度不准(过高或过低),就会导致用户过度信任或忽视 AI 的建议,在高风险场景(医疗诊断、法律咨询、金融决策)中造成严重后果。目前该领域成熟度中等:已有大量工作关注 LLM 的整体校准(比如预测概率是否匹配真实准确率),但对 LLM 在收到反馈后如何动态更新置信度这一过程的理解还很初步。

  • 本文的位置:它针对的是 LLM 置信度动态中的一个具体矛盾现象:LLM 一方面对自己的初始答案过度坚持(即使有相反证据也不改答案),另一方面对矛盾的反馈过度敏感(一旦收到反对意见,置信度就大幅下降)。本文通过精心设计的实验和计算建模,揭示了驱动这一矛盾的两种竞争机制(选择支持偏差和对矛盾的过度加权),并用贝叶斯最优推理作为基准来量化这些偏差。现在做这件事是因为 LLM 正被大规模部署,理解其置信度动态对构建可信 AI 至关重要。

二、关键术语扫盲

  1. 置信度校准 (Confidence Calibration):模型给出的置信度分数(比如“我 90% 确定”)是否等于它实际答对的概率。如果模型说 90% 确信时实际正确率也是 90%,就是完美校准。LLM 通常存在过度自信(高估自己)或信心不足(低估自己)的问题。

  2. 选择支持偏差 (Choice-Supportive Bias):一种认知偏差,指个体在做出选择后,会倾向于高估自己选择的正确性,并低估其他选项的价值。本文发现 LLM 在看到自己给出的初始答案后,也会表现出类似的偏差——即使有相反证据,也坚持原答案。

  3. 贝叶斯最优推理 (Bayesian Optimal Reasoning):一种基于贝叶斯定理的理想决策框架。给定先验信念和新证据,最优的更新方式是用贝叶斯公式计算后验概率。本文用这个作为“理性基准”,来衡量 LLM 的置信度更新是否偏离了最优。

  4. 矛盾信息过度加权 (Overweighting of Contradictory Information):指 LLM 对反对意见(“你错了,正确答案是 X”)的置信度更新幅度,远大于对支持意见(“你对了,正确答案就是你选的 Y”)的更新幅度。这违反了贝叶斯最优推理中“证据权重应独立于其方向”的原则。

  5. 置信度分数 (Confidence Score):LLM 输出答案时附带的一个数值(通常由模型生成,如“我 95% 确定”),表示模型对自己答案的确信程度。本文中,置信度分数是核心观测变量。

  6. 自我一致性保持 (Self-Consistency Preservation):本文提出的一个机制,指 LLM 倾向于保持其初始答案的置信度,即使面对矛盾证据也不轻易改变。这类似于人类的“确认偏差”。

  7. 事实查询 (Factual Query):有确定正确答案的问题,如“法国首都是什么?”。这类任务用于测试 LLM 在简单知识上的置信度。

  8. 推理任务 (Reasoning Task):需要多步逻辑推理的问题,如数学应用题或常识推理。这类任务用于测试 LLM 在更复杂场景下的置信度动态。

  9. 计算建模 (Computational Modeling):用数学方程(通常是参数化的)来描述一个系统的行为。本文用计算模型来拟合 LLM 的置信度更新数据,从中提取出“选择支持偏差”和“矛盾信息过度加权”这两个参数的强度。

  10. 人机交互 (Human-AI Interaction):研究人类如何与 AI 系统协作、沟通和信任。本文的发现直接关系到用户如何解读 LLM 的置信度信号,以及如何设计更可靠的交互界面。

三、这个领域的人在关心什么

这个领域的研究者在追问一个根本问题:我们能否信任 AI 系统告诉我们的“确信程度”? 这不仅仅是技术问题,更是认知科学问题——因为 LLM 的“置信度”并不是真正的自我意识,而是从训练数据中习得的统计模式。研究者关心的是:LLM 的置信度分数是否像人类一样受到各种认知偏差的影响?如果是,这些偏差如何影响人机协作的可靠性?

当前主流的方法集中在静态校准上:给定一个 LLM 和一组问题,计算其预测概率与实际准确率的匹配程度(如期望校准误差,ECE)。这类方法(如 Guo et al., 2017 的“On Calibration of Modern Neural Networks”)揭示了深度神经网络普遍存在过度自信的问题,并提出了温度缩放等后处理校准方法。但它们的局限在于:只关注单次预测的校准,忽略了 LLM 在收到反馈后如何动态更新置信度——而这正是人机交互中的关键场景(用户会提供补充信息或质疑)。

本文补上了这个缺口:它不再问“LLM 的置信度准不准”,而是问“LLM 的置信度如何随着新证据动态变化”。它绕开了静态校准的局限,通过引入贝叶斯最优推理作为基准,量化了 LLM 在动态更新中的系统性偏差。这比单纯报告“校准误差”更深入——它揭示了偏差的方向(过度坚持 vs. 过度敏感)和机制(两种竞争偏差)。

四、数据问题

  • 数据来源:本文的数据来自受控实验。研究者设计了一系列问题(事实查询和推理任务),让 LLM(包括 GPT-4、Claude、Llama 等)先给出答案和置信度分数,然后提供支持性或反对性的“建议”(由研究者预先编写或由另一个 LLM 生成),再记录 LLM 的答案修改和置信度更新。数据是人工生成的,而非来自真实用户交互日志。

  • 数据形态表格数据,每一行是一个“LLM-问题-反馈”三元组。主要变量包括:初始答案(文本)、初始置信度(数值 0-1)、反馈类型(支持/反对)、反馈内容(文本)、最终答案(文本)、最终置信度(数值 0-1)、是否修改答案(二值)。维度不高(几千到几万条记录),量级适中。

  • 结构特征:数据具有层次结构:每个 LLM 模型是一个“主体”,每个主体回答多个问题,每个问题有多个反馈条件。这构成了一个嵌套设计(模型 ⊃ 问题 ⊃ 反馈条件)。此外,反馈内容本身是文本,具有函数型结构(不同长度的文本序列),但本文将其简化为“支持/反对”二值变量。

  • Noise & 测量误差:主要噪声来源是 LLM 输出的随机性(温度参数控制)。置信度分数本身是 LLM 生成的,可能存在自报告偏差(LLM 可能不“诚实”地报告其内部状态)。测量误差是非高斯的(置信度分数被截断在 [0,1] 区间,且分布可能呈双峰)。异方差性明显:不同模型、不同问题类型、不同反馈条件下的置信度更新方差不同。

  • Selection / Bias / 缺失 / Censoring / Truncation / 计算约束

  • 选择偏差:问题集是人工挑选的,可能偏向于 LLM 容易出错或容易正确的类型,不代表真实世界分布。
  • 缺失数据:没有记录 LLM 的“内部状态”(如注意力权重、隐藏层激活),只能观测到输出。
  • 截断:置信度分数被限制在 [0,1] 区间,但 LLM 的“真实置信度”可能超出这个范围(比如模型内部有更精细的表示)。
  • 计算约束:实验需要多次调用 LLM API,成本较高,限制了样本量。

  • 哪些是“漂亮的统计学问题”,哪些是“纯工程或纯领域难题”

  • 漂亮的统计学问题:① 如何从层次结构数据中分离出“模型效应”、“问题效应”和“反馈效应”?这需要混合效应模型或贝叶斯层次模型。② 置信度分数的分布建模(截断、双峰、异方差)是一个有趣的非参数/半参数问题。③ 如何量化“选择支持偏差”和“矛盾信息过度加权”这两个参数的统计显著性?这涉及假设检验和效应量估计。
  • 纯工程或纯领域难题:① 如何设计“反馈”文本才能公平地测试 LLM 的置信度更新?这需要认知科学和语言学知识。② 如何确保不同 LLM 的置信度分数具有可比性?不同模型的输出格式和校准程度不同,这是一个工程对齐问题。③ 如何将本文的发现推广到更复杂的多轮对话场景?这需要大量的实验设计工作,而非统计方法能直接解决。

五、方法与模型问题

  • 分析方法:本文的核心方法是计算建模。研究者提出了一个参数化的贝叶斯更新模型,将 LLM 的置信度更新分解为两个偏差参数:
  • 选择支持偏差 (bias_self):控制 LLM 对初始答案的坚持程度。bias_self > 0 表示过度坚持。
  • 矛盾信息过度加权 (bias_contra):控制 LLM 对反对意见的敏感程度。bias_contra > 0 表示对反对意见过度加权。 模型的形式是:后验置信度 = f(先验置信度, 证据强度, bias_self, bias_contra),其中 f 是一个参数化的贝叶斯更新函数。研究者用最大似然估计拟合模型参数,并用模型比较(AIC/BIC)来验证哪个模型(包含不同偏差组合)最能解释数据。

  • 关键假设

  • 领域知识约束:假设 LLM 的置信度更新可以近似为贝叶斯更新过程(这是认知科学中常用的理性分析框架)。
  • 计算可行性:假设偏差参数是全局的(即同一个模型在所有问题上共享相同的 bias_self 和 bias_contra),而不是每个问题或每个反馈类型不同。这简化了模型,但可能掩盖了问题层面的异质性。

  • 推断/计算手段最大似然估计 + 模型比较(AIC/BIC)。没有使用贝叶斯方法(如 MCMC),也没有使用深度学习。计算上很轻量(参数很少,模型是解析的)。

  • 核心结论 + 不确定性量化

  • 核心结论:LLM 普遍表现出选择支持偏差(过度坚持初始答案)和对矛盾信息的过度加权(对反对意见过度敏感)。这两个偏差在不同模型(GPT-4、Claude、Llama)和不同任务(事实查询、推理任务)中一致存在。
  • 不确定性量化:本文没有对参数估计进行严格的不确定性量化(如置信区间或标准误)。它报告了模型比较的 AIC/BIC 值,但没有给出偏差参数的置信区间或假设检验的 p 值。这是一个明显的统计缺陷——读者无法知道这些偏差的估计是否显著异于零,或者不同模型之间的偏差差异是否统计显著。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?
  2. 评分:4/5 星
  3. 理由:对统计学家来说,这是一篇合格但非卓越的入门读物。它清晰地阐述了核心问题(LLM 置信度动态中的矛盾行为),实验设计直观易懂,计算模型也足够简单。但它的统计深度不足——没有不确定性量化,没有正式的假设检验,模型比较也仅依赖 AIC/BIC 这种经典但粗糙的方法。读完能长见识(了解 AI 置信度评估这个领域),但不会学到新的统计方法。作为 Nature Machine Intelligence 上的论文,它的科普价值高于方法学价值。

  4. 这里面有没有统计学家会觉得有意思的东西?

  5. 科学趣味性。这个问题本身非常有意思——LLM 的“心理”是否像人类一样受到认知偏差的影响?这触及了 AI 安全和人机交互的核心。作为一个好奇的统计学家,了解 LLM 的置信度动态如何偏离理性基准,本身就是一件有趣的事。它让人思考:我们是否应该用人类的认知偏差框架来理解 AI?这既有哲学趣味,也有实际意义。
  6. 方法学空间中等。本文的方法学贡献有限——它用的计算模型是认知科学中标准的参数化贝叶斯更新模型,没有提出新的统计方法。但数据特性为统计学家留下了有趣的问题:
    • 层次结构建模:数据具有模型 ⊃ 问题 ⊃ 反馈条件的嵌套结构,但本文用全局参数忽略了这种结构。一个更精细的混合效应模型贝叶斯层次模型可以分离出不同层次的方差,并量化偏差参数在问题间的异质性。
    • 置信度分数的分布建模:置信度分数是截断在 [0,1] 的连续变量,且可能呈双峰分布(LLM 要么很确信,要么很不确信)。这可以用零一膨胀贝塔回归分位数回归来建模,而不是简单的均值比较。
    • 假设检验:本文没有检验“偏差参数是否显著异于零”或“不同模型的偏差是否显著不同”。一个似然比检验Wald 检验可以填补这个空白。
    • 因果推断:反馈类型(支持/反对)是实验操纵的,因此可以建立从反馈到置信度更新的因果效应。本文的贝叶斯更新模型隐含了一个因果假设(反馈直接影响后验置信度),但没有用因果推断框架(如潜在结果或 DAG)来形式化。
  7. 现实相关性。置信度校准问题是统计学家在预测建模(分类、回归)中经常遇到的——模型输出的概率是否可靠?本文讨论的“动态置信度更新”是这一问题的延伸,在在线学习主动学习人机协作中都有直接应用。统计学家在别处也会遇到类似的数据模式(如用户反馈对推荐系统置信度的影响)。
  8. 明确结论很有意思值得留意。虽然方法学贡献有限,但这个问题本身足够有趣,数据特性也留下了统计建模的空间。适合作为科普阅读拓宽视野,但不值得投入大量时间做方法学迁移。

  9. 武器库匹配度

  10. 无明显接口,纯科普阅读。本文的数据和模型都非常简单(低维表格数据、参数化贝叶斯更新模型),与 researcher 的 very_familiar 武器(非参数统计、高维渐近、因果推断估计理论、高阶 U-统计量)没有直接接口。即使考虑 tensor contraction 或 einsum 复杂度,本文的模型也不涉及任何高阶多项式或图结构。因此,这是一篇纯粹的科普阅读,不产生可迁移的方法学问题。

  11. 如果想进一步了解这个话题,下一步读什么?

  12. 入门综述/科普
    • “On Calibration of Modern Neural Networks” (Guo et al., 2017):这是神经网络校准领域的奠基性论文,清晰解释了校准的概念、度量(ECE)和后处理方法(温度缩放)。虽然不涉及 LLM 的动态置信度,但它是理解静态校准的必读文献。
    • “Language Models (Mostly) Know What They Know” (Kadavath et al., 2022):这篇论文直接研究了 LLM 的置信度校准,发现 LLM 在事实查询上校准良好,但在推理任务上过度自信。它是本文的直接前驱工作。
  13. 关键奠基/代表论文
    • “Calibration of Pre-trained Language Models” (Jiang et al., 2021):系统评估了预训练语言模型(如 BERT、GPT-2)的校准性能,并提出了基于提示的校准方法。这是 LLM 校准领域的早期重要工作。
    • “Teaching Models to Express Their Uncertainty in Words” (Lin et al., 2022):探索了如何让 LLM 用自然语言表达不确定性(如“我 90% 确定”),而不是输出数值分数。这与本文的置信度分数获取方式直接相关。
  14. 公开数据集/挑战赛
    • TruthfulQA (Lin et al., 2022):一个用于评估 LLM 真实性和校准的数据集,包含 817 个可能引发错误信念的问题。可用于复现本文的实验或测试新模型的置信度动态。

七、术语小抄

英文术语 中文 一句话解释
Confidence Calibration 置信度校准 模型给出的置信度分数是否等于它实际答对的概率。
Choice-Supportive Bias 选择支持偏差 做出选择后高估自己选择的正确性,即使有相反证据也坚持原答案。
Bayesian Optimal Reasoning 贝叶斯最优推理 用贝叶斯公式更新信念的理想决策框架,作为衡量偏差的理性基准。
Overweighting of Contradictory Information 矛盾信息过度加权 对反对意见的置信度更新幅度远大于对支持意见的更新幅度。
Confidence Score 置信度分数 LLM 输出答案时附带的数值,表示模型对自己答案的确信程度。
Self-Consistency Preservation 自我一致性保持 LLM 倾向于保持初始答案的置信度,即使面对矛盾证据也不轻易改变。
Factual Query 事实查询 有确定正确答案的问题,如“法国首都是什么?”。
Reasoning Task 推理任务 需要多步逻辑推理的问题,如数学应用题或常识推理。
Computational Modeling 计算建模 用数学方程描述系统行为,通过拟合数据提取关键参数。
Human-AI Interaction 人机交互 研究人类如何与 AI 系统协作、沟通和信任。
Expected Calibration Error (ECE) 期望校准误差 衡量模型校准程度的常用指标,计算置信度与准确率的平均差异。
Temperature Scaling 温度缩放 一种后处理校准方法,通过调整 softmax 函数的“温度”参数来改善校准。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论