跳转至

Statutory construction and interpretation for AI

作者: Luxi He, Nimra Nadeem, Michel Liao, Howard Chen, Danqi Chen et al.
来源: Proceedings of the National Academy of Sciences
主题: 其他
相关性: 6/10
链接: 期刊页 · arXiv


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于 AI 安全与对齐 (AI Safety & Alignment) 的子领域——基于规则的 AI 行为控制 (Rule-based AI Alignment)。核心科学问题是:如何用自然语言写成的规则(例如“不要生成有害内容”)来可靠地约束一个大型语言模型(LLM)的行为?目前的成熟度很低:主流做法是“提示工程”(把规则写进 prompt)或“RLHF”(用人类反馈微调),但都默认规则是“清晰且无歧义的”,而实际上自然语言规则天然存在解释歧义——同一个规则,不同的人(或同一个人的不同时刻)会理解出不同的行为边界。这个领域刚刚开始系统性地研究这种歧义及其后果。

  • 本文的位置:它针对的是 规则解释歧义 (interpretive ambiguity) 这个具体问题。为什么现在做?因为 LLM 正被部署到法律、医疗、金融等高风险领域,规则必须被“正确”解释和执行,但当前 pipeline 没有任何机制来检测或管理解释分歧。本文借用了美国法律理论中管理歧义的制度机制(如上诉审查、解释准则),将其计算化,提出一个形式化框架来量化和减少解释分歧。

二、关键术语扫盲

  1. Rule-based AI Alignment (基于规则的 AI 对齐):让 AI 系统的行为符合一组预先写好的规则(如“不要歧视”、“不要泄露隐私”)。不是通过训练数据隐含地学习,而是显式地告诉模型规则。
  2. Interpretive Ambiguity (解释歧义):同一个自然语言规则,不同的人(或同一个人的不同上下文)会给出不同的行为边界。例如,“不要提供医疗建议”——“建议”的边界在哪里?是“不要诊断”还是“连‘多喝水’都不能说”?
  3. Prompt-based Interpretive Constraints (基于提示的解释约束):在给 LLM 的 prompt 里附加一段“解释准则”,告诉模型在遇到模糊规则时应该怎么理解。类比法律中的“解释准则”(canons of construction),比如“刑法条文应作有利于被告的解释”。
  4. Rule Refinement Pipeline (规则精炼管道):一个迭代过程——先用一组“合理解释者”对规则进行解释,找出分歧最大的地方,然后修改规则文本以减少歧义。类比法律中的“机构规则制定”(agency rulemaking)或“立法修正”。
  5. Constrained Entropy Minimization (约束熵最小化):本文用来形式化“解释歧义”的数学框架。把“解释”看作一个随机变量(不同解释者给出不同解释),歧义程度用这个随机变量的熵来度量。目标是找到一组“解释准则”或“规则修订”,使得在满足某些约束(如不改变规则的核心意图)的前提下,熵最小化。
  6. Panel of Reasonable Interpreters (合理解释者小组):一组人类标注者(或 LLM 模拟的标注者),每个人独立地对一个规则在某个场景下的含义做出判断。他们的分歧程度就是“解释歧义”的度量。
  7. WildChat Dataset:一个公开的、包含真实用户与 LLM 对话的数据集(由 Allen AI 发布)。本文从中抽取了 5000 个场景(用户请求),用来测试规则解释的一致性。
  8. Canons of Construction (法律解释准则):法律系统中用来指导法官解释模糊法条的一套原则。例如“同一词语在同一法律中应作同一解释”、“特别法优于普通法”。本文将其类比为 prompt 中的解释约束。
  9. Appellate Review (上诉审查):法律系统中,上级法院审查下级法院对法律的解释是否正确。本文认为当前 AI 系统缺乏类似的“解释审查”机制——没有机构来裁定哪个解释是“正确”的。
  10. RLHF (Reinforcement Learning from Human Feedback, 基于人类反馈的强化学习):当前主流的 AI 对齐方法,通过人类对模型输出的偏好评分来微调模型。本文指出 RLHF 隐含地处理了歧义(通过人类评分者的平均偏好),但缺乏透明性和可审计性。

三、这个领域的人在关心什么

这个领域的研究者在追问一个根本问题:如何让一个比人类更聪明、更快的系统,可靠地遵守人类写下的规则? 这不仅仅是技术问题,更是一个治理问题。规则是用自然语言写的,而自然语言天生模糊。法律系统花了几个世纪来发展管理这种模糊性的制度(解释准则、上诉审查、立法修正),但 AI 系统目前完全没有这些。

当前主流的方法有两种: 1. 提示工程 (Prompt Engineering):把规则写进系统 prompt,期望模型直接遵守。局限:模型对 prompt 的“理解”高度不稳定,轻微改写 prompt 就能导致完全不同的行为(Wei et al., 2023 展示了 prompt 的脆弱性)。 2. RLHF:用人类反馈微调模型,使其行为符合人类的“隐含偏好”。局限:人类反馈本身就有歧义(不同标注者对“有害”的定义不同),而且这个过程不透明——你不知道模型学到了哪个版本的规则(Bai et al., 2022 的 InstructGPT 论文展示了 RLHF 的效果,但也暴露了其不透明性)。

本文相对它们的补了什么?它明确地把“解释歧义”作为一个独立的问题提出来,而不是把它当作噪声或隐含变量。它提出了一个形式化框架(约束熵最小化)来量化歧义,并引入了两个法律启发的机制来主动管理歧义,而不是被动接受。它绕开了 RLHF 的不透明性——它的干预(规则精炼、解释约束)是透明的、可审计的。

四、数据问题

  • 数据来源:WildChat 数据集,由 Allen AI 收集的真实用户与 LLM(主要是 GPT-3.5/4)的对话。用户自愿参与,对话内容覆盖广泛主题。
  • 数据形态:文本对话(序列),每个场景是一个用户请求(如“帮我写一封辞职信”),长度从几个词到几百个词不等。本文从中抽取了 5000 个场景。
  • 结构特征:无特殊几何结构。是简单的文本序列,但每个场景对应一个“规则应用”的测试点。
  • noise & 测量误差:文本数据本身是确定性的(用户写了什么就是什么),但“解释”是主观的——不同标注者对同一个规则在同一个场景下的含义给出不同判断,这个分歧本身就是被测量的对象,而不是噪声。测量误差来自标注者之间的不一致性,但本文正是要量化和管理这种不一致性。
  • selection / bias / 缺失 / censoring / truncation / 计算约束
  • 选择偏差:WildChat 用户不是代表性样本——他们更可能是技术爱好者、英语使用者、愿意与 AI 对话的人。规则解释的歧义程度可能在不同人群中有系统差异。
  • 缺失:没有用户的人口统计信息,无法分析解释分歧是否与用户背景相关。
  • 计算约束:本文使用 LLM(如 GPT-4)来模拟“合理解释者”,这引入了计算成本和对 API 的依赖。此外,规则精炼管道需要多次迭代,每次迭代都需要 LLM 调用。
  • 哪些是“漂亮的统计学问题”几乎没有。数据是文本,没有概率结构、没有测量误差模型、没有因果识别问题。核心挑战是语义主观判断,不是统计推断。唯一有点统计味道的是“如何量化一组分类判断的一致性”(如 Cohen's Kappa 或 Fleiss' Kappa),但本文没有深入讨论——它只是简单地报告了“一致性提高了”。

五、方法与模型问题

  • 分析方法:本文的核心方法是一个两阶段干预框架
  • 规则精炼管道:给定一个模糊规则,让一组“合理解释者”(LLM 模拟)对一组场景做出判断,找出分歧最大的场景,然后让另一个 LLM(扮演“规则修订者”)修改规则文本以减少歧义。迭代直到分歧低于阈值。
  • 基于提示的解释约束:在应用规则时,在 prompt 中附加一段“解释准则”(如“当规则模糊时,选择最限制性的解释”),然后让解释者重新判断。
  • 关键假设
  • LLM 可以模拟“合理解释者”的判断(即 LLM 的判断与人类判断足够相似)。
  • 解释分歧可以用熵来度量(即把解释看作一个分类变量,熵衡量不确定性)。
  • 规则修订不改变规则的“核心意图”(这是一个领域知识约束,没有形式化)。
  • 推断 / 计算手段没有统计推断。本文是实证评估:在 5000 个场景上,比较干预前后的判断一致性(用 Fleiss' Kappa 或简单的一致性比例)。没有置信区间、没有假设检验、没有因果识别(干预不是随机分配的,而是基于规则模糊性选择的)。
  • 核心结论:两种干预都显著提高了判断一致性(从基线约 60% 到干预后约 80-90%)。不确定性没有被量化——报告的是点估计,没有标准误或置信区间。

六、对统计学家的判断(最关键的一节,不要含糊)

  1. 这篇文章作为科普读物质量如何?
  2. 2/5 星。理由:对统计学家来说,这不是一个好的入门读物。它假设读者熟悉 AI 对齐、RLHF、prompt engineering 等概念,但没有充分解释。法律类比(上诉审查、解释准则)写得比较清楚,但核心贡献(约束熵最小化)在数学上非常浅——只是用熵来度量分类不确定性,没有真正的优化或推断。读完能长见识吗?能——你会知道 AI 对齐领域开始意识到“解释歧义”这个问题了。但作为一篇 PNAS 论文,它更像一个“问题提出”的立场文章,而不是一个技术贡献。

  3. 这里面有没有统计学家会觉得有意思的东西?

  4. (i) 科学趣味性:中等。问题本身是有趣的——自然语言规则的解释歧义是一个真实且重要的问题,尤其是在 AI 被部署到高风险领域时。但本文的处理方式对统计学家来说太浅了。
  5. (ii) 方法学空间非常有限。本文没有提出任何统计方法。约束熵最小化只是一个概念框架,没有真正的优化算法或推断理论。数据是文本,没有概率结构。唯一可能有点意思的是“如何量化解释者之间的分歧”——但这已经是成熟的领域(inter-rater reliability),本文没有贡献新方法。
  6. (iii) 现实相关性:低。统计学家在别处很少遇到“自然语言规则的解释歧义”这类问题。这不是一个常见的数据模式。
  7. 明确结论纯领域文章,统计上乏味。除非你正在研究 AI 对齐或法律与 AI 的交叉领域,否则不值得花时间。

  8. 武器库匹配度无明显接口,纯科普阅读。本文不涉及非参数统计、高维渐近、因果推断、U-statistics、逆问题或任何计算复杂度分析。武器库中的工具无一可攻本文问题。

  9. 如果想进一步了解这个话题,下一步读什么?

  10. 入门综述 / 科普
    • 《The Alignment Problem》by Brian Christian(2020 年出版,科普书,不是论文,但很好地介绍了 AI 对齐的全局问题)。
    • 《Constitutional AI: Harmlessness from AI Feedback》by Bai et al. (2022)——本文引用了这篇,它是 RLHF 的一个变体,用一组“宪法规则”来引导模型行为,是本文的直接前身。
  11. 关键奠基论文
    • 《Training language models to follow instructions with human feedback》by Ouyang et al. (2022) (InstructGPT paper)——RLHF 的奠基工作,本文引用了它来讨论 RLHF 的局限性。
    • 《The Power of Prompting》by Wei et al. (2023)——展示了 prompt 的脆弱性,是本文讨论“规则应用歧义”的实证基础。
  12. 公开数据集
    • WildChat(Allen AI 发布,https://wildchat.allen.ai/)——本文使用的数据集,可以下载并复现实验。

七、术语小抄

英文术语 中文 一句话解释
Rule-based AI Alignment 基于规则的 AI 对齐 让 AI 系统遵守一组写好的自然语言规则。
Interpretive Ambiguity 解释歧义 同一个规则,不同的人理解出不同的行为边界。
Prompt-based Interpretive Constraints 基于提示的解释约束 在 prompt 里附加解释准则,告诉模型如何理解模糊规则。
Rule Refinement Pipeline 规则精炼管道 迭代修改规则文本以减少解释分歧的过程。
Constrained Entropy Minimization 约束熵最小化 用熵度量解释分歧,在约束下最小化熵的形式化框架。
Panel of Reasonable Interpreters 合理解释者小组 一组独立判断规则含义的标注者(人或 LLM)。
WildChat Dataset WildChat 数据集 包含真实用户与 LLM 对话的公开数据集。
Canons of Construction 法律解释准则 法律系统中指导法官解释模糊法条的原则。
Appellate Review 上诉审查 上级法院审查下级法院对法律的解释是否正确。
RLHF (Reinforcement Learning from Human Feedback) 基于人类反馈的强化学习 用人类偏好评分微调模型的对齐方法。
Fleiss' Kappa Fleiss 卡帕系数 衡量多个评分者之间一致性的统计量。
Interpretive Disagreement 解释分歧 不同解释者对同一规则在同一场景下的判断不一致。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论