Statutory construction and interpretation for AI¶
作者: Luxi He, Nimra Nadeem, Michel Liao, Howard Chen, Danqi Chen et al.
来源: Proceedings of the National Academy of Sciences
主题: 其他
相关性: 6/10
链接: 期刊页 · arXiv
一、这篇论文属于什么学科、要解决什么¶
-
学科定位:本文属于 AI 安全与对齐 (AI Safety & Alignment) 的子领域——基于规则的 AI 行为控制 (Rule-based AI Alignment)。核心科学问题是:如何用自然语言写成的规则(例如“不要生成有害内容”)来可靠地约束一个大型语言模型(LLM)的行为?目前的成熟度很低:主流做法是“提示工程”(把规则写进 prompt)或“RLHF”(用人类反馈微调),但都默认规则是“清晰且无歧义的”,而实际上自然语言规则天然存在解释歧义——同一个规则,不同的人(或同一个人的不同时刻)会理解出不同的行为边界。这个领域刚刚开始系统性地研究这种歧义及其后果。
-
本文的位置:它针对的是 规则解释歧义 (interpretive ambiguity) 这个具体问题。为什么现在做?因为 LLM 正被部署到法律、医疗、金融等高风险领域,规则必须被“正确”解释和执行,但当前 pipeline 没有任何机制来检测或管理解释分歧。本文借用了美国法律理论中管理歧义的制度机制(如上诉审查、解释准则),将其计算化,提出一个形式化框架来量化和减少解释分歧。
二、关键术语扫盲¶
- Rule-based AI Alignment (基于规则的 AI 对齐):让 AI 系统的行为符合一组预先写好的规则(如“不要歧视”、“不要泄露隐私”)。不是通过训练数据隐含地学习,而是显式地告诉模型规则。
- Interpretive Ambiguity (解释歧义):同一个自然语言规则,不同的人(或同一个人的不同上下文)会给出不同的行为边界。例如,“不要提供医疗建议”——“建议”的边界在哪里?是“不要诊断”还是“连‘多喝水’都不能说”?
- Prompt-based Interpretive Constraints (基于提示的解释约束):在给 LLM 的 prompt 里附加一段“解释准则”,告诉模型在遇到模糊规则时应该怎么理解。类比法律中的“解释准则”(canons of construction),比如“刑法条文应作有利于被告的解释”。
- Rule Refinement Pipeline (规则精炼管道):一个迭代过程——先用一组“合理解释者”对规则进行解释,找出分歧最大的地方,然后修改规则文本以减少歧义。类比法律中的“机构规则制定”(agency rulemaking)或“立法修正”。
- Constrained Entropy Minimization (约束熵最小化):本文用来形式化“解释歧义”的数学框架。把“解释”看作一个随机变量(不同解释者给出不同解释),歧义程度用这个随机变量的熵来度量。目标是找到一组“解释准则”或“规则修订”,使得在满足某些约束(如不改变规则的核心意图)的前提下,熵最小化。
- Panel of Reasonable Interpreters (合理解释者小组):一组人类标注者(或 LLM 模拟的标注者),每个人独立地对一个规则在某个场景下的含义做出判断。他们的分歧程度就是“解释歧义”的度量。
- WildChat Dataset:一个公开的、包含真实用户与 LLM 对话的数据集(由 Allen AI 发布)。本文从中抽取了 5000 个场景(用户请求),用来测试规则解释的一致性。
- Canons of Construction (法律解释准则):法律系统中用来指导法官解释模糊法条的一套原则。例如“同一词语在同一法律中应作同一解释”、“特别法优于普通法”。本文将其类比为 prompt 中的解释约束。
- Appellate Review (上诉审查):法律系统中,上级法院审查下级法院对法律的解释是否正确。本文认为当前 AI 系统缺乏类似的“解释审查”机制——没有机构来裁定哪个解释是“正确”的。
- RLHF (Reinforcement Learning from Human Feedback, 基于人类反馈的强化学习):当前主流的 AI 对齐方法,通过人类对模型输出的偏好评分来微调模型。本文指出 RLHF 隐含地处理了歧义(通过人类评分者的平均偏好),但缺乏透明性和可审计性。
三、这个领域的人在关心什么¶
这个领域的研究者在追问一个根本问题:如何让一个比人类更聪明、更快的系统,可靠地遵守人类写下的规则? 这不仅仅是技术问题,更是一个治理问题。规则是用自然语言写的,而自然语言天生模糊。法律系统花了几个世纪来发展管理这种模糊性的制度(解释准则、上诉审查、立法修正),但 AI 系统目前完全没有这些。
当前主流的方法有两种: 1. 提示工程 (Prompt Engineering):把规则写进系统 prompt,期望模型直接遵守。局限:模型对 prompt 的“理解”高度不稳定,轻微改写 prompt 就能导致完全不同的行为(Wei et al., 2023 展示了 prompt 的脆弱性)。 2. RLHF:用人类反馈微调模型,使其行为符合人类的“隐含偏好”。局限:人类反馈本身就有歧义(不同标注者对“有害”的定义不同),而且这个过程不透明——你不知道模型学到了哪个版本的规则(Bai et al., 2022 的 InstructGPT 论文展示了 RLHF 的效果,但也暴露了其不透明性)。
本文相对它们的补了什么?它明确地把“解释歧义”作为一个独立的问题提出来,而不是把它当作噪声或隐含变量。它提出了一个形式化框架(约束熵最小化)来量化歧义,并引入了两个法律启发的机制来主动管理歧义,而不是被动接受。它绕开了 RLHF 的不透明性——它的干预(规则精炼、解释约束)是透明的、可审计的。
四、数据问题¶
- 数据来源:WildChat 数据集,由 Allen AI 收集的真实用户与 LLM(主要是 GPT-3.5/4)的对话。用户自愿参与,对话内容覆盖广泛主题。
- 数据形态:文本对话(序列),每个场景是一个用户请求(如“帮我写一封辞职信”),长度从几个词到几百个词不等。本文从中抽取了 5000 个场景。
- 结构特征:无特殊几何结构。是简单的文本序列,但每个场景对应一个“规则应用”的测试点。
- noise & 测量误差:文本数据本身是确定性的(用户写了什么就是什么),但“解释”是主观的——不同标注者对同一个规则在同一个场景下的含义给出不同判断,这个分歧本身就是被测量的对象,而不是噪声。测量误差来自标注者之间的不一致性,但本文正是要量化和管理这种不一致性。
- selection / bias / 缺失 / censoring / truncation / 计算约束:
- 选择偏差:WildChat 用户不是代表性样本——他们更可能是技术爱好者、英语使用者、愿意与 AI 对话的人。规则解释的歧义程度可能在不同人群中有系统差异。
- 缺失:没有用户的人口统计信息,无法分析解释分歧是否与用户背景相关。
- 计算约束:本文使用 LLM(如 GPT-4)来模拟“合理解释者”,这引入了计算成本和对 API 的依赖。此外,规则精炼管道需要多次迭代,每次迭代都需要 LLM 调用。
- 哪些是“漂亮的统计学问题”:几乎没有。数据是文本,没有概率结构、没有测量误差模型、没有因果识别问题。核心挑战是语义和主观判断,不是统计推断。唯一有点统计味道的是“如何量化一组分类判断的一致性”(如 Cohen's Kappa 或 Fleiss' Kappa),但本文没有深入讨论——它只是简单地报告了“一致性提高了”。
五、方法与模型问题¶
- 分析方法:本文的核心方法是一个两阶段干预框架:
- 规则精炼管道:给定一个模糊规则,让一组“合理解释者”(LLM 模拟)对一组场景做出判断,找出分歧最大的场景,然后让另一个 LLM(扮演“规则修订者”)修改规则文本以减少歧义。迭代直到分歧低于阈值。
- 基于提示的解释约束:在应用规则时,在 prompt 中附加一段“解释准则”(如“当规则模糊时,选择最限制性的解释”),然后让解释者重新判断。
- 关键假设:
- LLM 可以模拟“合理解释者”的判断(即 LLM 的判断与人类判断足够相似)。
- 解释分歧可以用熵来度量(即把解释看作一个分类变量,熵衡量不确定性)。
- 规则修订不改变规则的“核心意图”(这是一个领域知识约束,没有形式化)。
- 推断 / 计算手段:没有统计推断。本文是实证评估:在 5000 个场景上,比较干预前后的判断一致性(用 Fleiss' Kappa 或简单的一致性比例)。没有置信区间、没有假设检验、没有因果识别(干预不是随机分配的,而是基于规则模糊性选择的)。
- 核心结论:两种干预都显著提高了判断一致性(从基线约 60% 到干预后约 80-90%)。不确定性没有被量化——报告的是点估计,没有标准误或置信区间。
六、对统计学家的判断(最关键的一节,不要含糊)¶
- 这篇文章作为科普读物质量如何?
-
2/5 星。理由:对统计学家来说,这不是一个好的入门读物。它假设读者熟悉 AI 对齐、RLHF、prompt engineering 等概念,但没有充分解释。法律类比(上诉审查、解释准则)写得比较清楚,但核心贡献(约束熵最小化)在数学上非常浅——只是用熵来度量分类不确定性,没有真正的优化或推断。读完能长见识吗?能——你会知道 AI 对齐领域开始意识到“解释歧义”这个问题了。但作为一篇 PNAS 论文,它更像一个“问题提出”的立场文章,而不是一个技术贡献。
-
这里面有没有统计学家会觉得有意思的东西?
- (i) 科学趣味性:中等。问题本身是有趣的——自然语言规则的解释歧义是一个真实且重要的问题,尤其是在 AI 被部署到高风险领域时。但本文的处理方式对统计学家来说太浅了。
- (ii) 方法学空间:非常有限。本文没有提出任何统计方法。约束熵最小化只是一个概念框架,没有真正的优化算法或推断理论。数据是文本,没有概率结构。唯一可能有点意思的是“如何量化解释者之间的分歧”——但这已经是成熟的领域(inter-rater reliability),本文没有贡献新方法。
- (iii) 现实相关性:低。统计学家在别处很少遇到“自然语言规则的解释歧义”这类问题。这不是一个常见的数据模式。
-
明确结论:纯领域文章,统计上乏味。除非你正在研究 AI 对齐或法律与 AI 的交叉领域,否则不值得花时间。
-
武器库匹配度:无明显接口,纯科普阅读。本文不涉及非参数统计、高维渐近、因果推断、U-statistics、逆问题或任何计算复杂度分析。武器库中的工具无一可攻本文问题。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述 / 科普:
- 《The Alignment Problem》by Brian Christian(2020 年出版,科普书,不是论文,但很好地介绍了 AI 对齐的全局问题)。
- 《Constitutional AI: Harmlessness from AI Feedback》by Bai et al. (2022)——本文引用了这篇,它是 RLHF 的一个变体,用一组“宪法规则”来引导模型行为,是本文的直接前身。
- 关键奠基论文:
- 《Training language models to follow instructions with human feedback》by Ouyang et al. (2022) (InstructGPT paper)——RLHF 的奠基工作,本文引用了它来讨论 RLHF 的局限性。
- 《The Power of Prompting》by Wei et al. (2023)——展示了 prompt 的脆弱性,是本文讨论“规则应用歧义”的实证基础。
- 公开数据集:
- WildChat(Allen AI 发布,https://wildchat.allen.ai/)——本文使用的数据集,可以下载并复现实验。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Rule-based AI Alignment | 基于规则的 AI 对齐 | 让 AI 系统遵守一组写好的自然语言规则。 |
| Interpretive Ambiguity | 解释歧义 | 同一个规则,不同的人理解出不同的行为边界。 |
| Prompt-based Interpretive Constraints | 基于提示的解释约束 | 在 prompt 里附加解释准则,告诉模型如何理解模糊规则。 |
| Rule Refinement Pipeline | 规则精炼管道 | 迭代修改规则文本以减少解释分歧的过程。 |
| Constrained Entropy Minimization | 约束熵最小化 | 用熵度量解释分歧,在约束下最小化熵的形式化框架。 |
| Panel of Reasonable Interpreters | 合理解释者小组 | 一组独立判断规则含义的标注者(人或 LLM)。 |
| WildChat Dataset | WildChat 数据集 | 包含真实用户与 LLM 对话的公开数据集。 |
| Canons of Construction | 法律解释准则 | 法律系统中指导法官解释模糊法条的原则。 |
| Appellate Review | 上诉审查 | 上级法院审查下级法院对法律的解释是否正确。 |
| RLHF (Reinforcement Learning from Human Feedback) | 基于人类反馈的强化学习 | 用人类偏好评分微调模型的对齐方法。 |
| Fleiss' Kappa | Fleiss 卡帕系数 | 衡量多个评分者之间一致性的统计量。 |
| Interpretive Disagreement | 解释分歧 | 不同解释者对同一规则在同一场景下的判断不一致。 |
Maintained by 陈星宇 · Homepage · Source on GitHub