跳转至

Densing law of LLMs

作者: Chaojun Xiao, Jie Cai, Weilin Zhao, Biyuan Lin, Guoyang Zeng et al.
来源: Nature Machine Intelligence
主题: 其他
相关性: 0/10
机构绿灯: Tsinghua University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01137-0


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于人工智能 / 自然语言处理领域中的大语言模型(LLM)效率研究分支。核心科学问题是:随着模型规模(参数量)不断增大,性能持续提升,但训练和部署成本也急剧上升——如何统一衡量一个模型的“性能”和“效率”?目前该领域缺乏一个公认的、跨模型规模的效率评价指标,大量工作各自为政,有的只关注性能(如准确率),有的只关注成本(如推理速度),难以横向比较不同年代、不同规模的模型。
  • 本文的位置:它针对的是LLM效率评估缺乏统一量化指标这一具体问题。作者提出“能力密度”(capability density)——即每单位模型参数所蕴含的能力——作为一把统一的尺子。然后基于公开的基准测试数据,观察到一个经验规律:开源LLM的最大能力密度大约每3.5个月翻一番,作者称之为“致密定律”(densing law)。这篇文章本质上是一个经验规律的发现与可视化报告,而非提出新的算法或理论。

二、关键术语扫盲

  1. 大语言模型(LLM):一种基于深度学习的文本生成模型,参数量通常在数十亿到数千亿之间。可以理解为“一个读过几乎所有互联网文本的超级文本预测器”。
  2. 参数量(Parameters):模型内部可调整的数值数量。参数量越大,模型通常越“聪明”,但训练和运行成本也越高。好比一个图书馆的藏书量——书越多,知识可能越丰富,但找书和建图书馆的成本也越高。
  3. 缩放定律(Scaling Law):一个经验观察——LLM的性能(如预测下一个词的准确率)随着模型参数量、训练数据量和计算量的增加而可预测地提升。这驱动了“越大越好”的竞赛。
  4. 能力密度(Capability Density):本文的核心概念。定义为“模型在某个基准测试上的得分 / 模型参数量”。直观理解:每花1个参数,能换来多少性能。好比“每升汽油能跑多少公里”——衡量效率。
  5. 基准测试(Benchmark):一组标准化的测试题,用来评估模型在特定任务(如数学推理、常识问答、代码生成)上的能力。例如MMLU(多任务语言理解)、GSM8K(小学数学)、HumanEval(代码生成)。
  6. 开源LLM:模型权重和代码公开可获取的LLM,如LLaMA、Mistral、Qwen系列。与之相对的是闭源模型(如GPT-4、Claude),其内部细节不公开。
  7. 推理成本(Inference Cost):使用一个训练好的模型来生成一次回答所需的计算资源(如GPU时间、电力)。通常与参数量成正比。
  8. 指数增长(Exponential Growth):一个量每隔固定时间翻一番。本文发现能力密度每3.5个月翻一番,意味着达到相同性能所需的参数量每3.5个月减半——效率呈指数级提升。
  9. 模型压缩(Model Compression):一系列技术(如量化、剪枝、知识蒸馏)用于减少模型参数量或计算量,同时尽量保持性能。本文的“致密定律”可以理解为模型压缩技术的进步速度的宏观度量。
  10. 知识蒸馏(Knowledge Distillation):一种模型压缩方法——用一个大的“教师”模型来训练一个小的“学生”模型,让学生模仿教师的输出。这是提升能力密度的关键技术之一。
  11. 量化(Quantization):将模型参数从高精度(如32位浮点数)转换为低精度(如8位整数),大幅减少内存占用和计算量,同时性能损失通常很小。
  12. MMLU(Massive Multitask Language Understanding):一个包含57个学科(从法律到医学到物理)的多选题基准测试,是衡量LLM通用知识水平的最常用指标之一。

三、这个领域的人在关心什么

这个领域的研究者(以及整个AI产业)在追问一个根本问题:如何用更少的资源获得更强的智能? 过去几年,缩放定律驱动了“越大越好”的范式——GPT-3(1750亿参数)、PaLM(5400亿参数)等巨型模型不断刷新记录。但这条路面临严峻挑战:训练一个千亿参数模型需要数千万美元的电费和GPU时间,部署到实际应用(如聊天机器人)时,每次推理都消耗大量算力,成本高昂且延迟高。

因此,近年来效率研究成为热点。研究者探索各种模型压缩技术(量化、剪枝、蒸馏)、更高效的架构(如混合专家模型MoE)、以及更小的“专用”模型(如针对代码或数学的微调模型)。但问题在于:缺乏一个统一的标尺来比较不同年代、不同规模的模型的效率。一篇2023年的论文可能报告一个70亿参数的模型在MMLU上达到60%,而一篇2024年的论文报告一个30亿参数的模型达到55%——哪个更“高效”?单纯看性能或参数量都无法回答。

本文提出的“能力密度”正是试图填补这个空白。它提供了一个跨模型规模、跨时间的单一指标:能力密度 = 性能 / 参数量。作者收集了2019年至2024年间多个开源LLM在MMLU、GSM8K、HumanEval等基准上的公开数据,发现最大能力密度随时间呈指数增长(每3.5个月翻一番)。这个规律被称为“致密定律”。

当前主流方法和已知局限: - 主流方法:研究者通常分别报告性能(如准确率)和效率(如推理速度、参数量),但缺乏统一框架。例如,Kaplan et al. (2020) 的缩放定律论文奠定了“性能随计算量/参数量/数据量可预测增长”的范式,但它关注的是性能上限,而非效率Hoffmann et al. (2022) 的“Chinchilla定律”指出,许多模型训练数据不足,最优策略是同时缩放模型和数据——这仍是性能导向。 - 局限:这些工作没有回答“给定一个性能目标,需要多少参数”的效率问题。本文的“能力密度”直接量化了这一点。此外,现有效率评估往往只关注单一基准或单一压缩技术,缺乏宏观趋势分析。本文通过收集大量公开数据,揭示了整个领域效率提升的宏观速度——这是一个新颖的视角。

四、数据问题

  • 数据来源:作者从公开的论文、模型发布页面(如Hugging Face)、基准测试排行榜(如Open LLM Leaderboard)收集了2019年至2024年间发布的多个开源LLM的性能数据。数据是二手汇总的,而非作者自己运行实验。
  • 数据形态表格数据。每一行是一个模型-基准测试对,包含:模型名称、发布时间、参数量、在某个基准上的得分(如MMLU准确率)。维度:约几十个模型 × 几个基准测试,总量很小(几十到几百条记录)。
  • 结构特征时间序列结构(模型按发布时间排序),但每个时间点只有一个或少数几个“最佳”模型。没有面板数据或重复测量。
  • Noise & 测量误差:基准测试得分本身有测量误差(不同运行、不同提示词可能导致1-2%的波动),但作者没有讨论或量化。更严重的是选择偏差:作者只收集了公开报告的模型数据,而许多未公开或失败的模型未被纳入,导致“幸存者偏差”——看到的趋势可能比真实情况更乐观。
  • Selection / Bias / 缺失严重的发表偏差。只有性能足够好的模型才会被公开报告和收录。此外,不同模型的训练数据、训练方法、评估设置(如few-shot次数、提示词模板)不一致,导致不可比性。作者没有进行任何标准化或协变量调整。
  • 哪些是“漂亮的统计学问题”,哪些是“纯工程或纯领域难题”
  • 漂亮的统计学问题发表偏差的校正(如何从“只看到成功案例”的数据中推断真实效率提升速度?)、测量误差建模(基准得分波动如何影响指数增长率的估计?)、异质性建模(不同架构、不同训练策略的模型,其能力密度增长速率是否不同?)。
  • 纯工程或纯领域难题:如何定义“能力”(不同基准测试衡量的能力维度不同,如何加权?)、如何公平比较不同年代的模型(训练数据泄露问题——新模型可能“见过”旧基准的测试题)。

五、方法与模型问题

  • 分析方法:作者的做法非常直接:
  • 对每个模型-基准测试对,计算能力密度 = 得分 / 参数量(得分归一化到0-100,参数量以十亿为单位)。
  • 对于每个时间点(按月或按季度),取该时间点及之前所有模型中的最大能力密度
  • 将最大能力密度对时间(以月为单位)做指数回归log(能力密度) ~ 时间,拟合一条直线。
  • 从斜率计算出“翻倍时间”:每3.5个月翻一番。
  • 关键假设
  • 能力密度是性能与参数量的简单比值——隐含假设是“能力”与参数量呈线性关系(在log尺度上),且不同基准测试的得分可以直接比较。这显然是一个粗糙的近似
  • 最大能力密度代表领域前沿——隐含假设是“最佳模型”最能反映技术进步。这忽略了模型之间的竞争和多样性。
  • 指数增长假设——作者直接假设趋势是指数形式,没有检验其他增长模型(如幂律、逻辑斯蒂)。
  • 推断 / 计算手段简单的线性回归(在log变换后)。没有置信区间、没有假设检验、没有模型诊断。作者只是画了一条趋势线并报告了斜率。
  • 核心结论 + 不确定性量化:核心结论是“能力密度每3.5个月翻一番”。不确定性完全没有量化——没有标准误、没有置信区间、没有讨论拟合优度(R²)。考虑到数据量极小(约10-20个数据点)且存在严重发表偏差,这个“3.5个月”的数值应该被视为一个粗略的经验观察,而非精确的统计估计。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?
  2. 评分:3/5 星
  3. 理由:作为一篇Nature Machine Intelligence上的文章,它清晰易懂,核心概念(能力密度)用一个简单公式就讲明白了,指数增长的趋势也直观可视化。对于一个完全不懂LLM的统计学家,读完后能理解“AI领域在关心效率问题”以及“有一个叫能力密度的指标在指数增长”。但它的深度有限——没有讨论任何统计挑战(发表偏差、测量误差、模型选择),也没有提供任何不确定性量化。更像一篇科技新闻式的短文,而非一篇严谨的实证研究。作为入门第一篇,它合格但不出彩。

  4. 这里面有没有统计学家会觉得有意思的东西?

  5. 科学趣味性:中等。这个问题本身(LLM效率的宏观趋势)是当前AI领域的热点,具有广泛的社会和产业意义。知道“每3.5个月效率翻一番”是一个有趣的谈资。但科学深度有限——它只是一个经验观察,没有解释“为什么”效率在加速(是算法进步?硬件进步?还是数据泄露?)。
  6. 方法学空间有,但本文没有触及。本文的数据和问题模式实际上提出了几个非常经典的统计挑战
    • 发表偏差 / 幸存者偏差:我们只看到成功的模型。如何从“截断”或“选择性”的数据中推断真实趋势?这是一个缺失数据问题,可以用Heckman选择模型或截断回归来处理。
    • 测量误差:基准测试得分有噪声,且不同基准的尺度不同。如何将多个基准的得分整合成一个“能力”指标?这涉及潜变量模型因子分析
    • 异质性增长速率:不同模型家族(如LLaMA vs. Qwen)的能力密度增长速率是否不同?这可以用混合效应模型分段回归来探索。
    • 模型比较的公平性:不同模型在训练数据、评估设置上不可比。这类似于观察性研究中的混杂问题——需要倾向得分匹配或协变量调整。
    • 但本文完全没有做这些。它只是画了一条线。所以方法学空间是存在的,但本文没有利用
  7. 现实相关性:高。这种“只看到成功案例”的数据模式在任何竞争性领域(如药物研发、创业公司表现、体育记录)都普遍存在。统计学家在其他地方也会遇到类似问题。
  8. 明确结论一般科普读读即可。作为一篇科普文章,它有趣且易懂。但作为一个统计学家,你会觉得“这数据明明可以做得更有趣”——它提出了问题(效率在加速),但没有用统计工具去严谨地回答它。不值得花时间深挖方法学,但可以作为了解AI效率话题的起点。

  9. 武器库匹配度

  10. 无明显接口,纯科普阅读。本文的数据量极小(几十条记录),模型极其简单(指数回归),没有任何高维、非参、因果推断或计算复杂度的挑战。武器库中的工具(非参统计、minimax界、U-statistics、因果推断)完全用不上。唯一可能搭上的是软件工程——如果作者公开了数据收集和处理的代码,可以学习如何从公开来源系统性地爬取和整理模型性能数据,但这与统计方法无关。

  11. 如果想进一步了解这个话题,下一步读什么?

  12. 入门综述 / 科普
    • 《Scaling Laws for Neural Language Models》 (Kaplan et al., 2020) —— 这是缩放定律的奠基论文,解释了“为什么越大越好”。虽然本文是效率视角,但理解缩放定律是理解“致密定律”的背景。
    • 《Training Compute-Optimal Large Language Models》 (Hoffmann et al., 2022) —— “Chinchilla定律”论文,讨论了模型和数据的最优缩放比例,是效率研究的另一个重要里程碑。
  13. 关键奠基或代表论文
    • 《LLaMA: Open and Efficient Foundation Language Models》 (Touvron et al., 2023) —— LLaMA系列是开源高效LLM的代表,其论文详细讨论了如何在更小的参数量上达到接近GPT-3的性能,是“能力密度”提升的典型案例。
    • 《Qwen2 Technical Report》 (Yang et al., 2024) —— Qwen2系列是另一个高效开源模型家族,其技术报告提供了详细的性能数据和效率分析。
  14. 公开数据集 / 挑战赛
    • Open LLM Leaderboard (Hugging Face) —— 一个持续更新的开源LLM排行榜,包含多个基准测试的得分和模型元数据。可以直接下载数据,复现本文的分析,并尝试加入自己的统计模型(如发表偏差校正)。

七、术语小抄

英文术语 中文 一句话解释
Large Language Model (LLM) 大语言模型 基于深度学习、参数量巨大的文本生成模型,如GPT-4、LLaMA。
Scaling Law 缩放定律 经验规律:模型性能随参数量、数据量、计算量的增加而可预测地提升。
Capability Density 能力密度 本文核心指标:模型在基准测试上的得分除以参数量,衡量“每单位参数的性能”。
Densing Law 致密定律 本文发现的经验规律:开源LLM的最大能力密度每约3.5个月翻一番。
Benchmark 基准测试 一组标准化测试题,用于评估模型在特定任务(如数学、代码)上的能力。
MMLU 多任务语言理解 最常用的通用知识基准测试,包含57个学科的多选题。
GSM8K 小学数学 一个小学数学应用题基准测试,用于评估模型的数学推理能力。
HumanEval 代码生成 一个代码生成基准测试,要求模型根据函数签名和文档字符串生成正确的Python函数。
Inference Cost 推理成本 使用模型生成一次回答所需的计算资源(GPU时间、电力)。
Model Compression 模型压缩 一系列技术(量化、剪枝、蒸馏)用于减少模型大小或计算量,同时尽量保持性能。
Knowledge Distillation 知识蒸馏 用大模型(教师)训练小模型(学生),让学生模仿教师的输出,是提升能力密度的关键技术。
Quantization 量化 将模型参数从高精度(如32位浮点数)转换为低精度(如8位整数),大幅减少内存和计算量。
Open-source LLM 开源大语言模型 模型权重和代码公开可获取的LLM,如LLaMA、Mistral、Qwen。
Publication Bias 发表偏差 只有成功或显著的结果被公开报告,导致观察到的趋势比真实情况更乐观。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论