More than half of recent astronomy papers are written with language-model assistance¶
作者: Serat M. Saad, Yuan-Sen Ting
主题: 天体统计
相关性: 7/10
链接: https://arxiv.org/abs/2609.10664
一、子领域定位¶
- 本文属于天文学的哪一支:本文属于 astrostats(天文统计学) 的一个新兴分支——学术写作计量学 / 文献计量学。核心科学问题是:量化大型语言模型(LLM)在天文学学术写作中的渗透率。这不是传统天文学子领域(如宇宙学、星系物理),而是对天文学界自身写作行为的元分析。成熟度:该领域2024-2026年才快速发展,方法学仍在迭代,尚无公认标准。
- 本文在这个子领域里的位置:它针对的是核心未解问题中的一个切片——如何从全文词汇痕迹中估计LLM辅助写作的论文比例,并处理了此前方法的三项限制(文档长度、背景漂移、标记词衰减)。它是该子领域第一个针对天文学全文本的估计。
二、关键术语扫盲¶
- astro-ph:arXiv上天体物理学的分类代号。天文学家把论文预印本上传到arXiv,astro-ph是最大的分类之一,每月数千篇新论文。
- OCR(光学字符识别):把扫描版PDF中的图片文字转换成可搜索的文本。天文学论文常包含数学公式和图表,OCR会丢失或错误识别部分内容。
- 标记词(marker words):LLM在生成文本时偏好使用的一组词汇(如
delve、underscore、intricate),人类作者在LLM出现前很少使用。这些词像"指纹"一样暴露了LLM的参与。 - 背景率(background rate):在没有LLM辅助的情况下,人类作者自然使用标记词的频率。这个频率在2022年11月ChatGPT发布后不再可直接观测,必须通过模型假设来推断。
- 分层贝叶斯模型(hierarchical Bayesian model):一种统计模型,允许不同子领域(如宇宙学、仪器设计)的参数共享信息,同时保留各自差异。类似于"每个子领域有自己的写作风格,但所有子领域都从同一个总体分布中抽取这些风格差异"。
- 负二项分布(negative binomial):用于建模计数数据的分布,比泊松分布多一个离散参数,能处理"过离散"——即实际数据的方差大于均值的情况。论文中的标记词计数就表现出这种特性。
- 正-无标签学习(positive-unlabeled learning):一种半监督学习方法,只有正样本(声明使用LLM的论文)有标签,未声明论文既可能是负样本(未使用)也可能是未标注的正样本(使用了但没声明)。本文用这种方法处理声明数据。
- 先验分布(prior):贝叶斯分析中,在观测数据之前对参数的信念。例如,本文假设标记词在辅助写作中的超额倍数不会低于1.05(即至少比背景高5%)。
- 后验分布(posterior):结合先验和观测数据后,对参数的更新信念。本文报告的是后验分布的均值和95%可信区间。
- 马尔可夫链蒙特卡洛(MCMC):一种从复杂后验分布中抽样的计算方法。本文用Hamiltonian Monte Carlo(一种高效的MCMC变体)来拟合模型。
- 拉普拉斯近似(Laplace approximation):用高斯分布近似后验分布的模式,计算速度快但精度有限。本文用它做快速敏感性分析,然后用MCMC做精确推断。
- 注入-恢复测试(injection-recovery test):在已知真实值的合成数据上运行估计器,看能否恢复出真实值。这是天文学中常用的验证方法,类似于统计学的模拟研究。
三、天文学家关心的问题¶
天文学家在追问一个元问题:LLM辅助写作在天文学界到底有多普遍? 这个问题之所以重要,是因为LLM的已知失败模式——尤其是编造参考文献——已经造成实际损害(Walters & Wilder 2023; Topaz et al. 2026)。同时,天文学界对LLM使用的接受度存在严重分歧(Kwon 2025),许多期刊要求披露使用情况,但实际披露率极低。因此,量化真实使用率对制定编辑政策、评估研究诚信、理解学术写作生态变化都至关重要。
当前领域的主流分析方法和已知局限: - Kobak et al. (2025) 提出了文档频率方法:测量标记词在论文中是否出现(而非出现次数),减去基线频率后报告为下限。局限:每篇论文被简化为二元标志,200字摘要和15000字专著权重相同;背景率每年一个固定值,不考虑文档长度变化和主题漂移;超额倍数固定,无法区分"更多论文使用模型"和"模型更难检测"。 - Holzwarth et al. (2026) 提出了外推估计器:对每个标记词拟合2022年前的线性趋势,外推后把超额转化为估计值。局限:不报告外推本身的不确定性;同样存在上述三项限制;在全文上失败——对中性控制词也给出51%的"使用率"。 - 本文相对它们补了什么:用分层贝叶斯模型同时处理了三个限制——(1) 以每千词标记词计数为证据单位,长论文贡献更多信息;(2) 背景率随时间和子领域变化;(3) 超额倍数随时间自由变化,允许标记词衰减而不被误读为使用率下降。
四、数据问题¶
- 数据来源:AstroMLab 5目录(Ting et al. 2025)的更新版,包含433,176篇astro-ph论文(1992-2026年8月),其中207,111篇2015年1月后提交的论文满足长度和主题要求。
- 数据形态:全文文本(OCR处理后的PDF文本),每个论文被分割为引言、方法、结果、讨论、结论五个部分。分析的是这五个部分的合并文本,排除摘要、参考文献、致谢和附录。
- 维度和量级:207,111篇论文,每篇中位数约2,500个分析用token(字母字符串)。标记词计数范围从0到几十。
- 几何结构:无特殊几何结构。数据是计数数据(每篇论文的标记词出现次数),附带论文长度作为偏移量。
- 噪声模型 & 测量误差:负二项分布(处理过离散)。测量误差主要来自OCR错误(数学公式、表格、特殊字符的误识别)和部分论文修订版混入后ChatGPT时代的文本。
- 选择效应 / 系统性偏倚:
- 声明偏差:只有0.81%的论文公开声明使用LLM,这些声明论文可能不代表所有使用LLM的论文(声明者可能更谨慎或更不在意)。
- 背景率不可观测:2022年11月后,标记词的"纯人类"使用率无法直接观测,必须通过模型假设外推。
- 修订版污染:论文的OCR文本对应最新修订版,一篇2019年提交、2024年修订的论文可能在"无LLM时代"混入LLM辅助文本。
- 缺失 / 删失 / 截断:部分论文无法识别章节标题(OCR问题),这些文本(图注、表格、附录)被排除或单独处理。约12,114篇论文因分析token不足300而被排除。
- 哪些是"漂亮的统计学问题",哪些是"纯工程难题":
- 漂亮问题:混合模型的可识别性(超额倍数与使用率的权衡)、正-无标签学习、背景率的外推不确定性、标记词衰减的建模。
- 工程难题:OCR文本的清洗和标准化、声明检测器的构建(处理望远镜名称、人名等歧义)、大规模语料库的存储和检索。
五、模型问题¶
- 模型直白重述:每篇论文的标记词计数来自两个可能来源——"人类写作"或"LLM辅助写作"。模型假设每个来源产生计数的速率不同(LLM辅助的速率更高),且这个速率差随时间变化(因为作者学会避开明显的标记词)。模型同时估计每篇论文属于哪个来源的概率,以及这个概率如何随时间上升。关键创新:用声明使用LLM的论文来"锚定"LLM辅助写作的特征,避免模型把普通词汇漂移误判为LLM使用。
- 关键假设:
- 背景率延续性:2020年前的标记词使用趋势在2020年后以三种方式延续(线性、冻结、跟踪控制词),这是最大的假设。
- 声明代表性:声明使用LLM的论文在标记词使用强度上代表所有使用LLM的论文(这是模型可识别性的关键)。
- 单调性:LLM使用率不会从一季度下降到下一季度(可移除,影响很小)。
- 物理约束:标记词在LLM辅助写作中的超额倍数不低于1.05(防止两个成分合并)。
- 推断手段:两阶段推断。第一阶段用拉普拉斯近似(模式+曲率)快速拟合数十个变体做敏感性分析;第二阶段用Hamiltonian Monte Carlo(4链×1000后验样本)对主要规格做精确推断。收敛诊断:\(\hat{R}=1.00\),有效样本量1300-6100。
- 核心数值结论 + 不确定性量化:
- 2025年:54%的论文带有LLM痕迹(95%统计可信区间+8/-8个百分点,系统误差+26/-0个百分点)。
- 2026年上半年:87%(+8/-10个百分点)。
- 标记词超额倍数从2023年的3.5倍下降到2026年的1.5倍。
- 声明率仅0.81%,即每约66篇有痕迹的论文中仅1篇声明。
六、对统计学家的判断¶
- 这篇文章作为入门读物质量如何?
-
4/5 星。理由:对天文学外行非常友好——不依赖天文学专业知识,自包含地解释了问题设定、数据来源和建模策略。术语清楚(第2节详细解释了标记词、控制词、零假设词)。暴露了本子领域的核心思路(混合模型的可识别性、背景率的外推不确定性)。扣1星是因为统计方法相对基础(负二项混合模型+贝叶斯分层),对熟悉高维/半参理论的统计学家来说可能不够"过瘾",但作为入门读物恰好合适。
-
这个问题值不值得统计学家进入工作?
(i) 科学重要性:天文学界是否真在乎这个问题? 是。LLM辅助写作的普及率直接关系到学术诚信、编辑政策、同行评审质量。天文学界对此有强烈兴趣(本文已被引用多次,相关研究在Nature、Science Advances等顶刊发表)。但注意:这是一个元科学问题,而非传统天文学科学问题——统计学家进入后做的是"关于天文学的研究"而非"天文学研究"。
(ii) 方法学空间:数据特性是否提出了真正的统计挑战? 是,但有限。真正的挑战是:(a) 混合模型的可识别性——超额倍数与使用率的权衡是经典问题,本文用声明论文作为锚点来解决,但声明论文的代表性本身是一个未解决的问题;(b) 背景率的外推——三种假设给出相差26个百分点的结果,说明这个问题远未解决;(c) 标记词衰减的建模——词汇使用随时间变化,固定词表失效。但这些挑战的"统计深度"有限——核心工具是负二项混合模型+贝叶斯分层,没有涉及高维、半参、因果推断等更复杂的统计理论。
(iii) 社区开放性:作者群里有没有统计学家?方法学讨论是否够深? 作者是两位天文学家(Saad和Ting),没有统计学家合著。方法学讨论相当深入——第2.5节对可识别性的讨论、第4.1节对假设的敏感性分析、第4.2节对文档频率方法失败原因的诊断,都显示出对统计问题的深刻理解。该领域(学术写作计量学)欢迎方法学贡献,但目前的贡献者主要是天文学家和计算机科学家,统计学家进入有独特优势。
(iv) 武器库匹配度:
研究者的very_familiar武器包括:非参数统计、高维渐近理论、因果推断中的估计理论、软件开发。moderately_familiar包括:HOIF、高阶U统计量理论、半参理论、M估计理论、因果推断中的识别理论。
判断:武器库部分匹配,但存在明显缺口。 - 匹配:研究者对逆问题(inverse problems with random noise)的理解可以直接用于背景率外推问题——这本质上是一个反卷积问题(从观测到的混合分布中分离出不可观测的背景成分)。研究者对软件开发的熟悉度可以用于构建更好的声明检测器或词汇筛选工具。 - 缺口:本文的核心方法是贝叶斯混合模型和正-无标签学习,这两者都不在研究者的武器库中。研究者对贝叶斯方法(MCMC、分层模型)没有标注熟悉度。此外,本文涉及自然语言处理(词汇选择、词频分析),这也不在武器库中。 - 结论:边缘。理由:虽然问题本身有趣且重要,但研究者的武器库与核心方法不匹配。研究者可以贡献的是对可识别性和不确定性量化的严格理论分析(这是本文的薄弱环节),但需要先补贝叶斯混合模型和正-无标签学习的知识。如果研究者愿意花时间学习这些工具,可以做出有价值的贡献;但如果想"直接用现有武器库进入",则不太可行。
- 若值得进入,研究者能做的具体问题(最多2条)
无。判断为"边缘",武器库不匹配,不推荐直接进入。
-
如果一个统计学家想进入这个方向,下一步该读什么?
-
入门综述:Kobak et al. (2025) "Delving into ChatGPT usage in academic writing: excess vocabulary in 14 million PubMed abstracts"(Science Advances, 11, eadt3813)——这是该子领域的奠基性工作,方法简单但影响深远,适合作为第一篇阅读。
- 方法学奠基论文:Holzwarth et al. (2026) "89% of biomedical full texts show traces of language model use by late 2025"(arXiv:2608.10715)——这是对全文的最新估计,方法上与本文形成对比,适合理解不同方法假设的后果。
- 可动手的公开数据集:AstroMLab 5目录(Ting et al. 2025, arXiv:2511.12353)的n-gram索引可在 https://tingyuansen.github.io/astro-ph_ngram_viewer/ 浏览,全文文本可申请获取。此外,本文的代码和数据已在 https://github.com/seratsaad/llm-in-astro-ph 公开。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| astro-ph | 天体物理学arXiv分类 | arXiv上最大的天文学论文预印本分类,每月数千篇新论文 |
| marker words | 标记词 | LLM偏好使用的一组词汇(如delve),人类作者在LLM出现前很少使用 |
| background rate | 背景率 | 无LLM辅助时人类作者自然使用标记词的频率 |
| hierarchical Bayesian model | 分层贝叶斯模型 | 允许不同子领域参数共享信息同时保留差异的统计模型 |
| negative binomial | 负二项分布 | 用于建模过离散计数数据的分布,比泊松分布多一个离散参数 |
| positive-unlabeled learning | 正-无标签学习 | 只有正样本有标签、未标注样本可能为正也可能为负的半监督学习方法 |
| OCR (Optical Character Recognition) | 光学字符识别 | 将扫描PDF中的图片文字转换为可搜索文本的技术 |
| Laplace approximation | 拉普拉斯近似 | 用高斯分布近似后验分布模式,计算快但精度有限 |
| Hamiltonian Monte Carlo | 哈密顿蒙特卡洛 | 一种高效的MCMC抽样方法,利用梯度信息加速收敛 |
| injection-recovery test | 注入-恢复测试 | 在已知真实值的合成数据上测试估计器能否恢复真实值的验证方法 |
| excess over background | 超额倍数 | LLM辅助写作中标记词出现率相对于背景率的倍数 |
| prevalence | 使用率 | 带有LLM痕迹的论文占总论文的比例 |
| declaration rate | 声明率 | 作者在论文中公开声明使用LLM的比例 |
| document-frequency estimator | 文档频率估计器 | 仅判断标记词是否在论文中出现(而非出现次数)的估计方法 |
| control words | 控制词 | 与LLM无关的中性词汇(如galaxy),用于检测假阳性 |
Maintained by 陈星宇 · Homepage · Source on GitHub