A psychometric framework for evaluating and shaping personality traits in large language models¶
作者: Gregory Serapio-García, Mustafa Safdari, Clément Crepy, Luning Sun, Stephen Fitz et al.
来源: Nature Machine Intelligence
主题: 其他
相关性: 4/10
机构绿灯: University of Cambridge(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01115-6
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于人工智能(AI)对齐与评估与心理测量学的交叉领域。核心科学问题是:当大型语言模型(LLM)被训练来生成类似人类的文本时,它们会无意中“习得”某种人格特质(例如,更外向、更神经质)。我们如何像评估人类一样,科学地、可靠地测量和验证这些“合成人格”?这个子领域目前处于早期阶段,主要挑战在于将一套为人类设计的心理测量工具(人格问卷)应用于一个非人类的、基于统计的语言模型,并确保测量结果有意义、可重复。
- 本文的位置:它针对的是“如何系统性地评估和塑造LLM输出中的人格特质”这一具体问题。之所以现在做,是因为LLM正被大规模部署为聊天机器人(如客服、心理支持),其“人格”会直接影响用户体验和沟通效果,但缺乏一个公认的、严谨的评估框架。本文试图填补这个空白。
二、关键术语扫盲¶
- 大型语言模型 (LLM):一种深度学习模型,通过海量文本数据训练,能根据上文预测下一个词。它没有真正的“意识”,但能生成非常像人写的文本。
- 合成人格 (Synthetic Personality):指LLM在生成文本时,其风格、语气、用词选择所表现出的、类似人类人格特质的模式。这不是模型“拥有”的人格,而是其输出的一种统计特性。
- 心理测量学 (Psychometrics):心理学的一个分支,专门研究如何设计、实施和解释心理测试(如智力测试、人格问卷),核心是确保测试的信度和效度。
- 信度 (Reliability):测量结果的一致性。例如,对同一个LLM用同一套人格问卷测两次,结果是否稳定?本文用了重测信度(隔一段时间再测)和内部一致性信度(问卷中不同题目是否指向同一特质)。
- 效度 (Validity):测量是否真的测到了它声称要测的东西。例如,一个“外向性”问卷,测出的分数是否真的反映了模型输出中的“外向”程度?本文用了结构效度(因子分析看问卷结构是否合理)和内容效度(专家判断题目是否覆盖了人格特质)。
- 大五人格模型 (Big Five / OCEAN):心理学中最主流的人格模型,将人格分为五个维度:开放性 (Openness)、尽责性 (Conscientiousness)、外向性 (Extraversion)、宜人性 (Agreeableness)、神经质 (Neuroticism)。本文就是基于这个模型来测量LLM的。
- 提示工程 (Prompt Engineering):通过精心设计输入给LLM的文本(即“提示”或“指令”),来引导模型产生特定类型输出的技术。本文通过不同的提示(如“请用外向的语气回答”)来“塑造”LLM的人格。
- 指令微调 (Instruction Fine-Tuning):一种训练LLM的技术,让模型学会更好地遵循人类的指令。本文发现,经过指令微调的模型,其人格测量结果更可靠。
- 因子分析 (Factor Analysis):一种统计方法,用于分析多个观测变量(如问卷中的各个题目)之间的相关性,找出背后潜在的、无法直接观测的“因子”(如人格维度)。本文用它来验证LLM的人格结构是否与人类一致。
- 下游任务 (Downstream Task):指LLM被训练后,实际要执行的具体任务,比如写邮件、做客服、写故事。本文测试了“塑造”后的人格是否会影响这些任务的表现。
三、这个领域的人在关心什么¶
这个领域的研究者,本质上在追问一个根本问题:当AI系统越来越像人,我们该如何用科学的方法去理解、评估和引导它们的行为? 这不仅仅是技术问题,更是伦理和社会问题。具体到人格这个点,他们关心的是: 1. 测量问题:我们能否像给人类做心理测试一样,给LLM做测试?如果LLM的“人格”是训练数据中人类人格的统计投影,那么这种投影是否稳定、可重复?不同模型(如GPT-4 vs. Llama)的“人格”有何不同? 2. 塑造与控制问题:我们能否通过技术手段(如提示工程、微调)来“定制”LLM的人格,使其更适合特定应用场景?例如,一个客服机器人可能需要高“宜人性”,而一个辩论AI可能需要高“开放性”。这种塑造是否会影响模型的其他能力? 3. 对齐与伦理问题:如果LLM无意中习得了不良的人格特质(如高“神经质”导致输出焦虑、消极的文本),我们如何发现并纠正?如何确保塑造人格的过程是负责任的,不会导致模型被滥用(例如,用来操纵用户)?
当前主流方法与局限: - 主流方法:此前,研究者主要直接使用人类人格问卷(如BFI-2)对LLM进行“施测”,即把问卷题目作为提示输入,记录模型的回答。这种方法简单直接,但缺乏验证——没人检查这些回答是否真的可靠、有效。 - 已知局限:本文在引言中明确指出,先前工作(如 Miotto et al., 2022)虽然做了测量,但没有系统地评估信度和效度。另一个问题是,LLM对提示的措辞极其敏感,不同的提问方式可能导致截然不同的“人格分数”,这使得测量结果不稳定。本文正是针对这些局限,引入了完整的心理测量学框架来填补空白。
四、数据问题¶
- 数据来源:数据并非来自真实人类,而是由LLM生成的文本。研究者将标准人格问卷(BFI-2)的题目作为提示输入给18个不同的LLM,收集模型的文本回答。
- 数据形态:文本数据。每个模型的回答被编码为问卷的Likert量表分数(例如,1-5分),最终形成表格数据:行是模型(或模型的特定提示配置),列是问卷题目。
- 结构特征:数据具有层次结构:题目嵌套在人格维度(大五)中,模型嵌套在模型家族(如GPT、Llama)中。此外,数据是重复测量的:每个模型在多个时间点、多种提示配置下被多次施测。
- Noise & 测量误差:这里的“噪声”主要来自提示的随机性(LLM生成文本的随机性)和模型对提示措辞的敏感性。误差不是独立同分布的高斯噪声,而是复杂的、与模型和提示相关的系统误差。
- Selection / Bias / 缺失:存在选择偏差:只测试了18个模型,且主要是开源和商业的流行模型,不代表所有LLM。缺失数据:某些模型可能因为内容过滤策略而拒绝回答某些敏感问题。
- 哪些是“漂亮的统计学问题”:信度和效度的量化本身就是一个经典的统计问题(方差分解、因子分析、结构方程模型)。提示敏感性可以看作一个因果推断问题:不同的提示(处理)如何影响模型的人格分数(结果)?这涉及到对文本处理变量的定义和识别。模型间的比较则是一个多重比较问题。
- 哪些是“纯工程或领域难题”:设计出能有效“塑造”人格的提示,以及理解LLM内部机制如何产生这些人格特质,更多是AI和心理学领域的难题,而非统计问题。
五、方法与模型问题¶
- 分析方法:文章的核心方法是心理测量学框架,具体步骤是:
- 施测:用标准人格问卷(BFI-2)对LLM进行测试。
- 信度评估:计算重测信度(Pearson相关系数)和内部一致性信度(Cronbach's alpha)。
- 效度评估:通过因子分析检查问卷的结构效度(LLM的回答是否也呈现出大五人格结构?),并通过专家评估检查内容效度。
- 人格塑造:通过设计不同的系统提示(例如,“你是一个外向、尽责的人”),来引导LLM在回答时表现出特定的人格特质。然后,在下游任务(如写故事)中验证这种塑造是否有效。
- 关键假设:
- 领域知识约束:假设大五人格模型同样适用于描述LLM的“合成人格”。这是一个很强的假设,也是本文试图验证的核心。
- 计算可行性:假设可以通过提示工程来有效“控制”LLM的输出人格,而不需要重新训练模型。
- 推断/计算手段:主要使用经典心理测量学方法(相关系数、Cronbach's alpha、因子分析),辅以描述性统计和可视化。没有使用贝叶斯方法、因果推断或复杂的机器学习模型。
- 核心结论与不确定性量化:
- 结论:较大、经过指令微调的LLM(如GPT-4)的人格测量具有较高的信度和效度;可以通过提示工程有效塑造LLM的人格。
- 不确定性量化:本文几乎没有进行严格的不确定性量化。信度和效度指标(如alpha系数、因子载荷)本身是点估计,没有报告置信区间或进行假设检验。结论主要基于描述性比较(例如,GPT-4的alpha值比Llama-2高),缺乏统计上的严谨性。
六、对统计学家的判断¶
-
这篇文章作为科普读物质量如何?
- 评分:4/5 星。
- 理由:对统计学家来说,这是一篇非常优秀的入门级科普。它清晰地介绍了心理测量学的基本概念(信度、效度),并将其应用于一个新颖且有趣的对象(LLM)。文章自包含,术语解释得当,把一个跨学科问题讲得比较明白。读完能让你对“如何科学地评估AI行为”有一个直观的认识。扣掉的一星是因为其统计方法过于基础,对于专业统计学家来说,在方法学上几乎没有新意。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:非常高。这个问题本身极具吸引力:我们能否像研究人类一样,用心理学的工具去研究一个统计模型的“人格”?这触及了AI对齐、人机交互和科学哲学的核心。作为一个好奇的统计学家,了解这个领域的最新进展本身就是一种享受。
- 方法学空间:有,但本文没有触及。本文的方法学贡献在于应用,而非创新。它只是将一套成熟的心理测量学方法搬到了LLM上。然而,这背后隐藏着大量有趣的统计挑战:
- 因果推断:提示工程本质上是一个因果干预。如何严谨地识别“提示”对“LLM人格分数”的因果效应?这里存在复杂的文本处理变量和潜在的混淆(如模型架构、训练数据)。
- 测量误差模型:LLM的“人格”是一个潜变量,我们只能通过有噪声的问卷回答来测量。如何构建一个更精细的测量误差模型,将提示的随机性、模型的随机性、以及人格本身的“状态依赖性”分离开来?
- 高维与函数型数据:LLM的“人格”可能不是5个维度就能概括的。其输出是一个高维的、函数型的文本空间。如何从高维文本中无监督地发现更丰富、更动态的“人格”结构?这需要更先进的降维和聚类技术。
- UQ的缺失:本文最大的统计缺陷是缺乏不确定性量化。一个严谨的统计学家会立刻想到:信度估计的置信区间是多少?不同模型的人格分数差异是否统计显著?因子模型拟合优度的检验结果如何?这些都是可以立刻改进的地方。
- 现实相关性:高。这种“评估非人类智能体行为”的模式,在AI安全、算法审计、社会科学(如用LLM模拟人类被试)等领域会越来越普遍。统计学家遇到的“数据”可能不再是人类,而是模型生成的文本。理解这种数据的特性和评估方法,对未来的统计实践很有价值。
- 明确结论:很有意思,值得留意。虽然本文在统计方法上乏善可陈,但它打开了一扇窗,指向了一个充满统计挑战的新兴交叉领域。对于想拓宽视野的统计学家来说,这是一篇很好的“引子”文章。
-
武器库匹配度:
- 无明显接口。本文使用的心理测量学方法(因子分析、Cronbach's alpha)与你的武器库(非参统计、高维渐近、因果推断、高阶U统计量)没有直接的技术重叠。你的工具更适合去解决我上面提到的“方法学空间”中的问题(如因果推断、测量误差模型),但这需要你主动去“跨界”应用,而非本文直接提供了接口。因此,纯科普阅读。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述/科普:
- 《The Big Five Personality Traits: A Psychological Model for AI?》 (或类似标题的综述文章,可在Google Scholar搜索“personality LLM psychometrics review”)。目前该领域还没有公认的经典综述,但可以搜索相关关键词找到最新的综述。
- 本文的引言部分本身就是一个很好的文献综述,引用了该领域的早期工作。
- 关键的奠基或代表论文:
- Miotto et al., 2022 (被本文引用):这是早期直接对LLM进行人格测量的代表性工作,可以作为对比阅读,看看本文在哪些方面做了改进。
- 本文作者团队的其他工作:可以关注第一作者Gregory Serapio-García的相关研究,他可能在该方向有系列工作。
- 可以动手玩的公开数据集/挑战赛:
- Hugging Face上的LLM人格数据集:可以搜索“LLM personality”或“synthetic personality”等关键词,可能会找到一些研究者公开的、用于复现本文结果的提示和模型输出数据。
- Big Five Personality Test (BFI-2):问卷本身是公开的,你可以自己设计提示,对任何开源的LLM(如Llama、Mistral)进行测试,复现本文的部分结果。这是一个很好的动手项目。
- 入门综述/科普:
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Large Language Model (LLM) | 大型语言模型 | 一种能生成类人文本的深度学习模型,如GPT-4。 |
| Synthetic Personality | 合成人格 | LLM输出文本中表现出的、类似人类人格特质的统计模式。 |
| Psychometrics | 心理测量学 | 设计和评估心理测试(如人格问卷)的科学。 |
| Reliability | 信度 | 测量结果的一致性、稳定性。 |
| Validity | 效度 | 测量是否真的测到了它声称要测的东西。 |
| Big Five (OCEAN) | 大五人格 | 描述人格的五个核心维度:开放性、尽责性、外向性、宜人性、神经质。 |
| Prompt Engineering | 提示工程 | 通过精心设计输入文本,引导LLM产生特定输出的技术。 |
| Instruction Fine-Tuning | 指令微调 | 一种训练方法,让LLM更好地理解和遵循人类指令。 |
| Factor Analysis | 因子分析 | 一种统计方法,用少数几个潜在因子来解释多个观测变量之间的相关性。 |
| Cronbach's Alpha | 克朗巴赫α系数 | 衡量问卷内部一致性的常用信度指标。 |
| Downstream Task | 下游任务 | LLM被训练后实际执行的具体任务,如写邮件、做客服。 |
| System Prompt | 系统提示 | 一种特殊的提示,用于设定LLM的角色、行为准则和整体风格。 |
Maintained by 陈星宇 · Homepage · Source on GitHub