High-level visual representations in the human brain are aligned with large language models¶
作者: Adrien Doerig, Tim C. Kietzmann, Emily Allen, Yihan Wu, Thomas Naselaris et al.
来源: Nature Machine Intelligence
主题: 其他
相关性: 4/10
机构绿灯: University of Minnesota(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01072-0
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于认知神经科学与计算神经科学的交叉领域,具体来说是视觉神经科学的一个分支——研究大脑如何从自然场景中提取并表征复杂的视觉信息(不仅仅是识别出“这是一个苹果”,还包括苹果与桌子的空间关系、苹果可能被吃的语义信息等)。这个子领域的核心科学问题是:大脑的视觉系统是如何将视网膜上的二维光信号,转化为我们主观体验到的、富含语义和关系的三维世界表征的? 目前的成熟度是:我们已经对初级视觉皮层(V1)处理简单特征(边缘、朝向)有较好理解,但对高级视觉皮层(如颞下回、外侧枕叶复合体)如何编码复杂场景的语义和关系信息,仍缺乏一个定量的、统一的描述框架。
- 本文的位置:它针对的是如何定量刻画大脑从自然场景中提取的“复杂视觉信息” 这一具体问题。为什么现在做?因为近年来大语言模型(LLM) 的嵌入(embedding)被证明能捕捉文本中的复杂语义和上下文关系,而大脑的视觉系统似乎也在做类似的事情——从视觉输入中提取一个“场景描述”。本文的核心假设是:LLM对场景文本描述的嵌入,可以作为大脑视觉表征的一个有效“代理”或“对齐目标”,从而让我们能用这个已知的、可计算的表征空间来理解未知的、高维的脑活动数据。
二、关键术语扫盲¶
- fMRI (功能性磁共振成像):一种无创测量大脑活动的方法。它通过检测血氧水平依赖(BOLD)信号来间接反映神经活动。简单说,就是给大脑拍“动态照片”,看哪些区域在你看东西时更“亮”(血流量增加)。空间分辨率约1-3毫米,时间分辨率约1-2秒。
- 体素 (Voxel):fMRI数据的最小三维单元,相当于大脑的“像素”。一个体素大约包含几十万到几百万个神经元。本文中,每个被试的大脑被分割成约10万个体素。
- 表征相似性分析 (Representational Similarity Analysis, RSA):一种比较不同表征系统(如大脑 vs. 模型)的方法。核心思想是:如果两个系统对一组刺激(比如100张图片)的内部表征结构相似,那么它们各自计算出的“刺激-刺激相似性矩阵”就应该高度相关。比如,大脑认为“猫”和“狗”的神经活动模式更相似,而“猫”和“汽车”差异很大;如果模型也这么认为,那模型和大脑就是“对齐”的。
- 大语言模型 (LLM) 嵌入 (Embedding):LLM(如GPT、BERT)将单词或句子转换成一个高维向量(比如768维或1024维)。这个向量不是简单的词频统计,而是捕捉了词汇的语义、句法、上下文关系。例如,“苹果”和“香蕉”的嵌入向量会比“苹果”和“汽车”更接近。本文用的是LLM对场景描述文本(如“一个人在公园里遛狗”)的嵌入。
- 编码模型 (Encoding Model):一种预测模型,输入是刺激特征(如图片、LLM嵌入),输出是预测的脑活动(体素响应)。本文用线性回归来预测每个体素的BOLD信号,看哪个特征集(如LLM嵌入 vs. 图像像素)预测得最好。预测能力越强,说明该特征集越能解释该脑区的活动。
- 解码 (Decoding):编码的逆过程。从脑活动数据中重建出刺激的某些属性。本文中,他们从fMRI信号中重建出场景描述文本,证明了LLM嵌入空间的信息足够丰富,可以被“反向读出”。
- 深度神经网络 (DNN):一种多层人工神经网络,是当前计算机视觉的主力模型。本文训练了一个DNN,其任务是将图像像素直接映射到LLM嵌入空间。这个DNN相当于一个“视觉编码器”,它学会了从图像中提取LLM所描述的“场景级”信息。
- 自然场景 (Natural Scenes):与实验室里用的简单、孤立的刺激(如黑白条纹、单个物体图片)相对,指真实世界中的复杂、多物体、有背景和语义关系的图像。这是本文的核心刺激材料,因为大脑的视觉系统正是为处理这种复杂场景而演化的。
- 脑区选择性 (Selectivity):指大脑的不同区域对不同类型的视觉信息有偏好。例如,梭状回面孔区(FFA)对面孔反应强烈,海马旁回位置区(PPA)对场景反应强烈。本文发现,LLM嵌入能很好地刻画这种区域选择性——即不同脑区对LLM嵌入的不同维度有不同响应模式。
- 表征对齐 (Representational Alignment):本文的核心概念。指两个不同的表征系统(如大脑的神经活动模式和LLM的嵌入向量)在结构上具有相似性。对齐程度通常用RSA或编码模型预测精度来衡量。
三、这个领域的人在关心什么¶
这个领域的研究者(视觉神经科学家和计算神经科学家)在追问一个根本问题:我们的大脑是如何“看”的? 这个问题远不止“识别出物体是什么”。它包含: - 场景理解:如何同时处理场景中的多个物体、它们的空间关系(左/右、前/后)、语义关系(“狗在追猫”)、以及场景的整体“gist”(“这是一个公园”)。 - 不变性:无论物体在视网膜上的大小、位置、视角、光照如何变化,我们都能稳定地识别它。大脑是如何实现这种“不变表征”的? - 从感知到认知:视觉信息如何从初级的感觉区域(V1)流向高级的认知区域(如颞叶、前额叶),并与记忆、语言、情感等系统交互,最终形成我们的主观体验?
当前主流的方法和已知局限: - 主流方法一:用人工神经网络(ANN)作为大脑视觉系统的计算模型。这是过去十年最成功的方法。研究者发现,深度卷积神经网络(如AlexNet, VGG)的中间层表征与大脑腹侧视觉通路(从V1到IT)的神经活动高度对齐。局限:这些模型主要擅长物体识别,对场景理解(特别是场景中物体间的复杂关系和语义)建模能力有限。它们更像是一个“物体分类器”,而不是一个“场景理解器”。 - 主流方法二:用低层视觉特征(如Gabor滤波器、SIFT特征)或中层特征(如场景的“空间包络”属性)。局限:这些特征过于简单,无法捕捉场景的丰富语义和关系信息。 - 本文的贡献:它引入了一个全新的、来自NLP领域的“中介表征”——LLM的场景描述嵌入。这个表征天然擅长捕捉复杂语义和上下文关系,正好弥补了传统视觉模型在“场景理解”上的短板。本文通过一系列控制实验证明,LLM嵌入与大脑高级视觉皮层的对齐程度,显著优于传统的视觉模型(如DNN),并且这种对齐源于LLM的整合能力(而非单个词汇的简单组合)。这为理解大脑如何编码复杂场景信息提供了一个全新的、强大的定量工具。
四、数据问题¶
- 数据来源:公开数据集 NSD (Natural Scenes Dataset)。这是目前最大的fMRI自然场景数据集之一。8名被试在7T fMRI扫描仪中观看了约10,000张自然场景图片(每张图片呈现3秒,每个被试重复观看3次)。同时,每张图片都配有人工标注的场景描述文本(如“一个男人在沙滩上遛狗”)。
- 数据形态:
- 脑活动数据:高维的时间序列(每个体素一个时间序列),但经过预处理后,通常被简化为每个刺激对应的体素响应向量(每个体素一个数值,代表该刺激下该体素的平均BOLD信号)。维度:约10万个体素(每个被试)。
- 刺激数据:自然场景图像(RGB像素)。以及对应的场景描述文本(句子)。
- LLM嵌入:将场景描述文本输入LLM(本文用了多种LLM,如GPT-2, BERT, RoBERTa等),得到每个句子的高维向量(如768维)。
- 结构特征:
- 层次结构:大脑视觉系统本身是分层的(V1 → V2 → V4 → IT → 前额叶等)。本文的分析也按脑区进行,考察不同层级脑区与LLM嵌入的对齐程度。
- 空间结构:fMRI数据有三维空间结构(体素在脑内的位置),但本文的分析(RSA和编码模型)通常将体素视为独立样本,或按脑区聚合。
- Noise & 测量误差:
- fMRI噪声:主要噪声源是生理噪声(心跳、呼吸)、热噪声、以及BOLD信号本身的低信噪比(SNR)。噪声通常是时间上相关的(自回归过程),且非高斯。本文通过多次重复实验(每个刺激3次)来平均降噪。
- 测量误差:BOLD信号是神经活动的间接测量,存在空间和时间上的模糊性。
- Selection / Bias / 缺失:
- 被试选择:8名被试,样本量小,且都是健康年轻人,存在选择偏差。
- 刺激选择:NSD数据集中的图片虽然多样,但并非完全随机采样自真实世界,存在一定的采样偏差(例如,可能更偏向于常见场景)。
- 缺失:fMRI数据中,由于被试头动或扫描仪故障,部分体素或时间点的数据可能被标记为缺失。
- 哪些是“漂亮的统计学问题”,哪些是“纯工程或纯领域难题”:
- 漂亮的统计学问题:
- 高维回归与预测:用高维的LLM嵌入(~1000维)预测高维的脑活动(~10万维)。如何在高维、低样本量(~10,000个刺激)下进行有效的正则化和模型选择?这直接涉及高维统计和非参数回归。
- 表征相似性分析中的统计推断:如何检验两个相似性矩阵(大脑 vs. 模型)的相关性是否显著?这涉及矩阵相关性检验(如Mantel检验),其零分布通常需要置换检验,计算量大。
- 多模态数据对齐:如何将图像、文本、脑活动三种不同模态的数据对齐到一个共同的表征空间?这涉及典型相关分析(CCA) 及其变体,以及深度学习的多模态学习。
- 纯工程或纯领域难题:
- fMRI数据预处理:头动校正、时间层校正、空间平滑、去噪等,这些是神经科学领域的标准流程,统计学家通常不直接参与。
- LLM的选择与调优:选择哪个LLM、用哪一层嵌入、是否微调,这些更多是NLP领域的工程问题。
- DNN的训练:训练一个将图像映射到LLM嵌入空间的DNN,需要大量的计算资源和调参经验,属于深度学习工程。
- 漂亮的统计学问题:
五、方法与模型问题¶
- 分析方法:
- 编码模型:对每个体素,用岭回归(Ridge Regression)训练一个线性模型,输入是LLM嵌入向量,输出是该体素的BOLD响应。通过交叉验证评估预测精度(皮尔逊相关系数)。这是本文最核心的分析,用来量化LLM嵌入对每个脑区的解释力。
- 表征相似性分析 (RSA):计算大脑的“表征不相似性矩阵”(RDM,基于不同刺激引起的体素响应模式的欧氏距离)和模型的RDM(基于LLM嵌入的余弦距离),然后计算两个RDM的Spearman秩相关。这是另一种评估对齐程度的方法。
- 解码:训练一个线性回归模型,从所有体素的响应向量中重建出LLM嵌入向量,然后从重建的嵌入向量中检索最相似的场景描述文本(最近邻搜索)。这证明了LLM嵌入空间的信息可以被“反向读出”。
- 控制实验:为了证明LLM的“整合能力”是关键,他们构建了“词袋模型”(Bag-of-Words, BoW)作为对照。BoW只考虑句子中出现了哪些词,不考虑词的顺序和上下文。如果LLM显著优于BoW,就说明整合能力(而非单个词汇)是解释力来源。
- 关键假设:
- 线性假设:编码模型假设体素响应是LLM嵌入的线性函数。这是一个很强的简化假设,但也是计算上可行的。实际上,大脑的编码可能是高度非线性的。
- 表征对齐假设:RSA假设大脑和模型在“刺激-刺激相似性结构”上是一致的。这是一个合理的假设,但并非唯一可能的对齐方式。
- 推断 / 计算手段:
- 回归:岭回归(L2正则化)。
- 相关性分析:Spearman秩相关。
- 置换检验:用于评估RSA相关性的统计显著性。
- 深度学习:训练DNN(如ResNet)进行图像到LLM嵌入的映射。
- 核心结论 + 不确定性量化:
- 核心结论:LLM的场景描述嵌入能有效解释高级视觉皮层(如外侧枕叶复合体、颞下回)的脑活动,其解释力显著优于传统的视觉模型(如DNN)和简单的词袋模型。这表明大脑在理解复杂场景时,可能采用了与LLM类似的“语义整合”机制。
- 不确定性量化:本文主要通过交叉验证(将数据分为训练集和测试集)来评估模型预测精度,并报告了标准误和统计显著性(p值)。但缺乏对模型参数(如岭回归的正则化系数)不确定性的系统量化(如贝叶斯方法)。结论的稳健性依赖于交叉验证的可靠性。
六、对统计学家的判断¶
- 这篇文章作为科普读物质量如何?
- 评分:4/5 星
-
理由:文章写得相当清晰,对核心概念(LLM嵌入、fMRI、RSA、编码模型)都有直观的解释,即使没有神经科学背景也能跟上主要逻辑。它很好地回答了“为什么这件事值得做”(大脑如何理解复杂场景?),并展示了从数据到结论的完整链条。扣一星是因为它假设读者对LLM和DNN有一定了解,且部分细节(如不同LLM的比较)对纯外行来说略显繁琐。但总体而言,它是一篇非常好的入门级跨学科科普,能让一个统计学家快速理解这个领域在做什么、用什么数据、怎么分析。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:非常高。这个问题本身——大脑如何“理解”一个复杂场景?——是科学中最根本、最迷人的问题之一。它连接了感知、认知、语言和人工智能。作为一个好奇的统计学家,了解这个领域的最新进展本身就是一种智力享受。文章提出的“LLM嵌入作为大脑表征的代理”这一想法,非常巧妙且富有启发性。
- 方法学空间:有,但并非核心。本文在方法学上相对直接(线性回归、RSA),没有提出新的统计方法。然而,它暴露出的数据和分析挑战对统计学家来说非常有趣:
- 高维、低样本量、多模态对齐:如何更优雅地处理10万维脑活动与1000维LLM嵌入之间的对齐?能否用典型相关分析(CCA) 或偏最小二乘(PLS) 来找到共享的低维子空间?能否用贝叶斯方法对体素响应的空间结构(平滑性)进行建模,以提高预测精度和可解释性?
- 非线性编码模型:线性假设显然过于简化。能否用高斯过程或深度核方法来建模体素响应与LLM嵌入之间的非线性关系?这能揭示大脑编码中更复杂的模式。
- 因果推断:本文是相关性研究。能否设计实验或分析方法来推断LLM嵌入的哪个维度(例如,是“物体”维度还是“关系”维度)因果性地驱动了特定脑区的活动?这需要更精细的因果推断框架。
- 不确定性量化:除了交叉验证,能否对“LLM嵌入与大脑表征的对齐程度”给出一个置信区间?能否量化不同LLM模型、不同脑区之间对齐程度的差异的不确定性?
- 现实相关性:中等。这种“用高维嵌入表征来对齐多模态数据”的问题模式,在计算社会科学(如用词嵌入分析文化观念)、计算生物学(如用基因表达谱对齐不同物种的脑区)等领域也会出现。统计学家在这里学到的分析思路(RSA、编码-解码框架)具有一定的可迁移性。
-
明确结论:很有意思,值得留意。虽然方法学上不是突破性的,但它提出了一个非常有趣且重要的科学问题,并展示了一个清晰、可复现的分析流程。对于想拓宽视野、了解认知神经科学前沿的统计学家来说,这是一篇很好的阅读材料。它暴露出的数据挑战(高维多模态对齐、非线性建模、因果推断)也为统计学家提供了潜在的研究切入点。
-
武器库匹配度(轻量,点到即可):
-
无明显接口,纯科普阅读。本文的核心分析(线性回归、RSA)非常标准,不涉及你非常熟悉的非参数统计、高维渐近、U-统计量或因果推断中的复杂识别问题。虽然高维回归是一个切入点,但本文的处理方式(岭回归)非常常规,没有提出新的理论挑战。因此,这篇文章更适合作为拓宽视野的科普,而非寻找方法学迁移点的来源。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述 / 科普:
- 《Principles of Neural Science》 (Kandel et al.) 的相关章节:这是神经科学的经典教材,其中关于视觉系统的章节是理解本文背景的绝佳起点。
- 《Vision: A Computational Investigation into the Human Representation and Processing of Visual Information》 (David Marr):计算神经科学的奠基之作,提出了“表征”和“计算”的核心概念,是理解本文思想根源的必读。
- 关键的奠基或代表论文:
- 本文引用的NSD数据集论文:
Allen, E. J., et al. (2022). A massive 7T fMRI dataset to bridge cognitive neuroscience and artificial intelligence. Nature Neuroscience.这是本文所用数据的来源,也是了解该领域大规模数据驱动研究范式的关键。 - 本文引用的RSA奠基论文:
Kriegeskorte, N., Mur, M., & Bandettini, P. (2008). Representational similarity analysis – connecting the branches of systems neuroscience. Frontiers in Systems Neuroscience.这是RSA方法的原始论文,是理解本文核心分析方法的必读。 - 本文引用的DNN与大脑对齐的奠基论文:
Yamins, D. L. K., et al. (2014). Performance-optimized hierarchical models predict neural responses in higher visual cortex. PNAS.这篇论文开创了用DNN作为大脑视觉系统计算模型的范式,是理解本文背景的基石。
- 本文引用的NSD数据集论文:
- 可以动手玩的公开数据集 / 挑战赛:
- NSD (Natural Scenes Dataset):数据公开可用(https://naturalscenesdataset.org/)。你可以下载数据,尝试复现本文的分析,或者用你自己的统计方法(如CCA、贝叶斯模型)来探索。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| fMRI (functional Magnetic Resonance Imaging) | 功能性磁共振成像 | 一种无创测量大脑活动的方法,通过检测血氧水平变化来间接反映神经活动。 |
| Voxel | 体素 | fMRI数据的最小三维单元,相当于大脑的“像素”。 |
| BOLD signal (Blood-Oxygen-Level-Dependent) | 血氧水平依赖信号 | fMRI测量的主要信号,反映局部脑区的血氧含量变化,与神经活动相关。 |
| Representational Similarity Analysis (RSA) | 表征相似性分析 | 一种比较不同系统(如大脑和模型)内部表征结构的方法,通过比较“刺激-刺激相似性矩阵”来实现。 |
| Embedding | 嵌入 | 将离散对象(如单词、句子、图像)映射到一个连续的低维向量空间,使得语义相似的对象在空间中距离更近。 |
| Encoding Model | 编码模型 | 一个预测模型,输入是刺激特征,输出是预测的脑活动,用于评估特征集对脑活动的解释力。 |
| Decoding | 解码 | 从脑活动数据中重建出刺激的某些属性(如场景描述文本)。 |
| Deep Neural Network (DNN) | 深度神经网络 | 一种多层人工神经网络,是当前计算机视觉和自然语言处理的核心模型。 |
| Natural Scene | 自然场景 | 真实世界中的复杂、多物体、有背景和语义关系的图像,与实验室中使用的简单刺激相对。 |
| Selectivity | 选择性 | 指大脑的不同区域对不同类型的视觉信息(如面孔、场景、物体)有偏好性响应。 |
| Representational Alignment | 表征对齐 | 指两个不同表征系统(如大脑和模型)在结构上具有相似性,通常用RSA或编码模型精度来衡量。 |
| Ridge Regression | 岭回归 | 一种带有L2正则化的线性回归方法,用于处理高维数据,防止过拟合。 |
| Bag-of-Words (BoW) | 词袋模型 | 一种简单的文本表示方法,只考虑句子中出现了哪些词,不考虑词的顺序和上下文。 |
Maintained by 陈星宇 · Homepage · Source on GitHub