跳转至

High-level visual representations in the human brain are aligned with large language models

作者: Adrien Doerig, Tim C. Kietzmann, Emily Allen, Yihan Wu, Thomas Naselaris et al.
来源: Nature Machine Intelligence
主题: 其他
相关性: 4/10
机构绿灯: University of Minnesota(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01072-0


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于认知神经科学计算神经科学的交叉领域,具体来说是视觉神经科学的一个分支——研究大脑如何从自然场景中提取并表征复杂的视觉信息(不仅仅是识别出“这是一个苹果”,还包括苹果与桌子的空间关系、苹果可能被吃的语义信息等)。这个子领域的核心科学问题是:大脑的视觉系统是如何将视网膜上的二维光信号,转化为我们主观体验到的、富含语义和关系的三维世界表征的? 目前的成熟度是:我们已经对初级视觉皮层(V1)处理简单特征(边缘、朝向)有较好理解,但对高级视觉皮层(如颞下回、外侧枕叶复合体)如何编码复杂场景的语义和关系信息,仍缺乏一个定量的、统一的描述框架。
  • 本文的位置:它针对的是如何定量刻画大脑从自然场景中提取的“复杂视觉信息” 这一具体问题。为什么现在做?因为近年来大语言模型(LLM) 的嵌入(embedding)被证明能捕捉文本中的复杂语义和上下文关系,而大脑的视觉系统似乎也在做类似的事情——从视觉输入中提取一个“场景描述”。本文的核心假设是:LLM对场景文本描述的嵌入,可以作为大脑视觉表征的一个有效“代理”或“对齐目标”,从而让我们能用这个已知的、可计算的表征空间来理解未知的、高维的脑活动数据。

二、关键术语扫盲

  1. fMRI (功能性磁共振成像):一种无创测量大脑活动的方法。它通过检测血氧水平依赖(BOLD)信号来间接反映神经活动。简单说,就是给大脑拍“动态照片”,看哪些区域在你看东西时更“亮”(血流量增加)。空间分辨率约1-3毫米,时间分辨率约1-2秒。
  2. 体素 (Voxel):fMRI数据的最小三维单元,相当于大脑的“像素”。一个体素大约包含几十万到几百万个神经元。本文中,每个被试的大脑被分割成约10万个体素。
  3. 表征相似性分析 (Representational Similarity Analysis, RSA):一种比较不同表征系统(如大脑 vs. 模型)的方法。核心思想是:如果两个系统对一组刺激(比如100张图片)的内部表征结构相似,那么它们各自计算出的“刺激-刺激相似性矩阵”就应该高度相关。比如,大脑认为“猫”和“狗”的神经活动模式更相似,而“猫”和“汽车”差异很大;如果模型也这么认为,那模型和大脑就是“对齐”的。
  4. 大语言模型 (LLM) 嵌入 (Embedding):LLM(如GPT、BERT)将单词或句子转换成一个高维向量(比如768维或1024维)。这个向量不是简单的词频统计,而是捕捉了词汇的语义、句法、上下文关系。例如,“苹果”和“香蕉”的嵌入向量会比“苹果”和“汽车”更接近。本文用的是LLM对场景描述文本(如“一个人在公园里遛狗”)的嵌入。
  5. 编码模型 (Encoding Model):一种预测模型,输入是刺激特征(如图片、LLM嵌入),输出是预测的脑活动(体素响应)。本文用线性回归来预测每个体素的BOLD信号,看哪个特征集(如LLM嵌入 vs. 图像像素)预测得最好。预测能力越强,说明该特征集越能解释该脑区的活动。
  6. 解码 (Decoding):编码的逆过程。从脑活动数据中重建出刺激的某些属性。本文中,他们从fMRI信号中重建出场景描述文本,证明了LLM嵌入空间的信息足够丰富,可以被“反向读出”。
  7. 深度神经网络 (DNN):一种多层人工神经网络,是当前计算机视觉的主力模型。本文训练了一个DNN,其任务是将图像像素直接映射到LLM嵌入空间。这个DNN相当于一个“视觉编码器”,它学会了从图像中提取LLM所描述的“场景级”信息。
  8. 自然场景 (Natural Scenes):与实验室里用的简单、孤立的刺激(如黑白条纹、单个物体图片)相对,指真实世界中的复杂、多物体、有背景和语义关系的图像。这是本文的核心刺激材料,因为大脑的视觉系统正是为处理这种复杂场景而演化的。
  9. 脑区选择性 (Selectivity):指大脑的不同区域对不同类型的视觉信息有偏好。例如,梭状回面孔区(FFA)对面孔反应强烈,海马旁回位置区(PPA)对场景反应强烈。本文发现,LLM嵌入能很好地刻画这种区域选择性——即不同脑区对LLM嵌入的不同维度有不同响应模式。
  10. 表征对齐 (Representational Alignment):本文的核心概念。指两个不同的表征系统(如大脑的神经活动模式和LLM的嵌入向量)在结构上具有相似性。对齐程度通常用RSA或编码模型预测精度来衡量。

三、这个领域的人在关心什么

这个领域的研究者(视觉神经科学家和计算神经科学家)在追问一个根本问题:我们的大脑是如何“看”的? 这个问题远不止“识别出物体是什么”。它包含: - 场景理解:如何同时处理场景中的多个物体、它们的空间关系(左/右、前/后)、语义关系(“狗在追猫”)、以及场景的整体“gist”(“这是一个公园”)。 - 不变性:无论物体在视网膜上的大小、位置、视角、光照如何变化,我们都能稳定地识别它。大脑是如何实现这种“不变表征”的? - 从感知到认知:视觉信息如何从初级的感觉区域(V1)流向高级的认知区域(如颞叶、前额叶),并与记忆、语言、情感等系统交互,最终形成我们的主观体验?

当前主流的方法和已知局限: - 主流方法一:用人工神经网络(ANN)作为大脑视觉系统的计算模型。这是过去十年最成功的方法。研究者发现,深度卷积神经网络(如AlexNet, VGG)的中间层表征与大脑腹侧视觉通路(从V1到IT)的神经活动高度对齐。局限:这些模型主要擅长物体识别,对场景理解(特别是场景中物体间的复杂关系和语义)建模能力有限。它们更像是一个“物体分类器”,而不是一个“场景理解器”。 - 主流方法二:用低层视觉特征(如Gabor滤波器、SIFT特征)或中层特征(如场景的“空间包络”属性)局限:这些特征过于简单,无法捕捉场景的丰富语义和关系信息。 - 本文的贡献:它引入了一个全新的、来自NLP领域的“中介表征”——LLM的场景描述嵌入。这个表征天然擅长捕捉复杂语义和上下文关系,正好弥补了传统视觉模型在“场景理解”上的短板。本文通过一系列控制实验证明,LLM嵌入与大脑高级视觉皮层的对齐程度,显著优于传统的视觉模型(如DNN),并且这种对齐源于LLM的整合能力(而非单个词汇的简单组合)。这为理解大脑如何编码复杂场景信息提供了一个全新的、强大的定量工具。

四、数据问题

  • 数据来源:公开数据集 NSD (Natural Scenes Dataset)。这是目前最大的fMRI自然场景数据集之一。8名被试在7T fMRI扫描仪中观看了约10,000张自然场景图片(每张图片呈现3秒,每个被试重复观看3次)。同时,每张图片都配有人工标注的场景描述文本(如“一个男人在沙滩上遛狗”)。
  • 数据形态
    • 脑活动数据:高维的时间序列(每个体素一个时间序列),但经过预处理后,通常被简化为每个刺激对应的体素响应向量(每个体素一个数值,代表该刺激下该体素的平均BOLD信号)。维度:约10万个体素(每个被试)。
    • 刺激数据:自然场景图像(RGB像素)。以及对应的场景描述文本(句子)。
    • LLM嵌入:将场景描述文本输入LLM(本文用了多种LLM,如GPT-2, BERT, RoBERTa等),得到每个句子的高维向量(如768维)。
  • 结构特征
    • 层次结构:大脑视觉系统本身是分层的(V1 → V2 → V4 → IT → 前额叶等)。本文的分析也按脑区进行,考察不同层级脑区与LLM嵌入的对齐程度。
    • 空间结构:fMRI数据有三维空间结构(体素在脑内的位置),但本文的分析(RSA和编码模型)通常将体素视为独立样本,或按脑区聚合。
  • Noise & 测量误差
    • fMRI噪声:主要噪声源是生理噪声(心跳、呼吸)、热噪声、以及BOLD信号本身的低信噪比(SNR)。噪声通常是时间上相关的(自回归过程),且非高斯。本文通过多次重复实验(每个刺激3次)来平均降噪。
    • 测量误差:BOLD信号是神经活动的间接测量,存在空间和时间上的模糊性。
  • Selection / Bias / 缺失
    • 被试选择:8名被试,样本量小,且都是健康年轻人,存在选择偏差。
    • 刺激选择:NSD数据集中的图片虽然多样,但并非完全随机采样自真实世界,存在一定的采样偏差(例如,可能更偏向于常见场景)。
    • 缺失:fMRI数据中,由于被试头动或扫描仪故障,部分体素或时间点的数据可能被标记为缺失。
  • 哪些是“漂亮的统计学问题”,哪些是“纯工程或纯领域难题”
    • 漂亮的统计学问题
      1. 高维回归与预测:用高维的LLM嵌入(~1000维)预测高维的脑活动(~10万维)。如何在高维、低样本量(~10,000个刺激)下进行有效的正则化和模型选择?这直接涉及高维统计非参数回归
      2. 表征相似性分析中的统计推断:如何检验两个相似性矩阵(大脑 vs. 模型)的相关性是否显著?这涉及矩阵相关性检验(如Mantel检验),其零分布通常需要置换检验,计算量大。
      3. 多模态数据对齐:如何将图像、文本、脑活动三种不同模态的数据对齐到一个共同的表征空间?这涉及典型相关分析(CCA) 及其变体,以及深度学习的多模态学习
    • 纯工程或纯领域难题
      1. fMRI数据预处理:头动校正、时间层校正、空间平滑、去噪等,这些是神经科学领域的标准流程,统计学家通常不直接参与。
      2. LLM的选择与调优:选择哪个LLM、用哪一层嵌入、是否微调,这些更多是NLP领域的工程问题。
      3. DNN的训练:训练一个将图像映射到LLM嵌入空间的DNN,需要大量的计算资源和调参经验,属于深度学习工程。

五、方法与模型问题

  • 分析方法
    1. 编码模型:对每个体素,用岭回归(Ridge Regression)训练一个线性模型,输入是LLM嵌入向量,输出是该体素的BOLD响应。通过交叉验证评估预测精度(皮尔逊相关系数)。这是本文最核心的分析,用来量化LLM嵌入对每个脑区的解释力。
    2. 表征相似性分析 (RSA):计算大脑的“表征不相似性矩阵”(RDM,基于不同刺激引起的体素响应模式的欧氏距离)和模型的RDM(基于LLM嵌入的余弦距离),然后计算两个RDM的Spearman秩相关。这是另一种评估对齐程度的方法。
    3. 解码:训练一个线性回归模型,从所有体素的响应向量中重建出LLM嵌入向量,然后从重建的嵌入向量中检索最相似的场景描述文本(最近邻搜索)。这证明了LLM嵌入空间的信息可以被“反向读出”。
    4. 控制实验:为了证明LLM的“整合能力”是关键,他们构建了“词袋模型”(Bag-of-Words, BoW)作为对照。BoW只考虑句子中出现了哪些词,不考虑词的顺序和上下文。如果LLM显著优于BoW,就说明整合能力(而非单个词汇)是解释力来源。
  • 关键假设
    • 线性假设:编码模型假设体素响应是LLM嵌入的线性函数。这是一个很强的简化假设,但也是计算上可行的。实际上,大脑的编码可能是高度非线性的。
    • 表征对齐假设:RSA假设大脑和模型在“刺激-刺激相似性结构”上是一致的。这是一个合理的假设,但并非唯一可能的对齐方式。
  • 推断 / 计算手段
    • 回归:岭回归(L2正则化)。
    • 相关性分析:Spearman秩相关。
    • 置换检验:用于评估RSA相关性的统计显著性。
    • 深度学习:训练DNN(如ResNet)进行图像到LLM嵌入的映射。
  • 核心结论 + 不确定性量化
    • 核心结论:LLM的场景描述嵌入能有效解释高级视觉皮层(如外侧枕叶复合体、颞下回)的脑活动,其解释力显著优于传统的视觉模型(如DNN)和简单的词袋模型。这表明大脑在理解复杂场景时,可能采用了与LLM类似的“语义整合”机制。
    • 不确定性量化:本文主要通过交叉验证(将数据分为训练集和测试集)来评估模型预测精度,并报告了标准误统计显著性(p值)。但缺乏对模型参数(如岭回归的正则化系数)不确定性的系统量化(如贝叶斯方法)。结论的稳健性依赖于交叉验证的可靠性。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?
  2. 评分:4/5 星
  3. 理由:文章写得相当清晰,对核心概念(LLM嵌入、fMRI、RSA、编码模型)都有直观的解释,即使没有神经科学背景也能跟上主要逻辑。它很好地回答了“为什么这件事值得做”(大脑如何理解复杂场景?),并展示了从数据到结论的完整链条。扣一星是因为它假设读者对LLM和DNN有一定了解,且部分细节(如不同LLM的比较)对纯外行来说略显繁琐。但总体而言,它是一篇非常好的入门级跨学科科普,能让一个统计学家快速理解这个领域在做什么、用什么数据、怎么分析。

  4. 这里面有没有统计学家会觉得有意思的东西?

  5. 科学趣味性非常高。这个问题本身——大脑如何“理解”一个复杂场景?——是科学中最根本、最迷人的问题之一。它连接了感知、认知、语言和人工智能。作为一个好奇的统计学家,了解这个领域的最新进展本身就是一种智力享受。文章提出的“LLM嵌入作为大脑表征的代理”这一想法,非常巧妙且富有启发性。
  6. 方法学空间有,但并非核心。本文在方法学上相对直接(线性回归、RSA),没有提出新的统计方法。然而,它暴露出的数据和分析挑战对统计学家来说非常有趣:
    • 高维、低样本量、多模态对齐:如何更优雅地处理10万维脑活动与1000维LLM嵌入之间的对齐?能否用典型相关分析(CCA)偏最小二乘(PLS) 来找到共享的低维子空间?能否用贝叶斯方法对体素响应的空间结构(平滑性)进行建模,以提高预测精度和可解释性?
    • 非线性编码模型:线性假设显然过于简化。能否用高斯过程深度核方法来建模体素响应与LLM嵌入之间的非线性关系?这能揭示大脑编码中更复杂的模式。
    • 因果推断:本文是相关性研究。能否设计实验或分析方法来推断LLM嵌入的哪个维度(例如,是“物体”维度还是“关系”维度)因果性地驱动了特定脑区的活动?这需要更精细的因果推断框架。
    • 不确定性量化:除了交叉验证,能否对“LLM嵌入与大脑表征的对齐程度”给出一个置信区间?能否量化不同LLM模型、不同脑区之间对齐程度的差异的不确定性
  7. 现实相关性中等。这种“用高维嵌入表征来对齐多模态数据”的问题模式,在计算社会科学(如用词嵌入分析文化观念)、计算生物学(如用基因表达谱对齐不同物种的脑区)等领域也会出现。统计学家在这里学到的分析思路(RSA、编码-解码框架)具有一定的可迁移性。
  8. 明确结论很有意思,值得留意。虽然方法学上不是突破性的,但它提出了一个非常有趣且重要的科学问题,并展示了一个清晰、可复现的分析流程。对于想拓宽视野、了解认知神经科学前沿的统计学家来说,这是一篇很好的阅读材料。它暴露出的数据挑战(高维多模态对齐、非线性建模、因果推断)也为统计学家提供了潜在的研究切入点。

  9. 武器库匹配度(轻量,点到即可)

  10. 无明显接口,纯科普阅读。本文的核心分析(线性回归、RSA)非常标准,不涉及你非常熟悉的非参数统计、高维渐近、U-统计量或因果推断中的复杂识别问题。虽然高维回归是一个切入点,但本文的处理方式(岭回归)非常常规,没有提出新的理论挑战。因此,这篇文章更适合作为拓宽视野的科普,而非寻找方法学迁移点的来源。

  11. 如果想进一步了解这个话题,下一步读什么?

  12. 入门综述 / 科普
    • 《Principles of Neural Science》 (Kandel et al.) 的相关章节:这是神经科学的经典教材,其中关于视觉系统的章节是理解本文背景的绝佳起点。
    • 《Vision: A Computational Investigation into the Human Representation and Processing of Visual Information》 (David Marr):计算神经科学的奠基之作,提出了“表征”和“计算”的核心概念,是理解本文思想根源的必读。
  13. 关键的奠基或代表论文
    • 本文引用的NSD数据集论文Allen, E. J., et al. (2022). A massive 7T fMRI dataset to bridge cognitive neuroscience and artificial intelligence. Nature Neuroscience. 这是本文所用数据的来源,也是了解该领域大规模数据驱动研究范式的关键。
    • 本文引用的RSA奠基论文Kriegeskorte, N., Mur, M., & Bandettini, P. (2008). Representational similarity analysis – connecting the branches of systems neuroscience. Frontiers in Systems Neuroscience. 这是RSA方法的原始论文,是理解本文核心分析方法的必读。
    • 本文引用的DNN与大脑对齐的奠基论文Yamins, D. L. K., et al. (2014). Performance-optimized hierarchical models predict neural responses in higher visual cortex. PNAS. 这篇论文开创了用DNN作为大脑视觉系统计算模型的范式,是理解本文背景的基石。
  14. 可以动手玩的公开数据集 / 挑战赛
    • NSD (Natural Scenes Dataset):数据公开可用(https://naturalscenesdataset.org/)。你可以下载数据,尝试复现本文的分析,或者用你自己的统计方法(如CCA、贝叶斯模型)来探索。

七、术语小抄

英文术语 中文 一句话解释
fMRI (functional Magnetic Resonance Imaging) 功能性磁共振成像 一种无创测量大脑活动的方法,通过检测血氧水平变化来间接反映神经活动。
Voxel 体素 fMRI数据的最小三维单元,相当于大脑的“像素”。
BOLD signal (Blood-Oxygen-Level-Dependent) 血氧水平依赖信号 fMRI测量的主要信号,反映局部脑区的血氧含量变化,与神经活动相关。
Representational Similarity Analysis (RSA) 表征相似性分析 一种比较不同系统(如大脑和模型)内部表征结构的方法,通过比较“刺激-刺激相似性矩阵”来实现。
Embedding 嵌入 将离散对象(如单词、句子、图像)映射到一个连续的低维向量空间,使得语义相似的对象在空间中距离更近。
Encoding Model 编码模型 一个预测模型,输入是刺激特征,输出是预测的脑活动,用于评估特征集对脑活动的解释力。
Decoding 解码 从脑活动数据中重建出刺激的某些属性(如场景描述文本)。
Deep Neural Network (DNN) 深度神经网络 一种多层人工神经网络,是当前计算机视觉和自然语言处理的核心模型。
Natural Scene 自然场景 真实世界中的复杂、多物体、有背景和语义关系的图像,与实验室中使用的简单刺激相对。
Selectivity 选择性 指大脑的不同区域对不同类型的视觉信息(如面孔、场景、物体)有偏好性响应。
Representational Alignment 表征对齐 指两个不同表征系统(如大脑和模型)在结构上具有相似性,通常用RSA或编码模型精度来衡量。
Ridge Regression 岭回归 一种带有L2正则化的线性回归方法,用于处理高维数据,防止过拟合。
Bag-of-Words (BoW) 词袋模型 一种简单的文本表示方法,只考虑句子中出现了哪些词,不考虑词的顺序和上下文。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论