Convolutional architectures are cortex-aligned de novo¶
作者: Atlas Kazemian, Eric Elmoznino, Michael F. Bonner
来源: Nature Machine Intelligence
主题: 其他
相关性: 0/10
机构绿灯: Johns Hopkins University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01142-3
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于计算神经科学与深度学习的交叉领域,具体是“用人工神经网络模型来理解生物视觉系统”。这个子领域的核心科学问题是:为什么深度神经网络(尤其是卷积神经网络)在图像识别任务上表现优异的同时,其内部表征(即网络各层的激活模式)与灵长类动物视觉皮层的神经活动记录之间存在惊人的相似性?目前该领域成熟度中等——已有大量实证表明预训练后的网络与大脑对齐,但对齐的根源(是架构约束、训练数据、还是优化过程?)仍存在激烈争论。
- 本文的位置:它针对的是“架构归纳偏置(architectural inductive bias)在多大程度上独立于训练经验,就能产生皮层对齐表征”这一具体问题。为什么现在做?因为此前主流观点认为,预训练(尤其是大规模监督学习)是皮层对齐的关键,但本文作者通过最小化训练(仅训练分类头,冻结特征提取器)的实验设计,证明架构本身——特别是卷积网络中的两种维度操作——足以让皮层对齐表征涌现。这挑战了“训练至上”的叙事,把焦点拉回架构设计。
二、关键术语扫盲(充分展开,目标是读者将来能继续读该领域的科普/文献)¶
- 皮层对齐(cortex-aligned):指人工神经网络某一层的激活模式,与通过fMRI或电生理记录到的灵长类视觉皮层(如V1、V4、IT)的神经活动模式在统计上高度相似。通常用“表征相似性分析”(RSA)或“脑分数”(Brain Score)来量化。
- 架构归纳偏置(architectural inductive bias):网络结构本身隐含的“先验知识”——比如卷积层假设特征具有平移不变性(一个物体出现在图像左边还是右边,应该被同样识别),池化层假设空间位置上的微小变化不应改变高层特征。这些偏置在训练前就已存在。
- 池化(pooling):一种降采样操作,将图像的一个小区域(如2×2像素)合并成一个值(通常取最大值或平均值)。效果是压缩空间维度,让网络对物体的精确位置不那么敏感。
- 通道数(channels):在卷积网络中,每一层输出多个“特征图”(feature maps),每个特征图检测一种模式(如边缘、纹理、物体部件)。通道数就是这些特征图的数量。增加通道数意味着扩展特征维度,让网络能表示更丰富的视觉模式。
- 表征相似性分析(RSA):一种比较两个系统(如大脑和神经网络)内部表征的方法。先计算每个系统内不同刺激(如图片)之间的“距离矩阵”(比如用欧氏距离或余弦距离),然后比较这两个距离矩阵的相似性(如Spearman相关)。如果两个矩阵高度相关,说明两个系统以相似的方式组织视觉信息。
- 脑分数(Brain Score):一个标准化的基准测试,用于量化神经网络预测大脑活动的能力。分数越高,说明网络与大脑的对齐越好。本文使用的就是“Brain Score”基准。
- 灵长类视觉皮层(primate visual cortex):大脑中处理视觉信息的区域,按层级组织:V1(初级视觉皮层,检测简单边缘)→ V2 → V4 → IT(下颞叶皮层,识别复杂物体如面孔)。本文使用的数据来自猕猴和人类的fMRI/电生理记录。
- 无预训练(no pre-training):网络权重是随机初始化的,没有经过ImageNet等大规模数据集的监督学习或自监督学习。本文的核心实验就是在这种“几乎没学”的条件下,看架构本身能产生什么。
- 消融实验(ablation study):通过移除或破坏网络的某个组件(如去掉池化层、减少通道数),观察性能变化,从而推断该组件的重要性。本文对卷积网络做了靶向消融。
- 宽网络(wide networks):指通道数很大的网络(如每层有数百甚至上千个特征图)。本文发现,宽网络(而非深网络)在无预训练时皮层对齐效果最好。
- 特征扩展(feature expansion):通过增加通道数来提升网络表达能力。本文的核心发现是:这种扩展只有在卷积架构(有池化)下才有效,在MLP(多层感知机)中效果很差。
三、这个领域的人在关心什么¶
这个领域的研究者在追问一个根本问题:为什么人工神经网络能“像大脑一样”看东西? 这不仅是工程问题(如何造更好的AI),更是科学问题(大脑的计算原理是什么)。具体来说,他们关心:
- 表征对齐的根源:是训练数据(比如看了大量自然图像)让网络学会了大脑的表征?还是网络架构本身(比如卷积、池化)就与生物视觉的约束足够接近,以至于即使不训练,随机网络也能表现出一些皮层对齐?本文属于后一种思路的强力证据。
- 架构 vs. 训练:此前有工作(如Yamins et al., 2014; Schrimpf et al., 2018)表明,经过ImageNet预训练的深度神经网络能达到很高的脑分数。但后来发现,即使随机初始化的网络(尤其是宽网络)也能有一定对齐(Elmoznino & Bonner, 2022)。本文进一步追问:具体是架构中的哪个设计元素导致了这种对齐?答案是池化(空间压缩)和通道扩展(特征扩展)的组合。
- 当前主流方法与局限:
- 奠基工作:Yamins et al. (2014) 首次系统比较了深度神经网络与猕猴IT皮层的表征,发现预训练后的AlexNet对齐良好。这开启了整个领域,但留下了“训练是否必要”的口子。
- 主流方法:Schrimpf et al. (2018) 提出了“Brain Score”基准,系统评估了数十种预训练网络。局限是:它无法区分架构和训练的作用,因为所有网络都经过了预训练。
- 本文的贡献:通过最小化训练(只训练分类头,冻结特征提取器)和系统消融,本文绕开了“训练混淆”,直接证明架构归纳偏置(池化+通道扩展)足以产生皮层对齐。这比此前的工作更精细地定位了关键因素。
四、数据问题(统计学家最该关注的部分)¶
- 数据来源:来自两个公开数据集:
- 猕猴电生理数据(Majaj et al., 2015):记录猕猴V4和IT皮层对96张自然图像的神经响应。
- 人类fMRI数据(Allen et al., 2022):记录人类V1、V2、V3、V4、LO(外侧枕叶)对92张自然图像的BOLD信号。
- 数据形态:每个刺激(图像)对应一个高维神经响应向量(猕猴:数百个神经元;人类:数千个体素)。这些向量构成一个刺激×神经元/体素的矩阵。维度:约100个刺激 × 几百到几千个神经元/体素。
- 结构特征:有明确的层级结构——视觉皮层按V1→V2→V4→IT(猕猴)或V1→V2→V3→V4→LO(人类)组织,每个区域有不同功能。网络层与皮层区域之间的对齐是逐层比较的(如网络早期层对齐V1,晚期层对齐IT)。
- noise & 测量误差:fMRI数据有空间平滑性(相邻体素相关)和时间自相关(BOLD信号缓慢变化)。电生理数据有泊松噪声(神经元发放计数)。本文使用表征相似性分析(RSA),它对噪声相对鲁棒,因为比较的是距离矩阵而非原始响应。
- selection / bias / 缺失:刺激集是精心挑选的自然图像(不是随机样本),可能存在选择偏差(比如偏向于有明确物体的图像)。但本文关注的是相对比较(不同架构之间的对齐差异),而非绝对预测,所以偏差影响有限。
- 哪些是“漂亮的统计学问题”:
- 高维小样本:刺激数(~100)远小于神经元/体素数(几百到几千),这是典型的“p > n”问题。RSA通过降维(距离矩阵)部分缓解了这个问题,但仍有统计挑战。
- 多重比较:比较多个网络层与多个皮层区域的对齐,涉及大量假设检验。本文未做多重比较校正(或未报告),这是一个统计上的口子。
- 测量误差的传播:fMRI和电生理数据都有噪声,RSA估计的相似性本身有不确定性。本文未量化这种不确定性(没有置信区间或p值),仅报告了点估计。
- 哪些是纯工程/领域难题:数据采集成本极高(需要动物实验或昂贵fMRI扫描),样本量小是领域固有约束,不是统计方法能解决的。
五、方法与模型问题(统计学家最该关注的部分)¶
- 分析方法:本文的核心方法是表征相似性分析(RSA)。具体步骤:
- 对每个网络(不同架构、不同宽度),提取其各层对92-96张图像的激活向量。
- 对每个皮层区域(V1、V4、IT等),提取对应的神经响应向量。
- 分别计算网络层和皮层区域的刺激间距离矩阵(1 - 余弦相似度)。
- 计算两个距离矩阵的Spearman秩相关,作为“对齐分数”。
- 对每个网络,取所有层中与目标皮层区域对齐最好的那个分数(或平均)。
- 关键假设:
- 领域知识约束:假设网络层与皮层区域之间存在层级对应(早期层↔V1,晚期层↔IT)。这是基于已知的视觉处理层级,合理但非严格证明。
- 计算可行性:只训练分类头(冻结特征提取器),避免端到端训练的计算成本。这允许系统探索大量架构变体(不同宽度、有无池化等)。
- 推断/计算手段:主要是相关性分析(Spearman相关),没有使用回归、贝叶斯或因果识别。计算上,RSA的复杂度是O(N² × D),其中N是刺激数(~100),D是特征维度(可到数千),对现代计算机很轻量。
- 核心结论与不确定性量化:
- 结论:卷积架构中池化(空间压缩)和通道扩展(特征扩展)的组合,是皮层对齐涌现的关键。在MLP或消融后的卷积网络中,这种对齐显著下降。
- 不确定性量化:几乎没有。本文报告了点估计(Spearman相关系数),但没有置信区间、标准误或p值。不同架构之间的比较基于视觉检查(柱状图),没有统计检验。这是本文在统计严谨性上的一个明显短板。
六、对统计学家的判断(最关键的一节,不要含糊)¶
- 这篇文章作为科普读物质量如何?
- 打分:4/5 星。
-
理由:对不懂神经科学的统计学家来说,这是一篇不错的入门级科普。文章结构清晰(先问问题,再实验,再结论),术语解释得当(虽然没给正式定义,但上下文足够理解),核心发现(池化+通道扩展)直观易懂。读完能长见识:原来随机初始化的卷积网络就能“像大脑一样”组织视觉信息。扣一星是因为:对统计学家来说,缺乏不确定性量化让人略感不适;另外,文章假设读者熟悉深度学习基础(卷积、池化、通道),如果完全不懂,可能需要先补课。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:高。这个问题本身非常有意思——它触及了“为什么人工神经网络能模拟大脑”这一根本问题。对好奇的统计学家来说,这是一个绝佳的跨学科视野拓展:原来深度学习与神经科学的交叉点如此直接,而且结论(架构偏置比训练更重要)有反直觉的趣味。
- 方法学空间:中等偏低。从统计方法角度看,本文的方法(RSA + Spearman相关)非常标准,没有提出新的统计挑战。但数据侧有一些统计学家可以介入的口子:
- 高维小样本下的表征比较:RSA虽然常用,但它的统计性质(估计量的方差、偏差、最优性)在“p >> n”下研究不足。统计学家可以问:有没有比Spearman相关更好的对齐度量?如何为对齐分数构造置信区间?
- 多重比较:比较多个网络层与多个皮层区域,如何控制假阳性?本文未做校正,但领域内可能默认“探索性分析”不校正——这本身就是一个统计学家可以指出的问题。
- 测量误差模型:fMRI和电生理数据都有复杂的噪声结构,RSA假设距离矩阵是精确已知的,忽略了测量误差。一个贝叶斯或测量误差模型可能改进对齐估计。
- 现实相关性:中等。这种“高维小样本+距离矩阵比较”的模式在神经科学、心理测量学、生态学中很常见。统计学家在其他领域也会遇到类似问题(如比较两个物种的基因表达谱)。
-
明确结论:一般科普读读即可。这篇文章的科学趣味性值得花30分钟阅读,但统计方法上乏善可陈——没有需要统计学家出手的推断或估计问题。它更适合作为“周末拓宽视野”的读物,而非寻找方法学迁移点的来源。
-
武器库匹配度(轻量,点到即可):
-
无明显接口。本文的方法(RSA + Spearman相关)与武器库中的工具(非参数统计、高维渐近、因果推断、U-统计量、张量收缩)没有直接连接。虽然RSA涉及距离矩阵的比较,但这属于经典多元分析范畴,不是高维或非参数前沿问题。纯科普阅读。
-
如果想进一步了解这个话题,下一步读什么?(有被引文献时,前两项优先从「## 主要被引论文」里挑真实存在的,给确切标题;查不到再凭常识补,并标注"待核实")
- 入门综述:Schrimpf et al. (2018) “Brain-Score: Which Artificial Neural Network for Object Recognition is most Brain-Like?” — 这是Brain Score基准的奠基论文,系统介绍了如何比较神经网络与大脑表征,适合作为该领域的入门读物。
- 奠基论文:Yamins et al. (2014) “Performance-optimized hierarchical models predict neural responses in higher visual cortex” — 首次证明深度神经网络与IT皮层对齐的经典工作,是理解该领域起源的必读。
- 动手数据集:Brain Score 基准的公开代码和数据:https://github.com/brain-score/brain-score — 可以下载猕猴和人类的神经数据,复现本文的RSA分析。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| cortex-aligned | 皮层对齐 | 神经网络激活模式与大脑皮层神经活动模式相似 |
| architectural inductive bias | 架构归纳偏置 | 网络结构本身隐含的先验知识(如平移不变性) |
| pooling | 池化 | 降采样操作,压缩空间维度,让网络对位置不敏感 |
| channels | 通道数 | 每层特征图的数量,控制网络能表示多少种模式 |
| representational similarity analysis (RSA) | 表征相似性分析 | 通过比较距离矩阵来量化两个系统内部表征的相似性 |
| Brain Score | 脑分数 | 标准化基准,量化神经网络预测大脑活动的能力 |
| primate visual cortex | 灵长类视觉皮层 | 大脑中处理视觉信息的层级区域(V1→V2→V4→IT) |
| pre-training | 预训练 | 在大规模数据集(如ImageNet)上先训练网络 |
| ablation study | 消融实验 | 移除网络组件以推断其重要性的实验方法 |
| wide network | 宽网络 | 通道数很大的网络(而非深度大) |
| feature expansion | 特征扩展 | 通过增加通道数提升网络表达能力 |
| Spearman rank correlation | Spearman秩相关 | 衡量两个变量单调关系的非参数相关性度量 |
| fMRI | 功能性磁共振成像 | 通过血氧水平依赖(BOLD)信号间接测量大脑活动 |
| electrophysiology | 电生理学 | 直接记录神经元电活动的方法(如单细胞记录) |
Maintained by 陈星宇 · Homepage · Source on GitHub