← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 085 | 原始基线: V0_ZCODE_BASELINE | 语义审核: pass | 图表审核: pass Astra裁决: compromise_revision (revise)


Studying the visual brain in its natural rhythm

Leopold · Neuroimage · 2020 · Zotero itemID=962

一句话定位:这是一篇关于"自然视觉"(naturalistic vision)研究范式的观点综述:作者检视了放开注视约束、引入电影/自由观看/自由活动之后,灵长类高级视皮层研究正在发生什么变化。它的核心论点值得每个做视觉实验的人记住——几十年高度还原论(reductionism)的"固视范式"塑造了整个领域的概念体系,而一旦大脑回到自然节律下工作,"表征主义"(representationalism)这套语言就开始显得力不从心。

研究背景

视觉神经科学的成功建立在严格的实验控制之上:头部固定、注视小点、刺激短暂闪现在空白屏幕上(图 1)。这套范式绘制了从 V1 到下颞叶皮层(inferior temporal cortex, IT)数十个脑区的特征选择性图谱,并与解剖连接、视网膜拓扑组织、反应潜伏期和损伤研究一起,催生了被广泛接受的视觉加工层级框架(如 Felleman & Van Essen 1991 的层级模型)。叠在这个框架之上的是"神经表征主义":全脑神经元被认为通过其选择性反应"表征"外部视觉对象——作者不否认这一概念在过去有用,但指出它本质上往往只是"特定神经元/体素对特定刺激有反应"这一结果的语言复述,而在行为不受约束的条件下能否继续有用,是尚未检验的问题。

与此同时,现实视觉与实验视觉的落差是结构性的:实验中刺激短暂呈现在空白背景上,现实中我们持续沉浸在复杂、全景式的三维场景里;实验中注视锁定在中央小点,现实中眼动和身体动作不断搅动视网膜输入。早期视觉神经元的感受野特性似乎在进化上就为自然图像的统计量身定制(如稀疏编码、边缘滤波器类感受野),高级区神经元则对社会性刺激(面孔、身体动作)敏感,且自我导向的探索行为通过注意、目标选择、"是否主动注意到"、是否与他人对视等因素强烈塑造脑反应——这些因素恰恰是传统实验刻意排除的。缺口在于:那些在还原论框架下确立的原理,没有多少保证能推广到大脑的"自然工作模式"。

研究思路

作者采用"从现状出发、逐级放开约束"的综述策略:先剖析领域赖以立足的表征主义根基(第 1 节),然后沿着控制程度递减的方向展开——从电影自由观看下的全脑成像(第 2 节),到面孔区神经元在传统与自然条件下的直接对比(第 3 节),再到真实社会互动(第 4 节),然后讨论自然视觉与计算方法(数据驱动建模、刺激合成)的汇合点(第 5 节),最后展望完全自由活动的动物实验及其将带来的四个几何/时间维度上的概念冲击(第 6 节)。这条逻辑线的暗线是:每当约束放松一档,某个被视为"安心"的概念(如"face cells"、严格功能分离、以视角为单位描述刺激)就会暴露出裂缝;作者由此论证自然主义方法不是锦上添花,而是对领域概念体系的一次压力测试。

方法

将方法首句相关部分替换为:“本文是综述/观点文章,未报告新的实验研究。图 2 展示猕猴 AF 面孔斑的单神经元响应,致谢注明图示数据由 Kenji W. Koyano 提供;正文在讨论相关发现时引用 McMahon 等(2015),但未明确说明该图是否为已发表数据的重绘。”,覆盖电生理与功能成像两条技术线、人类与猕猴(及少量狨猴、蝙蝠、大鼠)两类对象。其"素材"方法可概括为三类:(1)自由观看 fMRI 研究及其派生分析工具——被试间相关(inter-subject correlation,Hasson 等 2004 起)、时间共变网络分析(Bartels & Zeki 的"时间构筑学" chronoarchitecture)、时间感受窗(temporal receptive window)层级、连续语义空间(Huth et al 2012),以及跨物种活动相关(Mantini 等);(2)单细胞与 fMRI 的"混合"方法——如 Park 等(2017)用外部电影的共同时间线,把全脑 fMRI 体素时间课程当作对单单位活动的"读出",为每个神经元生成一幅与全脑的相关图;(3)数据驱动的刺激合成——把神经反应实时回馈给刺激生成器做遗传算法式迭代,或用深度生成网络优化图像(Ponce et al 2019)。作者声明聚焦于与人类和非人灵长类高级视觉特化最相关的研究。

主要结果

  1. 自由观看下,眼动与刺激运动的皮层分工截然不同。Russ 等(2015, 2016)把猕猴自由看电影时的血氧响应拆成两个成分——电影画面自身的运动与被试自己眼动造成的视网膜扫动——发现眼动运动强烈调制 V1、V2、V3 等早期视网膜拓扑区,却对上颞沟(STS)区域(含 MT 及其卫星区、面孔/身体选择斑块)影响很小;刺激运动则强烈影响 STS 区而对早期区作用相对较小。这暗示一种可能根本性的脑组织原则(p2-3)。
  2. "面孔细胞"在自然电影面前站不稳。McMahon 等(2015)记录猕猴前fundus(AF)面孔斑内不足 1 mm³ 内密集排列的面孔选择神经元,发现它们对闪现图片的分类选择高度一致(图 2A),且在电影观看下对同一视频的多次呈现反应仍可重复;但邻近神经元对电影的时间课程却显著互不相关(图 2B)——名义上的同类"面孔细胞"其实在响应闪现实验未触及的动态与空间维度(p3-4;图 2)。
  3. 同一毫米级皮层块内藏着多个功能亚群。Park 等(2017)把每个 AF 神经元的电影响应时间课程与全脑 fMRI 体素时间课程做相关,得到神经元专属的"全脑地图":相邻神经元的相关地图高度分化,说明局部群体在长程输入与视觉运算上异质;同样的局部多样性见于其他面孔斑与丘脑枕(pulvinar)(Park et al 2018)。这动摇了"严格功能分离"的观念——同一位置容纳着加盟完全不同脑网络的多个相互混杂的亚群(p3-4;图 3A)。
  4. 数据驱动与计算方法正在接管"意义提取"。基于活动实时迭代的刺激合成(遗传算法、深度学习)能为面孔区神经元找到诱发最强发放的优化图像(Ponce et al 2019)——这些图像并非可辨认的物体,而是常隐约像动物之类的彩色轮廓与表面马赛克(图 3B)。作者认为这类生成式方法虽仍带表征主义印记,却为思考高级视觉特化开辟了全新方向(p5;图 3B)。
  5. 自由活动将把四个被排除的维度带回视野。(i)真实场景几何:视网膜像无法唯一确定物体大小与距离,腹侧通路可能利用同类的绝对尺寸来标定空间尺度,人类 fMRI 已发现真实世界尺寸对物体表征的组织(Konkle & Oliva 2011, 2012)(p5;图 4A);(ii)全景沉浸:中央 10 度视野只占视野不足 0.5%,而研究外周反应的实验少之又少,Podvalny 等(2017)在自由转向的人类患者中发现大扫视强烈影响早期视网膜拓扑皮层却不影响面孔选择皮层——与猕猴自由观看 fMRI 结果平行,或为知觉稳定性指标(p6);(iii)自运动视差(motion parallax):这个最古老、最少被研究的深度线索,恰因几乎所有视觉实验都固定被试而被系统性消除(p6;图 4B);(iv)时间连续性:自然视觉的神经动态是连续的、跨多个时间尺度的,大鼠研究提示某些脑区在数秒以上的尺度上显式表征时间本身(Howard & Eichenbaum 2015)(p6-7)。

图注解读

图 1 · 固视范式:领域的默认设定

原文图注:Fig. 1. Fixed-gaze paradigms used in humans and nonhuman primates. The dominance of these paradigms, where the subject is immobilized, the head restrained, and the gaze maintained on a small point (black circle) during the presentation of visual stimuli (red cross), has strongly shaped theories of visual neuroscience.

这是一张示意性的"范式自画像":被试被固定、头部受约束、注视点为黑色小圆圈,视觉刺激以红十字呈现在屏幕上。它不是数据图,而是全文批判的靶子——作者用它说明人类与灵长类研究被这类"冻结行为"的范式主导,因此视觉理论天然带着"刺激短暂闪现、注视锁定"的隐含假设。放在全文开头,作用是为后文"自然条件下的脑如何反应"之问铺垫。

Figure 1

图 2 · AF 面孔斑神经元:闪现图片下同质,自然电影下分道扬镳

原文图注:Fig. 2. Responses of single neurons in the macaque anterior fundus (AF) face patch to flashed images from different categories (A) and to a 5-min video depicting primate social interaction (B). A. Each row in the heat map corresponds to an individual neuron, and each column is the average spiking response to a particular image. The image categories are shown at the bottom, revealing a strong bias for responding to faces, as is typical among neurons in macaque face patches. On the right are the mean category responses of eight example neurons. B. Movie responses are shown for the same eight example neurons.

A 面是一张热图:每行一个神经元、每列一张图片的平均发放反应,底部标出图片类别(面孔、身体等),整片热图向"面孔"列亮起,显示这些神经元对闪现图片的类别选择高度一致——这正是面孔斑的教科书性质。右侧再画出 8 个示例神经元的平均类别反应曲线。B 面换到 5 分钟灵长类社交互动视频:同一批 8 个神经元对视频多次呈现的光栅图(raster)叠加蓝色发放密度曲线,重复性虽强,但 8 个神经元的时间课程彼此几乎不相关。这张图支撑第 2 条结论:分类同质性只适用于闪现刺激范式,自然条件下同斑块神经元各自追踪不同的动态特征,"面孔细胞"作为一个整体概念开始松动。

Figure 2

图 3 · 两条数据驱动路线:给神经元画全脑地图,让算法来设计刺激

原文图注:Fig. 3. Data-driven approaches to understand the functional specialization of single neurons in high-level visual cortex. A. Single-unit mapping of individual time courses of neurons onto voxels across the brain (Park et al., 2017). This method uses fMRI-responses to video content as a way to interpret the response time courses of single neurons. Within macaque face patches, neighboring single neurons show highly divergent correlational maps with the rest of the brain, indicating a heterogeneity of long-range inputs and visual operations in the local neural population. B. Single-unit based design of visual images using deep learning methods (Ponce et al., 2019). Optimized stimuli are determined through multiple iterations of neural recording and stimulus modification.

此图分两栏展示"数据驱动"路线的两翼。A 栏示意 Park 等(2017)的方法链:以 15 分钟电影为共同时间线,把单个神经元的时间课程与全脑 fMRI 体素的时间课程逐一相关,得到每个神经元自己的全脑相关图——图中相邻神经元的相关地图差异悬殊,说明同一小皮层块内的神经元挂着不同的长程网络,对应第 3 条结论。B 栏示意 Ponce 等(2019)的生成式闭环:记录反应—算法修改刺激—再记录,多轮迭代后收敛出的优化图像(那些隐约像动物的彩色马赛克)。两栏合起来体现作者"计算方法与自然视觉汇合"的论点:前者是解读自然活动的工具,后者是从大脑自身偏好出发重新发现刺激的逆向工程。

Figure 3

图 4 · 自由活动后浮出水面的真实世界几何

原文图注:Fig. 4. Real world geometrical considerations that come to the fore when visual experiments involve unrestrained animals. A. Constraints of real object size on the brain's interpretation of visual images. Three example combinations of object size and distance that generate same two-dimensional retinal image are depicted. The practice of describing the size of visual objects in degrees of visual angle, which corresponds to the retinal geometry, is inherently ambiguous and may not match the brain's encoding of objects. B. Deducing 3D volumetric structure and spatial relations through self-motion. The example shows the experience of an observer across time induced by its self movement in three-dimensional scene.

A 面画出三组"大小×距离"的组合,它们在视网膜上投影成同一个二维像——说明用"度视角"描述刺激大小天然歧义,大脑未必按视网膜几何编码物体,而可能直接关联物体的物理尺寸与观察者距离(作者预测绝对尺寸信息嵌入在物体表征中)。B 面画的是观察者在三维场景中自运动时随时间获得的一系列视角,强调自运动视差是理解场景三维结构最基本却最少被研究的线索。这张图为第 6 节的展望服务:一旦动物不被固定,这些被固视范式系统性抹掉的几何量就会回到实验视野,可能改写高级视觉特化的解释。

Figure 4

讨论

作者在结论中的姿态相当清醒:他们不为表征主义辩护,也不宣告它作废,而是问这个框架在离开常规测试情境后还能走多远——答案倾向于"自然节律下的视觉运算需要新概念"。文中给出的正面例子是海马研究的历史:位置细胞与网格细胞的发现之所以可能,正是因为科学家让大鼠自由活动、再在大量受控环境中系统研究(O'Keefe 1976;Moser et al 2008);这一范式近来还扩展到"社会位置细胞"(蝙蝠与大鼠海马编码被观察个体的位置,Omer et al 2018;Danjo et al 2018),作者据此预测灵长类脑尤其适应追踪社会互动的空间布局。技术层面,作者指出无线多通道记录放大器与 DeepLabCut 式视频姿态追踪的爆发(Luan et al 2018;Nath et al 2019)让自由活动灵长类电生理成为可能,狨猴因社会行为丰富、易繁殖易操作而被看好为互动研究的模型。作者同时坦承自然主义方法"充满实验与分析挑战"——交互式双被试范式仍处起步阶段、电影分析的结论尚未证明其能重塑对脑的理解——并把拥抱这些范式的选择描绘为一场带风险的冒险。全文与 Hasson、Bartels & Zeki、Huth 等电影 fMRI 传统以及 McMahon/Park 自己团队的面孔斑工作直接对话,也回应了 Felsen & Dan(2005)以来"自然视觉"倡导者的老议题。

一句话总结

我的读法是:这篇文章真正讨论的不是"要不要用电影做实验",而是实验范式的隐形枷锁——我们以为是视觉脑的普适规律,很可能只是固视范式允许我们看到的那部分规律。AF 面孔斑在闪现图片下齐声、在自然电影下各唱各调的结果,是我见过对"类别模块"叙事最优雅的一记反例;当然,作者也承认自然范式还拿不出能替代表征主义的新框架,这一点我同意——目前它更多是在暴露旧框架的边界,而不是已经画出新地图。


审校与证据追溯 (Verification & Evidence)

图表审计结果

关键事实与局限性声明