IT Literature Intelligence 终审版本 (VERIFIED) 论文编号:
107| 原始基线:V0_ZCODE_BASELINE| 语义审核:minor_issues| 图表审核:pass
Factors determining where category-selective areas emerge in visual cortex
Op de Beeck · Trends in Cognitive Sciences · 2019 · Zotero itemID=1112
这是一篇立场明确的综述,回答"面孔、文字这类类别选择性功能区为何长在它们所长的地方":作者把近年发育研究的发现整合成一个三因素框架——既有的刺激特征选择性(what)、在视觉计算层级中的恰当位置(how)、与脑非视觉区域的领域特异性连接(why)——并逐一论证任何单一因素都不足以解释全部证据。它值得精读,因为它把"先天 vs 经验"的旧争论推进到"哪些先天约束与哪类经验如何交互"的可操作问题,并为枕颞皮层功能发育的后续实验列出了清晰的检验清单。
研究背景
人类大脑功能定位最引人注目的例子之一,就写在枕颞皮层(occipitotemporal cortex, OTC)上:这片区域密布着对生态学上有意义的类别图像表现选择性的功能区——面孔(如梭状回面孔区,fusiform face area, FFA)、视觉词形(visual word form area, VWFA)、身体、手、场景、工具、数字等。这些区域的位置高度可预测,但它们在发育过程中为何出现在各自的解剖位置,仍持续争论。争论的张力很典型:一方面,有证据表明这些区域的出现需要视觉经验(面孔剥夺的猴子不长面孔区、文盲没有 VWFA);另一方面,先天失明者脑内也能测出类似的类别选择性分布,又有论者认为它们反映的是领域一般性的加工过程(如专家化假说)。
当时的文献格局是各家各持一个因素:强调刺激属性者以视网膜拓扑(retinotopy)与感受野特性的内在联系解释定位;强调计算约束者(如专家化假说)主张区域是执行细粒度辨别与整体加工的通用机器;强调先天连接者(如 Mahon 与 Caramazza 的领域特异功能说)则主张与语言、社会认知等网络的前在连接决定功能归属。缺少的是一个能把三类证据、多个类别领域(面孔/文字的对比尤其关键)放在同一框架下比较的综合,这正是本综述要补的缺口。
研究思路
作者的策略是"先立框架、再逐域取证、后逐一排他"。第一步,把定位问题拆成三个相互关联的问句:这个区域表征什么类别(what)、用什么计算方式表征(how)、表征出来做什么用(why)——三个因素分别对应刺激的视觉特征(如面孔总是被中央凹注视,故位于视野中央)、类别所要求的计算层级位置(面孔与文字需要整体性、不变形性的加工,落在层级后期)、以及类别所属的认知领域(面孔属社会认知、文字属语言),后者决定其与杏仁核、内侧前额叶、左侧语言区的特异性连接。
第二步,从 OTC 的功能组织结构出发论证三因素的"土壤":类别区不是孤立的功能孤峰(作者用了一个漂亮的比喻——不是平原上突兀的乞力马扎罗,而是"黄石公园式"复杂地貌中的众多山头之一),它与视网膜拓扑图、空间频率图、形状图等视觉特征图共存,且这些图在发育上先于类别选择性存在。第三步,用近年发育研究的密集证据(婴儿成像、新生婴猴剥夺、文盲纵向追踪、先天失明者、新类别训练)检验框架,并依次论证"仅靠刺激""仅靠计算""仅靠连接"分别解释不了什么,最后落到框架的预测与未决问题。
方法
作为综述,本文不产生新数据(图 1 用的是作者未发表的演示性 fMRI 数据,仅用于展示单个被试上类别选择性的强度),其"方法"在于证据的组织方式。文中综合的实证证据涵盖几类手段:其一,发育成像——对 4–6 月龄婴儿的 fMRI(面孔>场景的对比可见、面孔>物体不可见)与改为:『对出生不足 4 天新生儿的频率标记 EEG(正立与倒置面孔样点阵的响应不同,但正立与打碎点阵无差异)』;其二,剥夺实验——两只从出生起未见过面孔的猴子在 8–9 月龄时的 fMRI;其三,纵向追踪——文盲儿童识字前后的 fMRI(未来 VWFA 位点的类别选择性演变)以及 5 岁时结构连接对 8 岁 VWFA 位置的预测;其四,先天失明者研究——用类别相关声音(如面孔类别的笑声、吹口哨、咀嚼声)诱发 OTC 响应并比较其空间分布与明眼人看面孔时的分布;其五,训练研究——人与幼猴对新类别物体的学习训练。分析框架上,作者用"因素排他性检验"的论证方式:对每个候选因素,找出只有它能解释或它明显解释不了的证据组合,并借 Boxes 讨论特征编码争议、失明者视觉皮层表征什么、以及偏心度偏置这一最常被引用因素的案例史。
主要结果
-
OTC 的功能组织为三因素提供了先在的"地形"。类别选择性区域之间存在丰富连接与重叠拓扑,弱而弥散的类别选择性覆盖更广;区域按类别的上位关系成簇(如腹侧 OTC 中"有生命"的响应区比"无生命"的更靠外侧),即便峰值区域也表现出分级选择性而非只对偏好类别有响应。OTC 同时共存着视网膜拓扑、空间频率、形状等特征拓扑图,它们独立于类别而存在,类别选择性也不能还原为特征选择性,但两者有系统相关——删去『(图 1)』或改为不指图的表述,如『(正文综述证据,见 Box 1/Box 3)』。
-
发育证据显示类别选择性从"弱而泛"走向"强而专",且经验不可缺。4–6 月龄婴儿腹侧 OTC 有面孔>场景的分化响应,却没有面孔>物体的选择性;新生儿(<4 天)的频率标记 EEG 对正立面孔样点阵的响应高于倒置,但正立与打碎之间无差异——即只有针对"非常不同刺激"的非特异性偏好,可能与出生头几天/几月已存在的视觉特征图有关。关键的反面证据来自面孔剥夺猴子:从出生未见过面孔的猴子,其他类别(如手)的选择性和偏心度视网膜拓扑组织都正常,唯独面孔区不出现,事后接触面孔也救不回来;正常猴子的面孔选择性恰好落在偏好低偏心度刺激的皮层(图 2A–C)。
-
VWFA 是"连接先于功能"的范例。纵向 fMRI 显示,日后长成 VWFA 的左侧梭状回部位在识字前对多数测试类别并无明显选择性(仅有对工具的弱选择性与中央凹偏置),识字学年结束后该处出现清晰的词形选择性;文盲成人则没有 VWFA——选择性可以大幅延迟甚至不出现,取决于学习阅读的时机。更关键的是,5 岁时左梭状回到语言区的结构连接可以预测 8 岁识字后词形选择性体素的位置,说明超越视觉特征选择性的领域特异性连接已经在"预订"未来区域的位置(图 2D–E)。
-
先天失明者的选择性分布与明眼人相似但更弱。先天盲者用盲文阅读时激活的位置与明眼人的 VWFA 大致相同,人声的情绪表达激活典型 FFA 位置;用类别相关声音诱发时,盲者 OTC 中面孔/身体/物体/场景选择性的空间分布与明眼人相似——而这些被试没有视网膜拓扑激活(有人甚至没有视网膜、没有视网膜波),也不可能用中央凹注视面孔。这证明仅有领域特异功能的使用而无感觉经验,也足以产生至少部分性质的类别选择性,但其强度明显更弱(图 2F)。
-
训练研究把三个因素分离开来检验。新物体训练后分布式活动模式的改变依赖于物体的视觉特征;幼猴经 8 个月训练出现训练诱导的局灶选择性,且相同刺激在不同猴子上的位置有相似性;把面孔当作词形占位符来训练,选择性转移到左侧而非右侧梭状回;新物体成为地标时招募场景区、成为工具时招募工具区;对计算要求的实验操作也能改变类别响应的皮层分布。三者合观的结论是:任何单一因素都不充分——只讲刺激解释不了盲者与 VWFA 的弱前在选择性;只讲计算解释不了"专家化产生的选择性并不与面孔区完全重叠";只讲连接解释不了不同视觉特征的新类别在相同任务下产生不同空间分布,且盲者样本量小、效应量可能被高估(图 3 给出框架总图)。
图注解读
图 1 · 皮层表面上的类别选择性区域
原文图注:Figure 1. Category-Selective Areas on the Cortical Surface. To illustrate the strength of this selectivity up to the individual level, data are shown of a single representative subject, from an unpublished fMRI experiment viewing stimuli of several categories, contrasting the fMRI blood oxygen level dependent response to the target category against all other categories. Results are projected onto the inflated cortical surface. The top left and right depict lateral views of left and right hemisphere and the bottom depicts a ventral view. The white lines at the occipital pole indicate the position of primary visual cortex (V1) for reference.
读图要点:图为单名代表性被试的 fMRI 数据(观看多个类别的刺激,将目标类别 BOLD 响应对所有其他类别做对比),投影到展开的皮层表面:上左、上右分别为左、右半球外侧面观,下为底面观,枕极处的白线圈标出 V1 位置作参照。色标区域依次显示面孔、词形、场景、身体等类别的选择性热点。用单被试数据是刻意的——它要说明类别选择性可以强到个体水平,而不仅仅是组平均的统计现象。此图对应上文结果 1,也是全文讨论的对象总览。

图 2 · 类别选择性区域发育的近期发现
原文图注:Figure 2. Recent Findings on the Development of Category-Selective Areas. (A) A faces-scenes contrast shows typical face and scene selectivity [in fMRI percent signal change (PSC)] in ventral occipitotemporal cortex (OTC) in 6-month-old infants (left). However, voxels show no selectivity for the faces-objects contrast (right). Adapted from [21] . (B) Increase in electroencephalography (EEG) response to face templates at the repetition frequency as compared with inverted, but not scrambled face template stimuli, in newborns. Adapted from [19]. (C) Canonical face-selective patch areas fail to develop in faces-deprived monkeys relative to controls (left), while selectivity for other stimulus categories and its relationship to eccentricity bias is preserved (right). Adapted from [16]. (D) Top left: lack of word form selectivity before schooling (Session 2). Bottom left: clear selectivity at end of the school year (Session 6). Right: activation to image categories in a region of interest (ROI) defined by responses from sessions 6 and 7 (not depicted). Adapted from [18]. (E) Connectivity at age 5 predicts future location of word-form-selective voxels [in arbitrary units (AU)] after children become literate (at age 8). Adapted from [17]. (F) Maps of preferred category in ventral OTC are strongly correlated between sighted and congenitally blind participants based on, respectively, visual and auditory category stimuli. Adapted from [20].
读图要点:六个面板各承载一条证据链,(A) 婴儿 fMRI:左图"面孔对场景"的对比在 6 月龄腹侧 OTC 呈现典型的面孔/场景选择性(纵轴为 BOLD 信号变化百分比 PSC、按体素百分比分布),右图"面孔对物体"则无选择性——选择性的"半成品"状态;(B) 新生儿频率标记 EEG:在重复频率处,正立面孔模板的响应高于倒置模板,但与打碎模板无差异;(C) 面孔剥夺猴子:左图显示对照组有、剥夺组没有的面孔补丁,右图显示两组对其他类别(手、场景)的选择性及与偏心度偏置的关系都保留;(D) 识字纵向 fMRI:上学前(第 2 次 session)无词形选择性、学年结束(第 6 次)出现清晰选择性;(E) 5 岁时的连接(任意单位)预测 8 岁识字后词形选择性体素的位置;(F) 明眼人(视觉刺激)与先天盲者(听觉刺激)在腹侧 OTC 的偏好类别图谱强相关。此图是全文经验证据的浓缩,支撑上文结果 2、3、4。

图 3 · 类别选择性区域发育位置的三因素框架
原文图注:Figure 3. Framework on Where Category-Selective Areas Develop. (Left) Before experience-driven learning with categories such as faces and words, there are already several factors in place in occipitotemporal cortex (OTC) and in the brain at large. As an example, a large region within OTC (oval) is positioned at the high-level (oval has green outline) in the computational processing hierarchy with preceding regions (green circles) that are at the low- or mid-level, respectively; already consists of several topographic maps of stimulus features [pink gradient within oval, e.g., retinotopic map showing foveal (upper part) to peripheral bias (lower part)]; and has several domain-specific connections to other regions in the brain (orange circle and arrow, e.g., social cognition domain, blue circle and arrow, e.g., language domain). (Middle) Experience-driven learning takes place: for example, experience with faces and words. (Right) The already present factors in the large region within OTC (oval) constrain where such category-selective areas will emerge: FFA (fusiform face area, red circle) develops in the high-level part of the hierarchy within the visual system (given its processing requires holistic computations), where there is already selectivity for stimulus features related to faces such as a foveal bias, and where there are connections to the specific domain relevant for faces (social cognition). VWFA (visual word form area, dark blue circle) also develops in the high-level part of the hierarchy within the visual system (given its processing requires recognizing font-invariant letters and incorporating multiletter statistics), where there is already selectivity for stimulus features related to words such as a foveal bias, and where there are connections to the specific domain relevant for words (language).
读图要点:图为框架总图,左中右三联呈时间推进:左图"经验之前"——OTC 中的一大块区域(椭圆)已具备三个先在条件:处于视觉计算层级的高层级位置(绿描边、前方有低/中层的绿圆圈区域)、多张刺激特征拓扑图(椭圆内粉色渐变,示例为从中央凹到外周的视网膜拓扑偏置)、以及与脑其他区域的领域特异性连接(橙色为社交认知域、蓝色为语言域);中图为面孔与文字的经验驱动学习发生;右图为结果——FFA(红圈)与 VWFA(深蓝圈)各自落在"计算要求(整体加工/字体不变与多字母统计)+ 特征偏置(均为中央凹偏置)+ 领域连接(社交认知/语言)"三条约束的交集处。这张图把"what/how/why"三因素收束成一个可检验的定位模型,对应上文结果 5 的框架性结论。

讨论
作者的总体解释是:类别选择性的皮层位置由三个因素共同约束——与待表征类别相关的刺激特征(通常经特征拓扑图表达,如中央凹偏置)、类别所要求的计算类型在视觉层级中的位置(整体性、不变形性加工要求高层级)、以及类别所属认知功能域的特异连接——三者分别回答 what、how、why。在这一框架下,作者与多个立场对话:纯刺激论(含偏心度偏置说,见 Box 3)无法解释盲者结果与 VWFA 的弱前在选择性;纯计算论(专家化假说)可以重新表述为"专家化把表征推向层级后期的整体加工",其"争抢中央凹地盘"的预测有部分证据(识字者文字与面孔竞争中央凹皮层、专家物体的竞争),但产生的选择性并不与面孔区完全重叠,说明计算因素只解释了部分;纯连接论(先天连接决定论)则被盲者选择性更弱、样本量偏小、以及新类别视觉特征差异造成的空间分布差异所限制。作者还强调一个常被忽视的要点:拥有某类别的经验远不止"暴露"——文盲缺的不是词形暴露而是把词形与语音连接起来的领域特异使用,面孔剥夺猴缺的也同时是把面孔当社会刺激来用的经验,因此"单独的暴露是不够的"。作者坦承各因素的相对权重与相互作用尚不清楚,且不少关键结论(包括被广泛引用的偏心度偏置)其实建立在少量被试、未分离暴露与功能的实验之上;面孔域的连接证据也仍缺 VWFA 式的直接纵向数据。文末以 Outstanding Questions 列出检验清单:其他类别(身体、工具)是否也满足三因素、三因素是按时间先后还是迭代起作用、盲者中连接因素是否权重更大、OTC 可分辨的类别数量上限等。
一句话总结
这篇综述的说服力在于它不选边站,而是把"先天与经验"之争改写成"先天约束规定了经验的落点":特征图定 what、层级位置定 how、领域连接定 why,三者交集处才是功能区诞生的摇篮。以我的理解,它最大的价值是给"连接先于功能"这类强主张配上了清醒的注脚——包括偏心度偏置在内的许多"定论"其实都还缺一个干净的因素操纵实验,审慎的说法应是三因素的权重因类别领域而异、目前证据强弱不均。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[] - Fig2: 提取质量
good,对齐度full,识别面板[A, B, C, D] - Fig3: 提取质量
good,对齐度full,识别面板[]
关键事实与局限性声明
- 补充要点: Box 3 的偏心度偏置案例史(含 Pokémon 研究 [120] 的再解释与『从未有实验操纵偏心度改变选择性落点』的批评)在讨论中一笔带过,它是原文对'最常被引用的定位因素证据其实不完整'这一审慎论点的核心载体,可适当加重。
- 补充要点: 原文对'经验 ≠ 暴露'的论证(文盲缺的是词形-语音的功能联结而非暴露;面孔剥夺猴同时被剥夺了面孔的社会使用,[16] 的设计未分离暴露与功能)笔记在讨论中已提及但较简,这是作者反对纯刺激论的关键一步,可再强化。