IT Literature Intelligence 终审版本 (VERIFIED) 论文编号:
221| 原始基线:V0_ZCODE_BASELINE| 语义审核:pass| 图表审核:pass
Object representations in the temporal cortex of monkeys and humans as revealed by functional magnetic resonance imaging
Bell · Journal of Neurophysiology · 2009 · Zotero itemID=2084
这篇文章用同一套 fMRI 范式平行扫描猴子与人类,把当时关于下颞皮层组织原则的三类假说——动物性二分、语义类别模块、视觉特征映射——放进同一个比较框架里检验。它的一手贡献是在猴身上首次用成像手段证实了"动物 vs 非动物"的皮层分离,并发现类别模块之间的相邻关系遵循语义亲缘(面孔挨着身体部位、物体挨着场景),且类别模块内部还有对具体样例图像的选择性簇。对想理解"腹侧流到底按什么结构组织"的读者,这篇是跨物种对照的经典坐标点。
研究背景
下颞皮层(inferior temporal, IT cortex)长期被认为是复杂物体知觉与辨认的核心脑区,但"单个物体的表征在其中如何组织"始终争论不休。行为研究给了一个关键线索:人对刺激做类别判断(这是脸还是车)比说出其具体身份(我的邻居还是同事)容易得多(Grill-Spector and Kanwisher 2005 等各项研究),提示物体识别在"被完全辨认"之前要经过多级分类,皮层结构可能反映了这一点。围绕 IT 的组织方式,当时并行存在三种假说。第一种主张 IT 按"动物性"(animacy)划分——支持证据来自活物与非活物选择性识别障碍的神经心理病例(Warrington 和 Shallice 1984 等)、人类的成像研究,以及 Kiani 等(2007)记录猴 IT 神经元群体的系统研究。第二种主张 IT 内有针对单个语义类别的专区模块,面孔区(梭状回面孔区)、身体部位区、场景区在过去十余年被逐一报告,损伤这些区域也造成类别特异的症状(面容失认症、地形失定向);但猴的此类证据当时还很零散。第三种来自电生理与光学成像传统(Fujita、Tanaka 等),主张 IT 是视觉特征的精细柱状映射,一个物体由不同特征柱的激活组合来表征。难点在于:支持这三种假说的证据来自不同物种、不同技术,没法直接对撞——这正是本文要解决的比较学缺口。
研究思路
作者的策略是"同法跨种、由粗到细、逐层递进"。第一步,在猴与人同步使用分类分块刺激设计,用 4 个类别(面孔、身体部位、物体、场景)的成对对比构造一个"动物 vs 非动物"的统计图,检验第一假说;第二步,用合取分析(conjunction analysis)让每个类别与其他三个类别对抗,提取出对该类别最具特异性的体素,看能否把动物性区块进一步拆成单类别模块;第三步,对每个类别选择区做相对选择性分析,定量刻画它们对非偏好类别的"调谐",从反应分布角度检验各模块彼此隔离还是重叠;最后一步回到视觉特征假说——如果类别区内只是按语义归类,那么同一类别的两个视觉上截然不同的样例应引起区内一致的反应,反之若存在特征编码,区内不同体素会偏好不同样例。他们在猴身上以单幅样例图像的分块呈现直接检验这一点。整个设计一气呵成:宏观分层(动物性)→ 中观划分(语义类别)→ 微观编码(特征列),任何一层发现都能对话相应的文献脉络。
方法
猴实验用 4 只雄性恒河猴(E、J、R、S),植入 MR 兼容头部固定装置,训练其在中央注视点周围 2° 窗口内维持注视(每轮要求至少 85% 时间注视合格,实际平均约 95%,眼动以 120 Hz 的瞳孔反射系统监控)。刺激分动物(猴面孔、猴身体部位)与非动物(物体、场景,均取自猴的周围环境)两大类,每类 48 张强度匹配的灰度图,以 32 秒的分块呈现(每块 16 张、每张 2 秒),图像最大边 22°,叠加在随机灰点背景上共 40°;每轮 6 分钟、含倒置面孔与倒置场景等条件,每猴每场 18–32 轮。扫描在 3T(Siemens Allegra 或 TimTrio)进行,等向 1.25 毫米体素;为了提高对比噪声比,每次扫描前注射铁基对比剂 MION(mono-crystalline iron nanoparticle,测脑血容量信号,而非人类的 BOLD 血氧信号)。人类实验 9 名被试(平均 25 岁,4 名女性),看人类面孔、身体部位、物体、场景(每类 32 张、16 秒分块、每图 1 秒间隔 1 秒空白),同时执行一个与实验无关的注视点颜色变化的中央任务以保持注意力(未记录眼位),数据经 Talairach 配准后在 3.5×3.5×5.0 毫米体素上采集,最终按群体组合分析(基于成组数据集)。定义类别选择性体素用合取映射:如"面孔 vs 物体 ∧ 面孔 vs 场景 ∧ 面孔 vs 身体部位",猴数据每个对比先阈限到 P=0.36 使三项合取后约 P=0.05,并用"任一条件 vs 随机点"掩膜控制低水平视觉特征混杂。定量分析基于感兴趣区(region of interest, ROI):以组内信号峰值体素为种子、取 7–8 毫米(猴)或 10–15 毫米(人)半径的球面掩膜,并归一化 ROI 体积以避免不同大小区域带来的分析偏差;区间的可分性用受试者工作特征曲线(receiver-operating characteristic, ROC)下的面积度量,1.0 表示两类反应分布完全可分,0.5 即猜测水平。
主要结果
- 两物种均有清晰的"动物 vs 非动物"分离,且拓扑方位一致。 猴 IT 内偏好动物刺激(面孔+身体部位)的体素沿上颞沟(superior temporal sulcus, sts)下岸分布成前后两团,分别位于 TE 区前部与 TEO 区附近;非动物偏好体素则在 sts 其他部分与 IT 腹侧面、向枕颞沟伸展。人类中动物偏好沿梭状回,更大偏背外侧;非动物偏好集中在海马旁回附近,更偏腹内侧(图 1)。
- 动物性区块可进一步拆出单类别模块,且模块相邻关系遵循语义亲缘。 猴的面孔区位于 TE 前部与 TEO 附近(双侧),身体部位区紧邻面孔区;物体区遍布 sts 与 IT 脑回;场景区见于 sts 前部、IT 腹侧面,且 4 只猴中 3 只在海马旁回也有场景区。人类中面孔与身体部位区沿梭状回相邻分布,场景区与物体区在海马旁回附近相邻、场景更靠内侧(图 2)。
- 相邻类别的对比收紧选择性:跨大类对比得出大区域,同类对比得出小区域。 四个面孔区用不同对比重定义时,"面孔 vs 场景"始终给出最大的 ROI,"面孔 vs 身体部位"最小;把 4 只猴的面孔区汇总同样如此,猴场景区也有类似但更弱的趋势;初始 16 个面孔 ROI 在叠加所有对比后只剩 9 个;人类被试同样出现此趋势但较弱(图 3);ROC 分析呼应此点——面孔区对场景的反应分布最可分、对身体部位最不可分,洼场景区与物体区、身体部位区各自呈现对称的模式,面孔成为 IT 反应中最易与其他类别区分的一类;人类被试的"类别调谐"看着比猴更尖锐(图 4、5)。
- 类别区内部存在对具体样例的选择性,且偏好相同的体素聚集成簇。 在猴 J 与 R 上以单图分块重复呈现同类别两个视觉差异大的样例,发现多个体素显著偏好其中之一,且偏好相同的体素在皮层平面上相邻聚集——表明类别区内部还有基于视觉特征(或伴随视网膜位置差异)的拓扑组织;奇偶轮次的数据分别分析后,显著体素的空间分布高度可复现(图 6)。
- 前、后面孔区功能不同:前部 TE 面孔区调谐更尖锐、对面孔倒置更敏感。 以选择性指数(SI)度量,前部 TE 的面孔区比 TEO 附近的后部面孔区更"挑剔"(Wilcoxon 符号秩检验,P<0.05);面孔倒置效应出现在 6 个受测面孔区中的 4 个,且前部面孔区平均降幅约 0.60% 信号变化(较最大响应下降 22%),后部约 0.22%(下降 11%,样本太小未作统计检验);只有 1 个面孔区对倒置场景有效应,而所有场景区对两类倒置刺激均无显著效应(图 7)。
图注解读
图 1 · 动物性与非动物性表征在两物种脑中的拓扑分布
原文图注:FIG. 1. Representation of animate vs. inanimate stimuli in the brain. Inflated views of 3 monkey subjects (E, J, and R) as well as the grouped human dataset showing the regions of the temporal lobe selective for animate vs. inanimate stimuli. The color bar shows the statistical value of the contrast between faces and body parts vs. objects and places. Regions outside the temporal lobes have been omitted. As, arcuate sulcus; cs, central sulcus; fg, fusiform gyrus; ios, inferior occipital sulcus; ips, intraparietal sulcus; las, lateral sulcus; ls, lunate sulcus; ots, occipitotemporal sulcus; phg, parahippocampal gyrus; ps, principal sulcus; sts, superior temporal sulcus.
此图把"动物 vs 非动物"的对比统计值涂在充气皮层表面上,猴三只(E、J、R)逐只显示,人类为合并数据。读图关键在于方位对比:无论哪个个体,动物偏好(面孔+身体部位 > 物体+场景)的区域都分布在偏背外侧(猴沿 sts 下岸的两团)而非动物偏好的区域都在偏腹内侧(猴沿 sts 其他部分与 IT 腹面延伸至 ots,人集中在海马旁回附近)。图下方缩写给出沟回定位(fg 梭状回、phg 海马旁回、sts 上颞沟等)。这张图支撑结果第 1 条——物种间不仅都有此分离,连"动物偏背外、非动物偏腹内"的相对方位都一致,是跨物种比较最有力的部分。
图 2 · 四个类别的选择性区域全景
原文图注:FIG. 2. Category-selective regions in monkeys and humans. Inflated views of monkeys E and J as well as the grouped human dataset. Voxels are colored according to their preference for 1 of the 4 categories tested. Regions outside the temporal lobes have been omitted. (Note: 原文图注前段为 "Inflated views of monkeys E and J as well as the grouped human dataset showing category-selective regions throughout the brain.")
四个类别各赋一色,把合取分析选出的选择性体素铺在膨胀皮层上(猴 E、J 与人类群体数据)。读法是纵览两组物种的颜色带:猴的面孔色块出现在 TE 前部与 TEO 附近,身体部位色块紧贴其旁,物体色块散布于 sts 与 IT 脑回,场景色块贴在物体色块边上;人类数据里,面孔与身体部位色块沿梭状回呈相邻分布,场景色块比物体色块更靠内侧(海马旁回附近)。此图支撑结果第 2 条:类别模块真实存在,而且"面孔—身体部位相邻、物体—场景相邻"的语义拓扑是跨物种的规律。
图 3 · 用不同对比定义区域时的规模变化
原文图注:FIG. 3. Topographical analysis of category-selective regions in monkeys and humans. A: the size (in number of voxels) of the 4 face-selective regions identified in monkey E, as a function of the contrast used to define them. In all cases, the faces vs. places contrast (represented by the blue bars) produced the largest face-selective regions, and the faces vs. body-parts contrast (represented by the yellow bars) produced the smallest. B: the same trend emerged when the data were combined from all face-selective regions from all 4 monkeys. C: the same analysis was done on the place-selective regions, revealing a similar but weaker trend. D: results of the same analysis for face-selective regions identified in the individual human subjects. Statistical comparisons were done using paired Wilcoxon rank sum tests (, P < 0.05; *, P < 0.01, SE indicated by the error bars). TE,: voxels within anterior area TE; TEO, voxels near area TEO.
柱状图:横轴为不同的定义对比(faces vs places、faces vs objects、faces vs body parts 等),纵轴为 ROI 的体素数。A(猴 E 的 4 个面孔区单独):蓝色柱(对场景)最高、黄色柱(对身体部位)最低,四个区域无一例外。B(四只猴合并)、建议修改为:“C(猴场景区)呈现与面孔区对称的格局:‘场景 vs 面孔’时保留区域最大,‘场景 vs 物体’时最小。”、D(人类个体数据)重复刻画同一格局。这组柱形图把"对比选择如何吞掉体素"翻译成可见的数字:跨大类对比(面孔 vs 场景)保留大量体素,而到语义相近类别(面孔 vs 身体部位)就只剩一小撮——语义结构的痕迹,支撑结果第 3 条的前半部分。
图 4 · 猴类别区的相对选择性与 ROC 分析
原文图注:FIG. 4. Relative selectivity of category-selective regions to their nonpreferred categories, in monkeys. A–D: normalized responses to the 4 categories within representative category-selective regions of interest (ROIs) for monkey E. E–H: corresponding receiver-operating characteristic (ROC) curves for the category-selective ROIs shown in A–D. An area under the curve of 1.0 indicates that the response distributions for the 2 categories are completely dissociable. A value of 0.5 (diagonal line) indicates that they are overlapping, and thus the ability to assign a given response to the correct category would be at chance (50%). Inset values indicate area under the ROC curve for the given contrast. I–L: average area under the ROC curves for all category-selective regions identified in the 4 monkeys. Statistical comparisons between pairs of contrasted categories for the population performed using paired Wilcoxon rank sum tests (, P < 0.05, *, P < 0.01, SE indicated by the error bars). - - -, the 0.50 (i.e., chance) level.
上排(A–D)是猴 E 代表性 ROI 对四类刺激的归一化反应柱图,下排(E–H)是对应的 ROC 曲线,I–L 汇总四猴全部 ROI 的 ROC 平均面积。读图要点有三:ROC 曲线离对角线越远、曲线下面积越接近 1,两类刺激的反应分布越可分;内插数字即各对比的曲线下面积。结合看可以发现面对面孔区里"面孔 vs 场景"的面积最大、"面孔 vs 身体部位"最小;场景区对面孔最可分、对物体最不可分;物体区反之;身体部位区对物体最不可分。这系列不对称性支撑结果第 3 条:类别区不是"全或无"的开关,而是对语义亲缘类别保留调谐——面孔反应是最能与其他类别分开的信号。
图 5 · 人类类别区的相对选择性(与猴对照)
原文图注:FIG. 5. Relative selectivity of category-selective regions to their nonpre ferred categories, in humans. A–D: normalized responses to the 4 categories within all category-selective ROIs identified in the ventral temporal cortex, averaged across all 9 human subjects. E–H: corresponding ROC curves for response distributions summarized in A–D. An area under the curve of 1.0 indicates that the response distributions for the 2 categories are completely dissociable. A value of 0.5 (diagonal line) indicates that they are overlapping, and thus the ability to assign a given response to the correct category would be at chance (50%). Inset values indicate area under the ROC curve for the given contrast.
与图 4 同构,主体换为 9 名人类被试合并数据(腹侧颞叶所有类别 ROI)。定性读法与图 4 相同,但对比是猴—人的定性差异:人类 ROI 对非偏好类别的反应明显更弱,三类非偏好反应彼此几乎一样平——即人类的"类别调谐"看起来更尖锐、更趋于纯化。作者在讨论中把此差异谨慎归因于方法学(MION 血容量信号 vs BOLD 信号、猴体素更小、猴按单个体分析而人按群体合并),并未断言物种差异。此图支撑结果第 3 条的物种对照部分。
图 6 · 类别区内部对同类别不同样例的体素偏好
原文图注:FIG. 6. Stimulus specificity within cate gory-selective regions in the monkey. Flat tened cortical surfaces of the left temporal lobe of monkeys J and R. The colored regions represent the individual category-selective regions identified in the previous experi ment. The color depicts each voxel's prefer ence for 2 different exemplars from the same category. Color bars indicate the P value for the regression analysis contrasting the 2 exem plars shown on the right. Insets: the ap proximate area sampled in the flat tened surfaces (main panels).
猴 J 与 R 左颞叶的平铺皮层表面图。先叠上此前实验定义的四类类别区(彩色底),再对区内每个体素做回归分析,比较与其类别同属但视觉差异明显的两个样例(图右示例)诱发的反应,颜色表示该对比的 P 值/偏好方向。读取时注意:如果类别区只编码类别成员,同一类的两个样例反应应无差异;实际图上多处出现对样例 1 或样例 2 有显著偏好的体素群,且同偏好的体素相邻聚集。奇偶轮次分离后的复测高度一致(正文并引补充图 S5/S6)。此图支撑结果第 4 条:语义类别模块内部仍有特征层次的并行组织,三种假说的证据在同一数据里同时成立。
图 7 · 面孔区的选择性指数与倒置效应
原文图注:FIG. 7. Face-selective regions in monkey IT cortex. A: inflated cortical surfaces of monkey E, colored according to the relative selectivity of individual voxels for their preferred ver sus nonpreferred categories. The selectivity index (SI) was calcu lated using the following formula: SI = [Rp − 1/3(Rnp1 + Rnp2 + Rnp3)]/[Rp + 1/3(Rnp1 + Rnp2 + Rnp3)], where Rp is the response to the preferred category and Rnp1-3 are the responses to the other 3 categories. All responses were first normalized to the lowest value to avoid confounds with negative signal intensities. Greater indices indicate voxels that show a larger difference in response magnitude between their preferred cate gory and the average of the responses to the three remaining categories (i.e., "more selective"). Face-selective regions (see Fig. 2) are indicated by the red outlines. B: average selectivity indices for the face-selective regions in near areas TE and TEO for all 4 monkeys. C: inversion effect for face (red bars) and place (blue bars) stimuli in face-selective regions in area TE and near area TEO. Significance not assessed due to inadequate sample size (n = 5).
(注:公式符号在 PDF 提取文本中乱码,此处按其数学含义复原。)A 面板以选择性指数染色的猴 E 双半球膨胀图,红圈圈出面孔区;SI 度量每个体素偏好类别响应与三个非偏好类别平均响应的差异幅度,值越大越"挑剔"。B 汇总 4 只猴:前部 TE 面孔区的平均 SI 显著高于 TEO 附近的后部面孔区(P<0.05),把"沿腹侧通路越往前选择性越锐"的单细胞层规律搬到了成像层面。C 面板给倒置效应:红色为面孔倒置效应幅度,前部 TE 约 0.60%(较最大响应下降约 22%),TEO 附近约 0.22%(约 11%);蓝色为场景倒置效应,几乎为零,说明倒置效应并非任意类别的普遍属性而是面孔区的类别特异性——此图支撑结果第 5 条。
讨论
作者把三个假说的证据同时收进来,主张 IT 皮层的物体表征是"多层级的(multiple hierarchical tiers)":顶层是动物性二分,中间层是语义类别模块,模块内还叠着对视觉特征(乃至视网膜位置)的细粒度映射。对动物性二分,他们强调这是猴成像的最新证据,与 Kiani 等(2007)的电生理结论互相成就,并从功能角度推测这样组织的好处是能迅速把周围刺激归入"是否关乎他者意图"——面孔表情与身体动作这类线索更适合快速分类处理。对类别模块,作者认为其拓扑证据支持语义组织,同时用"语义相关刺激往往共享视觉特征"(Rosch and Mervis 1975)来调和.category 区与特征柱的矛盾——面孔是最形态定型的类别,所以其区域最离散稳定;物体与身体部位外观变化大,所以区域更大、跨被试位置多变、调谐更宽:语义分区可能就是特征统计聚类的投影。前、后面孔区的分工被摆上台面:结合损毁文献(前部 IT 损毁偏识别缺陷、后部偏知觉缺陷,如 Iwai 和 Mishkin 1969;Merigan 和 Saunders 2004),作者猜测后部面孔区适合"脸 vs 非脸"的判别,前部 TE 面孔区偏向个体面孔的识别——只是明确声明此设想仍需生理与损毁实验直接检验。倒置效应方面,作者指出人类文献本身矛盾重重(部分实验室发现倒置面孔反应下降,部分无变化),本猴数据支持"有效应"的一方且显示其对类别的特异性。作者承认的局限主要在物种比较层面:猴用 MION(血容量)而人用 BOLD(血氧)、体素大小不同、猴单个体而人群体数据,所以"人类调谐更锐"无法坐实为物种差异;另声明更多类别的适用范围(动物/非动物二分之外的其他活物与非活物刺激)还要补测才能下强结论;IT 内部较弱的视网膜拓扑组织(Ito 等 1995)也提示样例特异性不至于全是低水平因素的驱动,但未完全排除。
一句话总结
这篇的价值是"对表"式的:同一范式同时扫猴和人类,把"动物性分区、类别模块、特征柱"三套互相竞争的叙事叠成一个分层图景——大框架二分、中层模块、底层特征簇。我觉得它最有意思的其实不是又一个面孔区,而是"面孔挨身体部位、物体挨场景"这种语义拓扑在猴脑里复现:它暗示腹侧流的分区可能不是红了眼的领域特化,而是视觉特征统计与语义经验长期互相塑造后的投影;不过从 MION、体素大小这些技术差异看,猴与人的调谐差异到今天也还是不能完全定论。
审校与证据追溯 (Verification & Evidence)
图表审计结果
- Fig1: 提取质量
good,对齐度full,识别面板[E] - Fig2: 提取质量
good,对齐度full,识别面板[E] - Fig3: 提取质量
good,对齐度full,识别面板[A, B, C, D, E] - Fig4: 提取质量
good,对齐度full,识别面板[A, D, E] - Fig5: 提取质量
good,对齐度full,识别面板[A, D] - Fig6: 提取质量
good,对齐度full,识别面板[] - Fig7: 提取质量
good,对齐度full,识别面板[A, E]