← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 260 | 原始基线: V0_ZCODE_BASELINE | 语义审核: needs_revision | 图表审核: pass


Perceptual differentiation and category effects in normal object recognition: a PET study

Gerlach · Brain: A Journal of Neurology · 1999 · Zotero itemID=2346

这篇 PET 研究用"物体决策"任务(判断图片是真实物体还是非物体)来定位物体识别中"视觉形状与记忆匹配"这一前语义加工阶段的神经基础。作者把任务的知觉分化需求(易/难)与真实物体的类别(自然物/人造物)做成两个正交变量,结果发现难度效应集中在右侧颞下回后部至前部梭状回,而自然物只有在高分化需求下才比人造物慢。它为"类别特异性识别障碍可能只是放大了正常识别中本已存在的类别间加工差异"这一观点提供了成像证据,也是 Gerlach 后来一系列知觉分化研究的起点。

研究背景

神经心理学文献里反复出现一种双重分离:自然物(natural objects,即生物/活物一类)识别或命名受损的病人往往视觉知识也受损,而人造物(artefacts)识别受损的病人则常伴有功能/言语知识受损(Warrington 与 McCarthy、Shallice、Hart 与 Gordon、Gainotti 与 Silveri 等)。顺着这个观察,一种流行的解释是脑内存在两套语义系统——视觉语义系统负责自然物、功能/言语语义系统负责人造物。但这个说法至少与两组现象难以兼容:其一,有些病人的视觉与功能知识受损程度相当(Laiacona 等 1993;Caramazza 与 Shelton 1998);其二,不少自然物识别受损的病人在需要提取存储视觉知识的任务上表现完全正常(Sartori 与 Job 1988、Etcoff 等 1991、De Renzi 与 Lucchelli 1994、Arguin 等 1996),提示真正的损伤位点可能在语义之前的视觉加工水平。

本文关心的正是 Humphreys 等人提出的另一种解释。在他们的模型里,物体命名依次经过三个阶段:视觉信息先激活规定物体形状的结构表征(结构描述系统,structural description system),再扩散到语义系统,最后到语音表征;同一水平的多个表征可并行激活,且信息在各层间级联式传递。由于自然物类内成员的整体形状更相似、共享更多部件(Riddoch 与 Humphreys 1987b;Humphreys 等 1988),若多表征并行激活,结构描述系统内的竞争对自然物会更大——自然物更难分化,人造物反而占优。因此损伤发生在结构描述系统水平,就可能造成自然物的类别特异性障碍。行为证据已经不少:Lloyd-Jones 与 Humphreys (1997) 发现物体决策中对自然物反应更慢;Gaffan 与 Heywood (1993) 发现把图片只呈现 20 ms 时,正常人和受训猴子辨认活物的错误都更多;计算仿真也复现了这一劣势。缺口在于:此前的成像研究(Perani 等 1995;Martin 等 1996;Grabowski 等 1998)考察过类别效应,却没有直接回答效应发生在哪一层加工。本研究的目标因此有二:(i) 检验物体决策是否基于结构而非语义知识——若是,激活应出现在视觉加工区而非语义加工区;(ii) 在结构层面直接寻找类别效应的证据。

研究思路

作者用模式辨别任务(判断图形是横排还是竖排)作基线:它与物体决策任务在感觉加工和反应方式上匹配,却不需要访问存储的视觉知识,因此两者对比应当揭示物体识别相关的脑区。但这个对比有个漏洞——图片自动引发的语义或语音加工无法排除。于是加第二重操纵:物体决策任务中的非物体分两种,一种是完全陌生的新异非物体(novel non-objects,取自 Kroll 与 Potter 1984 的图集),只要认出物体的某个熟悉部件就能判"真";另一种是嵌合非物体(chimeric non-objects,取自 Lloyd-Jones 与 Humphreys 1997 的图集),由同类别真实物体的部件交换拼接而成,看起来"像个东西"却不是,必须完成 stimulus 与存储结构表征的完整匹配才能拒绝。据此,新异任务称为易任务、嵌合任务称为难任务。逻辑在于:无论难易,语义/语音的自动加工应当同样存在,任务间真正变化的只是结构水平上拒绝干扰刺激所需的知觉分化(perceptual differentiation)量,所以"难−易"之差就是对知觉分化的相对纯净的测量。类别维度(自然物 vs 人造物)与难度维度正交,且同一组真实物体刺激会在易、难两个任务中轮换出现,将“排除了”改为“降低了由特定刺激选择造成伪类别效应的可能性”。

方法

被试为 15 名右利手健康志愿者(7 女 8 男,22–30 岁,平均 26 岁)。PET 扫描用 GE Advance 扫描仪三维采集(35 层,层距 4.25 mm),每人接受 12 次静脉 H2^15O 团注(每次 200 MBq),扫描间隔 10–12 分钟;任务在示踪剂到达脑部约 75 s 前启动并持续到采集的头 30 s,以优化激活区的信噪比。结构像为 1.5 T MPRAGE。图像用 SPM96 处理:逐体素刚性配准、与个体 MRI 配准后归一到 Talairach 空间、16 mm 高斯平滑、全局血流按比例归一化到 50;统计阈值在体素水平 P<0.05(经多重比较校正,Z>4.5)。

进入分析的任务共五个:模式辨别(35 横 + 35 竖图形)和四个物体决策任务(各 70 幅黑白线条图,真实物体与非物体各 35,呈现在白背景上,视角 3–5°,每图 180 ms、刺激间隔 1320 ms,任务历时 105 s)。真实物体线条图主要取自 Snodgrass 与 Vanderwart (1980) 标准图集,选了 10 组(自然物、人造物各 5 组,每组 16 个),在视觉复杂性、熟悉度、图像一致性三个常模维度上匹配(Kruskal-Wallis 检验 P>0.1)。每个任务分两块呈现:第一块 19 个真实物体加 31 个非物体,第二块 16 个真实物体加 4 个非物体,改为:行为分析只纳入第二块真实物体;第二块覆盖示踪剂摄取期,因此作者认为PET信号应主要反映真实物体加工。行为上,对第二块真实物体的正确反应时做任务类型(易/难)× 类别(自然物/人造物)的 2×2 方差分析;PET 上,先把每个物体决策任务与模式辨别任务对比,再做联结分析(conjunction analysis,Price 与 Friston 1997)找出四个任务共同的激活,随后对"难 vs 易"做主效应和按类别的简单效应分析。

主要结果

  1. 行为上,物体决策的反应时呈现清晰的难度 × 类别模式:任务类型主效应 F(1,15)=48.6,P<0.001(嵌合非物体任务更慢);类别主效应 F(1,15)=8.1,P<0.02(人造物更快);交互 F(1,15)=15.8,P<0.001(类别差在难任务中更大)。四个任务错误率无差异(1.3–2.2%,Friedman P>0.1),排除速度-准确率权衡。均值反应时:新异-自然 556 ms、新异-人造 564 ms、嵌合-自然 667 ms、嵌合-人造 581 ms(Table 1)。事后检验表明自然物慢于人造物只出现在嵌合(难)任务中;自然物在难任务比易任务慢,而人造物对任务类型不敏感。
  2. 四个物体决策任务相对模式辨别基线的共同激活是双侧腹侧枕颞区的广泛网络——双侧枕下回、枕中回、梭状回、颞下回、海马旁回、边缘叶,外加右下额回——其中右梭状回两处峰值 Z 最高达 9.16 与 8.49(Fig 3,Table 2)。关键的是,被认为参与语义加工的左侧颞下回前部和左颞中回并未激活。
  3. 任务难度主效应:难度增加使右侧颞下回极后部(并延及右梭状回前部)的区域性脑血流显著上升,峰值位于 Talairach 坐标 x=54, y=−62, z=−12,Z=5.23,簇水平 P=0.006(Fig 4)。作者将其解释为"视觉形状与记忆匹配"(即结构描述系统)的神经相关,其激活量对应识别所需的知觉分化程度。
  4. 按类别分解难度效应(简单效应):只有自然物的"难 vs 易"对比在簇水平显著(P=0.028,峰值仅勉强达到 P<0.08 校正),激活中心在右颞下回极后部 (52, −62, −14,Z=4.33,661 体素),还包含左颞下回后部的次峰 (−44, −64, −14,Z=4.14),并延伸到右梭状回前部;人造物的对比则只有右颞下回一处 (56, −54, −20,Z=3.73,166 体素)。自然物的激活范围约为人造物的四倍,且是双侧的(Fig 5)。

图注解读

图 1 · 模式辨别基线任务的刺激材料

原文图注:Fig. 1 The patterns displayed in the pattern discrimination task.

这张图展示了基线任务用的黑白模式图形:被试看到图形后判断其为"竖排"或"横排"并按对应键作答。该任务与物体决策任务匹配了感觉加工和按键反应方式,但不需访问存储的视觉知识,因此是全部 PET 对比的参照点;它也是理解实验设计逻辑的第一块拼图。

Figure 1

图 2 · 四个物体决策任务的刺激示例

原文图注:Fig. 2 Examples of the stimuli displayed in the four object decision tasks. (A) Novel non-objects + natural objects; (B) novel non-objects + artefacts; (C) chimeric non-objects + natural objects; and (D) chimeric non-objects + artefacts.

四个面板对应 2×2 设计:A、B 是"易"任务(新异非物体分别配自然物、人造物),C、D 是"难"任务(嵌合非物体分别配自然物、人造物)。读图重点在非物体的构成:新异非物体与真实物体无部件对应关系,而嵌合非物体由同类别真实物体的部件交换拼成,"像真非真",迫使被试完成完整的形状-记忆匹配才能正确拒绝。这张图直观说明了"难"的来源,支撑主要结果第 1 条的行为模式。

Figure 2

图 3 · 物体决策相对基线的共同激活网络

原文图注:Fig. 3 A rendering showing the activated areas common for the four object decision tasks relative to the pattern discrimination task. The activated areas are projected onto a template anatomical MRI scan in co-registration with the Talairach atlas. All areas shown were significant at P < 0.05, corrected for multiple comparisons (Z > 4.5). (A) The left side of the brain showing activation of the middle occipital gyrus, the inferior occipital gyrus and the inferior temporal gyrus. (B) The ventral part of the brain showing activation of the inferior occipital gyri, the fusiform gyri, the inferior temporal gyri, the parahippocampal gyri and the limbic lobes. (C) The right side of the brain showing activation of the inferior occipital gyrus, the middle occipital gyrus, the inferior temporal gyru……(原文如此,图注至此截断)

这是联结分析后的表面渲染图,分左侧面(A)、腹面(B)、右侧面(C)三个视角。读法是把激活色块对照 Table 2 的峰值坐标:双侧腹侧通路(枕下回、梭状回、颞下回、海马旁回、边缘叶)全面激活,另有右下额回;右梭状回两处峰值 Z=9.16、8.49 最高。值得注意的"负性"信息:左侧颞中回/颞下回前部——既往成像与损伤研究都指为语义加工区——并未出现,支撑主要结果第 2 条及"物体决策不依赖语义知识"的论点。

Figure 3

图 4 · 任务难度的主效应区

原文图注:Fig. 4 Four horizontal sections showing the area associated with the main effect of increased task difficulty. The activated area is superimposed on the average image of the stereotactically normalized anatomical MRI scans for each subject. The SPM{Z} was thresholded at a level of P < 0.001, uncorrected (Z > 3.09). In each slice the left cerebral hemisphere is displayed to the left. The peak activation was located at x = 54, y = −62, z = −12, Z = 5.23, in Talairach space. The cluster shown was significant at P = 0.006.

四张轴位切片显示"难 vs 易"的主效应:一个位于右侧颞下回极后部、延及右梭状回前部的激活簇(每张切片左半球显示在图的左侧,读图时勿左右混淆)。显示阈值 P<0.001 未校正(Z>3.09),但该簇在校正水平上显著(P=0.006)。这正是论文的核心证据:知觉分化需求越高,该区域血流越大,支撑主要结果第 3 条。

Figure 4

图 5 · 难度效应按类别分解(简单效应对比)

原文图注:Fig. 5 Four horizontal sections showing the areas associated with the simple main effect of increased task difficulty for natural objects (blue) and the simple main effect of increased task difficulty for artefacts (yellow). The activated areas are superimposed on the average image of the stereotactically normalized anatomical MRI scans for each subject. The SPM{Z} was thresholded at a level of P < 0.001, uncorrected (Z > 3.09). In each slice, the left cerebral hemisphere is displayed to the left. The largest peak activation associated with natural objects was located at x = 52, y = −62, z = −14, Z = 4.33 in Talairach space and the activated area covered 661 voxels. The second peak activation was located at x = −44, y = −64, z = −14, Z = 4.14 in Talairach space. The peak activation associate……(原文如此,图注至此截断)

蓝色为自然物的"难 vs 易"简单效应,黄色为人造物的同类对比。读图重点是比较两个色块的体量与范围:自然物的激活簇 661 个体素,跨越双侧颞下回后部(次峰在左半球 −44, −64, −14)并延及右梭状回前部;人造物仅 166 个体素,限于右颞下回,前者约为后者的四倍。这张图把行为数据里"只有自然物受难度影响"的交互,以"激活范围更大、波及区域更多"的形式在 PET 数据里呈现出来,支撑主要结果第 4 条。

Figure 5

讨论

作者的总体解读是:物体决策主要依靠结构的、前语义的视觉知识而非语义知识——共同激活落在腹侧视觉通路而非语义区,难度效应又集中在右侧颞下回后部与前部梭状回,这一部位与 Schacter 等 (1995) 让被试判断三维几何图形"能否在三维世界存在"的 PET 激活高度相似,而那个任务的刺激几乎不可能联系到语义知识,故该处激活应属前语义视觉加工。右下额回则被解释为参与存储视觉知识的提取,依据是右背外侧前额叶与视觉/空间知识提取有关(Kosslyn 1994)。行为与 PET 数据的不一致(行为上只有自然物受难度影响,PET 上两类都受)被解释为:自然物难度增加时激活了两个区域而非一个,单看哪一个都不足以撑起统计交互。最有趣的一笔是与"梭状回面孔区"的对话:Kanwisher 等 (1997) 与 McCarthy 等 (1997) 提出外侧梭状回被面孔特异性激活,而本研究难度效应的落点与之非常接近,作者据此提出,面孔知觉中看到的梭状回激活可能部分只是反映了面孔间更高的知觉分化需求,而非面孔特异加工本身(并援引 Chao 等 1998 的类似发现)。作者也承认局限:简单效应只在簇水平显著且需降低阈值;PET 数据中未发现任务类型 × 类别交互,可能与统计功效不足有关——不过把阈值降到 P<0.05 未校正仍无交互迹象,作者认为这个可能性不大。

在与损伤数据的对接上,作者指出至少三个病例(Etcoff 等 1991;De Renzi 与 Lucchelli 1994;Arguin 等 1996)的损伤位于右颞下回后部/梭状回前部,且障碍表现为前语义水平,与本文预测吻合;也有左半球单侧损伤导致自然物障碍的报道(Sheridan 与 Humphreys 1993),但那些更像命名而非识别问题。至于与其他成像研究的对比,Martin 等 (1996) 发现命名动物相对工具激活左距状沟,Perani 等 (1995) 发现活物概念判断激活左舌回/梭状回——方向与本研究的右侧效应相反,作者认为前者解释含混、后者任务偏概念性且是在降低阈值后才出现的,可靠性存疑。结论是:物体决策主要反映知觉分化,这一阶段独立于语义加工;类别效应可以起源于识别的结构水平,神经系统损伤可能只是放大了正常识别中已经存在的类别间加工差异。

一句话总结

在我看来,这篇文章的巧思在于把"难度"和"类别"拆成两个正交操纵,用非物体的拼装方式精确控制知觉分化的量——"自然物的劣势只在难任务出现"这一行为模式,加上改为:结果与类别差异可在前语义结构加工阶段产生的假说一致,但不能排除语义加工参与,也未在PET中得到显著的类别×难度交互。另外它其实提前给"梭状回面孔区是面孔专属"的说法泼了冷水:难度效应落点与 FFA 重叠,改为:作者提出一种待检验的替代解释,即邻近梭状回的面孔效应可能部分受知觉分化需求影响;本文本身不能证明该区域编码通用分化负荷。删除或另行引用“后来被反复引用”的历史评价。


审校与证据追溯 (Verification & Evidence)

图表审计结果

关键事实与局限性声明