← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 245 | 原始基线: V0_ZCODE_BASELINE | 语义审核: needs_revision | 图表审核: pass


Recognition of Objects in Non-Canonical Views: A Functional MRI Study

Terhune · Journal of Neuro-Ophthalmology · 2005 · Zotero itemID=2260

这项研究用组块式(boxcar)fMRI 比较了正常被试识别"非惯常视角"(non-canonical,如明显透视缩短的罕见朝向)与"惯常视角"(canonical)物体照片时的脑活动,发现右侧角回、左侧下颞回和右侧小脑在非惯常视角条件下显著更活跃。它值得一读,是因为"非惯常视角识别是否动用了独立于常规物体识别的通路"在当时只有临床损伤证据和少量 PET 结果,本文用真实照片(而非线条画或计算机图形)给出了正常人脑的功能成像对应证据。

研究背景

物体在自然环境中朝向各异,但由于自身形状、重力和观察者位置的限制,人们通常只在有限的几个朝向里见到它们——这些标准朝向称为惯常视角(canonical),罕见朝向(通常是透视缩短的视角)称为非惯常视角(non-canonical)。已有行为与临床证据表明这两条加工路线可能不同:健康被试加工、识别非惯常朝向的物体比惯常朝向更慢;右半球后部损伤的病人在识别非惯常朝向的常见物体时表现出困难,而 size 和位置相当、仅左右不同的后部病灶之间可以直接对比;阿尔茨海默病患者在这个任务上也更吃力。这些发现提示非惯常朝向加工使用的通路要么独立于、要么附加于传统物体识别通路,但这条"分离通路"的确切性质当时并不清楚。认知理论层面则有多种候选解释:Marr 的三维模型认为物体按几何与体积存储、主轴被遮挡时非惯常知觉更难,但后续证据表明对称轴与伸长轴的作用相对次要;Warrington 与 James 提出基于"独特特征"(distinctive features,即物体轮廓的独特性质及其空间关系)的模型,物体旋转偏离惯常视角越多、被遮挡的特征越多;还有部件绑定模型、geon 结构元素模型与"少量参考形状"模型等。一个关键临床观察是:有病人无法识别物体的部件、却能以整体形式识别惯常朝向的同一物体,提示惯常识别不依赖单个特征而依赖更整体的形式,独特特征可能在非惯常识别中更重要。

就功能成像而言,此前只有用常见物体线条画的 PET 研究(Kosslyn 等 1994,发现左中颞区 BA37 与右侧角回 BA39/19 等多个激活簇),以及用裁剪照片的 fMRI 研究(Sugio 等 1999,发现双侧前运动区与左侧上顶叶在非惯常条件下激活更强);尚没有研究使用自然环境中物体的真实照片。另一个相邻领域是心理旋转(mental rotation),其 fMRI 研究报告了顶叶、额叶、枕叶等多处激活,但一项用抽象计算机图形的研究提示心理旋转与"从不同视角识别物体"使用不同的神经通路——所以不能把非惯常识别简单等同于心理旋转。

研究思路

作者的策略是让任务尽量接近自然行为:用数码相机拍摄常见物体在惯常与非惯常朝向下的真实照片(照片比计算机生成图形和线条画多出深度、阴影等识别线索),并刻意回避颜色诊断性高的物体(参照 Tanaka 与 Presnell 的低/高颜色诊断性分类,避免香蕉这类靠颜色就能识别的对象),且全部转为黑白照片以排除颜色线索。识别任务采用"默念名称+按键确认"的形式:只呈现照片、不预先提示,从而消除启动(priming)效应,让被试像在自然环境中一样依赖自己的心理图像;同时要求按键确认以保证被试保持注意并真正在执行任务(注意本身会增强皮层激活,故不能不设确认反应),而改为“作者认为两条件均包含按键动作,因此运动成分应在对比中大体抵消;但由于完成试次数不同,这一点未被直接验证”。分析上采用非惯常减惯常的对比,其逻辑是:改为“该对比检验哪些区域在非惯常条件下表现出更强BOLD响应;它本身不能证明两种识别由彼此独立的神经通路完成”。

方法

被试为 8 名志愿者(5 男 3 女,22–36 岁,平均 26 岁;7 人右利手、1 人左利手),均无神经系统或眼科异常史,双眼最佳矫正视力不低于 20/25,视野检查正常。刺激为 98 张非惯常与 97 张惯常朝向的黑白物体照片,由 Nikon Coolpix 990 拍摄并转为 PICT 文件,用 MacStim 程序呈现,经投影仪投射到被试脚端的毛玻璃屏上(分辨率 1024×758)。实验为组块设计:共 8 个时程(epoch),即 4 对交替的惯常/非惯常组块,每段持续 39.97 秒,段内每张图片的呈现时长由被试通过光纤按键盒自行控制——看到照片后默念其名称,确认认出按右键、认不出按左键;扫描结束后在扫描仪外由研究者监听被试口头复述物体名称以核对正确性,无法识别或复述错误均计为错误,补充“未识别图片被排除在反应时计算之外,但仍保留在fMRI分析中;由于两条件准确率不同,这构成重要解释限制”。成像用 1.5 T Siemens Vision 磁共振:T1 解剖像(TR 800 ms,TE 15 ms)与 T2* EPI 功能像(TR 3.97 s,TE 29 ms,翻转角 90°)各取 28 层 5 mm 轴位片,FOV 240×240 mm,功能体素 3.75×3.75×5 mm³,实验总长 5 分 35 秒。数据用 SPM99 做层时间校正、六参数刚体头动校正、MNI 空间标准化与 8×8×10 mm 半高宽高斯平滑,逐体素按一般线性模型建立统计参数图(参考波形经血流动力学响应函数修正),并做高通、低通滤波与全局标准化;组间推断用随机效应分析(一级:逐被试的统计参数图,二级:对个体激活图做单样本 t 检验)。显著性门槛为体素级未校正 P<0.001、簇级校正 P<0.05。

主要结果

  1. 行为数据上,两种条件"准确率显著不同、反应时无显著差异"。 被试平均正确识别 85.8% 的非惯常照片与 95.9% 的惯常照片(t₇=9.341,P<0.001),差异显著;而正确识别的反应时平均为非惯常 1.707 秒、惯常 1.542 秒(t₇=1.562,P=0.162),无显著差异。每个 39.97 秒的时程内平均看 19.9 张非惯常与 23.0 张惯常图片。

  2. 三处脑区在非惯常减惯常的对比中达到统计显著。 第一个簇位于右侧角回并延伸到右上枕回与楔前叶(Brodmann 区 39/19,簇 P<0.001,最大 Z 值 4.42);第二个簇包括左侧下颞回、左中枕回与左中颞回(BA 37/19,簇 P<0.001,最大 Z 值 3.59);第三个簇主要位于右侧小脑(P=0.014,Z 值 3.98)(表 1;图 2)。

  3. 作者对这些区域的解读是"额外征用了视觉空间通路"。 左侧下颞回区(BA 37/19)本就是物体识别最常涉及的部位,其在非惯常条件下的更强激活可以解释为非惯常识别更依赖物体识别通路本身;右侧角回与小脑则可能是为非惯常识别专门征用的视觉空间加工区。关键的排除性论证是:若非惯常激活更强只是因为任务更难,那改为“作者据反应时差异未显著而倾向于认为难度不是唯一解释,但较低的识别准确率、选择性反应时分析及小样本意味着难度混淆并未被排除”。这一结果与临床证据吻合——右后部半球损伤(尤其颞-顶-枕交界)病人非惯常识别受损的病例系列——也与 Kosslyn 等(1994)PET 发现的左中颞 BA37 与右角回 BA39/19 互相印证,并支持 Warrington 与 James 提出的"直接通路失效时启用备用通路"假说。

图注解读

图 1 · 惯常与非惯常视角的刺激示例

原文图注:FIG. 1. Examples of objects shown in canonical and non-canonical views.

这张图展示实验所用刺激的样子:同一批常见物体分别以惯常视角(日常最常见的标准朝向)与非惯常视角(罕见、通常透视缩短的朝向)拍摄的黑白照片。读图时应当注意到刺激的三个设计要点:一是真实照片而非线条画,保留了深度与阴影线索;二是黑白处理排除了颜色这条识别捷径;三是所谓"非惯常"是拍摄视角意义上的,不是对图片做平面旋转。这张图帮助读者直观理解实验操纵的自变量是什么——改为“实验操纵的名义变量是观看视角,但该操纵同时带来了显著的准确率差异,不能排除难度及刺激属性差异的贡献”。

Figure 1

图 2 · 非惯常减惯常对比的显著激活簇

原文图注:FIG. 2. Significant clusters of activation in object identification task when the non-canonical viewing condition was contrasted with the canonical viewing condition. Activated areas are displayed on a smoothed standard brain. (A) Left hemispheric view shows activation in the left inferior temporal gyrus (arrow). (B) Posterior hemispheric view shows activation in the left inferior temporal and right angular gyrus (arrows). (C) Right hemispheric view shows activation in the right angular gyrus and right cerebellum (arrows). (See Table 1).

三个面板把显著激活簇画在平滑过的标准脑上:(A) 左半球侧面观,箭头指左侧下颞回;(B) 后面观,同时可见左下颞与右角回两处;(C) 右半球侧面观,可见右角回与右小脑。读图方式是把三个视角拼合成一个空间印象:激活分布在左腹侧颞-枕(物体识别通路核心区)与右顶叶-小脑(视觉空间加工相关区)两大块,与表 1 的三个簇一一对应(右角回延伸至上枕与楔前叶;左下颞合并中枕、中颞;右小脑,簇内另含左下颞的局灶极值)。这张图是上文主要结果第 2 条的空间展示,支撑"非惯常识别在惯常识别网络之外额外征用视觉空间区"的结论。

Figure 2

讨论

作者的讨论围绕"这些区域为什么在非惯常条件下更活跃"展开。对左侧下颞回,他们给出两种解释:一是非惯常识别确实存在一个比惯常识别更依赖物体识别通路的替代过程;二是非惯常识别任务只是更难、激活更高——但他们用反应时无显著差异这一点排除了后者,认为难度不是关键、过程本身才是。对顶叶与小脑激活,作者将其归因于视觉空间通路的征用,并援引小脑在视觉空间加工中的证据(小脑损伤病人的视觉空间任务缺陷;Fink 等用 Landmark 线段二分任务显示右后顶皮层、蚓部与左小脑的活动)。与既有文献的对话是讨论的重心:本研究与 Kosslyn 等(1994)的 PET 结果互补(左中颞 BA37、右角回 BA39/19 均复现),而 Kosslyn 研究中被试同时承担听、看、匹配、按键等多重任务、且用线条画,激活面自然更广;与最相似的 Sugio 等(1999)相比,后者用裁剪照片、无法确认被试是否真的在完成任务,且只在预设 ROI 内比较,发现的是双侧前运动区与左上顶叶——与本研究的顶下/颞区结果并不一致。作者也主动承认两点局限:任务中包含"默想名称+按键"这些额外加工,虽是防止走神、确认参与所必需,且运动成分在两条件间会在组块对比中抵消,但仍是潜在的混淆;被试只有 8 人,数量偏少可能限制结果的普适性。结论落点回到 Warrington 与 James(1988)的假说:当标准的直接识别通路无法完成识别时,可能存在一条备用通路——本研究找到了这条通路更活跃的皮层区域。

一句话总结

在我看来,这篇文章用最朴素的设计回答了一个干净的问题:非惯常视角识别不只是"更难的惯常识别",而是额外征用了右顶叶-小脑的视觉空间加工——反应时无差异而准确率与激活有差异这个三角关系是全文最巧的一步;8 个被试的组块设计放到今天偏单薄,但它把临床神经病学的视角(右后部半球损伤)带进功能成像的做法,正是神经眼科学期刊里少见的、值得保留的写法。


审校与证据追溯 (Verification & Evidence)

图表审计结果

关键事实与局限性声明