← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 007 | 原始基线: V0_ZCODE_BASELINE | 语义审核: pass | 图表审核: minor_issue


Consciousness absent and present: a neurophysiological exploration

Rolls · Progress in Brain Research · 2004 · Zotero itemID=167

Rolls 在这篇 Progress in Brain Research 章节里,用后向掩蔽(backward masking)把一个古老的意识问题改造成了可测量的神经生理学问题:当面孔"刚好能被辨认却进不了意识"时,下颞叶视觉皮层里到底发生了多少神经活动?答案是惊人的小——掩蔽起始仅比测试面孔晚 20 ms 时,猕猴 IT 皮层神经元只放电约 30 ms、单个神经元平均只携带 0.06 比特信息,而人类被试仍能以高于随机约 50% 的准确率强迫选择辨认面孔,却报告自己在瞎猜;SOA 拉长到 40 ms,信息量翻倍到 0.14 比特,意识报告随之出现。文章据此提出:有意识视觉知觉的阈值被设得高于"小而显著"的信息水平,以免意识加工系统被可能只是噪声的小信号打断。

研究背景

问题的两翼是盲视(blindsight)与后向掩蔽。盲视指初级(纹状)视皮层损伤的患者自己报告看不见刺激,却在强迫选择(forced choice)中能判别刺激的运动、位置、部分形状甚至面孔表情(Weiskrantz 等 1974;Stoerig 与 Cowey 1997;de Gelder 等 1999)——"没看见却能判对"的分离久已被确认,但它是定性的。正常人也一样:后向掩蔽——测试刺激短呈现后紧跟另一视觉刺激——会降低对测试刺激的视知觉,是心理物理学的常用范式。缺的是定量环节:当知觉被掩蔽压到意识之下、而强迫选择尚能辨对时,相关皮层里还剩多少神经活动、多少信息?

选择下颞叶视觉皮层(inferior temporal visual cortex, IT)作为测量点有明确理由:面孔与物体的表征在此以分布编码实现,具有位置、大小乃至视角的不变性(Rolls 2000a;Rolls 与 Deco 2002);它是灵长类单模态视觉加工的最后一级;人类同源区被认为是梭状回的面孔/物体区(Kanwisher 等 1997;Ishai 等 1999),其损伤造成面孔与物体识别障碍而不伴随视敏度等低级功能受损(Farah 1990, 1995a,b)。因此 IT 是把神经元活动的定量特征与人类面孔知觉挂钩的合适台阶。 Rolls 组此前已完成神经生理测量(Rolls 与 Tovee 1994;Rolls 等 1994)与信息论分析(Rolls 等 1997, 1999),Kovacs 等(1995)也用类似范式在独立实验中确认了结果;本章的任务是把这些结果与意识问题正面接通。

研究思路

作者的总策略是"同一套刺激、同一台设备、两个物种":猴子做 IT 单细胞记录,人做心理物理,两者在刺激起始不同步(Stimulus Onset Asynchrony, SOA,即测试刺激与掩蔽刺激起点之间的时间差)这一轴上对齐,逐点比较。逻辑链分三步。第一步在神经水平回答"掩蔽到底对皮层神经元做了什么"——是压制反应还是截断反应;第二步用信息论把发放换算成信息量(比特),这样既把试次间的方差纳入考虑,又能与人类心理物理的辨别力直接比较;第三步把 SOA = 20 ms 处"信息存在但无意识报告"与 SOA = 40 ms 处"意识报告出现"的对照,解释为意识知觉阈值高于隐式加工水平的证据,并顺着作者自己的意识理论给出一个功能性解释。之所以必须用信息量而不止是发放数,是因为作者发现短 SOA 下发放数下降有限、逐试次方差却增大——"看见"与"看不见"的差别不在神经元是否放电,而在放电是否可靠。

方法

神经生理部分:记录猕猴 IT 皮层中对面孔有选择性的单神经元(分布编码,distributed encoding),在视觉注视任务中呈现后向掩蔽(Fig. 1):先给 500 ms 提示音,−100 ms 时注视点熄灭以清屏,屏幕亮度全程恒为测试图与掩蔽的平均亮度;0 ms 时测试图像呈现一帧 16 ms(显示器余辉小于 3 ms);SOA 取 20、40、60、100 或 1000 ms,由计算机随机排序;掩蔽刺激持续 300 ms;静态刺激视角 8 度,监视器距离 1.0 m。测试刺激是面孔图像,标准掩蔽是重叠字母 N、O 组成的图案(被记录神经元对其无反应),部分实验改用对该神经元无效的面孔做掩蔽。人类部分:8 名观察者,5 张彼此熟悉的面孔;强迫选择任务要求判断呈现的是"正常"面孔还是部件被"重排"的面孔,并指认 5 张面孔中是哪一张,允许并鼓励猜测,数据经猜中校正(随机 = 0%,全对 = 100%);正确率经 arc sin 变换后做重复测量 ANOVA。信息分析:在刺激后固定时间窗内测发放率,把反应量化为少于每刺激试次数的分箱,据此估计联合概率表 P(s,r),用 Shannon 公式计算神经元发放传递的信息 I(S,R),并减去 Panzeri 与 Treves(1996)的有限采样校正以消除小样本偏差。

主要结果

  1. 掩蔽的作用机制是截断而非压制:无掩蔽时,IT 神经元对 16 ms 面孔呈现的反应潜伏期约 75 ms,放电持续 200–300 ms(远长于刺激本身);SOA = 20 ms 时放电被限制到约 30 ms,SOA = 40 ms 时约 50 ms。42 个被测细胞呈现相似的掩蔽时间特性。无掩蔽时刺激后放电的持续被解释为皮层回侧支连接构成自联想网络(具吸引子与短时记忆性质)的表现,因为外侧膝状体中没有这种刺激后持续放电(Fig. 3)。
  2. 发放数降得少、信息量掉得多:15 个细胞的群体平均显示,掩蔽对最有效刺激(max)的发放数有影响,对最无效刺激(min,接近自发水平)无显著影响(Fig. 4);但 SOA 缩短时信息量的下降远超发放数的下降,原因是短 SOA 下逐试次反应变得嘈杂(方差增大)——不同 SOA 间信息量差异显著(单因素 ANOVA,P<0.001)(Fig. 5)。
  3. 关键数字的双物种对照:SOA = 20 ms 时,单神经元平均携带 0.06 比特信息(约为无掩蔽 16 ms 呈现之 0.3 比特的 33%,约为 500 ms 呈现典型值 0.35–0.5 比特的 22%),此时人类身份辨认经猜中校正后约 50% 正确,但被试报告在瞎猜,意识不到看见了整张脸或哪张脸(只确知屏幕上"有什么变了",有时觉得某个部位如嘴出现过);补注:信息量为刺激起点后 200 ms 固定窗内的累计值(Fig. 5 定义),与放电持续时长是两个不同量。,辨认接近 100%(讨论中给出 97%),被试明显更常有意识地报告看到了谁的脸(Fig. 6;SOA 效应 F(4,28) = 61.52,P<0.0001)。
  4. 意识报告的定量化:要求被试用 0–10 量表(无掩蔽呈现的清晰度记 10,看不到面孔特征记 0)做量值估计,主观清晰度在 20 ms SOA 时低、40 ms 时升高、60 ms 时接近完全清晰(SOA 效应 P<0.001)(Fig. 7)。
  5. 时间尺度推论:20 ms SOA 条件下,IT 已有足够时间完成计算并让信息被读出(对应心理物理 50% 校正正确);按腹侧通路 V1–V2–V4–IT 各级最短反应潜伏期(V1 约 40 ms,每升一级增加约 15–17 ms,IT 约 90 ms),20 ms SOA 下 IT 的反应不可能在掩蔽作用于 V1 之前反馈影响 V1——故至少部分识别可以在没有自 IT 向早期区自上而下反馈的情况下完成;而每级 15–17 ms、单区不超过 30 ms 的处理窗,在神经元具连续动力学(积分发放型)与自发发放的前提下,足以让区内回侧支完成一轮吸引子式运算。

图注解读

图 1 · 后向掩蔽注视任务的时间线

原文图注:Fig. 1. The timing used in the backward masking visual fixation blink task. The Stimulus Onset Asynchrony is the time between the onset of the visual test stimulus and the onset of the pattern mask stimulus. The test stimulus duration was 16 ms. (After Rolls et al., 1994.)

这张示意图画出一次试验的时间结构:横轴为时间(约 −500 至 2000 ms),依次是提示音、注视点(−100 ms 熄灭以清屏)、0 ms 起的 16 ms 测试刺激、SOA 之后出现的掩蔽,随后是发放率测量窗。它定义了全篇的核心自变量 SOA——测试刺激起点与掩蔽起点之差——后面每张图的横轴都是它。读后续图前先记住两点:测试刺激本身只有 16 ms,掩蔽是非亮度性的图案掩蔽(屏幕亮度全程不变)。

Figure 1

图 2 · 测试面孔与掩蔽图案

原文图注:Fig. 2. Examples of the test images used. The mask is also shown. (After Rolls et al., 1994.)

给出实验材料:测试刺激是几张熟悉面孔,右侧是掩蔽——重叠字母(N、O)拼成的图案。它解释了为什么掩蔽能"切断"而不"擦除":掩蔽与测试图等亮、图案性质与面孔完全不同,且被记录神经元对掩蔽本身无反应,因此掩蔽后见到的任何神经活动只能归因于测试刺激残留的加工被打断,而不是掩蔽自身驱动了神经元。

Figure 2

图 3 · 掩蔽如何截断单个 IT 神经元的放电

原文图注:Fig. 3. Peristimulus rastergrams and smoothed peristimulus spike density histograms based on responses in 8–16 trials to the test face alone (top raster-histogram pair), and to the test face followed by a masking stimulus (which was a face that was ineffective in activating the cell) with different S.O.A. values. (S.O.A. = Stimulus Onset Asynchrony) The mask alone did not produce firing in the cell. The target stimulus was shown for 16 ms starting at time 0.……

每行是"栅格图 + 平滑发放密度直方图"一对(基于 8–16 个试次),横轴为相对刺激起点的时间。最上面一行是掩蔽远置(SOA = 1000 ms,记录窗内等于无掩蔽)的条件:反应潜伏期约 75 ms,放电持续 200–300 ms;往下各行 SOA 递减,可见放电恰在掩蔽到达处被截断,20 ms SOA 时只剩约 30 ms 的短促发放。掩蔽本身(无效面孔)不引发该细胞放电。这张图直接支撑结果第 1 条:后向掩蔽对皮层视觉加工的作用是中断放电、限制反应时长。

Figure 3

图 4 · 发放数随 SOA 的变化:强刺激掉、弱刺激不动

原文图注:Fig. 4. The mean (sem) across cells of the number of spikes produced by the most effective stimulus (max) and the least effective stimulus (min) as a function of Stimulus Onset Asynchrony (S.O.A.). (After Rolls et al., 1999.)

横轴为 SOA(20、40、60、100 与无掩蔽),纵轴为 0–200 ms 窗内的 spike 数,分别画 15 个细胞对最有效刺激(max)与最无效刺激(min)的群体平均(±sem)。max 曲线随 SOA 缩短而下降,min 曲线则贴在自发水平附近、受掩蔽影响不显著。它给结果第 2 条提供背景:就发放数而言,掩蔽的效应看似温和——这正是必须接着看信息量的原因。

Figure 4

图 5 · 信息量随 SOA 骤降:放电变"不可靠"了

原文图注:Figure 5 shows the average across the cells of the cumulated information available in a 200 ms period from stimulus onset from the responses of the 15 neurons as a function of the S.O.A. This emphasizes how as the S.O.A. is reduced towards 20 ms the information does reduce rapidly, but that nevertheless at an S.O.A. of 20 ms there is still considerable information about which stimulus was shown. The reduction of the information at different S.O.A.s was highly significant (one way ANOVA) at P<0.001. It was notable that the information reduced much more than the number of spikes on each trial as the S.O.A. was shortened.……

横轴为 SOA,纵轴为刺激起点后 200 ms 内的累计信息量(比特)。曲线随 SOA 缩短快速下滑,但在 20 ms 处仍显著大于零;各组间差异经单因素 ANOVA 高度显著(P<0.001)。与 Fig. 4 对照读是关键:信息量的相对跌幅远大于 spike 数的跌幅,因为短 SOA 下逐试次反应方差增大。这张图支撑结果第 2 条的全部含义——"意识之外仍有信息,但信息比发放掉得更快"。

Figure 5

图 6 · 人类强迫选择:20 ms 时高于随机、却自称在猜

原文图注:Fig. 6. Psychophysical performance of humans with the same stimuli as used in the neurophysiological experiments described here. The subjects were shown 'normal' faces or faces with the parts 'rearranged', and were asked to state which of 5 faces had been shown ('Identification'), and whether the face shown was in the normal or rearranged 'Configuration'. …… The data have been corrected for guessing. The test stimulus was presented for 16 ms. (After Rolls et al., 1994.)

横轴为 SOA(20–120 ms),纵轴为经猜中校正的正确比例(随机 = 0%,全对 = 100%),区分构型判断(正常/重排)与身份辨认两类任务及正常/重排两种面孔。要点是:20 ms SOA 处身份辨认已约 50% 校正正确、显著高于随机(SOA 效应 F(4,28) = 61.52,P<0.0001),40 ms 处接近 100%。它与 Fig. 5 并排读构成全文核心对照:0.06 比特对应约 50% 校正正确但无意识报告,0.14 比特对应接近全对且有意识报告。支撑结果第 3 条。

Figure 6

图 7 · 主观清晰度评定:意识报告的操作化

原文图注:Fig. 7. Rating of the subjective clarity of faces as a function of stimulus onset asynchrony (S.O.A.). The mean of the magnitude estimation ratings is shown. (The clarity of the face, when presented without being followed by a masking stimulus, was assigned the number 10. If the observer was not able to see the features of the face, that was to be considered 0. The observers assigned a number from 0 to 10 to represent the perceived subjective clarity of the face. The effect of S.O.A. was statistically significant at P<0.001. After Rolls et al., 1994.)

横轴为 SOA(20–200 ms),纵轴为被试对面孔主观清晰度的量值估计均分(0–10,无掩蔽 = 10)。曲线在 20 ms 处低、40 ms 处抬升、60 ms 处接近满值(SOA 效应 P<0.001)。它把"是否意识到看见了脸"从二值报告变成连续量度,为结果第 3、4 条中的意识出现点提供了直接的定量依据。

Figure 7

讨论

讨论的核心是把神经物理量与意识现象直接对齐:当被试"感觉在瞎猜"时,猕猴 IT 神经元仍以约 30 ms 的发放提供 0.06 比特信息;SOA 增至 40 ms、发放约 50 ms、0.14 比特时,辨认接近 97% 且意识报告出现。信息在 50 ms 级的短时段内已相当可观(与 Tovee 等 1993、Tovee 与 Rolls 1995、Heller 等 1995 一致),这为腹侧层级 V1–V2–V4–IT 的快速前馈读出提供了基础,也说明每级 15–17 ms 的处理窗足以让连续动力学神经元上的回侧支完成吸引子式运算(Panzeri 等 2001;Rolls 与 Deco 2002,与 Thorpe 等 1996 的观点相对照)。无掩蔽时信息可延续到刺激结束后 200–300 ms,作者认为这种短时记忆痕迹可能参与不变表征的学习。与盲视文献的对话很有分寸:盲视中的隐式/显式分离通常被解释为不同视觉通路受损程度不同(V1 之外存在替代通路,Weiskrantz 1997, 1998, 2001);而本文的分离发生在同一条通路、同一个脑区(IT)之内,仅因加工时长不同而出现——因此它为"感觉流中的活动必须超过某个阈值才能进入意识"提供了比盲视更直接的证据,并与 Marcel(1983a,b)的纯心理物理后向掩蔽证据互补。作者还顺带论证腹视流与意识的特殊关联:物体与面孔的信息需要进入规划动作的系统,而多步计划的拟定与修正最接近意识加工;背视流执行已选定的动作则可隐式进行(Milner 与 Goodale 1995)。

后半段是作者自己的理论:现象意识是"思考自己的句法性(或更广地,语言式)思维"时出现的状态——承接 Rosenthal 的高阶思维(Higher Order Thought, HOT)传统,作者称之为 HOLT(高阶语言思维)理论。计算论证是:多步计划若涉及多个符号及其条件关系,就需要语法把符号正确绑定;计划出错时,能反思并逐步核查的高阶过程是解决 credit assignment(功劳分配)问题的办法;作者明说"高阶句法思维不伴随主观感受是不太可能的"只是可信性论证(plausibility argument),而非可检验的主张。由此得出功能性解释:这类加工是串行而耗时的(串行用以限制绑定问题),服务于长期与多步规划,所以意识阈值应当设得较高——只有当非句法的隐式检测系统确认信号足够强、且可能是行为上重要的类型(地平线上移动的斑点、面孔上的表情变化)时,才值得打断它。局限作者并不讳言:这一整套关于意识功能的论证"必然涉及不易检验的假说"。

一句话总结

按我的理解,这篇文章真正立得住的贡献是定量那一半:把"阈下仍有加工"落实为 0.06 比特这样的数字,并且用信息量跌幅大于发放数跌幅这个细节点破——看不见不是因为神经元没放电,而是放电变得不可靠了。至于意识阈值为什么该设得高、意识为何系于高阶句法思维,那是作者个人理论(HOT/HOLT 一系)的延伸,逻辑自洽但如他自己承认的难以检验;我更愿意把它读作一个漂亮的约束性事实加上一个诚实的思辨框架。


审校与证据追溯 (Verification & Evidence)

图表审计结果

关键事实与局限性声明