← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 172 | 原始基线: V0_ZCODE_BASELINE | 语义审核: pass | 图表审核: pass


Neural mechanism of dynamic responses of neurons in inferior temporal cortex in face perception

Yamada · Cognitive Neurodynamics · 2013 · Zotero itemID=1630

这是一篇纯计算建模论文:作者用包含四个子网络的 IT 皮层(下颞叶皮层,inferior temporal cortex)模型,重现并解释了猕猴 IT 神经元对面孔刺激的几类"动态反应"特性——同步放电、与放电率无关的尖峰相关、熟悉面孔的更短反应延迟、以及"由粗到细"(coarse-to-fine)的层级加工。它值得读,是因为它给出了一个具体的机制性答案:学习造成的层间突触增强加上 Hodgkin–Huxley 型亚阈值膜电位的非线性,可以在放电率完全不变的情况下改变神经元的时序结构。

研究背景

物体识别由腹侧通路(ventral pathway)完成:V1、V2、V4 处理局部边缘特征(位置、朝向、曲率),而 IT 皮层以稀疏的神经元活动模式编码完整物体。当时电生理研究已积累了一批有意思的"动态"现象:Hirabayashi 和 Miyashita(2005)发现对面孔与非面孔刺激,同一对 IT 神经元的放电率几乎不变,但面孔刺激引起的尖峰相关性(spike correlation)明显更强;Sugase 等(1999)发现单个 IT 神经元在早期传送刺激的类别(全局)信息、稍后传送个体身份与表情(精细)信息;改为"IT 神经元对人面孔与非灵长类动物面孔反应幅度相当,但对人面孔起反应显著更快"。此外大量工作表明学习与经验会增强 IT 神经元的选择性。

缺口在于两点。其一,这些动态性质是如何在面孔信息加工中产生的,机制不清楚——尤其是"相关性变了而放电率不变"这种解耦现象,用常见的线性神经元模型(如 LIF,leaky integrate-and-fire)根本解释不了,因为输入增大必然同时推高放电率和相关性。其二,以往理论工作把学习造成的敏感性增强归结为神经元响应幅度增大,学习如何影响 IT 神经元响应的时间结构几乎没有被触及。作者的目标就是用一个模型同时解释上述三类实验事实。

研究思路

作者的总体策略是"分层编码 + 学习成网 + 非线性膜动力学"三件套。直觉链是:面孔既有整体图像又有定义良好的部件(眼、鼻、嘴),适合作为研究"整体—部件"表征的模型系统;因此让 V4 的三个空间分辨率层(粗、中、细)分别向三个 IT 层(ITB、ITM、ITF)喂入整体轮廓、部件排布、局部曲率信息,再由面孔识别层 ITFR 把三者绑定成一张具体的脸。层间按 Hebb 规则学习,面孔刺激出现频率高,功能连接就会长出来。

关键的巧思在于神经元本身:作者选择 Hodgkin–Huxley 模型而不是 LIF,理由是 HH 模型中部分激活的钾通道在阈下产生弱抑制,使亚阈值膜电位出现振荡,放电率对输入幅度的变化不敏感——这样学习增强的突触连接就主要体现在尖峰同步和相关上,而不必改变放电率,正好对应 Hirabayashi 和 Miyashita 的实验解耦现象。整个模型因此可以检验一个明确的核心命题:学习的功能连接是否足以在没有放电率变化的前提下组织出面孔知觉所需的时序格式。

方法

模型由 V4B/V4M/V4F 三个输入层与 ITB、ITM、ITF、ITFR 四个 IT 网络构成(ITB 无簇结构,其余每层由若干个"单元"组成,每单元 10 个电导有 ±10% 差异的 HH 神经元;各层间以兴奋性突触相互连接,ITFR 内部还有抑制性连接以实现竞争)。V4X 到 ITX 的连接先用 Kohonen 自组织映射学习,使 ITB 编码整脸粗轮廓、ITM 编码关注点周围的部件排布、ITF 编码被注意选择的部件的局部曲率。学习刺激包括两个面孔物体(FO1、FO2)、两个非面孔物体(部件随机排布的 NFO1、NFO2)和一张猫样的动物面孔(AFO),呈现比例设为 7:1:2,每次呈现 400 ms、注意点每 100 ms 切换,总学习时长 25 s——面孔出现频率远高于非面孔,是这个设计的核心。

层间连接在刺激呈现期间按 Hebb 规则更新(式 9),学习率随权重自增强。分析手段为尖峰互相关(cross-correlation):以 500 ms 窗、每次移步 100 ms 计算神经元对的互相关时间进程;对 ITF 对子的峰值高度换算成 z-score,在刺激后 0–300 ms 与 300–600 ms 两个时间窗分别比较面孔与非面孔条件。ITX 神经元膜方程为完整的 HH 方程(式 1–4),输入电流由 V4 赢者通吃机制给出(式 7–8)并叠加零均值高斯噪声。

主要结果

  1. 学习让 IT 层间出现面孔特异的同步放电:学习后 ITM–ITF 神经元对在 FO1 呈现后 60–190 ms 内以约 80 Hz(伽马频段)逐对同步放电;同一对神经元对 NFO1 则只有 9 对尖峰中约 2 对因偶然同时刻放电。改为"机制是刺激呈现频率差异经 Hebb 学习形成的正反馈"。ITFR 传回的 top–down 信号进一步增强互相关峰值(图 6)。
  2. 相关性与放电率解耦:编码眼与鼻的 ITF 神经元对对面孔 FO1 高度相关放电(有约 2 ms 的时间滞后),对非面孔 NFO1 则无,而两者的放电率几乎相同。面孔刺激下互相关在刺激后 500 ms 内快速上升到高位后保持平稳,非面孔要到 600 ms 才升上去且整体更弱(图 7、图 8);z-score 峰值在与非面孔之间的差异只在 0–300 ms 时间窗显著,此时放电率无构型依赖(图 9)。这复现了 Hirabayashi 和 Miyashita(2005)的核心发现。
  3. 反应延迟编码熟悉度:对出现频率更高的 FO,ITFR 神经元起反应的潜伏期比低频出现的 AFO 更短;群体散点图上潜伏期明显分布在对角线下方(FO 更快),放电率则沿对角线分布(无系统差异)。原因是 FO 造成更强的 ITF→ITFR 突触连接,更快触发放电,与 Kiani 等(2005)的实验一致(图 10、图 11、图 12)。
  4. 由粗到细的层级加工:FO1 呈现后的早期(约 50 ms 内),对 FO1 和对 FO2 敏感的 ITFR 神经元都被 ITB 传来的粗轮廓信号激活;随后精细信息(ITM、ITF 的前馈信号)维持 FO1 神经元的放电而把 FO2 神经元压到沉默。切断 ITB–ITFR 连接(即取消自上而下信号)会让 ITFR 对 FO1 的反应显著延迟(图 13、图 14)。
  5. 亚阈值振荡是快速判别的机制:仅由 ITFR 自上而下信号驱动的 ITM–ITF 神经元对,其阈下膜电位呈现高时间相关性——top–down 信号使膜电位形成阈下振荡并贴近发放阈,为快速面孔判别铺路,可视为一种预测信号(图 15)。

图注解读

图 1 · 四层 IT 网络的整体架构

原文图注:Fig. 1 The neural network model of IT cortex. The ITX (X = B, M, and F) receive the output of V4X with different spatial resolutions. ''B'', ''M'', and ''F'' mean the broad, middle, and fine spatial resolutions, respectively. The ITFR (face recognition; FR) has neurons responding to different faces. The unit of ITM, ITF, and ITFR contains a cluster of neurons, which is depicted by the network consisting of the small circles

这张图是全文的总地图。V4 三层分别以粗(B)、中(M)、细(F)分辨率编码面孔图像,各自喂给 ITB(整脸粗轮廓)、ITM(部件排布)、ITF(部件细节),三个层再共同汇入面孔识别层 ITFR;ITM、ITF、ITFR 的每个单元画成一簇小圈,表示由多个电导略有差别的 HH 神经元组成的神经簇。读图时注意 ITB 没有簇结构(它只做整脸粗分类),层间箭头是双向兴奋连接——这是后面所有同步与学习结果的载体。

Figure 1

图 2 · V4 三种分辨率的编码内容

原文图注:Fig. 2 Representation of face features in V4X (X = B, M, and F). a Face image on the retina (left), and the network model of V4B (right). The activated neurons are depicted by gray-colored cells. b Face image on the retina (left) and the network model of V4M (right). The small square in the face image indicates the point to which attention is directed. The V4M encodes the information about the arrangement of the face part around the attention point. c Image of face part (left) and the network model of V4F (right). The network has hypercolumns, which contains columns of neurons sensitive to different local curvatures. The V4F magnifies the local features of face part selected by attention

左列都是视网膜上的输入图像,右列是对应的网络响应。a 中 V4B 是视网膜拓扑排列的二维阵列,被激活的神经元以灰色示意,输出 0/1,等价于整脸的粗轮廓;b 中小方块标出注意指向的位置,V4M 围绕该点编码部件的相对位置即排布信息;c 中放大被注意选择的部件,超列(hypercolumn)中每列对一种局部曲率敏感。这张图界定了"粗、中、细"三档信息的具体含义,也说明注意在这里是模型的一个显式操作变量。

Figure 2

图 3 · 学习用刺激集

原文图注:Fig. 3 The images used in the learning. a Face objects (FOs; FO1, FO2). b Non-face objects (NFOs; NFO1, NFO2). c Animal face object (AFO)

a 是两张部件位置正常的面孔,b 是两张部件被随机打乱的"非面孔"(用的是同一套部件),c 是猫样的动物面孔。三者的呈现频率比设为 7:1:2。这个设计把"构型是否正常"与"出现频率高低"分了档:FO 与 NFO 共享部件、只差排布,用来检验相关性对构型的依赖;AFO 与 FO 都是脸、只差熟悉度,用来检验延迟—熟悉度关系。

Figure 3

图 4 · 学习后 ITM–ITF 对的同步放电

原文图注:Fig. 4 Time courses of spiking of a pair of ITM and ITF neurons. Responses of these neurons to FO1 (a) and NFO1 (b). The upper and lower panels in a and b indicate the spike patterns of ITM and ITF neurons, respectively

上下两行分别是 ITM、ITF 神经元的放电栅格。a(FO1):60–190 ms 内两个神经元以约 80 Hz 放电,且每一对尖峰都几乎同时刻出现;b(NFO1):放电总数与 a 相同,但 9 对尖峰中只有约 2 对碰巧同时。这是"学习造成面孔特异同步"最直接的展示,支撑主要结果第 1 条的人工对应物——即实验上 Hirabayashi 和 Miyashita 观察到的相关性差异。

Figure 4

图 5 · ITM→ITF 突触权重的时间演化

原文图注:Fig. 5 Temporal variations of the weights of synaptic connections from ITM to ITF neurons. The solid and dashed lines represent the synaptic weights involved in the representations of FO1 and NFO1, respectively

实线(FO1 相关的连接)随学习进程爬升,虚线(NFO1 相关的连接)几乎不涨。这张图给出图 4 同步现象的成因链条:面孔呈现频率高 → 同时刻放电机会多 → Hebb 学习效率高 → 权重更强 → 同步放电进一步被促进,构成正反馈。它同时排除了"同步是网络固有性质"的解释。

Figure 5

图 6 · 自上而下信号增强同步性

原文图注:Fig. 6 Cross-correlations of spikes of an ITM and ITF neuron pair. The solid and dashed lines indicate the cross-correlations in the presence and in the absence of top–down signal from ITFR, respectively. The presence and absence of top–down signal are also depicted with ''TDS(?)'' and ''TDS(-)'' on the graph, respectively. The vertical dashed line indicates the line of s = 0, which represents the correlation of synchronicity

横轴为时间滞后 s,纵轴为互相关强度,虚竖线在 s=0 处,读图时看中心峰的高度。有 top–down 信号(实线,图中标注 TDS(+))时中心峰明显高于无信号(虚线,TDS(−))时。注意文中所设的 top–down 强度只有前馈输入的约三分之一,不足以单独触发放电,只做调制——它印证了层间连接与 ITFR 反馈这两个因素共同组织同步性。

Figure 6

图 7 · ITF 对子相关与放电率的解耦

原文图注:Fig. 7 Response properties of a pair of ITF neurons encoding the features of eye and nose. Cross-correlations of spikes (a) and firing rate (b) of these neurons in response to FO1 and NFO1. The upper and lower panels in (b) indicate the firing rates for the face and non-face stimuli, respectively

a 是这对 ITF 神经元的尖峰互相关,b 是各自的放电率。a 中 FO1 条件的相关峰不仅高,还有约 2 ms 的时间滞后——文中特意指出这与 Hirabayashi 和 Miyashita 的实验值一致;NFO1 条件下因为这对 ITF 神经元与 ITM、ITFR 的连接极弱而无高相关。b 中面孔与非面孔的放电率几乎重合。这一"相关变、率不变"的对照是全文最核心的实验复现点。

Figure 7

图 8 · 尖峰相关与放电率的动态时间进程

原文图注:Fig. 8 Temporal dynamics of spike correlation. a Time courses of spike correlations of a ITF neuron pair in response to FO1 and NFO1. The cross-correlation at the time 0 ms was calculated using spikes in 500 ms before the stimulus onset time, and the time course was calculated by the spikes in 500 ms window that was successively shifted in steps of 100 ms. b Time courses of firing rate of a pair of ITF neurons for FO1 and NFO1

横轴以刺激呈现时刻为 0,分析窗 500 ms、步进 100 ms。a 中 FO1 引起的互相关在约 500 ms 内快速上升后维持平稳,NFO1 上升更慢也更弱;b 中两种条件的放电率均上升后波动,彼此几乎无差别。这正是 Hirabayashi 和 Miyashita 的实验范式——面孔/非面孔的相关差异出现得早且明显,而放电率没有对应的差异。作者在讨论中坦承群体平均上与实验有一个差异:实验中相关在 500–600 ms 后显著回落,模型则保持平稳(详见讨论部分)。

Figure 8

图 9 · 构型依赖的相关性只出现在早期

原文图注:Fig. 9 Rapid emergence of feature configuration-dependent spike correlation. Scatter plots showing peak heights of cross-correlation in z-score (left) and firing rates for ITF neurons (right), elicited by FO1 and NFO1 in the periods of 0–300 ms (top) and 300–600 ms (bottom)

四张子图是两窗 × 两指标:左列 z-score 化的互相关峰值、右列放电率;上行为刺激后 0–300 ms、下行为 300–600 ms。上行左图:FO1 的点系统性高于 NFO1,说明构型依赖的相关性在 300 ms 内就出现;上行右图:放电率在 FO1 与 NFO1 间无明显系统偏移;下行两张图则两种指标都不再有构型差异。"相关性先出现、且有构型选择性"的快速涌现即来于此。

Figure 9

图 10 · ITFR 对熟悉与陌生面孔的潜伏期差异

原文图注:Fig. 10 Onset latency of ITFR neuronal firing for FO1 and animal face object (AFO). The firing rates were averaged over the neurons within units responding to these stimuli

这张图展示 ITFR 神经元(单元内神经元平均放电率)对 FO1 与 AFO 的放电时间进程:AFO 引起的反应起始明显滞后于 FO1。按照作者的解释,频率高的 FO 在学习中建立了更强的 ITF→ITFR 连接,因而更快越阈触发。这是"熟悉度编码在潜伏期而非放电率里"的单神经元证据,对应 Kiani 等(2005)人脸快于动物脸的实验现象。

Figure 10

图 11 · 群体水平的潜伏期与放电率散点

原文图注:Fig. 11 Scatter plots of onset latency and firing rate of ITFR neurons in response to FO1 and AFO

左图以 FO1 的潜伏期为横轴、AFO 的为纵轴(按图中点的分布读),大多数点落在对角线下方,即同一神经元对 AFO 的潜伏期更长;右图以相同方式陈列放电率,点沿对角线分布,说明两种面孔的放电率无系统差异。群体统计把图 10 的单例结论固化下来,并再次呈现"时间可变、率不变"的主题。

Figure 11

图 12 · 熟悉度差异的突触来源

原文图注:Fig. 12 Temporal variations of the weights of synaptic connections from ITF to ITFR neurons during the learning. Only the two synaptic connections learned by FO1 and AFO are depicted

只画出两条连接的学习曲线:FO1 与 AFO 各自从 ITF 到 ITFR 的突触。FO1 曲线爬得更高,因为其呈现频率更高、Hebb 学习更充分。这张图是结果 3 的机制桥梁:连接强度的差异直接转化为放电起始时间的差异——强连接更早触发,弱连接更晚。文中特别强调熟悉度并不影响放电率,只影响时序。

Figure 12

图 13 · 由粗到细:ITFR 的两阶段反应

原文图注:Fig. 13 Responses of ITFR neurons to FO1. a Raster plot of ITFR neurons encoding FO1 and FO2. The label 'i–j' (i = 1, 2; j = 1–5) on the vertical axis means jth neuron within ith unit in ITFR layer. The ITFR neurons sensitive to FO1 and those sensitive to FO2 are indicated by ''1–j'' and ''2–j'' (j = 1–5), respectively. b Temporal variations of firing rates of the ITFR neurons corresponding to the raster plot

a 为栅格图,纵轴'1–j'与'2–j'分别标 FO1 敏感与 FO2 敏感的神经元;b 为对应的放电率曲线。读图关键在两个时间段:早期(约 50 ms 内)两组神经元都被激活——此时驱动它们的是 ITB 传来的粗轮廓前馈信号,尚不足以区分 FO1 与 FO2;随后 FO1 组维持放电而 FO2 组迅速衰减至沉默——此时 ITM、ITF 送来的精细前馈信号增强 FO1 组、通过 ITFR 内的抑制性连接压掉 FO2 组。这就是模型版本的 coarse-to-fine 加工,与 Sugase 等(1999)"类别信息先出、身份信息后出"的记录相合。

Figure 13

图 14 · 切断自上而下信号的反应延迟

原文图注:Fig. 14 Effect of top–down signal on the firing of ITFR neurons to FO1 is shown under the elimination of the connection between ITB and ITFR layers. The raster plot and firing rate are depicted with the similar way to those of Fig. 13

与图 13 同款绘图方式,但这次把 ITB 与 ITFR 之间的连接切断——ITB 无法再早期激活 ITFR,ITFR 也无法由此产生自上而下信号。结果是 ITFR 对 FO1 的放电明显延迟。这个"破坏性"对照(in silico 切断)证明自上而下的预测信号对快速面孔判别是必要的,支撑结果 5 的机制解释。

Figure 14

图 15 · 阈下膜电位的相关即预测信号

原文图注:Fig. 15 Effect of top–down signal on subthreshold membrane potentials of ITM and ITF neurons. Cross-correlation of subthreshold membrane potentials of a pair of ITM and ITF neurons, evoked by top–down signals from ITFR

这张图排除所有前馈输入,只保留 ITFR 的 top–down 信号,计算 ITM–ITF 神经元对的阈下膜电位互相关:两条阈下轨迹高度相关。这说明 top–down 信号使 IT 神经元的膜电位产生同步的阈下振荡并贴近发放阈,一旦前馈信号到达即可立刻越阈——这就是图 14 中"切断自上而下则反应变慢"的细胞层面机制,也呼应了 HH 模型非线性的设计初衷(时序协调而无需改变放电率)。

Figure 15

讨论

作者把全部结果归结为一个主题:IT 用层级化的多层网络加工面孔,而"经验依赖的学习"通过增强层间功能连接塑造这些层活动的时序格式——同步放电把整脸与部件信息绑在一起,ITF 内的高相关把部件特征绑在一起,潜伏期差异编码熟悉度,由粗到细则出自"ITB 先激活类别、top–down 预测信号再引导精细信息绑定"的循环。模型与三组实验(Hirabayashi 和 Miyashita 2005;Sugase 等 1999;Kiani 等 2005)各有一个系统对应点,作者特别强调"binding-by-synchronization"(以同步实现捆绑)假说在其框架下是学习的结果而非前提,并连带讨论了 30–100 Hz 伽马节律、面孔空间(face space)原型表征可能如何从 ITB 的粗分类中自组织出来,以及模型对识别缺失康复训练的临床启示(同步性可作为面孔识别能力的测量指标)。

作者也承认了几处局限与不确定:其一,模型假设 IT 内有一个独立于物体信息的面孔加工区,而 IT 也可能用共同区域处理面孔与非面孔,此时 NFO 反而是出现频率更高的刺激,结论的来源可能有出入,作者提出社会交往中面孔信息的重要性(经由奖励系统如基底神经节)作为替代解释;其二,群体平均的互相关时间进程与实验存在偏差——实验中相关在 500–600 ms 后显著下降而模型保持平稳,作者归因于神经元敏感性差异的平均效应或注意及 IT 与其他皮层区域的相互作用;其三,长期记忆所暗示的谷氨酸受体、GABA 能抑制性中间神经元等神经递质机制在模型中只是推测层面;其四,模型未涉及 IT 与海马、嗅周皮层等内侧颞叶记忆系统的关系,也未涉及人脑梭状回面孔区(FFA)及 Freiwald 和 Tsao 描述的六个面孔加工区网络如何与 IT 对接。

一句话总结

在我看来这篇文章最大的看点是用"神经元动力学 + 学习"把三组看似独立的实验现象纳入同一套机制:阈值非线性解决了"相关变而率不变"的矛盾,呈现频率自然生成熟悉度(潜伏期)与分类(粗到细)两个层次。当然它是模型论文,所有结论的真值取决于 HH 膜动力学假设是否兑现,且作者自己指出的群体时间进程偏差也提示模型在真实连接结构上仍有简化——读它应当当机制假说读,而不是当数据读。


审校与证据追溯 (Verification & Evidence)

图表审计结果

关键事实与局限性声明