← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 218 | 原始基线: V0_ZCODE_BASELINE | 语义审核: minor_revision | 图表审核: pass


Does learned shape selectivity in inferior temporal cortex automatically generalize across retinal position?

Cox · The Journal of Neuroscience: the Official Journal of the Society for Neuroscience · 2008 · Zotero itemID=2063

一句话定位:这是 DiCarlo 实验室"不变性从哪来"系列的关键一环——把两只成年猴学习新物体的视觉经验精确地限制在视网膜上的单一位置,几周训练后用无偏采样的 IT 神经元群体测量发现:学到的形状选择性并没有自动迁移到仅 4° 之外的等偏心未受训位置。这一结果与同实验室 Li & DiCarlo 2008 的"交换暴露"研究互为镜像:一篇证明改写自然时间连续性会改写位置容忍,这篇证明单位置的经验确实不足以在别处生出容忍。

研究背景

物体识别的计算难题("物体恒常性"/不变性问题,invariance)在于同一物体可因位置、大小、姿态、光照等产生近乎无限的视网膜像,而灵长类毫不费力地解决了它:腹侧视觉流最高阶段下颞叶皮层(IT, inferior temporal cortex)的神经元既对复杂视觉特征有选择性,又在位置、尺度等干扰因素变化下保持这种选择性。可是即便对其中"看起来最简单"的位置容忍(position tolerance),人们也不知道这一本领是如何达成的。一种可能是天生的:对任何新学物体的辨别能力会自动泛化到所有视网膜位置;另一种可能则认为位置容忍是从自然视觉世界的统计规律(尤其早期视觉发育阶段,可能延续到成年)中学来的。理论工作(Foldiak 1991、Wallis & Baddeley 1997、Wiskott & Sejnowski 2002 等)支持后一种可能,人类心理物理实验也显示单位置习得的辨别并不总自动迁移(Nazir & O'Regan 1990;Dill & Fahle;Cox et al., 2005),但在此之前没有人曾在高级神经表征层面直接检验过这个问题——缺口的本质是:我们不知道成年 IT 的位置容忍到底是"架构自带"还是"经验塑造"。

研究思路

作者的策略借鉴人类心理物理学的经典逻辑(Nazir & O'Regan 1990):让猴子只在单一视网膜位置获得新物体的视觉经验,然后在无偏采样的 IT 神经元群体上,比较同一组物体在受训位置与等偏心未受训位置的选择性。设计的精妙之处在于三重控制。其一,"受限经验物体集"由四个非均匀有理 B 样条形状构成,每个形状是左右两半特征的 2×2 组合,使动物无法靠任一局部特征完成辨别(沿用 Baker et al., 2002 的逻辑),且每个形状上下垂直对称,保证它在上方与下方两个位置同等可辨——这样两个位置的对比就是"同一组物体、同一只猴、同一套分析"的干净对照。其二,配套的"偏置检验物体集"(圆、十字、星、三角,更易分辨、两关键位置经验均等)承担两项任务:在寻找神经元时只用它呈现,从而保证采样对受限经验物体完全无偏;在正式测试中与受限物体逐刺激交错呈现,充当感受野采样偏置与空间注意偏置的灵敏探针——如果存在任何这类偏置,它必然同样显形于这组物体上。其三,所有神经数据都在与刺激无关的注视任务下采集,快速(5 物体/秒)随机交错呈现,尽量排除注意与测试期暴露的反向污染。

方法

两只成年恒河猴(M 与 P,起始体重 6 与 7 kg),植入头柱与巩膜眼圈,采用高精度实时眼动追踪。经验阶段用四选一的辨别任务:猴子注视中心点后,在预定视网膜位置呈现一个物体 100 ms(M 猴一律在注视点上方 2°,P 猴在下方 2°);若猴子试图朝物体眼跳,物体在眼跳结束前即被移除,因此受限物体从未出现在未受训位置上。猴子通过向监视器四角之一的发光目标眼跳报告物体身份(物体—反应角映射永不改变)。每只猴经 30–60 次训练期达到 80–90% 正确率(Chance 25%),约合每个物体 2 万–3 万次视网膜暴露。探针阶段做前部 IT 单细胞记录(Horsley-Clark 坐标前 12.5–19.5 mm、外 16–24 mm,腹侧上颞沟及颞下回腹侧面),改为“约 90 个记录 session 中共记录到 216 个分离良好的前部 IT 神经元”。(M 猴 151、P 猴 65),其中对偏置检验物体有视觉反应的 91 个进入分析。分析窗口取刺激后 100–200 ms;选择性指标包括 F ratio(ANOVA 的底层度量)、best-worst 反应差(用对半数据避免标签偏置)与 d′;另用留一交叉验证的 Fisher 线性判据分类器(n=21 个有选择性的神经元)做群体水平的四选一解码。记录完成后对 M 猴补充了行为测试:受限物体在两位置随机交错呈现(不给奖励),并与降对比度(10%)的偏置检验物体试验穿插,后者给奖励,以防止天花板效应并监测注意分配。

主要结果

  1. 群体无偏采样下的主效应:75% 的 IT 神经元对四个难分辨的受限物体在任一位置都不具个体统计显著性(p<0.1, ANOVA),但在有选择性的神经元中,受训位置上的选择性系统性地更强——散点图上最选择的神经元倾向落在对角线上方(Fig. 2a)。跨两只猴合并统计,受训位置上选择性神经元比例显著更高(p=0.0147,χ² 检验),且该差异对 ANOVA 显著阈值的选取不敏感(Figs. 3a, 4a);由于两只猴的受训位置一上一下完全平衡,方向随经验而非空间位置走。
  2. 选择性幅度:随着聚焦于越来越有选择性的神经元,受限物体在受训位置的 mean best-worst 差升至约 5 spikes/s,而等偏心的未受训位置接近零;同一批神经元在注视中心处也只有微弱选择性(Fig. 5b)。
  3. 偏置检验物体集三项对照全部阴性:它在两关键位置的驱动反应近乎相等(Fig. 5a)、best-worst 选择性两位置几乎一致(Fig. 5b 右)、选择性神经元比例无位置差异(p=0.441,χ²;Fig. 4c);而"位置 × 物体集"交互显著(p=0.001,多因素 χ²)。改为“这些结果使普通的感受野采样偏置或持续空间注意偏置难以解释主效应;更复杂的物体特异、位置特异注意机制并未被直接排除。”
  4. 时间进程与群体解码:选择性的位置差异在 IT 神经元开始响应的约 100 ms 处即已存在,无需时间发展(Fig. 6,n=11);线性分类器在受训位置对受限物体的解码显著优于未受训位置(改为“两只猴均 p<0.0001(单尾、两独立比例检验)”。),对偏置检验物体则两位置无差异(p=0.284 与 0.384);仅在受训位置数据上训练的分类器,改为“迁移到未受训位置时表现约为机会水平(M:24.4%;P:27.5%;机会水平:25%)”。,而对偏置检验物体迁移良好(35% 与 63%)(Figs. 4b, d)。受限物体两位置间的 rank-order 相关系数平均仅 0.10(不显著大于 0;偏置检验物体为 0.64)。
  5. 行为层面的对应:记录结束后测试 M 猴,受限物体在受训位置的辨别成绩显著优于未受训位置(p=0.0017),而逐试验交错的偏置检验物体两位置无差异(p=0.482)(Fig. 4b/d 右栏)——行为不对称与神经不对称同构,且同样不能归因于空间注意偏移。

图注解读

(说明:本篇图注为 PDF 文本层照录,提取时空格部分丢失,下列引文仅恢复了单词间空格与个别符号,未改动文字;均截断于前四句左右。)

图 1 · 实验设计总览

原文图注:Figure 1. Experimental design. a, Schematic illustration of the two main experimental positions on the retina and the two sets of visual objects. Monkeys first learned to discriminate among the four objects in the bias test set (easier than the restricted-experience objects) (see Materials and Methods). Monkeys were then trained to discriminate among the four objects in the restricted-experience set, for which presentation was restricted to a single retinal position (monkey M, 2°, shown here in red; monkey P, 2°). The key experimental question was whether selectivity among these newly learned objects was found at both the trained position (red) and the nontrained position (blue). ……

a 部分画出视网膜上两个主实验位置与两组物体:偏置检验集先学、在多位置均等呈现;受限经验集只在一个位置训练(M 猴上方 2° 红色,P 猴下方 2°),核心问题就是新学物体的选择性是否同时出现在红色受训位与蓝色未受训位。b 部分上下对照两条试验时间线:上是经验阶段的辨别试验(黄色圈为注视位置,猴子若朝物体眼跳则物体被移除,随后向四角之一眼跳作答并获得奖励);下是探针阶段的注视试验(保持注视即可,5–10 个来自两集合的刺激以 200 ms 间隔随机呈现)。此图是理解全部对照逻辑的钥匙,支撑方法部分与结果第 1 条。

Figure 1

图 2 · 全体 IT 神经元在受限物体上的选择性散点与示例

原文图注:Figure 2. Selectivity of the entire population of IT neurons among the restricted-experience objects. a, Each point shows the selectivity of a single IT neuron measured at both the trained position (ordinate) and the nontrained position (abscissa). Selectivity was computed using a standard index that takes into account all of the response data for these objects collected at each position (F ratio) (see Materials and Methods). The gray region highlights the fact that many IT neurons had little or no selectivity among these objects (see Results). ……

a 是全文主结果的散点图:每点一个神经元,横轴为未受训位置的 F ratio 选择性、纵轴为受训位置的 F ratio,灰色区域标出大量对这组物体几乎无选择性的神经元;关键读法是分布整体偏离对角线、偏向纵轴(受训位置更强)。b 是其中一个标注为 "A" 的神经元的刺激后时间直方图,显示它在受训位置有选择性、未受训位置几乎没有。c 给出八个示例神经元在两位置对四个物体的平均反应柱状图(实心柱为受训位置,空心柱为未受训位置,按受训位置反应排序对齐物体编号)。此图支撑主要结果第 1、2 条。

Figure 2

图 3 · 两只猴分别的结果与偏置检验对照

原文图注:Figure 3. a–b, IT selectivity among the restricted-experience objects (a) and bias test objects (b) for each monkey. a, Red points indicate the fraction of IT neurons selective among the restricted-experience objects at the trained position (counterbalanced across the two monkeys as shown). Blue points show selectivity within the same object set at the eccentricity-matched, nontrained position. Selectivity was determined by ANOVA (see Materials and Methods), and a range of significance levels (p values) used for deeming a neuron to be selective is indicated. ……

a 用一列 ANOVA 阈值(p 值横轴)下红(受训位置)蓝(未受训位置)两点的高度差来展示"选择性神经元比例"的不对称,分猴呈现——注意两只猴受训位置一上一下,但都是红色更高,说明效应跟着经验走而不是跟着视野位置走。b 用同一格式画偏置检验物体,红色点(此处代表与受限物体共用训练的位置)不再系统性偏高。作者在图注中特别提醒:由于偏置检验物体集内部形状差异更大,两物体集之间比较绝对选择性比例是不安全的。此图支撑主要结果第 1、3 条。

Figure 3

图 4 · 神经元比例、群体解码与行为表现

原文图注:Figure 4. a–d, IT selectivity and behavioral performance within object sets after training. a, Fraction of IT neurons with responses that were selective among the restricted-experience objects when those objects were tested at the trained retinal position (black bars) and at the nontrained, equally eccentric position (white bars). Data from both monkeys have been combined (Fig. 2). As in Figure 2, selectivity was determined by ANOVA, and the x-axis shows a range of significance levels (p values) used for deeming a neuron to be selective. ……

a 把两猴数据合并:黑柱(受训位置)在各个 ANOVA 阈值下都高于白柱(未受训位置),灰色的重叠部分表示在两个位置都具选择性的神经元,星号标出 χ² 显著的差异。b 左是选择性神经元群体的线性分类器解码成绩(Chance 25%,四选一),按猴分开,受训位置显著高于未受训位置;b 右是 M 猴补充行为测试中受限物体的辨别成绩(黑为受训位置、白为未受训位置,与低对比度偏置检验试验交错)。c、d 用相同格式画偏置检验物体,两位置间无任何不对称。此图支撑主要结果第 1、4、5 条。

Figure 4

图 5 · 群体平均反应与 best-worst 选择性

原文图注:Figure 5. Mean responsivity and selectivity (best-worst) of the IT population. a, Left, Mean response to all four objects in the restricted-experience object set at the two main experimental positions and at the center of gaze (Fig. 3, mapping of these positions to absolute visual field position). Results are shown for all neurons and for a subset of highly selective neurons (selective among the restricted-experience objects at p<0.05 at either position; ANOVA). Right, Same analysis applied to the same neurons, but now for the responses to the bias test objects presented at the same three positions (see Materials and Methods). ……

a 栏比较三个位置(受训、未受训、注视中心)的群体平均反应:偏置检验物体在两关键位置驱动几乎相等,中心位置略强——这与感受野采样偏置或注意偏置的预期都不符。b 栏是 best-worst 选择性作为 ANOVA 纳入阈值的函数:红色(受训位置)随阈值收紧升至约 5 spikes/s,蓝色(未受训位置)贴着零线,灰色虚线为中心位置(仅微弱选择性);右图对偏置检验物体做同样分析,两位置几乎重合。图注同样强调两物体集之间不可直接比较绝对幅度。此图支撑主要结果第 2、3 条。

Figure 5

图 6 · 选择性差异的时间进程

原文图注:Figure 6. Time course of selectivity for the restricted-experience objects at the two key experimental positions. The responses of all neurons showing strong selectivity among the restricted-experience objects at either position are included (p<0.05, n=11). The x-axis is time since stimulus onset; the y-axis is mean selectivity (over all of the neurons) in which best-worst selectivity was computed in an unbiased manner as described in Figure 5b and Results, but here using a 50 ms sliding window (10 ms steps). Quantitative assessment of the separation of the two curves is captured in Figure 5b.

这张图对 n=11 个强选择性神经元做 50 ms 滑窗(10 ms 步进)的无偏 best-worst 分析:横轴为刺激后时间,纵轴为群体平均选择性,受训位置(红)与未受训位置(蓝)两条曲线从 IT 反应起始(约 100 ms 潜伏期)就分离开来,并非随时间逐渐拉开。这一点专门用来反驳"快速注意转移"类解释——注意来不及在 200 ms 内完成那种先知先觉的调度。此图支撑主要结果第 4 条与讨论中对注意解释的排除。

Figure 6

讨论

作者的核心结论措辞克制:至少在某些条件下,IT 神经元选择性的完全跨位置迁移并非自动发生。他们首先按效应量给出公道的评估:虽然只有少数神经元对受限物体有选择性(这在无偏采样与 IT 承载海量物体的背景下是预期之中的),但约 5 spikes/s 的位置间选择性与 Baker et al. (2002) 精心控制的 IT 学习研究及腹侧流注意效应(约 25% 的视觉调制)相当,并非微不足道。对注意解释的清理很彻底:差异在 100 ms 处即出现,若要用注意解释,就得设想某个脑区在 200 ms 内先于 IT 识别物体、触发对受训位置的强制性内隐注意转移、又立刻复位,且这一切发生在对行为毫无用处的注视任务中;而"自底向上的、既物体特异又位置特异的持久注意偏置"此前无人报道,若真存在,其功能等价于"腹侧流位置容忍被改变了",即本文的主张本身。作者坦承的局限有三:其一,无法在同一神经元上做训练前后的记录,因此说不清选择性在受训位置是从零新造、由既有选择性放大,还是在未受训位置被削弱(他们补充指出 IT 感受野可以小到 1–2°,故效应未必来自更早的视觉阶段;知觉学习文献提示 V1/V2 变化很小、V4 中等);其二,所用物体难以分辨、需要学习新的特征组合,且暴露量(每个物体约两万次)远超心理物理研究,简单物体与更少经验下是否同样成立未知,姿态等其他容忍类型也留待检验;其三,行为不能位置泛化也可能部分因为猴子没把任务的"概念"泛化过去,或未采样的 IT 群体足以支撑泛化。收束时作者与时间连续性假说对话:自然经验中物体常连续存在数秒、眼跳在数十毫秒内提供同一物体在不同位置的像,而操纵这种时间连续性已被证明可预测地改变人类位置容忍(Cox et al., 2005)、人类姿态容忍(Wallis & Büthoff 2001)与猴 IT 位置容忍(Li & DiCarlo, 2008)——据此推测腹侧流全线的容忍性都由自然时空经验构建,但学到的容忍会通过共享特征向相似物体和邻近位置部分泛化,所以"认出一个从没见过的新手机"并不与本文矛盾。

一句话总结

在我看来这篇论文与 Li & DiCarlo 2008 是一对彼此校准的钳子:一篇从"少给了经验"的方向问位置容忍会不会缺,一篇从"错给了经验"的方向问位置容忍会不会错,两个答案都指向经验——成年腹侧流的位置容忍不是出厂设置,而是仍在被视觉史不断续写。把同一组物体在两个只差 4° 的位置上放到同一只猴、同一套无偏分析里,是这篇方法学上最干净、也最值得反复引用的一手。


审校与证据追溯 (Verification & Evidence)

图表审计结果

关键事实与局限性声明