← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 204 | 原始基线: V0_ZCODE_BASELINE | 语义审核: needs_revision | 图表审核: pass


Neural Representation of Ambiguous Visual Objects in the Inferior Temporal Cortex

Emadi · PLOS One · 2013 · Zotero itemID=1903

这篇文章记录猕猴下颞叶皮层(inferior temporal cortex, IT)神经元在观看不同噪声水平物体图像时的锋电活动,系统刻画了"模糊"这一刺激维度如何逐级改变 IT 反应的幅度、起始/结束时间与类别选择性,并用漂移扩散模型把这套神经指标与行为上识别变慢、变差联系起来。它值得读,是因为它没有停留在"噪声压低反应"这种直觉结论上,而是给出了一个定量的噪声容忍阈值,并发现了一个"只报告有东西、不报告是什么"的中间表征状态。

研究背景

IT 是腹侧视觉通路(ventral visual pathway)的最后一站,其神经元对面孔、身体等复杂物体有选择性反应,作者团队此前的微刺激工作还表明类别选择性神经集群的活动与知觉决策存在因果联系。生活中视觉刺激常常是退化的——文中举的例子是暴雨雪天隔着挡风玻璃辨认行人——而心理物理学研究早已表明,视觉噪声越多,物体识别的准确率和速度都越差。但当时文献大量研究的是 IT 对尺寸、朝向、颜色、视角、位置等变化的容忍性(tolerance),"模糊"这一维度对 IT 神经反应的影响并不清楚,噪声如何造成行为上的又慢又差更缺乏神经层面的解释。

当时已有的相关线索是:图像被打乱(scrambled)、形变(morphed)或部分遮挡时 IT 反应会下降;IT 反应起始潜伏期本身携带编码信息,作者曾发现人面孔比动物面孔诱发更短的起始潜伏期;知觉决策领域则有成熟的漂移扩散模型(drift diffusion model, DDM)框架。缺口在于:没有人系统测过模糊程度如何同时调制 IT 反应的幅度与时间结构(起始、结束、持续),也没人定量过类别选择性的噪声容忍阈值,更没有把这些指标放进决策模型去解释行为变化。

研究思路

作者的总体策略是"被动观看 + 参数化噪声 + 偏好/非偏好类别对比"。采用被动观看任务而非辨别任务,是为了在纯感觉层面考察模糊的影响,避免决策与注意的混淆——猴子只需保持注视。噪声选用高频"椒盐噪声"(salt & pepper noise),理由是 IT 神经元感受野大、加工带低通滤波性质,对这类高频噪声相对稳健,因此噪声主要改变刺激的可见性/模糊度,而不会像在低级视皮层那样严重破坏图像本身。分析聚焦在身体类别选择性单元上,这依托于该实验室此前在 IT 发现的身体选择性神经集群。全文围绕四个问题展开:幅度如何随模糊变化、时间结构如何变化、类别选择性能容忍多大噪声、以及如何用决策模型解释行为上准确率与速度的下降。

方法

两名成年雄性猕猴。刺激为 7°×7° 灰度照片,来自在刺激描述中补充:所有身体图像均不含面部特征。,各 90 张;每张在 10%、30%、45%、60% 四个噪声水平(补充说明:每个刺激采用固定噪声图样,而不同刺激使用不同噪声图样;论文没有通过同一基础图像的多个独立噪声实例检验泛化。)下呈现,另加 90 张 100% 全噪声图,共 720+90 张随机不重复呈现。每张图呈现 70 ms,刺激间隔 650–950 ms,猴子保持注视即每 1.5–2 秒获一次果汁奖励;每类别每单元的中位试次约 360。用钨丝电极在 STS 下岸与 TE 区按 1 mm 间隔网格穿刺,记录多单元活动(multi-unit activity, MUA),共获得 66 个有视觉反应的 MU(猴 1 为 41,猴 2 为 25);作者用一段较长的论证为选 MUA 而非单单元辩护(邻近单元选择性相似、信噪比更高、无需锋电位分选)。

分析窗口默认为刺激后 100–300 ms(换成 70–300 ms 不改变主要结论)。类别选择性指数(selectivity index, SI)=(μB−μO)/(μB+μO)×100,在 10% 噪声下计算,SI>0 定为身体选择性,共 48 个单元(猴 1 为 32,猴 2 为 16);若改用 t 检验定义的 21 个选择性单元,结果一致。起始/结束潜伏期将反应与 30 ms 高斯核卷积平滑后,用 50 ms 滑窗与基线(刺激前 −50 至 0 ms)做单尾配对 t 检验确定;所有噪声水平均可测得起始的单元有 25 个、可测得结束的有 21 个。群体解码用线性支持向量机(support vector machine, SVM),每轮以 75% 试次训练、25% 检验,重复 1000 轮。

主要结果

  1. 反应幅度随模糊度单调递减(图 2)。示例单元 U10 对身体图的反应与噪声水平呈负相关(Pearson r=−0.55, P<0.00001);48 个身体选择性单元归一化后的群体反应同样随噪声线性下降(r=−0.57, P<0.00001),对非偏好类物体图的反应亦然(r=−0.42, P<0.00001)。
  2. 反应的时间结构随模糊度系统性改变(图 3):噪声越大,起始潜伏期越晚(r=0.31, P=0.0004, n=25)、结束越早(r=−0.43, P=0.00004, n=21)、持续时间越短(r=−0.55, P<0.00001, n=21)。双因素 ANOVA 显示起始潜伏期在噪声水平间有差异(P=0.006)而在身体/物体两类别间无差异(P=0.24),而反应幅度则在噪声与类别两维度上都有差异——说明起始潜伏期的变化不能用"幅度大所以起始早"来解释。
  3. 类别选择性的噪声容忍阈值约为 60%(图 4、图 5)。身体与物体诱发反应之差在 10%、30%、45% 噪声下显著(配对 t 检验 P 分别为 <0.00001、<0.00001、0.002),到 60% 噪声时消失(P=0.46);群体 SI 随噪声递减(r=−0.45),在 60% 噪声下与零无显著差异(P=0.5)。示例单元的 SI 也逐级下滑(原文数字:信号比例 90%/70%/55%/40% 时 SI 为 18.15/12.87/3.95/0.08)。
  4. "只报有、不报是什么"的表征状态(图 5)。60% 噪声下两类刺激的反应仍显著高于基线(P 均 <0.00001),也显著高于 100% 全噪声,但已不含类别信息;SVM 解码准确率随噪声下降(r=−0.9, P<0.00001),在 60% 噪声处接近机会水平。另外全噪声图虽无物体信息,群体反应仍可高于基线(示例单元 U10 例外,其 100% 噪声反应不高于基线)——说明放电幅度本身不足以解释物体表征。
  5. 累积 SI 与漂移扩散模型(图 6)。把 100–300 ms 分成不重叠的 50 ms 窗计算累积 SI:噪声大的一组(45%+60%)证据积累开始更晚、斜率更浅。作者据此提出:模糊条件下证据积累起步更晚、漂移速率更慢,决策变量(decision variable, DV)更晚到达(或始终未到达)判定界,从而解释行为上更长的反应时与更低的准确率。

图注解读

图 1 · 刺激与任务流程

原文图注:Figure 1. Stimuli and task. A. Exemplar body (monkey body) and object (car) stimuli in different levels of noise. Numbers below the images show percent of the noise for each column of images. B. Sequence of task events. Two macaque monkeys were trained to perform a passive viewing task. The presentation of the stimulus sequence started after the monkey maintained fixation for 400 ms on a small white fixation point at the center of the screen. Images from two different categories (body and object) were presented randomly for 70 ms with a variable (650 to 950 ms) inter-stimulus interval (ISI). ……

A 栏把同一张猴身体图与汽车图在 10%–100% 各噪声水平下的外观并排展示,直观给出"模糊度"的操作定义——数字越小越清晰。B 栏是被动观看任务的时间线:注视 400 ms 后开始随机刺激序列,每张 70 ms、间隔 650–950 ms,猴子保持注视即可获奖励。这张图交代了后文所有分析的时间基准(刺激呈现仅 70 ms、分析窗取 100–300 ms)与噪声参数,是理解结果 1–5 设计前提的钥匙。

Figure 1

图 2 · 反应幅度随噪声递减

原文图注:Figure 2. Response amplitude in different noise levels. A. The response of an exemplar unit (U10) to body images in different noise levels (black: 10%, red: 30%, green: 45%, blue: 60% and magenta: 100%). Here and in all other plots of temporal pattern of the events, responses of units were measured in 1-ms bins and smoothed by convolving with a 30-ms Gaussian kernel. The gray box represents the period of evoked activity used for the further analysis. B. Mean response of the exemplar unit in A (U10) to body images with different levels of ambiguity, during 100 to 300 ms after stimulus onset. ……

A 是示例单元 U10 的刺激后时间直方图(PSTH),五条曲线对应五个噪声水平,可见噪声越大峰值越低、起伏越窄;B 把 100–300 ms 窗内的平均放电率对噪声水平作图,内嵌的 r 与 P 给出幅度与噪声水平的 Pearson 相关(r=−0.55);C 是同一单元对非偏好类(物体)的对照,反应整体更小。D 是全体 66 个单元的 SI 分布(用于界定 48 个身体选择性单元),E/F 把每个单元的平滑反应归一化到各自峰值后再取群体平均,展示群体层面的同一趋势。此图支撑结果 1。

Figure 2

图 3 · 起始、结束与持续时间

原文图注:Figure 3. Response onset latency, offset latency and duration in different noise levels. A. Onset latency, offset latency and duration of the response of the exemplar unit (U10) to body images in different levels of ambiguity. When full noise images were presented there was no increase in the response of this unit relative to the baseline activity (Figure 2A). Therefore, onset, offset and duration were not measurable in this noise level and are not shown in this figure. B. Onset latency of the response of the units (n=25) to body images with different levels of noise. C. P-values of the comparison of onset latency values in different pairs of noise levels (t-test, paired). D. Offset latency of the response of the units (n=21) to body images with different levels of noise. ……

A 展示 U10 在各噪声水平下的三个时间参数;由于该单元在 100% 全噪声下反应不高于基线,该条件的三个参数无法测量、故不画出。B/D/F 分别是群体起始潜伏期(n=25)、结束潜伏期(n=21)与持续时间(n=21)随噪声水平的变化,C/E/G 是相邻噪声水平两两配对比较的 p 值。读图要点:起始随噪声变晚、结束变早、持续时间变短,多数水平对之间差异达到显著。此图支撑结果 2,也是全文首次把"模糊"与 IT 反应时间结构联系起来的证据。

Figure 3

图 4 · 身体对物体的反应差随噪声缩小

原文图注:Figure 4. Response to body vs. object images in different noise levels. A. Averaged response of all units to object images with different levels of noise. Normalization was done as described in Figure 2E. The gray box represents the period of evoked activity used for the further analysis. B. Mean response of all units to object images in different levels of noise, during 100 to 300 ms after stimulus onset. Conventions as in Figure 2B. C. Response of all body selective units (n=48) to body and object images in different noise levels during 100 to 300 ms after stimulus onset. Each data point shows the mean response of one unit. ……

A/B 给出全部单元对非偏好类(物体)的反应:随噪声增加而下降,且整体低于身体图(对比图 2E)。C 是本图关键:48 个单元的身体反应与物体反应逐点配对,内嵌 p 值显示 10%、30%、45% 噪声下差异显著,60% 噪声下不再显著(P=0.46);100% 全噪声不画,因为其中不含任何类别信息。这张图是"类别选择性容忍阈值约 60%"(结果 3)最直接的证据。

Figure 4

图 5 · 类别可分辨性及其时间动态

原文图注:Figure 5. Category discriminability in different noise levels. A. SI of the all units in different noise levels, measured during 100 to 300 ms after stimulus onset. Stars show p-values of t-tests between pairs of noise levels (: P<0.005). B. The performance of a classification trained to categorize body versus object stimuli. Stars show p-values of t-tests between pairs of noise levels (***: P<0.00001). C. Temporal dynamic of SI of the exemplar unit (U10). SI was measured in different noise levels in sliding 50-ms windows. ……

A 是全体单元的 SI 随噪声水平递减,60% 处与零无显著差异;B 是线性 SVM 的身体/物体解码准确率,随噪声下降、在 60% 处接近机会水平(Pearson r=−0.9);C/D 用 50 ms 滑窗展示 SI 的时间动态——低噪声下 SI 更早升起、更晚回落,而 60% 噪声下全程在零附近波动。A 与结果 3 对应,B 与结果 4 的"群体层面也无类别信息"对应,D 的时间动态还为图 6 的累积 SI 分析做了铺垫。

Figure 5

图 6 · 累积 SI 与漂移扩散模型示意

原文图注:Figure 6. Schematic model. A. Body cells' cumulative SI in more and less noisy conditions. Cumulative SI was measured separately for less (10% and 30%, blue line) and more (45% and 60%, red line) noisy images in non-overlapping 50-ms windows during 100 to 300 ms after the stimulus onset. Dashed lines (a and b) represent hypothetical lines representing possible decision boundaries. B. Drift diffusion model and evidence accumulation for visible and ambiguous stimuli. Decision variable (DV) is the cumulative sum of the evidence. ……

A 把"证据积累"具体化为累积 SI 曲线:改为:红线所示的高噪声条件(45%+60%)比蓝线所示的低噪声条件(10%+30%)开始积累得更晚,斜率也更浅。;虚线 a、b 是两条假设的决策界。B 是漂移扩散模型示意:DV 为证据的累积和,到达任一界即做出选择;模糊条件下更低的幅度、更短的持续与更小的选择性共同造成更慢的漂移速率,使 DV 更晚到达界(对应 a 的情形)甚至到决策时刻仍未到达(b 的情形),于是反应时更长、准确率更低。此图支撑结果 5,是全文把神经指标接入行为解释的关键一环。

Figure 6

讨论

作者逐条回应引言中的四个问题,并把结果放进已有文献:幅度随噪声下降与图像打乱、形变、部分遮挡时 IT 反应下降的报道一致;而起始更晚、结束更早、持续更短这组时间结构变化是本文首次演示,作者将其与错觉轮廓加工中更长的起始潜伏期类比,推测噪声条件下 IT 可能需要类似的内部加工或自上而下反馈来"找回"丢失的信息。类别选择性在 60% 噪声处消失而反应仍高于基线,作者解读为"检测所需的信噪比低于辨别",正好对应"知道有东西、不知道是什么"的日常体验;同时作者谨慎地承认,单个 MU 在 60% 噪声下失去类别信息,不代表更大的神经元群体也不能编码——若编码稀疏度随噪声变化,更大规模的群体分析仍可能保留类别信息,只是本文的 SVM 已在 60% 处接近机会水平。

局限方面,作者明确指出这是被动观看任务:若换成辨别任务,结果可能按"反应增益模型""偏移模型"或"对比度增益模型"三种方式之一被注意/任务需求放大或压缩,具体是哪种有待比较实验检验。记录对象是 MUA 而非单单元,作者以 IT 柱状集群内邻近单元反应性质相似、MUA 信噪比更高来辩护,但也承认 MUA 只是理解脑生理的工具,不必然就是大脑实际使用的信号。最后,DDM 框架把起始、幅度、选择性、持续四个参数统一映射为"起步更晚、漂移更慢",为心理物理学中"噪声越大、识别越慢越差"提供了一个可检验的神经版本——尽管文中并未用行为数据正式拟合该模型。

一句话总结

在我看来这篇论文的漂亮之处有二:一是把潜伏期、持续时间这些时间参数与幅度并列为受噪声调制的编码维度,并给出了一个可复验的容忍阈值(60% 噪声);二是捕捉到"有信号但无类别"这个中间状态,把"看得见却认不出"变成了神经层面的可测量事实。用 DDM 串联这些参数虽属示意而非正式拟合(这是我的判断),但方向清楚,是把感知决策模型接到感觉皮层数据的一条干净路径。


审校与证据追溯 (Verification & Evidence)

图表审计结果

关键事实与局限性声明