← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 121 | 原始基线: V0_ZCODE_BASELINE | 语义审核: needs_revision | 图表审核: pass


Weighted Parallel Contributions of Binocular Correlation and Match Signals to Conscious Perception of Depth

Fujita · Philosophical Transactions of the Royal Society of London. Series B, Biological Sciences · 2016 · Zotero itemID=1262

这是一篇由 Fujita 与 Doi 撰写的综述,系统梳理了他们一系列心理物理与电生理研究后提出的主张:双眼深度知觉并非完全依赖"解决立体对应问题"之后的匹配信号(match signal),而是由基于相关的信号(correlation signal)与匹配信号按可变权重平行加权求和共同决定,权重随刺激的空间与时间参数自适应调节。文章把经典难题——V5/MT 神经元明明对反相关立体图有视差反应、又不被 perceptual 实验排除出深度系统——当作切入裂缝,用"梯度反相关"新范式给出统一解释,并把计算性质逐级映射到 V1、V5/MT、V4、IT/AIP 的电生理与人类 fMRI 证据上。对于想理解"一个知觉系统如何在不完备计算的情况下仍然工作"的读者,这是一份把机制、心理物理与皮层定位串成一条线的少见范例。

研究背景

双眼视差(binocular disparity)的检测始于初级视觉皮层:一部分 V1 神经元对左右眼图像做类似局部互相关的计算(视差能量模型,disparity-energy model),其结果是这些神经元对反相关立体图(anti-correlated RDS, aRDS,即一只眼的点图案明暗全部翻转后与另一眼合成)呈现翻转的视差调谐曲线——这是互相关器的标志性性质[13]。而 aRDS 在人身上不产生任何连贯的深度知觉(只看到一团明暗不均的光点云),因此长期以来主流观点认为:相关信号必须经过某种非线性变换,剔除错误匹配、只保留双眼正确匹配特征的视差(即匹配信号,match signal),深度知觉才可能成立。这一逻辑还能倒推出一个筛选标准——凡对 aRDS 仍有视差反应的皮层区,都不该是深度知觉的直接相关区。

但这个标准与解剖生理事实相冲突:V5/MT 半数神经元像 V1 一样对 aRDS 有视差调制[17],而微刺激(micro-stimulation)与单位记录又一再证明 V5/MT 与粗深度辨别和三维结构—运动知觉有因果联系[23–28]。要么 MT 被这个标准错杀,要么经典逻辑本身有漏洞——作者正是在这一点上重新设计实验:人类被试在"此前未被测试过的条件"下,能否直接利用相关信号辨别 aRDS 中的深度?与此同时,下颞叶皮层(inferior temporal cortex, IT)与前顶内沟区(anterior intraparietal area, AIP)的神经元对反相关刺激完全丧失三维曲率敏感性[16,88],暗示视相关到匹配信号的计算在腹侧通路某处彻底完成,但这些"快照"式证据彼此之间的层级关系需要系统整理,这正是本综述要搭建的框架。

研究思路

作者的核心武器是"梯度反相关"刺激集:在立体图序列中把一只眼的明暗对比按任意比例翻转,从 0%(正相关 cRDS)经过 50%(半匹配 hmRDS)到 100%(反相关 aRDS)。同一个维度上,双眼相关水平从 +100% 经 0% 降到 −100%,而匹配水平从 100% 经 50% 降到 0%——两种成分因此被数学地分离,各自对心理测量函数做出截然不同的预测:相关计算预言 hmRDS 处无偏(判别跌到 50% 概率水平)、负相关处判别反转(反深度知觉,reversed depth);匹配计算预言表现随匹配比例单调下降、只在 aRDS 处归零。谁对谁的形状更负责,一看曲线走向便知。

在这个范式之上,作者搭建了一个抽象的加权平均模型(图 3a):先分别按相关与匹配两条支路编码"视差符号 × 匹配水平"的双变量信号,在远近检测器间做减法(near/far opponent readout),再以相对权重 w 做加权平均,最后经阈值机制输出二元选择。模型的妙处在于其它自由参数在数学上承担不同的几何角色(幅值参数不改变与概率水平线的交点,S 函数上下限不改变纵截距),因此"只改 w 就能复现数据"本身就是可检验的强断言。电生理部分则把同一框架投射到皮层:以 cRDS 与 aRDS 的调谐幅度比(amplitude ratio,理想的纯相关信号为 1、纯匹配信号为 0)作为每个脑区的"所处阶段"指标,再以 92 个 V4 神经元对梯度反相关刺激的群体读出检验"计算层次如何跃迁"。

方法

心理物理部分使用动态随机点立体图(点图案以固定频率刷新),改为“由中央圆盘和周围圆环构成的二分式 center-surround RDS”。,被试判断中央圆盘相对外环是近还是远(概率水平 50%,低于 50% 即判别反转)。两个系列实验:其一把中央—外环视差从 0.038°(细立体视觉范围)逐步加大到 0.488°(粗立体视觉范围),记录每个视差下正确率随匹配比例的曲线;其二固定中间视差 0.24°,把点图案刷新率从 5.3 Hz 提高到 42.5 Hz,借此操纵瞬时(transient/band-pass)与持续(sustained/low-pass)两条时间通道的相对激活。第三个实验通过"点配对"操纵局部相关:把同对比符号的点在竖直方向两两配对(正配对,matched 配 matched),或让匹配点与反转点交叉成对(负配对,matched 配 reversed),在不改变整体相关(恒为 0)的前提下改变局部相关的波动幅度,检验匹配型知觉是否依赖对局部相关的检测(图 4)。模型方面,作者从编码、减法、加权平均、二值决策四阶段推出心理测量函数的解析式,拟合时只独立调整相对权重 w,其余三个参数取固定值。

电生理整合部分系统比较各皮层区在 cRDS/aRDS 条件下的调谐幅度比,并汇入两个数据源:其一为 V4 对梯度反相关刺激的单神经元反应及 92 个神经元的群体汇总(远偏好神经元的调谐曲线在汇总前围绕 0° 视差翻转方向);其二为人类 fMRI 的两个独立研究(Bridge & Parker 的旋转楔形设计、Preston 等的多体素模式解码),作者对它们与猴数据的一致与分歧做了逐区核查。

主要结果

  1. 相关信号可以直接进入意识深度知觉,但有条件。当 aRDS 紧邻一个 cRDS 参考面时,人能可靠判别其视差,但远近判断与真实视差符号相反(反深度知觉,reversed depth perception);给左右眼引入约 100 ms 的时间延迟,aRDS 反而给出正确深度;若参考面换成 aRDS 或无相关刺激、或与中央区之间留有小空隙,反深度知觉消失[29]。这也解释了此前一些研究看不到深度判别的原因(缺参考面或刷新率太低)。作者强调:深度符号的知觉与深度表面的知觉可以分离。

  2. 心理测量函数的形状随刺激参数系统性地在两种预测之间切换(图 3b、3c)。小视差(0.038°)下曲线完全遵循匹配计算的预测;视差加大到 0.488° 时,表现落在两预测之间、并在匹配水平低于 50% 时出现反深度;刷新率慢(5.3、10.6 Hz)时接近匹配型,快(21.3、42.5 Hz)时偏向相关型。整个数据集由加权平均模型单凭一个相对权重参数即可精确复现,改动其它自由参数无法再现数据形状(图 3d)。

  3. 匹配型深度知觉在机械上依赖局部相关加非线性。在整体相关恒为 0 的 hmRDS 变体中,把点做正配对(总体相关的局部波动变大)优于负配对,判别正确率随正配对点比例单调上升(图 4d);由于单眼特征对配对方式不可分辨,这一效应只能归因于"局部相关检测 + 阈值/非线性过滤",即非线性必须发生在跨视场汇总之前。

  4. 神经生理证据分层清晰:V1 平均幅度比 0.52、V4 约 10% 神经元保有 aRDS 敏感性且比值 0.38、V5/MT 50% 神经元敏感且群体比值 0.48、MST 有反置调谐但比值未测、IT 与 AIP 的三维曲率敏感性被反相关完全取消[16,88]。V4 的群体读出(92 神经元汇总)在全部梯度反相关范围内单调变弱、对 aRDS 完全平坦,即群体水平上相关信号被完全变换为匹配信号(图 6c);而初步结果表明 V5/MT 群体调谐在 0% 相关处变平、到 −100% 处以反置形状重现,幅度约为 100% 相关时的 40%,呈现介于相关型与匹配型之间的中间形态[89]。

  5. 人类 fMRI 与猴电生理大体相容但细节有分歧:Bridge & Parker 发现 V3、hV4、V5/MT、LO-1/LO-2 对 cRDS 楔形比对 aRDS 反应更强,V1、V2、V3A、V7 无差异;Preston 等的解码在背侧 V3A、V3B/KO、V5/hMT+、LO 及顶叶区均对 cRDS 更准,而 V1、V2、V3v 与 V4 两种刺激解码同样好。作者把 V4 的不一致部分归因于人 V4 背部区域定位 controversy(V3B/KO 与 LO-1 部分重合于猴 V4d 对应区),认为这属于技术性问题而非实质矛盾。

图注解读

图 1 · 立体对应问题与三类随即点立体图

原文图注:Figure 1. The stereo correspondence problem, and three types of RDSs. To infer the three-dimensional structure of the environment, the visual system needs to match correctly the features in the images received by the left and right retinae. The process of solving this correspondence problem can be defined as finding the match globally consistent across the visual field (global match) while rejecting false matches (blue dots) that do not belong to the global solution. Contrast-matched or correlated RDSs (cRDSs) have one global match, whereas contrast-reversed or anti-correlated RDSs (aRDSs) have none. hmRDSs, in which half of the dots are contrast-reversed, provide a half-match condition. hmRDSs are as a whole uncorrelated between the two eye images, because the positive correlation of contrast-matched dots and negative correlation of contrast-reversed dots cancel each other out.

解读:这张图给出了全文的"字母表"。立体对应问题(stereo correspondence problem)指的是如何从海量可能配对中选出全局一致的方案:a 面板的 cRDS 有唯一全局匹配,蓝点标出的假匹配应当被剔除;b 面板的 hmRDS(半匹配)保留一半正确配对但整体相关性为 0——正相关点与负相关点互相抵消,这对图 3a 里"相关通路预测性能跃到概率水平"的记忆点至关重要;c 面板的 aRDS 连一个全局匹配都没有。注意图注最后一句正是后文所有"hmRDS 悖论"(相关通路理论明明预测概率水平、人却能分辨)的根源,也是作者引出局部相关机制的伏笔。

Figure 1

图 2 · 梯度反相关:解离两种计算的实验工具

原文图注:Figure 2. Graded anti-correlation as a tool to dissociate binocular correlation-based and match-based computations. (a) Examples of contrast-matched, half-matched and contrast-reversed RDSs (cRDS, hmRDS, aRDS, respectively). The RDSs consist of a centre disc and a surrounding annulus. The annulus is always a cRDS. (b) We reverse the luminance contrast of a varying proportion of dots in one eye. This manipulation changes the binocular match from 100% (cRDS) through 50% (hmRDS) to 0% (aRDS), while binocular correlation changes from 100% (cRDS) through 0% (hmRDS) to −100% (aRDS). (c) Predicted psychophysical performance dissociates match-based computation from correlation-based computation. (Adapted from Doi et al. [30].)

解读:这张图是"方法学"的核心。a 面板示意三种 RDS 都采用中央圆盘+外环结构,外环始终保持 cRDS——这就是上一条结果里"相邻相关参考面"的硬件实现。b 面板给出两条刻度轴:随单眼对比翻转比例从 0 增至 100%,匹配沿 100%→50%→0% 递减、相关沿 +100%→0%→−100% 线性下降,同一操作在两条轴上的轨迹不同,正是"解离"的来源。c 面板画出两种计算各自预言的心理测量函数(横轴分别是匹配比例与相关比例,纵轴为正确选择率,50% 为概率水平):相关计算预言奇函数(负相关判别反转),匹配计算预言单调下降、仅 aRDS 归零。读懂这张图,图 3 的所有实证曲线都可以套进来分别判读。

Figure 2

图 3 · 加权平均模型:权重 w 随视差大小与刷新率变化

原文图注:Figure 3. Correlation and matching computations change their contribution depending on disparity magnitude and stimulus refresh rate. (a) Schematic diagram of weighted average of correlation and match signals that transforms bivariate signal (disparity sign and binocular match level) into a binary choice (near versus far). The process consists of four stages (encoding, subtraction, weighted average, binary decision). The relative contribution of the correlation computation for depth judgement is controlled by the parameter w. ……

解读:a 面板画出模型架构:双变量输入(视差符号与匹配水平)进入两路编码,各自在远/近检测器间相减,再以权重 w(相关支路)与 1−w(匹配支路)加权平均,最后一阶二值决策。b 面板是五个视差大小(0.03°–0.48°)下人类正确率数据(空心圆,每点 60 次选择)与模型曲线(实线;上下两条虚线分别为纯匹配 w=0 与纯相关 w=1 的假想曲线):最左图曲线贴着纯匹配虚线,最右图滑向纯相关虚线,中间三个视差逐级过渡。c 面板把同样的证据摆到时间轴上:5.3 Hz 与 10.6 Hz 贴近匹配型,21.3 Hz 与 42.5 Hz 偏向相关型。d 面板是排除替代假说的关键——只改检测器幅值不改变与概率水平线的交点,只改 S 函数上下限不改变纵截距(箭头标出的固定点),唯有相对权重能同时复现数据。这直接支撑主要结果第 2 条。

Figure 3

图 4 · 匹配型深度知觉依赖局部相关

原文图注:Figure 4. Match-based depth perception depends on local correlation. (a) RDSs to manipulate local correlation while maintaining global correlation at zero. (i) An example RDS with negative dot pairing, in which a contrast-matched dot is paired with a contrast-reversed dot. (ii) An example RDS with positive dot pairing, in which a contrast-matched dot is vertically paired with one of the other contrast-matched dots. Pairs are made likewise between contrast-reversed dots. ……

解读:这张图回答了"被过滤掉的信号从哪里来"——匹配计算若要在整体相关为 0 的刺激上有调谐,所需的视差信息只能藏在局部相关的波动里。a 面板给出两类成对操作:负配对(i)把对比匹配点与反转让点两两成对,正配对(ii)把匹配点与匹配点、反转让点与反转让点在竖直方向上配对;b 面板的橙色/蓝色示意二元素或四元素组中左右眼的对比符号。c 面板是模拟 RDS 在小窗内的相关统计:负配对时局部相关波动小,正配对时波动大,均值不变。d 面板是人的近/远判别正确率对配对点百分比的曲线(3 名被试的标准误):随正配对比例增加而单调上升。由于单眼图像对配对操作完全无感,这份数据把"局部相关检测+非线性过滤"钉成了匹配计算的前置必要条件,支撑主要结果第 3 条。

Figure 4

图 5 · 编码单位的可能机制:两路通道的空间—时间配置

原文图注:Figure 5. Possible mechanism of the encoding units in the weighted average model. For the correlation-based representation, local (spatially localized) disparity-energy units receive inputs from transient temporal channel and coarse spatial receptive field (RF). The outputs of the energy units are spatio-temporally pooled without additional nonlinearity. For the match-based representation, the sustained channel and fine RF are used instead of the transient channel and coarse RF. Additional nonlinearity transforms the local disparity-energy signals into match-based representation of disparity. Nonlinear process precedes pooling of responses across visual field.

解读:这是把行为模型落到感受野层面的机制图。相关通路:瞬时时间通道 + 粗感受野 + 视差能量计算,输出直接做时空汇总,不加非线性;匹配通路:持续通道 + 细感受野,能量计算后必须先经过非线性(如阈值操作或平方)再做汇总——否则局部信号会在池化时被平均掉,hmRDS 的视差信息就没了。图下方写的"非线性先于跨视觉场汇总"正是图 4 结论的电路化表述。这个安排也顺带解释了行为上的自适应:细慢刺激占据匹配通路、粗动态刺激占据相关通路,恰好对应中心视觉偏爱细慢特征、外周视觉偏爱快特征的组织方式。注意此图为定性示意,作者也承认单路"完全无线性"的假设偏简化,更真实的可能是两路都有强弱不同的非线性。

Figure 5

图 6 · V4 神经元对梯度反相关的反应

原文图注:Figure 6. Responses of V4 neurons to graded anti-correlation of RDSs. (a,b) Disparity tuning curves of two V4 neurons obtained with a set of gradually anti-correlated RDSs. Error bars indicate +s.e.m., and dashed lines indicate ongoing discharge rate. L, R and U denote response levels to monocular left, right and uncorrelated RDSs, respectively. Negative sign on x-axis denotes crossed disparity. ……

解读:这张图把"群体水平上相关信号被完全变换为匹配信号"落到了实处。a、b 面板是两个 V4 单元的视差调谐曲线族,每条对应一个相关水平(从 +100% 到 −100%,横轴为视差、纵轴为发放率,虚线为自发水平,L/R/U 分别为单眼左、单眼右与无相关刺激的对照)。单神经元层面有个与心理物理预测不符的细节:调谐幅度在小比例反相关时就迅速降到正基线水平,之后随进一步反相关几乎不再变化,且许多神经元的峰值随反相关缓慢漂移、方向不一。c 面板是 92 个神经元(远偏好者的调谐先围绕 0° 翻正后汇总)的群体读出:随相关水平从 100% 降到 −100%,群体调谐幅度逐渐缩小,到 aRDS 处完全平坦——单细胞"先降后稳"经池化被磨成"整体单调下降",定性地复现了人类心理测量函数的变化,并支撑主要结果第 4 条(V4 群体层面完成相关到匹配的跃迁)。

Figure 6

讨论

作者以"幅度比(amplitude ratio)"这一指标的层级排序——V1(0.52)介于纯相关器与非线性修正之间(约半数 V1 神经元的行为更适合非线性改造后的能量模型[11]),V5/MT(0.48)保有大量相关型反应,V4 低至 0.38 但群体读出完全平坦,IT 与 AIP 则对反相关完全无调谐——把"匹配计算发生在 V4 或其后"和"相关计算由 V5/MT 承担"写成了功能专长,并引用微刺激的分区效应(MT 偏粗深度、V4 偏细深度[36,63])与 choice-probability 证据来交叉验证。作者对剩余问题非常坦率:其一,尚需在同一物种内同时采心理物理与神经数据,检验"V4 群体响应与细深度判别的定量对应";其二,猴是否也像人一样在配参考面条件下感知反深度,过去的阴性结果都未采用本研究的那两类条件,因而必须重测;其三,加权平均模型不解释为何反深度需要相邻 cRDS 参考面这一空间交互,"反转"的也可能是测试区与参考区之间的相对深度而非绝对视差,但这又与 MT 神经元偏爱绝对视差的事实相龃龉;其四,本文的问题集只覆盖近/远判别这一种读出方式,深度检测/识别及复杂自然景物的对应问题仍待研究。距现代计算视角而言,作者以"优先处理中央视野精细而缓慢的特征"(中央视觉的典型偏好[51,52])来论证二路分工的演化合理性,把"粗略但不解决对应问题"的外周式计算与"精细但代价高昂"的中央式计算并置,为立体视功能的整体架构提供了一个清晰的解释框架。

一句话总结

以我的理解,这篇文章的最漂亮之处,是它没有把"仪表失灵的反应也参与读数"当成局限,而是反手把它变成算法分工:视觉系统保留了双轨计算——改为“作者推测相关计算可能提供较粗但较简便的视差估计,而匹配计算支持更精细的判断;行为拟合显示两类信号的相对贡献随视差大小和刷新率改变”。唯一让我觉得尚未闭环的地方,是"反深度为何必须有相邻参考面"这一点连作者自己的模型都装不下;如果这个空间交互最终证明 V5/MT 承担的正是相对深度操作,反而会给"相关信号直接进入意识"的主张再加上一根支柱。


审校与证据追溯 (Verification & Evidence)

图表审计结果

关键事实与局限性声明