← 返回文献列表

IT Literature Intelligence 终审版本 (VERIFIED) 论文编号: 103 | 原始基线: V0_ZCODE_BASELINE | 语义审核: pass | 图表审核: no_figures


Insight into the Neuron's Insight

Afraz · Cell · 2019 · Zotero itemID=1072

这是刊登在 Ponce 等 (2019) 同期 Cell 上的一篇 Preview(导读评述):评的对象是用生成式闭环系统(generative closed-loop system)进化合成图像、改为'非人灵长类下颞皮层',或加注'(Ponce et al. 原研究使用猕猴)'以区分文本依据与外部知识。。 Afraz 借此把"如何找出驱动一个神经元的最大刺激"这一问题写成了一部微缩史——从 Hubel 与 Wiesel 的手动摸索、到尖峰触发平均、到 Tanaka 的人工化简——并给出了两处清醒的批评:进化出的图像未必是响应空间的全局最大值;以及"进化出偏好刺激"这件事,反过来可以当作给计算模型与 IT 本身找茬的对抗性工具。

研究背景

把手指放在耳上方两侧的颅骨内侧,那里的神经元每次看到面孔和各种复杂物体都会剧烈放电——我们普遍认为灵长类用 IT 里的这些神经元识别面孔、动物与物体。过去三四十年,系统神经科学的一个核心难题始终没有解决:这些神经元到底对什么特征做出响应?改为'作者用一个第二人称思想实验(设想你正在记录自己 IT 中的一个神经元)来说明其结构'。:对同一个 IT 神经元测 10 张图,它对鹳最敏感,你能说它是"鹳神经元"吗?扩到 100 张图,它对鸵鸟更敏感;扩到 1000 张图,一只羊驼(alpaca)超过了两种鸟——那它是"动物神经元",还是只偏好"长脖子"?可能图像与特征的空间是无穷的,所以检验永远可以做下去,而每次只能揭示真理的一部分,甚至把你引开。作者用 Rumi 的寓言《黑暗中的大象》点题:每张测试图都像盲人摸到的一部分象。

低层视觉处理的同题研究给过高光答案:Hubel 与 Wiesel(1959)在初级视皮层(primary visual cortex, V1)发现朝向选择性神经元,但他们测的也主要是圆和线;上世纪 70–80 年代发展出的尖峰触发平均(spike-triggered averaging, STA)用视觉噪声替代枚举所有图像、无偏地估计最大驱动模式("kernel"),结果发现 V1 的 kernel 并非"朝向条",而是同时编码空间频率与朝向的 Gabor 光栅图块——Hubel 与 Wiesel 其实只摸到了象的獠牙。V1 kernel 的意义在于:视觉皮层用一组有限的基函数表达任意图像,如同一套"字母表"。由此自然引出下一个问题:比 V1 高级的 IT 有没有物体识别的字母表?若有,如何找到 IT 神经元的 kernel?

研究思路

矛盾在于:STA 依赖神经响应的线性假设,而 IT 恰恰违反线性,所以不能用同一套方法。在机器算力缺席的年代,Tanaka 团队走的是人工路线——"化简"(reduction)法(Kobatake & Tanaka, 1994):先找到能驱动某神经元的一张自然物体图,然后人工改变其视觉特征,直到找出与自然物体驱动力相当或更强的最小必要视觉特征集合。Ponce 等 (2019) 的贡献正是把这一步交给机器:用一个生成模型+进化的闭环,让合成图像朝"最大化目标神经元放电"的方向演化,无须人工设定候选特征,也就排除了研究者先入为主造成的偏差。这从原理上是"特征空间穷举"问题的第一个可操作解——不限方向、不限类别、自动搜索。

方法

作为对他人论文的评述,本文不呈现自己的实验;Ponce 等的关键做法可概括为:对非人灵长类 IT 神经元,用生成式网络的合成图像作为刺激,以真实神经响应作为适应度信号,闭环进化出高驱动合成图像(abstract 与文首段落即如此表述;改为'作为 Preview,本文不含方法学章节;Ponce et al. 的具体网络与实验细节需参阅原文(Cell 177, 999–1009)'。)。值得注意的是评述中呈现的三个可优化目标:可以进化"最能激活"的图像,也可以反过来优化"最抑制"的图像,甚至可以直接优化"对 IT 神经元群体最有判别性(discriminability)"的图像——这三种目标分别对应单细胞响应强度与群体解码两个层面的探测。评述还提到同一路线的另两项先行工作(Walker 等 2018、Bashivan 等 2018,均为预印本)。

主要结果

  1. Ponce 等 (2019) 的核心成果(据本文评述与摘要):进化出的合成图像为 IT 神经元的特征选择性提供了无偏评估,揭示了这一参与物体识别的高层级视觉区的编码原则与神经元偏好(Cell 177, 999–1009)。在低级区域 V1,这套无偏逻辑已把"朝向条"的朴素认识推进为 Gabor 基函数的"字母表";该研究把同一逻辑搬进了非线性的 IT。

  2. 评述者提出的第一个保留意见——术语与能量地形(energy landscape)问题。作者认为 Ponce 等明智地避开了 "kernel" 一词而用 "evolved image",因为 kernel 暗含特异性:V1 的典型 kernel 我们不指望一个神经元同时对多个不同 kernel 同等献身;而 IT 的进化图像,可能是图像空间里的全局最大值(更像 kernel),也可能只是无数无关图像汪洋中众多局部响应峰之一。多次独立进化能收敛出"相似"图像这一点松散地支持全局最大值的解读,但没有专门设计的研究,结论仍悬而未决;这两种情形(全局或多个局部最大)对理解大脑如何处理复杂信息各有其意义,但都需要未来的工作加以澄清。

  3. 评述者指出方法本身的自适应性才是更值钱的资产。改为'以神经元群体为单位优化低放电或判别性'。,因此是寻找"计算模型与真实 IT 的分歧点"的利器:在模型上进化并验证,能让模型的证伪与迭代加速。这一用途独立于模型纠错——它也可以作为彻头彻尾的对抗性工具去打 IT 本身的"设计裂缝"。

  4. 对 IT 本身的对抗性提问(文中列举式提出,尚待回答):能使 IT 神经元无法辨认模式的最小图像扰动是什么?什么样的扰动会让一个物体在 IT 神经元看来是另一个物体?这些图像在人眼里看起来像什么?作者以 Leonard Cohen 的歌词收束这一节:"万物皆有裂缝,那正是光照进来的地方。"

讨论

这篇评述的讨论实际上就是以上保留意见的延伸:一方面把 Ponce 等的方法放进"枚举无穷刺激空间"的历史脉络(Hubel–Wiesel → STA kernel → Tanaka 化简 → 生成式进化),确认其方法论价值在于无偏与可闭环;另一方面从理论角度提示解读的边界——进化图像的"kernel 式"解读(全局最大值 vs 局部局部峰)需要专门研究才能下结论,在此之前不宜把这类数据投入严格的建模。最后的展望把技术推向两个方向:作为模型证伪器(找模型与大脑的裂缝),和作为大脑自身的对抗探针(找 IT 的脆弱点),并把这些工作与同期出现的同类研究并置。文章刊出后作者专门发布了一则更正(Cell 178, 509, 2019):因疏忽漏引 DiCarlo 组的 Bashivan 等 (2018),据其所知当时只有三篇使用该技术的论文——这篇评述还指出,评的这篇是一篇、其内已引用的一篇是第二篇、加上被漏引的那篇恰好三篇。这则更正侧写了该技术当时之新,也显出作者对文献完整性近乎洁癖的认真。

一句话总结

读这篇 Preview 的乐趣不在报告什么新数据,而在看一位内行如何把一个老问题重新定义成可解的形式:不用再问"这神经元是什么神经元",只需让生成网络替你把刺激空间里让神经元最兴奋的那一帧画出来。不过我同意评述者的冷静——进化图像还配不上"kernel"这个词,它是个上坡路走到头的点,至于是不是山顶,得另做实验才知道。


审校与证据追溯 (Verification & Evidence)

图表审计结果

无嵌入图表。

关键事实与局限性声明