看懂神经网络认了什么:激活图谱画出概念地图
有些图像识别模型内部学了一堆概念,但没人说得清它到底认什么。
有些图像识别模型内部学了一堆概念,但没人说得清它到底认什么。激活图谱(Activation Atlases)把模型内部对百万张图片的反应取平均,画成一张概念地图,能看出模型的高层误解:比如一张棒球照片让模型把「灰鲸」认成「大白鲨」。
今天排查一个图像模型为什么认错东西时,这类可视化仍是标准工具;后来的解释方法大多是在它上面修修补补。触发场景是模型误判、你想看它内部把图片当成了什么。
如果模型不是做图片分类的,或者图片和常见测试集的分布差得远,就别用它来判断模型行为。它画的是低维投影,路径未必对应真实结构,只能当线索,不能当定量证明。
《Activation Atlases》(2019)|下次复查 2027-09-20