独立审计称权重分解解释聚合后明显偏离原模型
可解释性方法VPD的忠实性假设遭独立审计质疑,聚合与删除操作会显著改变模型输出,更大模型上是否成立待验证。
独立审计称Goodfire权重分解的解释聚合后明显偏离原模型。
对抗性参数分解(VPD)把模型权重拆成简单组件,并逐词标注“此处需要”或“可移除”。Tom Angsten于9月30日在LessWrong发布审计:聚合64个词元的组件(约4500个)后,输出偏离达0.80 nats,接近论文自身20步对抗攻击造成的0.83。
删除所有从未被标注为需要的组件,则偏离1.28 nats。审计仅覆盖论文已发布的分解,不含作者仓库中更新的未发表训练方案;对象是四层、6700万参数的小模型,对生产规模模型是否成立未知。
信息源:https://www.lesswrong.com/posts/KeBccWBGXnNXzZFBp/do-vpd-s-explanations-aggregate-an-audit-of-the-released-1https://github.com/angsten/vpd-audit