微调可抵消激活引导效果
研究发现,对嵌入权重编辑的模型进行监督微调,平均会消除69%的行为干预效果,但原始权重修改并未被逆转。
重要性实质性证据E2 未复现写法快讯
将行为控制直接写入大模型权重的“激活引导”技术,在后续监督微调(SFT)中可能失效。Glass等人发现,针对拒绝回答的引导在SFT后平均损失69%的效果,但在强化学习人类反馈(RLHF)下仅损失2%。
尽管行为效果消失,原始的权重编辑本身几乎未被还原(平均仅恢复0.4%)。微调更新的方向与预编辑权重模式近乎正交(余弦相似度0.071),意味着模型通过新的、不相关的权重变化恢复了原有行为,而非撤销了之前的编辑。
该研究基于5个3B至14B参数的指令微调模型,结论为:嵌入式引导不具备完全持久性,下游训练后必须重新验证行为表现。论文已被EMNLP 2026接收。