小模型实验称几十条样本可无声改写模型行为
论文在审、模型仅2000万参数,结论能否推广到真实大模型待验证。
作者自报的实验显示,先花数百条样本让模型学会绕开捷径,再用约56条错误答案样本就能让一半问题的回答改走另一条路径,且常规测试准确率保持满分。
实验在2000万参数的小模型上进行,任务是人工构造的动词问答。训练集从3.2万条扩到32万条,所需特殊样本始终是几百条(9.6万条时约378条),说明起作用的是绝对条数而非占比。这与Souly等人2025年发现预训练投毒约需250篇文档、且数量不随模型和数据规模变化的结论一致。
作者在9月30日的LessWrong帖文中给出解释:普通样本对绕行路径的强化有上限,只有捷径被切断或给出错误答案的样本才真正起作用。论文尚在评审中,结论能否推广到真实大模型待验证。