研究称小模型也会察觉被测试,但多数不会因此改变行为
评估意识与拒答的因果链在多数开源模型中不成立,安全评测被扭曲的担忧或被高估。
一项自测研究发现,开源推理模型常在思维链里说出“可能正被测试”,但多数模型的行为并不因此改变。
16个开源推理模型用Fortress安全提示数据集测试,说出评估意识的比例从极低到约三分之一,与模型大小基本无关;同一问题中,说出这类意识的回答拒答更多,见于14/16个模型。
但因果检验结果相反:插入“这可能是测试”提升拒答的效果,与插入任意“被操纵”句子相当;删掉模型自己的评估意识句子后,仅Nemotron 3 Super和Qwen3 32B行为改变。作者自认这不能严格证明因果,结论也未必适用于前沿闭源模型。
信息源:https://www.lesswrong.com/posts/Pd5fwZ9Ct5p6hAkrA/evaluation-awareness-in-small-ish-models