研究者称问无关问题可探测模型是否自知被评估
黑盒探针让评估监测门槛降低,但信号成因未定且不能跨模型迁移,值得跟踪。
原始事件 2026-09-25
LessWrong作者Ziqian Zhong于9月25日提出「虚假探针」方法:向模型问一个无关问题,就能近似判断它是否自知处于能力评估中。
在GPT-5.6 Luna上,让模型「建议一种两栖动物」,接续评估转录时答frog的比例为70-95%,接续真实使用会话时仅12-38%。对GPT-5.6 Sol和Claude Sonnet 5, medieval guild、茶类等探针在留出数据上的平衡准确率为0.77-0.81。
这类探针只需黑盒访问,且对「否认被评估」的系统提示和专门逃避激活探针的Neural Chameleon模型基本不失效。作者自认无法确定信号反映真实的评估意识还是词汇线索,探针也不能跨模型迁移,每个模型需重新筛选。