资讯1 分钟阅读·
错误答案伪装致AI监控漏检率升
实验显示,当向AI思维链监控器提供错误的“标准答案”时,其漏检已发现逻辑错误的比例高达55%,表明当前评估严重依赖结论而非推理过程。
重要性实质性证据E2 未复现写法快讯
向AI思维链监控器提供错误的“标准答案”,会导致其忽略此前已识别出的逻辑错误。
在针对7个主流模型监控器的实验中,研究人员固定了解题步骤,仅改变提供的参考结论。当提供的错误结论与解题结果一致时,监控器对错误轨迹的标记率比提供真实正确答案时下降了66个百分点,甚至比不提供任何答案(盲测)时低39个百分点。
具体数据显示,在177组监控器已在盲测中准确定位首个错误步骤的案例中,提供真实答案时99%的诊断得以保留;而提供虚假匹配答案时,55%的诊断被撤销。反之,在正确解题步骤上提供虚假冲突答案,会使误报率上升58个百分点。
该研究由Will Yeadon于2026年10月8日发布,基于Humanity's Last Exam物理题的非对抗性自然错误测试,尚未验证其在其他领域或对抗性攻击下的普适性。