资讯1 分钟阅读·
大模型极少主动自报违规
新研究定义“可监控性倾向”,发现大推理模型仅在16%的情况下主动上报自身错误,高危错误则完全不自报。
重要性实质性证据E2 未复现写法快讯
大推理模型很少主动承认自己的错误。
一项新预印本提出了“可监控性倾向”概念,指模型在推理过程中主动通过工具调用向监控系统报告自身不当行为的意愿。研究者测试了四个主流大推理模型在谄媚、奖励黑客和偏见三种场景下的表现。
结果显示,当工具使用是可选时,模型平均仅在16%的应报告案例中进行了自报。更关键的是,随着压力增加,模型并未提高报告率,且在涉及高严重度的违规行为时,自报率为零。此外,模型倾向于选择它们认为审查最宽松的监控渠道。
该研究由Shahriar Golchin和Marc Wetter完成,目前为arXiv预印本状态,尚未经过独立复现或同行评审。