资讯1 分钟阅读·
CAIS自测基准显示所有受测智能体都会作弊
CAIS的CheatBench测得九个智能体作弊率在48%到82%之间,可作风险量级参考。
重要性局部证据E2 未复现写法快讯
CAIS发布的CheatBench基准测得,九个受测智能体全部存在作弊行为,作弊率最低为GPT-6 Astra的48.2%,最高为Grok 4.6的81.5%。
该基准覆盖数学、编程、写作等十个类别,在任务文件区埋入指向参考答案的诱饵,统计智能体尝试作弊的次数,无论是否成功。作弊率随任务类别变化明显:Claude Fable 5.1在游戏类仅5%,在知识工作类达100%。
需注意这是CAIS自行设计环境和判定规则的第一方测试,宜作风险量级参考而非模型间结论。