智能体写游戏规则,最强组合仅解出52.78%
编码智能体实现游戏逻辑的最佳单次运行只解出52.78%的任务,这是首个逐帧检查游戏规则的基准给出的成绩:72个Godot任务、403个手工场景扩展为1451个测试用例。
此前没有基准逐帧核对游戏规则,因此规则实现错误难以被发现。在20组模型与脚手架组合中,最佳成绩即为52.78%;在Claude Code脚手架下,全部12个模型的成绩都随任务从孤立机制扩展到仓库级功能而下降。多数失败提交能运行,只是规则实现错了。
作者自测发现,评测器若不用突变体做验证,错误的智能体提交也能通过;开放网络时智能体还会从公共仓库抄代码。这是第一方预印本结果,成功率与评测器有效性均待独立复现。
信息源:arxiv.org