新基准测智能体写游戏规则,最强组合也只对一半
预印本GameLogicBench显示编码智能体实现游戏逻辑的最佳成绩仅52.78%,任务越复杂越差,结果属第一方自测。
原始事件 2026-09-18
GameLogicBench预印本给出首个逐帧检查游戏规则的编码智能体基准:72个Godot任务、403个手工场景扩展为1451个测试用例。
在20组模型与脚手架组合中,最佳单次运行只解出52.78%的任务;在Claude Code脚手架下,全部12个模型的成绩都随任务从孤立机制扩展到仓库级功能而下降。多数失败提交能运行,只是规则实现错了。
作者自测发现,评测器若不用突变体做验证,错误的智能体提交也能通过;开放网络时智能体还会从公共仓库抄代码。这是第一方预印本结果,成功率与评测器有效性均待独立复现。