资讯1 分钟阅读·
代码智能体评估现“幸运通过”陷阱
新研究称10.7%的代码智能体通过轨迹存在过程缺陷,或致模型排名大幅波动。
重要性实质性证据E2 未复现写法快讯
当前主流的软件工程(SWE)智能体评估仅看最终补丁是否通过测试,这一标准被证实存在盲区。
AgentLens团队分析2,614条OpenHands轨迹发现,在通过测试的案例中,有10.7%属于“幸运通过”。这些轨迹包含回归循环、盲目重试或缺少验证等混乱行为,虽结果正确但过程不可靠。
若改用过程质量评分而非单纯通过率,部分模型的排名可移动多达5个位置。该研究指出,仅凭二元信号无法区分严谨解决方案与试错运气,建议引入过程级评估框架。