新方法给智能体训练按进度记分,称小模型提升4.1个百分点
进度可像结果一样被验证,失败尝试也能产生训练信号;数字出自作者自测,待第三方复现。
原始事件 2026-09-24
一篇预印本提出ProCredit方法:把判定任务成败的验收检查改在每轮操作后的中间状态上重跑,按进度变化给每一轮记分,而不是只在任务结束时给一个结果奖励。
作者称,在AppWorld基准上用三个规模的Qwen3.5基座模型测试,该方法在每个规模上都超过结果奖励和进度类基线,4B规模超出最强结果奖励基线4.1个百分点;第二个环境的结果方向一致。消融显示,只把最终进度加进轨迹评分并无提升,收益来自把进度记到发生它的那一轮。
这一思路针对的是结果奖励的老问题:一组尝试全失败时没有训练信号,失败也分不出差多远。数字出自作者自测,摘要未给出第二环境的具体数值,能否推广待第三方复现。