预印本称智能体靠自我改进记录即可提升成功率
SelfSearch不用奖励信号也能改进智能体,4美元成本追平最高分harness,但属作者自测,待复现。
预印本SelfSearch称,智能体不用奖励信号、只靠过往自我改进的记录,就能在全部六个模型与基准组合上提升成功率。
论文由Jungwoo Yang、Injin Kong、Yohan Jo于9月29日提交arXiv。方法让智能体读取此前修改尝试的推理、工具动作和结果,作为改进依据,省去反复跑下游评测的开销。
自测数字包括:Terminal-Bench 2.1上单个智能体最高提升11.2个百分点;SWE-bench Multilingual上成功率提高5.0个百分点、执行成本降38.5%。用DeepSeek V4 Flash时,仅4.03美元搜索成本得到解出82.0%任务的harness,追平公开九套比较中的最高分Codex。
摘要未说明82.0%这一对比沿用了公开九套harness比较的原有设定,还是作者自建的评测流程。