5万条智能体错误数据发布,修正建议通过率升至51.1%
作者自测显示修正建议把回放验证通过率从18.4%提到51.1%,失败轨迹复用方向值得跟踪。
Kunlun Zhu等六位作者于9月30日在arXiv发布Agent Error Dataset,含50,228条错误诊断对。
数据来自9,961个任务、33个环境、23个策略模型,保留原始轨迹与执行元数据,可免重放做再诊断。
作者自测:3,062组回放配对中,修正建议把验证通过率从18.4%提到51.1%;微调Qwen3-8B后与教师标签的逐步一致率从47.2%升至63.6%。回放对比仅覆盖支持重放的环境。