SE-GoS技能图自进化
5 节点1 篇4 来源
SE-GoS 是一项让 LLM 智能体的技能检索图从执行轨迹中自我改进的方法:不训练模型、不改技能代码、不换检索算法,只更新图的拓扑、边权和节点描述。作者自测显示,在 1000 技能的 SkillsBench 上,一轮进化把平均奖励从 52.4% 提到 59.4%,输入 token 约省三分之一,且增益迁移到从未见过的任务集(52.9%→58.3%)。争议在于:Pith 评审认为摘要夸大了 held-out 迁移结果——论文自己报告该提升落在噪声带内,且方法依赖"从工具调用路径可靠识别实际使用的技能"这一前提,间接调用会被漏记。目前结果均为作者自测,尚无独立复现。
事情怎么走到这一步
Graph-of-Skills(GoS)发布:用类型化技能图加反向 Personalized PageRank 做依赖感知检索,在 SkillsBench 和 ALFWorld 上比全量加载技能平均奖励高 43.6%、token 省 37.8%。但图是静态的,建好后不随执行反馈更新。
huggingface.co ↗SE-GoS 论文提交(arXiv:2609.08228):从执行轨迹中归纳拓扑、衰减/强化边权、用一轮文本梯度改写检索不佳的节点描述,检索管线本身保持不变。
arxiv.org ↗Pith 评审给出 3 项主要异议:认可"执行轨迹驱动的图进化"想法干净,但指出摘要夸大了 held-out 迁移结果(论文自报在噪声带内),并质疑通过文件路径识别技能使用会漏掉间接调用。
pith.science ↗论文更新至 v2。作者报告一轮进化使 SkillsBench 奖励从 52.4% 升至 59.4%,held-out 集从 52.9% 升至 58.3%,token 约为全量加载的三分之二;重复进化轮次不再带来提升。
arxiv.org ↗作者再次强调一轮进化的 52.4%→59.4% 提升及对静态 GoS、向量检索、全量加载的全面超越,同时承认效果待独立复现。
arxiv.org ↗
还没定论的部分
- held-out 迁移提升(52.9%→58.3%)是否超出噪声带——Pith 认为论文自报结果在噪声带内,摘要存在夸大
- SE-GoS 能否在独立实验室、不同骨干模型上复现 7 个点的提升
- 在已知真实依赖结构的合成技能库上,进化后的图是否收敛到真实结构(Pith 提出的判定实验)