预印本自报:自进化智能体技能池过临界规模后污染难回滚,VaG门控在Terminal-Bench 2达72% pass@1
污染机制与72%成绩均为作者自测,能否独立复现决定这条结论的可信度。
原始事件 2026-08-06
Sources checked:09/18/2026, 15:48 · Original article in Chinese
This is an archived article. Forecasts, prices and upcoming events refer to its original time period.
Linfang Shang等七名作者的预印本8月6日提交arXiv、9月17日更新v2,结论均为作者自测、未经独立复现。据其描述,自进化智能体从执行轨迹蒸馏技能时,技能池超过临界规模后新技能反而拉低性能;缺陷技能会进入决策上下文、成为后续蒸馏的参照,形成跨轮污染链,事后删除源头技能只能挽回少量损失。作者据此提出Verifier-as-Gatekeeper(VaG)门控,用三类评审逐条过滤技能并做边际增益筛选,称在Terminal-Bench 2上逐轮提升至72% pass@1,技能池约为无条件累积的五分之一;72%未附无条件累积下的对照成绩,单看难以定位水平。