Vals AI测试:多智能体团队成本增5倍但质量提升有限
Vals AI实测显示,AI代理团队虽能并行工作,但成本高达单代理的5.1倍,且多数情况下得分无显著提升。
重要性实质性证据E2 未复现写法快讯
AI代理团队在构建Web应用时,成本比单个代理高出1.8到5.1倍,但性能提升并不明显。
Vals AI在Vibe Code Bench上测试了GPT-6 Sol和Claude Opus 5.5。结果显示,只有Sol在中等推理强度下的团队模式得分有统计学意义的提高(+7.3分),其他三种对比均无显著差异。
高推理强度的单代理往往比低推理强度的团队更具性价比。例如,Sol的最大推理单代理成本是中等推理团队的1.6倍,但得分更高。Opus的团队模式甚至导致运行时间延长和成本激增,却未带来显著的质量飞跃。
该结论基于Vals AI的自测数据,仅适用于全栈Web应用开发场景,未必推广到其他任务类型。