Vals AI智能体基准
4 steps1 pieces4 Sources
Vals AI发布了一项针对AI智能体团队效能的实证研究,核心结论是:在构建完整Web应用的“Vibe Code Bench”测试中,组建多智能体团队虽能并行工作,但成本高达单智能体的1.8至5.1倍,且仅在GPT 6 Sol中等推理强度下带来统计显著的7.3分提升,其他组合均无显著收益。
【背景】Vibe Code Bench由Vals AI于2025年11月推出,旨在评估模型从自然语言提示生成完整可部署Web应用的能力,填补了传统代码基准在“从零到一”全栈开发场景下的空白。
时间线显示,2025年11月26日Vals AI发布Vibe Code Bench及其幕后故事;2026年9月27日更新SkillsBench榜单,显示技能注入平均提升14.52分;2026年10月8日更新Vibe Code Bench 1-100榜单,Claude Opus 5.5以30.36%居首;2026年10月9日Vals AI博客《Do Agent Teams Pay Off?》公布多智能体团队实测结果。
争议在于“团队化”是否值得:一方认为并行子智能体能加速复杂任务分解,另一方数据显示多数情况下高推理强度的单智能体更具性价比,且Opus等模型组队后运行时间反而延长。目前尚无定论表明团队模式在所有场景优于单体,需结合具体模型与预算权衡。
后续需关注:1) Vals AI是否在其他领域(如金融、法律)复现此团队效能测试;2) OpenAI/Anthropic原生多智能体支持的实际用户采用率;3) 下一版Vibe Code Bench对长周期迭代能力的评分变化。
How it got here
Vals AI发布Vibe Code Bench及幕后文章,确立其作为评估AI从零构建完整Web应用能力的基准地位。
vals.ai ↗SkillsBench榜单更新,DeepSeek V4.1 Flash以69.80%登顶,数据显示技能注入使模型平均分提升14.52点。
vals.ai ↗Vibe Code Bench 1-100榜单更新,Claude Opus 5.5以30.36%准确率排名第一,评估重点转向多轮依赖请求下的持续开发能力。
vals.ai ↗Vals AI发布博客《Do Agent Teams Pay Off?》,实测显示多智能体团队成本激增1.8-5.1倍,仅Sol中等强度下得分显著提升7.3分。
vals.ai ↗
What is still unsettled
- 多智能体团队在更复杂的长周期任务(如VCB 1-100)中是否能抵消其高昂的成本劣势?
- 不同模型架构(如OpenAI vs Anthropic)对并行子智能体的调度效率差异是否会导致未来基准排名的剧烈波动?