资讯1 分钟阅读·
微软新基准查数据库终态,智能体一次成功不等于可靠
智能体评测从看工具调用转向查数据库终态,单次成功率与20次全对比例的落差是选型关键。
重要性实质性证据E2 未复现写法快讯
微软与Hugging Face发布ThinkingBox基准,按智能体留下的数据库终态打分,507个业务流程每个跑20次。
在12个模型、121,680次有效试验中,79,853次未通过可执行检查,其中67.24%的工具调用全部正常且无报错——问题出在写错字段值(77.61%)或留下多余副作用(43.30%)。
一致性落差更大:Kimi-K3至少成功一次的任务覆盖93.89%,但20次全对的只有13.41%;Claude Opus 5则79.09%至少一次、47.53%次次成功。
结果为微软与Hugging Face自测,基准与数据集已开源,可经OpenEnv复现。