资讯1 分钟阅读·
决策模型长链任务可靠性不足
新基准JEVal显示,通用决策模型在单步判断上高效,但在多步交互中因误差累积导致成功率下降,且在社会模拟中存在系统性偏差。
重要性局部证据E2 未复现写法快讯
通用决策模型(如Jev)在需要专家知识或不确定性估计的任务中表现减弱,常高估结果概率。
在τ-bench等长周期多步交互测试中,虽然局部决策速度加快、平均耗时缩短,但误差随轨迹长度累积,导致整体任务成功率低于生成式大模型。
大规模社会模拟显示,此类模型虽能以更低推理成本接近LLM的单点预测能力,但在用户画像构建上较弱,并表现出较大的聚合估计误差和系统性偏差。