JEVal决策基准
4 ステップ1 件4 ソース
通用决策模型(如Jev)在单步判断中高效,但在多步交互中因误差累积导致可靠性下降。2026年10月,复旦大学团队发布JEVal基准,评估了25种模型配置,指出此类模型在长链任务和社会模拟中存在系统性偏差。尽管其推理成本极低且速度较快,但校准度不足引发争议:一方认为其概率分布可信,另一方则强调需通过阈值控制自动化风险。InnerJev系列模型试图通过自蒸馏技术解决此问题,在保持毫秒级响应的同时提升表现。目前行业正围绕“何时可信任自动决策”展开博弈,关键在于校准误差(ECE)与覆盖率的平衡。
経緯
Benchmark Heaven运行JevBench v1.0,测试242个决策项,显示GPT-5.6 Luna与Jev 1.13.0准确率接近,但Jev成本更低。
benchmarkheaven.com ↗jeval工具对RAGTruth数据集进行基准测试,发现Jev在案例级判断中精度约82.8%,但存在大量弃权情况,校准误差较高。
getjeval.com ↗arXiv提交论文《General Decision Models: Benchmarking and Insights Beyond Jev》,提出JEVal基准,涵盖11,257个实例,揭示决策模型在多步交互中的可靠性缺陷。
arxiv.org ↗新闻摘要确认JEVal结果显示通用决策模型在社会模拟中存在系统性偏差,且在长轨迹任务中成功率随误差累积而下降。
arxiv.org ↗
未解決の問題
- InnerJev-27B是否能在实际生产环境中持续保持0.1秒响应下的低校准误差?
- 不同第三方基准(如JevBench与JEVal)对同一模型的评价差异源于测试集还是评分权重?
- 用户能否接受高弃权率以换取高精度,还是更倾向于强制输出带来的潜在错误风险?