决策模型品类
4 steps1 pieces5 Sources
“决策模型”正从实验性概念演变为AI基础设施的一个独立品类。与传统大语言模型生成文本不同,这类被称为“System One”的模型仅输出结构化判断(如选项、概率或评分),旨在以毫秒级延迟处理Agent工作流中的高频路由与分类任务。
该品类的爆发始于9月下旬TypeSafe AI发布Jev,随后AWS于10月1日推出开源竞品Strands Decider 2B,中国初创公司StartLux也在9月30日发布多规格开源模型并宣称在基准测试中超越Jev。尽管各家厂商均强调其低延迟与高校准度优势,但关于谁真正占据性能榜首尚无定论:StartLux声称在Decision Index上领先,而AWS则指出Jev存在结构性缺陷且自家模型在JevBench表现优异。此外,由于缺乏统一的第三方独立评测标准,目前的排名多基于厂商自测或特定榜单快照,实际部署效果仍待验证。
How it got here
TypeSafe AI发布Jev,定义“System One”决策模型,主打快速结构化判断而非文本生成。
sohu.com ↗StartLux发布开源决策模型系列(0.8B至27B),宣称在Decision Index基准测试中以63.88分超越Jev的57.91分。
eu.36kr.com ↗AWS Strands Labs发布开源模型Strands Decider 2B,采用Qwen3.5底座加指针头架构,RTX 3090中位延迟约115ms。
siliconangle.com ↗Databricks等厂商跟进,媒体确认“决策模型”已成为继LLM后的新AI类别,多家大厂同周入场。
databricks.com ↗
What is still unsettled
- 不同厂商使用的基准测试(JevBench vs Decision Index)口径不一,是否存在公认的第三方独立评测标准?
- 在复杂推理场景下,决策模型是否真的能完全替代轻量级LLM,还是必须与Reasoning Model配合使用?
- 各模型公布的准确率数据多为自测或特定快照,其在真实生产环境中的长期稳定性如何?