Strands决策模型
4 단계0 건5 출처
AWS 的 Strands Labs 于 10 月 1 日开源了 Strands Decider 2B:一个约 19 亿参数、不生成文本、只在一组给定选项里做选择的“决策模型”(System 1 模型)。它基于 Qwen3.5-2B-Base,去掉语言生成头,换上一个约 100 万参数的 pointer head,一次前向传播即给出 choice / noul(是/否概率)/ score 三种答案,并附带置信度。权重与代码以 Apache-2.0 发布,可在本地 CPU、消费级 GPU 或 Apple 芯片 Mac 上运行,官方称 RTX 3090 上中位延迟 115 毫秒。
【背景】决策模型成为独立品类,源于 TypeSafe AI 上月推出 Jev;OpenAI 的 Decisions API 截至 9 月 29 日仍为限量预览。AWS 的差异在于自托管与可重训:问题与候选可随请求更换,训练配方也一并公开。
【存疑】分歧集中在“能不能信”。AWS 自报 v19 在 JevBench 公开集准确率 0.723、ECE 0.052,但同一仓库指出 Mapika 的 decider-2b v11 在同一测试框架上高出 8 题;且该模型未进入更新的 v1.5.4 综合榜。第三方还提醒,choice 的 confidence 是概率分布的归一化集中度,不等于“正确概率”,需另行验证。团队自己也承认它在复杂问题上弱于推理模型,不适合编码、聊天或摘要。
【编按】开源不等于可放心自动执行:随附 HTTP 服务默认绑定 127.0.0.1 且无鉴权,生产环境需自建认证层;目前也没有托管推理服务商提供该模型。
현재까지의 과정
JevBench v1.4.2 榜单发布,Strands Decider v19 在 2B 级别 33 个模型中排第 3;剔除 3 个略超 2B 的模型后为 30 个中第 1。
marktechpost.com ↗AWS Strands Labs 开源 Strands Decider 2B,权重上 Hugging Face(Apache-2.0),代码、训练脚本与示例上 GitHub。
siliconangle.com ↗技术细节公布:基于 Qwen3.5-2B-Base,去掉 LM head,换约 100 万参数 pointer head,rank-16 LoRA;v19 在 JevBench 公开集准确率 0.723,Brier 0.342,ECE 0.052,RTX 3090 中位延迟 115 毫秒。
marktechpost.com ↗第三方分析指出 choice 的 confidence 是归一化集中度而非正确概率,并对比 Jev(托管 API)与 OpenAI Decisions API(9 月 29 日仍为限量预览)的交付方式差异。