亚马逊开源 2B 决策模型 Strands Decider:本地中位延迟约 0.1 秒,JevBench 准确率 72%,对标 TypeSafe 的 Jev

亚马逊 AWS 旗下实验项目 Strands Labs 于 10 月 1 日在 Hugging Face 以 Apache 2.0 许可证发布 Strands Decider 2B。它不生成文本,而是在预设选项里做选择并给出概率,支持是非、单选和打分三类问题,用于 agent 工作流里的路由、工具选择、护栏和分诊。模型以 Qwen3.5-2B 为底座,加 LoRA 和一个给选项打分的指针结构;官方数据为 JevBench 公开集准确率 72.3%,在 RTX 3090 上中位延迟约 106 毫秒。它是这类「决策模型」继 TypeSafe Jev 和 PostHog Jeeves 之后的又一个开源实现,代码、训练方法和评测脚本都放在 GitHub。

它是什么

agent 跑起来以后,有大量问题其实不需要写一段话来回答:这一步该不该调用工具、该交给哪个子 agent、这个请求要不要拦下。Strands Decider 2B 就只做这件事:输入当前状态和一个类型明确的问题,返回每个选项的概率。支持三种问题:是非、多选一、按等级打分。

它由 AWS 实验项目 Strands Labs 发布,亚马逊杰出工程师 Marc Brooker 主导。模型以 Qwen3.5-2B 为底座,把「预测下一个词」换成一个给选项打分的指针结构,再加一层 LoRA。权重以 Apache 2.0 许可证放在 Hugging Face,代码、训练方法和评测在 GitHub。

数字怎么看

官方模型卡给出的 JevBench 公开集准确率是 72.3%(231 题对 167 题);VentureBeat 引用的数据是 RTX 3090 本地中位延迟约 106 毫秒,P95 约 296 毫秒,M3 MacBook 上小任务约 150 毫秒。TypeSafe 的 Jev 只提供托管 API,按每百万输入 token 0.042 美元计费。

但这两者还不能直接分出胜负:AWS 的对比图里没有 Jev 本身,也没给出自托管的单次运行成本。模型卡自己列出的短板也很实在:多步推理弱,打分类任务换一套评分标准后迁移效果差,置信度校准只在短分类任务上验证过。

影响判断

它最大的意义不是分数,而是可复现、可自托管:数据不出本机,能按自己的业务再训练。对已经在 agent 里用大模型做「是/否」判断的团队,可以挑一两个高频决策点,拿它和现有方案在自己的数据上比准确率和延迟。需要多步推理的判断,暂时还是交给大模型。TypeSafe CEO Diogo Almeida 对这批跟进者不以为然,称它们更像是「想实现一个酷架构的机器学习人员」做的东西。

via: Hugging Face 模型卡、GitHub 仓库、VentureBeat 报道、TechCrunch 报道