10 月 1 日,AWS 旗下的实验性项目 Strands Labs 放出 Strands Decider 2B:一个约 20 亿参数的开源决策模型,起手于阿里 Qwen3.5-2B 底座,以 Apache 2.0 许可开放权重、训练数据与脚本。它不写文章、不写代码,只在智能体工作流里回答「该选哪个」「该不该调这个工具」这类闭域问题,并在一遍前向里给出概率分布与置信度。这类把「决策」从生成里拆出来的小模型,正悄悄成为智能体成本与延迟竞赛里的一条新赛道。
背景:智能体循环里大量窄判断,不值得每次调大模型
一个跑起来的智能体,真正需要「写点什么」的环节其实没那么多。更多时候它在做窄判断:这次调用该用哪个工具、用户给的参数是否齐全、这条策略是否踩线、下一步该路由给谁。这些事如果每次都丢给前沿大模型去生成一段理由,既慢又贵,还把结构化输出交给概率模型自由发挥。九月 TypeSafe 推出 Jev、把这类做法带火之后,短短两周里出现了多款可下载权重的决策模型。Strands Decider 2B 是其中由大云厂商下场、且把训练配方一并开源的一个,定位上刻意和 Jev 的托管 API 拉开:你拿不到便宜的托管价,但能自己跑、自己改。
Hobson 架构:去掉语言模型头,换一个指针评分头
Decider 2B 的做法并不神秘。它保留 Qwen3.5-2B 的躯干,去掉预测下一个词的语言模型头,换上一个约百万参数的指针评分头,用 rank-16 的 LoRA 训练。于是模型不再逐词生成文本,而是在一次前向里,对调用方给好的若干选项直接打分、返回分布。AWS 把这个设计叫做 Hobson。代价是它不能写代码、不能总结、不能聊天,连复杂推理也不擅长——但那本就不是它的活。它的卖点恰恰是输出空间收窄之后带来的可预测与低延迟,以及对结构化步骤的可靠把控。
它坐在工具调用之前:先判「该不该调」
官方示例把 Decider 放在智能体调用天气工具之前。当用户问天气却没说城市,Decider 会先判断「城市是否真的来自用户请求」「现在调用是否过早」,再决定放行、回问还是请求确认。Strands 框架已有的干预机制可以据此放行、拒绝、要求确认或给出引导。需要强调的是,模型只给判断,应用怎么用这个判断仍是开发者定义的:阈值、问题、后续动作都在人手里。换句话说,它把高频而窄的闸门从贵的大模型身上卸下来,大模型只保留真正需要生成的环节。
速度与精度:本地的便宜,云端的稳
AWS 披露,在公开基准 JevBench 的 231 道任务上,Decider 2B 答对了 167 道,约 72.3 个百分点;在本地 Nvidia RTX 3090 上中位决策延迟约 106 毫秒,九成五分位约 296 毫秒(含一次约 7.7 秒的冷启动)。TypeSafe 的托管 Jev 端到端约 70 到 500 毫秒。账面上本地小模型更省更快,但 Strands 也老实说明:难度分层里简单档接近全对、困难档只有约一半。对团队而言,真正的取舍不是「开源一定更便宜」,而是把决策这一步搬到自己机器上之后,能否摆脱每次调用都走外部 API 的经济与隐私依赖。
为什么值得写:可复现,是决策模型赛道的分水岭
把 Decider 2B 和 Jev 放在同一赛道看,二者的不同不在「谁能决策」,而在「谁把做法交出来」。Jev 权重私有、按调用计费;Decider 2B 把权重、训练数据、脚本一起开放,开发者能审计配方、在自己语料上微调、把路由与策略判断留在内网。对智能体基建来说,这种可复现性意味着「决策层」有可能像向量库、编排框架一样,成为可以自选、自托管的一层,而不是被锁进某个托管端点。当智能体每天都在做成千上万次小决策,这一层的成本与可控性会被持续放大。
边界:它仍是实验,不是生产服务
需要冷静看待的是,Strands Labs 自二月成立起就定位为实验场,Decider 2B 目前不是 AWS 的托管服务,也没有公布生产用户与规模化成本实测。困难档准确率、长文档与陌生评分规则的短板都是官方模型卡写明的。置信度分数虽然可用,但是基于另一组短文本分类样例调过,落到自己的工作负载上仍需自测再决定是否自动放行。对选型方更实在的建议是:先在自己的路由、工具选择、策略检查任务上复一遍基准,再谈替代托管 API 的经济账,而不是被「开源、免费、毫秒级」几个词直接带跑。
结语
Strands Decider 2B 的意义,不在于又多了一个小模型,而在于它把「决策」这门活从生成模型里正式拆出来,并用开源可复现的方式交给开发者自己跑。当智能体的瓶颈从「能不能生成」转向「每一次小判断要花多少」,这一类本地、闭域、可审计的决策模型,很可能成为 agent 堆栈里默默省钱的那一层。