三款模型的分工:走量、常开、重编码

2026 年 9 月 10 日,Abacus.AI 发布 Smaug 系列三款开放权重语言模型——Smaug Agentic、Smaug Flash、Smaug Mini,详细公告在 9 月 13 日放出,三者均可在 Hugging Face 下载,也可通过 Abacus.AI 的 RouteLLM API 调用。分工很清晰:Smaug Agentic 面向长时运行的编码循环与复杂工作流,基于 Moonshot AI 的 Kimi K3(专家混合架构,2.8 万亿总参数、1040 亿激活参数、104 万 token 上下文、MoonViT-V2 视觉编码器)做监督微调,不改架构,沿用 Kimi K3 许可证;Smaug Flash 基于 DeepSeek V4 Flash 0731,面向需要长上下文与重度工具调用的常开个人智能体,可连 WhatsApp、Telegram、Slack 维持长程对话;Smaug Mini 基于 Qwen3.8 27B,面向多模态与轻量推理。这种「小号走量、中号常开、大号重编码」的尺寸阶梯,本身就是一种对抗闭源 API 的成本—效率策略。

Smaug 是什么:一种可迁移的微调方法

关键不在于又训了个新底座,而在于 Smaug 被定义成一种适用于任意开源基础模型的微调技术。Abacus.AI 称其在不增加推理成本的前提下,把长时运行 agentic 循环的性能提升 15% 至 20%。方法上,它把人工策划的真实世界 agentic 轨迹,与基于困难实例合成的数据结合起来;技术简报指出,这套方法的起点,正是大上下文加重复工具调用场景下运行大型 agentic 循环的成本与低效问题——以及提示缓存在时间间隔里会失效这一痛点。CEO Bindu Reddy 的表述点明了定位:「开放权重模型正快速缩小与前沿闭源模型的差距,但在长时运行的智能体循环上仍显不足;Smaug 补上这块短板,同时成本仍比闭源模型低 10 到 100 倍。」

为什么是「agentic 循环」而不是「聊天」

这轮发布的真正看点,是开放权重模型从「比谁聊天更顺」卷到了「比谁更适合跑智能体循环」。过去开放权重模型常被诟病在长时、多工具、需自我纠偏的 agentic 任务上掉队;Smaug Agentic 的模型卡片给出了一组分数:GPQA Diamond 94.1、AA-LCR 75.7、DeepSWE 69.9、Terminal-Bench 2.1 86.5、SciCode 60.8、LiveBench agentic coding 64.6、AutomationBench 31.0、MMMU-Pro 81.0,并报告在 DeepSWE、LiveBench agentic coding、SciCode 等项上较 Kimi K3 基座有 2 分左右的提升,p99 推理长度降到基座约 0.6 倍。这些数字尚待独立复现,但方向很清楚:微调的重心从「回答质量」移到了「跑完一长串工具调用后还准不准」。

对企业:把敏感数据留在防火墙内

开放权重的商业楔子,是数据控制权。Abacus.AI 强调企业可以把 Smaug 部署在自己的云 VPC 甚至内部 GPU 集群里,敏感数据与凭证不必出防火墙;RouteLLM 则给不愿自建推理的团队一个托管选项,之后再迁移回内部基础设施。这把「自我托管的开放权重智能体栈」直接摆到闭源前沿 API 的对面:一边是可靠性与托管便利,一边是成本与数据主权。对受监管行业与对数据出境敏感的市场,后者的权重正在上升。Smaug 也不是孤例——它与 DeepSeek、阿里 Qwen 团队、Moonshot 的 Kimi 项目一起,把开放权重竞争从「底座参数」推进到「agentic 专用微调」这一更贴近生产的层。

边界与待观察

当然要冷静。Abacus.AI 称提升 15% 至 20% 来自其技术简报,尚缺第三方独立基准与更细的统计不确定性披露;「10 到 100 倍更便宜」是相对闭源订阅定价的口径,实际总拥有成本还取决于自托管算力。Smaug Agentic 沿用 Kimi K3 许可证,使用者须遵守其条款;训练数据与流程并未完全公开,属于开放权重而非完全开源。对采购方,更稳的结论是:开放权重模型在 agentic 循环上的可用水位正在快速抬升,但是否能在生产里替代 Opus 级闭源模型,仍要看具体任务、数据与合规约束,而不是只看一张分数表。

结语

Abacus.AI 的 Smaug 系列,把一个正在成形的趋势摆到了台前:智能体赛道的底座竞争,正从「谁的闭源模型更强」外溢到「谁的开放权重更适合跑长循环、且成本可控」。三款模型的尺寸阶梯、可自托管的权重、以及把 agentic 轨迹当训练信号的思路,给企业在前沿 API 之外提供了一条把数据与成本留在手里的路径。至于这套开放权重底座能否真正扛起生产级智能体,答案不在发布会,而在更多独立评测与真实部署里,后续将持续跟进。