三个档位,三个别人的底座

9 月 10 日,Abacus.AI 一次性放出了三个开放权重语言模型,命名 Smaug。真正值得琢磨的不是它发了什么,而是三个模型的底座:Smaug Agentic 跑在月之暗面的 Kimi K3 上,Smaug Flash 基于 DeepSeek V4 Flash,Smaug Mini 则是 Qwen3.8 27B。三款都是中国团队预训练出来的开源权重,Abacus.AI 做的是在其之上做面向 Agent 场景的后训练。

按官方公布的信息,Smaug Agentic 保留 Kimi K3 的 2.8 万亿参数混合专家架构、单 token 激活约 1040 亿参数、约 105 万 token 上下文,以及一个 4 亿参数的视觉编码器;Smaug Flash 保留 DeepSeek V4 Flash 的百万级上下文与服务接口,主打常驻型个人与企业 Agent;Smaug Mini 是 27B 稠密多模态模型,上下文约 26 万 token,面向高并发轻推理。权重在 Hugging Face 开放,也可走 Abacus.AI 自家的 RouteLLM 接口调用。

公司的说法是,这套微调方法能把长程 Agent 循环的表现提升 15% 到 20%,且不额外增加算力成本;而开放权重的推理成本,通常是 Anthropic、OpenAI 前沿模型的十分之一到百分之一。CEO Bindu Reddy 的表态是:开源权重正在快速逼近闭源前沿,但在长程 Agent 循环里仍然偏弱,Smaug 就是为了补上这一段。

它到底改了什么

技术细节其实给得比同类发布更具体,值得单独看。

Smaug Agentic 走的是监督微调路线,喂的是筛选过的多轮工具调用轨迹。其中一处关键处理,是把模型的推理 token 从损失函数里屏蔽掉——模型看得到自己的思考过程,但不被监督去模仿那段思考。官方给出的结果是:推理长度的中位数几乎不变,但长尾被压掉了。在一个代码推理子题上,推理长度的 99 分位降到基座模型的 0.62 倍,超过六万字符的失控思考从 8 例降到 3 例,撞到 65k 上限被截断的从 2 例降到 0 例。

Smaug Flash 的做法更取巧。它由三个 LoRA 适配器串起来训练——两步监督微调加一步偏好优化——最后合并成完整增量,而只改动了注意力机制里的因子矩阵,共 129 个。专家层、路由、embedding、投机解码模块与官方权重保持逐字节一致。这句话的实际含义是:任何能跑 DeepSeek V4 Flash 的推理栈,不改一行代码就能跑 Smaug Flash。

官方还提到一个评测中踩到的坑:回传历史时,推理内容与工具调用字段必须保留,但一些非标准的 provider 字段要剥掉,否则不少兼容 OpenAI 接口的服务会直接拒收。

评测数字该怎么读

厂商自报的成绩单里,有几处需要分开看。

Smaug Agentic 在 DeepSWE 上拿到 69.9,高于基座 Kimi K3 的 67.5,但低于同期闭源前沿模型公布的 73.0 与 70.0。在终端任务基准上拿 86.5,甚至略低于基座的 88.3。也就是说,体量最大的那一档,提升并不均匀,并非每一项都赢。

真正有含金量的在中间那一档。Smaug Flash 的综合分到 77.4,基座为 74.2,与一款高价闭源模型公布的 76.0 大致在同一区间;在 Agent 编码子项上从 46.8 提到 61.1,自动化基准从 25.1 提到 38.8。用一款便宜得多的 DeepSeek 微调,去跟一款高价闭源模型打得有来有回,这是这次发布里最值得记的一点。

需要标注的口径有三处:其一,所有数字都是厂商自报,未见第三方复现;其二,部分对照值来自不同测试框架、判分模型与采样设置,不能当作统一的横向对比;其三,体量最大的那档是在 8 张 B300、温度 1.0、推理力度拉满的条件下测的,这种配置与日常生产负载差距很大。

把「便宜 100 倍」拆开

先把逻辑理清。Smaug 是微调,不是基础模型。它的底子来自 DeepSeek、月之暗面、阿里投入重金预训练出来的开源权重,Abacus.AI 改的是行为,不是架构。所谓 10 到 100 倍,是拿自托管开源模型的边际推理成本,去比闭源 API 的标价——两边比的不是同一件事。

一个 2.8 万亿参数的模型要跑起来,需要一整套 GPU 集群、供电、散热与工程师,而且闲置时同样在付钱。厂商自己的评测就跑在 8 张 B300 上。换句话说,开源省下的主要是闭源厂商的毛利,而这份毛利并没有消失,它转移到了卖芯片、卖算力、卖电的环节。

还有一个容易被忽略的变量:负载曲线。很多「便宜十倍」的结论建立在满负荷假设上,一旦实际请求量偏低,折旧、电力与运维被摊薄到更少的调用上,单位成本会迅速翻转。评估自托管方案时,应当把 GPU 折旧、电费、闲置成本与运维人力一起摊进去,再和闭源 API 比。

同一天的另一条消息

把这次发布放到同一周的语境里看,会更有意思。同样是 9 月 10 日,Anthropic 发布了一份滥用报告,称观测到近 2 亿次与蒸馏相关的交互,归因于五起独立行动,其中规模最大的一起被指向一家中国公司:2026 年 5 月至 7 月共约 1.51 亿次交互,峰值接近每天 300 万次,分布在约 3500 个账号上。

这里必须说清楚:这是 Anthropic 单方面的调查结论,归因方法主要依赖行为特征(账号、提示词、时间分布),而非直接身份证据;「近 2 亿次」也没有独立第三方复核。把它当成一纸定论并不严谨。围绕这份报告的争议也值得记录:有研究者公开表示,这类行为更准确的称呼是滥用与越狱,而蒸馏是整个行业都在使用的后训练手段,把正常技术与大规模能力窃取混为一谈,最终可能反噬开放生态本身。

两条消息并排看,一边是中国开源权重被海外团队拿去二次加工成企业产品,一边是美国闭源模型被指被大规模取经,两股水流的流向正好相反。这本身说明一件事:中国开源权重已经成了全球 Agent 二次开发的重要地基。

对国内团队的三条提醒

其一,选边站。要么做底座,自研预训练,重资本、长周期;要么做最后一公里,即 Agent 化后训练加垂直数据加分发。夹在中间、只做通用接口转卖的那一层,会被上下两头挤掉。

其二,算力账要算全。评估「自托管能省多少」时,把折旧、电、闲置与人力都算进去,再和闭源 API 比。满负荷的漂亮数字,在低负载场景里经常翻车。

其三,合规链条要留痕。无论做底座还是做微调,数据与权重来源的授权链条会越来越重要。蒸馏争议升温,意味着「你的训练数据从哪来」迟早会被追问。

Abacus.AI 这波操作的聪明之处,是它没有去卷预训练,而是把别人的开源自重当原料,去卷 Agent 里最难也最值钱的一段:长任务不崩、工具调用不出错。但「便宜 100 倍」更像一个舆论杠杆,撬动的是话题,不是账单。真正稳赚的,往往不是改模型的人,而是给他供电、供卡、供机架的人。

该系列模型的训练数据构成、完整许可条款与商业化定价,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。