9月2日,Meta 超级智能实验室(Meta Superintelligence Labs)静悄悄地放出了 Muse Spark 1.3。相比此前高调的 GPT-6 Astra、Gemini 3.8 Flash,这则更新几乎没有铺天盖地的发布会,却透露出编程智能体赛道一个被忽视的转向:当模型能力逼近天花板,单位任务的「调用成本」正成为新的胜负手。
一、少调用、少消耗,主打长程单线程
官方给出的关键数字很克制:Muse Spark 1.3 相比 1.2 版本,完成同类工程任务大约少用 20% 的工具调用(tool calls)、少消耗约 25% 的 Token。它把「长程多任务」放在一个超长单线程里完成——面对杂乱、相互冲突的信息源,模型会自己生成上下文、补齐计划里的缺口,并一路追踪「学到了什么」直到产出最终交付物。1M token 的上下文窗口为此提供了空间基础。
二、更像「会提问的协作者」
新模型在交互上做了「拟人化」收敛:遇到含糊的指令会主动追问澄清,卡住时调用用户,做重大动作前先确认,多个任务并行时还能把请求映射到正确的子任务上。这些设计并不炫技,却正好对应企业级编程 Agent 落地时最怕的两件事——跑偏和擅自动手。值得一提的是,顶级的「max reasoning」模式虽已宣布,但仍处于安全测试、尚未开放,音频输入相比 1.2 也略有退化。
三、闭源旗舰与开放权重的双线
Muse Spark 1.3 仍是闭源权重,仅通过 Meta Model API 与 Muse Code 终端智能体调用。但同一实验室在 8 月 10 日已放出 Apache 2.0 开放权重的 Muse Glimmer 30B——这是自 Llama 4 以来首个可下载的前沿实验室模型,且去掉了 Llama 许可证里 7 亿 MAU 与欧盟的附加限制。Meta 已三次表态「开放权重的 Muse Spark 版本即将到来」,虽无日期,双线意图已经清晰:用闭源旗舰守能力高地,用开放权重抢开发者心智。
四、编程 Agent 的竞争换赛道了
过去一年,各家比的是「谁的模型更能写代码」;Muse Spark 1.3 的打法暗示,下一个比的是「谁用更少的调用把事办成」。对团队而言,工具调用次数和 Token 消耗直接挂钩账单与延迟,尤其在 Agent 把数十次模型调用串成一条长链时,单位成本差距会被放大数倍。当效率成为卖点,编程智能体的竞争,正从「能力上限」转向「性价比与可控性」。