7 月 9 日深夜,三年没有更新动态的那条账号连发三条消息,扎克伯格官宣了 Meta 最新模型 Muse Spark 1.1。它在医疗文书、税务问答、法律 Agent 三项专业评测中拿下第一,定价却只有 Fable 5 的十分之一。戏剧性的是,就在同一时间窗口内,小扎在 Meta 内部会议上承认 AI Agent 的进展没有像预期那样快,并计划将多余的 AI 算力出租给第三方。一边是王牌高调亮相,一边是预期低调回调,两相对照,勾勒出 Meta 在 Agent 赛道上的真实处境。
一、Muse Spark 1.1:定位 Agent 的"正菜"
Muse Spark 是 Meta 超级智能实验室的多模态推理模型,初代反响平平,曾被内部人士称为"开胃菜",三个月后正菜上桌。这一代的核心定位只有一个字:Agent。它拥有 100 万 token 的上下文窗口,且能自我管理、自我压缩——聊到一半快撑爆时,会自动"瘦身",只保留后续任务真正需要的关键步骤。
在 Agent 协作上,它既能当主 Agent,负责拆解任务、制定计划、派出子 Agent 并行干活,把端到端延迟压到最低;也能当子 Agent,老老实实执行本职,知道何时把球踢回主 Agent。在电脑操控方面,它不是机械地一步一步点鼠标,而是自行判断:写脚本更快就写脚本,直接点界面更简单就点界面,甚至能一次性生成一批操作。在 Vals AI 评测中,它在医疗文书、税务问答、法律 Agent 三项拿下第一,得分分别为 88.89%、79.72% 和 20.00%,其中法律榜把前一天刚登顶的 Grok 4.5 直接掀了下去。
二、小扎的"另一面":承认不及预期
与深夜亮王牌形成反差的,是另一则内部消息。据多家媒体报道,扎克伯格在 Meta 内部会议上承认,AI Agent 的进展慢于预期,Meta 计划将闲置的 AI 算力出租给第三方。这一表态随即引发业界对"AI 投资是否过热"的讨论。
一种普遍的分析认为,这并非 Meta 的 Agent 能力不行,而是行业此前对自动化进程的节奏预期过高。当"Agent 明年就能接管大量白领工作"的叙事撞上真实交付的滞后,预期回调几乎是必然。一个公司,在对外打出最强模型牌的同时,对内承认落地节奏不及预期,恰恰说明 Agent 赛道正处于"能力涌现"与"规模落地"之间的陡峭爬坡段。
三、价格战的逻辑:以 1/10 定价切入
Muse Spark 1.1 是 Meta 第一个收费模型,一上来就打价格战,定价仅 Fable 5 的十分之一。小扎自己的描述只有一句:very low cost。这背后是算力与成本的双重考量。在 Agent 落地过程中,多步任务的 token 消耗巨大,推理成本长期是行业的高成本痛点——前有开源 Agent Harness 项目 OpenSquilla 宣称砍掉八成 token 成本,后有英伟达 Nemotron 把单次推理成本压到闭源的十分之一。Meta 用低价换份额,本质是把竞争维度从"谁的模型更强"拉到了"谁的单位智能更便宜"。
四、对行业的几点启示
专业垂直 Agent 评测正在成为新战场。过去比拼综合跑分,如今医疗、税务、法律等细分场景的 Agent 能力,更能反映模型对真实工作的适配度。价格战从消费级模型蔓延到 Agent,意味着"能力 + 成本"双轴竞争已经成形。同时,企业也需理性看待 Agent 的能力边界——小扎的预期回调,本身就是一记提醒:自动化不会一夜发生。
五、需要冷静看待的地方
三榜第一不代表通用能力全面领先,垂直评测的高分能否平移到开放业务场景,仍是未知数。以 1/10 定价切入的低价策略,其可持续性高度依赖 Meta 自身的算力成本结构,能否长期维持尚未验证。出租多余算力这一动作,反过来说明产能与真实需求之间存在错配。热闹的发布之外,Agent 的规模化落地,终究要靠可验证的降本增效数字说话。