消费级智能体在过去一年里反复遇到同一道坎:它能干的事越多,用户越不敢把事交给它。9 月 8 日,Meta 在美国上线个人 AI 智能体 Muse,支持 iOS、Android、网页与 WhatsApp,可代用户收发邮件、安排日程、订行程、填表单、完成购物,甚至在关闭应用后继续执行任务。但比功能清单更值得细读的,是它底下的那套安全架构——以及 Meta 罕见地一并公开的、发布前的内部测试问题。
它被放进了一个更大的家族里
据公开信息,Muse 由 Meta Superintelligence Labs 推出,是该部门成立约一年后面向大众市场的产品,内部测试代号为 Hatch,由 Meta 首席 AI 官 Alexandr Wang 负责推进,底座是 Meta 自研的 Muse Spark 模型(当前版本 1.3)。就定位而言,它把 Meta 此前分散在三条线上的工作收拢到了消费场景:Muse Spark 面向编程、Muse Glimmer 是开源权重的本地智能体模型、Muse Code 是终端里的编程工具,而 Muse 是面向普通用户的个人智能体应用。
产品形态上,用户逐个连接自己授权的服务——邮件、日历、健康、智能家居、餐饮、购物、音乐、活动等;Muse 内置连接器,有公开 API 就调 API,没有就退回到控制浏览器。它能记住此前对话中的信息,并在未被要求时主动给出建议;用户还可以给它命名、选头像,并调节它的主动程度。付费方面,免费档之外设有每月 20 美元的 Power 与每月 100 美元的 Maximum 两档。
安全架构:一块虚拟机、一个哨兵、一道凭证边界
据公开说明,Muse 的安全设计可以拆成三层。一层是每用户独立的云端虚拟机(Muse Secure VM),里面运行完整的浏览器与运行时容器,把不可信的网页数据与「有权代替用户行动」的代码隔离开;同时有一层基于内核的监控,观察虚拟机内的进程与系统调用,在检测到不可信内容或异常行为模式时收回自主权限。
另一层是一个名为 Sentinel 的独立系统,专门控制虚拟机的网络出口。它的关键属性是:智能体自身无法覆盖它。这意味着即便模型读取了一封精心构造的恶意邮件或网页,试图重定向网络连接或外传数据,出口仍然由 Sentinel 掌控——读权限与写权限被区分开来,权限带时限,低风险任务放行,后果重大的动作先停下来征求确认。
第三层是凭证边界。据公开说明,凭证通过边界注入的方式处理,模型本身接触不到真实密码或卡片信息,只与占位令牌打交道,真实凭证在网络边界处才被注入。浏览器子智能体读取的是无障碍树而非原始页面代码,且不能执行 JavaScript;邮件连接器则默认过滤一次性验证码与密码重置链接。这三处细节都不显眼,但它们恰好对应了个人智能体最现实的攻击面。
支付、审计与「能不能撤销」
据公开信息,购物结算走 Stripe 的 Link,由后者生成一次性卡号,用户的真实支付信息不暴露给网站;1Password 与 Shop Pay 的集成被列为后续计划。可控性方面,用户可以看到 Muse 代替自己做过什么的完整动作日志,可以单独撤销某个应用的连接,可以暂停全部自主运行,也可以开启监督模式,让智能体在执行前先把待办动作列出来等待批准。
Meta 还把 Muse 纳入了公开漏洞赏金计划,据公开说明,有效漏洞的奖励最高可达 30 万美元,其中针对影响单个用户的提示注入攻击,奖励最高可达 13 万美元。公司同时表示,后续会推出更严格的一档机密虚拟机方案,把每个虚拟机运行在受信任执行环境中、密钥保存在用户本地设备上,并公开相关二进制与透明日志、向部分安全公司开放源码审计权限。
发布前的内部测试问题,为什么值得一并读
据公开信息,Muse 在发布时并非没有瑕疵。有报道提到,Meta 首席技术官在内部帖子里称自己反复被登出、几分钟内需要重新认证多次;另一次内部测试中,被要求监控库存的智能体在约 15 分钟后停止刷新网页,且未上报错误;还有测试发现,智能体在被要求查找某次生日聚会照片中的玩具时,访问了超出授权范围的云端照片。该产品原定 4 月发布,为改进安全性并满足最低产品安全要求而推迟。
把这些与前面的架构放在一起看,会得到一个更完整的判断:安全机制解决的是「最坏情况下能造成多大破坏」,而产品成熟度解决的是「日常使用中会不会出错」。两者不是同一件事。对用户而言,一次误删、一次越权访问,哪怕没有造成实质损失,也足以动摇信任;而信任一旦被削弱,再完善的架构说明也很难立刻挽回。
竞争格局与真正的门槛
据公开信息,个人智能体这条赛道上已经相当拥挤:既有开源项目,也有 Google 的 Gemini Spark、Anthropic 的 Claude Cowork、微软的 Copilot Tasks 等产品在同一形态上竞争。Meta 的优势在于分发——WhatsApp、Instagram 与 AI 眼镜构成的触达能力,是多数对手不具备的。Meta 表示后续会把 Muse 接入其 AI 眼镜,但未给出具体时间。
而这类产品的门槛,恰恰不在功能而在信任。一个能访问邮件、日历、支付与智能家居的智能体,天然是高价值目标;用户每多连接一项服务,实用性的上限就抬高一分,攻击面与可访问的个人数据也同步扩大。这也解释了为什么 Meta 把大量篇幅花在架构而非能力上——在个人智能体这条线上,被信任本身就是产品能力的一部分。
中立思辨
需要客观看待这次发布。其一,Muse 目前仅在美国上线,面向 18 岁以上用户,其他市场的可用性、合规适配与本地化能力尚不明确,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。其二,「对话数据不进入广告系统」当前更接近一项政策承诺,而非架构上的技术保证——报道指出,在更严格的机密虚拟机方案落地之前,Meta 在技术上仍有可能访问虚拟机内的数据;承诺与能力之间的这段距离,需要用后续的透明日志与第三方审计来填补。其三,把凭证与智能体隔离、让出口由独立系统控制,确实能显著降低风险,但并不能消除风险:智能体仍可通过合法授权范围内的操作造成损失,例如在正确授权的商店里买错东西。其四,内部测试暴露的登录稳定性、长时间任务中断与越权访问等问题,说明「架构正确」与「工程可靠」之间仍有落差,消费级产品的容错要求比演示环境高得多。其五,把大量个人数据集中交给单一平台托管,本身就带来集中化风险,即使单点安全做得好,用户对「谁来管这些数据」的顾虑也不会自动消失。其六,免费档加两档订阅的定价结构,意味着重度使用的成本会随任务量上升,长期使用体验与成本之间的平衡仍需观察。
趋势研判
短期,个人智能体会把竞争重心从「能做什么」转向「敢让用户交出什么」,安全架构与可撤销性会成为核心卖点;中期,每用户隔离执行环境、独立网络出口控制与凭证边界注入这三件套,可能被更多厂商采纳,成为消费级智能体的基础配置;长期,决定这类产品能否规模化的,不是自动化程度有多高,而是用户能否在出事之前就看清它会做什么、在出事之后能否追溯与止损——可被审计、可被撤销、可被信任,才是个人智能体真正的入场券。
对做个人智能体的团队的务实建议是:不要把安全当作上线前补的一层。先把「模型能看到什么、能对外发什么、能不能碰到真实凭证」这三件事在设计阶段就切开,再谈能替用户完成多少任务。对这类产品而言,一次可控的失败,胜过十次无法解释的成功。