当大家都在讨论「多 Agent 协作」时,Anthropic 却从自己已上线的电商项目里,总结出了一条看上去更「克制」的路线:单智能体配合技能(single agent + skills)。这份指南最有价值的地方,不是给了某个炫酷架构,而是把一个老问题讲清楚了——哪些能力该交给模型,哪些约束该由系统执行。边界划清楚了,落地才不会翻车。

一、核心思路:一个会话,共享上下文,复用老系统

指南给出的主流架构并不复杂:

  • 单智能体主导:整个购物会话由一个智能体保持,而不是拆成多个互不相关的 Agent;
  • 共享上下文:用户的意图、历史、购物车状态在同一会话里连贯流转,避免「每问一次都要重新介绍自己」;
  • 技能(skills)作为能力单元:搜索、比价、加购、履约等具体动作,封装成可复用的技能,由智能体按需调用;
  • 工具复用现有业务系统:技能背后对接的是企业既有的商品库、订单系统、会员体系,而非另起炉灶。

这套设计的精髓在于「复用」。它没有要求企业为了上 Agent 而重构整套中台,而是让智能体去适配已有的业务系统。对电商这类系统成熟、数据沉淀深厚的行业,这比推倒重来现实得多。

二、指南覆盖了什么:从缓存到审批到评测

值得称道的是,这份指南不是「概念图」,而是一份工程手册。它覆盖了四个落地必答题:

  • 缓存:会话与工具结果如何缓存,避免重复调用推高成本;
  • 记忆:跨轮次的用户偏好与状态如何保留;
  • 交易审批:涉及扣款、下单等高风险动作时,如何设置确认与权限边界;
  • 评测:如何量化一个电商 Agent 的好坏,而非凭感觉上线。

并且附了可运行的参考实现。对工程团队来说,这比一篇观点文章有用得多——它把「单智能体 + 技能」从一个说法,变成了一套能抄的作业。

三、为什么是「单智能体」,而不是「多 Agent」

这恰恰是这份指南最值得讨论的取舍。过去一年,行业叙事偏向「多 Agent 分工协作」:调研 Agent、写作 Agent、评审 Agent 各司其职。Anthropic 在电商场景却更推崇单智能体 + 技能,原因很务实:

电商购物会话的特点是强状态、强连续、强上下文依赖。用户从「想买什么」到「比价」到「下单」,是一条连贯的决策链,中间任何一段上下文丢失,都会让体验断裂。单智能体主导 + 共享上下文,能最大程度保住这条链的连贯性;而多个互相独立的 Agent,反而要额外设计上下文如何传递、谁来汇总。

当然,这不是说多 Agent 错了。单智能体适合「一条连贯主线」的场景,多 Agent 更适合「天然可并行、彼此解耦」的任务。Anthropic 的选择,是针对电商这一具体场景的最优解,而非放之四海皆准的真理。

四、成本账:缓存降价,但别被单价骗了

谈电商 Agent,绕不开成本。这里有个必须正视的账本:伴随 Fable / Mythos 5.1,Anthropic 把缓存读取单价下调了约 75%,对高频复用的会话与工具结果确实是利好。但第三方评测(Artificial Analysis)的数据泼了一盆冷水——同代模型的输出用量约增至 1.7 倍,折算下来单任务成本反而上升约 20%。

这给所有做 Agent 的团队提了个醒:别只看单价,要看「模型能力 × 缓存占比 × 完成任务的总用量」。单价降了,用量涨了,总成本可能不降反升。对电商这种高并发、长会话的场景,缓存策略的设计直接决定毛利。

五、客观看:这份指南的适用边界

从价值看,这份指南做对了几件事:用真实项目而非实验室场景总结架构;把「模型能力」与「系统约束」的边界讲透;提供可运行实现而非空谈。对正在搭建电商、客服、导购类 Agent 的团队,是难得的参考。

但它的边界也要认清。第一,场景适配性:单智能体 + 技能在「连贯主线」场景好用,遇到天然并行的复杂工程任务,仍可能需要多 Agent。第二,「可运行参考实现」不等于「你的业务开箱即用」:商品库、风控、合规、支付对接,每一项都要按企业自身系统改造。第三,评测标准仍缺位:指南给了评测框架,但行业尚未形成公认的电商 Agent 评测基准,好坏很大程度上仍靠企业自建。

总结一句:Anthropic 这份指南的价值,不在于它推崇单智能体还是多 Agent,而在于它示范了一种成熟的工程态度——先想清楚约束该落在系统还是模型,再决定架构。在 Agent 落地狂奔的当下,这种「克制」反而比「炫技」更接近生产可用。