智能体平台的竞争,正在从「模型谁更强」转向「能不能被当成一个操作系统来用」。7 月 23 日,Anthropic 在其托管智能体平台 CMA(Claude Managed Agents)上一口气推出六项更新:技能上限从 20 拉到 500、思考力度支持五档调速、种子会话一步冷启动、子 Agent 实时流下探到线程级、新增 7 种生命周期 webhook、版本字段变可选。对于一个过去 45 天里 Fable 5 与 Mythos 5 同发、Sonnet 5 降价、Claude Code 近乎日更的团队来说,这更像是把智能体从「API 产品」一步步改造成「可运维平台」的又一块拼图。
一、技能上限 20→500:一个会话装下整个业务部门
CMA 里的 Skills(技能),是给 Agent 注入专业指令与知识的「知识包」。此前上限只有 20 个——一个金融客服 Agent,光开户、KYC、反洗钱、投诉处理、合规免责、多语言切换就占去七八个,加上监管差异和 AB 测试版本,很快撞天花板。如今上限拉到 500,且由会话内所有 Agent 共享,跑在统一托管沙箱里,共享内存与环境变量,由协调器统一调度。这意味着一个会话足以对应一个完整的业务单元:法务文档、产品手册、销售话术、运维 runbook 全部压缩进同一个 Agent 的认知边界,甚至能把整套代码库规范、CI 流水线配置、部署目标塞进去,让 Agent 从写代码到上线一条龙全知晓。过去要拆给几十个专业 Agent 的活,现在一个会话就能消化。
二、思考力度五档调速:简单题不烧满血 token
effort(思考力度)参数在 API 层早就存在,但 CMA 里的 Agent 以前不能单独设置——整个 session 跑同一档位,问「今天几号」和「审计 500 页财报」用的是同一套推理深度,简单问题的过度推理纯粹在烧 token。新更新把这个参数直接写进每个 Agent 的模型配置,提供 low / medium / high / xhigh / max 五档。前端客服答天气,一档足矣、几乎不耗 token;后端工程师排查微服务故障,五档全开、翻遍日志推演根因。同一个会话、按场景选档位,把算力用在真正需要的地方——这对按量计费的 Agent 运行成本,是实打实的杠杆。
三、种子会话 + 线程级可观测:从黑盒到透视窗
过去子 Agent 像是「放出去就不管」的黑匣子。新更新做了两件事:其一,种子会话(seed session)一步创建即可携带最多 50 条初始事件,冷启动不再面对空白面板;其二,子 Agent 的实时流下探到线程级,每个子 Agent 跑到哪、想到哪、中间输出与决策路径全部透明可见。配套新增的 7 种 webhook 覆盖从环境创建到记忆存储的全生命周期,开发者可以据此退掉轮询、用事件驱动编排 Agent 集群;版本字段改为可选,又省掉一层版本管理开销。协调器、共享内存、五档算力、线程级可观测——这四件套叠在一起,Agent 的协作方式已经从「单体脚本」进化到了「分布式系统」。
四、客观看:Agent OS 浮出水面,缝隙也在变多
把六项更新连起来读,Anthropic 的意图很清楚:让智能体的认知范围超过人类的组织边界,企业不再需要为每个部门建一个独立 Agent。从 API 产品到可运维平台,这条路的里程碑意义不亚于一次模型发布。同步消息还显示,Claude 语音模式即将支持调用 Opus 与 Sonnet 的更强模型(目前统一使用 Haiku 4.5)。但客观看,能力密度越高,配置的复杂度与「缝缝补补」的现实就越凸显:当每个数字翻倍、每档都到位、每条流都可见,开发者要不要为这套「操作系统」的复杂度买单,仍要等真实企业工作负载来检验。Agent OS 的雏形已露,但离「人人能装」还隔着一层工程易用性。