8 月中旬,OpenAI 把 GPT-5.6 的「多智能体 v2」(Multi-Agent v2)全量推上线。核心变化是:主 Agent 可以把一个复杂任务自动拆给不同的子模型,每个子 Agent 还能单独设推理强度,不必再由人手动挑模型。OpenAI 总裁 Greg Brockman 把方向概括为「告别手动选模型」。背后的叙事是——模型不再是用户要纠结的选项,而是 Agent 系统内部按需调度的计算资源。
一、模型变成「内部计算资源」
在 v2 之前,开发者往往要自己判断「这一步用哪个模型」,既费心又容易配错——GitHub 上就曾因 Luna 未接入多智能体接口闹过一阵「把 Luna 还给我们」的争议。v2 把这件事交给主 Agent:它读任务、拆子任务、按难度派给合适的子模型,用户只在最上层描述目标。模型矩阵也分层清楚——Sol 攻复杂编码、Terra 扛日常开发、Luna 走最快最便宜、Daybreak 管网络安全。选模型的心智,正在被「选架构」取代。
二、Luna 把成本压到十八分之一
这套分层调度里,小模型 Luna 是关键角色。OpenAI 披露,Luna 在抽取类任务上能保住 GPT-5.5 约 98% 的准确率,成本却只有十八分之一;在 BrowseComp 上以 84.04% 追平 GPT-5.5 的 84.36%,单价从约 33 美元降到约 1.33 美元。典型复杂任务里,只有约两成步骤需要最强模型,其余可交给便宜模型。把「贵的能力」只用在刀刃上,整体推理账单随之大幅缩水——这是多智能体从炫技走向省钱的实质一步。
三、超长对话不再卡死
同一波更新里,ChatGPT 针对超长对话做了前端大改:按需加载,不再一打开就渲染全部历史。内部压力测试里,一段 741 轮、231MB 的「怪物级」对话,平均打开时间从 27.62 秒压到 1.66 秒,内存占用从约 1030MiB 降到 606MiB,网络请求从 894 次砍到 16 次。对动辄几百轮工具调用的重度 Codex 会话,界面会明显变轻。听起来是枯燥的基础设施建设,体验提升却很直接,尤其利好把 AI 当长期工作台的重度用户。
四、从选模型到选架构
多智能体 v2 真正改变的是开发心智:过去人要想「这一步用哪个模型」,现在改成「怎么把任务拆好、让系统自己派活」。这种「主 Agent 编排 + 专用子模型」的范式,正把 ChatGPT 从聊天工具推向工作流平台。你只管把难任务丢过去,拆解、调度、渲染交给系统——这也契合 OpenAI 近几个季度「从更聪明转向更省、更顺」的主线,把竞争力从单点模型拉到系统体验。
五、对开发者的真实影响
对开发者,最直接的好处是成本与卡顿双降,但要付出架构上的学习成本:得理解子 Agent 的委派边界、推理强度怎么设、长上下文怎么管理。新版本已用统一接口解决了此前 Luna 接入不一致的争议。整体看,OpenAI 这波是「前端扫历史包袱、后端通智能分发」的组合拳,方向明确——让 Agent 真正无缝地替人干活,而把「选哪个模型」从用户肩头卸下。