8 月中旬,OpenAI 上线 GPT-5.6 多智能体 V2 版本,官方称这是 ChatGPT 的一次「性能大换血」。与常规的模型能力升级不同,这次更新的主角是「编排层」:主 Agent 可以自动将子任务委派给不同模型,并为每个子任务单独设定推理强度。官方给出的性能数字相当惊人——网络请求数下降 98.2%、对话记录加载缩减 99.6%、长对话不再卡顿;Codex 同步更新,741 轮对话可秒级打开。当多智能体从「实验功能」变成「默认架构」,任务委派与推理强度调度的工程细节,正在成为决定产品体验的新战场。
一、多智能体 V2 是什么:从「单模型单线程」到「编排层」
GPT-5.6 多智能体 V2 的核心变化,是把「谁来做」的决策权交给了系统。此前,ChatGPT 处理一个复杂任务通常是单模型一路跑到底——主对话、子工具调用、并行计算共享同一套推理配置,长任务一多,对话记录膨胀、网络请求堆积,体验随之卡顿。V2 的架构则是:主 Agent 先理解用户意图,将任务拆解为多个子任务,再根据每个子任务的性质自动委派给不同模型,并为每个子任务单独设定推理强度——需要深度思考的推理任务用「重推理」配置,简单的信息查询用「轻推理」配置,避免为每一件事都付出最重的算力代价。这套「任务委派+分档推理」的设计,在工程上同时解决了两个问题:一是长对话的负载问题(网络请求数下降 98.2%、对话记录加载缩减 99.6% 正是其直接结果),二是推理成本的结构优化——不为所有任务支付最高档的推理开销。
二、性能大换血:数字背后的工程含义
「网络请求数下降 98.2%」听起来像营销话术,实际指向的是一个具体的工程问题:此前的多智能体架构中,每个子任务的执行都可能产生大量与服务器之间的往返请求,长对话场景下请求堆积成为卡顿的主要来源;V2 通过合并请求、优化状态同步、按需加载对话记录,把请求量压缩了两个数量级。「对话记录加载缩减 99.6%」则意味着:历史很长的对话不再需要整体加载,系统只加载当前执行所需的上下文片段——这正是 741 轮对话的 Codex 会话仍能秒级打开的技术基础。对开发者与重度用户而言,这套优化的直接感受是「长任务不再卡」;对 OpenAI 而言,它还有一个更实际的收益:更少的请求、更精准的推理强度分配,意味着单位任务的算力消耗下降——在推理成本成为 AI 公司利润表关键变量的当下,这是「性能优化」与「成本控制」的一体两面。
三、时间线背景:多智能体正在成为 OpenAI 的产品主线
多智能体 V2 的上线,是 OpenAI 多智能体路线上的最新一步。此前 8 月初,The Information 报道 OpenAI 正在开发暂定名 Astra 的新模型家族,支持多 Agent 协同处理数小时长时程复杂任务(其后又有报道称 Astra 因自主漏洞挖掘能力触及安全阈值而被紧急叫停相关内部工作);GPT-5.6 本身也内置了多智能体测试能力。V2 的意义在于把多智能体从「预览/测试」推进到「全量默认」——它不是又一个可选功能,而是 ChatGPT 与 Codex 当前体验的底层架构。同周的另一则人事信息也值得放在一起看:OpenAI 任命谷歌 Wiz 前总裁兼 COO Dali Rajic 为新任首席营收官,并披露周活用户超 10 亿、企业客户突破 200 万家——当产品底座换装多智能体架构、商业化团队同步换帅,OpenAI 显然在为一个「更大体量、更重编排」的下一代产品周期做准备。
四、客观看:编排的价值与工程挑战
几点客观边界需要标注。其一,98.2% 与 99.6% 等性能数字均为 OpenAI 官方口径,优化基准、测试场景与对比对象未完整披露,独立验证暂缺;其二,任务委派机制的质量取决于「谁该被派给哪个模型」的决策精度——若主 Agent 的委派判断出错(把需要深度推理的任务派给轻模型、或反之),会带来质量与成本的双重损失,行业暂未披露委派决策的准确率数据;其三,多智能体编排引入了新的可观测性难题——子任务分散在不同模型、不同推理档位之间,失败定位与行为审计的复杂度较单模型显著上升,这与大厂近期集中补课的 Agent 质检线(Eval 与 Observability)形成呼应;其四,分档推理意味着同样的任务在不同时刻可能被分配不同的算力,用户对「同一问题不同质量」的感知差异如何处理,仍是产品层面的开放问题。总体而言,GPT-5.6 多智能体 V2 把「委派」与「分档」这两个工程词变成了亿级用户产品的默认体验——当多智能体从演示走向默认,编排层正在成为与模型层同样重要的竞争维度,而这场竞争的胜负手,将藏在请求调度、成本分配与可观测性的工程细节里。