进阶 📋 6 个步骤 第 286 / 470 篇

OpenAI Codex 多智能体 V2:主 Agent 自动委派子任务,约 20% 步骤才用最强模型

8-16 Codex 全量上线 GPT-5.6「多智能体 V2」:主 Agent 自动把子任务委派给不同模型(含轻量 Luna),每个子 Agent 独立设推理强度,复杂任务仅约 20% 步骤需要最强模型。本教程从启用、拆解逻辑、强度调优到成本复盘,带你用好自动委派,告别手动选模型。

2026.08.18· 16 分钟阅读· 约 1609 字· 🤖 Codex 多智能体 V2

还在手动给每个子任务挑模型?8 月 16 日,OpenAI 在 Codex 上线了 GPT-5.6「多智能体 V2」(Multi-Agent v2)并全量推送:主 Agent 会自动把不同子任务委派给不同支持模型(含轻量模型 Luna),每个子 Agent 还能独立设置推理强度。官方数据显示,复杂任务里只有约 20% 的步骤真正需要最强模型——剩下的交给便宜模型,推理成本大幅下降。OpenAI 总裁 Brockman 的原话是:「朝着告别手动选模型的方向前进」。

🧩 本教程适合:已经在用 Codex / OpenAI 相关 Agent 的开发者,以及被「多模型选型」折腾过的团队。你将学会多智能体 V2 的运作逻辑、三种用法、推理强度调优和成本核算。

先搞懂:多智能体 V2 到底改了什么?

一句话概括:模型选择从「用户负担」变成了「系统智能」。过去的 Agent 工作流,要么全程用同一个强模型(贵),要么你手动给不同环节指定模型(累)。V2 引入一个「主 Agent 调度层」:

对比项旧方式(单模型)多智能体 V2
模型选择全程一个模型,或手动切换主 Agent 按任务难度自动委派
推理强度全局统一每个子 Agent 独立设置
成本特征强模型跑全部步骤仅约 20% 步骤用最强模型
用户要做的事描述任务 + 选模型只描述任务

别和「多 Agent 协作框架」搞混:V2 是 Codex 产品内的自动委派机制,侧重模型路由;而像 OpenAI Agents SDK 或 Google ADK 是让你自己编排多个 Agent 的框架。两者可以叠加使用。

Step 1:确认你的 Codex 已启用 V2

1 升级客户端,找到多智能体入口

多智能体 V2 是全量上线的功能,但需要较新的客户端版本:

1. 更新 Codex(桌面端 / CLI / IDE 插件均可)
2. 打开设置 Settings → 模型 Model
3. 确认出现「Multi-Agent v2 / 多智能体」开关,并保持开启
4. 在对话/任务输入框,确认可以指定子 Agent 推理强度
   (如 Low / Medium / High 三档,取决于你订阅的模型范围)
💡 若入口看不到:先确认账号版本(V2 优先向 Plus/Pro/Team 灰度后全量),并检查是否用的最新 CLI 版本。旧客户端会自动走单模型模式。

Step 2:理解「主 Agent 委派」的拆解逻辑

2 任务被自动拆成「强/中/弱」三档

V2 的调度层会先分析任务结构,再决定每个子任务交给谁:

典型任务:「修复登录页 bug 并补测试」
→ 子任务 A:定位代码问题(中等难度 → 中档模型)
→ 子任务 B:写修复补丁(高难度 → 强模型)
→ 子任务 C:补单元测试(机械活 → 轻量模型 Luna)
→ 汇总阶段:主 Agent 复核一致性(强模型)
🚀 价值点:官方统计复杂任务仅约 20% 步骤需要最强模型。这与你手动「全程上强模型」相比,成本差异可达数倍。想进一步省钱,可叠加 DeepSeek 峰谷定价 那种「把批量任务挪进低谷时段」的思路。

Step 3:给子 Agent 单独设推理强度

3 让「难任务多想、简单任务快跑」

每个子 Agent 的推理强度独立可控,这是 V2 最实用的旋钮:

1. 复杂架构改动  → 该子任务推理强度调 High
2. 模板化代码生成 → 调 Low(快且省)
3. 数据迁移/批量修改 → 调 Medium 并加自检步骤
4. 建议先全默认跑一遍,再按结果逐项调档

强度≠质量,别一刀切全 High:High 意味着更多 token 消耗和更慢响应。先用默认跑通,再对「出错率高的子任务」单独升档,才是性价比打法。

Step 4:实测一个多文件重构任务

4 用「重构+测试」验证委派效果
1. 新建一个分支,丢给它一个多文件重构任务
   「把支付模块从同步改成异步,并保持接口兼容」
2. 观察执行日志里子任务的模型分配
   (CLI 输出会显示每个步骤用了哪个模型)
3. 记录总耗时与 token 消耗
4. 对比开关 V2 前后的成本差异(设置里可临时关闭)
🔑 判断标准:V2 省不省钱,看「同样结果下的总 token × 均价」。如果任务高度同质(全是简单活),V2 收益有限;任务杂(架构+搬砖混合)收益最大。

Step 5:接入你自己的 Agent 流水线

5 在 API / SDK 层利用多模型委派

除了 Codex 界面,你也可以在自有流水线里复刻「委派」思路:

1. 用 OpenAI Agents SDK 定义主 Agent + 子 Agent 池
2. 主 Agent 负责拆解任务,按难度路由到不同模型
3. 每个子 Agent 绑定独立的 model 与 temperature
4. 结果由主 Agent 汇总、交叉校验后输出
5. 加一层预算熔断:单任务 token 超限自动降档

踩坑预警:子 Agent 越多,汇总不一致风险越高。建议强模型只保留在「拆解、复核、关键补丁」三处;其余环节信任轻量模型 + 自动化测试兜底。

Step 6:评估收益,决定要不要长期用

6 一周后看三组数字

建议按周复盘,用数据决定去留:

指标怎么算健康阈值参考
单任务成本总 token ÷ 任务数较单模型模式下降 30%+
一次通过率无需返工的提交占比≥ 70%(V2 委派后不劣化)
强模型使用占比High 推理步骤 ÷ 总步骤接近 20% 左右为佳
🎉 更系统的成本账可以看本中心《Agent 经济学入门》——把时薪、完成率、成本三张表放到一起,才能判断「模型路由」值不值得规模化。

常见问题速查

你遇到的现象大概率原因 & 解决
没看到多智能体开关客户端版本旧 / 账号未覆盖,更新后重试
子任务结果互相矛盾调强主 Agent 复核强度,或减少子 Agent 数量
成本没降反升推理强度设太高,先回到默认档再逐项调
不知道哪些步骤用了强模型看 CLI 执行日志的模型列,或开详细日志模式
← 返回教程中心