还在手动给每个子任务挑模型?8 月 16 日,OpenAI 在 Codex 上线了 GPT-5.6「多智能体 V2」(Multi-Agent v2)并全量推送:主 Agent 会自动把不同子任务委派给不同支持模型(含轻量模型 Luna),每个子 Agent 还能独立设置推理强度。官方数据显示,复杂任务里只有约 20% 的步骤真正需要最强模型——剩下的交给便宜模型,推理成本大幅下降。OpenAI 总裁 Brockman 的原话是:「朝着告别手动选模型的方向前进」。
先搞懂:多智能体 V2 到底改了什么?
一句话概括:模型选择从「用户负担」变成了「系统智能」。过去的 Agent 工作流,要么全程用同一个强模型(贵),要么你手动给不同环节指定模型(累)。V2 引入一个「主 Agent 调度层」:
| 对比项 | 旧方式(单模型) | 多智能体 V2 |
|---|---|---|
| 模型选择 | 全程一个模型,或手动切换 | 主 Agent 按任务难度自动委派 |
| 推理强度 | 全局统一 | 每个子 Agent 独立设置 |
| 成本特征 | 强模型跑全部步骤 | 仅约 20% 步骤用最强模型 |
| 用户要做的事 | 描述任务 + 选模型 | 只描述任务 |
别和「多 Agent 协作框架」搞混:V2 是 Codex 产品内的自动委派机制,侧重模型路由;而像 OpenAI Agents SDK 或 Google ADK 是让你自己编排多个 Agent 的框架。两者可以叠加使用。
Step 1:确认你的 Codex 已启用 V2
多智能体 V2 是全量上线的功能,但需要较新的客户端版本:
1. 更新 Codex(桌面端 / CLI / IDE 插件均可)
2. 打开设置 Settings → 模型 Model
3. 确认出现「Multi-Agent v2 / 多智能体」开关,并保持开启
4. 在对话/任务输入框,确认可以指定子 Agent 推理强度
(如 Low / Medium / High 三档,取决于你订阅的模型范围)
Step 2:理解「主 Agent 委派」的拆解逻辑
V2 的调度层会先分析任务结构,再决定每个子任务交给谁:
典型任务:「修复登录页 bug 并补测试」
→ 子任务 A:定位代码问题(中等难度 → 中档模型)
→ 子任务 B:写修复补丁(高难度 → 强模型)
→ 子任务 C:补单元测试(机械活 → 轻量模型 Luna)
→ 汇总阶段:主 Agent 复核一致性(强模型)
Step 3:给子 Agent 单独设推理强度
每个子 Agent 的推理强度独立可控,这是 V2 最实用的旋钮:
1. 复杂架构改动 → 该子任务推理强度调 High
2. 模板化代码生成 → 调 Low(快且省)
3. 数据迁移/批量修改 → 调 Medium 并加自检步骤
4. 建议先全默认跑一遍,再按结果逐项调档
强度≠质量,别一刀切全 High:High 意味着更多 token 消耗和更慢响应。先用默认跑通,再对「出错率高的子任务」单独升档,才是性价比打法。
Step 4:实测一个多文件重构任务
1. 新建一个分支,丢给它一个多文件重构任务
「把支付模块从同步改成异步,并保持接口兼容」
2. 观察执行日志里子任务的模型分配
(CLI 输出会显示每个步骤用了哪个模型)
3. 记录总耗时与 token 消耗
4. 对比开关 V2 前后的成本差异(设置里可临时关闭)
Step 5:接入你自己的 Agent 流水线
除了 Codex 界面,你也可以在自有流水线里复刻「委派」思路:
1. 用 OpenAI Agents SDK 定义主 Agent + 子 Agent 池
2. 主 Agent 负责拆解任务,按难度路由到不同模型
3. 每个子 Agent 绑定独立的 model 与 temperature
4. 结果由主 Agent 汇总、交叉校验后输出
5. 加一层预算熔断:单任务 token 超限自动降档
踩坑预警:子 Agent 越多,汇总不一致风险越高。建议强模型只保留在「拆解、复核、关键补丁」三处;其余环节信任轻量模型 + 自动化测试兜底。
Step 6:评估收益,决定要不要长期用
建议按周复盘,用数据决定去留:
| 指标 | 怎么算 | 健康阈值参考 |
|---|---|---|
| 单任务成本 | 总 token ÷ 任务数 | 较单模型模式下降 30%+ |
| 一次通过率 | 无需返工的提交占比 | ≥ 70%(V2 委派后不劣化) |
| 强模型使用占比 | High 推理步骤 ÷ 总步骤 | 接近 20% 左右为佳 |
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| 没看到多智能体开关 | 客户端版本旧 / 账号未覆盖,更新后重试 |
| 子任务结果互相矛盾 | 调强主 Agent 复核强度,或减少子 Agent 数量 |
| 成本没降反升 | 推理强度设太高,先回到默认档再逐项调 |
| 不知道哪些步骤用了强模型 | 看 CLI 执行日志的模型列,或开详细日志模式 |