8 月 13 日,OpenAI 发布 GPT-5.6 开发者指南,把过去几个月初创团队在生产环境踩出来的降本经验系统化——核心判断是:Agent 的成本结构变了。过去必须全程挂旗舰模型的任务,如今换小模型、降推理强度、改调用架构,能拿到相当甚至更好的结果。GPT-5.6 家族(Sol / Terra / Luna)+ 新版 Responses API 的三个新原语(跨轮保留推理与压缩、原生多智能体编排、程序化工具调用),把「便宜且能打的 Agent」变成了默认选项。
🧩 本教程适合:正在为 Agent 账单发愁的开发者与技术负责人。我们拆解三档模型的选型逻辑与三个 API 原语,并给出一套可执行的「降本重构」路径。
先看数字:成本地板塌了
官方与早期客户的数据最有说服力——同档位效果,成本差一个数量级:
| 对比项 | GPT-5.5 | GPT-5.6 | 变化 |
|---|---|---|---|
| BrowseComp 检索基准 | 84.36%,$33.27 | Luna 84.04%,$1.33 | 成本约 1/25 |
| 文档抽取(Hypha 实测) | 基准准确率 | Luna 保持约 98% 准确率 | 成本约 1/18 |
| 浏览器任务(Browser Use) | 80% 完成,约 $235 | Luna 78% 完成,约 $14 | 成本约 1/17 |
| 代码检索(PlayerZero) | 基准 | Luna 接入后 F1 +5 | 推理成本 -64%、延迟 -90% |
| Agent 评测 | GPT-5.5 高推理 | Sol 低推理即超过 | 同效更省 |
别只看基准分:真正的信号是「效果-成本」曲线整体下移——Sol 在低推理强度下跑赢 GPT-5.5 高推理;Luna 在重复执行的步骤上几乎零负担。降本不是砍能力,是重新分配调用。
Step 1:三档模型怎么选——给任务分层
1 Sol / Terra / Luna 各司其职
GPT-5.6 家族三档分工:
Sol(旗舰)
· 复杂推理、多步规划、开放研究
· 需要判断力的分析步骤
· 用低/中推理强度,别总开最高档
Terra(中档)
· 高并发、延迟敏感、反复执行的步骤
· 结构化抽取、改写、分类
· 平衡质量与速度的默认选择
Luna(小尺寸)
· 文档抽取、格式化、批量子任务
· 浏览器操作、工具调用的主力
· 性价比之王:98% 准确率,1/18 成本
分配口诀:判断用 Sol,执行用 Luna,
中间活儿交给 Terra
💡 某法律科技公司的做法值得抄:手写备忘录抽取交给 Terra/Luna,只在需要判断的分析环节调用更强模型——整体开销显著下降。分层路由的通用思路可参考《DeepSeek 分层路由降本》。
Step 2:降推理强度——低档跑出高档效果
2 从「默认最高」改到「按需调档」
1. 审查现有调用:把每个 Agent 步骤的
推理强度(reasoning effort)列出来
2. 降档测试:把高频步骤降到 low,
用评测集对比输出质量
3. 官方参照:Agents' Last Exam 上
Sol 低推理 > GPT-5.5 高推理
4. 成本监控:记录降档前后的
token 消耗与完成率
注意:不是所有任务都适合降档——
涉及财务、法律、安全判断的步骤
保留高推理,其余大胆降
降档要带评测,不能拍脑袋:先选 20-50 条代表性样本做回归,确认质量不掉再全量切。成本与质量的对冲方法可参考《Agent 经济学》的完成率 × 成本矩阵。
Step 3:保留推理 + 原生压缩——长任务不重建上文
3 让推理跨轮次「续用」
新版 Responses API 的两个能力:
1. 保留推理(retained reasoning)
· 推理过程可跨模型轮次保留
· 长周期任务不必反复重建上文
2. 原生压缩(conversation compaction)
· 自动压缩长对话
· 节省输入 token 与延迟
实测数据(ARC-AGI-3):
标准框架 Sol 得分 13.3%
开启保留推理 + 压缩后 38.3%
输出 token 反而少了约 6 倍
🔑 长任务的「上下文重建」是隐性成本大头:每次重算之前的推理 = 白烧 token。保留推理把推理成果缓存下来,等于给 Agent 装了「草稿纸」。上下文管理的更细方法可看《Reasonix 前缀缓存》。
Step 4:原生多智能体编排——主 Agent 拆解,子 Agent 并行
4 并行拆解写进 API 本身
Responses API 原生支持多智能体编排:
1. 主 Agent 接收任务并拆解子任务
2. 多个子 Agent 并行推进
3. 结果交回主 Agent 汇总
4. ChatGPT 的 ultra 档就是这套机制
早期用户的反馈:
· Quadrillion:Sol 是开放式研究任务
的优秀编排者,胜过 5.5 与多数模型
· Obvious:同时管理 6 个复杂任务
质量不掉
收益:总耗时接近「最长子任务」,
而不是所有任务之和
并行 ≠ 免费:子 Agent 并行会放大 token 消耗,适合「可拆分的独立子任务」。低价值的串行步骤交给 Luna 单线程跑更省钱。编排思路可对比《Codex 多智能体 V2》的自动委派设计。
Step 5:程序化工具调用——把确定性工作挪出上下文
5 让模型「写代码」而不是「背数据」
新原语:模型直接生成 JavaScript
来编排工具调用:
1. 过滤、聚合、格式化等确定性操作
→ 由生成的代码执行
2. 模型的上下文窗口只保留
需要判断的部分
3. 效果:省 token、降延迟、
结果更可复现
示例场景:
· 抓取结果后按字段清洗 → 代码做
· 多工具返回合并去重 → 代码做
· 只有「下一步怎么决策」留给模型
💡 本质是「把模型当 CPU 而非内存」:能确定性的工作就用代码固化,模型只做判断。这与你用框架管理工具调用(如《OpenAI Agents SDK》)是互补关系。
Step 6:迁移检查清单——降本改造怎么落地
6 六步完成存量 Agent 重构
1. 盘点:列出所有 Agent 调用,
标注步骤类型(判断/执行/抽取)
2. 分层:映射到 Sol/Terra/Luna 三档
3. 降档:执行类步骤调低推理强度
4. 接原语:长任务开保留推理+压缩,
可并行任务上原生编排
5. 写代码:把确定性工具操作
改为程序化调用
6. 回归验证:跑评测集对比
完成率与成本,记录新基线
预期:多数团队 token 成本降 50-80%,
延迟同步下降
警惕「为省而省」:降本改造后仍要保留成本护栏与告警——参考《Agent 预算护栏》,并定期用《DeepSeek V4 Pro》等竞品做价格锚点校准,防止被单一厂商绑定。
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| 降推理后质量明显下滑 | 该步骤不适合低档:把这步调回高推理,或换 Terra 试 |
| 并行子 Agent 后账单暴增 | 拆分过细:合并低价值子任务,执行类交给 Luna |
| 长任务上下文越滚越长 | 开启保留推理 + 原生压缩,必要时程序化工具调用分担 |
| 不确定从哪开始改 | 按 Step 6 清单先盘点,从 token 消耗最大的三个步骤下手 |