高级 📋 6 个步骤 第 302 / 470 篇

GPT-5.6 智能体降本指南:Sol/Terra/Luna 三档模型 + Responses API 三个省钱原语

8-13 OpenAI 发布 GPT-5.6 家族与开发者指南:Sol 低推理跑赢旧旗舰高推理、Luna 成本 1/18 仍保 98% 准确率、原生多智能体编排 + 程序化工具调用。本教程教你按新成本结构重构 Agent 调用链。

2026.08.21· 14 分钟阅读· 约 1799 字· 💰 GPT-5.6

8 月 13 日,OpenAI 发布 GPT-5.6 开发者指南,把过去几个月初创团队在生产环境踩出来的降本经验系统化——核心判断是:Agent 的成本结构变了。过去必须全程挂旗舰模型的任务,如今换小模型、降推理强度、改调用架构,能拿到相当甚至更好的结果。GPT-5.6 家族(Sol / Terra / Luna)+ 新版 Responses API 的三个新原语(跨轮保留推理与压缩、原生多智能体编排、程序化工具调用),把「便宜且能打的 Agent」变成了默认选项。

🧩 本教程适合:正在为 Agent 账单发愁的开发者与技术负责人。我们拆解三档模型的选型逻辑与三个 API 原语,并给出一套可执行的「降本重构」路径。

先看数字:成本地板塌了

官方与早期客户的数据最有说服力——同档位效果,成本差一个数量级:

对比项GPT-5.5GPT-5.6变化
BrowseComp 检索基准84.36%,$33.27Luna 84.04%,$1.33成本约 1/25
文档抽取(Hypha 实测)基准准确率Luna 保持约 98% 准确率成本约 1/18
浏览器任务(Browser Use)80% 完成,约 $235Luna 78% 完成,约 $14成本约 1/17
代码检索(PlayerZero)基准Luna 接入后 F1 +5推理成本 -64%、延迟 -90%
Agent 评测GPT-5.5 高推理Sol 低推理即超过同效更省

别只看基准分:真正的信号是「效果-成本」曲线整体下移——Sol 在低推理强度下跑赢 GPT-5.5 高推理;Luna 在重复执行的步骤上几乎零负担。降本不是砍能力,是重新分配调用。

Step 1:三档模型怎么选——给任务分层

1 Sol / Terra / Luna 各司其职
GPT-5.6 家族三档分工:

Sol(旗舰)
· 复杂推理、多步规划、开放研究
· 需要判断力的分析步骤
· 用低/中推理强度,别总开最高档

Terra(中档)
· 高并发、延迟敏感、反复执行的步骤
· 结构化抽取、改写、分类
· 平衡质量与速度的默认选择

Luna(小尺寸)
· 文档抽取、格式化、批量子任务
· 浏览器操作、工具调用的主力
· 性价比之王:98% 准确率,1/18 成本

分配口诀:判断用 Sol,执行用 Luna,
中间活儿交给 Terra
💡 某法律科技公司的做法值得抄:手写备忘录抽取交给 Terra/Luna,只在需要判断的分析环节调用更强模型——整体开销显著下降。分层路由的通用思路可参考《DeepSeek 分层路由降本》。

Step 2:降推理强度——低档跑出高档效果

2 从「默认最高」改到「按需调档」
1. 审查现有调用:把每个 Agent 步骤的
   推理强度(reasoning effort)列出来
2. 降档测试:把高频步骤降到 low,
   用评测集对比输出质量
3. 官方参照:Agents' Last Exam 上
   Sol 低推理 > GPT-5.5 高推理
4. 成本监控:记录降档前后的
   token 消耗与完成率

注意:不是所有任务都适合降档——
涉及财务、法律、安全判断的步骤
保留高推理,其余大胆降

降档要带评测,不能拍脑袋:先选 20-50 条代表性样本做回归,确认质量不掉再全量切。成本与质量的对冲方法可参考《Agent 经济学》的完成率 × 成本矩阵。

Step 3:保留推理 + 原生压缩——长任务不重建上文

3 让推理跨轮次「续用」
新版 Responses API 的两个能力:

1. 保留推理(retained reasoning)
   · 推理过程可跨模型轮次保留
   · 长周期任务不必反复重建上文
2. 原生压缩(conversation compaction)
   · 自动压缩长对话
   · 节省输入 token 与延迟

实测数据(ARC-AGI-3):
标准框架 Sol 得分 13.3%
开启保留推理 + 压缩后 38.3%
输出 token 反而少了约 6 倍
🔑 长任务的「上下文重建」是隐性成本大头:每次重算之前的推理 = 白烧 token。保留推理把推理成果缓存下来,等于给 Agent 装了「草稿纸」。上下文管理的更细方法可看《Reasonix 前缀缓存》。

Step 4:原生多智能体编排——主 Agent 拆解,子 Agent 并行

4 并行拆解写进 API 本身
Responses API 原生支持多智能体编排:

1. 主 Agent 接收任务并拆解子任务
2. 多个子 Agent 并行推进
3. 结果交回主 Agent 汇总
4. ChatGPT 的 ultra 档就是这套机制

早期用户的反馈:
· Quadrillion:Sol 是开放式研究任务
  的优秀编排者,胜过 5.5 与多数模型
· Obvious:同时管理 6 个复杂任务
  质量不掉

收益:总耗时接近「最长子任务」,
而不是所有任务之和

并行 ≠ 免费:子 Agent 并行会放大 token 消耗,适合「可拆分的独立子任务」。低价值的串行步骤交给 Luna 单线程跑更省钱。编排思路可对比《Codex 多智能体 V2》的自动委派设计。

Step 5:程序化工具调用——把确定性工作挪出上下文

5 让模型「写代码」而不是「背数据」
新原语:模型直接生成 JavaScript
来编排工具调用:

1. 过滤、聚合、格式化等确定性操作
   → 由生成的代码执行
2. 模型的上下文窗口只保留
   需要判断的部分
3. 效果:省 token、降延迟、
   结果更可复现

示例场景:
· 抓取结果后按字段清洗 → 代码做
· 多工具返回合并去重 → 代码做
· 只有「下一步怎么决策」留给模型
💡 本质是「把模型当 CPU 而非内存」:能确定性的工作就用代码固化,模型只做判断。这与你用框架管理工具调用(如《OpenAI Agents SDK》)是互补关系。

Step 6:迁移检查清单——降本改造怎么落地

6 六步完成存量 Agent 重构
1. 盘点:列出所有 Agent 调用,
   标注步骤类型(判断/执行/抽取)
2. 分层:映射到 Sol/Terra/Luna 三档
3. 降档:执行类步骤调低推理强度
4. 接原语:长任务开保留推理+压缩,
   可并行任务上原生编排
5. 写代码:把确定性工具操作
   改为程序化调用
6. 回归验证:跑评测集对比
   完成率与成本,记录新基线

预期:多数团队 token 成本降 50-80%,
延迟同步下降

警惕「为省而省」:降本改造后仍要保留成本护栏与告警——参考《Agent 预算护栏》,并定期用《DeepSeek V4 Pro》等竞品做价格锚点校准,防止被单一厂商绑定。

常见问题速查

你遇到的现象大概率原因 & 解决
降推理后质量明显下滑该步骤不适合低档:把这步调回高推理,或换 Terra 试
并行子 Agent 后账单暴增拆分过细:合并低价值子任务,执行类交给 Luna
长任务上下文越滚越长开启保留推理 + 原生压缩,必要时程序化工具调用分担
不确定从哪开始改按 Step 6 清单先盘点,从 token 消耗最大的三个步骤下手
← 返回教程中心