2026 年 8 月 13 日,Google DeepMind 发布了 Gemini 3.7 Flash——距离 3.6 Flash 只隔了三周,官方称它是「迄今最强的编码与 Agent 工作引擎」。这次升级最有意思的地方在于:接口完全没变,能力全面变强,价格直接腰斩。如果你手上已经跑着基于 Gemini Flash 系列的 Agent,这可能是本季度最值得做的一次「零迁移成本」升级;如果你还在观望,本教程从收益评估、切换步骤到成本测算,带你完整走一遍。
先看成绩单:3.6 → 3.7 Flash 到底强了多少
判断一次模型升级值不值得迁移,不要看宣传语,要看与「Agent 干活」强相关的基准。以下是官方公布的核心数字(均为 3.6 → 3.7 Flash 对比):
| 基准 | 考察能力 | 3.6 Flash | 3.7 Flash | 提升 |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 真实代码编写 | 34.4% | 43.6% | +9.2pp |
| DeepSWE v1.1 | 软件工程任务 | 49.0% | 65.3% | +16.3pp |
| WebDev Arena Elo | 网页开发 | 1538 | 1588 | +50 |
| AutomationBench | 自动化操作 | 17.0% | 30.4% | +13.4pp |
| GDP.pdf | 文档生成 | 22.0% | 34.0% | +12pp |
| Terminal-bench 2.1 | 终端任务 | 78.0% | 85.8% | +7.8pp |
可以看到,几乎所有与 Agent 执行相关的指标都是双位数提升,其中 DeepSWE +16.3pp、AutomationBench +13.4pp 对长链路任务的收益最明显。更关键的是:输入价格从 $1.50 降到 $0.75 每百万 token,输出从 $7.50 降到 $3.75,且这个价格锁定到 2026 年 12 月 31 日,明年 1 月起才恢复原价。
注意:价格减半是「锁定期特惠」。12-31 之后恢复到 $1.50 / $7.50。如果你的用量规划到明年,成本测算要把「恢复原价」这个变量算进去,避免预算拍脑袋。
Step 1:盘点你的现状——什么在跑、谁在用
迁移前先回答三个问题,避免「改了个模型名就上线」的裸奔式操作:
1. 哪些服务在用 Gemini 系列模型?
(Gemini API / AI Studio / Android Studio /
Antigravity / 企业级 Agent 平台 / Spark)
2. 这些服务的关键路径是什么?
例如:多步规划类、工具调用类、长文档类
3. 有没有正在用 3.6 Flash 的生产流水线?
有的话,准备一份「回归用例集」
Step 2:确认「变」与「不变」,预判风险点
3.7 Flash 沿用了 3.6 的 API 表面(端点、参数名、流式协议都不变),但有三处能力参数值得重新配置:
1. 上下文窗口:1M token 输入,64K token 输出
(长日志、长文档类任务可以直接整段喂)
2. 思考级别:low / medium / high 三档
(高思考=更慢更贵更准;低思考=快省)
3. 模型名:gemini-3.7-flash
(与 3.6 是不同模型标识,需显式切换)
Step 3:切换模型名,跑回归用例
以 OpenAI 兼容的 Responses API 风格为例(不同 SDK 只是换模型名,逻辑相同):
# 切换前
model = "gemini-3.6-flash"
# 切换后
model = "gemini-3.7-flash"
# 然后对你准备好的 10-20 条回归用例逐条跑,
# 重点对比三类任务:
# ① 多步规划:是否拆得更细、更少走弯路
# ② 工具调用:参数是否更准、失败重试是否更少
# ③ 长文档:1M 上下文下是否还稳定引用原文
Step 4:按任务难度分配思考级别
3.7 Flash 支持 low / medium / high 三档思考预算,这是继价格减半之后第二个省钱杠杆:
思考级别 适合场景 参考用法
low 简单问答、格式化、提取 对话类 Agent 默认档
medium 一般 Agent 任务、单步工具调用 大多数工作流默认
high 复杂多步规划、代码审查、 关键任务、可接受
长文档推理 更高延迟时使用
# API 参考:在请求参数中设置 thinking_level
# (各 SDK 命名略有差异,按官方文档为准)
Step 5:吃满 1M 上下文——长任务不再切块
1M token 上下文 + 64K 输出,意味着很多之前需要「检索-切块-拼接」的长任务,现在可以直接整段输入:
典型场景:
1. 代码库重构:把整个仓库核心文件喂进去做全局审查
2. 长日志分析:一天/一周的日志直接分析,不用抽样
3. 长文档翻译/摘要:整本书分章直喂,保持术语一致
注意事项:
- 输入 token 会随长度线性增加,长任务先算账再喂
- 超长输入建议配合思考级别 high,效果更稳
- 输出 64K 是上限,超长产出考虑分段生成
算账提醒:1M 上下文很诱人,但 100 万 token 输入按 $0.75/M 也要 $0.75/次。长任务要评估「整段喂」vs「检索后喂」哪个更划算——量大时结合检索能省下可观的成本。
Step 6:算清迁移 ROI,决定灰度节奏
迁移决策最后都要落到数字上。用一张表对比迁移前后:
维度 迁移前(3.6) 迁移后(3.7) 收益
单次输入成本 $1.50/M $0.75/M 省 50%
单次输出成本 $7.50/M $3.75/M 省 50%
DeepSWE 49.0% 65.3% 返工率下降
AutomationBench 17.0% 30.4% 自动化完成率↑
长任务处理 需切块 1M 直喂 流程简化
灰度节奏建议:
第 1 周:非核心服务切 3.7,跑回归+监控
第 2 周:核心服务灰度 20%,对比关键指标
第 3 周:全量切换,并把 12-31 前的锁定价
计入明年预算(恢复后按 2 倍预留)
常见问题速查
| 你遇到的问题 | 原因 & 解决 |
|---|---|
| 免费版 Gemini 聊天界面找不到 3.7 | 3.7 Flash 主要在 API/AI Studio/Android Studio/Antigravity 等开发者入口,标准聊天 UI 的免费用户暂未开放 |
| 切到 3.7 后输出格式偶尔漂移 | 新模型多步规划更强,原 prompt 里过度约束的格式指令可适当精简,让模型按工具 schema 输出 |
| 高思考级别延迟变高 | high 档天然更慢,只对关键任务开启;对话类场景保持 low/medium |
| 明年价格恢复后成本扛不住 | 在锁定期内完成 prompt 优化与思考级别路由,把基础用量压下来再等下一轮升级 |