进阶 📋 6 个步骤 第 281 / 470 篇

Gemini 3.7 Flash 上手:给 Agent 换上新引擎,编码基准双位数提升 + 价格减半

Google 8-13 发布 Gemini 3.7 Flash——「迄今最强的编码与 Agent 工作引擎」:FrontierCode 34.4→43.6%、DeepSWE 49→65.3%、AutomationBench 17→30.4%,输入价减半(年底前锁定 0.75 美元/百万 token)。本教程带你评估迁移收益、切换模型、按思考级别调优,并用 1M 上下文跑长任务。

2026.08.17· 15 分钟阅读· 约 1976 字· ⚡ Gemini 3.7 Flash

2026 年 8 月 13 日,Google DeepMind 发布了 Gemini 3.7 Flash——距离 3.6 Flash 只隔了三周,官方称它是「迄今最强的编码与 Agent 工作引擎」。这次升级最有意思的地方在于:接口完全没变,能力全面变强,价格直接腰斩。如果你手上已经跑着基于 Gemini Flash 系列的 Agent,这可能是本季度最值得做的一次「零迁移成本」升级;如果你还在观望,本教程从收益评估、切换步骤到成本测算,带你完整走一遍。

📌 本教程适合:已经在用 Gemini API / AI Studio / Antigravity 跑 Agent 的开发者,或正在对比模型、准备迁移的团队。想看 Gemini 3.5 Flash 的 computer_use 能力可看《Gemini computer_use 上手》;想了解云端长任务托管 Agent 可看《Gemini Managed Agents》。

先看成绩单:3.6 → 3.7 Flash 到底强了多少

判断一次模型升级值不值得迁移,不要看宣传语,要看与「Agent 干活」强相关的基准。以下是官方公布的核心数字(均为 3.6 → 3.7 Flash 对比):

基准考察能力3.6 Flash3.7 Flash提升
FrontierCode 1.1 Main真实代码编写34.4%43.6%+9.2pp
DeepSWE v1.1软件工程任务49.0%65.3%+16.3pp
WebDev Arena Elo网页开发15381588+50
AutomationBench自动化操作17.0%30.4%+13.4pp
GDP.pdf文档生成22.0%34.0%+12pp
Terminal-bench 2.1终端任务78.0%85.8%+7.8pp

可以看到,几乎所有与 Agent 执行相关的指标都是双位数提升,其中 DeepSWE +16.3pp、AutomationBench +13.4pp 对长链路任务的收益最明显。更关键的是:输入价格从 $1.50 降到 $0.75 每百万 token,输出从 $7.50 降到 $3.75,且这个价格锁定到 2026 年 12 月 31 日,明年 1 月起才恢复原价。

注意:价格减半是「锁定期特惠」。12-31 之后恢复到 $1.50 / $7.50。如果你的用量规划到明年,成本测算要把「恢复原价」这个变量算进去,避免预算拍脑袋。

Step 1:盘点你的现状——什么在跑、谁在用

1 建立迁移清单,先别急着改代码

迁移前先回答三个问题,避免「改了个模型名就上线」的裸奔式操作:

1. 哪些服务在用 Gemini 系列模型?
   (Gemini API / AI Studio / Android Studio /
     Antigravity / 企业级 Agent 平台 / Spark)
2. 这些服务的关键路径是什么?
   例如:多步规划类、工具调用类、长文档类
3. 有没有正在用 3.6 Flash 的生产流水线?
   有的话,准备一份「回归用例集」
💡 回归用例集不必复杂:把线上真实请求里典型的 10-20 条 prompt + 对应工具 schema 存成 JSON,切换后逐条对比输出质量即可。这是迁移 Agent 模型性价比最高的验证方式。

Step 2:确认「变」与「不变」,预判风险点

2 同一套 API,能力参数要重新认识

3.7 Flash 沿用了 3.6 的 API 表面(端点、参数名、流式协议都不变),但有三处能力参数值得重新配置:

1. 上下文窗口:1M token 输入,64K token 输出
   (长日志、长文档类任务可以直接整段喂)
2. 思考级别:low / medium / high 三档
   (高思考=更慢更贵更准;低思考=快省)
3. 模型名:gemini-3.7-flash
   (与 3.6 是不同模型标识,需显式切换)
🔑 官方提示:模型在多步规划上「明显更强」。这意味着你原来为了补偿规划能力而写的那些「每步强制确认」的 prompt,可以逐步放松——先保留,观察两轮再决定。

Step 3:切换模型名,跑回归用例

3 一行代码切到新引擎,重点盯多步任务

以 OpenAI 兼容的 Responses API 风格为例(不同 SDK 只是换模型名,逻辑相同):

# 切换前
model = "gemini-3.6-flash"

# 切换后
model = "gemini-3.7-flash"

# 然后对你准备好的 10-20 条回归用例逐条跑,
# 重点对比三类任务:
#   ① 多步规划:是否拆得更细、更少走弯路
#   ② 工具调用:参数是否更准、失败重试是否更少
#   ③ 长文档:1M 上下文下是否还稳定引用原文
✅ 验收标准:回归用例「无退化」即可灰度。3.7 在长周期工程任务上提升幅度很大,但厂商自报数字建议以你的真实场景实测为准——这正是回归用例集存在的意义。

Step 4:按任务难度分配思考级别

4 三档思考级别,别让所有请求都跑满配

3.7 Flash 支持 low / medium / high 三档思考预算,这是继价格减半之后第二个省钱杠杆:

思考级别     适合场景                    参考用法
low         简单问答、格式化、提取      对话类 Agent 默认档
medium      一般 Agent 任务、单步工具调用  大多数工作流默认
high        复杂多步规划、代码审查、     关键任务、可接受
            长文档推理                   更高延迟时使用

# API 参考:在请求参数中设置 thinking_level
# (各 SDK 命名略有差异,按官方文档为准)
💡 工程化建议:给 Agent 加一个「任务难度 → 思考级别」的路由规则,例如按输入长度或步骤数量自动选档。大部分流量跑 low/medium,只有少数关键路径开 high,综合成本可以再降一截。

Step 5:吃满 1M 上下文——长任务不再切块

5 把整库文档、整月日志直接喂进去

1M token 上下文 + 64K 输出,意味着很多之前需要「检索-切块-拼接」的长任务,现在可以直接整段输入:

典型场景:
1. 代码库重构:把整个仓库核心文件喂进去做全局审查
2. 长日志分析:一天/一周的日志直接分析,不用抽样
3. 长文档翻译/摘要:整本书分章直喂,保持术语一致

注意事项:
- 输入 token 会随长度线性增加,长任务先算账再喂
- 超长输入建议配合思考级别 high,效果更稳
- 输出 64K 是上限,超长产出考虑分段生成

算账提醒:1M 上下文很诱人,但 100 万 token 输入按 $0.75/M 也要 $0.75/次。长任务要评估「整段喂」vs「检索后喂」哪个更划算——量大时结合检索能省下可观的成本。

Step 6:算清迁移 ROI,决定灰度节奏

6 把「能力提升」翻译成「钱和时间」

迁移决策最后都要落到数字上。用一张表对比迁移前后:

维度            迁移前(3.6)     迁移后(3.7)     收益
单次输入成本     $1.50/M        $0.75/M        省 50%
单次输出成本     $7.50/M        $3.75/M        省 50%
DeepSWE         49.0%          65.3%           返工率下降
AutomationBench 17.0%          30.4%           自动化完成率↑
长任务处理      需切块          1M 直喂          流程简化

灰度节奏建议:
第 1 周:非核心服务切 3.7,跑回归+监控
第 2 周:核心服务灰度 20%,对比关键指标
第 3 周:全量切换,并把 12-31 前的锁定价
        计入明年预算(恢复后按 2 倍预留)
📈 成本敏感型团队还可参考《DeepSeek V4 Pro》与《分层路由降本》做多模型组合;想了解 Agent 整体成本治理可看《Agent 成本优化》。

常见问题速查

你遇到的问题原因 & 解决
免费版 Gemini 聊天界面找不到 3.73.7 Flash 主要在 API/AI Studio/Android Studio/Antigravity 等开发者入口,标准聊天 UI 的免费用户暂未开放
切到 3.7 后输出格式偶尔漂移新模型多步规划更强,原 prompt 里过度约束的格式指令可适当精简,让模型按工具 schema 输出
高思考级别延迟变高high 档天然更慢,只对关键任务开启;对话类场景保持 low/medium
明年价格恢复后成本扛不住在锁定期内完成 prompt 优化与思考级别路由,把基础用量压下来再等下一轮升级
← 返回教程中心