大模型竞赛的叙事,正在悄悄换轨。7 月 22 日,Google 一口气发布三款全新 Gemini 模型——Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 与 Gemini 3.5 Flash Cyber。与过去围绕「谁更聪明」的参数与榜单之争不同,这一轮 Google 把话筒递给了开发者最在意的三个词:效率、延迟、成本。当越来越多企业把 Agent 推进生产环境,跑得稳、花得少,正取代「智商天花板」成为新的主战场。

一、Flash 家族三箭齐发,主叙事从「更聪明」转向「更便宜」

此次发布刻意避开了旗舰对决的聚光灯。Google 在公告中明确表示,随着生产级 Agent 的大量出现,更高的 Token 利用率、更低的响应延迟与更稳定的模型表现,已取代单纯的能力上限,成为开发者的核心诉求。Flash 系列正是围绕这一判断打造:不追求在每一项基准上登顶,而是在模型能力与运行效率之间寻找平衡点,以支撑大规模、长链路的 Agent 工作流。这种「降维打击式」的产品思路,折射出 Google 对企业级 Agent 市场的重新理解——客户要的不是另一个会聊天的天才,而是一个能 7×24 跑流程、还不会把账单烧穿的搭档。

二、3.6 Flash:把 Agent 的运行成本压下来

三款之中,Gemini 3.6 Flash 被定位为新的主力模型,基于开发者对上一代 3.5 Flash 的反馈做了针对性优化,在编程、知识处理与多模态能力上同步提升。更关键的是 Token 利用效率:据官方在 Artificial Analysis Index 上的数据,3.6 Flash 相比 3.5 Flash 平均减少 17% 的输出 Token,且在执行复杂多步骤任务时需要更少的推理步骤与工具调用次数,直接拉低了整体 Agent 运行成本。价格随之同步下调至每百万输入 Token 1.5 美元、每百万输出 Token 7.5 美元。在 DeepSWE、MLE Bench 等编程与机器学习评测中,新模型较上代实现性能提升,并降低了无效代码修改与重复执行循环的发生。对依赖多轮工具调用的 Agent 而言,省下的每一分 Token,都是规模化部署时的真金白银。

三、Flash-Lite 与 Flash Cyber:守住吞吐与安全的两条边

另外两款则补齐了场景拼图。Gemini 3.5 Flash-Lite 主打低延迟、高吞吐量,面向 Agent 搜索、文档处理等需要被大规模调用的企业应用,相当于为「高频轻量」任务准备的经济舱。Gemini 3.5 Flash Cyber 则结合 CodeMender 代码安全智能体,专门面向软件漏洞检测与修复等网络安全应用——模型不只写代码,还开始帮人找代码里的窟窿。安全维度上,新模型强化了针对化学、生物、放射性、核安全(CBRN)以及网络攻击等领域的防护,提升了抵御越狱攻击的能力,同时尽量减少对正常使用场景的误拒绝。效率与安全的双线加固,显示出 Google 想把 Agent 塞进真实生产系统时,对「可控」二字的执念。

四、Gemini 4 已启动、Pro 仍未发:Google 的节奏算计

真正值得玩味的是 Google 在发布会末尾埋下的伏笔:公司透露已启动 Gemini 4「迄今最雄心勃勃的预训练工作」,而备受关注的旗舰模型 Gemini 3.5 Pro 仍处于测试阶段、尚未正式发布。一面用高性价比的 Flash 家族快速收割 Agent 开发者心智,一面把旗舰悬念留到下一代——这既是对 OpenAI、Anthropic 企业级市场竞争的正面回应,也透露出 Google 的节奏算计:与其在旗舰红海里硬碰,不如先在「Agent 跑得起、跑得省」这件事上建立心智占位。客观看,性价比路线能否真正转化为开发者黏性,仍取决于长链路任务的实际稳定性与生态工具链的完整度;但至少这一次,Google 把竞争的坐标,从「最聪明」挪到了「最划算」。