2026 年 5 月 29 日,阶跃星辰正式开源了其新一代 MoE 大模型——Step 3.7 Flash。这则消息在同一日被 Anthropic 发布 Claude Opus 4.8 的声量所遮蔽,但它在 AI 编程赛道引起的涟漪,可能远比看上去要深远。

Step 3.7 Flash 的核心竞争力可以用一组数字概括:总参数量 196B(激活 11B)、256K 上下文、推理速度 400 tokens/s、SWE-bench Pro 得分 56.26%、Terminal-Bench 2.1 得分 59.55%。更关键的是——开启"Advisor Mode"后,它在 SWE-bench Verified 上的编程性能可达 Claude Opus 4.6 的 97%,而单任务成本仅为 0.19 美元,相当于 Claude Opus 4.6 的九分之一。

"97% 性能,1/9 成本"意味着什么?

如果说 Claude Opus 4.8 代表了 AI 编程能力的"上限天花板",那么 Step 3.7 Flash 则在撬动另一个维度——"功能与成本的最优平衡点"。对于大多数日常开发场景而言,97% 的性能差异在实际使用中几乎不可感知,而 9 倍的成本差距却是实打实的预算决策因素。

特别值得注意的是,Step 3.7 Flash 原生兼容 Claude Code、OpenClaw、Hermes Agent 等主流 Agent 开发框架以及 MCP 协议。这意味着开发者可以无缝将其接入现有的智能体工作流,而无需为换模型重构工具链。这种"即插即用"的兼容性设计,大幅降低了企业的迁移成本。

阶跃星辰并非行业新手——其上一代模型 Step 3.5 Flash 曾登顶 OpenRouter 平台月度调用量榜首,证明了其在开源社区中的号召力。Step 3.7 Flash 开源的策略也延续了这一路线:模型权重一并放出,企业和开发者可以自由部署和二次开发。

Agent 编程模型的"三级火箭"格局

Step 3.7 Flash 的发布,让 AI 编程模型的赛道格局变得更加清晰。当前市场上正在形成明显的"三级火箭"结构:

第一级:天花板级闭源模型。 以 Claude Opus 4.8(SWE-bench Pro 69.2%)、GPT-5.5(Terminal-Bench 78.2%)为代表,追求极致性能上限。适合对代码质量要求极高的场景,比如金融系统的安全审计、大型架构重构。但成本高昂,Opus 4.8 常规模式输出价高达 25 美元/百万 token。

第二级:高性价比开源模型。 以 Step 3.7 Flash、Qwen3.6-35B 为代表,性能接近天花板而成本大幅降低。适合日常开发、持续集成、批量代码审查等对成本和规模敏感的场景。Step 3.7 Flash 在这一层级的竞争力在于其 MoE 架构带来的推理效率优势。

第三级:极致轻量级模型。 以面壁智能 MiniCPM5-1B(1B 参数)为代表,可在端侧设备部署。适合移动端编程辅助、代码片段补全等轻量场景。

这种分层意味着,企业在选择 AI 编程模型时不再是一个"谁最强就用谁"的简单决策,而是要根据场景匹配合适的模型——这本身就是模型生态走向成熟的标志。

MoE 架构在 Agent 场景的潜力

Step 3.7 Flash 采用稀疏 MoE 架构(196B 总参/11B 激活),这种"大总参、小激活"的设计在 Agent 场景中展现出独特优势。Agent 任务通常需要长时间运行、反复调用模型进行推理,Token 消耗量远大于传统对话场景。在 MoE 架构下,模型的总容量足够大(196B),但每次推理只激活一小部分参数(11B),从而在保持能力深度的同时控制推理成本和延迟。

这也是为何在推理速度上,Step 3.7 Flash 能做到 400 tokens/s——远快于同等总参数量的稠密模型。对于 Agent 场景中常见的链式思考(Chain-of-Thought)、多轮工具调用等任务,低延迟意味着更快的任务完成时间。

开源生态的加速器效应

Step 3.7 Flash 的另一个值得关注的维度是它对国内 AI 开源生态的助推作用。此前,国内开源大模型在 Agent 编程能力上与闭源模型之间存在不小的差距。Step 3.7 Flash 的 SWE-bench Pro 得分 56.26%,虽然距离 Opus 4.8 的 69.2% 还有差距,但它证明国产开源模型在 Agent 编程这个赛道上已经具备了"可用的基准线"。

更重要的是,Step 3.7 Flash 与 OpenClaw、Hermes Agent 等开源 Agent 框架的原生兼容性,正在形成一个国产化 Agent 技术栈的组合。当模型、框架、工具链这三个层面都有开源国产方案可选时,中国企业部署 AI Agent 的整体成本将迎来系统性下降。这对于推动 AI 编程能力在中小企业和传统行业的普及,意义不亚于模型本身的性能提升。

← 上一篇:华为云码道商用突破10万用户 下一篇:DeepMind AlphaProof攻克Erdős难题 →