在编程智能体的竞赛里,头条通常属于跑分。但 9 月 10 日 Cognition 发布 SWE-2 时,最值得技术团队停留的并不是那 50.0% 的分数,而是它在自己的发布里反复强调的一个词——帕累托曲线。这标志着竞争的叙事,正在从「谁更强」转向「在什么成本下够用」。
它是什么
据公开信息,SWE-2 是 Cognition 旗下编程智能体 Devin 的新一代模型,也是 SWE-1.7 的继任者。它的基座是月之暗面的 Kimi K3——一个据称 2.8 万亿参数的 MoE 模型(激活参数约 1040 亿),该基座此前已经过面向智能体编程的强化学习。Cognition 在此基础上做后训练,并称在多项基准上仍能取得额外 5 到 6 个百分点的提升。
产品形态上,SWE-2 没有独立的 API,也没有开放权重,而是直接并入 Devin 的订阅体系:Pro 及以上计划可不限量使用,其中 Pro 起价每月 20 美元,且现有 Pro 用户有一个月的用量不计量。它已在 Devin Desktop 与 CLI 上线,并逐步铺向 Devin Web 与 Fusion。
官方基准:一个「接近但未超过」的位置
据 Cognition 公布的表格,在自研的 FrontierCode 1.1 Main 基准(衡量 AI 提交的拉取请求是否会被人工维护者合并)上,SWE-2 取得 50.0%。作为对照,Anthropic 的 Fable 5.1 为 50.9%,OpenAI 的 GPT-6 Astra 为 53.3%,xAI 的 Grok 4.6 为 48.0%,其基座 Kimi K3 为 44.2%,前代 SWE-1.7 为 42.0%。Cognition 称,在达到相近分数的情况下,SWE-2 的运行成本比 Fable 5.1 低约 64%。
但同一张表里也有不那么好看的数字。在更难的 Terminal-Bench 4 上,SWE-2 仅得 27.3%,而 Fable 5.1 为 55.8%、GPT-6 Astra 为 57.9%。在行业标准的 Terminal-Bench 2.1 上,SWE-2 的 92.8% 则反超了 Fable 5.1 的 91.4%。把这些放在一起,结论相当清晰:它的成本优势在日常编程任务上成立,但在最难的、长链路的智能体任务上并不成立。
训练上的技术点
SWE-2 在方法上有两处值得拆解。一处是「单次强化学习训练覆盖全部努力档位」。多档位(medium、high、max)通常意味着为每个档位训练一个模型再合并,而 Cognition 称其在一次训练中端到端地训出了所有档位。另一处是成本惩罚的奖励设计——其目标可概括为「成功减去成本惩罚」,惩罚系数随基座模型帕累托前沿的局部切线缩放。通俗地说,模型不是单纯被奖励「做对」,而是在「做对」与「少花」之间被引导到一个更划算的点上。
配套的工程细节还包括:用长度加权的奖励基线来稳定梯度方差;把强化学习环境数量扩至三倍,加入指令跟随的叠加层,并用历史检查点不断加固自动验证器;服务侧引入在线草稿模型提升解码吞吐,并用 NVFP4/FP8 的量化感知内核压低显存占用。这些改动合在一起,指向的都是同一个目标——把单位任务的时间与成本同时压下来。
行为上的变化
比分数更有意思的是官方描述的行为差异。据其发布说明,SWE-1.7 曾因过度探索而被用户反馈「在简单任务上想太多」;SWE-2 则把探索做得更聚焦。在 FrontierCode 1.1 Main 上,medium 档位的平均步数为 53 步,而 SWE-1.7 为 127 步,步数减少约 58%、平均成本降低约 81%;SWE-2 的首次真实代码编辑发生在中位数第 18 步,而 SWE-1.7 是第 48 步。
此外,官方还描述了三种行为倾向:更倾向于编写端到端的测试以捕捉回归与边界情况;在「用户边界内」更愿意绕路寻找替代方案(例如某个 MCP 集成不可用时,改从已有的聊天记录中重建数据);以及在被质疑时倾向于重新推导结论而不是简单附和。这些描述都出自厂商自述,但它们指向的能力方向——把「会写代码」变成「会判断该不该改、改得对不对」——与业界近来的共识一致。
一个值得注意的供应链细节
这条发布里还有一个容易被忽略的事实:一家美国初创公司,拿一个来自中国的开源基座模型做后训练,把编程能力推到接近前沿的水平。它说明开源权重的供应链已经跨国,也说明「前沿」的相当一部分,正建立在一小批大型开源基座之上。这对选择技术路线的团队是一个现实提醒——上游基座的走向,会直接影响下游产品的成本与能力曲线。
中立思辨
需要保持中立地看待这组数字。其一,FrontierCode 是 Cognition 自研的基准,用它来给跨厂商模型排序,只能当作方向性参考,而非客观排名。其二,成本对比、步数减少与行为描述均为厂商自述,缺少独立的第三方评测来交叉验证。其三,SWE-2 不提供独立 API、不开放权重,外部研究者无法复现其宣称的结果,这会长期削弱这些数字的可信度。其四,Terminal-Bench 4 上的明显落后说明「接近前沿」并不等于「处于前沿」——对于以长链路、多步骤自动化为核心的场景,成本优势未必能弥补能力差距。其五,「单次训练覆盖全部档位」的具体实现、以及不同档位在边界任务上的切换策略,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
趋势研判
短期,「接近前沿 + 更低单位成本」会继续是编程智能体的主要竞争叙事,因为企业采购看的是单位任务的总账而非单次跑分;中期,成本—性能的帕累托优化会从「卖点」变成后训练的标准目标,届时价格优势本身将不再稀缺;长期,当模型能力进一步商品化,真正的护城河会落在编排框架与工作流资产上——这也解释了为什么同一批公司一边压模型成本,一边把力气花在 Devin 这样的产品外壳上。
对开发团队的务实建议是:不要被头条跑分牵着走。选型时先把自己最难的几类任务整理成一组可复现的用例,分别测「能不能做完」「要几步」「花多少」,再决定用哪一档能力。一个在简单任务上便宜、在困难任务上掉链子的模型,如果被用在错误的场景里,省下的钱会在返工里加倍还回去。