📖 产品简介
Cognition 于 2026 年 9 月 10 日发布 SWE-2,是其迄今最接近前沿、成本却大幅降低的编程模型,已落地 Devin Desktop 与 CLI。
SWE-2 从 Moonshot AI 的开放权重模型 Kimi K3(2.8T 参数 MoE,104B 激活)后训练而来,采用单次 RL 同时训练 medium/high/max 三档推理力度并施加成本惩罚。官方基准:FrontierCode 1.1 Main 50.0%(Fable 5.1 50.9%、GPT-6 Astra 53.3%),Terminal-Bench 2.1 92.8%(高于 Fable 5.1 的 91.4%),但 Terminal-Bench 4 仅 27.3%(远落后前沿)。相比 SWE-1.7,medium 档少 58% 步数、低 81% 成本,首次编辑中位 18 步(前代 48 步)。SWE-2 不单独售卖,仅通过 Devin 订阅提供,Pro 及以上不限量,自 $20/月起。
定位
基于 Moonshot Kimi K3(2.8T MoE)后训练的编程模型,FrontierCode 50% 接近前沿、成本约 1/4
适合人群
使用 Devin 的开发者与团队
成本敏感的编程 Agent 用户
日常 coding 多过超长程重构的任务
已在 Pro+ 订阅的 Devin 用户
支持平台
Devin Desktop、Devin CLI、Devin Web、Devin Fusion
开源
否
✨ 核心功能
- 成本-性能 Pareto:FrontierCode 50% 接近 Fable 5.1,成本仅约 1/4(GPT-6 Astra 约 1/4 价)
- 单 RL 训练三档力度(medium/high/max),无需为快慢各训一模型
- 聚焦式探索:先分析代码库再动手,medium 比 SWE-1.7 少 58% 步数、低 81% 成本
- Terminal-Bench 2.1 92.8%,为 Cognition 表中最高;DeepSWE 1.1 73.0%
- 仅经 Devin 提供:Pro+ 不限量 SWE-2,自 $20/月
- 基于中国开放权重 Kimi K3 后训练,凸显开放底座的可塑性
⚖️ 优缺点分析
👍 优点
- 以约 1/4 成本逼近前沿 coding 性能,性价比突出
- 单次 RL 训练多力度,工程实现优雅
- 首次编辑步数大幅降低,交互更干脆
- 已落地 Devin 全家桶(Desktop/CLI/Web/Fusion)
- Pro 及以上不限量,使用门槛低
👎 缺点
- Terminal-Bench 4 仅 27.3%,长程自主重构仍明显落后前沿
- 不开放独立 API/权重,只能经 Devin 使用
- 所有基准均为厂商自报,FrontierCode 为其自有榜
- 发布同日 Anthropic 指控 Moonshot 未经授权蒸馏,K3 溯源存议
📊 评分详情
功能完整
8.5
易用程度
8
安全可靠
7.5
性价比
9.5
💬 用户评价
SWE-2 的卖点不是最强,而是给定预算能多干、给定能力能少花钱——对跑几千步的 Agent 这才是关键。
📝 更新日志
-
2026-09-10v1.0 发布Cognition 发布 SWE-2 编程模型,基于 Moonshot Kimi K3(2.8T MoE)后训练:FrontierCode 1.1 Main 50.0%(Fable 5.1 50.9%、GPT-6 Astra 53.3%),Terminal-Bench 2.1 92.8%;medium 档比 SWE-1.7 少 58% 步数、低 81% 成本。仅经 Devin 订阅提供(Pro+ 不限量,自 $20/月)。