← 返回首页
🧬

SWE-2(Cognition)

Cognition(Devin 开发商)

基于 Moonshot Kimi K3(2.8T MoE)后训练的编程模型,FrontierCode 50% 接近前沿、成本约 1/4

编程智能体 模型
A-
成本优先的近前沿编程模型
⭐⭐⭐⭐

📖 产品简介

Cognition 于 2026 年 9 月 10 日发布 SWE-2,是其迄今最接近前沿、成本却大幅降低的编程模型,已落地 Devin Desktop 与 CLI。

SWE-2 从 Moonshot AI 的开放权重模型 Kimi K3(2.8T 参数 MoE,104B 激活)后训练而来,采用单次 RL 同时训练 medium/high/max 三档推理力度并施加成本惩罚。官方基准:FrontierCode 1.1 Main 50.0%(Fable 5.1 50.9%、GPT-6 Astra 53.3%),Terminal-Bench 2.1 92.8%(高于 Fable 5.1 的 91.4%),但 Terminal-Bench 4 仅 27.3%(远落后前沿)。相比 SWE-1.7,medium 档少 58% 步数、低 81% 成本,首次编辑中位 18 步(前代 48 步)。SWE-2 不单独售卖,仅通过 Devin 订阅提供,Pro 及以上不限量,自 $20/月起。

定位
基于 Moonshot Kimi K3(2.8T MoE)后训练的编程模型,FrontierCode 50% 接近前沿、成本约 1/4
适合人群
使用 Devin 的开发者与团队 成本敏感的编程 Agent 用户 日常 coding 多过超长程重构的任务 已在 Pro+ 订阅的 Devin 用户
支持平台
Devin Desktop、Devin CLI、Devin Web、Devin Fusion
开源

核心功能

  • 成本-性能 Pareto:FrontierCode 50% 接近 Fable 5.1,成本仅约 1/4(GPT-6 Astra 约 1/4 价)
  • 🎚️ 单 RL 训练三档力度(medium/high/max),无需为快慢各训一模型
  • 🔧 聚焦式探索:先分析代码库再动手,medium 比 SWE-1.7 少 58% 步数、低 81% 成本
  • 🏆 Terminal-Bench 2.1 92.8%,为 Cognition 表中最高;DeepSWE 1.1 73.0%
  • 🪙 仅经 Devin 提供:Pro+ 不限量 SWE-2,自 $20/月
  • 🌏 基于中国开放权重 Kimi K3 后训练,凸显开放底座的可塑性

⚖️ 优缺点分析

👍 优点

  • 以约 1/4 成本逼近前沿 coding 性能,性价比突出
  • 单次 RL 训练多力度,工程实现优雅
  • 首次编辑步数大幅降低,交互更干脆
  • 已落地 Devin 全家桶(Desktop/CLI/Web/Fusion)
  • Pro 及以上不限量,使用门槛低

👎 缺点

  • Terminal-Bench 4 仅 27.3%,长程自主重构仍明显落后前沿
  • 不开放独立 API/权重,只能经 Devin 使用
  • 所有基准均为厂商自报,FrontierCode 为其自有榜
  • 发布同日 Anthropic 指控 Moonshot 未经授权蒸馏,K3 溯源存议

📊 评分详情

功能完整
8.5
易用程度
8
安全可靠
7.5
性价比
9.5

💬 用户评价

SWE-2 的卖点不是最强,而是给定预算能多干、给定能力能少花钱——对跑几千步的 Agent 这才是关键。

📝 更新日志

  • 2026-09-10
    v1.0 发布
    Cognition 发布 SWE-2 编程模型,基于 Moonshot Kimi K3(2.8T MoE)后训练:FrontierCode 1.1 Main 50.0%(Fable 5.1 50.9%、GPT-6 Astra 53.3%),Terminal-Bench 2.1 92.8%;medium 档比 SWE-1.7 少 58% 步数、低 81% 成本。仅经 Devin 订阅提供(Pro+ 不限量,自 $20/月)。