SWE-bench(软件工程基准)
别名:SWE-bench软件工程基准AI编码评测智能体编码测试
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 19 分钟 |
| 更新时间 | 📅 2026-06-30 |
| 条目编号 | ENC-BENCH-01-swe-bench |
SWE-bench 是目前最权威的 AI 编程 Agent 能力评测基准。它从真实 GitHub 仓库中提取 Issue + PR(Pull Request)对,要求 Agent 根据 Issue 描述生成能通过所有测试的代码变更。
关键要点 ✦
- SWE-bench Verified 是官方验证子集,包含 500 个高质量 Issue-PR 对
- 2026 年 Q2 领先得分:Claude Code 80.8%,Codex CLI 76.2%
- 评测维度:正确率、多文件重构成功率、Bug 修复率、测试通过率
- 评测揭示:补全型模型在简单任务上占优,Agent 型在复杂任务上领先
- SWE-bench 的局限在于主要评估 Python 项目,不够全面
详细解释
SWE-bench(Software Engineering Benchmark)是目前评估 AI 编程 Agent 最权威的基准测试。它从 GitHub 真实仓库中提取 Issue(问题描述)和对应的 Pull Request(代码修改),要求 Agent 根据 Issue 描述生成能通过所有测试的代码变更。
与 HumanEval 等函数级基准不同,SWE-bench 的题目涉及真实代码库的多文件修改——需要定位问题、理解代码库结构、跨文件协调修改,更贴近真实开发场景。
评测维度与排名
SWE-bench Verified 是官方验证子集,包含 500 个高质量 Issue-PR 对。2026 年 Q2 领先得分:
Claude Code:80.8% | Codex CLI:76.2% | Copilot CLI:73.5% | Kiro CLI:71.0% | Gemini CLI:68.7%
评测维度:任务解决率、多文件重构成功率、Bug 修复率、代码测试通过率、Token 效率比(解决率 / Token 消耗量)。
局限
主要评估 Python 项目,对其他语言覆盖不足;Bug 修复是唯一任务类型,不评估新功能开发能力;不评估代码质量和可维护性。SWE-bench 的成功为 SWE-bench Lite 和 SWE-bench Multilingual 等扩展版本奠定了基础。
📖 相关条目
🛠️ 相关产品
🏷️ 标签SWE-bench基准测试AI编程评测Coding Agent