📊 评测基准

SWE-bench(软件工程基准)

别名:SWE-bench软件工程基准AI编码评测智能体编码测试
分类📊 评测基准
阅读时间⏱️ 19 分钟
更新时间📅 2026-06-30
条目编号ENC-BENCH-01-swe-bench
SWE-bench 是目前最权威的 AI 编程 Agent 能力评测基准。它从真实 GitHub 仓库中提取 Issue + PR(Pull Request)对,要求 Agent 根据 Issue 描述生成能通过所有测试的代码变更。

关键要点 ✦

详细解释

SWE-bench(Software Engineering Benchmark)是目前评估 AI 编程 Agent 最权威的基准测试。它从 GitHub 真实仓库中提取 Issue(问题描述)和对应的 Pull Request(代码修改),要求 Agent 根据 Issue 描述生成能通过所有测试的代码变更。

与 HumanEval 等函数级基准不同,SWE-bench 的题目涉及真实代码库的多文件修改——需要定位问题、理解代码库结构、跨文件协调修改,更贴近真实开发场景。

评测维度与排名

SWE-bench Verified 是官方验证子集,包含 500 个高质量 Issue-PR 对。2026 年 Q2 领先得分:

Claude Code:80.8% | Codex CLI:76.2% | Copilot CLI:73.5% | Kiro CLI:71.0% | Gemini CLI:68.7%

评测维度:任务解决率、多文件重构成功率、Bug 修复率、代码测试通过率、Token 效率比(解决率 / Token 消耗量)。

局限

主要评估 Python 项目,对其他语言覆盖不足;Bug 修复是唯一任务类型,不评估新功能开发能力;不评估代码质量和可维护性。SWE-bench 的成功为 SWE-bench Lite 和 SWE-bench Multilingual 等扩展版本奠定了基础。

📖 相关条目

🛠️ 相关产品

🏷️ 标签SWE-bench基准测试AI编程评测Coding Agent