能力评测 2026-09-15 24 分钟阅读 进阶

编码智能体抗污染评测:SWE-bench Pro 横评

为什么 SWE-bench Verified 的 80.9% 含 5–15 分注水 — 用 1865 题抗污染基准重新量化头部编码智能体

摘要

SWE-bench Verified 是 2026 年衡量编码智能体最常用基准,但其分数正被数据污染侵蚀。OpenAI 2026 年 2 月审计发现最难任务中有 59.4% 的测试套件其实抓不住目标缺陷。本文引入抗污染的 SWE-bench Pro(1865 题),量化横评 Claude Opus 4.5、Gemini 3 Pro、GPT-5 系列与 Codex CLI / Claude Code 等 Agent 系统,并指出「脚手架比裸模型更重要」这一被排行榜掩盖的事实。

评测方法论:污染从哪来

SWE-bench 家族源自真实 GitHub Issue:Agent 需产出通过维护者原测试套件的代码改动。OpenAI 审计了 500 Issue 子集并发布 Verified 版本以提升可靠性。但 2026 年 2 月的独立污染分析给出警示:

⚠️ 数据声明

本评测数据截止 2026 年 9 月,来源于 SWE-bench 官方、steel.dev 聚合榜与各厂商发布。SWE-bench Pro 为抗污染变体(contamination-resistant),相比 Verified 更贴近真实工程能力,但仍是单一编码维度,不替代长程/终端类基准。

SWE-bench Verified 的分数有多「虚」

同一模型在 Verified 与 Pro 上的落差,直接暴露污染程度。标准化脚手架下头部成绩如下:

模型 SWE-bench Verified SWE-bench Pro 落差
Claude Opus 4.5 80.9% 45.9% −35.0
Claude Sonnet 4.5 — 43.6% —
Gemini 3 Pro — 43.3% —
GPT-5 High — 41.8% —

Verified 与 Pro 之间 35 分的差距,是同一模型在同一能力上的「乐观分 vs 抗污染分」。这解释了为何线上真实缺陷修复率常低于排行榜预期——排行榜测的是「在弱测试上通过」,生产测的是「在真实意图上修对」。

SWE-bench Pro:1865 题抗污染基准

SWE-bench Pro 含 1865 道任务,设计为抗污染(contamination-resistant),月度滚动、不固定。标准化脚手架下 2026 年 5 月站位:

排名 系统 / 模型 SWE-bench Pro 说明
1 Claude Opus 4.5 45.9% 裸模型(标准化脚手架)
2 Claude Sonnet 4.5 43.6% 裸模型
3 Gemini 3 Pro 43.3% 裸模型
4 GPT-5 High 41.8% 裸模型

头部裸模型集中在 41.8%–45.9%,分差仅 4 分——说明在抗污染维度,模型间能力已高度收敛,真正的差距在「怎么用」。

Agent 系统 vs 裸模型

当换用自定义脚手架(Agent 系统)而非裸模型直跑,分数明显抬升——这是本轮最关键的发现:工具编排比模型本身更决定上限。

系统 SWE-bench Pro 对比裸模型
GPT-5.3-Codex CLI 57.0% +15.2 vs GPT-5 High
Claude Code + Opus 4.5 55.4% +9.5 vs Opus 4.5
Claude Opus 4.5(裸) 45.9% 基线
📊 核心洞察

Codex CLI 把 GPT-5 High 的 41.8% 拉到 57.0%,提升超 15 分;Claude Code 把 Opus 4.5 从 45.9% 拉到 55.4%。脚手架贡献的可不是边际优化,而是接近一个数量级的工程增益。选型时「模型分数」应让位于「模型 + 脚手架 + 工具」的组合分数。

Best-of-N 隐藏的成本

排行榜上 90% 的分数若依赖 best-of-16,单次通过率可能仅 60%,每任务推理成本放大 16 倍。生产环境无法承受这种成本结构。

风险 表现 生产影响
Best-of-N 乐观 多次取最优,pass@k 虚高 成本 16x,不可上线
弱测试通过 抓不住真实缺陷 线上修复率低于榜
污染膨胀 5–15 分注水 跨模型比较失真

关键发现

选型决策矩阵

场景 首选 理由
真实缺陷修复(抗污染口径) Claude Code + Opus 4.5 Pro 55.4%,脚手架成熟、安全控制完善
成本敏感大规模跑批 Codex CLI(GPT-5.3) Pro 57.0% 头部,API 成本结构优
多模型切换 / 性价比 Gemini CLI + Gemini 3 Pro Pro 43.3%,免费额度 + 大上下文
内部基准自测 自建 Pro 子集 + 私有仓库 避免公开榜污染,贴近真实代码库

核心发现

参考来源

  1. SWE-bench / SWE-bench Pro — 官方仓库 saiming123/SWE-bench 与 Pro 抗污染基准说明(1865 题、月度滚动)
  2. OpenAI — SWE-bench Verified 审计报告(2026.02,59.4% 最难任务测试套件失真)
  3. steel.dev — AI Agent Benchmark Results 聚合榜(SWE-bench Verified / Pro / OSWorld 2.0 / τ-bench 等 354 条结果)
  4. Gormes Docs — Agent Evaluation Benchmarks Landscape(Verified 80.9% vs Pro 45.9% 落差、Agent 系统分数)
  5. Decode the Future — AI Agent Benchmarks 2026: SWE-bench, GAIA, OSWorld(2026.05 站位与污染分析)
  6. Stanford HAI — 2026 AI Index(OSWorld 12%→66.3% 年度跃迁、Agent 基准 YoY 改进)