评测方法论:污染从哪来
SWE-bench 家族源自真实 GitHub Issue:Agent 需产出通过维护者原测试套件的代码改动。OpenAI 审计了 500 Issue 子集并发布 Verified 版本以提升可靠性。但 2026 年 2 月的独立污染分析给出警示:
- 测试套件失真:最难 Verified 任务中 59.4% 的测试其实抓不住目标缺陷,分数部分来自弱测试而非真实能力
- 训练集泄露:独立污染估计对 2023 年后模型的分数膨胀约 5–15 分
- Best-of-N 乐观偏差:允许多次尝试取最优,掩盖单次通过率
本评测数据截止 2026 年 9 月,来源于 SWE-bench 官方、steel.dev 聚合榜与各厂商发布。SWE-bench Pro 为抗污染变体(contamination-resistant),相比 Verified 更贴近真实工程能力,但仍是单一编码维度,不替代长程/终端类基准。
SWE-bench Verified 的分数有多「虚」
同一模型在 Verified 与 Pro 上的落差,直接暴露污染程度。标准化脚手架下头部成绩如下:
| 模型 | SWE-bench Verified | SWE-bench Pro | 落差 |
|---|---|---|---|
| Claude Opus 4.5 | 80.9% | 45.9% | −35.0 |
| Claude Sonnet 4.5 | — | 43.6% | — |
| Gemini 3 Pro | — | 43.3% | — |
| GPT-5 High | — | 41.8% | — |
Verified 与 Pro 之间 35 分的差距,是同一模型在同一能力上的「乐观分 vs 抗污染分」。这解释了为何线上真实缺陷修复率常低于排行榜预期——排行榜测的是「在弱测试上通过」,生产测的是「在真实意图上修对」。
SWE-bench Pro:1865 题抗污染基准
SWE-bench Pro 含 1865 道任务,设计为抗污染(contamination-resistant),月度滚动、不固定。标准化脚手架下 2026 年 5 月站位:
| 排名 | 系统 / 模型 | SWE-bench Pro | 说明 |
|---|---|---|---|
| 1 | Claude Opus 4.5 | 45.9% | 裸模型(标准化脚手架) |
| 2 | Claude Sonnet 4.5 | 43.6% | 裸模型 |
| 3 | Gemini 3 Pro | 43.3% | 裸模型 |
| 4 | GPT-5 High | 41.8% | 裸模型 |
头部裸模型集中在 41.8%–45.9%,分差仅 4 分——说明在抗污染维度,模型间能力已高度收敛,真正的差距在「怎么用」。
Agent 系统 vs 裸模型
当换用自定义脚手架(Agent 系统)而非裸模型直跑,分数明显抬升——这是本轮最关键的发现:工具编排比模型本身更决定上限。
| 系统 | SWE-bench Pro | 对比裸模型 |
|---|---|---|
| GPT-5.3-Codex CLI | 57.0% | +15.2 vs GPT-5 High |
| Claude Code + Opus 4.5 | 55.4% | +9.5 vs Opus 4.5 |
| Claude Opus 4.5(裸) | 45.9% | 基线 |
Codex CLI 把 GPT-5 High 的 41.8% 拉到 57.0%,提升超 15 分;Claude Code 把 Opus 4.5 从 45.9% 拉到 55.4%。脚手架贡献的可不是边际优化,而是接近一个数量级的工程增益。选型时「模型分数」应让位于「模型 + 脚手架 + 工具」的组合分数。
Best-of-N 隐藏的成本
排行榜上 90% 的分数若依赖 best-of-16,单次通过率可能仅 60%,每任务推理成本放大 16 倍。生产环境无法承受这种成本结构。
| 风险 | 表现 | 生产影响 |
|---|---|---|
| Best-of-N 乐观 | 多次取最优,pass@k 虚高 | 成本 16x,不可上线 |
| 弱测试通过 | 抓不住真实缺陷 | 线上修复率低于榜 |
| 污染膨胀 | 5–15 分注水 | 跨模型比较失真 |
关键发现
- Verified 与 Pro 对同一模型落差达 35 分(Opus 4.5:80.9% vs 45.9%),污染是排行榜普遍现象而非个例
- 抗污染维度头部裸模型高度收敛(41.8%–45.9%,仅 4 分差),模型红利见顶
- Agent 系统(Codex CLI 57.0%、Claude Code 55.4%)显著超过裸模型,脚手架是真实上限决定因素
- Best-of-N 把成本放大至多倍,生产须看单次通过率与单位任务成本
- SWE-bench Pro 仍仅测编码单维,选型须与 Terminal-Bench / 长程基准组合看
选型决策矩阵
| 场景 | 首选 | 理由 |
|---|---|---|
| 真实缺陷修复(抗污染口径) | Claude Code + Opus 4.5 | Pro 55.4%,脚手架成熟、安全控制完善 |
| 成本敏感大规模跑批 | Codex CLI(GPT-5.3) | Pro 57.0% 头部,API 成本结构优 |
| 多模型切换 / 性价比 | Gemini CLI + Gemini 3 Pro | Pro 43.3%,免费额度 + 大上下文 |
| 内部基准自测 | 自建 Pro 子集 + 私有仓库 | 避免公开榜污染,贴近真实代码库 |