评测方法论:Terminal-Bench 是什么
Terminal-Bench 是一类聚焦「真实计算机任务」的智能体基准:任务要求 Agent 在带图形界面或命令行环境的真实机器上,自主完成安装依赖、调试运行、操作文件、调用工具等多步终端操作,而不是只产出一个代码补丁。它在难度上通常被认为高于 SWE-bench,因为它要求 Agent 具备环境感知、错误自愈与长链路操作能力。
本横评采用公开榜单的「Agent+模型」配对口径(即工具与其默认/头部模型的组合),并区分「模型级分数」(独立 harness 测的底层模型能力)与「Agent 配对分数」(工具+模型组合的真实表现)。数据主要来自 2026 年 8 月更新的公开榜单。
榜单存在两类口径差异:其一是「模型级」分数(如 Artificial Analysis 在 Terminus 2 harness 上独立跑的 pass@1)与「Agent 配对」分数(tbench.ai 公布的工具+模型组合);其二是部分厂商自报分数与第三方测量分数。排名仅供参考,不代表单一工具的工程体验。GPT-5.6 Sol 与 Opus 5 的 Terminal-Bench 行多为模型级独立测量,应理解为「模型能力上限」而非「开箱即用能力」。
Terminal-Bench 2.1 量化榜单
下表为 2026 年 8 月公开的 Terminal-Bench 2.1 分数(越高越好)。前两行为模型级独立测量(Artificial Analysis / Terminus 2 harness),其余为 Agent+模型配对(tbench.ai)。
| Agent / 模型 | Terminal-Bench 2.1 | 口径 | 默认定价(参考) |
|---|---|---|---|
| GPT-5.6 Sol(xhigh) | 89.5% | 模型级(Terminus 2) | $20/月 Plus + 额度 |
| Claude Opus 5(max effort) | 89.1% | 模型级(Terminus 2) | $17/月 Pro(年付) |
| GPT-5.6 Sol(max) | 88.0% | 模型级 | $20/月 Plus + 额度 |
| Codex CLI + GPT-5.5 | 83.4% | Agent 配对 | $20/月 Plus + 额度 |
| Claude Code + Fable 5 | 83.1% | Agent 配对 | $17/月 Pro |
| Terminus 2 + Fable 5 | 80.4% | Agent 配对 | 按模型计费 |
| Claude Code + Opus 4.8 | 78.9% | Agent 配对 | $17/月 Pro |
| Gemini CLI + Gemini 3.1 Pro | 70.7% | Agent 配对 | 免费(1000 请求/日) |
头部两款默认模型(GPT-5.6 Sol 与 Claude Opus 5)在 Terminal-Bench 2.1 上仅差 0.4 个百分点,处于同一梯队。值得注意:Codex CLI 默认 GPT-5.6 Sol 自 2026-07-09 GA 后,以及 Claude Code 默认 Opus 5 自 2026-07-24 后,都把各自工具的「开箱即用」能力推到了 83% 以上区间。
与 SWE-bench / SWE-bench Pro 的差异
把同一批模型放到不同基准上,能看出「写补丁」与「做终端任务」的能力错位:
| 模型(底层) | SWE-bench Verified | SWE-bench Pro | Terminal-Bench 2.1 |
|---|---|---|---|
| Fable 5 | 95.0% | 80.3% | 83.1%(Claude Code 配对) |
| Claude Opus 4.8 | 88.6% | 69.2% | 78.9%(Claude Code 配对) |
| Gemini 3.1 Pro | 80.6% | 54.2% | 70.7%(Gemini CLI 配对) |
规律很清晰:SWE-bench Verified 分数普遍高于 Terminal-Bench 2.1 约 6–12 个百分点,而 SWE-bench Pro(更难的工程子集)则与 Terminal-Bench 处于同一量级。这说明「在沙箱里修 GitHub Issue」与「在真实终端里自主操作」是两种不同的能力,不能互相替代。
Gemini 3.1 Pro 在 SWE-bench Verified 达 80.6%,但在 Terminal-Bench 2.1 仅 70.7%——差距近 10 个点。对依赖「真实环境多步操作」的场景(运维、部署、数据清洗),SWE-bench 高分会高估实际可用性,Terminal-Bench 是更贴近的代理指标。
维度拆解:真实操作 vs 代码补丁
Terminal-Bench 与 SWE-bench 的能力维度差异决定了它们的适用边界:
| 维度 | SWE-bench Verified | Terminal-Bench |
|---|---|---|
| 任务形态 | 生成通过测试的补丁 | 真实环境多步终端操作 |
| 环境依赖 | 容器化代码库 + 测试套件 | 带 GUI / CLI 的真实机器 |
| 核心能力 | 仓库导航、最小改动 | 环境感知、错误自愈、长链路操作 |
| 难度共识 | 已接近饱和区 | 普遍认为更硬,离饱和更远 |
| 污染风险 | Full 集有泄露风险,Verified 较稳 | 任务更异质,泄露风险相对低 |
关键发现
- 头部两款默认模型(GPT-5.6 Sol / Claude Opus 5)在 Terminal-Bench 2.1 上仅差 0.4 个百分点,能力已进入同一梯队
- SWE-bench Verified 普遍高于 Terminal-Bench 2.1 约 6–12 点,SWE-bench Pro 与 Terminal-Bench 同量级——「修补丁」不等于「办成事」
- 模型级分数与 Agent 配对分数存在落差:Codex CLI + GPT-5.5 配对 83.4%,低于 GPT-5.6 Sol 模型级 89.5%,脚手架与交互层仍贡献显著
- Gemini CLI + Gemini 3.1 Pro 以免费额度拿到 70.7%,是性价比突出的「真实终端任务」入口,但距头部约 18 点
- 选型应看「基准组合」而非单榜:纯编码看 SWE-bench,真实运维/操作看 Terminal-Bench,长程业务流仍需 TAU-bench / WebArena / OSWorld 补充
选型决策矩阵
| 场景 | 首选 | 理由 |
|---|---|---|
| 真实终端/运维自主操作 | Claude Code(Opus 5)/ Codex CLI(GPT-5.6 Sol) | Terminal-Bench 2.1 配对 83%+,头部梯队 |
| 纯代码补丁/Issue 修复 | Claude Code(Fable 5)/ Cursor | SWE-bench Verified 88%–95% 区间 |
| 成本敏感 / 入门 | Gemini CLI + Gemini 3.1 Pro | 免费额度,Terminal-Bench 70.7% |
| 长程业务流(订单调度等) | 需补充 TAU-bench / WebArena 评估 | Terminal-Bench 不覆盖 Web/业务 API 流 |