能力评测 2026-09-14 24 分钟阅读 进阶

终端任务智能体评测:Terminal-Bench 横评

为什么「会写代码补丁」不等于「能在真实终端把事办成」— 用 Terminal-Bench 量化拆解编码智能体的真实操作边界

摘要

SWE-bench 衡量的是「能否生成通过测试的补丁」,而 Terminal-Bench 衡量的是「能否在真实计算机环境里自主完成多步终端任务」。本评测基于 2026 年 8 月公开榜单(steel.dev、morphllm 等),量化横评 GPT-5.6 Sol、Claude Opus 5、Codex CLI、Claude Code、Gemini CLI 等主流编码智能体在 Terminal-Bench 2.1 上的表现,并与 SWE-bench Verified / SWE-bench Pro 做差异分析,给出选型建议。数据截止 2026 年 9 月。

相关产品: Claude Code Codex CLI Gemini CLI

评测方法论:Terminal-Bench 是什么

Terminal-Bench 是一类聚焦「真实计算机任务」的智能体基准:任务要求 Agent 在带图形界面或命令行环境的真实机器上,自主完成安装依赖、调试运行、操作文件、调用工具等多步终端操作,而不是只产出一个代码补丁。它在难度上通常被认为高于 SWE-bench,因为它要求 Agent 具备环境感知、错误自愈与长链路操作能力。

本横评采用公开榜单的「Agent+模型」配对口径(即工具与其默认/头部模型的组合),并区分「模型级分数」(独立 harness 测的底层模型能力)与「Agent 配对分数」(工具+模型组合的真实表现)。数据主要来自 2026 年 8 月更新的公开榜单。

⚠️ 数据声明

榜单存在两类口径差异:其一是「模型级」分数(如 Artificial Analysis 在 Terminus 2 harness 上独立跑的 pass@1)与「Agent 配对」分数(tbench.ai 公布的工具+模型组合);其二是部分厂商自报分数与第三方测量分数。排名仅供参考,不代表单一工具的工程体验。GPT-5.6 Sol 与 Opus 5 的 Terminal-Bench 行多为模型级独立测量,应理解为「模型能力上限」而非「开箱即用能力」。

Terminal-Bench 2.1 量化榜单

下表为 2026 年 8 月公开的 Terminal-Bench 2.1 分数(越高越好)。前两行为模型级独立测量(Artificial Analysis / Terminus 2 harness),其余为 Agent+模型配对(tbench.ai)。

Agent / 模型 Terminal-Bench 2.1 口径 默认定价(参考)
GPT-5.6 Sol(xhigh) 89.5% 模型级(Terminus 2) $20/月 Plus + 额度
Claude Opus 5(max effort) 89.1% 模型级(Terminus 2) $17/月 Pro(年付)
GPT-5.6 Sol(max) 88.0% 模型级 $20/月 Plus + 额度
Codex CLI + GPT-5.5 83.4% Agent 配对 $20/月 Plus + 额度
Claude Code + Fable 5 83.1% Agent 配对 $17/月 Pro
Terminus 2 + Fable 5 80.4% Agent 配对 按模型计费
Claude Code + Opus 4.8 78.9% Agent 配对 $17/月 Pro
Gemini CLI + Gemini 3.1 Pro 70.7% Agent 配对 免费(1000 请求/日)

头部两款默认模型(GPT-5.6 Sol 与 Claude Opus 5)在 Terminal-Bench 2.1 上仅差 0.4 个百分点,处于同一梯队。值得注意:Codex CLI 默认 GPT-5.6 Sol 自 2026-07-09 GA 后,以及 Claude Code 默认 Opus 5 自 2026-07-24 后,都把各自工具的「开箱即用」能力推到了 83% 以上区间。

与 SWE-bench / SWE-bench Pro 的差异

把同一批模型放到不同基准上,能看出「写补丁」与「做终端任务」的能力错位:

模型(底层) SWE-bench Verified SWE-bench Pro Terminal-Bench 2.1
Fable 5 95.0% 80.3% 83.1%(Claude Code 配对)
Claude Opus 4.8 88.6% 69.2% 78.9%(Claude Code 配对)
Gemini 3.1 Pro 80.6% 54.2% 70.7%(Gemini CLI 配对)

规律很清晰:SWE-bench Verified 分数普遍高于 Terminal-Bench 2.1 约 6–12 个百分点,而 SWE-bench Pro(更难的工程子集)则与 Terminal-Bench 处于同一量级。这说明「在沙箱里修 GitHub Issue」与「在真实终端里自主操作」是两种不同的能力,不能互相替代。

📊 关键错位

Gemini 3.1 Pro 在 SWE-bench Verified 达 80.6%,但在 Terminal-Bench 2.1 仅 70.7%——差距近 10 个点。对依赖「真实环境多步操作」的场景(运维、部署、数据清洗),SWE-bench 高分会高估实际可用性,Terminal-Bench 是更贴近的代理指标。

维度拆解:真实操作 vs 代码补丁

Terminal-Bench 与 SWE-bench 的能力维度差异决定了它们的适用边界:

维度 SWE-bench Verified Terminal-Bench
任务形态 生成通过测试的补丁 真实环境多步终端操作
环境依赖 容器化代码库 + 测试套件 带 GUI / CLI 的真实机器
核心能力 仓库导航、最小改动 环境感知、错误自愈、长链路操作
难度共识 已接近饱和区 普遍认为更硬,离饱和更远
污染风险 Full 集有泄露风险,Verified 较稳 任务更异质,泄露风险相对低

关键发现

选型决策矩阵

场景 首选 理由
真实终端/运维自主操作 Claude Code(Opus 5)/ Codex CLI(GPT-5.6 Sol) Terminal-Bench 2.1 配对 83%+,头部梯队
纯代码补丁/Issue 修复 Claude Code(Fable 5)/ Cursor SWE-bench Verified 88%–95% 区间
成本敏感 / 入门 Gemini CLI + Gemini 3.1 Pro 免费额度,Terminal-Bench 70.7%
长程业务流(订单调度等) 需补充 TAU-bench / WebArena 评估 Terminal-Bench 不覆盖 Web/业务 API 流

核心发现

参考来源

  1. steel.dev — SWE-bench Verified Leaderboard(2026 更新,含 Terminal-Bench 关联说明)
  2. MorphLLM — Best AI Coding Agents (August 2026): The Scored Leaderboard(含 Terminal-Bench 2.1 数据)
  3. Presenc AI — Coding Agent Benchmarks 2026 (SWE-Bench, TerminalBench, Live PR)
  4. awesomeagents.ai — SWE-Bench Coding Agent Leaderboard 2026(Agent 配对口径说明)
  5. tbench.ai — Terminal-Bench 公开榜单(Agent+模型配对分数)