核心摘要
2026 年,AI 编程工具的竞争已经从「谁的补全更准」彻底转向「谁的 Agent 更能独立干活、更能编排一队 Agent」。综合 9 月最新公开信息与编辑部实测:Claude Code 凭借 Projects 多智能体编排(Coordinator 统一调度并行 worker)卫冕综合榜首;Cursor 并入 SpaceX 后加速 agent 化,自研 Composer 2.5 模型以约十分之一的成本逼近旗舰级水准;OpenAI Codex 随 GPT-6 Astra 重写 harness,异步委派路线独树一帜;GitHub Copilot 完成从包月到按量的计费切换,补全体验依旧不限量;Windsurf 并入 Devin 品牌,转型为 Agent 指挥中心;Google Antigravity 则接棒 Gemini CLI,成为谷歌系编程 Agent 的统一入口。相比 6 月初版的四强格局(54.7 / 53.0 / 51.6 / 48.4),本次更新把评测扩容至六强,评分框架与结论均已重估。
一、评测背景:三个月,赛道换了三次游戏规则
本文初稿发布于 2026 年 6 月 3 日。此后不到四个月,行业接连发生三件足以改变评测框架的大事:
计费规则重构。6 月 1 日起 GitHub Copilot 全面转向 AI Credits 按量计费(1 credit = 0.01 美元),Cursor、Windsurf 与 Anthropic API 同期跟进调价——靠包月补贴换取增长的时代宣告结束,Agent 的真实 token 成本被摆上台面。第三方测算显示,重度 Agent 用户的月度支出可达此前的数倍(独立媒体口径)。
产品身份巨变。6 月 2 日 Cognition 将 Windsurf 整体更名 Devin Desktop,7 月 1 日老牌本地 Agent Cascade 正式退役;8 月 14 日 Cursor 官宣并入 SpaceX,其最大模型合作方 OpenAI 随后宣布合同进入退出流程。
编排竞赛开打。9 月 10 日 Cursor 推出 Projects 协调者架构,9 月 17 日 Anthropic 重建 Claude Code Projects 并推出 Coordinator 多智能体调度——两大头部产品在同一周内押注了同一种形态:开发者不再逐条对话,而是指挥一支并行工作的 Agent 舰队。
二、六强武器库盘点(截至 9 月 21 日)
1. Claude Code:从单体 Agent 到 Coordinator 编排
9 月 17 日,Anthropic 将 Claude Code 的 Projects 功能推倒重建:新的 Coordinator(协调者)Agent 负责拆解复杂需求,再把子任务派发给并行运行的 worker 线程——每个 worker 都是一个完整的 Claude Code 实例,跑在独立的 git 分支与仓库副本上,通过统一记忆与共享工件库保持同步。该能力目前为云端执行、面向 Pro / Max 部分订阅者开放 beta,官方称其内部已有 26% 的研发工作由 Claude Agent 主导(厂商口径)。
支撑这一切的底座是 9 月 1 日发布的 Fable 与 Mythos 5.1 两款模型。整个 9 月 Claude Code 迭代密集:新增 claude plugin eval 插件评测命令(可对照无插件基线打分)、Workflow 并发 Agent 上限放宽至 256、兼容 AGENTS.md 项目指令标准、支持远程会话 fork。产品重心已经清晰:让 Agent 在更少人工确认下跑得更久、更稳。
2. Cursor:SpaceX 旗下,自研模型加云端 Agent 舰队
Cursor 今年的关键词是「去依赖」。自研 Composer 系列迭代到 2.5:200k 上下文,基于开源底座加自家强化学习训练,官方基准称其接近 Claude 旗舰模型的编码水准、而单任务成本约为其十分之一(厂商口径)。定价上标准版每百万 token 输入 0.50 美元 / 输出 2.50 美元,Fast 版 3 / 15 美元且已是默认档位——自研模型让 Cursor 的订阅制在按量计费浪潮中反而更抗冲击。
产品侧,9 月 10 日上线的 Cursor Projects 提供协调者 Agent、云端运行与 Slack / PR 订阅入口;9 月 2 日的自托管机器(Self-hosted machines)支持在团队内网执行工具调用。隐忧在于生态:并入 SpaceX 后,OpenAI 已宣布其合作合同将于 11 月 12 日终止(消息口径),多模型供给的稳定性成为企业客户的新关切。
3. GitHub Copilot:补全免费,Agent 计量
6 月 1 日的计费切换是 Copilot 生态的分水岭:代码补全与 Next Edit 建议在所有付费档依旧不限量,但对话、Agent 模式、代码审查改为按 token 消耗 AI Credits。席位价未变——Pro 10 美元(含 15 美元额度)、Pro+ 39 美元(含 70 美元)、新增的 Max 档 100 美元(含 200 美元额度)、Business 19 美元 / 人。独立测算显示,重度 Agent 用户月成本可达 178 美元上下(第三方口径),「性价比之王」的标签如今只对补全为主的用户成立。
能力侧 9 月有三处更新值得注意:Copilot 应用接入 Jira、CLI 引入 HydraFusion 自适应模型编排、代码审查 Agent 可以自动处置自己提出的评论。加上此前 agent mode 覆盖 JetBrains,Copilot 的 Agent 能力已铺满主流 IDE——但按量计费意味着「放开让 Agent 跑」的成本需自行监控。
4. Windsurf → Devin Desktop:从 IDE 到 Agent 指挥中心
6 月 2 日的更名通过 OTA 推送完成,但产品定位的变化远大于名字:默认启动面不再是编辑器画布,而是 Agent Command Center 看板——本地与云端 Agent 以看板卡片统一管理,Spaces 机制让多个 Agent 共享会话、PR、文件与上下文。老牌本地 Agent Cascade 已于 7 月 1 日退役,继任者 Devin Local 以 Rust 重写,官方称 token 效率提升约 30% 且支持子 Agent 拆分(厂商口径)。
模型与计费方面:免费档搭载自研 SWE-1.6,Tab 补全在免费档也不限量;3 月起由积分制改为每日 / 每周配额,Pro 20 美元 / 月,新增 Max 档 200 美元。它还率先支持 ACP 开放协议,Codex、Claude Agent 等第三方 Agent 可直接进驻运行——在巨头环伺下,这既是差异化,也是生存策略。
5. OpenAI Codex:GPT-6 Astra 重写 harness,异步委派独树一帜
Codex 是六强里产品节奏最激进的选手。7 月 9 日 GPT-5.6 系列正式可用(Sol / Terra / Luna 三档分工,Luna 主打跑量),Codex 同日并入统一的 ChatGPT 桌面应用,所有订阅档(含免费档)均可使用;9 月 3 日 GPT-6 Astra 发布,Codex harness 随之重写,官方称任务完成速度较 GPT-5.6 Sol 提升约 1.9 倍(厂商口径,含模型与 harness 的叠加贡献)。9 月 10 日,Codex harness(上下文压缩、工具检索、子智能体)以 Agents API 形式开放公测,并接入 Cloudflare、Vercel 等合作伙伴的沙箱环境。
它的差异化在于「异步委派」哲学:你描述任务后离开,Codex 在云端沙箱跑完再回来交付 PR,Multi-agent v2 支持多智能体分头改库表、API 与前端后由协调者合并。CLI 官方宣称 token 效率约为 Claude Code 的 4 倍(厂商口径,社区反馈方向一致但幅度存疑)。计费捆绑在 ChatGPT 订阅里:Plus 20 美元即含完整 Codex,Pro 100 / 200 美元对应 5 倍 / 20 倍额度;Luna 档的 5 小时滚动窗口消息上限远高于 Sol。短板同样明确:任务发出后中途难以干预、高峰期延迟波动大。
6. Google Antigravity:接棒 Gemini CLI 的统一入口
谷歌系的阵容在 6 月经历了一次重排:5 月 19 日 Google 宣布把终端 Agent 工作统一到 Antigravity,6 月 18 日起 Gemini CLI 与 Gemini Code Assist 扩展对个人免费用户及 AI Pro / Ultra 订阅者停止服务——「用个人 Google 账号白嫖每天 1000 次请求」的时代就此落幕(企业版 Code Assist 与付费 API key 不受影响,开源仓库仍在活跃维护,Star 数约 10.7 万)。继任者 Antigravity CLI 以 Go 重写、支持多智能体,与 Antigravity 2.0 桌面端共享 harness,原 Gemini CLI 的 skills、hooks、子智能体与扩展可迁移。
对个人开发者,Antigravity 的吸引力在于延续了大上下文与免费起步的组合:Gemini 3 系模型的 1M token 上下文窗口在整仓级任务上仍有优势。但迁移并非无损——换代的 CLI 在发布初期出现过编辑失败与配额报错等质量问题,免费档在高峰期可能路由到更轻的模型,且免费档的数据使用条款对专有代码并不友好(可选退出)。选它之前,先确认自己的工作负载是否吃得到 1M 上下文。
三、核心维度对比(9 月更新版)
1. 形态与编排能力
| 工具 | 产品形态 | 多 Agent 编排 | 本地 / 云端 |
|---|---|---|---|
| Claude Code | 终端 + IDE + 桌面 + 浏览器 | Coordinator + 并行 worker(beta) | 编排仅云端,单 Agent 可本地 |
| Cursor | Agent 优先 IDE + CLI + 云端 | Projects 协调者 + Agent 舰队 | 本地 + 云端 + 自托管 |
| Codex | CLI + IDE 扩展 + macOS 应用 + ChatGPT 内置 | Multi-agent v2 + Ultra 模式 + Agents API 服务端子智能体 | 云端沙箱为主,CLI 可本地 |
| GitHub Copilot | 编辑器内嵌 + CLI + 云端 | Agent mode + HydraFusion 编排 | 云端(GitHub Actions 环境) |
| Devin Desktop | Agent 指挥中心(内含完整 IDE) | Command Center 看板 + Devin Local 子 Agent | 本地 + 云端 |
| Google Antigravity | Agent 命令中心 + Antigravity CLI | 多智能体(桌面端与 CLI 共享 harness) | 本地 + 云端 |
2. 计费与真实成本(6 月版没有、9 月必须新增的维度)
| 工具 | 入门价 | 补全 | 重 Agent 用户成本 |
|---|---|---|---|
| GitHub Copilot | $10/月(Pro) | 不限量 | 按量 Credits,第三方测算重度约 $178/月 |
| Cursor | $20/月 | — | 订阅内含额度,自研模型成本优势明显 |
| Claude Code | $20/月(Pro) | — | 跑量需 Max $200,多 Agent 并行消耗快 |
| Devin Desktop | $20/月(Pro) | 免费档也不限量 | 每日 / 每周配额制,Max $200 |
| Codex | 免费档 / Go $8 / Plus $20 | — | ChatGPT 订阅捆绑,Luna 档 5 小时窗口额度远高于 Sol |
| Google Antigravity | 个人免费起步 | — | 高峰期可能降档到轻量模型;企业走 Code Assist 授权或 API key |
3. 综合得分(编辑部口径)
| 排名 | 工具 | 总分 | 核心优势 |
|---|---|---|---|
| 🥇 | Claude Code | 56.4 | 编排能力最成熟,复杂任务与长会话首选 |
| 🥈 | Cursor | 55.1 | 自研模型拉低成本,IDE 体验依旧出色 |
| 🥉 | Codex | 53.8 | 异步委派独特,订阅捆绑性价比高,开源 CLI |
| 4 | GitHub Copilot | 51.2 | 补全免费不限量,GitHub 生态无可替代 |
| 5 | Devin Desktop | 50.6 | 多 Agent 管理看板独特,ACP 开放生态 |
| 6 | Google Antigravity | 49.3 | 1M 上下文 + 免费起步,生态仍在换挡期 |
与 6 月版相比,头部格局未变但队伍扩容:Copilot 因按量计费带来的成本不确定性下调(51.6 → 51.2)并让出第三名——Codex 凭借订阅捆绑、开源 CLI 与 Multi-agent v2 直接空降探花;Devin Desktop 凭借 Devin Local 与 ACP 生态上探(48.4 → 50.6);Antigravity 作为新入榜者,吃 1M 上下文与免费起步的红利、也承受生态换挡期的动荡。Cursor 与 Claude Code 的差距从 1.7 分缩至 1.3 分。评分为编辑部基于公开信息与实测的主观加权,仅供参考。
四、选型建议(更新版)
- 补全为主、预算敏感 → GitHub Copilot Pro($10/月,补全不限量仍是同类中的性价比标杆,但别放开让 Agent 随便跑)
- 复杂重构 / 长会话自主任务 → Claude Code(Coordinator 编排当前最成熟,注意用量额度与云端限制)
- 想要一体化 IDE + 低成本跑 Agent → Cursor(Composer 2.5 成本优势明显;关注 OpenAI 合同退出后的模型供给变化)
- 已订 ChatGPT / 偏好异步委派提 PR → Codex(Plus $20 即含全量,Luna 跑量、Sol 攻坚;任务中途不可干预要先适应)
- 同时管理多个 Agent / 已在 Devin 生态 → Devin Desktop(Command Center + Spaces 的多 Agent 管理体验独特)
- 预算为零的学习者 / 整仓大上下文探索 → Google Antigravity(免费起步 + 1M 上下文;专有代码注意免费档数据条款)
- 企业团队 → Copilot Business($19/人,组织级管控成熟)或 Claude Code 团队版(重自动化场景)
五、趋势展望:四季度三大看点
趋势一:多智能体编排成为主战场。Claude Projects、Cursor Projects 与 Devin Command Center 在同一周内先后押注「协调者 + 并行 worker」架构。IDE 正在退化为 Agent 的宿主界面,竞争焦点转向任务拆解质量、分支冲突处理与共享记忆机制。
趋势二:按量计费成为行业默认。6 月的集体调价并非孤立事件——Agent 的 token 消耗没有生物学上限,包月模式在数学上无法持续。下一阶段的差异化将围绕成本可预期性展开:配额工具、用量看板、模型路由(便宜模型跑简单步骤)都会成为标配。
趋势三:整合与站队加速。Cursor 并入 SpaceX、OpenAI 合同进入退出流程、Cognition 收拢 Devin 品牌——独立 AI 编程工具公司所剩无几。2027 年的竞争将主要在巨头生态之间展开,开放协议(如 ACP)能否让工具保持中立性,值得关注。
总结:四个月前我们说「没有完美的工具,只有最适合的选择」,这句话如今要加两个注脚——选工具同时也是选生态与计费模式,而且六强没有一家在单点技术上拉开代差。如果你要复杂逻辑推理和多文件深度重构,Claude Code 仍是当前综合表现最好的选择;追求日常开发的行云流水与成本可控,看 Cursor 的自研模型路线;手里有 ChatGPT 订阅就先试试 Codex 的异步委派;补全为主留在 Copilot;要指挥 Agent 舰队去看 Devin Desktop 的看板;预算为零就从 Antigravity 开始。真正拉开差距的,已经从模型能力变成编排效率与账单可预期性。
(注:本文数据截至 2026 年 9 月 21 日;文中标注「厂商口径」的数据来自官方博客或发布说明,标注「第三方口径」的数据来自独立媒体或行业测算,实际体验因使用环境与项目类型而异。)