美国时间 7 月 24 日,Anthropic 正式发布 Claude Opus 5,全平台同步上线。这次发布的叙事重点不在「又强了多少」,而在「便宜了多少」——官方把定价直接钉在每百万 Token 输入 5 美元、输出 25 美元,与一年前的 Opus 4.8 完全持平,却恰好是自家旗舰 Fable 5(10 美元 / 50 美元)的一半。用一半的价格买到接近旗舰的性能,Anthropic 第一次把「性价比」写成了旗舰发布的主标题。

一、成绩:把上一代翻倍,把旗舰逼到墙角

据 Anthropic 官方评测,在 Frontier-Bench v0.1 软件工程基准上,Opus 5 拿到 43.3%,相比 Opus 4.8 的 21.1% 翻了一倍还多,也高于 Fable 5 的 33.7% 与 GPT-5.6 Sol 的 34.4%;知识工作基准 GDPval-AA v2 上,它以 1861 分超过 Fable 5 的 1747。最刺眼的是 ARC-AGI-3 新颖问题求解:Opus 5 得分 30.2%,是次优模型的三倍(Opus 4.8 仅 1.5%、GPT-5.6 Sol 为 7.8%)。在模拟电脑操作的 OSWorld 2.0 上,它用约三分之一的成本超过了 Fable 5 的最好成绩。第三方 Cursor 随后公布的 CursorBench 3.2 中,Max 档下 Fable 5 跑出 70.5%、每任务约 17.32 美元,Opus 5 为 70.0%、每任务 8.23 美元——落后半个百分点,价格不到一半,Token 用量还少了约 40%。

二、把算力预算的选择权交还给客户

这次发布引入了可调节的「努力程度」(Effort)设置,用户可以在追求极致智能与节省 Token 之间灵活取舍;即便在最低档,Opus 5 完成的任务数量仍超过其他任何模型。Fast 模式运行速度约为默认速度 2.5 倍,价格为基础价格的 2 倍。Anthropic 明确将其定位为面向日常高频使用的模型,已成为 Claude Max 的默认模型,也是 Claude Pro 中性能最强的一款。同时,两项处于测试阶段的能力值得关注:对话中途更换工具时提示词缓存不失效,以及对被安全分类器标记的请求自动降级处理而非直接拒绝——后者直接缓解了大量请求被「一刀切」拦截的工程痛点。

三、客观看:应对开源冲击的主动降价,但并非无短板

Opus 5 的策略逻辑很清楚:在中国开源模型崛起(Kimi K3、DeepSeek 等以远低于闭源的价格提供接近旗舰的能力)的背景下,与其让企业客户因价格高昂而流向开放权重模型,不如主动降价,用「准旗舰性能、中端价格」的组合留住他们。这标志着闭源巨头从「卖能力上限」转向「卖性价比」的结构性调整。但客观而言,Opus 5 并非全胜:在网络安全任务上仍落后于 Mythos 5,发布当天还因官方对比表中一处高亮标注(53.4% 被标成最优、而相邻一格为 53.5%)引发「翻车」调侃——讽刺的是,这次的主卖点恰恰是「会自己核对工作」。对团队而言,真正的考题是:当价格不再是护城河,闭源模型要靠什么继续留住愿意为「可靠与可控」付费的企业客户。