2026 年 6 月 9 日,Anthropic 正式发布了第五代 Claude 系列模型——面向通用市场的 Claude Fable5 和专注专业领域的 Claude Mythos5。两家模型基于相同的底层基础模型构建,但在安全配置和应用场景上各有侧重。

官方公告中的一句标准话术——"性能超越了此前所有公开可用的模型"——看起来与每次大模型发布并无二致。但这次的数据和实测案例,值得认真对待。

在同一日,Anthropic 内部 Claude Code 团队的开发者 Thariq 在社交媒体上写道:"以前我们检查 Claude 是否把活儿做对了——它有没有偷懒、有没有幻觉。用了 Fable 5 之后,我检查的是 Claude 是否在做正确的事。"这句话,或许比任何基准测试数据更能说明这一代模型的本质变化。

Fable5:基准测试的全面碾压

首先看数据。Fable5 在几乎所有主流基准测试中取得了最高分:

基准测试Fable5Opus 4.8GPT-5.5Gemini 3.1 Pro
SWE-Bench Pro(真实编程)80.3%69.2%58.6%54.2%
SWE-Bench Verified95.0%
FrontierCode Diamond(高难度编程)29.3%13.4%
Agent 整体得分80.7
领域知识 Elo(GDPval-AA)1932

SWE-Bench Pro 80.3% 的成绩,意味着在处理真实 GitHub Issue 时,Fable5 能自主修复超过八成的问题——相比 Opus 4.8 的 69.2% 提升了 11 个百分点。而 SWE-Bench Verified 的 95% 和 FrontierCode Diamond 的 29.3%(前代仅 13.4%),分别验证了其在标准场景和极限场景下的能力跃升。

Agent 整体得分 80.7 说明,Fable5 在多步骤推理、工具调用和自主规划上的综合能力已进入新量级。这一维度恰恰是 AI Agent 产品最依赖的核心能力。

从"监工"到"管理者":编程范式转型

基准数据是一回事,真实的工程场景是另一回事。

Stripe 的内部测试提供了一个有说服力的案例:Fable5 被用以自主完成一个 5000 行 Ruby 代码库的全面迁移。工程师只需设定迁移目标——将旧 Ruby 版本升级到新版本——模型即可自行规划代码路径、执行改写、处理运行失败并自动恢复,直至全量完成。

在旧模式下,同样的工作需要工程师将任务拆解成极小的片段、逐段编写指令、反复检查和纠正 AI 输出——工程师扮演的是"监工"角色。而在 Fable5 的模式下,工程师的角色转变为"管理者"或"审批者"——设定目标,审核结果,而非干预过程。

Anthropic 官方数据还显示,Fable5 能将数月的工程量压缩到几天之内。这不是效率的线性提升,而是协作范式的一次重构。

视觉能力质变:从"翻译"到"看见"

视觉能力的跃升同样值得关注。Fable5 可以直接从截图重建整个 Web 应用的源代码,无需任何文字描述。更引人注目的一个测试是:模型直接通过视觉观察通关了《Pokémon FireRed》——没有地图数据、没有隐藏信息,仅凭原始游戏画面做出判断和操作。

这意味着 AI 不再需要人类为其"翻译"视觉信息。对于 UI 设计、前端开发、文档理解等场景而言,设计师和开发者的角色正在从"视觉翻译者"变为"AI 产出结果的审核者"。其影响的不仅是效率,更是角色定义。

Mythos5:自主生物学研究的突破

面向专业领域的 Mythos5 带来了更令人意外的突破。Anthropic 内部团队进行了一项为期一周的自主生物学研究实验:

Mythos5 自主查阅了 138 篇相关文献,设计并训练了一个机器学习模型(性能超越某篇《Science》论文中模型的 1/100),完成了包括药物设计、位点选择、工具调用、失败恢复在内的整个研究闭环。整个过程只给了高层次的方向性指令,所有路径规划和执行均由 AI 自主完成。

这标志着 AI 的科研角色从"执行工具"进化到了能够独立探索和发现新知识的"初级研究员"水平。研究人员的工作重心,正从"操作实验"转向"设定课题"。

安全与控制:更强大的能力需要更坚固的护栏

模型能力的跃升也带来了新的安全挑战。Anthropic 内部承认,早期版本的 Mythos 模型存在"在发现和利用安全漏洞方面异常高效"的问题。

为此,Fable5 配备了一套新的"护栏"系统,能够自动检测网络安全、化学、生物学等高风险领域的恶意请求,并将其拒绝或引导。据 Anthropic 披露,相比 Opus 4.8,平均约有 5% 的对话会触发该安全机制,用户会被明确告知拦截原因。

AI 越强大,"它不能做什么"的边界就越与"它能做什么"同样重要。这一矛盾将是整个行业在 Agent 进化过程中持续面对的命题。

定价与市场定位

Fable5 的定价显著高于前代:输入 $10/百万 tokens,输出 $50/百万 tokens——约为 Opus 4.8 的 2 倍。但与其带来的能力跃升相比,对于能够节省"一个团队数周工作"的复杂任务来说,其成本效益仍具说服力。

Anthropic 同时提供了 advisor 等分层调用工具,思路是用便宜的 Haiku/Sonnet 模型处理日常查询,仅在最关键、最复杂的任务上调用 Fable5。这种"知道何时使用 Fable5"的策略,与其"知道 Fable5 能做什么"同等重要。

模型已通过 claude.ai、API、Claude Code、GitHub Copilot、AWS 和 Google Cloud 等渠道开放使用。

行业影响与展望

Fable5 的发布不仅仅是 Anthropic 的一次产品更新。当 Stripe 能自主完成代码库迁移、当 Mythos5 能独立开展科研、当模型能从原始游戏画面做出决策——这些能力对应的不是工具层面的优化,而是人机协作权重的一次重置。

工程师不再需要"如何做",只需"做什么";研究者不再需要指挥实验,只需设定课题;设计师不再需要为 AI 描述画面,只需审核成果。人类的角色被推向更高层次:战略决策者、目标判断者、价值评估者。

这一转变,已经不是"渐进式改进"可以概括的范畴。2026 年 6 月 9 日,或许正是 AI 从"工具"走向"协作者"的一个分界点。

← 上一篇:具身智能国标正式实施 返回资讯首页 →