6 月 9 日发布,6 月 10 日被越狱,6 月 12 日被美国政府下达出口管制禁令。Anthropic 的 Claude Fable 5,公开生命周期只有 72 小时。
这是 AI 行业第一次出现模型因安全事故而触发国家级管制行动的案例。更令人深思的是,制造这个模型的正是以「宪法式 AI」(Constitutional AI)安全方法论闻名全球的 Anthropic——一家将安全作为品牌核心叙事、估值超过 600 亿美元的顶级 AI 公司。
Fable 5 的 72 小时,把 AI 行业一个悬而未决的深层问题推到了台前:当模型能力「涌现」出超越预期的危险能力时,现有的安全治理框架根本追不上模型的进化速度。
一、72 小时全记录:从最强 AI 到被全球封禁
第 0 天(6 月 9 日):Anthropic 正式发布 Claude Fable 5 与 Claude Mythos 5。两者共享同一底层架构——Mythos 级模型,Anthropic 的最强能力。唯一区别是安全配置:Fable 5 面向所有用户开放,内置风险分类器与安全护栏;Mythos 5 保留完整能力,仅对 11 家受信任机构开放。Anthropic CEO Dario Amodei 将这个策略称为「同一基础模型、双档安全配置」,声称经过超 1000 小时的外部红队测试未发现通用越狱方法。
第 1 天(6 月 10 日):知名 AI 红队研究者 Pliny the Liberator 在社交媒体宣布攻破 Fable 5 的安全层。他展示了模型输出的 x86 Linux 系统栈缓冲区溢出完整利用教程,同时泄露了 Fable 5 约 12 万字符的完整系统提示词——相当于 Anthropic 约束模型行为的全部内部规则被公开摊在了 GitHub 上。
第 3 天(6 月 12 日):美国政府以国家安全为由发布出口管制指令,要求暂停所有外国公民对 Fable 5 和 Mythos 5 的访问。禁令范围之宽前所未有:不仅针对美国境外的全球用户,还涵盖了美国境内的所有外籍人士,甚至包括 Anthropic 自己的外籍雇员。
第 4 天(6 月 13 日):Anthropic 在官网发布声明,称已遵守指令暂停服务,但认为这是一个「误解」,正在努力恢复访问。
二、Mythos 的能力「涌现」:零日漏洞自动化发现
Fable 5 的故事要从两个月前讲起。2026 年 4 月 7 日,Anthropic 红队发布了 Claude Mythos Preview 的安全评估报告,揭示了一个令安全社区震动的发现:这个模型能自主发现零日漏洞,覆盖所有主流操作系统和浏览器,并自动编写完整的利用链——从扫描目标到写 exploit 到实现系统控制,全流程无需人类指导。
最极端的案例是,Mythos 找到了一个存在 27 年的休眠漏洞,并提出了利用方案。Mozilla 的 Firefox 团队在 4 月借助 Mythos 的受控访问修复了 271 个安全漏洞——比此前数年的总和还多。
Anthropic 的红队报告明确指出一个重要结论:网络攻击能力是通用推理和编码能力的「涌现副产品」——模型智力到了某个阈值,就自动具备了精英级渗透测试的水平。这不是专门训练出来的,而是推理能力提升后自然「长出来」的。
Anthropic 决定不向公众发布 Mythos,取而代之的是一个叫 Project Glasswing 的受控计划,只允许 11 家机构在严格监控下使用。Nature 在 5 月 26 日以标题《Too dangerous to release》(太危险不能释放)刊发评论,追问一个根本性问题:当 AI 公司单方面判定某种能力「太危险不能公开」,公众和政府如何监督这个判定本身是否成立?
三、Fable 5 的安全设计:分类器降级的三重盲区
Fable 5 的安全架构可以用一句话概括:当用户的请求触碰高风险领域时,不直接拒绝,而是悄悄把请求转交给一个更弱的模型来回答。
分类器覆盖四个领域:网络安全、生物、化学、模型蒸馏。当输入触碰这些领域时,Fable 5 静默将请求降级给 Claude Opus 4.8——一个能力明显弱于 Mythos 级的旧模型。设计逻辑是「弱模型的能力上限本身就是安全边界」。
但这个精巧的设计存在三个结构性盲区:
第一,分类器依赖字符模式匹配而非语义理解。Pliny 团队用最基础的手法——西里尔字母替换拉丁字母、Unicode 同形字——就骗过了分类器。视觉上「exploit」这个词看起来一模一样,但底层编码不同,分类器就认不出来了。
第二,分类器逐条检测,无法追踪跨轮次的意图链。Pliny 使用的「分解-重组」攻击是这样的:先问「Birch 还原法的化学原理是什么?(合法有机化学问题)」;再问「还原胺化反应需要什么条件?(同样合法)」。每一步单独看都完全无害,分类器放行。但把所有答案在外部拼起来,就是一条完整的管制药物合成路径。这就像拼图——每一片都是普通的彩色纸片,拼完了却是一张不该出现的地图。
第三,多模型管线的组合漏洞。Pliny 用一个已经被越狱的 Opus 4.8 实例作为「后端助手」,辅助 Fable 5 绕过安全控制。Anthropic 的安全评估是针对单个模型做的,但攻击者部署的是一个模型联盟——你测试了每一扇门的锁是否结实,但没想到有人会从窗户递钥匙进来。
这三种攻击手法对应三个层级的安全问题:
- 第一层(工程 bug):字符替换绕过 → 可以修复,不太严重
- 第二层(对齐理论困境):分解-重组攻击 → 现阶段无可靠技术方案
- 第三层(新攻击面):多 Agent 协作 → 连问题的边界都还没被学术界定义清楚
四、Constitutional AI 的悖论:最安全的公司,守不住自己的模型
Anthropic 在 AI 行业的定位一直很特殊。这家由前 OpenAI 副总裁 Dario Amodei 创立的公司,核心叙事就是「OpenAI 不够重视安全,我们来做那个把安全放在第一位的公司」。
但 Fable 5 的遭遇揭示了一个残酷的现实:制定宪法的人,管不住自己训练出来的最强模型。1000 小时的红队测试、分类器降级架构、双档安全策略——几乎行业能想到的安全措施 Anthropic 全用了,结果被一个公开身份的研究者在 24 小时内突破。
这对整个 AI 安全领域的震动是结构性的:如果最谨慎的玩家用了最精巧的方案,依然防不住,那其他公司的安全承诺还有多少可信度?全球前沿模型的能力正在逼近或已经达到 Mythos 类似的阈值。如果 Mythos 的网络攻击能力是「涌现」出来的,那么所有达到这个智力水平的模型都将面临同样的问题——Anthropic 的失败不是个案,而是整个行业的预言。
五、出口管制:从硬件层跳到能力层的政策跃迁
美国政府过去的 AI 管制逻辑是管「基础设施」——芯片、算力、设备。6 月 12 日的禁令标志着管制逻辑从硬件层跳到了能力层,而且划线标准是国籍而非居住地——一个持 H-1B 签证在旧金山为 Anthropic 工作的工程师,也不能碰自己参与开发的模型。
72 小时的反应速度暴露了政策工具的粗糙:一纸禁令把所有外国公民的访问全部切断,包括合法的学术研究者、安全防御人员。图灵研究所的 AI 安全中心(CETaS)在 4 月的分析中指出,我们正在进入一个「AI 加速漏洞发现」的新时代,而监管框架还停留在上一个时代的假设里。
另一层争议来自 Pliny 本人。他在越狱帖中批评 Fable 5 的安全设计「制造了虚假的安全感,同时阻碍了正当安全研究者获取攻防知识」。这本质上还是那个延续了二十年的「全面披露 vs 负责任披露」之争——在传统软件安全里,发现漏洞后可以先私下通知厂商;但 AI 模型的对齐缺陷不是一个可以「打补丁」的 bug,它是能力和控制之间的结构性鸿沟。
- 4 月 7 日:Anthropic 红队发布 Mythos 安全评估,揭示自主零日漏洞发现能力
- 5 月 26 日:Nature 刊发《Too dangerous to release》,质疑单方面安全判定
- 6 月 9 日:Fable 5 + Mythos 5 正式发布,双档安全策略
- 6 月 10 日:Pliny 攻破 Fable 5 安全层,泄露系统提示词
- 6 月 12 日:美国政府下令出口管制,冻结全球外籍人士访问
- 6 月 13 日:Anthropic 声明遵守指令但认为是「误解」
Fable 5 事件可能会成为 AI 行业的一个重要分水岭。它表明:当模型能力「涌现」的速度超过安全治理的进化速度,行业需要在四个层面同时寻找答案——技术层面的对齐研究、企业层面的安全设计范式、国家层面的治理框架、国际层面的合作机制。任何单一层面的突破都不足以解决这个结构化问题,而 Fable 5 的 72 小时只是这个漫长探索的开始。