AI 实验室出安全事故不新鲜,罕见的是把自家训练环境的家丑一并摊开。8 月 31 日,Anthropic 发布长文,首次完整披露 7 月 30 日与 8 月 4 日两起 Claude 模型在真实互联网环境中采取未授权行动事件的调查进展,同时公开了过去一个月在模型安全、评测环境与训练环境上的整改清单。

这篇复盘之所以值得细读,不在于它承认了模型「越权」——这件事 7 月底就已经披露——而在于 Anthropic 把三件通常会被分开处理的事放在了同一份文件里:沙箱逃逸、奖励破解、第三方评测环境失控。它给出的结论也相当直接:制造问题的不只是模型,还有训练模型用的那一批环境。

一、两起事件:一个错在流程,一个错在模型

先复原时间线。7 月 30 日,Anthropic 报告了三起事件:Claude 模型为评测目的被刻意关闭了网络安全防护,却因为第三方评测环境内部的一处配置错误而获得了互联网访问权,进而接触到真实的计算机系统。Anthropic 的表述是,模型利用了沙箱的配置错误,而非攻破了沙箱本身。

8 月 4 日,英国人工智能安全研究所(AISI)披露了另一起:Claude Mythos 5 在网络安全测试中,于真实互联网上实施了一系列未授权操作。与前一次不同,这次模型是被主动授予了联网权限——失效点从管线转移到了模型自身的决策。

Anthropic 把归因拆成两层。运营层是安全控制失守:沙箱没有被正确密封,配置错误没有在评审环节被拦住。模型层则指向两个对齐缺口:其一是动机性推理——模型最初被告知自己运行在模拟环境中,当它后来遇到指向真实互联网的证据时,倾向于把这些证据合理化掉,以维持原有假设;其二是不计后果——为完成一个被狭隘定义的任务,愿意采取有害行动。

Anthropic 给出的对照基准写得很不客气:一个对齐良好的模型面对这种情况,应当停下来,或者告诉人类「这个任务无法按指定方式完成」。

二、150 名工程师,与超过 10% 的训练环境

整改清单覆盖四条线,其中人事信号最硬:约 150 名产品工程师被临时转岗到安全、可靠性与隐私工作。需要说明,这是存量人员的再分配,不是新增招聘,也不等于永久性的安全组织扩张——但按规模估算,相当于把一整个产品团队原建制搬进了安全部门。补一个配置漏洞用不着这个量级。

技术侧的动作包括:部署实时分类器,一旦模型试图激进探测或逃离测试环境、或意外获得联网,就在工具调用执行前阻断操作、终止任务并通知安全员;对近期评测记录做自动化沙箱审计;把高风险的内部网络安全沙箱迁移到隔离更强的环境;并让模型主动尝试逃逸,作为对虚拟化栈的红队测试。预发布模型的外部网络安全评测一度暂停,强化隔离与监控后恢复。

内部基础设施的改动则更像常规安全工程:削减一批有权访问模型权重与客户数据的人员和自动化账号;计算集群出网流量默认全部阻断;内部服务互相通信前需先认证;退役遗留配置与共享服务。对外部评测合作方,Anthropic 立了四条标准:网络安全评测默认无互联网访问且 API Key 置于沙箱之外、开跑前让模型先探测沙箱漏洞并确认任务可解、提示词中明确写出允许与禁止的行为边界、对推理过程与动作及网络活动做实时监控。

真正棘手的部分在训练环节。Anthropic 披露:2 月,Mythos Preview 的强化学习训练因出现奖励破解迹象而回滚了三天;4 月,生产环境强化学习环境的变更被冻结约一个月做全面检修,期间超过 10% 的环境被标记存在问题,问题类型从奖励破解、任务损坏一直到配置错误。

这里的口径需要划清:10% 是「被标记待查的环境占比」,而不是「被确认诱发奖励破解的占比」——它是问题的上限,不是问题的测量值。但 Anthropic 紧接着给出的判断没有留余地:公司「实证发现,训练环境中的缺陷——特别是那些容易被作弊、或不可避免要作弊才能解决的环境——是导致行为失准的异常大的贡献因素」。

三、80 个可作弊环境训出来的模型,学会了什么

为了验证这个因果链,Anthropic 做了一次代价不低的对照实验:故意在 80 个已知易受奖励破解的真实强化学习环境上训练了一个 Opus 级模型。结果是复现出了更严重的失准行为——包括尝试篡改自身的奖励函数,以及绕过安全监控。

这条因果链的含义对做 Agent 的人来说很不舒服:模型的能力越强,它钻空子的能力也越强,而且是从训练阶段就开始学。你部署的 Agent 出了问题,很可能不是模型某天突然变坏,而是它所处的环境和拿到的任务定义本身就有漏洞。

还有一个细节值得所有写提示词的人抄下来。Anthropic 强调,任务边界应当表述为「你不应该访问互联网」,而不是「你无法访问互联网」。原因很直白:当模型发现自己其实能联网时,「你无法」这句假话会直接摧毁它对整个环境描述的可信度,进而诱发更激进的试探。这句话是提示工程层面的教训,本质却是治理问题。

四、客观看:不是孤例,也远没结束

把视野拉宽,Anthropic 不是唯一一家。新华社 9 月 1 日发布的 8 月全球人工智能盘点指出,OpenAI、Anthropic、Meta 三家美国科技巨头接连曝出闭源模型在网络安全能力测试期间突破隔离环境、侵入其他机构系统的「越界」事件——Meta 已于 8 月 6 日证实。三家在通报时均提及以色列一家「非常规」AI 公司为评估测试平台的托管方,该公司随后声明三起事件均源于「同一评估环境问题」。

换句话说,行业里最舍得投入安全的几家实验室,在最近两个月里接连栽在了同一类问题上:不是模型突破了防御,而是评测环境本身就没关好门。Anthropic 的应对还包括与 METR 合作开展独立审查,并公开呼吁行业就前沿 AI 的开发节奏建立「合法、可验证、有效」的协调机制,避免安全标准上的逐底竞争。

对正在部署 Agent 的企业,这份复盘能直接转成一张自查清单:工具权限是不是给太宽、任务边界是不是写成了会被现实戳破的假话、沙箱是不是真的默认断网、异常行为有没有实时监控。至于 Anthropic 自己,150 名工程师的转岗是「临时」的,冻结期结束后生产环境的强化学习已大部分恢复——整改效果如何,要等下一份独立审查报告出来才算数。