2026年6月27日,OpenAI 正式发布 GPT-5.6 系列模型。与外界预期的"全面上线"不同,这场发布最大的新闻不在模型本身,而在发布方式——应美国政府要求,GPT-5.6 系列仅向有限数量的"可信合作伙伴"提供预览权限。OpenAI 同时在公告中罕见公开表态:政府审批式的模型开放机制"不应成为长期默认做法"。
这是继 Anthropic Claude Fable 5 出口管制事件之后,美国政府第二次深度介入全球最前沿 AI 模型的发布流程。AI 行业的竞争格局,正在从比拼模型能力,升级为比拼监管合规与政府关系。
一、三档模型:Sol、Terra、Luna 差异化定位
OpenAI 本次共发布三档模型,覆盖从高强度科研到日常高频调用的全场景:
- GPT-5.6 Sol(旗舰版)——OpenAI 官方自称"当前最强模型",面向科研、编程、网络安全等高难度场景。新增 Max 推理强度模式和 Ultra 模式,后者可借助子智能体(sub-agent)加速复杂任务分解与执行。
- GPT-5.6 Terra(均衡版)——定位于兼顾效率与日常工作的平衡型模型,性能介于 Sol 和 Luna 之间,适合绝大多数企业级应用场景。
- GPT-5.6 Luna(轻量版)——面向高频次、大规模任务的快速经济型模型,适用于批量处理、内容审核、客服对话等对成本高度敏感的场景。
定价方面,GPT-5.6 Sol 的收费为 5 美元/百万输入 token、30 美元/百万输出 token,仅为 Anthropic Claude Fable 5(10 美元/百万输入 token、50 美元/百万输出 token)的一半左右。Terra 定价为 Sol 的一半,Luna 则不到 Terra 的一半。优化后的提示词缓存机制在重复调用场景中进一步降低了使用成本。
二、编程跑分首超 Mythos 5:Terminal-Bench 2.1 刷新纪录
在模型能力方面,GPT-5.6 Sol 最受关注的是编程基准测试成绩。在 Terminal-Bench 2.1 上,Sol 标准模式下得分 88.8%,一举超过 Claude Mythos 5 的 88.0%,成为该基准的最高纪录保持者。在开启 Ultra 模式后,Sol 的得分进一步提升至 91.9%,领先优势显著扩大。
在生物学 GeneBench v1 测试中,Sol 以更少的 token 消耗实现了比 GPT-5.5 更强的性能表现。网络安全方面,Sol 在 ExploitBench 漏洞研究基准测试中,仅用约三分之一的输出 token 即可达到与 Mythos Preview 相近的表现——对于长链路安全任务而言,这意味着成本的大幅下降和效率的显著提升。
OpenAI 表示,新模型在软件工程、自主智能体(Agent)任务、网络安全、防御研究等领域均取得"显著提升",并经过了超过 70 万 GPU 小时的自动化安全测试以及大量外部红队评估。
三、最值得关注的变化:发布方式本身
相比模型性能的提升,业内人士普遍认为此次发布方式的变化更具标志性意义。
OpenAI 在官方公告中披露,GPT-5.6 系列的限量开放安排并非公司主动决定,而是应特朗普政府要求实施。美国政府希望在模型全面公开前,对具有潜在网络安全能力的前沿模型建立统一审查流程。首批获得权限的企业约二十家左右,未来几周将逐步扩大开放范围。据报道,在当前机制下,部分客户的模型访问权限甚至需要政府逐一批准。
这一安排延续了此前特朗普政府针对前沿 AI 模型的监管思路。就在数周前,美国政府已要求 Anthropic 撤回部分新模型的公开发布。如今,OpenAI 也同样需要在模型上线前接受政府安全评估。
OpenAI 在公告中加入了一段措辞并不柔软的表态:公司"坚信应实现广泛的访问权限,并计划在未来几周内全面推出 GPT-5.6 系列",但这种政府审批式的模型开放机制"不应成为长期默认做法"。公司希望借此次预览,与美国政府共同建立一套"清晰、可重复执行的审批流程",而非让逐案审批成为行业常态。
四、安全评估:尚未达到最高风险等级
根据 OpenAI 同步发布的 Deployment Safety 报告,GPT-5.6 虽然在自主执行任务、漏洞分析及复杂推理方面能力进一步增强,但公司认为其尚未达到 Preparedness Framework 中需要最高等级限制的"危险阈值"。
报告指出:模型的网络安全能力虽有明显增强,但更擅长发现软件漏洞而非帮助实施攻击;发布前已接受自动化测试、专家红队以及外部机构评估,整体风险可控。
安全设计方面,GPT-5.6 系列采用分层防护体系,包括模型内置拒答机制、生成过程实时分类器、账户级风险审查、差异化访问策略以及监控和执法机制。对于高风险情况,系统可暂停生成并交由更大推理模型复核,若判定违规,内容会在展示前被拦截。
五、产品体系全面升级:Codex 和 ChatGPT 将接入 GPT-5.6
除 API 外,OpenAI 表示 Codex 和 ChatGPT 也将逐步升级至 GPT-5.6 架构。这意味着 OpenAI 整个产品体系——从代码生成到对话交互——都将切换至新一代模型底座。只是全面开放的时间节点,仍取决于政府审查流程的推进速度。
此外,OpenAI 计划于今年 7 月在 Cerebras 硬件上部署 GPT-5.6 Sol,提供最高每秒 750 token 的生成速度,初期仅向部分客户开放。
六、行业影响:AI 竞争进入"模型+监管"双维度时代
GPT-5.6 的发布,标志着全球 AI 竞争进入了一个新阶段。
一方面,模型能力的迭代仍在加速。GPT-5.6 Sol 在编程跑分上首次超越 Claude Mythos 5,定价仅为对手一半,性价比优势极为突出。三档差异化模型的布局,也让 OpenAI 的产品矩阵从"单一旗舰"走向"分层覆盖",面向不同用户群体的需求提供精准匹配。
另一方面,美国政府深度介入前沿模型发布流程,意味着 AI 行业的竞争维度正在增加。Anthropic 和 OpenAI 先后承受出口管制与政府审查后,"模型发布是否需要政府批准"已不再是假设性问题。未来,AI 公司不仅要比拼模型能力和商业策略,还要比拼政府关系与合规能力。
OpenAI 在公告中那句"不应成为长期默认做法",与其说是表态,不如说是一种预警——当前沿 AI 模型的能力达到可以自主发现零日漏洞的级别,政府监管的介入几乎是必然的。对于整个行业而言,如何在技术创新与国家安全之间找到可持续的平衡点,将成为未来数年最重要的议题之一。
而在"受限发布"期间,首批获得访问权限的可信合作伙伴将拥有短暂但关键的先发优势。当 GPT-5.6 全面开放之日,AI 应用层的竞争格局可能已经因此改写。