8 月 14 日,智谱正式发布新一代基座模型 GLM-5.3。与业界惯常的「换基座、堆参数」节奏不同,GLM-5.3 的发布路径相当「省事」:基座模型与 GLM-5.2 完全相同,官方把全部能力提升归因于极致的后训练 Scaling——数十倍的长程任务环境、更丰富多样的环境类型,以及超长的后训练时间。智谱在官方技术报告中把这句判断标亮加粗:「可能我们还远未开发出这个基座的智能上限。」用后训练去「榨」同一个基座的上限,而不是急着换新底座,这成为 2026 年 8 月国产大模型竞争里一个值得被单独记录的样本。

一、后训练 Scaling:同一基座上的「能力再开发」

GLM-5.3 与 GLM-5.2 的差异,几乎全部由后训练阶段制造。智谱披露,其基于 IndexShare、SAO 以及持续演进的新一代 Slime 框架,在与 GLM-5.2 完全相同的基座上高效推进强化学习。通俗地说,如果把基座模型比作一块「原材料」,GLM-5.2 与 GLM-5.3 用的同一块料,但后者在更长、更复杂、更多样的任务环境里被反复「打磨」——数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间,让同样的基座涌现出超出预期的能力。这套路线的商业含义相当直接:不换基座意味着省下从零预训练的巨大算力开支,把预算集中投向后训练与强化学习环节,追求「单位成本的能力增量」最大化。在国产模型普遍追求参数规模叙事、海外模型忙于降价与开源反扑的当下,智谱用一份「不换药」的技术报告,把竞争焦点拉回到工程效率本身。

二、数据说话:编程与智能体基准全线跃升

智谱官方给出的基准成绩覆盖了编程与智能体两大主线。在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 提升至 28.3;在聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1 上,得分从 46.2 提升至 66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents’ Last Exam 上,得分从 23.8 提升至 28.5;在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中得分 1769。智谱官方口径称,GLM-5.3 在包括 Terminal-Bench 3.0、Agents’ Last Exam(CLI)在内的公开基准测试中取得开源第一,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型;内部自建体感评测中较 GLM-5.2 提升约 50%。需要客观标注的是,以上成绩均为厂商自报口径,跨厂商对比缺乏独立第三方复测确认。

三、从写代码到「攻防」:网络安全成为新卖点

GLM-5.3 本次升级最值得注意的新维度是网络安全能力。智谱把网络安全视为代码能力向更高阶任务的延伸——模型需要理解程序逻辑、协议规则、权限边界和攻击路径。在 CyberGym 漏洞推理评测中,GLM-5.3 得分为 84.5%,高于 GLM-5.2 的 77.2%,也略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%;在白盒代码审查与漏洞发现等安全任务中,表现持平 Mythos 5。智谱同时披露了一组颇具冲击力的实测数据:模型发布前两周,团队联合安全专家开展测试,发现 2404 个潜在漏洞,其中 1088 个为中高危漏洞;研究人员借助 GLM-5.3 发现了一个潜伏 40 余年的 DNS 协议级风险——攻击者仅需少量特殊请求即可将服务器压力最高放大近 8 万倍,潜在影响超过 1000 万处公网 DNS 服务。这意味着模型能力正在从 Benchmark 测试走向真实专业工作流。也是出于安全考量,GLM-5.3 的完整模型权重计划在发布两周后开源,先完成安全评估与模型加固,「尽可能限制其潜在攻击能力,保留其防御价值」。

四、客观看:能力跃升背后,生态接入与「双刃剑」并存

几点客观边界需要标注。其一,GLM-5.3 的能力数字均为官方口径,Terminal-Bench 3.0、DeepSWE 等基准成绩与 Claude Fable 5、Mythos 5 的横向对比缺乏第三方复测,「开源第一」「接近 Fable 5」应视为官方宣称而非定论;其二,后训练 Scaling 的边际收益存在不确定性——同一基座被反复打磨,能力提升的天花板在哪里、下一次还能不能「加练」出同样的涨幅,行业暂未披露系统性数据;其三,网络安全能力的「双刃剑」属性需要正视——漏洞发现能力越强,被恶意滥用的风险也越高,权重延后两周开源、先做安全加固的安排,本身就是对这项风险的承认;其四,模型发布当天的生态动作值得关注:金山办公旗下 AI 办公智能体灵犀专业版首发接入 GLM-5.3(前一天刚接入 DeepSeek-V4-Pro 正式版),ZCode、AutoClaw、GLM Coding Plan 同步上线,Trae、WorkBuddy、Qoder、CatPaw、OpenCode 等编码平台开放抢先体验——办公与编程场景的「多模型矩阵」正在成为常态,模型厂商想撬动客户,光会聊天已经不够,能写代码、能查漏洞正在变成硬指标。总体而言,GLM-5.3 用「不换基座」的方式证明了一件事:当行业都在卷参数与新底座时,后训练阶段可能还藏着大量未被开发的能力红利——而把这份红利兑现为编程与安全的交付能力,才是模型真正走向商业化的路径。