2026 年 8 月,智谱发布 GLM-5.3——基座与 GLM-5.2 完全一致,提升全部来自「极致后训练 Scaling」:Terminal-Bench 从 4.6 直接跃升到 28.3(开源模型最高)、DeepSWE v1.1 从 46.2 涨到 66.9。更意外的是,它在预发布测试中涌现出网络安全能力:CyberGym 得分 84.5%(与闭源顶级模型 Mythos 5 的 83.8% 持平),还发现了 2436 个潜在漏洞(含 1097 个中高危)和一个潜伏 40 年的 DNS 协议缺陷。本教程带你从接入、编程实测到安全审计,把 GLM-5.3 用起来。
先看懂:为什么「基座不变」也能翻倍提升
过去大家默认「能力 = 预训练砸更多算力」,GLM-5.3 给出了另一个答案:后训练(Post-training)本身就是一个独立的 Scaling 维度。同一套基座,靠极致的后训练配比,就能让终端任务能力数倍跃升:
| 基准 | GLM-5.2 | GLM-5.3 | 说明 |
|---|---|---|---|
| Terminal-Bench | 4.6 | 28.3 | 开源模型最高,终端实操大幅提升 |
| DeepSWE v1.1 | 46.2 | 66.9 | 软件工程任务,接近闭源第一梯队 |
| CyberGym | — | 84.5% | 网络安全能力「涌现」,持平 Mythos 5(83.8%) |
对开发者来说,这意味着:想提升 Agent 的终端执行能力,不一定要换更大的基座——后训练优化同样是一条被验证的路。GLM-5.3 权重将在两周内开源(MIT/开源协议),届时本地部署与私有化场景也能吃到这份能力。
注意区分:本教程聚焦 GLM-5.3 的「编程 + 安全」能力与用法;如果是要把 GLM 系模型接入企业 Agent 业务流程(对话、知识库、任务编排),请看《GLM-5 企业接入》那篇的接入链路。
Step 1:开通 BigModel 开放平台,拿到 API Key
GLM-5.3 通过智谱 BigModel 开放平台提供 API,接入链路与 GLM-5 一致:
1. 打开 open.bigmodel.cn,注册/登录账号
2. 进入「API Keys」页面,创建一把密钥
(密钥形如:xxxxxxxx.xxxxxxxx,注意妥善保管)
3. 阅读计费页,确认 GLM-5.3 的输入/输出单价
(新模型上线初期通常有优惠或限流,以官方为准)
4. 记下模型名:glm-5.3(示例,按官方文档为准)
Step 2:接入你的 Agent,验证编程能力
GLM-5.3 的 DeepSWE 66.9、Terminal-Bench 28.3 都是「终端执行」类指标,最适合当编程/运维 Agent 的执行大脑。接入方式有两条:
方式 A:API 直调(适合自建 Agent 编排)
用 zhipuai SDK 或 OpenAI 兼容端点调用,
把模型名设为 glm-5.3,其余参数不变
方式 B:接入 Agent 前端(如 Claude Code / Codex 类
支持自定义模型端点的工具)
1. 在工具配置里选「自定义模型/API 端点」
2. 填 BigModel 的 Base URL 与你的 API Key
3. 模型名填 glm-5.3
4. 用一个小型真实任务验证(如修一个已知 bug)
Step 3:安全能力实测——让它审代码
GLM-5.3 在 CyberGym 拿到 84.5%,且在预发布测试中发现 2436 个潜在漏洞(覆盖内核、浏览器、DNS 等 269 个开源项目),其中包含一个潜伏 40 年的 DNS 协议缺陷。这意味着它具备超越常规模式识别的深度推理审计能力:
实测建议:
1. 挑一个自己维护的小项目(几百行即可)
2. 让 Agent 用 GLM-5.3 做一轮安全审查:
「请审查本项目的输入校验、权限检查、
依赖版本,列出潜在风险并给出修复建议」
3. 重点看它是否能发现「非模板化」问题:
—— 经典注入/越权漏洞它当然会找
—— 关键看它能不能发现设计层面的
逻辑缺陷(这才是 84.5% 的含金量)
4. 把发现整理成问题清单,人工复核后修复
Step 4:参与「开源的盾」免费安全审计
智谱同步启动了「开源的盾」计划:对重点开源项目提供免费安全审计。如果你维护开源项目,这是零成本拿到前沿模型安全审计的机会:
1. 确认项目符合计划要求
(重点开源项目、有活跃维护,具体以官方公告为准)
2. 通过智谱官方渠道提交申请
(留意官方公众号/官网的申请入口)
3. 审计完成后:复核报告、修复高危项
4. 把审计结论沉淀进项目 SECURITY.md,
提升项目可信度
Step 5:权重开源后的本地/私有化路线
GLM-5.3 权重计划在两周内开源,届时敏感场景可以完全私有化。提前做三件事:
1. 硬件评估:确认 GLM-5.3 的参数量与显存需求
(开源后查官方模型卡,估好显存/内存)
2. 推理框架选型:Ollama / vLLM / llama.cpp
(优先选你团队熟悉的,部署成本最低)
3. 数据安全清单:明确哪些数据不能出内网,
私有化后这些任务直接本地跑
本地部署的基础方法可参考:
《Ollama 本地跑 Agent 模型》
《本地隐私优先 Agent》
提醒:开源权重版本与 API 版本的能力可能略有差异(取决于开源时是否附带完整后训练配方),上线前务必在自有基准上复测,别直接照搬 API 的评测数字。
Step 6:落地决策清单
把以上信息浓缩成一张决策表,按你的场景对号入座:
场景 推荐程度 理由
开源编程 Agent(想不被锁定) ★★★★★ 开源最高 Terminal-Bench +
Apache/MIT 可商用
代码安全审计(上线前筛查) ★★★★☆ CyberGym 84.5%,性价比高
数据不能出内网的私有化部署 ★★★★☆ 权重开源,本地可跑(待验证)
已深度绑定闭源模型的长链路 ★★★☆☆ 迁移有成本,先跑回归用例
纯对话/知识问答场景 ★★☆☆☆ 杀鸡用牛刀,选轻量模型更划算
常见问题速查
| 你遇到的问题 | 原因 & 解决 |
|---|---|
| Terminal-Bench 28.3 但我的任务没这么强 | 基准是理想评测环境;真实任务要先跑一轮回归,再决定是否全量切换 |
| 安全审计结果误报太多 | AI 审计偏「宁多勿漏」,建议结合人工复核 + 规则引擎(如 Semgrep)分层过滤 |
| API 与开源权重能力不一致 | 以实测为准;开源版上线前在自有任务集上复测,差异大就继续用 API |
| 想本地部署但显存不够 | 等权重发布后看量化方案(4bit/8bit),或先用 API 验证业务价值再投入硬件 |