进阶 📋 6 个步骤 第 282 / 470 篇

智谱 GLM-5.3 上手:后训练 Scaling 跑出的最强开源编程 Agent,还涌现了安全审计能力

智谱发布 GLM-5.3:基座不变、仅靠后训练 Scaling,Terminal-Bench 从 4.6 跃升至 28.3(开源最高)、DeepSWE 46.2→66.9,并涌现网络安全能力(CyberGym 84.5%),同步启动「开源的盾」免费安全审计。本教程覆盖 API 接入、编程 Agent 实测、安全审计用法与开源落地路径。

2026.08.17· 15 分钟阅读· 约 2022 字· 🧠 GLM-5.3

2026 年 8 月,智谱发布 GLM-5.3——基座与 GLM-5.2 完全一致,提升全部来自「极致后训练 Scaling」:Terminal-Bench 从 4.6 直接跃升到 28.3(开源模型最高)、DeepSWE v1.1 从 46.2 涨到 66.9。更意外的是,它在预发布测试中涌现出网络安全能力:CyberGym 得分 84.5%(与闭源顶级模型 Mythos 5 的 83.8% 持平),还发现了 2436 个潜在漏洞(含 1097 个中高危)和一个潜伏 40 年的 DNS 协议缺陷。本教程带你从接入、编程实测到安全审计,把 GLM-5.3 用起来。

📌 本教程适合:想给 Agent 换开源编程模型的开发者、做代码安全审计的团队,以及关注国产模型能力的人。想了解 GLM-5 如何接入企业业务可看《GLM-5 企业接入》;想对比 Agent 安全风险治理可看《Agent 安全实践》。

先看懂:为什么「基座不变」也能翻倍提升

过去大家默认「能力 = 预训练砸更多算力」,GLM-5.3 给出了另一个答案:后训练(Post-training)本身就是一个独立的 Scaling 维度。同一套基座,靠极致的后训练配比,就能让终端任务能力数倍跃升:

基准GLM-5.2GLM-5.3说明
Terminal-Bench4.628.3开源模型最高,终端实操大幅提升
DeepSWE v1.146.266.9软件工程任务,接近闭源第一梯队
CyberGym—84.5%网络安全能力「涌现」,持平 Mythos 5(83.8%)

对开发者来说,这意味着:想提升 Agent 的终端执行能力,不一定要换更大的基座——后训练优化同样是一条被验证的路。GLM-5.3 权重将在两周内开源(MIT/开源协议),届时本地部署与私有化场景也能吃到这份能力。

注意区分:本教程聚焦 GLM-5.3 的「编程 + 安全」能力与用法;如果是要把 GLM 系模型接入企业 Agent 业务流程(对话、知识库、任务编排),请看《GLM-5 企业接入》那篇的接入链路。

Step 1:开通 BigModel 开放平台,拿到 API Key

1 注册平台、创建密钥,5 分钟起步

GLM-5.3 通过智谱 BigModel 开放平台提供 API,接入链路与 GLM-5 一致:

1. 打开 open.bigmodel.cn,注册/登录账号
2. 进入「API Keys」页面,创建一把密钥
   (密钥形如:xxxxxxxx.xxxxxxxx,注意妥善保管)
3. 阅读计费页,确认 GLM-5.3 的输入/输出单价
   (新模型上线初期通常有优惠或限流,以官方为准)
4. 记下模型名:glm-5.3(示例,按官方文档为准)
💡 老用户迁移几乎零成本:如果你的代码已经在用 GLM-5 的 SDK,把模型名换成 glm-5.3 即可,请求/响应结构兼容。

Step 2:接入你的 Agent,验证编程能力

2 给编程 Agent 换上 GLM-5.3 大脑

GLM-5.3 的 DeepSWE 66.9、Terminal-Bench 28.3 都是「终端执行」类指标,最适合当编程/运维 Agent 的执行大脑。接入方式有两条:

方式 A:API 直调(适合自建 Agent 编排)
  用 zhipuai SDK 或 OpenAI 兼容端点调用,
  把模型名设为 glm-5.3,其余参数不变

方式 B:接入 Agent 前端(如 Claude Code / Codex 类
  支持自定义模型端点的工具)
  1. 在工具配置里选「自定义模型/API 端点」
  2. 填 BigModel 的 Base URL 与你的 API Key
  3. 模型名填 glm-5.3
  4. 用一个小型真实任务验证(如修一个已知 bug)
🔑 验证任务建议选「真实仓库里一个已知缺陷」:让 Agent 定位、改、跑测试。DeepSWE 类能力只有在真实代码任务上才能看出差别,别用聊天题测。

Step 3:安全能力实测——让它审代码

3 把安全审计从「人肉」变成「人机协同」

GLM-5.3 在 CyberGym 拿到 84.5%,且在预发布测试中发现 2436 个潜在漏洞(覆盖内核、浏览器、DNS 等 269 个开源项目),其中包含一个潜伏 40 年的 DNS 协议缺陷。这意味着它具备超越常规模式识别的深度推理审计能力:

实测建议:
1. 挑一个自己维护的小项目(几百行即可)
2. 让 Agent 用 GLM-5.3 做一轮安全审查:
   「请审查本项目的输入校验、权限检查、
    依赖版本,列出潜在风险并给出修复建议」
3. 重点看它是否能发现「非模板化」问题:
   —— 经典注入/越权漏洞它当然会找
   —— 关键看它能不能发现设计层面的
      逻辑缺陷(这才是 84.5% 的含金量)
4. 把发现整理成问题清单,人工复核后修复
⚠️ 安全审计不能全自动放飞:AI 发现的是「候选风险」,高危项务必人工复核、验证可利用性后再修。建议把审计结果纳入 CI 的「AI 安全扫描」环节,但保留人工闸门。

Step 4:参与「开源的盾」免费安全审计

4 开源项目可以申请免费审计名额

智谱同步启动了「开源的盾」计划:对重点开源项目提供免费安全审计。如果你维护开源项目,这是零成本拿到前沿模型安全审计的机会:

1. 确认项目符合计划要求
   (重点开源项目、有活跃维护,具体以官方公告为准)
2. 通过智谱官方渠道提交申请
   (留意官方公众号/官网的申请入口)
3. 审计完成后:复核报告、修复高危项
4. 把审计结论沉淀进项目 SECURITY.md,
   提升项目可信度
💡 非开源项目的团队同样受益:用同样的方法自建「AI 安全扫描」流程,成本远低于专业渗透测试,适合作为上线前的第一道筛查。

Step 5:权重开源后的本地/私有化路线

5 两周内权重开源,评估自部署方案

GLM-5.3 权重计划在两周内开源,届时敏感场景可以完全私有化。提前做三件事:

1. 硬件评估:确认 GLM-5.3 的参数量与显存需求
   (开源后查官方模型卡,估好显存/内存)
2. 推理框架选型:Ollama / vLLM / llama.cpp
   (优先选你团队熟悉的,部署成本最低)
3. 数据安全清单:明确哪些数据不能出内网,
   私有化后这些任务直接本地跑

本地部署的基础方法可参考:
《Ollama 本地跑 Agent 模型》
《本地隐私优先 Agent》

提醒:开源权重版本与 API 版本的能力可能略有差异(取决于开源时是否附带完整后训练配方),上线前务必在自有基准上复测,别直接照搬 API 的评测数字。

Step 6:落地决策清单

6 什么时候值得切到 GLM-5.3

把以上信息浓缩成一张决策表,按你的场景对号入座:

场景                          推荐程度  理由
开源编程 Agent(想不被锁定)    ★★★★★  开源最高 Terminal-Bench +
                                          Apache/MIT 可商用
代码安全审计(上线前筛查)      ★★★★☆  CyberGym 84.5%,性价比高
数据不能出内网的私有化部署      ★★★★☆  权重开源,本地可跑(待验证)
已深度绑定闭源模型的长链路      ★★★☆☆  迁移有成本,先跑回归用例
纯对话/知识问答场景            ★★☆☆☆  杀鸡用牛刀,选轻量模型更划算
📈 想了解多模型组合与成本治理,可看《DeepSeek 分层路由》;关注国产手机智能体可看《Open-AutoGLM 手机 Agent》。

常见问题速查

你遇到的问题原因 & 解决
Terminal-Bench 28.3 但我的任务没这么强基准是理想评测环境;真实任务要先跑一轮回归,再决定是否全量切换
安全审计结果误报太多AI 审计偏「宁多勿漏」,建议结合人工复核 + 规则引擎(如 Semgrep)分层过滤
API 与开源权重能力不一致以实测为准;开源版上线前在自有任务集上复测,差异大就继续用 API
想本地部署但显存不够等权重发布后看量化方案(4bit/8bit),或先用 API 验证业务价值再投入硬件
← 返回教程中心