2026 年 8 月 11 日(北京时间 21:00),NVIDIA 发布 Nemotron 3.5 Lightning:一个 300 亿总参数 / 30 亿激活参数(30B-A3B)的开放权重混合专家(MoE)模型,专为大型多智能体系统中的「执行层」设计——工具调用、结果校验、子智能体委派这类高频任务。官方数据:输出速度最高为同类开放模型的 4 倍,Agent 任务完成速度提升 30%(PinchBench)。它可直接跑在本地(RTX PC / DGX Spark / Jetson),配套 NeMo Switchyard 路由库与强化学习数据集,按 OpenMDW-1.1 协议开源。本教程从模型定位、Ollama 本地部署、接入 Agent 框架讲到路由与微调。
先搞懂:多智能体系统的「规划层」与「执行层」为什么需要分开?
大型多智能体系统的流量分布很不均匀:复杂推理(规划、拆解、方案设计)频率低但要求高;工具调用、结果校验、子智能体委派频率极高但单次要求低。如果所有请求都走旗舰模型,成本与延迟双双失控。Nemotron 3.5 Lightning 的定位就是「执行层」:MoE 架构每次只激活 3B 参数,换来大模型级能力与小模型级成本,专吃高频任务。
| 对比 | 规划层(强模型) | 执行层(Lightning) |
|---|---|---|
| 任务 | 拆解、方案、复杂推理 | 工具调用、结果校验、委派 |
| 频率 | 低 | 高 |
| 单次要求 | 高 | 低 |
| 成本诉求 | 容忍 | 必须低 |
| 典型实现 | Claude Fable 5 / 旗舰 | Nemotron 3.5 Lightning |
Step 1:认识模型:30B-A3B、4 倍速度、为 Agent 任务而训练
先看清定位与配套:
模型规格:
· 架构:300 亿总参数 / 30 亿激活 MoE
· 定位:大型多智能体系统的「执行层」
· 性能:输出速度最高 4 倍于同类开放模型,
Agent 任务完成速度 +30%(PinchBench)
· 专项:针对 OpenClaw、Hermes Agent 等
智能体框架优化训练
· 许可:OpenMDW-1.1(权重/训练数据/配方公开,
支持追溯、审计与二次开发)
配套:
· NeMo Switchyard:智能路由库(把请求分给
最合适模型,无需重写应用)
· Nemotron-RL-Agentic-Terminal-Pivot:
提升终端环境下智能体操作能力的 RL 数据集
注意成熟度:NeMo Switchyard 当前为 pre-alpha,不建议直接上生产;模型本体与格式(NVFP4 / GGUF)可直接用于本地部署。
Step 2:Ollama 本地部署:一行命令跑起来
NVIDIA 与 vLLM、Ollama、llama.cpp、LM Studio 合作提供了本地部署体验,GGUF 格式可直接用 Ollama:
安装与运行(Ollama):
· 安装 Ollama 后拉取模型
ollama run nemotron35-lightning
(或按官方 ModelScope / Hugging Face 提供的 tag)
· 验证:让它连续做 20 次工具类问答,
记录响应速度与稳定性
格式选择:
· GGUF → Ollama / llama.cpp / LM Studio
· NVFP4 → vLLM(服务化、高吞吐)
· 端侧 → Jetson / RTX 5090 等设备本地跑
Step 3:接入 Agent 框架:给 OpenClaw / Hermes 换「执行大脑」
模型针对 OpenClaw、Hermes Agent 等框架做了专项优化,接入方式按各框架的模型配置改即可:
通用接入思路:
① 在 Agent 框架配置中新增本地模型端点
· Ollama 本地:http://localhost:11434
· vLLM 服务化:http://:8000
② 把「执行型」任务路由到 Lightning
· 工具调用:读文件、查库、写临时脚本
· 结果校验:检查上一步输出是否符合格式
· 子智能体委派:短任务直接下放
③ 保留旗舰模型处理「规划/复杂推理」
验证指标:
· 单任务延迟 vs 原方案
· 工具调用成功率
· 每 1000 次任务的 token 成本对比
Step 4:NeMo Switchyard:让流量自动「找对模型」
多模型并存后,路由是关键。NeMo Switchyard 就是那个「调度员」:
路由规则(概念):
· 复杂推理 / 长程规划 → 旗舰模型
· 高频执行 / 简单问答 → Nemotron 3.5 Lightning
· 开发者自定义:开源、专有、NVIDIA 模型自由组合
好处:
· 无需重写应用代码即可接入新模型
· 请求按规则智能分发,成本与延迟双降
· 可自建路由规则(按任务类型 / 按模型能力)
注意:
· 当前 pre-alpha,先小范围试用
· 路由决策要可观测(每请求落哪个模型要有日志)
路由不等于调优:路由只解决「谁来做」,不解决「做得好不好」。上线后要监控每个模型分组的错误率——执行模型误判率升高时,该提升级规则而不是默默兜底。
Step 5:微调入门:让 Lightning 说「你的话」
开放权重最大的红利是可微调,官方还配套了 RL 数据集:
可微调的方向(官方示例):
① 指定风格写作
· 遵循既定语气、格式与术语(邮件/报告/文档)
② 掌握专业技能
· 摄影、游戏、3D 设计等领域语言与常见任务
③ 遵循特定编程方式
· 首选编码规范、框架与测试方法
④ 智能体操作强化
· Nemotron-RL-Agentic-Terminal-Pivot 数据集
· 提升终端环境下的工具操作能力
流程:
准备示例数据 → 后训练 → 评估 → 重新部署
Step 6:硬件选型与组合落地:从单卡到多 Agent 集群
最后按你的硬件情况选择落地形态:
硬件档位(官方支持):
· 入门:RTX 5090 / RTX PRO 工作站 → 本地执行层
· 进阶:DGX Spark / DGX Station → 中型团队服务
· 端侧:Jetson → 边缘设备离线智能体
· 云端:数据中心 / 云环境 → 企业级扩展
组合落地三步:
① 单机验证:Ollama + Lightning 跑通执行任务
② 集群分工:规划(旗舰)+ 执行(Lightning)
+ 路由(Switchyard)
③ 规模化:加监控、加配额、加缓存,逐级放量
常见问题速查
| 你的疑问 | 参考答案 |
|---|---|
| Nemotron 3.5 Lightning 是开源的吗? | 是。开放权重,按 OpenMDW-1.1 协议开源,权重/训练数据/配方公开 |
| 多大?要什么显卡? | 300 亿总参数/30 亿激活(30B-A3B MoE);RTX 5090、RTX PRO、DGX Spark、Jetson 均可本地部署 |
| 比同类模型快多少? | 输出速度最高 4 倍,Agent 任务完成速度 +30%(官方 PinchBench 数据) |
| 适合做什么? | 多智能体的「执行层」:工具调用、结果校验、子智能体委派等高频任务 |
| 能用 Ollama 跑吗? | 能。官方与 Ollama、llama.cpp、LM Studio、vLLM 合作,提供 GGUF 与 NVFP4 格式 |
| NeMo Switchyard 能直接用吗? | 当前为 pre-alpha,不建议生产环境直接使用;可小范围试用并自建路由规则 |