入门 📋 6 个步骤 第 275 / 470 篇

Nemotron 3.5 Lightning 上手:给多智能体系统配一个「高频执行层」开源模型

NVIDIA 8-11 发布 30B-A3B MoE 开源模型 Nemotron 3.5 Lightning:输出速度最高 4 倍、Agent 任务完成提速 30%,专为多智能体的执行层高频任务(工具调用/结果校验/子智能体委派)设计;Ollama/llama.cpp/LM Studio 本地可跑,配套 NeMo Switchyard 路由库,OpenMDW-1.1 许可。本教程从模型定位、Ollama 部署、框架接入、路由、微调讲到硬件选型。

2026.08.13· 15 分钟阅读· 约 2052 字· ⚡ Nemotron 3.5 Lightning

2026 年 8 月 11 日(北京时间 21:00),NVIDIA 发布 Nemotron 3.5 Lightning:一个 300 亿总参数 / 30 亿激活参数(30B-A3B)的开放权重混合专家(MoE)模型,专为大型多智能体系统中的「执行层」设计——工具调用、结果校验、子智能体委派这类高频任务。官方数据:输出速度最高为同类开放模型的 4 倍,Agent 任务完成速度提升 30%(PinchBench)。它可直接跑在本地(RTX PC / DGX Spark / Jetson),配套 NeMo Switchyard 路由库与强化学习数据集,按 OpenMDW-1.1 协议开源。本教程从模型定位、Ollama 本地部署、接入 Agent 框架讲到路由与微调。

⚡ 本教程适合:想给多智能体系统配「便宜好用的执行模型」的开发者与 AI 发烧友。想对比其他端侧 Agent 模型可看本站《Meta Muse Glimmer》与《Liquid LFM2.5》;本地模型入门见《Ollama 本地 Agent》。

先搞懂:多智能体系统的「规划层」与「执行层」为什么需要分开?

大型多智能体系统的流量分布很不均匀:复杂推理(规划、拆解、方案设计)频率低但要求高;工具调用、结果校验、子智能体委派频率极高但单次要求低。如果所有请求都走旗舰模型,成本与延迟双双失控。Nemotron 3.5 Lightning 的定位就是「执行层」:MoE 架构每次只激活 3B 参数,换来大模型级能力与小模型级成本,专吃高频任务。

对比规划层(强模型)执行层(Lightning)
任务拆解、方案、复杂推理工具调用、结果校验、委派
频率低高
单次要求高低
成本诉求容忍必须低
典型实现Claude Fable 5 / 旗舰Nemotron 3.5 Lightning
💡 一句话记住:Lightning 是给多智能体系统当「流水线工人」的——搬砖、检查、派活这些高频动作交给它,复杂决策留给旗舰,系统整体又快又省。

Step 1:认识模型:30B-A3B、4 倍速度、为 Agent 任务而训练

1 认识模型:30B-A3B、4 倍速度、为 Agent 任务而训练

先看清定位与配套:

模型规格:
· 架构:300 亿总参数 / 30 亿激活 MoE
· 定位:大型多智能体系统的「执行层」
· 性能:输出速度最高 4 倍于同类开放模型,
        Agent 任务完成速度 +30%(PinchBench)
· 专项:针对 OpenClaw、Hermes Agent 等
        智能体框架优化训练
· 许可:OpenMDW-1.1(权重/训练数据/配方公开,
        支持追溯、审计与二次开发)

配套:
· NeMo Switchyard:智能路由库(把请求分给
  最合适模型,无需重写应用)
· Nemotron-RL-Agentic-Terminal-Pivot:
  提升终端环境下智能体操作能力的 RL 数据集

注意成熟度:NeMo Switchyard 当前为 pre-alpha,不建议直接上生产;模型本体与格式(NVFP4 / GGUF)可直接用于本地部署。

Step 2:Ollama 本地部署:一行命令跑起来

2 Ollama 本地部署:一行命令跑起来

NVIDIA 与 vLLM、Ollama、llama.cpp、LM Studio 合作提供了本地部署体验,GGUF 格式可直接用 Ollama:

安装与运行(Ollama):
· 安装 Ollama 后拉取模型
  ollama run nemotron35-lightning
  (或按官方 ModelScope / Hugging Face 提供的 tag)
· 验证:让它连续做 20 次工具类问答,
  记录响应速度与稳定性

格式选择:
· GGUF → Ollama / llama.cpp / LM Studio
· NVFP4 → vLLM(服务化、高吞吐)
· 端侧 → Jetson / RTX 5090 等设备本地跑
💡 本地部署的红利是数据驻留:金融、医疗等强监管场景,敏感数据不需要离开企业可控环境;现有 RTX PC / DGX Spark 就能跑,先最大化利用现有基础设施。

Step 3:接入 Agent 框架:给 OpenClaw / Hermes 换「执行大脑」

3 接入 Agent 框架:给 OpenClaw / Hermes 换「执行大脑」

模型针对 OpenClaw、Hermes Agent 等框架做了专项优化,接入方式按各框架的模型配置改即可:

通用接入思路:
① 在 Agent 框架配置中新增本地模型端点
   · Ollama 本地:http://localhost:11434
   · vLLM 服务化:http://:8000
② 把「执行型」任务路由到 Lightning
   · 工具调用:读文件、查库、写临时脚本
   · 结果校验:检查上一步输出是否符合格式
   · 子智能体委派:短任务直接下放
③ 保留旗舰模型处理「规划/复杂推理」

验证指标:
· 单任务延迟 vs 原方案
· 工具调用成功率
· 每 1000 次任务的 token 成本对比
💡 先做「读」类任务(文件读取、数据提取、格式校验)——失败成本低、收益立竿见影;稳定后再上「写」类任务(改代码、写脚本)。详见本站《Hermes Agent 装机》与《goose 开源 Agent》。

Step 4:NeMo Switchyard:让流量自动「找对模型」

4 NeMo Switchyard:让流量自动「找对模型」

多模型并存后,路由是关键。NeMo Switchyard 就是那个「调度员」:

路由规则(概念):
· 复杂推理 / 长程规划 → 旗舰模型
· 高频执行 / 简单问答 → Nemotron 3.5 Lightning
· 开发者自定义:开源、专有、NVIDIA 模型自由组合

好处:
· 无需重写应用代码即可接入新模型
· 请求按规则智能分发,成本与延迟双降
· 可自建路由规则(按任务类型 / 按模型能力)

注意:
· 当前 pre-alpha,先小范围试用
· 路由决策要可观测(每请求落哪个模型要有日志)

路由不等于调优:路由只解决「谁来做」,不解决「做得好不好」。上线后要监控每个模型分组的错误率——执行模型误判率升高时,该提升级规则而不是默默兜底。

Step 5:微调入门:让 Lightning 说「你的话」

5 微调入门:让 Lightning 说「你的话」

开放权重最大的红利是可微调,官方还配套了 RL 数据集:

可微调的方向(官方示例):
① 指定风格写作
   · 遵循既定语气、格式与术语(邮件/报告/文档)
② 掌握专业技能
   · 摄影、游戏、3D 设计等领域语言与常见任务
③ 遵循特定编程方式
   · 首选编码规范、框架与测试方法
④ 智能体操作强化
   · Nemotron-RL-Agentic-Terminal-Pivot 数据集
   · 提升终端环境下的工具操作能力

流程:
准备示例数据 → 后训练 → 评估 → 重新部署
💡 微调前先问「是不是微调问题」:大部分本地化需求(术语、格式、规范)用提示词与 few-shot 就能覆盖;微调适合「提示词塞不下的行为级改变」。

Step 6:硬件选型与组合落地:从单卡到多 Agent 集群

6 硬件选型与组合落地:从单卡到多 Agent 集群

最后按你的硬件情况选择落地形态:

硬件档位(官方支持):
· 入门:RTX 5090 / RTX PRO 工作站 → 本地执行层
· 进阶:DGX Spark / DGX Station → 中型团队服务
· 端侧:Jetson → 边缘设备离线智能体
· 云端:数据中心 / 云环境 → 企业级扩展

组合落地三步:
① 单机验证:Ollama + Lightning 跑通执行任务
② 集群分工:规划(旗舰)+ 执行(Lightning)
   + 路由(Switchyard)
③ 规模化:加监控、加配额、加缓存,逐级放量
🎉 小结:Nemotron 3.5 Lightning 用 30B-A3B 的 MoE 架构和 4 倍输出速度,把「执行层」从旗舰模型的成本区解放出来——Ollama 本地跑、框架直连、Switchyard 路由、按需微调,四步就能给多智能体系统装上高效流水线。端侧模型更极致的「轻量路线」见《LFM2.5》,自进化 Harness 见《PenguinHarness》。

常见问题速查

你的疑问参考答案
Nemotron 3.5 Lightning 是开源的吗?是。开放权重,按 OpenMDW-1.1 协议开源,权重/训练数据/配方公开
多大?要什么显卡?300 亿总参数/30 亿激活(30B-A3B MoE);RTX 5090、RTX PRO、DGX Spark、Jetson 均可本地部署
比同类模型快多少?输出速度最高 4 倍,Agent 任务完成速度 +30%(官方 PinchBench 数据)
适合做什么?多智能体的「执行层」:工具调用、结果校验、子智能体委派等高频任务
能用 Ollama 跑吗?能。官方与 Ollama、llama.cpp、LM Studio、vLLM 合作,提供 GGUF 与 NVFP4 格式
NeMo Switchyard 能直接用吗?当前为 pre-alpha,不建议生产环境直接使用;可小范围试用并自建路由规则
← 返回教程中心