8 月 11 日,英伟达一口气放出两项开源:面向高并发智能体工作流的 300 亿参数 MoE 开放模型 Nemotron 3.5 Lightning,以及为 AI 智能体设计的开源模型路由库 NeMo Switchyard。前者把「特定任务小模型」的性价比再推一档,后者则把「把 Agent 工作流每一步路由到最合适的模型」从工程师的手工配置,变成可编程、可调优的默认能力——在推理支出首超训练、大模型价格战白热化的当下,英伟达正用「系统之模型」(system of models)的叙事,押注一个多模型并存的智能体未来。
一、Nemotron 3.5 Lightning:为 always-on 智能体而生的 30B MoE
Nemotron 3.5 Lightning 是一个 300 亿参数的混合专家开放模型,专为大型多智能体系统中的特定任务而构建——例如代码审查、工具使用、安全告警监测、计费问答等高并发专项工作,而非替代前沿推理模型做全局规划。英伟达的定位是:像 Nemotron 3 Ultra 这样的前沿模型负责规划与协调工作流,而 Lightning 这类小型专用模型承担高频专项任务。性能方面,官方称其 Token 生成速度最高提升 4 倍、Agent 任务整体完成时间快 30%(对比同类开放模型)。模型为开放权重、可自由微调:开发者可以训练它遵循特定编码规范、学习摄影或 3D 设计等专业术语、按既定风格撰写文档,再配合工具调用打造个性化的本地 Agent——管理邮件日历的助手、处理日常事务的智能家居智能体、在本地代码库中协同的编程伙伴。本地部署生态是此次发布的重头:英伟达与 vLLM、Ollama、llama.cpp、LM Studio 合作提供 NVFP4 与 GGUF 格式,Unsloth 首日即提供优化量化支持;模型可运行于 RTX PC、DGX Spark、OEM GB10 与 Jetson 等边缘设备,并向上扩展到 RTX PRO 工作站、数据中心与云端。此外,英伟达同步发布了 Nemotron-RL-Agentic-Terminal-Pivot 强化学习数据集,可对 Lightning 进行后训练以培养编程智能体能力。
二、NeMo Switchyard:把「路由」做成开源基础设施
NeMo Switchyard 是本次发布更具战略意义的一块。它是一个开源模型路由库:根据准确性、速度与成本,自动把智能体工作流中的每一步路由到最合适的模型,开发者可替换不同的路由算法以匹配自身对质量、延迟与成本的优先级,且无需重写应用。英伟达内部基准显示,Switchyard 通过「在模型系统中路由每个步骤」,在维持前沿级任务完成能力的同时,把基准完成成本降至单独使用 Opus 4.8 时的约三分之一。一批生态伙伴给出了各自的实测数据:Boomi 在五项路由能力上实现 100% 领域路由准确率,把 59% 的流量导向速度快 5 倍的微调模型,并将后续轮次延迟降低 21%;Cognition 将 Switchyard 分级路由器集成进 Devin,在 FrontierCode Main 上获得接近前沿的性能、平均成本降低 28%;LangChain 在 145 个多轮 Deep Agents 任务中实现成本下降 74%——仅把 7% 的调用路由到前沿模型,以 6% 的准确率损失为代价;Ramp 在 SWE-Bench 上匹配前沿模型性能的同时成本降低 58%、运行时间缩短 33%;Classmethod 内部测试成本降 27%;Cadence 在形式验证场景效率提升 9.9%;Kong 在 AI 网关中原生提供 Switchyard 路由,LiteLLM 将其做成代理层插件,Nous Research 将其集成进 Hermes,Siemens 正在其 EDA 智能体中评估。
三、为什么「路由」成了新战场
路由之所以在 2026 年夏天成为焦点,背景是三重挤压的汇合:其一,推理支出首次超过训练支出,Token 成本直接决定 Agent 产品的盈亏——一个多步 Agent 的 Token 花费随循环长度近似平方级增长,成本工程从「省钱技巧」升级为「商业模式」;其二,模型价格战(Grok 4.6 定价为竞品一半、GPT-5.6 Luna 降价 80%)让「单一默认模型」的性价比假设被反复冲击——只用最贵的前沿模型会超支,只图便宜又牺牲质量,人工路由又成了拖慢部署的集成负担;其三,多智能体系统的成熟让「不同任务配不同模型」成为架构共识。Switchyard 给出的是结构化答案:让少数高价值调用承担前沿模型成本,把高频专项任务交给特定小模型——LangChain 场景里仅 7% 的调用需要前沿模型。这与 Grok 4.6 的「低价单体」路线、Gemini 的「单体野心」形成对照:英伟达押注的是「没有任何一个模型通吃一切」的未来,而路由层正是它在模型层之外卡位的新生态位——7 月它与 LangChain 联合发布的 NeMoClaw Deep Agents 蓝图强调开源 Agent 降本 10 倍,Switchyard 正是这条思路的落地。
四、客观看:路由不是银弹
几点客观边界需要标注。其一,「成本降至 Opus 4.8 的三分之一」为英伟达内部基准口径,伙伴数据多来自试点或特定场景,规模化长期效果有待独立验证;其二,路由质量依赖对任务类型与模型能力画像的准确建模,路由决策本身也有推理开销与延迟,复杂任务上「路由判断错误」可能抵消全部收益;其三,安全与治理维度:路由层若被误导,可能把敏感任务分发给能力或合规不足的弱模型,路由日志本身也成为新的审计与攻击面;其四,Nemotron 3.5 Lightning 的 300 亿参数规模决定了它是「特定任务主力」而非「全能选手」,跨场景泛化能力有限。总体而言,Nemotron 3.5 Lightning 补足了「任务专用小模型」拼图,NeMo Switchyard 则试图把模型路由标准化为 Agent 基础设施的一层——英伟达的野心是成为 Agent 时代的「模型操作系统」,而这场赌局的胜负,取决于生态采纳速度与路由可靠性能否同时兑现。