📖 产品简介
NVIDIA Nemotron 3.5 Lightning 是 NVIDIA 于 2026 年 8 月 11 日正式发布的开放权重(open-weight)智能体模型,属于 Nemotron 3 模型家族新成员,定位为「always-on agents」专用的高速、可定制专家模型。
它采用 30B 总参数的混合专家(MoE)架构,每 token 仅激活约 3B 参数,由更大的 Nemotron 3 Ultra 蒸馏而来,可在单张 NVIDIA RTX 消费级显卡、DGX Spark、Jetson 等设备上本地运行,并向上扩展到 RTX PRO 工作站、DGX Station、GB300 及数据中心/云。NVIDIA 称其在同类开放模型中提供最高 4x 的输出速度、约 30% 更快的 Agent 任务完成,PinchBench 86.2、SWE-Bench Verified 54.3、AA-Omniscience 非幻觉 73。模型开放权重、可免费商用(NVIDIA Open Model License),并发布训练数据与技术方法;NVIDIA 同时开源 NeMo Switchyard 路由库,可将 Agent 工作流每步路由到最合适模型,内部基准将任务成本降至约 Opus 4.8 单独运行的 1/3。NVIDIA 与 vLLM、Ollama、llama.cpp、LM Studio、Unsloth 协作提供 Day-1 本地部署(NVFP4 与 GGUF 格式),并通过 Hugging Face、ModelScope、OpenRouter 与 build.nvidia.com(NIM 微服务)分发;Cline 已将其接入 FREE 模型下拉。
✨ 核心功能
- 高速 Agent 执行:30B MoE(3B 激活),最高 4x 输出吞吐、Agent 任务完成快约 30%
- 单卡可跑:RTX 消费级显卡 / DGX Spark / Jetson 本地部署,无需按 token 计费
- 专为 always-on agents 设计:高吞吐、低延迟的工具调用与多步任务执行
- 开放权重、可免费商用(NVIDIA Open Model License),并公开训练数据与方法
- 可后训练定制:用 NeMo 在自有数据上微调,匹配特定工作流(CrowdStrike/Harvey/CodeRabbit 等已接入)
- Day-1 生态:vLLM/Ollama/llama.cpp/LM Studio/Unsloth;Hugging Face/ModelScope/OpenRouter/NIM
⚖️ 优缺点分析
👍 优点
- 开放权重免费商用,单卡本地运行,隐私与成本优势明显
- 面向常驻 Agent 的高吞吐定位,适合 Agent 循环内大量重复调用
- 可后训练定制,企业可用 NeMo 微调到专属任务
- Day-1 覆盖主流推理框架与分发渠道,落地门槛低
- 与 NeMo Switchyard 路由库协同,可把任务成本压到前沿模型的约 1/3
👎 缺点
- SWE-Bench Verified 54.3 明显弱于同尺寸前沿模型,复杂推理深度有限
- 采用 NVIDIA Open Model License(非 Apache-2.0),商用条款需单独核对
- 需约 30B 权重与 RTX 级显卡,入门级设备仍无法运行
- 独立基准以外缺乏大规模第三方评测交叉验证
- 定位为「专家执行」模型,需配合前沿规划模型组成模型系统
📊 评分详情
💬 用户评价
📝 更新日志
-
2026-08-11Nemotron 3.5 Lightning 首发(开放权重)**NVIDIA 发布 Nemotron 3.5 Lightning(Aug 11)**——Nemotron 3 家族新成员,30B MoE(3B 激活)开放权重智能体模型,由 Nemotron 3 Ultra 蒸馏,专为 always-on agents 的高速、可定制执行设计。单张 RTX 消费级显卡可跑,最高 4x 输出速度、Agent 任务完成快约 30%;PinchBench 86.2 / SWE-Bench Verified 54.3 / AA-Omniscience 非幻觉 73。开放权重免费商用(NVIDIA Open Model License),并公开训练数据与方法;NVIDIA 与 vLLM/Ollama/llama.cpp/LM Studio/Unsloth 提供 Day-1 本地部署(NVFP4 与 GGUF),通过 Hugging Face/ModelScope/OpenRouter/build.nvidia.com(NIM)分发。同步开源 NeMo Switchyard 路由库(Rust),将 Agent 工作流每步路由到最合适模型,内部基准把任务成本压到约 Opus 4.8 单独运行的 1/3(LangChain 145 个多轮 Deep Agents 任务降本 74%、Ramp SWE-Bench 降本 58% 且提速 33%)。Cline 同日将其接入 FREE 模型下拉。