← 返回首页

NVIDIA Nemotron 3.5 Lightning

NVIDIA

NVIDIA 8/11 发布的开放权重 Agent 模型(30B MoE,3B 激活),专为 always-on agents 设计,单卡可跑、最高 4x 吞吐,免费商用

开源 本地 模型API Agentic
A-
面向常驻智能体的高速开放模型
⭐⭐⭐⭐

📖 产品简介

NVIDIA Nemotron 3.5 Lightning 是 NVIDIA 于 2026 年 8 月 11 日正式发布的开放权重(open-weight)智能体模型,属于 Nemotron 3 模型家族新成员,定位为「always-on agents」专用的高速、可定制专家模型。

它采用 30B 总参数的混合专家(MoE)架构,每 token 仅激活约 3B 参数,由更大的 Nemotron 3 Ultra 蒸馏而来,可在单张 NVIDIA RTX 消费级显卡、DGX Spark、Jetson 等设备上本地运行,并向上扩展到 RTX PRO 工作站、DGX Station、GB300 及数据中心/云。NVIDIA 称其在同类开放模型中提供最高 4x 的输出速度、约 30% 更快的 Agent 任务完成,PinchBench 86.2、SWE-Bench Verified 54.3、AA-Omniscience 非幻觉 73。模型开放权重、可免费商用(NVIDIA Open Model License),并发布训练数据与技术方法;NVIDIA 同时开源 NeMo Switchyard 路由库,可将 Agent 工作流每步路由到最合适模型,内部基准将任务成本降至约 Opus 4.8 单独运行的 1/3。NVIDIA 与 vLLM、Ollama、llama.cpp、LM Studio、Unsloth 协作提供 Day-1 本地部署(NVFP4 与 GGUF 格式),并通过 Hugging Face、ModelScope、OpenRouter 与 build.nvidia.com(NIM 微服务)分发;Cline 已将其接入 FREE 模型下拉。

定位
NVIDIA 8/11 发布的开放权重 Agent 模型(30B MoE,3B 激活),专为 always-on agents 设计,单卡可跑、最高 4x 吞吐,免费商用
适合人群
本地优先 / 隐私敏感开发者 Agent harness 构建者(执行层专家模型) 企业后训练定制场景 边缘 / 离线部署
支持平台
本地(RTX PC / DGX Spark / Jetson)、NIM 微服务 / OpenRouter / 云(build.nvidia.com)
开源

核心功能

  • 高速 Agent 执行:30B MoE(3B 激活),最高 4x 输出吞吐、Agent 任务完成快约 30%
  • 🖥️ 单卡可跑:RTX 消费级显卡 / DGX Spark / Jetson 本地部署,无需按 token 计费
  • 🤖 专为 always-on agents 设计:高吞吐、低延迟的工具调用与多步任务执行
  • 📜 开放权重、可免费商用(NVIDIA Open Model License),并公开训练数据与方法
  • 🔧 可后训练定制:用 NeMo 在自有数据上微调,匹配特定工作流(CrowdStrike/Harvey/CodeRabbit 等已接入)
  • 🔌 Day-1 生态:vLLM/Ollama/llama.cpp/LM Studio/Unsloth;Hugging Face/ModelScope/OpenRouter/NIM

⚖️ 优缺点分析

👍 优点

  • 开放权重免费商用,单卡本地运行,隐私与成本优势明显
  • 面向常驻 Agent 的高吞吐定位,适合 Agent 循环内大量重复调用
  • 可后训练定制,企业可用 NeMo 微调到专属任务
  • Day-1 覆盖主流推理框架与分发渠道,落地门槛低
  • 与 NeMo Switchyard 路由库协同,可把任务成本压到前沿模型的约 1/3

👎 缺点

  • SWE-Bench Verified 54.3 明显弱于同尺寸前沿模型,复杂推理深度有限
  • 采用 NVIDIA Open Model License(非 Apache-2.0),商用条款需单独核对
  • 需约 30B 权重与 RTX 级显卡,入门级设备仍无法运行
  • 独立基准以外缺乏大规模第三方评测交叉验证
  • 定位为「专家执行」模型,需配合前沿规划模型组成模型系统

📊 评分详情

功能完整
8
易用程度
9
安全可靠
9
性价比
10

💬 用户评价

Nemotron 3.5 Lightning 把 30B 专家模型压进单张显卡,专门吃 Agent 循环里那些高频、重复的调用——配合前沿模型做规划、它做执行,整体成本能砍到三分之一。

📝 更新日志

  • 2026-08-11
    Nemotron 3.5 Lightning 首发(开放权重)
    **NVIDIA 发布 Nemotron 3.5 Lightning(Aug 11)**——Nemotron 3 家族新成员,30B MoE(3B 激活)开放权重智能体模型,由 Nemotron 3 Ultra 蒸馏,专为 always-on agents 的高速、可定制执行设计。单张 RTX 消费级显卡可跑,最高 4x 输出速度、Agent 任务完成快约 30%;PinchBench 86.2 / SWE-Bench Verified 54.3 / AA-Omniscience 非幻觉 73。开放权重免费商用(NVIDIA Open Model License),并公开训练数据与方法;NVIDIA 与 vLLM/Ollama/llama.cpp/LM Studio/Unsloth 提供 Day-1 本地部署(NVFP4 与 GGUF),通过 Hugging Face/ModelScope/OpenRouter/build.nvidia.com(NIM)分发。同步开源 NeMo Switchyard 路由库(Rust),将 Agent 工作流每步路由到最合适模型,内部基准把任务成本压到约 Opus 4.8 单独运行的 1/3(LangChain 145 个多轮 Deep Agents 任务降本 74%、Ramp SWE-Bench 降本 58% 且提速 33%)。Cline 同日将其接入 FREE 模型下拉。