7 月 8 日至 9 日,英伟达发布新一代开源大模型 NVIDIA Nemotron 3 Ultra,并在 LangChain 的 Deep Agents 深度智能体基准中拿下开源模型组别最高准确率;同期,英伟达与 LangChain 联合发布 NVIDIA NeMoClaw Deep Agents 蓝图,宣称将 Agent 推理成本降低超过 10 倍。开源 Agent 的"能力天花板"与"成本地板"被同时抬高与压低——这对正卡在落地成本上的企业来说,是一个值得关注的信号。
一、Nemotron 3 Ultra:开源组的 Deep Agents 冠军
这次评测采用的 Deep Agents 基准,聚焦的是具备多步骤逻辑推理、外部工具调用、长时记忆存取、复杂任务动态执行能力的智能体系统。这类 Agent 不局限于单一问答,而是在合规权限内完成全流程业务操作,广泛应用于企业流程自动化、海量信息检索、多环节任务统筹、跨平台系统协同等产业场景。
实测数据显示,经过深度调优的 Nemotron 3 Ultra 在取得开源模型最优准确率的同时,单次推理运行成本仅为行业头部闭源大模型的十分之一,任务处理吞吐量同步提升。换句话说,它补上的是开源模型在复杂产业任务上的性能短板——过去企业用开源模型跑长链路任务,往往"能跑但不稳、能用但偏贵",这一代试图把这两道坎一起跨过去。
二、NeMoClaw Deep Agents 蓝图:软硬协同降本
与模型发布配套的,是英伟达与 LangChain 联合推出的 NeMoClaw Deep Agents 蓝图。它把 Nemotron 系列模型与 Blackwell 推理平台结合起来,在多项基准测试中取得领先表现,官方称可将 Agent 推理成本降低超过 10 倍,与 Blackwell 推理平台形成软硬件协同,压缩 AI 应用的部署成本。
LangChain 联合创始人兼 CEO Harrison Chase 对此有一个精炼的总结:优质 Agent 的打造离不开模型配套体系的持续迭代,内存管理、工具调用逻辑、效果评估体系、模型行为调控等模块协同优化,能够形成性能叠加增益。这其实点出了一个常被忽视的事实——Agent 的强弱,不只在模型本身,而在围绕模型的整套运行体系。
三、为什么"降本"是 Agent 落地的命门
一个 Agent 完成任务,往往要经历多轮工具调用、长上下文读取、反复推理,token 消耗远非一次问答可比。推理成本,正是 Agent 规模化部署时最现实的拦路虎。近期行业里密集出现"降本"信号:开源 Agent Harness 项目 OpenSquilla 宣称性能超过 Fable 5 的同时砍掉八成 token 成本;Meta 用 1/10 定价切入 Agent 市场;如今英伟达把推理成本再压一个数量级。当单位智能的成本快速下探,企业才敢把 Agent 从"试点项目"大规模推进到"生产系统"。
四、开源 vs 闭源:能力差距正在收窄
Nemotron 3 Ultra 的意义,不止于一项基准冠军。它让企业在"自主可控 + 低成本"上多了一个真正可用的选项——过去闭源模型在复杂业务任务上明显领先,迫使企业用高昂的 API 费用换能力;如今开源模型综合业务处理能力开始对标顶尖闭源,配合自托管与私有化部署,企业在数据主权与成本之间不必二选一。这对金融、政务、制造等强合规行业尤其关键。
五、需要客观看待的地方
基准成绩不等于真实业务表现。Deep Agents 基准的高分,能否平移到企业自有的杂乱数据与流程,仍依赖针对性的调优与评测。所谓"1/10 成本",建立在英伟达对模型配套运行体系全链路优化的前提上,迁移到自有场景时,省下的成本可能被工程化投入抵消一部分。此外,开源模型的企业支持与合规责任由使用方自行承担,这与闭源厂商提供的托管服务保障并不相同。能力上来了、成本下来了,但落地工程化这道关,企业仍要自己过。