开源模型与闭源模型之间的差距,过去一年主要集中在两处:一是复杂推理,二是「会用电脑」。前者靠参数与训练数据追赶,后者则更难——它要求模型能看懂界面、控制鼠标键盘、在软件之间连续操作,并在出错后自己发现并纠正。9 月 8 日,Nex-AGI 开源了 Nex-N2.5 家族,正面切入的正是后一处。
三档模型,三条不同的路
据公开信息,Nex-AGI 是由上海创智学院发起的创新联盟,目标是建设可持续的能力闭环开源生态。此次开源的 Nex-N2.5 包含三个版本,各自定位不同。Mini 为 35B 参数、每 Token 激活约 3B 的混合专家多模态模型,以 Apache-2.0 协议完全开源,上下文长度 262K,主打高速指令遵循与实时工具执行,量化后可在消费级显卡上本地部署。Pro 为 397B 参数、每 Token 激活约 17B 的多模态混合专家模型,面向复杂推理、多智能体编排与高级软件工程。Max 走了一条不同的路线:它基于 DeepSeek-V4-Pro-Base,采用 1.6 万亿总参数、每 Token 激活 49B 的纯文本混合专家架构,官方称这是其在万亿参数规模上完成的完整后训练。
把多模态与纯文本分开,是一个值得注意的产品判断。视觉理解与环境交互所需的算力结构,与长链路文本推理并不相同;用同一套模型同时兼顾,往往两边都做不到最好。分档设计让「看得懂屏幕」和「想得清逻辑」各由更合适的模型承担,也让部署成本可以按任务类型来匹配。
基准成绩:与头部闭源互有高低
据公开信息,在文本类基准上,Max 取得 Terminal-Bench 2.1 的 86.1 分、SWE-Bench Pro 的 65.7 分、DeepSWE v1.1 的 65.6 分;Pro 对应为 82.7、61.2 与 55.8;Mini 为 73.4、43.8 与 36.1。在网页浏览基准 BrowseComp 上,Max 达到 92.6 分。多模态侧,Pro 在 OSWorld-G 上取得 87.4 分,在 OSWorld-Verified 上为 82.2 分,WebArena-Verified 为 67.6 分,OmniDoc 为 92.2 分;Mini 在 OSWorld-Verified 上为 71.2 分,WebArena-Verified 为 63.4 分,BrowseComp 为 83.4 分,Toolathlon Verified 为 54.6 分。
横向比较更能说明位置:在 SWE-Bench Pro 这类复杂软件工程任务上,头部闭源模型仍然领先;而在 BrowseComp 这类浏览与检索任务上,Max 的成绩超过了部分头部闭源模型。这种「互有高低」的格局,是当前开源与闭源竞争的真实写照——开源模型已经能在特定维度上追平甚至领先,但尚未在全部维度上完成超越。
它演示了哪些任务
据公开说明,官方展示的能力案例覆盖了相当宽的谱系。工程侧,Max 从一份存在缺陷的流式加速器 RTL 出发,修复了逐周期握手、忙碌状态、末字节处理与完成信号,并调用开源工具链完成功能验证、综合与布局布线,最终通过隐藏功能回归与完整物理实现。设计侧,它通过脚本调用三维 CAD 软件的接口,从零件建模、关节定位到整体装配构建了一个机械臂模型。科研侧,围绕某材料的磁控极化问题,它模拟不同磁矩方向下的电极化变化,用路径角度与极化曲线呈现磁态与极化的耦合关系。
交互侧的任务同样具体:Pro 在只有游戏画面与正常按键的条件下,自主阅读对话、寻找路线、推进剧情,并在失败后调整策略;它在办公套件中核对一份报告的结构与关键数据,整理研究笔记并保存为可编辑文档,正文与附录区分来源,使结论能够回到原报告查证;它还先在设计软件中绘制概念图,再将其转化为三维软件中的数十个独立网格分件,补齐厚度与结构,配置材质并完成渲染。此外,官方演示了一个名为 Vision2Context 的能力:模型根据用户授权范围,从示范视频或屏幕观察中提取信息,生成可复用的个性化技能,供其他计算机操作类智能体使用。
推理侧:为单请求场景做的引擎
据公开说明,配合 Pro 版本,团队提供了面向单请求场景的推理引擎,支持在 8 张 H100 或 H200 上运行普通解码与两类加速解码模式;通过定制内核、完整解码图与 GPU 直接通信,优化从嵌入、注意力、混合专家到采样的整条解码路径,并使用外部框架完成预填充,在预填充与解码引擎之间共享路由专家权重,以上下文并行注意力减少长上下文中的重复读取。官方还提供了预置定制推理框架的容器镜像,并给出三档模型的启动命令。思考行为上,模型支持三档模式:不思考直接回答、自适应思考,以及始终思考。
这套工程配套的分量不亚于模型本身。开源模型能否被用起来,很大程度上取决于部署链路是否顺畅——模型权重放出来、但推理引擎要自己从头搭,实际使用门槛会大幅上升。提供可直接运行的容器镜像与启动参数,是在把「能跑起来」这件事一起交付。
放进「开源 Agent 基座」这条线看
据公开信息,近期开源社区在智能体方向上的动作相当密集:有厂商开源了可在单张显卡上跑通的本地智能体模型;有团队推出面向端侧的轻量模型,把本地 Agent 能力压到更小的参数规模;也有厂商开源了专门为智能体场景训练的模型,覆盖工具调用、任务规划与代码生成。这些工作的共同取向,是把「智能体能力」从少数闭源厂商的专属,变成可下载、可微调、可商用的公共资源。
Nex-N2.5 的增量在于两点:一是把「会操作电脑」作为核心能力而非附带功能,并以多模态视觉反馈驱动自我纠正;二是给出了从 35B 到 1.6 万亿的完整档位,让同一个家族可以覆盖端侧部署到大规模推理的不同场景。对开发者而言,这意味着可以在同一套能力体系内,按预算与任务复杂度选择档位。
中立思辨
需要辩证看待这次开源。其一,上述基准成绩均由官方发布,测试条件、提示词模板与评测脚本需要对照模型卡与开源代码判断,跨厂商比较时更要注意口径差异,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。其二,三档模型的权重发布节奏并不同步,可直接下载使用的以 Mini 为主,Pro 与 Max 的实际表现与易用性仍有待社区验证。其三,多模态计算机操作在演示环境中的表现,与真实桌面环境的复杂度之间仍有距离;界面千差万别,实际落地往往需要针对具体场景做额外微调。其四,百万级上下文更适合长文档推理,并不等同于长程决策能力;复杂多步任务的上限,更多取决于决策链路的长度与稳定性,而非上下文窗口的大小。其五,为 1.6 万亿参数模型提供的部署示例需要多节点高端 GPU 环境,这类配置对多数团队而言并不现实,Max 的可用性受限于算力条件。其六,围绕开源模型的能力评估,社区量化版本与官方版本之间可能存在表现差异,使用前需要以自身任务做验证。其七,配套的工具链、部署框架与最佳实践仍处于早期,生态成熟需要时间。
趋势研判
短期,开源智能体基座会在「会操作电脑」这一维度上继续追赶,端侧可部署的小参数版本会成为落地主力;中期,多模态交互与长链路文本推理的分工可能进一步明确,形成「视觉执行模型 + 推理规划模型」的组合式方案;长期,开源与闭源的竞争焦点会从基准分数转向工程可用性——谁的部署链路更顺、谁的微调与集成成本更低、谁在真实任务里的失败更可恢复,谁就能获得开发者的持续使用。当顶级智能体能力不再被少数厂商独占,真正的差异化就会落到场景理解与工程细节上。
对做智能体应用的团队的务实建议是:在选型时不要只比榜单分数,而要先明确自己的任务属于「视觉交互为主」还是「长链路推理为主」,再据此选择档位;同时把「部署可行性」纳入评估——一个需要多节点高端集群才能跑起来的模型,即便分数更高,也未必适合当前阶段。先让系统在可控成本下跑通闭环,再谈能力上限。