过去一周,智能体赛道的竞争悄然换了一条主线。8 月下旬,OpenAI 全面开源 Codex Harness 的核心组件,DeepSeek Harness 在一周内连续迭代、把 Claude Code 与 Codex 收编为「子代理」,几乎同一时间 NVIDIA 的通用编程智能体系统 AVO 在 ARC-AGI-3 公开测试集上拿下 100% 满分。三件事指向同一个信号:当模型能力的差距被快速抹平,真正拉开身位的,正在变成连接模型、工具与任务的「运行时」(Harness)层。

一、Codex Harness 开源:把「 Agent 执行框架」交还给开发者

OpenAI 此次开源的 Codex Harness,包含 CLI 工具、官方 SDK 与 App Server 三大部分,以 Apache-2.0 协议发布。Harness 是 Codex 背后的核心运行环境,职责是连接模型、用户与工具,统一管理任务执行、上下文、会话与代码操作。换句话说,它不是一个「聊天框」,而是一整套 Agent 执行框架。

最关键的接口是 Codex App Server:开发者可以通过双向 JSON-RPC 协议把 Harness 接入自己的客户端,实时获取事件流,从而构建 IDE、桌面应用或任何定制化的 Agent 产品。OpenAI 在内部已经把这套理念跑通——一个由 Codex 主导的产品,约 5 个月生成约 100 万行代码、完成约 1500 个 Pull Request,团队的工作方式从「手写代码」转向「人设目标、Agent 执行」。把 Harness 开源,等于把这套生产范式开放给外部生态。

二、DeepSeek Harness 的「调度层」哲学:一切皆插件

DeepSeek 的动作更直接地挑明了路线之争。DeepSeek Harness 在一周内密集更新,将 Claude Code、Codex 等主流编程 Agent 作为子代理纳入统一调度,试图成为 Agent 时代的「调度层」。在数据猿的对比中,DeepSeek Harness 的「一切皆插件」被类比为安卓的开放生态,而 OpenAI Codex Harness 的「嵌入引擎」则更像 iOS 的封闭集成——社区在 8 天内涌现出 2600 多个插件仓库,开源运行时生态的活跃度肉眼可见。

两种哲学并无绝对优劣:安卓式强调可替换、可组合,iOS 式强调体验一致与深度优化。但共同点是,二者都把竞争维度从「谁的底座模型更强」抬升到了「谁能把多个模型、多种工具编排成一条可靠工作流」。调度能力,正在成为新的产品护城河。

三、NVIDIA AVO 满分背后:TechCrunch 说「Harness 才是英雄」

给这场转向提供注脚的,是 NVIDIA 的 AVO(Agent for Visual Operations)。这个通用编程智能体系统在 ARC-AGI-3 公开测试集的全部 25 个环境中取得 100% 满分,完成 183 个关卡。ARC-AGI 以抽象推理与模式识别著称,长期被视为通用智能的试金石。TechCrunch 在评论中给出的判断颇为尖锐:NVIDIA 证明的,是 Harness——而非 AI 模型本身——才是真正的英雄。

这一评价与 OpenAI 开源 Codex Harness、DeepSeek Harness 周更形成了呼应。当底层模型能力趋于同质,决定一个 Agent 能否稳定完成长周期、多步骤任务的,往往是运行时对上下文的管理、对工具调用的编排、对失败的重试与回溯。模型决定天花板,Harness 决定能不能落地——这正在从一句口号变成行业共识。

四、对用户意味着什么:套壳时代的终结

对于开发者和企业而言,开源 Harness 的集中释放带来的最大变化,是「套壳」红利的消退。过去,团队只要在闭源模型外面套一层 Prompt 就能讲出 Agent 故事;如今,运行时、工具链、上下文管理与工程反馈循环被逐一开源,差异化能力必须建立在更深的工程层上。Agent 基础设施的免费开放,意味着竞争重心从「接入哪个模型」转向「如何把模型、工具与业务编排成可度量、可回溯的生产系统」。

可以预见,接下来几个季度,「谁的 Harness 更开放、更能跨模型调度、工程反馈更短」会成为选型的关键指标。模型仍重要,但它不再是唯一答案。