8 月 21 日,DeepSeek Harness 团队宣布其模型适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态选项。这看似一次普通的能力补丁,却点出了 Agent 底座竞争的一个新变量:当运行框架能原生存图、接受图文混合指令,并把图片作为持久化附件在 MCP/ACP 之间流转,Agent 才真正从「读文本」跨入「看世界」。开源运行时大战的重心,正从「谁能驱动更多工具」悄悄转向「谁能理解更丰富的环境信号」。

一、多模态不是「能画图」,而是「能看图办事」

这一次更新支持原生图片请求、图文命令输入,以及 MCP/ACP 图片附件的持久化。过去 Agent 处理一张截图、设计稿或票据,往往要靠外部脚本临时转写、再塞回上下文;现在图片成为一等公民——截图、仪表盘、合同、工业图纸都能直接进上下文,并由不同子代理接力处理。对客服截图分析、设计稿转代码、票据核对这类场景,这是把「多模态」从模型卖点变成工程默认能力的关键一跳。

更关键的是「持久化」:图片一旦作为附件在协议层流转,就不会在子代理切换、工具调用之间丢失。长流程任务里,Agent 不再需要每步重新上传同一张图,上下文的一致性与可追溯性都随之提升。

二、子代理协作的门槛被降低

多模态让不同专长的子代理可以围绕同一张图协同——识别、推理、生成各有分工。DeepSeek Harness 把这项能力作为「适配器」而非「模型权重」开放,意味着开发者可以在自有产品里沿用这套多模态编排,而不必等待模型本身的权重更新。这种「框架先于权重」的节奏,正是近期开源运行时竞争的典型打法:用快速迭代的编排能力,去对冲底层模型发布的周期。

三、底座之争从「跑得动」转向「看得懂」

结合本栏此前梳理的开源运行时大战(OpenAI Codex Harness 开源、DeepSeek Harness 周更、NVIDIA AVO 在 ARC-AGI-3 取得满分),竞争焦点已经出现位移。早期比的是「谁能驱动更多工具、收编更多子代理」;现在,谁能理解更丰富的环境信号——尤其是视觉——成为分水岭。GUI 操作、文档核对、工业巡检、医疗影像,这些真实任务的第一步往往是「看见」,而非「读字」。谁先把视觉接入 Agent 的感知闭环,谁就离真实生产场景更近一步。

四、开源与闭源的节奏差

DeepSeek Harness 在一周内多次更新,多模态是其中关键一跳;相较之下,闭源 Harness 的开源程度与迭代节奏仍存在争议,双方最终的路线差异行业暂未披露。但一个共识正在形成:运行时(Harness)而非底层模型本身,才是 Agent 竞争力的隐藏主语。模型能力在趋同,真正的差异化落在工具调用编排、上下文管理与多模态感知这些「框架层」。

五、对开发者的直接意义

多模态原生最直接的价值,是降低「让 Agent 处理真实世界图像」的工程成本。不必再为每个视觉任务写胶水代码,开发者可以把精力放在「看图—决策—执行」闭环的稳定性上。下一阶段的比拼,不再是「模型能不能看图」,而是「谁的 Agent 能把看图之后的动作跑稳、跑对、可审计」。视觉时代的底座之争,才刚刚开场。