办公智能体的比拼,换了标尺
9 月 2 日,字节跳动旗下豆包工作推出两项能力:多 Agents 并行,以及 Mac 端的「操作电脑」。这标志着其 AI 办公统一入口,在「执行力」这一维度又往前走了一步。放在更宽的画面里看,办公类智能体的竞争标尺正在变化:过去比的是「答得准不准」,现在比的是「能不能动手把活干完」。
「操作电脑」指向的是计算机使用(computer use)能力——智能体不再只产出文本,而是能打开应用、点按钮、读界面、填表单,像人一样在图形界面里完成作业。多 Agents 并行则指向另一块:把一项大任务拆给多个智能体同时推进,而不是一个智能体串行从头做到尾。两者合起来,是办公 Agent 从「顾问」转向「执行者」的两块基石。
计算机使用:把世界变成工具箱
计算机使用的价值,在于它绕开了「每个系统都要接 API」的前提。企业里大量工作发生在没有开放接口的老旧软件、内部网页与桌面应用里,智能体若只能调 API,就够不到这些场景;若能直接操作界面,覆盖面立刻变大。对办公场景尤其如此:报销、录单、对账、排版,很多动作都在图形界面里。
但计算机使用也是可靠性与安全的重灾区。界面一变,基于像素或 DOM 的操作就可能失效;一个误操作可能直接改掉生产数据。因此它更适合放在「可读、可撤销、需确认」的位置,而不是默认放开所有写权限。把高风险动作设成人审批,是这条能力能否进生产的分水岭。
多 Agents 并行:用分工换吞吐
多 Agents 并行解决的是另一种瓶颈:耗时。一份市场调研、一次跨表核对、一个长文档的多角度重写,串行做要很久;拆给多个智能体并行,吞吐明显提升。它的难点不在「同时跑几个」,而在「怎么拆、怎么汇」:任务拆分是否干净、子智能体之间如何交换中间结果、最终由谁收敛成一致产出。
与阿里云「万有无界」的项目空间式协作相比,豆包工作的并行更偏「办公入口内的执行加速」,前者更偏「企业级复杂业务的拆解与资产沉淀」。两者都在证明同一件事:单智能体的天花板,正被「协作与执行」抬起来。
办公入口战,本质是信任战
把视野拉到同日的其他动态:腾讯 WorkBuddy 开放平台上线、阿里「万有无界」公测、百度搭子披露月活 674.3 万。办公与生产力场景里,多家厂商在同一周密集落子,说明「把智能体放进日常工作流」已成共识。但热闹之下,真正的壁垒不是功能数量,而是信任:用户敢不敢把敏感操作交出去,企业敢不敢让它碰生产数据。
对办公 Agent 来说,信任来自三件事——看得见它在做什么、关键动作可撤回、出了错能追责。哪一家先把这三点做扎实,哪一家才可能在入口战里留下来。
几点需要保留的谨慎
其一,计算机使用受界面稳定性影响大,在高频变动的网页与桌面应用上,成功率与稳定性仍需实测,不能只看演示。
其二,多 Agents 并行放大吞吐的同时,也放大了出错面的传播速度,子智能体的一步错可能污染汇总结果。
其三,「操作电脑」涉及的屏幕内容与键鼠动作,涉及隐私与数据边界,需明确哪些界面允许操作、操作是否被记录。
其四,豆包工作上述能力在各端的最终开放范围与可用性时间表,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。