2026年6月24日,Google DeepMind 团队宣布将计算机使用(Computer Use)能力作为内置工具,原生集成到 Gemini 3.5 Flash 模型中。开发者现在可以通过单一模型,构建能够在浏览器、移动设备和桌面环境之间自主执行任务的 AI Agent。

这意味着 Google 在 AI Agent 能力上迈出了一大步——不再需要借助独立的第三方框架或额外部署的计算机视觉模型,Gemini 3.5 Flash 本身就具备了"看懂屏幕并操作界面"的能力。AI 从对话工具升级为跨平台操作者,AI Agent 终于有了真正意义上的"手和脚"。

一、Computer Use 的技术实现与能力边界

本次 Gemini 3.5 Flash 内置的 Computer Use 能力,与 Anthropic 此前在 Claude 中推出的 Computer Use 功能在定位上有所不同。其核心差异在于:Google 将这一能力作为模型的"原生内置工具"来处理,而非独立的端侧应用或额外的插件。

从技术实现来看,Gemini 3.5 Flash 集成了对屏幕内容的视觉理解、元素定位和交互操作能力。模型能够:

  • 查看屏幕:识别浏览器、桌面应用或移动端界面的视觉内容
  • 推理操作:理解当前界面状态,决定下一步应该点击哪里、输入什么内容
  • 执行交互:模拟鼠标点击、键盘输入等操作,完成跨应用的工作流

Google 强调,Computer Use 不是独立的应用或产品,而是 Gemini 3.5 Flash 模型本身的一项基础能力。开发者可以通过 Gemini API 直接调用这一能力,在现有应用中为 AI Agent 赋予"操作计算机"的功能。

二、企业级应用场景与安全防护体系

Computer Use 的集成使 Gemini 3.5 Flash 在多个企业级场景中展现了实用价值。最典型的应用方向包括:

持续软件测试:AI Agent 可以自动在浏览器中打开测试环境、执行用户操作流程、检查页面响应和错误状态,实现真正的端到端自动化测试。

专业知识和数据提取:对于没有开放 API 的旧系统或外部网站,AI Agent 可以像人类操作员一样登录系统、导航菜单、提取数据并录入目标系统。

跨平台工作流自动化:Agent 可以在浏览器中执行一项任务,将结果同步到桌面应用中,再触发移动端的通知或操作——打通不同平台之间的数据孤岛。

安全方面,Google DeepMind 为 Computer Use 配备了多层防护体系:模型经过对抗性训练以识别和抵御恶意指令;所有敏感操作(如资金交易、数据删除)需要用户手动确认;内置自动终止机制用于检测潜在的提示注入攻击。这些安全措施旨在防止 AI Agent 在自主操作过程中被恶意利用。

三、"Computer Use"能力竞赛:各大厂商的差异化路径

Computer Use(或更广义的"AI 操控设备")已成为 2026 年 AI Agent 能力竞赛的核心赛道之一。各大厂商在这一能力上走了不同的技术路线:

Anthropic Claude:早在 2025 年底就在 Claude 桌面版中引入了 Computer Use 功能,通过独立的计算机视觉模型实现屏幕理解和操作。但 Claude 的 Computer Use 被视为"附加能力",需要额外配置。

OpenAI Codex / Operator:OpenAI 通过 Codex 的 Record & Replay 功能和 Operator 产品实现类似能力,但更多聚焦在编程场景和预设工作流的录制回放上。

Google Gemini 3.5 Flash:最大的差异化在于"原生集成"——Computer Use 不是插件、不是独立服务,而是模型本身内置的能力。这意味着调用成本更低、集成更简单、响应速度更快。

三种路径各有优劣:Claude 的方案灵活性高但配置复杂,OpenAI 的方案强调用户可控但场景受限,Google 的方案胜在系统集成度最高但在精细控制上还需打磨。

四、对 AI Agent 产业的深层影响

Gemini 3.5 Flash 原生集成 Computer Use,对 AI Agent 产业至少产生三个层面的影响:

第一,降低了 Agent 自主操作的技术门槛。此前,开发者构建一个能自主操作计算机的 Agent 需要集成视觉模型、动作规划模型、环境适配层等多个组件。现在通过单一模型的 API 调用即可实现,这意味着更多中小开发者和企业可以进入这一领域。

第二,加速了从"推荐"到"执行"的闭环。当 AI Agent 不仅可以回答问题,还能实际操作软件完成业务流程时,AI 的角色从"建议者"转变为"执行者"。这一转变对企业办公自动化、客户服务自动化等领域的影响将是结构性的。

第三,安全治理面临新挑战。AI 获得了操作计算机的能力,意味着一旦发生安全漏洞,AI 可以造成的"物理影响"远大于纯文本对话模型。Google 的安全防护体系提供了参考,但整个行业仍需建立更加系统化的 Computer Use 安全规范和审计标准。

值得注意的是,在 Google 之前,微软在 Build 2026 上发布的 Scout 智能体也展示了类似的"永远在线、跨平台操作"能力。Computer Use 正从单一公司的技术亮点演变为整个 AI 行业的标配能力——2026 年下半年,几乎所有主流模型都可能内置这一功能。

← 上一篇:OpenAI 发布首款自研 AI 推理芯片 Jalapeño 返回资讯首页 →