🧠 基础概念

Computer Use(计算机操作)

别名:GUI Agent屏幕操作操作电脑UI Automation视觉操作
分类🧠 基础概念
阅读时间⏱️ 18 分钟
更新时间📅 2026-07-16
条目编号ENC-CONCEPT-21-computer-use
Computer Use 指 Agent 直接像人一样操作图形界面——看屏幕截图、移动鼠标、点击按钮、输入文字,来完成原本需要 API 或人工的操作。它让 Agent 能驱动没有开放接口的旧系统与桌面软件。

关键要点 ✦

工作原理

Computer Use 形成「感知-决策-行动」闭环:Agent 捕获屏幕截图(感知),多模态模型理解界面元素与当前状态(决策),输出坐标级动作——移动鼠标、点击、键入、滚动(行动),再观察结果进入下一轮。

代表实现有 Anthropic 的 Claude Computer Use、OpenAI 的 Operator、智谱的 GLM-PC 等。

优势与局限

优势:无需对方提供 API,能操作任意 GUI 应用(含 legacy 系统、Citrix、桌面客户端),极大扩展 Agent 的「可触达面」。局限:每一步都需截图推理,延迟与 token 成本远高于 API 调用;且界面变化(弹窗、改版)易导致失败。

因此 Computer Use 多用于「没有更好接口」的场景,而非替代结构化工具。

安全考量

让 Agent 操作真实界面意味着它有「鼠标和键盘的权限」,误操作(删文件、误发消息)代价高。需设置:沙箱环境敏感操作二次确认动作回滚操作审计日志

🎯 应用场景

legacy 系统自动化
驱动无 API 的老旧内部系统,省去改造成本。
跨软件数据搬运
在多个桌面软件间复制粘贴、核对数据。
网页任务自动化
操作未开放接口的网站完成下单、填报。

✅ 最佳实践

  • 优先用 API/工具,仅在没有接口时启用 Computer Use
  • 在沙箱或受限账号中运行,限制可触达资源
  • 对「发送/删除/支付」类动作强制人工确认
  • 完整记录每步截图与动作,便于复盘与审计

🔮 未来展望

Computer Use 将与 Agent 工具箱深度融合为「能调 API 就调、不能调就点界面」的统一执行层;同时端侧小型视觉模型会让 GUI 操作更实时、更低成本。

📖 相关条目

🛠️ 相关产品

🏷️ 标签Computer UseGUI截图操作自动化Claude Computer Use视觉