高级 📋 6 个步骤 第 306 / 470 篇

Qwen-UI-Agent 上手:让 AI 学会「看屏幕、点界面」——手机电脑网页一通百通

8-20 阿里千问发布 GUI 智能体基座模型 Qwen-UI-Agent:基于 100+ 真机、150+ 应用训练,能看屏幕、模拟点击输入滑动,GUI+CLI 混合操作,支付删除等敏感操作自动停手确认。MobileWorld 82.1%、WebArena 第一。本教程讲清能力边界与四类环境玩法。

2026.08.22· 16 分钟阅读· 约 2171 字· 🖥️ Qwen-UI-Agent

8 月 20 日,阿里千问正式发布 Qwen-UI-Agent——一款面向真实设备的 GUI 智能体基座模型,覆盖手机、电脑桌面、网页与深度搜索四类环境。它的核心思路很简单:让模型「看懂屏幕、动手操作」,像人一样模拟点击、输入和滑动,去完成那些「没有开放 API、只能靠人点」的传统软件任务。官方在 100+ 台真机、150+ 应用上训练与评测,MobileWorld 得分 82.1%、真机基准 MobileWorld-Real 92.2%、浏览器 WebArena 73.6% 排名第一,多项基准超越 GPT-5.6 Sol、Claude Opus 4.8 等旗舰模型。

🧩 本教程适合:想给 Agent 装上「手」的产品经理、开发者与个人效率用户。我们讲清 Qwen-UI-Agent 的能力边界、四类环境的玩法与安全机制。

先搞懂:GUI 智能体和「会聊天的模型」差在哪

传统 Agent 靠 API 和工具调用完成工作,但绝大多数软件没有开放 API——查地图、订座、整理文件都发生在图形界面里。GUI 智能体的价值是把「屏幕」当成最大入口:模型读屏幕截图、识别元素位置、输出点击/输入/滑动动作,甚至直接执行命令行。Qwen-UI-Agent 的特别之处在于:

能力说明实测参考
跨端 GUI 操作手机/电脑/浏览器自动点击、输入、滑动MobileWorld 82.1%
GUI + CLI 混合一次决策批量输出多个动作,电脑任务中 CLI 占比近半OSWorld-Verified 79.5%
长程任务稳定执行 100+ 步的调研、分析、报告生成170 步跨应用任务演示
安全边界危险请求直接拒绝;支付/删除/授权等敏感操作停手确认发红包前停在支付页

注意版本定位:主力版本参数 27B(另有 35B-A3B 与 4B 小版),当前以开源模型 + 技术报告发布为主,落地形态(接入手机助手等)还在演进。别把基准分当成「今天就能全自动干活」。

Step 1:明确你的使用形态

1 选场景:手机 / 电脑 / 网页 / 深度搜索
Qwen-UI-Agent 四类环境各有玩法:

1. 手机端(Android 模拟点击)
   · 查地图→找店→看评价→辅助决策
   · 跨 App 接力(查资料→写日程)
   · 注意:涉及支付宝/微信支付会
     停在支付页等你确认
2. 电脑端(GUI + CLI 混合)
   · 跨网站调研、比价、核价
   · 跑命令行做数据分析
   · 批量动作输出提速
3. 网页端(浏览器操作)
   · 表单填写、网页检索
   · WebArena 排名第一的环境
4. 深度搜索(GUI + CLI 协同)
   · GUI 负责网页检索与数据源定位
   · CLI 负责数据下载与本地分析
   · 可生成 Excel/PPT/Word 交付物

建议从「单个环境、明确目标」的任务
开始,比如:让它在电脑上调研
三款产品并输出比价表格
💡 从「高确定性」任务入手:界面操作步骤明确、每步都能核对结果的场景(如固定流程的录入、归档)成功率最高;开放式创作类任务别指望一次到位。

Step 2:理解「看屏幕」的输入方式

2 截图识别 + 元素定位是根基
GUI 智能体的工作链路:

1. 输入:当前屏幕截图
   (或增强后的 UI 树信息)
2. 识别:定位可操作元素
   (按钮/输入框/列表项的位置)
   · ScreenSpot-Pro 界面定位 81.5%
   · 支持坐标级点击目标输出
3. 决策:输出动作序列
   · 点击 (x, y)
   · 输入文本
   · 滑动 / 长按
   · CLI 命令(电脑端)
   · 批量动作:一次决策输出多个
4. 反馈:观察新截图,继续下一轮

对使用者意味着:
· 任务描述要「可被屏幕验证」
· 页面加载慢/弹窗变化会打断流程
· 深色模式、非常规 UI 会降低识别率

别在脏乱界面上硬跑:弹窗、广告、多标签页会显著降低成功率。先整理桌面/关闭干扰窗口,再让 Agent 执行长任务。

Step 3:设计「GUI + CLI」混合任务

3 让界面负责检索、命令行负责计算
官方演示的 170 步任务拆解:

阶段 A(GUI):
   · 打开财经网站,跨站核实数据
   · 定位数据源、抓取页面内容
阶段 B(CLI):
   · 写脚本跑数据分析
   · 交叉验证财务数据
   · 生成 Excel / PPT / Word
阶段 C(GUI):
   · 打开文档做视觉检查
   · 修复版式问题,交付

你的任务设计模板:
1. 先问:哪几步需要「看界面找信息」?
2. 再问:哪几步适合「跑命令算数据」?
3. 把两步之间的交接写清楚
   (比如:把页面数据存到某个文件,
   再让脚本读它)

要点:CLI 动作在电脑任务中
占比接近一半,这正是它
比纯点击更快的秘诀
💡 交接文件是「GUI↔CLI」协作的粘合剂:约定好统一的中间数据格式(如 CSV/JSON),两边都读写它,任务就能顺畅接力。

Step 4:用对安全机制——该停就停

4 危险请求拒绝,敏感操作确认
Qwen-UI-Agent 的安全行为分两档:

1. 拒绝执行(直接终止):
   · 违法请求
   · 高风险请求(越权、恶意操作)
2. 停手确认(ask_user 接管):
   · 支付 / 转账(如:给妈妈转 500
     元,填好金额备注后停在支付页)
   · 删除文件 / 数据
   · 隐私授权(通讯录、相册等)
   · 信息缺失(机票日期/舱位没填
     会先反问确认)

你的配合动作:
· 敏感任务提前声明边界
  (「只查,不提交」)
· 授权弹窗出现时认真核对
  而不是机械点允许
· 高价值账号(支付、企业后台)
  不要让 Agent 长驻

安全机制是底线不是万能:模型会「停手」,但被你授权过的历史动作不会自动回滚。企业场景先看《Agent 沙箱安全》把执行环境隔离好,再谈自动化程度。

Step 5:跑通一个最小演示

5 「调研→比价→出表」三分钟闭环
最小演示(电脑端):

1. 明确任务:
   「调研 3 款 AI 编程工具的定价,
   输出对比表格」
2. 让 GUI 去检索:
   · 打开官方定价页
   · 截图定位价格信息
3. 让 CLI 去整理:
   · 把价格写入 CSV
   · 生成对比表(Excel/HTML)
4. 检查交付:
   · 核对价格是否与官网一致
   · 有偏差就让它回查
5. 记录成功/失败点:
   · 哪类页面识别差?
   · 哪类交接常断?
   形成你自己的「任务模板库」

进阶:把它接到你的 Agent 编排里,
和《千问免费自动化四件套》
《千问三端接入》组合使用
💡 别追求「一次全自动」:先把 170 步长任务切成 3-5 个可核对的短任务,每个短任务稳定后,再考虑串成流水线。整体设计可参考《上下文工程三板斧》的拆解思路。

Step 6:评估与选型——它适合你的场景吗

6 四问选型 + 三条红线
选型四问:
1. 你的任务真的需要「看屏幕」吗?
   有 API 的任务优先 API,
   GUI 是最后的通用入口
2. 界面环境稳定吗?
   固定后台 > 公网随机页面
3. 你能接受「偶尔停手确认」吗?
   全自动诉求与安全边界天然冲突
4. 数据敏感吗?
   截图会把业务数据带给模型

三条红线:
1. 支付/财务操作必须人工确认
2. 生产系统改动要有审计留痕
3. 截图数据过墙前先做脱敏

落地参考:手机端长期任务可对照
《手机智能体》的做法;
企业级安全评估对照
《CISO 四问法》

别让 GUI 智能体替你「守门」:它擅长执行,不擅长替你做业务决策。权限、预算、合规边界永远握在人类手里——模型只做「被授权的执行者」。

常见问题速查

你遇到的现象大概率原因 & 解决
任务跑一半卡在弹窗/广告界面干扰:提前清理页面、关闭弹窗,或换更稳定的目标页面
支付/删除前停住不动安全机制生效:这不是 bug,核对后确认即可继续
深色/非常规界面识别差切换浅色主题或标准布局,提高元素定位成功率
长任务中途「迷路」拆短任务 + 加中间检查点,别让 Agent 一口气跑 100+ 步
分不清该用 GUI 还是 CLI「找信息」用 GUI,「算数据/改文件」用 CLI,交接用统一中间文件
← 返回教程中心