8 月 20 日,阿里千问正式发布 Qwen-UI-Agent——一款面向真实设备的 GUI 智能体基座模型,覆盖手机、电脑桌面、网页与深度搜索四类环境。它的核心思路很简单:让模型「看懂屏幕、动手操作」,像人一样模拟点击、输入和滑动,去完成那些「没有开放 API、只能靠人点」的传统软件任务。官方在 100+ 台真机、150+ 应用上训练与评测,MobileWorld 得分 82.1%、真机基准 MobileWorld-Real 92.2%、浏览器 WebArena 73.6% 排名第一,多项基准超越 GPT-5.6 Sol、Claude Opus 4.8 等旗舰模型。
先搞懂:GUI 智能体和「会聊天的模型」差在哪
传统 Agent 靠 API 和工具调用完成工作,但绝大多数软件没有开放 API——查地图、订座、整理文件都发生在图形界面里。GUI 智能体的价值是把「屏幕」当成最大入口:模型读屏幕截图、识别元素位置、输出点击/输入/滑动动作,甚至直接执行命令行。Qwen-UI-Agent 的特别之处在于:
| 能力 | 说明 | 实测参考 |
|---|---|---|
| 跨端 GUI 操作 | 手机/电脑/浏览器自动点击、输入、滑动 | MobileWorld 82.1% |
| GUI + CLI 混合 | 一次决策批量输出多个动作,电脑任务中 CLI 占比近半 | OSWorld-Verified 79.5% |
| 长程任务 | 稳定执行 100+ 步的调研、分析、报告生成 | 170 步跨应用任务演示 |
| 安全边界 | 危险请求直接拒绝;支付/删除/授权等敏感操作停手确认 | 发红包前停在支付页 |
注意版本定位:主力版本参数 27B(另有 35B-A3B 与 4B 小版),当前以开源模型 + 技术报告发布为主,落地形态(接入手机助手等)还在演进。别把基准分当成「今天就能全自动干活」。
Step 1:明确你的使用形态
Qwen-UI-Agent 四类环境各有玩法:
1. 手机端(Android 模拟点击)
· 查地图→找店→看评价→辅助决策
· 跨 App 接力(查资料→写日程)
· 注意:涉及支付宝/微信支付会
停在支付页等你确认
2. 电脑端(GUI + CLI 混合)
· 跨网站调研、比价、核价
· 跑命令行做数据分析
· 批量动作输出提速
3. 网页端(浏览器操作)
· 表单填写、网页检索
· WebArena 排名第一的环境
4. 深度搜索(GUI + CLI 协同)
· GUI 负责网页检索与数据源定位
· CLI 负责数据下载与本地分析
· 可生成 Excel/PPT/Word 交付物
建议从「单个环境、明确目标」的任务
开始,比如:让它在电脑上调研
三款产品并输出比价表格
Step 2:理解「看屏幕」的输入方式
GUI 智能体的工作链路:
1. 输入:当前屏幕截图
(或增强后的 UI 树信息)
2. 识别:定位可操作元素
(按钮/输入框/列表项的位置)
· ScreenSpot-Pro 界面定位 81.5%
· 支持坐标级点击目标输出
3. 决策:输出动作序列
· 点击 (x, y)
· 输入文本
· 滑动 / 长按
· CLI 命令(电脑端)
· 批量动作:一次决策输出多个
4. 反馈:观察新截图,继续下一轮
对使用者意味着:
· 任务描述要「可被屏幕验证」
· 页面加载慢/弹窗变化会打断流程
· 深色模式、非常规 UI 会降低识别率
别在脏乱界面上硬跑:弹窗、广告、多标签页会显著降低成功率。先整理桌面/关闭干扰窗口,再让 Agent 执行长任务。
Step 3:设计「GUI + CLI」混合任务
官方演示的 170 步任务拆解:
阶段 A(GUI):
· 打开财经网站,跨站核实数据
· 定位数据源、抓取页面内容
阶段 B(CLI):
· 写脚本跑数据分析
· 交叉验证财务数据
· 生成 Excel / PPT / Word
阶段 C(GUI):
· 打开文档做视觉检查
· 修复版式问题,交付
你的任务设计模板:
1. 先问:哪几步需要「看界面找信息」?
2. 再问:哪几步适合「跑命令算数据」?
3. 把两步之间的交接写清楚
(比如:把页面数据存到某个文件,
再让脚本读它)
要点:CLI 动作在电脑任务中
占比接近一半,这正是它
比纯点击更快的秘诀
Step 4:用对安全机制——该停就停
Qwen-UI-Agent 的安全行为分两档:
1. 拒绝执行(直接终止):
· 违法请求
· 高风险请求(越权、恶意操作)
2. 停手确认(ask_user 接管):
· 支付 / 转账(如:给妈妈转 500
元,填好金额备注后停在支付页)
· 删除文件 / 数据
· 隐私授权(通讯录、相册等)
· 信息缺失(机票日期/舱位没填
会先反问确认)
你的配合动作:
· 敏感任务提前声明边界
(「只查,不提交」)
· 授权弹窗出现时认真核对
而不是机械点允许
· 高价值账号(支付、企业后台)
不要让 Agent 长驻
安全机制是底线不是万能:模型会「停手」,但被你授权过的历史动作不会自动回滚。企业场景先看《Agent 沙箱安全》把执行环境隔离好,再谈自动化程度。
Step 5:跑通一个最小演示
最小演示(电脑端):
1. 明确任务:
「调研 3 款 AI 编程工具的定价,
输出对比表格」
2. 让 GUI 去检索:
· 打开官方定价页
· 截图定位价格信息
3. 让 CLI 去整理:
· 把价格写入 CSV
· 生成对比表(Excel/HTML)
4. 检查交付:
· 核对价格是否与官网一致
· 有偏差就让它回查
5. 记录成功/失败点:
· 哪类页面识别差?
· 哪类交接常断?
形成你自己的「任务模板库」
进阶:把它接到你的 Agent 编排里,
和《千问免费自动化四件套》
《千问三端接入》组合使用
Step 6:评估与选型——它适合你的场景吗
选型四问:
1. 你的任务真的需要「看屏幕」吗?
有 API 的任务优先 API,
GUI 是最后的通用入口
2. 界面环境稳定吗?
固定后台 > 公网随机页面
3. 你能接受「偶尔停手确认」吗?
全自动诉求与安全边界天然冲突
4. 数据敏感吗?
截图会把业务数据带给模型
三条红线:
1. 支付/财务操作必须人工确认
2. 生产系统改动要有审计留痕
3. 截图数据过墙前先做脱敏
落地参考:手机端长期任务可对照
《手机智能体》的做法;
企业级安全评估对照
《CISO 四问法》
别让 GUI 智能体替你「守门」:它擅长执行,不擅长替你做业务决策。权限、预算、合规边界永远握在人类手里——模型只做「被授权的执行者」。
常见问题速查
| 你遇到的现象 | 大概率原因 & 解决 |
|---|---|
| 任务跑一半卡在弹窗/广告 | 界面干扰:提前清理页面、关闭弹窗,或换更稳定的目标页面 |
| 支付/删除前停住不动 | 安全机制生效:这不是 bug,核对后确认即可继续 |
| 深色/非常规界面识别差 | 切换浅色主题或标准布局,提高元素定位成功率 |
| 长任务中途「迷路」 | 拆短任务 + 加中间检查点,别让 Agent 一口气跑 100+ 步 |
| 分不清该用 GUI 还是 CLI | 「找信息」用 GUI,「算数据/改文件」用 CLI,交接用统一中间文件 |