8 月 21 日,SuperCLUE 公布 AgentCLUEMobile 手机 GUI 智能体基准测评榜单。据快科技报道,vivo 蓝心小V 首次参评即以 92.11 分登顶总榜,在复杂意图拆解、多模态界面感知、跨 App 全链路执行三个维度全部第一;而就在前一天,阿里发布 Qwen-UI-Agent,其移动端在 MobileWorld 基准达 82.1%,超越 GPT-5.6 Sol 与 Claude Opus 4.8,并支持超 100 步长程任务在线强化学习。一端是国产手机厂商登顶评测,一端是头部模型厂把 GUI 能力基座化——手机端「看得懂屏幕、跨 App 干活」的 GUI Agent,正从概念验证步入中美模型同台竞速。

一、vivo 登顶:端云协同方案交出高分答卷

这次登顶的看点,在于 vivo 是「首次参评直接第一」,且把第二名智谱 OpenAutoGLM(76.75 分)、第三名阿里 MobileAgent3.5(73.45 分)甩开明显差距。榜单把能力拆成三杆秤:复杂意图拆解与动态规划、多模态 GUI 感知与理解、跨应用全链路执行,蓝心小V 三项均列第一(94.41 / 91.69 / 89.12)。它采取 API 调用方式,借云端大模型拿到更强推理,再与终端感知协同。榜首与榜尾分差超过 60 分,说明手机 GUI Agent 不是「都差不多」,而是能力断层已经出现——端云协同这条路线,至少在当下评测里给出了高分样本。

二、阿里入局:Qwen-UI-Agent 把 GUI 做成基座模型

与 vivo 的「产品登顶」不同,阿里的动作是「能力下放」。Qwen-UI-Agent 覆盖移动端、PC 桌面与网页三类界面,是一个 GUI 智能体基座模型,移动端 MobileWorld 基准 82.1% 超过 GPT-5.6 Sol 与 Claude Opus 4.8,并支持超 100 步的长程任务在线强化学习。把 GUI 操作能力沉淀为可复用的基座模型,意味着开发者不必从零驯服「怎么点按钮」,而是直接调用一个「懂界面」的底座。这与阿里在 Qwen 系列上的开源策略一脉相承——用模型层能力,补上 Agent 与真实图形界面之间的最后一公里。

三、评测在比什么:从「会聊」到「会操作屏幕」

GUI Agent 与对话式 Agent 的根本区别,在于它要「动手」:识别屏幕上的按钮、理解弹窗语义、跨多个 App 连续点击完成一整套任务,比如帮你搜电影、订外卖、整理日程。AgentCLUEMobile 的三维评分,恰好对应了这件事的三个难点——听清意图、看懂界面、跑通链路。评测的升温,折射出行业共识的迁移:手机智能体的竞争标尺,已经从「对话顺不顺」转向「事办没办成」。当 vivo 与阿里在同一周先后交出成绩单,这条赛道正式从单点探索进入公开比拼。

四、客观看:榜单第一与真实体验仍有落差

几点客观边界需要标注。其一,评测在受控环境与固定应用集上运行,与用户手机里千差万别的 App 版本、定制系统、特殊弹窗仍有距离,榜首成绩不等于「在你的手机上永不翻车」;其二,各家调用方式不同(API 云端 vs 本地部署),本地方案数据不出设备但能力上限受限,云端方案更强却依赖网络,优劣取决于场景而非绝对高下;其三,阿里 82.1% 的 MobileWorld 成绩与 vivo 92.11 分来自不同基准,两者并不直接可比,跨榜排名需谨慎;其四,GUI Agent 仍面临界面改版即失效、敏感操作权限、误操作回滚等真实落地难题,行业暂未披露统一的失败兜底规范。总体而言,手机 GUI Agent 已经跑出清晰的第一梯队,但「评测能登顶」到「每天替你稳稳干活」,中间还隔着一长串工程与体验的硬仗。