会懂网AI资讯获悉,阿里巴巴推出面向数字设备执行的GUI智能体基座模型Qwen-UI-Agent。这一模型主要面向移动端、电脑端、网页端和深度搜索等环境,可以通过虚拟点击、CLI执行等方式操作设备并完成复杂任务。
在项目主页显示的6个核心GUI基准测试中,Qwen-UI-Agent在其中5个里取得第一,得分高于GPT-5.6 Sol、Claude Opus 4.8等模型,也优于字节今年6月发布的Seed 2.1 Pro。值得注意的是,这一模型的主力版本参数量仅为27B,基于Qwen 3.5系列基础模型打造,以较小的参数规模实现了领先的GUI操作能力。
阿里展示了多个应用场景。用户可以要求模型在手机上通过模拟点击的方式打开地图、查找附近咖啡馆、到社交媒体搜索评价,辅助用户决策。在PC上,模型则执行更多CLI动作,完成跨网站调研产品、核对价格、生成比价方案等任务。
为训练这一模型,阿里搭建了覆盖100多台真实手机、150多个应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测。除27B版本外,还提供了35B-A3B、4B参数量的版本,覆盖不同算力需求的部署场景。
阿里相信,GUI智能体有望成为现有数字设备上的通用执行器。这一判断背后,是AI从”会聊天”走向”会操作设备”的关键跨越。当模型能够像人一样点击、输入、操作各种应用,AI智能体的落地边界将被大幅拓展。
业内分析认为,GUI智能体是Agent落地的关键一环。相比纯文本交互,能操作真实设备的智能体才能真正替代人完成端到端的任务。Qwen-UI-Agent在多项基准上的领先,让国产模型在GUI智能体这一前沿方向上也具备了与国际巨头同台竞技的实力。






























暂无评论内容