智能AI
morning
阿里发布Qwen-UI-Agent:让模型会用每一块屏幕!手机电脑全覆盖
摘要
快科技8月20日消息,阿里千问大模型正式发布Qwen-UI-Agent,这是一款面向真实设备的GUI图形界面智能体基座模型,覆盖移动端、PC桌面端、网页以及深度搜索环境。 最大的亮点是让AI可以直接看懂屏幕界面、模拟人类操作App与软件,充当数字设备通用执行器。 性能评测上该模型多项基准达到业界顶尖水平,移动端MobileWorld得分82.1%,真机基准MobileWorld-Real达到92....
快科技8月20日消息
阿里千问大模型正式发布Qwen
Agent
这是一款面向真实设备的GUI图形界面智能体基座模型
覆盖移动端
PC桌面端
网页以及深度搜索环境
最大的亮点是让AI可以直接看懂屏幕界面
模拟人类操作App与软件
充当数字设备通用执行器
2026-08-20
1 阅读
约2分钟阅读
建嘉
字号:
快科技8月20日消息,阿里千问大模型正式发布Qwen-UI-Agent,这是一款面向真实设备的GUI图形界面智能体基座模型,覆盖移动端、PC桌面端、网页以及深度搜索环境。 最大的亮点是让AI可以直接看懂屏幕界面、模拟人类操作App与软件,充当数字设备通用执行器。 性能评测上该模型多项基准达到业界顶尖水平,移动端MobileWorld得分82.1%,真机基准MobileWorld-Real达到92.2%,AndroidDaily高达97.5%。 电脑端OSWorld?Verified取得79.5%,浏览器WebArena拿到73.6%。 ScreenSpot-Pro界面定位81.5%,多项榜单刷新SOTA,综合表现对标并超越GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro等海外旗舰模型,同时保留基座模型原本通用与Agent能力。 模型基于大规模真机环境训练,搭建超100台真实手机、150余款应用的测试集群,打通从仿真模拟到真实设备落地。 安全机制贯穿全流程,高风险请求直接拒绝,支付、删除数据、权限授权等敏感操作需要用户确认才继续执行。 支持GUI图形操作+CLI命令行混合动作,支持批量动作输出,电脑任务中接近半数可调用命令行,有效减少执行步骤,提升任务效率。 模型支持超100步超长轨迹在线强化学习,上万并发环境用于训练迭代,搭载AutoResearch式AI驱动数据飞轮,实现任务闭环迭代。 依托Harness框架,具备主动服务能力,支持手机、电脑跨设备任务接力,还可以和DeepSearch深度搜索联动,把网页检索和界面操作结合。 Qwen-UI-Agent目标是解决大量没有开放API的传统软件应用,不需要改造程序,AI依靠看懂屏幕就完成操作,拓展智能体落地边界。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱