Qwen-UI-Agent:让模型真正“会用”每一块屏幕
Qwen-UI-Agent 是一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索环境。它在 MobileWorld、OSWorld、WebArena 等多项 GUI 基准测试中全面对标或超越业界旗舰模型,并具备真机训练评测、严守安全边界、GUI+CLI 混合动作空间、长程在线强化学习、AutoResearch 数据飞轮、跨平台主动服务等六大核心能力。
GUI 智能体的现实意义与能力要求
CLI、MCP 等工具正在快速拓展智能体的能力边界,但大量既有的数字生态仍未被工具化,GUI (Graphical User Interface,图形用户界面)依然是数字世界最广泛、最通用的交互入口。
GUI 智能体有望成为现有数字设备上的通用执行器,只要有界面,它就能上手替你操作。为了让这一设想落地,我们期待的GUI 智能体基模应当具备这样几种能力:在真实设备上可靠运行;能力强大的同时,严守安全边界;跨手机、电脑执行个人工作流;将 GUI 交互与 CLI 执行有机结合;稳定高效完成长程任务;主动提供有用的个性化服务;在较少人工参与下由AI驱动模型能力迭代。
Qwen-UI-Agent 正式发布
基于这一愿景,我们推出了 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。
性能表现全面领先

Qwen-UI-Agent在GUI任务上全面对标乃至超越业界旗舰模型:
- 移动端: MobileWorld 82.1%,分别领先GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro 12.0、14.6、8.9 个百分点;真机基准MobileWorld-Real 92.2%,超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro ;AndroidDaily高达 97.5%,接近满分。
- 电脑端:OSWorld-Verified 79.5%,超越 GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro;OSWorld-v2 Partial分数40.0%,同时相比基线节省58%执行步数。
- 浏览器&DeepSearch:WebArena 73.6%,位列所有对比模型第一;BrowseComp-ZH 75.0%。
- GUI Grounding:ScreenSpot-Pro 81.5%,在其余4个grounding评测基准也全部刷新SOTA。
- 通用能力:通用和Agentic能力全面保持或超越训练基座模型,并在这两类任务上大幅领先GUI专用模型,从容应对真实世界的长尾需求。
六大核心亮点
01 真机训练,真机评测
搭建覆盖 100+ 台真实手机、150+ 应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建 MobileWorld-Real 真机基准(400+任务、100+应用),打通“从模拟到真实”的最后一公里。
☕️本地生活 + 咖啡探店
Prompt:我今天约了朋友去天目里喝咖啡,帮我在高德搜索查看详细地址,打开大众点找附近 1 公里内的咖啡馆,找人气最高的那家记下店名,再去小红书总结前五条笔记,看看大家推荐这家店的哪款咖啡。

🚄高铁行程 + 会议安排
Prompt:下周三我从北京回来,帮我看一下 12306 最早到杭州西的那班高铁几点到。然后查一下杭州西坐地铁到阿里巴巴西溪园区要多久,算一下我几点能到公司。最后在钉钉安排一个到达后整点的会议。主题写"出差归来项目同步",参会人选我和张三。开一个小时,设置提前 5 分钟提醒。

02 严守安全边界
Qwen-UI-Agent 将安全判断贯穿任务执行全过程:面对违法或高风险请求,它会不执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则会在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。危险请求不执行,敏感操作不擅自决定,让模型既能执行,也懂得何时停手。







03 GUI + CLI 混合动作空间,支持Batched Actions(批量操作)
GUI操作之外,模型还能直接执行命令行操作,并在单次决策中批量输出多个动作。在电脑任务中,CLI动作占比近半,约40%动作以batched actions形式输出,大幅缩短执行轨迹、拓展能力边界、提升执行效率。比如跨网站调研产品、核对价格,生成比价方案。
🪑规划居家办公桌面方案
Prompt:我有一张120厘米宽、60厘米长的书桌,想配一套适合居家办公的设备,总预算不超过4000元。帮我从公开网站上挑选显示器、显示器支架、键盘和台灯(有空间的话你自己再想想还要买什么 ),每类比较几款,注意显示器重量要在支架承重范围内,所有设备要能合理放在桌面上 。整理三套不同价位的方案,并做一张按实际比例绘制的桌面布局图,让我能直观看到每套方案放在桌上的效果。不要购买。(注意,附上推荐理由,而且要有一些产品评价跟对应的链接,我要性价比,最好给我1000,2000,4000的三套方案),最后展示一个html文件给我。

04 可扩展的长程在线强化学习
支持在超过100步的超长轨迹上进行在线 RL 训练,约 10000 个并发环境同时 rollout,配合模型自适应课程学习,持续攻克长程任务。
比如下面这一段数据分析的长程调研任务,总步数达170步。智能体采集并交叉核验数据,运行可复现分析,生成 Excel、PowerPoint 和 Word 交付物,再进行多轮视觉检查并修正可见的版式问题。
📑调研与报告生成
Prompt:请深度分析 Google(Alphabet)从 2019 年至今的增长轨迹,覆盖营收、营业利润、净利润、利润率、研发投入、资本开支、员工人数、主要业务板块及重大战略变化。使用统一的数据口径,计算同比增长率和复合年增长率,识别广告、云计算、AI、组织调整及基础设施投资等关键转折。
数据必须来自 Alphabet 财报、SEC 文件等权威来源,并通过可靠的第三方来源交叉核验。所有图表和结论均须标注出处。
请将原始资料、可复现分析脚本、Excel 工作簿、一份六页中文 PowerPoint 和一份简明 Word 摘要,统一保存到桌面的“Google Growth Analysis”文件夹中。
- 调研分析
(GUI 负责网页检索与数据源定位,CLI 负责数据下载与分析)

- 报告生成与视觉校验
(CLI 负责生成多项调研报告,GUI 负责检查视觉效果并指导提供修复反馈)

05 AutoResearch 式数据飞轮
要持续提升模型能力,需要一个迭代式、闭环式的流程,涵盖任务设计、环境构建、验证器开发、数据整理、模型训练、评估以及错误分析等多个环节。
当这些阶段主要由人类驱动时,迭代速度会变得缓慢,并且随着应用、平台和能力维度覆盖范围的不断扩大,也难以规模化。为了解决这一问题,我们提出了由AI驱动的数据飞轮,将人类从亲自执行每个阶段,转变为高层监督和干预关键节点。

06 主动服务 + 跨平台工作流Harness
通过强大的Harness能力,Agent不再被动等待指令,而是主动服务。比如收到航班取消通知,Agent 可主动识别受影响的行程、检索备选航班与高铁、结合日程给出改签方案,经用户确认后执行,并在手机与电脑之间无缝接力完成后续工作。
✈️航班取消后主动服务
场景: Harness检测到用户次日清晨的航班被取消,使其能否按时参加14:00的重要会议面临风险。在用户提出请求之前,主动服务 Harness 便开始搜索替代航班和高铁方案,评估哪些选项能够确保按时抵达,并提供可供直接决策的行程调整方案。

💻手机到电脑的跨端执行
Prompt:在手机相册中找到所有收据,将它们移动到远程桌面上的receipts文件夹,按日期重命名,并在该文件夹中创建一个 Excel 文件汇总账单。

🔍GUI x DeepSearch
GUI 负责真实界面中的交互与执行,DeepSearch 负责跨来源检索、筛选和核验信息。二者协同,可将原本多个页面中反复点击、浏览和筛选的信息检索流程,简化为少量高效的API搜索请求,再返回界面完成后续操作,显著缩短执行路径、拓展信息获取范围并提升任务效率。
Prompt:帮我找出本届世界杯淘汰赛中,在落后的情况下最终完成反超、且反超前最大落后球数最多的一场比赛,然后打开小红书,查看过去一周内讨论度最高的相关帖子并点开。


JOTO 企业落地观察
- GUI 智能体的真机训练与评测能力,对企业部署意味着必须重构传统 AI 模型的验证范式——不能仅依赖合成数据或模拟环境,而需建立覆盖真实终端、真实应用、真实用户行为的闭环测试体系,这对企业的设备管理、自动化测试平台和数据治理能力提出新要求。
- GUI+CLI 混合动作空间的设计,反映出企业智能体工程正从单一接口走向多模态执行层融合。这类系统在落地时需平衡界面解析精度与命令行执行可靠性,其架构设计必须支持异构动作的统一编排、状态同步与失败回滚,而非简单叠加两种能力。
- AutoResearch 数据飞轮强调由 AI 驱动的闭环迭代,这对企业 RAG 知识工程构成挑战:当模型自身参与任务设计、验证器开发与错误分析时,知识库的更新节奏、可信度校验机制和人工干预阈值必须重新定义,不能再沿用静态文档注入模式。
- Harness 主动服务能力要求智能体具备跨平台上下文感知与状态接力能力,这对企业 AI 安全治理提出新命题——如何在不牺牲主动性的前提下,确保跨设备操作的权限继承、操作留痕与用户确认链路完整,避免因自动接力引发的越权或误操作风险。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


