JOTO
Contact us
← AI 智库
开源模型

Qwen-UI-Agent:让模型真正“会用”每一块屏幕

2026 年 9 月 21 日

Qwen-UI-Agent 是一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索环境。它在 MobileWorld、OSWorld、WebArena 等多项 GUI 基准测试中全面对标或超越业界旗舰模型,并具备真机训练评测、严守安全边界、GUI+CLI 混合动作空间、长程在线强化学习、AutoResearch 数据飞轮、跨平台主动服务等六大核心能力。

GUI 智能体的现实意义与能力要求

CLI、MCP 等工具正在快速拓展智能体的能力边界,但大量既有的数字生态仍未被工具化,GUI (Graphical User Interface,图形用户界面)依然是数字世界最广泛、最通用的交互入口。

GUI 智能体有望成为现有数字设备上的通用执行器,只要有界面,它就能上手替你操作。为了让这一设想落地,我们期待的GUI 智能体基模应当具备这样几种能力:在真实设备上可靠运行;能力强大的同时,严守安全边界;跨手机、电脑执行个人工作流;将 GUI 交互与 CLI 执行有机结合;稳定高效完成长程任务;主动提供有用的个性化服务;在较少人工参与下由AI驱动模型能力迭代。

Qwen-UI-Agent 正式发布

基于这一愿景,我们推出了 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。

性能表现全面领先

Qwen-UI-Agent 在多个基准测试中的性能对比图表
(配图展示了部分核心 Benchmark 结果,更多分数及评测细节,可前往技术报告查阅)

Qwen-UI-Agent在GUI任务上全面对标乃至超越业界旗舰模型:

  • 移动端: MobileWorld 82.1%,分别领先GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro 12.0、14.6、8.9 个百分点;真机基准MobileWorld-Real 92.2%,超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro ;AndroidDaily高达 97.5%,接近满分。
  • 电脑端:OSWorld-Verified 79.5%,超越 GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro;OSWorld-v2 Partial分数40.0%,同时相比基线节省58%执行步数。
  • 浏览器&DeepSearch:WebArena 73.6%,位列所有对比模型第一;BrowseComp-ZH 75.0%。
  • GUI Grounding:ScreenSpot-Pro 81.5%,在其余4个grounding评测基准也全部刷新SOTA。
  • 通用能力:通用和Agentic能力全面保持或超越训练基座模型,并在这两类任务上大幅领先GUI专用模型,从容应对真实世界的长尾需求。

六大核心亮点

01 真机训练,真机评测

搭建覆盖 100+ 台真实手机、150+ 应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建 MobileWorld-Real 真机基准(400+任务、100+应用),打通“从模拟到真实”的最后一公里。

☕️本地生活 + 咖啡探店

Prompt:我今天约了朋友去天目里喝咖啡,帮我在高德搜索查看详细地址,打开大众点找附近 1 公里内的咖啡馆,找人气最高的那家记下店名,再去小红书总结前五条笔记,看看大家推荐这家店的哪款咖啡。
Qwen-UI-Agent 执行咖啡探店任务的演示动图
☕️本地生活 + 咖啡探店

🚄高铁行程 + 会议安排

Prompt:下周三我从北京回来,帮我看一下 12306 最早到杭州西的那班高铁几点到。然后查一下杭州西坐地铁到阿里巴巴西溪园区要多久,算一下我几点能到公司。最后在钉钉安排一个到达后整点的会议。主题写"出差归来项目同步",参会人选我和张三。开一个小时,设置提前 5 分钟提醒。
Qwen-UI-Agent 执行高铁行程与会议安排任务的演示动图
🚄高铁行程 + 会议安排

02 严守安全边界

Qwen-UI-Agent 将安全判断贯穿任务执行全过程:面对违法或高风险请求,它会不执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则会在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。危险请求不执行,敏感操作不擅自决定,让模型既能执行,也懂得何时停手。

Qwen-UI-Agent 安全机制示意图1
Qwen-UI-Agent 安全机制示意图2
Qwen-UI-Agent 安全机制示意图3
Qwen-UI-Agent 安全机制示意图4
Qwen-UI-Agent 安全机制示意图5
Qwen-UI-Agent 安全机制示意图6
Qwen-UI-Agent 安全机制示意图7
(可左右滑动查看更多演示)

03 GUI + CLI 混合动作空间,支持Batched Actions(批量操作)

GUI操作之外,模型还能直接执行命令行操作,并在单次决策中批量输出多个动作。在电脑任务中,CLI动作占比近半,约40%动作以batched actions形式输出,大幅缩短执行轨迹、拓展能力边界、提升执行效率。比如跨网站调研产品、核对价格,生成比价方案。

🪑规划居家办公桌面方案

Prompt:我有一张120厘米宽、60厘米长的书桌,想配一套适合居家办公的设备,总预算不超过4000元。帮我从公开网站上挑选显示器、显示器支架、键盘和台灯(有空间的话你自己再想想还要买什么 ),每类比较几款,注意显示器重量要在支架承重范围内,所有设备要能合理放在桌面上 。整理三套不同价位的方案,并做一张按实际比例绘制的桌面布局图,让我能直观看到每套方案放在桌上的效果。不要购买。(注意,附上推荐理由,而且要有一些产品评价跟对应的链接,我要性价比,最好给我1000,2000,4000的三套方案),最后展示一个html文件给我。
Qwen-UI-Agent 执行居家办公桌面方案规划任务的演示动图
🪑规划居家办公桌面方案

04 可扩展的长程在线强化学习

支持在超过100步的超长轨迹上进行在线 RL 训练,约 10000 个并发环境同时 rollout,配合模型自适应课程学习,持续攻克长程任务。

比如下面这一段数据分析的长程调研任务,总步数达170步。智能体采集并交叉核验数据,运行可复现分析,生成 Excel、PowerPoint 和 Word 交付物,再进行多轮视觉检查并修正可见的版式问题。

📑调研与报告生成

Prompt:请深度分析 Google(Alphabet)从 2019 年至今的增长轨迹,覆盖营收、营业利润、净利润、利润率、研发投入、资本开支、员工人数、主要业务板块及重大战略变化。使用统一的数据口径,计算同比增长率和复合年增长率,识别广告、云计算、AI、组织调整及基础设施投资等关键转折。
数据必须来自 Alphabet 财报、SEC 文件等权威来源,并通过可靠的第三方来源交叉核验。所有图表和结论均须标注出处。
请将原始资料、可复现分析脚本、Excel 工作簿、一份六页中文 PowerPoint 和一份简明 Word 摘要,统一保存到桌面的“Google Growth Analysis”文件夹中。
  • 调研分析

(GUI 负责网页检索与数据源定位,CLI 负责数据下载与分析)

Qwen-UI-Agent 执行调研分析任务的演示动图
📑调研与报告生成
  • 报告生成与视觉校验

(CLI 负责生成多项调研报告,GUI 负责检查视觉效果并指导提供修复反馈)

Qwen-UI-Agent 执行报告生成与视觉校验任务的演示动图

05 AutoResearch 式数据飞轮

要持续提升模型能力,需要一个迭代式、闭环式的流程,涵盖任务设计、环境构建、验证器开发、数据整理、模型训练、评估以及错误分析等多个环节。

当这些阶段主要由人类驱动时,迭代速度会变得缓慢,并且随着应用、平台和能力维度覆盖范围的不断扩大,也难以规模化。为了解决这一问题,我们提出了由AI驱动的数据飞轮,将人类从亲自执行每个阶段,转变为高层监督和干预关键节点。

AutoResearch 式数据飞轮流程图

06 主动服务 + 跨平台工作流Harness

通过强大的Harness能力,Agent不再被动等待指令,而是主动服务。比如收到航班取消通知,Agent 可主动识别受影响的行程、检索备选航班与高铁、结合日程给出改签方案,经用户确认后执行,并在手机与电脑之间无缝接力完成后续工作。

✈️航班取消后主动服务

场景: Harness检测到用户次日清晨的航班被取消,使其能否按时参加14:00的重要会议面临风险。在用户提出请求之前,主动服务 Harness 便开始搜索替代航班和高铁方案,评估哪些选项能够确保按时抵达,并提供可供直接决策的行程调整方案。
Qwen-UI-Agent 执行航班取消后主动服务任务的演示动图
✈️航班取消后主动服务

💻手机到电脑的跨端执行

Prompt:在手机相册中找到所有收据,将它们移动到远程桌面上的receipts文件夹,按日期重命名,并在该文件夹中创建一个 Excel 文件汇总账单。
Qwen-UI-Agent 执行手机到电脑跨端执行任务的演示动图
💻手机到电脑的跨端执行

🔍GUI x DeepSearch

GUI 负责真实界面中的交互与执行,DeepSearch 负责跨来源检索、筛选和核验信息。二者协同,可将原本多个页面中反复点击、浏览和筛选的信息检索流程,简化为少量高效的API搜索请求,再返回界面完成后续操作,显著缩短执行路径、拓展信息获取范围并提升任务效率。

Prompt:帮我找出本届世界杯淘汰赛中,在落后的情况下最终完成反超、且反超前最大落后球数最多的一场比赛,然后打开小红书,查看过去一周内讨论度最高的相关帖子并点开。
Qwen-UI-Agent:让模型真正“会用”每一块屏幕 配图 17
Qwen-UI-Agent 执行GUI x DeepSearch任务的演示动图

JOTO 企业落地观察

  • GUI 智能体的真机训练与评测能力,对企业部署意味着必须重构传统 AI 模型的验证范式——不能仅依赖合成数据或模拟环境,而需建立覆盖真实终端、真实应用、真实用户行为的闭环测试体系,这对企业的设备管理、自动化测试平台和数据治理能力提出新要求。
  • GUI+CLI 混合动作空间的设计,反映出企业智能体工程正从单一接口走向多模态执行层融合。这类系统在落地时需平衡界面解析精度与命令行执行可靠性,其架构设计必须支持异构动作的统一编排、状态同步与失败回滚,而非简单叠加两种能力。
  • AutoResearch 数据飞轮强调由 AI 驱动的闭环迭代,这对企业 RAG 知识工程构成挑战:当模型自身参与任务设计、验证器开发与错误分析时,知识库的更新节奏、可信度校验机制和人工干预阈值必须重新定义,不能再沿用静态文档注入模式。
  • Harness 主动服务能力要求智能体具备跨平台上下文感知与状态接力能力,这对企业 AI 安全治理提出新命题——如何在不牺牲主动性的前提下,确保跨设备操作的权限继承、操作留痕与用户确认链路完整,避免因自动接力引发的越权或误操作风险。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.