ClawGUI:GUI Agent训练、评估与部署的统一开源框架
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
ClawGUI是面向GUI Agent的开源全栈框架,统一解决训练、评估与部署的基础设施瓶颈。ClawGUI-RL首创支持并行虚拟环境与真实设备的开源强化学习管道,集成GiGPO与过程奖励模型;ClawGUI-Eval在6项基准实现95.8%基线复现率;ClawGUI-Agent支持部署至Android、HarmonyOS、iOS及12个以上聊天平台。经该管道训练的ClawGUI-2B在MobileWorld GUI-Only任务达17.1%成功率,较同规模基线提升6.0%。
这是 GUI agent 方向久等的工程基座,第一次把在线 RL 训练、标准化评估和真实设备部署装进同一个开源框架,2B 模型就能跑赢大尺寸模型,做移动 agent 的团队可以直接上手复现。
摘要
摘要。图形用户界面智能体通过视觉界面而非程序化 API 驱动应用程序,通过点击、滑动和按键与任意软件交互,从而触及基于命令行的智能体无法覆盖的长尾应用。然而,该领域的进展瓶颈更多在于缺乏连贯的全栈基础设施,而非模型能力本身:在线强化学习训练受困于环境不稳定和封闭的流水线,评估协议在不同工作中悄然漂移,训练好的智能体也鲜少能真正部署到真实用户的真实设备上。我们提出了 ClawGUI,一个在同一框架内解决这三个短板的开源方案。ClawGUI-RL 提供了首个开源的 GUI 智能体强化学习基础设施,经验证同时支持并行虚拟环境和真实物理设备,将 GiGPO 与过程奖励模型相结合,实现密集的步骤级监督。ClawGUI-Eval 在 6 个基准测试和 11 个以上模型上强制执行完全标准化的评估流水线,对官方基线的复现率达到 95.8%。ClawGUI-Agent 通过 12 个以上聊天平台,将训练好的智能体部署到 Android、HarmonyOS 和 iOS 系统,并具备混合命令行-GUI 控制与持久化个性化记忆功能。在该流水线内进行端到端训练后,ClawGUI-2B 在 MobileWorld GUI-Only 上取得了 17.1% 的成功率,比同规模的 MAI-UI-2B 基线高出 6.0 个百分点。
1 引言
图形用户界面(GUI)是人类与现代计算设备交互的通用基础 [tang2025surveymllmbasedguiagents, fu2023ufo2unifiedpretrainingframework, shen2023hugginggptsolvingaitasks, nakano2022webgptbrowserassistedquestionansweringhuman, hong2024cogagentvisuallanguagemodel, tang2025thinktwiceclickonce]。一个能够感知屏幕状态并执行轻触、滑动和键入等底层界面操作的智能体,原则上能够操作任何设备上的任何应用程序,无需专用 API 或后端访问权限 [hu2024dawnguiagentpreliminary, lai2024autowebglmlargelanguagemodelbased, zhang2025apiagentsvsgui]。这种通用性使得 GUI 智能体成为实现端到端数字自动化最活跃的研究方向之一,过去两年在基础定位、导航和在线强化学习(RL)方面取得了快速进展 [mobileguirl, qin2025uitarspioneeringautomatedgui]。
然而,构建一个功能强大的 GUI 智能体并非单纯的建模问题,而是一个全栈工程问题 [luo2025guir1generalistr1style, lu2025uir1enhancingefficientaction, tang2025gui, mobileagent3]。一个有用的智能体必须在逼真的环境中进行训练,在可比较的条件下进行评估,并最终部署到真实设备上,让真实用户能够从中受益 [mobileguirl, uitars2, liu2024autoglmautonomousfoundationagents]。现有研究在以上每个方面都已各自取得了有意义的进展:GUI 基础模型稳步提升了元素定位的准确性 [luo2025guir1generalistr1style, lu2025uir1enhancingefficientaction, liu2025infiguir1advancingmultimodalgui, tang2025gui],导航智能体拓展了任务执行范围 [qin2025uitarspioneeringautomatedgui, uivenus],而在线强化学习已开始将策略质量推升至超越静态监督所能达到的水平 [uivenus15]。然而,当人们试图将这些组件拼凑成一个可运行的流水线时,它们之间的裂痕便暴露无遗。该领域仍然缺乏一个统一的框架,使训练、评估和部署能够作为一个连贯的整体运作,而正是这一缺失——而非任何单一技术的不足——成为了当前制约实际进展的瓶颈。
我们识别出三个具体差距,它们共同构成了这一瓶颈。
GUI 智能体的训练生态系统在很大程度上仍然是封闭的。
近期有多个系统报告了在虚拟环境中通过在线强化学习训练取得了强劲结果 [uitars2, uivenus15, mobileagent35],但没有任何一个系统公开了底层基础设施,这使得外部研究人员无法复现其设置或在此基础上进行开发。即便存在代码,也完全绑定在基于模拟器的沙盒环境中,而直接在物理设备上进行训练——这恰恰是智能体最终必须执行任务的场景——在公开文献中基本上仍是一片未探索的领域 [maiui]。这里核心的工程难点并非强化学习算法本身,而是环境管理:模拟器在长时间运行中会偏离健康状态,真实设备无法暴露系统级的验证信号,而长周期 GUI 任务中的奖励信号几乎天生就是稀疏的。
各篇 GUI 智能体论文之间的评估标准严重不一致。
GUI 基准测试表面上看起来很简单,但不同论文报告的数值之间很少能直接比较 [seed18, Gemini]。提示词格式、坐标归一化约定、图像分辨率以及采样配置,每一项都会使报告准确率波动几个百分点,而这些选择往往没有文档记录。其结果是,整个社区缺乏一个共同的基线来衡量真正的进展。在 ScreenSpot-Pro [li2024screenspot-pro] 上 2% 的提升,可能反映的是真正的进步,也可能只是得益于一个有利的提示词,或者仅仅是分辨率不同——而读者目前根本无法分辨。
从研究到真实用户之间的部署循环是断裂的。
在研究流程中训练的智能体几乎从未触达终端用户。近期一系列工作探索了基于命令行的智能体框架 [openclaw, claudecode, clianything, opencli],这些框架通过结构化指令提供精确控制,但仅覆盖了实际应用的狭窄范围。与此同时,能够将训练好的图形界面策略连接到真实硬件、通过用户日常生活中已使用的界面进行交互、并随时间保持持久个性化能力的系统,在开放生态中仍基本缺失 [zhang2023appagentmultimodalagentssmartphone, wang2024mobileagentv2mobiledeviceoperation, agashe2024agentsopenagentic]。缺少这最后一环,图形界面智能体的真实世界价值便在很大程度上无法得到验证。
基于这些洞察,我们提出了 ClawGUI,这是一个旨在通过单一连贯系统弥合上述三个差距的开源框架。ClawGUI 由三个紧密集成的模块组成。ClawGUI-RL 提供可扩展的在线强化学习基础设施,同时支持基于 Docker 的并行安卓模拟器和真实物理设备,将 GiGPO [gigpo] 与一个过程奖励模型相结合,该模型提供密集的步骤级监督,以抵消长周期图形界面任务中结果奖励的稀疏性。ClawGUI-Eval 在 6 个基准测试和 11 个以上模型上强制执行严格的三阶段流程,为每个模型固定所有评估选项,从而使结果可复现,而非名义上可比较。ClawGUI-Agent 则闭环连接从研究到部署的链路,通过 12 个以上的聊天平台将训练好的智能体带到安卓、鸿蒙和 iOS 系统,采用混合命令行-图形界面控制策略,结合了命令行的精确性与图形界面的普适覆盖,并配备持久个性化记忆系统,使智能体能够随时间适应不同用户。
为了端到端验证该框架,我们在 ClawGUI-RL 流水线中完整训练了 ClawGUI-2B 模型。在 MobileWorld GUI-Only 基准上,ClawGUI-2B 的成功率达到 17.1%,而同等规模的 MAI-UI-2B 基线模型仅为 11.1%,并且该模型还超越了规模大得多的未训练模型,如 Qwen3-VL-32B(11.9%)和 UI-Venus-72B(16.4%)。在同一流水线中,将基于回合的 GRPO 替换为基于步骤的 GiGPO 带来了 2.6% 的提升(从 14.5% 提升至 17.1%),这直接证实了在 GUI 强化学习中密集信用分配的价值。在评估方面,ClawGUI-Eval 在 6 个基准测试和 11 个以上模型上,对已发表基线的复现率达到 95.8%。
我们的主要贡献如下:
- •
我们发布了 ClawGUI,这是一个统一的开源框架,它将在线强化学习训练、标准化评估和真实设备部署整合到一个面向 GUI 智能体的单一流水线中。
- •
我们发布了 ClawGUI-RL,这是首个开源 GUI 智能体强化学习基础设施,经验证支持大规模并行虚拟环境和真实物理设备,并将 GiGPO 与过程奖励模型相结合,以实现密集的步骤级监督。
- •
我们发布了 ClawGUI-Eval,以及所有推理代码和在 6 个基准测试及 11 个以上模型上的预计算预测结果,对官方基线的复现率达到 95.8%,从而实现了可靠的跨论文比较。
- •
我们发布了 ClawGUI-Agent,这是一个生产级部署系统,可通过 12 个以上聊天平台将训练好的智能体连接到真实的 Android、HarmonyOS 和 iOS 设备,并具备持久化的个性化记忆功能。
- •
我们发布了 ClawGUI-2B,该模型在 ClawGUI-RL 流水线内进行端到端训练,在 MobileWorld GUI-Only 上达到 17.1% 的成功率,比同等规模的 MAI-UI-2B 基线模型高出 6.0 个绝对百分点,从而端到端地验证了该框架。
2 相关工作
2.1 GUI 智能体模型:从基础定位到导航
早期的图形用户界面智能体依赖于级联式流水线,该流水线将现成的感知模块(例如 OCR [wang2024mobileagentautonomousmultimodalmobile, du2025unirec01bunifiedtextformula, feng_etal_2025_dolphin, feng2026dolphinv2universaldocumentparsing]、SAM [kirillov2023segment, ravi2024sam2segmentimages] 和 set-of-marks 提示词 [yang2023setofmarkpromptingunleashesextraordinary, lu2024omniparserpurevisionbased])与闭源规划器相结合,这是一种模块化但会累积错误的设计,阻碍了端到端优化。随着视觉语言基础模型的成熟,端到端定位成为主导范式:SeeClick [cheng2024seeclickharnessingguigrounding]、UI-TARS [qin2025uitarspioneeringautomatedgui]、Aguvis [xu2024aguvis] 和 UGround [gou2024navigatingdigitalworldhumans] 表明,定位精度随数据和模型能力的提升而扩展,后续工作通过基于强化学习的坐标奖励进一步强化了定位能力 [lu2025uir1enhancingefficientaction, luo2025guir1generalistr1style, tang2025gui]。在更强的定位能力基础上,第二波浪潮瞄准了长程导航,分为将定位模型与专有规划器配对的模块化流水线 [gou2024navigatingdigitalworldhumans, xu2024aguvis],以及将感知和决策共同内化的统一端到端策略 [qin2025uitarspioneeringautomatedgui, maiui, uivenus15]。ClawGUI 与此建模轴线正交:它并非提出新的定位或导航模型,而是提供了一个共享框架,使两种范式都能在一致条件下进行训练、评估和部署。
2.2 面向图形用户界面智能体的在线强化学习
为长程 GUI 任务收集大规模轨迹数据成本高昂,因为每次演示都需要逐步执行、精确的动作标注以及可靠的环境回放 [lin2025guirewalkmassivedatageneration, wang2026openclawrltrainagentsimply, mobileworld]。在线强化学习提供了一种有吸引力的替代方案,让智能体通过直接与环境交互来生成自身经验,并借助结果奖励来优化任务完成情况。包括 MobileGUI-RL [mobileguirl]、ComputerRL [lai2025computerrlscalingendtoendonline]、MAI-UI [maiui]、UI-Venus-1.5 [uivenus15] 和 UI-TARS-2 [uitars2] 在内的快速增长的研究工作表明,基于沙箱的在线训练能够带来超越监督微调(SFT)的持续提升。然而,仍存在三个难点:在长动作序列中奖励信号稀疏,多步信用分配并非易事,以及基础设施成本高昂,需要跨异构应用进行并行模拟和稳健的回合管理。更重要的是,对于社区而言,这些工作均未开源其训练基础设施,并且全部仅在虚拟沙箱中进行了验证,使得真实设备上的训练几乎完全未被探索。ClawGUI-RL 直接针对这一空白,发布了一套开源基础设施,该设施负责环境管理、提供密集的步骤级奖励监督,并在并行模拟器和真实物理设备上均进行了验证性训练。
2.3 GUI 智能体的基准测试与可复现性
一个丰富的图形用户界面基准测试生态系统已经形成,用于衡量(智能体的)定位与导航能力,其中包括 ScreenSpot-Pro [li2024screenspot-pro]、ScreenSpot-V2、UI-Vision、MMBench-GUI、OSWorld-G 和 AndroidControl,以及诸如 MobileWorld [mobileworld] 等交互式测试套件。这些已成为报告 GUI 智能体进展的事实标准。然而在实践中,不同论文报告的数据很少能直接比较:提示词格式、坐标归一化、图像分辨率、采样温度和后处理规则之间的相互作用,会使报告的准确率产生数个百分点的偏移,而且这些选择中的许多细节并未被记录在案 [seed18, Gemini, tang2025thinktwiceclickonce]。因此,社区缺乏一个可靠的共享基线,微小的报告改进往往与配置漂移难以区分。此前的标准化工作要么聚焦于单一基准测试,要么与特定的训练方案捆绑在一起,要么发布了评估脚本却不附带推理预测结果,这使得独立的重新评判变得不可行。ClawGUI-Eval 在范围和理念上都有所不同:它将评估解耦为标准化的推理、评判和指标计算三个环节,为每个模型固定所有配置选择,并发布了涵盖 6 个基准测试和 11 个以上模型的推理输出结果,使社区无需重新运行昂贵的推理过程,即可复现、重新评判和扩展已发表的结果。
2.4 将 GUI 智能体部署给真实用户
一个强大的 GUI 智能体只有在触达操作真实设备的真实用户时,才能体现其价值。受 OpenClaw [openclaw] 和 Hermes-Agent [hermes_agent] 成功的推动,越来越多的工作转向基于 CLI 的智能体工具链 [opencli, clianything, claudecode, anthropic_harness_design_2026, hermes_agent, minimax_m27_news_2026] 作为部署基础。CLI 执行高效且精确,但存在根本性局限:许多应用不提供编程接口 [zhang2025apiagentsvsgui],CLI 操作对用户不透明,用户无法观察或干预智能体行为 [masbench],并且绕过视觉层会丧失使智能体动作可解释的空间定位能力 [tang2025surveymllmbasedguiagents, fu2025manotechnicalreport]。基于 GUI 的交互通过在屏幕上直接操作来解决这些局限,并能覆盖任何应用(无论其底层架构如何),但这也带来了自身成本,因为 CLI 单次调用即可完成的任务,可能需要多次连续的 GUI 操作 [jiang2025appagentxevolvingguiagents, Magentic-UI]。现有的研究部署也往往止步于演示笔记本或孤立的 Android 控制器,跨平台覆盖和持久化个性化功能基本未被解决。ClawGUI-Agent 通过一种混合工具链弥补了这一差距,该工具链在接口允许时利用 CLI 的高效性,在接口不允许时回退到 GUI 控制,通过 12 个以上的聊天平台将训练好的智能体连接到 Android、HarmonyOS 和 iOS,并集成了一个持久的个性化记忆系统,使智能体能够随时间推移适应个体用户。
3 ClawGUI
3.1 系统概述
我们介绍 ClawGUI,这是一个旨在覆盖 GUI 智能体开发完整生命周期的统一框架。如图 1 所示,ClawGUI 由三个紧密集成的模块组成:用于可扩展在线 RL 训练的 ClawGUI-RL,用于标准化和可复现评估的 ClawGUI-Eval,以及用于真实设备部署和人类交互的 ClawGUI-Agent。
3.2 ClawGUI-RL:可扩展的在线强化学习训练
GUI 任务本质上是序列决策问题,要求智能体通过真实环境交互而非仅靠静态监督来学习。尽管业界对 GUI 智能体的在线强化学习兴趣日益增长,但该领域仍缺乏一个既具备可扩展性、又在真实物理设备上得到验证的开源基础设施。为此,我们构建了 ClawGUI-RL,以提供从环境管理、奖励设计到策略优化的端到端支持。
3.2.1 环境管理器
稳定且可扩展的环境管理是 GUI 任务在线强化学习训练的前提。如图 2 所示,ClawGUI-RL 将所有设备后端抽象到统一接口之下,使得虚拟环境和物理设备可以在同一训练循环中互换使用。
虚拟环境。ClawGUI-RL 通过 MobileWorld [mobileworld] 并行启动数十个基于 Docker 的安卓模拟器,每个模拟器暴露一个训练工作进程与之交互的后端 URL。每个环境遵循四个阶段的生命周期:
- •
任务重置。在每个回合开始时,环境初始化设备状态并加载新任务,确保每次 rollout 都有干净的起始条件。
- •
任务评估。虚拟环境暴露系统级 root 权限,从而能够通过直接检查应用状态和数据库记录来实现可靠的任务完成验证。这种系统级信号进一步由 MLLM 作为评判者进行补充,后者根据任务指令评估最终屏幕状态,提供稳健且全面的结果奖励。
- •
备用服务器轮换。虚拟沙盒环境在长时间训练过程中容易变得不健康——容器停滞或崩溃会引发训练不稳定,并可能导致不可恢复的错误。为解决这一问题,ClawGUI-RL 维护了一个备用服务器队列。当检测到某个容器不健康时,系统会自动从队列中取出备用容器并轮换至健康的替代容器,使受影响的任务能够在不中断训练过程的情况下恢复运行。
- •
容器重置。容器会定期重启,以防止状态累积,并在长时间训练过程中保持环境的一致性。
真实设备训练。ClawGUI-RL 支持通过同一统一接口直接在物理安卓设备或云手机上训练。真实设备训练带来了两个虚拟环境中不会出现的问题。
- •
任务来源。与任务可以通过程序化生成并自动验证的虚拟环境不同,真实设备上的任务必须由人工编写,以确保其在物理硬件上既可执行又可验证。在 ClawGUI-RL 中,我们整理了一套涵盖代表性真实场景的人工编写任务集。
- •
任务评估。物理设备不提供系统级 root 访问权限,因此无法进行自动化状态验证。因此,ClawGUI-RL 依赖 MLLM-as-judge(多模态大语言模型作为评判者),通过评估最终屏幕状态与任务指令的匹配程度来判断任务是否完成,从而在不需设备级权限的情况下提供实用的奖励信号。
3.2.2 奖励设计:二元奖励与密集奖励
奖励设计对于长周期 GUI 任务的在线强化学习训练至关重要。ClawGUI-RL 采用了两级奖励方案,将二元结果奖励与密集过程奖励相结合。
二元结果奖励。主要的奖励信号是在回合结束时分配的二元分数:任务成功为 1,失败为 0。虽然这种方法很直接,但该信号在 GUI 环境中存在一个根本性局限——执行延迟和多步交互导致动作与其可观察结果之间存在显著延迟,从而产生极其稀疏的奖励信号,对中间步骤几乎无法提供指导。
密集的逐步骤奖励(通过 PRM)。为了补充稀疏的结果奖励,ClawGUI-RL 集成了一种过程奖励模型(PRM)。在每个动作之后,PRM 会接收之前的截图、当前的截图以及迄今为止的完整动作历史,并判断当前动作是否对任务完成有实质性贡献。这会产生一个逐步骤得分,并与结果奖励相结合:
| (1) |
通过在每一步提供密集的反馈,PRM 显著缓解了稀疏性问题,并使优化器能够在整个回合中区分有效动作与死胡同。
3.2.3 强化学习训练器
ClawGUI-RL 基于 verl [Sheng_2025] 和 verl-agent [gigpo] 构建,开箱即用地支持一系列强化学习算法,包括 Reinforce++ [reinforce]、PPO [schulman2017proximalpolicyoptimizationalgorithms]、GSPO [zheng2025groupsequencepolicyoptimization]、GRPO [shao2024deepseekmathpushinglimitsmathematical] 和 GiGPO [gigpo]。在我们的实验中,我们集成了 GRPO 和 GiGPO 作为主要的优势估计算法,并分析了它们对 GUI 智能体训练的影响。
GRPO [shao2024deepseekmath] 通过对共享同一任务的一组 rollout 中的回报进行归一化来估计优势。虽然这种方法对于单轮任务来说简单有效,但 GRPO 会将统一的回合级优势分配给轨迹中的每一步,这对于长程 GUI 交互来说过于粗糙。考虑同一任务的两个 rollout:rollout A 在 4 步内完成,而 rollout B 在 8 步内完成。GRPO 为两条轨迹分配相同的奖励,无法提供信号来区分单个步骤的效率,也无法奖励有效动作而惩罚冗余动作。
GiGPO [gigpo] 通过一种两级层次化优势估计方法解决了这一局限。在回合层面,GiGPO 保留完整轨迹上的宏观相对优势,从而维持全局轨迹质量信号。在步骤层面,GiGPO 引入了一种锚点状态分组机制:在不同 rollout 中遇到相同中间环境状态的步骤会被回溯性地聚类到子组中,并在每个子组内通过折扣回报归一化来估计微观相对优势。这种层次化结构能够实现细粒度的逐步骤信用分配,同时捕获全局轨迹质量和局部步骤有效性,且无需学习价值网络或额外的 rollout,使其特别适用于 GUI 任务的多步骤特性。
3.3 ClawGUI-Eval:可复现的 GUI 评估
评估是研究进展的指南针,然而 GUI 评估的复现难度远超表面所见。提示词顺序、坐标归一化约定、图像分辨率和采样温度等因素相互交织,会导致不同实现间的报告准确率产生数个百分点的偏差。因此,不同论文中的数据几乎无法相互比较,社区也缺乏一个可靠的基线来衡量真正的进展。如图 3 所示,ClawGUI-Eval 通过为每个模型固定所有评估选择并采用严格的三阶段流水线来解决这一问题,在 6 个基准测试和 11 个以上模型上实现了 95.8% 的官方结果复现率。
3.3.1 基准测试与模型覆盖范围
ClawGUI-Eval 覆盖了 6 个基准测试,涵盖多种 GUI 基础定位与导航场景:ScreenSpot-Pro [li2024screenspot-pro]、ScreenSpot-V2 [wu2024osatlasfoundationactionmodel]、UI-Vision [uivision]、MMBench-GUI [mmbenchgui]、OSWorld-G [xie2025scalingcomputerusegroundinguser] 和 AndroidControl [androidcontrol]。在模型方面,它支持 11 个以上的模型,包括 Qwen3-VL [qwen3vl]、Qwen2.5-VL [bai2025qwen25vltechnicalreport]、UI-TARS [qin2025uitarspioneeringautomatedgui]、MAI-UI [maiui]、GUI-G2 [tang2025gui]、UI-Venus [uivenus]、GUI-Owl [mobileagent3]、StepGUI [yan2025stepguitechnicalreport]、Gemini [Gemini] 和 Seed 1.8 [seed18]。所有推理结果均与评估代码一同公开发布,使社区能够直接复现、扩展并基于我们的结果进行构建。
3.3.2 流水线架构:推理、评判与指标
ClawGUI-Eval 将评估分解为三个解耦的阶段,每个阶段都有明确定义的输入和输出。
- •
推理。给定一个基准数据集和一个目标模型,推理阶段生成原始预测结果。ClawGUI-Eval 支持两种后端:通过 transformers 进行本地 GPU 推理,以及通过任何兼容 OpenAI 的端点进行远程 API 推理。多 GPU 并行推理通过 Python 多进程自动处理,每个进程绑定到专用的 GPU。分片级检查点机制允许中断的运行从最后一个完成的分片恢复,无需重新计算。
- •
评判。对原始模型输出进行解析,并与真实标注进行对比评估。ClawGUI-Eval 实现了特定于基准测试的评判器:用于标准 GUI 基础定位基准测试的点在框内评判器、用于 OSWorld-G 的多边形与拒绝感知评判器,以及用于 AndroidControl 的多动作评判器。每个评判器都会为每个样本生成一个正确性标签。
- •
指标。每个样本的标签被汇总为最终的准确率分数,并按平台、UI 元素类型和任务类别进行细分,从而能够进行超越总体数字的细粒度分析。
通过将这三个阶段解耦,ClawGUI-Eval 允许独立重新运行任何一个阶段——例如,使用更新后的解析器重新评判已有的预测结果,而无需重复进行昂贵的推理。
3.4 ClawGUI-Agent:个人图形界面智能助手
随着 GUI 智能体的能力日益增强,最终的挑战在于如何将其闭环到真实用户。一个训练好的智能体,如果无法部署、无法个性化定制、也无法集成到日常工作流程中,就无法带来实际价值。如图 4 所示,ClawGUI-Agent 旨在弥合这一差距,提供一个生产就绪的系统,将 GUI 智能体交到真实用户手中,使其能够在真实设备上运行。
3.4.1 混合设备控制:通过 CLI 和 GUI 进行操作
受 OpenClaw [openclaw] 成功的推动,越来越多的研究工作聚焦于基于 CLI 的智能体控制。CLI 交互精确且高效:一条结构化的命令就能完成原本需要遍历多层 UI 才能实现的操作。然而,CLI 控制存在根本性的局限。并非所有应用程序都暴露了编程接口。CLI 操作对用户来说是不透明的,用户无法观察或干预。同时,它绕过了使智能体行为可解释的可视化层。GUI 交互通过在屏幕上直接操作来解决这些局限,能够覆盖任何应用程序,无论其底层架构如何,但它也带来了自身的代价:原本通过 CLI 一次调用就能解决的任务,可能需要多次连续的 GUI 操作才能完成。
我们认为,单独任何一种范式都不足以胜任。ClawGUI-Agent 采用了一种混合方法,在接口允许的情况下利用 CLI 的高效性,在接口不允许时则回退到 GUI 控制。这种组合方式,既为支持良好的操作保留了 CLI 的速度,又通过 GUI 确保了其他所有操作的广泛覆盖。
3.4.2 个性化记忆
ClawGUI-Agent 集成了一个持久化的个性化记忆系统。在任务执行过程中,该智能体会自动从交互中提取结构化事实,包括联系人姓名与关系、常用应用程序以及用户习惯与偏好,并将它们作为嵌入向量存储在持久化存储中。在后续任务中,系统会检索语义上最相似的相关记忆并将其注入到系统上下文中,从而使智能体能够识别重复出现的实体,并随时间推移适应个体用户的行为模式。重复的记忆会被检测并合并,而非累积存储,从而保持记忆存储的精简与相关性。
3.4.3 远程控制与本地控制
ClawGUI-Agent 支持两种部署模式。在远程控制模式下,智能体可通过飞书、钉钉、Telegram、Discord、Slack 和 QQ 等 12 个以上的聊天平台访问,允许用户从另一台设备发出任务,远程控制目标手机。在本地控制模式下,用户直接从手机上运行的聊天应用程序发送指令,智能体随即接管本地设备,无需额外硬件或云端中继。
3.4.4 作为可部署技能的 ClawGUI-Eval
ClawGUI-Agent 将 ClawGUI-Eval 作为内置工具技能开放,使用户能够通过一条自然语言指令触发完整的基准评测流程。当收到诸如“在 ScreenSpot-Pro 上对 Qwen3-VL 进行基准测试”的指令时,智能体会自动执行环境验证、启动多 GPU 并行推理、运行评测器、计算指标,并返回一份包含与官方基线对比的结构化结果报告,全程无需编写任何脚本。
| 模型 | MobileWorld SR(仅 GUI) |
| 智能体框架 | |
| Claude-4.5-Sonnet + UI-Ins-7B | 47.8 |
| Gemini-3-Pro + UI-Ins-7B | 55.6 |
| GPT-5 + UI-Ins-7B | 54.0 |
| 端到端模型 | |
| GUI-Owl-7B | 7.7 |
| GUI-Owl-32B | 8.5 |
| UI-Venus-7B | 8.5 |
| UI-Venus-72B | 16.4 |
| Qwen3-VL-8B | 9.4 |
| Qwen3-VL-32B | 11.9 |
| Qwen3-VL-235B-A22B | 12.8 |
| 豆包-1.5-UI-TARS | 26.3 |
| MAI-UI-2B | 11.1 |
| MAI-UI-8B | 19.7 |
| 我们的方案 | |
| ClawGUI-2B | 17.1 |
4 实验
4.1 实验设置
训练。我们基于 MAI-UI-2B [maiui],在 8 块 A6000(48GB)GPU 上使用 64 个并行虚拟环境训练 ClawGUI-2B。我们采用 GiGPO 算法,rollout 组大小为 8,采样温度为 0.7,学习率为 1e-6,训练批次大小为 8,共训练 3 个 epoch。对于基于 PRM 的步骤级奖励判断,我们使用 Qwen3.5-72B 作为评判模型。
评估。我们在 MobileWorld 上评估 ClawGUI-2B,这是一个在线交互式基准测试,旨在评估 GUI 智能体的端到端任务完成能力。MobileWorld 包含三类任务:纯 GUI、MCP 和呼叫用户。我们将评估重点放在纯 GUI 子集上,该子集包含 117 个任务,要求智能体仅通过视觉 GUI 控制完成真实的移动端交互,不借助任何程序化接口。任务完成情况通过成功率来衡量,即智能体是否在回合结束时成功达成任务目标。所有评估的最大交互步数均设为 50。
| 方法 | 奖励类型 | 成功率 (%) |
| GRPO | 二元(回合级) | 14.5 |
| GiGPO | 密集(回合级与步骤级) | 17.1 |
4.2 主要结果。
表1报告了在MobileWorld GUI-Only基准测试上的成功率。我们重点指出三个关键观察结果。(1) 基础设施驱动策略质量。ClawGUI-2B实现了17.1%的成功率,以6.0%的相对幅度超越了同规模的MAI-UI-2B基线,这直接验证了我们开源强化学习基础设施的有效性。两个模型共享相同的基础权重;性能提升完全源于ClawGUI-RL的可扩展环境管理和奖励设计。(2) 训练良好的小模型优于未经训练的大模型。ClawGUI-2B超越了规模大得多的端到端模型,包括Qwen3-VL-32B(11.9%)和UI-Venus-72B(16.4%),这表明通过真实环境交互进行在线强化学习训练对任务完成能力的贡献比模型规模本身更大。(3) 智能体框架仍属于独立体系。将专有前沿模型与专用接地模块相结合的方法取得了更高的绝对数值(例如,Gemini-3-Pro + UI-Ins-7B达到55.6%),但依赖于无法用于端到端优化的闭源规划器。这些系统与紧凑型训练智能体不具有直接可比性,代表了一种互补而非竞争的范式。综合来看,这些结果证实,精心设计的开源训练基础设施可以在适度的模型规模下释放强大的GUI智能体性能,显著缩小与更大系统之间的差距。
4.3 每一步都至关重要:密集奖励解锁更优的GUI策略
GRPO为整个回合分配一个单一的优势分数,这对于长周期GUI任务来说过于粗糙,因为在这些任务中,中间步骤的质量差异很大。轨迹中早期的误点击与决定性的最终动作获得相同的评分,这为优化器提供的信号很少,使其难以区分有效步骤与死胡同。
GiGPO 通过锚点状态分组来解决这一问题:遇到相同中间状态的步骤被聚类到子组中,每个步骤的优势值通过子组内的折扣回报归一化来估算。这样无需学习价值网络即可实现细粒度的步骤级信用分配,使其特别适合 GUI 交互的多步骤特性。
如表 2 所示,在 MobileWorld GUI-Only 任务上,将 GRPO 替换为 GiGPO 使 SR 提升了 2.6 个百分点(从 14.5% 提升至 17.1%),相对增益达 17.9%。这一持续改进表明,密集的步骤级监督比仅使用回合级奖励提供了更丰富的学习信号,而准确的信用分配是 GUI 智能体训练中的关键因素。
4.4 对基准进行基准测试:我们能相信已发表的 GUI 数据吗?
可复现性是取得有意义进展的前提,然而 GUI 评估以难以复现而著称。提示词顺序、坐标归一化约定、图像分辨率和采样温度等因素相互交织,在不同实现中可能导致报告准确率出现数个百分点的波动。因此,不同论文中的数据很少具有直接可比性,而社区也缺乏一个可靠的通用基线来衡量真正的进展。
ClawGUI-Eval 通过为每个模型固定所有评估选择,并在 6 个基准和 11 个以上模型上采用严格的三阶段“推理-评估-指标”流程来解决这一问题。表 3 报告了我们与官方已发表数据的复现结果。如果复现值达到或超过官方数据,或绝对差值在允许范围内,则认为结果已成功复现。
| 模型 | SS-Pro 官方 | SS-Pro 我们的 | SS-V2 官方 | SS-V2 我们的 | UIV 官方 | UIV 我们的 | MMB 官方 | MMB 我们的 | OSW-G 官方 | OSW-G 我们的 |
| 开源模型 | ||||||||||
| GUI-G2 | 47.50 | 47.75 | 93.30 | 93.32 | - | 25.99 | - | 79.33 | - | 58.63 |
| GUI-Owl 1.5-2B | 57.80 | 56.36 | 89.70 | 89.23 | - | 23.71 | 72.17 | 71.54 | 52.80 | 52.04 |
| GUI-Owl 1.5-4B | 66.80 | 66.16 | 93.20 | 92.53 | - | 29.97 | 83.24 | 82.94 | 63.70 | 62.34 |
| GUI-Owl 1.5-8B | 71.10 | 70.08 | 93.70 | 93.55 | - | 36.70 | 82.52 | 82.33 | 65.80 | 64.12 |
| Qwen3-VL-2B | 48.50 | 43.90 | - | 88.92 | - | 15.06 | - | 73.12 | - | 54.12 |
| Qwen3-VL-4B | 59.50 | 59.39 | - | 93.08 | - | 27.78 | - | 84.28 | - | 68.43 |
| Qwen3-VL-8B | 54.60 | 56.42 | - | 94.26 | - | 27.96 | - | 84.25 | - | 65.88 |
| Qwen2.5-VL-3B | - | 15.62 | - | 64.86 | - | 6.73 | - | 52.81 | - | 26.08 |
| Qwen2.5-VL-7B | - | 27.45 | - | 87.66 | - | 14.40 | - | 70.26 | - | 35.49 |
| UI-TARS 1.5-7B | 49.60 | 42.06 | - | 89.54 | - | 20.30 | - | 73.23 | - | 58.24 |
| UI-Venus-7B | 50.80 | 50.47 | 94.10 | 94.03 | 26.50 | 26.52 | - | 80.08 | 58.80 | 59.41 |
| UI-Venus 1.5-2B | 57.70 | 58.82 | 92.80 | 93.24 | 44.80 | 43.82 | 80.30 | 81.19 | 59.40 | 58.97 |
| UI-Venus 1.5-8B | 68.40 | 67.68 | 95.90 | 95.83 | 46.50 | 45.88 | 88.10 | 87.79 | 69.70 | 69.98 |
| MAI-UI-2B | 57.40 | 57.94 | 92.50 | 92.30 | 30.30 | 29.68 | 82.60 | 82.80 | 52.00 | 54.17 |
| MAI-UI-8B | 65.80 | 64.07 | 95.20 | 94.34 | 40.70 | 40.23 | 88.80 | 88.81 | 60.10 | 63.23 |
| StepGUI-4B | 60.00 | 59.14 | 93.60 | 91.98 | - | 29.90 | 84.00 | 83.03 | 66.90 | 65.69 |
| 闭源模型 | ||||||||||
| Gemini 3.0 Pro (Zoom) | 72.70 | 75.08 | - | - | - | - | - | - | - | - |
| Seed 1.8 (Zoom) | 73.10 | 72.80 | - | 95.68 | - | - | - | 88.4 | - | - |
| Gemini 3.1 Pro (Zoom) | - | 85.01 | - | - | - | - | - | - | - | - |
如表 3 所示,我们重点指出三个观察结果。首先,ClawGUI-Eval 实现了 95.8% 的整体复现率(48 个有官方基线的单元格中成功复现 46 个),其中开源模型在 ScreenSpot-Pro 上达到 95.7%,前沿模型达到 100%。其次,两个失败案例(Qwen3-VL-2B 和 UI-TARS 1.5-7B 在 SS-Pro 上)均涉及官方评估配置未公开的模型,这表明未公开的提示词或分辨率选择是该领域不可复现性的主要驱动因素。第三,对于标准推理不可行的闭源前沿模型,我们采用 Zoom 范式,这是一种两阶段裁剪后定位策略,对 Gemini 应用 25% 裁剪块,对 Seed 应用 50% 裁剪块,该方法在无需访问模型内部的情况下成功恢复了官方性能。
5 讨论
迈向统一的 GUI-CLI 智能体测试框架。
过去一年智能体工程领域(从 Claude Code [claudecode, anthropic_harness_design_2026]、Hermes Agent [hermes_agent] 到 MiniMax M2.7 的自我进化循环 [minimax_m27_news_2026])得出的核心经验是:前沿能力不仅来自模型本身,同样也来自其外围的“操控框架”。权限管道、工具调度、上下文压缩以及多轮恢复机制,决定了一个能力强大的模型是成为可靠的智能体,还是在几步之后陷入混乱 [anthropic_harness_design_2026]。然而,基于 CLI 的智能体 [openclaw, hermes_agent] 和基于 GUI 的智能体 [uitars2, uivenus15, maiui] 一直作为两个并行的生态系统发展,尽管用户目标重叠,却几乎没有共享基础设施。近期出现的混合系统,例如 Hermes Agent 的统一终端到安卓网关 [hermes_agent] 以及 MiniMax 的 shell-浏览器-MCP 工具链 [minimax_m27_news_2026],暗示了融合的趋势。我们将 ClawGUI 视为迈向共享操控框架标准的第一步,该标准将 CLI、GUI 和 API 调用视为可互换的操作,并直接从交互数据中学习路由策略本身。
将在线强化学习扩展到模拟器之外。
当前的 GUI 智能体强化学习训练几乎完全局限于模拟器沙盒 [mobileguirl, uitars2, uivenus15, mobileworld],这些沙盒与真实应用行为存在偏差,并且无法覆盖需要认证的商业应用长尾。目前出现了两个互补的方向。首先,由现代代码生成模型 [minimax_m27_news_2026, claudecode] 重建的模拟应用,提供了一种无需认证的分布,能够在不使用真实用户凭证的情况下模拟真实的交互流程。其次,采用隐私保护轨迹收集的设备端强化学习,可以在不集中数据的情况下,利用海量的真实用户交互。这两个方向都假设存在一个能够大规模处理环境不稳定性的基础设施,而这正是 ClawGUI-RL 旨在填补的角色。如今,扩展在线强化学习既是一个算法问题,也同样是一个系统问题。
迈向设备端、始终在线的系统智能体。
随着端侧推理变得切实可行,GUI 智能体的最终形态看起来越来越不像一个按需调用的远程服务,而更像一个在本地运行的持久化系统级智能体。近期的工作,例如 Hermes Agent 的安卓设备控制 [hermes_agent] 以及 Google 的 Gemma 4(一款高效的 2B 移动端优先模型 [google_gemma4_blog_2026]),共同表明,能力强大的智能体模型与无处不在的设备级部署正在走向融合。这样的智能体能够感知完整的设备状态,保留持久的个性化记忆,并在后台自主执行跨应用工作流。ClawGUI-Agent 的混合 CLI-GUI 控制与个性化记忆系统是这一模式的早期实例,但完整的愿景需要更紧密的操作系统集成、设备端策略训练,以及社区尚未建立的、严格的本地优先隐私保障。
GUI 环境的世界模型。
当今的 GUI 智能体以反应式方式运作:观察截图,预测动作,等待环境反馈。它们所缺乏的是一个关于屏幕将如何因候选动作而演变的内部模型,而这正是人类能够在执行前提前规划多个步骤的关键。近期在通用世界模型方面的进展 [zheng2026code2worldguiworldmodel, luo2025vimogenerativevisualgui, deepmind_genie3_blog_2025] 表明,将学习 UI 动态作为预测模型现在已变得可行,其训练信号来源于为模仿学习和强化学习而收集的相同屏幕-动作轨迹。一个针对 GUI 的世界模型将能够实现基于模型的规划、反事实推演以及早期死胡同检测,将多步交互从盲目的试错转变为有目的的搜索。我们认为 ClawGUI-RL 的密集步骤级轨迹日志记录是规模化训练此类模型的天然基础。
6 结论
我们提出了 ClawGUI,这是一个统一的开源框架,它将在线强化学习训练、标准化评估和真实设备部署整合到一个连贯的流程中,用于图形用户界面智能体的开发。ClawGUI-RL 提供了首个开源基础设施,经验证支持大规模并行虚拟环境和真实物理设备训练,将 GiGPO 与过程奖励模型相结合,以实现密集的步骤级奖励监督。ClawGUI-Eval 在 6 个基准测试和 11 个以上模型上建立了可复现的评估标准,对官方基线的复现率达到 95.8%。ClawGUI-Agent 闭环了从研究到部署的流程,通过 12 个以上的聊天平台和个性化记忆系统,实现了对 Android、HarmonyOS 和 iOS 的自然语言驱动自动化。在此流程中端到端训练的 ClawGUI-2B 在 MobileWorld SR 上达到了 17.1% 的成绩,相比同规模基线提升了 54% 的相对幅度,并超越了规模大得多的模型。我们希望 ClawGUI 能成为社区构建、评估和部署下一代图形用户界面智能体的基础。
参考文献
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org