PAGER:弥合点精确几何图形界面控制中的语义-执行鸿沟
PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control
研究针对需要点级精度的几何图形界面控制任务,揭示了现有视觉-语言模型存在的语义-执行鸿沟:通用模型动作类型准确率高但任务成功率极低。为此,我们构建了包含4,906个问题、超过22.4万次像素级动作的PAGE Bench基准,并提出了拓扑感知智能体PAGER。该智能体通过依赖结构规划与像素级执行分解任务,结合像素接地监督调优与精度对齐强化学习,将任务成功率提升至最强通用基线的4.1倍,步骤成功率从GUI专用智能体的不足9%提高到62%以上,实现了点精确GUI控制的新突破。
GUI agent一直绕着精确点击走,这篇直接硬碰硬,把成功率从6%拉到62%,做CAD自动化或工业软件的团队可以重点关注。
魏景轩
白曦
刘珊
贾才俊
孙峥
徐兴龙
李思远
孙林壮
于碧辉
何聪辉
谭程
tancheng@pjlab.org.cn
2026年5月15日
摘要
大型视觉语言模型显著推进了GUI智能体的发展,使其能够在网页、移动端和桌面端界面上执行可交互操作。然而,这些进展在很大程度上依赖于一种宽容的区域范式,即同一组件内许多邻近像素点仍被视为有效。精确的几何构建打破了这一假设:操作必须落在连续画布空间中的点上,而非宽容区域内。由于几何图元存在本体论上的依赖关系,一个局部坐标误差可能引发级联的拓扑故障,从而扭曲下游对象并使最终构建失效。我们将这种场景定义为精度敏感的GUI任务,它要求点级精度、几何感知验证,以及对依赖驱动错误传播的鲁棒性。为了对其进行基准测试,我们引入了PAGE Bench,包含4,906个问题以及超过22.4万个过程监督的像素级GUI操作。我们进一步提出了PAGER,一种拓扑感知的智能体,它将构建过程分解为依赖结构化的规划和像素级执行。基于像素的监督微调建立了可执行的操作语法,而精度对齐的强化学习则通过状态条件化的几何反馈来缓解因rollout导致的暴露偏差。实验揭示了一个显著的语义-执行鸿沟:通用多模态模型的动作类型准确率可超过88%,但任务成功率仍低于6%。PAGER弥合了这一鸿沟,在任务成功率上超越了评估过的最强通用基线,并将步骤成功率从GUI专用智能体的低于9%提升至超过62%,为点精确的GUI控制树立了新的最先进水平。
谭程,代码网站数据集
1 引言
现代 GUI 智能体正越来越多地将软件界面转化为视觉语言模型的动作空间。近期系统通过在网页、移动端、桌面端及更广泛的计算机使用环境中,将多模态指令与界面元素对齐,并将其组合成可执行工作流,从而实现了跨平台操作 [nguyen2025gui, chen2025guicourse, qin2025uitars, liu2026infiguiagent, zhao2025worldgui, yang2026probench, wang2026history]。然而,这一进展主要建立在一种区域容错交互范式之上:一个按钮、链接、输入框或菜单项,在附近多个点击位置下仍能保持正确响应。该范式支撑了当今大部分 GUI 自动化任务,但它留下了一个基本能力边界尚未解决:当目标位于连续视觉空间中的一个点,而非一个容错区域时,智能体是否仍能可靠运行?
我们通过精确几何构造来探究这一边界。给定一个几何问题,智能体必须在 GUI 画布上构造点、线段、直线、圆、多边形、标签及空间关系。如图 1 所示,这一设定不仅仅是 GUI 对齐的一个更困难实例;它将成功的判定标准从区域归属改变为小像素容差内的点级精度。更重要的是,几何操作具有依赖耦合性:一个位置错误的点会改变所有依赖它的直线、圆、交点、角度或多边形,因此局部坐标误差会像依赖雅可比矩阵下的扰动一样,在构造过程中传播。
我们将这一领域称为精度敏感的图形用户界面任务,在此类任务中,智能体必须超越区域级组件选择,迈向点级精确操控。这一领域处于图形用户界面智能体、几何推理与强化学习的交叉地带,但上述任一方向均未直接涵盖。图形用户界面智能体主要研究语义组件定位与工作流完成 [lian2025uiagile, lee2025reguide, zhou2025guig1, liao2025beyondclicking];几何推理方法聚焦于图表理解、辅助构造或符号空间中的形式有效性 [xu2025geosense, feng2025geobench, weng2025geosketch, wei2025geointr1];而基于强化学习的智能体通常优化离散的成功指标、里程碑或目标区域,而非连续的几何精度 [zhang2025r1vl, shi2025mobileguirl, xu2025mobilerl, lu2025uir1, xia2025guir1]。为将这一缺失的能力变为可度量,我们引入了 PAGE Bench,一个面向精确几何构造的精度感知几何图形用户界面基准。PAGE Bench 包含 4,906 道几何问题、53,277 个高层级构造任务以及 224,497 个低层级图形用户界面操作,其轨迹保留了问题陈述、有序子任务、画布状态、执行反馈及像素级几何标注。因此,其评估超越了最终的视觉相似性,能够衡量过程正确性、参数精度以及最终的几何有效性。
我们进一步提出了 PAGER,一个面向精度敏感型 GUI 任务的精度感知几何推理框架。PAGER 将绘图分解为依赖结构化的规划阶段和像素级执行阶段:规划器生成一个构造图,并产生一个拓扑有效的子任务执行顺序;而执行器则根据当前画布状态,将每个子任务落地为具体的 GUI 操作。基于像素的监督微调首先建立了可执行的动作语法和顺序绘图行为。由于这一模仿阶段采用了教师强制策略,推理时仍会面临暴露偏差:微小的偏差会使 rollout 偏离参考画布状态,并可能被下游的几何依赖关系放大。随后,精度对齐的强化学习对动作类型正确性、参数准确度以及渲染结果的几何有效性进行优化,直接针对精度敏感型绘图所暴露出的点级瓶颈。
实验表明,该任务暴露了现有智能体在结构上的不匹配。强大的通用多模态模型通常能理解预期操作,但无法维持有效构造所需的连续参数。消融实验进一步表明,基于像素的 SFT 提供了执行先验,参数准确度奖励驱动了连续空间控制,而结合动作类型奖励与参数奖励则能取得最强的任务级性能。
我们的主要贡献如下:
- •
我们识别并形式化了精度敏感型 GUI 任务,这是一类需要点级空间精度、连续画布操作、几何感知验证以及级联坐标误差缓解的 GUI 任务。
- •
我们引入了 PAGE Bench,据我们所知,这是首个用于评估 GUI 智能体在精确几何构造方面能力的基准,包含过程监督轨迹、像素级标注,以及过程级和最终结果级指标。
- •
我们提出了 PAGER,这是一个基于依赖结构的规划与像素级执行框架,通过像素级有监督微调与精度对齐的强化学习进行训练。实验表明,PAGER 在精确的几何 GUI 执行任务上显著优于通用视觉语言模型和 GUI 专用智能体。
2 相关工作
GUI 智能体
GUI 智能体研究将多模态指令映射为可在网页、移动端、桌面端以及更广泛的计算机使用环境中执行的操作。早期工作构建了感知-动作抽象:CogAgent [hong2024cogagent] 提升了高分辨率界面理解能力,而 CoCo-Agent [ma2024agent] 通过环境感知与条件分解来结构化移动端动作预测。近期系统如 UI-TARS [qin2025uitars] 和 GUI-Libra [yang2026guilibra] 则转向原生端到端执行,并引入推理感知的动作建模。另一条相关研究路线通过连续奖励优化、自进化强化学习、空间推理、测试时搜索以及难度感知的奖励修正 [lian2025uiagile, yuan2025segui, lee2025reguide, zhou2025guig1] 来提升定位精度与数据效率;这一方向也扩展到了点击之外的文本拖拽操作 [liao2025beyondclicking]。基准测试同样转向更真实、更注重过程的评估,涵盖任意状态桌面自动化、更广泛的计算机使用、工具使用以及浏览场景 [zhao2025worldgui, yang2026probench, mu2025gui360, fan2025mcptoolbenchpp, wei2025browsecomp]。尽管取得了这些进展,现有 GUI 智能体主要针对语义界面元素或容错区域,其成功取决于组件选择或工作流完成。而我们的工作则研究基于画布的精度敏感型 GUI 任务,这类任务的成功要求点级空间精度、几何有效性,并需要缓解由微小坐标偏差引发的级联错误传播。
几何推理
几何推理研究模型如何解读图表、识别原理,并从多模态输入中推导出数学上有效的解。诊断性基准分析在原理识别、原理应用、感知、规划、定理使用和反思方面的失败案例 [xu2025geosense, feng2025geobench]。后续评估将范围从平面几何扩展到三维场景、更大的基于图表的问题空间,以及视觉辅助的数学推理 [wang2025solidgeo, zhang2026geochallenge, ma2024visaidmath]。另一条研究路线通过验证性数据构建、形式化证明系统和形式语言驱动的合成,追求形式化与可靠数据 [fu2025trustgeogen, he2025matpbench, zhang2025geofm]。更新的方法通过引入辅助构造、几何变换、跨模态奖励、密集子目标监督和分阶段强化学习,使图表不再那么静态 [weng2025geosketch, guo2025geovlmath, chen2026milestones, wei2025geointr1]。尽管取得了这些进展,现有工作主要仍在符号空间中运作,其成功与否由识别、证明或形式化构造来定义。我们的工作通过将几何推理落地到像素空间的 GUI 操作中,弥合了符号有效性与物理执行之间的鸿沟,这些操作需要逻辑正确性、点级空间精度,并减轻级联误差传播。
3 方法论
3.1 预备知识
我们研究对精度敏感的几何 GUI 绘图,其中智能体在连续画布上构建目标图形。给定包含指令和目标图像的问题上下文,智能体从画布状态开始,并生成
| (1) |
其中 是绘图环境, 是操作类型, 是对象类型, 表示带类型的参数。
该任务在成功几何条件上与区域容错的 GUI 交互不同:
| (2) |
其中 是执行的像素位置, 是有效目标区域, 是参考点。几何绘图遵循点级准则,并表现出依赖耦合的误差传播:
| (3) |
其中 捕获了构造依赖关系,并将参数误差映射到画布扰动上。因此,微小的坐标偏差可能会影响后续对象。
3.2 PAGER:基于依赖结构的规划与执行
如图 2 所示,PAGER 将绘图过程分解为规划与执行两个阶段。规划模块生成一个构造图以及一个符合依赖关系的子任务列表:
| (4) |
其中包含图元或关系,编码依赖关系,是传递闭包。任务执行模块将每个子任务落地为 GUI 操作:
| (5) |
其中是子任务对应的操作数量,是操作历史,嵌套操作被展开为,并通过像素坐标、几何参数、视觉样式和标签位置来实例化步骤规范。
3.3 像素级监督微调
像素精确数据构建提供了包含子任务、截图、历史记录、下一步操作、执行反馈和空间标注的轨迹。对于可见窗口,几何坐标通过以下方式投影到像素上:
| (6) |
其中和分别是画布的宽度和高度。同样的投影将点、线、圆、弧、多边形和标签的锚点绑定到像素目标上。SFT 优化以下目标:
| (7) |
其中,是子任务的参考操作数量。SFT 学习可执行的操作语法和基于状态的操作预测,但教师强制使用参考截图,而推理则使用自生成截图。因此,公式 3 推动了基于精确度的展开训练。
3.4 精确度对齐的强化学习
RL 精确度优化使策略与操作类型正确性、参数准确性以及渲染后的几何有效性对齐。对于每个问题,规划模块生成,策略与环境交互产生长度为的展开轨迹和渲染后的构造结果。每个采样操作根据以下标准进行评分:
| (8) |
其中是参考构造结果,而、和分别是操作、对象和类型化参数空间。可接受集合由训练时的几何验证器构建,在推理时不使用。展开奖励为:
| (9) | ||||
对于操作类型匹配,会授予并激活参数准确度项。距离度量会惩罚对象不匹配和类型化参数错误,包括类型文本一致性、点击区域有效性以及绘制像素偏差;同时比较锚点、关系和布局。该策略以 SFT 策略作为 KL 锚点进行优化:
| (10) |
KL 项保留了可执行行为,而奖励项则针对公式 2 中的点级标准和公式 3 中的级联错误机制。
4 数据集
4.1 数据集构建
如图 3 所示,PAGE Bench 被构建为一个闭环执行流程,而非静态集合。整个流程将原始问题转换为 GeoGebra 中可执行的构建轨迹,并仅保留那些在执行和验证后仍然有效的实例。
问题收集与可执行性筛选。首先从公开的 K–12 多模态几何资源 [du2025mm] 中汇集候选池。由于许多原始题目支持符号求解但不支持基于 GUI 的构建,一个模型辅助筛选模块会选出那些解决方案可在 GeoGebra 中实现为有序构建的问题,随后通过人工验证剔除描述不充分、非构造性表述以及依赖关系无法在画布上操作的情况。此阶段产出的问题,其求解逻辑可落地为界面操作,而非自由形式的推导。
结构化任务生成与标准化。对于每个保留的问题,一个基于语言模型的创作模块会生成一个高级任务序列,该序列以函数加参数操作的有序列表形式呈现。随后,一个标准化模块会解析生成的结构,修正格式错误的任务字符串,并将输出规范化为一个标准任务列表及对齐的元数据。其结果是一种结构化的中间表示形式,它明确了预期的几何依赖关系和执行顺序。
执行映射与环境锚定的重建。接下来,标准化的任务列表会被映射到实时 GeoGebra 环境中的底层图形用户界面交互。每个抽象的构建步骤都被分解为一系列工具类别选择、工具选择以及参数化的画布操作,从而生成可执行的点击、绘制和输入操作。一个统一的交互层将结构化的构建意图转换为浏览器级别的操作,同时,坐标归一化、几何到像素的投影以及边界感知的重试机制,确保了在不同浏览器状态和画布外条件下的可执行性。通过这种方式,符号化的构建计划被重建为可重放的界面轨迹。
执行记录、执行后过滤与最终封装。在执行过程中,该框架会为每一步记录截图、当前任务、先前的操作、执行成功状态、执行日志以及下一步操作,连同已执行的操作及其参数。对于点击操作,记录器还会额外保存目标边界框、命中范围以及归一化坐标,为后续的精度分析提供所需的细粒度空间证据。执行完成后,一个基于语言模型的最终过滤模块会将记录的轨迹与渲染结果进行比较,并移除不一致的任务序列、执行失败的步骤以及几何上无效的构建。因此,保留的基准测试提供了带有细粒度空间来源的已验证构建轨迹,使得研究在精度敏感的图形用户界面任务中的点级精度和级联几何误差成为可能。
4.2 数据集分析
图 4 和表 1 总结了 PAGE Bench 的构成与过程规模。PAGE Bench 包含 4,906 道题目,采用 4,443/463 的训练/测试集划分,其中包括 2,049 道选择题和 2,857 道开放式题目。58.23% 的开放式题目占比强调了显式构建而非答案选择。其十类别多标签分类体系共产生 25,301 条标注,即每道题平均 5.16 个标签,这表明大多数实例结合了语言到工具的落地、物体构建、坐标建模、关系推理、多步规划以及辅助构建,而非孤立的单一技能。大部分题目来自 8–10+ 年级,中等级别或困难级别的案例占比达 94.11%,使该基准定位于面向构建且具有相当难度的推理领域。
| 语料库统计 | 过程统计 | ||||
|---|---|---|---|---|---|
| 统计项 | 数量 | 统计项 | 数量 | ||
| 题目总数 | 4,906 | 100.00% | 任务总数 | 53,277 | – |
| 训练集 / 测试集 | 4,443 / 463 | 90.56 / 9.44 | 平均每道题的任务数 | 10.86 | – |
| 选择题 | 2,049 | 41.77% | 动作总数 | 224,497 | – |
| 开放式题目 | 2,857 | 58.23% | 平均每道题的动作数 | 45.76 | – |
| 技能类别 | 10 | – | 点击动作 | 107,148 | 47.73% |
| 类别标签 | 25,301 | 5.16 / 每道题 | 绘制动作 | 90,486 | 40.31% |
| 8–10+ 年级 | 4,387 | 89.42% | 输入动作 | 26,863 | 11.97% |
| 中级 / 困难 | 2,940 / 1,677 | 94.11% | 点击+绘制 | 197,634 | 88.03% |
在过程方面,该语料库包含 53,277 个高层级任务和 224,497 个 GUI 动作,平均每道题有 10.86 个任务和 45.76 个动作。这种轨迹长度形成了有意义的依赖链,其中早期的执行错误可能会影响后续的物体。空间操作占主导地位:点击和绘制动作占所有动作的 88.03%,其中绘制直接要求对连续画布进行控制。
5 实验
5.1 实验设置
我们基于 Qwen3-VL-8B [bai2025qwen3] 训练 PAGER。在监督微调阶段,我们更新视觉编码器、多模态投影器和语言骨干网络,最大输入长度为 8,192 个 token,每设备批次大小为 1,梯度累积步数为 4,学习率,5% 预热,bfloat16 精度,并在 8 块 GPU 上使用 DeepSpeed ZeRO-2 训练 1 个 epoch。强化学习阶段紧随 SFT 之后,采用拒绝采样,每个提示词生成 8 个候选结果;保留结果方差较高的提示词,以将优化集中在不确定性较高的 rollout 上。所有阶段均使用 torchrun 在 8 块 NVIDIA A100 GPU 上实现。评估指标详见附录 F。
我们与开源 VLM 进行了对比,包括 Qwen3-VL-8B [bai2025qwen3]、DeepSeek-VL2 [wu2024deepseek]、GLM-4.5V [hong2025glm]、InternVL2.5-8B [zhu2025internvl3]、KimiVL-A3B [team2025kimi]、MiniCPM-V-2.6 [yao2024minicpm] 和 LLaVA-NeXT-8B [liu2024llavanext];闭源 VLM,包括 Claude-Sonnet-4.6 [Anthropic2026ClaudeSonnet4_6]、GPT-5.4 [OpenAI2026GPT5_4]、Qwen3.6-Plus [qwen3.6-35b-a3b] 和 Gemini-3.1-Pro [GoogleDeepMind2026Gemini3_1Pro];以及 GUI 专用智能体,包括 UI-TARS [qin2025ui]、OS-ATLAS [wu2024atlas]、InfiGUI-R1-3B [liu2025infigui]、GUI-Actor-7B [shakeel2026medspot] 和 OpenCUA-7B [wang2025opencua]。该基准测试集涵盖了通用多模态推理、专有视觉语言建模以及界面专用动作预测。
5.2 主要结果
| 模型 | 动作 | 参数量 | 步骤 | 任务 | O-Comp. | S-Comp. | S-Vis. | S-Geo. | 中间 | 最终 | 总体 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 开源 VLM | |||||||||||
| Qwen3-VL-8B [bai2025qwen3] | 52.03 | 9.48 | 9.38 | 0.25 | 3.09 | 3.83 | 3.69 | 3.05 | 8.18 | 3.42 | 5.80 |
| DeepSeek-VL2 [wu2024deepseek] | 26.33 | 1.75 | 1.53 | 0.00 | 18.25 | 8.46 | 3.70 | 12.40 | 3.11 | 11.23 | 7.17 |
| GLM-4.5V [hong2025glm] | 78.91 | 12.17 | 11.76 | 0.00 | 5.44 | 7.93 | 2.89 | 13.41 | 11.46 | 7.27 | 9.37 |
| InternVL2.5-8B [zhu2025internvl3] | 40.34 | 1.48 | 1.33 | 0.00 | 9.23 | 7.19 | 1.72 | 10.85 | 4.45 | 7.44 | 5.94 |
| KimiVL-A3B [team2025kimi] | 46.60 | 0.59 | 0.57 | 0.00 | 1.70 | 7.12 | 1.24 | 14.05 | 4.83 | 5.70 | 5.27 |
| MiniCPM-V-2.6-8B [yao2024minicpm] | 45.87 | 1.06 | 0.71 | 0.00 | 16.01 | 4.81 | 1.17 | 8.18 | 4.84 | 8.12 | 6.48 |
| LLaVA-NeXT-8B [liu2024llavanext] | 45.77 | 1.69 | 1.59 | 0.00 | 8.04 | 5.13 | 1.74 | 8.75 | 5.06 | 6.05 | 5.56 |
| 闭源视觉语言模型 | |||||||||||
| Claude-Sonnet-4.6 [Anthropic2026ClaudeSonnet4_6] | \cellcolor[rgb].851,.953,.99295.85 | 36.44 | 36.38 | 1.11 | 7.04 | 9.46 | 3.11 | 15.39 | 21.17 | 8.65 | 14.91 |
| GPT-5.4 [OpenAI2026GPT5_4] | 88.04 | 31.71 | 31.41 | 0.56 | 10.99 | 9.59 | 3.53 | 15.39 | 18.59 | 9.96 | 14.28 |
| Qwen3.6-Plus [qwen3.6-35b-a3b] | \cellcolor[rgb].851,.961,.83990.95 | 51.60 | 51.07 | 4.90 | 18.19 | 11.04 | 4.23 | 10.52 | 27.41 | 11.72 | 19.56 |
| Gemini-3.1-Pro [GoogleDeepMind2026Gemini3_1Pro] | 89.18 | \cellcolor[rgb].851,.953,.99266.68 | \cellcolor[rgb].851,.953,.99266.66 | \cellcolor[rgb].851,.961,.8395.82 | \cellcolor[rgb].851,.961,.83920.97 | \cellcolor[rgb].851,.961,.83914.17 | \cellcolor[rgb].851,.953,.9927.63 | \cellcolor[rgb].851,.953,.99221.21 | \cellcolor[rgb].851,.961,.83932.41 | \cellcolor[rgb].851,.961,.83916.31 | \cellcolor[rgb].851,.961,.83924.36 |
| 专用图形用户界面智能体 | |||||||||||
| UI-TARS [qin2025ui] | 47.08 | 8.79 | 8.38 | 0.00 | 7.06 | 5.26 | 3.78 | 5.21 | 7.26 | 5.49 | 6.38 |
| OS-ATLAS [wu2024atlas] | 51.24 | 9.19 | 8.80 | 0.29 | 14.56 | 6.65 | 4.32 | 6.36 | 7.98 | 8.50 | 8.24 |
| InfiGUI-R1-3B [liu2025infigui] | 44.81 | 16.51 | 16.18 | 0.00 | 18.23 | 9.66 | 4.14 | 13.82 | 9.37 | 11.96 | 10.66 |
| OpenCUA-7B [wang2025opencua] | 55.86 | 10.57 | 9.85 | 0.12 | 15.39 | 8.92 | 3.11 | 10.77 | 8.69 | 10.07 | 9.38 |
| GUI-Actor-7B [shakeel2026medspot] | 47.26 | 5.31 | 5.02 | 0.00 | 18.66 | 6.04 | 1.42 | 7.58 | 6.26 | 9.21 | 7.74 |
| PAGER | 82.62 | \cellcolor[rgb].851,.961,.83962.76 | \cellcolor[rgb].851,.961,.83962.20 | \cellcolor[rgb].851,.953,.99223.78 | \cellcolor[rgb].851,.953,.99228.88 | \cellcolor[rgb].851,.953,.99215.30 | \cellcolor[rgb].851,.961,.8397.05 | \cellcolor[rgb].851,.961,.83915.63 | \cellcolor[rgb].851,.953,.99241.25 | \cellcolor[rgb].851,.953,.99217.79 | \cellcolor[rgb].851,.953,.99229.52 |
表 2 显示,PAGER 取得了最佳总体得分 29.52,比最强的通用基线模型 Gemini-3.1-Pro 高出 5.15 分,即提升 21.1%。它还在任务、中间和最终得分上均获得最高分,表明其具备更强的完整展开执行能力和更好的最终几何质量。值得注意的是,这些提升是在 Gemini-3.1-Pro 在参数和步骤指标上领先的情况下取得的,这表明 PAGER 能更有效地将局部执行转化为任务层面的成功。这体现了更强的轨迹级稳定性,而不仅仅是更优的单步预测。
研究结果揭示了一个明显的语义-执行鸿沟。闭源视觉语言模型通常能选择正确的操作类型:Claude-Sonnet-4.6 的动作准确率达到 95.85,而 GPT-5.4 和 Gemini-3.1-Pro 分别达到 88.04 和 89.18。然而,它们的任务成功率分别仅为 1.11、0.56 和 5.82。相比之下,PAGER 的任务成功率达到 23.78,与 Gemini-3.1-Pro 相当。这表明,精确绘图的瓶颈不仅在于动作语义本身,还在于基于状态的参数控制以及依赖关系链中累积的误差。
与专用于图形用户界面的智能体相比,PAGER 进一步凸显了区域容错型 GUI 的局限性。UI-TARS 和 OS-ATLAS 的步骤成功率低于 9%,最强的 GUI 智能体基线也仅达到 16.18,而 PAGER 则达到了 62.20。这表明,对于几何构造任务而言,组件级别的 GUI 定位过于粗糙,因为决定有效性的不是区域,而是精确的点位。这些结果支持了本工作的核心动机:对精度敏感的几何图形 GUI 控制需要点级别的执行、几何感知的反馈以及对级联坐标误差的鲁棒性,而不仅仅是组件级别的定位。
5.3 消融实验
表 3 分析了所提出各组件的作用。PAGER-SFT 已经提供了强大的执行先验,达到了 48.47 的参数准确率、47.91 的步骤成功率和 20.47 的总体得分,这证实了像素级过程监督对于学习可执行绘图语法的价值。奖励消融实验表明,参数对齐是关键瓶颈。在没有参数准确率奖励的情况下,模型相比 SFT 几乎没有提升,总体得分甚至从 20.47 下降到 20.07,这表明当坐标、端点、半径或标签发生偏移时,仅靠动作层面的正确性无法保持几何结构。在没有动作类型奖励的情况下,模型仍然提升到了 24.52 的总体得分和 15.90 的任务成功率,这表明连续空间精度是有效构建的核心。完整的 PAGER 结合了两种奖励,在大多数指标上取得了最佳性能,总体得分从 SFT 的 20.47 提升到 29.52,任务成功率从 4.48 提升到 23.78。因此,这两种奖励是互补的:动作类型奖励稳定了语义执行顺序,而参数准确率奖励则改进了点级控制。它们的结合在动作选择、参数预测和最终几何有效性之间实现了最可靠的对齐。
| 模型 | 动作 | 参数 | 步骤 | 任务 | 整体构图 | 结构构图 | 结构可视化 | 结构几何 | 中间 | 最终 | 总体 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| PAGER-SFT | 75.14 | 48.47 | 47.91 | 4.48 | 27.70 | 11.24 | 5.69 | \cellcolor[rgb].851,.953,.99217.48 | 24.63 | 16.32 | 20.47 |
| PAGER 无参数准确率奖励 RL | 74.72 | 52.88 | 52.40 | 5.62 | 20.11 | 10.99 | 4.35 | 16.64 | 26.61 | 13.53 | 20.07 |
| PAGER 无动作类型奖励 RL | 78.77 | 59.14 | 58.70 | 15.90 | 22.67 | 11.54 | 4.33 | 14.22 | 35.07 | 13.97 | 24.52 |
| PAGER | \cellcolor[rgb].851,.953,.99282.62 | \cellcolor[rgb].851,.953,.99262.76 | \cellcolor[rgb].851,.953,.99262.20 | \cellcolor[rgb].851,.953,.99223.78 | \cellcolor[rgb].851,.953,.99228.88 | \cellcolor[rgb].851,.953,.99215.30 | \cellcolor[rgb].851,.953,.9927.05 | 15.63 | \cellcolor[rgb].851,.953,.992 \cellcolor[rgb].851,.953,.99241.25 | \cellcolor[rgb].851,.953,.99217.79 | \cellcolor[rgb].851,.953,.99229.52 |
5.4 案例研究与错误分析
图 5 展示了一个具有代表性的构图任务:在给定条件 和 下,绘制对角线相交于 点的矩形,并确定 。该示例要求精确的顶点定位、对角线构造,以及边、角和交点约束的保持。PAGER 构建了一个几何一致的矩形,具备有效的边关系和对角线中心交点,尽管存在微小的数值偏差。GPT-5.4 捕捉到了大致意图,但扭曲了四边形,引入了多余元素,并遗漏了一条关键对角线。Gemini-3.1-Pro 表现出更强的参数漂移:早期的顶点误差传播为无效的长线段,并破坏了矩形结构。这个案例表明,精确绘图中的失败往往源于不稳定的像素级参数和薄弱的约束保持能力,而非完全意义上的语义理解错误。因此,它支持了定量分析结果,即 PAGER 的过程监督和精度对齐优化在严格的几何约束下提高了执行可靠性。
5.5 与人类判断的一致性
图 6 展示了模型性能在空间上的清晰分离。大多数现有的多模态大语言模型(MLLM),包括 GPT-5.4 和 Gemini-3.1-Pro,聚集在左下区域,其自动评分和人类评分均较低。相比之下,PAGER 位于右上角,在取得高自动成功率的同时,也获得了更高的人类偏好。近乎完美的相关性 表明,我们的自动验证与专家判断之间高度对齐。尽管该任务对精度高度敏感,但我们指标的提升会单调地转化为人类感知的正确性,这证实了 PAGE Bench 捕捉到的是真实的几何有效性,而非代理信号。
![[Uncaptioned image]](/api/img-proxy?u=https%3A%2F%2Farxiv.org%2Fhtml%2F2605.15963v1%2Fx8.png&mode=full&exp=1790899200&sig=040d16845cf3cca7)
6 结论与局限性
我们引入了对精度敏感的图形用户界面(GUI)任务,在这类任务中,GUI 的成功标准从区域容忍的组件选择转变为连续视觉空间中的点级精确控制。精确的几何构造揭示了这一机制,因为依赖耦合的图元使得微小的坐标误差能够级联成无效的下游结构。PAGE Bench 通过过程监督、像素级几何交互使这种失败模式变得可测量,而 PAGER 则通过依赖结构化的规划和精度对齐的执行来解决这一问题。实验揭示了一个清晰的语义-执行鸿沟:现有智能体通常能识别正确的操作,但无法以几何所需的空间精度将其实现,而 PAGER 缩小了这一鸿沟,推动 GUI 智能体向在像素空间中忠实执行结构化意图迈进。本工作聚焦于 GeoGebra 风格的平面构造,因此其他对精度敏感的界面可能需要额外的动作语法、环境适配器和有效性规则。这一受控环境隔离了核心的语义-执行鸿沟,并提供了基于验证器的监督,而将相同原理扩展到更广泛的领域(如 CAD、图表编辑和科学可视化)则是一个自然的发展方向。
参考文献
附录 A 基于雷达图分析的性能结果
为了分析模型在精度敏感的 GUI 任务上的表现,我们在三个类别中评估了 PAGER 与十四个基线模型的对比,如图 7 所示。评估揭示了现有架构中存在一个关键的语义-执行鸿沟。最先进的闭源模型,如 Gemini-3.1-Pro 和 GPT-5.4,表现出强大的高层语义规划能力,其中间过程得分分别为 32.4 和 27.4。然而,它们的最终结果得分急剧下降,GPT-5.4 降至 11.8。这种陡峭的性能退化凸显出,先进通用模型缺乏防止依赖驱动型错误传播所需的细粒度连续空间推理能力。领先的开源权重架构,包括 Qwen3-VL-8B 和 InternVL2.5-8B,在雷达图中心附近聚集,反映出在所有指标上的系统性困境。同样,专为界面自动化设计的 GUI 专用智能体,如 UI-TARS 和 OS-ATLAS,表现出严重受限的性能。这些智能体主要在区域容忍范式上训练,无法适应需要严格像素级参数精度和几何感知验证的任务。我们提出的框架持续优于所有评估的基线模型。通过将构建过程分解为依赖结构化的规划和像素级执行,PAGER 取得了最高的中间过程得分 41.3。此外,它有效弥合了语义-执行鸿沟,取得了领先的最终结果得分 17.8 和总体得分 29.5。这些结果实证验证了我们的精度对齐强化学习流程成功保持了空间精度,并抵抗了级联拓扑故障。
附录 B 细粒度分类结果分析
为了进一步探究现有模型在精度敏感的 GUI 任务上的具体瓶颈,我们将评估分解为十种不同的几何能力。图 8 展示了这些维度上的性能分布,凸显了不同架构在处理连续空间推理和本体依赖关系时存在的严重差异。
自然语言到几何工具的映射以及基础几何对象构建等能力,是成功绘图的基本前提。我们提出的 PAGER 在这些领域取得了最佳性能,得分分别为 61.12 和 59.52。像 Gemini-3.1-Pro 和 Qwen3.6-Plus 这样的强闭源模型也展现出了合理的能力。这表明,对于先进的视觉语言模型而言,将基本语义指令与特定绘图工具关联起来仍然相对可控,这与它们在语义解析方面的既有优势相符。
当评估转向多步依赖与顺序规划能力,并结合几何关系与结构约束时,基线模型的性能急剧下降。GPT-5.4 在顺序规划上仅得 34.68 分,而像 Qwen3-VL-8B 这样的开源权重模型得分则低于 23 分。这种性能退化从实证角度验证了我们关于依赖耦合操作的假设。早期步骤中的微小坐标偏差会累积成级联式的拓扑结构失败,这是标准区域容错智能体无法解决的。通过将构建过程显式分解为依赖结构化的规划和像素级执行,PAGER 成功保留了这些结构约束,并保持了 55.04 的顺序规划得分。
最显著的能力差距出现在复杂场景中,具体包括辅助元素与隐式对象引入、多对象复合管理以及真实场景几何建模。这些类别需要抽象空间推理和严格的几何感知验证。像 UI-TARS 和 OS-ATLAS 这类专用于 GUI 的智能体在这些领域几乎完全失效,得分持续接近 10 分。相反,PAGER 在这些具有挑战性的领域中展现出强大的适应性。经过精度对齐的强化学习阶段有效缓解了 rollout 引发的暴露偏差,使我们的智能体在处理隐式辅助构造和复杂多对象依赖关系时,远比现有的通用多模态范式更加可靠。
附录 C GeoGebra 筛选提示词
附录 D GeoGebra 自动化提示词
附录 E 数据集质量保证提示词
附录 F 评估指标
为了全面评估模型的几何生成推理能力,我们设计了一个四阶段评估协议,涵盖动作执行的中间过程、最终几何结果、分层分析以及统一的总体得分。
F.1 中间过程指标(基于规则)
为了衡量智能体生成的逐步动作序列的质量,我们定义了四个细粒度的基于规则的指标,这些指标直接从预测的动作日志与真实标注的对比中计算得出。
设预测的动作序列为 ,真实序列为 ,其中每一步为 。
动作类型准确率(AA, Action)衡量每个步骤预测动作类别的正确性:
| (11) |
参数准确率(PA, Param)评估每个预测动作的参数是否正确。对于类型动作,要求字符串相等(不区分大小写)。对于点击动作,预测坐标必须落在标注的边界框内:
| (12) |
对于绘制动作,正确性由屏幕上像素的欧几里得距离是否在 5 像素容差范围内决定:
| (13) |
每个步骤的正确性指标汇总如下:
| (14) |
步骤成功率(SSR, Step)要求每个步骤的动作类型和参数同时正确:
| (15) |
任务成功率(TSR, Task)是每个任务的二元指标,要求所有步骤同时成功,并在所有任务中取平均:
| (16) |
其中 是任务总数。
所有四个指标首先在每个任务内计算,然后在每个评估 ID 内的任务间取平均,最后在所有 ID 上取宏平均,得到模型级别的分数。中间过程分数(MPS, Middle)随后作为加权组合计算:
| (17) |
权重反映了难度的层级:任务级成功是最严格的标准,因此贡献最大,而动作类型准确率则作为较低层级的合理性检查。
F.2 最终结果指标
我们从两个互补的角度评估模型最终几何输出的质量。
客观任务完成分数(OTC, O-Comp.)
给定真实的 GeoGebra 构造 和模型的构造 ,其中 表示带有坐标的标记点集合, 表示构造命令列表,我们计算一个几何相似度分数。对于每个模型点 ,我们找到其最接近的真实匹配点,并通过指数核函数定义一个连续的点匹配贡献:
| (18) |
其中是归一化坐标容差。对于指令序列,我们通过点对应映射来翻译每个模型指令的输入,并检查其与真实指令集的特征匹配情况:
| (19) |
任务完成分数综合了这两个组成部分,其中几何结构的权重高于点放置:
| (20) |
基于视觉语言模型的整体评分。
为了捕捉那些难以用纯符号化评估衡量的方面——例如视觉渲染保真度、标签可读性和跨模态一致性——我们采用 Gemini-2.5-Pro 作为自动评估器。给定任务描述、真实 JSON 构建数据、模型 JSON 数据、真实渲染图像和模型渲染图像,视觉语言模型在两个评估视角下输出分数。
在数据逻辑视角和视觉呈现视角下,模型独立对三个维度进行评分:
- •
任务完成度(TC,S-Comp.):任务列表中定义的所有几何元素是否在输出中呈现且可识别。
- •
视觉相似度(VS,S-Vis.):相对于真实图像的像素级渲染保真度,包括线条粗细、颜色、标签位置和坐标缩放。
- •
几何逻辑(GL,S-Geo.):几何关系(如垂直、相切和中点)的数学正确性,包括检测视觉"模型幻觉"——即图像看似正确但底层坐标在逻辑上不一致的情况。
一个综合的整体视角将数据逻辑视角和视觉呈现视角的分数整合为一组最终分数,其中每个维度是其两个视角对应分数的平均值。
最终结果分数(FRS,Final)是基于规则和基于视觉语言模型的分数加权组合:
| (21) |
F.3 总体分数
为了便于用单一标量进行模型比较,我们将总体分数(OS,Overall)定义为模型过程分数和最终结果分数的等权平均值:
| (22) |
因此,总体分数在动作序列的过程正确性与最终几何输出的质量之间取得平衡,为所有被评估模型提供统一的排名。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org