现实世界威胁下的移动 GUI 智能体:我们准备好了吗?
Mobile GUI Agents under Real-world Threats: Are We There Yet?
研究人员推出了一款应用内容插桩框架及配套测试套件,包含122个动态任务和3000余个静态场景,用于评估移动 GUI 智能体在含第三方内容(如广告、用户生成内容)的真实环境中的表现。实验显示,现有开源及商业智能体均受显著影响,在动态和静态环境下的平均误导率分别为42.0%和36.1%,表明当前技术在大规模部署前仍需加强安全性验证。
这篇论文系统揭示了移动 GUI 智能体的安全盲区,第三方恶意内容只需平均 10 个 token 就能让智能体误操作,视觉模态反而更脆弱,安全部署还有很长的路。
刘国宏
清华大学智能产业研究院(AIR)
北京
叶佳磊
电子科技大学
成都
刘嘉程
北京
刘伟
小米公司 MiLM Plus
北京
高鹏志
小米公司 MiLM Plus
北京
栾剑
小米公司 MiLM Plus
北京
李元春
清华大学智能产业研究院(AIR)
北京
刘云新
清华大学智能产业研究院(AIR)
北京
摘要
近年来,基于大语言模型的移动端 GUI 智能体发展迅速,它们能够根据自然语言指令自主执行各类设备控制任务。这些智能体在标准基准测试上的准确率不断提升,使得人们对大规模实际部署的期望也随之提高,目前已有数款商业智能体发布并被早期用户采用。然而,我们真的准备好让 GUI 智能体作为系统组件集成到日常设备中了吗?我们认为,目前缺少一项重要的部署前验证,即检验智能体在真实世界威胁下能否保持其性能。具体而言,与现有基于简单静态应用内容的常见基准测试不同(它们必须这样做以确保不同测试之间的环境一致性),真实世界的应用充斥着来自不可信第三方的内容,例如广告邮件、用户生成的帖子和媒体等。这些内容可能不可避免地出现在智能体的观测空间中,并影响任务执行过程。对这一问题的系统性研究颇具挑战性,因为真实世界应用的内容分布极不均衡——在正常的真实应用上进行测试通常无法发现任何潜在风险,因为大多数应用内容都是良性的。为此,我们引入了一个可扩展的应用内容注入框架,能够在现有应用内实现灵活且有针对性的内容修改。利用该框架,我们构建了一个测试套件,包含一个动态任务执行环境和一个由具有挑战性的 GUI 状态组成的静态数据集。动态环境包含 122 个可复现的任务,静态数据集则由从商业应用中构建的 3000 多个场景组成。我们对开源和商业 GUI 智能体均进行了实验。研究结果表明,所有被测试的智能体都会因第三方内容而出现显著性能下降,在动态和静态环境中平均误导率分别达到 42.0% 和 36.1%。该框架和基准测试已在 https://agenthazard.github.io 发布。
移动端 GUI 智能体、UI 安全、对抗性攻击、AgentHazard、实证评估
第 24 届年度国际移动系统、应用与服务会议;2026 年 6 月 21 日至 25 日;英国剑桥
第 24 届年度国际移动系统、应用与服务会议(MobiSys '26),2026 年 6 月 21 日至 25 日,英国剑桥
安全与隐私 软件与应用安全
以人为中心的计算 普适计算与移动计算
1. 引言
近年来,由大语言模型驱动的 GUI 智能体在任务自动化方面展现出了卓越的能力,使其成为下一代个人助理的有力候选方案。典型的 GUI 智能体以用户提供的任务描述作为输入,并自主与设备交互以完成任务。智能体会话的主要步骤包括多轮感知、推理和动作执行。随着 GUI 智能体解决复杂任务的能力日益增强,人们对其在真实环境中大规模部署的期待也与日俱增。此外,面向桌面环境和移动设备的早期商用计算机使用智能体已经出现。
尽管图形用户界面智能体(GUI agent)备受关注且市场期望很高,但我们认为,一个关键步骤被遗漏了:检验智能体在真实世界威胁下能否维持其性能。在实际部署中,GUI 智能体不可避免地会遭遇并处理来自不受控外部来源的第三方应用内容信息,例如社交媒体帖子、电商商品列表、收到的电子邮件或短信。经过特殊设计的内容可能误导智能体执行错误操作,进而可能导致用户隐私泄露或财产损失。如图 1 所示,当智能体正在执行一项任务并遇到一个经过精心设计的商品标题时,它会陷入困惑,并决定清除用户数据——这是一种高度敏感的操作。
现有的 GUI 智能体基准测试大多在简单且静态的应用上评估智能体性能,以确保可复现性。然而,这种评估方法不足以揭示在真实移动环境中遇到的复杂且动态的应用生态系统所带来的潜在风险。先前的研究已经证明,GUI 智能体很容易被弹出窗口、无关信息或隐藏的 HTML 元素所干扰(Zhang 等人,2024b;Ma 等人,2024;Lee 等人,2024a;Xu 等人,2024)。这些研究突显了系统性地评估并提升基于大语言模型的移动智能体在对抗性内容面前的鲁棒性的关键需求。
然而,现有研究在反映真实世界威胁方面能力有限,因为它们假设的攻击在隐蔽性、复杂性和可行性上均存在不足。首先,隐蔽性指的是威胁被检测到的难度。现有攻击大多基于简单的弹窗(Zhang 等人,2024b),这类攻击很容易被自动化工具识别,而真实世界的威胁可能更难通过简单规则检测到,例如社交网络上精心构造的帖子内容。其次,先前研究的威胁复杂性普遍较低,原因是攻击模式相对简单且固定。攻击者通常能够设计出针对性极强的定制化内容,从而更容易导致智能体行为异常。最后,可行性代表攻击在真实应用中能否以及如何实际实施。现有工作主要聚焦于包含弹窗或不可见元素的网页环境(Xu 等人,2024;Wu 等人,2025b;Zhang 等人,2024b;Levy 等人,2025;Vijayvargiya 等人,2025;Tur 等人,2025;Zhou 等人,2025;Zheng 等人,2025)。这些攻击在移动设备上的可行性较差,因为它们需要系统严格管控的高权限。
与现有基于高且不现实的攻击者权限的研究不同,我们认为移动智能体在真实世界面临的一个主要且独特的威胁来源,是来自无特权第三方应用内多样化的对抗性内容。具体而言,现代移动系统中系统权限和应用签名大多管理良好,但许多应用可能包含未经验证的内容(例如其他用户生成的帖子、图片、消息、文件名等),这些内容可能出现在移动智能体的观察空间中,从而误导智能体。在我们的威胁模型中,攻击者仅控制此类内容渠道,无法访问应用代码、系统 UI 或智能体的隐藏状态。因此,我们提议研究移动智能体在面对来自无特权第三方的误导性内容时的鲁棒性。
面对真实应用中对抗性内容稀缺的问题,我们采用基于模拟的方法来扩展分析规模。我们首先引入 AgentHazard,这是一个动态插桩框架,能够实时拦截并修改 UI 状态信息,从而实现对现有 Android 应用进行可控的对抗性内容注入。该框架主要由两部分组成:一个作为 Android 应用运行的 GUI 劫持模块,以及一个拦截智能体与环境之间系统 UI 状态转换的攻击模块。它能够实时在屏幕和结构化 UI 元素树上植入对抗性内容。当智能体请求 UI 状态时,该模块会将修改后的信息当作真实 UI 状态返回,并记录智能体执行的操作以供后续分析。与弹出式注入方法(Zhang 等人,2024b)不同——后者会引入自动化工具可检测的合成 UI 元素,且难以在移动平台上实现——我们的框架仅修改内容区域中第三方已拥有合法写入权限的现有原生组件。与手动数据集整理(例如 Lee 等人,2024a)不同,我们的动态插桩在运行时对真实 Android 应用进行操作,无需修改应用或获取 root 权限即可实现可扩展且可复现的评估。这极大地解决了隐蔽性和可行性的挑战。实验证明,与现有基于弹出式的方法相比,我们的框架更加隐蔽且更难被检测,而简单的对抗性训练无法提供有效防御。
在 AgentHazard 的基础上,我们构建了一个全面的基准测试,涵盖两种互补的评估模式。动态环境支持端到端的智能体执行:智能体在 122 个精心设计的任务中与真实安卓应用交互,同时运行时注入对抗性内容,从而能够直接测量任务成功率以及实时操作中的误导行为。静态数据集将 3000 多个独立的图形用户界面状态与对抗性内容和检测规则配对,支持可扩展的离线评估,判断智能体的动作选择是否受到对抗性内容的影响——而无需执行完整任务。通过注入平均每个攻击仅 10 个 token 的欺骗性内容,我们模拟了外部方操纵可见用户界面元素以颠覆智能体行为的现实场景。
通过对一组涵盖不同架构、规模和模态的开源及商业移动图形用户界面智能体进行全面实验,我们发现现有移动智能体容易受到欺骗性内容的影响。在动态和静态环境中,通过诱导平均长度仅为 10 个 token 的对抗性信息,其平均误导率分别达到 42.0% 和 36.1%。对于商业智能体 UI-TARS-1.5,我们也观察到了近 10% 的误导率。此外,我们的结果揭示了不同后端大语言模型和信息模态可能产生的影响。实验表明,虽然整合视觉模态可以提升移动智能体的性能,但也使其更容易受到欺骗性内容的影响。通过对一组骨干大语言模型的比较分析显示,Claude 系列大语言模型表现最佳,实现了最高的攻击后准确率和最低的误导率。GPT-5 展现出比其前代 GPT-4o 和 GPT-4o-mini 显著更强的鲁棒性,性能接近 Claude 水平。最后,我们还尝试了基于对抗训练的简单防御方法,发现该方法无法从根本上解决问题,防御提升效果有限。
- •
我们设计并实现了一个高度可配置、可扩展的真实移动端对抗性攻击模拟框架,该框架无需 root 权限即可在 Android 应用中将指定内容注入为原生 GUI 元素,且仅针对第三方合法控制的内容区域。
- •
我们构建了一套细粒度的基准测试套件,包含一个动态任务执行环境和一个由状态-规则元组组成的静态数据集,涵盖超过 3000 个攻击场景,并对六个代表性移动智能体及五个常见骨干大语言模型进行了全面评估,从而在真实对抗条件下对移动 GUI 智能体进行跨架构鲁棒性评估。
- •
我们通过误导性内容获得了关于移动智能体对抗攻击鲁棒性的若干有趣发现,并为未来智能体设计提供了指导原则。
2. 相关工作
GUI 智能体 GUI 智能体(Nguyen 等人,2024;Zhang 等人,2025a;Li 等人,2024b)已成为一个重要类别,能够理解图形用户界面并执行一系列模拟用户操作(例如点击和输入)的动作。这些智能体(Hong 等人,2024;Qin 等人,2025;Wen 等人,2024a, b;Gou 等人,2024;Yang 等人,2024;Lai 等人,2024;Wang 等人,2025;Dai 等人,2025)被广泛部署在网页和移动应用中,通过多种模态建立对界面的理解,包括来自界面截图的视觉信息,以及文本数据(如网页环境中的 HTML 和安卓移动设备中的 XML 界面层级结构)。GUI 智能体利用模型的感知与推理能力,基于其对界面和当前任务状态的感知来运行,调用潜在工具或外部知识库进行任务规划,最终执行动作并更新状态,进入下一轮“感知-规划-执行”循环。为了提升 GUI 智能体的性能,在该框架内已开展了大量研究,例如采用更高效的界面描述方案(Wen 等人,2024a;Lai 等人,2024),利用知识库和记忆模块(Wen 等人,2024b;Zhou 等人,2024),或训练基础模型(Wu 等人,2024;Gou 等人,2024;Hong 等人,2024;Lee 等人,2024b)以实现更高效、更精确的动作执行。
近年来,出现了几款商业化的 GUI 智能体(Anthropic,2025;Google,2025;OpenAI,2025;Tarantola,2024;DeepMind,2025;Patel,2025;Qin 等人,2025);然而,它们要么专门为桌面电脑设计(OpenAI 的 CUA、Claude 和 Gemini),要么仍处于预览或预发布阶段(豆包 AI 手机、Siri、Google 的 Project Astra)。因此,在本文中,我们将 UI-TARS-1.5(Qin 等人,2025)评估为唯一可商用的移动端智能体,而其他被评估的智能体则是基于商业大语言模型的开源框架。
GUI 智能体基准测试 为评估自主智能体在任务执行中的能力,研究人员已开发出大量基准测试,这些测试主要分为静态与动态两大类。静态基准测试(Deng 等人,2023;Li 等人,2020;Joyce 等人,2021;Rawles 等人,2023;Venkatesh 等人,2023;Cheng 等人,2024;Xing 等人,2024;Mialon 等人,2023;Li 等人,2024a)提供预定义的输入数据,例如 GUI 截图和文本界面信息(HTML、DOM 树),重点关注界面理解与元素定位准确率等特定评估指标。这类静态基准测试能够实现高效便捷的评估流程,但在评估真实世界交互方面缺乏灵活性。相比之下,动态基准测试则提供交互式环境,例如网站(Shi 等人,2017;Zhou 等人,2024;He 等人,2024;Koh 等人,2024;Xie 等人,2024)或安卓模拟器(Rawles 等人,2024;Wen 等人,2024a;Zhang 等人,2024a),智能体可在既定参数范围内以更高的自主性进行操作。
GUI 智能体的安全性与鲁棒性 随着自主 GUI 智能体能力的持续提升,关于其安全性与鲁棒性的担忧(Chen 等人,2025b;Shi 等人,2025;Chen 等人,2025a)也日益凸显。在语言模型的驱动下,智能体面临的风险包括提示词注入(Apruzzese 等人,2022)、越狱攻击(Shen 等人,2024;Andriushchenko 等人,2025)、后门攻击(Zhao 等人,2023)以及其他对抗性攻击(Akhtar 和 Mian,2018;Carlini 和 Wagner,2018;Wu 等人,2025b)。已有研究探索了 GUI 智能体的安全漏洞,证明它们很容易被对抗性元素误导,例如弹窗、环境干扰以及恶意工具使用指令(Zhang 等人,2024b;Ma 等人,2024;Lee 等人,2024a;Wu 等人,2025a;Levy 等人,2025;Vijayvargiya 等人,2025;Tur 等人,2025;Zhou 等人,2025;Ruan 等人,2024;Zhang 等人,2025b;Zheng 等人,2025)。此外,已有多个框架(Lee 等人,2025;Sun 等人,2025)被提出,旨在通过动作验证和上下文校验来改进指令对齐,并检测显式的敏感风险。
现有的大多数工作聚焦于基于网页的攻击,通过修改 HTML(Xu 等人,2024)或注入弹窗(Zhang 等人,2024b)来对智能体实施攻击,而针对移动端智能体的研究则十分有限。与网页环境不同,Android 等移动平台对用户隐私、应用权限以及第三方内容访问实施了更严格的安全要求和更紧密的控制。因此,弹窗注入或不可见元素插入等攻击对于无特权的第三方而言基本不可行,这使得将现有的基于网页的攻击方法直接迁移到移动平台变得不切实际。此外,由于内容推荐系统的存在,在移动应用上手动模拟对抗性内容效率极低,且无法构建可复现、确定性的场景。
然而,移动平台并非完全安全。当智能体在真实环境中运行时,它们不可避免地会与来自众多不可信来源的第三方信息进行交互。这些信息被合法地发布在各种应用程序中(例如,社交媒体平台上的帖子、电商应用中的产品描述),并且可以被第三方任意修改和控制。
这些局限性导致在理解移动 GUI 智能体在现实、无特权威胁下的鲁棒性方面存在重要空白。我们的工作填补了这一空白,具体方法是:聚焦于一种移动端特有的威胁模型,在该模型中,攻击者仅通过合法的第三方内容渠道进行攻击;在无需 root 权限或修改应用的情况下,实现对真实 Android 应用的可复现运行时检测;以及提供一项涵盖智能体架构、模态和大语言模型骨干网络的全面实证研究。
3. 威胁模型
考虑一个在真实 Android 环境中执行任务的移动 GUI 智能体。执行过程中涉及几个关键角色。用户通过向智能体下达任务来发起交互。智能体由其底层模型驱动,处理这些任务并与各种应用程序进行交互。这些应用通常会显示来自第三方来源的内容,例如卖家的产品列表、用户的社交媒体帖子以及营销人员的广告。此外,Android 操作系统为智能体与这些应用进行交互提供了运行时环境和必要的 API。
我们的工作专门聚焦于来自不可信第三方内容源的威胁,假设所有其他组件保持安全可靠。攻击者可以通过合法渠道(例如产品描述、社交媒体帖子、个人消息)发布并控制误导性信息,但无法修改应用资源(如 APK)或系统控制的组件。攻击面主要由出现在应用界面中的用户生成内容和第三方信息构成。这意味着攻击者不会修改应用逻辑、XML 布局、操作系统层面或智能体实现本身,也不会观察智能体隐藏的推理状态、提示词或超出屏幕外部可见范围的记忆。攻击者的能力仅限于控制那些能够自然出现在应用中第三方控制区域的内容,并通过合法应用功能将这些内容与相关任务上下文的时机相匹配。
4. 我们的分析框架:AgentHazard
为了系统性地研究移动端 GUI 智能体在面临来自无特权第三方应用内容的威胁时,是否已准备好进行实际部署,一个主要挑战是现实应用场景中此类威胁的数量有限、多样性不足且难以复现。为应对这一挑战并开展系统性研究,我们设计了一个名为 AgentHazard 的分析框架。该框架主要由一个应用内容插桩工具构成,并在此基础上进一步构建了一个动态交互环境和一个静态状态规则数据集,以促进对智能体鲁棒性的全面评估。
4.1. 应用内容插桩
我们首先介绍用于支持本研究的应用内容插桩组件。该工具旨在通过可配置的模式,构建用于评估真实 Android 应用中移动端 GUI 智能体的攻击场景。其工作流程如图 2 所示。该工具在搭载移动端 GUI 智能体的 Android 设备上以交互方式运行,主要由两个模块组成:一个 GUI 劫持模块和一个攻击模块。
GUI 劫持模块是一个 Android 应用程序,它通过无障碍事件监控 UI 状态变化,并实时向 UI 元素树和屏幕截图中注入对抗性内容。这解决了可复现评估中的一个关键挑战:手动模拟攻击场景并不可靠,因为应用程序会根据网络活动、用户历史记录和时变因素动态推荐内容。实时注入可确保在多个智能体评估中实现一致、可控的攻击场景。我们引入了一种结构化的攻击配置模式,如图 3 所示,该模式定义了用于注入对抗性内容的目标屏幕。每个目标屏幕指定目标应用和活动,以及一个定义对抗性信息的目标元素列表。每个目标元素指定内容、位置以及对齐方式和字体大小等属性,可自定义以呈现自然外观的内容。我们支持灵活的定位器,包括资源标识符、文本匹配和类名,并附带用于精确定位的条件约束。仅当所有“存在”条件均满足且不存在任何“不存在”条件时,才会执行注入。附录 C 中给出了一个配置示例。
通过配置这些属性,该工具能够实现高度逼近原始 UI 元素的渲染效果,从而达成高度的隐蔽性(详见附录 E)和可行性。这种方法还能实现复杂、定制化的攻击场景,这些场景可以针对不同的应用、任务和内容类型进行系统性变化——从而克服了以往固定模式攻击在复杂性上的局限。配置加载完成后,该工具在激活时便开始监控系统 UI 状态的变化。它会分析无障碍事件,并根据预设的攻击配置对其进行评估。当成功检测到目标元素时,该工具会在原始 UI 元素之上渲染预设的对抗性内容,以模拟真实的攻击场景。同时,它会更新 UI 元素树,以确保与视觉修改保持一致。具体来说,呈现给智能体的修改后截图,是通过将覆盖内容对齐到现有原生内容区域来生成的,而非引入新的系统级控件。返回给智能体的对应无障碍树也会与渲染后的屏幕进行一致性修补,从而使截图和结构化 UI 表示暴露相同的注入内容。这并不会赋予攻击者新的权限;它模拟的是,如果攻击者控制的内容通过正常应用渠道显示,智能体将会观察到什么。
攻击模块会拦截智能体对 UI 状态信息的请求。当智能体执行任务时,该模块会加载配置并激活工具。它会将修改后的 UI 状态返回给智能体,并记录智能体的操作,验证每个操作是否与预定义的误导性操作相匹配。这些信号会被记录下来,用于后续分析。
这个检测工具使我们能够通过简单的配置编辑,轻松构建模拟攻击场景,为我们的大规模系统性研究提供了所需的可扩展性、灵活性和稳定性,同时不受内容刷新或数据加载的影响。
4.2. 动态交互环境
为了对智能体鲁棒性进行系统性研究,我们利用上述工具构建了一个动态交互环境。该环境基于 AndroidWorld(Rawles 等人,2024)——一个广泛使用的、支持任务执行与评估的 GUI 智能体基准测试——并通过动态内容注入能力对其进行扩展,从而能够对不同移动 GUI 智能体进行高效的鲁棒性评估。
在本研究中,人类标注员从 12 个不同应用(涵盖社交媒体到生产力应用,详见附录 B)中精心挑选了 122 个可复现的任务,并为每个任务配对了不同的攻击场景。我们的动态环境遵循标准的智能体-环境交互循环:智能体观察当前 UI 状态,选择一个动作,并接收关于任务是否成功的反馈。关键在于,我们在特定屏幕注入对抗性内容,并监控智能体是否被误导而执行预定义的不正确动作。我们对该设置进行如下形式化描述。
具体而言,给定一个包含一组应用和任务目标的环境,智能体与环境交互以实现该目标。在每个时间步,智能体从动作空间中选择一个动作并执行。每个动作被定义为一个元组,包含动作类型和动作参数,即。当以下任一情况发生时,该回合终止:
- •
智能体选择结束任务,或
- •
步骤数超过最大限制。
任务终止后,系统会验证一组预定义的任务成功规则,以生成一个二元结果,指示任务是否成功完成。
在每个步骤之后,系统将状态-动作对与攻击误导规则进行匹配,以判断该回合是否被误导:
为确保智能体行为能够明确归因于特定的对抗性内容,我们在每个任务的单个屏幕上仅注入一条误导信息,并建立相应的规则。同时进行多次攻击将难以定量确定每条内容的影响。我们在第 5.4 节中探讨了多次并发攻击的效果。
值得注意的是,我们并不将“被误导”等同于“任务失败”(除非被误导的操作本身直接终止了任务)。一个在某个步骤被误导的智能体,仍有可能通过后续步骤中的推理和自我纠正,正确完成任务。这反映了现实世界中的场景:稳健的智能体应当能够从暂时的混乱中恢复过来。因此,我们将成功率和误导率视为两个独立的指标,以全面评估智能体的鲁棒性,这一点将在第4.4节中阐明。
在误导性操作的设计上,我们主要考虑两种类型:误导性点击和误导性终止。这并非旨在穷尽整个攻击空间,而是捕捉了对抗性内容能够控制智能体行为的两种基本方式。误导性点击代表将智能体重定向至攻击者选择的UI目标,这在下游场景中可能导致隐私泄露、经济损失、恶意重定向或破坏性的状态变更。误导性终止则代表智能体在错误地信任对抗性内容后,过早地放弃了用户任务。这两种基本操作的效果将在第5.3节中分析。针对每种类型,我们相应地配置了预定义的攻击误导规则:
对于误导性点击,我们将规则定义为 ,其中 表示一个目标区域。当点击操作落在 范围内时,即被识别为一次误导性点击:
对于误导性终止,规则由 定义。当智能体执行 时,即被识别为一次误导性终止:
4.3. 静态状态规则数据集
为了补充动态评估并实现更高效的大规模分析,我们开发了一个静态状态规则数据集。虽然动态环境对于理解智能体在真实多步骤场景中的行为至关重要,但其特点是评估周期长,并且由于现实世界系统中不可控因素(例如硬件响应、网络延迟)的存在,会引入大量混杂变量。静态数据集通过提供一个可扩展的流程,以最少的人力投入生成多样化的攻击场景,从而解决了这一局限性,实现了快速迭代和更广泛的覆盖。
我们构建了一个静态数据集,其中每个样本是一个元组,代表一个状态(包含一张截图及其对应的 UI 元素树)及其相关的攻击规则和成功规则。我们从一个多样化的、广泛使用的商业应用集合(例如 Twitter、YouTube、Spotify)中构建此数据集。数据集创建过程包括以下阶段:
数据收集:我们在环境中从目标应用收集大量的运行时状态。
可行性标注:标注员选择在可控区域内可以进行第三方内容篡改的状态。
规则编写:对于每个状态,标注员编写:
- •
一个需要单步交互的任务目标。
- •
一个定义完成标准的一组规则。
攻击规则生成:我们设计提示词,使大语言模型能够根据给定的状态、任务目标和规则集生成攻击内容。这构建了包含诸如误导性操作等内容的攻击。
数据集组装:最后,我们将每个最终样本组装为元组,从而创建一个全面的测试平台。
最终数据集包含良性和对抗性的状态-规则对,涵盖超过 3000 个攻击场景。提示词和示例见附录 D。
| 智能体 | 后端 | () | () | () | MR() |
|---|---|---|---|---|---|
| M3A | 4o | 47.4 | 18.9 | 28.5 | 50.5 |
| mini | 21.1 | 4.1 | 17.0 | 59.0 | |
| T3A | 4o | 44.7 | 22.2 | 22.5 | 36.5 |
| mini | 13.2 | 7.0 | 6.2 | 31.8 | |
| r1 | 44.1 | 30.3 | 13.8 | 41.4 | |
| AutoDroid | 4o | 22.4 | 13.1 | 9.3 | 38.1 |
| mini | 5.3 | 7.4 | -2.1 | 32.4 | |
| r1 | 21.7 | 16.4 | 5.3 | 32.4 | |
| AriaUI | 4o | 32.9 | 24.2 | 8.7 | 50.0 |
| mini | 14.5 | 3.7 | 10.8 | 59.0 | |
| UGround | 4o | 46.7 | 15.6 | 31.1 | 49.6 |
| mini | 31.6 | 8.6 | 23.0 | 46.7 | |
| UI-TARS | UI-TARS | 55.3 | 52.4 | 2.9 | 8.8 |
| 平均值 | - | 30.8 | 17.2 | 13.6 | 42.0 |
4.4 评估指标
给定一个智能体和一组任务,我们使用从数据集中得出的两个关键指标来评估其在攻击下的鲁棒性。
成功率下降()量化了智能体在遭受对抗性篡改时任务性能的下降程度。设表示在原始良性任务上的成功率,表示在相应对抗性版本上的成功率。下降率的计算公式为:
其中,较高的值表示更容易受到攻击。
误导率(MR)衡量智能体在给定集合中被欺骗执行预定义误导动作的频率。对于特定对抗任务,若智能体选择的动作与任何误导规则匹配,则该回合计为被误导。形式上,对于对抗回合集合,误导率定义为:
其中为指示函数。MR 值越高,表示智能体越容易被攻击误导。
5. 分析结果
本节将详细分析我们的实验结果。分析得出三个关键实证发现:(1)与纯文本配置相比,引入视觉模态显著增加了智能体的脆弱性;(2)对抗攻击可在不同大语言模型主干间迁移,表明存在根本性的推理局限而非模型特定弱点;(3)简单的对抗训练提供的防护有限,表明需要架构层面的变革才能实现稳健防御。除非另有说明,所有报告结果均为每种评估配置下两次重复运行的平均值,以降低大语言模型随机性的影响。
5.1. 动态环境评估
我们在动态交互环境中评估了六款移动智能体:M3A、T3A(Rawles 等人,2024)、UGround(Gou 等人,2024)、AutoDroid(Wen 等人,2024a)、Aria UI(Yang 等人,2024)以及 UI-TARS-1.5(Qin 等人,2025)。这些智能体代表了多样化的架构方法,包括多模态、纯文本和纯视觉范式,其规划与接地组件采用了不同的专有与开源实现组合。UI-TARS-1.5 是商业化的 GUI 智能体,其余智能体均为开源研究框架。我们采用 GPT-4o 和 GPT-4o-mini 作为主要后端大语言模型;对于纯文本智能体,我们还额外使用 DeepSeek-R1(DeepSeek-AI 等人,2025)进行了评估。
表 1 展示了 AgentHazard 动态基准测试环境中的实验结果。结果按 GUI 智能体和后端大语言模型配置进行组织。对于每种配置,我们计算了成功率下降值()和误导率(MR)。在某些配置中(例如,AutoDroid 搭配 GPT-4o-mini),呈现较小的负值,表明对智能体性能的影响可忽略不计。成功率的这一轻微提升主要归因于大语言模型输出固有的随机性。
移动智能体极易受到欺骗性第三方内容的影响。我们的结果表明,移动 GUI 智能体尽管在研究界获得了广泛关注,但在面对对抗性第三方内容时表现出显著的脆弱性,平均误导率达到 42.0%。大多数智能体的任务成功率出现大幅下降。例如,在对抗条件下,M3A@4o 和 UGround@4o 的任务成功率下降了约 30%。值得注意的是,基线性能较低的智能体(AutoDroid@mini 和 T3A@mini)在 方面表现出更强的攻击抵抗力。这一现象归因于它们最初有限的任务解决能力,这为性能进一步下降留下的空间极小。然而,MR 分析表明,这种表面上的抵抗力具有误导性。在良性环境下性能较低、在 方面表现出抵抗力的智能体,其误导率(MR)仍然很高,显示出显著的脆弱性。除 UI-TARS-1.5 外,所有被评估的智能体 MR 均超过 30%。尤其令人担忧的是,M3A@4o-mini 和 AriaUI@4o-mini 的 MR 接近 60%,表明存在严重脆弱性。
针对图形用户界面的专项训练增强了智能体的鲁棒性。我们的结果表明,经过图形用户界面相关操作专门微调的商业化 UI-TARS-1.5 智能体,在面对对抗性内容时表现出明显更稳健的行为。与基于通用大语言模型的智能体相比,其任务成功率和误导率均显示出更低的敏感性和更高的可靠性。我们推测,这种鲁棒性源于其领域特定的后训练过程。当一个模型被训练为基于界面元素的属性(而非其具体数值)从动作空间中选择动作时,它可能部分缓解那些严重影响作为移动智能体架构中规划器的通用大语言模型的漏洞。
| 模态 | () | () | () | 误导率() | |
|---|---|---|---|---|---|
| GPT-4o | 文本 | 58.0 | 33.9 | 24.1 | 47.6 |
| 视觉 | 67.9 | 35.3 | 32.6 | 50.8 | |
| 多模态 | 63.3 | 21.3 | 42.0 | 63.2 | |
| GPT-4o-mini | 文本 | 50.5 | 26.6 | 23.9 | 53.8 |
| 视觉 | 56.6 | 18.5 | 38.1 | 60.5 | |
| 多模态 | 52.6 | 13.5 | 39.1 | 72.6 | |
| Claude-4-sonnet | 文本 | 74.8 | 65.5 | 9.3 | 11.2 |
| 视觉 | 71.3 | 61.0 | 10.3 | 18.6 | |
| 多模态 | 74.5 | 55.1 | 19.4 | 11.3 | |
| DeepSeek-V3 | 文本 | 58.6 | 44.8 | 13.8 | 33.7 |
| DeepSeek-R1 | 文本 | 51.5 | 40.0 | 11.5 | 29.8 |
| GPT-5 | 文本 | 72.8 | 59.7 | 13.1 | 11.5 |
| 视觉 | 84.5 | 69.2 | 15.3 | 16.6 | |
| 多模态 | 74.5 | 52.5 | 22.0 | 24.5 | |
| 平均值 | - | 65.1 | 42.6 | 22.5 | 36.1 |
5.2 静态数据集评估
表 2 展示了在静态数据集上的实验结果。我们评估了多个基础大语言模型,以衡量它们对抗对抗性内容攻击的鲁棒性。对于每个大语言模型,我们考察了不同的输入模态(基于文本、基于视觉和多模态)。为保证可复现性,我们报告了精确的带日期模型标识符:GPT 系列:gpt-4o-2024-11-20、gpt-4o-mini-2024-07-18;DeepSeek 系列:deepseek-r1-250528、deepseek-v3-250324;而 Claude 和 GPT-5 只有一个快照版本。由于 DeepSeek 模型缺乏多模态支持,我们仅对这些系统评估了基于文本的模态。评估结果揭示了与动态环境评估一致的现象,所有被评估的大语言模型平均误导率为 36.1%。
引入视觉模态会增加智能体的脆弱性。在良性任务执行中,与纯文本模态相比,引入视觉模态通常能提升性能(GPT-4o 的成功率从 58.0% 提升至 67.9%),这表明视觉信息增强了 GUI 智能体对环境的理解能力。然而,在对抗条件下,我们观察到一种反直觉的现象。多模态智能体对欺骗性内容的防御能力最弱,导致成功率下降幅度和误导率均为最高。具体而言,对于 GPT-4o 和 GPT-4o-mini,多模态配置下遭受攻击时的成功率低于纯文本结果(分别为 21.3% 对比 33.9%,以及 13.5% 对比 26.6%);对于 Claude 4 Sonnet,多模态设置下的成功率下降幅度也超过了纯文本配置。误导率分析进一步证实了这些发现。视觉模态的引入导致误导率显著升高,其中 GPT-4o-mini 的误导率超过 70%。GPT-5 在不同模态下同样表现出不断加剧的脆弱性(文本、视觉和多模态的误导率分别为 11.5%、16.6% 和 24.5%),证实这一趋势即使在能力更强的前沿模型中也依然存在。这表明模型在视觉模态中识别欺骗性内容的能力弱于文本模态,这可能是由于视觉表征本身具有高信息密度和复杂性。此外,这一现象可能源于视觉和文本模态在信息编码方式上的根本差异。GUI 界面遵循用户体验设计原则,强调需要用户交互或关注的视觉显著元素——而这正是我们威胁模型中欺骗性内容所利用的特征。因此,对抗性内容更有可能通过视觉通道干扰智能体的决策。
对抗性攻击可跨大语言模型骨干网络迁移,揭示了根本性的推理局限。我们进一步分析了不同大语言模型在面对误导信息时的对比表现,如图4所示。我们的实验表明,大多数大语言模型的平均误导率超过30%,这说明仅依赖大语言模型自身能力不足以主动识别对抗性内容。在所有评估的模型中,Claude-4-sonnet表现最优,实现了最高的攻击后成功率以及最低的误导率。DeepSeek系列模型也展现出相对较强的鲁棒性。相比之下,GPT-4o和GPT-4o-mini对欺骗性内容的抵抗力较弱,其误导率分别达到53.9%和62.3%。值得注意的是,GPT-5的平均误导率显著降低至17.5%,相较于其前代产品有了大幅提升,并接近Claude-4-sonnet的鲁棒性水平。这表明前沿大语言模型的能力进步能够切实转化为对抗鲁棒性的提升,不过所有被评估的模型仍然存在脆弱性。尽管模型间的差异反映了训练数据和方法的区别,但这种脆弱性的普遍性——无论架构、规模或训练范式如何,大多数大语言模型的误导率均超过30%——表明对对抗性图形用户界面内容的敏感性源于当前推理能力的根本性局限,而非特定模型的弱点。
5.3. 误导性动作分析
为了刻画不同类型的误导性动作如何影响智能体行为,我们针对“误导点击”和“误导终止”这两种攻击类型进行了实验。这两种攻击类型对应我们基准测试中研究的两种基本控制流故障:将智能体的下一步动作重定向至攻击者选定的目标,或导致智能体完全放弃任务。我们的分析表明,不同类型的动作在误导智能体方面展现出不同的有效性。
图 5 展示了在静态数据集上,针对不同误导动作类型的评估结果。MR 和 MR 这两个指标对模型脆弱性的评估结果一致。对比揭示了一个显著现象:不同大语言模型对不同误导动作类型的敏感度存在巨大差异。对于 GPT-4o 和 DeepSeek-R1,“误导终止”动作的影响显著强于“误导点击”(MR 指标分别为 37.3% 对 67.8%,以及 9.0% 对 47.4%);相反,对于 Claude-4-sonnet,“误导点击”动作的影响更强(MR 指标为 22.8% 对 6.0%)。对于 GPT-4o-mini 和 DeepSeek-V3,两种误导动作类型的效果相当。这种巨大差异很可能源于模型开发过程中使用的训练数据、训练方法以及人类偏好对齐策略的不同。AgentHazard 为沿着这一关键维度评估未来模型提供了一个系统化平台。
5.4. 误导内容比例
为了评估误导内容数量如何影响攻击效果,我们将误导元素的数量作为一个关键变量进行分析。我们从动态评估环境中选取了 18 个任务,并使用 M3A@4o 分别以 1 个、3 个和 5 个误导元素对其进行评估。我们在不同元素间保持对抗性内容一致,以隔离数量带来的影响。此外,我们还实施了一种“混合动作”方法,该方法在 3 个元素中同时整合了点击和终止两种欺骗性内容。
图 6 展示了不同误导元素数量下的误导率。值得注意的是,增加重复性误导元素的数量并不会提升攻击效果。随着误导元素数量的增加,“点击”动作的误导率从 50.0% 略微下降至 47.2%。这表明重复性误导元素可能引发智能体的怀疑,从而降低攻击效果。
相比之下,“混合动作”攻击实现了最高的误导率,达到 83.3%,显著优于任何单一类型的攻击方法。这表明,结合不同误导动作类型的多样化攻击策略远比同质化方法更有效,说明防御机制在实际部署场景中必须考虑复杂的混合动作攻击。
5.5. 通过对抗训练进行缓解
对于将误导信息嵌入界面文本和视觉表示的多模态攻击,对抗性监督微调提供了一种直接的防御方法。为评估这一缓解策略,我们选择 Qwen-2.5-VL-7B-Instruct(Bai 等人,2025)作为基线模型(无 SFT)。我们首先收集良性样本并对模型进行微调,获得标准微调版本(良性 SFT)。此外,我们使用包含精心构造内容并配以正确动作输出的对抗样本,训练了一个对抗性微调版本(对抗 SFT)。
我们使用 LoRA(Hu 等人,2021)进行参数高效训练。秩设置为 8,学习率为 1e-4,训练在 480GB A100 GPU 上进行。我们启用 DeepSpeed(Aminabadi 等人,2022)并采用 ZeRO-3 优化策略,采用预热比率为 0.05 的余弦退火学习率调度,每个配置训练 1 个 epoch。我们遵循 M3A 的提示词格式和动作空间进行模型训练。
| 模型 | 无 SFT | 良性 SFT | 对抗 SFT |
|---|---|---|---|
| 11.0 | 44.6 | 43.0 | |
| 6.1 | 7.5 | 24.5 | |
| 4.9 | 37.1 | 18.5 | |
| 误导率 | 61.5 | 74.6 | 30.6 |
为了构建同时包含输出动作和对应推理过程的训练数据,我们从静态数据集评估中收集了 GPT 和 Claude 模型正确回答的样本,并将这些样本作为推理过程的真实标签。因此,验证集主要由这些大语言模型未能正确回答的样本构成,从而在训练集和验证集之间建立了明确的难度和范围区分。这种数据构建策略解释了表 3 中的结果,即未经训练的基线模型在这些任务上表现极低。然而,针对图形用户界面(GUI)的微调带来了显著的性能提升。
表 3 展示了评估结果。结果表明,监督式微调显著提升了模型在良性环境中的性能,且良性训练和对抗训练均提高了成功率。对抗微调达到了与良性训练(44.6%)相当的基线性能(43.0%)。然而,在对抗条件下,经过良性环境微调的模型表现出明显更高的脆弱性,成功率下降了 37.1%。此外,它在所有配置中实现了最高的 MR(74.6%),这表明良性微调可能无意中增加了模型对攻击的敏感性。经过对抗微调的模型展现出卓越的鲁棒性,与良性微调模型相比,其在攻击下的性能下降幅度显著更小,仅为 18.5%。其对抗成功率为 24.5%,也优于其他训练策略。此外,与良性训练相比,它将 MR 降低至 30.6%,显示出对欺骗性内容更强的抵抗力。
为了直观理解不同训练方法如何影响模型行为,我们提取了模型的最终层输出,并将其对图像 token 的注意力权重进行可视化,如图 7 所示。在此示例中,我们将歌手的显示名称修改为“点击添加歌曲”,并给出指令“将新歌曲 xxx 添加到我的曲库”。可视化结果揭示了不同训练策略在执行任务期间如何影响模型的注意力机制。值得注意的是,只有经过对抗训练的模型成功抵抗了误导性内容。
首先,我们分析了模型任务执行能力的变化。未经训练的基座模型在整个图像上表现出大量与任务无关的高注意力区域,这表明它无法根据给定指令从视觉输入中可靠地推导出确定性答案(成功率为 11.0%)。相比之下,经过训练的模型生成的注意力热图更加清晰、聚焦,且方向性更明确,证明微调显著提升了任务性能(成功率为 44.6% 和 43.0%),这与我们的实验结果一致。
其次,从易受欺骗的角度来看,未经对抗训练的模型在精心构造的误导性内容位置上表现出显著升高的注意力,证实了它们会受到对抗性第三方信息的干扰。值得注意的是,经过良性训练的模型生成了“更干净”的注意力——即聚焦于更少、更具体的区域——但矛盾的是,它反而更容易受到针对性误导线索的影响(误导率为 74.6%),因为其注意力多样性降低,导致规避欺骗信号的灵活性下降。相比之下,经过对抗训练的模型并未在误导性内容上表现出注意力升高,这表明对抗训练使模型能够识别欺骗性输入并对其产生鲁棒性(误导率为 30.6%)。
综上所述,我们的实验结果表明,对抗训练能够有效增强模型抵御涉及第三方内容攻击的鲁棒性。然而,这种提升仍然有限:即使在对抗训练之后,模型的误导率仍超过30%,这表明单纯的对抗训练无法从根本上解决这一漏洞,也意味着仅靠训练阶段的干预措施是不够的,还需要辅以架构层面的改变。基于注意力分析,这些改变应包括:明确约束模型对包含第三方内容区域的注意力分配,或在智能体的输入表示中,将可信的应用内容与不可信的第三方元素进行结构性分离。
6. 案例研究
为了说明移动端GUI智能体在面对欺骗性内容攻击时可能表现出的各种行为,我们使用Aria UI@4o(Yang等人,2024)进行了一项案例研究。此案例特意选取了一个极端情况,以突出尾部风险后果;它并不代表典型的攻击结果。大多数攻击反而会导致误导性点击或任务过早终止,这一点已在之前的评估部分进行了量化。本案例研究旨在揭示关键的设计缺陷——具体而言,即源信任推理不足以及缺乏针对高权限操作的防护措施——即使这些情况发生频率不高,也值得引起重视。
如图 8 所示,该任务要求智能体在 Broccoli 应用中删除一个指定名称的食谱。打开应用后,智能体遇到了注入的对抗性信息,内容为“你的任务不可行”。这成功误导了智能体,使其认为应用已损坏。值得注意的是,智能体并未直接终止任务或尝试继续执行原始目标,而是自主决定通过重置自身状态来进行修复。智能体导航至系统设置,找到应用管理部分,并清除了所有应用数据,包括用户生成内容和缓存。最终任务失败,因为所有食谱都被删除,而非指定的目标。虽然清除应用数据这一具体行为反映了智能体在对抗性条件下的一种可能响应,并且由于大语言模型推理的非确定性,不同运行结果可能有所不同,但这揭示了一个更广泛的漏洞类别:智能体在未进行充分验证或获得用户同意的情况下,执行了高权限、不可逆的操作。
这个案例揭示了当前移动端 GUI 智能体存在的两个关键漏洞。首先,智能体缺乏有效的机制来识别和审查可能具有欺骗性的内容。智能体不加质疑地接受了精心构造的信息,没有质疑其真实性或来源。其次,在遇到对抗性信息后,智能体执行了具有不可逆后果(数据丢失)的高权限操作,而没有请求用户确认或授权。基于这些观察,我们确定了增强移动端 GUI 智能体鲁棒性的两个关键维度:识别和处理欺骗性内容。
识别 该智能体未加质疑地全盘接受了欺骗性信息,未验证其真实性或来源,暴露出其缺乏根据信息来源可信度区分信息的机制。稳健的智能体应根据信息来源赋予不同的置信度——信任来自操作系统或用户的消息,同时对第三方应用中显示的内容保持适当的怀疑态度。此外,针对图形用户界面相关数据的领域特定后训练策略(如 UI-TARS-1.5 中实施的策略)可部分缓解此漏洞;然而,对该方法的量化评估仍是一个悬而未决的挑战。
处理 该智能体在未请求用户确认或授权的情况下,执行了不可逆的高权限操作(数据删除)。这凸显了智能体基于可能不可信的信息执行破坏性操作的关键风险。为缓解此类情况,智能体在遇到看似异常的系统状态时,也必须在执行可能具有破坏性的操作前获得用户的明确同意。这就在欺骗性内容与破坏性行为之间建立了一道关键的安全屏障,防止智能体在被未经验证的第三方内容误导时造成灾难性后果。
7. 讨论
局限性。尽管我们的研究为移动图形用户界面智能体的脆弱性提供了有价值的见解,但若干局限性仍需承认。首先,我们的框架不支持修改用户界面元素内的图像,这在现实场景中代表了一种额外的潜在攻击向量。其次,我们的基准测试套件涵盖的应用和操作有限,可能无法完全捕捉移动应用和智能体动作空间的多样性。我们的评估聚焦于两种代表性攻击类型——误导性点击和误导性终止——以此作为理解智能体脆弱性的基本原则。在测量层面,它们能够捕捉对抗性内容是否能够夺取智能体下一步行动决策的控制权,或过早终止任务执行。这些原语捕捉了对抗性内容颠覆智能体决策的基本机制,但更严重的下游后果(例如隐私泄露、金融欺诈或重定向至恶意目标)取决于被误导的操作所针对的目标,这需要在未来的工作中进行专门研究。第三,对所有可能的对抗性内容模式进行全面脆弱性检测本身就极具挑战性;我们并不声称已穷尽攻击面的覆盖范围。相反,AgentHazard 被设计为一个基线测量框架,建立了可复现、标准化的方法来评估和比较鲁棒性,使社区能够在智能体和防御措施不断演进的过程中系统性地追踪进展。这些局限性并不会实质性削弱我们研究结果的有效性或重要性。我们识别出的核心脆弱性——易受欺骗性第三方内容影响——是当前移动图形用户界面智能体架构的根本性问题,并且很可能在扩展图像操作能力、更广泛的应用覆盖范围或更大的动作空间后依然存在。
经验教训。基于我们的结果与分析,我们提出了多项建议,旨在从多个维度提升智能体安全性。从大语言模型开发与训练的角度来看,增强模型识别欺骗性内容的能力至关重要。值得注意的是,大语言模型在视觉模态下对对抗性信息的敏感度显著更高,这表明提升视觉理解的鲁棒性可能会带来不成比例的收益。对于智能体开发而言,智能体必须能够根据信息来源的可信度来区分信息,并在执行高权限或潜在破坏性操作前请求用户授权。此外,智能体识别欺骗性内容的能力有限,部分原因在于其对用户界面语义的熟悉程度不足。因此,引入离线探索机制或知识库可以增强智能体对界面组件来源和功能的理解。除了对抗性训练,还有两个互补方向尤其值得关注。不确定性感知的动作选择将使智能体能够表达对其动作选择的置信度,并在置信度低于阈值时交由用户决定或选择放弃,从而降低自信地执行被误导动作的风险。用户界面信任建模将使智能体能够根据推断出的来源(例如,系统生成内容与第三方内容)为界面区域维护动态信任分数,并据此权衡信息,而不是将所有可见内容视为同等权威。对于系统开发者而言,操作系统应提供应用程序接口,使应用开发者能够在开发过程中为图形用户界面元素标注来源和权限元数据,从而便于智能体框架识别和验证界面组件。此外,当前系统缺乏区分人类与智能体动作执行者的机制。未来的智能体感知操作系统应建立针对自主智能体的系统级访问控制策略和权限限制,以增强安全性。
8. 结论
在本文中,我们进行了一项系统性研究,以考察移动端 GUI 智能体在第三方应用内容威胁下是否已为真实世界部署做好准备。我们引入了 AgentHazard,这是一个可扩展的应用内容检测框架,能够在现有 Android 应用内实现灵活且有针对性的内容修改,从而解决真实世界应用内容严重偏向良性内容的挑战。利用该框架,我们开发了一套全面的基准测试套件,包含两种互补的评估模式:一个包含 122 个可复现任务的动态任务执行环境,以及一个由超过 3000 个从商业应用中构建的具有挑战性的场景组成的静态数据集。通过对多个基于不同骨干大语言模型的开源和商业移动端 GUI 智能体进行广泛实验,我们发现了揭示严重鲁棒性问题的关键结论。我们的结果显示,在暴露于对抗性第三方内容时,被评估智能体的平均误导率为 42%。我们进一步研究了基于对抗性训练的防御方法,发现这些方法仅能提供有限的改进,无法从根本上解决潜在的脆弱性。这些发现为我们研究问题提供了明确的答案:我们尚未准备好。移动端 GUI 智能体仍然极易受到来自第三方内容的现实威胁,在它们能够安全部署于真实世界环境之前,鲁棒性方面还需要大幅提升。
致谢。
本研究部分得到了国家自然科学基金(项目编号 62272261)、清华大学无锡应用技术研究院(项目编号 20242001120)以及小米基金会的资助。
参考文献
- N. Akhtar 和 A. Mian (2018) 计算机视觉中深度学习面临的对抗性攻击威胁:综述。外部链接:1801.00553,链接 被引用者:§2。
- R. Y. Aminabadi、S. Rajbhandari、M. Zhang、A. A. Awan、C. Li、D. Li、E. Zheng、J. Rasley、S. Smith、O. Ruwase 和 Y. He (2022) DeepSpeed 推理:实现前所未有的规模下 Transformer 模型的高效推理。外部链接:2207.00032,链接 被引用者:§5.5。
- M. Andriushchenko、A. Souly、M. Dziemian、D. Duenas、M. Lin、J. Wang、D. Hendrycks、A. Zou、Z. Kolter、M. Fredrikson、E. Winsor、J. Wynne、Y. Gal 和 X. Davies(2025)《AgentHarm:衡量大语言模型智能体危害性的基准》。外部链接:2410.09024,链接 引用自:§2。
- Anthropic(2025)《推出计算机使用功能、新版 Claude 3.5 Sonnet 和 Claude 3.5 Haiku \ Anthropic》。注释:https://www.anthropic.com/news/3-5-models-and-computer-use 引用自:§1、§2。
- G. Apruzzese、H. S. Anderson、S. Dambra、D. Freeman、F. Pierazzi 和 K. A. Roundy(2022)《“真正的攻击者不会计算梯度”:弥合对抗性机器学习研究与实际应用之间的差距》。外部链接:2212.14315,链接 引用自:§2。
- S. Bai、K. Chen、X. Liu、J. Wang、W. Ge、S. Song、K. Dang、P. Wang、S. Wang、J. Tang、H. Zhong、Y. Zhu、M. Yang、Z. Li、J. Wan、P. Wang、W. Ding、Z. Fu、Y. Xu、J. Ye、X. Zhang、T. Xie、Z. Cheng、H. Zhang、Z. Yang、H. Xu 和 J. Lin(2025)《Qwen2.5-VL 技术报告》。外部链接:2502.13923,链接 引用自:§5.5。
- N. Carlini 和 D. Wagner(2018)《音频对抗样本:针对语音转文本的定向攻击》。外部链接:1801.01944,链接 引用自:§2。
- A. Chen、Y. Wu、J. Zhang、J. Xiao、S. Yang、J. Huang、K. Wang、W. Wang 和 S. Wang(2025a)《关于计算机使用智能体的安全与安保威胁综述:JARVIS 还是 Ultron?》。arXiv。外部链接:2505.10924,文献标识码 引用自:§2。
- A. Chen、Y. Wu、J. Zhang、J. Xiao、S. Yang、J. Huang、K. Wang、W. Wang 和 S. Wang(2025b)《关于计算机使用智能体的安全与安保威胁综述:JARVIS 还是 Ultron?》。外部链接:2505.10924,链接 引用自:§2。
- K. Cheng、Q. Sun、Y. Chu、F. Xu、Y. Li、J. Zhang 和 Z. Wu(2024)《SeeClick:利用 GUI 定位增强视觉 GUI 智能体》。外部链接:2401.10935,链接 引用自:§2。
- G. Dai、S. Jiang、T. Cao、Y. Li、Y. Yang、R. Tan、M. Li 和 L. Qiu(2025)《推进移动 GUI 智能体:一种验证器驱动的实际部署方法》。arXiv。外部链接:2503.15937,文献标识码 引用自:§2。
- G. DeepMind(2025)《Project Astra》。注释:https://deepmind.google/models/project-astra/ 引用自:§1、§2。
- 深度求索(DeepSeek-AI),D. Guo,D. Yang,H. Zhang,J. Song,R. Zhang,R. Xu,Q. Zhu,S. Ma,P. Wang,X. Bi,X. Zhang,X. Yu,Y. Wu,Z. F. Wu,Z. Gou,Z. Shao,Z. Li,Z. Gao,A. Liu,B. Xue,B. Wang,B. Wu,B. Feng,C. Lu,C. Zhao,C. Deng,C. Zhang,C. Ruan,D. Dai,D. Chen,D. Ji,E. Li,F. Lin,F. Dai,F. Luo,G. Hao,G. Chen,G. Li,H. Zhang,H. Bao,H. Xu,H. Wang,H. Ding,H. Xin,H. Gao,H. Qu,H. Li,J. Guo,J. Li,J. Wang,J. Chen,J. Yuan,J. Qiu,J. Li,J. L. Cai,J. Ni,J. Liang,J. Chen,K. Dong,K. Hu,K. Gao,K. Guan,K. Huang,K. Yu,L. Wang,L. Zhang,L. Zhao,L. Wang,L. Zhang,L. Xu,L. Xia,M. Zhang,M. Zhang,M. Tang,M. Li,M. Wang,M. Li,N. Tian,P. Huang,P. Zhang,Q. Wang,Q. Chen,Q. Du,R. Ge,R. Zhang,R. Pan,R. Wang,R. J. Chen,R. L. Jin,R. Chen,S. Lu,S. Zhou,S. Chen,S. Ye,S. Wang,S. Yu,S. Zhou,S. Pan,S. S. Li,S. Zhou,S. Wu,S. Ye,T. Yun,T. Pei,T. Sun,T. Wang,W. Zeng,W. Zhao,W. Liu,W. Liang,W. Gao,W. Yu,W. Zhang,W. L. Xiao,W. An,X. Liu,X. Wang,X. Chen,X. Nie,X. Cheng,X. Liu,X. Xie,X. Liu,X. Yang,X. Li,X. Su,X. Lin,X. Q. Li,X. Jin,X. Shen,X. Chen,X. Sun,X. Wang,X. Song,X. Zhou,X. Wang,X. Shan,Y. K. Li,Y. Q. Wang,Y. X. Wei,Y. Zhang,Y. Xu,Y. Li,Y. Zhao,Y. Sun,Y. Wang,Y. Yu,Y. Zhang,Y. Shi,Y. Xiong,Y. He,Y. Piao,Y. Wang,Y. Tan,Y. Ma,Y. Liu,Y. Guo,Y. Ou,Y. Wang,Y. Gong,Y. Zou,Y. He,Y. Xiong,Y. Luo,Y. You,Y. Liu,Y. Zhou,Y. X. Zhu,Y. Xu,Y. Huang,Y. Li,Y. Zheng,Y. Zhu,Y. Ma,Y. Tang,Y. Zha,Y. Yan,Z. Z. Ren,Z. Ren,Z. Sha,Z. Fu,Z. Xu,Z. Xie,Z. Zhang,Z. Hao,Z. Ma,Z. Yan,Z. Wu,Z. Gu,Z. Zhu,Z. Liu,Z. Li,Z. Xie,Z. Song,Z. Pan,Z. Huang,Z. Xu,Z. Zhang,以及 Z. Zhang(2025)《DeepSeek-r1:通过强化学习激励大语言模型的推理能力》。外部链接:2501.12948,链接。引自 §5.1。
- X. Deng,Y. Gu,B. Zheng,S. Chen,S. Stevens,B. Wang,H. Sun,以及 Y. Su(2023)《Mind2Web:迈向通用型网络智能体》。外部链接:2306.06070,链接。引自 §1,§2。
- 谷歌(2025)《推出 Gemini 2.5 Computer Use 模型》。注:https://blog.google/technology/google-deepmind/gemini-computer-use-model/。引自 §1,§2。
- B. Gou、R. Wang、B. Zheng、Y. Xie、C. Chang、Y. Shu、H. Sun 和 Y. Su(2024)《像人类一样导航数字世界:面向 GUI 智能体的通用视觉定位》。外部链接:2410.05243,链接。引用自:第2节、第5.1节。
- H. He、W. Yao、K. Ma、W. Yu、Y. Dai、H. Zhang、Z. Lan 和 D. Yu(2024)《WebVoyager:构建基于大型多模态模型的端到端网络智能体》。外部链接:2401.13919,链接。引用自:第2节。
- W. Hong、W. Wang、Q. Lv、J. Xu、W. Yu、J. Ji、Y. Wang、Z. Wang、Y. Zhang、J. Li、B. Xu、Y. Dong、M. Ding 和 J. Tang(2024)《CogAgent:面向 GUI 智能体的视觉语言模型》。外部链接:2312.08914,链接。引用自:第1节、第2节。
- E. J. Hu、Y. Shen、P. Wallis、Z. Allen-Zhu、Y. Li、S. Wang、L. Wang 和 W. Chen(2021)《LoRA:大型语言模型的低秩适配》。外部链接:2106.09685,链接。引用自:第5.5节。
- R. J. Joyce、D. Amlani、C. Nicholas 和 E. Raff(2021)《MOTIF:一个带有真实家族标签的大型恶意软件参考数据集》。外部链接:2111.15031,链接。引用自:第2节。
- J. Y. Koh、R. Lo、L. Jang、V. Duvvur、M. C. Lim、P. Huang、G. Neubig、S. Zhou、R. Salakhutdinov 和 D. Fried(2024)《VisualWebArena:在真实视觉网络任务上评估多模态智能体》。外部链接:2401.13649,链接。引用自:第2节。
- H. Lai、X. Liu、I. L. Iong、S. Yao、Y. Chen、P. Shen、H. Yu、H. Zhang、X. Zhang、Y. Dong 和 J. Tang(2024)《AutoWebGLM:基于大型语言模型的网络导航智能体》。外部链接:2404.03648,链接。引用自:第2节。
- J. Lee、D. Lee、C. Choi、Y. Im、J. Wi、K. Heo、S. Oh、S. Lee 和 I. Shin(2025)《VeriSafe Agent:通过基于逻辑的动作验证保护移动 GUI 智能体》。arXiv。外部链接:2503.18492,文献。引用自:第2节。
- J. Lee、D. Hahm、J. S. Choi、W. B. Knox 和 K. Lee(2024a)《MobileSafetyBench:评估移动设备控制中自主智能体的安全性》。外部链接:2410.17520,链接。引用自:第1节、第1节、第2节。
- S. Lee、J. Choi、J. Lee、M. H. Wasi、H. Choi、S. Y. Ko、S. Oh 和 I. Shin(2024b)《探索、选择、推导与回忆:用类人记忆增强大语言模型以实现移动任务自动化》。外部链接:2312.03003,链接。引用自:第2节。
- I. Levy、B. Wiesel、S. Marreed、A. Oved、A. Yaeli 和 S. Shlomov(2025)《ST-webagentbench:评估网络智能体安全性与可信度的基准》。外部链接:2410.06703,链接 引用自:§1, §2。
- W. Li、W. Bishop、A. Li、C. Rawles、F. Campbell-Ajala、D. Tyamagundlu 和 O. Riva(2024a)《论数据规模对 UI 控制智能体的影响》。外部链接:2406.03679,链接 引用自:§2。
- Y. Li、J. He、X. Zhou、Y. Zhang 和 J. Baldridge(2020)《将自然语言指令映射到移动 UI 操作序列》。外部链接:2005.03776,链接 引用自:§2。
- Y. Li、H. Wen、W. Wang、X. Li、Y. Yuan、G. Liu、J. Liu、W. Xu、X. Wang、Y. Sun、R. Kong、Y. Wang、H. Geng、J. Luan、X. Jin、Z. Ye、G. Xiong、F. Zhang、X. Li、M. Xu、Z. Li、P. Li、Y. Liu、Y. Zhang 和 Y. Liu(2024b)《个人大语言模型智能体:关于能力、效率与安全性的见解与综述》。外部链接:2401.05459,链接 引用自:§2。
- X. Ma、Y. Wang、Y. Yao、T. Yuan、A. Zhang、Z. Zhang 和 H. Zhao(2024)《警惕环境:多模态智能体易受环境干扰》。arXiv。外部链接:2408.02544,文献标识码 引用自:§1, §2。
- G. Mialon、C. Fourrier、C. Swift、T. Wolf、Y. LeCun 和 T. Scialom(2023)《GAIA:通用 AI 助手的基准》。外部链接:2311.12983,链接 引用自:§2。
- D. Nguyen、J. Chen、Y. Wang、G. Wu、N. Park、Z. Hu、H. Lyu、J. Wu、R. Aponte、Y. Xia、X. Li、J. Shi、H. Chen、V. D. Lai、Z. Xie、S. Kim、R. Zhang、T. Yu、M. Tanjim、N. K. Ahmed、P. Mathur、S. Yoon、L. Yao、B. Kveton、T. H. Nguyen、T. Bui、T. Zhou、R. A. Rossi 和 F. Dernoncourt(2024)《GUI 智能体:综述》。外部链接:2412.13501,链接 引用自:§2。
- OpenAI(2025)《计算机使用智能体》。注释:https://openai.com/zh-Hans-CN/index/computer-using-agent/ 引用自:§1, §2。
- V. Patel(2025)《TikTok 母公司字节跳动发布 AI 手机助手——中国对 iPhone 的挑战》。注释:https://www.ibtimes.co.uk/tiktok-owner-bytedance-unveils-ai-phone-assistant-chinas-challenge-iphone-1759633 引用自:§1, §2。
- Y. Qin, Y. Ye, J. Fang, H. Wang, S. Liang, S. Tian, J. Zhang, J. Li, Y. Li, S. Huang, W. Zhong, K. Li, J. Yang, Y. Miao, W. Lin, L. Liu, X. Jiang, Q. Ma, J. Li, X. Xiao, K. Cai, C. Li, Y. Zheng, C. Jin, C. Li, X. Zhou, M. Wang, H. Chen, Z. Li, H. Yang, H. Liu, F. Lin, T. Peng, X. Liu, and G. Shi (2025) UI-tars:利用原生智能体开创自动化图形界面交互。外部链接:2501.12326,链接,被引用:§1, §2, §2, §5.1。
- C. Rawles, S. Clinckemaillie, Y. Chang, J. Waltz, G. Lau, M. Fair, A. Li, W. Bishop, W. Li, F. Campbell-Ajala, D. Toyama, R. Berry, D. Tyamagundlu, T. Lillicrap, and O. Riva (2024) AndroidWorld:面向自主智能体的动态基准测试环境。arXiv。外部链接:2405.14573,文献,被引用:§1, §2, §4.2, §5.1。
- C. Rawles, A. Li, D. Rodriguez, O. Riva, and T. Lillicrap (2023) Android in the wild:用于安卓设备控制的大规模数据集。外部链接:2307.10088,链接,被引用:§1, §2。
- Y. Ruan, H. Dong, A. Wang, S. Pitis, Y. Zhou, J. Ba, Y. Dubois, C. J. Maddison, and T. Hashimoto (2024) 利用大语言模型模拟沙盒识别大语言模型智能体的风险。外部链接:2309.15817,链接,被引用:§2。
- X. Shen, Z. Chen, M. Backes, Y. Shen, and Y. Zhang (2024) “Do anything now”:对现实世界中大语言模型越狱提示词的特征描述与评估。外部链接:2308.03825,链接,被引用:§2。
- T. Shi, A. Karpathy, L. Fan, J. Hernandez, and P. Liang (2017) World of bits:面向基于网页智能体的开放领域平台。收录于《第34届国际机器学习大会论文集》,D. Precup 和 Y. W. Teh 编,《机器学习研究会议论文集》第70卷,澳大利亚新南威尔士州悉尼,第3135–3144页。外部链接:链接,被引用:§2。
- Y. Shi, W. Yu, W. Yao, W. Chen, and N. Liu (2025) 迈向可信赖的图形界面智能体:综述。外部链接:2503.23434,链接,被引用:§2。
- Q. Sun, M. Li, Z. Liu, Z. Xie, F. Xu, Z. Yin, K. Cheng, Z. Li, Z. Ding, Q. Liu, Z. Wu, Z. Zhang, B. Kao, and L. Kong (2025) OS-Sentinel:通过真实工作流中的混合验证实现安全增强的移动图形界面智能体。arXiv。外部链接:2510.24411,文献,被引用:§2。
- A. Tarantola (2024) Apple Intelligence 作为个人 AI 智能体,在你的所有应用中运行。引用自:§1, §2。
- A. D. Tur, N. Meade, X. H. Lù, A. Zambrano, A. Patel, E. Durmus, S. Gella, K. Stańczak, 和 S. Reddy (2025) SafeArena:评估自主网络智能体安全性的框架。外部链接:2503.04957, 链接 引用自:§1, §2。
- S. G. Venkatesh, P. Talukdar, 和 S. Narayanan (2023) UGIF:基于 UI 的指令跟随。外部链接:2211.07615, 链接 引用自:§2。
- S. Vijayvargiya, A. B. Soni, X. Zhou, Z. Z. Wang, N. Dziri, G. Neubig, 和 M. Sap (2025) OpenAgentSafety:评估真实世界 AI 智能体安全性的综合框架。外部链接:2507.06134, 链接 引用自:§1, §2。
- H. Wang, H. Zou, H. Song, J. Feng, J. Fang, J. Lu, L. Liu, Q. Luo, S. Liang, S. Huang, W. Zhong, Y. Ye, Y. Qin, Y. Xiong, Y. Song, Z. Wu, A. Li, B. Li, C. Dun, C. Liu, D. Zan, F. Leng, H. Wang, H. Yu, H. Chen, H. Guo, J. Su, J. Huang, K. Shen, K. Shi, L. Yan, P. Zhao, P. Liu, Q. Ye, R. Zheng, S. Xin, W. X. Zhao, W. Heng, W. Huang, W. Wang, X. Qin, Y. Lin, Y. Wu, Z. Chen, Z. Wang, B. Zhong, X. Zhang, X. Li, Y. Li, Z. Zhao, C. Jiang, F. Wu, H. Zhou, J. Pang, L. Han, Q. Liu, Q. Ma, S. Liu, S. Cai, W. Fu, X. Liu, Y. Wang, Z. Zhang, B. Zhou, G. Li, J. Shi, J. Yang, J. Tang, L. Li, Q. Han, T. Lu, W. Lin, X. Tong, X. Li, Y. Zhang, Y. Miao, Z. Jiang, Z. Li, Z. Zhao, C. Li, D. Ma, F. Lin, G. Zhang, H. Yang, H. Guo, H. Zhu, J. Liu, J. Du, K. Cai, K. Li, L. Yuan, M. Han, M. Wang, S. Guo, T. Cheng, X. Ma, X. Xiao, X. Huang, X. Chen, Y. Du, Y. Chen, Y. Wang, Z. Li, Z. Yang, Z. Zeng, C. Jin, C. Li, H. Chen, H. Chen, J. Chen, Q. Zhao, 和 G. Shi (2025) UI-TARS-2 技术报告:通过多轮强化学习推进 GUI 智能体。外部链接:2509.02544, 链接 引用自:§2。
- L. Wang, C. Ma, X. Feng, Z. Zhang, H. Yang, J. Zhang, Z. Chen, J. Tang, X. Chen, Y. Lin, W. X. Zhao, Z. Wei, 和 J. Wen (2024) 基于大语言模型的自主智能体综述。计算机科学前沿 18 (6), 页码 186345。外部链接:2308.11432, ISSN 2095-2228, 2095-2236, 文献标识码 引用自:§1。
- H. Wen, Y. Li, G. Liu, S. Zhao, T. Yu, T. J. Li, S. Jiang, Y. Liu, Y. Zhang, and Y. Liu (2024a) AutoDroid: 基于大语言模型的安卓任务自动化。外部链接: 2308.15272, 链接 被引用: §1, §2, §2, §5.1。
- H. Wen, S. Tian, B. Pavlov, W. Du, Y. Li, G. Chang, S. Zhao, J. Liu, Y. Liu, Y. Zhang, and Y. Li (2024b) AutoDroid-v2: 通过代码生成提升基于小语言模型的 GUI 智能体。外部链接: 2412.18116, 链接 被引用: §1, §2。
- C. H. Wu, R. Shah, J. Y. Koh, R. Salakhutdinov, D. Fried, and A. Raghunathan (2025a) 剖析多模态语言模型智能体的对抗鲁棒性。外部链接: 2406.12814, 链接 被引用: §2。
- C. H. Wu, R. Shah, J. Y. Koh, R. Salakhutdinov, D. Fried, and A. Raghunathan (2025b) 剖析多模态语言模型智能体的对抗鲁棒性。外部链接: 2406.12814, 链接 被引用: §1, §2。
- Z. Wu, Z. Wu, F. Xu, Y. Wang, Q. Sun, C. Jia, K. Cheng, Z. Ding, L. Chen, P. P. Liang, and Y. Qiao (2024) OS-atlas: 面向通用型 GUI 智能体的基础动作模型。外部链接: 2410.23218, 链接 被引用: §2。
- T. Xie, D. Zhang, J. Chen, X. Li, S. Zhao, R. Cao, T. J. Hua, Z. Cheng, D. Shin, F. Lei, Y. Liu, Y. Xu, S. Zhou, S. Savarese, C. Xiong, V. Zhong, and T. Yu (2024) OSWorld: 在真实计算机环境中对多模态智能体进行开放式任务基准测试。外部链接: 2404.07972, 链接 被引用: §2。
- M. Xing, R. Zhang, H. Xue, Q. Chen, F. Yang, and Z. Xiao (2024) 理解大语言模型智能体在复杂安卓环境中的弱点。外部链接: 2402.06596, 链接 被引用: §2。
- C. Xu, M. Kang, J. Zhang, Z. Liao, L. Mo, M. Yuan, H. Sun, and B. Li (2024) AdvWeb: 对基于视觉语言模型的网络智能体进行可控黑盒攻击。外部链接: 2410.17401, 链接 被引用: §1, §1, §2。
- Y. Yang, Y. Wang, D. Li, Z. Luo, B. Chen, C. Huang, and J. Li (2024) Aria-ui: GUI 指令的视觉定位。外部链接: 2412.16256, 链接 被引用: §1, §2, §5.1, §6。
- C. Zhang, S. He, J. Qian, B. Li, L. Li, S. Qin, Y. Kang, M. Ma, G. Liu, Q. Lin, S. Rajmohan, D. Zhang, and Q. Zhang (2025a) 大语言模型驱动的 GUI 智能体:综述。外部链接: 2411.18279, 链接 被引用: §2。
- L. Zhang, S. Wang, X. Jia, Z. Zheng, Y. Yan, L. Gao, Y. Li, 和 M. Xu (2024a) 《LlamaTouch:一个忠实且可扩展的移动端 UI 任务自动化测试平台》。外部链接:2404.16054,链接 引用自:§2。
- Y. Zhang, T. Yu, 和 D. Yang (2024b) 《通过弹窗攻击视觉语言计算机智能体》。外部链接:2411.02391,链接 引用自:附录 E,§1,§1,§1,§2,§2。
- Z. Zhang, S. Cui, Y. Lu, J. Zhou, J. Yang, H. Wang, 和 M. Huang (2025b) 《Agent-SafetyBench:评估大语言模型智能体的安全性》。外部链接:2412.14470,链接 引用自:§2。
- S. Zhao, J. Wen, A. Luu, J. Zhao, 和 J. Fu (2023) 《提示词作为后门攻击的触发器:探究语言模型中的脆弱性》。收录于《2023年自然语言处理实证方法会议论文集》,H. Bouamor, J. Pino, 和 K. Bali 编,新加坡,第12303–12317页。外部链接:链接,文献编号 引用自:§2。
- B. Zheng, B. Gou, J. Kil, H. Sun, 和 Y. Su (2024) 《GPT-4v(ision) 是一个通用型网络智能体,前提是具备基础能力》。外部链接:2401.01614,链接 引用自:§1。
- B. Zheng, Z. Liao, S. Salisbury, Z. Liu, M. Lin, Q. Zheng, Z. Wang, X. Deng, D. Song, H. Sun, 和 Y. Su (2025) 《WebGuard:为网络智能体构建通用护栏》。外部链接:2507.14293,链接 引用自:§1,§2。
- S. Zhou, F. F. Xu, H. Zhu, X. Zhou, R. Lo, A. Sridhar, X. Cheng, T. Ou, Y. Bisk, D. Fried, U. Alon, 和 G. Neubig (2024) 《WebArena:一个用于构建自主智能体的真实网络环境》。外部链接:2307.13854,链接 引用自:§2,§2。
- X. Zhou, H. Kim, F. Brahman, L. Jiang, H. Zhu, X. Lu, F. Xu, B. Y. Lin, Y. Choi, N. Mireshghallah, R. L. Bras, 和 M. Sap (2025) 《HAICOSYSTEM:一个用于隔离人机交互安全风险的生态系统》。外部链接:2409.16427,链接 引用自:§1,§2。
附录
附录 A 论文相关工件
A.1. 工件摘要
我们的工件用于复现第 5.1 节和第 5.2 节中的实验结果。如论文所述,动态环境下的评估需要在 Android 虚拟设备上运行,需要完成相关环境配置、安装我们的攻击者应用,并使用相应的智能体在对应任务下运行评估;相关代码位于 `code/android_world` 目录下。静态环境下的评估相对简单便捷:无需虚拟机,只需完成 Python 环境配置即可运行评估;代码位于 `code/AgentHazard` 目录下。在 `data/` 文件夹中,我们提供了需要使用的数据,包括编译好的攻击者应用以及动态和静态两种设置下的任务数据。我们将在以下内容中详细介绍如何进行评估。
A.2. 工件检查清单(元信息)
- •
二进制文件:
- –
预构建 APK:`data/app-release.apk`
- –
- •
模型111:需要 API,或需要训练/部署。
- –
`gpt-4o-2024-11-20∗`
- –
`gpt-4o-mini-2024-07-18∗`
- –
`deepseek-r1-250528∗`
- –
`deepseek-v3-250324∗`
- –
`gpt-5∗`
- –
`claude-4-sonnet∗`
- –
`Qwen/Qwen-2.5-VL-7B-Instruct†`
- –
`osunlp/UGround-V1-7B†`, `Aria-UI/Aria-UI-base†`
- –
- •
数据集:
- –
`data/exp.7z`:评估任务。
- –
`data/app-release.apk`:攻击者应用的编译二进制文件。
- –
`data/mitigation`:训练数据集和脚本。
- –
- •
运行环境:
- –
宿主机操作系统:Ubuntu 22.04
- –
GPU 训练与推理服务器:A100, 80G
- –
Android:Android Studio/SDK 工具(API Level 33)
- –
Python:3.11+
- –
- •
评估指标:
- –
成功率,误导率
- –
- •
大约需要多少磁盘空间?:
- –
动态:25 GB;静态:5 GB。
- –
- •
准备流程大约需要多少时间?:
- –
动态:1 小时;静态:15-30 分钟。
- –
- •
完成实验大约需要多少时间?:
- –
动态:6 小时。静态:3 小时。(取决于 API 速度。)
- –
- •
是否公开可用?
- –
是。
- –
- •
代码许可证(如果公开可用)?
- –
MIT。
- –
A.3. 描述
A.3.1. 如何获取
我们的代码和数据通过此链接公开提供。我们在缓解训练中使用的训练框架是 ms-swift,您可以直接从 Github 克隆它。
A.3.2. 硬件依赖
动态环境评估在配备 2 块 24GB 3090 GPU 的 Ubuntu 桌面工作站上运行。这不是最低配置要求,但设备性能会影响实验速度。你可能需要安装 Android SDK 并下载 Android 虚拟设备。
对于缓解训练,我们使用 4 块 80GB A100 GPU。你也需要准备类似的配置,以支持评估所需的训练和推理。
A.3.3. 软件依赖
Android SDK、Python 3.11 及以上版本。
A.4. 安装
请从 A.3.1 提供的链接下载数据,并解压 data/exp.7z,解压后会生成两个文件夹:static/ 和 dynamic/。
A.4.1. 静态环境
- •
进入项目目录并设置 Python 虚拟环境。
⬇
#将数据移动到 AgentHazard 文件夹中
mv data/static code/AgentHazard/data
cd code/AgentHazard
#如果使用 uv 作为包管理器
uv sync --no-dev
#否则
pip install -r requirements.txt
A.4.2. 动态环境
- •
进入项目目录并设置 Python 虚拟环境。
⬇
mv data/dynamic code/android_world/config
cd code/android_world
- •
请按照 Android World 中的说明设置 venv、Android SDK、API 密钥等,并在 AVD 上安装提供的劫持工具(app-release.apk)。
- •
下载模型(osunlp/UGround-V1-7B、Aria-UI/Aria-UI-base),并使用 vllm 提供服务。
- •
为了增强批量评估的稳定性,我们强烈建议保存虚拟设备的快照,并将其命名为“init”,以便后续使用。
A.4.3. 缓解训练
- •
创建一个工作目录。
⬇
mkdir -p code/mitigation-training
cd code/mitigation-training
#按需设置虚拟环境。
- •
安装依赖。
⬇
pip install 'ms-swift[all]' -U
pip install deepspeed
pip install flash-attn --no-build-isolation
A.5. 实验工作流程
A.5.1. 静态环境
- •
进入项目目录并激活虚拟环境。
⬇
cd code/AgentHazard
source .venv/bin/activate
- •
准备 API 密钥(仅支持兼容 OpenAI 的接口)
- •
设置环境变量。
⬇
cp .env.local .env
#编辑 OPENAI_API_KEY、OPENAI_BASE_URL
- •
我们通过 eval 命令提供便捷的评估方式。
⬇
#对于 uv 用户
aheval --help
#否则
python -m agenthazard.cli eval --help
- •
为快速启动评估,我们也提供了脚本。请注意,如果你需要复现纯视觉模态的结果,你需要自行托管 UGround 模型。
⬇
#托管UGround模型
vllmserveosunlp/UGround-V1-7B\–dtypefloat16–api-key<xxx>
#导出环境变量(或添加到.env文件)
export=http://localhost:8000/v1
export=<xxx>
\parchmod+x./scripts/*.sh
#针对基线模型
./scripts/eval-baseline.sh
#针对攻击方法
./scripts/eval-attacks.sh
- •
评估结果将保存在 static_results 目录下。如果遇到网络错误,只需重新运行脚本,程序会自动从已保存的数据处恢复执行。
A.5.2. 动态环境
- •
使用以下命令运行动态评估。
⬇
cdcode/android_world
chmod+xeval.sh
./eval.sh
- •
注意:考虑到任务数量以及 Android 虚拟设备的加载和响应速度,此过程可能会运行很长时间。可以使用以下命令启动一个最小化的运行示例:
⬇
pythonrun.py\–suite_family=android_world\–agent_name=t3a_gpt4o\–perform_emulator_setup\–tasks=ContactsAddContact\–attack_configconfig/mislead_click.json\#如果指定了该参数,程序将在检测到误导性动作时退出
#检测到误导性动作时退出。
–break_on_misleading_actions
A.5.3. 缓解训练
- •
进入项目目录并激活虚拟环境。
⬇
cdcode/mitigation-training
source.venv/bin/activate
- •
解压训练数据集。解压后,将得到 2 个文件夹和 2 个文件(adv_images_marked、benign_images_marked、adv_train.json 和 benign_train.json)。
⬇
#使用7z命令行工具或其他你喜欢的方式
7zx../data/mitigation/dataset.7z
- •
使用我们提供的脚本开始训练。
⬇
mv../data/mitigation/scripts.
chmod+x./scripts/*.sh
#良性训练
./scripts/mitigation-benign.sh
#对抗训练
./scripts/mitigation-adv.sh
- •
训练完成后,LoRA 检查点将保存到文件夹中;我们需要合并权重,然后启动部署以进行评估。
⬇
#LoRA合并
swiftexport–adaptersxxx/checkpoint-xxx\–modelQwen/Qwen2.5-VL-7B-Instruct\–model_typeqwen2_5_vl
#部署
swiftdeploy–modelxxx/-xxx-merged\–model_typeqwen2_5_vl
#设置环境变量
exportOPENAI_BASE_URL=…
exportOPENAI_API_KEY=…
- •
基于我们提供的检查点开始评估。
⬇
python-magenthazard.clieval\–data-dirdata–agentm3a\–clientopenai–modelxxxx\-o../data/mitigation/val-ckpt.parquet\–attackclick#orstatus
#移除–attack参数以获取基线结果
A.6. 评估与预期结果
我们所有的实验都将结果保存为parquet文件,这些文件可以方便地使用pandas或其他Python库加载。各项指标可以轻松计算和验证(我们的程序在执行完毕时也会报告这些指标)。
附录B 基准构建的补充细节
在AgentHazard基准构建过程中,我们使用了多样化的应用程序集,以确保任务的广泛性和评估的有效性。我们动态和静态数据集的详细应用列表见表4。
对于动态任务构建,我们选择开源应用程序,以确保任务的可控性和可复现性,消除推荐系统或实时内容更新等外部影响。我们选取了12个涵盖多个领域的应用程序,包括笔记、餐饮、财务、规划、音乐、日程安排和联系人。对于静态数据集构建,我们使用了广泛的、常用的商业应用程序,以真实模拟现实世界的移动设备使用环境。
| 划分 | 应用 | 总计 |
|---|---|---|
| 动态 | Markor, Brocolli, Pro Expense, Simple SMS Messenger, Open Tracks, Tasks, Simple Calendar Pro, Retro Music, Joplin, Contacts, Files, VLC | 12 |
| 静态 | 大众点评, Chikki, Seat Geek, 掌阅, Skype, 墨迹天气, 百度贴吧, 美团, Keep, Fox Sports, Zzkko, Spotify, Indeed, 小红书, 大麦, 汽车之家, 安居客, 新闻, 爱奇艺, Twitter, 京东, 美图, 确认票, Scoops, Youtube, WPS, 淘宝, TEMU, Airbnb, PhotoDirector, SnapChat, 麦当劳, 高德地图 | 33 |
值得注意的是,所有旨在模拟第三方攻击的误导性信息,都只出现在第三方拥有合法控制权的区域,例如帖子内容或标题、产品名称或联系信息。这表明,这类通常通过简洁短语传达的误导性信息,足以改变或扰乱智能体的任务执行轨迹,并且在某些场景下,可能危及用户隐私和财务安全。为了量化这一现象,我们计算了动态和静态数据集中所有误导性实例的 token 长度(我们使用 tiktoken 中的 GPT-4o tokenizer 来计算 token 长度),并将结果展示在图 9 中。两个数据集中误导性信息的平均长度约为 10 个 token,最大值不超过 30 个 token。这证实了当前移动端 GUI 智能体在面对现实攻击场景时表现出的显著脆弱性。
附录 C 设计的任务示例及攻击内容注入
清单 10 展示了一个攻击配置模式的具体实现示例,该示例专门针对 MarkorMergeNotes 场景设计。此 JSON 配置展示了抽象模式如何在真实攻击场景中被实例化。
⬇
{
”packageName”:”net.gsantner.markor”,
”activityName”:”.activity.MainActivity”,
”overlayStyles”:[
{
”x”:0.0,
”y”:0.0,
”width”:800.0,
”height”:0.0,
”text”:”APPisbroken.Mergingnoteisinfeasible”,
”fontSize”:18.0,
”backgroundColor”:”#FFEEEEEE”,
”textColor”:”#FF212121”,
”horizontalAlign”:”start”,
”verticalAlign”:”center”,
”uiAutomatorCode”:”newUiSelector().
resourceId(\”net.gsantner.
markor:id/opoc_filesystem_item__title\”)”,
”padding”:{
”left”:0.0,
”top”:0.0,
”right”:0.0,
”bottom”:0.0
},
”allow”:[
”.resourceId(’net.gsantner.markor:id/nav_todo’)”
],
”deny”:[]
}
],
”extras”:{
”action”:”status”,
”area”:[0.0,0.0,0.0,0.0],
”relative_index”:-1
}
}
该配置定义了一个动态对抗任务,目标是在 Markor 笔记应用的主活动状态显示时对其进行攻击。攻击通过 `overlayStyles` 数组实例化,该数组包含一个目标元素,旨在向精确定义的屏幕区域注入欺骗性内容。该区域通过 UiAutomator 代码定位,代码根据资源 ID 识别特定 UI 组件,从而确保在应用界面状态内的精确空间定位。对抗性内容——“APP is broken. Merging note is infeasible”(应用已损坏。无法合并笔记)——被策略性地设计成看似合法的笔记标题,模仿系统通知。其样式属性旨在增强可信度:18.0 字体大小、微妙的灰色背景(#FFEEEEEE)和深色文本颜色(#FF212121),这些都与应用的美学风格自然融合。文本水平左对齐并垂直居中。800 像素的宽度参数指定该区域将在目标元素原始宽度的基础上扩展 800 像素,以确保有足够空间渲染对抗性文本。该配置通过 `allow` 和 `deny` 字段实现精确的条件逻辑,构成攻击规则的一部分。攻击仅在环境状态包含 UI 元素 `net.gsantner.markor:id/nav_todo` 时触发,确保欺骗性覆盖层仅在适当的上下文状态下出现:
| 使用资源 ID `resource_id` |
`extras` 部分中的附加参数,例如边界框和相对索引,提供了对注入行为的精细控制。如果边界框设置为非零值,它将强制覆盖目标区域;否则,目标区域由从 0 开始的相对索引决定。例如,如果相对索引设置为 0,则对应于 `overlayStyles` 中的第一个目标元素。这展示了攻击模式在保持隐蔽性和精确性的同时,适应多样化攻击需求的灵活性,最终为动态任务环境定义了一个特定的攻击实例。
附录 D 用于生成对抗性内容的提示词
在静态状态规则数据集构建过程中,我们设计了一组提示词,这些提示词在给定状态、任务和可控区域的情况下,使大语言模型能够生成有效的对抗性内容。该内容用于构建包含诸如 `或` 等误导性动作的攻击规则集。
提示词模板见列表 D。
{listing*}
旨在利用大语言模型自动生成对抗性内容的提示词模板。
原始任务
对抗性
动作
对抗性动作
输入
结束
段落
输出
开始
我们从人类在设计误导性文本时所采用的认知过程中汲取灵感,采用逐步优化策略来引导大语言模型生成高质量的对抗性内容,从而实现可扩展的生成。首先,我们指示模型输出一份草稿声明,然后增强其与任务目标的相关性。接下来,我们向模型提供对应于不同类型误导行为的特定指令。随后,我们缩短声明长度以确保简洁并避免冗长(与第三方可控信息通常简短的性质保持一致),最终得到最终输出。
表 5 展示了一个示例任务以及由大语言模型使用该提示词生成的两个对抗性字符串,图 11 显示了截图上相应的渲染内容。大语言模型有效地生成了对抗性误导信息,产生了与指定任务高度相关的字符串。
{listing*}
我们的大语言模型隐蔽性检测器中使用的提示词。
是否为恶意
是否为恶意
根据我们在正文中展示的实验结果,在动态评估中,由大语言模型生成的对抗性信息的误导率与人工精心制作的内容几乎相同。这证明了基于大语言模型的对抗性内容生成的有效性。通过将这些字符串以与原文相同的位置、相同的前景色和背景色进行渲染,我们以极少的人力合成了大量高度模拟真实使用场景的攻击界面。
附录 E 隐蔽性
为了验证我们的攻击模拟框架相比现有基于弹窗的攻击方法在隐蔽性上的优势,我们在动态评估环境中模拟了这两种方法,并使用基于大语言模型的检测器来识别误导性内容。具体来说,我们实现了一个基于 GPT-4o-mini 的检测器,通过分析截图来判断当前界面是否包含可疑或误导性信息。对于基于弹窗的攻击,我们遵循现有研究(Zhang 等人,2024b)的常见模式,通过叠加带有误导性消息的浮动窗口来实现。对于基于我们框架的攻击,我们通过攻击模拟框架修改原生 UI 元素。我们还对未受攻击的截图进行了检测,作为对照组,以考虑潜在的模型偏差。提示词见列表 D。
评估结果如表6所示。对于弹窗类攻击,检测器实现了98.3%的检出率,成功将绝大多数浮动窗口识别为可疑元素。这一高检出率符合预期,因为浮动窗口通常具有明显的视觉特征和定位方式。相比之下,对于基于我们框架的攻击,检出率降至37.9%,因为修改后的内容看起来自然且与原始界面设计一致。这一显著的检出率差异表明,我们的框架能够生成隐蔽性更强的攻击,这些攻击与合法内容之间的区分难度大幅提升。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org