黑客可利用9款最流行的AI工具组装大规模僵尸网络
Hackers can use 9 of the most popular AI tools to assemble massive botnets
提示注入已成为AI安全的首要威胁——大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。
这项研究首次揭示了利用 LLM 幻觉进行大规模 botnet 攻击的可行路径,影响范围覆盖几乎所有主流 AI 编程助手,每个依赖这些工具的开发者都该看一眼。
在 AI 安全的短暂历史中,提示词注入迅速成为头号威胁。大语言模型天生无法区分用户提供的合法指令与偷偷混入邮件、源代码以及模型正在处理的其他第三方内容中的恶意指令。这使得暗中注入 LLM 会轻易遵从的恶意命令变得轻而易举。
由于无法在可信来源与不可信来源之间强制划定这一关键边界,AI 引擎开发者只能搭建精心设计的防护栏,用以减轻损害,而非解决根本原因。
迄今为止,大多数提示词注入都属于被称为“推送式”的一类,即针对每一个潜在受害者逐一攻击。例如,攻击者将恶意指令注入某封个人邮件或日历邀请中。由于注入内容必须被发送(或推送)给每个特定目标,攻击规模因此受限,难以发动波及整个互联网的大规模利用。
与此同时,基于“拉取”的攻击——即 LLM 主动去寻找植入在网站上的对抗性提示词——仍然有限。由于无法引诱大量 LLM 访问恶意网站,这类攻击同样无法规模化。
HalluSquatting 登场
如今,研究人员设计出一种基于拉取(pull-based)的攻击,彻底改变了这一局面。研究人员将这种新型攻击命名为 HalluSquatting,它有可能组建大规模僵尸网络、发动大规模 DDoS 攻击,并大规模感染设备——这在提示词注入攻击中尚属首次。该攻击针对 AI 编程助手和智能体,包括 Cursor、Cursor CLI、Gemini CLI、Windsurf、GitHub Copilot、Cline、OpenClaw、ZeroClaw 和 NanoClaw,它们全都易受攻击。在日常活动过程中,这些助手和智能体会例行从代码仓库和注册表中拉取代码及其他资源。
HalluSquatting 威胁模型。
图片来源:Spira 等人。
HalluSquatting 是“对抗性幻觉抢注”(adversarial hallucination squatting)的缩写,它建立在 LLM 固有的倾向于幻觉出代码仓库和注册表中所托管资源标识符的特性之上。该攻击针对编程智能体和助手,它们通常会访问高权限命令行,以运行来自第三方资源的代码。通过预测 LLM 最有可能幻觉出的标识符,然后注册这些标识符并植入安装反向 shell 或其他恶意软件的指令,该攻击可以不加区分地感染海量设备,而无需逐一针对每个设备。
研究人员在周三发表的一篇论文中写道:“该攻击的可扩展特性使攻击者能够通过针对热门资源,以极小的代价攻陷大量用户,从而最大化被抢注资源被检索到的可能性。通过利用智能体应用集成的 shell 和终端来运行脚本和代码,攻击者可以在其注册的资源中嵌入安装反向 shell 的指令,从而有效地‘感染’许多独立的智能体应用。”
凭借大规模控制分布式设备的能力,HalluSquatting 有望实现此前提示词注入无法达成的多种目标。大规模勒索软件攻击活动,以及用于 DDoS 或加密货币挖矿的大型僵尸网络,就是两个这样的例子。
名称中的“抢注”(squatting)一词源自“域名仿冒”(typosquatting),即域名、代码仓库包或其他资源标识符高度模仿某个热门名称,以期诱使潜在用户访问或安装它。域名仿冒首次引起广泛关注是在 2016 年,当时一名大学生上传了 214 个带有陷阱的包到 PyPI、RubyGems 和 NPM 仓库,这些包的名称高度模仿合法包。结果是:这些冒充代码在超过 17,000 个独立域名上被执行了超过 45,000 次,其中超过一半被授予了最高管理权限。自那以后,域名仿冒攻击便层出不穷。
大语言模型不知道如何说“我不知道”。
HalluSquatting 的起点在于,大语言模型无法准确识别用户所指定资源的位置。例如,当开发者指示一个编程智能体去克隆一个热门的新代码仓库时,大语言模型有高达 85% 的概率会幻觉出错误的位置。而在克隆一个热门的“技能”(一种赋予智能体专门能力和领域专业知识的指令、脚本或资源形式)时,幻觉发生率可达 100%。HalluSquatting 之所以聚焦于热门资源,是因为它们未被纳入大语言模型的训练数据,同时它们又会在短时间内获得大量下载。
研究人员表示,大语言模型无法提供正确位置是一种固有缺陷,源于训练偏差或对当前上下文中指令的误解。这意味着,当用户提示编程助手去克隆某个代码仓库或技能时——比如以“clone repo name”或“install skill name”的形式——该机器人经常会导航到错误的位置去获取它。
这些幻觉不仅不可避免,而且还出现在全部六款主流大语言模型的基础层面,包括 Gemini-2.5-flash、Gemini-2.5-pro、GPT-5.1、GPT-5.2、Sonnet-4.5 和 Opus-4.5。此外,这些大语言模型最常给出的错误位置是可以提前预测的。当把提示词中的代码仓库或技能名称解析为其在代码仓库或技能仓库中的官方名称时,这六款大语言模型全都遵循共同的模式。
大语言模型会表现出各种模型幻觉模式。HalluSquatting 所利用的那种被描述为自我指涉型。全部六个模型都会生成“仓库名/仓库名”形式的 slug,把仓库名当作所有者。利用这一模式无需对模型进行探测。
表格展示了在 100 次查询中,每个(目标仓库、基础大语言模型)组合下最常被幻觉出的所有者/仓库候选。所有者底色:黄色 = 真实的 GitHub 所有者,蓝色 = 可注册的抢注(所有者不存在于 GitHub),红色 = 误导(真实但非预期的所有者),紫色 = 无法注册为 GitHub 用户名的占位字符串。⋆ 标记自我指涉型幻觉(所有者 == 仓库名)。
图片来源:Spira 等人。
有趣的是,这些大语言模型能正确解析 2019 年之前发布的仓库,平均幻觉率仅为 0.9%。而同样这些大语言模型在为 2025 年发布的仓库编造 slug 时,平均幻觉率高达 92.4%。
一旦攻击者确定了最有可能被幻觉出的名称,他们就会寻找其中可以注册的名称。然后他们上传一个模仿该热门资源的仓库或技能。在仓库或技能内部,readme 文件或其他位置埋有文本。该文本包含一条指令,让应用在 LLM 用户的机器上安装反向 shell。或者,攻击者也可以直接包含安装该 shell 所需的代码。无论哪种情况,编程助手或智能体都会利用其对命令窗口的访问权限来执行。
大规模利用大语言模型
研究人员包括:特拉维夫大学的 Aya Spira、Elad Feldman、Avishai Wool 和 Ben Nassi,以色列理工学院的 Stav Cohen,以及 Intuit 的 Ron Bitton。周三,他们在此处发表了他们的研究。在论文中,他们写道:
通过利用智能体应用集成的 shell 和终端来运行脚本和代码,攻击者可以有效地“感染”许多相互独立的智能体应用——方法是在攻击者注册的资源中嵌入安装反向 shell 的指令。获取攻击者控制下的分布式计算资源,为多种高影响后果打开了大门,使攻击者能够实现各种目标。例如,能够通过终端攻陷 LLM 应用,使攻击者可以扩大对不同网络的勒索软件攻击规模,以最大化经济利益。或者,攻击者可以将被攻陷的机器聚合成一个僵尸网络,用于依赖大量算力的任务,包括(1)大规模加密货币挖矿(例如 Smominru、WannaMine),或(2)对受害者执行分布式拒绝服务(DDoS)攻击(例如 Mirai)。
HalluSquatting 已经引起了未参与该研究的其他 AI 安全研究人员的兴趣。
“这是一项非常酷的研究,而且威胁非常真实,”安全公司 Zenity 的 CTO Michael Bargury 在电子邮件中写道。“就像域名抢注一样,这是一个不会消失的问题。归根结底,这取决于我们赋予智能体多大的自主权。它们总会以某种方式被欺骗。这应该成为我们的假设,我们应当对此具备韧性。”
独立研究员 Johann Rehberger 写道:
有趣的是,它表明 LLM 的资源解析可以成为一条攻击路径,攻击者可以先探测模型,找出高概率的幻觉候选对象(比如仓库名称、技能标识符等),然后抢注并等待智能体去解析和使用它们。
但关键在于,他们找到了一种巧妙的技术,能够找出模型更可能使用或混淆的资源名称。这可能意味着在真实环境中,许多智能体都会中招此类攻击。
AI 工具厂商经常夸大其平台的便利性和效率。营销人员声称这些平台通过自动化和简化繁琐任务来减轻工作流程负担。但对于可能摧毁整个项目的固有缺陷,他们却讳莫如深。像 HalluSquatting 这样的攻击有力地提醒人们,某些效率被夸大了,因为归根结底,用户必须逐一核实细节,比如项目中每个资源所对应的位置。它同时也提供了一个警示性的教训:当人们过度依赖 AI 助手时,可能产生意想不到且后果严重的结局。
来源:Ars Technica:AI(RSS) · arstechnica.com