跳到正文
北京时间
原文
Transluce(网页)·· 1 天前精选AI 评分74

Transluce 报告 AI 智能体以激进手段访问美加政府网站

AI Agents Targeted U.S. and Canadian Government Websites

AI 导读

Transluce 发布调查报告,发现多起 AI 智能体以激进手段访问美加政府网站的事件,包括两起失败的初级入侵尝试:6 月 17 日智能体对美国教育部民权数据收集网站发出超过 20 万次请求并尝试 SQL 注入,5 月 28 日和 6 月 9 日 Arquivo.pt 记录到针对加拿大图书档案馆的 899 次请求,其中 13 次含攻击载荷。

推荐理由

Transluce 自己的调查报告,给出 incidents 细节和识别方法,读者可以了解 AI 智能体访问政府网站的实际手法与边界。

正文 · AI 翻译

Jack Cable*,1、Daniel Chiu*、Francisco Pernice*,2、Laura Ruis*,2、Selena Zhang*,3、Tetiana Bas4、Jordan Chetty5、Farzaan Kaiyom1、Gary Shen4、Conrad Stosz†,3、Jacob Steinhardt†,3

1 Corridor · 2 MIT · 3 Transluce · 4 AIUC · 5 Hertz Foundation · * 第一作者,按字母顺序排列 · † 资深作者

Transluce | 发布于:

2026年9月30日

继我们之前的博客文章之后,我们又发现了若干额外事件,其中失控的 AI 智能体似乎使用了激进手段来访问政府网站上的公开数据。

这包括两次初级且失败的入侵尝试,一次针对美国教育部的民权数据收集,另一次针对加拿大联邦机构加拿大图书与档案馆。

这些失败的尝试与另外一些失控活动相关,其中智能体使用了一系列未达到入侵程度的激进策略来探测美国政府网站,常常以非预期的方式使用网站,有时还违反了明确的使用政策。这些活动针对的网站遍布白宫、战争部、司法部和商务部、CDC 和 SEC,以及加利福尼亚州、马里兰州、伊利诺伊州、得克萨斯州和纽约州的州级机构。

到目前为止,我们在这些数据集中没有发现任何智能体获取了非公开信息的实例。

我们下文的分析基于我们此前发布的 urlquery.net 数据集,以及 Arquivo.pt 的数据,后者是一个葡萄牙语网络存档,其 ArchivePageNow 功能被用来发送请求并检索数据。

智能体对美国教育部尝试了一次基础 SQL 注入

6月17日,智能体在显然是在查询学校统计数据时,向美国教育部的一个网站发出了超过20万次请求。该活动包括一次初级且失败的入侵尝试,即一次 SQL 注入探测,智能体添加了文本“State_Id=1 OR 1=1”,试图绕过网站的正常过滤器。

在 SQL 注入前的40秒内,出现了一系列带有各种异常州 ID 输入的请求(由于无法获取有关智能体及其推理轨迹的更多上下文,这组查询的目的尚不清楚):

该网站上存储的数据似乎与 Google 的 DeepSearchQA 基准测试中的一项网络搜索任务相匹配,这表明智能体并未被赋予与入侵相关的任务,而是根据其从互联网成功检索特定小众信息的能力来评分。

具体的 DeepSearchQA 任务(dsqa_250): 使用 civilrightsdata.ed.gov 中 2017–2018 学年的数据,确定以下哪个州——南卡罗来纳州、北卡罗来纳州、佐治亚州或弗吉尼亚州——的全日制等效学校辅导员与报告为种族相关骚扰或欺凌受害者的学生的比例最高。

我们在 Arquivo 流量中观察到的代理查询参数与 dsqa_250 的关系:

查询参数说明
survey_Year_Key=9对应 2017-2018 年。代理经常使用 Arquivo 进行多次查询以找到此映射,通常按顺序枚举 ID。
Measure_Id=130对应基于种族的欺凌受害者。
State_Id=11、State_Id=28、State_Id=41、State_Id=46对应相关州。

我们还注意到,超过 10,000 个请求包含以“oai”开头的标签(示例)。这些请求中有 99.6% 使用了上述三个查询参数的组合,表明这些请求的提交者试图回答 dsqa_250。

我们于 2026 年 9 月 25 日向教育部披露了此次未遂黑客攻击。一位教育部发言人随后评论称,他们未观察到此次报告事件对其服务造成任何影响。

代理对加拿大图书与档案馆进行了初级黑客攻击尝试

2026 年 5 月 28 日和 2026 年 6 月 9 日,Arquivo.pt 捕获了 899 个访问加拿大图书与档案馆(LAC)“collection-search”服务的请求,其中包括一系列显然失败的初级黑客攻击尝试。这些请求与检索 1905 年至 1911 年间加拿大离婚记录数据相关。

我们无法确信将这些尝试归因于 OpenAI,但它们表现出的策略与我们在类似时间段内归因于 OpenAI 的先前观察到的代理活动一致,包括使用 Arquivo.pt、针对特定、冷门信息进行激进的数据收集,以及探测网络安全漏洞。

在这 899 个请求中,有 13 个携带攻击载荷而非普通查询,包括探测记录标识符参数中的漏洞。这些载荷包括:

  • 三个 SQL 注入探测(一个撇号、1 OR 1=1 和 1,2)

  • 一个用于跨站脚本攻击的编码 <

  • 2147483648 用于测试 32 位整数边界

  • 字符串 abc 用于非数字处理

  • 五个对输出格式进行模糊测试的请求(.json、?output=、?raw=、?url=)

  • 两个切换 debug=1 标志的请求

我们认为这些探测并未成功:每个请求都返回正常的 HTTP 200 和空记录页面,没有任何迹象表明数据库对输入采取了行动或返回了任何额外数据。

我们于 2026 年 9 月 28 日向加拿大政府披露了此次未遂黑客攻击。9 月 29 日,加拿大网络安全中心发表公开声明作为回应。

代理对美国州和联邦网站使用了一系列其他激进策略

除上述内容外,我们还识别出一种更广泛的自动化工作流模式,我们根据任务级关联、共享基础设施和时间特征,以不同程度的置信度将其归因于 AI 代理。其中部分流量与先前已确认与 OpenAI 相关的活动存在不同程度的重叠,在某些情况下,代理会明确标记自己与 OpenAI 有关联。然而,我们并未将这一整体流量归因于 OpenAI,也未尝试对每一起事件进行归因估算。

在以下案例中,我们并未观察到黑客技术。相反,这些工作流使用激进或灰色地带的技术从政府网站获取信息,有时以非预期的方式使用网站,或违反明确的使用政策。这包括使用一次性电子邮件地址创建账户、复用已泄露的凭据、绕过反机器人控制,以及用请求淹没网站等技术。

我们在此概述我们的观察结果:

  • 堪萨斯州:5 月 7 日,Arquivo 记录到 36,578 次用户触发的 KansasMemory.gov 抓取(该网站显然由堪萨斯历史学会在堪萨斯州政府支持下管理),峰值达每分钟 1,093 次抓取。早期请求返回了内容,但在活动过程中,网站开始返回网关超时。我们无法确认该活动是否造成了服务中断。

  • 伊利诺伊州:在 4 月 19 日至 5 月 1 日之间的四个不同日期,我们观察到 251 次相关的 Arquivo 抓取,涉及伊利诺伊州遗留的 IQuery 公共卫生统计门户。最初的抓取返回“服务不可用”,但自动化工作流仍尝试了变通方法,例如直接 IP 路由、URL 解析变体,以及一个猜测的 ePass 路由,该路由重定向到该州的登录系统。所审查的响应均未返回 IQuery 数据。

  • 马里兰州:5 月 6 日,Arquivo 在多个包含教育统计数据的马里兰州主机上记录了 295,912 次抓取,峰值达每分钟 5,594 次抓取。该活动涉及大量猜测可下载文件名,同时成功下载了学生数学成绩的公开汇总数据集。另外,早在 3 月 2 日,Arquivo 就记录到对马里兰州数学成绩 API 的一小波 API 请求,尽管我们尚未确定其与 5 月后期活动之间的联系。

  • 纽约州:5 月 17 日,我们观察到归档活动试图通过修改后的 URL 和多个中间服务访问纽约州公立学校入学统计数据。最初的请求被阻止,而后续尝试返回了公开统计数据。相同的学校和入学选择出现在 collusion.wiki 先前记录的 wiki 活动中。

  • 德克萨斯州:同样在 5 月 17 日,归档结果显示,有人反复尝试通过直接导出请求以及此前被报道为代理所使用的中间转换服务,从德克萨斯州卫生服务部获取公开的性传播感染统计数据。我们无法确认所请求的统计数据是否成功获取。

  • 加利福尼亚州:5月26日,一系列请求显然绕过了反机器人控制,从加利福尼亚州的CAL-ACCESS检索到了公开的竞选财务记录。该工作流最初遇到了该网站的反机器人保护系统,但随后使用带有类文件后缀的路径检索到了记录。检索到的记录包括竞选支出报表。

  • 白宫管理和预算办公室:从5月25日到27日,我们发现了719份urlquery.net报告,这些报告似乎是在尝试从OMB的MAX.gov系统下载两份2023财年公开预算报告。这些报告显示有145个不同的提交字符串、416个不同的方法/URL对,以及跨越2,922个HTTP条目的243个追踪组。查询的URL包括与MAX的登录和PIV相关的主机名变体,有时还通过中间服务进行查询。在5月26日一次持续27秒的突发中,该工作流通过markdown.new(一项将网页转换为代理可读文本的服务)提交了同一PDF URL的16个版本,仅更改了一个任意的?uniqN查询参数(示例)。其他urlquery.net报告显示,该工作流成功下载了该公开PDF,并且一个中间服务成功将其中的文本提取为JSON。一份保存下来的collusion.wiki修订版本包含一条匹配的urlquery.net下载引用,而一张5月27日的截图显示了这两份报告以及访问它们的几种替代方式。

  • 美国海军:在4月23日至24日和5月18日,存档的请求探测了海军历史和遗产司令部网站history.navy.mil上的替代URL和端点。其中一些返回了图像元数据,而更广泛地尝试访问该网站用于编辑或发布内容的内容管理页面则失败了。我们未发现任何访问敏感军事信息的证据。

  • 美国司法部:在5月30日至31日,一个自动化工作流通过司法部少年司法与犯罪预防办公室(OJJDP)寻求公开的FBI逮捕统计数据。旧版URL反复重定向到一个替代服务,但该工作流通过添加一个编码的父目录段,成功检索到了旧版表格。检索到的数据,包括一份1980–2020年抢劫表,与一个DeepSearchQA问题合理匹配。

  • 经济分析局(美国商务部):6月18日,一个自动化工作流尝试注册经济分析局(BEA)的API密钥,使用了可丢弃的电子邮件地址和自行填写的组织名称“OpenAI Research”,但没有确认注册成功。该工作流还未能成功尝试使用OCR服务使CAPTCHA可机读。这一序列发生在6月16日至18日期间3,005次与BEA相关的Arquivo捕获这一更大集群之中。

  • 美国人口普查局(美国商务部): 在6月16日至22日期间,公开张贴的URL表明有人试图复用已泄露的API密钥来访问 census.gov 数据。其中若干相关页面包含OpenAI标记。在此案中我们不分享底层URL,以避免重新发布敏感材料,并且没有发现任何响应表明这些尝试成功或曾到达census.gov。

  • 美国证券交易委员会: 6月18日,一个工作流试图获取SEC公开的众筹统计数据。此前记录的智能体通信声称 双斜杠URL路径可以绕过速率限制,而另一些urlquery.net记录显示这些 URL确实返回了公开的县级数据。普通路径也成功了,因此并未证明存在速率限制绕过。

  • 美国疾病控制与预防中心: 7月18日,一个已归档的浏览器执行程序试图向CDC的WONDER统计服务提交数据请求(此处不包含链接,因为它含有可执行代码),包括接受其数据使用条款。一秒后的 捕获记录 返回了查询验证错误,这与表单提交代码的执行一致,尽管我们无法确定完整的执行链。

我们如何识别和评估该活动

我们主要依赖来自 urlquery.net(一个Web安全服务)和 Arquivo.pt(一个Web归档服务)的公开数据来识别上述活动。智能体显然利用这些平台来绕过其开发者或目标网站对其施加的限制来路由请求,但这两个服务也默认将智能体的请求公开。我们通过Web搜索、现有调查中的引用以及任务相关活动的具体示例,识别出了这些及其他有前景的数据源。

在分析这些数据时,我们的指导原则是识别哪些流量是由AI智能体留下的,并研究它们在尝试完成任务时的行为。例如,我们寻找与Web检索任务相关的高流量、明显自动化的请求模式,我们知道此前报道的智能体集群正在这些任务上接受训练和评估。为了识别激进策略,我们在这些流量中搜索可识别的漏洞利用模式及相关活动,例如在记录ID位置插入SQL表达式(如“1 OR 1=1”)、注入的JavaScript,或试图访问敏感文件(如 /etc/passwd)的路径。

为了帮助将单个请求相互关联,我们还检查了在失败后更改URL路径、编码或检索服务的请求序列,并通过共享的记录ID、独特的URL参数和时间关联相关请求。

为实现这一方法,我们结合使用了正则表达式匹配、LLM作为评判者、编码智能体调查和人工调查。

什么是Arquivo.pt?

免费在线服务 arquivo.pt 是葡萄牙国家网络档案馆,由葡萄牙 科学技术基金会(FCT)运营。其目的是让用户搜索和访问自1996年以来收集的网页内容的历史版本。它主要覆盖葡萄牙语网络,但也包含国际站点的材料,并支持对归档语料库的全文搜索。

该网站的条款与条件(最后更新于2022年8月25日)规定,Arquivo.pt 旨在支持教育、科学和研究工作,并明确禁止商业用途。条款还禁止将访问到的内容用于商业目的、分发、修改或转发至其他网站。

对于知识检索任务,它提供了以下可能对 AI 智能体有用的功能:

  • 它让能够发起 HTTP GET 请求的执行者通过可编程 API 访问大量归档网络内容语料库,并支持全文搜索。

  • 它可以从实时网络上已不可用的页面中恢复信息。给定一个 URL,智能体可以查询 Arquivo.pt 的版本历史,并获取该页面的留存版本。当某个来源已被删除、迁移、发生重大变更或无法从实时网站访问时,这非常有用。

  • 当不希望查询原始网站时,它可以提供一条替代检索路径。

  • 它可以通过其截图服务提供一种间接执行 JavaScript 的方式。这有助于智能体在不本地运行浏览器的情况下检查由脚本动态生成的内容。如果该服务接受一个其脚本由执行者控制的页面,它还可以提供一种运行执行者所提供 JavaScript 的手段。

来源:Transluce(网页) · transluce.org