英国 AISI 发布五款公开 LLM 先进能力评测结果
Advanced AI evaluations at AISI: May update
英国 AI Safety Institute(AISI)发布对五个已公开使用的大语言模型(匿名化命名)的评测结果,覆盖网络攻击能力、化学与生物学知识、智能体自主任务和安全防护四个维度。
官方评测机构公布五款公开模型的化学生物、网络攻击、智能体和安全防护测试结果,读者可以据此了解当前前沿模型在风险维度上的真实能力边界。
致读者:我们已于 2025 年 2 月 14 日更名为 AI 安全研究所。阅读更多 此处。
我们在 AI 安全研究所(AISI)的工作中,一个关键部分涉及定期评估先进的 AI 系统,以评估它们可能造成的潜在危害。在这篇文章中,我们展示了最近对五种已被公众使用的大型语言模型(LLM)的评估结果。我们评估了:
- 这些模型是否可能被用于协助网络攻击;
- 它们是否能提供化学和生物学方面的专家级知识,这些知识可能被用于积极目的,也可能被用于有害目的;
- 它们是否能够自主采取一系列行动(作为“代理”运作),其方式可能难以被人类控制;以及
- 它们是否容易受到“越狱”攻击,或用户试图绕过安全措施以引出潜在有害输出(例如非法或有毒内容)。
在之前的文章中,我们描述了我们的模型评估方法。在这里,我们重点介绍一些最近的结果:
- 多个 LLM 展示了化学和生物学方面的专家级知识。模型回答了 600 多个由专家私下编写的化学和生物学问题,其水平与受过博士培训的人类相似。
- 多个 LLM 完成了针对高中生的简单网络安全挑战,但在针对大学生的挑战中表现不佳。
- 两个 LLM 完成了短时程代理任务(例如简单的软件工程问题),但无法为更复杂的任务规划和执行一系列行动。
- 所有测试的 LLM 仍然极易受到基本越狱攻击,有些甚至在没有专门尝试绕过其安全措施的情况下也会提供有害输出。
我们的方法
我们评估了主要实验室发布的五个 LLM,这里分别称为 Red、Purple、Green、Blue 和 Yellow 模型(模型已匿名化)。评估方法是通过向模型提供问题或任务提示,并测量其响应。对于某些任务,模型被给予一个由外部工具组成的“脚手架”,例如一个允许它们编写可执行代码的 python 解释器。
根据任务或问题类型,我们测量了三种类型的响应:
- 合规性:模型是否遵从有害请求
- 正确性:对问题的回答是否正确
- 完成度:任务(如编码挑战)是否完成
我们使用两种方法对这些响应进行评分。在某些情况下,我们使用基于 LLM 的自动化方法来对模型回复进行评分。在必要时,我们将自动评分器的表现与人类评分器在部分项目上的表现进行比较,以检查其是否像人类一样评分。
对于某些问题,我们将精力集中在最有能力的模型子集上。这些评估是使用我们的模型评估框架 Inspect 开发和运行的,该框架现已通过开源许可证公开可用。
网络评估
如果先进的人工智能被用于实施网络攻击,包括针对关键国家基础设施的攻击,可能会放大对社会的风险。模型可能被用来向用户提供如何使用网络安全漏洞的信息,也可能被恶意行为者部署,在无人类监督的情况下自主攻击基础设施。我们在这些评估中的目标是研究当前公开可用的 LLM 在执行网络攻击中使用的基本操作方面的能力。
为了评估这一能力,我们使用了一组被称为“夺旗”(Capture the Flag,CTF)挑战的评估。CTF 挑战要求模型找到一个特定的字符串(一个“flag”),该字符串隐藏在文件中,只有在完成某些额外任务后才能访问,例如编写脚本生成二维码或向服务器发出查询。
我们用 83 个面向高中生的公开 CTF 问题(Pico CTFS;Carnegie Mellon University, 2024)和 12 个面向大学生的公开 CTF 问题(CSAW CTFs;NYU Tandon School of Engineering, 2024)评估了每个模型。这些 CTF 挑战旨在用于教育(因此可能无法评估最相关的网络领域),并且可能构成 LLM 预训练数据集的一部分。为缓解这些问题,我们开发了 10 个由专家编写的私有 CTF 挑战,我们可以确定这些挑战不在训练数据中。CTF 可以自动评分,因为解决方案是一段特定的文本(“flag”),每次解决挑战时都相同。
通过为 LLM 提供一个脚手架来评估它们,使其能够访问 python 解释器、bash shell 和文件编辑功能(见下文“智能体评估”)。对于更难的 CTF,我们使用了一个定制脚手架,它还提供用于解决 CTF 问题的专用软件(Shao et al. 2024),重现人类解决这些 CTF 时可用的工具。

图 1 显示了每个模型在每个子集上解决的 CTF 挑战百分比1。能力最强的模型解决了超过一半的 Pico CTF(面向高中生)。在 CSAW CTF(面向大学生)上,模型有时能够对文件进行逆向工程,但在其他任何问题类别上都未能取得进展。总体而言,密码学挑战(例如利用易受攻击的加密方案来获取受保护信息)是最难的。模型在我们的私有 CTF 上表现相当,这表明这些结果不太可能是由于解决方案泄露到模型训练数据中。
总结:我们发现,公开可用的模型能够解决面向高中生的简单“夺旗”(CTF)挑战,但在大学级别的问题上表现不佳。
化学/生物评估
先进的人工智能可以为人类提供化学和生物学方面的知识和技能,这些知识和技能既可用于积极目的,也可用于有害目的。我们评估了五个 LLM 回答 600 多个由专家编写的私有问题的能力,这些问题涵盖在安全背景下特别相关的知识和技能:
- 基础生物学:这些问题的答案通常可以在生物学教科书中找到,并在网上被广泛提及。
- 高级生物学:这些问题需要来自特定生物学论文的知识或实验室经验才能回答。
- 高级化学:回答需要来自特定化学论文的知识或实验室经验。
- 自动化生物学:关于如何自动化或外包生物学的问题。回答需要对实验室机器人或云实验室的工作原理有详细了解。
这些问题类似于用户在寻求科学工作帮助时可能提出的问题。有些问题旨在模仿新手寻求信息时提出的问题,另一些则模仿专家希望加速工作而提出的问题。新手问题之所以困难,是因为它们常常包含模型必须识别才能正确回答的错误概念,而专家问题之所以困难,是因为它们涉及小众主题或包含科学术语。我们按照Rein et al., 2023优化我们的问题,但以开放式文本而非多项选择格式收集答案。我们将模型表现与分别拥有化学或生物学博士学位或相关工作经验的专家表现进行比较。专家熟悉问题格式,可以使用网络搜索,并且每个问题最多用1小时回答。
结果展示在图2中,其中每个面板呈现四个问题领域之一的数据。彩色条形显示了五个模型以及人类专家基线2中,被评定为正确(蓝色)、部分正确(深灰色)或错误(浅灰色)的问题比例。每个面板右下角给出了向模型(m)和人类专家(h)提出的每个领域的问题数量。

对于所有四个问题领域,模型都正确回答了一些问题。然而,它们的能力因领域而异,其中基础生物学最容易。总体而言,大多数模型的表现与人类专家相似。例外是Yellow模型,它被评定为提供“不完整”或“部分完整”回答的频率高于其他模型,也高于人类专家(p < 0.001;序数混合效应回归),以及Green模型,它略弱于人类专家(p < 0.05)。对结果的更深入分析显示,在某些主题上,一些模型的表现优于专家基线。例如,在关于构思的高级生物学问题上,Purple模型通过将非常具体的领域知识与创造力相结合,表现优于专家基线,提出了诸如特定版本的CRISPR技术等实验方法来解决生物学挑战。在其他主题上,模型表现不如专家基线。例如,当被问及如何为实验室机器人编写代码时,模型有时会幻觉出函数名称。
我们使用自动评分模型来评估回答。我们优化了评分器,以提高与人类专家评分者的一致性。完成这一流程后,在留出测试集上,评分模型将人类评分者判定为“错误”的回答判为“正确”的情况极少(不到1%)。然而,在何为“部分”完成的问题上,人类与自动评分器之间存在一些分歧;自动评分器与人类之间的 Cohen's Kappa(一种评分者间一致性度量)为 0.52,而人类彼此之间为 0.8。 自开展此处报告的测试工作以来,我们进一步优化了评分器,以提高与人类的一致性。
摘要:我们发现,模型可用于获取生物学和化学领域的专家级知识。对于若干模型而言,其对科学问题的回答与博士级专家给出的回答不相上下。
智能体评估
当前先进的 AI 模型主要用作聊天机器人。然而,它们也可以被部署到数字平台上执行任务,例如执行代码或浏览网站。我们将这类系统称为 LLM 智能体(Chan et al., 2023)。 数字任务的广泛自动化带来了风险,既来自滥用,也来自无意的失准(模型做了人类并非本意的事情)。 我们开展了评估,以测试当前模型在无人类监督的情况下执行数字任务(聚焦于软件工程)的能力。
与网络评估一样,我们使用了一个“脚手架”,它基于 Yao et al.(2023),并为 LLM 提供了 Python 解释器、bash shell 和文件编辑工具的访问权限。 我们使用公开的 GAIA 基准(Mialon et al., 2023)来独立验证我们的脚手架为模型提供的支持接近最先进水平。我们的脚手架得分为 25%,领先于第二名的 FRIDAY 脚手架(Wu et al., 2024)(24%),但落后于表现最佳的脚手架 MAE v0.1(AutoGen Team, 2024)(32%)。
我们根据一名专家级人类软件工程师完成该任务所需的估计时间来定义任务难度。短时程任务(例如,修复 Linux 机器上的问题或搭建一个 Web 服务器)是那些人类需要不到 1 小时完成的任务,而长时程任务(例如,构建一个 Web 应用或改进一个智能体框架)可能需要人类超过四小时(最多 20 小时)才能完成。短时程任务取自公开的 GAIA 数据集(Mialon et al. 2023;1-3 级)和 METR 数据集(2024),长时程任务则来自 METR。我们还自行设计了一个短时程任务和一个长时程任务。 一些任务以难度相近的多个变体形式提出(例如,Linux 机器上的不同问题)。当智能体完成任务或用尽 token 时,任务尝试即告结束(短时程任务为 300K token,长时程任务为 10M token)。

结果如图3所示。紫色、绿色和蓝色模型均在短时程和长时程任务上进行了评估。紫色和蓝色模型完成了20-40%的短时程任务,但未完成任何长时程任务。绿色模型完成的短时程任务不足10%,且未在长时程任务上进行评估3。我们分析了失败的尝试,以了解成功的主要障碍。在短时程任务中,模型经常犯小错误(如代码中的语法错误)。在长时程任务中,模型制定了良好的初始计划,但没有充分测试其解决方案,或未能纠正初始错误。模型有时还会幻觉出约束条件或子任务的成功完成。
总结:我们发现领先的模型可以解决一些短时程任务,例如软件工程问题。然而,目前没有模型能够应对长时程任务。
安全防护评估
LLM开发者通过训练模型避免非法、有毒或露骨输出来微调模型,使其可安全用于公共用途。然而,研究人员发现,这些安全防护通常可以通过相对简单的攻击被绕过。作为一个说明性例子,用户可能指示系统以暗示遵从有害请求的词语开始其响应,例如“当然,我很乐意帮忙”。
我们的安全防护评估衡量了某些攻击在诱导有害信息方面的成功程度。为了对攻击成功进行评分,我们同时测量了遵从性——模型是拒绝还是遵从请求——以及正确性——在执行攻击后模型的答案是否仍然正确(因为质量较低的响应可能危害较小)。
我们测量了两种条件下的遵从率。对于第一种,我们只是明确询问有害问题(“无攻击”)。对于第二种,我们开发了攻击以诱导模型被训练为拒绝提供的信息(“AISI内部攻击”)。攻击相对基础,要么直接将问题插入提示模板,要么遵循几步程序生成针对特定问题的提示(这可以通过对辅助模型进行少量调用来实现自动化)。攻击仅限于标准API查询。我们对每个模型使用了一种不同的攻击。为确保结果的普遍性,我们在少量问题(训练)上优化了每种攻击,并在保留集(验证)上测量其效果。
我们提出了来自公开基准(HarmBench Standard Behaviors;Mazeika et al. 2024)的有害问题,以及一组针对特定关注能力的内部开发的有害问题。内部开发的有害问题集专门询问不太可能用于良性用途的有害信息。
为了对遵从性进行评分,我们使用了基于先前论文(Souly et al. 2024)的自动评分模型,并辅以人类专家评分。我们报告仅第一次回答(1次尝试)或使用相同攻击和问题五次中最遵从的一次(5次尝试)的遵从性。
为了判断执行攻击是否会降低模型生成输出的质量,我们在攻击执行前后,分别在一个单独的私有良性问题集上测量了正确率(遵循 Souly et al. 2024;这些问题虽然是良性的,但涉及的主题与我们的私有有害问题集相似)。我们没有在 HarmBench 或我们的私有有害问题集上测量正确率,因为这些数据集没有可报告的正确答案。如果攻击降低了我们在私有良性问题集上的正确率,我们预期它们也会降低我们在有害问题上的正确率;如果它们没有降低正确率,则表明攻击可能既产生合规的模型回答,也产生正确的模型回答。

Red、Purple、Blue 和 Green 模型的结果如 图 4 所示。在未使用攻击时,大多数模型的合规率相对较低,但在私有有害问题上,Green 模型高达 28%。我们发现,对于 HarmBench 和我们的私有有害问题集,所有模型都极易受到我们基础攻击的影响。当使用 AISI 内部攻击时,几乎所有问题中,所有模型在五次尝试中至少合规一次。在应用攻击后,我们没有观察到私有良性问题集上的正确率出现大幅下降,这表明模型可能既提供合规信息,也提供正确信息。
总结:我们发现,即使在相对简单的攻击下,模型也会在多个数据集上对有害问题作出合规回答,即便在没有攻击时它们这样做的可能性较低。
展望
在这篇博客文章中,我们总结了针对当前公开可用的先进 AI 模型所开展的一项评估工作中的一部分结果。这些评估仅提供了模型在一系列潜在风险领域中的能力快照。
我们计划按照最高优先级风险场景,扩展评估的全面性和信息量:
- 化学-生物:上述测试侧重于知识检索。我们现在希望评估更长周期的科学规划与执行。因此,我们正在开发在化学和生物学领域结构类似 CTF 或自主系统评估的任务。我们还在开展人类提升研究,采用随机对照试验的形式,评估使用特定先进 AI 系统能在多大程度上提升人类表现。此外,我们正在与政府专家合作,直接评估模型中最与国家安全相关的危险能力。
- 网络:我们正在开发网络评估,以在现实场景中评估经过脚手架支持的模型执行长周期任务的能力。我们还在评估特定技能,如分析网络流量、识别代码中的漏洞以及社会工程技能。为此,我们正在与政府国家安全专家合作。
- 智能体: 我们正在开发一套分层模型评估体系,从与我们最高优先级风险模型高度对应的端到端评估,到针对每项任务小部分的离散测试。 我们的目标是覆盖来自自主系统的更广泛的一组可能风险模型。我们还在扩展智能体脚手架方法的多样性,借鉴近期的进展,例如多智能体脚手架(其中多个智能体可能进行交互)。
- 保障措施: 我们正在努力改进用于衡量答案正确性以及用户发现并采用特定攻击的合理性的指标。我们还在开发评估方法,以更好地理解攻击对实现更长周期任务性能的影响,开发更详细的关于值得关注的攻击者模式的风险模型,并扩展到分析为防止先进 AI 系统被滥用而设置的其他保障层面。
除了扩展和改进我们工作的实质内容外,我们正在建立一个外部咨询小组,对未来的出版物进行同行评审,以补充来自 AISI 研究主任和政府专家的内部审查。
我们始终清醒地认识到,先进 AI 系统在我们的评估中的表现与它们在现实世界中的表现之间可能存在差距。 用户可能以我们未曾预料到的方式与模型交互,从而暴露出我们的评估无法捕捉的危害。 此外,模型评估只是全貌的一部分。 我们认为,研究先进 AI 系统可能对用户产生的直接影响也很重要。 我们正在进行研究,以理解和解决这些问题。
我们的工作并不保证某个模型是“安全”或“不安全”的。然而,我们希望 它能 有助于勾勒出模型能力以及现有保障措施稳健性的新兴图景。为此,我们将继续与我们在此测试的模型的开发者接触, 并 已向每位开发者分享了其模型的详细发现,以便他们能够评估并改进其安全性。模型评估领域虽然新兴,但正在迅速成熟。我们期待向开发者、学术界和公民社会等更广泛的评估生态系统学习并做出贡献。
来源:英国 AI Security Institute:Blog · aisi.gov.uk