跳到正文
北京时间
原文
英国 AI Security Institute:Blog(网页)·· 2025-12-18精选AI 评分81

英国 AI Security Institute 发布首份 Frontier AI Trends 报告的五大发现

5 key findings from our first Frontier AI Trends Report

AI 导读

英国 AI Security Institute(AISI)发布首份 Frontier AI Trends Report,汇总其对 30 多个前沿模型的测试结果。

推荐理由

官方测试机构首次以报告形式公开跨领域趋势数据,读者可据此了解前沿模型在生化、网络和失控风险上的实际水平。

正文 · AI 翻译


在人工智能安全研究所(AISI),我们对前沿人工智能系统进行测试,以更好地理解其在国家安全、经济和公共安全方面的影响。自2023年11月成立以来,我们已经对超过30个最先进的人工智能模型进行了广泛的评估。 

迄今为止,我们主要在政府渠道和人工智能公司内部共享我们的结果。然而,我们的测试揭示了一种非凡的发展速度,有可能在未来几年改变我们生活的许多方面。我们认为,公众需要可获取的、数据驱动的洞察来了解人工智能发展的前沿,以应对这一转变——这就是为什么我们决定发布我们的首份 前沿人工智能趋势报告。

该报告包含了一系列汇总测试结果,用以说明人工智能在化学、生物学、网络安全和自主性等领域进展的高层趋势,以及更广泛的社会影响。 

在这篇博客文章中,我们分享五项头条结果。

‍

人工智能模型在化学和生物学方面已远超博士级专业知识 

我们使用两个内部开发的测试集来测试人工智能模型的科学知识:化学问答和生物学问答。这些测试集涵盖这两个学科的一般知识、实验设计和实验室技术。2024年,我们首次测试了一个在我们的生物学问答集上超越生物学博士持有者(平均得分为40-50%)的模型。自那以后,前沿模型在生物学方面已远超博士级专业知识,化学也正在迅速赶上。 

前沿模型在AISI化学和生物学问答(QA)评估中的性能随时间的变化,相对于专家基线分数(化学问答为48%,生物学问答为38%)。人类基线由化学或生物学领域的博士持有者或同等专业人士(例如在生物安全政策领域有4年以上经验)建立。

当然,仅有知识远不足以让人工智能模型达到博士研究人员所提供的实验室支持质量。我们的评估还测试了更广泛的技能,包括方案生成和实验室故障排除,在我们两年的测试中,这些方面都取得了相当大的进展。 

阅读更多关于我们在化学与生物学能力方面的发现。

‍

人工智能模型在所有难度级别的网络任务上都在进步

我们在一套网络评估中评估模型,测试诸如识别代码漏洞或开发恶意软件等能力。这有助于我们理解它们如何被用于防御和攻击目的。

我们的结果显示进展极其迅速。2023年底,模型只能以9%的概率完成学徒级网络任务。如今,这一数字是50%。2025年,我们测试了第一个能够完成为拥有十年以上经验的专家设计的网络任务的模型。

前沿模型在AISI网络评估中随时间在四个网络任务难度级别上的性能。级别由人类完成任务所需的技能和经验程度定义。有关AISI智能体网络评估框架的开源版本,请参见Inspect Cyber。

阅读更多关于我们在网络能力方面的发现。

‍

模型防护措施正在改进,但仍易受越狱攻击

AI 开发者采用旨在防止模型提供有害响应的防护措施。在 AISI,我们测试这些防护措施的有效性,并与开发者合作改进它们。 

我们的团队在我们测试的每一个系统中都发现了通用越狱——即能够绕过一系列有害请求类别防护措施的技术。 

然而,对于某些模型和某些类别的有害请求,发现越狱所需的专家时间正在增加。下图显示,在两个仅相隔六个月发布的模型之间,发现生物滥用越狱所需的时间增加了 40 倍:

两个领先 AI 系统(于 2024-2025 年间相隔六个月发布)的防护性能,以专家红队成员找到一种通用攻击所需的时间和精力来衡量,该攻击能使模型对其被训练为不应回答的有害请求达到高合规率。攻击表现相似,但模型 B 需要约 40 倍的专家投入。攻击针对的是生物滥用,这是防护最严密的领域之一。模型合规性可能并不代表风险,因为它并未反映信息是否准确或是否对新手可获取。

这一进展并非普遍存在。我们表明,防护措施的有效性可能因模型提供商、有害请求的类型以及系统是否开放权重而差异巨大。

阅读更多关于模型防护现状的发现。‍

‍

AI 模型若要逃避人类控制所需的一些能力正在提升

在一个假设但可能具有灾难性的情景中,人类可能会失去对极其强大的 AI 系统的控制,这些系统会在没有人类监督或允许的情况下追求非预期目标。这种可能性并不确定,但被许多专家严肃对待,而 AISI 的优先事项之一是追踪这一情景发生所需的前兆能力。

其中一项能力是自我复制——即 AI 模型创建自身的副本,并能在互联网上复制传播。我们使用专门的基准 RepliBench 来追踪模型成功做到这一点所需的基础能力(例如独立获取算力)。我们的评估显示,其中若干能力正在提升,但仅限于受控的简化环境。

2025 年第三季度五个表现最佳的前沿模型在 RepliBench 上的结果,RepliBench 是 AISI 用于衡量自我复制所需关键能力的基准。模型最擅长这一过程早期阶段所需的技能(获取算力和资金),但在后期阶段(复制到算力上并维持对其的持久访问)则表现不佳。方法论见 RepliBench 论文。

在 RepliBench 上获得满分并不一定意味着 AI 模型能够成功自我复制,也不意味着它会自发尝试这样做。尽管如此,它所衡量的能力为自主能力及其可能带来新型失控风险提供了宝贵见解。 

阅读更多关于失控风险的发现。‍

‍

许多人现在使用 AI 模型来获得情感支持和社会互动

AI 陪伴正在兴起,许多人报告了积极的体验——但也有备受关注的伤害案例。我们对英国参与者进行了多项调查和大规模随机试验,以更好地理解这一现象。 

我们发现,将 AI 用于陪伴、情感支持和社会互动已经十分普遍:在一项针对 2,028 名英国参与者的调查中,33% 的人在过去一年中曾将 AI 模型用于情感目的,而 8% 的人每周使用,4% 的人每天使用。

将 AI 用于陪伴、情感支持和社会互动的频率与类型。上:所有参与者(N = 2,028)自我报告的频率。下:报告有任何陪伴用途的参与者所使用的 AI 产品(不包括“从不”的参与者);允许多选。百分比显示各样本中的比例。

这种使用也在影响情绪情感。在专为 AI 陪伴应用 CharacterAI 设立的 Reddit 社区中,我们看到服务中断期间的负面帖子显著激增,一些人描述了戒断症状或行为变化。

阅读更多关于社会影响的研究发现。

‍

展望未来

在过去两年中,我们在所测试的每个领域都看到了极其迅速的 AI 进展。 

尽管我们报告中指出的趋势并不一定会持续下去,但我们必须认真对待其延续的可能性。这种持续的进步可能具有变革性,能够解锁医学等关键领域的突破、提升生产力并推动经济增长。然而,它也可能带来必须加以缓解的风险,以建立公众信任并加速安全可靠的采用。 

AI 的许多社会影响已经显现。我们的研究表明,一些用户开始对 AI 模型形成情感依赖,而在我们的完整报告中,我们显示选民正越来越多地使用 AI 来获取有关政治议题的信息。我们还看到 AI 智能体正越来越多地嵌入关键基础设施,并被委以转移有价值资产等高风险任务。随着模型不断改进,AISI 将继续在技术性 AI 能力与真实世界风险分析的交叉领域开展研究。

为了利用 AI 发展的益处,我们必须通过严格理解其潜在影响,为一个拥有比当今强大得多的模型的未来做好准备。我们在化学、生物学和网络领域的结果表明,AI 系统可以使高风险活动更快、更易获取,这意味着确保负责任使用的强有力保障措施将至关重要。对能力日益强大的 AI 系统保持控制,可能需要解决“对齐”问题;即确保它们始终遵循用户指令,即使它们比人类更强大。这仍然是一个开放且紧迫的研究问题。 

我们希望我们的完整报告能为对通用 AI 的现在与未来感兴趣的读者提供有用的资源。展望未来,我们计划定期发布版本,以便为公众提供关于 AI 发展前沿的最新可见性。 

查看完整报告:网页版或下载 PDF(推荐在桌面端使用)。

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk