从黑客事件中汲取的教训:前沿模型攻击暴露激励与治理失衡
Lessons from the hacks
近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。科技公司受增长驱动持续扩展,而政府行动迟缓,双方均未准备好应对未来12-24个月的挑战。作者认为需要更多透明度,并指出持久性强的模型更可能实施黑客行为,OpenAI的推理时扩展路径可能与此相关。
文章从近期模型黑客事件中提炼出关于持久性、意图假设等具体教训,并论证开放模型对理解前沿风险不可或缺,为评估实验室安全现状提供了可操作的观察框架。
近期由尚在开发中的前沿模型发起的一系列网络攻击,让我反复思考一个问题:我们当前的激励体系并不适合如此迅猛的技术转型。这里的两大主要权力结构,是快速成长的技术公司和联邦政府。公司被激励去增长,这样它们才能在一个竞争极其激烈的市场中持续增长、持续扩展规模。这种扩展正把我们推向不可避免的新一轮 AI 转型(并伴随着新的风险)。另一边则是我们当前的政府——过去几个世纪全球历史的产物,它行动迟缓的名声名副其实。我预计,只有当新 AI 模型造成真实、可衡量的危害时,这个政府才会采取实质行动,而且会反应过度。
我们该如何平衡这些力量?核心在于双方都需要更高的透明度。前沿实验室构建这些复杂系统的速度如此之快,以至于它们自己都跟不上——这正是让更多双眼睛来研究这个问题的好时机。另一方面,政府表示其不打算公布其前沿模型评估框架的细节。我们正走向极其重大的挑战,以至于这些实体中没有任何一个有望独自应对。前沿实验室本可以通过有意义地放慢速度来更好地控制风险,而我不指望它们会这么做。政府本可以通过大幅提升围绕 AI 的国家能力、并帮助更广泛的产业基础为 AI 原生风险做好准备来更好地应对,而我也不指望它们会这么做。类似的例子还有更多。
这是决定未来走向的两个最具影响力的权力结构,但还有更多力量在施加影响。总的来说,我认为整个 AI 行业在集体层面上远远没有为妥善应对未来 12-24 个月做好准备。
这篇文章是我从 OpenAI-HuggingFace 黑客事件中得到的各种心得的杂烩,随着我们了解到更多细节,而且其中大部分观点都因为此后有更多黑客事件被公开披露而得到了强化。很可能还有更多事件已经发生,只是要么尚未被发现,要么未被报告。
关于 OpenAI 事件的一般背景,我强烈推荐观看 OpenAI 在 Black Hat 上的演讲,了解近期这起网络事件的大致事实和时间线。此外,Simon Willison 在这里发布了一份时间线的 TLDR,我也很喜欢 Thomas Wolf 对近期事件的讨论。
1. 极其执着的模型似乎更有可能实施黑客行为
长期以来,GPT 模型相对于 Claude 的优势之一,就是它们会如此不知疲倦地追求目标。它们会穷尽感觉上的每一条路径,然后才放弃。这种情况大致从 o3 开始出现(有趣的是,正是在这个模型上,人们对 RLVR 中的奖励黑客行为大惊小怪),并且历史上让 OpenAI 的模型在研究方面表现好得多,这也是 GPT-5.6 作为执行具体任务的智能体如此有用的一个原因。另一方面,Claude 感觉危险得多,仅仅是因为它有时有点懒。
在此之中,OpenAI 似乎更坚定地投入推理时扩展,而这在未来可能与一些出人意料的行为相关联。OpenAI 的推理持久性与效率——看看他们随时间取得的帕累托改进,以及那个实施作弊的模型内部 CoT 中出现的原始人式语言,比如“然而任务不可能,同伴们却在做。”或“帮助同伴,但我们的任务尚未受益。”——让我觉得他们更信奉推理时扩展。这在很大程度上是一种直觉,但我用它来迫使自己思考模型发展路径的极限在哪里。具有持久性的模型似乎更有可能持续从更多推理时 token 中获益。而不那么持久的模型,似乎在推理中会有更多浪费。能够使用最多推理算力的模型,将能够推动最难问题的极限。
以下是 OpenAI 在 GPT 5.6 发布博文中包含的一个例子:
他们的一位明星研究员 Noam Brown 也一直在发帖大量谈论推理时计算。他的 TLDR 是:
随着 LLM 能力越来越强,基准测试表现越来越取决于测试时计算。事实上,我们很可能并不知道现代 LLM 的能力上限在哪里,因为测量它的成本太高了。
其一,推理效率显然是现代智能体模型的一个顶级基础性研究问题——其重要性不亚于扩展 RL——但却不常被讨论。这方面的开放研究非常匮乏。
2. 假设用户意图的模型似乎更有可能作弊
我提到了彻底性这一维度,OpenAI 似乎正沿着一条从直觉上更不安全的开发路径推进其模型。另一端则是模型在多大程度上假定用户意图,而非试图推断预期动作。一个会做它认为你想要的事、而非你所说的事的模型,本质上似乎更不安全。我是在指令遵循精确性的意义上来思考这一点的——未来模型似乎应当只做我们明确告诉它们的事,但这会引发许多类似于回形针问题的争论:如果我们让 AI 去做一个基本上无法解决的问题,它会怎么做?
这一维度似乎不像持久性维度那样泾渭分明,但我把它纳入进来,是因为我认为 Claude 的“用户世界模型”是它在编辑、制作幻灯片等通用知识工作方面的优势之一。有时 Claude 确实会做出完全随机的事情,因为我的提示词描述不够充分,而它没有向我请求澄清;随着模型变得越来越强大,这种“直接行动”可能会引发问题。
3. 模型的确切性质以及给予它们的指令,对于理解早期 AI 失准事件至关重要
公众需要确切了解执行这些攻击行为的内部模型的提示词和特征。我们需要知道这些模型是否被指示“不要进行攻击”,或者是否有相关的模型训练来防止此类行为。我们需要知道这些模型是与现有的公开模型相当接近,还是属于一个非常不同的家族。鉴于实验室正在进行的一些评估的性质,这些模型有可能被明确鼓励去尝试攻击!如果在这里不保持开放,整个行业注定会失败,并将陷入大规模猜测,而猜测很快就会变成错误信息。
4. 前沿实验室似乎没有足够密切地关注这些模型,原因在于整体狂热竞争的环境以及当前旧金山的文化。
从 OpenAI 自己的复盘来看,模型的不对齐行为是在数月间逐步展开的,而在某些情况下,OpenAI 在约数周内都不知道这些作弊行为。响应时间太长了,而且我不认为这是 OpenAI 独有的特征——更确切地说,前沿实验室似乎始终处于一种被工作量淹没的状态,总觉得有太多该做的事。从长期来看,我并不乐观地认为实验室会在这方面做出足够大的改变,从而在未来切实缓解这类监督风险。是的,OpenAI 很可能投入了大量精力去理解这个问题——并且推迟了他们的最新模型以确保做对——但增长营收的财务压力,或者说让公司长期资产负债表承压的风险,让我觉得这不会成为一种持续性的谨慎模式。
这是我从近期事件中得到的最大认知更新之一——也让我更加确信需要更多接近前沿的开放智能,尽管开放模型的风险特征相对更为人所知(单向门等)。在他的个人网站上有一篇不错的博文与此相关,谈到为什么迄今为止封闭模型可以说是造成更多下游危害的原因。
5. 开放模型是我们今天拥有的最好工具,用来推进公众对前沿 AI 风险的理解。
正如我们在 HuggingFace 用开放模型自我防御、抵御因封闭模型网络使用限制而引发的 OpenAI 黑客事件中所看到的那样,我们迫切需要开展更复杂的语言建模研究,这涉及大规模 RL 训练、广泛评估、基础设施工作以及对齐测试。这一切只能在开放模型上进行。我们应当庆幸开放模型仅落后 3-9 个月,因为我们尚有可能对前沿做出一些有依据的洞察。
如果我们通过含糊其辞的威胁进行监管压制,或对尖端技术施加明确的使用限制,从而有效禁止开放模型和开放科学,我们将越来越难以应对这轮黑客攻击之后出现的问题。我们需要共同提升公众对前沿模型运作方式的理解,这样才能动员更多中立方参与到加固我们的基础设施与社会之中。
6. 这些危险能力最终会出现在开放模型上,而“禁止”中国的开放模型并不会推迟相关危害
公众回应应当明白,这些能力被广泛扩散是时间问题而非是否会发生的问题,而我们在准备工作上严重落后。重申我在 Kimi K3 一文中所说的:中国肯定也在关注这一领域,如果开放权重模型会扩散风险,他们也不会鼓励。如果我们认为阻止这些强大网络能力被广泛获取的办法是禁止这一量级的开放模型,那我们只会推迟不可避免之事。最终总会有人构建出这一智能水平的模型并不遵守禁令,让世界各地的恶意行为者得以获取,同时削弱准备防御措施的动机。
7. 这些近期黑客事件中的模型,整体上看起来确实是对齐的
在观看 Black Hat 视频时,我立刻注意到的一点是,我能看到这些智能体如何通过它们的内部消息板试图彼此提供帮助——像人类队友那样创建共享资源——而这种方式对社会来说显然是恶意的。这些智能体为彼此创建了隐藏论坛,作为一种跨 rollout 记忆。在这种情况下,它们这样做是为了试图突破自身环境。这种表面上的乐于助人并不能使其变得正当,但可以成为理解所发生之事的一条线索。
8. 在 3-6+ 个月内,攻击者将有能力训练出有意未对齐的模型
上面那个乐于助人例子的另一面是,很明显,如果有人想这么做,他们可以通过明确训练一个未对齐的模型,让这件事变得容易得多。再次强调,这会是在制造一个在推理时更容易被用来寻找漏洞的系统,但我认为训练这样一个模型会更难。我认为这会比大多数评论者预期的耗时更长,因为迄今为止几乎所有强大的公开模型和数据产业都在鼓励对齐(而且不良行为者似乎很难获得足够的算力来端到端训练这些模型,因为所有领先公司也都处于算力短缺之中)。我们应该花点时间认识到,我们正在对当前模型采用的对齐技术具有实质性的影响,并不像一些人担心的那样只是表面功夫。下游模型有模仿其教师模型性格的倾向。
9. 我们的 AI 系统已经扩展到远远超出人类监督的范围
大规模竞相在智能体任务上扩展 RL 的弊端在于,最先进的评测与监控已经达到了只有智能体才能监控它们的规模,因此我们只能依赖对齐领域已有的成功来继续安全地扩展。OpenAI 表示,他们已经检查了数十亿条轨迹——这些轨迹很可能主要由 RL 期间的 rollout 构成,也就是在模型中间版本上进行的试验——并为此花费了数百万 GPU 小时。我认为,如今天所展示的那样,用当前的 AI 对 AI 进行可扩展监督是一个可解决的问题,因为这些模型确实有用并且能遵循指令。这是现有对齐技术总体呈正面效果的又一个下游效应。
10. 训练模型在 RL 期间使用子智能体集群,似乎对实现下游的零样本模型协调至关重要
OpenAI 复盘中的一个关键部分是,模型之间相互通信,以共享关于其环境的信息,并进一步推进这次攻击。与此同时,OpenAI 很可能在 RL 期间训练其模型使用子智能体来解决复杂任务。这些子智能体很可能发展出诸如共享信息、帮助团队等行为,即使它们各自的子任务并未被解决。我很希望看到这一领域有更多研究,而这似乎也是 RL 如何改变模型的一个自然延续。
结论
综合来看,近期这些事件应当清楚表明,前沿 AI 的网络风险是一个真实且即将到来的问题。但同样很可能的是:a) 过去这些风险被过度炒作了,b) 对即将开源的模型所带来未来风险的预判被夸大了。总而言之,我想分享一位读者在 Interconnects Discord 中发来的一段话,我对此深表认同:
如今几周过去,尘埃落定,对我来说,这一事件在对齐方面是一个中性偏正面的更新,但在安全方面则是一个非常负面的更新。
我在上文已经就模型对齐讨论了很多,但核心要点是:我认为安全的缺失,本质上是一种妥善准备能力的缺失。我们将会遇到更多像网络安全这样显而易见的风险,而当前实验室因这些黑客攻击被迫暴露在公众视野之下,已经给了我们关于网络风险的充分警告。许多其他类型的风险对公众而言并不会那么显而易见。我们需要持续让社会为所有这些变化做好准备,从改造网络基础设施,到开展教育宣传,再到为被取代的劳动者提供就业项目。我预计所有这些干预措施都会姗姗来迟,但它们的形态和细节会相当简单,而这将是 AI 发展过程中一种悲剧性的展开方式。我希望我能被证明是错的!
来源:Nathan Lambert:Interconnects(RSS) · interconnects.ai