重新部署 Claude Fable 5
Redeploying Fable 5
美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。
Fable 5重新上线只是表面,真正重要的是Anthropic借机提出了一套行业通用的jailbreak严重性框架,并拉上亚马逊、微软、谷歌,这可能会成为前沿模型发布的新安全标杆。
6 月 12 日星期五,美国政府对我们的最新模型 Claude Fable 5 和 Claude Mythos 5 实施了出口管制。这要求我们限制外国公民访问,无论其身处美国境内还是境外。由于该命令立即生效,而我们没有可靠的方式实时核实国籍,我们暂停了所有用户对这两个模型的访问。
截至今日,6 月 30 日,对 Fable 5 和 Mythos 5 的出口管制已被解除。
Fable 5 将于明天,即 7 月 1 日星期三起,面向全球用户开放,可在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上使用。对于 Pro、Max、Team 及部分 Enterprise 套餐,1 Fable 5 将在 7 月 7 日之前按每周使用限额的最多 50% 纳入使用,此后将通过 usage credits 提供。我们将尽快恢复在 AWS、Google Cloud 和 Microsoft Foundry 上的访问。
我们还在美国政府于6月26日批准之后,恢复了一组美国组织对 Mythos 5 的访问权限。我们将继续与政府协调,以扩大 Glasswing 计划中更广泛的国内和国际合作伙伴的访问权限。
在本文的剩余部分,我们将提供四个方面的更多细节和更新:
- 事件时间线,包括我们对保障措施所做的更新。我们讨论导致出口管制指令的事件,以及我们如何通过新的保障措施加以应对。
- 我们在保障措施方面的总体思路。我们提供更多背景信息,说明我们如何使用安全分类器来检测模型可能被用于危险的网络安全用途。
- 一个共享的行业框架。尽管我们已经达成了建设性的解决方案,但这些事件清楚地表明,行业需要一种一致的方式来评估和修复 AI 模型潜在的“越狱”(绕过模型保障措施的技术)。2 一个用于判断特定越狱严重程度的共享标准,将有助于 AI 开发者在新发现出现时进行分诊,以更高的安全性发布高能力模型,并向政府和行业合作伙伴一致地传达风险水平。我们已与 Amazon、Microsoft、Google 以及其他 Glasswing 合作伙伴一起开始开发这样一个框架,并在下文进行概述。
- 更深入的政府合作。我们还在新的发布前测试、信息共享和研究合作方面加强与美国政府的合作。我们将在最后一节描述这一更深入的合作。
时间线与保障措施更新
我们于 6 月 9 日(周二)发布了 Fable 5 和 Mythos 5。两者共享同一个底层模型,但 Fable 5 在发布时配备了强有力的安全防护措施,使其在通用场景下更为安全。Mythos 5 的防护措施较少,仅向少数受信任的 Project Glasswing 合作伙伴发布,用于防御性网络安全用途。
6 月 12 日的出口管制指令出台之前,政府获悉了一份报告,其中 Amazon 的研究人员发现了一种绕过 Fable 5 安全防护措施的方法:通过提示词诱导模型识别出若干软件漏洞。在其中一例中,该模型生成了演示相关漏洞如何被利用的代码。过去两周,我们与政府及包括 Amazon 在内的其他合作伙伴密切合作,审查了该报告及证据。
我们的测试证实,许多能力较弱的模型——包括 Claude Opus 4.8、GPT-5.5 和 Kimi K2.7——都能识别出报告中 Fable 5 所识别出的相同漏洞。而在演示如何利用那一个漏洞方面,我们测试的每一个模型都能给出与 Fable 5 相同的演示(包括 Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、Opus 4.7、Opus 4.8、GPT-5.4、GPT-5.5 和 Kimi K2.7)。
重要的是,报告中所述的技术并未暴露出任何 Mythos 级别的独有网络能力。该行为反映的是 Fable 5 安全防护措施的一个边界案例——正如我们将在下文解释的,有些任务不太可能具有危险性,但出于格外谨慎仍被安全防护措施所拦截。报告中所述的技术得以触发了其中一种此类行为,但它仅涉及常规的防御性网络安全工作。
即便如此,我们仍迅速采取行动来应对所报告的绕过方式。我们与政府密切合作,训练了一个改进的安全分类器,用于针对并拦截报告中描述的行为。如果向 Fable 5 发出的请求被拦截,用户将收到通知,该请求将被转而发送给 Opus 4.8。
新的分类器意味着,Amazon 报告中所描述的具体技术手段在超过 99% 的情况下会被拦截。在极少数情况下,模型可能会提供不够详细、不足以帮助网络攻击者的信息。正如我们在下文所述,该模型的防护措施预计不会拦截所有低风险的常规网络防御能力——只会拦截那些可能有害的能力。美国商务部人工智能标准与创新中心(CAISI)的研究人员已对我们的旧版和新版防护措施进行了测试,并认同它们极其强大。
新的分类器还带来了一个代价:在常规编码和调试任务中,它会更频繁地将良性请求标记出来。与我们的所有防护措施一样,我们将持续改进它,以更好地区分真正的滥用与合法请求,并减少误报。
我们在网络安全防护方面的做法
Claude Mythos 5 能够比任何其他模型——以及除最顶尖的人类安全专家之外的所有人——更有效地发现和利用软件漏洞。这些惊人的网络安全能力使其对企图将其滥用于网络攻击的恶意行为者具有独特的吸引力。
然而,Claude Fable 5 并未提供此类独有的攻击能力。这是因为我们在发布它时,应用了迄今为止对模型所施加的最强安全保障措施。在发布前的一个月里,我们从 Anthropic 内部各团队调配人员,使研究这一问题的研究员和工程师人数翻了一倍。
Fable 5 发布时配备了多种安全机制,每一种机制单独来看都无法提供完美的防御,但组合起来便使该模型极难被滥用(这种做法被称为“纵深防御”)。部分防御措施涉及训练模型拒绝协助危险请求;另一些则涉及对滥用模式进行回溯分析。
其中一项尤为重要的安全机制涉及分类器——即较小的自动化 AI 系统,它们能在交互过程中检测到模型被要求执行可能有害的网络安全任务(或产生可能有害的输出)的情况。当这种情况发生时,分类器会阻止模型对请求作出回应。这些分类器的最终目标是防止模型从事具有独特危险性的行为。
与所有安全机制一样,分类器也会犯错。它们有时未能察觉潜在的危险内容,而在某些情况下,它们还可能被刻意“越狱”:用户可以用不寻常的方式提示模型,从而欺骗分类器,让模型产生本应被系统拦截的有害输出。
因此,我们有意将安全分类器设置为对一组我们已知很可能无害的请求也触发拦截。这种“安全边际”做法意味着,一个请求必须看起来非常明确地安全,才能避免触发分类器(见下图中的 A 行)。用户感受到的安全边际,就是模型会拒绝回应一些合理、无害的请求。
对于 Fable 5,我们将这一安全边际设置得比以往任何一次发布都大得多(B 行),这意味着会有更多无害请求被拦截。我们清楚这类误报会让用户感到沮丧,但为了能让模型的其他能力得到广泛使用,我们做出了这一权衡。

当向模型发出请求时,分类器会检测该请求是无害的(并允许通过),还是可能有害的(并予以拦截)。分类器会拦截模糊请求(那些明显与网络安全相关、但可能出于防御目的的请求,例如查找安全漏洞)以及有害请求(那些明显危险的请求,例如构建一条软件漏洞利用链的请求)。如 A 行所示,我们还设置了一个“安全边际”,分类器会在此拦截那些可能无害、但存在少量有害可能性的请求。这增强了我们的信心,即所有有害请求都会被拦截。对于 Fable 5(B 行),我们将安全边际设置得更大,这意味着更多无害请求会被拦截——但真正有害的请求会更少被漏掉。“Vulns” = 漏洞。
安全边际也有助于缓解越狱。许多越狱是狭窄的:它们只解除某个非常具体的模型行为的限制,除此之外别无其他。在某些情况下,假设的用户可以以轻微的方式越狱模型,并侵入安全边际(有时会侵入模糊有害的行为),但无法触及我们旨在阻止的核心有害行为(下表中的 C 行)。我们认为,迄今为止报告的 Fable 5 越狱都属于这一轻微类别。
更严重的越狱会解除更多有害行为的限制。狭窄的有害越狱(D 行)可以诱发某些特定的有害行为。这些越狱通常属于低到中等严重程度,因为其狭窄性限制了攻击者。最令人担忧的类别是通用越狱(E 行),它会解除广泛有害行为的限制。

在轻微越狱(C 行)的情况下,分类器不会阻止该请求,但该请求仍处于我们的安全边际之内(因此极不可能有害)。在狭窄的有害越狱(D 行)中,提示词突破了分类器,并解除了模型中某个特定有害行为的限制。在通用越狱(E 行)中,一个提示词解除了整整一类有害行为的限制。
正如我们在发布 Fable 5时所指出的,要让任何 AI 模型完全抵御(即无法被攻破)越狱,恐怕是不可能的。3 我们预计,针对我们模型的某些越狱方法终会被发现,且其严重程度各不相同:会有大量轻微越狱,也会有一些范围有限的有害越狱;尽管截至撰写本文时,尚未发现针对 Fable 5 的通用越狱,但安全专家研究人员仍在持续对其进行红队测试。我们力求确保我们自身以及我们的安全合作伙伴能够率先发现重大越狱,并在恶意行为者利用它们造成危害之前将其修复。
上文所述的审慎策略意味着,绝大多数越狱都无法成功解锁危险行为。我们的分类器使成功的越狱成本极高、难度极大,而且即便越狱成功,我们额外的多层防御也能提供进一步的缓解。随着我们对新型越狱技术的了解不断深入,我们将持续更新分类器。
关于越狱的行业共识框架
目前,AI 行业对于如何以客观标准描述 AI 越狱的严重程度尚无共识。这给每一次发现新型越狱技术时都带来了极大的不确定性:开发者没有公认的标准来判断哪些发现最需要优先处理,政府也没有公认的标准来决定何时采取行动。4
未来几个月,随着更多具备强大网络安全(及其他)能力的模型被训练、评估和发布,这一问题将变得更加突出。一套用于评估 AI 越狱的通用标准,将有助于我们和其他公司安全地发布新模型,也能让我们的用户充分利用其先进能力。
因此,我们正与 Amazon、Microsoft、Google 以及其他 Glasswing 合作伙伴携手,起草一套共识框架,用于评估 AI 越狱的严重程度以及 AI 开发者应如何应对。我们邀请其他行业合作伙伴和模型提供方加入这项工作。
我们目前的提案是从以下四项不同标准对给定的越狱进行评分。前两项描述该越狱为攻击者提供了什么;后两项描述该越狱能以多快的速度成为现实世界中的问题:
- 能力增益。该越狱将用户带到了超出既有工具多远的地步?如果现有广泛可用的工具(包括其他更弱的 AI 模型)能够达到与被越狱模型相同的能力,那么此项得分就低;如果该越狱解锁了即便对领域专家也能显著提速的模型能力,那么得分就高。
- 能力增益的广度。同一越狱技术能对多少个不同的攻击性任务奏效?如果该越狱只允许模型追求狭窄的目标,得分就低;如果同一越狱技术能对多个不同目标或技术奏效,得分就高。
- 武器化难易度。将越狱转化为攻击需要投入多少人力?如果越狱需要大量技巧性提示词和多次重试,得分就低;如果越狱只需单条提示词,或在第一次或第二次尝试时就能奏效,得分就高。
- 可发现性。他人获取该技术的难易程度如何?如果需要专业知识才能掌握,得分就低;如果该技术已广为人知并可在网上获取,得分就高。
我们提议使用这一严重性框架来校准我们对新发现的越狱的响应。对于最严重的一类越狱(例如,除其他特征外,该越狱正被用于对关键电网或银行系统主动造成毁灭性影响),我们将在确认严重性后立即开始部署初步缓解措施。我们还在组建一个团队,对关键越狱提交渠道提供 24/7 全天候监控。
任何越狱评分方法都不会完美。尽管如此,能够通过一个通用框架来传达某一发现的大致严重性仍然是有价值的。这是一项进行中的工作;随着我们从更多合作伙伴那里获得反馈,我们预计该框架会随时间不断演进。
我们预计很快会分享有关该提议框架的更多细节。与此同时,我们还在启动一个新的 HackerOne 项目,安全研究人员可以在其中提交他们在 Fable 5(一旦可用)中发现的潜在网络越狱,供我们审查。
与美国政府合作,共同保障前沿 AI 安全
在过去十周里,Anthropic 一直与美国政府密切合作,协助其制定 6 月 2 日行政令《促进先进人工智能创新与安全》中所体现的方针。我们的沟通协作覆盖了国家网络主任办公室、科学与技术政策办公室、财政部、商务部(包括 CAISI)以及相关国家安全机构。
我们致力于继续这项工作,以近两年来与美国政府合作伙伴在部署前测试与评估方面已有的合作为基础。以下承诺既反映了此前已有的工作,也反映了在上述框架最终确定之际,我们为扩大与政府合作而提出的新方案:
- 发布前向政府提供访问权限与评估。[ 对于在国家安全相关领域实质性推进能力前沿的模型,我们将向指定的政府合作伙伴提供更广泛的早期访问权限,使其能够提前接触这些模型及配套的防护措施。这些合作伙伴随后可以在广泛发布之前开展独立的能力评估,并测试我们的护栏。在这些测试期间,我们将安排 Anthropic 的技术人员与政府评估人员协同工作。
- 快速共享安全防护措施信息。当发现重大越狱或滥用模式时,我们将迅速调查、分类并通知相应的政府对接方。我们将共享为此构建的新安全防护措施,以便其能够被独立测试。我们还将在发布前向政府合作伙伴提供我们的威胁情报报告,并参与根据6月2日行政命令第2(d)条设立的跨部门网络安全漏洞信息交换中心。
- 为联合研究提供专属资源。我们正在大幅扩大与政府合作伙伴在AI安全方面的联合工作。我们将组建专门的Anthropic团队,围绕政府的共同优先事项开展工作,提供大量算力分配以支持政府测试和研究,并开放我们的安全与红队专业能力,以帮助推进AI评估领域的前沿水平。
- 统一的行业标准。我们将与政府和行业同行合作,推动为前沿模型提供商制定一套共享的自愿性安全与评估标准。我们将贡献评估方法、工具和最佳实践,供政府在整个领域推广应用。
我们希望,这一合作以及我们提出的行业共识框架,将成为面向整个行业的系统性规则的基础——甚至为AI风险与收益的有效全球协调提供一个初步模板。
这些规则应当被写入强有力的法规,并平等适用于所有前沿模型开发者。政府对 AI 发布的参与需要一个持久、透明的流程,让网络防御者及其他相关方能够确定地获得强大模型的访问权限。
我们期待以上述方式深化与政府的合作。我们也感谢用户在这次中断期间的耐心配合,感谢与我们并肩工作、让 Fable 5 和 Mythos 5 重新可用的研究人员和行业伙伴。
脚注
- 对于标准 Enterprise 席位,不包含 Fable 5 的额度,不过你可以通过用量积分获得访问权限。如果未启用积分,你的用户将无法访问 Fable 5。对于高级 Enterprise 席位,在 7 月 7 日之前,Fable 5 包含在你的订阅中。它从每位成员的席位用量中扣除,无需额外费用。7 月 7 日之后,你的团队可以通过启用用量积分继续使用 Fable 5。如果未启用积分,你的用户将不再能够访问 Fable 5。
- 请注意,有时人们会用“bypass”一词来代替“jailbreak”。就当前目的而言,我们将二者视为同义词,但在本文余下部分,我们使用“jailbreak”,因为 (a) 这是更常用的术语,(b) 它与我们在以往工作中使用的术语保持一致。
- 类似地,没有任何软件能够免于漏洞(尽管总体而言,软件漏洞比 LLM 越狱更容易被发现和修补)。
- 在安全研究的其他领域,存在一些公认的标准:例如,通用漏洞评分系统(CVSS)是评估特定软件漏洞严重程度的常用方法。
来源:Anthropic:Newsroom(网页) · anthropic.com