Anthropic 更新 Claude Fable 5 生物安全防护,误报率大幅降低
Improving Fable 5's biology safeguards
Anthropic 更新了 Claude Fable 5 的生物安全防护机制,将生物相关查询的“回退”次数减少约 85%,用户在日常健康与教育问题上将更少遇到系统切换至较弱模型的情况。此次更新扩大了模型可协助的生物任务范围,但涉及双重用途的病毒学、毒理学和分子设计请求仍会回退至 Opus 5。Anthropic 表示正通过可信访问途径,致力于缩小专业生物研究与药物开发领域的差距。
误报减少85%意味着生物医学用户在日常咨询中更少遭遇降级,对依赖模型辅助临床或学习的人有实际可用性提升。
我们正在更新 Claude Fable 5 的生物学安全防护措施,大幅减少误报。Fable 5 用户现在遇到的“回退”将显著减少——所谓回退,是指用户提出生物学相关查询后,系统切换到能力较弱的模型。在我们的测试中,此次更新使各产品界面上的生物学相关回退减少了约 85%。1
因此,Fable 5 将能够协助更广泛的生物学任务。
在实际使用中,用户在日常健康和教育类问题上遇到的回退应会少得多——例如解读化验结果、理解症状,以及在教育场景中学习生物学。医疗专业人士将能够在临床任务上获得 Fable 5 更多的支持。
我们相信,AI 对世界产生积极影响的最大机会在生物学和医学领域,我们正在大力投入,以负责任的方式让生物学家获得前沿能力的使用权限。目前,对于我们认为具有两用性质的请求——包括病毒学、毒理学和分子设计——Fable 仍会回退到 Opus 5,因此它尚不能用于专业生物学研究和药物开发。我们致力于通过可信的访问途径,为前沿生物学能力弥合这一差距。
我们为何构建强大的生物学安全防护
我们的目标,是尽快将 Fable 5 的前沿能力交到尽可能多的用户手中。然而,要做到这一点,我们必须管理好如此强大的模型所带来的日益增长的风险。其中一项风险存在于生物学领域:Fable 5 如今在一些高度复杂的生物学任务上已能超越专家,并在另一些任务上提供可操作的支持。这意味着它可以为研发新疗法的研究人员提供切实的帮助(这正是我们如此热衷于通过分类器改进和可信访问计划来扩大该模型访问范围的原因)。但若落入不法之手,这些同样的能力可能被恶意行为者利用,例如用于开发生物武器。我们的能力评估显示,Fable 5 可以为这类行为者提供显著的能力提升——也就是说,它可以为他们提供在其他任何地方都无法获得的能力。
在生物学领域,往往很难区分 AI 的有益用途和有害用途。例如,在某些情况下,研究某种疾病的治疗方法需要科学家制造出导致该疾病的危险化合物。这一点在活疫苗上最为明显,因为活疫苗需要科学家培养出他们想要预防的那种病原体。某些药物也是如此。为了研发治疗高血压的药物卡托普利,科学家分离出了蛇毒中能使人血压骤降的有毒成分。随着 AI 前沿领域不断涌现出新的生物学能力,我们需要保持谨慎,确保这些能力所带来的新风险不会在其潜在的科学益处之前成为现实。
那些企图利用我们的模型作恶的老练行为者深知如何利用这种模糊性来掩盖其意图,让危险的任务看起来像是普通的科研工作。美国情报界的2026年度威胁评估明确指出,此类行为者确实存在,而且包括合成生物学和基因组编辑在内的生物技术进步“可能导致新型生物威胁。”该评估指出,若干国家行为体很可能维持着活跃的进攻性生物与化学武器项目——而获取前沿 AI 模型的原始能力,可能会加速这些项目的进展。
出于对这些“两用”能力(即既可用于有益目的、也可用于有害目的,且两者之间的界限并不总是容易划清的能力)的担忧,我们在推出 Fable 5 时有意屏蔽了几乎所有生物学查询。这使我们能够将该模型提供给其他领域的用户使用。我们知道这会让正当的生物学用户感到沮丧:短期内会导致大量误报,提出生物学相关问题的用户其请求会被拦截,并被转交给能力较弱的模型处理。尽管如此,我们仍选择做出这一权衡,因为 Fable 在生物学这样的两用领域被滥用的代价可能是灾难性的。
我们的生物学防护机制如何运作
我们在生物学领域防范滥用的核心方式之一,是通过安全分类器:规模更小的自动化 AI 系统,用于检测 Fable 5 何时被要求执行受保护的生物学任务,或生成有害输出(我们此前曾撰文介绍过我们在网络安全领域的类似分类器)。
在 Fable 5 的情况下,当分类器触发时,模型会将用户的请求重新路由至 Opus 5——这是一个能力很强的模型,但不具备与 Fable 5 同等水平的生物学能力,因此无法为恶意用户提供同样多的帮助。这就是用户在其请求被拦截时所看到的回退方案。
开发精确、稳健的分类器并非易事。要让分类器快速且稳定地工作,它必须学会区分我们认为“在范围内”和“超出范围”的主题与查询——即那些我们认为可能有害的内容。调整分类器需要时间和反复迭代,既要避免假阳性(分类器对超出范围的内容误触发),也要避免假阴性(在范围内的内容被漏掉)。我们还要求分类器能够抵御绕过它们的尝试(即所谓的越狱),这需要更进一步的研究和测试。
从非常宽泛的生物学分类器起步,意味着我们可以在继续开展旨在完善它的研究的同时,让用户使用 Fable 5。另一种选择——在取得更多安全防护进展之前一直不发布该模型——会使模型的普遍开放及其对用户的潜在益处推迟数周甚至数月。
在过去几周里,我们仔细重写了该分类器的“宪法”(它由一系列规则组成,用于帮助模型区分受保护内容和被允许内容),并特别注重详细划定良性用途。我们向来自 Anthropic 内部和外部的多元化专家征求了对这些修改的反馈。随后,我们基于该宪法为分类器开发了更新后的训练数据,并对其进行了重新训练,同时验证了新分类器总体上仍会对有害及两用研究生物学内容触发,但现在将能够支持更广泛的良性且有益的用途。
如下图所示,这些更新意味着——与 Fable 5 发布时相比——该分类器将对远为更少的良性生物学相关请求触发。

结论
要完善我们的防护措施,仍有大量工作要做。误报不可避免仍会存在——即落在分类器安全裕度内的请求,这些请求风险极低,但分类器仍会触发。正如我们上文所述,Fable 将继续拦截双重用途的专业生物学和药物开发查询,因为存在潜在的双重用途风险。我们完全致力于为研究人员开发一条安全、可扩展的路径,让他们通过可信访问通道使用我们能力最强的模型。
我们希望你能继续与我们分享反馈,以便我们进一步完善防护措施。
脚注
1 因此,我们预计回退的总次数——无论是出于生物学相关原因还是任何其他原因——也将减少:在 Claude.ai 上减少约 67%,在 Cowork 上减少 55%,在 Claude Code 上减少 17%,在 Claude Platform 上减少 7%。
来源:Anthropic:Newsroom(网页) · anthropic.com